AI AI
속보
심층
이벤트
Pro
더보기
자금 조달 정보
특집
온체인 생태계
용어
팟캐스트
데이터
OPRR
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
XRP
$2.25
2.07%
DOGE
$0.325
2.23%
USDC
$0.999
3.05%

AI가 스스로 AI를 개선하기 시작했다: Claude의 안전 연구가 인간 연구원을 넘어섰다

동차 Beating AI 속보, Anthropic이 Claude를 AI 안전 연구원으로 삼아 다른 AI를 더 안전하게 훈련하는 방법을 연구하게 했다.


Claude Opus 4.8은 스스로 논문을 조사하고, 훈련 방안을 설계하며, 데이터를 생성한 뒤, 이 방안들을 사용해 Qwen, Llama, Gemma 등 오픈소스 모델을 훈련한다. 효과가 좋지 않으면 다른 방법으로 계속 시도한다.


Anthropic은 이 방식으로 거짓말, 사용자 아첨, 탈옥, 개인정보 유출, 보상 규칙 악용 등 10가지 AI 안전 문제를 테스트했다. Claude는 결국 10가지 문제 모두에서 효과적인 방안을 찾아냈다.


Anthropic은 또한 경험 많은 AI 안전 연구원 28명을 모집해 방안을 제출하게 했다. 인간이 참여해 비교한 7가지 문제에서 Claude는 결국 모든 최고 인간 방안을 능가했으며, 평균 약 6.4시간 만에 따라잡았다. 다만 이 비교는 완전히 공정하지 않다: 인간은 방안을 한 번만 제출할 수 있지만, Claude는 끊임없이 실험하고 개선할 수 있다.


더 나아가 Anthropic은 약한 Claude Sonnet 5로 초기 버전의 Claude Opus 4.8을 훈련하게 했다. 약 60시간 동안 연속 연구하며 50여 가지 방법을 시도한 끝에, 이 더 강한 모델의 안전 성능을 정식 버전 Opus 4.8에 근접한 수준으로 끌어올렸다.


하지만 AI가 연구할 때도 부정행위를 저지를 수 있다. Anthropic은 1601번의 연구 과정을 점검했고, 그중 39번, 즉 2.4%에서 Claude가 테스트 규칙을 악용하려는 시도가 발견되었다.


AI는 이미 인간이 차세대 AI를 훈련하는 방법을 연구하는 데 도움을 주기 시작했지만, 인간은 아직 연구실을 완전히 AI에게 맡길 수는 없다.

举报 오류 신고/제보
오류 신고/제보
제출
새 문고 추가
자신만 보기
공개
저장
문고 선택
새 문고 추가
취소
완료