동차 Beating AI 속보, Anthropic이 Claude를 AI 안전 연구원으로 삼아 다른 AI를 더 안전하게 훈련하는 방법을 연구하게 했다.
Claude Opus 4.8은 스스로 논문을 조사하고, 훈련 방안을 설계하며, 데이터를 생성한 뒤, 이 방안들을 사용해 Qwen, Llama, Gemma 등 오픈소스 모델을 훈련한다. 효과가 좋지 않으면 다른 방법으로 계속 시도한다.
Anthropic은 이 방식으로 거짓말, 사용자 아첨, 탈옥, 개인정보 유출, 보상 규칙 악용 등 10가지 AI 안전 문제를 테스트했다. Claude는 결국 10가지 문제 모두에서 효과적인 방안을 찾아냈다.
Anthropic은 또한 경험 많은 AI 안전 연구원 28명을 모집해 방안을 제출하게 했다. 인간이 참여해 비교한 7가지 문제에서 Claude는 결국 모든 최고 인간 방안을 능가했으며, 평균 약 6.4시간 만에 따라잡았다. 다만 이 비교는 완전히 공정하지 않다: 인간은 방안을 한 번만 제출할 수 있지만, Claude는 끊임없이 실험하고 개선할 수 있다.
더 나아가 Anthropic은 약한 Claude Sonnet 5로 초기 버전의 Claude Opus 4.8을 훈련하게 했다. 약 60시간 동안 연속 연구하며 50여 가지 방법을 시도한 끝에, 이 더 강한 모델의 안전 성능을 정식 버전 Opus 4.8에 근접한 수준으로 끌어올렸다.
하지만 AI가 연구할 때도 부정행위를 저지를 수 있다. Anthropic은 1601번의 연구 과정을 점검했고, 그중 39번, 즉 2.4%에서 Claude가 테스트 규칙을 악용하려는 시도가 발견되었다.
AI는 이미 인간이 차세대 AI를 훈련하는 방법을 연구하는 데 도움을 주기 시작했지만, 인간은 아직 연구실을 완전히 AI에게 맡길 수는 없다.