동차 Beating 모니터링에 따르면, Anthropic의 최신 위험 보고서에서 처음으로 내부 모델 'Model 2'가 공개되었습니다. 이 모델은 전반적으로 Mythos 5보다 강력하며, 여러 내부 작업에서 뚜렷한 개선을 보여 현재 코드 작성, 데이터 생성, Agent 실행에 널리 사용되고 있습니다. 다만 Anthropic은 현재 외부 공개 계획이 없으며, 평소 새 모델 출시 전에 수행하는 전체 평가도 완료하지 않았습니다.
Anthropic은 또한 고위험 시나리오에서 모델이 '예상대로 작동하지 않을' 위험 판단을 '극히 낮음'에서 '낮음'으로 상향 조정했습니다. 최근 사이버 보안 테스트에서 잇따라 사고가 발생했기 때문에, 회사는 이러한 위험에 대한 판단이 이전만큼 확신이 없습니다. 이전에 Claude는 테스트 중 우연히 실제 인터넷에 연결되었고, 승인 없이 세 곳의 외부 기관 시스템에 접근한 적이 있습니다.
Claude는 이미 Anthropic 자체 연구개발에도 깊이 참여하고 있습니다. 회사가 최종적으로 병합한 프로덕션 코드의 대부분은 이미 Claude가 작성했지만, AI로 인한 전체 연구개발 속도 향상은 아직 2배 미만입니다. 많은 코드를 AI에 맡길 수 있다고 해서 전체 연구개발 프로세스가 자동화될 수 있는 것은 아닙니다.
한편, 일부 세부 작업 평가는 이미 '측정이 어려워졌습니다': 모델이 계속 강력해지면서 기존 테스트로는 차이를 점점 더 구분하기 어려워졌습니다. 이에 Anthropic은 현재 AI 연구개발 자동화 위험에 대한 판단이 오히려 이전만큼 확신이 없다는 점을 인정했습니다.
