동찰 Beating 모니터링에 따르면, 구글 DeepMind은 AI 공동 수학자를 공개했습니다. 이는 수학자들이 사용하는 다중 에이전트 상호 작용형 연구 환경입니다. 이 시스템은 현재 가장 어려운 연구 수준의 수학 벤치마크인 FrontierMath Tier 4에서 47.9%의 정확도(48개 문제 중 23개 해결)를 기록하여 이전 최고 기록인 GPT-5.5 Pro의 39.6%를 직접 능가했습니다。
이 시스템은 새로운 세대의 베이스를 사용하지 않고 직접 Gemini 3.1 Pro를 사용했습니다. 이 모델은 Tier 4에서 개인적으로 실행시킨 결과가 19%였는데, 에이전트 프레임워크를 추가한 후에 성적이 두 배 이상 향상되었습니다. DeepMind은 다층 아키텍처를 적용했습니다. 최상위에는 "프로젝트 코디네이터"가 연구 작업을 여러 작업 흐름으로 나누어 문헌 검색, 코드 작성 및 추론을 담당하는 하위 에이전트에게 배분합니다. 작성된 증명은 다수의 "심사 에이전트"로 구성된 심사회의를 거쳐야만 제출할 수 있습니다. 이 프레임워크는 입증 능력을 극대화하는 구성 기술이 최첨단 수학 추론에서 모델 교체보다 더 큰 성과를 얻을 수 있다는 것을 입증했습니다.
인셉에이에서 진행된 블라인드 테스트에서, 부정행위를 방지하기 위해 DeepMind 팀은 문제를 보지 못하도록 하고, 각 문제는 최대 48시간 동안 실행할 수 있었습니다. 결과적으로 이 시스템은 뿌듯한 성과를 거뒀을 뿐 아니라, 기존 모델들이 전부 실패했던 문제 3개도 해결했습니다.
비록 '공동 수학자'로 불리지만, 이는 오히려 창의적인 동료처럼 작동합니다. 군집 이론 전문가 Marc Lackenby는 이를 사용하여 Kourovka Notebook의 공개 추측을 해결했습니다. 흥미로운 점은, 시스템이 처음 제시한 전략이 자체 검토 에이전트들에 의해 "결함이 있음"으로 표시되었지만, Lackenby가 재정의한 특이한 접근 방식을 감지하고 이를 보충하여 최종 증명을 완성했습니다.
현재 AI 공동 수학자는 소수의 수학자들에게만 내부 테스트를 공개하고 있습니다.