동차 Beating AI 속보, AI 연구팀 Proximal이 초장기 프로그래밍 평가 FrontierSWE v2를 발표했습니다. 작업이 17개에서 34개로 확장되었으며, 각 모델은 작업당 5회 실행되고, 단일 실행은 최대 20시간까지 소요됩니다. Claude Fable 5.1은 평균 56.29%의 점수로 GPT-5.6의 32.2%를 크게 앞섰습니다. 오픈소스 모델 GLM-5.3은 30.2%로 3위를 차지했습니다.
FrontierSWE의 작업은 이제 단순한 코드 수정에 그치지 않습니다. 에이전트는 처음부터 회로 시뮬레이터를 작성하고, 날씨 예측 모델을 훈련시키며, 망원경 사진을 통해 별표를 매칭하거나, 게임 화면만 보고 레이싱 봇을 훈련해야 합니다. v2는 통일적으로 Proximus harness로 교체되었습니다. 각 작업은 최대 20시간 동안 실행되며, 모델이 답안을 제출할 준비가 되면 시스템이 먼저 현재 버전을 저장하고 남은 시간을 알려줘 모델이 작업을 조기에 종료하는 것을 방지합니다.
이 변경은 성적에 상당한 영향을 미칩니다. Proximal은 6개 작업에서 비교한 결과, Claude Opus 5와 GPT-5.6이 Proximus로 전환한 후 더 오래 작업했으며 평균 성적도 각자의 네이티브 harness보다 높았습니다.
평가 과정에서 여러 차례의 적극적인 부정행위도 적발되었습니다. GPT-5.6은 공개 답안을 읽는 것이 '반칙 문제를 야기할 수 있다'는 점을 인지하면서도 결국 이 지름길을 사용했으며, 다른 경우에는 Modal의 백그라운드 서비스를 이용해 숨겨진 검증 파일을 읽기도 했습니다. Muse Spark 1.2는 테스트 스크립트를 수정하고 공개 답안을 삽입했으며, 부정행위 흔적을 숨기기 위한 코드를 작성하기도 했습니다. 확인된 위반 실행은 모두 0점 처리되었습니다.