동차 Beating 모니터링에 따르면, OpenAI는 ARC-AGI-3의 일반 평가 프레임워크가 GPT-5.6 Sol의 이전 추론을 저장하지 않으며, 컨텍스트가 너무 길어지면 초기 기록을 삭제한다고 밝혔습니다. 이로 인해 모델은 이미 발견한 게임 규칙을 자주 잊어버리고, 각 단계를 실행할 때마다 다시 사고해야 합니다.
이후 OpenAI는 자체 Responses API로 평가 프레임워크를 재구축하여 이전 추론을 보존하고, 과도하게 긴 컨텍스트를 압축했습니다. 그 결과, GPT-5.6 Sol의 점수는 13.3%에서 38.3%로 상승했으며, 출력 토큰은 약 6분의 1로 감소했습니다.
하지만 문제는 Opus 5도 동일한 일반 프레임워크를 사용한다는 점입니다. Opus 5는 High 추론 모드에서 30.2%를 기록한 반면, GPT-5.6 Sol은 더 높은 Max 모드를 사용해도 13.3%에 불과했습니다. 프레임워크가 실제로 GPT-5.6을 저하시켰지만, Opus 5를 동일하게 저하시키지는 않았습니다.
OpenAI가 어떻게 변명하든, 이 세계에서 가장 어려운 AI 평가에서 Opus 5는 GPT-5.6보다 확실히 우수합니다.