AI AI
속보
심층
이벤트
Pro
더보기
자금 조달 정보
특집
온체인 생태계
용어
팟캐스트
데이터
OPRR
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
XRP
$2.25
2.07%
DOGE
$0.325
2.23%
USDC
$0.999
3.05%

OpenAI는 평가 프레임워크가 GPT-5.6의 성능을 저하시켰다고 밝혔지만, Opus 5는 동일한 프레임워크에서 2.3배 높은 점수를 기록했다.

동차 Beating 모니터링에 따르면, OpenAI는 ARC-AGI-3의 일반 평가 프레임워크가 GPT-5.6 Sol의 이전 추론을 저장하지 않으며, 컨텍스트가 너무 길어지면 초기 기록을 삭제한다고 밝혔습니다. 이로 인해 모델은 이미 발견한 게임 규칙을 자주 잊어버리고, 각 단계를 실행할 때마다 다시 사고해야 합니다.

이후 OpenAI는 자체 Responses API로 평가 프레임워크를 재구축하여 이전 추론을 보존하고, 과도하게 긴 컨텍스트를 압축했습니다. 그 결과, GPT-5.6 Sol의 점수는 13.3%에서 38.3%로 상승했으며, 출력 토큰은 약 6분의 1로 감소했습니다.

하지만 문제는 Opus 5도 동일한 일반 프레임워크를 사용한다는 점입니다. Opus 5는 High 추론 모드에서 30.2%를 기록한 반면, GPT-5.6 Sol은 더 높은 Max 모드를 사용해도 13.3%에 불과했습니다. 프레임워크가 실제로 GPT-5.6을 저하시켰지만, Opus 5를 동일하게 저하시키지는 않았습니다.

OpenAI가 어떻게 변명하든, 이 세계에서 가장 어려운 AI 평가에서 Opus 5는 GPT-5.6보다 확실히 우수합니다.

举报 오류 신고/제보
오류 신고/제보
제출
새 문고 추가
자신만 보기
공개
저장
문고 선택
새 문고 추가
취소
완료