AI AI
속보
심층
이벤트
Pro
더보기
자금 조달 정보
특집
온체인 생태계
용어
팟캐스트
데이터
OPRR
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
XRP
$2.25
2.07%
DOGE
$0.325
2.23%
USDC
$0.999
3.05%

OpenAI가 GPT-6 Astra 평가 데이터를 조용히 조정했다는 지적이 제기됐으며, 일부 지표에서 경쟁사 성능이 '악화'된 것으로 나타났다.

동차 Beating AI 속보, OpenAI가 9월 3일 GPT-6 Astra를 출시한 이후 여러 모델 평가 벤치마크 데이터가 지속적으로 조정되었으며, 일부 수정으로 Astra의 성능이 더 우수하게 나타나고 동시에 일부 경쟁사 모델의 점수가 하락하면서 외부에서 AI '벤치마크 부풀리기'와 평가 투명성에 대한 의문이 제기되고 있다.


그중 Astra의 환각률은 4.2%에서 2%로 하향 조정되었고, GPT-5.6 Sol은 12.2%에서 9.4%로 낮아졌다가 이후 두 모델 모두 각각 4.2%와 12.2%로 복원되었다. 수학 평가에서 Anthropic의 Fable 5.1 점수도 87.8%에서 78%로 하락했다가 현재 83%로 회복되었으며, GPT-5.6 Sol은 83%에서 80.5%로 하락한 후 83%로 복원되었다.


또한 Astra는 ARC-AGI-3 평가에서 출시 전 초안의 98.6%에서 최종 페이지의 99.99%로 상승했으며, 프로그래밍 평가 점수도 57.7%에서 57.9%로 소폭 상향 조정되었다. OpenAI는 평가 결과가 모델 버전, 도구 구성, 추론 수준 및 테스트 실행 등의 요인에 영향을 받을 수 있으며, 이번 조정은 데이터가 모델의 최적 성능을 더 정확하게 반영하도록 하기 위한 것이라고 밝혔다.


그러나 스탠포드 대학 연구진은 잦은 평가 재실행이 소위 'Benchmaxxing'과 관련될 수 있다고 지적하며, 이는 테스트 조건을 조정하여 벤치마크 점수를 극대화하는 방식이다. 업계 관계자들은 AI 모델 경쟁이 심화됨에 따라 평가 데이터가 모델 역량을 측정하고 시장을 선점하는 중요한 도구가 되었으며, 벤치마크 테스트의 투명성과 재현성을 어떻게 높일지에 대한 관심이 점점 커지고 있다고 지적한다.

举报 오류 신고/제보
오류 신고/제보
제출
새 문고 추가
자신만 보기
공개
저장
문고 선택
새 문고 추가
취소
완료