AI AI
속보
심층
이벤트
Pro
더보기
자금 조달 정보
특집
온체인 생태계
용어
팟캐스트
데이터
OPRR
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
XRP
$2.25
2.07%
DOGE
$0.325
2.23%
USDC
$0.999
3.05%

AI가 분석가로 활동하기에는 아직 부족하다: 각 문제를 5번 풀었을 때, Claude Opus 5는 54%의 문제만 모두 맞췄다.

동차 Beating 모니터링에 따르면, Artificial Analysis가 새로운 AI 분석 능력 테스트 AA-AnalystAgent를 출시했다. 이 테스트는 모델이 실제 표와 문서를 처리하며 데이터 통계, 추세 분석, 재무 모델링 등의 작업을 수행하게 한다. 테스트는 총 80문항으로 구성되며, 각 문항마다 모델이 독립적으로 5회 풀이하고, 5회 모두 정답을 맞춰야만 통과로 간주된다.

결과 1위는 Claude Opus 5였지만, 5회 연속 모두 정답을 맞춘 문항은 54%에 불과했다. GPT-5.5는 2위로 통과율 50%를 기록했고, Claude Fable 5는 49%였다. 오픈 가중치 모델 중에서는 Kimi K3가 39%로 가장 좋은 성적을 보였다.

단순히 각 답변의 평균 정확도만 보면 GPT-5.5가 66%로 가장 높았다. 그러나 동일한 문항을 5회 연속 맞춰야 한다는 조건에서는 통과율이 50%로 떨어졌다. Claude Opus 5는 단회 정확도가 다소 낮았지만 더 안정적이어서 최종적으로 1위를 차지했다.

AI의 가장 흔한 문제는 계산을 못하는 것이 아니라, 처음부터 문제를 잘못 이해하는 것이다. Artificial Analysis는 1567건의 실패 기록을 분석했는데, 그중 57%에서 이런 현상이 나타났다: 모델이 너무 일찍 잘못된 해석을 확정하고, 이후 계속 그 방향으로 진행한 것이다.

举报 오류 신고/제보
오류 신고/제보
제출
새 문고 추가
자신만 보기
공개
저장
문고 선택
새 문고 추가
취소
완료