동차 Beating 모니터링에 따르면, Artificial Analysis가 새로운 AI 분석 능력 테스트 AA-AnalystAgent를 출시했다. 이 테스트는 모델이 실제 표와 문서를 처리하며 데이터 통계, 추세 분석, 재무 모델링 등의 작업을 수행하게 한다. 테스트는 총 80문항으로 구성되며, 각 문항마다 모델이 독립적으로 5회 풀이하고, 5회 모두 정답을 맞춰야만 통과로 간주된다.
결과 1위는 Claude Opus 5였지만, 5회 연속 모두 정답을 맞춘 문항은 54%에 불과했다. GPT-5.5는 2위로 통과율 50%를 기록했고, Claude Fable 5는 49%였다. 오픈 가중치 모델 중에서는 Kimi K3가 39%로 가장 좋은 성적을 보였다.
단순히 각 답변의 평균 정확도만 보면 GPT-5.5가 66%로 가장 높았다. 그러나 동일한 문항을 5회 연속 맞춰야 한다는 조건에서는 통과율이 50%로 떨어졌다. Claude Opus 5는 단회 정확도가 다소 낮았지만 더 안정적이어서 최종적으로 1위를 차지했다.
AI의 가장 흔한 문제는 계산을 못하는 것이 아니라, 처음부터 문제를 잘못 이해하는 것이다. Artificial Analysis는 1567건의 실패 기록을 분석했는데, 그중 57%에서 이런 현상이 나타났다: 모델이 너무 일찍 잘못된 해석을 확정하고, 이후 계속 그 방향으로 진행한 것이다.
