동찰 Beating AI 속보, Artificial Analysis가 어젯밤 여러 신모델에 대한 제3자 실측을 완료했다. Claude Opus 5.5 max는 Intelligence Index v4.3에서 58점을 받아 현재 1위다. GPT-6 Astra와 Fable 5.1은 모두 53점, Opus 5는 51점이다. Opus 5.5는 10개 평가 항목 중 6개에서 최고점을 차지했다.
하지만 이 최고점은 더 많은 token을 사용했다. Opus 5.5 max는 작업당 평균 약 11만 9천 tokens를 출력해 Opus 5의 7만 3천여 개보다 약 60% 많다. API 20% 인하와 캐시 읽기 60% 인하에 힘입어 작업당 비용은 최종 5.98달러로, Opus 5의 5.86달러와 거의持平했다. 더 실용적인 medium 등급은 51점을 받아 이미 Opus 5 max와 동일한 수준이며, 작업당 비용은 1.34달러에 불과하다.
OpenAI는 다른 길을 걸었다. GPT-6 Sol과 Luna의 Intelligence Index 성능은 GPT-5.6 전작과 비슷하지만 가격은 뚜렷하게 하락했다. Sol max의 작업당 비용은 1.99달러에서 1.06달러로, Luna는 0.18달러에서 0.07달러로 떨어졌다. 코딩 Agent 평가에서 Sol은 55점에서 57점으로 올랐고 비용도 약 절반 줄었다. Luna는 43점에서 41점으로 내렸지만 작업당 비용은 약 60% 낮다.
두 회사의 노선은 이미 분화하기 시작했다. Opus 5.5는 더 많은 추론으로 능력 상한을 새로운 고점으로 끌어올렸고, GPT-6 Sol과 Luna는 주로 기존 능력을 더 저렴하게 만들었다. Artificial Analysis의 성능/비용 차트에서 두 회사의 신모델 모두 새로운 Pareto 프런티어를 차지했다.