동향 Beating 모니터링에 따르면, 반도체 및 AI 분석 기관 SemiAnalysis은 프로그래밍 어시스턴트 벤치마킹을 발표했으며, GPT-5.5, Opus 4.7 및 DeepSeek V4을(를) 다룹니다. 핵심 결론: GPT-5.5는 OpenAI의 프로그래밍 모델로 6개월 만에 선두로 돌아온 것으로, SemiAnalysis의 엔지니어들은 Codex와 Claude Code 사이를 전환하기 시작했으며, 이전에는 거의 모두 Claude만 사용했습니다. GPT-5.5는 코드명 "Spud"에 기반한 새로운 사전 훈련을 기반으로 하며, 이것은 GPT-4.5 이후 OpenAI가 처음으로 사전 훈련 규모를 확대한 것입니다。
실제 테스트에서는 역할 분담이 형성되었습니다: Claude는 새로운 프로젝트 계획 및 초기 빌드를 수행하고, Codex는 추론 집중적인 버그 수정을 수행합니다. Codex는 데이터 구조 이해 및 논리 추론에서 뛰어나지만, 모호한 사용자 의도를 추론하는 데는 적합하지 않습니다. 동일한 대시 보드 작업에서, Claude는 참조 페이지 레이아웃을 자동 복제하지만 데이터는 대부분 조작되었고, Codex는 레이아웃을 건너뛰었지만 훨씬 더 정확한 데이터를 제공했습니다.
기사는 벤치마크 테스트의 운영 세부 사항을 드러냈습니다: OpenAI는 올해 2월 SWE-bench Pro를 새로운 프로그래밍 표준 벤치마크로 사용하도록 산업에 호소하는 블로그를 게시했지만, GPT-5.5의 공지는 "Expert-SWE"라는 새로운 벤치마크로 바뀌었습니다. 그 이유는 GPT-5.5가 SWE-bench Pro에서 Opus 4.7에 밀려 Anthropic이 아직 발표하지 않은 Mythos보다 훨씬 낮았기 때문입니다 (77.8%).
Opus 4.7 측면에서, Anthropic은 출시 한 주 후에 postmortem을 게시했으며, Claude Code가 3 ~ 4월에 세 번의 버그가 있었음을 인정했습니다. 몇 주 동안 계속되었으며, 이로 인해 거의 모든 사용자에게 영향을 줬습니다. 이전에 많은 엔지니어들이 성능 하락을 4.6으로 보고 있었지만 개인적인 느낌으로만 여겨졌습니다. 또한, 4.7의 새로운 토크나이저는 토큰 사용량이 최대 35% 늘어난다는 것을 야기하며, Anthropic은 이를 인정하며 숨은 인상을 뜻하는 것입니다.
DeepSeek V4는 "선도하지만 선도하지는 않음"으로 평가되었으며, 닫힌 소스 모델의 가장 저렴한 대안이 될 것입니다. 이 기사는 또한 "Claude는 중국어 작업에서 여전히 DeepSeek V4 Pro를 앞질렀다"고 언급하며, "Claude는 상대방의 언어로 중국 모델을 이겼다"라고 평가합니다.
기사는 중요한 개념을 제시합니다: 모델 가격 책정은 "각 작업 비용"을 고려해야하며, "각 토큰 비용"이 아닙니다. GPT-5.5의 단가는 GPT-5.4의 2배이지만 더 적은 토큰을 사용하여 동일한 작업을 수행할 수 있으므로 실제 비용은 항상 더 높지 않을 수 있습니다. SemiAnalysis의 초기 데이터에 따르면 Codex의 입력 출력 비율은 80:1로 Claude Code의 100:1보다 낮습니다.
