AI AI
속보
심층
이벤트
Pro
더보기
자금 조달 정보
특집
온체인 생태계
용어
팟캐스트
데이터
OPRR
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
XRP
$2.25
2.07%
DOGE
$0.325
2.23%
USDC
$0.999
3.05%

터미널-벤치 4.0: GLM-5.3이 3위로 급상승, GPT-5.6 솔을 능가

동차 Beating AI 속보, Terminal-Bench 4.0 출시, 에이전트가 작업을 수행할 때의 시간, CPU 및 메모리를 재보정하고 19개 작업을 수정하며 포화, 거부 응답, 공개 해법 또는 품질 문제가 있는 8개 작업을 제거했습니다. 모든 작업의 최대 실행 시간은 8시간으로 통일되어 주로 타임아웃과 환경 문제가 성적에 미치는 간섭을 줄였습니다.


최신 순위에서 Opus 5 + Claude Code가 51.8%로 1위, Fable 5가 44.5%로 2위입니다. GLM-5.3 + Claude Code가 41.8%를 기록하며 3위로 올라섰고, GPT-5.6 Sol + Codex의 37.3%를 앞질렀습니다. 상위 3위 중 GLM-5.3은 유일하게 Anthropic이 아닌 모델입니다.


Terminal-Bench 3.0에서 GLM-5.3은 여전히 32.4%로 4위였고, GPT-5.6 Sol의 34.6%에 뒤처졌습니다. 4.0에서는 GLM-5.3이 3위로 상승하며 반대로 Sol을 4.5% 포인트 앞섰습니다.

举报 오류 신고/제보
오류 신고/제보
제출
새 문고 추가
자신만 보기
공개
저장
문고 선택
새 문고 추가
취소
완료