AI AI
속보
심층
이벤트
Pro
더보기
자금 조달 정보
특집
온체인 생태계
용어
팟캐스트
데이터
OPRR
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
XRP
$2.25
2.07%
DOGE
$0.325
2.23%
USDC
$0.999
3.05%

Grok 4.5가 텐센트 혼위안(Tencent Hunyuan) 에이전트 내구성 랭킹에서 1위를 차지했으며, 60% 이상의 작업이 모델 없이 완료되었습니다.

동차 Beating 모니터링에 따르면, 텐센트 훈위안 팀이 여러 대학과 협력하여 LHTB를 발표했습니다. 이는 AI 에이전트가 터미널 내에서 복잡한 작업을 지속적으로 완료할 수 있는지 테스트하기 위한 것입니다.

벤치마크는 46개의 작업으로 구성되어 있으며, 소프트웨어 엔지니어링, 실험 재현, 과학 컴퓨팅, 멀티모달 분석 등의 분야를 포함합니다. 각 작업은 최대 90분 동안 실행되며, 일반적으로 수백 단계의 연속적인 조작이 필요합니다.

LHTB는 최종 성공 여부만 보지 않습니다. 작업의 일부를 완료하면 실제 진행률에 따라 점수를 부여합니다. 숨겨진 검증기는 파일, 테스트 결과 및 프로그램 출력을 확인하며, 에이전트가 스스로 완료했다고 주장하는 것은 인정되지 않습니다.

논문의 첫 번째 버전에서는 15개의 모델을 테스트했습니다. GPT-5.5가 7개의 작업을 완료하여 1위를 차지했습니다. 각 모델이 하나의 작업을 수행하는 데 평균 약 990만 토큰이 소모되었으며, 약 85분이 소요되었습니다.

현재 공개된 결과는 20개의 모델로 확장되었습니다. Grok 4.5는 평균 점수 0.505로 1위를 차지했으며, 13개의 작업을 완료했습니다. 46개의 작업 중 여전히 29개는 어떤 모델도 완료 기준에 도달하지 못했습니다.

대부분의 에이전트는 일부 단계를 완료할 수 있지만, 종종 90분을 모두 소진하거나 작업이 아직 완료되지 않았음에도 조기에 종료되어 복잡한 작업을 실제로 끝까지 수행하지 못합니다.

举报 오류 신고/제보
오류 신고/제보
제출
새 문고 추가
자신만 보기
공개
저장
문고 선택
새 문고 추가
취소
완료