동차 Beating 모니터링에 따르면, 텐센트 훈위안 팀이 여러 대학과 협력하여 LHTB를 발표했습니다. 이는 AI 에이전트가 터미널 내에서 복잡한 작업을 지속적으로 완료할 수 있는지 테스트하기 위한 것입니다.
벤치마크는 46개의 작업으로 구성되어 있으며, 소프트웨어 엔지니어링, 실험 재현, 과학 컴퓨팅, 멀티모달 분석 등의 분야를 포함합니다. 각 작업은 최대 90분 동안 실행되며, 일반적으로 수백 단계의 연속적인 조작이 필요합니다.
LHTB는 최종 성공 여부만 보지 않습니다. 작업의 일부를 완료하면 실제 진행률에 따라 점수를 부여합니다. 숨겨진 검증기는 파일, 테스트 결과 및 프로그램 출력을 확인하며, 에이전트가 스스로 완료했다고 주장하는 것은 인정되지 않습니다.
논문의 첫 번째 버전에서는 15개의 모델을 테스트했습니다. GPT-5.5가 7개의 작업을 완료하여 1위를 차지했습니다. 각 모델이 하나의 작업을 수행하는 데 평균 약 990만 토큰이 소모되었으며, 약 85분이 소요되었습니다.
현재 공개된 결과는 20개의 모델로 확장되었습니다. Grok 4.5는 평균 점수 0.505로 1위를 차지했으며, 13개의 작업을 완료했습니다. 46개의 작업 중 여전히 29개는 어떤 모델도 완료 기준에 도달하지 못했습니다.
대부분의 에이전트는 일부 단계를 완료할 수 있지만, 종종 90분을 모두 소진하거나 작업이 아직 완료되지 않았음에도 조기에 종료되어 복잡한 작업을 실제로 끝까지 수행하지 못합니다.