AI AI
속보
심층
이벤트
Pro
더보기
자금 조달 정보
특집
온체인 생태계
용어
팟캐스트
데이터
OPRR
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
XRP
$2.25
2.07%
DOGE
$0.325
2.23%
USDC
$0.999
3.05%

지푸 GLM-5.2, DeepSWE 오픈소스 1위 등극: 복잡한 개발 작업의 44% 해결, 주요 폐쇄형 모델 압도

동차 Beating 모니터링에 따르면, 지푸 AI(Zhipu AI)의 오픈소스 모델 GLM-5.2가 장기 소프트웨어 엔지니어링 벤치마크 DeepSWE에 공식 진입했습니다. 최대 사고 강도 모드에서 복잡한 개발 작업의 일회 성공률이 44%에 달하며, 오픈소스 모델 중 1위를 기록했습니다. 이전에 순위에 진입한 Kimi K2.7 Code와 비교하면 성공률이 13% 포인트 높습니다.

GLM-5.2가 각 작업을 해결하는 평균 비용은 3.92달러로, Kimi K2.7 Code의 2.82달러보다 약간 높지만, 성공률은 특정 사고 구성에서 여러 주요 폐쇄형 모델의 성능을 능가했습니다. 여기에는 Claude Sonnet 4.6 [high] (30%), Gemini 3.5 Flash [medium] (37%), Claude Opus 4.8 [low] (41%)가 포함됩니다.

평가 주최 측인 Datacurve가 설계한 DeepSWE 벤치마크는 AI 에이전트의 장기 작업 해결 능력을 특별히 테스트합니다. 테스트는 113개의 실제 프로그래밍 문제로 구성되며, 5가지 언어를 포괄합니다. 단일 코드만 수정하는 전통적인 테스트와 달리, DeepSWE는 AI가 여러 파일을 협력적으로 수정해야 하며, 평균적으로 600줄 이상의 코드를 수정합니다. 평가는 격리된 컨테이너에서 실행되며, CPU 및 메모리 리소스가 엄격히 제한됩니다.

举报 오류 신고/제보
오류 신고/제보
제출
새 문고 추가
자신만 보기
공개
저장
문고 선택
새 문고 추가
취소
완료