동찰 Beating AI 속보, YC가 육성한 AI 데이터 기업 Specific Labs가 프로그래밍 평가 Real-SWE를 출시했으며, 실제 기업의 프라이빗 코드로 Coding Agent를 테스트한다. 과제는 기업 생산 환경에서 직접 가져온 것으로, 세금 계산, 청구서 마이그레이션, API 과금, 고객 데이터 마이그레이션 등이 포함된다. 코드와 정답 모두 인터넷에 공개되지 않아, Agent는 기업의 비즈니스 규칙과 코드 구조를 스스로 파악해야 한다.
결과적으로 Fable 5.1이 1위를 차지했지만 통과율은 38.8%에 불과했다. GPT-6 Astra는 33.8%, Gemini 3.8 Flash는 31.2%였다. GLM 5.3은 28.8%로 4위를 기록하며 Grok 4.6, Kimi K3, GPT-5.6 Sol보다 높았다. 현재 공개된 10개 과제 중 6개의 전체 통과율이 15% 미만이며, 한 과제는 모든 모델이 전부 실패했다.
가장 놀라운 것은 GLM 5.3이다. Real-SWE는 낯선 프로젝트에서 Agent가 지속적으로 코드를 읽고, 규칙을 찾고, 다단계 수정을 완료하는 능력을 더 중시한다. 즈푸 연구원 Xiaopu Peng은 이에 대해 그들이 GLM-5.1부터 장기 과제를 훈련해 왔으며, Real-SWE가 공개 SWE 리더보드보다 이런 능력에 더 가깝다고 밝혔다. 이는 GLM 5.3이 이 리더보드에서 두드러진 성과를 보인 이유를 부분적으로 설명해 준다.