동차 Beating 모니터링에 따르면, Arena Agent 순위는 실제 사용자 작업 및 도구 호출 기록을 기반으로 합니다. Kimi K3의 종합 순 개선율은 9.62%로 4위를 기록했습니다. 이는 Claude Fable 5, Claude Opus 4.8 Thinking, GPT-5.6 Sol 뒤를 이은 결과입니다.
Arena는 모든 평가 모델을 균일하게 혼합하여 가상 평균 기준을 만든 후, K3로 대체했을 때 각 결과가 얼마나 개선되는지 추정합니다. 다섯 가지 순 개선율의 평균을 내어 종합 점수를 산출합니다.
K3는 현재까지 8344회의 테스트 세션을 축적했습니다. 사용자 확인 성공 지표의 순 개선율은 14.42%로 1위를 차지했습니다. 칭찬이 불만보다 많은 지표는 20.62% 개선되어 3위를 기록했습니다. 오류 수정 실행은 14위, Bash 오류 복구는 17위를 기록했습니다. K3는 사용자가 인정할 만한 결과를 더 쉽게 도출하지만, 중간 오류 수정 및 명령어 오류 복구는 여전히 약점으로 남아 있습니다.
