동차 Beating 모니터링에 따르면, 천원(千问)이 공식적으로 Qwen3.8-27B를 오픈소스화했으며 공식 벤치마크 점수도 함께 공개했습니다. 단 27B 파라미터를 가진 이 로컬 모델은 공식이 제시한 8개 직접 비교 테스트에서 모두 메타가 방금 출시한 30B 모델 Muse Glimmer를 능가했습니다.
격차는 특히 에이전트와 프로그래밍 분야에서 두드러집니다. Terminal-Bench 2.1에서 Qwen3.8-27B는 73.0점, Muse Glimmer는 51.7점을 기록했으며, SWE-bench Pro는 61.7 대 51.2, OSWorld-Verified는 84.3 대 65.9로 나타났습니다. 일반 추론, 문서, 비전 테스트에서도 모두 앞섰습니다.
더 놀라운 것은 Claude Opus 4.6과의 비교입니다. 양쪽 모두 점수가 있는 19개 테스트 중 Qwen3.8-27B가 15개 항목에서 승리했습니다. SWE-bench Pro, LiveCodeBench, OSWorld, AndroidWorld 및 여러 비전 작업에서 이미 역전했으며, Terminal-Bench, GPQA, HLE 및 NL2Repo는 여전히 뒤처져 있습니다.
개인 PC에서 로컬로 실행할 수 있는 27B 모델이 공식 벤치마크에서 이미 이전 세대 폐쇄형 플래그십 수준에 도달했습니다.