동차 Beating 모니터링에 따르면, 앤트 바이링(Ant Bailing)이 공식적으로 Ling-3.0-tiny 가중치를 공개했으며, BF16, FP8, INT4 세 가지 버전을 제공하고, Hugging Face 페이지에는 MIT 라이선스로 표시되어 있습니다. 모델은 총 79억 개의 파라미터를 보유하고 있으며, 각 토큰은 13억 개만 활성화되어 주로 로컬 배포 및 에이전트 시나리오를 대상으로 합니다.
Ling-3.0-tiny는 128개의 라우팅 전문가를 보유하고 있으며, 각 토큰은 그중 8개만 선택하고, 모든 토큰이 사용하는 공유 전문가 1개를 추가로 포함합니다. 어텐션 부분은 3:1의 KDA와 MLA 하이브리드 아키텍처를 채택하여, 즉 3개의 Kimi Delta Attention 레이어마다 1개의 MLA 레이어가 이어집니다.
공식 발표에 따르면 FP8 버전은 M4 Pro MacBook에서 약 86–90 Token/s의 속도를 달성할 수 있으며, DGX Spark에서는 약 100–105 Token/s입니다.
