동차 Beating AI 속보, 엔비디아가 게시한 기사에 따르면 알리바바의 최신 프리뷰 모델 Qwen3.8-Flash-Next가 엔비디아 GB300 NVL72 플랫폼을 지원받게 되었습니다. 이 모델의 총 파라미터 규모는 1760억 개에 달하며, 토큰당 약 60억 개의 파라미터가 활성화되고, 기본적으로 26.2만 토큰의 컨텍스트를 지원하며, YaRN을 통해 100만 토큰까지 확장할 수 있습니다. 주로 스마트 프로그래밍, 문서 처리 및 도구 호출 등 긴 컨텍스트 에이전트 애플리케이션을 대상으로 합니다.
엔비디아는 Qwen3.8-Flash-Next가 Gated DeltaNet(GDN)과 Qwen Sparse Attention(QSA) 하이브리드 아키텍처를 채택하여 긴 컨텍스트 시나리오에서의 계산 및 KV 캐시 오버헤드를 줄인다고 밝혔습니다. 테스트 결과, GB300 NVL72에서 이 모델의 단일 GPU 처리량은 초당 1.6만 토큰을 초과하고, 단일 사용자 처리량은 초당 200 토큰을 초과합니다. 또한 SGLang, vLLM 및 TensorRT-LLM과 같은 추론 프레임워크를 지원합니다.
