AI AI
속보
심층
이벤트
Pro
더보기
자금 조달 정보
특집
온체인 생태계
용어
팟캐스트
데이터
OPRR
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
XRP
$2.25
2.07%
DOGE
$0.325
2.23%
USDC
$0.999
3.05%

엔비디아: Qwen3.8-Flash-Next는 GB300NVL72에서 단일 카드 기준 초당 16,000개 이상의 토큰 처리량을 달성할 수 있습니다.

동차 Beating AI 속보, 엔비디아가 게시한 기사에 따르면 알리바바의 최신 프리뷰 모델 Qwen3.8-Flash-Next가 엔비디아 GB300 NVL72 플랫폼을 지원받게 되었습니다. 이 모델의 총 파라미터 규모는 1760억 개에 달하며, 토큰당 약 60억 개의 파라미터가 활성화되고, 기본적으로 26.2만 토큰의 컨텍스트를 지원하며, YaRN을 통해 100만 토큰까지 확장할 수 있습니다. 주로 스마트 프로그래밍, 문서 처리 및 도구 호출 등 긴 컨텍스트 에이전트 애플리케이션을 대상으로 합니다.


엔비디아는 Qwen3.8-Flash-Next가 Gated DeltaNet(GDN)과 Qwen Sparse Attention(QSA) 하이브리드 아키텍처를 채택하여 긴 컨텍스트 시나리오에서의 계산 및 KV 캐시 오버헤드를 줄인다고 밝혔습니다. 테스트 결과, GB300 NVL72에서 이 모델의 단일 GPU 처리량은 초당 1.6만 토큰을 초과하고, 단일 사용자 처리량은 초당 200 토큰을 초과합니다. 또한 SGLang, vLLM 및 TensorRT-LLM과 같은 추론 프레임워크를 지원합니다.

举报 오류 신고/제보
오류 신고/제보
제출
새 문고 추가
자신만 보기
공개
저장
문고 선택
새 문고 추가
취소
완료