AI AI
속보
심층
이벤트
Pro
더보기
자금 조달 정보
특집
온체인 생태계
용어
팟캐스트
데이터
OPRR
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
XRP
$2.25
2.07%
DOGE
$0.325
2.23%
USDC
$0.999
3.05%

DeepSeek가 오픈소스 추론 가속 프레임워크 DeepSpec을 공개하고, DSpark를 출시하여 V4 모델 속도를 최대 85% 향상시켰습니다.

동차 Beating 모니터링에 따르면, DeepSeek는 베이징대학교와 공동으로 투기 샘플링 가속 프레임워크 DSpark의 기술 보고서를 발표하고, 풀스택 코드 라이브러리 DeepSpec을 오픈소스로 공개했습니다. 현재 DSpark는 DeepSeek-V4 온라인 서비스에 배포되었습니다. 출력 손실 없이 DSpark는 Flash 버전의 단일 사용자 생성 속도를 60%~85% 향상시키고, Pro 버전의 속도를 57%~78% 향상시켰습니다. DSpark는 기존의 단일 토큰 다중 분기 예측(MTP-1) 기준을 능가하며, 엄격한 지연 시간 제약 하에서 시스템 전체 처리량을 크게 끌어올렸습니다.

이전에는 다중 토큰 투기 샘플링이 온라인 프로덕션 환경에서 구현되기 어려웠습니다. 자기회귀 드래프트 모델의 생성 속도가 너무 느렸고, 병렬 드래프트 모델은 각 위치가 독립적으로 예측하여 긴 시퀀스의 후반부 수용률이 극도로 낮았습니다. 높은 동시성에서 무분별하게 다중 토큰 드래프트를 검증하면 대규모 모델이 거부될 오자를 검증하는 데 많은 연산력을 낭비하게 되어 시스템 전체 처리량이 심각하게 저하되었습니다. 따라서 업계에서는 온라인에서 단일 토큰 예측(MTP-1)에 국한되었습니다.

DSpark는 높은 동시성에서의 처리량 저하 병목 현상을 극복했습니다. DSpark는 먼저 DFlash 병렬 백본 네트워크를 사용해 숨겨진 상태를 생성한 후, 매우 가벼운 마르코프 헤드를 추가합니다. 마르코프 헤드는 테이블 조회와 한 번의 행렬 곱셈을 통해 매우 낮은 비용으로 인접 단어 간의 연관성을 직렬로 주입합니다. 동시에 시스템은 신뢰도 예측 헤드와 사후 보정 알고리즘을 통합합니다. 프로덕션 환경의 제로 오버헤드 스케줄링과 미래 정보 유출 방지를 위해 스케줄러는 비동기 메커니즘을 사용하여 두 단계 전의 과거 예측을 기반으로 후보 단어 절단 길이를 동적으로 결정함으로써, 대규모 모델이 과부하 상태에서 위험한 꼬리 오자를 검증하는 것을 완전히 방지합니다.

DSpark 외에도, DeepSeek가 이번에 오픈소스로 공개한 DeepSpec 코드 라이브러리는 Qwen3 및 Gemma와 같은 오픈소스 대규모 모델을 기본 지원합니다. DeepSpec은 프롬프트 다운로드, 대규모 모델 캐시 재구축, 드래프트 모델 훈련부터 벤치마크 평가까지의 완전한 Python 도구 체인을 제공합니다. 개발자는 오픈소스 스크립트를 활용하여 로컬에서 다양한 오픈소스 대규모 모델에 맞춤형 가속 모듈을 제작하고 배포할 수 있습니다.

오류 신고/제보
제출
새 문고 추가
자신만 보기
공개
저장
문고 선택
새 문고 추가
취소
완료