AI AI
속보
심층
이벤트
Pro
더보기
자금 조달 정보
특집
온체인 생태계
용어
팟캐스트
데이터
OPRR
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
XRP
$2.25
2.07%
DOGE
$0.325
2.23%
USDC
$0.999
3.05%

DFlash 팀이 Mac에 진출해 27B 모델을 144Token/s로 구현했다

동찰 Beating AI 속보, Inco AI가 로컬 추론 엔진 Splash를 오픈소스로 공개하며, Qwen3.8-27B를 M5 Max MacBook Pro에서 최대 144 Token/s까지 실행했다. LM Studio가 즉시 연동했으며, 0.4.25 버전에서 바로 사용할 수 있다.


Inco가 이전에 만든 DFlash는 이미 SGLang, vLLM, TensorRT-LLM, llama.cpp에 진입했다. Meta, NVIDIA, 샤오미, Poolside 등도 자사 모델에 DFlash 가속 소형 모델을 적용했다. DFlash는 먼저 소형 모델이 여러 Token을 병렬로 추측하게 한 뒤, 대형 모델에 일괄 검증을 맡겨 Token별 생성 연산을 줄인다.


Splash는 이러한 최적화를 로컬 추론 엔진 전체로 확장했다. 현재 Qwen3.8-27B와 Qwen3.6-35B-A3B만 지원하며, 각 모델마다 GPU kernel, 메모리 방안, DFlash 2 소형 모델을 개별적으로 구성했다. 지원 모델은 적지만, 그 대가로 더 공격적인 성능 최적화를 얻었다.


144 Token/s는 M5 Max에서의 최고 데모 값이다. Inco가 횡적 테스트에 사용한 48GB M5 Pro로 바꾸면, Qwen3.8-27B 단일 경로 단문 컨텍스트에서 74 Token/s에 도달하며, 4경로 동시 실행 시 총 처리량은 170 Token/s로 2위의 3.9배다. 이는 Splash가 Agent 시나리오에 더 적합한 부분이기도 하다. 하나의 Agent가 동시에 여러 하위 작업을 시작할 때, 동시 총 처리량이 단일 대화 속도보다 더 중요할 때가 많다.


Splash 자체는 오픈소스이며 LM Studio에 종속되지 않는다. 현재 M3 이상 Mac, macOS 26.4 이상, 최소 36GB 통합 메모리가 필요하다.

举报 오류 신고/제보
오류 신고/제보
제출
새 문고 추가
자신만 보기
공개
저장
문고 선택
새 문고 추가
취소
완료