동찰 Beating AI 속보, Inco AI가 로컬 추론 엔진 Splash를 오픈소스로 공개하며, Qwen3.8-27B를 M5 Max MacBook Pro에서 최대 144 Token/s까지 실행했다. LM Studio가 즉시 연동했으며, 0.4.25 버전에서 바로 사용할 수 있다.
Inco가 이전에 만든 DFlash는 이미 SGLang, vLLM, TensorRT-LLM, llama.cpp에 진입했다. Meta, NVIDIA, 샤오미, Poolside 등도 자사 모델에 DFlash 가속 소형 모델을 적용했다. DFlash는 먼저 소형 모델이 여러 Token을 병렬로 추측하게 한 뒤, 대형 모델에 일괄 검증을 맡겨 Token별 생성 연산을 줄인다.
Splash는 이러한 최적화를 로컬 추론 엔진 전체로 확장했다. 현재 Qwen3.8-27B와 Qwen3.6-35B-A3B만 지원하며, 각 모델마다 GPU kernel, 메모리 방안, DFlash 2 소형 모델을 개별적으로 구성했다. 지원 모델은 적지만, 그 대가로 더 공격적인 성능 최적화를 얻었다.
144 Token/s는 M5 Max에서의 최고 데모 값이다. Inco가 횡적 테스트에 사용한 48GB M5 Pro로 바꾸면, Qwen3.8-27B 단일 경로 단문 컨텍스트에서 74 Token/s에 도달하며, 4경로 동시 실행 시 총 처리량은 170 Token/s로 2위의 3.9배다. 이는 Splash가 Agent 시나리오에 더 적합한 부분이기도 하다. 하나의 Agent가 동시에 여러 하위 작업을 시작할 때, 동시 총 처리량이 단일 대화 속도보다 더 중요할 때가 많다.
Splash 자체는 오픈소스이며 LM Studio에 종속되지 않는다. 현재 M3 이상 Mac, macOS 26.4 이상, 최소 36GB 통합 메모리가 필요하다.
