BlockBeats 뉴스, 7월 19일, 반도체 및 AI 독립 연구 기관 SemiAnalysis은 Kimi K3의 약 4분의 3 네트워크 계층이 KDA를 사용하여 완전한 글로벌 어텐션 모델과 비교해 KV 캐시 전송 대역폭을 최대 10배까지 줄일 수 있지만, 이것이 AI 네트워크 스위치 시장 규모가 크게 축소된다는 의미는 아니라고 밝혔습니다.
Kimi K3는 2.8조 개의 파라미터를 보유하고 있으며, MXFP4를 사용하더라도 매번 순방향 연산에 약 1.5TB의 HBM 대역폭이 필요합니다. 합리적인 상호작용 속도를 유지하면서 수익성 있는 배포를 위해서는 GB300 NVL72와 같은 고대역폭 네트워크를 통해 다수의 칩을 연결하고 WideEP 확장 서비스에 의존해야 합니다.
WideEP은 896개의 전문가 모델을 여러 GPU에 분산시키고, 각 계층 및 순방향 연산마다 두 번의 토큰 분배와 결과 병합을 수행하며, 단일 순방향 연산은 120회 이상 실행됩니다. 이에 비해 프리필과 디코딩 간의 KV 캐시 전송은 대화당 한 번만 발생하므로, KDA가 절약하는 전송 대역폭은 대규모 전문가 모델로 인한 확장 네트워크 수요보다 훨씬 작을 수 있습니다.
SemiAnalysis은 더 효율적인 어텐션 메커니즘이 컨텍스트 길이를 100만 토큰에서 500만 토큰 이상으로 증가시킬 가능성도 있다고 봅니다. 제본스 역설에 따르면, 효율성 향상은 AI 사용 규모를 확대하여 네트워크 수요를 더욱 증가시킬 수 있습니다.
