동차 Beating 모니터링에 따르면, 메이투안(美团)이 공식적으로万亿(조) 파라미터 대형 모델 LongCat-2.0을 오픈소스화했습니다. 총 파라미터는 1.6T, 평균 활성화 파라미터는 약 48B이며, 실제 Agentic Coding 작업을 위해 특별히 설계되었습니다. 아키텍처 측면에서 LongCat 희소 어텐션(Sparse Attention)과 N-gram 임베딩(Embedding)을 혁신적으로 도입했습니다. 전자는 흐름 인식 인덱스(Flow-aware Index)와 계층적 인덱스(Hierarchical Index)를 통해 단편화된 메모리 접근을 줄이고, 백만 단위의 긴 컨텍스트(Long Context) 학습 및 추론을 가속화합니다. 후자는 MoE 희소도가 이미 97%에 가까운 상황에서 135B 파라미터를 임베딩 레이어에 투입하여 파라미터 효율과 구조적 안정성을 동시에 확보합니다. 사후 학습(Post-training)은 다중 교사 온라인 증류(Multi-teacher Online Distillation)를 채택하여 전문가를 에이전트(Agent), 추론(Reasoning), 상호작용(Interaction) 세 가지 유형으로 나누고, MOPD 아키텍처를 통해 국산 컴퓨팅 클러스터에서 원활하게 통합합니다. 업계 최초로 5만 대의 국산 컴퓨팅 클러스터에서 추론을 완료한万亿(조) 파라미터 모델로서, LongCat-2.0은 국산 칩이 복잡한 대형 모델 작업을 처리할 수 있는 성숙한 역량을 입증했습니다.
중국 국산 칩의 메모리, 대역폭 및 상호 연결의 다중 제약에 대응하여, 메이투안은 모델, 칩适配(어댑테이션) 및 배포의 세 가지 방향에서 각각 돌파구를 마련했습니다. 모델 측면에서는 ScMoE를 통해 국산 칩의 코어 제어 능력을 활용하여 Dense와 MoE 브랜치를 물리적 코어 수준에서 병렬화하고, KV-cache 분할을 통해 초장기 컨텍스트의 메모리 압박을 완화합니다. 칩适配(어댑테이션) 측면에서는 Super Kernel을 통해 연산자 시작 오버헤드를 줄이고, Weight Prefetch를 통해 I/O 지연을 숨겨 제한된 조건에서 하드웨어 활용도를 극대화합니다. 배포 측면에서는 PD 분리를 통해 TTFT와 TPOT을 균형 있게 조정하고, 비동기화된 Expert-Parallel 부하 분산을 통해 대규모 EP(Expert Parallelism)에서의 불균형 문제를 해결합니다. 이번 오픈소스는 BF16, FP8 및 INT8 등 다양한 정밀도 버전을 동시에 제공하며, 국산 컴퓨팅 성능에 극도로 최적화된 추론 결과를 완전히 공개합니다. 목표는 기존 국산 카드 및 구형 카드에서도万亿(조) 파라미터 모델의 추론 서비스를 원활하게 배포할 수 있도록 하는 것입니다.
---------------------------------
아래 원문 링크를 클릭하여 동차 Beating · Feishu AI 뉴스 채널에 가입하세요. 7×24시간 글로벌 AI 핫이슈와 뉴스를 지속적으로 모니터링합니다.