AI AI
속보
심층
이벤트
Pro
더보기
자금 조달 정보
특집
온체인 생태계
용어
팟캐스트
데이터
OPRR
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
XRP
$2.25
2.07%
DOGE
$0.325
2.23%
USDC
$0.999
3.05%

GPT-2에서 Kimi K3까지: 7년간의 대규모 모델 아키텍처 진화, 그 본질은 메모리 쟁탈전이다

동차 Beating 모니터링에 따르면, Baseten 엔지니어 Ali가 GPT-2부터 Kimi K3까지 분석한 장문의 글을 발표했습니다. 매개변수 수 기준으로 K3 하나는 약 22,580개의 GPT-2에 해당합니다. 하지만 그는 지난 7년간의 진정한 변화는 단순히 모델을 키우는 것이 아니라, 모델이 정보를 저장, 업데이트, 검색하는 방식을 지속적으로 개선해 온 것이라고 봅니다.

GPT-2는 완전한 어텐션(Full Attention)을 사용합니다. 각 토큰은 자신의 Key와 Value를 남기고, 이후 언제든지 다시 참조할 수 있습니다. 정보 보존은 가장 완벽하지만, 컨텍스트가 길어질수록 KV Cache와 계산 비용이 증가합니다.

선형 어텐션(Linear Attention)은 전체 히스토리를 고정 크기의 상태로 압축합니다. 비용이 더 이상 컨텍스트 길이에 따라 계속 증가하지 않지만, 대신 서로 다른 정보가 동일한 공간에 밀집됩니다. 내용이 많아질수록 오래된 기억이 서로 간섭하기 시작합니다.

이후의 여러 아키텍처 혁신은 이 제한된 메모리에 관리 규칙을 추가하는 방향으로 진행되었습니다. DeltaNet은 모델이 먼저 기존 내용을 읽은 후, 새-구 차이를 이용해 덮어쓰도록 허용합니다. Gated DeltaNet은 전체 망각(Forgetting)을 도입하여, 오래된 정보가 상황 변화에 따라 감쇠할 수 있게 합니다.

KDA는 망각 제어를 각 채널 단위로 세분화합니다. 서로 다른 정보는 각기 다른 보존 시간을 가질 수 있습니다: 장기 사실은 더 오래 유지되고, 임시 명령어나 지역 변수는 더 빠르게 감쇠합니다. Ali는 이것이 Kimi Linear의 가장 중요한 발전이라고 봅니다.

하지만 고정 상태는 모든 세부 사항을 보존할 수 없습니다. 따라서 K3는 KDA만 사용하지 않고, 23개의 4계층 구조를 '3계층 KDA + 1계층 MLA'로 배열한 후, 마지막에 다시 한 계층의 MLA를 추가합니다. KDA는 저비용으로 장기 기억을 유지하고, MLA는 주기적으로 전체 컨텍스트를 다시 참조하여 숫자, 코드, 초기 명령어 등 정확한 정보를 찾아냅니다.

K3는 또한 어텐션 잔차(Attention Residuals)를 도입했습니다. 일반 모델은 각 계층의 결과를 계속 더해나가는데, 초기에 추출된 정보는 93계층의 계산 과정에서 후속 결과에 의해 희석되기 쉽습니다. K3는 네트워크를 12계층 단위로 블록화하여, 이후 계층이 필요에 따라 초기 단계에서 형성된 중간 표현을 호출할 수 있게 하여, 매번 원문에서 다시 유도할 필요가 없게 합니다.

따라서 K3의 핵심은 갑자기 등장한 특정 블랙 테크놀로지가 아닙니다. 그것이 정말 특별한 점은 순환 메모리, 전역 검색, 계층 간 재참조, 전문가 라우팅(Expert Routing)을 결합하여 계층화된 정보 시스템을 만든 데 있습니다.

지난 7년간의 모델 아키텍처 진화는 본질적으로 모델에게 무엇을 남길 가치가 있는지, 무엇을 덮어써야 하는지, 언제 원문을 다시 참조해야 하는지를 선택하는 방법을 가르쳐 온 과정입니다.

举报 오류 신고/제보
오류 신고/제보
제출
새 문고 추가
자신만 보기
공개
저장
문고 선택
새 문고 추가
취소
완료