동차 Beating AI 속보, AI 프로그래밍 기업 Magic이 사전 훈련 연구를 발표하며, 새로운 훈련 방식이 약 50만 달러 상당의 GB200 컴퓨팅 파워만으로 DeepSeek V4 Pro Base에 근접한 사전 훈련 효과를 달성할 수 있다고 밝혔습니다. 필요한 계산량은 약 1/50에 불과합니다.
Base는 사전 훈련만 완료하고 강화 학습 등의 후속 훈련을 거치지 않은 기본 모델입니다. Magic은 본 적 없는 코드, 수학 문제, 연구 논문으로 모델을 테스트하여 누가 후속 내용을 더 정확히 예측하는지 확인했습니다. 따라서 이는 기본 모델의 사전 훈련 효과를 비교한 것이며, 채팅, 코딩 또는 에이전트 능력이 이미 DeepSeek V4 Pro 완성판을 따라잡았다는 의미는 아닙니다.
Magic은 이후 훈련 규모를 10배로 확대했으며, 이는 약 400만 달러 상당의 GB200 컴퓨팅 파워에 해당합니다. 이 버전은 동일한 자체 테스트에서 테스트한 DeepSeek, Kimi 및 NVIDIA의 최신 공개 Base 모델을 능가했습니다. Magic은 DeepSeek V4 Pro의 훈련 효율로 동일한 수준을 달성한다면 컴퓨팅 비용이 1억 달러를 초과할 것으로 추산했습니다.
Magic은 전체 훈련 레시피를 공개하지 않았으며, 효율성 향상이 모델 아키텍처, 최적화기, 훈련 목표 및 데이터 처리 등 수십 가지 변경에서 비롯되었다고만 밝혔습니다. 현재 모델 가중치도 아직 공개되지 않아 '50배 효율'은 외부에서 독립적으로 재현할 수 없는 상태입니다.