AI AI
속보
심층
이벤트
Pro
더보기
자금 조달 정보
특집
온체인 생태계
용어
팟캐스트
데이터
OPRR
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
XRP
$2.25
2.07%
DOGE
$0.325
2.23%
USDC
$0.999
3.05%

微博, 오픈소스 VibeThinker-3B를 공개하며 3B 소형 모델이 최첨단 추론 계층에 진입하다.

동차 Beating 모니터링에 따르면, 시나 웨이보 팀이 최근 300억 파라미터의 추론 모델 VibeThinker-3B를 오픈소스로 공개했습니다.

이 모델은 수학 및 프로그래밍 등 작업에서 최첨단 수준에 도달했으며, 일부 지표는 DeepSeek V3.2, GLM-5, Gemini 3 Pro와 같은 대규모 플래그십 모델에 근접하거나 이를 능가합니다.

VibeThinker-3B는 Qwen2.5-Coder-3B를 기반으로 개조되었으며, Spectrum-to-Signal 프로세스를 통해 2차 훈련을 진행했습니다. 모델은 먼저 쉬운 문제부터 어려운 문제까지 풀며 문제 해결 스펙트럼을 축적한 후, 강화 학습을 통해 올바른 해결 신호를 증폭시킵니다. 훈련 전 과정에서 64K의 넓은 사고 공간을 사용하여 추론 단계의 중단을 방지합니다.

수학과 프로그래밍을 위해, 모델은 한편으로 자신이 맞춘 우수한 단계를 수집하여 자기 증류 모방을 수행하고, 다른 한편으로는 문제 풀이 시 단계별 평가를 도입하여 자기 검증을 진행합니다. 자기 검증 메커니즘은 최종적으로 AIME26 수학 테스트 점수를 94.3에서 97.1로 향상시켰습니다.

연구팀은 보고서에서 '파라미터 압축-커버리지 가설'을 제시하며, 논리적 추론은 고도로 압축 가능한 능력으로 주로 규칙과 오류 수정에 의존하며, 3B 소형 모델로도 최고 수준의 성능을 낼 수 있다고 주장했습니다. 반면, 개방형 도메인 지식은 방대한 파라미터를 통해 암기해야 합니다. 파라미터 규모의 한계로 인해 VibeThinker-3B는 상식적인 개방형 지식의 커버리지 능력에서 대형 모델보다 여전히 약합니다.

팀은 연구 개발 목적이 소형 모델로 대형 모델을 대체하는 것이 아니라, 명확한 검증 메커니즘 하에서 컴팩트 모델의 능력 한계를 탐구하는 것임을 강조했습니다.

举报 오류 신고/제보
오류 신고/제보
제출
새 문고 추가
자신만 보기
공개
저장
문고 선택
새 문고 추가
취소
완료