AI AI
속보
심층
이벤트
Pro
더보기
자금 조달 정보
특집
온체인 생태계
용어
팟캐스트
데이터
OPRR
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
XRP
$2.25
2.07%
DOGE
$0.325
2.23%
USDC
$0.999
3.05%

<strong>DeepSeek V4</strong> - <strong>Opus 4.6</strong> 성능 대비 최상의 오픈 소스 모델에 관한 모든 세부 정보: 가격 인하, 부문 벤치마킹, 인코딩 기준 랭킹 포화

이 글을 읽으려면 13 분
V4-Pro-Max(최고 추론 강도 모드)는 현재 최강의 오픈 소스 모델로, 인코딩 벤치마크가 최고 수준에 도달하며 추론 및 에이전트 작업은 프로프리트 전선과의 간극이 크게 줄어들었다.

오늘, DeepSeek은 V4 시리즈 미리보기 버전을 오픈 소스로 발표했으며, 모델의 가중치는 이미 Hugging Face와 ModelScope에 동기화되었고 MIT 라이선스를 사용했습니다. 이 시리즈에는 두 가지 MoE 모델이 포함되어 있습니다: V4-Pro (총 매개 변수 1.6T, 각 토큰 활성화 49B/490 억) 및 V4-Flash (총 매개 변수 284B/2840 억, 활성화 13B/130 억)으로, 두 모델 모두 1M 토큰 콘텍스트를 지원합니다.


아키텍처 측면에서 세 가지 주요 업그레이드가 있습니다:


· 혼합 주의 메커니즘은 Compressed Sparse Attention (CSA) 및 Heavy Compressed Attention (HCA)를 포함하며, 장거리 컨텍스트 비용을 크게 줄였습니다. 1M 콘택스트에서, V4-Pro의 단일 토큰 추론 FLOP는 V3.2의 27%이며, KV 캐시 사용량은 V3.2의 10%입니다.


· 매니폴드 제약 초연결 (mHC)은 전통적인 잔여 연결을 대체하여, 교층 신호 전파 안정성을 향상시켰습니다.


· Muon 옵티마이저를 사용한 학습 가속화로, 사전 학습 데이터 양은 총 32T 토큰을 초과합니다.


후속 학습은 두 단계로 이루어집니다: 우선 SFT 및 GRPO를 사용하여 각 도메인 전문가를 강화 학습하고, 그런 다음 온라인 증류를 통해 하나의 모델로 통합됩니다.


성능 평가: V4-Pro-Max가 현재 최강의 오픈 소스 모델이라고 자장합니다


V4-Pro의 최고 추론 강도 모드는 V4-Pro-Max로 불립니다. 공식 기술 레포트에서는 Opus 4.6 Max, GPT-5.4 xHigh, Gemini 3.1 Pro High 및 오픈 소스 Kimi K2.6, GLM-5.1과 비교되었습니다. (Opus 4.7 및 GPT-5.5는 제외되었으며 최종 차이는 제3자 확인을 필요로 합니다).


인코딩 측면에서, V4-Pro-Max는 Codeforces에서 3206 점을 획득하여 GPT-5.4의 3168과 Gemini 3.1 Pro의 3052를 넘어섰으며 이 벤치마크 기록을 갱신했습니다. LiveCodeBench 점수는 93.5로 또 한 번 최고입니다. SWE Verified 점수는 80.6으로 Opus 4.6의 80.8보다 낮으며, 0.2%포인트 낮습니다.


장문 맥락 측면에서, 두 개의 1M 벤치마크는 각각 두 번째로 순위했습니다. CorpusQA 1M의 점수는 62.0이며(Opus 4.6은 71.7), MRCR 1M의 점수는 83.5이며(Opus 4.6은 92.9)。


에이전트 작업 측면에서,MCPAtlas Public의 점수는 73.6으로, Opus 4.6의 73.8에만 못 미칩니다; Terminal-Bench 2.0의 점수는 67.9로, GPT-5.4의 75.1 및 Gemini 3.1 Pro의 68.5에 못 미칩니다.


지식 및 추론 측면에서에는 여전히 명백한 차이가 있습니다: GPQA Diamond 90.1(Gemini 94.3), SimpleQA-Verified 57.9(Gemini 75.6), HLE 37.7(Gemini 44.4)。


오픈 소스 모델인 V4-Pro-Max는 다중 인코딩 및 장문 맥락 벤치마크에서 처음으로 몇몇 클로즈드 소스 플래그십을 따라잡거나 능가했지만, 지식 밀집형 평가에서는 여전히 Gemini 3.1 Pro에 뒤처지고 있습니다.


내부 독후감 데이터와 수학적 추론


DeepSeek는 내부 독후감 데이터를 드물게 공개했습니다. 팀은 50명 이상의 엔지니어로부터 약 200개의 실제 개발 작업을 수집했으며 기능 개발, 버그 수정, 리팩터링 및 진단을 포함하며 기술 스택은 PyTorch, CUDA, Rust, C++를 포함합니다. 엄선된 30개의 작업이 평가 세트로 보존되었습니다.


V4-Pro-Max는 67%의 통과율을 기록했으며, Sonnet 4.5의 47%보다 현저히 높지만, Opus 4.5의 70%에 근접하지만, Opus 4.5 Thinking의 73% 및 Opus 4.6 Thinking의 80% 밑에 있습니다; Haiku 4.5의 통과율은 13%에 불과합니다. N=85의 내부 설문 조사 결과, 모든 응답자가 일상 업무에서 V4-Pro를 사용하여 agentic 코딩을 한다는 것을 보여주며, 52%가 V4-Pro를 기본 주력 코딩 모델로 사용할 수 있다고 생각하고 있으며, 39%가 동의하는 경향을 보이며, 9% 미만이 부정적입니다. 피드백의 주요 문제점은 하위 오류, 모호한 프롬프트에 대한 오해 및 가끔의 지나친 사고가 포함됩니다.


형식 수학 추론 측면에서 Putnam(퍼트남 대회)은 북미 최고 수준의 대학 수학 대회입니다. 실용적 영역(Practical Regime)에서 V4-Flash-Max는 Putnam-200 Pass@8 기준에서 81.00 점을 획들하며 오픈 소스 도구인 LeanExplore 및 제한된 샘플링을 사용했습니다. 대조적으로 Seed-2.0-Prover는 35.50, Gemini 3 Pro 및 Seed-1.5-Prover는 모두 26.50입니다.


전선 영역(Frontier Regime)에서 V4는 혼합형 형식-비형식 추론 방식을 채택하여, 우선 비형식 추론을 이용하여 후보 자연어 해석을 생성하고, 자체 검증 필터링 후 Lean 내 형식적 에이전트에 의해 엄격한 증명을 완료합니다. V4는 Putnam-2025에서 120/120 만점을 받아 Axiom과 공동 1위를 차지했으며, Seed-1.5-Prover의 110/120 및 Aristotle의 100/120을 상회했습니다. 전선 영역은 대규모 계산 확장을 사용하며, 실용적 영역 결과는 보다 일반적인 배포 능력을 반영할 수 있습니다.


API 및 가격: V4-Flash의 가격하락 및 컨텍스트 업그레이드, V4-Pro는 고급 판위


DeepSeek V4 API는 V4-Pro 및 V4-Flash에 동시에 올라갔습니다. 공식 공식넷은 가격 및 파워 플랜을 발표했습니다: V4-Flash는 V3.2(deepseek-chat)를 직접 대체하며, 오히려 가격이 하락했습니다 — 캐시 히트 입력은 변하지 않았으며(백만 토큰 당 0.2 달러), 캐시 미스 입력은 2 달러에서 1 달러로 하락했고(50% 인하), 출력은 3 달러에서 2 달러로 하락했습니다(33% 인하). 컨텍스트는 128K에서 1M으로 확장되었으며, 더 낮은 가격으로 8배의 컨텍스트를 얻는 것과 동일합니다. 구식 모델명 deepseek-chat 및 deepseek-reasoner는 2026년 7월 24일에 비활성화되며, 현재 각각 V4-Flash의 비사고 모드 및 사고 모드를 가리킵니다.


V4-Pro는 새로운 고급 판위입니다: 캐시 히트 입력 1달러, 미스 12달러, 출력 24달러/백만 토큰이며, 출력 가격은 V3.2의 8배입니다. DeepSeek는 가격표 주석에서, 고급 파워에 제한이 있어 현재 Pro의 서비스 처리량이 매우 제한되어 있음을 설명하며, 하반기에 950노드 이상이 일괄 공개되면 Pro의 가격이 크게 인하될 것으로 예상됩니다. 두 모델은 모두 비사고 모드와 사고 모드를 지원하며, 사고 모드는 reasoning_effort 매개변수 설정으로 높음/최대 두 가지 강도를 지원합니다.


DeepSeek은 공지에서 다음과 같이 말했습니다: "지금부터 1M 컨텍스트는 DeepSeek의 모든 공식 서비스의 기본 사양이 될 것입니다."


최초 공개 기반 시설: 프로덕션 급 탄력적 컴퓨팅 샌드박스 DSec


DeepSeek V4 기술 보고서는 세이전트 후 트레이닝 및 대규모 평가를 지원하는 핵심 기반 시설인 프로덕션 급 탄력적 컴퓨팅 샌드박스 DSec(DeepSeek Elastic Compute)을 최초로 공개했습니다.


현재 대규모 모델 강화 학습에는 극도로 거대한 코드 시험 환경이 필요합니다. 보고서에 따르면 실제 생산에서 단일 DSec 클러스터는 동시에 수십만 개의 동시 샌드박스를 스케줄링할 수 있습니다. 시스템은 Rust로 작성되었으며, 자체 개발한 3FS 분산 파일 시스템과 통합되어 계층별 온디맨드 로딩(on-demand loading)을 통해 대규모 샌드박스의 콜드 스타트 성능 병목 현상을 극복했습니다.


개발자 경험 측면에서 DSec은 Python SDK 세트를 사용하여 함수 호출, 컨테이너, 마이크로 VM 및 완전한 가상 머신 네 가지 실행 플랫폼을 통합하여 전환 시 하나의 매개변수 수정만으로 이루어집니다. 계산 리소스 클러스터에서 흔히 발생하는 작업 선점 문제에 대응하기 위해 DSec은 글로벌 추적 로그를 도입했습니다: 작업이 복구될 때 시스템은 이미 캐시된 명령 실행 결과를 직접 "스냅숏"하여 빠른 중지점 이어훈 및 중복 실행으로 인한 비멱듭 에러를 방지합니다.


V4가 "적응 어려움" 가설에 데이터로 응답


DeepSeek V4가 출시되기 전에 커뮤니티에는 V4가 예상보다 늦게 출시된 이유가 모델이 NVIDIA에서 하워 우아에 Ascend 플랫폼으로 이전되는 데 어려움을 겪었기 때문이라는 가설이 널리 퍼졌습니다. V4 기술 보고서는 이 추측에 직접 대답은 하지 않았지만 공개한 성능 데이터는 이를 명백히 부인했습니다.


보고서에 따르면 V4의 세밀한 전문 분할 방안(Fine-Grained EP Scheme)은 이미 NVIDIA GPU 및 하하 플랫폼에서 배포되고 확인되었으며, 일반 추론 부하가 1.50배에서 1.73배 가속되었으며, RL 롤아웃 및 고속 세이전트 서비스와 같은 대기간 민감한 시나리오에서는 최대 1.96배 가속되었습니다. 팀은 CUDA 버전 커널 MegaMoE를 DeepGEMM의 일부로 오픈 소스로 공개했습니다. 다시 말해, V4는 두 세트의 하드웨어에서 거의 이론적 한계에 도달하여 플랫폼 간 적응은 성능 저하를 초래하지 않았습니다.



BlockBeats 공식 커뮤니티에 참여하세요:

Telegram 구독 그룹:https://t.me/theblockbeats

Telegram 토론 그룹:https://t.me/BlockBeats_App

Twitter 공식 계정:https://twitter.com/BlockBeatsAsia

举报 오류 신고/제보
문고 선택
새 문고 추가
취소
완료
새 문고 추가
자신만 보기
공개
저장
오류 신고/제보
제출