AI AI
속보
심층
이벤트
Pro
더보기
자금 조달 정보
특집
온체인 생태계
용어
팟캐스트
데이터
OPRR
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
XRP
$2.25
2.07%
DOGE
$0.325
2.23%
USDC
$0.999
3.05%

DeepSeek가 드디어 멀티모달을 도입할까? 새로운 비전 모델이 공식 Harness에 진입했다

动察 Beating AI 속보, DeepSeek의 새로운 비전 모델 deepseek-v4-flash-vision-exp가 수면 위로 떠오르기 시작했습니다. 커뮤니티에서는 이미 API를 통해 실행에 성공했으며, 직접 이미지를 전송하여 질문할 수 있습니다. 더 직접적인 신호는 DeepSeek Harness가 오늘 이 모델을 기본 모델 디렉토리에 추가하고, 이미지 입력 지원을 명확히 표시했다는 점입니다. 해당 코드 PR의 제목은 바로 「publish the vision model」입니다. 현재 DeepSeek는 아직 공식 발표를 하지 않았으며, 공식 API 문서에도 아직 나타나지 않았습니다.

DeepSeek는 사실 이전부터 이미지 인식이 가능했습니다. 웹과 앱에는 이미 이미지 인식 모드가上线되어 있습니다. 이전에 DeepSeek 비전 팀이 공개한 연구는 V4-Flash를 기반으로 하여, 모델이 점과 경계 상자를 추론 체인에 직접 삽입하여, 마치 이미지를 「가리키면서」 시각 CoT 추론을 완료하는 방식입니다.

이번 발표도 이미 복선이 있었습니다. 이틀 전 DeepSeek Harness RC.8에서 공식 DeepSeek 어댑터에 네이티브 이미지 입력을 방금 보완했습니다. 구현 노트에는 당시 이미 deepseek-v4-flash-vision-exp가 작성되어 있었지만, 일부러 기본 모델 디렉토리에 넣지 않았으며, 이유는 모델 엔드포인트가 준비될 때까지 기다려야 했기 때문입니다.

이틀 후, 이 제한이 공식적으로 해제되었습니다. Harness v0.1.1-rc.1에서는 deepseek-v4-flash-vision-exp를 기본 비전 모델로 지정했습니다. 이전에는 「엔드포인트 준비 대기」 상태였지만, 이제는 공식 모델 목록에 직접 진입하여, 새로운 비전 모델이 곧 출시될 예정입니다.

举报 오류 신고/제보
오류 신고/제보
제출
새 문고 추가
자신만 보기
공개
저장
문고 선택
새 문고 추가
취소
완료