동차 Beating AI 속보, DeepSeek가 V4-Flash-Vision-Exp의 첫 번째 Agent 벤치마크 결과를 공개했습니다. 4가지 멀티모달 Agent 평가에서 Opus 4.8과 2승 2패를 기록했습니다: Agents' Last Exam은 27.3 대 25.7, ZeroBench는 35.0 대 34.0; ApexBench는 36.5 대 39.4, Chartography는 64.3 대 65.0입니다.
순수 텍스트 버전 V4-Flash-0731과 비교해, 비전 버전은 ApexBench에서 26.2에서 36.5로, Agents' Last Exam에서 25.2에서 27.3으로 상승했습니다. 다만 이 두 평가에는 이미지가 포함되어 있으며, 공식적으로 V4-Flash가 그중 멀티모달 콘텐츠를 직접 무시한다고 명시했기에, 이는 주로 시각 입력을 추가한 후의 능력을 보여주는 것이지 순수 텍스트 추론이 갑자기 강해진 것은 아닙니다.
시각 기능을 추가한 후에도 텍스트 Agent 능력은 크게 줄어들지 않았습니다. 7가지 텍스트 평가에서 Vision Exp는 6가지 항목이 V4-Flash-0731보다 높았습니다. 예를 들어 DeepSWE는 54.4에서 59.3으로 상승해 Opus 4.8의 58.0을 초과했고, Toolathlon은 75.9로 Opus 4.8의 76.2에 거의 근접했습니다.
주의할 점은 이 결과가 DeepSeek 공식 자체 테스트에서 나온 것이지 제3자 독립 순위가 아니라는 것입니다. DeepSeek 시리즈는 공개 Code Agent 텍스트 작업에서 DeepSeek Harness 미니멀 모드를 사용하며, 추론 단계는 max로 설정되어 있습니다.