AI AI
속보
심층
이벤트
Pro
더보기
자금 조달 정보
특집
온체인 생태계
용어
팟캐스트
데이터
OPRR
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
XRP
$2.25
2.07%
DOGE
$0.325
2.23%
USDC
$0.999
3.05%

Qwen3.8-Omni-Flash 출시: 스스로 영상 보고, 도구 호출하고, 완성본 전달

동찰 Beating AI 속보, 알리 치엔원이 네이티브 전모달 모델 Qwen3.8-Omni-Flash를 출시했으며, 텍스트, 이미지, 오디오, 비디오 및 1M 컨텍스트를 지원합니다.


이 세대는 오디오·비디오 Agent 능력이 확실히 강화되었습니다. 모델이 스스로 영상에서 정보를 찾고, 작업을 계획한 뒤 외부 도구를 호출해 편집, 더빙, 렌더링을 완료할 수 있습니다. 공식 측은 장시간 회의 처리, 단편 드라마 번역, 영화 해설, MV 제작, 영상→이미지·텍스트 노트 변환 등의 시나리오를 시연했습니다.


몇 시간짜리 장시간 영상에 대해서도 처음부터 끝까지 전부 처리할 필요가 없습니다. 모델이 먼저 답이 어디 있을지 판단한 뒤, 점진적으로 핵심 구간을 찾아냅니다. OmniVideoBench에서 정확도는 63.4에서 67.8로 올랐고, Token 소모는 145,736에서 79,117로 줄어 45.7% 감소했습니다.


치엔원은 Qwen3.8-Omni-Flash가 30개 평가 항목에서 평균 성적이 Qwen3.5-Omni-Plus보다 26% 이상 향상되었으며, 오디오·비디오 능력은 Gemini 3.8 Flash에 근접하고 오디오 능력은 전반적으로 이를 초과한다고 밝혔습니다. 오디오 입력 비용은 98% 이상, 오디오·비디오 입력은 93% 이상 하락했습니다.


현재 Qwen3.8-Omni-Flash 모델 가중치는 아직 공개되지 않았고 API만 개방되었습니다. 치엔원은 동시에 Qwen-MM-Plugins를 오픈소스로 공개했으며, Claude Code, Codex, Gemini CLI, Qwen Code 등의 Agent에 설치해 이미지, 오디오, 장시간 비디오 처리 및 영상 편집 능력을 보강할 수 있습니다.


또 다른 Qwen-Live Harness는 실시간 스케줄링 계층에 더 가깝습니다. 사용자가 실시간 전모달 모델과 직접 대화하고, 복잡한 작업을 Gemini CLI, Claude Code, Codex 등 백그라운드 Agent에 맡겨 지속적으로 실행할 수 있습니다. 작업 진행 상황을 추적하고, 완료되면 먼저 돌아와 결과를 알려줍니다.

举报 오류 신고/제보
오류 신고/제보
제출
새 문고 추가
자신만 보기
공개
저장
문고 선택
새 문고 추가
취소
완료