동차 Beating AI 속보, 구글이 Gemini API에 Agentic Video Understanding을 출시했습니다. 이 기능은 모델이 어떤 영상을 볼지, 어떻게 확인할지 스스로 결정하게 합니다. 일반 모드는 기본적으로 1 FPS로 고정 프레임을 추출한 뒤 한 번에 컨텍스트에 넣습니다. 새 모드는 시간 축을 따라 스스로 구간을 찾고, 질문에 따라 화면, 오디오 또는 전사 텍스트를 선택합니다. 빠른 동작이 감지되면 프레임 속도를 높여 다시 확인할 수도 있습니다.
구글 자체 테스트에 따르면, Gemini 3.7 Flash에서 이 기능을 활성화하면 토큰 소비가 최대 88% 감소하고, 분석 비용이 최대 66% 절감되며, 정확도는 상대적으로 최대 약 7% 향상됩니다. 1초 미만의 순간도 찾아낼 수 있고, 몇 시간 분량의 영상에서도 세부 사항 하나를 찾아낼 수 있습니다.
기술적으로는 개발자가 이전에 직접 구축해야 했던 '먼저 위치 파악, 그다음 정밀 분석' 프로세스를 Gemini 내부에 통합한 것입니다. 현재 Gemini 3.7 Flash, 3.6 Flash 및 3.5 Flash-Lite에서 모두 지원됩니다. 업로드한 영상과 YouTube 영상 모두 사용할 수 있으며, 별도의 기능 요금도 부과되지 않습니다. 향후에는 Gemini App과 YouTube의 Ask YouTube에도 연동될 예정입니다.
