블로그 목록
IT 뉴스 & 트렌드

제미니가 영상을 직접 찾게 만든 새로운 방식 — agentic video understanding 해설

DeepMind가 Gemini 3.7 Flash, 3.6 Flash, 3.5 Flash-Lite에 agentic video understanding을 추가했다. 정적 프레임 처리 대신 모델이 필요한 구간만 동적으로 찾아 분석하는 구조로, 토큰 사용량은 최대 88%, 비용은 66% 줄이고 정확도는 7% 높였다고 공식 발표했다.

2026년 9월 2일 5분 읽기

DeepMind가 영상 이해 방식을 바꿨어요

DeepMind가 2026년 9월 1일 공개한 agentic video understanding은 기존 방식의 고정 프레임 분석과 다르게, 모델이 스스로 중요한 구간을 찾아 처리하는 방식이에요. Gemini 3.7 Flash, 3.6 Flash, 3.5 Flash-Lite에서 사용할 수 있으며, Gemini API의 처리 모드를 agentic으로 바꾸기만 하면 된다.

기존 방식의 문제는 비효율적인 토큰 소비였어요

이전 영상 이해는 기본적으로 초당 1프레임을 고정으로 읽는 정적 처리였어요. 긴 영상일수록 불필요한 프레임까지 그대로 적재해 분석 비용이 급증했고, 실제 필요한 순간을 놓치는 경우도 많았어요. 개발자는 결국 프레임을 건너뛰거나 하위 샘플링하는 수동 튜닝을 해야 했어요.

agentic video understanding은 이 문제를 네이티브 영상 도구와 결합한 에이전트 루프로 풀어요. 모델이 먼저 목표를 정하고, 프레임과 오디오, 자막 중 필요한 모달리티를 선택한 뒤 필요한 구간만 불러오는 구조예요.

벤치마크 결과: 비용 66% 감소, 토큰 88% 감소, 정확도 7% 상승

DeepMind는 표준 영상 분석 벤치마크를 기준으로 세 수치를 함께 개선했다고 발표했어요.

  • 토큰 사용량: 최대 88% 감소
  • 분석 비용: 최대 66% 감소
  • 정확도: 최대 7% 상승

이 개선폭은 10분짜리 튜토리얼부터 90분 강의, 심지어 수시간 녹화에 이르는 롱폼 영상에서 두드러졌어요. 정적 처리에서는 고비용과 정보 손실 사이에서 선택해야 했던 문제가, 이번 구조에서는 성능과 효율을 동시에 잡을 수 있게 바뀐 거예요.

실제로 어떤 작업이 바뀌나요

DeepMind는 네 가지 적용 사례를 구체적으로 소개했어요.

  • sub-second moment retrieval: 1초 이내 장면 변화나 컷 경계를 정확히 찾아내 영상 편집 자동화가 가능해졌어요.
  • long-form needle-in-a-haystack search: 수시간 영상에서 특정 질문에 답할 때 필요한 부분만 처리해 수백만 토큰을 낭비하지 않아요.
  • anomaly detection: 이상 구간을 감지한 뒤 더 높은 프레임률로 다시 확인할 수 있어요.
  • counting action & object: 빠른 동작이나 반복되는 사물의 개수를 시간에 따라 정확히 추적해요.

어떻게 시작할 수 있나요

기능은 2026년 9월 1일부터 Gemini API로 사용할 수 있어요. 사용 위치는 Google AI Studio와 Gemini Enterprise Agent Platform 두 곳이에요. 추가 기능 요금은 없고, 기존 토큰 요금만 적용돼요.

활성화 방법은 간단해요. API 요청의 비디오 입력에 "processing": "agentic"을 지정하기만 하면 돼요.

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-3.7-flash",
    input=[
        {
            "type": "video",
            "uri": "https://youtu.be/7Z5Vy9JBANs",
            "processing": "agentic"
        }
    ],
    prompt="이 영상에서 발표자가 강조한 핵심 3가지를 정리해줘."
)

for event in interaction:
    if event.type == "message":
        print(event.content.text)

이 예시는 YouTube 영상에서 키노트 핵심 발표 3가지를 추출하는 요청이에요. 영상 파일을 직접 업로드하든 유튜브 링크를 쓰든 동일하게 동작해요.

출처

#DeepMind#Gemini#agentic video understanding#영상 AI#API
Robeedau

발행 전 운영자가 직접 큐레이션·검수·편집합니다.