Gemini 에이전틱 비디오 이해: 긴 영상을 최대 88% 적은 토큰으로 읽는 방식

프로필 이미지
gwanhun1
7분 읽기조회 1
공유

두 시간짜리 영상을 AI에게 보여주고 “발표자가 가격 정책을 설명하는 장면을 찾아줘”라고 요청했다고 가정해 보겠습니다.

기존 비디오 이해 모델은 영상을 일정한 간격으로 잘라 수많은 프레임을 컨텍스트에 넣습니다. 질문과 관련 없는 인트로, 쉬는 시간, 반복 장면까지 함께 읽습니다. 반대로 프레임 수를 줄이면 비용은 낮아지지만 찰나의 화면 전환이나 빠른 동작을 놓칠 수 있습니다.

Google이 2026년 9월 1일 공개한 **Gemini 에이전틱 비디오 이해(Agentic Video Understanding)**는 이 선택을 바꾸려는 기능입니다. 모델이 영상 전체를 같은 해상도와 속도로 처리하지 않고, 질문에 필요한 구간을 찾아 자막·음성·프레임을 선택적으로 다시 확인합니다. Google은 자체 평가에서 기존 정적 처리 대비 토큰 사용량을 최대 88%, 분석 비용을 최대 66% 줄이면서 정확도를 최대 7% 높였다고 발표했습니다. [Google 공식 발표](https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemin exec-83d57f20-f898-446a-adf2-229a2e7e4d59.png i/)

핵심은 더 많은 프레임을 보는 것이 아닙니다. 무엇을 다시 볼지 모델이 결정한다는 것입니다.

비디오 AI의 오래된 문제: 1초에 한 장이면 충분한가

Gemini의 기본 정적 처리 방식은 영상을 보통 초당 1프레임(1 FPS)으로 추출해 컨텍스트에 넣습니다. 음성과 시간 정보도 함께 처리하지만, 시각 정보만 보면 1초 사이에 벌어진 사건은 빠질 수 있습니다.

예를 들어 다음 장면은 1 FPS로 놓치기 쉽습니다.

  • 스포츠 영상에서 공이 손을 떠나는 순간
  • 제조 설비에서 짧게 발생한 이상 진동
  • 화면 녹화에서 0.5초 동안 나타난 오류 메시지
  • 편집 영상의 정확한 컷 전환 지점
  • 실험 영상에서 한 번만 발생한 상태 변화

그렇다고 모든 영상을 높은 FPS로 읽으면 프레임 수와 토큰이 급증합니다. Google 문서에 따르면 정적 모드의 영상 1초는 낮은 미디어 해상도에서 약 100토큰, 높은 해상도에서 약 300토큰을 사용할 수 있습니다. 90분 영상이라면 질문 하나를 위해 상당한 양의 시각·음성 정보를 먼저 적재하는 셈입니다. Gemini API 비디오 이해 문서

에이전틱 모드는 영상을 전부 자세히 읽는 대신 탐색 문제로 바꿉니다.

1 2 3 4 5 6 7 8 9 질문 분석 ↓ 자막·음성에서 후보 구간 검색 ↓ 관련 구간의 프레임 확인 ↓ 필요하면 FPS·해상도를 바꿔 재검사 ↓ 근거가 충분하면 답변 생성

사람이 긴 강의 영상을 볼 때 처음부터 끝까지 매초 멈추지 않고, 목차와 자막을 훑은 뒤 중요한 구간을 되감는 것과 비슷합니다.

processing: "agentic" 한 줄이 바꾸는 것

현재 Gemini API 문서에는 Gemini 3.8 Flash, 3.7 Flash, 3.6 Flash, 3.5 Flash Lite가 에이전틱 비디오 처리를 지원하는 모델로 안내돼 있습니다. 출시 발표 당시에는 3.7·3.6·3.5 Flash Lite가 중심이었지만, 이후 공개된 3.8 Flash도 공식 문서의 지원 목록에 포함됐습니다.

Python SDK에서는 비디오 입력에 processing: "agentic"을 추가합니다.

1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 from google import genai client = genai.Client() video = client.files.upload(file="conference-keynote.mp4") interaction = client.interactions.create( model="gemini-3.8-flash", input=[ { "type": "video", "uri": video.uri, "mime_type": video.mime_type, "processing": "agentic", }, { "type": "text", "text": ( "가격 정책이 변경되는 부분을 찾아 " "타임스탬프와 근거를 함께 정리해줘." ), }, ], ) print(interaction.output_text)

구현은 짧지만 실행 방식은 단순한 옵션 변경 이상입니다. 모델 내부에서 영상 구간을 불러오는 도구 호출이 일어나며, 응답의 steps 배열에는 processing_callprocessing_result가 기록될 수 있습니다. 이 항목을 확인하면 실제로 에이전틱 탐색이 사용됐는지 추적할 수 있습니다.

운영 환경에서는 최종 답변만 저장하지 말고 최소한 다음 정보도 기록하는 편이 좋습니다.

  • 모델과 처리 모드
  • 모델이 탐색한 구간 수
  • 입력·추론·도구 사용 토큰
  • 전체 처리 시간과 첫 토큰까지 걸린 시간
  • 답변에 포함된 타임스탬프
  • 사람이 검증한 장면과 실제 일치 여부

최대 88% 절감은 모든 영상에 적용되지 않는다

“토큰을 88% 줄인다”는 문구는 강력하지만, 모든 요청의 고정 할인율은 아닙니다. Google도 최대(up to) 수치로 제시하며 영상 길이, 질문의 범위, 탐색 전략에 따라 실제 사용량이 달라진다고 설명합니다.

긴 영상에서 한두 장면을 찾는 질문은 에이전틱 모드에 유리합니다. 하지만 “영상 전체의 모든 프레임에서 제품 로고가 노출된 시간을 계산해줘”처럼 전 구간을 촘촘히 검사해야 하는 요청은 선택적 탐색의 이점이 작아질 수 있습니다.

또한 에이전틱 모드는 어떤 구간을 볼지 판단하고 도구를 호출하는 시간이 필요합니다. 5분 미만의 짧은 영상이나 지연시간이 중요한 요청에서는 정적 모드가 더 빠를 수 있다고 공식 문서도 안내합니다.

상황우선 검토할 모드
긴 강의에서 특정 주장 찾기Agentic
여러 시간의 CCTV에서 이상 장면 찾기Agentic
빠른 동작을 필요한 구간만 확대 분석Agentic
30초 광고 전체를 빠르게 요약Static
모든 프레임을 동일 기준으로 검사Static
짧은 클립의 응답 지연이 가장 중요Static

정답은 “항상 에이전틱”이 아니라 질문의 희소성에 달려 있습니다. 영상에서 필요한 정보가 드물게 나타날수록 선택적 탐색의 가치가 커집니다.

검색·요약을 넘어 어디에 쓸 수 있을까

가장 쉽게 떠올릴 수 있는 기능은 긴 영상 요약이지만, 에이전틱 탐색의 장점은 요약보다 특정 순간을 찾는 작업에서 더 선명합니다.

고객지원과 교육 영상

수백 개의 사용법 영상에서 사용자가 겪는 오류와 일치하는 장면을 찾고, 해당 구간을 답변과 함께 제공할 수 있습니다. 전체 강의를 요약하는 대신 질문에 필요한 시연만 찾아보는 방식입니다.

영상 편집과 미디어 검색

표정이 바뀌는 순간, 카메라 전환, 특정 대사가 시작되는 프레임처럼 1 FPS 샘플링으로 놓치기 쉬운 경계를 다시 검사할 수 있습니다. 자동 편집 시스템은 “대략 이 구간”이 아니라 실제 컷 후보를 좁히는 데 활용할 수 있습니다.

제조·품질 검사

긴 설비 영상에서 이상 소리나 움직임이 감지된 구간만 높은 FPS로 재분석할 수 있습니다. 다만 실제 안전 판정에는 별도의 센서 데이터와 검증 모델이 필요하며, 범용 Gemini의 답변만으로 설비를 자동 정지시키는 것은 위험합니다.

스포츠와 행동 카운팅

빠르게 반복되는 운동이나 물체의 이동을 모델이 속도를 바꿔 다시 관찰할 수 있습니다. Google은 순간 검색, 이상 탐지, 반복 행동과 물체 계수를 주요 사례로 소개했습니다.

프로덕션에서 먼저 만날 실패 조건

선택적으로 영상을 본다는 것은 모델이 중요한 구간을 처음부터 잘 찾지 못할 가능성도 뜻합니다. 자막이 부정확하거나, 질문과 관련된 사건이 화면에만 잠깐 등장하거나, 배경음 때문에 음성 검색이 실패하면 후보 구간 자체를 놓칠 수 있습니다.

따라서 중요한 영상 분석 시스템에는 다음과 같은 이중 검증이 필요합니다.

  1. 에이전틱 모드로 후보 장면을 찾습니다.
  2. 후보 주변에 앞뒤 여유 시간을 추가합니다.
  3. 해당 구간을 더 높은 FPS의 정적 처리로 다시 검사합니다.
  4. 타임스탬프와 근거 프레임을 결과에 보관합니다.
  5. 안전·금융·의료 판단은 사람이 원본 장면을 확인합니다.

긴 요청은 스트리밍이나 백그라운드 실행을 사용하는 편이 좋습니다. Google 문서에는 복잡한 영상 처리에서 동기 요청이 오래 걸리면 연결이나 인증 시간 초과가 발생할 수 있다는 주의사항도 있습니다.

공개 YouTube URL을 직접 사용할 때는 제한도 확인해야 합니다. 공식 문서상 공개 영상만 처리할 수 있으며 비공개·일부 공개 영상은 지원되지 않습니다. 사내 영상은 파일 업로드나 승인된 저장소 경로를 사용하고, 보존 기간과 접근 권한을 별도로 관리해야 합니다.

비디오 RAG의 구조도 달라질 수 있다

기존 비디오 검색 시스템은 먼저 영상을 일정 구간으로 나누고, 자막과 프레임 임베딩을 저장한 다음, 검색 결과를 멀티모달 모델에 전달하는 방식이 많았습니다.

에이전틱 비디오 이해가 이 파이프라인을 완전히 없애지는 않습니다. 대규모 영상 라이브러리에서는 여전히 메타데이터와 1차 검색 인덱스가 필요합니다. 다만 검색된 영상 안에서 어느 순간을 자세히 볼지 결정하는 2차 탐색을 모델에 맡길 수 있습니다.

1 2 3 4 5 6 7 영상 라이브러리 ↓ 메타데이터·자막 검색 후보 영상 선택 ↓ 에이전틱 구간 탐색 후보 장면 선택 ↓ 고해상도 재검증 근거가 있는 답변

이 구조의 핵심 지표는 단순 정답률만이 아닙니다. 올바른 영상을 찾았는지, 정확한 구간을 열었는지, 최종 답변이 그 장면에 근거하는지를 단계별로 평가해야 합니다.

결론: 비디오를 ‘입력’이 아니라 ‘탐색 공간’으로 본다

Gemini의 에이전틱 비디오 이해가 흥미로운 이유는 토큰 절감 수치만이 아닙니다. 멀티모달 모델이 긴 영상을 한 번에 삼키는 대신, 목적에 따라 움직이며 증거를 찾는 방향을 보여주기 때문입니다.

개발자에게는 새로운 질문이 생깁니다.

모델이 답을 맞혔는가뿐 아니라, 올바른 장면을 찾아봤는가?

긴 영상 분석을 구축하고 있다면 동일한 테스트 세트로 정적 모드와 에이전틱 모드를 비교해 보세요. 정확도, 토큰, 비용, 첫 응답 시간, 타임스탬프 재현율을 함께 측정해야 합니다. 일부 워크로드에서는 최대 절감 수치에 가까운 결과가 나올 수 있고, 다른 워크로드에서는 정적 처리가 더 단순하고 빠를 수 있습니다.

영상 AI의 다음 경쟁은 얼마나 많은 프레임을 컨텍스트에 넣을 수 있는지가 아닐 가능성이 큽니다. 필요한 순간을 얼마나 적게 보고도 정확히 찾을 수 있는가가 더 중요한 기준이 되고 있습니다.

출처

댓글을 작성하려면로그인이 필요합니다.