구글은 제미니 플래시 모델 전반에 에이전틱 비디오 이해 기능을 출시했으며, 이는 이전의 정적 처리 방식을 대체하여 필요할 때 비디오 타임라인을 탐색하는 시스템으로 전환되었습니다. 이 변경으로 모델은 고정된 초당 1프레임의 방식으로 전체 타임라인을 일괄 입력하는 대신, 무엇을 볼지, 어떤 프레임 레이트로 볼지, 그리고 어떤 모달리티를 통해 접근할지를 결정할 수 있게 되었습니다.

  • 새로운 접근 방식은 표준 비디오 벤치마크에서 정확도를 최대 7% 향상시키는 동시에 토큰 사용량을 최대 88% 절감하고 비용을 최대 66% 낮춥니다.
  • 에이전틱 이해 기능을 갖춘 Gemini 3.7 Flash는 테스트된 모델 중 비디오 분석 분야에서 정확도 대비 비용 효율성 측면에서 파레토 최적 경계에 위치합니다.
  • 이 기능은 API의 단일 "processing" 필드를 통해 활성화되며, 파일 업로드와 공개 YouTube URL을 모두 지원합니다.
  • 토큰 관리에서는 탐색 추론(사고 토큰)과 로드된 미디어(도구 사용 토큰)를 구분합니다.

이 업데이트를 통해 개발자는 수동으로 처리 루프를 구성하는 데 따른 개발 부담 없이 장편 콘텐츠를 더 효율적으로 다룰 수 있지만, 5분 미만의 클립에 대해서는 정적 처리가 여전히 권장됩니다.