🤖 Gemini научился понимать видео как агент: динамический анализ вместо статичного просмотра
https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini/
📌 TL;DR
Google DeepMind представила agentic video understanding — новую парадигму работы с видео для моделей Gemini. Вместо статичного анализа с фиксированной частотой кадров, модель теперь действует как агент: сама решает, какие моменты смотреть, с какой скоростью и через какую модальность (кадры, аудио, субтитры). Результат — снижение по объему токенов до 88%, ускорение до 66% по стоимости и рост точности до 7% на бенчмарках.
Функция доступна в Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash‑Lite через Gemini API в Google AI Studio и Gemini Enterprise Agent Platform.
🧠 Проблема: статическое видео — это дорого и неэффективно
Раньше модели обрабатывали видео статически — брали фиксированное количество кадров в секунду (по умолчанию 1 FPS) и пропускали через себя весь поток. Это создавало дилемму:
— Высокий FPS → миллионы токенов, дорого, медленно.
— Низкий FPS → теряются важные детали, особенно в длинных и динамичных видео (от 10 минут до многочасовых записей).
🚀 Решение: агентный подход
Gemini берёт на себя активную, целенаправленную роль:
1) Модель получает запрос (например, "найди момент, где мяч касается сетки").
2) Вместо того чтобы прогнать всё видео, она запускает agentic loop — внутренний цикл, в котором:
— вызывает встроенный инструмент для загрузки нужного фрагмента видео,
— анализирует его (сколько нужно)
— принимает решение, какой кусок посмотреть дальше, с какой частотой и через какую модальность (кадры, звук или текст).
Это как если бы вы дали человеку задание найти конкретный момент в фильме — он бы не пересматривал всё подряд, а пролистывал, перематывал, вслушивался, пока не нашёл нужное.
🛠️ Новые возможности
Agentic video understanding открывает сценарии, которые раньше были слишком дорогими или сложными:
— Субсекундный поиск момента (sub‑second moment retrieval) — находить изменения состояния и границы монтажа, которые легко пропустить при 1 FPS. Идеально для автоматического видеомонтажа.
— Поиск иголки в стоге сена (long‑form needle‑in‑a‑haystack) — отвечать на сложные запросы по многочасовым видео без потребления миллионов токенов.
— Детекция аномалий — пересматривать подозрительные временные окна с более высокой частотой кадров, чтобы разглядеть быстрые движения и тонкие артефакты.
— Подсчёт действий и объектов — точно отслеживать повторяющиеся физические движения и объекты во времени.
😉 Так получилось, что мы тоже занимались похожей задачей. И на конференции AI RnD Day 17 сентября наш сотрудник Никита Сидоров расскажет, какие успехи были у нас в этом направлении. Приходите послушать!
#paperwatch #gemini
Post #466
2.14K


- 🔥 14
- ❤ 7
- 👍 4