Так же Google выпустили новый агентный режим обработки видео в Gemini
В этом режиме у модели теперь есть больше свободы выбора и тулов для понимания видео:
- Анализировать одновременно картинку, аудио и транскрипт
- Менять FPS и разрешение
- Переходить к нужному таймкоду и запрашивать отдельные кадры
- Делать транскрипт отдельных участков
- Повторять несколько циклов анализа подряд
Для контекста, раньше Gemini просто заранее семплировал видео целиком, примерно 1 кадр/сек + аудио, и просто читал размеченные таймстемпы
Поэтому новый режим дешевле, быстрее и точнее (гляньте видео)
Сейчас только по API, для моделей Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite.
Позже они хотят еще интегрировать его в Ask YouTube
Да, у Google не самые умные модели, но для агентного понимания видео как будто ничего лучше сейчас не существует ☕️
@tips_ai #news
Post #4872
5.84K
- 👍 21
- 🔥 9
- ❤ 8