Вчера прошла ежегодная конференция Google I/O. Главной звездой стала новая модель Gemini Omni.
Модель, которая принимает на вход всё: текст, картинки, аудио, видео, скетчи и генерирует видео из любой комбинации.
🤩 Ключевые возможности
✅ Модель не просто склеивает картинки, а понимает законы физики: гравитацию, кинетическую энергию, движение жидкостей. На презентации показали, как по промпту «объяснение сворачивания белка» модель сама сгенерировала научное 3D-видео с нуля без готовых шаблонов, с голосовым сопровождением.
✅ Персонаж задаётся один раз и остаётся консистентным в любых сценах и условиях освещения (а это очень круто). Модель запоминает внешность героя, его голос, манеру движения и сохраняет их при смене локаций, стилей и ракурсов. Это ключевое отличие от предыдущих генеративных моделей, которые часто забывали, как выглядел персонаж кадр к кадру.
✅ Редактирование как в разговоре, работает так - увидели, что хотите поменять персонажа, фон или стиль? Просто напишите об этом словами. Можно переснять действие из реального видео, сменить среду, добавить объекты или изменить освещение прямо через промпт, без монтажного софта.
✅ Защита от deepfake. Все видео, созданные с помощью Omni, получают невидимый цифровой водяной знак SynthID, который позволяет отличить ии-контент от реальной съёмки (+ использование цифровых аватаров требует обязательной верификации пользователя).
Также на конференции представили Gemini 3.5 Flash. Команда агентов на его основе в среде Antigravity 2.0 воссоздала исследовательскую работу AlphaZero: они запрограммировали конвейер обучения с подкреплением на JAX/Flax, обучили нейросеть ResNet с нуля через self-play на многоузловых TPU и собрали полноценное веб-приложение, в которое можно играть (и это всего за два промпта).
*Первая модель семейства, Omni Flash, уже доступна в Gemini App, Google Flow и YouTube Shorts, через несколько недель откроют API.
Вайб Working — канал, где простым языком рассказываем как оптимизировать свои рабочие процессы с помощью ai.