Новая Google Omni — похоже это действительно мультимодальный AI
В сеть утекла информация, что на ближайшем ивенте Google I/O в конце мая будет представлена первая по-настоящему мультимодальная модель Google Omni с видеогенерацией. Модель, возможно, заменит или «поглотит» Veo 3.1.
Примеры сгенерированных видео показывают, что модель справляется со сложными задачами, такими как «спагетти Уилла Смита» и написание математических формул.
Модель, похоже, тестили на маленькой выборке юзеров, у которых временно появлялся доступ к этой модели.
Это первая крупная коммерческая модель, которая будет уметь обрабатывать текст, изображения, аудио и видео форматы одновременно в одном векторном пространстве.
Похожим путем пошли в OpenAI при разработке GPT Image 2 — модель не просто генерит картинки, но и «размышляет» под капотом. Однако они остановились на картинках.
Гугловая Omni же будет не просто генерить видео. Она будет «понимать» и размышлять о том, что генерит. Видео и текст будут рождаться в одном «мозге». В отличие от старого подхода с Veo 3.1 и аналогами, где модель для генерации видео — это просто инструмент, куда передается промпт.
P.S. пока что это слухи. Ждём Google I/O 🍕
Заместители
Post #302
2.34K
- 🔥 6
- 👨💻 2