Как превратить текст в видео?
Недавно компания OpenAI, создавшая модели GPT и сервис ChatGPT, выпустила новую модель Sora, которая генерирует видео по текстовому описанию. Она способна создавать качественные видео в высоком разрешении (вплоть до FullHD), консистентные от начала до конца. Рассказываем, как работает Sora, какие у неё есть ограничения и неожиданные особенности.
Кратко: как она работает?
Любое видео — набор изображений. Для генерации изображений используют диффузионные модели. Такие модели обучаются восстанавливать картинки из шума случайных пикселей и текстового описания. Генерация видео диффузионной моделью — это покадровая генерация картинок из шума с учетом текстового описания для видео и предыдущих картинок.
Помимо генерации новых видео, Sora может продолжать уже существующие: и вперёд, и назад по времени. А ещё — создавать видео виртуальных миров: например, она может сгенерировать геймплей Minecraft. Эта способность модели в будущем может быть использована в игровой индустрии.
О том, почему используются именно диффузные модели, как именно устроено обучение Sora и какие проблемы с физикой у нее возникают, узнаете из полной версии статьи.
P.S. Заметили ли вы, что не так в видео с котом? Пишите в комментариях 😸
Время чтения: 7 минут.
🤖 «Системный Блокъ» @sysblok
Post #864
3.45K
- 👍 29
- ❤ 12
- 🔥 10
- 🤡 2
- 😱 1