Стартап World Labs представил Atlas — мультимодальную модель мира для создания управляемых 3D-пространств из фото и видео 😳
Архитектуру модели с нуля научили синхронно переваривать текст, статичные кадры и видеоряд. Достаточно скормить алгоритму всего одну фотографию, чтобы получить интерактивную 3D-сцену с возможностью покрутить камеру под любым углом. Все недостающие фрагменты окружения, которые физически не попали в объектив, нейросеть дорисовывает самостоятельно на основе своих представлений о физике реального мира.
Если подсунуть системе несколько изображений, Atlas генерирует до минуты видео в разрешении 1440p с полным контролем траектории виртуальной камеры.
Ранний доступ к генератору карманных вселенных обещают выкатить в ближайшие недели 😋
🥸 godnoTECH - Новости IT
Post #12073
853