Новая модель стартапа Odyssey, основанного выходцами из разработки беспилотных автомобилей, по текстовому запросу создаёт интерактивное окружение и в реальном времени просчитывает, как в нём двигаются и взаимодействуют объекты.
Попробовать её можно на сайте компании, вышли две версии, Odyssey-3 с разрешением 832х480 пикселей и Odyssey-3 Pro с разрешением 1280х720.
Модель продолжает видео кадр за кадром с опорой на предыдущие и на ходу принимает команды и запросы, а на каждый фрагмент тратит всего несколько шагов генерации, поэтому успевает отвечать в реальном времени.
По сгенерированному миру можно перемещаться от первого или третьего лица, отдельно управлять камерой и во время генерации добавлять события, на которые сцена реагирует.
Odyssey позиционирует новинку как симулятор для обучения роботов и других физических систем. Поверх неё обучают отдельные декодеры действий и политики управления.
На Physics-IQ Verified, который проверяет, насколько правдоподобно модель продолжает видео с физическими процессами, Odyssey-3 Pro набрала 66,1 балла, это лучший опубликованный результат на этом наборе.
На WorldMark модель заняла первое место в трёх категориях из четырёх, а в генерации реалистичных сцен от первого лица оказалась третьей, уступив Lyra 2.0 и AlayaWorld.
Доступ к API запрашивается через портал для разработчиков, стоимость неизвестна.
@ai_machinelearning_big_data
#news #ai #ml