Не так давно image-модели научились понимать контекст изображения.
Но оставался вопрос — как дать это же понимание видеогенераторам?
На этот вопрос ответили Kling своей новой моделью — Kling O1.
Сравнить эту модель можно с Nano Banana, но для видео.
То есть она больше не генерирует “кадр → кадр” вслепую, а понимает контекст сцены целиком.
Можно:
Использовать для генерации на основе референсов
Например, закинуть объекты, которые обязательно должны находиться в видео — и модель будет удерживать их через всю сцену, а не “догадываться”, что это было.
Управлять движением камеры и объектами с помощью изображений
Теперь в одной генерации может происходить несколько управляемых действий:
движение камеры, перемещение персонажей — а не просто переход из одного состояния в другое.
Давать модели полное понимание объекта — персонаж, предмет, окружение, эффекты
Вы показываете объект целиком, поэтому модели не нужно придумывать, как он выглядит при повороте, наклоне или выходе из тени.
Загружать видео и менять его теми же способами ⬆️
Можно использовать для пост-продакшена:
объектная замена, стилизация, расширение сцены, восстановление.
И всё это без хромакея и ручного трекинга.
Это уже не набор отдельных инструментов, а единый контекстный video-pipeline внутри модели.
Так я добавил на видео с движением камеры группу спецназа из 4 человек, которая корректно вписалась в окружение.
Исходное видео немного изменилось по цвету, видно как люди взаимодействуют со сценой.
И да, появились артефакты на тексте — но это уже мелкие проблемы, которые легко исправить.
Попробовать здесь
Гайд по использованию