Ролик выше сгенерирован целиком — вместе с героиней и её репликой. Восемь секунд, 167 ₽, ноль монтажа, это сырая выдача.
Метод я вытащил из 16-минутного туториала прошлым скиллом. Суть в одной вещи: ролик описывается посекундно, а не одним сплошным промтом.
0.0-4.0s: [@image1] со спины, обе руки на вентиле, крутит с усилием
4.0-8.0s: [@image1] распрямляется, смотрит в объектив и говорит:
"That should hold her till morning"
[@image1] — это героиня. Сначала скилл рисует её карту образа (первая картинка: четыре ракурса), потом вписывает тегом в сценарий. Без карты камера повернётся — и в профиль окажется другой человек.
Смотри ролик: она крутит вентиль со спины, на четвёртой секунде распрямляется и говорит. С липсинком. Ровно там, где написано.
Зачем эта точность. Сплошной промт даёт кусок, с которым больше ничего не сделаешь. А посекундный — монтируется:
• Не нравится вторая сцена? Переписал описание, оставил те же метки, перегенерил — новый кусок встал на то же место
• Запустил тот же промт трижды — точки склейки совпадут до нескольких кадров. Берёшь лучшую первую сцену из одного дубля, лучшую вторую из другого
• Звук отдельным блоком и между дублями не меняется — дорожку одного дубля кладёшь на видеоряд другого, всё сходится само
Клеить разные генерации между собой нельзя — швы видны, у каждой свой характер света и движения.
Черновик гоняй в 480p (вдвое дешевле), чистовик в 720p. MIT, забирай:
github.com/Auxlife32/ai-video-studio
