Как из одной идеи получились аудиоспектакль и карусель
Для одного хакатона я сделал скилл для ИИ-агентов, который собирает аудиоспектакль из описания сцены: герои, реплики, голоса и звуки вокруг. Позже из этой идеи вырос ActVoice - инструмент для создания аудиоспектаклей через ИИ-агентов.
А потом мне попалось задание «Города возможностей»: написать пост о мечте и подготовить изображения. Я решил добавить к тексту и картинкам ещё аудиосцену.
В сюжете я работаю с ноутбуком у ручья. Поют птицы, потом подходит жена, мы идём к воде, плывём к островку и отдыхаем. Для меня это и есть хорошая мечта: работа над проектом, технологии и обычная жизнь рядом.
Сюжет я передал агенту, тот подготовил запрос для ActVoice и собрал аудио. С первого раза звук купания получился как шумный бассейн с детскими криками. Заменил его. Новый вариант тоже не идеальный, но остальное - ручей, птицы, шаги и разговоры - сложилось в небольшую сцену, а не в обычную озвучку текста.
С изображениями пришлось повозиться отдельно. Мне было важно, чтобы на кадрах был именно я. Первые варианты часто меняли лицо, позу или руки. Локальная замена фона тоже не спасла: свет, перспектива и края выдавали монтаж.
Тогда мы с ИИ-агентом попробовали модели, которые работают сразу с несколькими изображениями-образцами. Лучше получилось с Nano Banana Pro edit и частично с GPT Image 2 edit. Со второй серьёзной попытки вышла последовательность кадров: работа у ручья, прогулка, вода, остров и отдых.
В итоге я собрал карусель, аудио и текст в одну историю. В процессе помогали разные инструменты, но первые варианты не становились хорошими сами собой: приходилось менять звук, подход и модели, а неудачные результаты отбрасывать.
Мне интересно развивать ActVoice дальше. Аудиоспектакль может подойти для историй, обучения, презентаций и блогов.
Вы бы стали добавлять короткую аудиосцену к своему посту или проекту?
😎 Незрячий web3 программист (подписаться)
Чат | бот
Post #1709
97