🎙️ Как я автоматизировал монтаж подкаста с помощью ИИ-агентов
Продолжая тему автоматизаций с ИИ, сегодня поделюсь другим проектом. На этот раз не клиентский (1, 2), а моим личным: монтаж подкаста. То что раньше занимало 6-8 часов ручной работы, теперь сжимается до ~10 минут автоматического прогона + 5 минут ручной правки 👍🔥 Работу скрипта вы можете увидеть в прикреплённом к посту видео☝️
Спросите: "А зачем это карьерно?" ❓ Отвечу: рынок труда меняется так, что любой, кто умеет описать свой workflow и собрать его автоматизацию — обгоняет на голову тех, кто продолжает делать всё руками❗️Подкаст здесь только пример. Та же логика применима в десятках других сценариев.
Что важно в самом начале отметить, так это то, что, садясь за любую автоматизацию, сначала нужно самому по шагам понять, как выглядит процесс, и не искать кнопку у Claude Code "сделай всё красиво"🤌 Работающая автоматизация — это аккуратно собранный алгоритм (скрипт) из трёх типов шагов:
• автоматические (выполняются кодом или ИИ, но лучше кодом 😅);
• ручные (да, не всё реально можно/нужно автоматизировать);
• валидирующие (Human-in-the-loop).
🔧 Как выстроен процесс:
1. Распознавание исходников
Тут автоматически по именам файлов определяются аудио и видео каждого участника подкаста.
2. Синхронизация записей
Так как все записи стартуют в разное время, необходимо определить общий старт. Я определяю его ключевой фразой (например, "Всем привет") ➡️ алгоритм выравнивает по ней все дорожки.
3. Создание недостающих планов и распределение по дорожкам
Автоматически из видео с двумя собеседниками выделяется средний план каждого. Затем все аудио и видео распределяются по своим дорожкам.
4. AI Voice Isolation
В DaVinci, в котором я монтирую, есть функция AI Voice Isolation. Она значительно улучшает звук речи. Однако её можно применить только вручную. Поэтому скрипт останавливается и просит применить эту функцию вручную.
5. Определение монологов
Самая интересная и сложная часть. Тут автоматически определяются интервалы речи каждого собеседника по тембору голоса.
6. Ручная правка интервалов речи (при необходимости)
Тут скрипт останавливается и просит проверить, всё ли верно размечено. Определение интервалов голоса - крайне сложный процесс, так как есть много факторов, повышающих вероятность ошибки.
7. Распределение планов по ходу подкаста
Так как никто не хочет смотреть на статичный план, очень важно менять планы по ходу видео. Поэтому тут автоматически выбираются планы для каждого говорящего.
8. Вставка интро подкаста
В начало Timeline автоматически добавляется заготовленный интро-ролик с заставкой подкаста — нет нужды каждый раз вставлять его вручную (это вот этот кусок).
10. Нарезка интересных моментов как превью к видео
ИИ формирует на основе транскрипта интервью 3-5 самых ярких 15-30 секундных моментов ➡️ я валидирую ➡️ скрипт собирает интро-ролик.
💡 Три инсайта:
1. Не надо пытаться отдавать всю логику процесса на ИИ
Я потратил уйму времени на подходы к "снаряду", когда просил ИИ самому придумать детально процесс, который я описал вам выше (там внутри почти 60 (!) конкретных шагов, которые я сам и валидировал)
2. Ставьте pause-point перед началом серьёзных изменений скриптом
Надёжней дать пользователю 5 минут проверить промежуточные результаты перед дальнейшими серьёзными изменениями (например, разрезы файлов по интервалам речи), чем просить потом откатывать шаги, если всё пойдёт не так.
3. При создании автоматизации валидируй каждый шаг
Я бы мог сэкономить море времени, если бы в самом начале перепроверял каждый шаг после его выполнения. Не будьте, как я 🤦♂️
👨💻 Где такая схема работает не только в подкасте
- Видеоконтент: vlog, интервью
- Корпоративные митинги: запись с Zoom + разбивка по говорящим + конспект
- Образование: лекции с двумя камерами (преподаватель + слайды)
🔥 - Если вам интересны подобные посты
🤔 - Если хотите всё-таки про отборы и карьерный рост
#продвижение_на_работе #хард_скиллы #автоматизация
Post #315
439