Дано: нужно озвучить фильм. Студия озвучивает с косяками. Въедливый клиент в лице меня, который уже два месяца портит менеджеру студии жизнь, выкатывает список из 48 правок на хрон в 72 минуты (могу, умею, практикую, вот такой я отвратительный человечек! Хочу качества за уплаченные деньги!). Сроки настолько поджимают, что у студии нет времени приглашать всех актёров переозвучивать то, что нуждается в полном переозвучании. Студия прибегает к ИИ. И получает список ещё из 15 правок. А сроки финальной сдачи так-то прошли несколько дней назад...
Итак, за чем последить, если нужно применить ИИ на готовом звуке. Взгляд со стороны клиента:
🎙️ совпадение голосов — сделайте voice clone, старайтесь приближать максимально. Иначе переход от человека к ИИ для слушателя звучит как "серпом по цацайкам".
🎙️ паузация — ИИ может её адекватно сделать, но для этого надо возиться с неестественной пунктуацией. Рвать предложение, ставить лишние запятые и тире. Всё возможно, я пробовала. Звучать будет более плавно. Но да, для этого вам прямо надо сесть и
🎙️ артефакты — если что-то режете и переозвучиваете ИИ, то следите, чтобы обрывков слов и щелчков от перехода звука не оставалось. Уверена, что это возможно технически.
🎙️ акцент — а то у меня дядька вещал на AmE, потом вдруг щёлкнул и провещался на классическом таком RP. Вот это я понимаю, шизофазия!
🎙️ задвоения — при замене одного на другое первый вариант надо всё же удалить, а то их остаётся два. Логично же?
🔤 Вот вам смешно, а я с этим всем скоро поседею. Потому что я привыкла видеть ровный слаженный процесс, а не такое.