AI-тренажер с видео-персонажем: стресс-тест гипотезы и честный постмортем
Мне давно нравятся голосовые AI-тренажеры, но для полного погружения всегда хочется добавить визуал: чтобы считывать невербалику собеседника, видеть его эмоции и контекст сцены.
Раньше я пробовал генерировать аватаров в HeyGen в реальном времени, крутил CSS-анимации, а пару месяцев назад собрал демо с «запеченными» видео без звука, накладывая ИИ-озвучку поверх.
Чтобы понять, рабочий ли это подход или просто игрушка, я решил устроить методу стресс-тест на более сложном кейсе — сборке полноценного тренажера по встрече 1-на-1.
Логика геймдева
По сути, архитектура тут ровно такая же, как в видеоиграх: есть библиотека заранее запеченных анимаций (в моем случае — видеоклипов), и контроллер переключает их в зависимости от событий. Только триггером выступают не только действия игрока, но и решения ИИ.
Что вошло в видео-пак:
• Типовые фазы: персонаж говорит, ждет, думает, слушает.
• Эмоциональные состояния: по 3 состояния (от злого до позитивного) на каждую фазу.
• Сценарные действия: редкие, но важные развилки (сотрудник увольняется, или жмет руку и принимает новые правила).
• Разнообразие: по 2–4 вариации на каждое действие, чтобы кадры не зацикливались.
На выходе получилась внушительная куча видеофрагментов.
Что хотелось проверить на практике?
• Ошибки ИИ
Насколько корректно модель подбирает нужные фрагменты и как часто ошибается?
• Трудоемкость
Понятно, что, если вложить в разработку одного тренажера 300 часов – можно добиться значимого результата, но у нас объективно нет 300 часов на разработку одного тренажера.
• UX и иммерсивность
Добавляет ли визуал ценности или вызывает отторжение, как «потоковые» аватары?
Предварительные итоги
1. Может ли ИИшка играть роль «Ирины» и одновременно выбирать подходящие фрагменты видео из библиотеки? Может.
Но!
Самая главная проблема – конфликт стоимости токенов, скорости и качества ответов и времени разработки. Выбрать, скорее всего, получится не больше двух-трех пунктов*.
*в моем примере дешево (используется GPT 4o mini), относительно быстро (нет сложной системы анализа ответа в несколько запросов), и разработано за выходные, но качество подходит только для формата демо.
2. Даже для такого просто диалога нужно больше видео и более качественный монтаж и генерация. С подготовкой промптов и тестированием – в пару недель точно не уложиться.
3. Качество продукта (даже если не обращать внимание на моменты, которые правятся монтажом и закрыть глаза на формат демо) вызывает вопросы.
4. Иммерсивность, мультяшные персонажи и ИИшная озвучка сочетаются плохо (кто бы мог подумать? 😄).
Вердикт
Эксперимент скорее признан неудачным.
Но негативный опыт — тоже опыт.
Зато:
• Реализовал фичу с ноутбуком на стартовом экране, подсмотренную в одной социальной сети (открывается и закрывает при перемещении мыши). Получилось прикольно.
• Воплотил школьную мечту — добавил забавные пасхалки при долгом ожидании. Мне нравится 😊
Есть пару идей, как попытаться реабилитировать подход и частично закрыть узкие места. Возможно, через пару выходных выйдет пост-реванш 🥳
Алексей Миляев и команда сообщества Digital Learning
⭐ Создаёте лучшие продукты для обучения? Обязательно участвуйте в Премии Digital Learning 2026!
Post #6474
567