Аватары от HeyGen в диалоговых тренажерах
Решил сразу «добить» тему диалоговых тренажеров с ИИ и рассказать про инновационные возможности в обучении от HeyGen.
Эта статья является продолжением прошлой статьи, где я рассказывал про свой опыт разработки диалогового тренажера с ИИ в Articulate Storyline. Лучше начать читать с предыдущей статьи… но это не прямо уж так обязательно.
Наверняка многие слышали про сервис HeyGen (ну или как минимум видели продукт, сделанный в этом сервисе). HeyGen — это сервис, который позволяет создавать и использовать виртуальных аватаров.
Набираешь текст, выбираешь аватара (или создаешь собственного), и аватар озвучивает твой текст. Выглядит весьма реалистично.
В прошлом году ребята выпустили API, позволяющее генерировать аватаров в режиме реального времени. Иными словами, мы передаем в HeyGen текст, который хотим озвучить, а в ответ получаем видео с аватаром, который озвучивает этот текст. И добавляем видео в свой проект (вот тут можно почитать про работу API подробнее).
Получается, что мы можем общаться с ИИ, который отвечает нам как реальный человек, выглядит как реальный человек и звучит как реальный человек, что позволяет сделать диалоговые тренажеры еще более реалистичными.
Важно отметить, что HeyGen умеет только генерировать видео с аватаром, который проговаривает присланный нами текст. Языковой модели в нем нет. Следовательно, чтобы наш диалоговый тренажер работал, нам нужно использовать LLM (большую языковую модель).
Процесс выглядит следующим образом:
1. Мы отправляем слова пользователя и инструкции по их обработке в ИИ.
2. Получаем ответ от ИИ, но не показываем его сразу пользователю, а отправляем в HeyGen.
3. HeyGen присылает нам видео с ответом покупателя — вот его мы уже показываем пользователю.
Таким образом, по факту у нас добавляется один дополнительный шаг с отправкой ответа от ИИ в HeyGen.
Конечно, качество потоковой генерации видео с аватаром несколько ниже, чем при обычной работе с сервисом, но, в любом случае, выглядит это очень интересно.
Что можно отметить из минусов использования этой технологии в обучении? Их по факту три:
1. За генерацию аватаров, естественно, нужно платить.
2. Генерация видео с аватаром требует времени (пусть и небольшого), следовательно, наш «покупатель» будет отвечать с задержкой.
3. Мы отправляем слова, которые нужно проговорить, на сторонний ресурс. ИБ вашей компании может запретить подобный проект.
Как думаете, есть ли у этой технологии будущее в корпоративном обучении?
Какие преимущества и недостатки вы видите в этой технологии?
Post #6
262
- 🔥 7
- 👍 3