Архитектура Kapitsa.AI
Чтобы ИИ-двойник Сергея Капицы мог слышать, видеть и отвечать — то есть понять, сформулировать и ответить человеку, нужно построить систему из взаимосвязанных модулей. Сейчас наши разработчики собирают систему воедино. Вот что в нее входит:
Чтобы видеть и слышать собеседника
🤖 Модуль захвата и обработки аудио
ИИ-двойник слышит человека через микрофон. Из этого аудио выделяется речь собеседника с помощью VAD (Voice Activity Detection), чтобы экспортировать ее в модули, отвечающие за преобразование речи в текст, обработку логики и генерации ответа.
🤖 Модуль обработки видео и компьютерного зрения
Веб-камера захватывает изображение, определяет где находятся собеседник, куда он смотрит и с какими эмоциями. Модули OpenCV и Mediapipe отвечают за «зеркальный отклик» 3D-аватара, который должен сохранять зрительный контакт и реагировать на смену эмоций человека.
Чтобы мог отвечать
🤖 Модули обработки речи и логики, генерации ответа (LlaMA 3.1-8B)
🤖 Модуль синхронизации речи с губами (Lipsync) и анимации лица
После обработки речи, сгенерированный ответ в аудиоформате поступает в модуль, отвечающий за синхронизацию движений губ (Lipsync) с речью аватара и мимикой лица — про основной шаблон 3D-аватара (Metahuman) мы рассказывали ранее.
Внешний вид
🤖 Модуль настройки и визуализации 3D-аватара
Создание и отображение 3D-аватара выполняется в среде Unreal Engine, на базе которого все модули интегрируются в итоговый 3D-аватар. В этот модуль можно внести компоненты и модули для кастомизации 3D-окружения и внешнего вида самого аватара, а также модуль процедурной анимации и поведения аватара в трёхмерном окружении, которые подстраиваются в процессе общения с пользователем.
🤖 Модуль создания генеративной маски
🤖 Модуль потоковой передачи рендера в модуль создания генеративной маски и вывод готового ИИ-двойника.
#десятилетиенауки #МинобрнаукиРоссии #популяризациянауки #KapitsaAI
Post #153
224
- 🔥 6
- 👍 1