TGViewer
Алек, сделай Алек, сделай @alek_dev · 321 subscribers
Post #182 769
Это я в Дагестанском Технологическом Университете рассказываю про последние наши разработки, как ИИ помогает сохранять языки малых народов. И призываю других энтузиастов присоединяться к нам и делиться опытом и экспертизой.

Два месяца назад я писал про платформу для краудсорсинга параллельного языкового корпуса. А в последний месяц мы один за другим проводили эксперименты по созданию Text-to-Speech модели. И тут есть, чем поделиться)

Для того чтобы натренировать такую модель, нужно иметь довольно большой размеченный датасет (аудио+текст). Качество аудио должно быть близко к идеальному. Поэтому обычно созданием таких моделей занимаются корпорации, либо используются открытые датасеты. На русском и английском, например, таких датасетов довольно много. Но чтобы у небольшого народа была проделана такая работа - это большая редкость.

И тут нам очень повезло. В рамках работы над переводчиком мы познакомились с еще одним энтузиастом, основателем PublicDictionary, который горел идеей создания синтеза речи для малых народов. Он организовал и платформу для записи аудио, и разметку, купил качественные микрофоны и нашел людей, кто очень грамотно говорит на лезгинском. Но модель создать пока что не вышло, хотя попытки предпринимались. Мы решили объединить усилия и поэкспериментировать по правилу 20/80. Так у нас на руках оказался уникальный набор данных.

Для базовой модели выбрали VITS, нашли наработки Meta по созданию модели озвучки текста на базе VITS, подсмотрели, как они работают с фонемами, и начали экспериментировать.

Несмотря на довольно небольшой датасет (30 часов аудио), полученная модель получилась в каких-то местах лучше привычных русскоязычных моделей синтеза речи. На видео я как раз рассказываю про один из примеров, как модель с выражением читает стихи. Однако она все еще не идеальна: есть проблемы с проглатыванием звуков в некоторых сценариях. Но в рамках малоресурсного языка модель такого качества выведена впервые. И рад, что аудитория это тоже заметила и оценила - было приятно получить аплодисменты аудитории после демонстрации примеров работы.

Такие модели значительно упрощают работу с контентом: вы могли и сами заметить, как много подобного видео стало появляться в социальных сетях. Буду надеяться, что наши первые шаги в эту сторону помогут наполнить рекомендательные алгоритмы тиктока, инсты и ютуба, и позволят людям не забывать, как звучит их родной язык.
  • ❤ 35
  • ❤‍🔥 15
  • 🔥 14
More from @alek_dev
  1. Sep 3, 2026Post #303
  2. Sep 3, 2026Post #302
  3. Aug 28, 2026Пятничный совет, как коммуницировать в 2026 году Отправляя сгенерированный с ИИ материал (…
  4. Aug 9, 2026ПОСМОТРИТЕ, НАША МОДЕЛЬ НАСТОЛЬКО КРУТАЯ, ЧТО ВЫШЛА ЗА ПРЕДЕЛЫ ПЕСОЧНИЦЫ И ВЗЛОМАЛА ВСЕ ПО…
  5. Jul 4, 20263 обязательных пункта перед внедрением ИИ в бизнес-процессы Последние полгода активно конс…
  6. Jun 25, 2026Особенности работы на AI Wellness продукте #1 Для тестирования гипотез на реальных данных…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →