С начала этого года по инициативе турецкого черкеса Бюлента Оздена идет активная работа по сбору записей черкесской речи на платформе Mozilla Common Voice. На сайте платформы волонтеры читают подготовленные фразы или проверяют записи других людей. Все накопленные голосовые данные регулярно выпускаются Mozilla в виде открытого датасета, который может свободно использовать любой человек или компания для создания голосовых технологий.
Common Voice — крупнейший в мире свободно доступный голосовой датасет, включающий более 32 тыс. часов речи на 133 языках. Эти данные активно используют исследователи, стартапы и крупные компании, такие как NVIDIA, Meta и др., для создания систем распознавания и синтеза речи. Благодаря Common Voice появились голосовые приложения и ассистенты на многих языках мира.
К работе уже присоединилось 250 волонтеров, собрано около 100 часов записей на обоих диалектах. Чем больше людей примет участие и чем разнообразнее будут записанные голоса, тем скорее черкесский язык появится в одном из ближайших официальных релизов датасета.
Больше информации в группе проекта: https://t.me/+ile9fiH1gcUxOGE8
Post #68
1K