У крымскотатарского не было ни одного датасета. От слова совсем. А спустя несколько месяцев на одной домашней видеокарте уже пахали распознавание речи — рабочее, с WER 0.3463 → 0.1701 — и синтез, который вслух одолел целую книгу: шестнадцать глав, 1 час 58 минут звучания.
Само обучение моделей сожрало считаные часы. Всё остальное время ушло на данные, проверки и выяснение того, какие из собственных замеров врут. Вот про эту вторую часть автор и хочет поговорить — она тащится на любой язык, а первая нет.
Теперь о том, чего в статье не будет. Ни конкретных источников аудио, ни договорённостей с правообладателями, ни точных рецептов пайплайна, ни внутренних скриптов. Зато будут метрики, порядки величин, методология проверки и грабли.
Читать далее
👉 About Python
Post #3097
339

- 👍 1