🗡 Сайд проект по сохранению языка - как мы делаем свой переводчик и краудсорсинговую платформу
Недавно Google добавил аварский язык (один из народов Дагестана) в свой переводчик. Это очень важное событие для небольшого народа. В одном из лезгинских чатов (еще один дагестанский народ) поднялось обсуждение - как сделать свой переводчик или попросить корпорации помочь с этим. Но в любом случае для работы с языком начинать нужно со сбора данных.
Как оказалось, на лезгинском языке очень сложно найти языковой корпус. На языке говорит всего 700К человек, а параллельный корпус с переводами почти никогда не собирался.
Мы собрали небольшую группу энтузиастов, соскребли по кусочкам с интернета то, что имелось, и разметили данные. Получилось 13 тысяч строк данных (со всего интернета!), состоящих из пар предложений русский-лезгинский. Это было немного, но хоть что-то.
Далее, дообучили модель NLLB, которая создана специально для языков с небольшим количеством данных. Разместили ее на HF и получили первый в мире лезгинский переводчик, и он уже умеет переводить простые фразы! Да, качество перевода пока оставляет желать лучшего, но это получился отличный Proof-of-Concept.
На этом мы остановиться не могли и начали работу по ручной разметке нужных нам данных. Благодаря первой версии переводчика, получилось заинтересовать массовую аудиторию и уже за первые две недели собрать довольно внушительный по текущим меркам датасет.
Краудсорсинг внезапно оказался очень увлекательной продуктовой задачей. Все решения мы разрабатывали очень быстро, итеративно дорабатывая на основе данных - чистый MVP, как он есть. В следующих постах подробнее раскрою, какие мы решения принимали, и как они влияли на активность в проекте.
Post #179
1.48K
- 🔥 50
- ❤ 13
- 💯 5