Тувинская и якутская клавиатуры добавлены в iOS 27
Для новичков в канале — я основательница стартапа Algebras AI, которая автоматизирует локализацию для игр, UGC-контента, b2c-приложений и тд. А проект был вдохновлен работой по сохранению низкоресурсных языков, включая тувинский язык (мой родной).
Сохранение языков помогает народам продолжать общаться и создавать больше контента уже в цифровом виде, что усиливает его позицию в мире. Многие языки уже мертвы (не осталось ни единого его носителя), и еще больше сейчас под угрозой исчезновения.
А зачем это нужно для цивилизованного мира? У многих народностей есть тысячелетние повествования, сказки, песни и фольклор, которые сохраняют знания о тех временах, и из этих знаний и самой структуры современного языка можно узнать многое о родстве тех или иных культур. То есть фактически сохранение языков помогает восстанавливать историю человечества и дает более глубокие антропологические данные. А зачем нам история и антропология — мы уже понимаем лучше.
Что вообще в себя включает сохранение языка через цифровые системы и ИИ?
1. Анализ состояния языка: какие бумажные или плохо оцифрованные ресурсы уже есть (книги, аналоговые сканы, диджитализированные сканы), определение, в каких системах язык не доступен (иногда у языка может даже отсутствовать алфавит в международных системах кодирования). Если их нет, то нужен сбор устных данных.
2. Создание/включение алфавита и главное — клавиатуры в Unicode (опенсорсный международный стандарт для данных (шрифты, инструменты, библиотеки) и программного обеспечения) и другие стандарты: практически все операционные системы, включая iOS, Android, Windows, MacOS, Linux, Chrome, браузеры и другие программы поддерживают эти стандарты и регулярно адаптируются к их обновлениям. Без клавиатур НЕВОЗМОЖНО вообще собрать никакие значные данные. И это сильный боттлнек для сохранения языка.
3. Сбор данных: моноязычные данные - книги, статьи, аудио/видеозаписи и тд. И мультиязычные параллельные данные (словари и просто переводы). Для низкоресурсных языков достаточно около 30-50 тыс параллельных переводов хорошего качества для первых результатов (обучения переводческой модели), и если у языка есть высокоресурсные соседи (например, для тувинского это тюркские языки, включая турецкий, азербайджанский, казахский, узбекский, кыргызский и т.д.) — то уже от 100 тыс до 1 млн слов параллельных данных могут.
Али, мой со-основатель проекта русско-тувинского ИИ-переводчика, организовывал более десяти лет сбор данных и переводы волонтерами и институтами в Республике Тыва, что стало основой для обучения первой модели. Мы также помогали советом или примером, а иногда и для сбора данных и для других языков постсоветсткого пространства.
4. Обучение моделей: вы можете обучить как шаг 1 переводческую модель на базе открытых весов (NLLB - мы обучили эту модель как первый вариант, TranslateGemma), и уже в будущем нагенерировать больше instruct-данных для обучения своей LLM новому языку. Благодаря данным, собранным под его руководством, тувинский язык был включен сначала в Google Translate и Gemini, и потом в Яндекс Переводчик.
Среди государств в 2026 практически все имеют свой язык и клавиатуру на популярных OS и браузерах. А народы, чьи языки не в первом приоритете, уже не имеют таких привилегий, и приходится своими усилиями добиваться репрезентации языков в системах.
Али смог довести до релиза клавиатуры для тувинского и саха в iOS 27 (и я думаю в MacOS тоже) — что является огромным достижением и возможностью для тувинцев и якутов собирать больше данных для обучения своих моделей. С чем я его поздравляю, и поздравляю наши народы 🙂
Post #10106
133