Если модель говорит по-русски, это ещё не значит, что вы с ней на одной волне
Каждую нейросеть нужно адаптировать под понимание и общение на конкретном языке. На примере новой открытой нейросети Яндекса Alice AI Foundation, которую обучили с нуля внутри компании, рассказываем, как ИИ прививают знание русского.
Токенизация на русском
LLM читают текст не по словам или буквам, а по токенам — кусочкам текста, из которых складываются промпты, размышления и ответы. Таким фрагментом может быть один символ, целое слово или его часть. Чтобы нейросеть могла нарезать текст на токены, разработчики заранее составляют для неё словарь. Собирают его автоматически: если слово часто встречается в датасете, оно получает собственный токен.
Но если обучающие материалы были, скажем, на английском, то русские слова при обработке будут дробиться на несколько токенов. И вообще один и тот же текст на разных языках превращается в разное количество токенов. Например, в Claude Opus 5 фраза «Это тестовый текст для подсчёта количества токенов на разных языках» на русском занимает 17 токенов, а на английском — всего 13.
Словарь Alice AI Foundation создавали на текстах, где преобладал русский, поэтому она эффективно его токенизирует. Поэтому обработка запросов упрощается — модели требуется меньше токенов, чтобы получить результат. Она начинает читать и генерировать текст быстрее, а на оплату её работы требуется меньше денег. Заодно в контекстное окно помещается больше текста, и нейросеть дольше сохраняет память о начале переписки.
Обучение на русском
Материалы для обучения влияют и на то, насколько хорошо модель понимает пользователя. Смысл запросов часто зависит от страны, поэтому просто перевести английские тексты недостаточно — модель нужно обучать на русских, чтобы она понимала местные реалии и культурный код.
При этом, чтобы модель запомнила факт, его нужно пересказать несколько раз в разных формах. Например, строчку «Пётр I основал Петербург в 1703 году» для обучения превращают в реплику экскурсовода, в запись в духе исторической заметки и в вопрос с ответом.
Тестирование на русском
Результат адаптации под русский язык нужно проверять на специальных тестах, основанных на популярных запросах пользователей. Для Alice AI Foundation в Яндексе разработали собственные тесты на знание истории, права, английского и общих фактов. В последней категории, к примеру, она набрала 86,5 балла против 83,2 китайской DeepSeek-V4-Flash-Base, которая в 3,5 раза больше.
Alice AI Foundation получилась компактной благодаря архитектуре MoE: из 80 млрд параметров для обработки токена задействуются лишь около 3 млрд. Так модель вмещает больше знаний, но требует меньше вычислений — и на многих задачах обходит более крупные открытые нейросети.
Релиз модели заметили и за рубежом, где её включили в число ключевых запусков недели. А подробнее о разработке и обучении Alice AI Foundation можно почитать в техрепорте.
Подписывайтесь 👉 @techno_yandex
Post #5746
2.73K

- 👍 16
- ❤ 10
- 🔥 4
- 👎 1
- 😐 1