TGViewer
ТЕХНО: Яндекс про технологии ТЕХНО: Яндекс про технологии @techno_yandex · 224K subscribers
Post #5746 2.73K
Если модель говорит по-русски, это ещё не значит, что вы с ней на одной волне

Каждую нейросеть нужно адаптировать под понимание и общение на конкретном языке. На примере новой открытой нейросети Яндекса Alice AI Foundation, которую обучили с нуля внутри компании, рассказываем, как ИИ прививают знание русского.

Токенизация на русском

LLM читают текст не по словам или буквам, а по токенам — кусочкам текста, из которых складываются промпты, размышления и ответы. Таким фрагментом может быть один символ, целое слово или его часть. Чтобы нейросеть могла нарезать текст на токены, разработчики заранее составляют для неё словарь. Собирают его автоматически: если слово часто встречается в датасете, оно получает собственный токен. 

Но если обучающие материалы были, скажем, на английском, то русские слова при обработке будут дробиться на несколько токенов. И вообще один и тот же текст на разных языках превращается в разное количество токенов. Например, в Claude Opus 5 фраза «Это тестовый текст для подсчёта количества токенов на разных языках» на русском занимает 17 токенов, а на английском — всего 13.

Словарь Alice AI Foundation создавали на текстах, где преобладал русский, поэтому она эффективно его токенизирует. Поэтому обработка запросов упрощается — модели требуется меньше токенов, чтобы получить результат. Она начинает читать и генерировать текст быстрее, а на оплату её работы требуется меньше денег. Заодно в контекстное окно помещается больше текста, и нейросеть дольше сохраняет память о начале переписки.

Обучение на русском

Материалы для обучения влияют и на то, насколько хорошо модель понимает пользователя. Смысл запросов часто зависит от страны, поэтому просто перевести английские тексты недостаточно — модель нужно обучать на русских, чтобы она понимала местные реалии и культурный код. 

При этом, чтобы модель запомнила факт, его нужно пересказать несколько раз в разных формах. Например, строчку «Пётр I основал Петербург в 1703 году» для обучения превращают в реплику экскурсовода, в запись в духе исторической заметки и в вопрос с ответом. 

Тестирование на русском

Результат адаптации под русский язык нужно проверять на специальных тестах, основанных на популярных запросах пользователей. Для Alice AI Foundation в Яндексе разработали собственные тесты на знание истории, права, английского и общих фактов. В последней категории, к примеру, она набрала 86,5 балла против 83,2 китайской DeepSeek-V4-Flash-Base, которая в 3,5 раза больше.

Alice AI Foundation получилась компактной благодаря архитектуре MoE: из 80 млрд параметров для обработки токена задействуются лишь около 3 млрд. Так модель вмещает больше знаний, но требует меньше вычислений — и на многих задачах обходит более крупные открытые нейросети.

Релиз модели заметили и за рубежом, где её включили в число ключевых запусков недели. А подробнее о разработке и обучении Alice AI Foundation можно почитать в техрепорте.

Подписывайтесь 👉 @techno_yandex
  • 👍 16
  • ❤ 10
  • 🔥 4
  • 👎 1
  • 😐 1
More from @techno_yandex
  1. Oct 1, 2026Яндекс создал ИИ-разработчика. А мы позвали в ТЕХНО того, кто его создал — руководителя пл…
  2. Oct 1, 2026В клавиатуре смартфона до сих пор живут решения инженеров XIX века. Рассказываем, как QWER…
  3. Oct 1, 2026Почти в любом сервисе с персональной лентой рекомендации подбирает цепочка из большого кол…
  4. Sep 30, 2026Вы выбираете температуру — умный климат разбирается с остальным. Рассказываем, как работае…
  5. Sep 30, 2026Ламповый радиоприёмник 1950-х или умная колонка с Алисой? Игорь и Елена Северские решили н…
  6. Sep 30, 2026👀 ИИ научится воспринимать мир как человек? Сначала каждая ИИ-модель работала с одним тип…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →