TGViewer
Synaptic Garden Synaptic Garden @synaptic_garden · 537 subscribers
Post #1338 166
Яндекс выложил в опенсорс AliceAI-Foundation-80B-A3B-Base: базовую модель, обученную с нуля

21 сентября Яндекс опубликовал на Hugging Face веса AliceAI-Foundation-80B-A3B-Base под лицензией Apache 2.0. Компания подчёркивает, что модель обучена со случайной инициализации, без весов сторонних опенсорс-моделей, на собственной архитектуре и собственном корпусе данных. Это именно базовая модель, то есть результат претрейна без пост-обучения и выравнивания. Яндекс позиционирует её как основу для исследований и дообучения, а не как готового ассистента. В репозитории есть пример дообучения через LoRA.

Архитектура

Модель построена на смеси экспертов (MoE): всего 80 млрд параметров, но на каждый токен работают только 3 млрд. В каждом из 48 слоёв 512 маршрутизируемых экспертов, из которых выбираются десять, плюс один общий эксперт. Балансировка маршрутизации устроена без вспомогательной функции потерь, по схеме из DeepSeek-V3. Самое интересное здесь в механизме внимания. Он гибридный: на каждые три слоя с линейным вниманием Kimi Delta Attention (KDA) приходится один слой полного внимания с гейтингом. KDA хранит историю в состоянии фиксированного размера вместо растущего KV-кэша, поэтому длинный контекст обходится дешевле. Окно контекста составляет 262 144 токена. Обучали оптимизатором Muon. Архитектурные решения Яндекс предварительно проверял на серии отдельных обучений с нуля, по 2 трлн токенов каждое.

Как обучали

По данным статьи на Хабре, модель прошла около 18 трлн токенов в несколько этапов. Основной претрейн занял 17,5 трлн токенов с контекстом 8K. Затем контекст расширяли до 32K и 256K, а в финале на 280 млрд токенов прогнали данные с рассуждениями при контексте 128K. В корпус входят веб, математика, код, длинные документы, рассуждения и траектории взаимодействия агентов с инструментами. Команда делится и наблюдениями. Одних данных с рассуждениями в претрейне не хватает, чтобы у модели появились агентные навыки. Лосс на валидации плохо предсказывает итоговые метрики на бенчмарках. А расширение контекста до 256K дало меньше, чем ожидали.

Результаты

Яндекс сравнивает модель с базовыми версиями Qwen3.5-35B-A3B, GLM-4.5-Air (106B/12B активных), Nemotron-3-Super-120B-A12B и DeepSeek-V4-Flash (284B/13B активных). Все цифры получены самим Яндексом. Сильнее всего модель выглядит на русскоязычных знаниях. На WikiWebFacts у неё 86,5 против 83,2 у DeepSeek-V4-Flash и 62,4 у Qwen3.5. На HardMultiQA 67,9 против 65,4 и 47,2. В экспертных вопросах по праву разрыв ещё больше: 49,6 против 40,5 у DeepSeek. На MATH-500 модель набрала 91,1 при 84,8 у Nemotron и 80,7 у DeepSeek. На LiveCodeBench она фактически вровень с Qwen3.5 и Nemotron (50,5 против 50,4). На англоязычных задачах на знания модель уступает: на TriviaQA у неё 79,0 против 89,8 у Nemotron, а на MMLU-Pro и SuperGPQA она позади Nemotron и DeepSeek. На длинном контексте в LongMemEval 128k лидирует DeepSeek (68,0 против 64,6).

Два новых бенчмарка

Вместе с моделью Яндекс выложил два русскоязычных бенчмарка на фактологию с вопросами, эталонными ответами и протоколом оценки под лицензией CC BY-SA 4.0. WikiWebFacts содержит 1365 вопросов с короткими ответами. Примерно половина вопросов основана на популярных статьях русской Википедии, вторая половина на запросах в Яндекс Поиске, а ответы проверяли эксперты. HardMultiQA включает 670 сложных вопросов, которые эксперты составили по темам пользовательских запросов к Алисе. Там пять форматов: выбор вариантов, открытый ответ, строгие и нестрогие списки, поиск и исправление ошибок. Оба бенчмарка оцениваются по схеме LLM-as-a-judge, судьёй выступает Qwen3.5-35B-A3B. Предусмотрены два режима: few-shot для базовых моделей и инструктивный для выровненных.
  • ❤ 3
More from @synaptic_garden
  1. Sep 22, 2026Источник: OpenAI
  2. Sep 22, 2026OpenAI выпустила GPT-6 Sol и GPT-6 Luna Ранее в сентябре OpenAI представила флагманскую GP…
  3. Sep 22, 2026Anthropic выпустила Claude Opus 5.5 Anthropic представила Claude Opus 5.5, первую модель н…
  4. Sep 22, 2026photo post
  5. Sep 22, 2026Xiaomi выпустила семейство MiMo-V2.6 из двух моделей: флагманской MiMo-V2.6-Pro и более де…
  6. Sep 21, 2026SpaceXAI представила Grok 4.7 — флагманскую модель, ориентированную на задачи программиров…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →