TGViewer
Machinelearning Machinelearning @ai_machinelearning_big_data · 280K subscribers
Post #10982 13.1K
🙂 Яндекс открыл LLM, обученную с нуля: модель обгоняет решение NVIDIA в коде

Alice AI Foundation LLM обучена на данных Яндекса без инициализации чужими открытыми весами. Претрейн распространяется под лицензией Apache 2.0, что позволяет использовать решение в коммерческих и исследовательских целях, дообучая под свои задачи.

Модель — экспериментальная ступень на пути к единой рассуждающей модели (ЕРМ): на ней Яндекс проверяет архитектурные решения, а сама ЕРМ станет основой агентных возможностей Алисы AI.

🟡 Архитектура

Модель построена на MoE: из 80 млрд параметров в моменте активны только 3 млрд. Она уже прошла основной этап обучения, поэтому её можно использовать как основу для собственных проектов.

🟡 Качество

По данным тестов:

🟢 в написании кода модель обгоняет решение от NVIDIA;

🟢 в олимпиадных задачах по математике делит лидерство с моделью от Alibaba;

🟢 при меньшем размере превосходит DeepSeek в задачах, требующих широких фактических знаний.

С предыдущей моделью компании, Alice AI LLM 235B, новая версия выигрывает в 75% случаев на фактологических вопросах, хотя у той втрое больше параметров и всемеро больше активных. С длинными текстами до 128K токенов модель работает на уровне лидеров рынка, разделяя первенство с DeepSeek.

🟡 Бенчмарки

Чтобы проверять знания, важные именно для русскоязычной аудитории, компания подготовила два собственных набора: WikiWebFacts построен на Википедии, HardMultiQA — на данных запросов пользователей к Алисе AI. Вместе с задачами опубликованы эталонные ответы и протокол оценки.

🟡 Обучение

Во-первых, перестроили работу оптимизатора так, чтобы пересылки данных между видеокартами шли параллельно с вычислениями. Также в архитектуре появился механизм обращения к выходам предыдущих слоев. Чтобы потребление памяти при этом не возросло, поменяли схему хранения и пересчета промежуточных результатов.

Во-вторых, оптимизировали подготовку данных для обучения. Ранее для оценки и отбора массивов использовалась исключительно отдельная ресурсоемкая модель — ее затраты оценивались в 200 тыс. часов работы видеокарт. Для нового решения построили каскад классификаторов. На каждом этапе более сложная и вычислительно затратная модель работает с уменьшающимся количеством документов. Это в десятки раз сократило количество вычислений.

Модель, технические отчёты и бенчмарки доступны на Hugging Face, техрепорт опубликован на Хабре.


@ai_machinelearning_big_data

#news #ai #ml
  • ❤ 118
  • 🤣 116
  • 👍 71
  • 😁 26
  • 👏 16
  • 🤩 8
  • 🎉 7
  • 🔥 6
  • 🗿 6
  • 🥱 5
  • 🤨 4
More from @ai_machinelearning_big_data
  1. Sep 22, 2026⚡️OpenAI выпустила GPT-6 Sol и GPT-6 Luna Семейство GPT-6 расширилось сразу двумя новыми м…
  2. Sep 22, 2026🚀 Anthropic представила Claude Opus 5.5 Новая флагманская модель стала сильнее Opus 5, пр…
  3. Sep 22, 2026🌟 Samsone: открытые аудиоязыковые модели для смартфонов Samsung опубликовали Samsone - се…
  4. Sep 22, 2026✔️ США предложили Китаю горячую линию для инцидентов с ИИ Министр финансов США обсудил с в…
  5. Sep 22, 2026Почему одни ИИ-агенты помогают разработчикам экономить время, а другие требуют постоянной…
  6. Sep 22, 2026🌟 Jina AI улучшила DeepSeek-OCR jina-ocr-v1 - 3B модель для разбора документов на английс…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →