🙂 Яндекс открыл LLM, обученную с нуля: модель обгоняет решение NVIDIA в коде
Alice AI Foundation LLM обучена на данных Яндекса без инициализации чужими открытыми весами. Претрейн распространяется под лицензией Apache 2.0, что позволяет использовать решение в коммерческих и исследовательских целях, дообучая под свои задачи.
Модель — экспериментальная ступень на пути к единой рассуждающей модели (ЕРМ): на ней Яндекс проверяет архитектурные решения, а сама ЕРМ станет основой агентных возможностей Алисы AI.
🟡 Архитектура
Модель построена на MoE: из 80 млрд параметров в моменте активны только 3 млрд. Она уже прошла основной этап обучения, поэтому её можно использовать как основу для собственных проектов.
🟡 Качество
По данным тестов:
🟢 в написании кода модель обгоняет решение от NVIDIA;
🟢 в олимпиадных задачах по математике делит лидерство с моделью от Alibaba;
🟢 при меньшем размере превосходит DeepSeek в задачах, требующих широких фактических знаний.
С предыдущей моделью компании, Alice AI LLM 235B, новая версия выигрывает в 75% случаев на фактологических вопросах, хотя у той втрое больше параметров и всемеро больше активных. С длинными текстами до 128K токенов модель работает на уровне лидеров рынка, разделяя первенство с DeepSeek.
🟡 Бенчмарки
Чтобы проверять знания, важные именно для русскоязычной аудитории, компания подготовила два собственных набора: WikiWebFacts построен на Википедии, HardMultiQA — на данных запросов пользователей к Алисе AI. Вместе с задачами опубликованы эталонные ответы и протокол оценки.
🟡 Обучение
Во-первых, перестроили работу оптимизатора так, чтобы пересылки данных между видеокартами шли параллельно с вычислениями. Также в архитектуре появился механизм обращения к выходам предыдущих слоев. Чтобы потребление памяти при этом не возросло, поменяли схему хранения и пересчета промежуточных результатов.
Во-вторых, оптимизировали подготовку данных для обучения. Ранее для оценки и отбора массивов использовалась исключительно отдельная ресурсоемкая модель — ее затраты оценивались в 200 тыс. часов работы видеокарт. Для нового решения построили каскад классификаторов. На каждом этапе более сложная и вычислительно затратная модель работает с уменьшающимся количеством документов. Это в десятки раз сократило количество вычислений.
Модель, технические отчёты и бенчмарки доступны на Hugging Face, техрепорт опубликован на Хабре.
@ai_machinelearning_big_data
#news #ai #ml
Post #10982
13.1K

- ❤ 118
- 🤣 116
- 👍 71
- 😁 26
- 👏 16
- 🤩 8
- 🎉 7
- 🔥 6
- 🗿 6
- 🥱 5
- 🤨 4