Яндекс выложил в открытый доступ модель под названием AliceAI-Foundation-80B-A3B-Base под лицензией Apache 2.0 (разрешено коммерческое использование). Компания заявляет, что это не докрутка китайских моделей, все веса обучены с нуля на своем корпусе текстов.
Что значат цифры в названии? 80B означает, что в ней 80 миллиардов параметров, A3B – что для ответа работают 3 миллиарда ("активные параметры", от них зависит цена ответа). По этим показателям модель сопоставима с Claude 3.5 Sonnet и GPT-4o (но это данные неофициальные никем не подтверждены). По замерам самого Яндекса, на русскоязычных вопросах и в математике она впереди модели DeepSeek-V4-Flash-Base.
"Base" в обоих случаях значит, что модель обучили на текстах, но не подготовили к общению, привычный нам чат из Base моделей получают дообучением. Грубо говоря, база – это выпускник, который прочитал всю библиотеку, а дообучение – это стажировка, где его учат работать с клиентами и соблюдать регламент компании. Дообучение делится на 3 основных стрима:
1. Дообучение самим производителем модели до чат-версии. Anthropic, OpenAI, DeepSeek и другие берут свою базу и учат ее отвечать на вопросы, следовать инструкциям, рассуждать, отказывать в опасных просьбах. Это делают на примерах диалогов и с оценками людей, которые говорят, что хорошо, а что плохо.
Этот шаг дает значимый плюс на тестах, а у Яндекса он еще не сделан. Так, флагман DeepSeek V4 Pro (это дообученная версия DeepSeek V4-Base) по тестам шла вровень с Claude Opus 4.6 и GPT-5.4, а это уже совсем другой уровень!
2. Дообучение бизнесом под свои задачи. Компания берёт готовую открытую модель и докручивает её на своих документах, переписках или отраслевой терминологии. Обычно правится малая часть весов, это относительно дешево и быстро. Важно: для "базы" от Яндекса компании придется сначала сделать первый вид дообучения, потом уже второй.
3. Доучивание поверх чужих весов. Прошлую версию Алисы Яндекс не учил с нуля, а взял готовые веса Qwen и продолжил обучение на своих данных. Это тоже дообучение, только на большом объёме и с целью получить свою модель, а не настроить чужую под задачу.
До флагманов OpenAI и Anthropic – Claude Fable 5.1 и GPT-6 Astra – отсюда далеко, но свои веса и свой корпус – вход в открытую лигу, где выкладывают свои базы, а не дообучают чужие. Пока это релиз для ML-команд. Весов 163 гигабайта, чат-версии нет, сроков Яндекс не называет и пишет, что модель "не является готовым решением". Зато у бизнеса, который держит open source у себя, чтобы данные не уходили наружу и юристы с безопасниками были спокойны, появилась отечественная база под дообучение.
Карточка модели: https://huggingface.co/yandex/AliceAI-Foundation-80B-A3B-Base
Post #1156
2.59K
- 🔥 30
- ❤ 7
- 👍 3
- 😁 2
- 😱 1