TGViewer
Николай Хлебинский Николай Хлебинский @nikolay_khl · 21.9K subscribers
Post #1156 2.59K
Яндекс выложил в открытый доступ модель под названием AliceAI-Foundation-80B-A3B-Base под лицензией Apache 2.0 (разрешено коммерческое использование). Компания заявляет, что это не докрутка китайских моделей, все веса обучены с нуля на своем корпусе текстов.

Что значат цифры в названии? 80B означает, что в ней 80 миллиардов параметров, A3B – что для ответа работают 3 миллиарда ("активные параметры", от них зависит цена ответа). По этим показателям модель сопоставима с Claude 3.5 Sonnet и GPT-4o (но это данные неофициальные никем не подтверждены). По замерам самого Яндекса, на русскоязычных вопросах и в математике она впереди модели DeepSeek-V4-Flash-Base.

"Base" в обоих случаях значит, что модель обучили на текстах, но не подготовили к общению, привычный нам чат из Base моделей получают дообучением. Грубо говоря, база – это выпускник, который прочитал всю библиотеку, а дообучение – это стажировка, где его учат работать с клиентами и соблюдать регламент компании. Дообучение делится на 3 основных стрима:

1. Дообучение самим производителем модели до чат-версии. Anthropic, OpenAI, DeepSeek и другие берут свою базу и учат ее отвечать на вопросы, следовать инструкциям, рассуждать, отказывать в опасных просьбах. Это делают на примерах диалогов и с оценками людей, которые говорят, что хорошо, а что плохо.

Этот шаг дает значимый плюс на тестах, а у Яндекса он еще не сделан. Так, флагман DeepSeek V4 Pro (это дообученная версия DeepSeek V4-Base) по тестам шла вровень с Claude Opus 4.6 и GPT-5.4, а это уже совсем другой уровень!

2. Дообучение бизнесом под свои задачи. Компания берёт готовую открытую модель и докручивает её на своих документах, переписках или отраслевой терминологии. Обычно правится малая часть весов, это относительно дешево и быстро. Важно: для "базы" от Яндекса компании придется сначала сделать первый вид дообучения, потом уже второй.

3. Доучивание поверх чужих весов. Прошлую версию Алисы Яндекс не учил с нуля, а взял готовые веса Qwen и продолжил обучение на своих данных. Это тоже дообучение, только на большом объёме и с целью получить свою модель, а не настроить чужую под задачу.

До флагманов OpenAI и Anthropic – Claude Fable 5.1 и GPT-6 Astra – отсюда далеко, но свои веса и свой корпус – вход в открытую лигу, где выкладывают свои базы, а не дообучают чужие. Пока это релиз для ML-команд. Весов 163 гигабайта, чат-версии нет, сроков Яндекс не называет и пишет, что модель "не является готовым решением". Зато у бизнеса, который держит open source у себя, чтобы данные не уходили наружу и юристы с безопасниками были спокойны, появилась отечественная база под дообучение.

Карточка модели: https://huggingface.co/yandex/AliceAI-Foundation-80B-A3B-Base
  • 🔥 30
  • ❤ 7
  • 👍 3
  • 😁 2
  • 😱 1
More from @nikolay_khl
  1. Sep 21, 2026А вы знали, что все картины Моне созданы Клодом?
  2. Sep 17, 2026OpenRouter (агрегатор ИИ-моделей для разработчиков) сообщил, что на прошлой неделе его пол…
  3. Sep 15, 2026Протестировал новую GPT-6 Astra. Я в шоке 😨 Просто посмотрите на что она способна: https:…
  4. Sep 10, 2026Что объединяет прошлые два поста про китайского фермера и просьбу для популярных нейронок…
  5. Sep 9, 2026Китайский фермер год с лишним следовал советам ИИ о том, как и когда обрабатывать и удобря…
  6. Sep 5, 2026Если попросить ChatGPT дать случайное число от 1 до 30 – он ответит "17". И все остальные…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →