✨ Яндекс выкатил свою новую модель и называет ее открытой. Но насколько она реально открытая? Анализируем, что там под капотом.
Alice AI Foundation 80B-A3B-Base — это именно open-weight модель. Яндекс выложил сами веса модели под Apache 2.0, а также код/конфигурацию, токенизатор и описание архитектуры. Это позволяет скачать модель и запустить ее на своей инфраструктуре — без обращения к серверам Яндекса. У модели 80 млрд параметров, из которых на каждом токене активируются 3 млрд.
Но обучающие данные целиком не открыты. Яндекс описывает, что это веб-страницы, код, книги, научные статьи, новости, открытые датасеты, синтетические данные и т. д., но сам полный набор для обучения не опубликован. То есть это открытые веса + открытая техническая документация, но не воспроизводимое с нуля обучение по полностью открытому датасету. Это принципиальная разница между open weights и максимально строгим пониманием open source AI.
Что касается контролируемости Яндексом. После того как вы скачали эти веса, Яндекс уже не может удаленно менять их поведение. Можно самостоятельно дообучать модель, менять системные ограничения и запускать ее вообще без инфраструктуры корпорации.
Более того, это именно базовая pretrain-модель без post-training/alignment — Яндекс прямо рекомендует пользователю самостоятельно проводить дообучение и настройку поведения. Но разработчик сохраняет контроль над исходной версией, будущими релизами, датасетами и методикой обучения.
В этом смысле Alice AI находится примерно в том же классе, что китайские DeepSeek/Qwen и американские Llama. У них тоже могут быть открыты веса, но это не означает открытия всего обучающего массива. Например, DeepSeek V4 публикует веса под MIT и позволяет локальный запуск, а Meta* называет Llama 4 open-weight и также дает возможность скачать модели. При этом Meta* отдельно контролирует лицензию и условия использования.
Поэтому Alice AI Foundation — это не «вся модель Яндекса открыта для всех». Это открытые веса базовой модели, которые можно забрать себе и контролировать локально. Обучающие данные не открыты целиком, а значит воспроизвести модель с нуля независимо от Яндекса нельзя.
И это, кстати, сильно отличается от закрытых американских моделей вроде GPT/Claude: там пользователь получает сервис через API, а не сами веса. У open-weight моделей после скачивания появляется гораздо большая независимость от разработчика. У Llama, DeepSeek и Alice AI эта независимость примерно одного порядка — различаются прежде всего лицензии, состав открытых материалов и степень раскрытия процесса обучения.
Кстати, китайцев обвиняют в дистилляции американских моделей. За счет масштабной дистилляции Китай сэкономил миллиарды долларов на исследованиях, вычислительных мощностях и электроэнергии. Полученные терабайты высококачественных «диалогов» использовались как обучающий датасет для тренировки собственных архитектур (например, линеек Qwen или DeepSeek).
Забавно, что Сбер обвинял Яндекс в копировании китайских моделей. К примеру, YandexGPT 5 Pro при выпуске была инициализирована базовыми весами китайской модели Qwen-2.5-32B-base. Следующая модель Alice AI LLM (вышедшая в конце 2025 г.) точно так же на старте инициализировалась весами Qwen3-235B.
Сам Сбер выбрал другую стратегию. Свой флагман GigaChat 3 Ultra они обучали от случайных весов (с нуля), но скопировали под капот передовую архитектуру другого китайского гиганта — DeepSeek V3 (совпадает количество экспертов, слоев и логика разреженной архитектуры MoE). Так что Таким образом, российская ИИ-индустрия сегодня фундаментально опирается на китайский опенсорс: Яндекс эффективно использует готовые китайские веса, а Сбер — китайскую архитектуру.
* Meta — организация, признанная экстремистской в РФ.
Post #4212
24

- 🔥 1