Греф назвал Алису китайской. Яндекс ответил открытыми весами
Летом Герман Греф заявил, что «Яндекс» фактически дообучает китайский Qwen. И частично был прав: флагманская Alice AI LLM 235B действительно начинала обучение с весов Qwen3-235B. Но дальше «Яндекс» проводил собственный большой цикл обучения, а маленькую YandexGPT 5 Lite вообще обучал со случайных весов.
Теперь компания закрыла этот спор технически. AliceAI-Foundation-80B-A3B-Base обучена с нуля, без чужих стартовых весов, примерно на 18 трлн токенов. Внутри 80 млрд параметров, из которых 3 млрд активны на каждом токене. Веса, код архитектуры и инструменты дообучения выложены на Hugging Face под Apache 2.0 — модель можно скачать, изменить и использовать коммерчески.
При этом «с нуля» не означает, что архитектуру придумали полностью самостоятельно. «Яндекс» использует идеи DeepSeek и Kimi. Сбер делает примерно то же самое: GigaChat 3 Ultra обучен с нуля, но архитектурно опирается на решения DeepSeek.
После релиза Сбер уже ответил, что Alice AI остаётся сравнительно небольшой моделью: 80 млрд параметров против 702 млрд у GigaChat 3 Ultra. Буквально три месяца работы разбили тезис «Яндекс просто дообучает Qwen». Но, как это обычно бывает, спор сместился в другое место — кто умеет самостоятельно обучать действительно сильные модели и насколько они хороши в независимых тестах.
🐊 Матвей про ИИ в MAX
Post #284
8
