TGViewer
Неискусственный интеллект Неискусственный интеллект @anti_agi · 5.4K subscribers
Post #2126 1.37K
Яндекс возвращается в гонку за суверенность (спойлер: никуда и не уходил)

В июле Герман Греф говорил, что единственная полностью отечественная большая языковая модель в России есть у Сбера, а «Яндекс» лишь дообучает китайскую Qwen. В Яндексе слова Грефа опровергали и заявляли, что используют прагматичный для бизнеса подход и берут лучшее из доступного: как опенсорс, так и обученные с нуля собственные модели. Работа над последними, по словам компании, никогда не останавливалась. Как минимум, на их основе всегда работали ИИ-ответы в Поиске.

Вслед за публикацией Alice AI Search Pretrain «Яндекс» представил Alice AI Foundation — ещё одну большую модель компании, обученную с нуля без использования сторонних весов.

В ней 80 млрд параметров, из которых при работе активны 3 млрд. На обучение примерно на 18 трлн токенов ушло около полугода. Параметры модели, код архитектуры и токенизатор опубликованы под Apache 2.0.

Пообщались с руководителем архитектуры претрейна Максимом Абрахамом на полях Practical ML Conf и ознакомились с почти 90-страничным техническим отчётом — документ предоставили специально для @anti_agi. На что обратили внимание:

📍 Модель суверенная, но не изолированная. Дистилляции от Kimi или другой зарубежной модели, по словам Абрахама, не было. Начальные параметры генерировались случайно, а весь цикл обучения прошёл внутри «Яндекса».

При разработке этой модели команда изучала все лучшие доступные подходы. В первых экспериментах команда тестировала архитектуру Qwen3-Next, а затем заменила её собственной архитектурой. В 36 из 48 attention-слоёв используется Kimi Delta Attention, роутинг экспертов основан на подходе DeepSeek-V3, применяются оптимизатор Muon и Attention Residuals.

Уникальной разработчики называют итоговую комбинацию блоков, их собственную реализацию и инженерные оптимизации. Для поддержки модели им пришлось написать отдельный архитектурный код и внести изменения в vLLM.

Рассуждения заложили уже в претрейн. Последние 280 млрд токенов состояли из сложных математических решений, кода, поисковых сессий и взаимодействий с инструментами. Эта стадия подняла результат на AIME по pass@32 на 63,4 п. п., на HMMT — на 72,6 п. п., на Codeforces по pass@8 — на 45,6 п. п.

После одинакового SFT преимущество сохранилось: +3,8 п. п. на HMMT и +6,6 п. п. на Codeforces. Помним, что нынешний релиз — экспериментальная основа для будущей единой рассуждающей модели. А вот будут ли выкладывать её, как какой-нибудь GigaChat 3.5 Reasoning, в компании пока не говорят. «Мы не опенсорсим ради опенсорса. Если в процессе работы над продакшен-моделями у нас появляются полезные для сообщества результаты, мы ими делимся», — говорят в Яндексе.

☁️ Компактность здесь скорее оружие, чем ограничение. У Alice активны 3 млрд параметров против 12 млрд у Nemotron-3-Super и 13 млрд у DeepSeek-V4-Flash. При этом на опубликованных замерах она обходит их на многих задачах по русскоязычным знаниям, математике и коду. По оценке собеседника в крупном облачном провайдере, модель можно разместить на двух Nvidia H100 с квантованием или четырёх H100 в BF16.

Немного смутило окно контекста в 128 тысяч токенов. Разработчики говорят, что модель фактически умеет работать с контекстом до 256-262 тысяч токенов. 128 тысяч — отсечка, на которой сохраняется наилучшее качество.

Факт релиза важен сам по себе. Одна модель означает технологическую монокультуру: ошибки в архитектуре, данных или цепочке разработки одного поставщика становятся проблемой всего рынка. В категории «суверенных» вновь (или по-прежнему) два игрока — и их конкуренция будет влиять уже не только на качество ответов, но и на стоимость внедрения, безопасность и скорость развития российских ИИ-агентов.

@anti_agi
  • ❤ 16
  • 🔥 9
  • 😁 3
  • 🥱 3
More from @anti_agi
  1. Sep 21, 2026Яркая сторона ИИ На марафоне «Знание.Первые» в рамках Международного фестиваля молодежи ге…
  2. Sep 21, 2026Отечественные чипы и четырехкратный рост компьюта Министерство промышленности и информатиз…
  3. Sep 21, 2026ИИ-войска🤖 Трамп объявил в Truth Social, что создает AI Force по образцу Space Force и на…
  4. Sep 19, 2026Кажется, вопрос названий решится уже в этот четверг. Как пишут СМИ, на государственном ужи…
  5. Sep 19, 2026Пока мы отдыхаем, уровень дискуссии в Западном полушарии растёт! Мы лично за "крайний" вар…
  6. Sep 18, 2026Сам себе разработчик Пока Дарио Амодеи предлагает лабораториям притормозить, Anthropic впе…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →