Яндекс выложил в опенсорс AliceAI-Foundation-80B-A3B-Base — модель, обученную с нуля.
Архитектура MoE: 80 млрд параметров, но на каждый токен активируется около 3 млрд. Это и есть идея MoE: не гонять всю сеть целиком, а включать только нужные блоки.
Поэтому интересно и сравнение с NVIDIA Nemotron на LiveCodeBench — сопоставимый результат достигается при вчетверо меньшем числе активных параметров. Меньше активных вычислений — ниже стоимость и задержка инференса.
Технический руководитель Google DeepMind Aman Chadha поместил модель на общий ландшафт релизов Google, Z.ai и Xiaomi и описал тренд через capability density — полезные возможности на единицу вычислений, памяти, задержки и стоимости. Если проще: гонка смещается от размера к эффективности, и AliceAI — один из примеров этого сдвига.
Модель открыта под лицензией Apache 2.0
Post #1213
577
- 👍 6
- 😁 3
- 👎 2
- ❤ 1