MiniMax M3 выложили на Hugging Face
MiniMax открыла веса M3 - модели с архитектурой MoE, где общий размер около 428B параметров, но на один токен активируется примерно 23B.
Это важный момент: модель выглядит «огромной» по общему числу параметров, но инференс считается не как у плотной 428B-модели. За счёт разреженной активации работает только часть экспертов, поэтому можно держать высокий запас знаний и возможностей без полного вычислительного удара на каждый токен.
Что интересно:
- веса уже доступны на Hugging Face
- примерно 428B параметров всего
- примерно 23B активных параметров на токен
- используется MiniMax Sparse Attention
- фокус на длинный контекст, агентные сценарии и кодинг
- модель можно изучать, дообучать и запускать вне закрытого API
Веса: https://huggingface.co/MiniMaxAI/MiniMax-M3
MiniMax Sparse Attention:
https://huggingface.co/papers/2606.13392
Post #2810
4.51K

- 👍 17
- 🔥 8
- ❤ 5
- 🥱 2