MiniMax-M3: как модель работает с 1M контекста
👋 MiniMax-M3 — открытая мультимодальная MoE-модель семейства MiniMax, рассчитанная на кодинг, агентные сценарии и инференс с длинным контекстом.
Главная особенность модели — MiniMax Sparse Attention: разреженное внимание, которое помогает обрабатывать последовательности до 1 048 576 токенов без линейного роста вычислительной стоимости внимания.
Что важно:
▪️ Контекст до 1M токенов
MiniMax-M3 можно рассматривать для задач, где модели нужно удерживать большие объёмы информации: репозитории, длинные документы, технические спецификации, логи, видео и многошаговые цепочки действий.
▪️ MiniMax Sparse Attention
MSA состоит из двух веток. Index Branch сначала оценивает блоки ключей-значений и выбирает релевантные части длинного контекста. Main Branch затем считает точное внимание только по выбранным блокам, а локальный блок ближайшего окружения токена сохраняется всегда.
▪️ Ниже стоимость внимания
При контексте 1 миллион токенов MSA сокращает вычислительные затраты на внимание на один токен в 28,4 раза по сравнению с GQA. Это критично для длинного контекста, где обычное внимание быстро становится дорогим по вычислениям и памяти.
📲 Подробнее — в слайдах.
➡️ MiniMax-M3 доступна через каталог моделей Immers Foundation Models: вы платите не за токены, а за время аренды GPU-сервера. Для запуска доступна конфигурация 4 × NVIDIA H200 от 1 717,59 ₽/ч.
Post #1273
569







- ❤ 3
- 🔥 3
- 👍 1
- 👏 1