Недавно пекинский стартап Moonshot AI выпустил большую языковую модель Kimi K2, которая достигла SOTA на многих бенчмарках среди LLM своей категории.
🔹 Размер и архитектура
Модель включает 1 триллион параметров, из которых активны только 32 миллиарда, так как используется архитектура Mixture-of-Experts, похожая на DeepSeek V3.
🔹 Отличие от reasoning-моделей
Kimi K2 — не «думающая» модель. В отличие от Qwen 3 или DeepSeek R1, она генерирует ответы без построения цепочек мыслей.
Поэтому на бенчмарках ее сравнивают с традиционными LLM, а на точных задачах, вроде математики, она уступает LRM-моделям.
🔹 Сильные стороны: агентские системы
Kimi K2 демонстрирует продвинутые способности в контексте агентских систем — модель обучалась на симулированных вызовах функций с применением Reinforcement Learning.
Она умеет комбинировать различные инструменты, адаптируя поведение к специфике задачи.
🔹 Контекст и оптимизация
— Контекстное окно: 131 072 токена
— Новый оптимизатор MuonClip, эффективнее AdamW при масштабировании
🔹 Две версии модели:
• Base — для углубленных экспериментов, чтобы путем файнтюнинга создавать модели с новыми свойствами и возможностями
• Instruct — для практических задач
🔹 Развёртывание
В формате fp8 веса модели занимают около 1 ТБ.
Рекомендуется 4bit-квантизация, чтобы развернуть модель на 8 × H100 / A100 в облаке immers.cloud.
Обзор подготовил наш амбассадор Ruslan Dev
🔗 Подключайтесь к immers.cloud, чтобы первыми протестировать Kimi K2, не привязываясь к локальному железу.
Оплата — только за фактическое время, без оверселлинга и очередей.
