Если коротко - от K2 архитектура K3 отличается почти во всём.
🟡Внимание
В K2 все слои (61) работали на одном механизме, MLA. В K3 слоёв 93, и собраны они блоками - 3 слоя KDA и один глобальный MLA, суммарно 69 и 24.
KDA сжимает предыдущий текст в состояние фиксированного размера, поэтому длина диалога перестаёт раздувать кэш.
Явных позиционных меток в модели нет, и она растягивается до миллиона токенов без привычных приёмов вроде перенастройки RoPE.
🟡Residual connections
Обычно слой получает всё накопленное предыдущими слоями одной суммой.
Attention Residuals позволяют каждому слою выбирать, из каких ранних блоков брать информацию. 93 слоя K3 разбиты на 8 блоков по 12.
🟡MoE
Маршрутизируемых экспертов теперь 896 против 384 у K2, на токен активируются 16 вместо 8, общих экспертов стало 2 вместо одного.
Считают они во вдвое более узком латент спэйсе, чем основной, а результат возвращают в общий поток.
Функцию активации SwiGLU заменили на SiTU-GLU, схему балансировки нагрузки - на Quantile Balancing.
Общий профит Moonshot оценивает примерно в 2,5 раза по эффективности масштабирования.
🟡Агентские способности
Тут сыграло роль не столько железо, сколько дообучение. 3 специализации (общие задачи, агенты, код) обучали отдельно, каждую на трёх уровнях ризонинга, а 9 получившихся моделей слили в одну.
Отдельные тренировочные эпизоды доходят до тысяч вызовов инструментов, причём состояние файлов, приложений и виртуальных машин сохраняется между шагами.
🖥Github
@ai_machinelearning_big_data
#AI #ML #LLM #KimiK3 #MoonshotAI
