Это первая нативно мультимодальная модель в серии GLM-5: 320B параметров в MoE-архитектуре, из которых на каждый токен активируются только 18B.
MoE – Mixture of Experts, или «смесь экспертов». Вкратце, модель состоит из специализированных блоков, но для каждого токена использует только часть из них. Поэтому у неё 320B параметров всего, а одновременно работают лишь 18B.
По данным Z.ai, GLM 5.3 Flash обходит GLM 5.2 в бенчмарках и реальных задачах, а в coding- и agentic-тестах приближается к Claude Opus 4.8. При этом API модели стоит примерно в 10 раз дешевле GLM 5.3.
До релиза модель тестировали на OpenRouter и OpenCode под названием Ox Alpha, где она быстро вышла в топ по популярности.
Мы уже прогоняем GLM 5.3 Flash на собственном бенчмарке. Скоро покажем результаты.
Кстати, обычная GLM 5.3 тоже доступна в Kodacode.
Установить Koda | Чат поддержки
