🔥 Z.ai раскрыла, как GLM-5.3 участвовала в оптимизации собственной inference-инфраструктуры.
Для GLM-5.3-Flash компания развернула serving stack на крупном кластере китайских AI-ускорителей и использовала Infra Agent на базе GLM-5.3 для работы с kernels, bottleneck’ами, операторами и настройкой inference engine.
Стек построен поверх SGLang и использует Encode-Prefill–Decode disaggregation, quantization и аппаратно-зависимые оптимизации.
По данным Z.ai, после серии таких оптимизаций end-to-end производительность выросла примерно в 3 раза относительно исходного baseline на том же железе.
https://z.ai/blog/glm-built-its-inference-infrastructure
Post #3018
2.59K




- ❤ 8
- 👍 5
- 🔥 2