GLM строит свою инференс-инфраструктуру сама: ранние формы рекурсивного самоулучшения (RSI)
Z.ai опубликовала технический отчет о запуске GLM-5.3-Flash: на кластере из более 100 000 китайских AI-ускорителей всю производственную инфраструктуру инференса подняла не команда инженеров, а Infra Agent под управлением самой GLM-5.3.
Модель адаптировалась к новому железу и вышла в прод за две недели, утраивая сквозной throughput. Через неделю анонимного тестирования на OpenCode и OpenRouter (псевдоним Ox-Alpha) Flash стала самой используемой моделью обеих платформ: 62 трлн токенов за 6 дней.
⚡️ Модель оптимизирует систему, система запускает модель:
Прорыв тут не в силе модели, а в контуре обратной связи.
Команда внедрила принцип плотной (dense) обратной связи, - вместо размытых сигналов вида «точность упала на 20%» агент получает локальные проверяемые факты: сравнение ядер по численной точности, микробенчмарки, трейсы выполнения.
Это позволило агенту самому находить и чинить баги уровня, о котором раньше говорили только сеньоры: численное расхождение в KDA-ядре из-за TF32 (фикс через tf32x3 уже ушел в апстрим Flash Linear Attention) и блокировка Python GIL в DeepEP, тормозившая передачу KV-кэша (разрыв упал с 20% до менее 1%).
🔥 Два факта, о которых стоит подумать:
• Каждый крупный лабораторный стартап сейчас строит подобные агентские контуры для обучения и инференса своих же моделей.
• При этом ни одна лаборатория по безопасности всерьез не занимается оценкой RSI-рисков, - нет ни стандартов, ни независимых бенчмарков на измерение близости к рекурсивному самоулучшению.
Z.ai пишет: люди по-прежнему задают цели и границы, но прогресс на этой границе не замедлится только потому, что нам этого хочется.
#GLM #инференс #RSI #агенты #Zai
———
@tsingular | Max | YouTube | RuTube | VK | VK Video | Дзен
Post #8547
2.42K

- 🔥 10
- 🤔 2
- 🤩 2
- ⚡ 1