Ох, как кучно Китайцы пошли. Сегодня зарелизили - GLM 5.3
База та же, что у 5.2, весь прирост Z.ai выжали чистым пост-трейнингом на длинных агентных задачах. И теперь заявляют сильнейшую открытую модель для кодинга. На Terminal-Bench 3.0 скачок с 4.6 до 28.3, лучше чем Kimi K3 (17.4) и даже Opus 4.8 (21.1), выше только Fable 5 и GPT-5.6. Плюс экономность, на их внутреннем бенче GLM обходит Opus 4.8, тратя в два с лишним раза меньше токенов на задачу.
Самое интересное, у модели неожиданно прокачалась кибербезопасность. Лучший результат на CyberGym (84.5, впереди топов Anthropic и OpenAI), а в полевых тестах с безопасниками она нашла 2436 реальных уязвимостей в 269 опенсорс-проектах. Самый старый баг сидел в коде с 1981 года, в среднем дыры жили по 26 лет до обнаружения.
Post #6575
393

- ❤ 1