TGViewer
AI for Devs AI for Devs @ai_for_devs · 17.5K subscribers
Post #279 7.02K
🔥 Подъехали бенчмарки по GLM-5

Z.ai раскрыли детали по новой версии. Коротко по сравнению с GLM-4.7: модель выросла с 355B (32B active) до 744B параметров (40B active), объём предобучения — 28.5T токенов. Добавили DeepSeek Sparse Attention для длинного контекста и собственную RL-инфраструктуру slime для ускорения посттрейна.

По результатам open-source сегмента GLM-5 держится в верхней группе.

Основные бенчмарки:

— SWE-bench Verified: 77.8 (у GLM-4.7 — 73.8)
— Terminal-Bench 2.0 (Terminus 2): 56.2 / 60.7
— BrowseComp с управлением контекстом: 75.9
— Vending Bench 2: $4,432 за год симуляции бизнеса

На Vending Bench 2 это первое место среди open-source моделей. В reasoning-задачах результаты близки к Claude Opus 4.5, местами выше других открытых моделей.

Модель уже выложена с весами под MIT на HuggingFace и доступна через API. Судя по метрикам, ставка сделана на длинные агентные сценарии и инженерные задачи.

@ai_for_devs
  • 🔥 38
  • 👍 14
  • ❤ 9
  • 🤩 3
  • 🤯 2
More from @ai_for_devs
  1. Oct 1, 2026⚡️ Google представили Gemini 4 Argon По заявлениям компании, новая модель обошла флагманы…
  2. Sep 30, 2026⚡️ Anthropic опубликовали лучшую рекламу GLM Помните пост про abliterated-модели, у которы…
  3. Sep 29, 2026⚡️ DevDay 2026 подошел к концу Помимо главных новинок, также показали: • Тариф Pro Max за…
  4. Sep 29, 2026⚡️ OpenAI обновили GPT-6.1 Sol Параллельно с трансляцией всем стала доступна новая версия…
  5. Sep 29, 2026⚡️ OpenAI представили dots [DevDay 2026] Персональный агент на базе Astra, по сути OpenCla…
  6. Sep 29, 2026⚡️ OpenAI DevDay [2026]: 20+ анонсов, новый агент и подписка за $500 Сегодня OpenAI провед…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →