TGViewer
Veai - управляемый AI в разработкe Veai - управляемый AI в разработкe @veaicode · 237 subscribers
Post #69 409
GLM 5.1 vs. DeepSeek V3.2: сравниваем топовые китайские модели

Мы регулярно тестируем и сравниваем модели, которые доступны у нас в плагине.
Тестируем четыре вещи:
1. Надёжность верификации (Pitfalls), UX в длинных сценариях (Pleasantness),
2. Качество работы с инструментами (ToolCalls) и следование требованиям задачи (InstructionCompliance).
3. Финальная метрика EndResult
4. Итог по всем четырём.

По качеству это видно сразу: Pitfalls (надёжность проверки) выросли с 0.41 до 0.53, Pleasantness (комфорт работы) — с 0.48 до 0.69, ToolCalls (работа с инструментами) — с 0.55 до 0.73, EndResult (доля реально закрытых задач) — с 0.55 до 0.67.
Агент стал короче, менее многословным и предсказуемее ведёт себя в длинных сценариях.


Попробуйте сами и сравните
GLM 5.1, DeepSeek V3.2 и многие другие популярные модели доступны в Veai прямо сейчас. Можете сравнить их на своих рабочих задачах. Установить Veai

Не забывайте подписываться на наши каналы: 🔥RuTube
РБК / Хабр / Дзен / ВК / Макс 🤝
  • 👍 5
  • 🔥 2
  • 💯 2
  • 👌 1
More from @veaicode
  1. Sep 9, 2026В Veai 5.19 подписка стала общим доступом к моделям для всех этих инструментов. В личном к…
  2. Aug 25, 2026Разработчики в вашей компании уже тратят много токенов. Как проверить реальную пользу ИИ д…
  3. Aug 18, 2026Почему Veai работает с кодом иначе? Ключевая ценность для бизнеса: Veai помогает командам…
  4. Jul 23, 2026Сколько стоит контроль над ИИ-агентом? Считаем экономику #полезное📚 Подготовка спецификац…
  5. Jul 16, 2026🚀 В Veai 5.15 расход агента виден в моменте, а не в конце месяца. Ключевая ценность: конт…
  6. Jul 8, 2026Veai и «Емдев» создают российскую экосистему корпоративного ПО со встроенным управляемым И…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →