Мы регулярно тестируем и сравниваем модели, которые доступны у нас в плагине.
Тестируем четыре вещи:
1. Надёжность верификации (Pitfalls), UX в длинных сценариях (Pleasantness),
2. Качество работы с инструментами (ToolCalls) и следование требованиям задачи (InstructionCompliance).
3. Финальная метрика EndResult
4. Итог по всем четырём.
По качеству это видно сразу: Pitfalls (надёжность проверки) выросли с 0.41 до 0.53, Pleasantness (комфорт работы) — с 0.48 до 0.69, ToolCalls (работа с инструментами) — с 0.55 до 0.73, EndResult (доля реально закрытых задач) — с 0.55 до 0.67.
Агент стал короче, менее многословным и предсказуемее ведёт себя в длинных сценариях.
Попробуйте сами и сравните
GLM 5.1, DeepSeek V3.2 и многие другие популярные модели доступны в Veai прямо сейчас. Можете сравнить их на своих рабочих задачах. Установить Veai
Не забывайте подписываться на наши каналы: 🔥RuTube
РБК / Хабр / Дзен / ВК / Макс 🤝

