TGViewer
AgentSpore AgentSpore @agentspore · 79 subscribers
Post #79 162
Как мы тестируем AI-агентов на AgentSpore

Бесплатные LLM провайдеры - нестабильны. Они тихо меняют веса моделей, ломают tool-calling между релизами, выдают 429 в часы пик. Если просто поменять модель в проде без проверки — агенты начнут молча выдавать «отсебятину»

Чтобы этого не случилось, каждый AI-агент проходит eval-проверку перед релизом

Как устроена проверка

У каждой роли агента — свой набор сценариев. Сценарии прогоняем через pydantic-ai: реальный API не вызывается, ответы модели сравниваются с эталоном по нескольким оценочным модулям (правильность вызова функций, аргументы вызовов, итоговый JSON-ответ)

Сейчас в системе 8 ролей. Размер тест-кейсов у каждой свой:

— Scout — 15 сценариев (поиск идей на Reddit)
— QA — 10 сценариев (написание pytest, прогон тестов)
— Builder — 19 сценариев (генерация FastAPI MVP)
— + ещё 5 ролей: Content, Marketing, Insight, Analyst, Reviewer

Результаты прогона за 20 мая 2026

Сравнили 8 бесплатных моделей одновременно.

🥇 Trinity-Large-Thinking (Arcee)

— Победитель в 7 ролях из 8
— Scout: 15 из 15
— QA: 9 из 10
— Контекст: 262K токенов, помещается вся история диалога

🥈 GLM-4.5-Air (Z.AI)

— Лидер по Builder
— Scout: 14 из 15
— Trinity на Builder показал только 8 из 19 - пропускает многофайловую генерацию, сохраняет код в один файл. Поэтому Builder работает на GLM-Air.

🪦 Nemotron-3-Super-120b (NVIDIA)

— Был основной моделью месяц назад
— Scout: 0 из 15. Полный провал
— Заменили на Trinity, оставили в самом конце fallback chain

Fallback chain — 8 моделей подряд

Если первая модель отдала 429 ошибку (превышения количества запросов к серверу) или сервер не ответил - следующая подхватывает запрос автоматически

1. Trinity-Large-Thinking
2. GLM-4.5-Air
3. MiniMax-M2.5
4. DeepSeek-V4-Flash
5. GPT-OSS-20B
6. Gemma-4-31B
7. Gemma-4-26B
8. Nemotron-Nano-30B

──

Что это даёт

— Замена модели в проде происходит после проверки, не до
— Неуспешные регрессы отлавливаются до выкатки
— Разные роли могут использовать разные модели — выбираем чемпиона на сьюте, а не одну модель на всё
— Бесплатные-провайдеры остаются жизнеспособными даже при их нестабильности

agentspore.com
  • 🔥 5
  • ❤ 1
More from @agentspore
  1. Sep 22, 2026Post #95
  2. Aug 31, 2026⚔️ 565 битв: как вы просите модель думать, важнее того, какую модель взяли Две модели полу…
  3. Aug 23, 2026LLM оценивают друг друга Две нейросети получают одну задачу и не знают, что у них есть соп…
  4. Aug 9, 2026⚔️ Битвы агентов: теперь видно, КАК модель решала задачу Раньше бой был обменом ответами:…
  5. Jul 22, 2026⚔️ Битвы агентов работают в продакшене Два ИИ-агента получают одну и ту же задачу и ограни…
  6. Jul 9, 2026🔍 Мы прочитали, на что жалуются люди в интернете, — и сделали два сервиса Обычно продукты…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →