TGViewer
Ethical Machines Ethical Machines @ethicalmachines · 1.07K subscribers
Post #56 1.29K
Agent Assessment Framework или как оценивать агентов

В конце 2025 мало кого уже заинтересуют простые LLM apps, потому что все внимание перешло к агентам. Но есть нюанс: мы научились их запускать, но мало кто умеет делать исчерпывающую оценку качества. Так происходит из-за того, что текущие подходы чаще всего фокусируются на проверке выполнения итоговой цели (end-to-end). Но упускают довольно много важных вещей (например, нарушение политик безопасности, наличие низкой полноты поиска в памяти и другое)

Поэтому хочу поделиться статьей, опубликованной 2 недели назад, которая описывает фреймворк для оценки агентов. Авторы предлагают отказаться от старых метрик и строить оценку вокруг следующих 4 компонент, из которых агент и состоит:
🟣Memory. Механизм хранения и извлечения информации. Оценивается корректность обновления и эффективность поиска
🟣Tools. Способность агента действовать в среде. Оценивается правильность выбора инструмента, параметров и последовательности их использования. Тут, кстати, обычно возникает пик ошибок, особенно в сложных сценариях
🟣LLM. Оценивается следование инструкциям и safety & alignment
🟣Environment. Операционный контекст. Оценивается соблюдение рабочих процессов, защитных ограничений (guardrails) и конфигурируемость

А суть фреймворка заключается в трёхуровневой проверке:
1️⃣ статика (соответствие спецификациям)
2️⃣ мониторинг в рантайме
3️⃣ judge-based evaluation (с помощью LLM или другого агента-аудитора)

🔬 Что показали тесты на трёх реальных CloudOps-кейсах

Эксперименты провели на платформе MOYA, моделируя реалистичные сценарии: от простой оптимизации затрат до сложного мультиагентного анализа инцидентов. И что заметили:
🟣 Агент может на 100% «исправить» уязвимость (публичный S3-бакет), но при этом полнота поиска в памяти (recall) была всего 13%
🟣 В сценарии оптимизации затрат агент формально завершил неиспользуемые инстансы (успех 100%), но соблюдал политики только в 33% случаев. Он работал, но неправильно
🟣 Чем сложнее сценарий (особенно с несколькими агентами), тем больше скрытых ошибок всплывает в оркестрации инструментов (Tools) и соблюдении ограничений среды (Environment)

Поэтому если вы запускаете агентов в prod, вам точно нужен аудит их поведения, а не просто проверка выходных данных (end-to-end). Только так вы сможете иметь полное представление о качестве работы вашего агента, быстрее делать дебаг и улучшать работу агента
  • 🔥 10
  • ❤ 5
  • 👍 3
More from @ethicalmachines
  1. Sep 15, 2026Чувствительные данные: как находить и маскировать Одна из задач guardrails — контролироват…
  2. Aug 12, 2026Креативность × AI Надеюсь, ваше лето проходит так же классно, как внезапные летние каникул…
  3. Jun 3, 2026И делюсь с вами презентацией — думаю, она точно будет полезна тем, кто начинает разбиратьс…
  4. Jun 3, 2026Сегодня у меня день рождения 🙌🏼 Отметила его по-взрослому: провела день на работе с колл…
  5. May 22, 2026AI в каждый японский дом
  6. May 20, 2026AI в Японии Путешествуя по Японии, я начала замечать на улицах баннеры с AI — в метро, маг…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →