TGViewer
Ethical Machines Ethical Machines @ethicalmachines · 1.07K subscribers
Post #58 1.16K
Agent-as-a-Judge: возможности и ограничения

Привет! В прошлом посте я упоминала о том, что в роли судьи для оценки качества продуктов можно использовать агентов. Но зачем, если есть LLM?!
Дело в том, что использование LLM-as-a-Judge тут имеет ряд ограничений и проблем:
🟣склонность к предвзятости aka biases (например, предпочитают более длинные ответы)
🟣неспособность анализировать многошаговые и сложные ответы из-за single-pass reasoning
🟣отсутствие проверки достоверности. То есть с помощью LLM оценивается только язык, а не фактическая корректность через внешние источники и инструменты

И как раз для решения этих проблем могут быть использованы системы, в основе которых лежит подход Agent-as-a-Judge. Такие системы хороши тем, что способны поддерживать многоагентное взаимодействие, планирование, интеграцию инструментов, сохранение промежуточных результатов и данных о пользователе, а также оптимизацию оценки.

И сейчас все чаще в различных источниках можно увидеть разделение таких систем на 3 типа:
1️⃣ Процедурные: системы этого типа обеспечивают сложные решения через координированные многоагентные взаимодействия, но остаются ограниченными заранее заданными правилами принятия решений, не адаптируясь к новым сценариям оценки
2️⃣ Реактивные: такие системы могут менять свои действия в процессе работы в зависимости от промежуточных результатов, но сами правила оценки остаются прежними
3️⃣ Автономные: эти системы могут не только адаптировать свои действия, но и самостоятельно менять или улучшать правила оценки, учась на собственном опыте

Конечно, у подхода Agent-as-a-Judge тоже есть свои ограничения, что делает его использование труднодоступным, несмотря на все потенциальные плюсы:
🟣Вычислительные затраты. Учить агента дорого, а вычисления требуют серьезных мощностей
🟣Latency. Из-за большого количества шагов в пайплайне оценки ждать результаты придется долго
🟣Safety. Доступ к внешним системам расширяет поверхность атак
🟣Privacy. Наличие памяти и персонализации увеличивает риск утечки чувствительных данных

Классно, что уже сейчас есть довольно большое множество систем (преимущественно процедурных), которые можно попробовать для задач в своем домене. В статье A Survey on Agent-as-a-Judge можно найти список таких систем с описанием их основного назначения, возможностей и реализации. Картинка, кстати, как раз оттуда. Но сразу отмечу, что большинство этих систем исследовательские, так что готового сервиса для их использования найти не получится. Хотя есть несколько систем, готовых к использованию, например:
🟣Agent-as-a-Judge от Meta (для тех кто любит читать paper-ы, ссылка)
🟣OpenFactCheck (paper)

Несмотря на преобладание процедурных систем сегодня, я уверена, что по мере решения проблем Agent-as-a-Judge будет появляться все больше реактивных и, конечно, автономных систем для оценки качества.

Расскажите, а пробовали ли вы использовать Agent-as-a-Judge для оценки качества работы ваших продуктов?
  • 👍 5
  • 🔥 5
  • ⚡ 2
More from @ethicalmachines
  1. Sep 15, 2026Чувствительные данные: как находить и маскировать Одна из задач guardrails — контролироват…
  2. Aug 12, 2026Креативность × AI Надеюсь, ваше лето проходит так же классно, как внезапные летние каникул…
  3. Jun 3, 2026И делюсь с вами презентацией — думаю, она точно будет полезна тем, кто начинает разбиратьс…
  4. Jun 3, 2026Сегодня у меня день рождения 🙌🏼 Отметила его по-взрослому: провела день на работе с колл…
  5. May 22, 2026AI в каждый японский дом
  6. May 20, 2026AI в Японии Путешествуя по Японии, я начала замечать на улицах баннеры с AI — в метро, маг…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →