Почему ваш LLM-as-a-Judge "слишком вежливый" (и как с этим бороться)
Я часто вижу, как команды внедряют LLM-as-a-Judge и радуются стабильным метрикам 1.0. На деле это не показатель качества системы, а показатель того, что «судья» слишком добрый и апрувит всё подряд, включая грубые нарушения бизнес-логики.
Простой пример: клиент требует возврат за кроссовки не того цвета (ошибка комплектации), а бот вежливо отказывает и предлагает купон на 10%. Политика компании требует полного возврата средств. Бот нарушил ключевое правило - но сделал это учтиво. Обычный LLM-судья с высокой вероятностью поставит такому ответу 5 из 5.
В посте я разобрала три типовых искажения, которые превращают судью в «поддакивателя», и как их нейтрализовать через архитектуру промпта:
• ПЕРСОНА - без жесткой авторитетной роли (например, «старший корпоративный аудитор по комплаенсу») модель скатывается к Central Tendency и ставит безопасные средние баллы.
• ЗАДАЧА - без явной привязки к политике компании срабатывает Sycophancy Bias: эмпатичный ответ автоматически считается «отличным».
• ШАГИ - если просить финальную оценку сразу, включается Precedence Bias, и модель галлюцинирует обоснования под уже выставленную цифру. Спасает строгий Chain-of-Thought с цитатами из политики до вердикта.
Отдельно я рассказала, почему стабильная метрика 1.0 - это красный флаг, и что мы делаем на проекте, когда судью становится слишком легко порадовать: читать далее
Post #243
451
- ✍ 1