Как тестировать AI-приложения: Рубрики
Когда вы используете одну LLM для оценки других, прилагательные в промптах работают против вас. Слова вроде «хорошо», «плохо», «вежливо» - это размытые ярлыки, которые судья интерпретирует через призму своих обучающих данных, а не вашей бизнес-логики.
РАЗБИРАЮ НА ПРЕДЫДУЩЕМ КЕЙСЕ:
Клиент требует возврат за кроссовки не того цвета. Бот вежливо отказывает и предлагает скидку 10%, хотя политика компании предписывает 100% возврат. Если судья обучен «ценить вежливость», такой ответ получит высокий балл - несмотря на то, что бизнес теряет лояльность клиента и нарушает собственные правила.
ЧТО РАБОТАЕТ ВМЕСТО ЭТОГО:
• Четкая рубрика по шкале 1-5, где каждый балл привязан к конкретному поведению (например, «3 = признает ошибку, но предлагает скидку вместо возврата»)
• Chain-of-Thought до вердикта: сначала идентифицировать жалобу, найти раздел политики, сравнить ответ бота с требованиями - и только потом ставить оценку
• Нормализация численных метрик в диапазон 0.0-1.0 для последующего комбинирования
Почему CoT критичен и как именно борьба с предвзятостью поспешных выводов меняет точность судьи: читать далее
Post #232
540