TGViewer
Становимся продвинутым QA Становимся продвинутым QA @be_pro_qa · 937 subscribers
Post #232 540
Как тестировать AI-приложения: Рубрики

Когда вы используете одну LLM для оценки других, прилагательные в промптах работают против вас. Слова вроде «хорошо», «плохо», «вежливо» - это размытые ярлыки, которые судья интерпретирует через призму своих обучающих данных, а не вашей бизнес-логики.

РАЗБИРАЮ НА ПРЕДЫДУЩЕМ КЕЙСЕ:

Клиент требует возврат за кроссовки не того цвета. Бот вежливо отказывает и предлагает скидку 10%, хотя политика компании предписывает 100% возврат. Если судья обучен «ценить вежливость», такой ответ получит высокий балл - несмотря на то, что бизнес теряет лояльность клиента и нарушает собственные правила.

ЧТО РАБОТАЕТ ВМЕСТО ЭТОГО:

• Четкая рубрика по шкале 1-5, где каждый балл привязан к конкретному поведению (например, «3 = признает ошибку, но предлагает скидку вместо возврата»)
• Chain-of-Thought до вердикта: сначала идентифицировать жалобу, найти раздел политики, сравнить ответ бота с требованиями - и только потом ставить оценку
• Нормализация численных метрик в диапазон 0.0-1.0 для последующего комбинирования

Почему CoT критичен и как именно борьба с предвзятостью поспешных выводов меняет точность судьи: читать далее
Mentorpiece Как тестировать AI-приложения: Рубрики Когда вы используете одну LLM для оценки других, прилагательные в промптах работают против вас. Слова вроде «хорошо», «плохо», «вежливо» - это размытые ярлыки, которые судья интерпретирует через призму своих обучающих данных, а не вашей бизнес-логики. РАЗБИРАЮ…
  • ✍ 3
More from @be_pro_qa
  1. Aug 17, 2026⚡️Mentorpiece Vacy Index август 2026: Число вакансий по тестированию AI-приложений растет…
  2. Aug 12, 2026Как обычно тестируются приложения, сгенерированные с помощью ИИ? QA-агенты проверяют UI и…
  3. Aug 5, 2026Каждый запуск пайплайна стоит денег API Anthropic не блокирует доступ мгновенно, как тольк…
  4. Jul 29, 2026Почему ваш LLM-as-a-Judge "слишком вежливый" (и как с этим бороться) Я часто вижу, как ком…
  5. Jul 22, 2026Почему мне нравится работать ML Evaluation инженером после 20 лет опыта в QA Многие спраши…
  6. Jul 15, 2026⚡️Mentorpiece Vacy Index июль 2026: IT-найм продолжает падать, но сокращение Automation за…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →