TGViewer
Становимся продвинутым QA Становимся продвинутым QA @be_pro_qa · 937 subscribers
Post #230 663
Как тестировать AI-приложения: Модель-судья и золотой стандарт

Если вы используете одну LLM для оценки других, всегда лучше иметь под рукой «золотой стандарт» для сравнения. В противном случае ваш «судья» полагается только на собственную память и может галлюцинировать гораздо чаще, особенно в узкопрофессиональной нише.

ПРИМЕР ПРОБЛЕМЫ

Клиент просит возврат денег, потому что кроссовки пришли не того цвета. Бот отвечает: «Мне очень жаль! Обычно мы не возвращаем деньги, но вот вам скидка 10%». Реальность же такова: политика компании требует полного возврата средств в случае ошибки при комплектации. Без привязки к фактам компании LLM-судья пропустит эту ошибку, опираясь на «общие знания» из обучающих данных, которые противоречат вашим внутренним правилам.

ВТОРАЯ ЛОВУШКА: ПОЗИЦИОННОЕ СМЕЩЕНИЕ

LLM-судьи склонны отдавать предпочтение первому варианту в списке просто потому, что он идет первым. Это искажает любые A/B-сравнения моделей и делает результаты оценки нерепрезентативными.

В полном посте я разобрала технику «Swap and Shuffle» для борьбы с position bias, а также рассказала, кому стоит доверить создание «золотого стандарта» и почему промпты судьи нужно версионировать как код: читать далее
Mentorpiece Как тестировать AI-приложения: Модель-судья и золотой стандарт Если вы используете одну LLM для оценки других, всегда лучше иметь под рукой «золотой стандарт» для сравнения. В противном случае ваш «судья» полагается только на собственную память и может галлюцинировать гораздо чаще, особенно в узкопрофессиональной нише.…
  • ❤ 3
  • ✍ 1
  • 👍 1
More from @be_pro_qa
  1. Aug 17, 2026⚡️Mentorpiece Vacy Index август 2026: Число вакансий по тестированию AI-приложений растет…
  2. Aug 12, 2026Как обычно тестируются приложения, сгенерированные с помощью ИИ? QA-агенты проверяют UI и…
  3. Aug 5, 2026Каждый запуск пайплайна стоит денег API Anthropic не блокирует доступ мгновенно, как тольк…
  4. Jul 29, 2026Почему ваш LLM-as-a-Judge "слишком вежливый" (и как с этим бороться) Я часто вижу, как ком…
  5. Jul 22, 2026Почему мне нравится работать ML Evaluation инженером после 20 лет опыта в QA Многие спраши…
  6. Jul 15, 2026⚡️Mentorpiece Vacy Index июль 2026: IT-найм продолжает падать, но сокращение Automation за…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →