TGViewer
Становимся продвинутым QA Становимся продвинутым QA @be_pro_qa · 938 subscribers
Post #227 525
LLM-as-a-Judge (модель-судья) и QA-терминология

Если вы задумываетесь о переходе из QA в инженеры оценки качества ML, стоит начать с изучения основных концепций больших языковых моделей (LLM) и способов оценки их результатов.

Одна из ключевых идей здесь - оценка работы «младшей» модели с помощью «старшей» (вместо или вместе с проверкой человеком). Эту «старшую» модель называют LLM-as-a-Judge. Проще говоря, вы используете более мощную LLM в качестве автоматизированного асессора.

Традиционные ассерты из автотестов здесь не работают по двум причинам:

• Выходные данные недетерминированы, поэтому каждый тест априори будет «мигающим» (flaky).
• Крайне сложно прописать четкие критерии pass/fail, если мы имеем дело, например, с текстовой схожестью (text similarity).

КАК ЭТО ВЫГЛЯДИТ НА ПРАКТИКЕ

Сначала определяется рубрика - строгие критерии оценки («Является ли ответ фактологически верным? Есть ли галлюцинации?»). Это ваша спецификация теста. Далее пишется промпт для «модели-судьи», включающий рубрику, ответ целевой модели и исходный промпт. Судья прогоняет датасет несколько раз (из-за недетерминированности) и возвращает структурированный JSON с оценкой и обоснованием.

В полной версии поста я разобрала, как концепции LLM-as-a-Judge напрямую проецируются на привычную QA-терминологию - от Test Oracle до Acceptance Criteria: читать далее
Mentorpiece LLM-as-a-Judge (модель-судья) и QA-терминология Если вы задумываетесь о переходе из QA в ML-инженеры, стоит начать с изучения основных концепций больших языковых моделей (LLM) и способов оценки их результатов. Одна из ключевых идей здесь - оценка работы «младшей» модели с помощью «старшей» (вместо или…
  • 👍 2
  • ❤ 1
  • 🔥 1
  • 🤝 1
More from @be_pro_qa
  1. Aug 17, 2026⚡️Mentorpiece Vacy Index август 2026: Число вакансий по тестированию AI-приложений растет…
  2. Aug 12, 2026Как обычно тестируются приложения, сгенерированные с помощью ИИ? QA-агенты проверяют UI и…
  3. Aug 5, 2026Каждый запуск пайплайна стоит денег API Anthropic не блокирует доступ мгновенно, как тольк…
  4. Jul 29, 2026Почему ваш LLM-as-a-Judge "слишком вежливый" (и как с этим бороться) Я часто вижу, как ком…
  5. Jul 22, 2026Почему мне нравится работать ML Evaluation инженером после 20 лет опыта в QA Многие спраши…
  6. Jul 15, 2026⚡️Mentorpiece Vacy Index июль 2026: IT-найм продолжает падать, но сокращение Automation за…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →