TGViewer
Становимся продвинутым QA Становимся продвинутым QA @be_pro_qa · 938 subscribers
Post #228 587
Тестовое задание для тестировщика AI-приложений

Ранее меня просили рассказать про subj. Итак, домашнее задание по оценке навыков ML Evaluation Engineer: как оно выглядит и чего ожидают работодатели?

Гипотетический сценарий: приложение медицинских консультаций тонет в пользовательских жалобах, при этом sentiment-модель внутри рапортует о высокой Global Accuracy.

Дано: 1000 отзывов в JSON с ground truth, предсказаниями и confidence scores. Задача - найти «слепые зоны», которые скрывают агрегированные метрики.

Ключевая ошибка большинства кандидатов - воспринимать это как задачу по кодингу. На самом деле, проверяется способность отвечать на вопрос «Ну и что?». Просто посчитать precision/recall недостаточно, нужен структурированный аудит с визуальными доказательствами (calibration curves, confusion matrices) и текстовым объяснением, где именно модель проваливается и почему старые метрики этого не видят.

Разбор по фазам:

• ФАЗА 1 «Детектив»: проверка дисбаланса классов (если позитива в 10 раз больше - Accuracy врет), поиск bias на срезах (медицинский жаргон vs разговорный).

• ФАЗА 2 «Архитектор»: модульный Python-код, решение где применять статистику, а где LLM-as-a-Judge для разбора сарказма и медконтекста, отдельная проверка на «Confidently Incorrect» предсказания - самые высокорисковые ошибки.

• ФАЗА 3 «Стратег»: визуализация + бриф по слепым зонам.

В оригинальной заметке также разобрано, какой именно «гибридный» профиль навыков ждут работодатели и почему ваш GitHub-README важнее самих .py файлов: читать далее
Mentorpiece Тестовое задание для тестировщика AI-приложений Ранее меня просили рассказать про subj. Итак, домашнее задание по оценке навыков ML Evaluation Engineer: как оно выглядит и чего ожидают работодатели? Гипотетический сценарий: приложение медицинских консультаций тонет в пользовательских жалобах, при этом…
  • ✍ 7
More from @be_pro_qa
  1. Aug 17, 2026⚡️Mentorpiece Vacy Index август 2026: Число вакансий по тестированию AI-приложений растет…
  2. Aug 12, 2026Как обычно тестируются приложения, сгенерированные с помощью ИИ? QA-агенты проверяют UI и…
  3. Aug 5, 2026Каждый запуск пайплайна стоит денег API Anthropic не блокирует доступ мгновенно, как тольк…
  4. Jul 29, 2026Почему ваш LLM-as-a-Judge "слишком вежливый" (и как с этим бороться) Я часто вижу, как ком…
  5. Jul 22, 2026Почему мне нравится работать ML Evaluation инженером после 20 лет опыта в QA Многие спраши…
  6. Jul 15, 2026⚡️Mentorpiece Vacy Index июль 2026: IT-найм продолжает падать, но сокращение Automation за…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →