TGViewer
Становимся продвинутым QA Становимся продвинутым QA @be_pro_qa · 937 subscribers
Post #229 579
Как тестировать AI-приложения: Determinism vs. Probability

Традиционный QA, даже вооруженный до зубов AI-инструментами, принципиально не отличается от тестирования без них. Вы планируете покрытие, опираясь на классический тест-дизайн: эквивалентное разделение, попарное тестирование и т.п. Вы работаете с установкой, что если ожидаемый результат A + B = C, а на деле A + B != C - это дефект. В этом детерминированном мире почти никогда нет смысла прогонять один и тот же тест дважды.

Однако, если вы AI QA или ML Evaluation инженер, ваше A + B в первом прогоне может быть C, во втором - C + k, а в третьем C - k или даже C + n. Вы живете в мире подброшенных кубиков. По сути, вы измеряете вероятность результата. А чтобы рассчитать эту вероятность, у вас должно быть статистически репрезентативное количество наблюдений.

Почему так происходит? Потому что, если честно, даже разработчики LLM не знают до мельчайших деталей, как они работают. Да, они понимают архитектуру (например, Transformer) и базовые принципы, но не могут гарантировать, что для одного и того же ввода сигнал всегда пройдет один и тот же путь.

В полной версии поста я разобрала, как именно адаптировать процесс под эту недетерминированность - от работы с доверительными интервалами и N-прогонами до конкретного примера стресс-теста промптов на задаче «нарисуй дом» и подхода, который мы применяем у себя на проекте для минимизации галлюцинаций: читать далее
Mentorpiece Как тестировать AI-приложения: Determinism vs. Probability Традиционный QA, даже вооруженный до зубов AI-инструментами, принципиально не отличается от тестирования без них. Вы планируете покрытие, опираясь на классический тест-дизайн: эквивалентное разделение, попарное тестирование и т.п. Вы работаете с установкой…
  • ✍ 3
More from @be_pro_qa
  1. Aug 17, 2026⚡️Mentorpiece Vacy Index август 2026: Число вакансий по тестированию AI-приложений растет…
  2. Aug 12, 2026Как обычно тестируются приложения, сгенерированные с помощью ИИ? QA-агенты проверяют UI и…
  3. Aug 5, 2026Каждый запуск пайплайна стоит денег API Anthropic не блокирует доступ мгновенно, как тольк…
  4. Jul 29, 2026Почему ваш LLM-as-a-Judge "слишком вежливый" (и как с этим бороться) Я часто вижу, как ком…
  5. Jul 22, 2026Почему мне нравится работать ML Evaluation инженером после 20 лет опыта в QA Многие спраши…
  6. Jul 15, 2026⚡️Mentorpiece Vacy Index июль 2026: IT-найм продолжает падать, но сокращение Automation за…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →