TGViewer
IT Test IT Test @ittestru · 320 subscribers
Post #1258 176
В классическом ПО не было категории дефекта "система уверенно врёт". В продуктах с LLM это один из самых частых багов.

Галлюцинация — не редкий пограничный случай, а поведение модели по умолчанию, когда данных для ответа нет: она генерирует правдоподобный текст вместо признания незнания. Проверять такое старыми методами не выходит — тест-кейс с ожидаемым результатом "строка X" просто не работает там, где на один и тот же запрос приходят десять разных ответов.

С чего начинают команды, которые тестируют LLM-фичи всерьёз: берут один типичный пользовательский запрос и отправляют его десять раз подряд, ничего не меняя. Это даёт понимание масштаба недетерминизма конкретной системы — и часто становится неприятным сюрпризом 🤖

Классический QA при этом никуда не девается. Тест-дизайн, классы эквивалентности, негативные сценарии, risk-based подход — всё переносится в недетерминированный мир и достраивается новыми инструментами: оценкой качества ответа, LLM-as-a-judge, прогоном evals в CI/CD и мониторингом поведения модели уже в проде.

Плюс отдельный список рисков, которых раньше в чек-листах не было: утечка системного промпта, prompt injection, токсичность, попадание персональных данных в ответ.
  • 💯 1
More from @ittestru
  1. Oct 2, 2026На техническом собеседовании инженера 72% вопросов — теория. На собеседовании руководителя…
  2. Sep 29, 2026🤖Современные модели пишут синтаксически корректный код почти в 100% случаев. Безопасным э…
  3. Sep 24, 202667% российских IT-компаний назвали автоматизацию тестирования приоритетом номер один. Это…
  4. Sep 22, 202618 августа отказ питания на подстанции, обслуживающей ММТС-9, на полтора часа уронил Steam…
  5. Sep 18, 2026Один из самых дорогих багов в истории обошёлся в 440 миллионов долларов за 45 минут. В 201…
  6. Sep 11, 2026Системы падают не тогда, когда трафик вырос, а тогда, когда об этом узнали постфактум. Осе…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →