В классическом ПО не было категории дефекта "система уверенно врёт". В продуктах с LLM это один из самых частых багов.
Галлюцинация — не редкий пограничный случай, а поведение модели по умолчанию, когда данных для ответа нет: она генерирует правдоподобный текст вместо признания незнания. Проверять такое старыми методами не выходит — тест-кейс с ожидаемым результатом "строка X" просто не работает там, где на один и тот же запрос приходят десять разных ответов.
С чего начинают команды, которые тестируют LLM-фичи всерьёз: берут один типичный пользовательский запрос и отправляют его десять раз подряд, ничего не меняя. Это даёт понимание масштаба недетерминизма конкретной системы — и часто становится неприятным сюрпризом 🤖
Классический QA при этом никуда не девается. Тест-дизайн, классы эквивалентности, негативные сценарии, risk-based подход — всё переносится в недетерминированный мир и достраивается новыми инструментами: оценкой качества ответа, LLM-as-a-judge, прогоном evals в CI/CD и мониторингом поведения модели уже в проде.
Плюс отдельный список рисков, которых раньше в чек-листах не было: утечка системного промпта, prompt injection, токсичность, попадание персональных данных в ответ.
Post #1258
176

- 💯 1