У языковой модели нет "ожидаемого результата"🤖
Один и тот же запрос два раза подряд — два разных ответа. Оба могут быть корректными. Или оба — нет.
Вся тестовая документация построена вокруг фразы "ожидаемый результат". На ИИ-фичах это ломается сразу: сравнением строк такое не проверить.
Разобрали, что конкретно меняется в работе QA:
• как переписать тест-кейс на проверяемые свойства ответа вместо точного текста
• зачем нужен golden set и с чего его начинать (подсказка: не с успехов)
• почему судья-модель тоже требует тестирования — и как её откалибровать
• что добавить в баг-репорт, если дефект не воспроизводится по шагам
• как ловить регресс, который приходит не от вас, а от обновления модели у провайдера
Плюс чек-лист что сделать до начала тестирования. Что в тестовой документации, а что в прогонах и критериях релиза.
Читать 👉 на сайте
Post #721
194

- ⚡ 4
- 🆒 1