Сегодня разберем тему проверки надежности Retrieval в RAG-системах.
Когда мы тестируем RAG, часто фокус уходит только на генерацию. Мы проверяем, насколько правильны ответы от AI Но часто источник ошибок - это retrieval. Даже если генерация работает идеально, слабый поиск по контексту ломает итоговый ответ.
Что такое RAG и retrieval разбирал тут
Что проверять на надежность:
⁃ Перестановки документов. Если мы меняем порядок выдачи, результат должен оставаться тем же. Если ответ внезапно меняется, значит, модель слишком чувствительна к ранжированию.
⁃ Удаление релевантного документа. Проверяем, умеет ли система честно сказать не знаю или начинает галлюцинировать.
⁃ Шум в источниках. Добавляем лишние тексты, нерелевантные документы. Надежная AI RAG система не должна отвлекаться на них и терять фокус.
⁃ Смешение доменов. Проверяем, не ломается ли retrieval, если рядом с профильными документами появляются материалы из другой области.
Важно: надежный retrieval это стабильная генерация. Если при малейших изменениях порядок фактов или шум сбивают модель, значит RAG небезопасен для реальных сценариев.
По сути, тестирование надежности retrieval - это метаморфическое тестирование на уровне источников, где мы меняем контекст, но правильный ответ должен оставаться тем же.
Полезная информация:
Курс по evaluation AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Post #49
606

- ❤ 3
- 👍 2
- 🔥 1