Галлюцинации в AI системах - это одна из тех тем, про которые все слышали, но мало кто понимает насколько по-разному они проявляются в зависимости от типа системы и насколько сложно их реально обнаружить.
Попробую разобрать это по уровням, потому что детекция галлюцинаций в чистой LLM, в RAG системе и в агентном пайплайнет, это три совершенно разные задачи.
В чистой LLM галлюцинация - это когда модель генерирует информацию, которой нет в реальности, но делает это уверенно и правдоподобно. Детектировать это сложно, потому что нет внешнего источника правды с которым можно сравнить ответ. Самый распространенный подход - это бенчмарки. TruthfulQA проверяет склонность модели воспроизводить распространённые заблуждения, HaluEval оценивает галлюцинации на задачах вопрос-ответ, диалогов и суммаризации, SimpleQA от OpenAI фокусируется на коротких фактических вопросах с однозначным ответом. Суть в том, что у нас есть размеченный датасет с правильными ответами, и мы можем измерить насколько часто модель отклоняется от них. Это воспроизводимо и сравнимо между моделями.
В RAG системе задача детекции теоретически проще, потому что есть контекст, а именно набор документов, которые были переданы модели. Галлюцинация здесь это когда модель генерирует что-то, что не поддерживается этим контекстом. Это можно проверить автоматически через faithfulness/groundness метрики. Но на практике есть нюанс: около 80% сбоев RAG систем происходят не на уровне генерации, а на уровне retrieval, то есть модель получает неправильный контекст и галлюцинирует уже на его основе. И тут faithfulness/groundness метрика покажет зеленый результат, потому что ответ формально соответствует переданному контексту, просто контекст был неправильный.
В агентных системах это становится еще сложнее. Агент может галлюцинировать на уровне выбора инструмента, на уровне аргументов которые он передаёт в tool call, на уровне интерпретации результата инструмента и на уровне финального ответа пользователю. Каждый из этих уровней нужно проверять отдельно, и каскадная ошибка на первом шаге может привести к уверенному неправильному ответу в конце, который очень сложно отследить до источника.
Когда меня спрашивают как тестировать галлюцинации, мой ответ всегда начинается с вопроса, а в какой именно системе и на каком уровне? Потому что универсального подхода здесь нет, и метрики которые работают для одного типа системы могут давать ложное чувство безопасности в другом.
Сталкивались с галлюцинациями в своих AI системах? На каком уровне было сложнее всего их обнаружить? 👇
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Post #148
576

- 💯 3
- 👍 2
- 🔥 2
- ❤ 1