"Лучшие промты" - не помогают, т.к. галлюцинации - это архитектурная проблема.
"Чем больше документов занесу в RAG, тем более умной она станет" - это заблуждение. После 5–7 источников количество ошибок растет, а не падает, т.к. модель начинает склеивать несовместимое.
На сайте Стэнфордского университет было опубликовано исследование ИИ-сервисов (которые утверждали, что в них нет галлюцинаций) для юридических исследований (юридические RAG). Это платные сервисы которые стоят от 128 до 900 долларов в месяц (Lexis+ AI, Westlaw AI-Assisted Research, Ask Practical Law AI) и был еще обычный GPT-4 без специализированных юридических данных.
Цель исследования - выяснить как часто появляются галлюцинации в специализированных юридических ИИ-помощниках. Оценка проводилась по 200 юридическим запросам.
Результат
Коммерческие AI-инструменты для юридических исследований все ещё генерируют галлюцинации в 17-33% случаев, несмотря на использование RAG.
- Lexis+ AI - галлюцинации 17%
- Westlaw AI-AR: точность 42%, галлюцинации 33%
- Ask Practical Law AI: точность 19%, отказался отвечать в 62%
- GPT-4 (для сравнения): галюцинации в районе 40%
Типичные ошибки систем
- Путают решение суда с аргументами адвокатов
- Цитируют отмененные прецеденты как действующие или ссылаются на документ, который не подтверждает утверждение
- Не различают иерархию судов (например, могут сказать, что суд штата отменил решение Верховного суда США)
- Генерируют несуществующие параграфы законов
Выводы
- RAG действительно снижает галлюцинации по сравнению с базовыми LLM, но не устраняет их
- Более длинные ответы содержат больше галлюцинаций
- Системы плохо справляются с вопросами, требующими знания юрисдикции и временного контекста
- Нельзя доверять AI-системам без проверки
- Каждую цитату и утверждение нужно верифицировать вручную
Исследователи также дали рекомендации по уменьшению галлюцинаций в RAG.
