TGViewer
altblog - трудовые будни altblog - трудовые будни @seopyt · 301 subscribers
Post #51 410
Галлюцинации в RAG

"Лучшие промты" - не помогают, т.к. галлюцинации - это архитектурная проблема.

"Чем больше документов занесу в RAG, тем более умной она станет" - это заблуждение. После 5–7 источников количество ошибок растет, а не падает, т.к. модель начинает склеивать несовместимое.


На сайте Стэнфордского университет было опубликовано исследование ИИ-сервисов (которые утверждали, что в них нет галлюцинаций) для юридических исследований (юридические RAG). Это платные сервисы которые стоят от 128 до 900 долларов в месяц (Lexis+ AI, Westlaw AI-Assisted Research, Ask Practical Law AI) и был еще обычный GPT-4 без специализированных юридических данных.

Цель исследования - выяснить как часто появляются галлюцинации в специализированных юридических ИИ-помощниках. Оценка проводилась по 200 юридическим запросам.

Результат

Коммерческие AI-инструменты для юридических исследований все ещё генерируют галлюцинации в 17-33% случаев, несмотря на использование RAG.

- Lexis+ AI - галлюцинации 17%
- Westlaw AI-AR: точность 42%, галлюцинации 33%
- Ask Practical Law AI: точность 19%, отказался отвечать в 62%
- GPT-4 (для сравнения): галюцинации в районе 40%

Типичные ошибки систем

- Путают решение суда с аргументами адвокатов
- Цитируют отмененные прецеденты как действующие или ссылаются на документ, который не подтверждает утверждение
- Не различают иерархию судов (например, могут сказать, что суд штата отменил решение Верховного суда США)
- Генерируют несуществующие параграфы законов

Выводы

- RAG действительно снижает галлюцинации по сравнению с базовыми LLM, но не устраняет их
- Более длинные ответы содержат больше галлюцинаций
- Системы плохо справляются с вопросами, требующими знания юрисдикции и временного контекста
- Нельзя доверять AI-системам без проверки
- Каждую цитату и утверждение нужно верифицировать вручную

Исследователи также дали рекомендации по уменьшению галлюцинаций в RAG.
More from @seopyt
  1. Sep 21, 2026Новая хайповая модель Jev, которая не пишет текст Про Jev от TypeSafe в твиттере не написа…
  2. Sep 18, 2026😀 18.08.2026 - Google Spam Update: месяц спустя Прошел месяц со злополучного апдейта - са…
  3. Sep 8, 2026💰Разбор ссылочного бюджета 4 гемблинг-гигантов Появилась идея сделать большой ревьюшник.…
  4. Aug 17, 2026Как сравнивать промпты и модели LLM перед запуском конвейера? В прошлый раз разбирали как…
  5. Jul 20, 2026Контроль качества каждой статьи, а не только первой Первую статью от нового промпта вычиты…
  6. Jul 4, 2026SEOGets.com снова стал бесплатным (пока) Монетизировать SEO-специалистов, особенно в эпоху…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →