TGViewer
Embedika | ИТ-решения для бизнеса Embedika | ИТ-решения для бизнеса @embedika · 472 subscribers
Post #1298 82
Подготовка данных — обязательное условие эффективности корпоративного RAG

Контекст в компании распределен. Один и тот же процесс или объект могут описывать несколько документов: приказ, регламент, инструкция, шаблон. Эти документы живут в разных системах (СЭД, файловых хранилищах, порталах, почте) и редко синхронизируются между собой, а версии и приоритеты почти невозможно контролировать вручную.

Когда RAG-система получает запрос, она ищет ответ по всем доступным внутренним источникам. И если в базе одновременно лежат действующая и устаревшая редакции регламента, два противоречащих друг другу положения или разные версии одного договора, система найдет оба варианта, но не будет знать, какой из них правильный.

Поэтому главным фактором точности ответа становится не мощность модели, а проблемы источников:
➖ Противоречивые версии. Когда в базе есть и актуальная, и устаревшая редакция документа, RAG не может определить, какая из них действующая;
➖ Смысловые конфликты между документами. Регламент и инструкция описывают одну процедуру по-разному, при этом каждый документ по отдельности выглядит корректно.
➖ Разорванные связи. Документ ссылается на приложение, которого нет в системе, или на редакцию, которая уже заменена, поэтому ответ строится на неполном контексте.
➖ Неоднозначные формулировки. Условие допускает несколько трактовок, и модель выбирает ту, которая статистически вероятнее, а не ту, которая юридически верна.
➖ Некачественные сканы и метаданные. OCR распознал текст с ошибками, атрибуты заполнены неверно или отсутствуют — в таком случае ответ опирается на искаженный источник.

Отдельная проблема — права доступа. Если RAG не наследует ролевую модель из источника, он может показать сотруднику документ, который ему не предназначен. Из-за чего вопрос переходит в плоскость безопасности.

Начинать нужно с источников, т.к. пока в документах есть противоречия и устаревшие версии поиск будет менее результативным. Пошаговый порядок действий мы подробно разбирали в посте про аудит данных

RAG-система, построенная на непроверенных источниках — это не инструмент, а источник новых рисков. Сначала необходимо подготовить данные, а далее разрабатывать RAG. Без этого шага модель может ошибаться или предоставлять общие ответы на основе внутренних знаний.
  • 👍 4
  • 🔥 3
  • 👏 2
  • 💯 1
More from @embedika
  1. Sep 18, 2026Подборка полезных и интересных материалов Господдержка ИИ-разработчиков, контроль над дейс…
  2. Sep 17, 2026Почему легкие модели обрабатывают большинство запросов к API Мы продолжаем разбирать тренд…
  3. Sep 16, 2026Галлюцинации ни при чем, качество ответа ИИ теряется еще на этапе запроса Шаблонный или не…
  4. Sep 11, 2026In-Context Learning — свойство языка, а не только архитектуры трансформера Материал подгот…
  5. Sep 10, 2026Системные ошибки управления в ИТ-проектах и правила, которые помогают их избежать Успех ИТ…
  6. Sep 9, 2026Диагностика данных — первый шаг к порядку в документах Успешная трансформация работы с док…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →