RAG (Retrieval Augmented Generation — генерация с дополненной выборкой) — это технология, при которой модель отвечает на основе фрагментов из базы знаний, добавленных в её контекст.
Обычно RAG продают как средство от галлюцинаций ИИ. Но на деле плохо подготовленная база знаний становится источником ошибок, а не их решением.
В чём может быть проблема?
✳️
Слишком много текста, лишняя информация.
✳️
Несколько версий одной инструкции.
✳️
Плохая структура документа: таблицы, списки, заголовки и сноски при парсинге извлекаются некорректно или теряют смысл.
✳️
Устаревшие материалы.
Неудачная база знаний приносит в контекст много лишнего, появляются противоречия в логике. Модель пытается собрать связный ответ из противоречивого контекста — и риск ошибок или галлюцинаций растёт.
Что делать?
➡️
Следить за актуальностью базы знаний, убирать лишнюю и повторяющуюся информацию.
➡️
Разбивать документы на смысловые блоки с понятными заголовками, сохраняя контекст раздела.
➡️
Проверять, какие именно фрагменты попадают в контекст модели.
➡️
Добавить метаданные: дату, версию, владельца, статус «актуально/архив».
Помните: RAG не исправит ошибки в вашей базе знаний автоматически. Чтобы снизить вероятность галлюцинаций модели, начните с подготовки логичного и структурированного документа.
