TGViewer
Draft AI | Иван Кундиль Draft AI | Иван Кундиль @draft_ai_law · 335 subscribers
Post #30 275
Пояснения к Схеме №1 «Полный цикл загрузки в RAG»

В разных источниках «ингестия» и «индексация» могут означать весь процесс загрузки данных в RAG, а иногда строго разделяются. В прикрепленной схеме они разделены: ингестия — подготовка и очистка текстов, индексация — нарезка, метаданные и перевод текста в векторы.

Этап 1. Ингестия
Начиная с блока 1.3 (Парсинг), всё происходит автоматически и, по сути, «невидно для глаза». Используются библиотеки, которые извлекают текст из файлов (PDF, Word и т.п.): pdfplumber, PyMuPDF, python-docx и др.
На шаге 1.4 текст автоматически (с помощью скриптов и библиотек) очищается от мусора: лишние переносы, колонтитулы, повторяющиеся заголовки, странные символы.

В прикреплённом ниже файле — более подробные пояснения ко всем этапам, если хочется разобраться глубже.

Этап 2. Индексация
2.1 Чанкинг. Текст режется на куски (чанки). Размер задаётся в скрипте и может измеряться в символах, токенах, словах, предложениях, абзацах, разделах или страницах. Дополнительно задаётся перекрытие (overlap) — «нахлёст» между чанками, чтобы не терялся контекст. Чанкинг делает скрипт, но конкретная стратегия зависит от уровня RAG (про уровни RAG можно найти в прикреплённом файле).

2.2 Метаданные. После нарезки каждому чанку присваиваются метаданные. Даже в простом RAG это хотя бы имя файла/документа. Простые метаданные (имя файла, страница) добавляет скрипт, более сложные (summary, ключевые слова) может генерировать LLM. Процессы здесь связаны и часто плавно перетекают один в другой.

2.3 Эмбеддинг. Каждый чанк преобразуется в набор чисел — вектор. Для этого используются специальные эмбеддинговые модели (энкодеры): all-MiniLM, bge, E5 и др.

2.4 Запись. Вектор, текст чанка и его метаданные сохраняются в векторной базе. Запись обычно идёт пакетами (батчами) — можно настроить, сколько чанков отправляется в хранилище за один раз.

Итог.
Данные подготовлены, нарезаны, превращены в векторы и сохранены в хранилище. Дальше RAG готов к этапу поиска и генерации ответов.
  • 👍 4
More from @draft_ai_law
  1. Jul 12, 2026Как большие лимиты могут лишать нас опыта Последние несколько месяцев я довольно экономно…
  2. Jul 9, 2026Тест 14 нейросетей: всегда ли нужна топовая модель? Мой сервис по каждому судебному делу с…
  3. Jul 2, 2026На ПМЮФ-2026 прошла сессия «Юрист будущего: портрет профессии в эпоху искусственного интел…
  4. Jun 26, 2026Как использовать нейросети для поиска судебной практики: запись вебинара 24 июня мы провел…
  5. Jun 22, 2026А у нас новый вебинар! Пожалуй с самым холиварным вопросом для юристов) Как использовать н…
  6. Jun 15, 2026Собрал юридический плагин для Claude Code и сравнил результаты При подготовке документа с…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →