Про создание огромных RAG для агентов
Меня просили рассказать подробнее про то, как мы готовим данные для AI-агента. Рассказываю)
Речь не про загрузил 10 pdf и спросил ChatGPT, а про десятки тысяч документов, которые нужно превратить в то, по чему агент реально сможет искать и отвечать.
Как это устроено. Файлы лежат в хранилище типа SharePoint. Кто-то руками кладёт их туда и заполняет метаданные - название, бренд, модель, язык - через удобный UI, следуя инструкции. Это первый уровень, и он человеческий.
Дальше работает pipeline. Раз в X времени он смотрит в папку, видит новые или обновлённые файлы, подхватывает и кладёт в Delta-таблицу. Вот тут начинается самое интересное - метаданные причёсываются, мэпятся с нужными справочниками, нормализуются.
Это тот этап, где ты реально сидишь с бизнесом и выясняешь: а что является названием, а что брендом, а что моделью? Потому что без этого агент будет искать в хаосе и выдавать хаос.
Кстати, метаданные здесь важнее самого файла. Ссылка на документ лежит рядом с остальными данными, но именно по метаданным агент ищет. Там же можно перестроить структуру хранения - распределить файлы по папкам так, как будет удобнее агенту, а не человеку.
Когда всё причёсано - данные отправляются в скрипт, который создаёт индексы в vector store. И дальше настраивается автоматическое обновление: pipeline проверяет изменения раз в X времени и досылает только новое или изменённое.
Вот так это и работает.
Много ручной работы с бизнесом, много чистки, много пайплайнов. Но когда всё настроено - агент реально выдаёт то, что нужно.
Если хотите подробнее про какой-то из этапов - пишите в комменты, расскажу, насколько смогу)
Post #262
362
- 👍 9
- 🔥 1