Что такое векторные базы данных?
Представим, что пользователь пишет📝:
«Не проходит оплата»
А нужная инструкция называется:
«Ошибка при проведении платежа»
Слова разные, поэтому обычный поиск может ничего не найти. Но смысл у запросов похожий - именно это учитывает векторный поиск.
Как он работает🤔
Специальная модель превращает каждый текст в набор чисел - вектор. Чем ближе смысл двух текстов, тем больше похожи их векторы.
Эти векторы сохраняются в специальной базе. Примеры таких баз: Qdrant, Milvus, Weaviate, pgvector — дополнение для PostgreSQL.
В базе обычно хранятся:
❗️вектор текста
❗️сам текст или ссылка на него
❗️дополнительная информация: дата, источник, категория и права доступа
Когда пользователь задаёт вопрос, он тоже превращается в вектор. База находит несколько похожих фрагментов и передаёт их нейросети. Уже на их основе она формирует ответ❔
Так работают многие системы с RAG, когда нейросеть отвечает по найденным документам, а не только по знаниям, полученным во время обучения.
Векторный поиск используют для:
⏺поиска по внутренним документам;
⏺чат-ботов поддержки;
⏺рекомендаций товаров;
⏺поиска похожих изображений;
⏺работы с юридическими и банковскими документами.
При этом векторная база не понимает текст как человек и не гарантирует правильный ответ ⚠️Если в неё загрузили старые инструкции, дубли или плохо очищенные документы, нейросеть получит неподходящую информацию.
Поэтому Data Engineer здесь отвечает за сбор и очистку документов, удаление дублей, загрузку данных и их своевременное обновление.
📚Для изучения:
Векторные базы данных: простым языком про сложное
Векторные базы для RAG: сравнение Qdrant, pgvector, Milvus и Weaviate
Ставь 🔥, если было полезно!
Post #132
1.27K

- 🔥 19
- 👍 9
- ❤ 4