Привет! На связи Кристина Желтова, директор по разработке моделей в Газпромбанке 👋🏻
Сегодня многие слышали про RAG, но часто кажется, что это что-то очень сложное, многокомпонентное и вообще только для больших компаний. На практике базовый RAG — это довольно понятный пайплайн: мы берём свои тексты, превращаем их в векторы, ищем релевантные куски и только потом просим модель ответить по найденному контексту.
Если совсем просто, то RAG — это LLM с внешней памятью, только в этой памяти документы лежат как векторы, а сами тексты хранятся в их метаданных.
Минимальный пайплайн состоит всего из нескольких шагов:
1️⃣ Берём приглянувшийся датасет с текстами;
2️⃣ Считаем для них эмбеддинги;
3️⃣ Складываем в векторную базу данных;
4️⃣ По запросу пользователя ищем top-k ближайших фрагментов;
5️⃣ Подкладываем найденный контекст в промпт LLM и просим ответить с использованием этой информации.
Такой пайплайн можно собрать даже на маленькой русской базе знаний: FAQ, конспектах, памятках или учебных материалах.
➡️ По ссылке доступна минималистичная реализация базового пайплайна с моделями
intfloat/multilingual-e5-small и Qwen/Qwen3-0.6B.
