#VectorDatabase
🔖Векторные базы данных: как LLM понимает мир
Знаете, как ChatGPT сочиняет сказки про единорогов за секунды? Секрет в векторных базах данных — технологии, которая превращает слова в числа и находит смысл в хаосе данных.
🔸Как это работает:
1. Эмбеддинг
Слова → векторы (списки чисел)
"единорог" = [0.2, -0.8, 1.3, ...]
2. Кодирование
Векторы проходят через нейросеть (линейное преобразование + ReLU)
3. Объединение
Усреднение по столбцам → один вектор предложения
4. Индексирование
Сжатие размерности для быстрого поиска
5. Поиск по сходству
Скалярное произведение находит "похожие" векторы
🔸Проблема масштаба:
- Миллиарды предложений в базе
- Тысячи измерений в каждом векторе
- Десятки тысяч токенов
Решение: Векторные БД хранят готовые эмбеддинги вместо их генерации на лету.
🔸Применение:
- RAG-системы (поиск + генерация)
- Рекомендательные системы
- Семантический поиск
- Чат-боты и ассистенты
🔸Алгоритмы поиска:
- Линейное сканирование — точно, но медленно
- HNSW — приблизительно, но быстро для миллиардов векторов
✔️Итог:
Векторные БД превращают "понимание" ИИ в математическую задачу. Похожие концепции получают близкие векторы в многомерном пространстве.
📎 Статья
🎙 Новости
📝 База вопросов
Post #260
106

- 🔥 1