На базе практически любой локальной мультимодальной языковой модели можно собрать систему, способную искать сведения в больших массивах документов, распознавать сканы и изображения, сопоставлять данные из нескольких источников и формировать ответы без передачи рабочей базы во внешние сервисы.
В качестве основной модели можно использовать Gemma, Qwen, Mistral, GLM и другие семейства, если выбранная версия поддерживает локальный запуск и обработку изображений.
То есть конкретная модель здесь не является основой всей системы и при необходимости может быть заменена.
🔻 Мультимодальная модель выполняет две задачи.
Первая
— анализ найденных документов и подготовка итогового ответа.Вторая
— обработка визуальных материалов: сканированных страниц, фотографий документов, таблиц, схем и других изображений.Например, если PDF состоит из обычного текстового слоя, текст можно извлечь напрямую. Если это скан документа, его страницы преобразуются в изображения и передаются мультимодальной модели для распознавания и структурирования содержимого. После этого распознанный текст становится частью общей базы.
🔻 BGE-M3 отвечает за поиск по смыслу.
Это отдельная модель эмбеддингов. Она не формирует ответы, а преобразует текстовые фрагменты документов в числовое представление. Благодаря этому система может искать не только точные совпадения слов.
Например, если в документе написано:
«предприятие разворачивает дополнительную линию выпуска беспилотных летательных аппаратов»,
то запрос:
«где увеличивается производство БпЛА»
также сможет привести к этому материалу.
BGE-M3 поддерживает большое количество языков, поэтому в одной базе можно одновременно хранить русские, английские, немецкие, польские и другие документы.
Для локального запуска через Ollama:
ollama pull bge-m3
🔻 TurboVec используется для хранения и быстрого поиска по документам.
После обработки BGE-M3 каждый фрагмент текста получает собственный вектор.
Если документов много, количество таких фрагментов может исчисляться десятками или сотнями тысяч. TurboVec сохраняет их в компактном локальном индексе и быстро определяет, какие материалы ближе всего к пользовательскому запросу.
Поддерживается сжатое 2-, 3- и 4-битное представление векторов, позволяющее существенно уменьшить объём базы. При этом отдельный сервер векторной БД не требуется
— индекс можно хранить обычным локальным файлом.📌 Как система работает на практике
Сначала в неё загружается папка с документами.
PDF, TXT, Markdown и другие материалы разбиваются на небольшие смысловые части. Для каждой сохраняются текст и служебные данные:
– название документа;
– номер страницы;
– дата;
– организация;
– URL первоисточника;
– тип документа.
Затем BGE-M3 создаёт для каждого фрагмента поисковое представление, а TurboVec сохраняет его в локальной базе.
После этого пользователь задаёт обычный вопрос, например:
«Какие предприятия в сентябре наращивали производство беспилотных систем?»
Система сначала ищет по всей базе наиболее подходящие фрагменты. Только найденные материалы передаются основной локальной модели. Она читает их, сопоставляет сведения и формирует итоговый ответ с указанием документов, страниц и первоисточников. То есть языковой модели не требуется при каждом вопросе заново читать сотни PDF.
🔻 Для сканов и изображений используется мультимодальный режим.
Обычный PDF обрабатывается средствами извлечения текста. Сканированный PDF или фотография документа передаются локальной мультимодальной модели, которая распознаёт текст и при необходимости восстанавливает структуру страницы, таблицы и подписи. После этого результат также индексируется через BGE-M3 и добавляется в TurboVec.
🔵 Главное преимущество – все компоненты можно заменять независимо друг от друга.
Основная локальная LLM – анализирует материалы, работает с изображениями и пишет ответ.
BGE-M3 – выполняет смысловой поиск.
TurboVec – хранит поисковый индекс.
PyMuPDF или другие парсеры – извлекают обычный текст из документов.
Поэтому сегодня можно использовать одну мультимодальную модель, а завтра заменить её на более новую или более мощную, не перестраивая всю базу документов.
В результате получается полностью локальная платформа для работы с технической документацией, нормативными актами, отчётами, научными материалами, сканами, схемами и большими архивами PDF.