🇺🇸🤖 США: Perplexity представила семейство мультимодальных моделей поиска pplx-embed-v2-late
Американская компания «Перплексити ИИ» (Perplexity) представила две открытые модели эмбеддингов – pplx-embed-v2-late-0.6b и pplx-embed-v2-late-9b, предназначенные для смыслового поиска по текстам, изображениям и документам, содержащим таблицы, схемы и графики. Модели созданы на основе Qwen3.5, веса опубликованы под лицензией MIT.
🔻 Главная особенность – многовекторное представление документов. В отличие от обычных моделей эмбеддингов, формирующих один вектор для текстового фрагмента, разработка Perplexity создаёт отдельный 128-мерный вектор для каждого токена.
Для поиска используется алгоритм MaxSim, который сопоставляет отдельные части запроса с наиболее близкими частями документа. Такой подход, известный как Late Interaction (ColBERT), позволяет точнее находить конкретные сведения, технические характеристики и взаимосвязанные данные.
🔻 Основные характеристики моделей:
– pplx-embed-v2-late-0.6b – 594 млн параметров, из которых при обработке изображений задействуется около 340 млн;
– pplx-embed-v2-late-9b – около 9 млрд параметров, из которых активны до 7,4 млрд.
Обе модели поддерживают поиск изображений по текстовым запросам, включая страницы PDF. Это позволяет находить информацию непосредственно в таблицах, схемах и графиках без обязательного предварительного распознавания текста (OCR).
🔻 Важная особенность – совместимость векторных представлений моделей 0.6B и 9B. Документы можно один раз обработать более мощной версией 9B, а последующие поисковые запросы выполнять компактной 0.6B без повторной индексации архива.
Основная вычислительная нагрузка переносится на этап подготовки документов, а для повседневного поиска достаточно менее производительного оборудования.
⚙️ Для обучения использованы 186 млн пар «запрос – документ» из 594 наборов данных на 46 языках. Подготовка проводилась с переносом знаний от более крупной внутренней модели с 18 млрд параметров.
📊 Результаты испытаний ViDoRe v3 по поиску изображений страниц документов:
– модель 0.6B – 62,3%;
– модель 9B – 65,2%;
– индекс, созданный моделью 9B, и запросы через 0.6B – 63,5%.
📌 Для локального применения предусмотрена поддержка Sentence Transformers. Модели совместимы с многовекторным поиском в Qdrant, использующим алгоритм MaxSim. Это позволяет применять их для уточнения результатов поиска в существующих системах RAG.
Основное ограничение – увеличенный объём поискового индекса. Несмотря на размерность 128, каждый документ представлен множеством векторов, что повышает требования к памяти и вычислительным ресурсам.
🔵 Практическое значение разработки Perplexity – возможность повысить точность локального поиска по сложной технической документации, включая отсканированные материалы, таблицы, чертежи и графики.
Особенно интересна совместная работа моделей 9B и 0.6B: крупная используется для индексации архива, а компактная – для последующего поиска. Такой подход позволяет сократить вычислительные затраты при постоянной работе с большими базами документов.
Post #2059
31
