NeoMME сжимает индекс страниц в 255 раз при сохранении более 95% качества поиска
Авторы представили в блоге Hugging Face мультимодальные энкодеры NeoMME на 260 и 800 млн параметров. Один двунаправленный Transformer обрабатывает текст и фрагменты изображений без отдельной зрительной модели и генеративного декодера. Контекст обеих версий: 16 384 токена, максимум два изображения 4K.
NeoMME-Retriever ищет по снимкам страниц PDF без распознавания текста, сохраняя таблицы, диаграммы и вёрстку. Версия на 260 млн параметров кодирует около 51 страницы в секунду на NVIDIA L40S при разрешении 2048×2048 против 26 у ColModernVBERT. Пулинг токенов и квантование сокращают индекс с примерно 1,5 МБ до 6 КБ на страницу, сохраняя более 95% исходного nDCG@10.
Контрольные точки доступны в Hugging Face Transformers под Apache 2.0. Модель можно использовать как первый этап визуального RAG.
@neuro_channel
Post #14814
7.01K

- 👍 11
- ❤ 6
- 👏 4
- 🎉 4
- 💯 4
- 🔥 3
- 👻 3
- 👀 2
- 👎 1
- 👌 1
- 🎃 1