LensVLM-9B от Apple
Визуально-языковая модель на базе Qwen3.5-9B. Читает текст в сжатом виде, а потом точечно разворачивает до полного формата только те страницы, которые нужны для ответа
• сканирование сжатых изображений текста
• выборочное расширение нужных страниц через выученные инструменты
• точность держится при сжатии в 4.3 раза
• обходит retrieval и текстовые компрессоры до 10.1 раза
• 9B параметров
• степени сжатия 5x, 10x, 15x
• работает с документами по запросу - вопрос и путь к файлу
Экономит контекст на длинных документах: модель видит ужатую версию, а полные страницы загружает только когда они реально нужны
Гитхаб
HF
Демо
#vlm #ocr
MAX
Post #14694
1.46K

- 👍 11