No OCR
Ранее уже делились множеством инструментов для извлечения текста из PDF с помощью OCR, но у них часто бывают проблемы — сложная настройка, низкая точность и т.д.
Сегодня — AI-инструмент для обработки документов без OCR: No OCR.
Просто загрузите PDF — и можно искать или задавать вопросы по содержимому сразу нескольких документов, без использования традиционного OCR. Это значительно повышает эффективность анализа документов.
Ключевые возможности:
🔸Создание и управление PDF/документами, организованными по "кейсам"
🔸Автоматическая генерация датасета в формате Hugging Face
🔸Поиск по страницам PDF и изображениям с помощью векторного поиска (на базе LanceDB)
🔸Визуальный вопрос-ответ по изображениям и графикам с помощью Qwen2-VL
🔸Поддержка гибридного поиска: текст + визуальные данные
Поддерживается быстрая установка через Docker, есть подробная инструкция по развёртыванию и разработке.
📁 Language: #TypeScript (53.9%), #Python (43.2%)
⭐️ Stars: 131
➡️ Cсылка на GitHub
📱 @git_developer
Post #735
3.98K
- 👍 13
- ❤ 1
- 🔥 1