Pdf-extract-API
Проект предлагает инструмент для конвертации изображений и PDF-файлов в текст форматов Markdown и JSON с высокой точностью, включая поддержку табличных данных и математических формул.
Он основан на FastAPI, использует Celery для асинхронной обработки и Redis для кэширования результатов OCR, предоставляя различные стратегии для конвертации, такие как Marker, Surya-OCR и Tesseract, а также возможность удаления персонально идентифицируемой информации.
📁 Language: #Python
⭐️ Stars: 1.5k
➡️ Cсылка на GitHub
📱 @git_developer
Post #381
6.7K


- 👍 31
- 🔥 2