Этот Python проект представляет собой инструмент для преобразования изображений и PDF-документов в текст в формате Markdown и JSON с высоким уровнем точности.
💡 Поддерживаются табличные данные и математические формулы.
В основе проекта лежит использование FastAPI, а для асинхронной обработки задач применяется Celery.
Для кэширования результатов оптического распознавания символов (OCR) используется Redis.
В проекте реализованы разные методы конвертации, среди которых Marker, Surya-OCR и Tesseract. Также предусмотрена функция удаления персональных данных.
✔️ Установка:
git clone https://github.com/CatchTheTornado/pdf-extract-api.git
cd pdf-extract-api🖥 Код
@pythonl


