📝 PDF-Extract-Kit (https://github.com/opendatalab/PDF-Extract-Kit) — библиотека для извлечения данных из PDF-файлов с поддержкой сложных документов с помощью моделей компьютерного зрения!
🔍 Основные особенности:
🌟 Точное извлечение текста и таблиц из структурированных и неструктурированных PDF, включая многостраничные таблицы и иерархические блоки!
🌟 OCR-интеграция, позволяющая обрабатывать PDF-документы с отсканированными изображениями!
🌟 Гибкий API на Python, что делает его удобным для анализа и интеграции в приложения!
🔐 Лицензия: AGPL-3.0
🖥 Github (https://github.com/opendatalab/PDF-Extract-Kit)
@Python_Community_ru
Post #2792
1.02K

- 🔥 2