Что умеет?
📚 Обрабатывает целые книги, PDF, научные статьи, инструкции и большие документы одним проходом.
🖼 Работает не только с PDF, но и с отдельными изображениями, сканами и фотографиями документов.
🌍 Поддерживает множество языков.
📄 Сохраняет структуру документа и корректно извлекает длинные тексты.
✂️ Не требует разрезать PDF на десятки частей — модель рассчитана на длинные последовательности и может распознавать десятки страниц за один запуск.
Подходит для:
* обучения по электронным книгам;
* оцифровки архивов;
* подготовки данных для RAG;
* поиска информации в больших PDF;
* создания собственных AI-баз знаний.
⚙️ Установка
Клонируем проект:
git clone https://github.com/baidu/Unlimited-OCR
cd Unlimited-OCR
Устанавливаем зависимости:
pip install torch torchvision transformers pymupdf pillow matplotlib einops addict easydict psutil
▶️ Пример использования
from transformers import AutoModel, AutoTokenizer
model = AutoModel.from_pretrained(
"baidu/Unlimited-OCR",
trust_remote_code=True
)
Простой пример распознавания PDF:
model.infer_multi(
tokenizer,
prompt='<image>Multi page parsing.',
image_files=pdf_to_images('your_doc.pdf', dpi=300),
output_path='your/output/dir',
image_size=1024,
max_length=32768,
no_repeat_ngram_size=35, ngram_window=1024,
save_results=True,
)
💬 Если вы работаете с огромными PDF, учебниками, исследованиями или строите AI-системы поверх документов, Unlimited-OCR выглядит одним из самых интересных открытых OCR-проектов.
Ключевая особенность — возможность обрабатывать длинные документы целиком без традиционного разбиения на страницы, что упрощает конвейер обработки и ускоряет работу с большими объемами данных.
♎️ GitHub/Инструкция
😳 Лайф | 📲 Зеркало Max
#python #soft #github