🇨🇳🤖 КНР: TeleOCR – компактная локальная модель для интеллектуального разбора документов
Специалисты китайской компании China Telecom Artificial Intelligence Technology (Beijing) разработали открытую мультимодальную модель TeleOCR, предназначенную для автоматического распознавания и структурного разбора электронных документов, сканов и фотографий страниц. Объём модели составляет около 1,2 млрд параметров.
🔻 Архитектура TeleOCR построена с использованием компонентов Qwen2.5-VL и Qwen3. В состав системы входят визуальный кодировщик для обработки изображения и языковая часть, формирующая структурированное представление содержимого документа. При обучении разработчики отдельно отрабатывали распознавание геометрически искажённых страниц, структуру таблиц и математических формул, а заключительный этап включал обучение с подкреплением.
В отличие от традиционных OCR-систем, TeleOCR выполняет не только распознавание символов, но и структурный анализ документа. Модель определяет расположение элементов и порядок чтения, распознаёт таблицы, математические формулы, программный код и графические данные, а также способна работать с фотографиями страниц с перекосом, перспективными искажениями и изгибом бумаги. Причём для таких изображений отдельное предварительное «выпрямление» страницы не требуется.
Поддерживается обработка многостраничных PDF-документов, два режима анализа структуры страницы, а также ускоренный вывод через vLLM. Распознанное содержимое может сохраняться в Markdown и HTML, математические выражения – в LaTeX, а таблицы – в структурированном формате OTSL. Таким образом сохраняется не только текст, но и значительная часть исходной логической организации документа.
⚙️ TeleOCR рассчитана на локальное применение. Модель распространяется под лицензией Apache 2.0, официальная версия использует BF16, имеются также сторонние квантованные сборки и поддержка llama.cpp. Жёсткие минимальные требования к видеопамяти разработчики не приводят, однако с учётом размера модели для одиночной обработки страниц практично ориентироваться на видеокарты с 8 ГБ VRAM; при пакетной обработке крупных PDF требования будут выше.
📊 На OmniDocBench v1.6 TeleOCR получила 96,87 балла, на Wild-OmniDocBench – 88,53. В опубликованном разработчиками сравнении она опередила MinerU2.5-Pro, PaddleOCR-VL-1.6 и GLM-OCR, несмотря на сравнительно небольшой размер модели.
🔹 Основное значение TeleOCR заключается в возможности развернуть полноценную систему интеллектуального разбора документов непосредственно на локальной вычислительной технике. Сочетание небольшого размера, анализа структуры страницы и устойчивости к фотографиям сложных документов делает её пригодной для обработки больших массивов технической документации, архивов, договоров, чеков и других слабоструктурированных данных без передачи исходных файлов во внешние облачные сервисы.
Подобные специализированные модели могут стать базовым элементом закрытых корпоративных систем поиска, анализа документов и RAG, где одновременно важны качество извлечения данных, автономность и сохранение конфиденциальности.
Post #2047
17
