TGViewer
SOF_news SOF_news @sof_news24 · 322 subscribers
Post #2047 17
🇨🇳🤖 КНР: TeleOCR – компактная локальная модель для интеллектуального разбора документов
Специалисты китайской компании China Telecom Artificial Intelligence Technology (Beijing) разработали открытую мультимодальную модель TeleOCR, предназначенную для автоматического распознавания и структурного разбора электронных документов, сканов и фотографий страниц. Объём модели составляет около 1,2 млрд параметров.
🔻 Архитектура TeleOCR построена с использованием компонентов Qwen2.5-VL и Qwen3. В состав системы входят визуальный кодировщик для обработки изображения и языковая часть, формирующая структурированное представление содержимого документа. При обучении разработчики отдельно отрабатывали распознавание геометрически искажённых страниц, структуру таблиц и математических формул, а заключительный этап включал обучение с подкреплением.
В отличие от традиционных OCR-систем, TeleOCR выполняет не только распознавание символов, но и структурный анализ документа. Модель определяет расположение элементов и порядок чтения, распознаёт таблицы, математические формулы, программный код и графические данные, а также способна работать с фотографиями страниц с перекосом, перспективными искажениями и изгибом бумаги. Причём для таких изображений отдельное предварительное «выпрямление» страницы не требуется.
Поддерживается обработка многостраничных PDF-документов, два режима анализа структуры страницы, а также ускоренный вывод через vLLM. Распознанное содержимое может сохраняться в Markdown и HTML, математические выражения – в LaTeX, а таблицы – в структурированном формате OTSL. Таким образом сохраняется не только текст, но и значительная часть исходной логической организации документа.
⚙️ TeleOCR рассчитана на локальное применение. Модель распространяется под лицензией Apache 2.0, официальная версия использует BF16, имеются также сторонние квантованные сборки и поддержка llama.cpp. Жёсткие минимальные требования к видеопамяти разработчики не приводят, однако с учётом размера модели для одиночной обработки страниц практично ориентироваться на видеокарты с 8 ГБ VRAM; при пакетной обработке крупных PDF требования будут выше.
📊 На OmniDocBench v1.6 TeleOCR получила 96,87 балла, на Wild-OmniDocBench – 88,53. В опубликованном разработчиками сравнении она опередила MinerU2.5-Pro, PaddleOCR-VL-1.6 и GLM-OCR, несмотря на сравнительно небольшой размер модели.
🔹 Основное значение TeleOCR заключается в возможности развернуть полноценную систему интеллектуального разбора документов непосредственно на локальной вычислительной технике. Сочетание небольшого размера, анализа структуры страницы и устойчивости к фотографиям сложных документов делает её пригодной для обработки больших массивов технической документации, архивов, договоров, чеков и других слабоструктурированных данных без передачи исходных файлов во внешние облачные сервисы.
Подобные специализированные модели могут стать базовым элементом закрытых корпоративных систем поиска, анализа документов и RAG, где одновременно важны качество извлечения данных, автономность и сохранение конфиденциальности.
More from @sof_news24
  1. Oct 9, 2026🇩🇪🛰 Германия: развитие системы космической радиолокационной разведки для обеспечения во…
  2. Oct 9, 2026🇳🇱⚔️🚁 Нидерланды: началось производство вертолётов H225M «Каракал» для сил специальных…
  3. Oct 9, 2026🇫🇷⚔️ Франция: особенности проведения учения ВКС «Базекс – 2026» На территории Франции 23…
  4. Oct 8, 2026🧭 Военный календарь на 9 октября 2026 года Ежедневно – основные заранее объявленные мероп…
  5. Oct 8, 2026photo post
  6. Oct 8, 2026🇫🇷⚔️ ФРАНЦИЯ: проект военного бюджета на 2027 год Министр вооружённых сил Франции Катрин…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →