В документе две колонки, таблица и формула.
Простого распознавания букв мало: ещё нужно сохранить порядок чтения
Страница → разметка областей → распознавание отдельных блоков → сборка документа
Сначала отдельный модуль находит структуру страницы
Затем GLM-OCR читает фрагменты, а SDK собирает текст и сведения о расположении блоков
Зачем это в работе?
Превратить папку сканов инструкций или прайсов в редактируемый материал, который уже можно искать, переносить и отдавать следующей модели
После настройки локального сервера и SDK папку можно обработать одной командой
glmocr parse ./scans/ --output ./result/
Результат — Markdown и данные структуры в JSON
GLM-OCR и установка
👍 — сканы давно ждут разбора
👨🚒 — проще попросить исходник
🪐 Вездесущий ИИ | Чат с админом | Консультация
