zerox
Если хочется гонять через AI PDF, Word и прочие документы, вытаскивать оттуда текст, таблицы, графики, то с обычным OCR часто боль: то распознает криво, то верстка разъезжается в хлам.
Случайно наткнулся на Zerox OCR, это опенсорс-тулза, которая делает хитрее: сначала конвертит документ в картинки, а потом отдает их vision-модели, чтобы она по сути “прочитала” страницы и выдала результат в Markdown. За счет этого точность выше и формат лучше сохраняется.
Флоу максимально простой: загрузил документ → получил последовательность изображений → каждую страницу прогнал через визуальную модель → собрал общий Markdown. Поддерживает PDF, DOCX, Excel, PPT и еще десятки форматов.
Есть поддержка разных провайдеров моделей: OpenAI, Azure, AWS Bedrock, Google Gemini и т.д. Плюс можно кастомить промпты и правила извлечения данных.
Внутри также есть структурированное извлечение: можно задать свой JSON Schema и вытаскивать из документа ровно те поля, которые тебе нужны, без ручной разметки и копипасты.
Если ты регулярно разбираешь документы или хочешь нормально скармливать их содержимое AI для дальнейшего анализа, штука точно стоит того, чтобы попробовать.
📁 Language: #TypeScript 67.6%
⭐️ Stars: 12.1k
➡️ Cсылка на GitHub
📱 @git_developer
Post #1403
3.14K

- 👍 5