Firecrawl 开源了 pdf-inspector,一个纯 Rust 编写的 PDF 解析库,可在本地快速完成 PDF 分类、文本提取和 Markdown 转换,全程无需 OCR。项目提供 Python、Node.js 和浏览器 WebAssembly 绑定,并附带 CLI 工具。
核心思路是智能路由:先用约 10-50ms 判断 PDF 是文本型还是扫描型,文本型直接在本地提取(约 150ms),只有扫描件才转交 OCR 服务。官方称约 54% 的 PDF 无需 OCR,可显著节省成本与延迟。
主要能力:
• 识别 TextBased
• Scanned
• ImageBased
• Mixed 四类 PDF,返回置信度与逐页 OCR 路由建议;位置感知的文本提取,支持多栏阅读顺序与 RTL;Markdown 转换覆盖标题
• 列表
• 代码块
• 表格
• 粗斜体与链接;表格检测采用矩形与文本对齐双模式,可处理跨页金融表格;支持 CID 字体与 ToUnicode CMap 解码
在 opendataloader-bench 基准(200 份 PDF)中,pdf-inspector 综合得分 0.875,阅读顺序 0.915,表格 0.814,处理 200 份文档耗时 0.470s,均优于 liteparse、opendataloader、pymupdf4llm 与 markitdown。基准于 2026 年 7 月 31 日在 Apple M4 Pro 上刷新。
适合处理报告、论文、金融文档、发票和法律 PDF 等原生文本型文档,输出干净的结构化 Markdown,无需引入 OCR 基础设施。项目以 MIT 协议开源。
GitHub
#GitHub #开源 #pdfinspector #Firecrawl #Rust #PDF解析 #Markdown #WebAssembly
@GitHubTrendingHub
