在构建RAG管道或搜索功能时,从docx、pdf等文件中提取文本总是一道绕不开的槛。现有方案要么依赖JVM(Apache Tika),要么需要Python环境及模型下载(unstructured、Docling),要么得上传云端(LlamaParse)。DeepDoc提供另一种选择:一个静态Rust二进制,无JVM、无Python、无模型下载、不连网,单文件即可运行。
> DeepDoc将每种格式解析为统一的文档模型(标题、段落、列表、表格、元数据、页码),再序列化为Markdown或JSON。v0.1支持13种原生数字格式:docx、pptx、xlsx、odt、ods、odp、epub、html、rtf、csv、md、txt及纯文本PDF。递归处理文件夹,输出保持目录结构。
>
> 对于RAG场景,DeepDoc按块边界切分,同时保留标题层级路径和字节范围作为元数据,确保检索时上下文不丢失。非OCR工具,扫描PDF会被检测并报错退出(返回码4),避免污染索引。也可作为Rust库使用,直接嵌入服务。
>
> 示例:deepdoc report.docx直接输出带表格的Markdown;deepdoc ./docs --recursive -o out/批量处理并镜像目录。
DeepDoc是本地优先、轻依赖的工具链(DeepLab系列)之一,开源(MIT / Apache 2.0),v0.1已发布。
GitHub
#开发者 #工具 #DeepDoc #Rust #RAG #文档解析 #离线 #开源
@DevToolboxHub