PDF、Word、HTML、Markdown、图片等文档解析工具MinerU和Docling
文章目录一多种文档解析意义二文档解析工具-MinerU2.1MinerU定位2.2 MinerU能干什么2.3 安装步骤2.3.2 CIL安装2.3 基本用法2.4 三种解析方式2.5 后端选择2.6 输出结果三文档解析工具-Docling3.1 Docling 定位3.2 Docling 能干什么3.3 安装步骤3.3.1 CLI 安装3.4 基本用法3.4.1 CLI 用法3.4.2 Python 用法3.5 PDF 解析配置3.6 输出结果3.7 文档分块3.7.1 HierarchicalChunker3.7.2 HybridChunker3.8 RAG 中的使用流程一多种文档解析意义我们需要把PDF、Word、HTML、Markdown、图片等不同文档解析成干净便于向量检索的文档。二文档解析工具-MinerU2.1MinerU定位MinerU 是一个文档解析引擎主要作用是把人类阅读的文档转换成机器容易处理的 Markdown、JSON 和图片。2.2 MinerU能干什么当前本地 CLI 文档明确列出的输入包括 PDF、图片、DOCX、PPTX、XLSX。2.3 安装步骤2.3.2 CIL安装# 创建虚拟环境uv venv .venv# 激活环境.venv\Scripts\Activate.ps1# 安装基础功能uv pipinstallmineru[core]# 检查安装mineru--versionmineru--help完整功能或源码开发可以使用gitclone https://github.com/opendatalab/MinerU.git Set-Location MinerU uv pipinstall-e.[all]2.3 基本用法纯 CPU 环境建议先使用 pipelinemineru-p.\samples\document.pdf-o.\output-bpipeline-mauto-lch参数含义参数作用-p输入文件或目录-o输出目录-b选择解析后端-m选择文字提取方式-lOCR 文档语言-s、-e指定开始页和结束页-t是否解析表格-f是否解析公式2.4 三种解析方式模式适用情况auto自动判断日常默认使用txtPDF 有完整且正常的文字层ocr扫描 PDF、图片 PDF、乱码 PDF示例# 自动判断mineru-pinput.pdf-ooutput-bpipeline-mauto# 强制直接提取文字mineru-pinput.pdf-ooutput-bpipeline-mtxt# 强制 OCRmineru-pinput.pdf-ooutput-bpipeline-mocr-lch2.5 后端选择后端特点建议pipeline传统解析流水线支持纯 CPU入门首选vlm-engine使用视觉语言模型复杂图文需要较多资源hybrid-engine结合多种解析能力GPU 环境和复杂文档vlm-http-client调用外部 VLM 服务服务化部署hybrid-http-client调用外部混合服务服务化部署当前版本的默认后端可能随版本变化因此以本机 mineru --help 为准。没有 GPU 时明确指定-bpipeline2.6 输出结果不同版本的具体文件名可能不同但主要有Markdown适合查看内容也可以用于简单分块。content list JSON按照阅读顺序保存标题、正文、表格、图片等元素最适合后续构建 RAG。middle JSON包含更详细的中间解析和版面信息适合排查问题。images从文档中提取的图片。可视化结果用于检查版面框和元素识别是否正确。RAG 中建议以 content list JSON 为主因为它比单纯 Markdown 更容易保留页码、类型和位置信息。三文档解析工具-Docling3.1 Docling 定位Docling 是一个多格式文档解析、转换和分块框架。它会把不同格式的文件统一转换成结构化的DoclingDocument。DoclingDocument可以继续导出为 Markdown、JSON、HTML或者直接进行 RAG 分块。Docling 支持完全本地运行文档不需要上传到云端。3.2 Docling 能干什么Docling 支持的主要输入格式包括 PDF、DOCX、PPTX、XLSX、HTML、Markdown、图片、EPUB、LaTeX、纯文本、邮件和部分音频格式。Docling 可以识别和保留以下内容内容解析结果标题保留标题及层级正文提取段落和阅读顺序列表保留列表结构表格识别行、列和单元格图片提取图片和图片标题扫描文字通过 OCR 识别公式和代码保留对应内容类型元数据保存来源、页码和位置信息3.3 安装步骤3.3.1 CLI 安装# 创建虚拟环境uv venv.venv# 激活虚拟环境.venv\Scripts\Activate.ps1# 安装 Doclinguv pip install docling# 检查安装docling--version docling--help使用 HuggingFace tokenizer 进行 RAG 分块时可以安装uv pip installdocling-core[chunking]3.4 基本用法3.4.1 CLI 用法转换成 Markdowndocling.\samples\document.pdf--to md--output.\output转换成 JSONdocling.\samples\document.pdf--to json--output.\output--to用于指定输出格式--output用于指定输出目录。3.4.2 Python 用法fromdocling.document_converterimportDocumentConverter converterDocumentConverter()resultconverter.convert(./samples/document.pdf)docresult.document markdowndoc.export_to_markdown()datadoc.export_to_dict()htmldoc.export_to_html()result.document是统一的DoclingDocument。后续导出、遍历元素和分块都基于这个对象进行。3.5 PDF 解析配置包含扫描页面和表格的 PDF可以启用 OCR 和表格结构识别fromdocling.datamodel.base_modelsimportInputFormatfromdocling.datamodel.pipeline_optionsimportPdfPipelineOptionsfromdocling.document_converterimportDocumentConverter,PdfFormatOption optionsPdfPipelineOptions(do_ocrTrue,do_table_structureTrue,)converterDocumentConverter(format_options{InputFormat.PDF:PdfFormatOption(pipeline_optionsoptions)})resultconverter.convert(./samples/document.pdf)docresult.document常用配置参数作用do_ocr对扫描页面和图片文字执行 OCRdo_table_structure识别表格行列和单元格结构generate_page_images生成完整页面图片generate_picture_images提取文档中的图片区域images_scale控制生成图片的清晰度do_picture_description使用视觉模型生成图片描述提取文档中的图片options.generate_picture_imagesTrueoptions.images_scale2.03.6 输出结果Docling 主要支持以下输出输出作用Markdown人工查看、结果校验和简单处理JSON保存完整的DoclingDocument结构HTML在网页中展示解析结果DocTagsDocling 使用的结构化标记格式DoclingDocument用于程序处理和 RAG 分块markdowndoc.export_to_markdown()json_datadoc.export_to_dict()htmldoc.export_to_html()doctagsdoc.export_to_doctags()RAG 项目建议直接使用DoclingDocument进行分块不需要先导出 Markdown 再重新解析。3.7 文档分块3.7.1 HierarchicalChunkerHierarchicalChunker根据标题、段落、列表、表格等文档结构进行分块。fromdocling.chunkingimportHierarchicalChunker chunkerHierarchicalChunker()chunkslist(chunker.chunk(doc))forchunkinchunks:print(chunk.text)3.7.2 HybridChunkerHybridChunker先按照文档结构分块再根据 tokenizer 控制 chunk 长度。超长内容会被拆分相邻且较短的同级内容可以合并。fromdocling.chunkingimportHybridChunkerfromdocling_core.transforms.chunker.tokenizer.huggingfaceimport(HuggingFaceTokenizer,)tokenizerHuggingFaceTokenizer.from_pretrained(model_nameBAAI/bge-m3,max_tokens512,)chunkerHybridChunker(tokenizertokenizer,merge_peersTrue,)chunkslist(chunker.chunk(doc))forchunkinchunks:embedding_textchunker.contextualize(chunk)print(chunk.meta.headings)print(embedding_text)分块器适用情况HierarchicalChunker强调标题和文档元素结构HybridChunker同时控制结构和 token 长度适合 RAG3.8 RAG 中的使用流程PDF、Word、HTML、Markdown、图片 ↓ DocumentConverter ↓ DoclingDocument ↓ HybridChunker ↓ BGE-M3 向量化 ↓ Milvus建议向量化chunker.contextualize(chunk)的结果。入库时保存正文、标题路径、页码、来源、内容类型和文档 ID。Markdown 主要用于人工检查JSON 用于保存完整解析结果DoclingDocument和 Chunker 用于正式的 RAG 入库流程。官方资料Docling 官方文档、Docling GitHub。

相关新闻

LangChain Go应用安全实战:7大关键策略防御提示词注入与资源滥用

LangChain Go应用安全实战:7大关键策略防御提示词注入与资源滥用

1. 项目概述:为什么LangChain Go应用需要专门的安全防护?最近在几个Go语言技术社区里,看到不少朋友在讨论用LangChain框架结合Go来开发AI应用。大家聊得热火朝天,都在说怎么快速集成大模型、怎么设计Agent流程、怎么提升RAG的召回…

2026/7/21 6:06:22 阅读更多 →
Python高效处理CSV数据的实战技巧与性能优化

Python高效处理CSV数据的实战技巧与性能优化

1. CSV数据处理的核心价值与痛点在数据密集型工作场景中,CSV格式始终保持着不可替代的地位。作为数据交换的"通用语言",CSV文件以纯文本形式存储表格数据的特点,使其在数据分析、系统迁移、报表导出等场景中展现出独特的优势。我处…

2026/7/21 6:06:22 阅读更多 →
2026年AI问答代运营服务选型与优化指南

2026年AI问答代运营服务选型与优化指南

1. 项目概述:AI问答代运营服务的市场现状 2026年的企业服务市场,AI问答代运营已成为中小企业数字化转型的标配需求。根据第三方调研数据显示,采用专业AI问答服务的中小企业客户转化率平均提升37%,客服人力成本下降52%。这个领域目…

2026/7/21 6:05:21 阅读更多 →

最新新闻

AGPL-3.0 协议完全指南:历史、原理与商业实践

AGPL-3.0 协议完全指南:历史、原理与商业实践

AGPL-3.0 协议完全指南:历史、原理与商业实践如果说 GPL 是开源世界的“宪法”,那 AGPL-3.0 就是为互联网时代专门颁布的“修正案”。它精准地堵住了网络服务的“漏洞”——当软件不再通过分发而是通过网络提供服务时,AGPL 依然能确保用户享有…

2026/7/21 15:27:27 阅读更多 →
Unity性能优化:堆栈分析工具实战与性能瓶颈定位指南

Unity性能优化:堆栈分析工具实战与性能瓶颈定位指南

1. 项目概述:为什么Unity堆栈分析是性能优化的“核磁共振” 在Unity项目开发的中后期,尤其是当项目规模膨胀、功能模块增多时,性能问题往往会像幽灵一样突然出现。你可能会遇到游戏在某个场景突然卡顿,或者内存使用量在某个操作后…

2026/7/21 15:27:27 阅读更多 →
30分钟打造专属AI数字人:Duix-Avatar本地部署全攻略

30分钟打造专属AI数字人:Duix-Avatar本地部署全攻略

30分钟打造专属AI数字人:Duix-Avatar本地部署全攻略 【免费下载链接】Duix-Avatar 🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning. 项目地址: https://gitcode.com/GitHub_Trending…

2026/7/21 15:27:27 阅读更多 →
手握 HappyHorse,阿里仍狂投 AI 视频公司,是“骑马找驴”还是争夺云计算入口?

手握 HappyHorse,阿里仍狂投 AI 视频公司,是“骑马找驴”还是争夺云计算入口?

模型背后的算力需求过去半年,AI 视频生成成了国内互联网大厂投资最密集的赛道。今年 4 月,阿里云领投生数科技近 20 亿元 B 轮融资,三个月后,生数科技官宣完成新一轮 5 亿美金 B轮融资(网传阿里云再次领投)…

2026/7/21 15:27:27 阅读更多 →
实时供应链可视化的落地实践与架构设计

实时供应链可视化的落地实践与架构设计

1. 项目概述:这不是“看一眼库存”,而是让整条供应链自己开口说话 “Real-Time Supply Chain Visibility”——这个标题里藏着一个被太多人轻描淡写、却正在重塑制造业和零售业底层逻辑的现实: 供应链不再是一张静态的流程图,而是…

2026/7/21 15:27:27 阅读更多 →
如何利用CoinMarketCap趋势服务API实现加密货币项目精准曝光

如何利用CoinMarketCap趋势服务API实现加密货币项目精准曝光

如何利用CoinMarketCap趋势服务API实现加密货币项目精准曝光 【免费下载链接】CoinMarketCap-Trending CoinMarketCap (CMC) Trending | CMC, Coingecko, Dexscreener, Dextools Trending services 项目地址: https://gitcode.com/GitHub_Trending/co/CoinMarketCap-Trending…

2026/7/21 15:26:27 阅读更多 →

日新闻

Octane Render与C4D汉化版安装与优化指南

Octane Render与C4D汉化版安装与优化指南

1. Octane Render与C4D的黄金组合:为什么选择这个方案?在三维创作领域,渲染器的选择往往决定了作品的最终呈现质量和工作效率。作为Cinema 4D(C4D)用户,Octane Render的GPU加速特性与实时预览功能&#xff…

2026/7/21 0:00:19 阅读更多 →
GPMC接口设计:异步/同步模式与多路复用配置实战

GPMC接口设计:异步/同步模式与多路复用配置实战

1. GPMC接口设计:从硬件连接到软件配置的全局视角在嵌入式系统开发中,尤其是基于TI Sitara系列如AM263x这类高性能微控制器的项目里,外部存储器的扩展几乎是绕不开的一环。无论是存放大量非易失性代码的NOR Flash,还是作为高速数据…

2026/7/21 0:00:19 阅读更多 →
UE5 GAS框架下RPG被动技能系统:从核心原理到实战实现

UE5 GAS框架下RPG被动技能系统:从核心原理到实战实现

1. 项目概述:UE5 GAS RPG被动技能的核心价值在UE5里用GAS(Gameplay Ability System)做RPG游戏,主动技能像是你手里的武器,按一下打一下,逻辑直接,反馈也快。但被动技能,它更像是你身…

2026/7/21 0:00:19 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/21 8:48:31 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/21 5:34:47 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/21 8:25:39 阅读更多 →

月新闻