python使用mineru解析pdf等格式的文档
2026/8/17 21:54:20 网站建设 项目流程

1、主页

MinerU | 面向 Agent 和 RAG 的智能文档解析平台

2、在线解析文档

MinerU 在线文档解析

3、使用代码批量处理文档

例如将pdf文件转成md文件

import os from mineru.cli.common import do_parse from mineru.data.data_reader_writer import FileBasedDataWriter if __name__ == '__main__': # ===== 1️⃣ 输入 PDF ===== pdf_path = "2020-03-17__厦门灿坤实业股份有限公司__200512__闽灿坤__2019年__年度报告.pdf" with open(pdf_path, "rb") as f: pdf_bytes = f.read() # ===== 2️⃣ 输出目录 ===== output_dir = "output" os.makedirs(output_dir, exist_ok=True) # ===== 3️⃣ MinerU 要求:必须是「列表」 ===== pdf_file_names = [os.path.basename(pdf_path)] pdf_bytes_list = [pdf_bytes] p_lang_list = [""] # 自动语言识别 # ===== 4️⃣ 图片 writer ===== img_writer = FileBasedDataWriter( os.path.join(output_dir, "images") ) # ===== 5️⃣ 核心解析 ===== do_parse( pdf_file_names=pdf_file_names, pdf_bytes_list=pdf_bytes_list, p_lang_list=p_lang_list, output_dir=output_dir, img_writer=img_writer, parse_method="auto" )

需要先执行

pip install -U "mineru[all]" pip install hf_xet

下载模型,

from modelscope import snapshot_download snapshot_download('OpenDataLab/PDF-Extract-Kit-1.0', local_dir=r'D:\LLM\Local_model\PDF-Extract-Kit-1.0')

并且设置环境变量

MINERU_MODEL_DIR = D:\LLM\Local_model\PDF-Extract-Kit-1.0

然后运行代码,在指定目录下生成了md文件和相关的json等文件

用typora工具打开该md文件,效果如下:

文档格式没乱,原来pdf文件里是表格的地方,在md文件里还是表格,等等。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询