1、主页
MinerU | 面向 Agent 和 RAG 的智能文档解析平台
2、在线解析文档
MinerU 在线文档解析
3、使用代码批量处理文档
例如将pdf文件转成md文件
import os from mineru.cli.common import do_parse from mineru.data.data_reader_writer import FileBasedDataWriter if __name__ == '__main__': # ===== 1️⃣ 输入 PDF ===== pdf_path = "2020-03-17__厦门灿坤实业股份有限公司__200512__闽灿坤__2019年__年度报告.pdf" with open(pdf_path, "rb") as f: pdf_bytes = f.read() # ===== 2️⃣ 输出目录 ===== output_dir = "output" os.makedirs(output_dir, exist_ok=True) # ===== 3️⃣ MinerU 要求:必须是「列表」 ===== pdf_file_names = [os.path.basename(pdf_path)] pdf_bytes_list = [pdf_bytes] p_lang_list = [""] # 自动语言识别 # ===== 4️⃣ 图片 writer ===== img_writer = FileBasedDataWriter( os.path.join(output_dir, "images") ) # ===== 5️⃣ 核心解析 ===== do_parse( pdf_file_names=pdf_file_names, pdf_bytes_list=pdf_bytes_list, p_lang_list=p_lang_list, output_dir=output_dir, img_writer=img_writer, parse_method="auto" )需要先执行
pip install -U "mineru[all]" pip install hf_xet下载模型,
from modelscope import snapshot_download snapshot_download('OpenDataLab/PDF-Extract-Kit-1.0', local_dir=r'D:\LLM\Local_model\PDF-Extract-Kit-1.0')并且设置环境变量
MINERU_MODEL_DIR = D:\LLM\Local_model\PDF-Extract-Kit-1.0然后运行代码,在指定目录下生成了md文件和相关的json等文件
用typora工具打开该md文件,效果如下:
文档格式没乱,原来pdf文件里是表格的地方,在md文件里还是表格,等等。