为什么你需要一个本地 PDF 解析器:LiteParse 完整上手指南
【免费下载链接】liteparseA fast, helpful, and open-source document parser项目地址: https://gitcode.com/GitHub_Trending/li/liteparse
在处理合同、发票、论文和扫描件时,PDF 是最常见的文档格式,也是大模型与 RAG 流程中最难啃的一块。LiteParse 是一个开源免费的本地 PDF 解析器:它把 PDF、扫描图片、Office 文档快速解析成结构化 Markdown、JSON 或纯文本,全程在本地机器运行,不上传任何数据、不依赖云端服务。本文将带你从零开始,用 3 分钟完成安装并跑通第一个 PDF 解析任务。
为什么需要一个本地 PDF 解析器?
| 痛点 | 云端解析服务 | LiteParse 本地解析 |
|---|---|---|
| 数据隐私 | 文档需上传到服务器 | ✅ 文件不出本机,适合合同、财报等敏感数据 |
| 使用成本 | 按页/按量收费 | ✅ 开源免费(Apache 2.0 协议) |
| 网络依赖 | 必须联网 | ✅ 完全离线,内网/隔离环境可用 |
| 处理速度 | 受队列与带宽限制 | ✅ Rust 编写,直接调用 PDFium 高速提取 |
| 输出可控性 | 黑盒 | ✅ 可输出带边界框的坐标数据,支持截图 |
一句话总结:当文档涉及隐私、成本敏感、或需要在离线环境批量处理时,本地 PDF 解析器几乎是唯一合理的选择。
LiteParse 核心功能一览
LiteParse 基于 Rust 构建,核心能力包括:
- ⚡快速文本解析:基于 PDFium 的空间文本解析,输出精确保留排版顺序
- 📦灵活 OCR 体系:内置 Tesseract 开箱即用,也可接入 EasyOCR、PaddleOCR 等任意 HTTP OCR 服务
- 📝多种输出格式:Markdown(标题、表格、列表、图片、链接)、JSON(含边界框坐标)、纯文本
- 🖼️页面截图生成:为 LLM 智能体生成高清页面截图,实现"视觉引用"
- 📄多格式输入:PDF、DOCX、XLSX、PPTX 和图片自动转换后统一解析
- 🌐多语言支持:Rust、Python、Node.js/TypeScript、浏览器 WASM 四种方式接入
其解析流程是:格式转换 → 文本提取 → 选择性 OCR → OCR 合并 → 网格投影重建版面,最终输出结构化数据。
3 分钟安装:一键安装步骤
LiteParse 通过你常用的包管理器安装,所有版本(WASM 除外)都附带同一个lit命令行工具:
| 语言 | 安装命令 |
|---|---|
| Node.js / TypeScript | npm i -g @llamaindex/liteparse |
| Python | pip install liteparse |
| Rust | cargo install liteparse(CLI)/cargo add liteparse(库) |
| 浏览器(WASM) | npm i @llamaindex/liteparse-wasm |
如果你想从源码构建或查看仓库,可以克隆项目:
git clone https://gitcode.com/GitHub_Trending/li/liteparse安装完成后,运行lit --help看到命令列表即代表安装成功。
第一次解析 PDF:命令行快速上手
拿到任意一个 PDF,一条命令即可解析:
# 基本解析,纯文本输出到终端 lit parse document.pdf # 渲染为 Markdown(标题、表格、列表、图片、链接) lit parse document.pdf --format markdown -o output.md # 输出带边界框坐标的结构化 JSON lit parse document.pdf --format json -o output.json # 只解析指定页 lit parse document.pdf --target-pages "1-5,10,15-20"对于扫描版文档(如下面的收据示例),LiteParse 的内置 OCR 会自动识别文字,输出可读的文本内容:
需要处理整个目录的文档?批量解析一条命令搞定:
lit batch-parse ./pdfs ./outputs生成页面截图(适合喂给 LLM 智能体):
lit screenshot document.pdf -o ./screenshots --dpi 300完整命令与参数说明可参考 cli-reference.md 与 getting_started.mdx。
扫描版 PDF 怎么办:OCR 配置指南
默认零配置:Tesseract 已随库打包,安装即可对扫描件做 OCR:
lit parse receipt.pdf # 默认启用 OCR lit parse receipt.pdf --ocr-language chi_sim # 指定识别语言 lit parse receipt.pdf --no-ocr # 关闭 OCR(纯文本层解析,更快)离线环境:通过TESSDATA_PREFIX环境变量指向预下载的.traineddata语言包目录即可。
追求更高精度:LiteParse 定义了简洁的 OCR HTTP API 规范(POST /ocr,返回带 bbox 的 JSON),仓库内附带 EasyOCR、PaddleOCR、SuryaOCR 的现成服务端实现,见 ocr/README.md 和 OCR_API_SPEC.md:
lit parse receipt.pdf --ocr-server-url http://localhost:8080进阶用法:文档复杂度检查与多格式输入
解析前先"体检":lit is-complex命令用一次廉价的纯文本层扫描,判断文档是否需要 OCR 或更重的处理,便于路由不同处理流水线或预估成本:
lit is-complex document.pdf # 可用作 shell 判断:简单文档就跳过 OCR lit is-complex document.pdf --quiet && lit parse document.pdf --no-ocr不只是 PDF:LiteParse 支持自动将多种文档转换为 PDF 再解析:
- Office 文档(Word/PPT/表格):安装 LibreOffice 后自动转换,如
.docx、.xlsx、.pptx、.csv等 - 图片:
.jpg、.png、.tiff、.webp、.svg等原生支持,无需额外依赖
谁最适合使用 LiteParse?场景清单
- 🤖RAG / LLM 管线开发者:干净的结构化 Markdown + 边界框坐标,直接喂给大模型
- 🔒企业文档处理:合同、财报、内部资料不出内网
- 🧾票据/扫描件数字化:内置 OCR 把收据、扫描 PDF 变成可检索文本
- 🖥️Agent 工作流:截图 + bbox 组合,实现"这句话在原文哪里"的视觉引用
- 🏭批量归档:
batch-parse一次性处理整个文档目录
项目资料与源码导读
- 中文完整文档:README.zh-CN.md
- 官方指南目录(Markdown 输出、OCR 配置、浏览器使用、视觉引用等):docs/src/content/docs/liteparse/guides/
- 核心 Rust 库与布局重建模块:crates/liteparse/src/
- OCR 服务示例(EasyOCR/PaddleOCR/SuryaOCR):ocr/
- Python 包封装:packages/python/liteparse/parser.py
- 浏览器演示站点:wasm-demo-site/index.html
从安装到解析只需要一条lit parse命令,配合内置 OCR、Markdown 输出和边界框坐标,LiteParse 是一个上手极简、能力却相当完整的本地 PDF 解析工具。现在就可以打开终端,把第一个 PDF 变成结构化数据了。
【免费下载链接】liteparseA fast, helpful, and open-source document parser项目地址: https://gitcode.com/GitHub_Trending/li/liteparse
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考