法律模板详解:Hyper-Extract 合同义务、案例时间线、合规清单提取指南
【免费下载链接】Hyper-ExtractHypergraph is more powerful. Transform unstructured text into structured knowledge with LLMs. Graphs, hypergraphs, and spatio-temporal extractions — with one command.项目地址: https://gitcode.com/GitHub_Trending/hy/Hyper-Extract
Hyper-Extract 是一个利用大语言模型(LLM)把非结构化文本转换为结构化知识的开源工具。它的内置法律模板可以帮你从合同、判决书、合规手册中一键提取合同义务关系、案件事实时间线和合规清单,省去人工逐条划重点的繁琐工作 📄。本文带你逐一拆解 5 个法律模板的适用场景、核心字段和使用方法。
为什么法律文档适合结构化提取
法律文档天然是"高密度非结构化文本":
- 合同里甲乙丙多方权利义务交叉引用,人工梳理容易遗漏
- 判决书中事实、证据、时间线交织在长篇文字里
- 合规手册要求、法规依据、期限、责任人分散在各章节
Hyper-Extract 的思路是:用一个 YAML 模板定义"要提取什么、输出成什么结构",再交给 LLM 按模板规则完成抽取。法律文档因此可以被转成超图(多方关系)、时间线(带时间戳的图)、清单、集合等结构,后续还能用he search语义检索、he show可视化。
法律模板全家福一览
Hyper-Extract 在 hyperextract/templates/presets/legal/ 下提供了 5 个法律领域模板:
| 模板 | 输出类型 | 适合文档 | 核心能力 |
|---|---|---|---|
contract_obligation | hypergraph(超图) | 服务合同、采购合同 | 提取多方权利义务网络 |
case_fact_timeline | temporal_graph(时间线) | 判决书、证据材料 | 构建带日期的案件事实时间线 |
case_citation | graph(图谱) | 判决书、法律意见书 | 提取判例引用关系网络 |
compliance_list | list(清单) | 合规手册、审计报告 | 结构化合规要求清单 |
defined_term_set | set(集合) | 合同、法律文书 | 提取术语定义并去重 |
5 个模板恰好覆盖了 Hyper-Extract 支持的不同数据结构类型——多方关系用超图、带时间关系用时间线图、有序要求用清单、术语用集合:
合同义务超图:把合同变成"义务网络"
contract_obligation.yaml 采用超图类型,这是它和其他模板最大的不同:普通图只表达"A 指向 B"的两点关系,而合同义务天然是多方的——比如"甲方在收到验收报告后 10 日内支付尾款"涉及多个当事人和多个义务要素,超图的一条边可以连接多个实体。
它提取的内容:
- 实体:合同当事人 + 义务要素(当事人/义务/权利/条件/例外/违约/赔偿等类型)
- 关系:每条义务关系包含
party(涉及的各方)、obligation(具体义务)、trigger(触发条件)、exception(例外情形)、type(关系类型,如"必须履行""由…触发""由…豁免")
模板内置的提取准则会以"专业合同律师"的角色要求 LLM 工作,并强调"仅提取文本中明确表达的义务关系",避免模型编造 🎯。
CLI 一行搞定:
he parse contract.md -t legal/contract_obligation -l zh提取结果可以用he show打开交互式可视化页面,直观查看谁对谁负有什么义务。
案件事实时间线:让判决书"按日期说话"
case_fact_timeline.yaml 使用时间线类型,专为判决书和证据材料设计。
它提取的内容:
- 实体:案件事实、证据(含证据编号)、证人、物证、书证、鉴定意见等
- 关系:每条关系带
source(前置事实)、target(后续事实)、type(先于/证明/争议/确认/否认/采信/排除)、time(事实日期)和disputed(是否争议)字段
其中time字段是时间线类型的核心能力——每条边都锚定一个日期,支持"2024-01-15""2024年1月"甚至"案发当日"这类模糊时间。你可以快速回答"起诉前被告做了什么""哪些事实存在争议"这类问题 ⏱️。
he parse case_summary.md -t legal/case_fact_timeline -l zh合规清单:从合规手册直接生成检查表
compliance_list.yaml 是最简单的清单类型模板,输出每条合规要求一张"结构化卡片":
| 字段 | 说明 |
|---|---|
requirement | 合规要求描述(完整保留原文核心含义) |
regulation | 依据法规(标注具体法规名称和条款) |
deadline | 完成期限(明确时间节点) |
responsible_party | 责任人或责任部门(尽量具体到部门或个人) |
合规分析师角色 + 明确的提取规则,让输出可以直接用作内部检查表,粘贴到表格或任务系统里就能分派跟踪 ✅。
he parse compliance_manual.md -t legal/compliance_list -l zh -o ./compliance/提取后还可以用he talk ./compliance/直接和这份清单对话,比如问"哪些要求没有明确责任人?"
另外两位帮手:判例引用图与术语集合
- case_citation.yaml(图谱类型):从判决书和法律意见书中提取"案件 ↔ 条款/法规"的引用网络,关系类型包括引用、区分、推翻、遵循、参照。做类案检索时,一眼看清哪些判例被高频引用、哪些已被推翻。
- defined_term_set.yaml(集合类型):自动收集合同中所有"大写定义术语",输出术语、定义位置(条款编号)、含义摘要三要素,且会自动去重合并同一术语的多次定义——审查合同时先跑它,等于拿到一份自带定位的合同词表。
提取结果长什么样:可视化与检索
对图谱类结果执行he show <ka_path>,Hyper-Extract 会启动一个交互式网页:左侧是节点数、边数、平均度数等统计,中间是可缩放拖拽的关系网络,点选任意节点还能查看它的详细信息:
对清单类结果,则可以用语义检索快速定位条款:
he build-index ./compliance/ he search ./compliance/ "关于数据安全的义务"快速上手三步
- 安装:
pip install hyperextract,或从仓库克隆后pip install .(详见 installation.md) - 配置:
he config --help设置你使用的 LLM 与 Embedding - 提取:
he list template查看全部模板,然后he parse 文档.md -t legal/模板名 -l zh
项目自带中英文示例脚本 legal_template.py,以及一份完整的中文 MSA 主服务协议样例 msa_contract_sample.md,可以直接拿来跑通全流程。
小结与延伸阅读
| 你的文档 | 推荐模板组合 |
|---|---|
| 服务/采购合同 | contract_obligation+defined_term_set |
| 判决书、案件总结 | case_fact_timeline+case_citation |
| 合规手册、审计报告 | compliance_list |
法律模板只是 Hyper-Extract 38 个内置模板之一,同一套方法同样适用于金融、医疗、工业等领域。更多细节可参考官方文档:legal.md(法律模板参考)与 legal-contract.md(法律文档分析完整工作流)。
【免费下载链接】Hyper-ExtractHypergraph is more powerful. Transform unstructured text into structured knowledge with LLMs. Graphs, hypergraphs, and spatio-temporal extractions — with one command.项目地址: https://gitcode.com/GitHub_Trending/hy/Hyper-Extract
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考