法律模板详解:Hyper-Extract 合同义务、案例时间线、合规清单提取指南
2026/9/2 14:49:26 网站建设 项目流程

法律模板详解:Hyper-Extract 合同义务、案例时间线、合规清单提取指南

【免费下载链接】Hyper-ExtractHypergraph is more powerful. Transform unstructured text into structured knowledge with LLMs. Graphs, hypergraphs, and spatio-temporal extractions — with one command.项目地址: https://gitcode.com/GitHub_Trending/hy/Hyper-Extract

Hyper-Extract 是一个利用大语言模型(LLM)把非结构化文本转换为结构化知识的开源工具。它的内置法律模板可以帮你从合同、判决书、合规手册中一键提取合同义务关系、案件事实时间线和合规清单,省去人工逐条划重点的繁琐工作 📄。本文带你逐一拆解 5 个法律模板的适用场景、核心字段和使用方法。

为什么法律文档适合结构化提取

法律文档天然是"高密度非结构化文本":

  • 合同里甲乙丙多方权利义务交叉引用,人工梳理容易遗漏
  • 判决书中事实、证据、时间线交织在长篇文字里
  • 合规手册要求、法规依据、期限、责任人分散在各章节

Hyper-Extract 的思路是:用一个 YAML 模板定义"要提取什么、输出成什么结构",再交给 LLM 按模板规则完成抽取。法律文档因此可以被转成超图(多方关系)、时间线(带时间戳的图)、清单、集合等结构,后续还能用he search语义检索、he show可视化。

法律模板全家福一览

Hyper-Extract 在 hyperextract/templates/presets/legal/ 下提供了 5 个法律领域模板:

模板输出类型适合文档核心能力
contract_obligationhypergraph(超图)服务合同、采购合同提取多方权利义务网络
case_fact_timelinetemporal_graph(时间线)判决书、证据材料构建带日期的案件事实时间线
case_citationgraph(图谱)判决书、法律意见书提取判例引用关系网络
compliance_listlist(清单)合规手册、审计报告结构化合规要求清单
defined_term_setset(集合)合同、法律文书提取术语定义并去重

5 个模板恰好覆盖了 Hyper-Extract 支持的不同数据结构类型——多方关系用超图、带时间关系用时间线图、有序要求用清单、术语用集合:

合同义务超图:把合同变成"义务网络"

contract_obligation.yaml 采用超图类型,这是它和其他模板最大的不同:普通图只表达"A 指向 B"的两点关系,而合同义务天然是多方的——比如"甲方在收到验收报告后 10 日内支付尾款"涉及多个当事人和多个义务要素,超图的一条边可以连接多个实体。

它提取的内容:

  • 实体:合同当事人 + 义务要素(当事人/义务/权利/条件/例外/违约/赔偿等类型)
  • 关系:每条义务关系包含party(涉及的各方)、obligation(具体义务)、trigger(触发条件)、exception(例外情形)、type(关系类型,如"必须履行""由…触发""由…豁免")

模板内置的提取准则会以"专业合同律师"的角色要求 LLM 工作,并强调"仅提取文本中明确表达的义务关系",避免模型编造 🎯。

CLI 一行搞定:

he parse contract.md -t legal/contract_obligation -l zh

提取结果可以用he show打开交互式可视化页面,直观查看谁对谁负有什么义务。

案件事实时间线:让判决书"按日期说话"

case_fact_timeline.yaml 使用时间线类型,专为判决书和证据材料设计。

它提取的内容:

  • 实体:案件事实、证据(含证据编号)、证人、物证、书证、鉴定意见等
  • 关系:每条关系带source(前置事实)、target(后续事实)、type(先于/证明/争议/确认/否认/采信/排除)、time(事实日期)和disputed(是否争议)字段

其中time字段是时间线类型的核心能力——每条边都锚定一个日期,支持"2024-01-15""2024年1月"甚至"案发当日"这类模糊时间。你可以快速回答"起诉前被告做了什么""哪些事实存在争议"这类问题 ⏱️。

he parse case_summary.md -t legal/case_fact_timeline -l zh

合规清单:从合规手册直接生成检查表

compliance_list.yaml 是最简单的清单类型模板,输出每条合规要求一张"结构化卡片":

字段说明
requirement合规要求描述(完整保留原文核心含义)
regulation依据法规(标注具体法规名称和条款)
deadline完成期限(明确时间节点)
responsible_party责任人或责任部门(尽量具体到部门或个人)

合规分析师角色 + 明确的提取规则,让输出可以直接用作内部检查表,粘贴到表格或任务系统里就能分派跟踪 ✅。

he parse compliance_manual.md -t legal/compliance_list -l zh -o ./compliance/

提取后还可以用he talk ./compliance/直接和这份清单对话,比如问"哪些要求没有明确责任人?"

另外两位帮手:判例引用图与术语集合

  • case_citation.yaml(图谱类型):从判决书和法律意见书中提取"案件 ↔ 条款/法规"的引用网络,关系类型包括引用、区分、推翻、遵循、参照。做类案检索时,一眼看清哪些判例被高频引用、哪些已被推翻。
  • defined_term_set.yaml(集合类型):自动收集合同中所有"大写定义术语",输出术语、定义位置(条款编号)、含义摘要三要素,且会自动去重合并同一术语的多次定义——审查合同时先跑它,等于拿到一份自带定位的合同词表。

提取结果长什么样:可视化与检索

对图谱类结果执行he show <ka_path>,Hyper-Extract 会启动一个交互式网页:左侧是节点数、边数、平均度数等统计,中间是可缩放拖拽的关系网络,点选任意节点还能查看它的详细信息:

对清单类结果,则可以用语义检索快速定位条款:

he build-index ./compliance/ he search ./compliance/ "关于数据安全的义务"

快速上手三步

  1. 安装pip install hyperextract,或从仓库克隆后pip install .(详见 installation.md)
  2. 配置he config --help设置你使用的 LLM 与 Embedding
  3. 提取he list template查看全部模板,然后he parse 文档.md -t legal/模板名 -l zh

项目自带中英文示例脚本 legal_template.py,以及一份完整的中文 MSA 主服务协议样例 msa_contract_sample.md,可以直接拿来跑通全流程。

小结与延伸阅读

你的文档推荐模板组合
服务/采购合同contract_obligation+defined_term_set
判决书、案件总结case_fact_timeline+case_citation
合规手册、审计报告compliance_list

法律模板只是 Hyper-Extract 38 个内置模板之一,同一套方法同样适用于金融、医疗、工业等领域。更多细节可参考官方文档:legal.md(法律模板参考)与 legal-contract.md(法律文档分析完整工作流)。

【免费下载链接】Hyper-ExtractHypergraph is more powerful. Transform unstructured text into structured knowledge with LLMs. Graphs, hypergraphs, and spatio-temporal extractions — with one command.项目地址: https://gitcode.com/GitHub_Trending/hy/Hyper-Extract

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询