一、引子:当语言遇见规划
2030年的某个下午,NASA的任务规划工程师面对一个棘手的问题:火星探测器传回了一段模糊的自然语言描述,“如果前面的岩石看起来不太稳,就绕到左边拍张全景,然后分析一下土壤成分”。
这句话对于人类工程师来说不难理解——但对于传统HTN规划器来说,这简直是一道"天书":
- "看起来不太稳"是什么条件?如何形式化?
- "绕到左边"如何量化?没有具体方位
- "全景"要覆盖多大范围?
- "分析土壤成分"需要哪些具体操作?
传统HTN规划的致命弱点暴露无遗:它需要精确的、形式化的输入,而人类用自然语言描述任务时充满模糊性和上下文依赖。
大型语言模型(LLM)的出现在很大程度上填补了这个空白。LLM能够理解自然语言的不确定性,进行知识推理,甚至"创造"出新的方法。但LLM的输出不稳定、不可解释、无法保证约束满足。
于是,一个自然而然的想法浮现:
能否让LLM和HTN各取所长?让LLM处理语言理解和知识推理,让HTN处理严格的约束和可解释的执行?
这就是"LLM+HTN"研究的核心动机。
二、LLM与HTN:能力互补的深度分析
2.1 LLM的核心优势
自然语言理解与知识推理
LLM在以下方面具有显著优势:
- 语义理解:能够理解"不太稳"、"绕到左边"这类模糊表达
- 世界知识:知道岩石、土壤、火星探测器等实体的属性和行为
- 上下文推理:根据当前场景补充缺失信息
- 隐式意图识别:理解用户没有明确说出但隐含的目标
方法合成(Method Synthesis)
传统HTN领域需要人工设计方法(method),这是一个耗时费力的过程。LLM能够:
- 根据任务描述"即时生成"可行的分解方法
- 从训练数据中学习类似任务的分解模式
- 在陌生领域也能进行"零样本方法合成"
创造性问题解决
当遇到领域设计中未覆盖的情况时,LLM能够"发明"新的解决路径,而不是束手无策。
2.2 HTN的核心优势
严格约束与可解释执行
HTN在以下方面具有不可替代的优势:
- 形式化约束:明确的前置条件、效果、状态变化
- 层次分解:复杂任务的结构化分解,每层分解都有明确的语义
- 可解释性:规划过程透明,可以追溯每个决策的原因
- 确定性执行:一旦规划完成,执行过程是确定性的,不会"幻觉"
可验证性
HTN领域可以经过形式化验证,确保关键安全约束得到满足。
2.3 互补性矩阵
| 能力维度 | LLM | HTN | 两者结合 |
|---|---|---|---|
| 自然语言理解 | ✅ 强 | ❌ 弱 | ✅ LLM处理输入 |
| 模糊推理 | ✅ 强 | ❌ 弱 | ✅ LLM处理不确定性 |
| 约束满足 | ❌ 弱 | ✅ 强 | ✅ HTN保证约束 |
| 可解释性 | ❌ 弱 | ✅ 强 | ✅ HTN提供解释 |
| 方法合成 | ✅ 强 | N/A | ✅ LLM生成+HTN验证 |
| 形式化验证 | ❌ 弱 | ✅ 强 | ✅ HTN提供验证框架 |
| 适应性 | ✅ 强 | ❌ 弱 | ✅ LLM提升适应性 |
三、当前研究热点
3.1 LLM作为HTN方法生成器
这是最直观的应用场景:用LLM来自动生成HTN领域中的方法(method)。
核心思想:
用户描述 → LLM解析 → LLM生成方法 → HTN验证 → 执行典型系统:PlanCLaude
PlanCLaude是一个代表性的研究系统,它的工作流程:
- 任务理解:用户用自然语言描述任务目标
- LLM分析:LLM理解任务,识别关键实体、约束和目标
- 方法生成:LLM生成候选的HTN方法结构
- HTN验证:将LLM生成的方法转化为形式化描述,用HTN规划器验证其可行性
- 迭代优化:如果验证失败,将错误信息反馈给LLM,让其修正
关键发现:LLM生成的方法在语法层面往往正确,但在语义约束层面经常出错。这正是HTN验证器存在的价值——它像一道"防火墙",阻止不合格的方法进入执行阶段。
3.2 HTN作为LLM规划的约束框架
另一种思路是用HTN来约束LLM的规划输出,解决LLM规划"不可靠"的问题。
核心思想:
用户描述 → LLM生成候选规划 → HTN约束检查 → 合规规划执行关键机制:
- 约束注入:在LLM生成规划之前,先将HTN领域的约束以提示(prompt)形式注入
- 规划验证:LLM生成规划后,用HTN规划器验证其约束满足性
- 约束修复:如果规划违反约束,将违反的具体约束反馈给LLM,让其重新生成
这种方法在机器人任务规划中特别有效,因为机器人的物理约束(如碰撞避免、关节角度限制)必须严格满足。
3.3 混合架构:双系统协同
更前沿的架构是LLM和HTN作为两个并行的子系统协同工作:
架构特点:
- LLM子系统:负责高层任务理解、方法合成、非结构化问题处理
- HTN子系统:负责低层规划执行、约束验证、确定性任务处理
- 协调器:根据任务类型动态分配给合适的子系统
用户输入 ↓ ┌─────────────┐ │ 协调器 │ └─────────────┘ ↓ ↓ LLM HTN 子系统 子系统 ↓ ↓ ┌─────────────┐ │ 结果融合 │ └─────────────┘ ↓ 执行/反馈3.4 基于LLM的HTN领域学习
这是最激动人心的方向之一:从自然语言描述或演示中自动学习HTN领域。
研究进展:
- 给定任务描述,自动提取任务层次结构
- 给定执行演示,自动推断任务分解模式
- 给定目标状态,自动生成达成目标的方法序列
这类工作尚处于早期阶段,但展示了"让机器自动建立任务规划领域"的诱人前景。
四、挑战与限制
4.1 幻觉问题(Hallucination)
问题描述:LLM可能生成听起来合理但实际错误的HTN方法。
具体表现:
- 方法的前提条件写错(如"火星探测器"需要"太阳能充足",但LLM编造了错误的条件)
- 方法的效果描述与实际不符
- 任务分解层次不合理
缓解策略:
- 严格的验证机制:所有LLM生成的方法都必须经过HTN规划器验证
- 置信度阈值:当LLM对其输出的置信度低于阈值时,触发人工审核
- 混合生成:让LLM只生成高层框架,具体的参数由规则引擎填充
4.2 符号接地问题(Symbol Grounding)
问题描述:LLM理解的"岩石"与HTN领域中的rock符号可能不匹配。
具体表现:
- LLM说"那块大石头",但HTN领域中没有精确对应的对象
- LLM生成的目标状态(如"探测器处于安全位置")无法形式化为具体谓词
缓解策略:
- 符号映射表:维护自然语言表达与领域符号的映射
- 语义验证:生成后检查是否所有符号都能接地到具体对象
- 上下文追踪:在对话中持续维护当前场景的符号状态
4.3 实时性问题
问题描述:LLM推理速度慢,无法满足航天任务规划的实时性要求。
具体表现:
- 深空探测器的紧急避障需要在毫秒级响应
- LLM生成方法可能需要几秒钟
- 多次LLM调用累积的延迟不可接受
缓解策略:
- 缓存预生成:对常见任务模式预先生成LLM方法,存在"方法库"中
- LLM轻量化:使用更小的模型处理简单情况,只在复杂时调用大模型
- 异步规划:将LLM处理放在规划周期之外,遇到未见过的任务时"边学边用"
4.4 验证复杂性
问题描述:即使有HTN规划器验证,完整的约束检查仍然耗时。
缓解策略:
- 增量验证:只检查新增/修改的部分,不用全量重验
- 分层验证:先做快速的语法检查,再做耗时的语义验证
- 牺牲部分完备性:对复杂领域放松验证要求,换取响应速度
五、未来展望
5.1 近期方向(1-3年)
更实用的系统集成:
- 开发完整的LLM+HTN工具链,降低使用门槛
- 针对特定领域(如航天、机器人)优化集成方案
- 提升验证效率,减少LLM调用的数量
基准测试建立:
- 建立LLM+HTN的标准评估基准
- 定义"成功"的度量标准
- 公开测试数据集,供研究者对比
5.2 中期方向(3-5年)
自适应领域学习:
- 系统能够从用户反馈中自动改进HTN领域
- 持续学习用户的偏好和约束
- 自动化领域维护和更新
多模态融合:
- 不仅处理自然语言,还融合视觉、语音等多模态输入
- LLM理解场景图像,生成对应的HTN规划
- 适用于需要"看"环境的任务(如视觉导航)
5.3 长期愿景(5年+)
通用任务规划助手:
- 一个能够理解任何自然语言任务描述的系统
- 自动构建HTN领域,执行规划,解释结果
- 非专业用户也能使用的任务规划工具
认知架构的一部分:
- LLM+HTN是更大认知架构的组件
- 与记忆系统、因果推理、目标管理整合
- 实现真正"像人类一样任务规划"的AI系统
六、总结
核心要点
- 互补性:LLM擅长语言理解和知识推理,HTN擅长约束满足和可解释执行,两者天然互补
- 两种融合方式:
- LLM生成 + HTN验证(LLM作为方法生成器)
- LLM建议 + HTN约束(HTN作为LLM的约束框架)
- 主要挑战:幻觉问题、符号接地、实时性限制、验证复杂性
- 应用前景:在航天任务规划、机器人控制、智能助手等领域有广阔前景
系列进度
- ✅ 基础篇(1-4):任务规划概述、HTN定义、STN对比、TFD算法
- ✅ 理论篇(5-6, 10):不可判定性、表达能力、分解性质
- ✅ 实践篇(7-9):领域设计、规划器对比、与经典规划关系
- ✅ 前沿篇(11-16):调试指南、HDDL、Timeline Planning、LLM+HTN、概率性HTN、研究前沿
下篇预告
下一篇文章我们将探讨HTN规划的前沿方向——概率性HTN与不确定性规划。当HTN遇上概率,如何在不确定环境中进行任务规划?这将是一个理论与实践并重的挑战。