☰
【IROS 2026】TIC:人群中的移动目标主动拦截,在线 POMDP 规划中动作空间结构的决定性作用|从人群导航与在线规划视角
2026/10/11 7:21:06 网站建设 项目流程

摘要

本文解读 IROS 2026 论文《Beyond Fixed Goal Delivery: Online POMDP Planning for Target Interception in Crowds》。该论文提出人群中的目标拦截(Target Interception in Crowds,TIC)问题,把"机器人主动追上并拦截正在移动的收件人"建模为部分可观测马尔可夫决策过程(POMDP),通过融合人类意图信念推断、在线树搜索与两类动作空间构造,在完全相同的感知、信念、奖励与算力预算下做受控对比,其特别之处在于把动作空间结构当成唯一自变量单独隔离出来测量。实验表明在 200 人高密度场景下,联合选择转向与速度的 ESP 安全成功率达到 97%,比路径-速度解耦的 P-LSP 高出 31 个百分点,并把平均拦截时间从 90.9 s 压到 63.3 s(少约 44%);而且在目标状态只能被间歇观测时,这一结构优势依然成立,为人群导航与移动目标拦截提供了重要借鉴。

视频讲解:点击观看 B 站视频

  • 摘要
  • 论文基本信息
  • 背景与动机
  • 研究主线:从问题到结论
  • 基准/方法设计
  • 分类全景
  • 方法细节
  • 实验设计与结果
  • 结果对比总结
  • 关键发现
  • 局限性
  • 常见问题(FAQ)
    • TIC 和传统的移动目标拦截有什么不同?
    • 为什么"先规划路径再调速"在人群密集时会失效?
    • ESP 比 LSP 到底强在哪里?有量化证据吗?
    • 目标状态看不见时结论还成立吗?
    • 这个结论可以推广到连续动作空间或真机吗?
    • 这篇论文的写法有什么值得借鉴的地方?
  • 参考链接

论文基本信息

项目内容
标题(英文)Beyond Fixed Goal Delivery: Online POMDP Planning for Target Interception in Crowds
标题(中文)人群中的移动目标主动拦截:在线 POMDP 规划中动作空间结构的决定性作用
作者Himanshu Gupta, Kelvin Aladum, Nisar Ahmed, Bradley Hayes, Zachary Sunberg
机构University of Colorado Boulder · 航空航天科学系 & 计算机科学系
会议IROS 2026
arXivarXiv:2607.18517
项目网站tic-planning.github.io

背景与动机

传统配送假设收件人待在固定地点等待,于是任务被简化为"到点即达"的导航问题。但在医院、机场这类人流密集的场所,更高效的策略是让机器人主动追上并拦截移动中的目标——这正是本文定义的 TIC 问题。难点在于两重不确定性同时存在:目标自身在移动,而周围行人各自抱着不可观测的意图。

  • 移动目标拦截的历史局限:既有工作大多假设环境静态,或把动态障碍视为已知确定量。基于 Dubins 曲线的时间/长度最优拦截在曲率受限条件下给出解析解,但缺少拥挤环境;Qu et al.(ACC 2022)提出"先预测目标轨迹 → 选拦截点 → 规划路径 → 用时空图调速"的流水线,性能依赖轨迹预测是否可靠,无法处理密集的意图驱动交互。
  • 人群导航下的意图不确定性:Bai et al.(ICRA 2015)首次把在线 POMDP用于人群中自动驾驶,确立有限空间规划(Limited Space Planning,LSP)范式——先算一条路径,再沿路径调速;Gupta et al.(AAMAS 2022)提出扩展空间规划(Extended Space Planning,ESP),让在线树搜索同时决定转向与速度,但目标是固定点。
  • 联合优化类方法:MPC 与开环反馈控制方法也同时优化朝向与速度,但每个决策周期只计算一条开环轨迹,不像树搜索那样在多种人类反应上做闭环分支。
  • 本文要填的缺口:现有工作从未检验"路径-速度解耦"这一结构假设,在动态拦截场景下会随人群密度上升如何失效。

从历史脉络看(对应附录 H),这条线经历了四步:2015 年 LSP 成为人群导航的默认范式 → 2022 年 ESP 让转向与速度一起进入搜索、但目标仍是固定点 → 2023–2025 年一批工作用学习价值近似或联合优化扩展人群导航、仍未处理移动目标 → 2026 年本文把 ESP 迁移到动态拦截,并给出路径受限与联合搜索的受控结构对比。

为什么动作空间表达力对拦截尤为关键?因为人群造成的延迟决定了"何时、何地"能完成截获,一旦朝向被冻结在参考路径上,时间与空间决策就解耦失败;而在固定算力下搜索只能覆盖动作空间的稀疏子集,动作空间的形状直接决定能不能发现绕行机动。

实验协议上(对应附录 B),每个"规划器 × 人群密度"组合跑500 次配对试验,三条臂共享同一目标与行人初始化以及同一批运动实现,因此可以做配对统计比较;一次试验在机器人进入1 m 截获半径时记为成功,在 300 s 超时或撞上工作区边界时终止;机器人在移动状态下进入任何行人1 m安全范围内记一次接近违规,违规不终止试验但计入安全成功率。为维持恒定密度,行人到达目标后被移除并沿边界重生、新目标取在对侧;机器人从左下角出发、目标从右上角出发,保证每次都必须穿越人群。

研究主线:从问题到结论

图 7:TIC 研究主线(Mermaid 流程图)。从"人群中主动拦截移动目标"的问题出发,经"路径-速度解耦够用吗"的动机、"受控对比三条规划臂"的设计,到同一 ARDESPOT 求解器下的方法对比,最终在 4 档密度 × 500 配对试验的实验设置上得到"空间受限规划在高密度下失效"的结论。

基准/方法设计

论文的核心设计是受控隔离:三条规划器共享同一套信念表示、求解器参数、奖励模型与算力预算,唯一变化的变量是动作空间如何暴露给在线树搜索。

  • R-LSP(Reactive LSP):Hybrid A* 先算出一条运动学可行路径,朝向随之被冻结;树搜索只在这条路径上选择速度更新 $\delta_v \in {-0.5, 0, 0.5}$ m/s,路径生成时用保守的膨胀安全边界吸收人类意图不确定性。
  • P-LSP(Predictive LSP):在 R-LSP 基础上,路径规划阶段按目标动力学把目标状态外推,朝预测的未来位置规划路径——这是 LSP 的加强版,用来检验"失败是不是因为路径规划器不够好"。
  • ESP(Extended Space Planning):取消参考路径约束,树搜索直接选择转向角(7 个离散值 $\in[-\phi_m, \phi_m]$)与速度更新,朝向在搜索过程中自适应;为了控制分支因子,速度分支只在 $\phi = 0$ 时开放。
  • 公平性约束:LSP 最多给路径生成分配 0.1 s,超时则沿用上一周期的路径;ESP 把完整的 0.5 s 预算投给树搜索。三条臂的 rollout 使用完全相同的行人接近度速度调制策略,因此空间行为的差异只能来自动作空间本身。
规划器转向自由度速度更新参考路径
R-LSP由路径决定(冻结)${-0.5, 0, 0.5}$ m/sHybrid A* → 当前目标
P-LSP由路径决定(冻结)${-0.5, 0, 0.5}$ m/sHybrid A* → 预测目标
ESP7 个离散值 $\in[-\phi_m, \phi_m]$${-0.5, 0, 0.5}$ m/s无(转向-速度联合搜索)

图 1:TIC(Target Interception in Crowds)任务场景。白色为机器人,黄色为需要拦截的移动目标,黑色为行人;机器人只能在有限感知区域内观测行人,并用彩色信念条表示对每个行人意图的估计。上图为俯视图,下图为同一场景的透视视角。

分类全景

图 8:三类规划器分类全景(Mermaid 流程图)。三条规划臂共享信念表示、奖励模型与 0.5 s 算力预算;LSP 家族又分为路径指向当前目标的 R-LSP 与路径指向预测目标的 P-LSP,ESP 则用 7 个转向值 × 3 个速度更新做联合搜索。

方法细节

TIC 被形式化为 POMDP 元组 $(S, A, Z, T, O, R, \gamma)$。状态由三部分组成:机器人状态 $s_R$、目标状态 $s_T$ 与 $N$ 个附近行人状态 ${s_H^i}$,其中每个行人带有不可观测的意图变量 $g_i$(离散候选目标点)。机器人对每个行人维持一个类别信念分布 $b_i(g)$,初始为均匀分布,之后按贝叶斯规则更新:$b_{t+1}(s') \propto O(s', a_t, z_{t+1}) \sum_{s \in S} T(s, a_t, s') b_t(s)$。

  • 运动学与动作:机器人是车式模型 $s_R=(x_R, y_R, \theta_R, v_R)$,控制量为转向角 $\phi_R$ 与速度增量 $\delta_v$,速度按 $v_R \leftarrow \mathrm{clip}(v_R + \delta_v, 0, v_m)$ 更新,朝向按 $\dot{\theta}_R = (v_R / L)\tan\phi_R$ 演化,其中轴距 $L = 0.75$ m、最高速度 $v_m = 2$ m/s、最大转向角 $\phi_m = 0.475$ rad;目标按恒定速度与恒定转向率运动,行人恒速朝各自目标点行进。
  • 奖励设计:成功拦截获得终端奖励,撞上工作区边界罚 $R_{obs}$,在移动状态下进入行人安全距离 $d_s$ 触发接近惩罚 $R_h$(采用 not-at-fault 形式,静止时不计罚),选择急刹动作罚 $R_{SB}$,每步再扣一个 $R_{step}$ 以促使尽快完成拦截。
  • 在线树搜索:使用 POMDPs.jl 中的ARDESPOT在线求解,决策周期 $\Delta t = 0.5$ s、运行频率 2 Hz,规划与执行在时间上重叠;每个节点从当前信念采样 $K = 50$ 个情景,只把最近的 $N = 6$ 个行人纳入搜索以聚焦安全关键交互,叶子节点用 rollout 仿真估计长时域价值。
  • rollout 策略:奖励稀疏(只有截获才给正奖励),因此两条臂都需要主动朝目标推进的 rollout。LSP 的 rollout 沿参考路径、用"远于 $D_{far}$ 加速、近于 $D_{near}$ 减速"的反应式控制器调速;ESP 的 rollout 在同样的速度调制之外,把每个候选转向命令与选定速度组合并前向仿真 $\Delta t$,选择让机器人最接近外推目标状态的动作。
  • 稀疏观测的处理:机器人、目标与行人位置在建模中被视为无噪观测,以隔离意图不确定性;观察空间在 ARDESPOT 中按 2 m 的空间分辨率离散化,因为该求解器要求离散观测。

图 2:两条臂搜索树的对比。左为 LSP——先算出到预测目标位置的路径(虚线),树搜索只能沿该路径选速度,遇到与行人的碰撞时只能减速;右为 ESP——搜索探索多条空间轨迹,找到无碰撞状态后用 rollout 评估,最终选择右转绕行。

实验设计与结果

实验在50 m × 50 m 无障碍工作区中进行,机器人采用上述自行车模型,人群规模取 $N_h \in {50, 100, 150, 200}$ 四档,行人恒速朝四个角落之一行进、目标以恒定转向率运动。主研究假设目标状态完全可观测;次级研究则用 15 m、180° 视场的探测器加 10% 漏检概率提供间歇观测,再用 1000 个粒子的序贯重要性重采样(SIR)粒子滤波维护目标状态信念,规划器只使用最大后验(MAP)粒子作为目标状态。每条臂在每个密度下各跑 500 次配对试验。

规划器成功率(主研究,200 人)安全成功率(主研究)成功率(次级研究)平均拦截时间(次级研究)
ESP(转向 + 速度联合搜索)98%97%约 90%98.2 s
P-LSP(路径 → 预测目标)96%66%83%113.1 s
R-LSP(路径 → 当前目标)73%44%69%132 s

在低密度(50 人)下三条臂几乎重合,但从 100 人起差距单调扩大。主研究中 200 人时,ESP 与 P-LSP 的成功率仍有 98% 与 96%,但安全成功率分化为 97% 与 66%(相差 31 个百分点)、R-LSP 仅 44%;拦截时间上 ESP 平均63.3 s,P-LSP 为90.9 s,即 ESP 少用约 44% 的时间。次级研究中所有规划器成功率下降(目标只能靠估计),但 ESP 的结构优势保留:安全成功率87%对 P-LSP 的 56%;200 人时 ESP 平均 98.2 s 完成拦截,P-LSP 需 113.1 s、R-LSP 需 132 s。

图 3:主研究(目标完全可观测)。左至右分别是成功率、安全成功率与截获时间随人群密度的变化。安全成功率最能说明问题——R-LSP 一路下滑、P-LSP 明显落后,而 ESP 几乎保持水平。

图 4:次级研究(间歇观测 + 粒子滤波 MAP 估计)。整体曲线下移一档,说明目标估计误差会损害所有规划器,但 ESP 相对两条 LSP 的结构性优势依然成立。

图 5:次级研究运动学特征。在空闲时间、平均速度、急刹次数三个指标上 ESP 都优于两条 LSP,而它的行驶距离更长、拦截反而更快,说明它是持续机动而不是走走停停。

图 6:次级研究中使用 ESP 的一次代表性拦截试验快照(第 5、15、30、50、60 秒)。红点为粒子滤波信念、橙色曲线为机器人实际轨迹;机器人一路穿过密集人群逼近目标并完成拦截。

结果对比总结

图 9:结果对比总结(Mermaid 流程图)。LSP 路径受限在 200 人时安全成功率为 44%–66%,ESP 联合搜索为 97%;ESP 的空闲时间更短、均速更高、急刹更少,主研究拦截时间 63.3 s 对 90.9 s,少约 44%。

关键发现

  • 安全成功率的分化最剧烈:200 人时 ESP 的安全成功率 97%,P-LSP 66%、R-LSP 44%——ESP 比 P-LSP 高31 个百分点,比 R-LSP 高53 个百分点。
  • 时间效率同样拉开:主研究中 ESP 平均63.3 s完成拦截,P-LSP 需要90.9 s,即路径受限规划多花约 44% 的时间;次级研究中 ESP 98.2 s、P-LSP 113.1 s、R-LSP 132 s。
  • 预测性路径规划只能补回一部分:给路径规划器加上目标外推(P-LSP)后,安全成功率从 R-LSP 的 44% 升到 66%,但仍显著低于 ESP 的 97%,说明负载的是"朝向被冻结"这一结构假设,而不是路径规划器的质量。
  • 结构效应是密度驱动的:50 人时三条臂几乎重合,差距从 100 人起单调扩大,符合受控实验对"单一变量起作用"的预期,而非调参噪声。
  • 估计误差下结论仍成立:次级研究中所有规划器成功率下移,但 ESP 相对 LSP 的优势保留(安全成功率 87% 对 56%),说明结论不依赖目标状态是否完美可观测。
  • 运动行为可解释:ESP 空闲时间更短、平均速度更高、急刹次数更少,同时行驶距离更长——受限的动作空间迫使规划器保守与反复刹车,而联合搜索能维持连续前进。

从顶会创新模式的角度(对应附录 C),这篇论文主要命中三条信号:① 设计混淆隔离诊断——构建一个只隔离"动作空间结构"这一个混淆变量的测量装置,其余感知、信念、奖励与算力全部固定,证据是 500 次配对试验 × 4 档密度、差距随密度单调扩大;② 审计并扭转负载假设——识别人群导航领域继承的"路径-速度分解足够"假设并把它违反,同时把失败追溯到结构机制(朝向冻结后无法在延迟出现时重选空间轨迹);③ 替换算子或表示——用转向-速度联合动作表示替换"路径 + 一维速度"。整体上,它的执行质量来自配对、单调密度曲线与跨观测设定复现这三重证据。

局限性

  • 无静态障碍:实验场地是 50 m × 50 m 的空场地,静态障碍与动态人群耦合时的表现尚未验证。
  • 观测被简化:机器人、目标与行人的位置假设为无噪观测,这是为了刻意隔离意图不确定性;真实传感器噪声会同时作用于三条臂,可能改变绝对数值。
  • 动作空间仍为离散:因为 ARDESPOT 对连续或很大的动作空间处理起来吃力,转向与速度都做了离散化,连续动作下的分支因子没有被刻画。
  • 结论来自仿真:全部结果来自仿真环境,没有真机验证;行人模型是恒速目标导向加有界噪声的基本形式,未覆盖 Social Force 或 PORCA 等更复杂的运动模型。
  • 论文表述口径的两处瑕疵:R-LSP 在主研究下的截获时间只出现在图中、正文只引用了 ESP 与 P-LSP 的数字;摘要里"31 percentage points lower"没有写明比较对象是 P-LSP 而不是 R-LSP。引用这两组数字时需要注意对应关系。

常见问题(FAQ)

TIC 和传统的移动目标拦截有什么不同?

传统拦截(如 Dubins 最优拦截、predict-then-intercept 流水线)大多假设环境静态或动态障碍已知;TIC 把人群的意图不确定性和移动目标放进同一个 POMDP,机器人要同时处理"追移动目标"和"躲意图不可观测的行人"两件事。

为什么"先规划路径再调速"在人群密集时会失效?

因为它把朝向冻结在搜索之外。人群造成的延迟会不断改变"何时、何地"能截获目标,而朝向不可调时,规划器只能用调速在人与人之间找缝隙,树搜索里可达的状态集合被限制。即使加上目标预测(P-LSP),安全成功率也只从 44% 升到 66%,仍显著低于联合搜索的 97%。

ESP 比 LSP 到底强在哪里?有量化证据吗?

强在动作空间的表达力。200 人时 ESP 安全成功率97%,而 P-LSP 为 66%、R-LSP 为 44%;主研究平均拦截时间63.3 s对90.9 s(少约 44%);次级研究中 ESP 的空闲时间更低、平均速度更高、急刹次数更少,同时行驶距离更长却拦截更快。

目标状态看不见时结论还成立吗?

成立。次级研究用 15 m、180° 探测器加 10% 漏检率提供间歇观测,再经 1000 粒子 SIR 滤波,规划器只拿到 MAP 估计。所有规划器成功率都下降,但 ESP 对 LSP 的结构性优势保留:安全成功率 87% 对 56%,平均拦截时间 98.2 s 对 113.1 s。

这个结论可以推广到连续动作空间或真机吗?

论文没有给出结论。作者明确指出,动作空间仍是离散化的,因为所用求解器(ARDESPOT)对连续或大动作空间处理吃力;同时实验全部在仿真中完成,未做真机验证。作者给出的下一步是扩展到含静态障碍的环境,这需要碰撞感知、面向拦截的 rollout 策略,而并行运动规划或许能让这类策略在在线预算内实时生成。

这篇论文的写法有什么值得借鉴的地方?

它用场景化开场(从送货机器人去找在病房之间移动的医生,到机场人群里把订单直接交给顾客)建立直觉,再用反问式设问点出研究问题(动作空间结构会如何影响在线树搜索在密集人群拦截中的效果),最后用受控对比兑现承诺;措辞上证据密度很高(直接给出 98%、96%、73% 这组成对数字),断言式表述没有 hedge,并精确锚定规模(最多 200 人、每组合 500 次试验)。

参考链接

  • 论文 arXiv 摘要页:arxiv.org/abs/2607.18517
  • 项目主页(含视频与 BibTeX):tic-planning.github.io
  • Gupta, Hayes, Sunberg.Intention-Aware Navigation in Crowds with Extended-Space POMDP Planning. AAMAS 2022:arxiv.org/abs/2206.10028
  • Egorov, Sunberg, Balaban, et al.POMDPs.jl: A Framework for Sequential Decision Making under Uncertainty. JMLR 2017:jmlr.org/papers/v18/16-300.html
  • Guez, Silver, Dayan.DESPOT: Online POMDP Planning with Regularization. JAIR 2016:doi.org/10.1613/jair.5328

给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群:白拾的小屋 (750365700)

⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页:YhbCode000(工程文件)

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询