【多篇论文阅读】Real Time Chunking相关
2026/7/24 20:50:53 网站建设 项目流程

RTC

https://arxiv.org/pdf/2506.07339

一句话概括

这篇论文提出了一种名为“实时分块”(RTC)的推理算法,让机器人能在不等待模型计算完成的情况下,平滑地执行下一个动作序列,从而解决了大型模型推理延迟高导致的动作卡顿问题。

核心内容

  • 解决问题:大型VLA推理慢,导致机器人执行动作时出现停顿或生硬的跳跃,无法流畅应对动态任务。
  • 核心思想:将动作生成过程看作“图像修复”(inpainting)。在执行当前动作块的同时,提前生成下一个动作块。
  • 关键流程
    1. 冻结:将下一个动作块中,因延迟而必然会被执行的前几步动作“冻结”,固定为当前已规划好的值。
    2. 修复:基于冻结的动作和新的环境观测,通过“软掩码”(soft masking)技术,平滑地“修复”(即生成)后续的动作,确保动作间的连续性。
  • 主要优势:RTC是一个纯推理时(inference-time)的算法,无需重新训练模型,可直接应用于任何基于扩散或流匹配(flow-based)的策略。

效果与价值

RTC在模拟和真实世界的灵巧操作任务中(如点燃火柴)都表现出极强的延迟鲁棒性,显著提升了任务完成速度和成功率。其主要局限是相比直接采样,计算开销有所增加,且目前仅适用于特定类型的生成模型。

Training-time RTC

一句话概括

这篇论文提出了一种名为“训练时RTC”(Training-time RTC)的方法,通过在训练阶段模拟推理延迟,消除了机器人实时控制中推理阶段的计算开销。

核心内容

  • 解决的问题:现有的实时分块(RTC)技术在推理时通过“图像修复”(inpainting)来保证动作连贯性,但这会带来额外的计算延迟,违背了实时控制的初衷。
  • 核心方法:将“图像修复”过程从推理阶段移至训练阶段。在训练时,模型会随机模拟一个推理延迟ddd,并将动作序列的前ddd步(即动作前缀)作为已知条件输入,让模型只学习预测剩余的动作后缀。
  • 实现方式:该方法无需修改模型架构,仅需在训练时对损失函数进行掩码处理,使其只计算动作后缀部分的误差。

效果与价值

该方法在保持与推理时RTC相同的任务成功率和运行速度的同时,显著降低了计算成本。在模拟实验中,当推理延迟较高时,其性能甚至优于推理时RTC。其主要局限是灵活性稍差,无法像推理时RTC那样“软性”地融合更多未来动作信息。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询