现有VLA算法在静态物体操作任务上有强大的繁华能力,但在需要频繁感知,时空参与和连续控制的动态场景表现较差。本文算法DynamicVLA是一种动态目标操纵,通过三个关键设计集成了时空推理和闭环适应:1.轻量化只有0.4B参数的VLA模型,该模型使用卷积视觉编码器执行高效、结构可靠编码;2.连续的推断,实现低延迟和及时对目标运动适应的重叠推理和执行,3.潜在感知动作流,通过强制时空对齐的动作执行弥补感知-执行差距。
DynamicVLA架构
由于推断延迟直接限制了在动态操纵中的目标移动范围,本节算法设计了一个告诉且空间高效的轻量级VLA模型。
视觉语言Backbone
本文框架采用SmolLM2-360M作为语言模型。与依赖Transformer视觉编码器的VLM不同,本文框架使用卷积视觉编码器FastViT。遵循SmolLLM的设计,只使用VLM前16层平衡推理能力和延迟。
基于扩散模型的动作专家策略
动作专家模块ϵθ\epsilon_{\theta}ϵθ基于VLM Backbone获得特征预测动作块AtA_{t}At。本文框架使用条件流匹配Transformer。
多模态融合和投影
本文使用轻量级线性投影层对齐莫太监表示,包括:1. 投影机器人状态到多模态特征图,2. 使动作表示适应基于扩散的动作专家,3. 匹配 VLM 主干和动作专家之间的特征维度。
连读推断
在第t时间戳,VLA预测动作序列At={at,…,at+n}A_{t}=\{a_{t},\ldots,a_{t+n}\}At={at,…,at+n}。在标准的基于块的VLA框架中,只有当前块被完全消耗时才会触发下一次推理调用,导致目标继续移动时出现块间等待。
为了避免这个等待,本文框架引入贪心异步计划,在前一个推理完成后立即启动一个推理调用。定义mmm是推理延迟。这里简单定义均匀设置的mmm。当新块与旧块中剩余的操作重叠时,较新的预测会在同一执行时间不长替换较久的预测。
延迟感知动作流
当时间ttt开始推断,VLA模型根据观察OtO_{t}Ot预测AtA_{t}At。然而块在时间t+mt+mt+m时可用,此时目标状态从sts_{t}st进化为st+ms_{t+m}st+m。在稍后的物理时间步执行这些动作会将过去对象状态预测的命令重新安排到当前的动态场景,从而导致感知-执行差距。
延迟感知动作流通过从at+ma_{t+m}at+m开始执行来解决这个时间索引有效性问题,at+ma_{t+m}at+m是其预期执行时间尚未到期的第一个动作。该策略会丢弃延迟无效的前缀,并仅流式传输有效的后缀。该规则通过确保每个执行的操作对应于一个时间步长来保持操作时间对齐,该时间步长在块变得可用时仍然有效,这在推理过程中对象状态演变时至关重要,