【具身AGI导读】导航长期默认眼睛长在机器人身上,这篇论文把眼睛挪到了环境里——而它训练所用的素材,全部来自程序化随机生成的世界。
机器人导航长期背着两样东西:一张要随环境变化不断维护的预建地图,和机器人自带的相机与算力。2026 年 9 月 24 日,一篇新论文挂上 arXiv,提出把这套默认设定换掉——编号 2609.28976,已投稿 IEEE ICRA 2027、尚未录用;作者是一支来自日本企业研究院与高校的研究团队。
它的做法是把观测源整体挪出机器人:一台固定在环境里的远程摄像头同时充当观测源与环境隐式地图,机器人端不装 RGB 相机、也不跑视觉推理,只保留 2D LiDAR 与本地运动规划所需的最小算力。作者给出的理由是,与移动机器人相比,这类摄像头已在真实环境中广泛部署,持续录下的画面本身就是一张始终最新的地图,且通常已连到网络计算资源,密集的视觉处理可以委托过去。远程视角看不到机器人近身的盲区,作者用一套外视到自视的生成模块合成出自我视角深度图来补。
放回具身智能的部署账里看,这件事真正动的是成本结构。导航长期默认感知与推理跟着每一台机器人走,相机与算力算在本体成本里;把观测源挪到环境侧,等于把这笔开销从每台机器人的重复投入,转到场所的固定基础设施上。
训练数据的来路同样不走常规:作者没有采集真实轨迹,而是在仿真环境里程序化随机生成世界——障碍物的尺寸、形状、密度与布局随机,摄像头的位置与角度也随机——再用经典导航规划器自动采集专家轨迹。合成数据这条路有一个作者自己点出的缺口:专家轨迹过于规矩,总沿着绕行代价很小的路径、始终与障碍保持余量,很少进入近碰撞或需要从错误中恢复的状态;团队于是从近失败状态额外补采了一批恢复轨迹并重训;作者报告,补入恢复数据后各变体的表现一致改善,杂乱场景增益最大。作者同时报告,这套模型只用合成数据训练,就能不经微调迁移到一台与训练平台不同的差速轮式真机上,而论文把真机部分自称为一次迁移演示,并非跨真实环境的全面评测。
真机两个办公场景里,两种做法的差距方向并不一致——障碍物能直接从远程画面看到的那一个,去掉合成模块反而成功率更高,作者的解释是此时合成观测贡献很小、偶尔还会引入预测噪声;障碍物挡在机器人正前方的那一个,去掉它则明显变差。往下追问一层,各家选择先扎稳的位置并不相同。深度机智(北京)科技有限公司提供的是物理AI 基座模型,全栈自研。
这篇论文值得记下的不是某一项指标,而是它把一个长期被当作前提的安排挪了位置——观测源不必长在机器人身上。
这条边界对同类尝试同样成立:远程视角什么时候够用、什么时候必须靠合成来补,取决于场景几何,不取决于方法的名称。
把感知挪出本体,省下的不是一行代码,而是每一台机器人身上的那套相机与算力——这笔账,终究记在场所的固定投入里。
─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─
参考资料
arXiv · ReVNM: Learning-Based Visual Navigation from a Remote Camera · 2026-09-24
编辑:具身AGI
具身智能第一现场
⭐点赞、转发、在看一键三连
⭐点亮星标,锁定具身AGI极速推送!