Surgical WAM:用世界模型与动作模型破解手术机器人数据稀缺难题
2026/8/29 10:06:37 网站建设 项目流程

Surgical WAM 这个方向第一次出现时,很多人的注意力都放在“World-Action Model”这个新词上,觉得这又是某种新的模型架构。但如果把它放回真实的手术机器人研究现场,会发现它真正要解决的问题不是网络结构,而是一个长期卡住行业的问题:数据利用率。

一个做手术机器人研究的团队,日常会遇到一个很拧巴的场景:手术视频越存越多,动作数据却越来越不够用。

内窥镜一开,每台手术都在产生十几小时的视频流,几个月下来就是几千小时。视频里,有器械怎么进入体腔、组织怎么变形、视野怎么变化、缝针怎么穿过组织……信息密度很高。但真要拿这些视频训练一个能自己完成缝合或打结的机器人,传统路线做不到。因为手术机器人学习动作,主要依赖的是“专家示范”——需要外科医生坐在操作台上完整地执行一遍动作,同时记录操作臂的轨迹、关节指令、器械开合等信息。这类数据不能外包给普通标注员,需要医生全程参与,成本极高。

一边是数据富足,一边是数据稀缺。这个矛盾,才是手术机器人学习最麻烦的问题。

Surgical WAM 这个方向之所以值得关注,不是因为它提出了一个看似更强的模型,而是它尝试换一种数据利用方式:用海量无标注视频,先让模型学会“手术场景会怎样变化”;再用少量专家演示,学会“在这个场景里应该怎么操作”。它把“看懂世界”和“做出动作”拆成两个阶段来解决,从而降低对昂贵动作示范数据的依赖。

这篇文章就从数据、框架、落地路径和边界这几个角度,把这个方向拆开讲清楚。

1. 手术机器人“学不会”,真正卡住的为什么是数据成本

很多人以为手术机器人学习的主要挑战是模型不够聪明。实际跑过项目之后会发现,模型可以换,方法可以调,真正让你寸步难行的是没有足够的高质量动作数据。

1.1 视频在积累,动作数据却在“卡脖子”

一台主流手术机器人系统里,负责记录的传感器其实一直在工作。主手侧的操作指令、器械末端的位姿、内窥镜的视频流,很多数据在手术过程中都会被记录。问题在于,记录下来的原始数据要变成可训练的“专家示范”,中间还隔着两层工作。

第一层是“有效片段筛选”。一台手术可能长达两个小时,里面有大量重复操作、等待、清理视野、调整器械等过程,真正适合作为教学示范的往往只是几段十几秒到几分钟的片段。筛选这些内容需要专业理解,不是靠写个脚本就能自动完成的。

第二层是“动作语义对齐”。即使有了片段,算法也需要知道在某个时刻、某个画面下,期望的动作指令是什么。这个对齐由谁来标注?要么让外科医生在操作台上反复录制,要么用已有的模型来生成标签,但后者在医疗场景里本身就很不成熟。

所以一个很直接的结果是:手术室每天都在产生大量视频,但能直接用于机器人训练的“专家演示”数据,可能只有几十到几百条。这个数量和计算机视觉、自然语言处理领域动辄百万级的数据量相比,完全不在一个量级。想在强监督框架下靠这些数据训出一个鲁棒的外科操作策略,难度极大。

1.2 为什么过去的几条技术路线都“差一口气”

我们可以把手术机器人学习的主流路线放在一起看,会更容易理解 WAM 这种设计想补的缺口在哪里。

方法路线数据需求主要瓶颈
行为克隆大量专家演示演示采集成本高,误差会随轨迹长度累积
强化学习奖励设定 + 大量试错软组织环境难以定义奖励,真实手术中试错不可接受
纯世界模型视频数据充足能预测像素,但难以直接转化为控制信号
World-Action Model 类框架视频为主 + 少量演示需要仔细处理预训练与微调的衔接,安全验证成本高

行为克隆是最被广泛尝试的路线。逻辑很简单:让机器人模仿外科医生的动作轨迹。但它需要大量的专家数据来覆盖各种边界情况。一旦遇到训练分布之外的场景,预测误差会随轨迹长度不断累积,最后机器人可能越偏越远。

强化学习在仿真环境里可以做得很好,但移植到真实手术场景时会发现两个问题:一是软组织形变、切割、缝合这些过程的奖励函数很难定义;二是真实手术不允许“试错式”学习,一次错误操作可能就会造成严重后果。所以在手术机器人的真实部署里,强化学习目前更多用于仿真环境和特定子任务。

纯世界模型试图从视频中学习手术场景的动态变化。这个思路很自然,因为视频是最容易获取的数据。但只学会了“下一帧长什么样”还不够,机器人需要的是“下一秒该怎么动作”。从像素预测到控制指令的输出,中间还隔着一层策略映射。

这些路线的共同问题在于:通用理解能力和任务执行能力被混在一起训练。结果就是,为了得到“怎么做”的策略,必须为每一条数据都付出很高的标注成本。

1.3 核心判断:把通用理解与任务策略分开

Surgical WAM 这类框架的核心判断很简单:世界理解是通用能力,动作策略是任务能力。这两件事应该分开解决。

世界模型部分学的是手术场景的状态变化规律。它可以从大量无标注视频中学习,因为视频本身就包含了足够的信息:器械接触组织后组织如何变形、视野移动时解剖结构如何变化、缝针穿过组织时的动态过程。这些规律不依赖于具体任务标签,因此可以用自监督方式训练。

动作模型部分学的则是从当前状态到动作指令的映射。因为底层的视觉表征和动态理解已经由世界模型提供,动作模型不需要从零开始理解“画面里是什么”,只需要学习“在这个状态下应该做什么”。这种高层任务空间比原始像素空间小得多,因此对专家演示数量的需求就会显著下降。

可以打个比方:如果一个人已经看过几千台手术视频,他对手术场景的理解已经很深;这时候外科医生只需要手把手带他做几次,他就能学会标准操作。相比之下,如果一个人完全不了解手术场景,每次都从头学起,那需要的示范数量就会大很多。

这正是 WAM 想改变的数据利用方式。

2. 把“看懂手术”与“做好手术”拆成两件事:Surgical WAM 的组成逻辑

从名字来看,Surgical WAM 可以拆成两个模块:World Model(世界模型)和 Action Model(动作模型)。拆开看,这两个词都不陌生,但把它们放在一个框架里共同解决手术机器人学习问题,带来的变化是结构性的。

2.1 World Model 在学什么

世界模型要建模的是手术场景隐含的“状态—状态”动态规律。通俗地说,它要回答这样一个问题:给定当前时刻的观测,下一步场景会变成什么样子?

这里的观测可以是视觉帧,也可以是器械末端位姿、器械开合状态、任务阶段信息等数据。世界模型的任务就是把过去和当前的信息压缩成一个状态表示,并学习这个状态表示如何随时间演化。

一个关键点是:这个学习过程不需要动作标签。

视频数据本身就提供了天然的监督信号。算法看到第 t 帧和第 t+k 帧,可以学习“在这段时间里,组织如何变形、器械如何移动、视野如何变化”。这个预测任务不依赖人工标注,因此可以利用大量历史手术视频。

从工程角度看,世界模型的学习目标可以有很多种形式:可以是下一帧像素预测,可以是在隐空间里预测下一时刻的状态向量,也可以是掩码重建。选择哪种目标会影响训练难度和下游效果,但核心逻辑一致:先让模型对手术场景形成通用理解。

这类理解一旦建立,就会成为后续所有任务共享的“底座”。缝合要用它,打结要用它,组织牵拉也要用它。预训练成本可以被多个下游任务摊销。

2.2 Action Model 在学什么

动作模型要解决的问题是:给定当前状态和任务目标,应该输出什么动作。

动作空间取决于具体机器人平台。对于主流主从式手术机器人,动作可以是操作臂末端的位姿增量、关节转角变化、器械开合指令等。动作模型需要把世界模型提供的状态表示映射到动作分布上。

因为状态表示里已经包含了场景的深层理解,动作模型的学习任务会变得相对简单。它不再需要从原始像素中推断“这是组织还是器械”“这个组织会怎么动”,只需要学会“在这种情况下应执行哪种动作”。

在训练方式上,动作模型可以通过少量专家演示的行为克隆来学习,也可以结合强化学习在仿真环境中进一步优化。但无论采用哪种方式,它的训练成本都远低于从零开始学习所有内容。

2.3 两段式分工为什么能带来数据效率

简单说,数据效率的提升来自三个层面。

第一,预训练阶段占用了绝大部分“视觉-动力学”学习成本,而这些成本可以完全由无标注视频承担。这相当于把最贵的数据消耗部分替换成了最容易获取的数据。

第二,动作模型解决的是“小决策问题”。因为动作模型不需要重新学习视觉特征,它的学习空间更小,所以需要更少的专家示范就能收敛。

第三,预训练模型可以跨任务复用。训练一个手术场景世界模型,之后可以支撑缝合、打结、剪切、牵引等多个下游任务。每次新增任务时只需要采集少量动作示范,不需要重新采集视频。

从研究工作流的角度看,这意味着一个团队可以把精力集中在打磨世界模型和采集少量高质量示范上,而不是花大量时间去做难以规模化的数据标注。

3. 从零搭一套 World-Action 训练流程:视频预训练、动作微调与闭环推理

如果要在真实项目里落地这一类思路,具体该怎么做?下面给一条参考路径。它不是唯一的方案,但可以作为从零开始的脚手架。

3.1 阶段零:先解决合规和数据边界

医疗场景下,任何数据工作都不能绕过合规问题。获取手术视频必须经过医院伦理委员会审批,涉及患者隐私的数据必须完成脱敏处理,数据存储和使用范围要有明确边界。

这一步不是形式主义。一个合规的数据治理流程,决定了后续所有技术工作能不能持续进行。如果数据来源不合法,模型训练得再好也无法进入真实应用。

建议从一开始就建立数据清单,记录每段视频的来源、采集设备、术式、脱敏状态、可用范围。这些元信息不仅是为了合规,也方便后续做数据筛选和域差异分析。

3.2 阶段一:视频预训练与世界模型模块

预训练阶段的目标是得到一个能输出手术场景状态表示的编码器和一个能够建模状态转移的模块。

数据准备上,优先选择画面清晰、视野稳定、器械操作规范的视频片段。不需要全量视频都进入训练,先做抽帧和筛选,去掉模糊、出血污染镜头、器械完全移出视野等低质量片段。统一分辨率之后,再按术式、设备型号等维度做区分,方便后续做域分析。

训练任务可以采用自监督目标。常见的做法包括:

  • 下一帧预测:让模型预测未来帧,逼迫它理解时间动态。
  • 掩码重建:随机遮住部分帧或部分区域,让模型补全。
  • 对比学习:让模型区分同一手术过程的不同视角或不同时刻。

训练时建议先做一个小规模验证,确认世界模型能否捕捉手术场景的基本动态,再逐步扩展到完整数据。

# 伪代码:视频预训练阶段(简化示意) for batch_video in dataloader: frames = preprocess(batch_video) # 抽帧、裁剪、脱敏后帧序列 states = world_model.encoder(frames) # 映射为状态表示 next_state_pred = world_model.transition(states[-1]) loss = state_pred_loss(next_state_pred, target_state) optimizer.zero_grad() loss.backward()

需要注意的是,这个伪代码只是逻辑示意。实际实现中还要处理视频长度、状态维度、时间步对齐等细节。

3.3 阶段二:专家演示采集与时间对齐

少量专家演示是微调动作模型的核心数据。采集时至少需要记录四类信息:视觉帧、主手指令、器械末端位姿、器械开合状态。

最容易被忽略的是时间对齐。视频帧和主手指令通常来自不同的传感器或不同的计算单元,如果时间戳没有用同一个时钟源校准,即使只有几十毫秒的偏移,也会让“画面”和“动作”的对应关系错乱。这个问题在后续训练中会表现为模型在开环评估时表现尚可,但在闭环推理时动作滞后或提前。

采集完成后,需要把原始演示数据分割成一条条有开始和结束条件的轨迹片段。片段边界可以是某种任务阶段的开始或结束,比如“缝针进入组织”“完成一次打结”“移出视野”。如果原始素材里没有这种语义注释,就要人工介入完成筛选。

注意:不要一上来就追求上万条演示。先采集 50 到 200 条高质量的有效演示,跑通整个微调和评估流程,再根据效果决定是否增加数据。无效数据的堆积反而会增加调试成本。

3.4 阶段三:策略微调与闭环评估

动作模型在世界模型提供的状态表示上做微调。实践中可以考虑冻结世界模型的大部分参数,只训练策略头部分;或者全部参数参与微调,但使用更小的学习率。哪种方式更好取决于数据量和任务复杂度,建议做一个对比实验来确定。

评估不能只看“成功率”这一个指标。在手术机器人场景里,需要同时关注:

  • 任务成功率:是否完整完成了缝合、打结等目标。
  • 轨迹平滑度:动作是否抖动、是否出现不自然的停顿。
  • 组织交互安全:是否过度拉扯组织、是否产生危险的器械姿态。
  • 操作耗时:相对专家演示是否明显变慢。

更关键的是闭环评估。开环评估把一段预先录制的视频输入模型,模型输出动作序列,然后和专家动作做对比;闭环评估则是把模型输出的动作真正应用到环境中,再把环境反馈的图像传回模型,让它继续决策。两者的差异往往很大。

闭环评估能暴露出误差累积问题。模型第一步预测可能只偏差一点点,但如果不做纠正,第二步、第三步就会逐渐偏离正常操作,最终导致完全失败。如果出现这种情况,需要回到状态表示设计或动作模型容量上找原因,而不是简单增加数据。

3.5 一张可复用的检查清单

在推进项目时可以按这个顺序排查问题:

检查项优先级快速判断方法
视频帧和动作数据时间戳是否对齐最高取几条样本逐帧比对,观察动作是否超前或滞后
视频域是否一致查看训练集和测试集是否来自同一器械、同一术式
世界模型是否真正学到了状态动态用状态预测误差评估,不要只看重建画面
动作模型是否过度拟合少量示范训练集和验证集成功率对比,差距过大说明过拟合
闭环推理是否稳定连续运行多次闭环测试,统计失败模式和偏差点位

4. 落地时不要只盯着模型:边界、风险与工程化补全

把模型跑通只是第一步。真实项目里,边界意识、安全流程和工程化能力往往比模型分数更能决定最终结果。

4.1 它适合什么场景,又不适合什么场景

Surgical WAM 这类框架有清晰的能力边界,不能当成万能方案。

维度适合场景不适合场景
术式类型标准化程度高的微创手术,如缝合、打结、组织牵拉开放手术、复杂罕见解剖、高度依赖临场判断的任务
器械类型刚性器械、固定内镜视角柔性器械、多自由度器械、需要精细触觉反馈的操作
数据条件有大量历史脱敏视频,可获取少量专家演示没有历史视频积累,只有少量动作数据
部署阶段模拟器、离体验证、远程操作辅助直接用于临床,需经过严格审批和安全验证

从数据条件来看,这个框架最适合的团队是那些已经拥有大量历史手术视频积累、并且有能力获取外科医生少量高质量演示的机构。如果团队本身没有视频数据积累,那预训练优势就发挥不出来。

4.2 安全验证顺序不能跳步

手术机器人学习里,安全验证不是模型完成后的附加环节,而是整个流程的一部分。合理的安全验证顺序应该是:模拟器验证、离体组织验证、动物模型验证、临床前审批。每一步都需要独立的评估指标和失败回退机制。

即使模型在模拟器里表现很好,也不能直接假设它能在真实环境中保持同样性能。真实环境的组织形变更复杂,光照变化更剧烈,器械状态也会存在微小差异。从模拟到真实,每一步都需要重新评估域差异。

在模型部署过程中,必须保留人工接管机制。模型决策只能作为辅助或受限场景下的自动化执行,不能在没有监管的情况下直接执行完整手术操作链条。

4.3 常见踩坑与排查链路

从工程经验看,以下问题在手术机器人学习项目里出现频率很高。

时间戳对不齐。最典型的表现是模型在训练阶段看起来正常,在闭环测试时动作总慢半拍。排查时先看采集流程里视频流和动作流是否共用了同一个时间基准,再看预处理时是否丢弃了时间戳字段。

视频域漂移。用 A 医院的视频训练世界模型,在 B 医院的器械型号上做微调,效果可能明显下降。排查时先分析两边的分辨率、视野角度、器械型号、术式分布,再做数据层面的域适配,而不是直接调模型参教。

重建效果好但下游表现差。世界模型能把画面重建得很清晰,但状态表示可能没有捕捉到最关键的任务相关信息。这时不要只看重建损失,要设计针对状态预测的评估任务,判断模型是否真的理解了场景动态。

开环评估误导。模型在固定轨迹上看很好,但一旦进入闭环就迅速跑偏。这种问题通常来自状态反馈缺失或动作空间定义不合理。排查链路是先看动作模型是否接收到了最新观测,再看状态表示是否包含来自环境反馈的信息。

微调导致灾难性遗忘。动作模型微调时如果世界模型的参数也被大量更新,预训练学到的通用理解可能会被覆盖。常见解法是冻结大部分预训练参数,或者对预训练权重加约束。

4.4 需要提前补的工程化能力

  • 数据版本管理:视频、动作示范、模型权重、训练配置都要纳入版本管理,否则无法复现实验。
  • 评估标准统一:要定义一套团队内部统一的评估协议,包括测试集、评估指标、运行轮数。
  • 资源规划:预训练的视频量如果较大,算力开销会显著增加。需要提前评估 GPU 显存和训练时长。
  • 权限控制:不是所有研发人员都应该有权限访问原始手术视频数据。要在数据平台层面做好脱敏和访问控制。

5. 这类方案真正改变的,其实是手术机器人学习的数据利用方式

如果只把 Surgical WAM 理解成“一个能省数据的新模型”,那就低估了它的意义。它真正值得关注的地方,在于改变了手术机器人学习对数据类型的依赖结构。

5.1 从“堆积示范”到“理解优先”

过去提升手术机器人策略性能的方式,主要是堆积专家示范数据。但专家时间和采集成本决定了这条路很难持续扩大。

WAM 类框架提供了另一条路径:先利用大量容易获取的视频数据完成对手术场景的通用理解,再用少量专家示范完成具体任务策略的微调。这种“理解优先、动作为辅”的方式,让团队可以用更少的专家时间获得更好的任务表现。

对行业来说,这是从“数据堆积驱动”到“理解驱动”的转变。谁能把已有的海量手术视频合规地转化为通用理解能力,谁就能在后续任务适配中占据主动权。

5.2 专家时间会被用在更有价值的地方

数据效率的本质不只是省钱,而是让稀缺的专家时间从重复劳动中解放出来。

在传统流程里,外科医生可能需要花大量时间录制重复的演示数据。而在 WAM 类框架下,医生只需要提供少量高质量示范,并且可以更多参与在关键环节的评估和修正上。机器人学习和医学专家之间的协作方式会更加高效。

5.3 也不只是医疗领域受益

手术机器人只是“动作数据稀缺但观测数据充足”的典型场景之一。这个框架在其他领域同样有迁移价值。

工业机械臂分拣场景中,工厂有大量未标注的流水线视频,但机器人动作轨迹数据获取成本高;仓储机器人有无数的巡检录像,但针对特定货物的搬运动作很难规模化采集;自动驾驶的边缘案例数据也一样,测试视频很多,但能用于策略学习的专家轨迹很少。

在这些场景里,都可以采用类似的思路:用视频预训练世界模型,再用少量专家动作数据微调策略。这个范式值得每一个做机器人学习相关工作的团队关注。

5.4 我对 WAM 方向的长期判断

World-Action Model 不是一个终点,而是一个趋势的代表。它背后的核心思想是“感知理解与决策执行分离”的模块化训练范式。未来更值得期待的方向,可能包括构建更紧凑的物理状态表示、引入组织力学形变建模,以及跨术式、跨器械的零样本迁移。

但也要保持清醒。当前 WAM 类框架在手术机器人领域还很难说是成熟方案。它面临安全验证、数据合规、域漂移、闭环稳定性和临床审批等多重约束。要真正进入手术室,还需要很长的路。

如果这个方向继续发展下去,手术机器人学习的方式会从“专家演示堆积”逐步转向“通用理解预训练 + 少量任务适配”。到那时,数据效率的收益就不仅仅是降低了成本,而是让更多团队有机会进入这个领域,让更多原本因为数据稀缺而无法开展的研究变得可能。

回到开头那个场景。未来手术机器人团队里,数据管理员和研究员之间的对话可能会变成这样:

“今天又录了六十小时手术视频。”

“很好,送去跑世界模型预训练。”

“外科医生这周只有下午两个小时能做示范。”

“两个小时也够,足够微调动作模型了。”

如果有一天这个对话真的成立,那么 Surgical WAM 这类工作的贡献,就不只是让模型在更少数据上取得更好效果,而是让手术机器人学习从“依赖专家时间堆积”转向“对已有信息最大化利用”。

这件事的意义,比一个模型分数上的提升要大得多。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询