医学论文解读:Predicting the Year of Total Knee Replacement: A Transformer-Based Multimodal Approach
2026/8/12 15:03:51 网站建设 项目流程

英文题目:Predicting the Year of Total Knee Replacement: A Transformer-Based Multimodal Approach

中文可译为:全膝关节置换术年份预测:一种基于 Transformer 的多模态方法

发表于:MIDL 2025​,即Medical Imaging with Deep Learning 2025

一、摘要

膝骨关节炎发展到晚期后,部分患者最终需要接受:Total Knee Replacement, TKR​

但是临床上一个很重要的问题不是只有:

“这个患者以后会不会换膝?”

而是:

“大概还有几年需要进行膝关节置换?”

这个问题很难,因为 TKR 决策不仅取决于影像学病变,还受到:

  • 疼痛程度;
  • 功能受限;
  • 年龄;
  • BMI;
  • 合并症;
  • 患者手术意愿;
  • 影像学结构改变;

等多种因素共同影响。

传统深度学习通常只使用: MRI,或者少量临床变量,因此信息不完整。

作者提出一个端到端多模态模型,将下面的内容共同输入模型:

MRI+Clinical Variables+MR Image Readings​

具体采用:

  • 3D ResNet18提取 MRI 特征;
  • Pretrained TabNet提取表格数据特征;
  • 然后通过: Cross-modal Attention​完成两种模态之间的融合。

最终预测: 0,1,2,…,9​,即患者距离 TKR 还有多少年。

实验表明,完整模型取得: 63.4% Accuracy​

优于:

  • MRI-only;
  • Tabular-only;
  • Concatenation;
  • DAFT;
  • 普通 Transformer 表格编码器;

二、创新点

1 从“TKR风险预测”进一步走到“TKR具体年份预测”

很多 OA 论文研究的是是否进展,​或者未来是否TKR​,属于二分类。

本文则预测: 0∼9年内具体哪一年接受TKR​,因此预测目标更细。

例如模型输出: 3意味着患者大约 3 年后接受 TKR。

所以这篇论文实际上研究的是一种: Time-to-event Prediction​

只不过作者将时间离散化后作为多时间区间预测问题处理。


2 MRI + 临床数据 + 影像评分的多模态融合

作者认为 TKR 不是由影像单独决定的。

比如:

一个 KL4 患者如果没有明显疼痛,可能暂时不会手术;

反过来:

一个 KL1 患者如果疼痛和功能受限非常严重,也可能更早接受 TKR。

因此仅看: MRI是不够的。

论文同时使用:

MRI+Clinical Variables+Image Readings​

其中表格信息包括例如:

  • 年龄;
  • BMI;
  • WOMAC;
  • KL;
  • OARSI;
  • BML;
  • 其他影像定量/半定量评分。

因此模型不是单纯进行: Image→TKR

而是:

Disease Structure+Symptoms+Clinical Condition→TKR Time​


3 使用 Cross-modal Attention,而不是简单拼接

传统 multimodal fusion 常用: Image Feature⊕Tabular Feature,直接 concatenate。

本文则让两种模态通过: Cross Attention​显式建立关系。

也就是说,模型可以学习:

哪些临床特征应该关注 MRI 中哪些区域或特征。

而且作者特别设计为:

  • Tabular features作为Query​
  • MRI features 作为 Key / Value。

因为作者认为:

TKR 决策更直接受到患者症状和临床状态影响,所以应该由临床信息主动“查询”影像中相关信息。

三、方法

整个方法可以拆成三个模块:Image Encoder+Tabular Encoder+Multimodal Interaction​

流程: MRI→3D ResNet18

同时: Clinical+Image Readings→Feature Selection→Pretrained TabNet

然后: Image Features+Tabular Features

Cross Modal Attention

Year of TKR​

3.1 MRI Image Encoder

作者使用的是:Sagittal fat-suppressed 3D DESS MRI​

也就是 OAI 中常用的: 3D DESS​膝关节 MRI。

Image Encoder 采用: 3D ResNet18​

输入尺寸经过裁剪后为: 300×300×160​

训练阶段: Random Crop

验证阶段: Center Crop

最终从最后一个 pooling layer 提取 MRI representation:

3.2 Self-supervised Pretraining Pretrained TabNet

作者没有直接监督训练 TabNet,而是先进行:Masked Self-Supervised Learning​,思路类似 BERT。

将一部分临床变量: Mask掉​

然后让 TabNet 根据剩下变量: Known Features

恢复: Masked Features

即:

Known Variables→Predict Missing Variables​

训练时 masking ratio: 0.5​

也就是随机遮掉 50% 的变量。

通过这种方式,TabNet 可以提前学习:临床变量之间的关联结构​,然后再 Fine-tune 到 TKR 预测。

1、Tabular Data

原始 OAI baseline clinical variables 一共有:1224​个。

其中: 245个变量在超过 90% 的受试者中可用。

此外作者还使用了: 全部可获得的影像评价指标​

所以表格数据包含两部分: Xt​=[Xc​,Xr​]

其中:

  • Xc​:Clinical variables;
  • Xr​:Image readings。

2、Tabular Representation

经过 TabNet 后得到:

可以理解为:

由多个临床/影像变量组成的一组 tabular tokens。

而 MRI 经过 ResNet 得到: I再通过 Linear:

使 image token 与 tabular token 拥有相同 embedding dimension。

3.3 Multimodal Interaction Module

核心融合模块:ψ​

包括:

  • Self-Attention;
  • Cross-Attention;
  • Feed Forward;
  • Layer Normalization。

一共有: 4 Transformer Layers​

每层: 8 Attention Heads

Hidden dimension: 64

Cross-modal Attention公式为:

这里作者设置:

  • Q=Tabular Features​
  • K,V=MRI Features

也就是说: Clinical Information→Query​

去询问: MRI Information​

哪些影像信息对当前 TKR 时间最重要。

这个设计很符合临床逻辑:

“这个患者痛得怎么样、功能怎么样、年龄是多少、已有影像评分怎么样?”

四、实验

4.1 数据集

使用:OAI​,Osteoarthritis Initiative。

OAI 共: 4796名受试者。

研究中: 547 subjects​

在 9 年随访期间接受过 TKR。

最终综合:

  • MRI;
  • Clinical data;
  • quantitative image assessments;
  • semi-quantitative image assessments;

筛选出: 850 knees​用于实验。

还包含丰富的临床变量

例如:WOMAC Pain不同疼痛等级。

OARSI Grade包括:

  • None;
  • Small;
  • Medium;
  • Large。

BML:作者将膝关节分为:15个 BML subregions。统计其中存在损伤的区域数量。

因此这不是简单: MRI+年龄+BMI

而是包含相当多OA-specific clinical and imaging features。

4.2 结果

MRI-only:

  • ACC=60.7%​
  • MAE: 1.46
  • Macro-AUC: 0.615

Tabular-only:

预训练 TabNet:

  • ACC=61.0%​
  • MAE: 1.55

说明:

单独临床+影像评分数据已经和MRI差不多​

再次说明 TKR 是一个临床决策,而不只是影像学严重程度:

症状 + 功能 + 结构共同决定

最终完整模型:

ACC=63.4%​ MAE=1.33 years​ Macro-AUC=0.665​

是所有方法中最优。

五、总结

什么时候换膝不是单纯由 MRI 决定的,因此模型不应该只“看膝盖”,而应该同时知道患者痛不痛、功能怎么样、影像评分如何,再让这些临床信息主动去 MRI 中寻找与手术时间相关的结构证据。

所以整个思想可以压缩为:“膝盖长什么样”+“患者现在是什么状态”→“还有几年需要换膝”​

而从 OA 人工智能研究路线来看,这篇论文已经明显从传统的: 分割→KL分级

进一步走到了: 个体化预后→临床事件时间预测​

这类问题与真正的临床决策支持更接近。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询