英文题目:Predicting the Year of Total Knee Replacement: A Transformer-Based Multimodal Approach
中文可译为:全膝关节置换术年份预测:一种基于 Transformer 的多模态方法
发表于:MIDL 2025,即Medical Imaging with Deep Learning 2025。
一、摘要
膝骨关节炎发展到晚期后,部分患者最终需要接受:Total Knee Replacement, TKR
但是临床上一个很重要的问题不是只有:
“这个患者以后会不会换膝?”
而是:
“大概还有几年需要进行膝关节置换?”
这个问题很难,因为 TKR 决策不仅取决于影像学病变,还受到:
- 疼痛程度;
- 功能受限;
- 年龄;
- BMI;
- 合并症;
- 患者手术意愿;
- 影像学结构改变;
等多种因素共同影响。
传统深度学习通常只使用: MRI,或者少量临床变量,因此信息不完整。
作者提出一个端到端多模态模型,将下面的内容共同输入模型:
MRI+Clinical Variables+MR Image Readings
具体采用:
- 3D ResNet18提取 MRI 特征;
- Pretrained TabNet提取表格数据特征;
- 然后通过: Cross-modal Attention完成两种模态之间的融合。
最终预测: 0,1,2,…,9,即患者距离 TKR 还有多少年。
实验表明,完整模型取得: 63.4% Accuracy
优于:
- MRI-only;
- Tabular-only;
- Concatenation;
- DAFT;
- 普通 Transformer 表格编码器;
二、创新点
1 从“TKR风险预测”进一步走到“TKR具体年份预测”
很多 OA 论文研究的是是否进展,或者未来是否TKR,属于二分类。
本文则预测: 0∼9年内具体哪一年接受TKR,因此预测目标更细。
例如模型输出: 3意味着患者大约 3 年后接受 TKR。
所以这篇论文实际上研究的是一种: Time-to-event Prediction
只不过作者将时间离散化后作为多时间区间预测问题处理。
2 MRI + 临床数据 + 影像评分的多模态融合
作者认为 TKR 不是由影像单独决定的。
比如:
一个 KL4 患者如果没有明显疼痛,可能暂时不会手术;
反过来:
一个 KL1 患者如果疼痛和功能受限非常严重,也可能更早接受 TKR。
因此仅看: MRI是不够的。
论文同时使用:
MRI+Clinical Variables+Image Readings
其中表格信息包括例如:
- 年龄;
- BMI;
- WOMAC;
- KL;
- OARSI;
- BML;
- 其他影像定量/半定量评分。
因此模型不是单纯进行: Image→TKR
而是:
Disease Structure+Symptoms+Clinical Condition→TKR Time
3 使用 Cross-modal Attention,而不是简单拼接
传统 multimodal fusion 常用: Image Feature⊕Tabular Feature,直接 concatenate。
本文则让两种模态通过: Cross Attention显式建立关系。
也就是说,模型可以学习:
哪些临床特征应该关注 MRI 中哪些区域或特征。
而且作者特别设计为:
- Tabular features作为Query
- MRI features 作为 Key / Value。
因为作者认为:
TKR 决策更直接受到患者症状和临床状态影响,所以应该由临床信息主动“查询”影像中相关信息。
三、方法
整个方法可以拆成三个模块:Image Encoder+Tabular Encoder+Multimodal Interaction
流程: MRI→3D ResNet18
同时: Clinical+Image Readings→Feature Selection→Pretrained TabNet
然后: Image Features+Tabular Features
↓
Cross Modal Attention
↓
Year of TKR
3.1 MRI Image Encoder
作者使用的是:Sagittal fat-suppressed 3D DESS MRI
也就是 OAI 中常用的: 3D DESS膝关节 MRI。
Image Encoder 采用: 3D ResNet18
输入尺寸经过裁剪后为: 300×300×160
训练阶段: Random Crop
验证阶段: Center Crop
最终从最后一个 pooling layer 提取 MRI representation:
3.2 Self-supervised Pretraining Pretrained TabNet
作者没有直接监督训练 TabNet,而是先进行:Masked Self-Supervised Learning,思路类似 BERT。
将一部分临床变量: Mask掉
然后让 TabNet 根据剩下变量: Known Features
恢复: Masked Features
即:
Known Variables→Predict Missing Variables
训练时 masking ratio: 0.5
也就是随机遮掉 50% 的变量。
通过这种方式,TabNet 可以提前学习:临床变量之间的关联结构,然后再 Fine-tune 到 TKR 预测。
1、Tabular Data
原始 OAI baseline clinical variables 一共有:1224个。
其中: 245个变量在超过 90% 的受试者中可用。
此外作者还使用了: 全部可获得的影像评价指标
所以表格数据包含两部分: Xt=[Xc,Xr]
其中:
- Xc:Clinical variables;
- Xr:Image readings。
2、Tabular Representation
经过 TabNet 后得到:
可以理解为:
由多个临床/影像变量组成的一组 tabular tokens。
而 MRI 经过 ResNet 得到: I再通过 Linear:
使 image token 与 tabular token 拥有相同 embedding dimension。
3.3 Multimodal Interaction Module
核心融合模块:ψ
包括:
- Self-Attention;
- Cross-Attention;
- Feed Forward;
- Layer Normalization。
一共有: 4 Transformer Layers
每层: 8 Attention Heads
Hidden dimension: 64
Cross-modal Attention公式为:
这里作者设置:
- Q=Tabular Features
- K,V=MRI Features
也就是说: Clinical Information→Query
去询问: MRI Information
哪些影像信息对当前 TKR 时间最重要。
这个设计很符合临床逻辑:
“这个患者痛得怎么样、功能怎么样、年龄是多少、已有影像评分怎么样?”
四、实验
4.1 数据集
使用:OAI,Osteoarthritis Initiative。
OAI 共: 4796名受试者。
研究中: 547 subjects
在 9 年随访期间接受过 TKR。
最终综合:
- MRI;
- Clinical data;
- quantitative image assessments;
- semi-quantitative image assessments;
筛选出: 850 knees用于实验。
还包含丰富的临床变量
例如:WOMAC Pain不同疼痛等级。
OARSI Grade包括:
- None;
- Small;
- Medium;
- Large。
BML:作者将膝关节分为:15个 BML subregions。统计其中存在损伤的区域数量。
因此这不是简单: MRI+年龄+BMI
而是包含相当多OA-specific clinical and imaging features。
4.2 结果
MRI-only:
- ACC=60.7%
- MAE: 1.46
- Macro-AUC: 0.615
Tabular-only:
预训练 TabNet:
- ACC=61.0%
- MAE: 1.55
说明:
单独临床+影像评分数据已经和MRI差不多
再次说明 TKR 是一个临床决策,而不只是影像学严重程度:
症状 + 功能 + 结构共同决定
最终完整模型:
ACC=63.4% MAE=1.33 years Macro-AUC=0.665
是所有方法中最优。
五、总结
什么时候换膝不是单纯由 MRI 决定的,因此模型不应该只“看膝盖”,而应该同时知道患者痛不痛、功能怎么样、影像评分如何,再让这些临床信息主动去 MRI 中寻找与手术时间相关的结构证据。
所以整个思想可以压缩为:“膝盖长什么样”+“患者现在是什么状态”→“还有几年需要换膝”
而从 OA 人工智能研究路线来看,这篇论文已经明显从传统的: 分割→KL分级
进一步走到了: 个体化预后→临床事件时间预测
这类问题与真正的临床决策支持更接近。