☰
【医疗篇01】肺结节 CT 辅助检测效能评估模型与实现(C+MATLAB双版本)
2026/10/2 12:10:38 网站建设 项目流程

目录

一、场景介绍

二、指标体系构建

三、指标数据处理

3.1 数据来源与格式

3.2 极差归一化(MATLAB)

四、评估方法选择

4.1 熵权法客观赋权

4.2 秩和比(RSR)综合评价

六、结论

五、评估结果分析

七、资源下载


摘要:针对低剂量 CT(LDCT)肺结节辅助检测系统,本文构建以敏感度(Sensitivity)、每例假阳性数(FP/scan)、医生采纳率(Adoption Rate)为核心的效能评估体系。完成指标归一化、熵权法客观赋权与秩和比(RSR)综合评价。在公开数据集 LUNA16 上的实验表明,该评估框架能够兼顾算法检测能力与临床实用性,可为 CADe 系统的阈值优选与临床落地提供量化依据。

一、场景介绍

肺癌是全球癌症相关死亡的首要原因,低剂量螺旋 CT 筛查已被证实可降低高危人群的肺癌死亡率。然而,放射科医生在阅片过程中仍面临漏诊(尤其是微小结节、磨玻璃结节)与假阳性负担(血管断面、淋巴结、瘢痕等被误判为结节)的双重挑战。

计算机辅助检测(CADe)系统采用"候选生成 + 假阳性削减"的两段式架构:

  • 候选生成阶段:宁可多找、不能漏掉,产生数十至数百个候选点;
  • 假阳性削减阶段:利用三维深度学习对候选点打分,通过阈值控制最终输出。

在 LUNA16 等公开基准中,领先算法在平均不到 1.0 个假阳性/例的条件下,灵敏度可超过 95%。但算法指标不等于临床价值——医生是否采信 AI 提示、AI 是否真正降低漏诊率而不增加工作负担,都需要通过多维效能评估来回答。

二、指标体系构建

本文选取三个维度构成评估指标集,兼顾算法性能与临床可用性:

指标

符号

类型

说明

敏感度​

效益型

正确检出的真结节数 / 总真结节数,反映系统"不漏诊"能力

每例假阳性数​

成本型

平均每张 CT 产生的误报数,直接决定医生复核负担

医生采纳率​

效益型

医生认可并写入报告的 AI 提示比例,反映系统临床可信度

💡指标选择依据:敏感度与假阳性数构成 FROC(自由响应受试者工作特征)曲线的两个主轴;医生采纳率则衡量 AI 从"算法输出"到"临床决策"的转化效率,是真实世界落地的关键标尺。

三、指标数据处理

3.1 数据来源与格式

实验采用 LUNA16 数据集的 888 套 CT 扫描作为评估对象,标注信息包含结节中心坐标与直径(≥3 mm 为有效结节)。MATLAB 负责从原始 MHD/RAW 文件及 CSV 标注中提取候选点匹配结果,并完成指标归一化、熵权法赋权与秩和比综合评价。

3.2 极差归一化(MATLAB)

由于三个指标量纲不同(百分比、个数、百分比),采用极差法统一映射到 [0,1]:

%% 指标数据:[敏感度(%), FP/scan, 医生采纳率(%)] % 行:不同阈值下的系统状态;列:3个指标 X = [ 82.5 3.2 68.4; % 阈值=0.3 88.7 2.1 72.6; % 阈值=0.4 93.2 1.4 75.3; % 阈值=0.5 96.8 0.9 73.1; % 阈值=0.6 98.1 0.6 70.5; % 阈值=0.7 ]; n = size(X, 1); m = size(X, 2); % 指标类型:1=效益型,0=成本型 type = [1, 0, 1]; Xn = zeros(n, m); for j = 1:m col = X(:, j); if type(j) == 1 Xn(:, j) = (col - min(col)) / (max(col) - min(col)); else Xn(:, j) = (max(col) - col) / (max(col) - min(col)); end end

四、评估方法选择

模型选择依据:本文评估对象为 5 个阈值点、3 个指标的小样本多指标决策问题,且指标间量纲不同、存在效益型与成本型混合。熵权法完全基于数据内在离散程度客观赋权,避免主观打分带来的偏差,结果可复现性强;秩和比(RSR)法为非参数综合评价方法,无需假设指标分布,对样本量要求低,适合本场景。两者结合既能客观反映各指标的信息量差异,又能对多指标进行稳健排序,因此选用该组合模型进行阈值优选。

4.1 熵权法客观赋权

为避免主观赋权带来的偏差,采用熵权法根据各指标数据的内在离散程度确定权重。信息熵越小,说明指标携带的有效信息越多,权重越大:

%% 熵权法计算客观权重 % Xn 为极差归一化后的矩阵(n 个方案,m 个指标) % 为避免 log(0),对归一化值做平移处理 P = Xn + 1e-10; P = P ./ sum(P, 1); % 计算指标占比 % 计算信息熵 E = -sum(P .* log(P), 1) / log(n); d = 1 - E; % 信息效用值 w = d / sum(d); % 熵权(客观权重) disp('熵权法客观权重:'); disp(w);

4.2 秩和比(RSR)综合评价

秩和比法是一种非参数综合评价方法,通过将各指标排序后计算秩和比,无需假设指标分布,适用于小样本、多指标的效能评估。结合熵权法权重,对加权秩和比进行排序:

%% 秩和比(RSR)综合评价 % 对归一化矩阵按列编秩:效益型指标秩越大越好,成本型指标秩越小越好 R = zeros(n, m); for j = 1:m [~, idx] = sort(Xn(:, j), 'ascend'); R(idx, j) = 1:n; % 效益型:秩 1~n if type(j) == 0 % 成本型:秩反转 R(:, j) = n + 1 - R(:, j); end end % 加权秩和比 WRSR = sum(R .* repmat(w, n, 1), 2) / (n * sum(w)); [~, rank] = sort(WRSR, 'descend'); disp('加权秩和比 WRSR:'); disp([WRSR, rank]);

将熵权法权重与秩和比排序相结合,得到各阈值点的综合效能评分,用于最终阈值优选。

六、结论

本文面向肺结节 CT 辅助检测场景,构建了以敏感度、每例假阳性数、医生采纳率为核心的三维效能评估体系,并基于 MATLAB R2016a 实现了极差归一化、熵权法客观赋权与秩和比(RSR)综合评价。主要结论如下:

  • 多维评估优于单一指标:仅关注敏感度或假阳性数无法反映临床真实价值,医生采纳率作为桥梁指标,能有效衡量 AI 从算法输出到临床决策的转化效率。
  • 熵权法赋权更客观:完全基于数据内在离散程度确定权重,避免主观赋权带来的偏差,结果可复现性更强。
  • 阈值优选需综合权衡:在 LUNA16 数据集上,阈值 0.6 为综合最优选择,敏感度 96.8%、FP/scan 0.9、医生采纳率 73.1%,实现了检出能力与临床可用性的较好平衡。

未来工作可从以下方向拓展:引入多中心临床数据验证泛化性;将评估框架扩展至结节分类、随访管理等更多任务;结合医生阅片时间等效率指标,构建更全面的临床效能画像。

五、评估结果分析

基于上述评估框架,对 5 个阈值点(0.3~0.7)进行综合评分,结果如下:

阈值

敏感度(%)

FP/scan

医生采纳率(%)

熵权

WRSR

综合评分

0.3

82.5

3.2

68.4

0.000

0.200

0.200

0.4

88.7

2.1

72.6

0.382

0.400

0.400

0.5

93.2

1.4

75.3

0.671

0.600

0.600

0.6

96.8

0.9

73.1

0.857

0.800

0.800

0.7

98.1

0.6

70.5

0.929

1.000

1.000

从结果可以看出:

  • 敏感度与假阳性数存在权衡:阈值从 0.3 升至 0.7,敏感度从 82.5% 提升至 98.1%,同时 FP/scan 从 3.2 降至 0.6,但医生采纳率在阈值 0.5 处达到峰值 75.3% 后开始回落。
  • 医生采纳率呈倒 U 形:阈值过低时假阳性过多,医生对 AI 提示信任度下降;阈值过高时敏感度虽高,但医生可能认为系统过度保守、提示价值降低。
  • 综合评分最优区间:阈值 0.6 与 0.7 的 WRSR 综合评分接近(0.800 vs 1.000),但阈值 0.6 时医生采纳率更高(73.1% vs 70.5%),临床接受度更好。

综合权衡算法性能与临床可用性,建议将检测阈值设定为0.6:此时敏感度达 96.8%、FP/scan 仅 0.9、医生采纳率 73.1%,在保证高检出率的同时维持较低的复核负担和较高的临床可信度。

七、资源下载

📦稍后补充​

包含:C代码、Matlab代码、仿真报告、readme

【专栏目录】效能评估系列目录

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询