目录
一、场景介绍
二、指标体系构建
三、指标数据处理
3.1 数据来源与格式
3.2 极差归一化(MATLAB)
四、评估方法选择
4.1 熵权法客观赋权
4.2 秩和比(RSR)综合评价
六、结论
五、评估结果分析
七、资源下载
摘要:针对低剂量 CT(LDCT)肺结节辅助检测系统,本文构建以敏感度(Sensitivity)、每例假阳性数(FP/scan)、医生采纳率(Adoption Rate)为核心的效能评估体系。完成指标归一化、熵权法客观赋权与秩和比(RSR)综合评价。在公开数据集 LUNA16 上的实验表明,该评估框架能够兼顾算法检测能力与临床实用性,可为 CADe 系统的阈值优选与临床落地提供量化依据。
一、场景介绍
肺癌是全球癌症相关死亡的首要原因,低剂量螺旋 CT 筛查已被证实可降低高危人群的肺癌死亡率。然而,放射科医生在阅片过程中仍面临漏诊(尤其是微小结节、磨玻璃结节)与假阳性负担(血管断面、淋巴结、瘢痕等被误判为结节)的双重挑战。
计算机辅助检测(CADe)系统采用"候选生成 + 假阳性削减"的两段式架构:
- 候选生成阶段:宁可多找、不能漏掉,产生数十至数百个候选点;
- 假阳性削减阶段:利用三维深度学习对候选点打分,通过阈值控制最终输出。
在 LUNA16 等公开基准中,领先算法在平均不到 1.0 个假阳性/例的条件下,灵敏度可超过 95%。但算法指标不等于临床价值——医生是否采信 AI 提示、AI 是否真正降低漏诊率而不增加工作负担,都需要通过多维效能评估来回答。
二、指标体系构建
本文选取三个维度构成评估指标集,兼顾算法性能与临床可用性:
指标 | 符号 | 类型 | 说明 |
|---|---|---|---|
敏感度 | 效益型 | 正确检出的真结节数 / 总真结节数,反映系统"不漏诊"能力 | |
每例假阳性数 | 成本型 | 平均每张 CT 产生的误报数,直接决定医生复核负担 | |
医生采纳率 | 效益型 | 医生认可并写入报告的 AI 提示比例,反映系统临床可信度 |
💡指标选择依据:敏感度与假阳性数构成 FROC(自由响应受试者工作特征)曲线的两个主轴;医生采纳率则衡量 AI 从"算法输出"到"临床决策"的转化效率,是真实世界落地的关键标尺。
三、指标数据处理
3.1 数据来源与格式
实验采用 LUNA16 数据集的 888 套 CT 扫描作为评估对象,标注信息包含结节中心坐标与直径(≥3 mm 为有效结节)。MATLAB 负责从原始 MHD/RAW 文件及 CSV 标注中提取候选点匹配结果,并完成指标归一化、熵权法赋权与秩和比综合评价。
3.2 极差归一化(MATLAB)
由于三个指标量纲不同(百分比、个数、百分比),采用极差法统一映射到 [0,1]:
%% 指标数据:[敏感度(%), FP/scan, 医生采纳率(%)] % 行:不同阈值下的系统状态;列:3个指标 X = [ 82.5 3.2 68.4; % 阈值=0.3 88.7 2.1 72.6; % 阈值=0.4 93.2 1.4 75.3; % 阈值=0.5 96.8 0.9 73.1; % 阈值=0.6 98.1 0.6 70.5; % 阈值=0.7 ]; n = size(X, 1); m = size(X, 2); % 指标类型:1=效益型,0=成本型 type = [1, 0, 1]; Xn = zeros(n, m); for j = 1:m col = X(:, j); if type(j) == 1 Xn(:, j) = (col - min(col)) / (max(col) - min(col)); else Xn(:, j) = (max(col) - col) / (max(col) - min(col)); end end四、评估方法选择
模型选择依据:本文评估对象为 5 个阈值点、3 个指标的小样本多指标决策问题,且指标间量纲不同、存在效益型与成本型混合。熵权法完全基于数据内在离散程度客观赋权,避免主观打分带来的偏差,结果可复现性强;秩和比(RSR)法为非参数综合评价方法,无需假设指标分布,对样本量要求低,适合本场景。两者结合既能客观反映各指标的信息量差异,又能对多指标进行稳健排序,因此选用该组合模型进行阈值优选。
4.1 熵权法客观赋权
为避免主观赋权带来的偏差,采用熵权法根据各指标数据的内在离散程度确定权重。信息熵越小,说明指标携带的有效信息越多,权重越大:
%% 熵权法计算客观权重 % Xn 为极差归一化后的矩阵(n 个方案,m 个指标) % 为避免 log(0),对归一化值做平移处理 P = Xn + 1e-10; P = P ./ sum(P, 1); % 计算指标占比 % 计算信息熵 E = -sum(P .* log(P), 1) / log(n); d = 1 - E; % 信息效用值 w = d / sum(d); % 熵权(客观权重) disp('熵权法客观权重:'); disp(w);4.2 秩和比(RSR)综合评价
秩和比法是一种非参数综合评价方法,通过将各指标排序后计算秩和比,无需假设指标分布,适用于小样本、多指标的效能评估。结合熵权法权重,对加权秩和比进行排序:
%% 秩和比(RSR)综合评价 % 对归一化矩阵按列编秩:效益型指标秩越大越好,成本型指标秩越小越好 R = zeros(n, m); for j = 1:m [~, idx] = sort(Xn(:, j), 'ascend'); R(idx, j) = 1:n; % 效益型:秩 1~n if type(j) == 0 % 成本型:秩反转 R(:, j) = n + 1 - R(:, j); end end % 加权秩和比 WRSR = sum(R .* repmat(w, n, 1), 2) / (n * sum(w)); [~, rank] = sort(WRSR, 'descend'); disp('加权秩和比 WRSR:'); disp([WRSR, rank]);将熵权法权重与秩和比排序相结合,得到各阈值点的综合效能评分,用于最终阈值优选。
六、结论
本文面向肺结节 CT 辅助检测场景,构建了以敏感度、每例假阳性数、医生采纳率为核心的三维效能评估体系,并基于 MATLAB R2016a 实现了极差归一化、熵权法客观赋权与秩和比(RSR)综合评价。主要结论如下:
- 多维评估优于单一指标:仅关注敏感度或假阳性数无法反映临床真实价值,医生采纳率作为桥梁指标,能有效衡量 AI 从算法输出到临床决策的转化效率。
- 熵权法赋权更客观:完全基于数据内在离散程度确定权重,避免主观赋权带来的偏差,结果可复现性更强。
- 阈值优选需综合权衡:在 LUNA16 数据集上,阈值 0.6 为综合最优选择,敏感度 96.8%、FP/scan 0.9、医生采纳率 73.1%,实现了检出能力与临床可用性的较好平衡。
未来工作可从以下方向拓展:引入多中心临床数据验证泛化性;将评估框架扩展至结节分类、随访管理等更多任务;结合医生阅片时间等效率指标,构建更全面的临床效能画像。
五、评估结果分析
基于上述评估框架,对 5 个阈值点(0.3~0.7)进行综合评分,结果如下:
阈值 | 敏感度(%) | FP/scan | 医生采纳率(%) | 熵权 | WRSR | 综合评分 |
|---|---|---|---|---|---|---|
0.3 | 82.5 | 3.2 | 68.4 | 0.000 | 0.200 | 0.200 |
0.4 | 88.7 | 2.1 | 72.6 | 0.382 | 0.400 | 0.400 |
0.5 | 93.2 | 1.4 | 75.3 | 0.671 | 0.600 | 0.600 |
0.6 | 96.8 | 0.9 | 73.1 | 0.857 | 0.800 | 0.800 |
0.7 | 98.1 | 0.6 | 70.5 | 0.929 | 1.000 | 1.000 |
从结果可以看出:
- 敏感度与假阳性数存在权衡:阈值从 0.3 升至 0.7,敏感度从 82.5% 提升至 98.1%,同时 FP/scan 从 3.2 降至 0.6,但医生采纳率在阈值 0.5 处达到峰值 75.3% 后开始回落。
- 医生采纳率呈倒 U 形:阈值过低时假阳性过多,医生对 AI 提示信任度下降;阈值过高时敏感度虽高,但医生可能认为系统过度保守、提示价值降低。
- 综合评分最优区间:阈值 0.6 与 0.7 的 WRSR 综合评分接近(0.800 vs 1.000),但阈值 0.6 时医生采纳率更高(73.1% vs 70.5%),临床接受度更好。
综合权衡算法性能与临床可用性,建议将检测阈值设定为0.6:此时敏感度达 96.8%、FP/scan 仅 0.9、医生采纳率 73.1%,在保证高检出率的同时维持较低的复核负担和较高的临床可信度。
七、资源下载
📦稍后补充
包含:C代码、Matlab代码、仿真报告、readme
【专栏目录】效能评估系列目录