论文《Thermodynamic simulation-assisted random forest: Towards explainable fault diagnosis of combustion chamber components of marine diesel engines》提出了热力学仿真辅助随机森林(Thermodynamic Simulation-assisted Random Forest,TSRF)方法,用于船舶柴油机燃烧室部件故障诊断。其基本思路是:先建立并校准一维热力学模型,根据不同故障机理调整关键参数进行故障仿真,再从仿真结果中筛选具有诊断意义的热力学参数,最后利用随机森林完成故障分类,并通过 SHAP 分析模型的判断依据。将这一技术路线抽象到高端装备场景,可以把随机森林看作连接机理模型与故障决策的诊断模块。需要说明的是,论文研究对象是船舶柴油机燃烧室部件,因此“高端装备控诊协同”属于对方法结构的工程化概括,并非论文已经完成跨装备验证。
图1,展示了 TSRF 从热力学建模、故障仿真、参数筛选到随机森林诊断和模型解释的完整流程。
1. 技术路线:先用机理构造故障信息
高端装备故障样本通常比较有限,严重故障尤其难以大量采集。论文没有完全依赖真实故障数据,而是先建立柴油机一维热力学模型,并用实际运行数据进行校准;随后根据不同燃烧室故障的物理机制,对模型中的关键参数进行调整,从而生成不同故障状态下的系统响应。
论文考虑了正常状态以及缸盖裂纹、活塞烧蚀、气缸套磨损、活塞环磨损和活塞环卡滞五类故障。不同故障采用不同参数进行模拟,例如缸盖裂纹主要通过缸盖表面温度表征,活塞烧蚀考虑活塞表面温度和窜气质量流量,气缸套及活塞环相关故障则主要通过缸径、窜气和温度等参数变化体现。其核心原则是让仿真参数变化尽可能对应具体失效机理,而不是简单人为改变故障标签。
图2,展示了柴油机一维热力学模型及其主要系统组成。
对于高端装备,这一步可以理解为“用机理模型构造诊断数据”。只要装备具有相对明确的物理规律,就可以先分析故障如何影响系统响应,再把这些响应交给机器学习模型进行分类。
2. 随机森林:承担故障状态分类
TSRF 中的随机森林不是直接处理未经筛选的原始信号,而是处理经过热力学仿真和参数选择后的诊断特征。论文选择随机森林,主要考虑其适合多类别分类、对样本规模要求相对有限,同时能够处理多参数之间的非线性划分关系。
随机森林由多棵决策树组成,各树分别进行分类,最后通过集成方式得到结果。其基本思想可以简单表示为:
y ^ = mode { T 1 ( x ) , T 2 ( x ) , … , T B ( x ) } \hat y=\operatorname{mode}\{T_1(x),T_2(x),\ldots,T_B(x)\}y^=mode{T1(x),T2(x),…,TB(x)}
其中,最终类别由多棵决策树的投票结果决定。
在论文中,热力学参数是连续变量,需要经过相应的离散化或节点划分后进入决策树。这样,随机森林主要承担的是“多参数状态特征→故障类别”的映射,而不是从原始数据中独立完成全部特征学习。
从控诊协同角度看,可以把它理解为:前端机理模型描述设备在不同运行状态下的响应,随机森林根据这些状态特征完成健康状态判断。
3. 参数筛选:利用 SHAP 缩减诊断输入
热力学模型能够产生较多参数,但并不是每个参数都适合用于故障诊断。参数过多会增加监测成本,也会增加模型解释难度。因此论文在随机森林基础上引入 Tree SHAP,对候选参数进行筛选。
整体过程为:
热力学故障仿真 → 候选参数 → 随机森林预识别 → Tree SHAP分析 → 参数筛选 → 随机森林重新诊断。
论文最终保留了一组核心热力学参数,包括增压器前后排气压力与温度、窜气质量流量、窜气热流以及活塞、缸套和缸盖壁面热流等。
图3,展示了从热力学仿真参数到随机森林预识别、SHAP分析和最终参数集的筛选过程。
SHAP 的一个特点是,它不仅可以提供特征重要性,还可以说明特征对具体预测的贡献方向。对于单个样本,可以把模型输出理解为基准值加上各参数贡献:
f ( x ) = ϕ 0 + ∑ i ϕ i f(x)=\phi_0+\sum_i\phi_if(x)=ϕ0+i∑ϕi
这里的重点不是公式本身,而是它提供了一种统一方式,把一次具体诊断结果拆解到各个参数上。
4. Tree SHAP:解释随机森林的诊断依据
随机森林由多棵树组成,直接分析大量树结构并不适合工程诊断,因此论文采用 Tree SHAP 对模型进行解释。Tree SHAP 利用树模型的分支结构计算特征贡献,相比直接枚举所有特征组合更适合树模型。
论文从两个尺度进行解释。
局部解释面向单个样本,通过 waterfall plot 查看各参数对当前故障判断的正负影响。
全局解释面向整个故障类别,通过 beeswarm plot 分析不同参数在大量样本中的贡献分布,并进一步利用 SHAP 交互值和 dependence plot 分析参数之间的关系。
这种解释方式的意义在于,诊断系统不仅能够输出“是什么故障”,还可以进一步说明“哪些热力学参数促成了这个判断”。但需要注意,SHAP 表示的是参数对机器学习模型预测的贡献,不应直接等同于严格的物理因果关系;最终的工程解释仍需要结合热力学模型和故障机理进行核对。
图4,展示了单样本 waterfall、全局 beeswarm、参数交互及 dependence 分析。
5. “机理模型 + 随机森林 + SHAP”的控诊协同思路
把论文的方法压缩后,可以得到一条比较清晰的诊断链:
运行数据 → 机理模型校准 → 故障机理参数化 → 故障仿真 → 诊断参数筛选 → 随机森林分类 → SHAP解释。
其中,机理模型解决“故障如何影响装备状态”的问题;随机森林解决“这些状态特征对应什么故障”的问题;SHAP解决“模型为什么这样判断”的问题。
如果推广到其他高端装备,可以把这一框架理解为:
控制/运行条件 → 装备机理响应 → 诊断特征 → 随机森林 → 健康状态判断。
这里的“控诊协同”主要体现在运行条件和装备机理被纳入诊断特征形成过程,而不是把随机森林直接作为控制器的一部分。
例如,在热力系统中可以使用温度、压力和流量等机理参数;在旋转装备中可以使用转速、载荷以及与能量传递和摩擦相关的状态参数;在液压系统中可以使用压力、流量和执行器状态等信息。具体参数必须根据装备故障机理重新确定,不能直接照搬柴油机中的参数体系。
6. 工程应用时的关键问题
这类方法真正落地时,首先要解决的是机理模型与真实设备的一致性。论文利用实际运行数据对正常工况进行了模型校准,但也明确指出,故障参数范围仍需要进一步优化。
其次是故障严重程度。论文目前主要建立若干代表性健康状态,后续还需要进一步研究同一故障不同严重程度对应的参数变化。
另外,仿真数据不能自动替代真实故障数据。真实设备还存在传感器特性、环境变化、部件磨损和测量噪声等因素,因此从仿真诊断走向实际部署仍需要持续进行实测验证。
7. 总结
TSRF 的核心并不是单独使用随机森林,而是把随机森林放在一个由物理模型和可解释分析共同支撑的诊断链条中。
机理模型负责构造和约束故障信息,随机森林负责多参数故障分类,SHAP负责特征筛选与结果解释。
对于具有明确物理机理、真实故障样本有限、同时需要较强可解释性的高端装备,这种方法可以作为一种控诊协同故障诊断的技术框架。其推广的关键不在于直接复制随机森林参数,而在于重新建立“运行条件—物理响应—故障特征—诊断结果”之间的对应关系。
同时需要明确,论文目前的主要验证基础是船舶柴油机燃烧室故障仿真数据,作者也将不同运行环境、故障严重度以及更复杂热力学模型作为后续研究方向。因此,面向其他高端装备时,应将该方法视为一种机理辅助的诊断建模思路,而不是已经普遍验证的统一算法。
原文出处:Thermodynamic simulation-assisted random forest: Towards explainable fault diagnosis of combustion chamber components of marine diesel engines. Measurement, 251 (2025), 117252. DOI: 10.1016/j.measurement.2025.117252.