去年 10 月,我们在西北某 150MW 集中式电站驻场时,发现了一个挺离谱的现象:运维值班室里的报警铃声几乎每隔几分钟就响一次,但值班员却气定神闲地喝着茶,眼皮都不抬一下。我凑过去看屏幕,好家伙,后台堆了 4000 多条未读告警。在那一刻,这套耗资百万的监控系统已经名存实亡,它不是「监控」,而是「背景噪音」。
这种场景在存量电站里太普遍了。很多业主在建设初期追求「大而全」的指标监控,结果上线后才发现,数据多并不代表管得好。当一个电站有 200 台组串式逆变器,每台机器每天哪怕只产生 5 条无效告警,也会瞬间淹没真正致命的故障。我们要解决的不是「如何看到数据」,而是「如何让数据变成动作」。
今天想聊聊我们这几年在资产管理系统(AMS)里死磕工单和告警规则的几点认知。不是谈宏大的数字化转型,而是聊聊怎么把那该死的报警铃声降下来,把运维效率提上去。
告警抑制:别让「通讯中断」掩盖了「逆变器离线」
在很多监控平台的逻辑里,逆变器离线和数采离线是并列的。但实操中,如果 1# 数采挂了,它下面挂接的 30 台逆变器会瞬间报出 30 条「逆变器离线」。这在运维人员眼里就是纯粹的垃圾信息。
我们的做法是引入根因分析(RCA)逻辑。在告警引擎层,我们设置了一个简单的层级抑制规则:当上位机(如数采或网关)发生通讯中断时,系统会自动挂起其下属子设备的关联告警,仅生成一条「数采通讯异常」的工单。就这一个改动,直接砍掉了某工商业项目 60% 以上的重复工单。
此外,告警滞后触发也非常关键。很多电站为了追求实时性,把电压波动告警设为 0 秒触发。结果电网稍微抖一下,几百条告警就出来了。我们建议对非致命性告警设置 30-60 秒的判定阈值。下表是我们常用的告警分级分层策略参考:
| 告警等级 | 典型场景 | 处理时效 | 抑制策略 |
|---|---|---|---|
| 紧急 (Critical) | 烟感、直流拉弧、停机故障 | 立即派单 | 不抑制,多通道推送 |
| 重要 (Major) | 组串电流偏低、效率异常 | 4小时内 | 同类合并,10分钟内不重复报警 |
| 次要 (Minor) | 通讯闪断、风扇转速异常 | 24小时内 | 滞后判定,5分钟持续触发才生成 |
| 提示 (Info) | 设备启停、参数修改记录 | 仅记录 | 仅存入数据库,不触发工单 |
工单流转:不是简单的 Excel 搬家
很多 EPC 工程师在规划工单系统时,习惯把流程画得极其复杂:从运维员到站长,再到区域经理,最后到总部专家审核。这种流程在 5MW 的分布式电站上简直是自杀。
我们去年 8 月帮一个资产方重构了工单流转逻辑。核心思路只有一句话:状态机驱动,而不是表单驱动。
工单不应该只是填空题,而应该是一个状态不断流转的实体。我们为每一类故障预设了处理路径。比如「逆变器超温」,工单生成后,第一步一定是「清理风扇/检查环境温度」,运维员必须在 App 上拍一张现场照上传,才能进入下一步。这种「强制指引」对提升存量电站的运维标准化程度非常有效,尤其是那种招不到资深电工、只能靠刚毕业小伙子的偏远电站。
{"ticket_type":"Inverter_Fault","workflow":{"INIT":["CHECK_ENVIRONMENT","CLEAN_FAN"],"DIAGNOSED":["REPLACE_PART","REMOTE_RESET"],"RESOLVED":["POWER_ON_TEST","PHOTO_CONFIRM"],"CLOSED":[]}}在这个 JSON 逻辑里,我们定义了故障处理的闭环。如果运维员没有完成「PHOTO_CONFIRM」,工单在后台状态就是「处理中」,直接影响他的月度 KPI。这种硬约束,比在早会上强调一万遍「要认真检查」都管用。
归一化:解决 5 种品牌逆变器的「方言」问题
这是做存量电站最头疼的地方。有的电站是 2018 年建的,用的是华为;有的 2021 年扩建,用的是阳光;还有些零散的用的是古瑞瓦特或锦浪。每家厂商的告警码定义都不一样,报错001在 A 厂商是过压,在 B 厂商可能就是风扇故障。
如果你的系统直接透传厂家原始告警,运维员就得随身带 5 本手册。我们在架构设计上加了一个映射层(Mapping Layer)。不管底层传上来的是什么原始代码,在经过我们的逻辑引擎后,都会统一映射成一套符合《光伏电站运维规范》的标准故障库。
这其实就是我们做中间件的初衷。我们把这套多品牌接入和逻辑统一的功能做成了ZenovaConnect,它帮我们把 30+ 厂商的 API 接口数据全部洗干净,归一化成通用的字段。这样我们在上层的资产管理系统里写逻辑时,只需要关心「逆变器离线」这一个标准布尔值,而不用去判断它到底是哪家品牌的哪个位(Bit)。
运维响应速度的提升,不在于「快」,而在于「准」
很多运维老板喜欢谈「15 分钟响应」,但实际情况是,运维员跑到了现场发现没带备件,或者发现是虚警,这 15 分钟就是纯浪费。通过精准的告警抑制和标准化的工单引导,我们能把无效出工率降低 30%-40%。
我们要让运维员养成一种习惯:只要手机弹出了工单,那就是真的出事了,而且系统已经告诉了他大概率是哪个部件坏了,带上备件去就行。这种信任感的建立,才是监控系统真正活过来的标志。
存量电站的资产管理,本质上是跟「熵增」做斗争。设备在老化,数据在变多,人员在流失。如果我们的系统不能在告警和工单这两件事上做到出色的克制和精准,那么数字化就只是在给运维人员增加负担。我们接下来的判断是,随着 AI 大模型的引入,告警分析会进入语义化阶段,但底层的逻辑依然离不开扎实的数据归一化和合理的流程设计。
你们在做多品牌电站集成时,遇到最奇葩的告警映射问题是什么?欢迎在评论区吐吐槽,我们一起看看还有哪些坑没填平。