公司动态

50MW电站日产千条告警,我们是如何通过降噪把有效工单提升3倍的

📅 2026/8/29 6:45:12
50MW电站日产千条告警,我们是如何通过降噪把有效工单提升3倍的
去年 10 月我们在西北某 150MW 集中式电站驻场时发现了一个挺离谱的现象运维值班室里的报警铃声几乎每隔几分钟就响一次但值班员却气定神闲地喝着茶眼皮都不抬一下。我凑过去看屏幕好家伙后台堆了 4000 多条未读告警。在那一刻这套耗资百万的监控系统已经名存实亡它不是「监控」而是「背景噪音」。这种场景在存量电站里太普遍了。很多业主在建设初期追求「大而全」的指标监控结果上线后才发现数据多并不代表管得好。当一个电站有 200 台组串式逆变器每台机器每天哪怕只产生 5 条无效告警也会瞬间淹没真正致命的故障。我们要解决的不是「如何看到数据」而是「如何让数据变成动作」。今天想聊聊我们这几年在资产管理系统AMS里死磕工单和告警规则的几点认知。不是谈宏大的数字化转型而是聊聊怎么把那该死的报警铃声降下来把运维效率提上去。告警抑制别让「通讯中断」掩盖了「逆变器离线」在很多监控平台的逻辑里逆变器离线和数采离线是并列的。但实操中如果 1# 数采挂了它下面挂接的 30 台逆变器会瞬间报出 30 条「逆变器离线」。这在运维人员眼里就是纯粹的垃圾信息。我们的做法是引入根因分析RCA逻辑。在告警引擎层我们设置了一个简单的层级抑制规则当上位机如数采或网关发生通讯中断时系统会自动挂起其下属子设备的关联告警仅生成一条「数采通讯异常」的工单。就这一个改动直接砍掉了某工商业项目 60% 以上的重复工单。此外告警滞后触发也非常关键。很多电站为了追求实时性把电压波动告警设为 0 秒触发。结果电网稍微抖一下几百条告警就出来了。我们建议对非致命性告警设置 30-60 秒的判定阈值。下表是我们常用的告警分级分层策略参考告警等级典型场景处理时效抑制策略紧急 (Critical)烟感、直流拉弧、停机故障立即派单不抑制多通道推送重要 (Major)组串电流偏低、效率异常4小时内同类合并10分钟内不重复报警次要 (Minor)通讯闪断、风扇转速异常24小时内滞后判定5分钟持续触发才生成提示 (Info)设备启停、参数修改记录仅记录仅存入数据库不触发工单工单流转不是简单的 Excel 搬家很多 EPC 工程师在规划工单系统时习惯把流程画得极其复杂从运维员到站长再到区域经理最后到总部专家审核。这种流程在 5MW 的分布式电站上简直是自杀。我们去年 8 月帮一个资产方重构了工单流转逻辑。核心思路只有一句话状态机驱动而不是表单驱动。工单不应该只是填空题而应该是一个状态不断流转的实体。我们为每一类故障预设了处理路径。比如「逆变器超温」工单生成后第一步一定是「清理风扇/检查环境温度」运维员必须在 App 上拍一张现场照上传才能进入下一步。这种「强制指引」对提升存量电站的运维标准化程度非常有效尤其是那种招不到资深电工、只能靠刚毕业小伙子的偏远电站。{ticket_type:Inverter_Fault,workflow:{INIT:[CHECK_ENVIRONMENT,CLEAN_FAN],DIAGNOSED:[REPLACE_PART,REMOTE_RESET],RESOLVED:[POWER_ON_TEST,PHOTO_CONFIRM],CLOSED:[]}}在这个 JSON 逻辑里我们定义了故障处理的闭环。如果运维员没有完成「PHOTO_CONFIRM」工单在后台状态就是「处理中」直接影响他的月度 KPI。这种硬约束比在早会上强调一万遍「要认真检查」都管用。归一化解决 5 种品牌逆变器的「方言」问题这是做存量电站最头疼的地方。有的电站是 2018 年建的用的是华为有的 2021 年扩建用的是阳光还有些零散的用的是古瑞瓦特或锦浪。每家厂商的告警码定义都不一样报错001在 A 厂商是过压在 B 厂商可能就是风扇故障。如果你的系统直接透传厂家原始告警运维员就得随身带 5 本手册。我们在架构设计上加了一个映射层Mapping Layer。不管底层传上来的是什么原始代码在经过我们的逻辑引擎后都会统一映射成一套符合《光伏电站运维规范》的标准故障库。这其实就是我们做中间件的初衷。我们把这套多品牌接入和逻辑统一的功能做成了ZenovaConnect它帮我们把 30 厂商的 API 接口数据全部洗干净归一化成通用的字段。这样我们在上层的资产管理系统里写逻辑时只需要关心「逆变器离线」这一个标准布尔值而不用去判断它到底是哪家品牌的哪个位Bit。运维响应速度的提升不在于「快」而在于「准」很多运维老板喜欢谈「15 分钟响应」但实际情况是运维员跑到了现场发现没带备件或者发现是虚警这 15 分钟就是纯浪费。通过精准的告警抑制和标准化的工单引导我们能把无效出工率降低 30%-40%。我们要让运维员养成一种习惯只要手机弹出了工单那就是真的出事了而且系统已经告诉了他大概率是哪个部件坏了带上备件去就行。这种信任感的建立才是监控系统真正活过来的标志。存量电站的资产管理本质上是跟「熵增」做斗争。设备在老化数据在变多人员在流失。如果我们的系统不能在告警和工单这两件事上做到出色的克制和精准那么数字化就只是在给运维人员增加负担。我们接下来的判断是随着 AI 大模型的引入告警分析会进入语义化阶段但底层的逻辑依然离不开扎实的数据归一化和合理的流程设计。你们在做多品牌电站集成时遇到最奇葩的告警映射问题是什么欢迎在评论区吐吐槽我们一起看看还有哪些坑没填平。