预测性维护先别上模型:把测点、阈值和工单接口做实

前言

预测性维护的招标书经常从算法开始写。现场失败却很少死在模型精度上,而死在测点装错、阈值抄手册、报警不进工单。模型再好看,没有正确的测点就没有退化过程;没有分得清的阈值,就只有报警洪水;报警若停在大屏上,维修班仍然靠夜班电话开工。

ISO 17359 的顺序很清楚:先弄清设备和失效模式,再选监测技术。ISO 13374-1 给的是状态监测数据处理的架构,不是采购说明书。ISO 20816-1 提供机械振动测量与评价的框架,不能当成每一台泵的唯一阈值。先把测点、阈值和工单接口做实,三个月后再谈模型。

一、失败通常不在模型,在信号进不了维修

常见弯路是先招标算法或平台,测点方案留给中标方进场后再“优化”。关键机泵装了振动温度传感器,平台能出健康评分,车间会看大屏。三个月后评分常绿,真正的停机仍来自机械密封泄漏和过滤器堵塞——这两类失效本来就不在测点覆盖里。或者评分常红,因为阈值按手册抄了通用振动限值,负荷一变就超,班组把推送关掉。

更常见的第三种:报警是准的,但只停在推送和群消息。没有预检工单,没有责任人和期限,没有备件预留。等工艺真的叫停,预测信息已经响过几天,维修记录里却写“突发”。

离散线的主轴、化工的机泵、公用的风机和空压机,技术不同,断点相同。预测性维护首先是一条监测到维修的闭环,不是一个准确率指标。闭环缺测点、缺阈值纪律、缺工单,模型没有用武之地。

二、过去:抄周期、抄手册、抄报警

过去很多工厂把预测性维护理解成两件事:把定期检修的周期缩短,或者把振动表的红线按手册贴到每台机器上。

抄周期的问题是过维修和欠维修并存。有退化过程的轴承,可能在周期前就坏;状态一直稳定的风机,仍然按月拆一次。缩短周期只是用更多人工掩盖不会选测点。

抄手册的问题是把评价框架当成唯一限值。ISO 20816-1 给出的是测量与评价的一般方法,要考虑机器类型、安装、转速、负荷和测量位置。把某一档区界直接写成全厂统一危险值,轻载备用泵和满负荷进料泵会一起误报或一起漏报。手册能当起点,不能当现场阈值的终态。

抄报警则制造洪水。现场仪表和在线模块各自报故障,操作屏、巡检器和预测平台叠三层。没有分类,班组只能全开或全关。全开则无暇区分危险和需要维护,全关则等于没有监测。

三、现在:先失效模式,再监测,再数据流,再分类报警

测点还在护罩上、报警还在群里的,先别上模型;测点已对上失效模式、告警已能自动开预检工单的,再谈模型。

ISO 17359 要求先做设备和失效模式。这台风机要防的是轴承损伤、叶轮积灰失平衡,还是电机过热?这台离心泵要防的是轴承、对中,还是汽蚀?模式不同,测点、参数和采集频次不同。先列模式,再选振动、温度、压力、电流、油液或工艺偏差。监测技术是对模式的回答,不是套餐。

测点位置必须对应模式。振动测点应能代表轴承座或承载路径上的运动,而不是装在护罩、配管或松动的过渡块上。温度要贴向轴承或绕组的热路径。装错位置的高精度传感器,只是在精确测量无关的东西

ISO 13374-1 描述的是数据处理总则:从采集、处理,到健康评估和给出建议。它提醒工厂把架构想清楚——原始信号在哪、特征谁算、谁做超限判断、谁生成建议、建议如何出系统。它不是一张算法采购清单。没有工单接口的“建议”,停在架构的最后一公里之外

阈值至少分成告警和危险两级,并允许按设备修订。告警表示该安排预检,危险表示该限制负荷或准备停机。用同一条红线既当预检又当联锁,现场只能选择无视。初始阈值可以参考 ISO 20816-1 的评价思路和同类机经验,但必须用本机稳态数据校准,并写明测量工况。

NAMUR NE107 把现场设备自诊断收成四类:故障、功能检查、超规格、需要维护。作用是让诊断信号按维护相关性分流,而不是每条诊断都当工艺报警。预测平台和仪表诊断接入时,应按这四类映射到不同动作:故障走故障工单,需要维护走预检,功能检查走校验计划,超规格先核工况再决定是否开单。分类是为了减少洪水,不是为了多几个状态灯。

四、落地顺序:测点、阈值、自动开单,三个月后再谈模型

先选真正关键的机泵或风机,不要全厂铺传感器。

第一步,按失效模式选测点。写明位置、方向、参数、采集方式是巡检还是在线。安装后做一次对中、紧固和基准采集。测点验收不合格,不进入阈值讨论。非承载座、松动支架、护罩上的振动点直接返工。

第二步,设告警与危险阈值。告警对应预检响应时限,危险对应升级路径。写清适用工况:转速、负荷、介质温度。备用设备要有单独的试验工况阈值,避免备泵低速盘车套用主机满负荷限值。阈值变更走短流程,改完要能追溯。

第三步,报警自动开预检工单。工单要带到设备位号、参数、当前值、阈值、建议检查项。工单进同一套优先级,而不是进一个“预测待阅”的死队列。没有自动开单,就不要声称已经做预测性维护。开单后仍要人确认,防止误报刷屏,但确认是否认或关闭,不是把报警留在聊天软件里。

前三步跑满三个月,再看要不要上模型。三个月里应能回答:哪些模式被测点覆盖了、告警转工单的及时率、误报主要来自测点还是阈值、真正避免了哪些紧急抢修。覆盖不足就补测点,误报就调阈值和 NE107 分类,及时率差就改工单接口。这些没稳住,模型只会给错误信号做平滑

五、误区:先招标人工智能,测点还在护罩上

进场后电缆难走、轴承座加装要停机、工艺不肯给负荷窗口,传感器就被装在方便的位置。方便的位置常常不是承载路径。精度再高,也监测不到要监测的失效。先招标、后优化测点,几乎总会落到这一步。

第二个误区是把 ISO 20816 的区界当成唯一阈值,全厂一台数。评价框架有用,设备个性更有用。第三是仪表诊断和预测报警不分,全部推给操作员。NE107 的四类就是为了把维护信号从工艺洪水里捞出来。第四是闭环只到大屏。没有工单,就没有维修行为,预测停在展示。

结语

班组按预检工单去现场,而不是按群消息去现场,这一条站住了,模型才有资格进场。测点、阈值和工单接口做不实,模型只是把失败推迟到验收之后。

参考资料

ISO 17359:2018 机器状态监测与诊断 总则
ISO 13374-1:2003 机器状态监测与诊断 数据处理 第1部分:总则
ISO 20816-1:2016 机械振动 测量与评价 第1部分:总则
NAMUR NE107 现场设备自监测与诊断修订说明