前言
季度设备可靠性复盘会上,大屏幕投出漂亮的故障柏拉图:各产线的停机统计五颜六色,排在第一位的却常常是刺眼的「其他」。
在很多工厂的 EAM 或 CMMS 报表里,「其他」或「综合故障」占了非计划停机工单的 40% 到 60%。下方的处理记录清一色写着“已修好”、“已换件”。当主管问起某台关键机组为何单月连续跳停四次时,点开工单明细,根因字段空空如也。
报表很热闹,数据全落空。故障代码一旦沦为现场关单的「垃圾桶」,任何基于工单数据的根因分析与可靠性改进,都会沦为没有依据的空中楼阁。
一、现场割裂:一线选「其他」,不是工人不负责
面对报表上一大片「其他」,管理层最习惯的反应是指责机修工“责任心差”、“关单敷衍”。但在真实的维修现场,选「其他」通常是糟糕的系统设计逼出来的必然结果。
许多工厂上线系统时,试图建一套“大而全”的代码库。机修工点开下拉菜单,面对的是密密麻麻上百项的扁平列表:既有“轴承异响”、“电机过热”等外在表象,又有“疲劳断裂”、“润滑不良”等失效机理,还夹杂着“操作不当”等人为归因。
更现实的是,机修工刚在四五十度的装置现场完成两小时紧急抢修,满手油污,车间还在催着交车。要在手持屏幕上翻找四五屏去对齐抽象代码,根本不现实。滑两下就能勾选的“9999-其他”,成了最快恢复生产、最不易被考核挑刺的避风港。
把混乱的工程概念堆成几十上百项的长列表,现场工人除了选「其他」快速脱身,没有任何合理的工程选择。系统给的工具不好用,数据失真就不是一线的态度问题,而是管理规则脱离了现场物理约束。
二、踩过的弯路:一刀切禁用「其他」,逼出虚假代码
发现「其他」泛滥后,很多工厂设备科走过一条典型弯路:在系统里一刀切地删除或禁用「其他」选项,并设为强制必填。
管理者以为封死了退路,就能逼一线认真分类。然而现场有自己的生存逻辑:既然「其他」选不了,列表又依然庞杂难找,维修工就直接选排在列表第一项的代码。
在某大型流程制造工厂的真实案例中,禁用「其他」两个月后,「其他」占比确实清零了,但排在首位的“01-电气跳闸”暴增至近 70%。可靠性工程师据此写了厚厚的分析报告,得出“全厂电网质量严重恶化”的虚假结论,甚至推动了数十万元的稳压改造。直到现场复核才发现,其中大量工单实为气管脱落和机械密封漏油。
靠硬性禁用「其他」堵漏洞,只会把显性的垃圾数据变成具有欺骗性的伪造数据,对工程决策的危害反而呈倍数放大。
三、明确判断与边界:三级解耦比穷举代码更管用
治理故障代码,核心不是扩充词汇量,而是理顺分类的工程逻辑。
在此,我们给出明确判断:绝不能试图建立一套穷尽现场所有故障细节的扁平代码表,而必须遵循 ISO 14224 标准框架,将故障记录解耦为三级独立的联动结构:故障部位(Part)、故障模式(Failure Mode)与故障机理/根因(Failure Mechanism/Cause)。每一级的单选下拉项必须严格控制在 7 到 10 项以内。
该判断的适用边界是:适用于拥有多班组协同、实行预防性维护闭环且具备工程支持的中大型工厂;对仅有两三名维保人员、以应急小修为主的小型加工点,推行三级联动反而增加系统负荷,保留简短自由文本与拍照举证更务实。
通过三级解耦,代码逻辑被清晰分离:
1. 部位(坏在哪里):如轴承、叶轮、机械密封、阀芯;
2. 模式(表现为什么现象):如振动过大、介质泄漏、温升超标、卡死停转;
3. 机理/根因(本质机理是什么):如润滑失效、磨粒磨损、疲劳剥落、安装对中超差。
每一级各司其职,现场不再面对混杂的多选池。
四、过去与现在:从单级填报到现象与根因分权
理顺代码结构后,更关键的是工单关闭流程中的责任拆分。
过去,工厂把故障代码当成关单时由一线机修工独自完成的单选任务。刚修完设备,就逼工人在现场判定机理与根因。但工程常识表明:轴承在现场刚换下,没有清洗拆解、没有公差检测,工人根本不可能在两分钟内断定究竟是交变疲劳还是游隙选小。逼迫现场立刻定性,只能逼出假数据。
现在,合理的机制必须在工单流转中推行现场事实与工程分析的物理分权:一线维修工关单只负责记录物理部件与外在现象,深入的失效机理与根因判定交由工程师在后续分析中回填。
一线机修工抢修完成,只需在半分钟内完成部位与模式两项客观单选,即可关单放行产线。而针对关键机组或重大停机,系统自动派发根因子任务,由可靠性工程师在 48 小时内结合备件拆检与油样结果回填机理代码。一线重在还原现场真实,工程师重在工程严谨。
五、数字带条件:代码精简度与「其他」占比的健康基线
现场治理故障代码,必须建立符合现场实际的量化警戒线。
数字带条件:
1. 单级菜单选项严控在 8 至 12 项以内:在任一设备类别下,单级下拉项一旦超过 15 项,一线填报准确率会出现断崖式下跌。代码库必须保持精炼克制。
2. 「其他」代码占比严守 5% 的警戒线:在健康运转的 EAM 系统中,故障工单中「其他」代码比例应稳定在 3% 至 5% 之间。若低于 1%,通常意味着现场存在瞒报或被禁用后的机械转嫁;若高于 10%,说明代码库存在明显盲区,需补充常用项;若持续超过 20%,表明该类别的关单审核与界面设计已实质失控。
3. 根因深度复核的触发阈值:绝不能对所有小修小补都强制全套分析。建议仅对 A 类关键设备、或 单次非计划停机超 2 小时(流程型工况)、或 停机造成直接损失超 3 万元 的工单强制启动工程师根因复核;普通日常故障守住部位与模式二级代码即可。
结语
设备资产管理的质量,不取决于仪表盘有多华丽,而取决于每一张工单留下的证据链是否扎实。
停止将数据质量问题单纯甩锅给一线工人。用部位、模式与根因的三级解耦重构代码体系,把现场事实与工程分析拆到合适的岗位。只有让一线工人在 30 秒内选得出、选得准,复盘报表上的故障代码才不再是虚妄的数字,可靠性改进才能找到真正的着力点。



