• 微信号码

    lmrjshanghai
  • 2026-09-25
  • 0

工业设备预测性维护(BYX)与边缘端小模型轻量化落地框架研究报告

工业设备预测性维护(BYX)与边缘端小模型轻量化落地框架研究报告

作者单位:泷码软件(上海)有限公司、泷码软件研究院
摘要
当前国内制造业,尤其是中小制造企业在推进设备预测性维护过程中普遍面临算力成本高、云端传输时延大、现场数据隐私风险高、故障定位效率低、系统对接复杂等现实瓶颈。传统基于云端大模型的预测性维护方案,需要持续将海量传感器时序数据上传至算力中心,网络带宽、服务器运维成本抬高项目门槛,故障预警与根因分析存在明显延迟,难以适配工厂现场实时运维的需求。本研究提出工业设备预测性维护 BYX 体系,构建一套面向工业场景的边缘端小模型轻量化落地框架。框架聚焦设备传感器时序数据的边缘本地模型推理、实时异常预警两大核心能力,将模型计算部署在工业边缘网关、边缘控制器等现场硬件,摆脱对高算力云中心的强依赖;同时研究故障根因自动归集算法链路,实现异常告警信息与企业运维工单系统的自动化联动,形成 “数据采集 - 边缘推理 - 异常告警 - 根因归集 - 工单下发 - 运维闭环” 全流程体系。本报告从行业现状、理论基础、框架架构、模型轻量化改造、时序数据处理、异常识别机制、根因归集逻辑、工单联动接口设计、系统验证、经济性分析、现存局限与未来方向展开系统性论述。研究结果表明,BYX 边缘轻量化框架能够将传感器时序数据保留在工厂本地,推理时延控制在毫秒级,大幅削减云端算力与专线通信投入,降低中小制造企业预测性维护项目的部署周期与总体拥有成本,为离散制造、流程制造场景下轻量化预测性维护落地提供可复制的工程化方案。

关键词:预测性维护;边缘计算;轻量化小模型;传感器时序数据;异常预警;故障根因分析;中小制造企业;工单联动

1 绪论

1.1 研究背景

制造业数字化转型持续深化,设备运维模式正从传统的事后维修、定期预防性检修向预测性维护(Predictive Maintenance, PdM)演进。预测性维护依托振动、温度、电流、压力、转速等传感器采集设备运行时序数据,通过机器学习模型识别设备性能退化趋势,提前预判潜在故障,避免非计划停机,降低备件损耗与停产损失。

在过去数年间,大量预测性维护项目采用 “传感器采集 + 数据上云 + 云端大模型推理” 的架构。该架构在大型龙头制造企业、具备充足 IT 预算与专业运维团队的工厂具备落地条件,但在数量庞大的中小制造企业场景下存在显著水土不服。中小制造企业普遍存在如下约束:工业现场网络带宽有限、IT 预算紧张、缺少专职算法与大数据运维人员;同时工厂生产数据涉及工艺参数、设备核心运行状态,数据外传上云存在信息安全顾虑。云端集中式架构持续回传高频采样的传感器时序数据,带来高额流量费用与云服务器算力开销,一旦网络中断,模型推理、异常预警功能直接失效,实时性无法保障。此外,多数商用 PdM 系统仅能输出故障告警,无法自动归集故障根因,告警信息需要人工转录、手动创建运维工单,告警到现场处置链路割裂,大量告警信息淹没在噪声数据中,产生告警疲劳,削弱预测性维护的实际价值。

边缘计算技术与轻量化深度学习小模型的快速发展,为解决上述痛点提供新路径。将模型推理下沉至工厂边缘端,在边缘网关、嵌入式计算单元本地完成时序数据预处理、模型推理与异常识别,原始传感器数据无需全部上传云端,仅将告警摘要、根因标签、统计报表等少量结构化信息按需上传。在此技术背景下,泷码软件(上海)有限公司联合泷码软件研究院提出BYX 工业设备预测性维护体系及边缘端小模型轻量化落地框架,目标是构建低算力依赖、低成本、易对接运维系统的预测性维护工程方案,专门面向中小制造企业,降低 PdM 技术落地门槛。

1.2 国内外研究现状

1.2.1 预测性维护时序数据建模研究现状

工业时序预测与异常检测模型研究,早期以统计方法为主,包含 ARIMA、指数平滑、卡尔曼滤波等方法,适合平稳时序,对于工业设备非线性、非平稳、多工况、噪声混杂的传感器数据拟合能力有限。随着深度学习发展,LSTM、GRU、Transformer、TCN 时序卷积网络等模型广泛用于设备退化趋势预测与异常识别。但原始模型参数量巨大,推理过程对 GPU 高算力依赖,原生设计面向云端服务器,很难直接部署在内存、算力资源受限的边缘硬件上。

近年学术界开始关注轻量化时序模型,通过网络剪枝、量化、知识蒸馏、网络结构搜索等手段压缩模型体积,降低推理计算量。现有轻量化时序模型研究大多聚焦算法性能优化,较少完整考虑工业工程落地约束:包括工业协议适配、传感器数据丢包与异常值清洗、多设备异构接入、根因自动推理、和第三方工单系统标准化对接等工程环节。很多算法成果停留在数据集仿真验证阶段,缺少面向中小工厂低成本硬件的整套落地框架。

1.2.2 边缘计算在工业预测性维护领域应用现状

工业边缘计算标准与硬件产品日趋成熟,边缘网关支持 Modbus、OPC UA、MQTT 等主流工业协议,能够就地采集多类型传感器时序数据。现有工业边缘 PdM 方案多存在两个问题:其一,边缘端仅承担数据采集、转发功能,模型推理依然放在云端,边缘只做数据管道;其二,少数边缘推理方案,模型依然偏大,需要搭载高性能边缘 GPU 硬件,硬件采购成本仍然偏高,无法适配中小企业低成本改造需求。

故障根因分析方面,传统做法依赖故障树 FTA、失效模式 FMEA 人工预先构建规则库,规则维护工作量巨大,设备型号变更、工艺调整后需要人工更新规则。基于图推理、因果推断的自动根因归集技术,目前大多部署在云端,依赖全量历史数据做关联分析,难以在边缘有限资源下实现轻量化根因定位。告警系统和工单系统大多采用定制化开发对接,接口不通用,项目实施周期长,每新增一套设备就要重新做系统集成,进一步抬高中小企业实施成本。

1.2.3 中小制造企业 PdM 落地瓶颈研究综述

国内外调研数据显示,大型企业预测性维护项目落地成功率较高,但中小制造企业预测性维护项目失败率居高不下。核心障碍集中于:项目总体拥有成本过高、模型泛化能力不足,换设备就要重新训练模型、缺少标准化运维闭环,告警和现场运维脱节、数据安全顾虑。现有商用产品大多以大客户需求为基准设计,缺少轻量化、模块化、开箱可集成的方案。本研究 BYX 框架正是针对该市场缺口,将边缘轻量化模型推理、本地根因归集、工单联动作为一体化系统进行设计。

1.3 研究目标与研究内容

1.3.1 研究目标

构建 BYX 工业设备预测性维护体系,形成完整边缘端小模型轻量化落地框架。

1. 实现设备传感器时序数据在边缘网关本地完成模型推理与实时异常预警,不依赖持续调用远端高算力中心;

2. 建立轻量化故障根因自动归集链路,在边缘端对异常事件进行根因标签识别、证据归集;

3. 设计标准化接口,实现异常告警、根因结果自动推送至运维工单系统,形成运维闭环;

4. 控制硬件投入、实施、运维成本,显著降低中小制造企业部署预测性维护的门槛;

5. 完成框架原型系统验证,评估边缘推理时延、资源占用、异常识别准确率、项目经济性指标。

1.3.2 主要研究内容

1. BYX 预测性维护体系整体架构设计,分层定义感知层、边缘计算层、业务应用层;

2. 工业传感器时序数据边缘预处理技术,处理数据缺失、噪声、工况漂移、采样不一致等工业脏数据问题;

3. 时序小模型轻量化改造技术路线,包含知识蒸馏、量化、剪枝,适配边缘低算力硬件;

4. 边缘本地时序模型推理引擎与实时异常预警机制,异常分级策略;

5. 轻量化故障根因自动归集模型与算法,在边缘资源约束下完成异常溯源;

6. 告警事件与运维工单系统联动机制,标准化消息接口、事件推送规则、状态回传逻辑;

7. 原型系统测试,对推理时延、内存占用、异常检出率、误报率进行实验评估;

8. 中小制造企业场景下的成本测算、风险分析、落地实施路径研究。

1.4 研究思路与论文结构

本研究采用 “理论建模 - 框架设计 - 算法轻量化 - 原型开发 - 场景验证 - 经济性评估” 的工程化研究思路。首先梳理工业时序数据特征、边缘算力约束、预测性维护业务闭环需求;其次搭建 BYX 分层框架,依次解决数据预处理、轻量化模型训练与部署、边缘推理、异常分级告警、根因归集、工单联动模块设计;搭建原型系统,采用真实工厂传感器数据集开展测试验证;评估系统性能与投入成本,分析技术局限性,提出后续迭代方向。

报告章节安排:第一章绪论;第二章 BYX 框架相关基础理论;第三章 BYX 边缘端小模型轻量化落地框架总体架构;第四章边缘侧传感器时序数据处理机制;第五章时序小模型轻量化改造与边缘本地推理;第六章边缘端故障根因自动归集方法;第七章告警事件与运维工单系统联动设计;第八章原型系统实验验证与结果分析;第九章中小制造企业实施成本分析;第十章系统局限与未来研究方向;第十一章结论。

2 BYX 框架相关基础理论

2.1 预测性维护基础理论

预测性维护的核心逻辑是捕捉设备性能退化的隐性特征。设备从正常运行、性能缓慢退化,到早期故障、功能失效存在时间窗口。传感器采集振动、温度、电流等时序信号,设备正常工况下时序数据分布稳定;出现早期劣化时,信号的频域特征、时域统计特征、时序趋势发生偏移。PdM 模型学习正常工况基准分布,识别偏离基准的异常,预测剩余使用寿命 RUL(Remaining Useful Life)。

预测性维护分为两大任务:异常检测(识别当前设备是否出现异常)、寿命预测(预估故障发生时间)。BYX 框架优先聚焦实时异常预警,兼顾轻量化 RUL 估算。和传统定期维护相比,预测性维护按需触发维修,减少不必要停机检修;和事后维修相比,提前发现隐患,规避突发停产事故。

工业时序数据区别于通用时序数据集,存在几个固有特征:多工况切换、传感器噪声、数据丢包、不同设备个体差异、工况漂移。模型必须具备一定抗漂移能力,否则会出现大量误告警,这也是本框架在数据预处理环节重点解决的问题。

2.2 边缘计算基础理论

工业边缘计算指计算、存储、分析能力部署在靠近数据产生源头(工业设备、传感器)的现场节点,典型硬件包含工业边缘网关、嵌入式边缘控制器、低功耗边缘计算模组。边缘计算核心特性:低网络时延、本地数据留存、断网可用、带宽节约。

边缘节点算力资源约束:CPU 算力有限,内存容量小,多数不配备独立 GPU。因此,不能直接部署大参数量深度学习模型,必须使用轻量化模型、精简推理引擎,降低单次推理的浮点计算量、内存占用。在 BYX 框架中,边缘节点承担数据采集、清洗、特征提取、模型推理、异常判定、轻量化根因归集、本地事件缓存;云端仅做模型版本下发、全局统计汇总、历史故障知识库更新,实时推理环节不依赖云端算力中心。

2.3 深度学习模型轻量化基础方法

模型轻量化是 BYX 框架的核心技术基础,主要包含四类技术路径。

1. 网络剪枝:识别神经网络中贡献较低的权重、通道,删除冗余参数,在精度损失可控前提下减少参数量和计算量。分为非结构化剪枝与结构化剪枝,结构化剪枝更利于硬件部署。

2. 量化:将模型权重与激活值从 32 位浮点数 FP32,转换为 FP16、INT8 甚至更低精度,降低存储占用,加速推理。工业边缘场景中 INT8 量化适用性最高。

3. 知识蒸馏:利用云端训练好的高精度大模型(教师模型),输出软标签,去训练小参数量边缘小模型(学生模型)。学生模型学习教师模型的决策分布,以小模型体积逼近大模型识别能力,是本研究采用的核心轻量化手段。

4. 轻量化网络结构设计:采用深度可分离卷积、瓶颈模块等轻量化基础单元,直接设计小参数量时序网络,降低基础计算开销。

2.4 工业故障根因分析与运维工单闭环理论

故障根因分析,目标是从单一或者多个传感器异常告警事件,定位背后根本故障原因,区分表象告警和根因故障。传统基于规则的 FTA/FMEA 方法可解释性强,但扩展性差,新增故障类型需要人工编写规则。基于时序特征关联、因果图、事件关联挖掘的自动根因归集,能够从历史故障样本学习异常信号之间的因果关联,输出候选根因集合与置信度。

运维闭环:告警识别→根因判定→自动生成工单→工单派单、现场维修→维修结果回传→故障样本回流模型更新。传统系统中告警到工单需要人工操作,存在延迟,容易遗漏告警。BYX 框架设计标准化事件消息总线,实现告警事件自动触发工单创建,工单状态回传给边缘系统,完成闭环反馈。

3 BYX 边缘端小模型轻量化落地框架总体架构

BYX 工业设备预测性维护框架采用三层架构:感知采集层、边缘计算层、业务应用层。框架设计原则:算力下沉、本地推理、轻量化、模块化、接口标准化、断网可持续基础预警功能。

3.1 感知采集层

感知层由各类工业传感器、现场 PLC、IO 采集模块组成。采集信号包含振动、轴承温度、电机三相电流、电压、压力、流量、转速等多维度时序数据。支持主流工业通信协议:Modbus RTU/TCP、OPC UA、MQTT、Profinet 等。采集模块按照配置的采样频率采集时序数据,数据初步过滤后传输至边缘网关。

感知层设计要点:支持异构设备接入;具备基础信号异常检测,识别传感器断线、漂移、采集噪声;可配置采样频率,非关键设备降低采样率节约算力;采集数据直接送入本地边缘节点,原始时序数据默认保存在边缘本地存储,不强制实时上传云端。

3.2 边缘计算层(BYX 核心层)

边缘计算层部署在工厂现场边缘网关,是 BYX 框架的核心,承担时序数据处理、轻量化模型推理、异常预警、故障根因自动归集、事件消息缓存功能。边缘层内部进一步划分为五个子模块。

1. 时序数据预处理子模块:接收感知层原始时序数据,执行缺失值填充、异常离群点剔除、归一化、时域 / 频域特征提取、工况识别,输出标准化特征序列送入模型推理子模块。

2. 轻量化小模型推理引擎子模块:搭载经过蒸馏、剪枝、量化后的时序异常检测小模型。在边缘本地完成模型推理,输出设备健康得分、异常概率、退化趋势,不依赖云端算力。推理引擎做了适配优化,适配 ARM、X86 低功耗边缘硬件。

3. 异常分级预警子模块:接收模型推理结果,结合预设阈值、工况上下文,将异常划分成三级:预警(早期劣化)、告警(明显异常)、紧急故障。分级之后生成标准化告警事件,附带设备编号、时间戳、传感器原始特征、异常置信度。支持本地声光告警输出。

4. 轻量化故障根因自动归集子模块:接收多条关联告警事件,调用边缘侧轻量化因果关联模型,对异常事件做关联归集,输出候选故障根因、置信度、证据链路。根因结果附加到告警事件包中。

5. 事件消息与本地缓存子模块:将告警事件、根因标签打包为标准化消息。一方面本地持久化存储事件记录,网络断开时缓存事件;另一方面通过标准接口向上层业务系统推送消息。网络恢复后,缓存事件续传。

核心特性说明:所有模型推理、异常判定、根因归集计算均运行在边缘本地。云端仅负责模型版本管理、模型训练更新、全局故障知识库迭代,不参与实时推理。边缘节点断网状态下,仍然可以持续采集数据、运行模型推理、触发本地预警、缓存告警事件,保障现场运维基础能力不中断。

3.3 业务应用层

业务应用层包含运维工单系统、可视化看板、后台管理模块。BYX 框架不强制绑定特定商用工单平台,通过标准化 API 与消息队列对接企业现有运维工单系统(自研工单、ERP 内嵌工单、CMMS 设备管理系统均可接入)。

• 接收边缘推送的告警事件、根因归集结果;

• 自动创建运维工单,填充设备信息、异常描述、候选根因、传感器曲线链接;

• 支持工单分派、维修记录填写、故障闭环;

• 工单完成后,维修结果回传给边缘系统,作为新样本,用于后续模型迭代优化;

• 可视化看板展示设备健康状态、告警列表、故障统计、工单完成率。

3.4 BYX 框架数据流总览

传感器时序原始数据 → 边缘网关本地预处理 → 提取时序特征 → 轻量化小模型边缘推理 → 健康评估与异常判定 → 异常事件触发根因自动归集 → 生成带根因标签的告警事件 → 事件推送至工单系统,自动新建工单 → 现场运维处置,工单状态更新回传 → 故障样本回流,用于模型迭代。

4 边缘侧传感器时序数据处理机制

工业传感器时序数据质量直接决定异常检测模型效果,而边缘硬件存储与算力有限,因此预处理算法必须轻量化,避免高复杂度运算占用边缘资源。本章节阐述 BYX 框架边缘端时序数据完整处理流程。

4.1 时序数据特征类型

输入数据分为原始时序采样值与人工提取特征。
时域特征:均值、方差、均方根、峰值、峭度、偏度、波形因子、脉冲因子,常用于振动信号劣化识别。
频域特征:FFT 频谱、谐波幅值,识别轴承、齿轮旋转设备的特征频率。
时序趋势特征:滑动窗口内的变化斜率,表征性能缓慢退化。

BYX 在边缘端做轻量化特征提取,不做全量高分辨率频谱持续计算;仅当模型识别到健康指标下降时,才触发精细化频域分析,节省算力开销。

4.2 数据清洗与缺失处理

工业现场常见问题:传感器临时断线、电磁干扰产生离群跳变值、数据包丢失。边缘预处理模块内置轻量化处理策略。

1. 离群点剔除:采用滑动窗口 3σ 准则,快速识别跳变异常值,区分是传感器故障还是设备真实故障;

2. 缺失值:短时间缺失采用线性插值填充;长时间连续丢包标记数据失效,模型不使用该段数据,同时生成传感器通信告警;

3. 工况识别:区分设备启停、空载、满载不同工况,模型在对应工况基准下评估健康状态,避免工况切换带来的误报警。

4.3 时序滑动窗口采样策略

时序模型需要固定长度的时间窗口序列作为输入。BYX 采用动态滑动窗口机制,平衡算力消耗与检测灵敏度。设备稳定正常运行阶段,使用较大步长,减少推理次数;当健康得分下降,进入预警区间后,自动缩小滑动步长,提升采样与推理频率,密切监测设备劣化趋势。动态窗口策略可以显著降低边缘节点平均算力负载。

4.4 数据本地存储策略

原始高频时序数据存储在边缘网关本地时序数据库。边缘存储按策略设置生命周期,超过保留周期自动滚动清理原始采样数据;告警事件、根因标签、工单关联记录等结构化元数据做长期保存。仅在用户授权前提下,将告警摘要、故障样本上传云端用于模型迭代;原始传感器时序数据默认不出工厂本地,满足数据安全与隐私管控需求。

5 时序小模型轻量化改造与边缘本地推理

5.1 模型训练 - 部署分离范式

BYX 采用 “云端大模型离线训练,轻量化小模型下发边缘本地推理” 的分离范式。

1. 云端利用历史故障数据集,训练高精度教师时序模型(TCN/LSTM 混合时序模型),学习设备正常模式、各类故障时序特征;

2. 使用知识蒸馏,以教师模型输出软标签训练小参数量学生模型;

3. 对学生模型进行结构化剪枝、INT8 量化,压缩模型体积;

4. 完成模型精度验证,保证轻量化后异常检出率、误报率满足工业要求;

5. 将轻量化后的模型文件,通过安全通道下发到边缘网关;

6. 边缘网关加载模型,本地持续执行推理,不再依赖云端算力。

训练阶段需要算力中心,但是设备上线运行、日常预测预警阶段,不需要持续占用云端算力,这是 BYX 降低中小企业运营成本的关键。

5.2 轻量化时序模型结构设计

学生小模型采用轻量化时序卷积 TCN 作为主干网络,搭配轻量门控单元。相比原始 LSTM、大 TCN 模型,减少网络层数、通道数量,使用深度可分离卷积降低计算量。
模型输入:滑动窗口内标准化多传感器时序特征;
模型输出:设备健康度 0~1,异常发生概率,短期退化预测值。

在知识蒸馏过程中,损失函数同时包含真实标签损失和教师模型软标签损失,使小模型学习大模型对于模糊样本、早期微弱故障的判别能力,弥补小模型表达能力不足的短板。剪枝操作移除贡献极小卷积通道,量化将浮点权重转为 INT8,进一步降低内存占用和推理耗时。

5.3 边缘推理引擎适配与资源调度

边缘推理引擎针对工业边缘硬件做适配,支持 ARM 架构边缘网关。推理模块采用事件触发调度,不是无限制持续循环推理。

• 设备稳态:低频率推理,降低 CPU 占用;

• 出现初步异常信号:提升推理频次;

• 非工作时段设备停机:暂停推理,释放算力。

推理时延指标:单窗口推理耗时控制在百毫秒至数十毫秒级别,满足工业实时预警需求。边缘系统内置资源监控,当 CPU、内存占用超过阈值,自动降级处理,优先保障基础异常检测功能,关闭非必要附加分析,保障系统稳定性。

5.4 异常分级预警机制

模型输出健康得分后,结合业务规则完成告警分级。
一级预警(提示):健康指标轻微偏离基准,属于早期缓慢劣化,不紧急,推送运维看板,纳入定期点检计划;
二级告警(一般):异常置信度达到设定阈值,设备存在潜在故障风险,生成工单,安排计划内维修;
三级紧急告警:高置信严重异常,有停机、安全风险,触发本地声光告警,生成紧急工单,优先派单。

分级机制减少无效告警,解决工业场景普遍存在的告警泛滥、运维人员麻木问题。同时告警附带置信度、关联传感器数据、工况信息,方便运维人员判断告警可信度。

6 边缘端故障根因自动归集方法

故障根因自动归集是 BYX 框架区别于普通异常告警系统的核心能力之一。传统方案只输出 “设备异常”,而 BYX 在边缘端归集异常事件,定位最可能的故障根源,直接给运维人员提供故障方向。

6.1 轻量化根因归集设计约束

根因推理部署在边缘端,算力资源有限,不能运行复杂大规模因果推断模型。因此采用 \\“轻量化因果图 + 事件关联规则 + 小模型因果打分”\\ 的混合方案。

1. 预先在边缘加载简化设备因果图,描述设备组件、传感器、故障模式之间的关联关系;

2. 当多条告警事件同时触发,根因归集模块分析告警之间时序先后、信号关联;

3. 轻量化打分模型,计算各个候选根因置信度,剔除不可能的故障假设;

4. 输出排序后的候选根因清单、支撑证据、置信分数。

因果图体量精简,存储开销小,适合边缘本地加载。因果图可以随模型版本一起从云端更新下发,设备结构变更时,更新对应因果图即可,不需要重新开发整套程序。

6.2 故障事件归集逻辑

单一传感器告警只能代表观测现象,不是故障根因。例如电机振动告警,可能来自轴承磨损、转子不平衡、基座松动、联轴器偏移等不同根因。根因归集模块会综合温度、电流、振动多传感器时序异常事件,结合故障因果知识库,排除冲突假设,给出优先级排序。

归集输出内容:候选根因名称、置信度、证据列表(哪几个传感器异常、异常发生时间顺序)、推荐初步检修方向。该信息会一并打包进入告警消息,随事件推送至工单系统,运维人员打开工单即可看到故障推断结论,缩短现场排查时间。

6.3 根因知识库迭代闭环

维修人员在工单系统填写实际故障结论,维修结果回传边缘系统。真实故障案例保存,定期上传云端,用于更新因果图权重、优化根因打分模型,持续提升后续根因归集准确率。实现现场运维经验自动回流到模型体系,持续迭代优化。

7 告警事件与运维工单系统联动设计

BYX 框架目标是打通从异常识别到维修工单的自动化链路,消除人工转录告警、手动建单环节,缩短故障处置时间。本章节介绍事件消息规范、接口架构、工单联动逻辑。

7.1 标准化告警事件消息结构

所有边缘产生告警事件采用统一 JSON 结构化消息,包含字段:事件唯一 ID、设备资产编号、设备类型、时间戳、告警等级、健康得分、异常置信度、关联传感器列表、时序特征摘要、候选根因列表、证据描述、边缘节点编号。标准化消息保证不同类型设备、不同边缘网关输出消息格式统一,便于工单系统解析。

7.2 消息传输与断网缓存机制

消息采用 MQTT/HTTP 两种可选传输协议。边缘内置消息本地队列,网络中断时,告警事件持久化保存在边缘本地,不会丢失;网络恢复后自动续传消息至业务平台。避免工厂网络波动造成告警丢失。消息传输只传输结构化告警事件、根因标签,不传输原始高频时序数据,极大降低网络流量消耗。

7.3 工单系统联动流程

1. 边缘异常预警模块判定产生告警事件,根因归集模块完成根因分析,组装事件消息;

2. 消息推送至业务层 CMMS / 工单系统;

3. 工单系统收到消息,自动新建运维工单,自动填充设备信息、告警等级、候选根因、异常证据;

4. 工单系统按预设规则自动分派给对应运维人员,短信 / APP 推送通知;

5. 运维人员现场检修,在工单内记录故障实际根因、备件消耗、维修结果,标记工单闭环;

6. 工单闭环结果回传 BYX 系统,真实故障样本回流模型迭代链路。

BYX 不绑定特定工单软件,接口标准化。中小企业可以直接对接其现有的简易工单系统、ERP 内置设备管理模块,不需要整体替换原有运维软件,显著降低集成成本与改造风险。

7.4 联动策略可配置化

支持在边缘侧配置工单触发策略:例如仅二级、三级告警自动生成工单;一级预警只做看板展示,不自动建单;可以设置黑白名单,部分设备告警不自动生成工单,满足工厂差异化运维管理要求。

8 原型系统实验验证与结果分析

8.1 实验环境

原型验证采用国内中小型离散制造工厂电机、风机、泵类设备传感器时序数据集。硬件选用普通工业边缘网关(ARM 四核,2GB 内存,无独立 GPU),符合中小企业常规低成本硬件选型。
数据集:包含轴承磨损、转子不平衡、基座松动、线圈老化等多类故障时序样本,同时包含大量正常工况、工况切换样本。
对照组方案:传统云端 PdM 方案,原始时序数据全部上传云端,云端大模型推理。

8.2 评价指标

评价指标分为模型性能指标、边缘资源指标、业务效率指标。
模型指标:异常检出率(Recall)、误报率(False Alarm Rate);
边缘资源指标:单样本推理时延、CPU 平均占用率、模型文件大小、内存占用;
业务指标:告警到工单创建耗时、故障定位平均耗时。

8.3 实验结果

1. 模型轻量化效果:原始教师 TCN 模型约 128MB,经过蒸馏、剪枝、INT8 量化后的边缘小模型体积压缩至 7MB 级别,内存占用显著下降,可在 2GB 内存边缘网关稳定加载运行。轻量化后异常检出率维持在 92.7%,误报率 4.1%,相比云端教师模型仅有小幅精度损失,满足工业预警需求。

2. 推理性能:单滑动窗口时序推理平均时延 62ms,实现边缘本地毫秒级实时预警。断网场景下,边缘系统可持续采集数据、执行推理、本地告警、缓存事件,功能不中断。

3. 网络流量对比:传统云端方案持续上传高频传感器原始时序,流量消耗巨大;BYX 框架仅上传告警结构化事件,数据传输量降低 95% 以上,大幅节省通信带宽成本。

4. 工单联动效率:告警产生到工单自动创建耗时小于 1 秒,无需人工录入;附带根因归集结果,运维人员故障排查平均耗时下降约 38%。

8.4 实验结论

原型验证证明 BYX 边缘端小模型框架具备工程可行性。在无独立 GPU 的普通工业边缘网关上,可以稳定完成时序数据本地推理、异常预警、根因归集,具备断网预警能力;和云端集中式方案对比,带宽消耗大幅降低,告警工单自动化闭环缩短运维处置时间,精度损失在工业可接受范围。

9 中小制造企业实施成本分析

中小制造企业预测性维护落地成本包含硬件成本、软件授权、实施部署、运维成本。本章节对比 BYX 边缘轻量化方案与传统云端 PdM 方案的总体拥有成本 TCO。

9.1 传统云端预测性维护方案成本构成

硬件:传感器、采集模块、边缘网关;通信:工业专线、流量费用;算力:云服务器、GPU 算力租赁;实施:数据对接、模型训练、系统集成定制开发;运维:专职算法人员、云资源持续年费。传统方案项目投入高,持续云算力年费是长期负担,中小企业难以承受。

9.2 BYX 方案成本构成

硬件:传感器、普通低成本边缘网关,无需高性能边缘 GPU;通信:仅少量告警事件上送,无需高带宽专线;算力:日常运行阶段不持续消耗云端推理算力,云端算力仅用于阶段性模型训练迭代;实施:模块化标准化组件,降低定制开发工作量;运维:不需要专职算法人员,模型版本远程更新。

BYX 框架将算力开销从 “常年云端在线推理” 转变为 “离线周期性模型训练”,大幅削减年度 recurring 算力费用。同时标准化工单接口,减少定制集成工作量,缩短项目实施周期,降低实施人工成本。

9.3 成本收益定性分析

投入收益:提前识别设备早期故障,减少非计划停机损失,降低备件盲目更换的库存成本;减少定期过度检修带来人工工时浪费;故障根因自动归集缩短排查时间,提升运维人员工作效率;数据保存在工厂本地,规避原始生产数据外传带来的数据安全风险。

BYX 方案适合设备数量几十台以内的中小工厂,实现低成本分批部署,企业可以分设备逐步试点,不用一次性大规模投入,降低项目试错风险。

10 系统局限与未来研究方向

10.1 当前框架局限性

1. 小模型泛化边界:轻量化模型容量有限,对于从未见过的全新故障类型识别能力弱于云端大模型,对新故障需要补充样本迭代模型;

2. 根因归集能力:当前边缘根因方案是轻量化因果图 + 打分模型,复杂多故障耦合场景下根因区分难度提升,置信度会下降;

3. 强耦合复杂工艺设备:流程工业高度耦合连续产线,设备之间强相互影响,当前 BYX 版本优先针对风机、泵、电机等独立旋转设备,复杂耦合产线场景仍需要进一步优化;

4. 数据标注成本:模型训练依然需要一定数量带标注故障样本,完全零样本场景效果受限。

10.2 后续研究方向

1. 小模型持续在线自适应学习,在边缘端实现轻量增量学习,利用运维闭环新样本,局部微调模型,减少频繁回传数据到云端训练;

2. 多设备联邦学习,多家工厂在不上传原始数据前提下协同训练模型,降低单厂标注样本压力;

3. 根因推理模型进一步轻量化,引入轻量化图神经网络,提升多故障耦合场景下根因归集精度;

4. 扩展更多设备类型,覆盖减速机、空压机、注塑机等更多中小制造企业常用工业装备;

5. 边缘端多模型调度优化,在有限硬件资源下动态调度异常检测、根因分析、RUL 预测模型,进一步优化算力分配。

11 结论

本研究构建 BYX 工业设备预测性维护体系以及边缘端小模型轻量化落地框架,面向中小制造企业预测性维护落地痛点,将传感器时序数据模型推理下沉至工业边缘网关本地,摆脱对持续高算力云中心的依赖;构建边缘端故障根因自动归集链路,设计标准化接口实现告警事件与运维工单系统自动化联动,形成完整运维闭环。

框架以知识蒸馏、剪枝、量化完成时序模型轻量化改造,在普通低算力边缘硬件上实现毫秒级本地时序推理与异常预警,断网环境下基础预警能力保持可用;原始时序数据保留在工厂本地,仅少量告警结构化信息按需上传,节约网络带宽,保障生产数据安全。原型系统验证表明,轻量化后模型保持较高异常检出率,误报率控制在工业可接受区间;自动工单联动消除人工转录告警环节,根因归集信息辅助运维人员快速定位故障,缩短设备检修时间。

BYX 框架显著降低预测性维护项目硬件、通信、算力、定制集成的总体拥有成本,支持中小企业分批试点部署,为国内中小离散制造、通用动力设备场景提供低成本、可工程化落地的预测性维护方案。该框架仍存在泛化能力、复杂耦合场景根因识别等局限,后续将围绕边缘增量学习、联邦学习、轻量化因果推理方向持续迭代,进一步拓展适用场景,提升模型性能。

数据来源与免责声明

数据来源

1. 原型验证数据集来源于泷码软件研究院在中小制造企业现场采集的电机、风机、泵类设备传感器时序运行数据;

2. 工业时序模型性能测试数据由泷码软件研究院 BYX 项目原型系统实测获得;

3. 成本测算基于国内工业边缘网关、传感器、云算力市场公开报价与泷码软件过往制造数字化项目工程经验估算;

4. 行业现状文献来源于国内外预测性维护、边缘计算相关期刊论文、行业白皮书、制造业数字化调研报告。

免责声明

本研究报告仅为学术研究与技术框架探讨,不构成任何商业承诺、产品性能担保或项目实施保证。报告中模型准确率、推理时延、成本节约等指标基于特定原型环境与测试数据集得到,实际落地效果受现场传感器质量、设备工况、工厂环境、数据质量、硬件选型等多重因素影响,不同项目结果存在差异。本框架相关技术方案的实施需要结合现场工况开展适配调试。泷码软件(上海)有限公司、泷码软件研究院不对任何基于本报告直接开展商业项目实施所产生的停产损失、设备故障、经济损失承担相关责任。报告内容属于研究成果,未经作者单位书面许可,不得全文复制、商用转载。

 

联系邮箱

contact@lcsso.cn

微信二维码

扫一扫,微信咨询