资讯动态

轴承故障诊断全解析:从振动机理到深度学习与工程实践

发布时间:2026/9/15 17:02:45 来源:尧图企业网站定制
1. 为什么“轴承故障诊断”值得单独写一篇综述我最早接触轴承故障诊断是在一次产线设备连续宕机的抢修现场。当时电机还在转但异响已经很明显拆开轴承座一看内圈滚道已经剥落了一大块。后来复盘时老师傅说了一句话这声音其实提前一两个月就能听出来只是没人当回事。这句话对我触动很大也是从那会儿开始我才真正理解轴承故障诊断的价值——它不是“坏了以后查原因”的被动工作而是“在还没坏之前发现苗头”的主动预防手段。轴承是旋转机械里最通用的零部件从几万转的电主轴到几十转的重载滚筒从几百克的家电电机到上百吨的发电机组几乎所有旋转设备里都有它的身影。统计上来讲旋转机械的故障里有30%到40%都和轴承相关某些场景下这个比例会更高。也正因为如此轴承故障诊断一直是设备状态监测、预测性维护、工业智能运维这些方向的研究热点——技术上足够典型工程上足够普遍理论上足够成熟还有大量开源数据和现成案例可以验证算法是入门故障诊断最合适的切入点。这篇综述准备从物理机理讲到信号处理从传统特征讲到深度学习再落回到工程实践里那些坑。适合刚接触设备诊断的工程师也适合想系统梳理方法体系的算法研究者。2. 轴承故障的物理基础故障从哪来、怎么坏2.1 轴承的典型失效模式想诊断故障首先得知道故障长什么样。轴承的失效模式大体可以分成这么几类疲劳剥落、磨损、胶合、腐蚀、断裂、保持架损坏其中最常见、也最容易被振动信号捕捉到的是疲劳剥落。疲劳剥落的过程是这样的滚动体反复滚过滚道表面接触区内部会产生循环交变应力。当应力循环次数达到材料的疲劳极限后会在表层下方产生裂纹裂纹逐步扩展最终导致表面材料成片脱落形成剥落坑。剥落坑一旦出现滚动体每次滚过坑位时都会产生一个冲击脉冲这个冲击会激励轴承座和结构件的高频固有振动。我们做振动诊断的核心目标之一就是捕捉这种周期性冲击。磨损则是另一类典型故障。微小颗粒进入轴承内部或者润滑膜破裂导致金属直接接触都会加速表面材料的缓慢损耗。磨损早期没有明显的冲击特征振动能量整体抬升频率成分比较杂乱。腐蚀和胶合在特定工况下比较突出比如潮湿环境中的微动腐蚀、润滑不良引起的滚道胶合它们对振动信号的影响类似磨损但现场往往还会伴随温度升高、油液金属颗粒增多等旁证。不同失效模式在振动信号上的表现差异很大这也是为什么诊断方法要分层设计有的故障适合看时域冲击有的适合看频域能量分布有的甚至需要借助温度、油液、声发射等多源信号才能判断。指望一种方法通吃所有故障在工程上是不现实的。2.2 故障特征频率诊断的核心计算逻辑轴承振动诊断里有一个绕不开的基础概念故障特征频率。它是根据轴承的几何参数和转速推算出来的周期性冲击频率公式并不复杂但理解它的推导过程对后续做包络谱分析特别重要。以滚动轴承中最常见的深沟球轴承为例设滚动体个数为 n、滚动体直径为 d、节圆直径为 D、接触角为 α、轴的转频为 f_r那么各类故障的特征频率可以按下表计算故障位置特征频率公式物理含义外圈故障(f_{BPFO} \dfrac{n \cdot f_r}{2}\left(1 - \dfrac{d}{D}\cos\alpha\right))滚动体通过外圈剥落坑的频率内圈故障(f_{BPFI} \dfrac{n \cdot f_r}{2}\left(1 \dfrac{d}{D}\cos\alpha\right))滚动体通过内圈剥落坑的频率滚动体故障(f_{BSF} \dfrac{D \cdot f_r}{d}\left(1 - \left(\dfrac{d}{D}\cos\alpha\right)^2\right))滚动体自转一圈撞击故障点的频率保持架故障(f_{FTF} \dfrac{f_r}{2}\left(1 - \dfrac{d}{D}\cos\alpha\right))保持架转频也是外圈通过频率的一半可能有人会疑惑为什么故障频率都小于转频的整数倍还有些带小数原因是滚动体在内外圈之间既滚动又公转内圈在转、外圈固定时滚动体相对外圈的通过频率取决于滚动体的公转速度而这个速度并不等于轴的转速需要按运动学关系折算。我拿最经典的6205-2RS深沟球轴承举例它的相关参数参数数值滚动体个数 n9滚动体直径 d7.94 mm节圆直径 D39.04 mm接触角 α0°假设转频 f_r 29.2 Hz也就是约1750 rpm。代入公式后外圈故障频率 f_BPFO ≈ 3.05 × f_r ≈ 89.1 Hz内圈故障频率 f_BPFI ≈ 4.95 × f_r ≈ 144.5 Hz滚动体故障频率 f_BSF ≈ 1.99 × f_r ≈ 58.1 Hz保持架故障频率 f_FTF ≈ 0.40 × f_r ≈ 11.7 Hz这里有个工程上很实用的判断技巧外圈故障频率大约是转频的3.05倍内圈故障频率约是转频的4.95倍前者接近3倍后者接近5倍所以看到奇数倍频和偶数倍频的差别可以通过频谱特征大致判断故障在外圈还是内圈。内圈故障的信号还有一个特殊性内圈随轴一起旋转剥落坑的位置相对载荷区周期性变化。当剥落坑转到承载区时冲击幅值大转到非承载区时冲击幅值小。因此在包络谱上内圈故障不仅会出现 BPFI 成分还会出现以转频为间隔的边频带这是区分内外圈故障的重要依据。2.3 为什么故障特征会“藏”在振动信号里很多初学者拿到振动波形第一反应是这不就是一堆随机噪声吗哪看得出来故障这是正常的。正常轴承的振动信号以随机噪声和低幅值周期成分为主一旦出现剥落故障每个冲击都会激起结构的高频共振但在原始波形里这些冲击往往被背景噪声掩盖直接看时域波形很难分辨。所以诊断流程会走“两步走”先把原始信号经过带通滤波或包络解调把高频冲击分量提取出来再对提取后的信号做频谱分析观察特征频率处有没有明显峰值。这个流程的本质是把微弱但有规律的冲击信号从强噪声和非平稳干扰中剥离出来是轴承诊断最核心的思路。3. 诊断方法体系从时域、频域到智能诊断3.1 时域分析最直接但也最容易误判时域分析是最早被使用的诊断手段核心思路是提取振动信号的统计指标通过这些指标的数值变化判断轴承状态。常用的时域指标有峰值反映最大振动幅度对冲击敏感均方根值RMS反映整体能量水平最常用的状态指征峰值因子Crest Factor峰值与RMS的比值早期故障时冲击明显增大但RMS变化不大峰值因子会升高峭度Kurtosis四阶矩归一化指标正常信号接近3早期冲击会使峭度明显增大波形因子、脉冲因子、裕度因子各有侧重但原理类似时域分析最大的优点是计算简单、实时性好很多在线监测系统的报警阈值就是基于RMS和峭度设定的。但它的缺点也很明显对故障类型不敏感很难区分外圈故障和内圈故障也很难定位故障部件。而且在新轴承跑合阶段RMS和峭度正常不代表没有早期微缺陷反过来转速波动、负荷变化、来自其他设备的冲击干扰都会让时域指标大幅波动导致误报率偏高。所以我的建议是时域指标适合做第一道粗筛判断“这个轴承有没有异常”但不适合直接做故障定位。一旦时域指标超阈值就需要转入频域分析进一步确认。3.2 频域分析频谱、包络谱和边频带的解读频域分析是轴承故障诊断的基石。常规做法是对振动信号做FFT得到频谱然后观察频谱中是否出现故障特征频率及其谐波。但在实际工程中原始信号里的故障特征频率往往被设备的工频、齿轮啮合频率和其他振动源淹没直接看频谱很难发现异常。这时就需要用到包络谱分析也叫高频解调分析。它的思路是对原始信号做带通滤波把轴承故障冲击激励起的高频共振成分选出来对滤波后的信号做Hilbert变换求出信号的瞬时幅值包络对包络信号做FFT得到包络谱在包络谱中寻找特征频率及其谐波、边频带包络谱的精髓在于它把“高频共振被低频冲击调制”的过程解调出来相当于把“藏在载波里的规律”提取成了低频的冲击序列。用生活化的类比来说原始信号就像一段被噪音干扰的语音包络解调就是先滤掉噪音、再把语音的节奏抽出来听。我在实际项目中做包络谱分析时有几点教训带通滤波的中心频率应该选在结构共振频率附近而不是随便选。没有谱分析基础时可以先看原始信号的功率谱密度找能量较高的频带作为带通范围包络谱的横轴不是转频的整数倍直接标记而是需要按轴承参数计算出的特征频率去比对。这个过程中转速的准确获取非常重要转速不准算出来的特征频率就不准峰值可能对不上看包络谱不能只看特征频率处的单一峰值要同时观察1X、2X、3X谐波和边频带。有谐波说明冲击是周期性的、规律明显的有边频说明故障部位在旋转比如内圈故障会伴随转频边带3.3 时频域分析非平稳工况下怎么办现场设备并不总是恒定转速、恒定负载运行的——风机变风量、轧机变负荷、机床变速加工都是常态。在转速变化的情况下传统频谱的“频率轴”是相对假定的常速条件得到的特征频率不固定频率峰会被拉宽甚至模糊到看不出来。时频分析是应对这类工况的主要手段。短时傅里叶变换STFT是最常见的方法它把信号切分成时间窗对每个窗做FFT得到一个频率随时间变化的谱图。这在转速缓慢变化的时候效果还行但时间分辨率和频率分辨率不可兼得窗太短频率看不清窗太长又会丢失突变细节。小波变换是另一个常用工具。它通过可变尺度的基函数分析信号在低频段有较高的频率分辨率在高频段有较高的时间分辨率比较适合捕捉转速变化条件下轴承故障产生的瞬态冲击。但小波基函数的选择具有一定主观性选得不合适效果会打折扣。对于转速剧烈变化的场景更推荐的是计算阶比跟踪。它的核心思路是以转速信号为参考把振动信号重采样到等角度间隔相当于把“时域信号”变成“角度域信号”这样即使转速在变化每个周期对应的角度是固定的故障冲击在角度域上依然等间隔出现特征频率也就变成了稳定的阶比成分。做阶比跟踪需要同步采集振动信号和转速信号。转速信号可以用光电传感器测键相脉冲也可以用编码器。部分商业采集系统支持硬件阶比跟踪如果手里只有普通采集卡也可以用计算阶比跟踪算法离线处理。实测下来在转速波动超过20%的工况下阶比跟踪比单纯用包络谱的效果要好很多。4. 智能诊断数据驱动方法的核心逻辑传统的特征频率分析方法依赖专家的领域知识和手工参数调整在单一恒定工况下非常可靠一旦工况复杂、噪声大、故障类型多人工识别特征频率的效率和准确率就明显不够用了。最近十年数据驱动的智能诊断方法发展得很快它的核心是把“人工找特征、人工做判断”变成“机器从数据中自动学习特征、自动做分类”。4.1 特征工程传统机器学习路线严格来说传统机器学习的路线也不是完全“智能”——它还是需要人先手工提取大量特征再用分类器做故障类型识别。只是把最后“判断”这个环节交给了模型。这条路线的一般流程是对每个样本提取时域特征均值、RMS、峭度、峰值因子等提取频域特征重心频率、频谱能量分布、特定频带能量占比提取时频特征小波包能量谱、EMD分解后各分量的能量占比用特征选择方法如主成分分析PCA、线性判别分析LDA降维送入分类器如支持向量机SVM、随机森林、K近邻、BP神经网络这套方法在公开数据集上能取得不错的准确率。但问题在于手工设计特征的质量决定了模型的上限。不同场景、不同设备、不同传感器安装位置最优的特征组合可能都不一样。调参工程师往往要反复试验特征组合才能得到理想效果迁移到新设备上又得重新来一遍——成本很高泛化能力也有限。4.2 深度学习路线从CNN到Transformer深度学习方法的思路完全不同。它不再依赖人工设计特征而是让模型直接从原始振动信号中端到端地学习特征表示。一维卷积神经网络1D-CNN是最常见的结构它通过多层卷积核自动提取波形中的局部模式再通过池化、全连接层输出故障类别。CNN比较擅长捕捉局部冲击特征对周期性故障信号特别有效。在CNN之外还有几类常用结构循环神经网络RNN和长短时记忆网络LSTM擅长建模时序依赖但要处理长序列时容易出现信息遗忘计算效率也不高注意力机制和Transformer可以同时建模全局和局部特征在变工况、强噪声场景下表现更稳定的趋势但对训练数据量要求更高自编码器AE和变分自编码器VAE主要用于异常检测可以只在正常数据上训练然后通过重构误差判断新样本是否异常适合故障样本极少的场景这里要强调一点深度学习不是万能的。它的性能很大程度依赖数据的数量、质量和工况覆盖度。CWRU数据上学到的模型直接拿到现场设备上往往效果明显下降这是因为训练域和测试域之间存在分布差异——传感器位置不同、设备型号不同、转速负载不同都会导致数据分布偏移。4.3 故障样本不足与数据不平衡的应对工业现场和实验室最大的区别就在数据集上。实验室里可以人为制造各种故障样本充足、标签完整但现场设备“正常时你根本不知道它什么时候会坏坏了又往往来不及采集完整的数据”再加上故障类型分布极不均匀正常样本占了绝大多数故障样本少得可怜。数据不平衡是智能诊断落地的主要障碍。解决这个问题有几条实际可行的路线数据增强对原始振动信号做平移、加噪、时间掩膜、频率扰动等操作扩充故障样本数量。注意增强方式要符合物理规律不能把信号改得面目全非重采样策略对少数类样本过采样如SMOTE对多数类样本欠采样或使用加权损失函数让模型更关注少数类迁移学习在大量公开数据或仿真数据上预训练模型再用少量现场数据微调缓解数据不足问题生成式方法用生成对抗网络GAN或扩散模型合成故障样本但合成样本的真实性需要仔细验证无监督/半监督异常检测只利用正常样本训练模型在推理阶段判断输入样本偏离正常模式的程度这是工程落地时最容易被低估的思路我在实际项目中体验最深的是与其花大力气收集所有故障类型的完美标注数据不如把更重要的精力放在“正常基线”和“异常检测”上。因为工业现场真正最迫切的需求往往不是“这是外圈故障还是内圈故障”而是“这台设备是不是在走向故障”。前者更像是研究问题后者才是生产问题。5. 实际工程应用中的挑战与排查经验5.1 现场噪声与传感器布置数据质量决定一切理论方法和现场效果之间隔着一条巨大的鸿沟——现场数据质量。算法再好数据一团糟也没用。现场振动信号里不仅有轴承本身的振动还有齿轮啮合、叶片通过频率、基础松动、皮带打滑、电磁干扰、周围设备传递过来的振动源和路径都非常复杂。传感器布置是最关键的一环。轴承振动信号在传播路径上会衰减传感器尽量安装在靠近轴承座的位置最好直接安装在轴承座刚性表面上避免隔着薄板或塑料件。磁座安装和螺纹安装的频响特性差异很大高频信号往往在磁座安装时会损失很多所以对于高频解调分析更推荐用螺纹安装或者用胶粘的加速度计。采样率也不能拍脑袋定。做包络谱分析时采样率至少要覆盖到轴承结构共振频带的2倍以上否则高频冲击可能被混叠丢失。低速重载设备和高转速设备对采样时长的需求差异也很大低速设备需要用更长的采样时间才能覆盖足够多的冲击次数。5.2 变转速与大噪声工况下的诊断对策前面提到阶比跟踪是应对变转速的重要手段但实际做的时候还有几个隐性坑转速信号和振动信号必须同步采集。如果异步采集转速和相位对不上重采样后角度域的冲击间隔就不稳定阶比成分会被打散转速波动剧烈时需要先对转速做平滑和去野值处理否则转速突变会导致重采样后的信号出现伪冲击变转速下不同故障类型的边频带结构变化很复杂。比如内圈故障的边频带间隔是转频转速变了边频间隔也跟着变直接拿固定频率去比对必然失败大噪声工况下除了包络谱还可以考虑盲源分离的思路。比如用独立成分分析ICA把轴承信号从混合信号中分离出来但ICA对源信号独立性的假设在机械系统中未必成立用之前最好先做去均值和白化处理。另一种思路是用谱峭度寻找共振频带。谱峭度是一个频率-频带二维函数它能自动找到“冲击成分最突出”的频带配合带通滤波和包络分析比人工选频带效果好很多。5.3 从“知道坏了”到“知道该怎么修”的闭环诊断分析的最终目的是服务维修决策但很多自动化诊断系统只停留在“报警”环节至于报警之后怎么办、修哪里、什么时候修还是靠人的经验判断。这就导致诊断结果的价值没有被充分利用。我总结了一套相对实用的闭环逻辑在线监测实时采集振动温度数据做粗筛任何时域指标超阈值都会触发告警告警后调取近期历史数据做趋势分析判断振动水平是持续上升、间歇性波动还是偶发冲击用包络谱、阶比分析和谱峭度确认故障特征频率判断故障部件外圈、内圈、滚动体还是保持架结合设备运行工况、润滑情况、历史维修记录综合判断故障严重程度根据严重程度决定维修策略轻度故障可以继续监测择机维修中度故障列入检修计划准备备件重度故障立即停机更换防止连带损坏第4步“结合运行工况和维修记录”常常被技术方案忽略但它恰恰是提高诊断准确率的重要一环。同样的频谱特征在新轴承和已运行八年的轴承上意义完全不同。数据画像越完整诊断结论越可靠。6. 常用公开数据集与工具链6.1 公开数据集绕不开的基准测试平台轴承故障诊断领域有几组开源数据集做算法验证时绕不开数据集机构特点CWRU美国凯斯西储大学最经典、使用最广泛包含正常、外圈、内圈、滚动体故障多种负载工况IMS美国辛辛那提大学全寿命周期数据适合做剩余寿命预测和退化趋势分析XJTU-SY西安交通大学加速寿命试验数据覆盖多种工况和故障类型非平稳特征更明显Ottawa渥太华大学振动与声发射同步采集适合多源信号融合研究Paderborn帕德博恩大学包含人工故障和真实磨损故障还有电流信号支持多模态诊断以CWRU数据集为例采样频率常见有12kHz和48kHz两档数据量适中格式规范很适合作为算法验证的起点。但要注意CWRU数据采集时的传感器位置、加载方式和工业现场差异较大在CWRU上跑出高精度并不等于现场就能直接用建议把它当“模型可行性验证工具”而非“工程效果保证”。XJTU-SY数据集的优势在于数据来自真实的加速寿命试验振动信号包含完整的退化过程不仅适合做故障分类也适合做剩余寿命预测。如果对健康指标构建和趋势预测感兴趣这个数据集很有参考价值。6.2 信号处理与建模工具选择我日常做轴承诊断分析的工具链相对固定信号处理和分析MATLAB的信号处理工具箱做FFT、包络谱、阶比跟踪很方便但商业授权不便宜开源环境里Python的SciPy和PyWT库完全可以覆盖信号处理需求时频分析小波变换可以用PyWaveletsVMD和EMD有对应的Python实现库特征工程和机器学习scikit-learn足够支撑常见分类器训练特征选择、交叉验证等流程也很成熟深度学习PyTorch最推荐动态图和调试体验比TensorFlow顺手得多社区资料也丰富谱峭度虽然部分学术代码不完整但自己实现也不难先对信号做多组带通滤波计算每个滤波结果的峭度再画成二维谱峭度图找最大峭度对应的频带轻量级的在线监测系统里我会把时域指标和基础频谱实时计算放到边缘端跑比如用Python配合NumPy写一个轻量计算服务或者更底层的用C/RTOS实现这样可以保证告警响应的实时性而包络谱、阶比跟踪、深度学习这些计算量较大的分析放到服务器端批量处理就好。这种前后端结合的部署方式是工业现场比较实用、也比较容易伸缩的方案。7. 诊断流程的完整套路总结把我过往做项目的经验浓缩一下跑一个轴承故障诊断项目的基本套路大致分为以下几步明确工况搞清楚转速范围、负载类型、传动路径确定传感器安装位置和采样率采集正常状态基线数据最好覆盖一个月以上不同工况的运行数据。没有基线后面所有阈值设置都是空中楼阁对历史数据做清洗剔除停机段、冲击性干扰段建立不同工况下的基线特征数据库设计实时监测逻辑粗筛用RMS加峭度细查用包络谱和谱峭度建立故障告警阈值阈值要根据历史数据的分布用统计方法确定比如正常均值加减三倍标准差而不是拍脑袋给一个固定值故障确认后输出诊断报告包含特征频率峰值表、频谱图、趋势图、严重程度评估、维修建议第5步的阈值设置是现场最容易踩坑的环节。固定阈值看着省事但在不同转速、不同负载下振动能量本身就会变化。比如同一台风机满负荷和半负荷状态下RMS可能差出三倍用一个固定阈值要么频繁误报要么漏报。更合理的做法是在不同工况分段设置阈值或者用速度归一化的特征——比如把时域指标除以当前转速下的基线值得到一个相对健康指数。8. 我个人的几点实操体会最后聊几句心得。轴承诊断做久了会发现最难的不是算法本身而是“把算法部署到现场以后还能稳定运行”。实验室跑通一个分类器不算什么放到现场转速波动、电磁干扰、日历驱动的周期变化都会让模型性能下跌。所以我的建议是从项目一开始就考虑鲁棒性不要在理想数据上过度调参。踩过几次坑之后我目前的经验是——对工业现场来说稳定可靠的异常预警比精准的故障定位更优先。先保证“有问题早发现别漏报”再逐步做到“发现到什么程度哪个部件坏了还有多少使用寿命”。很多团队一上来就想做剩余寿命预测最后往往因为数据不足或工况不稳定而搁浅反而把基础的异常监测做扎实了收益更直接。还有一点现场诊断永远要留后路。算法给的是概率和倾向维修决策要结合停机损失、备件周期、人员安排综合判断。一套好的诊断系统不是取代老师傅而是给老师傅提供更多可参考的线索。把数据、算法和经验结合起来才是轴承故障诊断真正落地的样子。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价