资讯动态

华为防火墙与交换机光口不UP排查思路与实战经验

发布时间:2026/10/10 18:21:54 来源:尧图企业网站定制
两台华为设备摆在一起光口插上之后死活不亮这种故障在机房里特别磨人。如果是USG6555F防火墙和CE6857交换机做南北向对接端口起不来业务直接全断两边工程师还容易互相猜疑——网络侧怀疑安全侧配置有问题安全侧怀疑交换侧光路有问题。我处理过不少类似的现场写这篇东西就是想把这套排障逻辑理清楚按什么顺序看、重点查哪里、哪些坑最容易踩一次性说明白。内容适合正在做数通维护的朋友也适合准备做边界对接或者等保整改、双机热备改造的兄弟们参考。我先说一下这类故障的通用认知光口无法UP本质上就是物理层没有完成握手。问题要么出在光模块、光纤这类物理介质上要么出在两端端口的协商参数不匹配上。配置层面的安全域、策略、路由那是端口UP之后才需要考虑的事。排障顺序搞反了后面全是无用功。1. 故障现象与排查思路总览1.1 现场拓扑与故障表现先说典型场景。USG6555F作为出口防火墙下接两台CE6857交换机做核心全网流量要过防火墙做安全检测所以两者之间的互联链路就是整张网的命脉。很多项目为了可靠性防火墙会做主备双机热备交换机也会做堆叠或者M-LAG但不管架构多复杂最底层的那根光缆只要起不来上面所有的冗余设计都白搭。故障现象通常是这样两端光口插上尾纤指示灯不亮或者只有微弱闪烁在设备上执行display interface brief端口状态显示DOWN再往下看物理状态是down协议状态也是down。如果此时业务还在跑要么是走了另一条备用链路要么就是业务已经中断。这里有个细节容易被忽略双机热备场景下心跳口或者业务口的光链路异常会导致VGMP组状态抖动防火墙主备频繁切换甚至出现两台设备都以为自己是主的情况。所以光口不UP的连带影响不只是断网这么简单是整个冗余体系都在被动摇。1.2 排查优先级为什么先把物理层放在第一位很多刚开始做网络的朋友遇到这种问题第一反应就是翻配置VLAN有没有放通、接口有没有加安全域、路由有没有指对甚至怀疑交换机端口被shutdown。但我要说的是光口不UP这件事配置层面的原因占比真的很低。按照我的统计物理链路和光模块问题占七成以上协商参数不匹配占两成剩下的才是端口状态、聚合、安全策略这些因素。为什么坚持先看物理层因为物理层检查都是无损操作不改变设备状态排查错了也不会有副作用。但你一上来就改配置改错了可能把原本正常的链路也搞挂。而且物理层的问题有非常明确的数据支撑——光模块的DDM信息会直接告诉你收光功率是多少模块是否被识别这些是客观的、不能抵赖的证据。所以我的推荐顺序很固定先看光模块识别状态和收发光功率再查端口协商模式是否一致然后才轮到聚合、VLAN、安全域这类配置项。这套顺序帮我在很多现场快速定位了问题也让两边团队能够基于同一个事实对话而不是互相甩锅。2. 物理层排查光模块、光纤与光功率2.1 光模块选型单模、多模与波长匹配物理层排查的第一步是确认光模块和光缆类型匹配。这里的基本常识其实就几行字多模光模块波长一般是850nm使用OM3、OM4等多模光纤传输距离短则几十米、长则几百米单模光模块波长一般是1310nm或者1550nm使用单模光纤传输距离从几公里到几十公里不等。USG6555F和CE6857对接常用的是SFP封装的万兆光模块。USG侧的接口如果是10GE光口插SFP模块没问题CE6857的情况稍微复杂些有些型号的高密度端口是25GE或者40GE起步如果用一分四线缆拆分成10GE口还需要确认拆分模式和接口速率配置对了没有。实际排障中我经常遇到“光缆和模块不匹配”的情况。比如拉了一根单模光纤结果插的是多模850nm模块最直接的表现就是不UP或者偶发UP但光功率极低反过来多模光纤插单模模块也可能因为模式色散问题导致收光异常。最稳妥的方法是在设备上直接看模块类型执行display transceiver interface命令查看模块的type字段是10G-SR还是10G-LR再核对一下本端和对端是否一致。另外提醒一句如果两端模块型号不一致比如一端LR一端SR只要光缆匹配通常也能通但光功率预算会非常紧张冗余不足。生产环境不建议这么干备件和规划时尽量统一。2.2 DDM光功率怎么看阈值、现象与判断光模块自带数字诊断功能DDM可以实时上报发射光功率、接收光功率、模块温度、偏置电流这些参数。这是排障时最有用的信息没有之一。在华为设备上查看命令大概是这样的display transceiver interface 10GE1/0/1 verbose display transceiver diagnosis interface 10GE1/0/1第一类命令看模块的基础信息和能力第二类命令看实时诊断数据。我们最关心的就是Rx Power也就是接收光功率。我给的参考判断标准是这样的不同模块阈值有差异但大体逻辑一致现象可能原因处理方向Rx Power显示-40dBm或N/A链路中断、纤芯断开、模块未完全插好重新插拔模块用光功率计逐芯测纤Rx Power低于-20dBm光衰过大、法兰盘污染、跳线折弯半径过小清洁端面检查跳线和ODF盘纤Rx Power在-15dBm到-2dBm之间正常范围继续排查协商和配置Tx Power异常偏低模块激光器老化或故障直接更换模块举个实际例子。某次现场USG侧读到的收光功率是-32dBm这个数据一出来基本可以断定不是配置问题而是链路本身光衰太大。后来排查发现ODF架里的尾纤被理线盖板压出了一个小弯重新盘纤之后光功率恢复到了-7dBm端口立刻UP。所以我的习惯是排障一开始就先读光功率。这组数据能帮你把范围从一个很大的故障域直接缩小到“链路物理层有问题”还是“链路物理层没问题”效率非常高。2.3 清洁与替换最容易被忽略的端面污染问题光模块的陶瓷插芯端面如果脏了光功率会异常严重时直接导致端口无法UP。这个原因特别常见但往往被忽略因为它不像光纤折断那样明显——模块外观是完好的插上去也到位了但端面上就是有一层灰或者一小块油渍。判断端面是否干净用肉眼直接看是不现实的得用光纤显微镜或者放大镜看。没有专业工具的话可以先用最原始的方法拿一根已确认没问题的跳线插到模块上测试如果还是不UP再考虑清洁端面。清洁操作本身很简单用光纤清洁笔在端面上轻轻擦拭几次或者用无尘纸沾少量无水酒精顺着一个方向擦然后等几秒风干再插回。注意千万不要用嘴吹吹出来的潮气会让灰尘粘得更牢固。也不要频繁插拔每次插拔都是对端面和接口的一次磨损。替换法是物理层定位的另一个利器。如果清洁之后还是不UP就把本端模块换到对端设备的另一个光口上看模块本身是否正常再把本端的光纤插到另一个空闲光口看是否端口本身有问题。三步互换下来基本就能定位是模块坏、端口坏还是光纤坏。这个过程中最好用已确认完好的备件做对照组否则越换越乱。3. 端口协商与速率配置UP不起来的长尾原因3.1 自协商机制与光口对接的“隐性雷区”如果光功率正常模块也能正常识别但端口还是起不来下一个要怀疑的就是自协商和速率双工配置。自协商的原理可以这样理解两个端口互发信号各自报自己的能力集然后协商出一个双方都支持的最佳参数。电口上最常见的协商内容是速率10M/100M/1000M和双工模式半双工/全双工光口的协商机制相对简单一些万兆光口一般速率固定为10G不存在降速到千兆的问题但握手过程同样存在而且对链路质量和模块兼容性比较敏感。“隐性雷区”出在哪里出在两端配置不一致。比如交换机侧某端口被前任工程师强制成了speed 1000防火墙侧还是默认auto两边握手就卡住了。另一种情况是模块兼容性差两端设备虽然都能识别模块但握手脉冲对不上设备日志里可能只显示“failed to negotiate”协议状态一直down。有个判断技巧如果两端都是auto模式还起不来而且确认光功率没问题大概率就是模块兼容性问题优先换模块如果一端auto一端非auto那先把两端改成一致模式再观察。3.2 USG6555F与CE6857两侧的速率双工配置USG6555F跑的也是华为VRP系操作系统命令行风格和交换机基本相同。把端口恢复为auto模式的配置如下system-view interface 10GE1/0/0 undo shutdown negotiation auto如果要做强制速率双工配置如下system-view interface 10GE1/0/0 undo shutdown undo negotiation auto speed 10000 duplex fullCE6857侧的逻辑一模一样system-view interface 10GE1/0/0 undo negotiation auto speed 10000 duplex full这里有几个实操要点。第一两端模式必须一致要么都是auto要么都是强制10000M全双工绝对不能一端auto一端强制。第二改配置要一端一端来改完立刻看对端状态变化如果第一端改完端口就UP了那说明问题出在原来那侧的配置上不需要继续动第二端。第三如果改成强制之后反而不UP及时回退到auto不要在一个错误方向上硬耗。另外CE6857的端口如果默认工作在25GE模式而你插的是10G模块需要到接口下执行speed 10000来切换速率。这种情况在CE6857带25G端口的型号上比较常见配置不对的话模块能被识别但端口永远起不来。3.3 聚合链路与安全域物理UP之后的第二道关卡物理端口UP了不代表链路就完全可用。如果是两条以上物理链路做Eth-Trunk聚合组的状态还取决于成员口是否都被加入、成员口配置是否一致。聚合组里只要有一端配置遗漏链路就可能处于DOWN状态。排障时别忘了执行display eth-trunk看一下聚合组的成员和活动状态。常见的情况是端口物理上已经UP但聚合组显示为DOWN原因无非是成员口没有全部加入、两边成员口编号不一致、或者成员口的允许VLAN列表不一样。再往前一层防火墙还有一个特有的关卡——安全域。USG系列防火墙默认隔离域间流量接口不加入安全域策略不放行物理链路再健康业务也过不去。相关配置大致是这样firewall zone untrust add interface 10GE1/0/0很多朋友在排障时遇到“端口UP但ping不通”就开始怀疑光口配置实际上问题出在安全域和安全策略上。所以我在现场排障时会提醒自己端口不UP查物理和协商端口UP但不通查安全域和路由。顺带说一句热词里提到的“链路聚合还是主备”这个选型问题其实在防火墙和交换机对接时特别关键。如果两台防火墙做双机热备、两台交换机做堆叠互联链路可以做成Eth-Trunk配合HRP实现高可用如果交换机之间没有堆叠那就要考虑聚合跨设备能不能做否则老老实实做单链路主备。无论哪种方案前提都是物理端口要稳定UP链路问题不解决一切高可用设计都是空中楼阁。4. 三个典型根因案例复盘4.1 兼容性黑名单非原厂光模块在CE侧的“不认账”这个案例我印象很深。某项目防火墙和交换机之间用了第三方兼容光模块单独在USG侧测试端口能正常UP数据收发也没问题。但插到CE6857这边端口就是起不来。查看接口信息发现交换机没有正确识别模块的厂商信息甚至没有识别出模块类型。华为CE系列交换机对光模块有兼容性校验非认证模块有时会触发告警严重情况下端口会被强制隔离或者直接不启用。这不是玄学是设备保护机制在起作用。USG系列的校验相对宽松所以才会出现“在防火墙侧能用插交换机就不亮”的情况。解决方式没有太多花哨的更换华为认证的光模块或者选择明确兼容该型号交换机的第三方模块。我个人的建议是核心设备和核心链路之间不要省这点模块钱备件里常备一对认证的万兆模块能省掉大量排障时间。怎么确认模块是否被识别执行display transceiver interface verbose看模块的Vendor Name、Vendor PN这些字段是否正常显示如果显示unknown或者异常基本就是兼容性问题。4.2 纤芯交叉与法兰盘污染看着没问题其实链路已断另一个现场案例更有迷惑性。两端设备都显示模块正常但收光功率低到-30dBm端口彻底起不来。物理拓扑图上看A端到B端的标签写得清清楚楚理线架也整整齐齐怎么想都不该是链路断。后来用光功率计和红光源逐芯测试才发现是ODF配线架上跳线跳错了芯。图纸上标注的是1/3芯实际施工接成了1/2芯从设备侧看过去链路就是断的只是因为线缆都集中在线架上从外观根本看不出来。还有一种情况是法兰盘污染或者对接头松动。法兰盘里的灰尘会让光功率凭空损失十几个dB看起来是通的实际上链路预算已经不够了。这类问题用肉眼完全看不见不测光功率根本无法定位。这个案例的教训是所有涉及光缆的新建、割接、搬迁项目交付前必须用光功率计逐芯验收并且保留测试记录。标签写得对不对要和实测结果比对不要想当然。4.3 协商降速导致“半UP”端口亮了但速率不对这个案例比较隐蔽因为端口状态是UP的业务也通但质量极差延迟大、丢包多监控系统看端口状态根本发现不了异常。检查接口信息才发现速率协商成了1000M两端一个是10G模块一个是千兆残废配置。这类问题常见于模块兼容性不佳时发生的降速回退以及端口配置被改动过。某次现场就是交换机侧之前被配置过speed 1000后来光模块从千兆换成了万兆但端口速率配置没有跟着改结果模块协商到了千兆链路半死不活。处理方式很直接把两端速率强制成10000M全双工然后检查错包计数是否还在增长。这里也体现出查看端口速率的重要性——不只是看UP还是DOWN还要看UP得对不对。做一个合格的一线工程师需要养成看完整接口信息的习惯速率、双工、错包、光功率这些字段都要扫一遍。5. 现场排查速查手册与避坑经验5.1 高频命令清单与判读标准这几个命令覆盖了九成以上的光口排障场景建议收藏备用命令什么时候用关键判读display interface brief第一眼全局看接口状态是UP还是DOWN速率是多少display interface 10GE1/0/0查看完整接口信息物理层状态、协议状态、错包计数display transceiver interface 10GE1/0/0 verbose查看模块信息模块类型是否识别、厂商是否正常display transceiver diagnosis interface 10GE1/0/0查看DDM光功率收光是否在正常范围display logbuffer查看端口down/up日志有无协商失败记录reset counters interface 10GE1/0/0清空错包计数清后观察错包是否继续增长display eth-trunk查看聚合组状态成员口是否激活、配置是否一致这些命令不仅用于排障日常巡检也可以按这个顺序过一遍提前发现光功率劣化、错包增长这些隐患。真正等到业务中断再查压力完全不一样。5.2 快速定位五步法现场排障的时候不要东一榔头西一棒子。我给自己定的流程是五步走每一步都不用花太长时间走完基本能锁定问题第一步看指示灯和接口状态确认是物理DOWN还是协议DOWN。物理DOWN说明链路层就有问题协议DOWN说明物理层通了但是二层协商有问题。第二步读光模块DDM信息核对两端都识别了模块、收光正常。这一关没过不要往下走先把物理链路搞干净。第三步检查两端的协商模式、速率、双工配置是否一致。改了任意一侧配置后立刻看对端状态变化。第四步还没UP的话用替换法处理替换模块、换光纤、换端口缩小故障域。记住每次只换一个变量否则结果没法判断。第五步端口UP之后不要急着走把Eth-Trunk成员状态、允许VLAN、防火墙安全域、双机热备心跳状态一并过一遍确认链路真正可用。这套流程最核心的思想就是把排查过程拆成无依赖的小步骤每一步都有明确的数据支撑不会混乱也不会重复劳动。5.3 这几次排障教会我的事最后分享几个踩过坑之后总结的小习惯。第一动任何配置之前先备份和截图。光口排障经常要改速率双工、改聚合、改安全域一旦改动没有恢复原状问题只会越排越多。备份给足了后悔药。第二不要同时改两端配置。哪怕你对配置非常有把握也建议一端一端来观察对端响应再动下一端。这个习惯可以让你快速确认是哪一端引起了变化。第三尽量使用认证光模块尤其是CE系列交换机侧。我见过太多因为兼容模块导致的怪故障排查到最后换个模块三秒钟解决但找原因可能花掉三个小时。第四备件包里至少要有一对万兆光模块、一根确认好的尾纤跳线、一个光纤清洁笔。这三样东西能让你在大部分故障现场完成物理层的自证。至于网上常问的“防火墙关闭有影响吗”这类问题答案很简单生产环境防火墙不能随意关闭双机热备下关闭会触发切换业务流量会走到备机单机部署下关了直接断网。所以链路可靠性和防火墙本身的可靠性是同等重要的一环光口这种基础问题的排障能力就是日常运维的硬功夫。做了这些年数通维护我越来越觉得端口UP这件事虽然基础但恰恰是最考验功底的。很多兄弟一上来就翻配置看到IP和路由都没问题就抓瞎其实答案就藏在那根跳线、那个模块端面上。我现在排障的第一动作永远是读光模块的光功率这个习惯已经帮我少加了好几次班。如果你也在做防火墙和交换机的光口对接按这个顺序走一遍大概率能少走不少弯路。等哪天有空我们再聊聊Eth-Trunk起不来和双机热备抢主的话题。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑