资讯动态

工控安全防护技术体系设计:从等保2.0定级分区到落地避坑指南

发布时间:2026/10/1 1:14:43 来源:尧图企业网站定制
跟工控打交道这么多年我最大的感受是真正能把安全体系落地的项目靠的不是堆设备而是先把“保护什么、为什么不这么干就会出事”想清楚。网络安全等级保护把工业控制系统正式纳入评估体系以后很多企业第一次开始认真做安全防护技术体系设计但标准条文和现场之间有一道很宽的执行鸿沟——怎么定级、怎么分区、边界设备怎么选、白名单怎么配、扫描器能不能碰PLC这些细节没人讲透。这篇文章我就按一个实际项目的推进顺序把工控安全防护技术体系从设计到落地的完整思路拆给你看适合正在做等保整改、工控安全建设或者负责生产网络安全的同行参考。1. 先弄明白等保2.0为什么把工控单独拎出来1.1 扩展要求到底扩展了什么等保2.0对应的国家标准GB/T 22239-2019在通用安全要求之外专门增加了工业控制系统安全扩展要求。这个变化的直接原因就是工控系统不是“换了设备的IT系统”通用要求里的很多条目拿到DCS/PLC现场根本没法执行。通用要求关注的对象一般是服务器、数据库、Web应用和办公终端。到了工控现场核心资产变成了PLC、DCS控制器、RTU、HMI、工程师站网络里跑的是Modbus/TCP、DNP3、IEC 60870-5-104、S7comm、Profinet、OPC UA这些工业协议。扩展要求针对这些对象做了细化包括室外控制设备和传感设备的物理防护、工业控制协议的安全过滤与深度解析、控制设备的身份鉴别、对关键操作如下装、参数修改、组态变更的审计、控制设备固件的可信验证等。你可以把扩展要求理解成“同一套安全思路在工控场景的方言版本”。它没有推翻通用要求而是在通用要求的基础上告诉你怎么把身份鉴别、访问控制、安全审计这些动作翻译成工控语言去落地。这一点非常重要因为等保1.0时代很多工控企业是硬套通用条款的整改做了一堆形式主义安全没上来运维反而更累。等保2.0把工控单独拎出来以后我们做设计时就有了明确依据设计方案能直接对应到扩展要求的条款评审和测评时也少了很多扯皮。1.2 工控和传统IT系统的五个本质差异做工控安全设计之前必须先把工控和IT的本质差异刻在脑子里否则后面所有的技术选择都会跑偏。第一是安全目标优先级不同。IT系统的默认顺序是保密性、完整性、可用性数据泄露是头等大事工控系统正好反过来可用性排第一完整性第二保密性最后。一次生产线停机可能每小时损失几十上百万而生产控制数据本身很少具备商业机密价值。这个差异决定了你设计的防护措施绝不能以牺牲可用性为代价任何可能引发生产中断的技术手段都要被谨慎评估。第二是网络结构不同。IT网络普遍有域控、分区分层、清晰的资产边界而工控网络大量是扁平化结构PLC和HMI直连、工程师站跨网段访问很常见既没有域控也没有统一身份体系。等保里强调的最小权限、默认拒绝在工控环境里落地要非常小心必须先搞清楚业务流、画清楚通信矩阵再谈策略否则一断电生产立马告警。第三是协议不同。传统防火墙只看IP、端口、协议号而工控安全要识别的是这条Modbus报文是读操作还是写操作、这个S7指令是不是在改PLC运行模式、这条IEC104命令有没有越权。没有深度协议解析能力边界防护基本等于没有攻击者只要绕过端口限制剩下的动作防火墙全部看不出来。这也是为什么工控项目普遍要求部署专门的工业防火墙而不是拿普通防火墙凑数。第四是系统老旧且补丁难打。现场还有大量Windows XP、Windows 7、老版本组态软件在支撑生产很多机器早过了官方维护周期厂商补丁滞后甚至根本没有打了补丁又怕和组态软件冲突需要反复验证。一台关键主机打补丁可能要等好几个月停机窗口这个节奏和IT部门完全不同。第五是运维模式不同。控制系统的运维通常由原厂和工艺团队负责安全团队插不进生产变更流程两边语言不通、流程不通、责任划分也经常有争议这是项目里最难啃的骨头。我在很多项目里一半时间不是花在技术上而是花在跟工艺、运维、原厂工程师对齐预期上。这五个差异贯穿全文后面所有设计决策都会反复回到这五条。2. 从定级到分区技术体系设计的两块基石2.1 定级备案先搞清楚你在保护什么技术体系设计不是从选设备开始的是从定级开始的。一个工控系统定二级还是三级直接决定你要上多少设备、做到什么强度、测评审核多严。定级的思路是把一个完整的工控系统作为定级对象比如某车间的DCS系统、某变电站的监控系统先梳理清楚系统所承载的业务重要性、波及范围和破坏后的影响程度再对照等级划分标准来确定级别。资产梳理这一步是最花时间的但也是最值得的。你要摸清楚生产网里到底有多少台PLC、多少台工控主机、用了哪些工业协议、哪些设备之间在通信。很多现场做完资产盘点都吓一跳本来以为只有两条网段的系统实际有十几个子网设备台账和实物对不上号。这个问题如果拖着不做后面所有防护策略都是空中楼阁。就我接触的项目来说重要的工控系统大多定三级。三级和二级在技术要求上有一个明显台阶边界访问控制、入侵防范、安全审计、集中管控要求全面加强日志留存要满足至少六个月的硬性要求而且每年都要做测评。二级相对宽松但也意味着防护强度需要靠企业自己把关。定级之后还要形成定级报告、走专家评审和备案流程这些合规动作项目甲方一般会跟进作为技术设计人员你最需要抓住的是定级结果对应到技术清单的映射关系定三级就老老实实把安全管理中心、边界防护、主机加固、日志审计全套配齐定二级则可以适当精简。2.2 用普渡模型做安全域划分定级解决“做到什么强度”的问题分区解决“设备和流量怎么摆”的问题。工控安全分区业内最常用的参考就是普渡模型。普渡模型从下往上把工业网络分成若干层现场设备层是传感器、变送器、执行器、阀门现场控制层是PLC、DCS控制器监控层是SCADA、HMI、工程师站生产管理层是MES、历史数据库、OPC服务器最上层是企业资源层也就是ERP和办公网络。落到实际项目我会把这个模型简化成三个安全域再加一个隔离区。企业管理域对应最上层跑办公业务和ERP生产管理域放历史数据库、OPC服务器、MES接口机这些既要跟生产设备交换数据、又要跟办公网打交道的设备这个区域通常做成缓冲区生产控制域就是真正的工控核心包含监控层、控制层和现场设备层。三个域之间的信任程度是递减的办公网的东西默认不可信生产控制域是最核心的保护对象任何跨域访问都必须经过边界防护设备。域内还可以再分。生产控制域内部我会建议按工艺单元或者装置划分逻辑子域比如一个化工厂的公用工程系统、反应单元、储运单元各自形成闭环网络子域之间的正常业务流量本来就很小正好方便做白名单策略。有个原则必须坚持视频监控、门禁、办公无线这类非控制业务绝不能和控制系统混在一个域里否则控制网被穿透的风险会成倍放大。下面是我在一个化工项目里常用的简化分区示意给你参考安全域典型设备对外通信方式防护建议企业管理域ERP、OA、办公PC经边界区访问生产数据与生产网隔离禁止直连边界区/生产管理域历史数据库、OPC服务器、MES接口机业务经工业防火墙双机冗余、部署审计生产控制域SCADA、HMI、工程师站、PLC/DCS域内白名单访问工业防火墙主机加固现场设备层传感器、执行器、RTU仅接收控制层指令物理防护禁止外部访问2.3 “一个中心、三重防护”的工控化落地骨架等保2.0技术部分的核心概括成一句话就是“一个中心、三重防护”。一个中心是安全管理中心三重防护是安全通信网络、安全区域边界、安全计算环境。这套骨架拿到工控场景里翻译一下落地关系非常清晰。安全通信网络解决“网络架构本身安不安全”的问题分区合理、跨域访问可控、通信加密和完整性有保障。在工控场景重点体现在普渡模型的分区落地、用工业防火墙做跨域流量过滤以及跨地域通信时用密码设备做加密传输。安全区域边界解决“跨域的入口安不安全”的问题部署防火墙做访问控制、部署入侵检测系统发现异常、部署恶意代码防护机制。这一块对应到产品就是工业防火墙、单向隔离网闸、工控IDS/IPS。安全计算环境解决“主机和设备本身安不安全”的问题身份鉴别、访问控制、安全审计、入侵防范、恶意代码防范、数据完整性保护。落到工控就是上位机加固、控制设备鉴别、应用白名单、移动介质管控。最后这些分散的技术措施需要一个中心统一管起来日志统一收集、策略统一下发、告警统一分析这就是安全管理中心实际落地通常是一个安全集中管控平台加一套运营流程。我经常打一个比方三重防护像是房子的小区围墙、单元门和入户门管理中心像是物业的监控室。没有监控室哪些门被撬了、哪些人进了楼都不知道防护设备再多也是盲防。这也是为什么我从一开始就要把安全管理中心放进技术体系里而不是让它变成一个可有可无的展示屏。3. 核心防护技术的落地细节3.1 边界防护工业防火墙、单向隔离与加密认证边界防护是整个技术体系里最不能省的一环。第一个要做的边界是办公网和生产网的边界我通常建议部署工业防火墙加单向隔离设备。为什么强调单向隔离生产数据经常需要往办公网同步比如让管理层的终端看生产报表、让ERP拿产量数据但反向流量基本没有合理需求。这种情况下用单向光闸最稳它从物理上只允许光信号单向传输办公网想往生产网回数据根本回不去。如果确实有维护通道需要从办公侧连进来那这条通道必须单独建设用堡垒机加最小权限策略绝不能直接打通一条双向路由。生产控制域内部各个子域之间需要工业防火墙做白名单边界的场景也很常见。传统防火墙在这儿的局限是只看五元组而工业防火墙能解析到工业协议指令级比如Modbus/TCP里的功能码、S7comm里的操作类型。策略可以细到“这台HMI只能对那台PLC发允许的写线圈指令其他指令一律拒绝”。这在实际生产里极其有用PLC最怕的就是有人误下发复位、写参数这类危险指令。边界设备的部署有几个容易被忽略的要点。第一工业防火墙必须支持故障旁路或者双机冗余否则设备一坏整个生产网被切断安全设备反而变成生产事故源。第二管理口和业务口要分离管理通道不能放在生产网里裸奔。第三策略全部默认拒绝一条一条把业务必需的通信流放进去做不全宁可先摸排业务流也不要图省事放开大段地址。我整理一份常见的边界策略示例供你照着调整方向源目的允许内容动作生产→管理历史数据库ERP接口服务器OPC UA / 指定端口允许管理→生产所有生产控制域全部拒绝工程师站→PLC指定工程师站IP指定PLC IPModbus只读功能码允许HMI→PLCHMI网段PLC网段运行必须的读写指令允许未知设备→PLC任意PLC网段任意拒绝3.2 计算环境上位机、控制设备和移动介质怎么管计算环境是等保考核的硬骨头也是工控项目整改工作量最大的部分。核心对象有三类上位机操作员站、工程师站、服务器、控制设备PLC/DCS/RTU、运维终端和移动介质。上位机加固第一步是身份鉴别。把默认口令全部改掉、禁止共用账号、启用强口令策略这些听起来基础但我在现场见过太多还在用admin/admin、甚至干脆不设密码的工程师站。第二步是访问控制按角色最小授权操作员和工程师权限必须分开组态修改、程序下装这类高危操作只给工程师角色。第三步是应用白名单这是工控主机防病毒的正确姿势。应用白名单的思路和杀毒软件完全相反杀毒靠特征库识别“谁是病毒”白名单直接规定“谁能运行”。组态软件、办公软件、系统进程放行其他可执行文件一律拦掉包括U盘里拷进来的新木马。它不依赖病毒库更新也不怎么耗性能对老旧工控主机非常友好。部署的时候我强烈建议先跑学习模式让主机正常运行一两周把所有合法程序学全了再切换阻断模式否则很容易误拦。这个缓冲期不能省我在下面第4章还会专门讲误拦问题。控制设备这边重点是四件事修改PLC/DCS默认口令、关闭不用的服务和协议口、建立固件版本台账并跟踪漏洞、启用可信验证。很多PLC自带Web管理、SNMP等服务出厂默认开着攻击者一旦进到控制网这些服务就是现成的跳板能关就关。可信验证如果现场没有可信计算模块至少先做引导完整性和关键组件的完整性基线校验这也是等保里明文要求的方向。移动介质管理单独说一句USB口是工控网络病毒进入的最大入口之一。技术上的做法包括禁用USB口、批量使用经过集中杀毒的专用U盘、在USB接入环节强制审计。管理上要配套“谁领用、谁负责、每次使用登记”的制度。光靠技术不靠制度移动介质管控就会变成摆设。3.3 检测、审计与集中管控防护体系里不能只有“挡”的设备还要有“看”的能力。检测和审计层面的标配是工控入侵检测系统、日志审计平台和集中管控平台。工控IDS一般旁路部署在核心交换机的镜像口把流量复制一份出来做分析不发阻断只发告警这是为了保证不影响业务。它靠深度协议解析能力来发现异常比如检测到有人在非维护时段连续向PLC发送写参数指令、发现从未见过的设备在扫描Modbus地址这些在传统防火墙的视角里根本看不出来。要注意的是IDS要接在生产网的关键节点而不是接在办公网很多项目把设备买回来接错位置等于没装。日志审计要解决的是“事后溯源”的问题。用户登录、操作指令、组态变更、参数调整都要有记录日志要统一收口系统时间要统一对时。缺少统一时间基准的日志没法做关联分析出了事根本还原不了事故现场。日志留存时长要满足等级保护要求基础是至少六个月保存方式要考虑完整性和防篡改。集中管控平台把这些零散的安全事件汇到一起之后还要做一件事关联分析。一台HMI被异常登录单独看可能只是可疑但如果同时发现它的网络行为开始规律性地向外发包、边界防火墙又拦到了来自未知IP的访问那基本可以判定这台机器已经失陷需要立即隔离排查。这种跨设备的关联判断单一设备做不了必须靠集中管控平台。再强调一次平台不是摆设。我看到过不少项目把态势感知大屏装得很漂亮却没人看、没规则、没运营流程告警堆积成山。平台上线的同时至少要定三件事谁来盯告警、告警分几级响应、每周怎么复盘。4. 项目现场最常见的四类坑4.1 漏洞扫描把PLC扫宕机第一类坑基本每个工控项目都会踩一次。刚接触工控的安全团队通常会习惯性照搬IT思路拿漏洞扫描器直接扫生产线结果扫描报文打到PLC上设备直接死机或者复位生产线当场停摆整个项目差点被赶出厂区。这不是危言耸听业内因为安全测试工具导致生产中断的真实案例不算少。扫描器发送的探测报文对于工控设备来说属于异常流量而很多工控设备的协议栈并没有做健壮性设计收到畸形报文就会复位甚至出错这个风险完全不可控。正确做法是前期用被动资产测绘通过镜像流量识别设备型号和开放端口不向设备发任何探测包。主动扫描只能在系统停机窗口里进行并且要先从非关键设备开始小强度、分批扫扫描前必须得到生产方书面确认。这个坑的本质是安全团队没有理解“可用性第一位”这一条。工控安全的第一原则永远是不给生产添乱所有动作都要以不影响生产为前提安排节奏。4.2 白名单策略误拦业务第二类坑是白名单策略误拦。我遇到过组态软件升级、新安装化验室数据接口程序之后程序被白名单直接拦掉的情况操作员反映系统异常排查半天发现是白名单没更新。这个问题几乎没法完全避免因为工业现场的软件更新本来就频繁组态软件补丁、新增采集程序、更新驱动模块任何一个新文件出现都可能触发白名单拦截。能做的就是把它变成流程问题新增或升级软件要走变更审批先在测试环境验证再更新白名单库最后才在目标机上操作。白名单管理端要放在安全管理员手里现场主机上不要留出口防止有人图省事自己关掉防护。部署白名单时留够缓冲期。先用学习模式跑足够长时间确认没有合法程序被遗漏再说。宁可多学几天不要急着上阻断误拦的代价比晚几天上线高得多。4.3 补丁打不上、特征库跟不上第三类坑是补丁和杀毒特征库都打不上、更新不了。工控主机大多是Windows 7甚至Windows XP很多已经停止官方支持补丁供应链早就断了杀毒软件依赖频繁更新病毒库可生产网不允许随便连外网内网更新源又不一定提前搭好。整改时我发现很多企业的工控杀毒软件病毒库还停留在半年前等于形同虚设。我的处理思路是组合缓解不追求完美修复。能打补丁的机器先在测试环境验证再分批打优先处理高危漏洞。完全打不了补丁的用虚拟补丁思路在边界设备上拦截已知漏洞的攻击特征再叠加网络白名单和主机白名单把可利用的路径一条一条堵死。杀毒更新源就在内网搭一个专用更新服务器定期人工挂载最新病毒库所有主机统一从内网更新既不接触外网又能保持特征库新鲜。这套组合拳下来虽然单看每条都不完美但攻击者要打通所有环节的成本已经非常高了。4.4 告警刷屏与审计失效第四类坑是告警刷屏间接导致审计失效。工控IDS和平台刚上线时误报率能到八九成运维和安全人员很快进入告警疲劳状态最后干脆不看平台前面做的检测审计全白费。解决误报的根本思路是给安全系统建立业务基线。让系统在生产网跑一段时间学习记录这个工厂的“正常行为”哪些设备之间通信、哪些指令在什么时段出现、流量量级多大。基线建立之后只有明显偏离基线的事件才产生告警。同时告警要分级高危异常实时推送中低危事件走日报周报。我还会跟客户约定一个“免打扰协议”除非确认是生产安全事故级的事件否则平台不直接干扰生产操作室告警只推给安全运维人员。这样可以避免安全告警和生产调度互相干扰也是工控项目能长期运营下去的关键。最后再说两句项目里的体会。技术体系本身再完善也只是项目的一半。另一半是让这套体系有人运营、有制度支撑。我见过太多花了大量预算建好防护体系的企业三个月后白名单没人维护、日志平台没人看、边界策略一年都没更新过一次。做安全不是为了给生产添麻烦是为了让生产在不出事的前提下更长久地运转。真正成功的工控安全项目往往是安全团队和工艺团队把彼此的语言听懂了这一点想通了后面所有的技术工作都顺了。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑