资讯详情

石化企业工控网络安全整改实战:从资产梳理到应急响应

📅 2026/9/14 9:12:31 | 华诺云谱 👁 阅读
石化企业工控网络安全整改实战:从资产梳理到应急响应
1. 石油化工行业的网络风险远比想象中复杂干这行十几年每年都要被问同一个问题石油化工企业到底有什么好黑的很多人觉得炼油厂、化工厂的网络不就是内网加上几台工控机吗跟普通企业能有多大区别但等你真正进到现场看到那一排排DCS操作站、PLC机柜、SCADA服务器、OPC网关之后你会发现这里面的网络风险跟办公楼里的完全不是一回事。它不光是数据泄露的问题更直接关系到装置能不能平稳运行、现场有没有安全风险往大了说就是生产安全和公共安全。这两年化工行业的网络风险事件其实一直在悄悄增多。勒索病毒打进操作站导致中控室大屏全部黑掉、装置被迫降负荷甚至停车的案例我身边就不止一次听到。更麻烦的是很多企业不是不想防是根本不知道从哪下手。传统办公网的防火墙、杀毒软件直接搬到工控网里轻则误杀组态软件、重则把正在运行的控制指令给拦了吓得运维团队再也不敢动。这篇文章我想从自己实际做过的石油化工行业网络风险整改项目出发把整套解决方案的思路、落地步骤、踩过的坑都拆开讲清楚。内容会覆盖资产梳理、分区隔离、主机加固、监测审计、应急响应这几个核心环节适合化工企业的信息化负责人、工控安全工程师、以及准备做等保合规改造的同行参考。我不会给你画一堆PPT上的“先进架构”而是尽量说人话告诉你真正在现场怎么干活。1.1 一张典型的石化企业网络拓扑藏着哪些隐患先花点时间把石油化工企业的网络结构讲清楚。绝大多数厂区会分成两层办公管理层和生产控制层。办公层跑的是OA、ERP、电子邮件这些系统员工在这里办公上网生产控制层则是从DCS系统、PLC控制器、现场仪表到操作员站、工程师站、历史数据库这一整套工控体系。看起来好像很清晰但实际的问题出在连接方式上。早期建设的时候很多厂子的生产网和办公网之间没有做严格的物理隔离或者中间只隔了一道普通的交换机靠VLAN划分一下就算完事。更普遍的情况是生产网需要把产量、能耗、质量这些数据传到办公网里的MES系统、LIMS系统去分析所以两网之间必然有数据交换的通道OPC协议、数据库同步、文件摆渡都是常见的通道。这些通道一旦开口风险就跟着进来了。办公网里的终端中了勒索病毒横向渗透到MES服务器再通过OPC通道摸进生产网的操作站这是非常典型的一条攻击路径。很多工控网络里跑的还是Windows XP、Windows Server 2003这些老掉牙的系统漏洞一堆补丁又不敢打因为组态软件可能依赖特定版本的系统环境一打补丁就容易出兼容性问题。再有就是第三方运维人员。炼化装置的DCS系统大多是霍尼韦尔、横河、西门子、中控、和利时这些厂商的设备出问题时厂商工程师要进场维护。这些人往往直接拿自己的笔记本电脑接到操作站或者工程师站上而这些笔记本去过多少家工厂、插过多少U盘谁也说不清楚。我见过一个案例最后的病毒溯源结果显示就是某个仪表厂商的维护笔记本把蠕虫带进了控制网。这个拓扑结构本身就决定了石化行业的网络风险不能只靠某一类产品解决必须从整体架构上去思考问题边界。1.2 真正让人头疼的几类风险场景结合我这些年接触的现场情况石油化工行业的网络风险主要集中在下面几类。第一是勒索攻击导致生产中断。这是最致命的一类。攻击者通过钓鱼邮件、弱口令爆破或者漏洞利用进入办公网再横向渗透到生产网在操作站上把关键文件加密。生产装置的控制程序、组态文件、历史趋势数据一旦被加密恢复起来非常耗费时间很多企业只能被迫停机。而化工厂停一次车损失不是按小时算的是按天算的一天的产量损失加上设备启停损耗几百万都打不住。第二是非法指令下发带来的工艺安全问题。工控系统里的DCS和PLC接受上位机传来的控制指令如果攻击者掌握了操作权限在凌晨向反应釜的温度控制PID参数里写一个异常值后果不堪设想。这种攻击隐蔽性极强不会像勒索病毒那样有加密动作它只是改变几个参数你可能几周之后才发现产品质量出了问题到时候溯源都难。第三是敏感数据被窃取。石油化工企业的工艺配方、催化剂配比、装置运行参数、能耗数据这些都是多年积累的商业秘密。随着工业互联网平台普及很多企业把生产数据往云上搬如果接口没做好权限控制数据泄露面就会扩大。第四是供应链和第三方风险。前面提到的厂商维护笔记本还有设备采购时预装的后门都属于这类。石化企业现场设备种类多、供应商杂从DCS到PLC到各种智能仪表美国、日本、欧洲、国产的都有供应链安全管理做起来非常费劲。为了看得更直观我把风险类型和典型影响整理成了下面这张表。风险类型典型场景影响范围勒索病毒钓鱼邮件进入办公网横向渗透到DCS操作站生产停车、数据加密、恢复成本高非法控制指令攻击者向PLC/DCS写入异常工艺参数产品质量异常、安全事故隐患数据窃取工艺配方、能耗数据经接口被动/主动外传商业机密流失、竞争力受损供应链污染设备出厂预置后门、维护笔记本带毒入网潜伏时间长、溯源困难违规操作U盘摆渡、私接Wi-Fi、违规远程接入病毒反复感染、监管整改压力2. 整体防护思路从合规驱动转向风险驱动讲解决方案之前我想先纠正一个普遍存在的误区。很多企业做网络风险治理切入点是“等保测评要来了赶紧买点设备应付一下”。这种合规驱动的做法不是不对而是容易流于形式。防火墙买了、日志审计上了、门禁装了但资产依然没梳理清楚、策略依然没有适配工控场景测评一过设备就吃灰去了。我更推荐风险驱动的思路。先把自己最核心的资产列出来想清楚“如果这套系统被人动了最坏的结果是什么”然后针对最坏的结果设计防护策略。你会发现合规的框架其实也可以作为底座但里面的内容要重新填充到真正能扛事的状态。2.1 先回答一个大问题你防的到底是黑客还是自己人石化行业做网络安全最容易被忽视的风险源其实是内部人员包括无意操作和违规操作。一个操作员把手机插到操作站上充电一个工程师为了方便调试私自把生产网的调试端口打开这些行为的威胁程度一点不比外部黑客低。我自己做过统计在给企业做风险排查时发现的真实威胁事件里内部原因包括误操作、违规连接、设备带毒接入占了大头真正的境外定向攻击反而占比很少。所以方案设计时不能只防外部入侵还要管住内部行为。这就意味着需要“白名单”思路。办公网习惯用黑名单——病毒库更新、IPS特征库升级、查杀未知文件工控网更应该用白名单——只有明确可信的进程、可执行文件、网络连接、操作指令才允许运行。原因很简单工控环境里跑的应用就那么几个DCS组态软件、历史数据库、OPC通信程序掰着手指头都数得过来完全可以划定一个明确的允许清单。白名单机制天然就能挡住那些“没见过的程序”不管它是勒索病毒还是APT样本只要不在清单里一律禁止执行。2.2 一个可复用的架构一个中心、三重防护很多同行应该听说过“一个中心、三重防护”这个说法它来自等保2.0的通用框架。在石化行业的工控网络里这套框架同样适用但落地时要做针对性的变通。“一个中心”指的是安全管理中心也就是把所有安全设备的管理、日志收集、策略下发、告警分析集中到一个平台上。在工控场景下我会建议把它部署在单独的II区逻辑上独立于生产控制网络避免安全系统本身成为被攻击的目标。“三重防护”分别是安全通信网络、安全区域边界、安全计算环境。落到石化现场对应关系大概是这样的安全通信网络生产控制网内部按装置区域划分VLANDCS各域之间、DCS与SCADA之间做流量隔离。安全区域边界办公网与生产网之间部署工业网闸或工业防火墙生产网各车间边界部署工业防火墙实现严格的区域隔离和协议级访问控制。安全计算环境操作站、工程师站、服务器上安装终端加固与白名单软件关闭高危端口禁用USB口限制可执行程序。需要强调一点工控场景的边界防护不能直接照搬办公网防火墙。办公网防火墙看的是IP、端口、五元组而工业防火墙必须要能做工业协议级的深度解析。比如Modbus TCP、OPC UA、S7comm这些协议防火墙要能识别出你在读哪个寄存器、写哪个地址、功能码是否合法。如果只是放行端口攻击者完全可以利用合法端口下发恶意指令边界防护形同虚设。2.3 为什么“不打扰”比“强阻断”更重要做办公网安全很多时候讲究“发现威胁就隔离、就阻断”甚至直接弹窗要求用户杀毒。但在生产控制网络里这条逻辑走不通。DCS系统是7乘24小时不间断运行的反应釜的温度控制、压缩机的转速调节这些实时任务对网络延迟和系统稳定性极其敏感。你不可能让一台操作站因为安全软件弹窗就停下来等用户确认更不可能在白天生产高峰的时候对DCS的历史服务器做全盘扫描。我参与过的某个项目的亲身经历客户之前在其他厂区试点过一套传统EDR结果软件升级后把DCS组态软件的某个DLL文件给隔离了工程师站重启后直接连不上控制器现场一片慌乱。他们后来把安全方案全部换掉我们接手后的第一原则就定成任何安全组件不得影响业务可用性。具体操作上是这么处理的终端侧用轻量级工控白名单软件不开传统杀毒的实时监控引擎只做文件白名单和USB管控网络侧用工业防火墙的审计模式先跑两到四周摸清正常流量基线后再逐步把策略从审计切换成阻断。整个过程像做手术一样先观察、再小切口、逐步扩大绝不一上来就大刀阔斧。后面我会详细说这个“先审计后阻断”的做法。3. 落地实操一次完整的网络风险整改过程这一部分我按一个典型的炼化企业项目来拆解。假设这是一家年炼油能力800万吨的中型炼厂有常减压、催化裂化、连续重整、加氢裂化等十来套装置DCS品牌以中控和霍尼韦尔为主生产网里大约有120台操作站、60台服务器和工程师站与办公网之间有一条OPC数据交换链路。项目目标很简单满足等保三级要求并且真实降低网络风险水平。整个周期我们做了三个月核心工作分五步走。3.1 第一步资产梳理把家底彻底摸清楚没有资产清单所有安全策略都是空谈。这一步的产出直接决定后续边界怎么划分、白名单怎么定、策略怎么下是整个项目的基石。实际操作中分三个手段并行推进。第一是人工调研发资产调研表到各车间让工艺员和仪表员填清楚自己工段的DCS型号、控制器数量、操作站位置、重要服务器清单。别嫌这个办法土很多一线人员手里至少有一份不完全准确的台账这张表能帮你快速建立初始清单。第二是流量发现在网络汇聚节点旁路部署流量探针跑两到三周把真实通信的对端关系、协议分布自动梳理出来。第三是主动扫描对生产网内的IP做轻量级端口扫描和主机指纹识别。注意这里必须用支持工控协议的扫描器而且要在装置停车检修窗口做绝对不能在生产运行期间对DCS控制器做高强度扫描哪怕是主动扫描也会给老旧的控制器带来额外负载严重时可能引起通信异常。最终输出的资产台账要包含这样几个字段IP地址、MAC地址、物理位置、所属装置、操作系统版本、开放端口、主要应用、负责人。这张表后面会反复用到。我给你的经验是资产台帐建完并不意味着事情结束而是开始。后续每次大修、装置改造、设备更换都要同步更新台账。很多企业方案实施完半年台账已经和实际对不上了安全策略随之失去效果。3.2 第二步策略设计分区隔离从图纸开始资产梳理完接下来画网络拓扑图把生产网内部按装置区域、管理功能切成多个安全域。石化行业的典型分法是把网络分成四个安全区办公管理区、生产执行区、过程控制区、现场设备区不同区域之间的信任级别不同交互规则也不同。这张图不是画完给人看的而是用来确定防火墙部署位置的施工图。我以最常见的情况举例办公管理区与过程控制区之间部署工业网闸只允许OPC UA的只读数据从过程控制区单向摆渡到办公管理区办公网不能反向访问生产网任何地址。过程控制区内部不同装置DCS之间部署工业防火墙只放行操作站、历史站与控制器的必要通信端口。工程师站、运维终端单独划一个运维管理区通过堡垒机做跳板集中管控运维行为并限制运维终端仅能访问目标设备。操作员站和工程师站直接连接控制器的端口在交换机上做端口级访问控制禁止非授权终端接入控制网。在策略配置上工业防火墙的规则要尽量收敛到“允许什么”而不是“拒绝什么”。比如OPC通信传统防火墙会放行TCP 135和动态端口而工业防火墙能做OPC UA的深度识别规则可以精确到只允许特定应用调用协议解析出来后按功能码白名单控制。对Modbus TCP规则可以限制功能码只允许03读保持寄存器、06写单个寄存器等必须的几种其它功能码一律丢弃。这样的策略设计花了我们大概两周时间。最大的工作量不是画图和写策略而是跟各装置负责人确认“这条链路是不是必须的”。几乎所有业务人员都会说“这个先留着说不定以后要用”你得拿着流量分析报告一条一条证明“这个通信过去三个月根本没出现过”才有可能说服对方收敛规则。3.3 第三步边界防护与主机加固该关的都关上边界设备部署完成之后真正花时间的是主机侧的加固工作。石化现场的老旧系统比例非常高主机加固必须按照“最小影响”原则执行。先梳理一份加固清单逐台确认。常见的基础加固项包括加固项操作内容注意问题关闭高危端口关闭135、139、445等SMB相关端口确认DCS组态软件是否依赖SMB共享个别老的组态软件需要放行特定共享端口禁用USB存储通过组策略或白名单软件禁用USB存储设备保留键鼠等HID设备的USB权限操作站上不要一刀切禁用所有USB账号策略禁用Guest账户、修改默认口令、强制强密码策略登录DCS的账号不能随便锁定要跟中控/和利时的服务商先确认补丁管理对Windows系统漏洞打补丁必须先在生产测试机验证再批量下发补丁服务器独立部署白名单软件部署工控主机白名单锁定可执行程序先开学习模式观察一到两周再启用强制模式屏幕锁定设置操作站自动锁屏策略避免操作员交接班时不锁屏导致越权操作这里有件事特别想提醒SMB端口关闭在石化行业矛盾很突出。很多老DCS的操作站之间通过Windows共享目录交换报表文件关掉445端口确实能防住永恒之蓝这类漏洞但也会让操作员正常业务干不了。我们的做法是先梳理依赖共享的机器列表对这个范围内的主机不关闭445但放到一个独立VLAN里并限制共享目录的读写权限其它机器一律关闭。妥协方案不一定完美但比一关了之造成的业务中断要好得多。另外主机白名单软件在正式启用之前一般建议开两到三周的学习模式让系统把正常运行的进程和模块都学习进来。上了强制模式之后偶尔还是会出现个别软件的新模块被拦截的情况。这时候不要慌白名单管理后台通常有临时放行和永久加白两种操作先临时放行保证业务恢复再分析确定要不要永久加白。3.4 第四步监测审计与日志管理让风险看得见边界和主机的策略解决的是“防住大多数”但总会有漏网之鱼所以监测审计能力必须跟上。我们的做法是在过程控制区的核心交换机上旁路部署工业审计探针以及在安全管理中心部署日志审计平台。工业审计探针的作用是持续分析网络流量发现异常行为。它会学习正常通信的基线一旦出现偏离就告警。比如某台操作站平时只跟DCS控制器通信某天凌晨两点突然开始对全网段进行扫描这就是非常典型的横向渗透行为系统应立即产生高优先级告警。探针的告警规则需要结合实际调整。第一周我们几乎被告警淹没了每天几千条仔细看了之后发现大半是误报。比如某些DCS操作站启动时会有短暂的网络广播扫描行为被误判成了扫描探测某些工程师站会在整点自动同步时间触发了异常通信告警。这些都需要把相关IP加入白名单或者调整检测阈值让告警收敛到一天二三十条真正需要关注的范围内。日志留存方面等保三级明确要求日志留存不少于6个月我们实际建议至少保留12个月。石化行业的调查取证周期往往比较长事故发生后需要向前追溯很长一段时间的操作记录。日志审计平台除了收集安全设备的日志还要同步操作系统的登录日志、DCS的操作日志、堡垒机的运维审计日志。数据量确实很大这里建议提前做好存储规划一台日志平台少说也要配几十TB的存储空间否则过半年你就得面临“删日志保运行”还是“加硬盘保合规”的两难。3.5 第五步应急响应与持续运营方案不是交付完就结束方案交付不是终点而是运营的起点。很多企业以为防火墙部署完就万事大吉结果三年之后设备策略没更新过、特征库过期、日志平台硬盘满了一直没人管整个项目等于白做。所以在项目收尾阶段我们一定会帮客户建立起持续的运营机制。首先是制定并演练应急预案覆盖勒索病毒、DCS通信中断、非法指令注入这几个最关键的场景。演练不是走流程要动真格的——在模拟环境里由安全工程师扮演攻击者投放勒索病毒样本看防守团队能不能在规定时间内发现并处置。第一次演练通常惨不忍睹但多练几次处置速度会有质的提升。其次是数据备份策略。操作站和工程师站的组态文件、DCS控制逻辑、历史数据库要定期备份备份文件要脱离生产网保存。这个备份策略平时不怎么显眼一旦遇到勒索病毒加密它就是你的救命稻草。我遇到过一个客户因为组态备份还是半年前的中招之后恢复生产花了一周多天天被领导骂。如果备份策略坚持每周做、每月异地归档最多损失一天的数据装置很快就能恢复起来。最后是运营指标定期回顾整改情况。我会给客户设定几个关键指标高危漏洞闭环率、白名单覆盖率、日志审计覆盖率、应急演练频次、告警平均响应时间。每个月出一次月报讲清楚这个月新增了哪些风险、处置了哪些隐患、哪些地方的策略需要调整。运营越到后面你会发现安全团队的成熟度提升得越快。4. 常见问题与故障排查我怎么处理现场疑难杂症的做石油化工行业的安全整改你一定会遇到各种奇奇怪怪的问题。这里挑几个我踩过坑最深、最典型的问题把排查思路写出来你们以后遇到可以少走很多弯路。4.1 工业防火墙一上线OPC通信就超时中断这是个高频问题。防火墙策略明明配得没问题流量也放行了但OPC客户端总是频繁断连操作员那边历史数据传到一半就报错。排查思路是这样的。先看是不是策略里的动态端口没放干净OPC DA基于COM/DCOM协议除了135端口还会动态协商高位端口很多传统防火墙就是挂在这个地方。如果策略是收敛的再看防火墙的会话老化时间设置工控协议的很多长连接长时间没有数据包防火墙默认的会话超时时间太短会把已经建立的连接斩断。把会话老化时间调长或者开启工控协议的保活机制问题就能解决。再说一句OPC UA通信本身就比OPC DA更容易做安全控制因为它在应用层有明确的服务调用关系工业防火墙解析起来更准确。新建项目尽量用OPC UA老的OPC DA实在没法替代的就在网闸两侧做协议转换不要把裸的DCOM流量直接暴露在两个网络之间。4.2 白名单误拦导致操作员下发控制指令失败这个问题出现的位置很刁钻。某天操作员在中控室画面上点了“启动进料泵”画面提示操作成功但现场泵没动作。查下去发现指令在操作站本地就被终端白名单软件给拦住了——某个DLL文件不在白名单列表里进程调用失败。遇到这种情况第一反应不要责怪白名单软件也不要责怪操作员。先到白名单管理后台查看拦截日志看清楚拦截的是哪个文件、哪个进程。大多数时候是新升级的组态软件补丁引入的新DLL文件或者某个动态生成的临时文件没有被学习进来。确认是正常文件后把它加入白名单即可。这类问题也说明白名单软件的学习模式和运维流程必须配套。每次DCS组态软件升级、打补丁、加模块之前都要提前通知安全管理员让白名单系统先进学习模式。安全管理员要有“业务变更联动”的意识而不是等出了故障再去排查。4.3 日志审计平台被海量日志打爆日志平台上线三个月硬盘满了入库速率越来越慢控制台操作卡得跟幻灯片一样。这也是续航项目里的常见病。问题根源是采集范围太大没有做日志过滤和分级。网上有句玩笑话叫“未经过滤的日志就是垃圾”放在这里非常贴切。我们把采集策略改成分级机制防火墙、网闸、堡垒机这类安全设备的高危告警日志全量采集操作系统日志只采集登录成功、登录失败、账号变更、服务启停这些关键事件DCS操作日志按业务重要性分优先级工艺报警和参数修改必须采集普通画面切换类操作不采集。同时给日志平台设置合理的存储保留策略热数据保留三个月满足快速检索冷数据压缩归档保留到一年以上。检索慢的问题靠索引优化解决不用全量索引只对最关键字段做索引查询速度翻倍。4.4 常见问题速查表把上面这些以及其它现场常见的问题整理成一个速查表方便你们直接查阅。问题现象可能原因排查与解决办法OPC通信频繁断连动态端口未放行、会话老化时间过短检查DCOM动态端口策略、调长会话超时防火墙部署后工艺数据中断误封了正常协议功能码先用审计模式观察流量基线再启用阻断操作站下发指令失败白名单拦截新文件/新模块查看拦截日志确认后加入白名单日志平台存储爆满采集范围过大、过滤策略缺失分级采集、冷热分离、关键字段索引勒索病毒在操作站反复感染USB摆渡或运维笔记本带毒禁用USB存储、运维终端统一经堡垒机接入告警大量误报基线学习不充分、阈值不合理运行一段时间后持续调优白名单和告警规则老旧主机无法打补丁系统版本太老、业务不兼容用白名单和微隔离技术兜底关停不必要服务设备厂商拒绝配合安全整改担忧影响DCS运行请厂商提供书面确认函明确安全加固风险边界5. 项目做完之后的几点体会做完这么多石油化工行业的网络风险整改项目我最大的感触是技术只是手段真正的分水岭在管理流程和执行层面。再好的工业防火墙再严的访问控制策略如果检修期间一个工程师图省事直接用自己电脑绕过堡垒机硬生生接进DCS网络整个安全体系就被撕开了一个口子。所以每次项目验收的时候我都会留一个专门的环节给管理制度的落地什么行为被允许、什么行为被禁止、违反之后有什么处罚白纸黑字写清楚让每个操作员和运维工程师签字确认。另外想对那些正在做方案规划的同仁说一句不要指望一步到位。石化行业的生产连续性要求极高停机和生产窗口都非常宝贵安全改造要见缝插针利用好装置大修的窗口期分阶段推进。先把风险最高的几条链路堵上再逐步扩展到全局。最后分享一个小技巧在做流量审计和基线梳理的时候别只盯着白天的高峰期看凌晨两三点到早上五六点的流量往往更能说明问题。很多恶意行为、违规操作都发生在深夜因为那时候值班人员最少、警惕性最低。你翻翻这段时间的审计日志通常会比白天时间段有更多意外发现。
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。