资讯详情

FusionStorage分布式存储运维实践:存储池、iSCSI与故障排查

📅 2026/10/10 5:09:45 | 华诺云谱 👁 阅读
FusionStorage分布式存储运维实践:存储池、iSCSI与故障排查
简介华为FusionStorage系统管理指南是一份面向数据中心存储管理员与运维工程师的官方操作手册聚焦分布式存储解决方案中存储资源的管理与维护重点解决存储池和块客户端日常操作中的常见问题。文档版本为V100R003C30内容按模块化目录组织详细涵盖存储池扩容、减容与删除块客户端创建与删除并延伸至卷管理、映射管理、数据保护、性能优化及故障排查等运维要点每个步骤均包含操作说明与注意事项。资源包为单个PDF文件大小仅1.32MB体积轻巧便于下载、离线查阅与按章节检索。目前已有194人浏览学习适合正在使用或计划部署该分布式存储系统的团队参考。通过阅读这份手册读者可系统理解存储资源的管理逻辑掌握扩容缩容时的安全操作规范从而在数据中心日常维护中降低误操作风险保障存储服务的连续性。1. 一份2016年的 FusionStorage 管理指南现在为什么还能用FusionStorage V100R003C30 管理员指南是华为 2016 年发布的分布式块存储配套文档。这份 PDF 的目录几乎就是一套完整的存储运维检查清单存储池怎么扩容减容、卷怎么挂载卸载、iSCSI 启动器和 CHAP 认证怎么配、FSM 数据怎么备份恢复、SSL 证书怎么换每个环节都给了操作路径而不是一句「请联系华为支持」带过。它适合三类人正在打理存量 FusionStorage 环境的运维刚接手华为分布式存储、想搞懂卷与存储池关系的新手以及在升级前想确认老版本管理动作有没有遗漏的工程师。版本虽然停在 V100R003C30但存储池、卷、映射、快照这套资源模型在后续版本里基本都是延续的照着这份指南练一遍再迁移到新版本心里不虚。更实际的一点是这份文档把「管理面」和「数据面」拆得很清楚FSM、CVM、VBS、FSA 各自管什么、互相怎么通信目录里都对应着具体章节比在网上翻碎片化帖子靠谱得多。2. 存储资源管理存储池、卷与块客户端的操作链路2.1 存储池扩容、减容、删除三条路径怎么选FusionStorage 的资源管理有个层级关系硬盘聚合进存储池存储池切出卷卷挂载给块客户端。手册把存储池放在资源管理第一节不是没道理的——存储池是容量分配的基本单元所有上层操作都建立在它之上。刚接触的人容易把存储池当成普通 RAID 组来理解其实差异很大RAID 组里硬盘属于同一台存储设备而 FusionStorage 的存储池是跨节点的同一个池里的数据可以分散在不同数据节点的磁盘上依靠多副本保证可靠性。扩容存储池是最常见的动作。业务量上来、剩余容量低于某个水位就往存储池里加硬盘或者加数据节点。加硬盘比较简单新盘被系统识别后在管理界面选择目标存储池执行扩容系统会自动把数据均衡到新盘上。加数据节点则需要先确保节点已经完成系统安装和网络配置再通过管理面纳入集群之后它自带的磁盘才参与存储池扩容。我一般会在扩容完成后观察一段时间数据均衡进度均衡期间 IO 会有所上升但不至于中断业务。需要特别注意的是扩容前要确认新节点的磁盘数量和容量规划别让其中一个节点的盘数过多否则均衡完成后各个节点的容量占比会很悬殊后续再做减容或者故障替换时可选范围就小了。减容存储池是操作风险明显升高的动作。减容的本质是把一部分硬盘或节点从存储池里释放前提是这些盘上的副本数据已经完整迁移到剩余盘上。数据量小的时候几分钟就完成数据量大或者剩余空间紧张时减容会长时间处于「等待数据迁移」状态。这时候不要强行中断任务否则可能出现副本数下降的告警甚至影响业务 IO。我踩过类似的情况当时想快速释放一批故障替换下来的旧盘直接点了减容结果任务跑了一晚上都没结束查了日志才发现剩余盘的空闲空间算上副本余量并不够系统一直在等待。这个操作的正确姿势是先查存储池的容量使用率和剩余空间确认后再执行。删除存储池是三个动作里唯一不可逆的。手册把存储池删除和卷删除都归进高危操作范畴删除前要求卷已经卸载、客户端已断开、数据已确认不需要。我的习惯是删除前先导出一次卷清单和映射关系确认没有遗漏的挂载关系再执行删除。下面这张表可以作为操作前检查的参考操作数据影响前置条件风险等级扩容存储池无新增容量新盘或节点已被系统识别低减容存储池存量数据需完成迁移剩余容量大于已用数据所需副本空间中高删除存储池数据永久删除卷已卸载、客户端已断开、备份已完成高2.2 卷与块客户端从创建到删除的完整生命周期块客户端的定位是「访客」。一台服务器要使用 FusionStorage 的存储能力需要先安装块客户端组件并注册到管理系统系统侧建立客户端的标识和连接信息之后卷才能挂给这个客户端。手册里「创建块客户端」「删除块客户端」两个小节看着简单但操作顺序有讲究创建客户端时要保证客户端节点与 FSM 管理面网络互通删除客户端前要确认该客户端上挂载的所有卷都已经卸载否则会出现数据面连接还挂着、管理面却已经把客户端删掉的中间态。卷的创建参数主要是容量和数量。FusionStorage 的卷单位一般是 GB创建时指定容量大小业务侧看到的就是一块裸盘需要自行格式化文件系统。这里有个容易被忽略的细节创建卷时系统按照配置的副本策略预留空间如果存储池剩余空间不足创建会直接失败。所以规划卷容量时不要只看每个卷的大小要把副本系数也算进去比如 1TB 卷如果默认 2 副本实际占用的池容量就是 2TB。挂载卷是卷生命周期里最关键的一步。在管理界面选中卷再选目标块客户端提交后主机侧重新扫描磁盘就能看到新 LUN。扫描动作在不同操作系统上不一样Linux 下通常用echo 1 /sys/class/scsi_device/xxx/device/rescan来触发Windows 下是「设备管理器—扫描硬件改动」。卸载卷则相反断开客户端与卷的连接数据还在池里重新挂载后又能用。删除卷才真正释放空间删除前系统会检查卷是否仍处于挂载状态未卸载的卷通常不允许直接删除。快照管理在手册里紧跟在卷管理后面。快照是卷在某一个时间点的副本创建快照前建议先把卷上的文件系统刷到一致状态避免恢复出来的数据是崩溃一致而非应用一致。快照的删除时机也要留意如果快照链上有依赖关系删除父快照会导致子快照合并这个过程在后台进行短时间内存储 IO 会升高尽量放到业务低峰期做。2.3 高危操作一览表与执行前检查手册单独列了一节「高危操作一览表」把存储池减容、删除存储池、删除卷、卸载已挂载卷、修改管理 IP、更换证书这类操作集中管理。这张表的价值不只是列出风险等级更在于它强制引入了「变更前检查」的流程意识。我每次执行高危操作前会过一遍四件事备份是否已完成、操作影响面是否已通知业务侧、操作窗口是否在低峰期、是否有人在旁协助盯告警。特别是修改管理 IP 和更换证书这类操作影响的是管理面而非数据面很多人会低估它的影响范围。实际上管理面一旦中断告警、监控、后续变更全部失效相当于整套系统暂时失去可观测性这时候如果数据面出故障很难快速定位。所以这类操作我会选择在夜间窗口执行并且提前准备好回退方案。手册里没有明确写回退方案怎么做但它是运维的基本素养改配置前记录原值改完后验证服务不行就立刻回退。3. 映射与连接iSCSI、启动器与 CHAP 认证的配置顺序3.1 iSCSI 功能什么时候开什么时候用默认链路FusionStorage 默认通过内部私有协议提供块服务iSCSI 是可选功能手册里明确标注了「(可选)配置 iSCSI 功能」。什么时候需要开启它取决于实际的网络与业务架构。如果存储访问都发生在 FusionStorage 集群内部节点之间走默认链路就够了但如果是外部服务器需要通过以太网络访问 FusionStorage 提供的块设备或者存储网络跨越了多个网段、需要与传统 FC/iSCSI 存储网络对接这时候才需要启用 iSCSI。配置 iSCSI 功能时需要指定 iSCSI 服务的监听网口和 IP 地址。常见做法是独立规划一个存储网段专用给 iSCSI 流量不要和管理网络、业务网络混用。混用的后果是性能上,存储流量和业务流量互相挤占带宽安全上,iSCSI 认证一旦配弱存储设备就暴露在更大的网络范围里。手册里给的配置路径是先启用 iSCSI 功能再配置启动器这个顺序不能反过来——启动器是注册到 iSCSI 服务里的服务没开启动器配置无从谈起。3.2 主机、主机组与映射关系的授权层级接触 FusionStorage 的映射管理时很多人会被主机、主机组、启动器、卷映射这几个概念绕晕。理清层级其实很简单主机组是一批主机的集合主机代表一台需要访问存储的服务器启动器是主机上发起 iSCSI 连接的网卡标识卷映射则是把卷授权给主机或主机组。前三个是「身份」最后一个才是「授权」。为什么手册要设计主机组这一层因为实际业务中一个应用集群往往有十几台服务器每台服务器都要访问同一批卷。如果逐台映射映射关系会变得非常冗长后续新增一台服务器还要补一条映射。把服务器先加入主机组再对主机组做卷映射新增节点时只需要把新主机加入组卷的访问权限自动生效。手册里创建主机的步骤要求先建主机组再添加主机就是这个原因。创建映射关系时选择卷、选择主机或主机组提交后卷就对指定主机可见。这里有个容易被忽略的细节解除映射后主机侧需要重新扫描总线卷才会从系统里消失。如果主机侧没有重扫系统里可能还残留着陈旧的设备路径下次再映射同一个卷时盘符顺序可能产生错乱影响数据库等依赖固定设备路径的应用。所以我在做映射变更时一般会先通知业务侧把涉及该卷的应用停掉再解除映射然后在主机侧执行重扫确认卷消失后才算完成。3.3 CHAP 双向认证密码一致性的常见坑CHAP 在 iSCSI 里做的是双向认证不只是服务端验证客户端客户端也会验证服务端。这意味着系统侧和主机侧必须配置同一组用户名和密码并且两边的密码策略要保持一致。FusionStorage 的 CHAP 配置在映射管理章节里单独列出说明它在华为这套体系里不是可有可无的尤其对多租户场景CHAP 是划分存储访问权限的重要手段。实际操作中CHAP 的坑通常出在密码字符上。CHAP 密码对长度和字符有限制有的版本只支持 ASCII 字符如果有人在密码里混入了中文、空格或者其他非 ASCII 字符配置界面可能不报错但发起连接时会认证失败。另外复制粘贴密码时多了一个空格这种错误最隐蔽——肉眼看不出来告警日志里也只是提示认证失败不会告诉你密码哪里不对。解决方法是先把密码写进一个临时文本文件确认字符无误后再粘贴到两端配置界面。密码修改也是个需要注意的时点。CHAP 密码一旦更换所有使用旧密码的已建立连接都会受到影响。手册里的做法是先断开连接再更新密码但实际我们通常是在业务低峰期先在新密码上做好主机侧配置再切换系统侧最后重连验证。顺序反了会直接导致已挂载的卷在主机侧变成不可用状态数据库这类应用可能直接 IO 超时。所以改 CHAP 密码之前先确认业务能否接受一次短暂的连接中断并做好对应的业务侧预案。4. 账号、密码与证书安全维护的四个操作面4.1 账号体系全景门户用户、OS 账户与内部账户FusionStorage 的账号体系可以分四个层面理解手册第 2 章几乎全部在讲这个。第一层是门户用户也就是登录 FusionStorage 管理界面的账号由管理员在用户管理里创建、删除、锁定承担日常配置操作第二层是 FSM/CVM 虚拟机操作系统账户包括 root、dsware、ftp_omm、ftp_dsware 等这些账户直接操作底层操作系统权限很高一般只在故障排查或者系统维护时使用第三层是系统内部账户包括访问数据库的账户、FSM 节点 grub 密码等它们不对管理员直接暴露但一旦密码丢失恢复流程会非常繁琐第四层是对接账户也就是对外提供的 Rest 接口账户供上层平台或第三方系统调用存储能力时使用。这四层账户的密码维护策略是不同的。门户用户密码按常规安全策略走就行定期更换、设置复杂度操作系统账户的密码修改要格外谨慎因为 dsware 这类账户可能被系统服务在后台使用改了密码后服务配置文件里的密码没有同步更新重启服务时就会失败数据库账户和 grub 密码这类内部账户修改失败的影响面是整个 FSM 管理面不可用属于高危操作。手册里有一张「帐户信息一览表」把所有账户的用途、所属层面、修改入口列清楚了实际运维时这张表应该打印出来贴在工位旁边比记在脑子里靠谱得多。4.2 密码策略与密码重置低峰期操作清单密码策略配置是容易被忽略但很实用的一节。手册里给出的可配置项包括密码长度、复杂度要求、有效期、历史密码检查、连续失败锁定阈值等。我给一套存储环境做初始化时一般会建议门户用户密码最少 12 位包含大小写字母、数字和至少一个特殊字符有效期 90 天连续 5 次错误自动锁定账号锁定后需要管理员手动解锁。密码重置操作有个通用原则尽量在业务低峰期做并且要在操作前把相关服务的情况摸清楚。比如修改 FSM/CVM 虚拟机的 root 密码看起来只是改一个系统账号密码实际上如果这台虚拟机上有多个自动化脚本通过 SSH 登录执行任务密码一改这些脚本全部失效。再比如修改 ftp_omm 密码后OMM 相关服务如果还在用旧密码与 FSM 通信会出现服务启动失败或者日志上传中断。所以每次改密码前我都会先把该账户的使用方列一张清单确认哪些服务在引用它改完密码后立刻去验证这些服务的状态。登录超时时间也是安全维护的一部分。管理界面的会话如果长时间不操作服务器会自动登出这个超时时间可以配置。默认值往往偏长如果管理终端所在的位置不够安全建议改短一些比如 15 分钟无操作自动断开降低被人冒用会话的风险。4.3 SSL 证书更换四种场景与重启顺序证书管理是 FusionStorage 运维里最容易被拖到最后一刻才做的事因为平时不显眼但到期之后影响立竿见影。手册把证书更换拆成了几种场景FSM 提供 Web 服务的 SSL 认证证书、OMM 的 SSL 认证证书、FSM 及 API 与 FSA 通信时使用的 SSL 认证证书分基于 FusionSphere OpenStack 和基于 FusionCompute 两种、以及 FSM 与 VBS 的 CHAP 认证传输密钥文件。每种场景对应一条不同的通信链路换错对象或者漏换一个对应的链路就会断。我对证书操作的建议是提前把有效期记录到日历里提前一个月准备新证书。更换证书本身不是难事难在顺序。以 FSM 的 Web 服务证书为例更换完成后要重启 Web 服务进程新证书才会被加载而重启会让管理界面短暂不可用所以要在维护窗口内操作。OMM 证书的更换影响面更大OMM 负责监控和运维管理它跟 FSM 之间有一组双向通信只换一边证书会导致另一边校验失败。FSM 与 FSA 的通信证书分两种部署形态OpenStack 形态和 FusionCompute 形态的配置路径不完全一样事先确认好自己环境属于哪种再按对应章节操作。VBS 的 CHAP 传输密钥文件这个场景经常被漏掉。它不是 HTTPS 证书而是数据面通信的认证密钥在更换之后需要保证 VBS 节点上的密钥文件同步更新否则数据面的 IO 路径会用旧密钥做握手校验直接失败。这类变更不像 Web 证书那样有浏览器的错误提示可以辅助排查出问题时往往表现为数据面 IO 中断但管理面一切正常排查起来更费劲。所以换密钥这类操作我的做法是换完立刻在客户端侧发起一次实际的 IO 读写验证别只看服务状态。5. 避坑与排查FusionStorage 运维中常见的五类问题5.1 存储池减容卡住数据迟迟不迁移现象执行存储池减容后任务长时间停留在「等待数据迁移」状态进度不前进存储池容量也没有变化。查看告警可能出现副本数不足或者容量阈值过高的提示。原因减容释放的磁盘上存有数据副本系统需要把这些副本迁移到剩余磁盘上剩余空间如果不足以容纳这些数据迁移任务就只能等待。很多时候不是系统卡住了而是迁移条件根本未满足。解决先查存储池的总容量、已用容量和剩余容量算清楚减容后剩余磁盘能否容纳现有数据的全部副本。空间不够就先扩容或者在业务侧清理无用卷腾出空间后再执行减容。等迁移真正跑起来后留意数据均衡任务的进度不要在迁移中途反复取消和重试这样反而会拖慢整体进度。5.2 卷挂载后主机侧不可见现象在管理界面上已经把卷挂载给客户端但主机系统里看不到对应的新磁盘设备fdisk -l或磁盘管理器里都没有出现新 LUN。原因挂载动作只完成了系统侧的配置主机侧还需要重新扫描 SCSI 总线才能发现新设备。另外如果是 iSCSI 链路启动器没有正确注册或者 CHAP 认证失败也会让卷在主机侧不可见。解决Linux 下执行echo 1 /sys/class/scsi_device/设备路径/device/rescan或重启 open-iscsi 服务Windows 下在设备管理器里点「扫描硬件改动」。扫描后仍然不可见就去查系统侧的映射关系和 CHAP 配置。排查顺序我一般是先确认映射关系还在再确认 CHAP 用户名密码没问题最后才考虑重扫总线。顺序反了容易白折腾。5.3 修改管理 IP 后告警刷屏现象修改了 FSM 或数据节点的管理 IP 之后管理界面上大量告警弹出节点状态显示异常有些节点甚至显示离线。原因FusionStorage 的管理面和内部通信都依赖 IP 地址地址一旦变更FSM 上登记的节点信息与节点实际 IP 不一致心跳检测失败于是告警风暴出现。如果只改了系统 IP 而没有在管理界面上同步更新节点配置就会出现这种情况。解决修改 IP 前先到管理界面把节点 IP 的登记信息改掉再去操作系统层面改 IP。如果已经出现告警风暴先通过控制台或带外管理方式登录节点确认 IP 是否已经生效然后在管理界面上手动刷新节点状态必要时重新添加节点。这个操作的优先原则是先改管理面配置再改系统配置。5.4 更换 SSL 证书后通信失败现象更换 FSM 的 Web 服务 SSL 证书后浏览器访问管理界面提示证书不受信任或者 API 调用返回 SSL 握手失败更隐蔽的是 OMM 或 FSA 相关通信中断管理界面能打开但监控数据不更新。原因证书更换后 Web 服务没有重启新证书未被加载或者证书链不完整中间证书缺失导致客户端校验失败。OMM/FSA 通信失败则往往是因为只换了一侧的证书另一侧仍然使用旧证书做校验。解决更换证书后按照手册里的顺序重启对应的服务进程然后用openssl s_client -connect 地址:端口检查证书链是否完整。通信类证书要确保通信双方都完成了更新并且证书里包含的域名或 IP 与连接目标一致。如果使用自签名证书还要重新导入信任库否则浏览器会一直报错。5.5 备份文件被静默覆盖现象FSM 数据备份任务一直在执行但某天需要恢复时发现只剩最近一份备份文件之前的历史备份都不见了。备份记录里可以看出备份文件数量没有增长但容量在变化。原因配置的备份文件份数上限太小。手册里专门有一节「配置备份文件份数上限」默认策略是只保留最近 N 份备份文件超出上限的会被自动清理。如果 N 设置成 1那每次备份完成前一份就被覆盖实际等于只有一个恢复点万一这份备份本身有问题就无点可恢复。解决把备份文件份数上限调整到合理值一般建议至少保留 3 份以上覆盖到最近一周的恢复点。同时在备份策略里增加定期导出机制把备份文件复制到第三方存储或异地位置避免 FSM 节点本身故障时备份也跟着丢失。我见过不止一次 FSM 坏了之后发现备份在同一个节点上的情况这种备份等于没有。6. 把运维工具链串起来备份恢复与远程操作习惯6.1 FSM 备份恢复的实操顺序FSM 节点保存了集群配置、账户信息、证书、数据库和操作日志是整个系统的控制面。备份 FSM 数据不复杂但要有固定节奏。我一般每周手动触发一次备份并在备份完成后检查备份文件的大小和生成时间确认任务真的产出了有效文件。恢复场景我虽然不希望遇到但流程要提前演练先确认备份文件可用再保证恢复目标节点的系统版本与备份来源一致最后按手册里的恢复步骤操作。版本不一致是恢复失败最常见的原因。6.2 用 WinSCP 和 PuTTY 打通远程检查链路手册里专门用一节讲 WinSCP 和 PuTTY 的用法说明华为存储运维的现场主力工具就是这两个。WinSCP 用来传日志、导备份PuTTY 用来登录节点执行命令。日常巡检时我习惯用 PuTTY 的plink命令直接在脚本里做远程检查比如这样plink -ssh dswarefsm_ip -pw password df -h; ps -ef | grep fsm | head -20这条命令的含义是通过 SSH 登录到 FSM 节点一次性执行两条指令先看磁盘空间使用情况再查 FSM 相关进程是否在运行。-pw参数用于指定密码但在生产环境不建议明文写在脚本里更安全的做法是先配置公钥认证用密钥登录代替密码登录。公钥认证的步骤是在本地执行ssh-keygen -t rsa生成密钥对将公钥内容追加到 FSM 节点的~/.ssh/authorized_keys文件里之后plink登录就不再需要密码了。从那以后我每次接手一套存储环境都会强制走一遍固定动作先看备份策略和份数上限再看密码策略和账户清单然后检查证书有效期最后把节点 IP 和网络规划记到自己的运维笔记里。这四件事都确认过这套系统才算真正「接得住」。希望帮到你。本文还有配套的精品资源点击获取
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。

↑