一台HP MSA 2050磁盘阵列,从纸箱里拆出来到两台主机都能正常读写,正常情况半天就能搞定。但如果没搞清它的管理口逻辑、盘位规则和主机映射关系,卡上两三天也是常事。我去年给客户部署过一台MSA 2050,当时固件版本比较老,光第一个管理IP就折腾了一个多小时。这篇文章把我完整梳理出来的配置步骤和踩坑点写出来,按这个顺序走,基本能一次过。如果你正准备上手HP MSA 2050,或者听到“服务器磁盘阵列怎么做”这类问题时想去自己试一遍,这篇内容应该能帮你节省大量时间。
1. 拿到一台MSA 2050,先别急着上架
1.1 认识控制器的接口和指示灯
MSA 2050有两种常见形态:2U12盘位的大盘(LFF)和2U24盘位的小盘(SFF)。无论哪种,后背板核心就是两个可插拔控制器,通常左边是控制器A,右边是控制器B,电源模块在外侧。我见过不少人把控制器后面的管理口和业务口搞混,其实只要认准“MGMT”标识,基本不会错。每个控制器上至少有一个RJ45管理口、一个串口(一般是Mini-USB或Micro-USB形态,包装里会附带转接线)、若干个FC或iSCSI业务口,以及一个用于扩展柜的SAS口。
指示灯方面,绿色表示正常,琥珀色闪烁一般是有故障或正在同步。开机时先留意控制器上的“Health”和“Power”灯,别急着进配置界面。如果某一侧控制器报错,后续固件升级和卷映射都可能受影响。我曾经遇到一台设备,控制器B的“Health”灯慢闪琥珀色,进SMU一查是缓存模块未同步,重新插拔后才恢复。硬件层面确认正常,再做软件配置才稳妥。
1.2 规划管理IP和业务网络
这一步特别重要。MSA 2050有两个控制器,每个控制器都要有独立的管理IP,而且管理网络尽量与业务网段分开。管理口默认情况下可能处于DHCP自动获取状态,也可能有一个固件版本相关的默认地址,所以上架前先想好两个管理IP、子网掩码和网关。业务网络根据你用的连接方式规划:FC环境要记好交换机Zone,iSCSI环境要预留专门的VLAN和网关,不要让存储管理流量和业务流量混在一起。
我的习惯是管理网单独用一个VLAN,PC直连交换机管理口,再通过管理PC访问SMU。这样排查问题的时候不会被业务流量干扰。另外,管理PC的IP地址建议手动设置成与存储管理IP同网段的静态地址,不要依赖DHCP。很多“连不上管理口”的问题,本质上就是管理PC的IP没对应上,而不是设备坏了。
1.3 确认固件版本和功能许可
MSA 2050的许可证相对开放,但不同固件版本对功能和界面布局影响很大。见过一台出厂很老的固件,登录后连界面模块都不完整。建议在浏览器进入SMU后,先到“系统状态”或“About”里记录当前固件版本,再到官网对照是否需要升级。配置之前升级固件,比配置完成后再升级要省事得多,因为升级过程可能会重启控制器,卷映射等配置虽然一般保留,但生产环境下尽量避免临场升级。
除固件外,还要确认快照、卷复制等功能是否已经包含在许可内。MSA 2050通常出厂已经带基础许可,但有些渠道设备可能会被限制,最好在SMU的“License”页面核实一下。如果功能缺失,后续业务要开快照时再补齐许可会很被动。
2. 硬件部署与控制器初始化
2.1 硬盘盘位安装顺序和注意事项
磁盘阵列的盘位安装不完全是随便插的。MSA 2050正面盘位有编号,建议从最小编号开始安装,同时尽量保证同一磁盘组内的硬盘型号、容量和转速一致。混合不同容量时,磁盘组会以最小容量计算可用空间,后面换盘也可能出现容量不匹配的问题。另外,所有硬盘在通电前装好,比开机后再热插拔要稳妥。
硬盘托架上的锁扣要扣到位,按压完全进入后再锁闭,别图省事只按半边,运行中振动会导致硬盘被识别为“缺失”。对于24个小盘位的机型,盘位分布对散热影响不小,有条件的话尽量均匀分布,避免局部过热。我见过客户为了整理线缆,把后排几个盘位空着,所有业务数据都集中在前排,结果连续报警硬盘温度过高。
2.2 首次登录:串口CLI还是Web初始化向导
MSA 2050首次配置有两种路径:串口CLI和Web初始化向导。我推荐用串口CLI做第一次管理IP配置,原因是管理口默认IP不稳定,而串口从启动阶段就能看到完整日志。用配置线连接控制器的串口到笔记本,使用终端软件连接,波特率一般是115200,数据位8,停止位1,无校验。接通电源后终端上会出现启动信息,进入CLI菜单后,选择网络配置相关项,设置控制器A和控制器B的管理IP、掩码和网关。
设置完成后,用网线把PC的网口调到同一网段,浏览器访问管理IP就能进入SMU。如果你没有串口线,也可以尝试把管理口接入DHCP环境,从DHCP服务器租约记录里查地址,但这种方法在复杂网络里明显没有串口高效。串口线还是建议常备一根,存储设备维护时作用非常大。
2.3 为控制器设置静态管理地址
配置管理地址时,两个控制器最好分别设置,不要只配置一个。SMU里也能修改,但首次用CLI更直接。CLI菜单层级需要对照固件提示操作,通常会有“Network Configuration”或“Management Port”选项。单一控制器配置完成后,另一个控制器会自动处于未配置状态,如果你想让两个控制器都走管理网络,务必在配置完A后,切到B控制器的串口再执行一遍相同设置。
很多人在这一步漏了另一个控制器,结果一台存储有一半管理功能不可用。设置完成后,可以做一次ping测试,确认管理PC与两个管理IP都通。从这之后,我习惯把两个管理IP直接写入机柜标签和运维文档,省得下次回访时满世界找IP。
2.4 初始化SMU后台的基本选项
第一次进入SMU,界面会启动一个初始化向导,要求设置管理员密码、系统名称、日期时间和NTP服务器。日期时间如果不对,日志排序会让人崩溃,快照策略和复制任务的调度也会受影响。所以别跳过去。系统名称建议用能体现机房位置或业务用途的,比如“SAN-ROOM-A-01”,后面卷命名也能更规范。
NTP建议直接配置公司内部NTP服务器,若没有,也可以用公开的NTP服务器,但注意存储管理网是否能出外网。初始化向导结束后,SMU首页会显示两个控制器状态,应该都是“Optimal”。如果显示其他状态,先别继续,回到硬件和日志页面排查完再走下一步。
3. 磁盘组与卷的创建,核心步骤
3.1 RAID级别选择与容量计算
MSA 2050支持RAID 0/1/5/6/10,也支持动态存储池(根据固件版本不同有差异)。选择RAID级别时,我通常会问自己一个问题:这块存储上放的数据丢了能不能承受?不能承受就至少RAID 1或RAID 10;追求容量利用率就RAID 5;盘多且故障容忍要求高就RAID 6。容量计算方法很简单:RAID 1可用容量等于单盘容量,也可以理解为总容量的一半;RAID 5可用容量等于盘数减一块盘的容量;RAID 6是减两块;RAID 10是总容量的一半。
下面这个表可以直接用来做选型参考:
| RAID级别 | 最少盘数 | 可用容量 | 容错能力 | 典型场景 |
|---|---|---|---|---|
| RAID 1 | 2 | 总容量的一半 | 最多坏1块 | 系统盘、重要小容量数据 |
| RAID 5 | 3 | (N-1)×单盘容量 | 最多坏1块 | 常规业务数据 |
| RAID 6 | 4 | (N-2)×单盘容量 | 最多坏2块 | 大容量、高可靠场景 |
| RAID 10 | 4 | 总容量的一半 | 每个镜像组坏1块 | 数据库、高随机IO |
举个例子,8块1.2TB硬盘做RAID 5,可用容量大约是8.4TB(按1.2TB计算,实际格式化后会有差异),RAID 10则只有4.8TB。如果还要额外设置热备盘,可用容量再减一块。热备盘的价值在于自动顶替故障盘,减少人工等待时间,建议至少配一块。
3.2 创建磁盘组/存储池时如何选盘
在SMU的“Storage”菜单下创建磁盘组(部分固件叫存储池),界面会列出所有未分配硬盘。这时候要小心:不是把所有硬盘一股脑加进去就行。如果一个磁盘组混了10K和7.2K转速的盘,性能会以慢盘为基准;如果混了不同容量,大容量盘的空间会被浪费。所以创建前,在磁盘列表里检查每块盘的容量、转速和固件版本,必要时分成两组或三组。
另外,MSA 2050界面里通常会有“动态池”和“传统磁盘组”两个方向。动态池的优势是扩容灵活、重建时间短,传统磁盘组的兼容性和管理习惯更成熟。我个人的建议是:如果是虚拟化环境,动态池体验更好;如果是传统数据库裸设备映射,用RAID 10磁盘组更直观。磁盘组创建后系统会执行初始化,这期间硬盘灯会频繁闪烁,属于正常现象。初始化时间与硬盘数量和容量有关,大容量盘动辄几小时,不要在初始化期间反复开关机。
3.3 创建卷与逻辑单元号分配
磁盘组创建好后,接下来是创建卷(Volume)。卷建在磁盘组之上,对应主机看到的LUN。卷名建议使用“用途-主机-序号”的方式,比如“DB-SQL01-01”,这样在映射多个主机时不会乱。创建卷时要设置容量和逻辑单元属性,容量可以小于磁盘组剩余容量,后面还可以扩展。块大小默认即可,除非有特殊应用要求。
一个常见误区是以为每个卷都要用满磁盘组所有空间,其实按需分配更灵活。MSA 2050支持精简配置(Thin Provisioning),但我个人在生产库上倾向用厚配置,空间规划透明,后续监控也简单。精简配置更适合虚拟化场景,因为多台虚机共享存储池,写多少占多少,容量规划得当的话可以提升资源利用率,但一定要开启告警,防止前端无感知写满空间导致整池只读。
3.4 主机与卷的映射关系设置
卷创建完不会自动出现在主机上,必须做映射。映射的本质是定义一个主机(Host),把主机的HBA卡WWN或iSCSI发起程序的IQN加进去,然后把卷(LUN)授权给这个主机。在SMU里进入“Hosts”或“Mapping”页面,先创建主机项,填上主机别名和操作系统类型,再添加WWN/IQN。添加WWN时不要把空格或冒号弄错,iSCSI的IQN要完整复制,少一个字符都识别不了。
映射时同样选择目标主机和要分配的卷,注意同一卷不能同时映射给多个非集群主机,否则文件系统会出问题。如果你确实需要让多台主机共享一个LUN,应该走集群文件系统或专用共享存储软件,而不是直接把裸LUN分配给多台非集群主机。完成后SMU里能看到映射关系,主机端重启扫描才能看到LUN。第一次做的人容易在主机端反复找不到盘,这时不要急着重复扫描,先回SMU确认映射关系是不是真的生效了。
4. 主机端连接:让系统认出LUN
4.1 FC交换机Zone配置与WWN核对
如果你是FC环境,存储端和主机端都通过光纤交换机连接。配置Zone时,我习惯用WWN别名(Alias)来配置,而不是直接用端口号,因为端口可能被拔插但WWN是固定的。先分别记录存储控制器FC端口WWN和主机HBA卡的WWN,然后进交换机配置Zone,把每个主机的HBA和它要访问的存储控制器FC端口放到同一个Zone里。
这里有一个特别容易踩的坑:MSA 2050双控制器下,主机最好同时连到两个控制器的FC端口,这样才具备故障切换基础。如果只映射到控制器A而不映射控制器B,控制器A故障后你还要手动改配置,达不到高可用。Zone配置完成后,在主机上通过HBA卡管理工具或系统命令可以看到存储端WWN,但LUN还要等存储映射和主机扫描之后出现。
4.2 使用iSCSI连接MSA 2050
iSCSI连接相对简单。在MSA 2050上提前为控制器配置好iSCSI端口的IP地址,创建主机时用的是主机的IQN而不是WWN。Windows下控制面板打开“iSCSI发起程序”,会看到本机IQN,复制到一个记事本;Linux下一般在“/etc/iscsi/initiatorname.iscsi”文件里。存储端把IQN加入主机后,再到主机发起程序“目标”页面上输入MSA 2050的iSCSI端口IP,点击连接,就能发现已映射的卷。
如果目标显示不活跃,检查双方端口是否在同一网段、防火墙是否放行3260端口。iSCSI的MTU建议在交换机和网卡上同时开启巨型帧(Jumbo Frame),否则网络性能上不去,但要注意所有转发路径都要支持,一条链路不支持就会产生分片。还有一个细节:iSCSI的CHAP认证虽然好,但如果两边配置了不同的用户名或密钥,连接会报“登录失败”,这类问题按日志排查比在界面上反复试要快得多。
4.3 Windows主机启用MPIO多路径
Windows服务器第一次发现存储时,往往会看到同一个卷在磁盘管理里出现两次,这是因为两条路径分别被识别成了两个设备,必须先启用MPIO。在“服务器管理器”里添加“多路径I/O”功能,然后打开MPIO控制台,在“发现多路径”页签勾选“添加对iSCSI设备的支持”或“添加对SAS设备的支持”。如果是FC设备就勾选“添加其他设备支持”,并填写MSA 2050对应的设备硬件ID。
有些情况下需要重启多次。配置完成后,磁盘管理里会只出现一个盘,在MPIO控制台可以看到两条或四条路径,建议把负载均衡策略设置为“循环”或“最少队列深度”。存储端务必确认所有路径映射到同一个LUN,否则MBR/GPT会出错。我遇到过一次重启后MPIO策略自动变回“故障转移”,导致某条路径上IO全部阻塞,后来改成“循环”策略并在注册表里固定下来才稳定。
4.4 Linux主机multipath配置
Linux下配置多路径,用默认的device-mapper-multipath也能识别,但建议写一个干净的multipath.conf。配置文件里重点是alias命名、path_grouping_policy和failback设置。以下是我常用的一个基础配置示例:
defaults { user_friendly_names yes path_grouping_policy multibus failback immediate } blacklist { devnode "^(ram|raw|loop|fd|sr|scd|st)[0-9]*" } multipaths { multipath { wwid "3600c0ff000xxxxxxxxxxxxxxxxxxxx" alias data01 } }wwid可以在系统里通过“multipath -ll”或“scsi_id”查到,alias最好手动固定,不然重开机后设备名容易漂移。配置好后,多路径设备通常出现在“/dev/mapper/”下,像“mpatha”或你自定义的“data01”。注意分区时用“parted”或“fdisk”对“/dev/mapper/xxx”操作,而不是对单个sdX操作。每次重启后路径重新探测,如果发现设备名变了,说明没有固定alias,要在配置里绑定wwid。
5. 配置中常见的坑与排查实录
5.1 管理口连不上、SMU页面打不开
这问题排第一。最常见的原因,一是管理PC和存储管理IP不在同一网段,二是浏览器访问了错误IP,三是管理口接了但网线或交换机端口没启用。排查顺序建议这样:先用串口登录CLI确认两个控制器的管理IP配置;再用“ping管理IP”测试三层连通;如果通了但页面打不开,检查浏览器是否用了代理,SMU建议用Chrome或Edge,禁用代理后刷新。
如果ping不通,在CLI里看看管理口是否down,可能你插的是业务口。另外,部分固件默认启用了“管理端口自动协商”,但如果PC网口是千兆,交换机端口被强制百兆,同样会出问题。我个人踩过的坑是串口线没插紧,终端软件界面全黑,差点以为控制器挂了。这里也放一张速查表,方便后面直接对照:
| 现象 | 常见原因 | 处理建议 |
|---|---|---|
| 管理口ping不通 | 网段不对、管理口插错、IP未生效 | 串口登录CLI查IP,换网口或直连 |
| SMU页面打不开 | 浏览器代理、页面缓存、固件兼容 | 禁用代理,换浏览器清理缓存 |
| 串口无输出 | 线材没插紧、波特率不对、终端软件配置错 | 重新插拔,核对115200/8N1 |
| 控制器状态异常 | 缓存未同步、电源异常、固件不匹配 | 查看事件日志,重新插拔缓存或电源 |
5.2 硬盘状态一直不是Optimal
新装阵列或更换硬盘后,SMU里硬盘状态偶尔会停在“Unassigned”或“Predictive Failure”。“Unassigned”表示这块盘还没被加入任何磁盘组或热备池,属于正常,只要在创建磁盘组时选中即可。“Predictive Failure”说明硬盘预测到故障,强烈建议尽快更换。
还有一种情况是硬盘固件版本不一致,MSA 2050会自动尝试做固件同步,但如果盘型号跨系列,可能一直显示不匹配,这时只能选同一型号的盘替换。磁盘组重建时,千万不要人为重启控制器或拔盘,RAID5/6重建期间对硬盘访问压力大,速度慢是正常的,多留意事件日志即可。另外,热备盘触发后,SMU主页会持续显示“Rebuilding”,这个过程也是正常状态,不要以为存储坏了。
5.3 主机已映射却看不到盘
这类问题多见于FC或iSCSI映射后主机侧无反应。先别急着反复扫描,按顺序检查:存储端映射是否生效(SMU能看到“Mapped”状态)、主机HBA是否在线、交换机Zone是否包含两端WWN、主机端的WWN/IQN是否和存储端录入的一致。Windows下在“设备管理器”里扫描硬件更改;Linux下执行命令重新扫描“/sys/class/scsi_host/”下的每个host。
如果扫描后还是没有盘,最常见的是Zone把主机和存储控制器B配在一起,但映射时只映射到了控制器A,路径不对称,导致所有IO走到一个控制器。正确做法是让每个控制器至少有一条可达路径。你可以在SMU里修改映射,也可以把Zone补全,总之路径对称是后面所有高可用操作的基础。
5.4 控制器故障切换验证的方法
配置完双控制器并且主机多路径生效后,我建议做一次故障切换验证,不要等到真出问题再反映。具体做法可以选在生产低峰期,拔掉一台控制器的电源或强制控制器B重启,然后观察主机端多路径路径是否下降、应用是否中断。SMU里事件日志会记录控制器重启,过几分钟后控制器重新上线,多路径恢复。
如果此时应用卡顿,重点检查多路径策略、LUN所有权设置和FC/iSCSI连接是否均衡。我就是在这个环节发现过某个LUN的所有权一直固定在控制器A,控制器A重启后IO全部需要跨到控制器B,延迟变高,后来通过设置LUN所有权偏向和负载均衡解决了。故障切换验证做完,存储配置才算真正可以交到业务手上。
6. 使用与维护中的几点建议
6.1 定期配置备份与固件升级
MSA 2050的SMU界面里有配置备份功能,会把当前所有磁盘组、卷、映射、用户等信息导出成一个文件。我习惯在每次改动配置前备份一次,固件升级前也必做。配置文件放本地还不行,最好同步到公司IT文档库里。文件不大,但恢复一个复杂映射关系时能省很多事。
固件升级时先下载对应版本的升级包,在SMU的“Maintenance”里上传,过程会重启控制器。升级顺序上,建议在官方文档里查看是否要先升级到中间版本,不要从很老的版本直接跳最新版本。切记现场没有备件、没有变更窗口时就别动固件,存储设备稳定压倒一切。升级完成后记得再备份一次配置,因为新固件可能对配置文件格式做了升级。
6.2 日志监控和硬盘预测性故障处理
SMU首页的事件日志能看七天内的事件,建议每隔几天翻一次,重点关注“Predictive Failure”和“Battery Failure”这类关键词。MSA控制器的缓存电池如果出问题,系统会警告,长时间不处理可能切换为直写模式,性能下降明显。硬盘一旦出现预测性故障,SMU会提示建议更换,不要抱有侥幸心理。
更换硬盘时,热备盘会自动顶替并开始重建,热备盘本身也可以定期更换。如果条件允许,在存储端开启邮件告警,SMU里配置SMTP服务器,事件能直接发到运维邮箱,这是最省心的一条。配置SMTP时注意填写正确的发件人地址和认证信息,不然告警邮件发不出去,比没配置还误导人。
6.3 后续还可以扩展什么
MSA 2050不只是做RAID和LUN映射,它还内置快照、卷复制和远程复制。快照功能在做备份测试和误删除恢复时非常有用,我通常给重要卷每小时拍一次快照。卷复制适合把生产卷克隆到另一台机器做验证。远程复制则需要两台MSA设备,通过网络做异步复制。
这些功能在SMU里都有对应入口,配置思路和卷映射类似。如果你前面已经把磁盘组、卷、主机映射这三个环节跑通,后面的扩展其实没有太多新东西。最后再提一个我自己的习惯:交付时一定在机柜上贴一张标签,写上管理IP、控制器A/B的WWN和iSCSI IP,再把SMU备份导出一份。这套配置步骤看似基础,但基础打牢了,后面做快照、复制、容灾都不会抓瞎。