
简介博科DCX-4S光纤交换机配置维护升级手册面向企业存储网络工程师系统讲解SAN交换机从硬件认知到上线配置、日常巡检与微码升级的完整方法。压缩包内共1个docx文档约382KB内容以图文对照的章节形式组织涵盖主机箱与FC8-48端口板介绍、串口/网络管理口登录、ZONE配置、配置备份、日常维护命令及微码升级等模块。已有300人学习下载这份文档适合作为数据中心或大型企业SAN环境的一线运维参考。手册对ZONE别名与配置命令、基于FTP/Telnet的配置备份、修改密码与IP配置等细节做了分步说明能帮助读者在实战中快速定位端口状态和日志查询命令降低误操作风险。相比零散的网络帖子完整版把升级前备份、微码升级流程和日常排错串联成体系便于按章节对照操作。 干存储网络运维这些年博科Brocade的光纤交换机几乎成了每个数据中心SAN环境里的标配。刚接触这些设备时面对命令行黑窗口总觉得它们比普通以太网交换机高冷不少尤其当机房里躺着的是DCX-4S这种机箱式导向器Director级别的设备时不少人会习惯先找手册再动手。这篇东西我就围绕DCX-4S从硬件认知、上线配置、日常维护、FOS升级到故障排查把我在实际项目中反复验证过的东西串一遍给初入SAN领域的兄弟铺个路也方便老手查漏补缺。如果你手上正好有一台DCX-4S要上线、要维护或者要升级这篇文章基本能覆盖你90%的日常需求。1. 认识DCX-4S硬件架构与产品定位1.1 核心硬件模块与机箱规格DCX-4S属于博科中端导向器级别的机箱式光纤交换机机箱高度为8U提供4个水平方向的插槽。它和那种固定端口数量的入门级交换机比如Brocade 300、6505这类最大的区别在于端口板卡可插拔、控制模块可冗余、电源和风扇单元全部支持热插拔更换。我经手过的那台DCX-4S出厂默认装了两块CR8-4控制模块CP以及两块独立的交换模块每个交换模块上又根据业务需求插了不同的端口板。端口板型号方面DCX-4S支持FC8系列和FC16系列的板卡比如常见的FC16-4、FC16-8、FC16-32端口速率可以从8Gb/s平滑过渡到16Gb/s。早期的板卡还有4Gb/s的但这类板卡建议尽早淘汰性能和能耗都不占优势。硬件上有一个很容易被忽略的细节DCX-4S的两个控制模块之间是有主备关系的Active CP和Standby CP各自有独立的管理网口和串口。日常维护时你登录的可能是Active CP但在升级固件或者做HA切换测试时Standby CP的状态直接决定了业务是否会中断。所以拿到设备之后第一件事不是急着配Zone而是先搞清楚当前哪块CP是Active哪块是Standby——这个信息用一句话就能查出来switchshow | grep -i cp或者更直接一点进入CLI后用chasisshow查看模块状态也能看到CP的HA状态。DCX-4S还有一个特点双CP之间通过专用的HA链路同步配置和状态数据如果这块链路异常控制模块会一直处于同步失败状态后续升级固件时会非常难受。这个问题后面在升级章节我会再提。1.2 产品定位它到底适合什么场景很多刚入行的朋友分不清导向器Director和普通交换机Switch之间的差异。简单粗暴地理解普通交换机适合接入层而导向器适合做核心或汇聚层。DCX-4S定位就是中小型SAN核心或中等规模数据中心的汇聚层它比入门级交换机更强的地方在三个方面冗余能力双CP、双交换模块、N1电源和风扇任何一个模块故障都不会导致整机瘫痪。扩展能力4个插槽可以灵活混插不同端口密度的板卡比如插2块FC16-32单机就能提供64个16Gb端口。维护性端口板、电源、风扇都能热插拔配合FOS的在线升级能力理论上可以做到业务不中断维护。在实际项目中我见过最常见的一种组网架构两台DCX-4S组成一个核心Fabric每台DCX-4S下挂若干台Brocade 6505作为接入交换机服务器HBA卡接入到接入交换机上存储阵列的前端端口则直连DCX-4S。这样设计的好处是把存储端口的稳定性和接入端的灵活性结合在一起既保证了核心链路的可靠性又不会因为服务器端口数量不够频繁扩容机箱。2. 新设备上线从开箱到跑起业务2.1 串口登录与网络参数配置新交付的DCX-4S默认管理IP是10.77.77.77账密是admin / password。这个默认配置相信很多人背得比自家路由器的密码还熟但正因为太熟了反而容易出事——有人上线半年都没改默认密码等出了安全问题才追悔莫及。所以拿到设备的第一步直接通过串口线连接CP的Console口串口参数为9600-8-N-1登录后第一时间修改密码passwd修改完密码紧接着要配置管理网口的IP地址。博科设备上配置管理IP的命令是ipaddrset交互式输入过程大致如下DCX4S:admin ipaddrset DHCP [OFF]: off Ethernet IP Address [10.77.77.77]: 192.168.10.11 Ethernet Subnetmask [255.0.0.0]: 255.255.255.0 Gateway IP Address [0.0.0.0]: 192.168.10.1 IP address is being changed... Done.配置完成后记得用网线把管理口和办公网或带外管理网连通然后用ping命令验证一下管理IP通不通。这里有个小经验博科的ipaddrset不仅配置以太网管理口还可以配置FC端口的IP地址如果启用了FCIP或FCoE但日常管理我们只需要关心Ethernet IP Address这一段别被后面的交互提示带跑偏了。2.2 硬件健康检查与基本状态确认设备上电、管理IP通完之后别急着往下走先花五分钟做一次全面的硬件体检。检查思路就一条所有能亮的灯都该亮所有该正常的模块都得正常。常用命令如下chassisshow fanshow tempshow psushow switchshow firmwareshowchassisshow会列出机箱序列号、CP状态、交换模块状态、端口板状态。重点是看每一项的状态是否为OK如果出现FAULTY或者DEGRADED先联系硬件厂商不要继续往下配置。fanshow和psushow分别检查风扇和电源DCX-4S机箱默认是N1冗余只要不是同时坏两个以上设备还能继续运行但必须尽快处理。switchshow这个命令值得一提它是博科CLI里出镜率最高的命令。它会展示交换机名称、逻辑交换机状态、端口索引、端口类型、端口状态、连接设备WWN等关键信息。上线之初switchshow可以帮助你确认端口板是否全部被识别端口是否处于No_Module没插光模块或No_Light插了模块但没有光信号状态。2.3 Zone规划与下发Zone是SAN里最核心的概念它决定了哪些服务器HBA端口能访问哪些存储端口。很多人喜欢拿VLAN来类比Zone这个类比不严谨但好在足够直观——Zone就是在FC网络里划出的访问控制边界。普通的以太网交换机不配VLAN会广播风暴而博科交换机不配Zone并不会“风暴”但所有端口会处于同一个默认Zone里表现为所有设备互相都能看到这在生产环境里是绝对不允许的。Zone规划要提前做不要上线了再临时想。我的习惯是在Excel里先列好矩阵行是服务器HBA的WWN或端口号列是存储控制器的端口号交叉点就是一对Zone。规划时要注意每台服务器的每个HBA端口对应一个ZoneZone里至少要包含一个存储端口但建议不要把两个存储控制器端口放进同一个Zone避免一台存储控制器故障时所有链路同时切换造成瞬断。下发Zone的CLI流程通常是这样switchshow alicreate Zone_Srv1_HBA0, 10, 0 alicreate Zone_Srv1_HBA0_Store_A, 10, 0; 20, 0 cfgcreate CFG_PROD, Zone_Srv1_HBA0_Store_A; Zone_Srv1_HBA0_Store_B cfgenable CFG_PROD cfgsave注意一个细节cfgenable只是临时生效cfgsave才会写入永久配置。很多新手配完Zone发现重启后又恢复原样多半就是漏了cfgsave。如果Zone配置出错了可以用cfgdisable禁用当前配置然后修改后再重新下发。还有一个容易踩坑的地方博科设备的端口编号是槽位号,端口号的格式。比如10, 0表示1号槽位端口板上的第0个端口20, 0表示2号槽位端口板上的第0个端口。这个编号规则一定要搞清楚否则你配的Zone会指向错误的物理端口排障时会怀疑人生。3. 日常运行与维护要点3.1 巡检核心指标与频率建议设备上线只是开始日常巡检才是保证SAN稳定运行的关键。我维护过的DCX-4S巡检频率基本按周来做核心指标就四个端口状态、错误计数、温度、电源风扇状态。每周固定的巡检命令集可以固化到运维脚本里输出到文本日志留存备查。switchshow porterrshow sfpshow tempsshow psushow switchstatusshowporterrshow是重中之重它统计每个端口的链路错误计数。需要重点关注的错误类型包括CRC Err、C3 Timeout、Invalid CRC、Link Failures、Signal Loss等。正常情况下CRC错误应该是0偶尔有个位数增长还能接受但如果持续增长或者一次报错达到几十上百基本可以断定是光模块、光纤跳线或者对端设备光口存在问题。sfpshow用来查看光模块的实时光功率、温度、电压通过对比收发功率可以快速判断光纤链路质量是否在正常范围。温度方面DCX-4S的正常工作范围一般是0°C到40°Ctempshow会显示具体数值和阈值。如果看到温度接近上限首先检查机房空调其次检查机箱风扇是否转速异常还可以看看机柜里是不是被其他设备堵住了通风口。设备温度异常通常不是设备本身的问题而是机房环境的问题这个排查顺序要记牢。3.2 端口维护与业务变更操作日常维护中最频繁的操作就是新增业务、下线业务和更换光纤。很多运维习惯直接拔光纤这其实是高风险操作。正确的做法是先在交换机上将对应的端口persistentdisable再拔光纤这样做的好处是避免端口在无光模块状态下产生大量链路错误日志也防止对端设备误发数据到悬空链路上。举个例子下线一台服务器时我会这样操作portdisable 10, 15 portcfgpersistentdisable 10, 15portdisable是临时禁用重启后端口会恢复portcfgpersistentdisable是永久禁用重启后仍然保持禁用状态。这两条命令的区别看似不起眼实际影响很大——如果你只是临时维护用portdisable就够了如果这个端口要长期下线建议两条都执行避免设备重启后端口意外激活导致未知设备接入Fabric。需要恢复端口时反过来操作portcfgpersistentenable 10, 15 portenable 10, 15端口速度设置也是常见需求。如果服务器HBA是16Gb/s但存储端只支持8Gb/s建议把交换机端口速度固定为8Gb/s不要让两端自动协商。博科端口默认是auto negotiate但在生产环境里我一般都会显式设置端口速度省得在链路抖动时出现协商不一致的问题。命令如下portcfgspeed 10, 15 83.3 配置备份与恢复机制配置备份这件事听起来简单做起来也简单但偏偏很多人就是不做直到设备故障需要替换时才发现手里没有配置文件。我个人的习惯是每次任何配置变更完成后立刻做一次完整备份备份文件定期归档到版本管理里。configupload执行configupload后按照提示选择协议FTP、SCP、USB等、输入服务器IP、用户名、密码、目标文件名即可。以FTP为例DCX4S:admin configupload Protocol (scp, ftp, local, usb): ftp Server Name or IP Address: 192.168.10.100 User Name: sanuser File Name: DCX4S.cfg Password: xxxxxx备份文件里包含了Zone配置、Alias配置、交换机名称、端口配置等所有重要参数。恢复配置时使用configdownload但有一个必须强调的坑configdownload会覆盖当前配置执行前务必确认当前配置已备份且恢复的文件版本与当前FOS版本兼容。版本差异太大的配置文件直接恢复轻则丢失部分参数重则导致配置解析失败。4. FOS升级实操版本选择与过程控制4.1 升级前的准备与路径规划固件升级是维护里技术含量最高、风险也最高的操作。DCX-4S的固件称为FOSFabric Operating System版本历史从6.x一直演进到9.x。升级绝对不能跨大版本直接跳路线必须按博科官方建议的路径来。以一台运行FOS v6.4.x的DCX-4S为例正确的路径一般是先升级到v7.4.x再升级到v8.2.x最后如果需要再到v9.x。每一步升级的具体版本号要根据官方兼容矩阵确认我的经验是直接去博科官网下载固件时查看版本说明里面会明确标注前置版本要求。升级前检查清单通常包括这几项firmwareshow确认当前版本firmwarecheck -p检查新固件包与当前版本是否匹配configupload备份配置switchshow和errshow确认当前有无影响升级的错误licenseshow记录所有有效License升级过程中需要确保License不被丢失通知所有业务方明确升级维护窗口有一点特别提醒升级前一定要检查Standby CP的HA状态。在CLI里用hastatus或者查看CP的状态只有Standby CP处于健康同步状态升级才会顺利进行。如果HA状态异常升级过程中可能出现CP切换失败、固件版本不一致的尴尬局面。4.2 执行firmwaredownload的完整步骤升级的基本操作是firmwaredownload这个命令既支持交互式输入也支持命令行带参执行。带参执行更适合脚本化但初次操作我建议用交互式能看到每一步的提示出问题时更容易定位。典型的过程如下DCX4S:admin firmwaredownload Server Name or IP Address: 192.168.10.100 User Name: ftpuser File Name: FOS_v8.2.3c.sh Network Protocol: ftp Password: xxxxxx输入完这些信息后系统会检查固件包、检查HA状态、检查各个模块是否满足升级条件。这一步如果报错会明确提示哪里出了问题。检查通过后系统会询问是否要启用HA升级模式一般选择y。随后固件会先推送到Standby CPStandby CP重启并运行新版本确认无误后再进行CP切换然后Active CP再升级。整个过程大约需要30到60分钟具体时间取决于固件包大小和机箱里的端口板数量。升级过程中需要留意终端输出正常情况下会看到如下的阶段性信息Firmware download in progress...、Starting HA sync...、Switching to Standby CP...、Downloading new firmware to Active CP...等。每一个阶段都有超时机制如果长时间卡在某一步没有进展不要轻易断电先等15分钟如果仍然卡住再联系技术支持或者通过串口查看CP状态。4.3 升级后的验证要点升级完成后不能看一眼firmwareshow显示新版本就宣布任务结束。我一般会在升级后等5分钟等所有模块都稳定运行后依次检查firmwareshow switchshow chasisshow configshow licenseshow porterrshow重点是确认下面几个问题两个CP的版本是否一致都显示新版本号所有端口板是否正常识别端口状态是否恢复成升级前的状态所有Zone、Alias、配置文件是否完整保留License文件是否还在尤其检查Trunking、Fabric Watch、Advanced Performance Monitoring这些功能License是否有新产生的错误日志errshow里不要出现与升级相关的异常记录升级后最容易出现的问题是端口状态没有自动恢复。正常情况下persistentenable的端口重启后会保持启用状态但偶尔也会出现端口卡在No_Light或者Disabled的情况。这个时候用portenable手动启用对应端口再观察是否恢复。另一个值得留意的点是升级后链路协商速率是否有变化。FOS版本升级后端口速率的默认设置可能发生变化如果发现某些16Gb链路协商成了8Gb需要用portcfgspeed重新设置。5. 实战故障排查与避坑记录5.1 经典故障一链路闪断且CRC错误持续增长这是一类在SAN运维里出现频率最高的故障。现象是业务侧间歇性报存储链路断开porterrshow里某个端口的CRC Err不断增长Link Failures计数也有增加。排查思路我从物理层到链路层逐步推进第一步检查光功率。用sfpshow查看收发功率如果接收功率低于出厂阈值优先怀疑光模块、光纤跳线或连接头。FC光模块接收功率在-10dBm左右是正常的如果低于-20dBm链路质量就会明显下降。第二步清洁光纤和光模块端面。注意光模块端面不是用嘴吹、用纸擦就行的要用专用的光纤清洁笔或清洁棒轻轻擦拭后再用显微镜检查端面。第三步更换光模块和跳线做交叉测试。把故障端口的模块换到正常端口测试如果错误跟随模块走说明模块坏了如果错误还在原端口说明是端口板问题。5.2 经典故障二Zone配置正确但服务器看不到存储明明是照着规划配的Zonecfgshow看配置也正确但服务器就是扫不到存储LUN。这种问题十有八九出在端口类型或Device Hidden这类细节上。排查时先检查Zone里端口号和实际物理连接是否一致。很多时候线插在10, 8上但Zone里写的是10, 9两边一对比就穿帮了。如果端口号没有问题再看端口类型是UUniversal还是FFabric还是NNode。常规连接中交换机端口应该显示为U或F如果显示为N说明端口被配置成了N_Port模式这通常是用作FCoE或特殊级联时才会用到的模式。另外还需要检查设备是否被某个DeviceAlias或Default Zone策略隐藏。博科设备支持DefZone配置默认是all还是noaccess会直接影响未划入Zone的设备是否能互相通信。生产环境建议把DefZone设为noaccess避免出现数据安全隐患。5.3 经典故障三FOS升级后部分端口消失升级FOS后偶尔会出现端口板被识别但端口数变少的情况。比如原本32口的板卡升级后switchshow只显示16口。遇到这种情况第一反应是查看chassisshow里端口板的状态如果板卡状态是OK那大概率是新版FOS对板卡型号的识别发生了变化或者板卡的配置文件没有完全加载。解决办法通常是先重启一次端口板不行再重启整个机箱。但重启机箱影响面太大我一般会先检查是不是端口板子固件ASIC Firmware需要单独更新。在FOS升级时系统通常会同时更新板卡的固件偶尔也会出现板卡固件和FOS不配套的情况。这个时间点需要用firmwareshow -b查看板卡固件版本如果发现和主FOS版本不匹配再联系技术支持确认是否需要单独刷板卡固件。5.4 排查工具与日志采集方法真正遇到复杂故障时仅靠几条状态命令远远不够需要采集完整的设备日志。博科设备最重要的一个命令是supportshow它会一次性输出设备所有关键信息包括固件版本、模块状态、端口统计、日志、路由表等堪称一键体检报告。supportshowsupportshow的输出量非常大适合在出问题时保存下来发给厂商技术支持或者自己慢慢分析。另一个常用命令是errshow查看系统错误日志。需要追溯历史事件时可以执行porterrshow和portlogdumpportlogdump能查看指定端口最近一段时间内的所有事件记录对分析瞬断和链路异常非常有帮助。日志采集有一个建议在故障发生后的第一时间执行supportshow和portlogdump因为设备内存日志会滚动覆盖拖得越久关键信息越可能被冲掉。先把现场数据固定下来再慢慢定位问题这是处理生产事故的基本原则。5.5 日常操作避坑清单我把这几年的踩坑经验浓缩成一份清单每次操作前对照一遍能避掉九成的低级失误操作前先备份配置无论改动多小都备份一次。不要在业务高峰期做Zone变更和固件升级哪怕是加了两个Alias这种小改动也可能因为误操作影响正在运行的链路。永远不要同时对两台核心交换机做同样的配置变更。如果第一台做完了出现问题至少还有第二台能兜底。不要用Telnet远程管理设备生产环境务必使用SSH。博科设备默认可能是Telnet和SSH都开放建议只保留SSH服务。光纤拔插前先确认端口是否已禁用否则强制拔插可能对光模块和链路造成损伤。光模块清洁要规范不要用手触摸端面也不要使用普通纸巾擦拭。6. 这些年摸设备的一点个人体会DCX-4S在博科产品线里谈不上多高大上但胜在稳字当头。经手的设备越多越觉得SAN运维和传统网络运维的思维方式有很大不同——传统网络断网了还能靠冗余顶一下SAN链路一旦出问题存储卷直接不可用影响的就是数据库、核心业务和一堆人的加班。所以我对所有操作的第一原则都是能不动就不动必须动就准备充分再动。第二原则是对物理层保持敬畏绝大部分诡异故障最后都能追溯到一根脏了的光纤或者一个衰减超标的光模块先查物理层再查配置层这个顺序能省下大量时间。最后分享一个我坚持到今天的习惯每次进机房升级或配置前一定先把configupload导出来放到本地电脑再把Console线插好放在机柜边上宁可多花十分钟准备也别让业务在关键时刻陪跑。本文还有配套的精品资源点击获取