ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

NetApp FAS8300集群初始化与NFS/SMB/iSCSI接入实践

NetApp FAS8300集群初始化与NFS/SMB/iSCSI接入实践 简介围绕NetApp FAS8300存储设备的部署实施这份PDF手册为存储工程师和系统管理员提供了从初始化到多协议访问的完整路径既适合初次配置FAS系列的新手也可作为标准化安装流程的参考。重点涵盖集群创建、节点加入、aggr与卷/LUN配置以及NFS、CIFS、SAN环境的搭建步骤。整包仅1个PDF文件大小551KB按安装实施报告结构编排目录模块清晰可快速定位到对应配置环节。当前已有36人学习下载。内容从设备配置信息开始逐步演示创建集群、查看集群状态、配置SP远程控制、时间设置与HA冗余存储侧则包括磁盘AGGR划分、SVM创建、网络接口广播域及地址路由配置最后落实到卷和LUN创建并附NFS/CIFS访问配置、SAN主机组操作等方案。各章节均含参数示例与操作顺序能帮助读者对照完成安装验收报告减少现场排错和反复查阅资料的时间尤其适合在数据中心交付场景中直接参考。1. 开箱的FAS8300不是即插即用上来先谈集群初始化大多数项目里把NetApp FAS8300到货后直接推上机架、插上两根万兆光口就以为存储上线了。真正干过现场的人都清楚FAS8300是按“双控HA对”形态交付的上电后默认只有一个空壳ONTAP两个控制器要么没互联、要么没建集群SVM、聚合、卷、共享全部是空的。第一次开机连管理IP都ping不通是常态因为节点管理口地址也还没配。这篇就是按我实际装机时走的流程把FAS8300从硬件上架、堆叠接线、集群初始化、聚合与卷创建再到NFS、SMB、iSCSI三方接入的完整路径写清楚。适合的对象是存储交付工程师、系统集成商实施人员以及公司里第一次接手NetApp又没人带的运维。别被“存储安装手册”这几个字骗了它真正的门槛不在拆箱而在集群规划和协议接入那几步。2. 硬件上架与堆叠接线FAS8300双控互联的现场准备FAS8300这种双节点一体机最怕的不是控制器故障而是安装阶段把HA互联线插错位置。两条堆叠线分别负责集群互连和HA心跳一旦插反后面前端业务再顺节点间也会互相报partner down。我见过新装机在机房里来回拔插网线搞了一个小时最后发现只是交换机端口up但cluster端口角色没对。硬件部分花十分钟慢慢核对比后面省一天时间。2.1 机架安装与供电检查FAS8300出厂自带导轨套件一般按标准19英寸机柜安装即可。先确认机柜前后深度够不够别先把设备推到位才发现前面板门关不上。散热方向是从前向后抽风所以机柜前后都要留出至少10厘米以上的通道如果机柜里有其他高功耗设备优先把FAS8300放在偏下位置避免热风倒灌。供电上重点看两点一是两个节点的电源模块是否分别接到不同PDU控制器A和控制器B的电源不能挂在同一路空开下否则一路跳闸就双控全挂二是机房接地要做实存储设备对地线虚接很敏感部分难排查的间歇性IO报错最后都追溯到接地。建议装机时用手持万用表确认PDU输出电压在额定范围以内再插线。常见做法是先接控制器B的电源再接控制器A方便观察启动顺序。2.2 HA对之间的堆叠线缆端口角色对照双控互联一般需要两条链路一条走cluster端口做集群通信一条走HA端口做心跳。结构上会看到每块控制器面板上有若干10GbE/25GbE端口别忘了还有板载管理口。现场最容易翻车的是只看端口编号不看端口角色把数据口拿来做了集群互联结果业务网口不够用。端口类型常用端口位置作用互联对象Cluster端口控制器尾部标注cluster的10G口节点间RDMA/集群RPC对端cluster端口HA端口控制器背板独立HA口心跳、缓存镜像对端HA端口管理口板载1GbE管理口带外管理、初始化管理交换机数据口前面板10G/25G/40G口NFS/SMB/iSCSI业务业务交换机插线规则是“同名端口对连”集群口接对端集群口HA口接对端HA口。不要交叉接成A节点cluster口对B节点HA口这样两个节点永远组不成HA对。线缆类型按端口速率选常见用光模块加光纤或AOC线少用铜缆跨机柜距离稍远就丢光。上电之前打开设备面板核对两个节点的端口角色灯再动手。2.3 管理口IP与初始网络规划初始化之前先做一张规划表管理口IP、集群网络、业务VLAN分开写。NetApp要求管理口和集群口都是独立网段不能跟业务网混在一起。常见做法是规划出一个专门的存储管理网段如192.168.100.0/24给两个节点管理口和集群管理IP各分一个地址。业务数据网段单独规划。对象示例IP网关备注node1管理口192.168.100.11192.168.100.1带外管理node2管理口192.168.100.12192.168.100.1带外管理集群管理IP192.168.100.10192.168.100.1用于SSH/System Manager数据LIF网段192.168.20.0/24192.168.20.1业务网络iSCSI网段192.168.30.0/24192.168.30.1可复用数据网段DNS和NTP也要列入初始化参数尤其NTPONTAP很多认证和日志时间戳依赖它现场忘了配后面补也不麻烦但会让排查乱掉。NTP服务器用公司内部时间源即可不要把公网时间服务器写进去存储出不了外网时会一直报时间偏差。2.4 串口进入system node setup做节点初始化首次上电后接串口线波特率默认115200进入控制台后系统会提示进行系统配置。如果使用命令行初始化第一台节点执行FAS8300 system node setup然后按向导依次设置管理口IP、子网掩码、默认网关、DNS、NTP。完成这一步后节点还只是一个独立孤岛要把两个节点凑成一对必须创建集群。在第一台节点的CLI里继续执行::* cluster create -cluster fas8300-cl -node node1 -privilege admin -autoassign这里-cluster指定集群名称-node写当前节点名-autoassign让系统自动为集群管理LIF分配IP。接着到第二台节点串口执行::* cluster add -cluster fas8300-cl -node node2 -privilege admin第二台会提示输入集群管理IP和管理员账号确认后自动加入。命令里的-privilege admin表示以管理员权限执行如果嫌每次交互麻烦也可以在system node setup时提前把node2的集群管理地址也配好。集群创建完成后用cluster show确认两个节点状态为true/true再继续后面的聚合与卷配置。到这一步FAS8300才真正从两台独立机器变成一个可用存储集群。3. 从空集群到第一个可读写卷聚合、SVM与卷的参数选择集群建好只是框架真正给业务用还得把物理磁盘变成聚合再在聚合上切卷。这一步最常见的问题是把SVM、聚合、卷三层关系搞混导致建了卷却挂不上共享路径。理解顺序应该是物理磁盘组成聚合聚合上划卷卷通过SVM的LIF对外提供服务。谁先谁后错了配置就绕圈子。3.1 集群创建与节点加入CLI还是System Manager刚开始接触FAS8300的人习惯打开System Manager图形界面点来点去我一般建议第一轮配置走CLI。原因很简单System Manager要等集群管理IP起来之后才可用而新装机时IP通不通本身就是未知数CLI通过串口在任何阶段都能操作。等聚合和SVM都建好再用System Manager做监控和后续日常维护界面看容量、告警更直观。如果是已经完成硬件初始化、只差聚合的机器可以直接在CLI里查看节点与磁盘状态::* cluster show ::* disk show -owner node1cluster show确认HA对状态disk show能看到每块盘owner归属。如果磁盘全部显示spare说明还没有聚合可以继续往下建。这里也顺带提一句FAS8300出厂盘位序列和owner不是绝对一对一最好在disk show里确认盘位号避免后续创建聚合时报盘数量不够。3.2 聚合创建raid_dp、磁盘数与热备盘聚合是FAS8300所有卷的载体。创建聚合最关键的是raid类型和盘数。NetApp默认推荐raid_dp相当于双盘冗余允许同时坏两块盘不丢数据。这比raid5单盘冗余更稳现场只要盘数够我都用raid_dp。创建命令::* storage aggregate create -aggregate aggr1 -diskcount 11 -raidtype raid_dp-aggregate指定聚合名-diskcount指定参与聚合的磁盘数量-raidtype指定raid_dp。11块盘是常见起步盘数其中8到9块作为数据盘2块作为校验盘剩余部分作为热备。注意-diskcount并不包含热备盘数量系统会优先从spare盘里按raid类型要求扣掉校验盘。如果现场盘少比如只有9块盘raid_dp也能建但可用容量和冗余度都要打折。创建完后用storage aggregate show -aggregate aggr1确认状态为online再往下走。热备盘这件事很多人忽略。装完聚合之后要主动确认还有剩余spare盘否则坏盘时没有盘可以顶替重构。查看方法::* storage aggregate show -aggregate aggr1 ::* disk show -state spare如果spare为0建议在一开始建聚合时就少放一两块盘进去保证全阵列至少保留一块全局热备。这也是“装完就放心用”和“装完就埋雷”之间的差别。3.3 SVM、数据LIF与卷的三层挂载关系聚合有了接下来是SVM。SVM是NetApp的逻辑分区单元可以理解成一个独立的NAS“虚拟设备”每个SVM有自己的数据LIF、NFS/SMB服务、导出策略。在FAS8300上建立一个SVM::* vserver create -vserver svm01 -subtype default -rootvolume vol0 -aggregate aggr1 -rootvolume-security-style unix-vserver是SVM名字-rootvolume指定根卷-aggregate指定根卷所在聚合-rootvolume-security-style设置权限风格Linux环境用unixWindows环境用ntfs。SVM建好之后要给它配数据LIF也就是对外提供服务的IP::* network interface create -vserver svm01 -lif lif_nfs1 -role data -data-protocol nfs -home-node node1 -home-port e0c -address 192.168.20.10 -netmask 255.255.255.0-home-node和-home-port指定LIF主用节点和端口-address是业务IP必须是之前规划好的数据网段地址。LIF建完用network interface show看状态是否up。很多新手在这里漏掉LIF导致卷建好后客户端永远连不上IP回头查半天才发愁。卷的创建放到SVM和LIF之后::* volume create -vserver svm01 -volume vol_data -aggregate aggr1 -size 2t -space-guarantee none -snapshot-policy default -percent-snapshot-space 5-space-guarantee none表示精简置备按实际写入增长占用容量适合大部分场景-snapshot-policy default启用默认快照策略-percent-snapshot-space 5预留5%空间给快照。之后给卷指定挂载路径::* volume mount -vserver svm01 -volume vol_data -junction-path /vol_data这个junction-path就是客户端看到的共享路径。在创建卷时如果没指定-junction-path默认不会自动挂载后面手动mount即可。3.4 卷容量参数精简置备、快照预留与存储大小验证卷配置里最容易纠结的是“存储大小”到底要不要厚置备。厚置备-space-guarantee file在建卷时就把空间全部锁定好处是后续不会出现聚合空间不足坏处是容量利用率低。FAS8300一般面向虚拟化和NAS场景我默认用精简置备通过容量报警来控制风险。精简置备下聚合剩余空间要保留15%以上的水位告警别把聚合塞到96%以上否则全局性能会明显劣化。快照预留单独提醒一下默认快照策略会在每个卷里留存按时间递增的快照副本。如果业务是Oracle数据库这类高频写场景快照增长会吃掉大量空间-percent-snapshot-space建议直接从5调到10并设置快照报警阈值。验证卷是否对外可用可用::* volume show -vserver svm01 -volume vol_data ::* df -h第一条看卷状态第二条看聚合和卷的容量使用率。看到状态online、容量正常即可进入协议接入阶段。4. 对外提供服务的落地配置NFS、SMB与iSCSI的数据接入到这里FAS8300已经有“存储”的样子了但还没“接上业务”。生产环境最常见的接入方式三种Linux用NFS、Windows用SMB、虚拟化平台用iSCSI。三者的配置入口完全不同很多人在这一步才开始接触NetApp的export-policy和share概念容易混淆。下面三种协议分开写按需复用。4.1 NFS给Linuxexport策略、挂载参数与延迟检查先启用NFS服务并创建export策略再把卷导出去。在FAS8300上操作::* vserver nfs create -vserver svm01 -v3 enabled -v4 enabled ::* vserver export-policy create -vserver svm01 -policy export_nfs ::* vserver export-policy rule create -vserver svm01 -policy export_nfs -clientmatch 192.168.20.0/24 -rorule any -rwrule any -superuser any -protocol nfsvserver nfs create开启NFS v3和v4export-policy定义谁能访问-clientmatch写客户端的网段-rorule和-rwrule设成any表示不限制具体用户映射-superuser any允许root客户端有root权限。权限粒度后面想在客户端上收紧再单独改rule即可。然后把卷挂到导出路径上::* volume mount -vserver svm01 -volume vol_data -junction-path /vol_data ::* vserver export-policy apply -vserver svm01 -policy export_nfs -volume vol_dataexport-policy apply把策略绑定到卷上这步漏了会出现“网段对但客户端访问no route”。Linux客户端挂载命令mount -t nfs 192.168.20.10:/vol_data /mnt/data -o vers4.1,prototcp,timeo600,noatimevers4.1明确用NFSv4.1timeo600把超时调到60秒避免临时网络抖动直接hang死客户端noatime减少写放大。有些场景比如把Ollama模型存储路径改到NAS共享上做集中推理客户端大量小文件读取更要注意挂载参数建议在fstab里固定并启用hard模式业务中断时至少不会静默丢数据。挂载后先跑一下df -h和dd读写测试确认IO路径通再切业务。4.2 SMB给Windows共享创建与权限管理Windows环境走SMB。先建CIFS服务再建共享::* vserver cifs create -vserver svm01 -cifs-server svm01 -domain corp.local -ad-user admin -ad-domain corp.local ::* volume mount -vserver svm01 -volume vol_data -junction-path /vol_data ::* vserver cifs share create -vserver svm01 -share-name data -path /vol_data -share-properties oplocksvserver cifs create把SVM加入AD域-cifs-server是Windows网络邻居里看到的主机名share create的-share-properties oplocks开启机会锁提升文件访问性能。创建好后在Windows客户端用\\192.168.20.10\data访问即可。注意CIFS server名不能跟AD里已有计算机名冲突否则加域会被拒绝。域账号权限在AD侧管理存储侧只控制共享级权限。Windows侧如果跑虚拟化或数据库建议在共享属性里显式开启持续可用性::* vserver cifs options modify -vserver svm01 -is-continuously-available enabled开启后出现交换机重启这类短暂故障时SMB会话能重连而不是报“网络位置不可用”能避免一批人为“掉盘误报”。这个选项同样会影响SMB的客户端重连行为建议只在关键业务共享上开启。4.3 iSCSI给虚拟化LUN、igroup与多路径虚拟化平台一般走iSCSI块存储配置分四步。第一步在SVM上启用iSCSI协议::* vserver iscsi create -vserver svm01第二步创建卷和LUN::* volume create -vserver svm01 -volume vol_iscsi -aggregate aggr1 -size 2t -space-guarantee none ::* lun create -vserver svm01 -volume vol_iscsi -path /vol/vol_iscsi/lun01 -size 2t -ostype windows -space-reserve disabled-path是LUN在卷内部的路径客户端看不到但映射时要用-ostype windows告诉ONTAP按Windows兼容模式处理LUN格式。第三步创建igroup并把LUN映射进去::* igroup create -igroup ig_win01 -protocol iscsi -ostype windows -initiator iqn.1991-05.com.microsoft:win01 ::* lun map -vserver svm01 -path /vol/vol_iscsi/lun01 -igroup ig_win01 -lun-id 0-initiator从Windows客户端iscsi发起程序里抄IQNlun map完成LUN到主机的绑定。没做igroup映射客户端永远发现不了LUN。最后在Windows或ESXi侧配置MPIO多路径FAS8300每个节点两个数据口接交换机客户端能看到多条路径负载均衡算法选Round Robin即可。iSCSI这块的延迟表现通常优于NFS适合数据库和虚拟化磁盘这类对单卷IOPS敏感的场景。4.4 协议选择对比与对象存储补充三类协议按场景选型Linux文件共享无脑NFSWindows文件共享、AD域环境走SMB虚拟化裸盘和数据库走iSCSI。FAS8300的ONTAP也支持S3对象存储协议如果客户要求“对象存储服务”再接入可直接在SVM上启用object store服务复用同一批聚合资源。不过对象存储的桶和数据冗余策略与NAS卷管理模型不同一般单独划卷部署别和NFS卷混在一个聚合里抢IO。接入完成后在客户端做一轮读写验证确认协议层稳定再继续后面的性能判断和避坑检查。5. FAS8300安装与上线阶段的5个典型翻车点现象、原因、处置装FAS8300不是敲完命令就万事大吉真正折磨人的往往是最不起眼的细节。这里挑五个我在现场遇到过的典型问题按“现象、原因、解决”展开遇到类似情况直接对照排查。5.1 现象HA对端节点一直显示down集群建好后用cluster show查看发现node2状态显示falseHA对端不可达。cluster show -statistics能看到两个节点间的通信有丢包。原因通常是cluster互联端口negotiation失败或插的端口不是cluster端口尤其是把数据口和cluster口搞混物理链路up但协议不通。解决方法是先看端口角色::* network port show -node node2确认cluster端口对应的link状态是否为up。如果link正常再检查两条cluster链路是否分别连接对端对应端口顺便用system node run -node node2 -cmd ifconfig -a看端口是否有CRC错误。曾经遇到一种更隐蔽的情况两台节点同一块cluster端口模块故障换模块解决。端口错插就重插模块故障就换硬件别不停reboot没用的。5.2 现象创建聚合报insufficient spares执行storage aggregate create时提示没有足够的spare盘。原因多半是盘位上有些磁盘处于failed或unowned状态没有被识别成可用spare。也可能之前尝试建聚合失败部分盘被标记为broken。解决::* disk show -state unowned ::* disk show -state failedunowned盘先用disk assign重新归属到当前节点failed盘确认是否是物理坏盘。如果只是之前配置残留执行disk unfail把盘释放回来再建聚合。热备盘数量不足时减少聚合的盘数量优先保证系统里至少留一块全局热备。5.3 现象Linux挂载NAS后落盘延时高NFS共享挂载后客户端写文件带宽低、延迟高dd测试只有几十MB/s。原因一般是客户端网卡协商速率不匹配或MTU没开9000。FAS8300数据口默认MTU是1500如果两侧网卡配置了巨型帧存储侧没同步设置会导致大包被分片典型的症状就是写放大和延迟波动。解决方法是把客户端网卡、交换机端口、ONTAP数据端口统一改成MTU 9000::* network port modify -node node1 -port e0c -mtu 9000改完用pings -S 9000验证通不通不通就逐段检查。也顺带看客户端侧/etc/fstab是否有noatime没加的话写放大明显。这条经验救过不少“换存储后应用还是慢”的现场。5.4 现象Windows存储池或映射盘频繁掉盘Windows客户端映射SMB共享后隔一段时间磁盘断开或Windows存储池里显示“缺盘”。原因大概率不是存储挂了而是SMB持续可用性没开或者客户端自身设置SMB节能策略把会话休眠了。解决方法是先在ONTAP打开持续可用性::* vserver cifs options modify -vserver svm01 -is-continuously-available enabled然后Windows侧在“网络中心-高级共享设置”把“关闭空闲断开”设为不关闭同时检查网卡高级属性里“能源高效以太网”是否关闭。对虚拟化平台挂载iSCSI的Windows存储池重点检查MPIO的路径状态mpclaim看到只有单路径就补路径配置。别一看到掉盘就重启存储先查链路和协议超时参数。5.5 现象License激活后功能仍不可用买的功能License已导入并显示有效但对应功能还不可用比如快照、同步复制、S3服务。原因多数是License的生效作用域与SVM不匹配ONTAP的功能License有些要绑定具体特性激活后需要刷新或重建对应服务。解决::* license show -license-code ::* vserver services nfs show -vserver svm01确认对应SVN的feature包是否启用。再用license refresh刷新License状态。如果还不行重跑一次功能初始化比如重新vserver cifs create。提醒一点抓包看功能不可用之前先确认License的起始日期和到期时间把过期License当有效License用是现场最常见的误判。6. 上线前最后一步卷在线扩容与客户端验证的做法安装手册看到最后不能只停在“能挂载就行”。生产上最常做的一项操作是容量扩容FAS8300在线扩容不重启、不停业务这是它比传统阵列省心的地方。在线扩卷的命令很简单::* volume size -vserver svm01 -volume vol_data -new-size 6t-new-size直接写成扩容后的总容量。执行后卷立即增大客户端无需umountNFS和SMB对文件系统的大小说刷新即见。如果卷所在的聚合剩余空间不够先给聚合补盘::* storage aggregate add-disks -aggregate aggr1 -diskcount 2add-disks先把新盘加入聚合再扩卷。扩卷完成后客户端验证Linux端执行df -h看容量变化Windows磁盘管理器里重新扫描磁盘即可识别扩大后的空间。验证读写时建议用fio跑一轮混合读写下限测试确认扩容后IOPS和延迟无明显劣化。注意扩容不是无限扩的卷大小不能超过聚合剩余容量同时要给聚合留至少一块盘的冗余余量。我自己的习惯是每次扩容后都记一次基线把聚合使用率、卷使用率、快照占用率三条数据写进变更记录下次扩容前先看这三条再决定扩卷还是先扩聚合。初期吃过的亏就是在聚合只剩5%空间的时候强行扩卷结果快照任务一跑直接把聚合写满业务写IO被挂起。这个坑望各位避开扩容前务必看一眼存储大小和聚合水位。希望帮到你。本文还有配套的精品资源点击获取
返回列表