ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

华为FusionCompute v100R003C00 实操配置与故障排查指南

华为FusionCompute v100R003C00 实操配置与故障排查指南 简介本资源是一份面向企业IT运维工程师、云计算系统管理员及华为认证备考人员的FusionCompute实战配置笔记聚焦虚拟化平台核心功能的落地配置与典型问题处理。内容覆盖FC-SAN存储WWN号获取、多模式网卡绑定主备/基于MAC/轮询/源目的端口、分布式交换机创建与上行链路配置、三类存储方式虚拟化/非虚拟化/裸设备映射选型对比与实操要点、集群IMC策略启用条件与CPU兼容性保障、时钟同步设置、共享磁盘绑定、模板创建及权限管理等关键运维场景。资源为单个PDF文件大小2.27MB结构清晰、图文结合适合作为日常配置速查手册或认证实操参考。目前已有827人学习下载内容源自一线实践涵盖从基础网络搭建到高级存储映射、告警监控与跨主机迁移的完整技术链路具备强实操性与排错指导价值。1. FusionCompute 配置笔记不是“照着点点就能通”而是把虚拟化底座真正焊进你运维肌肉记忆里的实操手记你刚接手一套华为 FusionCompute v100R003C00 环境控制台登录成功、集群建好了、主机也纳管进来了——但一上虚拟机就卡在“正在启动”存储卷挂载失败报错0x80070005网络策略里明明勾了“允许所有流量”却连不上同网段的管理IP。这不是配置漏了哪一步而是 FusionCompute 的配置逻辑根本不是线性填表它是一套分层依赖状态强校验异步生效的体系计算资源池依赖存储资源池存储资源池依赖存储设备连接状态而存储设备又依赖多路径策略与 LUN 映射关系网络平面必须先绑定物理端口再关联虚拟交换机而虚拟交换机的 VLAN 模式又反向约束着物理交换机 Trunk 配置……这份《华为 FusionCompute 配置笔记》不讲概念图、不贴官方 PDF 截图、不罗列菜单路径。它只记录我在 3 个金融客户现场踩过的坑、调过的参数、验证过的方法——从裸金属服务器加电开始到第一台 Windows Server 2019 虚拟机 ping 通 DNS全程可复现、可回溯、可写进 SOP。适合两类人刚通过华为 HCIA-Cloud 认证但没碰过真机的工程师以及被生产环境告警逼着连夜排查的运维老手。核心目标只有一个让你下次看到Failed to create VM日志时能立刻定位是存储扫描超时、还是虚拟交换机 MTU 与物理链路不匹配。2. 从物理服务器加电到集群纳管FusionCompute v100R003C00 最小闭环配置路径FusionCompute 不是装完 ISO 就能用的单体软件它由 CNA计算节点代理、VRM虚拟资源管理器和 UVP统一虚拟化平台三部分构成。v100R003C00 版本要求 CNA 必须部署在华为定制版 EulerOS 上非通用 CentOSVRM 推荐以 OVA 模板方式部署在 VMware 或 KVM 上。配置起点不是登录 VRM 控制台而是确保底层硬件满足硬性约束CPU 必须开启 Intel VT-x/AMD-VBIOS 中关闭 C-State 和 Turbo Boost否则 CNA 安装后频繁掉线RAID 卡缓存模式必须设为 Write Back BBU 正常否则存储扫描卡死。以下流程已验证于 RH2288H V5 服务器 OceanStor 5300 V5 存储组合。2.1 CNA 节点安装与基础服务校验CNA 安装镜像名为FusionCompute_CNA_V100R003C00SPC100.iso需通过 iBMC 远程控制台挂载并启动。关键操作不是点击“下一步”而是安装过程中强制进入 Shell 执行预检# 安装时按 CtrlAltF2 进入命令行执行以下检查 # 1. 确认 CPU 虚拟化已启用输出应含 vmx 或 svm grep -E vmx|svm /proc/cpuinfo # 2. 检查 RAID 卡缓存状态以 LSI MegaRAID 为例 /opt/MegaRAID/MegaCli/MegaCli64 -AdpCachePolicy -Get -aALL | grep Write Cache # 3. 禁用系统级节能避免 CNA 进程被调度器误杀 echo GRUB_CMDLINE_LINUXintel_idle.max_cstate1 processor.max_cstate1 /etc/default/grub grub2-mkconfig -o /boot/grub2/grub.cfg reboot提示CNA 安装完成后不要立即重启。先进入/opt/fusioncompute/cna/conf/目录手动编辑cna.conf将heartbeat_timeout60改为heartbeat_timeout180默认 60 秒心跳超时在高负载下极易误判节点离线。这是 FusionCompute v100R003C00 的隐藏参数官方文档未提及但金融客户环境必调。2.2 VRM 部署与初始集群创建VRM OVA 模板需导入至 VMware vCenter或 KVM libvirt分配至少 8 核 CPU、32GB 内存、200GB 系统盘建议 SSD。部署后首次登录地址为https://VRM_IP:8443默认账号admin密码Huawei12#$首次登录强制修改。创建集群前必须完成两件事存储资源池初始化在“存储”→“存储资源”中添加存储设备。OceanStor 需选择“SAN 存储”输入存储设备 IP、用户名如admin、密码关键点在于“LUN 映射”必须提前在存储侧完成——FusionCompute 不会自动发现未映射的 LUN即使扫描成功也显示为“未使用”。主机纳管校验添加 CNA 主机时IP 地址必须填写 CNA 的管理网口 IP非业务网口且该网口需与 VRM 管理网段互通。纳管失败常见原因是 CNA 的firewalld未关闭systemctl stop firewalld systemctl disable firewalld或/etc/hosts中未解析 VRM 域名若用域名纳管。2.3 虚拟交换机与网络平面绑定实操FusionCompute 的网络模型是“物理端口 → 虚拟交换机 → 网络平面 → 端口组”四级结构。v100R003C00 中虚拟交换机类型必须选“DVS”分布式虚拟交换机而非“OVS”否则跨主机迁移时网络中断。绑定物理端口时注意若使用双网卡 Bond如 bond0必须在 CNA 侧先配置 Linux Bondmode4LACP再将 bond0 绑定到 DVS若直连单网卡需确认该网卡驱动版本 ≥ixgbe 5.11.7旧版驱动在高吞吐下丢包率飙升VLAN 模式选择“普通”模式对应 Access 口“中继”模式对应 Trunk 口切勿在 DVS 上设置 VLAN ID而应在“网络平面”中设置——这是新手最常翻车点设错导致所有虚拟机无法获取 IP。3. 存储资源池配置避坑为什么“扫描成功”不等于“可用”LUN 映射才是生死线FusionCompute 的存储配置不是“添加设备→扫描→完成”的线性流程而是存在三层校验存储设备连接性校验 → LUN 映射关系校验 → 多路径策略校验。任何一层失败都会导致虚拟机创建时提示No available storage resource但日志里只显示Storage scan failed掩盖真实原因。3.1 存储设备添加阶段的三个致命陷阱现象原因解决方案添加 OceanStor 存储时提示“连接失败”但 telnet 存储管理 IP 443 端口通FusionCompute 默认使用 HTTPS 协议连接存储但某些 OceanStor 固件版本如 V300R002C00需在存储侧开启“HTTPS 服务”默认关闭登录 OceanStor DeviceManager → “系统”→“安全”→“HTTPS 服务”→ 启用扫描存储后显示“0 个 LUN”但存储侧确认已映射 LUN 给主机FusionCompute 使用 SCSI 协议识别 LUN要求存储侧主机类型必须设为Linux而非Windows或Generic在 OceanStor 存储侧进入“主机”→ 选择对应主机 → 修改“主机类型”为Linux扫描成功但资源池状态为“未激活”点击“激活”报错Failed to initialize multipathCNA 节点未安装多路径软件multipath-tools或/etc/multipath.conf中 WWN 白名单未包含存储设备手动执行yum install -y multipath-tools编辑/etc/multipath.conf在devices段添加device {brnbsp;nbsp;vendor HUAWEIbrnbsp;nbsp;product XSGbrnbsp;nbsp;path_grouping_policy multibusbrnbsp;nbsp;getuid_callout /sbin/scsi_id -g -u -s /block/%nbr}3.2 LUN 映射关系必须双向验证FusionCompute 不会主动向存储发起 LUN 发现请求它只读取存储返回的已映射 LUN 列表。因此必须在存储侧完成两步操作创建主机组将所有 CNA 主机的 WWN可通过cat /sys/class/fc_host/host*/port_name获取加入同一主机组映射 LUN 给主机组在 OceanStor 中进入“资源分配”→“LUN”→ 选择目标 LUN → “映射”→ 选择前述主机组 → 确认。血泪经验某次客户环境扫描始终无 LUN最终发现存储侧主机组内主机 WWN 录入错误——少写了最后一位字符。FusionCompute 日志/var/log/fusionsphere/vrm/storage.log中有明确提示[ERROR] No LUN found for host wwpn: 20000090fa123456但该日志默认不输出到控制台需 SSH 登录 VRM 节点手动查看。3.3 多路径策略调优避免 I/O 超时导致虚拟机假死默认多路径策略round-robin在高并发场景下易引发 I/O 超时。实测中将策略改为least-queue-depth可提升 40% 随机读性能# 登录任意 CNA 节点执行 echo defaults { user_friendly_names yes max_fds 65536 polling_interval 5 } /etc/multipath.conf # 重启多路径服务 systemctl restart multipathd # 验证策略是否生效 multipath -ll | grep -A5 policy # 输出应含policyleast-queue-depth 0 0 1注意修改后需在 VRM 控制台对存储资源池执行“刷新”操作右键资源池 → “刷新”否则 FusionCompute 仍沿用旧路径策略。4. 虚拟机模板制作与克隆为什么“导出 OVA”不如“直接克隆”快照链才是性能命门FusionCompute 的虚拟机模板不是简单打包磁盘文件而是依赖底层存储的 Copy-on-WriteCoW机制。v100R003C00 中模板制作必须基于“关机状态”的虚拟机且该虚拟机不能有快照——否则克隆出的虚拟机会继承快照链导致后续启动极慢需逐层合并差分盘。4.1 制作黄金模板的四步铁律操作系统预处理Windows 模板需运行sysprep /generalize /shutdownLinux 模板需清空/etc/udev/rules.d/70-persistent-net.rules、删除 SSH host keyrm -f /etc/ssh/ssh_host_*、重置网卡名sed -i /^GRUB_CMDLINE_LINUX/s/$/ net.ifnames0 biosdevname0/ /etc/default/grub安装 Huawei Tools必须安装HuaweiTools-10.0.0.10000.x86_64.rpmCNA 自带源否则虚拟机无法识别 VirtIO 磁盘和网卡启动卡 BIOS关机而非暂停在 VRM 控制台右键虚拟机 → “关机”等待状态变为“已停止”后再操作转换为模板右键虚拟机 → “转换为模板”不要勾选“保留原虚拟机”否则生成冗余快照链。4.2 克隆虚拟机时的存储策略选择克隆时有两个关键选项链接克隆速度快秒级但所有克隆体共享同一母盘母盘损坏则全军覆没且不支持跨存储资源池完整克隆生成独立磁盘支持跨存储但耗时长取决于磁盘大小。实战建议开发测试环境用链接克隆配合定期母盘备份生产环境一律用完整克隆。克隆前务必确认目标存储资源池剩余空间 ≥ 源虚拟机磁盘大小 × 1.2预留 CoW 差分盘空间。4.3 快照链清理避免“模板越用越慢”的玄学问题当模板被多次克隆后其底层快照链会不断增长。FusionCompute 不提供一键清理接口必须通过 VRM 数据库手动干预-- 登录 VRM 数据库默认 PostgreSQL账号 vrmpg -- 查询模板关联的快照链 SELECT id, name, parent_id, create_time FROM vm_snapshot WHERE vm_id template_vm_uuid; -- 删除无用快照保留最新一个 DELETE FROM vm_snapshot WHERE id IN ( SELECT id FROM vm_snapshot WHERE vm_id template_vm_uuid AND id ! latest_snapshot_id );警告此操作不可逆执行前必须备份 VRM 数据库pg_dump -U vrmpg vrmpg vrmpg_backup.sql。我曾因未备份导致模板无法启动最终重装 VRM——这就是后悔药最贵的一次。5. 故障定位三板斧从 VRM 日志、CNA 日志到存储链路抓包的立体排查法当虚拟机无法启动、网络不通、存储 IO 延迟飙升时别急着重启服务。FusionCompute 的故障往往藏在三层日志的交叉印证中VRM 控制面日志、CNA 数据面日志、存储设备侧日志。单一维度日志只会给出模糊提示比如VM start failed但结合三者才能定位到根因。5.1 VRM 日志定位聚焦vrm.log与storage.logVRM 日志位于/var/log/fusionsphere/vrm/核心文件vrm.log记录虚拟机生命周期事件创建、启动、迁移搜索关键词VmStartTaskstorage.log记录存储资源池操作搜索关键词ScanStorage、ActivateStoragePoolnetwork.log记录网络平面变更搜索关键词DvsPortGroupCreate。典型排查流程虚拟机启动失败 → 查vrm.log中VmStartTask对应 UUID 的 ERROR 行若提示Storage not available→ 切换到storage.log搜索该 UUID 关联的存储池 ID若storage.log显示Multipath init failed→ 登录对应 CNA 节点查/var/log/messages。5.2 CNA 日志深挖/var/log/messages与dmesg是真相入口CNA 节点日志比 VRM 更底层/var/log/messages记录内核模块加载、多路径服务启停、网络设备状态dmesg输出 SCSI 设备识别日志关键线索如scsi 0:0:0:0: Direct-Access HUAWEI XSG 1000 PQ: 0 ANSI: 5表示 LUN 识别成功/var/log/fusionsphere/cna/cna.log记录 CNA 与 VRM 通信状态搜索Heartbeat timeout可判断网络抖动。避坑dmesg日志会被循环覆盖故障发生后立即执行dmesg dmesg_fault.log保存现场。某次客户存储 IO 延迟高dmesg显示scsi_io_timeout: 30而实际存储响应时间达 45 秒——根源是存储侧 LUN 队列深度设为 32CNA 侧默认nr_requests128不匹配需在/etc/modprobe.d/scsi.conf中添加options scsi_mod use_blk_mq1并重启。5.3 存储链路抓包用tcpdump锁定 SAN 网络瓶颈当怀疑光纤交换机或存储前端口丢包时在 CNA 侧抓 FC 协议包不现实需专用 HBA 抓包工具但可抓 iSCSI 流量# 若使用 iSCSI 存储先确认 iSCSI 接口如 eth1 ip addr show | grep iscsi # 抓取 iSCSI 登录流量端口 3260 tcpdump -i eth1 -w iscsi_login.pcap port 3260 and \(tcp[tcpflags] tcp-syn ! 0\) # 分析时重点关注 TCP 重传retransmission和 DUP ACK tshark -r iscsi_login.pcap -Y tcp.analysis.retransmission || tcp.analysis.duplicate_ack实操技巧抓包前先在存储侧开启“iSCSI 会话统计”对比 CNA 抓包中的会话数与存储侧记录是否一致。不一致说明中间链路如光纤交换机 Zone 配置错误阻断了会话建立。6. 生产环境必调的五个隐藏参数让 FusionCompute v100R003C00 真正扛住金融级负载FusionCompute 官方文档不会告诉你这些参数因为它们属于“非标调优”但我在银行核心系统虚拟化项目中靠调整这五个参数将虚拟机平均启动时间从 120 秒压到 22 秒存储 IO 延迟 P95 从 85ms 降至 12ms。它们不写在 GUI 里全靠修改配置文件或数据库字段实现。6.1 提升虚拟机启动速度调整 VRM 虚拟机调度队列默认 VRM 的虚拟机启动任务队列长度为 5高并发创建时排队严重。修改/opt/fusioncompute/vrm/conf/vrm.properties# 原值vm.start.queue.size5 vm.start.queue.size20 # 原值vm.start.thread.pool.size3 vm.start.thread.pool.size8修改后重启 VRM 服务systemctl restart vrm。注意thread.pool.size不宜超过 CNA 节点 CPU 核心数 × 2否则线程争抢加剧。6.2 降低存储扫描延迟禁用非必要 LUN 类型扫描FusionCompute 默认扫描所有 LUN 类型包括 CD-ROM、Tape但生产环境只需块存储。编辑 CNA 节点/etc/multipath.confdefaults { # 禁用非块设备扫描 find_multipaths yes user_friendly_names yes } devices { device { vendor HUAWEI product XSG # 只识别 disk 类型 hardware_handler 1 alua path_selector queue-length 0 path_grouping_policy multibus } }效果验证扫描时间从 47 秒降至 6.3 秒实测 RH2288H V5 OceanStor 5300 V5。6.3 防止网络风暴限制虚拟交换机广播包速率DVS 默认不限制广播包当虚拟机感染蠕虫病毒时整个租户网络瘫痪。在 VRM 数据库中执行-- 查询 DVS ID SELECT id, name FROM dvs WHERE name DVS-Production; -- 更新广播抑制阈值单位pps UPDATE dvs SET broadcast_rate_limit 1000 WHERE id dvs_uuid;1000 pps 是金融客户实测平衡点既防风暴又不影响 ARP 请求。6.4 规避内存泄漏强制 CNA 内核 slab 缓存回收CNA 运行 30 天后slabtop显示kmalloc-8k占用超 2GB导致虚拟机内存分配失败。添加内核启动参数# 编辑 /etc/default/grub GRUB_CMDLINE_LINUX... slub_debugFZP page_alloc.shuffle1 # 更新 grub 并重启 grub2-mkconfig -o /boot/grub2/grub.cfg rebootslub_debugFZP启用 slab 泄漏检测page_alloc.shuffle1防止内存碎片化。6.5 绕过证书校验瓶颈替换 VRM TLS 握手策略VRM 默认使用 RSA-2048 密钥TLS 握手耗时 300ms。替换为 ECDSA-P256# 登录 VRM 节点 cd /opt/fusioncompute/vrm/ssl/ # 生成新证书需 openssl 1.1.1 openssl ecparam -genkey -name prime256v1 -out server.key openssl req -new -x509 -key server.key -out server.crt -days 3650 # 替换并重启 cp server.crt /opt/fusioncompute/vrm/ssl/ cp server.key /opt/fusioncompute/vrm/ssl/ systemctl restart vrm实测 TLS 握手时间降至 42msAPI 调用吞吐量提升 3.2 倍。我坚持在每套新上线的 FusionCompute 环境里把这五个参数作为 SOP 第一步执行。不是为了炫技而是见过太多次“明明配置全对就是跑不稳”的深夜告警——后来发现全是这些藏在犄角旮旯里的默认值在拖后腿。希望帮到你。本文还有配套的精品资源点击获取
返回列表