
简介本资源是一份面向企业IT运维工程师、云计算系统管理员及华为认证备考人员的FusionCompute实战配置笔记聚焦FC-SAN存储接入、网络高可用绑定、分布式交换机搭建、多类型存储选型虚拟化/非虚拟化/裸设备映射、集群IMC策略启用、时钟同步与告警阈值设置等核心运维场景。内容覆盖从主机HBA卡WWN号获取、FC-SAN/NAS存储添加到共享磁盘绑定、模板创建与权限管理等完整配置链路兼具原理说明与界面操作指引。资源为单个PDF文件大小2.27MB结构清晰、图文结合适合作为日常运维速查手册或HCIA-Cloud认证实操参考。目前已有828人学习下载内容源自一线实践知识点颗粒度细、排错提示明确尤其对网卡绑定模式选型主备/基于MAC/轮询/源目的端口、存储类型适用边界如Oracle RAC需裸设备映射、IMC开启前提条件等关键细节均有深入解析。1. FusionCompute 是什么不是“虚拟化软件”而是华为私有云的控制平面中枢你手头这份《华为FusionCompute配置笔记.pdf》大概率是某次交付现场工程师在客户机房熬夜调通集群后用 Typora 顺手记下的关键参数快照——它不讲 OpenStack 架构图不列 KVM 内核模块依赖更不会教你如何编译 libvirt 补丁。它只解决一件事让三台 x86 服务器在 4 小时内变成一个能被运维平台纳管、能跑起 Windows Server 2019 虚拟机、且存储故障时自动迁移的生产级资源池。FusionCompute 不是 VMware vSphere 那种“开箱即用”的黑盒也不是 Proxmox VE 那样靠 Web UI 点点点就能上线的轻量方案。它是华为云 Stack 的底层引擎是政企客户上云第一跳的“硬底座”所有虚拟机生命周期管理、存储卷挂载策略、网络 QoS 控制、主机告警联动都必须经由它的 CNAComputing Node Agent和 VRMVirtual Resource Manager两层服务协同完成。这意味着——配置不是“填完表单就完事”而是对物理拓扑、存储协议、网络分段三者耦合关系的显式声明。你配错一个 VLAN ID虚拟机可能连不上管理网你选错存储类型克隆模板会卡在 99%你没开主机 BMC 的 IPMI 接口VRM 根本收不到硬件告警。这份 PDF 的价值正在于它跳过了产品白皮书里“高可用”“弹性伸缩”这类虚词直击真实交付中反复踩坑的断点CNA 主机 BIOS 中 VT-d 必须开启但 Intel TXT 要关闭、VRM 数据库默认用 PostgreSQL 但客户要求迁移到 Oracle 时 JDBC URL 的写法、当存储多路径链路切换失败时multipath -ll输出里哪一行才是真故障路径。它适合两类人一是刚接手华为私有云维保的外包工程师需要快速定位“为什么虚拟机启动不了”二是准备华为 HCIA-Cloud Computing 认证的考生PDF 里那些带截图的“添加存储资源”步骤比官方实验手册更贴近考场真题环境。提示FusionCompute 的配置本质是“状态同步”——VRM 数据库记录的是你期望的资源配置状态CNA 主机上的 agent 进程负责把状态落地为真实的 Linux kernel 模块加载、qemu 进程参数、iscsiadm 登录会话。所以所有“配置不生效”的问题第一步永远不是重装而是查/var/log/fusionsphere/下对应组件的日志看状态同步是否卡在某一步。2. 从零部署 VRM用最小化命令集完成控制节点初始化VRMVirtual Resource Manager是 FusionCompute 的大脑它必须部署在独立物理服务器或高规格虚拟机上。华为官方推荐使用 ISO 镜像安装但实际交付中客户常因安全策略禁止光驱挂载或要求 VRM 与现有监控系统共用同一台物理机此时需用 KVM 嵌套虚拟化。本节聚焦最可控的ISO 本地安装 手动补全关键配置方案避开图形向导的隐藏选项陷阱。2.1 准备 ISO 与硬件预检BIOS 设置比磁盘容量更重要FusionCompute 7.5.x当前主流版本的 VRM 安装 ISO 需要满足CPUIntel Xeon E5/E7 或 AMD EPYC 系列必须开启 VT-x 和 VT-dIOMMU关闭 Intel TXT、SGX否则安装过程卡在 GRUB 加载阶段内存≥32GBVRM 自身占用 16GB剩余需留给 PostgreSQL 和 Tomcat磁盘系统盘 ≥200GB SSDRAID1额外挂载一块 ≥1TB 的 SATA 盘作为 VRM 数据库存储非系统盘注意VRM 安装程序会自动格式化系统盘但不会自动挂载第二块数据盘。若跳过此步PostgreSQL 默认将数据写入/opt/vrm/data系统盘后续虚拟机数量增长后极易触发磁盘满告警且无法在线迁移数据库目录。执行以下命令确认硬件就绪# 检查虚拟化支持必须输出 vmx 或 svm grep -E vmx|svm /proc/cpuinfo # 检查 IOMMU 是否启用必须输出 dmar: DRHD: handling fault 类似日志 dmesg | grep -i dmar # 检查第二块磁盘是否存在假设为 /dev/sdb lsblk | grep sdb2.2 ISO 安装后的三处必改配置绕过向导埋雷安装完成后系统默认进入 VRM 管理界面https://VRM_IP:8443但此时仅完成基础服务启动以下三项配置必须在首次登录前通过 SSH 修改否则后续所有操作将受限1修改 PostgreSQL 数据库路径到独立磁盘# 停止 VRM 服务 systemctl stop vrm # 创建数据目录假设数据盘已挂载到 /data/vrm_db mkdir -p /data/vrm_db chown -R vrm:vrm /data/vrm_db # 备份原配置 cp /etc/vrm/db.conf /etc/vrm/db.conf.bak # 修改 db.conf 指向新路径关键 sed -i s#/opt/vrm/data#/data/vrm_db#g /etc/vrm/db.conf # 初始化新数据库 su - vrm -c /opt/vrm/tools/initdb.sh -D /data/vrm_db2强制启用 HTTPS 证书信任避免浏览器报错中断配置VRM 默认生成自签名证书但部分客户浏览器策略会直接拦截连接。需将证书导入系统信任库# 导出 VRM 证书 openssl s_client -connect localhost:8443 -showcerts /dev/null 2/dev/null | openssl x509 /tmp/vrm.crt # 导入系统证书库 cp /tmp/vrm.crt /etc/pki/ca-trust/source/anchors/ update-ca-trust3开放必要端口防火墙默认关闭 22/8443/7443# 开放管理端口7443 为 CNA 注册端口8443 为 Web 界面22 为 SSH firewall-cmd --permanent --add-port22/tcp firewall-cmd --permanent --add-port7443/tcp firewall-cmd --permanent --add-port8443/tcp firewall-cmd --reload逻辑说明这三步的本质是将 VRM 从“演示模式”切换为“生产模式”。官方向导默认把数据库放在系统盘是为简化初次体验但生产环境必须分离 IO 负载。证书信任改造是为了让自动化脚本如 Ansible 调用 VRM API能稳定通信。端口开放则是 CNA 主机注册的前置条件——若 7443 端口不通CNA 向 VRM 发送的注册请求会被直接丢弃Web 界面中永远看不到主机列表。3. 添加 CNA 主机为什么“添加成功”不等于“可纳管”CNAComputing Node Agent是运行在物理服务器上的代理负责将本机的 CPU/内存/存储/网络资源上报给 VRM并执行虚拟机创建、迁移等指令。添加 CNA 的 Web 界面操作看似简单但90% 的“主机离线”问题源于三个被向导隐藏的底层依赖未就绪。3.1 CNA 主机 BIOS 与内核参数VT-d 和 hugepage 的硬性绑定华为 CNA 镜像基于 CentOS 7.6 定制但客户常自行安装标准 CentOS 并手动部署 CNA Agent。此时必须手动校验检查项正确值错误现象cat /sys/module/kvm_intel/parameters/enable_eptY虚拟机启动报 “KVM: entry failed, hardware error 0x0”cat /proc/sys/vm/nr_hugepages≥1024建议 2048虚拟机内存分配失败日志出现 “Cannot allocate memory”dmesggrep -i iommu包含 “DMAR: DRHD: handling fault”修正 hugepage 配置永久生效# 编辑 sysctl 配置 echo vm.nr_hugepages 2048 /etc/sysctl.conf sysctl -p # 验证 hugepage 分配 grep HugePages_ /proc/meminfo3.2 CNA 注册到 VRM 的完整握手流程抓包定位卡点CNA 启动后会向 VRM 的 7443 端口发起 TLS 握手 → 发送主机信息 JSON → 等待 VRM 返回授权 Token。若卡在某一步需用 tcpdump 抓包# 在 CNA 主机执行替换 VRM_IP 为实际地址 tcpdump -i any port 7443 -w cna_vrm_handshake.pcap # 在 VRM 主机执行检查 7443 端口监听状态 netstat -tuln | grep :7443 # 必须显示 LISTEN # 检查 VRM 日志中的注册请求 tail -f /var/log/fusionsphere/vrm/vrm.log | grep -i register常见失败场景及日志特征现象CNA 界面显示“正在注册”持续 5 分钟无变化日志线索vrm.log中无register关键字 → 检查 CNA 到 VRM 的 7443 端口网络连通性telnet VRM_IP 7443现象CNA 界面显示“注册失败”错误码ERR_CODE_1001日志线索vrm.log中出现Invalid certificate→ CNA 主机时间与 VRM 偏差 5 分钟需用ntpdate同步现象CNA 显示“在线”但无法创建虚拟机日志线索vrm.log中有host xxx not found in database→ CNA 主机名hostname与 VRM 界面添加时填写的“主机名”不一致区分大小写提示CNA 主机名必须与hostname命令输出完全一致且不能含下划线_或大写字母。这是华为 VRM 数据库字段约束向导界面不校验但后端 SQL 插入会失败。4. 存储资源配置避坑FC-SAN、IP-SAN、本地磁盘的三套生存法则FusionCompute 支持 FC-SAN、IP-SANiSCSI、本地磁盘三种存储类型但同一集群内严禁混用不同协议的存储作为“主存储”即存放虚拟机系统盘的存储。混用会导致虚拟机迁移失败、快照异常、甚至元数据损坏。本节直击三类存储最易翻车的配置点。4.1 FC-SANZone 配置错误比 HBA 卡驱动更致命客户常认为“HBA 卡驱动装好就能用”却忽略 SAN 交换机 Zone 配置。典型错误现象CNA 主机fdisk -l能看到 LUN但 VRM 界面添加存储资源时提示“未发现可用 LUN”原因SAN 交换机未将 CNA 的 WWPN 与存储阵列的 WWNN 划入同一 Zone排查在 CNA 主机执行systool -c fc_host -v | grep port_name获取 WWPN登录 SAN 交换机检查 Zone 成员修正 Zone以 Cisco MDS 为例# 查看当前 Zone show zone active # 创建新 Zone假设 CNA WWPN 为 10:00:00:00:c9:xx:xx:xx存储 WWNN 为 20:00:00:00:c9:yy:yy:yy zone name fusioncompute_zone vsan 100 member pwwn 10:00:00:00:c9:xx:xx:xx member pwwn 20:00:00:00:c9:yy:yy:yy exit # 激活 Zone zoneset activate name my_zoneset vsan 1004.2 IP-SANiSCSICHAP 认证的双向陷阱VRM 添加 iSCSI 存储时若存储侧启用了 CHAP 认证必须同时配置Target CHAP存储认证 CNA和Initiator CHAPCNA 认证存储。漏配任一方向均导致连接失败。Target CHAP 配置位置VRM Web 界面 → 存储资源 → 添加 → iSCSI → 勾选“启用 Target CHAP”输入存储侧设置的用户名/密码Initiator CHAP 配置位置必须在每台 CNA 主机上手动配置VRM 不下发# 编辑 iscsi 配置 vi /var/lib/iscsi/nodes/target_iqn/target_ip:3260,1/default # 修改以下两行替换为实际值 node.session.auth.authmethod CHAP node.session.auth.username cna_initiator_user node.session.auth.password cna_initiator_pass4.3 本地磁盘SSD 缓存盘的“伪 RAID”幻觉客户常用两块 NVMe SSD 做 RAID0 提升性能但 FusionCompute 本地存储不识别 RAID 卡逻辑盘。必须使用 Linux 软 RAIDmdadm或直接裸盘挂载。错误做法用 MegaRAID 工具创建 RAID0VRM 添加存储时选择/dev/sda→ 实际添加的是 RAID 卡虚拟盘CNA 主机重启后设备名可能变为/dev/sdb导致虚拟机无法启动正确做法禁用 RAID 卡将 SSD 设为 JBOD 模式用mdadm创建 RAID0# 创建软 RAID假设为 /dev/nvme0n1 和 /dev/nvme1n1 mdadm -C /dev/md0 -l 0 -n 2 /dev/nvme0n1 /dev/nvme1n1 mkfs.xfs /dev/md0 echo DEVICE /dev/nvme0n1 /dev/nvme1n1 /etc/mdadm.conf mdadm --detail --scan /etc/mdadm.conf注意本地存储的“存储类型”在 VRM 中必须选“本地磁盘”而非“FusionStorage”。后者是华为独立分布式存储产品需额外部署 FS-Master 节点与本地磁盘无关。5. 网络平面配置管理、业务、存储三网隔离的物理层真相FusionCompute 要求管理网络VRM-CNA 通信、业务网络虚拟机对外访问、存储网络CNA-存储阵列严格物理隔离。但客户常因机柜空间不足试图用 VLAN 划分“逻辑隔离”。本节用真实案例说明为何VLAN 隔离在存储网络上必然失败。5.1 存储网络为何必须物理隔离iSCSI 的 MTU 与乱序重传iSCSI 协议对网络延迟和丢包极度敏感。当管理网与存储网共用物理链路时管理网突发流量如 VRM 同步元数据会抢占带宽导致 iSCSI TCP 重传超时交换机 QoS 策略无法精确区分 iSCSI 流量无固定端口只能按 VLAN 限速但 iSCSI 使用动态端口3260 仅为初始端口最终现象虚拟机磁盘 I/O 延迟飙升至 500msiostat -x显示%util100%avgqu-sz10验证方法在 CNA 主机抓取存储网流量过滤 iSCSI# 假设存储网卡为 eth2 tcpdump -i eth2 port 3260 -w iscsi_traffic.pcap # 分析重传率需安装 tcpreplay tcpreplay --stats1 iscsi_traffic.pcap | grep retrans若重传率 0.1%即证明网络不可靠。5.2 业务网络的 VLAN 配置VRM 与 CNA 的双重绑定业务网络需在 VRM 和 CNA 两端同步配置 VLAN缺一不可VRM 侧网络资源 → 添加网络 → 输入 VLAN ID如 100→ 绑定到指定物理网卡如 eth1CNA 侧必须在 Linux 内核层面创建子接口VRM 不下发# 创建 VLAN 子接口假设物理网卡为 eth1VLAN ID 为 100 ip link add link eth1 name eth1.100 type vlan id 100 ip addr add 192.168.100.10/24 dev eth1.100 ip link set eth1.100 up提示CNA 侧 VLAN 子接口的 IP 地址无需与 VRM 同网段但必须确保该子接口处于UP状态ip link show eth1.100 | grep state输出state UP。否则虚拟机即使分配了该网络也无法获取 IP。6. 故障排查黄金三板斧日志、网络、权限的闭环验证法交付现场最耗时的不是配置而是定位“为什么不行”。我总结出一套不依赖 GUI 界面的 CLI 排查法覆盖 95% 的常见故障。核心逻辑所有问题最终归结为“日志报错 → 网络不通 → 权限不足”三层漏斗逐层收缩范围。6.1 日志分析精准定位到行号的技巧FusionCompute 日志分散在多个路径但关键错误集中在/var/log/fusionsphere/vrm/vrm.logVRM 服务主日志搜索ERROR、Exception/var/log/fusionsphere/cna/cna.logCNA 主机代理日志搜索fail、timeout/var/log/messages系统级日志搜索kernel:、multipath:高效检索技巧# 查看最近 1 小时内所有 ERROR排除无关 INFO awk -v d1$(date -d 1 hour ago %Y-%m-%d %H:%M:%S) \ -v d2$(date %Y-%m-%d %H:%M:%S) \ $0 ~ d1,$0 ~ d2 /var/log/fusionsphere/vrm/vrm.log | grep -i error\|exception # 定位具体错误行的上下文显示错误行前后 5 行 grep -A5 -B5 Failed to create VM /var/log/fusionsphere/vrm/vrm.log6.2 网络连通性用最小化工具链验证放弃ping改用四层协议验证验证目标命令通过标准VRM 与 CNA 管理通信telnet CNA_IP 7443ConnectedCNA 访问存储阵列nc -zv storage_ip 3260iSCSI或nc -zv storage_ip 22FC-SAN 管理口Connection succeededVRM 访问 PostgreSQLpsql -h localhost -U vrm -d vrmdb -c SELECT now();返回时间戳6.3 权限与 SELinux被忽视的“静默杀手”华为 CNA 镜像默认启用 SELinux但部分客户为调试关闭后未恢复。若 VRM 界面操作无响应先检查# 检查 SELinux 状态 sestatus # 若为 enforcing临时设为 permissive不影响业务 setenforce 0 # 检查 audit 日志中的拒绝记录 ausearch -m avc -ts recent | grep -i denied若ausearch输出大量avc: denied说明 SELinux 策略阻止了 VRM 服务访问文件或端口。此时应用setroubleshoot-server分析日志生成修复建议或直接应用华为官方 SELinux 策略包需从 Huawei Support 下载fusionsphere-selinux-policy.rpm我的血泪经验某次虚拟机无法启动日志只显示Failed to start domain折腾 3 小时后发现是 SELinux 阻止了 qemu 进程读取/var/lib/vrm/images/下的磁盘镜像。ausearch一行命令就定位到根源。希望帮到你。本文还有配套的精品资源点击获取