ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

VMware服务器虚拟化方案:从架构设计到容灾演练的落地指南

VMware服务器虚拟化方案:从架构设计到容灾演练的落地指南 简介这份文档面向企业IT运维人员、虚拟化架构师及数据中心规划者系统讲解VMware服务器虚拟化解决方案的完整设计思路帮助应对服务器数量激增带来的资金、人力与管理压力。资源为单个doc文件压缩包约3.39MB内容围绕vCompute、vStorage、vNetwork三大方向展开涵盖服务器整合、商业连续性与测试开发三类典型场景。文档从需求分析、方案拓扑图入手逐层说明软件与硬件需求并拆解基础架构服务层、应用程序服务层、虚拟应用程序层及异地容灾技术同时给出TCO降低、运营效率提升、服务水平改善与旧硬件投资保护等收益分析还包含与同类产品的效率、控制维度比较。目前已有2732人学习适合需要落地vSphere部署、规划vCenter Server与Lab Manager环境的技术人员参考可据此梳理架构分层与容灾设计要点。1. 从一台跑满 15% 的旧服务器说起这份 VMware 方案文档到底能解决什么很多机房巡检时都会撞见同一个画面一排 IBM X3850 亮着绿灯CPU 利用率常年在 10% 到 15% 之间晃内存空着一大半可每台机器只跑了一个活动目录或者文件打印服务。硬件在折旧电费在烧补丁还得一台台打。这份《VMware服务器虚拟化解决方案(详细).doc》就是冲着这个场景来的——它不是安装教程而是一份完整的架构设计与实施方案文档覆盖服务器整合、商业连续性、测试开发三条主线并给出了从需求分析、拓扑设计到软硬件清单的落地路径。文档里明确写了 vSphere 4、vCenter Server 4、Lab Manager 4 这套组合以及 HA、vMotion、DRS、FT、Storage vMotion、Thin Provisioning 等具体功能模块。适合谁看正在做数据中心整合规划、要写虚拟化实施方案、或者需要给领导讲清楚为什么上虚拟化、怎么上、花多少钱的运维和架构人员。如果你只是想在自己笔记本上装个虚拟机玩这份文档偏重企业级架构参考价值有限。2. 三层架构怎么拆vCompute、vStorage、vNetwork 的选型逻辑2.1 为什么方案把基础架构切成三层文档在 2.4 节把整个虚拟架构分成基础架构服务层、应用程序服务层和虚拟应用程序层。这个切法不是拍脑袋而是对应了虚拟化落地的三个递进问题资源怎么池化、应用怎么保活、交付怎么简化。基础架构服务层解决的是把物理资源变成可分配的池核心就是 vCompute、vStorage、vNetwork 三块。很多方案文档一上来就堆功能名但这份文档先讲分配粒度——内存细化到 MB、CPU 细化到 MHz粒度越细调度越灵活。这个细节在实际做资源规划时很关键因为如果 CPU 分配粒度太粗一台 4 核 32G 的 X3850 上跑十几台虚拟机时就会出现资源碎片明明总量够但就是分配不出去。vStorage 这块文档重点提了 VMFS 集群文件系统和 Thin Provisioning。VMFS 是让多台 ESXi 主机同时访问同一存储卷的基础没有它就没有 vMotion 和 HA。Thin Provisioning 则是按实际使用量分配存储文档里说能降低超过 50% 的存储成本这个数字在存储阵列采购时直接影响预算。vNetwork 部分讲了虚拟交换机和分布式交换机前者是单主机级别的二层连接后者是数据中心级别的集中管理。选型时如果主机数量少于 3 台标准交换机够用超过 5 台分布式交换机的集中配置优势就体现出来了改一次端口组策略不用每台主机登一遍。2.2 应用程序服务层的功能取舍应用程序服务层是整份文档最厚的部分因为它决定了虚拟化平台能不能扛事。文档列了 vMotion、HA、FT、DRS、Data Recovery、VMsafe、vShield Zone 等一堆功能。实际落地时不可能全上得按业务等级取舍。vMotion 是基础没有它就没有后续的动态调度建议必选。HA 解决的是主机故障后虚拟机自动重启RTO 通常在分钟级适合大多数业务。FT 则是零中断零丢包的连续运行但代价是虚拟机性能有损耗且只支持单 vCPU文档里也说了这是最高级别的业务连续性保障一般只给最核心的数据库或交易系统用。DRS 和 DPM 是一对DRS 做负载均衡DPM 在低负载时把虚拟机集中到少数主机上其余主机休眠省电。文档提到 DPM 是最近虚拟化领域的重要技术在电费敏感的场景下值得开。Data Recovery 是无代理备份适合没有专业备份软件的小环境如果已经有 Veritas、Legato 这类企业备份方案文档也说了要兼容传统方案不必重复建设。VMsafe 和 vShield Zone 偏安全前者提供 Hypervisor 级防病毒接口后者是动态防火墙虚拟机迁移时安全策略跟着走。这两个功能在等保合规场景下会被问到但部署复杂度不低建议在基础平台稳定后再叠加。2.3 硬件配置的实操对照文档 2.3.2 节给了明确的硬件清单20 台 IBM 服务器加 1 台普通 PC Server共享存储走 FC SAN。具体配置上X3850 至少 4 颗 4 核 CPU、32G 内存、双硬盘 RAID1、双光纤 HBA 卡X3650 至少 2 颗 4 核 CPU、16G 内存、同样双硬盘 RAID1 和双光纤 HBA。这个配置在当年是主流放到现在看CPU 核心数和内存容量需要按虚拟机密度重新算。一个粗略的换算方法是先统计现有物理机的 CPU 总核心数和内存总量按 1:4 到 1:6 的整合比估算目标主机数量再留 20% 到 30% 的余量给 HA 预留和突发负载。双光纤 HBA 卡和双硬盘 RAID1 是冗余底线文档里反复强调 NIC/HBA Teaming就是怕单卡故障导致整个主机失联。FC SAN 的选择上如果预算有限且对延迟不极端敏感iSCSI 也能跑 vMotion 和 HA但文档明确写了 FC SAN说明目标场景对存储性能和可靠性要求较高。普通 PC Server 的角色通常是 vCenter Server 和 Lab Manager 的宿主不承载生产虚拟机所以配置可以低一些但建议也做 RAID1因为 vCenter 挂了虽然不影响运行中的虚拟机但管理功能全停恢复起来很麻烦。3. 从需求分析到拓扑落地一份可抄的部署流程3.1 需求分析阶段要采集哪些数据文档 2.1 节把需求分析放在方案设计的第一步但没展开具体采集项。按一线经验至少要把这几类数据拉出来现有物理服务器的 CPU 型号、核心数、主频、内存容量和实际利用率峰值存储的已用容量、增长速度和 IOPS 峰值网络的上行链路数量和 VLAN 划分业务系统的操作系统版本、依赖关系和维护窗口。这些数据决定了后面主机数量、存储容量和网络带宽的规划。比如一台数据库服务器 IOPS 峰值到 5000那共享存储的 IOPS 能力至少要按所有数据库虚拟机峰值之和来配不能只看容量。采集工具上Windows 环境可以用性能监视器抓 CPU、内存、磁盘队列长度Linux 用 sar 或 nmon。采集周期建议覆盖一个完整的业务周期至少两周包含月末或季末的高峰。文档里没写这些工具但这是做需求分析绕不开的步骤。采集完之后做整合比测算把 CPU 利用率低于 20% 的服务器标记为高整合候选20% 到 50% 的标记为中整合超过 50% 的谨慎整合或暂不整合。内存方面注意区分已分配和实际使用很多服务器分配了 32G 但实际只用 8G这种按实际使用量算。3.2 拓扑设计与 vCenter 部署文档 2.2 节给了方案拓扑图核心是一个 vCenter Server 管理多个 ESXi 主机主机通过 FC SAN 共享存储虚拟机在主机间可迁移。落地时 vCenter 的部署位置有讲究可以装在物理机上也可以装在虚拟机里。装在虚拟机里的好处是可以用 HA 保护 vCenter 自身但要注意启动顺序——如果 vCenter 所在的 ESXi 主机先挂了HA 需要先在其他主机上重启 vCenter 虚拟机然后 vCenter 才能管理其他虚拟机的 HA 操作。所以生产环境常见做法是 vCenter 装在虚拟机里但配置 DRS 规则把它固定在一组主机上并设置较高的重启优先级。ESXi 主机的安装没什么特别从 U 盘或 PXE 启动按提示走完就行。装完后第一件事是配置管理网络给每台主机一个固定 IP然后加入 vCenter。加入时要注意 DNS 正反向解析必须通否则 vCenter 会报证书或连接错误。存储方面先在 FC 交换机上划 zone让每台主机的 HBA 卡能同时看到存储阵列的端口然后在 ESXi 里添加存储格式化成 VMFS 卷。网络方面至少配两个物理上行链路做 Teaming管理网络、vMotion 网络、虚拟机网络分开走不同 VLAN避免 vMotion 的大流量把管理网络冲垮。3.3 虚拟机创建与模板化平台搭好之后第一台虚拟机建议手动装用来做模板。装的时候注意几点操作系统选精简版去掉不用的组件装 VMware Tools这是驱动和性能优化的基础如果是 Windows把页面文件设到独立磁盘上避免和系统盘抢 IO。装完后用 vCenter 的转换为模板功能把它变成模板后续所有同类型虚拟机都从这个模板克隆。文档 1.3 节提到 Lab Manager 可以快速创建和销毁环境原理就是模板加克隆Lab Manager 在这个基础上做了网络隔离和配置管理。克隆时选择自定义选项让 vCenter 引导你改主机名、IP、域信息这样出来的虚拟机不会和模板冲突。如果批量部署可以用规范管理器Specification Manager预先定义好规范克隆时直接套用。文档里没提规范管理器但这是 vCenter 自带的功能能省很多重复劳动。虚拟机磁盘格式上Thin Provisioning 按需增长适合大多数场景如果对性能有极致要求比如数据库的日志盘用 Thick Provisioning 的 eager zeroed 格式虽然占空间但 IO 延迟更稳定。4. 避坑与排查HA 不切换、vMotion 失败、存储告警的现场记录4.1 HA 配置了但主机故障后虚拟机没重启现象拔掉一台 ESXi 主机的电源等了五分钟上面的虚拟机没有在其他主机上重启vCenter 里显示 HA 集群状态正常。原因通常是 HA 的接入控制策略没配对或者主机被置入了维护模式但没选将虚拟机迁移到其他主机。另一个常见原因是隔离响应设置成了保持关机主机失联后自己关机了但虚拟机没被释放。解决检查集群的 HA 设置接入控制策略选集群允许的主机故障数并设成 1 或更高隔离响应改成关闭并重启虚拟机确认每台主机都分配了足够的 HA 预留资源如果预留不够HA 会拒绝重启虚拟机。4.2 vMotion 迁移到一半报错现象虚拟机 vMotion 到 80% 左右卡住然后报迁移超时或无法连接到目标主机。原因一般是 vMotion 网络不通或带宽不够。vMotion 流量走的是 VMkernel 端口如果这个端口和虚拟机网络混在同一个 VLAN 里大流量会被其他流量干扰。解决给 vMotion 单独划一个 VMkernel 端口和 VLAN最好用万兆链路检查源和目标主机的 vMotion VMkernel 端口是否在同一子网且能互相 ping 通如果用了分布式交换机确认端口组的安全策略没有阻止 vMotion 流量。另外虚拟机如果挂了 CD-ROM 且指向物理设备vMotion 也会失败把 CD-ROM 断开或改成客户端设备即可。4.3 存储卷显示不可访问或永久设备丢失现象ESXi 主机突然报某个 VMFS 卷不可访问上面的虚拟机全部暂停。原因可能是 FC 链路抖动、存储阵列控制器切换或 zone 配置变更。解决先看 HBA 卡的链路状态如果显示在线但存储不可见在 FC 交换机上检查 zone 是否被误改如果链路显示离线检查光纤线和 SFP 模块。存储恢复后ESXi 通常会自动重新挂载 VMFS 卷虚拟机需要手动重新注册。如果卷显示永久设备丢失不要急着格式化先在存储阵列上确认 LUN 还在然后在 ESXi 里重新扫描存储适配器多数情况下能恢复。4.4 虚拟机性能远低于物理机现象一台物理机迁移到虚拟机后CPU 和内存都够但应用响应明显变慢。原因通常是资源分配不合理或驱动没装。解决确认 VMware Tools 已安装且运行正常没装 Tools 的虚拟机网卡和磁盘驱动是模拟的性能差一大截检查虚拟机的 CPU 和内存预留是否设得太低如果设了限制虚拟机再闲也用不了更多资源检查存储的 IOPS 是否成为瓶颈用 esxtop 看 DAVG设备平均响应时间超过 20ms 就说明存储跟不上了考虑把虚拟机迁到更快的存储卷或调整阵列缓存策略。4.5 快照用多了导致存储爆满现象存储卷使用率突然从 60% 涨到 95%虚拟机操作变慢甚至暂停。原因通常是快照文件堆积。快照不是备份每打一次快照就生成一个增量磁盘文件虚拟机运行时间越长增量文件越大。解决定期检查快照用 vCenter 的快照管理器看哪些虚拟机有快照、创建了多久超过 24 小时的快照要评估是否还需要不需要的及时删除删除快照时如果虚拟机在运行ESXi 会在后台合并磁盘文件这个过程可能很慢且占 IO建议在维护窗口做。最好的习惯是快照只用于短期变更保护用完就删长期备份交给 Data Recovery 或企业备份软件。5. 异地容灾与验证SRM 切换演练和几个容易被忽略的参数文档 2.4.4 节把异地容灾列为可选部分但实际做方案时容灾往往是领导最关心的章节。VMware 的容灾方案核心是 Site Recovery ManagerSRM它和底层存储的复制功能配合实现虚拟机的自动化切换。SRM 的部署分两块受保护站点和恢复站点各装一个 SRM Server各自连本地的 vCenter 和存储阵列然后建立保护组和恢复计划。保护组定义哪些虚拟机要保护恢复计划定义切换顺序、网络映射和 IP 自定义规则。切换演练是容灾方案里最容易翻车的环节。常见问题是演练时虚拟机在恢复站点能启动但网络不通因为恢复站点的端口组名称和受保护站点不一致或者 IP 自定义规则没配对。SRM 的恢复计划里有一个测试模式可以在不影响生产的情况下在隔离网络里启动虚拟机验证恢复流程。建议每季度做一次测试演练每半年做一次真实切换演练。测试演练用 SRM 的测试功能真实切换则要停生产业务风险高但能暴露测试模式发现不了的问题比如存储复制方向反了、DNS 记录没更新。几个容易被忽略的参数恢复点的 RPO 取决于存储复制的周期如果存储是异步复制且周期 15 分钟那 RPO 就是 15 分钟SRM 改不了这个RTO 取决于虚拟机启动顺序和依赖关系数据库虚拟机要先于应用虚拟机启动这个顺序在恢复计划里用优先级定义网络映射里如果恢复站点的 VLAN ID 和受保护站点不同要在恢复计划里做映射否则虚拟机启动后网络不通。另外SRM 的占位虚拟机Placeholder VM在恢复站点会占用少量存储和计算资源规划时要算进去。验证方法上除了 SRM 自带的测试模式还可以用 vSphere Replication 做单虚拟机的复制验证。vSphere Replication 是 vSphere 自带的异步复制功能不依赖存储阵列适合没有同构存储的场景。配置时注意复制种子Seed的生成方式如果虚拟机磁盘很大第一次全量复制会很慢可以用种子盘提前拷到恢复站点再增量同步。复制周期最短 15 分钟RPO 要求更短的话只能上同步复制但同步复制对链路延迟要求很高通常只在同城双活场景用。从那以后我每次做容灾方案都会强制走一遍测试模式演练加恢复计划导出检查把恢复计划导成 XML 逐条核对虚拟机的启动顺序和网络映射这个习惯帮我拦下过好几次配置遗漏。希望帮到你。本文还有配套的精品资源点击获取
返回列表