简介:这份文档面向中小企业IT运维与架构人员,提供一套基于VMware的三台物理机服务器虚拟化落地方案,用于替换老旧物理设备、提升资源利用率并实现业务系统平滑迁移。文档围绕客户八台物理服务器的现状展开,涵盖资源使用统计、虚拟化架构设计、集群搭建、硬件与软件配置清单,以及高可用与动态扩展思路,并对比传统物理架构说明方案在节能、灵活性与管理简化上的优势。资源包共1个docx文件,约87KB,内容为完整方案文档,含目录、架构图与配置说明,便于直接参考或改编为项目方案。已有88人学习。读者可从中获取从现状分析、架构选型到配置清单的完整思路,理解如何用较少高性能服务器承载原有业务,并规划未来1至3年的扩展需求,适合需要撰写虚拟化方案或实施迁移的运维人员参考。
1. 三台物理机做虚拟化:为什么这个配置是很多中小团队的甜点区
三台物理机做服务器虚拟化,是很多中小团队在预算、机柜空间和运维人力三重约束下反复权衡后落地的方案。它不像单机跑 VMware Workstation 那样只是"玩票",也不像十几台起步的 vSphere 集群那样需要专职虚拟化工程师。三台机器刚好能撑起一套带高可用(HA)和 DRS 的 vSphere 集群:两台承载业务虚机,第三台做冗余和迁移目标,任意一台宕机,虚机自动在剩余节点重启。这个标题里的"完整方案",核心就是把物理机选型、ESXi 安装、vCenter 部署、存储与网络规划、集群策略这几件事串成一条能落地的链路。适合谁?手上有两三台闲置服务器、想从物理机直装业务转向虚拟化的运维,或者要搭一套测试/准生产环境的技术负责人。下面按我实际搭过的顺序讲清楚。
2. 物理机选型与 ESXi 安装:三台机器怎么配才不浪费
2.1 三台物理机的角色划分与硬件底线
三台机器不是简单堆三台一样的就行,角色要先定清楚。常见做法是:两台配置相同作为计算节点(跑业务虚机),第三台可以配置略低,作为管理节点兼冗余计算节点,vCenter Server 就装在这台上(用 VCSA 虚拟化部署)。这样任意一台计算节点挂了,虚机有地方迁移。
硬件底线我一般按这个来卡:
| 项目 | 最低可用 | 推荐 | 说明 |
|---|---|---|---|
| CPU | 8 核支持 VT-x/AMD-V | 16 核以上 | 必须开 BIOS 里的虚拟化开关 |
| 内存 | 64GB | 128GB 起 | 虚机内存超分别超过 1.5 倍 |
| 系统盘 | 2 块 SSD 做 RAID1 | 同左 | ESXi 装这里 |
| 数据盘 | 本地 SSD/NVMe | 视业务 | 无共享存储时用 vSAN |
| 网卡 | 2 口千兆 | 2 口万兆 | 管理+业务+vMotion 分开 |
三台机器如果没有共享存储,最省事的方案是用 vSAN 把三台的本地盘聚成一个分布式存储池。vSAN 最少三节点,正好卡在这个配置上。注意 vSAN 对磁盘控制器有兼容性要求,选型前一定去兼容性列表里对一下型号,别买回来发现控制器不在列表里,这是血泪经验。
2.2 制作 ESXi 安装盘并完成首次安装
ESXi 的安装本身不复杂,但几个选项选错后面会翻车。先做启动盘:
# 用 Rufus 或 dd 把 ESXi ISO 写入 U 盘(Linux 下示例) # 确认 U 盘设备名,别写错盘 lsblk # 假设 U 盘是 /dev/sdb,写入(会清空该盘) sudo dd if=VMware-VMvisor-Installer.iso of=/dev/sdb bs=4M status=progress oflag=sync逻辑说明:dd把 ISO 原样写入 U 盘,oflag=sync保证写完再退出,避免拔盘时数据没落盘。参数上bs=4M是块大小,太小会慢,太大没必要。写完插到物理机上,进 BIOS 设置 U 盘启动。
安装过程里几个关键选择:磁盘选那块做 RAID1 后的逻辑盘;键盘布局默认美式即可;root 密码设复杂点,这是后面 SSH 和 vCenter 纳管的凭据。装完重启,机器会显示 DCUI 界面,用刚才的密码登录,配置管理网络:
Configure Management Network -> IP Configuration: 静态 IP,比如 192.168.10.11 -> DNS Configuration: 填内网 DNS -> 保存后重启管理网络三台机器分别配 192.168.10.11、.12、.13。配完在浏览器访问https://192.168.10.11就能看到 ESXi 的 Host Client 界面。这一步做完,三台独立的 ESXi 主机就立起来了,但还各自为战,需要 vCenter 把它们管起来。
3. 部署 vCenter 并纳管三台主机:集群的骨架怎么搭
3.1 VCSA 部署的两种方式与选型
vCenter Server 现在都是 VCSA(vCenter Server Appliance)形态,本质是一个 Photon OS 的虚机。部署方式有两种:一种是装在一台临时 ESXi 或 Workstation 上,再把 VCSA 迁到集群里;另一种是直接部署到已经纳管的主机。三台物理机的场景,我一般先把 VCSA 部署到第三台(管理节点)的 ESXi 上,再逐步把三台主机加进这个 vCenter。
部署用 VCSA 安装包里的 Installer,图形化向导走下来。关键参数:
- 部署目标:第三台 ESXi 的 IP、root 凭据
- 虚机名称:vcsa-01
- 网络:临时 IP 用于部署,之后设固定 IP
- SSO 域:默认
vsphere.local,密码记牢,这是登录 vCenter 的凭据 - 规模:三台主机选"小型"就够,别选大了浪费资源
部署完访问https://vcsa-ip:5480是设备管理界面,https://vcsa-ip/ui是 vSphere Client。这两个地址别搞混,5480 管设备本身(改 IP、打补丁、看服务状态),ui 才是日常运维入口。
3.2 把三台 ESXi 主机加入集群并配置 DRS
登录 vSphere Client,新建数据中心,再新建集群。集群建的时候有两个开关要开:
集群 -> 配置 -> vSphere DRS -> 打开 集群 -> 配置 -> vSphere HA -> 打开DRS 负责虚机在主机间的负载均衡,HA 负责主机故障时虚机自动重启。三台机器的集群,DRS 建议先设成"半自动",让它给迁移建议但由你确认,观察一段时间再改全自动,避免它半夜自己乱迁把业务搞出抖动。
纳管主机:右键集群 -> 添加主机,填 ESXi 的 IP、root 凭据,一路下一步。三台都加进来后,集群里能看到三台主机的 CPU、内存汇总。这时候可以验证一下 HA 是否生效:随便找一台主机,把电源拔了(测试环境),看虚机是否在另外两台重启。生产环境别这么干,用"模拟故障"或者直接看 HA 的配置状态就行。
3.3 网络与存储的规划要点
网络这块,三台机器至少要有这些网络类型:管理网络(vMotion 也走这个或单独走)、虚机业务网络、vSAN 网络(如果用了 vSAN)。标准交换机够用,但如果有条件上分布式交换机(vDS),迁移虚机时网络配置能跟着走,省事。
存储如果不用 vSAN,就得考虑共享存储。三台物理机接一台 iSCSI 或 NFS 存储是最稳的,虚机文件放共享存储上,HA 和 vMotion 才有意义。用本地盘的话,虚机没法跨主机迁移,HA 也受限。这是很多人第一次搭会忽略的点:没有共享存储,HA 基本是摆设。
4. 虚机创建与模板化:把重复劳动压到最低
4.1 从 ISO 装第一台虚机并装 VMware Tools
集群搭好后,先建一台虚机验证整条链路。右键主机 -> 新建虚拟机 -> 创建新虚拟机,选客户机操作系统(比如 Windows Server 或 Ubuntu),配置 CPU、内存、磁盘、网络。装系统过程跟物理机一样,挂 ISO 走安装。
系统装完第一件事是装 VMware Tools,它提供驱动、内存气球、心跳等,对性能和 HA 判断都关键。Linux 下:
# 挂载 VMware Tools 的虚拟光驱后 mount /dev/cdrom /mnt tar -zxvf /mnt/VMwareTools-*.tar.gz -C /tmp cd /tmp/vmware-tools-distrib sudo ./vmware-install.pl -d-d表示全部用默认选项,省得一路回车。装完重启,systemctl status vmtoolsd能看到服务在跑就对了。Windows 下更简单,光驱里直接双击安装。
4.2 把配好的虚机转成模板批量部署
一台台装系统太慢,标准做法是配好一台"黄金镜像",转成模板,之后克隆。转模板前先做 sysprep(Windows)或清理机器 ID(Linux),否则克隆出来的机器 SID 或 hostname 冲突。
右键虚机 -> 模板 -> 转换为模板 之后右键模板 -> 新建虚拟机 -> 从模板部署从模板部署时可以选"自定义",改 hostname、IP、加入域等。这一步把装系统的时间从一小时压到几分钟。注意模板别乱改,改之前先克隆一份出来改,模板本身保持干净,这是后悔药。
5. 避坑与排查:三台物理机方案里最容易翻车的几件事
5.1 现象:ESXi 装完进不去,报"此平台不支持虚拟化的 AMD-V"
原因:BIOS 里 CPU 虚拟化开关没开,或者开了但被其他设置覆盖。AMD 平台常见,Intel 平台对应的是 VT-x。
解决:进 BIOS,找 SVM Mode(AMD)或 Intel Virtualization Technology,设为 Enabled。有些服务器还有"嵌套虚拟化"选项,如果要在虚机里再跑虚机才需要开,普通场景不用。改完保存重启,DCUI 里能看到 CPU 支持虚拟化就对了。
5.2 现象:vCenter 部署到一半失败,提示证书或网络问题
原因:VCSA 部署对 DNS 正反向解析有要求,临时 IP 和最终 IP 不一致时容易出问题;或者部署目标主机的证书过期。
解决:部署前先把 DNS 记录建好,正反向都能解析。如果 vSphere Client 证书过期登不进去,应急办法是 SSH 到 VCSA,用shell进命令行,执行证书修复命令,或者临时把系统时间调回证书有效期内登进去再换证书。这是应急手段,事后一定要把时间同步(NTP)配好,否则证书还会过期。
5.3 现象:HA 开了但主机宕机后虚机没重启
原因:最常见的是没有共享存储,虚机文件在故障主机的本地盘上,其他主机访问不到;其次是 HA 的接入控制策略设成了"不预留",资源不够时不重启。
解决:确认虚机文件在共享存储或 vSAN 上;检查集群 HA 的"接入控制"策略,改成"集群资源百分比"并留出足够预留。三台机器的集群,预留 25% 左右比较稳。
5.4 现象:虚机迁移(vMotion)失败,报网络不通
原因:vMotion 网络没配,或者源和目标主机的 vMotion VMkernel 网卡不在同一网段。
解决:每台主机都要有一个 VMkernel 网卡勾选 vMotion 服务,且三台的 vMotion 网段互通。用 vDS 的话检查端口组配置是否一致。迁移前用 vmkping 测一下源到目标 vMotion 地址通不通。
5.5 现象:vSAN 磁盘组创建失败,提示磁盘不在兼容列表
原因:用了 RAID 卡但没设成直通(HBA)模式,或者磁盘型号不在 vSAN 兼容性列表里。
解决:进 RAID 卡配置,把要用于 vSAN 的盘设成 JBOD/直通模式;选型阶段就去兼容性列表查型号。已经买了不在列表里的盘,只能换或者改用其他存储方案,别硬上。
6. 进阶:用 DRS 规则和资源池把三台机器的性能榨干
三台机器的集群规模不大,但把 DRS 规则用好了,能明显提升稳定性和资源利用率。我一般会配两类规则:一是"应分开"规则,把互为冗余的两台虚机强制分到不同主机,避免一台主机挂了两个都停;二是"应在一起"规则,把通信频繁的虚机放同一主机,减少跨主机流量。
资源池方面,别一上来就切得很细。三台机器的场景,按业务线分两三个资源池就够,每个池设好 CPU 和内存的预留与上限。预留给多了浪费,给少了争抢。我的习惯是:关键业务池预留 50%,普通业务池不预留但设上限,防止它把资源吃光影响别人。
验证 DRS 是否在干活,看集群的"监控 -> vSphere DRS"里的迁移记录,或者看每台主机的 CPU/内存均衡度。如果长期一台忙两台闲,说明 DRS 没生效或者规则设反了。
最后说个具体技巧:三台机器的集群,把 vCenter 本身也当成一个需要保护的工作负载。VCSA 虚机建议放在管理节点上,并给它配 HA 重启优先级"高",这样管理节点挂了,vCenter 能优先在别的主机起来,不至于连管理界面都进不去。这个细节很多人搭完才想起来,属于典型的踩坑后补课。
我自己搭这类三节点集群,最大的教训是别急着上生产,先用测试虚机把 HA、vMotion、DRS 各跑一遍故障演练,确认行为符合预期再迁业务。虚拟化这东西,配置错了平时看不出来,真出事的时候才发现 HA 是摆设,那时候就晚了。希望帮到你。
本文还有配套的精品资源,点击获取