做这单采购之前,我对着机房角落那台服役六年的老塔式服务器发了好一会儿呆。机器倒是还能开机,可风扇噪音跟拖拉机差不多,内存只有16G,硬盘还是两块老式机械盘,别说跑虚拟化了,光Windows系统更新就能卡半天。公司这次同意拨预算采购三台服务器,说实话我是松了一口气的——基础设施这块欠账太多,再不补课,后面业务但凡涨一点,最先崩掉的就是IT系统。
这篇内容就围绕“三台服务器采购”这件事,把我从需求分析、硬件选型、商务对比、到货验收到上架部署的全过程掰开来说。三台机器说多不多,说少不少,采购决策做对了,能管三到五年的业务承载;做错了,轻则噪音扰民、运维闹心,重则数据丢失、业务中断。这篇适合准备给公司、实验室或团队采购服务器的运维、开发、IT负责人参考,也可以让刚接触物理服务器的同学少走弯路。
1. 采购之前,先把三台机器的布局想清楚
1.1 三台服务器最常见的三种用途划分
很多人一上来就盯着CPU、内存、硬盘的型号比价格,其实最应该先想明白的是:这三台机器买回来,到底是按什么架构去跑业务。架构没定,配置全是空中楼阁。
我接触过的中小规模服务器采购,三台机器最常见的用途划分是三种。
第一种是虚拟化集群。三台服务器都装上VMware ESXi或Proxmox VE,组一个高可用集群,跑公司内部的OA、ERP、文件服务器、开发测试环境。三台的好处是能满足“奇数节点”的集群要求,配合共享存储或分布式存储,一台挂了另外两台还能顶上。用这种方案,三台机器配置要尽量一致,这样虚拟机才能无缝漂移。
第二种是应用、数据库、备份三层分治。一台跑Web应用或业务系统,一台跑数据库,一台做备份、文件归档或者日志收集。这种布局对单台机器的性能要求高,但对集群一致性没要求。适合业务系统不多但数据要分权分域、备份要独立的中小公司。
第三种是一台控制节点加两台计算节点,常见于超融合架构或者GPU计算场景。控制节点管调度和管理面,两台计算节点做实际业务承载,后面想扩容就继续加计算节点。
我当时选的是第一种,三台同配置的机器组虚拟化集群。原因是公司业务类型比较多,有成套的应用系统要跑,还有开发环境、测试环境、临时环境,虚拟化最能平衡资源利用率,也方便做快照和备份。这里也是热词里“服务器虚拟化”“服务器集群”最集中的场景。
1.2 需求评估怎么做,别凭感觉拍脑袋
需求评估的核心是四个字:量化负载。别听厂商销售一张嘴“这个配置吊打所有”,也别信网上的“服务器cpu天梯图”排名高就一定好,得拿公司的真实负载来算。
我当时做了这么几件事:
- 盘点现有服务。把所有需要跑起来的系统列出来,包括每套系统的用户量、高峰期占用、数据量、增长趋势。
- 查看现有机器负载。用性能监控工具把旧服务器的CPU占用率、内存峰值、磁盘IO读写的曲线调出来,看过去两周的峰值和平均。
- 留出缓冲。虚拟化层的开销、备份窗口的资源占用、未来的增长空间,这些都要算进去。
我这里给一个参考算法。假设公司有50个员工,部署了OA、文件共享、项目管理系统,外加开发测试环境。现有机器高峰期CPU平均占用在60%左右,内存占用在12G上下。三台同配置虚拟化主机,每台最少保证:两颗物理CPU(10核以上)、64G内存起步、两块480G SSD做虚拟化系统盘与热数据、四块8T企业级机械盘做数据存储,这样整体跑下来会比较从容。
个人经验是:CPU宁可多留30%余量,内存直接往128G考虑,硬盘要按三年数据增长量来买,千万别按当前数据量买。服务器的CPU通常不好临时加,内存倒是可以后期扩容,但机箱插槽和预算限制了,最好一次到位。
2. 硬件配置选型,价格差异全在这些细节里
2.1 CPU、内存、硬盘到底怎么选
服务器采购的报价单,外行看型号,内行看细节。我逐项说下这次被我翻来覆去抠的重点。
CPU
服务器CPU的选择不是看频率高不高,而是看核心数、缓存、支持的内存通道数和功耗。热词里提到的“服务器cpu天梯图”只能帮你了解大致型号段位,但实际选型要看用途。
- 虚拟化集群:核心数优先,频率其次。比如同样是两颗CPU,32核2.0GHz可能比16核3.2GHz更适合虚拟化,因为虚拟机多,并发线程多。
- 数据库或高频交易类应用:频率优先,单核性能要强。
- GPU计算节点:CPU只要够用就行,重点在PCIe通道数和GPU卡兼容性。
我这次选的是两颗主流的至强系列CPU,单颗16核,基础频率2.4GHz,不支持超频。整体算下来,跑虚拟化的CPU利用率能压在40%到50%之间,比较健康。
内存
服务器内存必须带ECC纠错功能,这是和台式机内存最大的区别。长期运行的内存出现一个bit翻转,如果是普通内存可能直接导致系统崩溃,ECC内存会自动修正。容量方面,虚拟化集群的内存规划我是这么算的:
- 现有所有业务系统内存总量加在一起,按15%的虚拟化开销计算基础值;
- 留出至少20%余量给突发峰值和未来的新虚拟机;
- 每台物理机宁可多插几条内存,也不要卡在临界点。
所以每台128G是我对比后的最终选择。内存插满8条16G,还是4条32G,也要看主板的通道数和后续扩容空间。我建议内存插法尽量满足CPU的多通道均衡,比如单颗CPU支持8通道,就别插4条了事,插满对应通道数,内存带宽才能跑满。
硬盘
硬盘是这次采购里坑最深的部件,没有之一。服务器硬盘要分清楚SATA、SAS、NVMe,还要分企业级和消费级,价格差距巨大。
- 系统盘:两块480G企业级SATA SSD,做RAID 1,操作系统和虚拟机系统文件都放上面。
- 数据盘:四块8T企业级SATA机械硬盘,做RAID 10或者RAID 5,存放虚拟机数据和备份。
- 高速缓存盘:如果预算允许,可以加一块NVMe SSD做缓存加速,提升随机读性能。
这里要特别提醒:不要图便宜买消费级SSD放在服务器里用。消费级SSD没有断电保护、写寿命短、持续写入会掉速,服务器场景下故障率高很多。我这次是直接问供应商要了企业级硬盘的型号,然后去官网核对过,这一步很关键。
阵列卡
阵列卡是服务器数据安全的核心部件,却经常被采购忽略。热词里专门有“服务器磁盘阵列怎么做”和“在现有win服务器系统上提取raid驱动程序文件”,可见官方系统装机前最头疼的就是阵列卡驱动。
不同阵列卡的区别主要在三块:
- 是否支持硬件RAID;
- 缓存大小及是否带断电保护模块;
- 支持的RAID级别。
我选了带1G缓存和超级电容保护的主流阵列卡,支持RAID 0/1/5/6/10。有缓存阵列卡在RAID 5下写性能会好很多,而且断电时缓存数据不会丢。这个对于数据安全来说是必选项,不是可选项。
2.2 品牌机、白牌机和二手服务器怎么权衡
谈到服务器采购,绕不开品牌选择。市面主流的有戴尔、惠普、联想、浪潮、超微、H3C这些。每个品牌在同配置下价格差异可能达到10%到20%,但区别不只在价格上。
品牌机的优势是稳定性和售后。戴尔和联想的服务器,部件兼容性验证做得比较全,固件更新及时,出现硬件故障一个电话就有工程师上门。对于没有专职硬件运维人员的团队,这钱不能省。
白牌服务器就是用超微等厂家的准系统自己搭配CPU、内存、硬盘。价格确实便宜,但出了问题要学会自己排查,固件和驱动也得自己找,适合有一定运维能力的团队。
二手服务器就更考验人了。虽然二手市场能淘到高配置低价格,但服务器通常是7x24小时运行的老家伙,电源老化、电容鼓包、风扇损耗都是风险。我之前见过一个公司贪便宜买三台二手服务器,用了半年坏两块硬盘,数据恢复花的钱比省下的还多。
如果让我给建议:核心业务跑数据、公司没有专职硬件工程师,选品牌机加三年7x24上门服务。预算确实紧或者本身就是测试环境,可以拿一台白牌试水,但别把重要数据押上去。
2.3 电源、网卡和其他看似不起眼的部件
电源和网卡在报价单里容易被忽略,但真到部署的时候才会发现它们的价值。
电源方面,服务器标配要1+1冗余电源,也就是两颗电源同时工作,其中一颗坏了,另一颗能顶住整台服务器的功耗。电源功率按整机峰值功耗再预留30%-50%来选。我这次选的服务器是550W冗余电源,对两颗CPU加八块硬盘的配置来说足够了。另外要注意电源的电压范围,如果机房电压不太稳,最好加一个UPS。
网卡方面,虚拟化集群强烈建议两块千兆网口以上,最好预留万兆接口或者直接配双口万兆。三台服务器组虚拟化集群,如果存储是分布式的,数据流量都走网络,千兆网卡会成为瓶颈。我这次给每台服务器配了双口千兆做管理,再加双口万兆做数据存储网络,网口数量是足够的。
其他容易被忽略的还有:
- 远程管理卡:俗称IPMI/BMC/iDRAC/iLO,可以远程开关机、看屏幕、挂载ISO装系统。这个功能必须要有,不然每次折腾服务器都要跑到机房插显示器,运维效率太低了。
- 机架导轨和理线架:如果服务器要上机架,导轨是必买的,不然定位器不匹配,机器根本装不进去。
- 面板钥匙、标签贴纸、电源线长度:这些细节别看小,现场部署的时候缺一个都会耽误半天。
3. 商务采购流程,报价单里藏着哪些坑
3.1 一份靠谱的报价单应该长什么样
服务器采购不是“选好型号直接付款”,正规流程是:需求沟通、出配置方案、技术评审、商务比价、签合同、到货验收。但实际操作中,90%的人都倒在了“比价”这一环节,因为不同供应商给的报价单,配置描述完全不是一个颗粒度。
我拿自己的经验,说下报价单一定要核对的几个字段:
- CPU型号:必须具体到型号和主频,不能只写“至强处理器”。
- 内存:必须写明单条容量、条数、频率、是否ECC。比如“16G DDR4 ECC 3200MHz x 8条”,而不是“64G内存”。
- 系统盘/数据盘:必须写明容量、接口类型、是否企业级、具体品牌型号。
- 阵列卡:必须写明型号、缓存大小、是否支持掉电保护,支持哪些RAID级别。
- 电源:必须写明功率、是否冗余。
- 远程管理卡:是否标配、是否要额外许可费。
- 保修:必须写明保修年限、服务级别、是否上门、响应时间。
- 配件:是否包含导轨、电源线、理线架。
一个容易踩的坑是“含税含运费”和“不含”的区别。报价单上如果不写清楚,到货之后发现要单加运费和安装费,预算直接超支。
我还遇到过一次,供应商给报的价格特别低,仔细一对照发现阵列卡用的组装卡,硬盘用的是消费级SSD,电源也降成了单电源。这些问题你不逐条核对,等设备到了开机才会发现,那时候再扯皮就非常被动。
3.2 比价与谈判的经验
同样的配置,不同供应商的报价可能差一两成。除了品牌本身溢价,渠道优势、库存周期、是否原装正品,都会影响价格。我这次一共要了四家供应商的方案来对比:两家是原厂代理商,一家是系统集成商,还有一家是做二手翻新的。
四家对比下来发现一个规律:代理商报价里水最深的是“服务费”和“安装调试费”。有些供应商把服务费摊在配件里,有些直接单列。单列其实好办,能砍;摊在配件里,你根本分不清这个价格到底合理不合理。
谈判的时候有几个技巧可以分享:
- 明确告诉供应商你有三家比价,价格能更实在一些;
- 把配置写成技术规格书,让所有供应商按同一份文档报价,方便横向比;
- 保修期要写在合同里,不是写在口头承诺里;
- 要求供应商提供原厂序列号和配件编号,到货后可以逐项核对。
我最后选择了一家原厂授权代理商,三台同配置的机器,报价比另一家便宜了6%,还争取到了免费的导轨和上门安装。这一步不能省。
4. 到货上架与系统部署,全程实操记录
4.1 上架前的硬件自检与远程管理配置
服务器到货后别急着开机装系统,先做一轮硬件自检和固件更新。
我在物流签收的时候,先检查了外包装有没有严重变形,打开之后对着装箱单核对主机、导轨、电源线、说明书、合格证、序列号标签。序列号尤其重要,后面保修全靠它。开机之前把所有硬盘、内存条、阵列卡、网卡的物理安装情况都检查一遍,确认没有运输松动。
第一次通电开机,我等到机器自检完成,进入BIOS界面,先确认CPU、内存容量、硬盘是否全部被识别,然后进入远程管理卡界面,把管理口的IP地址配置成内部管理网段,设置好管理员密码。这一步非常重要,因为后面不管是在办公室还是在家,只要网络通,都能远程看到服务器状态。
我这里列一下新机器上架的基本操作顺序:
- 安装导轨,按机架U位高度把服务器推入机架,接好电源线和网线;
- 通电开机,进入BIOS/管理界面,核对硬件信息;
- 为每台服务器设置专属的管理IP和主机名,避免后续混淆;
- 将固件升级到最新版本,包括BIOS、阵列卡固件、网卡固件、远程管理卡固件;
- 设置风扇策略、电源策略,然后关机准备安装系统。
固件更新这个环节容易被跳过。但服务器出厂时的固件版本不一定是最新,阵列卡驱动可能跟最新系统不兼容。HP、Dell、联想都提供官方固件更新镜像,直接在远程管理界面挂载ISO更新就行。
个人经验:固件更新要一台一台来,别三台同时更新。万一一台更新失败,至少还有另外两台可以对比排查。更新过程中千万不能断电,否则可能变砖。
4.2 磁盘阵列怎么做,RAID级别选择与实操
热词里“服务器磁盘阵列怎么做”被搜到很多次,说明这是新手最迷茫的地方。我详细说下这次RAID创建的完整过程。
我先说一下RAID级别的选择逻辑。服务器数据盘我采用的是四块8T硬盘,在RAID 5和RAID 10之间选。
- RAID 5:可用空间是3块盘的容量,允许坏一块盘,空间利用率75%,写性能有校验开销。
- RAID 10:可用空间是2块盘的容量,允许一组镜像中各坏一块,空间利用率50%,读性能和重建速度更快。
如果是数据库一类的随机读写业务,RAID 10更稳;如果是文件存储、备份这类顺序读写业务,RAID 5性价比更高。我这次因为虚拟化里同时跑数据库和文件服务,最终折中选用了RAID 10,虽然空间少了一些,但性能和数据安全性都更好。
具体创建RAID的步骤,不同阵列卡界面不一样,但核心逻辑相同。我以主流的LSI/Broadcom阵列卡为例:
- 开机自检时按提示进入阵列卡配置界面,一般是Ctrl+R或者F5;
- 在逻辑盘管理界面选择新建逻辑盘;
- 选择RAID级别,我这里选RAID 10;
- 把四块8T硬盘全部选中;
- 设置条带大小,一般默认或者64KB即可;
- 初始化类型选快速初始化,然后确认创建;
- 创建完成后,确认逻辑盘状态正常,再开始安装系统。
系统盘的两块480G SSD我单独建了一个RAID 1逻辑盘,用作系统启动盘。这样系统盘和数据盘在阵列卡里是两个独立的逻辑盘,即使系统盘损坏,数据盘还在,恢复起来更安全。
注意:创建RAID时如果盘上有旧数据,一定要先备份。阵列创建过程会清空盘上的所有数据。另外,阵列初始化最好在装系统之前完成,不然系统装到一半发现阵列状态异常,会很麻烦。
4.3 操作系统安装与阵列驱动的坑
装系统算是采购流程里最后一道技术活。三台机器我准备装统一的Linux系统,考虑到稳定性和社区支持,选了Ubuntu Server LTS版本。
如果是装Linux,市面主流发行版对常见阵列卡都有内置驱动,一般不需要额外加载。我这次阵列卡是比较主流的型号,Ubuntu安装镜像直接就能识别,一路下一步就行。
但如果选Windows Server,很可能遇到热词里提到的“在现有win服务器系统上提取raid驱动程序文件”的经典问题。Windows安装时如果识别不到硬盘,多半就是缺阵列卡驱动。解决方法是有两种:
- 从阵列卡厂家官网下载驱动,解压后得到inf、sys文件,放到U盘里,Windows安装界面加载驱动即可;
- 如果手上只有一台能正常运行的Windows系统,可以用工具把厂商的驱动安装包解包,人工提取出inf和sys文件,再拷到U盘。
这一步没处理好,Windows装系统会一直卡在“找不到驱动器”的界面,非常让人崩溃。
系统装完之后,还有几步基础配置不能省:
- 更新系统补丁和安全源;
- 设置主机名、静态IP、DNS、网关;
- 配置SSH远程登录,并改成密钥认证;
- 配置防火墙,只开放必要端口;
- 配置时区和时间同步服务,指向国内可靠的时间服务器;
- 设置统一的管理账号和审计日志。
4.4 服务器时间同步不能忽视
热词里“时间服务器”“windows时间服务器地址”“怎么检查校时服务器的123端口是否别关闭”频繁出现,说明时间同步是所有服务器运维都会碰到的问题。
服务器时间不准,影响的不只是日志时间错乱,还会引发更严重的问题:认证失败、证书过期、分布式系统数据不一致、定时任务执行混乱。如果三台虚拟化主机时间都不一致,虚拟机的时钟会乱成一锅粥。
Linux下我用chrony做时间同步。安装完成之后,编辑/etc/chrony/chrony.conf,指定一个可靠的时间服务器地址,然后重启服务并查看同步状态。判断同步是否成功,最常用的命令是chronyc tracking,能显示当前时间源、偏差和同步状态。
如果发现时间一直同步不上,先检查123端口是否被防火墙挡了。命令可以用ss -ulpn | grep 123,或者直接用chronyc sources -v看时间源的同步状态。如果显示reach为0,说明本机到远程时间服务器的UDP 123端口不通,要去防火墙或者云安全组放行。
Windows服务器也一样,配置NTP服务器地址后在cmd里运行w32tm /resync强制同步,再用w32tm /query /status查看状态。
经验之谈:在虚拟化环境里,时间同步最怕的是客户机时钟和宿主机时钟互相拉扯。最好让所有物理宿主机统一走NTP,虚拟机里也统一指向同一个NTP源,避免“两层时钟源”互相干扰。
5. 现场问题的排查与实战记录
5.1 RAID相关问题:硬盘掉盘、缓存策略、初始化状态
这次部署过程中,三台服务器里有一台RAID创建后,过了两天居然出现硬盘状态告警,阵列变成了降级状态。排查下来发现是因为硬盘背板的连接线松动,重新插拔后重建阵列就好了。这里给大家提个醒:服务器机箱内部件多,运输过程中的震动真的会导致硬盘、内存、阵列卡线缆松动,新机器第一次上电前一定要把所有连接器按紧。
另外一个常见问题是阵列卡的缓存策略。如果阵列卡有缓存但没有超级电容保护,千万不要开写缓存。没有掉电保护的写缓存一旦断电,缓存里没来得及写入硬盘的数据会全部丢失,比坏一块硬盘还惨。我这次阵列卡有电容保护,才敢开启写缓存,否则都是设成直写模式。
5.2 远程管理卡的网络排查
服务器部署时,我发现其中一台远程管理卡可以ping通,但页面就是打不开。排查步骤是:
- 检查管理口和业务网口是否搞混了,有些服务器管理口是独立的,需要单独配IP;
- 检查浏览器访问协议,有些老版本管理卡需要HTTP,不是HTTPS;
- 试试换个浏览器或者清缓存,管理卡Web界面兼容性经常不行;
- 如果还不行,直接在服务器本地接显示器进管理卡命令行,重置网络配置。
最后发现是浏览器对老版本TLS证书不信任,换了个浏览器解决。这里提醒各位,远程管理卡拿到手第一件事就是升级固件,很多奇奇怪怪的问题刷完固件就好了。
5.3 部署后日常使用中容易踩的坑
三台服务器装完跑了一段时间,我把常见的“后续问题”也提前总结一下,方便用到的同学有个预期。
第一,SSH或远程工具连不上服务器。排查顺序必须是:本机网络通不通、目标服务器端口通不通、服务有没有监听、防火墙放行没有。用一条命令就能查:ssh -v user@ip,它会打印详细的连接日志,能定位到到底是网络层问题还是认证层问题。
第二,数据库或Web服务连不上。很多时候不是程序本体出问题,而是服务器防火墙、Netfilter规则或者SELinux没放行端口。排查时先用curl或telnet测试端口,再去看服务日志。
第三,虚拟化主机负载忽高忽低。一般不是硬件问题,而是某个“吵闹的邻居”虚拟机占用了绝大部分资源。在虚拟化管理界面里按资源占用排序就能快速定位。
第四,时钟漂移。虚拟化环境时间同步问题非常常见。我之前排查过一台虚拟机时间越走越快的故障,最后发现是宿主机的时间源没有配置好,修好宿主机时间,虚拟机时间也正常了。
5.4 关于后续备份和监控的建议
采购三台服务器只是起点,服务器运维重在日子怎么过。三台物理机如果只是各自独立跑业务,没有备份策略和监控报警,出了问题再补救就很被动。
我给这套环境配了一个简单的方案:物理机层面,三台机器的远程管理卡配置了告警邮件;虚拟机层面,所有重要系统都启用了定期快照和异地备份;存储层面,关键数据除了RAID保护外,再定期往备份服务器或NAS推一份。
监控方面可以选开源工具,比如Prometheus加Grafana,或者Zabbix。重点监控CPU、内存、磁盘空间、磁盘健康状态、网络流量、温度。三台机器的机房环境,温湿度探头如果预算允许也建议装一个,服务器最怕的就是闷热和灰尘。
这套基础设施撑个三五年问题不大,后面真要扩展,再加节点、加存储就行。采购决策最忌讳的就是“这次买完不管了”,把运维监控、备份恢复、文档记录这些配套做好,服务器才能真正成为稳定的底座。
我个人在这次采购里最大的体会是:三台服务器的钱其实不算大头,真正花时间的是需求梳理和现场踩坑。如果时间能倒流,我一定在采购前就把网络拓扑、IP规划、管理口地址、标签规范、备份策略全部写好,然后贴在机房柜门上。你要相信,设备到位只是开始,后续能把它们稳稳地管住,才是一个运维真正的本事。