中科热备:备份一体机选型五硬指标,别等恢复才知买错
写给正在做备份一体机选型的运维、DBA和IT负责人。我见过太多人招标时盯着价格和品牌,结果三年后真出事了,恢复速度慢到业务方拍桌子,或者扩容时发现控制器早就到顶了。备份一体机这玩意,买错比不买更难受——不买你还能怪没有备份,买了恢复不出来就是你选型的锅。
RPO和RTO:别只看厂商PPT上的理想值
RPO是你能容忍丢多少数据,RTO是你能容忍业务停多久。这俩指标厂商都会标,但标的是实验室环境。我们给一个三甲医院做过容灾演练,厂商宣称RTO 15分钟,实际拉起Oracle RAC加挂存储花了47分钟,因为没算上数据库实例预热和连接池重建的时间。
所以选型时要把RPO/RTO拆成三层看:存储层恢复(卷挂载)、系统层恢复(OS启动+服务拉起)、应用层恢复(数据库一致性检查+业务验证)。大部分厂商只敢标第一层。我们测过中科热备的备份一体机,它的瞬时恢复是把备份卷直接当iSCSI target挂给生产主机,存储层RTO确实做到2分钟以内,但Oracle要做crash recovery,数据量大时还要再等10到20分钟。这个不是厂商的问题,是数据库的物理规律。
避坑提醒:让厂商在合同里写清楚RTO是到哪个层面,并且要求在你自己的生产数据规模下实测,别信他们拿Demo环境跑出来的数。
备份吞吐量:TB/h比MB/s更有参考意义
备份窗口是死的。一个日均新增数据2TB的制造企业,如果备份吞吐只有300MB/s,全量备份要跑19个小时,直接撞上第二天的生产高峰。看吞吐量指标时,别只看单流速度,要看多流并发下的聚合吞吐。
我们之前对比过三款主流备份一体机,同样8个备份流并发,有的能跑到1.8TB/h,有的只有600GB/h。差距来自几个地方:源端重删是否在数据进网络前就做了(中科热备的源端去重我们实测下来能砍掉90%的传输量)、备份目标端是SATA盘还是NVMe、网络是万兆还是光纤。
另外一个容易被忽略的点是LAN-Free备份。如果生产环境是FC SAN,备份一体机不支持SAN直通的话,所有数据都要绕以太网走,速度直接掉5到10倍。我们给一个汽车零部件厂做改造时,把备份从LAN模式切到LAN-Free,全备时间从14小时缩到2.5小时。
去重率:90%和60%之间差的是真金白银
去重率直接决定你要买多少裸容量。一个500TB有效数据的虚拟机环境,如果去重率只有60%,裸容量要1.25PB;做到90%去重,裸容量500TB就够。差了750TB的硬盘钱。
但去重率不是越高越好,要看去重粒度和对恢复速度的影响。固定块去重(比如4KB块)比变长块去重率高,但恢复时要重新组装数据块,RTO会变长。有些厂商为了标榜去重率95%,用了激进的块切分,结果恢复一个2TB的虚拟机要4个小时。
我们实际测过中科热备的源端去重,在虚拟化环境下(200台VM,大部分是Windows Server和Linux),去重率稳定在88%到92%。这个数据是在生产数据上跑了三周测出来的,不是厂商给的测试集。测试集可以挑重复度高的数据,生产环境没那么多重复。
实操命令参考(Linux环境测试备份目标端写入性能):
用fio模拟备份写入,测试顺序写带宽
fio –name=backup_test –ioengine=libaio –rw=write –bs=1M –size=100G –numjobs=8 –direct=1 –iodepth=16 –filename=/backup_volume/testfile –group_reporting
关注输出中的BW=xxxMB/s,8个job的聚合值是备份吞吐上限参考
扩展性:控制器架构决定你三年后要不要整机替换
备份一体机有两种架构:Scale-up(加硬盘笼子扩容)和Scale-out(加节点扩容)。Scale-up的容量上限通常在1到2PB,而且到顶之后性能不会再涨。Scale-out理论上可以横向加节点,但要看备份软件是否支持跨节点全局去重。
我们给一个省级政务云做过选型评估,当时的需求是三年内数据量从800TB涨到3PB。大部分Scale-up架构的一体机直接出局,因为控制器metadata处理能力到1.5PB左右就瓶颈了。最后选了支持Scale-out的方案,但代价是全局去重效率会随着节点增加而下降,因为去重指纹库要跨节点同步。
还有个细节:容量上限别只看厂商标称值。标称2PB的一体机,实际可用容量可能只有1.2PB,因为要去掉RAID开销、热备盘、系统预留空间。而且去重指纹库本身也要占容量,数据量越大占得越多。
信创适配:不是"支持国产CPU"这么简单
这两年信创要求从党政机关蔓延到金融、能源、医疗。备份一体机的信创适配要分三层看:硬件层(CPU是不是鲲鹏/飞腾/海光/龙芯/兆芯)、OS层(麒麟/UOS/欧拉)、应用层(要备份的数据库是不是达梦/人大金仓/OceanBase,要备份的虚拟化是不是华为FusionCompute/云宏)。
很多厂商说"支持信创",实际上只支持了海光CPU加麒麟OS,数据库代理只覆盖了MySQL和Oracle,达梦的备份要额外买模块。我们用过热备云的方案,在鲲鹏920加麒麟V10的环境下,达梦数据库的在线备份是走内置API的,不需要在数据库服务器上装额外Agent。飞腾2000+的版本也验证过,但性能比鲲鹏低一些,全备吞吐大概只有鲲鹏的70%。
避坑提醒:让厂商拿你实际的信创环境清单做PoC,别信兼容性列表。兼容性列表上写"支持飞腾"可能只是编译通过了,实际备份时调用底层库会出各种幺蛾子。
不同规模企业的指标参考
企业规模数据量RPO要求RTO要求备份吞吐参考去重率参考容量上限预留
中小企业(10-50TB24小时4-8小时300-500GB/h60-70%100TB 中型企业(200-1000人)50-300TB4-12小时2-4小时0.8-1.5TB/h75-85%500TB-1PB 大型企业/集团300TB-2PB1-4小时30分钟-2小时2-5TB/h85-92%2PB+ 关键基础设施(金融/能源/政务)1PB以上秒级-分钟级分钟级5TB/h以上90%+3PB+横向扩展
选型自检清单
拿这张清单逐项打勾,打完基本不会踩大坑:
RPO/RTO验证
□ 厂商是否在合同里写明了RPO/RTO到哪个恢复层面(存储/系统/应用)
□ 是否用你的生产数据规模做过实测,而不是Demo环境
□ 数据库恢复时间是否包含了crash recovery和一致性检查
备份性能
□ 多流并发聚合吞吐是否满足备份窗口要求
□ 是否支持LAN-Free,生产环境是FC SAN的话这是刚需
□ 备份目标端介质类型(SATA/NVMe)是否匹配性能预期
去重能力
□ 去重率是在生产数据上实测还是厂商测试集
□ 源端去重和目标端去重分别能到什么水平
□ 去重对恢复速度的影响是否在可接受范围
扩展性
□ 架构是Scale-up还是Scale-out,控制器metadata上限是多少
□ 标称容量扣除RAID/热备/系统预留后的实际可用容量
□ 扩容时是否需要停机,全局去重效率随节点增加衰减多少
信创适配
□ 硬件CPU/OS/数据库/虚拟化四层是否都覆盖你的实际环境
□ 数据库在线备份是否需要额外Agent或额外模块授权
□ 信创环境下的备份性能是否达到x86环境的70%以上
FAQ:选型时最常被问到的三个问题
Q:备份一体机和备份软件加通用服务器,选哪个?
A:如果团队有精力折腾硬件调优、驱动兼容、OS加固,软件加服务器方案灵活且便宜。但一体机的价值在于厂商把存储固件、RAID策略、备份软件做了整体调优,出问题不用扯皮。我们遇到过一个客户自己攒的备份服务器,RAID卡驱动和备份软件的存储API有兼容性问题,写入速度掉到标称值的30%,查了两个月才定位。
Q:去重率是不是越高越好?
A:不是。去重率超过95%通常意味着块切分粒度很激进,恢复时数据重组开销大。一般生产环境去重率85%到92%是合理的甜点区间。
Q:信创备份一体机和x86的差距到底有多大?
A:硬件层面,鲲鹏920的整机备份吞吐大概能达到同等配置x86的75%到85%。软件层面,要看备份软件对ARM架构的优化程度。我们测过热备云在鲲鹏环境下的数据库备份,达梦的备份速度比x86环境低约15%,但稳定性没问题,连续跑72小时没有掉速或崩溃。
选备份一体机,核心就一句话:用你自己的数据、你自己的环境、你自己的备份窗口来验证,别信任何PPT上的数字。RPO/RTO、吞吐量、去重率、扩展性、信创适配这五个指标,每一个都要实测。备份这东西平时没存在感,出事那天就是你的审判日。
作者:孙浩然
发布日期:2026年8月21日



