数据中心的“可用性”常被等同于“可靠性”,甚至和“冗余”混为一谈。其实三者完全不同,搞错了可能花了大钱却办砸了事。
可靠性 ≠ 可用性
可靠性是组件在规定时间内正常工作的能力,用平均无故障时间(MTBF)衡量。而可用性通常用“几个9”表示,比如5个9代表每年停机约5.3分钟。但别被数字迷惑——6个9仍允许每年32秒中断,而对IT设备而言,超过20毫秒的断电就可能造成灾难。
冗余 ≠ 无缝切换
冗余是多部署一套备用设备,但不代表切换瞬间完成。比如备用发电机启动需要1030秒,这期间必须靠UPS撑住。冷却系统也有响应延迟,高密度设备可能只能扛1560秒。所以,冗余必须配合容错设计和快速切换机制,才能真正保障可用性。
别把“历史成绩”当“未来保障”
一个N+1冗余的设施可能五年无故障,而2N+1的设施第一年就可能断电。历史可用性数据不能代表未来表现,过度迷信硬件可靠性,反而会忽略更关键的控制和切换环节。
可用性的新思路:不止看硬件
传统的Tier分级只评估电力和制冷基础设施,但在虚拟化和多站点复制的今天,这远远不够。像Facebook、Google等超大规模运营商,硬件冗余级别并不高(有些甚至只是N或N+1),但凭借强大的软件故障切换和异地数据复制,整体可用性反而极高。
OSDA等新标准也在尝试把多站点数据复制纳入可用性评估,让企业可以用更低的基础设施冗余,换来更高的应用级可用性。
云计算不是“免检产品”
很多人默认云服务永远可用,但实际情况往往不透明。托管+云的混合模式正成为主流,评估可用性时必须把软件弹性、应用容灾和业务需求一并考虑进去。
极端案例是比特币矿场——设备连UPS和备用发电机都不配,一旦断电就停工,恢复后再继续。对他们来说,两个9的可用性已经足够划算。
说到底,“可用性”没有一刀切的标准。它取决于你的业务目标、成本预算和容错策略。与其盲目追求最高的Tier等级,不如想清楚:你的应用到底能容忍多久的中断?