1.
概述:为什么要做企业级容灾
① 香港机房集中导致单点风险高,发生故障或被炸(大流量攻击)可能造成业务中断。
② 容灾目标应明确:RTO(恢复时间目标)与RPO(恢复点目标)。示例:RTO ≤ 30 分钟,RPO ≤ 15 分钟。
③ 平衡成本与可用性:本地热备、异地冷备与云端归档三层策略。
④ 与域名/DNS结合:设置短TTL的DNS自动切换与健康检查。
⑤ 将CDN、Anycast与上游防护集成,减轻源站压力并提升全局可用性。
2.
风险评估与需求分析
① 识别关键资产:域名、证书、数据库、文件存储、API网关。
② 评估威胁模型:DDoS(体积/协议/应用层)、物理断电、网络中断。
③ 量化SLA需求:示例企业要求99.95%可用,允许月中断不超过21分钟。
④ 带宽与流量基线:监控正常峰值与异常放大倍数(如正常5Gbps,攻击可达500Gbps)。
⑤ 制定合规与保密要求,决定备份是否加密、是否跨境存储。
3.
多点备份与架构设计
① 主用节点(香港)+异地热备(新加坡/东京)+云归档(S3/Azure Blob)为推荐三层架构。
② 采用Anycast与CDN(如Cloudflare、Akamai)前置,减少源站直连请求。
③ 数据复制策略:主库同步到异地从库,关键日志实时复制,文件用对象存储异地复制(跨区复制)。
④ DNS和流量切换:使用健康探测与自动故障转移(如Route53/Alibaba DNS with failover)。
⑤ 负载均衡与会话粘性:使用LVS/HAProxy/Kubernetes ingress结合持久化存储。
4.
备份策略与具体数据示例
① 快照频率:数据库15分钟全增量,整机镜像每日一次,保留7天滚动。
② 异地备份份数:3 份(本地快照、近端异地、远端冷备)。
③ 备份加密与校验:AES-256 加密,SHA256 完整性校验。
④ 恢复演练:每月一次恢复演练,目标RTO ≤ 30 分钟。
⑤ 成本与存储示例:冷备对象存储按月结算,保留策略自动归档到低频/归档层。
5.
DDoS防御与网络防护实施细节
① 使用CDN/Anycast清洗流量,部署WAF过滤应用层攻击。
② 与带宽运营商/上游签署吸收策略,配置黑洞与流量重定向(BGP/RTBH)。
③ 阈值限制与速率限制:接口限流、连接限制、IP黑白名单。
④ 日志与告警:NetFlow/采样流量监测与自动告警。
⑤ 配合专业清洗中心(清洗能力示例:可承受至1Tbps以上峰值)进行紧急调度。
6.
真实案例与服务器配置举例
① 真实案例(化名HKPay,2024年3月):遭受约500Gbps的混合型DDoS,源站带宽饱和。
② 处置过程:启用Cloudflare Spectrum + 上游清洗,切换流量到新加坡热备,恢复时间约20分钟。
③ 教训:未启用Anycast前源站直接暴露导致主机CPU与I/O高负载。
④ 恢复策略:将数据库切换到异地从库并回滚部分写入,最终数据损失小于15分钟(RPO 达标)。
⑤ 服务器配置示例(请参见下表):
| 节点 | 配置 | 带宽 | 用途 |
| 香港主站 | 8 vCPU / 16GB RAM / 500GB NVMe | 1 Gbps 公网 | 主库 + 应用 |
| 新加坡热备 | 4 vCPU / 8GB RAM / 250GB NVMe | 500 Mbps | 从库 + 读写切换 |
| 云归档 | S3/Blob(生命周期归档) | 按需 | 长期备份与合规存储 |
7.
演练、监控与持续优化
① 定期演练切换、恢复数据库与文件系统,记录RTO/RPO指标。
② 建立统一监控面板(Prometheus+Grafana)监测流量、延迟、错误率。
③ 按事件复盘:对每次“被炸”事件进行根因分析与补救。
④ 优化成本:根据流量与访问分布调整节点规模与冷备保留期。
⑤ 文档化与自动化:使用IaC(Terraform/Ansible)保证恢复步骤可重复执行。
来源:香港服务器被炸 企业级容灾与多点备份实施手册