Google uses AI technology to translate content into your preferred language. AI translations can contain errors.
通过资源冗余构建高可用性系统
使用集合让一切井井有条
根据您的偏好保存内容并对其进行分类。
Last reviewed 2024-12-30 UTC
Well-Architected Framework 可靠性核心中的这一原则提供了相关建议,可帮助您规划、构建和管理资源冗余,从而避免故障。Google Cloud
这一原则与可靠性的 范围界定
重点领域
相关。
原则概览
在确定所需可靠性级别后,您必须设计系统以避免任何单点故障。系统中的每个关键组件都必须跨多台
机器、多个可用区和多个
区域进行复制。
例如,关键数据库不能仅位于一个区域中,元数据服务器也不能仅部署在一个可用区或区域中。在这些示例中,如果唯一的可用区或区域发生中断,则系统会发生全局中断。
建议
如需构建冗余系统,请考虑以下小节中的建议。
识别故障域并复制服务
绘制系统的
故障域(
从单个虚拟机到区域),并设计跨故障
域的冗余。
为确保高可用性,请跨多个可用区和区域分发和复制服务及应用。配置系统以进行自动故障切换,确保服务和应用在可用区或区域中断时仍可用。
如需查看多可用区和多区域架构的示例,请参阅
为您的工作负载设计可靠的基础架构 Google Cloud。
及时检测和解决问题
持续跟踪故障域的状态,以便及时检测和解决问题。
您可以使用
Google Cloud Service Health 信息中心监控所有区域中
服务的当前状态。
Google Cloud 您还可以使用
Personalized Service Health查看与项目相关的突发事件。
您可以使用负载平衡器检测资源健康状况,并自动将流量路由到健康状况良好的后端。如需了解详情,请参阅
健康检查概览。
测试故障切换场景
与消防演习类似,定期模拟故障以验证复制和故障切换策略的有效性。
如需了解详情,请参阅
模拟区域级 MIG 的可用区服务中断情况
和
在 GKE 区域级集群中模拟可用区故障。
如未另行说明,那么本页面中的内容已根据知识共享署名 4.0 许可获得了许可,并且代码示例已根据 Apache 2.0 许可获得了许可。有关详情,请参阅 Google 开发者网站政策。Java 是 Oracle 和/或其关联公司的注册商标。
最后更新时间 (UTC):2024-12-30。
[[["易于理解","easyToUnderstand","thumb-up"],["解决了我的问题","solvedMyProblem","thumb-up"],["其他","otherUp","thumb-up"]],[["很难理解","hardToUnderstand","thumb-down"],["信息或示例代码不正确","incorrectInformationOrSampleCode","thumb-down"],["没有我需要的信息/示例","missingTheInformationSamplesINeed","thumb-down"],["翻译问题","translationIssue","thumb-down"],["其他","otherDown","thumb-down"]],["最后更新时间 (UTC):2024-12-30。"],[],[]]