Table of Contents
设计AWS中容错架构对于确保应用程序的高可用性和复原力至关重要。 通过实施最佳做法,各组织可以最大限度地减少故障时间,即使在出现故障时也能保持服务连续性。
AIS的过失容忍核心原则
过失容忍包括设计能够继续运行的系统,尽管失败。 关键原则包括冗余、故障机制和自动化恢复过程。 AWS提供各种服务和功能来支持这些原则。
错误-容忍建筑的实实在在的世界实例
许多组织都运用多区域架构来增强容错能力。 比如,一家公司可能使用亚马逊53号公路进行DNS线路,引导交通到不同地区的健康终点。 此外,在多个可提供区部署EC2实例,确保如果一个区遇到问题,应用程序仍然可用。
设计故障-容忍系统的最佳做法
- 执行冗余: 使用多个实例,数据库,以及跨地区和跨区的存储选项.
- 自动故障: 配置健康检查和使用53号公路和弹性负载平衡器等服务自动改道的交通.
- 使用管理服务: 利用AWS管理服务,如RDS,DynamoDB,以及提供内置断层容恕的S3.
- 监控和警报:[] 持续通过云表监测系统健康,并设置异常警报.
- 定期试验:[] 进行故障模拟,以确保回收程序有效工作。