Table of Contents
システムレジリエンスは、障害や悪意のある条件にもかかわらず、ソフトウェアシステムの機能を維持するための能力を意味します。 このレジリエンスを定量化することで、堅牢なアーキテクチャの設計と欠陥許容を改善するのに役立ちます。 この記事では、障害のあるソフトウェアアーキテクチャにおけるシステムレジリエンスを評価するために使用される重要なメトリックと計算について説明します。
システムレジリエンスのためのキーメトリック
複数のメトリックは、ソフトウェアシステムのレジリエンスを測定するために使われます。これらのメトリックは、システムが故障から耐え、回復できる方法に洞察を提供します。
- []Availability]:システムが運用可能でアクセス可能である時間の割合。
- []障害(MTBF)[間の平均時間:システム障害間で経過した平均時間。
- []修復する時間(MTTR)[:障害後にシステムを回復するために必要な平均時間。
- レジリエンス指数]:全体的な弾性を評価するために様々なメトリックを組み合わせた複合スコア。
レジリエンスメトリックの計算
レジリエンスメトリックの計算には、監視システムの性能を時間とともに含み、障害と回復データを分析します。例えば、可用性は次のように計算できます。
空性 = 稼働時間 / (稼働時間 + ダウンタイム)
同様に、MTBFとMTTRは障害ログから派生しています。
[MTBF = 稼働時間/障害回数]
[MTTR=修理時間/故障回数]
システムレジリエンスの改善
レジリエンスを強化するには、冗長、障害のあるメカニズム、定期的なテストを実施することが含まれます。キーメトリックの監視は、弱点を特定し、改善を導きます。