何が起こったか
Google Cloudは、開発者やアーキテクトがクラウド環境での障害テストを自動化できるようにするサービス、Fault Injection Testingのプレビューを発表しました。
このプレビューでは、高可用性Cloud SQLインスタンスのフェイルオーバーをトリガーすることと、レイヤ7ロードバランサーを介して遅延とHTTPエラーコードを追加することでアプリケーショントラフィックを低下させること、という2つの主要な障害シナリオがサポートされています。
Fault Injection Testingには、注入前に自動でドライランを実行する機能、手動で開始できる機能、そして実験を停止してリソースを復元するための停止およびロールバック機能が含まれています。
なぜ重要なのか
現代の分散システムは複雑であり、特にクラウド環境では基盤となるインフラストラクチャへの直接アクセスが制限されるため、高可用性を保証することがますます困難になっています。
ネイティブな耐障害性テストツールがない場合、組織は顧客の信頼の喪失、コンプライアンスおよび規制上のペナルティ、大規模な移行の遅延などのリスクに直面します。
実際の障害が発生する前に障害実験を実施することで、安全機構が意図どおりに動作し、ミッションクリティカルなサービスが障害時にオンラインを維持できることを検証できます。
主要な事実
Fault Injection Testingは、Google Cloudコンソール、gcloud CLI、REST APIを通じてプレビュー版として利用できます。
このサービスは、障害を注入する前に、読み取り専用のドライランを実行して権限を確認し、影響を受けるリソースを一覧表示します。
KeyBankやServierなどのパートナーは、すでにFault Injection Testingを使用してデプロイメントを検証しています。
Google Cloudは、プレビュー期間中はFault Injection Testingを非本番環境で使用することを推奨しています。
今後の注目点
組織は、Google Cloudのアカウントチームにプレビューアクセスをリクエストし、Fault Testing APIを有効にして、実験を実行するためにroles/faulttesting.operatorロールを割り当てることができます。
プレビュー期間中、初期ユーザーはフィードバックを提供して製品の形成に貢献でき、Google Cloudはサポートされる障害シナリオをCloud SQLフェイルオーバーやロードバランサーのトラフィック低下以外にも拡大する可能性があります。
