スキップしてコンテンツを表示

Amazon RDS DB インスタンスが再起動、回復、またはフェイルオーバーした理由を教えてください。

所要時間2分
0

Amazon Relational Database Service (Amazon RDS) データベースインスタンスの再起動、回復、またはフェイルオーバーの根本原因を知りたいです。

簡単な説明

Amazon RDS DB インスタンスは、以下の条件で自動的に再起動を実行します。

  • プライマリのアベイラビリティーゾーンに可用性の問題が発生した場合か、パフォーマンスのボトルネックとリソースの競合により過剰なワークロードが発生した場合。
  • プライマリインスタンスの基盤となるインフラストラクチャに問題がある場合。これには、プライマリインスタンスへのネットワーク接続の喪失、またはプライマリインスタンスのコンピュートユニットやストレージの問題が考えられます。
  • DB インスタンスクラスのタイプが、DB インスタンスの垂直スケーリングアクティビティの一環として変更された場合。
  • DB インスタンスの基盤となるホストが、特定のメンテナンス時間中に OS パッチを受けている場合。詳細については、「DB インスタンスのメンテナンス」および「DB インスタンスのエンジンバージョンのアップグレード」を参照してください。
  • [再起動] または [フェイルオーバーによる再起動] オプションを使用して、手動で DB インスタンスの再起動を開始した場合。

DB インスタンスに潜在的な問題が示されており、Amazon RDS ヘルスチェックに応答しない場合、Amazon RDS は次のいずれかのアクションを自動的に実行します。

  • シングル AZ 配置の場合、Amazon RDS はシングル AZ リカバリを開始します。
  • マルチ AZ 配置の場合、Amazon RDS はマルチ AZ 配置のマルチ AZ フェイルオーバーを開始します。

その後、Amazon RDS は、管理者の介入なしにデータベース操作をできるだけ早く再開できるように、DB インスタンスを再起動します。

解決策

停止の原因を特定するには、DB インスタンスの次のログとメトリクスを確認してください。また、ベストプラクティスにも必ず従ってください。

Amazon RDS イベントメッセージ

インスタンスの予期しない停止の根本原因を特定するには、過去 24 時間のすべての Amazon RDS イベントを表示します。デフォルトでは、Amazon RDS はすべてのイベントを UTC/GMT 時間で登録します。イベントをより長期間保存するには、Amazon RDS イベントを Amazon CloudWatch Events に送信してください。インスタンスが再起動すると、Amazon RDS イベント通知に次のいずれかのメッセージが表示されます。

The RDS instance was modified by customer

この RDS イベントメッセージは、RDS インスタンスの変更によりフェイルオーバーが開始されたことを示しています。

Applying modification to database instance class

この RDS イベントメッセージは、DB インスタンスクラスのタイプが配置タイプに基づいて変更されたことを示しています。

  • シングル AZ 配置は、スケーリング操作中に数分間使用できなくなります。
  • マルチ AZ 配置は、インスタンスがフェイルオーバーする間は使用できません。この所要時間は通常約 60 秒です。この遅延が発生するのは、新しくサイズを変更されたデータベースでフェイルオーバーが発生する前に、スタンバイデータベースがアップグレードされるためです。その後、データベースが再起動し、エンジンがリカバリを実行して、データベースが整合性のある状態に保たれるようにします。

The user requested a failover of the DB instance

このメッセージは、ユーザーが [再起動] または [フェイルオーバーによる再起動] オプションを使用して手動で DB インスタンスの再起動を開始したことを示しています。

The primary host of the RDS Multi-AZ instance is unhealthy
この理由は、基盤となるハードウェアの一時的な問題により、プライマリインスタンスとの通信が失われたことを示しています。この問題により、RDS モニタリングシステムが RDS インスタンスと通信してヘルスチェックを実行できなかったため、インスタンスが異常とみなされた可能性があります。

The primary host of the RDS Multi-AZ instance is unreachable due to loss of network connectivity

この理由は、マルチ AZ 配置のプライマリホストに影響した一時的なネットワークの問題により、マルチ AZ のフェイルオーバーとデータベースインスタンスの再起動が発生したことを示しています。内部監視システムがこの問題を検出し、フェイルオーバーを開始しました。

The RDS Multi-AZ primary instance is busy and unresponsive, the Multi-AZ instance activation started, or the Multi-AZ instance activation completed

このイベントログには、次の状況でこれらのメッセージが表示されます。

  • プライマリ DB インスタンスが応答しない場合。
  • データベースでメモリを過剰に消費した後のメモリ不足により、Amazon RDS モニタリングシステムが基盤となるホストに通信できなくなった場合。予防措置として、監視システムがデータベースを再起動します。
  • DB インスタンスで、基盤となるホストとのネットワークの問題が断続的に発生した場合。
  • インスタンスでデータベース負荷が発生した場合。この場合、CloudWatch メトリクス CPUUtilizationDatabaseConnectionsIOPS メトリクス、およびスループットの詳細が急増している可能性があります。また、FreeableMemory が枯渇していることに気付く場合もあります。

Database instance patched

このメッセージは、DB インスタンスがメンテナンス時間中にマイナーバージョンアップグレードが実施されたことを示しています。このメッセージは、インスタンスのマイナーバージョン自動アップグレード設定がオンになっているために表示されます。

CloudWatch メトリクス

データベース負荷の問題が停止の原因となったかどうかを確認するには、Amazon RDS インスタンスの CloudWatch メトリクスを確認します。以下の主要メトリクスが急増している場合は、RDS インスタンスの可用性とヘルスステータスに問題がある可能性があります。

  • DatabaseConnections
  • CPUUtilization
  • FreeableMemory
  • WriteIOPS
  • ReadIOPS
  • ReadThroughput
  • WriteThroughput
  • DiskQueueDepth

拡張モニタリング

Amazon RDS は、拡張モニタリングからのメトリクスをお客様の Amazon CloudWatch Logs アカウントに配信します。この機能は、DB インスタンスが実行されているオペレーティングシステムのメトリクスをリアルタイムで提供します。DB インスタンスのすべてのシステムメトリクスとプロセス情報をコンソールで表示できます。

Database Insights

CloudWatch Database Insights ダッシュボードには、パフォーマンス問題の分析とトラブルシューティングに使用できるデータベースパフォーマンスに関する情報が含まれています。Database Insights ダッシュボードを使用して、クエリの統計情報を分析します。このダッシュボードの情報を使用してクエリのパフォーマンスを調整し、ワークロードを最適化するのがベストプラクティスです。詳細については、「CloudWatch Database Insights のデータベースインスタンスダッシュボードの表示」を参照してください。

注: 問題を軽減するには、データベース管理者と協力してこれらの変更を行うことがベストプラクティスです。

RDS データベースログ

DB インスタンスの停止原因をトラブルシューティングするには、Amazon Aurora と RDS コンソールまたは Amazon RDS API オペレーションを使用してデータベースログファイルを表示、ダウンロード、または監視します。データベーステーブルにロードされたデータベースログファイルを照会することもできます。詳細については、「Amazon RDS ログファイルのモニタリング」を参照してください。

RDS インスタンスの停止に対処する際は、次のベストプラクティスを念頭に置いてください。

関連情報

Amazon RDS のダウンタイムやデータベースパフォーマンスにはどのような要因が影響しますか?

Amazon RDS DB インスタンスがフェイルオーバーした原因を教えてください。

必要な Amazon RDS メンテナンス中のダウンタイムを最小限に抑える方法を教えてください。

Amazon RDS for PostgreSQL または Aurora PostgreSQL DB インスタンスについて、実行中のクエリを確認し、リソース消費の問題を診断する方法を教えてください。

AWS公式更新しました 8ヶ月前
コメントはありません

関連するコンテンツ