PSUに障害が発生したかどうかを確認する方法
概要: この記事では、Isilon電源装置の障害が本物かどうかを確認する方法について説明します。
手順
データとクラスターの運用への影響
A "Loss in power supply redundancy detected" アラートは、ノード内の1台の電源供給ユニット(PSU)への電力供給が停止したことを意味します。ノードは残りのPSUで動作を継続し、このアラートの時点ではデータは差し迫ったリスクにさらされていません。
OneFSはFlexProtectを使用します。これはリードソロモン消失訂正符号に基づく分散データ保護メカニズムです。これにより、ノードまたはドライブで同時に発生した複数の障害(構成された保護レベルに応じて)に耐えることができます。影響を受けるノードが完全にオフラインになった場合でも、データはクラスター内の他のノードから引き続きアクセスできます。
しかし、ノードは電源装置の冗長性を失いました。残りのPSUにも障害が発生した場合、ノードはオフラインになります。このため、このアラートを緊急性の高いものとして扱い、以下の診断および交換手順を速やかに実行してください。
大規模クラスターの場合の推奨事項:すべてのノードでPSUの完全な冗長性が維持されていること、およびデータ センターがバッテリー バックアップ式UPSや発電機電源を供給していることを確認します。詳細については、Dell Technologies Info Hubにあるホワイトペーパー『Dell PowerScale:大規模クラスターに関する考慮事項とベスト プラクティス』を参照してください。
- クラスター内の任意のノードでSSH接続を開き、「root」アカウントを使用してログインします。
"root"アカウンタビリティ - 次のコマンドを実行します。
- 1つのノードのPSUステータスを確認するには、次を実行します。
# isi_hw_status | grep -i -A2 "Power Supplies" Power Supplies OK Power Supply 1 good Power Supply 2 good - 1つのノードのPSUステータスを確認するには、次を実行します。
# isi_for_array -s isi_hw_status | grep -i -A2 "Power Supplies" RTPIsilon02-1: Power Supplies OK RTPIsilon02-1: Power Supply 1 good RTPIsilon02-1: Power Supply 2 good -- RTPIsilon02-2: Power Supplies OK RTPIsilon02-2: Power Supply 1 good RTPIsilon02-2: Power Supply 2 good - 上記の出力は、すべての電源装置が
OK処置は不要です。
- 1つのノードのPSUステータスを確認するには、次を実行します。
- すべての電源装置が
OKで、誤ったアラートをクリアして、クラスターを24時間監視します。- 特定のPSUアラートのみをクリアするには、グループIDを取得し、
isi event groups modifyでアラートをクリアするには、手動のステップが必要です。
# isi event groups list ID Started Ended Causes Short Lnn Events Severity ----------------------------------------------------------------------------------- 3074 01/01 00:25 01/01 00:25 POWER Supply Failed 4 1 Critical # isi event groups modify --resolved=yes --ignore=yes --id=<Group ID from above command> Example: # isi event groups modify --resolved=yes --ignore=yes --id=3074 - クラスター全体の古いアラートをすべてクリアするには、次の手順を実行します。
- OneFS 7.x.x.xの場合
# isi events cancel all # isi events quiet all - OneFS 8.x.x.xの場合
# isi event bulk --ignore=true # isi event bulk --resolved=true
- OneFS 7.x.x.xの場合
- 特定のPSUアラートのみをクリアするには、グループIDを取得し、
- コマンド出力でPSUに障害が発生した場合は、Isilonサポートに交換を依頼してください。
統合ワークフロー:PSU冗長性喪失アラート
アラートを受け取った場合は、次の手順に従います。 "Loss in power supply redundancy detected" または類似のPSUアラート:
表1:冗長性損失アラート
|
手順 |
処置 |
リファレンス: |
|
1 |
アラートが現実のものであることを確認します。クラスターにSSHで接続し、前述のCLI手順を使用して、影響を受けるノードのPSUステータスを確認します。PSUが正常と表示されている場合は、KB #517459でGen6ノードでの既知の誤ったアラート動作を確認してください。 |
この記事 KB 20717 |
|
2 |
正しいPSUスロットの特定:Gen6シャーシ(H500、H400、A200、A2000)の場合は、PSUとスロットのマッピングを使用して正しい物理PSUを見つけます。Gen6マッピング:PS0 = スロット1/スロット3。PS1 = スロット2/スロット4。 |
KB 226947 |
|
3 |
PSUファームウェアの確認 — 古いPSUファームウェアは、誤ったアラートの原因となる可能性があります。CLIを使用してファームウェアのバージョンを確認します。 |
KB 19622 |
|
4 |
Dellサポートに問い合わせる — PSUの障害が確認された場合は、デル・テクノロジーズ サポートで交換のためのサービス リクエストを作成します。電話をかける前に、ノードのシリアル番号、ノード番号、およびPSUスロットIDを収集します。 |
dell.com/support |
その他の情報
このビデオをご覧ください。