PowerVault ME4およびME5:アレイへのアクセスを失ったホストの調査
概要: この記事は、Dell PowerVault ME4/ME5アレイを使用するストレージ管理者を対象としています。適切な証拠を収集する方法、初回パス チェックを実行する方法、およびホストがマップされたボリュームにアクセスできなくなった場合の一般的な原因を特定する方法について説明します。より詳細なホスト オペレーティング システムまたはスイッチの構成が必要な場合は、アレイ側の検証手順を完了した後で、オペレーティング システムまたはスイッチ ベンダーのドキュメントを参照してください。 ...
手順
目的と範囲
この記事は、Dell PowerVault ME4/ME5アレイを使用するストレージ管理者を対象としています。適切な証拠を収集する方法、初回パス チェックを実行する方法、およびホストがマップされたボリュームにアクセスできなくなった場合の一般的な原因を特定する方法について説明します。より詳細なホスト オペレーティング システムまたはスイッチの構成が必要な場合は、アレイ側の検証手順を完了した後で、オペレーティング システムまたはスイッチ ベンダーのドキュメントを参照してください。
接続の概要
- シリアル接続SCSI(SAS) は、 直接接続型ストレージ(DAS) としてのみサポートされています。SASスイッチはMEアレイではサポートされていません。冗長性を確保するために、両方のコントローラーにデュアル パスを使用します。
- iSCSI(Internet Small Computer Systems Interface) および FC(Fibre Channel) は、直接接続設計とスイッチ接続設計をサポートします。回復性を確保するために、2つのファブリックまたはサブネットを使用します。
- 変更を加える前に、ホスト ドライバー、ファームウェア、トランシーバーを検証します。
1.まず、適切な証拠を収集します。
変更を加える前に、この情報を収集してください。すべてをインシデントの期間とタイム ゾーンに関連付けます。
アレイから(ME4/ME5)
- PowerVault Managerで サポート バンドル を生成するには、[Maintenance]、[Support]、[Collect Logs]の順に選択します。バンドルには、コントローラー イベント、ファームウェア レベル、フロントエンド ポート ステータスが含まれます。
- PowerVault Managerで アラートとイベント を確認します。インシデントに合わせて、コントローラーの再起動、フェールオーバー、リンクのリセット、エンクロージャ イベントを記録します。
確認すべき点:リンク ダウン状態、速度またはネゴシエーションの不一致、エラー カウンターの増加、予想される設計と比較したイニシエーターの欠落。
Windows Serverホストから
MPIOを確認し、デバイスが要求されていることと、予想される数のアクティブ/最適化パスが存在することを確認します。インシデントに関連するディスク、StorPort、マルチパスIO(MPIO)イベントをイベント ビューアーからエクスポートします。HBA(ホスト バス アダプター)およびネットワーク カード ドライバーおよびファームウェアのバージョンを、入手可能な最新バージョンと比較します。
VMware ESXiホストから
APD(すべてのパス ダウン)、PDL(永続的なデバイス損失)、パス遷移イベントをvmkernel.logで検索します
各データストア デバイスに予想されるパス数が表示され、ラウンド ロビンなどのMEアレイにポリシーが適切であることを確認します。
esxcli storage core path list
esxcli storage core device list
Linuxホストから
マルチパスにWWIDごとに複数のアクティブ パスが表示され、カーネル転送エラーがインシデント時刻に関連づけられていることを確認します。HBAドライバーとファームウェアのバージョンを確認します。dmesg -T | egrep -i 'scsi|sas|reset|error'
multipath -ll
ネットワークまたはファブリックから(使用する場合)
- iSCSIスイッチ: ポートごとのCRCまたはドロップ カウンター、リンク フラップ、MTU(最大伝送単位)設定、フロー制御ポリシーをキャプチャします。ジャンボ フレームを使用する場合は、MTUがエンドツーエンドで一貫していることを確認し、少なくともストレージ ポートで受信フロー制御を有効にします。ホストiSCSI NICでLACPの代わりにMPIOを使用して冗長性を確保します。
- FCファブリック: 両方のファブリックでFLOGI/PLOGI、RSCN、ポートごとのエラー カウンターのファブリック ログを収集します。ゾーニングが意図した設計と一致していることを確認します。
2.ほとんどのケースを解決するトリアージ チェック。
-
目的のトポロジーを確認します。コントローラーがSASを使用している場合は、SASスイッチのない直接接続設計を確認し、両方のコントローラーへのデュアル パスを維持します。iSCSIおよびFCの場合は、2ファブリックまたは2サブネットのレイアウトを確認します。
-
ストレージ イベントとポートの正常性を確認します。イベントのタイムスタンプをホスト エラーに合わせます。フロントエンド ポートが予想される速度で動作していることと、イニシエーターがログインしていることを確認します。エラー カウンターが上昇しているポートを調査します。
-
ホストのマルチパスを検証します。
- マルチパスI/O (MPIO)搭載Windows Server: デバイスを要求し、アクティブ/最適化パスの意図した数を表示する必要があります。
- 「VMware ESXi:デバイスには、フル パス数と適切なポリシー(ラウンド ロビンなど)が表示されます。
- Linux(デバイスマッパー マルチパスあり): 各 mpath dev は、複数のアクティブ パスを表示する必要があります。
- 転送の安定性を確認します。
- iSCSI:2つの分離されたサブネットとVLAN(仮想ローカル エリア ネットワーク)、一貫性のあるMTU、受信または対称フロー制御。データ パスのリンク アグリゲーションをMPIOに置き換えます。
- FC:2つのファブリックと一貫したゾーニング。リンクのリセットとログインの失敗を探します。
- SAS:両方のコントローラーへのデュアルパス ケーブル接続。パスにスイッチはありません。HBAツールにPHYエラーがないか確認し、疑わしいケーブルを抜き差しするか交換します。
- ソフトウェアとファームウェアのバージョンを確認します。ホストHBA、ネットワーク カードのドライバーとファームウェアをサポート マトリックスと比較し、必要に応じてアップデートします。
3.輸送固有のガイダンス
SAS(直接接続)
- 両方のコントローラーにデュアルパスDAS設計を使用します。サポートされているケーブル長内に収まってください。データ パスにSASスイッチを配置しないでください。
- SAS HBAを使用したWindows Serverクラスタリングで、デバイスがHBAではなくRAIDとして識別された場合は、オペレーティング システムのガイダンスに従ってください。
- ケーブル接続の図と例については、『導入ガイド』を参照してください。
iSCSI(直接接続またはスイッチ接続)
- 一貫したMTUを持つ2つの専用iSCSIサブネットとVLANを使用し、受信または対称フロー制御を有効にします。直接接続設計では、サブネットごとに1つのNICを対応するコントローラーのポートに接続し、MPIOを使用します。
- VMware ESXiの場合は、ソフトウェアiSCSIイニシエーターを使用します。iSCSIオフロード カードは、ME5ではサポートされていません。単一のvmnicを持つvSwitchでは、ファブリックごとに1つのVMkernelを使用します。
Fibre Channel(DASまたはSAN)
- 2つのファブリックを使用します。一般的な手法は、シングルイニシエーター、シングルターゲットゾーニングです。ゾーンごとに1つのアレイ ポートWWPNで1つのホストHBAワールド ワイド ポート名(WWPN)を使用し、両方のファブリックで繰り返します。
4.一般的な原因とその確認方法。
- コントローラーのフェールオーバーまたはファームウェアの問題: アレイ イベントには、ログ内のホストAPDまたはPDLと一致するコントローラーの再起動またはフェールオーバーが表示されます。リリース ノートに関連修正が示されている場合は、ファームウェアに対処します。
- マルチパスの構成ミス: ホストでパス数が減少するか、使用不能パスが報告される。MPIO、NMP、マルチパス設定を修正して、予期されるパスを復元します。
- iSCSIネットワークの問題: スイッチ カウンターにドロップまたはCRCエラーが表示されるか、MTUが一貫していない。受信または対称フロー制御の有効化、MTUの調整、MPIOを使用したリンク アグリゲーションの置き換え。
- FCゾーニングまたはファブリックの不安定性: 影響を受けるホストが 1 つのファブリックでログインできないか、リンク リセットが頻繁に発生します。ゾーニングを修正するか、光ファイバーとケーブルを修復します。
- SASケーブルまたはポートの劣化: アレイまたはHBAの診断では、PHYエラーの増加または断続的なリンク ダウン状態が表示されます。ケーブルを抜き差しするか、ケーブルを交換します。
- サポートされていないドライバーまたはファームウェア: 影響を受けるのは特定のホストまたはHBAのみです。サポート マトリックスのバージョンにアップデートすると、この状態が解決されます。
5.エスカレーション チェックリスト
サービス リクエストを開始する際には、次の項目をご用意ください。
- アレイ サポート バンドルとタイム ゾーン付きの正確なインシデント ウィンドウ
- アクセスを失ったホストと影響を受けたパスを含む、ホスト接続、ファブリック、サブネットの トポロジー図 。
- ホストの証拠:
- Windows Server:MPIOおよび関連するイベント ビューアーのエントリーを確認します。
- 「VMware ESXi:vmkernel.logからの抜粋とesxcli storageコマンドの出力
- Linuxの場合dmesgの抜粋とマルチパス出力。
- スイッチまたはファブリックの証拠: iSCSIカウンターと構成スニペット、FCファブリック ログとゾーニングのスクリーンショット。
- バージョン インベントリー: アレイ ファームウェア(バンドル内)、ホストHBAまたはNICドライバーとファームウェアのバージョン。
6.参照するDellのドキュメントは、特定のデバイス モデルの support.dell.com にあります
- サポート マトリックス: サポートされているオペレーティング システム、HBA、NIC、ルール
- 導入ガイド: ケーブル接続、初期セットアップ、トポロジーの例。
- 管理者ガイド: これは日常的な管理用です。
- CLIリファレンス: 調査のためのshowコマンドの完全なリスト。