「PowerEdge:ハード ディスクが故障する理由
Summary: この記事では、ハードドライブが故障するさまざまな理由について詳しく説明します。
Instructions
目次
ファームウェアの破損とファームウェア ゾーンの損傷
ハード ディスクのファームウェアが破損または読み取り不能になると、多くの場合、コンピューターはハード ディスクと正しく対話できなくなります。
電子的な故障
電子的な故障は通常、ハード ディスクのコントローラー ボードの問題に関連しています。サーバーに電力スパイクまたは電気サージが発生し、ハード ディスク上のコントローラー ボードがノックアウトされ、BIOSが検出できなくなる可能性があります。
機械的な故障
機械的な故障は、多くの場合(特に早期に対処しなかった場合)、データの部分的、場合によっては完全な損失につながる可能性があります。機械的な故障は、読み書きヘッドの故障やモーターの問題など、さまざまな形で発生します。最も一般的な機械的な故障の1つは、ヘッド クラッシュです。重大度はさまざまですが、ハード ディスクの読み取り/書き込みヘッドが瞬間的または連続的にハード ディスクのプラッターに接触すると、ヘッド クラッシュが発生します
ヘッド クラッシュの原因には、物理的な衝撃(ディスクを床に落とすなど)、コンピューターの動き、静電気、過電流、機械的な読み取り/書き込みヘッドの障害など、さまざまな理由があります。
論理障害
論理エラーは、多くの場合、対処するのが最も簡単な問題であり、最も難しい問題です。論理エラーは、ファイル割り当てテーブルの無効なエントリなどの単純なものから、ひどく断片化されたドライブ上のファイルシステムの破損や損失などの本当に恐ろしい問題までさまざまです
論理エラーは、上記の電気的および機械的な問題とは異なり、通常はディスクに「物理的」な問題はなく、ディスク上の情報ビットに問題はありません。
メディアのエラー
不良セクターとは、ハード ディスク上で読み取れなくなる領域のことです。すべてのハードディスクドライブは、最終的に不良セクタを開発します。ハードディスクは不良になったセクターをマークし、これらはそれ以上使用されません。しかし、不良セクタになるセクタに存在するデータがある場合、データやファイルに正しくアクセスできません。過酷な動作条件(高温、振動など)では、ハード ディスクに多数の不良セクターが急速に発生する可能性があります。すべてのタイプのハード ディスクでは「自然に」不良セクターが発生する傾向がありますが、常にそうであるとは限りません。
SCSI/SAS環境
SCSIハード ディスクは、多くの場合、高性能ドライブと見なされます。これらはIDE/SATAよりも高速に回転するため、データ転送速度がより速くなります。このため、SCSIドライブは、多くのデータ スループットを提供する必要があるサーバーでよく使用されます。ただし、これらのドライブでは機械的な故障が発生する可能性が高いため、このパフォーマンスには代償が伴うことがよくあります
この環境で複数のディスク障害が発生する最も一般的な原因は、SCSIバス全体の信号品質の低下です。信号品質が低いと、これらの問題(タイムアウトとバス リセット)から回復しようとするときに、SCSIプロトコルのオーバーヘッドが発生する可能性があります。システムがビジー状態になり、データの需要が増加すると、SCSIプロトコルの対応処置が増加し、SCSIバスが飽和状態に近づきます。このオーバーヘッドにより、最終的に通常のデバイス通信帯域幅が制限されます。クリアしないままにしておくと、1つまたは複数のSCSIデバイスがRAIDコントローラーにタイムリーに応答できず、その結果、RAIDコントローラーがハード ディスク ドライブをオフラインとしてマークすることがあります。PCIスロットへのRAIDコントローラの不適切な取り付け、ケーブル接続の不良、SCSIバックプレーンに対するディスクの装着不良、バックプレーンドーターカードの不適切な取り付けまたは装着、および不適切なSCSIバス終端は、これらのタイプの信号の問題を引き起こす可能性があります。
また、これらの障害タイプの組み合わせもあり得ます。
アップタイムを最大化し、ハード ディスク障害によるデータ ロスを防ぐために、すべての技術者とお客様はメンテナンスのベスト プラクティスを読み、理解する必要があります。
PowerEdgeディスク障害に関する注意
PowerEdgeサーバーでディスク障害に対処する場合は、次の予防策を講じることが不可欠です。
- バックアップ データ: ディスクを操作する前に、必ず重要なデータのバックアップを実行してください。これにより、さらに問題が発生した場合でもデータの安全性が確保されます。
- アラートの監視: 予測的なドライブ障害アラート(エラー コード
PDR6)およびその他のディスク関連のエラー コード(PDR1001とPDR3)を提供する必要があります。これらのアラートは、早急な対応が必要な潜在的な問題を示します。 - ファームウェアのアップデート:ハードウェアを交換する前に、RAIDコントローラーとドライブのファームウェアが最新であることを確認します。これにより、誤ったアラートを防ぎ、システム全体の安定性を向上させることができます。
- ドライブの取り扱いには注意が必要です。ハード ドライブの取り外し、取り付け、または再装着時には、無理な力を加えないようにしてください。これにより、バックプレーンが曲がり、隣接するドライブに障害が発生したり、接続が失われたりする可能性があります。
- 接続の確認: ドライブに障害が発生していると報告された場合は、ドライブを抜き差しして接続の問題を除外します。すべての接続が安全であることを確認します。
- システム ログの確認: iDRACログとシステム ログを定期的にチェックして、根本的な問題を示す可能性のある関連するアラートや温度イベントがないか確認します。
- サポートへのお問い合わせ: 複数のドライブでエラーが報告されている場合、または上記のアクションを実行しても問題が解決しない場合は、Dellサポートにお問い合わせください。