PowerEdge : Pourquoi les disques durs tombent-ils en panne ?
Resumen: Cet article explique en détail les différentes raisons pour lesquelles les disques durs peuvent tomber en panne.
Instrucciones
Sommaire
- Corruption du firmware et endommagement de la zone du firmware
- Défaillance électronique
- Défaillance mécanique
- Défaillance logique
- Erreurs de support
- Environnement SCSI/SAS
- Précautions en cas de panne de disque PowerEdge
Corruption du firmware et endommagement de la zone du firmware
Lorsque le firmware d’un disque dur devient corrompu ou illisible, l’ordinateur est souvent incapable d’interagir correctement avec le disque dur.
Défaillance électronique
Une défaillance électronique est généralement liée à des problèmes sur la carte de contrôle du disque dur. Le serveur peut subir un pic d’alimentation ou une surtension électrique qui fait tomber la carte contrôleur sur le disque dur, ce qui la rend indétectable par le BIOS.
Défaillance mécanique
Une défaillance mécanique entraîne souvent une perte partielle, voire totale, des données, en particulier si elle n’est pas traitée rapidement. La défaillance mécanique se présente sous différentes formes, comme une défaillance de la tête de lecture/écriture ou des problèmes de moteur. L’une des défaillances mécaniques les plus courantes est une panne de tête. D’une gravité variable, un choc de charge se produit lorsque les têtes de lecture/écriture du disque dur entrent en contact, momentanément ou en continu, avec les plateaux du disque dur.
Différentes raisons peuvent être à l’origine d’un choc à la charge, notamment un choc physique (par exemple, la chute du disque sur le sol), un mouvement de l’ordinateur, de l’électricité statique, des surtensions et une défaillance mécanique de la tête de lecture/écriture.
Défaillance logique
Les erreurs logiques sont souvent les problèmes les plus faciles et les plus difficiles à résoudre. Les erreurs logiques peuvent aller de choses simples telles qu’une entrée non valide dans une table d’allocation de fichiers à des problèmes vraiment horribles tels que la corruption et la perte du système de fichiers sur un lecteur gravement fragmenté.
Les erreurs logiques sont différentes des problèmes électriques et mécaniques ci-dessus, car il n’y a généralement rien qui ne va pas « physiquement » avec le disque, à l’exception des éléments d’information qu’il contient.
Erreurs de support
Les secteurs défectueux sont des zones du disque dur qui deviennent illisibles. Tous les disques durs finissent par développer des secteurs défectueux. Le disque dur marque les secteurs défectueux et ceux-ci ne sont plus utilisés. Toutefois, si vos données résident sur des secteurs qui deviennent dangereux, vous ne pouvez pas accéder correctement à vos données ou fichiers. Des conditions de fonctionnement difficiles (telles que des températures élevées, des vibrations, etc.) peuvent entraîner le développement rapide de nombreux secteurs défectueux sur les disques durs. Tous les types de disques durs sont susceptibles de développer des secteurs défectueux « naturellement », mais ce n’est pas systématique.
Environnement SCSI/SAS
Les disques durs SCSI sont souvent considérés comme des disques hautes performances. Ils tournent plus rapidement que les disques IDE/SATA et offrent donc généralement des vitesses de transfert de données plus rapides. De ce fait, les disques SCSI se trouvent généralement dans des serveurs qui doivent fournir un débit de données important. Cependant, ces performances ont souvent un prix, car les pannes mécaniques sont plus probables sur ces disques.
La cause la plus fréquente de défaillance de plusieurs disques dans cet environnement est une mauvaise qualité du signal sur le bus SCSI. Une mauvaise qualité du signal peut entraîner une surcharge du protocole SCSI lors de la tentative de récupération de ces problèmes (délais d’expiration et réinitialisations de bus). À mesure que le système devient plus occupé et que la demande de données augmente, les actions correctives du protocole SCSI augmentent et le bus SCSI se rapproche de la saturation. Cette surcharge finit par limiter les bandes passantes normales des communications entre les appareils. Si cette option n’est pas activée, un ou plusieurs périphériques SCSI risquent de ne pas être en mesure de répondre au contrôleur RAID en temps opportun, ce dernier peut alors marquer le disque dur comme étant hors ligne. Une mauvaise installation du contrôleur RAID dans un logement PCI, de mauvaises connexions de câbles, une mauvaise installation des disques par rapport au fond de panier SCSI, une mauvaise installation ou une mauvaise installation des cartes filles de fond de panier et une terminaison incorrecte du bus SCSI peuvent être à l’origine de ces types de problèmes de signal.
Des combinaisons des différents types de défaillance sont également possibles.
Tous les techniciens et les clients doivent lire et comprendre les pratiques d’excellence en matière de maintenance afin d’optimiser la disponibilité et d’éviter les pertes de données résultant d’une défaillance du disque dur.
Précautions en cas de panne de disque PowerEdge
En cas de panne de disque sur les serveurs PowerEdge, il est essentiel de prendre les précautions suivantes :
- Données de sauvegarde : Effectuez toujours une sauvegarde des données stratégiques avant d’intervenir sur les disques. Cela garantit la sécurité des données en cas d’autres problèmes.
- Surveiller les alertes : Soyez attentif aux alertes prédictives de panne de disque (code d’erreur
PDR6) et d’autres codes d’erreur liés au disque (commePDR1001etPDR3). Ces alertes indiquent des problèmes potentiels nécessitant une attention immédiate. - Mises à jour de firmware : Avant de remplacer tout matériel, assurez-vous que le firmware du contrôleur RAID et des disques est à jour. Cela peut aider à prévenir les fausses alertes et à améliorer la stabilité globale du système.
- Manipulez les disques avec précaution : Lors du retrait, de l’installation ou de la remise en place des disques durs, évitez d’exercer une pression excessive. Cela peut plier le fond de panier et potentiellement entraîner la défaillance ou la perte de connectivité des disques voisins.
- Vérifier les connexions : Si un disque est signalé comme étant en panne, réinstallez-le pour écarter tout problème de connexion. Vérifiez que toutes les connexions sont sécurisées.
- Passez en revue les journaux système : Consultez régulièrement les journaux iDRAC et les journaux système pour rechercher toute alerte associée ou tout événement thermique qui pourrait indiquer des problèmes sous-jacents.
- Contacter le support : Si plusieurs disques signalent des erreurs ou si les problèmes persistent après avoir pris les mesures ci-dessus, contactez le support Dell pour obtenir de l’aide.