Data Domain : Alerte - Le module d’E/S a échoué | EVT-ENVIRONMENT-00029
Résumé: Un système Data Domain (DD) génère une alerte EVT-ENVIRONMENT-00029 avec le message « I/O module has failed » lorsqu’un module d’E/S PCIe (également appelé carte SLIC ou PCI) tombe en panne ou est retiré. Les types de cartes concernés comprennent SAS, NIC, NVRAM et Fibre Channel (FC). ...
Symptômes
Cet article de la base de connaissances s’applique aux périphériques PCIe ; la même alerte peut également être générée sur un module TPM (Trusted Platform Module).
Pour le module TPM en échec, reportez-vous à l’article de la base de connaissancesData Domain : Alert : ENVIRONMENT-00029 : TPM I/O Module has Failed
La défaillance ou le retrait d’une carte d’E/S (SAS, NIC, NVRAM, FC, par exemple) entraîne une perte de communication avec la carte concernée.
- L’échange à chaud des périphériques PCIe n’est PAS pris en charge. Le système DD DOIT être mis hors tension pour réinstaller ou installer un périphérique PCIe.
- L’échange à chaud déclenche un redémarrage inattendu du système.
Exemple d’alerte :
Alert Id: 147
Event Id: EVT-ENVIRONMENT-00029
Event Message: I/O module has failed
Object: Enclosure=1:Slot=7
Additional Information: Cause=A hardware fault occurredCause
Un module d’E/S PCIe (carte SLIC ou PCI) a subi une défaillance physique en raison d’une panne matérielle ou a été retiré de son logement alors que le système était en cours d’exécution.
Dans certains cas, un événement transitoire tel qu’un problème de firmware peut déclencher une réinitialisation temporaire de la carte qui génère également cette alerte.
Résolution
Étape 1 : confirmez l’état de la carte concernée.
- Connectez-vous au système DD via SSH (DDCLI).
- Exécutez le fichier
system show hardwarepour afficher l’inventaire matériel. - Passez en revue la sortie. Une carte vide, défaillante ou retirée s’affiche comme
(empty)Dans son logement :
Exemple :
sysadmin@DD# system show hardware
Slot Vendor Device Ports
---- ------ ------------------------------- --------------
M QLogic QL41000 4x 10GBase-T (NDC) Ma, Mb, Mc, Md
1 QLogic QL41164 4x 10GbE SFP+ 1a, 1b, 1c, 1d
2 EMC NVRAM 16GB Card
3 EMC PMC Quad Port 12 Gbps SAS 3a, 3b, 3c, 3d
4 Intel Intel QuickAssist Adapter 8970
5 EMC Quad Port 16 Gbps Fibre Channel 5a, 5b, 5c, 5d
6 QLogic QL41000 2x 25GbE 6a, 6b
7 (empty) (empty)
8 QLogic QL41000 2x 25GbE 8a, 8b
---- ------ ------------------------------- --------------
Cet exemple montre le logement 7 comme (empty) car la carte de ce logement est défectueuse.
- Si tous les logements ne sont pas remplis, comparez la sortie actuelle à un rapport d’autosupport précédent pour identifier une carte manquante.
Étape 2 : vérifiez si l’alerte est transitoire
Cette alerte peut être transitoire. Dans certains cas, le système parvient à restaurer la carte par lui-même, par exemple, après qu’une réinitialisation de la carte a été déclenchée par un événement du firmware.
Dans la plupart des exemples transitoires, l’alerte publiée s’efface d’elle-même et aucune action supplémentaire n’est requise.
- Réexécutez
system show hardwareaprès quelques minutes. - Si la carte réapparaît dans la sortie et reprend son fonctionnement normal, l’alerte était transitoire. Effacez l’alerte et surveillez le système pour vérifier si cette situation se reproduit.
- Si la carte est toujours défectueuse ou
(empty)État:- Suivez les étapes 4, 5 et 6 pour résoudre la défaillance matérielle.
Étape 3 - Vérifier et effacer les actes d’accusation
actifsUne défaillance matérielle peut entraîner la création d’un acte d’accusation par le système DD contre le composant concerné. Les actes d’accusation actifs peuvent empêcher certaines opérations ou déclencher des alertes supplémentaires.
Vérifiez et effacez tous les actes d’accusation associés au module d’E/S défaillant.
- Exécutez le fichier
# system indict listpour répertorier tous les actes d’accusation actifs sur le système : - Passez en revue la sortie et identifiez les éventuels actes d’accusation liés au module d’E/S défaillant (faites correspondre les informations de boîtier et de logement de l’alerte).
- Supprimez chaque acte d’accusation pertinent en exécutant la commande suivante, en remplaçant
<indict-id#>avec l’option de ligne de commandeindictment IDÀ partir de la sortie :# system indict remove <indict-id#> - Réexécutez
system indict listpour confirmer que l’acte d’accusation a été retiré avec succès. Passez à l’étape 4 si la carte reste défectueuse ou(empty).
Note: Les actes d’accusation ne sont effacés qu’une fois que vous avez confirmé la cause première ou terminé l’action de récupération associée. La suppression d’un acte d’accusation ne résout pas le problème matériel sous-jacent.
Étape 4 : essayez de récupérer en redémarrant le système
- Redémarrez le système DD en exécutant la commande
# system rebootvia SSH. - Après le redémarrage du système, exécutez
system show hardwarepour vérifier si la carte a été récupérée. - Si la carte est détectée et fonctionne normalement, effacez l’alerte (
# alert clear <alert-id>), des actes d’accusation clairs (conformément à l’étape 3) et continuer de surveiller la récurrence. - Si la carte s’affiche toujours comme
(empty)ou en échec, passez à l’étape 5.
Étape 5 : réinstallez ou réinstallez la carte
Si la carte a été retirée accidentellement, installée dans le mauvais logement ou doit être replacée :
- Mettez le système DD hors tension en exécutant la commande
# system poweroffvia SSH. - Réinstallez (ou replacez) la carte d’E/S dans le logement approprié.
- Remettez le système sous tension.
- Exécutez la commande
system show hardwarepour confirmer que la carte est détectée. - Exécutez la commande
system indict listpour vérifier qu’il n’y a plus d’actes d’accusation. Supprimez tous les actes d’accusation périmés avecsystem indict remove <indict-id#> - Si la carte ne fonctionne toujours pas, passez à l’étape 6.
Étape 6 : contactez le support
techniqueSi la carte reste dans un état défectueux après avoir effectué les étapes ci-dessus, la carte est probablement défectueuse.
Contactez votre fournisseur de support Dell pour enquêter sur la panne et organiser une réparation ou un remplacement.
Pour accélérer le traitement de votre demande de service, confirmez que les étapes 1 à 5 ont été effectuées, puis générez une nouvelle offre groupée de support et joignez-la à la demande de service.