Data Domain : Dépannage des erreurs de mémoire
Summary: Cet article explique comment dépanner les alertes liées à la mémoire sur les systèmes Dell Data Domain, y compris comment identifier une barrette DIMM défectueuse devant être remplacée. Il couvre les codes d’alerte courants, les causes premières des erreurs ECC corrigibles et non corrigibles, ainsi que des conseils de résolution étape par étape tels que le lancement de la réparation post-package (PPR), l’exécution de commandes CLI de diagnostic et l’exécution d’un dépannage physique. ...
This article applies to
This article does not apply to
This article is not tied to any specific product.
Not all product versions are identified in this article.
Symptoms
- DDOS génère des alertes liées à la mémoire, notamment :
DIMM-00001: Correctable ECC logging limit reachedDIMM-00002: Multibit uncorrectable ECC errorDIMM-00003: Memory card failureENVIRONMENT-00009: Correctable ECC errors exceed thresholdENVIRONMENT-00013: Uncorrectable ECC error detectedENVIRONMENT-00044: Memory riser fault detectedMEM-00001: DIMM failure detected; DDFS will not startMEM-00002: Memory size below configured value
- Entrée du journal des événements système (SEL)
MEM0802:The memory health monitor feature has detected a degradation in the DIMM installed in DIMM [slot number]. Reboot system to initiate self-heal process.
- Redémarrages du système déclenchés par des erreurs de mémoire non corrigibles
- DDFS ne démarre pas ou ne peut pas être activé
- Le système passe dans un état d’arrêt en raison d’une défaillance matérielle de la mémoire
- D’autres alertes peuvent masquer des problèmes de mémoire (par exemple, Erreur de vérification de la machine du processeur)
Cause
- Les modules DIMM Data Domain utilisent le code de correction d’erreurs (ECC) pour détecter et corriger les erreurs de mémoire.
- Les erreurs corrigibles s’accumulent et déclenchent des alertes en cas de dépassement des seuils.
- Les erreurs non corrigibles indiquent une panne matérielle et peuvent provoquer une instabilité ou un redémarrage du système.
- La défaillance d’un module DIMM ou d’une carte de montage de mémoire réduit la mémoire disponible et peut empêcher le démarrage de DDFS.
Remarque : D’autres symptômes ou alertes peuvent masquer des erreurs de mémoire - par exemple, une erreur de vérification de la machine du processeur. Un redémarrage peut résoudre le problème de mémoire sous-jacente et une analyse ou un dépannage approfondi des logs peut être nécessaire.
Resolution
Remarque : Si une erreur DIMM est signalée sur les systèmes basés sur Dell PowerEdge, la première action de restauration consiste à redémarrer l’unité DataDomain. Cela lance une PPR (POST Package Repair) pour récupérer la barrette DIMM.
Alerte DIMM - Guide de décision au redémarrage
La fonctionnalité BIOS Post Package Repair (PPR-DDR4 Self-healing) peut réparer les cellules de mémoire affectées lors d’un redémarrage.
Aide à la décision de redémarrage :
| Scénario | Recommandation |
|---|---|
| L’alerte vient d’apparaître ; système stable ; Sauvegardes de production en cours d’exécution | Prévoyez une fenêtre de maintenance dans les 24 à 48 heures pour redémarrer le système |
| Alerte présente pendant plusieurs jours sans action | Planifiez un redémarrage dès que possible pour éviter l’escalade vers une erreur non corrigible (MEM0001) |
| Système inactif ou en fenêtre de maintenance | Redémarrez immédiatement pour permettre l’autoréparation de PPR. |
Avertissement critique
- Ne retirez pas ou n’échangez pas la barrette DIMM avant le redémarrage. Une PPR nécessite que le module DIMM d’origine soit en place.
- Le système peut redémarrer automatiquement plusieurs fois au cours de l’autoréparation. Ce comportement est normal.
- Si l’autoréparation réussit, le remplacement du module DIMM n’est pas nécessaire.
- Si l’alerte persiste après le redémarrage ou est escaladée à
MEM0001Contactez le support Dell.
Étapes standard de dépannage et de résolution
- Redémarrez le système Data Domain (plates-formes PowerEdge) pour lancer la PPR.
- Identifiez le composant défectueux (DIMM, CPU ou carte mère) à l’aide d’alertes et de diagnostics.
- Comparez l’état actuel du système à un snapshot AutoSupport précédent (avant l’alerte).
- Exécutez la commande suivante dans l'interface PowerCLI :
alerts show current system show meminfo enclosure show memory log view debug/messages.engineering - Exécutez le bilan de santé du matériel DDOS pour confirmer la panne matérielle.
- Effectuez des vérifications physiques :
- Réinstallez la barrette DIMM en toute sécurité
- Remplacez le module par un module DIMM dont le fonctionnement a été vérifié pour les tests d’isolement
- Remplacez le composant défectueux en fonction des résultats du diagnostic.
- Si le système ne démarre pas :
- Retrait du matériel non essentiel
- Démarrage avec une configuration minimale (un seul module DIMM dans le logement 0)
- Collectez un bundle de support et ouvrez une demande de service si nécessaire.
- La vidéo suivante montre comment rassembler un bundle de support : Gather a Support Bundle (Lien externe : connexion requise)
Additional Information
Ressources :
- Documents relatifs au matériel PowerProtect et Data Domain pour des informations pertinentes sur la configuration et la disposition des modules DIMM.
- Configurations de mémoire système requises et configurations de stockage étendues
- Vidéo : Rassembler un bundle de support (lien externe : connexion requise)
Affected Products
Data Domain, PowerProtect Data Protection Appliance, Data Domain, Data Domain Deduplication Storage Systems, PowerProtect Data Protection HardwareArticle Properties
Article Number: 000034334
Article Type: Solution
Last Modified: 10 aug 2026
Version: 11
Find answers to your questions from other Dell users
Support Services
Check if your device is covered by Support Services.