Data Domain : Dépannage des erreurs de mémoire
摘要: Cet article explique comment dépanner les alertes liées à la mémoire sur les systèmes Dell Data Domain, y compris comment identifier une barrette DIMM défectueuse devant être remplacée. Il couvre les codes d’alerte courants, les causes premières des erreurs ECC corrigibles et non corrigibles, ainsi que des conseils de résolution étape par étape tels que le lancement de la réparation post-package (PPR), l’exécution des commandes CLI de diagnostic et le dépannage physique. ...
本文章適用於
本文章不適用於
本文無關於任何特定產品。
本文未識別所有產品版本。
症狀
- DDOS génère des alertes liées à la mémoire, notamment :
DIMM-00001: Correctable ECC logging limit reachedDIMM-00002: Multibit uncorrectable ECC errorDIMM-00003: Memory card failureENVIRONMENT-00009: Correctable ECC errors exceed thresholdENVIRONMENT-00013: Uncorrectable ECC error detectedENVIRONMENT-00044: Memory riser fault detectedMEM-00001: DIMM failure detected; DDFS will not startMEM-00002: Memory size below configured value
- Rapports du journal des événements système (SEL) de l’iDRAC
MEM0802:The memory health monitor feature has detected a degradation in the DIMM installed in DIMM [slot number]. Reboot system to initiate self-heal process.
- Redémarrages du système déclenchés par des erreurs de mémoire non corrigibles
- DDFS ne démarre pas ou ne peut pas être activé
- Le système passe dans un état d’arrêt en raison d’une défaillance matérielle de la mémoire
- D’autres alertes peuvent masquer des problèmes de mémoire (par exemple, une erreur de vérification de la machine du processeur)
原因
- Les modules DIMM Data Domain utilisent le code de correction d’erreurs (ECC) pour détecter et corriger les erreurs de mémoire.
- Les erreurs corrigibles s’accumulent et déclenchent des alertes en cas de dépassement des seuils.
- Les erreurs non corrigibles indiquent une panne matérielle et peuvent provoquer une instabilité ou un redémarrage du système.
- La défaillance d’un module DIMM ou d’une carte de montage de mémoire réduit la mémoire disponible et peut empêcher le démarrage de DDFS.
🛠️ REMARQUE : D’autres symptômes ou alertes peuvent masquer des erreurs de mémoire. Par exemple, une erreur de vérification de la machine du processeur. Un redémarrage peut résoudre le problème de mémoire sous-jacent et une analyse approfondie des logs ou un dépannage peut être nécessaire.
解析度
✅ REMARQUE : si une erreur DIMM est signalée sur les systèmes basés sur Dell PowerEdge, la première action de restauration consiste à redémarrer l’unité DataDomain. Cela lance une PPR (POST Package Repair) pour récupérer la barrette DIMM.
Alerte DIMM - Guide de décision au redémarrage
La fonctionnalité PPR (Post Package Repair) du BIOS peut réparer les cellules de mémoire affectées lors d’un redémarrage.
Aide à la décision de redémarrage :
| Scénario | Recommandation |
|---|---|
| L’alerte vient d’apparaître ; système stable ; Sauvegardes de production en cours d’exécution | Prévoyez une fenêtre de maintenance dans les 24 à 48 heures pour redémarrer le système |
| Alerte présente pendant plusieurs jours sans action | Planifiez un redémarrage dès que possible pour éviter l’escalade d’une erreur non corrigible (MEM0001) |
| Système inactif ou en fenêtre de maintenance | Redémarrez immédiatement pour permettre l’autoréparation de PPR. |
Avertissements critiques :
- Ne retirez pas ou n’échangez pas la barrette DIMM avant le redémarrage. Une PPR nécessite que le module DIMM d’origine soit en place.
- Le système peut redémarrer automatiquement plusieurs fois au cours de l’autoréparation. Ce comportement est normal.
- Si l’autoréparation réussit, le remplacement du module DIMM n’est pas nécessaire.
- Si l’alerte persiste après le redémarrage ou est transmise à MEM0001, contactez le support Dell.
Étapes standard de dépannage et de résolution
- Redémarrez le système Data Domain (plates-formes PowerEdge) pour lancer la PPR.
- Identifiez le composant défectueux (DIMM, CPU ou carte mère) à l’aide d’alertes et de diagnostics.
- Comparez l’état actuel du système à un snapshot AutoSupport précédent (avant l’alerte).
- Exécutez les commandes de l’interface de ligne de commande DD suivantes :
alerts show current system show meminfo enclosure show memory log view debug/messages.engineering - Exécutez le bilan de santé du matériel DDOS pour confirmer la panne matérielle.
- Effectuez des vérifications physiques :
- Réinstallez la barrette DIMM en toute sécurité
- Remplacez le module par un module DIMM dont le fonctionnement a été vérifié pour les tests d’isolement
- Remplacez le composant défectueux en fonction des résultats du diagnostic.
- Si le système ne démarre pas :
- Retrait du matériel non essentiel
- Démarrage avec une configuration minimale (un seul module DIMM dans le logement 0)
- Collectez un bundle de support et ouvrez une demande de service si nécessaire.
- La vidéo suivante montre comment rassembler un bundle de support : Rassembler un bundle de support
- La vidéo suivante montre comment rassembler un bundle de support : Rassembler un bundle de support
其他資訊
Références :
- Documents relatifs au matériel PowerProtect et Data Domain pour des informations pertinentes sur la configuration et la disposition des modules DIMM.
- Data Domain : exigences en matière de mémoire système et configurations de stockage étendu
- Data Domain : Dépannage des erreurs de mémoire
- Vidéo : Comment rassembler un bundle de support
受影響的產品
Data Domain, PowerProtect Data Protection Appliance, Data Domain, Data Domain Deduplication Storage Systems, PowerProtect Data Protection Hardware文章屬性
文章編號: 000034334
文章類型: Solution
上次修改時間: 01 7月 2026
版本: 10
向其他 Dell 使用者尋求您問題的答案
支援服務
檢查您的裝置是否在支援服務的涵蓋範圍內。