Data Domain: risoluzione degli errori di memoria

摘要: Questo articolo descrive come risolvere gli avvisi relativi alla memoria sui sistemi Dell Data Domain e come identificare un modulo DIMM difettoso che richiede la sostituzione. Copre i codici di avviso comuni, le root cause degli errori ECC correggibili e non correggibili e le indicazioni dettagliate per la risoluzione, come l'avvio della riparazione del pacchetto POST (POST-Package Repair, PPR), l'esecuzione di comandi CLI di diagnostica e l'esecuzione di risoluzione dei problemi fisici. ...

本文章適用於 本文章不適用於 本文無關於任何特定產品。 本文未識別所有產品版本。

症狀

  • DDOS genera avvisi relativi alla memoria, tra cui:
    • DIMM-00001: Correctable ECC logging limit reached
    • DIMM-00002: Multibit uncorrectable ECC error
    • DIMM-00003: Memory card failure
    • ENVIRONMENT-00009: Correctable ECC errors exceed threshold
    • ENVIRONMENT-00013: Uncorrectable ECC error detected
    • ENVIRONMENT-00044: Memory riser fault detected
    • MEM-00001: DIMM failure detected; DDFS will not start
    • MEM-00002: Memory size below configured value
  • Report System Event Log (SEL) di iDRAC
    • MEM0802: The memory health monitor feature has detected a degradation in the DIMM installed in DIMM [slot number]. Reboot system to initiate self-heal process.
  • Riavvii del sistema attivati da errori di memoria non correggibili
  • DDFS non si avvia o non può essere abilitato
  • Il sistema entra in uno stato di inattività a causa di un guasto hardware della memoria
  • Altri avvisi possono mascherare problemi di memoria (ad esempio, errore di controllo del computer CPU)

原因

  • I DIMM di Data Domain utilizzano ECC (Error Correcting Code) per rilevare e correggere gli errori di memoria.
  • Gli errori correggibili si accumulano e attivano avvisi quando vengono superate le soglie.
  • Gli errori non correggibili indicano un guasto hardware e possono causare l'instabilità del sistema o il riavvio.
  • L'errore di un modulo DIMM o di una riser di memoria riduce la memoria disponibile e può impedire l'avvio di DDFS.
🛠️ NOTA: altri sintomi o avvisi possono mascherare errori di memoria, ad esempio un errore di controllo del computer CPU. Il riavvio potrebbe risolvere il problema di memoria sottostante e potrebbe essere necessaria un'analisi più approfondita dei registri o la risoluzione dei problemi.

解析度

✅ NOTA: se viene segnalato un errore DIMM sui sistemi basati su Dell PowerEdge, la prima azione da eseguire è il riavvio dell'unità DataDomain. Verrà avviata la riparazione del pacchetto POST (PPR) per ripristinare il modulo DIMM.

Avviso DIMM - Guida decisionale per il riavvio

 La funzione PPR (Post Package Repair) del BIOS può riparare le celle di memoria interessate durante il riavvio.


Indicazioni per le decisioni di riavvio:

Scenario Suggerimento
L'avviso è appena apparso; stabile del sistema; Backup di produzione in esecuzione Pianificazione di una finestra di manutenzione entro 24-48 ore per riavviare il sistema
Avviso presente per più giorni senza alcuna azione Pianificare un riavvio il prima possibile per evitare l'escalation a un errore irreversibile (MEM0001)
Sistema inattivo o in finestra di manutenzione Riavviare immediatamente per consentire il self-healing della PPR

Avvisi critici:

  • Non rimuovere o scambiare il modulo DIMM prima del riavvio. La PPR richiede il modulo DIMM originale.
  • Il sistema potrebbe riavviarsi automaticamente più di una volta durante il self-healing. Si tratta del comportamento previsto.
  • Se Self-healing ha esito positivo, non è necessaria la sostituzione del modulo DIMM.
  • Se l'avviso persiste dopo il riavvio o si trasmette a MEM0001, contattare il supporto Dell.

Procedura standard per la risoluzione dei problemi e la risoluzione

  1. Riavviare il sistema Data Domain (piattaforme PowerEdge) per avviare la PPR.
  2. Identificare il componente difettoso (DIMM, CPU o scheda madre) utilizzando avvisi e diagnostica.
  3. Confrontare lo stato corrente del sistema con un'istantanea AutoSupport precedente (prima dell'avviso).
  4. Eseguire i seguenti comandi DD CLI:
    alerts show current
    system show meminfo
    enclosure show memory
    log view debug/messages.engineering
    
  5. Eseguire DDOS Hardware Healthcheck per confermare il guasto hardware.
  6. Eseguire i controlli fisici:
    • Riposizionare il modulo DIMM in modo sicuro
    • Sostituire con un DIMM funzionante per i test di isolamento
  7. Sostituire il componente difettoso in base ai risultati della diagnostica.
  8. Se il sistema non si avvia:
    • Rimozione dell'hardware non essenziale
    • Avvio con una configurazione minima (singolo DIMM nello slot 0)
  9. Raccogliere un pacchetto di supporto e aprire una Service Request, se necessario.

其他資訊

受影響的產品

Data Domain, PowerProtect Data Protection Appliance, Data Domain, Data Domain Deduplication Storage Systems, PowerProtect Data Protection Hardware
文章屬性
文章編號: 000034334
文章類型: Solution
上次修改時間: 01 7月 2026
版本:  10
向其他 Dell 使用者尋求您問題的答案
支援服務
檢查您的裝置是否在支援服務的涵蓋範圍內。