Data Domain: solucionando problemas de erros de memória

摘要: Este artigo descreve como solucionar problemas de alertas relacionados à memória em sistemas Dell Data Domain, incluindo como identificar um DIMM com defeito que requer substituição. Ele abrange códigos de alerta comuns, causas raiz de erros de ECC corrigíveis e incorrigíveis e orientações passo a passo de resolução, como iniciar o POST-Package Repair (PPR), executar comandos de diagnóstico da CLI e executar solução de problemas física. ...

本文章適用於 本文章不適用於 本文無關於任何特定產品。 本文未識別所有產品版本。

症狀

  • O DDOS gera alertas relacionados à memória, incluindo:
    • DIMM-00001: Correctable ECC logging limit reached
    • DIMM-00002: Multibit uncorrectable ECC error
    • DIMM-00003: Memory card failure
    • ENVIRONMENT-00009: Correctable ECC errors exceed threshold
    • ENVIRONMENT-00013: Uncorrectable ECC error detected
    • ENVIRONMENT-00044: Memory riser fault detected
    • MEM-00001: DIMM failure detected; DDFS will not start
    • MEM-00002: Memory size below configured value
  • Relatórios de registro de eventos do sistema (SEL) do iDRAC
    • MEM0802: The memory health monitor feature has detected a degradation in the DIMM installed in DIMM [slot number]. Reboot system to initiate self-heal process.
  • Reinicializações do sistema acionadas por erros de memória incorrigíveis
  • O DDFS não inicia ou não pode ser ativado
  • O sistema entra em um estado inativo devido a uma falha de hardware de memória
  • Outros alertas podem mascarar problemas de memória (por exemplo, erro de verificação da máquina da CPU)

原因

  • Os DIMMs do Data Domain usam códigos de correção de erros (ECC) para detectar e corrigir erros de memória.
  • Erros corrigíveis se acumulam e acionam alertas quando os limites são excedidos.
  • Erros incorrigíveis indicam uma falha de hardware e podem causar instabilidade ou reinicialização do sistema.
  • A falha de um DIMM ou riser de memória reduz a memória disponível e pode impedir a inicialização do DDFS.
🛠️ NOTA: outros sintomas ou alertas podem mascarar erros de memória, por exemplo, erro de verificação da máquina da CPU - uma reinicialização pode resolver o problema de memória subjacente e pode ser necessária uma análise ou solução de problemas de registro mais profunda.

解析度

✅ NOTA: se um erro de DIMM for relatado em sistemas baseados no Dell PowerEdge, a primeira ação a ser recuperada será reinicializar a unidade do Data Domain. Isso iniciará o PPR (POST Package Repair) para recuperar o DIMM.

Alerta de DIMM - Guia de decisão de reinicialização

 O recurso de reparo pós-pacote (PPR) do BIOS pode reparar as células de memória afetadas durante uma reinicialização.


Orientação sobre a decisão de reinicialização:

Cenário Recomendação
Alerta acabou de aparecer; sistema estável; Backups de produção em execução Agende uma janela de manutenção dentro de 24 a 48 horas para reinicializar o sistema
Alerta presente por vários dias sem ação Agende uma reinicialização o mais rápido possível para evitar o escalonamento para erro incorrigível (MEM0001)
Sistema ocioso ou na janela de manutenção Reinicialize imediatamente para permitir a autocorreção do PPR

Advertências críticas:

  • Não remova nem troque o DIMM antes de reinicializar. O PPR requer o DIMM original no local.
  • O sistema pode ser reinicializado automaticamente mais de uma vez durante a autocorreção. Isso é comum.
  • Se a autocorreção for bem-sucedida, a substituição de DIMM não será necessária.
  • Se o alerta persistir após a reinicialização ou escalar para o MEM0001, entre em contato com o Suporte Dell.

Etapas padrão de solução de problemas e resolução

  1. Reinicialize o sistema Data Domain (plataformas PowerEdge) para iniciar o PPR.
  2. Identifique o componente com defeito (DIMM, CPU ou placa-mãe) usando alertas e diagnósticos.
  3. Compare o estado atual do sistema com um snapshot anterior do AutoSupport (antes do alerta).
  4. Execute os seguintes comandos da CLI do DD:
    alerts show current
    system show meminfo
    enclosure show memory
    log view debug/messages.engineering
    
  5. Execute a verificação de integridade de hardware do DDOS para confirmar a falha de hardware.
  6. Realize verificações físicas:
    • Recoloque o DIMM com segurança
    • Troque por um DIMM em boas condições para testes de isolamento
  7. Substitua o componente com falha com base nos resultados do diagnóstico.
  8. Se o sistema não inicializar:
    • Remova o hardware não essencial
    • Inicialize com uma configuração mínima (DIMM único no slot 0)
  9. Colete um pacote de suporte e abra um chamado, se necessário.

其他資訊

受影響的產品

Data Domain, PowerProtect Data Protection Appliance, Data Domain, Data Domain Deduplication Storage Systems, PowerProtect Data Protection Hardware
文章屬性
文章編號: 000034334
文章類型: Solution
上次修改時間: 01 7月 2026
版本:  10
向其他 Dell 使用者尋求您問題的答案
支援服務
檢查您的裝置是否在支援服務的涵蓋範圍內。