Data Domain: rozwiązywanie problemów z pamięcią

摘要: W tym artykule opisano sposób rozwiązywania problemów z alertami dotyczącymi pamięci w systemach Dell Data Domain, w tym sposób identyfikowania wadliwego modułu DIMM, który wymaga wymiany. Obejmuje typowe kody alertów, główne przyczyny naprawialnych i nienaprawialnych błędów ECC oraz wskazówki krok po kroku, takie jak inicjowanie naprawy POST-Package Repair (PPR), uruchamianie poleceń diagnostycznych CLI i rozwiązywanie problemów fizycznych. ...

本文章適用於 本文章不適用於 本文無關於任何特定產品。 本文未識別所有產品版本。

症狀

  • DDOS generuje alerty związane z pamięcią, w tym:
    • DIMM-00001: Correctable ECC logging limit reached
    • DIMM-00002: Multibit uncorrectable ECC error
    • DIMM-00003: Memory card failure
    • ENVIRONMENT-00009: Correctable ECC errors exceed threshold
    • ENVIRONMENT-00013: Uncorrectable ECC error detected
    • ENVIRONMENT-00044: Memory riser fault detected
    • MEM-00001: DIMM failure detected; DDFS will not start
    • MEM-00002: Memory size below configured value
  • Raporty dziennika zdarzeń systemu iDRAC (SEL)
    • MEM0802: The memory health monitor feature has detected a degradation in the DIMM installed in DIMM [slot number]. Reboot system to initiate self-heal process.
  • Ponowne uruchamianie systemu spowodowane niemożliwymi do naprawienia błędami pamięci
  • DDFS nie uruchamia się lub nie można go włączyć
  • System przechodzi w stan wyłączenia z powodu awarii pamięci
  • Inne alerty mogą maskować problemy z pamięcią (na przykład błąd sprawdzania procesora)

原因

  • Moduły DIMM Data Domain wykorzystują funkcję korekcji błędów (ECC) do wykrywania i korygowania błędów pamięci.
  • Błędy możliwe do naprawienia kumulują się i wyzwalają alerty po przekroczeniu progów.
  • Niemożliwe do naprawienia błędy wskazują na awarię sprzętu i mogą spowodować niestabilność systemu lub ponowne uruchomienie.
  • Awaria modułu DIMM lub karty nośnej pamięci zmniejsza ilość dostępnej pamięci i może uniemożliwić uruchomienie DDFS.
🛠️ UWAGA: inne objawy lub alerty mogą maskować błędy pamięci — na przykład błąd sprawdzania procesora — ponowne uruchomienie może rozwiązać podstawowy problem z pamięcią i może być wymagana głębsza analiza dziennika lub rozwiązywanie problemów.

解析度

✅ UWAGA: W przypadku zgłoszenia błędu modułu DIMM w systemach Dell PowerEdge pierwszą czynnością wymagającą odzyskania jest ponowne uruchomienie jednostki DataDomain. Spowoduje to zainicjowanie testu PPR (POST Package Repair) w celu odzyskania modułu DIMM.

Alert DIMM — przewodnik po podejmowaniu decyzji o ponownym uruchomieniu

 Funkcja BIOS Post Package Repair (PPR) umożliwia naprawę komórek pamięci, których dotyczy problem, podczas ponownego uruchamiania.


Wskazówki dotyczące decyzji o ponownym uruchomieniu:

Scenariusz Zalecenie
Właśnie pojawił się alert; stabilny system; Uruchomione kopie zapasowe produkcji Zaplanuj przerwę konserwacyjną w ciągu 24–48 godzin, aby ponownie uruchomić system
Alert jest obecny przez wiele dni bez działania Zaplanuj ponowne uruchomienie tak szybko, jak to możliwe, aby uniknąć eskalacji do nienaprawialnego błędu (MEM0001)
System bezczynny lub w przerwie konserwacyjnej Natychmiast uruchom ponownie komputer, aby umożliwić samoczynną naprawę PPR

Ostrzeżenia krytyczne:

  • Nie wyjmuj ani nie wymieniaj modułów DIMM przed ponownym uruchomieniem. PPR wymaga oryginalnego modułu DIMM.
  • System może zostać automatycznie uruchomiony ponownie więcej niż jeden raz podczas automatycznej naprawy. Jest to zachowanie poprawne.
  • Jeśli automatyczna naprawa zakończy się powodzeniem, wymiana modułów DIMM nie jest wymagana.
  • Jeśli alert nie ustąpi po ponownym uruchomieniu lub eskaluje do MEM0001, skontaktuj się z działem pomocy technicznej firmy Dell.

Standardowe czynności rozwiązywania problemów

  1. Uruchom ponownie system Data Domain (platformy PowerEdge), aby zainicjować PPR.
  2. Zidentyfikuj wadliwy element (DIMM, procesor lub płytę główną) za pomocą alertów i diagnostyki.
  3. Porównaj bieżący stan systemu z poprzednią migawką AutoSupport (przed alertem).
  4. Uruchom następujące polecenia DD CLI:
    alerts show current
    system show meminfo
    enclosure show memory
    log view debug/messages.engineering
    
  5. Uruchom test kondycji sprzętu DDOS, aby potwierdzić usterkę sprzętu.
  6. Przeprowadzenie kontroli bezpośredniej:
    • Popraw osadzenie modułu DIMM
    • Wymień moduł DIMM na inny, sprawny w celu przetestowania izolacji
  7. Wymień uszkodzony element na podstawie wyników diagnostyki.
  8. Jeśli system się nie uruchomi:
    • Usuwanie zbędnego sprzętu
    • Rozruch z minimalną konfiguracją (jeden moduł DIMM w gnieździe 0)
  9. Zbierz pakiet pomocy technicznej i w razie potrzeby otwórz zgłoszenie serwisowe.

其他資訊

受影響的產品

Data Domain, PowerProtect Data Protection Appliance, Data Domain, Data Domain Deduplication Storage Systems, PowerProtect Data Protection Hardware
文章屬性
文章編號: 000034334
文章類型: Solution
上次修改時間: 01 7月 2026
版本:  10
向其他 Dell 使用者尋求您問題的答案
支援服務
檢查您的裝置是否在支援服務的涵蓋範圍內。