PowerEdge: Probleme mit thermischer GPU-Drosselung oder nicht erkannter GPU

Summary: Dieser Artikel enthält Anleitungen zum Troubleshooting für Probleme mit thermischer GPU-Drosselung und nicht erkannter GPU auf Dell PowerEdge-Servern. Diese Probleme können aufgrund von Temperaturbedingungen, Hardwarekonfigurationsproblemen oder Systemkonfigurationseinstellungen auftreten. ...

This article applies to This article does not apply to This article is not tied to any specific product. Not all product versions are identified in this article.

Symptoms

 

  • Die GPU-Performance wird bei hoher Workload reduziert.
  • Die GPU-Taktrate sinkt automatisch, um die Hardware zu schützen.
  • Die GPU-Temperatur erreicht bei ausgelasteten Workloads hohe Werte.
  • Das Systemereignisprotokoll (SEL) zeigt Warnungen in Bezug auf die Systemeintrittstemperatur an.
  • GPU wird nicht im Betriebssystem oder in Managementtools angezeigt.
  • Der Befehl nvidia-smi zeigt kein GPU-Gerät an.
  • iDRAC oder BIOS erkennt die installierte GPU nicht.

Cause

  • Hohe Umgebungstemperatur im Rechenzentrum
  • Unzureichender Luftstrom oder blockierte Luftzufuhr im Server-Rack
  • Falsches Lüfterprofil oder falsche Einstellungen für die Temperaturrichtlinie
  • GPU sitzt nicht ordnungsgemäß im PCIe-Steckplatz
  • Nicht unterstützte GPU-Konfiguration oder nicht übereinstimmende Firmware
  • Veraltete BIOS-, iDRAC- oder GPU-Firmware
  • Probleme mit der Stromversorgung oder Kabelverbindung für GPU-Module

Resolution

1. Überprüfen Sie die GPU-Temperatur und den Drosselungsstatus:

Führen Sie den folgenden Befehl im Betriebssystem aus, um die GPU-Leistung und den Drosselungsstatus von NVIDIA-GPUs zu überprüfen:

nvidia-smi -q -d performance

Wenn die Gründe für die Drosselung als "Nicht aktiv" angezeigt werden, funktioniert die GPU normal.

 

2. Überwachen der Systemtemperatur:

  • Überprüfen Sie das Systemereignisprotokoll (SEL) in iDRAC.
  • Überprüfen Sie das Lebenszyklusprotokoll auf Temperaturwarnungen.
  • Überprüfen Sie die Systemeintrittstemperatur im Abschnitt Temperaturübersicht.

 

3. Verbesserte Kühlbedingungen:

  • Stellen Sie sicher, dass die Umgebungstemperatur im Rechenzentrum innerhalb der unterstützten Grenzwerte liegt.
  • Entfernen Sie blockierte Luftströme im Rack.
  • Stellen Sie sicher, dass alle Systemlüfter ordnungsgemäß funktionieren.
  • Verwenden Sie geeignete Luftstromabdeckungen und GPU-Kühlkits.

 

4. Überprüfen Sie die GPU-Hardwareinstallation:

  • Stellen Sie sicher, dass die GPU korrekt im PCIe-Steckplatz sitzt.
  • Überprüfen Sie die GPU-Stromkabel und -Anschlüsse.
  • Vergewissern Sie sich, dass die GPU auf der Serverplattform unterstützt wird.

 

5. Aktualisieren Sie die Systemfirmware:

  • Aktualisieren Sie das Server-BIOS.
  • Aktualisieren Sie die iDRAC-Firmware.
  • Aktualisieren Sie die GPU-Treiber und -Firmware.

 

6. Überprüfen der GPU-Erkennung:

Verwenden Sie den folgenden Befehl, um zu überprüfen, ob die Nvidia GPU vom System erkannt wird:

nvidia-smi

Wenn die GPU nicht erkannt wird, überprüfen Sie die BIOS-Einstellungen und die Hardwareinstallation.

 

7. Testen Sie die GPU in einem anderen PCIe-Steckplatz:

Wenn die GPU nicht erkannt wird oder weiterhin Leistungsprobleme aufweist, versuchen Sie, die GPU in einem anderen verfügbaren PCIe-Steckplatz zu installieren.

  • Schalten Sie den Server aus und ziehen Sie die Netzkabel ab.
  • Entfernen Sie die GPU aus dem aktuellen PCIe-Steckplatz.
  • Installieren Sie die GPU in einem anderen unterstützten PCIe-Steckplatz.
  • Schließen Sie die Stromversorgung wieder an und schalten Sie das System ein.
  • Überprüfen Sie, ob die GPU mithilfe des Befehls erkannt wird: nvidia-smi oder aus der iDRAC-Hardwarebestandsliste.

Wenn die GPU in einem anderen Steckplatz erkannt wird, hat der ursprüngliche PCIe-Steckplatz möglicherweise ein Konfigurations- oder Hardwareproblem.

 

8. Führen Sie den GPU-Diagnosetest durch:

Führen Sie das NVIDIA Data Center GPU Manager (DCGM)-Diagnosetool aus, um die Integrität der NVIDIA GPU zu überprüfen und potenzielle Hardware- oder Temperaturprobleme zu erkennen.

  1. Greifen Sie über SSH oder die Konsole auf das Betriebssystem zu.
  2. Führen Sie den folgenden Befehl aus, um einen erweiterten GPU-Diagnosetest durchzuführen:
sudo dcgmi diag

Mit diesem Befehl wird ein umfassender Diagnosetest durchgeführt, bei dem GPU-Speicher, PCIe-Konnektivität und thermisches Verhalten geprüft werden. Überprüfen Sie die Ausgabe, um hardware- oder leistungsbezogene Probleme zu identifizieren.

Affected Products

C Series, Rack Servers, XE Servers
Article Properties
Article Number: 000458921
Article Type: Solution
Last Modified: 14 ذو القعدة 1447
Version:  1
Find answers to your questions from other Dell users
Support Services
Check if your device is covered by Support Services.