PowerEdge: Probleme mit thermischer GPU-Drosselung oder nicht erkannter GPU
Summary: Dieser Artikel enthält Anleitungen zum Troubleshooting für Probleme mit thermischer GPU-Drosselung und nicht erkannter GPU auf Dell PowerEdge-Servern. Diese Probleme können aufgrund von Temperaturbedingungen, Hardwarekonfigurationsproblemen oder Systemkonfigurationseinstellungen auftreten. ...
Symptoms
- Die GPU-Performance wird bei hoher Workload reduziert.
- Die GPU-Taktrate sinkt automatisch, um die Hardware zu schützen.
- Die GPU-Temperatur erreicht bei ausgelasteten Workloads hohe Werte.
- Das Systemereignisprotokoll (SEL) zeigt Warnungen in Bezug auf die Systemeintrittstemperatur an.
- GPU wird nicht im Betriebssystem oder in Managementtools angezeigt.
- Der Befehl
nvidia-smizeigt kein GPU-Gerät an. - iDRAC oder BIOS erkennt die installierte GPU nicht.
Cause
- Hohe Umgebungstemperatur im Rechenzentrum
- Unzureichender Luftstrom oder blockierte Luftzufuhr im Server-Rack
- Falsches Lüfterprofil oder falsche Einstellungen für die Temperaturrichtlinie
- GPU sitzt nicht ordnungsgemäß im PCIe-Steckplatz
- Nicht unterstützte GPU-Konfiguration oder nicht übereinstimmende Firmware
- Veraltete BIOS-, iDRAC- oder GPU-Firmware
- Probleme mit der Stromversorgung oder Kabelverbindung für GPU-Module
Resolution
1. Überprüfen Sie die GPU-Temperatur und den Drosselungsstatus:
Führen Sie den folgenden Befehl im Betriebssystem aus, um die GPU-Leistung und den Drosselungsstatus von NVIDIA-GPUs zu überprüfen:
nvidia-smi -q -d performance
Wenn die Gründe für die Drosselung als "Nicht aktiv" angezeigt werden, funktioniert die GPU normal.
2. Überwachen der Systemtemperatur:
- Überprüfen Sie das Systemereignisprotokoll (SEL) in iDRAC.
- Überprüfen Sie das Lebenszyklusprotokoll auf Temperaturwarnungen.
- Überprüfen Sie die Systemeintrittstemperatur im Abschnitt Temperaturübersicht.
3. Verbesserte Kühlbedingungen:
- Stellen Sie sicher, dass die Umgebungstemperatur im Rechenzentrum innerhalb der unterstützten Grenzwerte liegt.
- Entfernen Sie blockierte Luftströme im Rack.
- Stellen Sie sicher, dass alle Systemlüfter ordnungsgemäß funktionieren.
- Verwenden Sie geeignete Luftstromabdeckungen und GPU-Kühlkits.
4. Überprüfen Sie die GPU-Hardwareinstallation:
- Stellen Sie sicher, dass die GPU korrekt im PCIe-Steckplatz sitzt.
- Überprüfen Sie die GPU-Stromkabel und -Anschlüsse.
- Vergewissern Sie sich, dass die GPU auf der Serverplattform unterstützt wird.
5. Aktualisieren Sie die Systemfirmware:
- Aktualisieren Sie das Server-BIOS.
- Aktualisieren Sie die iDRAC-Firmware.
- Aktualisieren Sie die GPU-Treiber und -Firmware.
6. Überprüfen der GPU-Erkennung:
Verwenden Sie den folgenden Befehl, um zu überprüfen, ob die Nvidia GPU vom System erkannt wird:
nvidia-smi
Wenn die GPU nicht erkannt wird, überprüfen Sie die BIOS-Einstellungen und die Hardwareinstallation.
7. Testen Sie die GPU in einem anderen PCIe-Steckplatz:
Wenn die GPU nicht erkannt wird oder weiterhin Leistungsprobleme aufweist, versuchen Sie, die GPU in einem anderen verfügbaren PCIe-Steckplatz zu installieren.
- Schalten Sie den Server aus und ziehen Sie die Netzkabel ab.
- Entfernen Sie die GPU aus dem aktuellen PCIe-Steckplatz.
- Installieren Sie die GPU in einem anderen unterstützten PCIe-Steckplatz.
- Schließen Sie die Stromversorgung wieder an und schalten Sie das System ein.
- Überprüfen Sie, ob die GPU mithilfe des Befehls erkannt wird:
nvidia-smioder aus der iDRAC-Hardwarebestandsliste.
Wenn die GPU in einem anderen Steckplatz erkannt wird, hat der ursprüngliche PCIe-Steckplatz möglicherweise ein Konfigurations- oder Hardwareproblem.
8. Führen Sie den GPU-Diagnosetest durch:
Führen Sie das NVIDIA Data Center GPU Manager (DCGM)-Diagnosetool aus, um die Integrität der NVIDIA GPU zu überprüfen und potenzielle Hardware- oder Temperaturprobleme zu erkennen.
- Greifen Sie über SSH oder die Konsole auf das Betriebssystem zu.
- Führen Sie den folgenden Befehl aus, um einen erweiterten GPU-Diagnosetest durchzuführen:
sudo dcgmi diag
Mit diesem Befehl wird ein umfassender Diagnosetest durchgeführt, bei dem GPU-Speicher, PCIe-Konnektivität und thermisches Verhalten geprüft werden. Überprüfen Sie die Ausgabe, um hardware- oder leistungsbezogene Probleme zu identifizieren.