PowerEdge: GPU thermal throttling of GPU niet gedetecteerde problemen

Zusammenfassung: Dit artikel bevat richtlijnen voor probleemoplossing voor GPU thermal throttling en GPU niet gedetecteerde problemen op Dell PowerEdge servers. Deze problemen kunnen optreden als gevolg van temperaturen, hardwareconfiguratieproblemen of systeemconfiguratie-instellingen. ...

Dieser Artikel gilt für Dieser Artikel gilt nicht für Dieser Artikel ist nicht an ein bestimmtes Produkt gebunden. In diesem Artikel werden nicht alle Produktversionen aufgeführt.

Symptome

 

  • GPU-prestaties worden verminderd tijdens hoge workloads.
  • De GPU-kloksnelheid daalt automatisch om de hardware te beschermen.
  • GPU-temperatuur bereikt hoge waarden tijdens stress-workloads.
  • In het systeemgebeurtenislogboek (SEL) worden waarschuwingen weergegeven met betrekking tot de inlaattemperatuur van het systeem.
  • GPU wordt niet weergegeven in het besturingssysteem of in beheertools.
  • De opdracht nvidia-smi geen enkel GPU-apparaat wordt weergegeven.
  • iDRAC of BIOS detecteert de geïnstalleerde GPU niet.

Ursache

  • Hoge omgevingstemperatuur van het datacenter
  • Onvoldoende luchtstroom of geblokkeerde luchtinlaat in het serverrack
  • Onjuist ventilatorprofiel of instellingen voor temperatuurbeleid
  • GPU niet goed geplaatst in het PCIe-slot
  • Niet-ondersteunde GPU-configuratie of firmware komt niet overeen
  • Verouderde BIOS-, iDRAC- of GPU-firmware
  • Problemen met de voeding of kabelverbinding voor GPU-modules

Lösung

1. Controleer GPU-temperatuur en status van de gashendel:

Voer de volgende opdracht uit in het besturingssysteem om de GPU-prestaties en de status van de throttle van Nvidia GPU's te controleren:

nvidia-smi -q -d performance

Als de redenen voor de beperking worden weergegeven als "Niet actief", werkt de GPU normaal.

 

2. Systeemtemperatuur bewaken:

  • Controleer het systeemgebeurtenislogboek (SEL) in iDRAC.
  • Bekijk het Lifecycle-logboek voor temperatuurwaarschuwingen.
  • Controleer de inlaattemperatuur van het systeem in het gedeelte Temperatuuroverzicht.

 

3. Verbeter de koelomstandigheden:

  • Controleer of de temperatuur van het datacenter binnen de ondersteunde limieten blijft.
  • Verwijder blokkades in de luchtstroom in het rack.
  • Controleer of alle systeemventilatoren goed werken.
  • Gebruik geschikte luchtstroomomhulsels en GPU-koelkits.

 

4. Controleer GPU-hardware-installatie:

  • Zorg ervoor dat de GPU correct in het PCIe-slot is geplaatst.
  • Controleer de GPU-voedingskabels en -connectoren.
  • Controleer of de GPU wordt ondersteund op het serverplatform.

 

5. Systeemfirmware bijwerken:

  • Werk het server-BIOS bij.
  • Werk de iDRAC-firmware bij.
  • Werk GPU-drivers en firmware bij.

 

6. Controleer GPU-detectie:

Gebruik de volgende opdracht om te controleren of de NVIDIA GPU wordt gedetecteerd door het systeem:

nvidia-smi

Als de GPU niet wordt gedetecteerd, controleert u de BIOS-instellingen en de hardware-installatie.

 

7. Test de GPU in een ander PCIe-slot:

Als de GPU niet wordt gedetecteerd of prestatieproblemen blijft ondervinden, probeer dan de GPU in een ander beschikbaar PCIe-slot te installeren.

  • Schakel de server uit en koppel de voedingskabels los.
  • Verwijder de GPU uit het huidige PCIe-slot.
  • Installeer de GPU in een ander ondersteund PCIe-slot.
  • Sluit de stroom opnieuw aan en schakel het systeem in.
  • Controleer of de GPU wordt gedetecteerd met de opdracht nvidia-smi of uit de iDRAC-hardwareinventaris.

Als de GPU wordt gedetecteerd in een ander slot, heeft het oorspronkelijke PCIe-slot mogelijk een configuratie- of hardwareprobleem.

 

8. Voer de diagnostische test van de GPU uit:

Voer de diagnostische tool NVIDIA Data Center GPU Manager (DCGM) uit om de status van de NVIDIA GPU te controleren en mogelijke hardware- of thermische problemen te detecteren.

  1. Open het besturingssysteem via SSH of console.
  2. Voer de volgende opdracht uit om een uitgebreide GPU-diagnostische test uit te voeren:
sudo dcgmi diag

Deze opdracht voert een uitgebreide diagnostische test uit die het GPU-geheugen, de PCIe-connectiviteit en thermisch gedrag controleert. Bekijk de uitvoer om hardware- of prestatiegerelateerde problemen te identificeren.

Betroffene Produkte

C Series, Rack Servers, XE Servers
Artikeleigenschaften
Artikelnummer: 000458921
Artikeltyp: Solution
Zuletzt geändert: 01 Mai 2026
Version:  1
Antworten auf Ihre Fragen erhalten Sie von anderen Dell NutzerInnen
Support Services
Prüfen Sie, ob Ihr Gerät durch Support Services abgedeckt ist.