PowerEdge: GPU thermal throttling of GPU niet gedetecteerde problemen
Zusammenfassung: Dit artikel bevat richtlijnen voor probleemoplossing voor GPU thermal throttling en GPU niet gedetecteerde problemen op Dell PowerEdge servers. Deze problemen kunnen optreden als gevolg van temperaturen, hardwareconfiguratieproblemen of systeemconfiguratie-instellingen. ...
Symptome
- GPU-prestaties worden verminderd tijdens hoge workloads.
- De GPU-kloksnelheid daalt automatisch om de hardware te beschermen.
- GPU-temperatuur bereikt hoge waarden tijdens stress-workloads.
- In het systeemgebeurtenislogboek (SEL) worden waarschuwingen weergegeven met betrekking tot de inlaattemperatuur van het systeem.
- GPU wordt niet weergegeven in het besturingssysteem of in beheertools.
- De opdracht
nvidia-smigeen enkel GPU-apparaat wordt weergegeven. - iDRAC of BIOS detecteert de geïnstalleerde GPU niet.
Ursache
- Hoge omgevingstemperatuur van het datacenter
- Onvoldoende luchtstroom of geblokkeerde luchtinlaat in het serverrack
- Onjuist ventilatorprofiel of instellingen voor temperatuurbeleid
- GPU niet goed geplaatst in het PCIe-slot
- Niet-ondersteunde GPU-configuratie of firmware komt niet overeen
- Verouderde BIOS-, iDRAC- of GPU-firmware
- Problemen met de voeding of kabelverbinding voor GPU-modules
Lösung
1. Controleer GPU-temperatuur en status van de gashendel:
Voer de volgende opdracht uit in het besturingssysteem om de GPU-prestaties en de status van de throttle van Nvidia GPU's te controleren:
nvidia-smi -q -d performance
Als de redenen voor de beperking worden weergegeven als "Niet actief", werkt de GPU normaal.
2. Systeemtemperatuur bewaken:
- Controleer het systeemgebeurtenislogboek (SEL) in iDRAC.
- Bekijk het Lifecycle-logboek voor temperatuurwaarschuwingen.
- Controleer de inlaattemperatuur van het systeem in het gedeelte Temperatuuroverzicht.
3. Verbeter de koelomstandigheden:
- Controleer of de temperatuur van het datacenter binnen de ondersteunde limieten blijft.
- Verwijder blokkades in de luchtstroom in het rack.
- Controleer of alle systeemventilatoren goed werken.
- Gebruik geschikte luchtstroomomhulsels en GPU-koelkits.
4. Controleer GPU-hardware-installatie:
- Zorg ervoor dat de GPU correct in het PCIe-slot is geplaatst.
- Controleer de GPU-voedingskabels en -connectoren.
- Controleer of de GPU wordt ondersteund op het serverplatform.
5. Systeemfirmware bijwerken:
- Werk het server-BIOS bij.
- Werk de iDRAC-firmware bij.
- Werk GPU-drivers en firmware bij.
6. Controleer GPU-detectie:
Gebruik de volgende opdracht om te controleren of de NVIDIA GPU wordt gedetecteerd door het systeem:
nvidia-smi
Als de GPU niet wordt gedetecteerd, controleert u de BIOS-instellingen en de hardware-installatie.
7. Test de GPU in een ander PCIe-slot:
Als de GPU niet wordt gedetecteerd of prestatieproblemen blijft ondervinden, probeer dan de GPU in een ander beschikbaar PCIe-slot te installeren.
- Schakel de server uit en koppel de voedingskabels los.
- Verwijder de GPU uit het huidige PCIe-slot.
- Installeer de GPU in een ander ondersteund PCIe-slot.
- Sluit de stroom opnieuw aan en schakel het systeem in.
- Controleer of de GPU wordt gedetecteerd met de opdracht
nvidia-smiof uit de iDRAC-hardwareinventaris.
Als de GPU wordt gedetecteerd in een ander slot, heeft het oorspronkelijke PCIe-slot mogelijk een configuratie- of hardwareprobleem.
8. Voer de diagnostische test van de GPU uit:
Voer de diagnostische tool NVIDIA Data Center GPU Manager (DCGM) uit om de status van de NVIDIA GPU te controleren en mogelijke hardware- of thermische problemen te detecteren.
- Open het besturingssysteem via SSH of console.
- Voer de volgende opdracht uit om een uitgebreide GPU-diagnostische test uit te voeren:
sudo dcgmi diag
Deze opdracht voert een uitgebreide diagnostische test uit die het GPU-geheugen, de PCIe-connectiviteit en thermisch gedrag controleert. Bekijk de uitvoer om hardware- of prestatiegerelateerde problemen te identificeren.