PowerEdge: Problem med termisk begränsning av GPU eller problem med att GPU inte identifieras
Zusammenfassung: Den här artikeln innehåller felsökningsvägledning för termisk GPU-begränsning och problem med att GPU:n inte identifieras på Dell PowerEdge-servrar. Dessa problem kan uppstå på grund av temperaturförhållanden, maskinvarukonfigurationsproblem eller systemkonfigurationsinställningar. ...
Symptome
- GPU-prestanda minskar under hög arbetsbelastning.
- GPU-klockhastigheten sjunker automatiskt för att skydda hårdvaran.
- GPU-temperaturen når höga värden under belastningsarbetsbelastningar.
- Systemhändelseloggen (SEL) visar varningar relaterade till systemets ingångstemperatur.
- GPU:n visas inte i operativsystemet eller hanteringsverktygen.
- Kommandot
nvidia-smivisar inte någon GPU-enhet. - iDRAC eller BIOS identifierar inte den installerade GPU:n.
Ursache
- Hög omgivningstemperatur i datacentret
- Otillräckligt luftflöde eller blockerat luftintag i serverracket
- Felaktiga inställningar för fläktprofil eller värmepolicy
- GPU:n sitter inte korrekt i PCIe-kortplatsen
- GPU-konfiguration eller fast programvara som inte stöds
- Föråldrad fast programvara för BIOS, iDRAC eller GPU
- Problem med ström- eller kabelanslutning för GPU-moduler
Lösung
1. Kontrollera GPU-temperatur och gasspjällsstatus:
Kör följande kommando i operativsystemet för att kontrollera GPU-prestanda och begränsningsstatus för Nvidia-GPU:er:
nvidia-smi -q -d performance
Om begränsningsorsaker visas som "Inte aktiva" fungerar GPU:n normalt.
2. Övervaka systemtemperatur:
- Kontrollera systemhändelseloggen (SEL) i iDRAC.
- Granska livscykelloggen för temperaturvarningar.
- Kontrollera systemets ingångstemperatur i avsnittet Temperaturöversikt.
3. Förbättra kylförhållandena:
- Se till att datacentrets omgivningstemperatur ligger inom de gränser som stöds.
- Ta bort luftflödesblockeringar i racket.
- Kontrollera att alla systemfläktar fungerar som de ska.
- Använd lämpliga luftflödeshöljen och GPU-kylningssatser.
4. Verifiera GPU-maskinvaruinstallation:
- Kontrollera att GPU:n sitter ordentligt i PCIe-kortplatsen.
- Kontrollera GPU-strömkablar och kontakter.
- Bekräfta att GPU:n stöds på serverplattformen.
5. Uppdatera systemets inbyggda programvara:
- Uppdatera serverns BIOS.
- Uppdatera den fasta iDRAC-programvaran.
- Uppdatera GPU-drivrutiner och fast programvara.
6. Verifiera GPU-detektering:
Använd följande kommando för att kontrollera om Nvidia GPU detekteras av systemet:
nvidia-smi
Om GPU:n inte detekteras kontrollerar du BIOS-inställningarna och maskinvaruinstallationen.
7. Testa GPU:n i en annan PCIe-kortplats:
Om GPU:n inte identifieras eller fortfarande har prestandaproblem kan du prova att installera GPU:n i en annan ledig PCIe-kortplats.
- Stäng av servern och koppla bort strömkablarna.
- Ta bort GPU:n från den aktuella PCIe-kortplatsen.
- Installera GPU:n i en annan PCIe-kortplats som stöds.
- Anslut strömmen och slå på systemet.
- Kontrollera om GPU:n detekteras med kommandot
nvidia-smieller från iDRAC-maskinvaruinventeringen.
Om GPU:n identifieras i en annan kortplats kan det bero på ett konfigurations- eller maskinvaruproblem på den ursprungliga PCIe-kortplatsen.
8. Kör diagnostiktest för GPU:
Kör diagnostikverktyget NVIDIA Data Center GPU Manager (DCGM) för att kontrollera Nvidia GPU-hälsan och upptäcka potentiella hårdvaru- eller värmeproblem.
- Få åtkomst till operativsystemet via SSH eller konsol.
- Kör följande kommando om du vill utföra ett utökat diagnostiktest av GPU:n:
sudo dcgmi diag
Detta kommando utför ett omfattande diagnostiskt test som kontrollerar GPU-minne, PCIe-anslutning och värmebeteende. Granska utdata för att identifiera eventuella maskinvaru- eller prestandarelaterade problem.