PowerEdge: Problemer med GPU-varmebegrænsning eller GPU blev ikke registreret
Summary: Denne artikel indeholder fejlfindingsvejledning til GPU-varmebegrænsninger og problemer med GPU ikke registreret på Dell PowerEdge-servere. Disse problemer kan opstå på grund af temperaturforhold, hardwarekonfigurationsproblemer eller systemkonfigurationsindstillinger. ...
Symptoms
- GPU-ydeevnen reduceres under høj arbejdsbelastning.
- GPU-clockhastigheden falder automatisk for at beskytte hardwaren.
- GPU-temperaturen når høje værdier under stressede workloads.
- System Event Log (SEL) viser advarsler relateret til systemets indgangstemperatur.
- GPU vises ikke i operativsystem- eller administrationsværktøjer.
- Kommandoen
nvidia-smiviser ikke nogen GPU-enhed. - iDRAC eller BIOS registrerer ikke den installerede GPU.
Cause
- Høj omgivende datacentertemperatur
- Utilstrækkelig luftgennemstrømning eller blokeret luftindtag i serverracket
- Forkert blæserprofil eller indstillinger for termisk politik
- GPU ikke sat korrekt i PCIe-slottet
- Ikke-understøttet GPU-konfiguration eller firmwareuoverensstemmelse
- Forældet BIOS-, iDRAC- eller GPU-firmware
- Problemer med strøm- eller kabelforbindelse for GPU-moduler
Resolution
1. Kontrollér GPU-temperatur og -begrænsning:
Kør følgende kommando i operativsystemet for at kontrollere GPU-ydeevnen og begrænsningsstatus for Nvidia-GPU'er:
nvidia-smi -q -d performance
Hvis årsagen til begrænsningen vises som "Ikke aktiv", fungerer GPU'en normalt.
2. Overvåg systemtemperaturen:
- Kontroller systemets hændelseslog (SEL) i iDRAC.
- Gennemgå Lifecycle Log for temperaturadvarsler.
- Kontroller systemets indgangstemperatur fra afsnittet Temperaturoversigt.
3. Forbedre køleforholdene:
- Sørg for, at datacenterets omgivende temperatur er inden for understøttede grænser.
- Fjern blokeringer af luftgennemstrømningen i racket.
- Kontroller, at alle systemblæsere fungerer korrekt.
- Brug passende luftstrømshylstre og GPU-kølesæt.
4. Bekræft GPU-hardwareinstallation:
- Sørg for, at GPU'en sidder korrekt i PCIe-slotten.
- Kontrollér GPU-strømkabler og -stik.
- Bekræft, at GPU'en understøttes på serverplatformen.
5. Opdater systemfirmware:
- Opdater serverens BIOS.
- Opdater iDRAC-firmware.
- Opdater GPU-drivere og firmware.
6. Bekræft GPU-registrering:
Brug følgende kommando til at kontrollere, om Nvidia GPU en registreres af systemet:
nvidia-smi
Hvis GPU'en ikke registreres, skal du kontrollere BIOS-indstillingerne og hardwareinstallationen.
7. Test GPU i en anden PCIe-slot:
Hvis GPU'en ikke registreres eller fortsat har problemer med ydeevnen, kan du prøve at installere GPU'en i en anden tilgængelig PCIe-slot.
- Sluk for serveren, og frakobl strømkablerne.
- Fjern GPU'en fra den aktuelle PCIe-slot.
- Installer GPU'en i en anden understøttet PCIe-slot.
- Tilslut strømmen igen, og tænd for systemet.
- Kontroller, om GPU'en registreres ved hjælp af kommandoen
nvidia-smieller fra iDRAC-hardwareopgørelsen.
Hvis GPU'en registreres i en anden slot, kan der være et konfigurations- eller hardwareproblem med den originale PCIe-slot.
8. Kør GPU-diagnosticeringstest:
Kør diagnosticeringsværktøjet NVIDIA Data Center GPU Manager (DCGM) for at kontrollere Nvidia GPU's tilstand og registrere potentielle hardware- eller varmeproblemer.
- Få adgang til operativsystemet via SSH eller konsol.
- Kør følgende kommando for at udføre en udvidet GPU-diagnosticeringstest:
sudo dcgmi diag
Denne kommando udfører en omfattende diagnosticeringstest, der kontrollerer GPU-hukommelse, PCIe-forbindelse og termisk adfærd. Gennemgå outputtet for at identificere eventuelle hardware- eller ydeevnerelaterede problemer.