PowerEdge: Problemi di GPU Thermal Throttling o GPU non rilevati

Zusammenfassung: Questo articolo fornisce indicazioni per la risoluzione dei problemi di limitazione termica della GPU e GPU non rilevata sui server Dell PowerEdge. Questi problemi possono verificarsi a causa di condizioni di temperatura, problemi di configurazione hardware o impostazioni di configurazione del sistema. ...

Dieser Artikel gilt für Dieser Artikel gilt nicht für Dieser Artikel ist nicht an ein bestimmtes Produkt gebunden. In diesem Artikel werden nicht alle Produktversionen aufgeführt.

Symptome

 

  • Le prestazioni della GPU si riducono in caso di carichi di lavoro elevati.
  • La velocità di clock della GPU diminuisce automaticamente per proteggere l'hardware.
  • La temperatura della GPU raggiunge valori elevati durante i carichi di lavoro di stress.
  • System Event Log (SEL) mostra gli avvisi relativi alla temperatura di ingresso del sistema.
  • La GPU non viene visualizzata nel sistema operativo o negli strumenti di gestione.
  • Il comando nvidia-smi non mostra alcun dispositivo GPU.
  • L'iDRAC o il BIOS non rileva la GPU installata.

Ursache

  • Temperatura ambiente elevata del data center
  • Flusso d'aria insufficiente o ingresso dell'aria ostruito nel rack del server
  • Impostazioni errate del profilo della ventola o della policy termica
  • GPU non inserita correttamente nello slot PCIe
  • Configurazione GPU non supportata o mancata corrispondenza del firmware
  • BIOS, iDRAC o firmware GPU obsoleti
  • Problemi di alimentazione o collegamento dei cavi per i moduli GPU

Lösung

1. Controllare lo stato della GPU e della accelerazione:

Eseguire il seguente comando nel sistema operativo per verificare le prestazioni della GPU e lo stato di limitazione delle GPU NVIDIA:

nvidia-smi -q -d performance

Se i motivi della limitazione vengono visualizzati come "Not Active", la GPU funziona normalmente.

 

2. Monitorare la temperatura del sistema:

  • Controllare il registro eventi di sistema (SEL) in iDRAC.
  • Rivedere il registro del ciclo di vita per le avvertenze sulla temperatura.
  • Verificare la temperatura sfiato del sistema dalla sezione Panoramica della temperatura.

 

3. Migliorare le condizioni di raffreddamento:

  • Assicurarsi che la temperatura ambiente del data center rientri nei limiti supportati.
  • Rimuovere le ostruzioni del flusso d'aria nel rack.
  • Verificare che tutte le ventole del sistema funzionino correttamente.
  • Utilizzare manicotti della circolazione dell'aria appropriati e kit di raffreddamento GPU.

 

4. Verificare l'installazione hardware della GPU:

  • Accertarsi che la GPU sia inserita correttamente nello slot PCIe.
  • Controllare i cavi e i connettori di alimentazione della GPU.
  • Verificare che la GPU sia supportata sulla piattaforma server.

 

5. Aggiornare il firmware del sistema:

  • Aggiornare il BIOS del server.
  • Aggiornare il firmware iDRAC.
  • Aggiornare i driver e il firmware della GPU.

 

6. Verifica del rilevamento GPU:

Utilizzare il comando seguente per verificare se la GPU NVIDIA viene rilevata dal sistema:

nvidia-smi

Se la GPU non viene rilevata, controllare le impostazioni del BIOS e l'installazione hardware.

 

7. Testare la GPU in un altro slot PCIe:

Se la GPU non viene rilevata o continua a riscontrare problemi di prestazioni, provare a installarla in un altro slot PCIe disponibile.

  • Spegnere il server e scollegare i cavi di alimentazione.
  • Rimuovere la GPU dallo slot PCIe corrente.
  • Installare la GPU in un altro slot PCIe supportato.
  • Ricollegare l'alimentazione e accendere il sistema.
  • Verificare se la GPU viene rilevata utilizzando il comando: nvidia-smi o dall'inventario hardware dell'iDRAC.

Se la GPU viene rilevata in un altro slot, lo slot PCIe originale potrebbe presentare un problema di configurazione o hardware.

 

8. Eseguire il test di diagnostica GPU:

Eseguire lo strumento di diagnostica NVIDIA Data Center GPU Manager (DCGM) per verificare lo stato della GPU NVIDIA e rilevare potenziali problemi hardware o termici.

  1. Accedere al sistema operativo tramite SSH o console.
  2. Eseguire il comando seguente per eseguire un test di diagnostica estesa della GPU:
sudo dcgmi diag

Questo comando esegue un test di diagnostica completo che verifica la memoria GPU, la connettività PCIe e il comportamento termico. Esaminare l'output per identificare eventuali problemi relativi all'hardware o alle prestazioni.

Betroffene Produkte

C Series, Rack Servers, XE Servers
Artikeleigenschaften
Artikelnummer: 000458921
Artikeltyp: Solution
Zuletzt geändert: 01 Mai 2026
Version:  1
Antworten auf Ihre Fragen erhalten Sie von anderen Dell NutzerInnen
Support Services
Prüfen Sie, ob Ihr Gerät durch Support Services abgedeckt ist.