PowerEdge: Problemi di GPU Thermal Throttling o GPU non rilevati

Summary: Questo articolo fornisce indicazioni per la risoluzione dei problemi di limitazione termica della GPU e GPU non rilevata sui server Dell PowerEdge. Questi problemi possono verificarsi a causa di condizioni di temperatura, problemi di configurazione hardware o impostazioni di configurazione del sistema. ...

This article applies to This article does not apply to This article is not tied to any specific product. Not all product versions are identified in this article.

Symptoms

 

  • Le prestazioni della GPU si riducono in caso di carichi di lavoro elevati.
  • La velocità di clock della GPU diminuisce automaticamente per proteggere l'hardware.
  • La temperatura della GPU raggiunge valori elevati durante i carichi di lavoro di stress.
  • System Event Log (SEL) mostra gli avvisi relativi alla temperatura di ingresso del sistema.
  • La GPU non viene visualizzata nel sistema operativo o negli strumenti di gestione.
  • Il comando nvidia-smi non mostra alcun dispositivo GPU.
  • L'iDRAC o il BIOS non rileva la GPU installata.

Cause

  • Temperatura ambiente elevata del data center
  • Flusso d'aria insufficiente o ingresso dell'aria ostruito nel rack del server
  • Impostazioni errate del profilo della ventola o della policy termica
  • GPU non inserita correttamente nello slot PCIe
  • Configurazione GPU non supportata o mancata corrispondenza del firmware
  • BIOS, iDRAC o firmware GPU obsoleti
  • Problemi di alimentazione o collegamento dei cavi per i moduli GPU

Resolution

1. Controllare lo stato della GPU e della accelerazione:

Eseguire il seguente comando nel sistema operativo per verificare le prestazioni della GPU e lo stato di limitazione delle GPU NVIDIA:

nvidia-smi -q -d performance

Se i motivi della limitazione vengono visualizzati come "Not Active", la GPU funziona normalmente.

 

2. Monitorare la temperatura del sistema:

  • Controllare il registro eventi di sistema (SEL) in iDRAC.
  • Rivedere il registro del ciclo di vita per le avvertenze sulla temperatura.
  • Verificare la temperatura sfiato del sistema dalla sezione Panoramica della temperatura.

 

3. Migliorare le condizioni di raffreddamento:

  • Assicurarsi che la temperatura ambiente del data center rientri nei limiti supportati.
  • Rimuovere le ostruzioni del flusso d'aria nel rack.
  • Verificare che tutte le ventole del sistema funzionino correttamente.
  • Utilizzare manicotti della circolazione dell'aria appropriati e kit di raffreddamento GPU.

 

4. Verificare l'installazione hardware della GPU:

  • Accertarsi che la GPU sia inserita correttamente nello slot PCIe.
  • Controllare i cavi e i connettori di alimentazione della GPU.
  • Verificare che la GPU sia supportata sulla piattaforma server.

 

5. Aggiornare il firmware del sistema:

  • Aggiornare il BIOS del server.
  • Aggiornare il firmware iDRAC.
  • Aggiornare i driver e il firmware della GPU.

 

6. Verifica del rilevamento GPU:

Utilizzare il comando seguente per verificare se la GPU NVIDIA viene rilevata dal sistema:

nvidia-smi

Se la GPU non viene rilevata, controllare le impostazioni del BIOS e l'installazione hardware.

 

7. Testare la GPU in un altro slot PCIe:

Se la GPU non viene rilevata o continua a riscontrare problemi di prestazioni, provare a installarla in un altro slot PCIe disponibile.

  • Spegnere il server e scollegare i cavi di alimentazione.
  • Rimuovere la GPU dallo slot PCIe corrente.
  • Installare la GPU in un altro slot PCIe supportato.
  • Ricollegare l'alimentazione e accendere il sistema.
  • Verificare se la GPU viene rilevata utilizzando il comando: nvidia-smi o dall'inventario hardware dell'iDRAC.

Se la GPU viene rilevata in un altro slot, lo slot PCIe originale potrebbe presentare un problema di configurazione o hardware.

 

8. Eseguire il test di diagnostica GPU:

Eseguire lo strumento di diagnostica NVIDIA Data Center GPU Manager (DCGM) per verificare lo stato della GPU NVIDIA e rilevare potenziali problemi hardware o termici.

  1. Accedere al sistema operativo tramite SSH o console.
  2. Eseguire il comando seguente per eseguire un test di diagnostica estesa della GPU:
sudo dcgmi diag

Questo comando esegue un test di diagnostica completo che verifica la memoria GPU, la connettività PCIe e il comportamento termico. Esaminare l'output per identificare eventuali problemi relativi all'hardware o alle prestazioni.

Affected Products

C Series, Rack Servers, XE Servers
Article Properties
Article Number: 000458921
Article Type: Solution
Last Modified: 01 May 2026
Version:  1
Find answers to your questions from other Dell users
Support Services
Check if your device is covered by Support Services.