PowerEdge: Problemi di GPU Thermal Throttling o GPU non rilevati
Summary: Questo articolo fornisce indicazioni per la risoluzione dei problemi di limitazione termica della GPU e GPU non rilevata sui server Dell PowerEdge. Questi problemi possono verificarsi a causa di condizioni di temperatura, problemi di configurazione hardware o impostazioni di configurazione del sistema. ...
Symptoms
- Le prestazioni della GPU si riducono in caso di carichi di lavoro elevati.
- La velocità di clock della GPU diminuisce automaticamente per proteggere l'hardware.
- La temperatura della GPU raggiunge valori elevati durante i carichi di lavoro di stress.
- System Event Log (SEL) mostra gli avvisi relativi alla temperatura di ingresso del sistema.
- La GPU non viene visualizzata nel sistema operativo o negli strumenti di gestione.
- Il comando
nvidia-sminon mostra alcun dispositivo GPU. - L'iDRAC o il BIOS non rileva la GPU installata.
Cause
- Temperatura ambiente elevata del data center
- Flusso d'aria insufficiente o ingresso dell'aria ostruito nel rack del server
- Impostazioni errate del profilo della ventola o della policy termica
- GPU non inserita correttamente nello slot PCIe
- Configurazione GPU non supportata o mancata corrispondenza del firmware
- BIOS, iDRAC o firmware GPU obsoleti
- Problemi di alimentazione o collegamento dei cavi per i moduli GPU
Resolution
1. Controllare lo stato della GPU e della accelerazione:
Eseguire il seguente comando nel sistema operativo per verificare le prestazioni della GPU e lo stato di limitazione delle GPU NVIDIA:
nvidia-smi -q -d performance
Se i motivi della limitazione vengono visualizzati come "Not Active", la GPU funziona normalmente.
2. Monitorare la temperatura del sistema:
- Controllare il registro eventi di sistema (SEL) in iDRAC.
- Rivedere il registro del ciclo di vita per le avvertenze sulla temperatura.
- Verificare la temperatura sfiato del sistema dalla sezione Panoramica della temperatura.
3. Migliorare le condizioni di raffreddamento:
- Assicurarsi che la temperatura ambiente del data center rientri nei limiti supportati.
- Rimuovere le ostruzioni del flusso d'aria nel rack.
- Verificare che tutte le ventole del sistema funzionino correttamente.
- Utilizzare manicotti della circolazione dell'aria appropriati e kit di raffreddamento GPU.
4. Verificare l'installazione hardware della GPU:
- Accertarsi che la GPU sia inserita correttamente nello slot PCIe.
- Controllare i cavi e i connettori di alimentazione della GPU.
- Verificare che la GPU sia supportata sulla piattaforma server.
5. Aggiornare il firmware del sistema:
- Aggiornare il BIOS del server.
- Aggiornare il firmware iDRAC.
- Aggiornare i driver e il firmware della GPU.
6. Verifica del rilevamento GPU:
Utilizzare il comando seguente per verificare se la GPU NVIDIA viene rilevata dal sistema:
nvidia-smi
Se la GPU non viene rilevata, controllare le impostazioni del BIOS e l'installazione hardware.
7. Testare la GPU in un altro slot PCIe:
Se la GPU non viene rilevata o continua a riscontrare problemi di prestazioni, provare a installarla in un altro slot PCIe disponibile.
- Spegnere il server e scollegare i cavi di alimentazione.
- Rimuovere la GPU dallo slot PCIe corrente.
- Installare la GPU in un altro slot PCIe supportato.
- Ricollegare l'alimentazione e accendere il sistema.
- Verificare se la GPU viene rilevata utilizzando il comando:
nvidia-smio dall'inventario hardware dell'iDRAC.
Se la GPU viene rilevata in un altro slot, lo slot PCIe originale potrebbe presentare un problema di configurazione o hardware.
8. Eseguire il test di diagnostica GPU:
Eseguire lo strumento di diagnostica NVIDIA Data Center GPU Manager (DCGM) per verificare lo stato della GPU NVIDIA e rilevare potenziali problemi hardware o termici.
- Accedere al sistema operativo tramite SSH o console.
- Eseguire il comando seguente per eseguire un test di diagnostica estesa della GPU:
sudo dcgmi diag
Questo comando esegue un test di diagnostica completo che verifica la memoria GPU, la connettività PCIe e il comportamento termico. Esaminare l'output per identificare eventuali problemi relativi all'hardware o alle prestazioni.