PowerEdge: Problemas de limitação térmica da GPU ou GPU não detectada

Summary: Este artigo fornece orientação de solução de problemas para controle de fluxo térmico da GPU e problemas de GPU não detectada em servidores Dell PowerEdge. Esses problemas podem ocorrer devido a condições de temperatura, problemas de configuração de hardware ou definições de configuração do sistema. ...

This article applies to This article does not apply to This article is not tied to any specific product. Not all product versions are identified in this article.

Symptoms

 

  • O desempenho da GPU é reduzido durante a carga de trabalho alta.
  • A velocidade do relógio da GPU cai automaticamente para proteger o hardware.
  • A temperatura da GPU atinge valores altos durante cargas de trabalho de estresse.
  • O Registro de eventos do sistema (SEL) mostra avisos relacionados à temperatura de entrada do sistema.
  • A GPU não aparece no sistema operacional ou nas ferramentas de gerenciamento.
  • O comando nvidia-smi não mostra nenhum dispositivo GPU.
  • O iDRAC ou BIOS não detecta a GPU instalada.

Cause

  • Alta temperatura ambiente do data center
  • Fluxo de ar insuficiente ou entrada de ar bloqueada no rack do servidor
  • Configurações incorretas do perfil do ventilador ou da política térmica
  • GPU não encaixada corretamente no slot PCIe
  • Configuração de GPU incompatível ou disparidade de firmware
  • Firmware desatualizado do BIOS, iDRAC ou GPU
  • Problemas de conexão de energia ou cabo para módulos de GPU

Resolution

1. Verifique a temperatura da GPU e o status do acelerador:

Execute o seguinte comando no sistema operacional para verificar o desempenho da GPU e o status do acelerador das GPUs Nvidia:

nvidia-smi -q -d performance

Se os motivos do acelerador forem mostrados como "Não ativo", a GPU está funcionando normalmente.

 

2. Monitorar a temperatura do sistema:

  • Verifique o Registro de eventos do sistema (SEL) no iDRAC.
  • Analise o registro do ciclo de vida para ver se há avisos de temperatura.
  • Verifique a Temperatura de entrada do sistema na seção Visão geral da temperatura.

 

3. Melhore as condições de refrigeração:

  • Certifique-se de que a temperatura ambiente do data center esteja dentro dos limites compatíveis.
  • Remova os bloqueios do fluxo de ar no rack.
  • Verifique se todos os ventiladores do sistema estão funcionando corretamente.
  • Use defletores de fluxo de ar apropriados e kits de refrigeração da GPU.

 

4. Verifique a instalação do hardware da GPU:

  • Verifique se a GPU está encaixada corretamente no slot PCIe.
  • Verifique os cabos de alimentação e conectores da GPU.
  • Confirme se a GPU é compatível com a plataforma do servidor.

 

5. Atualize o firmware do sistema:

  • Atualize o BIOS do servidor.
  • Atualize o firmware do iDRAC.
  • Atualize os drivers e o firmware da GPU.

 

6. Verifique a detecção da GPU:

Use o seguinte comando para verificar se a GPU Nvidia é detectada pelo sistema:

nvidia-smi

Se a GPU não for detectada, verifique as configurações do BIOS e a instalação do hardware.

 

7. Teste a GPU em outro slot PCIe:

Se a GPU não for detectada ou continuar a apresentar problemas de desempenho, tente instalar a GPU em outro slot PCIe disponível.

  • Desligue o servidor e desconecte os cabos de alimentação.
  • Remova a GPU do slot PCIe atual.
  • Instale a GPU em outro slot PCIe compatível.
  • Reconecte a alimentação e ligue o sistema.
  • Verifique se a GPU foi detectada usando o comando nvidia-smi ou do inventário de hardware do iDRAC.

Se a GPU for detectada em outro slot, o slot PCIe original pode ter um problema de configuração ou hardware.

 

8. Execute o teste de diagnóstico da GPU:

Execute a ferramenta de diagnóstico NVIDIA Data Center GPU Manager (DCGM) para verificar a integridade da GPU Nvidia e detectar possíveis problemas térmicos ou de hardware.

  1. Acesse o sistema operacional por meio de SSH ou console.
  2. Execute o seguinte comando para executar um teste de diagnóstico estendido de GPU:
sudo dcgmi diag

Esse comando executa um teste de diagnóstico abrangente que verifica a memória da GPU, a conectividade PCIe e o comportamento térmico. Analise a saída para identificar quaisquer problemas relacionados ao hardware ou ao desempenho.

Affected Products

C Series, Rack Servers, XE Servers
Article Properties
Article Number: 000458921
Article Type: Solution
Last Modified: 14 ذو القعدة 1447
Version:  1
Find answers to your questions from other Dell users
Support Services
Check if your device is covered by Support Services.