PowerEdge: Problemas de limitação térmica da GPU ou GPU não detectada
Summary: Este artigo fornece orientação de solução de problemas para controle de fluxo térmico da GPU e problemas de GPU não detectada em servidores Dell PowerEdge. Esses problemas podem ocorrer devido a condições de temperatura, problemas de configuração de hardware ou definições de configuração do sistema. ...
Symptoms
- O desempenho da GPU é reduzido durante a carga de trabalho alta.
- A velocidade do relógio da GPU cai automaticamente para proteger o hardware.
- A temperatura da GPU atinge valores altos durante cargas de trabalho de estresse.
- O Registro de eventos do sistema (SEL) mostra avisos relacionados à temperatura de entrada do sistema.
- A GPU não aparece no sistema operacional ou nas ferramentas de gerenciamento.
- O comando
nvidia-sminão mostra nenhum dispositivo GPU. - O iDRAC ou BIOS não detecta a GPU instalada.
Cause
- Alta temperatura ambiente do data center
- Fluxo de ar insuficiente ou entrada de ar bloqueada no rack do servidor
- Configurações incorretas do perfil do ventilador ou da política térmica
- GPU não encaixada corretamente no slot PCIe
- Configuração de GPU incompatível ou disparidade de firmware
- Firmware desatualizado do BIOS, iDRAC ou GPU
- Problemas de conexão de energia ou cabo para módulos de GPU
Resolution
1. Verifique a temperatura da GPU e o status do acelerador:
Execute o seguinte comando no sistema operacional para verificar o desempenho da GPU e o status do acelerador das GPUs Nvidia:
nvidia-smi -q -d performance
Se os motivos do acelerador forem mostrados como "Não ativo", a GPU está funcionando normalmente.
2. Monitorar a temperatura do sistema:
- Verifique o Registro de eventos do sistema (SEL) no iDRAC.
- Analise o registro do ciclo de vida para ver se há avisos de temperatura.
- Verifique a Temperatura de entrada do sistema na seção Visão geral da temperatura.
3. Melhore as condições de refrigeração:
- Certifique-se de que a temperatura ambiente do data center esteja dentro dos limites compatíveis.
- Remova os bloqueios do fluxo de ar no rack.
- Verifique se todos os ventiladores do sistema estão funcionando corretamente.
- Use defletores de fluxo de ar apropriados e kits de refrigeração da GPU.
4. Verifique a instalação do hardware da GPU:
- Verifique se a GPU está encaixada corretamente no slot PCIe.
- Verifique os cabos de alimentação e conectores da GPU.
- Confirme se a GPU é compatível com a plataforma do servidor.
5. Atualize o firmware do sistema:
- Atualize o BIOS do servidor.
- Atualize o firmware do iDRAC.
- Atualize os drivers e o firmware da GPU.
6. Verifique a detecção da GPU:
Use o seguinte comando para verificar se a GPU Nvidia é detectada pelo sistema:
nvidia-smi
Se a GPU não for detectada, verifique as configurações do BIOS e a instalação do hardware.
7. Teste a GPU em outro slot PCIe:
Se a GPU não for detectada ou continuar a apresentar problemas de desempenho, tente instalar a GPU em outro slot PCIe disponível.
- Desligue o servidor e desconecte os cabos de alimentação.
- Remova a GPU do slot PCIe atual.
- Instale a GPU em outro slot PCIe compatível.
- Reconecte a alimentação e ligue o sistema.
- Verifique se a GPU foi detectada usando o comando
nvidia-smiou do inventário de hardware do iDRAC.
Se a GPU for detectada em outro slot, o slot PCIe original pode ter um problema de configuração ou hardware.
8. Execute o teste de diagnóstico da GPU:
Execute a ferramenta de diagnóstico NVIDIA Data Center GPU Manager (DCGM) para verificar a integridade da GPU Nvidia e detectar possíveis problemas térmicos ou de hardware.
- Acesse o sistema operacional por meio de SSH ou console.
- Execute o seguinte comando para executar um teste de diagnóstico estendido de GPU:
sudo dcgmi diag
Esse comando executa um teste de diagnóstico abrangente que verifica a memória da GPU, a conectividade PCIe e o comportamento térmico. Analise a saída para identificar quaisquer problemas relacionados ao hardware ou ao desempenho.