PowerEdge: Problemas de regulación térmica de la GPU o GPU no detectada

Summary: En este artículo, se proporciona orientación para la solución de problemas de regulación térmica de GPU y problemas de GPU no detectada en servidores Dell PowerEdge. Estos problemas pueden ocurrir debido a condiciones de temperatura, problemas de configuración de hardware o ajustes de configuración del sistema. ...

This article applies to This article does not apply to This article is not tied to any specific product. Not all product versions are identified in this article.

Symptoms

 

  • El rendimiento de la GPU se reduce durante una carga de trabajo alta.
  • La velocidad del reloj de la GPU disminuye automáticamente para proteger el hardware.
  • La temperatura de la GPU alcanza valores altos durante las cargas de trabajo forzadas.
  • El registro de eventos del sistema (SEL) muestra advertencias relacionadas con la temperatura de entrada del sistema.
  • La GPU no aparece en el sistema operativo ni en las herramientas de administración.
  • El comando nvidia-smi no muestra ningún dispositivo GPU.
  • iDRAC o el BIOS no detecta la GPU instalada.

Cause

  • Alta temperatura ambiente del centro de datos
  • Flujo de aire insuficiente o entrada de aire bloqueada en el rack del servidor
  • Configuración incorrecta de la política térmica o del perfil del ventilador
  • La GPU no está bien colocada en la ranura PCIe
  • Incompatibilidad de firmware o configuración de GPU no compatible
  • Firmware de BIOS, iDRAC o GPU obsoleto
  • Problemas de alimentación o conexión de cables para módulos de GPU

Resolution

1. Compruebe la temperatura de la GPU y el estado de la regulación:

Ejecute el siguiente comando en el sistema operativo para comprobar el rendimiento de la GPU y el estado de regulación de las GPU Nvidia:

nvidia-smi -q -d performance

Si los motivos de regulación se muestran como "No activo", la GPU funciona con normalidad.

 

2. Monitorear la temperatura del sistema:

  • Verifique el registro de eventos del sistema (SEL) en iDRAC.
  • Revise el registro de Lifecycle para ver las advertencias de temperatura.
  • Verifique la temperatura de entrada del sistema en la sección Visión general de la temperatura.

 

3. Mejora de las condiciones de refrigeración:

  • Asegúrese de que la temperatura ambiente del centro de datos se encuentre dentro de los límites admitidos.
  • Quite las obstrucciones del flujo de aire en el rack.
  • Verifique que todos los ventiladores del sistema funcionen correctamente.
  • Utilice cubiertas para flujo de aire y kits de enfriamiento de GPU adecuados.

 

4. Verifique la instalación del hardware de la GPU:

  • Asegúrese de que la GPU esté bien colocada en la ranura PCIe.
  • Compruebe los conectores y los cables de alimentación de la GPU.
  • Confirme que la GPU sea compatible con la plataforma del servidor.

 

5. Actualizar firmware del sistema:

  • Actualice el BIOS del servidor.
  • Actualice el firmware de iDRAC.
  • Actualice los controladores y el firmware de la GPU.

 

6. Verifique la detección de GPU:

Utilice el siguiente comando para comprobar si el sistema detecta la GPU Nvidia:

nvidia-smi

Si no se detecta la GPU, compruebe la configuración del BIOS y la instalación del hardware.

 

7. Pruebe la GPU en otra ranura PCIe:

Si la GPU no se detecta o continúa experimentando problemas de rendimiento, intente instalar la GPU en otra ranura PCIe disponible.

  • Apague el servidor y desconecte los cables de alimentación.
  • Quite la GPU de la ranura PCIe actual.
  • Instale la GPU en otra ranura PCIe compatible.
  • Vuelva a conectar la alimentación y encienda el sistema.
  • Compruebe si la GPU se detecta mediante el comando nvidia-smi o desde el inventario de hardware de iDRAC.

Si la GPU se detecta en otra ranura, es posible que la ranura PCIe original tenga un problema de configuración o hardware.

 

8. Ejecute la prueba de diagnóstico de GPU:

Ejecute la herramienta de diagnóstico NVIDIA Data Center GPU Manager (DCGM) para verificar el estado de la GPU Nvidia y detectar posibles problemas térmicos o de hardware.

  1. Acceda al sistema operativo a través de SSH o la consola.
  2. Ejecute el siguiente comando para realizar una prueba de diagnóstico de GPU extendida:
sudo dcgmi diag

Este comando realiza una prueba de diagnóstico integral que comprueba la memoria de la GPU, la conectividad PCIe y el comportamiento térmico. Revise el resultado para identificar cualquier problema relacionado con el hardware o el rendimiento.

Affected Products

C Series, Rack Servers, XE Servers
Article Properties
Article Number: 000458921
Article Type: Solution
Last Modified: 14 ذو القعدة 1447
Version:  1
Find answers to your questions from other Dell users
Support Services
Check if your device is covered by Support Services.