PowerEdge: Problemas de regulación térmica de la GPU o GPU no detectada
Summary: En este artículo, se proporciona orientación para la solución de problemas de regulación térmica de GPU y problemas de GPU no detectada en servidores Dell PowerEdge. Estos problemas pueden ocurrir debido a condiciones de temperatura, problemas de configuración de hardware o ajustes de configuración del sistema. ...
Symptoms
- El rendimiento de la GPU se reduce durante una carga de trabajo alta.
- La velocidad del reloj de la GPU disminuye automáticamente para proteger el hardware.
- La temperatura de la GPU alcanza valores altos durante las cargas de trabajo forzadas.
- El registro de eventos del sistema (SEL) muestra advertencias relacionadas con la temperatura de entrada del sistema.
- La GPU no aparece en el sistema operativo ni en las herramientas de administración.
- El comando
nvidia-smino muestra ningún dispositivo GPU. - iDRAC o el BIOS no detecta la GPU instalada.
Cause
- Alta temperatura ambiente del centro de datos
- Flujo de aire insuficiente o entrada de aire bloqueada en el rack del servidor
- Configuración incorrecta de la política térmica o del perfil del ventilador
- La GPU no está bien colocada en la ranura PCIe
- Incompatibilidad de firmware o configuración de GPU no compatible
- Firmware de BIOS, iDRAC o GPU obsoleto
- Problemas de alimentación o conexión de cables para módulos de GPU
Resolution
1. Compruebe la temperatura de la GPU y el estado de la regulación:
Ejecute el siguiente comando en el sistema operativo para comprobar el rendimiento de la GPU y el estado de regulación de las GPU Nvidia:
nvidia-smi -q -d performance
Si los motivos de regulación se muestran como "No activo", la GPU funciona con normalidad.
2. Monitorear la temperatura del sistema:
- Verifique el registro de eventos del sistema (SEL) en iDRAC.
- Revise el registro de Lifecycle para ver las advertencias de temperatura.
- Verifique la temperatura de entrada del sistema en la sección Visión general de la temperatura.
3. Mejora de las condiciones de refrigeración:
- Asegúrese de que la temperatura ambiente del centro de datos se encuentre dentro de los límites admitidos.
- Quite las obstrucciones del flujo de aire en el rack.
- Verifique que todos los ventiladores del sistema funcionen correctamente.
- Utilice cubiertas para flujo de aire y kits de enfriamiento de GPU adecuados.
4. Verifique la instalación del hardware de la GPU:
- Asegúrese de que la GPU esté bien colocada en la ranura PCIe.
- Compruebe los conectores y los cables de alimentación de la GPU.
- Confirme que la GPU sea compatible con la plataforma del servidor.
5. Actualizar firmware del sistema:
- Actualice el BIOS del servidor.
- Actualice el firmware de iDRAC.
- Actualice los controladores y el firmware de la GPU.
6. Verifique la detección de GPU:
Utilice el siguiente comando para comprobar si el sistema detecta la GPU Nvidia:
nvidia-smi
Si no se detecta la GPU, compruebe la configuración del BIOS y la instalación del hardware.
7. Pruebe la GPU en otra ranura PCIe:
Si la GPU no se detecta o continúa experimentando problemas de rendimiento, intente instalar la GPU en otra ranura PCIe disponible.
- Apague el servidor y desconecte los cables de alimentación.
- Quite la GPU de la ranura PCIe actual.
- Instale la GPU en otra ranura PCIe compatible.
- Vuelva a conectar la alimentación y encienda el sistema.
- Compruebe si la GPU se detecta mediante el comando
nvidia-smio desde el inventario de hardware de iDRAC.
Si la GPU se detecta en otra ranura, es posible que la ranura PCIe original tenga un problema de configuración o hardware.
8. Ejecute la prueba de diagnóstico de GPU:
Ejecute la herramienta de diagnóstico NVIDIA Data Center GPU Manager (DCGM) para verificar el estado de la GPU Nvidia y detectar posibles problemas térmicos o de hardware.
- Acceda al sistema operativo a través de SSH o la consola.
- Ejecute el siguiente comando para realizar una prueba de diagnóstico de GPU extendida:
sudo dcgmi diag
Este comando realiza una prueba de diagnóstico integral que comprueba la memoria de la GPU, la conectividad PCIe y el comportamiento térmico. Revise el resultado para identificar cualquier problema relacionado con el hardware o el rendimiento.