PowerFlex: Cómo solucionar los problemas de la PSOD de la pantalla púrpura de la muerte
Resumen: En este artículo, se explica cómo comprender la causa raíz de la pantalla púrpura (PS).
Instrucciones
La variable VMkernel es el núcleo del sistema operativo de ESXi. El kernel maneja la programación de recursos y las I/O de dispositivos. La red y las pilas de almacenamiento de VMware manejan las I/O de los dispositivos, que sirven como una capa entre el sistema de archivos virtual, los dispositivos de red y los controladores de dispositivos que controlan los dispositivos físicos.
Una pantalla violeta de la muerte (PSOD) es una pantalla de diagnóstico con tipo blanco sobre un fondo púrpura que se muestra cuando VMkernel de un host ESXi experimenta un error crítico, deja de funcionar y finaliza todas las máquinas virtuales que se están ejecutando.
Podría ser un problema de hardware, pero también podría ser un problema de software.
El archivo más importante es la carpeta Core que contiene el volcado del kernel, la PSOD purga lo que estaba en la memoria a un archivo llamado vmkernel-zdump.1 o algo por el estilo y colocarlo en ese directorio.
VMware ESXi Server [Releasebuild-98103
PCPU 1 locked up. Failed to ack TLB invalidate.
Code start: 0x41802bc00000 VMK uptime: 1:21:19:10.743
0x41220079baf0:[0x41802bc7abff]PanicvPanicInt@vmkernel#nover+0x56 stack: 0x3000000008
0x41220079bbd0:[0x41802bc7b4a7]Panic@vmkernel#nover+0xae stack: 0x100000000000000
0x41220079bc50:[0x41802bdd88eb]MemSched_WorldCleanup@vmkernel#nover+0x426 stack: 0x410001625830
0x41220079bef0:[0x41802bd033b8]WorldCleanup@vmkernel#nover+0x1cb stack: 0x470079bf40
0x41220079bf60:[0x41802bd03829]WorldReap@vmkernel#nover+0x318 stack: 0x0
0x41220079bff0:[0x41802bc483c8]helpFunc@vmkernel#nover+0x517 stack: 0x0
Starting coredump to disk Starting coredump to disk Dumping using slot 1 of 1…using slot 1 of 1… log
Aquí hay un desglose de cada sección de la pantalla de diagnóstico púrpura anterior:
-
El producto y la compilación:
VMware ESX Server [Releasebuild-98103]En esta sección de la pantalla de diagnóstico de color púrpura, se identifica el producto y la compilación que experimentaron el error. En este ejemplo, el producto es VMware ESXi Server compilación 98103.
- El mensaje de error:
PCPU 1 locked up. Failed to ack TLB invalidate
- El tiempo de actividad:
VMK uptime: 7:05:43:45.014 TSC: 1751259712918392
Esta sección indica cuánto tiempo lleva funcionando un servidor desde el último arranque. En este ejemplo, el host ESXi estuvo en ejecución durante 7 días, 5 horas, 43 minutos y 45,014 segundos. El valor TSC es la cantidad de ciclos de reloj de CPU que transcurrieron desde que se inició el servidor.
-
El seguimiento de la pila:

La pila representa lo que el VMkernel estaba haciendo en el momento del error. En este ejemplo, estaba intentando borrar las tablas de páginas de memoria (TLB).
-
El volcado de memoria:
Starting coredump to disk Starting coredump to disk Dumping using slot 1 of 1...using slot 1 of 1... logEsta sección de la pantalla de diagnóstico de color púrpura indica que el contenido de la
VMkernelLa memoria se está copiando en el archivovmkcorepartición.
Impacto:
El nodo se encuentra en un "Not-responding state"
Para verificar si tiene un problema de PSOD:
- Hacer ping al nodo afectado
- Obtener la IP de BMC o iDRAC para el nodo #
- Intente conectarse a BMC del nodo afectado. Si no puede, deje que el cliente conecte KVM desde su laptop al puerto BMC y capture la pantalla.
- Reinicie el nodo afectado después de comprobar si hay una falla en el host y si hay una resincronización en curso.
- Lea el código de la pila (las primeras tres líneas) y busque con
PanicvPanicInt PSOD
Code start: 0x41802bc00000 VMK uptime: 1:21:19:10.743
0x41220079baf0:[0x41802bc7abff]PanicvPanicInt@vmkernel#nover+0x56 stack: 0x3000000008
0x41220079bbd0:[0x41802bc7b4a7]Panic@vmkernel#nover+0xae stack: 0x100000000000000
0x41220079bc50:[0x41802bdd88eb]MemSched_WorldCleanup@vmkernel#nover+0x426 stack: 0x410001625830
0x41220079bef0:[0x41802bd033b8]WorldCleanup@vmkernel#nover+0x1cb stack: 0x470079bf40
0x41220079bf60:[0x41802bd03829]WorldReap@vmkernel#nover+0x318 stack: 0x0
0x41220079bff0:[0x41802bc483c8]helpFunc@vmkernel#nover+0x517 stack: 0x0
- Busque el error en Google para saber qué causó la PSOD y escale a VMware con registros para el análisis de causa raíz.
- Si se trata de hardware, verifique PowerFlex
get_infoy el registro de eventos de BMC para comprobar si hay errores - Si se trata de software, consulte con el parche reparado de VMware para solucionar el problema.