La actualización de Dell Automation Platform de 1.0 a 1.2 falla debido a una alta utilización de memoria en orquestador de nodo único.
Resumen: En este artículo, se explica cómo resolver fallas de actualización de la plataforma de automatización de Dell 1.0 a 1.2 en un orquestador de nodo único causadas por la alta utilización de memoria. El problema puede ocurrir cuando los servicios de Fusion tienen conteos de réplicas altos y el nodo está bajo presión de recursos. Para resolverlo, compruebe el uso de la memoria, reduzca el servidor de métricas si está instalado, reduzca las implementaciones de Fusion si es necesario y vuelva a intentar la actualización. Si el servidor de métricas no está instalado, omita ese paso y navegue por el procedimiento. ...
Instrucciones
Procedimiento para verificar y reducir el uso de memoria antes de la actualización
Antes de realizar la actualización, verifique la utilización de la memoria del clúster. Si el uso de la memoria es inferior al 60 %, la actualización puede continuar normalmente. Si el uso de la memoria es superior al 70 %, reduzca el consumo de memoria antes de iniciar la actualización.
Paso 1: Verificar la utilización de la memoria del clúster
Ejecute el siguiente comando para comprobar el uso de la memoria del nodo:
kubectl top nodes
Ejecute el siguiente comando para comprobar los recursos de nodo asignados:
kubectl describe nodes | grep -A 12 "Allocated resources"
Paso 2: Comprobar y reducir el servidor de métricas si está instalado
Ejecute el siguiente comando para comprobar si el servidor de métricas está en ejecución:
kubectl -n kube-system get deploy metrics-server
Si el servidor de métricas está presente, ejecute el siguiente comando para reducirlo:
kubectl -n kube-system scale deploys metrics-server --replicas=0
Ejecute el siguiente comando para verificar que el servidor de métricas esté reducido:
kubectl -n kube-system get deploy metrics-server
Paso 3: Espere a que se estabilicen los recursos
Si se redujo el servidor de métricas, espere aproximadamente 5 minutos para que los recursos y las métricas del clúster se estabilicen. Si el servidor de métricas no se instaló, omita esta espera.
Paso 4: Comprobar las implementaciones de Fusion
Ejecute el siguiente comando para comprobar las implementaciones de Fusion y los conteos de réplicas:
kubectl get deploy -A | grep -i fusion
Paso 5: Reduzca verticalmente las implementaciones de Fusion si el uso de la memoria sigue siendo alto
Ejecute el siguiente comando para buscar implementaciones de Fusion con más de una réplica y reducirlas:
kubectl get deploy -A | awk 'NR>1 && tolower($2) ~ /fusion/ && $3+0 > 1 {print $1, $2}' | while read -r ns dep; do echo "Scaling $ns/$dep to 1 replica"; kubectl -n "$ns" scale deploy "$dep" --replicas=1; done
Ejecute el siguiente comando para verificar las implementaciones de Fusion después del escalamiento:
kubectl get deploy -A | grep -i fusion
Paso 6: Volver a comprobar la utilización de la memoria del clúster después de reducir la escala de Fusion
Espere unos minutos después de reducir las implementaciones de Fusion para que los recursos del clúster se estabilicen.
Ejecute el siguiente comando para volver a comprobar el uso de la memoria del nodo:
kubectl top nodes
Ejecute el siguiente comando para comprobar nuevamente los recursos del nodo asignado:
kubectl describe nodes | grep -A 12 "Allocated resources"
Continúe con la actualización solo después de que la utilización de la memoria se reduzca a un nivel aceptable y el clúster esté estable.
Paso 7: Vuelva a intentar la actualización
Una vez que la utilización de la memoria se haya reducido y el clúster esté estable, vuelva a intentar la actualización de Dell Automation Platform.
Paso 8: Verifique la actualización
Una vez finalizada la actualización, ejecute los siguientes comandos para verificar los pods y las implementaciones de Fusion:
kubectl get pods -A | grep -i fusion kubectl get deploy -A | grep -i fusion
Información adicional
- El escalamiento es temporal. Durante el proceso de actualización, las configuraciones de implementación se vuelven a aplicar desde los gráficos de Helm o los manifiestos de registro. Estas configuraciones restauran automáticamente los conteos de réplicas previstos, por lo que no se requiere una restauración manual después de la actualización.
- Además, el conteo de réplicas de Fusion se redujo a 2 a partir de Dell Automation Platform 1.2, este problema de memoria relacionado con el conteo de réplicas no se espera cuando se actualiza desde Dell Automation Platform 1.2 o versiones posteriores.
Ticket EE DAPEE-235
Fallo DAP07A-2316, DAP07A-2300