Turno aberto: Falha no LCM do cluster durante a reinicialização do nó

Resumo: Falha no LCM durante a reinicialização do nó devido ao impasse entre o pod do controlador CSI e o pod do gerenciador de depósito.

Este artigo aplica-se a Este artigo não se aplica a Este artigo não está vinculado a nenhum produto específico. Nem todas as versões do produto estão identificadas neste artigo.

Sintomas

Falha no LCM durante o upgrade do OCP ou a reinicialização do nó, a interface do usuário de atualização perdeu o acesso.

Faça login no OCP e execute o comando "oc get pods -n dell-acp" para verificar o status dos pods, localize um pod csi-vxflexos-controller no status ImagePullBackOff e um pod mcp-depot-manager no status ContainerCreate . Por exemplo:


image.png
execute o comando "oc logs <pod_name> -n dell-acp -c driver" para verificar os registros do pod.
  • No pod Running csi-vxflexos-controller, o log mostra que ele está tentando adquirir o leasing líder, por exemplo:
mystic@mystic-vm:~$ oc logs csi-vxflexos-controller-7d9b97c659-q8d4n -n dell-acp -c driver
I0918 08:33:23.460955 1 leaderelection.go:248] tentando adquirir líder leasing dell-acp/driver-csi-vxflexos-dellemc-com...
 
  • No pod ImagePullBackOff csi-vxflexos-controller, o log mostra que a locação líder foi adquirida com sucesso, por exemplo:
mystic@mystic-vm:~$ oc logs csi-vxflexos-controller-7d9b97c659-4tn2v -n dell-acp -c driver
I0918 09:07:30.076298 1 leaderelection.go:248] tentando adquirir a locação líder dell-acp/driver-csi-vxflexos-dellemc-com...
I0918 09:07:46.074524 1 leaderelection.go:258] leasing adquirido com sucesso dell-acp/driver-csi-vxflexos-dellemc-com
time="2023-09-18T09:07:46Z" level=info msg="configured 69de1f95f50e390f" allSystemNames= endpoint="https://dellpowerflex.h01.com" isDefault=true nasName=0xc000489950 nfsAcls= password="********" skipCertificateValidation=false systemID=69de1f95f50e390f user=admin
time="2023-09-18T09:07:46Z" level=info msg="driver configuration file " file=/vxflexos-config-params/driver-config-params.yaml
time="2023-09-18T09:07:46Z" level=info msg="Read CSI_LOG_FORMAT from log configuration file" format=
text time="2023-09-18T09:07:46Z" level=info msg="Read CSI_LOG_LEVEL from log configuration file" fields.level=debug
time="2023-09-18T09:07:46Z" level=info msg="array configuration file" file=/vxflexos-config/config
time="2023-09-18T09:07:46Z" level=info msg="Sondando todos os arrays. Número de arrays: 1"
time="2023-09-18T09:07:46Z" level=info msg="default array is set to array ID: 69de1f95f50e390f"
time="2023-09-18T09:07:46Z" level=info msg="69de1f95f50e390f é o array padrão, ignorando a atualização do mapa VolumePrefixToSystems. \n"
time="2023-09-18T09:07:46Z" level=info msg="array 69de1f95f50e390f sondado com sucesso"
time="2023-09-18T09:07:46Z" level=info msg="configured csi-vxflexos.dellemc.com" IsApproveSDCEnabled=false IsHealthMonitorEnabled=false IsQuotaEnabled=false IsSdcRenameEnabled=false MaxVolumesPerNode=0 allowRWOMultiPodAccess=false autoprobe=true externalAccess= mode=controller nfsAcls= privatedir=/dev/disk/csi-vxflexos sdcGUID= sdcPrefix= thickprovision=false
time="2023-09-18T09:07:46Z" level=info msg="identity service registered"
time="2023-09-18T09:07:46Z" level=info msg="controller service registered"
time="2023-09-18T09:07:46Z" level=info msg="Registrando servidores GRPC adicionais"
time="2023-09-18T09:07:46Z" level=info msg=serving endpoint="unix:///var/run/csi/csi.sock"


Execute o comando "oc describe pod <pod_name> -n dell-acp" para verificar o ContainerCreating mcp-depot-manager (na captura de tela de exemplo acima, o nome do pod é mcp-depot-manager-5d5c7cbbb6-twqr5), ele informa o aviso de FailedMount conforme abaixo:

image.png
Execute o comando "oc get nodes" para verificar o status do nó, há um nó no status SchedulingDisabled, por exemplo:
image.png
 

Causa

Se o pod csi-controller ativo e o mcp-depot-manager estiverem no mesmo nó, quando o LCM reinicializar o nó, o csi-controller e o depot-manager serão reprogramados para novos nós. Durante a inicialização do pod, o controlador csi e o gerenciador de depósito encontram um impasse e não conseguem inicializar.

Resolução

1. Execute o comando "oc get pods -n dell-acp |grep csi" para identificar o nome do pod do pod do controlador CSI de status inválido.
2. Execute o comando "oc delete pod <pod_name> -n dell-acp" para excluir os pods/pods identificados.
Por exemplo:
image.png

3. Aguarde alguns minutos e execute o comando "oc get pods -n dell-acp" para garantir que todos os pods estejam com o status Running. Se ainda houver o pod csi-controller ou mcp-depot-manager não em execução, repita a etapa acima novamente.
4. Até que todos os pods estejam no status Running, repita o LCM para continuar o upgrade do cluster.
Propriedades do artigo
Número do artigo: 000217992
Tipo de artigo: Solution
Último modificado: 18 set. 2026
Versão:  4
Encontre as respostas de outros usuários da Dell para suas perguntas.
Serviços de suporte
Verifique se o dispositivo está coberto pelos serviços de suporte.