Turno aperto: Errore della gestione del ciclo di vita del cluster durante il riavvio del nodo

Summary: LCM ha avuto esito negativo durante il riavvio del nodo a causa di un deadlock tra pod del controller CSI e pod di Depot Manager.

This article applies to This article does not apply to This article is not tied to any specific product. Not all product versions are identified in this article.

Symptoms

LCM ha avuto esito negativo durante l'aggiornamento OCP o il riavvio del nodo, l'interfaccia utente di aggiornamento ha perso l'accesso.

Accedere all'OCP ed eseguire il comando "oc get pods -n dell-acp" per controllare lo stato dei pod, trovare un pod csi-vxflexos-controller in stato ImagePullBackOff e un pod mcp-depot-manager in stato ContainerCreating  Ad esempio:


image.png
eseguire il comando "oc logs <pod_name> -n dell-acp -c driver" per controllare i registri pod.
  • Nel pod Running csi-vxflexos-controller, il registro mostra che sta tentando di acquisire il leasing principale, ad esempio:
mystic@mystic-vm:~$ oc logs csi-vxflexos-controller-7d9b97c659-q8d4n -n dell-acp -c driver
I0918 08:33:23.460955 1 leaderelection.go:248] tentativo di acquisire il contratto di locazione del leader dell-acp/driver-csi-vxflexos-dellemc-com...
 
  • Nel pod csi-vxflexos-controller di ImagePullBackOff, il registro mostra che il lead lease è stato acquisito correttamente, ad esempio:
mystic@mystic-vm:~$ oc logs csi-vxflexos-controller-7d9b97c659-4tn2v -n dell-acp -c driver
I0918 09:07:30.076298 1 leaderelection.go:248] tentativo di acquisire il contratto di locazione leader dell-acp/driver-csi-vxflexos-dellemc-com...
I0918 09:07:46.074524 1 leaderelection.go:258] leasing acquisito correttamente dell-acp/driver-csi-vxflexos-dellemc-com
time="2023-09-18T09:07:46Z" level=info msg="configurato 69de1f95f50e390f" allSystemNames= endpoint="https://dellpowerflex.h01.com" isDefault=true nasName=0xc000489950 nfsAcls= password="********" skipCertificateValidation=false systemID=69de1f95f50e390f user=admin
time="2023-09-18T09:07:46Z" level=info msg="file di configurazione del driver " file=/vxflexos-config-params/driver-config-params.yaml
time="2023-09-18T09:07:46Z" level=info msg="Leggi CSI_LOG_FORMAT dal file di configurazione del registro" format=text
time="2023-09-18T09:07:46Z" level=info msg="Leggi CSI_LOG_LEVEL dal file di configurazione del registro" fields.level=
debug time="2023-09-18T09:07:46Z" level=info msg="File di configurazione dell'array" file=/vxflexos-config/config
time="2023-09-18T09:07:46Z" level=info msg="Analisi di tutti gli array. Numero di array: 1"
time="2023-09-18T09:07:46Z" level=info msg="l'array predefinito è impostato sull'ID array: 69de1f95f50e390f"
time="2023-09-18T09:07:46Z" level=info msg="69de1f95f50e390f è l'array predefinito, ignora l'aggiornamento della mappa VolumePrefixToSystems. \n"
time="2023-09-18T09:07:46Z" level=info msg="array 69de1f95f50e390f probato correttamente"
time="2023-09-18T09:07:46Z" level=info msg="configurato csi-vxflexos.dellemc.com" IsApproveSDCEnabled=false IsHealthMonitorEnabled=false IsSdcRenameEnabled=false MaxVolumesPerNode=0 allowRWOMultiPodAccess=false autoprobe=true externalAccess= mode=controller nfsAcls= privatedir=/dev/disk/csi-vxflexos sdcGUID= sdcPrefix= thickprovision=false
time="2023-09-18T09:07:46Z" level=info msg="servizio di identità registrato"
time="2023-09-18T09:07:46Z" level=info msg="servizio controller registrato"
time="2023-09-18T09:07:46Z" level=info msg="Registrazione di server GRPC aggiuntivi"
time="2023-09-18T09:07:46Z" level=info msg=serving endpoint="unix:///var/run/csi/csi.sock"


Eseguire il comando "oc describe pod <pod_name> -n dell-acp" per controllare il comando ContainerCreating mcp-depot-manager (nello screenshot di esempio sopra, il nome del pod è mcp-depot-manager-5d5c7cbbb6-twqr5), che segnala l'avviso FailedMount come indicato di seguito:Eseguire

image.png
il comando "oc get nodes" per controllare lo stato del nodo, è presente un nodo nello stato SchedulingDisabled, ad esempio:
image.png
 

Cause

Se il pod del controller csi attivo e mcp-depot-manager si trovano sullo stesso nodo, quando LCM riavvia il nodo, csi-controller e depot-manager verranno ripianificati su nuovi nodi. Durante l'avvio del pod, csi-controller e depot-manager entrano in un deadlock e non possono essere avviati.

Resolution

1. Eseguire il comando "oc get pods -n dell-acp |grep csi" per identificare il nome pod del pod del controller CSI con stato errato.
2. Eseguire il comando "oc delete pod <pod_name> -n dell-acp" per eliminare i pod o i pod identificati.
Ad esempio:
image.png

3. Attendere alcuni minuti ed eseguire il comando "oc get pods -n dell-acp" per assicurarsi che tutti i pod siano in esecuzione. Se sono ancora presenti pod csi-controller o mcp-depot-manager non in esecuzione, riprovare il passaggio precedente.
4. Fino a quando tutti i pod non sono in stato Running, riprovare LCM per procedere con l'aggiornamento del cluster.
Article Properties
Article Number: 000217992
Article Type: Solution
Last Modified: 18 Sept 2026
Version:  4
Find answers to your questions from other Dell users
Support Services
Check if your device is covered by Support Services.