Разомкнутое смещение: Сбой LCM кластера во время перезагрузки узла

Summary: Сбой LCM во время перезагрузки узла из-за взаимоблокировки модуля контроллера CSI и модуля управления хранилищем.

Acest articol se aplică pentru Acest articol nu se aplică pentru Acest articol nu este legat de un produs specific. Acest articol nu acoperă toate versiunile de produs existente.

Symptoms

Сбой LCM во время модернизации OCP или перезагрузки узла, пользовательский интерфейс обновления теряет доступ.

Выполните вход в OCP Выполните команду «oc get pods -n dell-acp», чтобы проверить состояние модулей, найдите один модуль csi-vxflexos-controller в состоянии ImagePullBackOff и один модуль mcp-depot-manager в состоянии ContainerCreating  Например:


image.png
Выполните команду «oc logs <pod_name> -n dell-acp -c driver» для проверки журналов pod.
  • В поде «Running csi-vxflexos-controller» журнал показывает, что он пытается получить аренду лидера, например:
mystic@mystic-vm:~$ OC Logs csi-vxflexos-controller-7d9b97c659-q8d4n -n dell-acp -c driver
I0918 08:33:23.460955 1 leaderelection.go:248] Попытка аренды лидера Dell-ACP/driver-csi-vxflexos-dellemc-com...
 
  • В поде ImagePullBackOff csi-vxflexos-controller журнал показывает, что он успешно получил аренду лидера, например:
mystic@mystic-vm:~$ OC журналы csi-vxflexos-controller-7d9b97c659-4tn2v -n dell-acp -c driver
I0918 09:07:30.076298 1 leaderelection.go:248] Попытка аренды лидера Dell-ACP/driver-csi-vxflexos-dellemc-com...
I0918 09:07:46.074524 1 leaderelection.go:258] успешно получен аренда dell-acp/driver-csi-vxflexos-dellemc-com
time="2023-09-18T09:07:46Z" level=info msg="configured 69de1f95f50e390f" allSystemNames= endpoint="https://dellpowerflex.h01.com" isDefault=true nasName=0xc000489950 nfsAcls= password="********" skipCertificateValidation=false systemID=69de1f95f50e390f user=admin
time="2023-09-18T09:07:46Z" level=info msg="файл конфигурации драйвера" file=/vxflexos-config-params/driver-config-params.yaml
time="2023-09-18T09:07:46Z" level=info msg="Чтение CSI_LOG_FORMAT из файла конфигурации журнала" format=text
time="2023-09-18T09:07:46Z" level=info msg="Чтение CSI_LOG_LEVEL из файла конфигурации журнала" fields.level=debug
time="2023-09-18T09:07:46Z" level=info msg="файл конфигурации массива" file=/vxflexos-config/config
time="2023-09-18T09:07:46Z" level=info msg="Зондирование всех массивов. Количество массивов: 1"
time="2023-09-18T09:07:46Z" level=info msg="по умолчанию для массива установлен идентификатор массива: 69de1f95f50e390f"
time="2023-09-18T09:07:46Z" level=info msg="69de1f95f50e390f — массив по умолчанию, пропуская обновление карты VolumePrefixToSystems. \n"
time="2023-09-18T09:07:46Z" level=info msg="array 69de1f95f50e390f probed successfully"
time="2023-09-18T09:07:46Z" level=info msg="настроено csi-vxflexos.dellemc.com" IsApproveSDCEnabled=false IsHealthMonitorEnabled=false IsQuotaEnabled=false IsSdcRenameEnabled=false MaxVolumesPerNode=0 allowRWOMultiPodAccess=false autoprobe=true externalAccess= mode=controller nfsAcls= privatedir=/dev/disk/csi-vxflexos sdcGUID= sdcPrefix= thickprovision=false
time="2023-09-18T09:07:46Z" level=info msg="служба идентификации зарегистрирована"
time="2023-09-18T09:07:46Z" level=info msg="служба контроллера зарегистрирована"
time="2023-09-18T09:07:46Z" level=info msg="Регистрация дополнительных серверов GRPC"
time="2023-09-18T09:07:46Z" level=info msg=обслуживающая конечная точка="unix:///var/run/csi/csi.sock"


Выполните команду «oc describe pod pod_name <> -n dell-acp», чтобы проверить ContainerCreating mcp-depot-manager (на снимке экрана выше имя модуля mcp-depot-manager-5d5c7cbbb6-twqr5), он сообщает предупреждение FailedMount, как показано ниже:

image.png
Выполните команду «oc get nodes», чтобы проверить состояние узла, есть один узел в состоянии SchedulingDisabled, например:
image.png
 

Cause

Если активный csi-controller pod и mcp-depot-manager находятся на одном узле, то при перезагрузке узла LCM csi-controller и depot-manager будут перепланированы на новые узлы. Во время загрузки pod csi-controller и depot-manager сталкиваются с взаимоблокировкой и не могут загрузиться.

Resolution

1. Выполните команду «oc get pods -n dell-acp |grep csi», чтобы определить имя pod контроллера CSI с недопустимым состоянием.
2. Выполните команду «oc delete pod <pod_name> -n dell-acp», чтобы удалить указанный модуль/модули.
Например:
image.png

3. Подождите несколько минут и выполните команду «oc get pods -n dell-acp», чтобы убедиться, что все модули pod находятся в состоянии «Выполняется». Если по-прежнему есть csi-controller pod или mcp-depot-manager, которые не запущены, повторите шаг, описанный выше.
4. Пока все модули pod не перейдут в состояние «Выполняется», повторите попытку запуска LCM, чтобы продолжить обновление кластера.
Proprietăți articol
Article Number: 000217992
Article Type: Solution
Ultima modificare: 18 sept. 2026
Version:  4
Găsiți răspunsuri la întrebările dvs. de la alți utilizatori Dell
Servicii de asistență
Verificați dacă dispozitivul dvs. este acoperit de serviciile de asistență.