Разомкнутое смещение: Сбой LCM кластера во время перезагрузки узла

Summary: Сбой LCM во время перезагрузки узла из-за взаимоблокировки модуля контроллера CSI и модуля управления хранилищем.

This article applies to This article does not apply to This article is not tied to any specific product. Not all product versions are identified in this article.

Symptoms

Сбой LCM во время модернизации OCP или перезагрузки узла, пользовательский интерфейс обновления теряет доступ.

Выполните вход в OCP Выполните команду «oc get pods -n dell-acp», чтобы проверить состояние модулей, найдите один модуль csi-vxflexos-controller в состоянии ImagePullBackOff и один модуль mcp-depot-manager в состоянии ContainerCreating  Например:


image.png
Выполните команду «oc logs <pod_name> -n dell-acp -c driver» для проверки журналов pod.
  • В поде «Running csi-vxflexos-controller» журнал показывает, что он пытается получить аренду лидера, например:
mystic@mystic-vm:~$ OC Logs csi-vxflexos-controller-7d9b97c659-q8d4n -n dell-acp -c driver
I0918 08:33:23.460955 1 leaderelection.go:248] Попытка аренды лидера Dell-ACP/driver-csi-vxflexos-dellemc-com...
 
  • В поде ImagePullBackOff csi-vxflexos-controller журнал показывает, что он успешно получил аренду лидера, например:
mystic@mystic-vm:~$ OC журналы csi-vxflexos-controller-7d9b97c659-4tn2v -n dell-acp -c driver
I0918 09:07:30.076298 1 leaderelection.go:248] Попытка аренды лидера Dell-ACP/driver-csi-vxflexos-dellemc-com...
I0918 09:07:46.074524 1 leaderelection.go:258] успешно получен аренда dell-acp/driver-csi-vxflexos-dellemc-com
time="2023-09-18T09:07:46Z" level=info msg="configured 69de1f95f50e390f" allSystemNames= endpoint="https://dellpowerflex.h01.com" isDefault=true nasName=0xc000489950 nfsAcls= password="********" skipCertificateValidation=false systemID=69de1f95f50e390f user=admin
time="2023-09-18T09:07:46Z" level=info msg="файл конфигурации драйвера" file=/vxflexos-config-params/driver-config-params.yaml
time="2023-09-18T09:07:46Z" level=info msg="Чтение CSI_LOG_FORMAT из файла конфигурации журнала" format=text
time="2023-09-18T09:07:46Z" level=info msg="Чтение CSI_LOG_LEVEL из файла конфигурации журнала" fields.level=debug
time="2023-09-18T09:07:46Z" level=info msg="файл конфигурации массива" file=/vxflexos-config/config
time="2023-09-18T09:07:46Z" level=info msg="Зондирование всех массивов. Количество массивов: 1"
time="2023-09-18T09:07:46Z" level=info msg="по умолчанию для массива установлен идентификатор массива: 69de1f95f50e390f"
time="2023-09-18T09:07:46Z" level=info msg="69de1f95f50e390f — массив по умолчанию, пропуская обновление карты VolumePrefixToSystems. \n"
time="2023-09-18T09:07:46Z" level=info msg="array 69de1f95f50e390f probed successfully"
time="2023-09-18T09:07:46Z" level=info msg="настроено csi-vxflexos.dellemc.com" IsApproveSDCEnabled=false IsHealthMonitorEnabled=false IsQuotaEnabled=false IsSdcRenameEnabled=false MaxVolumesPerNode=0 allowRWOMultiPodAccess=false autoprobe=true externalAccess= mode=controller nfsAcls= privatedir=/dev/disk/csi-vxflexos sdcGUID= sdcPrefix= thickprovision=false
time="2023-09-18T09:07:46Z" level=info msg="служба идентификации зарегистрирована"
time="2023-09-18T09:07:46Z" level=info msg="служба контроллера зарегистрирована"
time="2023-09-18T09:07:46Z" level=info msg="Регистрация дополнительных серверов GRPC"
time="2023-09-18T09:07:46Z" level=info msg=обслуживающая конечная точка="unix:///var/run/csi/csi.sock"


Выполните команду «oc describe pod pod_name <> -n dell-acp», чтобы проверить ContainerCreating mcp-depot-manager (на снимке экрана выше имя модуля mcp-depot-manager-5d5c7cbbb6-twqr5), он сообщает предупреждение FailedMount, как показано ниже:

image.png
Выполните команду «oc get nodes», чтобы проверить состояние узла, есть один узел в состоянии SchedulingDisabled, например:
image.png
 

Cause

Если активный csi-controller pod и mcp-depot-manager находятся на одном узле, то при перезагрузке узла LCM csi-controller и depot-manager будут перепланированы на новые узлы. Во время загрузки pod csi-controller и depot-manager сталкиваются с взаимоблокировкой и не могут загрузиться.

Resolution

1. Выполните команду «oc get pods -n dell-acp |grep csi», чтобы определить имя pod контроллера CSI с недопустимым состоянием.
2. Выполните команду «oc delete pod <pod_name> -n dell-acp», чтобы удалить указанный модуль/модули.
Например:
image.png

3. Подождите несколько минут и выполните команду «oc get pods -n dell-acp», чтобы убедиться, что все модули pod находятся в состоянии «Выполняется». Если по-прежнему есть csi-controller pod или mcp-depot-manager, которые не запущены, повторите шаг, описанный выше.
4. Пока все модули pod не перейдут в состояние «Выполняется», повторите попытку запуска LCM, чтобы продолжить обновление кластера.
Article Properties
Article Number: 000217992
Article Type: Solution
Last Modified: 18 Sept 2026
Version:  4
Find answers to your questions from other Dell users
Support Services
Check if your device is covered by Support Services.