PowerFlex después del cambio de MDM, los SDS no se pueden volver a conectar y los MDM se bloquean
Resumen: Después del cambio de MDM, los SDS no se pueden volver a conectar y los MDM se bloquean.
Síntomas
Escenario
Después de un cambio de MDM, los SDS no se pueden conectar por completo y los MDM se bloquean después de mantener las responsabilidades del MDM principal durante unos minutos.
Síntomas
- Los SDS no pueden permanecer conectados al nuevo MDM principal después de un cambio y entrar en el modo de "Cool Down":
2022-08-26 16:17:28.338 MDM_CLUSTER_BECOMING_PRIMARY WARNING This MDM, MDM3 (ID 1456cb2611860002), took control of the cluster and is now the Primary MDM. 2022-08-26 16:17:28.551 MDM_CLUSTER_NODE_DEGRADED ERROR MDM cluster node is now DEGRADED and is in offline node MDM1 (ID 65e9ec4b16ce3900); IPs: [10.0.2.104,10.0.3.141,10.0.1.132], Port: 9011 . 2022-08-26 16:17:28.551 MDM_CLUSTER_NODE_NORMAL INFO MDM cluster node MDM2 (ID 401d30c85efd7401); IPs: [10.0.2.102,10.0.1.105,10.0.3.140], Port: 9011 is now in NORMAL state. 2022-08-26 16:17:28.552 MDM_BECOMING_PRIMARY WARNING This MDM is switching to Primary mode. MDM will start running. .. 2022-08-26 16:17:58.032 SDS_DECOUPLED ERROR SDS: sl73sdspdn133 (id: beb9168100000032) decoupled. 2022-08-26 16:17:58.032 SDS_DECOUPLED ERROR SDS: sl73sdspdn136 (id: beb964a500000035) decoupled. 2022-08-26 16:17:58.032 SDS_DECOUPLED ERROR SDS: sl73sdspdn137 (id: beb964a600000037) decoupled. 2022-08-26 16:17:58.032 SDS_DECOUPLED ERROR SDS: sl73sdspdn141 (id: beb964aa0000003b) decoupled. .. 2022-08-26 16:18:02.361 MDM_DATA_FAILED CRITICAL The system is now in DATA FAILURE state. Some data is unavailable. 2022-08-26 16:18:03.654 SDS_IN_COOL_DOWN WARNING SDS: sl73sdspdn133 (ID beb9168100000032) will disconnect from MDM for 15 seconds. failed to reconnect multiple times or for too long time 2022-08-26 16:18:03.654 SDS_IN_COOL_DOWN WARNING SDS: sl73sdspdn141 (ID beb964aa0000003b) will disconnect from MDM for 15 seconds. failed to reconnect multiple times or for too long time 2022-08-26 16:18:03.654 SDS_IN_COOL_DOWN WARNING SDS: sl73sdspdn136 (ID beb964a500000035) will disconnect from MDM for 15 seconds. failed to reconnect multiple times or for too long time
- Uno o más de los MDM se bloquean con la siguiente pila en el archivo exp.0:
2022/08/26 16:21:38.628778 [CHOKE_POINT] Panic in file /data/build/workspace/ScaleIO-Common-Job/src/mdm/control/tgt_poller.c, line 624, function tgtPoll_DevCapUsageTimerExpired, PID 90058.Panic Expression ALWAYS_ASSERT Device capacity update takes too long - restarting. /opt/emc/scaleio/mdm/bin/mdm-3.6.300.107(mosDbg_PanicPrepare+0x13a) [0xabf1ba] /opt/emc/scaleio/mdm/bin/mdm-3.6.300.107(tgtPoll_DevCapUsageTimerExpired+0x47) [0x9457d7] /opt/emc/scaleio/mdm/bin/mdm-3.6.300.107(mosTimerQ_PollUnlocked+0xb2) [0x9b4082] /opt/emc/scaleio/mdm/bin/mdm-3.6.300.107(mosTimer_PollQRange+0xf8) [0x9b6da8] /opt/emc/scaleio/mdm/bin/mdm-3.6.300.107(mosTimer_Loop+0x28) [0x9bcc58] /opt/emc/scaleio/mdm/bin/mdm-3.6.300.107(mosOsThrd_StartFunc+0x13c) [0x5bb2fc] /lib64/libpthread.so.0(+0x7ea5) [0x7f99e7618ea5]
- El espacio de volumen asignado se acerca al límite máximo permitido del sistema (16 PB). En el archivo query_all.txt, se muestran actualmente 14,3 PB:
Volumes summary: 2827 thin-provisioned volumes. Total user data size: 1.8 PB (1797 TB) 227 snapshots. Total user data size: 1.9 GB (1979 MB) 14.3 PB (14645 TB) all volumes size <===TOTAL ALLOCATED VOLUME CAPACITY 14.3 PB (14603 TB) base volumes size 427 volumes are not mapped 0 snapshot policies 2827 user volumes
Impacto
Los datos no estarán disponibles para los clientes si no hay suficientes SDS conectados al MDM principal.
Causa
En un cambio de MDM, el MDM debe tener en cuenta la ubicación y la capacidad de todos los bloques y en qué SDS residen. A medida que la capacidad asignada por volumen se acerca al límite máximo del sistema, hay una posibilidad cada vez mayor de que el MDM tarde demasiado en enviar estas actualizaciones a los SDS durante el cambio de MDM, lo que hace que los SDS no puedan volver a conectarse correctamente y que el MDM se bloquee cuando venza el temporizador de actualización de capacidad.
Resolución
Solución alternativa
Reduzca la cantidad de espacio de volumen asignado en el clúster de PowerFlex. Como hemos visto aumentar las posibilidades sobre el límite de 9 PB, se sugeriría quedarse en ese límite de capacidad asignado o por debajo de él. Este es un enlace de documentación que menciona el número de 9 PB.
Verifique que no haya problemas de red que ralenticen la comunicación entre los nodos de MDM y SDS.
Versiones afectadas
PowerFlex 3.5.x
PowerFlex 3.6.x
PowerFlex 4.0.0
Problema corregido en la versión
PowerFlex 3.6.1
PowerFlex 4.5