PowerFlex después del cambio de MDM, los SDS no se pueden volver a conectar y los MDM se bloquean

Resumen: Después del cambio de MDM, los SDS no se pueden volver a conectar y los MDM se bloquean.

Este artículo se aplica a Este artículo no se aplica a Este artículo no está vinculado a ningún producto específico. No se identifican todas las versiones del producto en este artículo.

Síntomas

Escenario
Después de un cambio de MDM, los SDS no se pueden conectar por completo y los MDM se bloquean después de mantener las responsabilidades del MDM principal durante unos minutos.

Síntomas
 - Los SDS no pueden permanecer conectados al nuevo MDM principal después de un cambio y entrar en el modo de "Cool Down":

2022-08-26 16:17:28.338 MDM_CLUSTER_BECOMING_PRIMARY WARNING  	 This MDM, MDM3 (ID 1456cb2611860002), took control of the cluster and is now the Primary MDM. 
2022-08-26 16:17:28.551 MDM_CLUSTER_NODE_DEGRADED ERROR    	 MDM cluster node is now DEGRADED and is in offline node MDM1 (ID 65e9ec4b16ce3900); IPs: [10.0.2.104,10.0.3.141,10.0.1.132], Port: 9011 . 
2022-08-26 16:17:28.551 MDM_CLUSTER_NODE_NORMAL   INFO     	 MDM cluster node MDM2 (ID 401d30c85efd7401); IPs: [10.0.2.102,10.0.1.105,10.0.3.140], Port: 9011 is now in NORMAL state. 
2022-08-26 16:17:28.552 MDM_BECOMING_PRIMARY      WARNING  	 This MDM is switching to Primary mode. MDM will start running. 
..
2022-08-26 16:17:58.032 SDS_DECOUPLED             ERROR    	 SDS: sl73sdspdn133 (id: beb9168100000032) decoupled. 
2022-08-26 16:17:58.032 SDS_DECOUPLED             ERROR    	 SDS: sl73sdspdn136 (id: beb964a500000035) decoupled. 
2022-08-26 16:17:58.032 SDS_DECOUPLED             ERROR    	 SDS: sl73sdspdn137 (id: beb964a600000037) decoupled. 
2022-08-26 16:17:58.032 SDS_DECOUPLED             ERROR    	 SDS: sl73sdspdn141 (id: beb964aa0000003b) decoupled. 
..
2022-08-26 16:18:02.361 MDM_DATA_FAILED           CRITICAL 	 The system is now in DATA FAILURE state. Some data is unavailable. 
2022-08-26 16:18:03.654 SDS_IN_COOL_DOWN          WARNING  	 SDS: sl73sdspdn133 (ID beb9168100000032) will disconnect from MDM for 15 seconds. failed to reconnect multiple times or for too long time
2022-08-26 16:18:03.654 SDS_IN_COOL_DOWN          WARNING  	 SDS: sl73sdspdn141 (ID beb964aa0000003b) will disconnect from MDM for 15 seconds. failed to reconnect multiple times or for too long time
2022-08-26 16:18:03.654 SDS_IN_COOL_DOWN          WARNING  	 SDS: sl73sdspdn136 (ID beb964a500000035) will disconnect from MDM for 15 seconds. failed to reconnect multiple times or for too long time 

- Uno o más de los MDM se bloquean con la siguiente pila en el archivo exp.0:

2022/08/26 16:21:38.628778 [CHOKE_POINT] Panic in file /data/build/workspace/ScaleIO-Common-Job/src/mdm/control/tgt_poller.c, line 624, function tgtPoll_DevCapUsageTimerExpired, PID 90058.Panic Expression ALWAYS_ASSERT Device capacity update takes too long - restarting.
/opt/emc/scaleio/mdm/bin/mdm-3.6.300.107(mosDbg_PanicPrepare+0x13a) [0xabf1ba]
/opt/emc/scaleio/mdm/bin/mdm-3.6.300.107(tgtPoll_DevCapUsageTimerExpired+0x47) [0x9457d7]
/opt/emc/scaleio/mdm/bin/mdm-3.6.300.107(mosTimerQ_PollUnlocked+0xb2) [0x9b4082]
/opt/emc/scaleio/mdm/bin/mdm-3.6.300.107(mosTimer_PollQRange+0xf8) [0x9b6da8]
/opt/emc/scaleio/mdm/bin/mdm-3.6.300.107(mosTimer_Loop+0x28) [0x9bcc58]
/opt/emc/scaleio/mdm/bin/mdm-3.6.300.107(mosOsThrd_StartFunc+0x13c) [0x5bb2fc]
/lib64/libpthread.so.0(+0x7ea5) [0x7f99e7618ea5] 

- El espacio de volumen asignado se acerca al límite máximo permitido del sistema (16 PB). En el archivo query_all.txt, se muestran actualmente 14,3 PB:

Volumes summary:
	2827 thin-provisioned volumes. Total user data size: 1.8 PB (1797 TB)
	227 snapshots. Total user data size: 1.9 GB (1979 MB)
	14.3 PB (14645 TB) all volumes size  <===TOTAL ALLOCATED VOLUME CAPACITY
	14.3 PB (14603 TB) base volumes size
	427 volumes are not mapped
	0 snapshot policies
	2827 user volumes 

 

Impacto

Los datos no estarán disponibles para los clientes si no hay suficientes SDS conectados al MDM principal.

Causa

En un cambio de MDM, el MDM debe tener en cuenta la ubicación y la capacidad de todos los bloques y en qué SDS residen. A medida que la capacidad asignada por volumen se acerca al límite máximo del sistema, hay una posibilidad cada vez mayor de que el MDM tarde demasiado en enviar estas actualizaciones a los SDS durante el cambio de MDM, lo que hace que los SDS no puedan volver a conectarse correctamente y que el MDM se bloquee cuando venza el temporizador de actualización de capacidad. 

Resolución

Solución alternativa

Reduzca la cantidad de espacio de volumen asignado en el clúster de PowerFlex. Como hemos visto aumentar las posibilidades sobre el límite de 9 PB, se sugeriría quedarse en ese límite de capacidad asignado o por debajo de él. Este es un enlace de documentación que menciona el número de 9 PB.

Verifique que no haya problemas de red que ralenticen la comunicación entre los nodos de MDM y SDS.

Versiones afectadas

PowerFlex 3.5.x
PowerFlex 3.6.x
PowerFlex 4.0.0

Problema corregido en la versión

PowerFlex 3.6.1
PowerFlex 4.5

Productos afectados

PowerFlex rack, ScaleIO
Propiedades del artículo
Número del artículo: 000203272
Tipo de artículo: Solution
Última modificación: 15 may 2026
Versión:  5
Encuentre respuestas a sus preguntas de otros usuarios de Dell
Servicios de soporte
Compruebe si el dispositivo está cubierto por los servicios de soporte.