PowerFlex Après le basculement MDM, les SDS ne peuvent pas se reconnecter et les MDM se bloquent
Résumé: Après le basculement MDM, les SDS ne peuvent pas se reconnecter et les MDM se bloquent.
Symptômes
Scénario
Après un basculement MDM, les SDS ne peuvent pas se connecter complètement et les MDM se bloquent après avoir assumé les responsabilités de MDM principal pendant quelques minutes.
Symptômes
Les SDS ne peuvent pas rester connectés au nouveau MDM principal après un basculement et passer en mode de refroidissement :
2022-08-26 16:17:28.338 MDM_CLUSTER_BECOMING_PRIMARY WARNING This MDM, MDM3 (ID 1456cb2611860002), took control of the cluster and is now the Primary MDM. 2022-08-26 16:17:28.551 MDM_CLUSTER_NODE_DEGRADED ERROR MDM cluster node is now DEGRADED and is in offline node MDM1 (ID 65e9ec4b16ce3900); IPs: [10.0.2.104,10.0.3.141,10.0.1.132], Port: 9011 . 2022-08-26 16:17:28.551 MDM_CLUSTER_NODE_NORMAL INFO MDM cluster node MDM2 (ID 401d30c85efd7401); IPs: [10.0.2.102,10.0.1.105,10.0.3.140], Port: 9011 is now in NORMAL state. 2022-08-26 16:17:28.552 MDM_BECOMING_PRIMARY WARNING This MDM is switching to Primary mode. MDM will start running. .. 2022-08-26 16:17:58.032 SDS_DECOUPLED ERROR SDS: sl73sdspdn133 (id: beb9168100000032) decoupled. 2022-08-26 16:17:58.032 SDS_DECOUPLED ERROR SDS: sl73sdspdn136 (id: beb964a500000035) decoupled. 2022-08-26 16:17:58.032 SDS_DECOUPLED ERROR SDS: sl73sdspdn137 (id: beb964a600000037) decoupled. 2022-08-26 16:17:58.032 SDS_DECOUPLED ERROR SDS: sl73sdspdn141 (id: beb964aa0000003b) decoupled. .. 2022-08-26 16:18:02.361 MDM_DATA_FAILED CRITICAL The system is now in DATA FAILURE state. Some data is unavailable. 2022-08-26 16:18:03.654 SDS_IN_COOL_DOWN WARNING SDS: sl73sdspdn133 (ID beb9168100000032) will disconnect from MDM for 15 seconds. failed to reconnect multiple times or for too long time 2022-08-26 16:18:03.654 SDS_IN_COOL_DOWN WARNING SDS: sl73sdspdn141 (ID beb964aa0000003b) will disconnect from MDM for 15 seconds. failed to reconnect multiple times or for too long time 2022-08-26 16:18:03.654 SDS_IN_COOL_DOWN WARNING SDS: sl73sdspdn136 (ID beb964a500000035) will disconnect from MDM for 15 seconds. failed to reconnect multiple times or for too long time
- Un ou plusieurs des MDM se bloquent avec la pile ci-dessous dans le fichier exp.0 :
2022/08/26 16:21:38.628778 [CHOKE_POINT] Panic in file /data/build/workspace/ScaleIO-Common-Job/src/mdm/control/tgt_poller.c, line 624, function tgtPoll_DevCapUsageTimerExpired, PID 90058.Panic Expression ALWAYS_ASSERT Device capacity update takes too long - restarting. /opt/emc/scaleio/mdm/bin/mdm-3.6.300.107(mosDbg_PanicPrepare+0x13a) [0xabf1ba] /opt/emc/scaleio/mdm/bin/mdm-3.6.300.107(tgtPoll_DevCapUsageTimerExpired+0x47) [0x9457d7] /opt/emc/scaleio/mdm/bin/mdm-3.6.300.107(mosTimerQ_PollUnlocked+0xb2) [0x9b4082] /opt/emc/scaleio/mdm/bin/mdm-3.6.300.107(mosTimer_PollQRange+0xf8) [0x9b6da8] /opt/emc/scaleio/mdm/bin/mdm-3.6.300.107(mosTimer_Loop+0x28) [0x9bcc58] /opt/emc/scaleio/mdm/bin/mdm-3.6.300.107(mosOsThrd_StartFunc+0x13c) [0x5bb2fc] /lib64/libpthread.so.0(+0x7ea5) [0x7f99e7618ea5]
- L’espace de volume alloué approche de la limite maximale autorisée du système (16 Po). Dans le fichier query_all.txt, il affiche actuellement 14,3 Po :
Volumes summary: 2827 thin-provisioned volumes. Total user data size: 1.8 PB (1797 TB) 227 snapshots. Total user data size: 1.9 GB (1979 MB) 14.3 PB (14645 TB) all volumes size <===TOTAL ALLOCATED VOLUME CAPACITY 14.3 PB (14603 TB) base volumes size 427 volumes are not mapped 0 snapshot policies 2827 user volumes
Impact
Les données ne seront pas disponibles pour les clients si suffisamment de SDS ne restent pas connectés au MDM principal.
Cause
Lors d’un basculement MDM, le MDM doit tenir compte de l’emplacement et de la capacité de tous les blocs, ainsi que des SDS sur lesquels ils résident. Lorsque la capacité allouée au volume approche de la limite maximale du système, il est de plus en plus probable que le MDM mette trop de temps à envoyer ces mises à jour aux SDS lors du basculement MDM, ce qui empêche les SDS de se reconnecter correctement et le MDM se bloque lorsque le minuteur de mise à jour de capacité expire.
Résolution
Solution
Réduisez la quantité d’espace de volume alloué sur le cluster PowerFlex. Comme nous avons constaté une probable augmentation au-dessus de la limite de 9 Po, il est recommandé de ne pas dépasser la limite de capacité allouée. Voici un lien vers la documentation qui mentionne le nombre de 9 Po.
Vérifiez qu’aucun problème réseau ne ralentit la communication entre les nœuds MDM et SDS.
Versions affectées
PowerFlex 3.5.x
PowerFlex 3.6.x
PowerFlex 4.0.0
Problème résolu dans la version
PowerFlex 3.6.1
PowerFlex 4.5