PowerFlex: 잦은 MDM 연결 해제
요약: PowerFlex 시스템은 빈번한 MDM 연결 해제를 보고합니다. 이 문제는 이 특정 시나리오의 PowerFlex 랙 15G 클러스터에서 발견되었습니다.
증상
이 시나리오에서 기본 MDM은 클러스터의 모든 MDM이 영향을 받았음을 나타내는 다양한 MDM 간의 연결 끊김을 자주 보고합니다.
2023-10-25 14:24:06.740 MDM_CLUSTER_NODE_DEGRADED ERROR MDM cluster node is now DEGRADED and is in offline node node05 (ID 0411f6fe38bf3103); IPs: [14.14.14.105,15.15.15.105], Port: 9011 . 2023-10-25 14:24:06.845 MDM_CLUSTER_CONNECTED INFO The MDM, node05 (ID 0411f6fe38bf3103), connected after 100ms 2023-10-25 14:24:06.952 MDM_CLUSTER_NODE_NORMAL INFO MDM cluster node node05 (ID 0411f6fe38bf3103); IPs: [14.14.14.105,15.15.15.105], Port: 9011 is now in NORMAL state. 2023-10-25 14:24:06.952 MDM_CLUSTER_NORMAL INFO MDM cluster is now in NORMAL mode. 2023-10-25 14:24:42.060 MDM_CLUSTER_LOST_CONNECTION WARNING The MDM, node02 (ID 6176009c2159e002), has lost connection to the cluster. 2023-10-25 14:24:42.060 MDM_CLUSTER_LOST_CONNECTION WARNING The MDM, node05 (ID 0411f6fe38bf3103), has lost connection to the cluster. 2023-10-25 14:24:42.162 MDM_CLUSTER_CONNECTED INFO The MDM, node05 (ID 0411f6fe38bf3103), connected after 100ms 2023-10-25 14:24:42.162 MDM_CLUSTER_CONNECTED INFO The MDM, node02 (ID 6176009c2159e002), connected after 100ms ...
운영 MDM trc 로그에서 다음과 같은 오류가 보고될 수 있습니다.
2023/10/25 14:24:42.161854 7fb3d978adb0:netPath_StartAsClient_CK:00920: :: Disconnected Live CLIENT path 0x7fb3e8113bb0 of portal 0x7fb3e8111650 net 0x7fb3e8010420 socket -1 infl ights 0 HS:0 Start connection from conID 79b6776f71a29e00 to 0411f6fe38bf3103, to IP 15.15.15.105:9011 2023/10/25 14:24:42.161902 7fb3d978adb0:netPath_StartAsClient_CK:00920: :: Disconnected Live CLIENT path 0x7fb3e8120b30 of portal 0x7fb3e8120930 net 0x7fb3e8010420 socket -1 infl ights 0 HS:0 Start connection from conID 79b6776f71a29e00 to 6176009c2159e002, to IP 14.14.14.102:9011 2023/10/25 14:24:42.161919 7fb3d978adb0:netPath_StartAsClient_CK:00920: :: Disconnected Live CLIENT path 0x7fb3e8122f90 of portal 0x7fb3e8120a30 net 0x7fb3e8010420 socket -1 infl ights 0 HS:0 Start connection from conID 79b6776f71a29e00 to 6176009c2159e002, to IP 15.15.15.102:9011 2023/10/25 14:24:42.161934 7fb3d978adb0:netPath_StartAsClient_CK:00920: :: Disconnected Live CLIENT path 0x7fb3e8111750 of portal 0x7fb3e8111550 net 0x7fb3e8010420 socket -1 inflights 0 HS:0 Start connection from conID 79b6776f71a29e00 to 0411f6fe38bf3103, to IP 14.14.14.105:9011
SAR 데이터는 TCP 재전송의 급증을 보여줄 수 있습니다.
Linux 5.4.225-200.el7.x86_64 10/25/2023 _x86_64_ (64 CPU) 11:56:11 AM atmptf/s estres/s retrans/s isegerr/s orsts/s 12:23:38 PM 0.00 0.00 0.00 0.00 0.00 12:23:39 PM 0.00 0.00 284.00 0.00 0.00 12:23:40 PM 0.00 0.99 123.76 0.00 0.00 12:23:41 PM 0.00 1.00 501.00 0.00 0.00 12:23:42 PM 0.00 0.00 275.25 0.00 0.00 12:24:37 PM 0.00 0.00 274.00 0.00 0.00 12:24:38 PM 0.00 0.00 122.77 0.00 0.00 12:24:39 PM 0.00 0.00 276.00 0.00 0.00 12:24:40 PM 0.00 0.00 159.00 0.00 0.00 12:24:41 PM 0.00 0.00 439.00 0.00 0.00 12:24:42 PM 0.00 7.92 249.50 0.00 8.91 12:24:43 PM 0.00 0.00 109.00 0.00 2.00 12:24:44 PM 0.00 0.99 102.97 0.00 0.99 12:24:45 PM 0.00 0.00 84.00 0.00 0.00 12:24:46 PM 0.00 0.00 63.37 0.00 0.00 12:24:47 PM 0.00 0.00 0.00 0.00 0.00 12:24:48 PM 0.00 0.00 124.75 0.00 0.00 12:24:49 PM 0.00 0.00 321.00 0.00 0.00 12:24:50 PM 0.00 0.00 346.00 0.00 0.00 12:24:51 PM 0.00 0.00 316.00 0.00 0.00
후속 테스트에서 복제되지 않은 주소 14.14.14.102에서 발생한 초기 12% 패킷 손실에서 알 수 있듯이 데이터 네트워크에 대해 점보 프레임으로 ping할 때 패킷 손실이 간헐적으로 나타납니다.
[root@node01 ~]# for x in {102..105}; do echo "Testing .$x"; ping -c100 -Mdo -i .01 -s 8972 14.14.14.$x |grep -i packet; done
Testing .102
100 packets transmitted, 88 received, 12% packet loss, time 1089ms
Testing .103
100 packets transmitted, 100 received, 0% packet loss, time 1088ms
Testing .104
100 packets transmitted, 100 received, 0% packet loss, time 1088ms
Testing 105
100 packets transmitted, 100 received, 0% packet loss, time 1088ms
[root@node01 ~]# for x in (102..105); do echo "Testing .$x"; ping -c100 -Mdo -i .01 -s 8972 14.14.14.$x |grep -i packet; done
Testing .102
100 packets transmitted, 100 received, 0% packet loss, time 1089ms
Testing .103
100 packets transmitted, 100 received, 0% packet loss, time 1088ms
Testing .104
100 packets transmitted, 100 received, 0% packet loss, time 1088ms
Testing -105
100 packets transmitted, 100 received, 0% packet loss, time 1088ms
MDM 클러스터는 지속적인 성능 저하 상태와 MDM의 연결이 끊기거나 다시 연결되는 빈도를 보고합니다. 이 시나리오에서는 간헐적인 패킷 손실이나 TCP 재전송의 급증이 SDS에 영향을 미치지 않았습니다.
영향
MDM 클러스터는 지속적인 성능 저하 상태를 보고하고 MDM의 연결이 끊기거나 다시 연결되는 경우가 잦습니다. 이 시나리오에서는 간헐적인 패킷 손실이나 TCP 재전송의 급증이 SDS에 영향을 미치지 않았습니다.
원인
네트워크 불안정 및 간헐적인 패킷 손실은 네트워크 내의 IPv6 처리와 관련된 것으로 보입니다. IPv4/IPv6 주소 처리 구성을 수정하고 IPv6을 비활성화하여 IPv6과의 충돌 또는 잘못된 구성 또는 네트워크가 IPv4에서만 작동하는 것이 더 안정적이고 효율적임을 시사하는 문제가 해결되었습니다.
해결
모든 PowerFlex 노드에서 다음 명령을 실행합니다.
echo ""precedence ::ffff:0:0/96 100"" >>/etc/gai.conf echo "net.ipv6.conf.lo.disable_ipv6=1" >> /etc/sysctl.conf echo "net.ipv6.conf.all.disable_ipv6=1" >> /etc/sysctl.conf echo "net.ipv6.conf.default.disable_ipv6=1" >> /etc/sysctl.conf
네트워크 카드에 대한 ifcfg-* 스크립트 파일이 IPv6을 특별히 활성화하는 경우 비활성화해야 합니다.
노드를 유지 보수 모드(IMM 또는 PMM)로 전환한 다음 노드를 재부팅합니다.
영향을 받는 버전
PowerFlex 문제가 아님
수정된 버전
PowerFlex 문제는 아니지만 PowerFlex Manager 3.8.7 이상에서는 신규 구축 시 IPv6를 비활성화합니다.
추가 정보
관련 기사 참조: PowerFlex: 잦은 MDM 연결 해제