네트워크 문제 없이 소켓을 닫는 PowerFlex SDS
Summary: SDS는 네트워크 이벤트나 네트워킹 문제의 증거 없이 소켓이 닫혔다고 보고합니다.
Symptoms
시나리오
SDS는 원격 프로세스(SDC, SDS, MDM)에 의해 소켓이 닫혔으며 NIC 다운 이벤트, 프레임 손실 또는 패킷 손실이 관찰되지 않았다고 보고합니다.
조짐
이벤트 로그는 분리 또는 재연결 중 SDS 연결 손실을 보고합니다.
2017-11-11 16:52:12.101 SDS_RECONNECTED INFO SDS: xyz_d35 (ID 67211111110089) reconnected 2017-11-11 16:52:13.690 MDM_DATA_FAILED CRITICAL The system is now in DATA FAILURE state. Some data is unavailable. 2017-11-11 16:52:15.791 MDM_DATA_DEGRADED ERROR The system is now in DEGRADED state.
그 전에 SDS 추적에서 다음과 같은 오류가 표시됩니다.
SDS가 전송을 시도했으며 응답하는 데 1초가 걸렸습니다 >.
11/11 16:52:04.527408 0x7ff0b19eaeb0:contNet_OscillationNotif:01720: Con 672cb111110099 - Oscillation of type 5 (RPC_LINGERED_1SEC) reported
피어가 있는 소켓은 하위 수준 keepalive를 보내는 것을 수신하지 못했기 때문에 다른 쪽에서 닫혔습니다.
11/11 16:52:06.241105 0x7ff0b19e1eb0:contNet_OscillationNotif:01720: Con a71d2b5d00000078 - Oscillation of type 1 (SOCKET_DOWN) reported
이것의 또 다른 예는 다음과 같습니다.
11/11 16:52:06.241224 0x7ff0b19e1eb0:contNet_OscillationNotif:01720: Con a71d2b3c00000057 - Oscillation of type 2 (IO_ERROR) reported
기타 지표:
반복
ScaleIO의 하위 수준 네트워킹 keepalive 타이머는 100밀리초 길이의 반복으로 측정됩니다.
MDM-SDS> 시간 초과는 20회 반복 또는 2초이고 MDM-MDM keepalive 시간 초과는 3회 반복 또는 300ms입니다.
20회 반복 초과:
11/11 16:52:11.685281 0x7ff752d1beb0:netPath_IsKaNeeded:01858: :: Connected Live CLIENT path 0x7ff6e2192a00 of portal 0x7ff6e2192900 net 0x7ff7480e1110 socket 210 inflights 0 didn't receive message for 20 iterations from 10.124.162.109:7072. Marking as down
소켓 다운 이 트레이스 출력은 소켓이 다운된 시기를 나타냅니다.
11/11 16:52:09.787793 0x7ff752cf7eb0:tgtMgr_TgtOscCB:07696: Con 672cba7400000089 Network address 10.124.130.109 - Oscillation of type SOCKET_DOWN reported 11/11 16:52:11.685290 0x7ff752d1beb0:tgtMgr_TgtOscCB:07696: Con 672cba7400000089 Network address 10.124.162.109 - Oscillation of type RCV_KA_DISCONNECT reported 11/11 16:52:11.685308 0x7ff752cf7eb0:tgtMgr_TgtOscCB:07696: Con 672cba7400000089 Network address 10.124.162.109 - Oscillation of type SOCKET_DOWN reported
이 인쇄는 SDS에 대한 마지막 소켓이 다운되었음을 의미하며 SDS의 연결이 끊긴 것으로 간주되는 지점입니다.
11/11 16:52:11.685319 0x7ff752cf7eb0:tgtMgr_TgtDisconnectCB:07818: Tgt: 672cba7400000089 ConId: 672cba7400000089
MDM은 addmdm 명령을 실행하여 SDS를 다시 연결합니다.
IO 장애 차단됨
SDS가 MDM에 연결할 수 없어 IO를 거부하는 IO_FAULT_BLOCKED 발생하는 것을 알고 있지만 이 정보는 불완전합니다.
SDS는 1초마다 MDM에 keepalive를 전송하며, MDM이 5초 동안 이를 받지 못하면 SDS는 시간 초과된 것으로 간주되어 분리된 것으로 표시됩니다.
MDM은 SDS에 1초마다 "계속 작동" 메시지를 보냅니다. SDS가 5초 동안 이 메시지를 수신하지 못한 경우 IO_FAULT_BLOCKED IO를 거부합니다.
11/11 16:52:12.007045 0x7ff0b0cdfeb0:ioh_NewRequest:05490: Write to comb f778038007f - Done rc is IO_FAULT_BLOCKED (Lba 6721528 8), volume 6e1a2f4a0000075d (dit) 11/11 16:52:12.008825 0x7ff0b0ec5eb0:ioh_NewRequest:05490: Write to comb f78803903fc - Done rc is IO_FAULT_BLOCKED (Lba 5031040 6), volume 6e1a2f4c0000075f (dit) 11/11 16:52:12.017262 0x7ff0b26daeb0:ioh_NewRequest:05490: Write to comb f768037003e - Done rc is IO_FAULT_BLOCKED (Lba 15106144 16), volume 6e1a2f490000075c (dit)
영향
SDS 연결 끊김
data_degraded 상태 또는 즉각적인 유지 보수 모드에서는 이로 인해 DU가 발생할 수 있습니다.
Cause
이 예에서 IO 실패의 원인은 (5초) SDS 임대가 만료되지 않았지만 (2초) 하위 수준 네트워크 시간 초과가 발생했기 때문입니다.
근본 원인은 다음 이유 중 하나 이상입니다.
1- TCP/네트워크 문제
A- 이는 HW/컨피그레이션 문제를 나타내는 TCP 재전송으로 나타날 수 있습니다. (케이블, NIC, 스위치 문제 등) 의 출력에서 볼 수 있듯이
sar -n ETCP 1
다음과 같이 출력됩니다.
Linux 3.10.0-693.5.2.el7.x86_64 (SIO-DCOE-96O-3) 12/13/2017 _x86_64_ (48 CPU) 04:33:44 PM atmptf/s estres/s retrans/s isegerr/s orsts/s 04:33:45 PM 0.00 0.00 50.00 0.00 0.00 04:33:46 PM 2.00 0.00 75.00 0.00 0.00 04:33:47 PM 0.00 0.00 223.00 0.00 0.00 04:33:48 PM 0.00 0.00 106.00 0.00 0.00 04:33:49 PM 2.00 0.00 58.00 0.00 0.00 04:33:50 PM 0.00 0.00 5.00 0.00 0.00 04:33:51 PM 0.00 0.00 7.00 0.00 0.00 04:33:52 PM 2.00 0.00 2.00 0.00 0.00 04:33:53 PM 0.00 0.00 1.00 0.00 0.00 ^C 04:33:53 PM 0.00 0.00 0.00 0.00 0.00 Average: 0.65 0.00 99.00 0.00 0.00
참조:
- 녹색 = 한 자릿수/초
- 노란색 = 최대 50/s의 높은 두 자릿수
- 빨간색 = >50/s
B-SVM의 SusE 11 SP3와 같은 이전 Linux Distro의 경우 다음 명령을 사용하여 네트워크 재전송을 모니터링할 수 있습니다.
watch -d -n 2 "netstat -s |grep retrans"
아래와 같이 출력되며 마지막 간격 동안 업데이트된 문자가 강조 표시됩니다.
Every 2.0s: netstat -s |grep retrans Wed Dec 13 09:55:10 2017
1244070 segments retransmited
2- CPU 문제, 프로세스 부족.
이는 모든 SIO 구성 요소의 추적에서 동시 일시 중지로 나타나며, 재개 시 추적의 첫 번째 줄로 많은 소켓이 닫힙니다.
LIA, SDS, MDM/TB, SDC/메시지 파일에 간격이 표시됩니다.
예를 들어, LIA 추적은 3초(30회 반복 x 100ms) 시간 초과 후 LIA→SDS 소켓이 닫히는 것을 보여줍니다.
11/11 16:52:11.597227 0x7f44c41c6eb0:netPath_IsKaNeeded:01858: :: Connected Live SERVER path 0x7f44c4195690 of portal 0x7f44c4192bb0 net 0x83b040 socket 8 inflights 0 didn't receive message for 30 iterations from 127.0.0.1:43228. Marking as down 11/11 16:52:12.031195 0x7f44c419eeb0:liaNet_DisconnectedNotif:01553: Con aed disconnected 11/11 16:52:12.158383 0x7f44c419eeb0:liaNet_ConnectedNotif:01483: Con aed connected
3- SIO 어딘가에 버그가 있을 수 있습니다. 네트워크가 아닌 스레드가 CPU를 보유하고 다른 것을 실행하지 못하게하는 등의 가능성이 있습니다.
Resolution
해결 방법
일반적인 해결 방법 없음
영향을 받는 버전
All
수정된 버전
N/A