PowerFlex SDS — zamykanie gniazd bez problemów z siecią
Summary: SDS zgłasza zamknięte gniazda bez żadnych zdarzeń sieciowych lub dowodów na problemy z siecią.
Symptoms
Scenariusz
SDS zgłasza gniazda zamknięte przez procesy zdalne (SDC, SDS, MDM) i nie zaobserwowano żadnych zdarzeń awarii karty sieciowej, porzuconych ramek lub utraty pakietów.
Objawy
Dziennik zdarzeń zgłasza utratę łączności SDS, odłączenie lub ponowne połączenie:
2017-11-11 16:52:12.101 SDS_RECONNECTED INFO SDS: xyz_d35 (ID 67211111110089) reconnected 2017-11-11 16:52:13.690 MDM_DATA_FAILED CRITICAL The system is now in DATA FAILURE state. Some data is unavailable. 2017-11-11 16:52:15.791 MDM_DATA_DEGRADED ERROR The system is now in DEGRADED state.
Wcześniej widzimy błędy podobne do następujących w śladach SDS.
SDS próbował wysłać, a odpowiedź zajęła >1 sekundę:
11/11 16:52:04.527408 0x7ff0b19eaeb0:contNet_OscillationNotif:01720: Con 672cb111110099 - Oscillation of type 5 (RPC_LINGERED_1SEC) reported
Gniazdo z peerem zostało zamknięte z drugiej strony z powodu braku odbioru przez nas wysłanych informacji niższego poziomu:
11/11 16:52:06.241105 0x7ff0b19e1eb0:contNet_OscillationNotif:01720: Con a71d2b5d00000078 - Oscillation of type 1 (SOCKET_DOWN) reported
Inny przykład wygląda tak:
11/11 16:52:06.241224 0x7ff0b19e1eb0:contNet_OscillationNotif:01720: Con a71d2b3c00000057 - Oscillation of type 2 (IO_ERROR) reported
Inne wskaźniki:
Iteracje
Zegar utrzymywania aktywności sieci niższego poziomu ScaleIO jest mierzony w iteracjach, które trwają 100 milisekund.
Limit czasu MDM-SDS> wynosi 20 iteracji lub 2 s, podczas gdy limit czasu utrzymywania aktywności MDM-MDM wynosi 3 iteracje lub 300 ms.
Przekroczono dwadzieścia iteracji:
11/11 16:52:11.685281 0x7ff752d1beb0:netPath_IsKaNeeded:01858: :: Connected Live CLIENT path 0x7ff6e2192a00 of portal 0x7ff6e2192900 net 0x7ff7480e1110 socket 210 inflights 0 didn't receive message for 20 iterations from 10.124.162.109:7072. Marking as down
Gniazda wciśnięte Te ślady wskazują, kiedy gniazda przestały działać:
11/11 16:52:09.787793 0x7ff752cf7eb0:tgtMgr_TgtOscCB:07696: Con 672cba7400000089 Network address 10.124.130.109 - Oscillation of type SOCKET_DOWN reported 11/11 16:52:11.685290 0x7ff752d1beb0:tgtMgr_TgtOscCB:07696: Con 672cba7400000089 Network address 10.124.162.109 - Oscillation of type RCV_KA_DISCONNECT reported 11/11 16:52:11.685308 0x7ff752cf7eb0:tgtMgr_TgtOscCB:07696: Con 672cba7400000089 Network address 10.124.162.109 - Oscillation of type SOCKET_DOWN reported
Ten wydruk oznacza, że ostatnie gniazdo karty SDS uległo awarii i jest to punkt, w którym SDS jest uważany za odłączony:
11/11 16:52:11.685319 0x7ff752cf7eb0:tgtMgr_TgtDisconnectCB:07818: Tgt: 672cba7400000089 ConId: 672cba7400000089
MDM wyda polecenie addmdm, aby ponownie połączyć się z SDS.
Błąd we/wy zablokowany
Wiemy, że IO_FAULT_BLOCKED się zdarzyć, gdy serwer SDS odmawia operacji we/wy, ponieważ nie może połączyć się z MDM, ale informacje te są niekompletne.
SDS wysyła elementy utrzymania do MDM co sekundę, a jeśli MDM nie otrzyma ich przez 5 sekund, SDS jest uznawany za przekroczony limit czasu i zostaje oznaczony jako rozłączony.
MDM co sekundę wysyła do serwera SDS komunikat "kontynuuj pracę". Jeśli serwer SDS nie otrzyma tego komunikatu przez 5 sekund, odrzuca operacje we/wy z IO_FAULT_BLOCKED:
11/11 16:52:12.007045 0x7ff0b0cdfeb0:ioh_NewRequest:05490: Write to comb f778038007f - Done rc is IO_FAULT_BLOCKED (Lba 6721528 8), volume 6e1a2f4a0000075d (dit) 11/11 16:52:12.008825 0x7ff0b0ec5eb0:ioh_NewRequest:05490: Write to comb f78803903fc - Done rc is IO_FAULT_BLOCKED (Lba 5031040 6), volume 6e1a2f4c0000075f (dit) 11/11 16:52:12.017262 0x7ff0b26daeb0:ioh_NewRequest:05490: Write to comb f768037003e - Done rc is IO_FAULT_BLOCKED (Lba 15106144 16), volume 6e1a2f490000075c (dit)
Wpływ
Utrata łączności z kartą SDS
W stanie data_degraded lub w trybie natychmiastowej konserwacji może to spowodować DU.
Cause
Przyczyną niepowodzenia we/wy w tym przykładowym przypadku było to, że dzierżawa SDS (5 s) nie wygasła, ale limit czasu sieci niższego poziomu (2 s) wygasł.
Główną przyczyną jest co najmniej jedna z następujących przyczyn:
1— Problemy z
TCP/siecią: A— Problem prawdopodobnie objawi się ponownymi transmisjami TCP, co wskazuje na problemy ze sprzętem/konfiguracją. (problemy z, kartą sieciową, przełącznikiem itp.) Jak widać na danych wyjściowych
sar -n ETCP 1
Który daje wynik jako:
Linux 3.10.0-693.5.2.el7.x86_64 (SIO-DCOE-96O-3) 12/13/2017 _x86_64_ (48 CPU) 04:33:44 PM atmptf/s estres/s retrans/s isegerr/s orsts/s 04:33:45 PM 0.00 0.00 50.00 0.00 0.00 04:33:46 PM 2.00 0.00 75.00 0.00 0.00 04:33:47 PM 0.00 0.00 223.00 0.00 0.00 04:33:48 PM 0.00 0.00 106.00 0.00 0.00 04:33:49 PM 2.00 0.00 58.00 0.00 0.00 04:33:50 PM 0.00 0.00 5.00 0.00 0.00 04:33:51 PM 0.00 0.00 7.00 0.00 0.00 04:33:52 PM 2.00 0.00 2.00 0.00 0.00 04:33:53 PM 0.00 0.00 1.00 0.00 0.00 ^C 04:33:53 PM 0.00 0.00 0.00 0.00 0.00 Average: 0.65 0.00 99.00 0.00 0.00
Materiały referencyjne:
- Zielony = pojedyncze cyfry/s
- Żółty = wysokie dwucyfrowe wartości do 50/s
- Czerwony = >50/s
B-W przypadku starszych dystrybucji Linuksa, takich jak SusE 11 SP3 na naszych SVM, można monitorować retransmisje sieciowe za pomocą następującego polecenia:
watch -d -n 2 "netstat -s |grep retrans"
Który wyświetla dane wyjściowe jak poniżej, wyróżniając znaki, które zostały zaktualizowane w ostatnim interwale:
Every 2.0s: netstat -s |grep retrans Wed Dec 13 09:55:10 2017
1244070 segments retransmited
2- Problemy z procesorem, głód procesu.
Objawia się to jednoczesną pauzą w śladach każdego komponentu SIO, z wieloma gniazdami zamykającymi się jako pierwsze linie w śladzie po wznowieniu.
Plik LIA, SDS, MDM/TB, SDC/messages pokazuje lukę.
Na przykład ślad LIA pokazuje gniazda LIA→SDS zamykające się po upływie 3 s (30 iteracji x 100 ms):
11/11 16:52:11.597227 0x7f44c41c6eb0:netPath_IsKaNeeded:01858: :: Connected Live SERVER path 0x7f44c4195690 of portal 0x7f44c4192bb0 net 0x83b040 socket 8 inflights 0 didn't receive message for 30 iterations from 127.0.0.1:43228. Marking as down 11/11 16:52:12.031195 0x7f44c419eeb0:liaNet_DisconnectedNotif:01553: Con aed disconnected 11/11 16:52:12.158383 0x7f44c419eeb0:liaNet_ConnectedNotif:01483: Con aed connected
3- Może mamy błąd gdzieś w SIO. Prawdopodobnie wątek niesieciowy wstrzymuje procesor i nie pozwala na uruchomienie czegoś innego itp.
Resolution
Obejście problemu
Brak ogólnego obejścia problemu
Wersje, których dotyczy problem
Wszystko
Naprawiono w wersji
Nie dotyczy