PowerFlex SDS — zamykanie gniazd bez problemów z siecią

Summary: SDS zgłasza zamknięte gniazda bez żadnych zdarzeń sieciowych lub dowodów na problemy z siecią.

Acest articol se aplică pentru Acest articol nu se aplică pentru Acest articol nu este legat de un produs specific. Acest articol nu acoperă toate versiunile de produs existente.

Symptoms

Scenariusz
SDS zgłasza gniazda zamknięte przez procesy zdalne (SDC, SDS, MDM) i nie zaobserwowano żadnych zdarzeń awarii karty sieciowej, porzuconych ramek lub utraty pakietów. 

Objawy
Dziennik zdarzeń zgłasza utratę łączności SDS, odłączenie lub ponowne połączenie: 

2017-11-11 16:52:12.101 SDS_RECONNECTED           INFO     	 SDS: xyz_d35 (ID 67211111110089) reconnected 
2017-11-11 16:52:13.690 MDM_DATA_FAILED           CRITICAL 	 The system is now in DATA FAILURE state. Some data is unavailable. 
2017-11-11 16:52:15.791 MDM_DATA_DEGRADED         ERROR    	 The system is now in DEGRADED state. 

Wcześniej widzimy błędy podobne do następujących w śladach SDS.

SDS próbował wysłać, a odpowiedź zajęła >1 sekundę:

11/11 16:52:04.527408 0x7ff0b19eaeb0:contNet_OscillationNotif:01720: Con 672cb111110099 - Oscillation of type 5 (RPC_LINGERED_1SEC) reported

Gniazdo z peerem zostało zamknięte z drugiej strony z powodu braku odbioru przez nas wysłanych informacji niższego poziomu:

11/11 16:52:06.241105 0x7ff0b19e1eb0:contNet_OscillationNotif:01720: Con a71d2b5d00000078 - Oscillation of type 1 (SOCKET_DOWN) reported 

Inny przykład wygląda tak:

11/11 16:52:06.241224 0x7ff0b19e1eb0:contNet_OscillationNotif:01720: Con a71d2b3c00000057 - Oscillation of type 2 (IO_ERROR) reported

Inne wskaźniki:
Iteracje
Zegar utrzymywania aktywności sieci niższego poziomu ScaleIO jest mierzony w iteracjach, które trwają 100 milisekund.

Limit czasu MDM-SDS> wynosi 20 iteracji lub 2 s, podczas gdy limit czasu utrzymywania aktywności MDM-MDM wynosi 3 iteracje lub 300 ms.

Przekroczono dwadzieścia iteracji:

11/11 16:52:11.685281 0x7ff752d1beb0:netPath_IsKaNeeded:01858:  :: Connected Live CLIENT path 0x7ff6e2192a00 of portal 0x7ff6e2192900 net 0x7ff7480e1110 socket 210 inflights 0 didn't receive message for 20 iterations from 10.124.162.109:7072. Marking as down  

Gniazda wciśnięte Te ślady wskazują, kiedy gniazda przestały działać:

11/11 16:52:09.787793 0x7ff752cf7eb0:tgtMgr_TgtOscCB:07696: Con 672cba7400000089 Network address 10.124.130.109 - Oscillation of type SOCKET_DOWN reported

11/11 16:52:11.685290 0x7ff752d1beb0:tgtMgr_TgtOscCB:07696: Con 672cba7400000089 Network address 10.124.162.109 - Oscillation of type RCV_KA_DISCONNECT reported
11/11 16:52:11.685308 0x7ff752cf7eb0:tgtMgr_TgtOscCB:07696: Con 672cba7400000089 Network address 10.124.162.109 - Oscillation of type SOCKET_DOWN reported

Ten wydruk oznacza, że ostatnie gniazdo karty SDS uległo awarii i jest to punkt, w którym SDS jest uważany za odłączony:

11/11 16:52:11.685319 0x7ff752cf7eb0:tgtMgr_TgtDisconnectCB:07818: Tgt: 672cba7400000089 ConId: 672cba7400000089

MDM wyda polecenie addmdm, aby ponownie połączyć się z SDS. 

Błąd we/wy zablokowany
Wiemy, że IO_FAULT_BLOCKED się zdarzyć, gdy serwer SDS odmawia operacji we/wy, ponieważ nie może połączyć się z MDM, ale informacje te są niekompletne.

SDS wysyła elementy utrzymania do MDM co sekundę, a jeśli MDM nie otrzyma ich przez 5 sekund, SDS jest uznawany za przekroczony limit czasu i zostaje oznaczony jako rozłączony.

MDM co sekundę wysyła do serwera SDS komunikat "kontynuuj pracę". Jeśli serwer SDS nie otrzyma tego komunikatu przez 5 sekund, odrzuca operacje we/wy z IO_FAULT_BLOCKED: 

11/11 16:52:12.007045 0x7ff0b0cdfeb0:ioh_NewRequest:05490: Write to comb f778038007f - Done rc is IO_FAULT_BLOCKED (Lba 6721528 8), volume 6e1a2f4a0000075d (dit)
11/11 16:52:12.008825 0x7ff0b0ec5eb0:ioh_NewRequest:05490: Write to comb f78803903fc - Done rc is IO_FAULT_BLOCKED (Lba 5031040 6), volume 6e1a2f4c0000075f (dit)
11/11 16:52:12.017262 0x7ff0b26daeb0:ioh_NewRequest:05490: Write to comb f768037003e - Done rc is IO_FAULT_BLOCKED (Lba 15106144 16), volume 6e1a2f490000075c (dit)

 

Wpływ

Utrata łączności z kartą SDS

W stanie data_degraded lub w trybie natychmiastowej konserwacji może to spowodować DU.

Cause

Przyczyną niepowodzenia we/wy w tym przykładowym przypadku było to, że dzierżawa SDS (5 s) nie wygasła, ale limit czasu sieci niższego poziomu (2 s) wygasł.

Główną przyczyną jest co najmniej jedna z następujących przyczyn: 

1— Problemy z
TCP/siecią: A— Problem prawdopodobnie objawi się ponownymi transmisjami TCP, co wskazuje na problemy ze sprzętem/konfiguracją. (problemy z, kartą sieciową, przełącznikiem itp.) Jak widać na danych wyjściowych 

sar -n ETCP 1

Który daje wynik jako:

 Linux 3.10.0-693.5.2.el7.x86_64 (SIO-DCOE-96O-3)        12/13/2017      _x86_64_        (48 CPU)

04:33:44 PM  atmptf/s  estres/s retrans/s isegerr/s   orsts/s
04:33:45 PM      0.00      0.00     50.00      0.00      0.00
04:33:46 PM      2.00      0.00     75.00      0.00      0.00
04:33:47 PM      0.00      0.00    223.00      0.00      0.00
04:33:48 PM      0.00      0.00    106.00      0.00      0.00
04:33:49 PM      2.00      0.00     58.00      0.00      0.00
04:33:50 PM      0.00      0.00      5.00      0.00      0.00
04:33:51 PM      0.00      0.00      7.00      0.00      0.00
04:33:52 PM      2.00      0.00      2.00      0.00      0.00
04:33:53 PM      0.00      0.00      1.00      0.00      0.00
^C

04:33:53 PM      0.00      0.00      0.00      0.00      0.00
Average:         0.65      0.00     99.00      0.00      0.00

Materiały referencyjne:

  • Zielony = pojedyncze cyfry/s
  • Żółty = wysokie dwucyfrowe wartości do 50/s
  • Czerwony = >50/s

B-W przypadku starszych dystrybucji Linuksa, takich jak SusE 11 SP3 na naszych SVM, można monitorować retransmisje sieciowe za pomocą następującego polecenia:

watch -d -n 2 "netstat -s |grep retrans"

Który wyświetla dane wyjściowe jak poniżej, wyróżniając znaki, które zostały zaktualizowane w ostatnim interwale:

Every 2.0s: netstat -s |grep retrans                                                                                                                                                   Wed Dec 13 09:55:10 2017

    1244070 segments retransmited

2- Problemy z procesorem, głód procesu.
Objawia się to jednoczesną pauzą w śladach każdego komponentu SIO, z wieloma gniazdami zamykającymi się jako pierwsze linie w śladzie po wznowieniu. 
Plik LIA, SDS, MDM/TB, SDC/messages pokazuje lukę.
Na przykład ślad LIA pokazuje gniazda LIA→SDS zamykające się po upływie 3 s (30 iteracji x 100 ms):

11/11 16:52:11.597227 0x7f44c41c6eb0:netPath_IsKaNeeded:01858:  :: Connected Live SERVER path 0x7f44c4195690 of portal 0x7f44c4192bb0 net 0x83b040 socket 8 inflights 0 didn't receive message for 30 iterations from 127.0.0.1:43228. Marking as down
11/11 16:52:12.031195 0x7f44c419eeb0:liaNet_DisconnectedNotif:01553: Con aed disconnected
11/11 16:52:12.158383 0x7f44c419eeb0:liaNet_ConnectedNotif:01483: Con aed  connected

3- Może mamy błąd gdzieś w SIO. Prawdopodobnie wątek niesieciowy wstrzymuje procesor i nie pozwala na uruchomienie czegoś innego itp.

Resolution

Obejście problemu

Brak ogólnego obejścia problemu

Wersje, których dotyczy problem

Wszystko

Naprawiono w wersji

Nie dotyczy 

Produse afectate

PowerFlex Software, VxFlex Product Family, VxFlex Ready Node, Ready Node Series
Proprietăți articol
Article Number: 000203040
Article Type: Solution
Ultima modificare: 15 mai 2026
Version:  5
Găsiți răspunsuri la întrebările dvs. de la alți utilizatori Dell
Servicii de asistență
Verificați dacă dispozitivul dvs. este acoperit de serviciile de asistență.