PowerFlex SDS Sockets sluiten zonder netwerkproblemen

Summary: SDS meldt dat sockets gesloten zijn zonder dat er sprake is van netwerkgebeurtenissen of aanwijzingen voor netwerkproblemen.

This article applies to This article does not apply to This article is not tied to any specific product. Not all product versions are identified in this article.

Symptoms

Scenario
SDS meldt dat sockets zijn gesloten door externe processen (SDC's, SDS'en, MDM's) en dat er geen NIC-downgebeurtenissen, afgebroken frames of pakketverlies zijn waargenomen. 

Symptomen
Gebeurtenissenlogboek meldt verlies van SDS-connectiviteit, ofwel ontkoppelen of opnieuw verbinden: 

2017-11-11 16:52:12.101 SDS_RECONNECTED           INFO     	 SDS: xyz_d35 (ID 67211111110089) reconnected 
2017-11-11 16:52:13.690 MDM_DATA_FAILED           CRITICAL 	 The system is now in DATA FAILURE state. Some data is unavailable. 
2017-11-11 16:52:15.791 MDM_DATA_DEGRADED         ERROR    	 The system is now in DEGRADED state. 

Daarvoor zien we fouten zoals de volgende in de SDS-traces.

De SDS probeerde te verzenden, en het duurde >1 seconde om te reageren:

11/11 16:52:04.527408 0x7ff0b19eaeb0:contNet_OscillationNotif:01720: Con 672cb111110099 - Oscillation of type 5 (RPC_LINGERED_1SEC) reported

Socket met een peer werd vanaf de andere kant gesloten vanwege het ontbreken van ontvangst van onze verzendende keepalives op een lager niveau:

11/11 16:52:06.241105 0x7ff0b19e1eb0:contNet_OscillationNotif:01720: Con a71d2b5d00000078 - Oscillation of type 1 (SOCKET_DOWN) reported 

Een ander voorbeeld hiervan ziet er als volgt uit:

11/11 16:52:06.241224 0x7ff0b19e1eb0:contNet_OscillationNotif:01720: Con a71d2b3c00000057 - Oscillation of type 2 (IO_ERROR) reported

Andere indicatoren:
Iteraties
ScaleIO's keepalive-timer op een lager niveau wordt gemeten in iteraties, die 100 milliseconden lang zijn.

MDM-SDS> time-out is 20 iteraties, of 2 s, terwijl de MDM-MDM keepalive time-out 3 iteraties of 300 ms is.

Twintig iteraties overschreden:

11/11 16:52:11.685281 0x7ff752d1beb0:netPath_IsKaNeeded:01858:  :: Connected Live CLIENT path 0x7ff6e2192a00 of portal 0x7ff6e2192900 net 0x7ff7480e1110 socket 210 inflights 0 didn't receive message for 20 iterations from 10.124.162.109:7072. Marking as down  

Stopcontacten naar beneden Deze sporenafdrukken geven aan wanneer de stopcontacten naar beneden zijn gegaan:

11/11 16:52:09.787793 0x7ff752cf7eb0:tgtMgr_TgtOscCB:07696: Con 672cba7400000089 Network address 10.124.130.109 - Oscillation of type SOCKET_DOWN reported

11/11 16:52:11.685290 0x7ff752d1beb0:tgtMgr_TgtOscCB:07696: Con 672cba7400000089 Network address 10.124.162.109 - Oscillation of type RCV_KA_DISCONNECT reported
11/11 16:52:11.685308 0x7ff752cf7eb0:tgtMgr_TgtOscCB:07696: Con 672cba7400000089 Network address 10.124.162.109 - Oscillation of type SOCKET_DOWN reported

Deze afdruk betekent dat de laatste socket naar een SDS is uitgevallen en is het punt waarop de SDS als losgekoppeld wordt beschouwd:

11/11 16:52:11.685319 0x7ff752cf7eb0:tgtMgr_TgtDisconnectCB:07818: Tgt: 672cba7400000089 ConId: 672cba7400000089

De MDM geeft een addmdm-opdracht om de SDS opnieuw verbinding te laten maken. 

IO-fout geblokkeerd
We weten dat er IO_FAULT_BLOCKED gebeurt wanneer de SDS IO weigert omdat deze het MDM niet kan bereiken, maar deze informatie is onvolledig.

De SDS stuurt elke seconde keepalives naar de MDM, en als de MDM dit gedurende 5 seconden niet krijgt, wordt de SDS beschouwd als een time-out en wordt deze gemarkeerd als ontkoppeld.

Het MDM stuurt de SDS elke seconde een bericht om te blijven werken. Het is wanneer de SDS dit bericht gedurende 5 seconden niet ontvangt, dat het IO weigert met IO_FAULT_BLOCKED: 

11/11 16:52:12.007045 0x7ff0b0cdfeb0:ioh_NewRequest:05490: Write to comb f778038007f - Done rc is IO_FAULT_BLOCKED (Lba 6721528 8), volume 6e1a2f4a0000075d (dit)
11/11 16:52:12.008825 0x7ff0b0ec5eb0:ioh_NewRequest:05490: Write to comb f78803903fc - Done rc is IO_FAULT_BLOCKED (Lba 5031040 6), volume 6e1a2f4c0000075f (dit)
11/11 16:52:12.017262 0x7ff0b26daeb0:ioh_NewRequest:05490: Write to comb f768037003e - Done rc is IO_FAULT_BLOCKED (Lba 15106144 16), volume 6e1a2f490000075c (dit)

 

Impact

Verlies van SDS-connectiviteit

Tijdens data_degraded status of Instant Maintenance-modus kan dit DU veroorzaken.

Cause

De oorzaak van de IO-fout in dit voorbeeldgeval was dat de SDS-lease (5 s) niet was verlopen, maar de (2 s) time-out van het netwerk op een lager niveau wel.

De oorzaak is een of meer van de volgende redenen: 

1- TCP/netwerkproblemen
A- Dit zal zich waarschijnlijk manifesteren met TCP-herverzendingen, wat HW/configuratieproblemen aangeeft. (Kabel, NIC, switchproblemen, enz.) zoals te zien is in de uitvoer van 

sar -n ETCP 1

Die wordt weergegeven als:

 Linux 3.10.0-693.5.2.el7.x86_64 (SIO-DCOE-96O-3)        12/13/2017      _x86_64_        (48 CPU)

04:33:44 PM  atmptf/s  estres/s retrans/s isegerr/s   orsts/s
04:33:45 PM      0.00      0.00     50.00      0.00      0.00
04:33:46 PM      2.00      0.00     75.00      0.00      0.00
04:33:47 PM      0.00      0.00    223.00      0.00      0.00
04:33:48 PM      0.00      0.00    106.00      0.00      0.00
04:33:49 PM      2.00      0.00     58.00      0.00      0.00
04:33:50 PM      0.00      0.00      5.00      0.00      0.00
04:33:51 PM      0.00      0.00      7.00      0.00      0.00
04:33:52 PM      2.00      0.00      2.00      0.00      0.00
04:33:53 PM      0.00      0.00      1.00      0.00      0.00
^C

04:33:53 PM      0.00      0.00      0.00      0.00      0.00
Average:         0.65      0.00     99.00      0.00      0.00

Ter referentie:

  • Groen = enkele cijfers/s
  • Geel = hoge dubbele cijfers tot 50/s
  • Rood = >50/s

B-In het geval van oudere Linux-distributies, zoals de SusE 11 SP3 op onze SVM's, kan men met de volgende opdracht controleren of het netwerk opnieuw wordt verzonden:

watch -d -n 2 "netstat -s |grep retrans"

Die wordt uitgevoerd zoals hieronder, met de nadruk op de tekens die tijdens het laatste interval zijn bijgewerkt:

Every 2.0s: netstat -s |grep retrans                                                                                                                                                   Wed Dec 13 09:55:10 2017

    1244070 segments retransmited

2- CPU-problemen, procesuithongering.
Dit manifesteert zich als een gelijktijdige pauze in de sporen van elke SIO-component, met veel sockets die sluiten als de eerste regels in de trace bij hervatting. 
LIA, SDS, MDM/TB, SDC/berichtenbestand toont de kloof.
LIA-tracering laat bijvoorbeeld zien dat LIA→SDS-sockets sluiten na een time-out van 3 s (30 iteraties x 100 ms):

11/11 16:52:11.597227 0x7f44c41c6eb0:netPath_IsKaNeeded:01858:  :: Connected Live SERVER path 0x7f44c4195690 of portal 0x7f44c4192bb0 net 0x83b040 socket 8 inflights 0 didn't receive message for 30 iterations from 127.0.0.1:43228. Marking as down
11/11 16:52:12.031195 0x7f44c419eeb0:liaNet_DisconnectedNotif:01553: Con aed disconnected
11/11 16:52:12.158383 0x7f44c419eeb0:liaNet_ConnectedNotif:01483: Con aed  connected

3- Misschien hebben we ergens in SIO een bug. Waarschijnlijk houdt een niet-netwerkthread een CPU vast en laat niet toe dat iets anders wordt uitgevoerd, enz.

Resolution

Tijdelijke oplossing

Geen algemene tijdelijke oplossing

Versies waarop dit van toepassing is

Alle

Opgelost in versie

N.v.t. 

Affected Products

PowerFlex Software, VxFlex Product Family, VxFlex Ready Node, Ready Node Series
Article Properties
Article Number: 000203040
Article Type: Solution
Last Modified: 15 مايو 2026
Version:  5
Find answers to your questions from other Dell users
Support Services
Check if your device is covered by Support Services.