PowerFlex SDS Stänga uttagen utan nätverksproblem

Summary: SDS rapporterar att socketar stängs utan några nätverkshändelser eller tecken på nätverksproblem.

This article applies to This article does not apply to This article is not tied to any specific product. Not all product versions are identified in this article.

Symptoms

Scenario
SDS rapporterar att socketar har stängts av fjärrprocesser (SDC:er, SDS:er, MDM:er) och inga observerade NIC-nedhändelser, tappade bildrutor eller paketförlust. 

Symtom
Händelseloggen rapporterar SDS-anslutningsförlust, antingen en frikoppling eller återanslutning: 

2017-11-11 16:52:12.101 SDS_RECONNECTED           INFO     	 SDS: xyz_d35 (ID 67211111110089) reconnected 
2017-11-11 16:52:13.690 MDM_DATA_FAILED           CRITICAL 	 The system is now in DATA FAILURE state. Some data is unavailable. 
2017-11-11 16:52:15.791 MDM_DATA_DEGRADED         ERROR    	 The system is now in DEGRADED state. 

Innan dess visas följande fel i SDS-spårningarna.

SDS försökte skicka, och det tog >1 sekund att svara:

11/11 16:52:04.527408 0x7ff0b19eaeb0:contNet_OscillationNotif:01720: Con 672cb111110099 - Oscillation of type 5 (RPC_LINGERED_1SEC) reported

Socket med en peer stängdes från andra sidan på grund av att de inte fick ta emot våra sändningar på lägre nivå:

11/11 16:52:06.241105 0x7ff0b19e1eb0:contNet_OscillationNotif:01720: Con a71d2b5d00000078 - Oscillation of type 1 (SOCKET_DOWN) reported 

Ett annat exempel på detta ser ut så här:

11/11 16:52:06.241224 0x7ff0b19e1eb0:contNet_OscillationNotif:01720: Con a71d2b3c00000057 - Oscillation of type 2 (IO_ERROR) reported

Andra indikatorer:
Iterationer
ScaleIO:s keepalive-timer för nätverk på lägre nivå mäts i iterationer, som är 100 millisekunder långa.

MDM-SDS-tidsgränsen> är 20 iterationer, eller 2 sekunder, medan MDM-MDM keepalive-tidsgränsen är 3 iterationer eller 300 ms.

Tjugo iterationer överskred:

11/11 16:52:11.685281 0x7ff752d1beb0:netPath_IsKaNeeded:01858:  :: Connected Live CLIENT path 0x7ff6e2192a00 of portal 0x7ff6e2192900 net 0x7ff7480e1110 socket 210 inflights 0 didn't receive message for 20 iterations from 10.124.162.109:7072. Marking as down  

Uttag nedåt Dessa spåravtryck anger när hylsorna gick ner:

11/11 16:52:09.787793 0x7ff752cf7eb0:tgtMgr_TgtOscCB:07696: Con 672cba7400000089 Network address 10.124.130.109 - Oscillation of type SOCKET_DOWN reported

11/11 16:52:11.685290 0x7ff752d1beb0:tgtMgr_TgtOscCB:07696: Con 672cba7400000089 Network address 10.124.162.109 - Oscillation of type RCV_KA_DISCONNECT reported
11/11 16:52:11.685308 0x7ff752cf7eb0:tgtMgr_TgtOscCB:07696: Con 672cba7400000089 Network address 10.124.162.109 - Oscillation of type SOCKET_DOWN reported

Det här trycket betyder att det sista uttaget till ett säkerhetsdatablad gick sönder och är den punkt där säkerhetsdatalagret anses vara frånkopplat:

11/11 16:52:11.685319 0x7ff752cf7eb0:tgtMgr_TgtDisconnectCB:07818: Tgt: 672cba7400000089 ConId: 672cba7400000089

MDM-enheten utfärdar ett addmdm-kommando för att få SDS att återansluta. 

IO-fel blockerat
Vi vet att IO_FAULT_BLOCKED händer när SDS nekar IO eftersom det inte kan nå MDM-enheten, men den här informationen är ofullständig.

SDS skickar keepalives till MDM varje sekund, och om MDM inte får detta på 5 s anses SDS ha överskridit tidsgränsen och markeras som frikopplad.

MDM skickar ett "fortsätt arbeta"-meddelande till SDS varje sekund. Det är när säkerhetsdatabladet inte får detta meddelande på 5 sekunder som det nekar IO med IO_FAULT_BLOCKED: 

11/11 16:52:12.007045 0x7ff0b0cdfeb0:ioh_NewRequest:05490: Write to comb f778038007f - Done rc is IO_FAULT_BLOCKED (Lba 6721528 8), volume 6e1a2f4a0000075d (dit)
11/11 16:52:12.008825 0x7ff0b0ec5eb0:ioh_NewRequest:05490: Write to comb f78803903fc - Done rc is IO_FAULT_BLOCKED (Lba 5031040 6), volume 6e1a2f4c0000075f (dit)
11/11 16:52:12.017262 0x7ff0b26daeb0:ioh_NewRequest:05490: Write to comb f768037003e - Done rc is IO_FAULT_BLOCKED (Lba 15106144 16), volume 6e1a2f490000075c (dit)

 

Påverkan

Förlust av SDS-anslutning

Under data_degraded läge eller Instant Maintenance Mode kan detta orsaka DU.

Cause

Orsaken till I/O-fel i det här exempelfallet var att SDS-lånet (5 s) inte hade upphört att gälla, men att nätverkstimeouten (2 s) på lägre nivå hade gjort det.

Rotorsaken är en eller flera av följande orsaker: 

1 – TCP-/nätverksproblem
S- Detta kommer sannolikt att visa sig med TCP-återsändningar, vilket indikerar maskinvaru-/konfigurationsproblem. (Kabel, NIC, switchproblem etc.) Som framgår av utdata från 

sar -n ETCP 1

Som matas ut som:

 Linux 3.10.0-693.5.2.el7.x86_64 (SIO-DCOE-96O-3)        12/13/2017      _x86_64_        (48 CPU)

04:33:44 PM  atmptf/s  estres/s retrans/s isegerr/s   orsts/s
04:33:45 PM      0.00      0.00     50.00      0.00      0.00
04:33:46 PM      2.00      0.00     75.00      0.00      0.00
04:33:47 PM      0.00      0.00    223.00      0.00      0.00
04:33:48 PM      0.00      0.00    106.00      0.00      0.00
04:33:49 PM      2.00      0.00     58.00      0.00      0.00
04:33:50 PM      0.00      0.00      5.00      0.00      0.00
04:33:51 PM      0.00      0.00      7.00      0.00      0.00
04:33:52 PM      2.00      0.00      2.00      0.00      0.00
04:33:53 PM      0.00      0.00      1.00      0.00      0.00
^C

04:33:53 PM      0.00      0.00      0.00      0.00      0.00
Average:         0.65      0.00     99.00      0.00      0.00

Som referens:

  • Grön = ensiffriga/s
  • Gul = höga tvåsiffriga tal upp till 50/s
  • Röd = >50/s

B-När det gäller äldre Linux-distributioner, till exempel SusE 11 SP3 på våra SVM:er, kan man övervaka om nätverket återsänder med följande kommando:

watch -d -n 2 "netstat -s |grep retrans"

Som matas ut enligt nedan, med markering av de tecken som uppdaterades under det senaste intervallet:

Every 2.0s: netstat -s |grep retrans                                                                                                                                                   Wed Dec 13 09:55:10 2017

    1244070 segments retransmited

2 – CPU-problem, processsvält.
Detta manifesteras som en samtidig paus i varje SIO-komponents spårningar, med massor av sockets som stängs som de första raderna i spårningen vid återupptagning. 
Filen LIA, SDS, MDM/TB, SDC/meddelanden visar gapet.
LIA-spårning visar till exempel LIA→SDS-socketar som stängs efter en tidsgräns på 3 s (30 iterationer x 100 ms):

11/11 16:52:11.597227 0x7f44c41c6eb0:netPath_IsKaNeeded:01858:  :: Connected Live SERVER path 0x7f44c4195690 of portal 0x7f44c4192bb0 net 0x83b040 socket 8 inflights 0 didn't receive message for 30 iterations from 127.0.0.1:43228. Marking as down
11/11 16:52:12.031195 0x7f44c419eeb0:liaNet_DisconnectedNotif:01553: Con aed disconnected
11/11 16:52:12.158383 0x7f44c419eeb0:liaNet_ConnectedNotif:01483: Con aed  connected

3- Kanske har vi en bugg någonstans i SIO. Troligen är det en icke-nätverkstråd som håller en CPU och inte tillåter att något annat körs, etc.

Resolution

Alternativ lösning

Ingen allmän lösning

Berörda versioner

Alla

Åtgärdat i version

Ej tillämpligt 

Affected Products

PowerFlex Software, VxFlex Product Family, VxFlex Ready Node, Ready Node Series
Article Properties
Article Number: 000203040
Article Type: Solution
Last Modified: 15 مايو 2026
Version:  5
Find answers to your questions from other Dell users
Support Services
Check if your device is covered by Support Services.