PowerFlex SDS закриває розетки без проблем із мережею

Summary: SDS повідомляє про закриті сокети без будь-яких мережевих подій або ознак проблем з мережею.

Acest articol se aplică pentru Acest articol nu se aplică pentru Acest articol nu este legat de un produs specific. Acest articol nu acoperă toate versiunile de produs existente.

Symptoms

Сценарій
SDS повідомляє про наявність сокетів, закритих віддаленими процесами (SDC, SDS, MDM), і жодних спостережуваних подій аварійного відключення NIC, пропущених кадрів або втрати пакетів. 

Симптоми
Журнал подій повідомляє про втрату з'єднання SDS, від'єднання або повторне підключення: 

2017-11-11 16:52:12.101 SDS_RECONNECTED           INFO     	 SDS: xyz_d35 (ID 67211111110089) reconnected 
2017-11-11 16:52:13.690 MDM_DATA_FAILED           CRITICAL 	 The system is now in DATA FAILURE state. Some data is unavailable. 
2017-11-11 16:52:15.791 MDM_DATA_DEGRADED         ERROR    	 The system is now in DEGRADED state. 

Перед цим ми бачимо помилки, подібні до наведених нижче в трасуванні SDS.

SDS спробувала відправити, і відповідь зайняла >1 секунду:

11/11 16:52:04.527408 0x7ff0b19eaeb0:contNet_OscillationNotif:01720: Con 672cb111110099 - Oscillation of type 5 (RPC_LINGERED_1SEC) reported

Розетка з піром була закрита з іншого боку через відсутність надходження від нас відправлення нижчого рівня:

11/11 16:52:06.241105 0x7ff0b19e1eb0:contNet_OscillationNotif:01720: Con a71d2b5d00000078 - Oscillation of type 1 (SOCKET_DOWN) reported 

Інший приклад цього виглядає так:

11/11 16:52:06.241224 0x7ff0b19e1eb0:contNet_OscillationNotif:01720: Con a71d2b3c00000057 - Oscillation of type 2 (IO_ERROR) reported

Інші показники:
Ітерації
Мережевий таймер підтримки працездатності нижчого рівня ScaleIO вимірюється в ітераціях, які тривають 100 мілісекунд.

Тайм-аут MDM-SDS> становить 20 ітерацій або 2 секунди, тоді як тайм-аут підтримки MDM-MDM становить 3 ітерації або 300 мс.

Двадцять ітерацій перевищили:

11/11 16:52:11.685281 0x7ff752d1beb0:netPath_IsKaNeeded:01858:  :: Connected Live CLIENT path 0x7ff6e2192a00 of portal 0x7ff6e2192900 net 0x7ff7480e1110 socket 210 inflights 0 didn't receive message for 20 iterations from 10.124.162.109:7072. Marking as down  

Sockets down Ці відбитки слідів вказують, коли розетки вийшли з ладу:

11/11 16:52:09.787793 0x7ff752cf7eb0:tgtMgr_TgtOscCB:07696: Con 672cba7400000089 Network address 10.124.130.109 - Oscillation of type SOCKET_DOWN reported

11/11 16:52:11.685290 0x7ff752d1beb0:tgtMgr_TgtOscCB:07696: Con 672cba7400000089 Network address 10.124.162.109 - Oscillation of type RCV_KA_DISCONNECT reported
11/11 16:52:11.685308 0x7ff752cf7eb0:tgtMgr_TgtOscCB:07696: Con 672cba7400000089 Network address 10.124.162.109 - Oscillation of type SOCKET_DOWN reported

Цей відбиток означає, що останній роз'єм на SDS вийшов з ладу і є точкою, в якій SDS вважається відключеним:

11/11 16:52:11.685319 0x7ff752cf7eb0:tgtMgr_TgtDisconnectCB:07818: Tgt: 672cba7400000089 ConId: 672cba7400000089

MDM віддасть команду addmdm, щоб змусити SDS повторно підключитися. 

Блокування несправності
вводу-виводу Ми знаємо, що IO_FAULT_BLOCKED відбувається, коли SDS відмовляється від вводу-виводу, оскільки не може дістатися до MDM, але ця інформація неповна.

SDS надсилає пам'ятні дані до MDM щосекунди, і якщо MDM не отримує цього протягом 5 секунд, SDS вважається тимчасовим проміжком і позначається як розв'язане.

Щосекунди MDM надсилає SDS повідомлення «продовжувати працювати». Саме коли СДС не отримує це повідомлення протягом 5 с, вона відмовляється від ІО з IO_FAULT_BLOCKED: 

11/11 16:52:12.007045 0x7ff0b0cdfeb0:ioh_NewRequest:05490: Write to comb f778038007f - Done rc is IO_FAULT_BLOCKED (Lba 6721528 8), volume 6e1a2f4a0000075d (dit)
11/11 16:52:12.008825 0x7ff0b0ec5eb0:ioh_NewRequest:05490: Write to comb f78803903fc - Done rc is IO_FAULT_BLOCKED (Lba 5031040 6), volume 6e1a2f4c0000075f (dit)
11/11 16:52:12.017262 0x7ff0b26daeb0:ioh_NewRequest:05490: Write to comb f768037003e - Done rc is IO_FAULT_BLOCKED (Lba 15106144 16), volume 6e1a2f490000075c (dit)

 

Вплив

Втрата з'єднання SDS

Під час data_degraded стану або режиму миттєвого обслуговування це може спричинити DU.

Cause

Причина збою вводу-виводу в цьому прикладі полягала в тому, що (5 с) оренди SDS не закінчився, але (2 с) тайм-аут мережі нижчого рівня закінчився.

Першопричиною є одна або кілька з наступних причин: 

1- Проблеми
з TCP/мережею A- Це, ймовірно, проявиться при повторній передачі TCP, що вказує на проблеми з апаратним забезпеченням/конфігурацією. (Проблеми з кабелем, NIC, комутатором тощо) як видно з виводу 

sar -n ETCP 1

Який виводить як:

 Linux 3.10.0-693.5.2.el7.x86_64 (SIO-DCOE-96O-3)        12/13/2017      _x86_64_        (48 CPU)

04:33:44 PM  atmptf/s  estres/s retrans/s isegerr/s   orsts/s
04:33:45 PM      0.00      0.00     50.00      0.00      0.00
04:33:46 PM      2.00      0.00     75.00      0.00      0.00
04:33:47 PM      0.00      0.00    223.00      0.00      0.00
04:33:48 PM      0.00      0.00    106.00      0.00      0.00
04:33:49 PM      2.00      0.00     58.00      0.00      0.00
04:33:50 PM      0.00      0.00      5.00      0.00      0.00
04:33:51 PM      0.00      0.00      7.00      0.00      0.00
04:33:52 PM      2.00      0.00      2.00      0.00      0.00
04:33:53 PM      0.00      0.00      1.00      0.00      0.00
^C

04:33:53 PM      0.00      0.00      0.00      0.00      0.00
Average:         0.65      0.00     99.00      0.00      0.00

Довідково:

  • Зелений = однозначні цифри/с
  • Жовтий = високі двозначні цифри до 50/с
  • Червоний = >50/с

B-У випадку старих дистрибутивів Linux, таких як SusE 11 SP3 на наших SVM, можна відстежувати повторну передачу мережі за допомогою наступної команди:

watch -d -n 2 "netstat -s |grep retrans"

Який виводить, як показано нижче, виділяючи символи, які оновлювалися протягом останнього інтервалу:

Every 2.0s: netstat -s |grep retrans                                                                                                                                                   Wed Dec 13 09:55:10 2017

    1244070 segments retransmited

2- Проблеми з процесором, голодування процесу.
Це проявляється у вигляді одночасної паузи в трасах кожного компонента SIO, з безліччю сокетів, що закриваються як перші рядки в трасуванні після відновлення. 
Файл LIA, SDS, MDM/TB, SDC/messages показує прогалину.
Трасування LIA, наприклад, показує закриття сокетів LIA→SDS після тайм-ауту 3 с (30 ітерацій x 100 мс):

11/11 16:52:11.597227 0x7f44c41c6eb0:netPath_IsKaNeeded:01858:  :: Connected Live SERVER path 0x7f44c4195690 of portal 0x7f44c4192bb0 net 0x83b040 socket 8 inflights 0 didn't receive message for 30 iterations from 127.0.0.1:43228. Marking as down
11/11 16:52:12.031195 0x7f44c419eeb0:liaNet_DisconnectedNotif:01553: Con aed disconnected
11/11 16:52:12.158383 0x7f44c419eeb0:liaNet_ConnectedNotif:01483: Con aed  connected

3- Можливо, у нас десь у SIO є баг. Швидше за все, немережевий потік утримує процесор і не дозволяє працювати чомусь іншому тощо.

Resolution

Спосіб вирішення проблеми

Немає загального обхідного шляху

Версії, яких це стосується

Увесь

Виправлено у версії

Н/Д 

Produse afectate

PowerFlex Software, VxFlex Product Family, VxFlex Ready Node, Ready Node Series
Proprietăți articol
Article Number: 000203040
Article Type: Solution
Ultima modificare: 15 mai 2026
Version:  5
Găsiți răspunsuri la întrebările dvs. de la alți utilizatori Dell
Servicii de asistență
Verificați dacă dispozitivul dvs. este acoperit de serviciile de asistență.