PowerFlex: Проблема з апаратним забезпеченням DIMM спричиняє високе навантаження процесора та роз'єднання SDS

Summary: Записи в журналі повідомляють про виправлені помилки від Dual In-line memory module (DIMM) та CMCI storm messages, що призводить до завантаження процесора, що гальмує SDS, підвищує затримку та роз'єднує SDS. ...

This article applies to This article does not apply to This article is not tied to any specific product. Not all product versions are identified in this article.

Symptoms

Опис випуску 

Певні проблеми з пам'яттю (наприклад, проблеми з DIMM) можуть спричинити CMCI-бурі і, відповідно, роз'єднання SDS.

Сценарій

Ця конкретна проблема виникла через те, що операційна система не реагувала належним чином на рутинні кориговані сповіщення пам'яті.

Це також може траплятися, коли модуль RAM DIMM виходить з ладу на сервері, але інші апаратні проблеми можуть спричинити подібний сценарій. 

Ознаки

Відмову DIMM можна спостерігати в журналах iDrac або операційної системи, наприклад:

 kernel: {1}[Hardware Error]: Hardware error from APEI Generic Hardware Error Source: 4
 kernel: {1}[Hardware Error]: It has been corrected by h/w and requires no further action
 kernel: {1}[Hardware Error]: event severity: corrected
 kernel: {1}[Hardware Error]:  Error 0, type: corrected
 kernel: {1}[Hardware Error]:  fru_text: A1
 kernel: {1}[Hardware Error]:   section_type: memory error
 kernel: {1}[Hardware Error]:   error_status: 0x0000000000000400
 kernel: {1}[Hardware Error]:   physical_address: 0x0000000ad6a38ac0
 kernel: {1}[Hardware Error]:   node: 0 card: 0 module: 0 rank: 0 bank: 1 device: 1 row: 58311 column: 712
 kernel: {1}[Hardware Error]:   error_type: 13, scrub corrected error
 kernel: {1}[Hardware Error]:   DIMM location: not present. DMI handle: 0x0000
 kernel: {2}[Hardware Error]: Hardware error from APEI Generic Hardware Error Source: 65534
 kernel: {2}[Hardware Error]: It has been corrected by h/w and requires no further action
 kernel: {2}[Hardware Error]: event severity: corrected
 kernel: {2}[Hardware Error]:  Error 0, type: corrected
 kernel: {2}[Hardware Error]:   section type: unknown, xxxxxxxx-xxxx-xxxx-xxxx-000xxxxxxx1b
 kernel: {2}[Hardware Error]:  Error 1, type: corrected
 kernel: {2}[Hardware Error]:   section type: unknown, xxxxxxxx-xxxx-xxxx-xxxx-000xxxxxxx1b
 kernel: EDAC skx MC0: HANDLING MCE MEMORY ERROR
 kernel: EDAC skx MC0: CPU 0: Machine Check Event: 0x0 Bank 1: 0x940000000000009f
 kernel: EDAC skx MC0: TSC 0xcdaff277a3653a
 kernel: EDAC skx MC0: ADDR 0xad6a38ac0
 kernel: EDAC skx MC0: MISC 0x0
 kernel: EDAC skx MC0: PROCESSOR 0:0x50654 TIME 1669993821 SOCKET 0 APIC 0x0
 kernel: EDAC MC0: 0 CE memory read error on CPU_SrcID#0_MC#0_Chan#0_DIMM#0 (channel:0 slot:0 page:0xad6a38 offset:0xac0 grain:32 syndrome:0x0 -  err_code:0x0000:0x009f socket:0 imc:0 rank:0 bg:1 ba:1 row:0xe3c7 col:0x2c8)
 kernel: mce: [Hardware Error]: Machine check events logged
 mcelog: Hardware event. This is not a software error.
 mcelog: MCE 0
 mcelog: CPU 0 BANK 1 TSC cdaff277a3653a
 mcelog: ADDR ad6a38ac0
 mcelog: TIME 1669993821 Fri Dec  2 15:10:21 2022
 mcelog: MCG status:
 mcelog: MCi status:
 mcelog: Corrected error
 mcelog: Error enabled
 mcelog: MCi_ADDR register valid
 

Незабаром після виявлення апаратної проблеми повідомляється про шторм CMCI:

Dec  8 08:28:51 node01 kernel: CMCI storm detected: switching to poll mode
Dec  8 08:33:50 node01 kernel: CMCI storm subsided: switching to interrupt mode
(...)                
Dec 10 03:19:03 node01 kernel: CMCI storm subsided: switching to interrupt mode
Dec 10 03:19:03 node01 kernel: CMCI storm detected: switching to poll mode


Високе навантаження процесора може призвести до затримки SDS-процесу IO (що впливає на загальну затримку системи введення/виведення) або навіть від'єднання SDS від MDM. Якщо це трапляється під час триваючого ремонту або коли інший SDS має схожі проблеми, це може призвести до DU.

Cause

Процесори Intel можуть страждати від «бурі переривань» під час помилок DIMM. Згідно з Red Hat KB:

Починаючи з 45-нм процесора Intel 64, на якому CPUID DisplayFamily_DisplayModel як 06H_1AH, процесор може повідомляти інформацію про виправлені помилки машинної перевірки та надавати програмоване переривання для реагування програмного забезпечення на помилки MC, що розглядається як виправлене переривання машинної перевірки (CMCI). Апаратне забезпечення Intel може передавати переривання, коли рівень помилок перевищує програмований поріг. Якщо помилка зберігається, процесор отримує постійний наплив або шквал переривань з достатньою частотою, що це впливає на здатність процесора виконувати корисну роботу. Коли це відбувається, ядро вимикає механізм CMCI і повертається до більш класичного підходу — регулярного опитування помилок машинної перевірки. Коли рівень помилок зменшується, ядро знову вмикає CMCI.

Детальніше дивіться на: Постійне журналування помилок «ядро: CMCI storm shited» (Зовнішнє посилання)
 

Ця проблема може спричинити шторм CMCI, який також може бути спровокований функціями та програмним забезпеченням ОС, що перехоплюють виправні помилки замість того, щоб дозволити їх фіксувати та обробляти Dell iDRAC. Зазвичай це відбувається, коли увімкнено і EDAC, і CMCI.

 

Resolution

Переведіть уражений SDS у режим обслуговування та/або видаліть його з кластера, щоб зменшити вплив на всю систему.

Зв'яжіться з виробником апаратного забезпечення для перевірки на наявність можливих проблем із апаратним забезпеченням. Якщо апаратна проблема не виявлена, особливо у випадку виправних помилок, зверніться до виробника ОС і попросіть допомоги з вимкненням EDAC і CMCI. 

Additional Information

Версії, на які це вплинуло

Н/Д - не проблема PowerFlex

Виправлено у версії

Н/Д - апаратна проблема

Affected Products

PowerFlex rack, VxFlex Ready Nodes, ScaleIO
Article Properties
Article Number: 000197735
Article Type: Solution
Last Modified: 20 Jul 2026
Version:  8
Find answers to your questions from other Dell users
Support Services
Check if your device is covered by Support Services.