PowerScale: Potenziale latenza intermittente o riavvio con errore irreversibile del nodo dopo l'aggiornamento di OneFS

Zusammenfassung: L'errore irreversibile del nodo PowerScale si riavvia in modo intermittente con BUF_TIMELOCK o perdita BTL (Journal Buffer Transaction Lock) dopo l'aggiornamento a OneFS 9.10.1.7, 9.13.0.1, 9.13.0.2 o 9.13.1.0. I client potrebbero potenzialmente riscontrare latenza a causa di un conflitto di blocco intermittente con hangdump. ...

Dieser Artikel gilt für Dieser Artikel gilt nicht für Dieser Artikel ist nicht an ein bestimmtes Produkt gebunden. In diesem Artikel werden nicht alle Produktversionen aufgeführt.

Symptome

È possibile notare uno o più dei seguenti sintomi:

  1. Uno o più nodi PowerScale presentano un errore irreversibile con una stringa simile a una di queste in /var/log/messages:
panic @ time 1778169056.246, thread 0xfffffe8ec0574100: Journal BTL drain on buf 0xfffffe8143e0c038 failed due to timeout. BTL was held by transaction (5:5143063721) [0xfffffe8efdbd3a40] tracking: getblk_core

panic @ time 1778435497.146, thread 0xfffffe98692b3000: BUF_TIMELOCK: Waited more than 300 seconds for lock on 0xfffffe82c3b03ea8 (lock access type: 0x89900; wmesg: getblk) -- lockinfo: lock state: EXCL (recursed 0), held by: 0xffffff1e8e18b000; buf_track: jt_flush_block extrainfos: (0: td: 0x0; flags: 200200; time: 4108081318; 1: td: 0x0; flags: 201200; time: 676860600; 2: td: 0x0; flags: 201200; time: 676860439); ext_fields: (b_ext = 0xfffffe82c3b04240; b_trans_item: 0xfffff82333d71de0; b_shadow_item: 0x0; b_ifs_type: 2; b_source_baddr: 2cade5b7000e0029); vnode: 0xfffff80a562026a8; ldnum: 14; disk: 0xfffff80509c67800 da2; iosched: (total_inqueue: 41820; total_inprog: 18; bio_in_prog: 18);

panic @ time 1777739689.534, thread 0xfffffe9dff52bb00: BUF_TIMELOCK: Waited more than 240 seconds for lock on 0xfffffe837d0e17b0 (lock access type: 0x89900; wmesg: getblk) -- lockinfo: lock state: EXCL (recursed 0), held by: 0xfffffffffffffff0; buf_track: biodone extrainfos: (0: td: 0x0; flags: 200200; time: 3583726706; 1: td: 0x0; flags: 201200; time: 2710420770; 2: td: 0x0; flags: 201200; time: 1737195872); ext_fields: (b_ext = 0xfffffe837d0e1b48; b_trans_item: 0x0; b_shadow_item: 0x0; b_ifs_type: 0; b_source_baddr: 660d66b900020002); geom bio fields: (bp->b_bio: 0xfffff8325b43dce8;  bio_cmd: 2; bio_tdflags: 0; bio_disk: 0x0);

 

  1. Conflitto di blocco a causa dell'attesa di thread txn_i_commit che potenzialmente potrebbe causare latenza del client.
    Il supporto Dell deve analizzare qualsiasi hangdumps per confermare questo sintomo.
     
  2. Coda elevata del disco su una o più unità sul nodo interessato in /var/log/vmlog.
    Ad esempio:
Drive  Type  OpsIn  BytesIn  OpsOut  BytesOut  TimeAvg  TimeInQ  Queued  Busy
------------------------------------------------------------------------------
. . .
 2:20   SAS  330.7    11.4M    18.7    284.0k    2.2ms    2.9ms   624.9 76.3

Ursache

Si tratta di un problema identificato di recente in cui gli scaricamenti frequenti causano la mancata risposta del disco.

Versioni interessate:
Sono interessate solo queste versioni esatte:

  • OneFS 9.10.1.7
  • OneFS 9.13.0.1
  • OneFS 9.13.0.2
  • OneFS 9.13.1.0

Le versioni di OneFS precedenti e successive a queste versioni non sono interessate.

Lösung

Soluzione:
Se si prevede di eseguire l'aggiornamento a una delle versioni interessate, applicare questa soluzione alternativa in modo proattivo prima dell'aggiornamento.

Questa soluzione alternativa può essere applicata anche dopo l'aggiornamento alle versioni interessate.

Il valore della soluzione alternativa è stato aumentato dal 03 giugno 2026, in particolare per i nodi di classe A con memoria di 96 GB o inferiore.

Aumentare il sysctl vfs.dirtybufthresh su tutti nodes local sysctl.conf File eseguendo questi passaggi da qualsiasi singolo nodo:

  1. Commentare qualsiasi soluzione alternativa se applicata in base agli aggiornamenti di questo articolo prima del 2026-June-03 in /etc/local/sysctl.conf su tutti i nodi. A tale scopo, eseguire:

isi_for_array "sed -i '' 's/^vfs.dirtybufthresh/#vfs.dirtybufthresh/g' /etc/local/sysctl.conf "

 

  1.  Applicare questa nuova soluzione alternativa aggiornata in /etc/local/sysctl.conf su tutti i nodi.
     A tale scopo, eseguire:

isi_for_array -s 'echo "vfs.dirtybufthresh=$((16 * (`sysctl -n kern.nbuf` / 2 + 20) * 9 / 10 ))" >> /etc/local/sysctl.conf'

Il comando precedente aggiunge la seguente riga a /etc/local/sysctl.conf su tutti i nodi:
vfs.dirtybufthresh=<value_for_specific_node>


La soluzione alternativa di cui sopra NON è applicabile per il cluster di conformità.
Si consiglia di eseguire l'aggiornamento alle versioni del codice fisso per il cluster di conformità.

Soluzione definitiva:
I tecnici stanno pianificando una soluzione permanente nelle versioni future di OneFS.
Fino a quando queste versioni non saranno disponibili, mantenere i valori della soluzione alternativa impostati in /etc/local/sysctl.conf.

Betroffene Produkte

PowerScale OneFS
Artikeleigenschaften
Artikelnummer: 000464795
Artikeltyp: Solution
Zuletzt geändert: 27 Juli 2026
Version:  8
Antworten auf Ihre Fragen erhalten Sie von anderen Dell NutzerInnen
Support Services
Prüfen Sie, ob Ihr Gerät durch Support Services abgedeckt ist.