PowerScale: Potenziell intermittierende Latenz oder Node-Panik-Neustart nach OneFS-Upgrade

Zusammenfassung: Nach dem Upgrade auf OneFS 9.10.1.7, 9.13.0.1, 9.13.0.2 oder 9.13.1.0 kommt es zeitweise zu einem Neustart des PowerScale-Node mit BUF_TIMELOCK BTL-Drain (Journal Buffer Transaction Lock). Bei Clients kann es aufgrund von zeitweiligen Sperrkonflikten mit Hangdumps zu Latenzzeiten kommen. ...

Dieser Artikel gilt für Dieser Artikel gilt nicht für Dieser Artikel ist nicht an ein bestimmtes Produkt gebunden. In diesem Artikel werden nicht alle Produktversionen aufgeführt.

Symptome

Eines oder mehrere der folgenden Symptome können festgestellt werden:

  1. Bei einem oder mehreren PowerScale-Nodes tritt ein Fehler mit einer Zeichenfolge aus, die einer der folgenden ähnelt: /var/log/messagesverwalten:
panic @ time 1778169056.246, thread 0xfffffe8ec0574100: Journal BTL drain on buf 0xfffffe8143e0c038 failed due to timeout. BTL was held by transaction (5:5143063721) [0xfffffe8efdbd3a40] tracking: getblk_core

panic @ time 1778435497.146, thread 0xfffffe98692b3000: BUF_TIMELOCK: Waited more than 300 seconds for lock on 0xfffffe82c3b03ea8 (lock access type: 0x89900; wmesg: getblk) -- lockinfo: lock state: EXCL (recursed 0), held by: 0xffffff1e8e18b000; buf_track: jt_flush_block extrainfos: (0: td: 0x0; flags: 200200; time: 4108081318; 1: td: 0x0; flags: 201200; time: 676860600; 2: td: 0x0; flags: 201200; time: 676860439); ext_fields: (b_ext = 0xfffffe82c3b04240; b_trans_item: 0xfffff82333d71de0; b_shadow_item: 0x0; b_ifs_type: 2; b_source_baddr: 2cade5b7000e0029); vnode: 0xfffff80a562026a8; ldnum: 14; disk: 0xfffff80509c67800 da2; iosched: (total_inqueue: 41820; total_inprog: 18; bio_in_prog: 18);

panic @ time 1777739689.534, thread 0xfffffe9dff52bb00: BUF_TIMELOCK: Waited more than 240 seconds for lock on 0xfffffe837d0e17b0 (lock access type: 0x89900; wmesg: getblk) -- lockinfo: lock state: EXCL (recursed 0), held by: 0xfffffffffffffff0; buf_track: biodone extrainfos: (0: td: 0x0; flags: 200200; time: 3583726706; 1: td: 0x0; flags: 201200; time: 2710420770; 2: td: 0x0; flags: 201200; time: 1737195872); ext_fields: (b_ext = 0xfffffe837d0e1b48; b_trans_item: 0x0; b_shadow_item: 0x0; b_ifs_type: 0; b_source_baddr: 660d66b900020002); geom bio fields: (bp->b_bio: 0xfffff8325b43dce8;  bio_cmd: 2; bio_tdflags: 0; bio_disk: 0x0);

 

  1. Sperrkonflikt aufgrund eines wartenden Threads auf txn_i_commit Dies kann möglicherweise zu Client-Latenz führen.
    Der Dell Support muss alle hangdumps , um dieses Symptom zu bestätigen.
     
  2. Hohe Festplattenwarteschlange auf einem oder mehreren Laufwerken auf dem betroffenen Node in /var/log/vmlog.
    Zum Beispiel:
Drive  Type  OpsIn  BytesIn  OpsOut  BytesOut  TimeAvg  TimeInQ  Queued  Busy
------------------------------------------------------------------------------
. . .
 2:20   SAS  330.7    11.4M    18.7    284.0k    2.2ms    2.9ms   624.9 76.3

Ursache

Hierbei handelt es sich um ein neu identifiziertes Problem, bei dem häufiges Leeren dazu führt, dass die Festplatte nicht mehr reagiert.

Betroffene Versionen:
Nur genau diese Versionen sind betroffen:

  • OneFS 9.10.1.7
  • OneFS 9.13.0.1
  • OneFS 9.13.0.2
  • OneFS 9.13.1.0

OneFS-Versionen vor und nach diesen Versionen sind nicht betroffen.

Lösung

Problemumgehung:
Wenn Sie ein Upgrade auf eine der betroffenen Versionen planen, wenden Sie diesen Workaround proaktiv vor dem Upgrade an.

Dieser Workaround kann auch nach dem Upgrade auf die betroffenen Versionen angewendet werden.

Der Wert für die Problemumgehung wurde seit dem 03. Juni 2026 erhöht, insbesondere für Nodes der A-Klasse mit 96 GB oder weniger Arbeitsspeicher.

Erhöhen Sie die sysctl vfs.dirtybufthresh auf allen nodes local sysctl.conf -Datei, indem Sie diese Schritte von einem beliebigen einzelnen Node aus ausführen:

  1. Kommentieren Sie jeden Workaround aus, wenn er gemäß diesem Artikel angewendet wird, der vor dem 03. Juni 2026 in /etc/local/sysctl.conf auf allen Nodes aktualisiert wird. Führen Sie dazu Folgendes aus:

isi_for_array "sed -i '' 's/^vfs.dirtybufthresh/#vfs.dirtybufthresh/g' /etc/local/sysctl.conf "

 

  1.  Wenden Sie diesen neuen, aktualisierten Workaround in /etc/local/sysctl.conf auf alle Nodes an.
     Führen Sie dazu Folgendes aus:

isi_for_array -s 'echo "vfs.dirtybufthresh=$((16 * (`sysctl -n kern.nbuf` / 2 + 20) * 9 / 10 ))" >> /etc/local/sysctl.conf'

Mit dem obigen Befehl wird die folgende Zeile zu /etc/local/sysctl.conf auf allen Nodes hinzugefügt:
vfs.dirtybufthresh=<value_for_specific_node>


Der obige Workaround gilt NICHT für Compliance-Cluster.
Es wird empfohlen, ein Upgrade auf die festen Codeversionen für Compliance-Cluster durchzuführen.

Dauerhafte Lösung:
Die technische Abteilung plant eine dauerhafte Lösung in zukünftigen OneFS-Versionen.
Bis diese Versionen verfügbar sind, lassen Sie die Workaround-Werte in /etc/local/sysctl.conf festgelegt.

Betroffene Produkte

PowerScale OneFS
Artikeleigenschaften
Artikelnummer: 000464795
Artikeltyp: Solution
Zuletzt geändert: 27 Juli 2026
Version:  8
Antworten auf Ihre Fragen erhalten Sie von anderen Dell NutzerInnen
Support Services
Prüfen Sie, ob Ihr Gerät durch Support Services abgedeckt ist.