PowerScale:OneFSのアップグレード後に、断続的なレイテンシーまたはノード パニックによる再起動が発生する可能性がある

Zusammenfassung: OneFS 9.10.1.7、9.13.0.1、9.13.0.2、9.13.1.0にアップグレードした後、PowerScaleノードのパニックが断続的に再起動し、BUF_TIMELOCKまたはジャーナル バッファー トランザクション ロック(BTL)ドレインが発生します。 ハングダンプとの断続的なロック競合により、クライアントでレイテンシーが発生する可能性があります。 ...

Dieser Artikel gilt für Dieser Artikel gilt nicht für Dieser Artikel ist nicht an ein bestimmtes Produkt gebunden. In diesem Artikel werden nicht alle Produktversionen aufgeführt.

Symptome

次の現象のうち1つ以上が発生する可能性があります。

  1. 1つ以上のPowerScaleノードで、次のような文字列でパニックが発生します。 /var/log/messagesファイルに置き換えます。
panic @ time 1778169056.246, thread 0xfffffe8ec0574100: Journal BTL drain on buf 0xfffffe8143e0c038 failed due to timeout. BTL was held by transaction (5:5143063721) [0xfffffe8efdbd3a40] tracking: getblk_core

panic @ time 1778435497.146, thread 0xfffffe98692b3000: BUF_TIMELOCK: Waited more than 300 seconds for lock on 0xfffffe82c3b03ea8 (lock access type: 0x89900; wmesg: getblk) -- lockinfo: lock state: EXCL (recursed 0), held by: 0xffffff1e8e18b000; buf_track: jt_flush_block extrainfos: (0: td: 0x0; flags: 200200; time: 4108081318; 1: td: 0x0; flags: 201200; time: 676860600; 2: td: 0x0; flags: 201200; time: 676860439); ext_fields: (b_ext = 0xfffffe82c3b04240; b_trans_item: 0xfffff82333d71de0; b_shadow_item: 0x0; b_ifs_type: 2; b_source_baddr: 2cade5b7000e0029); vnode: 0xfffff80a562026a8; ldnum: 14; disk: 0xfffff80509c67800 da2; iosched: (total_inqueue: 41820; total_inprog: 18; bio_in_prog: 18);

panic @ time 1777739689.534, thread 0xfffffe9dff52bb00: BUF_TIMELOCK: Waited more than 240 seconds for lock on 0xfffffe837d0e17b0 (lock access type: 0x89900; wmesg: getblk) -- lockinfo: lock state: EXCL (recursed 0), held by: 0xfffffffffffffff0; buf_track: biodone extrainfos: (0: td: 0x0; flags: 200200; time: 3583726706; 1: td: 0x0; flags: 201200; time: 2710420770; 2: td: 0x0; flags: 201200; time: 1737195872); ext_fields: (b_ext = 0xfffffe837d0e1b48; b_trans_item: 0x0; b_shadow_item: 0x0; b_ifs_type: 0; b_source_baddr: 660d66b900020002); geom bio fields: (bp->b_bio: 0xfffff8325b43dce8;  bio_cmd: 2; bio_tdflags: 0; bio_disk: 0x0);

 

  1. 次を待機しているスレッドによるロック競合 txn_i_commit これにより、クライアントのレイテンシーが発生する可能性があります。
    Dellサポートは hangdumps をクリックして、この現象を確認します。
     
  2. の影響を受けるノード上の1つ以上のドライブでディスク キューが高くなっています /var/log/vmlogの詳細を確認してください。
    例:
Drive  Type  OpsIn  BytesIn  OpsOut  BytesOut  TimeAvg  TimeInQ  Queued  Busy
------------------------------------------------------------------------------
. . .
 2:20   SAS  330.7    11.4M    18.7    284.0k    2.2ms    2.9ms   624.9 76.3

Ursache

これは新たに確認された問題で、頻繁にフラッシュするとディスクが応答しなくなります。

影響を受けるバージョン:
影響を受けるのは、次の正確なバージョンのみです。

  • OneFS 9.10.1.7
  • OneFS 9.13.0.1
  • OneFS 9.13.0.2
  • OneFS 9.13.1.0

これらのバージョンの前後のOneFSリリースは影響を受けません。

Lösung

回避策:
影響を受けるリリースのいずれかへのアップグレードを計画している場合は、アップグレードの前にこの回避策をプロアクティブに適用してください。

この回避策は、影響を受けるバージョンにアップグレードした後にも適用できます。

この回避策の値は、2026年6月3日以降、特に96 GB以下のメモリーを搭載したAクラス ノードで増加しています。

[ sysctl vfs.dirtybufthresh すべて nodes local sysctl.conf 任意の単一ノードから次の手順を実行してファイルを作成します。

  1. すべてのノードの /etc/local/sysctl.conf で、2026年6月3日より前のこの記事のアップデートに従って回避策が適用されている場合は、回避策をコメント アウトします。これを行うには、次のコマンドを実行します。

isi_for_array "sed -i '' 's/^vfs.dirtybufthresh/#vfs.dirtybufthresh/g' /etc/local/sysctl.conf "

 

  1.  すべてのノードの /etc/local/sysctl.conf で、この新しい更新された回避策を適用します。
    これを行うには、次のコマンドを実行します。

isi_for_array -s 'echo "vfs.dirtybufthresh=$((16 * (`sysctl -n kern.nbuf` / 2 + 20) * 9 / 10 ))" >> /etc/local/sysctl.conf'

上記のコマンドを実行すると、すべてのノードの /etc/local/sysctl.conf に次の行が追加されます。
vfs.dirtybufthresh=<value_for_specific_node>


上記の回避策は、コンプライアンス クラスターには適用されません。
コンプライアンス クラスターについては、修正済みコード バージョンにアップグレードすることをお勧めします。

恒久的な解決策:
エンジニアリング チームは、将来のOneFSリリースで永続的なソリューションを計画しています。
これらのリリースが利用可能になるまで、回避策の値は /etc/local/sysctl.conf に設定されたままにしてください。

Betroffene Produkte

PowerScale OneFS
Artikeleigenschaften
Artikelnummer: 000464795
Artikeltyp: Solution
Zuletzt geändert: 27 Juli 2026
Version:  8
Antworten auf Ihre Fragen erhalten Sie von anderen Dell NutzerInnen
Support Services
Prüfen Sie, ob Ihr Gerät durch Support Services abgedeckt ist.