PowerScale:OneFSのアップグレード後に、断続的なレイテンシーまたはノード パニックによる再起動が発生する可能性がある
Zusammenfassung: OneFS 9.10.1.7、9.13.0.1、9.13.0.2、9.13.1.0にアップグレードした後、PowerScaleノードのパニックが断続的に再起動し、BUF_TIMELOCKまたはジャーナル バッファー トランザクション ロック(BTL)ドレインが発生します。 ハングダンプとの断続的なロック競合により、クライアントでレイテンシーが発生する可能性があります。 ...
Symptome
次の現象のうち1つ以上が発生する可能性があります。
- 1つ以上のPowerScaleノードで、次のような文字列でパニックが発生します。
/var/log/messagesファイルに置き換えます。
panic @ time 1778169056.246, thread 0xfffffe8ec0574100: Journal BTL drain on buf 0xfffffe8143e0c038 failed due to timeout. BTL was held by transaction (5:5143063721) [0xfffffe8efdbd3a40] tracking: getblk_core panic @ time 1778435497.146, thread 0xfffffe98692b3000: BUF_TIMELOCK: Waited more than 300 seconds for lock on 0xfffffe82c3b03ea8 (lock access type: 0x89900; wmesg: getblk) -- lockinfo: lock state: EXCL (recursed 0), held by: 0xffffff1e8e18b000; buf_track: jt_flush_block extrainfos: (0: td: 0x0; flags: 200200; time: 4108081318; 1: td: 0x0; flags: 201200; time: 676860600; 2: td: 0x0; flags: 201200; time: 676860439); ext_fields: (b_ext = 0xfffffe82c3b04240; b_trans_item: 0xfffff82333d71de0; b_shadow_item: 0x0; b_ifs_type: 2; b_source_baddr: 2cade5b7000e0029); vnode: 0xfffff80a562026a8; ldnum: 14; disk: 0xfffff80509c67800 da2; iosched: (total_inqueue: 41820; total_inprog: 18; bio_in_prog: 18); panic @ time 1777739689.534, thread 0xfffffe9dff52bb00: BUF_TIMELOCK: Waited more than 240 seconds for lock on 0xfffffe837d0e17b0 (lock access type: 0x89900; wmesg: getblk) -- lockinfo: lock state: EXCL (recursed 0), held by: 0xfffffffffffffff0; buf_track: biodone extrainfos: (0: td: 0x0; flags: 200200; time: 3583726706; 1: td: 0x0; flags: 201200; time: 2710420770; 2: td: 0x0; flags: 201200; time: 1737195872); ext_fields: (b_ext = 0xfffffe837d0e1b48; b_trans_item: 0x0; b_shadow_item: 0x0; b_ifs_type: 0; b_source_baddr: 660d66b900020002); geom bio fields: (bp->b_bio: 0xfffff8325b43dce8; bio_cmd: 2; bio_tdflags: 0; bio_disk: 0x0);
- 次を待機しているスレッドによるロック競合
txn_i_commitこれにより、クライアントのレイテンシーが発生する可能性があります。
Dellサポートはhangdumpsをクリックして、この現象を確認します。
- の影響を受けるノード上の1つ以上のドライブでディスク キューが高くなっています
/var/log/vmlogの詳細を確認してください。
例:
Drive Type OpsIn BytesIn OpsOut BytesOut TimeAvg TimeInQ Queued Busy ------------------------------------------------------------------------------ . . . 2:20 SAS 330.7 11.4M 18.7 284.0k 2.2ms 2.9ms 624.9 76.3
Ursache
これは新たに確認された問題で、頻繁にフラッシュするとディスクが応答しなくなります。
影響を受けるバージョン:
影響を受けるのは、次の正確なバージョンのみです。
- OneFS 9.10.1.7
- OneFS 9.13.0.1
- OneFS 9.13.0.2
- OneFS 9.13.1.0
これらのバージョンの前後のOneFSリリースは影響を受けません。
Lösung
回避策:
影響を受けるリリースのいずれかへのアップグレードを計画している場合は、アップグレードの前にこの回避策をプロアクティブに適用してください。
この回避策は、影響を受けるバージョンにアップグレードした後にも適用できます。
この回避策の値は、2026年6月3日以降、特に96 GB以下のメモリーを搭載したAクラス ノードで増加しています。
[ sysctl vfs.dirtybufthresh すべて nodes local sysctl.conf 任意の単一ノードから次の手順を実行してファイルを作成します。
- すべてのノードの /etc/local/sysctl.conf で、2026年6月3日より前のこの記事のアップデートに従って回避策が適用されている場合は、回避策をコメント アウトします。これを行うには、次のコマンドを実行します。
isi_for_array "sed -i '' 's/^vfs.dirtybufthresh/#vfs.dirtybufthresh/g' /etc/local/sysctl.conf "
- すべてのノードの /etc/local/sysctl.conf で、この新しい更新された回避策を適用します。
これを行うには、次のコマンドを実行します。
isi_for_array -s 'echo "vfs.dirtybufthresh=$((16 * (`sysctl -n kern.nbuf` / 2 + 20) * 9 / 10 ))" >> /etc/local/sysctl.conf'
上記のコマンドを実行すると、すべてのノードの /etc/local/sysctl.conf に次の行が追加されます。
vfs.dirtybufthresh=<value_for_specific_node>
上記の回避策は、コンプライアンス クラスターには適用されません。
コンプライアンス クラスターについては、修正済みコード バージョンにアップグレードすることをお勧めします。
恒久的な解決策:
エンジニアリング チームは、将来のOneFSリリースで永続的なソリューションを計画しています。
これらのリリースが利用可能になるまで、回避策の値は /etc/local/sysctl.conf に設定されたままにしてください。