PowerScale: OneFS 업그레이드 후 간헐적인 레이턴시 또는 노드 패닉이 발생할 수 있습니다.

Zusammenfassung: OneFS 9.10.1.7, 9.13.0.1, 9.13.0.2 또는 9.13.1.0으로 업그레이드한 후 BUF_TIMELOCK 또는 BTL(Journal Buffer Transaction Lock) 드레인과 함께 PowerScale 노드 패닉이 간헐적으로 재부팅됩니다. 클라이언트는 중단 덤프와의 간헐적인 잠금 경합으로 인해 대기 시간이 발생할 수 있습니다. ...

Dieser Artikel gilt für Dieser Artikel gilt nicht für Dieser Artikel ist nicht an ein bestimmtes Produkt gebunden. In diesem Artikel werden nicht alle Produktversionen aufgeführt.

Symptome

다음 증상 중 하나 이상이 나타날 수 있습니다.

  1. 다음 항목 중 하나와 유사한 문자열로 표시되는 하나 이상의 PowerScale 노드 패닉이 발생합니다. /var/log/messages파일로 교체합니다.
panic @ time 1778169056.246, thread 0xfffffe8ec0574100: Journal BTL drain on buf 0xfffffe8143e0c038 failed due to timeout. BTL was held by transaction (5:5143063721) [0xfffffe8efdbd3a40] tracking: getblk_core

panic @ time 1778435497.146, thread 0xfffffe98692b3000: BUF_TIMELOCK: Waited more than 300 seconds for lock on 0xfffffe82c3b03ea8 (lock access type: 0x89900; wmesg: getblk) -- lockinfo: lock state: EXCL (recursed 0), held by: 0xffffff1e8e18b000; buf_track: jt_flush_block extrainfos: (0: td: 0x0; flags: 200200; time: 4108081318; 1: td: 0x0; flags: 201200; time: 676860600; 2: td: 0x0; flags: 201200; time: 676860439); ext_fields: (b_ext = 0xfffffe82c3b04240; b_trans_item: 0xfffff82333d71de0; b_shadow_item: 0x0; b_ifs_type: 2; b_source_baddr: 2cade5b7000e0029); vnode: 0xfffff80a562026a8; ldnum: 14; disk: 0xfffff80509c67800 da2; iosched: (total_inqueue: 41820; total_inprog: 18; bio_in_prog: 18);

panic @ time 1777739689.534, thread 0xfffffe9dff52bb00: BUF_TIMELOCK: Waited more than 240 seconds for lock on 0xfffffe837d0e17b0 (lock access type: 0x89900; wmesg: getblk) -- lockinfo: lock state: EXCL (recursed 0), held by: 0xfffffffffffffff0; buf_track: biodone extrainfos: (0: td: 0x0; flags: 200200; time: 3583726706; 1: td: 0x0; flags: 201200; time: 2710420770; 2: td: 0x0; flags: 201200; time: 1737195872); ext_fields: (b_ext = 0xfffffe837d0e1b48; b_trans_item: 0x0; b_shadow_item: 0x0; b_ifs_type: 0; b_source_baddr: 660d66b900020002); geom bio fields: (bp->b_bio: 0xfffff8325b43dce8;  bio_cmd: 2; bio_tdflags: 0; bio_disk: 0x0);

 

  1. 스레드 대기 중으로 인한 경합 잠금 txn_i_commit 이는 잠재적으로 클라이언트 대기 시간을 유발할 수 있습니다.
    Dell 지원 부서는 모든 사항을 분석하고 hangdumps 이 증상을 확인합니다.
     
  2. 에서 영향을 받는 노드에 있는 하나 이상의 드라이브에서 높은 디스크 대기열 /var/log/vmlog.
    예:
Drive  Type  OpsIn  BytesIn  OpsOut  BytesOut  TimeAvg  TimeInQ  Queued  Busy
------------------------------------------------------------------------------
. . .
 2:20   SAS  330.7    11.4M    18.7    284.0k    2.2ms    2.9ms   624.9 76.3

Ursache

잦은 플러시로 인해 디스크가 응답하지 않는 새로 확인된 문제입니다.

영향을 받는 버전:
다음과 같은 정확한 버전만 영향을 받습니다.

  • OneFS 9.10.1.7
  • OneFS 9.13.0.1
  • OneFS 9.13.0.2
  • OneFS 9.13.1.0

이러한 버전 이전과 이후의 OneFS 릴리스는 영향을 받지 않습니다.

Lösung

해결:
영향을 받는 릴리스 중 하나로 업그레이드할 계획이라면 업그레이드 전에 이 해결 방법을 사전 예방적으로 적용하십시오.

이 해결 방법은 영향을 받는 버전으로 업그레이드한 후에도 적용할 수 있습니다.

특히 메모리가 96GB 이하인 A 클래스 노드의 경우 2026년 6월 3일부터 해결 방법 값이 증가했습니다.

를 늘립니다. sysctl vfs.dirtybufthresh 전체 nodes local sysctl.conf 단일 노드에서 다음 단계를 수행하여 파일을 정리합니다.

  1. 모든 노드의 /etc/local/sysctl.conf 에서 2026년 6월 3일 이전에 이 문서 업데이트에 따라 적용되는 경우 해결 방법을 주석 처리합니다. 이렇게 하려면 다음을 실행합니다.

isi_for_array "sed -i '' 's/^vfs.dirtybufthresh/#vfs.dirtybufthresh/g' /etc/local/sysctl.conf "

 

  1.  모든 노드의 /etc/local/sysctl.conf 에 새로 업데이트된 해결 방법을 적용합니다.
     이렇게 하려면 다음을 실행합니다.

isi_for_array -s 'echo "vfs.dirtybufthresh=$((16 * (`sysctl -n kern.nbuf` / 2 + 20) * 9 / 10 ))" >> /etc/local/sysctl.conf'

위의 명령은 모든 노드의 /etc/local/sysctl.conf 에 다음 줄을 추가합니다.
vfs.dirtybufthresh=<value_for_specific_node>


위의 해결 방법은 규정 준수 클러스터에는 적용되지 않습니다.
규정 준수 클러스터의 고정 코드 버전으로 업그레이드하는 것이 좋습니다.

영구 해결책:
엔지니어링 팀은 향후 OneFS 릴리스에서 영구적인 솔루션을 계획하고 있습니다.
이러한 릴리스를 사용할 수 있을 때까지 /etc/local/sysctl.conf에 설정된 해결 방법 값을 유지합니다.

Betroffene Produkte

PowerScale OneFS
Artikeleigenschaften
Artikelnummer: 000464795
Artikeltyp: Solution
Zuletzt geändert: 27 Juli 2026
Version:  8
Antworten auf Ihre Fragen erhalten Sie von anderen Dell NutzerInnen
Support Services
Prüfen Sie, ob Ihr Gerät durch Support Services abgedeckt ist.