PowerFlex 3.x: vTree Geçişi, SDS Panik Durumuna veya Askıda Kalmaya Neden Olabilir

요약: vTree geçişi sırasında, PowerFlex 3.6.7 çalıştıran SDS düğümleri panik durumuna geçebilir ve bu da veri noksanlığı (DU) olayına neden olabilir. Önceki PowerFlex sürümlerinde, geçiş işlemi süresiz takılabilir ve tamamlanamayabilir. ...

이 문서는 다음에 적용됩니다. 이 문서는 다음에 적용되지 않습니다. 이 문서는 특정 제품과 관련이 없습니다. 모든 제품 버전이 이 문서에 나와 있는 것은 아닙니다.

증상

PowerFlex sürüm 3.6.7'de, planlanmış bir vTree geçişi sırasında birden çok SDS panik durumuna geçerek sistemin veri noksanlığına girmesine neden olur.

Geçiş gecikmelerinin bir sonucu olarak, Depolama Havuzu (SP) kapasite tüketimi hızla artar ve kısa bir süre içinde tam kullanıma ulaşabilir.

MDM olayları:

2026-06-30 07:27:19.340 SDS_DECOUPLED ERROR SDS: SDS11 (id: 64cb920800000006) decoupled.
2026-06-30 07:27:19.465 MDM_DATA_DEGRADED ERROR The system is now in DEGRADED state
....
2026-06-30 07:32:20.638 SDS_DECOUPLED ERROR SDS: SDS9 (id: 64cb920b00000009) decoupled.
2026-06-30 07:32:20.638 SDS_DECOUPLED ERROR SDS: SDS12 (id: 64cb920a00000008) decoupled.
2026-06-30 07:32:21.842 MDM_DATA_FAILED CRITICAL The system is now in DATA FAILURE state. Some data is unavailable
...
2026-06-30 07:32:23.538 DEV_CAPACITY_USAGE_CRITICAL ERROR Capacity usage on Protection Domain PD1, Storage Pool FGSP_01 is CRITICAL.
2026-06-30 07:32:23.605 DEV_CAPACITY_USAGE_FULL ERROR Capacity usage on Protection Domain PD1, Storage Pool FGSP_02 is FULL.

Etkilenen tüm SDS düğümlerindeki izleme günlükleri aynı panik yığını izlemesini üretir:

2026/07/01 17:45:33.506630 Panic in file /data/build/workspace/ScaleIO-Common-Job/src/mos/mos_timer.c, line 437, function mosTimerReq_AddByQ, PID 1291427.Panic Expression pReq->state == MOS_TIMER_REQ_STATE__IDLE .
/opt/emc/scaleio/sds/bin/sds-3.6.7000.123(mosDbg_PanicPrepare+0xe5) [0x932ce5]
/opt/emc/scaleio/sds/bin/sds-3.6.7000.123(mosTimerReq_AddByQ+0x143) [0x917043]
/opt/emc/scaleio/sds/bin/sds-3.6.7000.123(vaeCleaner_CleanVae+0x64) [0x668904]
/opt/emc/scaleio/sds/bin/sds-3.6.7000.123(head_removeVae+0x170) [0x545e00]
/opt/emc/scaleio/sds/bin/sds-3.6.7000.123(head_Update+0x373) [0x546363]
/opt/emc/scaleio/sds/bin/sds-3.6.7000.123(contHead_UpdateFull+0x69) [0x4db689]
/opt/emc/scaleio/sds/bin/sds-3.6.7000.123(contCmd_AddHead+0x18a) [0x60d85a]
/opt/emc/scaleio/sds/bin/sds-3.6.7000.123(contCmd_AddHeadGroup+0x100) [0x61b630]
/opt/emc/scaleio/sds/bin/sds-3.6.7000.123(contCmd_NewRequest+0x15fd) [0x62b96d]
/opt/emc/scaleio/sds/bin/sds-3.6.7000.123(contNet_RecvRequest+0xd0) [0x4ce880]

3.6.7'den önceki PowerFlex sürümlerinde, planlanmış bir vTree geçişi sırasında geçiş ilerlemesi askıda kalıyor ve hiçbir zaman tamamlanmıyor.

PowerFlex Manager kullanıcı arayüzü > Running Storage Jobs (Depolama İşlerini Çalıştırırken) kısmında Loading endlessly (Sonsuz Yükleme yapılıyor) ifadesi gösterilir:

Depolama İşleri Çalıştırıldığında Sonsuz Yükleme gösteriyor

query_vtree_migration Çıktı, İlerleme yüzdesinin hiç değişmediğini gösterir:

scli --query_vtree_migration --volume_id 53b80e00000000d1
VTree ID: ba46bf57000000d1 Name: PDC-GC-LNX-N-01-PFSP01-01-V043
    Storage Pool 5f2f4acc00000000 Name: PDC-FLEX-LNX-SP01
    Protection Domain 908ff43700000000 Name: PDC-FLEX-LNX-PD01
    Data layout: Medium granularity
    Provisioning: Thin
    Total capacity in use: 504.7 GB (516787 MB)
    Total user data: 504.7 GB (516787 MB)
            Total base user data: 504.7 GB (516787 MB)
            Total snapshots user data: 0 Bytes
    VTree migration info:
            Migration status: Migrating
            Source:      Storage Pool: PDC-FLEX-LNX-SP01 ID: 5f2f4acc00000000 Protection Domain: PDC-FLEX-LNX-PD01 ID: 908ff43700000000
            Destination: Storage Pool: PDC-FLEX-LNX-SP03 ID: 5f2fe70d00000004 Protection Domain: PDC-FLEX-LNX-PD03 ID: 9090907800000003
            Conversion type: No conversion
            Queue position: 1
            Progress percentage : 34%

Etki

3.6.7'den önceki sürümlerde birim geçişi hiçbir zaman sona ermez, SP kapasite kullanımı kritik veya daha yüksektir ve uygulamalarda G/Ç hataları olabilir.

3.6.7 sürümünde ise veri noksanlığı.

원인

Bu sorun, disk bölümü geçişi işlemleri sırasında Disk Bölümü Ayırma Öğesi (VAE) temizleyici bileşeninde paylaşılan bir zamanlayıcı mekanizması içeren çok iş parçacıklı yarış koşulundan kaynaklanır.

3.6.7'den önceki PowerFlex sürümlerinde, geçişten sonra eski SP konumlarından veri silmek için zaman uyumsuz bir temizleme işlemi kullanılıyordu. Eşzamanlı disk bölümü yönetimi işlemleri, eşzamanlı disk bölümü silmeleri, yüksek G/Ç yükü veya ağ kararsızlığı gibi nadir koşullarda bu işlem, geçişlerin süresiz olarak takılı kalmasına neden olan bir yarış durumuyla karşılaşabilir.

Bu sorunu çözmek için 3.6.7 sürümünde gelişmiş bir izleme mekanizması kullanıma sunulmuştur. Bu güvenlik mekanizması, sıkışmış bir VAE temizleyici iş parçacığını algılamak ve sistemin sıkışmış G/Ç veya MDM komutlarını işleme şekline benzer şekilde veri bozulmasını veya uzun süreli duraklamaları önlemek için SDS hizmetini proaktif olarak paniklemek üzere tasarlanmış bir zamanlayıcıya sahipti.

Ancak, bu düzeltmenin ilk uygulamasında, izleme zamanlayıcısı geçiş verileri oluşturma sırasında yalnızca bir kez başlatıldı ve sonraki tüm VAE temizleyici çağrılarında genel olarak paylaşıldı. Ağır geçiş iş yükleri sırasında birden çok arka plan iş parçacığı bu tek paylaşılan zamanlayıcıya aynı anda erişmeye çalıştığında yeni bir yarış koşulu tetiklenir. Bu eşzamanlı erişim, izleme mekanizmasının VAE temizleyicisini yanlış bir şekilde sıkışmış olarak işaretlemesine neden olur, bu da istenmeyen SDS hizmet çökmelerine ve veri kullanılabilirliğinde yerelleştirilmiş kesintiye neden olarak verilerin kullanılamamasına neden olur.

해결

Kalıcı düzeltme (önerilen)

Kümeyi PowerFlex 3.6.7.1 veya sonraki bir sürüme yükseltin. Hem VAE temizleyici hem de zamanlayıcı yarış koşulları için düzeltme dahildir.


Geçici çözüm (yükseltme hemen gerçekleştirilemezse)

3.6.7'den önceki sürümlerde

  1. Birincil MDM'de, şu adreste bulunan izleme günlükleri dizinine gidin: /opt/emc/scaleio/mdm/logs/. Geçerli izleme günlüğünü bulmak için şunu çalıştırın: ls -ltr, yani en son trc.z.* Günlük, listenin en altında listelenir.
  2. Günlükler sıkıştırıldığından, trace_decompress Yardımcı program şu adreste bulunur: /opt/emc/scaleio/mdm/bin/
    tail -f <current_trace_log> | /opt/emc/scaleio/mdm/bin/trace_decompress
    1. SDS Kimliği Filtresi (örneğin, TGT) girdileri. Benzersiz ve güçlü bir parola yazmak için grep Bulmak için komut:
    tail -f <current_trace_log> | /opt/emc/scaleio/mdm/bin/trace_decompress | grep volumeBlock_HandleQueryCleanVaeResponse
    1. Tanımlayın TGT. Filtrelenmiş çıktıda aşağıdakine benzer satırlar olup olmadığını kontrol edin:
    TGT 41a903f100000036 not done yet

    Etkinleştirici TGT Kimlik zaman içinde tutarlı kalır ve muhtemelen ilgili SDS düğümüne karşılık gelir. Tutarlılığını koruduğunu onaylamak için 3. adımı yeniden çalıştırın.

    1. Tüm SDS düğümlerini listelemek ve düğümlerini eşleştirmek için aşağıdaki komutu çalıştırın: TGT SDS adı/IP adresi ile kimlik:
    scli --query_all_sds
    1. Gerekli bilgilere sahip olduğunuzda, şunları yapabilirsiniz: SSH bu SDS'ye gidin ve aşağıdakileri çalıştırarak SDS hizmetini yeniden başlatın:
    pkill sds

    Sürüm 3.6.7'de

    • Seri hale getirme disk bölümü yönetimi işlemleri - bir kerede yalnızca bir silme, yeniden boyutlandırma veya geçiş çalıştırın.
    • Geçişler devam ederken etkilenen Koruma Etki Alanları üzerindeki G/Ç yükünü azaltın.
    • Toplu vTree geçişlerinden kaçının; Bunları küçük gruplar halinde gruplandırın.
    • Ağ kararsızlık gösterdiğinde geçişi duraklatmayın veya iptal etmeyin.

    Bu eylemler eşzamanlı zamanlayıcı kullanımı olasılığını düşürür ve böylece panik oluşumlarını azaltır.


    Etkilenen Sürümler

    PowerFlex Core 3.x.x.x

    Düzeltildiği Sürüm

    PowerFlex Core 3.6.7.1

    해당 제품

    PowerFlex rack, ScaleIO
    문서 속성
    문서 번호: 000488725
    문서 유형: Solution
    마지막 수정 시간: 24 7월 2026
    버전:  2
    다른 Dell 사용자에게 질문에 대한 답변 찾기
    지원 서비스
    디바이스에 지원 서비스가 적용되는지 확인하십시오.