PowerFlex 3.x: vTree-siirto voi aiheuttaa SDS-kaatumisen tai jumiutumisen

요약: PowerFlex 3.6.7:ää käyttävät SDS-solmut saattavat kaatua vTree-siirron aikana ja aiheuttaa DU-tapahtuman (Data Unavailability). Aiemmissa PowerFlex-versioissa siirtoprosessi saattaa juuttua loputtomiin eikä sitä suoriteta loppuun. ...

이 문서는 다음에 적용됩니다. 이 문서는 다음에 적용되지 않습니다. 이 문서는 특정 제품과 관련이 없습니다. 모든 제품 버전이 이 문서에 나와 있는 것은 아닙니다.

증상

PowerFlex-versiossa 3.6.7 ajoitetun vTree-siirron aikana useat SDS:t -paniikkia, jolloin järjestelmä siirtyy tietojen käytettävyystilaan.

Siirtoviiveiden seurauksena tallennusvarannon (SP) kapasiteetin kulutus kasvaa nopeasti ja voi saavuttaa täyden käyttöasteen lyhyessä ajassa.

MDM-tapahtumat:

2026-06-30 07:27:19.340 SDS_DECOUPLED ERROR SDS: SDS11 (id: 64cb920800000006) decoupled.
2026-06-30 07:27:19.465 MDM_DATA_DEGRADED ERROR The system is now in DEGRADED state
....
2026-06-30 07:32:20.638 SDS_DECOUPLED ERROR SDS: SDS9 (id: 64cb920b00000009) decoupled.
2026-06-30 07:32:20.638 SDS_DECOUPLED ERROR SDS: SDS12 (id: 64cb920a00000008) decoupled.
2026-06-30 07:32:21.842 MDM_DATA_FAILED CRITICAL The system is now in DATA FAILURE state. Some data is unavailable
...
2026-06-30 07:32:23.538 DEV_CAPACITY_USAGE_CRITICAL ERROR Capacity usage on Protection Domain PD1, Storage Pool FGSP_01 is CRITICAL.
2026-06-30 07:32:23.605 DEV_CAPACITY_USAGE_FULL ERROR Capacity usage on Protection Domain PD1, Storage Pool FGSP_02 is FULL.

Kaikkien kyseisten SDS-solmujen jäljityslokit tuottavat saman panic stack -jäljityksen:

2026/07/01 17:45:33.506630 Panic in file /data/build/workspace/ScaleIO-Common-Job/src/mos/mos_timer.c, line 437, function mosTimerReq_AddByQ, PID 1291427.Panic Expression pReq->state == MOS_TIMER_REQ_STATE__IDLE .
/opt/emc/scaleio/sds/bin/sds-3.6.7000.123(mosDbg_PanicPrepare+0xe5) [0x932ce5]
/opt/emc/scaleio/sds/bin/sds-3.6.7000.123(mosTimerReq_AddByQ+0x143) [0x917043]
/opt/emc/scaleio/sds/bin/sds-3.6.7000.123(vaeCleaner_CleanVae+0x64) [0x668904]
/opt/emc/scaleio/sds/bin/sds-3.6.7000.123(head_removeVae+0x170) [0x545e00]
/opt/emc/scaleio/sds/bin/sds-3.6.7000.123(head_Update+0x373) [0x546363]
/opt/emc/scaleio/sds/bin/sds-3.6.7000.123(contHead_UpdateFull+0x69) [0x4db689]
/opt/emc/scaleio/sds/bin/sds-3.6.7000.123(contCmd_AddHead+0x18a) [0x60d85a]
/opt/emc/scaleio/sds/bin/sds-3.6.7000.123(contCmd_AddHeadGroup+0x100) [0x61b630]
/opt/emc/scaleio/sds/bin/sds-3.6.7000.123(contCmd_NewRequest+0x15fd) [0x62b96d]
/opt/emc/scaleio/sds/bin/sds-3.6.7000.123(contNet_RecvRequest+0xd0) [0x4ce880]

PowerFlex 3.6.7:ää vanhemmissa versioissa siirto jumittuu ajoitetun vTree-siirron aikana eikä sitä koskaan suoriteta loppuun.

PowerFlex Manager -käyttöliittymässä > Tallennustöiden suorittaminen näyttää tekstin Ladataan loputtomasti:

Tallennustöitä suoritettaessa näkyy loputon lataus

query_vtree_migration tuloste näyttää, että edistymisprosentti ei muutu koskaan:

scli --query_vtree_migration --volume_id 53b80e00000000d1
VTree ID: ba46bf57000000d1 Name: PDC-GC-LNX-N-01-PFSP01-01-V043
    Storage Pool 5f2f4acc00000000 Name: PDC-FLEX-LNX-SP01
    Protection Domain 908ff43700000000 Name: PDC-FLEX-LNX-PD01
    Data layout: Medium granularity
    Provisioning: Thin
    Total capacity in use: 504.7 GB (516787 MB)
    Total user data: 504.7 GB (516787 MB)
            Total base user data: 504.7 GB (516787 MB)
            Total snapshots user data: 0 Bytes
    VTree migration info:
            Migration status: Migrating
            Source:      Storage Pool: PDC-FLEX-LNX-SP01 ID: 5f2f4acc00000000 Protection Domain: PDC-FLEX-LNX-PD01 ID: 908ff43700000000
            Destination: Storage Pool: PDC-FLEX-LNX-SP03 ID: 5f2fe70d00000004 Protection Domain: PDC-FLEX-LNX-PD03 ID: 9090907800000003
            Conversion type: No conversion
            Queue position: 1
            Progress percentage : 34%

Vaikutus

Versiota 3.6.7 vanhemmissa versioissa aseman siirto ei lopu koskaan, tallennussuoritinkapasiteetin käyttöaste on kriittinen tai sitä suurempi, ja sovelluksissa saattaa ilmetä I/O-virheitä.

Versiossa 3.6.7 tiedot eivät ole käytettävissä.

원인

Tämä ongelma johtuu monisäikeisestä kilpailutilanteesta, johon liittyy jaettu ajastinmekanismi tilavuuden varauselementin (VAE) puhdistuskomponentissa taltion siirtotoimintojen aikana.

PowerFlex 3.6.7 -versiota edeltävissä versioissa tiedot poistettiin vanhoista tallennussuoritinsijainneista siirron jälkeen asynkronisella puhdistusprosessilla. Harvoissa olosuhteissa, kuten samanaikaisissa levyaseman hallintatoiminnoissa, samanaikaisissa asemien poistoissa, suuressa I/O-kuormituksessa tai verkon epävakaudessa, tämä prosessi saattaa kokea kilpailutilanteen, joka saa siirrot näyttämään jumiutuneilta loputtomiin.

Tämän korjaamiseksi versiossa 3.6.7 otettiin käyttöön parannettu seurantamekanismi. Tässä turvamekanismissa oli ajastin, joka oli suunniteltu havaitsemaan juuttunut UAE-puhdistuslanka ja paniikki SDS-palvelu ennakoivasti tietojen vioittumisen tai pitkittyneiden pysähtymisten estämiseksi, samalla tavalla kuin järjestelmä käsittelee juuttuneita I/O- tai MDM-komentoja.

Tämän korjauksen ensimmäisessä toteutuksessa valvonta-ajastin alustettiin kuitenkin vain kerran siirtotietojen rakentamisen aikana, ja se jaettiin maailmanlaajuisesti kaikissa myöhemmissä UAE Cleaner -kutsuissa. Kun useat taustasäikeet yrittävät käyttää tätä yhtä jaettua ajastinta samanaikaisesti raskaiden siirtokuormitusten aikana, uusi kilpailutilanne käynnistyy. Tämä samanaikainen käyttö aiheuttaa sen, että seurantamekanismi merkitsee UAE-puhdistimen virheellisesti jumiin, mikä johtaa tahattomiin SDS-palvelun kaatumisiin ja paikallisiin häiriöihin tietojen saatavuudessa, mikä johtaa tietojen käytettävyyteen.

해결

Pysyvä korjaus (suositus)

Päivitä klusteri PowerFlex 3.6.7.1:een tai uudempaan. Korjaus sekä UAE-puhdistimen että ajastimen kilpailuolosuhteisiin on mukana.


Vaihtoehtoinen menetelmä (jos päivitystä ei voi tehdä heti)

Versiota 3.6.7 vanhemmat versiot

  1. Siirry ensisijaisessa MDM:ssä jäljityslokihakemistoon, joka sijaitsee osoitteessa /opt/emc/scaleio/mdm/logs/. Voit etsiä nykyisen jäljityslokin suorittamalla komennon ls -ltr, joten uusin trc.z.* Loki näkyy luettelon lopussa.
  2. Koska lokit on pakattu, käytä trace_decompress Apuohjelma sijaitsee osoitteessa /opt/emc/scaleio/mdm/bin/
    tail -f <current_trace_log> | /opt/emc/scaleio/mdm/bin/trace_decompress
    1. SDS-tunnuksen suodatus (esimerkiksi TGT) -merkinnät. Korosta grep Etsi-komento:
    tail -f <current_trace_log> | /opt/emc/scaleio/mdm/bin/trace_decompress | grep volumeBlock_HandleQueryCleanVaeResponse
    1. Tunnista TGT. Etsi suodatetusta tuloksesta seuraavanlaisia viivoja:
    TGT 41a903f100000036 not done yet

    Jos TGT Tunnus pysyy samana ajan mittaan, se vastaa todennäköisesti mukana olevaa SDS-solmua. Tarkista uudelleen vaihe 3 varmistaaksesi, että toiminta on yhdenmukaista.

    1. Näytä luettelo kaikista SDS-solmuista ja anna vastine TGT Tunnus, jossa SDS-nimi/IP-osoite:
    scli --query_all_sds
    1. Kun sinulla on tarvittavat tiedot, voit SSH kyseiseen SDS:ään ja käynnistä SDS-palvelu uudelleen suorittamalla:
    pkill sds

    Versiossa 3.6.7

    • Sarjoita aseman hallintatoimintoja – suorita vain yksi poisto, koon muutos tai siirto kerralla.
    • Vähennä niiden suojaustoimialueiden I/O-kuormitusta, joita asia koskee, siirtojen aikana.
    • Vältä vTree-joukkosiirtoja; Erä ne pienissä ryhmissä.
    • Älä keskeytä tai peruuta siirtoa, kun verkko näyttää epävakaalta.

    Nämä toimet pienentävät ajastimen samanaikaisen käytön todennäköisyyttä ja vähentävät siten paniikkitapauksia.


    Versiot, joita ongelma koskee

    PowerFlex Core 3.x.x.x

    Korjattu versiossa

    PowerFlex Core 3.6.7.1

    해당 제품

    PowerFlex rack, ScaleIO
    문서 속성
    문서 번호: 000488725
    문서 유형: Solution
    마지막 수정 시간: 24 7월 2026
    버전:  2
    다른 Dell 사용자에게 질문에 대한 답변 찾기
    지원 서비스
    디바이스에 지원 서비스가 적용되는지 확인하십시오.