PowerFlex 3.x: vTree-siirto voi aiheuttaa SDS-kaatumisen tai jumiutumisen
요약: PowerFlex 3.6.7:ää käyttävät SDS-solmut saattavat kaatua vTree-siirron aikana ja aiheuttaa DU-tapahtuman (Data Unavailability). Aiemmissa PowerFlex-versioissa siirtoprosessi saattaa juuttua loputtomiin eikä sitä suoriteta loppuun. ...
증상
PowerFlex-versiossa 3.6.7 ajoitetun vTree-siirron aikana useat SDS:t -paniikkia, jolloin järjestelmä siirtyy tietojen käytettävyystilaan.
Siirtoviiveiden seurauksena tallennusvarannon (SP) kapasiteetin kulutus kasvaa nopeasti ja voi saavuttaa täyden käyttöasteen lyhyessä ajassa.
MDM-tapahtumat:
2026-06-30 07:27:19.340 SDS_DECOUPLED ERROR SDS: SDS11 (id: 64cb920800000006) decoupled. 2026-06-30 07:27:19.465 MDM_DATA_DEGRADED ERROR The system is now in DEGRADED state .... 2026-06-30 07:32:20.638 SDS_DECOUPLED ERROR SDS: SDS9 (id: 64cb920b00000009) decoupled. 2026-06-30 07:32:20.638 SDS_DECOUPLED ERROR SDS: SDS12 (id: 64cb920a00000008) decoupled. 2026-06-30 07:32:21.842 MDM_DATA_FAILED CRITICAL The system is now in DATA FAILURE state. Some data is unavailable ... 2026-06-30 07:32:23.538 DEV_CAPACITY_USAGE_CRITICAL ERROR Capacity usage on Protection Domain PD1, Storage Pool FGSP_01 is CRITICAL. 2026-06-30 07:32:23.605 DEV_CAPACITY_USAGE_FULL ERROR Capacity usage on Protection Domain PD1, Storage Pool FGSP_02 is FULL.
Kaikkien kyseisten SDS-solmujen jäljityslokit tuottavat saman panic stack -jäljityksen:
2026/07/01 17:45:33.506630 Panic in file /data/build/workspace/ScaleIO-Common-Job/src/mos/mos_timer.c, line 437, function mosTimerReq_AddByQ, PID 1291427.Panic Expression pReq->state == MOS_TIMER_REQ_STATE__IDLE . /opt/emc/scaleio/sds/bin/sds-3.6.7000.123(mosDbg_PanicPrepare+0xe5) [0x932ce5] /opt/emc/scaleio/sds/bin/sds-3.6.7000.123(mosTimerReq_AddByQ+0x143) [0x917043] /opt/emc/scaleio/sds/bin/sds-3.6.7000.123(vaeCleaner_CleanVae+0x64) [0x668904] /opt/emc/scaleio/sds/bin/sds-3.6.7000.123(head_removeVae+0x170) [0x545e00] /opt/emc/scaleio/sds/bin/sds-3.6.7000.123(head_Update+0x373) [0x546363] /opt/emc/scaleio/sds/bin/sds-3.6.7000.123(contHead_UpdateFull+0x69) [0x4db689] /opt/emc/scaleio/sds/bin/sds-3.6.7000.123(contCmd_AddHead+0x18a) [0x60d85a] /opt/emc/scaleio/sds/bin/sds-3.6.7000.123(contCmd_AddHeadGroup+0x100) [0x61b630] /opt/emc/scaleio/sds/bin/sds-3.6.7000.123(contCmd_NewRequest+0x15fd) [0x62b96d] /opt/emc/scaleio/sds/bin/sds-3.6.7000.123(contNet_RecvRequest+0xd0) [0x4ce880]
PowerFlex 3.6.7:ää vanhemmissa versioissa siirto jumittuu ajoitetun vTree-siirron aikana eikä sitä koskaan suoriteta loppuun.
PowerFlex Manager -käyttöliittymässä > Tallennustöiden suorittaminen näyttää tekstin Ladataan loputtomasti:

query_vtree_migration tuloste näyttää, että edistymisprosentti ei muutu koskaan:
scli --query_vtree_migration --volume_id 53b80e00000000d1
VTree ID: ba46bf57000000d1 Name: PDC-GC-LNX-N-01-PFSP01-01-V043
Storage Pool 5f2f4acc00000000 Name: PDC-FLEX-LNX-SP01
Protection Domain 908ff43700000000 Name: PDC-FLEX-LNX-PD01
Data layout: Medium granularity
Provisioning: Thin
Total capacity in use: 504.7 GB (516787 MB)
Total user data: 504.7 GB (516787 MB)
Total base user data: 504.7 GB (516787 MB)
Total snapshots user data: 0 Bytes
VTree migration info:
Migration status: Migrating
Source: Storage Pool: PDC-FLEX-LNX-SP01 ID: 5f2f4acc00000000 Protection Domain: PDC-FLEX-LNX-PD01 ID: 908ff43700000000
Destination: Storage Pool: PDC-FLEX-LNX-SP03 ID: 5f2fe70d00000004 Protection Domain: PDC-FLEX-LNX-PD03 ID: 9090907800000003
Conversion type: No conversion
Queue position: 1
Progress percentage : 34%
Vaikutus
Versiota 3.6.7 vanhemmissa versioissa aseman siirto ei lopu koskaan, tallennussuoritinkapasiteetin käyttöaste on kriittinen tai sitä suurempi, ja sovelluksissa saattaa ilmetä I/O-virheitä.
Versiossa 3.6.7 tiedot eivät ole käytettävissä.
원인
Tämä ongelma johtuu monisäikeisestä kilpailutilanteesta, johon liittyy jaettu ajastinmekanismi tilavuuden varauselementin (VAE) puhdistuskomponentissa taltion siirtotoimintojen aikana.
PowerFlex 3.6.7 -versiota edeltävissä versioissa tiedot poistettiin vanhoista tallennussuoritinsijainneista siirron jälkeen asynkronisella puhdistusprosessilla. Harvoissa olosuhteissa, kuten samanaikaisissa levyaseman hallintatoiminnoissa, samanaikaisissa asemien poistoissa, suuressa I/O-kuormituksessa tai verkon epävakaudessa, tämä prosessi saattaa kokea kilpailutilanteen, joka saa siirrot näyttämään jumiutuneilta loputtomiin.
Tämän korjaamiseksi versiossa 3.6.7 otettiin käyttöön parannettu seurantamekanismi. Tässä turvamekanismissa oli ajastin, joka oli suunniteltu havaitsemaan juuttunut UAE-puhdistuslanka ja paniikki SDS-palvelu ennakoivasti tietojen vioittumisen tai pitkittyneiden pysähtymisten estämiseksi, samalla tavalla kuin järjestelmä käsittelee juuttuneita I/O- tai MDM-komentoja.
Tämän korjauksen ensimmäisessä toteutuksessa valvonta-ajastin alustettiin kuitenkin vain kerran siirtotietojen rakentamisen aikana, ja se jaettiin maailmanlaajuisesti kaikissa myöhemmissä UAE Cleaner -kutsuissa. Kun useat taustasäikeet yrittävät käyttää tätä yhtä jaettua ajastinta samanaikaisesti raskaiden siirtokuormitusten aikana, uusi kilpailutilanne käynnistyy. Tämä samanaikainen käyttö aiheuttaa sen, että seurantamekanismi merkitsee UAE-puhdistimen virheellisesti jumiin, mikä johtaa tahattomiin SDS-palvelun kaatumisiin ja paikallisiin häiriöihin tietojen saatavuudessa, mikä johtaa tietojen käytettävyyteen.
해결
Pysyvä korjaus (suositus)
Päivitä klusteri PowerFlex 3.6.7.1:een tai uudempaan. Korjaus sekä UAE-puhdistimen että ajastimen kilpailuolosuhteisiin on mukana.
Vaihtoehtoinen menetelmä (jos päivitystä ei voi tehdä heti)
Versiota 3.6.7 vanhemmat versiot
- Siirry ensisijaisessa MDM:ssä jäljityslokihakemistoon, joka sijaitsee osoitteessa
/opt/emc/scaleio/mdm/logs/. Voit etsiä nykyisen jäljityslokin suorittamalla komennonls -ltr, joten uusintrc.z.*Loki näkyy luettelon lopussa. - Koska lokit on pakattu, käytä
trace_decompressApuohjelma sijaitsee osoitteessa/opt/emc/scaleio/mdm/bin/
tail -f <current_trace_log> | /opt/emc/scaleio/mdm/bin/trace_decompress
- SDS-tunnuksen suodatus (esimerkiksi
TGT) -merkinnät. KorostagrepEtsi-komento:
tail -f <current_trace_log> | /opt/emc/scaleio/mdm/bin/trace_decompress | grep volumeBlock_HandleQueryCleanVaeResponse
- Tunnista
TGT. Etsi suodatetusta tuloksesta seuraavanlaisia viivoja:
TGT 41a903f100000036 not done yet
Jos TGT Tunnus pysyy samana ajan mittaan, se vastaa todennäköisesti mukana olevaa SDS-solmua. Tarkista uudelleen vaihe 3 varmistaaksesi, että toiminta on yhdenmukaista.
- Näytä luettelo kaikista SDS-solmuista ja anna vastine
TGTTunnus, jossa SDS-nimi/IP-osoite:
scli --query_all_sds
- Kun sinulla on tarvittavat tiedot, voit
SSHkyseiseen SDS:ään ja käynnistä SDS-palvelu uudelleen suorittamalla:
pkill sds
Versiossa 3.6.7
- Sarjoita aseman hallintatoimintoja – suorita vain yksi poisto, koon muutos tai siirto kerralla.
- Vähennä niiden suojaustoimialueiden I/O-kuormitusta, joita asia koskee, siirtojen aikana.
- Vältä vTree-joukkosiirtoja; Erä ne pienissä ryhmissä.
- Älä keskeytä tai peruuta siirtoa, kun verkko näyttää epävakaalta.
Nämä toimet pienentävät ajastimen samanaikaisen käytön todennäköisyyttä ja vähentävät siten paniikkitapauksia.
Versiot, joita ongelma koskee
PowerFlex Core 3.x.x.x
Korjattu versiossa
PowerFlex Core 3.6.7.1