PowerFlex 3.x: vTree 마이그레이션으로 인해 SDS 패닉 또는 중단이 발생할 수 있음

요약: vTree 마이그레이션 중에 PowerFlex 3.6.7을 실행하는 SDS 노드에 패닉이 발생하여 DU(Data Unavailability) 이벤트가 발생할 수 있습니다. 이전 PowerFlex 버전에서는 마이그레이션 프로세스가 무기한 중단되어 완료되지 않을 수 있습니다.

이 문서는 다음에 적용됩니다. 이 문서는 다음에 적용되지 않습니다. 이 문서는 특정 제품과 관련이 없습니다. 모든 제품 버전이 이 문서에 나와 있는 것은 아닙니다.

증상

PowerFlex 버전 3.6.7에서는 예약된 vTree 마이그레이션 중에 여러 SDS 패닉이 발생하여 시스템이 데이터 가용성 손실 상태가 됩니다.

마이그레이션 지연으로 인해 SP(Storage Pool) 용량 사용량이 급격히 증가하고 짧은 시간 내에 최대 활용도에 도달할 수 있습니다.

MDM 이벤트:

2026-06-30 07:27:19.340 SDS_DECOUPLED ERROR SDS: SDS11 (id: 64cb920800000006) decoupled.
2026-06-30 07:27:19.465 MDM_DATA_DEGRADED ERROR The system is now in DEGRADED state
....
2026-06-30 07:32:20.638 SDS_DECOUPLED ERROR SDS: SDS9 (id: 64cb920b00000009) decoupled.
2026-06-30 07:32:20.638 SDS_DECOUPLED ERROR SDS: SDS12 (id: 64cb920a00000008) decoupled.
2026-06-30 07:32:21.842 MDM_DATA_FAILED CRITICAL The system is now in DATA FAILURE state. Some data is unavailable
...
2026-06-30 07:32:23.538 DEV_CAPACITY_USAGE_CRITICAL ERROR Capacity usage on Protection Domain PD1, Storage Pool FGSP_01 is CRITICAL.
2026-06-30 07:32:23.605 DEV_CAPACITY_USAGE_FULL ERROR Capacity usage on Protection Domain PD1, Storage Pool FGSP_02 is FULL.

영향을 받는 모든 SDS 노드의 추적 로그는 동일한 패닉 스택 추적을 생성합니다.

2026/07/01 17:45:33.506630 Panic in file /data/build/workspace/ScaleIO-Common-Job/src/mos/mos_timer.c, line 437, function mosTimerReq_AddByQ, PID 1291427.Panic Expression pReq->state == MOS_TIMER_REQ_STATE__IDLE .
/opt/emc/scaleio/sds/bin/sds-3.6.7000.123(mosDbg_PanicPrepare+0xe5) [0x932ce5]
/opt/emc/scaleio/sds/bin/sds-3.6.7000.123(mosTimerReq_AddByQ+0x143) [0x917043]
/opt/emc/scaleio/sds/bin/sds-3.6.7000.123(vaeCleaner_CleanVae+0x64) [0x668904]
/opt/emc/scaleio/sds/bin/sds-3.6.7000.123(head_removeVae+0x170) [0x545e00]
/opt/emc/scaleio/sds/bin/sds-3.6.7000.123(head_Update+0x373) [0x546363]
/opt/emc/scaleio/sds/bin/sds-3.6.7000.123(contHead_UpdateFull+0x69) [0x4db689]
/opt/emc/scaleio/sds/bin/sds-3.6.7000.123(contCmd_AddHead+0x18a) [0x60d85a]
/opt/emc/scaleio/sds/bin/sds-3.6.7000.123(contCmd_AddHeadGroup+0x100) [0x61b630]
/opt/emc/scaleio/sds/bin/sds-3.6.7000.123(contCmd_NewRequest+0x15fd) [0x62b96d]
/opt/emc/scaleio/sds/bin/sds-3.6.7000.123(contNet_RecvRequest+0xd0) [0x4ce880]

PowerFlex 3.6.7 이전 버전에서는 예약된 vTree 마이그레이션 중에 마이그레이션 프로세스가 중단되고 완료되지 않습니다.

스토리지 작업을 실행하는 PowerFlex Manager UI > 에서 다음과 같이 Loading이 끝없이 표시됩니다.

스토리지 작업을 실행하면 Loading이 끝없이 표시됩니다.

query_vtree_migration 출력에는 절대 변하지 않는 진행률이 표시됩니다.

scli --query_vtree_migration --volume_id 53b80e00000000d1
VTree ID: ba46bf57000000d1 Name: PDC-GC-LNX-N-01-PFSP01-01-V043
    Storage Pool 5f2f4acc00000000 Name: PDC-FLEX-LNX-SP01
    Protection Domain 908ff43700000000 Name: PDC-FLEX-LNX-PD01
    Data layout: Medium granularity
    Provisioning: Thin
    Total capacity in use: 504.7 GB (516787 MB)
    Total user data: 504.7 GB (516787 MB)
            Total base user data: 504.7 GB (516787 MB)
            Total snapshots user data: 0 Bytes
    VTree migration info:
            Migration status: Migrating
            Source:      Storage Pool: PDC-FLEX-LNX-SP01 ID: 5f2f4acc00000000 Protection Domain: PDC-FLEX-LNX-PD01 ID: 908ff43700000000
            Destination: Storage Pool: PDC-FLEX-LNX-SP03 ID: 5f2fe70d00000004 Protection Domain: PDC-FLEX-LNX-PD03 ID: 9090907800000003
            Conversion type: No conversion
            Queue position: 1
            Progress percentage : 34%

영향

3.6.7 이전 버전에서는 볼륨 마이그레이션이 종료되지 않고, SP 용량 활용도가 심각하거나 그 이상이며, 애플리케이션에 I/O 오류가 발생할 수 있습니다.

버전 3.6.7에서 데이터를 사용할 수 없습니다.

원인

이 문제는 볼륨 마이그레이션 작업 중 VAE(Volume Allocation Element) 클리너 구성 요소 내의 공유 타이머 메커니즘과 관련된 다중 스레드 경합 상태로 인해 발생합니다.

3.6.7 이전 버전의 PowerFlex에서는 마이그레이션 후 이전 SP 위치에서 데이터를 삭제하는 데 비동기식 정리 프로세스가 사용되었습니다. 동시 볼륨 관리 작업, 동시 볼륨 삭제, 높은 I/O 로드 또는 네트워크 불안정과 같은 드문 조건에서 이 프로세스에서 마이그레이션이 무기한 중단된 것처럼 보이게 하는 경합 상태가 발생할 수 있습니다.

이 문제를 해결하기 위해 버전 3.6.7에 향상된 모니터링 메커니즘이 도입되었습니다. 이 안전 메커니즘에는 시스템이 중단된 I/O 또는 MDM 명령을 처리하는 방법과 유사하게 중단된 VAE 클리너 스레드를 감지하고 SDS 서비스를 사전에 패닉하여 데이터 손상 또는 장기 중단을 방지하도록 설계된 타이머가 있습니다.

그러나 이 수정 사항의 초기 구현에서 모니터링 타이머는 마이그레이션 데이터 생성 중에 한 번만 초기화되었으며 이후의 모든 VAE 클리너 호출에서 전역적으로 공유되었습니다. 마이그레이션 워크로드가 많은 동안 여러 백그라운드 스레드가 이 단일 공유 타이머에 동시에 액세스하려고 하면 새로운 경합 상태가 트리거됩니다. 이 동시 액세스로 인해 추적 메커니즘이 VAE 클리너를 멈춘 것으로 잘못 플래그를 지정하여 의도하지 않은 SDS 서비스 충돌이 발생하고 데이터 가용성이 국지적으로 중단되어 데이터 가용성 손실이 발생합니다.

해결

영구 수정(권장)

클러스터를 PowerFlex 3.6.7.1 이상으로 업그레이드합니다. VAE 클리너 및 타이머 경합 조건에 대한 수정 사항이 포함되어 있습니다.


해결 방법(업그레이드를 즉시 수행할 수 없는 경우)

3.6.7 이전 버전

  1. 기본 MDM에서 다음 위치에 있는 추적 로그 디렉터리로 이동합니다. /opt/emc/scaleio/mdm/logs/. 현재 추적 로그를 찾으려면 다음을 실행합니다. ls -ltr, 최신 trc.z.* 로그는 목록 맨 아래에 나열됩니다.
  2. 로그는 압축되어 있으므로 trace_decompress 유틸리티 위치 /opt/emc/scaleio/mdm/bin/
    tail -f <current_trace_log> | /opt/emc/scaleio/mdm/bin/trace_decompress
    1. SDS ID를 필터링합니다(예: TGT) 항목. 다음으로 grep 찾을 명령:
    tail -f <current_trace_log> | /opt/emc/scaleio/mdm/bin/trace_decompress | grep volumeBlock_HandleQueryCleanVaeResponse
    1. 다음 사항을 식별합니다. TGT. 필터링된 출력에서 다음과 유사한 줄을 찾습니다.
    TGT 41a903f100000036 not done yet

    이러한 볼륨을 TGT ID는 시간이 지나도 일관되게 유지되며 관련된 SDS 노드에 해당할 가능성이 높습니다. 3단계를 다시 실행하여 일관성이 유지되는지 확인합니다.

    1. 다음 명령을 실행하여 모든 SDS 노드를 나열하고 TGT SDS 이름/IP 주소가 포함된 ID:
    scli --query_all_sds
    1. 필요한 정보가 있으면 SSH 해당 SDS에 연결하고 다음을 실행하여 SDS 서비스를 재시작합니다.
    pkill sds

    버전 3.6.7

    • 볼륨 관리 작업 직렬화 - 삭제, 크기 조정 또는 마이그레이션을 한 번에 하나만 실행합니다.
    • 마이그레이션이 실행되는 동안 영향을 받는 보호 도메인의 I/O 로드를 줄입니다.
    • 대량 vTree 마이그레이션을 피하십시오. 작은 그룹으로 배치합니다.
    • 네트워크가 불안정할 때 마이그레이션을 일시 중지하거나 취소하지 마십시오.

    이렇게 하면 타이머가 동시에 사용될 확률이 낮아지므로 패닉이 발생할 확률이 낮아집니다.


    영향을 받는 버전

    PowerFlex 코어 3.x.x.x

    수정된 버전

    PowerFlex 코어 3.6.7.1

    해당 제품

    PowerFlex rack, ScaleIO
    문서 속성
    문서 번호: 000488725
    문서 유형: Solution
    마지막 수정 시간: 24 7월 2026
    버전:  2
    다른 Dell 사용자에게 질문에 대한 답변 찾기
    지원 서비스
    디바이스에 지원 서비스가 적용되는지 확인하십시오.