Data Domain: 압축 관련 자주 묻는 질문

Summary: 이 문서에서는 압축과 관련된 자주 묻는 질문에 대한 답변을 제공합니다. Data Domain은 데이터 유형에 구애받지 않습니다. Data Domain은 고유한 데이터만 백업하는 압축 알고리듬을 사용합니다. 즉, 패턴이 중복되거나 여러 백업이 한 번만 저장됩니다.

This article applies to This article does not apply to This article is not tied to any specific product. Not all product versions are identified in this article.

Instructions

목차

 
일반적인 압축률은 몇 주간의 일일 백업 및 증분 백업을 수행할 경우 20:1입니다. 데이터 유형은 압축률에 영향을 줍니다 - 압축된 이미지 파일, 데이터베이스 및 압축된 아카이브(예: .zip 파일)는 잘 압축되지 않습니다.
 

증분 백업과 전체 백업은 동일한 디스크 공간을 사용합니까?

이상적으로는 그렇습니다. 실제로 전체 백업은 다음과 같은 이유로 증분 백업보다 약간 더 많은 공간을 사용합니다. 이러한 이유로는 데이터를 변경하지 않은 후에도 전체 백업이 여전히 많은 양의 공간을 사용하는 이유를 설명할 수 있습니다.
  • 메타데이터는 백업의 논리적 크기의 약 0.5%를 차지합니다. 다음과 같은 경우를 가정하겠습니다.
    • 전체의 논리적 크기는 100GB입니다
    • 증분의 논리적 크기는 2GB입니다
    • 증분 용량은 1GB로 압축됩니다
    • ... 그런 다음 전체는 최소 1.5GB를 차지합니다.
  • DD 압축 엔진은 성능을 위해 일부 중복 데이터 세그먼트를 다시 씁니다. 변경 사항의 데이터 인접성이 낮을수록 중복 항목이 더 많이 기록됩니다. 나중에 파일 시스템 GC(Garbage Collection)를 통해 중복 항목이 재확보됩니다. 경우에 따라 논리적 크기의 약 2%가 중복으로 다시 작성됩니다. 이 수준의 중복을 가정하면 전체 용량은 1GB(압축) + 0.5GB(메타데이터) + 2GB(중복) = 3.5GB가 될 수 있습니다. 기록된 중복 데이터의 양은 시스템 매개변수를 통해 제어할 수 있지만 일반적으로 현장에서는 이 매개변수를 조정하지 않습니다.
  • 데이터 세분화는 NFS 클라이언트가 데이터를 전송하는 순서에 따라 백업마다 약간 다를 수 있습니다. 이 순서는 확정적이지 않습니다. 일반적으로 분할 알고리즘은 이동과 재정렬을 허용합니다. 그러나 이동 및 재정렬이 발생하기 쉬운 일부 "강제" 세그먼트도 생성합니다. 일반적으로 세그먼트의 약 0.2%가 강제 적용되므로 훨씬 더 많은 공간 사용을 예상할 수 있습니다.
 

왜 'filesys show space' 및 'filesys show compression' 다른 숫자를 표시하시겠습니까?

  • 'filesys show space'는 저장된 데이터의 논리적 크기와 명령이 실행될 때 사용된 디스크 공간을 기반으로 하는 압축률을 제공합니다.
  • 'filesys show compression'는 각 파일이 생성될 때 압축된 방법에 따른 압축률을 제공합니다.
  • 'filesys show compression'는 주로 지원 및 디버깅에 사용됩니다. 파일 삭제가 있는 경우 'filesys show compression'는 압축률을 과대 평가합니다.
 
예를 들어, 다음과 같은 경우를 가정해 보겠습니다.
  • 첫 번째 전체 백업은 2배 압축됩니다
  • 데이터를 변경하지 않은 후속 전체 백업은 200배 압축됩니다.
  • 첫 번째 전체 백업이 삭제됩니다
'filesys show space'는 2배의 압축률을 나타내고, 'filesys show compression'는 현재 존재하는 유일한 파일이 생성될 때 압축률이 200x이기 때문에 압축률이 200x로 표시됩니다.
 
위의 예에서 두 번째 백업 후 'filesys show space'는 약 4배의 누적 비율을 나타냅니다. 삭제 없이 더 많은 백업을 계속하면 누적 비율이 200배로 점근적으로 개선됩니다.
 
몇 가지 다른 사소한 차이점이 있습니다. 이 'filesys show compression' 명령:
  • 컨테이너 수준의 낭비를 고려하지 않으므로 압축률이 더 과대 평가됩니다.
  • 전역 압축에 의한 중복 제거를 고려하지 않으므로 압축률이 과소평가됨
  • 파일별 또는 디렉토리별 정보를 제공할 수 있는 반면, 'filesys show space'는 전체 시스템으로 제한됩니다.
  • 글로벌 압축과 로컬 압축 간의 분석 정보를 제공하는 반면, 'filesys show space' 하지 않음
 

왜 'filesys show compression last 24 hoursVTL에 대한 기대치와 일치하지 않습니까?

VTL의 경우 'filesys show compression last 24 hours'는 종종 '와 같은 다른 출처를 기반으로 기대치를 충족하지 않습니다.system show performance'.
 
문제는 '의 특성으로 인해 발생합니다.filesys show compression'. 일반적으로 선택한 파일의 누적 통계를 표시합니다. "지난 24시간" 한정자는 지난 24시간 동안 업데이트된 파일을 선택합니다. 파일이 생성되었거나 마지막으로 크기가 0으로 잘린 이후에도 통계는 계속 누적됩니다. 따라서 지난 24시간 동안 파일이 추가된 경우 'filesys show compression last 24 hours'는 지난 24시간 이전의 누적 통계를 표시합니다.
 
비 VTL 환경의 백업 파일은 한 번만 기록되므로 업데이트된 파일과 생성된 파일 간에 불일치가 거의 없습니다. VTL을 사용하면 기존 테이프 파일에 백업을 추가할 수 있습니다. 예를 들어 최대 50GB까지 채워지는 100GB 테이프를 생각해 보십시오. 지난 24시간 동안 10GB의 데이터가 이 테이프에 추가되었다면 'filesys show compression last 24 hours'는 60GB로 기록된 파일의 "원본 바이트"를 표시합니다.
 

누적 압축률은 어떻게 계산됩니까?

개별 압축률은 선형적으로 합산되지 않습니다.
 
첫 번째 전체 백업의 압축률이 2배이고 두 번째 전체 백업의 압축률이 20배라고 가정합니다. 누적 압축은 (2 + 20) / 2 = 11x하지만 2 / (1/2 + 1/20) = 3.64x.
 
일반적으로 압축률이 낮을수록 누적 압축률에 미치는 영향이 높습니다.
 
라고 가정합니다. ith 백업의 논리적 크기가 있음 si 및 압축비 ci. 그런 다음 에 대한 누적 압축률 k 백업은 다음과 같이 계산할 수 있습니다.
C = (total logical size)/(total space used)
total logical size = s1 + s2 + .. + sk
total space used = s1/c1 + s2/c2 + ... + sk/ck
 
종종 논리적 크기는 거의 서로 동일합니다. 이 경우 위의 계산은 다음과 같이 단순화할 수 있습니다.
C = k / (1/c1 + 1/c2 + ... + 1/ck)
 
예를 들어 다음과 같습니다.
  • 첫 번째 전체 백업은 3배 압축됩니다
  • 이후의 각 전체 압축은 30배 증가합니다.
  • 보존 기간은 30일입니다

사용자는 다음의 누적 압축을 볼 수 있습니다. 30 / (1/3 + 29/30)또는 23x입니다.

 

Data Domain 압축은 어떻게 작동합니까?

이 질문에 대한 답변은 별도의 기사에서 자세히 확인할 수 있습니다. Data Domain 압축 이해
 

Data Domain은 멀티플렉싱을 지원합니까?

백업 애플리케이션의 데이터를 다중화하면 글로벌 중복 제거 수준이 매우 저하됩니다. 자세한 내용은 다음 문서를 참조하세요. Data Domain: 백업 소프트웨어의 멀티플렉싱
 

1:1 디렉토리 복제에서 복제본의 전역 압축이 더 나은 이유는 무엇입니까?

이는 일반적으로 시스템에 기록된 중복 세그먼트의 수준이 변하기 때문입니다.
  • 소스에 저장된 데이터는 소스에 저장된 이전 데이터에 대해 한 번 중복 제거되었습니다.
  • 회선을 통해 전송된 데이터는 복제본에 저장된 데이터에 대해 한 번 중복 제거되었습니다.
  • 복제본에 저장된 데이터는 회선을 통해 데이터를 전송될 때 한 번, 수신된 데이터가 복제본에 기록될 때 한 번 중복 제거되었습니다.
중복 제거 프로세스에서 일부 중복이 남기 때문에 여러 번 중복 제거된 데이터의 중복은 더 적습니다. 소스에 저장되고 회선을 통해 전송된 데이터는 한 번 중복 제거되므로 소스와 복제본에 저장된 데이터가 유사하다고 가정하면 거의 동일합니다. 복제본에 저장된 데이터는 중복 제거가 두 번 수행되므로 압축률이 더 높습니다.
 
파일 시스템 정리는 대부분의 중복 항목을 제거합니다. 따라서 소스와 복제본에서 정리를 실행한 후 저장된 데이터의 양은 거의 동일해야 합니다.
 

사용할 때 압축의 변경 사항은 무엇입니까? lz, gzfastgz 로컬 압축 설정 여부

다음 명령을 사용하여 Data Domain에 사용되는 로컬 압축 알고리즘을 변경합니다.
filesys option set compression {none | lz | gzfast | gz}
 
참고: 로컬 압축 유형을 변경하기 전에 파일 시스템을 종료해야 합니다. 그런 다음 압축 옵션을 설정한 후 즉시 재시작할 수 있습니다.
 
일반적으로 압축 순서는 다음과 같습니다.
lz < gzfast < gz
 
다음을 예상 구성 요소 CPU 부하
없음 1배 0배
출발지 2배 1배
gzfast 2.5배 2배
Gz 3배 5배
 
대략적인 차이점은 다음과 같습니다.
  • lz to gzfast ~15% 더 나은 압축을 제공하고 2개의 CPU를 소비합니다.
  • lz to gz ~30% 더 나은 압축을 제공하고 5배의 CPU 소비
  • gzfast to gz ~ 10-15 % 더 나은 압축을 제공합니다.
로컬 압축을 먼저 변경하면 변경된 이후에 Data Domain에 기록되는 새 데이터가 영향을 받습니다. 이전 데이터는 다음 정리 주기가 될 때까지 이전 압축 형식을 유지합니다. 다음 정리 주기는 모든 이전 데이터를 새 압축 형식으로 복사합니다. 이로 인해 정리가 훨씬 더 오래 실행되고 CPU가 더 많이 사용됩니다.
 
시스템의 CPU가 이미 부족한 경우, 특히 백업과 복제가 동시에 실행되는 경우 백업 속도가 느려질 수 있습니다. 고객은 이 변환을 수행하기 위해 시간을 명시적으로 예약할 수 있습니다.

Additional Information

Affected Products

Data Domain

Products

Data Domain
Article Properties
Article Number: 000022100
Article Type: How To
Last Modified: 24 Apr 2026
Version:  12
Find answers to your questions from other Dell users
Support Services
Check if your device is covered by Support Services.