Data Domain: Często zadawane pytania na temat kompresji

Summary: Ten artykuł zawiera odpowiedzi na najczęściej zadawane pytania dotyczące kompresji. Systemy Data Domain są niezależne od typu danych. System Data Domain używa algorytmów kompresji, które tworzą kopie zapasowe tylko unikalnych danych — zduplikowane wzorce lub wiele kopii zapasowych jest przechowywanych tylko raz. ...

This article applies to This article does not apply to This article is not tied to any specific product. Not all product versions are identified in this article.

Instructions

Spis treści

 
Typowe współczynniki kompresji wynoszą 20:1 przez wiele tygodni codziennych i przyrostowych kopii zapasowych. Typ danych wpływa na współczynnik kompresji — skompresowane pliki obrazów, bazy danych i skompresowane archiwa (takie jak pliki .zip) nie są dobrze kompresowane.
 

Czy przyrostowe i pełne kopie zapasowe zajmują to samo miejsce na dysku?

Idealnie byłoby, gdyby to była prawda. W praktyce pełna kopia zapasowa zajmuje nieco więcej miejsca niż przyrostowa z następujących powodów. Powody te wyjaśniają również, dlaczego pełna kopia zapasowa bez zmian w danych nadal zajmuje dodatnią ilość miejsca.
  • Metadane zajmują około 0,5% logicznego rozmiaru kopii zapasowej. Załóżmy, że:
    • Rozmiar logiczny pełnego pliku to 100 GB
    • Rozmiar logiczny pliku przyrostowego wynosi 2 GB
    • Przyrostowa kompresja do 1 GB
    • ... wtedy pełna zajmuje co najmniej 1,5 GB
  • Silnik kompresji DD przepisuje niektóre zduplikowane segmenty danych w celu zwiększenia wydajności. Im uboższa lokalność danych zmian, tym więcej duplikatów jest zapisywanych. Duplikaty są później odzyskiwane przez odśmiecanie pamięci systemu plików (GC). W niektórych przypadkach około 2% rozmiaru logicznego jest przepisywane jako duplikat. Zakładając ten poziom duplikatów, pełny może zająć 1 GB (skompresowany) + 0,5 GB (metadane) +2 GB (duplikaty) = 3,5 GB. Liczbę zapisanych duplikatów można kontrolować za pomocą parametru systemowego, ale generalnie nie dostrajamy tego parametru w polu.
  • Segmentacja danych może się nieco różnić w zależności od kolejności, w jakiej klient NFS wysyła dane. Porządek ten nie jest deterministyczny. Ogólnie rzecz biorąc, algorytm segmentacji toleruje przesunięcia i zmianę kolejności. Jednak tworzy również pewne "wymuszone" segmenty, które są podatne na przesunięcia i zmianę kolejności. Zazwyczaj około 0,2% segmentów jest wymuszonych, dzięki czemu można spodziewać się znacznie większego wykorzystania miejsca.
 

Dlaczego 'filesys show space' oraz 'filesys show compression' pokazują różne liczby?

  • 'filesys show space' zapewnia współczynnik kompresji oparty na logicznym rozmiarze przechowywanych danych i miejscu na dysku używanym w momencie uruchamiania polecenia.
  • 'filesys show compression' zapewnia współczynnik kompresji oparty na tym, jak każdy plik został skompresowany w momencie jego utworzenia.
  • 'filesys show compression' jest używany głównie do obsługi i debugowania. W przypadku usunięcia plików, 'filesys show compression' przeszacowuje współczynnik kompresji.
 
Załóżmy na przykład, że:
  • Pierwsza pełna kopia zapasowa jest poddawana podwójnej kompresji
  • Kolejna pełna kopia zapasowa bez żadnych zmian danych jest objęta kompresją 200x
  • Pierwsza pełna kopia zapasowa zostanie usunięta
Dane wyjściowe 'filesys show space' pokaże współczynnik kompresji 2x, podczas gdy 'filesys show compression' pokaże współczynnik kompresji 200x, ponieważ jedyny plik, który istnieje, ma teraz współczynnik kompresji 200x podczas tworzenia.
 
W powyższym przykładzie, po wykonaniu drugiej kopii zapasowej, 'filesys show space' pokazałby skumulowany współczynnik około 4x. Skumulowany współczynnik poprawiłby się asymptotycznie w kierunku 200x, gdyby kontynuowano tworzenie większej liczby kopii zapasowych bez usuwania.
 
Jest jeszcze kilka innych drobnych różnic. Znak "filesys show compression' polecenie:
  • Nie uwzględnia marnotrawstwa na poziomie kontenera, co jeszcze bardziej przeszacowuje współczynnik kompresji
  • Nie uwzględnia eliminacji duplikatów przez kompresję globalną, a tym samym nie docenia współczynnika kompresji
  • Może podawać informacje o plikach lub katalogach, podczas gdy "filesys show space' ogranicza się do całego systemu
  • Zawiera podział na kompresję globalną i lokalną, natomiast 'filesys show space" nie
 

Dlaczego 'filesys show compression last 24 hours' nie spełnia oczekiwań wobec VTL?

W przypadku biblioteki VTL dane wyjściowe poleceń, takich jak "filesys show compression last 24 hours" często nie spełnia oczekiwań opartych na innych źródłach, takich jak "system show performance'.
 
Problem pojawia się z powodu osobliwości w "filesys show compression'. Ogólnie rzecz biorąc, pokazuje skumulowane statystyki w wybranych plikach. Kwalifikator "ostatnie 24 godziny" wybiera pliki, które zostały zaktualizowane w ciągu ostatnich 24 godzin. Statystyki są nadal skumulowane od momentu utworzenia pliku lub ostatniego obcięcia do zerowego rozmiaru. W związku z tym, jeśli plik został dodany w ciągu ostatnich 24 godzin, "filesys show compression last 24 hours' pokazuje skumulowane statystyki sprzed ostatnich 24 godzin.
 
Kopie zapasowe plików w środowiskach innych niż VTL są zapisywane tylko raz, więc istnieje niewielka rozbieżność między plikami zaktualizowanymi a utworzonymi plikami. W przypadku VTL kopie zapasowe mogą być dołączane do istniejących plików taśmowych. Rozważmy na przykład taśmę o pojemności 100 GB, która jest wypełniona do 50 GB. Jeśli w ciągu ostatnich 24 godzin do tej taśmy zostało dołączonych 10 GB danych, 'filesys show compression last 24 hours' pokaże "Oryginalne bajty" pliku zapisane w 60 GB.
 

Jak obliczany jest skumulowany współczynnik kompresji?

Poszczególne stopnie kompresji nie sumują się liniowo.
 
Załóżmy, że kompresja pierwszej pełnej kopii zapasowej jest 2x, a drugiej pełnej kopii 20x. Kompresja skumulowana nie wynosi (2 + 20) / 2 = 11xAle 2 / (1/2 + 1/20) = 3.64x.
 
Ogólnie rzecz biorąc, niższe współczynniki kompresji mają większy wpływ na skumulowany współczynnik kompresji niż wyższe.
 
Załóżmy, że ith Kopia zapasowa ma rozmiar logiczny si i współczynnik kompresji ci. Następnie skumulowany współczynnik kompresji dla k Kopie zapasowe można obliczać w następujący sposób:
C = (total logical size)/(total space used)
total logical size = s1 + s2 + .. + sk
total space used = s1/c1 + s2/c2 + ... + sk/ck
 
Często rozmiary logiczne są mniej więcej takie same. W takim przypadku powyższe obliczenie upraszcza się do następującego:
C = k / (1/c1 + 1/c2 + ... + 1/ck)
 
Na przykład, jeśli:
  • Pierwsza pełna kopia zapasowa jest poddawana 3-krotnej kompresji
  • Każde kolejne pełne objęcie podlega 30-krotnej kompresji
  • Okres przechowywania wynosi 30 dni

Użytkownik widzi łączną kompresję 30 / (1/3 + 29/30)lub 23x.

 

Jak działa kompresja Data Domain?

Na to pytanie szczegółowo odpowiemy w osobnym artykule: Wskazówki dotyczące kompresji Data Domain
 

Czy Data Domain obsługuje multipleksowanie?

Multipleksowane dane z aplikacji do tworzenia kopii zapasowych skutkują bardzo słabą globalną deduplikacją. Aby uzyskać więcej informacji, zapoznaj się z tym artykułem: Data Domain: Multipleksowanie w oprogramowaniu do tworzenia kopii zapasowych
 

Dlaczego w przypadku replikacji katalogów 1 do 1 replika wykazuje lepszą kompresję globalną?

Dzieje się tak zazwyczaj z powodu różnic w poziomie zduplikowanych segmentów zapisanych w systemie:
  • Dane przechowywane u źródła zostały raz zdeduplikowane - w stosunku do poprzednich danych przechowywanych w źródle.
  • Dane przesyłane przewodem zostały raz zdeduplikowane - względem danych przechowywanych w replice.
  • Dane przechowywane w replice zostały zdeduplikowane dwukrotnie, raz po wysłaniu danych za pośrednictwem sieci i ponownie po zapisaniu odebranych danych w replice.
Ponieważ proces deduplikacji pozostawia pewne duplikaty, dane, które zostały wielokrotnie zdeduplikowane, mają mniej duplikatów. Dane przechowywane w źródle i wysyłane za pośrednictwem sieci są deduplikowane raz, więc są w przybliżeniu takie same, przy założeniu, że dane przechowywane w źródle i replice są podobne. Dane przechowywane w replice są deduplikowane dwukrotnie, dzięki czemu są lepiej skompresowane.
 
Czyszczenie systemu plików usuwa większość duplikatów. W związku z tym po uruchomieniu czyszczenia w źródle i replice ilość przechowywanych tam danych powinna być mniej więcej taka sama.
 

Jaka jest zmiana kompresji podczas używania lz, gzfasti gz Ustawienia kompresji lokalnej?

Użyj następującego polecenia, aby zmienić lokalny algorytm kompresji używany w Data Domain:
filesys option set compression {none | lz | gzfast | gz}
 
Uwaga: Przed zmianą typu kompresji lokalnej należy wyłączyć system plików. Następnie można go uruchomić ponownie natychmiast po ustawieniu opcji kompresji.
 
Ogólnie rzecz biorąc, kolejność kompresji jest następująca:
lz < gzfast < gz
 
Wpisz Oczekiwany komp. Obciążenie procesora
brak 1x 0x
Lz 2x 1x
gzfast 2,5x 2x
Gz 3x 5-krotny
 
Przybliżona różnica jest następująca:
  • lz to gzfast daje ~15% lepszą kompresję i zużywa 2x procesor
  • lz to gz daje ~30% lepszą kompresję i zużywa 5x procesor
  • gzfast to gz daje ~10-15% lepsza kompresja
Należy pamiętać, że zmiana kompresji lokalnej wpływa najpierw na nowe dane zapisane w Data Domain po wprowadzeniu zmiany. Stare dane zachowują poprzedni format kompresji do następnego cyklu czyszczenia. Następny cykl czyszczenia kopiuje wszystkie stare dane do nowego formatu kompresji. Powoduje to, że czyszczenie trwa znacznie dłużej i bardziej obciąża procesor.
 
Jeśli system ma już mało procesora, szczególnie jeśli kopie zapasowe i replikacja są uruchomione jednocześnie, może to spowolnić tworzenie kopii zapasowych i. Klient może chcieć dokładnie zaplanować czas na wykonanie tej konwersji.

Additional Information

Affected Products

Data Domain

Products

Data Domain
Article Properties
Article Number: 000022100
Article Type: How To
Last Modified: 24 Apr 2026
Version:  12
Find answers to your questions from other Dell users
Support Services
Check if your device is covered by Support Services.