Data Domain: Perguntas frequentes sobre compactação

Summary: Este artigo responde às perguntas mais frequentes sobre compactação. Os Data Domains são independentes do tipo de dados. O Data Domain usa algoritmos de compactação que fazem backup apenas de dados exclusivos - padrões duplicados ou vários backups são armazenados apenas uma vez. ...

This article applies to This article does not apply to This article is not tied to any specific product. Not all product versions are identified in this article.

Instructions

Sumário

 
As taxas de compactação típicas são de 20:1 ao longo de muitas semanas de backups diários e incrementais. O tipo de dados afeta a taxa de compactação - arquivos de imagem compactados, bancos de dados e arquivos compactados (como arquivos .zip) não são compactados bem.
 

Os backups incrementais e completos usam o mesmo espaço em disco?

O ideal seria que isso fosse verdade. Na prática, o backup completo usa um pouco mais de espaço do que o incremental pelos seguintes motivos. Esses motivos também explicam por que um backup completo depois de nenhuma alteração nos dados ainda consome uma quantidade positiva de espaço.
  • Os metadados ocupam cerca de 0,5% do tamanho lógico do backup. Suponha que:
    • O tamanho lógico do completo é de 100 GB
    • O tamanho lógico do incremental é de 2 GB
    • A compactação incremental para 1 GB
    • ... em seguida, o completo leva pelo menos 1,5 GB
  • O mecanismo de compactação do DD regrava alguns segmentos de dados duplicados para fins de desempenho. Quanto pior a localidade dos dados das alterações, mais cópias são gravadas. Posteriormente, as duplicatas são recuperadas pela coleta de lixo do file system (GC). Em alguns casos, cerca de 2% do tamanho lógico é reescrito como duplicado. Supondo esse nível de duplicatas, o total pode levar 1 GB (compactado) + 0,5 GB (metadados) + 2 GB (duplicados) = 3,5 GB. A quantidade de cópias gravadas pode ser controlada por meio de um parâmetro do sistema, mas geralmente não ajustamos esse parâmetro no campo.
  • A segmentação de dados pode variar um pouco de backup para backup, dependendo da ordem em que o client NFS envia os dados. Essa ordem não é determinista. Em geral, o algoritmo de segmentação tolera deslocamentos e reordenação. No entanto, também cria alguns segmentos "forçados", que são propensos a mudanças e reordenamentos. Normalmente, cerca de 0,2% dos segmentos são forçados, de modo que muito mais uso de espaço pode ser esperado.
 

Porquê 'filesys show space' e 'filesys show compression' mostrar números diferentes?

  • 'filesys show space' fornece a taxa de compactação com base no tamanho lógico dos dados armazenados e no espaço em disco usado no momento em que o comando é executado.
  • 'filesys show compression' fornece a taxa de compactação com base em como cada arquivo foi compactado no momento em que foi criado.
  • 'filesys show compression' é usado principalmente para suporte e depuração. Na presença de arquivos exclui, 'filesys show compression' superestima a taxa de compressão.
 
Por exemplo, suponha que:
  • O primeiro backup completo recebe 2x a compactação
  • Um backup completo subsequente sem alterações nos dados obtém compactação de 200 vezes
  • O primeiro backup completo é excluído
A saída de 'filesys show space' mostraria uma taxa de compressão de 2x, enquanto 'filesys show compression' mostraria uma taxa de compactação de 200x, porque o único arquivo que existe agora tem uma taxa de compactação de 200x quando foi criado.
 
No exemplo acima, após o segundo backup, 'filesys show space' mostraria uma razão cumulativa de cerca de 4x. A taxa cumulativa melhoraria assintoticamente para 200x se continuasse com mais backups sem exclusão.
 
Há algumas outras pequenas diferenças. O 'filesys show compressioncomando ':
  • Não contabiliza o desperdício no nível do contêiner, superestimando ainda mais a taxa de compactação
  • Não considera a eliminação duplicada por compactação global, subestimando a taxa de compactação
  • Pode fornecer informações por arquivo ou por diretório, enquanto 'filesys show space' limita-se a todo o sistema
  • Fornece a divisão entre compactação global e local, enquanto 'filesys show space' não
 

Por que 'filesys show compression last 24 hours' não correspondem às expectativas para a VTL?

Para VTL, a saída de comandos como 'filesys show compression last 24 hours' muitas vezes não atende à expectativa com base em outras fontes, como 'system show performance'.
 
O problema acontece devido a uma peculiaridade em 'filesys show compression'. Em geral, ele mostra estatísticas cumulativas em arquivos selecionados. O qualificador "last 24 hours" seleciona os arquivos que foram atualizados nas últimas 24 horas. As estatísticas ainda são cumulativas desde que o arquivo foi criado ou truncado pela última vez para o tamanho zero. Assim, se um arquivo foi anexado nas últimas 24 horas, 'filesys show compression last 24 hours' mostra suas estatísticas cumulativas antes das últimas 24 horas.
 
Os arquivos de backup em ambientes não VTL são gravados apenas uma vez, portanto, há pouca discrepância entre os arquivos atualizados e os arquivos criados. Com a VTL, os backups podem ser acrescentados aos arquivos de fita existentes. Por exemplo, considere uma fita de 100 GB preenchida até 50 GB. Se 10 GB de dados foram acrescentados a essa fita nas últimas 24 horas, 'filesys show compression last 24 hours' mostraria os "bytes originais" do arquivo gravados em 60 GB.
 

Como é calculada a taxa de compactação cumulativa?

As taxas de compactação individuais não se somam linearmente.
 
Suponha que a compactação no primeiro backup completo seja 2x e que no segundo backup completo seja 20x. A compactação cumulativa não é (2 + 20) / 2 = 11xMas 2 / (1/2 + 1/20) = 3.64x.
 
Em geral, taxas de compactação mais baixas têm mais impacto do que taxas mais altas na taxa de compactação cumulativa.
 
Suponha que o ith O backup tem tamanho lógico si e taxa de compressão ci. Em seguida, a taxa de compactação cumulativa para k Os backups podem ser computados da seguinte maneira:
C = (total logical size)/(total space used)
total logical size = s1 + s2 + .. + sk
total space used = s1/c1 + s2/c2 + ... + sk/ck
 
Muitas vezes, os tamanhos lógicos são aproximadamente os mesmos. Nesse caso, o cálculo acima é simplificado da seguinte forma:
C = k / (1/c1 + 1/c2 + ... + 1/ck)
 
Por exemplo, se:
  • O primeiro backup completo obtém compactação de 3 vezes
  • Cada completo subsequente recebe compactação de 30x
  • O período de retenção é de 30 dias

O usuário vê uma compactação cumulativa de 30 / (1/3 + 29/30), ou 23x.

 

Como funciona a compactação do Data Domain?

Essa pergunta é respondida em detalhes em um artigo separado: Noções básicas sobre a compactação do Data Domain
 

O Data Domain dá suporte à multiplexação?

Dados multiplexados do aplicativo de backup resultam em uma desduplicação global muito ruim. Para obter mais informações, consulte este artigo: Data Domain: Multiplexação em software de backup
 

Com a replicação de diretório de um para um, por que a réplica mostra melhor compactação global?

Isso geralmente ocorre devido a variações no nível de segmentos duplicados gravados no sistema:
  • Os dados armazenados na origem foram desduplicados uma vez, em comparação com os dados anteriores armazenados na origem.
  • Os dados enviados pela rede foram desduplicados uma vez em relação aos dados armazenados na réplica.
  • Os dados armazenados na réplica foram desduplicados duas vezes, uma vez quando os dados foram enviados pela rede e novamente quando os dados recebidos foram gravados na réplica.
Como o processo de desduplicação deixa algumas cópias, os dados que foram desduplicados várias vezes têm menos cópias. Os dados armazenados na origem e enviados pela rede são desduplicados uma vez, portanto, são praticamente os mesmos, considerando que os dados armazenados na origem e na réplica sejam semelhantes. Os dados armazenados na réplica são desduplicados duas vezes, portanto, é melhor compactá-los.
 
A limpeza do file system remove a maioria das duplicatas. Portanto, depois que a limpeza for executada na origem e na réplica, o volume de dados armazenados deverá ser praticamente o mesmo.
 

Qual é a alteração na compactação ao usar lz, gzfaste gz Configurações de compactação local?

Use o seguinte comando para alterar o algoritmo de compactação local usado em um Data Domain:
filesys option set compression {none | lz | gzfast | gz}
 
Nota: O file system deve ser desligado antes de alterar o tipo de compactação local. Em seguida, ele pode ser reiniciado imediatamente após a opção de compactação ter sido definida.
 
Em geral, a ordem de compactação é a seguinte:
lz < gzfast < gz
 
Digite Composição esperada Carga da CPU
nenhuma 1x 0x
Lz 2x 1x
gzfast 2,5x 2x
Gz 3x 5x
 
A diferença aproximada é:
  • lz to gzfast oferece ~15% de melhor compactação e consome 2x CPU
  • lz to gz oferece ~30% de melhor compactação e consome 5x CPU
  • gzfast to gz oferece ~10-15% de melhor compactação
Observe que alterar a compactação local afeta primeiro os novos dados gravados no Data Domain depois que a alteração foi feita. Os dados antigos mantêm seu formato de compactação anterior até o próximo ciclo de limpeza. O próximo ciclo de limpeza copia o encaminhamento de todos os dados antigos para o novo formato de compactação. Isso faz com que a limpeza seja executada por muito mais tempo e consuma mais CPU.
 
Se o sistema já estiver com pouca CPU, especialmente se os backups e a replicação estiverem em execução simultaneamente, isso poderá tornar os backups mais lentos e. O cliente pode querer agendar explicitamente algum horário para fazer essa conversão.

Additional Information

Affected Products

Data Domain

Products

Data Domain
Article Properties
Article Number: 000022100
Article Type: How To
Last Modified: 24 Apr 2026
Version:  12
Find answers to your questions from other Dell users
Support Services
Check if your device is covered by Support Services.