Data Domain: Preguntas frecuentes sobre la compresión
Summary: En este artículo, se responden las preguntas más frecuentes sobre la compresión. Los Data Domain son independientes del tipo de datos. Data Domain utiliza algoritmos de compresión que respaldan solo datos únicos; los patrones duplicados o varios respaldos se almacenan solo una vez. ...
This article applies to
This article does not apply to
This article is not tied to any specific product.
Not all product versions are identified in this article.
Instructions
Tabla de contenido
- ¿Los respaldos incrementales y completos utilizan el mismo espacio de disco?
- ¿Por qué '
filesys show space' y 'filesys show compression' ¿Mostrar números diferentes? - ¿Por qué '
filesys show compression last 24 hours' no coincide con las expectativas para VTL? - ¿Cómo se calcula la tasa de compresión acumulada?
- ¿Cómo funciona la compresión de Data Domain?
- ¿Data Domain es compatible con la multiplexación?
- Con la replicación de directorios 1 a 1, ¿por qué la réplica muestra una mejor compresión global?
- ¿Cuál es el cambio en la compresión cuando se utiliza la configuración de compresión local lz, gzfast y gz?
Las tasas de compresión típicas son de 20:1 durante muchas semanas de respaldos diarios e incrementales. El tipo de datos afecta la tasa de compresión: los archivos de imagen comprimidos, las bases de datos y los archivos comprimidos (como los archivos .zip) no se comprimen correctamente.
¿Los respaldos incrementales y completos utilizan el mismo espacio de disco?
Idealmente, esto sería cierto. En la práctica, el respaldo completo utiliza un poco más de espacio que el incremental por las siguientes razones. Estas razones también explican por qué un respaldo completo después de no realizar cambios en los datos sigue consumiendo una cantidad positiva de espacio.
- Los metadatos ocupan aproximadamente el 0,5 % del tamaño lógico del respaldo. Supongamos que:
- El tamaño lógico del full es de 100 GB
- El tamaño lógico del incremental es de 2 GB
- El incremental se comprime a 1 GB
- ... entonces el completo ocupa al menos 1,5 GB
- El motor de compresión de DD vuelve a escribir algunos segmentos de datos duplicados para mejorar el rendimiento. Cuanto más deficiente sea la ubicación de datos de los cambios, más duplicados se escribirán. Posteriormente, los duplicados se recuperan mediante la recolección de elementos no utilizados (GC) del sistema de archivos. En algunos casos, aproximadamente el 2 % del tamaño lógico se vuelve a escribir como duplicado. Suponiendo este nivel de duplicados, el completo podría ocupar 1 GB (comprimido) + 0,5 GB (metadatos) + 2 GB (duplicados) = 3,5 GB. La cantidad de duplicados escritos se puede controlar a través de un parámetro del sistema, pero generalmente no ajustamos este parámetro en el campo.
- La segmentación de datos puede variar un poco de un respaldo a otro según el orden en que el cliente NFS envía los datos. Este orden no es determinista. En general, el algoritmo de segmentación tolera cambios y reordenamientos. Sin embargo, también crea algunos segmentos "forzados", que son propensos a cambios y reordenamientos. Por lo general, alrededor del 0,2 % de los segmentos son forzados, por lo que se puede esperar un uso mucho mayor del espacio.
¿Por qué 'filesys show space' y 'filesys show compression' ¿Mostrar números diferentes?
- '
filesys show space' proporciona la tasa de compresión en función del tamaño lógico de los datos almacenados y el espacio en disco utilizado en el momento en que se ejecuta el comando. - '
filesys show compression' proporciona la tasa de compresión en función de cómo se comprimió cada archivo en el momento en que se creó. - '
filesys show compression' se utiliza principalmente para soporte y depuración. En presencia de eliminaciones de archivos, 'filesys show compression' sobreestima la relación de compresión.
Por ejemplo, supongamos que:
- El primer respaldo completo obtiene el doble de compresión
- Un respaldo completo subsiguiente sin cambios en los datos obtiene una compresión 200 veces mayor
- Se elimina el primer respaldo completo
La salida de '
filesys show space' mostraría una tasa de compresión de 2x, mientras que 'filesys show compression' mostraría una tasa de compresión de 200x, porque el único archivo que existe ahora tiene una tasa de compresión de 200x cuando se creó.
En el ejemplo anterior, después del segundo respaldo, '
filesys show space' mostraría una relación acumulada de aproximadamente 4x. La tasa acumulativa mejoraría asintóticamente hacia 200 veces si se continúa con más respaldos sin eliminación.
Hay algunas otras diferencias menores. El '
filesys show compression' comando:
- No tiene en cuenta el desperdicio en el nivel del contenedor, por lo que sobreestima aún más la relación de compresión
- No tiene en cuenta la eliminación duplicada por compresión global, por lo que subestima la tasa de compresión
- Puede proporcionar información por archivo o por directorio, mientras que '
filesys show space' se limita a todo el sistema - Proporciona el desglose entre la compresión global y local, mientras que '
filesys show space' no lo hace
¿Por qué 'filesys show compression last 24 hours' no coincide con las expectativas para VTL?
Para VTL, la salida de comandos como '
filesys show compression last 24 hours' a menudo no cumple con las expectativas basadas en otras fuentes como 'system show performance”.
El problema ocurre debido a una peculiaridad en '
filesys show compression”. En general, muestra estadísticas acumulativas en los archivos seleccionados. El calificador "últimas 24 horas" selecciona los archivos que se actualizaron en las últimas 24 horas. Las estadísticas aún son acumuladas desde que se creó el archivo o se truncó por última vez a tamaño cero. Por lo tanto, si se anexó un archivo en las últimas 24 horas, 'filesys show compression last 24 hours' muestra sus estadísticas acumuladas antes de las últimas 24 horas.
Los archivos de respaldo en entornos que no son de VTL se escriben solo una vez, por lo que hay poca discrepancia entre los archivos actualizados y los archivos creados. Con VTL, los respaldos se pueden anexar a archivos de cinta existentes. Por ejemplo, considere una cinta de 100 GB que se llena hasta 50 GB. Si se anexaron 10 GB de datos a esta cinta en las últimas 24 horas, '
filesys show compression last 24 hours' mostraría los "bytes originales" del archivo escritos a 60 GB.
¿Cómo se calcula la tasa de compresión acumulada?
Las tasas de compresión individuales no se suman linealmente.
Suponga que la compresión en el primer respaldo completo es 2x y la del segundo respaldo completo es 20x. La compresión acumulativa no es
(2 + 20) / 2 = 11x, pero 2 / (1/2 + 1/20) = 3.64x.
En general, las tasas de compresión más bajas tienen más impacto que las más altas en la tasa de compresión acumulativa.
Supongamos que el
ith El respaldo tiene tamaño lógico si y la relación de compresión ci. Luego, la tasa de compresión acumulada para k Los respaldos se pueden calcular de la siguiente manera:
C = (total logical size)/(total space used)
total logical size = s1 + s2 + .. + sk
total space used = s1/c1 + s2/c2 + ... + sk/ck
A menudo, los tamaños lógicos son aproximadamente idénticos. En ese caso, el cálculo anterior se simplifica a lo siguiente:
C = k / (1/c1 + 1/c2 + ... + 1/ck)
Por ejemplo, si:
- El primer respaldo completo obtiene 3 veces más compresión
- Cada operación completa subsiguiente obtiene una compresión de 30 veces
- El período de retención es de 30 días
El usuario ve una compresión acumulativa de 30 / (1/3 + 29/30)o 23x.
¿Cómo funciona la compresión de Data Domain?
Esta pregunta se responde en detalle en un artículo aparte: Descripción de la compresión de Data Domain
¿Data Domain es compatible con la multiplexación?
Los datos multiplexados de la aplicación de respaldo generan una desduplicación global muy deficiente. Para obtener más información, consulte este artículo: Data Domain: Multiplexación en el software de respaldo
Con la replicación de directorios 1 a 1, ¿por qué la réplica muestra una mejor compresión global?
Por lo general, esto se debe a variaciones en el nivel de segmentos duplicados escritos en el sistema:
- Los datos almacenados en la fuente se desduplicaron una vez, en comparación con los datos anteriores almacenados en la fuente.
- Los datos enviados a través del cable se desduplicaron una vez, en comparación con los datos almacenados en la réplica.
- Los datos almacenados en la réplica se desduplicaron dos veces, una cuando los datos se enviaron por cable y otra vez cuando los datos recibidos se escribieron en la réplica.
Dado que el proceso de desduplicación deja algunos duplicados, los datos que se desduplicaron varias veces tienen menos duplicados. Los datos almacenados en la fuente y enviados a través de la conexión se desduplican una vez, por lo que son aproximadamente los mismos, suponiendo que los datos almacenados en la fuente y la réplica son similares. Los datos almacenados en la réplica se desduplican dos veces, por lo que se comprimen mejor.
La limpieza del sistema de archivos elimina la mayoría de los duplicados. Por lo tanto, después de ejecutar la limpieza en la fuente y la réplica, la cantidad de datos almacenados allí debe ser aproximadamente idéntica.
¿Cuál es el cambio en la compresión cuando se usa lz, gzfasty gz ¿Ajustes de compresión locales?
Utilice el siguiente comando para cambiar el algoritmo de compresión local utilizado en un Data Domain:
filesys option set compression {none | lz | gzfast | gz}
Nota: El sistema de archivos se debe apagar antes de cambiar el tipo de compresión local. Se puede reiniciar inmediatamente después de establecer la opción de compresión.
En general, el orden de compresión es el siguiente:
lz < gzfast < gz
| Escriba | Cumplimiento esperado | Carga de CPU |
|---|---|---|
| ninguno | 1 vez | 0x |
| lz | 2 veces | 1 vez |
| gzfast | 2,5 veces | 2 veces |
| gz | 3 veces | 5 veces |
La diferencia aproximada es:
lz to gzfastda ~ 15% mejor compresión y consume 2 CPUlz to gzproporciona ~ 30% mejor compresión y consume 5x CPUgzfast to gzProporciona ~10-15% mejor compresión
Tenga en cuenta que el cambio de la compresión local afecta primero a los datos nuevos escritos en Data Domain después de que se realizó el cambio. Los datos antiguos conservan su formato de compresión anterior hasta el siguiente ciclo de limpieza. En el siguiente ciclo de limpieza, se reenvían todos los datos antiguos al nuevo formato de compresión. Esto hace que la limpieza dure mucho más tiempo y requiera más CPU.
Si el sistema ya tiene poca CPU, especialmente si los respaldos y la replicación se ejecutan simultáneamente, esto puede ralentizar los respaldos y. Es posible que el cliente desee programar explícitamente una hora para realizar esta conversión.
Additional Information
Referencias de conocimiento:
Affected Products
Data DomainProducts
Data DomainArticle Properties
Article Number: 000022100
Article Type: How To
Last Modified: 24 Apr 2026
Version: 12
Find answers to your questions from other Dell users
Support Services
Check if your device is covered by Support Services.