Eliminación de datos duplicados
La desduplicación de datos es un método para reducir las necesidades de almacenamiento eliminando datos redundantes.
Visión general
Hay dos tipos de deduplicación de datos disponibles en IBM® Storage Protect: deduplicación de datos del lado del cliente y deduplicación de datos del lado del servidor.
La eliminación de datos duplicados del lado del cliente es una técnica de eliminación de datos duplicados que se utiliza en el cliente de archivado y copia de seguridad para eliminar datos redundantes durante el proceso de copia de seguridad y archivado antes de que los datos se transfieran al servidor de IBM Storage Protect . El uso de la eliminación de datos duplicados del lado del cliente puede reducir la cantidad de datos que va a enviarse a través de una red de área local.
La eliminación de datos duplicados del lado del servidor es una técnica de eliminación de datos duplicados realizada por el servidor. El administrador de IBM Storage Protect puede especificar la ubicación de eliminación de duplicados de datos (cliente o servidor) que se debe utilizar con el parámetro DEDUP en el mandato de servidor REGISTER NODE o UPDATE NODE .
Mejoras
- Excluir archivos específicos en un cliente de la optimización de almacenamiento.
- Habilitar una memoria caché de eliminación de duplicados de datos que reduzca el tráfico de la red entre el cliente y el servidor. La memoria caché contiene extensiones que se enviaron al servidor en operaciones de copia de seguridad incremental anteriores. En lugar de consultar al servidor sobre la existencia de una extensión, el cliente consulta su memoria caché.
Especifique el tamaño y la ubicación de la memoria caché del cliente. Si se detecta una incoherencia entre el servidor y la memoria caché local, la memoria caché se elimina y se vuelve a llenar.
Nota: Para las aplicaciones que utilizan la API de IBM Storage Protect , la memoria caché de eliminación de duplicados de datos no se debe utilizar debido a la posibilidad de que se produzcan errores de copia de seguridad causados por que la memoria caché no esté sincronizada con el servidor de IBM Storage Protect . Si existen varias sesiones de cliente de archivado y copia de seguridad simultáneas, debe tener configurada una memoria caché independiente para cada sesión. - Habilitar la eliminación de duplicados de datos y la compresión del lado del cliente para reducir la cantidad de datos almacenados por el servidor. Todas las extensiones se comprimen antes de ser enviadas al servidor. La compensación se realiza entre el ahorro de almacenamiento y la potencia de procesamiento necesaria para comprimir los datos de cliente. En general, si comprime y elimina duplicados de datos del sistema cliente, está utilizando aproximadamente el doble de potencia de proceso que si sólo realizara la eliminación de duplicados de datos.
El servidor puede trabajar con datos cuyos duplicados de han eliminado y que han sido comprimidos. Además, los clientes de archivado y copia de seguridad anteriores a la V6.2 pueden restaurar datos comprimidos y con duplicados eliminados.
La eliminación de datos duplicados del lado del cliente utiliza el siguiente proceso:
- El cliente crea extensiones. Las extensiones son partes de archivos que se comparan con otras extensiones de archivos para identificar duplicados.
- El cliente y el servidor colaboran para identificar las extensiones duplicadas. El cliente envía extensiones no duplicadas al servidor.
- Las operaciones subsiguientes de eliminación de duplicados de datos del cliente crean nuevas extensiones. Es posible que algunas o todas las extensiones coincidan con las extensiones que se crearon en operaciones anteriores de optimización de almacenamiento de datos y que se enviaron al servidor. Las extensiones coincidentes no vuelven a enviarse al servidor.
Ventajas
La eliminación de duplicados de datos del lado del cliente presenta las siguientes ventajas:
- Puede reducir la cantidad de datos enviados a la red de área local (LAN).
- La potencia de procesamiento necesaria para identificar datos duplicados se descarga desde el servidor a los nodos cliente. La eliminación de duplicados de datos en el lado del servidor siempre está habilitada para la agrupación de almacenamiento con la eliminación de duplicados de datos habilitada. Sin embargo, los archivos que se encuentran en la agrupación de almacenamiento habilitada para eliminación de duplicados de datos y cuyos duplicados han sido eliminados por el cliente no requieren ningún proceso adicional.
- La potencia de proceso necesaria para eliminar los datos duplicados en el servidor se suprime, lo que permite ahorrar de forma inmediata espacio en el servidor.
La eliminación de duplicados de datos del lado del cliente tiene una desventaja posible. El servidor no cuenta con copias completas de archivos del cliente hasta que se realiza una copia de seguridad de las agrupaciones de almacenamiento primarias que contienen las extensiones del cliente para una agrupación de almacenamiento de copia sin eliminación de duplicados de datos. (Las extensiones son partes de un archivo que se crean durante el proceso de eliminación de duplicados de datos). Durante la copia de seguridad de la agrupación de almacenamiento en una agrupación de almacenamiento sin optimización de almacenamiento de datos, las extensiones del cliente se vuelven a ensamblar en archivos contiguos.
De manera predeterminada, debe realizarse una copia de seguridad de las agrupaciones de almacenamiento de acceso secuencial primarias que están configuradas para la eliminación de duplicados de datos en agrupaciones de almacenamiento de copia sin eliminación de duplicados para que puedan reclamarse y para que puedan eliminarse los datos duplicados. El valor predeterminado garantiza que el servidor siempre tiene copias de los archivos completos, ya sea en una agrupación de almacenamiento primaria o en una agrupación de almacenamiento de copias.
Las siguientes opciones están relacionadas con la eliminación de duplicados de datos:
- Deduplicación
- Dedupcachepath
- Dedupcachesize
- Enablededupcache
- Exclude.dedup
- Include.dedup