Skip to content
  • Inicio
  • Explora las páginas
  • Deduplicación de datos

Deduplicación de datos

La deduplicación de datos, también conocida como «dedup», elimina la información duplicada o redundante de un conjunto de datos. En pocas palabras, la deduplicación es un proceso que garantiza que solo exista una copia de los datos en un conjunto de datos o bloque determinado.

Definición de deduplicación de datos

La deduplicación de datos, también denominada «dedup», elimina la información duplicada o redundante de un conjunto de datos. En pocas palabras, la deduplicación es un proceso que garantiza que solo exista una copia de los datos en un determinado conjunto de datos o bloque.

El proceso mejora la capacidad de almacenamiento y optimiza las redundancias sin comprometer la fidelidad ni la integridad de los datos. Las referencias o punteros a la única copia guardada sustituyen a la información redundante eliminada. Muy a menudo, la deduplicación de datos se combina con la compresión de datos para lograr un ahorro de almacenamiento más óptimo.

Existen dos formas de clasificar la deduplicación en función del lugar donde se lleva a cabo. La primera es la deduplicación en el lado del origen, lo que significa que la deduplicación se produce en el origen, donde se generan los datos. La segunda es la deduplicación en el lado del destino, lo que implica que la deduplicación se produce en el almacenamiento de destino, donde se almacena la información.

¿Qué es la deduplicación de datos?

La deduplicación de datos es el proceso de eliminar copias duplicadas de conjuntos de datos para optimizar los recursos de almacenamiento y mejorar su rendimiento. Al eliminar la información redundante, el sistema libera espacio de almacenamiento y reduce el tamaño de los conjuntos de datos. Estos cambios reducen el coste del almacenamiento y mejoran el rendimiento de las aplicaciones, que pueden realizar tareas utilizando conjuntos de datos más pequeños.

La deduplicación de datos solo tiene sentido cuando se aplica a ubicaciones de almacenamiento secundarias con datos de copia de seguridad. Los repositorios de almacenamiento secundarios utilizados para realizar copias de seguridad de los datos suelen presentar mayores índices de duplicación, lo que hace necesaria la deduplicación. Por otro lado, el almacenamiento primario utilizado en entornos de producción da prioridad al rendimiento frente a otros factores y puede optar por no utilizar la deduplicación.

A la hora de implementar la deduplicación, es importante tener en cuenta que algunas bases de datos relacionales, como Oracle y Microsoft SQL, no se benefician de ella. Estas bases de datos suelen mantener una clave única para cada registro, lo que impide que los motores de deduplicación reconozcan los registros duplicados como tales.

Veamos un ejemplo habitual.

El director general de la empresa envía un correo electrónico a los 100 empleados con un organigrama actualizado como archivo adjunto. Los 100 empleados reciben el mismo archivo y lo guardan en su escritorio para poder consultarlo más tarde. Cuando se ejecuta la copia de seguridad esa misma noche, se guardan las 100 copias de ese archivo, pero gracias a la deduplicación solo se guarda un único archivo real, con 99 referencias o punteros al original.

En este ejemplo, hemos visto una relación de deduplicación de 100 a 1. Cuando se combina con la compresión de datos, solo se comprimen las instancias guardadas de los datos para mejorar aún más la capacidad de almacenamiento mediante una codificación eficiente de los datos.

¿En qué consiste el proceso de deduplicación de datos y cómo funciona?

La deduplicación consiste en analizar los datos para identificar los bloques únicos de datos antes de almacenarlos. Cuando se detectan duplicados de un bloque de datos concreto, los patrones redundantes se eliminan y se sustituyen por referencias, o punteros, a los datos únicos ya almacenados. El agente que lleva a cabo la deduplicación asigna un número identificador único a cada bloque de datos almacenado.

Cuando se detectan datos duplicados al comprobar los números identificadores únicos, se elimina la información redundante recién descubierta. Como parte del proceso de deduplicación, se comparan bloques o fragmentos de datos mediante el escaneo de los números identificadores únicos asignados a los datos almacenados. Cuando se encuentra un número identificador duplicado, el nuevo fragmento de datos con ese número se considera una copia redundante y se elimina. El agente de deduplicación asume que los números únicos duplicados indican un bloque de datos redundante.

La deduplicación de datos puede realizarse en línea, a medida que fluyen los datos, o en «posprocesamiento», una vez que la información ya se ha escrito en los dispositivos de almacenamiento.

La deduplicación de datos se ejecuta en segundo plano y sigue políticas de optimización preestablecidas para identificar los archivos que requieren intervención. A continuación, el agente de deduplicación divide los archivos de destino en fragmentos de datos de tamaño variable, identifica los únicos y los almacena asignándoles números identificadores únicos. Como parte del proceso de deduplicación, los bloques de datos duplicados se eliminan y se sustituyen por referencias idénticas a datos ya almacenados. A continuación, el agente de deduplicación restablece el flujo de archivos original con los archivos recién optimizados.

Como se ha señalado anteriormente en el ejemplo del correo electrónico, no es raro (con determinados tipos de datos) que las tasas de deduplicación alcancen valores de hasta 90:1, lo que aumenta las ventajas de la deduplicación. Se consigue una mayor eficiencia en el almacenamiento al combinar la deduplicación con la compresión de datos, lo que reduce aún más el tamaño de los datos almacenados y su huella de almacenamiento.

La deduplicación de datos es un concepto sencillo que contribuye de forma notable a reducir los recursos de almacenamiento y los costes asociados a ellos. Cuando se combina con la compresión de datos, el ahorro aumenta y mejoran tanto el rendimiento de los dispositivos de almacenamiento como el de las aplicaciones.

¿Por qué es importante la deduplicación de datos?

El crecimiento exponencial y descontrolado de los datos, junto con la reducción de los intervalos de copia de seguridad, los acuerdos de nivel de servicio (SLA) de retención de datos y los requisitos normativos, supone una carga para los recursos de TI y el crecimiento empresarial. La tecnología de deduplicación de datos reduce los requisitos de capacidad de los discos físicos al tiempo que cumple con los requisitos de retención de datos.

La cantidad de datos que se generan a diario es abrumadora, y todos ellos deben optimizarse para aprovechar mejor la capacidad de almacenamiento y protegerse contra su pérdida. De media, en 2020, los seres humanos generaron 1,7 MB de datos por segundo por cada persona del planeta Se estima que, para 2025, se generarán 463 exabytes de datos cada día

Lamentablemente, la mayor parte de los datos almacenados son duplicados que aumentan los costes de almacenamiento de los clientes y reducen el rendimiento y la utilización de los sistemas en la nube. Por ejemplo, el intercambio de archivos entre usuarios da lugar a numerosas copias duplicadas del mismo archivo. En entornos virtualizados, los sistemas operativos invitados pueden ser casi idénticos en varias de las máquinas virtuales (VM). Incluso las instantáneas de copia de seguridad pueden presentar pequeñas diferencias de un día para otro. La deduplicación elimina estas ineficiencias de los sistemas de almacenamiento.

Según las estimaciones de Microsoft, las bibliotecas de virtualización pueden alcanzar un ahorro de espacio típico de hasta el 50 %, mientras que las bibliotecas de virtualización podrían llegar a un ahorro de espacio de hasta el 95 %.³ El ahorro varía en función de los conjuntos de datos.

Ventajas de la deduplicación de datos

Las aplicaciones y los datos que generan son los motores del análisis empresarial y el factor determinante para un crecimiento exitoso. La gestión del crecimiento de los datos y las ventajas de la deduplicación no se limitan a los sistemas de almacenamiento, sino que se extienden a toda la infraestructura de TI y al rendimiento de las aplicaciones. Una menor huella de almacenamiento, conseguida mediante la deduplicación y la compresión, reduce los costes de almacenamiento, alivia la presión sobre la red y las limitaciones de ancho de banda. También mejora el rendimiento de las aplicaciones en los terminales, lo que contribuye a aumentar la productividad de los trabajadores remotos.

Las soluciones de deduplicación de datos aportan importantes beneficios empresariales que van más allá de las áreas directamente relacionadas con los dispositivos de almacenamiento:

  • Menores costes. Una menor capacidad de almacenamiento se traduce en menores gastos que repercuten en el conjunto de las operaciones de TI. Una infraestructura más reducida que gestionar implica menos recursos administrativos y de gestión, así como menores costes generales por parte de los proveedores de la nube en concepto de movimiento de datos y tráfico de red. El ahorro en el almacenamiento local incluye el Capex correspondiente a los dispositivos de almacenamiento y al espacio que ocupan, junto con los sistemas de refrigeración. El ahorro también incluye el Opex destinado a la gestión del almacenamiento, la refrigeración y otros servicios públicos, incluida la electricidad.
  • Mayor retención de datos. Gracias a la deduplicación de datos, las empresas tienen la ventaja de poder conservar conjuntos de datos más pequeños durante períodos más prolongados y cumplir requisitos de retención más estrictos.
  • Mayor rendimiento general. Dado que los proveedores de servicios en la nube basan gran parte de sus tarifas en el movimiento de datos, tiene sentido que los clientes optimicen sus conjuntos de datos. Un menor tráfico de datos entre las ubicaciones en la nube reduce los costes incurridos y libera ancho de banda de red para más usuarios y una prestación más rápida de los servicios. Es recomendable que las empresas dedupliquen sus datos antes de enviarlos a la nube. También es aconsejable deduplicar los datos almacenados en la nube.

Casos de uso habituales de la deduplicación de datos

Las organizaciones de todos los tamaños necesitan la deduplicación para estos casos de uso cotidianos:

  • Máquinas virtuales. Las máquinas virtuales con implementaciones de aplicaciones generan sistemas invitados duplicados y datos asociados. La deduplicación puede ayudar a que las máquinas virtuales funcionen de forma más eficiente.
  • Endpoints. Los clientes de terminales, incluidos los ordenadores de sobremesa y portátiles, tienden a generar datos duplicados que requieren una deduplicación periódica para obtener un mejor rendimiento y operaciones de copia de seguridad más eficientes.
  • Almacenamiento en la nube. A medida que se trasladan más datos a la nube, la deduplicación ofrece enormes ventajas, ya que la acumulación de datos puede resultar más costosa que el almacenamiento de datos en las propias instalaciones si no se controla. Algunos clientes pueden considerar que aplicar la deduplicación a sus datos antes de enviarlos a la nube para su conservación a largo plazo resulta útil para reducir costes. En general, reducir el tamaño del conjunto de datos disminuye los costes y mejora el rendimiento y el tráfico de red.

¿Ofrece Commvault deduplicación de datos?

Sí, Commvault ofrece deduplicación de nivel empresarial en nuestra gama de soluciones de protección de datos. Gracias a nuestras sofisticadas capacidades de deduplicación, los clientes disfrutan de un rendimiento rápido, optimización del almacenamiento y ahorro de costes. ¡Solicita una demostración hoy mismo para descubrir cómo podría ayudar a tu organización!

Fuentes

  1. Domo.com 2020. «Data Never Sleeps 6.0».
  2. Raconteur. Infografía «Data in a Day».
  3. Microsoft 2021. «¿Por qué es útil la deduplicación de datos
  4. WinPure, enero de 2021. «Ventajas de la deduplicación de datos: mejora el ROI de tu empresa».

¿Quieres ver cómo funciona la protección de datos?

Descubre hoy mismo este producto totalmente funcional y con todas las prestaciones, y comprueba cómo Commvault puede satisfacer directamente tus necesidades.