¿Qué es la deduplicación de datos?
La deduplicación detecta bloques de datos idénticos y guarda uno solo, sustituyendo el resto por referencias. En copias de seguridad de máquinas virtuales, donde la mayoría del contenido se repite entre copias y entre máquinas, reduce el espacio necesario de forma drástica.
Diez máquinas virtuales con el mismo sistema operativo comparten casi todo su disco, y la copia de hoy se parece muchísimo a la de ayer. La deduplicación aprovecha esa repetición: trocea los datos en bloques, calcula una huella de cada uno y solo almacena los que no había visto antes.
Donde brilla es en el backup. Un almacén deduplicado permite guardar retenciones largas —diarias, semanales, mensuales— ocupando una fracción de lo que sumarían las copias completas, y acelera las copias posteriores a la primera porque solo viaja lo nuevo. Proxmox Backup Server y Veeam trabajan con esa lógica.
En almacenamiento primario la historia es distinta: deduplicar en línea consume memoria y penaliza la escritura, así que en sistemas como ZFS suele desaconsejarse y se prefiere la compresión, que da un ahorro parecido casi gratis. Y conviene recordar que deduplicar concentra riesgo: un repositorio deduplicado es un único punto donde viven todas las copias, razón de más para tener otra fuera y para verificar las restauraciones.
Preguntas frecuentes
¿Deduplicación o compresión?
La compresión reduce el tamaño de cada bloque y es barata: en almacenamiento primario suele ser la opción correcta. La deduplicación elimina bloques repetidos y brilla en backup, donde la repetición entre copias es enorme. No son excluyentes: los repositorios de copias suelen usar las dos.
Servicios relacionados
¿Lo aplicamos a tu caso?
Cuéntanos tu proyecto y un especialista te propone la arquitectura, los plazos y el presupuesto. Sin coste y sin compromiso.