Desduplicação de dados
A desduplicação de dados, também chamada de “dedup”, elimina informações duplicadas ou redundantes em um conjunto de dados. Em resumo, a dedup é um processo que garante que exista apenas uma cópia dos dados em um determinado conjunto de dados ou bloco.
Definição de deduplicação de dados
A deduplicação de dados, também chamada de “dedup”, elimina informações duplicadas ou redundantes em um conjunto de dados. Em resumo, a deduplicação é um processo que garante que exista apenas uma cópia dos dados em um determinado conjunto de dados ou bloco.
O processo aumenta a capacidade de armazenamento e otimiza as redundâncias sem comprometer a fidelidade ou a integridade dos dados. Referências ou ponteiros para a única cópia salva substituem as informações redundantes excluídas. Frequentemente, a deduplicação de dados é combinada com a compactação de dados para uma economia de espaço de armazenamento ainda mais otimizada.
Existem duas maneiras de classificar a deduplicação com base no local onde ela ocorre. A primeira é a deduplicação no lado da fonte, que indica que a deduplicação ocorre na fonte, de onde os dados se originam. A segunda é a deduplicação no lado do destino, que sugere que a deduplicação ocorre no armazenamento de destino, onde as informações são armazenadas.
O que é desduplicação de dados?
A deduplicação de dados é o processo de remoção de cópias duplicadas de conjuntos de dados para otimizar os recursos de armazenamento e melhorar seu desempenho. Ao eliminar informações redundantes, o sistema libera espaço de armazenamento e reduz o tamanho dos conjuntos de dados. Essas mudanças reduzem o custo do armazenamento e melhoram o desempenho das aplicações, que podem executar tarefas utilizando conjuntos menores de dados.
A deduplicação de dados só faz sentido quando aplicada a locais de armazenamento secundários com dados de backup. Os repositórios de armazenamento secundários usados para fazer backup de dados tendem a apresentar taxas de duplicação mais altas, o que torna a deduplicação necessária. Por outro lado, o armazenamento primário usado em ambientes de produção prioriza o desempenho em detrimento de outros fatores e pode optar por não utilizar a deduplicação.
Ao implementar a deduplicação, é importante estar ciente de que alguns bancos de dados relacionais, como o Oracle e o Microsoft SQL, não se beneficiam da deduplicação. Esses bancos de dados costumam manter uma chave única para cada registro, impedindo que os mecanismos de deduplicação reconheçam registros duplicados como tal.
Vejamos um exemplo comum.
O CEO da empresa envia um e-mail para todos os 100 funcionários com um organograma atualizado em anexo. Todos os 100 funcionários recebem o mesmo arquivo e o salvam em suas áreas de trabalho para poderem consultá-lo posteriormente. Quando o backup é executado mais tarde naquela noite, ele salva todas as 100 cópias desse arquivo, mas, devido à deduplicação, apenas 1 arquivo real é salvo, com 99 referências ou ponteiros para o original.
Nesse exemplo, observamos uma taxa de desduplicação de 100 para 1. Quando combinada com a compactação de dados, apenas as instâncias salvas dos dados são compactadas para aumentar ainda mais a capacidade de armazenamento por meio da codificação eficiente dos dados.
O que é o processo de desduplicação de dados e como ele funciona?
A desduplicação envolve a análise dos dados para identificar os blocos únicos de dados antes de armazená-los. Quando são encontradas duplicatas de um bloco de dados específico, os padrões redundantes são excluídos e substituídos por referências, ou ponteiros, aos dados únicos já armazenados. O agente responsável pela desduplicação atribui um número identificador único a cada bloco de dados armazenado.
Quando dados duplicados são encontrados durante a verificação dos números de identificação únicos, as informações redundantes recém-descobertas são removidas. Como parte do processo de desduplicação, blocos ou fragmentos de dados são comparados por meio da verificação dos números de identificação únicos atribuídos aos dados armazenados. Quando um número de identificação duplicado é encontrado, o novo fragmento de dados com esse número é considerado uma cópia redundante e excluído. O agente de desduplicação presume que números únicos duplicados indicam um bloco de dados redundante.
A deduplicação de dados pode ser realizada em linha, à medida que os dados fluem, ou em “pós-processamento”, após as informações já terem sido gravadas nos dispositivos de armazenamento.
A deduplicação de dados é executada em segundo plano e segue políticas de otimização definidas para identificar arquivos que precisam ser tratados. O agente de deduplicação, então, divide os arquivos-alvo em blocos de dados variáveis, identifica e armazena aqueles com números de identificação exclusivos atribuídos. Como parte do processo de deduplicação, os blocos de dados duplicados são removidos e substituídos por referências idênticas aos dados salvos. Em seguida, o agente de deduplicação restabelece o fluxo original do arquivo com os arquivos recém-otimizados.
Conforme observado anteriormente no exemplo do e-mail, não é incomum (com certos tipos de dados) que as taxas de desduplicação cheguem a 90:1, o que aumenta os benefícios da desduplicação. Obtêm-se maiores eficiências de armazenamento ao combinar a desduplicação com a compactação de dados, o que reduz ainda mais o tamanho dos dados armazenados e o espaço ocupado no armazenamento.
A desduplicação de dados é um conceito simples que contribui significativamente para a redução dos recursos de armazenamento e dos custos a eles associados. Quando combinada com a compactação de dados, a economia aumenta, e o desempenho dos dispositivos de armazenamento e das aplicações melhora.
Por que a desduplicação de dados é importante?
O crescimento exponencial e descontrolado dos dados, aliado à redução das janelas de backup, aos SLAs de retenção de dados e aos requisitos regulatórios, sobrecarrega os recursos de TI e o crescimento dos negócios. A tecnologia de desduplicação de dados reduz os requisitos de capacidade física dos discos, ao mesmo tempo em que atende aos requisitos de retenção de dados.
A quantidade de dados criados diariamente é impressionante, e todos eles devem ser otimizados para uma melhor utilização da capacidade de armazenamento e protegidos contra perdas. Em média, em 2020, os seres humanos geraram 1,7 MB de dados a cada segundo para cada pessoa na Terra.1 Estima-se que, até 2025, 463 exabytes de dados serão criados a cada dia.2
Infelizmente, a maior parte dos dados armazenados consiste em duplicatas que aumentam os custos de armazenamento dos clientes e reduzem o desempenho e a utilização dos sistemas em nuvem. Por exemplo, o compartilhamento de arquivos pelos usuários resulta em muitas cópias duplicadas do mesmo arquivo. Em ambientes virtualizados, os sistemas operacionais convidados podem ser quase idênticos em várias máquinas virtuais (VMs). Até mesmo os instantâneos de backup podem apresentar pequenas diferenças de um dia para o outro. A desduplicação elimina essas ineficiências dos sistemas de armazenamento.
De acordo com a estimativa da Microsoft, as bibliotecas de virtualização podem apresentar uma economia típica de espaço de até 50%, enquanto as bibliotecas de virtualização podem alcançar uma economia de espaço de até 95%.³ A economia varia dependendo dos conjuntos de dados.
Benefícios da desduplicação de dados
Os aplicativos e os dados que eles geram são os impulsionadores da análise de negócios e o fator determinante para um crescimento bem-sucedido. O gerenciamento do crescimento dos dados e os benefícios da desduplicação não se limitam aos sistemas de armazenamento, mas se estendem a toda a infraestrutura de TI e ao desempenho dos aplicativos. Uma menor ocupação de espaço de armazenamento, resultante da deduplicação e da compactação, reduz os custos de armazenamento, diminui a pressão sobre a rede e as restrições de largura de banda. Isso também melhora o desempenho dos aplicativos nos terminais, o que contribui para aumentar a produtividade dos funcionários remotos.
As soluções de desduplicação de dados oferecem benefícios comerciais significativos que vão além das áreas diretamente relacionadas aos dispositivos de armazenamento:
- Custos mais baixos. Uma menor capacidade de armazenamento se traduz em despesas menores que se refletem em todas as operações de TI. Menos infraestrutura para gerenciar significa menos recursos administrativos e de gerenciamento, além de cobranças gerais menores por parte dos provedores de nuvem pela movimentação de dados e pelo tráfego de rede. A economia no armazenamento local inclui o Capex (custo de capital) dos dispositivos de armazenamento e do espaço que ocupam, juntamente com os sistemas de refrigeração. A economia também inclui o Opex (custo operacional) para gerenciamento de armazenamento, refrigeração e outros serviços públicos, incluindo energia elétrica.
- Maior retenção de dados. Com a deduplicação de dados, as empresas têm a vantagem de reter conjuntos de dados menores por períodos mais longos e atender a requisitos de retenção mais rigorosos.
- Maior desempenho geral. Como os provedores de nuvem baseiam grande parte de suas cobranças no tráfego de dados, faz sentido que os clientes otimizem seus conjuntos de dados. Um tráfego de dados menor entre os locais na nuvem reduz os custos incorridos e libera largura de banda da rede para mais usuários e uma prestação mais rápida dos serviços. É recomendável que as empresas dedupliquem seus dados antes de enviá-los para a nuvem. Também é prudente deduplicar os dados armazenados na nuvem.
Casos de uso comuns para a desduplicação de dados
Organizações de todos os tamanhos precisam da desduplicação para estes casos de uso cotidianos:
- Máquinas virtuais. Máquinas virtuais com implantações de aplicativos resultam em sistemas convidados duplicados e dados associados. A desduplicação pode ajudar as máquinas virtuais a funcionarem com mais eficiência.
- Terminais. Clientes de terminais, incluindo desktops e laptops, estão sujeitos ao acúmulo de dados duplicados, o que exige desduplicação regular para melhor desempenho e operações de backup mais eficientes.
- Armazenamento em nuvem. À medida que mais dados migram para a nuvem, a deduplicação oferece benefícios significativos, já que o acúmulo de dados pode ser mais oneroso do que o armazenamento local, se não for controlado. Alguns clientes podem perceber que aplicar a deduplicação aos seus dados antes de enviá-los para a nuvem para retenção de longo prazo é útil para reduzir custos. Geralmente, reduzir o tamanho do conjunto de dados diminui os custos e melhora o desempenho da rede e das operações.
A Commvault oferece desduplicação de dados?
Sim. A Commvault oferece desduplicação de nível empresarial em nosso portfólio de soluções de proteção de dados. Por meio de nossos recursos sofisticados de desduplicação, os clientes desfrutam de desempenho rápido, otimização de armazenamento e economia de custos. Solicite uma demonstração hoje mesmo para saber como isso ajudaria sua organização!
Fontes
- Domo.com 2020. “Data Never Sleeps 6.0.”
- Raconteur. Infográfico “Data in a Day”.
- Microsoft 2021. “Why is Data Deduplication useful?”
- WinPure, janeiro de 2021. “Benefícios da desduplicação de dados: melhore o ROI da sua empresa.”
Quer ver a proteção de dados em ação?
Conheça hoje mesmo o produto totalmente funcional e com serviço completo e veja como a Commvault pode atender diretamente às suas necessidades.