Déduplication des données
La déduplication des données, également appelée « dédup », élimine les informations dupliquées ou redondantes dans un ensemble de données. En bref, la déduplication est un processus qui garantit qu’il n’existe qu’une seule copie des données dans un ensemble ou un bloc de données particulier.
Définition de la déduplication des données
La déduplication des données, également appelée « dédup », élimine les informations dupliquées ou redondantes au sein d’un ensemble de données. En bref, la déduplication est un processus qui garantit qu’il n’existe qu’une seule copie des données dans un ensemble ou un bloc de données donné.
Ce processus améliore la capacité de stockage et optimise les redondances sans compromettre la fidélité ni l’intégrité des données. Les informations redondantes supprimées sont remplacées par des références ou des pointeurs vers la seule copie enregistrée. Très souvent, la déduplication des données est associée à la compression des données afin d’optimiser encore davantage les économies de stockage.
Il existe deux façons de classer la déduplication en fonction de l’endroit où elle a lieu. La première est la déduplication côté source, ce qui signifie que la déduplication s’effectue à la source, là où les données sont créées. La seconde est la déduplication côté cible, ce qui signifie que la déduplication s’effectue sur le stockage cible où les informations sont conservées.
Qu’est-ce que la déduplication des données ?
La déduplication des données est le processus consistant à supprimer les copies en double d’ensembles de données afin d’optimiser les ressources de stockage et d’améliorer leurs performances. En éliminant les informations redondantes, le système libère de l’espace de stockage et réduit la taille des ensembles de données. Ces modifications réduisent le coût du stockage et améliorent les performances des applications, qui peuvent ainsi effectuer des tâches à partir d’ensembles de données plus petits.
La déduplication des données n’a de sens que lorsqu’elle est appliquée à des emplacements de stockage secondaires contenant des données de sauvegarde. Les référentiels de stockage secondaires utilisés pour la sauvegarde des données présentent généralement des taux de duplication plus élevés, ce qui rend la déduplication nécessaire. En revanche, le stockage primaire utilisé dans les environnements de production privilégie les performances par rapport à d’autres facteurs et peut choisir de ne pas recourir à la déduplication.
Lors du déploiement de la déduplication, il est important de savoir que certaines bases de données relationnelles, telles qu’Oracle et Microsoft SQL, ne tirent aucun avantage de la déduplication. Ces bases de données conservent souvent une clé unique pour chaque enregistrement, ce qui empêche les moteurs de déduplication de reconnaître les enregistrements en double comme tels.
Prenons un exemple courant.
Le PDG de l’entreprise envoie un e-mail à l’ensemble des 100 employés avec, en pièce jointe, un organigramme mis à jour. Les 100 employés reçoivent tous le même fichier et l’enregistrent sur leur bureau afin de pouvoir s’y référer ultérieurement. Lorsque la sauvegarde s’exécute plus tard dans la nuit, elle enregistre les 100 copies de ce fichier, mais grâce à la déduplication, un seul fichier réel est conservé, accompagné de 99 références ou pointeurs vers l’original.
Dans cet exemple, nous avons observé un taux de déduplication de 100 pour 1. Associée à la compression des données, cette technique permet de ne compresser que les instances sauvegardées des données, ce qui optimise encore davantage la capacité de stockage grâce à un encodage efficace des données.
En quoi consiste le processus de déduplication des données, et comment fonctionne-t-il ?
La déduplication consiste à analyser les données afin d’identifier les blocs de données uniques avant de les stocker. Lorsque des doublons d’un bloc de données donné sont détectés, les éléments redondants sont supprimés et remplacés par des références, ou pointeurs, vers les données uniques déjà stockées. L’agent chargé de la déduplication attribue un identifiant unique à chaque bloc de données stocké.
Lorsque des données en double sont détectées lors de la vérification des identifiants uniques, les informations redondantes nouvellement identifiées sont supprimées. Dans le cadre du processus de déduplication, les blocs ou segments de données sont comparés en analysant les identifiants uniques attribués aux données stockées. Lorsqu’un identifiant en double est détecté, le nouveau segment de données portant cet identifiant en double est considéré comme une copie redondante et supprimé. L’agent de déduplication part du principe que des identifiants uniques en double correspondent à un bloc de données redondant.
La déduplication des données peut être effectuée soit en ligne, au fur et à mesure que les données transitent, soit en « post-traitement », une fois que les informations ont déjà été écrites sur les périphériques de stockage.
La déduplication des données s’exécute en arrière-plan et suit des politiques d’optimisation prédéfinies pour identifier les fichiers nécessitant un traitement. L’agent de déduplication divise ensuite les fichiers cibles en segments de données de taille variable, identifie ceux qui sont uniques et les stocke en leur attribuant des numéros d’identification uniques. Dans le cadre du processus de déduplication, les blocs de données en double sont supprimés et remplacés par des références aux données identiques déjà enregistrées. L’agent de déduplication reconstitue ensuite le flux de fichiers d’origine à partir des fichiers nouvellement optimisés.
Comme indiqué précédemment dans l’exemple de l’e-mail, il n’est pas rare (avec certains types de données) que les taux de déduplication atteignent 90:1, ce qui renforce les avantages de la déduplication. On obtient encore plus d’efficacité de stockage en associant la déduplication à la compression des données, ce qui réduit davantage la taille des données stockées et leur empreinte de stockage.
La déduplication des données est un concept simple qui contribue de manière significative à réduire les ressources de stockage et les coûts qui y sont associés. Lorsqu’elle est associée à la compression des données, les économies augmentent, tandis que les performances des périphériques de stockage et des applications s’améliorent.
Pourquoi la déduplication des données est-elle importante ?
La croissance exponentielle et incontrôlée des données, combinée au raccourcissement des fenêtres de sauvegarde, aux accords de niveau de service (SLA) en matière de conservation des données et aux exigences réglementaires, met à rude épreuve les ressources informatiques et freine la croissance de l’entreprise. La technologie de déduplication des données réduit les besoins en capacité de disque physique tout en respectant les exigences de conservation des données.
La quantité de données créées chaque jour est colossale, et chacune d’entre elles doit être optimisée pour une meilleure utilisation de la capacité de stockage et protégée contre toute perte. En moyenne, en 2020, l’humanité a généré 1,7 Mo de données par seconde pour chaque habitant de la planète.¹ D’ici 2025, on estime que 463 exaoctets de données seront créés chaque jour.²
Malheureusement, la plupart des données stockées sont des doublons qui augmentent les coûts de stockage des clients et réduisent les performances ainsi que le taux d’utilisation des systèmes cloud. Par exemple, le partage de fichiers entre utilisateurs entraîne la création de nombreuses copies en double d’un même fichier. Dans les environnements virtualisés, les systèmes d’exploitation invités peuvent être presque identiques sur plusieurs machines virtuelles (VM). Même les instantanés de sauvegarde peuvent présenter de légères différences d’un jour à l’autre. La déduplication élimine ces inefficacités des systèmes de stockage.
Selon les estimations de Microsoft, les bibliothèques de virtualisation permettent généralement un gain d’espace pouvant atteindre 50 %, tandis que les bibliothèques de virtualisation pourraient permettre jusqu’à 95 % d’économies d’espace.³ Ces économies varient en fonction des ensembles de données.
Avantages de la déduplication des données
Les applications et les données qu’elles génèrent sont les moteurs de l’analyse métier et le facteur déterminant d’une croissance réussie. La gestion de la croissance des données et les avantages de la déduplication ne se limitent pas aux systèmes de stockage, mais s’étendent à l’ensemble de l’infrastructure informatique et aux performances des applications. La réduction de l’encombrement de stockage grâce à la déduplication et à la compression diminue les coûts de stockage, allège la charge sur le réseau et atténue les contraintes de bande passante. Cela améliore également les performances des applications au niveau des terminaux, ce qui contribue à renforcer la productivité des télétravailleurs.
Les solutions de déduplication des données offrent des avantages commerciaux significatifs qui vont au-delà des domaines directement liés aux périphériques de stockage :
- Réduction des coûts. Une capacité de stockage réduite se traduit par une baisse des dépenses qui se répercute sur l’ensemble des opérations informatiques. Une infrastructure moins volumineuse à gérer implique moins de ressources administratives et de gestion, ainsi que des frais globaux moins élevés facturés par les fournisseurs de cloud pour le transfert de données et le trafic réseau. Les économies réalisées sur le stockage sur site comprennent les dépenses d’investissement (Capex) liées aux périphériques de stockage, à l’espace qu’ils occupent et aux systèmes de refroidissement. Elles incluent également les dépenses d’exploitation (Opex) liées à la gestion du stockage, au refroidissement et à d’autres services, notamment l’alimentation électrique.
- Une conservation des données plus longue. Grâce à la déduplication des données, les entreprises ont la possibilité de conserver des ensembles de données plus petits pendant des périodes plus longues et de respecter des exigences de conservation plus strictes.
- De meilleures performances globales. Étant donné que les fournisseurs de cloud basent une grande partie de leur facturation sur le transfert de données, il est logique que les clients optimisent leurs ensembles de données. Une réduction du trafic de données entre les sites cloud diminue les coûts engagés et libère de la bande passante réseau pour accueillir davantage d’utilisateurs et accélérer la fourniture des services. Il est judicieux pour les entreprises de dédupliquer leurs données avant de les envoyer vers le cloud. Il est également prudent de dédupliquer les données stockées dans le cloud.
Cas d’utilisation courants de la déduplication des données
Les organisations de toutes tailles ont besoin de la déduplication pour ces cas d’utilisation courants :
- Machines virtuelles. Les machines virtuelles hébergeant des applications génèrent des instances invitées en double ainsi que des données associées. La déduplication peut contribuer à améliorer l’efficacité des machines virtuelles.
- Terminaux. Les terminaux, notamment les ordinateurs de bureau et les ordinateurs portables, sont susceptibles de générer des données en double qui nécessitent une déduplication régulière pour de meilleures performances et des opérations de sauvegarde plus efficaces.
- Stockage dans le cloud. Alors que de plus en plus de données migrent vers le cloud, la déduplication offre des avantages considérables dans cet environnement, car l’accumulation de données peut s’avérer plus coûteuse que le stockage sur site si elle n’est pas maîtrisée. Certains clients peuvent constater que l’application de la déduplication à leurs données avant de les envoyer dans le cloud pour une conservation à long terme contribue à réduire les coûts. De manière générale, la réduction de la taille du jeu de données diminue les coûts et améliore les performances réseau et globales.
Commvault propose-t-il la déduplication des données ?
Oui ! Commvault propose une déduplication de niveau entreprise dans sa gamme de solutions de protection des données. Grâce à nos fonctionnalités de déduplication sophistiquées, les clients bénéficient de performances élevées, d’une optimisation du stockage et de réductions de coûts. Demandez une démonstration dès aujourd’hui pour découvrir comment cela pourrait aider votre entreprise !
Sources
- Domo.com 2020. « Data Never Sleeps 6.0 ».
- Raconteur. Infographie « Data in a Day ».
- Microsoft 2021. « Why is Data Deduplication useful? »
- WinPure, janvier 2021. « Les avantages de la déduplication des données : améliorez le retour sur investissement de votre entreprise. »
Vous souhaitez découvrir la protection des données en action ?
Découvrez dès aujourd’hui ce produit complet et pleinement fonctionnel, et voyez comment Commvault peut répondre directement à vos besoins.