Skip to content

Datendeduplizierung

Die Datendeduplizierung, auch „Dedup“ genannt, beseitigt doppelte oder redundante Informationen in einem Datensatz. Kurz gesagt ist die Deduplizierung ein Prozess, der sicherstellt, dass nur eine Kopie der Daten in einem bestimmten Datensatz oder Block existiert.

Definition der Datendeduplizierung

Die Datendeduplizierung, auch „Dedup“ genannt, beseitigt doppelte oder redundante Informationen in einem Datensatz. Kurz gesagt ist die Deduplizierung ein Prozess, der sicherstellt, dass nur eine Kopie der Daten in einem bestimmten Datensatz oder Block existiert.

Der Prozess verbessert die Speicherkapazität und optimiert Redundanzen, ohne die Genauigkeit oder Integrität der Daten zu beeinträchtigen. Verweise oder Zeiger auf die einzige gespeicherte Kopie ersetzen die gelöschten redundanten Informationen. Sehr oft wird die Datendeduplizierung mit Datenkomprimierung kombiniert, um noch größere Speichereinsparungen zu erzielen.

Es gibt zwei Möglichkeiten, die Deduplizierung danach zu klassifizieren, wo sie stattfindet. Die erste ist die quellseitige Deduplizierung, bei der die Deduplizierung an der Quelle erfolgt, wo die Daten entstehen. Die zweite ist die zielseitige Deduplizierung, bei der die Deduplizierung auf dem Zielspeicher stattfindet, auf dem die Informationen gespeichert werden.

Was ist Datendeduplizierung?

Datendeduplizierung ist der Prozess der Entfernung doppelter Kopien von Datensätzen, um Speicherressourcen zu optimieren und deren Leistung zu steigern. Durch die Beseitigung redundanter Informationen gibt das System Speicherplatz frei und reduziert die Größe der Datensätze. Diese Maßnahmen senken die Speicherkosten und verbessern die Leistung von Anwendungen, die Aufgaben mit kleineren Datensätzen ausführen können.

Datendeduplizierung ist nur dann sinnvoll, wenn sie auf sekundäre Speicherorte mit Sicherungsdaten angewendet wird. Die für die Datensicherung genutzten sekundären Speicherorte weisen in der Regel höhere Duplikationsraten auf, was eine Deduplizierung erforderlich macht. Im Gegensatz dazu wird bei Primärspeichern für Produktionsumgebungen der Leistung Vorrang vor anderen Faktoren eingeräumt, sodass dort möglicherweise auf eine Deduplizierung verzichtet wird.

Bei der Einführung der Deduplizierung ist zu beachten, dass einige relationale Datenbanken wie Oracle und Microsoft SQL keinen Nutzen aus der Deduplizierung ziehen. Solche Datenbanken verwalten oft einen eindeutigen Schlüssel für jeden Datensatz, wodurch Deduplizierungs-Engines Duplikate nicht als solche erkennen können.

Betrachten wir ein gängiges Beispiel.

Der Geschäftsführer des Unternehmens sendet eine E-Mail an alle 100 Mitarbeiter mit einem aktualisierten Organigramm als Anhang. Alle 100 Mitarbeiter erhalten dieselbe Datei und speichern sie auf ihrem Desktop, um später darauf zugreifen zu können. Wenn die Sicherung später in der Nacht läuft, werden alle 100 Kopien dieser Datei erfasst, doch dank der Deduplizierung wird nur eine einzige tatsächliche Datei gespeichert, mit 99 Verweisen oder Zeigern auf das Original.

In diesem Beispiel haben wir eine Deduplizierungsrate von 100 zu 1 gesehen. In Kombination mit der Datenkomprimierung werden nur die gespeicherten Instanzen der Daten komprimiert, um die Speicherkapazität durch die effiziente Kodierung der Daten weiter zu erhöhen.

Was ist der Prozess der Datendeduplizierung und wie funktioniert er?

Bei der Deduplizierung werden die Daten analysiert, um die eindeutigen Datenblöcke zu identifizieren, bevor sie gespeichert werden. Werden Duplikate eines einzelnen Datenblocks gefunden, werden die redundanten Muster gelöscht und durch Verweise oder Zeiger auf die gespeicherten eindeutigen Daten ersetzt. Der Agent, der die Deduplizierung durchführt, weist jedem gespeicherten Datenblock eine eindeutige Identifikationsnummer zu.

Werden bei der Überprüfung der eindeutigen Identifikationsnummern doppelte Daten gefunden, werden die neu entdeckten redundanten Informationen entfernt. Im Rahmen des Deduplizierungsprozesses werden Datenblöcke oder -chunks verglichen, indem die den gespeicherten Daten zugewiesenen eindeutigen Identifikationsnummern gescannt werden. Wird eine doppelte Identifikationsnummer gefunden, wird der neue Daten-Chunk mit der doppelten Identifikationsnummer als redundante Kopie angesehen und gelöscht. Der Deduplizierungsagent geht davon aus, dass doppelte eindeutige Nummern einen redundanten Datenblock bedeuten.

Die Datendeduplizierung kann entweder inline während des Datenflusses oder im „Nachbearbeitungsprozess“ erfolgen, nachdem die Informationen bereits auf Speichergeräte geschrieben wurden.

Die Datendeduplizierung läuft im Hintergrund ab und folgt vorgegebenen Optimierungsrichtlinien, um Dateien zu identifizieren, die bearbeitet werden müssen. Der Deduplizierungsagent zerlegt die Zieldateien dann in variable Datenblöcke, identifiziert die eindeutigen Blöcke und speichert sie mit zugewiesenen eindeutigen Identifikationsnummern. Im Rahmen des Deduplizierungsprozesses werden doppelte Datenblöcke entfernt und durch identische Verweise auf gespeicherte Daten ersetzt. Anschließend stellt der Deduplizierungsagent den ursprünglichen Dateistrom mit den neu optimierten Dateien wieder her.

Wie bereits im E-Mail-Beispiel erwähnt, sind (bei bestimmten Datentypen) Deduplizierungsverhältnisse von bis zu 90:1 keine Seltenheit, was die Vorteile der Deduplizierung noch verstärkt. Eine noch größere Speichereffizienz wird durch die Kombination von Deduplizierung mit Datenkomprimierung erzielt, wodurch die Größe der gespeicherten Daten und ihr Speicherbedarf weiter reduziert werden.

Die Datendeduplizierung ist ein einfaches Konzept, das erheblich zur Reduzierung der Speicherressourcen und der damit verbundenen Kosten beiträgt. In Verbindung mit Datenkomprimierung steigen die Einsparungen, und die Leistung der Speichergeräte sowie der Anwendungen wird verbessert.

Warum ist die Datendeduplizierung wichtig?

Das ungebremste exponentielle Datenwachstum in Verbindung mit immer kürzer werdenden Backup-Fenstern, SLAs zur Datenaufbewahrung und regulatorischen Anforderungen belastet die IT-Ressourcen und das Unternehmenswachstum. Die Datendeduplizierungstechnologie reduziert den Bedarf an physischer Festplattenkapazität und erfüllt gleichzeitig die Anforderungen an die Datenaufbewahrung.

Die täglich erzeugte Datenmenge ist atemberaubend, und all diese Daten müssen optimiert werden, um die Speicherkapazität besser zu nutzen und sie vor Verlust zu schützen. Im Jahr 2020 erzeugten die Menschen im Durchschnitt 1,7 MB Daten pro Sekunde und pro Person auf der Erde.1 Bis 2025 werden schätzungsweise täglich 463 Exabyte an Daten erzeugt.2

Leider handelt es sich bei den meisten gespeicherten Daten um Duplikate, die die Speicherkosten der Kunden erhöhen und die Leistung sowie die Auslastung von Cloud-Systemen beeinträchtigen. So führt beispielsweise die gemeinsame Nutzung von Dateien durch Benutzer zu vielen doppelten Kopien derselben Datei. In virtualisierten Umgebungen können Gastbetriebssysteme auf mehreren virtuellen Maschinen (VMs) nahezu identisch sein. Selbst Backup-Snapshots können von einem Tag zum anderen geringfügige Unterschiede aufweisen. Die Deduplizierung beseitigt diese Ineffizienzen aus Speichersystemen.

Nach Schätzungen von Microsoft lassen sich bei Virtualisierungsbibliotheken typischerweise bis zu 50 % Speicherplatz einsparen, während bei Virtualisierungsbibliotheken sogar bis zu 95 % Speicherplatz eingespart werden könnenDie Einsparungen variieren je nach Datensatz.

Vorteile der Datendeduplizierung

Anwendungen und die von ihnen generierten Daten sind die Triebkräfte der Geschäftsanalytik und der entscheidende Faktor für erfolgreiches Wachstum. Die Bewältigung des Datenwachstums und die Vorteile der Deduplizierung beschränken sich nicht auf Speichersysteme, sondern erstrecken sich auf die gesamte IT-Infrastruktur und die Anwendungsleistung. Ein durch Deduplizierung und Komprimierung reduzierter Speicherbedarf senkt die Speicherkosten, entlastet das Netzwerk und verringert Bandbreitenengpässe. Zudem verbessert sich die Leistung von Anwendungen an den Endpunkten, was zur Steigerung der Produktivität von Remote-Mitarbeitern beiträgt.

Lösungen zur Datendeduplizierung bieten erhebliche geschäftliche Vorteile, die über Bereiche hinausgehen, die in direktem Zusammenhang mit Speichergeräten stehen:

  • Geringere Kosten. Ein geringerer Speicherbedarf führt zu niedrigeren Ausgaben, die sich auf den gesamten IT-Betrieb auswirken. Weniger zu verwaltende Infrastruktur bedeutet weniger Verwaltungs- und Managementressourcen sowie geringere Gesamtkosten bei Cloud-Anbietern für Datenübertragung und Netzwerkverkehr. Zu den Einsparungen beim lokalen Speicher gehören die Investitionskosten (Capex) für die Speichergeräte und den von ihnen beanspruchten Platz sowie für Kühlsysteme. Die Einsparungen umfassen zudem die Betriebskosten (Opex) für Speicherverwaltung, Kühlung und andere Versorgungsleistungen, einschließlich Strom.
  • Längere Datenaufbewahrung. Dank der Datendeduplizierung haben Unternehmen den Vorteil, dass sie kleinere Datensätze über längere Zeiträume aufbewahren und strengere Aufbewahrungsanforderungen erfüllen können.
  • Höhere Gesamtleistung. Da Cloud-Anbieter viele ihrer Gebühren an den Datenverkehr koppeln, ist es für Kunden sinnvoll, ihre Datensätze zu optimieren. Ein geringerer Datenverkehr zwischen Cloud-Standorten senkt die anfallenden Kosten und setzt Netzwerkbandbreite für mehr Nutzer sowie eine schnellere Bereitstellung von Diensten frei. Für Unternehmen ist es ratsam, ihre Daten zu deduplizieren, bevor sie in die Cloud übertragen werden. Ebenso ist es sinnvoll, in der Cloud gespeicherte Daten zu deduplizieren.

Häufige Anwendungsfälle für die Datendeduplizierung

Unternehmen jeder Größe benötigen Deduplizierung für diese alltäglichen Anwendungsfälle:

  • Virtuelle Maschinen. VMs mit Anwendungsbereitstellungen führen zu doppelten Gastsystemen und zugehörigen Daten. Durch Deduplizierung können VMs effizienter arbeiten.
  • Endgeräte. Endgeräte, darunter Desktops und Laptops, neigen dazu, doppelte Daten anzusammeln, die regelmäßig dedupliziert werden müssen, um eine bessere Leistung und effizientere Sicherungsvorgänge zu gewährleisten.
  • Cloud-Speicher. Da immer mehr Daten in die Cloud verlagert werden, bietet die Deduplizierung in der Cloud enorme Vorteile, da die Anhäufung von Daten dort kostspieliger sein kann als bei der lokalen Datenspeicherung, wenn sie unkontrolliert bleibt. Für manche Kunden kann es zur Kostensenkung hilfreich sein, ihre Daten vor der Übertragung in die Cloud zur langfristigen Aufbewahrung zu deduplizieren. Im Allgemeinen senkt die Verkleinerung des Datensatzes die Kosten und verbessert die Netzwerkleistung sowie die Gesamtleistung.

Bietet Commvault Datendeduplizierung an?

Ja, Commvault bietet in seinem Portfolio an Datensicherungslösungen eine Deduplizierung auf Unternehmensniveau an. Dank unserer ausgefeilten Deduplizierungsfunktionen profitieren Kunden von hoher Leistung, Speicheroptimierung und Kosteneinsparungen. Fordern Sie noch heute eine Demo an, um zu erfahren, wie Ihr Unternehmen davon profitieren kann!

Quellen

  1. Domo.com 2020. „Data Never Sleeps 6.0.“
  2. Raconteur. Infografik „Data in a Day“.
  3. Microsoft 2021. „Why is Data Deduplication useful?“
  4. WinPure, Januar 2021. „Vorteile der Datendeduplizierung: Verbessern Sie den ROI Ihres Unternehmens.“

Möchten Sie Datenschutz in der Praxis erleben?

Sehen Sie sich noch heute das voll funktionsfähige Full-Service-Produkt an und erfahren Sie, wie Commvault Ihre Anforderungen direkt erfüllen kann.