Skip to content

Was ist Failover?

Failover bezeichnet den automatischen oder manuellen Vorgang der Umschaltung des Betriebs von einem ausgefallenen Primärsystem auf ein funktionierendes Sekundärsystem.

Was ist Failover?

Die Failover-Technologie bildet die entscheidende Brücke zwischen Systemausfall und Geschäftskontinuität. Im Gegensatz zu einfachen Backup-Lösungen, die sich auf die Datensicherung konzentrieren, leiten Failover-Mechanismen den Betrieb innerhalb von Sekunden aktiv auf sekundäre Systeme um und tragen so dazu bei, die Kettenreaktion ungeplanter Ausfälle zu verhindern.

Grundlagen und Arten des Failovers

Failover bezeichnet den automatischen oder manuellen Prozess der Umschaltung des Betriebs von einem ausgefallenen Primärsystem auf ein funktionierendes Sekundärsystem. Diese Funktion gewährleistet die Aufrechterhaltung des Geschäftsbetriebs, indem sie Ausfälle erkennt und Arbeitslasten umleitet, bevor es für die Nutzer zu Dienstunterbrechungen kommt.

Der Unterschied zwischen Failover und Switchover liegt im Ausführungszusammenhang. Ein Failover erfolgt automatisch bei unerwarteten Systemausfällen, während ein Switchover geplante Übergänge während Wartungsfenstern oder geplanter Updates umfasst. Beide spielen eine entscheidende Rolle bei der Aufrechterhaltung der Serviceverfügbarkeit, doch aufgrund seines automatischen Charakters ist das Failover unverzichtbar für den Schutz vor unvorhersehbaren Störungen.

Unternehmen setzen je nach ihren Wiederherstellungszeitzielen (Recovery Time Objectives, RTO) und Budgetvorgaben verschiedene Failover-Arten ein:

  • Automatisches Failover: Systeme überwachen die primäre Infrastruktur und leiten die Umleitung ohne menschliches Eingreifen ein.
  • Manuelles Failover: Administratoren steuern den Übergangsprozess und übernehmen die Aufsicht in komplexen Umgebungen, in denen automatisierte Entscheidungen zusätzliche Risiken mit sich bringen könnten. Dieser Ansatz eignet sich für Unternehmen mit dedizierten IT-Teams, die in der Lage sind, schnell zu reagieren.
  • Hot-Standby: Sekundäre Systeme laufen parallel zur primären Infrastruktur und sorgen für eine Datensynchronisation in Echtzeit. Diese Konfiguration ermöglicht eine nahezu sofortige Recovery, erfordert jedoch doppelte Investitionen in die Infrastruktur.
  • Cold-Standby: Backup-Systeme bleiben ausgeschaltet, bis sie benötigt werden, was die Betriebskosten senkt, jedoch längere Recovery-Zeiten in Kauf nimmt. Kleine Unternehmen entscheiden sich oft für diese Option, wenn sie den Schutz gegen Budgetbeschränkungen abwägen.

Auswahl des richtigen Failover-Typs

Die Auswahl geeigneter Failover-Mechanismen erfordert eine systematische Bewertung:

    1. Bewertung der geschäftlichen Auswirkungen: Berechnen Sie die potenziellen Verluste pro Minute Ausfallzeit für verschiedene Abteilungen und Dienste.
    2. Recovery-Ziele definieren: Legen Sie für jedes kritische System die maximal akzeptable Ausfallzeit (RTO) und den maximal akzeptablen Datenverlust (Recovery Point Objective, RPO) fest.
    3. Technische Anforderungen bewerten: Dokumentieren Sie Systemabhängigkeiten, Datenvolumina und Netzwerkbandbreitenkapazitäten.
    4. Budgetbeschränkungen berücksichtigen: Wägen Sie die Infrastrukturkosten gegen potenzielle Ausfallverluste ab.
    5. Implementierungsoptionen testen: Führen Sie Proof-of-Concept-Implementierungen durch, um die Leistungserwartungen zu validieren.

Vergleich verschiedener Failover-Arten

Die folgende Tabelle bietet einen Vergleich verschiedener Failover-Ansätze, um Unternehmen bei der Auswahl der für ihre Anforderungen am besten geeigneten Lösung zu unterstützen.

Failover-Typ Recovery Time Risk eines Datenverlusts Kosten Bester Anwendungsfall
Automatischer Hot-Standby Sekunden Nahezu null Am höchsten Geschäftskritische Anwendungen
Manueller Hot-Standby Protokoll Minimal Hoch Komplexe Umgebungen, die eine Überwachung erfordern
Automatischer Cold-Standby Protokoll Gering Mäßig Standard-Geschäftsanwendungen
Manueller Kaltstandby Minuten bis Stunden Mäßig Am niedrigsten Nicht kritische Systeme

Unterschiede zwischen Failover, Redundanz und Backup

Das Verständnis der Unterschiede zwischen Failover, Redundanz und Backup verhindert, dass Unternehmen kritische Lücken in ihren Ausfallsicherheitsstrategien hinterlassen. Jede Komponente erfüllt spezifische Zwecke innerhalb eines umfassenden Schutzkonzepts.

Stellen Sie sich ein Einzelhandelsunternehmen vor, bei dem während der Black-Friday-Aktion ein Serverausfall auftritt. Ein reiner Backup-Ansatz würde zwar die Transaktionsdaten sichern, die Website jedoch stundenlang offline lassen, während Administratoren die Systeme wiederherstellen. Im Gegensatz dazu würden Failover-Mechanismen den Datenverkehr automatisch auf sekundäre Server umleiten und so den Verkaufsbetrieb aufrechterhalten, während IT-Teams den Ausfall des Primärservers beheben.

Diese drei Konzepte wirken zusammen, um einen mehrschichtigen Schutz zu schaffen:

  • Failover sorgt für sofortige Betriebskontinuität, indem bei Ausfällen auf alternative Systeme umgeschaltet wird. Der Schwerpunkt liegt dabei auf der Aufrechterhaltung der Serviceverfügbarkeit und nicht allein auf der Datensicherung.
  • Redundanz beseitigt einzelne Fehlerquellen durch doppelte Komponenten wie Stromversorgungen, Netzwerkpfade oder ganze Rechenzentren. Diese Duplizierung bildet die Grundlage, die Failover-Fähigkeiten ermöglicht.
  • Backups sichern Datenkopien für die Recovery nach Vorfällen und schützen vor Beschädigung, Löschung oder Ransomware-Angriffen. Obwohl Backups für den Datenschutz unverzichtbar sind, können sie allein keine Dienstunterbrechungen verhindern.

Integrationsschritte für umfassenden Schutz

Der Aufbau einer effektiven Ausfallsicherheit erfordert die Koordination folgender Elemente:

  1. Erfassung kritischer Systeme: Identifizieren Sie Anwendungen und Dienste, die eine kontinuierliche Verfügbarkeit erfordern.
  2. Entwerfen Sie eine redundante Architektur: Implementieren Sie doppelte Komponenten für die identifizierten kritischen Pfade.
  3. Failover-Mechanismen konfigurieren: Richten Sie automatische Erkennungs- und Umschaltfunktionen zwischen redundanten Systemen ein.
  4. Erstellen Sie Backup-Zeitpläne: Erstellen Sie regelmäßige Datensnapshots, die den Echtzeitschutz ergänzen.
  5. Integrationspunkte testen: Stellen Sie sicher, dass Failover-Ereignisse weder die Sicherungsprozesse noch die Datenkonsistenz beeinträchtigen.

Failover vs. Redundanz vs. Sicherung

Diese Tabelle verdeutlicht die wesentlichen Unterschiede zwischen Failover-, Redundanz- und Backup-Ansätzen.

Aspekt Failover Redundanz Sicherung
Hauptzweck Aufrechterhaltung des Betriebs Beseitigung einzelner Ausfallpunkte Sicherung von Datenkopien
Recovery-Zeit Sekunden bis Minuten Sofort (vorbeugend) Stunden bis Tage
Datenschutz Beschränkt auf den Zeitpunkt der Umschaltung Duplizierung in Echtzeit Snapshots zu einem bestimmten Zeitpunkt
Kostenstruktur Mäßig bis hoch Hoch (doppelte Infrastruktur) Niedrig bis moderat
Komplexität Mittel Hoch Niedrig

Wie funktioniert Failover?

Failover-Mechanismen tragen dazu bei, Unternehmen vor den kaskadierenden Auswirkungen von Systemausfällen zu schützen.

  • Heartbeat-Überwachung: Primäre und sekundäre Systeme tauschen regelmäßig Statussignale aus, in der Regel alle paar Sekunden. Wenn die Heartbeat-Signale ausbleiben, leitet das Überwachungssystem vorab festgelegte Failover-Prozesse ein. Diese kontinuierliche Kommunikation ermöglicht die Erkennung von Ausfällen in verteilten Umgebungen innerhalb von weniger als einer Minute.
  • Failover-Prozess: Der Übergang umfasst mehr als nur eine einfache Umleitung des Datenverkehrs. Die Systeme müssen den Datenstatus synchronisieren, DNS-Einträge aktualisieren, Lastverteiler neu konfigurieren und abhängige Dienste benachrichtigen. Moderne Implementierungen wickeln diese komplexen Abläufe automatisch ab und verkürzen so die Zeiten der Recovery von Stunden auf Sekunden.
  • Geschäftskontinuität: Über die technische Recovery hinaus gewährleisten Failover-Strategien den Kundenzugang, wahren die Transaktionsintegrität und schützen die Einnahmequellen.
  • Failback: Nach der Behebung von Problemen im Primärsystem muss der Betrieb zur ursprünglichen Infrastruktur zurückkehren. Dieser umgekehrte Prozess erfordert eine sorgfältige Planung, um Dateninkonsistenzen oder Dienstunterbrechungen während der Rückführung zu vermeiden.

Failover-Cluster

Ein Failover-Cluster besteht aus miteinander verbundenen Servern, die als einheitliches System zusammenarbeiten, um eine kontinuierliche Dienstverfügbarkeit zu gewährleisten. Wenn ein Clusterknoten ausfällt, übernehmen die verbleibenden Knoten automatisch dessen Arbeitslast und gewährleisten so den Betrieb, ohne dass die Nutzer davon beeinträchtigt werden.

Moderne Cluster nutzen dedizierte private Netzwerke für interne Funktionen wie Heartbeat-Signale und Zustandssynchronisation. Öffentliche Netzwerke wickeln Client-Verbindungen separat ab, wodurch sowohl die Leistung als auch die Sicherheit optimiert werden. Gemeinsame Speichersysteme gewährleisten einen konsistenten Datenzugriff über alle Knoten hinweg und ermöglichen so reibungslose Übergänge der Arbeitslasten.

Datenbankcluster tragen zum Schutz vor Datenverlust bei und gewährleisten gleichzeitig die Konsistenz von Transaktionen. Webanwendungscluster verteilen Benutzersitzungen auf mehrere Knoten und verhindern so, dass Ausfälle einzelner Server das Kundenerlebnis beeinträchtigen. Cluster virtueller Maschinen ermöglichen die unterbrechungsfreie Migration ganzer Workloads zwischen physischen Hosts.

Übersicht über die Cluster-Komponenten

Diese Tabelle gibt einen Überblick über die wesentlichen Komponenten, aus denen ein Failover-Cluster besteht.

Cluster-Komponente Beschreibung
Primärknoten Hauptserver, der die Vorgänge abwickelt
Standby-Knoten Backup-Server, bereit zur Übernahme
Heartbeat-Monitor Signalsystem zur Zustandsüberwachung
Gemeinsam genutzter Speicher Stellt sicher, dass die Daten auf beiden Knoten identisch sind
Automatisch/manuell Failover kann vollautomatisch erfolgen (HA)

Lösungen für Netzwerkredundanz und Failover

  • Hochverfügbarkeitsnetzwerke nutzen mehrere Übertragungswege für die Datenübertragung und verhindern so, dass der Ausfall einzelner Komponenten die Kommunikation unterbricht. Unternehmen setzen redundante Switches, Router und Internetverbindungen mit automatischen Failover-Protokollen ein, die den Datenverkehr innerhalb von Millisekunden nach Erkennung eines Ausfalls umleiten.
  • Disaster Recovery erweitert die Failover-Fähigkeiten über einzelne Komponenten hinaus auf ganze Standorte. Bei Naturkatastrophen oder regionalen Ausfällen leiten Failover-Mechanismen den Betrieb auf geografisch entfernte Rechenzentren um und gewährleisten so die Aufrechterhaltung der Geschäftsfunktionen trotz des Ausfalls der lokalen Infrastruktur.
  • Cloud-Failover-Dienste nutzen die verteilte Struktur von Cloud-Plattformen, um einen ausfallsicheren Betrieb zu gewährleisten. Multi-Cloud-Failover-Strategien schützen vor anbieterspezifischen Ausfällen und optimieren gleichzeitig Kosten und Leistung.

Best Practices für Failover und wesentliche Vorteile

Unternehmen, die umfassende Failover-Strategien umsetzen, profitieren von greifbaren Vorteilen bei allen betrieblichen Kennzahlen:

  • Schutz der Workloads: Kritische Anwendungen bleiben trotz Infrastrukturausfällen verfügbar.
  • Einhaltung gesetzlicher Vorschriften: Erfüllung der Verfügbarkeitsanforderungen gemäß den Vorschriften im Gesundheitswesen, im Finanzsektor und im öffentlichen Dienst.
  • Umsatzsicherung: Vermeidung des durchschnittlichen jährlichen Verlusts von 49 Millionen US-Dollar durch Ausfallzeiten.
  • Kundenvertrauen: Aufrechterhaltung der Zuverlässigkeit, die langfristige Geschäftsbeziehungen fördert.

Diese Vorteile gelten branchenübergreifend für Unternehmen, die Hybrid- und Multi-Cloud-Umgebungen betreiben, in denen die Komplexität sowohl das Ausfallrisiko als auch die Herausforderungen bei der Recovery erhöht.

Als bewährte Verfahren werden folgende Maßnahmen empfohlen:

  • Failover und Failback regelmäßig testen: Planen Sie monatliche Übungen ein, bei denen verschiedene Ausfallszenarien simuliert werden. Dokumentieren Sie Reaktionszeiten, identifizieren Sie Engpässe und optimieren Sie die Verfahren auf der Grundlage der Ergebnisse. Regelmäßige Tests können Konfigurationsabweichungen aufdecken, bevor es zu tatsächlichen Notfällen kommt.
  • Überwachung und Benachrichtigungen automatisieren: Richten Sie eine umfassende Überwachung über alle physischen und virtuellen Infrastrukturebenen hinweg ein. Konfigurieren Sie Eskalationsverfahren, die je nach Schweregrad und Systemkritikalität das zuständige Personal benachrichtigen.
  • Failover-Prozesse dokumentieren: Führen Sie detaillierte Runbooks im Rahmen von Business-Continuity- und Disaster-Recovery-Plänen. Beziehen Sie Entscheidungsbäume, Kontaktinformationen und Schritt-für-Schritt-Anleitungen sowohl für automatisierte als auch für manuelle Eingriffe ein.
  • Failover-Cluster für geschäftskritische Anwendungen bereitstellen: Identifizieren Sie Systeme, bei denen Ausfallzeiten unmittelbare geschäftliche Auswirkungen haben. Investieren Sie zunächst in Clustering-Technologie für diese Anwendungen und erweitern Sie die Abdeckung, sobald das Budget dies zulässt.
  • Redundanz auf mehreren Ebenen konzipieren: Bauen Sie Schutzebenen auf, die von Speicher-Arrays bis hin zur Anwendungsebene reichen. Dieser Ansatz der mehrschichtigen Verteidigung trägt dazu bei, zu verhindern, dass einzelne Schwachstellen ganze Dienste gefährden.

Effektive Failover-Strategien kombinieren Technologie, Prozesse und Mitarbeiter, um widerstandsfähige Betriebsabläufe zu schaffen, die modernen Bedrohungen standhalten. Die Investition in geeignete Failover-Mechanismen macht nur einen Bruchteil der potenziellen Ausfallkosten aus und führt gleichzeitig zu messbaren Verbesserungen bei der Kundenzufriedenheit und der Einhaltung gesetzlicher Vorschriften. Unternehmen, die umfassende Failover-Lösungen implementieren, sind in der Lage, kritische Betriebsabläufe unabhängig von infrastrukturellen Herausforderungen oder Sicherheitsbedrohungen aufrechtzuerhalten.

Fordern Sie eine Demo an, um zu erfahren, wie wir Ihnen helfen können, widerstandsfähige Failover-Strategien für Ihre Hybrid- und Multi-Cloud-Umgebungen zu entwickeln.

Verwandte Begriffe

Sicherungsrichtlinie

Eine Reihe von Regeln und Verfahren, die die Strategie eines Unternehmens bei der Erstellung von Sicherungskopien von Daten zur sicheren Aufbewahrung beschreiben.

Erfahren Sie mehr über die Sicherungsrichtlinie

Sicherungsrichtlinie

Eine Reihe von Regeln und Verfahren, die die Strategie eines Unternehmens bei der Erstellung von Sicherungskopien von Daten zur sicheren Aufbewahrung beschreiben.

Erfahren Sie mehr über die Sicherungsrichtlinie

Notfallwiederherstellung

Der Prozess der Wiederherstellung der IT-Infrastruktur und des Betriebs eines Unternehmens nach einer schwerwiegenden Störung, um die Auswirkungen auf den Geschäftsbetrieb zu minimieren und den normalen Betrieb schnell wieder aufzunehmen.

Erfahren Sie mehr über die Notfallwiederherstellung

Notfallwiederherstellung

Der Prozess der Wiederherstellung der IT-Infrastruktur und der Betriebsabläufe eines Unternehmens nach einer schwerwiegenden Störung, um die Auswirkungen auf den Geschäftsbetrieb zu minimieren und den normalen Betrieb schnell wieder aufzunehmen.

Erfahren Sie mehr über Notfallwiederherstellung

RTO und RPO

Wichtige Kennzahlen bei der Planung von Recovery-Plänen, die die maximal akzeptable Ausfallzeit und den maximal akzeptablen Datenverlust während eines Recovery-Vorgangs definieren.

Erfahren Sie mehr über RTO und RPO

RTO und RPO

Wichtige Kennzahlen für die Planung von Recovery-Plänen, die die maximal akzeptable Ausfallzeit und den maximal akzeptablen Datenverlust während eines Recovery-Vorgangs definieren.

Erfahren Sie mehr über RTO und RPO

Verwandte Ressourcen

Entdecken Sie weitere Ressourcen

Lösung im Überblick

Commvault-Reinraum

Erfahren Sie, wie Sie isolierte Recovery-Umgebungen einrichten, damit Ihre Daten vor der Wiederherstellung kritischer Systeme frei von Malware sind.
Erfahren Sie mehr über Commvault Cleanroom
Lösung im Überblick

Leitfaden zur Cyber-Resilienz

Ein praktischer Leitfaden zum Aufbau minimaler, funktionsfähiger Recovery-Funktionen, die Unternehmen dabei helfen, den Geschäftsbetrieb während und nach Cybervorfällen aufrechtzuerhalten.
Erfahren Sie mehr über das Handbuch zur Cyber-Resilienz