Skip to content

Operaciones de resiliencia

Cómo las operaciones de resiliencia (ResOps) potencian la capacidad de recuperación de la empresa

La resiliencia empresarial no falla por falta de herramientas, sino porque los equipos de operaciones, seguridad e infraestructura carecen de un marco común y cuantificable para demostrar Recovery.

Son las 2:47 de la madrugada y hay 40 personas en tu centro de control de incidentes. El ransomware afectó a una carga de trabajo de primer nivel hace seis horas. La contención ya se ha llevado a cabo. El equipo forense ha validado dos puntos de Recovery. Y ahora todo el mundo está a la espera de la única pregunta para la que nadie estaba preparado: ¿qué servicios restauramos primero, en qué orden y cómo sabemos que los datos están realmente limpios? Tu administrador de copias de seguridad inicia la tarea de Recovery. Tu responsable de seguridad abre el informe de amenazas. Tu responsable de infraestructura abre el manual de procedimientos —el que se actualizó por última vez hace dieciocho meses—. Nadie tiene una respuesta común. Nadie ha ensayado esto juntos. Esta es la brecha que las Operaciones de Resiliencia —ResOps— están diseñadas para cerrar. No después del incidente. Antes de que se produzca.

Las operaciones de resiliencia (ResOps) son una disciplina operativa que coordina a los equipos de seguridad, infraestructura y operaciones en torno a los servicios críticos, los niveles de tolerancia al impacto definidos y la validación continua, de modo que las organizaciones puedan resistir las interrupciones y demostrar su capacidad de recuperación con pruebas fehacientes. Commvault Cloud respalda las ResOps con inteligencia de Recovery, visibilidad del estado de seguridad, «Cleanroom Recovery» para la restauración aislada, detección de anomalías basada en IA y pruebas de Recovery automatizadas en entornos híbridos, multinube, SaaS y basados en IA.

Menos del 7 %

Menos del 7 % de las organizaciones pueden recuperarse de un ataque de ransomware en las 24 horas siguientes a su detección. Para las empresas que operan en entornos automatizados y estrechamente interconectados —en los que una sola carga de trabajo comprometida puede provocar una paralización operativa total—, esta estadística define la brecha que ResOps se propone cerrar.


¿Qué es ResOps y en qué se diferencia de las copias de seguridad y la recuperación ante desastres?

Backup and Recovery son disciplinas de infraestructura: responden a si los datos existen y a si un centro de datos puede realizar una conmutación por error. ResOps es una disciplina operativa empresarial: responde a si los servicios críticos de la empresa pueden recuperarse de principio a fin, en condiciones de estrés reales y dentro de unos límites de impacto definidos, y aporta pruebas que lo demuestran.

Mientras que la recuperación ante desastres (DR) aborda la recuperación como un procedimiento a cargo del departamento de TI, ResOps la integra en el ritmo operativo de toda la empresa. Un Consejo de ResOps otorga a los equipos multifuncionales —ingeniería, seguridad, infraestructura, operaciones y prestación de servicios— la responsabilidad compartida y los derechos de decisión sobre los resultados de resiliencia. Recovery se rige, por tanto, por dos objetivos cuantificables: los Indicadores de Resiliencia del Servicio (SRI), que definen el nivel de rendimiento que debe alcanzar cada servicio crítico ante una interrupción, y el Tiempo Medio de Recuperación Completa (MTCR), que mide la rapidez con la que se alcanza realmente dicho estado. El resultado es un cambio de las pruebas anuales de Recovery ante desastres y los manuales de procedimientos estáticos a una capacidad de recuperación medida de forma continua y sobre la que se puede informar al consejo de administración.

  • Mapeo de servicios críticos: ResOps comienza identificando la «empresa mínima viable» (MVC) —el conjunto más reducido de servicios críticos necesarios para mantener las operaciones empresariales— y definiendo los niveles de impacto aceptables para cada uno de ellos. Esta definición del alcance sirve de base para la gobernanza posterior y las prioridades de prueba.
  • Objetivos de rendimiento basados en el SRI: A cada servicio crítico se le asigna un indicador de resiliencia del servicio (SRI), es decir, un objetivo específico y verificable sobre cómo debe funcionar el servicio en caso de interrupción. Los SRI sustituyen las vagas intenciones de Recovery por objetivos más cuantificables y que permiten rendir cuentas.
  • Seguimiento del MTCR: El tiempo medio hasta la recuperación completa (MTCR) mide el tiempo transcurrido desde la declaración de un incidente hasta la restauración verificada de un servicio crítico. A diferencia del objetivo de tiempo de recuperación (RTO), que mide la restauración del tiempo de actividad, el MTCR incorpora pasos de validación para reforzar la confianza en la recuperación.
  • Competencias decisorias interfuncionales: ResOps define quién toma las decisiones de Recovery, en qué orden y en qué condiciones, utilizando diagramas RACI, estructuras de autoridad de respaldo y manuales de procedimientos preaprobados. Esto ayuda a reducir las lagunas de coordinación que pueden producirse cuando equipos aislados responden durante un incidente.
  • Ritmo de validación continua: ResOps sustituye las pruebas anuales de recuperación ante desastres (DR) por un ritmo continuo de simulaciones, ejercicios de simulación y restauraciones en sala limpia, cada uno de los cuales aporta pruebas de que las capacidades de recuperación siguen estando actualizadas y son eficaces.

El marco ResOps: cinco ámbitos integrados para la resiliencia empresarial

El marco ResOps es un modelo operativo de ciclo cerrado construido en torno a cinco ámbitos integrados —Gobernanza de la resiliencia, Planificación de la recuperación, Arquitectura de la recuperación, Garantía de la resiliencia y Mediciones de la resiliencia— que, en conjunto, ayudan a las organizaciones a mantener los servicios críticos dentro de unos límites de tolerancia al impacto definidos durante las interrupciones. Una vez establecidos estos ámbitos, los equipos pueden adoptar una postura de mejora continua, transformando la resiliencia de un proyecto puntual en un programa continuo y cuantificable.

Cada ámbito desempeña un papel específico en el circuito cerrado de ResOps. La gobernanza de la resiliencia establece los principios rectores, define la «empresa mínima viable» (MVC) y crea una responsabilidad interfuncional a través de un Consejo de ResOps. La planificación de la recuperación y la arquitectura de recuperación traducen dicha gobernanza en manuales de procedimientos verificables, niveles de recuperabilidad, separación de los planos de control y de datos, puntos de recuperación inmutables y aislamiento mediante «air gap». La garantía de resiliencia valida estas arquitecturas mediante pruebas continuas —como simulaciones, restauraciones en sala limpia y ejercicios de simulación—, mientras que las mediciones de resiliencia realizan un seguimiento de los SRI, el MTCR y los resultados de los informes para facilitar la visibilidad y la toma de decisiones.

  • Gobernanza de la resiliencia: establece unos estatutos de ResOps, define los umbrales de tolerancia al impacto para cada servicio crítico, alinea los resultados de resiliencia con la financiación de la organización y crea un Consejo de ResOps multifuncional para compartir la responsabilidad y la toma de decisiones.
  • Planificación de la Recovery: define niveles de recuperabilidad en función de la criticidad del negocio, incluyendo manuales técnicos para el reinicio del sistema, diagramas RACI de las responsabilidades de recuperación, mapas de dependencias y calendarios de pruebas, de modo que los equipos dispongan de una ruta de recuperación documentada y probada.
  • Arquitectura de Recovery: Define la separación entre planos de control, planos de datos y niveles de almacenamiento; incorpora aislamiento físico (air-gap), inmutabilidad y aislamiento de dominios; y está diseñada para reducir el radio de impacto dentro del entorno de Recovery, con el fin de facilitar una restauración más rápida y controlada.
  • Garantía de resiliencia: incorpora la validación continua en el ritmo operativo —incluidas restauraciones en «sala limpia», simulaciones y ejercicios de simulación regulados— diseñada para validar los procesos de Recovery y reducir el riesgo de reinfección.
  • Medidas de resiliencia: realiza un seguimiento de métricas centradas en los resultados, como las tolerancias de impacto, el MTCR, el cumplimiento del SRI y el estado de los servicios críticos, y las recoge en informes trimestrales de resiliencia para que la dirección pueda disponer de visibilidad.

Cómo Commvault Cloud respalda ResOps en entornos empresariales híbridos

Commvault Cloud respalda ResOps como una plataforma basada en pruebas que ayuda a ampliar la ciberresiliencia más allá de las herramientas de protección, para convertirla en un modelo operativo más amplio. Aunque ResOps es una disciplina más que un producto, Commvault Cloud ofrece capacidades que ayudan a las organizaciones a poner en práctica sus cinco ámbitos en entornos híbridos, multinube, SaaS y basados en IA.

Commvault Cloud ayuda a subsanar la falta de pruebas en ResOps al combinar inteligencia de recuperación, visibilidad del estado de seguridad y flujos de trabajo de recuperación en una plataforma unificada. En lugar de unir herramientas puntuales para copias de seguridad, recuperación ante desastres (DR) y operaciones de seguridad, Commvault Cloud ofrece una consola unificada de protección de datos para todas las cargas de trabajo de la empresa —en las instalaciones, en la nube y en SaaS— al tiempo que se integra con herramientas de SecOps para que la detección y la recuperación puedan funcionar de manera coordinada. Este enfoque permite a los equipos multifuncionales definir los SRI, medir el MTCR y validar continuamente los procesos de Recovery en entornos aislados, satisfaciendo así las necesidades de pruebas de las partes interesadas, incluidos los directivos y los organismos reguladores.

  • Recuperación en «cleanroom»: La función «Cleanroom Recovery» de Commvault proporciona, bajo demanda, un entorno aislado y físicamente separado —independiente de la red de producción— en el que las cargas de trabajo críticas pueden restaurarse, analizarse y escanearse antes de volver a poner los servicios en producción. (Consulte la pregunta 3 de las preguntas frecuentes para conocer los pasos a seguir).
  • Detección de anomalías basada en IA: La detección basada en IA de Commvault Cloud ayuda a identificar de forma temprana patrones inusuales de acceso a los datos y anomalías en las copias de seguridad, lo que contribuye a limitar el impacto de los incidentes y a reducir el alcance de la Recovery.
  • Pruebas de recuperación automatizadas: En lugar de depender únicamente de ejercicios periódicos de recuperación ante desastres (DR), Commvault Cloud permite una validación continua de la capacidad de recuperación mediante la ejecución de pruebas de recuperación sin interrupciones y la comparación de los resultados con los objetivos de SRI, lo que ayuda a detectar deficiencias antes de que se produzca un incidente.
  • Consola unificada de protección de datos: un único panel de control abarca las cargas de trabajo locales, en la nube, SaaS y basadas en IA, lo que ayuda a reducir las lagunas de cobertura y la proliferación de herramientas que pueden afectar a la confianza en Recovery en entornos híbridos.
  • Visibilidad del estado de resiliencia e informes de SRI: Commvault Cloud ofrece visibilidad del estado de resiliencia de todas las cargas de trabajo protegidas en una vista unificada —realizando un seguimiento del cumplimiento de los SRI, las tendencias del MTCR y las brechas de tolerancia— y generando informes para apoyar a las partes interesadas internas y externas.

Microsoft Sentinel (SIEM)

La integración bidireccional permite a Commvault Cloud transmitir datos de telemetría de Recovery a Microsoft Sentinel para correlacionarlos con las detecciones de amenazas, lo que ayuda a tomar decisiones de recuperación basadas en el contexto de seguridad actual.

CrowdStrike Falcon (plataforma de seguridad)

La integración con CrowdStrike proporciona inteligencia sobre amenazas que ayuda a fundamentar la selección del punto de Recovery, de modo que los entornos restaurados puedan evaluarse en función de indicadores conocidos de compromiso antes de volver a producción.

Splunk (SIEM/SOAR)

Commvault Cloud envía datos de eventos de Recovery a Splunk para proporcionar una visibilidad unificada de las operaciones de seguridad, lo que ayuda a los equipos a correlacionar las anomalías en las copias de seguridad con una actividad de amenazas más amplia.

Microsoft Azure / AWS / Google Cloud (nube)

La portabilidad de cargas de trabajo «cualquier-a-cualquier» de Commvault Cloud permite la Recovery en los principales proveedores a hiperescala, lo que ayuda a las organizaciones a mantener la resiliencia a medida que cambian las dependencias entre los entornos en la nube.

ServiceNow (ITSM)

La integración con ServiceNow permite la creación automatizada de tickets de incidencias y la coordinación de flujos de trabajo de Recovery, lo que ayuda a conectar la detección de amenazas con la respuesta de las operaciones de TI.

Cómo funciona ResOps de principio a fin: desde la gobernanza hasta la Recovery limpia


Descubre

La consola unificada de protección de datos ayuda a clasificar los datos de la empresa e identificar las dependencias de los servicios, creando así un inventario centralizado de lo que constituye la «empresa mínima viable» (MVC) y de qué cargas de trabajo se ajustan a niveles específicos de recuperabilidad.


Protege

La protección basada en políticas se aplica a todas las cargas de trabajo según los niveles de recuperabilidad definidos en la planificación de la recuperación. Esto da como resultado puntos de recuperación diseñados con principios de inmutabilidad y aislamiento físico, lo que refleja el enfoque de la arquitectura de Recovery —como la separación de los planos de control, los planos de datos y el almacenamiento, y las consideraciones para reducir el radio de impacto—.


Detectar

La detección de anomalías basada en IA supervisa la telemetría de las copias de seguridad y los patrones de acceso a los datos. Cuando se identifican irregularidades, las alertas pueden enviarse a plataformas SecOps integradas, lo que ayuda a los equipos de seguridad y de Recovery a actuar a partir de una señal compartida y a reducir los retrasos en la respuesta.


Recuperar

Tras la notificación de un incidente, se ejecutan flujos de trabajo orquestados basados en manuales de procedimientos previamente probados, lo que reduce la necesidad de respuestas ad hoc. Cleanroom Recovery proporciona un entorno aislado en el que se pueden analizar y probar los puntos de recuperación antes de que los servicios vuelvan a producción.


Restauración

Los servicios se incorporan a producción según la prioridad del SRI. Se registra el MTCR para cada servicio. La secuencia de Recovery —incluidas las marcas de tiempo, los pasos de validación y el cumplimiento del SRI— puede registrarse y recopilarse en informes para respaldar las revisiones internas y la presentación de informes a las partes interesadas.

ResOps transforma la resiliencia empresarial, pasando de una planificación basada en la documentación a una disciplina operativa validada de forma continua y basada en datos contrastados. Las organizaciones que implementan ResOps obtienen un marco multifuncional que aúna seguridad, TI e infraestructura en torno a una capacidad de recuperación cuantificable, cuyo seguimiento se realiza a través de los SRI, el MTCR y los informes, lo que proporciona visibilidad a los directivos.

Commvault Cloud respalda este modelo mediante Cleanroom Recovery, la detección de anomalías basada en IA, las pruebas de recuperación automatizadas y la protección de datos unificada en todas las cargas de trabajo de la empresa.

El resultado: cuando se produce una interrupción —ya sea por ransomware, un fallo provocado por la IA o cortes en cadena de la infraestructura—, los equipos están mejor preparados, los procesos de Recovery están validados y las organizaciones pueden aportar pruebas de respaldo a las partes interesadas, incluidos los organismos reguladores.

Preguntas frecuentes

¿Qué es ResOps y en qué se diferencia de la Backup and Recovery tradicional?

ResOps aborda una carencia que las copias de seguridad y la recuperación ante desastres no cubren por completo: ¿se pueden recuperar los servicios críticos de principio a fin en condiciones reales, dentro de unos límites de impacto definidos, y podemos demostrarlo? Las copias de seguridad confirman que existen copias de los datos, y la recuperación ante desastres valida la conmutación por error del centro de datos, pero ResOps va más allá al tener en cuenta las dependencias, la validación del estado limpio, las rutas de reconstrucción y la ejecución interfuncional, con métricas como los SRI y el MTCR, compatibles con Commvault Cloud.

¿En qué se diferencia la resiliencia operativa de la planificación de la continuidad del negocio (BCP)?

La planificación de la continuidad del negocio (BCP) define cómo pretende una organización responder ante una interrupción, elaborando procedimientos documentados que se prueban periódicamente. La resiliencia operativa y ResOps se centran en probar y mejorar continuamente la capacidad real de una organización para resistir las interrupciones dentro de los límites de tolerancia definidos. Commvault Cloud respalda este cambio proporcionando la capa de medición y validación —seguimiento de los SRI, informes de MTCR y pruebas basadas en «Cleanroom»— que permite a las organizaciones demostrar la ejecución en lugar de limitarse a documentar la intención.

¿Cómo funciona la Cleanroom Recovery de Commvault Cloud para la respuesta ante el ransomware?

Cuando se produce un incidente, Commvault Cloud habilita un entorno «Cleanroom» —un segmento de red aislado diseñado para limitar la exposición a los sistemas comprometidos—. Los puntos de recuperación se analizan en busca de posibles amenazas antes de que las actividades de validación —como el inicio de aplicaciones y las comprobaciones de dependencias— ayuden a confirmar la «Readiness», y el proceso genera registros y artefactos que pueden servir de apoyo para la revisión interna y la presentación de informes reglamentarios.

¿En qué se diferencia ResOps de lo que ofrecen Rubrik, Cohesity o Veeam?

Rubrik, Cohesity y Veeam proporcionan capacidades de protección y recuperación de datos, mientras que ResOps introduce un modelo operativo que coordina a los equipos de seguridad, operaciones e infraestructura en torno a tolerancias de impacto definidas y una capacidad de recuperación basada en pruebas. Commvault Cloud respalda este enfoque con capacidades como un plano de control unificado, Cleanroom Recovery, la detección de anomalías basada en IA y la medición automatizada de métricas de resiliencia como los SRI y el MTCR.

¿Qué marcos de cumplimiento exigen pruebas de resiliencia operativa y cómo las aborda ResOps?

Marcos como NIS2, la Ley de Ciberresiliencia de la UE, DORA y el NIST CSF 2.0 hacen hincapié en la resiliencia, las pruebas y la rendición de cuentas, aunque los requisitos específicos varían según la normativa y la jurisdicción. ResOps puede ayudar a las organizaciones a cumplir estas expectativas proporcionando un modelo operativo y resultados medibles —como métricas SRI y registros de validación de Recovery— respaldados por las capacidades de Commvault Cloud.

¿Cuándo debería una empresa adoptar ResOps en lugar de limitarse a mejorar su programa de recuperación ante desastres (DR) existente?

Las organizaciones pueden mejorar la recuperación ante desastres (DR) cuando abordan deficiencias específicas, como los objetivos de tiempo de recuperación, los objetivos de punto de recuperación o la cobertura de las cargas de trabajo. ResOps cobra relevancia cuando los retos son más amplios: equipos aislados, dependencias poco claras o visibilidad limitada sobre el estado de Readiness para la recuperación. Commvault Cloud facilita la transición de la recuperación ante desastres (DR) a ResOps al proporcionar un panel de control unificado, Cleanroom Recovery para pruebas validadas y métricas basadas en el SRI que hacen que el estado de Readiness para la recuperación sea visible y se pueda comunicar a la dirección y a los reguladores.

Demuestra tu resiliencia con Commvault Cloud ResOps

Empieza por los servicios críticos, define los niveles de tolerancia al impacto y valida una Recovery satisfactoria mediante pruebas, utilizando el SRI, el MTCR y Commvault Cloud.

Recursos relacionados

Explora

¿Qué son las operaciones de resiliencia (ResOps)?

Conoce el modelo operativo de ResOps: cómo aúna la seguridad de los datos, la resiliencia de la identidad y la Recovery cibernética en una disciplina continua para las empresas de la era de la IA.
Lee el artículo sobre «¿Qué son las operaciones de resiliencia (ResOps)?»
Blog

Un nuevo enfoque de la resiliencia para la era de la IA

Descubre cómo gestionar de forma activa la resiliencia en entornos de IA cada vez más complejos con un nuevo enfoque operativo multifuncional impulsado por Commvault Cloud.
Lee la entrada del blog sobre «Un nuevo enfoque de la resiliencia para la era de la IA»