RPO, RTO, WRT y MTD: cómo fijar los tiempos de tu plan de recuperación

Las cuatro siglas se explican en cualquier sitio; lo que casi nunca se explica es cómo se calculan y cómo encajan entre ellas. La regla que las ordena cabe en una línea: RTO más WRT nunca puede superar el MTD. Si esa suma se pasa, el plan de recuperación que tienes escrito no sirve, por bien redactado que esté.

Las cuatro métricas de un vistazo

SiglaQué mideQuién pone el númeroEn qué se traduce
RPOCuántos datos puedes perderNegocio, con ITFrecuencia de las copias
RTOCuánto puede estar caído el servicioNegocioTipo de infraestructura y de respaldo
WRTCuánto se tarda en dar por bueno lo restauradoEquipo técnicoProcedimiento de verificación
MTDInterrupción total que aguanta el negocioDirecciónEl techo de todo lo anterior

El orden importa. El MTD se fija primero, porque es el único dato que sale del negocio y no de la infraestructura, y los demás se ajustan por debajo.

Un incidente contado con el reloj en la mano

Una tienda con pedidos continuos, copias cada hora y un MTD acordado de cuatro horas:

  • 15:00 — cae el servidor. La última copia válida es de las 14:00, así que el RPO real de este incidente es de una hora: se pierden los pedidos de esos sesenta minutos.
  • 15:10 — salta la monitorización y arranca el procedimiento. Esos diez minutos cuentan dentro del RTO, aunque casi nadie los suma.
  • 17:00 — la web vuelve a responder. RTO de dos horas desde la caída.
  • 18:30 — comprobados la pasarela de pago, el envío de correos, los formularios y los registros de error. WRT de hora y media.

Total: tres horas y media frente a un MTD de cuatro. Cabe, con poco margen. Si la dirección hubiera fijado un MTD de tres horas, el mismo incidente demostraría que hace falta otra infraestructura, no otro procedimiento.

RPO: la frecuencia de copia, traducida a euros

El RPO es el hueco entre la última copia válida y el incidente, y define directamente cada cuánto hay que copiar. Un RPO de cuatro horas exige copias cada cuatro horas como mínimo. Cuanto más bajo, más cara la solución, porque por debajo de cierta frecuencia ya no se habla de copias sino de replicación continua.

La pregunta que lo aterriza no es técnica: cuánta actividad genera el sistema por hora. Para una tienda con pedidos constantes, una hora perdida son pedidos, pagos a medias y clientes que no entienden qué ha pasado. Para un blog corporativo, un borrador. La misma cifra de RPO cuesta lo mismo y vale cosas muy distintas.

Conviene añadir un matiz que se olvida: una copia que nunca se ha restaurado no cuenta como copia. El RPO real de una organización es el de la última copia que alguien ha probado a levantar. Ese principio, junto con las tres copias, los dos soportes y la copia inmutable fuera de las instalaciones, está desarrollado en la regla 3-2-1 y el backup inmutable que publicamos en Cloud Privado.

RTO y WRT: el servicio vuelve antes de estar bien

El RTO mide hasta que el sistema responde. El WRT mide lo que va desde ahí hasta que el sistema es de fiar: verificar que los datos restaurados son correctos, reconfigurar las conexiones con terceros (APIs, pasarelas de pago, servicios de correo), comprobar formularios y repasar los registros en busca de errores silenciosos.

Ese tramo es el que casi ningún plan contabiliza, y es donde se cuela el fallo caro: una web que parece recuperada, con los pagos enviando a un endpoint viejo. Un RTO de quince minutos con un WRT de tres horas no es un plan rápido, es un plan mal medido.

En WordPress la traducción es bastante directa: snapshots del servidor listos para restaurar, alertas que disparen el procedimiento en minutos y un proveedor con un acuerdo de nivel de servicio explícito. La capa previa, la de que el incidente no se produzca por descuido, está en cómo proteger WordPress frente a ataques.

Cuando la conversación pasa de fijar los números a elegir la infraestructura que los sostiene, que va de la simple copia y restauración a la réplica síncrona y el DR orquestado, el recorrido y la tabla que empareja cada tipo de carga con su objetivo están en cómo dimensionar el disaster recovery a partir del RTO y el RPO.

Cómo lo nombra la norma

Si en algún momento te toca alinear esto con una auditoría, conviene saber que la terminología cambia. La norma de continuidad de negocio ISO 22301 usa MTPD (periodo máximo tolerable de interrupción), equivalente al MTD que maneja el mundo de la recuperación ante desastres y también a las siglas MAO que aparecen en documentación más antigua. La relación que fija es la misma que hemos descrito: el RTO puede ser igual o menor que ese máximo, nunca mayor.

De donde salen los números es del análisis de impacto en el negocio, el BIA: el ejercicio de estimar qué le pasa a cada proceso conforme avanzan las horas de interrupción. Sin ese paso, el MTD se acaba fijando a ojo y todo lo demás se calcula sobre una cifra inventada.

Ponerlo en marcha sin montar un departamento

  • Separa lo crítico de lo demás: el carrito y la pasarela de pago no tienen los mismos objetivos que el blog o la landing de una campaña antigua.
  • Asigna RPO y RTO por sistema: un único número para toda la empresa siempre sale caro de más en un sitio y corto en otro.
  • Pon el MTD por escrito con quien firma: lo decide quien conoce el coste de cada hora sin servicio, no el equipo técnico.
  • Haz un simulacro al año y cronómetralo: es la única forma de saber si el RTO del papel se sostiene, y casi siempre descubre que el WRT es mayor de lo que se creía.

Los incidentes que acaban siendo graves rara vez lo son por el fallo inicial, sino por descubrir en caliente que el plan no cubría algo. En vulnerabilidades habituales en pymes está el panorama de por dónde suelen entrar, y nuestra propia infraestructura está montada con copias diarias automatizadas y monitorización continua por este mismo motivo.

Preguntas frecuentes

¿Cuál es la diferencia entre RPO y RTO?

El RPO mide cuántos datos puedes perder, y se traduce en cada cuánto haces copias. El RTO mide cuánto tiempo puede estar caído el servicio, y se traduce en qué infraestructura necesitas. Uno habla de datos y el otro de tiempo de parada.

¿Qué pasa si RTO más WRT supera el MTD?

Que el plan no sirve. Significa que recuperar el servicio y darlo por bueno lleva más tiempo del que el negocio aguanta, y la solución pasa por cambiar la infraestructura o el procedimiento, no por reescribir el documento.

¿Qué RPO y RTO son razonables para una pyme?

Depende del volumen de actividad. Una tienda con pedidos continuos suele moverse en un RPO de una o dos horas y un RTO de cuatro. Un sitio corporativo con poco tráfico puede asumir 24 y 48 horas. La cifra sale de calcular lo que cuesta cada hora sin servicio, no de copiar un estándar.

¿MTD y MTPD son lo mismo?

Sí. MTD es el término habitual en recuperación ante desastres y MTPD el que usa la norma ISO 22301 de continuidad de negocio; en documentación antigua aparece también como MAO. Los tres nombran el mismo techo, y el RTO nunca puede superarlo.

¿Se aplica esto a un sitio WordPress?

Sí. El RPO es la frecuencia de las copias, el RTO la velocidad de restauración del hosting y el WRT el tiempo de comprobar que plugins, formularios, correo y pasarelas funcionan después de restaurar.

Fuentes

  • ISO 22301, sistemas de gestión de la continuidad del negocio: terminología de MTPD, RTO, RPO y análisis de impacto en el negocio
Resumen de privacidad

Esta web utiliza cookies para que podamos ofrecerte la mejor experiencia de usuario posible. La información de las cookies se almacena en tu navegador y realiza funciones tales como reconocerte cuando vuelves a nuestra web o ayudar a nuestro equipo a comprender qué secciones de la web encuentras más interesantes y útiles.