Por qué fallan los backups

La mayoría de los problemas no aparecen cuando el equipo configura el sistema de copias, sino cuando llega el momento de recuperar. Entre los fallos más comunes están:

  • Copias incompletas (exclusiones mal definidas, volúmenes sin incluir, bases de datos sin consistencia).
  • Retención insuficiente (el incidente ocurre después del periodo disponible, o no hay versiones para el punto correcto).
  • Dependencias no documentadas (credenciales, llaves de cifrado, rutas, versiones del software de restauración).
  • Pruebas inexistentes o demasiado superficiales (solo se verifica que “se copió”, no que “se restaura”.).
  • Acceso excesivo (una cuenta con permisos amplios puede borrar o modificar copias durante un ransomware).

Estrategia 3-2-1: una regla que obliga a pensar

La estrategia 3-2-1 reduce el riesgo de depender de un único punto de fallo. Significa:

3
Copias de tus datos (versiones o datasets recuperables).
2
Medios distintos (por ejemplo, almacenamiento local y un repositorio externo).
1
Copia fuera de tu entorno principal (offline o en un tercer lugar que no comparte el mismo dominio de fallo).
Lo importante no es el número, es el diseño

Un “3-2-1” mal aplicado puede fallar igualmente. Lo que buscas es redundancia real, separación de riesgos y capacidad de restaurar cuando más lo necesitas.

RPO y RTO: traduce el riesgo a objetivos medibles

Dos conceptos aterrizan la estrategia en requisitos operativos:

RPO
Objetivo de Punto de Recuperación

Cuánta pérdida de datos puedes tolerar. Si tu RPO es de 24 horas, una copia de hace 6 horas suele valer; una de hace 36, probablemente no.

RTO
Objetivo de Tiempo de Recuperación

Cuánto tiempo tardas en volver a operar. Un backup puede existir, pero si restaurar tarda días, el RTO no se cumple.

Cómo planear pruebas de restauración

Probar restauración es el paso que convierte la estrategia en seguridad. Recomendaciones prácticas:

1) Define el alcance por criticidad

No pruebes todo el entorno con la misma frecuencia. Prioriza lo crítico: bases de datos, archivos de negocio y configuración esencial.

2) Ejecuta pruebas “de punta a punta”

Una prueba válida incluye preparar el destino, restaurar, validar integridad y comprobar que el servicio vuelve a responder. Si el sistema requiere credenciales o llaves de cifrado, asegúrate de que también estén disponibles.

3) Registra resultados y tiempos

Documenta el proceso y mide tiempos reales. Si la restauración excede tu RTO, ajusta retención, preparación del entorno o automatiza pasos que hoy son manuales.

4) Simula incidentes con variaciones realistas

No se trata solo de restaurar “un archivo”. Considera escenarios: pérdida total, corrupción parcial, o una restauración desde un punto de tiempo específico.

Checklist mínima antes de dar por válido un backup
  • La copia incluye los datos esperados, con consistencia donde aplica.
  • Puedes restaurar en un entorno de pruebas y montar el sistema sin intervención improvisada.
  • La validación confirma que el servicio funciona, no solo que los archivos “existen”.
  • El tiempo total de restauración cumple el RTO definido para ese componente.

Cifrado, inmutabilidad y acceso mínimo

Un ransomware moderno no solo cifra. También intenta sabotear copias. Para reducir el impacto:

  • Cifra los datos en tránsito y en reposo, y gestiona llaves con control de acceso.
  • Aplica inmutabilidad o retención protegida cuando tu arquitectura lo permita, para evitar borrado o modificación.
  • Usa cuentas con permisos mínimos para restaurar y administrar copias. Separa tareas de copia y tareas de restauración.
  • Supervisa alertas de fallos de backup y también de anomalías en el repositorio.

Plan de acción recomendado

Si estás empezando, usa este orden para avanzar rápido y con control:

  1. Inventaria qué datos son críticos y define RPO y RTO para cada uno.
  2. Implementa o revisa la estrategia 3-2-1 con separación real de riesgos.
  3. Establece una rutina de pruebas de restauración y criterios de aceptación.
  4. Refuerza cifrado, inmutabilidad (si aplica) y acceso mínimo.
  5. Revisa y mejora tras cada prueba, usando tiempos y fallos registrados.

Con un enfoque de backups recuperables y pruebas verificables, tu organización pasa de “tener copias” a poder recuperar de forma consistente. Eso es resiliencia operativa, no solo almacenamiento.