Backups y recuperación ante desastres: estrategia 3-2-1 y pruebas de restauración
Si un incidente borra datos, cifra sistemas o deja la infraestructura inutilizable, tu plan de copias de seguridad es la diferencia entre reanudar y quedarse atrapado. Aquí tienes una estrategia clara (3-2-1) y un método para probar que restaurar funciona de verdad.
Por qué fallan los backups
La mayoría de los problemas no aparecen cuando el equipo configura el sistema de copias, sino cuando llega el momento de recuperar. Entre los fallos más comunes están:
- Copias incompletas (exclusiones mal definidas, volúmenes sin incluir, bases de datos sin consistencia).
- Retención insuficiente (el incidente ocurre después del periodo disponible, o no hay versiones para el punto correcto).
- Dependencias no documentadas (credenciales, llaves de cifrado, rutas, versiones del software de restauración).
- Pruebas inexistentes o demasiado superficiales (solo se verifica que “se copió”, no que “se restaura”.).
- Acceso excesivo (una cuenta con permisos amplios puede borrar o modificar copias durante un ransomware).
Estrategia 3-2-1: una regla que obliga a pensar
La estrategia 3-2-1 reduce el riesgo de depender de un único punto de fallo. Significa:
Un “3-2-1” mal aplicado puede fallar igualmente. Lo que buscas es redundancia real, separación de riesgos y capacidad de restaurar cuando más lo necesitas.
RPO y RTO: traduce el riesgo a objetivos medibles
Dos conceptos aterrizan la estrategia en requisitos operativos:
Cuánta pérdida de datos puedes tolerar. Si tu RPO es de 24 horas, una copia de hace 6 horas suele valer; una de hace 36, probablemente no.
Cuánto tiempo tardas en volver a operar. Un backup puede existir, pero si restaurar tarda días, el RTO no se cumple.
Cómo planear pruebas de restauración
Probar restauración es el paso que convierte la estrategia en seguridad. Recomendaciones prácticas:
1) Define el alcance por criticidad
No pruebes todo el entorno con la misma frecuencia. Prioriza lo crítico: bases de datos, archivos de negocio y configuración esencial.
2) Ejecuta pruebas “de punta a punta”
Una prueba válida incluye preparar el destino, restaurar, validar integridad y comprobar que el servicio vuelve a responder. Si el sistema requiere credenciales o llaves de cifrado, asegúrate de que también estén disponibles.
3) Registra resultados y tiempos
Documenta el proceso y mide tiempos reales. Si la restauración excede tu RTO, ajusta retención, preparación del entorno o automatiza pasos que hoy son manuales.
4) Simula incidentes con variaciones realistas
No se trata solo de restaurar “un archivo”. Considera escenarios: pérdida total, corrupción parcial, o una restauración desde un punto de tiempo específico.
- ✓ La copia incluye los datos esperados, con consistencia donde aplica.
- ✓ Puedes restaurar en un entorno de pruebas y montar el sistema sin intervención improvisada.
- ✓ La validación confirma que el servicio funciona, no solo que los archivos “existen”.
- ✓ El tiempo total de restauración cumple el RTO definido para ese componente.
Cifrado, inmutabilidad y acceso mínimo
Un ransomware moderno no solo cifra. También intenta sabotear copias. Para reducir el impacto:
- Cifra los datos en tránsito y en reposo, y gestiona llaves con control de acceso.
- Aplica inmutabilidad o retención protegida cuando tu arquitectura lo permita, para evitar borrado o modificación.
- Usa cuentas con permisos mínimos para restaurar y administrar copias. Separa tareas de copia y tareas de restauración.
- Supervisa alertas de fallos de backup y también de anomalías en el repositorio.
Plan de acción recomendado
Si estás empezando, usa este orden para avanzar rápido y con control:
- Inventaria qué datos son críticos y define RPO y RTO para cada uno.
- Implementa o revisa la estrategia 3-2-1 con separación real de riesgos.
- Establece una rutina de pruebas de restauración y criterios de aceptación.
- Refuerza cifrado, inmutabilidad (si aplica) y acceso mínimo.
- Revisa y mejora tras cada prueba, usando tiempos y fallos registrados.
Con un enfoque de backups recuperables y pruebas verificables, tu organización pasa de “tener copias” a poder recuperar de forma consistente. Eso es resiliencia operativa, no solo almacenamiento.