Alta disponibilidad en AWS
Diseño la disponibilidad según lo que le cuesta a tu negocio una caída: Multi-AZ, failover automático y un RTO/RPO que se decide antes, no después del primer incidente.
Pedir un assessment de disponibilidadEl presupuesto sale del assessment.
01Cuándo tiene sentido
- Una hora caído le cuesta al negocio más que un mes de infraestructura.
- Si se cae una máquina, se cae el servicio.
- Nadie sabe cuánto tarda en volver ni cuántos datos se pierden.
02Cómo trabajo
- 01
Assess
Qué cuesta una caída; de ahí salen el RTO/RPO objetivo y los puntos únicos de falla.
- 02
Diseño
Multi-AZ, balanceo y failover de la base, escritos en Terraform.
- 03
Prueba de falla
Se fuerza la caída de una instancia y de la base, y se mide la recuperación.
- 04
Handoff
Runbooks de incidente y alarmas funcionando.
03Qué incluye
- Amazon RDS Multi-AZ.
- Application Load Balancer y Auto Scaling en varias zonas.
- Backups y restauración probados contra el RPO.
- Alarmas en Amazon CloudWatch.
Qué no incluye
- Guardia 24/7 después del handoff.
04Casos
Un pico de 3000 usuarios que se sostuvo, y una plataforma que releva sola un nodo caído.
05Preguntas frecuentes
- ¿Hace falta multi-región?
- Solo si una caída regional cuesta más que operarla. Para la mayoría alcanza con Multi-AZ, y el assessment lo dice con números.
- ¿Cuánto cuesta?
- Sale del assessment: con el inventario armo el presupuesto y lo apruebas antes de empezar. Lo que factura AWS es por uso y lo pagas directo a AWS.
- ¿Cómo sé que funciona?
- Porque se prueba: la falla se fuerza antes del handoff y la recuperación se mide.
Cuéntame qué tienes hoy y te respondo, casi siempre dentro de las 24 horas.
Pedir un assessment de disponibilidad