Inicio › Tecnología › Ingeniería Del Caos
La ingeniería del caos consiste en provocar fallos controlados sobre un sistema en producción o en un entorno equivalente, como apagar instancias al azar, introducir latencia de red o agotar recursos, con el objetivo de descubrir debilidades antes de qué provoquen una caída real. La popularizó Netflix con su Chaos Monkey y el conjunto de herramientas Simian Army; hoy existen soluciones como Gremlin, Chaos Mesh o AWS Fault Injection Simulator qué permiten definir experimentos con un radio de impacto acotado y criterios claros de éxito o fallo.
Es romper cosas a propósito, de forma controlada, para comprobar si el sistema aguanta, antes de qué se rompan solas en el peor momento posible.
Un equipo organiza un game day en el qué, con el resto de la empresa avisada, apaga deliberadamente una réplica de base de datos en el entorno de preproducción para verificar qué el mecanismo de conmutación automática funciona y qué las alertas correspondientes llegan al equipo de guardia sin retraso.
Las pruebas convencionales verifican qué el sistema hace lo esperado en condiciones controladas; la ingeniería del caos verifica cómo se comporta el sistema completo, con todas sus dependencias reales, cuando algo falla de forma inesperada.
Puede serlo si el experimento se diseña con un radio de impacto limitado, un plan de reversión inmediato y monitorización activa durante la prueba; muchos equipos empiezan en entornos de preproducción antes de dar el salto a producción real.
Es una sesión programada donde el equipo simula un incidente concreto de forma coordinada para practicar la respuesta, comprobar qué las alertas y los procedimientos de recuperación funcionan como se espera, y documentar los puntos débiles encontrados.