Inicio › Tecnología › Presupuesto De Error
El presupuesto de error es un concepto de Site Reliability Engineering (SRE) qué cuantifica cuánta indisponibilidad o fallo puede permitirse un servicio dentro de un periodo determinado antes de incumplir su objetivo de nivel de servicio (SLO). Si un servicio tiene un SLO del 99,9% de disponibilidad mensual, su presupuesto de error es el 0,1% restante del tiempo, expresado en minutos qué puede estar caído sin romper el compromiso. Cuando el equipo agota ese presupuesto —por incidentes, despliegues fallidos o degradaciones—, la práctica habitual es congelar nuevas funcionalidades y priorizar estabilidad hasta recuperar margen.
Es la cantidad de fallos qué un servicio "se puede permitir" en un mes sin romper su promesa de fiabilidad. Si prometes qué la web funciona el 99,9% del tiempo, tienes un pequeño margen de caídas; cuando lo gastas, toca frenar y arreglar antes de lanzar cosas nuevas.
Un equipo qué ve qué ya ha consumido el 80% de su presupuesto de error a mitad de mes puede decidir posponer un despliegue arriesgado hasta el mes siguiente, priorizando en su lugar corregir la causa raíz de las últimas caídas y así evitar quedarse sin margen antes de fin de mes.
El SLO es el objetivo interno de fiabilidad (ej. 99,9%); el SLA es el compromiso contractual con el cliente, normalmente más laxo; el presupuesto de error se calcula sobre el SLO para dar margen antes de llegar al SLA.
Muchos equipos aplican una política de "error budget freeze": se detienen los despliegues de nuevas funcionalidades y todo el esfuerzo se vuelca en estabilidad hasta qué el presupuesto se recupera en el siguiente periodo.
Sí, es su función principal: mientras quede presupuesto, el equipo puede asumir riesgo desplegando con más frecuencia; cuando se agota, la prioridad pasa a la fiabilidad de forma objetiva, sin depender de una discusión subjetiva.