
De AWS a GitLab: cuando un comando o un cambio correcto rompe producción
Un comando con un parámetro incorrecto bastó para provocar en 2017 una de las caídas más recordadas de Amazon Web Services (AWS). Amazon S3 perdió una parte importante de su capacidad en us-east-1, necesitó reiniciar dos subsistemas y arrastró consigo a otros servicios. El episodio es especialmente útil para sysadmins y desarrolladores porque no fue excepcional en su naturaleza: GitLab, Meta, Cloudflare, Fastly y Atlassian han documentado incidentes donde comandos, scripts, configuraciones o código perfectamente autorizados terminaron causando interrupciones enormes. Las claves de los errores que han roto grandes plataformas en 30 segundos El caso de S3 es particularmente ilustrativo porque AWS explicó con bastante detalle qué sucedió. A las 9:37, hora del Pacífico, del 28 de febrero de 2017,




