When one region is not enoughCuando una región no basta · V8 Master Engine
26 slides · 18 min · 2 hours ago26 láminas · 18 min · hace 2 hlanguage
ENES
theme
LightDark
view
TalkTable
brand
HanademiPlatzi
Counting incidents is not the same as measuring the probability of an outage.
All 42 Google Cloud regions could have failed simultaneously.
Operational independence matters more than accumulating regions on a diagram.
Contar incidentes no equivale a medir la probabilidad de una caída.
Las 42 regiones de Google Cloud pudieron caer simultáneamente.
La independencia operativa importa más que acumular regiones en un diagrama.
Five observed cloud disruptions lasted 1.5 to 13.4 times the 52.6 minutes allowed per year. The public record cannot estimate the annual probability of joint provider failures.
Cinco interrupciones observadas de nube duraron entre 1,5 y 13,4 veces los 52,6 minutos permitidos al año. El registro público no permite estimar la probabilidad anual de fallas conjuntas entre proveedores.
Geography is just one layer of the cloud. Control, data, and identity planes can have different boundaries. These differences explain why two separate regions are not always independent.
La geografía es solo una capa de la nube. Los planos de control, datos e identidad pueden tener límites distintos. Estas diferencias explican por qué dos regiones separadas no siempre son independientes.
The cloud looks like a physical machine, but its largest observed source of critical events was human. In 2025, human error represented 50.8%, versus 29.6% from power. Resilience begins by controlling changes, permissions, and automation.
La nube parece una máquina física, pero su mayor causa observada de eventos críticos fue humana. En 2025, el error humano representó 50,8%, frente a 29,6% por energía. La resiliencia empieza controlando cambios, permisos y automatización.
This server-rack view makes the dependency layer tangible before the deck tests whether regions truly fail independently.
Esta vista de un rack de servidores hace tangible la capa de dependencias antes de evaluar si las regiones realmente fallan de forma independiente.
Aggregate duration reached 244.8 hours in 2024. In 2025 it fell to 175.3 hours, while critical interruptions went from 49 to 45. Parametrix achieved that result with 16.5 billion tests across 500 data centers.
La duración agregada alcanzó 244,8 horas en 2024. En 2025 bajó a 175,3 horas, mientras las interrupciones críticas pasaron de 49 a 45. Parametrix obtuvo ese resultado con 16,5 mil millones de pruebas en 500 centros de datos.
La menor cantidad de interrupciones explica solo 29% de la reducción anual. Cerca de 71% provino de bajar la duración media de 5,0 a 3,9 horas por interrupción.
The preliminary extraction places Azure above AWS in critical hours. The difference is 31.6% during the same reported period. Without exposure by region and customer, that gap does not demonstrate that Azure is inherently less reliable.
La extracción preliminar coloca a Azure por encima de AWS en horas críticas. La diferencia es 31,6% durante el mismo período informado. Sin exposición por región y cliente, esa brecha no demuestra que Azure sea intrínsecamente menos fiable.
The extraction identifies failures that reached multiple regions. Azure records 4, AWS 2, and GCP 1. The total of 7 confirms the mechanism but does not allow providers to be separated with statistical precision.
La extracción identifica fallas que alcanzaron varias regiones. Azure registra 4, AWS 2 y GCP 1. El total de 7 confirma el mecanismo, pero no permite separar proveedores con precisión estadística.
On June 12, 2025, regional separation did not contain the failure. All 42 Google Cloud regions were affected at the same time. Service Control was a dependency of 76 products, which amplified the scope.
El 12 de junio de 2025, la separación regional no contuvo la falla. Las 42 regiones de Google Cloud quedaron afectadas al mismo tiempo. Service Control era una dependencia de 76 productos, lo que amplificó el alcance.
Google Cloud's simultaneous loss of 42 regions in 2025 cannot plausibly be interpreted as 42 independent failures under the illustrative 1% assumption. It points to a shared dependency, not an empirical probability of recurrence.
La pérdida simultánea de 42 regiones de Google Cloud en 2025 no puede interpretarse de forma plausible como 42 fallas independientes bajo el supuesto ilustrativo de 1%. Señala una dependencia compartida, no una probabilidad empírica de repetición.
us-east-1 leads the record with 44 incidents. us-west-2 appears with 17 and eu-west-1 with 15. IncidentHub cautions that differences in reporting and products prevent converting that order into a reliability ranking.
us-east-1 encabeza el registro con 44 incidentes. us-west-2 aparece con 17 y eu-west-1 con 15. IncidentHub advierte que diferencias de publicación y productos impiden convertir ese orden en un ranking de fiabilidad.
StatusGator recorded 10 failures in us-east-1 during 2025. Cumulative downtime reached 33 hours and 49 minutes and affected 126 components. This is a different measurement from IncidentHub's count and should not be merged with it.
StatusGator registró 10 fallas en us-east-1 durante 2025. La interrupción acumulada llegó a 33 horas y 49 minutos y alcanzó 126 componentes. Es una medición distinta del conteo de IncidentHub y no debe fusionarse con él.
AWS published 3 significant outages in December 2021. They occurred within a window of only 15 days and in the same region. That pattern reminds us that incidents can cluster by shared services and causes.
AWS publicó 3 interrupciones relevantes en diciembre de 2021. Ocurrieron dentro de una ventana de solo 15 días y en la misma región. Ese patrón recuerda que los incidentes pueden agruparse por servicios y causas compartidas.
us-east-1 has 6 zones and us-west-2 has 4. That depth protects against local failures within a region. However, AWS places the IAM control plane for the aws partition in us-east-1, while maintaining regional data planes.
us-east-1 tiene 6 zonas y us-west-2 tiene 4. Esa profundidad protege contra fallas locales dentro de una región. Sin embargo, AWS ubica el plano de control de IAM de la partición aws en us-east-1, mientras mantiene planos de datos regionales.
On July 24, 2026, initial impact in us-west-2 lasted 20 minutes. The affected Direct Connect route in Seattle required 1 hour and 17 minutes. A single incident can have different durations depending on the dependency observed.
El 24 de julio de 2026, el impacto inicial en us-west-2 duró 20 minutos. La ruta de Direct Connect afectada en Seattle necesitó 1 hora y 17 minutos. Un mismo incidente puede tener duraciones distintas según la dependencia observada.
Partial mitigation took roughly 3 hours. Full recovery reached 338 minutes. The incident shows that large regional footprint does not prevent shared network from amplifying a failure.
La mitigación parcial necesitó cerca de 3 horas. La recuperación completa llegó a los 338 minutos. El incidente demuestra que una gran huella regional no evita que la red compartida amplifique una falla.
Each documented incident alone lasted more than four annual 99.99% downtime budgets. SLA eligibility and service scope differ, so this compares duration rather than proving a contractual breach.
Cada incidente documentado duró por sí solo más de cuatro presupuestos anuales de caída al 99,99%. La elegibilidad y el alcance de los SLA difieren, por lo que se compara duración sin afirmar un incumplimiento contractual.
In April, an East US control plane outage affected parts of all 3 physical zones. In July, West US lost external connectivity while internal traffic remained operational. The relevant boundary shifted based on the dependency affected.
En abril, una interrupción del plano de control de East US afectó partes de las 3 zonas físicas. En julio, West US perdió conectividad externa mientras el tráfico interno siguió operativo. La frontera relevante cambió según la dependencia afectada.
The network incident began on June 2, 2019. Recovery was gradual and concluded 272 minutes later. Centralized configuration can produce global scope even when physical capacity is distributed.
El incidente de red comenzó el 2 de junio de 2019. La recuperación fue progresiva y terminó 272 minutos después. Una configuración central puede producir alcance global incluso cuando la capacidad física está distribuida.
In July 2026, a network update affected extended VMware clusters. Sydney, Melbourne, and Frankfurt fell within the same incident for 11 hours and 46 minutes. Distributed geography did not offset a shared configuration dependency.
En julio de 2026, una actualización de red afectó clústeres extendidos de VMware. Sídney, Melbourne y Fráncfort quedaron dentro del mismo incidente durante 11 horas y 46 minutos. La geografía distribuida no compensó una dependencia común de configuración.
Multiplication appears straightforward: 1% by 1% produces 0.01%. That calculation holds for two regions or two providers only when their failures are independent. A common dependency can elevate joint risk and render the figure meaningless.
La multiplicación parece sencilla: 1% por 1% produce 0,01%. Ese cálculo sirve para dos regiones o dos proveedores únicamente cuando sus fallas son independientes. Una dependencia común puede elevar el riesgo conjunto y volver inútil la cifra.
All 3 providers have track records that expose shared dependencies. Core layers are network, identity, naming, and control plane. An application can preserve its data plane if it avoids changes and scaling during an administrative failure.
Los 3 proveedores tienen antecedentes que exponen dependencias compartidas. Las capas principales son red, identidad, nombres y plano de control. Una aplicación puede conservar su plano de datos si evita cambios y escalamiento durante una falla administrativa.
An everyday digital touchpoint gives the shared-dependency argument a human stake before the deck turns to SLA limits.
Un punto de contacto digital cotidiano da una dimensión humana al argumento sobre dependencias compartidas antes de abordar los límites del SLA.
AWS, Azure, and GCP offer up to 99.99% for eligible configurations. That commitment still permits 52.6 minutes of annual unavailability. Additionally, the credit typically offsets part of the service bill, not the business loss.
AWS, Azure y GCP ofrecen hasta 99,99% para configuraciones elegibles. Ese compromiso todavía admite 52,6 minutos anuales de indisponibilidad. Además, el crédito suele compensar parte de la factura del servicio, no la pérdida comercial.
Multi-zone protects against local failures within a region. Multi-region extends separation, but may retain dependencies on the same provider. Multi-cloud adds a real boundary only when operation is also independent.
Multizona protege frente a fallas locales dentro de una región. Multirregión amplía la separación, pero puede conservar dependencias del mismo proveedor. Multicloud solo añade una barrera real cuando la operación también es independiente.
Regions reduce physical risk, but do not guarantee independence. Public data allow observing concentration and cascades, not calculating exact probabilities. Practical defense is isolating dependencies and testing recovery.
Las regiones reducen riesgo físico, pero no garantizan independencia. Los datos públicos permiten observar concentración y cascadas, no calcular probabilidades exactas. La defensa práctica es aislar dependencias y ensayar la recuperación.
Public outages confirm that the cloud can fail beyond a single region. Without comparable denominators, no one can yet calculate which region or provider is statistically safer. The decision should focus on shared dependencies and proven recovery.
Key findings
No existe un registro público completo de ventanas simultáneas AWS-Azure-GCP que permita estimar directamente su probabilidad conjunta anual. Parametrix Insurance
La extracción preliminar de IncidentHub cuenta 44 incidentes regionales en us-east-1 y 17 en us-west-2 durante el período cubierto. IncidentHub
La extracción preliminar de Parametrix identifica 2 cascadas multirregión en AWS, 4 en Azure y 1 en GCP durante el período informado. Parametrix Insurance
AWS sufrió tres interrupciones relevantes en us-east-1 los días 7, 15 y 22 de diciembre de 2021. Amazon Web Services
La interrupción de red de Azure del 25 de enero de 2023 duró aproximadamente 5 horas y 38 minutos. Microsoft
El apagón de Google Cloud del 2 de junio de 2019 afectó servicios durante aproximadamente 4 horas y 32 minutos. Google Cloud
El incidente global de Azure de enero de 2023 y el de Google de junio de 2019 tuvieron causas de red o configuración central. Microsoft
On June 12, 2025, all 42 Google Cloud regions crashed simultaneously, demonstrating a failure that crossed nominal regional boundaries. offbeatengineer.com
On 24 April 2026, East US control-plane disruption ran from 11:30 to 23:22 UTC and affected portions of physical AZ-01, AZ-02, and AZ-03. azure.status.microsoft
On March 2, 2026, AWS reported another impaired Availability Zone in ME-CENTRAL-1 and instance-launch errors in the remaining zone. postmortem.io
La extracción preliminar del informe Parametrix registra 23,1 horas críticas para AWS y 30,4 para Azure en su período anual analizado. Parametrix Insurance
El registro preliminar atribuye a us-east-1 aproximadamente 2,6 veces los incidentes registrados en us-west-2. IncidentHub
The argument
In 2025, human error caused 50.8% of critical events observed by Parametrix.
Aggregate critical unavailability fell from 244.8 hours in 2024 to 175.3 in 2025.
A preliminary analysis attributes 30.4 critical hours to Azure and 23.1 to AWS, with no comparable exposure.
IncidentHub records 44 incidents in us-east-1 versus 17 in us-west-2.
All 42 Google Cloud regions failed simultaneously on June 12, 2025.
Two independent 1% risks would produce 0.01% combined, but shared dependencies invalidate that calculation.
A 99.99% commitment still allows 52.6 minutes of annual unavailability.
Resilience requires isolating data, compute, identity, and deployment, plus testing failover.
This research is published in English and Spanish. Ver en español
La investigación detrás de esta presentación
Los apagones públicos confirman que la nube puede fallar más allá de una región. Sin denominadores comparables, nadie puede calcular todavía qué región o proveedor es estadísticamente más seguro. La decisión debe centrarse en dependencias compartidas y recuperación probada.
Hallazgos clave
No existe un registro público completo de ventanas simultáneas AWS-Azure-GCP que permita estimar directamente su probabilidad conjunta anual. Parametrix Insurance
La extracción preliminar de IncidentHub cuenta 44 incidentes regionales en us-east-1 y 17 en us-west-2 durante el período cubierto. IncidentHub
La extracción preliminar de Parametrix identifica 2 cascadas multirregión en AWS, 4 en Azure y 1 en GCP durante el período informado. Parametrix Insurance
AWS sufrió tres interrupciones relevantes en us-east-1 los días 7, 15 y 22 de diciembre de 2021. Amazon Web Services
La interrupción de red de Azure del 25 de enero de 2023 duró aproximadamente 5 horas y 38 minutos. Microsoft
El apagón de Google Cloud del 2 de junio de 2019 afectó servicios durante aproximadamente 4 horas y 32 minutos. Google Cloud
El incidente global de Azure de enero de 2023 y el de Google de junio de 2019 tuvieron causas de red o configuración central. Microsoft
El 12 de junio de 2025, las 42 regiones de Google Cloud fallaron simultáneamente, lo que demostró una falla que cruzó los límites regionales nominales. offbeatengineer.com
El 24 de abril de 2026, una interrupción del plano de control en East US duró de 11:30 a 23:22 UTC y afectó partes de las AZ físicas 01, 02 y 03. azure.status.microsoft
El 2 de marzo de 2026, AWS reportó otra zona de disponibilidad afectada en ME-CENTRAL-1 y errores al lanzar instancias en la zona restante. postmortem.io
La extracción preliminar del informe Parametrix registra 23,1 horas críticas para AWS y 30,4 para Azure en su período anual analizado. Parametrix Insurance
El registro preliminar atribuye a us-east-1 aproximadamente 2,6 veces los incidentes registrados en us-west-2. IncidentHub
El argumento
En 2025, el error humano causó 50,8% de los eventos críticos observados por Parametrix.
La indisponibilidad crítica agregada bajó de 244,8 horas en 2024 a 175,3 en 2025.
Una extracción preliminar atribuye 30,4 horas críticas a Azure y 23,1 a AWS, sin exposición comparable.
IncidentHub registra 44 incidentes en us-east-1, frente a 17 en us-west-2.
Las 42 regiones de Google Cloud fallaron simultáneamente el 12 de junio de 2025.
Dos riesgos independientes de 1% producirían 0,01% conjunto, pero las dependencias compartidas invalidan ese cálculo.
Un compromiso de 99,99% todavía permite 52,6 minutos anuales de indisponibilidad.
La resiliencia exige aislar datos, cómputo, identidad y despliegue, además de probar la conmutación.
Esta investigación se publica en inglés y español. Read in English