Hanademi

When one region is not enoughCuando una región no basta · V8 Master Engine

26 slides · 18 min · 2 hours ago26 láminas · 18 min · hace 2 h language
ENES
theme
LightDark
view
TalkTable
brand
HanademiPlatzi
When one region is not enoughMade for Yerlan Guevara, by Hanademi
  1. Counting incidents is not the same as measuring the probability of an outage.
  2. All 42 Google Cloud regions could have failed simultaneously.
  3. Operational independence matters more than accumulating regions on a diagram.
Cuando una región no bastaMade for Yerlan Guevara, by Hanademi
  1. Contar incidentes no equivale a medir la probabilidad de una caída.
  2. Las 42 regiones de Google Cloud pudieron caer simultáneamente.
  3. La independencia operativa importa más que acumular regiones en un diagrama.
A Google Cloud configuration outage lasted 13.4 timesthe yearly downtime allowed at 99.99%Made for Yerlan Guevara, by HanademiSources: btw.media; Microsoft; azure.status.microsoft; Google Cloud; aws.amazon.com; blog.incidenthub.cloud;National Institute of Standards and Technology; outagecost.com; Parametrix Insurance; IncidentHubUnitTimes the yearly downtime allowance at 99.99% availabilityGoogle Cloud, Jul 202613.4×Azure, Jan 20236.4×Google Cloud, Jun 20195.2×AWS Lambda, Jun 20234.3×AWS network route, Jul20261.5×
Five observed cloud disruptions lasted 1.5 to 13.4 times the 52.6 minutes allowed per year. The public record cannot estimate the annual probability of joint provider failures.
Una caída de configuración de Google Cloud duró 13,4veces el tiempo anual permitido con 99,99% dedisponibilidadMade for Yerlan Guevara, by HanademiFuentes: btw.media; Microsoft; azure.status.microsoft; Google Cloud; aws.amazon.com; blog.incidenthub.cloud;National Institute of Standards and Technology; outagecost.com; Parametrix Insurance; IncidentHubUnidadVeces el tiempo anual permitido con 99,99% de disponibilidadGoogle Cloud, jul 202613,4×Azure, ene 20236,4×Google Cloud, jun 20195,2×AWS Lambda, jun 20234,3×Ruta de red de AWS, jul20261,5×
Cinco interrupciones observadas de nube duraron entre 1,5 y 13,4 veces los 52,6 minutos permitidos al año. El registro público no permite estimar la probabilidad anual de fallas conjuntas entre proveedores.
Terms to read the riskMade for Yerlan Guevara, by HanademiAvailability zone (AZ)Isolated location within a cloud region.Control planeServices that create, configure, and manage resources.Data planeServices that process application traffic and workload.Identity and access management (IAM)System that authenticates users and controlspermissions.Service level agreement (SLA)Commercial commitment to availability and credits.
Geography is just one layer of the cloud. Control, data, and identity planes can have different boundaries. These differences explain why two separate regions are not always independent.
Términos para leer el riesgoMade for Yerlan Guevara, by HanademiZona de disponibilidad (AZ)Ubicación aislada dentro de una región de nube.Plano de controlServicios que crean, configuran y administran recursos.Plano de datosServicios que procesan el tráfico y trabajo de la aplicación.Gestión de identidad y acceso (IAM)Sistema que autentica usuarios y controla permisos.Acuerdo de nivel de servicio (SLA)Compromiso comercial de disponibilidad y créditos.
La geografía es solo una capa de la nube. Los planos de control, datos e identidad pueden tener límites distintos. Estas diferencias explican por qué dos regiones separadas no siempre son independientes.
Human error caused 50.8% of observedserious service incidentsShare of causes in critical unavailability events observed by Parametrix during 2025.Made for Yerlan Guevara, by HanademiSources: businessinsurance.com.Unit% of critical eventsHuman error50.8%Power29.6%Overload7.7%
The cloud looks like a physical machine, but its largest observed source of critical events was human. In 2025, human error represented 50.8%, versus 29.6% from power. Resilience begins by controlling changes, permissions, and automation.
El error humano causó el 50,8% de losincidentes graves de servicio observadosParticipación de causas en eventos críticos de indisponibilidad observados por Parametrix durante 2025.Made for Yerlan Guevara, by HanademiFuentes: businessinsurance.com.Unidad% de eventos críticosError humano50,8 %Energía29,6 %Sobrecarga7,7 %
La nube parece una máquina física, pero su mayor causa observada de eventos críticos fue humana. En 2025, el error humano representó 50,8%, frente a 29,6% por energía. La resiliencia empieza controlando cambios, permisos y automatización.
Regional resilience runs through the networkRegional boundaries are only as resilient as the connections behind them.Sources: The Definitive AWS Outage Report 2025: Reliability ....
This server-rack view makes the dependency layer tangible before the deck tests whether regions truly fail independently.
La resiliencia regional pasa por la redLos límites regionales son tan resilientes como las conexiones que los sostienen.Fuentes: The Definitive AWS Outage Report 2025: Reliability ....
Esta vista de un rack de servidores hace tangible la capa de dependencias antes de evaluar si las regiones realmente fallan de forma independiente.
Critical service downtime fell by 69.5hours in 2025Aggregate critical duration reported by Parametrix, hours, years published 2022, 2024, and 2025.Made for Yerlan Guevara, by HanademiSources: businessinsurance.com.Unithours150.92022244.82024175.32025
Aggregate duration reached 244.8 hours in 2024. In 2025 it fell to 175.3 hours, while critical interruptions went from 49 to 45. Parametrix achieved that result with 16.5 billion tests across 500 data centers.
El tiempo de caída crítica del servicio bajó69,5 horas en 2025Duración crítica agregada reportada por Parametrix, horas, años publicados 2022, 2024 y 2025.Made for Yerlan Guevara, by HanademiFuentes: businessinsurance.com.Unidadhoras150,92022244,82024175,32025
La duración agregada alcanzó 244,8 horas en 2024. En 2025 bajó a 175,3 horas, mientras las interrupciones críticas pasaron de 49 a 45. Parametrix obtuvo ese resultado con 16,5 mil millones de pruebas en 500 centros de datos.
Shorter interruptions cut 49.5 of 69.5critical downtime hours in 2025Made for Yerlan Guevara, by HanademiSources: businessinsurance.com.UnitCritical downtime hours244.82024 total−20.0Four fewer events−49.5Shorter duration175.32025 total
Fewer interruptions explain only 29% of the annual decline. About 71% came from reducing average duration from 5.0 to 3.9 hours per interruption.
Interrupciones más cortas redujeron 49,5de 69,5 horas de caída crítica en 2025Made for Yerlan Guevara, by HanademiFuentes: businessinsurance.com.UnidadHoras críticas de caída244,8Total de 2024−20,0Cuatro eventosmenos−49,5Menor duración175,3Total de 2025
La menor cantidad de interrupciones explica solo 29% de la reducción anual. Cerca de 71% provino de bajar la duración media de 5,0 a 3,9 horas por interrupción.
A preliminary comparison attributes 30.4 criticaldowntime hours to Azure and 23.1 to AWSCritical hours from the preliminary extraction of Parametrix's annual report. The figures could not beverified against an active source during compilation.Made for Yerlan Guevara, by HanademiSources: Parametrix Insurance. (2024). Cloud Outage Risk Report.Unitcritical hoursAzure30.4AWS23.1* Critical hours from the preliminary extraction of Parametrix's annual report. The figures couldnot be verified against an active source during compilation.
The preliminary extraction places Azure above AWS in critical hours. The difference is 31.6% during the same reported period. Without exposure by region and customer, that gap does not demonstrate that Azure is inherently less reliable.
Una comparación preliminar atribuye 30,4 horas decaída crítica a Azure y 23,1 a AWSHoras críticas en la extracción preliminar del informe anual de Parametrix. Las cifras no pudieronverificarse contra una fuente activa durante la construcción.Made for Yerlan Guevara, by HanademiFuentes: Parametrix Insurance. (2024). Cloud Outage Risk Report.Unidadhoras críticasAzure30,4AWS23,1* Horas críticas en la extracción preliminar del informe anual de Parametrix. Las cifras no pudieronverificarse contra una fuente activa durante la construcción.
La extracción preliminar coloca a Azure por encima de AWS en horas críticas. La diferencia es 31,6% durante el mismo período informado. Sin exposición por región y cliente, esa brecha no demuestra que Azure sea intrínsecamente menos fiable.
Preliminary sample records chain-reactionoutages: 4 on Azure, 2 on AWS, 1 on GCPMulti-region events preliminarily extracted from Parametrix's report. The sample totals only 7 events.Made for Yerlan Guevara, by HanademiSources: Parametrix Insurance. (2024). Cloud Outage Risk Report.; Critical cloud outage risk remains significant despite decline inoccurrence: Parametrix - Reinsurance News.Unitcascade eventsAzure4AWS2GCP1
The extraction identifies failures that reached multiple regions. Azure records 4, AWS 2, and GCP 1. The total of 7 confirms the mechanism but does not allow providers to be separated with statistical precision.
Muestra preliminar registra apagones encadena: 4 en Azure, 2 en AWS, 1 en GCPEventos multirregión extraídos preliminarmente del informe de Parametrix. La muestra suma solo 7eventos.Made for Yerlan Guevara, by HanademiFuentes: Parametrix Insurance. (2024). Cloud Outage Risk Report.; Critical cloud outage risk remains significant despite declinein occurrence: Parametrix - Reinsurance News.Unidadeventos de cascadaAzure4AWS2GCP1
La extracción identifica fallas que alcanzaron varias regiones. Azure registra 4, AWS 2 y GCP 1. El total de 7 confirma el mecanismo, pero no permite separar proveedores con precisión estadística.
42 regions went down and 76 productsdepended on Service Control.The incident demonstrates that a central dependency can cross all nominal regionalboundaries.Sources: offbeatengineer.com.
On June 12, 2025, regional separation did not contain the failure. All 42 Google Cloud regions were affected at the same time. Service Control was a dependency of 76 products, which amplified the scope.
42 regiones cayeron y 76 productosdependían de Service Control.El incidente demuestra que una dependencia central puede cruzar todos los límitesregionales nominales.Fuentes: offbeatengineer.com.
El 12 de junio de 2025, la separación regional no contuvo la falla. Las 42 regiones de Google Cloud quedaron afectadas al mismo tiempo. Service Control era una dependencia de 76 productos, lo que amplificó el alcance.
With independent 1% failure risks, all 42would fail together 1 in 10^84Made for Yerlan Guevara, by HanademiSources: National Institute of Standards and Technology. (2012). Guide for conducting risk assessments: SP800-30 Rev. 1.; Joint Probability Calculator - P(A B).; offbeatengineer.com.UnitDenominator of the hypothetical failure odds1 in 10²One region1 in 10⁴Two independentregions1 in 10⁸⁴All 42 GoogleCloud regions
Google Cloud's simultaneous loss of 42 regions in 2025 cannot plausibly be interpreted as 42 independent failures under the illustrative 1% assumption. It points to a shared dependency, not an empirical probability of recurrence.
Con riesgos de falla independientes del 1%, las 42regiones fallarían juntas 1 entre 10^84Made for Yerlan Guevara, by HanademiFuentes: National Institute of Standards and Technology. (2012). Guide for conducting risk assessments: SP800-30 Rev. 1.; Joint Probability Calculator - P(A B).; offbeatengineer.com.UnidadDenominador de la probabilidad hipotética de caída1 entre 10²Una región1 entre 10⁴Dos regionesindependientes1 entre 10⁸⁴Las 42 regionesde Google Cloud
La pérdida simultánea de 42 regiones de Google Cloud en 2025 no puede interpretarse de forma plausible como 42 fallas independientes bajo el supuesto ilustrativo de 1%. Señala una dependencia compartida, no una probabilidad empírica de repetición.
AWS’s us-east-1 region had 2.6 times asmany recorded outages as us-west-2Regional incidents from the preliminary extraction of IncidentHub. Counts are not adjusted for traffic,customers, duration, or publication.Made for Yerlan Guevara, by HanademiSources: IncidentHub. (2024). The Definitive AWS Outage Report.; blog.incidenthub.cloud.; blog.incidenthub.cloud.Unitincidents recordedus-east-144us-west-217eu-west-115* Regional incidents from the preliminary extraction of IncidentHub. Counts are not adjusted fortraffic, customers, duration, or publication.
us-east-1 leads the record with 44 incidents. us-west-2 appears with 17 and eu-west-1 with 15. IncidentHub cautions that differences in reporting and products prevent converting that order into a reliability ranking.
La región us-east-1 de AWS tuvo 2,6 veceslos apagones registrados de us-west-2Incidentes regionales en la extracción preliminar de IncidentHub. Los conteos no están ajustados portráfico, clientes, duración ni publicación.Made for Yerlan Guevara, by HanademiFuentes: IncidentHub. (2024). The Definitive AWS Outage Report.; blog.incidenthub.cloud.; blog.incidenthub.cloud.Unidadincidentes registradosus-east-144us-west-217eu-west-115* Incidentes regionales en la extracción preliminar de IncidentHub. Los conteos no están ajustadospor tráfico, clientes, duración ni publicación.
us-east-1 encabeza el registro con 44 incidentes. us-west-2 aparece con 17 y eu-west-1 con 15. IncidentHub advierte que diferencias de publicación y productos impiden convertir ese orden en un ranking de fiabilidad.
10 failures totaled 33 hours and 49minutes in us-east-1.The figure corresponds to the StatusGator analysis cited by the secondary source. It isnot normalized by traffic or customers.Sources: updatevibe.com.
StatusGator recorded 10 failures in us-east-1 during 2025. Cumulative downtime reached 33 hours and 49 minutes and affected 126 components. This is a different measurement from IncidentHub's count and should not be merged with it.
10 fallas sumaron 33 horas y 49minutos en us-east-1.La cifra corresponde al análisis de StatusGator citado por la fuente secundaria. No estánormalizada por tráfico o clientes.Fuentes: updatevibe.com.
StatusGator registró 10 fallas en us-east-1 durante 2025. La interrupción acumulada llegó a 33 horas y 49 minutos y alcanzó 126 componentes. Es una medición distinta del conteo de IncidentHub y no debe fusionarse con él.
AWS suffered 3 interruptions in us-east-1during 15 daysRelevant interruptions published by AWS for us-east-1 on December 7, 15, and 22, 2021.Made for Yerlan Guevara, by HanademiSources: Amazon Web Services. (2021). AWS service event summaries, December 2021.; Summary of the AWS Service Event in theNorthern ....Unitinterruptions1December 71December 151December 22
AWS published 3 significant outages in December 2021. They occurred within a window of only 15 days and in the same region. That pattern reminds us that incidents can cluster by shared services and causes.
AWS sufrió 3 interrupciones en us-east-1durante 15 díasInterrupciones relevantes publicadas por AWS para us-east-1 los días 7, 15 y 22 de diciembre de 2021.Made for Yerlan Guevara, by HanademiFuentes: Amazon Web Services. (2021). AWS service event summaries, December 2021.; Summary of the AWS Service Event in theNorthern ....Unidadinterrupciones17 de diciembre115 de diciembre122 de diciembre
AWS publicó 3 interrupciones relevantes en diciembre de 2021. Ocurrieron dentro de una ventana de solo 15 días y en la misma región. Ese patrón recuerda que los incidentes pueden agruparse por servicios y causas compartidas.
AWS’s us-east-1 has twice the usualminimum of separate data-center zonesAvailability zones published by AWS for selected regions, versus the typical minimum across its commercialregions.Made for Yerlan Guevara, by HanademiSources: Amazon Web Services. (2026). AWS global infrastructure.; docs.aws.amazon.com.; aws.amazon.com.Unitavailability zonesTypical minimum36us-east-14us-west-2
us-east-1 has 6 zones and us-west-2 has 4. That depth protects against local failures within a region. However, AWS places the IAM control plane for the aws partition in us-east-1, while maintaining regional data planes.
us-east-1 de AWS duplica el mínimo habitual dezonas de centros de datos separadasZonas de disponibilidad publicadas por AWS para regiones seleccionadas, frente al mínimo habitual de susregiones comerciales.Made for Yerlan Guevara, by HanademiFuentes: Amazon Web Services. (2026). AWS global infrastructure.; docs.aws.amazon.com.; aws.amazon.com.Unidadzonas de disponibilidadMínimo habitual36us-east-14us-west-2
us-east-1 tiene 6 zonas y us-west-2 tiene 4. Esa profundidad protege contra fallas locales dentro de una región. Sin embargo, AWS ubica el plano de control de IAM de la partición aws en us-east-1, mientras mantiene planos de datos regionales.
Initial impact lasted 20 minutes; theaffected route, 77.The 77 minutes correspond to the affected route, not the entire region.Sources: blog.incidenthub.cloud.
On July 24, 2026, initial impact in us-west-2 lasted 20 minutes. The affected Direct Connect route in Seattle required 1 hour and 17 minutes. A single incident can have different durations depending on the dependency observed.
El impacto inicial duró 20 minutos; laruta afectada, 77.Los 77 minutos corresponden a la ruta afectada, no a toda la región.Fuentes: blog.incidenthub.cloud.
El 24 de julio de 2026, el impacto inicial en us-west-2 duró 20 minutos. La ruta de Direct Connect afectada en Seattle necesitó 1 hora y 17 minutos. Un mismo incidente puede tener duraciones distintas según la dependencia observada.
Azure took 338 minutes to recover from anetwork outageCumulative minutes from detection to recovery of the January 25, 2023 connectivity incident.Made for Yerlan Guevara, by HanademiSources: Microsoft. (2023). Azure status history: Networking connectivity event, 25 January 2023.; Azure status history |Microsoft Azure.Unitcumulative minutes0Detection180Partialmitigation338Recovery
Partial mitigation took roughly 3 hours. Full recovery reached 338 minutes. The incident shows that large regional footprint does not prevent shared network from amplifying a failure.
Azure tardó 338 minutos en recuperarse deuna falla de redMinutos acumulados desde la detección hasta la recuperación del incidente de conectividad del 25 de enerode 2023.Made for Yerlan Guevara, by HanademiFuentes: Microsoft. (2023). Azure status history: Networking connectivity event, 25 January 2023.; Azure status history |Microsoft Azure.Unidadminutos acumulados0Detección180Mitigaciónparcial338Recuperación
La mitigación parcial necesitó cerca de 3 horas. La recuperación completa llegó a los 338 minutos. El incidente demuestra que una gran huella regional no evita que la red compartida amplifique una falla.
One outage lasted 4.3 to 6.4 times the annualdowntime allowed at 99.99% availabilityMade for Yerlan Guevara, by HanademiSources: Microsoft. (2023). Azure status history: Networking connectivity event, 25 January 2023.; Azure statushistory | Microsoft Azure.; Google Cloud. (2019). Google Cloud networking incident report, 2 June 2019.UnitMultiples of the 52.6-minute annual downtime budget at 99.99%AWS Lambda, 20234.3xGoogle Cloud, 20195.2xAzure, 20236.4x
Each documented incident alone lasted more than four annual 99.99% downtime budgets. SLA eligibility and service scope differ, so this compares duration rather than proving a contractual breach.
Un apagón duró entre 4,3 y 6,4 veces la caída anualpermitida con 99,99% de disponibilidadMade for Yerlan Guevara, by HanademiFuentes: Microsoft. (2023). Azure status history: Networking connectivity event, 25 January 2023.; Azure statushistory | Microsoft Azure.; Google Cloud. (2019). Google Cloud networking incident report, 2 June 2019.UnidadMúltiplos del presupuesto anual de caída de 52,6 minutos al 99,99%AWS Lambda, 20234,3xGoogle Cloud, 20195,2xAzure, 20236,4x
Cada incidente documentado duró por sí solo más de cuatro presupuestos anuales de caída al 99,99%. La elegibilidad y el alcance de los SLA difieren, por lo que se compara duración sin afirmar un incumplimiento contractual.
East US reached 3 physical zones; West USretained internal traffic.The incidents show that region, zone, external connectivity, and control plane aredifferent boundaries.Sources: azure.status.microsoft.; azure.status.microsoft.UTC times are encoded as HHMM numbers: 1130 means 11:30 and 2322 means 23:22.
In April, an East US control plane outage affected parts of all 3 physical zones. In July, West US lost external connectivity while internal traffic remained operational. The relevant boundary shifted based on the dependency affected.
East US alcanzó 3 zonas físicas; West USconservó el tráfico interno.Los incidentes muestran que región, zona, conectividad externa y plano de control sonlímites diferentes.Fuentes: azure.status.microsoft.; azure.status.microsoft.Las horas UTC se codifican como números HHMM: 1130 significa 11:30 y 2322 significa 23:22.
En abril, una interrupción del plano de control de East US afectó partes de las 3 zonas físicas. En julio, West US perdió conectividad externa mientras el tráfico interno siguió operativo. La frontera relevante cambió según la dependencia afectada.
Google Cloud took 272 minutes to resolveits network outageCumulative minutes from start to end of the Google Cloud incident on June 2, 2019.Made for Yerlan Guevara, by HanademiSources: Google Cloud. (2019). Google Cloud networking incident report, 2 June 2019.Unitcumulative minutes0Start180Gradual recovery272End
The network incident began on June 2, 2019. Recovery was gradual and concluded 272 minutes later. Centralized configuration can produce global scope even when physical capacity is distributed.
Google Cloud necesitó 272 minutos paracerrar su apagón de redMinutos acumulados desde el inicio hasta el fin del incidente de Google Cloud del 2 de junio de 2019.Made for Yerlan Guevara, by HanademiFuentes: Google Cloud. (2019). Google Cloud networking incident report, 2 June 2019.Unidadminutos acumulados0Inicio180Recuperaciónprogresiva272Fin
El incidente de red comenzó el 2 de junio de 2019. La recuperación fue progresiva y terminó 272 minutos después. Una configuración central puede producir alcance global incluso cuando la capacidad física está distribuida.
A network configuration affected 3cities for 11.77 hours.The case demonstrates correlated risk across distant locations when they share anetwork layer.Sources: btw.media.
In July 2026, a network update affected extended VMware clusters. Sydney, Melbourne, and Frankfurt fell within the same incident for 11 hours and 46 minutes. Distributed geography did not offset a shared configuration dependency.
Sources
Una configuración de red afectó 3 ciudadesdurante 11,77 horas.El caso muestra riesgo correlacionado entre ubicaciones distantes cuando comparten unacapa de red.Fuentes: btw.media.
En julio de 2026, una actualización de red afectó clústeres extendidos de VMware. Sídney, Melbourne y Fráncfort quedaron dentro del mismo incidente durante 11 horas y 46 minutos. La geografía distribuida no compensó una dependencia común de configuración.
Fuentes
Two 1% annual failure risks combine to0.01% only when independentMathematical example for 2 regions or 2 providers with hypothetical annual risk of 1%. Not an empiricalestimate. Logarithmic scale: each line is ×10.Made for Yerlan Guevara, by HanademiSources: National Institute of Standards and Technology. (2012). Guide for conducting risk assessments: SP 800-30 Rev. 1.Unithypothetical annual risk1%Risk A1%Risk B0.01%Joint failure
Multiplication appears straightforward: 1% by 1% produces 0.01%. That calculation holds for two regions or two providers only when their failures are independent. A common dependency can elevate joint risk and render the figure meaningless.
Dos riesgos anuales de falla del 1% dan0,01% solo si son independientesEjemplo matemático para 2 regiones o 2 proveedores con riesgo anual hipotético de 1%. No es unaestimación empírica.Made for Yerlan Guevara, by HanademiFuentes: National Institute of Standards and Technology. (2012). Guide for conducting risk assessments: SP 800-30 Rev. 1.Unidadriesgo anual hipotético1 %Riesgo A1 %Riesgo B0,01 %Falla conjunta
La multiplicación parece sencilla: 1% por 1% produce 0,01%. Ese cálculo sirve para dos regiones o dos proveedores únicamente cuando sus fallas son independientes. Una dependencia común puede elevar el riesgo conjunto y volver inútil la cifra.
AWS, Azure, and Google have experiencedoutages that spread through shared systemsDocumented cases used as examples of shared network, configuration, or services. Each mark representsone case, not a rate.Made for Yerlan Guevara, by HanademiSources: Microsoft. (2023). Azure status history: Networking connectivity event.; Google Cloud. (2019). Google Cloud networkingincident report.; Amazon Web Services. (2023). Static stability using Availability Zones.Unitillustrative casesAzure 20231Google 20191AWS 20211* Documented cases used as examples of shared network, configuration, or services. Each markrepresents one case, not a rate.
All 3 providers have track records that expose shared dependencies. Core layers are network, identity, naming, and control plane. An application can preserve its data plane if it avoids changes and scaling during an administrative failure.
AWS, Azure y Google han sufrido apagonespropagados por sistemas compartidosCasos documentados usados como ejemplos de red, configuración o servicios compartidos. Cada marcarepresenta un caso, no una tasa.Made for Yerlan Guevara, by HanademiFuentes: Microsoft. (2023). Azure status history: Networking connectivity event.; Google Cloud. (2019). Google Cloud networkingincident report.; Amazon Web Services. (2023). Static stability using Availability Zones.Unidadcasos ilustrativosAzure 20231Google 20191AWS 20211* Casos documentados usados como ejemplos de red, configuración o servicios compartidos. Cada marcarepresenta un caso, no una tasa.
Los 3 proveedores tienen antecedentes que exponen dependencias compartidas. Las capas principales son red, identidad, nombres y plano de control. Una aplicación puede conservar su plano de datos si evita cambios y escalamiento durante una falla administrativa.
Resilience ends at the userInfrastructure resilience matters wherever people depend on connected services.Sources: US East-1, o cómo el colapso del desconocido corazón de Internet puso en jaque a medio mundo: "La red se saturó en Europa porque falló EEUU y no había capacidad para asumir la carga" | Empresas…
An everyday digital touchpoint gives the shared-dependency argument a human stake before the deck turns to SLA limits.
La resiliencia termina en el usuarioLa resiliencia de la infraestructura importa donde las personas dependen de servicios conectados.Fuentes: US East-1, o cómo el colapso del desconocido corazón de Internet puso en jaque a medio mundo: "La red se saturó en Europa porque falló EEUU y no había capacidad para asumir la carga" | Empresas…
Un punto de contacto digital cotidiano da una dimensión humana al argumento sobre dependencias compartidas antes de abordar los límites del SLA.
A 99.99% uptime promise allows 52.6minutes of downtime per yearMathematical equivalence between contractual availability and annual minutes, together with eligibledistributed compute commitments.Made for Yerlan Guevara, by HanademiSources: Amazon Web Services. (2025). Amazon EC2 Service Level Agreement.; Microsoft. (2025). Service LevelAgreement for Virtual Machines.; Google Cloud. (2025). Compute Engine Service Level Agreement.Unitavailability and minutesMinutes allowed per year525.65.399,9%99,999%Eligible commitment100.0%unchanged, AWS EC2 multi-zone → GCP VM regional
AWS, Azure, and GCP offer up to 99.99% for eligible configurations. That commitment still permits 52.6 minutes of annual unavailability. Additionally, the credit typically offsets part of the service bill, not the business loss.
Una promesa de 99,99% de disponibilidadpermite 52,6 minutos de caída al añoEquivalencia matemática entre disponibilidad contractual y minutos anuales, junto con compromisoselegibles de cómputo distribuido.Made for Yerlan Guevara, by HanademiFuentes: Amazon Web Services. (2025). Amazon EC2 Service Level Agreement.; Microsoft. (2025). Service LevelAgreement for Virtual Machines.; Google Cloud. (2025). Compute Engine Service Level Agreement.Unidaddisponibilidad y minutosMinutos permitidos al año525,65,399,9%99,999%Compromiso elegible100,0 %sin cambio, AWS EC2 multizona → VM regional de GCP
AWS, Azure y GCP ofrecen hasta 99,99% para configuraciones elegibles. Ese compromiso todavía admite 52,6 minutos anuales de indisponibilidad. Además, el crédito suele compensar parte de la factura del servicio, no la pérdida comercial.
The strategy’s final step uses independentcloud providers to contain failuresThree levels of operational resilience, from isolation within a region to independent operation acrossproviders.Made for Yerlan Guevara, by HanademiSources: Amazon Web Services. (2023). Disaster recovery of workloads on AWS.; Microsoft. (2024). Azure Well-ArchitectedFramework: Reliability.Unitresilience levelMulti-zone1Multi-region2Multi-cloud3
Multi-zone protects against local failures within a region. Multi-region extends separation, but may retain dependencies on the same provider. Multi-cloud adds a real boundary only when operation is also independent.
El último paso de la estrategia usa proveedoresindependientes para contener fallasTres niveles de resiliencia operativa, desde aislamiento dentro de una región hasta operación independienteentre proveedores.Made for Yerlan Guevara, by HanademiFuentes: Amazon Web Services. (2023). Disaster recovery of workloads on AWS.; Microsoft. (2024). Azure Well-ArchitectedFramework: Reliability.Unidadnivel de resilienciaMultizona1Multirregión2Multicloud3
Multizona protege frente a fallas locales dentro de una región. Multirregión amplía la separación, pero puede conservar dependencias del mismo proveedor. Multicloud solo añade una barrera real cuando la operación también es independiente.
In summaryMade for Yerlan Guevara, by HanademiSources: IncidentHub. (2024). The Definitive AWS Outage Report.; National Institute of Standards and Technology. (2012). Guide for conducting riskassessments: SP 800-30 Rev. 1.; outagecost.com.All 42 Google regions failed simultaneously.us-east-1 logs 2.6x more incidents.Shared dependency breaks the 0.01% math.99.99% still allows 52.6 minutes of downtime.
Regions reduce physical risk, but do not guarantee independence. Public data allow observing concentration and cascades, not calculating exact probabilities. Practical defense is isolating dependencies and testing recovery.
En resumenMade for Yerlan Guevara, by HanademiFuentes: IncidentHub. (2024). The Definitive AWS Outage Report.; National Institute of Standards and Technology. (2012). Guide for conducting riskassessments: SP 800-30 Rev. 1.; outagecost.com.Las 42 regiones de Google cayeron simultáneamente.us-east-1 registra 2,6 veces más incidentes.La dependencia compartida rompe el cálculo de 0,01%.99,99% todavía permite 52,6 minutos de caída.
Las regiones reducen riesgo físico, pero no garantizan independencia. Los datos públicos permiten observar concentración y cascadas, no calcular probabilidades exactas. La defensa práctica es aislar dependencias y ensayar la recuperación.

The research behind this deck

Public outages confirm that the cloud can fail beyond a single region. Without comparable denominators, no one can yet calculate which region or provider is statistically safer. The decision should focus on shared dependencies and proven recovery.

Key findings

The argument

This research is published in English and Spanish. Ver en español

La investigación detrás de esta presentación

Los apagones públicos confirman que la nube puede fallar más allá de una región. Sin denominadores comparables, nadie puede calcular todavía qué región o proveedor es estadísticamente más seguro. La decisión debe centrarse en dependencias compartidas y recuperación probada.

Hallazgos clave

El argumento

Esta investigación se publica en inglés y español. Read in English

Related researchInvestigación relacionada