This case joins engineering, statistics, and organizational decisions. These definitions let you read the rest of the deck without confusing a prediction with an observation. The most important distinction is simple: extrapolation means leaving known ground.
Este caso une ingeniería, estadística y decisiones organizacionales. Estas definiciones permiten leer el resto del deck sin confundir una predicción con una observación. La distinción más importante es simple: extrapolar significa salir del terreno conocido.
You already know the ending: Challenger disintegrated 73 seconds after launch. The question is what information existed before. On cold flights, the 53°F point concentrated the highest damage index and 3 incidents, a warning hard to dismiss as noise.
El lector ya conoce el final: el Challenger se desintegró 73 segundos después del despegue. La pregunta es qué información existía antes. En los vuelos fríos, el punto de 53 °F concentraba el mayor índice de daño y 3 incidentes, una advertencia difícil de llamar ruido.
The coldest prior flight had occurred at 53°F. The launch environment was near 36°F and the critical O-ring was estimated at 31°F. Engineers initially recommended not launching below 53°F, but the decision ultimately required proving danger in territory with no prior experience.
El vuelo previo más frío había ocurrido a 53 °F. El ambiente del lanzamiento estaba cerca de 36 °F y la junta crítica se estimó en 31 °F. Los ingenieros recomendaron inicialmente no lanzar por debajo de 53 °F, pero la decisión terminó exigiendo demostrar peligro en un terreno sin experiencia previa.
La condición de lanzamiento no solo fue más fría que la experiencia: quedó muy por debajo de la temperatura donde el modelo posterior situó el daño como igualmente probable.
The dilemma was not launch or achieve zero risk. The available comparison was between at least 13% at 31 °F and at least 2% at 60 °F. Waiting materially changed the exposure without requiring perfect prediction.
El dilema no era lanzar o alcanzar riesgo cero. La comparación disponible era entre al menos 13% a 31 °F y al menos 2% a 60 °F. Esperar cambiaba materialmente la exposición sin exigir una predicción perfecta.
The complete record allows estimation of a probability that the incident sample alone cannot identify. The shuttle2 model predicts 0.82 probability of damage at 31 °F. The figure was calculated after the accident and extrapolates 22 °F below the observed minimum.
El registro completo permite estimar una probabilidad que la muestra de incidentes no puede identificar. El modelo shuttle2 predice 0.82 de probabilidad de daño a 31 °F. La cifra se calculó después del accidente y extrapola 22 °F bajo el mínimo observado.
All 4 flights below 65 °F showed damage. Above that threshold there were also 3 damaged flights, so temperature was not a perfect rule. The error was demanding perfection from a risk signal before allowing it to influence the decision.
Los 4 vuelos bajo 65 °F presentaron daño. Sobre ese umbral también hubo 3 vuelos dañados, así que la temperatura no era una regla perfecta. El error fue exigir perfección a una señal de riesgo antes de permitir que influyera en la decisión.
Warmer flights were not free of damage. The record totals 4 incidents above 65 °F. That prevents a simple narrative, but does not erase the concentration of severity at the coldest temperatures.
Los vuelos más cálidos no estuvieron libres de daño. El registro suma 4 incidentes por encima de 65 °F. Eso impide una historia simplista, pero no borra la concentración de gravedad en las temperaturas más bajas.
The record held 23 flights, but the simplified argument focused on 7 with damage. The 16 undamaged flights were neither noise nor irrelevant cases. They were the denominator needed to ask how risk changed with temperature.
El registro tenía 23 vuelos, pero el argumento simplificado se concentró en 7 con daño. Los 16 vuelos sin daño no eran ruido ni casos irrelevantes. Eran el denominador necesario para preguntar cómo cambiaba el riesgo con la temperatura.
If only 7 flights with incidents are selected, each group shows 100% damage by construction. It is not a prediction, but a consequence of the filter. Without negative outcomes, binary logistic regression cannot identify a valid probability at 31 °F.
Si se seleccionan únicamente 7 vuelos con incidentes, cada grupo presenta 100% de daño por construcción. No es una predicción, sino una consecuencia del filtro. Sin resultados negativos, una regresión logística binaria no identifica una probabilidad válida a 31 °F.
No flight experience existed below 53 °F. Yet the discussion stopped requiring evidence of safety and shifted to demanding conclusive proof of danger. That change converted extreme uncertainty into operating permission.
No existía experiencia de vuelo por debajo de 53 °F. Aun así, la discusión dejó de exigir evidencia de seguridad y pasó a exigir una prueba concluyente de peligro. Ese cambio convirtió una incertidumbre extrema en permiso operativo.
Feynman found estimates near 1 in 100 among engineers and 1 in 100,000 among management. That 1,000x gap is not a minor calibration disagreement. It is evidence that information transformed as it rose through the organization.
Feynman encontró estimaciones cercanas a 1 en 100 entre ingenieros y 1 en 100,000 entre la gerencia. Esa brecha de 1,000 veces no es un desacuerdo menor de calibración. Es evidencia de que la información se transformaba mientras ascendía por la organización.
Seven people in NASA flight suits make the consequences of unresolved risk disagreement impossible to abstract away.
Siete personas con trajes de vuelo de la NASA hacen imposible abstraer las consecuencias del desacuerdo sobre el riesgo.
Google Flu Trends began with a median correlation of 0.97 against weekly CDC surveillance. In 2013 it overestimated the peak by 140% and remained above official reports for 100 of 108 weeks. The digital signal worked better as a complement to epidemiological surveillance, not as a replacement.
Google Flu Trends comenzó con una correlación media de 0.97 frente a la vigilancia semanal de los CDC. En 2013 sobrestimó 140% el pico y quedó por encima de los reportes oficiales durante 100 de 108 semanas. La señal digital funcionaba mejor como complemento de la vigilancia epidemiológica, no como reemplazo.
Zillow Offers accelerated its purchases during 2021. It moved from 1,856 homes in the first quarter to 9,680 in the third. Each pricing error stopped being a wrong forecast and became real inventory on the balance sheet.
Zillow Offers aceleró sus compras durante 2021. Pasó de 1,856 viviendas en el primer trimestre a 9,680 en el tercero. Cada error de precio dejó de ser una predicción equivocada y se convirtió en inventario real sobre el balance.
The cost appeared when price estimates met actual buyers. Zillow recorded USD 304 million in impairments during 2021-Q3. It also anticipated between USD 240 and 265 million for 2021-Q4, which is why those 2 values are presented as forecasts rather than observed losses.
El costo apareció cuando las estimaciones de precios encontraron compradores reales. Zillow registró USD 304 millones en deterioros durante 2021-T3. También anticipó entre USD 240 y 265 millones para 2021-T4, por eso esos 2 valores se presentan como previsiones y no como pérdidas observadas.
Zillow closed Offers after acknowledging it could not predict prices with the precision needed to operate at that scale. The company announced an approximate 25% reduction in its workforce. The predictive error had acquired irreversible operational consequences.
Zillow cerró Offers después de reconocer que no podía prever los precios con la precisión necesaria para operar a esa escala. La empresa anunció una reducción aproximada de 25% de su plantilla. El error predictivo había adquirido consecuencias operativas irreversibles.
Gender Shades disaggregated performance that an average could obscure. Errors for dark-skinned women reached 34.7%, 20.8%, and 34.5%. In light-skinned men, none of the 3 systems exceeded 0.8% error.
Gender Shades desagregó el rendimiento que una media podía ocultar. Los errores para mujeres de piel oscura llegaron a 34.7%, 20.8% y 34.5%. En hombres de piel clara, ninguno de los 3 sistemas superó 0.8% de error.
An aggregated figure could make the model appear competent. But sensitivity was 33% and positive predictive value barely 12%. In a clinical alert, performance must be read from the harm each error type produces.
Una cifra agregada podía hacer que el modelo pareciera competente. Pero la sensibilidad fue 33% y el valor predictivo positivo apenas 12%. En una alerta clínica, el rendimiento debe leerse desde el daño que produce cada tipo de error.
A sensitivity of 33% has a direct translation. For every cohort of patients who developed sepsis, 67% did not receive a timely alert. The critical metric was not overall average but how many cases went unwarned.
La sensibilidad de 33% tiene una traducción directa. Por cada grupo de pacientes que desarrolló sepsis, 67% no recibió una alerta oportuna. La métrica decisiva no era el promedio general, sino cuántos casos quedaban sin advertencia.
Known models performed worse when ImageNet was replicated with new data. The reported drop was between 11.7 and 14.3 percentage points. The result demonstrates degradation outside the original test, but does not answer the exact comparison between complete data and incident-only samples.
Los modelos conocidos rindieron peor cuando ImageNet se replicó con datos nuevos. La caída reportada estuvo entre 11.7 y 14.3 puntos porcentuales. El resultado demuestra degradación fuera de la prueba original, pero no responde la comparación exacta entre datos completos y muestras solo de incidentes.
Available evidence could not establish a valid probability at 31 °F using only the 7 incidents. It could not count AI failures caused specifically by out-of-distribution extrapolation. It found no consolidated productive comparison between models evaluated on complete data and models evaluated on incidents alone.
La evidencia disponible no pudo establecer una probabilidad válida a 31 °F usando solo los 7 incidentes. Tampoco pudo contar los incidentes de IA causados específicamente por extrapolación fuera de distribución. Finalmente, no encontró una comparación productiva consolidada entre modelos evaluados con datos completos y modelos evaluados solo con incidentes.
NIST converts the Challenger lessons into 4 operational verbs: govern, map, measure, and manage. Order matters because measuring without authority does not stop a deployment. Each team needs explicit boundaries and a person with the power to say no.
NIST convierte las lecciones del Challenger en 4 verbos operativos: gobernar, mapear, medir y gestionar. El orden importa porque medir sin autoridad no detiene un despliegue. Cada equipo necesita límites explícitos y una persona con poder para decir no.
Challenger is not a story about an ugly graph or a single wrong calculation. It is a story about excluding denominators, extrapolating without limits, and shifting the burden of proof to those warning of danger. Modern cases change industries but preserve the same structure.
Challenger no es una historia sobre una gráfica fea ni sobre un único cálculo errado. Es una historia sobre excluir denominadores, extrapolar sin límites y trasladar la carga de la prueba a quienes advertían del peligro. Los casos modernos cambian de industria, pero conservan la misma estructura.
A forensic reconstruction of how incomplete data, extreme extrapolation, and organizational pressure authorized Challenger, and how those same errors resurface in AI systems deployed at scale.
Key findings
Los cuatro vuelos bajo 65 °F presentaron daño, frente a tres de los 19 vuelos realizados sobre 65 °F. American Statistical Association
La regresión logística de los 23 vuelos estima aproximadamente 99.96% de probabilidad de daño a 31 °F. American Statistical Association
Con siete resultados positivos y ningún negativo, una regresión logística binaria no identifica una probabilidad válida de falla a 31 °F. Cambridge University Press
Zillow registró 304 millones de dólares en deterioros de inventario en 2021-T3 y anticipó otros 240 a 265 millones en 2021-T4. Zillow Group
Gender Shades encontró errores máximos de 34.7%, 20.8% y 34.5% para mujeres de piel oscura en tres clasificadores comerciales. PMLR
Un sistema hospitalario de sepsis mostró 33% de sensibilidad, 83% de especificidad y apenas 12% de valor predictivo positivo. American Medical Association
El modelo de sepsis no generó una alerta oportuna para 67% de los pacientes que posteriormente desarrollaron sepsis. American Medical Association
La comparación 4 de 4 contra 3 de 19 produce una probabilidad unilateral de Fisher cercana a 0.004 bajo ausencia de asociación. American Statistical Association
En el subconjunto de siete vuelos con incidentes, la tasa observada es 7 de 7, o 100%, por construcción. University of California, Irvine
Abraham Wald recomendó reforzar las zonas sin impactos en los aviones supervivientes porque los aviones alcanzados allí probablemente no regresaban. Center for Naval Analyses
The argument
Challenger disintegrated 73 seconds after launch, but the cold signal was present across 23 prior flights.
The critical O-ring was estimated at 31°F, 22°F below the minimum observed of 53°F.
One assessment estimated at least 13% risk of catastrophic failure at 31°F, versus 2% at 60°F.
Selecting only 7 incidents concealed 16 undamaged flights and prevented valid probability estimation.
Google Flu Trends overestimated during 100 of 108 weeks despite historical correlation of 0.97.
Zillow multiplied its home purchases more than 5x before shutting down Offers and cutting 25% of staff.
Gender Shades found error rates up to 34.7% for dark-skinned women, versus a maximum of 0.8% for light-skinned men.
A hospital sepsis model missed timely alerts for 67% of those who developed the disease.
The practical response is to shift the burden of proof: govern, map, measure, and manage before deployment.
This research is published in English and Spanish. Ver en español
La investigación detrás de esta presentación
Una reconstrucción forense de cómo datos incompletos, extrapolación extrema y presión organizacional autorizaron el Challenger, y cómo esos mismos errores reaparecen en sistemas de IA desplegados a escala.
Hallazgos clave
Los cuatro vuelos bajo 65 °F presentaron daño, frente a tres de los 19 vuelos realizados sobre 65 °F. American Statistical Association
La regresión logística de los 23 vuelos estima aproximadamente 99.96% de probabilidad de daño a 31 °F. American Statistical Association
Con siete resultados positivos y ningún negativo, una regresión logística binaria no identifica una probabilidad válida de falla a 31 °F. Cambridge University Press
Zillow registró 304 millones de dólares en deterioros de inventario en 2021-T3 y anticipó otros 240 a 265 millones en 2021-T4. Zillow Group
Gender Shades encontró errores máximos de 34.7%, 20.8% y 34.5% para mujeres de piel oscura en tres clasificadores comerciales. PMLR
Un sistema hospitalario de sepsis mostró 33% de sensibilidad, 83% de especificidad y apenas 12% de valor predictivo positivo. American Medical Association
El modelo de sepsis no generó una alerta oportuna para 67% de los pacientes que posteriormente desarrollaron sepsis. American Medical Association
La comparación 4 de 4 contra 3 de 19 produce una probabilidad unilateral de Fisher cercana a 0.004 bajo ausencia de asociación. American Statistical Association
En el subconjunto de siete vuelos con incidentes, la tasa observada es 7 de 7, o 100%, por construcción. University of California, Irvine
Abraham Wald recomendó reforzar las zonas sin impactos en los aviones supervivientes porque los aviones alcanzados allí probablemente no regresaban. Center for Naval Analyses
El argumento
El Challenger se desintegró 73 segundos después del despegue, pero la señal de frío ya estaba en 23 vuelos previos.
La junta crítica se estimó en 31 °F, 22 °F por debajo del mínimo observado de 53 °F.
Una evaluación estimó al menos 13% de riesgo catastrófico a 31 °F, frente a 2% a 60 °F.
La selección de solo 7 incidentes ocultó 16 vuelos sin daño e impidió estimar una probabilidad válida.
Google Flu Trends sobrestimó durante 100 de 108 semanas pese a su correlación histórica de 0.97.
Zillow multiplicó sus compras de viviendas por más de 5 antes de cerrar Offers y recortar 25% de su plantilla.
Gender Shades encontró errores de hasta 34.7% en mujeres de piel oscura, frente a un máximo de 0.8% en hombres de piel clara.
Un modelo hospitalario de sepsis omitió alertas oportunas para 67% de quienes desarrollaron la enfermedad.
La respuesta práctica es cambiar la carga de la prueba: gobernar, mapear, medir y gestionar antes de desplegar.
Esta investigación se publica en inglés y español. Read in English