AI can redesign aerodynamics, but it cannot certify itself
22 slides · 31 min · 1 minute agolanguage
ENES
theme
LightDark
view
DeckTableTalk
brand
HanademiPlatzi
AlphaGeometry solved 25 of 30 Olympiad problems. Human gold medalists averaged 25.9. That narrow gap proves formidable reasoning, but an aircraft needs verified engineering decisions, not only brilliant answers.
AlphaGeometry resolvió 25 de 30 problemas olímpicos. Los medallistas de oro humanos promediaron 25,9. Esa pequeña diferencia demuestra un razonamiento formidable, pero una aeronave necesita decisiones de ingeniería verificadas, no solo respuestas brillantes.
This argument connects AI with several mature engineering disciplines. CFD predicts flow, while FEA checks whether the structure survives it. Surrogates and adjoints accelerate decisions, but neither removes the need for trustworthy physics.
Este argumento conecta la IA con varias disciplinas maduras de ingeniería. La CFD predice el flujo, mientras el FEA comprueba si la estructura lo resiste. Los sustitutos y adjuntos aceleran decisiones, pero ninguno elimina la necesidad de física confiable.
A strong component can still produce a weak chain. Repeating a 98% reliable action across 34 unverified steps pushes total success below an even chance. Aerodynamic agents therefore need checks inside the workflow, not only at the end.
Un componente sólido todavía puede producir una cadena débil. Repetir una acción fiable al 98% durante 34 pasos sin verificar reduce el éxito total por debajo de una probabilidad par. Por eso los agentes aerodinámicos necesitan controles dentro del flujo, no solo al final.
SWE-bench used 2,294 real software issues rather than classroom exercises. Its original best system resolved only 1.96%. Aerodynamic autonomy demands a much higher standard because a plausible but incorrect result can propagate into physical hardware.
SWE-bench utilizó 2.294 problemas reales de software, no ejercicios académicos. Su mejor sistema original resolvió solo 1,96%. La autonomía aerodinámica exige un nivel mucho mayor porque un resultado plausible pero incorrecto puede llegar al hardware físico.
The vision has moved faster than public commercial deployment. Researchers found zero announced LLM-based geometry copilots in use by aerospace manufacturers. Absence of an announcement is not proof of absence, but it marks the gap between a promising architecture and demonstrated industrial adoption.
La visión ha avanzado más rápido que el despliegue comercial público. Los investigadores no encontraron ningún copiloto geométrico basado en LLM anunciado y utilizado por fabricantes aeroespaciales. La ausencia de anuncios no prueba inexistencia, pero marca la distancia entre una arquitectura prometedora y una adopción industrial demostrada.
Aerodynamic AI is no longer starting from empty shelves. AirfRANS provides 1,000 simulations, UIUC lists more than 1,600 airfoils, and DrivAerNet++ contains 8,000 car designs. Scale helps, but coordinates without uniform performance labels and automotive data cannot certify an aircraft.
La IA aerodinámica ya no parte de estantes vacíos. AirfRANS aporta 1.000 simulaciones, UIUC incluye más de 1.600 perfiles y DrivAerNet++ contiene 8.000 diseños de automóviles. La escala ayuda, pero unas coordenadas sin etiquetas uniformes y los datos automotrices no pueden certificar una aeronave.
Specialization requires a common examination. ShapeBench supplies 103 tasks across eight environments, three geometry classes, and seven optimization methods. That breadth makes progress comparable instead of letting each system choose its easiest demonstration.
La especialización requiere una prueba común. ShapeBench aporta 103 tareas en ocho entornos, tres clases geométricas y siete métodos de optimización. Esa amplitud permite comparar avances en vez de dejar que cada sistema elija su demostración más fácil.
AWS reports that Baker Hughes cut CFD wait time by 98% and runtime by 26%. The difference matters because faster access and faster calculation are separate problems. Before replacing physics with AI, organizations should remove the avoidable delay around the solver.
AWS reporta que Baker Hughes redujo 98% el tiempo de espera de CFD y 26% el tiempo de ejecución. La diferencia importa porque acceder más rápido y calcular más rápido son problemas distintos. Antes de reemplazar la física con IA, las organizaciones deben eliminar la demora evitable alrededor del solucionador.
Faster aerodynamic computing can create value before full autonomy arrives. Koenigsegg reported recovering one HPC simulation investment in less than three months for a new car configuration. The economic case can begin with better access to proven solvers.
Un cómputo aerodinámico más rápido puede crear valor antes de que llegue la autonomía completa. Koenigsegg reportó recuperar una inversión en simulación HPC en menos de tres meses para una nueva configuración de automóvil. El caso económico puede comenzar con mejor acceso a solucionadores probados.
A wing is not only a flow surface. In a basic three-dimensional displacement model, one million nodes imply about three million primary unknowns. Generative geometry must therefore satisfy structural calculations as well as aerodynamic objectives.
Un ala no es solo una superficie de flujo. En un modelo básico tridimensional de desplazamiento, un millón de nodos implica unas tres millones de incógnitas primarias. Por eso la geometría generativa debe satisfacer cálculos estructurales además de objetivos aerodinámicos.
Brute-force gradient estimation scales with the number of design variables. In this simplified example, 1,000 variables and three objectives require 1,001 forward evaluations but about four major adjoint solves. The numerical revolution is already here, so AI should build on it.
La estimación directa del gradiente escala con el número de variables de diseño. En este ejemplo simplificado, 1.000 variables y tres objetivos requieren 1.001 evaluaciones directas, pero unas cuatro soluciones adjuntas principales. La revolución numérica ya existe, así que la IA debe apoyarse en ella.
A multi-agent architecture is only useful if coordination can be measured. TeamBench enforces role separation across 851 templates and 931 instances. AgentClinic tests sequential tool use across nine medical specialties and seven languages, showing how domain agents can be evaluated within clear boundaries.
Una arquitectura de varios agentes solo es útil si puede medirse su coordinación. TeamBench impone separación de funciones en 851 plantillas y 931 instancias. AgentClinic evalúa el uso secuencial de herramientas en nueve especialidades médicas y siete idiomas, mostrando cómo probar agentes de dominio dentro de límites claros.
A generator can propose 10,000 shapes without making 10,000 shapes trustworthy. This illustrative policy sends only 100 candidates, or 1%, into expensive simulation. The system becomes useful when generation is cheap and escalation is disciplined.
Un generador puede proponer 10.000 formas sin convertirlas en 10.000 formas confiables. Esta política ilustrativa envía solo 100 candidatos, o 1%, a simulación costosa. El sistema se vuelve útil cuando generar es barato y escalar es disciplinado.
Neural operators can replace repeated numerical work with a learned mapping. The Fourier Neural Operator paper reported speedups approaching three orders of magnitude on selected benchmarks. That is enough to transform exploration, but not enough to prove accuracy on an unfamiliar aircraft.
Los operadores neuronales pueden sustituir trabajo numérico repetido por una relación aprendida. El artículo del operador neuronal de Fourier reportó aceleraciones cercanas a tres órdenes de magnitud en pruebas seleccionadas. Eso puede transformar la exploración, pero no demuestra precisión en una aeronave desconocida.
A 100-fold cost reduction changes the size of the question engineers can ask. Under a fixed budget, an illustrative search grows from 100 to 10,000 candidates. Cheap simulation does not simply accelerate the old workflow; it invites a much larger design space.
Una reducción de costos de 100 veces cambia el tamaño de la pregunta que pueden plantear los ingenieros. Con un presupuesto fijo, una búsqueda ilustrativa crece de 100 a 10.000 candidatos. La simulación barata no solo acelera el flujo anterior; invita a explorar un espacio de diseño mucho mayor.
Not every acceleration requires replacing the solver with a learned model. DLR reported up to an 8.6-fold improvement by running its CODA aircraft-aerodynamics workflow on GPUs. Trusted simulation and modern hardware remain part of the competitive baseline.
No toda aceleración exige reemplazar el solucionador por un modelo aprendido. DLR reportó una mejora de hasta 8,6 veces al ejecutar su flujo CODA de aerodinámica aeronáutica en GPU. La simulación confiable y el hardware moderno siguen formando parte de la referencia competitiva.
A useful surrogate should not treat every prediction as equally trustworthy. This illustrative policy accepts 90%, escalates 9%, and rejects 1% of 10,000 candidates. The 900 uncertain cases receive expensive simulation because novelty, not volume, should consume the verification budget.
Un sustituto útil no debe tratar todas sus predicciones como igualmente confiables. Esta política ilustrativa acepta 90%, escala 9% y rechaza 1% de 10.000 candidatos. Los 900 casos inciertos reciben simulación costosa porque la novedad, no el volumen, debe consumir el presupuesto de verificación.
Adding equations to a loss function does not make a model physically correct. Controlled experiments found error differences approaching three orders of magnitude on selected problems. Physics constraints are guardrails, so trusted solvers and conservation checks must still verify the journey.
Añadir ecuaciones a una función de pérdida no vuelve físicamente correcto a un modelo. Experimentos controlados encontraron diferencias de error cercanas a tres órdenes de magnitud en problemas seleccionados. Las restricciones físicas son barandillas, por lo que solucionadores confiables y controles de conservación todavía deben verificar el recorrido.
Simulation preparation contains repetitive work that agents can plausibly automate. In this illustrative scenario, setup falls from eight hours to one per study. Across 100 studies, that releases 700 engineer-hours for judgment, diagnosis, and verification.
La preparación de simulaciones contiene trabajo repetitivo que los agentes pueden automatizar de forma plausible. En este escenario ilustrativo, la preparación baja de ocho horas a una por estudio. En 100 estudios, eso libera 700 horas de ingeniería para criterio, diagnóstico y verificación.
A cheaper evaluation does not guarantee lower total computation. If each run becomes 100 times cheaper but usage rises 200 times, total work reaches twice the baseline. The likely future is not the same simulation bill delivered faster, but many more questions being asked.
Una evaluación más barata no garantiza menor cómputo total. Si cada ejecución se abarata 100 veces pero el uso aumenta 200 veces, el trabajo total llega al doble de la base. El futuro probable no es la misma factura de simulación entregada antes, sino muchas más preguntas.
Speed is useful only when the result remains auditable. ASME V&V 20 separates numerical, input, and comparison uncertainty. A credible AI pipeline should preserve those distinctions, record every run, and require accountable approval before a generated design advances.
La velocidad solo sirve cuando el resultado sigue siendo auditable. ASME V&V 20 separa la incertidumbre numérica, de entrada y de comparación. Una canalización de IA creíble debe conservar esas distinciones, registrar cada ejecución y exigir aprobación responsable antes de avanzar un diseño generado.
The value of the research is not only what each source knew, but what became visible when their evidence was combined.
General AI reasoning is strong enough to matter, but examination skill is not design authority. The opportunity joins learned speed with established engineering tools.
Key findings
The Fourier Neural Operator paper reported speedups reaching approximately three orders of magnitude on selected PDE benchmarks. github.com
For 1,000 variables, forward finite differences require about 1,001 primal evaluations per gradient, while a single-objective adjoint needs roughly one primal and one adjoint solve.
Controlled PINN experiments reported error differences reaching roughly three orders of magnitude on selected convection, reaction, and diffusion problems.
Under an illustrative 1,000-fold speedup, a three-hour solve becomes 10.8 seconds before preprocessing, communication, and uncertainty overhead.
At 98% accuracy per step, an unverified 34-step AI workflow becomes more likely wrong than right. edn.com
AlphaGeometry solved 25 of 30 Olympiad geometry problems, compared with a 25.9-problem average for human gold medalists. deepmind.google
The original SWE-bench evaluation reported a best resolution rate of 1.96% across a benchmark containing 2,294 real GitHub issues. proceedings.iclr.cc
The first AIAA Drag Prediction Workshop reportedly found a roughly 270-drag-count spread among submitted CFD predictions for a common transport configuration.
With 1,000 variables and three scalar objectives, a simplified adjoint count is about four major solves, versus 1,001 forward finite-difference evaluations.
Complex-step differentiation can use perturbations near 10^-20 without the subtractive cancellation that limits ordinary finite differences.
In an illustrative pipeline, screening 99% of 10,000 generated candidates leaves 100 for high-fidelity evaluation. getcalc.com
Under a fixed-budget scenario, making evaluations 100 times cheaper expands a search from 100 to 10,000 candidates if all other costs remain constant. tiger-algebra.com
The argument
At 98% accuracy per step, a 34-step unverified workflow is more likely wrong than right.
The original SWE-bench leader resolved only 1.96% of 2,294 real issues.
Researchers found no publicly announced LLM geometry copilot in commercial aerospace use.
Specialized models can train on substantial data, but labels and domains still limit transfer.
ShapeBench compares methods across 103 tasks instead of isolated demonstrations.
Much of CFD delay can come from infrastructure and queues, not only solver mathematics.
This research is published in English and Spanish. Ver en español
La investigación detrás de esta presentación
El razonamiento general de IA ya importa, pero superar exámenes no concede autoridad de diseño. La oportunidad une la velocidad aprendida con herramientas de ingeniería establecidas.
Hallazgos clave
El artículo del operador neuronal de Fourier reportó aceleraciones de aproximadamente tres órdenes de magnitud en determinadas pruebas de ecuaciones diferenciales. github.com
Para 1.000 variables, las diferencias finitas requieren unas 1.001 evaluaciones por gradiente, mientras que un adjunto de objetivo único necesita una solución primal y otra adjunta.
Experimentos controlados con PINN reportaron diferencias de error cercanas a tres órdenes de magnitud en problemas seleccionados de convección, reacción y difusión.
Con una aceleración ilustrativa de 1.000 veces, una solución de tres horas se convierte en 10,8 segundos antes de preprocesamiento, comunicación e incertidumbre.
Con una precisión de 98% por paso, un flujo de IA de 34 pasos sin verificación termina siendo más propenso al error que al acierto. edn.com
AlphaGeometry resolvió 25 de 30 problemas de geometría olímpica, frente a un promedio de 25,9 para medallistas de oro humanos. deepmind.google
La evaluación original de SWE-bench reportó una tasa máxima de resolución de 1,96% en una prueba con 2.294 problemas reales de GitHub. proceedings.iclr.cc
El primer taller AIAA de predicción de resistencia reportó una dispersión aproximada de 270 cuentas entre predicciones CFD de una configuración común.
Con 1.000 variables y tres objetivos escalares, un recuento adjunto simplificado es de unas cuatro soluciones principales, frente a 1.001 evaluaciones por diferencias finitas.
La diferenciación por paso complejo puede usar perturbaciones cercanas a 10^-20 sin la cancelación sustractiva que limita las diferencias finitas ordinarias.
En una canalización ilustrativa, filtrar 99% de 10.000 candidatos generados deja 100 para evaluación de alta fidelidad. getcalc.com
En un escenario de presupuesto fijo, abaratar las evaluaciones 100 veces amplía una búsqueda de 100 a 10.000 candidatos si los demás costos permanecen constantes. tiger-algebra.com
El argumento
Con 98% de precisión por paso, un flujo de 34 pasos sin verificar tiene más probabilidad de fallar.
El líder original de SWE-bench resolvió solo 1,96% de 2.294 problemas reales.
Los investigadores no encontraron ningún copiloto geométrico con LLM anunciado para uso aeroespacial comercial.
Los modelos especializados pueden entrenarse con muchos datos, pero las etiquetas y dominios todavía limitan la transferencia.
ShapeBench compara métodos en 103 tareas en vez de demostraciones aisladas.
Gran parte de la demora de CFD puede venir de infraestructura y colas, no solo del solucionador.
Esta investigación se publica en inglés y español. Read in English