Hanademi

How AI inference costs collapsed

22 slides · 18 min · 2026-06-14 language
ENES
theme
LightDark
view
DeckTableTalk
brand
HanademiPlatzi
How AI inference costs collapsedMade for Freddy Vega, by Hanademi
Cómo colapsaron los costos deIAMade for Freddy Vega, by Hanademi
OpenAI prices collapsed in three yearsLog scale: every gridline is ×10.Made for Freddy Vega, by HanademiSources: TokenCost. (2026). AI Price Index: LLM costs dropped 300x (2023-2026).UnitUSD per million tokens$0.1$1$10$100GPT-4GPT-4 TurboGPT-4oGPT-4o miniGPT-4.1GPT-5.4$30$2.5
GPT-4 launched at $30 per million tokens in March 2023; 16 months later, the mini model matched its quality for just $0.15. This unprecedented price compression set the stage for a total reimagining of software economics.
Los precios de OpenAI colapsaron en tresañosEscala logarítmica: cada línea es ×10.Made for Freddy Vega, by HanademiFuentes: TokenCost. (2026). AI Price Index: LLM costs dropped 300x (2023-2026).UnidadUSD por millón de tokens$0,1$1$10$100GPT-4GPT-4 TurboGPT-4oGPT-4o miniGPT-4.1GPT-5.4$30$2,5
GPT-4 salió a 30 dólares por millón de tokens en marzo de 2023; 16 meses después, el modelo mini igualó su calidad por solo 0,15. Esta compresión de precios sin precedentes preparó el escenario para una reinvención total de la economía del software.
The new absolute cost floorMade for Freddy Vega, by HanademiSources: TokenCost. (2026). AI Price Index: LLM costs dropped 300x (2023-2026).UnitUSD per million tokens$30GPT-4 launch$0.1Gemini 2.0 Flash$0.07DeepSeek cache-hit
The cheapest capable models today, like Gemini 2.0 Flash and DeepSeek, cost up to 400 times less than GPT-4's launch price. This intense price deflation is the real force making mass-market AI deployment possible.
El nuevo piso de costo absolutoMade for Freddy Vega, by HanademiFuentes: TokenCost. (2026). AI Price Index: LLM costs dropped 300x (2023-2026).UnidadUSD por millón de tokens$30Lanzamiento de GPT-4$0,1Gemini 2.0 Flash$0,07DeepSeek con caché
Los modelos capaces más baratos de hoy, como Gemini 2.0 Flash y DeepSeek, cuestan hasta 400 veces menos que el precio de lanzamiento de GPT-4. Esta intensa deflación de precios es la verdadera fuerza que hace posible el despliegue de IA en el mercado masivo.
The cost of GPT-3 level intelligenceMade for Freddy Vega, by HanademiSources: Dataku. (2025, November 10). The price of intelligence: tracking AI API costs since 2020.UnitUSD per million tokens2020$602023$1.5Late 2025$0.3
The price for a fixed baseline of capability dropped from $60 in 2020 to mere cents by late 2025. Dataku tracking reveals that the exact same intelligence baseline becomes exponentially cheaper to query over time.
El costo de la inteligencia nivel GPT-3Made for Freddy Vega, by HanademiFuentes: Dataku. (2025, November 10). The price of intelligence: tracking AI API costs since 2020.UnidadUSD por millón de tokens2020$602023$1,5Fines de 2025$0,3
El precio para una capacidad base fija cayó de 60 dólares en 2020 a meros centavos para fines de 2025. El seguimiento revela que la misma base de inteligencia se vuelve exponencialmente más barata de consultar con el tiempo.
Top models are only 12x cheaper becausecapabilities keep advancing.While older capabilities crash in price, accessing the absolute bleeding edge ofintelligence maintains a steady premium.Sources: TokenCost. (2026). AI Price Index: LLM costs dropped 300x (2023-2026).
Top models are only 12x cheaper because capabilities keep advancing. While older capabilities crash in price, accessing the absolute bleeding edge of intelligence maintains a steady premium.
Los mejores modelos son 12 x más baratosporque sus capacidades avanzan.Mientras las capacidades antiguas se desploman en precio, acceder a la vanguardiaabsoluta de la inteligencia mantiene una prima estable.Fuentes: TokenCost. (2026). AI Price Index: LLM costs dropped 300x (2023-2026).
Los mejores modelos son 12x más baratos porque sus capacidades avanzan. Mientras las capacidades antiguas se desploman en precio, acceder a la vanguardia absoluta de la inteligencia mantiene una prima estable.
AI deflation beats Moore's LawMade for Freddy Vega, by HanademiSources: Appenzeller, G. (2024, November 12). Welcome to LLMflation - LLM inference cost is going down fast. Andreessen Horowitz.; SaylorAcademy. (n.d.). Moore's Law: Fast, cheap computing. Information Systems: A Manager's Guide to Harnessing Technology.Moore's Law (18 months)12Start18 months laterAI Inference (12 months)110Start12 months later
AI inference costs fall 10x every year, drastically outpacing the famous 18-month doubling cycle of Moore's Law. What used to be the gold standard of tech deflation looks incredibly slow compared to generative AI.
La deflación de IA supera la Ley de MooreMade for Freddy Vega, by HanademiFuentes: Appenzeller, G. (2024, November 12). Welcome to LLMflation - LLM inference cost is going down fast. Andreessen Horowitz.; Saylor Academy.(n.d.). Moore's Law: Fast, cheap computing. Information Systems: A Manager's Guide to Harnessing Technology.Ley de Moore (18 meses)12Inicio18 meses despuésInferencia de IA (12 meses)110Inicio12 meses después
Los costos de inferencia de IA caen 10 veces por año, superando drásticamente el famoso ciclo de duplicación de 18 meses de la Ley de Moore. Lo que solía ser el patrón de oro de la deflación tecnológica parece increíblemente lento en comparación con la IA generativa.
DNA sequencing took two decades to fallMade for Freddy Vega, by HanademiSources: National Human Genome Research Institute. (2023). DNA sequencing costs: Data, 2001-2022.UnitUSD per genome$95,000,0002001$5252022
DNA sequencing fell from 95 million dollars to $525, but that historic drop took 20 years instead of three. AI deflation is compressing multi-decade paradigm shifts into a single software cycle.
El ADN tardó dos décadas en caerMade for Freddy Vega, by HanademiFuentes: National Human Genome Research Institute. (2023). DNA sequencing costs: Data, 2001-2022.UnidadUSD por genoma$95.000.0002001$5252022
La secuenciación de ADN cayó de 95 millones de dólares a 525, pero esa caída histórica tomó 20 años en lugar de tres. La deflación de la IA está comprimiendo cambios de paradigma de múltiples décadas en un solo ciclo de software.
Solar took a decade to dropMade for Freddy Vega, by HanademiSources: International Renewable Energy Agency. (n.d.). Power generation costs. IRENA.Decade cost indexed from 100 to 10 to reflect the 90% decline.UnitRelative costStart of decade100End of decade1010x
Solar panels are famously fast to deflate, but their 90% price drop took a full decade. AI inference has dropped by similar margins in mere months.
La energía solar tardó una década en caerMade for Freddy Vega, by HanademiFuentes: International Renewable Energy Agency. (n.d.). Power generation costs. IRENA.Costo de la década indexado de 100 a 10 para reflejar la caída del 90%.UnidadCosto relativoInicio de la década100Fin de la década1010x
Los paneles solares son célebres por su rápida deflación, pero su caída de precio del 90% tomó una década entera. La inferencia de IA ha caído en márgenes similares en meros meses.
Depending on the milestone, the price toreach a capability has fallen between 9xand 900x per year.The steepest cost reductions have occurred in the most recent generations of models.Sources: Epoch AI. (2025, March 12). LLM inference prices have fallen rapidly but unequally across tasks.
Depending on the milestone, the price to reach a capability has fallen between 9x and 900x per year. The steepest cost reductions have occurred in the most recent generations of models.
Según el hito, el precio para alcanzaruna capacidad ha caído entre 9 y 900veces por año.Las reducciones de costos más pronunciadas han ocurrido en las generaciones demodelos más recientes.Fuentes: Epoch AI. (2025, March 12). LLM inference prices have fallen rapidly but unequally across tasks.
Según el hito, el precio para alcanzar una capacidad ha caído entre 9 y 900 veces por año. Las reducciones de costos más pronunciadas han ocurrido en las generaciones de modelos más recientes.
Performance per dollar soaredMade for Freddy Vega, by HanademiSources: Apiar Data. (2026, April 14). AI intelligence per dollar: Frontier model benchmark efficiency (2020-2026).GPT-3 capability indexed to 1x baseline.UnitPerformance multiplierGPT-3 (2020)GPT-3.5-turbo (2022)66166x
As prices were slashed, newer models delivered 66 times more benchmark performance for every dollar spent. Capabilities are rising in tandem with falling prices, amplifying the return on investment for developers.
El rendimiento por dólar se disparóMade for Freddy Vega, by HanademiFuentes: Apiar Data. (2026, April 14). AI intelligence per dollar: Frontier model benchmark efficiency (2020-2026).Capacidad de GPT-3 indexada a una base de 1x.UnidadMultiplicador de rendimientoGPT-3 (2020)GPT-3.5-turbo (2022)66166x
Mientras los precios bajaban, los modelos más nuevos entregaron 66 veces más rendimiento en pruebas por cada dólar gastado. Las capacidades están aumentando a la par de la caída de los precios, amplificando el retorno de inversión para los desarrolladores.
The cost of reasoningMade for Freddy Vega, by HanademiSources: Cohen, T. (2026, May 28). OpenAI o3 and o4 mini: What the new reasoning models mean for AI applications. ValueAdd VC.UnitUSD per million tokensTop o3 model$10o4-mini$1.1
OpenAI's o4-mini delivers up to 90% of the top o3 model's capability while being nearly 9x cheaper. Small reasoning models make advanced logical tasks economically viable for mass production.
El costo del razonamientoMade for Freddy Vega, by HanademiFuentes: Cohen, T. (2026, May 28). OpenAI o3 and o4 mini: What the new reasoning models mean for AI applications.Value Add VC.UnidadUSD por millón de tokensModelo superior o3$10o4-mini$1,1
El o4-mini de OpenAI entrega hasta el 90% de la capacidad del modelo superior o3 siendo casi 9 veces más barato. Los modelos pequeños de razonamiento hacen que las tareas lógicas avanzadas sean económicamente viables para la producción en masa.
Competition is crushing output pricesMade for Freddy Vega, by HanademiSources: Tech Fast Forward. (2026). DeepSeek V4 Pro matches Claude at 86 percent off.Claude cost indexed to 100%; DeepSeek represented as the 14% remainder.UnitRelative token costClaude Sonnet 4.6100%DeepSeek V4 Pro14%
DeepSeek V4 Pro matches Claude's performance while costing 86% less on output tokens. The arrival of highly capable open-weight models forces proprietary vendors to slash their output token prices to remain competitive.
La competencia aplasta los precios desalidaMade for Freddy Vega, by HanademiFuentes: Tech Fast Forward. (2026). DeepSeek V4 Pro matches Claude at 86 percent off.Costo de Claude indexado al 100%; DeepSeek se representa como el 14% restante.UnidadCosto relativo por tokenClaude Sonnet 4.6100 %DeepSeek V4 Pro14 %
DeepSeek V4 Pro iguala el rendimiento de Claude costando un 86% menos en tokens de salida. La llegada de modelos de pesos abiertos altamente capaces obliga a los proveedores a recortar los precios de sus tokens de salida para seguir siendo competitivos.
Better hardware cuts inference costsMade for Freddy Vega, by HanademiSources: Kael Research. (2026). GPU economics: Real inference costs.Inference output12.5H100B200Per-token cost100%56%H100B200
NVIDIA's B200 pushes 2.5x more inference than an H100, driving the underlying per-token cost down by 44%. Even though the physical chips cost more to buy, their massive leap in efficiency lowers the net cost of computing.
Un mejor hardware recorta costos deinferenciaMade for Freddy Vega, by HanademiFuentes: Kael Research. (2026). GPU economics: Real inference costs.Salida de inferencia12,5H100B200Costo por token100 %56 %H100B200
El B200 de NVIDIA produce 2,5 veces más inferencia que un H100, reduciendo el costo subyacente por token un 44%. Aunque los chips físicos cuestan más, su salto masivo en eficiencia reduce el costo neto de computación.
Falling costs lift AI product marginsMade for Freddy Vega, by HanademiSources: SaaStr. (2026, February 7). 5 key takeaways from ICONIQ's State of AI report.UnitGross margin52%202641%2024
AI product gross margins are projected to reach 52% in 2026 as falling inference costs ease the squeeze. Software margins, initially squeezed by the high cost of API calls, are rebounding as model efficiency improves.
Costos menores elevan los márgenes de IAMade for Freddy Vega, by HanademiFuentes: SaaStr. (2026, February 7). 5 key takeaways from ICONIQ's State of AI report.UnidadMargen bruto52 %202641 %2024
Se proyecta que los márgenes brutos de los productos de IA lleguen al 52% en 2026 a medida que la caída de costos alivia la presión. Los márgenes de software, inicialmente reducidos por el alto costo de las llamadas a API, se están recuperando a medida que mejora la eficiencia del modelo.
AI software runs on 50 -65%gross margins, trailingtraditional SaaS's 80-90%.Traditional software scaled essentially for free; AI-native applications require physicalcomputing power for every action.Sources: KnowledgeLib. (2026, March 9). AI-native SaaS benchmarks 2026.
AI software runs on 50-65% gross margins, trailing traditional SaaS's 80-90%. Traditional software scaled essentially for free; AI-native applications require physical computing power for every action.
El software IA tiene márgenes del 50-65%, debajo del 80-90% tradicional.El software tradicional escalaba esencialmente gratis; las aplicaciones nativas de IArequieren poder de cómputo físico para cada acción.Fuentes: KnowledgeLib. (2026, March 9). AI-native SaaS benchmarks 2026.
El software IA tiene márgenes del 50-65%, debajo del 80-90% tradicional. El software tradicional escalaba esencialmente gratis; las aplicaciones nativas de IA requieren poder de cómputo físico para cada acción.
Inference is a new line itemMade for Freddy Vega, by HanademiSources: SaaStr. (2026, February 7). 5 key takeaways from ICONIQ's State of AI report.UnitShare of revenue23%Revenue spent on inference
AI-native startups still spend nearly a quarter of their revenue on inference, a cost traditional software never had. This new computing cost fundamentally alters the profit profile of startups scaling AI products.
La inferencia es un nuevo gastoMade for Freddy Vega, by HanademiFuentes: SaaStr. (2026, February 7). 5 key takeaways from ICONIQ's State of AI report.UnidadParte de los ingresos23 %Ingresos gastados en inferencia
Las startups nativas de IA gastan casi una cuarta parte de sus ingresos en inferencia, un costo que el software tradicional nunca tuvo. Este nuevo costo de cómputo altera fundamentalmente el perfil de ganancias de las startups que escalan productos de IA.
Price is not the real blockerMade for Freddy Vega, by HanademiSources: Bain & Company. (2026). Your AI budget is growing, your returns aren't. Here's why.UnitShare citing barrier41%Citing data access
The single biggest barrier to enterprise AI is data access, cited by 41% of companies—ranking above cost and skills. Deflation has largely removed price as the primary objection for large-scale deployments.
El precio no es el verdadero obstáculoMade for Freddy Vega, by HanademiFuentes: Bain & Company. (2026). Your AI budget is growing, your returns aren't. Here's why.UnidadPorción que cita la barrera41 %Citando acceso a datos
La mayor barrera para la IA empresarial es el acceso a los datos, citada por el 41% de las empresas, por encima del costo y las habilidades. La deflación ha eliminado en gran medida el precio como la principal objeción para implementaciones a gran escala.
Cheaper tokens unleashed a massive waveof spendMade for Freddy Vega, by HanademiSources: Oplexa. (2026). The AI inference cost crisis 2026.Inference cost factor28012022 baselineTodayTotal spend growth1004202022 baselineToday
Even as inference costs fell 280-fold, total enterprise AI spend rose 320%, proving that cheaper fuel drives much more use. This is a classic Jevons paradox: reducing the cost of a resource ultimately increases the total amount of it consumed.
Los tokens baratos desataron el gastomasivoMade for Freddy Vega, by HanademiFuentes: Oplexa. (2026). The AI inference cost crisis 2026.Factor de costo de inferencia2801Base 2022HoyCrecimiento de gasto total100420Base 2022Hoy
Aunque los costos de inferencia cayeron 280 veces, el gasto empresarial en IA subió un 320%, probando que el combustible barato dispara el uso. Esta es una paradoja de Jevons clásica: reducir el costo de un recurso finalmente aumenta la cantidad total consumida del mismo.
Enterprise AI spend tripled in one yearMade for Freddy Vega, by HanademiSources: NextWaves Insight. (2026). AI inference unit economics in the enterprise 2026.UnitUSD2024$11.5B2025$37B
Total enterprise AI spend jumped from $11.5 billion to $37 billion, more than tripling in a single year. The lower cost per token has completely removed friction for enterprise adoption, unlocking multi-billion dollar budgets.
El gasto empresarial en IA se triplicó en unañoMade for Freddy Vega, by HanademiFuentes: NextWaves Insight. (2026). AI inference unit economics in the enterprise 2026.UnidadUSD2024$11,5 mil M2025$37 mil M
El gasto empresarial total en IA saltó de 11.500 millones a 37.000 millones de dólares, más que triplicándose en un solo año. El menor costo por token ha eliminado por completo la fricción para la adopción empresarial, desbloqueando presupuestos multimillonarios.
The inference market is explodingMade for Freddy Vega, by HanademiSources: MarketsandMarkets. (2026). AI inference market - Global forecast to 2030.UnitUSD$0$100B$200B$255B20252030 projection
The global AI inference market is set to grow from $106 billion in 2025 to $255 billion by 2030. MarketsandMarkets forecasts a massive expansion as organizations integrate inference into everyday business logic.
El mercado de inferencia está explotandoMade for Freddy Vega, by HanademiFuentes: MarketsandMarkets. (2026). AI inference market - Global forecast to 2030.UnidadUSD$0$100 mil M$200 mil M$255 mil M2025Proyección 2030
Se prevé que el mercado global de inferencia de IA crezca de 106.000 millones de dólares en 2025 a 255.000 millones para 2030. MarketsandMarkets pronostica una expansión masiva a medida que las organizaciones integran la inferencia en la lógica empresarial cotidiana.
Generative AI drove half of all cloud marketgrowth in 2025 as AI-specific servicesexpanded up to 180%.Hyperscalers are seeing their fastest growth segments entirely dominated by the demandfor model access and hosting.Sources: Analysis Atlas. (2026, April 2). Cloud infrastructure market: AWS, Azure & GCP 2025.
Generative AI drove half of all cloud market growth in 2025 as AI-specific services expanded up to 180%. Hyperscalers are seeing their fastest growth segments entirely dominated by the demand for model access and hosting.
La IA generativa impulsó la mitad de todo elcrecimiento del mercado de la nube en2025, con servicios específicos de IA engran expansión.Los hyperscalers están viendo que sus segmentos de crecimiento más rápido estáncompletamente dominados por la demanda de acceso y alojamiento de modelos.Fuentes: Analysis Atlas. (2026, April 2). Cloud infrastructure market: AWS, Azure & GCP 2025.
La IA generativa impulsó la mitad de todo el crecimiento del mercado de la nube en 2025, con servicios específicos de IA en gran expansión. Los hyperscalers están viendo que sus segmentos de crecimiento más rápido están completamente dominados por la demanda de acceso y alojamiento de modelos.
Anthropic hit a $30 billion annualizedrevenue run rate.Price reductions did not destroy revenue; instead, they enabled a scale of usage thatcrowned new market leaders.Sources: Daily AI Bite. (2026, April 25). Anthropic's $30B ARR overtakes OpenAI in the AI revenue wars.
Anthropic hit a $30 billion annualized revenue run rate. Price reductions did not destroy revenue; instead, they enabled a scale of usage that crowned new market leaders.
Anthropic alcanzó ingresos anualizados de30.000 millones de dólares.Las reducciones de precios no destruyeron los ingresos; en cambio, permitieron unaescala de uso que coronó a nuevos líderes del mercado.Fuentes: Daily AI Bite. (2026, April 25). Anthropic's $30B ARR overtakes OpenAI in the AI revenue wars.
Anthropic alcanzó ingresos anualizados de 30.000 millones de dólares. Las reducciones de precios no destruyeron los ingresos; en cambio, permitieron una escala de uso que coronó a nuevos líderes del mercado.
Renting versus owning the computeMade for Freddy Vega, by HanademiSources: The Information (via BigGo Finance). (2026, February 25). AI giants' profitability under pressure as inference costs skyrocket.; Gentic News.(2026, April 11). AI economics have flipped: Owned compute drives margin explosion.Gross margins while renting40%33%PreviousCurrentCompute margins when owning35%70%Before ownershipAfter ownership
Renting compute crushed margins as use soared, but labs that own their hardware flipped the deflation into massive profit. Falling token prices do not guarantee profit for AI builders unless they control the physical infrastructure running the model.
Alquilar versus poseer el cómputoMade for Freddy Vega, by HanademiFuentes: The Information (via BigGo Finance). (2026, February 25). AI giants' profitability under pressure as inference costs skyrocket.; Gentic News.(2026, April 11). AI economics have flipped: Owned compute drives margin explosion.Márgenes brutos al alquilar40 %33 %AnteriorActualMárgenes de cómputo al poseer35 %70 %Antes de la propiedadDespués de la propiedad
Alquilar el cómputo aplastó los márgenes al dispararse el uso, pero los laboratorios que poseen su hardware convirtieron la deflación en enormes ganancias. La caída de los precios por token no garantiza ganancias para los creadores de IA a menos que controlen la infraestructura física que ejecuta el modelo.

The research behind this deck

AI inference prices have plummeted by a factor of 300 in just three years, falling faster than Moore's Law or solar energy. This extreme deflation is upending traditional software economics and unleashing a massive wave of enterprise spending.

Key findings

The argument

This research is published in English and Spanish. Ver en español

La investigación detrás de esta presentación

Los precios de inferencia de IA se han desplomado 300 veces en solo tres años, cayendo más rápido que la Ley de Moore. Esta deflación extrema está transformando la economía del software y desatando una ola masiva de inversión empresarial.

Hallazgos clave

El argumento

Esta investigación se publica en inglés y español. Read in English