GPT-4 launched at $30 per million tokens in March 2023; 16 months later, the mini model matched its quality for just $0.15. This unprecedented price compression set the stage for a total reimagining of software economics.
GPT-4 salió a 30 dólares por millón de tokens en marzo de 2023; 16 meses después, el modelo mini igualó su calidad por solo 0,15. Esta compresión de precios sin precedentes preparó el escenario para una reinvención total de la economía del software.
The cheapest capable models today, like Gemini 2.0 Flash and DeepSeek, cost up to 400 times less than GPT-4's launch price. This intense price deflation is the real force making mass-market AI deployment possible.
Los modelos capaces más baratos de hoy, como Gemini 2.0 Flash y DeepSeek, cuestan hasta 400 veces menos que el precio de lanzamiento de GPT-4. Esta intensa deflación de precios es la verdadera fuerza que hace posible el despliegue de IA en el mercado masivo.
The price for a fixed baseline of capability dropped from $60 in 2020 to mere cents by late 2025. Dataku tracking reveals that the exact same intelligence baseline becomes exponentially cheaper to query over time.
El precio para una capacidad base fija cayó de 60 dólares en 2020 a meros centavos para fines de 2025. El seguimiento revela que la misma base de inteligencia se vuelve exponencialmente más barata de consultar con el tiempo.
Top models are only 12x cheaper because capabilities keep advancing. While older capabilities crash in price, accessing the absolute bleeding edge of intelligence maintains a steady premium.
Los mejores modelos son 12x más baratos porque sus capacidades avanzan. Mientras las capacidades antiguas se desploman en precio, acceder a la vanguardia absoluta de la inteligencia mantiene una prima estable.
AI inference costs fall 10x every year, drastically outpacing the famous 18-month doubling cycle of Moore's Law. What used to be the gold standard of tech deflation looks incredibly slow compared to generative AI.
Los costos de inferencia de IA caen 10 veces por año, superando drásticamente el famoso ciclo de duplicación de 18 meses de la Ley de Moore. Lo que solía ser el patrón de oro de la deflación tecnológica parece increíblemente lento en comparación con la IA generativa.
DNA sequencing fell from 95 million dollars to $525, but that historic drop took 20 years instead of three. AI deflation is compressing multi-decade paradigm shifts into a single software cycle.
La secuenciación de ADN cayó de 95 millones de dólares a 525, pero esa caída histórica tomó 20 años en lugar de tres. La deflación de la IA está comprimiendo cambios de paradigma de múltiples décadas en un solo ciclo de software.
Los paneles solares son célebres por su rápida deflación, pero su caída de precio del 90% tomó una década entera. La inferencia de IA ha caído en márgenes similares en meros meses.
Depending on the milestone, the price to reach a capability has fallen between 9x and 900x per year. The steepest cost reductions have occurred in the most recent generations of models.
Según el hito, el precio para alcanzar una capacidad ha caído entre 9 y 900 veces por año. Las reducciones de costos más pronunciadas han ocurrido en las generaciones de modelos más recientes.
As prices were slashed, newer models delivered 66 times more benchmark performance for every dollar spent. Capabilities are rising in tandem with falling prices, amplifying the return on investment for developers.
Mientras los precios bajaban, los modelos más nuevos entregaron 66 veces más rendimiento en pruebas por cada dólar gastado. Las capacidades están aumentando a la par de la caída de los precios, amplificando el retorno de inversión para los desarrolladores.
OpenAI's o4-mini delivers up to 90% of the top o3 model's capability while being nearly 9x cheaper. Small reasoning models make advanced logical tasks economically viable for mass production.
El o4-mini de OpenAI entrega hasta el 90% de la capacidad del modelo superior o3 siendo casi 9 veces más barato. Los modelos pequeños de razonamiento hacen que las tareas lógicas avanzadas sean económicamente viables para la producción en masa.
DeepSeek V4 Pro matches Claude's performance while costing 86% less on output tokens. The arrival of highly capable open-weight models forces proprietary vendors to slash their output token prices to remain competitive.
DeepSeek V4 Pro iguala el rendimiento de Claude costando un 86% menos en tokens de salida. La llegada de modelos de pesos abiertos altamente capaces obliga a los proveedores a recortar los precios de sus tokens de salida para seguir siendo competitivos.
NVIDIA's B200 pushes 2.5x more inference than an H100, driving the underlying per-token cost down by 44%. Even though the physical chips cost more to buy, their massive leap in efficiency lowers the net cost of computing.
El B200 de NVIDIA produce 2,5 veces más inferencia que un H100, reduciendo el costo subyacente por token un 44%. Aunque los chips físicos cuestan más, su salto masivo en eficiencia reduce el costo neto de computación.
AI product gross margins are projected to reach 52% in 2026 as falling inference costs ease the squeeze. Software margins, initially squeezed by the high cost of API calls, are rebounding as model efficiency improves.
Se proyecta que los márgenes brutos de los productos de IA lleguen al 52% en 2026 a medida que la caída de costos alivia la presión. Los márgenes de software, inicialmente reducidos por el alto costo de las llamadas a API, se están recuperando a medida que mejora la eficiencia del modelo.
AI software runs on 50-65% gross margins, trailing traditional SaaS's 80-90%. Traditional software scaled essentially for free; AI-native applications require physical computing power for every action.
El software IA tiene márgenes del 50-65%, debajo del 80-90% tradicional. El software tradicional escalaba esencialmente gratis; las aplicaciones nativas de IA requieren poder de cómputo físico para cada acción.
AI-native startups still spend nearly a quarter of their revenue on inference, a cost traditional software never had. This new computing cost fundamentally alters the profit profile of startups scaling AI products.
Las startups nativas de IA gastan casi una cuarta parte de sus ingresos en inferencia, un costo que el software tradicional nunca tuvo. Este nuevo costo de cómputo altera fundamentalmente el perfil de ganancias de las startups que escalan productos de IA.
The single biggest barrier to enterprise AI is data access, cited by 41% of companies—ranking above cost and skills. Deflation has largely removed price as the primary objection for large-scale deployments.
La mayor barrera para la IA empresarial es el acceso a los datos, citada por el 41% de las empresas, por encima del costo y las habilidades. La deflación ha eliminado en gran medida el precio como la principal objeción para implementaciones a gran escala.
Even as inference costs fell 280-fold, total enterprise AI spend rose 320%, proving that cheaper fuel drives much more use. This is a classic Jevons paradox: reducing the cost of a resource ultimately increases the total amount of it consumed.
Aunque los costos de inferencia cayeron 280 veces, el gasto empresarial en IA subió un 320%, probando que el combustible barato dispara el uso. Esta es una paradoja de Jevons clásica: reducir el costo de un recurso finalmente aumenta la cantidad total consumida del mismo.
Total enterprise AI spend jumped from $11.5 billion to $37 billion, more than tripling in a single year. The lower cost per token has completely removed friction for enterprise adoption, unlocking multi-billion dollar budgets.
El gasto empresarial total en IA saltó de 11.500 millones a 37.000 millones de dólares, más que triplicándose en un solo año. El menor costo por token ha eliminado por completo la fricción para la adopción empresarial, desbloqueando presupuestos multimillonarios.
The global AI inference market is set to grow from $106 billion in 2025 to $255 billion by 2030. MarketsandMarkets forecasts a massive expansion as organizations integrate inference into everyday business logic.
Se prevé que el mercado global de inferencia de IA crezca de 106.000 millones de dólares en 2025 a 255.000 millones para 2030. MarketsandMarkets pronostica una expansión masiva a medida que las organizaciones integran la inferencia en la lógica empresarial cotidiana.
Generative AI drove half of all cloud market growth in 2025 as AI-specific services expanded up to 180%. Hyperscalers are seeing their fastest growth segments entirely dominated by the demand for model access and hosting.
La IA generativa impulsó la mitad de todo el crecimiento del mercado de la nube en 2025, con servicios específicos de IA en gran expansión. Los hyperscalers están viendo que sus segmentos de crecimiento más rápido están completamente dominados por la demanda de acceso y alojamiento de modelos.
Anthropic hit a $30 billion annualized revenue run rate. Price reductions did not destroy revenue; instead, they enabled a scale of usage that crowned new market leaders.
Anthropic alcanzó ingresos anualizados de 30.000 millones de dólares. Las reducciones de precios no destruyeron los ingresos; en cambio, permitieron una escala de uso que coronó a nuevos líderes del mercado.
Renting compute crushed margins as use soared, but labs that own their hardware flipped the deflation into massive profit. Falling token prices do not guarantee profit for AI builders unless they control the physical infrastructure running the model.
Alquilar el cómputo aplastó los márgenes al dispararse el uso, pero los laboratorios que poseen su hardware convirtieron la deflación en enormes ganancias. La caída de los precios por token no garantiza ganancias para los creadores de IA a menos que controlen la infraestructura física que ejecuta el modelo.
AI inference prices have plummeted by a factor of 300 in just three years, falling faster than Moore's Law or solar energy. This extreme deflation is upending traditional software economics and unleashing a massive wave of enterprise spending.
Key findings
GPT-4 launched at $30 per million tokens in March 2023; by July 2024 GPT-4o mini matched its quality for $0.15, a 200x price cut in 16 months. TokenCost
Moore's Law, the gold standard of tech deflation, roughly doubled chip performance per dollar only about every 18 months. Saylor Academy
Solar panels, a famously fast cost curve, fell about 90% over a full decade, far slower per year than AI inference. IRENA
DNA sequencing famously fell from $95 million per genome in 2001 to $525 in 2022, but that took two decades, not three years. National Human Genome Research Institute
Gartner projects inference will get up to 100x more cost-efficient over four years, with costs dropping more than 90% by 2030. Gartner (via CIO Dive)
GPT-3.5-turbo in 2022 delivered 66 times more benchmark performance per dollar than GPT-3 had in 2020, as scores nearly doubled and prices were slashed. Apiar Data
OpenAI's o4-mini delivers 80 to 90% of the top o3 model's capability at $1.10 per million tokens versus $10, nearly 9x cheaper. Value Add VC
Open-weight models now match or approach closed models on benchmarks while costing 50 to 90% less per token. AI Cost Check
NVIDIA's B200 chip pushes about 2.5x the inference of an H100 for roughly 40% more cost, cutting per-token cost about 44%. Kael Research
DeepSeek V4 Pro costs 86% less than Claude Sonnet 4.6 on output tokens with comparable performance, showing competition crushing prices. Tech Fast Forward
The cheapest capable model today, Gemini 2.0 Flash at $0.10 per million tokens, costs about 300 times less than GPT-4's launch price. TokenCost
AI product gross margins are projected to reach 52% in 2026, up from 41% in 2024, as falling inference costs ease the squeeze. ICONIQ Capital (via SaaStr)
The argument
Top-tier AI capability is up to 400 times cheaper than it was three years ago.
Prices are falling 10 times per year, far outpacing the historical drops of solar panels and DNA sequencing.
Fierce competition and better chips mean lower prices are arriving alongside massive performance gains.
Inference is a new line item that replaces near-zero-cost SaaS margins with expensive, usage-based economics.
Cheaper tokens triggered a 320% jump in total enterprise AI spend as falling costs unlocked vast new demand.
This research is published in English and Spanish. Ver en español
La investigación detrás de esta presentación
Los precios de inferencia de IA se han desplomado 300 veces en solo tres años, cayendo más rápido que la Ley de Moore. Esta deflación extrema está transformando la economía del software y desatando una ola masiva de inversión empresarial.
Hallazgos clave
GPT-4 salió a 30 dólares por millón de tokens en marzo de 2023; para julio de 2024 GPT-4o mini igualó su calidad a 0,15, un recorte de 200 veces en 16 meses. TokenCost
La Ley de Moore, el patrón de oro de la deflación tecnológica, apenas duplicaba el rendimiento por dólar de los chips cada 18 meses aproximadamente. Saylor Academy
Los paneles solares, una curva de costos célebre por su rapidez, cayeron cerca del 90% en una década entera, mucho más lento por año que la inferencia de IA. IRENA
La secuenciación de ADN cayó célebremente de 95 millones de dólares por genoma en 2001 a 525 en 2022, pero eso tomó dos décadas, no tres años. National Human Genome Research Institute
Gartner proyecta que la inferencia será hasta 100 veces más eficiente en costos en cuatro años, con caídas superiores al 90% para 2030. Gartner (via CIO Dive)
GPT-3.5-turbo en 2022 entregó 66 veces más rendimiento por dólar que GPT-3 en 2020, mientras las puntuaciones casi se duplicaban y los precios se desplomaban. Apiar Data
El o4-mini de OpenAI entrega del 80 al 90% de la capacidad del modelo superior o3 a 1,10 dólares por millón de tokens frente a 10, casi 9 veces más barato. Value Add VC
Los modelos de pesos abiertos ahora igualan o se acercan a los cerrados en las pruebas, mientras cuestan entre un 50 y un 90% menos por token. AI Cost Check
El chip B200 de NVIDIA produce unas 2,5 veces la inferencia de un H100 por aproximadamente un 40% más de costo, reduciendo el costo por token cerca de un 44%. Kael Research
DeepSeek V4 Pro cuesta un 86% menos que Claude Sonnet 4.6 en tokens de salida con rendimiento comparable, mostrando cómo la competencia aplasta los precios. Tech Fast Forward
El modelo capaz más barato de hoy, Gemini 2.0 Flash a 0,10 dólares por millón de tokens, cuesta unas 300 veces menos que el precio de lanzamiento de GPT-4. TokenCost
Se proyecta que los márgenes brutos de los productos de IA lleguen al 52% en 2026, frente al 41% en 2024, a medida que la caída de los costos de inferencia alivia la presión. ICONIQ Capital (via SaaStr)
El argumento
La capacidad de IA de primer nivel es hasta 400 veces más barata que hace tres años.
Los precios caen 10 veces por año, superando con creces las bajas históricas de los paneles solares y la secuenciación de ADN.
La competencia feroz y los mejores chips hacen que los precios bajos lleguen junto a enormes ganancias de rendimiento.
La inferencia es un nuevo costo que reemplaza los márgenes casi nulos del SaaS por una costosa economía basada en el uso.
Los tokens más baratos provocaron un salto del 320% en el gasto empresarial en IA al desbloquear una inmensa nueva demanda.
Esta investigación se publica en inglés y español. Read in English