This is the collapse that changes the economics of software. Stanford estimated that GPT-3.5-level inference fell from $20 to $0.07 per million tokens in 23 months. The comparison holds benchmark capability roughly fixed.
Este es el desplome que cambia la economía del software. Stanford estimó que la inferencia de nivel GPT-3.5 cayó de $20 a $0,07 por millón de tokens en 23 meses. La comparación mantiene aproximadamente fija la capacidad de referencia.
3 technical terms carry much of the argument.
3 términos técnicos sostienen buena parte del argumento.
The price collapse was not confined to one provider. Three leading small models listed input below $0.35 per million tokens. GPT-4o mini sat lowest at $0.15.
El desplome no se limitó a un proveedor. Tres modelos pequeños líderes publicaron entradas inferiores a $0,35 por millón de tokens. GPT-4o mini quedó en el nivel más bajo, con $0,15.
The cheapest token was not always attached to the desired capability. Late-2024 output prices ranged from $10 per million tokens for GPT-4o to $60 for o1. Verification and rework can widen the real gap further.
El token más barato no siempre estaba unido a la capacidad deseada. A finales de 2024, los precios de salida iban de $10 por millón de tokens para GPT-4o a $60 para o1. La verificación y el retrabajo pueden ampliar aún más la brecha real.
The dollar bought more than raw token volume. Reported broad-knowledge performance rose from 43.9% for GPT-3 to about 90% for Gemini Ultra. Better benchmark scores still do not guarantee reliable work.
El dólar compró más que volumen de tokens. El rendimiento publicado de conocimiento general subió de 43,9% para GPT-3 a cerca de 90% para Gemini Ultra. Mejores puntuaciones aún no garantizan trabajo fiable.
A dollar increasingly bought a larger working memory. Advertised limits rose from 2,048 tokens for GPT-3 to 2 million for Gemini 1.5 Pro. A larger window does not prove that every token is used reliably.
Un dólar compraba una memoria de trabajo cada vez mayor. Los límites anunciados subieron de 2.048 tokens para GPT-3 a 2 millones para Gemini 1.5 Pro. Una ventana mayor no prueba que cada token se use con fiabilidad.
Capability gains were broad but uneven. Stanford reported 18.8 points on MMMU, 48.9 on GPQA and 67.3 on SWE-bench during 2024. The fastest-moving benchmark was the one closest to practical software work.
Las mejoras fueron amplias pero desiguales. Stanford informó 18,8 puntos en MMMU, 48,9 en GPQA y 67,3 en SWE-bench durante 2024. La prueba que más avanzó fue la más cercana al trabajo práctico de software.
No single invention caused the price collapse. Stanford estimated annual gains near 30% in hardware price-performance and 40% in energy efficiency, while H100 reached nearly eight times V100 throughput on this measure. Separately, matching AlexNet required 44 times less compute by 2019 than in 2012.
Ninguna invención causó por sí sola el desplome. Stanford estimó mejoras anuales cercanas a 30% en precio-rendimiento y 40% en eficiencia energética, mientras H100 alcanzó casi 8 veces el rendimiento de V100 en esta medida. Por separado, igualar a AlexNet requirió 44 veces menos cómputo en 2019 que en 2012.
Lower technology prices do not automatically create productive capital. Italy estimated that each Transition 4.0 tax-credit euro activated €1.50 to €2.00 of total material investment among beneficiary firms. The upper estimate implies another €1 of investment around each credit euro.
Los precios tecnológicos más bajos no crean capital productivo de forma automática. Italia estimó que cada euro de crédito fiscal de Transición 4.0 movilizó entre €1,50 y €2,00 de inversión material total entre empresas beneficiarias. La estimación superior implica otro euro de inversión por cada euro de crédito.
The sticker price is only the first layer. OpenAI, Anthropic and Google each advertised about 50% off for eligible asynchronous batches. Scheduling alone can halve the price before changing models.
El precio publicado es solo la primera capa. OpenAI, Anthropic y Google anunciaron cerca de 50% de descuento para lotes asíncronos elegibles. La programación puede reducir el precio a la mitad sin cambiar de modelo.
Repeated context changes the economics again. OpenAI advertised cache reads about 50% below normal input, while Anthropic advertised up to 90% less. Creating the cache can carry a premium.
El contexto repetido vuelve a cambiar la economía. OpenAI anunció lecturas cerca de 50% más baratas que la entrada normal, y Anthropic hasta 90% menos. Crear la caché puede tener una prima.
Cheap inference matters when it converts into saved labor without sacrificing output. In this experiment, ChatGPT reduced completion time by 40% and raised evaluator-rated quality by 18%. The result came from bounded writing tasks.
La inferencia barata importa cuando se convierte en trabajo ahorrado sin sacrificar el resultado. En este experimento, ChatGPT redujo 40% el tiempo y elevó 18% la calidad calificada por evaluadores. El resultado provino de tareas delimitadas de redacción.
Task fit is part of the real price. Consultants using GPT-4 completed suitable tasks about 25% faster and more than 40% better. On an unsuitable task, correctness fell 19 points.
El ajuste de la tarea forma parte del precio real. Los consultores con GPT-4 completaron tareas adecuadas cerca de 25% más rápido y más de 40% mejor. En una tarea inadecuada, la corrección cayó 19 puntos.
The gains survived beyond one laboratory. A bounded Copilot task improved 55.8%, company-run developer trials found 26.08% more completed tasks, and support agents resolved 15% more issues per hour. The different outcomes warn against one universal productivity number.
Las mejoras sobrevivieron más allá de un laboratorio. Una tarea delimitada con Copilot mejoró 55,8%, ensayos empresariales hallaron 26,08% más tareas completadas y agentes de soporte resolvieron 15% más casos por hora. Los distintos resultados impiden usar una cifra universal.
Cheap intelligence can still be expensive on the wrong task. Experienced developers predicted a 24% speedup but took 19% longer with AI. This is a narrow boundary case, not a universal verdict.
La inteligencia barata todavía puede resultar costosa en la tarea equivocada. Desarrolladores experimentados esperaban una mejora de 24%, pero tardaron 19% más con IA. Es un caso límite estrecho, no un veredicto universal.
The marginal cost and the creation cost moved in opposite directions. Stanford reported estimated training-compute costs rising from $4.3 million for GPT-3 to $191 million for Gemini Ultra, while Meta reported 30.84 million H100 GPU-hours for Llama 3.1 405B. Cheap calls can rest on expensive fixed infrastructure.
El costo marginal y el costo de creación se movieron en direcciones opuestas. Stanford publicó costos estimados desde $4,3 millones para GPT-3 hasta $191 millones para Gemini Ultra, mientras Meta informó 30,84 millones de horas GPU H100 para Llama 3.1 405B. Las llamadas baratas pueden descansar sobre infraestructura fija costosa.
The user-facing price decline did not reduce the infrastructure race. Microsoft's cash capital expenditure rose from $20.6 billion in fiscal 2021 to $44.5 billion in fiscal 2024. The steepest increase came in the final year.
La caída del precio para el usuario no frenó la carrera de infraestructura. La inversión de capital en efectivo de Microsoft subió de $20.600 millones en 2021 fiscal a $44.500 millones en 2024 fiscal. El mayor aumento llegó en el último año.
Low application prices coexist with concentrated infrastructure. Synergy estimated AWS at 31%, Microsoft at 25% and Google at 11% in early 2024. Together, the three accounted for 67% of cloud-infrastructure revenue.
Los bajos precios de las aplicaciones conviven con infraestructura concentrada. Synergy estimó 31% para AWS, 25% para Microsoft y 11% para Google a comienzos de 2024. Juntas, las tres empresas representaban 67% de los ingresos.
The infrastructure layer is concentrated, but model capability moved differently. Stanford reported the leading closed-versus-open-weight gap falling from about 8% to 1.7% in 13 months. Alternatives can improve inside a concentrated compute market.
La infraestructura está concentrada, pero la capacidad de los modelos se movió de otra forma. Stanford informó que la brecha entre líderes cerrados y de pesos abiertos cayó de cerca de 8% a 1,7% en 13 meses. Las alternativas pueden mejorar dentro de un mercado de cómputo concentrado.
Efficiency can overpower growth for long periods. From 2010 to 2018, global data-center compute instances increased about 550%, while estimated electricity use rose about 6%. Added compute did not require proportional electricity during this period.
La eficiencia puede superar al crecimiento durante largos períodos. Entre 2010 y 2018, las instancias mundiales de cómputo aumentaron cerca de 550%, mientras el uso eléctrico estimado subió alrededor de 6%. El cómputo adicional no exigió electricidad proporcional durante este período.
AI does not enter one uniform electricity system. China's consumption per person rose more than sixfold, Sweden's fell from a much higher base, and the United States remained comparatively flat. The same data-center load lands differently in each country.
La IA no entra en un único sistema eléctrico uniforme. El consumo por persona de China creció más de 6 veces, el de Suecia cayó desde una base mucho mayor y Estados Unidos se mantuvo relativamente estable. La misma carga de centros de datos cae de forma distinta en cada país.
Efficiency is only half the electricity story. By 2025, renewable generation ranged from 5.49% in Singapore to 71.37% in Sweden across these five countries. Identical compute demand can carry very different grid consequences.
La eficiencia es solo la mitad de la historia eléctrica. En 2025, la generación renovable iba de 5,49% en Singapur a 71,37% en Suecia entre estos cinco países. Una demanda idéntica de cómputo puede tener consecuencias eléctricas muy distintas.
AI use spread quickly, rising from about 50% of surveyed organizations in 2022 to 78% later in 2024. Yet IBM found limited skills, data complexity and ethical concerns blocking successful adoption. Cheap models cannot redesign work by themselves.
El uso de IA avanzó rápido, desde cerca de 50% de las organizaciones encuestadas en 2022 hasta 78% posteriormente en 2024. IBM halló que las habilidades limitadas, la complejidad de datos y las preocupaciones éticas frenaban la adopción. Los modelos baratos no pueden rediseñar el trabajo por sí solos.
Cheaper use did not mean less capital entering the sector. Stanford reported private generative-AI investment rising from about $3 billion in 2022 to $33.9 billion in 2024. The steepest jump came in 2023.
El uso más barato no significó menos capital para el sector. Stanford informó que la inversión privada en IA generativa subió de cerca de $3.000 millones en 2022 a $33.900 millones en 2024. El mayor salto llegó en 2023.
The supply of digital workers expanded across most of these countries, but not at the same pace. Spain nearly doubled its total, while Italy peaked in 2023 and then declined. Access to models can globalize faster than the skills needed to deploy them.
La oferta de trabajadores digitales creció en la mayoría de estos países, pero no al mismo ritmo. España casi duplicó su total, mientras Italia alcanzó un pico en 2023 y luego cayó. El acceso a modelos puede globalizarse más rápido que las habilidades necesarias para desplegarlos.
This is the central paradox. The marginal price of using a model collapsed while estimated hardware and energy costs for frontier final runs grew 2.4 times annually. The reported 95% confidence interval runs from 2.0 to 3.1 times.
Esta es la paradoja central. El precio marginal de usar un modelo se desplomó mientras los costos estimados de hardware y energía de las corridas finales crecieron 2,4 veces al año. El intervalo de confianza de 95% va de 2,0 a 3,1 veces.
The value of the research is not only what each source knew, but what became visible when their evidence was combined.
A 2025 METR randomized study of 16 experienced developers and 246 tasks found AI increased completion time by 19%, despite predicted 24% savings. METR
Advertised context limits expanded from 2,048 GPT-3 tokens to 8,192 for an initial GPT-4 tier, 100,000 for Claude 2 and two million for Gemini 1.5 Pro. OpenAI
In a 758-consultant experiment, GPT-4 users completed suitable tasks about 25% faster and above 40% better, but correctness fell 19 points on an unsuitable task. Harvard Business School
Meta reported 1.46 million, 7.0 million and 30.84 million H100 GPU-hours for Llama 3.1 models with 8B, 70B and 405B parameters. Meta
From 2010 to 2018, global data-center compute instances increased about 550% while estimated electricity use increased only about 6%. Science
Across six benchmarks, Epoch AI found milestone-specific inference-price declines ranging from 9-fold to 900-fold per year, with the fastest drops concentrated in the latest year. epoch.ai
Frontier models’ amortized final-run hardware and energy costs have grown 2.4-fold annually since 2016, with a 95% confidence interval of 2.0-fold to 3.1-fold. epoch.ai
In mid-2024, listed input prices were $0.15 for GPT-4o mini, $0.25 for Claude 3 Haiku and $0.35 for Gemini 1.5 Flash per million tokens. OpenAI
Reported MMLU scores increased from 43.9% for GPT-3 to 69.3% for PaLM, 86.4% for GPT-4 and about 90.0% for Gemini Ultra. OpenAI
The argument
By mid-2024, basic model input had become a cents-scale commodity.
Cheap input did not erase the premium for harder reasoning.
Price fell while reported broad-knowledge performance rose from 43.9% to about 90%.
Models became cheaper while accepting far larger documents and histories.
The fastest benchmark gain appeared on practical software tasks.
Faster accelerators compounded with algorithms that needed 44x less compute.
This research is published in English and Spanish. Ver en español