This is the collapse that changes the economics of software. Stanford estimated that GPT-3.5-level inference fell from $20 to $0.07 per million tokens in 23 months. The comparison holds benchmark capability roughly fixed.
Este es el desplome que cambia la economía del software. Stanford estimó que la inferencia de nivel GPT-3.5 cayó de $20 a $0,07 por millón de tokens en 23 meses. La comparación mantiene aproximadamente fija la capacidad de referencia.
3 términos técnicos sostienen buena parte del argumento.
The price collapse was not confined to one provider. Three leading small models listed input below $0.35 per million tokens. GPT-4o mini sat lowest at $0.15.
El desplome no se limitó a un proveedor. Tres modelos pequeños líderes publicaron entradas inferiores a $0,35 por millón de tokens. GPT-4o mini quedó en el nivel más bajo, con $0,15.
The cheapest token was not always attached to the desired capability. Late-2024 output prices ranged from $10 per million tokens for GPT-4o to $60 for o1. Verification and rework can widen the real gap further.
El token más barato no siempre estaba unido a la capacidad deseada. A finales de 2024, los precios de salida iban de $10 por millón de tokens para GPT-4o a $60 para o1. La verificación y el retrabajo pueden ampliar aún más la brecha real.
The dollar bought more than raw token volume. Reported broad-knowledge performance rose from 43.9% for GPT-3 to about 90% for Gemini Ultra. Better benchmark scores still do not guarantee reliable work.
El dólar compró más que volumen de tokens. El rendimiento publicado de conocimiento general subió de 43,9% para GPT-3 a cerca de 90% para Gemini Ultra. Mejores puntuaciones aún no garantizan trabajo fiable.
A dollar increasingly bought a larger working memory. Advertised limits rose from 2,048 tokens for GPT-3 to 2 million for Gemini 1.5 Pro. A larger window does not prove that every token is used reliably.
Un dólar compraba una memoria de trabajo cada vez mayor. Los límites anunciados subieron de 2.048 tokens para GPT-3 a 2 millones para Gemini 1.5 Pro. Una ventana mayor no prueba que cada token se use con fiabilidad.
Capability gains were broad but uneven. Stanford reported 18.8 points on MMMU, 48.9 on GPQA and 67.3 on SWE-bench during 2024. The fastest-moving benchmark was the one closest to practical software work.
Las mejoras fueron amplias pero desiguales. Stanford informó 18,8 puntos en MMMU, 48,9 en GPQA y 67,3 en SWE-bench durante 2024. La prueba que más avanzó fue la más cercana al trabajo práctico de software.
No single invention caused the price collapse. Stanford estimated annual gains near 30% in hardware price-performance and 40% in energy efficiency, while H100 reached nearly eight times V100 throughput on this measure. Separately, matching AlexNet required 44 times less compute by 2019 than in 2012.
Ninguna invención causó por sí sola el desplome. Stanford estimó mejoras anuales cercanas a 30% en precio-rendimiento y 40% en eficiencia energética, mientras H100 alcanzó casi 8 veces el rendimiento de V100 en esta medida. Por separado, igualar a AlexNet requirió 44 veces menos cómputo en 2019 que en 2012.
Lower technology prices do not automatically create productive capital. Italy estimated that each Transition 4.0 tax-credit euro activated €1.50 to €2.00 of total material investment among beneficiary firms. The upper estimate implies another €1 of investment around each credit euro.
Los precios tecnológicos más bajos no crean capital productivo de forma automática. Italia estimó que cada euro de crédito fiscal de Transición 4.0 movilizó entre €1,50 y €2,00 de inversión material total entre empresas beneficiarias. La estimación superior implica otro euro de inversión por cada euro de crédito.
The sticker price is only the first layer. OpenAI, Anthropic and Google each advertised about 50% off for eligible asynchronous batches. Scheduling alone can halve the price before changing models.
El precio publicado es solo la primera capa. OpenAI, Anthropic y Google anunciaron cerca de 50% de descuento para lotes asíncronos elegibles. La programación puede reducir el precio a la mitad sin cambiar de modelo.
Repeated context changes the economics again. OpenAI advertised cache reads about 50% below normal input, while Anthropic advertised up to 90% less. Creating the cache can carry a premium.
El contexto repetido vuelve a cambiar la economía. OpenAI anunció lecturas cerca de 50% más baratas que la entrada normal, y Anthropic hasta 90% menos. Crear la caché puede tener una prima.
Cheap inference matters when it converts into saved labor without sacrificing output. In this experiment, ChatGPT reduced completion time by 40% and raised evaluator-rated quality by 18%. The result came from bounded writing tasks.
La inferencia barata importa cuando se convierte en trabajo ahorrado sin sacrificar el resultado. En este experimento, ChatGPT redujo 40% el tiempo y elevó 18% la calidad calificada por evaluadores. El resultado provino de tareas delimitadas de redacción.
Task fit is part of the real price. Consultants using GPT-4 completed suitable tasks about 25% faster and more than 40% better. On an unsuitable task, correctness fell 19 points.
El ajuste de la tarea forma parte del precio real. Los consultores con GPT-4 completaron tareas adecuadas cerca de 25% más rápido y más de 40% mejor. En una tarea inadecuada, la corrección cayó 19 puntos.
The gains survived beyond one laboratory. A bounded Copilot task improved 55.8%, company-run developer trials found 26.08% more completed tasks, and support agents resolved 15% more issues per hour. The different outcomes warn against one universal productivity number.
Las mejoras sobrevivieron más allá de un laboratorio. Una tarea delimitada con Copilot mejoró 55,8%, ensayos empresariales hallaron 26,08% más tareas completadas y agentes de soporte resolvieron 15% más casos por hora. Los distintos resultados impiden usar una cifra universal.
Cheap intelligence can still be expensive on the wrong task. Experienced developers predicted a 24% speedup but took 19% longer with AI. This is a narrow boundary case, not a universal verdict.
La inteligencia barata todavía puede resultar costosa en la tarea equivocada. Desarrolladores experimentados esperaban una mejora de 24%, pero tardaron 19% más con IA. Es un caso límite estrecho, no un veredicto universal.
The marginal cost and the creation cost moved in opposite directions. Stanford reported estimated training-compute costs rising from $4.3 million for GPT-3 to $191 million for Gemini Ultra, while Meta reported 30.84 million H100 GPU-hours for Llama 3.1 405B. Cheap calls can rest on expensive fixed infrastructure.
El costo marginal y el costo de creación se movieron en direcciones opuestas. Stanford publicó costos estimados desde $4,3 millones para GPT-3 hasta $191 millones para Gemini Ultra, mientras Meta informó 30,84 millones de horas GPU H100 para Llama 3.1 405B. Las llamadas baratas pueden descansar sobre infraestructura fija costosa.
The user-facing price decline did not reduce the infrastructure race. Microsoft's cash capital expenditure rose from $20.6 billion in fiscal 2021 to $44.5 billion in fiscal 2024. The steepest increase came in the final year.
La caída del precio para el usuario no frenó la carrera de infraestructura. La inversión de capital en efectivo de Microsoft subió de $20.600 millones en 2021 fiscal a $44.500 millones en 2024 fiscal. El mayor aumento llegó en el último año.
Low application prices coexist with concentrated infrastructure. Synergy estimated AWS at 31%, Microsoft at 25% and Google at 11% in early 2024. Together, the three accounted for 67% of cloud-infrastructure revenue.
Los bajos precios de las aplicaciones conviven con infraestructura concentrada. Synergy estimó 31% para AWS, 25% para Microsoft y 11% para Google a comienzos de 2024. Juntas, las tres empresas representaban 67% de los ingresos.
The infrastructure layer is concentrated, but model capability moved differently. Stanford reported the leading closed-versus-open-weight gap falling from about 8% to 1.7% in 13 months. Alternatives can improve inside a concentrated compute market.
La infraestructura está concentrada, pero la capacidad de los modelos se movió de otra forma. Stanford informó que la brecha entre líderes cerrados y de pesos abiertos cayó de cerca de 8% a 1,7% en 13 meses. Las alternativas pueden mejorar dentro de un mercado de cómputo concentrado.
Efficiency can overpower growth for long periods. From 2010 to 2018, global data-center compute instances increased about 550%, while estimated electricity use rose about 6%. Added compute did not require proportional electricity during this period.
La eficiencia puede superar al crecimiento durante largos períodos. Entre 2010 y 2018, las instancias mundiales de cómputo aumentaron cerca de 550%, mientras el uso eléctrico estimado subió alrededor de 6%. El cómputo adicional no exigió electricidad proporcional durante este período.
AI does not enter one uniform electricity system. China's consumption per person rose more than sixfold, Sweden's fell from a much higher base, and the United States remained comparatively flat. The same data-center load lands differently in each country.
La IA no entra en un único sistema eléctrico uniforme. El consumo por persona de China creció más de 6 veces, el de Suecia cayó desde una base mucho mayor y Estados Unidos se mantuvo relativamente estable. La misma carga de centros de datos cae de forma distinta en cada país.
Efficiency is only half the electricity story. By 2025, renewable generation ranged from 5.49% in Singapore to 71.37% in Sweden across these five countries. Identical compute demand can carry very different grid consequences.
La eficiencia es solo la mitad de la historia eléctrica. En 2025, la generación renovable iba de 5,49% en Singapur a 71,37% en Suecia entre estos cinco países. Una demanda idéntica de cómputo puede tener consecuencias eléctricas muy distintas.
AI use spread quickly, rising from about 50% of surveyed organizations in 2022 to 78% later in 2024. Yet IBM found limited skills, data complexity and ethical concerns blocking successful adoption. Cheap models cannot redesign work by themselves.
El uso de IA avanzó rápido, desde cerca de 50% de las organizaciones encuestadas en 2022 hasta 78% posteriormente en 2024. IBM halló que las habilidades limitadas, la complejidad de datos y las preocupaciones éticas frenaban la adopción. Los modelos baratos no pueden rediseñar el trabajo por sí solos.
Cheaper use did not mean less capital entering the sector. Stanford reported private generative-AI investment rising from about $3 billion in 2022 to $33.9 billion in 2024. The steepest jump came in 2023.
El uso más barato no significó menos capital para el sector. Stanford informó que la inversión privada en IA generativa subió de cerca de $3.000 millones en 2022 a $33.900 millones en 2024. El mayor salto llegó en 2023.
The supply of digital workers expanded across most of these countries, but not at the same pace. Spain nearly doubled its total, while Italy peaked in 2023 and then declined. Access to models can globalize faster than the skills needed to deploy them.
La oferta de trabajadores digitales creció en la mayoría de estos países, pero no al mismo ritmo. España casi duplicó su total, mientras Italia alcanzó un pico en 2023 y luego cayó. El acceso a modelos puede globalizarse más rápido que las habilidades necesarias para desplegarlos.
This is the central paradox. The marginal price of using a model collapsed while estimated hardware and energy costs for frontier final runs grew 2.4 times annually. The reported 95% confidence interval runs from 2.0 to 3.1 times.
Esta es la paradoja central. El precio marginal de usar un modelo se desplomó mientras los costos estimados de hardware y energía de las corridas finales crecieron 2,4 veces al año. El intervalo de confianza de 95% va de 2,0 a 3,1 veces.
Un estudio aleatorio de METR de 2025 con 16 desarrolladores experimentados y 246 tareas halló que la IA aumentó 19% el tiempo, pese a ahorros previstos de 24%. METR
Los límites de contexto anunciados crecieron de 2.048 tokens para GPT-3 a 8.192 en un nivel inicial de GPT-4, 100.000 para Claude 2 y dos millones para Gemini 1.5 Pro. OpenAI
En un experimento con 758 consultores, los usuarios de GPT-4 completaron tareas adecuadas cerca de 25% más rápido y más de 40% mejor, pero la corrección cayó 19 puntos en otra tarea. Harvard Business School
Meta informó 1,46 millones, 7,0 millones y 30,84 millones de horas GPU H100 para modelos Llama 3.1 de 8B, 70B y 405B parámetros. Meta
Entre 2010 y 2018, las instancias mundiales de cómputo de centros de datos aumentaron cerca de 550% mientras el uso eléctrico estimado creció solo alrededor de 6%. Science
En seis benchmarks, Epoch AI halló caídas del precio de inferencia de entre 9 y 900 veces por año, según el nivel de desempeño, con las mayores bajas en el último año. epoch.ai
Los costos amortizados de hardware y energía de la corrida final de modelos frontera han crecido 2,4 veces por año desde 2016, con un intervalo de confianza de 2,0 a 3,1 veces. epoch.ai
A mediados de 2024, los precios de entrada publicados eran 0,15 dólares para GPT-4o mini, 0,25 para Claude 3 Haiku y 0,35 para Gemini 1.5 Flash por millón. OpenAI
Los resultados publicados en MMLU aumentaron de 43,9% para GPT-3 a 69,3% para PaLM, 86,4% para GPT-4 y cerca de 90,0% para Gemini Ultra. OpenAI
El argumento
A mediados de 2024, la entrada de modelos básicos ya costaba centavos.
La entrada barata no eliminó la prima por razonamiento más exigente.
El precio cayó mientras el rendimiento publicado subió de 43,9% a cerca de 90%.
Los modelos se abarataron mientras aceptaban documentos e historiales mucho mayores.
La mayor mejora apareció en tareas prácticas de software.
Aceleradores más rápidos se sumaron a algoritmos que necesitaban 44 veces menos cómputo.
Esta investigación se publica en inglés y español. Read in English