Hanademi

Intelligence got 280x cheaper

27 slides · $4.44 · 23 min · 1 minute ago language
ENES
theme
LightDark
view
DeckTableTalk
brand
HanademiPlatzi
Intelligence got 280x cheaperMade for Freddy Vega, by Hanademi
La inteligencia se abarató 280vecesMade for Freddy Vega, by Hanademi
GPT-3.5-level inference got 280x cheaperEstimated price for running a model at GPT-3.5-level capability, USD per million tokens, November 2022 toOctober 2024. Log scale: every gridline is ×10.Made for Freddy Vega, by HanademiSources: Stanford Institute for Human-Centered Artificial Intelligence. (2025). AI Index Report 2025. Stanford University.UnitUSD per million tokens$0.01$0.1$1$10$100November 2022October 2024By October 2024, the estimatewas $0.07.$20
This is the collapse that changes the economics of software. Stanford estimated that GPT-3.5-level inference fell from $20 to $0.07 per million tokens in 23 months. The comparison holds benchmark capability roughly fixed.
La inferencia de nivel GPT-3.5 se abarató280 vecesPrecio estimado de ejecutar un modelo con capacidad de nivel GPT-3.5, USD por millón de tokens,noviembre de 2022 a octubre de 2024. Escala logarítmica: cada línea es ×10.Made for Freddy Vega, by HanademiFuentes: Stanford Institute for Human-Centered Artificial Intelligence. (2025). AI Index Report 2025. StanfordUniversity.UnidadUSD por millón de tokens$0,01$0,1$1$10$100Noviembre de 2022Octubre de 2024En octubre de 2024, la estimaciónera $0,07.$20
Este es el desplome que cambia la economía del software. Stanford estimó que la inferencia de nivel GPT-3.5 cayó de $20 a $0,07 por millón de tokens en 23 meses. La comparación mantiene aproximadamente fija la capacidad de referencia.
The terms behind the argumentMade for Freddy Vega, by HanademiTokenA small unit of text processed by a language model, often a word fragment rather than acomplete word.InferenceRunning a trained model to generate an answer, prediction or other output.SWE-benchA benchmark testing whether AI systems can resolve software issues drawn frompublic GitHub repositories.
3 technical terms carry much of the argument.
Los términos detrás del argumentoMade for Freddy Vega, by HanademiTokenUna unidad pequeña de texto procesada por un modelo de lenguaje, a menudo un fragmento y nouna palabra completa.InferenciaEjecutar un modelo entrenado para generar una respuesta, predicción u otro resultado.SWE-benchUna prueba que evalúa si los sistemas de IA pueden resolver problemas de softwareextraídos de repositorios públicos de GitHub.
3 términos técnicos sostienen buena parte del argumento.
Small-model input fell to cents per milliontokensListed input price per million tokens in mid-2024, USD.Made for Freddy Vega, by HanademiSources: OpenAI. (2024). GPT-4o mini: Advancing cost-efficient intelligence.; Anthropic. (2024). The Claude 3 modelfamily.; Google. (2024). Gemini Developer API pricing.UnitUSD per million input tokens$0.3Gemini 1.5 Flash$0.2Claude 3 Haiku$0.1GPT-4o mini
The price collapse was not confined to one provider. Three leading small models listed input below $0.35 per million tokens. GPT-4o mini sat lowest at $0.15.
La entrada de modelos pequeños cayó acentavos por millón de tokensPrecio publicado de entrada por millón de tokens a mediados de 2024, USD.Made for Freddy Vega, by HanademiFuentes: OpenAI. (2024). GPT-4o mini: Advancing cost-efficient intelligence.; Anthropic. (2024). The Claude 3model family.; Google. (2024). Gemini Developer API pricing.UnidadUSD por millón de tokens de entrada$0,3Gemini 1.5 Flash$0,2Claude 3 Haiku$0,1GPT-4o mini
El desplome no se limitó a un proveedor. Tres modelos pequeños líderes publicaron entradas inferiores a $0,35 por millón de tokens. GPT-4o mini quedó en el nivel más bajo, con $0,15.
Output prices still varied 6x across leadingmodelsListed output price per million tokens in late 2024, USD.Made for Freddy Vega, by HanademiSources: OpenAI. (2024). API pricing.; Anthropic. (2024). Claude API pricing.UnitUSD per million output tokensGPT-4o$10Claude 3.5 Sonnet$15OpenAI o1$60
The cheapest token was not always attached to the desired capability. Late-2024 output prices ranged from $10 per million tokens for GPT-4o to $60 for o1. Verification and rework can widen the real gap further.
Los precios de salida aún variaban 6 vecesentre modelos líderesPrecio publicado de salida por millón de tokens a finales de 2024, USD.Made for Freddy Vega, by HanademiFuentes: OpenAI. (2024). API pricing.; Anthropic. (2024). Claude API pricing.UnidadUSD por millón de tokens de salidaGPT-4o$10Claude 3.5 Sonnet$15OpenAI o1$60
El token más barato no siempre estaba unido a la capacidad deseada. A finales de 2024, los precios de salida iban de $10 por millón de tokens para GPT-4o a $60 para o1. La verificación y el retrabajo pueden ampliar aún más la brecha real.
Reported broad-knowledge performanceroughly doubledReported MMLU broad-knowledge benchmark score by model, percent. Cross-report conditions may differ.Made for Freddy Vega, by HanademiSources: Brown, T. B., et al. (2020). Language models are few-shot learners. Advances in Neural Information Processing Systems, 33.;Chowdhery, A., et al. (2022). PaLM: Scaling language modeling with pathways.; OpenAI. (2023). GPT-4 technical report.UnitMMLU scoreGPT-343.9%PaLM69.3%GPT-486.4%Gemini Ultra90%
The dollar bought more than raw token volume. Reported broad-knowledge performance rose from 43.9% for GPT-3 to about 90% for Gemini Ultra. Better benchmark scores still do not guarantee reliable work.
El rendimiento publicado de conocimientogeneral casi se duplicóPuntuación publicada en la prueba amplia de conocimiento MMLU por modelo, porcentaje. Las condicionespueden diferir entre informes.Made for Freddy Vega, by HanademiFuentes: Brown, T. B., et al. (2020). Language models are few-shot learners. Advances in Neural Information ProcessingSystems, 33.; Chowdhery, A., et al. (2022). PaLM: Scaling language modeling with pathways.; OpenAI. (2023). GPT-4 technicalreport.Unidadpuntuación MMLUGPT-343,9 %PaLM69,3 %GPT-486,4 %Gemini Ultra90 %
El dólar compró más que volumen de tokens. El rendimiento publicado de conocimiento general subió de 43,9% para GPT-3 a cerca de 90% para Gemini Ultra. Mejores puntuaciones aún no garantizan trabajo fiable.
Advertised model memory expanded almost1,000xAdvertised maximum context, tokens, 2020 to June 2024. Values were not verified against live pagesduring the build. Log scale: every gridline is ×10.Made for Freddy Vega, by HanademiSources: OpenAI. (2020). OpenAI API.; Anthropic. (2023). Claude 2.; Google. (2024). Gemini 1.5 Pro updates.Unittokens1K10K100K1M10MGPT-3, 2020GPT-4 8K, 2023Claude 2, 2023Gemini 1.5 Pro, Jun 2024The advertised limit reached 2million tokens.2,048
A dollar increasingly bought a larger working memory. Advertised limits rose from 2,048 tokens for GPT-3 to 2 million for Gemini 1.5 Pro. A larger window does not prove that every token is used reliably.
La memoria anunciada de los modeloscreció casi 1.000 vecesContexto máximo anunciado, tokens, 2020 a junio de 2024. Los valores no se verificaron contra páginasactivas durante la construcción. Escala logarítmica: cada línea es ×10.Made for Freddy Vega, by HanademiFuentes: OpenAI. (2020). OpenAI API.; Anthropic. (2023). Claude 2.; Google. (2024). Gemini 1.5 Pro updates.Unidadtokens1K10K100K1 M10 MGPT-3, 2020GPT-4 8K, 2023Claude 2, 2023Gemini 1.5 Pro, Jun 2024El límite anunciado llegó a 2millones de tokens.2.048
Un dólar compraba una memoria de trabajo cada vez mayor. Los límites anunciados subieron de 2.048 tokens para GPT-3 a 2 millones para Gemini 1.5 Pro. Una ventana mayor no prueba que cada token se use con fiabilidad.
Software-task performance gained 67.3points in one yearOne-year improvement during 2024, percentage points across three AI benchmarks.Made for Freddy Vega, by HanademiSources: Stanford Institute for Human-Centered Artificial Intelligence. (2025). AI Index Report 2025. StanfordUniversity.Unitpercentage-point improvement67.3SWE-bench48.9GPQA18.8MMMU
Capability gains were broad but uneven. Stanford reported 18.8 points on MMMU, 48.9 on GPQA and 67.3 on SWE-bench during 2024. The fastest-moving benchmark was the one closest to practical software work.
El rendimiento en tareas de software ganó67,3 puntos en un añoMejora durante 2024, en puntos porcentuales, en tres pruebas de IA.Made for Freddy Vega, by HanademiFuentes: Stanford Institute for Human-Centered Artificial Intelligence. (2025). AI Index Report 2025. StanfordUniversity.Unidadmejora en puntos porcentuales67,3SWE-bench48,9GPQA18,8MMMU
Las mejoras fueron amplias pero desiguales. Stanford informó 18,8 puntos en MMMU, 48,9 en GPQA y 67,3 en SWE-bench durante 2024. La prueba que más avanzó fue la más cercana al trabajo práctico de software.
Cheaper intelligence came from chips andalgorithmsLeft: estimated annual hardware improvement. Right: Nvidia dense FP16 tensor throughput, teraflops. H100is an AI accelerator generation.Made for Freddy Vega, by HanademiSources: Hernandez, D., & Brown, T. B. (2020). Measuring the algorithmic efficiency of neural networks.; StanfordInstitute for Human-Centered Artificial Intelligence. (2025). AI Index Report 2025. Stanford University.; Nvidia. (2022).Nvidia H100 Tensor Core GPU.Unittwo improvement enginesHardware improved annually30%40%Price-performanceEnergy efficiencyAccelerator throughput rose125312989V100A100H100 SXM
No single invention caused the price collapse. Stanford estimated annual gains near 30% in hardware price-performance and 40% in energy efficiency, while H100 reached nearly eight times V100 throughput on this measure. Separately, matching AlexNet required 44 times less compute by 2019 than in 2012.
La inteligencia barata vino de chips yalgoritmosIzquierda: mejora anual estimada del hardware. Derecha: rendimiento tensorial FP16 denso de Nvidia,teraflops. H100 es una generación de aceleradores de IA.Made for Freddy Vega, by HanademiFuentes: Hernandez, D., & Brown, T. B. (2020). Measuring the algorithmic efficiency of neural networks.; Stanford Institutefor Human-Centered Artificial Intelligence. (2025). AI Index Report 2025. Stanford University.; Nvidia. (2022). Nvidia H100Tensor Core GPU.Unidaddos motores de mejoraEl hardware mejoró cada año30 %40 %Precio-rendimientoEficiencia energéticaEl rendimiento del acelerador subió125312989V100A100H100 SXM
Ninguna invención causó por sí sola el desplome. Stanford estimó mejoras anuales cercanas a 30% en precio-rendimiento y 40% en eficiencia energética, mientras H100 alcanzó casi 8 veces el rendimiento de V100 en esta medida. Por separado, igualar a AlexNet requirió 44 veces menos cómputo en 2019 que en 2012.
One tax-credit euro activated up to €2 ofinvestmentUpper estimate for total material investment among beneficiary firms under Italy's Transition 4.0 program,2020 to 2023.Made for Freddy Vega, by HanademiSources: mef.gov.it.Upper estimate shown.Uniteuros per tax-credit euroEUR0EUR0.5EUR1EUR1.5EUR2EUR1Tax creditEUR1Additional investmentEUR2Total investment
Lower technology prices do not automatically create productive capital. Italy estimated that each Transition 4.0 tax-credit euro activated €1.50 to €2.00 of total material investment among beneficiary firms. The upper estimate implies another €1 of investment around each credit euro.
Un euro de crédito fiscal movilizó hasta €2de inversiónEstimación superior de inversión material total entre empresas beneficiarias del programa Transición 4.0de Italia, 2020 a 2023.Made for Freddy Vega, by HanademiFuentes: mef.gov.it.Se muestra la estimación superior.Unidadeuros por euro de crédito fiscalEUR0EUR0,5EUR1EUR1,5EUR2EUR1Crédito fiscalEUR1Inversión adicionalEUR2Inversión total
Los precios tecnológicos más bajos no crean capital productivo de forma automática. Italia estimó que cada euro de crédito fiscal de Transición 4.0 movilizó entre €1,50 y €2,00 de inversión material total entre empresas beneficiarias. La estimación superior implica otro euro de inversión por cada euro de crédito.
Work that can wait is structurally cheaperthan immediate responses.Eligibility, latency and product terms differ by provider. The discounts do not apply toevery request.Sources: OpenAI. (2024). Batch API guide.; Anthropic. (2024). Message Batches API.; Google. (2025). Gemini API batch mode.
The sticker price is only the first layer. OpenAI, Anthropic and Google each advertised about 50% off for eligible asynchronous batches. Scheduling alone can halve the price before changing models.
El trabajo que puede esperar esestructuralmente más barato que larespuesta inmediata.La elegibilidad, la latencia y las condiciones cambian según el proveedor. Los descuentosno se aplican a todas las solicitudes.Fuentes: OpenAI. (2024). Batch API guide.; Anthropic. (2024). Message Batches API.; Google. (2025). Gemini API batch mode.
El precio publicado es solo la primera capa. OpenAI, Anthropic y Google anunciaron cerca de 50% de descuento para lotes asíncronos elegibles. La programación puede reducir el precio a la mitad sin cambiar de modelo.
Reused prompts can cost up to 90% lessAdvertised cache-read discounts and Anthropic five-minute cache-write premium.Made for Freddy Vega, by HanademiSources: OpenAI. (2024). Prompt caching in the API.; Anthropic. (2024). Prompt caching.Unitprice changeOpenAI cache read50%Anthropic cache read90%Anthropic cache write25%
Repeated context changes the economics again. OpenAI advertised cache reads about 50% below normal input, while Anthropic advertised up to 90% less. Creating the cache can carry a premium.
Los prompts reutilizados pueden costarhasta 90% menosDescuentos anunciados por lecturas de caché y prima de Anthropic por escritura de cinco minutos.Made for Freddy Vega, by HanademiFuentes: OpenAI. (2024). Prompt caching in the API.; Anthropic. (2024). Prompt caching.Unidadcambio de precioLectura de caché OpenAI50 %Lectura de caché Anthropic90 %Escritura de caché Anthropic25 %
El contexto repetido vuelve a cambiar la economía. OpenAI anunció lecturas cerca de 50% más baratas que la entrada normal, y Anthropic hasta 90% menos. Crear la caché puede tener una prima.
AI made writing 40% faster and 18% betterPreregistered 2023 experiment with 453 professionals: completion-time reduction and evaluator-ratedquality increase.Made for Freddy Vega, by HanademiSources: Noy, S., & Zhang, W. (2023). Experimental evidence on the productivity effects of generative artificial intelligence.Science.Unitmeasured improvementTime reduction40%Quality increase18%2.2x
Cheap inference matters when it converts into saved labor without sacrificing output. In this experiment, ChatGPT reduced completion time by 40% and raised evaluator-rated quality by 18%. The result came from bounded writing tasks.
La IA hizo la redacción 40% más rápida y18% mejorExperimento prerregistrado de 2023 con 453 profesionales: reducción del tiempo y aumento de calidadsegún evaluadores.Made for Freddy Vega, by HanademiFuentes: Noy, S., & Zhang, W. (2023). Experimental evidence on the productivity effects of generative artificial intelligence. Science.Unidadmejora medidaReducción de tiempo40 %Aumento de calidad18 %2,2x
La inferencia barata importa cuando se convierte en trabajo ahorrado sin sacrificar el resultado. En este experimento, ChatGPT redujo 40% el tiempo y elevó 18% la calidad calificada por evaluadores. El resultado provino de tareas delimitadas de redacción.
GPT-4 helped inside the task frontier andhurt beyond itExperiment with 758 consultants: speed and quality gains on suitable tasks, correctness change on anunsuitable task.Made for Freddy Vega, by HanademiSources: Dell'Acqua, F., et al. (2023). Navigating the jagged technological frontier. Harvard Business SchoolWorking Paper 24-013.Unitpercent or percentage-point changeSuitable-task speed25%Suitable-task quality40%Unsuitable-task correctness-19%
Task fit is part of the real price. Consultants using GPT-4 completed suitable tasks about 25% faster and more than 40% better. On an unsuitable task, correctness fell 19 points.
GPT-4 ayudó dentro de la frontera de tareasy perjudicó fueraExperimento con 758 consultores: mejoras de velocidad y calidad en tareas adecuadas, y cambio decorrección en una tarea inadecuada.Made for Freddy Vega, by HanademiFuentes: Dell'Acqua, F., et al. (2023). Navigating the jagged technological frontier. Harvard Business School WorkingPaper 24-013.Unidadcambio porcentual o en puntosVelocidad en tarea adecuada25 %Calidad en tarea adecuada40 %Corrección en tarea inadecuada-19 %
El ajuste de la tarea forma parte del precio real. Los consultores con GPT-4 completaron tareas adecuadas cerca de 25% más rápido y más de 40% mejor. En una tarea inadecuada, la corrección cayó 19 puntos.
Bounded workplace gains ranged from 15%to 55.8%Separate studies of a coding task, completed developer tasks and support cases resolved per hour.Made for Freddy Vega, by HanademiSources: Peng, S., Kalliamvakou, E., Cihon, P., & Demirer, M. (2023). The impact of AI on developer productivity:Evidence from GitHub Copilot.; demirermert.github.io.; danielle.li.Unitreported productivity improvementBounded coding task55.8%Developer tasks completed26.1%Support cases per hour15%
The gains survived beyond one laboratory. A bounded Copilot task improved 55.8%, company-run developer trials found 26.08% more completed tasks, and support agents resolved 15% more issues per hour. The different outcomes warn against one universal productivity number.
Las mejoras laborales delimitadas variaronentre 15% y 55,8%Estudios separados de una tarea de programación, tareas de desarrollo completadas y casos de soporteresueltos por hora.Made for Freddy Vega, by HanademiFuentes: Peng, S., Kalliamvakou, E., Cihon, P., & Demirer, M. (2023). The impact of AI on developer productivity:Evidence from GitHub Copilot.; demirermert.github.io.; danielle.li.Unidadmejora de productividad publicadaTarea delimitada de programación55,8 %Tareas de desarrollocompletadas26,1 %Casos de soportepor hora15 %
Las mejoras sobrevivieron más allá de un laboratorio. Una tarea delimitada con Copilot mejoró 55,8%, ensayos empresariales hallaron 26,08% más tareas completadas y agentes de soporte resolvieron 15% más casos por hora. Los distintos resultados impiden usar una cifra universal.
A small study found AI slowed experienceddevelopersPredicted and observed speedup across 16 experienced developers and 246 tasks in 2025; small-samplerandomized study.Made for Freddy Vega, by HanademiSources: Becker, J., Rush, N., & Barnes, B. (2025). Measuring the impact of early-2025 AI on experienced open-source developerproductivity. METR.Unitproductivity effectPredicted speedup24%Observed speedup-19%Expectation gap43%
Cheap intelligence can still be expensive on the wrong task. Experienced developers predicted a 24% speedup but took 19% longer with AI. This is a narrow boundary case, not a universal verdict.
Un estudio pequeño halló que la IA ralentizóa desarrolladores expertosMejora prevista y observada con 16 desarrolladores experimentados y 246 tareas en 2025; estudioaleatorio con muestra pequeña.Made for Freddy Vega, by HanademiFuentes: Becker, J., Rush, N., & Barnes, B. (2025). Measuring the impact of early-2025 AI on experiencedopen-source developer productivity. METR.Unidadefecto sobre la productividadMejora prevista24 %Mejora observada-19 %Brecha de expectativa43 %
La inteligencia barata todavía puede resultar costosa en la tarea equivocada. Desarrolladores experimentados esperaban una mejora de 24%, pero tardaron 19% más con IA. Es un caso límite estrecho, no un veredicto universal.
Cheap model calls sit on top of huge trainingrunsLeft: estimated training-compute cost, USD millions. Right: reported H100 GPU-hours for Llama 3.1,millions.Made for Freddy Vega, by HanademiSources: Stanford Institute for Human-Centered Artificial Intelligence. (2024). AI Index Report 2024. Stanford University.;Epoch AI. (2024). Notable AI models and training-compute estimates.; Meta. (2024). Llama 3.1 model card.Unitfrontier training scaleEstimated training cost$4.3M$79M$191MGPT-3, 2020GPT-4, 2023Gemini Ultra, 2023Reported H100 GPU-hours1.5730.8Llama 3.1 8BLlama 3.1 70BLlama 3.1 405B
The marginal cost and the creation cost moved in opposite directions. Stanford reported estimated training-compute costs rising from $4.3 million for GPT-3 to $191 million for Gemini Ultra, while Meta reported 30.84 million H100 GPU-hours for Llama 3.1 405B. Cheap calls can rest on expensive fixed infrastructure.
Las llamadas baratas descansan sobreentrenamientos enormesIzquierda: costo estimado de cómputo de entrenamiento, millones USD. Derecha: horas GPU H100publicadas para Llama 3.1, millones.Made for Freddy Vega, by HanademiFuentes: Stanford Institute for Human-Centered Artificial Intelligence. (2024). AI Index Report 2024. StanfordUniversity.; Epoch AI. (2024). Notable AI models and training-compute estimates.; Meta. (2024). Llama 3.1model card.Unidadescala de entrenamiento de fronteraCosto estimado de entrenamiento$4,3 M$79 M$191 MGPT-3, 2020GPT-4, 2023Gemini Ultra, 2023Horas GPU H100 publicadas1,5730,8Llama 3.1 8BLlama 3.1 70BLlama 3.1 405B
El costo marginal y el costo de creación se movieron en direcciones opuestas. Stanford publicó costos estimados desde $4,3 millones para GPT-3 hasta $191 millones para Gemini Ultra, mientras Meta informó 30,84 millones de horas GPU H100 para Llama 3.1 405B. Las llamadas baratas pueden descansar sobre infraestructura fija costosa.
Microsoft cash capex more than doubledMicrosoft cash capital expenditure by fiscal year, USD billions, 2021 to 2024.Made for Freddy Vega, by HanademiSources: Microsoft Corporation. (2024). Form 10-K for the fiscal year ended June 30, 2024.; U.S. Securities and Exchange Commission. (2024).Microsoft Corporation filings.UnitUSD$0$20B$40BFY2021FY2022FY2023FY2024FY2024 reached $44.5 billion.$20.6B
The user-facing price decline did not reduce the infrastructure race. Microsoft's cash capital expenditure rose from $20.6 billion in fiscal 2021 to $44.5 billion in fiscal 2024. The steepest increase came in the final year.
La inversión de capital en efectivo deMicrosoft se duplicóInversión de capital en efectivo de Microsoft por año fiscal, miles de millones USD, 2021 a 2024.Made for Freddy Vega, by HanademiFuentes: Microsoft Corporation. (2024). Form 10-K for the fiscal year ended June 30, 2024.; U.S. Securities and Exchange Commission. (2024).Microsoft Corporation filings.UnidadUSD$0$20 mil M$40 mil MFY2021FY2022FY2023FY2024El año fiscal 2024 llegó a $44.500millones.$20,6 mil M
La caída del precio para el usuario no frenó la carrera de infraestructura. La inversión de capital en efectivo de Microsoft subió de $20.600 millones en 2021 fiscal a $44.500 millones en 2024 fiscal. El mayor aumento llegó en el último año.
Three companies controlled 67% of cloudinfrastructureEstimated cloud-infrastructure revenue share in the first quarter of 2024.Made for Freddy Vega, by HanademiSources: Synergy Research Group. (2024). Cloud market growth remains strong in Q1 2024.Unitrevenue shareAWS31%Microsoft25%Google11%Other providers33%
Low application prices coexist with concentrated infrastructure. Synergy estimated AWS at 31%, Microsoft at 25% and Google at 11% in early 2024. Together, the three accounted for 67% of cloud-infrastructure revenue.
Tres empresas controlaban 67% de lainfraestructura en la nubeCuota estimada de ingresos de infraestructura en la nube en el primer trimestre de 2024.Made for Freddy Vega, by HanademiFuentes: Synergy Research Group. (2024). Cloud market growth remains strong in Q1 2024.Unidadcuota de ingresosAWS31 %Microsoft25 %Google11 %Otros proveedores33 %
Los bajos precios de las aplicaciones conviven con infraestructura concentrada. Synergy estimó 31% para AWS, 25% para Microsoft y 11% para Google a comienzos de 2024. Juntas, las tres empresas representaban 67% de los ingresos.
Open-weight models narrowed thebenchmark gap to 1.7%Reported performance gap between leading closed and open-weight models, January 2024 to February2025.Made for Freddy Vega, by HanademiSources: Stanford Institute for Human-Centered Artificial Intelligence. (2025). AI Index Report 2025. Stanford University.Unitperformance gap0%2%5%8%January 2024February 2025By February 2025, the gap was1.7%.
The infrastructure layer is concentrated, but model capability moved differently. Stanford reported the leading closed-versus-open-weight gap falling from about 8% to 1.7% in 13 months. Alternatives can improve inside a concentrated compute market.
Los modelos de pesos abiertos redujeron labrecha a 1,7%Brecha de rendimiento publicada entre modelos cerrados y de pesos abiertos, enero de 2024 a febrero de2025.Made for Freddy Vega, by HanademiFuentes: Stanford Institute for Human-Centered Artificial Intelligence. (2025). AI Index Report 2025. Stanford University.Unidadbrecha de rendimiento0 %2 %5 %8 %Enero de 2024Febrero de 2025En febrero de 2025, la brechaera 1,7%.
La infraestructura está concentrada, pero la capacidad de los modelos se movió de otra forma. Stanford informó que la brecha entre líderes cerrados y de pesos abiertos cayó de cerca de 8% a 1,7% en 13 meses. Las alternativas pueden mejorar dentro de un mercado de cómputo concentrado.
Compute grew 550% while electricity rose6%Global data-center compute instances and estimated electricity use, indexed to 100 in 2010.Made for Freddy Vega, by HanademiSources: Masanet, E., Shehabi, A., Lei, N., Smith, S., & Koomey, J. (2020). Recalibrating global data center energy-use estimates. Science.Unit2010 index020040060020102018ComputeinstancesElectricityuseCompute reached an index of 650.Electricity reached only 106.
Efficiency can overpower growth for long periods. From 2010 to 2018, global data-center compute instances increased about 550%, while estimated electricity use rose about 6%. Added compute did not require proportional electricity during this period.
El cómputo creció 550% mientras laelectricidad subió 6%Instancias mundiales de cómputo de centros de datos y uso eléctrico estimado, índice 2010 = 100.Made for Freddy Vega, by HanademiFuentes: Masanet, E., Shehabi, A., Lei, N., Smith, S., & Koomey, J. (2020). Recalibrating global data center energy-use estimates.Science.Unidadíndice 2010020040060020102018Instancias decómputoUso deelectricidadEl cómputo alcanzó un índice de650.La electricidad llegó solo a 106.
La eficiencia puede superar al crecimiento durante largos períodos. Entre 2010 y 2018, las instancias mundiales de cómputo aumentaron cerca de 550%, mientras el uso eléctrico estimado subió alrededor de 6%. El cómputo adicional no exigió electricidad proporcional durante este período.
China's electricity use surged whileSweden's fellElectric power consumption per person, kWh, China, Ireland, Singapore, Sweden and the United States,2000 to 2024 where available.Made for Freddy Vega, by HanademiSources: World Bank. (n.d.). Electric power consumption (kWh per capita) [EG.USE.ELEC.KH.PC]. World Bank Open Data.UnitkWh per person05,00010,00015,0002000200420082012201620202024ChinaIrelandSingaporeSwedenUnitedStatesChina reached 6,524 kWh perperson in 2023.Sweden fell to 12,226 kWh in2024.
AI does not enter one uniform electricity system. China's consumption per person rose more than sixfold, Sweden's fell from a much higher base, and the United States remained comparatively flat. The same data-center load lands differently in each country.
El uso eléctrico de China se disparómientras el de Suecia cayóConsumo eléctrico por persona, kWh, China, Irlanda, Singapur, Suecia y Estados Unidos, 2000 a 2024donde hay datos.Made for Freddy Vega, by HanademiFuentes: World Bank. (n.d.). Electric power consumption (kWh per capita) [EG.USE.ELEC.KH.PC]. World Bank Open Data.UnidadkWh por persona05.00010.00015.0002000200420082012201620202024ChinaIrlandaSingapurSueciaEstadosUnidosChina llegó a 6.524 kWh porpersona en 2023.Suecia cayó a 12.226 kWh en2024.
La IA no entra en un único sistema eléctrico uniforme. El consumo por persona de China creció más de 6 veces, el de Suecia cayó desde una base mucho mayor y Estados Unidos se mantuvo relativamente estable. La misma carga de centros de datos cae de forma distinta en cada país.
AI hubs enter the electricity race withunequal clean powerRenewable share of electricity generation, China, Ireland, Singapore, Sweden and the United States, 2010 to2025.Made for Freddy Vega, by HanademiSources: Ember. (n.d.). Yearly electricity data: Renewables - Electricity generation (%).Unitrenewable generation share0%20%40%60%201020132016201920222025ChinaIrelandSingaporeSwedenUnitedStatesSweden reached 71.37%renewables in 2025.Singapore remained at 5.49%.
Efficiency is only half the electricity story. By 2025, renewable generation ranged from 5.49% in Singapore to 71.37% in Sweden across these five countries. Identical compute demand can carry very different grid consequences.
Los centros de IA entran en la carreraeléctrica con energía limpia desigualCuota renovable de la generación eléctrica, China, Irlanda, Singapur, Suecia y Estados Unidos, 2010 a2025.Made for Freddy Vega, by HanademiFuentes: Ember. (n.d.). Yearly electricity data: Renewables - Electricity generation (%).Unidadcuota de generación renovable0 %20 %40 %60 %201020132016201920222025ChinaIrlandaSingapurSueciaEstadosUnidosSuecia llegó a 71,37% derenovables en 2025.Singapur se mantuvo en 5,49%.
La eficiencia es solo la mitad de la historia eléctrica. En 2025, la generación renovable iba de 5,49% en Singapur a 71,37% en Suecia entre estos cinco países. Una demanda idéntica de cómputo puede tener consecuencias eléctricas muy distintas.
AI adoption rose faster than organizationalreadinessLeft: surveyed organizational AI use, 2022 to 2024. Right: barriers named in IBM's 2023 survey.Made for Freddy Vega, by HanademiSources: McKinsey & Company. (2024). The state of AI in early 2024.; Stanford Institute for Human-Centered ArtificialIntelligence. (2025). AI Index Report 2025. Stanford University.; IBM. (2023). Global AI Adoption Index 2023.Unitshare of respondentsOrganizations using AI50%78%2022Later 2024Barriers to successful adoption33%25%23%Limited AI skillsData complexityEthical concerns
AI use spread quickly, rising from about 50% of surveyed organizations in 2022 to 78% later in 2024. Yet IBM found limited skills, data complexity and ethical concerns blocking successful adoption. Cheap models cannot redesign work by themselves.
La adopción de IA creció más rápido que lapreparación organizacionalIzquierda: uso empresarial de IA en encuestas, 2022 a 2024. Derecha: barreras citadas en la encuesta deIBM de 2023.Made for Freddy Vega, by HanademiFuentes: McKinsey & Company. (2024). The state of AI in early 2024.; Stanford Institute for Human-Centered ArtificialIntelligence. (2025). AI Index Report 2025. Stanford University.; IBM. (2023). Global AI Adoption Index 2023.Unidadporcentaje de encuestadosOrganizaciones que usan IA50 %78 %2022Finales de 2024Barreras para adoptar con éxito33 %25 %23 %Habilidades de IAlimitadasComplejidad de datosPreocupacioneséticas
El uso de IA avanzó rápido, desde cerca de 50% de las organizaciones encuestadas en 2022 hasta 78% posteriormente en 2024. IBM halló que las habilidades limitadas, la complejidad de datos y las preocupaciones éticas frenaban la adopción. Los modelos baratos no pueden rediseñar el trabajo por sí solos.
Generative AI investment jumped more than11xPrivate generative-AI investment, USD billions, 2022 to 2024.Made for Freddy Vega, by HanademiSources: Stanford Institute for Human-Centered Artificial Intelligence. (2025). AI Index Report 2025. Stanford University.UnitUSD$0$10B$20B$30B202220232024Investment surged to $25.2 billionin 2023.It reached $33.9 billion in 2024.$3B
Cheaper use did not mean less capital entering the sector. Stanford reported private generative-AI investment rising from about $3 billion in 2022 to $33.9 billion in 2024. The steepest jump came in 2023.
La inversión en IA generativa aumentó másde 11 vecesInversión privada en IA generativa, miles de millones USD, 2022 a 2024.Made for Freddy Vega, by HanademiFuentes: Stanford Institute for Human-Centered Artificial Intelligence. (2025). AI Index Report 2025. Stanford University.UnidadUSD$0$10 mil M$20 mil M$30 mil M202220232024La inversión saltó a $25.200millones en 2023.Llegó a $33.900 millones en2024.$3 mil M
El uso más barato no significó menos capital para el sector. Stanford informó que la inversión privada en IA generativa subió de cerca de $3.000 millones en 2022 a $33.900 millones en 2024. El mayor salto llegó en 2023.
Europe expanded its digital workforceunevenlyEmployed information and communications technology specialists, thousands, six European countries, 2015to 2025.Made for Freddy Vega, by HanademiSources: Eurostat. (n.d.). Employed information and communications technology (ICT) specialists [ISOC_SKS_ITSPT]. Eurostat.Unitthousand specialists01K2K201520172019202120232025GermanySpainFranceItalyNetherlandsSweden
The supply of digital workers expanded across most of these countries, but not at the same pace. Spain nearly doubled its total, while Italy peaked in 2023 and then declined. Access to models can globalize faster than the skills needed to deploy them.
Europa amplió su fuerza laboral digital deforma desigualEspecialistas empleados en tecnologías de información y comunicación, miles, seis países europeos, 2015a 2025.Made for Freddy Vega, by HanademiFuentes: Eurostat. (n.d.). Employed information and communications technology (ICT) specialists [ISOC_SKS_ITSPT].Eurostat.Unidadmiles de especialistas01K2K201520172019202120232025AlemaniaEspañaFranciaItaliaPaísesBajosSuecia
La oferta de trabajadores digitales creció en la mayoría de estos países, pero no al mismo ritmo. España casi duplicó su total, mientras Italia alcanzó un pico en 2023 y luego cayó. El acceso a modelos puede globalizarse más rápido que las habilidades necesarias para desplegarlos.
Frontier hardware and energy costs grew2.4x annually since 2016.The estimate covers amortized hardware and energy for final training runs since 2016,not every development expense.Sources: epoch.ai.
This is the central paradox. The marginal price of using a model collapsed while estimated hardware and energy costs for frontier final runs grew 2.4 times annually. The reported 95% confidence interval runs from 2.0 to 3.1 times.
Los costos de hardware y energíade frontera crecieron 2,4 veces alaño desde 2016.La estimación cubre hardware amortizado y energía de las corridas finales desde 2016,no todos los gastos de desarrollo.Fuentes: epoch.ai.
Esta es la paradoja central. El precio marginal de usar un modelo se desplomó mientras los costos estimados de hardware y energía de las corridas finales crecieron 2,4 veces al año. El intervalo de confianza de 95% va de 2,0 a 3,1 veces.
Fuentes
In summaryMade for Freddy Vega, by HanademiSources: Stanford Institute for Human-Centered Artificial Intelligence. (2025). AI Index Report 2025. Stanford University.; Masanet, E., Shehabi, A., Lei, N., Smith, S., &Koomey, J. (2020). Recalibrating global data center energy-use estimates. Science.; epoch.ai.; Dell'Acqua, F., et al. (2023). Navigating the jagged technological frontier.Harvard Business School Working Paper 24-013.; Meta. (2024). Llama 3.1 model card.; OpenAI. (2024). GPT-4o mini: Advancing cost-efficient intelligence.Stanford reported one-year gains of 18.8 percentage points on MMMU, 48.9 on GPQA and 67.3 on SWE-bench during 2024.From 2010 to 2018, global data-center compute instances increased about 550% while estimated electricity use increased only about 6%.Frontier models’ amortized final-run hardware and energy costs have grown 2.4-fold annually since 2016, with a 95%confidence interval of 2.0-fold to 3.1-fold.In a 758-consultant experiment, GPT-4 users completed suitable tasks about 25% faster and above 40% better, butcorrectness fell 19 points on an unsuitable task.Meta reported 1.46 million, 7.0 million and 30.84 million H100 GPU-hours for Llama 3.1 models with 8B, 70B and 405B parameters.In mid-2024, listed input prices were $0.15 for GPT-4o mini, $0.25 for Claude 3 Haiku and $0.35 for Gemini 1.5 Flash per million tokens.
The value of the research is not only what each source knew, but what became visible when their evidence was combined.
En resumenMade for Freddy Vega, by HanademiFuentes: Stanford Institute for Human-Centered Artificial Intelligence. (2025). AI Index Report 2025. Stanford University.; Masanet, E., Shehabi, A., Lei, N., Smith, S., &Koomey, J. (2020). Recalibrating global data center energy-use estimates. Science.; epoch.ai.; Dell'Acqua, F., et al. (2023). Navigating the jagged technological frontier.Harvard Business School Working Paper 24-013.; Meta. (2024). Llama 3.1 model card.; OpenAI. (2024). GPT-4o mini: Advancing cost-efficient intelligence.Stanford informó mejoras de un año de 18,8 puntos porcentuales en MMMU, 48,9 en GPQA y 67,3 en SWE-bench durante 2024.Entre 2010 y 2018, las instancias mundiales de cómputo de centros de datos aumentaron cerca de 550% mientras el usoeléctrico estimado creció solo alrededor de 6%.Los costos amortizados de hardware y energía de la corrida final de modelos frontera han crecido 2,4 veces por añodesde 2016, con un intervalo de confianza de 2,0 a 3,1 veces.En un experimento con 758 consultores, los usuarios de GPT-4 completaron tareas adecuadas cerca de 25% más rápido ymás de 40% mejor, pero la corrección cayó 19 puntos en otra tarea.Meta informó 1,46 millones, 7,0 millones y 30,84 millones de horas GPU H100 para modelos Llama 3.1 de 8B, 70B y 405B parámetros.A mediados de 2024, los precios de entrada publicados eran 0,15 dólares para GPT-4o mini, 0,25 para Claude 3 Haiku y0,35 para Gemini 1.5 Flash por millón.
El valor de la investigación no está solo en cada fuente, sino en lo que apareció al combinar sus evidencias.

La investigación detrás de esta presentación

Un dólar compraba más de 280 veces la misma inferencia de referencia. 3 términos técnicos sostienen buena parte del argumento.

Hallazgos clave

El argumento

Esta investigación se publica en inglés y español. Read in English