Hanademi

The real price of AI performance

28 slides · 20 min · 1 minute ago language
ENES
theme
LightDark
view
DeckTableTalk
brand
HanademiPlatzi
The real price of AIperformanceMade for Leonardo Chacon, by Hanademi
El precio real del rendimientode la IAMade for Leonardo Chacon, by Hanademi
GPT-4o made premium AI cheaper andnearly conversationalOpenAI launch prices per million input tokens and reported average voice response times.Made for Leonardo Chacon, by HanademiSources: OpenAI. (2024). Hello GPT-4o; OpenAI. (2023). New models and developer products announced at DevDay.UnitUSD and secondsInput price$30$10$5GPT-4 launchGPT-4 Turbo launchGPT-4o launchVoice response time5.42.80.3GPT-4GPT-3.5GPT-4o
GPT-4o was not merely another benchmark release. OpenAI cut its listed input price from $30 for GPT-4 to $5 and reported average voice responses of 0.32 seconds instead of 5.4 seconds. The product began to feel more like a conversation.
GPT-4o volvió la IA avanzada más barata ycasi conversacionalPrecios de lanzamiento de OpenAI por millón de tokens de entrada y tiempos promedio de respuesta de vozreportados.Made for Leonardo Chacon, by HanademiFuentes: OpenAI. (2024). Hello GPT-4o; OpenAI. (2023). New models and developer products announced at DevDay.UnidadUSD y segundosPrecio de entrada$30$10$5Lanzamiento deGPT-4Lanzamiento deGPT-4 TurboLanzamiento deGPT-4oTiempo de respuesta de voz5,42,80,3GPT-4GPT-3.5GPT-4o
GPT-4o no fue solamente otro lanzamiento de pruebas. OpenAI redujo el precio de entrada publicado de US$30 para GPT-4 a US$5 y reportó respuestas de voz de 0,32 segundos en vez de 5,4 segundos. El producto empezó a sentirse más como una conversación.
A quick guide to the testsPlain-language definitions used throughout the deck.Made for Leonardo Chacon, by HanademiMMLUQuestions covering many academic subjects.GPQADifficult graduate-level science questions.HumanEvalProgramming problems used to test code generation.SWE-benchReal software issues that models attempt to resolve.Context windowThe amount of input a model can consider at once.RAGRetrieving external information before generating an answer.
AI scores are easy to compare and easy to misunderstand. MMLU tests broad academic knowledge, GPQA targets difficult science and HumanEval tests programming. A larger context window measures capacity, not guaranteed attention.
Guía rápida de las pruebasDefiniciones sencillas usadas en toda la presentación.Made for Leonardo Chacon, by HanademiMMLUPreguntas sobre muchas materias académicas.GPQAPreguntas difíciles de ciencias a nivel de posgrado.HumanEvalProblemas de programación para probar generación de código.SWE-benchProblemas reales de software que los modelos intentan resolver.Ventana de contextoLa cantidad de entrada que un modelo puede considerar a la vez.RAGRecuperar información externa antes de generar una respuesta.
Las puntuaciones de IA son fáciles de comparar y fáciles de malinterpretar. MMLU prueba conocimiento académico amplio, GPQA se enfoca en ciencias difíciles y HumanEval prueba programación. Una ventana mayor mide capacidad, no atención garantizada.
GPT-4o was presentedA woman speaks in front of a screen displaying GPT-4o.Sources: OpenAI debuts GPT-4o 'omni' model now powering ChatGPT | TechCrunch. techcrunch.com.
The presentation gave a human face to GPT-4o before its performance profile comes into view.
GPT-4o fue presentadoUna mujer habla frente a una pantalla que muestra GPT-4o.Fuentes: OpenAI debuts GPT-4o 'omni' model now powering ChatGPT | TechCrunch. techcrunch.com.
La presentación dio un rostro humano a GPT-4o antes de examinar su perfil de rendimiento.
GPT-4o was strongest on broad knowledge,not advanced scienceOpenAI's 2024 launch scores under benchmark-specific prompting.Made for Leonardo Chacon, by HanademiSources: OpenAI. (2024). Hello GPT-4o.UnitBenchmark score88.7MMLU76.6MATH53.6GPQA
GPT-4o scored 88.7 on broad academic knowledge but 53.6 on GPQA. That spread matters more than one headline average. One test cannot establish superiority across every field.
GPT-4o fue más fuerte en conocimientogeneral que en ciencia avanzadaPuntuaciones de lanzamiento de OpenAI en 2024 bajo instrucciones específicas para cada prueba.Made for Leonardo Chacon, by HanademiFuentes: OpenAI. (2024). Hello GPT-4o.UnidadPuntuación de prueba88,7MMLU76,6MATH53,6GPQA
GPT-4o obtuvo 88,7 en conocimiento académico amplio, pero 53,6 en GPQA. Esa diferencia importa más que un único promedio destacado. Una prueba no establece superioridad en cada campo.
OpenAI said GPT-4o retained only 1% of usersThe launch page remained visible as GPT-4o approached retirement from ChatGPT.Sources: zdnet.com.
GPT-4o made speed and price the story in 2024. OpenAI later said only 1% of its users still engaged with it as retirement approached. Model comparisons can age very quickly.
Sources
OpenAI afirmó que GPT-4o conservabasolo al 1% de los usuariosLa página de lanzamiento seguía visible mientras GPT-4o se acercaba a su retiro de ChatGPT.Fuentes: zdnet.com.
GPT-4o convirtió la velocidad y el precio en la historia de 2024. OpenAI afirmó después que solo el 1% de sus usuarios todavía lo utilizaba mientras se acercaba su retiro. Las comparaciones de modelos pueden envejecer muy rápido.
Fuentes
Claude 3.5 Sonnet's coding score outpacedits science scoreAnthropic's 2024 reported scores across broad knowledge, science and code generation.Made for Leonardo Chacon, by HanademiSources: Anthropic. (2024). Claude 3.5 Sonnet.UnitBenchmark scoreMMLU88.7GPQA59.4HumanEval92
Anthropic reported 92 on HumanEval and 88.7 on MMLU for Claude 3.5 Sonnet. GPQA was lower at 59.4. The three tests did not describe one universal level of capability.
La puntuación de programación de Claude3.5 Sonnet superó la de cienciaPuntuaciones reportadas por Anthropic en 2024 para conocimiento general, ciencia y generación de código.Made for Leonardo Chacon, by HanademiFuentes: Anthropic. (2024). Claude 3.5 Sonnet.UnidadPuntuación de pruebaMMLU88,7GPQA59,4HumanEval92
Anthropic reportó 92 en HumanEval y 88,7 en MMLU para Claude 3.5 Sonnet. GPQA fue menor, con 59,4. Las tres pruebas no describían un nivel universal de capacidad.
Claude 3.5 Sonnet improved coding withoutmoving upmarketAnthropic's SWE-bench resolution rates and launch pricing of $3 input and $15 output per million tokens.Made for Leonardo Chacon, by HanademiSources: Anthropic. (2024). Claude 3.5 Sonnet; Jimenez, C. E., Yang, J., Wettig, A., Yao, S., Pei, K., Press, O., & Narasimhan, K.(2024). SWE-bench: Can language models resolve real-world GitHub issues?UnitResolved issues33.4%Claude 3.5 Sonnet31%Claude 3 Opus22%Claude 3 Sonnet
Claude 3.5 Sonnet reached 33.4% in Anthropic's SWE-bench setup, above 31% for Opus and 22% for the prior Sonnet. It launched at $3 per million input tokens and $15 per million output tokens. Better coding did not require moving to a higher price tier.
Claude 3.5 Sonnet mejoró en programaciónsin subir de nivel de precioTasas de resolución SWE-bench de Anthropic y precios de lanzamiento de US$3 de entrada y US$15 desalida por millón de tokens.Made for Leonardo Chacon, by HanademiFuentes: Anthropic. (2024). Claude 3.5 Sonnet; Jimenez, C. E., Yang, J., Wettig, A., Yao, S., Pei, K., Press, O., & Narasimhan, K.(2024). SWE-bench: Can language models resolve real-world GitHub issues?UnidadProblemas resueltos33,4 %Claude 3.5 Sonnet31 %Claude 3 Opus22 %Claude 3 Sonnet
Claude 3.5 Sonnet alcanzó 33,4% en la configuración SWE-bench de Anthropic, por encima de 31% para Opus y 22% para el Sonnet anterior. Se lanzó a US$3 por millón de tokens de entrada y US$15 por millón de salida. Mejorar en programación no exigió subir de nivel de precio.
Gemini expanded its context to 2 milliontokens in monthsGemini 1.5 Pro's advertised context window during 2024.Made for Leonardo Chacon, by HanademiSources: Google. (2024). Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context; Google. (2024). Gemini 1.5 Proupdates and 2 million token context window.UnitTokensFebruary preview128KMay availability1MJune preview2M
Google expanded Gemini 1.5 Pro from 128,000 to 2 million advertised tokens during 2024. That created a much larger workspace for documents, video and audio. Capacity alone did not guarantee equal attention to every position.
Gemini amplió su contexto a 2 millones detokens en pocos mesesVentana de contexto anunciada de Gemini 1.5 Pro durante 2024.Made for Leonardo Chacon, by HanademiFuentes: Google. (2024). Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context; Google. (2024). Gemini 1.5 Proupdates and 2 million token context window.UnidadTokensVista previa de febrero128KDisponibilidad de mayo1 MVista previa de junio2 M
Google amplió Gemini 1.5 Pro de 128.000 a 2 millones de tokens anunciados durante 2024. Eso creó un espacio mucho mayor para documentos, video y audio. La capacidad no garantizaba la misma atención en cada posición.
Long context looked capable, but longerprompts entered a higher price tier.The selected evaluations do not establish uniform recall in every position, modality orapplication.Sources: Google DeepMind. (2024). Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context; Google Cloud. (2024). VertexAI pricing: Generative AI; deepmind.google.
Google reported more than 99% retrieval in selected tests at 1 million tokens. Initial input pricing rose from $3.50 to $7 above 128,000 tokens, with $21 output pricing for longer prompts. Google announced a greater-than-50% reduction below 128K tokens on September 24, 2024.
El contexto largo parecía capaz, perolas solicitudes largas entraban en unnivel de precio mayor.Las evaluaciones seleccionadas no demuestran memoria uniforme en cada posición,modalidad o aplicación.Fuentes: Google DeepMind. (2024). Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context; Google Cloud. (2024). Vertex AIpricing: Generative AI; deepmind.google.
Google reportó más de 99% de recuperación en pruebas seleccionadas con 1 millón de tokens. El precio inicial de entrada subía de US$3,50 a US$7 por encima de 128.000 tokens, con US$21 de salida para solicitudes largas. Google anunció una reducción superior al 50% por debajo de 128K tokens el 24 de septiembre de 2024.
Scaling Llama 3 from 8B to 70B liftedknowledge and codingMeta's reported MMLU and HumanEval scores for Llama 3 Instruct sizes.Made for Leonardo Chacon, by HanademiSources: Meta AI. (2024). Introducing Meta Llama 3.The four reported values are organized into two benchmark series without changing them.UnitBenchmark score6070808B70BMMLUHumanEvalHumanEval rose to 81.7.
Moving from 8B to 70B raised MMLU from 68.4 to 82. HumanEval climbed from 62.2 to 81.7. Downloadable weights offered real capability, but the larger model demanded more infrastructure.
Escalar Llama 3 de 8B a 70B elevóconocimiento y programaciónPuntuaciones MMLU y HumanEval reportadas por Meta para tamaños de Llama 3 Instruct.Made for Leonardo Chacon, by HanademiFuentes: Meta AI. (2024). Introducing Meta Llama 3.Los cuatro valores reportados se organizan en dos series de pruebas sin modificarlos.UnidadPuntuación de prueba6070808B70BMMLUHumanEvalHumanEval subió a 81,7.
Pasar de 8B a 70B elevó MMLU de 68,4 a 82. HumanEval subió de 62,2 a 81,7. Los pesos descargables ofrecían capacidad real, pero el modelo mayor exigía más infraestructura.
Llama 3 70B excelled at grade-school math,not advanced mathMeta's reported Llama 3 70B Instruct scores across four 2024 evaluations.Made for Leonardo Chacon, by HanademiSources: Meta AI. (2024). Introducing Meta Llama 3; Meta. (2024). Meta Llama 3 Community License Agreement; ai-tldr.dev.UnitBenchmark scoreMMLU82HumanEval81.7MATH50.4GSM8K93
Llama 3 70B reached 93 on GSM8K but 50.4 on MATH. Meta charged no per-token license fee, although its community license included conditions for very large platforms. Llama 3.3 70B later arrived with a 128,000-token context window.
Llama 3 70B destacó en matemáticasescolares, no en matemáticas avanzadasPuntuaciones de Llama 3 70B Instruct reportadas por Meta en cuatro evaluaciones de 2024.Made for Leonardo Chacon, by HanademiFuentes: Meta AI. (2024). Introducing Meta Llama 3; Meta. (2024). Meta Llama 3 Community License Agreement; ai-tldr.dev.UnidadPuntuación de pruebaMMLU82HumanEval81,7MATH50,4GSM8K93
Llama 3 70B alcanzó 93 en GSM8K, pero 50,4 en MATH. Meta no cobró una tarifa de licencia por token, aunque su licencia comunitaria incluyó condiciones para plataformas muy grandes. Llama 3.3 70B llegó después con una ventana de 128.000 tokens.
Mixtral activated only part of its full engineper tokenMistral reported 141B total parameters, 39B active parameters and 2 experts selected per token; categorylabels retain each unit.Made for Leonardo Chacon, by HanademiSources: Mistral AI. (2024). Cheaper, better, faster, stronger.The first 2 values are billions of parameters; the final value is experts selected per token.UnitReported architecture values141Total parameters (B)39Active parameters (B)2Experts selected (count)
Mistral described 141 billion total parameters and 39 billion active per token. The model selected 2 experts for each token. Sparse routing reduced active computation without removing the full model's memory burden.
Mixtral activaba solo una parte de su motorcompleto por tokenMistral reportó 141B parámetros totales, 39B parámetros activos y 2 expertos seleccionados por token;cada categoría conserva su unidad.Made for Leonardo Chacon, by HanademiFuentes: Mistral AI. (2024). Cheaper, better, faster, stronger.Los primeros 2 valores son miles de millones de parámetros; el último es la cantidad de expertos seleccionados portoken.UnidadValores de arquitectura reportados141Parámetros totales (B)39Parámetros activos (B)2Expertos seleccionados (cantidad)
Mistral describió 141.000 millones de parámetros totales y 39.000 millones activos por token. El modelo seleccionaba 2 expertos para cada token. El enrutamiento disperso reducía el cálculo activo sin eliminar la carga de memoria del modelo completo.
Mixtral 8x22B was documented on1 DGX H200 node.This is a documented deployment configuration, not a universal minimum hardwarerequirement.Sources: docs.discoverer.bg.
Discoverer HPC documented Mixtral 8x22B deployment on one DGX H200 node. The setup used a SLURM-managed cluster and vLLM. Sparse computation still relied on substantial serving hardware.
Mixtral 8x22B fue documentado en 1nodo DGX H200.Esta es una configuración de despliegue documentada, no un requisito mínimo universalde hardware.Fuentes: docs.discoverer.bg.
Discoverer HPC documentó el despliegue de Mixtral 8x22B en un nodo DGX H200. La configuración usó un clúster administrado con SLURM y vLLM. El cálculo disperso todavía dependía de hardware de servicio considerable.
Mixtral 8x22B offered 8 times Llama 3'sinitial contextSupported context windows in the initial 2024 releases, measured in tokens.Made for Leonardo Chacon, by HanademiSources: Mistral AI. (2024). Mixtral of experts; Mistral AI. (2024). Cheaper, better, faster, stronger; Meta AI. (2024). Introducing MetaLlama 3.UnitTokensInitial Llama 38KMixtral 8x7B32KMixtral 8x22B64K
Mixtral 8x22B supported 64,000 tokens, twice Mixtral 8x7B and eight times the initial Llama 3 release. That expanded the material it could accept. It did not remove the memory burden of storing the full model.
Mixtral 8x22B ofrecía 8 veces el contextoinicial de Llama 3Ventanas de contexto admitidas en los lanzamientos iniciales de 2024, medidas en tokens.Made for Leonardo Chacon, by HanademiFuentes: Mistral AI. (2024). Mixtral of experts; Mistral AI. (2024). Cheaper, better, faster, stronger; Meta AI. (2024). Introducing MetaLlama 3.UnidadTokensLlama 3 inicial8KMixtral 8x7B32KMixtral 8x22B64K
Mixtral 8x22B admitía 64.000 tokens, el doble que Mixtral 8x7B y ocho veces el lanzamiento inicial de Llama 3. Eso amplió el material que podía aceptar. No eliminó la carga de memoria de almacenar el modelo completo.
Mixtral's strongest reported result camefrom commonsense reasoningMistral's base-model scores across broad knowledge and reasoning tests.Made for Leonardo Chacon, by HanademiSources: Mistral AI. (2024). Cheaper, better, faster, stronger.UnitBenchmark score88.7HellaSwag77.8MMLU70ARC Challenge
Mixtral 8x22B reached 88.7 on HellaSwag, above 77.8 on MMLU and 70 on ARC Challenge. Its strength depended on the task. Sparse architecture did not guarantee universal benchmark leadership.
El mejor resultado reportado de Mixtralvino del razonamiento de sentido comúnPuntuaciones del modelo base de Mistral en pruebas de conocimiento general y razonamiento.Made for Leonardo Chacon, by HanademiFuentes: Mistral AI. (2024). Cheaper, better, faster, stronger.UnidadPuntuación de prueba88,7HellaSwag77,8MMLU70ARC Challenge
Mixtral 8x22B alcanzó 88,7 en HellaSwag, por encima de 77,8 en MMLU y 70 en ARC Challenge. Su fortaleza dependía de la tarea. La arquitectura dispersa no garantizaba liderazgo universal.
DeepSeek listed output tokens at just$0.28 per million.The price came from DeepSeek's API documentation and was not an independentlyaudited cost comparison.Sources: DeepSeek. (2024). DeepSeek API pricing.
DeepSeek-V2 listed about $0.14 for uncached input and $0.28 for output per million tokens. Those prices were unusually low beside other launch-era APIs. Sticker price alone did not establish quality or total cost.
DeepSeek publicó tokens de salida a soloUS$0,28 por millón.El precio provino de la documentación de API de DeepSeek y no fue una comparación decostos auditada de forma independiente.Fuentes: DeepSeek. (2024). DeepSeek API pricing.
DeepSeek-V2 publicó cerca de US$0,14 para entrada sin caché y US$0,28 para salida por millón de tokens. Eran precios inusualmente bajos frente a otras API de lanzamiento. El precio anunciado no demostraba calidad ni costo total.
Qwen2 72B's science score trailed itsknowledge, math and codingAlibaba's reported Qwen2-72B-Instruct results across four evaluations.Made for Leonardo Chacon, by HanademiSources: Qwen Team. (2024). Qwen2 technical report; Qwen Team. (2024). Hello Qwen2.UnitBenchmark scoreMMLU84.2GSM8K89.5HumanEval86GPQA37.9
Qwen2 72B scored above 84 on MMLU, GSM8K and HumanEval, but 37.9 on GPQA. Its documentation also listed 27 additional languages beyond English and Chinese. Language coverage did not prove equal regional accuracy.
La puntuación científica de Qwen2 72B quedó detrásde conocimiento, matemáticas y programaciónResultados de Qwen2-72B-Instruct reportados por Alibaba en cuatro evaluaciones.Made for Leonardo Chacon, by HanademiFuentes: Qwen Team. (2024). Qwen2 technical report; Qwen Team. (2024). Hello Qwen2.UnidadPuntuación de pruebaMMLU84,2GSM8K89,5HumanEval86GPQA37,9
Qwen2 72B obtuvo más de 84 en MMLU, GSM8K y HumanEval, pero 37,9 en GPQA. Su documentación también enumeró 27 idiomas adicionales al inglés y chino. La cobertura lingüística no demostraba la misma precisión regional.
Qwen2 stretched from 0.5B to 72BparametersFive Qwen2 variants released for different deployment scales.Made for Leonardo Chacon, by HanademiSources: Qwen Team. (2024). Hello Qwen2.UnitBillion parameters72Qwen2 72B57Qwen2 57B-A14B7Qwen2 7B1.5Qwen2 1.5B0.5Qwen2 0.5B
Qwen2 arrived in at least five scales, from 0.5B to 72B parameters. Deployers could trade footprint against capability instead of accepting one architecture. The economic choice became finding the smallest model that could complete the task.
Qwen2 abarcó desde 0,5B hasta 72BparámetrosCinco variantes de Qwen2 publicadas para diferentes escalas de despliegue.Made for Leonardo Chacon, by HanademiFuentes: Qwen Team. (2024). Hello Qwen2.UnidadMiles de millones de parámetros72Qwen2 72B57Qwen2 57B-A14B7Qwen2 7B1,5Qwen2 1.5B0,5Qwen2 0.5B
Qwen2 llegó en al menos cinco escalas, desde 0,5B hasta 72B parámetros. Los usuarios podían intercambiar tamaño por capacidad en vez de aceptar una sola arquitectura. La decisión económica pasó a ser encontrar el modelo más pequeño capaz de completar la tarea.
Command R+ charged 5 times more foroutput than inputInitial API prices per million tokens for Command R+.Made for Leonardo Chacon, by HanademiSources: Cohere. (2024). Cohere pricing; Cohere. (2024). Introducing Command R+.UnitUSD per million tokensInput$3Output$155x
Command R+ listed $3 for input and $15 for output per million tokens. Cohere emphasized retrieval, citations, tools and evaluation across 10 languages. Its value proposition focused on enterprise workflows rather than every general benchmark.
Command R+ cobraba 5 veces más porsalida que por entradaPrecios iniciales de API por millón de tokens para Command R+.Made for Leonardo Chacon, by HanademiFuentes: Cohere. (2024). Cohere pricing; Cohere. (2024). Introducing Command R+.UnidadUSD por millón de tokensEntrada$3Salida$155x
Command R+ publicó US$3 para entrada y US$15 para salida por millón de tokens. Cohere enfatizó recuperación, citas, herramientas y evaluación en 10 idiomas. Su propuesta se enfocó en flujos empresariales y no en cada prueba general.
MMLU's expert human baseline was 89.8%Original MMLU study baselines under its reported conditions.Made for Leonardo Chacon, by HanademiSources: Hendrycks, D., Burns, C., Basart, S., et al. (2021). Measuring massive multitask language understanding.UnitAccuracy25%50%75%100%25%Random choice34.5%Unskilled human89.8%Expert humanExpert human baseline
The original MMLU paper reported 25% for random choice, 34.5% for unskilled humans and 89.8% for experts. Nearing that benchmark is impressive. It does not establish expert performance on unrelated work.
La referencia de expertos humanos enMMLU fue 89,8%Referencias del estudio original de MMLU bajo sus condiciones reportadas.Made for Leonardo Chacon, by HanademiFuentes: Hendrycks, D., Burns, C., Basart, S., et al. (2021). Measuring massive multitask language understanding.UnidadPrecisión25 %50 %75 %100 %25 %Elección al azar34,5 %Humano no especializado89,8 %Humano expertoReferencia de experto humano
El artículo original de MMLU reportó 25% para elección al azar, 34,5% para humanos no especializados y 89,8% para expertos. Acercarse a esa referencia es impresionante. No demuestra rendimiento experto en trabajos diferentes.
Routing cut selected AI task costs by up to98%FrugalGPT's maximum reported reduction while matching GPT-4 quality on selected benchmark tasks.Made for Leonardo Chacon, by HanademiSources: Chen, L., Zaharia, M., & Zou, J. (2023). FrugalGPT: How to use large language models while reducing cost and improvingperformance.The reported 98% maximum reduction is expressed as a bridge from a 100 baseline to a 2 cost index.UnitCost index0255075100100GPT-4 baseline-98Maximum saving2FrugalGPT cost
FrugalGPT reported cost reductions of up to 98% while matching GPT-4 quality on selected tasks. It cascaded requests across models instead of sending everything to the most expensive option. The cheapest useful system may be a router, not one model.
El enrutamiento redujo hasta 98% el costode tareas seleccionadas de IAReducción máxima reportada por FrugalGPT manteniendo la calidad de GPT-4 en tareas seleccionadas.Made for Leonardo Chacon, by HanademiFuentes: Chen, L., Zaharia, M., & Zou, J. (2023). FrugalGPT: How to use large language models while reducing cost and improvingperformance.La reducción máxima reportada de 98% se expresa como un puente desde una referencia 100 hasta un índice de costo 2.UnidadÍndice de costo0255075100100Referencia GPT-4-98Ahorro máximo2Costo de FrugalGPT
FrugalGPT reportó reducciones de costo de hasta 98% manteniendo la calidad de GPT-4 en tareas seleccionadas. Encadenó solicitudes entre modelos en vez de enviar todo a la opción más costosa. El sistema útil más barato puede ser un enrutador y no un solo modelo.
Performance reaches the keyboardHands typing on a keyboard beside a potted plant and a cup.Sources: GPT-4o vs GPT-4 Turbo: Real Benchmark Results | Bitig. bitig.info.
Cost and throughput choices ultimately shape the experience of ordinary computer interactions.
El rendimiento llega al tecladoUnas manos escriben en un teclado junto a una planta en maceta y una taza.Fuentes: GPT-4o vs GPT-4 Turbo: Real Benchmark Results | Bitig. bitig.info.
Las decisiones sobre costo y rendimiento terminan moldeando la experiencia de las interacciones informáticas cotidianas.
Serving software delivered up to 24 timesthe baseline throughputMaximum throughput indices reported in selected vLLM serving experiments.Made for Leonardo Chacon, by HanademiSources: Kwon, W., Li, Z., Zhuang, S., et al. (2023). Efficient memory management for large language model serving withPagedAttention.UnitThroughput multiple010201Hugging Face baseline6.9FasterTransformer24vLLMHugging Face baseline
The vLLM paper reported up to 24 times Hugging Face Transformers throughput and 3.5 times FasterTransformer. Serving software changed how much output the same infrastructure could deliver. Model pricing can miss this operational lever.
El software de servicio alcanzó hasta 24veces el rendimiento de referenciaÍndices máximos de rendimiento reportados en experimentos seleccionados de servicio con vLLM.Made for Leonardo Chacon, by HanademiFuentes: Kwon, W., Li, Z., Zhuang, S., et al. (2023). Efficient memory management for large language model serving withPagedAttention.UnidadMúltiplo de rendimiento010201Referencia de Hugging Face6,9FasterTransformer24vLLMReferencia de Hugging Face
El artículo de vLLM reportó hasta 24 veces el rendimiento de Hugging Face Transformers y 3,5 veces el de FasterTransformer. El software de servicio cambió cuánta salida podía entregar la misma infraestructura. El precio del modelo puede ocultar esta palanca operativa.
AI runs on physical infrastructureServer racks with blue cables and visible status lights.Sources: Mistral vs Mixtral: Comparing the 7B, 8x7B, and 8x22B Large Language Models | Towards Data Science. towardsdatascience.com.
Serving gains matter because every model ultimately depends on a physical computing stack.
La IA funciona sobre infraestructura físicaRacks de servidores con cables azules y luces de estado visibles.Fuentes: Mistral vs Mixtral: Comparing the 7B, 8x7B, and 8x22B Large Language Models | Towards Data Science. towardsdatascience.com.
Las mejoras de servicio importan porque todo modelo depende finalmente de una infraestructura física de cómputo.
Estimated training compute reached $191million for Gemini UltraStanford estimates of training-compute cost, excluding the full investment required to build and operate amodel.Made for Leonardo Chacon, by HanademiSources: Stanford Institute for Human-Centered Artificial Intelligence. (2024). Artificial Intelligence Index Report 2024; Epoch AI. (2024).Machine learning hardware and training cost estimates.UnitUSDLlama 2 70B estimate$3.3MGPT-4 estimate$78MGemini Ultra estimate$191M
Stanford estimated $3.3 million in training compute for Llama 2 70B, $78 million for GPT-4 and $191 million for Gemini Ultra. Frontier training increasingly resembled major industrial infrastructure. These figures still excluded other investment categories.
El cómputo estimado de entrenamiento llegóa US$191 millones para Gemini UltraEstimaciones de Stanford del costo de cómputo de entrenamiento, sin incluir toda la inversión necesariapara construir y operar un modelo.Made for Leonardo Chacon, by HanademiFuentes: Stanford Institute for Human-Centered Artificial Intelligence. (2024). Artificial Intelligence Index Report 2024; Epoch AI. (2024).Machine learning hardware and training cost estimates.UnidadUSDEstimación de Llama 2 70B$3,3 MEstimación de GPT-4$78 MEstimación de Gemini Ultra$191 M
Stanford estimó US$3,3 millones en cómputo de entrenamiento para Llama 2 70B, US$78 millones para GPT-4 y US$191 millones para Gemini Ultra. El entrenamiento de frontera se parecía cada vez más a infraestructura industrial. Estas cifras todavía excluían otras categorías de inversión.
Frontier training costs grew 2.4x yearlyand could exceed $1 billion before 2030.The estimate assumes the historical growth rate persists and should not be read as aguaranteed forecast.Sources: Cottier, B., Rahman, R., Fattorini, L., Maslej, N., & Owen, D. (2024). The rising costs of training frontier AI models.
Epoch AI estimated that frontier training costs had multiplied about 2.4 times annually since 2016. If that trend persisted, one training run could exceed $1 billion before 2030. The result is a conditional estimate, not a committed budget.
Los costos de entrenamiento de fronteracrecieron 2,4x anualmente y podríansuperar $1 mil millones antes de 2030.La estimación supone que la tasa histórica de crecimiento continúa y no debe leersecomo un pronóstico garantizado.Fuentes: Cottier, B., Rahman, R., Fattorini, L., Maslej, N., & Owen, D. (2024). The rising costs of training frontier AI models.
Epoch AI estimó que los costos de entrenamiento de frontera se habían multiplicado unas 2,4 veces al año desde 2016. Si esa tendencia continuaba, una ejecución podría superar US$1.000 millones antes de 2030. El resultado es una estimación condicional, no un presupuesto comprometido.
The IEA projected data-center electricityuse past 1,000 TWhGlobal data-center electricity use in 2022 and the IEA's lower-bound 2026 projection; AI is only onecontributor.Made for Leonardo Chacon, by HanademiSources: International Energy Agency. (2024). Electricity 2024: Analysis and forecast to 2026.The 2026 point is plotted at 1,000 TWh as the lower bound of the IEA's more-than-1,000 TWh projection.UnitTWh20224602026 projection1,0002.2x
The IEA reported about 460 TWh of data-center electricity use in 2022 and projected more than 1,000 TWh for 2026. That would be more than twice the earlier level. AI contributes to this demand, but the total includes other workloads.
La AIE proyectó el uso eléctrico de centrosde datos por encima de 1.000 TWhUso eléctrico mundial de centros de datos en 2022 y límite inferior de la proyección de la AIE para 2026;la IA es solo un factor.Made for Leonardo Chacon, by HanademiFuentes: International Energy Agency. (2024). Electricity 2024: Analysis and forecast to 2026.El punto de 2026 se representa en 1.000 TWh como límite inferior de la proyección de más de 1.000 TWh de la AIE.UnidadTWh2022460Proyección 20261.0002,2x
La AIE reportó unos 460 TWh de uso eléctrico de centros de datos en 2022 y proyectó más de 1.000 TWh para 2026. Eso sería más del doble del nivel anterior. La IA contribuye a esta demanda, pero el total incluye otras cargas.
In summaryMade for Leonardo Chacon, by HanademiSources: DeepSeek. (2024). DeepSeek API pricing.; Chen, L., Zaharia, M., & Zou, J. (2023). FrugalGPT: How to use large language models while reducing cost and improving performance.; Stanford Institute forHuman-Centered Artificial Intelligence. (2024). Artificial Intelligence Index Report 2024.; Cottier, B., Rahman, R., Fattorini, L., Maslej, N., & Owen, D. (2024). The rising costs of training frontier AI models.; Google.(2024). Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.; Google DeepMind. (2024). Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.DeepSeek-V2's 2024 API page listed approximately $0.14 per million uncached input tokens and $0.28 per million output tokens.FrugalGPT reported cost reductions of up to 98% while matching GPT-4 quality on selected benchmark tasks through model cascades.Stanford estimated training-compute costs of about $3.3 million for Llama 2 70B, $78 million for GPT-4 and $191 million for Gemini Ultra.Epoch AI estimated frontier training costs grew about 2.4-fold annually since 2016 and could exceed $1 billion before 2030 if the trend persisted.Google expanded Gemini 1.5 Pro's advertised context from 128,000 to 1 million and then 2 million tokens during 2024.Google reported over 99% retrieval at 1 million tokens in selected text, video and audio needle-in-a-haystack evaluations.
The value of the research is not only what each source knew, but what became visible when their evidence was combined.
En resumenMade for Leonardo Chacon, by HanademiFuentes: DeepSeek. (2024). DeepSeek API pricing.; Chen, L., Zaharia, M., & Zou, J. (2023). FrugalGPT: How to use large language models while reducing cost and improving performance.; Stanford Institute forHuman-Centered Artificial Intelligence. (2024). Artificial Intelligence Index Report 2024.; Cottier, B., Rahman, R., Fattorini, L., Maslej, N., & Owen, D. (2024). The rising costs of training frontier AI models.; Google.(2024). Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.; Google DeepMind. (2024). Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.La página de API de DeepSeek-V2 en 2024 publicó aproximadamente US$0,14 por millón de tokens de entrada sin caché yUS$0,28 por millón de salida.FrugalGPT reportó reducciones de costo de hasta 98% manteniendo calidad de GPT-4 en tareas seleccionadas mediante cascadas de modelos.Stanford estimó costos de cómputo de unos US$3,3 millones para Llama 2 70B, US$78 millones para GPT-4 y US$191 millones para Gemini Ultra.Epoch AI estimó que los costos de entrenamiento de frontera crecieron unas 2,4 veces al año desde 2016 y podríansuperar US$1.000 millones antes de 2030.Google amplió durante 2024 el contexto anunciado de Gemini 1.5 Pro desde 128.000 hasta 1 millón y después 2 millones de tokens.Google reportó más de 99% de recuperación con 1 millón de tokens en evaluaciones seleccionadas de aguja en un pajar para texto, video y audio.
El valor de la investigación no está solo en cada fuente, sino en lo que apareció al combinar sus evidencias.

The research behind this deck

The 2024 model race cut prices, latency and serving costs while expanding context and capability. Yet no benchmark crowned a universal winner, and major savings often came from routing and infrastructure rather than the model alone.

Key findings

The argument

This research is published in English and Spanish. Ver en español

La investigación detrás de esta presentación

La carrera de modelos de 2024 redujo precios, latencia y costos de servicio mientras amplió contexto y capacidad. Pero ninguna prueba coronó un ganador universal, y grandes ahorros vinieron del enrutamiento y la infraestructura.

Hallazgos clave

El argumento

Esta investigación se publica en inglés y español. Read in English