GPT-4o was not merely another benchmark release. OpenAI cut its listed input price from $30 for GPT-4 to $5 and reported average voice responses of 0.32 seconds instead of 5.4 seconds. The product began to feel more like a conversation.
GPT-4o no fue solamente otro lanzamiento de pruebas. OpenAI redujo el precio de entrada publicado de US$30 para GPT-4 a US$5 y reportó respuestas de voz de 0,32 segundos en vez de 5,4 segundos. El producto empezó a sentirse más como una conversación.
AI scores are easy to compare and easy to misunderstand. MMLU tests broad academic knowledge, GPQA targets difficult science and HumanEval tests programming. A larger context window measures capacity, not guaranteed attention.
Las puntuaciones de IA son fáciles de comparar y fáciles de malinterpretar. MMLU prueba conocimiento académico amplio, GPQA se enfoca en ciencias difíciles y HumanEval prueba programación. Una ventana mayor mide capacidad, no atención garantizada.
The presentation gave a human face to GPT-4o before its performance profile comes into view.
La presentación dio un rostro humano a GPT-4o antes de examinar su perfil de rendimiento.
GPT-4o scored 88.7 on broad academic knowledge but 53.6 on GPQA. That spread matters more than one headline average. One test cannot establish superiority across every field.
GPT-4o obtuvo 88,7 en conocimiento académico amplio, pero 53,6 en GPQA. Esa diferencia importa más que un único promedio destacado. Una prueba no establece superioridad en cada campo.
GPT-4o made speed and price the story in 2024. OpenAI later said only 1% of its users still engaged with it as retirement approached. Model comparisons can age very quickly.
GPT-4o convirtió la velocidad y el precio en la historia de 2024. OpenAI afirmó después que solo el 1% de sus usuarios todavía lo utilizaba mientras se acercaba su retiro. Las comparaciones de modelos pueden envejecer muy rápido.
Anthropic reported 92 on HumanEval and 88.7 on MMLU for Claude 3.5 Sonnet. GPQA was lower at 59.4. The three tests did not describe one universal level of capability.
Anthropic reportó 92 en HumanEval y 88,7 en MMLU para Claude 3.5 Sonnet. GPQA fue menor, con 59,4. Las tres pruebas no describían un nivel universal de capacidad.
Claude 3.5 Sonnet reached 33.4% in Anthropic's SWE-bench setup, above 31% for Opus and 22% for the prior Sonnet. It launched at $3 per million input tokens and $15 per million output tokens. Better coding did not require moving to a higher price tier.
Claude 3.5 Sonnet alcanzó 33,4% en la configuración SWE-bench de Anthropic, por encima de 31% para Opus y 22% para el Sonnet anterior. Se lanzó a US$3 por millón de tokens de entrada y US$15 por millón de salida. Mejorar en programación no exigió subir de nivel de precio.
Google expanded Gemini 1.5 Pro from 128,000 to 2 million advertised tokens during 2024. That created a much larger workspace for documents, video and audio. Capacity alone did not guarantee equal attention to every position.
Google amplió Gemini 1.5 Pro de 128.000 a 2 millones de tokens anunciados durante 2024. Eso creó un espacio mucho mayor para documentos, video y audio. La capacidad no garantizaba la misma atención en cada posición.
Google reported more than 99% retrieval in selected tests at 1 million tokens. Initial input pricing rose from $3.50 to $7 above 128,000 tokens, with $21 output pricing for longer prompts. Google announced a greater-than-50% reduction below 128K tokens on September 24, 2024.
Google reportó más de 99% de recuperación en pruebas seleccionadas con 1 millón de tokens. El precio inicial de entrada subía de US$3,50 a US$7 por encima de 128.000 tokens, con US$21 de salida para solicitudes largas. Google anunció una reducción superior al 50% por debajo de 128K tokens el 24 de septiembre de 2024.
Moving from 8B to 70B raised MMLU from 68.4 to 82. HumanEval climbed from 62.2 to 81.7. Downloadable weights offered real capability, but the larger model demanded more infrastructure.
Pasar de 8B a 70B elevó MMLU de 68,4 a 82. HumanEval subió de 62,2 a 81,7. Los pesos descargables ofrecían capacidad real, pero el modelo mayor exigía más infraestructura.
Llama 3 70B reached 93 on GSM8K but 50.4 on MATH. Meta charged no per-token license fee, although its community license included conditions for very large platforms. Llama 3.3 70B later arrived with a 128,000-token context window.
Llama 3 70B alcanzó 93 en GSM8K, pero 50,4 en MATH. Meta no cobró una tarifa de licencia por token, aunque su licencia comunitaria incluyó condiciones para plataformas muy grandes. Llama 3.3 70B llegó después con una ventana de 128.000 tokens.
Mistral described 141 billion total parameters and 39 billion active per token. The model selected 2 experts for each token. Sparse routing reduced active computation without removing the full model's memory burden.
Mistral describió 141.000 millones de parámetros totales y 39.000 millones activos por token. El modelo seleccionaba 2 expertos para cada token. El enrutamiento disperso reducía el cálculo activo sin eliminar la carga de memoria del modelo completo.
Discoverer HPC documented Mixtral 8x22B deployment on one DGX H200 node. The setup used a SLURM-managed cluster and vLLM. Sparse computation still relied on substantial serving hardware.
Discoverer HPC documentó el despliegue de Mixtral 8x22B en un nodo DGX H200. La configuración usó un clúster administrado con SLURM y vLLM. El cálculo disperso todavía dependía de hardware de servicio considerable.
Mixtral 8x22B supported 64,000 tokens, twice Mixtral 8x7B and eight times the initial Llama 3 release. That expanded the material it could accept. It did not remove the memory burden of storing the full model.
Mixtral 8x22B admitía 64.000 tokens, el doble que Mixtral 8x7B y ocho veces el lanzamiento inicial de Llama 3. Eso amplió el material que podía aceptar. No eliminó la carga de memoria de almacenar el modelo completo.
Mixtral 8x22B reached 88.7 on HellaSwag, above 77.8 on MMLU and 70 on ARC Challenge. Its strength depended on the task. Sparse architecture did not guarantee universal benchmark leadership.
Mixtral 8x22B alcanzó 88,7 en HellaSwag, por encima de 77,8 en MMLU y 70 en ARC Challenge. Su fortaleza dependía de la tarea. La arquitectura dispersa no garantizaba liderazgo universal.
DeepSeek-V2 listed about $0.14 for uncached input and $0.28 for output per million tokens. Those prices were unusually low beside other launch-era APIs. Sticker price alone did not establish quality or total cost.
DeepSeek-V2 publicó cerca de US$0,14 para entrada sin caché y US$0,28 para salida por millón de tokens. Eran precios inusualmente bajos frente a otras API de lanzamiento. El precio anunciado no demostraba calidad ni costo total.
Qwen2 72B scored above 84 on MMLU, GSM8K and HumanEval, but 37.9 on GPQA. Its documentation also listed 27 additional languages beyond English and Chinese. Language coverage did not prove equal regional accuracy.
Qwen2 72B obtuvo más de 84 en MMLU, GSM8K y HumanEval, pero 37,9 en GPQA. Su documentación también enumeró 27 idiomas adicionales al inglés y chino. La cobertura lingüística no demostraba la misma precisión regional.
Qwen2 arrived in at least five scales, from 0.5B to 72B parameters. Deployers could trade footprint against capability instead of accepting one architecture. The economic choice became finding the smallest model that could complete the task.
Qwen2 llegó en al menos cinco escalas, desde 0,5B hasta 72B parámetros. Los usuarios podían intercambiar tamaño por capacidad en vez de aceptar una sola arquitectura. La decisión económica pasó a ser encontrar el modelo más pequeño capaz de completar la tarea.
Command R+ listed $3 for input and $15 for output per million tokens. Cohere emphasized retrieval, citations, tools and evaluation across 10 languages. Its value proposition focused on enterprise workflows rather than every general benchmark.
Command R+ publicó US$3 para entrada y US$15 para salida por millón de tokens. Cohere enfatizó recuperación, citas, herramientas y evaluación en 10 idiomas. Su propuesta se enfocó en flujos empresariales y no en cada prueba general.
The original MMLU paper reported 25% for random choice, 34.5% for unskilled humans and 89.8% for experts. Nearing that benchmark is impressive. It does not establish expert performance on unrelated work.
El artículo original de MMLU reportó 25% para elección al azar, 34,5% para humanos no especializados y 89,8% para expertos. Acercarse a esa referencia es impresionante. No demuestra rendimiento experto en trabajos diferentes.
FrugalGPT reported cost reductions of up to 98% while matching GPT-4 quality on selected tasks. It cascaded requests across models instead of sending everything to the most expensive option. The cheapest useful system may be a router, not one model.
FrugalGPT reportó reducciones de costo de hasta 98% manteniendo la calidad de GPT-4 en tareas seleccionadas. Encadenó solicitudes entre modelos en vez de enviar todo a la opción más costosa. El sistema útil más barato puede ser un enrutador y no un solo modelo.
Cost and throughput choices ultimately shape the experience of ordinary computer interactions.
Las decisiones sobre costo y rendimiento terminan moldeando la experiencia de las interacciones informáticas cotidianas.
The vLLM paper reported up to 24 times Hugging Face Transformers throughput and 3.5 times FasterTransformer. Serving software changed how much output the same infrastructure could deliver. Model pricing can miss this operational lever.
El artículo de vLLM reportó hasta 24 veces el rendimiento de Hugging Face Transformers y 3,5 veces el de FasterTransformer. El software de servicio cambió cuánta salida podía entregar la misma infraestructura. El precio del modelo puede ocultar esta palanca operativa.
Serving gains matter because every model ultimately depends on a physical computing stack.
Las mejoras de servicio importan porque todo modelo depende finalmente de una infraestructura física de cómputo.
Stanford estimated $3.3 million in training compute for Llama 2 70B, $78 million for GPT-4 and $191 million for Gemini Ultra. Frontier training increasingly resembled major industrial infrastructure. These figures still excluded other investment categories.
Stanford estimó US$3,3 millones en cómputo de entrenamiento para Llama 2 70B, US$78 millones para GPT-4 y US$191 millones para Gemini Ultra. El entrenamiento de frontera se parecía cada vez más a infraestructura industrial. Estas cifras todavía excluían otras categorías de inversión.
Epoch AI estimated that frontier training costs had multiplied about 2.4 times annually since 2016. If that trend persisted, one training run could exceed $1 billion before 2030. The result is a conditional estimate, not a committed budget.
Epoch AI estimó que los costos de entrenamiento de frontera se habían multiplicado unas 2,4 veces al año desde 2016. Si esa tendencia continuaba, una ejecución podría superar US$1.000 millones antes de 2030. El resultado es una estimación condicional, no un presupuesto comprometido.
The IEA reported about 460 TWh of data-center electricity use in 2022 and projected more than 1,000 TWh for 2026. That would be more than twice the earlier level. AI contributes to this demand, but the total includes other workloads.
La AIE reportó unos 460 TWh de uso eléctrico de centros de datos en 2022 y proyectó más de 1.000 TWh para 2026. Eso sería más del doble del nivel anterior. La IA contribuye a esta demanda, pero el total incluye otras cargas.
The 2024 model race cut prices, latency and serving costs while expanding context and capability. Yet no benchmark crowned a universal winner, and major savings often came from routing and infrastructure rather than the model alone.
Key findings
DeepSeek-V2's 2024 API page listed approximately $0.14 per million uncached input tokens and $0.28 per million output tokens. DeepSeek
FrugalGPT reported cost reductions of up to 98% while matching GPT-4 quality on selected benchmark tasks through model cascades. Stanford University
Epoch AI estimated frontier training costs grew about 2.4-fold annually since 2016 and could exceed $1 billion before 2030 if the trend persisted. Epoch AI
OpenAI reported average voice response times of 5.4 seconds for GPT-4, 2.8 for GPT-3.5 and 0.32 for GPT-4o. OpenAI
Google expanded Gemini 1.5 Pro's advertised context from 128,000 to 1 million and then 2 million tokens during 2024. Google
Google reported over 99% retrieval at 1 million tokens in selected text, video and audio needle-in-a-haystack evaluations. Google DeepMind
DeepSeek reported 2.8 million H800 GPU-hours for V2 and estimated 30.8 million H800-equivalent hours for Meta's unfinished Llama 3 400B training. DeepSeek AI
The vLLM paper reported up to 24 times Hugging Face Transformers throughput and 3.5 times FasterTransformer throughput in selected serving experiments. University of California, Berkeley
The IEA reported roughly 460 TWh of 2022 data-center electricity use and projected more than 1,000 TWh for 2026, with AI only one contributor. International Energy Agency
Artificial Analysis ranked DeepSeek-V2-Chat 43rd among 44 models, with an Intelligence Index score of 4. artificialanalysis.ai
The argument
GPT-4o launched with input pricing down from $30 to $5 per million tokens and reported voice latency down from 5.4 to 0.32 seconds.
Claude 3.5 Sonnet reached 33.4% in Anthropic's SWE-bench setup while retaining the former Sonnet price tier.
Gemini 1.5 Pro expanded its advertised context from 128,000 to 2 million tokens during 2024.
Downloadable models exchanged token fees for infrastructure, licenses and serving efficiency.
Scores varied sharply across broad knowledge, science, mathematics and coding.
FrugalGPT reported up to 98% lower cost on selected tasks, while vLLM reached up to 24 times a serving baseline.
Stanford estimated training compute at $3.3 million for Llama 2 70B, $78 million for GPT-4 and $191 million for Gemini Ultra.
The practical choice is the system that completes each task reliably at the lowest total cost.
This research is published in English and Spanish. Ver en español
La investigación detrás de esta presentación
La carrera de modelos de 2024 redujo precios, latencia y costos de servicio mientras amplió contexto y capacidad. Pero ninguna prueba coronó un ganador universal, y grandes ahorros vinieron del enrutamiento y la infraestructura.
Hallazgos clave
La página de API de DeepSeek-V2 en 2024 publicó aproximadamente US$0,14 por millón de tokens de entrada sin caché y US$0,28 por millón de salida. DeepSeek
FrugalGPT reportó reducciones de costo de hasta 98% manteniendo calidad de GPT-4 en tareas seleccionadas mediante cascadas de modelos. Stanford University
Epoch AI estimó que los costos de entrenamiento de frontera crecieron unas 2,4 veces al año desde 2016 y podrían superar US$1.000 millones antes de 2030. Epoch AI
OpenAI reportó tiempos promedio de voz de 5,4 segundos para GPT-4, 2,8 para GPT-3.5 y 0,32 para GPT-4o. OpenAI
Google amplió durante 2024 el contexto anunciado de Gemini 1.5 Pro desde 128.000 hasta 1 millón y después 2 millones de tokens. Google
Google reportó más de 99% de recuperación con 1 millón de tokens en evaluaciones seleccionadas de aguja en un pajar para texto, video y audio. Google DeepMind
DeepSeek reportó 2,8 millones de horas H800 para V2 y estimó 30,8 millones de horas equivalentes para el entrenamiento inconcluso de Llama 3 400B. DeepSeek AI
El artículo de vLLM reportó hasta 24 veces el rendimiento de Hugging Face Transformers y 3,5 veces el de FasterTransformer en experimentos seleccionados. University of California, Berkeley
La AIE reportó unos 460 TWh de electricidad para centros de datos en 2022 y proyectó más de 1.000 TWh para 2026, siendo la IA solamente un factor. International Energy Agency
Artificial Analysis ubicó a DeepSeek-V2-Chat en el puesto 43 de 44 modelos, con una puntuación de 4 en su Intelligence Index. artificialanalysis.ai
El argumento
GPT-4o se lanzó con un precio de entrada que bajó de US$30 a US$5 por millón de tokens y una latencia de voz reportada que cayó de 5,4 a 0,32 segundos.
Claude 3.5 Sonnet alcanzó 33,4% en la configuración SWE-bench de Anthropic y mantuvo el nivel de precio del Sonnet anterior.
Gemini 1.5 Pro amplió su contexto anunciado de 128.000 a 2 millones de tokens durante 2024.
Los modelos descargables cambiaron tarifas por token por infraestructura, licencias y eficiencia de servicio.
Las puntuaciones variaron mucho entre conocimiento general, ciencia, matemáticas y programación.
FrugalGPT reportó hasta 98% menos costo en tareas seleccionadas, mientras vLLM alcanzó hasta 24 veces una referencia de servicio.
Stanford estimó el cómputo de entrenamiento en US$3,3 millones para Llama 2 70B, US$78 millones para GPT-4 y US$191 millones para Gemini Ultra.
La opción práctica es el sistema que completa cada tarea de forma fiable al menor costo total.
Esta investigación se publica en inglés y español. Read in English