AI helps until it doesn'tLa IA ayuda hasta que deja de hacerlo · V7
25 slides · 13 min · 2026-08-11language
ENES
theme
LightDark
view
TalkTable
brand
HanademiPlatzi
AI fluency does not prove understanding, truth, or sound judgment.
Within compatible tasks, GPT-4 raised average quality by roughly 40%.
The best tool is the one that passes an internal test with acceptable risks and costs.
La fluidez de una IA no demuestra comprensión, verdad ni buen juicio.
Dentro de tareas compatibles, GPT-4 elevó aproximadamente 40% la calidad promedio.
La mejor herramienta es la que supera una prueba interna con riesgos y costos aceptables.
This experiment tracked 758 consultants on real knowledge work tasks. Within the evaluated boundary, they completed more work, moved faster, and raised quality by roughly 40%. The opportunity is large, but depends on recognizing where the tool works.
Este experimento siguió a 758 consultores en tareas reales de conocimiento. Dentro de la frontera evaluada, hicieron más trabajo, avanzaron más rápido y elevaron cerca de 40% la calidad. La oportunidad es grande, pero depende de reconocer dónde funciona la herramienta.
These words appear throughout the module. A model is the engine, while a tool adds interface, data, permissions, and integrations. Benchmarks help compare, but never represent all real work.
Estas palabras aparecen durante todo el módulo. Un modelo es el motor, mientras una herramienta agrega interfaz, datos, permisos e integraciones. Los benchmarks ayudan a comparar, pero nunca representan todo el trabajo real.
The jump in HumanEval shows how much models improved at generating code in short time. Still, this exam measures a narrow capability. A fluent response can still be false, incomplete, or wrong for the situation.
El salto en HumanEval muestra cuánto mejoraron los modelos para generar código en poco tiempo. Aun así, este examen mide una capacidad estrecha. Una respuesta fluida puede seguir siendo falsa, incompleta o inadecuada para la situación.
The same tool that accelerated work produced the opposite effect on a task outside its boundary. Participants relied on a capability that did not fit the problem. The risk is not only that AI fails, but that it advances a wrong answer faster.
La misma herramienta que aceleró el trabajo produjo el efecto contrario en una tarea fuera de su frontera. Los participantes confiaron en una capacidad que no encajaba con el problema. El riesgo no es solo que la IA falle, sino que haga avanzar más rápido una respuesta equivocada.
The cost of GPT engine input fell from USD 30 to USD 5 per million tokens. That did not make the price of applications presenting it to the user disappear. A tool can maintain its brand, change the internal model, and charge for permissions, continuity, and integration.
El costo de entrada del motor GPT cayó de USD 30 a USD 5 por millón de tokens. Eso no hizo desaparecer el precio de las aplicaciones que lo presentan al usuario. Una herramienta puede mantener su marca, cambiar el modelo interno y cobrar por permisos, continuidad e integración.
OpenAI and Microsoft sharing a stage reinforces why model providers, product brands, and workplace tools must be distinguished.
OpenAI y Microsoft compartiendo un escenario refuerzan por qué debemos distinguir proveedores de modelos, marcas de productos y herramientas de trabajo.
Under the reported saving, a $25 labor hour loses about $173 annually, a $50 hour barely clears the cost, and a $100 hour produces $390 before implementation and review costs.
Con el ahorro reportado, una hora laboral de US$25 pierde cerca de US$173 al año, una de US$50 apenas supera el costo y una de US$100 produce US$390 antes de costos de implantación y revisión.
ChatGPT grew from 200 to 300 million weekly users reported in just four months. That scale enables learning, support, and recognition within teams. However, the free plan maintains variable limits and does not guarantee continuous capacity for intensive work.
ChatGPT creció de 200 a 300 millones de usuarios semanales reportados en solo cuatro meses. Esa escala facilita aprendizaje, soporte y reconocimiento dentro de los equipos. Sin embargo, el plan gratuito mantiene límites variables y no garantiza capacidad continua para trabajo intensivo.
A familiar phone screen helps turn an abstract AI category into a recognizable product touchpoint.
La pantalla familiar de un teléfono ayuda a convertir una categoría abstracta de IA en un punto de contacto reconocible.
A tool's experience depends on more than text quality. GPT-4o reduced the reported average voice response time from 2.8 seconds to 320 milliseconds. That difference changes how it feels to use the product, though it does not demonstrate greater accuracy.
La experiencia de una herramienta depende de más que la calidad del texto. GPT-4o redujo el promedio reportado de respuesta de voz desde 2,8 segundos hasta 320 milisegundos. Esa diferencia cambia cómo se siente usar el producto, aunque no demuestra mayor exactitud.
Haiku, Sonnet, and Opus belong to the same family but achieved different results. Opus led both MMLU and GPQA in the figures published by Anthropic. Choosing the brand without specifying the model leaves out an important difference.
Haiku, Sonnet y Opus pertenecen a la misma familia, pero obtuvieron resultados distintos. Opus lideró tanto MMLU como GPQA en las cifras publicadas por Anthropic. Elegir la marca sin especificar el modelo deja fuera una diferencia importante.
Opus obtiene mejores resultados en ambas pruebas y reduce la brecha a 36,4 puntos, mientras la brecha de Haiku llega a 41,9 puntos pese a tener la misma capacidad de contexto.
Anthropic announced the same nominal window of 200,000 tokens for all three Claude 3 models. That capacity allows inputting extensive documents or multiple sources. However, admitting text does not mean remembering, interpreting, or prioritizing each part with equal quality.
Anthropic anunció la misma ventana nominal de 200.000 tokens para los tres modelos Claude 3. Esa capacidad permite introducir documentos extensos o varias fuentes. Sin embargo, admitir el texto no significa recordar, interpretar o priorizar cada parte con la misma calidad.
The Gemini family spans models designed for different needs. On MMLU, Google reported a wide gap between Nano and Ultra. That's why asking whether a task works with Gemini is not enough; you must identify the model, plan, and limits.
La familia Gemini abarca modelos diseñados para necesidades distintas. En MMLU, Google reportó una distancia amplia entre Nano y Ultra. Por eso, preguntar si una tarea funciona con Gemini no basta; hay que identificar modelo, plan y límites.
Google significantly expanded the amount of information that some Gemini variants could receive. The nominal jump was from 32,000 to 2 million tokens. That figure should be read alongside the version and plan, because the brand does not define a single experience.
Google amplió fuertemente la cantidad de información que algunas variantes de Gemini podían recibir. El salto nominal fue desde 32.000 hasta 2 millones de tokens. Esa cifra debe leerse junto con la versión y el plan, porque la marca no define una experiencia única.
Early users expressed favorable signals about productivity, quality, and desire to keep Copilot. In Microsoft-sponsored tests, another average result indicated tasks completed 29% faster. These are useful signals to form a hypothesis, not a guarantee for each process.
Los primeros usuarios expresaron señales favorables sobre productividad, calidad y deseo de conservar Copilot. En pruebas patrocinadas por Microsoft, otro resultado promedio indicó tareas completadas 29% más rápido. Son señales útiles para formular una hipótesis, no una garantía para cada proceso.
The Tow Center examined 8 AI search engines, 200 news fragments, and 1,600 responses. Over 60% of citations were incorrect. These tools can accelerate discovery, but a visible link does not prove the source backs the answer.
El Tow Center examinó 8 buscadores con IA, 200 fragmentos periodísticos y 1.600 respuestas. Más de 60% de las citas fueron incorrectas. Estas herramientas pueden acelerar el descubrimiento, pero el enlace visible no demuestra que la fuente respalde la respuesta.
The test found weak results across all products tested, though with wide differences. Perplexity registered approximately 37%, ChatGPT Search 67%, and Grok 94% incorrect responses. These figures should be read as a specific test, not as a permanent ranking.
La prueba encontró resultados débiles en todos los productos señalados, aunque con diferencias amplias. Perplexity registró cerca de 37%, ChatGPT Search 67% y Grok 94% de respuestas incorrectas. Estas cifras deben leerse como una prueba concreta, no como un ranking permanente.
The research commissioned by Google reported 105 minutes of average weekly savings and favorable quality signals. Those results help design a test, but the provider also has commercial interest in the outcome. The decision should be supported by your own tasks and data.
La investigación encargada por Google reportó 105 minutos semanales de ahorro promedio y señales favorables de calidad. Esos resultados ayudan a diseñar una prueba, pero el proveedor también tiene interés comercial en el resultado. La decisión debe apoyarse en tareas y datos propios.
A personal subscription looks small until multiplied across your entire team. At USD 20 monthly, 100 people cost USD 24,000 per year before taxes. The purchase requires a frequent task, measurable savings, and review factored into the calculation.
Una suscripción personal parece pequeña hasta que se multiplica por todo el equipo. A USD 20 mensuales, 100 personas cuestan USD 24.000 al año antes de impuestos. La compra necesita una tarea frecuente, ahorro medible y revisión incluida en el cálculo.
Adoption is already happening even if the organization has not designed it. 78% of those using work AI reported bringing their own tools. The most practical response is to offer an authorized route that competes with the convenience of outside options.
La adopción ya ocurre aunque la organización no la haya diseñado. El 78% de quienes usaban IA laboral declaró llevar herramientas propias. La respuesta más práctica es ofrecer una ruta autorizada que compita con la comodidad de las opciones externas.
Cisco reported that 48% of users had inputted non-public business information into generative tools. The risk appears before evaluating response quality. The first decision must be what information can enter and into which authorized tool.
Cisco reportó que 48% de los usuarios había introducido información empresarial no pública en herramientas generativas. El riesgo aparece antes de evaluar la calidad de la respuesta. La primera decisión debe ser qué información puede entrar y en qué herramienta autorizada.
The decision does not start with a brand or general ranking. It starts with representative tasks and criteria defined before testing. Use four dimensions for the internal test, and treat preference rankings as context rather than a substitute for process evaluation.
La decisión no empieza por una marca ni por un ranking general. Empieza con tareas representativas y criterios definidos antes de probar. Usa cuatro dimensiones en la prueba interna y trata los rankings de preferencia como contexto, no como sustituto de la evaluación del proceso.
AI was most valuable when the task matched its capabilities. A brand, a model, and an application are not the same thing.
Key findings
En una tarea fuera de la frontera, los consultores con IA fueron aproximadamente 19 puntos porcentuales menos propensos a producir la respuesta correcta. Harvard Business School
Google amplió el contexto nominal desde 32.000 tokens en Gemini 1.0 Pro hasta uno y dos millones en variantes de Gemini 1.5. Google
El Tow Center evaluó 1.600 respuestas de ocho buscadores con IA y reportó que más de 60% de sus citas fueron incorrectas. Tow Center for Digital Journalism
En esa prueba, las respuestas incorrectas variaron aproximadamente entre 37% para Perplexity y 94% para Grok; ChatGPT Search registró cerca de 67%. Tow Center for Digital Journalism
En un experimento con 758 consultores, quienes usaron GPT-4 completaron 12,2% más tareas y trabajaron 25,1% más rápido dentro de su frontera. Harvard Business School
En una encuesta de 2024, 78% de quienes usaban IA laboral llevaba herramientas propias no proporcionadas formalmente por su organización. Microsoft and LinkedIn
Cisco reportó que 48% de usuarios había introducido información empresarial no pública en herramientas generativas; el desglose por tipo de dato requiere verificación. Cisco
El precio de entrada de API cayó de 30 dólares en GPT-4 a 10 en GPT-4 Turbo y 5 en GPT-4o por millón de tokens. OpenAI
OpenAI informó que ChatGPT pasó de 200 millones de usuarios semanales en agosto a 300 millones en diciembre de 2024. Reuters
OpenAI reportó para GPT-4o respuestas de audio desde 232 milisegundos y un promedio de 320, frente a 2,8 segundos del sistema de voz anterior. OpenAI
Una investigación encargada por Google reportó que usuarios de Gemini para Workspace ahorraban en promedio 105 minutos semanales. Google Workspace
The argument
Capacity advanced fast, but a code test does not measure judgment.
With AI, consultants were 19 percentage points less likely to get it right.
The model is a component; the tool charges for access, features, and integration.
Adoption explains its generalist presence, not superiority in every task.
The shorter wait made voice conversation a more natural interaction.
Sharing the Claude brand does not mean sharing the same capability.
This research is published in English and Spanish. Ver en español
La investigación detrás de esta presentación
La IA fue más valiosa cuando la tarea coincidía con sus capacidades. Una marca, un modelo y una aplicación no son lo mismo.
Hallazgos clave
En una tarea fuera de la frontera, los consultores con IA fueron aproximadamente 19 puntos porcentuales menos propensos a producir la respuesta correcta. Harvard Business School
Google amplió el contexto nominal desde 32.000 tokens en Gemini 1.0 Pro hasta uno y dos millones en variantes de Gemini 1.5. Google
El Tow Center evaluó 1.600 respuestas de ocho buscadores con IA y reportó que más de 60% de sus citas fueron incorrectas. Tow Center for Digital Journalism
En esa prueba, las respuestas incorrectas variaron aproximadamente entre 37% para Perplexity y 94% para Grok; ChatGPT Search registró cerca de 67%. Tow Center for Digital Journalism
En un experimento con 758 consultores, quienes usaron GPT-4 completaron 12,2% más tareas y trabajaron 25,1% más rápido dentro de su frontera. Harvard Business School
En una encuesta de 2024, 78% de quienes usaban IA laboral llevaba herramientas propias no proporcionadas formalmente por su organización. Microsoft and LinkedIn
Cisco reportó que 48% de usuarios había introducido información empresarial no pública en herramientas generativas; el desglose por tipo de dato requiere verificación. Cisco