AI agents work best with boundariesLos agentes de IA funcionan mejor con límites · V7
32 slides · 24 min · 2026-08-04language
ENES
theme
LightDark
view
DeckTableTalk
brand
HanademiPlatzi
The measured speed gain is large, but the experiment covered one bounded task.
AI can accelerate the wrong answer when users misjudge its capability.
Agents add a decision loop around a model.
La mejora medida es grande, pero el experimento cubrió una sola tarea delimitada.
La IA puede acelerar una respuesta incorrecta cuando se juzga mal su capacidad.
Los agentes añaden un ciclo de decisión alrededor de un modelo.
Start with the benefit because it is real. Developers using Copilot finished the defined task in 71.2 minutes, compared with 160.9 minutes for controls. That saved 89.7 minutes. The rest of the deck asks what happens when the task becomes broader, riskier or less testable.
Empecemos por el beneficio porque es real. Los desarrolladores con Copilot terminaron la tarea definida en 71,2 minutos, frente a 160,9 minutos del control. Ahorraron 89,7 minutos. El resto de la presentación pregunta qué ocurre cuando la tarea es más amplia, riesgosa o difícil de evaluar.
A model produces an answer. An agent adds observation, decisions, tools and repeated evaluation. ReAct is one way to organize that loop. Context and prompt injection matter because more information and more permissions create both capability and risk.
Un modelo produce una respuesta. Un agente añade observación, decisiones, herramientas y evaluación repetida. ReAct es una forma de organizar ese ciclo. El contexto y la inyección de prompts importan porque más información y permisos crean capacidad y riesgo.
An agent must do more than answer. It has to find information, use tools and keep track of a goal. GAIA reported about 92% for humans and about 15% for its strongest evaluated GPT-4-based assistant. That gap is the foundation for every design choice that follows.
Un agente debe hacer más que responder. Tiene que encontrar información, usar herramientas y seguir un objetivo. GAIA informó cerca de 92% para humanos y 15% para su asistente evaluado más fuerte basado en GPT-4. Esa brecha sustenta cada decisión de diseño que sigue.
ReAct behaves like navigating while checking signs after every turn. That feedback can help, but every loop adds work. One cycle needs at least 2 stages, while 5 cycles need at least 10. Agent depth should therefore be earned by the task, not added by default.
ReAct se parece a navegar comprobando señales después de cada giro. Esa retroalimentación puede ayudar, pero cada ciclo añade trabajo. Un ciclo necesita al menos 2 etapas y 5 ciclos requieren al menos 10. La profundidad del agente debe justificarse por la tarea.
This was not merely a speed effect. In a 453-person experiment, ChatGPT reduced writing time by 40% while evaluated quality increased by 18%. The result shows why bounded knowledge work is an attractive starting point. The task and evaluation method still define where the finding applies.
No fue solo un efecto de velocidad. En un experimento con 453 personas, ChatGPT redujo 40% el tiempo de redacción mientras la calidad evaluada aumentó 18%. El resultado explica por qué el trabajo intelectual delimitado es un buen punto de partida. La tarea y la evaluación definen dónde aplica.
The productivity story extends beyond software and casual writing. Randomized GPT-4o access at the National Bank of Slovakia improved output quality by up to 44% and reduced completion time by 21%. The key is assistance inside a controlled institution, not unsupervised authority.
La historia de productividad va más allá del software y la redacción casual. El acceso aleatorio a GPT-4o en el Banco Nacional de Eslovaquia mejoró hasta 44% la calidad y redujo 21% el tiempo de ejecución. La clave es asistencia dentro de una institución controlada, no autoridad sin supervisión.
The average productivity gain was 14%, but novices gained about 34%. The most experienced workers saw minimal gains. This suggests that assistance can spread practices already held by stronger workers. It also means the value of a tool depends heavily on who uses it.
La mejora promedio fue 14%, pero los novatos ganaron cerca de 34%. Los trabajadores más experimentados obtuvieron beneficios mínimos. Esto sugiere que la asistencia puede difundir prácticas que ya dominan los trabajadores fuertes. El valor depende mucho de quién usa la herramienta.
Inside the technology frontier, consultants completed 12.2% more tasks and worked 25.1% faster. Outside it, they were 19 percentage points less likely to solve the task correctly. This is the central operating risk. Speed is valuable only when the system can detect which corridor it is in.
Dentro de la frontera tecnológica, los consultores completaron 12,2% más tareas y trabajaron 25,1% más rápido. Fuera de ella, tuvieron 19 puntos porcentuales menos de probabilidad de responder correctamente. Este es el riesgo operativo central. La velocidad vale cuando el sistema detecta en qué corredor está.
A randomized trial and a 14-week Los Angeles pilot tested a generative assistant for public-benefit caseworkers. Average accuracy improved by 40%. The tool helped workers navigate a difficult body of rules. It supported accountable staff rather than replacing their authority.
Un ensayo aleatorizado y un piloto de 14 semanas en Los Ángeles probaron un asistente generativo para gestores de beneficios. La precisión promedio mejoró 40%. La herramienta ayudó a navegar un conjunto complejo de reglas. Apoyó a personal responsable en vez de reemplazar su autoridad.
The experience data support the experimental speed result. In GitHub's survey, 96% said repetitive work was faster, 88% felt more productive and 74% focused on more satisfying work. These are self-reported perceptions, but they show where assistance feels valuable to users.
Los datos de experiencia respaldan el resultado experimental de velocidad. En la encuesta de GitHub, 96% dijo que el trabajo repetitivo fue más rápido, 88% se sintió más productivo y 74% se concentró en trabajo más satisfactorio. Son percepciones autoinformadas, pero muestran dónde la asistencia aporta valor.
A UK cross-government trial translated coding-assistant use into an annual estimate. Each participating developer saved the equivalent of 28 working days. That is enough to reshape delivery capacity if the saved time becomes useful output. The estimate still depends on how recorded time savings translate into a full year.
Un ensayo transversal del gobierno británico convirtió el uso de asistentes de programación en una estimación anual. Cada desarrollador participante ahorró el equivalente a 28 días laborales. Eso puede cambiar la capacidad de entrega si el tiempo liberado se convierte en resultados útiles. La cifra depende de cómo se anualicen los ahorros observados.
One attempt produced a reported 28.8% pass rate. Allowing 10 attempts raised it to 46.8%, and 100 attempts raised it to 72.3%. The capability was real, but repeated generation and testing carried much of the result. Without a trustworthy evaluator, more drafts can simply multiply uncertainty.
Un intento produjo una tasa informada de 28,8%. Permitir 10 intentos la elevó a 46,8% y 100 intentos a 72,3%. La capacidad era real, pero la generación repetida y las pruebas sostuvieron gran parte del resultado. Sin un evaluador confiable, más borradores pueden multiplicar la incertidumbre.
Context windows grew by orders of magnitude across major model families. Claude reached 200,000 tokens, GPT reached 128,000 and Gemini reached 2 million in the cited releases. A larger desk can hold more documents. It still does not guarantee that the model will find the right page or act correctly on it.
Las ventanas de contexto crecieron por órdenes de magnitud en grandes familias de modelos. Claude llegó a 200.000 tokens, GPT a 128.000 y Gemini a 2 millones en las versiones citadas. Un escritorio mayor puede contener más documentos. No garantiza que el modelo encuentre la página correcta ni actúe bien.
Gemini Ultra was reported at 90.0% and GPT-4 at 86.4% on MMLU. The comparison looks decisive until the evaluation procedures are examined. Different prompting methods weaken the direct comparison. More importantly, high exam scores do not establish reliable autonomous execution.
Gemini Ultra fue informado con 90,0% y GPT-4 con 86,4% en MMLU. La comparación parece decisiva hasta revisar los procedimientos. Métodos de prompting distintos debilitan la comparación directa. Además, puntuaciones académicas altas no establecen una ejecución autónoma confiable.
Meta expanded its largest Llama release from 65 billion parameters to 405 billion. Downloadable weights can offer more deployment control than a closed service. That control comes with responsibilities for infrastructure, security and licensing. Llama 3.1 requires additional permission above 700 million monthly active users.
Meta amplió su mayor lanzamiento de Llama de 65.000 millones a 405.000 millones de parámetros. Los pesos descargables pueden dar más control que un servicio cerrado. Ese control trae responsabilidades de infraestructura, seguridad y licencia. Llama 3.1 exige permiso adicional por encima de 700 millones de usuarios activos mensuales.
Reported weekly use rose from 100 million to 300 million in 13 months. A complex technology reached mass audiences through a simple conversation interface. That scale multiplies both useful assistance and confidently wrong output. Verification cannot remain an expert-only practice.
El uso semanal informado creció de 100 millones a 300 millones en 13 meses. Una tecnología compleja llegó a audiencias masivas mediante una interfaz conversacional sencilla. Esa escala multiplica tanto la asistencia útil como las respuestas incorrectas y seguras. Verificar ya no es una tarea exclusiva de expertos.
Laboratory capability is only one part of deployment. A University of Texas review reported about $62.1 million spent on MD Anderson's Oncology Expert Advisor before the project was placed on hold. Integration, procurement and operating rules can dominate the outcome. A powerful engine cannot compensate for incompatible roads.
La capacidad de laboratorio es solo una parte del despliegue. Una revisión de la Universidad de Texas informó cerca de US$62,1 millones gastados en Oncology Expert Advisor antes de suspender el proyecto. La integración, la contratación y las reglas operativas pueden dominar el resultado. Un motor potente no compensa carreteras incompatibles.
The reported gap is not a small error rate. Humans achieved 72.4% success, while the strongest evaluated GPT-4V-based agent achieved 12.2%. That makes broad permissions hard to justify. Capability limits and permission limits should be designed together.
La brecha informada no es una tasa pequeña de error. Los humanos lograron 72,4% de éxito y el agente evaluado más fuerte con GPT-4V obtuvo 12,2%. Eso dificulta justificar permisos amplios. Los límites de capacidad y permisos deben diseñarse juntos.
Prompt injection ranked first in OWASP's 2023 list, ahead of insecure output handling and training-data poisoning. A chatbot can produce a bad sentence. An agent with tools can turn a bad instruction into an action. Least privilege, logging and approval gates are therefore product features, not paperwork.
La inyección de prompts ocupó el primer lugar en la lista de OWASP de 2023, por delante del manejo inseguro de salidas y el envenenamiento de datos. Un chatbot puede producir una frase incorrecta. Un agente con herramientas puede convertir una instrucción incorrecta en una acción. El privilegio mínimo, los registros y las aprobaciones son funciones del producto.
Three agents debating for three rounds produce at least 9 responses instead of one. That can create specialization or disagreement. It also multiplies computation and coordination. If every agent shares the same model and blind spots, the extra voices may not provide independent verification.
Tres agentes debatiendo durante tres rondas producen al menos 9 respuestas en vez de una. Eso puede crear especialización o desacuerdo. También multiplica el cómputo y la coordinación. Si todos comparten el mismo modelo y puntos ciegos, las voces adicionales pueden no aportar verificación independiente.
The evidence supports using AI, but not treating fluency, scale or a single productivity result as reliability. Start with bounded tasks, test outcomes, restrict permissions and expand autonomy only when measured performance justifies it.
La evidencia respalda el uso de IA, pero no confundir fluidez, escala ni un solo resultado de productividad con confiabilidad. Empiece con tareas delimitadas, evalúe resultados, restrinja permisos y amplíe la autonomía solo cuando el desempeño medido lo justifique.
GPT grew from 2,048 to 128,000 tokens and Gemini from 32,000 to two million, both 62.5-fold. Claude's move from about 9,000 to 200,000 tokens equals 22.2-fold.
GPT pasó de 2.048 a 128.000 tokens y Gemini de 32.000 a dos millones, ambos 62,5 veces. El avance de Claude desde cerca de 9.000 hasta 200.000 tokens equivale a 22,2 veces.
Dentro de un intervalo de mejora de velocidad del 21% al 40%, los resultados medidos van desde un aumento de calidad del 44% hasta una penalización de 19 puntos en corrección fuera de la frontera de tareas.
The observed time advantage falls from 55.8% to 26.2% under this stress test. It assumes independent reruns, a secure control output and transfer of the security-study rate.
La ventaja de tiempo observada cae del 55,8% al 26,2% bajo esta prueba de tensión. Supone repeticiones independientes, una salida de control segura y la transferencia de la tasa del estudio de seguridad.
Las puntuaciones de tareas de los agentes equivalen solo al 14,1% o 17,4% de la referencia MMLU. Las proporciones son un índice de transferencia, no una conversión directa entre evaluaciones.
Prompt structure accounts for 50% of the combined checklist. Retrieval, protected execution, evaluation and permission architecture make up the other half.
La estructura del prompt representa el 50% de la lista combinada. La recuperación, la ejecución protegida, la evaluación y la arquitectura de permisos forman la otra mitad.
At the observed rate, the Singapore officer base would generate 390,000 questions over 18 months, or about 21,700 per month. This is a scale counterfactual across different public services.
Con la tasa observada, la base de funcionarios de Singapur generaría 390.000 preguntas en 18 meses, cerca de 21.700 al mes. Es un contrafactual de escala entre servicios públicos distintos.
The measured speed gain is large, but the experiment covered one bounded task. Agents add a decision loop around a model.
Key findings
Consultants using GPT-4 completed 12.2% more tasks and worked 25.1% faster, but were 19 percentage points less likely to solve an outside-frontier task correctly. Harvard Business School
Researchers estimated that Pakistan’s JudgeGPT trial generated $38.50 in savings for every dollar spent. venturepost.co
A University of Texas review reported approximately $62.1 million spent on MD Anderson's Oncology Expert Advisor before the project was placed on hold. University of Texas System
Google increased advertised Gemini context from 32,000 tokens in Gemini 1.0 Pro to one million and later two million in Gemini 1.5 Pro. Google
A field study of 5,179 support agents found AI increased resolved issues per hour by 14% on average and about 34% among novices. National Bureau of Economic Research
OSWorld reported 12.2% success for its strongest GPT-4V-based agent and 72.4% for humans across real computer tasks. Neural Information Processing Systems
Pakistan’s JudgeGPT experiment randomized 1,559 judges across 118 courts into targeted-training, generic-training-with-AI and generic-training-without-AI arms. elliottash.com
In a randomized coding experiment, developers with GitHub Copilot completed a defined JavaScript task 55.8% faster than controls. GitHub
Published Watson for Oncology concordance estimates varied from roughly 21% to above 90% across hospitals, cancers and definitions. Journal of Clinical Oncology
The argument
Fluent answers are not the same as reliable goal completion.
More chances to correct course also mean more latency, cost and failure points.
On suitable writing tasks, speed and quality improved together.
Even regulated knowledge work can improve when the task stays bounded.
AI spread useful practices most strongly to less experienced workers.
AI can accelerate the wrong answer when users misjudge its capability.
This research is published in English and Spanish. Ver en español
La investigación detrás de esta presentación
La mejora medida es grande, pero el experimento cubrió una sola tarea delimitada. Los agentes añaden un ciclo de decisión alrededor de un modelo.
Hallazgos clave
Consultores con GPT-4 completaron 12,2% más tareas y trabajaron 25,1% más rápido, pero tuvieron 19 puntos porcentuales menos de probabilidad de resolver correctamente una tarea externa. Harvard Business School
Los investigadores estimaron que el ensayo de JudgeGPT en Pakistán generó US$38,50 en ahorros por cada dólar invertido. venturepost.co
Una revisión de la Universidad de Texas informó aproximadamente 62,1 millones de dólares gastados en Oncology Expert Advisor antes de suspender el proyecto. University of Texas System
Google aumentó el contexto anunciado desde 32.000 tokens en Gemini 1.0 Pro hasta un millón y posteriormente dos millones en Gemini 1.5 Pro. Google
Un estudio de campo con 5.179 agentes de soporte encontró que la IA aumentó 14% los casos resueltos por hora y cerca de 34% entre novatos. National Bureau of Economic Research
OSWorld informó 12,2% de éxito para su agente más fuerte basado en GPT-4V y 72,4% para humanos en tareas informáticas reales. Neural Information Processing Systems
El experimento JudgeGPT de Pakistán asignó aleatoriamente a 1.559 jueces de 118 tribunales a tres grupos con distintas combinaciones de IA y capacitación. elliottash.com
En un experimento aleatorizado, los desarrolladores con GitHub Copilot completaron una tarea definida de JavaScript 55,8% más rápido que el grupo de control. GitHub
Las estimaciones publicadas de concordancia de Watson for Oncology variaron desde aproximadamente 21% hasta más de 90% según hospitales, cánceres y definiciones. Journal of Clinical Oncology
El argumento
Las respuestas fluidas no equivalen a completar objetivos de forma confiable.
Más oportunidades para corregir también implican más latencia, costo y puntos de fallo.
En tareas de redacción adecuadas, velocidad y calidad mejoraron juntas.
Incluso el trabajo regulado puede mejorar cuando la tarea permanece delimitada.
La IA difundió prácticas útiles con mayor fuerza entre trabajadores menos experimentados.
La IA puede acelerar una respuesta incorrecta cuando se juzga mal su capacidad.
Esta investigación se publica en inglés y español. Read in English