AI works best with human approvalLa IA funciona mejor con permiso humano · V8.2 Master Engine
59 slides · 22 min · 2 hours ago59 láminas · 22 min · hace 2 hlanguage
ENES
theme
LightDark
view
TalkTable
brand
HanademiPlatzi
AI can raise performance, but unreliable shared memory and inflated non-randomized advertising estimates make human approval and causal testing necessary before customer decisions are executed.
A 2025 review of 35 studies found that explanations may increase acceptability without improving accuracy.
Trust in AI can shut down the critical review a checkpoint needs.
La IA puede elevar el desempeño, pero la memoria compartida poco fiable y las estimaciones publicitarias infladas sin aleatorización hacen necesarias la aprobación humana y las pruebas causales antes de ejecutar decisio…
Una revisión de 2025 de 35 estudios halló que las explicaciones pueden aumentar la aceptación sin mejorar la precisión.
La confianza en la IA puede apagar la revisión crítica que el checkpoint necesita.
AI can raise performance, but unreliable shared memory and inflated non-randomized advertising estimates make human approval and causal testing necessary before customer decisions are executed.
La IA puede elevar el desempeño, pero la memoria compartida poco fiable y las estimaciones publicitarias infladas sin aleatorización hacen necesarias la aprobación humana y las pruebas causales antes de ejecutar decisiones sobre clientes.
6 términos técnicos sostienen buena parte del argumento.
The first test is not whether an agent can respond once. It is whether it stays on course when the conversation requires multiple turns. In CRMArena-Pro, success falls from 58% to 35%, a drop that makes replacing the responsible team dangerous.
La primera prueba no es si un agente puede responder una vez. Es si mantiene el rumbo cuando la conversación exige varios turnos. En CRMArena-Pro, el éxito pasa de 58% a 35%, una caída que vuelve peligrosa la sustitución del equipo responsable.
This is the frontier that matters for approving decisions. Within it, AI enabled consultants to complete 12.2% more tasks and work 25.1% faster. Outside it, the effect reversed: the probability of getting the answer right fell by 19 percentage points.
Aquí aparece la frontera que importa para aprobar decisiones. Dentro de ella, la IA hizo que los consultores completaran 12,2% más tareas y trabajaran 25,1% más rápido. Fuera de ella, la ayuda cambió de signo: la probabilidad de acertar cayó 19 puntos porcentuales.
The question is not whether one person can work alone. It is whether AI can expand their reach without erasing collaboration. At Procter & Gamble, individuals using AI matched the performance of human teams without AI, and the tool brought solutions closer to other specialties.
La pregunta no es si una persona puede trabajar sola. Es si la IA puede ampliar su alcance sin borrar la colaboración. En Procter & Gamble, individuos con IA igualaron el desempeño de equipos humanos sin IA, y la herramienta acercó las soluciones a otras especialidades.
Human oversight can become automatic obedience. In this review, erroneous automated advice was associated with a 26% higher risk of an incorrect decision.
La supervisión humana puede convertirse en obediencia automática. En esta revisión, el consejo automatizado erróneo se asoció con un 26% más de riesgo de una decisión incorrecta.
An explanation is not the same as a protective checkpoint. Across 35 studies, explanations could increase acceptance without reliably improving accuracy.
Una explicación no equivale a un checkpoint protector. En 35 estudios, las explicaciones podían aumentar la aceptación sin mejorar de forma fiable la precisión.
A checkpoint does not work if the person stops looking critically. Across 936 experiences described by 319 workers, greater trust in AI was associated with less critical thinking. Self-confidence showed the opposite relationship, with more review, a clear signal for designing real authority and controls.
Un checkpoint no funciona si la persona deja de mirar críticamente. En 936 experiencias descritas por 319 trabajadores, confiar más en la IA se asoció con menos pensamiento crítico. La confianza propia tuvo la relación opuesta, con más revisión, una señal clara para diseñar autoridad y controles reales.
Oversight does more than protect the organization. It also makes people more comfortable with delegation. Baseline preference was 66%, and allowing participants to monitor and adjust the recommendation added 7 percentage points. Control is part of trust, not a subsequent obstacle.
La supervisión no solo protege a la organización. También hace que las personas acepten mejor la delegación. La preferencia base fue de 66%, y permitir que los participantes vigilaran y ajustaran la recomendación añadió 7 puntos porcentuales. El control es parte de la confianza, no un obstáculo posterior.
Technical integration still lags far behind ambition. Only 6% had fully integrated AI into their workflows. At the same time, 52% said external teams defined data strategy and measurement.
La integración técnica sigue muy por detrás de la ambición. Solo 6% había incorporado plenamente la IA en sus flujos. Al mismo tiempo, 52% dijo que equipos externos definían la estrategia y medición de datos.
Research on long-term interactive memory gives a human face to the challenge of building reliable shared memory.
La investigación sobre memoria interactiva a largo plazo pone rostro humano al desafío de construir una memoria compartida confiable.
Shared memory requires more than storing conversations. In GroupMemBench, the best system reached 46% accuracy. When knowledge changed, accuracy fell to 27.1%, the factor posing the greatest threat to decisions based on outdated context.
La memoria compartida necesita algo más que guardar conversaciones. En GroupMemBench, el mejor sistema alcanzó 46% de exactitud. Cuando el conocimiento cambiaba, la precisión cayó a 27,1%, el punto que más amenaza una decisión basada en contexto viejo.
Memory can also improve operational efficiency. Mem0 reported 26% higher quality and 91% lower p95 latency, along with more than 90% lower token use. The figure is promising, but should be read as a result from its own authors.
La memoria también puede mejorar la eficiencia operativa. Mem0 reportó 26% más calidad y 91% menos latencia p95, además de más de 90% menos tokens. La cifra es prometedora, pero debe leerse como un resultado de sus propios autores.
Mem0 reports a 26% quality gain alongside 91% lower p95 latency and 90% lower token cost than comparison systems. That combination is a strong efficiency story, but its author-reported provenance requires validation before adoption.
Mem0 reporta una mejora de calidad del 26% junto con 91% menos latencia p95 y 90% menos costo de tokens que los sistemas comparadores. Esa combinación presenta una fuerte historia de eficiencia, pero su procedencia, reportada por los autores, exige validación antes de adoptarla.
Adoption can grow without changing the customer experience. Three in four professionals said they used AI, but 84% still ran generic campaigns. The bottleneck appears to be not just the tool, but the ability to turn data into fast decisions.
La adopción puede crecer sin cambiar la experiencia del cliente. Tres de cada cuatro profesionales dijeron usar IA, pero 84% todavía ejecutaba campañas genéricas. El cuello de botella no parece ser solo la herramienta, sino la capacidad de convertir datos en decisiones rápidas.
81% of companies delayed, scaled back, or abandoned at least one AI initiative. Marketing and segmentation led the stalled areas at 41%. The problem appears precisely where data, permissions, and customer decisions must be coordinated.
El 81% de las empresas retrasó, redujo o abandonó alguna iniciativa de IA. Marketing y segmentación encabezaron las áreas estancadas con 41%. El problema aparece justo donde datos, permisos y decisiones de cliente deben coordinarse.
An agent cannot solve a fragmented database on its own. Teams satisfied with data unification responded regularly 42% more often and were 60% more likely to use agents. The relationship is observational, but it points to a clear prerequisite: organizing customer memory.
El agente no resuelve por sí solo una base de datos fragmentada. Los equipos satisfechos con la unificación respondían regularmente 42% más y eran 60% más propensos a usar agentes. La relación es observacional, pero apunta a una condición previa clara: ordenar la memoria del cliente.
The promise of agents rests on a foundation that many organizations do not control well. Only 26% trust their data connectivity, while another 26% trust their data to support AI-generated revenue. In addition, responsibility for strategy and measurement often sits outside the marketing team.
La promesa de agentes se apoya en una base que muchas organizaciones no controlan bien. Solo 26% confía en la conectividad de sus datos y otro 26% confía en que puedan sostener ingresos generados por IA. Además, la responsabilidad de estrategia y medición suele quedar fuera del equipo de marketing.
The average organization manages data across seven sources, yet only 26% report being satisfied with their connectivity. A shared memory must resolve that fragmentation before feeding autonomous decisions.
La organización promedio gestiona datos en siete fuentes, pero solo 26% declara satisfacción con la conectividad. Una memoria compartida debe resolver esa fragmentación antes de alimentar decisiones autónomas.
The strongest signal is execution failure in customer-facing AI. 81% of enterprises stalled at least one AI initiative, including marketing and segmentation at 41%, data monetization at 38%, and personalization at 30%. Separately, 98% of marketers reported personalization barriers. Together, the surveys make the operating constraint visible without claiming that one caused the other.
La señal más fuerte es el fallo de ejecución en la IA orientada al cliente. El 81% de las empresas estancó al menos una iniciativa de IA, incluida personalización con 30%, marketing y segmentación con 41%, y monetización de datos con 38%. Por separado, el 98% de los marketers reportó barreras para personalizar. En conjunto, las encuestas hacen visible la restricción operativa sin afirmar que una causó la otra.
Personalization is where the promise collides with operations. 98% report at least one barrier. Agents cannot fix permissions, data quality, and incomplete processes on their own.
La personalización es el caso donde la promesa y la operación chocan. El 98% reporta al menos una barrera. Los agentes no pueden reparar por sí solos permisos, calidad de datos y procesos incompletos.
This is the limit of attribution based solely on observation. The dataset included 15 experiments, 500 million observations, and 1,600 million impressions. More data did not eliminate bias: observational methods continued to fail against randomized results. To know what caused a sale, the system needs experiments.
Este es el límite de la atribución basada solo en observación. El conjunto incluía 15 experimentos, 500 millones de observaciones y 1.600 millones de impresiones. La cantidad de datos no eliminó el sesgo: los métodos observacionales siguieron fallando frente a los resultados aleatorizados. Para saber qué causó una venta, el sistema necesita experimentos.
The first study compared 15 experiments. The extension expanded the test to 663 campaigns. Non-experimental data still could not reliably reproduce the known causal effect.
El primer estudio comparó 15 experimentos. La extensión llevó la prueba a 663 campañas. Los datos no experimentales siguieron sin reproducir de forma confiable el efecto causal conocido.
La sobreestimación aumenta a medida que el resultado medido se acerca a la compra y alcanza 4,8 veces el efecto aleatorizado en la parte baja del embudo.
The overestimation is not concentrated in one part of the journey. In the upper funnel, DML estimated 83% versus 29% in RCTs; in the lower funnel, 24% versus 5%. The same direction appears at all three stages. If the system learns from that attribution, it may scale an illusion.
La sobreestimación no se concentra en una sola parte del recorrido. En el embudo alto, DML estimó 83% frente a 29% en RCT; en el bajo, 24% frente a 5%. La misma dirección se repite en las tres etapas. Si el sistema aprende de esa atribución, puede escalar una ilusión.
eBay separated observed credit from causal effect. In brand searches, 99.5% of attributed traffic would have arrived anyway. In non-brand searches, the estimated change in purchases was just 0.66% and was not significant.
eBay separó crédito observado de efecto causal. En búsquedas de marca, 99,5% del tráfico atribuido habría llegado de todos modos. En búsquedas no asociadas a la marca, el cambio estimado en compras fue apenas 0,66% y no resultó significativo.
The scale of the purchase was enormous: more than 100 million keywords. Yet much of the spending reached frequent buyers who did not change their behavior. Scaling attribution without measuring incrementality can scale waste.
La escala de compra era enorme: más de 100 millones de palabras clave. Sin embargo, gran parte del gasto alcanzaba a compradores frecuentes que no modificaban su conducta. Escalar atribución sin medir incrementalidad puede escalar desperdicio.
A marketing system cannot treat every attributed conversion as a sale caused by marketing. In half of 15 studies, estimates of the increase in purchases were off by a factor of 3. The 1x line marks accuracy, while the observed value lies three times farther away. That is why incrementality should arbitrate investment decisions.
Un sistema de marketing no puede tratar toda conversión atribuida como una venta causada. En la mitad de 15 estudios, las estimaciones del aumento de compras se desviaron por un factor de 3. La línea de 1x marca la exactitud, y el valor observado queda tres veces más lejos. Por eso la incrementalidad debe arbitrar las decisiones de inversión.
The final barrier is economic: even measuring accurately can cost too much. In 25 experiments that spent US$2.8 million, the median return interval exceeded 100 percentage points. The narrowest interval still exceeded 50%, while common sales variation reached 1,000%. The answer is not an occasional study, but a continuous portfolio of tests.
La última barrera es económica: incluso medir bien puede costar demasiado. En 25 experimentos que gastaron US$2,8 millones, el intervalo mediano de retorno superó 100 puntos porcentuales. El intervalo más estrecho todavía superó 50%, mientras que la variación común de ventas llegó a 1.000%. La respuesta no es un estudio ocasional, sino una cartera continua de pruebas.
The first signal is uncomfortable. More than 80% of the 288 brands had negative marginal ROI, even though overall ROI was positive for one third. These are not complementary percentages: they answer different questions. To decide how much to invest, you need to measure which sales were generated by the additional spend.
La primera señal es incómoda. Más del 80% de las 288 marcas tuvo ROI marginal negativo, aunque el ROI total fue positivo para un tercio. No son porcentajes que se complementen: responden preguntas distintas. Para decidir cuánto invertir, hace falta medir qué ventas produjo el gasto adicional.
Only one third of brands had positive overall ROI. In addition, more than 80% had negative marginal ROI. The difference makes it essential to measure the effect of increasing spend, not just the historical average across all investment.
Solo un tercio de las marcas tuvo ROI total positivo. Además, más de 80% tuvo ROI marginal negativo. La diferencia obliga a medir el efecto de aumentar gasto, no solo el promedio histórico de toda la inversión.
Advertising cannot be understood by looking only at attribution. In one experiment, sales rose 3.6% versus the control. After removing sales that had not been affected, precision increased 31%. Another experiment estimated a total return of 7x the spend, but each figure answers a different question.
La publicidad no se entiende mirando solo atribuciones. En un experimento, las ventas subieron 3,6% frente al control. Al retirar ventas que no habían sido afectadas, la precisión aumentó 31%. Otro experimento estimó un retorno total superior a 7 veces el gasto, pero cada cifra responde una pregunta distinta.
More data does not always mean better measurement. Removing sales that the ads could not affect increased precision by 31%. The result was equivalent to expanding the sample from 3 million to 5.3 million users.
Más datos no siempre significan mejor medición. Al retirar ventas que los anuncios no podían afectar, la precisión aumentó 31%. El resultado equivalió a ampliar la muestra de 3 millones a 5,3 millones de usuarios.
The most common workforce response is not layoffs, but training. 85% of employers plan to train their workforce, compared with 41% that anticipate AI-driven job reductions. Scale matters: the survey represents 14 million workers across 55 economies. Yet 63% identify skills gaps as the primary barrier.
La respuesta laboral más común no es despedir, sino capacitar. El 85% de los empleadores planea formar a su fuerza laboral, frente a 41% que prevé reducir puestos por IA. La escala importa: la encuesta representa 14 millones de trabajadores en 55 economías. Pero 63% identifica las brechas de habilidades como la principal barrera.
Employers expect 39% of skills to change by 2030. They also estimate that 59 out of every 100 workers will need training. Eleven would not receive it, a gap that makes education operational infrastructure.
Los empleadores esperan que 39% de las habilidades cambie hacia 2030. También calculan que 59 de cada 100 trabajadores necesitarán formación. Once no la recibirían, una brecha que convierte la educación en infraestructura operativa.
The labor outlook does not project simple job destruction. It anticipates 170 million new jobs and 92 million displaced jobs. The balance of 78 million makes training and internal mobility as important as automation.
El escenario laboral no proyecta una simple destrucción de empleo. Espera 170 millones de nuevos puestos y 92 millones desplazados. El saldo de 78 millones vuelve la formación y la movilidad internas tan importantes como la automatización.
86% expect AI to transform their business. However, 63% identify skills as the primary barrier, and only 29% expect greater talent availability. The answer is to build internal capability, not wait for the market to provide it.
El 86% espera que la IA transforme su negocio. Sin embargo, 63% identifica las habilidades como la principal barrera y solo 29% espera mayor disponibilidad de talento. La respuesta es formar capacidad interna, no esperar que el mercado la entregue.
The gains were not evenly distributed. Among 5,179 support agents, average productivity rose by 14%, while productivity among new or less-skilled workers increased by 34%. The effect was minimal among experienced workers. The training takeaway is clear: AI can accelerate the learning curve.
La ganancia no se repartió por igual. Entre 5.179 agentes de soporte, la productividad media subió 14%, pero la de trabajadores nuevos o menos calificados aumentó 34%. En los experimentados, el efecto fue mínimo. La lección para la formación es concreta: la IA puede acelerar la curva de aprendizaje.
New or less-skilled workers gained 34%, compared with 14% on average and nearly 0% for experienced workers. The pattern shows that AI benefits were concentrated among newer workers.
Los trabajadores nuevos o menos calificados ganaron 34%, frente a 14% en promedio y casi 0% entre los experimentados. El patrón muestra que los beneficios de la IA se concentraron entre los trabajadores nuevos.
AI does not replace judgment for every task. Consultants who started below average improved 43%, while those above average improved 17%. But when the task fell outside the tool’s frontier, performance worsened. The exact figure varies across publications, from less than 19% to less than 23%, but the direction is the same.
La IA no sustituye el criterio en cualquier tarea. Los consultores que empezaban bajo el promedio mejoraron 43%, y los que estaban sobre el promedio mejoraron 17%. Pero cuando la tarea quedó fuera de la frontera de la herramienta, el desempeño empeoró. La cifra exacta varía entre publicaciones, de menos 19% a menos 23%, pero la dirección es la misma.
The exact figure varies across publications. One reports a 19% lower likelihood of getting the answer right, while the other reports 23% worse performance. The direction is unchanged: outside the frontier, accepting GPT-4’s answer destroyed value.
La cifra exacta cambia entre publicaciones. Una reporta 19% menos probabilidad de acertar y otra 23% peor desempeño. La dirección no cambia: fuera de la frontera, aceptar la respuesta de GPT-4 destruyó valor.
Generative AI adoption rose from 7% to 22.4% across four measurements. Sales productivity attributed to AI also increased, from 5.1% to 14.1%. The pattern is consistent, but it remains an association based on leaders’ responses, not causal evidence.
La adopción de IA generativa pasó de 7% a 22,4% en cuatro mediciones. La productividad comercial atribuida a IA también subió, de 5,1% a 14,1%. El patrón es consistente, pero sigue siendo una asociación basada en respuestas de líderes, no una prueba causal.
El uso de IA superó tres veces el nivel base del índice, mientras la productividad de ventas declarada llegó a 276 y el ahorro declarado de gastos generales a 209.
Reported productivity and savings moved together across four measurements. In 2026, they reached 14.1% and 14.6%. Their proximity strengthens the value hypothesis, but does not show what portion was caused by AI.
Productividad y ahorro reportados avanzaron juntos en cuatro mediciones. En 2026 llegaron a 14,1% y 14,6%. La cercanía fortalece la hipótesis de valor, pero no demuestra qué parte fue causada por la IA.
Leaders attributed a growing reduction in overhead costs to AI. The figure rose from 7% in 2024 to 14.6% in 2026. Because the result is self-reported, it should become a hypothesis for experiments, not causal evidence.
Los líderes atribuyeron a la IA una reducción creciente de costos generales. La cifra pasó de 7% en 2024 a 14,6% en 2026. Como el resultado es autodeclarado, debe convertirse en una hipótesis para experimentos, no en prueba causal.
Leaders reported gains across three outcomes between 2024 and 2025. Cost reduction reached 10.8%, while productivity and satisfaction were around 8.5%. The pattern merits attention, but still depends on self-reported responses.
Los líderes reportaron avances en tres resultados entre 2024 y 2025. La reducción de costos llegó a 10,8%, mientras productividad y satisfacción rondaron 8,5%. El patrón merece atención, pero todavía depende de respuestas autodeclaradas.
The EU AI Act sets general applicability from August 2026 and defers high-risk obligations until 2027 and 2028. The NIST profile turns governance into an operational checklist: 13 risks and more than 400 actions, developed with 2,500 participants. Human oversight needs dates, tasks, and owners, not just a policy.
El Reglamento Europeo de IA fija aplicación general desde agosto de 2026 y aplaza obligaciones de alto riesgo hasta 2027 y 2028. El perfil de NIST convierte la gobernanza en una lista operativa: 13 riesgos y más de 400 acciones, desarrolladas con 2.500 participantes. La supervisión humana necesita fechas, tareas y responsables, no solo una política.
NIST organizes 13 generative AI risks. The profile proposes more than 400 actions and was developed with a public group of 2,500 participants. The scale shows that governing AI requires ongoing work, accountable owners, and records.
NIST organiza 13 riesgos de IA generativa. El perfil propone más de 400 acciones y se desarrolló con un grupo público de 2.500 participantes. La escala muestra que gobernar IA exige trabajo continuo, responsables y registros.
Agent adoption remains low: 13% of marketers used them in the survey. However, 82% of users or prospective users expected improved returns. On the workforce side, 70% of employers plan to hire for new skills, and only 29% expect talent availability to increase. The practical conclusion is to redesign roles and decisions before scaling autonomy.
La adopción de agentes todavía es baja: 13% de marketers los usaba en la encuesta. Sin embargo, 82% de usuarios o interesados esperaba mejorar el retorno. Del lado laboral, 70% de empleadores planea contratar nuevas habilidades y solo 29% espera que aumente la disponibilidad de talento. La conclusión práctica es rediseñar funciones y decisiones antes de escalar autonomía.
Actual adoption remains at 13%. However, 82% of users or prospective users expect improved returns, and 81% trust AI to answer queries. The gap between use and expectations calls for testing before expanding autonomy.
La adopción real sigue en 13%. Sin embargo, 82% de usuarios o interesados espera mejoras de retorno y 81% confía en la IA para responder consultas. La distancia entre uso y expectativa exige pruebas antes de ampliar autonomía.
70% expect to hire for new skills, and 63% to augment workers with technology. 51% expect to redeploy staff, and 41% to reduce headcount. Sustainable transformation combines several organizational decisions, not a single wave of substitution.
El 70% prevé contratar nuevas habilidades y 63% complementar trabajadores con tecnología. El 51% espera trasladar personal y 41% reducirlo. La transformación sostenible mezcla varias decisiones organizacionales, no una sola ola de sustitución.
On single-turn tasks, leading agents achieved approximately 58% success. When interaction extended across multiple turns, success fell to 35%. Decision-making autonomy breaks down when the process requires continuity.
En tareas de un turno, los agentes líderes alcanzaron aproximadamente 58%. Al extender la interacción a varios turnos, el éxito cayó a 35%. La autonomía decisoria se rompe cuando el proceso exige continuidad.
Within the frontier, GPT-4 produced a clear advantage. Participants completed 12.2% more tasks and finished 25.1% faster. The gain supports delegating drafts, not eliminating approval.
Dentro de la frontera, GPT-4 produjo una ventaja clara. Los participantes completaron 12,2% más tareas y terminaron 25,1% más rápido. La ganancia justifica delegar propuestas, no eliminar la aprobación.
The benefit was greater for those who started below average. Their performance improved by 43%, compared with 17% among those who started above average. Education should harness this transfer without mistaking it for universal autonomy.
El beneficio fue mayor para quienes empezaban por debajo del promedio. Su desempeño mejoró 43%, frente a 17% entre quienes empezaban arriba. La educación debe aprovechar esa transferencia sin confundirla con autonomía universal.
Employers plan to build capability before cutting jobs: 85% plan to train workers, 77% to train them for AI, 70% to hire new skills, 63% to expand technology-enabled work, 51% to redeploy internally, and 41% to reduce jobs because of AI. Education must connect business judgment, measurement, and technical literacy.
Los empleadores planean desarrollar capacidades antes de reducir puestos: el 85% capacitará, el 77% formará para IA, el 70% contratará nuevas habilidades, el 63% ampliará el trabajo apoyado por tecnología, el 51% reasignará personal internamente y el 41% reducirá puestos por IA. La educación debe unir criterio comercial, medición y alfabetización técnica.
Within its frontier, AI accelerates work by 25.1%. Outside it, AI reduces the probability of getting the answer right by 19 points. And without experiments, attribution can claim traffic that would have arrived anyway. The operating model must clearly separate proposal, approval, and causal validation.
Dentro de su frontera, la IA acelera el trabajo 25,1%. Fuera de ella, reduce 19 puntos la probabilidad de acertar. Y sin experimentos, la atribución puede reclamar tráfico que habría llegado igual. El modelo operativo debe separar claramente propuesta, aprobación y validación causal.
AI can raise performance, but unreliable shared memory and inflated non-randomized advertising estimates make human approval and causal testing necessary before customer decisions are executed. 6 technical terms carry much of the argument.
Key findings
In eBay’s brand experiment, approximately 99.5% of traffic attributed to ads arrived anyway through organic results. Econometrica
After eBay halted brand-search advertising, 99.5% of traffic that would have arrived through the ads still reached the site through other channels. chicagobooth.edu
Outside the capability frontier, consultants using AI were 19 percentage points less likely to produce the correct answer. Organization Science
In GroupMemBench, the best system reached 46% accuracy; knowledge updating reached 27.1% and terminology ambiguity 37.7%. Microsoft Research
Fifteen Facebook experiments, with 500 million observations and 1,600 million impressions, showed that observational methods failed to measure causality. Marketing Science
An extension to 663 Facebook experiments likewise failed to reliably estimate the causal effect of campaigns using non-experimental data alone. arXiv
eBay suspended non-brand advertising for 60 days in approximately 30% of markets and estimated only a 0.66% change in purchases. Econometrica
In approximately half of Facebook’s purchase experiments, observational estimates deviated from the experimental effect by nearly three times as much. Marketing Science
In 25 experiments that spent US$2.8 million, the median interval for advertising returns was more than 100% wide, and the narrowest exceeded 50%. The Quarterly Journal of Economics
Detecting profitable advertising effects may require more than 10 million person-weeks because of high individual-level variation in sales. The Quarterly Journal of Economics
On GroupMemBench, the strongest memory system reached only 46.0% average accuracy; knowledge-update accuracy was 27.1% and term ambiguity 37.7%. microsoft.com
Across 663 Facebook experiments, median RCT lifts were 29%, 18%, and 5% for upper-, middle-, and lower-funnel outcomes; DML estimates were 83%, 58%, and 24%. ideas.repec.org
The argument
Prolonged business conversations reduce agent success to 35%.
The same AI adds speed within the frontier but subtracts 19 points outside it.
AI does more than speed things up: it can bring individual performance closer to that of a team.
A review of 74 studies found a 26% higher risk of an incorrect human decision after erroneous automated advice.
A 2025 review of 35 studies found that explanations may increase acceptability without improving accuracy.
Trust in AI can shut down the critical review a checkpoint needs.
This research is published in English and Spanish. Ver en español
La investigación detrás de esta presentación
La IA puede elevar el desempeño, pero la memoria compartida poco fiable y las estimaciones publicitarias infladas sin aleatorización hacen necesarias la aprobación humana y las pruebas causales antes de ejecutar decisiones sobre clientes. 6 términos técnicos sostienen buena parte del argumento.
Hallazgos clave
En el experimento de marca de eBay, aproximadamente 99,5% del tráfico acreditado a anuncios llegó igualmente por resultados orgánicos. Econometrica
Después de que eBay suspendiera la publicidad en búsquedas de marca, el 99,5% del tráfico que habría llegado mediante los anuncios siguió llegando al sitio por otros canales. chicagobooth.edu
Fuera de la frontera de capacidad, los consultores con IA fueron 19 puntos porcentuales menos propensos a producir la respuesta correcta. Organization Science
En GroupMemBench, el mejor sistema alcanzó 46% de exactitud; actualización de conocimiento logró 27,1% y ambigüedad terminológica 37,7%. Microsoft Research
Quince experimentos de Facebook, con 500 millones de observaciones y 1.600 millones de impresiones, mostraron que métodos observacionales fallaban al medir causalidad. Marketing Science
Una ampliación a 663 experimentos de Facebook tampoco logró estimar confiablemente el efecto causal de campañas usando solamente datos no experimentales. arXiv
eBay suspendió publicidad no vinculada a marca durante 60 días en cerca de 30% de mercados y estimó apenas 0,66% de cambio en compras. Econometrica
En aproximadamente la mitad de los experimentos de compra de Facebook, estimaciones observacionales se desviaron cerca de tres veces del efecto experimental. Marketing Science
En 25 experimentos que gastaron US$2,8 millones, el intervalo mediano para retorno publicitario superó 100% de ancho y el menor superó 50%. The Quarterly Journal of Economics
Detectar efectos publicitarios rentables puede requerir más de 10 millones de persona-semanas por la alta variabilidad individual de las ventas. The Quarterly Journal of Economics
En GroupMemBench, el sistema de memoria más sólido alcanzó apenas un 46,0% de precisión promedio; la actualización de conocimiento llegó al 27,1% y la ambigüedad terminológica al 37,7%. microsoft.com
En 663 experimentos de Facebook, los incrementos medianos de los RCT fueron de 29%, 18% y 5% para resultados de embudo alto, medio y bajo; las estimaciones DML fueron de 83%, 58% y 24%. ideas.repec.org
El argumento
La IA puede elevar el desempeño, pero la memoria compartida poco fiable y las estimaciones publicitarias infladas sin aleatorización hacen necesarias la aprobación humana y las pruebas causales antes de ejecutar decisio…
La conversación empresarial prolongada reduce el éxito de los agentes a 35%.
La misma IA suma velocidad dentro de la frontera, pero resta 19 puntos fuera de ella.
La IA no solo acelera: puede acercar el desempeño individual al de un equipo.
Una revisión de 74 estudios halló un 26% más de riesgo de una decisión humana incorrecta tras un consejo automatizado erróneo.
Una revisión de 2025 de 35 estudios halló que las explicaciones pueden aumentar la aceptación sin mejorar la precisión.
La confianza en la IA puede apagar la revisión crítica que el checkpoint necesita.
Esta investigación se publica en inglés y español. Read in English