When AI does the homeworkCuando la IA hace la tarea · V7
35 slides · 23 min · 2026-08-07language
ENES
theme
LightDark
view
TalkTable
brand
HanademiPlatzi
The question is not whether AI improves an assignment, but whether the student can still perform alone.
Unrestricted GPT users scored 17% below controls after the assistance disappeared.
Universities should assess reasoning, revision, and verification instead of treating the final answer as sufficient evidence.
La pregunta no es si la IA mejora una tarea, sino si el estudiante todavía puede rendir por sí solo.
Los usuarios de GPT sin restricciones puntuaron un 17% por debajo del control cuando desapareció la ayuda.
Las universidades deben evaluar el razonamiento, la revisión y la verificación en vez de considerar suficiente la respuesta final.
AI assistance is not one treatment. Unrestricted GPT raised practice performance 48%, while a tutor designed to require reasoning raised it 127%. The safeguarded tutor achieved that gain without the significant unaided penalty observed with unrestricted GPT.
La ayuda de IA no es un tratamiento único. GPT sin restricciones elevó el rendimiento práctico un 48%, mientras un tutor diseñado para exigir razonamiento lo elevó un 127%. El tutor protegido logró esa mejora sin la penalización independiente significativa observada con GPT sin restricciones.
4 términos técnicos sostienen buena parte del argumento.
Unrestricted GPT improved assisted work but left students below control when the tool disappeared. Safeguards delivered 2.6 times the practice gain without a significant unaided disadvantage.
GPT sin restricciones mejoró el trabajo asistido, pero dejó a los estudiantes por debajo del grupo de control al desaparecer la herramienta. Las salvaguardas lograron 2,6 veces la mejora práctica sin una desventaja autónoma significativa.
ChatGPT launched about 3 months after a typical August 2022 ninth-grade start. It then progressed from text-focused interaction to image, voice, and vision capabilities within roughly 18 months. The cohort did not have AI for every month, but it had access through nearly all four high-school years.
ChatGPT se lanzó unos 3 meses después de un inicio típico de noveno grado en agosto de 2022. Luego pasó de una interacción centrada en texto a capacidades de imagen, voz y visión en aproximadamente 18 meses. La cohorte no tuvo IA durante todos los meses, pero sí durante casi los cuatro años de secundaria.
Practice performance looked better while unrestricted GPT was available. After the tool was removed, those students scored -17% relative performance versus controls. The final assisted answer had overstated what they could reproduce independently.
El rendimiento práctico parecía mejor mientras GPT sin restricciones estaba disponible. Al retirar la herramienta, esos estudiantes obtuvieron un rendimiento relativo de -17% frente al control. La respuesta asistida había exagerado lo que podían reproducir independientemente.
Pew found that United States teen use of ChatGPT for schoolwork doubled from 13% in 2023 to 26% in 2024. By February 2026, just over half reported using chatbots for schoolwork. Another 12% had used them for emotional support, showing that chatbot use extends beyond assignments.
Pew encontró que el uso de ChatGPT para tareas entre adolescentes estadounidenses se duplicó del 13% en 2023 al 26% en 2024. En febrero de 2026, poco más de la mitad reportó usar chatbots para tareas. Otro 12% los había usado como apoyo emocional, lo que demuestra que su uso supera el ámbito académico.
The adoption numbers concern real teenagers already doing collaborative schoolwork on laptops.
Las cifras de adopción representan a adolescentes reales que ya realizan trabajo escolar colaborativo con computadoras portátiles.
HEPI reported that 92% of surveyed United Kingdom undergraduates used AI and 88% used it in assessments. Directly inserting generated text was much less common at 18%. Simple labels such as user and non-user hide major differences in how AI enters student work.
HEPI informó que el 92% de los universitarios británicos encuestados usaba IA y el 88% la utilizaba en evaluaciones. Incluir directamente texto generado era mucho menos común, con un 18%. Etiquetas simples como usuario y no usuario ocultan diferencias importantes en la forma de usar IA.
Student adoption is only half the story. A June 2026 Georgia audit surveyed more than 13,000 public-school teachers and found generative AI was already part of instructional practice in many classrooms. AI exposure now comes through both personal tools and school activity.
La adopción estudiantil es solo la mitad de la historia. Una auditoría de Georgia de junio de 2026 encuestó a más de 13.000 docentes de escuelas públicas y encontró que la IA generativa ya formaba parte de la práctica educativa en muchas aulas. La exposición llega tanto por herramientas personales como por actividades escolares.
AI assistance is becoming part of public education infrastructure. New Hampshire approved a statewide Khanmigo pilot for educators and students in grades 5 through 12. Universities should expect incoming students to have experienced very different tools and guardrails across schools.
La ayuda de IA se está convirtiendo en parte de la infraestructura educativa pública. New Hampshire aprobó un piloto estatal de Khanmigo para docentes y estudiantes de los grados 5 a 12. Las universidades deben esperar experiencias muy distintas con herramientas y protecciones entre escuelas.
The critical-thinking risk is misplaced trust, not mere tool presence. Microsoft and Carnegie Mellon researchers analyzed 936 self-reported task examples from 319 knowledge workers. Higher confidence in AI was associated with less critical effort.
El riesgo para el pensamiento crítico es la confianza indebida, no la mera presencia de la herramienta. Investigadores de Microsoft y Carnegie Mellon analizaron 936 ejemplos de tareas declaradas por 319 trabajadores del conocimiento. Una mayor confianza en la IA se asoció con menor esfuerzo crítico.
ChatGPT reduced professional-writing time by 40% and raised independently rated quality by 18%. Yet pre-AI evidence found a 0.82 standardized writing effect associated with explicit strategy instruction and related practices. Product gains and skill-building are not the same outcome.
ChatGPT redujo un 40% el tiempo de escritura profesional y elevó un 18% la calidad evaluada independientemente. Sin embargo, evidencia anterior a la IA encontró un efecto estandarizado de 0,82 asociado con enseñanza explícita de estrategias y prácticas relacionadas. Mejorar el producto y desarrollar habilidades no son el mismo resultado.
AI can improve one writer's product while making many writers more alike. In a 293-person experiment, access to AI ideas improved individual story evaluations but reduced similarity-adjusted diversity across writers. Universities should value original reasoning, not only polished output.
La IA puede mejorar el producto de un autor mientras hace que muchos autores se parezcan más. En un experimento con 293 personas, acceder a ideas de IA mejoró las evaluaciones individuales de relatos, pero redujo la diversidad ajustada por similitud. Las universidades deben valorar el razonamiento original, no solo un producto pulido.
Users experience AI as useful because its immediate benefits are visible. In the Australian Government trial, 69% reported faster completion and 61% reported improved work quality. Educational designs that ask students to struggle first must compete with that reward.
Los usuarios perciben la IA como útil porque sus beneficios inmediatos son visibles. En la prueba del Gobierno australiano, el 69% reportó terminar más rápido y el 61% señaló una mejor calidad. Los diseños educativos que piden al estudiante esforzarse primero deben competir con esa recompensa.
Fluency is not evidence. Three general-purpose language models hallucinated in roughly 58% to 88% of tested legal queries, depending on model and task. Students need explicit habits for checking sources and claims.
La fluidez no es evidencia. Tres modelos lingüísticos generales alucinaron en aproximadamente entre el 58% y el 88% de las consultas jurídicas evaluadas, según el modelo y la tarea. Los estudiantes necesitan hábitos explícitos para comprobar fuentes y afirmaciones.
The incoming cohort did not start from one uniform skill level. In PISA 2022, Singapore scored 41 in creative thinking while the OECD average was 33. These results predate sustained school exposure to ChatGPT.
La cohorte que ingresa no partió de un nivel uniforme de habilidades. En PISA 2022, Singapur obtuvo 41 puntos en pensamiento creativo y el promedio de la OCDE fue 33. Estos resultados son anteriores a la exposición escolar sostenida a ChatGPT.
Independent learning requires sustained attention, but digital distraction predates widespread generative AI. PISA 2022 found 65% of students were distracted by their own devices and 59% by classmates' devices in at least some mathematics lessons. AI adds immediate answers to an already contested attention environment.
El aprendizaje independiente exige atención sostenida, pero la distracción digital es anterior a la difusión de la IA generativa. PISA 2022 encontró que el 65% se distraía con sus propios dispositivos y el 59% con los de sus compañeros en al menos algunas clases de matemáticas. La IA añade respuestas inmediatas a un entorno de atención ya disputado.
The average ACT composite fell from 20.6 in 2020 to 19.4 in 2024. The share meeting all four readiness benchmarks also declined. Timing alone cannot assign this longer-running deterioration to generative AI.
El promedio compuesto de ACT cayó de 20,6 en 2020 a 19,4 en 2024. La proporción que cumplía los cuatro umbrales de preparación también disminuyó. Las fechas por sí solas no permiten atribuir este deterioro previo a la IA generativa.
The ACT composite declined 5.8%, eighth-grade mathematics 3.5%, and eighth-grade reading 1.9%. The broad decline predates the first nearly fully AI-exposed class and complicates causal attribution.
El resultado compuesto de ACT cayó un 5,8%, las matemáticas de octavo grado un 3,5% y la lectura de octavo grado un 1,9%. El descenso general precede a la primera generación casi totalmente expuesta a la IA y complica la atribución causal.
National eighth-grade reading fell from 263 in 2019 to 259 in 2022 and 258 in 2024. The decline began before public ChatGPT and continued afterward. The incoming cohort therefore carries a preexisting literacy shock alongside AI exposure.
La lectura nacional de octavo grado bajó de 263 en 2019 a 259 en 2022 y 258 en 2024. La caída comenzó antes de ChatGPT público y continuó después. Por tanto, la cohorte que ingresa carga con una alteración previa de alfabetización junto con la exposición a la IA.
The supplied figures report a fall from 282 in 2019 to 274 in 2022 and 272 in 2024. That pattern matches the broader preexisting-readiness warning. Because these values were not independently reverified at build time, the slide frames them as provisional rather than settled evidence.
Las cifras suministradas reportan una caída de 282 en 2019 a 274 en 2022 y 272 en 2024. Ese patrón coincide con la advertencia más amplia sobre preparación previa. Como los valores no se volvieron a verificar de forma independiente, se presentan como provisionales y no como evidencia definitiva.
OpenAI's own classifier failed in both directions. It correctly identified only 26% of AI-written text and mislabeled 9% of human-written text. OpenAI withdrew it, leaving universities without a reliable shortcut for proving authorship.
El propio clasificador de OpenAI falló en ambas direcciones. Identificó correctamente solo el 26% del texto escrito por IA y clasificó erróneamente como IA el 9% del texto humano. OpenAI lo retiró, dejando a las universidades sin un atajo confiable para demostrar la autoría.
The classifier missed most AI writing while still falsely flagging human work. In the non-native essay evaluation, 61.2% were classified as AI-generated and 97% were flagged by at least one detector.
El clasificador omitió la mayoría de los textos de IA y aun así marcó erróneamente trabajos humanos. En la evaluación de ensayos de autores no nativos, el 61,2% fue clasificado como generado por IA y el 97% fue marcado por al menos un detector.
The danger is not evenly distributed. In one study, detectors classified 61.2% of 91 TOEFL essays by non-native English writers as AI-generated, and 97% were flagged by at least one detector. Because the values were not independently reverified here, the finding is presented as a study-specific warning.
El peligro no se distribuye de forma uniforme. En un estudio, los detectores clasificaron como IA el 61,2% de 91 ensayos TOEFL de autores no nativos de inglés, y el 97% fue señalado por al menos un detector. Como los valores no se volvieron a verificar aquí, el hallazgo se presenta como una advertencia específica del estudio.
Usage is not the same as literacy. The international survey reported 86% regular AI use, yet 58% felt insufficiently knowledgeable and 80% judged institutional support inadequate. In United States schools, RAND separately reported 25% teacher use during 2023-24 and substantially higher use among principals.
El uso no equivale a alfabetización. La encuesta internacional reportó un 86% de uso regular de IA, pero el 58% se consideraba poco preparado y el 80% juzgaba insuficiente el apoyo institucional. En escuelas estadounidenses, RAND reportó por separado un 25% de uso docente durante 2023-24 y un uso mucho mayor entre directores.
The student survey yields gaps of 44 points for knowledge and 66 points for adequate support. A separate institutional survey puts formal guidance more than 76 points below regular student use.
La encuesta estudiantil muestra brechas de 44 puntos en conocimiento y 66 puntos en apoyo adecuado. Otra encuesta institucional sitúa la orientación formal más de 76 puntos por debajo del uso habitual de los estudiantes.
Unclear choices about whether and when AI is allowed widen the gap between student use and institutional support.
Las decisiones poco claras sobre si se permite la IA y cuándo amplían la brecha entre el uso estudiantil y el apoyo institucional.
The answer is not to recreate a world without AI. Evidence syntheses estimate 8 additional months of progress from metacognition, 7 from reading-comprehension strategies, and 6 from feedback under favorable implementation. Universities should make these processes visible in assessment.
La respuesta no es recrear un mundo sin IA. Las síntesis de evidencia estiman 8 meses adicionales de progreso por metacognición, 7 por estrategias de comprensión lectora y 6 por retroalimentación con una implementación favorable. Las universidades deben hacer visibles estos procesos en la evaluación.
The supplied study reports 61% recall after repeated retrieval and 40% after repeated study one week later. Repeated study performed better immediately, which helps explain why easier methods feel effective. Because the values were not independently reverified here, the finding remains provisional.
El estudio suministrado reporta un 61% de recuerdo tras recuperación repetida y un 40% tras estudio repetido una semana después. El estudio repetido rindió mejor de inmediato, lo que ayuda a explicar por qué los métodos más fáciles parecen eficaces. Como los valores no se volvieron a verificar aquí, el hallazgo sigue siendo provisional.
The United Kingdom and United States maintained high gross lower-secondary completion rates. Yet the United States readiness measures in this deck still declined. Finishing school and mastering the skills universities expect are different outcomes.
Reino Unido y Estados Unidos mantuvieron tasas brutas altas de finalización de secundaria básica. Sin embargo, las medidas estadounidenses de preparación incluidas en esta presentación disminuyeron. Terminar la escuela y dominar las habilidades que esperan las universidades son resultados distintos.
Singapore's gross rate stayed near or above 100% across much of the series. Türkiye's rate spiked to 131% in 2020 before falling to 91.8% in 2023. Gross completion measures system participation and cohort structure, not whether students can reason or write independently.
La tasa bruta de Singapur se mantuvo cerca o por encima del 100% durante gran parte de la serie. La tasa de Türkiye subió al 131% en 2020 antes de caer al 91,8% en 2023. La finalización bruta mide participación y estructura de cohortes, no si los estudiantes pueden razonar o escribir independientemente.
AI can improve the submitted product while weakening the evidence that the student learned. Its design determines whether it supports reasoning or replaces it. Universities should observe the process, require verification, and test independent performance.
La IA puede mejorar el producto entregado mientras debilita la evidencia de que el estudiante aprendió. Su diseño determina si apoya el razonamiento o lo sustituye. Las universidades deben observar el proceso, exigir verificación y evaluar el desempeño independiente.
Inside the frontier, consultants completed more work faster and at higher quality. Outside it, AI assistance reduced the likelihood of a correct answer by 19 points.
Dentro de la frontera, los consultores completaron más trabajo, con mayor rapidez y calidad. Fuera de ella, la asistencia de IA redujo en 19 puntos la probabilidad de una respuesta correcta.
The design of the assistance mattered more than simply providing AI. This cohort encountered public AI near the start of high school.
Key findings
After AI removal, unrestricted-GPT students scored 17% below controls, while safeguarded-tutor students showed no statistically significant unaided disadvantage. National Bureau of Economic Research
Three general-purpose language models hallucinated in approximately 58% to 88% of tested legal queries, depending on model and task. Journal of Legal Analysis
The safeguarded mathematics tutor produced a 127% assisted gain without the statistically significant 17% unaided penalty observed with unrestricted GPT. National Bureau of Economic Research
OpenAI withdrew its classifier after reporting 26% correct detection of AI-written text and 9% false classification of human text as AI-written. OpenAI
Detectors classified 61.2% of 91 TOEFL essays by non-native English writers as AI-generated, and 97% were flagged by at least one detector. Patterns
In a Turkish high-school mathematics experiment, unrestricted GPT raised practice performance 48%, while a safeguarded AI tutor raised it 127% relative to control. National Bureau of Economic Research
A randomized Harvard physics study found a carefully designed AI tutor produced more than twice the learning gain of in-class active learning in less time. Scientific Reports
On a task outside GPT-4's competence frontier, assisted BCG consultants were 19 percentage points less likely to produce the correct answer than controls. Harvard Business School
After one week, repeated retrieval produced 61% recall versus 40% after repeated study, although repeated study performed better immediately. Psychological Science
Espírito Santo scaled an AI writing-feedback platform to more than 100,000 public-school seniors after applying research findings. povertyactionlab.org
Typical 2026 entrants had roughly 3.5 school years of public ChatGPT availability, compared with about 0.5, 1.5, and 2.5 for the preceding cohorts. OpenAI
Pew reported 26% of United States teens used ChatGPT for schoolwork in 2024, up from 13% in 2023, with demographic differences. Pew Research Center
The argument
Without AI, unrestricted-GPT students scored -17% relative performance versus controls.
Student adoption moved faster than most institutional assessment policies.
The submitted product increasingly reveals less about how it was produced.
A 2026 Georgia audit surveyed more than 13,000 teachers.
New Hampshire approved Khanmigo access for grades 5 through 12.
Across 936 tasks, higher AI confidence tracked lower critical effort.
This research is published in English and Spanish. Ver en español
La investigación detrás de esta presentación
El diseño de la ayuda importó más que el simple acceso a la IA. Esta cohorte encontró la IA pública cerca del inicio de secundaria.
Hallazgos clave
Tras retirar la IA, los estudiantes con GPT sin restricciones puntuaron un 17% por debajo del control, mientras el tutor protegido no mostró una desventaja significativa. National Bureau of Economic Research
Tres modelos lingüísticos generales alucinaron en aproximadamente entre el 58% y el 88% de las consultas jurídicas, según modelo y tarea. Journal of Legal Analysis
El tutor matemático protegido produjo una ganancia asistida del 127% sin la penalización independiente significativa del 17% observada con GPT sin restricciones. National Bureau of Economic Research
OpenAI retiró su clasificador tras informar un 26% de detección correcta de texto de IA y un 9% de falsos positivos sobre texto humano. OpenAI
Los detectores clasificaron como IA el 61,2% de 91 ensayos TOEFL de autores no nativos, y el 97% fue señalado por al menos un detector. Patterns
En un experimento turco de matemáticas de secundaria, GPT sin restricciones elevó la práctica un 48% y un tutor protegido un 127% frente al control. National Bureau of Economic Research
Un estudio aleatorizado de física en Harvard encontró que un tutor de IA cuidadosamente diseñado produjo más del doble de aprendizaje que la enseñanza activa en menos tiempo. Scientific Reports
En una tarea fuera de la frontera de competencia de GPT-4, los consultores asistidos tuvieron 19 puntos porcentuales menos de probabilidad de acertar que el control. Harvard Business School
Después de una semana, la recuperación repetida produjo un 61% de recuerdo frente al 40% del estudio repetido, aunque este rindió mejor inmediatamente. Psychological Science
Espírito Santo amplió una plataforma de retroalimentación de escritura con IA a más de 100.000 estudiantes del último año de escuelas públicas tras aplicar resultados de investigación. povertyactionlab.org
Los estudiantes típicos de 2026 tuvieron unos 3,5 años escolares con ChatGPT público, frente a 0,5, 1,5 y 2,5 para las cohortes anteriores. OpenAI
Pew informó que el 26% de los adolescentes estadounidenses usó ChatGPT para tareas en 2024, frente al 13% en 2023, con diferencias demográficas. Pew Research Center
El argumento
Sin IA, los estudiantes con GPT sin restricciones obtuvieron un rendimiento relativo de -17% frente al control.
La adopción estudiantil avanzó más rápido que muchas políticas institucionales de evaluación.
El producto entregado revela cada vez menos sobre cómo fue elaborado.
Una auditoría de Georgia de 2026 encuestó a más de 13.000 docentes.
New Hampshire aprobó acceso a Khanmigo para los grados 5 a 12.
En 936 tareas, mayor confianza en IA acompañó menor esfuerzo crítico.
Esta investigación se publica en inglés y español. Read in English