Start with the central split. Homework scores rose 18%, but monthly exams fell 20% and entrance exams fell as much as 24%. AI can look like an exoskeleton during practice while the exam still measures the muscles underneath.
Empecemos con la división central. Las notas de tareas subieron 18%, pero los exámenes mensuales cayeron 20% y los de ingreso hasta 24%. La IA puede parecer un exoesqueleto durante la práctica, mientras el examen sigue midiendo los músculos que hay debajo.
This is a single course, and the AI attribution has not been finally adjudicated. Even so, the assessment contrast is extraordinary: 96% at home, then 48.6% under control. The episode raises a question larger than cheating, whether the original assessment measured student knowledge at all.
Es un solo curso y la atribución a la IA no ha sido resuelta de forma definitiva. Aun así, el contraste es extraordinario: 96% en casa y después 48,6% bajo supervisión. El episodio plantea una pregunta mayor que el fraude: si la evaluación original medía realmente el conocimiento del alumno.
Behind the scores is a professor confronting a basic loss of trust. He said his evidence implicated at least 50 students in a class of 86, but the university had not completed its findings. That distinction matters because suspicion is not adjudication.
Detrás de las puntuaciones hay un profesor ante una pérdida básica de confianza. Afirmó que sus pruebas implicaban al menos a 50 estudiantes de una clase de 86, pero la universidad no había concluido su investigación. Esa distinción importa porque una sospecha no es una resolución.
In 2024, just over half of UK undergraduates used generative AI for assessments. One year later, the figure was 88%. This measures use, not cheating, but it makes prohibition alone an implausible operating model.
En 2024, poco más de la mitad de los universitarios británicos usaba IA generativa en evaluaciones. Un año después, la cifra era 88%. Esto mide uso, no fraude, pero convierte la prohibición por sí sola en un modelo operativo poco plausible.
By May 2025, 84% of high school students reported using generative AI for schoolwork. That includes legitimate assistance as well as possible substitution. At this penetration, AI literacy and independent verification become basic academic skills.
Para mayo de 2025, el 84% de los estudiantes de secundaria declaraba usar IA generativa para tareas escolares. La cifra incluye ayuda legítima y posible sustitución del trabajo propio. Con esta penetración, el dominio de la IA y la verificación independiente se vuelven habilidades académicas básicas.
Across more than half a million grades, the share of A grades rose 13 points after ChatGPT. In homework-heavy courses, the increase reached 16 points. Better grades are visible, but this design does not prove that underlying knowledge improved.
En más de medio millón de calificaciones, la proporción de sobresalientes subió 13 puntos tras ChatGPT. En cursos con muchas tareas, el aumento llegó a 16 puntos. Las mejores notas son visibles, pero este diseño no demuestra que el conocimiento subyacente mejorara.
A 2026 academic test gave Originality an overall accuracy of 0.69 and Turnitin 0.61. Both struggled with mixed human-AI writing. Institutions cannot rebuild assessment trust by asking an uncertain detector to make high-stakes judgments.
Una prueba académica de 2026 dio a Originality una precisión general de 0,69 y a Turnitin de 0,61. Ambos tuvieron dificultades con textos mixtos de humanos e IA. Las instituciones no pueden reconstruir la confianza pidiendo a un detector incierto que tome decisiones de alto riesgo.
Mass adoption makes take-home output easier to produce and harder to authenticate. Detection remains imperfect, and a polished submission may no longer reveal who can reproduce the reasoning. The durable response is to redesign what students must demonstrate.
La adopción masiva facilita producir tareas para casa y dificulta autentificarlas. La detección sigue siendo imperfecta y una entrega pulida puede dejar de mostrar quién puede reproducir el razonamiento. La respuesta duradera es rediseñar lo que los alumnos deben demostrar.
One trial found that AI feedback made wrong answers 16% more likely to be corrected and improved the next problem by 7%. A separate dataset linked AI-susceptible problems to a 25% decline in later proctored retention odds. A tool can help on the next step without guaranteeing durable learning.
Un ensayo halló que la retroalimentación con IA aumentó 16% la corrección de respuestas erróneas y mejoró 7% el siguiente problema. Otro conjunto de datos vinculó los problemas vulnerables a la IA con una caída del 25% en la probabilidad de retención supervisada posterior. Una herramienta puede ayudar en el siguiente paso sin garantizar aprendizaje duradero.
After ChatGPT, time spent on susceptible math problems fell at every education level studied. The decline reached 31.3% in high school and 26.9% in college. AI can act like an escalator: arriving faster does not show whether the rider’s legs became stronger.
Tras ChatGPT, el tiempo dedicado a problemas matemáticos vulnerables cayó en todos los niveles estudiados. La reducción alcanzó 31,3% en secundaria y 26,9% en universidad. La IA puede actuar como una escalera mecánica: llegar antes no demuestra que las piernas del usuario se fortalecieran.
The strongest decline appeared when AI took over the writing process. Comprehension accuracy fell 25.1%, compared with 12% during AI-assisted reading. The more completely the tool substituted for producing the argument, the weaker the measured understanding.
La mayor caída apareció cuando la IA asumió el proceso de escritura. La precisión de comprensión bajó 25,1%, frente al 12% durante la lectura asistida por IA. Cuanto más completamente sustituyó la herramienta la producción del argumento, más débil fue la comprensión medida.
The widely shared EEG experiment began with only 54 participants, and 18 completed its tool-switching session. The large behavioral studies here involve more than 20,000 students. Lower neural connectivity during one essay task is worth studying, but it is not proof of damaged brains or lower intelligence.
El difundido experimento EEG comenzó con solo 54 participantes y 18 completaron la sesión de cambio de herramienta. Los grandes estudios conductuales aquí superan los 20.000 estudiantes. Una menor conectividad durante una tarea de escritura merece estudio, pero no demuestra daño cerebral ni menor inteligencia.
The volume of AI education research looks reassuring until quality filters are applied. Stanford found more than 800 papers, but only 20 offered strong cause-and-effect evidence. None met that standard for U.S. students, so confident universal claims are premature.
El volumen de investigación educativa sobre IA parece tranquilizador hasta aplicar filtros de calidad. Stanford encontró más de 800 trabajos, pero solo 20 ofrecían pruebas causales sólidas. Ninguno alcanzó ese nivel para estudiantes de Estados Unidos, por lo que las afirmaciones universales siguen siendo prematuras.
The same technology can remove thinking or redirect effort toward it. Unstructured answer generation encourages substitution. Good tutoring withholds the lift, gives feedback and leaves the student responsible for the reasoning.
La misma tecnología puede eliminar el pensamiento o redirigir el esfuerzo hacia él. La generación de respuestas sin estructura favorece la sustitución. Una buena tutoría no levanta el peso, ofrece retroalimentación y mantiene al alumno responsable del razonamiento.
The evidence is not uniformly negative. A 2026 synthesis of 35 experiments and 4,193 participants found a moderate overall learning benefit. The result changed with subject, duration and instructional mode, making pedagogy the active ingredient.
Las pruebas no son uniformemente negativas. Una síntesis de 2026 de 35 experimentos y 4.193 participantes halló un beneficio moderado general. El resultado cambió según la materia, la duración y el modo de enseñanza, lo que convierte la pedagogía en el ingrediente activo.
This is the hopeful counterexample. Six weeks of teacher-supported tutoring produced gains estimated at 1.5 to 2 years of ordinary schooling. The device was not the intervention by itself; the structure, teacher and tutoring rules were part of the treatment.
Este es el contraejemplo esperanzador. Seis semanas de tutoría con apoyo docente produjeron avances estimados entre 1,5 y 2 años de escolarización habitual. El dispositivo no fue la intervención por sí solo; la estructura, el docente y las reglas tutoriales formaron parte del tratamiento.
Tutor CoPilot raised mastery by 4 points overall. For students working with lower-rated tutors, the gain reached 9 points. AI’s strongest promise here is equalization, scaling better guidance through a human relationship rather than replacing it.
Tutor CoPilot elevó el dominio 4 puntos en general. Entre alumnos con tutores de menor valoración, el avance llegó a 9 puntos. La mayor promesa de la IA aquí es la igualación, ampliando una mejor orientación mediante una relación humana en vez de reemplazarla.
Raw ChatGPT help failed quality checks on 32% of problems. Consistency filtering reduced failures close to zero in algebra, but only to 13% in statistics. Fluency can sound equally convincing across subjects even when reliability differs.
La ayuda inicial de ChatGPT falló controles de calidad en el 32% de los problemas. El filtrado redujo los fallos casi a cero en álgebra, pero solo al 13% en estadística. La fluidez puede sonar igual de convincente entre materias aunque la fiabilidad difiera.
Cognitive offloading is not automatically harmful. This structured method delegated mechanical writing work while requiring reflection, evidence checking and student control. It reduced unnecessary effort by 32% and redirected effort toward learning by 28%.
La delegación cognitiva no es automáticamente dañina. Este método estructurado delegó trabajo mecánico de escritura, pero exigió reflexión, verificación de pruebas y control estudiantil. Redujo 32% el esfuerzo innecesario y redirigió 28% más esfuerzo hacia el aprendizaje.
A randomized evaluation followed 531 rural Peruvian schools for ten years. Laptops improved computer skills but produced no significant academic gains and some evidence of worse grade progression. Technology access matters, but classroom use and teacher preparation determine whether access becomes learning.
Una evaluación aleatorizada siguió durante diez años a 531 escuelas rurales de Perú. Los portátiles mejoraron habilidades informáticas, pero no produjeron avances académicos significativos y hubo indicios de peor progresión escolar. El acceso importa, pero el uso en clase y la preparación docente determinan si se convierte en aprendizaje.
The education crisis did not start with generative AI. Between 2018 and 2022, OECD mathematics fell 15 points and reading fell 10. PISA 2022 was largely administered before public ChatGPT adoption, so blaming the original collapse on chatbots gets the chronology wrong.
La crisis educativa no comenzó con la IA generativa. Entre 2018 y 2022, matemáticas cayó 15 puntos en la OCDE y lectura bajó 10. PISA 2022 se aplicó en gran medida antes de la adopción pública de ChatGPT, por lo que culpar a los chatbots del desplome original contradice la cronología.
In 2023, frontier models solved 4.4% of SWE-bench problems. In 2024, they solved 71.7%. The benchmark covers real software issues, not every workplace task, but the speed means curriculum assumptions can expire inside one academic year.
En 2023, los modelos avanzados resolvían el 4,4% de los problemas de SWE-bench. En 2024, resolvían el 71,7%. El indicador cubre problemas reales de software, no todas las tareas laborales, pero la velocidad implica que los supuestos curriculares pueden caducar dentro de un año académico.
Capability is not only improving on short benchmarks. Since 2019, the duration of software tasks frontier AI can complete with 50% reliability has doubled about every seven months. Education must prepare students for moving boundaries, not freeze training around today’s division of labor.
La capacidad no mejora solo en pruebas breves. Desde 2019, la duración de las tareas de software que la IA avanzada completa con un 50% de fiabilidad se duplica aproximadamente cada siete meses. La educación debe preparar a los alumnos para fronteras móviles y no congelar la formación en la división actual del trabajo.
The headline is positive: 170 million jobs created, 92 million displaced and a net gain of 78 million by 2030. The lived transition is much larger than the net. Creation plus displacement puts 262 million jobs inside the churn, even before asking who can move between them.
El titular es positivo: 170 millones de empleos creados, 92 millones desplazados y una ganancia neta de 78 millones para 2030. La transición vivida es mucho mayor que el saldo. La creación y el desplazamiento sitúan 262 millones de empleos dentro de la rotación, antes incluso de preguntar quién podrá pasar de unos a otros.
Young people are not simply refusing AI. Their emotional response is shifting while adoption continues. Anger rose 9 points, excitement fell 14 and hopefulness fell 9, a pattern consistent with uncertainty about agency and future work.
Los jóvenes no están simplemente rechazando la IA. Su respuesta emocional cambia mientras la adopción continúa. El enojo subió 9 puntos, el entusiasmo cayó 14 y la esperanza bajó 9, un patrón compatible con incertidumbre sobre la autonomía y el trabajo futuro.
In a 2026 youth poll, 29% used AI to support their mental health and 27% used it for conversation or personal advice. That creates an unusual feedback loop. The technology young people fear may also become the place where they process that fear.
En una encuesta juvenil de 2026, el 29% usó IA para apoyar su salud mental y el 27% para conversar o pedir consejos personales. Esto crea un bucle inusual. La tecnología que los jóvenes temen también puede convertirse en el lugar donde procesan ese temor.
Internet use rose from 43.1% in 2000 to 94.7% in 2024. Youth unemployment moved through recessions and the pandemic but ended at 8.92%, close to and slightly below its 2000 level. This is not proof that AI disruption will be harmless, only a reminder that technological diffusion does not mechanically determine the employment endpoint.
El uso de internet subió del 43,1% en 2000 al 94,7% en 2024. El desempleo juvenil atravesó recesiones y la pandemia, pero terminó en 8,92%, cerca y ligeramente por debajo de su nivel de 2000. Esto no demuestra que la disrupción de la IA será inocua, solo recuerda que la difusión tecnológica no determina mecánicamente el resultado laboral.
AI can improve visible work while weakening independent performance, yet structured tutoring can reverse that tradeoff. The evidence points beyond bans or detection toward assessments, teaching methods and curricula designed around what students can still do alone.
Key findings
Among 26,811 students, AI raised homework scores 18%, but monthly exams fell 20% and high-stakes entrance exams fell as much as 24%. Centre for Economic Policy Research
At Brown, a suspected AI-assisted take-home midterm averaged 96%; the controlled final averaged a record-low 48.6%, versus the course’s historical 65%-80% range. The Register
Across more than 500,000 university grades, the share of A grades rose 13 percentage points after ChatGPT, concentrated in writing- and coding-heavy courses. University of California, Berkeley
UK undergraduate use of generative AI for assessments jumped from 53% to 88% in one year, turning an optional tool into normal academic infrastructure. Higher Education Policy Institute
By May 2025, 84% of high school students reported using generative AI tools for schoolwork. College Board
In a 120-country university dataset, 73% found ChatGPT clarifying, but only 43% found it reliable and 39.1% said it improved critical thinking. Mendeley Data
A Brown professor said he had conclusive evidence that at least 50 students cheated on one 86-person midterm, though the university had not issued final findings. El País
A 2026 academic test found only 0.69 overall accuracy for Originality and 0.61 for Turnitin, with both struggling on mixed human-AI writing. International Journal for Educational Integrity
MIT’s essay experiment reported brain-signal strength as much as 55% lower for LLM users than unaided writers, but it did not demonstrate brain damage or lower intelligence. MIT Media Lab
The widely cited MIT experiment included only 54 participants in its first sessions, and just 18 completed the tool-switching session. MIT Media Lab
Across 3.2 million math-learning interactions, AI-susceptible problems were followed by a 25% decline in the odds of answering later proctored retention questions correctly. University of California, Irvine and McGraw Hill
Among 26,811 students, AI raised homework scores 18% while monthly and entrance exams fell as much as 24%.
AI use for UK undergraduate assessments jumped from 53% to 88% in one year, while 84% of high school students used it for schoolwork.
The strongest harm evidence concerns effort and retention: study time fell as much as 31.3%, and later proctored retention odds fell 25%.
The research base remains immature: Stanford found more than 800 K-12 AI papers but only 20 with strong causal evidence.
When AI supports teachers instead of replacing thought, gains can be large, including 1.5 to 2 years of schooling from six weeks of supported tutoring in Nigeria.
Frontier coding performance rose from 4.4% to 71.7% in one year, forcing curricula to adapt faster than traditional revision cycles.
The projected labor market remains net positive by 78 million jobs, but 262 million jobs sit inside the gross transition.
Gen Z anger about AI rose 9 points as excitement fell 14, making judgment, agency and AI fluency educational outcomes in their own right.
This research is published in English and Spanish. Ver en español
La investigación detrás de esta presentación
La IA puede mejorar el trabajo visible y debilitar el desempeño independiente, pero una tutoría estructurada puede invertir esa tensión. Las pruebas apuntan más allá de prohibiciones o detectores, hacia evaluaciones, métodos docentes y currículos centrados en lo que el alumno aún puede hacer solo.
Hallazgos clave
Entre 26.811 estudiantes, la IA elevó 18% las notas de tareas, pero los exámenes mensuales cayeron 20% y los de ingreso hasta 24%. Centre for Economic Policy Research
En Brown, un parcial en casa con presunto uso de IA promedió 96%; el final supervisado cayó a un mínimo histórico de 48,6%, frente al rango previo de 65%-80%. The Register
En más de 500.000 calificaciones universitarias, la proporción de sobresalientes subió 13 puntos porcentuales tras ChatGPT, sobre todo en cursos con mucha escritura y programación. University of California, Berkeley
El uso de IA generativa en evaluaciones por universitarios británicos saltó de 53% a 88% en un año, convirtiendo una herramienta opcional en infraestructura académica habitual. Higher Education Policy Institute
Para mayo de 2025, el 84% de los estudiantes de secundaria declaraba usar herramientas de IA generativa para tareas escolares. College Board
En datos universitarios de 120 países, el 73% consideró que ChatGPT aclaraba conceptos, pero solo el 43% lo vio fiable y el 39,1% dijo que mejoraba el pensamiento crítico. Mendeley Data
Un profesor de Brown afirmó tener pruebas concluyentes de que al menos 50 de 86 estudiantes hicieron fraude en un parcial, aunque la universidad aún no había emitido conclusiones finales. El País
Una prueba académica de 2026 halló una precisión general de solo 0,69 para Originality y 0,61 para Turnitin; ambos fallaron con textos mixtos de humanos e IA. International Journal for Educational Integrity
El experimento de escritura del MIT registró señales cerebrales hasta un 55% menores entre usuarios de IA, pero no demostró daño cerebral ni menor inteligencia. MIT Media Lab
El muy citado experimento del MIT incluyó solo 54 participantes en las primeras sesiones, y apenas 18 completaron la sesión de cambio de herramienta. MIT Media Lab
En 3,2 millones de interacciones de matemáticas, los problemas vulnerables a la IA se asociaron con una caída del 25% en la probabilidad de responder bien después bajo supervisión. University of California, Irvine and McGraw Hill
Entre 26.811 estudiantes, la IA elevó 18% las notas de tareas mientras los exámenes mensuales y de ingreso cayeron hasta 24%.
El uso de IA en evaluaciones universitarias británicas saltó del 53% al 88% en un año, mientras el 84% de los estudiantes de secundaria la usaba para tareas.
Las pruebas más sólidas de daño se refieren al esfuerzo y la retención: el tiempo de estudio cayó hasta 31,3% y la probabilidad de retención supervisada bajó 25%.
La base de investigación sigue siendo inmadura: Stanford halló más de 800 trabajos sobre IA escolar, pero solo 20 con pruebas causales sólidas.
Cuando la IA apoya a docentes en vez de sustituir el pensamiento, los avances pueden ser grandes, incluidos entre 1,5 y 2 años de escolarización tras seis semanas de tutoría apoyada en Nigeria.
El rendimiento avanzado en programación subió del 4,4% al 71,7% en un año, obligando a adaptar los currículos más rápido que los ciclos tradicionales de revisión.
La previsión laboral mantiene una ganancia neta de 78 millones de empleos, pero 262 millones quedan dentro de la transición bruta.
El enojo de la generación Z ante la IA subió 9 puntos mientras el entusiasmo cayó 14, convirtiendo el juicio, la autonomía y el dominio de la IA en resultados educativos por derecho propio.
Esta investigación se publica en inglés y español. Read in English