Hanademi

AI Can Raise Scores and Lower Mastery

27 slides · $7.26 · 20 min · 2026-07-11 language
ENES
theme
LightDark
view
DeckTableTalk
brand
HanademiPlatzi
AI Can Raise Scores and LowerMasteryMade for Freddy Vega, by Hanademi
La IA puede subir las notas yreducir el dominioMade for Freddy Vega, by Hanademi
MIT's AI brain study cannot establishlasting brain damageParticipants completing each phase of MIT's AI brain-activity studyMade for Freddy Vega, by HanademiSources: Kosmyna, N., et al. (2025). Your brain on ChatGPT: Accumulation of cognitive debt when using an AI assistant for essay writingtask. MIT Media Lab and arXiv. Jones, N. (2025, June 26). Does using ChatGPT change your brain activity? Study sparks debate. Natureand Scientific American.UnitParticipants020401-34Only 18 completed the finalsession54
The sample fell from 54 across sessions 1-3 to 18 in session 4.
El estudio cerebral de IA del MIT nodemuestra daño duraderoParticipantes que completaron cada fase del estudio cerebral de IA del MITMade for Freddy Vega, by HanademiFuentes: Kosmyna, N., et al. (2025). Your brain on ChatGPT: Accumulation of cognitive debt when using an AI assistant for essay writingtask. MIT Media Lab and arXiv. Jones, N. (2025, June 26). Does using ChatGPT change your brain activity? Study sparks debate. Natureand Scientific American.UnidadParticipantes020401-34Solo 18 completaron la sesiónfinal54
La muestra cayó de 54 en las sesiones 1-3 a 18 en la sesión 4.
Brown’s alleged AI-cheating case exposeda mastery gapScores and alleged cases from one 86-student economics course in 2026; formats and supervision differedbetween examinations.Made for Freddy Vega, by HanademiSources: The Register. (2026, July 9). Brown says AI make class dumb, teacher must help use better.; Inside Higher Ed. (2026, July 8). Brown professorsuspects majority of his class used AI to cheat.; Pascual, M. G. (2026, June 28). Professor denounces mass AI fraud on an exam at Brown University. EL PAÍS.Hanademi analysis: A grades rose thirteen percentage points, Brown’s take-home average was ninety-six versus forty-eight point six in person, andChinese homework scores rose eighteen percent while monthly and entrance exams fell twenty and eighteen to twenty-four percent.UnitScores and studentsAverage score96%48.6%Take-home midtermIn-person finalProfessor’s allegation8650Class sizeEvidence cases
Start with the split: 96% on the take-home midterm and 48.6% on the controlled final. Professor Roberto Serrano also said he had conclusive evidence against at least 50 students in a class of 86. This is not causal proof, but it shows how quickly assisted output can separate from independently demonstrated mastery.
El caso denunciado de fraude con IA enBrown expuso una brecha de dominioNotas y casos denunciados en un curso de economía de 86 estudiantes en 2026; el formato y la supervisiónvariaron entre exámenes.Made for Freddy Vega, by HanademiFuentes: The Register. (2026, July 9). Brown says AI make class dumb, teacher must help use better.; Inside Higher Ed. (2026, July 8). Brown professorsuspects majority of his class used AI to cheat.; Pascual, M. G. (2026, June 28). Professor denounces mass AI fraud on an exam at Brown University. EL PAÍS.Análisis de Hanademi: Las calificaciones A subieron trece puntos porcentuales, el promedio del examen para casa de Brown fue noventa y seis frente acuarenta y ocho punto seis en persona, y las tareas en China subieron dieciocho por ciento mientras los exámenes mensuales y de ingreso cayeron…UnidadNotas y estudiantesNota promedio96 %48,6 %Parcial en casaFinal presencialDenuncia del profesor8650Tamaño del cursoCasos con pruebas
Empecemos por la división: 96% en el parcial en casa y 48,6% en el final controlado. El profesor Roberto Serrano también afirmó tener pruebas concluyentes contra al menos 50 estudiantes de un curso de 86. No es una prueba causal, pero muestra la rapidez con que el resultado asistido puede separarse del dominio demostrado sin ayuda.
The professor behind Brown’s warningRoberto Serrano said he had evidence that at least 50 students cheated in an 86-student course.Sources: Pascual, M. G. (2026, June 28). Professor denounces mass AI fraud on an exam at Brown University. EL PAÍS.
This is the human face of the Brown dispute. Serrano’s claim was not about occasional misuse, but evidence involving at least 50 students. The larger question is whether traditional take-home assessment can still distinguish assistance from mastery.
El profesor detrás de la advertencia de BrownRoberto Serrano afirmó tener pruebas de que al menos 50 estudiantes hicieron fraude en un curso de86.Fuentes: Pascual, M. G. (2026, June 28). Professor denounces mass AI fraud on an exam at Brown University. EL PAÍS.
Este es el rostro humano de la disputa de Brown. La afirmación de Serrano no trataba de un uso indebido ocasional, sino de pruebas relacionadas con al menos 50 estudiantes. La pregunta mayor es si la evaluación tradicional en casa todavía puede distinguir la asistencia del dominio.
Across 500,000 university grades, Agrades rose 13 points in writing- andcoding-heavy courses.The study compared eight fall semesters from 2018 through 2025 and classified courseexposure using assignment mixes defined before ChatGPT.Sources: Chirikov, I. (2026). Study of generative AI exposure and university grade trends, summarized by The Decoder.
This is larger than one course or one professor. Across 500,000 grades, courses most exposed to writing and coding gained 13 percentage points in A grades after ChatGPT. Average GPA rose only 0.12, making the concentration of the shift the important clue.
En 500.000 notas universitarias, lascalificaciones A subieron 13 puntosen cursos intensivos en escritura yprogramación.El estudio comparó ocho semestres de otoño entre 2018 y 2025 y clasificó la exposiciónde los cursos mediante tareas definidas antes de ChatGPT.Fuentes: Chirikov, I. (2026). Study of generative AI exposure and university grade trends, summarized by The Decoder.
Esto es mayor que un curso o un profesor. En 500.000 calificaciones, los cursos más expuestos a escritura y programación ganaron 13 puntos porcentuales de calificaciones A después de ChatGPT. El promedio general subió solo 0,12, por lo que la concentración del cambio es la pista importante.
Assessment AI jumped from 53% to 88% inone yearShare of UK undergraduates using generative AI for assessments and any AI tool, 2024 to 2025.Made for Freddy Vega, by HanademiSources: Freeman, J. (2025). Student generative AI survey 2025. Higher Education Policy Institute and Kortext.; WorldBank. (n.d.). Individuals using the Internet (% of population) [IT.NET.USER.ZS]. World Bank Open Data.Hanademi analysis: United States internet use gained fifty-one point six points over twenty-four years, or two point two points peryear, while UK assessment AI use gained thirty-five points in one year, making the latter pace about sixteen point three times faster.UnitPercent of undergraduates60%80%20242025AssessmentuseAny AI useIn 2025, assessment use reached88%.
Adoption did not creep forward. In one year, assessment use rose 35 points and any AI use rose 26 points. Among students using any AI, the supplied analysis estimates that 95.7% used generative AI for assessments in 2025.
La IA en evaluaciones saltó del 53% al 88%en un añoProporción de universitarios británicos que usaron IA generativa en evaluaciones y cualquier herramientade IA, 2024 a 2025.Made for Freddy Vega, by HanademiFuentes: Freeman, J. (2025). Student generative AI survey 2025. Higher Education Policy Institute and Kortext.;World Bank. (n.d.). Individuals using the Internet (% of population) [IT.NET.USER.ZS]. World Bank Open Data.Análisis de Hanademi: El uso de internet en Estados Unidos ganó cincuenta y uno punto seis puntos durante veinticuatro años, o dos punto dospuntos por año, mientras el uso de IA en evaluaciones británicas ganó treinta y cinco puntos en un año, un ritmo aproximadamente…UnidadPorcentaje de universitarios60 %80 %20242025Uso enevaluacionesUso decualquier IAEn 2025, el uso en evaluacionesllegó al 88%.
La adopción no avanzó lentamente. En un año, el uso en evaluaciones subió 35 puntos y el uso de cualquier IA aumentó 26. Entre quienes usaban alguna IA, el análisis suministrado estima que el 95,7% empleó IA generativa en evaluaciones en 2025.
Homework improved as controlled examsfell in ChinaReported changes among 26,811 Chinese students followed for 30 months; negative values indicate declines.Made for Freddy Vega, by HanademiSources: Strömberg, D., Lei, V., & Wu, Y. (2026). The generative AI learning penalty: Evidence from Chinese secondary education.CEPR Discussion Paper 21577.Hanademi analysis: A grades rose thirteen percentage points, Brown’s take-home average was ninety-six versus forty-eight point six in person, andChinese homework scores rose eighteen percent while monthly and entrance exams fell twenty and eighteen to twenty-four percent.UnitPercent changeHomework score18%Completion time-30%Monthly exam-20%Entrance exam low-18%Entrance exam high-24%
This is the cleanest picture of the output-mastery split. Homework scores rose 18% and completion time fell 30%, both attractive outcomes. Yet monthly examinations fell 20% and entrance examinations declined between 18% and 24%.
Las tareas mejoraron mientras cayeron losexámenes controlados en ChinaCambios informados entre 26.811 estudiantes chinos seguidos durante 30 meses; los valores negativosindican caídas.Made for Freddy Vega, by HanademiFuentes: Strömberg, D., Lei, V., & Wu, Y. (2026). The generative AI learning penalty: Evidence from Chinese secondary education.CEPR Discussion Paper 21577.Análisis de Hanademi: Las calificaciones A subieron trece puntos porcentuales, el promedio del examen para casa de Brown fue noventa y seis frente acuarenta y ocho punto seis en persona, y las tareas en China subieron dieciocho por ciento mientras los exámenes mensuales y de ingreso cayeron…UnidadCambio porcentualNota de tareas18 %Tiempo de finalización-30 %Examen mensual-20 %Ingreso, extremo bajo-18 %Ingreso, extremo alto-24 %
Esta es la imagen más clara de la división entre resultado y dominio. Las notas de las tareas subieron un 18% y el tiempo de finalización cayó un 30%, dos resultados atractivos. Sin embargo, los exámenes mensuales cayeron un 20% y los de ingreso disminuyeron entre un 18% y un 24%.
AI-friendly problems lost the most studytimeDecline in time spent on math problems that students could readily enter into AI tools, based on 3.2 millioninteractions.Made for Freddy Vega, by HanademiSources: Rismanchian, S., Uzun, H., Matayoshi, J., Cosyn, E., & Kurd-Misto, E. (2026). Faster completion, less learning:Generative AI reduced study time on math problems and the knowledge they build. arXiv.UnitDecline in study time31.3%High school26.9%College9%Middle school
Learning time fell most where AI was easiest to use. High school students reduced time by 31.3% and university students by 26.9%. The danger is not exposure to AI itself, but repeatedly removing the effort that practice is meant to create.
Los problemas aptos para IA perdieronmás tiempo de estudioCaída del tiempo dedicado a problemas matemáticos que podían introducirse fácilmente en herramientas deIA, basada en 3,2 millones de interacciones.Made for Freddy Vega, by HanademiFuentes: Rismanchian, S., Uzun, H., Matayoshi, J., Cosyn, E., & Kurd-Misto, E. (2026). Faster completion, less learning:Generative AI reduced study time on math problems and the knowledge they build. arXiv.UnidadCaída del tiempo de estudio31,3 %Secundaria superior26,9 %Universidad9 %Secundaria media
El tiempo de aprendizaje cayó más donde la IA era más fácil de usar. Los estudiantes de secundaria superior redujeron el tiempo un 31,3% y los universitarios un 26,9%. El peligro no es la exposición a la IA en sí, sino eliminar repetidamente el esfuerzo que la práctica debe producir.
Correct-answer odds fell 25% on retentionquestionsCumulative decline in the chance of a correct answer on randomly assigned, proctored retention questions ina large math study.Made for Freddy Vega, by HanademiSources: Rismanchian, S., Uzun, H., Matayoshi, J., Cosyn, E., & Kurd-Misto, E. (2026). Faster completion, lesslearning: Generative AI reduced study time on math problems and the knowledge they build. arXiv.UnitDecline in correct-answer chance25%Cumulative decline
The immediate convenience was followed by a measurable retention penalty. On randomly assigned and proctored questions, the chance of a correct answer declined cumulatively by 25%. This is a decline in probability, not a 25-point fall in examination scores.
La probabilidad de acertar cayó un 25% enpreguntas de retenciónCaída acumulada de la probabilidad de acertar preguntas de retención asignadas al azar y supervisadas enun gran estudio de matemáticas.Made for Freddy Vega, by HanademiFuentes: Rismanchian, S., Uzun, H., Matayoshi, J., Cosyn, E., & Kurd-Misto, E. (2026). Faster completion, lesslearning: Generative AI reduced study time on math problems and the knowledge they build. arXiv.UnidadCaída de la probabilidad de acertar25 %Caída acumulada
A la comodidad inmediata le siguió una penalización medible en la retención. En preguntas asignadas al azar y supervisadas, la probabilidad de acertar cayó de forma acumulada un 25%. Es una caída de probabilidad, no una disminución de 25 puntos en las notas.
AI-assisted students retained less in onerandomized trialLong-term knowledge retained after AI-assisted or traditional study in one randomized experiment.Made for Freddy Vega, by HanademiSources: Akgun, M., & Toker, S. (2025). ChatGPT as a cognitive crutch: Effects on learning and retention. Social Sciences &Humanities Open.UnitKnowledge retained68.5%Traditional study57.5%AI-assisted
The difference appears after the immediate task is over. Traditional learners retained 68.5% of the knowledge, while AI-assisted learners retained 57.5%. On-demand support can feel like easier training while leaving less strength behind.
Los estudiantes asistidos por IA retuvieronmenos en un ensayo aleatorioConocimiento retenido a largo plazo después de estudiar con IA o de forma tradicional en un experimentoaleatorio.Made for Freddy Vega, by HanademiFuentes: Akgun, M., & Toker, S. (2025). ChatGPT as a cognitive crutch: Effects on learning and retention. Social Sciences &Humanities Open.UnidadConocimiento retenido68,5 %Estudio tradicional57,5 %Con asistencia de IA
La diferencia aparece después de terminar la tarea inmediata. Quienes estudiaron de forma tradicional retuvieron el 68,5% del conocimiento, mientras quienes usaron IA retuvieron el 57,5%. La ayuda bajo demanda puede hacer que el entrenamiento parezca más fácil y dejar menos fortaleza después.
Who controls the help can double the gainThree-month performance gains in a randomized chess study with more than 200 students.Made for Freddy Vega, by HanademiSources: Knowledge at Wharton. (2026, February 24). When does AI assistance undermine learning?Hanademi analysis: AI-assisted students retained fifty-seven point five percent versus sixty-eight point five percent traditionally, while ateacher-supported six-week program delivered one point five to two years of ordinary gains and controlled help produced sixty-four percent…UnitPerformance gainOn-demand help30%Controlled help64%2.1x
The model was the same kind of tool; the protocol changed. Unrestricted help produced a 30% gain, while controlled timing produced 64%. The useful AI behaves like a coach who chooses the moment to intervene, not a substitute available for every move.
Quien controla la ayuda puede duplicar elavanceAvances de rendimiento durante tres meses en un estudio aleatorio de ajedrez con más de 200 estudiantes.Made for Freddy Vega, by HanademiFuentes: Knowledge at Wharton. (2026, February 24). When does AI assistance undermine learning?Análisis de Hanademi: Los estudiantes asistidos por IA retuvieron cincuenta y siete punto cinco por ciento frente a sesenta y ocho punto cinco porciento con estudio tradicional, mientras un programa de seis semanas apoyado por docentes produjo entre uno punto cinco y dos años de avance…UnidadAvance de rendimientoAyuda bajo demanda30 %Ayuda controlada64 %2,1x
El tipo de herramienta era el mismo; cambió el protocolo. La ayuda sin restricciones produjo un avance del 30%, mientras el control del momento produjo un 64%. La IA útil actúa como un entrenador que elige cuándo intervenir, no como un sustituto disponible para cada movimiento.
Purpose-built K-12 AI agents show amoderate positive learning effectacross 34 studies.The pooled score of 0.404 covers multiple subjects and grade levels and should not begeneralized to every use of generative AI.Sources: Liu, J., Mbowe, A. E., Tahri, D., & Aziku, M. (2026). Meta-analysis on the influence of AI agents on K-12 student cognitive performance.Computers in Human Behavior Reports, 21, 100973.Hanademi analysis: A thirty-four-study review reported a positive pooled learning score of zero point four zero four, but twenty strong causal papers divided byeight hundred repository papers equals only two point five percent.
The evidence is not uniformly negative. A 2026 review of 34 K-12 studies found a moderate positive overall effect on cognitive learning. The distinction matters: these were purpose-built educational agents, not unrestricted chatbots completing homework.
Los agentes de IA diseñados paraescuelas muestran un efecto positivomoderado en 34 estudios.La puntuación combinada de 0,404 abarca distintas materias y cursos y no debegeneralizarse a todos los usos de la IA generativa.Fuentes: Liu, J., Mbowe, A. E., Tahri, D., & Aziku, M. (2026). Meta-analysis on the influence of AI agents on K-12 student cognitive performance.Computers in Human Behavior Reports, 21, 100973.Análisis de Hanademi: Una revisión de treinta y cuatro estudios informó una puntuación agregada positiva de aprendizaje de cero punto cuatro cero cuatro, peroveinte trabajos con evidencia causal sólida divididos entre ochocientos trabajos del repositorio equivalen a solo dos punto cinco por ciento.
La evidencia no es uniformemente negativa. Una revisión de 2026 con 34 estudios escolares halló un efecto general positivo moderado sobre el aprendizaje cognitivo. La distinción importa: eran agentes educativos diseñados para ese fin, no chatbots sin restricciones que hacían las tareas.
Only a sliver of K-12 AI research isstrongly causalPapers in Stanford’s 2026 K-12 repository versus papers with strong evidence that an AI tool caused anoutcome.Made for Freddy Vega, by HanademiSources: Fesler, L., Martinez Claeys, J. P., Agnew, C., & Loeb, S. (2026). The evidence base on AI in K-12: A 2026 review. Stanford SCALE Initiative.; Liu, J., Mbowe, A. E.,Tahri, D., & Aziku, M. (2026). Meta-analysis on the influence of AI agents on K-12 student cognitive performance. Computers in Human Behavior Reports, 21, 100973.Hanademi analysis: A thirty-four-study review reported a positive pooled learning score of zero point four zero four, but twenty strong causal papersdivided by eight hundred repository papers equals only two point five percent.UnitPapersRepository papers · 800Strong causal evidence · 20
The volume of research is much larger than the dependable causal core. Stanford found only 20 papers with strong cause-and-effect evidence in a repository containing more than 800. The field may be promising, but it is still radically immature.
Solo una fracción de la investigación escolar sobre IAtiene evidencia causal sólidaTrabajos del repositorio escolar de Stanford de 2026 frente a trabajos con evidencia sólida de que unaherramienta de IA causó un resultado.Made for Freddy Vega, by HanademiFuentes: Fesler, L., Martinez Claeys, J. P., Agnew, C., & Loeb, S. (2026). The evidence base on AI in K-12: A 2026 review. Stanford SCALE Initiative.; Liu, J., Mbowe, A. E.,Tahri, D., & Aziku, M. (2026). Meta-analysis on the influence of AI agents on K-12 student cognitive performance. Computers in Human Behavior Reports, 21, 100973.Análisis de Hanademi: Una revisión de treinta y cuatro estudios informó una puntuación agregada positiva de aprendizaje de cero punto cuatro cero cuatro,pero veinte trabajos con evidencia causal sólida divididos entre ochocientos trabajos del repositorio equivalen a solo dos punto cinco por ciento.UnidadTrabajosTrabajos del repositorio · 800Evidencia causal sólida · 20
El volumen de investigación es mucho mayor que su núcleo causal fiable. Stanford encontró solo 20 trabajos con evidencia sólida de causa y efecto en un repositorio con más de 800. El campo puede ser prometedor, pero todavía es radicalmente inmaduro.
Six weeks of teacher-supported AItutoring delivered gains equivalent to1.5 to 2 school years.The intervention was teacher-supported and structured, which limits comparison withunrestricted individual chatbot use.Sources: De Simone, M., Tiberti, F., Barron Rodriguez, M., Manolio, F., Mosuro, W., & Dikoru, E. J. (2025). From chalkboards to chatbots: Evaluating theimpact of generative AI on learning outcomes in Nigeria. World Bank Policy Research Working Paper 11125.
The strongest hopeful result combines AI with teachers rather than removing them. A six-week program in Nigeria produced gains estimated as 1.5 to 2 years of ordinary schooling. That figure is a randomized cost-effectiveness comparison, not the literal time students attended.
Seis semanas de tutoría con IA ydocentes produjeron avances equivalentesa 1,5 a 2 años escolares.La intervención contó con apoyo docente y una estructura definida, lo que limita sucomparación con el uso individual y sin restricciones de un chatbot.Fuentes: De Simone, M., Tiberti, F., Barron Rodriguez, M., Manolio, F., Mosuro, W., & Dikoru, E. J. (2025). From chalkboards to chatbots: Evaluating theimpact of generative AI on learning outcomes in Nigeria. World Bank Policy Research Working Paper 11125.
El resultado esperanzador más fuerte combina la IA con docentes en lugar de eliminarlos. Un programa de seis semanas en Nigeria produjo avances estimados como 1,5 a 2 años de escolaridad habitual. Esa cifra es una comparación aleatoria de rentabilidad educativa, no el tiempo literal de asistencia.
AI helped most when people stayed in theloopResults from separate randomized K-12 mathematics studies involving human tutors and AI-generatedfeedback.Made for Freddy Vega, by HanademiSources: Wang, R. E., Ribeiro, A. T., Robinson, C. D., Loeb, S., & Demszky, D. (2024). Tutor CoPilot: A human-AI approach forscaling real-time expertise. Stanford University.; A large scale randomized control trial showing LLM generated feedbackhelps low-knowledge middle school math students with short-term learning. (2026). ACM Digital Library.UnitLearning improvementTutor CoPilot4%9%All studentsLower-rated tutorsAI feedback16%7%Fix current answerSolve next problem
These studies preserve a role for both the teacher and the learner. Tutor CoPilot raised mastery by 9 points for students with lower-rated tutors. In a separate trial, AI feedback increased immediate correction by 16% and next-problem success by 7%.
La IA ayudó más cuando las personassiguieron dentro del procesoResultados de estudios escolares aleatorios separados sobre tutores humanos y retroalimentaciónmatemática generada por IA.Made for Freddy Vega, by HanademiFuentes: Wang, R. E., Ribeiro, A. T., Robinson, C. D., Loeb, S., & Demszky, D. (2024). Tutor CoPilot: A human-AI approach forscaling real-time expertise. Stanford University.; A large scale randomized control trial showing LLM generated feedbackhelps low-knowledge middle school math students with short-term learning. (2026). ACM Digital Library.UnidadMejora del aprendizajeTutor CoPilot4 %9 %Todos los estudiantesTutores con menor valoraciónRetroalimentación con IA16 %7 %Corregir respuesta actualResolver problema siguiente
Estos estudios preservan un papel para el docente y el estudiante. Tutor CoPilot elevó el dominio en 9 puntos entre alumnos con tutores de menor valoración. En otro ensayo, la retroalimentación con IA aumentó la corrección inmediata un 16% y el éxito en el problema siguiente un 7%.
Math help needed safeguards before it wasdependableShare of generated math-help problems failing quality checks before and after subject-specific filtering.Made for Freddy Vega, by HanademiSources: Pardos, Z. A., & Bhandari, S. (2024). ChatGPT-generated help produces learning gains equivalent to humantutor-authored help on mathematics skills. PLOS ONE.Hanademi analysis: Raw math help failed on thirty-two percent of problems, while subtracting detector accuracies of sixty-nineand sixty-one percent from one hundred gives error rates of thirty-one and thirty-nine percent.UnitProblems failing checksInitial help32%Filtered algebra0%Filtered statistics13%
The learning gains came with a reliability problem. Initial help failed quality checks on 32% of problems. Added safeguards reduced failures to zero in the algebra set and 13% in statistics, showing that deployment quality depends on checking.
La ayuda matemática necesitó salvaguardasantes de ser fiableProporción de problemas de ayuda matemática que fallaron controles de calidad antes y después de filtrosespecíficos por materia.Made for Freddy Vega, by HanademiFuentes: Pardos, Z. A., & Bhandari, S. (2024). ChatGPT-generated help produces learning gains equivalent tohuman tutor-authored help on mathematics skills. PLOS ONE.Análisis de Hanademi: La ayuda matemática sin filtrar falló en treinta y dos por ciento de los problemas, mientras que restar de cienlas precisiones de los detectores, de sesenta y nueve y sesenta y uno por ciento, da tasas de error de treinta y uno y treinta y nueve…UnidadProblemas que fallaron controlesAyuda inicial32 %Álgebra filtrada0 %Estadística filtrada13 %
Los avances de aprendizaje llegaron con un problema de fiabilidad. La ayuda inicial falló los controles en el 32% de los problemas. Las salvaguardas redujeron los fallos a cero en álgebra y al 13% en estadística, lo que muestra que la calidad del despliegue depende de la verificación.
Reliability fails on both sidesFailure rates across raw math help and AI detector evaluations, with detector errors derived from overallaccuracy.Made for Freddy Vega, by HanademiSources: Pardos, Z. A., & Bhandari, S. (2024). ChatGPT-generated help produces learning gains equivalent to human tutor-authored help on mathematics skills. PLOS ONE. Hadra, M.,Cambridge, K., & Mesbah, M. (2026). Evaluating the accuracy and reliability of AI content detectors in academic contexts. International Journal for Educational Integrity, 22, 4.Hanademi analysis: Raw math help failed on thirty-two percent of problems, while subtracting detector accuracies of sixty-nine and sixty-onepercent from one hundred gives error rates of thirty-one and thirty-nine percent.UnitFailure rateRaw math-help failure32%Originality error31%Turnitin error39%
Education faces a two-sided reliability problem. Raw AI math help failed on 32% of problems, while detector errors reached 31% for Originality and 39% for Turnitin.
La fiabilidad falla por ambos ladosTasas de fallo en ayuda matemática sin filtrar y evaluaciones de detectores de IA, con errores dedetectores derivados de la precisión general.Made for Freddy Vega, by HanademiFuentes: Pardos, Z. A., & Bhandari, S. (2024). ChatGPT-generated help produces learning gains equivalent to human tutor-authored help on mathematics skills. PLOS ONE. Hadra, M.,Cambridge, K., & Mesbah, M. (2026). Evaluating the accuracy and reliability of AI content detectors in academic contexts. International Journal for Educational Integrity, 22, 4.Análisis de Hanademi: La ayuda matemática sin filtrar falló en treinta y dos por ciento de los problemas, mientras que restar de cien lasprecisiones de los detectores, de sesenta y nueve y sesenta y uno por ciento, da tasas de error de treinta y uno y treinta y nueve por ciento.UnidadTasa de falloRaw math-help failure32 %Originality error31 %Turnitin error39 %
La educación enfrenta un problema de fiabilidad por ambos lados. La ayuda matemática sin filtrar falló en el 32% de los problemas, mientras que los errores de los detectores alcanzaron el 31% en Originality y el 39% en Turnitin.
The best AI protocol preserves thestudent’s turnEvidence-backed sequence synthesized from controlled-help, human-tutor, feedback and quality-checkstudies.Made for Freddy Vega, by HanademiSources: Knowledge at Wharton. (2026, February 24). When does AI assistance undermine learning?; Wang, R. E., Ribeiro, A. T., Robinson, C. D., Loeb, S., & Demszky, D. (2024). Tutor CoPilot: A human-AI approachfor scaling real-time expertise. Stanford University.; Pardos, Z. A., & Bhandari, S. (2024). ChatGPT-generated help produces learning gains equivalent to human tutor-authored help on mathematics skills. PLOS ONE.Hanademi analysis: AI-assisted students retained fifty-seven point five percent versus sixty-eight point five percent traditionally, while a teacher-supported six-weekprogram delivered one point five to two years of ordinary gains and controlled help produced sixty-four percent performance growth versus thirty percent on demand.StudentattemptsAI gives timedhintStudent revisesHuman or filterchecksStudentanswers again
The studies point to a common protocol. The student tries first, receives limited feedback, revises, and must transfer the learning to another answer. Teachers and safeguards remain in the loop because both timing and reliability change the outcome.
El mejor protocolo de IA preserva el turnodel estudianteSecuencia respaldada por estudios de ayuda controlada, tutores humanos, retroalimentación y controles decalidad.Made for Freddy Vega, by HanademiFuentes: Knowledge at Wharton. (2026, February 24). When does AI assistance undermine learning?; Wang, R. E., Ribeiro, A. T., Robinson, C. D., Loeb, S., & Demszky, D. (2024). Tutor CoPilot: A human-AI approach forscaling real-time expertise. Stanford University.; Pardos, Z. A., & Bhandari, S. (2024). ChatGPT-generated help produces learning gains equivalent to human tutor-authored help on mathematics skills. PLOS ONE.Análisis de Hanademi: Los estudiantes asistidos por IA retuvieron cincuenta y siete punto cinco por ciento frente a sesenta y ocho punto cinco por ciento con estudio tradicional,mientras un programa de seis semanas apoyado por docentes produjo entre uno punto cinco y dos años de avance ordinario y la ayuda controlada generó sesenta y cuatro por…El estudianteintentaLa IA da unapista oportunaEl estudianterevisaUna persona ofiltro verificaEl estudianteresponde de nuevo
Los estudios apuntan a un protocolo común. El estudiante intenta primero, recibe retroalimentación limitada, revisa y debe transferir el aprendizaje a otra respuesta. Los docentes y las salvaguardas permanecen dentro del proceso porque tanto el momento como la fiabilidad cambian el resultado.
The learning crisis began before ChatGPTPISA mathematics scores in 2022 compared with the 2018–2022 point decline, a period largely precedingpublic generative AI.Made for Freddy Vega, by HanademiSources: OECD. (2023). PISA 2022 results, Volume I: The state of learning and equity in education. OECD Publishing.; OECD. (2023).How did countries perform in PISA? In PISA 2022 results, Volume I.Hanademi analysis: PISA had already fallen fifteen math points and ten reading points, a ten-year laptop experiment across five hundredthirty-one schools found no significant gains, and phone restrictions across four thousand six hundred schools had almost no overall test effect.UnitPISA points575Singapore 2022492Ireland 2022152018–2022 math decline
AI did not create the baseline crisis. From 2018 to 2022, OECD mathematics performance fell 15 points, a decline already equal to 18.1% of the 83-point spread between Singapore and Ireland in the listed PISA ranking.
La crisis de aprendizaje comenzó antes deChatGPTPuntuaciones de matemáticas PISA en 2022 comparadas con la caída de puntos entre 2018 y 2022, unperiodo en gran medida anterior a la IA generativa pública.Made for Freddy Vega, by HanademiFuentes: OECD. (2023). PISA 2022 results, Volume I: The state of learning and equity in education. OECD Publishing.; OECD. (2023).How did countries perform in PISA? In PISA 2022 results, Volume I.Análisis de Hanademi: PISA ya había caído quince puntos en matemáticas y diez en lectura, un experimento de portátiles de diez años en quinientas treinta y unaescuelas no halló mejoras significativas y las restricciones de teléfonos en cuatro mil seiscientas escuelas casi no tuvieron efecto general en los exámenes.UnidadPuntos PISA575Singapur 2022492Irlanda 202215Caída en matemáticas 2018–2022
La IA no creó la crisis de partida. Entre 2018 y 2022, el rendimiento de matemáticas de la OCDE cayó 15 puntos, una disminución equivalente al 18,1% de la brecha de 83 puntos entre Singapur e Irlanda en la clasificación PISA mostrada.
Singapore led PISA mathematicsTen highest PISA 2022 mathematics scores available in the research corpus.Made for Freddy Vega, by HanademiSources: OECD. (2023). How did countries perform in PISA? In PISA 2022 results, Volume I.; World Population Review.(2026). PISA scores by country 2026, using PISA 2022 data.Hanademi analysis: Singapore’s five hundred seventy-five points minus Ireland’s four hundred ninety-two gives aneighty-three-point spread, and the fifteen-point mathematics decline divided by eighty-three equals eighteen point one percent.UnitPISA mathematics pointsSingapore575Macao China552Chinese Taipei547Hong Kong540Japan536South Korea527Estonia510Switzerland508Canada497Ireland492
The benchmark is demanding. Singapore reached 575 points, followed by Macao China at 552 and Chinese Taipei at 547. Any claim that AI will transform education must be judged against systems already producing exceptional measured mastery.
Singapur lideró las matemáticas de PISADiez puntuaciones más altas de matemáticas de PISA 2022 disponibles en el corpus.Made for Freddy Vega, by HanademiFuentes: OECD. (2023). How did countries perform in PISA? In PISA 2022 results, Volume I.; World PopulationReview. (2026). PISA scores by country 2026, using PISA 2022 data.Análisis de Hanademi: Los quinientos setenta y cinco puntos de Singapur menos los cuatrocientos noventa y dos de Irlanda dan una brechade ochenta y tres puntos, y la caída de quince puntos en matemáticas dividida entre ochenta y tres equivale a dieciocho punto uno por…UnidadPuntos PISA de matemáticasSingapur575Macao, China552Taipéi Chino547Hong Kong540Japón536Corea del Sur527Estonia510Suiza508Canadá497Irlanda492
La referencia es exigente. Singapur alcanzó 575 puntos, seguido de Macao, China, con 552 y Taipéi Chino con 547. Cualquier afirmación de que la IA transformará la educación debe juzgarse frente a sistemas que ya producen un dominio medido excepcional.
Evidence is mixed on technology-only schoolpoliciesA 10-year randomized laptop follow-up in rural Peru and a contested 2026 national study of lockable phonepouches.Made for Freddy Vega, by HanademiSources: Cueto, S., Beuermann, D., Cristia, J., Malamud, O., & Ramos Pardo, F. J. (2025). Laptops in the long run: Evidence from the One Laptop per Child program in rural Peru.NBER Working Paper 34495.; National Bureau of Economic Research. (2026). Study of school cellphone bans using lockable pouches. NBER Working Paper 35132.Hanademi analysis: PISA had already fallen fifteen math points and ten reading points, a ten-year laptop experiment across five hundred thirty-one schools foundno significant gains, and phone restrictions across four thousand six hundred schools had almost no overall test effect.Add laptopsComputer skillsimproveNo broadacademic gainLock phonesawayOverall effectnear zero
Technology access alone has a weak educational record. A 10-year randomized follow-up in 531 rural Peruvian schools found better computer skills but no significant academic gains. A separate, contested study of 4,600 schools found phone pouches had almost no overall effect on test scores.
La evidencia es mixta sobre las políticasescolares centradas solo en tecnologíaUn seguimiento aleatorio de portátiles durante 10 años en el Perú rural y un estudio nacional disputado de2026 sobre bolsas cerradas para móviles.Made for Freddy Vega, by HanademiFuentes: Cueto, S., Beuermann, D., Cristia, J., Malamud, O., & Ramos Pardo, F. J. (2025). Laptops in the long run: Evidence from the One Laptop per Child program in rural Peru.NBER Working Paper 34495.; National Bureau of Economic Research. (2026). Study of school cellphone bans using lockable pouches. NBER Working Paper 35132.Análisis de Hanademi: PISA ya había caído quince puntos en matemáticas y diez en lectura, un experimento de portátiles de diez años en quinientas treinta y unaescuelas no halló mejoras significativas y las restricciones de teléfonos en cuatro mil seiscientas escuelas casi no tuvieron efecto general en los exámenes.Añadir portátilesMejoran habilidadesinformáticasSin avanceacadémico amplioGuardar móvilesbajo llaveEfecto generalcercano a cero
El acceso a la tecnología por sí solo tiene un historial educativo débil. Un seguimiento aleatorio de 10 años en 531 escuelas rurales peruanas halló mejores habilidades informáticas, pero no avances académicos significativos. Otro estudio disputado de 4.600 escuelas encontró que las bolsas para móviles casi no afectaron las notas generales.
The students behind the scoresStudents enter the AI era after OECD mathematics and reading performance had already fallensharply.Sources: OECD. (2023). PISA 2022 results, Volume I: The state of learning and equity in education. OECD Publishing.
The debate can become abstract, but the stakes are students. They inherit a learning decline that began before public generative AI. The opportunity is to use new tools to repair learning systems rather than repeat the assumption that access alone creates achievement.
Los estudiantes detrás de las puntuacionesLos estudiantes entran en la era de la IA después de que el rendimiento de matemáticas y lectura dela OCDE ya hubiera caído con fuerza.Fuentes: OECD. (2023). PISA 2022 results, Volume I: The state of learning and equity in education. OECD Publishing.
El debate puede volverse abstracto, pero lo que está en juego son los estudiantes. Heredan una caída del aprendizaje que comenzó antes de la IA generativa pública. La oportunidad consiste en usar nuevas herramientas para reparar los sistemas educativos y no repetir la suposición de que el acceso por sí solo produce rendimiento.
AI is already changing teen career plansResponses from 1,111 U.S. teens ages 13 to 18 surveyed in February 2026.Made for Freddy Vega, by HanademiSources: National 4-H Council. (2026, June 15). Young people recognize AI skills are essential for future careers, many feelunprepared.Hanademi analysis: Forty-one percent of teens had already changed their desired job and sixty-one percent expected fewer opportunities,even while eighty percent of senior executives reported no employment or productivity effect.UnitPercent of teens61%Expect fewer jobs48%Feel prepared41%Changed job goal40%AI skills matter29%Lack guidance26%Work reshaped
The psychological labor-market shock is already here. Forty-one percent said AI changed the jobs they wanted, and 61% expected fewer opportunities across many fields. Yet only 48% felt prepared, making career guidance an immediate educational responsibility.
La IA ya está cambiando los planesprofesionales juvenilesRespuestas de 1.111 adolescentes estadounidenses de 13 a 18 años encuestados en febrero de 2026.Made for Freddy Vega, by HanademiFuentes: National 4-H Council. (2026, June 15). Young people recognize AI skills are essential for future careers, manyfeel unprepared.Análisis de Hanademi: El cuarenta y uno por ciento de los adolescentes ya había cambiado el trabajo que deseaba y el sesenta y uno por cientoesperaba menos oportunidades, aunque el ochenta por ciento de los altos ejecutivos no declaraba efectos sobre el empleo ni la productividad.UnidadPorcentaje de adolescentes61 %Espera menos empleos48 %Se siente preparado41 %Cambió su meta laboral40 %Importan habilidades de IA29 %Carece de orientación26 %Trabajo transformado
El impacto psicológico en el mercado laboral ya está aquí. El 41% dijo que la IA cambió los empleos que quería y el 61% esperaba menos oportunidades en muchos sectores. Sin embargo, solo el 48% se sentía preparado, lo que convierte la orientación profesional en una responsabilidad educativa inmediata.
Most executives still report no AI impactShare of senior executives reporting in 2026 that AI had not affected employment or productivity in theirorganizations.Made for Freddy Vega, by HanademiSources: Krass, P. (2026, May 8). How much will AI impact tomorrow’s workforce? New data on the future of workwith AI. MIT Initiative on the Digital Economy.Hanademi analysis: Coding benchmark performance rose from four point four to seventy-one point seven percent whileeight in ten senior executives still reported no effect on either employment or productivity.UnitExecutives reporting no effect8%No reported effect
Capability and deployment are running on different clocks. Eight in ten senior executives reported no effect on employment or productivity in their organizations. That does not predict a quiet future, but it explains why youth anxiety can lead measured workplace change.
La mayoría de los directivos aún noinforma impacto de la IAProporción de altos directivos que informó en 2026 que la IA no había afectado el empleo ni laproductividad de sus organizaciones.Made for Freddy Vega, by HanademiFuentes: Krass, P. (2026, May 8). How much will AI impact tomorrow’s workforce? New data on the future ofwork with AI. MIT Initiative on the Digital Economy.Análisis de Hanademi: El rendimiento en la prueba de programación subió de cuatro punto cuatro a setenta y uno punto siete por cientomientras ocho de cada diez altos ejecutivos todavía declaraban no observar efectos sobre el empleo ni la productividad.UnidadDirectivos que informan ningún efecto8 %Sin efecto informado
La capacidad y el despliegue avanzan con relojes distintos. Ocho de cada diez altos directivos no informaron efectos sobre el empleo o la productividad en sus organizaciones. Eso no predice un futuro tranquilo, pero explica por qué la ansiedad juvenil puede adelantarse al cambio medido en el trabajo.
SWE-bench leapt from 4.4% to 71.7%Share of SWE-bench software-engineering problems solved by AI systems in 2023 and 2024.Made for Freddy Vega, by HanademiSources: Stanford Institute for Human-Centered Artificial Intelligence. (2025). Technical performance. AI Index Report 2025.Hanademi analysis: Dividing seventy-one point seven percent of coding problems solved in twenty twenty-four by four point four percent in twentytwenty-three gives a sixteen point three-fold increase, while reliable task length has doubled about every seven months since twenty nineteen.UnitProblems solved20234.4%202471.7%16.3x
In 2023, AI systems solved 4.4% of SWE-bench problems. One year later, they solved 71.7%. Schools cannot make assessment durable simply by selecting tasks that today’s models still fail.
SWE-bench saltó del 4,4% al 71,7%Proporción de problemas de ingeniería de software SWE-bench resueltos por sistemas de IA en 2023 y2024.Made for Freddy Vega, by HanademiFuentes: Stanford Institute for Human-Centered Artificial Intelligence. (2025). Technical performance. AI Index Report 2025.Análisis de Hanademi: Dividir el setenta y uno punto siete por ciento de problemas de programación resueltos en dos mil veinticuatro entre el cuatropunto cuatro por ciento de dos mil veintitrés da un aumento de dieciséis punto tres veces, mientras la duración fiable de las tareas se ha duplicado…UnidadProblemas resueltos20234,4 %202471,7 %16,3x
En 2023, los sistemas de IA resolvieron el 4,4% de los problemas de SWE-bench. Un año después resolvieron el 71,7%. Las escuelas no pueden hacer duradera una evaluación simplemente eligiendo tareas que los modelos actuales todavía no resuelven.
Frontier AI’s reliable software-taskhorizon has doubled about every sevenmonths since 2019.The measure uses software tasks and human completion times. Extending the trend toother occupations or future years remains uncertain.Sources: Kwa, T., West, B., et al. (2025). Measuring AI ability to complete long tasks. Model Evaluation and Threat Research.; Model Evaluation andThreat Research. (2026). Task-completion time horizons of frontier AI models.Hanademi analysis: Dividing seventy-one point seven percent of coding problems solved in twenty twenty-four by four point four percent in twenty twenty-threegives a sixteen point three-fold increase, while reliable task length has doubled about every seven months since twenty nineteen.
Benchmark scores are only one sign of movement. Since 2019, the length of software tasks completed with 50% reliability has doubled roughly every seven months. Curriculum and assessment therefore need designs that survive changing capability, not a frozen list of AI-proof tasks.
El horizonte fiable de tareas de software dela IA avanzada se duplica aproximadamentecada siete meses desde 2019.La medida utiliza tareas de software y tiempos humanos de finalización. Extender latendencia a otras profesiones o años futuros sigue siendo incierto.Fuentes: Kwa, T., West, B., et al. (2025). Measuring AI ability to complete long tasks. Model Evaluation and Threat Research.; Model Evaluation andThreat Research. (2026). Task-completion time horizons of frontier AI models.Análisis de Hanademi: Dividir el setenta y uno punto siete por ciento de problemas de programación resueltos en dos mil veinticuatro entre el cuatro punto cuatro por ciento de dosmil veintitrés da un aumento de dieciséis punto tres veces, mientras la duración fiable de las tareas se ha duplicado aproximadamente cada siete meses desde dos mil diecinueve.
Las puntuaciones de las pruebas son solo una señal del movimiento. Desde 2019, la duración de las tareas de software completadas con un 50% de fiabilidad se ha duplicado aproximadamente cada siete meses. El currículo y la evaluación necesitan diseños que sobrevivan a capacidades cambiantes, no una lista congelada de tareas resistentes a la IA.
The 2030 jobs forecast is positive anddisruptiveWorld Economic Forum global employer forecast in millions of jobs; it covers technology, economic change,demographics and the green transition, not AI alone.Made for Freddy Vega, by HanademiSources: World Economic Forum. (2025). Future of Jobs Report 2025: 78 million new job opportunities by 2030 but urgent upskillingneeded.Hanademi analysis: Ninety-two million displaced jobs exceed the seventy-eight million net gain by fourteen million, even though creation totals onehundred seventy million.UnitMillion jobs050100150170Jobs created-92Jobs displaced78Net gain
The forecast is not simple mass replacement. It projects 170 million jobs created and 92 million displaced, leaving a net gain of 78 million. Youth anxiety remains rational because the number displaced is larger than the entire net gain.
La previsión laboral para 2030 es positivay disruptivaPrevisión mundial del Foro Económico Mundial basada en empleadores, en millones de empleos; abarcatecnología, cambios económicos, demografía y transición verde, no solo IA.Made for Freddy Vega, by HanademiFuentes: World Economic Forum. (2025). Future of Jobs Report 2025: 78 million new job opportunities by 2030 but urgentupskilling needed.Análisis de Hanademi: Los noventa y dos millones de empleos desplazados superan en catorce millones la ganancia neta de setenta yocho millones, aunque la creación totaliza ciento setenta millones.UnidadMillones de empleos050100150170Empleos creados-92Empleos desplazados78Aumento neto
La previsión no describe un reemplazo masivo simple. Proyecta 170 millones de empleos creados y 92 millones desplazados, con un aumento neto de 78 millones. La ansiedad juvenil sigue siendo racional porque el número desplazado supera toda la ganancia neta.
Internet use soared while youthunemployment returned near its 2000 levelU.S. internet use as a share of population, 2000 to 2024, and modeled youth unemployment ages 15 to 24,2000 to 2025.Made for Freddy Vega, by HanademiSources: World Bank. (n.d.). Individuals using the Internet (% of population) [IT.NET.USER.ZS]. World Bank Open Data.; World Bank. (n.d.).Unemployment, youth total (% of total labor force ages 15-24) (modeled ILO estimate) [SL.UEM.1524.ZS]. World Bank Open Data.Hanademi analysis: United States internet use rose from forty-three point one percent in two thousand to ninety-four point seven percent in twentytwenty-four, while youth unemployment moved from nine point three to eight point nine percent over the same endpoints.UnitPercentInternet use43.1%94.7%20002024Youth unemployment9.3%9.3%20002025
The internet offers a caution against treating technological adoption as permanent mass unemployment. Use rose from 43.1% in 2000 to 94.7% in 2024, while youth unemployment moved through crises and reached 9.34% in 2025, close to 9.28% in 2000. This does not prove AI will follow the same path, but it shows why adaptation and transition matter more than a static job count.
El uso de internet se disparó mientras el desempleojuvenil volvió cerca de su nivel de 2000Uso de internet en Estados Unidos como proporción de la población, 2000 a 2024, y desempleo juvenilmodelado de 15 a 24 años, 2000 a 2025.Made for Freddy Vega, by HanademiFuentes: World Bank. (n.d.). Individuals using the Internet (% of population) [IT.NET.USER.ZS]. World Bank Open Data.; World Bank. (n.d.).Unemployment, youth total (% of total labor force ages 15-24) (modeled ILO estimate) [SL.UEM.1524.ZS]. World Bank Open Data.Análisis de Hanademi: El uso de internet en Estados Unidos subió de cuarenta y tres punto uno por ciento en dos mil a noventa y cuatro punto siete porciento en dos mil veinticuatro, mientras el desempleo juvenil pasó de nueve punto tres a ocho punto nueve por ciento entre los mismos extremos.UnidadPorcentajeUso de internet43,1 %94,7 %20002024Desempleo juvenil9,3 %9,3 %20002025
Internet ofrece una advertencia contra interpretar la adopción tecnológica como desempleo masivo permanente. El uso subió del 43,1% en 2000 al 94,7% en 2024, mientras el desempleo juvenil atravesó varias crisis y llegó al 9,34% en 2025, cerca del 9,28% de 2000. Esto no demuestra que la IA seguirá el mismo camino, pero muestra por qué la adaptación y la transición importan más que una cifra laboral estática.

La investigación detrás de esta presentación

El trabajo entregado parecía excelente, pero el rendimiento controlado y las denuncias del profesor contaron otra historia. Un solo curso disputado se convirtió en una advertencia sobre si las notas aún miden conocimiento independiente.

Hallazgos clave

El argumento

Esta investigación se publica en inglés y español. Read in English