AI can produce answers without producing learningLa IA puede producir respuestas sin producir aprendizaje · V7
29 slides · 26 min · 2026-08-04language
ENES
theme
LightDark
view
DeckTableTalk
brand
HanademiPlatzi
Fluent performance is not dependable competence.
AI raised undergraduate knowledge by 0.27 SD, with gains lasting one week.
Removing struggle can improve the worksheet while weakening the learner.
Un rendimiento fluido no equivale a una competencia fiable.
La IA elevó 0,27 DE el conocimiento universitario y la mejora duró una semana.
Eliminar el esfuerzo puede mejorar la tarea y debilitar al estudiante.
The same experiment produced a spectacular win and a serious failure. GPT-4 improved speed, completion, and quality on suitable consulting tasks. On a task outside its capability frontier, assisted consultants lost 19 points in accuracy.
El mismo experimento produjo un éxito espectacular y un fracaso serio. GPT-4 mejoró la rapidez, la finalización y la calidad en tareas de consultoría adecuadas. En una tarea fuera de su frontera de capacidad, los consultores con IA perdieron 19 puntos de precisión.
These terms separate visible performance from durable learning. Effect sizes allow comparisons across different tests. Unaided transfer asks whether students can still reason when the tool is gone.
Estos términos separan el rendimiento visible del aprendizaje duradero. Los tamaños de efecto permiten comparar pruebas distintas. La transferencia sin ayuda pregunta si los estudiantes todavía pueden razonar cuando la herramienta desaparece.
Higher-order thinking is not answer production. The revised taxonomy distinguishes 6 processes, culminating in analysis, evaluation, and creation. Knowing a recipe is different from diagnosing why the cake failed and redesigning it.
El pensamiento de orden superior no consiste en producir respuestas. La taxonomía revisada distingue 6 procesos y culmina en analizar, evaluar y crear. Conocer una receta es distinto de diagnosticar por qué falló el pastel y rediseñarla.
Critical thinking is teachable, but it does not appear automatically. Interventions across 117 studies averaged an effect near 0.30 standard deviations. Prompted self-explanation reached about 0.55, while Boston policy debate produced analytical gains of 0.13.
El pensamiento crítico se puede enseñar, pero no aparece automáticamente. Las intervenciones en 117 estudios promediaron un efecto cercano a 0,30 desviaciones estándar. La autoexplicación guiada alcanzó cerca de 0,55, mientras el debate de políticas en Boston produjo mejoras analíticas de 0,13.
Because devices already mediate classroom work, deeper thinking must be deliberately built into each task.
Como los dispositivos ya median el trabajo en el aula, el pensamiento profundo debe incorporarse deliberadamente en cada tarea.
Student adoption moved quickly. In this 2024 survey, 86% used AI regularly, 54% used it weekly, and 24% used it daily. The survey covered 3,839 students across 16 countries.
La adopción estudiantil avanzó rápidamente. En esta encuesta de 2024, el 86% usaba IA regularmente, el 54% cada semana y el 24% a diario. La encuesta cubrió a 3.839 estudiantes de 16 países.
When AI assistance sits beside the assignment, guidance must reach students at the point of use.
Cuando la asistencia de IA está junto a la tarea, la orientación debe llegar al alumnado en el momento de uso.
This is the strongest case for AI assistance. Professionals finished 40% faster, improved quality by 18%, and completed 10% more work. But the experiment measured task output, not durable learning.
Este es el caso más sólido a favor de la asistencia con IA. Los profesionales terminaron un 40% antes, mejoraron la calidad un 18% y completaron un 10% más de trabajo. Pero el experimento midió el resultado de la tarea, no el aprendizaje duradero.
Not every AI-assisted gain disappears when the session ends. In one randomized undergraduate experiment, AI access raised immediate knowledge scores by 0.27 standard deviations. The improvement persisted one week later.
No toda mejora asistida por IA desaparece al terminar la sesión. En un experimento aleatorizado con universitarios, el acceso a IA elevó 0,27 desviaciones estándar los resultados inmediatos de conocimiento. La mejora persistió una semana.
During practice, both AI conditions produced large gains. The safeguarded tutor performed especially well because it supported reasoning rather than freely supplying answers. After AI removal, the unrestricted group scored 17% below controls.
Durante la práctica, ambas condiciones con IA produjeron grandes mejoras. El tutor con salvaguardas funcionó especialmente bien porque apoyaba el razonamiento en vez de entregar respuestas libremente. Tras retirar la IA, el grupo sin restricciones obtuvo un 17% menos que el control.
The pattern repeats at much larger scale. Homework scores increased and completion time fell after AI adoption. Yet monthly exam scores declined 20% within six months.
El patrón se repite a una escala mucho mayor. Las notas de tareas aumentaron y el tiempo de finalización disminuyó tras adoptar IA. Sin embargo, las notas de exámenes mensuales bajaron un 20% en seis meses.
AI can sit at the center of a task while independent performance remains the test of learning.
La IA puede ocupar el centro de una tarea, pero el desempeño independiente sigue siendo la prueba del aprendizaje.
Tutor CoPilot did not replace tutors. It gave about 900 tutors real-time support across sessions involving 1,800 students. Mastery rose 4 points overall and 9 points for students of lower-rated tutors.
Tutor CoPilot no sustituyó a los tutores. Dio apoyo en tiempo real a unos 900 tutores en sesiones con 1.800 estudiantes. El dominio aumentó 4 puntos en general y 9 puntos entre estudiantes de tutores con menor calificación.
This assessment points toward genuine instructional promise. The AI lesson reached an estimated post-score of 4.3, compared with 3.5 for the active in-class lesson. The values were read from a published image, so the precision is limited.
Esta evaluación apunta a una promesa educativa real. La lección con IA alcanzó una puntuación posterior estimada de 4,3, frente a 3,5 para la lección activa presencial. Los valores se leyeron de una imagen publicada, por lo que la precisión es limitada.
Tutoring has a meaningful average effect near 0.37 standard deviations. When Spain scaled online mathematics tutoring, effects reached 0.15 for grades and 0.11 for standardized tests. Those results remain far below Bloom's famous 2-sigma benchmark.
La tutoría tiene un efecto promedio significativo cercano a 0,37 desviaciones estándar. Cuando España amplió la tutoría virtual de matemáticas, los efectos llegaron a 0,15 en notas y 0,11 en pruebas estandarizadas. Esos resultados siguen muy por debajo de la famosa referencia de 2 sigma de Bloom.
Across 225 undergraduate STEM studies, active learning improved examination performance by 0.47 standard deviations. That result is stronger evidence than passive answer consumption. AI should create more attempts, explanations, and revisions, not remove them.
En 225 estudios universitarios STEM, el aprendizaje activo mejoró 0,47 desviaciones estándar el rendimiento en exámenes. Ese resultado tiene más respaldo que el consumo pasivo de respuestas. La IA debe crear más intentos, explicaciones y revisiones, no eliminarlos.
An AI answer can sound like a confident witness with an unreliable memory. One study found GPT-3.5 fabricated 55% of references and GPT-4 fabricated 18%. Separate legal tests reported hallucination rates from 58% to 88%.
Una respuesta de IA puede sonar como un testigo seguro con memoria poco fiable. Un estudio encontró que GPT-3.5 inventó el 55% de las referencias y GPT-4 el 18%. Pruebas jurídicas separadas informaron tasas de alucinación entre el 58% y el 88%.
Students must look past fluent output and inspect the evidence underneath.
El alumnado debe mirar más allá de una respuesta fluida y examinar la evidencia que la sustenta.
These essays were written by people, yet detectors repeatedly called them machine-generated. Across seven tools, 61.2% were flagged on average. At least one detector flagged 97% of the 91 essays.
Estos ensayos fueron escritos por personas, pero los detectores los clasificaron repetidamente como generados por máquinas. En siete herramientas, el 61,2% fue señalado en promedio. Al menos un detector señaló el 97% de los 91 ensayos.
A safer misconduct process does not begin and end with a detector score. Version histories reveal the work's development. Oral questions, supervised baseline work, and source verification test whether the student understands and owns the submission.
Un proceso más seguro ante una posible falta no empieza ni termina con una puntuación de detector. Los historiales de versiones revelan el desarrollo del trabajo. Las preguntas orales, el trabajo base supervisado y la verificación de fuentes comprueban si el estudiante comprende y domina la entrega.
Inside the capability frontier, below-average consultants gained about 43% in quality. Above-average consultants gained about 17%. AI can therefore compress visible performance gaps during assisted work.
Dentro de la frontera de capacidad, los consultores por debajo del promedio ganaron cerca del 43% en calidad. Los consultores por encima ganaron alrededor del 17%. La IA puede reducir las brechas visibles durante el trabajo asistido.
Tres comparaciones distintas se concentran alrededor de un múltiplo de mejora de 2,5x cuando la IA está limitada o dirigida a un punto de partida más débil.
The submitted product is no longer complete evidence of learning. A stronger design combines 5 layers: unaided baseline work, a record of AI use, verification, reflection, and oral defense. Each layer answers a different question about capability and authorship.
El producto entregado ya no es una prueba completa del aprendizaje. Un diseño más sólido combina 5 capas: trabajo base sin ayuda, registro del uso de IA, verificación, reflexión y defensa oral. Cada capa responde una pregunta distinta sobre capacidad y autoría.
Course evaluation must stop treating one polished product as the whole outcome. Measure assisted output, then test unaided transfer and delayed retention. Add source accuracy and explanation quality to reveal whether students can defend what they submitted.
La evaluación del curso debe dejar de tratar un producto pulido como el resultado completo. Mida el resultado asistido y después pruebe la transferencia sin ayuda y la retención retrasada. Añada precisión de fuentes y calidad de explicación para saber si los estudiantes pueden defender lo entregado.
AI can raise output while hiding weaker understanding. Guardrails, active practice, verification, and human tutoring change that equation. The decisive test is what students can explain and transfer after assistance is removed.
La IA puede elevar el resultado mientras oculta una comprensión más débil. Las salvaguardas, la práctica activa, la verificación y la tutoría humana cambian esa ecuación. La prueba decisiva es lo que los estudiantes pueden explicar y transferir después de retirar la ayuda.
Fluent performance is not dependable competence. The core question is what remains when assistance disappears.
Key findings
After AI removal, students previously assigned unrestricted GPT scored 17% lower than controls on an unaided examination. University of Pennsylvania
The same intervention moved from a 48% assisted gain to a 17% unaided deficit, showing that product performance and learning can diverge. University of Pennsylvania
A 2025 preprint with 54 participants reported lower EEG connectivity and weaker recall during LLM-assisted essay writing than in brain-only writing.
On a task outside GPT-4's capability frontier, AI-assisted consultants were 19 percentage points less likely than controls to give the correct answer. Harvard Business School
Across seven detectors, 61.2% of 91 human-written TOEFL essays were flagged on average, and 97% were flagged by at least one detector. Patterns
Across 26,811 Chinese students, staggered AI adoption raised homework scores 18% and cut completion time 30%, but lowered monthly exam scores 20% within six months. studylib.net
In secondary mathematics, unrestricted GPT raised assisted practice performance by 48%, while a safeguarded GPT tutor raised it by 127%. University of Pennsylvania
One bibliographic study found fabricated-reference rates of 55% for GPT-3.5 and 18% for GPT-4. Scientific Reports
Legal tests reported hallucination rates near 58% for GPT-4, 69% for ChatGPT, 72% for PaLM 2, and 88% for Llama 2. Journal of Legal Analysis
The consulting experiment produced gains of 12.2% in task completion, 25.1% in speed, and over 40% in quality, but a 19-point accuracy loss elsewhere. Harvard Business School
The same survey reported 58% felt insufficiently knowledgeable, 72% wanted more training, and 80% said university AI integration fell short. Digital Education Council
The argument
A correct-looking answer may never reach analysis, evaluation, or creation.
Reasoning grows when students must explain, argue, and justify.
Universities began writing traffic rules after students were driving.
For bounded work, AI can improve speed and visible quality together.
AI raised undergraduate knowledge by 0.27 SD, with gains lasting one week.
Removing struggle can improve the worksheet while weakening the learner.
This research is published in English and Spanish. Ver en español
La investigación detrás de esta presentación
Un rendimiento fluido no equivale a una competencia fiable. La pregunta central es qué permanece cuando desaparece la ayuda.
Hallazgos clave
Tras retirar la IA, los estudiantes asignados anteriormente a GPT sin restricciones obtuvieron un 17% menos que el grupo de control en un examen sin ayuda. University of Pennsylvania
La misma intervención pasó de una mejora asistida del 48% a un déficit sin ayuda del 17%, mostrando que rendimiento y aprendizaje pueden divergir. University of Pennsylvania
Un preprint de 2025 con 54 participantes informó menor conectividad EEG y recuerdo más débil al escribir ensayos con LLM que sin herramientas.
En una tarea fuera de la frontera de GPT-4, los consultores con IA tuvieron 19 puntos porcentuales menos de probabilidad de acertar que el grupo de control. Harvard Business School
En siete detectores, el 61,2% de 91 ensayos TOEFL humanos fue señalado en promedio, y el 97% fue señalado por al menos uno. Patterns
Entre 26.811 estudiantes chinos, la adopción escalonada de IA elevó 18% las notas de tareas y redujo 30% el tiempo, pero bajó 20% los exámenes mensuales en seis meses. studylib.net
En matemáticas de secundaria, GPT sin restricciones elevó el rendimiento asistido un 48%, mientras un tutor GPT con salvaguardas lo elevó un 127%. University of Pennsylvania
Un estudio bibliográfico encontró tasas de referencias inventadas del 55% para GPT-3.5 y del 18% para GPT-4. Scientific Reports
Pruebas jurídicas informaron tasas de alucinación cercanas al 58% para GPT-4, 69% para ChatGPT, 72% para PaLM 2 y 88% para Llama 2. Journal of Legal Analysis
El experimento produjo mejoras del 12,2% en tareas, 25,1% en rapidez y más del 40% en calidad, pero una pérdida de precisión de 19 puntos en otra tarea. Harvard Business School
La misma encuesta informó que el 58% se sentía insuficientemente informado, el 72% quería más formación y el 80% consideraba deficiente la integración universitaria. Digital Education Council
El argumento
Una respuesta correcta puede no llegar al análisis, la evaluación o la creación.
El razonamiento crece cuando los estudiantes deben explicar, debatir y justificar.
Las universidades comenzaron a redactar reglas cuando los estudiantes ya conducían.
En tareas acotadas, la IA puede mejorar rapidez y calidad visible.
La IA elevó 0,27 DE el conocimiento universitario y la mejora duró una semana.
Eliminar el esfuerzo puede mejorar la tarea y debilitar al estudiante.
Esta investigación se publica en inglés y español. Read in English