GPT-4 passed 67% of HumanEval problems at first attempt, more than twice the Codex result. HumanEval contains only 164 short problems, so this is not broad engineering competence. It is enough to make submitted code weak evidence of independent student ability.
GPT-4 superó 67% de los problemas de HumanEval al primer intento, más del doble que Codex. HumanEval contiene solamente 164 problemas breves, así que esto no demuestra competencia amplia de ingeniería. Sí basta para debilitar la entrega como prueba de capacidad independiente.
These terms separate output from learning. A benchmark tests whether code passes, while tracing tests whether a student follows the logic. Cognitive offloading explains why a tool can improve immediate performance without building the same unaided ability.
Estos términos separan el resultado del aprendizaje. Una prueba comprueba si el código funciona, mientras el rastreo comprueba si el estudiante sigue la lógica. La descarga cognitiva explica por qué una herramienta puede mejorar el desempeño inmediato sin desarrollar la misma capacidad independiente.
The important test came after the tool disappeared. Students assigned unrestricted GPT scored 17% below controls, a measured effect of -17%. The safeguarded tutor did not produce the same significant penalty.
La prueba importante ocurrió después de retirar la herramienta. Los estudiantes asignados a GPT libre obtuvieron 17% menos que el control, un efecto medido de -17%. El tutor protegido no produjo la misma penalización significativa.
International reviews placed introductory-programming failure near 28% to 33% before generative AI. In spring 2026, UC Berkeley reported 35.3% receiving F grades in CS 10 and 10.6% in CS 61A. The foundation was already difficult, and local course conditions still matter.
Revisiones internacionales situaron la reprobación en programación introductoria cerca de 28% a 33% antes de la IA generativa. En la primavera de 2026, UC Berkeley reportó 35,3% con calificación F en CS 10 y 10,6% en CS 61A. La base ya era difícil y las condiciones de cada curso siguen importando.
Nuremberg Tech observed first-semester failure double to approximately 50% in winter 2023/24. That is severe enough to demand investigation. It remains one course and does not prove that AI caused a global decline.
Nuremberg Tech observó que la reprobación del primer semestre se duplicó hasta aproximadamente 50% en el invierno de 2023/24. Es suficientemente grave para exigir investigación. Sigue siendo un solo curso y no demuestra que la IA causó un deterioro global.
Reading, tracing and writing code are related skills, although the evidence does not prove a simple one-way cause. External tools can improve immediate performance while creating dependence. Parsons problems and worked examples show that support can reduce irrelevant difficulty while preserving later independent practice.
Leer, rastrear y escribir código son habilidades relacionadas, aunque la evidencia no demuestra una causa simple en una sola dirección. Las herramientas externas pueden mejorar el desempeño inmediato y crear dependencia. Los problemas Parsons y los ejemplos resueltos pueden reducir dificultad irrelevante mientras conservan práctica independiente posterior.
Learners need practice reading and tracing code before delegating its generation.
Los estudiantes necesitan practicar la lectura y el seguimiento del código antes de delegar su generación.
The danger is not merely that an answer can be wrong. It can be wrong, long and persuasive at the same time. Researchers classified 52% of sampled answers as inaccurate and 77% as unnecessarily verbose.
El peligro no es solamente que una respuesta pueda estar equivocada. Puede estar equivocada, ser larga y resultar persuasiva al mismo tiempo. Investigadores clasificaron 52% de las respuestas como inexactas y 77% como innecesariamente verbosas.
Generated code can fit the task and still carry weak locks. Secure Code Warrior's 2026 index reported an average of 15 vulnerabilities per codebase. Beginners cannot verify risks they have not learned to recognize.
El código generado puede cumplir la tarea y conservar cerraduras débiles. El índice de Secure Code Warrior de 2026 reportó un promedio de 15 vulnerabilidades por base de código. Los principiantes no pueden verificar riesgos que todavía no saben reconocer.
In one 2024 survey, 86% reported using AI, 54% used it weekly and 24% used it daily. In a separate UK survey, 53% used generative AI in assessed work and 13% generated assessed text. Policies based on invisible compliance cannot carry this load.
En una encuesta de 2024, 86% informó usar IA, 54% la usaba semanalmente y 24% a diario. En otra encuesta británica, 53% usó IA generativa en trabajo evaluado y 13% generó texto evaluado. Las políticas basadas en cumplimiento invisible no pueden soportar esta carga.
These essays were written by people, yet 61.22% triggered at least one detector. All 7 detectors flagged 19.78%. The sample is small, but the result makes detector-led punishment difficult to defend.
Estos ensayos fueron escritos por personas, pero 61,22% activó al menos un detector. Los 7 detectores marcaron 19,78%. La muestra es pequeña, pero el resultado dificulta defender castigos dirigidos por detectores.
When detectors can flag human work, instructors still need direct evidence of reasoning.
Cuando los detectores pueden señalar trabajo humano, el profesorado aún necesita evidencia directa del razonamiento.
One randomized experiment found developers completed a bounded task 55.8% faster with Copilot. A separate 2025 experiment found 16 experienced developers took 19% longer across 246 tasks. Students eventually need to learn when AI helps, when it fails and how to verify the difference.
Un experimento aleatorio encontró que desarrolladores completaron una tarea acotada 55,8% más rápido con Copilot. Otro experimento de 2025 encontró que 16 desarrolladores experimentados tardaron 19% más en 246 tareas. El alumnado debe aprender cuándo ayuda la IA, cuándo falla y cómo verificar la diferencia.
In Stack Overflow's 2024 survey, 62% used AI development tools and another 14% planned to use them. The educational question is therefore timing, not whether the tools exist. Students need manual control before relying on professional automation.
En la encuesta de Stack Overflow de 2024, 62% usaba herramientas de desarrollo con IA y otro 14% planeaba usarlas. La pregunta educativa es cuándo introducirlas, no si existen. El alumnado necesita control manual antes de depender de la automatización profesional.
Preparing students for AI-enabled work means delaying substitution, not avoiding tools forever.
Preparar a los estudiantes para el trabajo con IA implica retrasar la sustitución, no evitar las herramientas para siempre.
Constrained assistance can operate at classroom scale. CodeAid served approximately 700 programming students and recorded more than 8,000 interactions over 12 weeks. Scale does not prove learning effectiveness, but it shows that the choice is not limited to unrestricted access or a total ban.
La asistencia restringida puede operar a escala de aula. CodeAid atendió aproximadamente a 700 estudiantes de programación y registró más de 8.000 interacciones durante 12 semanas. La escala no demuestra eficacia educativa, pero muestra que las opciones no se limitan al acceso libre o a una prohibición total.
The policy separates 3 modes instead of choosing one rule forever. Early courses prohibit complete solution generation, while hint-based tutoring can preserve reasoning. Later courses require AI-assisted verification because professional literacy includes recognizing failure.
La política separa 3 modos en lugar de elegir una sola regla para siempre. Los cursos iniciales prohíben generar soluciones completas, mientras la tutoría con pistas puede conservar el razonamiento. Los cursos posteriores exigen verificación asistida por IA porque la alfabetización profesional incluye reconocer fallos.
Internet use in Colombia rose from near zero to 79.35% of the population by 2024. This does not measure student AI use. It does show why enforcement cannot depend only on a campus network.
El uso de internet en Colombia subió desde casi cero hasta 79,35% de la población en 2024. Esto no mide el uso estudiantil de IA. Sí muestra por qué la aplicación no puede depender solamente de una red universitaria.
UK internet use reached 95.47% in 2024 and has remained near that level since 2020. This does not reveal which students use AI. It makes network-only enforcement implausible.
El uso de internet en Reino Unido alcanzó 95,47% en 2024 y se mantiene cerca de ese nivel desde 2020. Esto no revela qué estudiantes usan IA. Hace poco creíble una aplicación basada solamente en la red.
Japan's series rose sharply and peaked at 93.18% in 2016 before settling at 85.54% in 2024. Annual estimates move, but access remains broad. A university policy therefore needs assessment controls, not only technical blocking.
La serie de Japón subió con fuerza y alcanzó un máximo de 93,18% en 2016 antes de situarse en 85,54% en 2024. Las estimaciones anuales cambian, pero el acceso sigue siendo amplio. Una política universitaria necesita controles de evaluación, no solamente bloqueos técnicos.
US internet use reached 94.69% in 2024. Students can reach online tools through many channels beyond a university network. Enforcement must therefore focus on observable performance and clear rules.
El uso de internet en Estados Unidos alcanzó 94,69% en 2024. El alumnado puede acceder a herramientas en línea mediante muchos canales fuera de la red universitaria. La aplicación debe centrarse en desempeño observable y reglas claras.
Colombia's fixed broadband rate rose steadily to 17.22 subscriptions per 100 people in 2024. Growth slowed sharply after 2022. A device-based policy must account for unequal access without pretending that campus blocking prevents AI use.
La tasa de banda ancha fija de Colombia subió de forma sostenida hasta 17,22 suscripciones por cada 100 personas en 2024. El crecimiento se frenó con fuerza después de 2022. Una política basada en dispositivos debe considerar el acceso desigual sin fingir que el bloqueo del campus impide usar IA.
UK fixed broadband subscriptions rose rapidly in the 2000s and reached 42.16 per 100 people in 2024. The curve has slowed, but connectivity is deeply established. Take-home assessment cannot assume that denying campus access removes the tool.
Las suscripciones de banda ancha fija en Reino Unido crecieron rápidamente en la década de 2000 y alcanzaron 42,16 por cada 100 personas en 2024. La curva se ha frenado, pero la conectividad está profundamente establecida. La evaluación fuera del aula no puede suponer que negar el acceso en el campus elimina la herramienta.
US fixed broadband rose from 2.51 subscriptions per 100 people in 2000 to 38.86 in 2024. The long climb makes personal access a structural fact. Policy must verify learning rather than promise perfect technical exclusion.
La banda ancha fija de Estados Unidos subió de 2,51 suscripciones por cada 100 personas en 2000 a 38,86 en 2024. El largo crecimiento convierte el acceso personal en un hecho estructural. La política debe verificar el aprendizaje en lugar de prometer exclusión técnica perfecta.
Secure-server density grew quickly in both countries, but the United States reached 196,616 per million people in 2024 versus 68,395 in the UK. This measures infrastructure, not secure AI output. More secure servers do not make generated code automatically safe.
La densidad de servidores seguros creció rápidamente en ambos países, pero Estados Unidos alcanzó 196.616 por millón de personas en 2024 frente a 68.395 en Reino Unido. Esto mide infraestructura, no código seguro generado por IA. Más servidores seguros no vuelven seguro automáticamente el código generado.
Japan reached 32,929 secure servers per million people in 2024, while Colombia reached 1,126. Both grew, but on very different scales. Infrastructure context cannot replace secure-coding instruction or testing.
Japón alcanzó 32.929 servidores seguros por millón de personas en 2024, mientras Colombia alcanzó 1.126. Ambos crecieron, pero en escalas muy distintas. El contexto de infraestructura no sustituye la enseñanza de programación segura ni las pruebas.
ICT goods fell from 19.8% to 9.05% of US goods exports and from 17.37% to 3.43% in the UK. The technology economy changed, but this indicator does not measure software work or AI demand. The stronger case for later AI literacy comes from direct professional adoption.
Los bienes TIC bajaron de 19,8% a 9,05% de las exportaciones estadounidenses y de 17,37% a 3,43% en Reino Unido. La economía tecnológica cambió, pero este indicador no mide trabajo de software ni demanda de IA. El argumento más fuerte para alfabetización posterior proviene de la adopción profesional directa.
Japan's ICT goods share fell from 22.16% in 2000 to 7.64% in 2024. Colombia remained below 0.5% throughout the series. These differences caution against using national export structure as a substitute for direct evidence about developer tools.
La participación de bienes TIC de Japón bajó de 22,16% en 2000 a 7,64% en 2024. Colombia permaneció por debajo de 0,5% durante toda la serie. Estas diferencias aconsejan no sustituir evidencia directa sobre herramientas de desarrollo por estructura exportadora nacional.
In 2025, unemployment among workers with advanced education was 9.02% in Colombia, 3.37% in the UK and 2.93% in the US. The series does not isolate programmers or AI skills. It does show why universities must protect foundations while still preparing students for changing work.
En 2025, el desempleo entre trabajadores con educación avanzada fue 9,02% en Colombia, 3,37% en Reino Unido y 2,93% en Estados Unidos. La serie no aísla programadores ni habilidades de IA. Sí muestra por qué las universidades deben proteger las bases mientras preparan al alumnado para un trabajo cambiante.
A polished submission can no longer prove who understood the code. The central distinction is generating code versus understanding it.
Key findings
After AI removal, students assigned unrestricted GPT scored 17% below controls, while the safeguarded tutor did not produce the same significant penalty. National Bureau of Economic Research
Seven detectors flagged 61.22% of 91 non-native English TOEFL essays at least once, and all seven flagged 19.78%. Cell Press
A 2025 METR experiment reported 16 experienced developers took 19% longer with AI across 246 tasks, despite predicting a 24% speedup. Model Evaluation and Threat Research
In a mathematics field experiment, unrestricted GPT assistance raised practice performance by 48%, while a safeguarded tutor raised it by 127%. National Bureau of Economic Research
A multinational study of 216 first-year students reported a mean programming-assessment score of 23.8 out of 110. Association for Computing Machinery
Across 517 Stack Overflow questions, researchers classified 52% of ChatGPT answers as inaccurate and 77% as unnecessarily verbose. Association for Computing Machinery
In a 47-participant experiment, AI-assistant users produced less secure code in several tasks and were more likely to believe their answers were secure. Association for Computing Machinery
In spring 2026, Berkeleytime reported F grades for 35.3% of UC Berkeley CS 10 students and 10.6% of CS 61A students. dailycal.org
A 2026 preprint reported a 46-point calibration gap as GenAI reliance peaked where task complexity was highest and objective accuracy lowest. doi.org
Secure Code Warrior’s 2026 AI Trust Index reported that AI-generated code introduced an average of 15 vulnerabilities per codebase. darkreading.com
OpenAI reported HumanEval pass-at-one scores of 28.8% for Codex, 48.1% for GPT-3.5 and 67.0% for GPT-4. OpenAI
The argument
Without AI access, unrestricted GPT produced a -17% penalty versus controls.
AI entered a fragile subject, but one diagnosis cannot fit every course.
A 50% local failure rate demands investigation, not a universal verdict.
Students must reason through code before asking AI to generate it.
Learners need practice reading and tracing code before delegating its generation.
Fluent output raises the verification burden where novices are weakest.
This research is published in English and Spanish. Ver en español
La investigación detrás de esta presentación
Una entrega pulida ya no demuestra quién entendió el código. La distinción central es generar código frente a comprenderlo.
Hallazgos clave
Tras retirar la IA, los estudiantes asignados a GPT libre obtuvieron 17% menos que el control, mientras el tutor protegido no produjo la misma penalización significativa. National Bureau of Economic Research
Siete detectores marcaron al menos una vez 61,22% de 91 ensayos TOEFL de no nativos, y los siete marcaron 19,78%. Cell Press
Un experimento de METR de 2025 informó que 16 desarrolladores experimentados tardaron 19% más con IA en 246 tareas, pese a predecir una mejora de 24%. Model Evaluation and Threat Research
En un experimento de matemáticas, la asistencia libre de GPT elevó 48% el desempeño de práctica y un tutor protegido lo elevó 127%. National Bureau of Economic Research
Un estudio multinacional de 216 estudiantes de primer año informó una puntuación media de programación de 23,8 sobre 110. Association for Computing Machinery
En 517 preguntas de Stack Overflow, investigadores clasificaron 52% de las respuestas de ChatGPT como inexactas y 77% como innecesariamente verbosas. Association for Computing Machinery
En un experimento con 47 participantes, usuarios de un asistente produjeron código menos seguro en varias tareas y creyeron con mayor frecuencia que era seguro. Association for Computing Machinery
En la primavera de 2026, Berkeleytime reportó calificaciones F para 35,3% del alumnado de CS 10 y 10,6% del de CS 61A en UC Berkeley. dailycal.org
Un preprint de 2026 reportó una brecha de calibración de 46 puntos cuando la dependencia de GenAI alcanzó su máximo en las tareas más complejas y menos precisas. doi.org
El AI Trust Index 2026 de Secure Code Warrior reportó que el código generado por IA introdujo en promedio 15 vulnerabilidades por base de código. darkreading.com
OpenAI informó resultados HumanEval al primer intento de 28,8% para Codex, 48,1% para GPT-3.5 y 67,0% para GPT-4. OpenAI
El argumento
Sin acceso a IA, GPT libre produjo una penalización de -17% frente al control.
La IA entró en una materia frágil, pero un diagnóstico no sirve para todos los cursos.
Una reprobación local de 50% exige investigación, no un veredicto universal.
El alumnado debe razonar el código antes de pedir que la IA lo genere.
Los estudiantes necesitan practicar la lectura y el seguimiento del código antes de delegar su generación.
La fluidez aumenta la carga de verificación donde el principiante es más débil.
Esta investigación se publica en inglés y español. Read in English