Faster code needs stronger QAEl código más rápido necesita un QA más fuerte · V7
30 slides · 23 min · 2026-08-05language
ENES
theme
LightDark
view
DeckTableTalk
brand
HanademiPlatzi
Feeling faster did not translate into faster completion.
Copilot cut one task from 161.8 to 71.2 minutes.
Plausible mistakes are expensive because they look ready to ship.
Sentirse más rápido no se tradujo en una finalización más rápida.
Copilot redujo una tarea de 161,8 a 71,2 minutos.
Los errores plausibles son costosos porque parecen listos para entregar.
GitHub reported more than 70,000 new public generative-AI projects in 2024, alongside 98% project growth and 59% contribution growth. A separate study dataset grew from 1 repository to 269. At another scale, Alberta reported using Claude Code to scan 466 million government code lines in 20 hours. These are distinct scopes, but each points toward more software material reaching automated and human quality systems.
GitHub reportó más de 70.000 proyectos públicos nuevos de IA generativa en 2024, junto con crecimiento de proyectos de 98% y de contribuciones de 59%. Un conjunto separado de estudio creció de 1 repositorio a 269. En otra escala, Alberta reportó el uso de Claude Code para analizar 466 millones de líneas de código gubernamental en 20 horas. Son alcances distintos, pero todos apuntan a más material de software llegando a sistemas de calidad automatizados y humanos.
The argument depends on the difference between generating code and delivering a dependable change. Repositories hold real systems, while pull requests bring proposed changes into review. SWE-bench measures issue resolution, and security debt describes weaknesses that survive delivery.
El argumento depende de la diferencia entre generar código y entregar un cambio confiable. Los repositorios contienen sistemas reales, mientras las solicitudes de incorporación llevan cambios propuestos a revisión. SWE-bench mide la resolución de problemas y la deuda de seguridad describe debilidades que sobreviven a la entrega.
As generation accelerates, readable code can still conceal issues that review and testing must uncover.
A medida que se acelera la generación, el código legible aún puede ocultar problemas que la revisión y las pruebas deben descubrir.
AI coding capability has moved beyond autocomplete toward resolving real repository issues. The accepted latest figure is roughly 41% of selected SWE-bench tasks. That capability can increase the machine-generated change entering delivery systems. The earlier trend was not independently verified, so only the latest value is stated.
La capacidad de programación con IA avanzó más allá del autocompletado hacia la resolución de problemas reales de repositorios. La última cifra aceptada es aproximadamente 41% de tareas seleccionadas de SWE-bench. Esa capacidad puede aumentar los cambios generados por máquinas que entran en los sistemas de entrega. La tendencia anterior no se verificó de forma independiente, por lo que solo se expresa el último valor.
The scale gap turns faster generation into a larger and more concentrated burden for human reviewers.
La brecha de escala convierte la generación más rápida en una carga mayor y más concentrada para los revisores humanos.
AI tools had become normal for many developers by 2024. Yet trust lagged: 76% used or planned to use them, while only 43% trusted their accuracy. That gap creates verification work. Adoption increases exposure before confidence is settled.
Las herramientas de IA se habían vuelto normales para muchos desarrolladores en 2024. Sin embargo, la confianza quedó rezagada: 76% las usaba o planeaba usarlas, mientras solo 43% confiaba en su precisión. Esa brecha crea trabajo de verificación. La adopción aumenta la exposición antes de que la confianza esté resuelta.
Copilot users completed a bounded JavaScript task in 71.2 minutes, compared with 161.8 minutes for the control group. GitHub reported a 55.8% speed gain, while another experiment reported a 53.2% improvement in the likelihood of passing all project unit tests. A separate 2026 study observed throughput reaching 2.09 times its pre-mandate baseline across 802 developers. These results support acceleration, but none alone measures the full delivery system.
Los usuarios de Copilot completaron una tarea acotada de JavaScript en 71,2 minutos, frente a 161,8 minutos en el grupo de control. GitHub reportó una ganancia de velocidad de 55,8%, mientras otro experimento reportó una mejora de 53,2% en la probabilidad de aprobar todas las pruebas unitarias del proyecto. Un estudio separado de 2026 observó que el rendimiento llegó a 2,09 veces su nivel previo al mandato entre 802 desarrolladores. Estos resultados respaldan la aceleración, pero ninguno mide por sí solo todo el sistema de entrega.
In GitHub's enterprise survey, 92% used AI coding tools at work. A smaller 70% perceived benefits, and 57% expected better code quality. Access and use arrived first, while confidence in the result followed more cautiously. QA operates in that difference.
En la encuesta empresarial de GitHub, 92% usaba herramientas de IA para programar en el trabajo. Un 70% menor percibía beneficios y 57% esperaba mejor calidad del código. El acceso y el uso llegaron primero, mientras la confianza en el resultado avanzó con más cautela. QA opera en esa diferencia.
The hardest AI error is an answer that looks finished but is slightly wrong. Among surveyed users, 66% cited almost-correct answers and 45% said debugging generated code consumed more time. Anthropic later analyzed about 400,000 Claude Code sessions to study tasks, collaboration and success. At that scale, verification behavior becomes part of the production system.
El error de IA más difícil es una respuesta que parece terminada, pero está ligeramente equivocada. Entre los usuarios encuestados, 66% señaló respuestas casi correctas y 45% dijo que depurar código generado consumía más tiempo. Anthropic analizó después aproximadamente 400.000 sesiones de Claude Code para estudiar tareas, colaboración y éxito. A esa escala, el comportamiento de verificación se convierte en parte del sistema de producción.
The reported local effects are positive. DORA associated greater adoption with 3.1% faster review, 1.3% faster approval and 7.5% better documentation. Those gains matter because QA should automate routine work where evidence supports it. They do not prove that the complete delivery system became more stable.
Los efectos locales reportados son positivos. DORA asoció una mayor adopción con revisión 3,1% más rápida, aprobación 1,3% más rápida y documentación 7,5% mejor. Esas ganancias importan porque QA debe automatizar el trabajo rutinario cuando la evidencia lo respalda. No demuestran que todo el sistema de entrega se haya vuelto más estable.
The review burden was not hypothetical for this surveyed population. In 2026, 78.6% of 322 Japanese reviewers said they had fixed bugs or incidents caused by AI-generated code. The survey does not establish a universal defect rate. It does show that human correction remains part of AI-assisted delivery.
La carga de revisión no era hipotética para esta población encuestada. En 2026, 78,6% de 322 revisores japoneses dijo haber corregido errores o incidentes causados por código generado con IA. La encuesta no establece una tasa universal de defectos. Sí muestra que la corrección humana sigue siendo parte de la entrega asistida por IA.
AI can generate tests, but each quality threshold removes more of them. Meta reported that 75% built, 57% passed and only 25% increased coverage for the targeted class. QA still has to determine whether generated tests represent the real requirement and meaningful failures. The test oracle cannot simply be delegated to the code generator.
La IA puede generar pruebas, pero cada umbral de calidad elimina más de ellas. Meta reportó que 75% compiló, 57% pasó y solo 25% aumentó cobertura para la clase objetivo. QA todavía debe determinar si las pruebas generadas representan el requisito real y fallos significativos. El oráculo de prueba no puede delegarse simplemente al generador de código.
AI does not enter a clean security environment. Veracode reported security debt in 70% of sampled organizations and critical debt in 46%. Research is broadening: SecDrift evaluates 7 models across 8 critical-infrastructure sectors and 9 vulnerability categories, while another study analyzed over 12,000 agent actions across 5 coding models. A separate 58-person controlled study found no significant overall increase in severe bugs, so the evidence supports validation rather than a universal claim that every assistant worsens security.
La IA no entra en un entorno de seguridad limpio. Veracode reportó deuda de seguridad en 70% de las organizaciones muestreadas y deuda crítica en 46%. La investigación se amplía: SecDrift evalúa 7 modelos en 8 sectores de infraestructura crítica y 9 categorías de vulnerabilidades, mientras otro estudio analizó más de 12.000 acciones de agentes en 5 modelos de programación. Un estudio controlado separado con 58 personas no encontró un aumento general significativo de errores graves, por lo que la evidencia respalda la validación y no una afirmación universal de que todo asistente empeora la seguridad.
The reported code-level direction is favorable. DORA associated AI adoption with 3.4% better perceived code quality, 1.8% lower perceived complexity and 7.5% better documentation. These are local and perceived attributes. They should be measured separately from system-level stability.
La dirección reportada a nivel de código es favorable. DORA asoció la adopción de IA con 3,4% mejor calidad percibida del código, 1,8% menor complejidad percibida y 7,5% mejor documentación. Estos son atributos locales y percibidos. Deben medirse por separado de la estabilidad del sistema.
The reported measures move in opposite directions. Documentation and review speed improved, while delivery stability was 7.2% lower. That does not prove AI caused the decline. It does show why QA must measure both the code artifact and the behavior of the complete delivery system.
Las medidas reportadas avanzan en direcciones opuestas. La documentación y la velocidad de revisión mejoraron, mientras la estabilidad de entrega fue 7,2% menor. Esto no demuestra que la IA causara la caída. Sí muestra por qué QA debe medir tanto el artefacto de código como el comportamiento de todo el sistema de entrega.
The financial cost of security failure moved upward. IBM reported that the global average breach cost rose from $3.86 million in 2020 to $4.88 million in 2024. These are breach costs, not an estimate of AI-generated defects. They show why assurance savings cannot be judged only by coding speed.
El costo financiero de los fallos de seguridad aumentó. IBM reportó que el costo promedio global de una filtración subió de US$3,86 millones en 2020 a US$4,88 millones en 2024. Estos son costos de filtraciones, no una estimación de defectos generados por IA. Muestran por qué el ahorro en aseguramiento no puede evaluarse únicamente por la velocidad de programación.
Security failures can persist for months before identification and containment are complete. IBM reported an average breach lifecycle of 258 days in 2024. That delay turns a missed weakness into prolonged operational exposure. The supplied historical trend was not independently verified, so only the latest value is stated.
Los fallos de seguridad pueden persistir durante meses antes de completar su identificación y contención. IBM reportó un ciclo promedio de filtración de 258 días en 2024. Esa demora convierte una debilidad no detectada en una exposición operativa prolongada. La tendencia histórica suministrada no se verificó de forma independiente, por lo que solo se expresa el último valor.
Employers expect disruption, but their plans are not limited to cutting jobs. The World Economic Forum reported that 77% planned AI-related upskilling and 86% expected business transformation by 2030. A substantial 41% also expected reductions where tasks can be automated. For QA, the defensible conclusion is redesign around supervision, evidence and exceptions.
Los empleadores esperan disrupción, pero sus planes no se limitan a reducir empleos. El Foro Económico Mundial reportó que 77% planeaba capacitación relacionada con IA y 86% esperaba transformación empresarial hacia 2030. Un 41% considerable también esperaba reducciones donde las tareas puedan automatizarse. Para QA, la conclusión defendible es rediseñarse alrededor de supervisión, evidencia y excepciones.
The supplied BLS outlook projected 17% growth for software QA analysts and testers from 2023 to 2033. That compares with 11% for computer occupations and 4% across all occupations. The projection does not prove that AI causes QA employment growth. It does challenge a simple claim that the role is disappearing.
La proyección suministrada de BLS estimó crecimiento de 17% para analistas y testers de QA de software entre 2023 y 2033. Esto se compara con 11% para ocupaciones informáticas y 4% para todas las ocupaciones. La proyección no demuestra que la IA cause crecimiento del empleo en QA. Sí cuestiona una afirmación simple de que el rol está desapareciendo.
A passing unit test answers only part of the quality question. ISO/IEC 25010 defines 9 characteristics, including reliability, security, maintainability and safety. AI can help produce code and tests, but it cannot collapse these dimensions into one score. QA expands toward system evidence, risk and release judgment.
Una prueba unitaria aprobada responde solo una parte de la pregunta de calidad. ISO/IEC 25010 define 9 características, entre ellas fiabilidad, seguridad, mantenibilidad y seguridad operacional. La IA puede ayudar a producir código y pruebas, pero no puede reducir estas dimensiones a una sola puntuación. QA se amplía hacia evidencia del sistema, riesgo y juicio de liberación.
Functional testing is only one part of AI assurance. The EU framework names 7 high-risk duties, while NIST organizes AI risk work into govern, map, measure and manage. A Microsoft PromptKit case study reported 147 findings against 260 requirements across 5 components after 3 audit passes. The QA role increasingly connects product behavior with documented evidence and accountable oversight.
Las pruebas funcionales son solo una parte del aseguramiento de IA. El marco de la UE nombra 7 deberes para alto riesgo, mientras NIST organiza el trabajo de riesgo de IA en gobernar, mapear, medir y gestionar. Un caso de Microsoft PromptKit reportó 147 hallazgos frente a 260 requisitos en 5 componentes después de 3 pasadas de auditoría. El rol de QA conecta cada vez más el comportamiento del producto con evidencia documentada y supervisión responsable.
As QA expands into governance and supply-chain risk, assurance becomes a responsibility across the software ecosystem.
A medida que QA se extiende a la gobernanza y al riesgo de la cadena de suministro, el aseguramiento se convierte en una responsabilidad de todo el ecosistema de software.
Under the independence assumption, the one-review weakness cell is three times the multiple-review weakness cell.
Feeling faster did not translate into faster completion. These terms connect code generation with real software delivery.
Key findings
METR reported that 16 experienced open-source developers completed 246 real repository tasks 19% slower when allowed to use early-2025 AI tools. METR
METR participants expected AI to make them 24% faster and later perceived a 20% gain, but measured completion time indicated a 19% slowdown. METR
During Italy’s ChatGPT ban, GitHub developer output reportedly dropped about 50% within two working days before rebounding as coders adopted VPNs and Tor. pub.towardsai.net
DORA associated a 25% increase in AI adoption with 1.5% lower delivery throughput and 7.2% lower delivery stability. Google Cloud
Uplevel reported no significant pull-request cycle-time improvement among roughly 800 developers using Copilot, while its measured bug measure increased 41%. Uplevel
In a 47-person Stanford study, AI-assistant users produced less secure code on several tasks while expressing greater confidence that their solutions were secure. Stanford University
Researchers reported that approximately 40% of Copilot-generated programs across 89 security scenarios contained potentially exploitable weaknesses. New York University
DORA linked greater AI adoption to 7.2% lower delivery stability despite simultaneously reporting improvements in documentation and review speed. Google Cloud
For experienced open-source developers in the study, forecasts anticipated faster completion when AI was allowed, but the observed result was a 19 percent slowdown; developer forecasts during the study indicated -23 percent. Measuring the Impact of Early-2025 AI on Experienced Open-Source ...
Alberta’s Ministry of Technology and Innovation used Claude Code to scan 466 million lines of government code in 20 hours. anthropic.com
Across 802 developers and 196,212 pull requests, per-capita throughput reached 2.09 times its pre-mandate baseline in April 2026. arxiv.org
The argument
Selected later systems resolved roughly 41% of SWE-bench tasks.
GitHub added over 70,000 public AI projects as observed usage widened.
Widespread use can coexist with deep uncertainty about correctness.
Copilot cut one task from 161.8 to 71.2 minutes.
Tool use became normal before quality improvement became equally convincing.
Plausible mistakes are expensive because they look ready to ship.
This research is published in English and Spanish. Ver en español
La investigación detrás de esta presentación
Sentirse más rápido no se tradujo en una finalización más rápida. Estos términos conectan la generación de código con la entrega real de software.
Hallazgos clave
METR reportó que 16 desarrolladores experimentados completaron 246 tareas reales de repositorios 19% más lento al poder usar herramientas de IA de inicios de 2025. METR
Los participantes de METR esperaban ser 24% más rápidos y después percibieron una ganancia de 20%, pero el tiempo medido indicó una ralentización de 19%. METR
Durante la prohibición italiana de ChatGPT, la producción de desarrolladores en GitHub habría caído cerca del 50% en dos días laborales antes de repuntar con VPN y Tor. pub.towardsai.net
DORA asoció un aumento de 25% en adopción de IA con 1,5% menos rendimiento de entrega y 7,2% menos estabilidad. Google Cloud
Uplevel reportó que unos 800 desarrolladores con Copilot no mejoraron significativamente el ciclo de pull requests, mientras su medida de errores aumentó 41%. Uplevel
En un estudio de Stanford con 47 personas, usuarios de IA produjeron código menos seguro en varias tareas y expresaron mayor confianza en su seguridad. Stanford University
Investigadores reportaron que aproximadamente 40% de los programas generados por Copilot en 89 escenarios contenía debilidades potencialmente explotables. New York University
DORA vinculó mayor adopción de IA con 7,2% menos estabilidad de entrega pese a reportar simultáneamente mejoras en documentación y revisión. Google Cloud
Para los desarrolladores experimentados de código abierto del estudio, los pronósticos anticipaban una finalización más rápida cuando se permitía la IA, pero el resultado observado fue una ralentización del 19 por ciento; los pronósticos de los desarrolladores durante el estudio indicaban -23 por ciento. Measuring the Impact of Early-2025 AI on Experienced Open-Source ...
El Ministerio de Tecnología e Innovación de Alberta usó Claude Code para analizar 466 millones de líneas de código gubernamental en 20 horas. anthropic.com
Entre 802 desarrolladores y 196.212 solicitudes de incorporación, el rendimiento per cápita llegó a 2,09 veces su nivel previo al mandato en abril de 2026. arxiv.org
El argumento
Sistemas posteriores seleccionados resolvieron aproximadamente 41% de las tareas de SWE-bench.
GitHub añadió más de 70.000 proyectos públicos de IA mientras se ampliaba el uso observado.
El uso generalizado puede coexistir con una gran incertidumbre sobre la corrección.
Copilot redujo una tarea de 161,8 a 71,2 minutos.
El uso de herramientas se normalizó antes de que la mejora de calidad fuera igual de convincente.
Los errores plausibles son costosos porque parecen listos para entregar.
Esta investigación se publica en inglés y español. Read in English