Hanademi

Faster code needs stronger QAEl código más rápido necesita un QA más fuerte · V7

30 slides · 23 min · 2026-08-05 language
ENES
theme
LightDark
view
DeckTableTalk
brand
HanademiPlatzi
Faster code needs stronger QAMade for Daniel Agudelo, by Hanademi
  1. Feeling faster did not translate into faster completion.
  2. Copilot cut one task from 161.8 to 71.2 minutes.
  3. Plausible mistakes are expensive because they look ready to ship.
El código más rápido necesitaun QA más fuerteMade for Daniel Agudelo, by Hanademi
  1. Sentirse más rápido no se tradujo en una finalización más rápida.
  2. Copilot redujo una tarea de 161,8 a 71,2 minutos.
  3. Los errores plausibles son costosos porque parecen listos para entregar.
AI coding activity expanded at two differentscalesGitHub growth rates for public generative-AI activity in 2024 and repository counts from a separateAI-assisted coding dataset. The count panel uses a log scale because the source scopes differ sharply.Made for Daniel Agudelo, by HanademiSources: GitHub. (2024). The state of open source and rise of AI in 2024. GitHub Octoverse 2024.; [2511.04427v2]Does AI-Assisted Coding Deliver? A Difference-in-Differences Study of Cursor's Impact on Software Projects.(2026). Published figure transcribed from pixels.; anthropic.com.UnitGrowth and repository countsGitHub growth in 202498%59%Public projectsContributionsObserved repository counts12692024-012025-03
GitHub reported more than 70,000 new public generative-AI projects in 2024, alongside 98% project growth and 59% contribution growth. A separate study dataset grew from 1 repository to 269. At another scale, Alberta reported using Claude Code to scan 466 million government code lines in 20 hours. These are distinct scopes, but each points toward more software material reaching automated and human quality systems.
La actividad de programación con IA seexpandió en dos escalas distintasTasas de crecimiento de GitHub para actividad pública de IA generativa en 2024 y conteos de repositoriosde un conjunto separado sobre programación asistida por IA. El panel de conteos usa escala logarítmicaporque los alcances difieren mucho.Made for Daniel Agudelo, by HanademiFuentes: GitHub. (2024). The state of open source and rise of AI in 2024. GitHub Octoverse 2024.;[2511.04427v2] Does AI-Assisted Coding Deliver? A Difference-in-Differences Study of Cursor's Impact onSoftware Projects. (2026). Published figure transcribed from pixels.; anthropic.com.UnidadCrecimiento y conteos de repositoriosCrecimiento de GitHub en 202498 %59 %Proyectos públicosContribucionesConteos observados de repositorios12692024-012025-03
GitHub reportó más de 70.000 proyectos públicos nuevos de IA generativa en 2024, junto con crecimiento de proyectos de 98% y de contribuciones de 59%. Un conjunto separado de estudio creció de 1 repositorio a 269. En otra escala, Alberta reportó el uso de Claude Code para analizar 466 millones de líneas de código gubernamental en 20 horas. Son alcances distintos, pero todos apuntan a más material de software llegando a sistemas de calidad automatizados y humanos.
A few terms before we beginMade for Daniel Agudelo, by HanademiRepositoryA stored software project with code and its change history.Pull requestA proposed code change submitted for review before merging.SWE-benchA benchmark based on resolving real software-repository issues.Security debtKnown weaknesses that remain unfixed and accumulate risk.
The argument depends on the difference between generating code and delivering a dependable change. Repositories hold real systems, while pull requests bring proposed changes into review. SWE-bench measures issue resolution, and security debt describes weaknesses that survive delivery.
Algunos términos antes de comenzarMade for Daniel Agudelo, by HanademiRepositorioUn proyecto de software almacenado con código e historial de cambios.Solicitud de incorporaciónUn cambio de código propuesto para revisión antes de incorporarlo.SWE-benchUna evaluación basada en resolver problemas reales de repositorios de software.Deuda de seguridadDebilidades conocidas que siguen sin corregirse y acumulan riesgo.
El argumento depende de la diferencia entre generar código y entregar un cambio confiable. Los repositorios contienen sistemas reales, mientras las solicitudes de incorporación llevan cambios propuestos a revisión. SWE-bench mide la resolución de problemas y la deuda de seguridad describe debilidades que sobreviven a la entrega.
Code now appears fasterMarkup code appears on a computer display.Sources: AI Tools Accelerates Coding, But Not Overall Software Delivery, GitLab .... infoq.com.
As generation accelerates, readable code can still conceal issues that review and testing must uncover.
El código ahora aparece más rápidoCódigo de marcado aparece en la pantalla de una computadora.Fuentes: AI Tools Accelerates Coding, But Not Overall Software Delivery, GitLab .... infoq.com.
A medida que se acelera la generación, el código legible aún puede ocultar problemas que la revisión y las pruebas deben descubrir.
Selected later systems resolved roughly41% of SWE-bench tasks.Resolving a benchmark issue does not prove that every generated change is secure,maintainable or ready for production.Sources: Jimenez, C. E., Yang, J., Wettig, A., Yao, S., Pei, K., Press, O., & Narasimhan, K. (2024). SWE-bench: Can language models resolve real-worldGitHub issues? Princeton University.
AI coding capability has moved beyond autocomplete toward resolving real repository issues. The accepted latest figure is roughly 41% of selected SWE-bench tasks. That capability can increase the machine-generated change entering delivery systems. The earlier trend was not independently verified, so only the latest value is stated.
Sistemas posteriores seleccionadosresolvieron aproximadamente 41% de lastareas de SWE-bench.Resolver un problema de evaluación no demuestra que todo cambio generado sea seguro,mantenible o esté listo para producción.Fuentes: Jimenez, C. E., Yang, J., Wettig, A., Yao, S., Pei, K., Press, O., & Narasimhan, K. (2024). SWE-bench: Can language models resolve real-worldGitHub issues? Princeton University.
La capacidad de programación con IA avanzó más allá del autocompletado hacia la resolución de problemas reales de repositorios. La última cifra aceptada es aproximadamente 41% de tareas seleccionadas de SWE-bench. Esa capacidad puede aumentar los cambios generados por máquinas que entran en los sistemas de entrega. La tendencia anterior no se verificó de forma independiente, por lo que solo se expresa el último valor.
Human review guidelines imply at least 1.46 millionreviewer-hours for the scanned codebaseMade for Daniel Agudelo, by HanademiSources: anthropic.com.; Sadowski, C., Söderberg, E., Church, L., Sipko, M., & Bacchelli, A. (2018). Modern codereview: A case study at Google. Google.; Cohen, J. (2006). Best kept secrets of peer code review: Modern approach,practical advice. SmartBear Software.Unithours on a logarithmic scaleAutomated scan20 hoursSession-hours at 400 lines per hour1,165,000Minimum reviewer-hours with the observed mix1,456,250101,000100,00010,000,000Hours on a logarithmic scale
The minimum human benchmark is about 72,813 times the reported 20-hour machine scan.
Las guías de revisión humana implican al menos 1,46millones de horas de revisión para el código analizadoMade for Daniel Agudelo, by HanademiFuentes: anthropic.com.; Sadowski, C., Söderberg, E., Church, L., Sipko, M., & Bacchelli, A. (2018). Modern codereview: A case study at Google. Google.; Cohen, J. (2006). Best kept secrets of peer code review: Modern approach,practical advice. SmartBear Software.Unidadhoras en escala logarítmicaEscaneo automatizado20 horasHoras de sesión a 400 líneas por hora1.165.000Horas mínimas de revisión con la mezcla observada1.456.250101.000100.00010.000.000Horas en escala logarítmica
El mínimo humano de referencia es unas 72.813 veces el escaneo automatizado de 20 horas.
Review remains human workA person reviews a document at a desk surrounded by papers.Sources: You Cannot Review Your Way Out of This. andrewlewis.ca.
The scale gap turns faster generation into a larger and more concentrated burden for human reviewers.
La revisión sigue siendo trabajo humanoUna persona revisa un documento en un escritorio rodeado de papeles.Fuentes: You Cannot Review Your Way Out of This. andrewlewis.ca.
La brecha de escala convierte la generación más rápida en una carga mayor y más concentrada para los revisores humanos.
Developers adopted AI faster than theytrusted itShare using or planning to use AI tools and attitudes toward accuracy, Stack Overflow Developer Survey2024.Made for Daniel Agudelo, by HanademiSources: Stack Overflow. (2024). 2024 Developer Survey: Artificial intelligence.UnitRespondents76%Uses or plans to use43%Trusts accuracy31%Distrusts accuracy
AI tools had become normal for many developers by 2024. Yet trust lagged: 76% used or planned to use them, while only 43% trusted their accuracy. That gap creates verification work. Adoption increases exposure before confidence is settled.
Los desarrolladores adoptaron la IA másrápido de lo que confiaron en ellaPorcentaje que usaba o planeaba usar herramientas de IA y actitudes frente a su precisión, encuesta deStack Overflow de 2024.Made for Daniel Agudelo, by HanademiFuentes: Stack Overflow. (2024). 2024 Developer Survey: Artificial intelligence.UnidadEncuestados76 %Usa o planea usar43 %Confía en la precisión31 %Desconfía de la precisión
Las herramientas de IA se habían vuelto normales para muchos desarrolladores en 2024. Sin embargo, la confianza quedó rezagada: 76% las usaba o planeaba usarlas, mientras solo 43% confiaba en su precisión. Esa brecha crea trabajo de verificación. La adopción aumenta la exposición antes de que la confianza esté resuelta.
AI produced large gains on bounded codingoutcomesCompletion time in GitHub's 95-developer JavaScript study and reported relative gains from separateGitHub experiments.Made for Daniel Agudelo, by HanademiSources: Peng, S., Kalliamvakou, E., Cihon, P., & Demirer, M. (2023). The impact of AI on developer productivity:Evidence from GitHub Copilot. GitHub.; GitHub. (2024). Does GitHub Copilot improve code quality? GitHub CustomerResearch.; arxiv.org.UnitMinutes and relative improvementTask completion time161.871.2ControlCopilotReported relative improvements55.8%53.2%Faster task completionMore likely to pass tests
Copilot users completed a bounded JavaScript task in 71.2 minutes, compared with 161.8 minutes for the control group. GitHub reported a 55.8% speed gain, while another experiment reported a 53.2% improvement in the likelihood of passing all project unit tests. A separate 2026 study observed throughput reaching 2.09 times its pre-mandate baseline across 802 developers. These results support acceleration, but none alone measures the full delivery system.
La IA produjo grandes ganancias enresultados acotados de programaciónTiempo de finalización en el estudio de JavaScript de GitHub con 95 desarrolladores y ganancias relativasreportadas en experimentos separados de GitHub.Made for Daniel Agudelo, by HanademiFuentes: Peng, S., Kalliamvakou, E., Cihon, P., & Demirer, M. (2023). The impact of AI on developer productivity:Evidence from GitHub Copilot. GitHub.; GitHub. (2024). Does GitHub Copilot improve code quality? GitHub CustomerResearch.; arxiv.org.UnidadMinutos y mejora relativaTiempo de finalización161,871,2ControlCopilotMejoras relativas reportadas55,8 %53,2 %Finalización más rápidaMayor probabilidad de aprobar
Los usuarios de Copilot completaron una tarea acotada de JavaScript en 71,2 minutos, frente a 161,8 minutos en el grupo de control. GitHub reportó una ganancia de velocidad de 55,8%, mientras otro experimento reportó una mejora de 53,2% en la probabilidad de aprobar todas las pruebas unitarias del proyecto. Un estudio separado de 2026 observó que el rendimiento llegó a 2,09 veces su nivel previo al mandato entre 802 desarrolladores. Estos resultados respaldan la aceleración, pero ninguno mide por sí solo todo el sistema de entrega.
The annual time-saving benchmark isreached at about 148 bounded tasksUse the 90.6-minute gap between control and Copilot task times, convert accumulated minutes to eight-hourworking days and solve for the 28-day annual benchmark.Made for Daniel Agudelo, by HanademiSources: Peng, S., Kalliamvakou, E., Cihon, P., & Demirer, M. (2023). The impact of AI on developer productivity:Evidence from GitHub Copilot. GitHub.; The Impact of AI on Developer Productivity: Evidence from GitHub ....;gov.uk.Unitworking days saved per coder per year0204050 tasks100 tasks148.3 tasks200 tasksModeled dayssavedAnnual trialbenchmark
Completing roughly three such bounded tasks per working week would reproduce the public-sector trial's annual saving benchmark.
El umbral anual de ahorro de tiempo sealcanza con unas 148 tareas acotadasSe usa la diferencia de 90,6 minutos entre los tiempos de la tarea con control y con Copilot, se conviertenlos minutos acumulados en jornadas de ocho horas y se despeja el umbral anual de 28 días.Made for Daniel Agudelo, by HanademiFuentes: Peng, S., Kalliamvakou, E., Cihon, P., & Demirer, M. (2023). The impact of AI on developer productivity:Evidence from GitHub Copilot. GitHub.; The Impact of AI on Developer Productivity: Evidence from GitHub ....;gov.uk.Unidaddías laborables ahorrados por programador al año0204050 tareas100 tareas148,3 tareas200 tareasDías ahorradosmodeladosReferencia anualdel ensayo
Completar unas tres tareas acotadas por semana laboral reproduciría el ahorro anual de referencia del ensayo del sector público.
Projected QA hiring leaves a 2.52xworkload index in a combined AI scenarioMade for Daniel Agudelo, by HanademiSources: arxiv.org.; Uplevel. (2024). Can generative AI improve developer productivity? Uplevel Data Labs.; GenAI for Coding Research Report | Uplevel Data Labs.Unitindexed QA workload per tester, baseline = 1.000x1x2x3xBaseline output and QA staff1.00xAI throughput after QA hiring1.79xAI plus bugs after QA hiring2.52xIndexed workload per QA tester
A 17% staffing increase offsets little of a 2.09x throughput rate compounded by a 41% bug increase.
La contratación proyectada de QA deja un índice decarga de 2,52x en un escenario combinado de IAMade for Daniel Agudelo, by HanademiFuentes: arxiv.org.; Uplevel. (2024). Can generative AI improve developer productivity? Uplevel Data Labs.; GenAI for Coding Research Report | Uplevel Data Labs.Unidadcarga de QA por tester indexada, base = 1,000x1x2x3xProducción y personal de QA base1,00xRendimiento de IA tras contratar QA1,79xIA más errores tras contratar QA2,52xCarga indexada por tester de QA
Un aumento de 17% en personal compensa poco un rendimiento de 2,09x combinado con un aumento de 41% en errores.
Enterprise AI use exceeded perceivedbenefitShare of 500 United States enterprise developers reporting AI-tool use, perceived benefits and expectedquality improvement.Made for Daniel Agudelo, by HanademiSources: GitHub. (2023). Survey reveals AI's impact on the developer experience. GitHub.UnitDevelopersUsed AI tools92%Perceived benefits70%Expected better quality57%
In GitHub's enterprise survey, 92% used AI coding tools at work. A smaller 70% perceived benefits, and 57% expected better code quality. Access and use arrived first, while confidence in the result followed more cautiously. QA operates in that difference.
El uso empresarial de IA superó elbeneficio percibidoPorcentaje de 500 desarrolladores empresariales de Estados Unidos que reportó uso de IA, beneficiospercibidos y mejora esperada de calidad.Made for Daniel Agudelo, by HanademiFuentes: GitHub. (2023). Survey reveals AI's impact on the developer experience. GitHub.UnidadDesarrolladoresUsó herramientas de IA92 %Percibió beneficios70 %Esperó mejor calidad57 %
En la encuesta empresarial de GitHub, 92% usaba herramientas de IA para programar en el trabajo. Un 70% menor percibía beneficios y 57% esperaba mejor calidad del código. El acceso y el uso llegaron primero, mientras la confianza en el resultado avanzó con más cautela. QA opera en esa diferencia.
Almost-correct answers create a debuggingtaxFrustrations reported by AI-tool users in the Stack Overflow Developer Survey 2024.Made for Daniel Agudelo, by HanademiSources: Stack Overflow. (2024). 2024 Developer Survey: Artificial intelligence.; anthropic.com.Sources use different measurement bases; read the comparison directionally, not as one exact scale.UnitAI users66%Almost-correct answers45%More debugging time31%Distrusts accuracy
The hardest AI error is an answer that looks finished but is slightly wrong. Among surveyed users, 66% cited almost-correct answers and 45% said debugging generated code consumed more time. Anthropic later analyzed about 400,000 Claude Code sessions to study tasks, collaboration and success. At that scale, verification behavior becomes part of the production system.
Las respuestas casi correctas crean unimpuesto de depuraciónFrustraciones reportadas por usuarios de herramientas de IA en la encuesta de Stack Overflow de 2024.Made for Daniel Agudelo, by HanademiFuentes: Stack Overflow. (2024). 2024 Developer Survey: Artificial intelligence.; anthropic.com.Las fuentes usan bases de medición distintas; lea la comparación como tendencia, no como una escala exacta.UnidadUsuarios de IA66 %Respuestas casi correctas45 %Más tiempo depurando31 %Desconfía de la precisión
El error de IA más difícil es una respuesta que parece terminada, pero está ligeramente equivocada. Entre los usuarios encuestados, 66% señaló respuestas casi correctas y 45% dijo que depurar código generado consumía más tiempo. Anthropic analizó después aproximadamente 400.000 sesiones de Claude Code para estudiar tareas, colaboración y éxito. A esa escala, el comportamiento de verificación se convierte en parte del sistema de producción.
DORA linked AI adoption to faster reviewand better documentationReported changes associated with a 25% increase in AI adoption. These figures could not be verified againsta live source during the build.Made for Daniel Agudelo, by HanademiSources: Google Cloud. (2024). Accelerate State of DevOps Report 2024. Google.UnitAssociated changeReview speed3.1%Approval speed1.3%Documentation quality7.5%
The reported local effects are positive. DORA associated greater adoption with 3.1% faster review, 1.3% faster approval and 7.5% better documentation. Those gains matter because QA should automate routine work where evidence supports it. They do not prove that the complete delivery system became more stable.
DORA vinculó la adopción de IA con revisiónmás rápida y mejor documentaciónCambios reportados asociados con un aumento de 25% en adopción de IA. Estas cifras no pudieronverificarse contra una fuente activa durante la construcción.Made for Daniel Agudelo, by HanademiFuentes: Google Cloud. (2024). Accelerate State of DevOps Report 2024. Google.UnidadCambio asociadoVelocidad de revisión3,1 %Velocidad de aprobación1,3 %Calidad documental7,5 %
Los efectos locales reportados son positivos. DORA asoció una mayor adopción con revisión 3,1% más rápida, aprobación 1,3% más rápida y documentación 7,5% mejor. Esas ganancias importan porque QA debe automatizar el trabajo rutinario cuando la evidencia lo respalda. No demuestran que todo el sistema de entrega se haya vuelto más estable.
Stability loss was 5.5 times theapproval-speed gainFor the same 25% increase in AI adoption, divide the 7.2% stability decline by each reported benefit: 1.3%faster approval, 3.1% faster review and 7.5% better documentation.Made for Daniel Agudelo, by HanademiSources: Google Cloud. (2024). Accelerate State of DevOps Report 2024. Google.Unitstability-loss points per benefit pointApproval speed5.5Review speed2.3Documentation quality1
Even the largest benefit, documentation quality, only matched the stability loss at a ratio near one.
La pérdida de estabilidad fue 5,5 veces lamejora en velocidad de aprobaciónPara el mismo aumento de 25% en adopción de IA, se divide la caída de 7,2% en estabilidad por cadabeneficio reportado: 1,3% en aprobación, 3,1% en revisión y 7,5% en documentación.Made for Daniel Agudelo, by HanademiFuentes: Google Cloud. (2024). Accelerate State of DevOps Report 2024. Google.Unidadpuntos de pérdida de estabilidad por cada punto de beneficioVelocidad de aprobación5,5Velocidad de revisión2,3Calidad documental1
Incluso el mayor beneficio, la calidad documental, apenas igualó la pérdida de estabilidad con una razón cercana a uno.
78.6% had already fixed AI-causedbugs or incidents.This national survey came from a press-release source and should be read as reviewerexperience, not a global defect estimate.Sources: prtimes.jp.
The review burden was not hypothetical for this surveyed population. In 2026, 78.6% of 322 Japanese reviewers said they had fixed bugs or incidents caused by AI-generated code. The survey does not establish a universal defect rate. It does show that human correction remains part of AI-assisted delivery.
78,6% ya había corregido errores oincidentes causados por IA.Esta encuesta nacional provino de un comunicado de prensa y debe leerse comoexperiencia de revisores, no como una estimación global de defectos.Fuentes: prtimes.jp.
La carga de revisión no era hipotética para esta población encuestada. En 2026, 78,6% de 322 revisores japoneses dijo haber corregido errores o incidentes causados por código generado con IA. La encuesta no establece una tasa universal de defectos. Sí muestra que la corrección humana sigue siendo parte de la entrega asistida por IA.
Only 25% of generated tests increasedcoverageBuild, pass and targeted coverage outcomes in Meta's TestGen-LLM evaluation.Made for Daniel Agudelo, by HanademiSources: Alagarsamy, S., et al. (2024). TestGen-LLM: Automated unit test improvement using large language models. Meta.UnitGenerated testsBuilt · 75%Passed · 57%Increased coverage· 25%
AI can generate tests, but each quality threshold removes more of them. Meta reported that 75% built, 57% passed and only 25% increased coverage for the targeted class. QA still has to determine whether generated tests represent the real requirement and meaningful failures. The test oracle cannot simply be delegated to the code generator.
Solo 25% de las pruebas generadas aumentócoberturaResultados de compilación, aprobación y aumento de cobertura objetivo en la evaluación TestGen-LLM deMeta.Made for Daniel Agudelo, by HanademiFuentes: Alagarsamy, S., et al. (2024). TestGen-LLM: Automated unit test improvement using large language models. Meta.UnidadPruebas generadasCompiló · 75 %Pasó · 57 %Aumentó cobertura ·25 %
La IA puede generar pruebas, pero cada umbral de calidad elimina más de ellas. Meta reportó que 75% compiló, 57% pasó y solo 25% aumentó cobertura para la clase objetivo. QA todavía debe determinar si las pruebas generadas representan el requisito real y fallos significativos. El oráculo de prueba no puede delegarse simplemente al generador de código.
Security debt already affects 70% ofsampled organizationsOrganizations with security debt, critical security debt and no measured debt in Veracode's 2024 sample.Made for Daniel Agudelo, by HanademiSources: Veracode. (2024). State of Software Security 2024. Veracode.; Sandoval, G., Pearce, H., Nys, T., Karri, R., Garg, S., &Dolan-Gavitt, B. (2023). Lost at C: A user study on the security implications of large language model code assistants. USENIXAssociation.; arxiv.org.UnitOrganizations70%Security debt46%Critical debt30%No measured debt
AI does not enter a clean security environment. Veracode reported security debt in 70% of sampled organizations and critical debt in 46%. Research is broadening: SecDrift evaluates 7 models across 8 critical-infrastructure sectors and 9 vulnerability categories, while another study analyzed over 12,000 agent actions across 5 coding models. A separate 58-person controlled study found no significant overall increase in severe bugs, so the evidence supports validation rather than a universal claim that every assistant worsens security.
La deuda de seguridad ya afecta a 70% delas organizaciones muestreadasOrganizaciones con deuda de seguridad, deuda crítica y sin deuda medida en la muestra de Veracode de2024.Made for Daniel Agudelo, by HanademiFuentes: Veracode. (2024). State of Software Security 2024. Veracode.; Sandoval, G., Pearce, H., Nys, T., Karri, R., Garg, S., &Dolan-Gavitt, B. (2023). Lost at C: A user study on the security implications of large language model code assistants. USENIXAssociation.; arxiv.org.UnidadOrganizaciones70 %Deuda de seguridad46 %Deuda crítica30 %Sin deuda medida
La IA no entra en un entorno de seguridad limpio. Veracode reportó deuda de seguridad en 70% de las organizaciones muestreadas y deuda crítica en 46%. La investigación se amplía: SecDrift evalúa 7 modelos en 8 sectores de infraestructura crítica y 9 categorías de vulnerabilidades, mientras otro estudio analizó más de 12.000 acciones de agentes en 5 modelos de programación. Un estudio controlado separado con 58 personas no encontró un aumento general significativo de errores graves, por lo que la evidencia respalda la validación y no una afirmación universal de que todo asistente empeora la seguridad.
DORA linked AI adoption to better local codeattributesReported changes in perceived code quality, complexity reduction and documentation. These figures could notbe verified against a live source during the build.Made for Daniel Agudelo, by HanademiSources: Google Cloud. (2024). Accelerate State of DevOps Report 2024. Google.UnitAssociated changeCode quality3.4%Complexity reduction1.8%Documentation quality7.5%
The reported code-level direction is favorable. DORA associated AI adoption with 3.4% better perceived code quality, 1.8% lower perceived complexity and 7.5% better documentation. These are local and perceived attributes. They should be measured separately from system-level stability.
DORA vinculó la adopción de IA con mejoresatributos locales del códigoCambios reportados en calidad percibida del código, reducción de complejidad y documentación. Estas cifrasno pudieron verificarse contra una fuente activa durante la construcción.Made for Daniel Agudelo, by HanademiFuentes: Google Cloud. (2024). Accelerate State of DevOps Report 2024. Google.UnidadCambio asociadoCalidad del código3,4 %Reducción de complejidad1,8 %Calidad documental7,5 %
La dirección reportada a nivel de código es favorable. DORA asoció la adopción de IA con 3,4% mejor calidad percibida del código, 1,8% menor complejidad percibida y 7,5% mejor documentación. Estos son atributos locales y percibidos. Deben medirse por separado de la estabilidad del sistema.
Local gains coincided with lower deliverystabilityDORA-reported documentation, review-speed and delivery-stability associations. These figures could not beverified against a live source during the build.Made for Daniel Agudelo, by HanademiSources: Google Cloud. (2024). Accelerate State of DevOps Report 2024. Google.UnitAssociated changeDocumentation quality7.5%Review speed3.1%Delivery stability-7.2%
The reported measures move in opposite directions. Documentation and review speed improved, while delivery stability was 7.2% lower. That does not prove AI caused the decline. It does show why QA must measure both the code artifact and the behavior of the complete delivery system.
Las ganancias locales coincidieron conmenor estabilidad de entregaAsociaciones reportadas por DORA en documentación, velocidad de revisión y estabilidad de entrega. Estascifras no pudieron verificarse contra una fuente activa durante la construcción.Made for Daniel Agudelo, by HanademiFuentes: Google Cloud. (2024). Accelerate State of DevOps Report 2024. Google.UnidadCambio asociadoCalidad documental7,5 %Velocidad de revisión3,1 %Estabilidad de entrega-7,2 %
Las medidas reportadas avanzan en direcciones opuestas. La documentación y la velocidad de revisión mejoraron, mientras la estabilidad de entrega fue 7,2% menor. Esto no demuestra que la IA causara la caída. Sí muestra por qué QA debe medir tanto el artefacto de código como el comportamiento de todo el sistema de entrega.
The average breach cost climbed to $4.88millionIBM-reported global average cost of a data breach, USD millions, 2020 to 2024.Made for Daniel Agudelo, by HanademiSources: IBM. (2024). Cost of a Data Breach Report 2024. IBM Security.UnitUSD$4.0M$4.5M202020212022202320242020 averaged $3.86 million.2024 reached $4.88 million.
The financial cost of security failure moved upward. IBM reported that the global average breach cost rose from $3.86 million in 2020 to $4.88 million in 2024. These are breach costs, not an estimate of AI-generated defects. They show why assurance savings cannot be judged only by coding speed.
El costo promedio de una filtración subió aUS$4,88 millonesCosto promedio global de una filtración de datos reportado por IBM, millones de USD, de 2020 a 2024.Made for Daniel Agudelo, by HanademiFuentes: IBM. (2024). Cost of a Data Breach Report 2024. IBM Security.UnidadUSD$4,0 M$4,5 M20202021202220232024El promedio de 2020 fue US$3,86millones.2024 alcanzó US$4,88 millones.
El costo financiero de los fallos de seguridad aumentó. IBM reportó que el costo promedio global de una filtración subió de US$3,86 millones en 2020 a US$4,88 millones en 2024. Estos son costos de filtraciones, no una estimación de defectos generados por IA. Muestran por qué el ahorro en aseguramiento no puede evaluarse únicamente por la velocidad de programación.
Average breach cost per lifecycle day rose28% by 2024Divide each annual average breach cost by its reported average lifecycle and convert the result to thousandsof dollars per day.Made for Daniel Agudelo, by HanademiSources: IBM. (2024). Cost of a Data Breach Report 2024. IBM Security.; IBM Report: Escalating Data BreachDisruption Pushes Costs to New Highs.; Data breach lifecycle defined: 277 days to identify and contain — IBM Costof a Data Breach Report 2023 — Deck.gallery.UnitUSD thousands per lifecycle day$14$16$182021202220232024$14.8$18.9
The shorter 2024 lifecycle did not offset rising cost, leaving daily exposure 28% above 2021.
El costo promedio por día del ciclo de unabrecha aumentó 28% hasta 2024Se divide el costo promedio anual de una brecha por su ciclo promedio reportado y se convierte el resultadoa miles de dólares por día.Made for Daniel Agudelo, by HanademiFuentes: IBM. (2024). Cost of a Data Breach Report 2024. IBM Security.; IBM Report: Escalating Data BreachDisruption Pushes Costs to New Highs.; Data breach lifecycle defined: 277 days to identify and contain — IBM Costof a Data Breach Report 2023 — Deck.gallery.Unidadmiles de dólares por día del ciclo$14$16$182021202220232024$14,8$18,9
El ciclo más corto de 2024 no compensó el aumento del costo y dejó la exposición diaria 28% por encima de 2021.
Poor software quality's cost equals about494,000 average 2024 breachesDivide the $2.41 trillion poor-quality cost benchmark by IBM's average breach cost in each year. This is ascale equivalence, not an estimate of breach incidence.Made for Daniel Agudelo, by HanademiSources: Krasner, H. (2022). The cost of poor software quality in the US: A 2022 report. Consortium forInformation and Software Quality.; Cost of Poor Software Quality in the U.S.: A 2022 Report.; IBM. (2024). Costof a Data Breach Report 2024. IBM Security.Unitequivalent count of average breaches500K550K600K20202021202220232024624,352493,852
Even at 2024's highest average unit cost, the quality bill remains equivalent to nearly half a million breaches.
El costo de la mala calidad del software equivale aunas 494.000 brechas promedio de 2024Se divide el costo de 2,41 billones de dólares por mala calidad entre el costo promedio de una brecha deIBM en cada año. Es una equivalencia de escala, no una estimación de incidencia.Made for Daniel Agudelo, by HanademiFuentes: Krasner, H. (2022). The cost of poor software quality in the US: A 2022 report. Consortium forInformation and Software Quality.; Cost of Poor Software Quality in the U.S.: A 2022 Report.; IBM. (2024). Costof a Data Breach Report 2024. IBM Security.Unidadcantidad equivalente de brechas promedio500K550K600K20202021202220232024624.352493.852
Incluso con el mayor costo unitario promedio de 2024, la factura de calidad equivale a casi medio millón de brechas.
IBM reported an average breach lifecycleof 258 days in 2024.The 258-day value measures the complete average lifecycle, not only the initialdiscovery period.Sources: IBM. (2024). Cost of a Data Breach Report 2024. IBM Security.
Security failures can persist for months before identification and containment are complete. IBM reported an average breach lifecycle of 258 days in 2024. That delay turns a missed weakness into prolonged operational exposure. The supplied historical trend was not independently verified, so only the latest value is stated.
IBM reportó un ciclo promedio de filtraciónde 258 días en 2024.El valor de 258 días mide el ciclo promedio completo, no solamente el periodo inicial dedescubrimiento.Fuentes: IBM. (2024). Cost of a Data Breach Report 2024. IBM Security.
Los fallos de seguridad pueden persistir durante meses antes de completar su identificación y contención. IBM reportó un ciclo promedio de filtración de 258 días en 2024. Esa demora convierte una debilidad no detectada en una exposición operativa prolongada. La tendencia histórica suministrada no se verificó de forma independiente, por lo que solo se expresa el último valor.
Employers plan more AI training thanworkforce reductionShare of surveyed employers planning AI upskilling, expecting business transformation and expectingworkforce reductions, World Economic Forum 2025.Made for Daniel Agudelo, by HanademiSources: World Economic Forum. (2025). Future of Jobs Report 2025. World Economic Forum.UnitEmployers86%Expects transformation77%Plans AI upskilling41%Expects reductions
Employers expect disruption, but their plans are not limited to cutting jobs. The World Economic Forum reported that 77% planned AI-related upskilling and 86% expected business transformation by 2030. A substantial 41% also expected reductions where tasks can be automated. For QA, the defensible conclusion is redesign around supervision, evidence and exceptions.
Los empleadores planean más capacitaciónen IA que reducción de personalPorcentaje de empleadores encuestados que planea capacitación en IA, espera transformación empresarialy prevé reducciones de personal, Foro Económico Mundial 2025.Made for Daniel Agudelo, by HanademiFuentes: World Economic Forum. (2025). Future of Jobs Report 2025. World Economic Forum.UnidadEmpleadores86 %Espera transformación77 %Planea capacitación en IA41 %Espera reducciones
Los empleadores esperan disrupción, pero sus planes no se limitan a reducir empleos. El Foro Económico Mundial reportó que 77% planeaba capacitación relacionada con IA y 86% esperaba transformación empresarial hacia 2030. Un 41% considerable también esperaba reducciones donde las tareas puedan automatizarse. Para QA, la conclusión defendible es rediseñarse alrededor de supervisión, evidencia y excepciones.
The BLS projected QA growth far above thejob averageProjected United States employment growth from 2023 to 2033. The supplied figure could not be verifiedagainst a live source during the build.Made for Daniel Agudelo, by HanademiSources: United States Bureau of Labor Statistics. (2024). Software developers, quality assurance analysts, andtesters: Occupational Outlook Handbook.UnitProjected employment growth0%5%10%15%20%17%Software QA11%Computer occupations4%All occupationsAll occupations
The supplied BLS outlook projected 17% growth for software QA analysts and testers from 2023 to 2033. That compares with 11% for computer occupations and 4% across all occupations. The projection does not prove that AI causes QA employment growth. It does challenge a simple claim that the role is disappearing.
BLS proyectó un crecimiento de QA muysuperior al promedio laboralCrecimiento laboral proyectado en Estados Unidos de 2023 a 2033. La cifra suministrada no pudoverificarse contra una fuente activa durante la construcción.Made for Daniel Agudelo, by HanademiFuentes: United States Bureau of Labor Statistics. (2024). Software developers, quality assurance analysts, andtesters: Occupational Outlook Handbook.UnidadCrecimiento laboral proyectado0 %5 %10 %15 %20 %17 %QA de software11 %Ocupaciones informáticas4 %Todas las ocupacionesTodas las ocupaciones
La proyección suministrada de BLS estimó crecimiento de 17% para analistas y testers de QA de software entre 2023 y 2033. Esto se compara con 11% para ocupaciones informáticas y 4% para todas las ocupaciones. La proyección no demuestra que la IA cause crecimiento del empleo en QA. Sí cuestiona una afirmación simple de que el rol está desapareciendo.
QA must test the system people depend on,not merely generated output.The framework makes quality broader than functional correctness alone.Sources: International Organization for Standardization. (2023). ISO/IEC 25010:2023 Systems and software engineering: Product quality model.
A passing unit test answers only part of the quality question. ISO/IEC 25010 defines 9 characteristics, including reliability, security, maintainability and safety. AI can help produce code and tests, but it cannot collapse these dimensions into one score. QA expands toward system evidence, risk and release judgment.
QA debe probar el sistema del que dependenlas personas, no solo el resultado generado.El marco hace que la calidad sea más amplia que la corrección funcional por sí sola.Fuentes: International Organization for Standardization. (2023). ISO/IEC 25010:2023 Systems and software engineering: Product quality model.
Una prueba unitaria aprobada responde solo una parte de la pregunta de calidad. ISO/IEC 25010 define 9 características, entre ellas fiabilidad, seguridad, mantenibilidad y seguridad operacional. La IA puede ayudar a producir código y pruebas, pero no puede reducir estas dimensiones a una sola puntuación. QA se amplía hacia evidencia del sistema, riesgo y juicio de liberación.
AI assurance expands from testing intogovernanceNamed high-risk duties in the EU AI Act and risk functions in NIST AI RMF 1.0. The supplied claims couldnot be verified against live sources during the build.Made for Daniel Agudelo, by HanademiSources: European Union. (2024). Regulation (EU) 2024/1689 laying down harmonised rules on artificial intelligence.Official Journal of the European Union.; National Institute of Standards and Technology. (2023). Artificial Intelligence RiskManagement Framework, AI RMF 1.0. NIST.; github.com.UnitNamed assurance areasEU high-risk duties1unchanged, Risk management → CybersecurityNIST risk functions1unchanged, Govern → Manage
Functional testing is only one part of AI assurance. The EU framework names 7 high-risk duties, while NIST organizes AI risk work into govern, map, measure and manage. A Microsoft PromptKit case study reported 147 findings against 260 requirements across 5 components after 3 audit passes. The QA role increasingly connects product behavior with documented evidence and accountable oversight.
El aseguramiento de IA se amplía desde laspruebas hacia la gobernanzaDeberes nombrados para alto riesgo en la Ley de IA de la UE y funciones de riesgo en NIST AI RMF 1.0.Las afirmaciones suministradas no pudieron verificarse contra fuentes activas durante la construcción.Made for Daniel Agudelo, by HanademiFuentes: European Union. (2024). Regulation (EU) 2024/1689 laying down harmonised rules on artificialintelligence. Official Journal of the European Union.; National Institute of Standards and Technology. (2023).Artificial Intelligence Risk Management Framework, AI RMF 1.0. NIST.; github.com.UnidadÁreas de aseguramiento nombradasDeberes de alto riesgo de la UE1sin cambio, Gestión de riesgos → CiberseguridadFunciones de riesgo de NIST1sin cambio, Gobernar → Gestionar
Las pruebas funcionales son solo una parte del aseguramiento de IA. El marco de la UE nombra 7 deberes para alto riesgo, mientras NIST organiza el trabajo de riesgo de IA en gobernar, mapear, medir y gestionar. Un caso de Microsoft PromptKit reportó 147 hallazgos frente a 260 requisitos en 5 componentes después de 3 pasadas de auditoría. El rol de QA conecta cada vez más el comportamiento del producto con evidencia documentada y supervisión responsable.
Assurance reaches the wider ecosystemTwo people stand onstage beneath a KubeCon welcome banner.Sources: Cloudsmith warns - most teams won't meet the EU Cyber Resilience Act's software supply chain deadline. diginomica.com.
As QA expands into governance and supply-chain risk, assurance becomes a responsibility across the software ecosystem.
El aseguramiento alcanza al ecosistemaDos personas están en el escenario bajo un cartel de bienvenida de KubeCon.Fuentes: Cloudsmith warns - most teams won't meet the EU Cyber Resilience Act's software supply chain deadline. diginomica.com.
A medida que QA se extiende a la gobernanza y al riesgo de la cadena de suministro, el aseguramiento se convierte en una responsabilidad de todo el ecosistema de software.
A simple overlap scenario puts 30% ofprograms in the one-review weakness cellMade for Daniel Agudelo, by HanademiSources: Sadowski, C., Söderberg, E., Church, L., Sipko, M., & Bacchelli, A. (2018). Modern code review: A casestudy at Google. Google.; Pearce, H., Ahmad, B., Tan, B., Dolan-Gavitt, B., & Karri, R. (2022). Asleep at thekeyboard? Assessing the security of GitHub Copilot's code contributions. New York University.Unitprograms per 100 in a modeled overlapPotential weaknessOne reviewer30%Potential weaknessMultiple reviewers10%No sampled potentialweakness60%Each tile represents 10 programs
Under the independence assumption, the one-review weakness cell is three times the multiple-review weakness cell.
Un escenario simple sitúa al 30% de los programas enla celda de debilidad con un solo revisorMade for Daniel Agudelo, by HanademiFuentes: Sadowski, C., Söderberg, E., Church, L., Sipko, M., & Bacchelli, A. (2018). Modern code review: A casestudy at Google. Google.; Pearce, H., Ahmad, B., Tan, B., Dolan-Gavitt, B., & Karri, R. (2022). Asleep at thekeyboard? Assessing the security of GitHub Copilot's code contributions. New York University.Unidadprogramas por cada 100 en una superposición modeladaDebilidad potencialUn revisor30%Debilidad potencialVarios revisores10%Sin debilidad potencialen la muestra60%Cada cuadro representa 10 programas
Bajo el supuesto de independencia, la celda de debilidad con un revisor triplica la celda con varios revisores.
In summaryMade for Daniel Agudelo, by HanademiSources: anthropic.com.; arxiv.org.; gov.uk.; IBM. (2024). Cost of a Data Breach Report 2024. IBM Security.; prtimes.jp.; Jimenez, C. E., Yang, J.,Wettig, A., Yao, S., Pei, K., Press, O., & Narasimhan, K. (2024). SWE-bench: Can language models resolve real-world GitHub issues? PrincetonUniversity.Alberta’s Ministry of Technology and Innovation used Claude Code to scan 466 million lines of government code in 20 hours.Across 802 developers and 196,212 pull requests, per-capita throughput reached 2.09 times its pre-mandate baseline in April 2026.A UK government trial estimated that AI assistants saved public-sector coders 28 working days per year, nearly one hour daily.IBM's reported global average breach cost increased from $3.86 million in 2020 to $4.88 million in 2024.A 2026 survey found 78.6% of 322 Japanese code reviewers had fixed bugs or incidents caused by AI-generated code.Reported SWE-bench results rose from 1.96% for the original baseline to 12.47%, 27.33% and roughly 41% for selected later systems.
The value of the research is not only what each source knew, but what became visible when their evidence was combined.
En resumenMade for Daniel Agudelo, by HanademiFuentes: anthropic.com.; arxiv.org.; gov.uk.; IBM. (2024). Cost of a Data Breach Report 2024. IBM Security.; prtimes.jp.; Jimenez, C. E., Yang, J.,Wettig, A., Yao, S., Pei, K., Press, O., & Narasimhan, K. (2024). SWE-bench: Can language models resolve real-world GitHub issues? PrincetonUniversity.El Ministerio de Tecnología e Innovación de Alberta usó Claude Code para analizar 466 millones de líneas de código gubernamental en 20 horas.Entre 802 desarrolladores y 196.212 solicitudes de incorporación, el rendimiento per cápita llegó a 2,09 veces su nivelprevio al mandato en abril de 2026.Un ensayo del gobierno británico estimó que los asistentes de IA ahorraron a los programadores públicos 28 díaslaborales al año, casi una hora diaria.El costo promedio global de una filtración reportado por IBM aumentó de US$3,86 millones en 2020 a US$4,88 millones en 2024.Una encuesta de 2026 halló que el 78,6% de 322 revisores de código japoneses había corregido errores o incidentescausados por código generado con IA.Los resultados reportados de SWE-bench subieron de 1,96% en la referencia original a 12,47%, 27,33% yaproximadamente 41% en sistemas posteriores seleccionados.
El valor de la investigación no está solo en cada fuente, sino en lo que apareció al combinar sus evidencias.

The research behind this deck

Feeling faster did not translate into faster completion. These terms connect code generation with real software delivery.

Key findings

The argument

This research is published in English and Spanish. Ver en español

La investigación detrás de esta presentación

Sentirse más rápido no se tradujo en una finalización más rápida. Estos términos conectan la generación de código con la entrega real de software.

Hallazgos clave

El argumento

Esta investigación se publica en inglés y español. Read in English

Related researchInvestigación relacionada