AI adoption did not move every outcome together. DORA linked a 25% adoption increase to 3.4% better perceived code quality, but throughput fell 1.5% and delivery stability fell 7.2%. That split is the central warning: code that feels better can still make the system harder to ship safely.
La adopción de IA no movió todos los resultados en la misma dirección. DORA vinculó un aumento del 25% con 3,4% más calidad percibida, pero el rendimiento cayó 1,5% y la estabilidad de entrega cayó 7,2%. Esa división es la advertencia central: el código puede parecer mejor y aun así dificultar una entrega segura.
The debate becomes clearer when the terms are concrete. A benchmark tests a defined task, pass@k rewards repeated attempts, and formal verification proves only a written specification. Delivery stability then asks whether the wider system still works when changes reach users.
El debate se aclara cuando los términos son concretos. Un benchmark prueba una tarea definida, pass@k recompensa los intentos repetidos y la verificación formal demuestra solo una especificación escrita. La estabilidad de entrega pregunta después si el sistema completo sigue funcionando cuando los cambios llegan a los usuarios.
AI tools had already crossed into mainstream use, with 62% reporting adoption. Trust lagged at 43%, while 31% actively distrusted the tools' accuracy. That gap makes review a normal operating control, not resistance to new technology.
Las herramientas de IA ya habían llegado al uso general, con una adopción informada del 62%. La confianza se quedó en el 43%, mientras el 31% desconfiaba activamente de su precisión. Esa brecha convierte la revisión en un control operativo normal, no en resistencia a la tecnología.
This randomized field study followed 16 experienced developers across 246 eligible repository tasks. Access to early-2025 AI tools increased completion time by 19%. The result does not say AI always slows development, but it directly rejects the idea that review and judgment are already unnecessary.
Este estudio de campo aleatorizado siguió a 16 desarrolladores experimentados en 246 tareas elegibles de repositorio. El acceso a herramientas de IA de principios de 2025 aumentó el tiempo de finalización un 19%. El resultado no dice que la IA siempre ralentice el desarrollo, pero sí rechaza que la revisión y el juicio ya sean innecesarios.
Irrelevant context did not produce a universal penalty. Sonnet lost 8 benchmark points, while Opus gained 4 in the same experiment. Constraints therefore need model-level evaluation instead of a single token rule copied across every workflow.
El contexto irrelevante no produjo una penalización universal. Sonnet perdió 8 puntos de benchmark, mientras Opus ganó 4 en el mismo experimento. Por eso los límites deben evaluarse por modelo, en lugar de copiar una sola regla de tokens en todos los flujos.
The first generated answer passed 28.81% of HumanEval tasks. The probability rose to 46.81% with 10 samples and 72.31% with 100. Compute can buy more chances, but pass@k does not identify which candidate is correct before evaluation.
La primera respuesta generada superó el 28,81% de las tareas de HumanEval. La probabilidad subió al 46,81% con 10 muestras y al 72,31% con 100. El cómputo puede comprar más oportunidades, pero pass@k no identifica qué candidato es correcto antes de evaluarlo.
In a replay of 400 JavaScript bugs, TypeScript or Flow individually could detect about 15%, and either system could detect roughly 20%. A separate reanalysis covering 729 GitHub projects found that language-quality effects were small and sensitive to modeling choices. Types are valuable filters, not complete quality certificates.
En una reproducción de 400 errores de JavaScript, TypeScript o Flow podían detectar individualmente cerca del 15%, y cualquiera de los 2 alrededor del 20%. Otro análisis de 729 proyectos de GitHub encontró efectos pequeños y sensibles a las decisiones del modelo estadístico. Los tipos son filtros valiosos, no certificados completos de calidad.
The study generated 1,689 programs across 89 security scenarios and classified about 40% as vulnerable. That is not a present-day rate for every coding model, but it shows why functional output alone cannot clear a security gate. Static analysis, dependency checks, and restricted permissions still have work to do.
El estudio generó 1.689 programas en 89 escenarios de seguridad y clasificó cerca del 40% como vulnerables. No es una tasa reciente para todos los modelos, pero muestra por qué un resultado funcional no basta para superar un control de seguridad. El análisis estático, la revisión de dependencias y los permisos restringidos todavía son necesarios.
The original seL4 effort connected about 8,700 lines of C implementation to roughly 200,000 lines of Isabelle proof. That investment delivered unusually strong assurance for a narrowly specified kernel. It also explains why formal verification belongs first where failure is expensive, not as a universal rule for every change.
El esfuerzo original de seL4 conectó unas 8.700 líneas de implementación en C con aproximadamente 200.000 líneas de prueba en Isabelle. Esa inversión produjo una garantía excepcional para un núcleo bien delimitado. También explica por qué la verificación formal debe empezar donde un fallo es costoso, no como regla universal para cada cambio.
Random testing found 325 GCC bugs, 79 LLVM bugs, and 6 CompCert bugs. No wrong-code error was attributed to CompCert's verified core. By contrast, an experiment with 27 independently developed versions found correlated failures, showing that more implementations do not automatically create independent protection.
Las pruebas aleatorias encontraron 325 errores en GCC, 79 en LLVM y 6 en CompCert. Ningún error de código incorrecto se atribuyó al núcleo verificado de CompCert. En cambio, un experimento con 27 versiones desarrolladas independientemente encontró fallos correlacionados, lo que demuestra que más implementaciones no crean protección independiente de forma automática.
The SPACE framework separates satisfaction, performance, activity, communication, and efficiency. That is the practical operating model for AI coding controls. Tighten review, tests, permissions, and formal assurance as potential harm rises, then watch several outcomes so one local gain cannot hide a system-level loss.
El marco SPACE separa satisfacción, rendimiento, actividad, comunicación y eficiencia. Ese es un modelo operativo práctico para los controles de programación con IA. Refuerce revisión, pruebas, permisos y garantía formal a medida que aumente el daño posible, y observe varios resultados para que una mejora local no oculte una pérdida del sistema.
A local quality gain did not translate into better software delivery. These terms separate code generation from dependable software delivery.
Key findings
In a randomized field study, 16 experienced developers completed 246 eligible repository tasks 19% slower when allowed to use early-2025 AI tools. METR
DORA associated a 25% increase in AI adoption with 3.4% better perceived code quality but 1.5% lower throughput and 7.2% lower delivery stability. Google Cloud
A study generated 1,689 GitHub Copilot programs across 89 security scenarios and classified approximately 40% as vulnerable. IEEE
In a 47-person experiment, access to an AI assistant sometimes reduced code security while users remained more confident that their solutions were secure. Association for Computing Machinery
The original seL4 verification connected about 8,700 lines of C implementation to roughly 200,000 lines of Isabelle proof. Association for Computing Machinery
Random testing found 325 GCC bugs, 79 LLVM bugs, and six CompCert bugs, with no wrong-code errors attributed to CompCert's verified core. Association for Computing Machinery
DORA's 2024 models associated AI adoption with improvements in some local outcomes and declines in throughput and delivery stability. Google Cloud
Expectations of faster completion with AI contrasted with the observed result: economics experts forecast a -39% change in time and developers after the study estimated -20%, while the observed result was 19%. Measuring the Impact of Early-2025 AI on Experienced ...
OpenAI Codex generated more than 400,000 pull requests in two months, illustrating the review volume autonomous agents can create. arxiv.org
In one context-noise experiment, Sonnet lost 8 benchmark points while Opus gained 4, demonstrating model-dependent effects from irrelevant context. techloom.it
Long-context experiments found that models often retrieved information less accurately when the relevant document appeared in the middle rather than near either endpoint. Association for Computational Linguistics
EvalPlus expanded the 164 HumanEval tasks with approximately 80 times more tests, exposing incorrect solutions accepted by the original suites. Neural Information Processing Systems
The argument
Adoption is not evidence that developers consider the output dependable.
Experienced developers took 19% longer with early-2025 AI tools.
A universal context limit can help one model and damage another.
The original SWE-bench covered 12 repositories and 2,294 real issues, averaging 191.2 issues per repository.
More attempts improve the odds, but someone still must select the correct answer.
EvalPlus expanded 164 HumanEval tasks with about 80 times more tests, exposing incorrect solutions accepted by the original suites.
This research is published in English and Spanish. Ver en español
La investigación detrás de esta presentación
Una mejora local de calidad no se convirtió en una mejor entrega de software. Estos términos separan la generación de código de una entrega fiable.
Hallazgos clave
En un estudio de campo aleatorizado, 16 desarrolladores experimentados completaron 246 tareas elegibles de repositorio un 19% más lento cuando pudieron usar herramientas de IA de principios de 2025. METR
DORA asoció un aumento del 25% en adopción de IA con 3,4% más calidad percibida, pero 1,5% menos rendimiento y 7,2% menos estabilidad de entrega. Google Cloud
Un estudio generó 1.689 programas con GitHub Copilot en 89 escenarios de seguridad y clasificó aproximadamente el 40% como vulnerable. IEEE
En un experimento con 47 personas, el acceso a un asistente de IA redujo a veces la seguridad del código mientras los usuarios mantenían mayor confianza en sus soluciones. Association for Computing Machinery
La verificación original de seL4 conectó unas 8.700 líneas de implementación en C con aproximadamente 200.000 líneas de prueba en Isabelle. Association for Computing Machinery
Las pruebas aleatorias encontraron 325 errores en GCC, 79 en LLVM y seis en CompCert, sin errores de código incorrecto atribuidos al núcleo verificado de CompCert. Association for Computing Machinery
Los modelos de DORA de 2024 asociaron la adopción de IA con mejoras en algunos resultados locales y descensos en rendimiento y estabilidad de entrega. Google Cloud
Las expectativas de completar el trabajo más rápido con IA contrastaron con el resultado observado: los expertos en economía pronosticaron un cambio del -39% en el tiempo y los desarrolladores después del estudio estimaron un -20%, mientras que el resultado observado fue del 19%. Measuring the Impact of Early-2025 AI on Experienced ...
OpenAI Codex generó más de 400.000 pull requests en dos meses, lo que ilustra el volumen de revisión que pueden crear los agentes autónomos. arxiv.org
En un experimento con ruido de contexto, Sonnet perdió 8 puntos de benchmark mientras Opus ganó 4, mostrando efectos que dependen del modelo. techloom.it
Experimentos de contexto largo encontraron que los modelos recuperaban información con menor precisión cuando el documento relevante aparecía en el centro y no cerca de los extremos. Association for Computational Linguistics
EvalPlus amplió las 164 tareas de HumanEval con aproximadamente 80 veces más pruebas, revelando soluciones incorrectas aceptadas por las suites originales. Neural Information Processing Systems
El argumento
La adopción no demuestra que los desarrolladores consideren fiable el resultado.
Los desarrolladores experimentados tardaron un 19% más con herramientas de IA de principios de 2025.
Un límite universal de contexto puede ayudar a un modelo y dañar a otro.
El SWE-bench original cubrió 12 repositorios y 2.294 incidencias reales, con una media de 191,2 incidencias por repositorio.
Más intentos mejoran las probabilidades, pero alguien todavía debe elegir la respuesta correcta.
EvalPlus amplió 164 tareas de HumanEval con cerca de 80 veces más pruebas y reveló soluciones incorrectas aceptadas por las suites originales.
Esta investigación se publica en inglés y español. Read in English