xAI's comparison places Grok 4.5 at 62%. Two systems score higher, and Opus 4.8 scores lower. Product names alone cannot determine which system should control a repository.
La comparación de xAI ubica a Grok 4.5 en 62%. Dos sistemas obtienen más y Opus 4.8 obtiene menos. Los nombres de producto no determinan qué sistema debe controlar un repositorio.
This argument is no longer about autocomplete. Agents can act across repositories, while harnesses determine their tools and limits. Lifecycle risk asks what happens after a patch passes its test.
Este argumento ya no trata de autocompletado. Los agentes actúan en repositorios y los armazones determinan herramientas y límites. El riesgo del ciclo de vida pregunta qué ocurre después de superar una prueba.
As generation becomes cheap, responsibility shifts from typing code to directing and validating systems.
A medida que generar código se abarata, la responsabilidad pasa de escribirlo a dirigir y validar sistemas.
Reported resolution rose from 1.96% to 12.47% and then 50.8%. That is a major capability shift. It still measures selected repository tests rather than complete production engineering.
La resolución publicada subió de 1,96% a 12,47% y luego a 50,8%. Es un cambio importante de capacidad. Aún mide pruebas seleccionadas y no ingeniería completa en producción.
METR estimated a rapid rise in the length of tasks frontier models can complete with 50% success. The doubling interval was about 7 months between 2019 and early 2025. That pace makes static coding policies age quickly.
METR estimó un aumento rápido en la duración de tareas que los modelos de frontera completan con 50% de éxito. El intervalo de duplicación fue de unos 7 meses entre 2019 y comienzos de 2025. Ese ritmo envejece rápidamente las políticas estáticas.
Anthropic introduced Claude Code as a research preview in February 2025. It expanded the product with Claude 4 in May. The short interval shows how quickly agentic coding moved into normal product use.
Anthropic presentó Claude Code como vista previa de investigación en febrero de 2025. Amplió el producto con Claude 4 en mayo. El intervalo corto muestra la rapidez con que la programación agéntica llegó al uso normal.
Anthropic reports 72.5% for Claude Opus 4. OpenAI reports 72.1% for codex-1. The near tie matters more than the decimal because agentic coding is becoming a competitive product category.
Anthropic publica 72,5% para Claude Opus 4. OpenAI publica 72,1% para codex-1. El empate importa más que el decimal porque la programación agéntica se convierte en una categoría competitiva.
Claude Code interactions are mostly classified as automation, not augmentation. Developers increasingly assign work instead of typing every change. This measures interaction style rather than independently verified production outcomes.
Las interacciones de Claude Code se clasifican principalmente como automatización y no como aumento humano. Los desarrolladores asignan trabajo en vez de escribir cada cambio. Esto mide el estilo de interacción y no resultados de producción verificados.
A reported comparison held GPT-5.5 constant and changed the harness. Functionality rose from 61.5% to 87.2%. Model-only policies ignore the tools, context, permissions, and feedback that shape performance.
Una comparación mantuvo GPT-5.5 constante y cambió el armazón. La funcionalidad subió de 61,5% a 87,2%. Las políticas centradas en el modelo ignoran herramientas, contexto, permisos y retroalimentación.
A bounded JavaScript task finished 55.8% faster with Copilot. Three field experiments estimated 26.1% more completed tasks. Experienced developers working in familiar repositories instead took 19% longer with early-2025 tools.
Una tarea delimitada de JavaScript terminó 55,8% más rápido con Copilot. Tres experimentos estimaron 26,1% más tareas completadas. Desarrolladores expertos en repositorios conocidos tardaron 19% más con herramientas de comienzos de 2025.
Investigadores generaron 1.689 programas en 89 escenarios. Cerca de 40% contenía código potencialmente vulnerable. La generación automática puede reproducir patrones inseguros rápidamente, por lo que la revisión no puede desaparecer.
Swiss Re reported 88% fewer property-damage claims and 92% fewer bodily-injury claims. The analysis covered 25.3 million Waymo driverless miles. Strong automation claims require this kind of defined domain and comparable outcome.
Swiss Re informó 88% menos reclamaciones por daños y 92% menos por lesiones. El análisis cubrió 25,3 millones de millas autónomas de Waymo. Las afirmaciones fuertes requieren un dominio definido y un resultado comparable.
Congress required action in 2008. NHTSA finalized the rule in 2014, and full compliance arrived in 2018. Responsible mandates emerge through evidence and standards rather than product announcements alone.
El Congreso exigió acción en 2008. NHTSA finalizó la regla en 2014 y el cumplimiento pleno llegó en 2018. Los mandatos responsables surgen de evidencia y normas, no solo de anuncios.
Rear cameras reduced backing crashes 17%. Cameras plus sensors reached 42%, while rear autobraking reached 78%. The surrounding control system determines the value of the technology.
Las cámaras redujeron 17% los choques de reversa. Las cámaras con sensores alcanzaron 42% y el frenado automático 78%. El sistema de control determina el valor de la tecnología.
NIST organizes continuing risk work into Govern, Map, Measure, and Manage. None disappears when implementation becomes cheaper. Problem definition and accountability remain human functions.
NIST organiza el trabajo continuo en Gobernar, Mapear, Medir y Gestionar. Ninguna función desaparece cuando la implementación se abarata. Definir el problema y asumir responsabilidad siguen siendo funciones humanas.
The EU AI Act does not require automated decisions everywhere. It applies different obligations according to risk. Coding policy should follow the same logic and demand automation only where evidence shows lower total risk.
La Ley de IA de la UE no exige decisiones automatizadas en todas partes. Aplica obligaciones distintas según el riesgo. La política de programación debe exigir automatización solo donde la evidencia demuestre menor riesgo total.
Brazil's ICT-service share rose from 2.2% in 2005 to 13.7% in 2025. The acceleration began after a long low plateau. Coding automation arrives inside a sector already gaining export weight.
La cuota brasileña de servicios TIC subió de 2,2% en 2005 a 13,7% en 2025. La aceleración comenzó tras una larga meseta baja. La automatización llega a un sector que ya gana peso exportador.
Colombia's share fell from 9.3% in 2009 to 4.9% in 2019. It then recovered to 11.8% by 2025. Technology transitions can reverse before they accelerate.
La cuota de Colombia cayó de 9,3% en 2009 a 4,9% en 2019. Luego se recuperó hasta 11,8% en 2025. Las transiciones tecnológicas pueden retroceder antes de acelerarse.
India remained near half of service exports across the period. Ireland rose from 36.6% to 57.4% by 2024. Coding automation enters economies where digital services already carry major export weight.
India se mantuvo cerca de la mitad de las exportaciones de servicios. Irlanda subió de 36,6% a 57,4% en 2024. La automatización entra en economías donde los servicios digitales ya tienen gran peso.
Poland rose steadily from 2.6% to 16.9%. The United States rose from 4.1% to 8.3%. Lower coding costs may broaden digital production rather than concentrate it in one market.
Polonia subió de forma sostenida de 2,6% a 16,9%. Estados Unidos pasó de 4,1% a 8,3%. Menores costes de programación pueden ampliar la producción digital en vez de concentrarla.
China's R&D spending rose from 0.56% to 2.58% of GDP. The climb was persistent across nearly 3 decades. Coding automation joins a much broader expansion of technical capacity.
El gasto chino en I+D subió de 0,56% a 2,58% del PIB. El aumento persistió durante casi 3 décadas. La automatización se une a una expansión técnica mucho más amplia.
Germany moved from 2.14% to 3.15% of GDP in R&D spending. The shape is gradual rather than explosive. Cheaper implementation does not replace the institutions that build durable technical capability.
Alemania pasó de 2,14% a 3,15% del PIB en gasto de I+D. La forma es gradual y no explosiva. Una implementación más barata no sustituye las instituciones que crean capacidad duradera.
UK R&D intensity stayed near 1.6% for years. It jumped above 2.2% in 2014 and later approached 3%. Technical ecosystems can change abruptly when measurement, policy, and investment shift.
La intensidad británica se mantuvo cerca de 1,6% durante años. Saltó por encima de 2,2% en 2014 y luego se acercó a 3%. Los ecosistemas técnicos pueden cambiar bruscamente.
Japan crossed 3% in 2005 and largely stayed there. The latest value reached 3.44%. Fast code generation operates inside technical systems built over decades.
Japón superó 3% en 2005 y se mantuvo cerca de ese nivel. El último valor alcanzó 3,44%. La generación rápida funciona dentro de sistemas construidos durante décadas.
Korea rose from 2.14% to 4.94% of GDP. The United States moved from 2.45% to 3.45%. Cheaper implementation changes one production input, while national capability still depends on broader investment.
Corea subió de 2,14% a 4,94% del PIB. Estados Unidos pasó de 2,45% a 3,45%. Una implementación más barata cambia un insumo, mientras la capacidad nacional depende de inversión más amplia.
China rose from about 550 to 2,107 researchers per million people. The latest years accelerated. More capable tools have arrived alongside more human technical capacity, not after its disappearance.
China subió de unos 550 a 2.107 investigadores por millón. Los últimos años aceleraron. Las herramientas más capaces llegaron junto con más capacidad humana, no después de su desaparición.
Germany rose from 3,154 to 5,926 researchers per million. Growth continued through the period. Better tools did not remove the need to expand technical expertise.
Alemania subió de 3.154 a 5.926 investigadores por millón. El crecimiento continuó durante todo el periodo. Mejores herramientas no eliminaron la necesidad de ampliar experiencia técnica.
The UK rose from 2,893 to 4,473 researchers per million by 2017. Growth slowed after the early increase but did not reverse. The series predates current coding agents and anchors the longer capability story.
Reino Unido subió de 2.893 a 4.473 investigadores por millón en 2017. El crecimiento se frenó después del aumento inicial, pero no se revirtió. La serie precede a los agentes actuales.
Japan started above 5,100 researchers per million and ended near 5,609. The level stayed high while growth remained modest. Tools alone do not determine the trajectory of a technical workforce.
Japón comenzó por encima de 5.100 investigadores por millón y terminó cerca de 5.609. El nivel siguió alto y el crecimiento fue modesto. Las herramientas no determinan por sí solas la trayectoria laboral.
Korea rose from 2,324 to 9,472 researchers per million. The United States reached 4,937 in 2022. Technology improvement and human specialization can grow together rather than substitute uniformly.
Corea subió de 2.324 a 9.472 investigadores por millón. Estados Unidos alcanzó 4.937 en 2022. La mejora tecnológica y la especialización humana pueden crecer juntas.
China's annual scientific articles rose from about 53,000 to 933,000. Output accelerated rather than merely becoming cheaper. Coding automation may similarly expand software volume and the work needed to evaluate it.
Los artículos científicos anuales de China subieron de unos 53.000 a 933.000. La producción aceleró en vez de solo abaratarse. La automatización puede ampliar el volumen de software y el trabajo para evaluarlo.
German scientific output grew from about 70,000 to more than 100,000 articles. It then flattened and declined after the 2021 peak. Output systems still face constraints beyond production tools.
La producción científica alemana subió de unos 70.000 a más de 100.000 artículos. Luego se estabilizó y cayó después del pico de 2021. Los sistemas de producción enfrentan límites más allá de las herramientas.
India rose from about 21,000 to 228,000 scientific articles. The curve accelerated in the closing years. More output raises the value of selection, verification, integration, and maintenance.
India subió de unos 21.000 a 228.000 artículos científicos. La curva aceleró en los últimos años. Más producción aumenta el valor de selección, verificación, integración y mantenimiento.
Japan peaked near 113,000 articles in 2006. By 2023, output had returned below the 2000 level. Mature technical capacity does not guarantee expanding output.
Japón alcanzó casi 113.000 artículos en 2006. En 2023, la producción volvió por debajo del nivel de 2000. Una capacidad técnica madura no garantiza expansión.
Korea rose from about 16,000 to 72,000 articles. US output grew more slowly and declined after 2021. The same technology era can produce very different institutional outcomes.
Corea subió de unos 16.000 a 72.000 artículos. La producción estadounidense creció más despacio y cayó después de 2021. La misma era tecnológica puede producir resultados institucionales muy distintos.
Korea's high-technology share fluctuated around 30% before ending at 36.3%. The system includes manufacturing, research, supply chains, and operations. Faster coding changes one layer of that stack.
La cuota coreana fluctuó cerca de 30% antes de terminar en 36,3%. El sistema incluye manufactura, investigación, cadenas de suministro y operaciones. Programar más rápido cambia una sola capa.
Mexico's high-technology share stayed close to 20% for most years. The latest value was 19.3%. Rapid improvements in coding tools do not automatically transform every surrounding economic structure.
La cuota mexicana se mantuvo cerca de 20% durante la mayoría de los años. El último valor fue 19,3%. Las mejoras rápidas de herramientas no transforman automáticamente toda estructura económica.
The US share fell from 29.9% to 18.5% by 2018. It recovered to 24.3% in 2024. A technology system can improve while remaining below its earlier structure.
La cuota estadounidense cayó de 29,9% a 18,5% en 2018. Se recuperó hasta 24,3% en 2024. Un sistema tecnológico puede mejorar y seguir por debajo de su estructura anterior.
Brazil's share rose above 60% and remained there. It peaked at 68.6% in 2020 before easing. The economic base for software automation is already substantial.
La cuota brasileña superó 60% y se mantuvo allí. Alcanzó 68,6% en 2020 antes de moderarse. La base económica para automatización de software ya es considerable.
Colombia jumped from 25.2% to 49.1% in 2020. The share then retreated to 33% by 2025. Short-term digital acceleration can overstate a lasting structural shift.
Colombia saltó de 25,2% a 49,1% en 2020. La cuota retrocedió hasta 33% en 2025. Una aceleración digital breve puede exagerar un cambio estructural duradero.
India remained near 70% for years before crossing 80% in 2020. The latest value reached 81.8%. Coding-agent gains can matter at national scale where digital services dominate exports.
India se mantuvo cerca de 70% durante años antes de superar 80% en 2020. El último valor alcanzó 81,8%. Las mejoras de agentes pueden importar a escala nacional donde dominan los servicios digitales.
Ireland rose from 59.5% to 87.4%. Digital services became the overwhelming majority of commercial service exports. Coding policy in such an economy affects far more than software teams.
Irlanda subió de 59,5% a 87,4%. Los servicios digitales pasaron a ser la gran mayoría de las exportaciones comerciales. La política de programación afecta mucho más que equipos de software.
China rose from 25,346 to 1.43 million resident patent applications. The increase was 56-fold. Software could face a similar shift from scarce production toward abundant output and scarce evaluation.
China subió de 25.346 a 1,43 millones de solicitudes de patentes de residentes. El aumento fue de 56 veces. El software podría pasar de producción escasa a producción abundante y evaluación escasa.
Germany declined from 51,736 to 39,822 resident patent applications. The fall accelerated after 2019. Better tools do not remove institutional, market, or demographic constraints on output.
Alemania cayó de 51.736 a 39.822 solicitudes de patentes de residentes. La caída aceleró después de 2019. Mejores herramientas no eliminan límites institucionales, comerciales o demográficos.
India rose from 2,206 to 26,267 resident patent applications. Growth accelerated in the closing years. Abundant production increases the need to decide which outputs deserve integration and maintenance.
India subió de 2.206 a 26.267 solicitudes de patentes de residentes. El crecimiento aceleró en los últimos años. Una producción abundante aumenta la necesidad de decidir qué resultados integrar y mantener.
Japan fell from 387,364 to 222,452 resident patent applications. The decline persisted across 2 decades. Technical output depends on more than the speed of producing an individual artifact.
Japón cayó de 387.364 a 222.452 solicitudes de patentes de residentes. El descenso persistió durante 2 décadas. La producción técnica depende de más que la velocidad de crear un artefacto.
Korea rose from 72,831 to 186,245 resident applications. The United States peaked and then fell to 262,244. Automation may redistribute technical work rather than eliminate it uniformly.
Corea subió de 72.831 a 186.245 solicitudes de residentes. Estados Unidos alcanzó un pico y luego cayó a 262.244. La automatización puede redistribuir trabajo técnico en vez de eliminarlo uniformemente.
Brazilian unemployment peaked at 13.7% in 2020 and fell to 6% by 2025. The reversal predates any measurable economy-wide coding-agent effect. Macro labor series cannot substitute for direct occupational evidence.
El desempleo brasileño alcanzó 13,7% en 2020 y cayó a 6% en 2025. La reversión precede cualquier efecto económico medible de agentes. Las series macro no sustituyen evidencia ocupacional directa.
Colombia fell from 20.5% unemployment in 2000 to 8.3% in 2025. A sharp 2020 interruption did not erase the longer decline. Broad labor outcomes cannot be assigned to one class of software tools.
Colombia pasó de 20,5% de desempleo en 2000 a 8,3% en 2025. La interrupción de 2020 no borró la caída de largo plazo. Los resultados laborales amplios no pueden atribuirse a una clase de herramientas.
German unemployment peaked at 11.2% in 2005 and fell below 4%. The decline spans many technology cycles. National employment cannot reveal whether coding agents help or displace developers.
El desempleo alemán alcanzó 11,2% en 2005 y cayó por debajo de 4%. La caída abarca muchos ciclos tecnológicos. El empleo nacional no revela si los agentes ayudan o desplazan desarrolladores.
India stayed near 7.6% for almost 2 decades. The estimate then fell toward 4.2%. The country also carries a high digital-service export share, showing why simple displacement stories are inadequate.
India se mantuvo cerca de 7,6% durante casi 2 décadas. La estimación luego cayó hacia 4,2%. El país también tiene una cuota digital alta, mostrando por qué las historias simples de desplazamiento son insuficientes.
Ireland's unemployment rose from about 4% to 15.5%, then returned near 4.6%. The country simultaneously became highly specialized in digital services. Digital intensity does not remove broader economic cycles.
El desempleo irlandés subió de cerca de 4% a 15,5% y volvió a 4,6%. El país se especializó al mismo tiempo en servicios digitales. La intensidad digital no elimina los ciclos económicos.
Poland fell from more than 20% unemployment to 3%. The United States ended at 4.2%. Poland also expanded its digital-service export share, which complicates simple technology-displacement claims.
Polonia pasó de más de 20% de desempleo a 3%. Estados Unidos terminó en 4,2%. Polonia también amplió su cuota digital, complicando afirmaciones simples de desplazamiento tecnológico.
Implementation cost is only one part of software economics. CISQ estimated poor software quality cost the United States at least $2.41 trillion in 2022. Faster generation can amplify expensive integration and maintenance mistakes.
El coste de implementación es solo una parte de la economía del software. CISQ estimó que la mala calidad costó al menos 2,41 billones USD en 2022. Una generación más rápida puede amplificar errores caros de integración y mantenimiento.
Automation can displace implementation tasks while expanding complementary work. The supplied research identifies evaluation, integration, security, operations, and product judgment. The scarce skill moves upward in the system rather than vanishing uniformly.
La automatización puede desplazar tareas de implementación mientras amplía trabajo complementario. La investigación identifica evaluación, integración, seguridad, operaciones y juicio de producto. La habilidad escasa sube en el sistema en vez de desaparecer uniformemente.
The work moves from manual production toward review, integration, and shared judgment.
El trabajo pasa de la producción manual a la revisión, la integración y el juicio compartido.
NIST distributes secure-development responsibility across design, development, verification, release, and vulnerability response. Agents can take implementation work without taking accountability. The lifecycle remains a human and organizational obligation.
NIST distribuye responsabilidad entre diseño, desarrollo, verificación, lanzamiento y respuesta a vulnerabilidades. Los agentes pueden asumir implementación sin asumir responsabilidad. El ciclo sigue siendo una obligación humana y organizativa.
A new model name does not guarantee coding leadership. The model generates code. The surrounding system determines its power.
Key findings
METR estimated that the 50%-success task horizon of frontier models doubled approximately every seven months between 2019 and early 2025. METR
In a randomized study of 16 experienced developers and 246 tasks, early-2025 AI tools increased completion time by 19%. METR
A reported harness comparison raised GPT-5.5 functionality from 61.5% in Codex to 87.2% in Cursor, a 26-point difference without changing the model. yodev.dev
No primary source available to this review verifies a released Anthropic product named Opus 4.8. Anthropic
Reported repository-resolution scores progressed from 1.96% for an early baseline to 12.47% for SWE-agent and 50.8% for a later verified evaluation. Princeton University
No primary source available to this review verifies benchmarks for a released product specifically named Composer 2.5. Anysphere
No primary source available to this review verifies coding results for a released model specifically named Grok 4.5. xAI
Reported SWE-bench resolution advanced from below 2% for an early baseline through results above 10%, 30%, and 50% for later systems. Princeton University
Researchers generated 1,689 programs across 89 scenarios and found approximately 40% contained potentially vulnerable code. New York University
A 47-person experiment found that AI-assisted participants produced less secure code while reporting greater confidence in its security. Stanford University
DORA's 2024 observational analysis associated higher AI adoption with better documentation and code quality but weaker delivery stability and throughput. Google Cloud
Swiss Re reported 88% fewer property-damage claims and 92% fewer bodily-injury claims across 25.3 million Waymo driverless miles. Swiss Re
The argument
As generation becomes cheap, responsibility shifts from typing code to directing and validating systems.
Agentic repository work improved too quickly to dismiss.
METR estimated frontier task horizons doubled about every 7 months.
Delegated repository work became a shipping product quickly.
Delegated repository resolution is no longer a one-vendor capability.
Anthropic classified 79% of sampled conversations as automation.
This research is published in English and Spanish. Ver en español
La investigación detrás de esta presentación
Un modelo nuevo no garantiza liderazgo en programación. El modelo genera código. El sistema que lo rodea determina su poder.
Hallazgos clave
METR estimó que el horizonte de tareas con 50% de éxito de los modelos de frontera se duplicó aproximadamente cada siete meses entre 2019 y comienzos de 2025. METR
En un estudio aleatorio de 16 desarrolladores experimentados y 246 tareas, las herramientas de comienzos de 2025 aumentaron el tiempo 19%. METR
Una comparación reportada elevó la funcionalidad de GPT-5.5 de 61,5% en Codex a 87,2% en Cursor, una diferencia de 26 puntos sin cambiar el modelo. yodev.dev
Ninguna fuente primaria disponible para esta revisión verifica un producto lanzado por Anthropic llamado Opus 4.8. Anthropic
Las puntuaciones publicadas de resolución progresaron de 1,96% para una referencia temprana a 12,47% para SWE-agent y 50,8% en una evaluación verificada posterior. Princeton University
Ninguna fuente primaria disponible para esta revisión verifica evaluaciones de un producto lanzado llamado específicamente Composer 2.5. Anysphere
Ninguna fuente primaria disponible para esta revisión verifica resultados de programación de un modelo lanzado llamado específicamente Grok 4.5. xAI
La resolución publicada de SWE-bench avanzó desde menos de 2% en una referencia temprana hasta resultados superiores a 10%, 30% y 50%. Princeton University
Investigadores generaron 1.689 programas en 89 escenarios y encontraron que aproximadamente 40% contenía código potencialmente vulnerable. New York University
Un experimento con 47 personas encontró que los participantes asistidos por IA produjeron código menos seguro y mostraron mayor confianza en él. Stanford University
El análisis observacional DORA de 2024 asoció mayor adopción de IA con mejor documentación y calidad, pero menor estabilidad y rendimiento de entrega. Google Cloud
Swiss Re informó 88% menos reclamaciones por daños materiales y 92% menos por lesiones en 25,3 millones de millas autónomas de Waymo. Swiss Re
El argumento
A medida que generar código se abarata, la responsabilidad pasa de escribirlo a dirigir y validar sistemas.
El trabajo agéntico en repositorios mejoró demasiado rápido para ignorarlo.
METR estimó que los horizontes se duplicaron cada 7 meses.
El trabajo delegado en repositorios se convirtió rápidamente en producto.
La resolución delegada ya no es capacidad de un solo proveedor.
Anthropic clasificó 79% de las conversaciones analizadas como automatización.
Esta investigación se publica en inglés y español. Read in English