Hanademi

Cursor became an agent platformCursor se convirtió en una plataforma de agentes · V7

31 slides · 23 min · 2026-08-04 language
ENES
theme
LightDark
view
DeckTableTalk
brand
HanademiPlatzi
Cursor became an agentplatformMade for Christian Rios, by Hanademi
  1. Investors priced the platform story before its outcomes were settled.
  2. Cursor reports that its concurrent agents wrote over 1,000,000 lines of code while consuming trillions of tokens.
  3. Cursor's Auto option moves 1 model-selection decision from developer to platform.
Cursor se convirtió en unaplataforma de agentesMade for Christian Rios, by Hanademi
  1. Los inversionistas valoraron la historia de plataforma antes de resolver sus resultados.
  2. Cursor informa que sus agentes simultáneos escribieron más de 1.000.000 de líneas de código mientras consumían billones de tokens.
  3. La opción Auto de Cursor traslada 1 decisión de selección del desarrollador a la plataforma.
Cursor's reported valuation jumped nearly25xReported Anysphere valuation, USD billions, August 2024 to June 2025.Made for Christian Rios, by HanademiSources: TechCrunch. (2024, August 22). Anysphere raises $60M at a $400M valuation.; TechCrunch. (2025, June 5). Cursor maker Anysphereraises $900M at a $9.9B valuation.UnitUSD$0$5B$10BAugust 2024January 2025June 2025August 2024 started at $400million.June 2025 reached $9.9 billion.
The market moved faster than the product debate. Anysphere's reported valuation rose from $400 million to $9.9 billion in under 10 months. That is nearly a 25x increase. It proves investor conviction, not durable productivity or profitability.
La valoración reportada de Cursor aumentócasi 25 vecesValoración reportada de Anysphere, miles de millones de dólares, de agosto de 2024 a junio de 2025.Made for Christian Rios, by HanademiFuentes: TechCrunch. (2024, August 22). Anysphere raises $60M at a $400M valuation.; TechCrunch. (2025, June 5). Cursor maker Anysphereraises $900M at a $9.9B valuation.UnidadUSD$0$5 mil M$10 mil MAgosto de 2024Enero de 2025Junio de 2025Agosto de 2024 comenzó en 400millones de dólares.Junio de 2025 alcanzó 9.900millones de dólares.
El mercado avanzó más rápido que el debate sobre el producto. La valoración reportada de Anysphere subió de 400 millones a 9.900 millones de dólares en menos de 10 meses. Es un aumento de casi 25 veces. Demuestra convicción inversionista, no productividad duradera ni rentabilidad.
A few terms before the agents startMade for Christian Rios, by HanademiCoding agentSoftware that plans, edits, runs commands, and checks code.Pull requestA proposed code change awaiting review and approval.CheckpointA saved model version used as a starting foundation.Prompt injectionUntrusted content that tricks an AI into following harmful instructions.
The vocabulary reveals the wider product boundary. Cursor is no longer only suggesting text inside a file. Agents can act across repositories, commands, reviews, and model providers. That reach creates both the platform opportunity and its governance problem.
Algunos términos antes de iniciar losagentesMade for Christian Rios, by HanademiAgente de programaciónSoftware que planifica, edita, ejecuta comandos y revisa código.Solicitud de incorporaciónUn cambio de código propuesto que espera revisión y aprobación.CheckpointUna versión guardada de un modelo usada como base inicial.Inyección de instruccionesContenido no confiable que engaña a una IA para seguirinstrucciones dañinas.
El vocabulario revela una frontera de producto más amplia. Cursor ya no solamente sugiere texto dentro de un archivo. Los agentes pueden actuar sobre repositorios, comandos, revisiones y proveedores de modelos. Ese alcance crea tanto la oportunidad de plataforma como su problema de gobernanza.
Cursor moved from editor releases to agentmanagementDocumented product and governance milestones from June 2025 to June 2026.Made for Christian Rios, by HanademiSources: Cursor. (2025, June 4). Cursor 1.0.; Cursor. (2025, October 29). Cursor 2.0 and Composer.; New Coding Model and AgentInterface.; infoq.com.; labs.cloudsecurityalliance.org.; startdebugging.net.Month-only sources are placed on the first day of the stated month.Unitcalendar dateJun 4, 2025Oct 29, 2025Jan 8, 2026Apr 1, 2026Jun 1, 2026Jun 4, 2025June 2025, Cursor 1.0: BackgroundAgent and Bugbot availableOct 29, 2025October 2025, Cursor 2.0: Composerand up to 8 parallel agentsJan 8, 2026January 2026, NIST requeston autonomous-agent controlsApr 1, 2026April 2026, Cursor 3: agent managementbecomes the primary interactionJun 1, 2026June 2026, local Bugbot reviewreported for Cursor 3.7
Cursor 1.0 announced general availability for Bugbot and made Background Agent available to all users in June 2025. Cursor 2.0 reportedly introduced Composer and an interface for running up to 8 agents in parallel in October 2025. Anysphere then released Cursor 3 with an interface that shifts the primary interaction from file editing to managing parallel coding agents. NIST's January 2026 information request shows that controls for autonomous agent systems had also become a formal governance topic. A June 2026 report says Cursor 3.7 can run Bugbot locally against a branch before the code leaves the machine.
Cursor pasó de lanzar funciones del editor agestionar agentesHitos documentados de producto y gobernanza entre junio de 2025 y junio de 2026.Made for Christian Rios, by HanademiFuentes: Cursor. (2025, June 4). Cursor 1.0.; Cursor. (2025, October 29). Cursor 2.0 and Composer.; New Coding Model and Agent Interface.;infoq.com.; labs.cloudsecurityalliance.org.; startdebugging.net.Las fuentes que solamente indican el mes se colocan en el primer día de ese mes.UnidadfechaJun 4, 2025Oct 29, 2025Jan 8, 2026Apr 1, 2026Jun 1, 2026Jun 4, 2025Junio de 2025, Cursor 1.0: BackgroundAgent y Bugbot disponiblesOct 29, 2025Octubre de 2025, Cursor 2.0:Composer y hasta 8 agentes en paraleloJan 8, 2026Enero de 2026, solicitud del NISTsobre controles de agentes autónomosApr 1, 2026Abril de 2026, Cursor 3: la gestión deagentes se vuelve la interacción principalJun 1, 2026Junio de 2026, informe sobre revisiónlocal de Bugbot en Cursor 3.7
Cursor 1.0 anunció la disponibilidad general de Bugbot y puso Background Agent a disposición de todos los usuarios en junio de 2025. Cursor 2.0 habría presentado Composer y una interfaz para ejecutar hasta 8 agentes en paralelo en octubre de 2025. Después, Anysphere lanzó Cursor 3 con una interfaz que desplaza la interacción principal de editar archivos a gestionar agentes de programación en paralelo. La solicitud de información del NIST de enero de 2026 muestra que los controles para sistemas autónomos de agentes también se habían convertido en un tema formal de gobernanza. Un informe de junio de 2026 señala que Cursor 3.7 puede ejecutar Bugbot localmente sobre una rama antes de que el código salga del equipo.
A 2026 report places Bugbot two workflowstages earlierMade for Christian Rios, by HanademiSources: Cursor. (2025, June 4). Cursor 1.0.; Cursor. (2025-2026). Bugbot documentation.; How to Run aPre-Push Code Review Locally with Cursor Bugbot's /review - Start Debugging.Unitworkflow stage and elapsed monthsLocal editingRemote pushPull request reviewCursor 1.0, June 2025Bugbot: pull request reviewCursor 3.7 report, June 2026Bugbot: local review12 months and 2 stages earlier
The pre-push gate described in the thesis appears in the later Cursor 3.7 report, not in the cited Cursor 1.0 documentation.
Un informe de 2026 sitúa a Bugbot dosetapas antes en el flujo de trabajoMade for Christian Rios, by HanademiFuentes: Cursor. (2025, June 4). Cursor 1.0.; Cursor. (2025-2026). Bugbot documentation.; How to Run aPre-Push Code Review Locally with Cursor Bugbot's /review - Start Debugging.Unidadetapa del flujo de trabajo y meses transcurridosEdición localEnvío remotoRevisión de solicitud de cambioCursor 1.0, junio de 2025Bugbot: revisión de solicitud de cambioInforme sobre Cursor 3.7, junio de 2026Bugbot: revisión local12 meses y 2 etapas antes
El control previo al envío descrito en la tesis aparece en el informe posterior sobre Cursor 3.7, no en la documentación citada de Cursor 1.0.
Cursor reports concurrent agents wroteover 1,000,000 lines of code.Cursor reported the experiment and the cited value is over 1,000,000 lines of code.Lines written and tokens consumed do not measure accepted code or escaped defects.Sources: cursor.com.
This is infrastructure-scale generation, not an editor suggesting the next line. Cursor reports coordinating hundreds of agents that produced over 1,000,000 lines of code and consumed trillions of tokens. Output volume is proven inside the experiment. Accepted quality and economic value still require separate measurement.
Cursor informa que agentessimultáneos escribieron más de1.000.000 de líneas de código.Cursor informó el experimento y el valor citado supera 1.000.000 de líneas de código.Las líneas escritas y los tokens consumidos no miden el código aceptado ni los defectosescapados.Fuentes: cursor.com.
Esto es generación a escala de infraestructura, no un editor que sugiere la siguiente línea. Cursor informa que coordinó cientos de agentes que produjeron más de 1.000.000 de líneas de código y consumieron billones de tokens. El volumen de producción queda demostrado dentro del experimento. La calidad aceptada y el valor económico todavía necesitan medición separada.
Anysphere's latest round was 15x its firstReported financing raised, USD millions, August 2024 to June 2025.Made for Christian Rios, by HanademiSources: Anysphere. (2024, August 22). Series A.; Anysphere. (2025, January 14). Series B.; Anysphere. (2025, June 5). Series C.UnitUSD$0$500M$1,000MAugust 2024January 2025June 2025The June 2025 round reached$900 million.
Anysphere raised $60 million in August 2024, $105 million in January 2025, and $900 million in June. The latest round was 15 times the first. Investors were funding a platform-scale ambition. The financing itself does not establish profitability or durable customer outcomes.
La última ronda de Anysphere fue 15 vecesla primeraFinanciamiento reportado, millones de dólares, de agosto de 2024 a junio de 2025.Made for Christian Rios, by HanademiFuentes: Anysphere. (2024, August 22). Series A.; Anysphere. (2025, January 14). Series B.; Anysphere. (2025, June 5). Series C.UnidadUSD$0$500 M$1.000 MAgosto de 2024Enero de 2025Junio de 2025La ronda de junio de 2025alcanzó 900 millones dedólares.
Anysphere captó 60 millones de dólares en agosto de 2024, 105 millones en enero de 2025 y 900 millones en junio. La última ronda fue 15 veces la primera. Los inversionistas financiaban una ambición a escala de plataforma. El financiamiento no demuestra por sí mismo rentabilidad ni resultados duraderos para clientes.
Fundraising intensity rebounded to 9.1% byJune 2025Divide each reported round size by the valuation reported for the same month and multiply by 100: 60 ÷400, 105 ÷ 2,500, and 900 ÷ 9,900.Made for Christian Rios, by HanademiSources: Anysphere. (2024, August 22). Series A.; Anysphere. (2025, January 14). Series B.; Anysphere. (2025,June 5). Series C.Unitround size as percent of reported valuation051015August 2024January 2025June 2025159.1
The June round was 15 times the August round in dollars, but represented 9.1% of valuation versus 15% initially. Financing intensity still more than doubled from January.
La intensidad de financiación repuntó al 9,1%en junio de 2025Se divide el tamaño de cada ronda reportada por la valoración del mismo mes y se multiplica por 100: 60 ÷400, 105 ÷ 2.500 y 900 ÷ 9.900.Made for Christian Rios, by HanademiFuentes: Anysphere. (2024, August 22). Series A.; Anysphere. (2025, January 14). Series B.; Anysphere. (2025,June 5). Series C.Unidadtamaño de la ronda como porcentaje de la valoración reportada051015Agosto de 2024Enero de 2025Junio de 2025159,1
La ronda de junio fue 15 veces mayor que la de agosto en dólares, pero representó el 9,1% de la valoración frente al 15% inicial. Aun así, la intensidad de financiación aumentó más del doble desde enero.
Bornbee measured -23% output quality with15 agents than at its five-agent peak.This vendor case study should not be generalized to every agent architecture orworkload.Sources: bornbee.com.
Parallelism can pass its useful limit. Bornbee reports -23% output quality with 15 agents versus its five-agent peak. Coordination overhead can erase the benefit of extra workers. Capacity therefore needs task-level evidence, not a simple maximum.
Bornbee midió -23% en calidad deresultados con 15 agentes frente a sumáximo con cinco.Este estudio de caso de un proveedor no debe generalizarse a todas las arquitecturas nicargas de trabajo.Fuentes: bornbee.com.
El paralelismo puede superar su límite útil. Bornbee informa de -23% en calidad de resultados con 15 agentes frente a su máximo con cinco. La carga de coordinación puede borrar el beneficio de trabajadores adicionales. La capacidad necesita evidencia por tarea, no solamente un máximo.
Eight active agents can create 8x inferenceloadMaximum first-order load multiplier before retries, tests, summaries, and review.Made for Christian Rios, by HanademiSources: Cursor. (2025). Parallel agents documentation.; Cursor 3 Parallel Agents Tutorial 2026: Run Multiple AI AgentsSimultaneously | RockB.Unitload multiplier1 active agent12 active agents24 active agents48 active agents8
Eight agents do not mean eight times the productivity. They can mean eight times the first-order inference load before retries, tests, summaries, and review. The platform widens the search space, but someone still pays for every attempt. Efficiency depends on choosing when parallel search is worth that cost.
Ocho agentes activos pueden crear 8 vecesla carga de inferenciaMultiplicador máximo de carga inicial antes de reintentos, pruebas, resúmenes y revisión.Made for Christian Rios, by HanademiFuentes: Cursor. (2025). Parallel agents documentation.; Cursor 3 Parallel Agents Tutorial 2026: Run Multiple AI AgentsSimultaneously | RockB.Unidadmultiplicador de carga1 agente activo12 agentes activos24 agentes activos48 agentes activos8
Ocho agentes no significan ocho veces la productividad. Pueden significar ocho veces la carga de inferencia inicial antes de reintentos, pruebas, resúmenes y revisión. La plataforma amplía el espacio de búsqueda, pero alguien todavía paga por cada intento. La eficiencia depende de decidir cuándo compensa esa búsqueda paralela.
Cursor's Auto option moves 1model -selection decision fromdeveloper to platform.Automatic selection can simplify use while reducing visibility into which model processeda request.Sources: Cursor. (2025). Models documentation.
A multi-model interface does more than offer a menu. Cursor's Auto option reportedly chooses among available models for the developer. That moves 1 consequential decision into the platform. Cost, quality, retention, and availability can all depend on that hidden choice.
La opción Auto de Cursor traslada 1decisión de selección deldesarrollador a la plataforma.La selección automática puede simplificar el uso mientras reduce la visibilidad sobre quémodelo procesó una solicitud.Fuentes: Cursor. (2025). Models documentation.
Una interfaz multimodelo hace más que ofrecer un menú. La opción Auto de Cursor habría elegido entre los modelos disponibles por el desarrollador. Eso traslada 1 decisión importante a la plataforma. El costo, la calidad, la retención y la disponibilidad pueden depender de esa elección oculta.
Routing can lower cost, but the platformcontrols the optimization.The 60% result comes from Cursor-run tests reported by a third party.Sources: digitalapplied.com.
Model choice becomes an optimization layer once the platform can route each request. Cursor Router reportedly saved 60% in Cursor-run tests compared with using only Opus 4.8. Early enterprise savings were reported at 30% to 50%. The tradeoff is less direct control over which model handles the work.
El enrutamiento puede reducir costos, perola plataforma controla la optimización.El resultado de 60% procede de pruebas de Cursor informadas por un tercero.Fuentes: digitalapplied.com.
La elección del modelo se convierte en una capa de optimización cuando la plataforma puede enrutar cada solicitud. Cursor Router habría ahorrado 60% en pruebas de Cursor frente al uso exclusivo de Opus 4.8. Los ahorros iniciales para empresas se informaron entre 30% y 50%. La contraparte es un menor control directo sobre qué modelo realiza el trabajo.
Five model suppliers create at least 5policy surfaces for Cursor.Supplier diversity spreads technical dependence while multiplying policies that teamsmust monitor.Sources: Cursor. (2025-2026). Security and privacy documentation.
Multi-model access reduces dependence on a single laboratory. It also creates at least 5 separate supplier policy surfaces. Price, retention, availability, and capability can change independently. Routing convenience therefore comes with a larger governance job.
Cinco proveedores de modeloscrean al menos 5 superficiesnormativas para Cursor.La diversidad de proveedores distribuye la dependencia técnica mientras multiplica laspolíticas que los equipos deben vigilar.Fuentes: Cursor. (2025-2026). Security and privacy documentation.
El acceso multimodelo reduce la dependencia de un solo laboratorio. También crea al menos 5 superficies normativas separadas. El precio, la retención, la disponibilidad y la capacidad pueden cambiar de forma independiente. La comodidad del enrutamiento trae consigo una tarea de gobernanza mayor.
Accepting 1 of 8 agent outputs leaves 7 tojudgeUnselected outputs when 1 competing solution is accepted.Made for Christian Rios, by HanademiSources: Cursor. (2025). Parallel agents documentation.; New Coding Model and Agent Interface.Unitunselected outputs2 competing agents14 competing agents36 competing agents58 competing agents7
Eight printers can create pages quickly, but an editor still decides what ships. If 8 agents produce competing solutions and only 1 is accepted, 7 outputs remain. Those outputs must be compared, rejected, or discarded. Parallelism moves work from writing toward testing and judgment.
Aceptar 1 de 8 resultados deja 7 porevaluarResultados no seleccionados cuando se acepta 1 solución competidora.Made for Christian Rios, by HanademiFuentes: Cursor. (2025). Parallel agents documentation.; New Coding Model and Agent Interface.Unidadresultados no seleccionados2 agentes competidores14 agentes competidores36 agentes competidores58 agentes competidores7
Ocho impresoras pueden crear páginas rápidamente, pero un editor todavía decide qué se publica. Si 8 agentes producen soluciones competidoras y solamente se acepta 1, quedan 7 resultados. Esos resultados deben compararse, rechazarse o descartarse. El paralelismo traslada trabajo desde la escritura hacia las pruebas y el juicio.
People still judge the outputTwo people observe a computer monitor in an office setting.Sources: infoq.com.
As agents generate more alternatives, human review remains the bottleneck.
Las personas aún juzgan el resultadoDos personas observan un monitor de computadora en un entorno de oficina.Fuentes: infoq.com.
A medida que los agentes generan más alternativas, la revisión humana sigue siendo el cuello de botella.
At eight agents, 87.5% of first-order workcan go unselectedMade for Christian Rios, by HanademiSources: Cursor. (2025). Parallel agents documentation.; Cursor 3 Parallel Agents Tutorial 2026: Run Multiple AIAgents Simultaneously | RockB.; New Coding Model and Agent Interface.Unitshare of first-order agent output2 competing agents50% selected50% not selected4 competing agents25% selected75% not selected8 competing agents12.5% selected87.5% not selectedAccepted outputComparison, rejection, or disposal
Parallelism increases solution breadth, but accepting only one result drives first-order selection efficiency from 50% with two agents to 12.5% with eight.
Con ocho agentes, el 87,5% del trabajo deprimer orden puede quedar sin seleccionarMade for Christian Rios, by HanademiFuentes: Cursor. (2025). Parallel agents documentation.; Cursor 3 Parallel Agents Tutorial 2026: Run Multiple AIAgents Simultaneously | RockB.; New Coding Model and Agent Interface.Unidadproporción de la producción de agentes de primer orden2 agentes en competencia50% seleccionado50% no seleccionado4 agentes en competencia25% seleccionado75% no seleccionado8 agentes en competencia12,5% seleccionado87,5% no seleccionadoProducción aceptadaComparación, rechazo o descarte
El paralelismo amplía la variedad de soluciones, pero aceptar un solo resultado reduce la eficiencia de selección de primer orden del 50% con dos agentes al 12,5% con ocho.
Google selected the optimal agentarchitecture for 87% of unseen tasks.After evaluating 180 agent configurations, Google reports selecting the optimalarchitecture for 87% of unseen tasks. The result supports adaptive orchestration, not auniversal rule that more agents improve every task.Sources: research.google.
Agent count is only one design choice. Google evaluated 180 configurations and reports selecting the optimal architecture for 87% of unseen tasks. Orchestration becomes a model problem of its own. Platforms must decide when agents collaborate, divide work, or stay out of one another's way.
Google seleccionó la arquitectura óptima deagentes para el 87% de las tareas no vistas.Tras evaluar 180 configuraciones de agentes, Google informa que seleccionó laarquitectura óptima para el 87% de las tareas no vistas. El resultado respalda laorquestación adaptativa, no una regla universal según la cual más agentes mejoran todaslas tareas.Fuentes: research.google.
La cantidad de agentes es solamente una decisión de diseño. Google evaluó 180 configuraciones e informa que seleccionó la arquitectura óptima para el 87% de las tareas no vistas. La orquestación se convierte en un problema de modelo propio. Las plataformas deben decidir cuándo los agentes colaboran, dividen el trabajo o evitan interferirse.
Cursor says Composer 2.5 usesMoonshot's open Kimi K2.5 checkpoint.Cursor is the source for the checkpoint relationship.Sources: cursor.com.
Composer is a proprietary product layer, but it does not necessarily begin from zero. Cursor says Composer 2.5 uses the same open-source Kimi K2.5 checkpoint as Composer 2. Differentiation may sit in training, tools, routing, and integration. A version name alone does not prove benchmark leadership.
Cursor afirma que Composer 2.5 usa elcheckpoint abierto Kimi K2.5 de Moonshot.Cursor es la fuente de la relación entre los checkpoints.Fuentes: cursor.com.
Composer es una capa de producto propia, pero no necesariamente comienza desde cero. Cursor afirma que Composer 2.5 usa el mismo checkpoint abierto Kimi K2.5 que Composer 2. La diferenciación puede estar en el entrenamiento, las herramientas, el enrutamiento y la integración. Un nombre de versión no demuestra por sí solo liderazgo en evaluaciones.
Cursor says Bugbot resolved more andfound moreCursor-run results across 40 experiments, comparing earlier and later Bugbot configurations.Made for Christian Rios, by HanademiSources: cursor.com.Unitresolution rate and bugs per runResolution rate52%70%Earlier configurationLater configurationBugs flagged per run0.400.70Earlier configurationLater configuration
Cursor reports progress on both sides of review quality. Resolution rose from 52% to over 70%, while bugs flagged per run increased from 0.4 to 0.7. The direction is promising across 40 experiments. Independent production evidence would need to test precision, recall, and escaped defects.
Cursor afirma que Bugbot resolvió más yencontró másResultados de Cursor en 40 experimentos, comparando configuraciones anteriores y posteriores de Bugbot.Made for Christian Rios, by HanademiFuentes: cursor.com.Unidadtasa de resolución y errores por ejecuciónTasa de resolución52 %70 %Configuración anteriorConfiguración posteriorErrores señalados por ejecución0,400,70Configuración anteriorConfiguración posterior
Cursor informa avances en ambos lados de la calidad de revisión. La resolución subió de 52% a más de 70%, mientras los errores señalados por ejecución aumentaron de 0,4 a 0,7. La dirección es prometedora en 40 experimentos. La evidencia independiente en producción tendría que probar precisión, cobertura y defectos escapados.
Bugbot's reported resolved findings per runmore than doubledMade for Christian Rios, by HanademiSources: Cursor. (2025-2026). Bugbot documentation.; cursor.com.Unitreported bug findings per review runEarlier reported rate0.21 resolved0.19 unresolvedLater reported rateMore than 0.49 resolvedLess than 0.21 unresolved00.20.40.60.8Findings per review run3 independent validation metrics remain missing
Reported resolved yield rose by more than 2.36 times, but independent evidence is still missing for precision, recall, and escaped-defect reduction.
Los hallazgos resueltos reportados por ejecución deBugbot aumentaron más del dobleMade for Christian Rios, by HanademiFuentes: Cursor. (2025-2026). Bugbot documentation.; cursor.com.Unidadhallazgos de errores reportados por ejecución de revisiónTasa inicial reportada0,21 resueltos0,19 sin resolverTasa posterior reportadaMás de 0,49 resueltosMenos de 0,21 sin resolver00,20,40,60,8Hallazgos por ejecución de revisiónSiguen faltando 3 métricas de validación independientes
El rendimiento resuelto reportado aumentó más de 2,36 veces, pero aún falta evidencia independiente sobre precisión, exhaustividad y reducción de defectos escapados.
BenchLM places Composer 2.5 at number43 in its agentic ranking.A rank is methodology-dependent and should be read within BenchLM's evaluation design.Sources: benchlm.ai.
Owning a model matters, but rank still depends on measured performance. BenchLM places Composer 2.5 at number 43 in its published agentic ranking. That single ranking does not settle the product's value. It does block a clean state-of-the-art claim without broader independent evaluation.
BenchLM ubica a Composer 2.5 en elpuesto 43 de su clasificación de agentes.Una posición depende de la metodología y debe leerse dentro del diseño de evaluación deBenchLM.Fuentes: benchlm.ai.
Controlar un modelo importa, pero la posición todavía depende del desempeño medido. BenchLM ubica a Composer 2.5 en el puesto 43 de su clasificación publicada de agentes. Una sola clasificación no resuelve el valor del producto. Sí impide afirmar con claridad que está a la vanguardia sin una evaluación independiente más amplia.
AI coding changed with the work, from55.8% faster to 19% slowerPercentage speed effects reported in two different study contexts, shown separately rather than pooled.Made for Christian Rios, by HanademiSources: Peng, S., Kalliamvakou, E., Cihon, P., & Demirer, M. (2023). The impact of AI on developer productivity: Evidence from GitHub Copilot. GitHub.; export.arxiv.org.; Becker, J.,Rush, N., Barnes, B., & Rein, D. (2025). Measuring the impact of early-2025 AI on experienced open-source developer productivity. METR.; Measuring the Impact of Early-2025 AI…The METR series is plotted in order, with each value retaining its original meaning and unit.Unitpercent speed effectPredicted speedup before tasks24%Perceived speedup after tasks20%Measured productivity effect-19%
Copilot users completed one bounded JavaScript task 55.8% faster. In a different setting, METR recorded 24% predicted, 20% perceived, and 19% measured slower productivity. The work determines which result applies.
La programación con IA cambió según el trabajo, de55,8% más rápida a 19% más lentaEfectos porcentuales sobre la velocidad reportados en dos contextos de estudio distintos, mostrados porseparado y no combinados.Made for Christian Rios, by HanademiFuentes: Peng, S., Kalliamvakou, E., Cihon, P., & Demirer, M. (2023). The impact of AI on developer productivity: Evidence from GitHub Copilot. GitHub.;export.arxiv.org.; Becker, J., Rush, N., Barnes, B., & Rein, D. (2025). Measuring the impact of early-2025 AI on experienced open-source developer productivity…La serie de METR se representa en orden, conservando el significado y la unidad originales de cada valor.Unidadefecto porcentual en velocidadPredicted speedup before tasks24 %Perceived speedup after tasks20 %Efecto de productividad medido-19 %
Los usuarios de Copilot completaron una tarea delimitada de JavaScript un 55,8% más rápido. En otro contexto, METR registró una mejora prevista del 24%, una mejora percibida del 20% y una ralentización medida del 19%. El trabajo determina qué resultado se aplica.
Owning models concentrates 3 risks: cost,accountability, and obsolescence.The risks concern the business burden of maintaining proprietary model layers.Sources: Stanford Institute for Human-Centered Artificial Intelligence. (2025). AI Index Report 2025.
Owning the engine gives Cursor more control over speed, integration, and margin. It also concentrates 3 business risks: development cost, benchmark accountability, and rapid obsolescence. External models spread some of that burden across suppliers. Proprietary models make Cursor responsible for both performance and upkeep.
Controlar modelos concentra 3 riesgos:costo, responsabilidad y obsolescencia.Los riesgos se refieren a la carga empresarial de mantener capas de modelos propios.Fuentes: Stanford Institute for Human-Centered Artificial Intelligence. (2025). AI Index Report 2025.
Controlar el motor da a Cursor más control sobre velocidad, integración y margen. También concentra 3 riesgos empresariales: costo de desarrollo, responsabilidad por resultados y rápida obsolescencia. Los modelos externos distribuyen parte de esa carga entre proveedores. Los modelos propios hacen responsable a Cursor tanto del desempeño como del mantenimiento.
AI improved local work while stability fell7.2%DORA associations for a 25% increase in AI adoption across local work and delivery measures.Made for Christian Rios, by HanademiSources: Google Cloud. (2024). Accelerate State of DevOps Report 2024.Unitpercent changeDocumentation quality7.5Code quality3.4Review speed3.1Approval speed1.3Delivery throughput-1.5Delivery stability-7.2
The gains appeared close to the developer. Documentation, code quality, review speed, and approval speed all moved positively. Delivery throughput fell 1.5%, and stability fell 7.2%. A platform can speed individual steps while adding complexity to the system around them.
La IA mejoró el trabajo local mientras laestabilidad cayó 7,2%Asociaciones de DORA para un aumento de 25% en adopción de IA entre medidas locales y de entrega.Made for Christian Rios, by HanademiFuentes: Google Cloud. (2024). Accelerate State of DevOps Report 2024.Unidadcambio porcentualCalidad de documentación7,5Calidad del código3,4Velocidad de revisión3,1Velocidad de aprobación1,3Rendimiento de entrega-1,5Estabilidad de entrega-7,2
Las mejoras aparecieron cerca del desarrollador. La documentación, la calidad del código, la velocidad de revisión y la aprobación avanzaron positivamente. El rendimiento de entrega cayó 1,5% y la estabilidad 7,2%. Una plataforma puede acelerar pasos individuales mientras añade complejidad al sistema que los rodea.
Reported AI productivity effects span a74.8-point reversalMade for Christian Rios, by HanademiSources: Peng, S., Kalliamvakou, E., Cihon, P., & Demirer, M. (2023). The impact of AI on developer productivity: Evidencefrom GitHub Copilot. GitHub.; export.arxiv.org.; Google Cloud. (2024). Accelerate State of DevOps Report 2024.Unitreported effect, percentBounded task, measured+55.8%Developer prediction+24%Perception after tasks+20%Familiar repository, measured-19%Delivery throughput-1.5%Delivery stability-7.2%-200+20+40+60Reported productivity effect, %
The evidence changes sign as evaluation moves from a bounded task to familiar repositories and delivery systems, so task-level speed cannot be assumed to become organizational throughput.
Los efectos reportados de productividad conIA abarcan una reversión de 74,8 puntosMade for Christian Rios, by HanademiFuentes: Peng, S., Kalliamvakou, E., Cihon, P., & Demirer, M. (2023). The impact of AI on developer productivity:Evidence from GitHub Copilot. GitHub.; export.arxiv.org.; Google Cloud. (2024). Accelerate State of DevOps Report2024.Unidadefecto reportado, porcentajeTarea acotada, medida+55.8%Predicción del desarrollador+24%Percepción después de las tareas+20%Repositorio conocido, medido-19%Rendimiento de entrega-1.5%Estabilidad de entrega-7.2%-200+20+40+60Efecto reportado sobre la productividad, %
La evidencia cambia de signo al pasar de una tarea acotada a repositorios conocidos y sistemas de entrega, por lo que la velocidad en tareas no puede suponerse como rendimiento organizacional.
Background Agents have 2sensitive powers: internet accessand automatic commands.Useful autonomy requires narrowly scoped access and reviewable records.Sources: Cursor. (2025). Background Agents: Security.
Background Agents need real access to do useful work. Cursor documents 2 consequential capabilities: internet access and automatic terminal-command execution. Those powers widen both productivity and exposure. Repository scope, isolation, credentials, and logs become product requirements.
Background Agents tienen 2 capacidadessensibles: internet y comandos automáticos.La autonomía útil requiere acceso limitado y registros que puedan revisarse.Fuentes: Cursor. (2025). Background Agents: Security.
Background Agents necesitan acceso real para hacer trabajo útil. Cursor documenta 2 capacidades importantes: acceso a internet y ejecución automática de comandos de terminal. Esos poderes amplían tanto la productividad como la exposición. El alcance del repositorio, el aislamiento, las credenciales y los registros se convierten en requisitos del producto.
Cursor's individual plans stretched from$20 to $200Reported monthly individual prices for Pro, Pro Plus, and Ultra during 2025.Made for Christian Rios, by HanademiSources: Cursor. (2025). Pricing.UnitUSD per month$200Ultra$60Pro Plus$20Pro
Cursor's reported individual pricing covered a 10x span. Pro cost $20 per month, Pro Plus $60, and Ultra $200. Platform capability therefore arrives with a meaningful access gradient. Any productivity case must include the tier and usage cost required to obtain it.
Los planes individuales de Cursor iban de20 a 200 dólaresPrecios individuales mensuales reportados para Pro, Pro Plus y Ultra durante 2025.Made for Christian Rios, by HanademiFuentes: Cursor. (2025). Pricing.UnidadUSD al mes$200Ultra$60Pro Plus$20Pro
Los precios individuales reportados de Cursor cubrían una diferencia de 10 veces. Pro costaba 20 dólares al mes, Pro Plus 60 y Ultra 200. La capacidad de plataforma llega con una diferencia importante de acceso. Cualquier caso de productividad debe incluir el nivel y el costo de uso necesarios.
OWASP ranks prompt injection as LLM risknumber 1 for 2025.Prompt injection becomes especially relevant when an agent can read external contentand execute commands.Sources: OWASP Foundation. (2025). OWASP Top 10 for LLM Applications 2025.
Coding agents read untrusted content and can invoke tools. OWASP ranks prompt injection as LLM risk number 1 for 2025. That makes least privilege the practical response: narrow repository scope, isolated execution, short-lived credentials, approval boundaries, and reviewable logs. Security must scale with agent autonomy.
OWASP clasifica la inyección deinstrucciones como riesgo LLMnúmero 1 para 2025.La inyección de instrucciones cobra especial importancia cuando un agente puede leercontenido externo y ejecutar comandos.Fuentes: OWASP Foundation. (2025). OWASP Top 10 for LLM Applications 2025.
Los agentes de programación leen contenido no confiable y pueden usar herramientas. OWASP clasifica la inyección de instrucciones como riesgo LLM número 1 para 2025. Eso convierte el privilegio mínimo en la respuesta práctica: alcance limitado del repositorio, ejecución aislada, credenciales breves, límites de aprobación y registros revisables. La seguridad debe escalar con la autonomía.
Eight Background Agents imply 16 sensitivecapability instancesScenario multiplication: active Background Agents multiplied by two documented capabilities per agent,internet access and automatic terminal-command execution.Made for Christian Rios, by HanademiSources: Cursor. (2025). Parallel agents documentation.; Cursor. (2025). Background Agents: Security.; OWASPFoundation. (2025). OWASP Top 10 for LLM Applications 2025.Unitsecurity-sensitive capability instances1 active agent22 active agents44 active agents88 active agents16
At the eight-agent ceiling, a homogeneous Background Agent scenario scales two sensitive capabilities to 16 instances. This measures exposure capacity, not observed simultaneous use.
Ocho agentes en segundo plano implican 16instancias de capacidades sensiblesMultiplicación del escenario: agentes en segundo plano activos multiplicados por dos capacidadesdocumentadas por agente, acceso a internet y ejecución automática de comandos de terminal.Made for Christian Rios, by HanademiFuentes: Cursor. (2025). Parallel agents documentation.; Cursor. (2025). Background Agents: Security.; OWASPFoundation. (2025). OWASP Top 10 for LLM Applications 2025.Unidadinstancias de capacidades sensibles para la seguridad1 agente activo22 agentes activos44 agentes activos88 agentes activos16
En el límite de ocho agentes, un escenario homogéneo de agentes en segundo plano amplía dos capacidades sensibles a 16 instancias. Esto mide capacidad de exposición, no uso simultáneo observado.
Five suppliers create 20 policycombinations to governMade for Christian Rios, by HanademiSources: Cursor. (2025-2026). Models documentation.; Cursor. (2025). Models documentation.; cursor.com.Unitsupplier-policy combinationsAuto routing policy:Supplier-specific termsCursor policyAnthropicOpenAIGooglexAICursorPriceRetentionAvailabilityCapability
Automatic routing transfers one model-selection decision to Cursor, but the platform still has to manage 20 underlying supplier-policy combinations.
Cinco proveedores crean 20 combinacionesde políticas por gobernarMade for Christian Rios, by HanademiFuentes: Cursor. (2025-2026). Models documentation.; Cursor. (2025). Models documentation.; cursor.com.Unidadcombinaciones de proveedor y políticaPolítica de enrutamiento automático:Términos propios del proveedorPolítica de CursorAnthropicOpenAIGooglexAICursorPrecioRetenciónDisponibilidadCapacidad
El enrutamiento automático transfiere una decisión de selección de modelo a Cursor, pero la plataforma aún debe gestionar 20 combinaciones subyacentes de proveedor y política.
Cursor's eight-agent ceiling exceeds areported five-agent quality peakMade for Christian Rios, by HanademiSources: Cursor. (2025). Parallel agents documentation.; bornbee.com.Unitconcurrent agents and indexed output quality1.6x, 3 agents beyond peak5 agents, reported peakQuality index: 1008 agentsCursor ceiling15 agents, measured declineQuality index: 770581516Concurrent agent count
Cursor's maximum is three agents beyond the reported quality peak, although the external experiment does not establish Cursor's own quality curve.
El límite de ocho agentes de Cursor supera un pico decalidad reportado con cinco agentesMade for Christian Rios, by HanademiFuentes: Cursor. (2025). Parallel agents documentation.; bornbee.com.Unidadagentes simultáneos y calidad de producción indexada1,6x, 3 agentes más allá del pico5 agentes, pico reportadoÍndice de calidad: 1008 agentesLímite de Cursor15 agentes, caída medidaÍndice de calidad: 770581516Cantidad de agentes simultáneos
El máximo de Cursor está tres agentes por encima del pico de calidad reportado, aunque el experimento externo no establece la curva de calidad propia de Cursor.
In summaryMade for Christian Rios, by HanademiSources: cursor.com.; benchlm.ai.; bornbee.com.; Cursor. (2025-2026). Security and privacy documentation.; Stanford Institute for Human-CenteredArtificial Intelligence. (2025). AI Index Report 2025.Cursor says Composer 2.5 uses the same open-source checkpoint as Composer 2: Moonshot’s Kimi K2.5.BenchLM’s published evidence places Composer 2.5 at number 43 in its agentic ranking.Bornbee Labs measured 23% lower output quality with 15 agents than at its five-agent peak.Five model suppliers create at least five separate policy surfaces for price, retention, availability, and capability.Owning models concentrates three unreported business risks at Cursor: development cost, benchmark accountability, and rapid obsolescence.
The value of the research is not only what each source knew, but what became visible when their evidence was combined.
En resumenMade for Christian Rios, by HanademiFuentes: cursor.com.; benchlm.ai.; bornbee.com.; Cursor. (2025-2026). Security and privacy documentation.; Stanford Institute for Human-CenteredArtificial Intelligence. (2025). AI Index Report 2025.Cursor afirma que Composer 2.5 utiliza el mismo checkpoint de código abierto que Composer 2: Kimi K2.5 de Moonshot.La evidencia publicada por BenchLM ubica a Composer 2.5 en el puesto 43 de su clasificación de agentes.Bornbee Labs midió una calidad de resultados 23% menor con 15 agentes que en su punto máximo de cinco agentes.Cinco proveedores de modelos crean al menos cinco superficies normativas separadas para precio, retención, disponibilidad y capacidad.Controlar modelos concentra en Cursor tres riesgos empresariales no divulgados: costo de desarrollo, responsabilidadpor resultados y rápida obsolescencia.
El valor de la investigación no está solo en cada fuente, sino en lo que apareció al combinar sus evidencias.

The research behind this deck

Investors priced the platform story before its outcomes were settled. Cursor now connects generation, execution, review, and model selection.

Key findings

The argument

This research is published in English and Spanish. Ver en español

La investigación detrás de esta presentación

Los inversionistas valoraron la historia de plataforma antes de resolver sus resultados. Cursor conecta generación, ejecución, revisión y selección de modelos.

Hallazgos clave

El argumento

Esta investigación se publica en inglés y español. Read in English

Related researchInvestigación relacionada