Start with the user's real risk. SEBI found that 93% of individual F&O traders lost money across 3 fiscal years. Only 1% earned more than ₹100,000 net, so automation must solve more than access.
Empecemos por el riesgo real del usuario. SEBI encontró que el 93% de los traders individuales de F&O perdió dinero durante 3 ejercicios fiscales. Solo el 1% ganó más de ₹100.000 netos, así que la automatización debe resolver algo más que el acceso.
The deck crosses software and finance, so a few terms matter. SWE-bench tests coding capability, while a backtest tests a trading idea against history. Neither proves that a live strategy is safe or profitable.
La presentación cruza software y finanzas, por eso importan algunos términos. SWE-bench prueba capacidad de programación, mientras un backtest prueba una idea de trading contra la historia. Ninguno demuestra que una estrategia real sea segura o rentable.
Retail tools can simplify analysis, but they cannot create durable trading skill.
Las herramientas retail pueden simplificar el análisis, pero no pueden crear una habilidad de trading duradera.
This is the clean acceleration case. The control group took 161 median minutes, while Copilot users took 71.17. GitHub reported a 55.8% reduction for this bounded task.
Este es el caso claro de aceleración. El grupo de control tardó 161 minutos medianos, mientras quienes usaron Copilot tardaron 71,17. GitHub reportó una reducción del 55,8% para esta tarea limitada.
The simple productivity story breaks here. Experienced developers expected a 24% improvement but measured a 19% slowdown. Treat this small study as a warning about task fit and correction costs.
Aquí se rompe la historia simple de productividad. Los desarrolladores experimentados esperaban una mejora del 24%, pero midieron una ralentización del 19%. Este pequeño estudio advierte sobre el tipo de tarea y el costo de corregir.
A broader field result points in the positive direction. Across 3 experiments and 4,867 developers, AI increased completed tasks by 26.08%. The 10.3% standard error means the gain remains uncertain in size.
Un resultado de campo más amplio apunta en dirección positiva. En 3 experimentos con 4.867 desarrolladores, la IA aumentó un 26,08% las tareas completadas. El error estándar del 10,3% implica que el tamaño de la mejora sigue siendo incierto.
A UK government trial gives the productivity claim a practical scale. Participating coders saved an estimated 28 working days per year. The estimate applies to that trial, not every developer.
Un ensayo del gobierno británico da una escala práctica a la mejora de productividad. Los programadores participantes ahorraron unos 28 días laborales al año. La estimación se aplica a ese ensayo, no a todos los desarrolladores.
Claude's reported coding performance improved sharply across these releases. The rate rose from 4.8% for Claude 2 to 49.0% for Claude 3.5 Sonnet. Model choice matters, but benchmark success does not replace testing.
El rendimiento reportado de Claude en programación mejoró con fuerza entre estas versiones. La tasa subió del 4,8% con Claude 2 al 49,0% con Claude 3.5 Sonnet. Elegir el modelo importa, pero el éxito en una prueba no sustituye las pruebas propias.
Claude's working memory expanded dramatically across releases. It moved from about 9,000 tokens in Claude 1 to 200,000 in Claude 2.1. Opus 4.6 pushed the advertised beta window to 1 million tokens.
La memoria de trabajo de Claude se amplió de forma drástica entre versiones. Pasó de unos 9.000 tokens en Claude 1 a 200.000 en Claude 2.1. Opus 4.6 llevó la ventana beta anunciada a 1 millón de tokens.
Este es un ejemplo concreto de uso, no una puntuación de prueba. Alberta utilizó Claude Code para revisar 466.000.000 de líneas de código gubernamental en 20 horas.
GPT-4 improved across all 3 reported tests. The largest gap appeared on GSM8K, where GPT-4 reached 92.0% against 57.1%. These remain separate benchmarks, not one combined guarantee.
GPT-4 mejoró en las 3 pruebas reportadas. La mayor diferencia apareció en GSM8K, donde GPT-4 llegó al 92,0% frente al 57,1%. Siguen siendo pruebas separadas, no una garantía combinada.
The cost of sending text into OpenAI's models fell quickly. The launch price moved from $30 per million input tokens to $10, then $5. Cheaper experimentation makes testing easier, but also makes overfitting easier.
El costo de enviar texto a los modelos de OpenAI cayó con rapidez. El precio de lanzamiento pasó de 30 dólares por millón de tokens de entrada a 10 y luego a 5. Experimentar más barato facilita probar, pero también facilita sobreajustar.
GPT-4's benchmark strength came with a clear limit. It solved 67% of the reported HumanEval problems and left 33% unsolved. That residual error is material for financial software.
La fortaleza de GPT-4 en la prueba tuvo un límite claro. Resolvió el 67% de los problemas reportados de HumanEval y dejó el 33% sin resolver. Ese error residual es importante para el software financiero.
Financial retrieval is not a simple yes-or-no task. ChatGPT matched the exact answer in 63.8% of cases, while 83.1% landed within ±5%. Small numerical errors can still change a trading decision.
La recuperación financiera no es una tarea sencilla de sí o no. ChatGPT coincidió con la respuesta exacta en el 63,8% de los casos, mientras el 83,1% quedó dentro de ±5%. Pequeños errores numéricos todavía pueden cambiar una decisión de trading.
Two administrative records tell a similar story. In Brazil, 97% of persistent traders lost money after fees. In Taiwan, fewer than 1% were predictably profitable after fees.
Dos registros administrativos cuentan una historia similar. En Brasil, el 97% de los traders persistentes perdió dinero después de comisiones. En Taiwán, menos del 1% fue previsiblemente rentable después de comisiones.
The cost of trading was not a rounding error. Across Taiwan's complete investor record, individuals gave up 3.8 percentage points of performance each year. That recurring toll equaled 2.2% of GDP.
El costo de operar no fue un error de redondeo. En todo el registro de inversionistas de Taiwán, los individuos cedieron 3,8 puntos porcentuales de rendimiento cada año. Ese peaje recurrente equivalió al 2,2% del PIB.
The active households did not receive a reward for trading more often. Their annual net return was 11.4%, against 16.4% for the average household and 17.9% for the market. Activity added motion, not performance.
Los hogares activos no recibieron una recompensa por operar con mayor frecuencia. Su rendimiento neto anual fue del 11,4%, frente al 16,4% del hogar promedio y el 17,9% del mercado. La actividad añadió movimiento, no rendimiento.
In 2017, lowering the tax changed investor behavior. The reform increased day trading enough to offset the tax savings. Portfolio returns fell as speculation rose.
En 2017, bajar el impuesto cambió el comportamiento de los inversionistas. La reforma aumentó el day trading lo suficiente para neutralizar el ahorro fiscal. Los retornos de cartera cayeron mientras aumentaba la especulación.
Choosing for yourself sounds like a route to better performance. Over the long term, only 13% of Swedish self-selecting savers beat AP7 Såfa. Roughly half outperformed it during 2025, but the source reports no exact percentage for that year.
Elegir por cuenta propia parece una ruta hacia un mejor rendimiento. A largo plazo, solo el 13% de los ahorradores suecos que eligieron fondos superó a AP7 Såfa. Cerca de la mitad lo hizo en 2025, pero la fuente no reporta un porcentaje exacto para ese año.
Sweden provides a tangible setting for comparing active choices with a default.
Suecia ofrece un contexto tangible para comparar las decisiones activas con una opción predeterminada.
Among 524,181 Finnish investors tracked from 2007 to 2022, first-time ETF adoption produced statistically significant improvements in risk-adjusted returns. A structured, diversified vehicle can improve the decision.
Entre 524.181 inversionistas finlandeses seguidos de 2007 a 2022, la primera adopción de ETF produjo mejoras estadísticamente significativas en los retornos ajustados por riesgo. Un vehículo estructurado y diversificado puede mejorar la decisión.
A factor can look powerful in its original study and weaken elsewhere. The index falls from 100 to 74 outside the sample. After publication, it reaches 42.
Un factor puede parecer potente en su estudio original y debilitarse en otro lugar. El índice cae de 100 a 74 fuera de la muestra. Tras la publicación, llega a 42.
On May 6, 2010, major U.S. equity indices fell more than 5% within minutes. Much of that decline reversed roughly 20 minutes later. Automated markets can amplify and unwind shocks at extraordinary speed.
El 6 de mayo de 2010, los principales índices estadounidenses cayeron más de 5% en minutos. Gran parte de esa caída se revirtió unos 20 minutos después. Los mercados automatizados pueden amplificar y deshacer perturbaciones a una velocidad extraordinaria.
FinQANet beat the general crowd but still trailed financial experts. Experts reached 91.16% execution accuracy, while FinQANet reached 68.90%. Domain expertise remained the strongest benchmark here.
FinQANet superó al grupo general, pero quedó por debajo de los expertos financieros. Los expertos alcanzaron 91,16% de precisión y FinQANet llegó al 68,90%. La experiencia financiera siguió siendo la referencia más fuerte.
Model performance must ultimately operate within real people, workflows and institutions.
El rendimiento del modelo debe funcionar finalmente entre personas, procesos e instituciones reales.
GPT-4 improved factuality by 40% relative to GPT-3.5 in OpenAI's internal evaluations. That is a meaningful gain, but OpenAI still warned about hallucinations and incorrect reasoning. Better is not the same as reliable enough for live trading.
GPT-4 mejoró la factualidad un 40% frente a GPT-3.5 en las evaluaciones internas de OpenAI. Es una mejora importante, pero OpenAI todavía advirtió sobre alucinaciones y razonamiento incorrecto. Mejor no significa suficientemente fiable para operar en vivo.
Knight Capital's faulty deployment ran for 45 minutes. It generated more than 4 million executions and caused about $460 million in pre-tax losses. Automation scaled the failure at market speed.
El despliegue defectuoso de Knight Capital funcionó durante 45 minutos. Generó más de 4 millones de ejecuciones y causó unos 460 millones de dólares en pérdidas antes de impuestos. La automatización escaló el fallo a velocidad de mercado.
A t-statistic near 2 can look persuasive when researchers test many ideas. Harvey, Liu and Zhu argued for a threshold near 3 instead. AI-assisted experimentation makes that higher bar more relevant.
Un estadístico t cercano a 2 puede parecer convincente cuando se prueban muchas ideas. Harvey, Liu y Zhu propusieron un umbral cercano a 3. La experimentación asistida por IA hace más relevante ese listón superior.
At 100 trials, expected noise reaches 2.51, leaving the conventional threshold 0.51 below noise while the multiple-testing threshold retains a 0.49 margin.
Con 100 pruebas, el ruido esperado llega a 2,51, dejando el umbral convencional 0,51 por debajo del ruido mientras el umbral para pruebas múltiples conserva un margen de 0,49.
Commercial AI products face more than model risk. The EU AI Act permits maximum fines of 1%, 3% or 7% of worldwide annual turnover, depending on the violation. Compliance must enter the product design before launch.
Los productos comerciales de IA afrontan algo más que riesgo del modelo. La Ley de IA de la UE permite multas máximas del 1%, 3% o 7% de la facturación mundial anual, según la infracción. El cumplimiento debe entrar en el diseño antes del lanzamiento.
The safe workflow ends with controls, not a better prompt. SEC Rule 15c3-5 requires covered broker-dealers to block orders that exceed preset credit or capital thresholds. Use four illustrative control categories for a retail system, while keeping the legal scope clear: the rule applies to covered broker-dealers, not every retail script.
El flujo seguro termina con controles, no con un mejor prompt. La regla 15c3-5 de la SEC exige que los corredores cubiertos bloqueen órdenes que superen límites preestablecidos de crédito o capital. Usa cuatro categorías de control ilustrativas en un sistema minorista, sin confundir el alcance legal: la regla se aplica a corredores cubiertos, no a todo script minorista.
The practical edge is disciplined validation, not faster code alone. The evidence spans trader losses, slower experienced developers, decaying published returns, deployment controls and the limits of self-selection.
La ventaja práctica es una validación disciplinada, no solo programar más rápido. La evidencia abarca pérdidas de operadores, desarrolladores experimentados más lentos, rentabilidades publicadas que decaen, controles de despliegue y los límites de elegir por cuenta propia.
Un solo fallo de 45 minutos equivale al 31% del beneficio anual propuesto, mientras que tres fallos similares alcanzan 1.380 millones de dólares y eliminan el 92% de ese beneficio.
The odds worsen from 4.4 losing CFD accounts per non-losing account to at least 99 day traders without predictable profitability per predictably profitable trader.
Las probabilidades empeoran desde 4,4 cuentas de CFD perdedoras por cada cuenta no perdedora hasta al menos 99 operadores intradía sin rentabilidad predecible por cada operador con rentabilidad predecible.
Even the lowest measured AI error rate is 31.1 times the upper bound on predictable trader profitability, so automated competence does not imply a scarce trading edge.
Incluso la menor tasa de error medida de la IA equivale a 31,1 veces el límite superior de rentabilidad predecible del operador, por lo que la competencia automatizada no implica una ventaja de trading escasa.
The 2012 catalogue contains 316 factors, but applying the documented average decay leaves only 133 factors' worth of post-publication return in this counterfactual.
El catálogo de 2012 contiene 316 factores, pero al aplicar el deterioro medio documentado quedan apenas 133 factores equivalentes de rendimiento tras la publicación en este contrafactual.
Only 1% earned more than ₹100,000 net. These terms connect software capability with financial risk.
Key findings
METR reported that 16 experienced open-source developers were 19% slower with early-2025 AI tools across 246 tasks, despite expecting a 24% speedup. METR
SEBI found 93% of individual equity futures-and-options traders lost money during fiscal years 2022 through 2024, with aggregate losses above ₹1.8 trillion. Securities and Exchange Board of India
Among 1,551 Brazilians who persisted in equity-index day trading for at least 300 days, 97% lost money after fees. Brazilian Review of Finance
About 4% of U.S. common stocks created all net shareholder wealth above Treasury bills from 1926 through 2016. Journal of Financial Economics
Knight Capital's faulty 2012 deployment generated more than four million executions in 45 minutes and caused an approximately $460 million pre-tax loss. U.S. Securities and Exchange Commission
Taiwanese transaction records indicated that fewer than 1% of day traders were predictably profitable after fees in a typical year. Journal of Financial Markets
S&P reported that none of the 2020 top-quartile U.S. large-cap funds remained in the top quartile for the following four years. S&P Dow Jones Indices
Across 97 published predictors, average returns were 26% lower out of sample and 58% lower after academic publication. Journal of Finance
ESMA reported that 74% to 89% of retail CFD accounts typically lost money, supporting leverage limits and standardized warnings. European Securities and Markets Authority
Alberta’s Ministry of Technology and Innovation used Claude Code to scan 466 million lines of government code in 20 hours. anthropic.com
Across Taiwan’s complete investor trading history, individual investors incurred a 3.8-percentage-point annual performance penalty, equal to 2.2% of GDP. faculty.haas.berkeley.edu
The argument
Retail tools can simplify analysis, but they cannot create durable trading skill.
Copilot reduced median completion time from 161 to 71.17 minutes.
Developers expected a 24% gain but measured a 19% slowdown.
Across 3 field experiments, AI raised completed tasks 26.08%.
Participating coders saved an estimated 28 working days yearly.
The reported resolution rate rose from 4.8% to 49.0%.
This research is published in English and Spanish. Ver en español
La investigación detrás de esta presentación
Solo el 1% ganó más de ₹100.000 netos. Estos términos conectan la capacidad del software con el riesgo financiero.
Hallazgos clave
METR informó que 16 desarrolladores experimentados fueron 19% más lentos con herramientas de IA de comienzos de 2025 en 246 tareas, pese a esperar una mejora de 24%. METR
SEBI encontró que 93% de los operadores individuales de futuros y opciones perdió dinero entre los ejercicios 2022 y 2024, con pérdidas agregadas superiores a 1,8 billones de rupias. Securities and Exchange Board of India
Entre 1.551 brasileños que persistieron al menos 300 días en day trading de futuros sobre índices, 97% perdió dinero después de comisiones. Brazilian Review of Finance
Aproximadamente 4% de las acciones ordinarias estadounidenses creó toda la riqueza neta para accionistas por encima de las letras del Tesoro entre 1926 y 2016. Journal of Financial Economics
El despliegue defectuoso de Knight Capital en 2012 generó más de cuatro millones de ejecuciones en 45 minutos y causó una pérdida antes de impuestos de unos 460 millones de dólares. U.S. Securities and Exchange Commission
Los registros de transacciones de Taiwán indicaron que menos de 1% de los day traders era previsiblemente rentable después de comisiones en un año típico. Journal of Financial Markets
S&P informó que ninguno de los fondos estadounidenses de gran capitalización situados en el cuartil superior en 2020 permaneció allí durante los cuatro años siguientes. S&P Dow Jones Indices
Entre 97 predictores publicados, las rentabilidades promedio fueron 26% menores fuera de muestra y 58% menores después de su publicación académica. Journal of Finance
ESMA informó que entre 74% y 89% de las cuentas minoristas de CFD normalmente perdía dinero, respaldando límites de apalancamiento y advertencias estandarizadas. European Securities and Markets Authority
El Ministerio de Tecnología e Innovación de Alberta utilizó Claude Code para revisar 466 millones de líneas de código gubernamental en 20 horas. anthropic.com
En el historial completo de operaciones de Taiwán, los inversionistas individuales sufrieron una penalización anual de 3,8 puntos porcentuales, equivalente al 2,2% del PIB. faculty.haas.berkeley.edu
El argumento
Las herramientas retail pueden simplificar el análisis, pero no pueden crear una habilidad de trading duradera.
Copilot redujo el tiempo mediano de 161 a 71,17 minutos.
Los desarrolladores esperaban una mejora del 24%, pero midieron una ralentización del 19%.
En 3 experimentos de campo, la IA elevó un 26,08% las tareas completadas.
Los programadores participantes ahorraron unos 28 días laborales al año.
La tasa de resolución reportada subió del 4,8% al 49,0%.
Esta investigación se publica en inglés y español. Read in English