Hanademi

AI can code your trading bot, not your edge · V7

37 slides · 23 min · 2026-08-01 language
ENES
theme
LightDark
view
DeckTableTalk
brand
HanademiPlatzi
AI can code your trading bot,not your edgeMade for Juan Camilo, by Hanademi
La IA puede programar tu bot,no crear tu ventajaMade for Juan Camilo, by Hanademi
93% of Indian F&O traders lost moneyIndividual equity futures and options traders, fiscal years 2022 to 2024.Made for Juan Camilo, by HanademiSources: Securities and Exchange Board of India. (2024). Analysis of profit and loss of individual traders dealing in theequity F&O segment. SEBI.UnitPercent of individual tradersLost money93%Any net profit7%Over ₹100,000 net1%
Start with the user's real risk. SEBI found that 93% of individual F&O traders lost money across 3 fiscal years. Only 1% earned more than ₹100,000 net, so automation must solve more than access.
El 93% de los traders indios de F&O perdiódineroTraders individuales de futuros y opciones sobre acciones, ejercicios 2022 a 2024.Made for Juan Camilo, by HanademiFuentes: Securities and Exchange Board of India. (2024). Analysis of profit and loss of individual traders dealingin the equity F&O segment. SEBI.UnidadPorcentaje de traders individualesPerdió dinero93 %Alguna ganancia neta7 %Más de ₹100.000 netos1 %
Empecemos por el riesgo real del usuario. SEBI encontró que el 93% de los traders individuales de F&O perdió dinero durante 3 ejercicios fiscales. Solo el 1% ganó más de ₹100.000 netos, así que la automatización debe resolver algo más que el acceso.
A few terms before we buildMade for Juan Camilo, by HanademiF&OFutures and options, leveraged contracts tied to another asset.SWE-benchA test of whether models can resolve real software issues.BacktestA simulation of how a strategy would have performed historically.t-statisticA measure of how strongly data supports an estimated effect.ETFA fund traded like a stock, often holding many assets.
The deck crosses software and finance, so a few terms matter. SWE-bench tests coding capability, while a backtest tests a trading idea against history. Neither proves that a live strategy is safe or profitable.
Algunos términos antes de construirMade for Juan Camilo, by HanademiF&OFuturos y opciones, contratos apalancados ligados a otro activo.SWE-benchUna prueba sobre si los modelos resuelven problemas reales de software.BacktestUna simulación de cómo habría rendido una estrategia en el pasado.Estadístico tUna medida de cuánto respaldan los datos un efecto estimado.ETFUn fondo negociado como acción que suele contener muchos activos.
La presentación cruza software y finanzas, por eso importan algunos términos. SWE-bench prueba capacidad de programación, mientras un backtest prueba una idea de trading contra la historia. Ninguno demuestra que una estrategia real sea segura o rentable.
Access is not an edgeA calculator, tablet and printed financial documents on a desk.Sources: Sebi study flags high-risk trading trend: 91% individual traders posted net losses in FY25, turnover dips after Oct 2024 curbs, but volumes still high vs two years ago - Times of India. timesofindia.indiatimes.com.
Retail tools can simplify analysis, but they cannot create durable trading skill.
El acceso no es una ventajaUna calculadora, una tableta y documentos financieros impresos sobre un escritorio.Fuentes: Sebi study flags high-risk trading trend: 91% individual traders posted net losses in FY25, turnover dips after Oct 2024 curbs, but volumes still high vs two years ago - Times of India. timesofindia.indiatimes.com.
Las herramientas retail pueden simplificar el análisis, pero no pueden crear una habilidad de trading duradera.
Copilot cut a bounded coding task by 55.8%GitHub randomized experiment with 95 developers; the first 2 values are minutes and the third is thereported reduction.Made for Juan Camilo, by HanademiSources: Peng, S., Kalliamvakou, E., Cihon, P., & Demirer, M. (2023). The impact of AI on developer productivity: Evidencefrom GitHub Copilot. GitHub.The source reports 161 control minutes, 71.17 Copilot minutes and a 55.8% time reduction.UnitReported task figures161Control, minutes71.2Copilot, minutes55.8Time reduction, %
This is the clean acceleration case. The control group took 161 median minutes, while Copilot users took 71.17. GitHub reported a 55.8% reduction for this bounded task.
Copilot redujo una tarea limitada un 55,8%Experimento aleatorizado de GitHub con 95 desarrolladores; los primeros 2 valores son minutos y eltercero es la reducción reportada.Made for Juan Camilo, by HanademiFuentes: Peng, S., Kalliamvakou, E., Cihon, P., & Demirer, M. (2023). The impact of AI on developer productivity:Evidence from GitHub Copilot. GitHub.La fuente reporta 161 minutos de control, 71,17 minutos con Copilot y una reducción del tiempo del 55,8%.UnidadCifras reportadas de la tarea161Control, minutos71,2Copilot, minutos55,8Reducción de tiempo, %
Este es el caso claro de aceleración. El grupo de control tardó 161 minutos medianos, mientras quienes usaron Copilot tardaron 71,17. GitHub reportó una reducción del 55,8% para esta tarea limitada.
METR's small study found AI sloweddevelopers 19%Methodology-limited study of 16 experienced developers across 246 tasks using early-2025 AI tools.Made for Juan Camilo, by HanademiSources: Becker, J., Rush, N., Barnes, B., & Rein, D. (2025). Measuring the impact of early-2025 AI on experiencedopen-source developer productivity. METR.; Measuring the Impact of Early-2025 AI on Experienced ....The line shows the 0% baseline, the expected 24% improvement, and the measured -19% change.UnitProductivity change-10%0%10%20%0%Without AI baseline24%Expected improvement-19%Measured changeNo change
The simple productivity story breaks here. Experienced developers expected a 24% improvement but measured a 19% slowdown. Treat this small study as a warning about task fit and correction costs.
El pequeño estudio de METR halló unaralentización del 19%Estudio limitado por su metodología con 16 desarrolladores experimentados y 246 tareas usandoherramientas de IA de comienzos de 2025.Made for Juan Camilo, by HanademiFuentes: Becker, J., Rush, N., Barnes, B., & Rein, D. (2025). Measuring the impact of early-2025 AI on experiencedopen-source developer productivity. METR.; Measuring the Impact of Early-2025 AI on Experienced ....La línea muestra la base de 0%, la mejora esperada de 24% y el cambio medido de -19%.UnidadCambio de productividad-10 %0 %10 %20 %0 %Base sin IA24 %Mejora esperada-19 %Cambio medidoSin cambio
Aquí se rompe la historia simple de productividad. Los desarrolladores experimentados esperaban una mejora del 24%, pero midieron una ralentización del 19%. Este pequeño estudio advierte sobre el tipo de tarea y el costo de corregir.
Across 3 field experiments, AI raisedcompleted tasks 26.08%.The estimate has a 10.3% standard error.Sources: economics.mit.edu.
A broader field result points in the positive direction. Across 3 experiments and 4,867 developers, AI increased completed tasks by 26.08%. The 10.3% standard error means the gain remains uncertain in size.
En 3 experimentos de campo, la IA elevóun 26,08% las tareas completadas.La estimación tiene un error estándar del 10,3%.Fuentes: economics.mit.edu.
Un resultado de campo más amplio apunta en dirección positiva. En 3 experimentos con 4.867 desarrolladores, la IA aumentó un 26,08% las tareas completadas. El error estándar del 10,3% implica que el tamaño de la mejora sigue siendo incierto.
Participating coders saved an estimated 28working days yearly.The 2025 estimate was almost 1 hour per participating coder per day.Sources: gov.uk.
A UK government trial gives the productivity claim a practical scale. Participating coders saved an estimated 28 working days per year. The estimate applies to that trial, not every developer.
Sources
Los programadores participantesahorraron unos 28 días laborales al año.La estimación de 2025 fue de casi 1 hora diaria por programador participante.Fuentes: gov.uk.
Un ensayo del gobierno británico da una escala práctica a la mejora de productividad. Los programadores participantes ahorraron unos 28 días laborales al año. La estimación se aplica a ese ensayo, no a todos los desarrolladores.
Fuentes
Claude 3.5 Sonnet reached 49% onSWE-benchReported SWE-bench resolution rates across 3 Claude releases.Made for Juan Camilo, by HanademiSources: Anthropic. (2024). Claude 3.5 Sonnet. Anthropic.; Jimenez, C. E., et al. (2024). SWE-bench: Can languagemodels resolve real-world GitHub issues? International Conference on Learning Representations.UnitSWE-bench resolution rateClaude 24.8%Claude 3 Opus22.5%Claude 3.5 Sonnet49%
Claude's reported coding performance improved sharply across these releases. The rate rose from 4.8% for Claude 2 to 49.0% for Claude 3.5 Sonnet. Model choice matters, but benchmark success does not replace testing.
Claude 3.5 Sonnet alcanzó el 49% enSWE-benchTasas de resolución reportadas en SWE-bench para 3 versiones de Claude.Made for Juan Camilo, by HanademiFuentes: Anthropic. (2024). Claude 3.5 Sonnet. Anthropic.; Jimenez, C. E., et al. (2024). SWE-bench: Can languagemodels resolve real-world GitHub issues? International Conference on Learning Representations.UnidadTasa de resolución en SWE-benchClaude 24,8 %Claude 3 Opus22,5 %Claude 3.5 Sonnet49 %
El rendimiento reportado de Claude en programación mejoró con fuerza entre estas versiones. La tasa subió del 4,8% con Claude 2 al 49,0% con Claude 3.5 Sonnet. Elegir el modelo importa, pero el éxito en una prueba no sustituye las pruebas propias.
Claude's context reached 1 million tokensAdvertised context windows by Claude release.Made for Juan Camilo, by HanademiSources: Anthropic. (2023). Introducing 100K context windows. Anthropic.; Anthropic. (2023). Claude 2.1. Anthropic.; anthropic.com.UnittokensClaude 19,000Claude 2100,000Claude 2.1200,000Opus 4.6 beta1,000,000
Claude's working memory expanded dramatically across releases. It moved from about 9,000 tokens in Claude 1 to 200,000 in Claude 2.1. Opus 4.6 pushed the advertised beta window to 1 million tokens.
El contexto de Claude llegó a 1 millón detokensVentanas de contexto anunciadas por versión de Claude.Made for Juan Camilo, by HanademiFuentes: Anthropic. (2023). Introducing 100K context windows. Anthropic.; Anthropic. (2023). Claude 2.1. Anthropic.; anthropic.com.UnidadtokensClaude 19.000Claude 2100.000Claude 2.1200.000Opus 4.6 beta1.000.000
La memoria de trabajo de Claude se amplió de forma drástica entre versiones. Pasó de unos 9.000 tokens en Claude 1 a 200.000 en Claude 2.1. Opus 4.6 llevó la ventana beta anunciada a 1 millón de tokens.
Claude Code scanned 466,000,000 lines ofAlberta government code in 20 hours.Alberta's Ministry of Technology and Innovation completed the scan of 466,000,000lines in 20 hours.Sources: anthropic.com.
This is a concrete deployment example, not a benchmark score. Alberta used Claude Code to scan 466,000,000 lines of government code in 20 hours.
Claude Code revisó 466.000.000 delíneas de código del gobierno deAlberta en 20 horas.El Ministerio de Tecnología e Innovación de Alberta completó la revisión de466.000.000 de líneas en 20 horas.Fuentes: anthropic.com.
Este es un ejemplo concreto de uso, no una puntuación de prueba. Alberta utilizó Claude Code para revisar 466.000.000 de líneas de código gubernamental en 20 horas.
GPT-4 led GPT-3.5 on all 3 benchmarksReported GPT-3.5 and GPT-4 scores across MMLU, GSM8K and HumanEval.Made for Juan Camilo, by HanademiSources: OpenAI. (2023). GPT-4 technical report. arXiv.UnitPercent scoreMMLUGPT-3.5 scoreGPT-4 score1.2×70%86.4%GSM8K1.6×57.1%92%HumanEval1.4×48.1%67%
GPT-4 improved across all 3 reported tests. The largest gap appeared on GSM8K, where GPT-4 reached 92.0% against 57.1%. These remain separate benchmarks, not one combined guarantee.
GPT-4 superó a GPT-3.5 en las 3 pruebasPuntuaciones reportadas de GPT-3.5 y GPT-4 en MMLU, GSM8K y HumanEval.Made for Juan Camilo, by HanademiFuentes: OpenAI. (2023). GPT-4 technical report. arXiv.UnidadPuntuación porcentualMMLU86,4 %Puntuación de GPT-470 %Puntuación de GPT-3.51,2×GSM8K1,6×57,1 %92 %HumanEval1,4×48,1 %67 %
GPT-4 mejoró en las 3 pruebas reportadas. La mayor diferencia apareció en GSM8K, donde GPT-4 llegó al 92,0% frente al 57,1%. Siguen siendo pruebas separadas, no una garantía combinada.
GPT input prices fell from $30 to $5OpenAI launch prices per million input tokens for GPT-4, GPT-4 Turbo and GPT-4o.Made for Juan Camilo, by HanademiSources: OpenAI. (2023). New models and developer products announced at DevDay. OpenAI.; OpenAI. (2024). HelloGPT-4o. OpenAI.UnitUSD per million input tokensGPT-4 launch$30GPT-4 Turbo launch$10GPT-4o launch$5
The cost of sending text into OpenAI's models fell quickly. The launch price moved from $30 per million input tokens to $10, then $5. Cheaper experimentation makes testing easier, but also makes overfitting easier.
Los precios de entrada de GPT bajaron de30 a 5 dólaresPrecios de lanzamiento de OpenAI por millón de tokens de entrada para GPT-4, GPT-4 Turbo y GPT-4o.Made for Juan Camilo, by HanademiFuentes: OpenAI. (2023). New models and developer products announced at DevDay. OpenAI.; OpenAI. (2024).Hello GPT-4o. OpenAI.UnidadUSD por millón de tokens de entradaLanzamiento de GPT-4$30Lanzamiento de GPT-4 Turbo$10Lanzamiento de GPT-4o$5
El costo de enviar texto a los modelos de OpenAI cayó con rapidez. El precio de lanzamiento pasó de 30 dólares por millón de tokens de entrada a 10 y luego a 5. Experimentar más barato facilita probar, pero también facilita sobreajustar.
GPT-4 still missed 33% of HumanEvalproblemsGPT-4 HumanEval pass and non-pass shares, with the full evaluation as reference.Made for Juan Camilo, by HanademiSources: OpenAI. (2023). GPT-4 technical report. arXiv.UnitPercent of evaluation25%50%75%100%67%Solved33%Unsolved100%Full evaluationFull evaluation
GPT-4's benchmark strength came with a clear limit. It solved 67% of the reported HumanEval problems and left 33% unsolved. That residual error is material for financial software.
GPT-4 aún falló en 33% de los problemas deHumanEvalProporciones de aprobación y no aprobación de GPT-4 en HumanEval, con la evaluación completa comoreferencia.Made for Juan Camilo, by HanademiFuentes: OpenAI. (2023). GPT-4 technical report. arXiv.UnidadPorcentaje de la evaluación25 %50 %75 %100 %67 %Resueltos33 %Sin resolver100 %Evaluación completaEvaluación completa
La fortaleza de GPT-4 en la prueba tuvo un límite claro. Resolvió el 67% de los problemas reportados de HumanEval y dejó el 33% sin resolver. Ese error residual es importante para el software financiero.
ChatGPT's exact financial retrieval reached63.8%ChatGPT answer accuracy on Daloopa's financial-retrieval benchmark.Made for Juan Camilo, by HanademiSources: daloopa.com.UnitPercent of answers83.1%Within ±5%63.8%Exact match
Financial retrieval is not a simple yes-or-no task. ChatGPT matched the exact answer in 63.8% of cases, while 83.1% landed within ±5%. Small numerical errors can still change a trading decision.
La recuperación financiera exacta deChatGPT llegó al 63,8%Exactitud de ChatGPT en el benchmark financiero de recuperación de Daloopa.Made for Juan Camilo, by HanademiFuentes: daloopa.com.UnidadPorcentaje de respuestas83,1 %Dentro de ±5%63,8 %Coincidencia exacta
La recuperación financiera no es una tarea sencilla de sí o no. ChatGPT coincidió con la respuesta exacta en el 63,8% de los casos, mientras el 83,1% quedó dentro de ±5%. Pequeños errores numéricos todavía pueden cambiar una decisión de trading.
Persistence rarely became durable tradingskillBrazilian traders who persisted for at least 300 days and Taiwanese day traders, after fees.Made for Juan Camilo, by HanademiSources: Chague, F., De-Losso, R., & Giovannetti, B. (2020). Day trading for a living? Brazilian Review of Finance.; Barber, B. M.,Lee, Y. T., Liu, Y. J., Odean, T., & Zhang, K. (2014). The cross-section of speculator skill: Evidence from day trading. Journal ofFinancial Markets, 18, 1-24.UnitPercent of tradersBrazilian persistent traders97%1.1%0.5%Lost moneyAbove minimumwageAbove teller salaryTaiwanese day traders100%1%99%All day tradersPredictablyprofitableNot predictablyprofitable
Two administrative records tell a similar story. In Brazil, 97% of persistent traders lost money after fees. In Taiwan, fewer than 1% were predictably profitable after fees.
Persistir rara vez se convirtió en habilidadduraderaTraders brasileños que persistieron al menos 300 días y day traders taiwaneses, después de comisiones.Made for Juan Camilo, by HanademiFuentes: Chague, F., De-Losso, R., & Giovannetti, B. (2020). Day trading for a living? Brazilian Review of Finance.; Barber, B.M., Lee, Y. T., Liu, Y. J., Odean, T., & Zhang, K. (2014). The cross-section of speculator skill: Evidence from day trading.Journal of Financial Markets, 18, 1-24.UnidadPorcentaje de tradersTraders persistentes de Brasil97 %1,1 %0,5 %Perdió dineroSobre salariomínimoSobre salario decajeroDay traders taiwaneses100 %1 %99 %Todos los daytradersRentablesprevisiblementeNo rentablesprevisiblemente
Dos registros administrativos cuentan una historia similar. En Brasil, el 97% de los traders persistentes perdió dinero después de comisiones. En Taiwán, menos del 1% fue previsiblemente rentable después de comisiones.
Trading cost Taiwanese individualinvestors 3.8 percentage points yearly.The percentage-point penalty and its GDP equivalent measure different quantities.Sources: faculty.haas.berkeley.edu.
The cost of trading was not a rounding error. Across Taiwan's complete investor record, individuals gave up 3.8 percentage points of performance each year. That recurring toll equaled 2.2% of GDP.
Operar costó a los inversionistasindividuales taiwaneses 3,8 puntosporcentuales al año.La penalización en puntos porcentuales y su equivalencia con el PIB miden cantidadesdistintas.Fuentes: faculty.haas.berkeley.edu.
El costo de operar no fue un error de redondeo. En todo el registro de inversionistas de Taiwán, los individuos cedieron 3,8 puntos porcentuales de rendimiento cada año. Ese peaje recurrente equivalió al 2,2% del PIB.
Active U.S. households earned the leastAnnual net returns for U.S. brokerage households and the market, 1991 to 1996.Made for Juan Camilo, by HanademiSources: Barber, B. M., & Odean, T. (2000). Trading is hazardous to your wealth. Journal of Finance.UnitAnnual net returnMost active households11.4%Average household16.4%Market17.9%
The active households did not receive a reward for trading more often. Their annual net return was 11.4%, against 16.4% for the average household and 17.9% for the market. Activity added motion, not performance.
Los hogares estadounidenses más activosganaron menosRendimientos netos anuales de hogares estadounidenses de corretaje y del mercado, 1991 a 1996.Made for Juan Camilo, by HanademiFuentes: Barber, B. M., & Odean, T. (2000). Trading is hazardous to your wealth. Journal of Finance.UnidadRendimiento neto anualHogares más activos11,4 %Hogar promedio16,4 %Mercado17,9 %
Los hogares activos no recibieron una recompensa por operar con mayor frecuencia. Su rendimiento neto anual fue del 11,4%, frente al 16,4% del hogar promedio y el 17,9% del mercado. La actividad añadió movimiento, no rendimiento.
In 2017, more speculation offset the taxsavings and reduced portfolio returns.The study links Taiwan's 2017 tax reduction to greater speculation, offset tax savings,and lower portfolio returns.Sources: chingtsechen.com.
In 2017, lowering the tax changed investor behavior. The reform increased day trading enough to offset the tax savings. Portfolio returns fell as speculation rose.
En 2017, una mayor especulaciónneutralizó el ahorro fiscal y redujo losretornos de cartera.El estudio vincula la reducción fiscal de Taiwán en 2017 con más especulación, laneutralización del ahorro tributario y menores retornos de cartera.Fuentes: chingtsechen.com.
En 2017, bajar el impuesto cambió el comportamiento de los inversionistas. La reforma aumentó el day trading lo suficiente para neutralizar el ahorro fiscal. Los retornos de cartera cayeron mientras aumentaba la especulación.
Only 13% of self-selecting Swedish pensionsavers beat AP7 Såfa over the long term.Only 13% beat the default long term, although roughly half outperformed it during 2025,with no exact percentage reported for that year.Sources: europeanpensions.net.
Choosing for yourself sounds like a route to better performance. Over the long term, only 13% of Swedish self-selecting savers beat AP7 Såfa. Roughly half outperformed it during 2025, but the source reports no exact percentage for that year.
Solo el 13% de los ahorradores suecosque eligieron sus fondos superó a AP7Såfa a largo plazo.Solo el 13% superó la opción predeterminada a largo plazo, aunque cerca de la mitad lohizo en 2025, sin un porcentaje exacto reportado para ese año.Fuentes: europeanpensions.net.
Elegir por cuenta propia parece una ruta hacia un mejor rendimiento. A largo plazo, solo el 13% de los ahorradores suecos que eligieron fondos superó a AP7 Såfa. Cerca de la mitad lo hizo en 2025, pero la fuente no reporta un porcentaje exacto para ese año.
The benchmark becomes concreteA Swedish flag marks Sweden on a map of Northern Europe.Sources: europeanpensions.net.
Sweden provides a tangible setting for comparing active choices with a default.
El benchmark se vuelve concretoUna bandera sueca señala Suecia en un mapa del norte de Europa.Fuentes: europeanpensions.net.
Suecia ofrece un contexto tangible para comparar las decisiones activas con una opción predeterminada.
Among 524,181 Finnish investors,first-time ETF adoption significantlyimproved risk-adjusted returns.The study followed 524,181 Finnish investors from 2007 to 2022 and found statisticallysignificant improvements in risk-adjusted returns after first-time ETF adoption.Sources: ideas.repec.org.
Among 524,181 Finnish investors tracked from 2007 to 2022, first-time ETF adoption produced statistically significant improvements in risk-adjusted returns. A structured, diversified vehicle can improve the decision.
Entre 524.181 inversionistasfinlandeses, adoptar ETF por primeravez mejoró significativamente losretornos ajustados por riesgo.El estudio siguió a 524.181 inversionistas finlandeses entre 2007 y 2022 y encontrómejoras estadísticamente significativas en los retornos ajustados por riesgo trasadoptar ETF por primera vez.Fuentes: ideas.repec.org.
Entre 524.181 inversionistas finlandeses seguidos de 2007 a 2022, la primera adopción de ETF produjo mejoras estadísticamente significativas en los retornos ajustados por riesgo. Un vehículo estructurado y diversificado puede mejorar la decisión.
Published factors lost 58% of their returnAverage return index across 97 predictors, normalized to 100 in sample.Made for Juan Camilo, by HanademiSources: McLean, R. D., & Pontiff, J. (2016). Does academic research destroy stock return predictability? Journal of Finance.The bridge follows the reported index sequence from 100 to 74 to 42.UnitReturn index0255075100100In sample-26Out-of-sample decline74Out of sample-32Publication decline42After publication
A factor can look powerful in its original study and weaken elsewhere. The index falls from 100 to 74 outside the sample. After publication, it reaches 42.
Los factores publicados perdieron 58% desu rentabilidadÍndice medio de rentabilidad de 97 predictores, normalizado a 100 en muestra.Made for Juan Camilo, by HanademiFuentes: McLean, R. D., & Pontiff, J. (2016). Does academic research destroy stock return predictability? Journal of Finance.El puente sigue la secuencia reportada del índice de 100 a 74 y luego a 42.UnidadÍndice de rentabilidad0255075100100En muestra-26Caída fuera demuestra74Fuera de muestra-32Caída tras publicación42Tras publicación
Un factor puede parecer potente en su estudio original y debilitarse en otro lugar. El índice cae de 100 a 74 fuera de la muestra. Tras la publicación, llega a 42.
Indices fell over 5% and recoveredmuch of it in 20 minutes.The cited report supports the decline and recovery timing, not a reconstructed intradayprice path.Sources: U.S. Securities and Exchange Commission & Commodity Futures Trading Commission. (2010). Findings regarding the market events of May 6,2010.
On May 6, 2010, major U.S. equity indices fell more than 5% within minutes. Much of that decline reversed roughly 20 minutes later. Automated markets can amplify and unwind shocks at extraordinary speed.
Los índices cayeron más de 5% yrecuperaron gran parte en 20 minutos.El informe citado respalda la caída y el momento de la recuperación, no unareconstrucción de la trayectoria intradía.Fuentes: U.S. Securities and Exchange Commission & Commodity Futures Trading Commission. (2010). Findings regarding the market events of May 6,2010.
El 6 de mayo de 2010, los principales índices estadounidenses cayeron más de 5% en minutos. Gran parte de esa caída se revirtió unos 20 minutos después. Los mercados automatizados pueden amplificar y deshacer perturbaciones a una velocidad extraordinaria.
Financial experts still led FinQA accuracyFinQA execution accuracy by respondent or model.Made for Juan Camilo, by HanademiSources: Chen, Z., Chen, W., Smiley, C., et al. (2021). FinQA: A dataset of numerical reasoning over financial data. EMNLP.UnitExecution accuracyFinancial experts91.2%Crowd workers50.7%FinQANet model68.9%
FinQANet beat the general crowd but still trailed financial experts. Experts reached 91.16% execution accuracy, while FinQANet reached 68.90%. Domain expertise remained the strongest benchmark here.
Los expertos financieros siguieronliderando FinQAPrecisión de ejecución en FinQA por grupo o modelo.Made for Juan Camilo, by HanademiFuentes: Chen, Z., Chen, W., Smiley, C., et al. (2021). FinQA: A dataset of numerical reasoning over financial data. EMNLP.UnidadPrecisión de ejecuciónExpertos financieros91,2 %Trabajadores generales50,7 %Modelo FinQANet68,9 %
FinQANet superó al grupo general, pero quedó por debajo de los expertos financieros. Los expertos alcanzaron 91,16% de precisión y FinQANet llegó al 68,90%. La experiencia financiera siguió siendo la referencia más fuerte.
Finance extends beyond benchmarksA man carrying papers walks out of a modern office building.Sources: BankerToolBench 2026: AI Agents Fail the Banking Test | innobu. innobu.com.
Model performance must ultimately operate within real people, workflows and institutions.
Las finanzas van más allá de los benchmarksUn hombre que lleva documentos sale de un edificio de oficinas moderno.Fuentes: BankerToolBench 2026: AI Agents Fail the Banking Test | innobu. innobu.com.
El rendimiento del modelo debe funcionar finalmente entre personas, procesos e instituciones reales.
GPT-4 improved factuality 40% but stillmade errorsOpenAI internal adversarial evaluation; index levels and reported relative improvement.Made for Juan Camilo, by HanademiSources: OpenAI. (2023). GPT-4 technical report. arXiv.GPT-3.5 is indexed to 100, GPT-4 to 140, and the reported relative improvement is 40%.UnitReported factuality figures140GPT-4 index100GPT-3.5 index40Relative improvement, %
GPT-4 improved factuality by 40% relative to GPT-3.5 in OpenAI's internal evaluations. That is a meaningful gain, but OpenAI still warned about hallucinations and incorrect reasoning. Better is not the same as reliable enough for live trading.
GPT-4 mejoró la factualidad 40%, pero aúncometió erroresEvaluación adversarial interna de OpenAI; niveles del índice y mejora relativa reportada.Made for Juan Camilo, by HanademiFuentes: OpenAI. (2023). GPT-4 technical report. arXiv.GPT-3.5 se indexa en 100, GPT-4 en 140 y la mejora relativa reportada es del 40%.UnidadCifras reportadas de factualidad140Índice de GPT-4100Índice de GPT-3.540Mejora relativa, %
GPT-4 mejoró la factualidad un 40% frente a GPT-3.5 en las evaluaciones internas de OpenAI. Es una mejora importante, pero OpenAI todavía advirtió sobre alucinaciones y razonamiento incorrecto. Mejor no significa suficientemente fiable para operar en vivo.
Knight Capital automated a $460 million lossReported dimensions of Knight Capital's faulty 2012 deployment, labeled in their source units.Made for Juan Camilo, by HanademiSources: U.S. Securities and Exchange Commission. (2013). SEC charges Knight Capital with violations of market accessrule. SEC.Each category retains its source unit: 45 minutes, more than 4 million executions and about $460 million in pre-tax loss.UnitReported incident figuresActivity, minutes45Executions, millions4Pre-tax loss, USD M460
Knight Capital's faulty deployment ran for 45 minutes. It generated more than 4 million executions and caused about $460 million in pre-tax losses. Automation scaled the failure at market speed.
Knight Capital automatizó una pérdida de460 millones de dólaresDimensiones reportadas del despliegue defectuoso de Knight Capital en 2012, etiquetadas con sus unidadesoriginales.Made for Juan Camilo, by HanademiFuentes: U.S. Securities and Exchange Commission. (2013). SEC charges Knight Capital with violations of marketaccess rule. SEC.Cada categoría conserva su unidad original: 45 minutos, más de 4 millones de ejecuciones y unos 460 millones dedólares de pérdida antes de impuestos.UnidadCifras reportadas del incidenteActividad, minutos45Ejecuciones, millones4Pérdida antes de impuestos, MUSD460
El despliegue defectuoso de Knight Capital funcionó durante 45 minutos. Generó más de 4 millones de ejecuciones y causó unos 460 millones de dólares en pérdidas antes de impuestos. La automatización escaló el fallo a velocidad de mercado.
New factors need a t-statistic near 3Conventional threshold, proposed multiple-testing threshold and the 1.0-point increase.Made for Juan Camilo, by HanademiSources: Harvey, C. R., Liu, Y., & Zhu, H. (2016). ... and the cross-section of expected returns. Review of Financial Studies.Unitt-statistic points3Proposed threshold2Conventional threshold1Threshold increase
A t-statistic near 2 can look persuasive when researchers test many ideas. Harvey, Liu and Zhu argued for a threshold near 3 instead. AI-assisted experimentation makes that higher bar more relevant.
Los factores nuevos necesitan unestadístico t cercano a 3Umbral convencional, umbral propuesto para pruebas múltiples y aumento de 1,0 punto.Made for Juan Camilo, by HanademiFuentes: Harvey, C. R., Liu, Y., & Zhu, H. (2016). ... and the cross-section of expected returns. Review of Financial Studies.UnidadPuntos del estadístico t3Umbral propuesto2Umbral convencional1Aumento del umbral
Un estadístico t cercano a 2 puede parecer convincente cuando se prueban muchas ideas. Harvey, Liu y Zhu propusieron un umbral cercano a 3. La experimentación asistida por IA hace más relevante ese listón superior.
At 100 trials, t=2 falls below expected noiseCompare the expected maximum of independent noise with fixed t-statistic thresholds of 2 and 3 as the trialcount rises.Made for Juan Camilo, by HanademiSources: Bailey, D. H., & López de Prado, M. (2014). The deflated Sharpe ratio. Journal of Portfolio Management.; Harvey, C. R., Liu, Y., &Zhu, H. (2016). ... and the cross-section of expected returns. Review of Financial Studies.; …and the Cross-Section of Expected Returns.Unitt-statistic01231 trial10 trials100 trialsExpectedmaximum noiseConventionalthresholdMultiple-testingthreshold
At 100 trials, expected noise reaches 2.51, leaving the conventional threshold 0.51 below noise while the multiple-testing threshold retains a 0.49 margin.
Con 100 pruebas, t=2 queda por debajo delruido esperadoComparar el máximo esperado de ruido independiente con umbrales fijos del estadístico t de 2 y 3 a medidaque aumenta el número de pruebas.Made for Juan Camilo, by HanademiFuentes: Bailey, D. H., & López de Prado, M. (2014). The deflated Sharpe ratio. Journal of Portfolio Management.; Harvey, C. R., Liu, Y., &Zhu, H. (2016). ... and the cross-section of expected returns. Review of Financial Studies.; …and the Cross-Section of Expected Returns.Unidadestadístico t01231 prueba10 pruebas100 pruebasMáximoesperado delruidoUmbralconvencionalUmbral parapruebasmúltiples
Con 100 pruebas, el ruido esperado llega a 2,51, dejando el umbral convencional 0,51 por debajo del ruido mientras el umbral para pruebas múltiples conserva un margen de 0,49.
EU AI Act fines can reach 7% of worldwideturnoverMaximum fines as a share of worldwide annual turnover, by violation category.Made for Juan Camilo, by HanademiSources: European Union. (2024). Regulation (EU) 2024/1689 laying down harmonised rules on artificialintelligence. Official Journal of the European Union.UnitPercent of worldwide annual turnoverIncorrect information1%Other obligations3%Prohibited practices7%
Commercial AI products face more than model risk. The EU AI Act permits maximum fines of 1%, 3% or 7% of worldwide annual turnover, depending on the violation. Compliance must enter the product design before launch.
Las multas de la Ley de IA pueden llegar al7% de la facturación mundialMultas máximas como proporción de la facturación mundial anual, según la categoría de infracción.Made for Juan Camilo, by HanademiFuentes: European Union. (2024). Regulation (EU) 2024/1689 laying down harmonised rules on artificialintelligence. Official Journal of the European Union.UnidadPorcentaje de la facturación mundial anualInformación incorrecta1 %Otras obligaciones3 %Prácticas prohibidas7 %
Los productos comerciales de IA afrontan algo más que riesgo del modelo. La Ley de IA de la UE permite multas máximas del 1%, 3% o 7% de la facturación mundial anual, según la infracción. El cumplimiento debe entrar en el diseño antes del lanzamiento.
Use four illustrative controlcategories, with credit and capitallimits enforced before any automatedorder reaches the market.SEC Rule 15c3-5 requires covered broker-dealers to enforce pre-trade controls againstorders exceeding preset credit or capital thresholds. The four categories are a designanalogy, not four labels used by the rule.Sources: U.S. Securities and Exchange Commission. (2010). Risk management controls for brokers or dealers with market access. SEC.
The safe workflow ends with controls, not a better prompt. SEC Rule 15c3-5 requires covered broker-dealers to block orders that exceed preset credit or capital thresholds. Use four illustrative control categories for a retail system, while keeping the legal scope clear: the rule applies to covered broker-dealers, not every retail script.
El flujo seguro termina con controles, nocon un mejor prompt.La regla 15c3-5 de la SEC exige que los corredores cubiertos apliquen controlesprevios contra órdenes que superen límites preestablecidos de crédito o capital. Lascuatro categorías son una analogía de diseño, no cuatro etiquetas usadas por la regla.Fuentes: U.S. Securities and Exchange Commission. (2010). Risk management controls for brokers or dealers with market access. SEC.
El flujo seguro termina con controles, no con un mejor prompt. La regla 15c3-5 de la SEC exige que los corredores cubiertos bloqueen órdenes que superen límites preestablecidos de crédito o capital. Usa cuatro categorías de control ilustrativas en un sistema minorista, sin confundir el alcance legal: la regla se aplica a corredores cubiertos, no a todo script minorista.
Use AI to accelerate testing, never tobypass evidence or controls.The summary now gives the Indian F&O finding its full context while keeping every citedresult visible for review.Sources: Securities and Exchange Board of India. (2024). Analysis of profit and loss of individual traders dealing in the equity F&O segment. SEBI.; Updated SEBI Study Reveals 93% of Individual Traders ....; Becker,J., Rush, N., Barnes, B., & Rein, D. (2025). Measuring the impact of early-2025 AI on experienced open-source developer productivity. METR.; Measuring the Impact of Early-2025 AI on Experienced ....; McLean, R.D., & Pontiff, J. (2016). Does academic research destroy stock return predictability? Journal of Finance.; Does Academic Research Destroy Stock Return Predictability?.; U.S. Securities and Exchange Commission…
The practical edge is disciplined validation, not faster code alone. The evidence spans trader losses, slower experienced developers, decaying published returns, deployment controls and the limits of self-selection.
Usa IA para acelerar las pruebas, nuncapara saltarte la evidencia ni los controles.El resumen ahora da al hallazgo sobre F&O en India todo su contexto y mantiene visiblecada resultado citado para su revisión.Fuentes: Securities and Exchange Board of India. (2024). Analysis of profit and loss of individual traders dealing in the equity F&O segment. SEBI.; Updated SEBI Study Reveals 93% of Individual Traders ....; Becker, J.,Rush, N., Barnes, B., & Rein, D. (2025). Measuring the impact of early-2025 AI on experienced open-source developer productivity. METR.; Measuring the Impact of Early-2025 AI on Experienced ....; McLean, R. D., &Pontiff, J. (2016). Does academic research destroy stock return predictability? Journal of Finance.; Does Academic Research Destroy Stock Return Predictability?.; U.S. Securities and Exchange Commission. (2013)…
La ventaja práctica es una validación disciplinada, no solo programar más rápido. La evidencia abarca pérdidas de operadores, desarrolladores experimentados más lentos, rentabilidades publicadas que decaen, controles de despliegue y los límites de elegir por cuenta propia.
In summaryMade for Juan Camilo, by HanademiSources: Chague, F., De-Losso, R., & Giovannetti, B. (2020). Day trading for a living? Brazilian Review of Finance.; U.S. Securities and Exchange Commission. (2013). SEC charges Knight Capital with violations ofmarket access rule. SEC.; Securities and Exchange Board of India. (2024). Analysis of profit and loss of individual traders dealing in the equity F&O segment. SEBI.; McLean, R. D., & Pontiff, J. (2016). Does academicresearch destroy stock return predictability? Journal of Finance.; Barber, B. M., Lee, Y. T., Liu, Y. J., Odean, T., & Zhang, K. (2014). The cross-section of speculator skill: Evidence from day trading. Journal of…Among 1,551 Brazilians who persisted in equity-index day trading for at least 300 days, 97% lost money after fees.Knight Capital's faulty 2012 deployment generated more than four million executions in 45 minutes and caused anapproximately $460 million pre-tax loss.SEBI found 93% of individual equity futures-and-options traders lost money during fiscal years 2022 through 2024, withaggregate losses above ₹1.8 trillion.Across 97 published predictors, average returns were 26% lower out of sample and 58% lower after academic publication.Taiwanese transaction records indicated that fewer than 1% of day traders were predictably profitable after fees in a typical year.Taiwan’s 2017 day-trading tax cut increased speculation enough that investor responses offset tax savings and reduced portfolio returns.
The value of the research is not only what each source knew, but what became visible when their evidence was combined.
En resumenMade for Juan Camilo, by HanademiFuentes: Chague, F., De-Losso, R., & Giovannetti, B. (2020). Day trading for a living? Brazilian Review of Finance.; U.S. Securities and Exchange Commission. (2013). SEC charges Knight Capital with violations of marketaccess rule. SEC.; Securities and Exchange Board of India. (2024). Analysis of profit and loss of individual traders dealing in the equity F&O segment. SEBI.; McLean, R. D., & Pontiff, J. (2016). Does academic researchdestroy stock return predictability? Journal of Finance.; Barber, B. M., Lee, Y. T., Liu, Y. J., Odean, T., & Zhang, K. (2014). The cross-section of speculator skill: Evidence from day trading. Journal of Financial…Entre 1.551 brasileños que persistieron al menos 300 días en day trading de futuros sobre índices, 97% perdió dinero después de comisiones.El despliegue defectuoso de Knight Capital en 2012 generó más de cuatro millones de ejecuciones en 45 minutos y causóuna pérdida antes de impuestos de unos 460 millones de dólares.SEBI encontró que 93% de los operadores individuales de futuros y opciones perdió dinero entre los ejercicios 2022 y2024, con pérdidas agregadas superiores a 1,8 billones de rupias.Entre 97 predictores publicados, las rentabilidades promedio fueron 26% menores fuera de muestra y 58% menoresdespués de su publicación académica.Los registros de transacciones de Taiwán indicaron que menos de 1% de los day traders era previsiblemente rentabledespués de comisiones en un año típico.La reducción del impuesto al day trading en Taiwán en 2017 elevó la especulación hasta el punto de neutralizar el ahorrotributario y reducir los retornos de cartera.
El valor de la investigación no está solo en cada fuente, sino en lo que apareció al combinar sus evidencias.
Three Knight-sized losses equal 92% of oneyear's execution benefitAccumulate the $460 million Knight Capital loss one, two and three times, then compare the totals with theSEC's estimated $1.5 billion annual execution benefit.Made for Juan Camilo, by HanademiSources: U.S. Securities and Exchange Commission. (2013). SEC charges Knight Capital with violations of market access rule. SEC.;Knight Capital Group.; U.S. Securities and Exchange Commission. (2022). Order competition rule: Proposed rule. SEC.UnitUSD billionsOne Knight loss$0.5Two Knight losses$0.9Three Knight losses$1.4Annual execution benefit$1.5
A single 45-minute failure equals 31% of the proposed annual benefit, while three such failures reach $1.38 billion and erase 92% of it.
Tres pérdidas como la de Knight equivalenal 92% del beneficio anual de ejecuciónAcumular una, dos y tres veces la pérdida de 460 millones de dólares de Knight Capital y comparar lostotales con el beneficio anual de ejecución de 1.500 millones estimado por la SEC.Made for Juan Camilo, by HanademiFuentes: U.S. Securities and Exchange Commission. (2013). SEC charges Knight Capital with violations of market accessrule. SEC.; Knight Capital Group.; U.S. Securities and Exchange Commission. (2022). Order competition rule: Proposedrule. SEC.Unidadmiles de millones de USDUna pérdida de Knight$0,5Dos pérdidas de Knight$0,9Tres pérdidas de Knight$1,4Beneficio anual de ejecución$1,5
Un solo fallo de 45 minutos equivale al 31% del beneficio anual propuesto, mientras que tres fallos similares alcanzan 1.380 millones de dólares y eliminan el 92% de ese beneficio.
Adverse retail outcomes outweigh successby 4x to at least 99xConvert each reported adverse-outcome rate into odds by dividing it by its complementary success rate.Made for Juan Camilo, by HanademiSources: European Securities and Markets Authority. (2018). ESMA adopts final product intervention measures on CFDsand binary options. ESMA.; Securities and Exchange Board of India. (2024). Analysis of profit and loss of individualtraders dealing in the equity F&O segment. SEBI.; Updated SEBI Study Reveals 93% of Individual Traders ....Unitadverse outcomes per successful outcomeEuropean CFD accounts4.4Indian equity derivatives traders13.3Brazilian persistent day traders32.3Taiwanese day traders99
The odds worsen from 4.4 losing CFD accounts per non-losing account to at least 99 day traders without predictable profitability per predictably profitable trader.
Los resultados adversos del retail superanal éxito entre 4 y al menos 99 vecesConvertir cada tasa reportada de resultado adverso en probabilidades relativas dividiéndola entre su tasacomplementaria de éxito.Made for Juan Camilo, by HanademiFuentes: European Securities and Markets Authority. (2018). ESMA adopts final product intervention measures on CFDsand binary options. ESMA.; Securities and Exchange Board of India. (2024). Analysis of profit and loss of individualtraders dealing in the equity F&O segment. SEBI.; Updated SEBI Study Reveals 93% of Individual Traders ....Unidadresultados adversos por cada resultado exitosoCuentas europeas de CFD4,4Operadores indios de derivados sobre acciones13,3Operadores intradía persistentes de Brasil32,3Operadores intradía de Taiwán99
Las probabilidades empeoran desde 4,4 cuentas de CFD perdedoras por cada cuenta no perdedora hasta al menos 99 operadores intradía sin rentabilidad predecible por cada operador con rentabilidad predecible.
AI failure rates exceed thepredictable-profit ceiling by at least 31xConvert each AI accuracy into an error rate and divide it by the generous 1% ceiling for predictablyprofitable day traders.Made for Juan Camilo, by HanademiSources: Barber, B. M., Lee, Y. T., Liu, Y. J., Odean, T., & Zhang, K. (2014). The cross-section of speculator skill: Evidencefrom day trading. Journal of Financial Markets, 18, 1-24.; The cross-section of speculator skill_ Evidence from day trading.;Chen, Z., Chen, W., Smiley, C., et al. (2021). FinQA: A dataset of numerical reasoning over financial data. EMNLP.Unitmultiple of the 1% predictable-profit ceilingFinQANet errors31.1GPT-4 HumanEval unsolved33ChatGPT exact-retrieval misses36.2
Even the lowest measured AI error rate is 31.1 times the upper bound on predictable trader profitability, so automated competence does not imply a scarce trading edge.
Las tasas de fallo de la IA superan al menos 31 vecesel techo de rentabilidad predecibleConvertir cada precisión de IA en una tasa de error y dividirla entre el techo generoso del 1% paraoperadores intradía con rentabilidad predecible.Made for Juan Camilo, by HanademiFuentes: Barber, B. M., Lee, Y. T., Liu, Y. J., Odean, T., & Zhang, K. (2014). The cross-section of speculator skill: Evidencefrom day trading. Journal of Financial Markets, 18, 1-24.; The cross-section of speculator skill_ Evidence from day trading.;Chen, Z., Chen, W., Smiley, C., et al. (2021). FinQA: A dataset of numerical reasoning over financial data. EMNLP.Unidadmúltiplo del techo de rentabilidad predecible del 1%Errores de FinQANet31,1Problemas HumanEval no resueltos por GPT-433Fallos de recuperación exacta de ChatGPT36,2
Incluso la menor tasa de error medida de la IA equivale a 31,1 veces el límite superior de rentabilidad predecible del operador, por lo que la competencia automatizada no implica una ventaja de trading escasa.
316 published factors shrink to 133post-publication equivalentsApply the average retained-return indices of 74% out of sample and 42% after publication to each historicalfactor count. Log scale: every gridline is ×10.Made for Juan Camilo, by HanademiSources: Harvey, C. R., Liu, Y., & Zhu, H. (2016). ... and the cross-section of expected returns. Review ofFinancial Studies.; McLean, R. D., & Pontiff, J. (2016). Does academic research destroy stock returnpredictability? Journal of Finance.; Does Academic Research Destroy Stock Return Predictability?.Unitreturn-weighted factor equivalents1101001KBefore 1980By 1990By 2000By 2012PublishedfactorsOut-of-sampleequivalentsPost-publicationequivalents
The 2012 catalogue contains 316 factors, but applying the documented average decay leaves only 133 factors' worth of post-publication return in this counterfactual.
316 factores publicados se reducen a 133equivalentes tras su publicaciónAplicar los índices medios de rendimiento conservado del 74% fuera de muestra y del 42% tras lapublicación a cada recuento histórico de factores. Escala logarítmica: cada línea es ×10.Made for Juan Camilo, by HanademiFuentes: Harvey, C. R., Liu, Y., & Zhu, H. (2016). ... and the cross-section of expected returns. Review of FinancialStudies.; McLean, R. D., & Pontiff, J. (2016). Does academic research destroy stock return predictability? Journalof Finance.; Does Academic Research Destroy Stock Return Predictability?.Unidadequivalentes de factores ponderados por rendimiento1101001KAntes de 1980Hasta 1990Hasta 2000Hasta 2012FactorespublicadosEquivalentesfuera demuestraEquivalentestras lapublicación
El catálogo de 2012 contiene 316 factores, pero al aplicar el deterioro medio documentado quedan apenas 133 factores equivalentes de rendimiento tras la publicación en este contrafactual.

The research behind this deck

Only 1% earned more than ₹100,000 net. These terms connect software capability with financial risk.

Key findings

The argument

This research is published in English and Spanish. Ver en español

La investigación detrás de esta presentación

Solo el 1% ganó más de ₹100.000 netos. Estos términos conectan la capacidad del software con el riesgo financiero.

Hallazgos clave

El argumento

Esta investigación se publica en inglés y español. Read in English