Hanademi

Finance agents need boundaries before autonomy

34 slides · 27 min · 1 minute ago language
ENES
theme
LightDark
view
DeckTableTalk
brand
HanademiPlatzi
Finance agents need boundariesbefore autonomyMade for Santiago Cano Toro, by Hanademi
Los agentes financierosnecesitan límites antes deautonomíaMade for Santiago Cano Toro, by Hanademi
GPT-4 made consultants faster and betterChange among 758 consultants on tasks inside GPT-4's measured competence boundary, percent.Made for Santiago Cano Toro, by HanademiSources: Dell'Acqua, F., et al. (2023). Navigating the jagged technological frontier: Field experimental evidence of the effects of AI onknowledge worker productivity and quality. Harvard Business School Working Paper 24-013.Unitpercent change40%Higher quality25.1%Faster12.2%More tasks
In an experiment with 758 consultants, GPT-4 users finished 12.2% more tasks and worked 25.1% faster. Their work received quality ratings over 40% higher. On a task outside the measured competence boundary, however, users were 19 percentage points less likely to answer correctly.
GPT-4 volvió a los consultores más rápidosy mejoresCambio entre 758 consultores en tareas dentro del límite de competencia medido de GPT-4, porcentaje.Made for Santiago Cano Toro, by HanademiFuentes: Dell'Acqua, F., et al. (2023). Navigating the jagged technological frontier: Field experimental evidence of the effects of AIon knowledge worker productivity and quality. Harvard Business School Working Paper 24-013.Unidadcambio porcentual40 %Mayor calidad25,1 %Más rápido12,2 %Más tareas
En un experimento con 758 consultores, los usuarios de GPT-4 completaron 12,2% más tareas y trabajaron 25,1% más rápido. Su trabajo recibió evaluaciones de calidad más de 40% superiores. Sin embargo, en una tarea fuera del límite de competencia medido, los usuarios tuvieron 19 puntos porcentuales menos de probabilidad de acertar.
A short guide to the languageMade for Santiago Cano Toro, by HanademiFP&AFinancial planning and analysis: budgets, forecasts and business decisions.RPASoftware that follows predefined rules to repeat routine computer tasks.LLMA language model trained to interpret and generate text.BPOBusiness processes performed by an outside service provider.EORA firm that legally employs workers for another company.
FP&A covers budgets, forecasts and decisions. RPA repeats known rules, while an LLM interprets language. An agent adds memory, planning and action, which raises a new question about who controls the final step.
Una guía breve del lenguajeMade for Santiago Cano Toro, by HanademiFP&APlanificación y análisis financiero: presupuestos, pronósticos y decisiones empresariales.RPASoftware que sigue reglas predefinidas para repetir tareas informáticas rutinarias.LLMUn modelo de lenguaje entrenado para interpretar y generar texto.BPOProcesos empresariales realizados por un proveedor externo.EORUna firma que emplea legalmente trabajadores para otra empresa.
FP&A cubre presupuestos, pronósticos y decisiones. RPA repite reglas conocidas, mientras un LLM interpreta lenguaje. Un agente añade memoria, planificación y acción, lo que plantea una nueva pregunta sobre quién controla el paso final.
Financial reasoning mixes words withnumbersQuestions or question-answer pairs in 3 financial benchmarks requiring textual and numerical reasoning.Made for Santiago Cano Toro, by HanademiSources: Chen, Z., et al. (2021). FinQA: A dataset of numerical reasoning over financial data. Proceedings of EMNLP 2021.; Islam,P., et al. (2023). FinanceBench: A new benchmark for financial question answering. arXiv.; Zhu, F., et al. (2021). TAT-QA: Aquestion answering benchmark on a hybrid of tabular and textual content in finance. Proceedings of ACL-IJCNLP 2021.Unitbenchmark itemsFinQA8,281FinanceBench10,231TAT-QA16,552
Classic automation works best when the input and rule are known. FP&A is harder because one answer may require reading a narrative, finding values in a table and performing a calculation. TAT-QA alone contains 16,552 such items.
El razonamiento financiero mezcla palabrasy númerosPreguntas o pares de pregunta-respuesta en 3 pruebas financieras que requieren razonamiento textual ynumérico.Made for Santiago Cano Toro, by HanademiFuentes: Chen, Z., et al. (2021). FinQA: A dataset of numerical reasoning over financial data. Proceedings of EMNLP 2021.; Islam, P.,et al. (2023). FinanceBench: A new benchmark for financial question answering. arXiv.; Zhu, F., et al. (2021). TAT-QA: A questionanswering benchmark on a hybrid of tabular and textual content in finance. Proceedings of ACL-IJCNLP 2021.Unidadelementos de pruebaFinQA8.281FinanceBench10.231TAT-QA16.552
La automatización clásica funciona mejor cuando la entrada y la regla ya se conocen. FP&A es más difícil porque una respuesta puede exigir leer una narrativa, encontrar valores en una tabla y realizar un cálculo. TAT-QA contiene por sí sola 16.552 elementos de este tipo.
The larger burden stays belowA small portion of an iceberg is visible above the waterline.Sources: FP&A's AI problem, again, is the data underneath it. diginomica.com.
A finance answer is only the visible tip; the larger burden is the data, assumptions and exceptions underneath.
La mayor carga permanece debajoUna pequeña parte de un iceberg es visible sobre la línea del agua.Fuentes: FP&A's AI problem, again, is the data underneath it. diginomica.com.
Una respuesta financiera es solo la punta visible; debajo están los datos, los supuestos y las excepciones.
Automation works best when variation isdesigned out first.The areas denote equal membership in a qualitative synthesis, not measured importance.The specific Peng 2025 evidence named in the thesis was not verified during the build.Sources: Kokina, J., & Blanchette, S. (2019). Early evidence of digital labor in accounting: Innovation with robotic process automation. Journal ofEmerging Technologies in Accounting.; Cooper, L. A., Holderness, D. K., Sorensen, T. L., & Wood, D. A. (2019). Robotic process automation in publicaccounting. Accounting Horizons.
Accounting RPA research repeatedly points to standardized rules, structured inputs and manageable exceptions. That resembles a dishwasher running a known cycle. Unusual objects still require human handling.
La automatización funciona mejor cuandoprimero se reduce la variación.Las áreas indican pertenencia equivalente a una síntesis cualitativa, no importanciamedida. La evidencia específica de Peng de 2025 mencionada en la tesis no fueverificada durante la construcción.Fuentes: Kokina, J., & Blanchette, S. (2019). Early evidence of digital labor in accounting: Innovation with robotic process automation. Journal ofEmerging Technologies in Accounting.; Cooper, L. A., Holderness, D. K., Sorensen, T. L., & Wood, D. A. (2019). Robotic process automation in publicaccounting. Accounting Horizons.
La investigación sobre RPA contable señala repetidamente reglas estandarizadas, entradas estructuradas y excepciones manejables. Se parece a un lavavajillas que ejecuta un ciclo conocido. Los objetos inusuales todavía requieren intervención humana.
China's digital invoicing reform raisedeffective tax rates by 0.91 points.This result comes from the cited Chinese reform study and does not measureautonomous-agent deployment.Sources: journals.plos.org.
Standardization is not merely an efficiency project. China's staggered digital invoicing reform increased firms' effective tax rates by an average 0.91 percentage points. A standardized transaction layer can change financial outcomes, not only processing speed.
La reforma china de facturación digitalelevó 0,91 puntos las tasas efectivas.Este resultado proviene del estudio citado sobre la reforma china y no mide desplieguesde agentes autónomos.Fuentes: journals.plos.org.
La estandarización no es solamente un proyecto de eficiencia. La implementación escalonada de la facturación digital en China aumentó en promedio 0,91 puntos porcentuales las tasas efectivas de las empresas. Una capa transaccional estandarizada puede cambiar resultados financieros y no solamente la velocidad.
A language model advises; an agent canremember, plan and execute.The areas denote equal membership in the framework, not measured importance.Technical capability and organizational authority remain separate design choices.Sources: Wang, L., et al. (2023). A survey on large language model based autonomous agents. arXiv:2308.11432. Subsequently published in Frontiers ofComputer Science.; National Institute of Standards and Technology. (2023). Artificial Intelligence Risk Management Framework, AI RMF 1.0. U.S.Department of Commerce.
Fluent conversation does not define an agent. Wang and colleagues organize agents around profile, memory, planning and action. Firms can still require human approval before payments, accounting entries or published forecasts.
Un modelo aconseja; un agente puederecordar, planificar y ejecutar.Las áreas indican pertenencia equivalente al marco, no importancia medida. Lacapacidad técnica y la autoridad organizacional siguen siendo decisiones de diseñoseparadas.Fuentes: Wang, L., et al. (2023). A survey on large language model based autonomous agents. arXiv:2308.11432. Subsequently published in Frontiers ofComputer Science.; National Institute of Standards and Technology. (2023). Artificial Intelligence Risk Management Framework, AI RMF 1.0. U.S.Department of Commerce.
La conversación fluida no define a un agente. Wang y sus colegas organizan los agentes alrededor de perfil, memoria, planificación y acción. Las empresas todavía pueden exigir aprobación humana antes de pagos, registros contables o pronósticos publicados.
Execution creates more paths to governOrange and blue light traces form a dense network.Sources: Accounting automation's intelligent future. journalofaccountancy.com.
Once an agent can act, every connection becomes another path requiring permissions, monitoring and recovery.
La ejecución crea más rutas que gobernarTrazos de luz anaranjados y azules forman una red densa.Fuentes: Accounting automation's intelligent future. journalofaccountancy.com.
Cuando un agente puede actuar, cada conexión se convierte en otra ruta que exige permisos, monitoreo y recuperación.
A survey of 277 accountants found widelydifferent AI experiences.The study documents heterogeneity in human-AI accounting. It does not establish aprevalence rate for autonomous agents.Sources: ideas.repec.org.
A field study surveyed 277 professional accountants. It found substantial variation in adoption patterns, benefits and concerns. One organizational adoption rate cannot describe a profession experiencing generative AI in very different ways.
Una encuesta a 277 contadores encontróexperiencias muy distintas con IA.El estudio documenta heterogeneidad en la contabilidad con IA. No establece una tasa deprevalencia para agentes autónomos.Fuentes: ideas.repec.org.
Un estudio de campo encuestó a 277 profesionales contables. Encontró diferencias importantes en patrones de adopción, beneficios y preocupaciones. Una sola tasa organizacional no puede describir una profesión que vive la IA generativa de maneras muy distintas.
A label is not a capability test.The survey taxonomy, commercial labels, production study and agent index answerdifferent questions. Together they show why naming a system an agent does not establishautonomous capability.Sources: Xi, Z., et al. (2023). The rise and potential of large language model based agents: A survey. arXiv:2309.07864.; ar5iv.labs.arxiv.org.;arxiv.org.These sources use different scopes and units.
Labels compress different operating models into one word. The evidence is separate: three survey dimensions, four overlapping labels, 306 practitioners, 20 cases across 26 domains, and 30 indexed deployments. None alone proves autonomous capability.
Una etiqueta no es una prueba de capacidad.La taxonomía de la revisión, las etiquetas comerciales, el estudio de producción y elíndice de agentes responden preguntas distintas. En conjunto muestran por qué llamaragente a un sistema no establece su capacidad autónoma.Fuentes: Xi, Z., et al. (2023). The rise and potential of large language model based agents: A survey. arXiv:2309.07864.; ar5iv.labs.arxiv.org.;arxiv.org.Estas fuentes usan alcances y unidades diferentes.
Las etiquetas comprimen distintos modelos operativos en una sola palabra. La evidencia está separada: tres dimensiones de revisión, cuatro etiquetas superpuestas, 306 profesionales, 20 casos en 26 ámbitos y 30 despliegues indexados. Ninguna prueba por sí sola la capacidad autónoma.
Fluent conversation alone does not proveorganizational agency.The areas are equal conceptual functions. They do not represent measured capabilityscores.Sources: Wang, L., et al. (2023). A survey on large language model based autonomous agents. arXiv:2308.11432.
The proposed test asks whether a system can perceive, set objectives, plan, act, evaluate and interact. That resembles judging an employee by completed work rather than confident speech. The framework is useful for screening claims, but it remains an unpublished research design.
Una conversación fluida no demuestra porsola agencia organizacional.Las áreas son funciones conceptuales iguales. No representan puntuaciones de capacidadmedidas.Fuentes: Wang, L., et al. (2023). A survey on large language model based autonomous agents. arXiv:2308.11432.
La prueba propuesta pregunta si un sistema puede percibir, fijar objetivos, planificar, actuar, evaluar e interactuar. Se parece a juzgar a un empleado por el trabajo completado y no por un discurso seguro. El marco es útil para evaluar afirmaciones, pero sigue siendo un diseño de investigación no publicado.
With an independence assumption, reliabilitycollapses across stepsIllustrative end-to-end reliability when every independent step succeeds 95% of the time.Made for Santiago Cano Toro, by HanademiIllustrative project calculation: 0.95 raised to the number of independent steps.Unitend-to-end reliability1 step95%5 steps77.4%10 steps59.9%20 steps35.8%
A step that succeeds 95% of the time sounds reliable. Under an independence assumption, 10 such steps produce only 59.9% end-to-end reliability. At 20 steps, the figure falls to 35.8%.
Con independencia entre pasos, laconfiabilidad se desplomaConfiabilidad total ilustrativa cuando cada paso independiente acierta 95% de las veces.Made for Santiago Cano Toro, by HanademiCálculo ilustrativo del proyecto: 0,95 elevado al número de pasos independientes.Unidadconfiabilidad total1 paso95 %5 pasos77,4 %10 pasos59,9 %20 pasos35,8 %
Un paso que acierta 95% de las veces parece confiable. Bajo un supuesto de independencia, 10 pasos producen solamente 59,9% de confiabilidad total. Con 20 pasos, la cifra cae a 35,8%.
Implementation friction slowed adoption,but the study reported lower leakages andsubstantial time savings.The study reported three separate outcomes: payment leakages fell by more than 40%,Smartcards processed 50% of payments after two years, and aggregate time savingswere estimated at US$4.5 million.Sources: povertyactionlab.org.
India's Smartcards reduced payment leakages by more than 40%. After two years, they processed 50% of payments in treated areas because enrollment was difficult. The same study estimated US$4.5 million in aggregate time savings.
La fricción frenó la adopción, pero elestudio reportó menos fugas y un ahorroconsiderable de tiempo.El estudio reportó tres resultados separados: las fugas de pagos cayeron más de 40%, lastarjetas procesaban 50% de los pagos después de dos años y el ahorro agregado detiempo se estimó en US$4,5 millones.Fuentes: povertyactionlab.org.
Las tarjetas inteligentes de India redujeron las fugas de pagos en más de 40%. Después de dos años, procesaban 50% de los pagos en las zonas tratadas porque la inscripción era difícil. El mismo estudio estimó US$4,5 millones en ahorro agregado de tiempo.
Generative AI entered offices faster thanautonomous financial control.The 65% figure measures broad generative-AI use, not agent-specific prevalence. Thesupplied historical trend was not independently verified, so only the reported early-2024value is used.Sources: McKinsey & Company. (2024). The state of AI in early 2024: Gen AI adoption spikes and starts to generate value.
McKinsey reported regular generative-AI use in at least one function at 65% of surveyed organizations. The survey included writing, summarization and other uses that do not plan or execute workflows. It cannot establish an equivalent rate for autonomous finance agents.
La IA generativa entró a oficinas antes queal control financiero.La cifra de 65% mide uso amplio de IA generativa, no prevalencia específica de agentes.La tendencia histórica suministrada no fue verificada de forma independiente, por lo quese usa solamente el valor reportado a comienzos de 2024.Fuentes: McKinsey & Company. (2024). The state of AI in early 2024: Gen AI adoption spikes and starts to generate value.
McKinsey reportó uso regular de IA generativa en al menos una función en 65% de las organizaciones encuestadas. La encuesta incluyó redacción, resúmenes y otros usos que no planifican ni ejecutan flujos. No permite establecer una tasa equivalente para agentes financieros autónomos.
Attention is not autonomyViewers face illuminated cubes and projected imagery in a dark installation.Sources: China's AI Agent Army: 126 Platforms, 67% Enterprise Adoption | AI in China. ainchina.com.
A compelling AI experience can draw attention without proving that a system can operate safely on its own.
La atención no es autonomíaVarias personas observan cubos iluminados e imágenes proyectadas en una instalación oscura.Fuentes: China's AI Agent Army: 126 Platforms, 67% Enterprise Adoption | AI in China. ainchina.com.
Una experiencia de IA impactante puede atraer atención sin demostrar que un sistema opere por sí solo con seguridad.
Early GPT-4 trailed humans by 77 points onGAIAApproximate performance across 466 real-world questions: humans versus an early GPT-4 system withplugins.Made for Santiago Cano Toro, by HanademiSources: Mialon, G., et al. (2024). GAIA: A benchmark for general AI assistants. International Conference on LearningRepresentations.; Liu, X., et al. (2024). AgentBench: Evaluating LLMs as agents. International Conference on LearningRepresentations.Unitpercent performanceHumans92%Early GPT-415%6.1x
GAIA set human performance near 92% and an early GPT-4 system with plugins near 15%. The gap was roughly 77 percentage points across 466 real-world questions. AgentBench separately found material capability differences across 8 environments.
GPT-4 temprano quedó 77 puntos detrás dehumanos en GAIADesempeño aproximado en 466 preguntas reales: humanos frente a un sistema temprano GPT-4 concomplementos.Made for Santiago Cano Toro, by HanademiFuentes: Mialon, G., et al. (2024). GAIA: A benchmark for general AI assistants. International Conference on LearningRepresentations.; Liu, X., et al. (2024). AgentBench: Evaluating LLMs as agents. International Conference on LearningRepresentations.Unidadporcentaje de desempeñoHumanos92 %GPT-4 temprano15 %6,1x
GAIA situó el desempeño humano cerca de 92% y el de un sistema temprano GPT-4 con complementos cerca de 15%. La brecha fue de unos 77 puntos porcentuales en 466 preguntas reales. AgentBench encontró por separado diferencias importantes de capacidad entre 8 entornos.
Less-experienced workers gained morethan twice the averageIncrease in issues resolved per hour among 5,179 support agents using generative assistance.Made for Santiago Cano Toro, by HanademiSources: Brynjolfsson, E., Li, D., & Raymond, L. R. (2023). Generative AI at work. NBER Working Paper No. 31161.; Brynjolfsson,E., Li, D., & Raymond, L. R. (2025). Generative AI at work. Quarterly Journal of Economics.Unitproductivity gainAverage14%Less experienced34%2.4x
Generative assistance increased issues resolved per hour by 14% on average. Less-experienced workers gained 34%, more than twice that average. The near-term workforce effect looks more like skill compression than immediate team elimination.
Los trabajadores menos experimentadosganaron más del dobleAumento de problemas resueltos por hora entre 5.179 agentes de soporte con asistencia generativa.Made for Santiago Cano Toro, by HanademiFuentes: Brynjolfsson, E., Li, D., & Raymond, L. R. (2023). Generative AI at work. NBER Working Paper No. 31161.;Brynjolfsson, E., Li, D., & Raymond, L. R. (2025). Generative AI at work. Quarterly Journal of Economics.Unidadganancia de productividadPromedio14 %Menos experimentados34 %2,4x
La asistencia generativa aumentó 14% en promedio los problemas resueltos por hora. Los trabajadores menos experimentados ganaron 34%, más del doble de ese promedio. El efecto laboral cercano se parece más a una compresión de habilidades que a eliminar equipos de inmediato.
Exposure reaches 38% of regionalemployment, while inadequate digitalinfrastructure may block benefits for up to17 million workers.ILO and World Bank estimates place 38% of Latin American and Caribbean employmentwithin some degree of generative-AI exposure. Inadequate digital infrastructure mayprevent up to 17 million exposed workers from realizing the benefits.Sources: Gmyrek, P., Winkler, H., & Garganta, S. (2024). Buffer or bottleneck? Employment exposure to generative AI and the digital divide in LatinAmerica. International Labour Organization and World Bank.; Generative AI and Jobs in Latin America and the Caribbean.
ILO and World Bank estimates place 38% of regional employment within some degree of generative-AI exposure, while inadequate digital infrastructure may prevent up to 17 million exposed workers from realizing the benefits.
La exposición alcanza al 38% del empleoregional, mientras la infraestructura digitalinadecuada puede impedir beneficios parahasta 17 millones de trabajadores.Las estimaciones de la OIT y el Banco Mundial sitúan al 38% del empleo latinoamericanoy caribeño bajo algún grado de exposición a IA generativa. Una infraestructura digitalinadecuada puede impedir que hasta 17 millones de trabajadores expuestos materialicenlos beneficios.Fuentes: Gmyrek, P., Winkler, H., & Garganta, S. (2024). Buffer or bottleneck? Employment exposure to generative AI and the digital divide in LatinAmerica. International Labour Organization and World Bank.; Generative AI and Jobs in Latin America and the Caribbean.
Las estimaciones de la OIT y el Banco Mundial sitúan al 38% del empleo regional bajo algún grado de exposición a IA generativa, mientras una infraestructura digital inadecuada puede impedir que hasta 17 millones de trabajadores expuestos materialicen los beneficios.
A model analyzed 78,822 articles withoutestablishing organizational agent adoption.A large corpus does not by itself answer how many firms have deployed autonomousfinance agents.Sources: doi.org.
A 2025 topic model analyzed 78,822 articles from 110 finance journals. It identified 20 topics grouped into 5 themes. The supplied evidence did not include the theme shares needed to test whether architecture research outweighs organizational adoption research.
Sources
Un modelo analizó 78.822artículos sin establecer adopciónorganizacional de agentes.Un corpus grande no responde por sí solo cuántas empresas han desplegado agentesfinancieros autónomos.Fuentes: doi.org.
Un modelo temático de 2025 analizó 78.822 artículos de 110 revistas financieras. Identificó 20 temas agrupados en 5 áreas. La evidencia suministrada no incluyó las proporciones necesarias para probar si la investigación sobre arquitecturas supera a la investigación sobre adopción organizacional.
Fuentes
A credible regional gap starts withsix recorded search elements andfive terminology families forsensitivity searches.The protocol records six reproducibility elements: databases, dates, languages, queries,screening stages and included-study counts. Sensitivity searches add five provisionalterminology families, a search-design choice rather than a universal taxonomy.Sources: Page, M. J., et al. (2021). The PRISMA 2020 statement: An updated guideline for reporting systematic reviews. BMJ, 372, n71.; Xi, Z., et al.(2023). The rise and potential of large language model based agents: A survey. arXiv:2309.07864.The six reporting elements and five terminology families are separate evidence claims and are shown in separate rows.
A regional evidence-gap claim needs a reproducible search. Record six elements: databases, dates, languages, queries, screening stages and included-study counts. Then test five provisional terminology families in sensitivity searches, keeping that vocabulary choice distinct from the reporting protocol.
Una brecha regional creíble empieza conseis elementos de búsqueda registrados ycinco familias terminológicas parabúsquedas de sensibilidad.El protocolo registra seis elementos de reproducibilidad: bases, fechas, idiomas,consultas, etapas de selección y conteos de estudios incluidos. Las búsquedas desensibilidad añaden cinco familias terminológicas provisionales, una decisión de diseño yno una taxonomía universal.Fuentes: Page, M. J., et al. (2021). The PRISMA 2020 statement: An updated guideline for reporting systematic reviews. BMJ, 372, n71.; Xi, Z., et al.(2023). The rise and potential of large language model based agents: A survey. arXiv:2309.07864.Los seis elementos de reporte y las cinco familias terminológicas son afirmaciones de evidencia separadas y se muestran en filas separadas.
Una afirmación sobre una brecha regional necesita una búsqueda reproducible. Registra seis elementos: bases, fechas, idiomas, consultas, etapas de selección y conteos de estudios incluidos. Después prueba cinco familias terminológicas provisionales en búsquedas de sensibilidad, manteniendo separada esa elección léxica del protocolo de reporte.
Argentina and Costa Rica converged asBrazil kept climbingICT-service exports as a share of service exports, Argentina, Brazil and Costa Rica, 2010 to 2025.Made for Santiago Cano Toro, by HanademiSources: World Bank. (n.d.). ICT service exports (% of service exports, BoP) [BX.GSR.CCIS.ZS]. World Bank Open Data.Unitpercent of service exports0%10%20%201020132016201920222025ArgentinaBrazilCosta RicaArgentina peaked at 24.61% in2021.Brazil reached 13.67% in 2025.
Argentina and Costa Rica led this group around 2020 and 2021. Argentina then retreated while Brazil continued climbing from a much lower base. These exports show tradable digital-service capacity, not autonomous-agent deployment.
Argentina y Costa Rica convergieronmientras Brasil siguió subiendoExportaciones de servicios TIC como proporción de exportaciones de servicios, Argentina, Brasil y CostaRica, 2010 a 2025.Made for Santiago Cano Toro, by HanademiFuentes: World Bank. (n.d.). ICT service exports (% of service exports, BoP) [BX.GSR.CCIS.ZS]. World Bank OpenData.Unidadporcentaje de exportaciones de servicios0 %10 %20 %201020132016201920222025ArgentinaBrasilCosta RicaArgentina alcanzó 24,61% en2021.Brasil alcanzó 13,67% en 2025.
Argentina y Costa Rica lideraron este grupo alrededor de 2020 y 2021. Luego Argentina retrocedió mientras Brasil siguió subiendo desde una base mucho menor. Estas exportaciones muestran capacidad de servicios digitales comercializables y no despliegue de agentes autónomos.
Colombia pulled ahead while Chile andMexico stayed below 6%ICT-service exports as a share of service exports, Chile, Colombia and Mexico, 2010 to 2025.Made for Santiago Cano Toro, by HanademiSources: World Bank. (n.d.). ICT service exports (% of service exports, BoP) [BX.GSR.CCIS.ZS]. World Bank Open Data.Unitpercent of service exports0%5%10%201020132016201920222025ChileColombiaMexicoColombia reached 11.79% in 2025.Mexico recovered to 5.09% in2025.
Colombia's ICT-service export share fell through 2019 and then recovered sharply. Chile peaked in 2021 before settling below 6%, while Mexico ended 2025 at 5.09%. Regional capacity is uneven even before agent adoption enters the question.
Colombia se alejó mientras Chile y Méxicoquedaron bajo 6%Exportaciones de servicios TIC como proporción de exportaciones de servicios, Chile, Colombia y México,2010 a 2025.Made for Santiago Cano Toro, by HanademiFuentes: World Bank. (n.d.). ICT service exports (% of service exports, BoP) [BX.GSR.CCIS.ZS]. World Bank OpenData.Unidadporcentaje de exportaciones de servicios0 %5 %10 %201020132016201920222025ChileColombiaMéxicoColombia alcanzó 11,79% en 2025.México se recuperó a 5,09% en2025.
La cuota colombiana de exportaciones de servicios TIC cayó hasta 2019 y luego se recuperó con fuerza. Chile alcanzó su máximo en 2021 antes de quedar bajo 6%, mientras México cerró 2025 en 5,09%. La capacidad regional es desigual incluso antes de considerar la adopción de agentes.
Argentina and Costa Rica nearly convergedat a 0.91-point gapAnalysis: Argentina minus Costa Rica in ICT-service exports as a share of service exports, 2010 to 2025.Made for Santiago Cano Toro, by HanademiSources: World Bank. (n.d.). ICT service exports (% of service exports, BoP) [BX.GSR.CCIS.ZS]. World Bank Open Data.Hanademi analysis: Argentina's figure minus Costa Rica's across the 16 years both series cover, from the two cited sources. ·Analysis from unrounded World Bank values.Unitpercentage-point gap0%5%201020132016201920222025Equal sharesThe gap peaked at 7.18 points in2021.The gap narrowed to 0.91 pointsin 2025.0.3%
Argentina's export share moved far ahead of Costa Rica in 2021. By 2025, Argentina stood at 15.66% and Costa Rica at 14.75%. Hanademi's recomputed result is a gap of 0.91 percentage points.
Argentina y Costa Rica casi convergieroncon una brecha de 0,91 puntosAnálisis: Argentina menos Costa Rica en exportaciones de servicios TIC como proporción de exportacionesde servicios, 2010 a 2025.Made for Santiago Cano Toro, by HanademiFuentes: World Bank. (n.d.). ICT service exports (% of service exports, BoP) [BX.GSR.CCIS.ZS]. World Bank OpenData.Análisis de Hanademi: La cifra de Argentina menos la de Costa Rica en los 16 años que ambas series cubren, a partir delas dos fuentes citadas. · Análisis con valores no redondeados del Banco Mundial.Unidadbrecha en puntos porcentuales0 %5 %201020132016201920222025Cuotas igualesLa brecha alcanzó 7,18 puntos en2021.La brecha bajó a 0,91 puntos en2025.0,3 %
La cuota exportadora de Argentina se alejó mucho de Costa Rica en 2021. En 2025, Argentina estaba en 15,66% y Costa Rica en 14,75%. El resultado recalculado por Hanademi es una brecha de 0,91 puntos porcentuales.
Brazil pulled away from Argentina andMexico after 2021ICT-service exports, current USD, Argentina, Brazil and Mexico, 2010 to 2025.Made for Santiago Cano Toro, by HanademiSources: World Bank. (n.d.). ICT service exports (BoP, current US$) [BX.GSR.CCIS.CD]. World Bank Open Data.UnitUSD$0$2B$4B$6B201020132016201920222025ArgentinaBrazilMexicoBrazil reached US$7.44 billion in2025.
Brazil reached US$7.44 billion in ICT-service exports in 2025. Mexico reached US$3.26 billion and Argentina reached US$2.83 billion. Export scale creates room for agent-enabled services, but it still does not document autonomous FP&A use.
Brasil se alejó de Argentina y Méxicodespués de 2021Exportaciones de servicios TIC, USD corrientes, Argentina, Brasil y México, 2010 a 2025.Made for Santiago Cano Toro, by HanademiFuentes: World Bank. (n.d.). ICT service exports (BoP, current US$) [BX.GSR.CCIS.CD]. World Bank Open Data.UnidadUSD$0$2 mil M$4 mil M$6 mil M201020132016201920222025ArgentinaBrasilMéxicoBrasil alcanzó US$7,44 milmillones en 2025.
Brasil alcanzó US$7,44 mil millones en exportaciones de servicios TIC en 2025. México alcanzó US$3,26 mil millones y Argentina US$2,83 mil millones. La escala exportadora abre espacio para servicios habilitados por agentes, pero todavía no documenta uso autónomo en FP&A.
Colombia and Costa Rica outgrew Chile inexport dollarsICT-service exports, current USD, Chile, Colombia and Costa Rica, 2010 to 2025.Made for Santiago Cano Toro, by HanademiSources: World Bank. (n.d.). ICT service exports (BoP, current US$) [BX.GSR.CCIS.CD]. World Bank Open Data.UnitUSD$0$1B$2B201020132016201920222025ChileColombiaCosta RicaColombia jumped to US$1.60billion in 2022.Costa Rica reached US$2.67billion in 2025.
Costa Rica grew steadily and reached US$2.67 billion in 2025. Colombia accelerated sharply after 2021 and reached US$2.31 billion. Chile also grew, but ended the period below US$1 billion.
Colombia y Costa Rica superaron a Chile endólares exportadosExportaciones de servicios TIC, USD corrientes, Chile, Colombia y Costa Rica, 2010 a 2025.Made for Santiago Cano Toro, by HanademiFuentes: World Bank. (n.d.). ICT service exports (BoP, current US$) [BX.GSR.CCIS.CD]. World Bank Open Data.UnidadUSD$0$1 mil M$2 mil M201020132016201920222025ChileColombiaCosta RicaColombia saltó a US$1,60 milmillones en 2022.Costa Rica alcanzó US$2,67 milmillones en 2025.
Costa Rica creció de forma constante y alcanzó US$2,67 mil millones en 2025. Colombia aceleró con fuerza después de 2021 y llegó a US$2,31 mil millones. Chile también creció, pero terminó el periodo por debajo de US$1 mil millones.
Uruguay built a US$1.50 billion ICT-exportbaseUruguay's ICT-service exports, current USD, 2010 to 2025.Made for Santiago Cano Toro, by HanademiSources: World Bank. (n.d.). ICT service exports (BoP, current US$) [BX.GSR.CCIS.CD]. World Bank Open Data.UnitUSD$0$500M$1B$2B20102012201420162018202020222024Exports nearly doubled toUS$0.80 billion in 2017.Uruguay reached US$1.50billion in 2025.
Uruguay's ICT-service exports rose from about US$0.21 billion in 2010 to US$1.50 billion in 2025. The sharpest break came in 2017, when exports nearly doubled from the prior year. This is a meaningful digital-service base, though it still does not measure finance-agent adoption.
Uruguay construyó una base exportadoraTIC de US$1,50 mil millonesExportaciones uruguayas de servicios TIC, USD corrientes, 2010 a 2025.Made for Santiago Cano Toro, by HanademiFuentes: World Bank. (n.d.). ICT service exports (BoP, current US$) [BX.GSR.CCIS.CD]. World Bank Open Data.UnidadUSD$0$500 M$1 mil M$2 mil M20102012201420162018202020222024Las exportaciones casi seduplicaron a US$0,80 milmillones en 2017.Uruguay alcanzó US$1,50 milmillones en 2025.
Las exportaciones uruguayas de servicios TIC subieron de unos US$0,21 mil millones en 2010 a US$1,50 mil millones en 2025. El cambio más fuerte llegó en 2017, cuando casi se duplicaron frente al año anterior. Es una base importante de servicios digitales, aunque todavía no mide adopción de agentes financieros.
Brazil's ICT-export lead reached US$4.62billionAnalysis: Brazil minus Argentina in ICT-service exports, current USD, 2010 to 2025.Made for Santiago Cano Toro, by HanademiSources: World Bank. (n.d.). ICT service exports (BoP, current US$) [BX.GSR.CCIS.CD]. World Bank Open Data.Analysis from unrounded World Bank values.UnitUSD$0$2B$4B201020132016201920222025-$799M$4.6B
Brazil trailed Argentina by about US$1.28 billion in 2011. The relationship reversed and widened quickly after 2021. Hanademi's exact inferred 2025 result is a Brazil lead of US$4,615,199,452.32.
La ventaja exportadora TIC de Brasilalcanzó US$4,62 mil millonesAnálisis: Brasil menos Argentina en exportaciones de servicios TIC, USD corrientes, 2010 a 2025.Made for Santiago Cano Toro, by HanademiFuentes: World Bank. (n.d.). ICT service exports (BoP, current US$) [BX.GSR.CCIS.CD]. World Bank Open Data.Análisis con valores no redondeados del Banco Mundial.UnidadUSD$0$2 mil M$4 mil M201020132016201920222025-$799 M$4,6 mil M
Brasil estaba cerca de US$1,28 mil millones detrás de Argentina en 2011. La relación se invirtió y se amplió rápidamente después de 2021. El resultado inferido exacto de 2025 por Hanademi es una ventaja de Brasil de US$4.615.199.452,32.
Argentina's fixed broadband expandedelevenfoldFixed broadband subscriptions per 100 people in Argentina, 2005 to 2024.Made for Santiago Cano Toro, by HanademiSources: World Bank. (n.d.). Fixed broadband subscriptions (per 100 people) [IT.NET.BBND.P2]. World Bank OpenData.Unitsubscriptions per 100 people010202005200820112014201720202023Argentina started at 2.36 per100 in 2005.Subscriptions reached 26.10per 100 in 2024.
Argentina moved from 2.36 fixed broadband subscriptions per 100 people in 2005 to 26.10 in 2024. That is roughly an elevenfold increase. The national trend shows infrastructure progress, not equal access across workers or countries.
La banda ancha fija de Argentina semultiplicó por 11Suscripciones de banda ancha fija por cada 100 personas en Argentina, 2005 a 2024.Made for Santiago Cano Toro, by HanademiFuentes: World Bank. (n.d.). Fixed broadband subscriptions (per 100 people) [IT.NET.BBND.P2]. World Bank OpenData.Unidadsuscripciones por cada 100 personas010202005200820112014201720202023Argentina empezó en 2,36 porcada 100 en 2005.Las suscripciones llegaron a26,10 por cada 100 en 2024.
Argentina pasó de 2,36 suscripciones de banda ancha fija por cada 100 personas en 2005 a 26,10 en 2024. Es un aumento aproximado de 11 veces. La tendencia nacional muestra progreso de infraestructura y no acceso igualitario entre trabajadores o países.
Mexico's R&D effort nearly halved from its2010 peakResearch and development expenditure as a share of GDP in Mexico, 2000 to 2024.Made for Santiago Cano Toro, by HanademiSources: World Bank. (n.d.). Research and development expenditure (% of GDP) [GB.XPD.RSDV.GD.ZS]. World Bank Open Data.Unitpercent of GDP0.0%0.2%0.4%2000200420082012201620202024R&D peaked at 0.47% of GDP in2010.The share fell to 0.25% in 2024.0.3%
Mexico's R&D expenditure peaked at 0.47% of GDP in 2010. By 2024 it had fallen to 0.25%, close to half the peak share. This does not prove a shortage of agentic-FP&A studies, but it shows a weaker national research-investment base.
El esfuerzo de I+D de México casi se redujoa la mitadGasto en investigación y desarrollo como proporción del PIB en México, 2000 a 2024.Made for Santiago Cano Toro, by HanademiFuentes: World Bank. (n.d.). Research and development expenditure (% of GDP) [GB.XPD.RSDV.GD.ZS]. World Bank Open Data.Unidadporcentaje del PIB0,0 %0,2 %0,4 %2000200420082012201620202024La I+D alcanzó 0,47% del PIB en2010.La proporción cayó a 0,25% en2024.0,3 %
El gasto de México en I+D alcanzó un máximo de 0,47% del PIB en 2010. Para 2024 había caído a 0,25%, cerca de la mitad de la proporción máxima. Esto no demuestra escasez de estudios sobre FP&A agéntico, pero muestra una base nacional más débil de inversión en investigación.
Argentina's service economy grew as wagework slippedServices employment and wage or salaried work as shares of total employment in Argentina, 2000 to2025.Made for Santiago Cano Toro, by HanademiSources: World Bank. (n.d.). Employment in services (% of total employment) (modeled ILO estimate) [SL.SRV.EMPL.ZS].World Bank Open Data.; World Bank. (n.d.). Wage and salaried workers, total (% of total employment) (modeled ILO estimate)[SL.EMP.WORK.ZS]. World Bank Open Data.Unitpercent of employment70%75%2000200420082012201620202024Employmentin servicesWage andsalariedworkersWage work peaked at 77.00% in2012.Services reached 71.81% in 2025.
Argentina's service-employment share rose from 67.62% in 2000 to 71.81% in 2025. Wage and salaried work peaked at 77.00% in 2012 before easing to 74.42%. Finance agents will enter a large service economy whose employment structure is already changing.
Los servicios crecieron en Argentinamientras cedió el trabajo asalariadoEmpleo en servicios y trabajo asalariado como proporciones del empleo total en Argentina, 2000 a 2025.Made for Santiago Cano Toro, by HanademiFuentes: World Bank. (n.d.). Employment in services (% of total employment) (modeled ILO estimate) [SL.SRV.EMPL.ZS]. WorldBank Open Data.; World Bank. (n.d.). Wage and salaried workers, total (% of total employment) (modeled ILO estimate)[SL.EMP.WORK.ZS]. World Bank Open Data.Unidadporcentaje del empleo70 %75 %2000200420082012201620202024Empleo enserviciosTrabajadoresasalariadosEl trabajo asalariado alcanzó77,00% en 2012.Los servicios alcanzaron 71,81%en 2025.
La proporción argentina de empleo en servicios subió de 67,62% en 2000 a 71,81% en 2025. El trabajo asalariado alcanzó 77,00% en 2012 antes de bajar a 74,42%. Los agentes financieros entrarán en una gran economía de servicios cuya estructura laboral ya está cambiando.
Argentina's output per worker remainsbelow its 2011 peakGDP per person employed in Argentina, constant 2021 PPP USD, 2000 to 2025.Made for Santiago Cano Toro, by HanademiSources: World Bank. (n.d.). GDP per person employed (constant 2021 PPP $) [SL.GDP.PCAP.EM.KD]. World Bank Open Data.Unitconstant 2021 PPP USD$50K$60K$70K2000200420082012201620202024Output peaked near US$70.15Kin 2011.The 2025 value wasUS$61.33K.
Argentina's GDP per person employed peaked near US$70,154 in 2011. The 2025 value was about US$61,326, still well below that high. A 14% gain in one support workflow cannot be treated as a forecast for national productivity.
La producción por trabajador en Argentinasigue bajo su máximo de 2011PIB por persona empleada en Argentina, USD PPA constantes de 2021, 2000 a 2025.Made for Santiago Cano Toro, by HanademiFuentes: World Bank. (n.d.). GDP per person employed (constant 2021 PPP $) [SL.GDP.PCAP.EM.KD]. World Bank OpenData.UnidadUSD PPA constantes de 2021$50K$60K$70K2000200420082012201620202024La producción alcanzó cerca deUS$70,15K en 2011.El valor de 2025 fueUS$61,33K.
El PIB por persona empleada en Argentina alcanzó cerca de US$70.154 en 2011. El valor de 2025 fue aproximadamente US$61.326, todavía muy por debajo de ese máximo. Una ganancia de 14% en un flujo de soporte no puede tratarse como pronóstico de productividad nacional.
1 human decision-maker retained control ofcustomer interactions and chose whichrecommendations to use.The cited evidence records 1 retained human decision-maker, separating this field studyfrom autonomous execution.Sources: Brynjolfsson, E., Li, D., & Raymond, L. R. (2023). Generative AI at work. NBER Working Paper No. 31161.; Generative AI at Work.
The support-agent study produced meaningful productivity gains, but 1 human decision-maker retained control of customer interactions. That person decided whether and how to use the system's recommendations. The strongest adjacent evidence therefore supports assisted judgment, not unsupervised agency.
1 responsable humano conservó el controlde las interacciones con clientes y eligióqué recomendaciones utilizar.La evidencia citada registra 1 responsable humano conservado, lo que separa esteestudio de campo de la ejecución autónoma.Fuentes: Brynjolfsson, E., Li, D., & Raymond, L. R. (2023). Generative AI at work. NBER Working Paper No. 31161.; Generative AI at Work.
El estudio de agentes de soporte produjo ganancias importantes de productividad, pero 1 responsable humano conservó el control de las interacciones con clientes. Esa persona decidió si usar las recomendaciones del sistema y cómo hacerlo. La evidencia adyacente más sólida apoya el juicio asistido y no la agencia sin supervisión.
Human judgment closes the loopA suited man examines an open folder in an office overlooking buildings and water.Sources: No New AI Rules for Financial Reporting. Here's... | Nexairi. nexairi.com.
Finance agents can assemble evidence, but a person should retain the authority to review and decide.
El juicio humano cierra el cicloUn hombre con traje examina una carpeta abierta en una oficina con vistas a edificios y agua.Fuentes: No New AI Rules for Financial Reporting. Here's... | Nexairi. nexairi.com.
Los agentes financieros pueden reunir evidencia, pero una persona debe conservar la autoridad para revisar y decidir.
In summaryMade for Santiago Cano Toro, by HanademiSources: povertyactionlab.org.; ar5iv.labs.arxiv.org.; Liu, X., et al. (2024). AgentBench: Evaluating LLMs as agents. International Conference onLearning Representations.; Wang, L., et al. (2023). A survey on large language model based autonomous agents. arXiv:2308.11432. Subsequentlypublished in Frontiers of Computer Science.India’s Smartcards reduced payment leakages by more than 40% without changing official government disbursements.A production-agent study surveyed 306 practitioners and conducted 20 case studies across 26 domains.India’s Smartcard payment system generated an estimated US$4.5 million in aggregate time savings.AgentBench evaluates agents in eight environments, showing that capability varies materially by task and interface.Wang et al. organize LLM agents around four components: profile, memory, planning and action.
The value of the research is not only what each source knew, but what became visible when their evidence was combined.
En resumenMade for Santiago Cano Toro, by HanademiFuentes: povertyactionlab.org.; ar5iv.labs.arxiv.org.; Liu, X., et al. (2024). AgentBench: Evaluating LLMs as agents. International Conference onLearning Representations.; Wang, L., et al. (2023). A survey on large language model based autonomous agents. arXiv:2308.11432. Subsequentlypublished in Frontiers of Computer Science.Las tarjetas inteligentes de India redujeron las fugas de pagos en más de 40% sin modificar los desembolsos oficiales del gobierno.Un estudio sobre agentes en producción encuestó a 306 profesionales y realizó 20 estudios de caso en 26 ámbitos.El sistema indio de pagos con tarjetas inteligentes generó un ahorro agregado de tiempo estimado en US$4,5 millones.AgentBench evalúa agentes en ocho entornos, mostrando que la capacidad varía materialmente según la tarea y la interfaz.Wang et al. organizan los agentes basados en LLM alrededor de cuatro componentes: perfil, memoria, planificación y acción.
El valor de la investigación no está solo en cada fuente, sino en lo que apareció al combinar sus evidencias.

The research behind this deck

AI improved speed, output and quality inside its competence boundary. The key distinction is assistance versus authority to act.

Key findings

The argument

This research is published in English and Spanish. Ver en español

La investigación detrás de esta presentación

La IA mejoró velocidad, producción y calidad dentro de su competencia. La distinción clave es asistencia frente a autoridad para actuar.

Hallazgos clave

El argumento

Esta investigación se publica en inglés y español. Read in English