In an experiment with 758 consultants, GPT-4 users finished 12.2% more tasks and worked 25.1% faster. Their work received quality ratings over 40% higher. On a task outside the measured competence boundary, however, users were 19 percentage points less likely to answer correctly.
En un experimento con 758 consultores, los usuarios de GPT-4 completaron 12,2% más tareas y trabajaron 25,1% más rápido. Su trabajo recibió evaluaciones de calidad más de 40% superiores. Sin embargo, en una tarea fuera del límite de competencia medido, los usuarios tuvieron 19 puntos porcentuales menos de probabilidad de acertar.
FP&A covers budgets, forecasts and decisions. RPA repeats known rules, while an LLM interprets language. An agent adds memory, planning and action, which raises a new question about who controls the final step.
FP&A cubre presupuestos, pronósticos y decisiones. RPA repite reglas conocidas, mientras un LLM interpreta lenguaje. Un agente añade memoria, planificación y acción, lo que plantea una nueva pregunta sobre quién controla el paso final.
Classic automation works best when the input and rule are known. FP&A is harder because one answer may require reading a narrative, finding values in a table and performing a calculation. TAT-QA alone contains 16,552 such items.
La automatización clásica funciona mejor cuando la entrada y la regla ya se conocen. FP&A es más difícil porque una respuesta puede exigir leer una narrativa, encontrar valores en una tabla y realizar un cálculo. TAT-QA contiene por sí sola 16.552 elementos de este tipo.
A finance answer is only the visible tip; the larger burden is the data, assumptions and exceptions underneath.
Una respuesta financiera es solo la punta visible; debajo están los datos, los supuestos y las excepciones.
Accounting RPA research repeatedly points to standardized rules, structured inputs and manageable exceptions. That resembles a dishwasher running a known cycle. Unusual objects still require human handling.
La investigación sobre RPA contable señala repetidamente reglas estandarizadas, entradas estructuradas y excepciones manejables. Se parece a un lavavajillas que ejecuta un ciclo conocido. Los objetos inusuales todavía requieren intervención humana.
Standardization is not merely an efficiency project. China's staggered digital invoicing reform increased firms' effective tax rates by an average 0.91 percentage points. A standardized transaction layer can change financial outcomes, not only processing speed.
La estandarización no es solamente un proyecto de eficiencia. La implementación escalonada de la facturación digital en China aumentó en promedio 0,91 puntos porcentuales las tasas efectivas de las empresas. Una capa transaccional estandarizada puede cambiar resultados financieros y no solamente la velocidad.
Fluent conversation does not define an agent. Wang and colleagues organize agents around profile, memory, planning and action. Firms can still require human approval before payments, accounting entries or published forecasts.
La conversación fluida no define a un agente. Wang y sus colegas organizan los agentes alrededor de perfil, memoria, planificación y acción. Las empresas todavía pueden exigir aprobación humana antes de pagos, registros contables o pronósticos publicados.
Once an agent can act, every connection becomes another path requiring permissions, monitoring and recovery.
Cuando un agente puede actuar, cada conexión se convierte en otra ruta que exige permisos, monitoreo y recuperación.
A field study surveyed 277 professional accountants. It found substantial variation in adoption patterns, benefits and concerns. One organizational adoption rate cannot describe a profession experiencing generative AI in very different ways.
Un estudio de campo encuestó a 277 profesionales contables. Encontró diferencias importantes en patrones de adopción, beneficios y preocupaciones. Una sola tasa organizacional no puede describir una profesión que vive la IA generativa de maneras muy distintas.
Labels compress different operating models into one word. The evidence is separate: three survey dimensions, four overlapping labels, 306 practitioners, 20 cases across 26 domains, and 30 indexed deployments. None alone proves autonomous capability.
Las etiquetas comprimen distintos modelos operativos en una sola palabra. La evidencia está separada: tres dimensiones de revisión, cuatro etiquetas superpuestas, 306 profesionales, 20 casos en 26 ámbitos y 30 despliegues indexados. Ninguna prueba por sí sola la capacidad autónoma.
The proposed test asks whether a system can perceive, set objectives, plan, act, evaluate and interact. That resembles judging an employee by completed work rather than confident speech. The framework is useful for screening claims, but it remains an unpublished research design.
La prueba propuesta pregunta si un sistema puede percibir, fijar objetivos, planificar, actuar, evaluar e interactuar. Se parece a juzgar a un empleado por el trabajo completado y no por un discurso seguro. El marco es útil para evaluar afirmaciones, pero sigue siendo un diseño de investigación no publicado.
A step that succeeds 95% of the time sounds reliable. Under an independence assumption, 10 such steps produce only 59.9% end-to-end reliability. At 20 steps, the figure falls to 35.8%.
Un paso que acierta 95% de las veces parece confiable. Bajo un supuesto de independencia, 10 pasos producen solamente 59,9% de confiabilidad total. Con 20 pasos, la cifra cae a 35,8%.
India's Smartcards reduced payment leakages by more than 40%. After two years, they processed 50% of payments in treated areas because enrollment was difficult. The same study estimated US$4.5 million in aggregate time savings.
Las tarjetas inteligentes de India redujeron las fugas de pagos en más de 40%. Después de dos años, procesaban 50% de los pagos en las zonas tratadas porque la inscripción era difícil. El mismo estudio estimó US$4,5 millones en ahorro agregado de tiempo.
McKinsey reported regular generative-AI use in at least one function at 65% of surveyed organizations. The survey included writing, summarization and other uses that do not plan or execute workflows. It cannot establish an equivalent rate for autonomous finance agents.
McKinsey reportó uso regular de IA generativa en al menos una función en 65% de las organizaciones encuestadas. La encuesta incluyó redacción, resúmenes y otros usos que no planifican ni ejecutan flujos. No permite establecer una tasa equivalente para agentes financieros autónomos.
A compelling AI experience can draw attention without proving that a system can operate safely on its own.
Una experiencia de IA impactante puede atraer atención sin demostrar que un sistema opere por sí solo con seguridad.
GAIA set human performance near 92% and an early GPT-4 system with plugins near 15%. The gap was roughly 77 percentage points across 466 real-world questions. AgentBench separately found material capability differences across 8 environments.
GAIA situó el desempeño humano cerca de 92% y el de un sistema temprano GPT-4 con complementos cerca de 15%. La brecha fue de unos 77 puntos porcentuales en 466 preguntas reales. AgentBench encontró por separado diferencias importantes de capacidad entre 8 entornos.
Generative assistance increased issues resolved per hour by 14% on average. Less-experienced workers gained 34%, more than twice that average. The near-term workforce effect looks more like skill compression than immediate team elimination.
La asistencia generativa aumentó 14% en promedio los problemas resueltos por hora. Los trabajadores menos experimentados ganaron 34%, más del doble de ese promedio. El efecto laboral cercano se parece más a una compresión de habilidades que a eliminar equipos de inmediato.
ILO and World Bank estimates place 38% of regional employment within some degree of generative-AI exposure, while inadequate digital infrastructure may prevent up to 17 million exposed workers from realizing the benefits.
Las estimaciones de la OIT y el Banco Mundial sitúan al 38% del empleo regional bajo algún grado de exposición a IA generativa, mientras una infraestructura digital inadecuada puede impedir que hasta 17 millones de trabajadores expuestos materialicen los beneficios.
A 2025 topic model analyzed 78,822 articles from 110 finance journals. It identified 20 topics grouped into 5 themes. The supplied evidence did not include the theme shares needed to test whether architecture research outweighs organizational adoption research.
Un modelo temático de 2025 analizó 78.822 artículos de 110 revistas financieras. Identificó 20 temas agrupados en 5 áreas. La evidencia suministrada no incluyó las proporciones necesarias para probar si la investigación sobre arquitecturas supera a la investigación sobre adopción organizacional.
A regional evidence-gap claim needs a reproducible search. Record six elements: databases, dates, languages, queries, screening stages and included-study counts. Then test five provisional terminology families in sensitivity searches, keeping that vocabulary choice distinct from the reporting protocol.
Una afirmación sobre una brecha regional necesita una búsqueda reproducible. Registra seis elementos: bases, fechas, idiomas, consultas, etapas de selección y conteos de estudios incluidos. Después prueba cinco familias terminológicas provisionales en búsquedas de sensibilidad, manteniendo separada esa elección léxica del protocolo de reporte.
Argentina and Costa Rica led this group around 2020 and 2021. Argentina then retreated while Brazil continued climbing from a much lower base. These exports show tradable digital-service capacity, not autonomous-agent deployment.
Argentina y Costa Rica lideraron este grupo alrededor de 2020 y 2021. Luego Argentina retrocedió mientras Brasil siguió subiendo desde una base mucho menor. Estas exportaciones muestran capacidad de servicios digitales comercializables y no despliegue de agentes autónomos.
Colombia's ICT-service export share fell through 2019 and then recovered sharply. Chile peaked in 2021 before settling below 6%, while Mexico ended 2025 at 5.09%. Regional capacity is uneven even before agent adoption enters the question.
La cuota colombiana de exportaciones de servicios TIC cayó hasta 2019 y luego se recuperó con fuerza. Chile alcanzó su máximo en 2021 antes de quedar bajo 6%, mientras México cerró 2025 en 5,09%. La capacidad regional es desigual incluso antes de considerar la adopción de agentes.
Argentina's export share moved far ahead of Costa Rica in 2021. By 2025, Argentina stood at 15.66% and Costa Rica at 14.75%. Hanademi's recomputed result is a gap of 0.91 percentage points.
La cuota exportadora de Argentina se alejó mucho de Costa Rica en 2021. En 2025, Argentina estaba en 15,66% y Costa Rica en 14,75%. El resultado recalculado por Hanademi es una brecha de 0,91 puntos porcentuales.
Brazil reached US$7.44 billion in ICT-service exports in 2025. Mexico reached US$3.26 billion and Argentina reached US$2.83 billion. Export scale creates room for agent-enabled services, but it still does not document autonomous FP&A use.
Brasil alcanzó US$7,44 mil millones en exportaciones de servicios TIC en 2025. México alcanzó US$3,26 mil millones y Argentina US$2,83 mil millones. La escala exportadora abre espacio para servicios habilitados por agentes, pero todavía no documenta uso autónomo en FP&A.
Costa Rica grew steadily and reached US$2.67 billion in 2025. Colombia accelerated sharply after 2021 and reached US$2.31 billion. Chile also grew, but ended the period below US$1 billion.
Costa Rica creció de forma constante y alcanzó US$2,67 mil millones en 2025. Colombia aceleró con fuerza después de 2021 y llegó a US$2,31 mil millones. Chile también creció, pero terminó el periodo por debajo de US$1 mil millones.
Uruguay's ICT-service exports rose from about US$0.21 billion in 2010 to US$1.50 billion in 2025. The sharpest break came in 2017, when exports nearly doubled from the prior year. This is a meaningful digital-service base, though it still does not measure finance-agent adoption.
Las exportaciones uruguayas de servicios TIC subieron de unos US$0,21 mil millones en 2010 a US$1,50 mil millones en 2025. El cambio más fuerte llegó en 2017, cuando casi se duplicaron frente al año anterior. Es una base importante de servicios digitales, aunque todavía no mide adopción de agentes financieros.
Brazil trailed Argentina by about US$1.28 billion in 2011. The relationship reversed and widened quickly after 2021. Hanademi's exact inferred 2025 result is a Brazil lead of US$4,615,199,452.32.
Brasil estaba cerca de US$1,28 mil millones detrás de Argentina en 2011. La relación se invirtió y se amplió rápidamente después de 2021. El resultado inferido exacto de 2025 por Hanademi es una ventaja de Brasil de US$4.615.199.452,32.
Argentina moved from 2.36 fixed broadband subscriptions per 100 people in 2005 to 26.10 in 2024. That is roughly an elevenfold increase. The national trend shows infrastructure progress, not equal access across workers or countries.
Argentina pasó de 2,36 suscripciones de banda ancha fija por cada 100 personas en 2005 a 26,10 en 2024. Es un aumento aproximado de 11 veces. La tendencia nacional muestra progreso de infraestructura y no acceso igualitario entre trabajadores o países.
Mexico's R&D expenditure peaked at 0.47% of GDP in 2010. By 2024 it had fallen to 0.25%, close to half the peak share. This does not prove a shortage of agentic-FP&A studies, but it shows a weaker national research-investment base.
El gasto de México en I+D alcanzó un máximo de 0,47% del PIB en 2010. Para 2024 había caído a 0,25%, cerca de la mitad de la proporción máxima. Esto no demuestra escasez de estudios sobre FP&A agéntico, pero muestra una base nacional más débil de inversión en investigación.
Argentina's service-employment share rose from 67.62% in 2000 to 71.81% in 2025. Wage and salaried work peaked at 77.00% in 2012 before easing to 74.42%. Finance agents will enter a large service economy whose employment structure is already changing.
La proporción argentina de empleo en servicios subió de 67,62% en 2000 a 71,81% en 2025. El trabajo asalariado alcanzó 77,00% en 2012 antes de bajar a 74,42%. Los agentes financieros entrarán en una gran economía de servicios cuya estructura laboral ya está cambiando.
Argentina's GDP per person employed peaked near US$70,154 in 2011. The 2025 value was about US$61,326, still well below that high. A 14% gain in one support workflow cannot be treated as a forecast for national productivity.
El PIB por persona empleada en Argentina alcanzó cerca de US$70.154 en 2011. El valor de 2025 fue aproximadamente US$61.326, todavía muy por debajo de ese máximo. Una ganancia de 14% en un flujo de soporte no puede tratarse como pronóstico de productividad nacional.
The support-agent study produced meaningful productivity gains, but 1 human decision-maker retained control of customer interactions. That person decided whether and how to use the system's recommendations. The strongest adjacent evidence therefore supports assisted judgment, not unsupervised agency.
El estudio de agentes de soporte produjo ganancias importantes de productividad, pero 1 responsable humano conservó el control de las interacciones con clientes. Esa persona decidió si usar las recomendaciones del sistema y cómo hacerlo. La evidencia adyacente más sólida apoya el juicio asistido y no la agencia sin supervisión.
On a task outside GPT-4's measured frontier, AI users were 19 percentage points less likely to produce the correct answer. Harvard Business School
ICT service exports: the gap between Argentina and Costa Rica reached 0.9 % of service exports, BoP in 2025. World Bank Open Data
ICT service exports: the gap between Brazil and Argentina reached 4615199452 BoP, current US$ in 2025. World Bank Open Data
If ten independent workflow steps are each 95% reliable, end-to-end reliability falls mathematically to 59.9%.
The preliminary review found zero peer-reviewed field studies measuring autonomous-agent accuracy or financial returns inside an EOR provider.
A field study of 5,179 support agents found that generative assistance increased issues resolved per hour by 14% on average. National Bureau of Economic Research
Among 758 consultants, GPT-4 users completed 12.2% more tasks, worked 25.1% faster and produced results rated over 40% higher in quality. Harvard Business School
En una tarea fuera de la frontera medida de GPT-4, los usuarios de IA tuvieron 19 puntos porcentuales menos de probabilidad de producir la respuesta correcta. Harvard Business School
ICT service exports: la brecha entre Argentina y Costa Rica alcanzó 0,9 % of service exports, BoP en 2025. World Bank Open Data
ICT service exports: la brecha entre Brazil y Argentina alcanzó 4615199452 BoP, current US$ en 2025. World Bank Open Data
Si diez pasos independientes de un flujo tienen cada uno 95% de confiabilidad, la confiabilidad total cae matemáticamente a 59,9%.
La revisión preliminar encontró cero estudios de campo revisados por pares que midieran precisión o retorno financiero de agentes autónomos dentro de un proveedor EOR.
Un estudio de campo con 5.179 agentes de soporte encontró que la asistencia generativa aumentó 14% los problemas resueltos por hora en promedio. National Bureau of Economic Research
Entre 758 consultores, los usuarios de GPT-4 completaron 12,2% más tareas, trabajaron 25,1% más rápido y produjeron resultados evaluados más de 40% mejor. Harvard Business School
Hasta 17 millones de trabajadores latinoamericanos expuestos podrían no materializar beneficios de la IA generativa debido a infraestructura digital inadecuada. International Labour Organization and World Bank
Las tarjetas inteligentes de India redujeron las fugas de pagos en más de 40% sin modificar los desembolsos oficiales del gobierno. povertyactionlab.org
McKinsey reportó uso regular de IA generativa en al menos una función empresarial por 65% de las organizaciones encuestadas a comienzos de 2024. McKinsey & Company
Todavía no se identifica un conjunto latinoamericano multiempresa verificado que aísle la adopción de agentes autónomos en FP&A de BPO.
El argumento
FP&A exige lenguaje y aritmética dentro de la misma respuesta.
La automatización funciona mejor cuando primero se reduce la variación.
La reforma china de facturación digital elevó 0,91 puntos las tasas efectivas.
Un modelo aconseja; un agente puede recordar, planificar y ejecutar.
Una encuesta a 277 contadores encontró experiencias muy distintas con IA.
Una etiqueta no es una prueba de capacidad.
Esta investigación se publica en inglés y español. Read in English