This is the opening fact to keep in mind. ChatGPT did not merely miss a few tricky prompts. Across 28,085 accounting questions, students averaged 76.7% while ChatGPT averaged 47.4%. That gap makes reliability the starting point for any financial planning agent.
Este es el dato que conviene recordar. ChatGPT no falló solo en unas pocas preguntas difíciles. En 28.085 preguntas contables, los estudiantes promediaron 76,7% y ChatGPT 47,4%. Esa brecha convierte la fiabilidad en el punto de partida para cualquier agente de planificación financiera.
3 términos técnicos sostienen buena parte del argumento.
Automation can make a process faster without making its decisions better. A defective rule still produces defective output at higher speed. That is why financial agents need control design, not only execution speed.
La automatización puede acelerar un proceso sin mejorar sus decisiones. Una regla defectuosa sigue produciendo resultados defectuosos, solo que más rápido. Por eso los agentes financieros necesitan diseño de controles, no solo velocidad de ejecución.
Automation is not neutral when it standardizes the information flowing through a system. China's staggered e-invoicing reform was followed by a 0.91 percentage-point rise in firms' effective tax rates. The lesson is that process design can change outcomes.
La automatización no es neutral cuando estandariza la información que circula por un sistema. La implementación escalonada de la factura electrónica en China fue seguida por un aumento de 0,91 puntos porcentuales en las tasas efectivas de las empresas. La lección es que el diseño del proceso puede cambiar los resultados.
There is no single adoption story among accounting professionals. A 2026 study of 277 accountants found substantial variation in use, perceived benefits and concerns. Any finance rollout has to expect uneven readiness.
No existe una sola historia de adopción entre los profesionales contables. Un estudio de 2026 sobre 277 contadores encontró una variación importante en uso, beneficios percibidos y preocupaciones. Cualquier implementación financiera debe prever una preparación desigual.
The literature is moving quickly on GenAI. Peer-reviewed syntheses from 2023 and 2024 describe rapid growth while leaving organizational implementation questions unresolved. That mismatch is the gap between a capable model and a dependable finance system.
La literatura sobre GenAI avanza rápidamente. Síntesis revisadas por pares de 2023 y 2024 describen un crecimiento veloz mientras dejan sin resolver preguntas de implementación organizacional. Esa diferencia separa un modelo capaz de un sistema financiero confiable.
One record is now traceable to volume 13, issue 3, dated September 2025. That helps locate the article, but it does not settle whether the source is peer reviewed. Verification must come before using it as organizational evidence.
Un registro permite ubicar el artículo en el volumen 13, número 3, con fecha de septiembre de 2025. Eso ayuda a localizarlo, pero no resuelve si la fuente fue revisada por pares. La verificación debe preceder a su uso como evidencia organizacional.
The workplace is not adopting GenAI evenly. Across 35 European countries, the average was 12%, but reported levels ranged from under 3% to 25%. That spread makes adoption a management question, not a settled baseline.
El lugar de trabajo no está adoptando GenAI de manera uniforme. En 35 países europeos, el promedio fue 12%, pero los niveles reportados variaron desde menos de 3% hasta 25%. Esa diferencia convierte la adopción en una cuestión de gestión, no en una base consolidada.
The evidence base is much broader outside academia. The review counts 355 non-academic sources against 14 academic ones, with 587 versus 93 use cases. The pattern is clear, but the counts come from figure extraction and should be read with that limit in mind.
La base de evidencia es mucho más amplia fuera de la academia. La revisión cuenta 355 fuentes no académicas frente a 14 académicas, con 587 frente a 93 casos de uso. El patrón es claro, pero los conteos provienen de la extracción de una figura y deben leerse con ese límite.
The date matters because the archival survey replaces reliance on an earlier manuscript citation. The usable publication year is 2024. That gives the agent definition a firmer bibliographic anchor.
La fecha importa porque la revisión archivada reemplaza la dependencia de una cita anterior del manuscrito. El año de publicación utilizable es 2024. Eso da una base bibliográfica más firme a la definición de agente.
The boundary is operational, not cosmetic. A system that stops after 1 prompt-response cycle is a generative assistant. Calling it an autonomous agent would blur the capability the review needs to measure.
La frontera es operativa, no estética. Un sistema que se detiene después de 1 ciclo de instrucción y respuesta es un asistente generativo. Llamarlo agente autónomo confundiría la capacidad que la revisión necesita medir.
A cost objective becomes meaningful only when its constraint is explicit. Uzbekistan directed 19 strategic state enterprises to cut production costs by 10% to 20% without reducing output. That is the kind of measurable boundary an agent objective would need.
Un objetivo de costos solo adquiere sentido cuando su restricción está clara. Uzbekistán ordenó a 19 empresas estatales estratégicas reducir los costos de producción entre 10% y 20% sin disminuir la producción. Ese es el tipo de límite medible que necesitaría un objetivo para un agente.
A second pass is not automatically an independent check. If one model writes the answer and reviews it, both steps can carry the same mistake. That is why financial workflows need validation outside the generating model.
Una segunda pasada no es automáticamente una revisión independiente. Si un modelo escribe la respuesta y también la revisa, ambos pasos pueden cargar el mismo error. Por eso los flujos financieros necesitan validación fuera del modelo generador.
A system reviewing its own output can preserve the same blind spot, so independent checks remain essential.
Un sistema que revisa su propio resultado puede conservar el mismo punto ciego, por lo que los controles independientes siguen siendo esenciales.
This is the cleanest evidence that generative assistance can help in bounded knowledge work. Among 453 professionals, people finished 40% faster and rated the work 18% higher. The same experiment also found a narrower performance gap, though no size for that reduction is supplied here.
Esta es la evidencia más clara de que la asistencia generativa puede ayudar en trabajo intelectual delimitado. Entre 453 profesionales, las personas terminaron 40% más rápido y valoraron el trabajo 18% mejor. El mismo experimento también encontró una brecha de desempeño menor, aunque aquí no se aporta el tamaño de esa reducción.
The average result was useful, but the distribution matters more. Productivity rose 14% across the support workforce and about 34% among less-skilled and less-experienced workers. Assistance helped the people furthest from the top catch up fastest.
El resultado medio fue útil, pero importa más cómo se distribuyó. La productividad subió 14% en toda la fuerza de soporte y cerca de 34% entre los trabajadores menos calificados y experimentados. La asistencia ayudó a avanzar más rápido a quienes estaban más lejos del nivel superior.
The evidence gap is specific, not abstract. Four high-quality adjacent studies were reviewed, and 0 directly tested agentic FP&A in Latin American outsourcing firms. That means the case for deployment still needs local, domain-matched validation.
La brecha de evidencia es específica, no abstracta. Se revisaron 4 estudios adyacentes de alta calidad y 0 probaron directamente el FP&A agéntico en empresas latinoamericanas de tercerización. Por eso la decisión de desplegarlo aún necesita validación local y ajustada al dominio.
A text error can produce a bad memo. A tool-enabled error can reach a system that changes something in the world. The supplied security evidence identifies 3 attack surfaces, so execution rights deserve tighter controls than text generation.
Un error de texto puede producir un mal memorando. Un error con acceso a herramientas puede llegar a un sistema y cambiar algo en el mundo. La evidencia de seguridad suministrada identifica 3 superficies de ataque, por lo que los derechos de ejecución merecen controles más estrictos que la generación de texto.
The evidence supports bounded productivity gains, not autonomous FP&A. The argument moves from accounting reality to agent boundaries, measured benefits, capability gaps and the controls required before financial execution.
Key findings
The meta-analysis found human-AI combinations relatively stronger in content creation than in decision tasks.
In the support study, less-skilled and less-experienced workers received productivity gains of about 34% from generative assistance. Oxford University Press
Yordanova and Hristozov’s article is listed in volume 13, issue 3, dated September 2025. reference-global.com
Ten independent steps, each 90% reliable, produce only 34.9% end-to-end reliability.
Generative Agents simulated 25 interacting agents whose stored experiences influenced later plans and social behavior. Association for Computing Machinery
A field study of 5,172 support agents found generative assistance increased resolved issues per hour by 14% on average. Oxford University Press
Across assessments contributed by 186 institutions, ChatGPT averaged 47.4%, while students averaged 76.7%. researchspace.auckland.ac.nz
The accounting study evaluated ChatGPT on 28,085 questions, limiting dependence on a few favorable prompts. pdxscholar.library.pdx.edu
A 2024 meta-analysis synthesized 106 experiments comparing humans, AI and human-AI combinations. nature.com
Tool-integrated LLM systems expose at least 3 attack surfaces: retrieved content, generated tool instructions and action permissions. Association for Computing Machinery
The argument
ChatGPT scored 47.4% on accounting assessments versus 76.7% for students across 28,085 questions.
Accounting automation can improve compliance while preserving bad rules, sources or controls.
Workplace GenAI adoption averaged 12% across 35 European countries, with wide variation.
A single prompt-response cycle is an assistant, not an autonomous agent.
Bounded experiments found 40% faster completion and 18% higher rated quality.
Support productivity rose 14% on average and about 34% for less-skilled workers.
Across 106 experiments, human-AI combinations performed better in creation than in decisions.
No reviewed adjacent study directly tested agentic FP&A in Latin American outsourcing firms.
Tool-connected systems add attack surfaces across retrieval, instructions and action permissions.
This research is published in English and Spanish. Ver en español
La investigación detrás de esta presentación
La evidencia respalda mejoras de productividad delimitadas, no FP&A autónomo. El argumento avanza desde la realidad contable hasta los límites de agencia, los beneficios medidos, las brechas de capacidad y los controles necesarios antes de ejecutar acciones financieras.
Hallazgos clave
El metaanálisis encontró combinaciones humano-IA relativamente más fuertes en creación de contenido que en tareas de decisión.
En el estudio de soporte, los trabajadores menos calificados y experimentados obtuvieron ganancias de productividad cercanas al 34%. Oxford University Press
El artículo de Yordanova y Hristozov figura en el volumen 13, número 3, con fecha de septiembre de 2025. reference-global.com
Diez pasos independientes, cada uno con 90% de confiabilidad, producen solo 34,9% de confiabilidad integral.
Generative Agents simuló 25 agentes interactivos cuyas experiencias almacenadas influyeron en planes y comportamiento social posteriores. Association for Computing Machinery
Un estudio de campo con 5.172 agentes de soporte encontró que la asistencia generativa elevó 14% los casos resueltos por hora. Oxford University Press
En evaluaciones aportadas por 186 instituciones, ChatGPT promedió 47,4%, mientras los estudiantes promediaron 76,7%. researchspace.auckland.ac.nz
El estudio contable evaluó ChatGPT con 28.085 preguntas, limitando la dependencia de unas pocas instrucciones favorables. pdxscholar.library.pdx.edu
Un metaanálisis de 2024 sintetizó 106 experimentos que compararon humanos, IA y combinaciones entre ambos. nature.com
Los sistemas LLM integrados con herramientas exponen al menos 3 superficies: contenido recuperado, instrucciones generadas y permisos de acción. Association for Computing Machinery
El argumento
ChatGPT obtuvo 47,4% en evaluaciones contables frente a 76,7% de los estudiantes en 28.085 preguntas.
La automatización contable puede mejorar el cumplimiento y conservar reglas, fuentes o controles defectuosos.
La adopción laboral de GenAI promedió 12% en 35 países europeos, con amplia variación.
Un solo ciclo de instrucción y respuesta corresponde a un asistente, no a un agente autónomo.
Experimentos delimitados encontraron tareas 40% más rápidas y calidad evaluada 18% mayor.
La productividad en soporte subió 14% en promedio y cerca de 34% entre trabajadores menos calificados.
En 106 experimentos, las combinaciones humano-IA rindieron mejor en creación que en decisiones.
Ningún estudio adyacente revisado probó directamente FP&A agéntico en empresas latinoamericanas de tercerización.
Los sistemas conectados a herramientas añaden superficies de ataque en recuperación, instrucciones y permisos de acción.
Esta investigación se publica en inglés y español. Read in English