How AI can strengthen public projectsCómo la IA puede fortalecer proyectos públicos · V7
30 slides · 19 min · 2026-08-05language
ENES
theme
LightDark
view
DeckTableTalk
brand
HanademiPlatzi
Historical data can teach a model the same optimism it should detect.
Engagement peaks between minutes 15 and 35, so place a decision there.
Automation can expand throughput, but the Ghana result does not validate MGA decisions.
Los datos históricos pueden enseñar al modelo el mismo optimismo que debería detectar.
La participación alcanza su máximo entre los minutos 15 y 35; ubique allí una decisión.
La automatización puede ampliar la capacidad, pero el resultado de Ghana no valida decisiones MGA.
Start with the problem AI is supposed to solve. Across 258 transport projects, every category averaged costs above estimate, and rail reached 44.7%. Historical records are useful, but they can preserve the planning failures embedded in them.
Comience con el problema que la IA debería ayudar a resolver. En 258 proyectos de transporte, todas las categorías promediaron costos superiores a la estimación y ferrocarriles llegó a 44,7%. Los registros históricos son útiles, pero pueden conservar los errores de planeación incorporados en ellos.
These terms perform different jobs. MGA structures the public project, while language processing and machine learning support specific tasks. The AI RMF organizes the controls around those tools.
Estos términos cumplen trabajos diferentes. La MGA estructura el proyecto público, mientras el procesamiento de lenguaje y el aprendizaje automático apoyan tareas específicas. El AI RMF organiza los controles alrededor de esas herramientas.
The 24% benchmark covers the road average but only 54% of the rail average. The 51% benchmark covers all three averages, although the project categories are illustrative rather than directly equivalent.
El referente del 24 % cubre el promedio vial, pero solo el 54 % del promedio ferroviario. El referente del 51 % cubre los tres promedios, aunque las categorías de proyecto son ilustrativas y no directamente equivalentes.
If benefits move proportionally with passenger demand, the combined forecasting errors reduce a 1.00 benefit-cost index to 0.34 before any other delivery risk is considered.
Si los beneficios varían proporcionalmente con la demanda de pasajeros, ambos errores reducen un índice beneficio-costo de 1,00 a 0,34 antes de considerar otros riesgos de ejecución.
Forecast assumptions should eventually meet what transport systems observe in operation.
Los supuestos de proyección deben contrastarse finalmente con lo que los sistemas de transporte observan durante la operación.
Thirty slides divided by 60 minutes suggests 2 minutes each. That average disappears once demonstrations, interactions and transitions enter the room. TEDx talks are usually under 18 minutes, so this session should borrow TED clarity without imitating TED duration.
Treinta diapositivas divididas entre 60 minutos sugieren 2 minutos por cada una. Ese promedio desaparece cuando entran las demostraciones, las interacciones y las transiciones. Las charlas TEDx suelen durar menos de 18 minutos, por lo que esta sesión debe adoptar la claridad de TED sin imitar su duración.
Borrowing TED-style delivery for the full hour requires several narrative resets. The 38-minute MGA block is already 2.11 TEDx-length equivalents before the demonstration begins.
Aplicar un estilo TED durante toda la hora exige varios reinicios narrativos. El bloque MGA de 38 minutos ya equivale a 2,11 duraciones TEDx antes de iniciar la demostración.
The MGA section must sustain 2.38 minutes per slide, compared with 1.25 in both the opening and closure. This is the section most likely to feel dense or run late.
La sección MGA debe sostener 2,38 minutos por diapositiva, frente a 1,25 tanto en la apertura como en el cierre. Es la sección con mayor riesgo de sentirse densa o extenderse.
The diagnostic poll arrives about 10 minutes before the peak window, the evaluation choice lands on its endpoint, and the live prompt audit arrives about 20 minutes after it.
La encuesta diagnóstica llega unos 10 minutos antes de la ventana máxima, la decisión de evaluación cae en su límite final y la auditoría del prompt en vivo llega unos 20 minutos después.
AI can support the material, but the presenter still creates attention and connection.
La IA puede apoyar el material, pero quien presenta todavía crea atención y conexión.
Design is not decoration added after the analysis. A randomized conference experiment found that low-cost presentation advice produced a meaningful effectiveness gain. The reported comparison was as large as reducing a class from 22 to 15 students.
El diseño no es decoración añadida después del análisis. Un experimento aleatorizado en una conferencia halló que consejos de bajo costo produjeron una mejora importante de efectividad. La comparación reportada fue tan grande como reducir una clase de 22 a 15 estudiantes.
The redesign needs a learning logic, not only a visual style. Mayer reported favorable results in 13 of 14 coherence tests, 5 of 6 signaling tests and all 5 spatial-contiguity tests. The practical rule is fewer competing elements, clearer cues and tighter placement of words and evidence.
El rediseño necesita una lógica de aprendizaje, no solo un estilo visual. Mayer reportó resultados favorables en 13 de 14 pruebas de coherencia, 5 de 6 de señalización y las 5 pruebas de contigüidad espacial. La regla práctica es usar menos elementos competidores, señales más claras y mayor cercanía entre palabras y evidencia.
A recurring case can connect the modules and reduce mental switching. A related citizenship project was evaluated in England, France, Greece and Spain during 2018-2019. That evidence does not prove the proposed MGA case will work for a Colombian audience, so test it before locking the script.
Un caso recurrente puede conectar los módulos y reducir los cambios mentales. Un proyecto de ciudadanía relacionado fue evaluado en Inglaterra, Francia, Grecia y España durante 2018-2019. Esa evidencia no prueba que el caso MGA propuesto funcione para una audiencia colombiana, por lo que debe probarse antes de cerrar el guion.
A 2026 Ghana experiment found that automated GPT-4 screening increased offer rates 84% and hiring rates 73% over human-only screening. The result shows that automation can change operational throughput. Its population and decision context differ from Colombian public-project formulation, so it remains an analogy rather than direct MGA evidence.
Un experimento realizado en Ghana en 2026 halló que la evaluación automatizada con GPT-4 aumentó 84% las ofertas y 73% las contrataciones frente a la evaluación exclusivamente humana. El resultado muestra que la automatización puede cambiar la capacidad operativa. Su población y contexto de decisión difieren de la formulación de proyectos públicos en Colombia, por lo que sigue siendo una analogía y no evidencia directa para la MGA.
An MGA assistant will not operate in an empty technical space. DNP said the Integrated Public Investment Platform would consolidate more than 13 information systems across the investment lifecycle and financing sources. The assistant must remain separate from official systems of record and respect their institutional roles.
Un asistente MGA no operará en un espacio técnico vacío. El DNP indicó que la Plataforma Integrada de Inversión Pública consolidaría más de 13 sistemas de información del ciclo de inversión y sus fuentes de financiación. El asistente debe mantenerse separado de los sistemas oficiales de registro y respetar sus funciones institucionales.
Even under an evenly distributed simplification, the public-investment journey remains fragmented across 4.33 systems per function and 3.25 per MGA module.
Incluso bajo una simplificación de distribución uniforme, el recorrido de inversión pública sigue fragmentado entre 4,33 sistemas por función y 3,25 por módulo MGA.
The strongest case for AI is bounded work with a measurable answer. GPT-4 users completed 12.2% more suitable tasks, worked 25.1% faster and produced outputs rated over 40% higher. The task boundary is part of the result, not a footnote.
El caso más sólido para la IA son las tareas acotadas con una respuesta medible. Los usuarios de GPT-4 completaron 12,2% más tareas adecuadas, trabajaron 25,1% más rápido y produjeron resultados con calificaciones superiores en más de 40%. El límite de la tarea forma parte del resultado, no es una nota al pie.
Una reducción de tiempo del 55,8 % no implica un 55,8 % más de producción. Bajo una interpretación de tiempo fijo, el rendimiento potencial aumenta a más del doble.
Preparation contains bounded drafting tasks that AI can accelerate. In a preregistered experiment with 453 professionals, ChatGPT reduced average completion time 40% and improved rated quality 18%. The chart also shows 45.3, the sample size divided by 10, for context. The result supports first drafts, not unsupervised project assumptions.
La Preparación contiene tareas acotadas de redacción que la IA puede acelerar. En un experimento prerregistrado con 453 profesionales, ChatGPT redujo 40% el tiempo medio y mejoró 18% la calidad evaluada. El gráfico también muestra 45,3, el tamaño de muestra dividido por 10, como contexto. El resultado respalda primeros borradores, no supuestos de proyecto sin supervisión.
A randomized experiment with 95 developers tested one defined coding task. The full series reports control time at 100, Copilot time at 44.2, and acceleration at 55.8. This supports coding assistance inside Preparation, where the task can be bounded and reviewed.
Un experimento aleatorizado con 95 desarrolladores evaluó una tarea de programación definida. La serie completa reporta el tiempo del control en 100, el de Copilot en 44,2 y la aceleración en 55,8. Esto respalda la asistencia de programación dentro de Preparación, donde la tarea puede acotarse y revisarse.
The public sector also has early operational evidence. A 2025 UK government trial estimated that AI assistants saved each public-sector coder 28 working days annually. The estimate strengthens the case for bounded assistance, but it does not establish the same saving in MGA formulation.
El sector público también cuenta con evidencia operativa inicial. Un ensayo del Gobierno británico de 2025 estimó que los asistentes de IA ahorraron 28 días laborales al año por cada programador público. La estimación fortalece el caso de la asistencia acotada, pero no demuestra el mismo ahorro en la formulación MGA.
Evaluation depends on explicit assumptions. Colombia's social discount rate moved from the earlier 12% reference to 9% under Resolution 1092 of 2022. A model may calculate with that rate, but it must not choose or silently replace it.
La Evaluación depende de supuestos explícitos. La tasa social de descuento de Colombia pasó de la referencia anterior de 12% a 9% con la Resolución 1092 de 2022. Un modelo puede calcular con esa tasa, pero no debe escogerla ni reemplazarla silenciosamente.
AI's value may not be evenly distributed. Across 5,179 support agents, productivity increased 14% on average and about 34% among novices. That 20-point difference suggests a practical role for assistance while accountable reviewers remain in control.
El valor de la IA puede no distribuirse de manera uniforme. Entre 5.179 agentes de soporte, la productividad aumentó 14% en promedio y cerca de 34% entre principiantes. Esa diferencia de 20 puntos sugiere una función práctica para la asistencia mientras revisores responsables conservan el control.
Generic language benchmarks can look broad. GLUE contains 9 tasks, SuperGLUE 8 and XTREME covers 40 languages. None of those scope counts establishes whether a model extracts Colombian MGA fields correctly or invents unsupported ones.
Las pruebas lingüísticas generales pueden parecer amplias. GLUE contiene 9 tareas, SuperGLUE 8 y XTREME cubre 40 idiomas. Ninguno de esos conteos demuestra si un modelo extrae correctamente campos MGA colombianos o inventa campos sin respaldo.
A full hour of passive listening is a design risk. Across 225 STEM studies, active learning improved examination performance by 0.47 standard deviations, while traditional lecturing carried 1.5 times the failure risk. The session should use short decisions that ask the audience to judge evidence or choose a control.
Una hora completa de escucha pasiva es un riesgo de diseño. En 225 estudios STEM, el aprendizaje activo mejoró el desempeño en exámenes en 0,47 desviaciones estándar, mientras las clases tradicionales tuvieron 1,5 veces el riesgo de fracaso. La sesión debe usar decisiones breves que pidan a la audiencia juzgar evidencia o elegir un control.
A persuasive answer is not the same as a supported answer. A 2024 benchmark reported legal hallucination rates between 69% and 88% for three general-purpose models on specific verifiable questions. The result does not measure MGA performance directly, but it makes verification indispensable.
Una respuesta persuasiva no equivale a una respuesta respaldada. Una prueba de 2024 reportó tasas de alucinación jurídica entre 69% y 88% para tres modelos generales ante preguntas específicas y verificables. El resultado no mide directamente el desempeño con la MGA, pero vuelve indispensable la verificación.
When AI enters public systems, technical choices can become visible stakeholder debates.
Cuando la IA entra en sistemas públicos, las decisiones técnicas pueden convertirse en debates visibles entre actores.
The closing protocol has 4 control gates: retrieve approved evidence, generate a draft, validate support and obtain accountable human approval. Each consequential output also preserves 4 audit fields: source, extraction date, model version and approving reviewer. AI becomes a traceable assistant rather than an invisible decision maker.
El protocolo de cierre tiene 4 controles: recuperar evidencia aprobada, generar un borrador, validar el respaldo y obtener aprobación humana responsable. Cada salida relevante también conserva 4 campos de auditoría: fuente, fecha de extracción, versión del modelo y revisor aprobador. La IA se convierte en un asistente trazable y no en un decisor invisible.
A single aggregate accuracy score would hide where failures occur. The minimum useful scorecard contains one measure for every module-outcome combination.
Una sola métrica agregada de exactitud ocultaría dónde ocurren las fallas. El tablero mínimo útil contiene una medida para cada combinación de módulo y resultado.
Historical data can teach a model the same optimism it should detect. The technology changes, but the project method and accountability remain visible.
Key findings
UK guidance listed upper optimism-bias adjustments of 24% for standard buildings, 51% for nonstandard buildings and 200% for equipment or development projects. HM Treasury
In the international rail sample, passenger demand averaged 51.4% below forecast while construction costs in the related rail evidence averaged 44.7% above estimate. Transport Reviews
A 2024 benchmark reported legal hallucination rates between 69% and 88% for three general-purpose language models on specific verifiable legal queries. Stanford University
India’s stricter biometric welfare verification reduced corruption, but 1.5–2 million legitimate beneficiaries lost access to benefits during the reforms. econweb.ucsd.edu
Across 258 transport projects, average cost escalation was reported as 44.7% for rail, 33.8% for bridges and tunnels, and 20.4% for roads. Journal of the American Planning Association
On a task outside the tested AI capability frontier, GPT-4 users were 19 percentage points less likely to produce the correct answer. Harvard Business School
A study of 5,179 support agents found generative AI increased issues resolved per hour by 14% on average, with about 34% improvement among novice workers. National Bureau of Economic Research
A meta-analysis of 225 STEM studies found active learning improved examination performance by 0.47 standard deviations and traditional lecturing carried 1.5 times the failure risk. Proceedings of the National Academy of Sciences
A 2026 Ghana teacher-recruitment experiment found automated GPT-4 screening increased offer rates 84% and hiring rates 73% over human-only screening. ursakrenk.com
On 16 February 2023, Germany’s Federal Constitutional Court declared automated-data-analysis legislation in Hesse and Hamburg unconstitutional. bundesverfassungsgericht.de
In an experiment with 758 consultants, GPT-4 users completed 12.2% more in-frontier tasks, worked 25.1% faster and produced outputs rated over 40% higher. Harvard Business School
In a preregistered experiment with 453 professionals, ChatGPT reduced average completion time by 40% and increased rated output quality by 18%. Science
The argument
Two minutes per slide is arithmetic, not a pacing strategy.
Better delivery can change effectiveness without adding content.
Remove distractions, signal the structure and place explanations beside evidence.
Engagement peaks between minutes 15 and 35, so place a decision there.
A related citizenship project was evaluated in 4 countries, not Colombia.
Automation can expand throughput, but the Ghana result does not validate MGA decisions.
This research is published in English and Spanish. Ver en español
La investigación detrás de esta presentación
Los datos históricos pueden enseñar al modelo el mismo optimismo que debería detectar. La tecnología cambia, pero el método del proyecto y la responsabilidad siguen visibles.
Hallazgos clave
La guía británica enumeró ajustes superiores por sesgo optimista de 24% para edificios estándar, 51% para no estándar y 200% para equipos o desarrollo. HM Treasury
En la muestra ferroviaria internacional, la demanda fue en promedio 51,4% inferior al pronóstico y los costos, en evidencia relacionada, 44,7% superiores. Transport Reviews
Una prueba de 2024 reportó tasas de alucinación jurídica entre 69% y 88% para tres modelos generales ante consultas jurídicas verificables específicas. Stanford University
La verificación biométrica más estricta en India redujo la corrupción, pero entre 1,5 y 2 millones de beneficiarios legítimos perdieron acceso durante las reformas. econweb.ucsd.edu
En 258 proyectos de transporte se reportaron sobrecostos medios de 44,7% en ferrocarriles, 33,8% en puentes y túneles, y 20,4% en carreteras. Journal of the American Planning Association
En una tarea fuera de la frontera de capacidad probada, los usuarios de GPT-4 tuvieron 19 puntos porcentuales menos de probabilidad de responder correctamente. Harvard Business School
Un estudio con 5.179 agentes halló que la IA generativa aumentó 14% los casos resueltos por hora, con cerca de 34% entre trabajadores principiantes. National Bureau of Economic Research
Un metaanálisis de 225 estudios STEM halló una mejora de 0,47 desviaciones estándar y un riesgo de fracaso 1,5 veces mayor con clases tradicionales. Proceedings of the National Academy of Sciences
Un experimento de reclutamiento docente realizado en Ghana en 2026 halló que la evaluación automatizada con GPT-4 elevó 84% las ofertas y 73% las contrataciones. ursakrenk.com
El 16 de febrero de 2023, el Tribunal Constitucional Federal de Alemania declaró inconstitucional la legislación sobre análisis automatizado de datos en Hesse y Hamburgo. bundesverfassungsgericht.de
En un experimento con 758 consultores, usuarios de GPT-4 completaron 12,2% más tareas dentro de la frontera, trabajaron 25,1% más rápido y superaron 40% en calidad. Harvard Business School
En un experimento prerregistrado con 453 profesionales, ChatGPT redujo 40% el tiempo medio y aumentó 18% la calidad evaluada. Science
El argumento
Dos minutos por diapositiva es aritmética, no una estrategia de ritmo.
Una mejor presentación puede cambiar la efectividad sin agregar contenido.
Elimine distracciones, señale la estructura y ubique las explicaciones junto a la evidencia.
La participación alcanza su máximo entre los minutos 15 y 35; ubique allí una decisión.
Un proyecto de ciudadanía relacionado se evaluó en 4 países, no en Colombia.
La automatización puede ampliar la capacidad, pero el resultado de Ghana no valida decisiones MGA.
Esta investigación se publica en inglés y español. Read in English