Hanademi

How AI can strengthen public projectsCómo la IA puede fortalecer proyectos públicos · V7

30 slides · 19 min · 2026-08-05 language
ENES
theme
LightDark
view
DeckTableTalk
brand
HanademiPlatzi
How AI can strengthen publicprojectsMade for Daniel Felipe Rambaut Lemus, by Hanademi
  1. Historical data can teach a model the same optimism it should detect.
  2. Engagement peaks between minutes 15 and 35, so place a decision there.
  3. Automation can expand throughput, but the Ghana result does not validate MGA decisions.
Cómo la IA puede fortalecerproyectos públicosMade for Daniel Felipe Rambaut Lemus, by Hanademi
  1. Los datos históricos pueden enseñar al modelo el mismo optimismo que debería detectar.
  2. La participación alcanza su máximo entre los minutos 15 y 35; ubique allí una decisión.
  3. La automatización puede ampliar la capacidad, pero el resultado de Ghana no valida decisiones MGA.
Rail projects averaged 44.7% costescalationAverage cost escalation across 258 international transport projects, percent above estimate.Made for Daniel Felipe Rambaut Lemus, by HanademiSources: Flyvbjerg, B., Holm, M. S., & Buhl, S. (2002). Underestimating costs in public works projects: Error or lie?Journal of the American Planning Association.UnitAverage cost escalationRail44.7%Bridges and tunnels33.8%Roads20.4%
Start with the problem AI is supposed to solve. Across 258 transport projects, every category averaged costs above estimate, and rail reached 44.7%. Historical records are useful, but they can preserve the planning failures embedded in them.
Los proyectos ferroviarios promediaron44,7% de sobrecostoSobrecosto medio en 258 proyectos internacionales de transporte, porcentaje sobre la estimación.Made for Daniel Felipe Rambaut Lemus, by HanademiFuentes: Flyvbjerg, B., Holm, M. S., & Buhl, S. (2002). Underestimating costs in public works projects: Error or lie? Journal of theAmerican Planning Association.UnidadSobrecosto medioFerrocarriles44,7 %Puentes y túneles33,8 %Carreteras20,4 %
Comience con el problema que la IA debería ayudar a resolver. En 258 proyectos de transporte, todas las categorías promediaron costos superiores a la estimación y ferrocarriles llegó a 44,7%. Los registros históricos son útiles, pero pueden conservar los errores de planeación incorporados en ellos.
Four terms for the conversationMade for Daniel Felipe Rambaut Lemus, by HanademiMGAColombia's method for formulating and evaluating public-investment projects.Natural Language ProcessingTechnology that extracts, organizes or generates informationfrom human language.Machine LearningModels that learn patterns from examples to classify or predict.AI RMFNIST framework for governing and managing artificial-intelligence risks.
These terms perform different jobs. MGA structures the public project, while language processing and machine learning support specific tasks. The AI RMF organizes the controls around those tools.
Cuatro términos para la conversaciónMade for Daniel Felipe Rambaut Lemus, by HanademiMGAMétodo colombiano para formular y evaluar proyectos de inversión pública.Procesamiento de Lenguaje NaturalTecnología que extrae, organiza o genera información apartir del lenguaje humano.Aprendizaje AutomáticoModelos que aprenden patrones de ejemplos para clasificar o predecir.IA RMFMarco del NIST para gobernar y gestionar riesgos de inteligencia artificial.
Estos términos cumplen trabajos diferentes. La MGA estructura el proyecto público, mientras el procesamiento de lenguaje y el aprendizaje automático apoyan tareas específicas. El AI RMF organiza los controles alrededor de esas herramientas.
A 24% optimism adjustment would miss twoof three transport overrun averagesMade for Daniel Felipe Rambaut Lemus, by HanademiSources: Flyvbjerg, B., Holm, M. S., & Buhl, S. (2002). Underestimating costs in public works projects: Error orlie? Journal of the American Planning Association.; How common and how large are cost overruns in transportinfrastructure projects?.; HM Treasury. (2022). The Green Book supplementary guidance: Optimism bias.Unitobserved escalation as a multiple of the adjustmentStandard buildingsNonstandard buildingsEquipment or development24%51%200%RailBridges and tunnelsRoads1.86x0.88x0.22x1.41x0.66x0.17x0.85x0.40x0.10x1.0x means the adjustment is fully used
The 24% benchmark covers the road average but only 54% of the rail average. The 51% benchmark covers all three averages, although the project categories are illustrative rather than directly equivalent.
Un ajuste por optimismo del 24 % no cubriría dos delos tres sobrecostos promedio de transporteMade for Daniel Felipe Rambaut Lemus, by HanademiFuentes: Flyvbjerg, B., Holm, M. S., & Buhl, S. (2002). Underestimating costs in public works projects: Error orlie? Journal of the American Planning Association.; How common and how large are cost overruns in transportinfrastructure projects?.; HM Treasury. (2022). The Green Book supplementary guidance: Optimism bias.Unidadsobrecosto observado como múltiplo del ajusteEdificios estándarEdificios no estándarEquipos o desarrollo24 %51 %200 %FerrocarrilPuentes y túnelesVías1.86x0.88x0.22x1.41x0.66x0.17x0.85x0.40x0.10x1,0x indica que el ajuste se utiliza por completo
El referente del 24 % cubre el promedio vial, pero solo el 54 % del promedio ferroviario. El referente del 51 % cubre los tres promedios, aunque las categorías de proyecto son ilustrativas y no directamente equivalentes.
Rail forecast errors can erase two thirds ofthe expected benefit-cost ratioMade for Daniel Felipe Rambaut Lemus, by HanademiSources: Flyvbjerg, B., Holm, M. S., & Buhl, S. (2002). Underestimating costs in public works projects: Error or lie? Journal of theAmerican Planning Association.; How common and how large are cost overruns in transport infrastructure projects?.; Flyvbjerg, B.,Holm, M. S., & Buhl, S. (2005). How inaccurate are demand forecasts in public works projects? Transport Reviews.Unitbenefit-cost index relative to forecastForecast B/C index1.00xDemand: 51.4% shortfall0.49xDemand and cost adjusted0.34x66.4% of the forecast index erased
If benefits move proportionally with passenger demand, the combined forecasting errors reduce a 1.00 benefit-cost index to 0.34 before any other delivery risk is considered.
Los errores de pronóstico ferroviario pueden borrardos tercios de la relación beneficio-costo esperadaMade for Daniel Felipe Rambaut Lemus, by HanademiFuentes: Flyvbjerg, B., Holm, M. S., & Buhl, S. (2002). Underestimating costs in public works projects: Error or lie? Journal of theAmerican Planning Association.; How common and how large are cost overruns in transport infrastructure projects?.; Flyvbjerg, B.,Holm, M. S., & Buhl, S. (2005). How inaccurate are demand forecasts in public works projects? Transport Reviews.Unidadíndice beneficio-costo relativo al pronósticoÍndice B/C previsto1.00xDemanda: déficit de 51,4 %0.49xDemanda y costos ajustados0.34xSe borra el 66,4 % del índice previsto
Si los beneficios varían proporcionalmente con la demanda de pasajeros, ambos errores reducen un índice beneficio-costo de 1,00 a 0,34 antes de considerar otros riesgos de ejecución.
Operations create evidenceCameras installed inside a public transport vehicle.Sources: Cameras, commutes, and CUNY. mta.info.
Forecast assumptions should eventually meet what transport systems observe in operation.
La operación genera evidenciaCámaras instaladas en el interior de un vehículo de transporte público.Fuentes: Cameras, commutes, and CUNY. mta.info.
Los supuestos de proyección deben contrastarse finalmente con lo que los sistemas de transporte observan durante la operación.
The hour needs 22 minutes beyond MGAProvisional allocation of a 60-minute session; MGA receives 38 minutes.Made for Daniel Felipe Rambaut Lemus, by HanademiSources: TED. (n.d.). What is a TEDx talk? TEDx Organizer Guide.; Creating Your Best Run of Show.; Slides Count for 1 Hour Presentation -Here's How Many ....UnitMinutes02040605Hook38MGA10Demonstration5Closure2Contingency60Total
Thirty slides divided by 60 minutes suggests 2 minutes each. That average disappears once demonstrations, interactions and transitions enter the room. TEDx talks are usually under 18 minutes, so this session should borrow TED clarity without imitating TED duration.
La hora necesita 22 minutos fuera de laMGAAsignación provisional de una sesión de 60 minutos; la MGA recibe 38 minutos.Made for Daniel Felipe Rambaut Lemus, by HanademiFuentes: TED. (n.d.). What is a TEDx talk? TEDx Organizer Guide.; Creating Your Best Run of Show.; Slides Count for 1 Hour Presentation -Here's How Many ....UnidadMinutos02040605Enganche38MGA10Demostración5Cierre2Contingencia60Total
Treinta diapositivas divididas entre 60 minutos sugieren 2 minutos por cada una. Ese promedio desaparece cuando entran las demostraciones, las interacciones y las transiciones. Las charlas TEDx suelen durar menos de 18 minutos, por lo que esta sesión debe adoptar la claridad de TED sin imitar su duración.
The MGA block alone lasts more than twotypical TEDx talksDivide each run-sheet allocation by 18 minutes, the stated usual upper duration for a TEDx talk.Made for Daniel Felipe Rambaut Lemus, by HanademiSources: TED. (n.d.). What is a TEDx talk? TEDx Organizer Guide.; What is a TEDx Talk?.; Creating Your Best Runof Show.Unit18-minute TEDx-length equivalentsOpening0.3MGA2.1Demonstration0.6Closure0.3Contingency0.1Full session3.3
Borrowing TED-style delivery for the full hour requires several narrative resets. The 38-minute MGA block is already 2.11 TEDx-length equivalents before the demonstration begins.
El bloque MGA por solo dura más de doscharlas TEDx típicasCada asignación del programa se divide entre 18 minutos, la duración máxima habitual indicada para unacharla TEDx.Made for Daniel Felipe Rambaut Lemus, by HanademiFuentes: TED. (n.d.). What is a TEDx talk? TEDx Organizer Guide.; What is a TEDx Talk?.; Creating Your Best Runof Show.Unidadequivalentes de una duración TEDx de 18 minutosApertura0,3MGA2,1Demostración0,6Cierre0,3Contingencia0,1Sesión completa3,3
Aplicar un estilo TED durante toda la hora exige varios reinicios narrativos. El bloque MGA de 38 minutos ya equivale a 2,11 duraciones TEDx antes de iniciar la demostración.
MGA content carries 90% more time perslide than the openingPair each run-sheet time block with its corresponding slide block and divide minutes by slides. The10-minute demonstration block is paired with the six AI architecture and demonstration slides.Made for Daniel Felipe Rambaut Lemus, by HanademiSources: Creating Your Best Run of Show.; MGA and Geo Unit Business Finances Overview PPT | SlideOrbit.Unitminutes per slideOpening1.2MGA2.4AI and demonstration1.7Closure1.2
The MGA section must sustain 2.38 minutes per slide, compared with 1.25 in both the opening and closure. This is the section most likely to feel dense or run late.
El contenido MGA concentra un 90 % más detiempo por diapositiva que la aperturaCada bloque de tiempo se empareja con su bloque correspondiente de diapositivas y se dividen los minutosentre las diapositivas. El bloque de demostración de 10 minutos se empareja con las seis diapositivas dearquitectura de IA y demostración.Made for Daniel Felipe Rambaut Lemus, by HanademiFuentes: Creating Your Best Run of Show.; MGA and Geo Unit Business Finances Overview PPT | SlideOrbit.Unidadminutos por diapositivaApertura1,2MGA2,4IA y demostración1,7Cierre1,2
La sección MGA debe sostener 2,38 minutos por diapositiva, frente a 1,25 tanto en la apertura como en el cierre. Es la sección con mayor riesgo de sentirse densa o extenderse.
Only one planned interaction touches thepeak engagement windowMade for Daniel Felipe Rambaut Lemus, by HanademiSources: Slides Count for 1 Hour Presentation - Here's How Many ....; snapsight.com.Unitestimated minute in the 60-minute session0153560Poll, slide 3, min 5Evaluation choice, slide 18, min 35Live prompt audit, slide 28, min 55Peak engagement, minutes 15 to 35
The diagnostic poll arrives about 10 minutes before the peak window, the evaluation choice lands on its endpoint, and the live prompt audit arrives about 20 minutes after it.
Solo una interacción planificada toca laventana de máxima atenciónMade for Daniel Felipe Rambaut Lemus, by HanademiFuentes: Slides Count for 1 Hour Presentation - Here's How Many ....; snapsight.com.Unidadminuto estimado de la sesión de 60 minutos0153560Encuesta, diap. 3, min 5Decisión de evaluación, diap. 18, min 35Auditoría de prompt, diap. 28, min 55Máxima atención, minutos 15 a 35
La encuesta diagnóstica llega unos 10 minutos antes de la ventana máxima, la decisión de evaluación cae en su límite final y la auditoría del prompt en vivo llega unos 20 minutos después.
Delivery remains humanA speaker addresses an auditorium audience with a handheld microphone.Sources: How to Give a TED Talk-Style Presentation: 8 Proven Techniques. ahaslides.com.
AI can support the material, but the presenter still creates attention and connection.
La presentación sigue siendo humanaUna expositora se dirige al público de un auditorio con un micrófono de mano.Fuentes: How to Give a TED Talk-Style Presentation: 8 Proven Techniques. ahaslides.com.
La IA puede apoyar el material, pero quien presenta todavía crea atención y conexión.
Small presentation changes can producelarge gainsA conference experiment compared the gain with reducing a class from 22 to 15 students.Made for Daniel Felipe Rambaut Lemus, by HanademiSources: cepr.org.UnitStudents per classStarting class22Smaller class151.5x
Design is not decoration added after the analysis. A randomized conference experiment found that low-cost presentation advice produced a meaningful effectiveness gain. The reported comparison was as large as reducing a class from 22 to 15 students.
Sources
Pequeños cambios de presentación puedenproducir grandes mejorasUn experimento en una conferencia comparó la mejora con reducir una clase de 22 a 15 estudiantes.Made for Daniel Felipe Rambaut Lemus, by HanademiFuentes: cepr.org.UnidadEstudiantes por claseClase inicial22Clase reducida151,5x
El diseño no es decoración añadida después del análisis. Un experimento aleatorizado en una conferencia halló que consejos de bajo costo produjeron una mejora importante de efectividad. La comparación reportada fue tan grande como reducir una clase de 22 a 15 estudiantes.
Fuentes
Coherence won 13 of 14 testsFavorable tests summarized by Mayer across 3 multimedia-learning principles.Made for Daniel Felipe Rambaut Lemus, by HanademiSources: Mayer, R. E. (2009). Multimedia learning (2nd ed.). Cambridge University Press.UnitFavorable tests13Coherence (13/14)5Signaling (5/6)5Spatial contiguity (5/5)
The redesign needs a learning logic, not only a visual style. Mayer reported favorable results in 13 of 14 coherence tests, 5 of 6 signaling tests and all 5 spatial-contiguity tests. The practical rule is fewer competing elements, clearer cues and tighter placement of words and evidence.
La coherencia obtuvo resultados favorablesen 13 de 14 pruebasPruebas favorables resumidas por Mayer en 3 principios de aprendizaje multimedia.Made for Daniel Felipe Rambaut Lemus, by HanademiFuentes: Mayer, R. E. (2009). Multimedia learning (2nd ed.). Cambridge University Press.UnidadPruebas favorables13Coherencia (13/14)5Señalización (5/6)5Contigüidad espacial (5/5)
El rediseño necesita una lógica de aprendizaje, no solo un estilo visual. Mayer reportó resultados favorables en 13 de 14 pruebas de coherencia, 5 de 6 de señalización y las 5 pruebas de contigüidad espacial. La regla práctica es usar menos elementos competidores, señales más claras y mayor cercanía entre palabras y evidencia.
A related citizenship project was evaluatedin 4 countries, not Colombia.Use the recurring case as a design hypothesis, not as a proven educational advantage.Sources: france-education-international.fr.
A recurring case can connect the modules and reduce mental switching. A related citizenship project was evaluated in England, France, Greece and Spain during 2018-2019. That evidence does not prove the proposed MGA case will work for a Colombian audience, so test it before locking the script.
Un proyecto de ciudadanía relacionado seevaluó en 4 países, no en Colombia.Use el caso recurrente como hipótesis de diseño, no como una ventaja educativademostrada.Fuentes: france-education-international.fr.
Un caso recurrente puede conectar los módulos y reducir los cambios mentales. Un proyecto de ciudadanía relacionado fue evaluado en Inglaterra, Francia, Grecia y España durante 2018-2019. Esa evidencia no prueba que el caso MGA propuesto funcione para una audiencia colombiana, por lo que debe probarse antes de cerrar el guion.
Automated screening raised both offers andhiringIncrease over human-only screening in a 2026 Ghana teacher-recruitment experiment.Made for Daniel Felipe Rambaut Lemus, by HanademiSources: ursakrenk.com.UnitIncrease over human-only screening84%Offer rate73%Hiring rate
A 2026 Ghana experiment found that automated GPT-4 screening increased offer rates 84% and hiring rates 73% over human-only screening. The result shows that automation can change operational throughput. Its population and decision context differ from Colombian public-project formulation, so it remains an analogy rather than direct MGA evidence.
La evaluación automatizada elevó ofertas ycontratacionesAumento frente a la evaluación exclusivamente humana en un experimento de reclutamiento docente enGhana durante 2026.Made for Daniel Felipe Rambaut Lemus, by HanademiFuentes: ursakrenk.com.UnidadAumento frente a evaluación humana84 %Tasa de ofertas73 %Tasa de contratación
Un experimento realizado en Ghana en 2026 halló que la evaluación automatizada con GPT-4 aumentó 84% las ofertas y 73% las contrataciones frente a la evaluación exclusivamente humana. El resultado muestra que la automatización puede cambiar la capacidad operativa. Su población y contexto de decisión difieren de la formulación de proyectos públicos en Colombia, por lo que sigue siendo una analogía y no evidencia directa para la MGA.
DNP said the integrated platform wouldconsolidate more than 13 systems.Formulation assistance, official registration and subsequent monitoring should remaindistinguishable.Sources: dnp.gov.co.
An MGA assistant will not operate in an empty technical space. DNP said the Integrated Public Investment Platform would consolidate more than 13 information systems across the investment lifecycle and financing sources. The assistant must remain separate from official systems of record and respect their institutional roles.
El DNP indicó que la plataforma integradaconsolidaría más de 13 sistemas.La asistencia para formular, el registro oficial y el seguimiento posterior debenmantenerse diferenciados.Fuentes: dnp.gov.co.
Un asistente MGA no operará en un espacio técnico vacío. El DNP indicó que la Plataforma Integrada de Inversión Pública consolidaría más de 13 sistemas de información del ciclo de inversión y sus fuentes de financiación. El asistente debe mantenerse separado de los sistemas oficiales de registro y respetar sus funciones institucionales.
Even allocation implies at least 2.6 systemsper story stateUse 13 as the conservative floor for systems being consolidated, then divide by three lifecycle functions,four MGA modules and five visible story states.Made for Daniel Felipe Rambaut Lemus, by HanademiSources: Departamento Nacional de Planeación. (n.d.). Manual conceptual de la Metodología General Ajustada.;Departamento Nacional de Planeación. (n.d.). Ayudas de la MGA y gestión de proyectos de inversión pública.;dnp.gov.co.Unitminimum systems per organizing unitLifecycle function4.3MGA module3.2Story state2.6
Even under an evenly distributed simplification, the public-investment journey remains fragmented across 4.33 systems per function and 3.25 per MGA module.
Una distribución uniforme implica al menos2,6 sistemas por estado narrativoSe usa 13 como límite mínimo conservador de los sistemas que serán consolidados y se divide entre tresfunciones del ciclo de vida, cuatro módulos MGA y cinco estados narrativos visibles.Made for Daniel Felipe Rambaut Lemus, by HanademiFuentes: Departamento Nacional de Planeación. (n.d.). Manual conceptual de la Metodología General Ajustada.;Departamento Nacional de Planeación. (n.d.). Ayudas de la MGA y gestión de proyectos de inversión pública.;dnp.gov.co.Unidadmínimo de sistemas por unidad organizativaFunción del ciclo de vida4,3Módulo MGA3,2Estado narrativo2,6
Incluso bajo una simplificación de distribución uniforme, el recorrido de inversión pública sigue fragmentado entre 4,33 sistemas por función y 3,25 por módulo MGA.
Inside its frontier, GPT-4 made work25.1% fasterExperiment with 758 consultants; changes on tasks inside the tested AI capability frontier.Made for Daniel Felipe Rambaut Lemus, by HanademiSources: Dell'Acqua, F., et al. (2023). Navigating the jagged technological frontier: Field experimental evidence of the effectsof AI on knowledge worker productivity and quality. Harvard Business School Working Paper.The quality result was reported as over 40%; 40% is the supplied conservative boundary.UnitChange versus controlMore tasks12.2%Faster completion25.1%Quality improvement40%
The strongest case for AI is bounded work with a measurable answer. GPT-4 users completed 12.2% more suitable tasks, worked 25.1% faster and produced outputs rated over 40% higher. The task boundary is part of the result, not a footnote.
Dentro de su frontera, GPT-4 aceleró eltrabajo 25,1%Experimento con 758 consultores; cambios en tareas dentro de la frontera de capacidad probada de la IA.Made for Daniel Felipe Rambaut Lemus, by HanademiFuentes: Dell'Acqua, F., et al. (2023). Navigating the jagged technological frontier: Field experimental evidence of the effectsof AI on knowledge worker productivity and quality. Harvard Business School Working Paper.La mejora de calidad se reportó como superior a 40%; 40% es el límite conservador suministrado.UnidadCambio frente al controlMás tareas12,2 %Finalización más rápida25,1 %Mejora de calidad40 %
El caso más sólido para la IA son las tareas acotadas con una respuesta medible. Los usuarios de GPT-4 completaron 12,2% más tareas adecuadas, trabajaron 25,1% más rápido y produjeron resultados con calificaciones superiores en más de 40%. El límite de la tarea forma parte del resultado, no es una nota al pie.
Reported time savings imply up to 126%more throughputConvert each reported completion-time reduction r into fixed-time throughput growth using 1 divided by 1minus r, minus 1. This assumes an unchanged task mix and sustained utilization.Made for Daniel Felipe Rambaut Lemus, by HanademiSources: Dell'Acqua, F., et al. (2023). Navigating the jagged technological frontier: Field experimental evidence of the effects of AI on knowledge workerproductivity and quality. Harvard Business School Working Paper.; Navigating the Jagged Technological Frontier: Field Experimental Evidence of the Effects of AIon Knowledge Worker Productivity and Quality | Papers.; Noy, S., & Zhang, W. (2023). Experimental evidence on the productivity effects of generative artificial…Unitimplied tasks per fixed time, % increaseGPT-4 consultants33.5ChatGPT professionals66.7GitHub Copilot developers126.2
A 55.8% time reduction does not imply 55.8% more output. Under a fixed-time interpretation, it more than doubles potential throughput.
Los ahorros de tiempo reportados implicanhasta un 126 % más de producciónCada reducción reportada del tiempo de ejecución r se convierte en crecimiento de producción por tiempofijo mediante 1 dividido entre 1 menos r, menos 1. Se supone una mezcla de tareas constante y utilizaciónsostenida.Made for Daniel Felipe Rambaut Lemus, by HanademiFuentes: Dell'Acqua, F., et al. (2023). Navigating the jagged technological frontier: Field experimental evidence of the effects of AI on knowledge workerproductivity and quality. Harvard Business School Working Paper.; Navigating the Jagged Technological Frontier: Field Experimental Evidence of the Effects of AIon Knowledge Worker Productivity and Quality | Papers.; Noy, S., & Zhang, W. (2023). Experimental evidence on the productivity effects of generative artificial…Unidadtareas implícitas por tiempo fijo, aumento porcentualConsultores con GPT-433,5Profesionales con ChatGPT66,7Desarrolladores con GitHub Copilot126,2
Una reducción de tiempo del 55,8 % no implica un 55,8 % más de producción. Bajo una interpretación de tiempo fijo, el rendimiento potencial aumenta a más del doble.
ChatGPT cut completion time 40%Preregistered experiment with 453 professionals; percentages and normalized sample-size context areshown separately.Made for Daniel Felipe Rambaut Lemus, by HanademiSources: Noy, S., & Zhang, W. (2023). Experimental evidence on the productivity effects of generative artificialintelligence. Science.; Experimental evidence on the productivity effects of generative ....The first two values are percentage changes.UnitReported values, with sample size divided by 10Time reduction40Quality improvement18Sample size divided by 1045.3
Preparation contains bounded drafting tasks that AI can accelerate. In a preregistered experiment with 453 professionals, ChatGPT reduced average completion time 40% and improved rated quality 18%. The chart also shows 45.3, the sample size divided by 10, for context. The result supports first drafts, not unsupervised project assumptions.
ChatGPT redujo 40% el tiempo definalizaciónExperimento prerregistrado con 453 profesionales; se muestran por separado los porcentajes y el contextonormalizado del tamaño de muestra.Made for Daniel Felipe Rambaut Lemus, by HanademiFuentes: Noy, S., & Zhang, W. (2023). Experimental evidence on the productivity effects of generative artificialintelligence. Science.; Experimental evidence on the productivity effects of generative ....Los dos primeros valores son cambios porcentuales.UnidadValores reportados, con el tamaño de muestra dividido por 10Reducción de tiempo40Mejora de calidad18Tamaño de muestra dividido por1045,3
La Preparación contiene tareas acotadas de redacción que la IA puede acelerar. En un experimento prerregistrado con 453 profesionales, ChatGPT redujo 40% el tiempo medio y mejoró 18% la calidad evaluada. El gráfico también muestra 45,3, el tamaño de muestra dividido por 10, como contexto. El resultado respalda primeros borradores, no supuestos de proyecto sin supervisión.
Copilot users completed one task 55.8%fasterRandomized experiment with 95 developers; control completion time indexed to 100.Made for Daniel Felipe Rambaut Lemus, by HanademiSources: Peng, S., Kalliamvakou, E., Cihon, P., & Demirer, M. (2023). The impact of AI on developer productivity: Evidencefrom GitHub Copilot.; [2302.06590v1] The Impact of AI on Developer Productivity: Evidence from GitHub Copilot.The full reported series is shown: control time is 100, Copilot time is 44.2, and reported acceleration is 55.8.UnitCompletion-time index100Control time index55.8Reported acceleration44.2Copilot time index
A randomized experiment with 95 developers tested one defined coding task. The full series reports control time at 100, Copilot time at 44.2, and acceleration at 55.8. This supports coding assistance inside Preparation, where the task can be bounded and reviewed.
Los usuarios de Copilot completaron unatarea 55,8% más rápidoExperimento aleatorizado con 95 desarrolladores; tiempo de finalización del control indexado en 100.Made for Daniel Felipe Rambaut Lemus, by HanademiFuentes: Peng, S., Kalliamvakou, E., Cihon, P., & Demirer, M. (2023). The impact of AI on developer productivity: Evidence fromGitHub Copilot.; [2302.06590v1] The Impact of AI on Developer Productivity: Evidence from GitHub Copilot.Se muestra la serie completa reportada: el tiempo del control es 100, el de Copilot es 44,2 y la aceleración reportada es55,8.UnidadÍndice de tiempo de finalización100Índice de tiempo del control55,8Aceleración reportada44,2Índice de tiempo de Copilot
Un experimento aleatorizado con 95 desarrolladores evaluó una tarea de programación definida. La serie completa reporta el tiempo del control en 100, el de Copilot en 44,2 y la aceleración en 55,8. Esto respalda la asistencia de programación dentro de Preparación, donde la tarea puede acotarse y revisarse.
A 2025 UK trial estimated savings of 28working days per coder.The result concerns public-sector coding and requires local testing before transfer toColombian project work.Sources: gov.uk.
The public sector also has early operational evidence. A 2025 UK government trial estimated that AI assistants saved each public-sector coder 28 working days annually. The estimate strengthens the case for bounded assistance, but it does not establish the same saving in MGA formulation.
Sources
Un ensayo británico de 2025estimó 28 días laboralesahorrados por programador.El resultado corresponde a programación en el sector público y exige pruebas localesantes de transferirlo al trabajo de proyectos en Colombia.Fuentes: gov.uk.
El sector público también cuenta con evidencia operativa inicial. Un ensayo del Gobierno británico de 2025 estimó que los asistentes de IA ahorraron 28 días laborales al año por cada programador público. La estimación fortalece el caso de la asistencia acotada, pero no demuestra el mismo ahorro en la formulación MGA.
Fuentes
Colombia lowered its social discount rate to9%DNP social discount rate for public-investment evaluation, earlier reference versus Resolution 1092 of2022.Made for Daniel Felipe Rambaut Lemus, by HanademiSources: Adopción de la Tasa Social de Descuento para la evaluación de ....UnitSocial discount rate12%Earlier reference9%Resolution 1092
Evaluation depends on explicit assumptions. Colombia's social discount rate moved from the earlier 12% reference to 9% under Resolution 1092 of 2022. A model may calculate with that rate, but it must not choose or silently replace it.
Colombia redujo su tasa social de descuentoa 9%Tasa social de descuento del DNP para evaluar inversión pública, referencia anterior frente a la Resolución1092 de 2022.Made for Daniel Felipe Rambaut Lemus, by HanademiFuentes: Adopción de la Tasa Social de Descuento para la evaluación de ....UnidadTasa social de descuento12 %Referencia anterior9 %Resolución 1092
La Evaluación depende de supuestos explícitos. La tasa social de descuento de Colombia pasó de la referencia anterior de 12% a 9% con la Resolución 1092 de 2022. Un modelo puede calcular con esa tasa, pero no debe escogerla ni reemplazarla silenciosamente.
Novice workers gained more than twice theaverageIssues resolved per hour among 5,179 support agents; the final value is the supplied percentage-pointdifference.Made for Daniel Felipe Rambaut Lemus, by HanademiSources: Brynjolfsson, E., Li, D., & Raymond, L. R. (2023). Generative AI at work. NBER Working Paper No. 31161.Average and novice values are percentage gains; 20 is the supplied difference between them.UnitProductivity gainAverage gain14%Novice gain34%Difference20%
AI's value may not be evenly distributed. Across 5,179 support agents, productivity increased 14% on average and about 34% among novices. That 20-point difference suggests a practical role for assistance while accountable reviewers remain in control.
Los principiantes mejoraron más del dobledel promedioCasos resueltos por hora entre 5.179 agentes; el valor final es la diferencia suministrada en puntosporcentuales.Made for Daniel Felipe Rambaut Lemus, by HanademiFuentes: Brynjolfsson, E., Li, D., & Raymond, L. R. (2023). Generative AI at work. NBER Working Paper No. 31161.Los valores promedio y de principiantes son mejoras porcentuales; 20 es la diferencia suministrada entre ambos.UnidadMejora de productividadMejora promedio14 %Mejora de principiantes34 %Diferencia20 %
El valor de la IA puede no distribuirse de manera uniforme. Entre 5.179 agentes de soporte, la productividad aumentó 14% en promedio y cerca de 34% entre principiantes. Esa diferencia de 20 puntos sugiere una función práctica para la asistencia mientras revisores responsables conservan el control.
Broad language benchmarks do not validateMGAPublished scope counts for GLUE, SuperGLUE and XTREME; tasks and languages are labeled separately.Made for Daniel Felipe Rambaut Lemus, by HanademiSources: Wang, A., et al. (2018). GLUE: A multi-task benchmark and analysis platform for natural language understanding. Proceedings of EMNLP.; Wang, A., et al. (2019).SuperGLUE: A stickier benchmark for general-purpose language understanding systems.; Hu, J., et al. (2020). XTREME: A massively multilingual multi-task benchmark for…GLUE and SuperGLUE count tasks; XTREME counts languages.UnitPublished scope countGLUE tasksCOP9SuperGLUE tasksCOP8XTREME languagesCOP40
Generic language benchmarks can look broad. GLUE contains 9 tasks, SuperGLUE 8 and XTREME covers 40 languages. None of those scope counts establishes whether a model extracts Colombian MGA fields correctly or invents unsupported ones.
Las pruebas lingüísticas amplias no validanla MGAConteos de alcance publicados para GLUE, SuperGLUE y XTREME; las tareas y los idiomas se etiquetan porseparado.Made for Daniel Felipe Rambaut Lemus, by HanademiFuentes: Wang, A., et al. (2018). GLUE: A multi-task benchmark and analysis platform for natural language understanding. Proceedings of EMNLP.; Wang, A., et al. (2019).SuperGLUE: A stickier benchmark for general-purpose language understanding systems.; Hu, J., et al. (2020). XTREME: A massively multilingual multi-task benchmark…GLUE y SuperGLUE cuentan tareas; XTREME cuenta idiomas.UnidadConteo de alcance publicadoTareas de GLUECOP9Tareas de SuperGLUECOP8Idiomas de XTREMECOP40
Las pruebas lingüísticas generales pueden parecer amplias. GLUE contiene 9 tareas, SuperGLUE 8 y XTREME cubre 40 idiomas. Ninguno de esos conteos demuestra si un modelo extrae correctamente campos MGA colombianos o inventa campos sin respaldo.
Passive lectures carried 1.5 times thefailure riskMeta-analysis summary: 225 studies, 0.47 standard-deviation effect and 1.5 failure-risk ratio, scaledexactly as supplied.Made for Daniel Felipe Rambaut Lemus, by HanademiSources: Freeman, S., et al. (2014). Active learning increases student performance in science, engineering, andmathematics. Proceedings of the National Academy of Sciences.The source quantities have different meanings.UnitSupplied evidence index225Studies150Failure risk ×10047Effect size ×100
A full hour of passive listening is a design risk. Across 225 STEM studies, active learning improved examination performance by 0.47 standard deviations, while traditional lecturing carried 1.5 times the failure risk. The session should use short decisions that ask the audience to judge evidence or choose a control.
Las clases pasivas tuvieron 1,5 veces elriesgo de fracasoResumen del metaanálisis: 225 estudios, efecto de 0,47 desviaciones estándar y razón de riesgo de fracasode 1,5, escalados como fueron suministrados.Made for Daniel Felipe Rambaut Lemus, by HanademiFuentes: Freeman, S., et al. (2014). Active learning increases student performance in science, engineering, andmathematics. Proceedings of the National Academy of Sciences.Las cantidades de la fuente tienen significados diferentes.UnidadÍndice de evidencia suministrado225Estudios150Riesgo de fracaso ×10047Tamaño del efecto ×100
Una hora completa de escucha pasiva es un riesgo de diseño. En 225 estudios STEM, el aprendizaje activo mejoró el desempeño en exámenes en 0,47 desviaciones estándar, mientras las clases tradicionales tuvieron 1,5 veces el riesgo de fracaso. La sesión debe usar decisiones breves que pidan a la audiencia juzgar evidencia o elegir un control.
A 2024 benchmark reported legalhallucination rates from 69% to 88%.The range belongs to a specific legal benchmark and should not be generalized to everymodel, task or safeguarded system.Sources: Dahl, M., Magesh, V., Suzgun, M., & Ho, D. E. (2024). Large legal fictions: Profiling legal hallucinations in large language models.
A persuasive answer is not the same as a supported answer. A 2024 benchmark reported legal hallucination rates between 69% and 88% for three general-purpose models on specific verifiable questions. The result does not measure MGA performance directly, but it makes verification indispensable.
Una prueba de 2024 reportó tasas dealucinación jurídica de 69% a 88%.El rango pertenece a una prueba jurídica específica y no debe generalizarse a todomodelo, tarea o sistema con controles.Fuentes: Dahl, M., Magesh, V., Suzgun, M., & Ho, D. E. (2024). Large legal fictions: Profiling legal hallucinations in large language models.
Una respuesta persuasiva no equivale a una respuesta respaldada. Una prueba de 2024 reportó tasas de alucinación jurídica entre 69% y 88% para tres modelos generales ante preguntas específicas y verificables. El resultado no mide directamente el desempeño con la MGA, pero vuelve indispensable la verificación.
Public scrutiny follows AIParticipants display signs at a press conference about AI textbooks.Sources: Court Dismisses AI Textbook Publishers' Suit Against Optional Adoption - Seoul Economic Daily. en.sedaily.com.
When AI enters public systems, technical choices can become visible stakeholder debates.
La IA enfrenta escrutinio públicoParticipantes exhiben carteles en una rueda de prensa sobre libros de texto de IA.Fuentes: Court Dismisses AI Textbook Publishers' Suit Against Optional Adoption - Seoul Economic Daily. en.sedaily.com.
Cuando la IA entra en sistemas públicos, las decisiones técnicas pueden convertirse en debates visibles entre actores.
Retrieve, draft, validate andapprove, then preserve source,date, model and reviewer.The architecture separates evidence retrieval, generation, validation and institutionalaccountability.Sources: Lewis, P., et al. (2020). Retrieval-augmented generation for knowledge-intensive NLP tasks. Advances in Neural Information ProcessingSystems, 33.; National Institute of Standards and Technology. (2024). Artificial Intelligence Risk Management Framework: Generative ArtificialIntelligence Profile.
The closing protocol has 4 control gates: retrieve approved evidence, generate a draft, validate support and obtain accountable human approval. Each consequential output also preserves 4 audit fields: source, extraction date, model version and approving reviewer. AI becomes a traceable assistant rather than an invisible decision maker.
Recupere, redacte, valide yapruebe; después conserve fuente,fecha, modelo y revisor.La arquitectura separa la recuperación de evidencia, la generación, la validación y laresponsabilidad institucional.Fuentes: Lewis, P., et al. (2020). Retrieval-augmented generation for knowledge-intensive NLP tasks. Advances in Neural Information ProcessingSystems, 33.; National Institute of Standards and Technology. (2024). Artificial Intelligence Risk Management Framework: Generative ArtificialIntelligence Profile.
El protocolo de cierre tiene 4 controles: recuperar evidencia aprobada, generar un borrador, validar el respaldo y obtener aprobación humana responsable. Cada salida relevante también conserva 4 campos de auditoría: fuente, fecha de extracción, versión del modelo y revisor aprobador. La IA se convierte en un asistente trazable y no en un decisor invisible.
Module-level validation expands threeoutcomes into 12 checksMade for Daniel Felipe Rambaut Lemus, by HanademiSources: Departamento Nacional de Planeación. (n.d.). Manual conceptual de la Metodología General Ajustada.; NationalInstitute of Standards and Technology. (2024). Artificial Intelligence Risk Management Framework: Generative ArtificialIntelligence Profile.Unitmodule-outcome checksIdentificationPreparationEvaluationProgrammingCorrect extractionsOmitted fieldsUnsupported fields4 checks4 checks4 checks
A single aggregate accuracy score would hide where failures occur. The minimum useful scorecard contains one measure for every module-outcome combination.
La validación por módulo convierte tresresultados en 12 controlesMade for Daniel Felipe Rambaut Lemus, by HanademiFuentes: Departamento Nacional de Planeación. (n.d.). Manual conceptual de la Metodología General Ajustada.;National Institute of Standards and Technology. (2024). Artificial Intelligence Risk Management Framework:Generative Artificial Intelligence Profile.Unidadcontroles por combinación de módulo y resultadoIdentificaciónPreparaciónEvaluaciónProgramaciónExtracciones correctasCampos omitidosCampos sin sustento4 controles4 controles4 controles
Una sola métrica agregada de exactitud ocultaría dónde ocurren las fallas. El tablero mínimo útil contiene una medida para cada combinación de módulo y resultado.
In summaryMade for Daniel Felipe Rambaut Lemus, by HanademiSources: Dahl, M., Magesh, V., Suzgun, M., & Ho, D. E. (2024). Large legal fictions: Profiling legal hallucinations in large language models.; Flyvbjerg, B., Holm, M. S., & Buhl, S. (2002). Underestimatingcosts in public works projects: Error or lie? Journal of the American Planning Association.; Brynjolfsson, E., Li, D., & Raymond, L. R. (2023). Generative AI at work. NBER Working Paper No. 31161.;Freeman, S., et al. (2014). Active learning increases student performance in science, engineering, and mathematics. Proceedings of the National Academy of Sciences.; ursakrenk.com.; gov.uk.A 2024 benchmark reported legal hallucination rates between 69% and 88% for three general-purpose language models onspecific verifiable legal queries.Across 258 transport projects, average cost escalation was reported as 44.7% for rail, 33.8% for bridges and tunnels, and 20.4% for roads.A study of 5,179 support agents found generative AI increased issues resolved per hour by 14% on average, with about34% improvement among novice workers.A meta-analysis of 225 STEM studies found active learning improved examination performance by 0.47 standarddeviations and traditional lecturing carried 1.5 times the failure risk.A 2026 Ghana teacher-recruitment experiment found automated GPT-4 screening increased offer rates 84% and hiringrates 73% over human-only screening.A 2025 UK government trial estimated that AI assistants saved public-sector coders 28 working days annually, nearly one hour per day.
The value of the research is not only what each source knew, but what became visible when their evidence was combined.
En resumenMade for Daniel Felipe Rambaut Lemus, by HanademiFuentes: Dahl, M., Magesh, V., Suzgun, M., & Ho, D. E. (2024). Large legal fictions: Profiling legal hallucinations in large language models.; Flyvbjerg, B., Holm, M. S., & Buhl, S. (2002). Underestimatingcosts in public works projects: Error or lie? Journal of the American Planning Association.; Brynjolfsson, E., Li, D., & Raymond, L. R. (2023). Generative AI at work. NBER Working Paper No. 31161.;Freeman, S., et al. (2014). Active learning increases student performance in science, engineering, and mathematics. Proceedings of the National Academy of Sciences.; ursakrenk.com.; gov.uk.Una prueba de 2024 reportó tasas de alucinación jurídica entre 69% y 88% para tres modelos generales ante consultasjurídicas verificables específicas.En 258 proyectos de transporte se reportaron sobrecostos medios de 44,7% en ferrocarriles, 33,8% en puentes y túneles, y 20,4% en carreteras.Un estudio con 5.179 agentes halló que la IA generativa aumentó 14% los casos resueltos por hora, con cerca de 34%entre trabajadores principiantes.Un metaanálisis de 225 estudios STEM halló una mejora de 0,47 desviaciones estándar y un riesgo de fracaso 1,5 vecesmayor con clases tradicionales.Un experimento de reclutamiento docente realizado en Ghana en 2026 halló que la evaluación automatizada con GPT-4elevó 84% las ofertas y 73% las contrataciones.Un ensayo del Gobierno británico de 2025 estimó que los asistentes de IA ahorraron a programadores públicos 28 díaslaborales al año, casi una hora diaria.
El valor de la investigación no está solo en cada fuente, sino en lo que apareció al combinar sus evidencias.

The research behind this deck

Historical data can teach a model the same optimism it should detect. The technology changes, but the project method and accountability remain visible.

Key findings

The argument

This research is published in English and Spanish. Ver en español

La investigación detrás de esta presentación

Los datos históricos pueden enseñar al modelo el mismo optimismo que debería detectar. La tecnología cambia, pero el método del proyecto y la responsabilidad siguen visibles.

Hallazgos clave

El argumento

Esta investigación se publica en inglés y español. Read in English

Related researchInvestigación relacionada