Hanademi

Harness must earn the right to grow · V7

31 slides · 10 min · 2026-08-01 language
ENES
theme
LightDark
view
DeckTableTalk
brand
HanademiPlatzi
Harness must earn the right togrowMade for Freddy Vega, by Hanademi
Harness debe ganarse elderecho a crecerMade for Freddy Vega, by Hanademi
AI made consultants faster and experienceddevelopers slowerPercentage change versus comparison groups in separate consultant and experienced open-sourcedeveloper studies, 2023 and 2025.Made for Freddy Vega, by HanademiSources: Dell'Acqua, F., et al. (2023). Navigating the Jagged Technological Frontier. Harvard Business School Working Paper 24-013.; ModelEvaluation and Threat Research. (2025). Measuring the impact of early-2025 AI on experienced open-source developer productivity.Consultant quality is plotted at the stated lower bound of 40%.UnitChange versus comparison groupConsultant tasks12.2%Consultant speed25.1%Consultant quality40%Developer speed-19%
The same technology can create a large gain or a measurable loss. Consultants working inside the tested frontier completed more tasks, moved faster and produced better work. Experienced open-source developers using early-2025 tools took 19% longer. Harness therefore needs bounded use cases and evidence before authority expands.
La IA aceleró a consultores y ralentizó adesarrolladores experimentadosCambio porcentual frente a grupos de comparación en estudios separados con consultores ydesarrolladores experimentados de código abierto, 2023 y 2025.Made for Freddy Vega, by HanademiFuentes: Dell'Acqua, F., et al. (2023). Navigating the Jagged Technological Frontier. Harvard Business School Working Paper 24-013.; ModelEvaluation and Threat Research. (2025). Measuring the impact of early-2025 AI on experienced open-source developer productivity.La calidad de consultoría se representa en el límite inferior declarado de 40%.UnidadCambio frente al grupo de comparaciónTareas de consultoría12,2 %Velocidad de consultoría25,1 %Calidad de consultoría40 %Velocidad de desarrollo-19 %
La misma tecnología puede producir una gran mejora o una pérdida medible. Los consultores dentro de la frontera evaluada completaron más tareas, avanzaron más rápido y produjeron mejor trabajo. Los desarrolladores experimentados de código abierto tardaron 19% más con herramientas de inicios de 2025. Por eso Harness necesita casos limitados y evidencia antes de ampliar autoridad.
The language of the control planePlain-language definitions for the technical terms used in this deck.Made for Freddy Vega, by HanademiHarnessThe proposed shared control plane for governed corporate workflows.Compliance as CodePolicies expressed as executable and testable rules.MCPA standard way for AI applications to connect with tools and data.RPASoftware robots that operate existing user interfaces.BPMSoftware for managing structured, durable business processes.
Harness is not another model or chatbot. It is the proposed control layer around business workflows. MCP connects tools, Compliance as Code expresses rules, and BPM maintains durable state. RPA remains useful at legacy interfaces rather than becoming the control room.
El lenguaje del plano de controlDefiniciones sencillas de los términos técnicos usados en esta presentación.Made for Freddy Vega, by HanademiHarnessEl plano de control compartido propuesto para flujos corporativos gobernados.Cumplimiento como CódigoPolíticas expresadas como reglas ejecutables y comprobables.MCPUna forma estándar para conectar aplicaciones de IA con herramientas y datos.RPARobots de software que operan interfaces de usuario existentes.BPMSoftware para gestionar procesos empresariales estructurados y duraderos.
Harness no es otro modelo ni otro chatbot. Es la capa de control propuesta alrededor de los flujos empresariales. MCP conecta herramientas, Compliance as Code expresa reglas y BPM mantiene estado durable. RPA sigue siendo útil en interfaces heredadas, no como sala de control.
An AI agent reportedly deleted PocketOSproduction data in 9 seconds.The incident was reported by a secondary personal website and should be treatedcautiously.Sources: aakashsharan.com.
Fast execution makes weak authorization more dangerous. A secondary account reported that an AI agent deleted PocketOS production data in 9 seconds in April 2026. The source is not independently corroborated here, so the incident remains a caution rather than a benchmark. Harness must make destructive actions narrow, reversible and explicitly authorized.
Un agente de IA habría eliminado datosproductivos de PocketOS en 9 segundos.El incidente fue reportado por un sitio personal secundario y debe tratarse con cautela.Fuentes: aakashsharan.com.
La ejecución rápida vuelve más peligrosa una autorización débil. Una fuente secundaria reportó que un agente de IA eliminó datos productivos de PocketOS en 9 segundos en abril de 2026. El incidente no tiene corroboración independiente aquí, por lo que funciona como advertencia y no como benchmark. Harness debe hacer que las acciones destructivas sean limitadas, reversibles y autorizadas explícitamente.
Forecasts predicted at least 30% ofgenerative AI projects would be abandoned.Gartner forecast that at least 30% of generative AI projects would be abandoned afterproof of concept by the end of 2025. The forecast captures prototype-to-production riskbut does not establish Harness's likely failure rate.Sources: Gartner. (2024). Gartner predicts 30% of generative AI projects will be abandoned after proof of concept by end of 2025.; Gartner Predicts30% of Generative AI Projects Will Be Abandoned After ....
The dangerous moment comes after the demo works. Gartner forecast that at least 30% of generative AI projects would be abandoned after proof of concept by the end of 2025. This was a forecast, not a measured final outcome. Harness must prove repeatable delivery before it earns platform-scale investment.
Se pronosticó que al menos 30% delos proyectos de IA generativaserían abandonados.Gartner pronosticó que al menos 30% de los proyectos de IA generativa seríanabandonados tras la prueba de concepto para finales de 2025. El pronóstico captura elriesgo entre prototipo y producción, pero no establece la tasa probable de fracaso deHarness.Fuentes: Gartner. (2024). Gartner predicts 30% of generative AI projects will be abandoned after proof of concept by end of 2025.; Gartner Predicts 30%of Generative AI Projects Will Be Abandoned After ....
El momento peligroso llega después de que funciona la demostración. Gartner pronosticó que al menos 30% de los proyectos de IA generativa serían abandonados tras la prueba de concepto para finales de 2025. Fue un pronóstico, no un resultado final medido. Harness deberá demostrar una entrega repetible antes de merecer una inversión a escala de plataforma.
One Swedish workflow fell from 24 weeksto 6Reported duration of a Swedish government company-analysis workflow before and after AI assistance.Made for Freddy Vega, by HanademiSources: zenml.io.; kolmena.ai.Sources use different measurement bases; read the comparison directionally, not as one exact scale.UnitWeeksBefore24With AI assistance64x
A complete workflow can make value visible. Swedish government offices reported reducing one company-analysis process from 24 weeks to 6 while deploying more than 30 assistants. Kolmena establishes one disclosed feasibility example, but not reusable corporate performance. The next proof must come from production workflows.
Un flujo sueco bajó de 24 semanas a 6Duración reportada de un flujo gubernamental sueco de análisis empresarial antes y después de asistenciacon IA.Made for Freddy Vega, by HanademiFuentes: zenml.io.; kolmena.ai.Las fuentes usan bases de medición distintas; lea la comparación como tendencia, no como una escala exacta.UnidadSemanasAntes24Con asistencia de IA64x
Un flujo completo puede hacer visible el valor. Oficinas del Gobierno de Suecia reportaron reducir un proceso de análisis empresarial de 24 a 6 semanas mientras desplegaban más de 30 asistentes. Kolmena establece un ejemplo declarado de viabilidad, pero no desempeño corporativo reutilizable. La siguiente prueba debe venir de flujos productivos.
Public-sector AI has moved beyond isolatedpilotsReported AI assistants in Swedish government offices and public-sector AI use cases in Estonia.Made for Freddy Vega, by HanademiSources: zenml.io.; ega.ee.Both figures are lower bounds because the sources state more than 30 and more than 220.UnitReported implementationsSwedish assistants30Estonian use cases2207.3x
Government AI programs are moving beyond one-off experiments. Swedish offices reported more than 30 assistants, while Estonia counted more than 220 public-sector use cases and estimated nearly €60 million in annual impact. These are implementation reports, not comparable ROI studies. Harness should copy the discipline of scaling measured workflows, not the headline counts.
La IA del sector público ya superó lospilotos aisladosAsistentes de IA reportados en oficinas del Gobierno de Suecia y casos de uso de IA en el sector público deEstonia.Made for Freddy Vega, by HanademiFuentes: zenml.io.; ega.ee.Ambas cifras son límites inferiores porque las fuentes indican más de 30 y más de 220.UnidadImplementaciones reportadasAsistentes suecos30Casos de Estonia2207,3x
Los programas gubernamentales de IA están superando los experimentos aislados. Oficinas suecas reportaron más de 30 asistentes, mientras Estonia contabilizó más de 220 casos de uso públicos y estimó casi €60 millones de impacto anual. Son reportes de implementación, no estudios comparables de ROI. Harness debería copiar la disciplina de escalar flujos medidos, no los conteos llamativos.
Japan planned to pilot Gennaiwith approximately 180,000government employees.The figure describes planned pilot reach, not measured usage or benefit.Sources: digital.go.jp.
Japan's Digital Agency planned to pilot Gennai with approximately 180,000 employees across ministries and agencies in fiscal 2026. That scale raises the stakes for identity, permissions, logging and support. It does not yet prove realized productivity or return. Harness should separate deployment reach from verified value.
La Agencia Digital de Japón probaráGennai con aproximadamente 180.000empleados gubernamentales.La cifra describe el alcance previsto del piloto, no uso ni beneficio medidos.Fuentes: digital.go.jp.
La Agencia Digital de Japón probará su entorno gubernamental de IA Gennai con aproximadamente 180.000 empleados de todos los ministerios y agencias durante el año fiscal 2026. Esa escala eleva la importancia de identidad, permisos, registros y soporte. Todavía no demuestra productividad ni retorno realizados. Harness debería separar alcance de despliegue y valor verificado.
More evidence collection does not provelower operational risk.The claim contrasts compliance activity with two outcome types: operational incidentsand losses.Sources: The audit society: rituals of verification.
Compliance automation can make activity easy to count. It can produce more evidence, checks and reports without proving that incidents or losses decline. Harness must connect policy execution with operational outcomes. Otherwise Compliance as Code becomes faster documentation rather than better control.
Recolectar más evidencia no demuestramenor riesgo operativo.La afirmación contrasta la actividad de cumplimiento con dos tipos de resultado:incidentes y pérdidas operativas.Fuentes: The audit society: rituals of verification.
La automatización del cumplimiento puede facilitar el conteo de actividad. Puede producir más evidencia, controles y reportes sin demostrar que disminuyan incidentes o pérdidas. Harness debe conectar la ejecución de políticas con resultados operativos. De lo contrario, Compliance as Code se convierte en documentación más rápida y no en mejor control.
Activity is not controlAI governance binders, a checklist, an approval stamp and a network cable arranged on a meetingtable.Sources: AI Governance Theater: How Health Systems Confuse Activity with Control | Censinet. censinet.com.
Governance artifacts matter only when they translate into demonstrable operational control.
La actividad no es controlCarpetas de gobernanza de IA, una lista de verificación, un sello de aprobación y un cable de reddispuestos sobre una mesa de reuniones.Fuentes: AI Governance Theater: How Health Systems Confuse Activity with Control | Censinet. censinet.com.
Los artefactos de gobernanza solo importan cuando se traducen en un control operativo demostrable.
Harness needs business evidence beyondtechnical telemetryNumber of dimensions or signals explicitly named for candidate selection, process evidence, data contractsand telemetry.Made for Freddy Vega, by HanademiSources: van der Aalst, W. M. P. (2016). Process Mining: Data Science in Action. Springer.; Cloud Native Computing Foundation.(2024). OpenTelemetry graduates within CNCF.; The 7 Dimensions to Prioritize Your Innovation Efforts | ITONICS.The counts describe different operating-model checklists.UnitNamed dimensions7Candidate score4Process evidence4Data contract3Technical telemetry
A control plane needs more than logs. Candidate selection must consider pain, volume, rules, cross-functional reach, data readiness, return and political feasibility. Process evidence adds variants, waiting time, rework and bottlenecks. Data contracts and technical telemetry then make execution understandable and reproducible.
Harness necesita evidencia de negocio másallá de la telemetría técnicaNúmero de dimensiones o señales nombradas explícitamente para selección de candidatos, evidencia deprocesos, contratos de datos y telemetría.Made for Freddy Vega, by HanademiFuentes: van der Aalst, W. M. P. (2016). Process Mining: Data Science in Action. Springer.; Cloud Native Computing Foundation.(2024). OpenTelemetry graduates within CNCF.; The 7 Dimensions to Prioritize Your Innovation Efforts | ITONICS.Los conteos describen listas distintas del modelo operativo.UnidadDimensiones nombradas7Puntuación de candidatos4Evidencia de procesos4Contrato de datos3Telemetría técnica
Un plano de control necesita más que logs. La selección de candidatos debe considerar dolor, volumen, reglas, alcance transversal, datos, retorno y viabilidad política. La evidencia de procesos añade variantes, tiempos de espera, retrabajo y cuellos de botella. Los contratos de datos y la telemetría técnica hacen después que la ejecución sea comprensible y reproducible.
RPA adoption was expected to rise from 53%to 72%Deloitte respondent adoption and projections from a 2018 survey. Projected points are not observedoutcomes.Made for Freddy Vega, by HanademiSources: Robots in the workplace supported by 81% of business chiefs | Computer Weekly.; Syed, R., et al. (2020). Robotic processautomation: Contemporary themes and challenges. Computers in Industry, 115, 103162.; fns-prod.azureedge.us.Only the 53% survey level was observed.UnitRespondentsSurvey level53%One-year projection64%Two-year projection72%
RPA looked ready for rapid expansion. A systematic review still identified governance, process selection, brittle interfaces and organizational change as recurring scaling problems. Connecticut spent about $1.1 million on SNAP RPA, and quantified worker-time benefits did not exceed costs. GSA's inspector general separately found weak evidence for claimed savings.
Se esperaba que la adopción de RPA subierade 53% a 72%Adopción y proyecciones de participantes en una encuesta de Deloitte de 2018. Los puntos proyectados noson resultados observados.Made for Freddy Vega, by HanademiFuentes: Robots in the workplace supported by 81% of business chiefs | Computer Weekly.; Syed, R., et al. (2020). Robotic processautomation: Contemporary themes and challenges. Computers in Industry, 115, 103162.; fns-prod.azureedge.us.Solo se observó el nivel encuestado de 53%.UnidadParticipantesNivel encuestado53 %Proyección a 1 año64 %Proyección a 2 años72 %
RPA parecía lista para una rápida expansión. Una revisión sistemática identificó gobierno, selección de procesos, interfaces frágiles y cambio organizacional como problemas recurrentes de escalamiento. Connecticut gastó cerca de US$1,1 millones en RPA para SNAP y los beneficios cuantificados de tiempo laboral no superaron los costos. El inspector general de GSA también encontró evidencia débil para los ahorros declarados.
Prime Video cut infrastructure cost 90% byadopting a simpler architecture.Harness should centralize only capabilities that repeatedly improve cost, reliability ordelivery effort.Sources: Amazon Web Services. (2023). Scaling up the Prime Video audio/video monitoring service and reducing costs by 90%.
More distribution does not automatically create more reliability or lower cost. Prime Video reported a 90% cost reduction after replacing one distributed monitoring design with a simpler monolithic architecture. This is one workload, not a universal rule. It is strong evidence against treating architecture as doctrine.
Prime Video redujo 90% el costo deinfraestructura al adoptar unaarquitectura más simple.Harness debería centralizar solo capacidades que mejoren repetidamente costo,confiabilidad o esfuerzo de entrega.Fuentes: Amazon Web Services. (2023). Scaling up the Prime Video audio/video monitoring service and reducing costs by 90%.
Más distribución no crea automáticamente mayor confiabilidad ni menor costo. Prime Video reportó una reducción de 90% después de reemplazar un diseño distribuido de monitoreo por una arquitectura monolítica más simple. Es un solo caso, no una regla universal. Es evidencia fuerte contra tratar la arquitectura como dogma.
Software-agent resolution rose from about2% to 49%Approximate SWE-bench resolution rate for early systems in 2023 and leading verified systems in late2024.Made for Freddy Vega, by HanademiSources: Jimenez, C. E., et al. (2024). SWE-bench: Can language models resolve real-world GitHub issues? ICLR 2024.The figures are approximate, and the historical trend was not independently reconstructed.UnitIssues resolved49%20242%2023
Software-agent capability improved sharply over a short period. Approximate SWE-bench resolution rose from about 2% in 2023 to roughly 49% for leading verified systems in late 2024. That makes experimentation more valuable. It also makes versioning and repeated evaluation necessary because the underlying tools change quickly.
La resolución de agentes de software subióde cerca de 2% a 49%Tasa aproximada de resolución en SWE-bench para sistemas iniciales en 2023 y sistemas verificadoslíderes a finales de 2024.Made for Freddy Vega, by HanademiFuentes: Jimenez, C. E., et al. (2024). SWE-bench: Can language models resolve real-world GitHub issues? ICLR 2024.Las cifras son aproximadas y la tendencia histórica no fue reconstruida de forma independiente.UnidadIncidencias resueltas49 %20242 %2023
La capacidad de los agentes de software mejoró con rapidez. La resolución aproximada en SWE-bench subió de cerca de 2% en 2023 a aproximadamente 49% para sistemas verificados líderes a finales de 2024. Eso vuelve más valiosa la experimentación. También hace necesarios el versionamiento y la evaluación repetida porque las herramientas cambian rápidamente.
Sweden's enterprise AI figure rose from7.11 to 10.97Eurostat artificial-intelligence measure by enterprise size class in Sweden, 2024 and 2025.Made for Freddy Vega, by HanademiSources: Eurostat. (n.d.). Artificial intelligence by size class of enterprise [ISOC_EB_AI]. Eurostat.UnitReported Eurostat valueEUR8EUR1020242025EUR7.1EUR11.0
The Eurostat measure for Swedish enterprises increased between 2024 and 2025. That establishes movement in organizational adoption, not the value of any one platform. As adoption spreads, shared identity, evaluation and telemetry become more useful. Harness should respond to proven reuse needs rather than assume them in advance.
La cifra de IA empresarial de Suecia subióde 7,11 a 10,97Medida de Eurostat sobre inteligencia artificial por tamaño de empresa en Suecia, 2024 y 2025.Made for Freddy Vega, by HanademiFuentes: Eurostat. (n.d.). Artificial intelligence by size class of enterprise [ISOC_EB_AI]. Eurostat.UnidadValor reportado por EurostatEUR8EUR1020242025EUR7,1EUR11,0
La medida de Eurostat para empresas suecas aumentó entre 2024 y 2025. Eso demuestra movimiento en la adopción organizacional, no el valor de una plataforma específica. A medida que la adopción se extiende, identidad, evaluación y telemetría compartidas se vuelven más útiles. Harness debería responder a necesidades demostradas de reutilización y no asumirlas por adelantado.
Sweden's 2025 AI use reached only 39% ofcloud useDivide Sweden's 2025 AI use rate of 10.97% by its 2025 cloud use rate of 27.96%; the result is 39.2%.Made for Freddy Vega, by HanademiSources: Eurostat. (n.d.). Artificial intelligence by size class of enterprise [ISOC_EB_AI]. Eurostat.; Eurostat. (n.d.). Cloudcomputing services by size class of enterprise [ISOC_CICCE_USE]. Eurostat.Unitpercent of enterprisesAI use, 20247.1AI use, 202511.0Cloud use, 202528.0
Cloud availability does not translate automatically into AI adoption, so Harness must prove workflow value rather than assume infrastructure readiness will pull demand.
El uso de IA en Suecia alcanzó solo el 39%del uso de la nube en 2025Se divide la tasa sueca de uso de IA de 2025, 10,97%, entre la tasa de uso de la nube de 2025, 27,96%; elresultado es 39,2%.Made for Freddy Vega, by HanademiFuentes: Eurostat. (n.d.). Artificial intelligence by size class of enterprise [ISOC_EB_AI]. Eurostat.; Eurostat. (n.d.). Cloudcomputing services by size class of enterprise [ISOC_CICCE_USE]. Eurostat.Unidadporcentaje de empresasUso de IA, 20247,1Uso de IA, 202511,0Uso de la nube, 202528,0
La disponibilidad de la nube no se traduce automáticamente en adopción de IA, por lo que Harness debe demostrar valor en los flujos en vez de asumir que la preparación de infraestructura generará demanda.
Agent testing must cover task variation andmaterial riskDocumented evaluation environments, policy-code experiments and selected risk classes from separateresearch programs.Made for Freddy Vega, by HanademiSources: Liu, X., et al. (2024). AgentBench: Evaluating LLMs as agents. ICLR 2024.; National Institute of Standards andTechnology. (2024). Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile. NIST AI600-1.; OWASP Foundation. (2025). Top 10 for Large Language Model Applications.UnitDocumented categoriesEvaluation breadth84AgentBench environmentsPolicy-code experimentsRisk breadth4unchanged, NIST risks → OWASP threats
AgentBench found substantial performance variation across eight environments. Georgetown-led work documented four experiments translating public-benefit policy into code. NIST and OWASP separately identify material risks including confabulation, privacy, excessive agency and insecure tool use. Harness needs task-specific tests, adversarial tests and monitored outcomes before authority expands.
Las pruebas de agentes deben cubrirvariación de tareas y riesgos materialesEntornos de evaluación, experimentos de políticas como código y clases de riesgo seleccionadas deprogramas de investigación separados.Made for Freddy Vega, by HanademiFuentes: Liu, X., et al. (2024). AgentBench: Evaluating LLMs as agents. ICLR 2024.; National Institute of Standards andTechnology. (2024). Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile. NISTAI 600-1.; OWASP Foundation. (2025). Top 10 for Large Language Model Applications.UnidadCategorías documentadasAmplitud de evaluación84Entornos de AgentBenchExperimentos de políticasAmplitud de riesgos4sin cambio, Riesgos de NIST → Amenazas de OWASP
AgentBench encontró variación considerable de desempeño en ocho entornos. Un trabajo liderado por Georgetown documentó cuatro experimentos para traducir políticas de beneficios públicos a código. NIST y OWASP identifican por separado riesgos como confabulación, privacidad, agencia excesiva y uso inseguro de herramientas. Harness necesita pruebas específicas, pruebas adversariales y resultados supervisados antes de ampliar autoridad.
Connection standards still need a separateauthority layerNamed structural roles in MCP and OAuth beside governance functions in NIST AI RMF and EU AI Acttreatment groups.Made for Freddy Vega, by HanademiSources: Anthropic. (2024). Introducing the Model Context Protocol.; Hardt, D. (2012). The OAuth 2.0 AuthorizationFramework. RFC 6749.; National Institute of Standards and Technology. (2023). Artificial Intelligence Risk ManagementFramework 1.0.UnitNamed structural elementsConnection and authorization34MCP rolesOAuth rolesRisk governance4unchanged, NIST functions → EU treatment groups
Anthropic introduced MCP with host, client and server roles. OAuth defines a separate authorization structure, while NIST and the EU organize risk governance through their own functions and treatment groups. These layers solve different problems. Harness should keep protocol compatibility separate from identity, permission and business accountability.
Los estándares de conexión aún necesitanuna capa separada de autoridadRoles estructurales nombrados en MCP y OAuth junto con funciones de gobierno de NIST AI RMF y gruposde tratamiento de la Ley de IA de la UE.Made for Freddy Vega, by HanademiFuentes: Anthropic. (2024). Introducing the Model Context Protocol.; Hardt, D. (2012). The OAuth 2.0Authorization Framework. RFC 6749.; National Institute of Standards and Technology. (2023). ArtificialIntelligence Risk Management Framework 1.0.UnidadElementos estructurales nombradosConexión y autorización34Roles de MCPRoles de OAuthGobierno de riesgos4sin cambio, Funciones de NIST → Grupos de la UE
Anthropic presentó MCP con roles de host, cliente y servidor. OAuth define una estructura separada de autorización, mientras NIST y la UE organizan el gobierno de riesgos mediante sus propias funciones y grupos de tratamiento. Estas capas resuelven problemas distintos. Harness debería separar compatibilidad de protocolo de identidad, permisos y responsabilidad empresarial.
The agent market expanded faster than itsproduct boundaries stabilizedVendor counts and documented product surfaces or portfolio layers from enterprise agent offerings around2024.Made for Freddy Vega, by HanademiSources: Google Cloud. (2024). Vertex AI Agent Builder.; Salesforce. (2024). Introducing Agentforce.; Microsoft. (2024). CopilotStudio documentation.UnitDocumented entitiesMarket participation3unchanged, Hyperscalers → Workflow vendorsStack breadth34Microsoft surfacesNVIDIA layers
Google, Microsoft and Amazon offered managed enterprise agent platforms by 2024. Salesforce, ServiceNow and Microsoft also announced branded enterprise agents during 2024. Microsoft maintained at least three overlapping building surfaces, while NVIDIA covered four portfolio layers. Harness needs a stable vendor-neutral boundary because the surrounding product market remains fluid.
El mercado de agentes creció más rápidoque la estabilidad de sus productosConteos de proveedores y superficies de producto o capas de portafolio documentadas en ofertasempresariales de agentes alrededor de 2024.Made for Freddy Vega, by HanademiFuentes: Google Cloud. (2024). Vertex AI Agent Builder.; Salesforce. (2024). Introducing Agentforce.; Microsoft. (2024).Copilot Studio documentation.UnidadEntidades documentadasParticipación de mercado3sin cambio, Hiperscalers → Proveedores de flujosAmplitud del stack34Superficies de MicrosoftCapas de NVIDIA
Google, Microsoft y Amazon ofrecían plataformas empresariales administradas de agentes para 2024. Salesforce, ServiceNow y Microsoft también anunciaron agentes empresariales durante 2024. Microsoft mantuvo al menos tres superficies superpuestas de construcción, mientras NVIDIA cubría cuatro capas de portafolio. Harness necesita una frontera estable y neutral porque el mercado de productos sigue cambiando.
Agent tooling changed while legal obligationsmoved into forceDocumented OpenAI product generations and principal EU AI Act implementation years, 2023 to 2027.Made for Freddy Vega, by HanademiSources: OpenAI. (2023). Function calling and other API updates.; OpenAI. (2025). New tools for building agents.; EuropeanCommission. (2024). AI Act implementation timeline.Rows represent documented milestone years, not durations.UnitCalendar year20232025202620272023Function calling2023Assistants2025Responses and agent tools2025EU obligations wave 12026EU obligations wave 22027EU obligations wave 3
OpenAI moved through three documented product generations from 2023 to 2025. During the same broad period, EU AI Act obligations began phasing across 2025, 2026 and 2027. Vendor interfaces can change faster than corporate control obligations. Harness should therefore version adapters, policies and evidence independently.
Las herramientas agénticas cambiaronmientras entraban obligaciones legalesGeneraciones documentadas de productos de OpenAI y principales años de implementación de la Ley de IAde la UE, 2023 a 2027.Made for Freddy Vega, by HanademiFuentes: OpenAI. (2023). Function calling and other API updates.; OpenAI. (2025). New tools for building agents.; EuropeanCommission. (2024). AI Act implementation timeline.Las filas representan años documentados de hitos, no duraciones.UnidadAño calendario20232025202620272023Invocación de funciones2023Asistentes2025Responses y herramientasagénticas2025Ola 1 de obligaciones UE2026Ola 2 de obligaciones UE2027Ola 3 de obligaciones UE
OpenAI avanzó por tres generaciones documentadas de productos entre 2023 y 2025. Durante el mismo período amplio, las obligaciones de la Ley de IA de la UE comenzaron a implementarse entre 2025, 2026 y 2027. Las interfaces de proveedores pueden cambiar más rápido que las obligaciones corporativas de control. Harness debería versionar adaptadores, políticas y evidencia de forma independiente.
DORA applied to 20 regulated types plustheir ICT providers.The legal scope should be confirmed against primary DORA materials beforeimplementation.Sources: cyrilsimonnet.substack.com.
DORA applied from 17 January 2025 to twenty types of regulated financial entities plus their ICT providers. That broad reach makes reusable control evidence attractive. The source supplied here is secondary, so exact applicability requires legal confirmation. Compliance as Code should encode validated obligations, not summaries copied from commentary.
DORA aplicó a 20 tipos regulados y a susproveedores de TIC.El alcance jurídico debe confirmarse con materiales primarios de DORA antes de laimplementación.Fuentes: cyrilsimonnet.substack.com.
DORA rige desde el 17 de enero de 2025 para veinte tipos de entidades financieras reguladas y sus proveedores de TIC. Ese alcance vuelve atractiva la evidencia reutilizable de control. La fuente suministrada es secundaria, por lo que la aplicabilidad exacta requiere confirmación jurídica. Compliance as Code debería codificar obligaciones validadas, no resúmenes copiados de comentarios.
Palantir customers rose from 139 to 497Reported Palantir customer count in 2020 and 2023 from company annual reports.Made for Freddy Vega, by HanademiSources: Palantir Technologies Inc. (2021-2024). Annual reports, Forms 10-K.UnitCustomers20201392023497
Palantir is a relevant example of an ontology-centered enterprise platform. Its reported customer count rose from 139 in 2020 to 497 in 2023, while revenue approximately doubled. That demonstrates market traction. It does not isolate whether the architecture itself caused customer outcomes.
Los clientes de Palantir aumentaron de 139a 497Número de clientes reportado por Palantir en 2020 y 2023 según informes anuales de la empresa.Made for Freddy Vega, by HanademiFuentes: Palantir Technologies Inc. (2021-2024). Annual reports, Forms 10-K.UnidadClientes20201392023497
Palantir es un ejemplo relevante de plataforma empresarial centrada en ontologías. Su número reportado de clientes aumentó de 139 en 2020 a 497 en 2023, mientras los ingresos aproximadamente se duplicaron. Eso demuestra tracción comercial. No permite aislar si la arquitectura causó resultados para los clientes.
JPMorgan technology investmentapproached $17 billionApproximate annual technology investment reported for 2022 and 2024, USD billions.Made for Freddy Vega, by HanademiSources: JPMorgan Chase & Co. (2022-2024). Annual reports and investor presentations.Figures are approximate and describe company-wide technology investment, not agent-platform spending.UnitUSD$17B2024$15.3B2022
JPMorgan Chase described annual technology investment rising from approximately $15.3 billion in 2022 toward about $17 billion in 2024. The scale shows the sustained funding behind regulated technology operations. It does not define an appropriate Harness budget. Harness should grow through measured value gates rather than imitate absolute spending.
La inversión tecnológica de JPMorgan seacercó a US$17 mil millonesInversión tecnológica anual aproximada reportada para 2022 y 2024, miles de millones USD.Made for Freddy Vega, by HanademiFuentes: JPMorgan Chase & Co. (2022-2024). Annual reports and investor presentations.Las cifras son aproximadas y describen inversión tecnológica de toda la empresa, no gasto en plataformas agénticas.UnidadUSD$17 mil M2024$15,3 mil M2022
JPMorgan Chase describió un aumento de la inversión tecnológica anual desde aproximadamente US$15,3 mil millones en 2022 hacia cerca de US$17 mil millones en 2024. La escala muestra el financiamiento sostenido detrás de operaciones tecnológicas reguladas. No define un presupuesto apropiado para Harness. Harness debería crecer mediante umbrales de valor medidos y no imitar un gasto absoluto.
Sweden's 2025 cloud figure was 2.04xGermany's 2021 figureFull Eurostat series for Sweden and Germany. The 2.04x analysis compares Sweden's 2025 value withGermany's 2021 value.Made for Freddy Vega, by HanademiSources: Eurostat. (n.d.). Cloud computing services by size class of enterprise [ISOC_CICCE_USE]. Eurostat.Hanademi analysis: Sweden's figure divided by Germany's, from the two cited sources.UnitReported Eurostat valueSweden27.228.020182025Germany15.613.720202021
The complete Eurostat series place the computed ratio in context. Sweden reported 27.96 in 2025, while Germany reported 13.7 in 2021, producing a 2.04x ratio. The years differ, so this is not a synchronized country ranking. It shows why platform adoption begins from different infrastructure baselines.
La cifra cloud de Suecia en 2025 fue 2,04veces la de Alemania en 2021Series completas de Eurostat para Suecia y Alemania. El análisis de 2,04 veces compara el valor sueco de2025 con el alemán de 2021.Made for Freddy Vega, by HanademiFuentes: Eurostat. (n.d.). Cloud computing services by size class of enterprise [ISOC_CICCE_USE]. Eurostat.Análisis de Hanademi: La cifra de Sweden dividida por la de Germany, a partir de las dos fuentes citadas.UnidadValor reportado por EurostatSuecia27,228,020182025Alemania15,613,720202021
Las series completas de Eurostat ponen la razón calculada en contexto. Suecia reportó 27,96 en 2025, mientras Alemania reportó 13,7 en 2021, lo que produce una razón de 2,04 veces. Los años son distintos, por lo que no es una clasificación sincronizada entre países. Muestra por qué la adopción de plataformas comienza desde bases de infraestructura diferentes.
Harness should expand only when eachdelivery wave gets easierProposed Harness evaluation structure: delivery waves, lifecycle evaluation stages and process-selectiondimensions.Made for Freddy Vega, by HanademiSources: National Institute of Standards and Technology. (2024). NIST AI 600-1.; Google Cloud. (2023). Accelerate State ofDevOps Report 2023.; The 7 Dimensions to Prioritize Your Innovation Efforts | ITONICS.The three-wave retention test is a proposed internal decision protocol, not an externally validated threshold.UnitSpecified elementsDelivery waves3Evaluation stages3Selection dimensions7
Start with a deliberately small control plane and one valuable end-to-end workflow. Add a second and third flow only when shared components reduce marginal delivery effort. Evaluate before deployment, during operation and after material changes. DORA's platform research supports a product orientation but warns that excessive standardization can reduce developer effectiveness.
Harness debería expandirse solo cuandocada ola de entrega sea más fácilEstructura propuesta de evaluación de Harness: olas de entrega, etapas de evaluación del ciclo de vida ydimensiones de selección de procesos.Made for Freddy Vega, by HanademiFuentes: National Institute of Standards and Technology. (2024). NIST AI 600-1.; Google Cloud. (2023). Accelerate State ofDevOps Report 2023.; The 7 Dimensions to Prioritize Your Innovation Efforts | ITONICS.La prueba de continuidad de tres olas es un protocolo interno de decisión propuesto, no un umbral validado externamente.UnidadElementos especificadosOlas de entrega3Etapas de evaluación3Dimensiones de selección7
Comience con un plano de control deliberadamente pequeño y un flujo End-to-End valioso. Añada un segundo y un tercer flujo solo cuando los componentes compartidos reduzcan el esfuerzo marginal de entrega. Evalúe antes del despliegue, durante la operación y después de cambios materiales. La investigación de DORA respalda una orientación a producto, pero advierte que la estandarización excesiva puede reducir la efectividad de los desarrolladores.
Three delivery waves create nine minimumevaluation checkpointsMade for Freddy Vega, by HanademiSources: National Institute of Standards and Technology. (2024). NIST AI 600-1.; International Organization forStandardization. (2023). ISO/IEC 42001:2023.Unitlifecycle checkpointsDelivery wave 1Delivery wave 2Delivery wave 3123456789Before deploymentDuring operationAfter material changeNine checkpoints follow the delivery sequence
Every wave must be evaluated before deployment, during operation and after material change before expansion earns approval.
Tres oleadas de entrega crean nueve puntosmínimos de evaluaciónMade for Freddy Vega, by HanademiFuentes: National Institute of Standards and Technology. (2024). NIST AI 600-1.; International Organization forStandardization. (2023). ISO/IEC 42001:2023.Unidadpuntos de control del ciclo de vidaOleada de entrega 1Oleada de entrega 2Oleada de entrega 3123456789Antes del despliegueDurante la operaciónDespués de un cambio materialNueve puntos de control siguen la secuencia de entrega
Cada oleada debe evaluarse antes del despliegue, durante la operación y después de cambios materiales antes de autorizar la expansión.
Build the smallest governed system that canprove reusable value.The evidence rejects both extremes. Independent automation can waste money, while alarge platform can harden assumptions before value is proven. Start with boundedworkflows, narrow authority and measurable outcomes. Expand Harness only whenreuse and reliability improve across successive production flows.Sources: Amazon Web Services. (2023). Scaling up the Prime Video audio/video monitoring service and reducing costs by 90%.; Prime Video Sparks Serverless Debate by Switching to Monolith.; zenml.io.; ModelEvaluation and Threat Research. (2025). Measuring the impact of early-2025 AI on experienced open-source developer productivity.; Measuring the Impact of Early-2025 AI on Experienced Open-Source ....; Gartner.(2024). Gartner predicts 30% of generative AI projects will be abandoned after proof of concept by end of 2025.; Gartner Predicts 30% of Generative AI Projects Will Be Abandoned After ....
The evidence rejects both extremes. Simpler architecture can cut cost, bounded AI workflows can compress cycle time, and measured AI use can slow experienced developers. Start with narrow authority and measurable outcomes. Expand Harness only when reuse and reliability improve across successive production flows.
Construya el sistema gobernadomás pequeño que pueda demostrarvalor reutilizable.La evidencia rechaza ambos extremos. La automatización independiente puededesperdiciar dinero, mientras una gran plataforma puede endurecer supuestos antes dedemostrar valor. Comience con flujos limitados, autoridad estrecha y resultadosmedibles. Expanda Harness solo cuando reutilización y confiabilidad mejoren en flujosproductivos sucesivos.Fuentes: Amazon Web Services. (2023). Scaling up the Prime Video audio/video monitoring service and reducing costs by 90%.; Prime Video Sparks Serverless Debate by Switching to Monolith.; zenml.io.; ModelEvaluation and Threat Research. (2025). Measuring the impact of early-2025 AI on experienced open-source developer productivity.; Measuring the Impact of Early-2025 AI on Experienced Open-Source ....; Gartner.(2024). Gartner predicts 30% of generative AI projects will be abandoned after proof of concept by end of 2025.; Gartner Predicts 30% of Generative AI Projects Will Be Abandoned After ....
La evidencia rechaza ambos extremos. Una arquitectura más simple puede reducir costos, los flujos limitados de IA pueden acortar los ciclos y el uso medido de IA puede ralentizar a desarrolladores experimentados. Comience con autoridad estrecha y resultados medibles. Expanda Harness solo cuando reutilización y confiabilidad mejoren en flujos productivos sucesivos.
Measured AI speed outcomes span 44.1percentage pointsMade for Freddy Vega, by HanademiSources: Jimenez, C. E., et al. (2024). SWE-bench: Can language models resolve real-world GitHub issues? ICLR2024.; SWE-bench Leaderboards.; Model Evaluation and Threat Research. (2025). Measuring the impact ofearly-2025 AI on experienced open-source developer productivity.Unitreported percentage outcomeExperienced developerspeed-19%Consultant task output+12.2%Consultant speed+25.1%Consultant quality>40%SWE-bench tasks resolved49%-200204050Reported outcome, percent
AI can accelerate work inside its capability frontier and slow experts outside it, so aggregate adoption cannot substitute for workflow-level evaluation.
Los resultados medidos de velocidad con IAabarcan 44,1 puntos porcentualesMade for Freddy Vega, by HanademiFuentes: Jimenez, C. E., et al. (2024). SWE-bench: Can language models resolve real-world GitHub issues? ICLR2024.; SWE-bench Leaderboards.; Model Evaluation and Threat Research. (2025). Measuring the impact ofearly-2025 AI on experienced open-source developer productivity.Unidadresultado porcentual reportadoVelocidad de desarrolladoresexperimentados-19%Producción de tareas de consultores+12.2%Velocidad de consultores+25.1%Calidad de consultores>40%Tareas de SWE-bench resueltas49%-200204050Resultado reportado, porcentaje
La IA puede acelerar el trabajo dentro de su frontera de capacidad y ralentizar a expertos fuera de ella, por lo que la adopción agregada no sustituye la evaluación de cada flujo.
Harness has completed only 33% of theevidence required to scaleMade for Freddy Vega, by HanademiSources: kolmena.ai.; Gartner. (2024). Gartner predicts 30% of generative AI projects will be abandoned afterproof of concept by end of 2025.; Gartner Predicts 30% of Generative AI Projects Will Be Abandoned After ....Unitshare of the minimum proof gateMinimum proof completed33%Evidence still missing67%Forecast project abandonment30%0%25%50%75%100%
The platform thesis remains unproven while the forecast abandonment rate for generative AI projects is still 30%.
Harness ha completado solo el 33% de laevidencia necesaria para escalarMade for Freddy Vega, by HanademiFuentes: kolmena.ai.; Gartner. (2024). Gartner predicts 30% of generative AI projects will be abandoned afterproof of concept by end of 2025.; Gartner Predicts 30% of Generative AI Projects Will Be Abandoned After ....Unidadproporción del umbral mínimo de validaciónValidación mínima completada33%Evidencia aún pendiente67%Abandono previsto de proyectos30%0%25%50%75%100%
La tesis de plataforma sigue sin validarse mientras la tasa prevista de abandono de proyectos de IA generativa aún es del 30%.
In summaryMade for Freddy Vega, by HanademiSources: aakashsharan.com.; Anthropic. (2024). Introducing the Model Context Protocol.; Liu, X., et al. (2024). AgentBench: Evaluating LLMs as agents.ICLR 2024.; The audit society: rituals of verification.; Salesforce. (2024). Introducing Agentforce.; National Institute of Standards and Technology.(2023). Artificial Intelligence Risk Management Framework 1.0.An AI agent deleted PocketOS’s production database in nine seconds in late April 2026.Anthropic introduced MCP in November 2024 using a host-client-server architecture.AgentBench evaluated agents across eight environments and found substantial performance variation by model and task.Automating evidence collection can increase compliance activity without proving that operational incidents or losses decline.Salesforce, ServiceNow and Microsoft each announced branded enterprise agent offerings during 2024.NIST AI RMF organizes AI risk management into four functions: Govern, Map, Measure and Manage.
The value of the research is not only what each source knew, but what became visible when their evidence was combined.
En resumenMade for Freddy Vega, by HanademiFuentes: aakashsharan.com.; Anthropic. (2024). Introducing the Model Context Protocol.; Liu, X., et al. (2024). AgentBench: Evaluating LLMs as agents.ICLR 2024.; The audit society: rituals of verification.; Salesforce. (2024). Introducing Agentforce.; National Institute of Standards and Technology.(2023). Artificial Intelligence Risk Management Framework 1.0.Un agente de IA eliminó la base de datos de producción de PocketOS en nueve segundos a finales de abril de 2026.Anthropic presentó MCP en noviembre de 2024 utilizando una arquitectura host-cliente-servidor.AgentBench evaluó agentes en ocho entornos y encontró variación considerable de desempeño según modelo y tarea.Automatizar la recolección de evidencia puede aumentar actividad de cumplimiento sin demostrar que disminuyan incidentes o pérdidas operativas.Salesforce, ServiceNow y Microsoft anunciaron ofertas empresariales de agentes durante 2024.NIST AI RMF organiza la gestión de riesgo de IA en cuatro funciones: Gobernar, Mapear, Medir y Gestionar.
El valor de la investigación no está solo en cada fuente, sino en lo que apareció al combinar sus evidencias.
Risk tiering and AI RMF create a 16-cellgovernance matrixMade for Freddy Vega, by HanademiSources: National Institute of Standards and Technology. (2023). Artificial Intelligence Risk ManagementFramework 1.0.; International Organization for Standardization. (2023). ISO/IEC 42001:2023 Artificialintelligence management system.; AI RMF Core - AIRC - NIST AI Resource Center.Unitrisk-treatment coverage cellsGovernMapMeasureManageProhibited usesBanScreenVerifyStopHigh-risk usesOwnerMapTestControlTransparency-regulated usesNoticeRecordAuditRespondLower-risk usesPolicyCatalogSampleMonitor
Harness needs differentiated controls across every risk tier and governance function, not one universal compliance policy.
La clasificación de riesgo y el AI RMFcrean una matriz de gobierno de 16 celdasMade for Freddy Vega, by HanademiFuentes: National Institute of Standards and Technology. (2023). Artificial Intelligence Risk ManagementFramework 1.0.; International Organization for Standardization. (2023). ISO/IEC 42001:2023 Artificialintelligence management system.; AI RMF Core - AIRC - NIST AI Resource Center.Unidadceldas de cobertura de tratamiento de riesgosGobernarMapearMedirGestionarUsos prohibidosProhibirDetectarVerificarDetenerUsos de alto riesgoResponsableMapearProbarControlUsos regulados por transparenciaAvisoRegistroAuditarResponderUsos de menor riesgoPolíticaCatálogoMuestraMonitorear
Harness necesita controles diferenciados para cada nivel de riesgo y función de gobierno, no una política universal de cumplimiento.
Workflow complexity is 14.3 times MCP'srole modelDivide each architectural count by MCP's three core roles; 43 workflow patterns divided by 3 roles equals14.3.Made for Freddy Vega, by HanademiSources: Workflow Patterns Initiative. (2011). Control-flow patterns.; van der Aalst, W. M. P., ter Hofstede, A. H.M., Kiepuszewski, B., & Barros, A. P. (2003). Workflow patterns. Distributed and Parallel Databases, 14, 5-51.;Anthropic. (2024). Introducing the Model Context Protocol.Unitmultiples of MCP's three core rolesMCP core roles1Telemetry signals1Data contract dimensions1.3AI RMF functions1.3Workflow control patterns14.3
MCP can standardize connectivity, but Harness must provide the workflow, contract, telemetry and governance layers that the protocol does not define.
La complejidad de los flujos multiplica por14,3 el modelo de roles de MCPSe divide cada recuento arquitectónico entre los tres roles centrales de MCP; 43 patrones de flujo divididosentre 3 roles equivalen a 14,3.Made for Freddy Vega, by HanademiFuentes: Workflow Patterns Initiative. (2011). Control-flow patterns.; van der Aalst, W. M. P., ter Hofstede, A. H.M., Kiepuszewski, B., & Barros, A. P. (2003). Workflow patterns. Distributed and Parallel Databases, 14, 5-51.;Anthropic. (2024). Introducing the Model Context Protocol.Unidadmúltiplos de los tres roles centrales de MCPRoles centrales de MCP1Señales de telemetría1Dimensiones del contrato de datos1,3Funciones del AI RMF1,3Patrones de control de flujo14,3
MCP puede estandarizar la conectividad, pero Harness debe aportar las capas de flujo, contratos, telemetría y gobierno que el protocolo no define.

The research behind this deck

AI value depends on the task, user and operating boundary. Harness separates workflow control from models, tools and business systems.

Key findings

The argument

This research is published in English and Spanish. Ver en español

La investigación detrás de esta presentación

El valor de la IA depende de la tarea, el usuario y el límite operativo. Harness separa el control del flujo de modelos, herramientas y sistemas empresariales.

Hallazgos clave

El argumento

Esta investigación se publica en inglés y español. Read in English