In this evaluation, long context produced 75.9% correct answers, ahead of Semantic RAG at 67.3%. A separate 2024 study also found that well-resourced long-context models often outperformed RAG, while RAG remained cheaper. Architecture must balance accuracy, cost and control.
En esta evaluación, el contexto largo produjo 75,9% de respuestas correctas, por encima del 67,3% de RAG semántico. Otro estudio de 2024 también encontró que los modelos de contexto largo con recursos suficientes superaron con frecuencia a RAG, mientras RAG siguió siendo más barato. La arquitectura debe equilibrar precisión, costo y control.
The decision requires 4 distinctions. Context carries material, retrieval selects evidence, and routing chooses the engine. Enterprise controls remain outside the model.
La decisión requiere 4 distinciones. El contexto transporta material, la recuperación selecciona evidencia y el enrutamiento elige el motor. Los controles empresariales permanecen fuera del modelo.
The defensible advantage comes from the controlled knowledge and architecture surrounding interchangeable models.
La ventaja defendible proviene del conocimiento controlado y la arquitectura que rodean a modelos intercambiables.
Model vendors expanded one request from 128,000 to 1 million tokens. That is a major capability gain. Even 128,000 tokens represent about 256 illustrative pages before instructions, conversation history and output capacity.
Los proveedores ampliaron una solicitud de 128.000 a 1 millón de tokens. Es un avance importante. Incluso 128.000 tokens representan unas 256 páginas ilustrativas antes de instrucciones, historial de conversación y capacidad de respuesta.
At 1 million tokens, reported single-needle retrieval ranged from 78% to 99%. The advertised capacity was identical, but the outcomes were not. Procurement must test retrieval behavior, not compare context limits alone.
Con 1 millón de tokens, la recuperación reportada de una sola aguja varió entre 78% y 99%. La capacidad anunciada era idéntica, pero los resultados no. La compra debe probar el comportamiento de recuperación, no comparar solo límites de contexto.
A large context window is not the hardest enterprise problem. The best reported agentic RAG method scored 32.96 across a pool of 39,190 mixed artifacts. Heterogeneous repositories turn search quality into an architectural bottleneck.
Una ventana de contexto grande no es el problema empresarial más difícil. El mejor método reportado de RAG agéntico obtuvo 32,96 en un conjunto de 39.190 artefactos mixtos. Los repositorios heterogéneos convierten la calidad de búsqueda en un cuello de botella arquitectónico.
At equal rates, sending 1 million tokens costs 100 times as much as sending 10,000. Representative 2024 list prices ranged from $3 to $7 per million input tokens. Long context can win a task and still lose the operating model.
Con la misma tarifa, enviar 1 millón de tokens cuesta 100 veces más que enviar 10.000. Los precios de lista representativos de 2024 variaron entre US$3 y US$7 por millón de tokens de entrada. El contexto largo puede ganar una tarea y aun así perder en el modelo operativo.
RAG began with a measurable accuracy gain on a knowledge-intensive task. The reported scores were 44.5 and 42.9. That validates retrieval as a technique, not as a complete permission, currency or audit system.
RAG comenzó con una mejora medible de precisión en una tarea intensiva en conocimiento. Las puntuaciones reportadas fueron 44,5 y 42,9. Eso valida la recuperación como técnica, no como sistema completo de permisos, vigencia o auditoría.
Austria announced GovGPT for more than 180,000 federal staff. Public reporting described ChatPetrobras as potentially serving more than 100,000 workers. At that scale, identity, spending and audit controls cannot be rebuilt inside every assistant.
Austria anunció GovGPT para más de 180.000 empleados federales. Informes públicos describieron ChatPetrobras con potencial para servir a más de 100.000 trabajadores. A esa escala, identidad, gasto y auditoría no pueden reconstruirse dentro de cada asistente.
This factory case makes the knowledge layer tangible. The agent indexed 4,500 technical documents and reduced average procedure search from 18 minutes to 40 seconds. The value came from organizing and retrieving plant knowledge.
Este caso industrial vuelve tangible la capa de conocimiento. El agente indexó 4.500 documentos técnicos y redujo la búsqueda promedio de procedimientos de 18 minutos a 40 segundos. El valor provino de organizar y recuperar conocimiento de la planta.
Agent systems can extend one controlled service across enormous information estates. Alberta reportedly used 50 agents to scan 466 million lines of government code in roughly 20 hours. Scale makes shared orchestration and audit services more important, not less.
Los sistemas de agentes pueden extender un servicio controlado sobre enormes conjuntos de información. Alberta utilizó, según el reporte, 50 agentes para revisar 466 millones de líneas de código gubernamental en unas 20 horas. La escala aumenta la importancia de la orquestación y la auditoría compartidas.
ADNOC reported improvements of up to 75% in geological modeling and 70% in seismic interpretation. Its description of ENERGYai combines language models with proprietary subsurface knowledge and industrial workflows. The numbers remain company-reported pilot evidence.
ADNOC reportó mejoras de hasta 75% en modelado geológico y 70% en interpretación sísmica. Su descripción de ENERGYai combina modelos de lenguaje con conocimiento propietario del subsuelo y procesos industriales. Las cifras siguen siendo evidencia piloto reportada por la empresa.
A temperature is unsafe to interpret without equipment identity, engineering unit, timestamp and operating context. NIST separates operational technology because failures can affect safety, reliability, production and physical processes. Industrial agents need stronger validation before they can act.
Una temperatura no puede interpretarse de forma segura sin identidad del equipo, unidad de ingeniería, hora y contexto operativo. NIST separa la tecnología operacional porque las fallas pueden afectar seguridad, confiabilidad, producción y procesos físicos. Los agentes industriales necesitan mayor validación antes de actuar.
The suite assistant has genuine value. Microsoft reported that 70% of early users felt more productive and 77% did not want to give it up. A shared enterprise layer should complement this experience, not force the company to abandon it.
El asistente de la suite tiene valor real. Microsoft reportó que 70% de los primeros usuarios se sintió más productivo y 77% no quería dejarlo. Una capa empresarial compartida debe complementar esa experiencia, no obligar a la empresa a abandonarla.
McKinsey reported that 44% of relevant respondents had experienced inaccuracy. It was the most commonly reported negative consequence. Controlled knowledge is therefore a risk response as well as a productivity strategy.
McKinsey reportó que 44% de los encuestados relevantes había experimentado inexactitud. Fue la consecuencia negativa reportada con mayor frecuencia. El conocimiento controlado es una respuesta de riesgo además de una estrategia de productividad.
A 1,000-seat deployment costs $30,000 each month at the historical price whether people use it or not. Under the supplied consumption assumption, model charges range from $200 to $20,000. Engineering and support must still be added before deciding.
Un despliegue de 1.000 licencias cuesta US$30.000 al mes al precio histórico, se use o no. Bajo el supuesto de consumo entregado, los cargos del modelo varían entre US$200 y US$20.000. Aún deben añadirse ingeniería y soporte antes de decidir.
Industrial announcements rarely disclose all 5 essentials needed to judge a result. A controlled pilot should also measure 5 operational outcomes, including citation accuracy and obsolete-version leakage. The company needs its own evidence before promising return.
Los anuncios industriales rara vez divulgan los 5 elementos esenciales para juzgar un resultado. Un piloto controlado también debe medir 5 resultados operativos, incluidos precisión de citas y filtración de versiones obsoletas. La empresa necesita evidencia propia antes de prometer retorno.
NIST identifies 12 generative AI risk categories, including confabulation, privacy and information security. It organizes the work into 4 functions: Govern, Map, Measure and Manage. Approval is therefore the start of control, not its end.
NIST identifica 12 categorías de riesgo de IA generativa, incluidas confabulación, privacidad y seguridad de la información. Organiza el trabajo en 4 funciones: gobernar, mapear, medir y gestionar. La aprobación es el inicio del control, no su final.
Siemens and Microsoft announced an industrial copilot in 2023. Austria then ran an on-premises knowledge-management pilot from May 2024 through April 2025. Japan approved a normative generative AI procurement guideline on June 12, 2026.
Siemens y Microsoft anunciaron un copiloto industrial en 2023. Austria ejecutó después un piloto local de gestión del conocimiento entre mayo de 2024 y abril de 2025. Japón aprobó una directriz normativa de contratación de IA generativa el 12 de junio de 2026.
ISO 15489 governs the creation, capture and management of official records. ISO 42001 adds a management system for organizations using AI. The EU AI Act brings documentation, logging, data governance and human oversight into staged legal obligations for high-risk systems.
ISO 15489 gobierna la creación, captura y gestión de registros oficiales. ISO 42001 añade un sistema de gestión para organizaciones que usan IA. La Ley de IA de la UE incorpora documentación, registros, gobernanza de datos y supervisión humana en obligaciones legales graduales para sistemas de alto riesgo.
A reusable platform can centralize 6 services: identity, retrieval, model routing, evaluation, cost metering and audit logging. Office assistants can consume them, while industrial agents use stricter permissions. The company owns the control layer without owning every interface.
Una plataforma reutilizable puede centralizar 6 servicios: identidad, recuperación, enrutamiento, evaluación, medición de costos y registro auditable. Los asistentes ofimáticos pueden consumirlos, mientras los agentes industriales usan permisos más estrictos. La empresa controla la capa sin poseer cada interfaz.
A 2024 study found sufficiently resourced long-context models often outperformed RAG, while RAG remained substantially cheaper in its tested settings. arXiv
ADNOC reported pilot improvements of up to 70% for seismic interpretation and 75% for geological modeling through ENERGYai. ADNOC
Reviewed industrial announcements rarely disclosed all five essentials: baseline, sample size, active users, error definition and independent validation. National Institute of Standards and Technology
At an assumed $0.02 per query, 1,000 users making 10, 100 or 1,000 monthly queries generate $200, $2,000 or $20,000 in model charges. OpenAI
The best agentic RAG method scored 32.96 out of 100 on an enterprise pool containing 39,190 heterogeneous artifacts. particula.tech
Advertised context capacity rose from 128,000 tokens in GPT-4 Turbo to 200,000 in Claude 3 and 1 million in Gemini 1.5. OpenAI
Representative 2024 list prices ranged from $3 to $7 per million input tokens for several leading long-context model APIs. Anthropic
RAG cannot alone guarantee current versions, inherited permissions or valid citations because these depend on source governance and validation controls. National Institute of Standards and Technology
With equal per-token rates, processing 1 million input tokens costs 100 times as much as processing 10,000 input tokens. OpenAI
Public reporting described ChatPetrobras as an internal generative AI initiative intended to serve a potential population exceeding 100,000 workers. en.clickpetroleoegas.com.br
Public ChatPetrobras materials reviewed did not quantify paragraph-citation accuracy, obsolete-version leakage or reductions in operational errors.
The argument
A larger desk holds more binders, but does not find the right paragraph.
The same context size does not deliver the same retrieval reliability.
The best tested method scored 32.96 across 39,190 mixed artifacts.
Selective retrieval buys economic headroom even when full context answers better.
Retrieval improved grounded answering, but did not certify enterprise governance.
Shared knowledge services become infrastructure when reach exceeds 100,000 people.
This research is published in English and Spanish. Ver en español
La investigación detrás de esta presentación
La recuperación es una decisión arquitectónica, no una ganadora automática en precisión. Estos términos separan la capacidad del modelo del control empresarial.
Un estudio de 2024 encontró que modelos de contexto largo con recursos suficientes frecuentemente superaron a RAG, mientras RAG siguió siendo sustancialmente más barato. arXiv
ADNOC reportó mejoras piloto de hasta 70% en interpretación sísmica y 75% en modelado geológico mediante ENERGYai. ADNOC
Los anuncios industriales revisados rara vez divulgaron los cinco elementos esenciales: línea base, muestra, usuarios activos, definición de error y validación independiente. National Institute of Standards and Technology
Con un supuesto de US$0,02 por consulta, 1.000 usuarios con 10, 100 o 1.000 consultas generan US$200, US$2.000 o US$20.000. OpenAI
El mejor método de RAG agéntico obtuvo 32,96 sobre 100 en un conjunto empresarial de 39.190 artefactos heterogéneos. particula.tech
La capacidad anunciada subió de 128.000 tokens en GPT-4 Turbo a 200.000 en Claude 3 y un millón en Gemini 1.5. OpenAI
Precios de lista representativos de 2024 oscilaron entre US$3 y US$7 por millón de tokens de entrada para varias API de contexto largo. Anthropic
RAG no puede garantizar por sí solo versiones vigentes, permisos heredados o citas válidas porque dependen de gobernanza de fuentes y controles de validación. National Institute of Standards and Technology
Con la misma tarifa por token, procesar un millón de tokens de entrada cuesta 100 veces más que procesar 10.000. OpenAI
Informes públicos describieron ChatPetrobras como una iniciativa interna de IA generativa destinada a una población potencial superior a 100.000 trabajadores. en.clickpetroleoegas.com.br
Los materiales públicos revisados de ChatPetrobras no cuantificaron precisión de citas por párrafo, filtración de versiones obsoletas ni reducción de errores operativos.
El argumento
Un escritorio más grande admite más carpetas, pero no encuentra el párrafo correcto.
El mismo tamaño de contexto no entrega la misma confiabilidad de recuperación.
El mejor método probado obtuvo 32,96 entre 39.190 artefactos mixtos.
La recuperación selectiva crea margen económico incluso si el contexto completo responde mejor.
La recuperación mejoró respuestas fundamentadas, pero no certificó gobernanza empresarial.
Los servicios compartidos de conocimiento se vuelven infraestructura al superar 100.000 personas.
Esta investigación se publica en inglés y español. Read in English