Start with the uncomfortable result. Across 58 reviewed integration failures, deterministic rules scored 89.7%, slightly above the LLM at 87.9%. This is one small practitioner evaluation, not a universal ranking. It still exposes the core design principle: use models where ambiguity requires them, not where a rule is clearer.
Comencemos con el resultado incómodo. En 58 fallas de integración revisadas, las reglas deterministas lograron 89,7%, ligeramente por encima del 87,9% del LLM. Es una evaluación pequeña de un profesional, no una clasificación universal. Aun así, revela el principio central: use modelos donde la ambigüedad los exija, no donde una regla sea más clara.
The deck uses four technical terms repeatedly. QLoRA changes memory economics, while seccomp limits operating-system behavior. Schema adherence checks form, and FActScore checks factual support. Keeping these ideas separate prevents one safeguard from being mistaken for another.
La presentación usa cuatro términos técnicos de forma repetida. QLoRA cambia la economía de memoria, mientras seccomp limita el comportamiento del sistema operativo. El cumplimiento del esquema comprueba la forma y FActScore comprueba el respaldo factual. Separar estas ideas evita confundir una protección con otra.
Hermes Agent should be treated as the operating procedure, not the worker. The Hermes 3 family stretches from 8B to 405B parameters. Four-bit weights reduce storage sharply, but runtime overhead still matters. The model choice therefore belongs to each role, not to the agent framework as a whole.
Hermes Agent debe tratarse como el procedimiento operativo, no como el trabajador. La familia Hermes 3 abarca desde 8B hasta 405B parámetros. Los pesos de cuatro bits reducen mucho el almacenamiento, pero la sobrecarga de ejecución sigue importando. Por eso, la elección del modelo corresponde a cada función, no al marco de agentes completo.
A parameter label is not a hardware bill. QLoRA fine-tuned a quantized 65B model on one 48 GB GPU. Training, inference, quantization, cache size, and context length create different memory profiles. Benchmark kbot's exact workload instead of rejecting a model from its parameter count alone.
Una etiqueta de parámetros no es una factura de hardware. QLoRA ajustó un modelo cuantizado de 65B en una GPU de 48 GB. El entrenamiento, la inferencia, la cuantización, la caché y el contexto crean perfiles de memoria distintos. Pruebe la carga exacta de kbot en lugar de descartar un modelo solo por sus parámetros.
Model selection must account for the physical hardware available to kbot.
La selección del modelo debe considerar el hardware físico disponible para kbot.
Recent Debian stable releases followed a roughly 2-year rhythm. sid is the moving development stream feeding that cycle, so a working installation can change beneath kbot. Record package versions, isolate the environment, and preserve rebuild inputs. Otherwise, debugging the agent also means debugging an undocumented operating-system state.
Las versiones estables recientes de Debian siguieron un ritmo cercano a 2 años. sid es la corriente de desarrollo cambiante que alimenta ese ciclo, por lo que una instalación funcional puede cambiar bajo kbot. Registre las versiones, aísle el entorno y conserve los elementos de reconstrucción. De lo contrario, depurar el agente también implica depurar un estado del sistema operativo sin documentar.
A moving distribution becomes manageable when its past states remain addressable. Debian Snapshot provides historical package archives dating to 2005. That does not make every sid build automatically reproducible. It gives kbot a rollback source when package names, versions, and repository dates are recorded.
Una distribución cambiante se vuelve manejable cuando sus estados anteriores siguen disponibles. Debian Snapshot ofrece archivos históricos desde 2005. Esto no hace que cada instalación de sid sea reproducible automáticamente. Proporciona una fuente de reversión cuando se registran nombres, versiones y fechas de repositorios.
Reproducibility moved from an aspiration to a release condition. A secondary report dated May 10, 2026 said Debian 14 would block packages that fail reproducibility or regress after the project had hovered near 96%. kbot should follow the same logic locally. A build that cannot be reconstructed should not become the trusted production baseline.
La reproducibilidad pasó de aspiración a condición de publicación. Un informe secundario del 10 de mayo de 2026 indicó que Debian 14 bloquearía paquetes que fallaran o retrocedieran tras mantenerse el proyecto cerca de 96%. kbot debe aplicar la misma lógica localmente. Una compilación que no pueda reconstruirse no debe convertirse en la base de producción.
Give the robot its own badge and locked storeroom. Unix mode 700 limits directory access to the owner, while 750 admits an approved group and 755 admits all local users with different write rights. Start kbot's private workspace at 700. Grant every broader capability explicitly and record why it exists.
Dé al robot su propia credencial y un almacén cerrado. El modo Unix 700 limita el acceso al propietario, 750 admite un grupo autorizado y 755 admite a todos los usuarios locales con distintos permisos de escritura. Empiece el espacio privado de kbot con 700. Conceda cada capacidad adicional de forma explícita y registre su motivo.
Removing sudo from kbot is still worthwhile. Two reported flaws, CVE-2025-32462 and CVE-2025-32463, allowed a local user to gain root-level access and full machine control. But removing one escalation path is not complete containment. kbot can still misuse every resource already available to its ordinary user identity.
Quitar sudo a kbot sigue siendo útil. Dos fallas informadas, CVE-2025-32462 y CVE-2025-32463, permitían a un usuario local obtener acceso root y control total del equipo. Pero eliminar una vía de elevación no constituye aislamiento completo. kbot aún puede abusar de cada recurso disponible para su identidad ordinaria.
Taking away the master key helps, but it does not lock every drawer. Docker's default seccomp profile blocks about 44 system calls while allowing hundreds. A kbot user can also reach any secret, repository, process, or network destination already authorized to that identity. Real containment needs several independent boundaries.
Quitar la llave maestra ayuda, pero no cierra todos los cajones. El perfil seccomp predeterminado de Docker bloquea unas 44 llamadas del sistema y permite cientos. Un usuario kbot también puede alcanzar cualquier secreto, repositorio, proceso o destino de red ya autorizado para esa identidad. El aislamiento real necesita varias barreras independientes.
Agent containment protects the infrastructure where data is stored and processed.
La contención de agentes protege la infraestructura donde se almacenan y procesan datos.
Advertised windows differed dramatically in 2024, from 128K to 2M tokens. RULER evaluated 17 models and found that many struggled before their stated limit. Recursive Language Models later handled inputs up to 2 orders of magnitude beyond model windows, showing that architecture can extend reach. For kbot, start with a proposed maximum of 24 investigation turns and escalate when the budget expires.
Las ventanas anunciadas diferían mucho en 2024, desde 128K hasta 2M tokens. RULER evaluó 17 modelos y encontró que muchos fallaban antes de su límite declarado. Los Modelos de Lenguaje Recursivos procesaron después entradas hasta 2 órdenes de magnitud mayores que las ventanas, mostrando que la arquitectura puede ampliar el alcance. Para kbot, empiece con un máximo propuesto de 24 turnos y eleve el caso cuando se agote.
The scout is a metal detector, not the excavation team. Agentless reported resolving 27.33% of SWE-bench Lite at about $0.34 per issue under historical pricing. That is useful coverage for an inexpensive first pass, but 72.67% remained unresolved. Escalation is part of the design, not evidence that the scout failed.
El explorador es un detector de metales, no el equipo de excavación. Agentless informó resolver 27,33% de SWE-bench Lite por unos US$0,34 por incidencia con precios históricos. Es una cobertura útil para una primera pasada económica, pero 72,67% quedó sin resolver. La elevación forma parte del diseño, no demuestra que el explorador haya fallado.
Formatting resembles completing a tax form, not writing an essay. Constrained output can keep every answer inside the required boxes. It cannot determine whether the severity or challenge label is true. kbot therefore needs both schema validation and deterministic checks against the underlying incident.
Formatear se parece a completar un formulario fiscal, no a escribir un ensayo. La salida restringida puede mantener cada respuesta dentro de las casillas exigidas. No puede determinar si la etiqueta de severidad o dificultad es verdadera. Por eso, kbot necesita validación del esquema y comprobaciones deterministas contra el incidente.
A report specialist needs more than a large context window. LongBench spans 21 datasets, 6 task categories, and 2 languages, making it useful for screening long-document models. It does not measure whether kbot's final severity claims match the incident evidence. Feed the writer selected findings and citations, then verify the report claim by claim.
Un especialista en informes necesita más que una gran ventana de contexto. LongBench abarca 21 conjuntos de datos, 6 categorías y 2 idiomas, por lo que sirve para filtrar modelos de documentos extensos. No mide si las severidades finales de kbot coinciden con la evidencia del incidente. Entregue hallazgos seleccionados y citas, y después verifique el informe afirmación por afirmación.
More AI did not align with every outcome moving together. DORA associated 25% higher adoption with 3.4% better code quality but 7.2% lower delivery stability. The result is correlational and methodology-limited, yet the split matters. Separate design, repository discovery, requirements criticism, testing, and delivery verification.
Una mayor adopción de IA no se relacionó con mejoras en todos los resultados. DORA asoció una adopción 25% mayor con 3,4% más calidad del código, pero 7,2% menos estabilidad de entrega. El resultado es correlacional y tiene límites metodológicos, pero la separación importa. Divida diseño, exploración, crítica de requisitos, pruebas y verificación de entrega.
Multiple reasoning paths can outperform one answer. In this reported GSM8K result, self-consistency raised accuracy from 56.5% to 74.4%, a gain of 17.9 points. That supports separating proposal and review roles for difficult architecture decisions. It does not prove that adding agents always helps, so measure the gain against latency and cost.
Varios caminos de razonamiento pueden superar una sola respuesta. En este resultado informado de GSM8K, la autoconsistencia elevó la exactitud de 56,5% a 74,4%, una mejora de 17,9 puntos. Esto respalda separar propuesta y revisión en decisiones difíciles. No demuestra que añadir agentes siempre ayude, por lo que debe medir la mejora frente a latencia y coste.
A model may draft the electrical plan, but it should not connect the live grid. In one 2022 study, about 40% of 1,689 generated programs were classified as vulnerable under selected scenarios. The estimate is narrow and does not describe every model or prompt. It still makes automated scanning and human approval essential for high-impact production changes.
Un modelo puede dibujar el plano eléctrico, pero no debe conectarlo a la red activa. En un estudio de 2022, cerca de 40% de 1.689 programas generados fueron clasificados como vulnerables en escenarios seleccionados. La estimación es limitada y no describe todos los modelos ni instrucciones. Aun así, hace esenciales el análisis automático y la aprobación humana para cambios críticos.
The router is a clinic, not a price-comparison engine. A proposed starting policy sends 70% of low-risk work to a local model, 20% to a hosted strong model, and 10% to human review. Production access, exposed credentials, destructive commands, and low confidence should bypass ordinary cost routing. Measure and revise every share from replay results.
El enrutador es una clínica, no un comparador de precios. Una política inicial propuesta envía 70% del trabajo de bajo riesgo a un modelo local, 20% a un modelo alojado potente y 10% a revisión humana. El acceso a producción, las credenciales expuestas, los comandos destructivos y la baja confianza deben evitar el enrutamiento normal por coste. Mida y revise cada proporción con resultados de repetición.
Routing can create real economic leverage. FrugalGPT reported reductions reaching 98% while matching the best individual model on selected tasks. The phrase selected tasks carries the caveat: a router can also send the wrong case to the wrong model. Treat routing accuracy as a production metric, not hidden plumbing.
El enrutamiento puede crear una ventaja económica real. FrugalGPT informó reducciones de hasta 98% mientras igualaba al mejor modelo individual en tareas seleccionadas. La frase tareas seleccionadas contiene la salvedad: un enrutador también puede enviar el caso equivocado al modelo equivocado. Trate la exactitud del enrutamiento como una métrica de producción, no como infraestructura invisible.
AgentBench is broad enough to expose different kinds of agent behavior. Its eight environments include operating-system and database tasks, which are relevant to kbot. Yet no public benchmark reproduces kbot's permissions, repositories, tools, failure patterns, and escalation policy. Use benchmark scores to shortlist models, then decide with replay tests from real incidents.
AgentBench es lo bastante amplio para revelar distintos comportamientos de agentes. Sus ocho entornos incluyen tareas de sistemas operativos y bases de datos, relevantes para kbot. Sin embargo, ninguna prueba pública reproduce los permisos, repositorios, herramientas, fallas y políticas de elevación de kbot. Use las puntuaciones para preseleccionar modelos y decida con repeticiones de incidentes reales.
Build kbot as a controlled team, not one oversized model. Match each role to its workload, restrict its authority, validate its outputs, and escalate uncertainty through replay-tested gates.
Key findings
AgentDojo introduced 97 realistic tasks and 629 security test cases, and some evaluated prompt-injection attacks achieved success rates above 80%. ETH Zurich
OpenAI reported 100% schema adherence for constrained Structured Outputs, compared with 35.9% for GPT-4-0613 using prompting alone. OpenAI
DORA reported that 25% higher AI adoption correlated with 3.4% better code quality but 7.2% lower delivery stability in its 2024 analysis. Google Cloud
A 2022 Copilot study generated 1,689 programs and classified approximately 40% as vulnerable under its selected security scenarios. New York University
FrugalGPT reported cost reductions reaching 98% while matching the best individual model on selected benchmark tasks through model cascades. Stanford University
On May 10, 2026, Debian made reproducibility a Debian 14 release gate, blocking packages that fail or regress after reproducibility had hovered near 96%. patchwindow.serverdigital.net
Across 58 hand-reviewed integration failures, deterministic rules achieved 89.7% classification accuracy versus 87.9% for the LLM. dev.to
Recursive Language Models handled inputs up to two orders of magnitude beyond model context windows and outperformed base models and common long-context scaffolds across four task types. arxiv.org
Agentless reported resolving 27.33% of SWE-bench Lite with an average model cost near $0.34 per issue under historical pricing. University of Illinois Urbana-Champaign
RULER evaluated 17 long-context models and found that many performed poorly before reaching their advertised maximum context lengths. NVIDIA
Self-consistency raised reported PaLM 540B GSM8K accuracy from 56.5% to 74.4% by aggregating multiple reasoning paths. Google Research
EvalPlus expanded HumanEval and MBPP testing by roughly 80 times and reported pass-rate reductions reaching 19.3 percentage points for some models. University of Illinois Urbana-Champaign
The argument
In one 58-case integration test, deterministic rules scored 89.7% versus 87.9% for the LLM.
Hermes 3 spans 8B, 70B, and 405B parameters, so the family name alone cannot determine deployment.
QLoRA fine-tuned a quantized 65B model on one 48 GB GPU.
Debian stable releases followed a roughly 2-year rhythm, while Snapshot preserves package history from 2005.
Advertised context ranged from 128K to 2M tokens, yet usable performance could fail earlier.
Agentless resolved 27.33% of SWE-bench Lite for about $0.34 per issue under historical pricing.
DORA associated 25% higher AI adoption with 3.4% better code quality and 7.2% lower delivery stability.
FrugalGPT reported cost reductions reaching 98% on selected tasks through model cascades.
This research is published in English and Spanish. Ver en español
La investigación detrás de esta presentación
Construya kbot como un equipo controlado, no como un único modelo enorme. Adapte cada función a su carga, limite su autoridad, valide sus resultados y eleve la incertidumbre mediante controles probados con incidentes.
Hallazgos clave
AgentDojo introdujo 97 tareas realistas y 629 casos de seguridad, y algunos ataques de inyección evaluados alcanzaron tasas superiores a 80%. ETH Zurich
OpenAI informó 100% de cumplimiento de esquema con Structured Outputs restringidos, frente a 35,9% de GPT-4-0613 usando solo instrucciones. OpenAI
DORA informó que una adopción de IA 25% mayor se correlacionó con 3,4% más calidad de código y 7,2% menos estabilidad de entrega en 2024. Google Cloud
Un estudio de Copilot de 2022 generó 1.689 programas y clasificó aproximadamente 40% como vulnerables bajo sus escenarios seleccionados. New York University
FrugalGPT informó reducciones de coste de hasta 98% manteniendo al mejor modelo individual en tareas seleccionadas mediante cascadas. Stanford University
El 10 de mayo de 2026, Debian convirtió la reproducibilidad en un requisito de Debian 14 y bloqueó paquetes que fallaran o retrocedieran, tras años cerca del 96%. patchwindow.serverdigital.net
En 58 fallas de integración revisadas manualmente, las reglas deterministas lograron 89,7% de exactitud de clasificación frente a 87,9% del LLM. dev.to
Los Modelos de Lenguaje Recursivos procesaron entradas hasta dos órdenes de magnitud mayores que la ventana de contexto y superaron modelos base y estructuras comunes en cuatro tipos de tareas. arxiv.org
Agentless informó resolver 27,33% de SWE-bench Lite con un coste medio cercano a 0,34 dólares por incidencia bajo precios históricos. University of Illinois Urbana-Champaign
RULER evaluó 17 modelos de contexto largo y encontró que muchos rindieron mal antes de alcanzar sus longitudes máximas anunciadas. NVIDIA
La autoconsistencia elevó la precisión informada de PaLM 540B en GSM8K de 56,5% a 74,4% al agregar múltiples caminos de razonamiento. Google Research
EvalPlus amplió aproximadamente 80 veces las pruebas de HumanEval y MBPP e informó reducciones de hasta 19,3 puntos porcentuales para algunos modelos. University of Illinois Urbana-Champaign
El argumento
En una prueba de integración con 58 casos, las reglas lograron 89,7% frente a 87,9% del LLM.
Hermes 3 abarca 8B, 70B y 405B parámetros, por lo que la familia no determina por sí sola el despliegue.
QLoRA ajustó un modelo cuantizado de 65B en una sola GPU de 48 GB.
Las versiones estables de Debian siguieron un ritmo cercano a 2 años, mientras Snapshot conserva paquetes desde 2005.
El contexto anunciado iba de 128K a 2M tokens, pero el rendimiento útil podía fallar antes.
Agentless resolvió 27,33% de SWE-bench Lite por unos US$0,34 por incidencia con precios históricos.
DORA asoció una adopción de IA 25% mayor con 3,4% más calidad y 7,2% menos estabilidad de entrega.
FrugalGPT informó reducciones de coste de hasta 98% en tareas seleccionadas mediante cascadas de modelos.
Esta investigación se publica en inglés y español. Read in English