Hanademi

The right model for every agent

23 slides · 22 min · 1 minute ago language
ENES
theme
LightDark
view
DeckTableTalk
brand
HanademiPlatzi
The right model for every agentMade for Gabriel Cavedal, by Hanademi
El modelo adecuado para cadaagenteMade for Gabriel Cavedal, by Hanademi
Simple rules beat the LLM in one failuretestClassification accuracy across 58 hand-reviewed integration failures, percent.Made for Gabriel Cavedal, by HanademiSources: dev.to.Unitaccuracy89.7%Deterministic rules87.9%LLM
Start with the uncomfortable result. Across 58 reviewed integration failures, deterministic rules scored 89.7%, slightly above the LLM at 87.9%. This is one small practitioner evaluation, not a universal ranking. It still exposes the core design principle: use models where ambiguity requires them, not where a rule is clearer.
Sources
Reglas simples superaron al LLM en unaprueba de fallasExactitud de clasificación en 58 fallas de integración revisadas manualmente, porcentaje.Made for Gabriel Cavedal, by HanademiFuentes: dev.to.Unidadexactitud89,7 %Reglas deterministas87,9 %LLM
Comencemos con el resultado incómodo. En 58 fallas de integración revisadas, las reglas deterministas lograron 89,7%, ligeramente por encima del 87,9% del LLM. Es una evaluación pequeña de un profesional, no una clasificación universal. Aun así, revela el principio central: use modelos donde la ambigüedad los exija, no donde una regla sea más clara.
Fuentes
Four terms to knowMade for Gabriel Cavedal, by HanademiQLoRAA memory-saving method for tuning a quantized language model.seccompA Linux filter that permits or blocks system calls.Schema adherenceWhether output follows a required structure and data type.FActScoreA method that checks individual claims against a chosen source.
The deck uses four technical terms repeatedly. QLoRA changes memory economics, while seccomp limits operating-system behavior. Schema adherence checks form, and FActScore checks factual support. Keeping these ideas separate prevents one safeguard from being mistaken for another.
Cuatro términos claveMade for Gabriel Cavedal, by HanademiQLoRAUn método que ahorra memoria al ajustar un modelo cuantizado.seccompUn filtro de Linux que permite o bloquea llamadas del sistema.Cumplimiento del esquemaSi el resultado respeta una estructura y tipos de datos exigidos.FActScoreUn método que comprueba afirmaciones contra una fuente elegida.
La presentación usa cuatro términos técnicos de forma repetida. QLoRA cambia la economía de memoria, mientras seccomp limita el comportamiento del sistema operativo. El cumplimiento del esquema comprueba la forma y FActScore comprueba el respaldo factual. Separar estas ideas evita confundir una protección con otra.
Hermes is a family, not one deploymentchoiceHermes 3 checkpoint sizes and approximate four-bit raw-weight storage before runtime overhead.Made for Gabriel Cavedal, by HanademiSources: Nous Research. (2024). Hermes 3 model collection.; Dettmers, T., Pagnoni, A., Holtzman, A., & Zettlemoyer, L. (2023).QLoRA: Efficient finetuning of quantized LLMs.; Hugging Face. (2024). Bitsandbytes quantization documentation.Unitparameters and GBHermes 3 sizes870405Hermes 3 8BHermes 3 70BHermes 3 405BApproximate four-bit weights3.516357B32B70B
Hermes Agent should be treated as the operating procedure, not the worker. The Hermes 3 family stretches from 8B to 405B parameters. Four-bit weights reduce storage sharply, but runtime overhead still matters. The model choice therefore belongs to each role, not to the agent framework as a whole.
Hermes es una familia, no una únicaelecciónTamaños de Hermes 3 y almacenamiento aproximado de pesos de cuatro bits antes de la sobrecarga deejecución.Made for Gabriel Cavedal, by HanademiFuentes: Nous Research. (2024). Hermes 3 model collection.; Dettmers, T., Pagnoni, A., Holtzman, A., & Zettlemoyer, L. (2023).QLoRA: Efficient finetuning of quantized LLMs.; Hugging Face. (2024). Bitsandbytes quantization documentation.Unidadparámetros y GBTamaños de Hermes 3870405Hermes 3 8BHermes 3 70BHermes 3 405BPesos aproximados de cuatro bits3,516357B32B70B
Hermes Agent debe tratarse como el procedimiento operativo, no como el trabajador. La familia Hermes 3 abarca desde 8B hasta 405B parámetros. Los pesos de cuatro bits reducen mucho el almacenamiento, pero la sobrecarga de ejecución sigue importando. Por eso, la elección del modelo corresponde a cada función, no al marco de agentes completo.
Parameter count does not equal requiredGPU memoryMemory examples in GB: raw four-bit weights for 7B and 32B models, plus the QLoRA device used tofine-tune 65B.Made for Gabriel Cavedal, by HanademiSources: Dettmers, T., Pagnoni, A., Holtzman, A., & Zettlemoyer, L. (2023). QLoRA: Efficient finetuning of quantized LLMs. Advances in NeuralInformation Processing Systems, 36.The first two values are raw weight storage.UnitGB7B raw weights3.532B raw weights1665B QLoRA device48
A parameter label is not a hardware bill. QLoRA fine-tuned a quantized 65B model on one 48 GB GPU. Training, inference, quantization, cache size, and context length create different memory profiles. Benchmark kbot's exact workload instead of rejecting a model from its parameter count alone.
El número de parámetros no equivale a lamemoria GPUEjemplos de memoria en GB: pesos de cuatro bits para modelos 7B y 32B, más la GPU usada por QLoRApara ajustar 65B.Made for Gabriel Cavedal, by HanademiFuentes: Dettmers, T., Pagnoni, A., Holtzman, A., & Zettlemoyer, L. (2023). QLoRA: Efficient finetuning of quantized LLMs. Advances in NeuralInformation Processing Systems, 36.Los dos primeros valores son almacenamiento de pesos.UnidadGBPesos 7B3,5Pesos 32B16GPU QLoRA 65B48
Una etiqueta de parámetros no es una factura de hardware. QLoRA ajustó un modelo cuantizado de 65B en una GPU de 48 GB. El entrenamiento, la inferencia, la cuantización, la caché y el contexto crean perfiles de memoria distintos. Pruebe la carga exacta de kbot en lugar de descartar un modelo solo por sus parámetros.
Compute is physicalA processor sits among components and traces on a circuit board.Sources: Debian Must Now Ship Reproducible Packages. phoronix.com.
Model selection must account for the physical hardware available to kbot.
El cómputo es físicoUn procesador se encuentra entre componentes y pistas de una placa de circuito.Fuentes: Debian Must Now Ship Reproducible Packages. phoronix.com.
La selección del modelo debe considerar el hardware físico disponible para kbot.
Debian stable releases arrived about every2 yearsApproximate months from each predecessor to Debian 9, 10, 11, and 12.Made for Gabriel Cavedal, by HanademiSources: Debian Project. (2023). Debian releases.; Debian Project. (2023). Debian release information.Unitmonths22242626Debian 925Debian 1025Debian 1122Debian 12Mean 24.5 months
Recent Debian stable releases followed a roughly 2-year rhythm. sid is the moving development stream feeding that cycle, so a working installation can change beneath kbot. Record package versions, isolate the environment, and preserve rebuild inputs. Otherwise, debugging the agent also means debugging an undocumented operating-system state.
Las versiones estables de Debian llegaroncada 2 añosMeses aproximados desde cada predecesor hasta Debian 9, 10, 11 y 12.Made for Gabriel Cavedal, by HanademiFuentes: Debian Project. (2023). Debian releases.; Debian Project. (2023). Debian release information.Unidadmeses22242626Debian 925Debian 1025Debian 1122Debian 12Media de 24,5 meses
Las versiones estables recientes de Debian siguieron un ritmo cercano a 2 años. sid es la corriente de desarrollo cambiante que alimenta ese ciclo, por lo que una instalación funcional puede cambiar bajo kbot. Registre las versiones, aísle el entorno y conserve los elementos de reconstrucción. De lo contrario, depurar el agente también implica depurar un estado del sistema operativo sin documentar.
Debian Snapshot preserves package historyfrom 2005Archive and release milestones used to orient the available reconstruction span, calendar year.Made for Gabriel Cavedal, by HanademiSources: Debian Project. (2024). snapshot.debian.org.; debian - snapshot.debian.org.UnityearArchive start2005Debian 9 release2017Debian 12 release2023
A moving distribution becomes manageable when its past states remain addressable. Debian Snapshot provides historical package archives dating to 2005. That does not make every sid build automatically reproducible. It gives kbot a rollback source when package names, versions, and repository dates are recorded.
Debian Snapshot conserva paquetes desde2005Hitos del archivo y de versiones que orientan el periodo disponible para reconstrucción, año.Made for Gabriel Cavedal, by HanademiFuentes: Debian Project. (2024). snapshot.debian.org.; debian - snapshot.debian.org.UnidadañoInicio del archivo2005Publicación de Debian 92017Publicación de Debian 122023
Una distribución cambiante se vuelve manejable cuando sus estados anteriores siguen disponibles. Debian Snapshot ofrece archivos históricos desde 2005. Esto no hace que cada instalación de sid sea reproducible automáticamente. Proporciona una fuente de reversión cuando se registran nombres, versiones y fechas de repositorios.
On May 10, 2026, Debian set the gate afterhovering near 96%.This finding comes from a secondary report and should be checked against Debian'sformal release documentation before operational use.Sources: patchwindow.serverdigital.net.
Reproducibility moved from an aspiration to a release condition. A secondary report dated May 10, 2026 said Debian 14 would block packages that fail reproducibility or regress after the project had hovered near 96%. kbot should follow the same logic locally. A build that cannot be reconstructed should not become the trusted production baseline.
El 10 de mayo de 2026, Debian fijó elrequisito cerca de 96%.Este hallazgo procede de un informe secundario y debe comprobarse con ladocumentación formal de Debian antes de su uso operativo.Fuentes: patchwindow.serverdigital.net.
La reproducibilidad pasó de aspiración a condición de publicación. Un informe secundario del 10 de mayo de 2026 indicó que Debian 14 bloquearía paquetes que fallaran o retrocedieran tras mantenerse el proyecto cerca de 96%. kbot debe aplicar la misma lógica localmente. Una compilación que no pueda reconstruirse no debe convertirse en la base de producción.
Mode 700 limits the privateworkspace to its owner.File modes are one layer. Credentials, process access, network destinations, andexternal tools still need separate controls.Sources: The Open Group. (2018). POSIX chmod utility.; GNU Project. (2024). GNU Coreutils manual: File permissions.
Give the robot its own badge and locked storeroom. Unix mode 700 limits directory access to the owner, while 750 admits an approved group and 755 admits all local users with different write rights. Start kbot's private workspace at 700. Grant every broader capability explicitly and record why it exists.
El modo 700 limita el espacio privadoa su propietario.Los modos de archivos son una capa. Las credenciales, los procesos, los destinos de redy las herramientas externas aún necesitan controles separados.Fuentes: The Open Group. (2018). POSIX chmod utility.; GNU Project. (2024). GNU Coreutils manual: File permissions.
Dé al robot su propia credencial y un almacén cerrado. El modo Unix 700 limita el acceso al propietario, 750 admite un grupo autorizado y 755 admite a todos los usuarios locales con distintos permisos de escritura. Empiece el espacio privado de kbot con 700. Conceda cada capacidad adicional de forma explícita y registre su motivo.
Two sudo flaws let a local user gainroot-level control.The no-sudo rule reduces privilege and attack surface, but it must sit inside a broaderleast-privilege design.Sources: secpod.com.
Removing sudo from kbot is still worthwhile. Two reported flaws, CVE-2025-32462 and CVE-2025-32463, allowed a local user to gain root-level access and full machine control. But removing one escalation path is not complete containment. kbot can still misuse every resource already available to its ordinary user identity.
Dos fallas de sudo permitían a un usuariolograr control root.La regla sin sudo reduce privilegios y superficie de ataque, pero debe integrarse en undiseño más amplio de privilegio mínimo.Fuentes: secpod.com.
Quitar sudo a kbot sigue siendo útil. Dos fallas informadas, CVE-2025-32462 y CVE-2025-32463, permitían a un usuario local obtener acceso root y control total del equipo. Pero eliminar una vía de elevación no constituye aislamiento completo. kbot aún puede abusar de cada recurso disponible para su identidad ordinaria.
Docker's default filter still allows hundredsof system callsApproximate Linux system-call counts under Docker's default seccomp profile.Made for Gabriel Cavedal, by HanademiSources: Docker, Inc. (2024). Seccomp security profiles for Docker.; Rose, S., Borchert, O., Mitchell, S., & Connelly, S. (2020). Zerotrust architecture. NIST Special Publication 800-207.Sources use different measurement bases; read the comparison directionally, not as one exact scale.Unitsystem calls300Approximate total256Approximately allowed44Disabled by profile
Taking away the master key helps, but it does not lock every drawer. Docker's default seccomp profile blocks about 44 system calls while allowing hundreds. A kbot user can also reach any secret, repository, process, or network destination already authorized to that identity. Real containment needs several independent boundaries.
El filtro predeterminado de Docker permitecientos de llamadasRecuentos aproximados de llamadas Linux bajo el perfil seccomp predeterminado de Docker.Made for Gabriel Cavedal, by HanademiFuentes: Docker, Inc. (2024). Seccomp security profiles for Docker.; Rose, S., Borchert, O., Mitchell, S., & Connelly, S. (2020).Zero trust architecture. NIST Special Publication 800-207.Las fuentes usan bases de medición distintas; lea la comparación como tendencia, no como una escala exacta.Unidadllamadas del sistema300Total aproximado256Permitidas aproximadamente44Deshabilitadas
Quitar la llave maestra ayuda, pero no cierra todos los cajones. El perfil seccomp predeterminado de Docker bloquea unas 44 llamadas del sistema y permite cientos. Un usuario kbot también puede alcanzar cualquier secreto, repositorio, proceso o destino de red ya autorizado para esa identidad. El aislamiento real necesita varias barreras independientes.
Infrastructure remains exposedIlluminated status lights line the drive bays in a server rack.Sources: AI Agent Sandbox Security: Lock Down Permissions | AnIntent. anintent.com.
Agent containment protects the infrastructure where data is stored and processed.
La infraestructura sigue expuestaLuces de estado encendidas recorren las bahías de discos de un rack de servidores.Fuentes: AI Agent Sandbox Security: Lock Down Permissions | AnIntent. anintent.com.
La contención de agentes protege la infraestructura donde se almacenan y procesan datos.
A bigger context window does not guaranteebetter watchingAdvertised 2024 context limits in tokens. RULER found many models weakened before their advertisedmaximum.Made for Gabriel Cavedal, by HanademiSources: Meta. (2024). The Llama 3.1 model collection.; Hsieh, C. P., et al. (2024). RULER: What's the real context size of your long-contextlanguage models?; arxiv.org.UnittokensLlama 3.1128KClaude 3.5 Sonnet200KGemini 1.5 Pro2,000K
Advertised windows differed dramatically in 2024, from 128K to 2M tokens. RULER evaluated 17 models and found that many struggled before their stated limit. Recursive Language Models later handled inputs up to 2 orders of magnitude beyond model windows, showing that architecture can extend reach. For kbot, start with a proposed maximum of 24 investigation turns and escalate when the budget expires.
Una ventana mayor no garantiza una mejorvigilanciaLímites de contexto anunciados en 2024. RULER encontró que muchos modelos se debilitaban antes de sumáximo.Made for Gabriel Cavedal, by HanademiFuentes: Meta. (2024). The Llama 3.1 model collection.; Hsieh, C. P., et al. (2024). RULER: What's the real context size of your long-contextlanguage models?; arxiv.org.UnidadtokensLlama 3.1128KClaude 3.5 Sonnet200KGemini 1.5 Pro2.000K
Las ventanas anunciadas diferían mucho en 2024, desde 128K hasta 2M tokens. RULER evaluó 17 modelos y encontró que muchos fallaban antes de su límite declarado. Los Modelos de Lenguaje Recursivos procesaron después entradas hasta 2 órdenes de magnitud mayores que las ventanas, mostrando que la arquitectura puede ampliar el alcance. Para kbot, empiece con un máximo propuesto de 24 turnos y eleve el caso cuando se agote.
A cheap scout resolved 27.33% of onerepair benchmarkAgentless reported 27.33% resolved, 72.67% unresolved, and average historical model cost of 34 cents perissue.Made for Gabriel Cavedal, by HanademiSources: Xia, C. S., Deng, Y., Dunn, S., & Zhang, L. (2024). Agentless: Demystifying LLM-based software engineering agents.The first 2 values are percentages.Unitreported values72.7Unresolved percent34Average cost, cents27.3Resolved percent
The scout is a metal detector, not the excavation team. Agentless reported resolving 27.33% of SWE-bench Lite at about $0.34 per issue under historical pricing. That is useful coverage for an inexpensive first pass, but 72.67% remained unresolved. Escalation is part of the design, not evidence that the scout failed.
Un explorador barato resolvió 27,33% deuna pruebaAgentless informó 27,33% resuelto, 72,67% sin resolver y un coste histórico medio de 34 centavos porincidencia.Made for Gabriel Cavedal, by HanademiFuentes: Xia, C. S., Deng, Y., Dunn, S., & Zhang, L. (2024). Agentless: Demystifying LLM-based software engineering agents.Los primeros 2 valores son porcentajes.Unidadvalores informados72,7Porcentaje sin resolver34Coste medio, centavos27,3Porcentaje resuelto
El explorador es un detector de metales, no el equipo de excavación. Agentless informó resolver 27,33% de SWE-bench Lite por unos US$0,34 por incidencia con precios históricos. Es una cobertura útil para una primera pasada económica, pero 72,67% quedó sin resolver. La elevación forma parte del diseño, no demuestra que el explorador haya fallado.
OpenAI's schema test hit 100%, butcorrectness stayed untestedReported schema adherence with prompting and constrained Structured Outputs. The source could not belive-verified during this build.Made for Gabriel Cavedal, by HanademiSources: OpenAI. (2024). Introducing Structured Outputs in the API.; National Institute of Standards and Technology. (2023).Artificial Intelligence Risk Management Framework 1.0.Unitschema adherence25%50%75%100%35.9%Prompting alone100%Structured Outputs100%Production targetRequired syntax
Formatting resembles completing a tax form, not writing an essay. Constrained output can keep every answer inside the required boxes. It cannot determine whether the severity or challenge label is true. kbot therefore needs both schema validation and deterministic checks against the underlying incident.
La prueba de esquema de OpenAI llegó a100%, sin probar la correcciónCumplimiento informado con instrucciones y Structured Outputs restringidos. La fuente no pudo verificarseen vivo durante esta compilación.Made for Gabriel Cavedal, by HanademiFuentes: OpenAI. (2024). Introducing Structured Outputs in the API.; National Institute of Standards and Technology.(2023). Artificial Intelligence Risk Management Framework 1.0.Unidadcumplimiento del esquema25 %50 %75 %100 %35,9 %Solo instrucciones100 %Structured Outputs100 %Objetivo de producciónSintaxis exigida
Formatear se parece a completar un formulario fiscal, no a escribir un ensayo. La salida restringida puede mantener cada respuesta dentro de las casillas exigidas. No puede determinar si la etiqueta de severidad o dificultad es verdadera. Por eso, kbot necesita validación del esquema y comprobaciones deterministas contra el incidente.
LongBench tests breadth, not report truthLongBench coverage counts: 21 datasets, 6 task categories, and 2 languages.Made for Gabriel Cavedal, by HanademiSources: Bai, Y., Lv, X., Zhang, J., et al. (2024). LongBench: A bilingual, multitask benchmark for long context understanding.Proceedings of ACL.Unitcoverage countsDatasets21Task categories6Languages2
A report specialist needs more than a large context window. LongBench spans 21 datasets, 6 task categories, and 2 languages, making it useful for screening long-document models. It does not measure whether kbot's final severity claims match the incident evidence. Feed the writer selected findings and citations, then verify the report claim by claim.
LongBench prueba amplitud, no la verdaddel informeCobertura de LongBench: 21 conjuntos de datos, 6 categorías de tareas y 2 idiomas.Made for Gabriel Cavedal, by HanademiFuentes: Bai, Y., Lv, X., Zhang, J., et al. (2024). LongBench: A bilingual, multitask benchmark for long context understanding.Proceedings of ACL.Unidadrecuentos de coberturaConjuntos de datos21Categorías de tareas6Idiomas2
Un especialista en informes necesita más que una gran ventana de contexto. LongBench abarca 21 conjuntos de datos, 6 categorías y 2 idiomas, por lo que sirve para filtrar modelos de documentos extensos. No mide si las severidades finales de kbot coinciden con la evidencia del incidente. Entregue hallazgos seleccionados y citas, y después verifique el informe afirmación por afirmación.
DORA's estimate split code quality fromdelivery stabilityAssociations reported for 25% higher AI adoption in 2024, percent change. Correlation does not establishcausation.Made for Gabriel Cavedal, by HanademiSources: Google Cloud. (2024). Accelerate State of DevOps 2024 report.Unitassociated changeCode quality3.4%Review speed3.1%Delivery throughput-1.5%Delivery stability-7.2%
More AI did not align with every outcome moving together. DORA associated 25% higher adoption with 3.4% better code quality but 7.2% lower delivery stability. The result is correlational and methodology-limited, yet the split matters. Separate design, repository discovery, requirements criticism, testing, and delivery verification.
La estimación de DORA separó calidad yestabilidadAsociaciones informadas para una adopción de IA 25% mayor en 2024. La correlación no establececausalidad.Made for Gabriel Cavedal, by HanademiFuentes: Google Cloud. (2024). Accelerate State of DevOps 2024 report.Unidadcambio asociadoCalidad del código3,4 %Velocidad de revisión3,1 %Rendimiento de entrega-1,5 %Estabilidad de entrega-7,2 %
Una mayor adopción de IA no se relacionó con mejoras en todos los resultados. DORA asoció una adopción 25% mayor con 3,4% más calidad del código, pero 7,2% menos estabilidad de entrega. El resultado es correlacional y tiene límites metodológicos, pero la separación importa. Divida diseño, exploración, crítica de requisitos, pruebas y verificación de entrega.
One math test gained 17.9 points frommultiple pathsReported PaLM 540B accuracy on GSM8K, percent and percentage-point bridge. The source was notlive-verified during this build.Made for Gabriel Cavedal, by HanademiSources: Wang, X., Wei, J., Schuurmans, D., et al. (2023). Self-consistency improves chain of thought reasoning in language models.International Conference on Learning Representations.Unitaccuracy0%20%40%60%80%56.5%Chain of thought17.9%Added gain74.4%Self-consistency
Multiple reasoning paths can outperform one answer. In this reported GSM8K result, self-consistency raised accuracy from 56.5% to 74.4%, a gain of 17.9 points. That supports separating proposal and review roles for difficult architecture decisions. It does not prove that adding agents always helps, so measure the gain against latency and cost.
Una prueba matemática ganó 17,9 puntoscon varios caminosExactitud informada de PaLM 540B en GSM8K y puente en puntos. La fuente no se verificó en vivo duranteesta compilación.Made for Gabriel Cavedal, by HanademiFuentes: Wang, X., Wei, J., Schuurmans, D., et al. (2023). Self-consistency improves chain of thought reasoning in language models.International Conference on Learning Representations.Unidadexactitud0 %20 %40 %60 %80 %56,5 %Cadena de pensamiento17,9 %Mejora añadida74,4 %Autoconsistencia
Varios caminos de razonamiento pueden superar una sola respuesta. En este resultado informado de GSM8K, la autoconsistencia elevó la exactitud de 56,5% a 74,4%, una mejora de 17,9 puntos. Esto respalda separar propuesta y revisión en decisiones difíciles. No demuestra que añadir agentes siempre ayude, por lo que debe medir la mejora frente a latencia y coste.
One Copilot study classified about 40% asvulnerableProgram counts from a 2022 study: 1,689 generated, about 676 vulnerable, and about 1,013 otherprograms.Made for Gabriel Cavedal, by HanademiSources: Pearce, H., Ahmad, B., Tan, B., Dolan-Gavitt, B., & Karri, R. (2022). Asleep at the keyboard? Assessing the security of GitHubCopilot's code contributions. IEEE Symposium on Security and Privacy.Unitprograms1,689Generated total1,013Other programs676Vulnerable
A model may draft the electrical plan, but it should not connect the live grid. In one 2022 study, about 40% of 1,689 generated programs were classified as vulnerable under selected scenarios. The estimate is narrow and does not describe every model or prompt. It still makes automated scanning and human approval essential for high-impact production changes.
Un estudio de Copilot clasificó cerca de 40%como vulnerableRecuentos de un estudio de 2022: 1.689 generados, unos 676 vulnerables y unos 1.013 programasrestantes.Made for Gabriel Cavedal, by HanademiFuentes: Pearce, H., Ahmad, B., Tan, B., Dolan-Gavitt, B., & Karri, R. (2022). Asleep at the keyboard? Assessing the security of GitHubCopilot's code contributions. IEEE Symposium on Security and Privacy.Unidadprogramas1.689Total generado1.013Otros programas676Vulnerables
Un modelo puede dibujar el plano eléctrico, pero no debe conectarlo a la red activa. En un estudio de 2022, cerca de 40% de 1.689 programas generados fueron clasificados como vulnerables en escenarios seleccionados. La estimación es limitada y no describe todos los modelos ni instrucciones. Aun así, hace esenciales el análisis automático y la aprobación humana para cambios críticos.
A proposed router keeps 70% of low-riskwork localProposed starting allocation for low-risk kbot work. This is a policy baseline, not a measured optimum.Made for Gabriel Cavedal, by HanademiSources: Chen, L., Zaharia, M., & Zou, J. (2023). FrugalGPT: How to use large language models while reducing cost and improvingperformance.; National Institute of Standards and Technology. (2023). Artificial Intelligence Risk Management Framework 1.0.Unittask shareLocal model70%Hosted strong model20%Human review10%
The router is a clinic, not a price-comparison engine. A proposed starting policy sends 70% of low-risk work to a local model, 20% to a hosted strong model, and 10% to human review. Production access, exposed credentials, destructive commands, and low confidence should bypass ordinary cost routing. Measure and revise every share from replay results.
Un enrutador propuesto mantiene local 70%del trabajoAsignación inicial propuesta para trabajo de bajo riesgo de kbot. Es una base de política, no un óptimomedido.Made for Gabriel Cavedal, by HanademiFuentes: Chen, L., Zaharia, M., & Zou, J. (2023). FrugalGPT: How to use large language models while reducing cost andimproving performance.; National Institute of Standards and Technology. (2023). Artificial Intelligence Risk ManagementFramework 1.0.Unidadproporción de tareasModelo local70 %Modelo alojado potente20 %Revisión humana10 %
El enrutador es una clínica, no un comparador de precios. Una política inicial propuesta envía 70% del trabajo de bajo riesgo a un modelo local, 20% a un modelo alojado potente y 10% a revisión humana. El acceso a producción, las credenciales expuestas, los comandos destructivos y la baja confianza deben evitar el enrutamiento normal por coste. Mida y revise cada proporción con resultados de repetición.
FrugalGPT reported up to 98% lower costReported cost index for a model cascade matching the best individual model on selected tasks. The sourcewas not live-verified during this build.Made for Gabriel Cavedal, by HanademiSources: Chen, L., Zaharia, M., & Zou, J. (2023). FrugalGPT: How to use large language models while reducing cost and improvingperformance.Unitcost index0255075100100Baseline-98Reported reduction2Reduced cost
Routing can create real economic leverage. FrugalGPT reported reductions reaching 98% while matching the best individual model on selected tasks. The phrase selected tasks carries the caveat: a router can also send the wrong case to the wrong model. Treat routing accuracy as a production metric, not hidden plumbing.
FrugalGPT informó hasta 98% menos costeÍndice de coste informado para una cascada que igualó al mejor modelo en tareas seleccionadas. La fuenteno se verificó en vivo.Made for Gabriel Cavedal, by HanademiFuentes: Chen, L., Zaharia, M., & Zou, J. (2023). FrugalGPT: How to use large language models while reducing cost and improvingperformance.Unidadíndice de coste0255075100100Base-98Reducción informada2Coste reducido
El enrutamiento puede crear una ventaja económica real. FrugalGPT informó reducciones de hasta 98% mientras igualaba al mejor modelo individual en tareas seleccionadas. La frase tareas seleccionadas contiene la salvedad: un enrutador también puede enviar el caso equivocado al modelo equivocado. Trate la exactitud del enrutamiento como una métrica de producción, no como infraestructura invisible.
AgentBench tests 8 environments, but noneis kbotAgentBench coverage includes operating-system, database, knowledge-graph, game, and four otherenvironments.Made for Gabriel Cavedal, by HanademiSources: Liu, X., Yu, H., Zhang, H., Xu, Y., Lei, X., Lai, H., et al. (2024). AgentBench: Evaluating LLMs as agents. InternationalConference on Learning Representations.UnitenvironmentsOperating system1Database1Knowledge graph1Digital game1Other environments4
AgentBench is broad enough to expose different kinds of agent behavior. Its eight environments include operating-system and database tasks, which are relevant to kbot. Yet no public benchmark reproduces kbot's permissions, repositories, tools, failure patterns, and escalation policy. Use benchmark scores to shortlist models, then decide with replay tests from real incidents.
AgentBench prueba 8 entornos, pero ningunoes kbotAgentBench cubre sistemas operativos, bases de datos, grafos de conocimiento, juegos y otros cuatroentornos.Made for Gabriel Cavedal, by HanademiFuentes: Liu, X., Yu, H., Zhang, H., Xu, Y., Lei, X., Lai, H., et al. (2024). AgentBench: Evaluating LLMs as agents. International Conference onLearning Representations.UnidadentornosSistema operativo1Base de datos1Grafo de conocimiento1Juego digital1Otros entornos4
AgentBench es lo bastante amplio para revelar distintos comportamientos de agentes. Sus ocho entornos incluyen tareas de sistemas operativos y bases de datos, relevantes para kbot. Sin embargo, ninguna prueba pública reproduce los permisos, repositorios, herramientas, fallas y políticas de elevación de kbot. Use las puntuaciones para preseleccionar modelos y decida con repeticiones de incidentes reales.
In summaryMade for Gabriel Cavedal, by HanademiSources: Liu, X., Yu, H., Zhang, H., Xu, Y., Lei, X., Lai, H., et al. (2024). AgentBench: Evaluating LLMs as agents. International Conference on Learning Representations.;National Institute of Standards and Technology. (2023). Artificial Intelligence Risk Management Framework 1.0.; Bai, Y., Lv, X., Zhang, J., Lyu, H., Tang, J., Huang, Z.,Du, Z., Liu, X., Zeng, A., & Hou, L. (2024). LongBench: A bilingual, multitask benchmark for long context understanding. Proceedings of ACL.AgentBench evaluates language-model agents across eight environments, including operating-system, database, knowledge-graph, and game tasks.Schema validity verifies output structure, not whether the selected severity, challenge, or supporting evidence is correct.LongBench contains 21 datasets across six task categories and two languages for evaluating long-context understanding.
The value of the research is not only what each source knew, but what became visible when their evidence was combined.
En resumenMade for Gabriel Cavedal, by HanademiFuentes: Liu, X., Yu, H., Zhang, H., Xu, Y., Lei, X., Lai, H., et al. (2024). AgentBench: Evaluating LLMs as agents. International Conference on Learning Representations.;National Institute of Standards and Technology. (2023). Artificial Intelligence Risk Management Framework 1.0.; Bai, Y., Lv, X., Zhang, J., Lyu, H., Tang, J., Huang, Z.,Du, Z., Liu, X., Zeng, A., & Hou, L. (2024). LongBench: A bilingual, multitask benchmark for long context understanding. Proceedings of ACL.AgentBench evalúa agentes de modelos lingüísticos en ocho entornos, incluidos sistemas operativos, bases de datos,grafos de conocimiento y juegos.La validez del esquema verifica la estructura, no si la severidad, dificultad o evidencia seleccionada es correcta.LongBench contiene 21 conjuntos de datos en seis categorías y dos idiomas para evaluar comprensión de contexto largo.
El valor de la investigación no está solo en cada fuente, sino en lo que apareció al combinar sus evidencias.

The research behind this deck

Build kbot as a controlled team, not one oversized model. Match each role to its workload, restrict its authority, validate its outputs, and escalate uncertainty through replay-tested gates.

Key findings

The argument

This research is published in English and Spanish. Ver en español

La investigación detrás de esta presentación

Construya kbot como un equipo controlado, no como un único modelo enorme. Adapte cada función a su carga, limite su autoridad, valide sus resultados y eleve la incertidumbre mediante controles probados con incidentes.

Hallazgos clave

El argumento

Esta investigación se publica en inglés y español. Read in English