Do extraction controls outperform direct summarization and federation?¿Los controles de extracción superan al resumen directo y la federación? · V8 Master Engine
28 slides · 30 min · 2 hours ago28 láminas · 30 min · hace 2 hlanguage
ENES
theme
LightDark
view
TalkTable
brand
HanademiPlatzi
The problem is not drafting a readable record, but preserving every figure that supports a decision.
Metric coverage was 20%, even though metrics represent 30% of analytical weight.
Architecture must test extraction, computed coverage, and human approval as separate controls.
El problema no es redactar un acta legible, sino conservar cada cifra que sostiene una decisión.
La cobertura de métricas fue 20%, aunque las métricas representan 30% del peso analítico.
La arquitectura debe probar extracción, cobertura computada y aprobación humana como controles separados.
The system preserves 80% of main topics but only 20% of metrics. The proposed 95% threshold must therefore test figures explicitly across six error classes.
El sistema conserva el 80% de los temas principales, pero solo el 20% de las métricas. Por eso, el umbral propuesto del 95% debe comprobar explícitamente las cifras frente a seis clases de error.
The problem combines summary evaluation, data protection, and traceability. These definitions prevent technical names from hiding simple decisions. The goal remains preserving figures, attributions, and evidence.
El problema combina evaluación de resúmenes, protección de datos y trazabilidad. Estas definiciones evitan que los nombres técnicos escondan decisiones simples. El objetivo sigue siendo conservar cifras, atribuciones y evidencia.
Internal comparison reveals a dangerous inversion. Topics survive well, but metrics drop to 20% coverage. These same metrics receive 30% of analytical weight, so fluent writing can mask a critical loss.
La comparación interna revela una inversión peligrosa. Los temas sobreviven bien, pero las métricas quedan en 20% de cobertura. Precisamente esas métricas reciben 30% del peso analítico, así que una redacción fluida puede ocultar una pérdida decisiva.
Every measured capability misses the proposed gate. The required gains range from 15 points for topics to 75 points for metrics, so numeric loss is the largest remediation burden.
Todas las capacidades medidas incumplen el umbral propuesto. Las mejoras necesarias van de 15 puntos en temas a 75 puntos en métricas, por lo que la pérdida numérica representa la mayor carga de corrección.
Metrics carry 30% of the score, so reaching the numeric gate adds 22.5 points. The result remains 21.8 points below 95% because agreements, decisions and owners also miss the threshold.
Las métricas representan el 30% de la puntuación, por lo que alcanzar el umbral numérico añade 22,5 puntos. El resultado queda 21,8 puntos por debajo del 95% porque acuerdos, decisiones y responsables también incumplen el umbral.
The Peruvian experiment separated 2 interventions that could appear equivalent. The algorithmic list worsened the outcome by 5 points, while a suggested date improved it by 4. For executive summaries, this advises automating specific controls before replacing final judgment.
El experimento peruano separó 2 intervenciones que podían parecer equivalentes. La lista algorítmica empeoró el resultado en 5 puntos, mientras una fecha sugerida lo mejoró en 4. Para las actas, esto aconseja automatizar controles concretos antes que reemplazar el juicio final.
Replacing managerial assignment with algorithmic lists reduced timely completion, while adding suggested dates increased it. The 9-point spread shows that workflow design can matter more than the mere presence of automation.
Sustituir la asignación gerencial por listas algorítmicas redujo la finalización oportuna, mientras que añadir fechas sugeridas la aumentó. La diferencia de 9 puntos muestra que el diseño del flujo puede importar más que la mera presencia de automatización.
The Peruvian Supreme Court rejected an objection built without sufficient individual verification. Only 391 clients supported a conclusion applied across 336,325 records. The architectural lesson is clear: partial coverage must not be presented as exhaustive.
La Corte Suprema peruana rechazó un reparo construido sin verificación individual suficiente. Solo 391 clientes respaldaban una conclusión aplicada sobre 336.325 registros. La lección arquitectónica es clara: una cobertura parcial no debe presentarse como exhaustiva.
The hypothesis requires comparing factual consistency across 2 specific architectures. No public ACL table was found reporting FactCC for both under comparable scope. Therefore, the quantitative superiority of extracting before generating remains unproven.
La hipótesis exige comparar la consistencia factual de 2 arquitecturas concretas. No se verificó una tabla pública de la ACL que reporte FactCC para ambas bajo un alcance comparable. Por eso la superioridad cuantitativa de extraer antes de generar sigue sin demostrarse.
QMSum and MeetingBank show that long meetings can be converted into large evaluation sets. MeetingBank contains 1,366 meetings and 6,892 segmented instances. However, the original BERTSum was tested on 3 news datasets, and none of these resources publish the required FactCC contrast.
QMSum y MeetingBank demuestran que las reuniones largas pueden convertirse en conjuntos de evaluación amplios. MeetingBank reúne 1.366 reuniones y 6.892 instancias segmentadas. Sin embargo, el BERTSum original se probó en 3 conjuntos de noticias y ninguno de estos recursos publica el contraste FactCC exigido.
The scattered pieces reflect a benchmark record that cannot establish model fidelity for meetings.
Las piezas dispersas reflejan un registro de evaluación que no permite establecer la fidelidad del modelo en reuniones.
On BOE-XSUM, the fine-tuned model outperformed DeepSeek-R1 by 8.1 precision points. The result equals a reported relative improvement of 24%. Yet the dataset does not represent long meetings or demonstrate number preservation in executive summaries.
En BOE-XSUM, el modelo ajustado superó a DeepSeek-R1 por 8,1 puntos de precisión. El resultado equivale a una mejora relativa reportada de 24%. Aun así, el conjunto no representa reuniones largas ni demuestra conservación de cifras en actas.
FRAME signals favor for using more explicit structures when summarizing meetings. The reduction was 2 points on a 5-point scale. However, the result does not measure internal minutes numerical coverage or isolate the effect of extracting before generating.
FRAME aporta una señal favorable para usar estructuras más explícitas al resumir reuniones. La reducción fue de 2 puntos sobre una escala de 5. Sin embargo, el resultado no mide la cobertura numérica del acta interna ni aísla el efecto de extraer antes de generar.
The SIC's investigative activity nearly doubled in 2 years. It went from 55 investigations in 2023 to 101 in 2025. For a Colombian enforcement agent, that movement carries more weight than automatically assuming the application of European rules.
La actividad investigativa de la SIC casi se duplicó en 2 años. Pasó de 55 investigaciones en 2023 a 101 en 2025. Para un agente de actas colombiano, ese movimiento pesa más que asumir automáticamente la aplicación de normas europeas.
Colombian data regulation already reached artificial intelligence use in 2024. In 2026, the SIC confirmed closure of a sensitive data processing operation. The European AI Act advanced by phases, but that temporal coincidence does not by itself create European jurisdiction.
La regulación colombiana de datos ya alcanzaba el uso de inteligencia artificial en 2024. En 2026, la SIC confirmó el cierre de una operación de tratamiento de datos sensibles. La Ley de IA europea avanzaba por etapas, pero esa coincidencia temporal no crea por sí sola jurisdicción europea.
Local risk is not theoretical. The SIC sanctioned Claro with COP 950 million in 2021 and COP 1,306 million in 2023. These cases do not involve executive actions, but they show that improper data handling already has direct consequences in Colombia.
El riesgo local no es teórico. La SIC sancionó a Claro con COP 950 millones en 2021 y con COP 1.306 millones en 2023. Estos casos no tratan actas ejecutivas, pero demuestran que el tratamiento indebido de datos ya tiene consecuencias directas en Colombia.
Verified Colombian enforcement produces a direct local exposure of COP 2.26 billion across two cases. That evidence is more relevant to the entity than assuming European rules apply from foreign enforcement examples.
La aplicación verificada de la normativa colombiana produce una exposición local directa de COP 2,26 mil millones en dos casos. Esta evidencia es más pertinente para la entidad que asumir la aplicación de normas europeas a partir de sanciones extranjeras.
Orange operates within a European jurisdiction and has received significant French sanctions. The privacy fine was €50 million and the competition fine reached €350 million. Neither figure measures enforcement action compliance nor shows that Claro shares the same exposure.
Orange opera dentro de una jurisdicción europea y ha recibido sanciones francesas importantes. La multa de privacidad fue de €50 millones y la de competencia alcanzó €350 millones. Ninguna cifra mide fidelidad de actas ni demuestra que Claro comparta la misma exposición.
National sanctions show that Claro and Orange face different authorities. No nominal and comparable EDPB registry count was found for both companies. Evidence also did not establish that NIS2 or the European AI Act are obligations applicable to the Colombian case.
Las sanciones nacionales muestran que Claro y Orange enfrentan autoridades distintas. No se verificó un conteo nominal y comparable del registro EDPB para ambas compañías. La evidencia tampoco estableció que NIS2 o la Ley de Inteligencia Artificial europea sean obligaciones aplicables al caso colombiano.
Law 1581 governs processing conducted in Colombia, and the approved record requires minimum corporate content. The operational summary brings together 7 categories, from number and date through decisions and approvals. GDPR applies only if a European territorial nexus is demonstrated, not by virtue of using artificial intelligence.
La Ley 1581 gobierna el tratamiento realizado en Colombia y el acta aprobada necesita contenido corporativo mínimo. El resumen operativo reúne 7 categorías, desde número y fecha hasta decisiones y aprobaciones. El RGPD solo entra si se demuestra un nexo territorial europeo, no por usar inteligencia artificial.
The control needs an operational rule before the pilot. The proposal requires 95% coverage for critical figures and human review in 100% of cases where a decision figure is missing. These percentages are starting points, not validated thresholds.
El control necesita una regla operativa antes del piloto. La propuesta exige 95% de cobertura para cifras críticas y revisión humana en 100% de los casos donde falte una cifra decisoria. Estos porcentajes son puntos de partida, no umbrales validados.
Content Understanding is the component closest to multimodal extraction with schema. The test must distinguish 6 failures because a correct figure becomes false if its unit, period, comparator, speaker, or deliberative status changes. Service availability and accuracy still require verification.
Content Understanding es el componente más cercano a una extracción multimodal con esquema. La prueba debe distinguir 6 fallas, porque una cifra correcta puede quedar falsa si cambia su unidad, periodo, comparador, hablante o estado deliberativo. La disponibilidad y precisión del servicio todavía requieren verificación.
The semantic classifier improves the ranking of results already retrieved. The limit of up to 50 results does not prove that no figures were left out. Azure AI Search serves better for locating evidence than for building the complete numerical inventory.
El clasificador semántico mejora el orden de los resultados que ya fueron recuperados. El límite de hasta 50 resultados no demuestra que ninguna cifra haya quedado fuera. Azure AI Search sirve mejor para localizar evidencia que para construir el inventario numérico completo.
Data Factory offers more than 90 connectors to move and transform data. Graph can contribute 5 input metadata, but neither of those services decides whether the minutes are publishable. The proposal places 4 independent gates before releasing the document.
Data Factory ofrece más de 90 conectores para mover y transformar datos. Graph puede aportar 5 metadatos de entrada, pero ninguno de esos servicios decide si el acta es publicable. La propuesta coloca 4 gates independientes antes de liberar el documento.
The digital interface makes the control argument concrete because each handoff needs a deliberate gate before publication.
La interfaz digital concreta el argumento de control porque cada transferencia necesita una compuerta deliberada antes de publicar.
SharePoint can maintain versions and separate 2 document states. The pre-minutes remains a draft until an authorized person approves it. That boundary prevents automatic output from accidentally acquiring official minutes status.
SharePoint puede mantener versiones y separar 2 estados documentales. La pre-acta sigue siendo un borrador hasta que una persona autorizada la aprueba. Esa frontera evita que una salida automática adquiera por accidente el estatus del acta oficial.
Teams intelligent recap and Microsoft 365 Copilot are useful baselines, but do not publish specific benchmarks for Colombian executive minutes. The pilot must compare direct summary, prior extraction, federation alone, and federation with extraction. Until those 4 arms are executed, the architecture is a well-motivated hypothesis, not demonstrated causality.
Teams intelligent recap y Microsoft 365 Copilot son líneas base útiles, pero no publican benchmarks específicos para actas ejecutivas colombianas. El piloto debe comparar resumen directo, extracción previa, federación sola y federación con extracción. Hasta ejecutar esos 4 brazos, la arquitectura es una hipótesis bien motivada, no una causalidad demostrada.
Partial coverage cannot be presented as exhaustive. Models improve with specific design, but that improvement must be measured on real meetings. Colombian regulatory pressure reinforces the need to preserve evidence and human approval.
La cobertura parcial no puede presentarse como exhaustiva. Los modelos mejoran con diseño específico, pero esa mejora debe medirse en reuniones reales. La presión regulatoria colombiana refuerza la necesidad de conservar evidencia y aprobación humana.
Internal evidence reveals severe metric loss. Architecture must separate extraction, evaluation, and approval, but a controlled trial is still needed to show that sequence recovers the figures.
Key findings
La comparación interna reporta coberturas de 80% en temas, 65% en responsables y riesgos, 55% en decisiones y apenas 20% en métricas. spain.meloda.org
On 6 July 2023, Colombia’s SIC imposed a COP 1,306,289,600 sanction on Comcel S.A. (Claro) over its “Amigos que te premian” campaign. sedeelectronica.sic.gov.co
In July 2026, SIC definitively ordered World Foundation and Tools for Humanity to close their sensitive-data processing operation in Colombia. sedeelectronica.sic.gov.co
No se verificó una tabla ACL que publique conjuntamente FactCC para BART-large-CNN y BERTSumExtAbs; la comparación cuantitativa exigida permanece sin resolver. Association for Computational Linguistics
No existe evidencia pública comparativa de que la sola federación por dominio recupere el 20% de cobertura métrica observado sin un contrato de extracción. Microsoft Research
Azure AI Foundry ofrece evaluación de calidad y seguridad, pero no publica 1 evaluador estándar específico para cobertura de cifras en actas. Microsoft
Content Understanding debe probarse contra 6 errores: cifra, unidad, periodo, comparador, hablante y estado deliberativo. Microsoft
Teams permite transcripción con identificación de hablantes, pero 1 error de diarización puede convertir una sugerencia ajena en compromiso nominal. Microsoft
La prueba debe estratificar cifras en al menos 4 posiciones del transcript para separar pérdida por contenido de sesgo posicional. Association for Computational Linguistics
Teams intelligent recap genera notas y tareas automáticas, pero Microsoft no publica 1 benchmark de cobertura numérica para actas ejecutivas colombianas. Microsoft
The argument
Metrics receive 30% of analytical weight but achieve only 20% coverage.
In Peru, replacing managerial assignment with algorithmic lists reduced timely case completion by 5 percentage points.
Meeting repositories offer thousands of examples, but not the FactCC contrast requested.
Colombian data protection investigations rose from 55 in 2023 to 101 in 2025.
Claro received Colombian sanctions of COP 950 million and COP 1.306 billion for data handling.
A JSON schema controls form, but coverage requires checking each figure against the transcript.
The decision requires comparing 4 variants and maintaining human approval before publishing.
This research is published in English and Spanish. Ver en español
La investigación detrás de esta presentación
La evidencia interna revela una pérdida severa de métricas. La arquitectura debe separar extracción, evaluación y aprobación, pero un ensayo controlado sigue siendo necesario para demostrar que ese orden recupera las cifras.
Hallazgos clave
La comparación interna reporta coberturas de 80% en temas, 65% en responsables y riesgos, 55% en decisiones y apenas 20% en métricas. spain.meloda.org
El 6 de julio de 2023, la SIC de Colombia impuso una sanción de COP 1.306.289.600 a Comcel S.A. (Claro) por su campaña «Amigos que te premian». sedeelectronica.sic.gov.co
En julio de 2026, la SIC ordenó definitivamente a World Foundation y Tools for Humanity cerrar su operación de tratamiento de datos sensibles en Colombia. sedeelectronica.sic.gov.co
No se verificó una tabla ACL que publique conjuntamente FactCC para BART-large-CNN y BERTSumExtAbs; la comparación cuantitativa exigida permanece sin resolver. Association for Computational Linguistics
No existe evidencia pública comparativa de que la sola federación por dominio recupere el 20% de cobertura métrica observado sin un contrato de extracción. Microsoft Research
Azure AI Foundry ofrece evaluación de calidad y seguridad, pero no publica 1 evaluador estándar específico para cobertura de cifras en actas. Microsoft
Content Understanding debe probarse contra 6 errores: cifra, unidad, periodo, comparador, hablante y estado deliberativo. Microsoft
Teams permite transcripción con identificación de hablantes, pero 1 error de diarización puede convertir una sugerencia ajena en compromiso nominal. Microsoft
La prueba debe estratificar cifras en al menos 4 posiciones del transcript para separar pérdida por contenido de sesgo posicional. Association for Computational Linguistics
Teams intelligent recap genera notas y tareas automáticas, pero Microsoft no publica 1 benchmark de cobertura numérica para actas ejecutivas colombianas. Microsoft
El argumento
Las métricas reciben 30% del peso analítico, pero alcanzan apenas 20% de cobertura.
En Perú, sustituir la asignación gerencial por listas algorítmicas redujo 5 puntos la finalización oportuna.
Los repositorios de reuniones ofrecen miles de ejemplos, pero no el contraste FactCC solicitado.
Las investigaciones colombianas de protección de datos subieron de 55 en 2023 a 101 en 2025.
Claro recibió sanciones colombianas de COP 950 millones y COP 1.306 millones por tratamiento de datos.
Un esquema JSON controla la forma, pero la cobertura requiere comprobar cada cifra contra la transcripción.
La decisión exige comparar 4 variantes y mantener una aprobación humana antes de publicar.
Esta investigación se publica en inglés y español. Read in English