La adopción de la IA y la actividad normativa están extendidas, mientras los errores medidos siguen siendo considerables y las exigencias de transparencia son escasas.
These terms let you read the rest of the evidence without unnecessary jargon. A false positive can become an accusation. A hallucination can become a false clinical recommendation. Biometrics and electricity consumption show that risks also leave the screen.
Estos términos permiten leer el resto de la evidencia sin jerga innecesaria. Un falso positivo puede convertirse en una acusación. Una alucinación puede convertirse en una recomendación clínica falsa. La biometría y el consumo eléctrico muestran que los riesgos también salen de la pantalla.
This is the ethical problem in a single image. A system can look accurate on average and fail very differently depending on the person. Error rises from 0.8% to 34.7%. That's why approving a model without testing it by group transfers risk to those least able to avoid it.
Este es el problema ético en una sola imagen. Un sistema puede parecer preciso en promedio y fallar de forma muy distinta según la persona. El error sube de 0,8% a 34,7%. Por eso, aprobar un modelo sin probarlo por grupo traslada el riesgo a quienes menos pueden evitarlo.
The FTC alleged that Rite Aid used facial recognition for 8 years to identify suspected shoplifters. The case did not end with a voluntary recommendation. The agreement announced included a 5-year ban. When a system affects people, accountability can outlast its deployment.
La FTC alegó que Rite Aid utilizó reconocimiento facial durante 8 años para identificar a presuntos ladrones. El caso no terminó con una recomendación voluntaria. El acuerdo anunciado incluyó una prohibición de 5 años. Cuando un sistema afecta a personas, la responsabilidad puede sobrevivir mucho más que su despliegue.
The Rite Aid case turns an abstract model failure into a store-level consequence for customers.
El caso de Rite Aid convierte un fallo abstracto del modelo en una consecuencia para los clientes dentro de la tienda.
The error did not remain within the software. The FTC's complaint alleges that alerts led to surveillance, public accusations, searches, entry bans, arrests, and police calls. It also alleged special damages for Black, Asian, Latino, and women consumers. Ethical harm emerged when a score became human action.
El error no permanecía dentro del software. La demanda de la FTC afirma que las alertas llevaron a vigilancia, acusaciones públicas, registros, prohibiciones de entrada, detenciones y llamadas policiales. También alegó daños especiales para consumidores negros, asiáticos, latinos y mujeres. El daño ético apareció cuando una puntuación se convirtió en acción humana.
NIST did not find a small statistical deviation. In many algorithms, false positives were 10 to 100x higher for certain groups. That difference changes who is arrested, rejected, or investigated. An ethical assessment must separate outcomes by population and context.
NIST no encontró una pequeña desviación estadística. En muchos algoritmos, los falsos positivos fueron entre 10 y 100 veces mayores para ciertos grupos. Esa diferencia cambia quién es detenido, rechazado o investigado. Una evaluación ética debe separar resultados por población y contexto.
Protecting only delivered data leaves half the problem open. European guidelines note that information can be linked to a person through its content, purpose, or effect. AEPD also penalized mandatory facial biometrics without valid alternatives in remote exams. Responsibility starts before inference and continues after it.
Proteger solo los datos entregados deja abierta la mitad del problema. Las directrices europeas señalan que una información puede relacionarse con una persona por su contenido, finalidad o efecto. La AEPD también sancionó biometría facial obligatoria sin alternativas válidas en exámenes remotos. La responsabilidad empieza antes de inferir y continúa después de hacerlo.
A familiar phone interaction shows why protections must cover analysis around ordinary consumer activity.
Una interacción habitual con el teléfono muestra por qué la protección debe abarcar el análisis de la actividad cotidiana del consumidor.
ProPublica found false positives of 44.9% for Black defendants and 23.5% for white. Northpointe responded that people with the same score had similar recidivism across groups. Both arguments examine different properties. The ethical choice is to declare which harm is prioritized before approving the system.
ProPublica encontró falsos positivos de 44,9% para acusados negros y 23,5% para blancos. Northpointe respondió que personas con la misma puntuación tenían reincidencia parecida entre grupos. Ambos argumentos miran propiedades distintas. La decisión ética consiste en declarar qué daño se prioriza antes de aprobar el sistema.
The same calibrated scoring system can produce opposite error profiles. Black defendants faced more false positives than false negatives, while White defendants faced more false negatives than false positives.
El mismo sistema de puntuación calibrado puede producir perfiles de error opuestos. Los acusados negros afrontaron más falsos positivos que falsos negativos, mientras que los acusados blancos afrontaron más falsos negativos que falsos positivos.
Rates vary with the model, the task, and how the error is triggered. Even so, no result presented allows us to treat generation as an autonomous clinical source. One medical study reported 19.7% hallucinations while 98.8% of responses received maximum plausibility. Looking correct and being correct are separate controls.
Las tasas cambian con el modelo, la tarea y la forma de provocar el error. Aun así, ningún resultado presentado permite tratar la generación como una fuente clínica autónoma. Una prueba médica reportó 19,7% de alucinaciones mientras 98,8% de las respuestas recibió plausibilidad máxima. Parecer correcto y ser correcto son controles distintos.
The intervention produced a statistically significant improvement, but the residual rate remained close to one hallucination in every two adversarial clinical answers.
La intervención produjo una mejora estadísticamente significativa, pero la tasa residual permaneció cerca de una alucinación por cada dos respuestas clínicas adversariales.
Mitigation worked, but it did not turn the system into a safe source. The average rate dropped 22 points, from 66% to 44%. That result changes the product question. It is not enough to ask whether a safeguard exists; you must measure how much risk remains after.
La mitigación funcionó, pero no convirtió el sistema en una fuente segura. La tasa media bajó 22 puntos, de 66% a 44%. Ese resultado cambia la pregunta de producto. No basta con preguntar si existe una salvaguarda, hay que medir cuánto riesgo queda después.
GPT-4 improved substantially over GPT-3.5 on this task. However, about 18% of fabricated references is still too much for a research chain without human review. NIST includes confabulation within 12 categories of generative risk. Hallucinations must be managed throughout the lifecycle.
GPT-4 mejoró mucho frente a GPT-3.5 en esta tarea. Sin embargo, cerca de 18% de referencias fabricadas sigue siendo demasiado para una cadena de investigación sin revisión humana. NIST incluye la confabulación dentro de 12 categorías de riesgo generativo. Las alucinaciones deben gestionarse durante todo el ciclo de vida.
Generative AI does not distribute workplace pressure uniformly. The ILO estimates 4.7% of female employment in the peak category, versus 2.4% of male employment. Global total is 3.3%. Responsibility includes anticipating who needs transition, training, and protection first.
La IA generativa no distribuye su presión laboral de manera uniforme. La OIT estima 4,7% del empleo femenino en la categoría máxima, frente a 2,4% del masculino. El total mundial es 3,3%. La responsabilidad incluye anticipar quién necesita transición, capacitación y protección primero.
Most exposure lies below the highest tier, supporting transformation rather than wholesale replacement. Within the highest tier, women's exposure is nearly twice men's, at 4.7% versus 2.4%.
La mayor parte de la exposición queda por debajo del nivel máximo, lo que respalda la transformación más que la sustitución total. Dentro del nivel máximo, la exposición de las mujeres casi duplica la de los hombres, con 4,7% frente a 2,4%.
Responsibility does not end at the response a user receives. The IEA estimates 415 TWh in 2024 and over 945 TWh in 2030. Renewables would cover roughly half the growth, not all of it. Efficiency, location, and energy source are design decisions.
La responsabilidad no termina en la respuesta que recibe el usuario. La IEA estima 415 TWh en 2024 y más de 945 TWh en 2030. Las renovables cubrirían cerca de la mitad del crecimiento, no todo. Eficiencia, ubicación y fuente energética son decisiones de diseño.
Renewables absorb only about half of the projected increase. The remaining growth alone is equivalent to nearly two thirds of the sector's entire 2024 electricity demand.
Las renovables absorben solo cerca de la mitad del aumento proyectado. El crecimiento restante equivale por sí solo a casi dos tercios de toda la demanda eléctrica del sector en 2024.
The database contains supporting figures for employment and electricity. However, no source was enabled to satisfy these 2 exact critical obligations. The conclusion must preserve that limit rather than convert adjacent evidence into a definitive answer.
El banco contiene cifras de apoyo para empleo y electricidad. Sin embargo, ninguna fuente quedó habilitada para satisfacer estas 2 obligaciones críticas exactas. La conclusión debe conservar ese límite en lugar de convertir evidencia adyacente en una respuesta definitiva.
Advanced models depend on infrastructure that few companies can offer at scale. AWS, Azure, and Google Cloud combined held approximately 67% of the market. That concentration affects costs, access, and inspection capacity. Governance needs to look also at the providers that sustain the system.
Los modelos avanzados dependen de infraestructura que pocas empresas pueden ofrecer a gran escala. AWS, Azure y Google Cloud sumaban aproximadamente 67% del mercado. Esa concentración afecta costos, acceso y capacidad de inspección. La gobernanza necesita mirar también a los proveedores que sostienen el sistema.
GPT-4 came much closer to passing as human than ELIZA in this test. That does not prove consciousness or understanding. It shows that conversational appearance can mask the nature of the speaker. Clear disclosure especially protects vulnerable users.
GPT-4 quedó mucho más cerca de las personas que ELIZA en esta prueba. Eso no demuestra conciencia ni comprensión. Demuestra que la apariencia conversacional puede ocultar la naturaleza del interlocutor. La divulgación clara protege especialmente a usuarios vulnerables.
Customer-service settings make the disclosure duty concrete when a system can be mistaken for a person.
Los entornos de atención al cliente concretan el deber de informar cuando un sistema puede confundirse con una persona.
Organizations publish principles, tools, and processes, but a basic measure is missing. There is no standardized public registry of enterprise systems that have passed independent audits for bias and privacy. That absence does not equal 0 audits. It means compliance cannot be compared from outside.
Las organizaciones publican principios, herramientas y procesos, pero falta una medida básica. No hay un registro público estandarizado de sistemas empresariales que hayan superado auditorías independientes de sesgo y privacidad. Esa ausencia no equivale a 0 auditorías. Significa que el cumplimiento no puede compararse desde fuera.
Student adoption was already widespread: 86% reported using AI and 24% did so daily. In 2023, a UNESCO survey found formal guidance in fewer than 10% of schools and universities. The gap is not solved by blanket bans. Rules for use, verification, and attribution are needed.
La adopción estudiantil ya era amplia: 86% declaró usar IA y 24% lo hacía diariamente. En 2023, una encuesta de UNESCO encontró orientación formal en menos de 10% de escuelas y universidades. El vacío no se resuelve con prohibiciones generales. Se necesitan reglas de uso, verificación y atribución.
La adopción precedió a la gobernanza: solo el uso diario entre estudiantes superó en más del doble el límite máximo de escuelas y universidades con orientación formal.
The 193 member states adopted UNESCO's ethical recommendation in 2021. Yet among evaluated countries, only 51% reported a national strategy. Ecuador still showed absent sector-specific regulation and weak incorporation of principles. Colombia shows the other move: its Constitutional Court mandated effective human scrutiny in AI-driven judicial decisions.
Los 193 Estados miembros adoptaron la recomendación ética de UNESCO en 2021. Sin embargo, entre los países evaluados, solo 51% reportó una estrategia nacional. Ecuador todavía mostraba regulación específica ausente y débil incorporación de principios. Colombia ofrece el otro movimiento: su Corte exigió escrutinio humano efectivo en decisiones judiciales con IA.
Adopting a policy is now common. Exposing government algorithms to public scrutiny is not yet. The Global Responsible AI Index found initiatives in 126 of 135 countries, but disclosure requirements in only 18%. The distance between commitment and control is the space where accountability can disappear.
Adoptar una política ya es común. Exponer los algoritmos gubernamentales al escrutinio público todavía no lo es. El Índice Global de IA Responsable encontró iniciativas en 126 de 135 países, pero requisitos de divulgación en solo 18%. La distancia entre compromiso y control es el espacio donde la responsabilidad puede desaparecer.
Chile converted its policy into 177 initiatives distributed across 14 ministries. By April 2025, 78% was implemented or finalized. Governance becomes verifiable when it assigns owners, work, and tracking. An ethical principle without execution is still a promise.
Chile convirtió su política en 177 iniciativas repartidas entre 14 ministerios. Para abril de 2025, 78% estaba implementado o finalizado. La gobernanza se vuelve verificable cuando asigna responsables, trabajo y seguimiento. Un principio ético sin ejecución todavía es una promesa.
The European Regulation converts some duties into enforceable obligations. Prohibited practices can face fines of up to 7% of global sales. High-risk systems must also retain automated records for at least 6 months. Spain proposed the same ceiling of 35 million euros or 7% for prohibited systems.
El Reglamento europeo convierte algunos deberes en obligaciones exigibles. Las prácticas prohibidas pueden recibir multas de hasta 7% de las ventas mundiales. Los sistemas de alto riesgo también deben conservar registros automáticos durante al menos 6 meses. España propuso el mismo techo de 35 millones de euros o 7% para sistemas prohibidos.
The Spanish authority sanctioned 2 distinct uses of facial recognition. Sidecu ended up paying EUR 96,000 after an initial fine of EUR 160,000. Aena received a fine of EUR 10,043,002 and temporary suspension of biometric processing. The cost appears when convenience substitutes for consent, necessity, and alternatives.
La autoridad española sancionó 2 usos distintos de reconocimiento facial. Sidecu terminó pagando €96.000 tras una sanción inicial de €160.000. Aena recibió una multa de €10.043.002 y una suspensión temporal del tratamiento biométrico. El costo aparece cuando la conveniencia sustituye consentimiento, necesidad y alternativas.
Airport crowds show who bears the consequences when biometric systems lack a lawful basis or alternatives.
Las multitudes en los aeropuertos muestran quién asume las consecuencias cuando los sistemas biométricos carecen de base legal o alternativas.
This is a scale counterfactual, not an estimate of AI-enabled losses because the FTC total includes scams that did not use AI. Even under the laboratory detection rate, more than one quarter of the loss pool remains unscreened.
Este es un contrafactual de escala, no una estimación de pérdidas facilitadas por IA, porque el total de la FTC incluye estafas que no usaron IA. Incluso con la tasa de detección del laboratorio, más de una cuarta parte de las pérdidas quedaría sin detectar.
Measurement, documentation, disclosure, and correction remain actions that people must authorize and record.
Medir, documentar, informar y corregir siguen siendo acciones que las personas deben autorizar y registrar.
Evidence converges on one simple rule. Whoever decides to build, buy, or deploy AI retains responsibility for its effects. That requires testing by group, human verification, records, transparency, and remedy. A machine produces the output, but an institution decides whether it can affect someone.
La evidencia converge en una regla sencilla. Quien decide construir, comprar o desplegar IA conserva la responsabilidad por sus efectos. Eso exige pruebas por grupo, verificación humana, registros, transparencia y reparación. Una máquina produce la salida, pero una institución decide si puede afectar a alguien.
Evidence shifts ethics from intentions toward verifiable controls. Bias, hallucinations, surveillance, employment, and energy show that those who design and deploy AI must measure harms, preserve evidence, allow challenges, and answer for consequences.
Key findings
Gender Shades encontró errores de clasificación de género de 0,8% en hombres de piel clara y 34,7% en mujeres de piel oscura. Proceedings of Machine Learning Research
Clearview AI afirmó en 2023 que su base facial había crecido hasta aproximadamente 30.000 millones de imágenes obtenidas de internet. Reuters
En COMPAS, los falsos positivos fueron 44,9% para acusados negros y 23,5% para blancos, según el análisis de ProPublica. ProPublica
Al solicitar referencias, GPT-3.5 fabricó 55% y GPT-4 alrededor de 18%, frente a menos errores verificables en búsquedas bibliográficas tradicionales. Scientific Reports
En la categoría máxima de exposición, la OIT estimó 4,7% del empleo femenino, 2,4% del masculino y 3,3% del total mundial. Organización Internacional del Trabajo
En una prueba controlada, participantes juzgaron humano a GPT-4 en 54% de conversaciones, frente a 67% para humanos y 22% para ELIZA. arXiv
The FTC complaint says false Rite Aid match alerts led to surveillance, store bans, public accusations, searches, detentions, and police calls. ftc.gov
Most reviewed Local Law 144 audits did not report results that would avoid suggesting four-fifths-rule violations; missing demographic data could often imply violations. doi.org
Spain’s data-protection authority fined Aena €10,043,002 and temporarily suspended biometric-data processing over its facial-recognition airport access system. efe.com
On textbook-grounded medical QA, LLaMA-70B-Instruct hallucinated in 19.7% of answers despite 98.8% receiving maximal plausibility. arxiv.org
The argument
A commercial system erred 0.8% with light-skinned men and 34.7% with dark-skinned women.
The FTC alleged that 8 years of facial recognition at Rite Aid produced mistaken accusations and wrongful expulsions.
In adversarial clinical tests, hallucinations reached between 50% and 82%.
A mitigation prompt reduced average clinical hallucinations from 66% to 44%, but did not eliminate them.
Greatest exposure to generative AI affects 4.7% of female employment and 2.4% of male employment.
Data center electricity would move from 415 TWh in 2024 to more than 945 TWh in 2030.
126 of 135 countries have AI initiatives, but only 18% require disclosure of government algorithms.
The European regulation allows fines of up to 7% of global sales for prohibited practices.
This research is published in English and Spanish. Ver en español
La investigación detrás de esta presentación
La evidencia desplaza la ética desde las intenciones hacia controles verificables. Sesgo, alucinaciones, vigilancia, empleo y energía muestran que quienes diseñan y despliegan IA deben medir daños, conservar pruebas, permitir impugnaciones y responder por las consecuencias.
Hallazgos clave
Gender Shades encontró errores de clasificación de género de 0,8% en hombres de piel clara y 34,7% en mujeres de piel oscura. Proceedings of Machine Learning Research
Clearview AI afirmó en 2023 que su base facial había crecido hasta aproximadamente 30.000 millones de imágenes obtenidas de internet. Reuters
En COMPAS, los falsos positivos fueron 44,9% para acusados negros y 23,5% para blancos, según el análisis de ProPublica. ProPublica
Al solicitar referencias, GPT-3.5 fabricó 55% y GPT-4 alrededor de 18%, frente a menos errores verificables en búsquedas bibliográficas tradicionales. Scientific Reports
En la categoría máxima de exposición, la OIT estimó 4,7% del empleo femenino, 2,4% del masculino y 3,3% del total mundial. Organización Internacional del Trabajo
En una prueba controlada, participantes juzgaron humano a GPT-4 en 54% de conversaciones, frente a 67% para humanos y 22% para ELIZA. arXiv
La demanda de la FTC afirma que alertas de coincidencia falsas de Rite Aid llevaron a vigilancia, prohibiciones de entrada, acusaciones públicas, registros, detenciones y llamadas a la policía. ftc.gov
La mayoría de las auditorías revisadas bajo la Ley Local 144 no reportó resultados que evitaran sugerir infracciones de la regla de cuatro quintos; los datos demográficos faltantes podían implicarlas. doi.org
La autoridad española de protección de datos multó a Aena con 10.043.002 euros y suspendió temporalmente el tratamiento biométrico por su sistema aeroportuario de reconocimiento facial. efe.com
En preguntas médicas basadas en textos, LLaMA-70B-Instruct alucinó en 19,7% de las respuestas, aunque 98,8% recibió plausibilidad máxima. arxiv.org
El argumento
Un sistema comercial erró 0,8% con hombres de piel clara y 34,7% con mujeres de piel oscura.
La FTC alegó que 8 años de reconocimiento facial en Rite Aid produjeron acusaciones y expulsiones erróneas.
En pruebas clínicas adversariales, las alucinaciones alcanzaron entre 50% y 82%.
Un prompt de mitigación redujo las alucinaciones clínicas medias de 66% a 44%, pero no las eliminó.
La mayor exposición laboral a IA generativa afecta 4,7% del empleo femenino y 2,4% del masculino.
La electricidad de centros de datos pasaría de 415 TWh en 2024 a más de 945 TWh en 2030.
126 de 135 países tienen iniciativas de IA, pero solo 18% exige divulgar algoritmos gubernamentales.
El Reglamento europeo permite multas de hasta 7% de las ventas mundiales por prácticas prohibidas.
Esta investigación se publica en inglés y español. Read in English