Hanademi

Spanish is closer to English than one score suggests

15 slides · 27 min · 1 minute ago language
ENES
theme
LightDark
view
DeckTableTalk
brand
HanademiPlatzi
Spanish is closer to English thanone score suggestsMade for Karla Sequén, by Hanademi
El español está más cerca delinglés de lo que sugiere una solanotaMade for Karla Sequén, by Hanademi
Benchmark coverage surged to 122language variantsLanguage coverage across four benchmark releases from 2018 through 2023.Made for Karla Sequén, by HanademiSources: Conneau, A., et al. (2018). XNLI: Evaluating cross-lingual sentence representations. Proceedings of EMNLP 2018; Hu, J., et al. (2020).XTREME: A massively multilingual multi-task benchmark for evaluating cross-lingual generalization. Proceedings of ICML 2020; Bandarkar, L.,et al. (2024). The Belebele benchmark: A parallel reading comprehension dataset in 122 language variants. Proceedings of ACL 2024.UnitLanguage variants050100XNLI 2018XTREME 2020MASSIVE 2022 releaseBelebele 2023 releaseBelebele reached 122 languagevariants in 2023.15
The first signal is not a score. It is the size of the testing world. Coverage grew from 15 language variants in XNLI to 122 in Belebele, so the question must move beyond one translated exam.
La cobertura de pruebas llegó a 122variantes lingüísticasCobertura lingüística en cuatro versiones de pruebas entre 2018 y 2023.Made for Karla Sequén, by HanademiFuentes: Conneau, A., et al. (2018). XNLI: Evaluating cross-lingual sentence representations. Proceedings of EMNLP 2018; Hu, J., et al. (2020).XTREME: A massively multilingual multi-task benchmark for evaluating cross-lingual generalization. Proceedings of ICML 2020; Bandarkar, L., etal. (2024). The Belebele benchmark: A parallel reading comprehension dataset in 122 language variants. Proceedings of ACL 2024.UnidadVariantes lingüísticas050100XNLI 2018XTREME 2020MASSIVE 2022 releaseBelebele 2023 releaseBelebele llegó a 122 varianteslingüísticas en 2023.15
La primera señal no es una puntuación. Es el tamaño del mundo evaluado. La cobertura pasó de 15 variantes lingüísticas en XNLI a 122 en Belebele, así que la pregunta debe superar un solo examen traducido.
The terms behind the argumentMade for Karla Sequén, by HanademiTokenA unit processed by a model, such as a word, subword, punctuation mark, or character.TokenizerThe algorithm that divides text into the units processed and billed by many language models.MMLUAn English-origin multiple-choice benchmark covering 57 academic and professional subjects.Benchmark contaminationThe possibility that test questions or close copies appeared in a model'straining data.CalibrationHow closely a model's stated confidence matches how often its answers are correct.JailbreakA prompt designed to bypass a model's safety restrictions.
6 technical terms carry much of the argument.
Los términos detrás del argumentoMade for Karla Sequén, by HanademiTokenUna unidad procesada por un modelo, como una palabra, subpalabra, signo de puntuación ocarácter.TokenizadorEl algoritmo que divide el texto en las unidades procesadas y facturadas por muchosmodelos.MMLUUna prueba de opción múltiple de origen inglés que cubre 57 materias académicas yprofesionales.Contaminación de pruebasLa posibilidad de que preguntas de prueba o copias cercanasaparecieran en los datos de entrenamiento.CalibraciónEl grado en que la confianza declarada por un modelo coincide con la frecuencia derespuestas correctas.Ataque de evasiónUna instrucción diseñada para eludir las restricciones de seguridad de un modelo.
6 términos técnicos sostienen buena parte del argumento.
XTREME spans 9 task typesacross 40 languages.A model can look strong on translated multiple-choice questions and still vary acrossother capabilities.Sources: Hu, J., et al. (2020). XTREME: A massively multilingual multi-task benchmark for evaluating cross-lingual generalization. Proceedings ofMachine Learning Research, 119, 4411-4421.
Parity is bigger than one exam. XTREME evaluates 9 task types across 40 languages. That breadth is the warning: a translated multiple-choice score cannot stand in for every language ability.
XTREME abarca 9 tipos de tareasen 40 idiomas.Un modelo puede parecer sólido en preguntas traducidas de opción múltiple y aun asívariar en otras capacidades.Fuentes: Hu, J., et al. (2020). XTREME: A massively multilingual multi-task benchmark for evaluating cross-lingual generalization. Proceedings ofMachine Learning Research, 119, 4411-4421.
La paridad es más amplia que un examen. XTREME evalúa 9 tipos de tareas en 40 idiomas. Esa amplitud importa: una puntuación traducida de opción múltiple no representa todas las capacidades lingüísticas.
UNED-ACCESO contains 1,003bilingual university-entrancequestions across 11 subjects.Spanish evaluation is not limited to translated general benchmarks. UNED-ACCESO tests areal educational setting in Spanish and English.Sources: leaderboard.odesia.uned.es. (2024). UNED-ACCESO GenAI evaluation leaderboard.
The Spanish side of the story is not only about catching up. UNED-ACCESO contains 1,003 bilingual university-entrance questions across 11 subjects. That is native educational relevance, not just translation.
UNED-ACCESO contiene 1.003preguntas bilingües de ingresouniversitario en 11 materias.La evaluación del español no se limita a pruebas generales traducidas. UNED-ACCESOexamina un contexto educativo real en español e inglés.Fuentes: leaderboard.odesia.uned.es. (2024). UNED-ACCESO GenAI evaluation leaderboard.
La historia del español no trata solo de alcanzar al inglés. UNED-ACCESO contiene 1.003 preguntas bilingües de ingreso universitario en 11 materias. Eso es relevancia educativa propia, no solo traducción.
English dominates the visible webApproximate website shares by known content language during 2024; public-web presence is not disclosedtraining data.Made for Karla Sequén, by HanademiSources: W3Techs. (2024). Usage statistics of content languages for websites.UnitShare of websites with known content languageEnglish50%Spanish6%8.3x
English has a much larger visible home on the web. W3Techs placed English at roughly half of websites with a known content language, compared with about 6% for Spanish. This is a structural clue, not a measurement of any model's training set.
El inglés domina la web visibleProporción aproximada de sitios por idioma de contenido conocido durante 2024; la presencia en la webpública no equivale a datos de entrenamiento divulgados.Made for Karla Sequén, by HanademiFuentes: W3Techs. (2024). Usage statistics of content languages for websites.UnidadProporción de sitios con idioma de contenido conocidoInglés50 %Español6 %8,3x
El inglés tiene una presencia visible mucho mayor en la web. W3Techs situó al inglés en aproximadamente la mitad de los sitios con idioma conocido, frente a cerca del 6% del español. Es una señal estructural, no una medición del conjunto de entrenamiento de un modelo.
XNLI starts with an English data imbalanceXNLI example counts for English training and per-language development and test sets.Made for Karla Sequén, by HanademiSources: Conneau, A., et al. (2018). XNLI: Evaluating cross-lingual sentence representations. Proceedings of EMNLP 2018; xnli |TensorFlow Datasets.UnitExamples392,702English training5,010Per-language test2,490Per-language development
The benchmark's foundation is uneven. XNLI has 392,702 English training examples, but only 5,010 test examples and 2,490 development examples for each language. That design can shape what multilingual performance appears to mean.
XNLI empieza con un desequilibrio de datosen inglésConteo de ejemplos de XNLI para entrenamiento en inglés y conjuntos de desarrollo y prueba por idioma.Made for Karla Sequén, by HanademiFuentes: Conneau, A., et al. (2018). XNLI: Evaluating cross-lingual sentence representations. Proceedings of EMNLP 2018; xnli |TensorFlow Datasets.UnidadEjemplos392.702Entrenamiento en inglés5.010Prueba por idioma2.490Desarrollo por idioma
La base de la prueba es desigual. XNLI tiene 392.702 ejemplos de entrenamiento en inglés, pero solo 5.010 ejemplos de prueba y 2.490 de desarrollo para cada idioma. Ese diseño puede influir en lo que parece significar el rendimiento multilingüe.
Spain aims to mobilize €2.1 billion forlanguage technologySpain's PERTE language program, stated public funding and private-mobilization aim, in millions of euros.Made for Karla Sequén, by HanademiSources: planderecuperacion.gob.es.The combined ambition adds €1.1 billion in public funding and the stated €1 billion private-mobilization aim.UniteurosEUR0EUR500MEUR1,000MEUR1,500MEUR2,000MEUR1,100MPublic fundingEUR1,000MPrivate aimEUR2,100MCombined ambition
Spain is treating language technology as national infrastructure. The program names €1.1 billion in public funding and seeks another €1 billion privately. That makes €2.1 billion the ambition, but only the public portion is funding already identified in the claim.
España busca movilizar 2.100 millones deeuros para tecnología lingüísticaPrograma PERTE de la lengua en España, financiación pública declarada y objetivo de movilización privada,en millones de euros.Made for Karla Sequén, by HanademiFuentes: planderecuperacion.gob.es.La ambición combinada suma 1.100 millones de euros de financiación pública y el objetivo declarado de movilizar 1.000 millones privados.UnidadeurosEUR0EUR500 MEUR1.000 MEUR1.500 MEUR2.000 MEUR1.100 MFinanciación públicaEUR1.000 MObjetivo privadoEUR2.100 MAmbición combinada
España trata la tecnología lingüística como infraestructura nacional. El programa menciona 1.100 millones de euros públicos y busca otros 1.000 millones privados. La ambición suma 2.100 millones, pero solo la parte pública aparece como financiación identificada en la afirmación.
A 37-country study found morefavorable portrayals in nationallanguages than in English.The finding concerns models' portrayals of governments with controlled media. It isattributed to the cited study.Sources: sciencesources.eurekalert.org.
Language is not only a delivery channel for a model's answer. A study across 37 countries found that models portrayed governments with controlled media more favorably in the national language than in English. The implication is sharp: changing the prompt language can change the political portrait.
Un estudio de 37 países halló retratosmás favorables en lenguas nacionalesque en inglés.El hallazgo se refiere a los retratos que hicieron los modelos de gobiernos con medioscontrolados. Se atribuye al estudio citado.Fuentes: sciencesources.eurekalert.org.
El idioma no es solo el canal de entrega de una respuesta. Un estudio en 37 países halló que los modelos retrataban de forma más favorable a los gobiernos con medios controlados en la lengua nacional que en inglés. La implicación es clara: cambiar el idioma de la instrucción puede cambiar el retrato político.
Native exams cover fewer subjects but testlocal expertiseAcademic and professional subjects in English-assembled MMLU and Korean-built KMMLU; KMMLU'sexpert question count is annotated.Made for Karla Sequén, by HanademiSources: Hendrycks, D., et al. (2021). Measuring massive multitask language understanding. Proceedings of ICLR 2021.; arxiv.deeppaper.ai.UnitSubjects57English MMLU45Korean KMMLU
A translated exam and a native exam measure different kinds of reach. MMLU covers 57 subjects, while KMMLU covers 45. But KMMLU adds 35,030 expert-level questions built from Korean exams, showing why native evaluation can matter more than a bigger subject count.
Los exámenes nativos cubren menosmaterias pero prueban experiencia localMaterias académicas y profesionales en MMLU reunido en inglés y KMMLU construido en coreano; se anotael número de preguntas expertas de KMMLU.Made for Karla Sequén, by HanademiFuentes: Hendrycks, D., et al. (2021). Measuring massive multitask language understanding. Proceedings of ICLR 2021.; arxiv.deeppaper.ai.UnidadMaterias57MMLU en inglés45KMMLU coreano
Un examen traducido y uno nativo miden tipos distintos de alcance. MMLU cubre 57 materias, mientras KMMLU cubre 45. Pero KMMLU añade 35.030 preguntas de nivel experto basadas en exámenes coreanos, lo que muestra por qué la evaluación nativa puede importar más que un mayor número de materias.
Translated benchmarks expanded from 15to 200 languagesLanguages covered by translated evaluation data in XNLI and FLORES-200; counts reflect benchmarkscope, not native exam design.Made for Karla Sequén, by HanademiSources: Conneau, A., et al. (2018). XNLI: Evaluating cross-lingual sentence representations. Proceedings of EMNLP 2018, 2475-2485.;NLLB Team. (2022). No language left behind: Scaling human-centered machine translation. arXiv.UnitLanguagesXNLI15FLORES-20020013.3x
Translated evaluation has scaled dramatically. XNLI established a parallel benchmark across 15 languages, while FLORES-200 reaches 200. That is a major gain in controlled coverage, but translation still does not recreate local curricula, idioms, or knowledge.
Los benchmarks traducidos pasaron de 15a 200 idiomasIdiomas cubiertos por datos de evaluación traducidos en XNLI y FLORES-200; las cifras reflejan el alcancedel benchmark, no el diseño de exámenes nativos.Made for Karla Sequén, by HanademiFuentes: Conneau, A., et al. (2018). XNLI: Evaluating cross-lingual sentence representations. Proceedings of EMNLP 2018, 2475-2485.;NLLB Team. (2022). No language left behind: Scaling human-centered machine translation. arXiv.UnidadIdiomasXNLI15FLORES-20020013,3x
La evaluación traducida ha crecido de forma drástica. XNLI estableció un benchmark paralelo en 15 idiomas, mientras FLORES-200 alcanza 200. Es un gran avance en cobertura controlada, pero traducir no recrea los currículos, modismos ni conocimientos locales.
Larger vocabularies can reduce tokenfragmentationStated vocabulary sizes for BERT, multilingual BERT, and XLM-R.Made for Karla Sequén, by HanademiSources: Conneau, A., et al. (2020). Unsupervised cross-lingual representation learning at scale. Proceedings of ACL 2020, 8440-8451.;Devlin, J., et al. (2019). BERT: Pre-training of deep bidirectional transformers for language understanding. Proceedings of NAACL-HLT 2019.The values compare stated vocabulary sizes.UnitVocabulary entriesBERT30,522Multilingual BERT119,547XLM-R250,002
Tokenization is partly a design choice. BERT lists 30,522 vocabulary entries, multilingual BERT 119,547, and XLM-R 250,002. Larger vocabularies may split words less often, but these figures alone cannot promise equal efficiency for Spanish.
Los vocabularios más grandes puedenreducir la fragmentación de tokensTamaños de vocabulario declarados para BERT, BERT multilingüe y XLM-R.Made for Karla Sequén, by HanademiFuentes: Conneau, A., et al. (2020). Unsupervised cross-lingual representation learning at scale. Proceedings of ACL 2020, 8440-8451.; Devlin,J., et al. (2019). BERT: Pre-training of deep bidirectional transformers for language understanding. Proceedings of NAACL-HLT 2019.Los valores comparan los tamaños de vocabulario declarados.UnidadEntradas de vocabularioBERT30.522BERT multilingüe119.547XLM-R250.002
La tokenización depende en parte del diseño. BERT registra 30.522 entradas de vocabulario, BERT multilingüe 119.547 y XLM-R 250.002. Los vocabularios más grandes pueden dividir menos las palabras, pero estas cifras por sí solas no garantizan la misma eficiencia en español.
The same Spanish text cost 55% more in onetokenizer testRelative token cost for equivalent English and Spanish text in a reproducible tiktoken test; English is indexedto 100.Made for Karla Sequén, by HanademiSources: github.com.English is indexed to 100; Spanish is indexed to 155 from the reported 55% premium.UnitIndexed token costEnglish100Spanish155
Here is the practical penalty. In one reproducible tiktoken test, the same paragraph cost 55% more in Spanish than in English. That does not settle every tokenizer, but it shows how a language gap can become a real usage cost.
El mismo texto en español costó un 55% másen una prueba de tokenizaciónCosto relativo de tokens para texto equivalente en inglés y español en una prueba reproducible con tiktoken;el inglés se indexa en 100.Made for Karla Sequén, by HanademiFuentes: github.com.El inglés se indexa en 100; el español se indexa en 155 a partir de la prima reportada del 55%.UnidadCosto indexado de tokensInglés100Español155
Este es el costo práctico. En una prueba reproducible con tiktoken, el mismo párrafo costó un 55% más en español que en inglés. Eso no resuelve el caso de todos los tokenizadores, pero muestra cómo una brecha lingüística puede convertirse en un costo real de uso.
Safety gaps widen sharply beyond EnglishHarmful-content generation reported in a 2026 review, comparing English with a grouped result for Hausa,Igbo, and Javanese.Made for Karla Sequén, by HanademiSources: pike.psu.edu.UnitHarmful-generation rateEnglish1%Hausa, Igbo, Javanese35%
The language question is not only about getting the answer right. A 2026 review reports harmful generation at 1% in English and 35% across Hausa, Igbo, and Javanese. It also reports a 20-point instruction-following drop, showing why safety needs its own test.
Las brechas de seguridad aumentan muchofrente al inglésGeneración de contenido dañino informada en una revisión de 2026, comparando inglés con un resultadoagrupado de hausa, igbo y javanés.Made for Karla Sequén, by HanademiFuentes: pike.psu.edu.UnidadTasa de generación dañinaInglés1 %Hausa, igbo, javanés35 %
La cuestión lingüística no trata solo de responder correctamente. Una revisión de 2026 informa una generación dañina del 1% en inglés y del 35% en hausa, igbo y javanés. También informa una caída de 20 puntos en el seguimiento de instrucciones, lo que muestra por qué la seguridad necesita su propia prueba.
Argentina crossed 70% and reached 82.0%Individuals using the internet in Argentina, percent of population, 1990-2024.Made for Karla Sequén, by HanademiSources: World Bank. (2024). Individuals using the Internet (% of population), indicator IT.NET.USER.ZS. World DevelopmentIndicators.; It.net.user.zs.UnitPercent of population0%25%50%75%199019982003200820132018202370% thresholdArgentina moved above 70% in2021 at 71.1%.Internet use reached 82.0% in2024.0%
Spanish-language access is not a niche condition in a connected country. Argentina crossed 70% internet use in 2021 and reached 82.0% in 2024. That scale makes even small language or token differences matter beyond the lab.
Argentina superó el 70% y llegó al 82,0%Personas que usan internet en Argentina, porcentaje de la población, 1990-2024.Made for Karla Sequén, by HanademiFuentes: World Bank. (2024). Individuals using the Internet (% of population), indicator IT.NET.USER.ZS. WorldDevelopment Indicators.; It.net.user.zs.UnidadPorcentaje de la población0 %25 %50 %75 %1990199820032008201320182023Umbral del 70%Argentina superó el 70% en 2021con 71,1%.El uso de internet alcanzó el 82,0%en 2024.0 %
El acceso en español no es una condición de nicho en un país conectado. Argentina superó el 70% de uso de internet en 2021 y llegó al 82,0% en 2024. Esa escala hace que incluso pequeñas diferencias lingüísticas o de tokens importen fuera del laboratorio.
In summaryMade for Karla Sequén, by HanademiSources: leaderboard.odesia.uned.es.; Hendrycks, D., et al. (2021). Measuring massive multitask language understanding. Proceedings of ICLR 2021.;NLLB Team. (2022). No language left behind: Scaling human-centered machine translation. arXiv.; Conneau, A., et al. (2018). XNLI: Evaluatingcross-lingual sentence representations. Proceedings of EMNLP 2018, 2475-2485.UNED-ACCESO 2024 contains 1,003 bilingual university-entrance questions across 11 subjects in Spanish and English.MMLU contains multiple-choice questions from 57 academic and professional subjects assembled in English.FLORES-200 provides professionally translated evaluation data for 200 languages, offering broader controlled coverage than English-only testing.XNLI translated English evaluation examples into 14 additional languages, producing a 15-language parallel benchmark.
The value of the research is not only what each source knew, but what became visible when their evidence was combined.
En resumenMade for Karla Sequén, by HanademiFuentes: leaderboard.odesia.uned.es.; Hendrycks, D., et al. (2021). Measuring massive multitask language understanding. Proceedings of ICLR 2021.;NLLB Team. (2022). No language left behind: Scaling human-centered machine translation. arXiv.; Conneau, A., et al. (2018). XNLI: Evaluatingcross-lingual sentence representations. Proceedings of EMNLP 2018, 2475-2485.UNED-ACCESO 2024 contiene 1.003 preguntas bilingües de ingreso universitario, distribuidas en 11 materias, en español e inglés.MMLU contiene preguntas de opción múltiple de 57 materias académicas y profesionales reunidas en inglés.FLORES-200 proporciona datos de evaluación traducidos profesionalmente para 200 idiomas, ofreciendo una coberturacontrolada más amplia que las pruebas solo en inglés.XNLI tradujo ejemplos ingleses de evaluación a otros 14 idiomas, produciendo una prueba paralela de 15 idiomas.
El valor de la investigación no está solo en cada fuente, sino en lo que apareció al combinar sus evidencias.

The research behind this deck

Multilingual evaluation expanded from 15 to 122 language variants. 6 technical terms carry much of the argument.

Key findings

The argument

This research is published in English and Spanish. Ver en español

La investigación detrás de esta presentación

La evaluación multilingüe se amplió de 15 a 122 variantes lingüísticas. 6 términos técnicos sostienen buena parte del argumento.

Hallazgos clave

El argumento

Esta investigación se publica en inglés y español. Read in English