Spanish is closer to English than one score suggests
15 slides · 27 min · 1 minute agolanguage
ENES
theme
LightDark
view
DeckTableTalk
brand
HanademiPlatzi
The first signal is not a score. It is the size of the testing world. Coverage grew from 15 language variants in XNLI to 122 in Belebele, so the question must move beyond one translated exam.
La primera señal no es una puntuación. Es el tamaño del mundo evaluado. La cobertura pasó de 15 variantes lingüísticas en XNLI a 122 en Belebele, así que la pregunta debe superar un solo examen traducido.
6 términos técnicos sostienen buena parte del argumento.
Parity is bigger than one exam. XTREME evaluates 9 task types across 40 languages. That breadth is the warning: a translated multiple-choice score cannot stand in for every language ability.
La paridad es más amplia que un examen. XTREME evalúa 9 tipos de tareas en 40 idiomas. Esa amplitud importa: una puntuación traducida de opción múltiple no representa todas las capacidades lingüísticas.
The Spanish side of the story is not only about catching up. UNED-ACCESO contains 1,003 bilingual university-entrance questions across 11 subjects. That is native educational relevance, not just translation.
La historia del español no trata solo de alcanzar al inglés. UNED-ACCESO contiene 1.003 preguntas bilingües de ingreso universitario en 11 materias. Eso es relevancia educativa propia, no solo traducción.
English has a much larger visible home on the web. W3Techs placed English at roughly half of websites with a known content language, compared with about 6% for Spanish. This is a structural clue, not a measurement of any model's training set.
El inglés tiene una presencia visible mucho mayor en la web. W3Techs situó al inglés en aproximadamente la mitad de los sitios con idioma conocido, frente a cerca del 6% del español. Es una señal estructural, no una medición del conjunto de entrenamiento de un modelo.
The benchmark's foundation is uneven. XNLI has 392,702 English training examples, but only 5,010 test examples and 2,490 development examples for each language. That design can shape what multilingual performance appears to mean.
La base de la prueba es desigual. XNLI tiene 392.702 ejemplos de entrenamiento en inglés, pero solo 5.010 ejemplos de prueba y 2.490 de desarrollo para cada idioma. Ese diseño puede influir en lo que parece significar el rendimiento multilingüe.
Spain is treating language technology as national infrastructure. The program names €1.1 billion in public funding and seeks another €1 billion privately. That makes €2.1 billion the ambition, but only the public portion is funding already identified in the claim.
España trata la tecnología lingüística como infraestructura nacional. El programa menciona 1.100 millones de euros públicos y busca otros 1.000 millones privados. La ambición suma 2.100 millones, pero solo la parte pública aparece como financiación identificada en la afirmación.
Language is not only a delivery channel for a model's answer. A study across 37 countries found that models portrayed governments with controlled media more favorably in the national language than in English. The implication is sharp: changing the prompt language can change the political portrait.
El idioma no es solo el canal de entrega de una respuesta. Un estudio en 37 países halló que los modelos retrataban de forma más favorable a los gobiernos con medios controlados en la lengua nacional que en inglés. La implicación es clara: cambiar el idioma de la instrucción puede cambiar el retrato político.
A translated exam and a native exam measure different kinds of reach. MMLU covers 57 subjects, while KMMLU covers 45. But KMMLU adds 35,030 expert-level questions built from Korean exams, showing why native evaluation can matter more than a bigger subject count.
Un examen traducido y uno nativo miden tipos distintos de alcance. MMLU cubre 57 materias, mientras KMMLU cubre 45. Pero KMMLU añade 35.030 preguntas de nivel experto basadas en exámenes coreanos, lo que muestra por qué la evaluación nativa puede importar más que un mayor número de materias.
Translated evaluation has scaled dramatically. XNLI established a parallel benchmark across 15 languages, while FLORES-200 reaches 200. That is a major gain in controlled coverage, but translation still does not recreate local curricula, idioms, or knowledge.
La evaluación traducida ha crecido de forma drástica. XNLI estableció un benchmark paralelo en 15 idiomas, mientras FLORES-200 alcanza 200. Es un gran avance en cobertura controlada, pero traducir no recrea los currículos, modismos ni conocimientos locales.
Tokenization is partly a design choice. BERT lists 30,522 vocabulary entries, multilingual BERT 119,547, and XLM-R 250,002. Larger vocabularies may split words less often, but these figures alone cannot promise equal efficiency for Spanish.
La tokenización depende en parte del diseño. BERT registra 30.522 entradas de vocabulario, BERT multilingüe 119.547 y XLM-R 250.002. Los vocabularios más grandes pueden dividir menos las palabras, pero estas cifras por sí solas no garantizan la misma eficiencia en español.
Here is the practical penalty. In one reproducible tiktoken test, the same paragraph cost 55% more in Spanish than in English. That does not settle every tokenizer, but it shows how a language gap can become a real usage cost.
Este es el costo práctico. En una prueba reproducible con tiktoken, el mismo párrafo costó un 55% más en español que en inglés. Eso no resuelve el caso de todos los tokenizadores, pero muestra cómo una brecha lingüística puede convertirse en un costo real de uso.
The language question is not only about getting the answer right. A 2026 review reports harmful generation at 1% in English and 35% across Hausa, Igbo, and Javanese. It also reports a 20-point instruction-following drop, showing why safety needs its own test.
La cuestión lingüística no trata solo de responder correctamente. Una revisión de 2026 informa una generación dañina del 1% en inglés y del 35% en hausa, igbo y javanés. También informa una caída de 20 puntos en el seguimiento de instrucciones, lo que muestra por qué la seguridad necesita su propia prueba.
Spanish-language access is not a niche condition in a connected country. Argentina crossed 70% internet use in 2021 and reached 82.0% in 2024. That scale makes even small language or token differences matter beyond the lab.
El acceso en español no es una condición de nicho en un país conectado. Argentina superó el 70% de uso de internet en 2021 y llegó al 82,0% en 2024. Esa escala hace que incluso pequeñas diferencias lingüísticas o de tokens importen fuera del laboratorio.
Multilingual evaluation expanded from 15 to 122 language variants. 6 technical terms carry much of the argument.
Key findings
A 2026 review reports harmful generation rising from 1% in English to 35% in Hausa, Igbo, and Javanese, alongside a 20-point instruction-following drop. pike.psu.edu
OpenAI reported that GPT-4 exceeded GPT-3.5's 70.1% English MMLU score in 24 of 26 translated languages tested. OpenAI
GPT-4's reported 84.0% Spanish MMLU score exceeded GPT-3.5's 70.1% English score by 13.9 percentage points. OpenAI
Multilingual jailbreak studies report language-dependent attack success, but current Spanish-English rates vary too much by model and attack for one universal gap. Association for Computational Linguistics
A 37-country study found models portrayed media-controlled governments more favorably in the national language than in English. sciencesources.eurekalert.org
OpenAI reported GPT-4 MMLU accuracy of 85.5% in English and 84.0% in translated Spanish, a 1.5-point gap. OpenAI
W3Techs reported English on roughly half of websites with a known content language and Spanish on about 6% during 2024. W3Techs
Tokenizer studies indicate that equivalent Spanish text can require more tokens than English, but no universal 10% to 30% penalty applies across models. NeurIPS
MGSM experiments found that English chain-of-thought prompting can outperform native-language prompting for some models and languages, but not universally. International Conference on Learning Representations
UNED-ACCESO contains 1,003 bilingual university-entrance questions across 11 subjects.
English appears on roughly half of websites, versus about 6% for Spanish.
XNLI supplies 392,702 English training examples, versus 5,010 tests per language.
Spain pairs €1.1 billion in public funding with a €1 billion private aim.
A 37-country study found more favorable portrayals in national languages than in English.
This research is published in English and Spanish. Ver en español
La investigación detrás de esta presentación
La evaluación multilingüe se amplió de 15 a 122 variantes lingüísticas. 6 términos técnicos sostienen buena parte del argumento.
Hallazgos clave
Una revisión de 2026 reporta que la generación dañina sube de 1% en inglés a 35% en hausa, igbo y javanés, junto con una caída de 20 puntos en seguimiento de instrucciones. pike.psu.edu
OpenAI informó que GPT-4 superó el 70,1% de GPT-3.5 en MMLU inglés en 24 de los 26 idiomas traducidos evaluados. OpenAI
El 84,0% informado para GPT-4 en MMLU español superó el 70,1% inglés de GPT-3.5 por 13,9 puntos porcentuales. OpenAI
Los estudios de ataques multilingües informan éxitos dependientes del idioma, pero las tasas español-inglés varían demasiado según modelo y ataque para una brecha universal. Association for Computational Linguistics
Un estudio de 37 países halló que los modelos retrataban más favorablemente a gobiernos con medios controlados en la lengua nacional que en inglés. sciencesources.eurekalert.org
OpenAI informó una precisión MMLU de GPT-4 del 85,5% en inglés y 84,0% en español traducido, una brecha de 1,5 puntos. OpenAI
W3Techs informó que el inglés aparecía en aproximadamente la mitad de los sitios con idioma conocido y el español en cerca del 6% durante 2024. W3Techs
XNLI contiene 392.702 ejemplos ingleses de entrenamiento y 2.490 de desarrollo más 5.010 de prueba para cada uno de 15 idiomas. Association for Computational Linguistics
Los estudios de tokenización indican que un texto español equivalente puede requerir más tokens que el inglés, pero no existe una penalización universal del 10% al 30%. NeurIPS
Los experimentos de MGSM hallaron que el razonamiento guiado en inglés puede superar las instrucciones nativas para algunos modelos e idiomas, pero no universalmente. International Conference on Learning Representations
Con una prima de tokens del 20%, una carga equivalente a mil millones de tokens ingleses añadiría 200 millones de tokens españoles facturables. Association for Computational Linguistics