DeepSeek released distilled models ranging from 1.5B to 70B parameters. Its striking claim concerns the 32B version: the developer says it beat the 671B DeepSeek-V3 on several reasoning benchmarks. Parameter count is not capability, and the result still needs independent testing. But this is why distillation has become a strategic issue rather than a niche training technique.
DeepSeek lanzó modelos destilados desde 1,5B hasta 70B parámetros. Su afirmación más llamativa se refiere a la versión de 32B: el desarrollador dice que superó al DeepSeek-V3 de 671B en varias pruebas de razonamiento. El número de parámetros no equivale a capacidad y el resultado aún necesita pruebas independientes. Pero esto explica por qué la destilación se convirtió en un asunto estratégico y no solo en una técnica de entrenamiento.
Four terms carry much of this story. Distillation concerns transferring behavior. Open weights concern who can modify and distribute a model. Context measures how much information fits into one request, while H100 names the scarce computing hardware behind much frontier training.
Cuatro términos sostienen gran parte de esta historia. La destilación trata de transferir comportamiento. Los pesos abiertos determinan quién puede modificar y distribuir un modelo. El contexto mide cuánta información cabe en una solicitud, mientras H100 nombra el hardware escaso detrás de gran parte del entrenamiento de frontera.
A visitor photographing DeepSeek gives the model race a visible human audience.
Un visitante fotografiando DeepSeek da a la carrera de modelos una audiencia humana visible.
Moonshot's official release describes Kimi K3 as a 2.8-trillion-parameter model with native vision and a 1-million-token context window. Those specifications place it directly inside the frontier conversation. They establish what Moonshot launched, not how K3 ranks under independent evaluation. The next question is whether capability matches scale.
El lanzamiento oficial de Moonshot describe Kimi K3 como un modelo de 2,8 billones de parámetros, con visión nativa y una ventana de contexto de 1 millón de tokens. Esas especificaciones lo colocan directamente en la conversación de frontera. Establecen qué lanzó Moonshot, no cómo se clasifica K3 en evaluaciones independientes. La siguiente pregunta es si la capacidad iguala la escala.
The crowded exhibition booth turns Kimi K3 from a specification sheet into a public-facing product.
El concurrido stand convierte a Kimi K3 de una ficha técnica en un producto presentado al público.
Stanford counted 40 notable US models in 2024, compared with 15 from China and 3 from France. That is still a large output lead. Yet a separate report on Stanford's 2026 index put the best-model performance gap at 2.7%, far below the range reported in May 2023. China can remain behind in model count while approaching the frontier on selected evaluations.
Stanford contó 40 modelos estadounidenses destacados en 2024, frente a 15 de China y 3 de Francia. La ventaja de producción sigue siendo grande. Sin embargo, otro informe sobre el índice de Stanford de 2026 situó la brecha entre los mejores modelos en 2,7%, muy por debajo del rango informado en mayo de 2023. China puede seguir detrás en cantidad mientras se acerca a la frontera en evaluaciones seleccionadas.
Anthropic alleges over 16 million Claude exchanges involving DeepSeek, Moonshot and MiniMax. Separately, the White House OSTP dated NSTM-4 in 2026. Similar outputs alone still cannot identify which teacher produced training examples.
Anthropic alega más de 16 millones de intercambios con Claude relacionados con DeepSeek, Moonshot y MiniMax. Por separado, la OSTP de la Casa Blanca fechó el NSTM-4 en 2026. La similitud de resultados por sí sola aún no identifica qué maestro produjo los ejemplos de entrenamiento.
Microsoft announced about $80 billion for AI-enabled datacenters in fiscal 2025. Silicon Analysts estimated that 4 US hyperscalers purchased $433.9 billion of property and equipment over the 4 quarters through March 2026. Separately, the GAO counted incentive awards covering 40 semiconductor projects at 19 companies. These figures cannot be summed, but together they show that frontier competition has become physical infrastructure competition.
Microsoft anunció unos 80.000 millones de dólares para centros de datos preparados para IA en su ejercicio 2025. Silicon Analysts estimó que 4 hiperescaladores estadounidenses compraron 433.900 millones de dólares en propiedades y equipos durante los 4 trimestres terminados en marzo de 2026. Por separado, la GAO contó incentivos para 40 proyectos de semiconductores en 19 empresas. Estas cifras no pueden sumarse, pero juntas muestran que la competencia de frontera se convirtió en competencia de infraestructura física.
China installed 276,288 industrial robots in 2023. That was 51% of all installations worldwide. This does not solve China's access to the most advanced chips, but it gives the country an enormous base for automating factories and lowering hardware costs. Frontier chips remain the irreplaceable component inside a much broader manufacturing advantage.
China instaló 276.288 robots industriales en 2023. Eso representó el 51% de todas las instalaciones mundiales. La cifra no resuelve el acceso chino a los chips más avanzados, pero ofrece una base enorme para automatizar fábricas y reducir costos de hardware. Los chips de frontera siguen siendo el componente irremplazable dentro de una ventaja industrial mucho más amplia.
The robot kiosk places China’s automation story within its broader urban and industrial buildout.
El quiosco robótico sitúa la historia de automatización de China dentro de su desarrollo urbano e industrial.
Manufacturing fell from 31.5% of China's GDP in 2004 to 24.7% in 2025. That decline can look like retreat until it is compared with Germany, Japan and India. China remained above all 3 in the latest shared period, while South Korea retained an even larger manufacturing share. China's advantage is not that manufacturing never declined, but that it stayed unusually central at enormous scale.
La manufactura cayó del 31,5% del PIB chino en 2004 al 24,7% en 2025. Ese descenso puede parecer un retroceso hasta compararlo con Alemania, Japón e India. China permaneció por encima de los 3 en el último periodo compartido, mientras Corea del Sur conservó una participación manufacturera aún mayor. La ventaja china no consiste en que la manufactura nunca cayera, sino en que siguió siendo excepcionalmente central a enorme escala.
Japan and Germany remain manufacturing giants, but the long movement comes from India and South Korea. India's constant-dollar manufacturing output approached Germany's by 2025. South Korea built a similarly large base from a much smaller starting point. The AI race may concentrate model labs, while the industrial system beneath it remains multinational.
Japón y Alemania siguen siendo gigantes manufactureros, pero el gran movimiento viene de India y Corea del Sur. La producción manufacturera india en dólares constantes se acercó a la alemana en 2025. Corea del Sur construyó una base de tamaño similar desde un punto de partida mucho menor. La carrera de IA puede concentrar laboratorios de modelos mientras el sistema industrial subyacente sigue siendo multinacional.
Chinese resident patent applications rose from about 25,000 in 2000 to 1.43 million in 2021. High-technology exports reached $857 billion in 2024, more than 3 times Germany's level. Patents do not prove quality, and high-tech exports include much more than AI. Together they show why China's model sector sits inside a large innovation and manufacturing system.
Las solicitudes de patentes de residentes chinos aumentaron de unas 25.000 en 2000 a 1,43 millones en 2021. Las exportaciones de alta tecnología alcanzaron US$857.000 millones en 2024, más de 3 veces el nivel de Alemania. Las patentes no demuestran calidad y las exportaciones de alta tecnología incluyen mucho más que IA. Juntas muestran por qué el sector chino de modelos se apoya en un gran sistema innovador y manufacturero.
Meta said Llama downloads rose from 350 million in September 2024 to 1 billion by March 2025. That is nearly a tripling in half a year. Downloads are not active users and do not measure model quality, but they capture the diffusion advantage of downloadable weights. Closed systems retain more control; open systems recruit the rest of the world as adapters and distributors.
Meta afirmó que las descargas de Llama aumentaron de 350 millones en septiembre de 2024 a 1.000 millones en marzo de 2025. Es casi una triplicación en medio año. Las descargas no equivalen a usuarios activos ni miden calidad, pero reflejan la ventaja de difusión de los pesos descargables. Los sistemas cerrados conservan más control; los abiertos convierten al resto del mundo en adaptadores y distribuidores.
South Korean electricity use per person rose from 2,462 kWh in 1990 to 11,350 kWh in 2024. It moved from far below the European group to near the US level. Germany, France, the United Kingdom and Japan generally declined after earlier peaks. Electricity use does not equal spare datacenter capacity, but South Korea's trajectory shows the physical depth that exists outside the US-China model duopoly.
El consumo eléctrico por persona de Corea del Sur aumentó de 2.462 kWh en 1990 a 11.350 kWh en 2024. Pasó de estar muy por debajo del grupo europeo a acercarse al nivel estadounidense. Alemania, Francia, Reino Unido y Japón descendieron en general después de máximos anteriores. El consumo eléctrico no equivale a capacidad libre para centros de datos, pero la trayectoria surcoreana muestra la profundidad física existente fuera del duopolio de modelos entre Estados Unidos y China.
Stanford reported that the cost of inference at GPT-3.5-level benchmark performance fell more than 280-fold from November 2022 to October 2024. That collapse changes who can deploy capable models and how quickly challengers can scale. It also means hardware restrictions operate against a moving efficiency frontier. The safest conclusion is not one 2028 forecast, but continued pressure toward wider access and heavier electricity demand.
Stanford informó que el costo de inferencia con rendimiento comparable a GPT-3.5 cayó más de 280 veces entre noviembre de 2022 y octubre de 2024. Ese desplome cambia quién puede desplegar modelos capaces y qué tan rápido pueden escalar los competidores. También significa que las restricciones de hardware actúan contra una frontera de eficiencia en movimiento. La conclusión más segura no es un único pronóstico para 2028, sino una presión continua hacia mayor acceso y más demanda eléctrica.
US advanced-computing controls unfolded across three major rule stages, beginning in October 2022 and receiving material updates in October 2023 and December 2024.
Los controles estadounidenses de cómputo avanzado se desarrollaron en tres etapas principales de las reglas, comenzando en octubre de 2022 y recibiendo actualizaciones sustanciales en octubre de 2023 y diciembre de 2024.
Distillation can move valuable behavior into a model 21 times smaller. Model size, access and training method shape different kinds of power.
Key findings
Stanford reported that inference cost at GPT-3.5-level benchmark performance fell more than 280-fold from November 2022 to October 2024. report-ai.org
Moonshot’s official blog introduces Kimi K3 as a 2.8-trillion-parameter model with native vision and a 1-million-token context window. kimi.com
Anthropic alleged that DeepSeek, Moonshot, and MiniMax generated over 16 million Claude exchanges through approximately 24,000 fraudulent accounts. anthropic.com
DeepSeek reported that R1-Distill-Qwen-32B beat DeepSeek-V3 on several listed reasoning benchmarks, but the comparison was developer-reported. llm-stats.com
Stargate announced up to $500 billion over four years, which was a commitment ceiling rather than completed spending. openai.com
xAI and Nvidia said Colossus deployed 100,000 H100 GPUs in 122 days, an involved-party claim requiring independent confirmation. digitaltrends.com
Stanford estimated 2024 private AI investment at $109.1 billion in the US, $9.3 billion in China, and $4.5 billion in Britain.
A further 5-fold to 50-fold inference-cost decline by 2028 is a scenario range, not an observed trend or forecast. arxiv.org
TNW reported that Stanford’s 2026 AI Index put the best US-China model performance gap at 2.7%, down from 17.5–31.6 percentage points in May 2023. thenextweb.com
On April 23, 2026, the White House OSTP dated NSTM-4, titled “Adversarial Distillation of American AI Models.” whitehouse.gov
Stanford SCCEI says Chinese central and local government VC funds channeled $912 billion into strategic industries including AI over the past decade. sccei.fsi.stanford.edu
DeepSeek-R1 published six Qwen or Llama distilled checkpoints ranging from 1.5 billion to 70 billion parameters. deepseekai.guide
The argument
Kimi K3 pairs 2.8 trillion parameters with 1 million tokens.
China narrowed the quality gap faster than the release-count gap.
Anthropic alleges over 16 million Claude exchanges.
The race increasingly depends on datacenters, power and chip factories.
China installed 276,288 industrial robots in 2023, equal to 51% of global installations.
China's economy became less factory-heavy without losing its industrial depth.
This research is published in English and Spanish. Ver en español
La investigación detrás de esta presentación
La destilación puede transferir comportamiento valioso a un modelo 21 veces menor. El tamaño, el acceso y el entrenamiento crean distintas formas de poder.
Hallazgos clave
Stanford informó que el costo de inferencia con rendimiento comparable a GPT-3.5 cayó más de 280 veces entre noviembre de 2022 y octubre de 2024. report-ai.org
El blog oficial de Moonshot presenta Kimi K3 como un modelo de 2,8 billones de parámetros, con visión nativa y una ventana de contexto de un millón de tokens. kimi.com
Anthropic afirmó que DeepSeek, Moonshot y MiniMax generaron más de 16 millones de intercambios con Claude mediante aproximadamente 24.000 cuentas fraudulentas. anthropic.com
DeepSeek informó que R1-Distill-Qwen-32B superó a DeepSeek-V3 en varias pruebas de razonamiento, pero la comparación fue comunicada por el desarrollador. llm-stats.com
Stargate anunció hasta 500.000 millones de dólares durante cuatro años, un máximo comprometido y no gasto ejecutado. openai.com
xAI y Nvidia afirmaron que Colossus desplegó 100.000 GPU H100 en 122 días, una afirmación de partes involucradas que requiere confirmación independiente. digitaltrends.com
Stanford estimó la inversión privada de 2024 en 109.100 millones de dólares en Estados Unidos, 9.300 millones en China y 4.500 millones en Reino Unido.
Otra caída del costo de inferencia entre 5 y 50 veces para 2028 es un rango de escenarios, no una tendencia observada ni un pronóstico. arxiv.org
TNW informó que el Índice de IA 2026 de Stanford situó la brecha entre los mejores modelos de EE. UU. y China en 2,7%, frente a 17,5–31,6 puntos en mayo de 2023. thenextweb.com
El 23 de abril de 2026, la OSTP de la Casa Blanca fechó el memorando NSTM-4, titulado “Adversarial Distillation of American AI Models”. whitehouse.gov
Stanford SCCEI señala que fondos de capital de riesgo de gobiernos chinos centrales y locales canalizaron US$912.000 millones hacia industrias estratégicas, incluida la IA, durante la última década. sccei.fsi.stanford.edu
DeepSeek-R1 publicó seis puntos destilados basados en Qwen o Llama, desde 1.500 millones hasta 70.000 millones de parámetros. deepseekai.guide
El argumento
Kimi K3 combina 2,8 billones de parámetros con 1 millón de tokens.
China redujo la brecha de calidad más rápido que la de lanzamientos.
Anthropic alega más de 16 millones de intercambios con Claude.
La carrera depende cada vez más de centros de datos, energía y fábricas de chips.
China instaló 276.288 robots industriales en 2023, equivalentes al 51% de las instalaciones mundiales.
La economía china redujo su peso fabril sin perder profundidad industrial.
Esta investigación se publica en inglés y español. Read in English