One action with 95% success sounds dependable. A sequence of 20 is different. Under the independent-step calculation, flawless completion falls to 35.8%. Long-horizon robotics must manage compounding errors, not merely improve isolated actions.
Una acción con un 95% de éxito parece confiable. Una secuencia de 20 es distinta. Según el cálculo con pasos independientes, la finalización perfecta cae al 35,8%. La robótica prolongada debe controlar errores acumulados, no solo mejorar acciones aisladas.
4 términos técnicos sostienen buena parte del argumento.
A benchmark may reward reaching the expected outcome without checking how the robot interpreted the instruction. LangGap found that leading VLA models largely ignored language instructions despite exceeding 95% on standard benchmarks. Success and obedience are not the same capability.
Una prueba puede premiar el resultado esperado sin comprobar cómo interpretó el robot la instrucción. LangGap halló que modelos VLA avanzados ignoraban en gran medida las instrucciones pese a superar un 95% en pruebas estándar. El éxito y la obediencia no son la misma capacidad.
RT-2 connected web knowledge with robotic control and reported more than 2x generalization over earlier baselines on unseen scenarios. That is a meaningful predecessor result. Exact matched rates are still necessary before using it as a direct generational benchmark.
RT-2 conectó conocimiento de la web con control robótico e informó más de 2x de generalización frente a referencias anteriores en escenarios inéditos. Es un resultado predecesor importante. Aún se necesitan tasas comparables exactas antes de usarlo como prueba generacional directa.
RoboCat could adapt and then generate more practice data for itself. But the loop did not begin from nothing. New tasks first required approximately 100 to 1,000 demonstrations, making transfer cost part of the capability story.
RoboCat podía adaptarse y después generar más datos de práctica. Pero el ciclo no comenzó desde cero. Las tareas nuevas necesitaron primero aproximadamente de 100 a 1.000 demostraciones, por lo que el costo de transferencia forma parte de la capacidad.
Open X-Embodiment reported over 1 million trajectories, compared with DROID's 76,000. That is more than a 13x volume gap. Open X also covered 22 robot embodiments, but exposure across those mechanical forms was uneven.
Open X-Embodiment informó más de un millón de trayectorias, frente a las 76.000 de DROID. Es una diferencia de volumen superior a 13x. Open X también cubrió 22 cuerpos robóticos, pero la exposición entre esas formas mecánicas fue desigual.
Seeing a humanoid beside an industrial arm makes clear why more trajectories do not automatically ensure mechanical coverage.
Ver un humanoide junto a un brazo industrial aclara por qué más trayectorias no garantizan por sí solas una cobertura mecánica amplia.
Navigation data moved beyond a single laboratory or city. Collection covered 4,565 hours across 161 locations in 35 countries. It supported closed-loop sidewalk tests in 4 countries over 125 kilometers.
Los datos de navegación superaron un único laboratorio o ciudad. La recopilación cubrió 4.565 horas en 161 ubicaciones de 35 países. Sustentó pruebas cerradas en aceras de 4 países durante 125 kilómetros.
A general policy does not always need full retraining to improve. V-GPS reranked proposed actions and produced an average 82.8% improvement in real-world success without fine-tuning. Better selection can matter as much as a larger policy.
Una política general no siempre necesita reentrenamiento completo para mejorar. V-GPS reclasificó acciones propuestas y produjo una mejora promedio del 82,8% en el éxito real sin ajuste fino. Una mejor selección puede importar tanto como una política mayor.
Gemini 1.5 Pro could hold multimodal sequences of up to 1,000,000 tokens. That expands how much history and sensory context a system can consider. It does not by itself establish a fast or affordable perception-to-control loop.
Gemini 1.5 Pro podía mantener secuencias multimodales de hasta 1.000.000 de tokens. Eso amplía la historia y el contexto sensorial que un sistema puede considerar. Por sí solo, no establece un ciclo rápido ni asequible de percepción y control.
Manufacturing represented almost one-third of China's GDP in the mid-2000s. The share then declined steadily and reached 24.7% in 2025. China remains manufacturing-heavy, but its economic mix has changed materially.
La manufactura representaba casi un tercio del PIB de China a mediados de los años 2000. Después, la proporción descendió de forma sostenida y llegó al 24,7% en 2025. China sigue teniendo un gran peso manufacturero, pero su mezcla económica cambió de forma importante.
Korea's manufacturing share moved within a relatively narrow band compared with other major economies. It peaked at 29.0% in 2011 and ended at 27.4% in 2025. That sustained industrial weight makes Korea a particularly relevant deployment market.
La proporción manufacturera de Corea se movió dentro de un intervalo relativamente estrecho frente a otras grandes economías. Alcanzó un máximo del 29,0% en 2011 y terminó en 27,4% en 2025. Ese peso industrial sostenido convierte a Corea en un mercado de despliegue especialmente relevante.
Germany and Japan began the century at different levels but moved toward a similar manufacturing share. Germany reached 17.6% in 2025, while Japan reached 18.8% in 2024. Both remain industrial powers even as manufacturing occupies less of their economies.
Alemania y Japón comenzaron el siglo en niveles distintos, pero avanzaron hacia una proporción manufacturera similar. Alemania llegó al 17,6% en 2025 y Japón al 18,8% en 2024. Ambos siguen siendo potencias industriales aunque la manufactura ocupe una parte menor de sus economías.
Manufacturing represented 15.1% of US GDP in 2000. By 2021, that share was 10.5%. The market remains enormous, but manufacturing occupies a smaller portion of the overall US economy.
La manufactura representaba el 15,1% del PIB estadounidense en 2000. Para 2021, la proporción era del 10,5%. El mercado sigue siendo enorme, pero la manufactura ocupa una parte menor de la economía total de EE. UU.
China's industry employment share followed a different path from its manufacturing GDP share. Employment rose from 24.6% in 2000 to 31.8% in 2025. Industrial deployment therefore enters a labor market that has become more, not less, concentrated in industry.
La proporción del empleo industrial de China siguió una trayectoria distinta de la proporción manufacturera del PIB. El empleo subió del 24,6% en 2000 al 31,8% en 2025. Por tanto, el despliegue industrial entra en un mercado laboral más concentrado en la industria.
One-third of German employment was in industry in 2000. By 2025, the share had fallen to 26.0%. Germany remains a major industrial economy, but robot deployment enters a workforce with a smaller industrial footprint.
Un tercio del empleo alemán estaba en la industria en 2000. Para 2025, la proporción había caído al 26,0%. Alemania sigue siendo una gran economía industrial, pero el despliegue robótico entra en una fuerza laboral con menor presencia industrial.
Japan and Korea began with industrial employment near 30% and converged close to 23% by 2025. The United States started lower and ended at 18.9%. All three declined, but their labor exposure to industrial automation remains different.
Japón y Corea comenzaron con un empleo industrial cercano al 30% y convergieron cerca del 23% para 2025. Estados Unidos comenzó más abajo y terminó en 18,9%. Los tres descendieron, pero su exposición laboral a la automatización industrial sigue siendo distinta.
Germany's manufacturing cycle is anything but smooth. Growth collapsed 19.9% in 2009 and rebounded 19.6% in 2010, a swing of roughly 39 percentage points. Industrial robotics must deliver value through cycles, not only during expansion.
El ciclo manufacturero alemán está lejos de ser estable. El crecimiento cayó un 19,9% en 2009 y rebotó un 19,6% en 2010, una oscilación de unos 39 puntos porcentuales. La robótica industrial debe aportar valor durante los ciclos, no solo en la expansión.
Japan's manufacturing output fell 17.2% in 2009 and rebounded 16.9% in 2010. The recovery did not create a stable growth path. By 2024, manufacturing value added was contracting again by 5.8%.
La producción manufacturera de Japón cayó un 17,2% en 2009 y rebotó un 16,9% en 2010. La recuperación no creó una trayectoria estable. Para 2024, el valor agregado manufacturero volvía a contraerse un 5,8%.
Korea also experienced sharp industrial cycles, including a 14.0% rebound in 2010. Its later swings were smaller, and manufacturing value added grew 2.0% in 2025. That combination of scale and continued growth strengthens the commercial setting for industrial robotics.
Corea también experimentó ciclos industriales fuertes, incluido un rebote del 14,0% en 2010. Sus oscilaciones posteriores fueron menores y el valor agregado manufacturero creció un 2,0% en 2025. Esa combinación de escala y crecimiento continuo fortalece el entorno comercial para la robótica industrial.
Global industrial robot installations rose from roughly 159,000 in 2012 to 553,052 in 2022. That is more than a threefold increase in a decade. The market opportunity is real, even though annual industrial conditions remain cyclical.
Las instalaciones mundiales de robots industriales subieron de unas 159.000 en 2012 a 553.052 en 2022. Es un aumento superior a tres veces en una década. La oportunidad de mercado es real, aunque las condiciones industriales anuales sigan siendo cíclicas.
A person watching several robot arms turns market growth into the practical question of oversight and verification.
Una persona observando varios brazos robóticos convierte el crecimiento del mercado en una cuestión práctica de supervisión y verificación.
A second-generation label is not a performance result. Architecture, release status, supported hardware, and matched benchmark gains all determine what Gemini Robotics 2 actually represents. Those facts need primary documentation before the system earns a generational verdict.
Una etiqueta de segunda generación no es un resultado de rendimiento. La arquitectura, el lanzamiento, el hardware compatible y las mejoras comparables determinan lo que Gemini Robotics 2 representa. Esos hechos necesitan documentación primaria antes de otorgarle un veredicto generacional.
Long tasks can drift without one dramatic failure. Across 20 sequential interactions, the cited evaluation reported that compounded errors corrupted an average 25% of document content. Robotics faces the same structural danger when decisions and actions depend on earlier steps.
Las tareas largas pueden desviarse sin un fallo dramático. Durante 20 interacciones consecutivas, la evaluación citada informó que los errores acumulados corrompieron en promedio el 25% del contenido documental. La robótica enfrenta el mismo peligro estructural cuando las decisiones y acciones dependen de pasos anteriores.
The strongest findings all point in the same direction. High isolated scores can hide instruction failures and compound into weak long-task reliability. Gemini Robotics 2 should earn confidence through matched comparisons, repeated trials, recovery metrics, and transparent operating conditions.
Los hallazgos más sólidos apuntan en la misma dirección. Las puntuaciones aisladas pueden ocultar fallos de instrucciones y acumularse hasta producir poca fiabilidad prolongada. Gemini Robotics 2 debe ganarse la confianza mediante comparaciones equivalentes, ensayos repetidos, métricas de recuperación y condiciones operativas transparentes.
Reliable actions can still produce an unreliable plan. Despite exceeding 95% success on standard benchmarks, leading VLA models largely ignored language instructions.
Key findings
Open X-Embodiment reported more than 1 million trajectories spanning 22 embodiments, 60 datasets, and 527 skills. autolab.berkeley.edu
With independent 95% step success, flawless completion falls from 95% at one step to 59.9% at ten and 35.8% at twenty. snapxam.com
Zero observed incidents do not establish a low incident rate without total operating hours and counted opportunities for failure.
LangGap found that state-of-the-art VLA models largely ignored language instructions despite exceeding 95% success on standard benchmarks. arxiv.org
RT-2 reportedly more than doubled generalization performance over earlier baselines on unseen scenarios, but exact matched rates require verification. deepmind.google
PaLM-E's largest reported configuration contained 562 billion parameters and combined language, images, and continuous sensor inputs.
RoboCat adapted to new tasks using approximately 100 to 1,000 demonstrations before generating additional self-practice data. deepmind.google
DROID reported 76,000 trajectories, 350 interaction hours, 564 scenes, and 86 tasks collected with common robot hardware. openreview.net
Open X-Embodiment reportedly included 22 robot embodiments, creating broad but uneven training exposure across mechanical forms. deepmind.google
Gemini 1.5 Pro launched with a context window of up to 1 million tokens for long multimodal sequences. blog.google
IFR reported 553,052 industrial robot installations in 2022, versus roughly 159,000 in 2012, within a strongly cyclical market.
Broader robot capability can expand addressable tasks while increasing validation, liability, cybersecurity, and maintenance burdens.
The argument
RT-2 reported more than 2x generalization on unseen scenarios.
New tasks required approximately 100 to 1,000 demonstrations before self-practice began.
Dataset scale expanded sharply, but mechanical coverage remained uneven.
A 4,565-hour dataset covered 161 locations in 35 countries.
V-GPS improved real-world success by an average 82.8% without fine-tuning.
Gemini 1.5 Pro launched with context of up to 1,000,000 tokens.
This research is published in English and Spanish. Ver en español
La investigación detrás de esta presentación
Acciones confiables todavía pueden producir un plan poco confiable. Pese a superar un 95% de éxito en pruebas estándar, los modelos VLA más avanzados ignoraban en gran medida las instrucciones lingüísticas.
Hallazgos clave
Open X-Embodiment informó más de un millón de trayectorias distribuidas entre 22 cuerpos, 60 conjuntos y 527 habilidades. autolab.berkeley.edu
Con 95% de éxito independiente por paso, la finalización perfecta cae de 95% en uno a 59,9% en diez y 35,8% en veinte. snapxam.com
Cero incidentes observados no establecen una tasa baja sin horas totales de operación y oportunidades contabilizadas de fallo.
LangGap halló que los modelos VLA más avanzados ignoraban en gran medida las instrucciones lingüísticas pese a superar el 95% de éxito en pruebas estándar. arxiv.org
RT-2 supuestamente duplicó con creces la generalización frente a referencias anteriores en escenarios inéditos, pero las tasas comparables requieren verificación. deepmind.google
La mayor configuración informada de PaLM-E contenía 562 mil millones de parámetros y combinaba lenguaje, imágenes y sensores continuos.
RoboCat se adaptó a tareas nuevas con aproximadamente 100 a 1.000 demostraciones antes de generar datos adicionales de práctica autónoma. deepmind.google
DROID informó 76.000 trayectorias, 350 horas de interacción, 564 escenas y 86 tareas recopiladas con hardware robótico común. openreview.net
Open X-Embodiment supuestamente incluyó 22 cuerpos robóticos, creando una exposición amplia pero desigual entre formas mecánicas. deepmind.google
Gemini 1.5 Pro se lanzó con una ventana de contexto de hasta un millón de tokens para secuencias multimodales largas. blog.google
IFR informó 553.052 instalaciones de robots industriales en 2022, frente a unas 159.000 en 2012, dentro de un mercado muy cíclico.
Una capacidad robótica más amplia puede expandir tareas abordables mientras aumenta validación, responsabilidad, ciberseguridad y mantenimiento.
El argumento
RT-2 informó más de 2x de generalización en escenarios inéditos.
Las tareas nuevas requirieron aproximadamente de 100 a 1.000 demostraciones antes de comenzar la práctica autónoma.
La escala de los datos creció con fuerza, pero la cobertura mecánica siguió siendo desigual.
Un conjunto de 4.565 horas cubrió 161 ubicaciones en 35 países.
V-GPS mejoró el éxito real un promedio de 82,8% sin ajuste fino.
Gemini 1.5 Pro se lanzó con contexto de hasta 1.000.000 de tokens.
Esta investigación se publica en inglés y español. Read in English