|

Gemini Robotics 2 y la consolidación del control corporal completo en robótica humanoide

Seguir en Google
Resumen Estructurado: Gemini Robotics 2

El contexto: Google DeepMind presenta Gemini Robotics 2, pasando de la manipulación estática al control corporal completo integrando marcha, equilibrio y locomoción en plataformas humanoides como Apollo 2.


1. Arquitectura Dividida

La suite se organiza en tres variantes: Gemini Robotics ER 2 para razonamiento encarnado de alto nivel (basado en Gemini 3.5 Flash), Gemini Robotics 2 para acción VLA, y Gemini Robotics On-Device 2 optimizado sobre Gemma para procesamiento local.

2. Rendimiento y Métricas

Destaca con un 76,3% de éxito en recogida en estantes, 91,3% de precisión en localización temporal en vídeo continuo y soporte nativo para streaming de baja latencia mediante la API Gemini Live.

3. Marco de Seguridad

Incorporación del benchmark ASIMOV-Agentic y un sistema de contención redundante por capas para evaluar la seguridad de las acciones físicas en entornos compartidos con humanos.

«La inteligencia física en 2026 exige la convergencia unificada entre la interpretación semántica y la dinámica locomotora.»

Escuchar artículo
Gemini Robotics 2 y la consolidación del control corporal completo en robótica humanoide
0:00 –:–

El 30 de julio de 2026, Google DeepMind presentó oficialmente la suite Gemini Robotics 2, un desarrollo fundamental en la convergencia entre grandes modelos multimodales y la robótica autónoma. Bajo la dirección de Carolina Parada, vicepresidenta y responsable de robótica en la organización, el anuncio formaliza la transición desde sistemas de manipulación limitada en superficies de trabajo estáticas hacia el control corporal completo en plataformas humanoides y brazos bimanuales. Esta familia de modelos aborda de forma unificada la relación entre el razonamiento espacial de alto nivel y el control kinemático de bajo nivel.

La propuesta de Google DeepMind no se articula como un único algoritmo aislado, sino como una suite técnica distribuida en tres variantes interconectadas. La capa de acción se sostiene en el modelo vision-language-action Gemini Robotics 2, mientras que la planificación de alto nivel recae sobre el modelo de razonamiento encarnado Gemini Robotics ER 2. La suite se completa con Gemini Robotics On-Device 2, una versión optimizada sobre la arquitectura Gemma para ejecutarse en procesadores locales embarcados con baja latencia y máxima privacidad.

El salto funcional impulsado por Google DeepMind

La innovación central de Gemini Robotics 2 radica en la extensión del control cinemático a la totalidad del cuerpo del robot. Mientras que las arquitecturas VLA precedentes coordinaban exclusivamente el movimiento de extremidades superiores sobre bases fijas, esta nueva versión calcula de manera integrada la marcha, los cambios en el centro de gravedad, el agachado y el estiramiento corporal, coordinando desde los apoyos de los pies hasta el agarre fino de los dedos.

En las pruebas de campo desarrolladas en la instalación Robot Park en Austin, el modelo ha sido evaluado extensivamente sobre el robot humanoide Apollo 2 de la empresa Apptronik, equipado con manos robóticas Inspire de alta destreza y pinzas de doble dedo SharpaWave. La plataforma ha demostrado la capacidad de recibir instrucciones complejas en lenguaje natural, como trasladar una regadera hacia un contenedor específico en un estante inferior, ejecutando de forma continua la caminata, la inclinación corporal y la colocación exacta del objeto sin requerir la división de la tarea en scripts rígidos preprogramados.

Procesamiento Embarcado

Ejecución local sin latencia

El modelo opera directamente en los procesadores locales del robot, eliminando la dependencia de la red para entornos sin conectividad.

Multi-Embodiment

Adaptación rápida de hardware

Arquitectura adaptable a nuevas morfologías corporales, articulaciones y sensores en pocas horas de ajuste fino.

Entorno Dinámico

Generalización en entornos reales

Pruebas complejas de manipulación con menos de 200 demostraciones en escenarios con objetos desordenados.

Bucle de Acción Continuo

Coordinación motora fina

Demostración del bucle de percepción-acción en tiempo real ejecutando tareas de agachado y agarre de precisión.

La arquitectura dividida entre razonamiento encarnado y control motor cinemático

La suite estructura su funcionamiento diferenciando el plano cognitivo del plano de ejecución motora. El módulo Gemini Robotics ER 2 funciona como el cerebro superior del sistema. Desarrollado sobre la arquitectura de Gemini 3.5 Flash, este modelo admite una ventana de contexto de 128.000 tokens y genera respuestas estructuradas de hasta 64.000 tokens. A diferencia de versiones anteriores como ER 1.6, procesa transmisiones de vídeo continuo en lugar de fotogramas estáticos, lo que le permite supervisar tareas de varios minutos de duración, evaluar el nivel de avance y detectar desviaciones sobre la marcha.

La capacidad de razonar en tiempo real se potencia mediante la inclusión de endpoints orientados a la transmisión directa mediante la API Gemini Live, destacando la variante de baja latencia gemini-robotics-er-2-streaming-preview. Este modelo incluye capacidades de orquestación agente, lo que le permite realizar llamadas nativas a funciones desarrolladas por terceros, ejecutar código Python o consultar la Búsqueda de Google para recopilar datos del entorno. Además, integra un sistema de colaboración multi-robot capaz de distribuir secuencias de trabajo entre humanoides, plataformas sobre ruedas y brazos bimanuales como el Franka F3 Duo, compartiendo una misma interpretación semántica de la escena.

Arquitectura Tripartita

Ecosistema Gemini Robotics 2

Orquestación desacoplada entre el razonamiento cognitivo, la acción motora y el procesamiento en el dispositivo

Capa Cognitiva

Gemini Robotics ER 2

Actúa como el cerebro superior. Planifica secuencias complejas analizando vídeo continuo en tiempo real y coordinando flujos multi-robot.

  • Base: Gemini 3.5 Flash
  • Contexto: 128k Tokens
  • Input: Vídeo continuo (Live API)
Capa de Acción

Gemini Robotics 2

Modelo VLA que traduce intenciones semánticas en trayectorias cinemáticas continuas para todo el cuerpo (marcha, agachado y agarre fino).

  • Control: Cuerpo Completo (Full-Body)
  • Precisión mesa: 68,4%
  • Precisión estantes: 76,3%
Capa Local

On-Device 2

Versión ultracompacta diseñada para ejecutarse localmente en el hardware embarcado del robot sin latencia de red y con privacidad total.

  • Base: Arquitectura Gemma
  • Conectividad: Offline / Edge
  • Adaptación: < 200 ejemplos

Benchmarks de precisión y capacidades de interacción en entornos reales

Las evaluaciones publicadas por Google DeepMind reflejan avances cuantitativos relevantes en tareas físicas y de análisis temporal. En pruebas de manipulación espacial sobre la plataforma Apollo 2, el modelo alcanzó una tasa de éxito del 76,3% en la recogida de objetos situados en estanterías, un 68,4% en superficies elevadas como mesas y un 45,7% en recogidas directamente desde el suelo, donde el control del equilibrio corporal resulta crítico. En tareas de manipulación fina con brazos bimanuales Franka Duo, como atar bolsas de basura, enroscar bombillas o insertar cintas en reproductores, la precisión del sistema alcanzó un 74,2%.

En el apartado de comprensión de vídeo continuo, Gemini Robotics ER 2 registra un 91,3% de precisión en la tarea de localización de momentos exactos, identificando el fotograma preciso en el que concluye una acción clave con un error medio de solo 0,96 segundos. En la clasificación del progreso de tareas dividida en cinco tramos de ejecución, el modelo alcanza un 57,4% de precisión. Asimismo, el sistema ha ampliado su capacidad de lectura de instrumentos a diez tipologías distintas, incluyendo pantallas digitales, escalas lineales, termómetros de líquido y manómetros de presión, facilitando la inspección autónoma en instalaciones industriales.

El mapa competitivo frente a FLUX 3, Figure 03 y las alternativas de código abierto

El anuncio de Google DeepMind se enmarca en un periodo de intensa actividad dentro de la inteligencia física. El 23 de julio de 2026, Black Forest Labs lanzó FLUX 3, una red multimodal basada en flow matching que unifica la generación de imagen, vídeo con audio nativo y la predicción de acciones robóticas. A través del desarrollo FLUX-mimic en alianza con Mimic Robotics, esta arquitectura se está aplicando en las plantas de ensamblaje de Audi para la manipulación delicada de cableado y sellos flexibles, demostrando que los modelos generativos de vídeo coinciden en su representación interna del espacio con las necesidades del control motor.

En el ámbito de los despliegues industriales masivos, Figure 03 opera en la planta de BMW en Spartanburg respaldado por la red neuronal Helix 02 y modelos de OpenAI, mientras que Tesla continúa la integración de las iteraciones de Optimus en sus gigafactorías. En el sector de la investigación especializada, Physical Intelligence avanza con sus modelos Pi0 y Pi0.5 centrados en aprendizaje táctil, al tiempo que NVIDIA impulsa la industria con su plataforma GR00T N1.7 y los modelos Cosmos World Foundation. En el ámbito del software abierto, iniciativas como LeRobot de Hugging Face con los modelos SmolVLA y OpenVLA garantizan alternativas accesibles para la comunidad investigadora.

Marcos de seguridad y perspectivas para la automatización física generalizada

El despliegue de robots de gran tamaño impulsados por modelos probabilísticos en entornos compartidos con seres humanos ha obligado a reforzar los mecanismos de contención. Para abordar este desafío, Google DeepMind ha implementado una arquitectura de seguridad por capas inspirada en el modelo de protección redundante, abarcando salvaguardas semánticas, físicas y operativas.

Entre las herramientas introducidas destaca el nuevo benchmark de evaluación ASIMOV-Agentic, diseñado para verificar de forma continua si las instrucciones interpretadas o generadas por el modelo pueden derivar en acciones físicamente peligrosas. Este marco de evaluación busca garantizar que, ante situaciones de incertidumbre o fallos en el reconocimiento de objetos, el robot adopte estados de parada segura o pida aclaraciones verbales antes de aplicar fuerza cinemática en su entorno.

Glosario Técnico

VLA Model Robótica
Vision-Language-Action Model. Arquitectura que une visión por computador y procesamiento de lenguaje para generar comandos de acción motora directa.
Embodied AI Concepto
Inteligencia artificial encarnada que interactúa con el mundo físico mediante sensores y actuadores dentro de una cuerpo físico o robótico.
Control Cinemático
Cálculo y gestión de las trayectorias, velocidades y aceleraciones de las articulaciones de un robot para ejecutar movimientos precisos.
Flow Matching Algoritmo
Técnica alternativa a los modelos de difusión tradicional empleada en arquitecturas como FLUX 3 para la generación y predicción continua.
ASIMOV-Agentic Benchmark
Marco de evaluación de seguridad diseñado por Google DeepMind para verificar que los modelos no ejecuten acciones físicamente peligrosas.
Manipulación Bimanual
Capacidad de coordinar dos brazos robóticos de forma sincrónica para realizar tareas complejas como atar, enroscar o ensamblar.
Autoría y colaboración técnica
Foto del avatar
Arquitecto de Arkosia

Miguel Ángel Navarro

Innovador en IA y Coordinador Técnico. Fusiona desarrollo web, audiovisual y soporte para integrar la IA en flujos de trabajo creativos y eficientes.

Foto del avatar
System Architect (IA)

Kanon System Arquitect

IA especializada en verificación de datos y estructura técnica. Colabora en el análisis y diseño bajo estricta supervisión humana.

Reparto de carga operativa
Miguel Ángel Navarro: 56% Kanon System Arquitect: 44%

No te pierdas...