Gemini Robotics 2 lleva los robots del texto al mundo físico, y los benchmarks lo miden
Google DeepMind ha publicado Gemini Robotics 2, un modelo vision-language-action (VLA) que convierte lo que un robot ve y siente en comandos motores para todo el cuerpo, desde los pies hasta los dedos. El modelo hace caminar y agacharse a un humanoide, manipula objetos en habitaciones desordenadas, y coordina múltiples robots trabajando juntos. Además funciona on-device y se adapta a cuerpos robóticos nuevos en pocas horas.
El anuncio llega tres días después de que reportáramos SceneActBench, el benchmark que evalúa modelos vision-language en acciones coordinadas con múltiples objetos en escenas 3D. Once modelos probados, puntuaciones entre 38 y 50 de 100: ninguno se desempeña bien en todo. Ahora hay un modelo de laboratorio que intenta hacer exactamente esas cosas, en un cuerpo real.
Por qué te importa. Si trabajas con agentes IA, hasta ahora has medido el éxito en texto y código. Los VLM que describen imágenes siguen en la misma familia. El salto hacia agentes que manipulan el mundo físico desplaza la pregunta: importa qué tan coordinada es su acción en el espacio, más allá de lo que saben decir. Los benchmarks lo persiguen. Gemini Robotics 2 muestra que los labs invierten en serio, con modelos que controlan movimiento fino y colaboración multi-robot.
En el mismo frente, MarbleOS (Show HN, 113 puntos) propone una interfaz gráfica para agentes IA con archivos, herramientas y outputs visibles en lugar de hilos de chat enterrados. Es una demo prematura, pero la señal es coherente: cuando el agente hace cosas en el mundo en lugar de escribir, la interfaz debe mostrar el trabajo en progreso.
Los límites siguen siendo grandes. Gemini Robotics 2 es un anuncio de laboratorio, aún sin un producto que comprar. Los benchmarks en escenas 3D registran puntuaciones bajas para todos. Falta reproducibilidad independiente: por ahora los números sobre adaptación a nuevos cuerpos vienen de DeepMind mismo.
En detalle
El contexto: hace meses hablamos de agentes que trabajan con texto y código. Los papers sobre world models generativos habían mostrado la dirección, entrenar robots en simulación en lugar del mundo real. Dos frameworks sobre razonamiento espacial habían marcado el límite: los VLM que describen imágenes no razonan bien sobre el espacio físico. Gemini Robotics 2 intenta cerrar esa brecha con una arquitectura diferente.
Qué cambia técnicamente. Un modelo vision-language-action no se detiene en la descripción. Toma como entrada el flujo de video de las cámaras del robot e instrucciones en lenguaje natural, y produce como salida comandos para cada articulación motora. El modelo controla todo el cuerpo: marcha, agarre fino de objetos, coordinación entre extremidades. DeepMind habla de adaptación a cuerpos robóticos nuevos en pocas horas y ejecución on-device sin nube.
La novedad respecto a la primera generación de Gemini Robotics es el control whole-body. Antes los VLA gestionaban un brazo o pinza, ahora cubren desde la marcha hasta la manipulación fina. Añade colaboración multi-robot: dos robots que se dividen el trabajo para ordenar una habitación.
Dónde las fuentes divergen y qué queda abierto. El post de DeepMind es un anuncio con demos en video, no un paper con métricas reproducibles. Los números sobre adaptación a nuevos cuerpos (pocas horas) y ejecución on-device son afirmaciones del laboratorio, no verificadas independientemente. SceneActBench, publicado en arXiv tres días antes, muestra el cuadro opuesto: cuando se mide objetivamente cómo los VLM coordinan acciones en escenas 3D, las puntuaciones están entre 38 y 50 de 100. La brecha entre el anuncio y la medida independiente es amplia.
MarbleOS, reportado en Hacker News el mismo día, toca un nodo conectado pero diferente: si el agente opera sobre archivos, herramientas y outputs en lugar de solo responder en chat, necesita una interfaz que muestre el trabajo en progreso. Es una beta con 113 puntos en HN, no un producto maduro, pero el problema de la interfaz para agentes que actúan en el mundo es real.
Qué no concluir. Un robot que camina y manipula objetos en un demo de video no significa que los VLA estén listos para producción. Los benchmarks dicen lo contrario. La señal útil es otra: los labs están invirtiendo en modelos que actúan en el mundo físico, y las herramientas para medirlos llegan en paralelo. Para quien construye agentes hoy con texto y código, vale la pena seguir esta línea: las métricas de evaluación que usas podrían no ser suficientes cuando el agente tenga que operar en el espacio en lugar de en la página.