Storie DécryptageTech et IA
Gemini Robotics 2 veut devenir le cerveau de tous les robots : Google prépare-t-il l’Android du monde physique ?
Apollo 2 avec deux types de mains, Franka Duo, exécution locale et adaptation à de nouveaux corps avec moins de 200 exemples : Google DeepMind ne cherche plus seulement à rendre un robot intelligent. Avec Gemini Robotics 2, il tente de construire une couche d’intelligence transférable entre plusieurs machines. Une ambition qui rappelle Android — avec des limites importantes.
Par Florent Despréaux

Le vrai pari de Google : séparer le cerveau du corps
Pendant des décennies, chaque robot a été conçu comme un système presque fermé : un corps, des capteurs, un logiciel, des mouvements et des tâches largement spécifiques. Gemini Robotics 2 attaque ce verrou de front. Google DeepMind ne présente pas seulement un nouveau modèle pour un humanoïde : il veut construire une couche d’intelligence capable de fonctionner sur plusieurs formes de robots.
L’image la plus forte publiée par DeepMind n’est donc pas un robot spectaculaire. C’est un résultat d’architecture : le même checkpoint de Gemini Robotics 2 contrôle trois embodiments différents — Apollo 2 avec des mains SharpaWave, Apollo 2 avec des mains Inspire et un Franka Duo équipé d’une pince Robotiq. Autrement dit, le corps change, mais une partie essentielle de l’intelligence reste commune.
C’est ce qui rend l’analogie avec Android intéressante. Android n’a pas imposé un téléphone unique : il a fourni une couche logicielle commune à des appareils différents. Gemini Robotics 2 pourrait-il jouer un rôle comparable dans le monde physique ? La comparaison reste imparfaite, mais elle permet de comprendre l’ambition.

Apollo 2 devient un banc d’essai grandeur nature
Apptronik joue un rôle central dans cette stratégie. Le 30 juin 2026, l’entreprise a dévoilé Apollo 2, nouvelle génération de sa plateforme humanoïde, proposée en version bipède et sur base roulante. Dans ses Robot Parks, des flottes d’Apollo 2 collectent des données sur des tâches et environnements réels en partenariat avec Google DeepMind.
Un mois plus tard, DeepMind montre Apollo 2 comme l’un des corps principaux de Gemini Robotics 2. L’exemple le plus parlant combine déplacement et manipulation : sur instruction, l’humanoïde peut aller chercher un arrosoir, marcher jusqu’à une étagère puis le déposer dans un bac précis. Le modèle ne se contente donc plus de commander deux bras au-dessus d’une table : il orchestre le corps entier.
Cette progression compte parce que le monde réel impose des contraintes simultanées. Un humanoïde doit voir, équilibrer son corps, choisir une trajectoire, atteindre un objet, le saisir et corriger son action si quelque chose se passe mal. L’intelligence robotique ne peut plus être séparée du mouvement.
Trois modèles pour trois niveaux du problème
Gemini Robotics 2 n’est en réalité pas un seul modèle. DeepMind présente une famille de trois briques complémentaires. Gemini Robotics 2 est le modèle vision-langage-action — le VLA — qui transforme images et instructions en commandes motrices. Gemini Robotics ER 2 est la couche de raisonnement incarné. Gemini Robotics On-Device 2 est la version optimisée pour fonctionner directement sur le robot.
ER 2 joue le rôle de cerveau de haut niveau. Il reçoit la consigne humaine, observe l’environnement, raisonne sur les étapes nécessaires, coordonne le VLA et suit l’avancement. DeepMind affirme qu’il peut gérer des séquences durant plusieurs minutes et impliquant des centaines de décisions, avec capacité à se corriger lorsqu’une étape échoue.
On-Device 2 répond à une autre contrainte : un robot ne peut pas toujours dépendre du cloud. Latence, connexion ou sécurité peuvent imposer une exécution locale. Le modèle est donc conçu pour fonctionner sur le matériel robotique lui-même.

Moins de 200 exemples pour apprendre un nouveau corps
La promesse la plus stratégique se trouve peut-être dans On-Device 2. DeepMind le décrit comme nativement multi-embodiment et indique pouvoir l’adapter à de nouveaux robots avec seulement quelques heures de données, généralement moins de 200 exemples.
Le point est crucial. Aujourd’hui, changer de robot signifie souvent reconstruire une grande partie de la pile : nouvelles articulations, nouveaux capteurs, nouveaux degrés de liberté, nouvelles données. Si un modèle généraliste peut être adapté rapidement à un nouveau matériel, la valeur pourrait progressivement se déplacer du robot lui-même vers la couche d’intelligence qui sait apprendre son corps.
DeepMind cite des adaptations à des plateformes très différentes comme Dexmate, SO101 et Trossen. Cela ne prouve pas encore qu’un modèle pourra contrôler n’importe quel robot sans travail spécifique, mais cela montre la direction : réduire fortement le coût logiciel d’un changement de hardware.
La même intelligence, mais pas encore les mêmes performances
Il faut toutefois éviter de transformer cette transférabilité en magie. Les résultats publiés par DeepMind montrent encore de fortes différences selon les tâches. Sur Apollo 2 avec mains SharpaWave, dévisser une ampoule atteint 92 % de réussite dans l’évaluation publiée, mais revisser une ampoule tombe à 36 %, utiliser une pelle et une balayette à 32 % et fermer un sac Ziplock à 40 %.
Le Franka Duo avec pince obtient de meilleurs résultats sur plusieurs tâches de manipulation : 74,2 % en pick-and-place général, 78,9 % en préparation d’outils et 89,6 % sur des insertions précises. Ce contraste rappelle que partager un modèle ne fait pas disparaître les différences mécaniques entre les corps.
C’est précisément la limite de l’analogie Android. Un smartphone Android expose des interfaces largement standardisées. Dans la robotique, chaque corps possède sa propre géométrie, ses forces, ses capteurs, ses actionneurs et ses contraintes physiques. Le logiciel peut devenir commun, mais le monde réel ne l’est pas.
L’« Android des robots » n’existe donc pas encore
Gemini Robotics 2 n’est pas aujourd’hui une plateforme ouverte que n’importe quel constructeur peut installer comme Android sur un téléphone. Le VLA principal est en private preview, On-Device 2 reste accessible à un groupe de testeurs et partenaires, tandis que Gemini Robotics ER 2 est la brique la plus largement accessible via Google AI Studio.
Il n’existe pas non plus encore d’écosystème standardisé d’applications robotiques, de certification matérielle ou de distribution comparable à celui construit autour d’Android. L’analogie décrit donc davantage une direction stratégique qu’un produit déjà constitué.
Mais la bataille du système d’exploitation physique a commencé
Le changement de perspective reste majeur. Les constructeurs de robots se battent traditionnellement sur le hardware : moteurs, mains, autonomie, charge utile, vitesse ou coût. L’arrivée de modèles multi-embodiment ajoute une nouvelle couche de compétition : qui fournira l’intelligence suffisamment générale pour piloter plusieurs familles de machines ?
Google DeepMind n’est évidemment pas seul sur ce terrain. Mais son partenariat avec Apptronik, ses Robot Parks, ses modèles de raisonnement et ses démonstrations sur plusieurs embodiments lui donnent une stratégie cohérente : collecter du réel, apprendre sur plusieurs corps et réutiliser ce qui a été appris.
Si cette approche fonctionne à grande échelle, le robot du futur pourrait ressembler moins à une machine entièrement autonome conçue de zéro qu’à un nouvel appareil venant se connecter à une intelligence déjà entraînée. C’est à ce moment-là que la comparaison avec Android cesserait d’être une métaphore.
Sources
- Gemini Robotics 2 brings whole body intelligence to robotsGoogle DeepMind · Carolina Parada · 30 juillet 2026
- Gemini Robotics 2Google DeepMind · Google DeepMind
- Gemini Robotics On-Device 2 — Model CardGoogle DeepMind · Google DeepMind · 30 juillet 2026
- Gemini Robotics On-Device 2Google DeepMind · Google DeepMind
- Welcome to Robot Park: Where Apptronik’s Apollo Goes to Work Training the Next Generation of Humanoid Robot IntelligenceApptronik · Apptronik · 30 juin 2026