Mes lectures 0

Mes lectures

IA Générale

Google lance Gemini Robotics 2, améliore dextérité robotique

Le modèle ER 2 classe la complétude d'une image vidéo avec près de 60 % de précision. Google DeepMind déploie cette mise à jour pour piloter des robots hum

Châssis de robot humanoïde éteint, vu de dos, dans un laboratoire de robotique au crépuscule.
📋 En bref
Le modèle ER 2 classe la complétude d'une image vidéo avec près de 60 % de précision. Google DeepMind déploie cette mise à jour pour piloter des robots hum
  • Gemini Robotics ER 2 : le raisonnement incarné passe à la version 2
  • Un robot généraliste, l'ambition affichée
  • Le VLM et l'API Gemini Live pour développeurs
  • Ce que ces 60 % situent

Le modèle ER 2 classe la complétude d’une image vidéo avec près de 60 % de précision. Google DeepMind déploie cette mise à jour pour piloter des robots humanoïdes entiers. L’objectif affiché : un robot généraliste capable d’imiter les gestes humains.

🤖 Transparence IA — Cet article a été rédigé avec l'assistance d'outils d'IA générative à partir de sources primaires identifiées, puis relu et validé par Mohamed Meguedmi, fondateur de LagazetteIA.

Ce qu’il faut retenir – Gemini Robotics ER 2, modèle de raisonnement incarné, atteint près de 60 % de précision sur la classification de complétude d’une image vidéo. – Le système repose sur un trio de sous-modèles, dont un est ouvert aux développeurs dès le jour de l’annonce. – L’accès public passe par l’API Gemini Live, qui traite les flux vidéo en temps réel.

Gemini Robotics ER 2 : le raisonnement incarné passe à la version 2

Google DeepMind présente Gemini Robotics 2.0 ce jeudi 30 juillet 2026, selon Ars Technica. Au cœur du dispositif, un modèle baptisé Gemini Robotics ER 2 — ER pour embodied reasoning, le raisonnement incarné, soit la capacité d’une IA à décider en fonction de ce qu’elle perçoit du monde physique.

Google avance une mesure : ER 2 classe la complétude d’une image vidéo avec près de 60 % de précision. Le modèle s’appuie sur un trio de sous-modèles. L’un d’eux devient accessible aux développeurs dès le jour de l’annonce.

Un robot généraliste, l’ambition affichée

Gemini Robotics vise un robot généraliste : une machine capable, sur le papier, de reproduire n’importe quelle action humaine. C’est la ligne directrice que Google répète depuis le lancement du programme.

Avec la version 2.0, la firme affirme que son IA robotique pilote désormais un robot humanoïde complet, avec une dextérité améliorée. Le saut concerne le contrôle de l’ensemble du corps, pas un bras isolé ni une pince. Google ne communique toutefois pas de mesure chiffrée de cette dextérité à ce stade.

Le VLM et l’API Gemini Live pour développeurs

ER 2 appartient à la famille des VLM, vision language models — des modèles qui relient l’image au langage pour interpréter une scène. Concrètement, le système lit un flux vidéo pour suivre la progression d’une tâche, image après image.

Ce sous-modèle s’intègre à l’API Gemini Live. Les développeurs testent donc eux-mêmes la brique de perception, sans attendre un robot physique. L’ouverture immédiate d’un composant, plutôt qu’une démonstration en vase clos, distingue cette sortie des annonces robotiques précédentes de Google.

Ce que ces 60 % situent

Le chiffre de 60 % mérite d’être replacé. Il ne mesure pas la réussite d’une tâche complète, mais la seule classification de la complétude d’une image vidéo — savoir si une séquence montre une action finie ou en cours. À ce niveau, la brique de perception reste perfectible avant tout usage industriel.

Pour les équipes qui suivent la course aux robots humanoïdes, l’intérêt tient moins au score qu’à l’accès. Un composant ouvert dès le premier jour permet de mesurer l’écart entre la démonstration filmée et le comportement sur le terrain, ce que ne permet pas une vidéo promotionnelle.

FAQ

Qu’est-ce qu’un modèle de raisonnement incarné ?

C’est un système d’IA relié à un robot physique. Il perçoit son environnement — surtout par la vision — puis décide de l’action à mener. Le raisonnement incarné, ou embodied reasoning, s’oppose aux modèles purement textuels, qui n’interagissent pas avec le monde réel.

Comment tester Gemini Robotics ER 2 ?

Google ouvre l’un des sous-modèles via l’API Gemini Live dès le 30 juillet 2026. Les développeurs y accèdent pour expérimenter la perception vidéo, sans matériel robotique dédié.

À suivre

Google n’a pas daté le déploiement des autres sous-modèles ni chiffré les gains de dextérité annoncés. Prochaine étape à surveiller : les premiers retours des développeurs sur l’API Gemini Live. À lire aussi, notre suivi de Google DeepMind et la robotique.

Avatar photo
À propos de l'auteur

Mohamed Meguedmi

Je suis Mohamed Meguedmi, fondateur et directeur éditorial de LagazetteIA. Multi-entrepreneur passionné de tech depuis toujours, j'ai intégré l'IA dans chacune de mes entreprises dès ses débuts. Chaque semaine, je teste des dizaines d'outils IA, compare les modèles et décortique les dernières avancées pour vous donner un avis concret, sans bullshit. Mon objectif avec LagazetteIA : vous faire gagner du temps et vous aider à prendre les bonnes décisions dans cette révolution technologique. La rédaction s'appuie sur des outils d'analyse modernes (incluant l'IA générative) et chaque publication est vérifiée et validée par mes soins avant mise en ligne. Profil LinkedIn : https://www.linkedin.com/in/mohamed-meguedmi/