
Google avance vers un avenir où les utilisateurs cesseront de contrôler directement leurs téléphones mobiles depuis l’écran, déléguant cette fonction à son système d’intelligence artificielle, Gemini.
Ce pari représente un changement radical dans la façon d’interagir avec les appareils Android, ouvrant la porte à une nouvelle ère d’automatisation où les actions quotidiennes ne dépendront plus d’une intervention manuelle.
Comment est le projet de Google pour l’automatisation
La société a présenté publiquement les premières ébauches de ce plan sous le nom de Project Astra, lors de sa dernière conférence des développeurs. Là, elle a montré comment Gemini peut agir comme un agent autonome, capable d’exécuter des tâches sur le téléphone, d’analyser le contenu à l’écran et même de se déplacer et d’activer des boutons dans des applications, sans que l’utilisateur ait à toucher l’écran.
Dans les versions bêta les plus récentes de l’application Google pour Android, les développeurs ont trouvé de nouvelles chaînes de code confirmant l’arrivée imminente d’une fonctionnalité baptisée “automatisation d’écran”.

Le nom de code interne pour le système est “bonobo”. Cet outil permettra à Gemini d’effectuer des actions au sein d’applications spécifiques : de la passation de commandes en ligne à la demande d’un trajet dans des applications comme Uber ou Lyft, tout cela sans que l’utilisateur n’ait à interagir physiquement avec son mobile.
Le but de cette automatisation est clair : libérer l’utilisateur des tâches répétitives ou simples qui consomment du temps, permettant à l’intelligence artificielle de prendre le contrôle opérationnel sous une surveillance constante.
Comme démontré dans Project Astra, Gemini est non seulement capable de lire les informations affichées à l’écran, mais peut également naviguer dans des interfaces, identifier et sélectionner des options, et confirmer des actions de manière autonome.
Comment fonctionnerait l’automatisation de Gemini sur Android
Le fonctionnement prévu de l’automatisation d’écran repose sur la capacité de Gemini à analyser, comprendre et exécuter des instructions au sein de différentes applications. Par exemple, l’utilisateur pourra demander à l’IA d’acheter un produit en ligne ou de réserver un trajet.

L’intelligence artificielle analysera l’écran, détectera les éléments nécessaires et procédera à la réalisation des étapes requises, depuis le début du processus jusqu’à la confirmation finale, sans que l’utilisateur ait besoin de toucher l’écran.
Les premiers indices trouvés dans le code de la version bêta de l’application Google pour Android suggèrent que, bien que les fonctions initiales soient limitées, le potentiel d’expansion est considérable. À l’avenir, Gemini pourrait gérer le suivi des achats et commandes jusqu’à l’organisation d’activités personnelles, tout cela à travers une interface conversationnelle et proactive.
L’intégration de l’automatisation d’écran dans Android apporte également des nouveautés dans l’interface utilisateur. De nouvelles sections ont été détectées, comme “Achats” et “Mes commandes”, au sein de la zone de gestion de comptes et dans l’application elle-même de Gemini.
Bien que ces options ne soient pas encore opérationnelles, elles anticipent la possibilité pour les utilisateurs de consulter et de gérer des commandes directement depuis un panneau centralisé, facilitant le suivi et l’administration des activités réalisées par l’intelligence artificielle.

Comment sera la vie privée et le contrôle de l’utilisateur
L’autonomie de Gemini, cependant, ne signifie pas que l’utilisateur perd le contrôle de son appareil. Le code de l’application Google inclut des avertissements clairs : l’utilisateur doit toujours superviser les actions réalisées par Gemini.
Bien que l’IA soit conçue pour minimiser l’intervention humaine, Google souligne que des erreurs peuvent survenir et que la responsabilité ultime de toute action exécutée incombe à l’utilisateur. À tout moment, ce dernier pourra reprendre le contrôle manuellement s’il le juge nécessaire.
Un aspect pertinent qui émerge des chaînes de code trouvées est la préoccupation pour la vie privée et la sécurité de l’information. Si l’utilisateur active la fonction de maintien de l’activité (“Keep Activity”), des examinateurs entraînés pourront voir des captures d’écran de l’appareil pour garantir le bon fonctionnement du système.
Pour cette raison, il est recommandé de ne pas saisir d’informations sensibles ou de données de paiement tant que l’automatisation est active, bien qu’il ne soit pas clair si l’IA pourra détecter automatiquement ces cas et suspendre son intervention, ou si cela dépendra de l’utilisateur pour la désactiver manuellement.