Intelligence artificielle · Actualité

Google présente Gemini 4 Argon, son modèle d'IA le plus puissant à ce jour

Google a annoncé le 30 septembre le lancement de Gemini 4 Argon, son nouveau modèle d'intelligence artificielle, présenté par l'entreprise comme le plus avancé de son catalogue à ce jour. Le système, développé par Alphabet via Google DeepMind, est conçu pour des tâches de programmation, de recherche, de rédaction et de travail professionnel, bien que l'entreprise mette particulièrement en avant ses capacités en matière de cybersécurité.

Contrairement à d'autres récents lancements d'intelligence artificielle, Argon ne sera pas immédiatement accessible aux utilisateurs finaux. Son accès initial est restreint à un groupe sélect de partenaires en cybersécurité de Google via le programme Fairwind, l'initiative de sécurité de l'entreprise. Plus tard, le modèle sera disponible pour les clients de l'API payante et pour les abonnés à Google AI Ultra, bien qu'aucune date précise n'ait encore été fixée pour cette extension.

Détection et correction autonomes des failles de sécurité

Selon l'entreprise, Argon a été entraîné spécifiquement pour des tâches défensives dans le domaine cybernétique. Google affirme que le modèle peut « trouver, valider et corriger de manière autonome des vulnérabilités logicielles critiques ». Cette capacité explique pourquoi l'accès initial est limité aux collaborateurs en cybersécurité avant un déploiement plus large.

D'après Google DeepMind, les groupes prioritaires pour recevoir un accès anticipé incluent les administrations publiques, les organisations sanitaires et les services de télécommunications. L'entreprise a opté pour un déploiement progressif afin que ceux qui conçoivent des solutions défensives puissent exploiter l'outil avant que des capacités similaires ne soient utilisées à des fins offensives contre les systèmes informatiques.

Une référence citée dans le contexte de ces initiatives est Scan for Good, de l'entreprise Wiz, un programme qui recourt à l'intelligence artificielle pour analyser les services exposés à Internet. Cette initiative valide les découvertes et les communique de manière privée aux organisations concernées, en accordant la priorité aux hôpitaux, aux services publics et aux infrastructures essentielles. Parmi les problèmes les plus courants détectés figurent ceux liés à l'autorisation et à l'exposition des identifiants.

Argon maintient le raisonnement dans les tâches longues et complexes

Google souligne qu'Argon a été « conçu pour soutenir un raisonnement approfondi dans des flux de travail complexes et de longue portée », selon une publication sur son blog officiel. Le modèle gère une limite de sortie allant de 64 000 à un million de jetons, les unités d'information traitées par le système.

Cette capacité vise à ce que le modèle affronte des tâches en plusieurs étapes, telles que la révision de code, la recherche dans la documentation ou l'exécution de travaux spécialisés. Google mentionne parmi ses applications principales l'ingénierie logicielle, la finance et le domaine juridique. L'utilité réelle de cette fonctionnalité dépendra de la quantité de travail que le modèle peut accomplir sans intervention de l'utilisateur pour redresser le processus, ainsi que de la qualité finale des résultats fournis.

L'entreprise a également indiqué que son propre personnel utilise déjà Argon dans son travail quotidien, y compris pour des tâches de débogage et de migration de bases de code. Google souligne également la capacité du modèle à analyser du contenu visuel, comme des vidéos longues ou des graphiques.

Comparaison avec GPT-6 Astra et les systèmes d'Anthropic

Google a accompagné l'annonce de résultats de tests comparatifs entre Gemini 4 Argon, GPT-6 Astra d'OpenAI, et Claude Fable 5.1 et Claude Opus 5.5 d'Anthropic. Les évaluations ont porté sur la programmation, les tâches professionnelles, la compréhension vidéo et la gestion d'ordinateurs.

En programmation, Argon mène le test DeepSWE avec 77,9 %, bien que Claude Opus 5.5 obtienne de meilleurs résultats aux tests FrontierSWE et Terminal-Bench. Dans les tâches professionnelles, Argon domine les évaluations de recherche financière, les tâches juridiques et l'automatisation des entreprises parmi les quatre modèles comparés.

Pour la compréhension de vidéos longues, le modèle de Google atteint 91,7 % au test LVBench, devant les 87,5 % enregistrés par GPT-6 Astra. Cependant, en matière de gestion d'ordinateur, GPT-6 Astra surpasse Argon dans le sous-ensemble hors ligne du test OSWorld 2.0, avec 72,6 % contre 69,2 % pour Argon. En correction de vulnérabilités, Argon et GPT-6 Astra sont à égalité à 68 % au test CWE-bench v1, devant les 67 % de Claude Opus 5.5.

Google cite également Vals, une plateforme d'évaluation des modèles d'intelligence artificielle, pour affirmer que Argon mène actuellement l'indice de modèles de cette entreprise.