Intelligence artificielle · Actualité

OpenAI présente son IA GPT-5.5 et la teste contre Claude en codage : voici les résultats.

OpenAI a réalisé diverses tests internes pour comparer GPT-5.5 avec des modèles d'IA de ses concurrents. (Europa Press)

OpenAI a présenté GPT-5.5, son modèle d'intelligence artificielle le plus avancé à ce jour, en mettant l'accent sur l'autonomie et la capacité à exécuter des tâches complexes avec un minimum d'intervention humaine.

Le lancement de GPT-5.5 répond à la nécessité de modèles qui non seulement suivent des instructions détaillées, mais peuvent également recevoir des tâches générales et les accomplir en gérant l'ambiguïté et les étapes intermédiaires. "GPT-5.5 comprend ce que l'utilisateur cherche et assume plus de travail par lui-même", a indiqué OpenAI.

Cette évolution renforce la tendance vers des assistants numériques capables d'opérer en tant qu'agents, se déplaçant entre différentes tâches et outils de manière intégrée.

Lors du test interne d'OpenAI, le modèle a atteint 82,7% de précision dans Terminal-Bench 2.0, un record dans les benchmarks de codage. (Europa Press)

Résultats des tests internes

Un des progrès les plus notables de GPT-5.5 se constate dans le domaine de la programmation, selon les tests d'OpenAI. Le modèle excelle dans des flux de travail complexes nécessitant planification et coordination d'outils, démontrant des améliorations substantielles par rapport aux versions précédentes.

Dans le benchmark Terminal-Bench 2.0, qui mesure la performance des agents IA, il a atteint une précision de 82,7%. Dans SWE-Bench Pro, il a obtenu un 58,6% de succès en résolvant des problèmes réels de GitHub en un seul essai. Dans les deux tests, il a surpassé ses prédécesseurs et des concurrents comme Claude Opus 4.7, le modèle d'Anthropic.

Dans des tâches d', qui peuvent nécessiter jusqu'à 20 heures de travail pour un développeur humain, GPT-5.5 a montré des résultats supérieurs. En plus de résoudre des questions techniques, le modèle est capable d'identifier des points critiques dans l'architecture des systèmes et d'anticiper l'impact des changements dans le code, ce qui est apprécié par les experts et les premiers utilisateurs.

La nouvelle IA se distingue dans la planification, l'exécution et la révision des flux de travail d'ingénierie. REUTERS/Bhawika Chhabra

OpenAI souligne que GPT-5.5 maintient la même latence par token que son prédécesseur GPT-5.4, malgré son intelligence et son autonomie accrues. Le modèle utilise moins de tokens pour accomplir des tâches similaires, ce qui se traduit par un coût computationnel réduit. "GPT-5.5 offre ce saut d'intelligence sans compromettre la vitesse", a détaillé l'entreprise, soulignant qu'une plus grande capacité de traitement et de réponse a été obtenue dans des environnements réels.

Expansion dans l'utilisation réelle et nouveaux cas d'application

GPT-5.5 n'améliore pas seulement la codification, mais élargit son utilité dans des tâches quotidiennes de gestion de l'information, analyse de données et génération de documents et de feuilles de calcul. Le modèle peut interpréter des interfaces, exécuter des actions et transiter entre différents flux de travail avec une grande fluidité. Des exemples internes d'OpenAI montrent son application dans des départements d'.

Dans le domaine de la communication, le modèle a traité des données de demandes de conférenciers pendant six mois, construisant un cadre d'évaluation et automatisant les approbations à faible risque. En finances, il a révisé plus de 71 000 pages de formulaires fiscaux K-1, excluant les données personnelles et réduisant le temps de traitement de deux semaines. De plus, l'automatisation des rapports hebdomadaires dans un autre domaine a permis d'économiser entre cinq et dix heures par semaine.

Selon OpenAI, GPT-5.5 maintient la vitesse de GPT-5.4 mais utilise moins de ressources et de tokens par tâche. EFE/ Etienne Laurent

Sécurité et déploiement progressif

OpenAI a mis en œuvre ses mesures de sécurité les plus robustes à ce jour pour le lancement de GPT-5.5, y compris des tests avancés, du red-teaming et la collaboration de près de 200 partenaires d'accès précoce. Le modèle est déjà disponible pour les utilisateurs Plus, Pro, Business et Enterprise de ChatGPT et Codex, et l'accès via l'API est prévu après avoir rempli des exigences supplémentaires de sécurité et d'évolutivité.

L'arrivée de GPT-5.5 marque une nouvelle étape dans le développement d'infrastructures pour l'IA agentique, consolidant une intelligence plus autonome, efficace et prête à affronter des tâches complexes dans des environnements réels.