Intelligence artificielle · Actualité

Google lance Gemma 4, son IA la plus ouverte et prête à l'utilisation commerciale.

Google a lancé Gemma 4, une famille de modèles d'intelligence artificielle à intégrer dans différentes plateformes. REUTERS/Steve Marcus//Photo d'archive/Photo d'archive

Google a présenté Gemma 4, un ensemble de modèles d'intelligence artificielle conçus pour programmer des plateformes qui traitent à la fois du texte et des images, et qui dans leurs versions les plus compactes admettent également l'audio.

Cette version incorpore des modèles avec des poids ouverts, disponibles dans des variantes préalablement entraînées et dans des options ajustées par des instructions spécifiques.

Gemma 4 offre une fenêtre de contexte allant jusqu'à 256 000 tokens et supporte plus de 140 langues. Selon Google, Gemma 4 est son modèle le plus ouvert à ce jour et peut être utilisé à des fins commerciales.

Inclut des modèles de poids ouverts dans des versions entraînées et ajustées par des instructions. (Google)

“Gemma 4 est adapté à des tâches telles que la génération de texte, la programmation et le raisonnement. Les modèles sont disponibles en quatre tailles différentes : E2B, E4B, 26B A4B et 31B. Leurs différentes tailles permettent de les implémenter dans des environnements allant des téléphones haut de gamme aux ordinateurs portables et serveurs, ce qui démocratise l'accès à l'IA de pointe", explique Google.

Quelles sont les principales caractéristiques de Gemma 4

Gemma 4 incorpore des avancées substantielles en capacité et architecture. Tous les modèles de la famille sont conçus comme des raisonneurs hautement capables, avec des modes de pensée configurables permettant d'adapter le processus de raisonnement selon la tâche.

Parmi ses principales nouveautés se trouve la multimodalité étendue : tous les modèles peuvent traiter du texte et des images avec une compatibilité variable de résolution et de ratio d'aspect, tandis que les versions E2B et E4B étendent cette capacité à la vidéo et à l'audio de manière native.

Gros plan d'une main avec un effet de mouvement bleu brillant sur un clavier sombre, avec un écran d'ordinateur affichant du code flou en arrière-plan.

L'architecture de Gemma 4 est diverse et efficace, avec des variantes denses et des modèles de combinaison d'experts (MoE) de différentes tailles, ce qui facilite une mise en œuvre évolutive selon les besoins de l'utilisateur.

Les modèles les plus petits ont été optimisés pour une exécution locale efficace sur des ordinateurs portables et appareils mobiles, sans sacrifier la performance.

Concernant la fenêtre de contexte, les modèles petits supportent jusqu'à 128 000 tokens, tandis que les modèles moyens atteignent 256 000 tokens, permettant de travailler avec des volumes d'information significativement plus importants.

De plus, Gemma 4 incorpore des capacités améliorées de codage et d'agent, obtenant des résultats remarquables dans des tests de codage et offrant une compatibilité native avec des appels de fonctions, permettant ainsi des agents autonomes plus sophistiqués.

Plusieurs personnes collaborent dans un bureau moderne en utilisant des ordinateurs avec des écrans de graphiques et de code.

Enfin, Gemma 4 introduit une compatibilité native avec les instructions système, permettant la définition précise du rôle de système et facilitant des conversations plus structurées et contrôlables.

Que peut-on faire avec Gemma 4

Gemma 4 permet de développer et exécuter une large variété d'applications alimentées par l'intelligence artificielle, grâce à sa capacité à traiter du texte, des images, de l'audio et de la vidéo.

Par exemple, les entreprises peuvent utiliser Gemma 4 pour créer des assistants virtuels qui gèrent des demandes dans plusieurs langues et résolvent des problèmes complexes par le raisonnement avancé. Dans le domaine éducatif, Gemma 4 facilite la génération automatique de résumés de textes et d'interprétations d'images pour des étudiants avec des besoins différents.

(Hugging Face)

De plus, les développeurs peuvent tirer parti des capacités de codage améliorées de Gemma 4 pour automatiser l'écriture et la révision de code dans plusieurs langages de programmation, ainsi que pour intégrer des fonctions personnalisées dans des applications d'entreprise.

Grâce à son support pour l'exécution locale sur des appareils mobiles et des ordinateurs portables, il est possible de déployer des solutions de reconnaissance d'images et de traitement de la voix directement sur l'appareil, sans besoin de connexion constante au cloud.

La compatibilité native avec les instructions système permet la création d'agents autonomes qui peuvent opérer de manière plus structurée, tels que des systèmes de service client qui interprètent l'intention de l'utilisateur et exécutent des tâches spécifiques, ou des outils d'édition multimédia qui traitent simultanément du texte, des images et de l'audio pour produire du contenu personnalisé.

Comment accéder à Gemma 4

Gemma 4 est disponible au téléchargement et à l'utilisation sur les plateformes Hugging Face et GitHub, ce qui facilite l'accès à ses modèles ouverts pour les développeurs et les chercheurs.