Google lance Gemma 4, son pari ambitieux sur l'IA ouverte et locale

  • Gemma 4 est une famille de quatre modèles d'IA ouverts basés sur la technologie Gemini 3, avec des tailles allant de E2B à 31B paramètres.
  • Les modèles combinent une « intelligence paramétrique » élevée avec une exécution locale sur des infrastructures mobiles, périphériques et propriétaires, grâce à des fenêtres de contexte allant jusqu'à 256 000 jetons.
  • La licence Apache 2.0 autorise une utilisation commerciale sans restriction, renforce la souveraineté numérique et facilite le déploiement dans des environnements réglementés en Europe.
  • Gemma 4 est multimodal (texte, image, vidéo et audio dans de petits modèles), prend en charge plus de 140 langues et est disponible dans Google AI Studio, Hugging Face, Kaggle et Ollama.

Modèle d'IA Gemma 4

Google a franchi une étape importante dans sa stratégie visant à intelligence artificielle ouverte Avec le lancement de Gemma 4, une nouvelle famille de modèles vise à allier des capacités de raisonnement élevées à des exigences matérielles bien plus modestes. L'entreprise présente cette génération comme une alternative sérieuse pour ceux qui ont besoin d'exécuter une IA avancée sur leur propre infrastructure, des appareils mobiles aux centres de données.

Loin d'être un modèle unique, Gemma 4 est une gamme complète de quatre variantes ouvertes.Conçue pour les développeurs, les entreprises et les entités publiques qui souhaitent un meilleur contrôle de leurs données et de leurs déploiements, cette proposition répond particulièrement bien aux exigences de Souveraineté numérique et conformité réglementaire en Europeoù le pouvoir de décider du lieu d'exécution et du lieu de stockage des données devient de plus en plus important.

Une famille de quatre modèles axés sur « l'intelligence basée sur les paramètres »

Gemma 4, famille de modèles

Gemma 4 a été construite sur la même base technologique que Gemini 3Mais avec un objectif clair : maximiser ce que Google appelle « intelligence basée sur les paramètres »Au lieu de miser uniquement sur la taille, l'entreprise se targue d'avoir atteint des niveaux de performance comparables à ceux de systèmes beaucoup plus grands, dans des modèles relativement compacts.

La famille se compose de quatre tailles différentes: Effective 2B (E2B), Effective 4B (E4B), un modèle de 26B avec architecture mixte d'experts (MoE) et une variante dense de Paramètres 31BCe dernier est déjà situé dans le top 3 du classement d'Arena AI pour les modèles ouverts, surpassant les alternatives qui multiplient son nombre de paramètres par vingt, un point particulièrement pertinent pour ceux qui cherchent à réduire les coûts du GPU sans sacrifier la qualité.

modèle 26B MoE Il est optimisé pour n'activer qu'une fraction de ses paramètres (environ 3,8 milliards) lors de l'inférence, ce qui améliore la vitesse de génération des jetons et l'efficacité énergétique. En revanche, la version 31B dense Elle se positionne comme l'option privilégiée pour les tâches de réglage fin exigeantes, l'orchestration complexe et l'utilisation intensive dans les environnements commerciaux ou institutionnels.

Google souligne que, sur le plan des benchmarks publics, ces variantes rivalisent directement avec des modèles plus lourds d'autres fournisseurs, notamment ceux de fabricants chinois comme DeepSeek ou Qwen, qui se sont imposés ces dernières années dans l'écosystème open source. Le modèle 31B de Gemma 4 est classé troisième meilleur modèle ouvert dans Arena AI, tandis que le ministère de l'Éducation 26B se classe également parmi les meilleurs.

D'un point de vue commercial, cette relation entre taille et performance implique Dépenses matérielles réduites, latence plus faible et la possibilité d'exécuter des modèles de frontière dans un seul Carte graphique NVIDIA H100 80 GoCela ouvre la voie aux entreprises européennes de taille moyenne pour travailler avec l'IA avancée sans investir dans des infrastructures disproportionnées.

IA de poche : informatique mobile, IoT et en périphérie

Gemma 4 sur appareils mobiles

Les modèles plus petits, E2B et E4BIls sont expressément conçus pour fonctionner en périphérie du réseau, c'est-à-dire dans appareils mobiles, IoT et matériel localGoogle indique que ces variantes sont optimisées pour fonctionner sur Smartphones Android, Raspberry PiJetson Nano et d'autres systèmes à faible consommation, avec une latence très faible et même sans connexion Internet.

Dans ce segment, la priorité n'est pas seulement la puissance brute, mais la capacité à offrir fonctions multimodales et réponse rapide dans des environnements aux ressources limitées. Les modèles Gemma 4 Edge peuvent gérer texte, images et vidéoet dans le cas d'E2B et d'E4B, ils ajoutent une prise en charge native pour acoustiqueCela permet des cas d'utilisation tels que les assistants vocaux locaux, la reconnaissance d'images sur le terrain ou l'analyse vidéo en temps réel sans avoir besoin d'envoyer de données vers le cloud.

La fenêtre contextuelle de ces modèles légers atteint Jetons 128.000Cela suffit pour traiter des documents longs, des conversations approfondies ou des extraits de code pertinents en une seule requête. Selon Google, cette combinaison d'un contexte large et d'une exécution locale contribue à fluidifier le processus. confidentialité, connectivité et latenceCeci est particulièrement pertinent pour les projets industriels, de santé ou éducatifs en Europe, où les restrictions en matière de traitement des données deviennent de plus en plus strictes.

Du point de vue des fabricants de matériel, Gemma 4 ouvre la voie à l'intégration. L'IA avancée directement intégrée aux produits de consommationDes smartphones et tablettes aux dispositifs médicaux et capteurs industriels, l'entreprise a souligné que ces modèles sont conçus pour fonctionner avec des puces provenant de fournisseurs courants de l'écosystème Android, tels que Qualcomm et MediaTek, facilitant ainsi leur adoption à grande échelle.

De plus, l'architecture des modèles de périphérie exploite des techniques telles que Intégrations par couche (PLE) afin de maximiser l'efficacité de l'utilisation des paramètres, permettant ainsi un raisonnement et une compréhension du contexte à un coût de calcul bien inférieur à celui des modèles à usage général habituels.

Multimodalité, agents et assistance avancée aux développeurs

Les 4 capacités multimodales de Gemma

L'un des points forts de Gemma 4 est son engagement clair envers flux de travail agentiquesLes modèles ne se limitent pas à la génération de texte : ils s’intègrent nativement Appels de fonctions, sortie JSON structurée et instructions systèmeCela permet la construction d'agents autonomes qui orchestrent différentes étapes, appellent des API externes et renvoient des résultats dans des formats facilement intégrables aux applications d'entreprise.

Google insiste sur le fait que tous les modèles de la gamme Gemma 4 ont été conçus comme raisonneurs de haut niveauavec des modes de réflexion configurables permettant d'ajuster la profondeur du raisonnement en fonction de la tâche. Cela se traduit par de meilleurs résultats dans Raisonnement multi-étapes, génération de code hors ligne et la résolution de problèmes complexes, aspects clés dans les environnements d'administration publique et d'entreprise où la fiabilité est requise.

Dans le plan multimodal, les quatre modèles peuvent traiter Texte et images de résolutions et de formats différents, tandis que les variantes E2B et E4B étendent cette capacité à vidéo et audioCette combinaison rend possible, par exemple, des systèmes qui analysent des documents contenant des graphiques, des vidéos de surveillance industrielle ou un contenu pédagogique riche, et génèrent des réponses contextuelles en temps réel.

La fenêtre contextuelle atteint le 256 000 jetons dans les modèles les plus importantsCela permet aux utilisateurs de télécharger des dépôts de code entiers, des contrats juridiques volumineux ou d'importants volumes de documentation technique en une seule requête. Pour les équipes de support, de conseil ou d'audit informatique, cela simplifie l'automatisation des tâches qui nécessitaient auparavant de nombreuses heures de vérification manuelle.

En termes de langues, Gemma 4 prend en charge nativement plus de 140 languesPour l'Europe, et plus particulièrement pour l'Espagne, cela signifie que des solutions multilingues peuvent être développées, couvrant aussi bien les principales langues de l'UE que les langues moins représentées, contribuant ainsi à atteindre les objectifs d'accessibilité et d'inclusion dans les services publics et privés.

Intégration du cloud, souveraineté numérique et déploiement en Europe

Le déploiement de Gemma 4 ne se limite pas aux infrastructures matérielles sur site. Google a intégré ces modèles à son offre cloud via IA des sommets y Google Kubernetes Engine (GKE)permettant aux organisations de configurer des ressources informatiques dédiées et d'adapter les charges de travail d'inférence à la demande. Pour les secteurs européens réglementés, cette solution est combinée à des options pour Nuage souverain et des déploiements isolés ou sur site, adaptés aux exigences de résidence des données et à la conformité avec le Règlement général sur la protection des données (RGPD).

L'entreprise souligne que les poids de précision bfloat16 des modèles plus grands peuvent être utilisés efficacement dans un GPU NVIDIA H100 de 80 Goréduire les barrières à l'entrée pour les PME ou les institutions publiques souhaitant conserver la maîtrise de leurs infrastructures. Dans leurs versions quantifiées, les modèles peuvent également fonctionner dans matériel informatique grand public ou stations de travail, élargissant ainsi l'éventail des déploiements possibles.

Pour les responsables technologiques en Espagne et dans le reste de l'Europe, cette combinaison de modèle ouvert, déploiement contrôlé et prise en charge du cloud souverain Elle permet la conception d'architectures hybrides : une partie des données intelligentes peut résider dans des centres de données locaux, tandis que d'autres charges de travail moins sensibles s'exécutent dans le cloud public, tout en conservant une base technologique commune.

De plus, Google propose un Kit de développement d'agent (ADK)Un framework modulaire qui simplifie la création, le test et le déploiement d'agents basés sur Gemma 4. Il s'appuie également sur des services tels que : Cloud Run avec les GPU NVIDIA RTX PRO 6000 (Blackwell) en mode sans serveur, ce qui permet de lancer des projets pilotes à haute intensité sans avoir besoin d'acquérir son propre matériel dès le premier jour.

Dans un contexte européen où le débat sur l'IA tourne généralement autour du contrôle, de la transparence et de l'auditabilité, la possibilité de Déployer des modèles ouverts sous Apache 2.0 dans des infrastructures contrôlées Elle est particulièrement intéressante pour les administrations, les banques, les compagnies d'assurance ou les entreprises du secteur de la santé qui doivent concilier innovation et cadres réglementaires stricts.

Licence Apache 2.0, écosystème ouvert et forte adhésion de la communauté

S'il y a un aspect qui a suscité un intérêt particulier au sein de la communauté, c'est bien la décision de concéder Gemma 4 sous licence. Apache 2.0Les versions précédentes de Gemma utilisaient des licences personnalisées qui soulevaient des questions juridiques pour les produits commerciaux ; désormais, grâce à une licence open source standard, Les développeurs et les entreprises peuvent modifier, redistribuer et monétiser les modèles avec beaucoup moins de difficultés..

Cette ouverture intervient à un moment où Google tente de… regagner du terrain dans l'écosystème des modèles ouvertsCette décision intervient après une période durant laquelle des alternatives comme Llama de Meta ou les modèles chinois (DeepSeek, Qwen, GLM, Minimax) ont gagné en popularité. Des personnalités influentes du secteur, à l'instar du cofondateur de Hugging Face, ont qualifié cette évolution d'« étape majeure » pour l'IA locale, soulignant que les services juridiques disposent désormais d'un cadre beaucoup plus clair pour approuver les projets basés sur Gemma 4.

L'écosystème autour de la famille Gemma était déjà prometteur avant cette version. Google note que les générations précédentes dépassent... 400 millions de téléchargements et que la communauté a créé plus de 100.000 XNUMX variantes adapté à différentes langues et cas d'utilisation. Parmi les exemples les plus marquants figurent des modèles spécialisés dans Bulgare ou des outils de recherche sur le cancer tels que Échelle Cell2Sentence développé à l'Université de Yale.

Avec Gemma 4, la société espère que l'univers Gemma s'étendra encore davantage, invitant... Start-ups, universités et centres de recherche européens pour créer leurs propres dérivés. La combinaison d'une licence permissive et de poids libres permet le développement de versions axées sur des secteurs spécifiques, tels que la santé, la justice, l'industrie 4.0 ou l'éducation, qui peuvent ensuite être partagées ou commercialisées sans trop de restrictions.

Pour les entreprises espagnoles, cette situation signifie qu'il est possible de développer des solutions propriétaires sur Gemma 4 — telles que des assistants internes, des moteurs de recherche d'entreprise ou des systèmes d'analyse avancée — tout en conservant la maîtrise du code, des données et de l'infrastructure, ce qui correspond parfaitement à la tendance au renforcement de la maîtrise des données. Souveraineté technologique européenne.

Cas d'utilisation : des startups aux grandes entreprises

Gemma 4 a été présentée avec un large éventail de applications potentiellesDans le monde des affaires, les modèles peuvent être utilisés pour créer assistants virtuels multilingues capable de traiter des requêtes complexes grâce à un raisonnement avancé, ou d'automatiser la génération et la révision de code au sein des équipes de développement.

Les modèles plus grands sont conçus pour des tâches telles que orchestration des agents, analyse de volumes importants de documentationCela inclut la génération de rapports techniques et l'assistance aux services juridiques et de conformité. Grâce à ses larges fenêtres contextuelles et à sa prise en charge multimodale, un seul agent peut facilement gérer contrats, courriels, graphiques, images du système de surveillance et enregistrements audio, le tout au sein d'un même flux de travail.

Dans le secteur de l'éducation et le secteur public, la capacité de traiter du texte, des images et, dans certains cas, de la vidéo et de l'audio, permet la création de plateformes de soutien à l'apprentissage qui génèrent des résumés, des explications étape par étape ou des supports adaptés à différents niveaux. Une mise en œuvre locale permet également de respecter les exigences en matière de protection de la vie privée lors du traitement de données sensibles concernant des mineurs ou des groupes vulnérables.

Dans l'univers des startups, Gemma 4 peut constituer la base de produits verticaux Dans les secteurs de la fintech, de la santé numérique, de la logistique ou des logiciels SaaS B2B, grâce à la flexibilité offerte par Apache 2.0, les équipes peuvent… réglage fin Ils peuvent ainsi utiliser le modèle sur leurs propres données, le déployer sur site ou dans le cloud et commercialiser le résultat sans être liés à des licences propriétaires strictes.

La possibilité de développer est particulièrement intéressante pour l'Europe. solutions d'IA locales qui respectent les réglementations nationales et communautaires, par exemple en stockant les données dans des centres de données situés sur le territoire européen et en gardant les modèles sous le contrôle direct de l'organisation, ce qui peut être essentiel pour les projets liés au futur règlement européen sur l'IA.

Où et comment accéder à Gemma 4

Google a mis à disposition les poids Gemma 4 via différents canaux afin de faciliter leur adoption par les développeurs et les chercheurs. Ces poids ouverts peuvent être téléchargés depuis [lien manquant]. Étreindre le visage y GitHub, tandis que l'utilisation via interface et API est disponible dans Google IA StudioDes intégrations sont également proposées avec OllamaDocker, Kaggle et des outils comme LM Studio.

Selon l'entreprise, Gemma 4 peut être exécuté localement sur «des milliards d'appareils Androidet sur une large gamme de matériel : de Cartes graphiques pour ordinateurs portables et des stations de travail, jusqu'aux accélérateurs dédiés aux développeurs. Ceci s'inscrit dans la stratégie visant à étendre l'IA avancée au-delà des grands centres de données, vers les appareils des utilisateurs finaux et les environnements de calcul en périphérie.

Pour ceux qui souhaitent commencer par des tests rapides, l'option la plus directe est d'utiliser Google IA Studio pour les modèles 26B et 31B ou le Galerie Google AI Edge C’est le cas pour les variantes E2B et E4B. Parallèlement, les communautés de développeurs sur des plateformes comme Hugging Face publient déjà des adaptations et des configurations prêtes à l’emploi pour différents environnements.

En Espagne et dans d'autres pays européens, on s'attend à ce que les intégrateurs locaux et les fournisseurs de services gérés commencent à proposer Solutions clés en main basées sur Gemma 4, combinant des déploiements de cloud souverain, un support en espagnol et une adaptation aux réglementations sectorielles spécifiques, telles que celles des services financiers ou de la santé.

Globalement, le lancement de Gemma 4 positionne Google comme l'un des acteurs les plus importants dans le domaine de modèles d'IA ouverts et exécutables localement, à un moment où l'industrie européenne exige précisément des outils qui combinent haute performance, contrôle des données et cadres de licences clairs pour construire des produits commerciaux à long terme.

IA embarquée pour plus de confidentialité
Article connexe:
Intelligence artificielle en périphérie et confidentialité : une IA puissante sans divulguer vos données

Ajouter comme source préférée