Gemini 4 Argon : notre prochaine ère d'intelligence de pointe
Aujourd'hui, nous annonçons notre nouveau modèle de pointe, Gemini 4 Argon, déployé auprès d'un groupe de spécialistes de la cybersécurité de confiance par le biais de notre programme Fairwind . Conçu pour assurer un raisonnement approfondi tout au long de flux de travail complexes et à long terme, Argon transforme radicalement nos méthodes de travail et de développement chez Google. Il offre des performances exceptionnelles pour les flux de travail complexes, que ce soit en génie logiciel, en gestion des connaissances d'entreprise (juridique, finances, etc.) ou en cybersécurité.
Le déploiement sécurisé de fonctionnalités de pointe à ce niveau exige une approche progressive. Nous participons activement au processus volontaire du gouvernement américain pour l'accès anticipé au modèle de prélancement, tout en élargissant progressivement cet accès. Nous continuerons de recueillir les commentaires des premiers testeurs afin d'affiner les garde-fous avant de mettre Argon à la disposition des développeurs, des entreprises et des consommateurs dès que possible.
Nous changeons notre façon de travailler et de développer chez Google.
Gemini 4 Argon est déjà au cœur de nos processus internes, et des milliers de Googlers soulignent les forces de ce modèle pour les tâches de codage spécialisées, la recherche approfondie et la qualité de la rédaction. Il aide les équipes à développer plus rapidement, à repousser les limites de la productivité en ingénierie et à accélérer les innovations.
- Optimisation algorithmique quantique : Argon aide nos chercheurs en informatique quantique à optimiser les ressources spatio-temporelles (qubits × portes) des sous-routines qui constituent un goulot d’étranglement pour des applications critiques. À titre d'exemple, il a permis d'améliorer les performances de référence publiées de 40 % en quelques minutes seulement.
- Optimisation de la mémoire : Une équipe d'agents Argon a analysé les données télémétriques de profilage à l'échelle de la flotte afin d'identifier et d'appliquer de manière autonome des optimisations de mémoire dans les centres de données de Google, libérant ainsi plus de 300 Tio de mémoire une fois déployées, avec des économies totales estimées entre 500 Tio et 1 Piio.
- Migrations et optimisations à grande échelle de bases de code : les agents Argon travaillent à la migration des bases de code C/C++ vers Rust chez Google, allant de quelques dizaines de milliers de lignes pour les bibliothèques essentielles comme re2 et libgav1 à plus de 800 000 lignes pour le noyau Zircon de Fuchsia OS. Compte tenu de la criticité de nombreux systèmes, ces réécritures à grande échelle font l’objet d’audits automatisés et manuels rigoureux, de tests d’émulation et d’une revue avant leur mise en production.
Pour libgav1, le logiciel libre de Google pour le décodage vidéo, les agents Argon ont utilisé un portage Rust existant et ont remplacé 32 000 lignes de code SIMD en exécutant de nombreux cycles d'expérimentation guidée par profilage. Ils ont analysé la sortie du compilateur et généré du code Rust sécuritaire, permettant ainsi sa vectorisation automatique. Résultat : un décodeur vidéo économe en mémoire, 2,7 fois plus rapide que le portage Rust, avec une sortie vidéo identique, se rapprochant ainsi de la version C++ optimisée.
Travailler plus fort sur vos problèmes les plus complexes
Pour permettre à Gemini 4 Argon de gérer des cas d'utilisation plus longs et plus complexes, nous augmentons considérablement la limite de jetons de sortie du modèle à 1 million de jetons, une performance inégalée dans l'industrie, contre 64 000 auparavant. Grâce à cette capacité de traitement, le modèle peut analyser en profondeur et générer des centaines de milliers de jetons en une seule étape, ce qui lui permet de résoudre des problèmes complexes d'un seul coup.
Faciliter le codage et les flux de travail d'entreprise dans tous les domaines
Les capacités de Gemini 4 Argon en matière de codage, de raisonnement et de multimodalité, ainsi que sa capacité à gérer des tâches longues et complexes, lui permettent d'exceller dans un large éventail de flux de travail d'entreprise.
Les ingénieurs de Google utilisent Argon au quotidien, du débogage courant aux migrations de code à grande échelle et à la conception d'algorithmes. Il établit une nouvelle référence sur DeepSWE v1.1 (77,9 %), qui mesure la performance d'un modèle dans des tâches d'ingénierie logicielle concrètes et à long terme.
Au-delà du développement logiciel, Argon est le modèle de référence de l' indice Vals , qui mesure l'impact économique des activités en finance, développement, droit et fiscalité, chaque secteur étant pondéré par sa contribution au PIB américain. Nous constatons des performances tout aussi remarquables dans d'autres évaluations spécifiques à un domaine, comme Vals Finance Agent v2 (recherche financière en plusieurs étapes) et Harvey's Legal Agent Benchmark (recherche et rédaction juridiques). Sur AutomationBench, le benchmark de Zapier mesurant l'exécution de bout en bout des fonctions d'affaires essentielles, Argon se classe premier avec un score de 51,3 %.
Argon excelle particulièrement dans les tâches intellectuelles nécessitant une compréhension visuelle. Il permet d'effectuer des analyses graphiques professionnelles, d'identifier des détails dans de longues vidéos et de prendre des décisions à partir de documents. Par exemple, sur LVBench, qui évalue la compréhension de longues vidéos, Argon obtient un score de 91,7 %, se classant ainsi parmi les meilleurs.
Chef de file en cybersécurité défensive
Pour mieux préparer les équipes de cyberdéfense à la nouvelle ère des cyberattaques, nous avons entraîné Gemini 4 Argon à exceller en matière de défense contre les cybermenaces. L'argon est capable de détecter, valider et corriger de manière autonome les vulnérabilités logicielles critiques. Pour nos équipes de confiance et nos équipes internes chez Google, nous déploierons Argon sans aucune restriction de sécurité afin qu'elles puissent exploiter pleinement ses capacités de pointe en matière de cybersécurité.
Wiz utilise déjà Argon pour sa cybersécurité dans le cadre de son initiative Scan for Good , un programme gratuit de protection des infrastructures publiques critiques qui détecte et corrige les vulnérabilités à haut risque. Lors d'une première démonstration de son efficacité, le modèle a mis au jour une faille critique exposant des données personnelles sensibles dans un logiciel de santé utilisé par des hôpitaux du monde entier, identifiant ainsi un risque majeur qui avait échappé aux modèles précédents.
Sur CWE-bench v1 , qui évalue la capacité du modèle à corriger les vulnérabilités de sécurité, Argon se classe premier ex aequo avec un score maximal de 68 %, s'appuyant sur les performances exceptionnelles de 3.8 Flash Cyber sur CWE-bench v0 .
Gemini 4 Argon démontre des progrès impressionnants en matière de détection des vulnérabilités par rapport à Flash Cyber 3.8. Par exemple :
- Lors du test de vulnérabilité interne et exhaustif de Google, Argon a découvert un large éventail de failles de sécurité dans des bases de code complexes couvrant 20 langages de programmation.
- Sur le banc d'essai interne de tests d'intrusion en boîte noire de Wiz, qui teste la capacité d'un modèle à analyser des systèmes Web en direct sans code source, Argon surpasse 3.8 Flash Cyber dans la découverte de la surface d'attaque, l'identification des vulnérabilités et la production de preuves de concept pour les valider.
Renforcer les garanties aux frontières avant une large disponibilité
Avant le déploiement à grande échelle de Gemini 4 Argon, nous continuons de renforcer les mesures de protection critiques aux frontières de l'espace dans quatre domaines principaux :
Protection contre les utilisations abusives : Afin d’empêcher toute utilisation malveillante d’Argon à des fins de cyberattaques ou d’attaques chimiques, biologiques, radiologiques et nucléaires (CBRN), le modèle est conçu pour refuser les requêtes malveillantes tout en préservant la recherche scientifique légitime à double usage, conformément à notre cadre de sécurité Frontier . Nous renforçons la robustesse de nos mesures de protection pour ce lancement, notamment en améliorant nos techniques de surveillance des activations internes du modèle afin de détecter toute utilisation abusive. Ces mesures de protection ont fait l’objet de tests de robustesse menés par des équipes d’experts internes et externes, utilisant une combinaison de méthodes d’attaque manuelles et automatisées.
Protection contre les attaques par injection d'instructions : Argon est aussi notre modèle le plus résistant à ce jour aux injections d'instructions indirectes, où des instructions ou un contexte malveillants sont utilisés pour détourner le comportement d'un modèle. Ces attaques complexes exigent une vigilance constante et plusieurs niveaux de défense. Grâce à des exercices d'intrusion automatisés et à un entraînement face à des adversaires, Gemini 4 Argon se distingue par sa robustesse face aux injections d'instructions indirectes sur le benchmark IPI (Indirect Prompt Injection) de Gray Swan.
Surveillance des incohérences : Afin d'empêcher Argon de dépasser les limites pour tenter d'accomplir une tâche d'une manière qui va au-delà des intentions de l'utilisateur, nous déployons des mesures d'atténuation des incohérences qui surveillent le raisonnement et les actions d'Argon et interrompent l'exécution si nécessaire.
Nous avons utilisé un système similaire pour superviser nos simulations d'entraînement et alerter une équipe dédiée à la gestion des incidents, en veillant scrupuleusement à ne pas réintégrer les résultats dans la formation afin de ne pas risquer de fausser le raisonnement d'Argon et ainsi contourner notre surveillance. Nous encourageons fortement l'ensemble du secteur à préserver la transparence du raisonnement lors de ces phases cruciales d'accroissement des capacités, tout en gérant les risques de désalignement, afin que les concepts modélisés restent utiles pour identifier et diagnostiquer les désalignements.
Renforcement des systèmes : À mesure que les modèles de pointe gagnent en puissance, leur test en toute sécurité exige des environnements sécurisés capables d’évoluer au même rythme que les systèmes eux-mêmes. Conformément à notre feuille de route sur le contrôle des agents , nous renforçons nos environnements de test en les isolant et en les scellant avant le début des formations ou des évaluations à haut risque. Nous nous engageons à partager ces bonnes pratiques de sécurité des agents avec nos partenaires afin d’améliorer la sécurité de l’ensemble de l’écosystème.
Prochain déploiement
Nous avons conçu Gemini 4 Argon avec des fonctionnalités de pointe en matière de programmation, de travail intellectuel, de cybersécurité et de création de contenu, afin d'accompagner les développeurs, les professionnels et les entreprises dans la résolution des problèmes les plus complexes. Nous remercions chaleureusement la première promotion de spécialistes en cybersécurité et de testeurs de confiance dont les évaluations et les retours d'expérience concrets nous permettront de renforcer nos systèmes avant leur déploiement auprès des développeurs, des entreprises et des consommateurs, en commençant par les clients de l'API payante et les abonnés à Google AI Ultra.