IA (intelligence artificielle)
Gemini 4 Argon : ce qui le distingue face à GPT-6 Astra et Claude
Un million de tokens en sortie, des agents taillés pour les tâches longues et des tarifs de lancement serrés. Mais les comparatifs ne donnent pas Argon gagnant partout.

Gemini 4 Argon vise les missions longues : développer, analyser des dossiers et corriger des failles. Voici ce qui le distingue, et ce que les chiffres ne permettent pas de conclure.
- Google annonce jusqu’à 1 million de tokens en sortie, contre 64 000 auparavant. Ce n’est pas la taille de la fenêtre de contexte.
- Argon devance plusieurs concurrents sur DeepSWE et le Vals Index, mais GPT-6 Astra et Claude Opus 5.5 gardent des avantages sur d’autres tests.
- L’accès commence auprès de cyberdéfenseurs sélectionnés. L’ouverture générale n’a pas encore de date précise dans l’annonce.
Un agent qui commence une migration de code, suit les dépendances, corrige les erreurs et vérifie le résultat : c’est sur ce genre de travail que Google veut faire la différence avec Gemini 4 Argon. Annoncé le 30 septembre 2026, le modèle met l’accent sur la capacité à tenir une tâche complexe dans la durée. Le détail le plus intéressant tient en une ligne : jusqu’à un million de tokens en sortie.
Mais regardons aussi les colonnes d’à côté. Le tableau de Google montre des domaines où Argon progresse nettement, et d’autres où OpenAI ou Anthropic restent devant. Cet article croise l’annonce et sa méthodologie avec les classements publics de Vals AI et CWE-bench. Il ne repose pas sur un essai de Gemini 4 Argon par JSD.
CE QUI CHANGE
Le million de tokens concerne bien la sortie
Un token est une unité de texte manipulée par le modèle, souvent un mot ou un morceau de mot. Google annonce une limite de sortie portée de 64 000 à 1 000 000 de tokens. L’objectif est de laisser davantage de place au raisonnement et à la génération au cours d’une même trajectoire, lorsque le problème demande beaucoup d’étapes. [1]
La distinction compte : une grande fenêtre de contexte aide à prendre en compte des documents ou du code ; une grande limite de sortie donne de la marge pour produire et poursuivre le travail. Le chiffre mis en avant ici concerne ce second budget. Il ne signifie ni que chaque réponse fera un million de tokens, ni qu’une réponse plus longue sera forcément meilleure.
Pour une migration logicielle ou une enquête documentaire, cette marge peut éviter de devoir interrompre trop tôt un raisonnement. C’est l’intérêt pratique à tester. Il faudra aussi mesurer le temps, la facture et la qualité finale : un agent qui tourne longtemps peut aller plus loin, mais il peut aussi s’obstiner plus longtemps.
DU CODE AUX DOCUMENTS
Google avance des cas d’usage à grande échelle
Google indique qu’Argon est déjà utilisé en interne. Des agents travaillent sur des migrations de C/C++ vers Rust, depuis des bibliothèques jusqu’au noyau Zircon de Fuchsia, qui dépasse 800 000 lignes. Le groupe précise que ces réécritures critiques passent par des audits, des tests et des revues avant leur déploiement. Il ne faut donc pas lire « migration autonome » comme « mise en production sans contrôle ». [1]
Sur libgav1, son décodeur vidéo, Google rapporte le remplacement de 32 000 lignes de code SIMD dans un portage Rust existant. Le résultat serait 2,7 fois plus rapide que ce portage Rust de départ, avec une sortie vidéo identique. Le point de comparaison est important : Google ne dit pas que le résultat dépasse de 2,7 fois la version C++ optimisée. [1]
Autre exemple annoncé : des optimisations auraient déjà libéré plus de 300 TiB de mémoire dans les centres de données de Google. Ces chiffres donnent une idée des chantiers visés ; ce sont des résultats internes rapportés par l’entreprise, pas des gains reproductibles garantis chez chaque client.
Argon vise aussi les recherches financières, les dossiers juridiques et la compréhension visuelle. Google publie 91,7 % sur LVBench, un test de compréhension de vidéos longues, contre 87,5 % pour GPT-6 Astra, 79,7 % pour Claude Fable 5.1 et 83,7 % pour Claude Opus 5.5. Prudence : les modèles n’ont pas reçu le même échantillonnage d’images, en raison de leurs limites d’API. Cela renseigne sur les configurations testées, pas sur une supériorité isolée du modèle à entrée strictement identique. [1][4]
COMPARATIF DES MODÈLES FRONTIÈRES
Face à GPT-6 Astra et Claude : les victoires… et les revers
Un modèle frontière fait partie des modèles les plus avancés de son éditeur. Pour comparer Argon, Google retient notamment GPT-6 Astra, Claude Fable 5.1 et Claude Opus 5.5. Voici une sélection de son tableau, en gardant aussi les lignes où Argon ne gagne pas.
| Évaluation | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 |
|---|---|---|---|---|
| DeepSWE v1.1 | 77,9 % | 74,1 % | 67,4 % | 74,2 % |
| FrontierSWE v2 | 55,0 % | 65,5 % | 56,3 % | 62,3 % |
| Terminal-Bench 4.0 | 57,4 % | 58,2 % | 57,9 % | 66,4 % |
| AutomationBench | 51,3 % | 41,4 % | 31,4 % | 42,5 % |
| Vals Finance Agent v2 | 65,4 % | 53,5 % | 58,9 % | 58,6 % |
| GraphWalks, 256 k à 1 M | 84,2 % | 71,8 % | 65,0 % | 66,8 % |
DeepSWE mesure du développement logiciel sur des tâches longues. Argon y affiche 3,8 points d’avance sur Astra. Mais sur FrontierSWE v2, Astra passe devant avec 65,5 %, contre 55,0 % pour Argon. Sur Terminal-Bench 4.0, qui évalue le travail dans un terminal, Opus 5.5 mène cette sélection à 66,4 %. Le verdict « Argon est le meilleur pour coder » serait donc trop large.
Les évaluations mélangent plusieurs sources et environnements d’agent. Google calcule lui-même le score DeepSWE d’Argon avec mini-swe, tandis que les résultats concurrents viennent de classements ou de fiches de modèles. Les réglages de raisonnement sont généralement les plus élevés disponibles. Pour Terminal-Bench, Google reprend 58,2 % pour Astra ; l’article OpenAI consulté donne 57,9 %. Nous conservons les valeurs du tableau Google, sans fusionner des mesures différentes. [4][5]
Sur le travail professionnel, le classement Vals Index consulté le 1er octobre place Argon à 68,90 %, devant Claude Sonnet 5.5 à 67,04 %, Opus 5.5 à 66,97 % et Astra à 63,13 %. Ce classement apporte un point de comparaison extérieur à Google. Il agrège des tâches de finance, de code, de droit et de fiscalité, pondérées selon des parts de l’économie américaine. Ce n’est pas un pourcentage de métiers automatisables. [2]
L’avance sur Sonnet est de 1,86 point, avec des erreurs standard annoncées de ±0,97 pour Argon et ±0,92 pour Sonnet : évitons d’en faire un écart écrasant. Vals précise aussi que certains scores de modèles Claude incluent le recours à un autre modèle après un refus. Enfin, le texte de synthèse de cette page n’est pas entièrement synchronisé avec son tableau ; les valeurs retenues ici sont celles du classement détaillé.
SÉCURITÉ ET CONTRÔLE
En cyberdéfense, Argon partage la première place
Google réserve d’abord Argon à des cyberdéfenseurs de confiance via Fairwind. Il annonce pour ces partenaires et ses équipes internes un accès sans garde-fous cyber, afin de rechercher, valider et corriger des vulnérabilités. Cette modalité restreinte ne décrit pas les protections d’une future version grand public. [1]
CWE-bench v1 permet de nuancer le discours de lancement. Sur son score programmatique pass@1, Argon atteint 68 %, à égalité avec GPT-6 Astra et Grok 4.7. Claude Opus 5.5 suit à 67 %. Le classement mesure des systèmes complets, avec leurs environnements d’agent, et non des modèles nus. [3]
| Système évalué | Pass@1 programmatique | Pass@1 du jury | Coût moyen par essai |
|---|---|---|---|
| Argon + Antigravity | 68 % | 62 % | 6,63 $ |
| Astra + Codex | 68 % | 66 % | 2,85 $ |
| Grok 4.7 + opencode | 68 % | 64 % | 2,75 $ |
| Opus 5.5 + Claude Code | 67 % | 67 % | 0,79 $ |
La seconde colonne de scores est utile : un jury de modèles examine aussi la correction et ses effets sur le logiciel. Argon descend alors à 62 %. Cela ne rend pas le premier score faux ; cela montre ce qui change quand on regarde au-delà du vérificateur automatique. Le coût moyen affiché pour Argon est également plus élevé que celui de ses concurrents dans cette évaluation.
Le site CWE-bench chiffre son coût avec 0,20 $ par million de tokens d’entrée en cache, alors que la remise annoncée par Google implique 0,10 $ pendant l’offre de lancement. Les coûts du tableau sont donc ceux publiés par l’évaluateur, sans recalcul maison ni promesse de facture identique. Une bonne note en cyberdéfense ne dispense toujours pas de relire le correctif et de tester les régressions. [1][3]
PRIX API
Des tarifs attractifs au lancement, puis un doublement
Google annonce 2 $ par million de tokens d’entrée et 10 $ par million de tokens de sortie pour la période de lancement. Une note de bas de page précise ensuite 4 $ et 20 $. Aucune date de fin de cette offre n’est indiquée dans l’annonce. C’est cette deuxième grille qu’il faut aussi garder en tête pour un projet durable. [1]
| Modèle et période | Entrée / million | Sortie / million |
|---|---|---|
| Argon, lancement | 2 $ | 10 $ |
| Argon, après lancement | 4 $ | 20 $ |
| Claude Opus 5.5, standard | 4 $ | 20 $ |
| GPT-6 Astra, à partir de | 10 $ | 50 $ |
Google annonce 95 % de remise sur les entrées en cache, soit 0,10 $ par million au lancement et 0,20 $ ensuite si cette remise reste identique. Pour un exemple purement comptable de 100 000 tokens d’entrée et 20 000 de sortie facturée, sans cache ni outils supplémentaires : 0,40 $ avec Argon au lancement, 0,80 $ après l’offre, 0,80 $ avec Opus 5.5 et 2 $ avec Astra aux tarifs indiqués. Ce n’est pas un devis : une même tâche ne consomme pas forcément le même nombre de tokens selon le modèle.
Le plafond d’un million de tokens n’est donc pas une cible à atteindre. Pour choisir un agent, regardez plutôt ce que vous payez pour obtenir un résultat vérifié, y compris les reprises et le temps de contrôle humain.
ACCÈS ET USAGES
Une annonce à suivre, pas encore un outil ouvert à tous
Au moment de l’annonce, Argon est déployé auprès de cyberdéfenseurs et de testeurs sélectionnés. Google prévoit ensuite une ouverture aux développeurs, aux entreprises et aux particuliers, en commençant par les clients de l’API payante et les abonnés Google AI Ultra. Le billet ne donne pas de date ferme d’ouverture générale. [1]
C’est une différence très concrète avec Astra, qu’OpenAI annonce disponible dans ChatGPT Work, Codex et l’API, et avec Opus 5.5, qu’Anthropic annonce disponible sur ses plateformes et chez ses partenaires cloud. Un modèle déjà accessible peut être le meilleur choix pour un projet qui doit commencer aujourd’hui, même si un autre annonce un meilleur score. [5][6]
Développement
À tester sur des migrations et des corrections longues, en comparant Argon à Astra et Opus sur vos propres dépôts. Même consigne, mêmes droits, mêmes critères de réussite.
Dossiers professionnels
À examiner pour croiser documents, tableaux et vidéos. Mesurez la qualité des sources et le travail de correction, pas seulement le volume produit.
Cyberdéfense
Accès encadré pour les acteurs autorisés. Les résultats de benchmark restent insuffisants pour accepter automatiquement un correctif ou supprimer une revue humaine.
Ce qui rend Argon intéressant, c’est l’association d’un budget de sortie très élevé, de bons résultats sur les tâches longues et d’exemples industriels précis. Les résultats publics soutiennent cette piste, sans en faire un vainqueur universel. Pour vous, le bon test sera simple : lui confier un travail dont vous savez reconnaître une bonne exécution, puis comparer le résultat, le temps et le coût avec vos outils actuels. Le podium est sympathique ; le correctif qui ne casse rien l’est encore plus.
POUR VÉRIFIER
Sources et méthode
Article documenté le 1er octobre 2026. Les performances internes sont attribuées à Google ; les comparaisons sont celles des sources citées, pas des essais JSD. Les animations sont des visualisations éditoriales Remotion, sans simulation d’une utilisation réelle du modèle.
- Google, « Gemini 4 Argon: our next era of frontier intelligence », 30 septembre 2026.https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/
- Vals AI, Vals Index, classement et méthodologie.https://www.vals.ai/benchmarks/vals_index
- Collinear AI, CWE-bench v1, classement et protocole.https://cwe-bench.com/
- Google DeepMind, Gemini 4 Argon Model evaluation.https://deepmind.google/models/evals-methodology/gemini-4-argon
- OpenAI, « GPT-6 Astra: The next generation in intelligence for work ».https://openai.com/index/gpt-6-astra-next-generation-work/
- Anthropic, « Introducing Claude Opus 5.5 ».https://www.anthropic.com/claude-opus-5-5