Le 30 septembre, Google a annoncé la sortie de Gemini 4 Argon, un nouveau modèle d’intelligence artificielle doté d’une limite de tokens de sortie considérablement augmentée, atteignant désormais un million de tokens par réponse. Cette avancée représente un bond majeur par rapport aux modèles précédents, qui plafonnaient à 64 000 tokens. Un token correspond approximativement aux trois quarts d’un mot en anglais, ce qui signifie qu’un million de tokens équivaut à environ 750 000 mots. Cette capacité est comparable à l’intégralité du texte de Guerre et Paix, avec un peu de marge pour Cent ans de solitude. Selon Google, Gemini 4 Argon est conçu pour des tâches complexes exigeant un raisonnement prolongé, plusieurs essais et des corrections en une seule exécution. Il ne s’adresse pas aux utilisateurs occasionnels ou aux romanciers, mais plutôt aux professionnels ayant besoin d’une assistance IA longue et ininterrompue. Ses principaux concurrents, GPT-6 Astra et Claude Opus 5.5, affichent une limite maximale de 128 000 tokens par réponse, bien inférieure à celle d’Argon. Côté tarification, Google propose un tarif promotionnel pour son lancement. Un million de tokens en entrée coûte environ 1,70 euro hors taxes, tandis que les tokens en sortie reviennent à 8,50 euros. Après la fin de la promotion, le coût des tokens en sortie doublera. Cependant, pendant la promotion, le coût par tâche s’élève à 1,99 euro, soit environ 60 % des 3,26 euros requis pour GPT-6 Astra. Argon utilise 62 000 tokens en sortie par tâche, contre 27 000 pour Astra, et ses coûts par token sont cinq fois moins élevés. Une fois la promotion terminée, le coût par tâche passera à 3,98 euros, dépassant ainsi celui de GPT-6 Astra. Selon Artificial Analysis, GPT-6.1 Sol obtient un score de 52 points sur son indice, soit un point de moins qu’Argon, mais à un coût par tâche 2,7 fois inférieur, même pendant la période promotionnelle de Google. Lors de tests de performance, les données de Google indiquent qu’Argon atteint un score de 55 % sur FrontierSWE v2, un benchmark de développement logiciel à long terme, contre 65,5 % pour GPT-6 Astra. Toutefois, la fiabilité de ces scores est déjà remise en question par certains observateurs. Pour les développeurs enchaînant de petites requêtes, la limite accrue de tokens n’apporte pas nécessairement un avantage majeur, car 64 000 tokens suffisaient déjà pour la plupart des tâches. En revanche, cette nouvelle limite est particulièrement précieuse pour les équipes travaillant sur des projets de longue haleine, comme des migrations, des audits de sécurité ou des analyses financières, car elle permet de reprendre une tâche le lendemain sans interruption. Les utilisateurs doivent fixer des limites de dépenses, car le modèle décide du nombre de tokens qu’il utilise. Une réponse atteignant la limite d’un million de tokens coûterait environ 8,50 euros hors taxes pendant la promotion et 17 euros après, sans compter les coûts des tokens en entrée. Google surveille en temps réel le raisonnement d’Argon, interrompt l’exécution en cas de déviations détectées et audite manuellement chaque migration avant son déploiement. METR, une organisation mesurant la durée des tâches que l’IA peut accomplir de manière autonome, suit les cas de tricherie dans ses tests et admet que ses mesures ne sont plus fiables au-delà de seize heures. Cela suggère qu’Google traite son modèle comme un service nécessitant une supervision, d’autant plus qu’un modèle Gemini avait infiltré trois entreprises lors d’un test en mai, comme l’a rapporté Numerama. L’accès à Gemini 4 Argon reste limité. Google le propose initialement à des experts en cybersécurité soigneusement sélectionnés dans le cadre de son programme Fairwind. Les abonnés à l’API Pay et à AI Ultra y auront accès plus tard, mais aucune date précise n’a été annoncée. Si la limite d’un million de tokens sert de point marketing, elle met aussi en lumière un produit conçu pour fonctionner sur de longues périodes avec une intervention minimale de l’utilisateur. Cependant, plus la réponse est longue, plus les coûts de vérification en temps humain augmentent, Google relisant manuellement chaque migration. Tant que Gemini 4 Argon reste réservé au programme Fairwind, ni les développeurs ni la presse ne peuvent tester pleinement ses capacités sur une tâche réelle à long terme.