Présentés par Anthropic le 1er septembre 2026, Claude Fable 5.1 et Claude Mythos 5.1 reposent sur le même modèle, mais ne donnent pas accès aux mêmes usages sensibles. Fable est largement disponible avec des garde-fous renforcés, tandis que Mythos est réservé à des professionnels vérifiés de la cybersécurité et des sciences de la vie. L’innovation la plus importante ne tient donc pas à deux niveaux d’intelligence, mais à une distribution des capacités fondée sur l’identité, le contexte d’usage et le risque.
Deux modèles issus du même socle
Gemini 3.8 Flash succède à Gemini 3.7 Flash trois semaines après son lancement. Google le destine au génie logiciel de longue durée, aux agents autonomes et aux workflows professionnels complexes. La documentation indique qu’il repose sur Gemini 3.7 Flash et conserve une fenêtre de contexte pouvant atteindre 1 048 576 tokens, avec une sortie maximale de 65 536 tokens. Les entrées peuvent combiner texte, image, vidéo, audio et PDF, tandis que la sortie documentée reste textuelle.[1][2][3]
Gemini 3.8 Flash Cyber utilise la même intelligence fondamentale, mais reçoit une spécialisation et des règles d’accès adaptées à la cyberdéfense. Google le présente comme capable d’explorer des dépôts complexes, de rechercher des vulnérabilités et de produire des correctifs. Il n’est pas proposé dans les canaux grand public. L’accès passe par le programme Fairwind, qui vise notamment des autorités publiques, des opérateurs d’infrastructures critiques et des plateformes technologiques jugées essentielles.[1][4]
Cette séparation doit être comprise comme une architecture de distribution des capacités. Le modèle généraliste conserve des garde-fous contre les usages offensifs en cybersécurité. La variante Cyber applique des protections plus permissives pour des tâches défensives sensibles, en contrepartie d’une sélection des organisations, d’une authentification renforcée et d’un suivi des accès. La nouveauté porte donc autant sur la gouvernance du modèle que sur ses performances techniques.[1][4]
Une évolution surtout agentique
Gemini 3.8 Flash ne constitue pas une nouvelle famille de modèles entièrement distincte. La fiche officielle précise qu’il est fondé sur Gemini 3.7 Flash. Google attribue les gains annoncés à des améliorations d’entraînement, notamment dans la cybersécurité, et à des boucles agentiques longues utilisées pour évaluer puis affiner le système. Cette continuité invite à parler d’une évolution importante du post-entraînement et de l’orchestration, plutôt que d’une rupture d’architecture démontrée.[1][2]
Le changement le plus visible est la persistance. Sur une tâche difficile, le modèle peut effectuer davantage d’étapes intermédiaires, appeler plusieurs fois des outils et vérifier son travail avant de répondre. Les développeurs choisissent un niveau de raisonnement faible, moyen ou élevé. Le niveau moyen est appliqué par défaut. Le réglage élevé peut améliorer certaines tâches complexes, mais il augmente aussi le nombre de tokens, la latence et le risque qu’une erreur précoce se propage dans la suite de la trajectoire.[3]
Le tarif unitaire ne résume donc pas l’économie d’un agent. Jusqu’au 31 décembre 2026, Google annonce 0,75 dollar par million de tokens en entrée et 3,75 dollars en sortie, puis 1,50 dollar et 7,50 dollars à partir du 1er janvier 2027. Ces prix sont identiques à ceux de Gemini 3.7 Flash pendant la période de lancement, mais une mission qui mobilise davantage de tours, de sorties et d’appels d’outils peut coûter plus cher au total.[1][3]
Le fonctionnement repose sur des boucles longues et des outils
Un modèle conversationnel produit généralement une réponse à partir d’une demande. Un agent reçoit un objectif, choisit une action, observe le résultat et adapte la suite. Dans un dépôt logiciel, cette boucle peut comprendre la recherche de fichiers, l’analyse des dépendances, la modification du code, l’exécution de tests et la correction d’une première solution. Gemini 3.8 Flash prend en charge l’appel de fonctions, l’exécution de code, la recherche dans des fichiers, les sorties structurées et le contexte d’URL. L’usage de l’ordinateur est annoncé en préversion.[3]
Flash Cyber applique cette logique à une chaîne de sécurité. L’agent peut recevoir un code vulnérable, explorer les chemins d’exécution, tenter de reproduire le comportement, localiser la cause et proposer un patch. Détecter une faiblesse et la corriger restent deux tâches différentes. Un correctif peut supprimer le symptôme testé tout en laissant la cause active, casser une fonction ou créer une nouvelle vulnérabilité. Les tests de sécurité, les tests fonctionnels et la revue humaine restent donc nécessaires.
Google indique aussi que Flash Cyber peut être utilisé avec CodeMender, son agent spécialisé dans la correction de vulnérabilités. Le modèle fournit alors les capacités de raisonnement et de génération, tandis que l’environnement agentique organise les outils, les tests et la validation. Cette distinction est importante : un score mesure rarement le modèle isolé. Il dépend aussi du harnais, des permissions, des données fournies et du nombre d’essais autorisés.[4]
Référentiel technologique
Le code et la sécurité deviennent des chaînes d’action
Pour les équipes de développement, l’intérêt de Gemini 3.8 Flash se situe dans l’exécution de missions plus longues. Le modèle peut participer à une migration, rechercher une régression ou modifier plusieurs fichiers en tenant compte des résultats des tests. Cette continuité réduit certains changements de contexte, mais elle exige des critères de réussite explicites. Une tâche terminée par l’agent n’est utile que si les tests couvrent le comportement attendu et si la modification respecte l’architecture du projet.
Pour les équipes de sécurité, Flash Cyber promet de réduire le délai entre l’identification d’une faiblesse et la proposition d’un correctif. Google affirme déjà l’utiliser sur son propre code. L’entreprise rapporte que l’équipe Chrome a obtenu 2,6 fois plus de correctifs valides qu’avec les meilleurs modèles commerciaux plus grands de sa comparaison. Elle indique aussi que son équipe Cloud Vulnerability Research a trouvé en moins de deux heures une vulnérabilité qualifiée de critique, sur une recherche qui aurait habituellement demandé plusieurs mois. Ces résultats sont intéressants, mais ils viennent de Google et ne décrivent ni l’échantillon complet ni le taux de faux positifs.[1]
Le gain organisationnel dépendra surtout de la capacité à intégrer l’agent dans un processus de sécurité existant. Un déploiement prudent lui donne accès au code nécessaire, l’exécute dans un environnement isolé, journalise les appels d’outils et exige une approbation avant toute fusion ou mise en production. Un accès direct à des secrets, à des données clients ou aux systèmes de production augmente le risque sans être indispensable à la plupart des audits.
Ce que les résultats publiés permettent d’affirmer
Les évaluations publiées soutiennent une conclusion limitée. Gemini 3.8 Flash progresse par rapport à Gemini 3.7 Flash sur plusieurs tests de génie logiciel et de travail spécialisé. Flash Cyber obtient de meilleurs résultats que les versions antérieures de Google sur la reproduction ou la découverte de vulnérabilités. Elles ne montrent pas qu’un seul modèle domine tous les usages, ni qu’un agent peut corriger de manière fiable un système de production sans validation.
DeepSWE fournit une vérification publique utile. Au 22 septembre 2026, son classement place Gemini 3.8 Flash à environ 74 % avec un coût moyen de 2,36 dollars, 143 000 tokens de sortie cumulés et 166 étapes par tâche. Gemini 3.7 Flash atteint environ 65 %, pour 2,03 dollars, 94 000 tokens et 117 étapes. Le progrès s’accompagne donc d’une trajectoire plus longue et d’un coût moyen supérieur sur ce test, malgré un tarif identique par token.[5]
CyberGym mérite une lecture précise. Le benchmark réunit 1 507 vulnérabilités historiques issues de 188 projets. Dans son niveau principal, l’agent reçoit une description et un dépôt non corrigé, puis doit produire une preuve de concept qui reproduit la vulnérabilité. Il s’agit d’une tâche de reproduction réaliste, mais différente d’une découverte entièrement ouverte. Les auteurs soulignent aussi que les résultats sont soumis par les équipes, que les exécutions sont stochastiques et que de faibles écarts peuvent ne pas représenter une différence significative.[6]
Les résultats de patching demandent une prudence supplémentaire. Des travaux récents sur PatchBench montrent que des évaluations fondées sur un test de preuve de concept peuvent surestimer la qualité des correctifs. Certains agents produisent un patch proche d’une correction historique mémorisée ou suppriment le symptôme sans traiter la cause. Dans cette étude, la validation limitée au test initial gonfle en moyenne le taux de réussite d’un facteur 1,83. Le résultat de CWE-Bench doit donc être lu comme un signal expérimental, pas comme une garantie de correction en production.[7]
L’accès contrôlé devient une composante du produit
Les capacités cyber sont à double usage. Un système capable d’expliquer pourquoi une vulnérabilité fonctionne possède une partie des connaissances nécessaires pour la reproduire. Google répond à cette tension par Fairwind. Les partenaires peuvent réaliser des simulations de menace autorisées, de la rétro-ingénierie et de l’analyse de logiciels malveillants à des fins défensives ou académiques. Ils doivent appliquer une authentification individuelle, une authentification multifacteur résistante au phishing, des contrôles d’accès et un suivi de l’utilisation.[4]
Le programme interdit le partage, la revente ou la redistribution de l’accès. Google effectue aussi une vérification des organisations candidates et réserve l’usage interne aux équipes de cybersécurité, de réponse aux incidents ou de tests d’intrusion. Ces règles réduisent certaines possibilités d’abus, mais elles ne prouvent pas qu’un compte approuvé restera toujours légitime. Une organisation peut être compromise, un utilisateur autorisé peut dépasser son mandat et une requête défensive peut produire des éléments réutilisables ailleurs.
La gouvernance doit donc continuer après l’admission. Il faut définir la durée des droits, les dépôts accessibles, les outils utilisables, les seuils d’approbation et la procédure de révocation. Les journaux doivent permettre de reconstituer les données consultées, les commandes exécutées, les modifications proposées et les validations humaines. L’accès différencié constitue une mesure de sécurité, pas une preuve que toutes les sorties deviennent sûres.
Les organisations doivent sécuriser l’agent avant le code
Un agent connecté à des outils rencontre des données non fiables. Une instruction malveillante peut être dissimulée dans une page Web, un fichier, un ticket ou un commentaire de code afin de détourner sa trajectoire. Google rapporte un taux de réussite d’attaque de 6 % pour Flash Cyber sur le benchmark Gray Swan IPI, où une valeur faible est préférable. Ce résultat indique une résistance supérieure dans le protocole publié, sans démontrer une immunité. Gray Swan rappelle d’ailleurs qu’aucun modèle testé dans sa compétition sur les injections indirectes n’était entièrement protégé.[8]
La défense repose alors sur plusieurs couches. Les contenus externes doivent être traités comme des données, les secrets doivent rester hors du contexte lorsque leur présence n’est pas nécessaire, et les outils doivent appliquer le moindre privilège. Les actions irréversibles ou susceptibles d’affecter la production exigent une approbation. Les environnements d’exécution doivent limiter le réseau, les fichiers et les identités accessibles. Enfin, les équipes doivent tester le système complet, car la sécurité du modèle ne couvre pas automatiquement les connecteurs, les scripts et les politiques de l’application.
La supervision humaine ne consiste pas à cliquer mécaniquement sur une validation. Le réviseur doit comprendre la modification, connaître les tests manquants et pouvoir refuser ou corriger le patch. Les métiers de la cybersécurité évoluent ainsi vers l’évaluation de trajectoires agentiques, la conception de politiques d’accès, le contrôle des preuves et l’analyse des incidents produits par les agents eux-mêmes.
Les coûts et les impacts doivent être mesurés par mission
Le prix de Gemini 3.8 Flash peut faciliter l’expérimentation, mais une organisation doit suivre le coût par tâche terminée. Cette mesure inclut les tokens, les appels d’outils, le calcul des environnements isolés, les échecs, les reprises et le temps de revue. Un agent moins cher par token peut devenir plus coûteux s’il multiplie les étapes ou produit des sorties très longues. Les données publiques de DeepSWE illustrent précisément cet écart entre prix unitaire et coût opérationnel.[5]
Le même raisonnement vaut pour l’impact environnemental. Google reconnaît que le modèle peut utiliser davantage de tokens sur les tâches complexes, mais ne publie pas dans la fiche consultée de consommation énergétique par mission ni d’empreinte carbone propre à Gemini 3.8 Flash. Il serait donc prématuré de chiffrer un gain ou une dégradation. Les organisations peuvent néanmoins réduire les calculs inutiles en choisissant le niveau d’effort adapté, en limitant les boucles, en réutilisant le cache et en arrêtant les trajectoires qui ne progressent plus.[3]
Le cadre juridique dépend de l’usage et du secteur
Dans l’Union européenne, l’AI Act ne classe pas automatiquement un agent de cybersécurité comme système à haut risque. La qualification dépend du rôle de l’acteur, de la finalité et du contexte de déploiement. Un système utilisé comme composant de sécurité d’une infrastructure numérique critique peut relever d’exigences plus strictes. Depuis le 2 août 2026, l’AI Office et les autorités nationales mettent en œuvre et contrôlent les dispositions applicables du règlement, avec un calendrier distinct pour certaines catégories à haut risque.[9]
Le RGPD reste applicable lorsque l’agent traite des données personnelles présentes dans des journaux, des tickets d’incident, des dépôts ou des environnements clients. L’organisation doit limiter les données transmises, définir une base légale et une durée de conservation, contrôler les transferts et documenter les personnes pouvant accéder aux traces. Les secrets techniques, les clés et les identifiants exigent une protection spécifique, même lorsqu’ils ne sont pas des données personnelles.
Le règlement européen sur la cyberrésilience ajoute une autre dimension pour les produits comportant des éléments numériques. Ses obligations de notification relatives aux vulnérabilités activement exploitées et aux incidents graves s’appliquent depuis le 11 septembre 2026, tandis que l’essentiel du règlement s’appliquera à partir du 11 décembre 2027. Un patch généré par un agent ne remplace ni l’analyse de la vulnérabilité, ni la documentation, ni les obligations du fabricant.[10]
Ce qu’il faudra observer maintenant
La première question concerne la reproduction indépendante. Les résultats internes sur vingt langages, les correctifs produits pour Chrome et la vulnérabilité découverte en moins de deux heures devraient être documentés avec des protocoles, des échantillons et des taux de faux positifs suffisants. Sans ces éléments, ils restent des résultats annoncés par Google et ses partenaires.
La deuxième question porte sur la qualité des correctifs. Il faudra mesurer la correction de la cause racine, la réussite des tests fonctionnels, l’absence de régression, la robustesse face à des variantes de l’attaque et la maintenabilité du code. Un taux de réussite sur une preuve de concept ne répond pas à toutes ces questions.
La troisième question est celle de l’accès. Fairwind compte plus de 650 partenaires selon Google, mais l’efficacité du modèle de gouvernance dépendra des incidents, des révocations, des audits et de la transparence sur les critères d’admission. L’avantage donné aux défenseurs ne peut être évalué qu’en observant la manière dont les capacités diffusent et dont les attaquants s’adaptent.[4]
Gemini 3.8 Flash et Flash Cyber montrent ainsi une progression de l’IA agentique vers des tâches plus longues et plus sensibles. Leur portée réelle se mesurera à la fiabilité des trajectoires complètes, au coût par mission, à la qualité des corrections et à la capacité des organisations à limiter les permissions. Dans la cybersécurité, la performance du modèle et la sécurité de son environnement deviennent indissociables.
Pour aller plus loin
Pour replacer Gemini 3.8 Flash et Flash Cyber dans l’évolution des agents de code, des modèles spécialisés et des métiers de la cyberdéfense, poursuivez avec ces analyses du blog aivancity.
Sources
[1] Google, 2 septembre 2026. Introducing Gemini 3.8 Flash and 3.8 Flash Cyber. Consulter la source
[2] Google DeepMind, septembre 2026. Gemini 3.8 Flash Model Card. Consulter la source
[3] Google AI for Developers, consulté le 30 septembre 2026. Gemini 3.8 Flash Latest Model Documentation. Consulter la source
[4] Google DeepMind, consulté le 30 septembre 2026. Gemini 3.8 Flash Cyber and Fairwind Program. Consulter la source
[5] Datacurve, classement mis à jour le 22 septembre 2026. DeepSWE v1.1 Leaderboard. Consulter la source
[6] Wang, Z. et al., ICLR 2026. CyberGym: Evaluating AI Agents’ Real-World Cybersecurity Capabilities at Scale. Consulter la source
[7] Shen, C. et al., 3 septembre 2026. PatchBench: Evaluating AI Agents for Vulnerability Patching. Consulter la source
[8] Gray Swan AI, consulté le 30 septembre 2026. Indirect Prompt Injection Arena and Benchmark Resources. Consulter la source
[9] Commission européenne, consultée le 30 septembre 2026. The Enforcement Framework of the AI Act. Consulter la source
[10] EUR-Lex, règlement (UE) 2024/2847. Cyber Resilience Act and Application Calendar. Consulter la source
