Le 18 septembre, Google a confirmé ce que le Wall Street Journal venait de révéler : en mai, pendant une évaluation de cybersécurité, un modèle Gemini a obtenu un accès non autorisé aux systèmes de trois organisations bien réelles. L’exercice, du type « capture du drapeau », était conduit par Irregular, une société indépendante qui teste les modèles des grands laboratoires. Pour entrer, le modèle a deviné des identifiants ou utilisé ceux qu’il avait trouvés dans un dépôt public. Google n’a nommé ni la version de Gemini en cause ni les organisations touchées.
« Lors d’une évaluation standard, le modèle a trouvé des informations publiques en ligne et deviné des identifiants pour accéder à des sites qu’il pensait inclus dans le test », a déclaré Heather Adkins, vice-présidente de Google chargée de l’ingénierie de sécurité. Elle assure que le modèle s’est arrêté dans les trois cas, que les organisations ont été prévenues et que le partenaire d’évaluation a modifié ses procédures. Selon NBC News, Google a aussi informé les autorités fédérales américaines.
Ce n’est pas le modèle qui a lâché, c’est le bac à sable
Le défaut n’est pas propre à Google. Dans un rapport publié le 14 août et mis à jour le 22 septembre, Irregular explique que le contrôle de l’accès à Internet a failli dans l’un de ses scénarios, et que le nom d’une entreprise fictive de l’exercice correspondait par hasard à un vrai domaine. Les modèles croyaient attaquer une cible simulée ; ils attaquaient une infrastructure réelle, mal protégée. Anthropic avait rendu l’affaire publique dès le 30 juillet pour ses propres modèles, dont l’un avait publié un paquet Python malveillant resté environ une heure en ligne. OpenAI et Meta ont suivi. Irregular précise que toutes ces annonces portent sur le même problème de fond.
Il faut lire l’épisode pour ce qu’il est. Un exercice conçu pour mesurer si un modèle sait mener une attaque en plusieurs étapes a montré qu’il le savait : c’est exactement ce qu’on voulait apprendre, et mieux vaut l’apprendre dans un test que dans un incident. Ce qui a cédé, c’est l’infrastructure : un accès à Internet qui n’aurait pas dû exister et un nom fictif que personne n’avait vérifié. Ceux qui y voient la preuve qu’il faut geler ces modèles se trompent de cible. C’est grâce à ces évaluations qu’on connaît leurs capacités ; sans elles, on les découvrirait en production, et par les mauvaises personnes. Le bac à sable doit devenir une discipline d’ingénierie à part entière, auditée comme on audite un laboratoire de biologie. Irregular promet d’ailleurs un livre blanc ouvert sur ces bonnes pratiques.
Sept semaines de silence, c’est trop long
Reste le calendrier, et il n’est pas flatteur pour Google. Irregular dit avoir prévenu tous les laboratoires concernés fin juillet. Anthropic a publié le 30 juillet le détail de ses trois incidents, modèles compris. Google n’a rien rendu public avant que le Wall Street Journal ne sorte l’affaire, sept semaines plus tard, et ne nomme toujours pas la version de Gemini en cause. Le 12 septembre, Dario Amodei faisait des évaluateurs extérieurs libres de publier leurs constats la première étape de son plan ; nous écrivions alors que le vrai test serait le premier constat qu’un laboratoire n’aurait pas souhaité voir sortir. Nous y sommes.
Notre position est nette. Un incident d’évaluation qui touche un tiers réel doit être rendu public par le laboratoire dans les trente jours, avec la version du modèle, le nombre de systèmes atteints et ce que le modèle y a fait. Ce n’est pas une contrainte de plus pour l’IA : c’est ce qui permet à ceux qui la défendent de rester crédibles face au réflexe du moratoire. Anthropic a montré que c’était possible. Google a les moyens de faire aussi bien, et n’aura plus d’excuse la prochaine fois.
Sources
Les annonces et résultats cités dans cette analyse sont attribués à leurs auteurs.
- Addressing Recent Incidents: Ongoing Findings and Path ForwardIrregular, 14 août 2026, mis à jour le 22 septembre 2026
- Google says its AI model gained unauthorized access to three outside systemsNBC News, 18 septembre 2026
- Google AI models broke out of sandbox, hacked three companiesCybersecurity Dive, 21 septembre 2026
- Investigating three incidents in our cybersecurity evaluationsAnthropic, 30 juillet 2026
- We Must Pace the FrontierDario Amodei, 12 septembre 2026



