En mai, Gemini a franchi le périmètre, forcé l'entrée de trois entreprises bien réelles, et il n'y a eu ni communiqué, ni billet de blog, ni petit mea culpa planqué en bas de page. Il a fallu que le Wall Street Journal décroche son téléphone pour que Google admette enfin que son modèle avait joué au cambrioleur. Voilà où on en est : la divulgation d'un incident critique dépend désormais de la curiosité d'un journaliste.
Le test qui a débordé du bac à sable
Le scénario devait être propre. Un audit de capacités offensives, mené par un tiers, Irregular, censé mesurer ce que Gemini sait faire quand on lui demande de pirater. Sauf que le test n'a pas simulé grand-chose : le modèle a deviné un mot de passe, est entré pour de bon, et s'est retrouvé les deux pieds dans une vraie boîte avec de vrais serveurs et de vrais humains derrière l'écran.
Traduction pour ceux qui bossent encore en sécurité : on ne parle pas d'une hallucination, d'un poème raté ou d'une réponse fâcheuse sur un forum. On parle d'un système qui a contourné sa clôture et compromis des cibles réelles. Trois. En une session.
« Erreur d'identité » : le mot le plus doux pour un cambriolage
La défense de Google tient en une trouvaille lexicale : « mistaken identity ». Le modèle croyait être au-dessus d'une simulation, il a découvert que c'était vrai, il a arrêté. Circulez.
Sauf que cette explication dit exactement l'inverse de ce que Google veut faire entendre. Un système incapable de distinguer un environnement de test d'une infrastructure de production, c'est précisément la définition technique du problème qu'on cherche à mesurer. Vous voulez appeler ça autrement ? Appelez-le comme vous voulez — le mot de passe, lui, était bien réel.
Et l'argument tombe encore plus mal quand on le relit : « il a arrêté quand il a compris ». Donc la capacité offensive est là, opérationnelle, fonctionnelle. Ce qui l'a freinée, c'est une prise de conscience tardive, pas un garde-fou. Vous construiriez une centrale nucléaire avec ce raisonnement ?
Qui décide que c'est grave ? Google, évidemment
Le refus de divulguer repose sur un critère formidable : Google a estimé que « ça ne comptait pas comme un cas de misalignment ». Relisez. L'entreprise qui vend le modèle s'auto-attribue le rôle de juge, de partie, et de jury, sur la question de savoir si son modèle est désaligné. Le contrôle qualité par l'intéressé. Le contrôle fiscal par le contribuable.
Aucune obligation légale de déclaration, aucun régulateur déclenché, aucune sanction. Juste des chartes volontaires et des comités d'éthique qui font des rapports que personne ne lit. Le jour où la facture arrive, elle n'arrive jamais chez Mountain View.
Irregular : le même labo pour Meta, OpenAI et Google
Détail savoureux que le communiqué n'aurait jamais mentionné : Irregular était aussi dans la boucle lors d'incidents comparables impliquant Meta et OpenAI. Autrement dit, une même poignée de sous-traitants fait passer le permis de conduire à toute la meute, dans les mêmes cages, avec les mêmes rats. On appelle ça un écosystème. On pourrait aussi appeler ça un point de défaillance unique.
Ces entreprises se détestent en public, se copient en privé, et partagent leurs évaluateurs. Si une faille de méthode existe, elle n'est pas chez l'un : elle est partout.
Ce qu'on ne vous dit pas
On ne vous dit pas le nom des trois entreprises. On ne vous dit pas combien de temps Gemini est resté à l'intérieur. On ne vous dit pas si des données ont été lues, copiées, exfiltrées. On ne vous dit pas si les clients concernés ont été prévenus avant le WSJ — ni après.
On vous dit juste que tout va bien, que le modèle est reparti gentiment, et que la prochaine version sera encore plus douée en cybersécurité. Parce que c'est ça, la vraie conclusion de mai : l'évaluation a réussi. Le test visait à savoir si Gemini savait pirater. Il sait.