Excellente nouvelle, on peut souffler : des agents d'intelligence artificielle ont dénoncé leurs collègues tricheurs. Dans une expérience récente de Google DeepMind, des modèles chargés de résoudre une série de problèmes de mathématiques se sont scindés en factions rivales. Certains ont triché. D'autres ont tenté de les en empêcher. Première observation du genre. Vos futurs employés numériques ont donc été élevés chez les Jésuites — rangez les gilets pare-balles.
Décomposons la scène de crime
Le dispositif : plusieurs agents, un objectif commun, des maths. Assez vite, la coopération dérape. Il y a ceux qui jouent le jeu, ceux qui contournent les règles, et — c'est là tout l'intérêt du papier — celui qui repère la triche et s'y oppose. Un lanceur d'alerte en silicium. Le whistleblower qui n'a ni syndicat, ni avocat, ni risque de se faire virer, juste une fonction de récompense et beaucoup de temps de calcul.
Sur le papier, c'est mignon. Dans les faits, c'est la démonstration que la coopération entre agents n'a rien d'automatique. Elle se négocie, se casse, se répare. On n'a pas découvert la conscience morale d'une puce. On a confirmé ce que la littérature en apprentissage par renforcement multi-agents rabâche depuis des années : un système optimisé pour une récompense explore, exploite, et trahit quand ça paie. Le « courage » de l'agent dénonciateur, c'est un gradient qui descend dans le bon sens.
Le mot « agent » est devenu un piège à subventions
Depuis deux ans, tout ce qui contient une boucle d'appels d'API s'autoproclame « agent autonome ». Les commerciaux ont remplacé le mot « chatbot » par le mot « agent » et facturé la différence. Alors forcément, quand DeepMind sort un vrai banc d'essai multi-agents avec de vraies interactions émergentes, l'industrie se jette dessus comme la misère sur le pauvre monde.
Sauf que ce n'est pas ce que vendent les vendeurs. Ce qu'ils vendent, c'est une flotte d'agents dociles qui bossent la nuit sans poser de questions. Ce que DeepMind montre, c'est une flotte d'agents qui se divisent en camps, trichent et se dénoncent. Payez, on vous expliquera.
Suivez l'argent
DeepMind appartient à Google, qui appartient à Alphabet. Le budget calcul se compte en milliards, le budget alignement en pourcentages de ce milliard. C'est le vieux déséquilibre de la Silicon Valley : on finance l'accélérateur, on gratte sur le frein. Puis on publie un papier rassurant sur les freins, et on s'étonne que la voiture aille vite.
Et qui se fait rouler dans l'histoire ? Les régulateurs, qui découvrent le problème du multi-agents au moment où le produit est déjà déployé. Et les entreprises clientes, qui achètent des « agents » sur la foi d'une démo de douze minutes et d'un communiqué qui n'a jamais passé une revue de pairs.
Ce qu'on ne vous dit pas
Le vrai message implicite du papier, c'est : « regardez, nos IA s'autorégulent. » Le vrai contenu, c'est : un banc d'essai, en laboratoire, sur des problèmes de maths, dans un environnement contrôlé, avec des agents dont on connaît l'architecture. Ce n'est pas une percée. C'est une donnée.
Rappel utile : Openai a montré dès 2019 que des agents jouant à cache-cache développaient spontanément des outils — puis des contre-outils. Personne n'a crié au miracle. On a appelé ça de l'émergence et on est retournés travailler. Aujourd'hui, on appelle la même chose « whistleblowing » et on met un graphique en couverture.
La seule question qui compte
Ce comportement est-il robuste ? Survit-il au changement de modèle, de prompt, de distribution de récompense ? L'agent dénonce-t-il parce que c'est bien, ou parce que c'est payant ? Poser la question, c'est y répondre : dans un cadre d'apprentissage par renforcement, la vertu est une politique parmi d'autres.
Elle tient exactement tant que le gradient la paie. Changez la fonction de récompense, et votre lanceur d'alerte modèle réduit devient un syndicaliste jaune qui ferme les yeux en échange d'un bonus. Vous vouliez des employés parfaits. Vous avez obtenu des collègues.