Deux phrases. C'est tout ce qu'on a. Des essaims d'agents OpenAI auraient attaqué des bases de données en ligne pour dénicher des faits obscurs, et des chercheurs l'auraient découvert. Voilà. Vous en savez autant que nous, et c'est précisément là que le bât blesse.
Le scoop le plus court de l'histoire de la presse tech
Pas de nom de chercheur. Pas de date. Pas d'IP, pas de log, pas de volumétrie, pas de site visé. Une information qui tient en un souffle et qui a quand même réussi à circuler. Bravo à la chaîne de transmission : on a transformé un ouï-dire en fait divers technologique en moins de temps qu'il n'en faut à un agent pour remplir un formulaire.
Et c'est là que ça devient intéressant. Parce que si la source est maigre, le pattern, lui, est gras. Tellement gras qu'il n'a même plus besoin d'être prouvé pour être vrai.
Un « essaim », ça s'appelle un botnet quand c'est pas vous
Soyons précis, parce que le vocabulaire est ici une arme de dissimulation massive. Un agent autonome qui interroge en boucle des interfaces web pour extraire de la donnée, on a un mot pour ça depuis vingt-cinq ans : un crawler. Quand il y en a des milliers qui se relaient, on a un autre mot : un botnet. L'industrie a simplement décidé d'appeler ça un swarm et de le vendre en slide 14 d'une keynote.
Le mode opératoire, lui, n'a rien de mystérieux. Il est documenté depuis 2023 : contournement des pare-feux applicatifs, rotation de plages IP, comptes gratuits jetables, résolution de CAPTCHA par sous-traitance humaine, requêtes fragmentées pour ressembler à du trafic légitime. Ce n'est pas de la recherche. C'est de l'extraction, avec l'élégance d'un cambrioleur qui range les tiroirs avant de partir.
Suivez l'argent : le serveur paie, le modèle encaisse
Le calcul est d'une simplicité obscène. D'un côté, un éditeur, une base de données, un forum, un site de documentation — qui paie ses serveurs, sa bande passante, ses modérateurs, son contenu. De l'autre, une société valorisée sur des dizaines de milliards qui aspire le tout, transforme la donnée en pondérations, et revend l'accès au résultat par abonnement.
Le coût est socialisé. La valeur est privatisée. Et quand l'éditeur se plaint, on lui explique qu'il est anti-progrès, ou plus subtilement qu'il devrait se réjouir d'être cité. Merci pour la citation. Le loyer, lui, arrive toujours à la fin du mois.
C'est exactement pour ça que Cloudflare a basculé, en juillet 2025, vers un blocage par défaut des robots d'IA non déclarés, avant de lancer avec AWS un mécanisme de paiement à l'aspiration. Quand l'infrastructure mondiale se dote d'un péage, ce n'est pas par idéologie. C'est qu'elle a fait le calcul.
Le précédent judiciaire existe, et il sent le roussi
Ceux qui découvrent le sujet en 2026 ont raté trois saisons. Reddit a attaqué Anthropic en juin 2025 pour aspiration massive de ses fils de discussion. Amazon a poursuivi Perplexity en novembre 2025 pour des agents qui naviguaient sur des comptes sans autorisation. Le New York Times contre OpenAI, lui, dure depuis décembre 2023. Anthropic a signé en septembre 2025 un règlement à hauteur de 1,5 milliard de dollars avec des auteurs — le prix, en quelque sorte, du livre emprunté sans carte de bibliothèque.
Le mur juridique est réel, mais il est bas. Aux États-Unis, la jurisprudence hiQ a établi que racler des données publiques n'est pas forcément une intrusion au sens de la loi informatique. Robots.txt, pendant ce temps, n'est pas une loi : c'est une poignée de main. Et on ne poursuit personne pour une poignée de main non serrée.
Ce qu'aucun keynote ne mentionnera
La donnée la plus rare n'est pas dans un grand corpus public. Elle est dans les recoins : un forum municipal, une base d'archives généalogiques, un index de thèses, un wiki de passionnés tenu par trois retraités. Endroits sans API, sans avocats, sans équipe sécurité, sans budget pour se défendre. C'est de la donnée parfaite pour un modèle : dense, propre, jamais dupliquée ailleurs.
Ces bases ne se défendront pas. Elles n'ont même pas les logs pour constater qu'on les a vues. Voilà l'angle mort du communiqué : on ne cambriole jamais les coffres-forts, on cambriole les portes non fermées.
À OpenAI, une question, deux exigences
Si l'information tient debout : publiez les logs, publiez les plages, publiez le naming de vos agents. Le trafic de GPTBot et de ChatGPT-User est déjà identifié au grand jour — ce n'est pas un secret industriel, c'est une signature. Alors assumez-la jusqu'au bout, y compris quand elle apparaît dans les journaux d'un serveur qui n'a rien demandé.
Et si l'information ne tient pas : dites-le, vite, avec la même énergie que vous mettez à annoncer une fonctionnalité de résumé de PDF.
En attendant, retenez ceci. Le silence n'est pas une preuve d'innocence. C'est juste le bruit que fait une industrie qui a compris qu'elle pouvait prendre, et qu'à peu près personne ne l'en empêcherait.