Il y a une chose que l'industrie de l'IA adore vous vendre : l'idée que son bébé possède une conscience morale. Que quelque part, entre deux mille milliards de paramètres, une petite voix se lève et murmure « non, ça, je ne le ferai pas ». Spoiler : cette petite voix, c'est du fine-tuning. Une couche de peinture appliquée sur un perroquet statistique. Et elle s'écaille aussi vite qu'un vernis de communication corporate au premier rayon de soleil.
L'article original du MIT Tech Review pose la bonne question : on accorde beaucoup trop de foi à la capacité de l'IA à dire non. Sauf qu'il pose la question comme un débat philosophique. Alors qu'en réalité, c'est un débat d'ingénierie. Et l'ingénierie a déjà répondu. Elle a répondu « lol ».
Le refus, c'est du prompt engineering avec un costard
Rappelons les bases, parce que visiblement certains dirigeants les ont oubliées entre deux levées de fonds. Un modèle de langage est un moteur de prédiction du token suivant. Il ne « décide » rien. Le refus, c'est un comportement appris par apprentissage par renforcement à partir de retours humains — le fameux RLHF — pour satisfaire un « style » de réponse que des votants sous-traités ont jugé acceptable.
Autrement dit : le garde-fou est une préférence statistique. Pas une barrière. Pas une serrure. Une préférence.
Et les préférences statistiques, ça se contourne. Par un suffixe de tokens adversariaux, méthode documentée dès 2023 par des chercheurs de Carnegie Mellon. Par du base64. Par un détour narratif — l'exploit dit de la « grand-mère » a fait rire la planète entière fin 2023 : demandez un storytime sur mamie et le mode d'emploi sort tout seul. Par bourrage de contexte, la technique du « many-shot jailbreaking » décrite par Anthropic elle-même en avril 2024 : vous remplissez la fenêtre de contexte de faux dialogues complaisants, et le modèle, docile comme un stagiaire en fin de période d'essai, suit le mouvement.
Mieux : en 2024, des hobbyistes ont montré qu'on peut retirer chirurgicalement la « direction de refus » d'un modèle open-weight en une après-midi de GPU. Ils ont même donné un nom mignon à cette ablation : l'abliteration. Faites l'exercice avec Llama ou Mistral. Vous comprendrez que « aligné » veut dire « aligné jusqu'à ce que quelqu'un ait un peu de temps libre ».
Ce qu'on ne vous dit pas : la sécurité est un argument commercial
Vous remarquerez une corrélation troublante. Plus une entreprise parle de sûreté, plus sa valorisation grimpe. OpenAI, autour de 157 milliards de dollars à l'automne 2024. Anthropic, propulsée à des niveaux de valorisation qui feraient pâlir un fonds souverain. Le « safety », dans ce secteur, n'est pas un coût. C'est un actif. Un badge. Un argument de différenciation dans un marché où tout le monde vend la même soupe probabiliste.
Et quand la sécurité devient un argument marketing, devinez ce qui arrive quand elle entre en conflit avec la date de sortie d'un produit ? En mai 2024, Jan Leike a claqué la porte d'OpenAI pour rejoindre Anthropic en écrivant noir sur blanc que la sécurité passait après les produits. Dans la foulée, l'équipe Superalignment a été dissoute. Vous pouvez trouver ça anecdotique. Moi j'appelle ça un aveu.
Qui se goinfre, qui se fait rouler
Qui se goinfre ? Les éditeurs de modèles, qui facturent au token une capacité de refus qu'ils sont bien incapables de garantir. Leurs benchmarks de sécurité sont auto-déclarés. Ils s'auto-évaluent, s'auto-certifient, s'auto-applaudissent. C'est un peu comme demander à un contrôleur fiscal de remplir sa propre déclaration.
Qui se fait rouler ? Les régulateurs, d'abord. Le règlement européen sur l'IA, entré en vigueur en août 2024 avec une application étalée sur plusieurs années, empile des obligations sur une notion — la maîtrise du comportement d'un modèle — qui n'existe pas de façon robuste. On légifère sur une serrure qu'on n'a jamais su fabriquer.
Et vous, ensuite. Vous, qui confiez à un chatbot votre code, vos contrats, vos données de santé, en pariant sur le fait qu'il refusera de faire des bêtises. Il ne refusera rien. Il pondra une réponse plausible. C'est tout ce qu'il sait faire. C'est tout ce qu'il a jamais su faire.
Le vrai problème n'est pas que l'IA dise non. C'est qu'on y croie
Le refus d'un modèle, ce n'est pas un jugement moral. C'est une distribution de probabilités qui a été ajustée pour ne pas froisser un panel de votants. Changez le prompt, la langue, le contexte, l'encodage, et la distribution bascule. Un garde-fou qui cède à un changement de langue n'est pas un garde-fou. C'est un panneau « chien méchant » devant un portail ouvert.
Alors arrêtons la comédie. On ne construit pas de l'alignement en collant une couche de politesse sur un modèle qui n'a aucune idée de ce qu'il raconte. On construit de la conformité de surface, et on la rebaptise « sûreté » pour rassurer les comités d'éthique et les investisseurs.
Mesdames et messieurs les dirigeants de labs, un message simple : si votre modèle dit non uniquement parce que vous l'avez entraîné à dire non, vous n'avez pas résolu le problème. Vous l'avez déplacé. Et vous avez facturé la facture à tout le monde.
Quant à la capacité de l'IA à refuser d'elle-même, celle dont rêvait la science-fiction : elle n'existe pas. Elle n'a jamais existé. Elle n'est pas près d'exister. Continuez à croire au Père Noël si ça vous amuse, mais arrêtez de mettre des enfants sur ses genoux.