Le pitch tient en une phrase. Une seule. « If AI lab PrismML isn't on your radar yet, it should be. » Voilà. Pas un chiffre, pas un benchmark, pas une licence, pas un nom de modèle, pas un gramme de poids. Un radar, et un ordre.
Susanoo News n'a pas de radar. Mais on a un détecteur de fumée, et il hurle.
« Sur votre radar », ou l'art de ne rien dire en douze mots
C'est la formule la plus paresseuse du marketing tech, et elle fonctionne à tous les coups : on ne décrit pas le produit, on décrit votre ignorance supposée. Vous ne connaissez pas PrismML ? C'est votre faute, pas la leur. Le tour de passe-passe est vieux comme le premier salon professionnel : si tu n'as rien à montrer, fais sentir à l'autre qu'il est en retard.
Notez au passage le titre original : « will change how we all use AI ». Le « we all » est le vrai aveu. Personne ne se demande comment nous tous allons utiliser l'IA — on l'utilise déjà, massivement, souvent mal, et gratuitement pour ceux qui la vendent. Ce que PrismML veut dire, c'est « comment nous tous allons utiliser notre IA ». Nuance.
Le petit modèle est devenu le nouveau pivot
Ne faisons pas de procès d'intention : le créneau existe, et il est sérieux. Depuis 2023, la course au minuscule est lancée. Mistral sort son 7B en septembre 2023. Google lâche Gemma 2B et 7B en février 2024. Microsoft pousse Phi-3-mini, 3,8 milliards de paramètres, en avril 2024, en jurant que ça « surpasse » des modèles dix fois plus gros sur certains tests. Meta emboîte le pas en septembre 2024 avec Llama 3.2 en 1B et 3B. Apple annonce à la WWDC 2024 un modèle d'environ 3B qui tourne sur l'appareil.
Pourquoi tout le monde pivote en même temps ? Pas par élégance intellectuelle. Parce que la facture arrive. Inférence sur un modèle frontière : des dizaines de dollars par million de tokens en sortie. Inférence sur un 3B quantifié en 4 bits : des centimes, ou zéro si c'est le téléphone du client qui paie l'électricité. Quand le récit des « lois d'échelle » commence à grincer, on découvre soudain les vertus de la frugalité. Comme par hasard.
Qui se goinfre, qui se fait rouler
Suivons l'argent, c'est plus instructif que le communiqué. Celui qui encaisse dans les deux scénarios, c'est le fabricant de puces : que vous fassiez tourner un 400B dans un datacenter ou un 3B dans une puce de téléphone, quelqu'un a vendu du silicium. Ensuite, les plateformes : les petits modèles ouverts sont distribués gratis, mais l'outillage autour — fine-tuning, évaluation, déploiement — reste facturé au token ou à l'abonnement. Le cadeau est dans le modèle, la marge est dans la plomberie.
Et qui se fait rouler ? L'entreprise qui signe un pilote « IA souveraine » sur un micro-modèle sans avoir vérifié une seule ligne d'évaluation indépendante. Le développeur qui découvre que son 1B, entraîné par distillation d'un modèle géant, reproduit fidèlement les biais de son géniteur — mais sans l'équipe de sécurité, sans le budget juridique, et avec une licence écrite en hiéroglyphes.
Le seul benchmark qui compte : le communiqué
Un modèle minuscule, ça se juge sur trois choses. Les poids : téléchargeables ou pas ? La licence : commerciale, ou piège à avocats ? Le coût réel par million de tokens, mesuré sur votre matériel, pas sur leur slide ? Tant que PrismML n'a publié ni l'un, ni l'autre, ni le troisième, il n'y a rien à évaluer. Il y a une intention.
Alors, adressons-nous directement à l'équipe. Vous voulez être sur nos radars ? Simple. Ouvrez les poids. Publiez les scores sur des benchmarks que vous n'avez pas fabriqués. Donnez le coût d'inférence sur un laptop de 2021. Dites-nous ce que vous avez distillé, et depuis quel modèle. Et surtout : arrêtez d'écrire « should be » à propos de votre propre produit. Ce n'est pas une promesse, c'est une supplique.
Le petit LLM de PrismML changera peut-être notre façon d'utiliser l'IA. En attendant, il a déjà changé la nôtre : on lit désormais les communiqués de presse comme on lit les étiquettes de composition. Avec méfiance, et en cherchant ce qui manque.