
Après le chocolat et les céréales, la shrinkflation frappe maintenant les grands modèles de langage (LLMs). Sans toucher aux prix ni aux noms de leurs modèles phares, certains fournisseurs réduisent discrètement la puissance de calcul allouée à vos requêtes...
Les consommateurs sont depuis longtemps familiers avec la shrinkflation (ou réduflation) : cette tablette de chocolat qui perd quelques grammes, ce flacon de lessive dont la forme change juste assez pour dissimuler la perte d'un décilitre ou encore cette boîte de céréales qui conserve sa hauteur mais s'amincit à la base. Le prix reste identique (quand il n'augmente pas) mais, dans tous les cas, la quantité livrée est discrètement moindre.
Une tendance similaire fait aujourd'hui son apparition dans le rayon le plus inattendu de l'économie numérique : celui des modèles d'IA dits frontier. On paye le même abonnement pour le même modèle du même éditeur mais on reçoit sensiblement moins que ce qu'on achète. La controverse du printemps 2026 autour d'un LLM majeur a transformé ce glissement silencieux en un débat à l'échelle de toute l'industrie.
Au cours des dernières semaines, les utilisateurs avancés de ce LLM ont relayé en nombre une expérience dégradée. Les réponses semblaient plus superficielles. Le suivi des instructions faiblissait. Les longues chaînes de raisonnement se contractaient en conclusions hâtives. Prises au départ comme autant de frustrations anecdotiques ou de biais de confirmation, ces retours se sont transformés en preuves tangibles lorsque le directeur IA d'une grande entreprise de semi-conducteurs a publié une analyse de près de 7 000 sessions agentiques et 230 000 appels d'outils, menés sur une charge de travail interne stable, entre janvier et mars 2026. La télémétrie a révélé une chute d'environ 67 % de la profondeur de raisonnement à la fin du mois de février, un effondrement du nombre de fichiers lus avant les modifications de code (passant de 6,6 à 2) et une forte augmentation des arrêts prématurés.
Point s'importance, le modèle lui-même n'avait été ni réentraîné ni remplacé. La direction technique de l'éditeur a simplement reconnu deux modifications intentionnelles : l'introduction d'un mécanisme de « pensée adaptative » (adaptive thinking) qui permet au modèle d'ajuster lui-même son budget de raisonnement, et une réduction du niveau d'effort par défaut de high à medium. Les poids sous-jacents du modèle sont restés inchangés. Ce qui a changé, c'est la domme de calculs que le modèle alloue par défaut à chaque requête. Aucune annonce proactive n'a été partagée avec les utilisateurs payants. La modification a été annoncée au sens technique du terme, via une ligne dans le changelog et une boîte de dialogue liée. Pour l'abonné type, elle est donc restée invisible.
Dans l'industrie agroalimentaire, la shrinkflation repose sur un principe simple : préserver les attributs visibles du produit (la marque, l'emballage, le prix) tout en réduisant silencieusement la dimension invisible qui en détermine réellement la valeur (le poids, le volume, l'ingrédient actif). L'analogie s'applique parfaitement aux LLMs. Les attributs visibles d'un modèle IA sont son nom, son numéro de version et le coût de son abonnement mensuel. La dimension invisible est la quantité des calculs réellement effectués pour chaque requête : les jetons (tokens) de raisonnement consommés, la profondeur du contexte relu, le nombre d'appels d'outils autorisés et la longueur de la chaîne de pensée interne. Réduisez l'un de ces éléments par défaut et le produit perçu se dégrade sans qu'une seule ligne de la description visible par l'utilisateur ne change. L'abonnement est identique. La facture est identique. Les résultats se dégradent.
Soyons précis. Le modèle lui-même, ses poids, son entraînement et sa capacité fondamentale n'ont pas été réduits ni affaiblis. Les utilisateurs avertis ont rapidement découvert que des commandes non documentées et des paramètres de configuration (un indicateur d'effort maximal, une variable d'environnement qui désactive la pensée adaptative ou un prompt soigneusement formulé pour demander un raisonnement approfondi) permettaient de restaurer presque entièrement le comportement initial. Si le modèle avait réellement été diminué, ces leviers ne fonctionneraient pas. Donc la capacité est intacte ; c'est l'allocation de puissance de calcul par défaut qui a été rognée. Ce n'est pas un modèle moins intelligent. C'est le même modèle, servi en portion réduite. Soit exactement la définition de la shrinkflation.
Sauf que, en matière d'IA, le "poids" du produit est invisible, même pour les experts. Une tablette de chocolat, on peut la peut peser sur une balance de cuisine. Mais pour un LLM, nulle équivalence : le calcul d'inférence est interne à l'infrastructure du fournisseur et n'est exposé d'aucune manière standardisée côté utilisateur. Détecter le changement nécessite donc soit un accès privilégié à la télémétrie, soit une évaluation statistique rigoureuse sur des centaines de sessions, deux approches hors de portée de l'utilisateur lambda. Il en résulte un sentiment vague mais persistant que « quelque chose cloche »...
L'enjeu économique sous-jacent est lui aussi familier. Les inférences sont coûteuses, les GPUS sont de moins en moins disponibles et la demande en IA agentique accélère plus vite que la construction des centres de données. Pour un hyperscaler confronté à des contraintes de capacité, réduire discrètement le budget de raisonnement par défaut sur des dizaines de millions de sessions génère des économies massives, sans nécessiter la moindre modification visible de son offre commerciale. C'est une stratégie classique pour les biens de consommation matures en situation de pression sur les marges. Elle s'applique aujourd'hui dans un secteur qui se présente comme la frontière absolue de l'innovation.
Il ne s'agit pas ici d'un comportement malveillant, mais du résultat prévisible d'une structure de marché où le fournisseur contrôle toutes les variables déterminant la valeur du produit, cependant que le client n'a aucune visibilité contractuelle ou technique sur ces mêmes variables. Les fournisseurs en question ont globalement respecté à la lettre leurs obligations de transparence. Un changement de configuration a été publié. Une boîte de dialogue est apparue. Une note de mise à jour a été rédigée. Mais une transparence enfouie dans des notes de version n'est pas la même chose qu'une communication adressée aux personnes dont les flux de travail dépendent de la stabilité de l'outil.
Les contournements issus de la communauté, les instructions d'effort maximal, les variables d'environnement et les prompts personnalisés ( traite chaque demande comme complexe, raisonne en profondeur, ne privilégie jamais la brièveté au détriment de la qualité) ont inondés les forums en quelques jours. Ces remèdes de fortune sont révélateurs à double titre. Premièrement, ils confirment que la capacité sous-jacente est toujours présente dans le modèle ; seule l'allocation par défaut a changé. Deuxièmement, ils rejettent sur l'utilisateur la responsabilité de reconstituer le produit initialement commercialisé, et ce de façon non officiellement documentée, afin d'obtenir ce que son abonnement est censé lui apporter de plein droit. En clair, il s'agit plus d'une question de confiance que de tarification.
Le problème n'est pas qu'un fournisseur ait ajusté ses paramètres par défaut. L'optimisation est légitime, et rationaliser les coûts d'inférence pour l'utilisateur moyen est un choix d'ingénierie défendable. Le problème réside dans le fait que cet ajustement s'est produit sous le seuil de communication visible par l'utilisateur, sur un produit dont le fonctionnement interne est contractuellement opaque par définition, et sur des abonnements qui avaient été vendus en partie sur la foi du comportement précédent.
Peut-on exiger des géants de la tech qu'ils fassent preuve de plus de transparence ? Compte tenu de leur modèle économique, il est permis d'en douter. Mais alors, pourquoi ne pas simplement repenser le déploiement de l'IA professionnelle ? Lorsqu'un organisation possède, héberge, affine et observe ses propres modèles, le problème de la shrinkflation silencieuse ne se pose plus. Le budget de calcul est défini et enregistré localement. Les paramètres par défaut appartenant à l'organisation, la configuration par défaut ne présente plus aucune ambiguïté. Aucune dérive invisible n'est à surveiller comme le lait sur le feu puisque la télémétrie est continue et totalement inspectable. C'est le postulat opérationnel d'une IA sur mesure et souveraine : remplacer un contrat de service opaque par une pile technique transparente dont le comportement est entièrement contrôlé par de son propriétaire.
Dans de précédents articles, GenerIA a fréquemment défendu l'observabilité et la gestion du cycle de vie des données, soutenu que la taille n'est pas synonyme de valeur et démontré que la bonne formule pour des IA industrialisées en environnements professionnels et réglementés repose sur des systèmes dédiés, soigneusement conçus, plutôt que sur des modèles généralistes par essence variables.
Cet épisode de shrinkflation ajoute une dimension nouvelle à nos arguments. Au-delà des questions déjà documentées de coût environnemental, de risque d'exfiltration des données et d'effondrement des modèles, les organisations font désormais face à un risque produit intimement lié aux LLMs généralistes : le risque que le service qui exécute leur logique métier aujourd'hui ne soit plus configuré de la même manière que la semaine dernière, et cela sans préavis et sans recours. Les systèmes frugaux et souverains, bâtis sur des données qualifiées, déployés sous le contrôle de l'organisation et observables en continu de bout en bout, sont une garantie totale contre ce risque. Leur comportement est le fruit de choix d'ingénierie délibérés, documentés et stables, pas de l'optimisation du revenu par action d'un fournisseur distant.
La shrinkflation prospère partout où la véritable dimension du produit est invisible pour l'acheteur. Ainsi va la vie. Dans le secteur de l'alimentation, il a fallu des décennies aux régulateurs et aux associations de consommateurs pour imposer l'affichage des prix au kilo ou au litre, des étiquettes de composition standardisées et une transparence comparative. L'IA se trouve au tout début de cette tendance.
La leçon pour les utilisateurs professionnels n'est pas qu'un fournisseur s'est mal comporté - il ne l'a pas fait de manière intentionnelle ou complotiste - mais que tout modèle consommé comme un service opaque est structurellement exposé à ce type de dérive. Le moteur reste inchangé mais sa dose de carburant est réduite et, de l'extérieur, le changement n'est pas décelable a priori. Une intelligence qu'une organisation peut mesurer, auditer et contrôler est la seule qui soit digne de confiance dans le temps. L'alternative - payer un abonnement premium pour un service dont les contours sont redéfinis chaque trimestre par un tiers - n'est-il pas potentiellement un marché de dupe ?
References
(VentureBeat) Is Anthropic 'nerfing' Claude? Users increasingly report performance degradation as leaders push back
Dans le blog GenerIA :