Le Blog GenerIA

Repenser la tokenisation : SuperBPE dépasse la frontière de l'espace

Blog post illustration
Partagez cet article :

En remettant en question une assomption arbitraire (à la manière d'Einstein), SuperBPE rapproche la tokenisation algorithmique de la réalité sémantique et améliore un des piliers fondamentaux du traitement du langage naturel.

En vertu du principe "Garbage in, garbage out", la tokenisation est l'une des étapes les plus critiques de la construction de modèles linguistiques. Et pourtant, elle est considérée comme allant de soi, comme un problème définitivement réglé. Depuis près de dix ans, les tokenizers classiques basés sur le Byte-Pair Encoding (BPE) suivent une règle simple mais rigide : ne jamais dépasser les limites du mot. Autrement dit, les espaces sont considérés comme LE séparateur sémantique universel. Mais voilà qu'une équipe de l'université de Washington, de NVIDIA et de l'Allen Institute for AI vient de remettre en question cette hypothèse [1] - et les résultats sont remarquables.

Leur méthode, SuperBPE, propose un ajustement assez simple à concevoir : permettre aux tokens de s'étendre sur plusieurs mots, et donc de dépasser la sacro-sainte frontière du signe espace. Cette nouvelle approche réduit le nombre de tokens jusqu'à 33 %, diminue les besoins en calcul de 27 % et augmente la précision en aval de 4 %. Tout cela en modifiant une limitation arbitraire en place depuis plusieurs années - depuis le célèbre article Attention is All You Need [2] des chercheurs de Google et les modèles de type Transformers qui l'ont mis en pratique.

Des frontières sémantiques artificielles

Les tokenizers traditionnels traitent les espaces comme un mur sémantique, en supposant que chaque mot est une unité autonome. Mais ce n'est pas comme ça que nous autres humains interprétons le langage. Nous comprenons des expressions telles que « en revanche » ou « New York City » comme des entités sémantiques uniques.

Le fait que cette tokenisation pour ainsi dire simpliste ait la vie dure illustre, si besoin en était, le biais anglophone qui conditionne le traitement automatique du langage naturel tel qu'il se pratique tous les jours. Dans d'autres langues, notamment les langues agglutinantes comme le turc ou celles qui favorisent la composition des mots comme l'allemand, le rôle relatif des espaces est plus clair. Les mots composés tels que Weltanschauung ("Vision du monde" en allemand) ignorent les espaces. Les modèles linguistiques entrainés à partir d'entrées de ce type incluent déjà une flexibilité adaptative. Dès lors, pourquoi la tokenisation de langues comme l'anglais ou le français devrait-elle considérer le bornage des espaces comme incontournable ?

Comment fonctionne SuperBPE

SuperBPE ne rejette pas le BPE traditionnel, il l'étend. Pour ce faire, l'algorithme de tokenisation procède en deux étapes :

  • Phase initiale : le traitement BPE standard s'exécute sur le texte (en respectant les espaces) jusqu'à une taille de vocabulaire t.
  • "Super" phase : l'apprentissage se poursuit sans tenir compte des espaces, ce qui permet aux tokens de s'étendre sur plusieurs mots.

Cette transition permet au tokenizer de commencer par comprendre les mots, puis d'évoluer vers la capture d'expressions fréquentes incluant plusieurs mots. À mesure que le vocabulaire s'enrichit, le modèle augmente sa cohérence sémantique. Des expressions telles que « La Grosse Pomme » deviennent une unité, et non plus une séquence lambda de mots discrets, c'est-à-dire déconnectés sémantiquement.

Efficacité et précision

Avec SuperBPE, moins de tokens sont nécessaires pour représenter plus précisément le même texte. Outre l'élégance technique, cette efficacité a des effets concrets en termes de temps de calcul et donc d'impact environnemental. Par exemple, selon les auteurs, SuperBPE permet d'obtenir une efficacité d'encodage (octets par tokens) supérieure de 49 % à celle de BPE.

L'équipe de recherche a entraîné des modèles à 8B paramètres à partir de zéro, en ne changeant que le tokenizer. Les modèles SuperBPE surpassent leurs équivalents BPE - remportant 25 des 30 tâches proposées - tout en étant moins gourmands en inférence. Sur des benchmarks tels que CommonsenseQA [3] and ARC-Easy [4], les gains de performance dépassent 20 %.

Sous le capot

SuperBPE permet de rééquilibrer l'espace des tokens. Là où BPE sur-représente les tokens triviaux (« le », « de »...), SuperBPE linéarise la distribution en traitant les expressions composées en tant qu'unités atomiques. Et se rapproche ainsi de la façon dont les humains comprennent le langage : non pas mot par mot mais unité sémantique par unité sémantique.

Conséquence logique, les modèles allouent l'espace vectoriel plus efficacement. Ils évitent les efforts inutiles sur les prédictions faciles tout en améliorant la généralisation sur les tâches plus difficiles et en faisant beaucoup mieux sur les inputs riches en métaphores et expressions imagées.

Impacts pratiques et perspectives

Pour une fois, dans le déluge de publications récentes sur le TAL et l'IA, SuperBPE n'est pas qu'une simple curiosité académique. Il permet de réduire le nombre de tokens, avec une inférence plus rapide et une utilisation réduite de la mémoire. Il offre une plus grande efficacité par paramètre, ce qui signifie de meilleurs modèles sans mise à l'échelle. Et, accessoirement, il prend en charge des contextes étendus, c'est-à-dire des documents plus longs dans la même limite de tokens.

L'avancée ici peut sembler principalement conceptuelle, en ce sens que nous devons cesser de considérer aveuglément les espaces comme délimiteurs naturels. Mais pas d'erreur : dans notre quête permanente de modèles linguistiques plus efficaces et plus performants, les stratégies de segmentation en unités plus intelligentes deviennent fondationnelles. Ce qui nous amène aux implications logiques :

Comment la modélisation cross-token interagit-elle avec les stratégies de prédiction multi-tokens ?

Des approches similaires apportent-elles des bénéfices concrets sur les modèles multimodaux (texte et vision) ?

References

[1] A.Liu, J. Hayase, V.Hofmann, S. Oh, N.A. Smith, Y. Choi, SuperBPE: Space Travel for Language Models

[2] A. Vaswani, N. Shazeer, N. Parmar, J. Uszkoreit, L. Jones, A. N. Gomez, L. Kaiser, I. Polosukhin, Attention Is All You Need

[3] A. Talmor, J. Herzig, N. Lourie, J. Berant, CommonsenseQA: A Question Answering Challenge Targeting Commonsense Knowledge

[4] P. Clark, I. Cowhey, O. Etzioni, T. Khot, A. Sabharwal, C. Schoenick, O. Tafjord, ARC (AI2 Reasoning Challenge)

Dans le blog GenerIA :

Article Image

Quand votre fournisseur d'IA devient votre concurrent

Un mathématicien a consacré un an à l'un des problèmes ouverts les plus difficiles de son domaine. Il a mené ce travail dans Codex, l'agent de codage d'OpenAI. Quelques jours avant sa publication, OpenAI a publié un résultat concurrent sur le même problème, suivant une voie tout aussi inhabituelle, mais avec une puissance de calcul "maison".

Article Image

Comme au supermarché, la shrinkflation s'empare de l'IA

Après le chocolat et les céréales, la shrinkflation frappe maintenant les grands modèles de langage (LLMs). Sans toucher aux prix ni aux noms de leurs modèles phares, certains fournisseurs réduisent discrètement la puissance de calcul allouée à vos requêtes...

Article Image

Fin de l'IA gratuite : pourquoi les organisations doivent sécuriser leur capacités maintenant

Alors que les conflits géopolitiques et la course à l'échelle font flamber les prix de l'énergie, les géants de la Tech suppriment une à une les offres gratuites ou massivement subventionnées sur lesquelles de nombreuses organisations s'appuient.

Article Image

À l'ère du "slop", le savoir-faire devient un avantage concurrentiel

La démocratisation de l'IA a rendu la production de contenu quasi triviale, et dans le même temps beaucoup plus difficile la création de valeur ajoutée. La différence entre les deux n'a rien à voir avec l'art du prompt. Elle découle d'une combinaison de savoir-faire, denrée rare s'il en est.

Article Image

Repenser votre prochaine embauche junior : et si l'IA prenait en charge le travail répétitif ?

Si votre expérience de l'intelligence artificielle se limite à ChatGPT, cet article pourrait remettre en question vos idées reçues. L'IA grand public n'est pas la référence. L'IA d'entreprise, correctement conçue et gouvernée, fonctionne à un niveau fondamentalement différent, capable de transformer définitivement la manière dont les organisations structurent les missions "junior".

Article Image

La vague que les métiers intellectuels ne voient pas arriver

Pendant des années, on a pensé que l'automatisation remplacerait d'abord le travail manuel. Ce sont les usines, les entrepôts et le transport qui allaient absorber le premier choc de la disruption portée par l'IA. Sauf que les données actuelles racontent une autre histoire. La prochaine grande disruption du monde du travail ne vise pas les métiers manuels ; elle touchera d'abord les cols blancs.

Article Image

Modèles d'IA et langues africaines : exclusion systémique et nécessité d'alternatives souveraines

La sous-représentation persistante des langues africaines dans les grands modèles d'IA révèle des déséquilibres structurels en matière de données, d'infrastructures et de choix de conception. Elle souligne l'urgence de développer des alternatives souveraines, frugales et explicables, mieux adaptées aux réalités locales.

Article Image

Modèles d'IA et exfiltration de données : menace sur les avantages concurrentiels des petites et moyennes organisations

Les petites et moyennes organisations adoptent en masse l'IA générative pour gagner en vitesse et en efficacité avec des ressources limitées. Mais derrière ces gains de productivité se cache une menace croissante autant qu'invisible : des données sensibles s'échappent silencieusement vers des modèles d'IA publics. À mesure que les outils non maîtrisés deviennent le principal vecteur d'exfiltration de données, les organisations doivent repenser leur adoption de l'IA, sous peine de perdre à la fois leur singularité et leurs avantages concurrentiels.

Article Image

Les modèles hyperscale sont-ils meilleurs ou contre-productifs pour votre organisation ?

L'industrie de l'IA est obsédée par la course à l'échelle : plus de paramètres, plus de données, plus de puissance de calcul. Pourtant, derrière la promesse de performances toujours accrues, des fragilités structurelles apparaissent. Fiabilité, soutenabilité, gouvernance des données et valeur économique à long terme sont désormais en jeu. Pour la plupart des organisations, les modèles hyperscale peuvent s'avérer tout simplement contre-productifs...

Article Image

Shadow AI et dérive stratégique : de l'expérimentation non maîtrisée à la transformation orchestrée

L'IA générative est partout dans les organisations - sauf là où elle crée réellement de la valeur stratégique. Alors que les collaborateurs gagnent en efficacité dans l'ombre, les directions peinent à transformer ces gains individuels en avantage concurrentiel durable. Résultat : un fossé grandissant entre expérimentation et stratégie, productivité et transformation.

Tout le blog GenerIA