
En remettant en question une assomption arbitraire (à la manière d'Einstein), SuperBPE rapproche la tokenisation algorithmique de la réalité sémantique et améliore un des piliers fondamentaux du traitement du langage naturel.
En vertu du principe "Garbage in, garbage out", la tokenisation est l'une des étapes les plus critiques de la construction de modèles linguistiques. Et pourtant, elle est considérée comme allant de soi, comme un problème définitivement réglé. Depuis près de dix ans, les tokenizers classiques basés sur le Byte-Pair Encoding (BPE) suivent une règle simple mais rigide : ne jamais dépasser les limites du mot. Autrement dit, les espaces sont considérés comme LE séparateur sémantique universel. Mais voilà qu'une équipe de l'université de Washington, de NVIDIA et de l'Allen Institute for AI vient de remettre en question cette hypothèse [1] - et les résultats sont remarquables.
Leur méthode, SuperBPE, propose un ajustement assez simple à concevoir : permettre aux tokens de s'étendre sur plusieurs mots, et donc de dépasser la sacro-sainte frontière du signe espace. Cette nouvelle approche réduit le nombre de tokens jusqu'à 33 %, diminue les besoins en calcul de 27 % et augmente la précision en aval de 4 %. Tout cela en modifiant une limitation arbitraire en place depuis plusieurs années - depuis le célèbre article Attention is All You Need [2] des chercheurs de Google et les modèles de type Transformers qui l'ont mis en pratique.
Les tokenizers traditionnels traitent les espaces comme un mur sémantique, en supposant que chaque mot est une unité autonome. Mais ce n'est pas comme ça que nous autres humains interprétons le langage. Nous comprenons des expressions telles que « en revanche » ou « New York City » comme des entités sémantiques uniques.
Le fait que cette tokenisation pour ainsi dire simpliste ait la vie dure illustre, si besoin en était, le biais anglophone qui conditionne le traitement automatique du langage naturel tel qu'il se pratique tous les jours. Dans d'autres langues, notamment les langues agglutinantes comme le turc ou celles qui favorisent la composition des mots comme l'allemand, le rôle relatif des espaces est plus clair. Les mots composés tels que Weltanschauung ("Vision du monde" en allemand) ignorent les espaces. Les modèles linguistiques entrainés à partir d'entrées de ce type incluent déjà une flexibilité adaptative. Dès lors, pourquoi la tokenisation de langues comme l'anglais ou le français devrait-elle considérer le bornage des espaces comme incontournable ?
SuperBPE ne rejette pas le BPE traditionnel, il l'étend. Pour ce faire, l'algorithme de tokenisation procède en deux étapes :
Cette transition permet au tokenizer de commencer par comprendre les mots, puis d'évoluer vers la capture d'expressions fréquentes incluant plusieurs mots. À mesure que le vocabulaire s'enrichit, le modèle augmente sa cohérence sémantique. Des expressions telles que « La Grosse Pomme » deviennent une unité, et non plus une séquence lambda de mots discrets, c'est-à-dire déconnectés sémantiquement.
Avec SuperBPE, moins de tokens sont nécessaires pour représenter plus précisément le même texte. Outre l'élégance technique, cette efficacité a des effets concrets en termes de temps de calcul et donc d'impact environnemental. Par exemple, selon les auteurs, SuperBPE permet d'obtenir une efficacité d'encodage (octets par tokens) supérieure de 49 % à celle de BPE.
L'équipe de recherche a entraîné des modèles à 8B paramètres à partir de zéro, en ne changeant que le tokenizer. Les modèles SuperBPE surpassent leurs équivalents BPE - remportant 25 des 30 tâches proposées - tout en étant moins gourmands en inférence. Sur des benchmarks tels que CommonsenseQA [3] and ARC-Easy [4], les gains de performance dépassent 20 %.
SuperBPE permet de rééquilibrer l'espace des tokens. Là où BPE sur-représente les tokens triviaux (« le », « de »...), SuperBPE linéarise la distribution en traitant les expressions composées en tant qu'unités atomiques. Et se rapproche ainsi de la façon dont les humains comprennent le langage : non pas mot par mot mais unité sémantique par unité sémantique.
Conséquence logique, les modèles allouent l'espace vectoriel plus efficacement. Ils évitent les efforts inutiles sur les prédictions faciles tout en améliorant la généralisation sur les tâches plus difficiles et en faisant beaucoup mieux sur les inputs riches en métaphores et expressions imagées.
Pour une fois, dans le déluge de publications récentes sur le TAL et l'IA, SuperBPE n'est pas qu'une simple curiosité académique. Il permet de réduire le nombre de tokens, avec une inférence plus rapide et une utilisation réduite de la mémoire. Il offre une plus grande efficacité par paramètre, ce qui signifie de meilleurs modèles sans mise à l'échelle. Et, accessoirement, il prend en charge des contextes étendus, c'est-à-dire des documents plus longs dans la même limite de tokens.
L'avancée ici peut sembler principalement conceptuelle, en ce sens que nous devons cesser de considérer aveuglément les espaces comme délimiteurs naturels. Mais pas d'erreur : dans notre quête permanente de modèles linguistiques plus efficaces et plus performants, les stratégies de segmentation en unités plus intelligentes deviennent fondationnelles. Ce qui nous amène aux implications logiques :
Comment la modélisation cross-token interagit-elle avec les stratégies de prédiction multi-tokens ?
Des approches similaires apportent-elles des bénéfices concrets sur les modèles multimodaux (texte et vision) ?
References
[1] A.Liu, J. Hayase, V.Hofmann, S. Oh, N.A. Smith, Y. Choi, SuperBPE: Space Travel for Language Models
[2] A. Vaswani, N. Shazeer, N. Parmar, J. Uszkoreit, L. Jones, A. N. Gomez, L. Kaiser, I. Polosukhin, Attention Is All You Need
[3] A. Talmor, J. Herzig, N. Lourie, J. Berant, CommonsenseQA: A Question Answering Challenge Targeting Commonsense Knowledge
[4] P. Clark, I. Cowhey, O. Etzioni, T. Khot, A. Sabharwal, C. Schoenick, O. Tafjord, ARC (AI2 Reasoning Challenge)
Dans le blog GenerIA :