Aller au contenu
Notitia

TokenisationTokenization

Réponse directe

L’étape qui découpe un contenu en unités appelées tokens avant son traitement par un modèle.

Explication détaillée

Pour traiter un texte, un modèle ne lit pas directement des mots entiers. Un tokenizer le découpe en mots, fragments de mots, signes ou autres unités, puis associe chaque token à un identifiant numérique. Le découpage varie selon le modèle et la langue ; il influence notamment la place utilisée dans la fenêtre de contexte.

Exemple

Un mot courant peut correspondre à un seul token, tandis qu’un nom rare ou un mot très long peut être découpé en plusieurs fragments. Deux modèles peuvent donc compter différemment la même phrase.

Analogie

C’est comme découper une phrase en pièces de puzzle numérotées avant de les transmettre au modèle.

Erreurs fréquentes

« Un token correspond toujours à un mot. » Il peut s’agir d’un mot, d’un fragment, d’un signe de ponctuation ou d’une autre unité. « Tous les modèles découpent un texte de la même manière. » Chaque famille de modèles peut utiliser son propre tokenizer. « Le nombre de tokens se déduit exactement du nombre de caractères. » Il faut utiliser le tokenizer du modèle concerné pour obtenir un compte précis.

Termes liés

Sources

Dernière mise à jour : 24/07/2026 · Rédaction : Alban Speckaert