TokenisationTokenization
Réponse directe
L’étape qui découpe un contenu en unités appelées tokens avant son traitement par un modèle.
Explication détaillée
Pour traiter un texte, un modèle ne lit pas directement des mots entiers. Un tokenizer le découpe en mots, fragments de mots, signes ou autres unités, puis associe chaque token à un identifiant numérique. Le découpage varie selon le modèle et la langue ; il influence notamment la place utilisée dans la fenêtre de contexte.
Exemple
Un mot courant peut correspondre à un seul token, tandis qu’un nom rare ou un mot très long peut être découpé en plusieurs fragments. Deux modèles peuvent donc compter différemment la même phrase.
Analogie
C’est comme découper une phrase en pièces de puzzle numérotées avant de les transmettre au modèle.
Erreurs fréquentes
« Un token correspond toujours à un mot. » Il peut s’agir d’un mot, d’un fragment, d’un signe de ponctuation ou d’une autre unité.
« Tous les modèles découpent un texte de la même manière. » Chaque famille de modèles peut utiliser son propre tokenizer.
« Le nombre de tokens se déduit exactement du nombre de caractères. » Il faut utiliser le tokenizer du modèle concerné pour obtenir un compte précis.
Termes liés
Sources
- Google for Developers — Machine Learning Glossary — Google for Developers · consulté le 2026-07-24
- Google for Developers — Large language models, tokenization — Google for Developers · consulté le 2026-07-24
Dernière mise à jour : 24/07/2026 · Rédaction : Alban Speckaert
