Token
L’unité de base qu’un modèle lit et écrit. Souvent un sous-mot, parfois un mot, parfois un caractère.
La tokenization est la première étape d’un pipeline de modèle de langage. Les tokenizers par espaces coupent les mots ; les tokenizers BPE apprennent une granularité entre mots et caractères.
Explication complémentaire dans Step by Token, chapitre 2.
Où ce terme est construit
- chap. 1Le modèle le plus idiot qui existe
- chap. 2Compter ne suffit pas
- chap. 3Entraîne tes propres tokens
- chap. 4Donner du sens aux mots
- chap. 5Un neurone qui apprend
- chap. 7La descente de gradient en direct
- chap. 8Une tête d’attention à la main
- chap. 9Multi-têtes et résidus
- chap. 10Le bloc transformer complet
- chap. 11Préparer un dataset
- chap. 12Le code minimal
- chap. 13La boucle d’entraînement
- chap. 14Génération et sampling
- chap. 15Charger les vrais poids
- chap. 16Pourquoi ton modèle parle mal
- chap. 17Donner des instructions à ton modèle
- chap. 20Parler à ton modèle
Continuer