Logits
Les scores bruts, non normalisés, produits par le modèle — un par token du vocabulaire. Le softmax les transforme en probabilités ; avant ça, ce sont des réels quelconques.
La dernière couche produit un logit par token du vocabulaire, pour chaque position. Rien n’en fait encore une probabilité : ils peuvent être négatifs et leur somme ne vaut pas 1. L’échantillonnage agit sur les logits (la température les divise) puis sur les probabilités qui en découlent (top-k et top-p les filtrent).
Explication complémentaire dans Step by Token, chapitre 7.
Où ce terme est construit
Continuer