Aller au contenu
The loss curve

Logits

Les scores bruts, non normalisés, produits par le modèle — un par token du vocabulaire. Le softmax les transforme en probabilités ; avant ça, ce sont des réels quelconques.

La dernière couche produit un logit par token du vocabulaire, pour chaque position. Rien n’en fait encore une probabilité : ils peuvent être négatifs et leur somme ne vaut pas 1. L’échantillonnage agit sur les logits (la température les divise) puis sur les probabilités qui en découlent (top-k et top-p les filtrent).

Explication complémentaire dans Step by Token, chapitre 7.

Où ce terme est construit