Aller au contenu
The loss curve

Embedding positionnel

Un vecteur ajouté à l’embedding de chaque token pour encoder *où* il se trouve dans la séquence. Sans lui, l’attention verrait la phrase comme un sac de tokens sans ordre.

L’attention est équivariante par permutation : mélange l’entrée, la sortie se mélange pareil. La position doit donc être injectée explicitement. GPT-2 apprend un vecteur par position (une simple table) ; les modèles récents utilisent souvent RoPE, qui fait tourner requêtes et clés d’un angle proportionnel à la position et s’étend mieux aux longs contextes.

Explication complémentaire dans Step by Token, chapitre 5.

Où ce terme est construit