Embedding positionnel
Un vecteur ajouté à l’embedding de chaque token pour encoder *où* il se trouve dans la séquence. Sans lui, l’attention verrait la phrase comme un sac de tokens sans ordre.
L’attention est équivariante par permutation : mélange l’entrée, la sortie se mélange pareil. La position doit donc être injectée explicitement. GPT-2 apprend un vecteur par position (une simple table) ; les modèles récents utilisent souvent RoPE, qui fait tourner requêtes et clés d’un angle proportionnel à la position et s’étend mieux aux longs contextes.
Explication complémentaire dans Step by Token, chapitre 5.
Où ce terme est construit
Continuer