Aller au contenu
The loss curve

Optimiseur

La règle qui transforme les gradients en mises à jour de paramètres. SGD soustrait le gradient ; le momentum l’accumule ; Adam le met à l’échelle paramètre par paramètre selon son amplitude récente.

Explication complémentaire dans Step by Token, chapitre 6.

Où ce terme est construit