Aller au contenu
The loss curve

Learning rate

Le scalaire qui multiplie chaque pas de descente de gradient. Trop petit et l’entraînement traîne ; trop grand et la loss diverge. L’hyperparamètre le plus important.

Explication complémentaire dans Step by Token, chapitre 6.

Où ce terme est construit