Loss
Un nombre qui dit à quel point le modèle se trompe sur la bonne réponse. L’entraînement la minimise.
Pour un modèle de langage, la loss par token est typiquement −log(probabilité) attribuée par le modèle au vrai prochain token. Sa somme ou moyenne sur une séquence donne un nombre comparable par token. La cross-entropy est la formulation standard.
Explication complémentaire dans Step by Token, chapitre 6.
Où ce terme est construit
- chap. 2Compter ne suffit pas
- chap. 5Un neurone qui apprend
- chap. 6Empiler les couches
- chap. 7La descente de gradient en direct
- chap. 8Une tête d’attention à la main
- chap. 9Multi-têtes et résidus
- chap. 12Le code minimal
- chap. 13La boucle d’entraînement
- chap. 16Pourquoi ton modèle parle mal
- chap. 17Donner des instructions à ton modèle
- chap. 19Quantification simple
- chap. 21Livrer quelque chose d’utile
- chap. 22Appendice · La backprop à la main
- chap. 23Appendice · RLHF et DPO
Continuer