Aller au contenu
The loss curve

Alignement

Le travail qui transforme un prédicteur de prochain token en assistant utile : SFT, puis RLHF ou DPO sur préférences humaines.

Explication complémentaire dans Step by Token, chapitre 8.

Où ce terme est construit