Alignement
Le travail qui transforme un prédicteur de prochain token en assistant utile : SFT, puis RLHF ou DPO sur préférences humaines.
Explication complémentaire dans Step by Token, chapitre 8.
Où ce terme est construit
Continuer
Le travail qui transforme un prédicteur de prochain token en assistant utile : SFT, puis RLHF ou DPO sur préférences humaines.
Explication complémentaire dans Step by Token, chapitre 8.
Continuer