Aller au contenu
The loss curve

SFT (fine-tuning supervisé)

Fine-tuning sur des paires prompt/réponse écrites par des humains, pour qu’un prédicteur de token brut apprenne la forme d’une réponse. L’étape la moins chère et la plus rentable pour passer du modèle de base à l’assistant.

L’astuce qui fait marcher le SFT, c’est le masque de loss : la loss ne compte que sur les tokens de la réponse, jamais sur ceux du prompt. Le modèle apprend à *produire* des réponses, pas à répéter des questions.

Explication complémentaire dans Step by Token, chapitre 8.

Où ce terme est construit