SFT (fine-tuning supervisé)
Fine-tuning sur des paires prompt/réponse écrites par des humains, pour qu’un prédicteur de token brut apprenne la forme d’une réponse. L’étape la moins chère et la plus rentable pour passer du modèle de base à l’assistant.
L’astuce qui fait marcher le SFT, c’est le masque de loss : la loss ne compte que sur les tokens de la réponse, jamais sur ceux du prompt. Le modèle apprend à *produire* des réponses, pas à répéter des questions.
Explication complémentaire dans Step by Token, chapitre 8.
Où ce terme est construit
Continuer