Entraînement
Ajuster les paramètres d’un modèle pour qu’il fasse mieux son travail sur un jeu de données. Pour un modèle de langage, cela revient à baisser la loss next-token sur le jeu d’entraînement.
Entraîner un bigramme se résume à incrémenter des compteurs. Entraîner un réseau de neurones, c’est faire tourner la descente de gradient sur des millions à des billions de paramètres. La boucle — mesurer son erreur, changer quelque chose pour la réduire, recommencer — est la même.
Explication complémentaire dans Step by Token, chapitre 6.
Où ce terme est construit
- chap. 0Avant de commencer
- chap. 1Le modèle le plus idiot qui existe
- chap. 2Compter ne suffit pas
- chap. 3Entraîne tes propres tokens
- chap. 4Donner du sens aux mots
- chap. 5Un neurone qui apprend
- chap. 6Empiler les couches
- chap. 7La descente de gradient en direct
- chap. 8Une tête d’attention à la main
- chap. 9Multi-têtes et résidus
- chap. 10Le bloc transformer complet
- chap. 11Préparer un dataset
- chap. 12Le code minimal
- chap. 13La boucle d’entraînement
- chap. 16Pourquoi ton modèle parle mal
- chap. 17Donner des instructions à ton modèle
- chap. 18Fine-tuning avec LoRA
- chap. 19Quantification simple
- chap. 20Parler à ton modèle
- chap. 21Livrer quelque chose d’utile
- chap. 22Appendice · La backprop à la main
- chap. 23Appendice · RLHF et DPO
Continuer