LLM (large language model)
Un modèle de langage avec assez de paramètres et de données d’entraînement pour produire du texte cohérent sur plusieurs paragraphes. Les LLM modernes sont des transformers avec des milliards à des billions de paramètres.
Il n’y a pas de seuil exact de taille — « large » est une cible mouvante. En pratique, le terme couvre les modèles de langage à base de transformer à partir de quelques centaines de millions de paramètres, entraînés sur des centaines de milliards de tokens.
Explication complémentaire dans Step by Token, chapitre 1.
Où ce terme est construit
- chap. 0Avant de commencer
- chap. 1Le modèle le plus idiot qui existe
- chap. 8Une tête d’attention à la main
- chap. 10Le bloc transformer complet
- chap. 14Génération et sampling
- chap. 15Charger les vrais poids
- chap. 16Pourquoi ton modèle parle mal
- chap. 19Quantification simple
- chap. 20Parler à ton modèle
- chap. 21Livrer quelque chose d’utile
- chap. 23Appendice · RLHF et DPO
Continuer