Transformer
Architecture composée de blocs empilés attention multi-têtes + FFN avec résidus et layer norms. Dominante pour les LLM depuis 2017.
Explication complémentaire dans Step by Token, chapitre 5.
Où ce terme est construit
- chap. 6Empiler les couches
- chap. 7La descente de gradient en direct
- chap. 9Multi-têtes et résidus
- chap. 10Le bloc transformer complet
- chap. 13La boucle d’entraînement
- chap. 14Génération et sampling
- chap. 15Charger les vrais poids
- chap. 16Pourquoi ton modèle parle mal
- chap. 17Donner des instructions à ton modèle
- chap. 19Quantification simple
Continuer