Partage de poids (weight tying)
Partager une seule matrice entre l’embedding de tokens et la projection de sortie. Économise vocab_size × n_embd paramètres, en général sans coût de qualité.
Où ce terme est construit
Continuer
Partager une seule matrice entre l’embedding de tokens et la projection de sortie. Économise vocab_size × n_embd paramètres, en général sans coût de qualité.
Continuer