Quantification
Stocker les poids en entiers basse précision (INT8, INT4) plutôt qu’en floats. Réduit taille et coût d’inférence.
Où ce terme est construit
Continuer
Stocker les poids en entiers basse précision (INT8, INT4) plutôt qu’en floats. Réduit taille et coût d’inférence.
Continuer