Cache KV
Les clés et valeurs déjà calculées pour les tokens précédents, stockées pour que générer le token suivant coûte une nouvelle requête contre le cache au lieu de tout recalculer.
Sans cache, générer n tokens coûte O(n³) au total, puisque chaque étape ré-attend sur tout le préfixe. Avec un cache, chaque étape est en O(n) — c’est pour ça que le deuxième token d’une réponse arrive bien plus vite que le premier. Le prix, c’est la mémoire : le cache grandit linéairement avec le contexte.
Explication complémentaire dans Step by Token, chapitre 18.
Où ce terme est construit
Continuer