L'élément du prompt qui est réutilisé et mis en cache.
Dans ce deuxième volet sur l'optimisation des Small Language Models, nous explorons la réutilisation du préfixe d'invite avec un cache clé-valeur. Une technique qui promet monts et merveilles, mais qui mérite un regard critique.