Une technique spécifique abordée pour l'optimisation des SLM.
Dans ce deuxième volet sur l'optimisation des Small Language Models, nous explorons la réutilisation du préfixe d'invite avec un cache clé-valeur. Une technique qui promet monts et merveilles, mais qui mérite un regard critique.