Le sujet principal de l'article est l'optimisation des Small Language Models.
Dans ce deuxième volet sur l'optimisation des Small Language Models, nous explorons la réutilisation du préfixe d'invite avec un cache clé-valeur. Une technique qui promet monts et merveilles, mais qui mérite un regard critique.