L'utilisation intensive des GPU peut poser des problèmes de disponibilité pour les petites et moyennes entreprises.
La méthode de décodage spéculatif développée par DSpark promet d'améliorer la vitesse d'inférence des modèles de langage de grande taille. Cependant, les PME doivent naviguer avec précaution face aux contraintes de ressources GPU.