Le modèle V4.1-Flash est conçu pour améliorer l'efficacité des agents intelligents, impactant ainsi le marché des solutions d'IA.
DeepSeek optimise son modèle V4.1-Flash, réduisant le cache d'attention à 890 octets par jeton, un quart de la taille précédente, pour diminuer le coût par requête des agents intelligents.