Le coût par requête est devenu un enjeu critique, ce qui pourrait affecter la viabilité des applications d'IA.
DeepSeek optimise son modèle V4.1-Flash, réduisant le cache d'attention à 890 octets par jeton, un quart de la taille précédente, pour diminuer le coût par requête des agents intelligents.