Infrastructure Agentique
Cache clé-valeur (Key-Value Cache)
Le cache clé-valeur (KV cache) est la mémoire de travail d'un modèle transformer pendant l'inférence. Il stocke les vecteurs clés et valeurs de chaque token déjà lu, afin que le modèle n'a pas à recalculer l'attention complète à chaque étape. Cela accélère la génération de tokens, mais consomme de plus en plus de mémoire au fil de la contexte.
En détail: Cache clé-valeur (Key-Value Cache)
Le cache clé-valeur (KV cache) est la mémoire de travail d'un modèle transformer pendant l'inférence. Il stocke les vecteurs clés et valeurs de chaque token déjà lu, afin que le modèle n'a pas à recalculer l'attention complète à chaque étape. Cela accélère la génération de tokens, mais consomme de plus en plus de mémoire au fil de la contexte.
Détails d'implémentation
- Garde-fous prêts pour la production