Agentic Infrastructure

KV-Cache (Key-Value-Cache)

Der KV-Cache (Key-Value-Cache) ist der Zwischenpeicher eines Transformer-Modells während der Inferenz: Er hält die Key- und Value-Vektoren aller bereits gelesenen Tokens fest, damit jeder neue Token ohne komplette Neuberechnung des Kontexts erzeugt werden kann. Ohne diese Technik wäre Texterzeugung quadratisch teuer; mit ihr wächst der Rechenaufwand pro Token nur noch linear. Der Speicherverbrauch selbst steigt weiter mit der Kontextlänge, denn jede Ebene und jeder Attention-Kopf liefert zwei Vektorblöcke pro Token. Deshalb bestimmt die KV-Cache-Größe im Betrieb direkt, wie viele parallele Sessions eine GPU bedient, wie schnell Long-Context-Anfragen laufen und was ein Token kostet. Moderne Architekturen komprimieren den Cache gezielt: Multi-head Latent Attention bringt es bei DeepSeek V4.1 Flash auf rund 890 Byte pro Token. Eng verwandt ist das Prefix Caching, bei dem identische System-Prompts und Dokumentanfänge zwischen Anfragen wiederverwendet werden. Für Teams, die KI-Agenten produktiv betreiben, ist der KV-Cache damit kein Detail der Modellinterna, sondern ein konkreter Hebel für Durchsatz, Preis und Stabilität — besonders bei Agenten-Loops mit langen, mehrfachen Kontexten.

Im Detail: KV-Cache (Key-Value-Cache)

Der KV-Cache (Key-Value-Cache) ist der Zwischenpeicher eines Transformer-Modells während der Inferenz: Er hält die Key- und Value-Vektoren aller bereits gelesenen Tokens fest, damit jeder neue Token ohne komplette Neuberechnung des Kontexts erzeugt werden kann. Ohne diese Technik wäre Texterzeugung quadratisch teuer; mit ihr wächst der Rechenaufwand pro Token nur noch linear. Der Speicherverbrauch selbst steigt weiter mit der Kontextlänge, denn jede Ebene und jeder Attention-Kopf liefert zwei Vektorblöcke pro Token. Deshalb bestimmt die KV-Cache-Größe im Betrieb direkt, wie viele parallele Sessions eine GPU bedient, wie schnell Long-Context-Anfragen laufen und was ein Token kostet. Moderne Architekturen komprimieren den Cache gezielt: Multi-head Latent Attention bringt es bei DeepSeek V4.1 Flash auf rund 890 Byte pro Token. Eng verwandt ist das Prefix Caching, bei dem identische System-Prompts und Dokumentanfänge zwischen Anfragen wiederverwendet werden. Für Teams, die KI-Agenten produktiv betreiben, ist der KV-Cache damit kein Detail der Modellinterna, sondern ein konkreter Hebel für Durchsatz, Preis und Stabilität — besonders bei Agenten-Loops mit langen, mehrfachen Kontexten.

Implementierungsdetails

  • Tech-Stack
    deepseek
  • Produktionsreife Leitplanken