KI-Infrastruktur

Memory Bandwidth

Definition
Memory Bandwidth (Speicherbandbreite) ist die Datenmenge, die ein Beschleuniger pro Sekunde zwischen seinem Arbeitsspeicher und den Rechenkernen hin- und hertransportiert. Sie wird in Gigabyte pro Sekunde (GB/s) angegeben und ist ein Durchsatzmaß — im Unterschied zur Speichergröße, die nur zählt, wie viele Bytes Platz finden. Der Chiptyp (GDDR, HBM, LPDDR) bestimmt das mögliche Niveau: Consumer-Karten liegen bei einigen hundert GB/s, HBM-Beschleuniger bei ein bis zwei TB/s und mehr. Für die LLM-Inferenz ist die Bandbreite der wichtigste Einzelwert, weil das Decode-Stadium bandbreitenlimitiert ist: Jedes erzeugte Token verlangt, dass alle Gewichtsmatrizen einmal komplett durch den Speicher wandern. Die Tokens pro Sekunde lassen sich grob abschätzen: Bandbreite geteilt durch die Bytes der Gewichte. Ein 27-Milliarden-Parameter-Modell in 8-Bit belegt rund 27 GB; bei 178 GB/s ergeben sich etwa 6,5 Tokens pro Sekunde — unabhängig von den TFLOPS der Kerne. Prefill und Decode verhalten sich unterschiedlich: Beim Prefill zählt Rechenleistung, beim Decode entscheidet die Bandbreite. Wer Coding-Agents mit langen Kontexten lokal betreibt, sieht das Muster — der Prompt verschwindet schnell, die Antwort kommt mit niedriger Tokenrate. Für die Praxis: Erst Token-Rate und Modellgröße festlegen, dann die Bandbreite wählen. Quantisierung (4-Bit statt 8-Bit) halbiert die Gewichts-Bytes und steigert die Rate direkt; Batching verteilt die Speicherlast auf parallele Aufgaben. Passt das Modell nicht mehr ins Gedächtnis, hilft auch hohe Bandbreite nicht — dann limitiert die Kapazität. Memory Bandwidth ist das Scharnier zwischen Modellarchitektur, Hardwarewahl und Betriebskosten lokaler KI-Systeme.
Kategorie
KI-Infrastruktur

Im Detail: Memory Bandwidth

Memory Bandwidth (Speicherbandbreite) ist die Datenmenge, die ein Beschleuniger pro Sekunde zwischen seinem Arbeitsspeicher und den Rechenkernen hin- und hertransportiert. Sie wird in Gigabyte pro Sekunde (GB/s) angegeben und ist ein Durchsatzmaß — im Unterschied zur Speichergröße, die nur zählt, wie viele Bytes Platz finden. Der Chiptyp (GDDR, HBM, LPDDR) bestimmt das mögliche Niveau: Consumer-Karten liegen bei einigen hundert GB/s, HBM-Beschleuniger bei ein bis zwei TB/s und mehr. Für die LLM-Inferenz ist die Bandbreite der wichtigste Einzelwert, weil das Decode-Stadium bandbreitenlimitiert ist: Jedes erzeugte Token verlangt, dass alle Gewichtsmatrizen einmal komplett durch den Speicher wandern. Die Tokens pro Sekunde lassen sich grob abschätzen: Bandbreite geteilt durch die Bytes der Gewichte. Ein 27-Milliarden-Parameter-Modell in 8-Bit belegt rund 27 GB; bei 178 GB/s ergeben sich etwa 6,5 Tokens pro Sekunde — unabhängig von den TFLOPS der Kerne. Prefill und Decode verhalten sich unterschiedlich: Beim Prefill zählt Rechenleistung, beim Decode entscheidet die Bandbreite. Wer Coding-Agents mit langen Kontexten lokal betreibt, sieht das Muster — der Prompt verschwindet schnell, die Antwort kommt mit niedriger Tokenrate. Für die Praxis: Erst Token-Rate und Modellgröße festlegen, dann die Bandbreite wählen. Quantisierung (4-Bit statt 8-Bit) halbiert die Gewichts-Bytes und steigert die Rate direkt; Batching verteilt die Speicherlast auf parallele Aufgaben. Passt das Modell nicht mehr ins Gedächtnis, hilft auch hohe Bandbreite nicht — dann limitiert die Kapazität. Memory Bandwidth ist das Scharnier zwischen Modellarchitektur, Hardwarewahl und Betriebskosten lokaler KI-Systeme.

Produktionsreife Leitplanken