---
type: "GlossaryTerm"
title: "Memory Bandwidth"
description: "Memory Bandwidth (Speicherbandbreite) ist die Datenmenge, die ein Beschleuniger pro Sekunde zwischen seinem Arbeitsspeicher und den Rechenkernen hin- und hertra"
resource: "https://www.contextstudios.ai/de/glossar/memory-bandwidth"
language: "de"
tags: ["infrastructure"]
generated:
  by: "process:contextstudios-md/1"
  at: "2026-10-08T21:38:57.226Z"
status: "stable"
---

# Memory Bandwidth

Memory Bandwidth (Speicherbandbreite) ist die Datenmenge, die ein Beschleuniger pro Sekunde zwischen seinem Arbeitsspeicher und den Rechenkernen hin- und hertransportiert. Sie wird in Gigabyte pro Sekunde (GB/s) angegeben und ist ein Durchsatzmaß — im Unterschied zur Speichergröße, die nur zählt, wie viele Bytes Platz finden. Der Chiptyp (GDDR, HBM, LPDDR) bestimmt das mögliche Niveau: Consumer-Karten liegen bei einigen hundert GB/s, HBM-Beschleuniger bei ein bis zwei TB/s und mehr.

Für die LLM-Inferenz ist die Bandbreite der wichtigste Einzelwert, weil das Decode-Stadium bandbreitenlimitiert ist: Jedes erzeugte Token verlangt, dass alle Gewichtsmatrizen einmal komplett durch den Speicher wandern. Die Tokens pro Sekunde lassen sich grob abschätzen: Bandbreite geteilt durch die Bytes der Gewichte. Ein 27-Milliarden-Parameter-Modell in 8-Bit belegt rund 27 GB; bei 178 GB/s ergeben sich etwa 6,5 Tokens pro Sekunde — unabhängig von den TFLOPS der Kerne.

Prefill und Decode verhalten sich unterschiedlich: Beim Prefill zählt Rechenleistung, beim Decode entscheidet die Bandbreite. Wer Coding-Agents mit langen Kontexten lokal betreibt, sieht das Muster — der Prompt verschwindet schnell, die Antwort kommt mit niedriger Tokenrate.

Für die Praxis: Erst Token-Rate und Modellgröße festlegen, dann die Bandbreite wählen. Quantisierung (4-Bit statt 8-Bit) halbiert die Gewichts-Bytes und steigert die Rate direkt; Batching verteilt die Speicherlast auf parallele Aufgaben. Passt das Modell nicht mehr ins Gedächtnis, hilft auch hohe Bandbreite nicht — dann limitiert die Kapazität. Memory Bandwidth ist das Scharnier zwischen Modellarchitektur, Hardwarewahl und Betriebskosten lokaler KI-Systeme.
