---
type: "GlossaryTerm"
title: "Layer Streaming"
description: "Layer Streaming ist eine Speicher-Technik für lokale Inferenz großer Sprachmodelle. Die Modellgewichte bleiben als Datei auf der NVMe-SSD; die Engine lädt pro V"
resource: "https://www.contextstudios.ai/de/glossar/layer-streaming"
language: "de"
tags: ["infrastructure"]
generated:
  by: "process:contextstudios-md/1"
  at: "2026-10-08T21:41:43.351Z"
status: "stable"
---

# Layer Streaming

Layer Streaming ist eine Speicher-Technik für lokale Inferenz großer Sprachmodelle. Die Modellgewichte bleiben als Datei auf der NVMe-SSD; die Engine lädt pro Vorwärtspass nur die Schichten in die RAM, die für das nächste Token nötig sind. So läuft ein 2,8 Billionen Parameter großes MoE-Modell wie Kimi K3 (1,45 TB Gewichte) auf einem MacBook mit 128 GB RAM. Der Trade-off: sequenzieller Lade-Overhead pro Token statt einem vollständigen Laden. Für MoE-Modelle lohnt sich das besonders, weil pro Token nur ein Teil der Experten aktiv ist.
