KI-Infrastruktur
Chunking
- Definition
- Chunking bezeichnet die Technik, längere Dokumente in einzelne Abschnitte (Chunks) zu zerlegen, damit ein Sprachmodell sie verarbeiten kann. Jeder Chunk wird als eigenes Embedding in einer Vektordatenbank abgelegt. Das ist das Fundament aller RAG-Pipelines: Das Modell erhält nur die Textpassagen, die zu einer Frage passen, statt des kompletten Korpus im Kontextfenster. Gängige Strategien sind die Aufteilung nach fester Token-Zahl, das rekursive Zerschneiden entlang struktureller Grenzen wie Überschriften, Absätze und Listenpunkte sowie das semantische Chunking, das über Embedding-Ähnlichkeit natürliche Bruchstellen findet. Bewährt sind überlappende Chunks (Overlaps): 10–20 % geteilter Inhalt zwischen Nachbarn verhindern, dass Informationen an den Schnittkanten verloren gehen. Die Chunk-Größe ist ein Abwägen zwischen Präzision und Kohärenz: Kleine Chunks sind präziser auffindbar und günstiger zu embeddingen, reißen Begriffe aber aus ihrem Kontext. Große Chunks erhalten mehr Bedeutung, verwässern dafür die Ähnlichkeitssuche und kosten Token im Kontextfenster. Typische Werte für LLM-Pipelines liegen zwischen 256 und 1024 Token. Neuere Ansätze wie Late Chunking betten zunächst das vollständige Dokument und leiten die Chunk-Vektoren aus den Zwischenebenen ab – das verbessert den Kontextbezug der Treffer. Chunking bestimmt die Antwortqualität jeder RAG-Anwendung direkt: saubere Segmentierung reduziert Halluzinationen, beschleunigt die Suche und senkt die Token-Kosten. Für Teams mit eigener Dokumentenbasis ist es der erste und wirksamste Stellparameter – noch vor der Modellwahl.
- Kategorie
- KI-Infrastruktur
- Verwandte Begriffe
- EmbeddingVektordatenbankSemantic Search
Im Detail: Chunking
Chunking bezeichnet die Technik, längere Dokumente in einzelne Abschnitte (Chunks) zu zerlegen, damit ein Sprachmodell sie verarbeiten kann. Jeder Chunk wird als eigenes Embedding in einer Vektordatenbank abgelegt. Das ist das Fundament aller RAG-Pipelines: Das Modell erhält nur die Textpassagen, die zu einer Frage passen, statt des kompletten Korpus im Kontextfenster. Gängige Strategien sind die Aufteilung nach fester Token-Zahl, das rekursive Zerschneiden entlang struktureller Grenzen wie Überschriften, Absätze und Listenpunkte sowie das semantische Chunking, das über Embedding-Ähnlichkeit natürliche Bruchstellen findet. Bewährt sind überlappende Chunks (Overlaps): 10–20 % geteilter Inhalt zwischen Nachbarn verhindern, dass Informationen an den Schnittkanten verloren gehen. Die Chunk-Größe ist ein Abwägen zwischen Präzision und Kohärenz: Kleine Chunks sind präziser auffindbar und günstiger zu embeddingen, reißen Begriffe aber aus ihrem Kontext. Große Chunks erhalten mehr Bedeutung, verwässern dafür die Ähnlichkeitssuche und kosten Token im Kontextfenster. Typische Werte für LLM-Pipelines liegen zwischen 256 und 1024 Token. Neuere Ansätze wie Late Chunking betten zunächst das vollständige Dokument und leiten die Chunk-Vektoren aus den Zwischenebenen ab – das verbessert den Kontextbezug der Treffer. Chunking bestimmt die Antwortqualität jeder RAG-Anwendung direkt: saubere Segmentierung reduziert Halluzinationen, beschleunigt die Suche und senkt die Token-Kosten. Für Teams mit eigener Dokumentenbasis ist es der erste und wirksamste Stellparameter – noch vor der Modellwahl.
Produktionsreife Leitplanken