---
type: "GlossaryTerm"
title: "Tokenization"
description: "Tokenization (deutsch: Tokenisierung) ist der Prozess, einen fortlaufenden Textstrom in kleinere, maschinenlesbare Einheiten – sogenannte Tokens – zu zerlegen."
resource: "https://www.contextstudios.ai/de/glossar/tokenization"
language: "de"
tags: ["engineering"]
generated:
  by: "process:contextstudios-md/1"
  at: "2026-10-08T21:48:56.074Z"
status: "stable"
---

# Tokenization

Tokenization (deutsch: Tokenisierung) ist der Prozess, einen fortlaufenden Textstrom in kleinere, maschinenlesbare Einheiten – sogenannte Tokens – zu zerlegen. Jedes Token kann ein komplettes Wort, eine Silbe, ein Wortteil, ein Buchstabe oder ein Satzzeichen sein. Damit bildet die Tokenization die Brücke zwischen menschlicher Sprache und der numerischen Welt der KI-Modelle.

Der typische Ablauf: Ein Eingabetext (Prompt) wird in Tokens zerlegt, jedem Token eine eindeutige ID aus einem festen Vokabular zugewiesen, und diese IDs werden als numerische Vektoren an das Modell übergeben. Drei Ansätze haben sich etabliert: Wort-basierte Tokenization (Word-level) mit dem Nachteil großer Vokabulare, zeichen-basierte (Character-level) mit langen Sequenzen, und der heutige Goldstandard: die teilwort-basierte Subword-Level- Zerlegung. Häufig verwendete Wörter bleiben als Ganzes erhalten, komplexe oder seltene Komposita werden in Silben oder morphologische Bestandteile zerlegt.

Die wichtigsten Algorithmen für Subword-Zerlegung sind Byte-Pair Encoding (BPE), WordPiece (Google/BERT) und SentencePiece – letzteres besonders geeignet für mehrsprachige Modelle, da es sprachspezifische Trennregeln vermeidet. Führende LLMs wie Claude (Anthropic), ChatGPT (OpenAI) und Llama (Meta) setzen diese Verfahren ein.

Für die Praxis relevant: API-Kosten und Kontextfenster-Limits werden pro Token berechnet und begrenzt. Ein Kontextfenster von 128.000 Tokens entspricht grob einem 300-Seiten-Buch. Da die meisten LLMs primär auf englischen Texten trainiert sind, sind deutsche Komposita wie „Datenschutzgrundverordnung" besonders tokenintensiv – was die Kosten und die Latenz minimal erhöht.
