KI-Agenten
Spekulatives Dekodieren: der einzige verlustfreie Speed-Boost — und die eine Frage, die ihn entscheidet
Spekulatives Dekodieren beschleunigt die LLM-Token-Generierung ohne Ergebnisänderung: Ein Draft-Modell schlägt Tokens vor, das große Modell prüft sie in einem Forward-Pass. Die entscheidende Frage: memory-bound (bis ~2x Gewinn) oder compute-bound (kaum Gewinn)?
vor 3 Tagen