Agentic Infrastructure

Model Residency (residente Modellparameter)

Model Residency beschreibt, welcher Anteil eines KI-Modells während der Inferenz dauerhaft im Arbeitsspeicher einer GPU, eines Servers oder einer anderen Laufzeitumgebung gehalten werden muss. Der Begriff ist wichtig, weil moderne Modelle nicht nur nach der Zahl der aktiv genutzten Parameter bewertet werden können. Ein Mixture-of-Experts-Modell kann pro Token nur einen kleinen Teil seiner Experten aktivieren und trotzdem sehr viele Gewichte resident halten müssen. Diese residenten Gewichte bestimmen, wie viel Speicher ein Deployment braucht, wie viele Modelle parallel betrieben werden können und ob ein System lokal, in einer privaten Cloud oder nur auf sehr großer Spezialhardware sinnvoll läuft. Model Residency trennt damit Rechenlast von Speicherlast. Für Planung und Betrieb heißt das: Ein scheinbar günstiges Modell kann teuer werden, wenn seine Gewichte ständig vorgehalten werden müssen, während ein größeres Modell mit sparsamer Aktivierung unter bestimmten Lastprofilen effizienter sein kann. Der Begriff hilft Teams, Inferenzarchitektur nicht nur über Benchmark-Scores, sondern über reale Kapazitätsgrenzen zu beurteilen.

Im Detail: Model Residency (residente Modellparameter)

Model Residency beschreibt, welcher Anteil eines KI-Modells während der Inferenz dauerhaft im Arbeitsspeicher einer GPU, eines Servers oder einer anderen Laufzeitumgebung gehalten werden muss. Der Begriff ist wichtig, weil moderne Modelle nicht nur nach der Zahl der aktiv genutzten Parameter bewertet werden können. Ein Mixture-of-Experts-Modell kann pro Token nur einen kleinen Teil seiner Experten aktivieren und trotzdem sehr viele Gewichte resident halten müssen. Diese residenten Gewichte bestimmen, wie viel Speicher ein Deployment braucht, wie viele Modelle parallel betrieben werden können und ob ein System lokal, in einer privaten Cloud oder nur auf sehr großer Spezialhardware sinnvoll läuft. Model Residency trennt damit Rechenlast von Speicherlast. Für Planung und Betrieb heißt das: Ein scheinbar günstiges Modell kann teuer werden, wenn seine Gewichte ständig vorgehalten werden müssen, während ein größeres Modell mit sparsamer Aktivierung unter bestimmten Lastprofilen effizienter sein kann. Der Begriff hilft Teams, Inferenzarchitektur nicht nur über Benchmark-Scores, sondern über reale Kapazitätsgrenzen zu beurteilen.

Implementierungsdetails

  • Tech-Stack
  • Produktionsreife Leitplanken