LLMs
DeepSeek-V4-Flash passt, weil die Experten in 4 Bit liegen
DeepSeek-V4-Flash aktiviert 13 Mrd. Parameter pro Token, resident sind 284 Mrd. Die Experten liegen in FP4 – das bestimmt fast die gesamte Speicherrechnung.
vor 19 Tagen
Alle Artikel zum Thema Llm Ops
DeepSeek-V4-Flash aktiviert 13 Mrd. Parameter pro Token, resident sind 284 Mrd. Die Experten liegen in FP4 – das bestimmt fast die gesamte Speicherrechnung.
Zwei API-Einstellungen hoben GPT-5.6 Sol bei ARC-AGI-3 von 13,3 % auf 38,3 % — ohne neue Gewichte. Warum das Harness und nicht das Modell den Score bestimmt.
GPT-5.6 Pro ist nicht angekündigt, jede Spezifikation ist ein Leck. Eine Checkliste, die jeden Spitzenmodell-Start zum Nicht-Ereignis macht: Kennungen fixieren, Auswertungen einfrieren, Kosten deckeln, Rückfall benennen.