LLMs
DeepSeek-V4-Flash tient parce que ses experts sont en 4 bits
DeepSeek-V4-Flash active 13 Md de paramètres par token mais en garde 284 Md en mémoire. Ses experts sont en FP4, et ce choix fixe presque toute la facture.
il y a 20 jours
Tous les articles sur Llm Ops
DeepSeek-V4-Flash active 13 Md de paramètres par token mais en garde 284 Md en mémoire. Ses experts sont en FP4, et ce choix fixe presque toute la facture.
Deux réglages d'API ont fait passer GPT-5.6 Sol de 13,3 % à 38,3 % sur ARC-AGI-3, sans toucher aux poids. Pourquoi c'est le harnais, et non le modèle, qui décide d'un score.
GPT-5.6 Pro n'est pas annoncé et chaque spécification est une fuite. Une liste pour faire de toute sortie de pointe un non-événement : figer les identifiants, geler les évaluations, plafonner le coût, désigner un repli.