Agents IA
ARC-AGI-3 mesurait le harnais, pas seulement le modèle
Deux réglages d'API ont fait passer GPT-5.6 Sol de 13,3 % à 38,3 % sur ARC-AGI-3, sans toucher aux poids. Pourquoi c'est le harnais, et non le modèle, qui décide d'un score.
il y a 11 jours