31 juil. 2026
ARC-AGI-3 mesurait le harnais, pas seulement le modèle
(01)Deux réglages d'API ont fait passer GPT-5.6 Sol de 13,3 % à 38,3 % sur ARC-AGI-3, sans toucher aux poids. Pourquoi c'est le harnais, et non le modèle, qui décide d'un score.
benchmarks