Agenti AIARC-AGI-3 misurava l'harness, non solo il modelloDue impostazioni API hanno portato GPT-5.6 Sol dal 13,3 % al 38,3 % su ARC-AGI-3, senza toccare i pesi. Perché a decidere il punteggio è l'harness, non il modello.11 giorni fa