KI-AgentenARC-AGI-3 hat das Harness gemessen, nicht nur das ModellZwei API-Einstellungen hoben GPT-5.6 Sol bei ARC-AGI-3 von 13,3 % auf 38,3 % — ohne neue Gewichte. Warum das Harness und nicht das Modell den Score bestimmt.vor 11 Tagen