KI-Agenten
Mythos bei 92,1 %: Die KI, die einfach mehr Zeit braucht
Claude Mythos Preview erreicht 92,1 % auf Terminal-Bench 2.1 mit 4-Stunden-Timeout. Was dieser Anstieg über KI-Evaluierung aussagt — und was das für Enterprise-Teams bedeutet.
vor 4 Monaten