---
type: "GlossaryTerm"
title: "SWE-bench Verificato"
description: "Un benchmark che testa i modelli di IA nella risoluzione autonoma di problemi reali su GitHub. La variante Verificato utilizza compiti convalidati da esseri uma"
resource: "https://www.contextstudios.ai/it/glossario/swe-bench-verified"
language: "it"
tags: ["tech"]
generated:
  by: "process:contextstudios-md/1"
  at: "2026-10-08T22:06:34.875Z"
status: "stable"
---

# SWE-bench Verificato

Un benchmark che testa i modelli di IA nella risoluzione autonoma di problemi reali su GitHub. La variante Verificato utilizza compiti convalidati da esseri umani per un punteggio affidabile. Claude Sonnet 4.6 ottiene un punteggio del 79,6%.
