---
type: "GlossaryTerm"
title: "SWE-bench Verified"
description: "Ein Benchmark, der KI-Modelle beim eigenständigen Lösen echter GitHub-Issues testet. Die Verified-Variante nutzt menschlich validierte Aufgaben für verlässliche"
resource: "https://www.contextstudios.ai/de/glossar/swe-bench-verified"
language: "de"
tags: ["tech"]
generated:
  by: "process:contextstudios-md/1"
  at: "2026-10-08T22:04:23.447Z"
status: "stable"
---

# SWE-bench Verified

Ein Benchmark, der KI-Modelle beim eigenständigen Lösen echter GitHub-Issues testet. Die Verified-Variante nutzt menschlich validierte Aufgaben für verlässliche Bewertungen. Claude Sonnet 4.6 erreicht 79,6 %.
