
benchmarks safetyNew
SWE-Bench
Benchmark evaluating LLMs on resolving real GitHub software issues.
weight 0.0Open SourceLaunched 2026-06-07
💸 No earnings reported yet
What it is
SWE-bench is a benchmark that tests language models on resolving real-world software engineering issues pulled from GitHub repositories. The de facto standard for measuring coding-agent capability.
How AI plugs in
Evaluates models by having them resolve real GitHub issues end-to-end, scoring whether the generated patch passes the repo's own tests.
Alternatives & related tools

Benchmarks & SafetyResearch
Artificial Analysis
New
Independent AI model benchmarking
Frontier Labs

Benchmarks & SafetyResearch
Epoch AI
Research and benchmarks tracking AI progress
Frontier Labs
Benchmarks & SafetyResearch
Apollo Research
New
AI deception and scheming evaluation lab
Frontier Labs
Benchmarks & SafetyResearch
LMArena
New
Crowdsourced human-preference model leaderboard
Frontier Labs
Benchmarks & SafetyResearch
METR
New
Independent frontier-model dangerous-capability evaluator
Frontier Labs
Benchmarks & SafetyResearch
MLCommons
New
Open engineering consortium behind MLPerf and AI safety benchmarks
Frontier Labs
★ Reviews
No reviews yet — be the first.Your rating
