From 91aa3ed51b709be6457e12d00300a6a596d4c6a3 Mon Sep 17 00:00:00 2001 From: Ofir Press Date: Fri, 27 Feb 2026 20:36:38 +0000 Subject: [PATCH] Update eval.yaml (#4) - Update eval.yaml (f969e1b0b82b7791849e2aa8331931061c574b32) Co-authored-by: Nathan Habib --- eval.yaml | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/eval.yaml b/eval.yaml index d3ae551..decd979 100644 --- a/eval.yaml +++ b/eval.yaml @@ -1,6 +1,6 @@ name: SWE-Bench Verified description: SWE-bench Verified is a curated, human-annotated subset of 500 issues from the original SWE-bench, designed to accurately evaluate AI models on real-world software engineering tasks. It fixes issues in the original dataset by ensuring all tasks are solvable, well-defined, and properly tested by human developers. -evaluation_framework: swe-bench-verified +evaluation_framework: swe-bench tasks: - id: swe_bench_%_resolved