Benchmark-Qwen-Ref: v0.21.14
Full end-to-end validation: SWE-bench Verified 500, Release writeback, then Terminal-Bench 2.0 89 and final writeback.
SWE-bench Verified
- Status: SUCCEEDED
- Dataset:
swe-bench/swe-bench-verified@2; 500/500 completed - Results: 378 resolved, 116 unresolved, 3 execution errors, 3 infrastructure failures
- Score: 76.52%
- Score denominator: valid grader results (378 + 116 = 494)
- Qwen Code:
v0.21.14(6e20a58923b0); modelqwen3.7-plus - Run:
pool-e790f9f02eca4d45; dispatch workflow: https://github.com/QwenLM/qwen-code/actions/runs/32280371805 - Case trajectories:
swe-bench-verified-dsw-eas-full-20260820-r1-trajectories.tar.gz(498 cases)