Benchmark-Qwen-Ref: v0.21.15
End-to-end full benchmark: SWE-bench Verified 500 followed by Terminal-Bench 2.0 89, including verifier-backed result and trajectory writeback.
SWE-bench Verified
- Status: SUCCEEDED
- Dataset:
swe-bench/swe-bench-verified@2; 500/500 completed - Results: 377 resolved, 118 unresolved, 2 execution errors, 3 infrastructure failures
- Score: 76.16%
- Score denominator: valid grader results (377 + 118 = 495)
- Qwen Code:
v0.21.15(5dce2515a778); modelqwen3.7-plus - Run:
pool-82e3a6633a264530; dispatch workflow: https://github.com/QwenLM/qwen-code/actions/runs/32444619153 - Case trajectories:
swe-bench-verified-dsw-eas-full-20260821-r1-trajectories.tar.gz(498 cases)
Terminal-Bench 2.0
- Status: QUARANTINED
- Dataset:
terminal-bench@2.0; 89/89 completed - Results: 43 resolved, 29 unresolved, 11 execution errors, 6 infrastructure failures
- Score: not published (non-scoreable or quarantined run)
- Score denominator: valid grader results (43 + 29 = 72)
- Qwen Code:
v0.21.15(5dce2515a778); modelqwen3.7-plus - Run:
pool-3abc82f27dca44a7; dispatch workflow: https://github.com/QwenLM/qwen-code/actions/runs/32444619153 - Case trajectories:
terminal-bench-2.0-dsw-eas-full-20260821-r1-trajectories.tar.gz(78 cases)