Benchmark-Qwen-Ref: v0.21.13
1 SWE-bench Verified + 1 Terminal-Bench 2.0 end-to-end release smoke.
SWE-bench Verified
- Status: SUCCEEDED
- Dataset:
swe-bench/swe-bench-verified@2; 1/1 completed - Results: 0 resolved, 0 unresolved, 0 execution errors, 1 infrastructure failures
- Score: not published (non-scoreable or quarantined run)
- Score denominator: valid grader results (0 + 0 = 0)
- Qwen Code:
v0.21.13(d95901597430); modelqwen3.7-plus - Run:
pool-8847756066a14ab6; dispatch workflow: https://github.com/QwenLM/qwen-code/actions/runs/32001837895 - Case trajectories:
swe-bench-verified-dsw-eas-tb-smoke-20260817-r1-trajectories.tar.gz(0 cases)
Terminal-Bench 2.0
- Status: QUARANTINED
- Dataset:
terminal-bench@2.0; 0/1 completed - Results: 0 resolved, 0 unresolved, 0 execution errors, 0 infrastructure failures
- Score: not published (non-scoreable or quarantined run)
- Score denominator: valid grader results (0 + 0 = 0)
- Qwen Code:
v0.21.13(d95901597430); modelqwen3.7-plus - Run:
pool-1119966a366f4683; dispatch workflow: https://github.com/QwenLM/qwen-code/actions/runs/32001837895 - Case trajectories:
terminal-bench-2.0-dsw-eas-tb-smoke-20260817-r1-trajectories.tar.gz(0 cases)