Benchmark-Qwen-Ref: v0.21.14
Regression smoke: 1 SWE + 1 previously successful Terminal-Bench task.
SWE-bench Verified
- Status: SUCCEEDED
- Dataset:
swe-bench/swe-bench-verified@2; 1/1 completed - Results: 1 resolved, 0 unresolved, 0 execution errors, 0 infrastructure failures
- Score: 100.00%
- Score denominator: valid grader results (1 + 0 = 1)
- Qwen Code:
v0.21.14(6e20a58923b0); modelqwen3.7-plus - Run:
pool-e1c32affd937493e; dispatch workflow: https://github.com/QwenLM/qwen-code/actions/runs/32368602733 - Case trajectories:
swe-bench-verified-dsw-eas-manual-smoke-20260820-r2-trajectories.tar.gz(1 cases)
Terminal-Bench 2.0
- Status: SUCCEEDED
- Dataset:
terminal-bench@2.0; 1/1 completed - Results: 1 resolved, 0 unresolved, 0 execution errors, 0 infrastructure failures
- Score: 100.00%
- Score denominator: valid grader results (1 + 0 = 1)
- Qwen Code:
v0.21.14(6e20a58923b0); modelqwen3.7-plus - Run:
pool-e2667ea6c4664284; dispatch workflow: https://github.com/QwenLM/qwen-code/actions/runs/32368602733 - Case trajectories:
terminal-bench-2.0-dsw-eas-manual-smoke-20260820-r2-trajectories.tar.gz(1 cases)