Benchmark-Qwen-Ref: v0.21.15
End-to-end 1 SWE + 1 Terminal-Bench smoke for release-trigger, DSW Harbor execution, and GitHub Release result writeback validation.
SWE-bench Verified
- Status: SUCCEEDED
- Dataset:
swe-bench/swe-bench-verified@2; 1/1 completed - Results: 1 resolved, 0 unresolved, 0 execution errors, 0 infrastructure failures
- Score: 100.00%
- Score denominator: valid grader results (1 + 0 = 1)
- Qwen Code:
v0.21.15(5dce2515a778); modelqwen3.7-plus - Run:
pool-c4930429cc6a43ab; dispatch workflow: https://github.com/QwenLM/qwen-code/actions/runs/32440537429 - Case trajectories:
swe-bench-verified-dsw-eas-tb-smoke-20260821-r1-trajectories.tar.gz(1 cases)
Terminal-Bench 2.0
- Status: SUCCEEDED
- Dataset:
terminal-bench@2.0; 1/1 completed - Results: 1 resolved, 0 unresolved, 0 execution errors, 0 infrastructure failures
- Score: 100.00%
- Score denominator: valid grader results (1 + 0 = 1)
- Qwen Code:
v0.21.15(5dce2515a778); modelqwen3.7-plus - Run:
pool-4a4de70d009f494e; dispatch workflow: https://github.com/QwenLM/qwen-code/actions/runs/32440537429 - Case trajectories:
terminal-bench-2.0-dsw-eas-tb-smoke-20260821-r1-trajectories.tar.gz(1 cases)