Benchmark-Qwen-Ref: v0.21.14
1 SWE + 1 Terminal-Bench smoke for ACR Python base-image mapping.
SWE-bench Verified
- Status: SUCCEEDED
- Dataset:
swe-bench/swe-bench-verified@2; 1/1 completed - Results: 1 resolved, 0 unresolved, 0 execution errors, 0 infrastructure failures
- Score: 100.00%
- Score denominator: valid grader results (1 + 0 = 1)
- Qwen Code:
v0.21.14(6e20a58923b0); modelqwen3.7-plus - Run:
pool-6dcaf46752d04ea7; dispatch workflow: https://github.com/QwenLM/qwen-code/actions/runs/32365807498 - Case trajectories:
swe-bench-verified-dsw-eas-manual-smoke-20260820-r1-trajectories.tar.gz(1 cases)