github ROCm/FastFlowLM v0.9.31
πŸš€ FastFlowLM v0.9.31: Long-Context Acceleration

latest releases: v1.0.1, v1.0.0, v0.9.46...
6 months ago

πŸ“¦ What’s New

⚑ Prefill Speed Upgrade (Qwen & Gemma Families)

A new attention engine dramatically accelerates prefill, with larger gains at longer context lengths (especially 16K+).

  • πŸš€ Up to 3.8Γ— faster prefill
    (qwen3:0.6b with a 32K-token prompt)

πŸ“ˆ Prefill Speed @ 32K Prompt (tokens/sec)

Model Before β†’ After Speedup
gemma3:1b 1596 β†’ 1755 1.1Γ—
gemma3:4b 673 β†’ 926 1.4Γ—
medgemma:4b 673 β†’ 926 1.4Γ—
qwen3:0.6b 236 β†’ 1496 3.8Γ—
qwen3:1.7b 225 β†’ 768 3.4Γ—
qwen3:4b 164 β†’ 303 1.9Γ—
qwen3-it:4b 164 β†’ 303 1.9Γ—
qwen3-tk:4b 164 β†’ 303 1.9Γ—
qwen3vl-it:4b 164 β†’ 303 1.9Γ—
qwen3:8b 150 β†’ 260 1.7Γ—
deepseek-r1-0528:8b 150 β†’ 260 1.7Γ—

πŸ–ΌοΈ Note: For qwen3vl-it:4b, image understanding is also faster in this release.


πŸ”— Benchmark Results


πŸ› οΈ Vision Tool Calling (New)


πŸ”§ Client Compatibility Improvements

  • Non-stream mode logic adjusted
  • Improves compatibility with client applications

Don't miss a new FastFlowLM release

NewReleases is sending notifications on new releases.