1bit.MONSTERDocs GitHub ↗

Qwen — Dense + VL + MoE + Speech

The most versatile ecosystem: dense models from 0.5B to 72B, vision-language variants, a 35B MoE, DeepSeek-distilled derivatives, and Whisper speech-to-text. Strongest on GPU Vulkan (ZINC), with broad NPU coverage via extracted FLM xclbins.

Models

Model Params 1BP Size Backend(s) Perf
Qwen2.5-0.5B 0.5B 328 MB ZINC / NPU / HIP / CPU 423 tok/s Q2_K (Vulkan)
Qwen3-0.6B 0.6B 356 MB GGML-Vulkan / ZINC / NPU / HIP 373 tok/s
Qwen3-4B 4B 2.2 GB ZINC / NPU / HIP
Qwen3-8B 8B 4.1 GB ZINC / NPU / HIP 423 tok/s ZINC
Qwen3.5-4B 4B 2.2 GB GGML-Vulkan / NPU 65 tok/s
Qwen3.6-MoE-35B-A3B 35B (3B active) GGML-Vulkan / NPU 75.65 tok/s (Vulkan), 11.66 tok/s (NPU)
Qwen2-VL-2B 2B 781 MB ZINC (vision)
Qwen2.5-VL-3B 3B GGML-Vulkan / NPU (vision) 100 tok/s
Qwen3-VL-4B 4B 2.2 GB ZINC / NPU (vision)
Qwen2-VL-7B 7B 3.9 GB ZINC (vision)
DeepSeek-R1-Distill-Qwen-7B 7B 3.8 GB ZINC / NPU / HIP
Whisper (speech-to-text) NPU / GPU HIP 🔄

Architectures in this family

NPU FLM coverage

7 Qwen3 xclbin sets (qwen3:0.6bqwen3vl-it:4b), 4 Qwen3.5 sets, plus Qwen3.6-35B. Build any with ./build_xclbins.sh qwen3_0_6b (etc.).

See also: Whisper page · DeepSeek page · full model support detail · benchmarks SSOT · all families