1bit.MONSTERDocs GitHub ↗

Falcon — TII Dense (Parallel Attention)

TII's Falcon3 — parallel attention+FFN architecture with multi-query attention (MQA). Broad size range, GGUF on all GPU backends and CPU.

Models

Model Params 1BP Size Backend(s) Perf
Falcon3-1B 1B 675 MB GGML-Vulkan / ZINC / NPU / HIP
Falcon3-3B 3B 1.4 GB GGML-Vulkan / ZINC / NPU / HIP
Falcon3-7B 7B 4.0 GB GGML-Vulkan / ZINC / NPU / HIP
Falcon3-10B 10B 5.7 GB GGML-Vulkan / ZINC / NPU / HIP

Notes

See also: full model support detail · benchmarks SSOT · all families