Qwen 3.8 27B Q4 with 100K context on a 16 GB RX 7800 XT guide
I'm running Qwen 3.8 27B Q4 XS with ~30 t/s decode (no MTP) at 100k context with q8/q5 KV cache on a 16GB AMD GPU. I wanted to share my setup since many believe Qwen 3.8 27B to be infeasible on 16GB VRAM. Build llama.cpp with Vulkan: cmake -B build -DGGML_VULKAN=ON && cmake --build build --config R…
Read the full story at r/LocalLLaMA ↗
Timeline · 1 report
- 2026-09-29 11:18 · r/LocalLLaMA
Qwen 3.8 27B Q4 with 100K context on a 16 GB RX 7800 XT guide