feat: add GLM5Next MTP, optimize by pwilkin · Pull Request #29928 · ggml-org/llama.cpp
now you can use GLM 5 Flash MTP locally
Read the full story at r/LocalLLaMA ↗
Timeline · 3 reports
- 2026-10-08 09:04 · r/LocalLLaMA
ggml-cuda: assign four GDN state columns per warp by SongXiaoXi · Pull Request #30087 · ggml-org/llama.cpp - 2026-10-07 18:15 · r/LocalLLaMA
llama : add a GPU cache for MoE experts kept in host memory by am17an · Pull Request #29887 · ggml-org/llama.cpp - 2026-10-07 12:36 · r/LocalLLaMA
feat: add GLM5Next MTP, optimize by pwilkin · Pull Request #29928 · ggml-org/llama.cpp