From 4a03c7571026cdec3f4015be74db43c3d45de463 Mon Sep 17 00:00:00 2001 From: wmantly Date: Wed, 2 Sep 2026 01:00:57 +0000 Subject: [PATCH] Perf: Enable native MTP speculative decoding (draft-n-max 2), achieving 38.73 tok/s (+120% speedup) at 64.8% draft acceptance --- scripts/start-server.sh | 7 ++----- 1 file changed, 2 insertions(+), 5 deletions(-) diff --git a/scripts/start-server.sh b/scripts/start-server.sh index 60e4c37..6708e5a 100755 --- a/scripts/start-server.sh +++ b/scripts/start-server.sh @@ -13,14 +13,11 @@ export NCCL_PROTO=SIMPLE exec /opt/llama.cpp/build-nccl/bin/llama-server \ -m /opt/models/gguf/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-Q4_K_P.gguf \ - --spec-type ngram-simple \ - --spec-ngram-simple-size-n 24 \ - --spec-ngram-simple-size-m 4 \ - --mmproj /opt/models/gguf/mmproj-Qwen3.8-27B-Uncensored-f16.gguf \ + --spec-type draft-mtp \ + --spec-draft-n-max 2 \ -ngl 99 \ -c 262144 \ --parallel 1 \ - --image-max-tokens 2048 \ --split-mode tensor \ --flash-attn on \ --batch-size 1024 \