share how i optimize in my 8G VRAM

#23
by TAOTAO777 - opened

$model = "D:\model\Qwen3.8-27B-Cold-Fusion-Q4_K_M.gguf"
$tpl = "D:\AI_Girlfriend\llama-server\chat_template.jinja"
Start-Process -FilePath $exe -ArgumentList @(
"-m", $model,
"-c", "100000",
"--flash-attn", "on",
"--temp", "0.6",
"--top-p", "0.95",
"--top-k", "40",
"--min-p", "0.01",
"--repeat-penalty", "1.02",
"--presence-penalty", "0.0"
"-ctk", "q4_0", "-ctv", "q4_0",
"--batch-size", "600",
"--ubatch-size", "300",
"--threads", "24",
"--api-key", "123456",
"-rea", "on",
"--jinja",
"--cache-ram", "4000",
"--parallel", "1",
"--kv-unified",
"--no-warmup",
"--spec-type", "draft-mtp",
"--spec-draft-n-max", "5",
"--spec-draft-p-min", "0.84",
"--chat-template-file", $tpl,
"--load-mode", "none",
"--reasoning-preserve",
"--spec-draft-ngl", "99",
"--reasoning-format", "deepseek",
"--chat-template-kwargs", '{"reasoning_effort":"low"}',
"-ngl", "12"
)

decode 4.0–5.07 t/s,323 tokens think 3.92 t/s,
draft acceptance 0.86–1.00,mean len 3.16–5.25(n-max=5),

graphs reused 300–500+
LCP similarity 0.99+
VRAM 7.6/8.0,RAM 24.5/31.6

TAOTAO777 changed discussion title from share how i optimize i my 8G VRAM to share how i optimize in my 8G VRAM

Sign up or log in to comment