Qwen3.8-27B-MTP-GGUF / bench /test_fa_quants.sh
Davidmg0815's picture
Upload bench/test_fa_quants.sh with huggingface_hub
c4bfc1e verified
Raw
History Blame
2.17 kB
#!/usr/bin/env bash
# Prueft, ob unser llama.cpp-Build von GitHub-Issue #24485 betroffen ist:
# quantisierter KV-Cache + Flash-Attention fallen ohne GGML_CUDA_FA_ALL_QUANTS
# STILL auf CPU-Attention zurueck. Symptom laut Issue: 25-45x langsamerer
# Prefill, GPU bei 0 Prozent, keine Warnung.
#
# Messgroesse ist die Prompt-Rate (prompt_per_second) bei einem langen Prompt —
# genau dort schlaegt der Unterschied durch, nicht bei der Token-Erzeugung.
set -uo pipefail
PREP=/mnt/models/qwen38-prep
BIN=/mnt/models/bin/llama-server
M=/mnt/models/PropellerA-models/qwen3.8-27b-Q8_0.gguf
PORT=8291
ERG=$PREP/fa-test
mkdir -p "$ERG"
echo $$ > "$PREP/.runner.pid"
trap 'rm -f "$PREP/.runner.pid"' EXIT
stop() {
for pid in $(pgrep -x llama-server 2>/dev/null); do kill -TERM "$pid" 2>/dev/null; done
for i in $(seq 1 25); do pgrep -x llama-server >/dev/null 2>&1 || break; sleep 1; done
for pid in $(pgrep -x llama-server 2>/dev/null); do kill -9 "$pid" 2>/dev/null; done
sleep 3
}
warte() {
for i in $(seq 1 200); do
curl -s -m 3 "http://127.0.0.1:$PORT/health" 2>/dev/null | grep -q ok && return 0
sleep 2
done
return 1
}
# $1 = Kurzname, $2/$3 = cache-type-k/v, $4 = flash-attn on|off
mess() {
local kurz="$1" ck="$2" cv="$3" fa="$4"
echo
echo "### $kurz (KV $ck/$cv, flash-attn $fa)"
stop
nohup "$BIN" -m "$M" --host 127.0.0.1 --port "$PORT" \
--ctx-size 16384 --parallel 1 --n-gpu-layers 99 --tensor-split 1,1,1 \
--cache-type-k "$ck" --cache-type-v "$cv" --flash-attn "$fa" --jinja \
> "$ERG/server-$kurz.log" 2>&1 &
if ! warte; then
echo " SERVER KAM NICHT HOCH"
grep -iE "error|failed|not supported|unsupported" "$ERG/server-$kurz.log" | tail -4
stop; return 1
fi
# Warnungen des Servers zu Flash-Attention festhalten.
grep -iE "flash|fattn|attention" "$ERG/server-$kurz.log" | tail -3 | sed 's/^/ LOG: /'
/mnt/models/skinnyJoe-venv/bin/python "$PREP/fa_probe.py" "$PORT" "$kurz" \
| tee -a "$ERG/ergebnis.txt"
stop
}
: > "$ERG/ergebnis.txt"
echo "=== Flash-Attention x quantisierter KV-Cache ==="
mess "q8_0-fa-on" q8_0 q8_0 on
mess "f16-fa-on" f16 f16 on
mess "q8_0-fa-off" q8_0 q8_0 off
echo
echo "=== Zusammenfassung ==="
cat "$ERG/ergebnis.txt"