File size: 2,166 Bytes
c4bfc1e
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
#!/usr/bin/env bash
# Prueft, ob unser llama.cpp-Build von GitHub-Issue #24485 betroffen ist:
# quantisierter KV-Cache + Flash-Attention fallen ohne GGML_CUDA_FA_ALL_QUANTS
# STILL auf CPU-Attention zurueck. Symptom laut Issue: 25-45x langsamerer
# Prefill, GPU bei 0 Prozent, keine Warnung.
#
# Messgroesse ist die Prompt-Rate (prompt_per_second) bei einem langen Prompt —
# genau dort schlaegt der Unterschied durch, nicht bei der Token-Erzeugung.
set -uo pipefail

PREP=/mnt/models/qwen38-prep
BIN=/mnt/models/bin/llama-server
M=/mnt/models/PropellerA-models/qwen3.8-27b-Q8_0.gguf
PORT=8291
ERG=$PREP/fa-test
mkdir -p "$ERG"
echo $$ > "$PREP/.runner.pid"
trap 'rm -f "$PREP/.runner.pid"' EXIT

stop() {
for pid in $(pgrep -x llama-server 2>/dev/null); do kill -TERM "$pid" 2>/dev/null; done
for i in $(seq 1 25); do pgrep -x llama-server >/dev/null 2>&1 || break; sleep 1; done
for pid in $(pgrep -x llama-server 2>/dev/null); do kill -9 "$pid" 2>/dev/null; done
sleep 3
}

warte() {
for i in $(seq 1 200); do
curl -s -m 3 "http://127.0.0.1:$PORT/health" 2>/dev/null | grep -q ok && return 0
sleep 2
done
return 1
}

# $1 = Kurzname, $2/$3 = cache-type-k/v, $4 = flash-attn on|off
mess() {
local kurz="$1" ck="$2" cv="$3" fa="$4"
echo
echo "### $kurz  (KV $ck/$cv, flash-attn $fa)"
stop
nohup "$BIN" -m "$M" --host 127.0.0.1 --port "$PORT" \
--ctx-size 16384 --parallel 1 --n-gpu-layers 99 --tensor-split 1,1,1 \
--cache-type-k "$ck" --cache-type-v "$cv" --flash-attn "$fa" --jinja \
> "$ERG/server-$kurz.log" 2>&1 &
if ! warte; then
echo "  SERVER KAM NICHT HOCH"
grep -iE "error|failed|not supported|unsupported" "$ERG/server-$kurz.log" | tail -4
stop; return 1
fi
# Warnungen des Servers zu Flash-Attention festhalten.
grep -iE "flash|fattn|attention" "$ERG/server-$kurz.log" | tail -3 | sed 's/^/  LOG: /'

/mnt/models/skinnyJoe-venv/bin/python "$PREP/fa_probe.py" "$PORT" "$kurz" \
| tee -a "$ERG/ergebnis.txt"
stop
}

: > "$ERG/ergebnis.txt"
echo "=== Flash-Attention x quantisierter KV-Cache ==="
mess "q8_0-fa-on"  q8_0 q8_0 on
mess "f16-fa-on"   f16  f16  on
mess "q8_0-fa-off" q8_0 q8_0 off
echo
echo "=== Zusammenfassung ==="
cat "$ERG/ergebnis.txt"