#!/usr/bin/env bash # Prueft, ob unser llama.cpp-Build von GitHub-Issue #24485 betroffen ist: # quantisierter KV-Cache + Flash-Attention fallen ohne GGML_CUDA_FA_ALL_QUANTS # STILL auf CPU-Attention zurueck. Symptom laut Issue: 25-45x langsamerer # Prefill, GPU bei 0 Prozent, keine Warnung. # # Messgroesse ist die Prompt-Rate (prompt_per_second) bei einem langen Prompt — # genau dort schlaegt der Unterschied durch, nicht bei der Token-Erzeugung. set -uo pipefail PREP=/mnt/models/qwen38-prep BIN=/mnt/models/bin/llama-server M=/mnt/models/PropellerA-models/qwen3.8-27b-Q8_0.gguf PORT=8291 ERG=$PREP/fa-test mkdir -p "$ERG" echo $$ > "$PREP/.runner.pid" trap 'rm -f "$PREP/.runner.pid"' EXIT stop() { for pid in $(pgrep -x llama-server 2>/dev/null); do kill -TERM "$pid" 2>/dev/null; done for i in $(seq 1 25); do pgrep -x llama-server >/dev/null 2>&1 || break; sleep 1; done for pid in $(pgrep -x llama-server 2>/dev/null); do kill -9 "$pid" 2>/dev/null; done sleep 3 } warte() { for i in $(seq 1 200); do curl -s -m 3 "http://127.0.0.1:$PORT/health" 2>/dev/null | grep -q ok && return 0 sleep 2 done return 1 } # $1 = Kurzname, $2/$3 = cache-type-k/v, $4 = flash-attn on|off mess() { local kurz="$1" ck="$2" cv="$3" fa="$4" echo echo "### $kurz (KV $ck/$cv, flash-attn $fa)" stop nohup "$BIN" -m "$M" --host 127.0.0.1 --port "$PORT" \ --ctx-size 16384 --parallel 1 --n-gpu-layers 99 --tensor-split 1,1,1 \ --cache-type-k "$ck" --cache-type-v "$cv" --flash-attn "$fa" --jinja \ > "$ERG/server-$kurz.log" 2>&1 & if ! warte; then echo " SERVER KAM NICHT HOCH" grep -iE "error|failed|not supported|unsupported" "$ERG/server-$kurz.log" | tail -4 stop; return 1 fi # Warnungen des Servers zu Flash-Attention festhalten. grep -iE "flash|fattn|attention" "$ERG/server-$kurz.log" | tail -3 | sed 's/^/ LOG: /' /mnt/models/skinnyJoe-venv/bin/python "$PREP/fa_probe.py" "$PORT" "$kurz" \ | tee -a "$ERG/ergebnis.txt" stop } : > "$ERG/ergebnis.txt" echo "=== Flash-Attention x quantisierter KV-Cache ===" mess "q8_0-fa-on" q8_0 q8_0 on mess "f16-fa-on" f16 f16 on mess "q8_0-fa-off" q8_0 q8_0 off echo echo "=== Zusammenfassung ===" cat "$ERG/ergebnis.txt"