Davidmg0815 commited on
Commit
fe3fffe
·
verified ·
1 Parent(s): 0794b44

Upload README.md with huggingface_hub

Browse files
Files changed (1) hide show
  1. README.md +11 -6
README.md CHANGED
@@ -320,12 +320,17 @@ es erst ab SM 8.9. Qwens FP8-Release lässt sich dort nur dequantisiert fahren
320
  Speicher gespart, Tempo nicht. Für GGUF ist das gegenstandslos, weil `Q8_0` und
321
  `Q6_K` reine Integer-Formate mit nativen Ampere-Kernen sind.
322
 
323
- **vLLM scheitert hier an drei GPUs.** Das Modell hat 24 Attention-Heads, aber
324
- nur **4 KV-Heads**. vLLM verlangt, dass `tensor_parallel_size` die KV-Head-Zahl
325
- teilt — 4 durch 3 geht nicht auf. Bleiben TP=2 und damit eine ungenutzte Karte.
326
- llama.cpp kennt das Problem nicht, weil `--tensor-split` Layer verteilt statt
327
- Attention-Köpfe. **Für ungerade GPU-Zahlen ist llama.cpp hier der einzige Weg,
328
- alle Karten zu nutzen.**
 
 
 
 
 
329
 
330
  ## Reproduzieren
331
 
 
320
  Speicher gespart, Tempo nicht. Für GGUF ist das gegenstandslos, weil `Q8_0` und
321
  `Q6_K` reine Integer-Formate mit nativen Ampere-Kernen sind.
322
 
323
+ **vLLM und drei GPUs: Tensor-Parallelität geht nicht, Pipeline-Parallelität
324
+ schon.** Das Modell hat 24 Attention-Heads, aber nur **4 KV-Heads**, und
325
+ `tensor_parallel_size` muss die Head-Zahl teilen — 4 durch 3 geht nicht auf.
326
+ Für TP bleibt also TP=2 und eine ungenutzte Karte.
327
+
328
+ > **Korrektur, 16.08.2026.** Eine frühere Fassung schloss daraus, llama.cpp sei
329
+ > bei ungeraden GPU-Zahlen »der einzige Weg, alle Karten zu nutzen«. Das ist
330
+ > falsch: **`pipeline_parallel_size` kennt diese Beschränkung nicht.** Pipeline-
331
+ > Parallelität teilt Layer statt Attention-Köpfe und erlaubt sogar ungleiche
332
+ > Aufteilungen — dasselbe Prinzip wie `--tensor-split` in llama.cpp. Mit
333
+ > `--pipeline-parallel-size 3` nutzt vLLM alle drei Karten.
334
 
335
  ## Reproduzieren
336