Davidmg0815 commited on
Commit
7fd1d8c
·
verified ·
1 Parent(s): 668cfda

Upload README.md with huggingface_hub

Browse files
Files changed (1) hide show
  1. README.md +49 -0
README.md CHANGED
@@ -262,6 +262,55 @@ unverändert weiter) erbt `supports_mtp_export = True` über
262
  Quelle: `Qwen/Qwen3.8-27B` in **BF16** (51,3 GB, 16,00 BPW), nicht das
263
  FP8-Release — also **keine** doppelte Quantisierung.
264
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
265
  ## Kontextlänge und KV-Cache — ab 48 GB hört die Abwägung auf
266
 
267
  Auf kleineren Karten zwingt der KV-Cache zu einer Entscheidung: weniger Bits
 
262
  Quelle: `Qwen/Qwen3.8-27B` in **BF16** (51,3 GB, 16,00 BPW), nicht das
263
  FP8-Release — also **keine** doppelte Quantisierung.
264
 
265
+ ## MATH-500 — derselbe Befund, anderes Fach
266
+
267
+ HumanEval+ trennte die Varianten nicht. Mathematik ist der härtere Test, weil
268
+ die Aufgaben nach Schwierigkeit gestuft sind und ein einzelner Rechenfehler die
269
+ Antwort kippt. Gemessen wurden 150 Aufgaben je Variante, gleichmäßig über den
270
+ Datensatz gegriffen (MATH-500 ist nach Thema sortiert, die ersten 150 wären fast
271
+ nur Precalculus).
272
+
273
+ ![MATH-500 je Variante](bench/mathe-hell.png)
274
+
275
+ | Variante | streng gewertet | nur abgeschlossene Antworten | abgeschnitten | Token/s |
276
+ |---|---|---|---|---|
277
+ | Qwen3.8-27B BF16 | 77,3 % | 97,5 % | 31 von 150 | 10,8 |
278
+ | Qwen3.8-27B Q6_K | 76,7 % | 97,5 % | 32 von 150 | 22,4 |
279
+ | Qwen3.6-27B Q6_K | 76,0 % | 97,4 % | 33 von 150 | 22,0 |
280
+ | Qwen3.8-27B Q8_0 | 76,0 % | 98,3 % | 34 von 150 | 18,6 |
281
+
282
+ **Die Spanne beträgt 1,3 Prozentpunkte — zwei Aufgaben von 150.** Bei einem
283
+ Konfidenzintervall von ±6,7 Punkten ist zwischen den Varianten kein Unterschied
284
+ nachweisbar. Dasselbe Bild wie bei Code, jetzt in einem zweiten Fach bestätigt:
285
+ **auch die unquantisierte BF16 mit 51 GB liegt gleichauf mit einem 21-GB-Q6_K,
286
+ läuft dabei aber halb so schnell.**
287
+
288
+ > **Warum zwei Spalten?** Rund ein Fünftel der Antworten lief in das
289
+ > Token-Budget von 1.600 und enthielt deshalb kein Ergebnis. Streng gewertet
290
+ > zählen sie als falsch; die zweite Spalte lässt sie weg. Beide Zahlen sind
291
+ > verzerrt — die erste nach unten, die zweite nach oben, weil überwiegend die
292
+ > schweren Aufgaben abbrachen. Die belastbare Zahl liegt dazwischen und wird
293
+ > nachgemessen. **Der vollständige Messvorgang samt aller gefundenen Fehler ist
294
+ > in [METHODIK.md](METHODIK.md) protokolliert** — inklusive der Korrektur, die
295
+ > allein durch einen zu strengen Antwortvergleich vier bis fünf Prozentpunkte
296
+ > gekostet hatte.
297
+
298
+ ### Was der Benchmark sehr wohl zeigt
299
+
300
+ ![MATH-500 nach Schwierigkeitsstufe](bench/mathe-stufen-hell.png)
301
+
302
+ Über die Schwierigkeitsstufen trennt MATH-500 sauber: von knapp 90 Prozent auf
303
+ Stufe 1 bis gut die Hälfte auf Stufe 5 (Wettbewerbsniveau). Der Test
304
+ funktioniert also — er findet zwischen *diesen* Varianten nur nichts, weil dort
305
+ nichts zu finden ist.
306
+
307
+ > **Diese Werte sind zu niedrig und nicht mit publizierten MATH-500-Zahlen
308
+ > vergleichbar.** Rund ein Viertel der Antworten lief ins Token-Limit von 1.600
309
+ > und zählt als falsch, weil das abschließende `\boxed{}` nie kam. Gemessen
310
+ > wurde damit teilweise, ob der Rechenweg ins Budget passt — nicht, ob das
311
+ > Modell rechnen kann. Für den Vergleich *untereinander* ist das
312
+ > unproblematisch, weil alle Varianten dasselbe Limit bekommen.
313
+
314
  ## Kontextlänge und KV-Cache — ab 48 GB hört die Abwägung auf
315
 
316
  Auf kleineren Karten zwingt der KV-Cache zu einer Entscheidung: weniger Bits