Davidmg0815 commited on
Commit
dc1f32e
·
verified ·
1 Parent(s): 56026de

Upload README.md with huggingface_hub

Browse files
Files changed (1) hide show
  1. README.md +60 -12
README.md CHANGED
@@ -116,24 +116,68 @@ Fließtext-Dialog liegt bei **rund 1,7×**.
116
  Deutlich mehr als etwa der Gemma-4-12B-Draft mit 0,5 GB. Wer knapp an VRAM ist,
117
  muss das einplanen.
118
 
119
- ## HumanEval+ — was das Modell tatsächlich kann
120
 
121
- **88,4 % (145 von 164)** für `qwen3.8-27b-Q8_0.gguf`, ohne Reasoning, in
122
- 25,6 Minuten. Bewertet wird durch Ausführen: jede gelieferte Funktion läuft
123
- gegen den vollständigen Testblock von EvalPlus, der die HumanEval-Originaltests
124
- um etwa das Achtzigfache erweitert.
125
 
126
- Zur Einordnung, publizierte Werte anderer Modelle:
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
127
 
128
  | Modell | HumanEval+ |
129
  |---|---|
130
  | Phi-4 Reasoning (Microsoft) | 92,9 % |
 
131
  | Llama 3 405B Instruct | 89 % |
132
  | **Qwen3.8-27B Q8_0 — diese Messung** | **88,4 %** |
133
  | Granite 3.3 8B Base | 86,1 % |
134
  | Kimi K2 Base | 80,3 % |
135
 
136
- > **Diese Zahl ist nicht eins zu eins mit den Leaderboards vergleichbar.**
137
  > Drei Abweichungen vom offiziellen EvalPlus-Verfahren: die Aufgabe wird im
138
  > **Chat-Format** gestellt (»Vervollständige diese Funktion«) statt als reine
139
  > Textvervollständigung; **Temperatur 0,2** statt greedy; und der Code wird aus
@@ -141,12 +185,16 @@ Zur Einordnung, publizierte Werte anderer Modelle:
141
  > oben — Chat-Modelle schneiden im Chat-Format besser ab. Wer vergleichen will,
142
  > nimmt die Zahl als Hausmessung, nicht als Leaderboard-Eintrag.
143
 
144
- Das Fehlerbild ist gesund: von 19 Fehlschlägen sind **15 AssertionError**, also
145
- echte Logikfehler. Dazu je ein TypeError, SyntaxError, IndexError und eine
146
- Zeitüberschreitung. Kein Muster, das auf ein kaputtes Testgerüst hindeutet.
 
147
 
148
- Die übrigen Varianten (Q6_K, BF16, die Qwen3.6-Reihe) werden gerade gemessen
149
- und hier nachgetragen.
 
 
 
150
 
151
  ## Durchsatz im Vergleich
152
 
 
116
  Deutlich mehr als etwa der Gemma-4-12B-Draft mit 0,5 GB. Wer knapp an VRAM ist,
117
  muss das einplanen.
118
 
119
+ ## HumanEval+ — sieben Varianten, ein Ergebnis
120
 
121
+ Alle 164 Aufgaben, alle sieben Varianten, identische Bedingungen. Bewertet wird
122
+ durch Ausführen: jede gelieferte Funktion läuft gegen den vollständigen
123
+ EvalPlus-Testblock, der die HumanEval-Originaltests um etwa das Achtzigfache
124
+ erweitert.
125
 
126
+ ![HumanEval+ je Variante](bench/quoten-hell.png)
127
+
128
+ | Variante | bestanden | Quote | Token/s | 95-%-Intervall |
129
+ |---|---|---|---|---|
130
+ | Qwen3.6-27B UD-Q6_K_XL | 149/164 | 90,9 % | 25,1 | ±4,4 |
131
+ | Qwen3.6-27B Uncensored Q6_K_P | 148/164 | 90,2 % | 26,9 | ±4,5 |
132
+ | **Qwen3.8-27B Q6_K** | 148/164 | **90,2 %** | **27,9** | ±4,5 |
133
+ | Qwen3.6-27B Q6_K | 146/164 | 89,0 % | 27,6 | ±4,8 |
134
+ | **Qwen3.8-27B Q8_0** | 145/164 | **88,4 %** | 19,5 | ±4,9 |
135
+ | **Qwen3.8-27B BF16** | 145/164 | **88,4 %** | 13,2 | ±4,9 |
136
+ | Qwen3.6-27B Q5_K_M | 145/164 | 88,4 % | 31,3 | ±4,9 |
137
+
138
+ ### Der eigentliche Befund: die Unterschiede sind keine
139
+
140
+ Die gesamte Spanne beträgt **vier Aufgaben von 164**. Bei ±4,4 bis ±4,9 Punkten
141
+ Konfidenzintervall überlappen alle sieben Bereiche vollständig — **statistisch
142
+ ist keine Variante von einer anderen unterscheidbar.**
143
+
144
+ Noch deutlicher wird es beim Blick auf einzelne Aufgaben:
145
+
146
+ * **135 der 164 Aufgaben lösen alle sieben** Varianten
147
+ * **9 Aufgaben löst keine einzige** (HumanEval/32, 76, 91, 101, 127, 132, 145,
148
+ 154, 163)
149
+ * nur **20 Aufgaben** unterscheiden überhaupt — und dort geht es mal so, mal so
150
+ aus
151
+
152
+ Die scheinbare Rangfolge entsteht ausschließlich aus diesen 20 Wackelkandidaten.
153
+ Wer daraus ein »Modell A ist besser als B« liest, liest Rauschen.
154
+
155
+ ### Was man trotzdem mitnehmen kann
156
+
157
+ **Quantisierung kostet hier nichts.** BF16 (51 GB), Q8_0 (27 GB) und Q5_K_M
158
+ (19 GB) landen alle auf **exakt 145 von 164**. Von 51 auf 19 Gigabyte
159
+ heruntergerechnet — kein messbarer Qualitätsverlust bei Code, aber 13,2 gegen
160
+ 31,3 Token/s. Die unquantisierte Variante ist für diesen Zweck reine
161
+ Verschwendung.
162
+
163
+ **Qwen3.8 schlägt Qwen3.6 bei Code nicht.** Die neue Generation liegt im selben
164
+ Bereich. Wer wegen Code aufrüstet, tut es umsonst; die Verbesserungen liegen
165
+ woanders (Vision, MTP-Kopf, Kontextlänge).
166
+
167
+ ![Tempo gegen Qualität](bench/tempo-hell.png)
168
+
169
+ ### Einordnung gegen publizierte Werte
170
 
171
  | Modell | HumanEval+ |
172
  |---|---|
173
  | Phi-4 Reasoning (Microsoft) | 92,9 % |
174
+ | **Qwen3.8-27B Q6_K — diese Messung** | **90,2 %** |
175
  | Llama 3 405B Instruct | 89 % |
176
  | **Qwen3.8-27B Q8_0 — diese Messung** | **88,4 %** |
177
  | Granite 3.3 8B Base | 86,1 % |
178
  | Kimi K2 Base | 80,3 % |
179
 
180
+ > **Diese Zahlen sind nicht eins zu eins mit den Leaderboards vergleichbar.**
181
  > Drei Abweichungen vom offiziellen EvalPlus-Verfahren: die Aufgabe wird im
182
  > **Chat-Format** gestellt (»Vervollständige diese Funktion«) statt als reine
183
  > Textvervollständigung; **Temperatur 0,2** statt greedy; und der Code wird aus
 
185
  > oben — Chat-Modelle schneiden im Chat-Format besser ab. Wer vergleichen will,
186
  > nimmt die Zahl als Hausmessung, nicht als Leaderboard-Eintrag.
187
 
188
+ Das Fehlerbild ist gesund: bei Q8_0 sind von 19 Fehlschlägen **15
189
+ AssertionError**, also echte Logikfehler. Dazu je ein TypeError, SyntaxError,
190
+ IndexError und eine Zeitüberschreitung kein Muster, das auf ein kaputtes
191
+ Testgerüst hindeutet.
192
 
193
+ Das komplette Messgerüst liegt unter `bench/` samt beider Selbsttests: einer
194
+ prüft das Aufgaben-Harness gegen bekannt richtige *und* bekannt falsche
195
+ Lösungen, der andere die EvalPlus-Ausführung gegen die mitgelieferten
196
+ Referenzlösungen (25/25 grün). Ohne diese Prüfung misst ein Benchmark unter
197
+ Umständen nur die eigenen Denkfehler.
198
 
199
  ## Durchsatz im Vergleich
200