Gemma-4-26B-A4B-it-Uncensored (NVFP4)
Up to 4.3× faster decode · 2.5× average vs stock vanilla vLLM
Single-stream decode (tok/s, c=1) on DGX Spark GB10 / sm_121a · stock vanilla vLLM vs AEON-optimized (DFlash)
0
59
119
179
238
49
156
3.2×
Coding
49
128
2.6×
Math
49
119
2.4×
Reasoning
49
50
1.0×
Prose
49
67
1.4×
Natural language
47
202
4.3×
Extraction/JSON
Stock vanilla vLLM (no DFlash, no opts)
AEON aeon-vllm-ultimate:latest (DFlash)
× = speedup · stock provisional, pending vanilla re-benchmark