jackasda211233 commited on
Commit
41ae095
·
verified ·
1 Parent(s): 180de2a

Add 5090 runtime probe summary

Browse files
docs/deckard_5090_f32_server_probe_20260429_124630_summary.txt ADDED
@@ -0,0 +1,23 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ Source: /home/benbi/models/gemma4_deckard_davidau_gguf/evals/deckard_f32_server_compare_20260429_124630/baseline.summary
2
+ Model: /home/benbi/models/gemma4_deckard_davidau_gguf/gemma4-deckard-davidau-IQ4_NL.imatrix_creative_voice_logic_english_v1.attnQ8_last6.gguf
3
+ Runtime: standard llama.cpp b8763 server
4
+ GPU: NVIDIA GeForce RTX 5090
5
+ Context / KV: -c 120000, f32 K/V, KV offload enabled
6
+ Layers: 43/43 offloaded to GPU
7
+
8
+ Timing:
9
+ prompt_n: 1122
10
+ prompt_ms: 263.88
11
+ prompt_per_second: 4251.932696680309
12
+ predicted_n: 40
13
+ predicted_ms: 288.136
14
+ predicted_per_second: 138.82333342588223
15
+
16
+ Memory breakdown:
17
+ CUDA0 self allocation: 7159 MiB
18
+ model buffer: 2775 MiB
19
+ context buffer: 3812 MiB
20
+ compute buffer: 572 MiB
21
+
22
+ Note:
23
+ This was a short live-style server request and stopped at EOS after 40 generated tokens.