Gemma-4-E4B-Deckard-AttnQ8-IQ4_NL-storyMaker / docs /deckard_5060ti_probe_20260429_125554_summary.txt
jackasda211233's picture
Add model card and validation docs
90f7365 verified
Raw
History Blame
1.12 kB
Output: /home/benbi/models/gemma4_deckard_davidau_gguf/evals/deckard_5060ti_probe_20260429_125554
GPU: GPU-d21e6aeb-f57e-c98c-ad53-f39cb446b4b7
== llama-bench f16 KV small-context kernel probe ==
prompt_tok_s=5558.544 kv=f16/f16 prompt=1024 gen=0
decode_tok_s=105.795 kv=f16/f16 prompt=0 gen=256
== live-style 120k f32 KV server probe ==
server_ready=yes
972609, /home/benbi/llama.cpp/build/bin/llama-server, GPU-d21e6aeb-f57e-c98c-ad53-f39cb446b4b7, 7796
prompt_n=1352
prompt_ms=480.019
prompt_per_second=2816.555178024203
predicted_n=256
predicted_ms=3481.02
predicted_per_second=73.54166307576514
== server VRAM/KV log lines ==
load_tensors: offloaded 43/43 layers to GPU
load_tensors: CUDA0 model buffer size = 2775.92 MiB
llama_kv_cache_iswa: creating non-SWA KV cache, size = 120064 cells
llama_kv_cache: CUDA0 KV buffer size = 3752.00 MiB
llama_kv_cache_iswa: creating SWA KV cache, size = 768 cells
llama_kv_cache: CUDA0 KV buffer size = 60.00 MiB
sched_reserve: CUDA0 compute buffer size = 572.00 MiB
sched_reserve: CUDA_Host compute buffer size = 66.76 MiB
finished