Output: /home/benbi/models/gemma4_deckard_davidau_gguf/evals/deckard_5060ti_probe_20260429_125554 GPU: GPU-d21e6aeb-f57e-c98c-ad53-f39cb446b4b7 == llama-bench f16 KV small-context kernel probe == prompt_tok_s=5558.544 kv=f16/f16 prompt=1024 gen=0 decode_tok_s=105.795 kv=f16/f16 prompt=0 gen=256 == live-style 120k f32 KV server probe == server_ready=yes 972609, /home/benbi/llama.cpp/build/bin/llama-server, GPU-d21e6aeb-f57e-c98c-ad53-f39cb446b4b7, 7796 prompt_n=1352 prompt_ms=480.019 prompt_per_second=2816.555178024203 predicted_n=256 predicted_ms=3481.02 predicted_per_second=73.54166307576514 == server VRAM/KV log lines == load_tensors: offloaded 43/43 layers to GPU load_tensors: CUDA0 model buffer size = 2775.92 MiB llama_kv_cache_iswa: creating non-SWA KV cache, size = 120064 cells llama_kv_cache: CUDA0 KV buffer size = 3752.00 MiB llama_kv_cache_iswa: creating SWA KV cache, size = 768 cells llama_kv_cache: CUDA0 KV buffer size = 60.00 MiB sched_reserve: CUDA0 compute buffer size = 572.00 MiB sched_reserve: CUDA_Host compute buffer size = 66.76 MiB finished