model_info: name: anemll-google-gemma-3-1b-it-ctx4096 version: 0.3.5 description: | Demonstarates running google-gemma-3-1b-it on Apple Neural Engine Context length: 4096 Batch size: 64 Chunks: 1 license: MIT author: Anemll framework: Core ML language: Python architecture: gemma3_text parameters: context_length: 4096 batch_size: 64 lut_embeddings: 6 lut_ffn: 6 lut_lmhead: 6 num_chunks: 1 model_prefix: gemma3 embeddings: gemma3_embeddings_lut6.mlmodelc lm_head: gemma3_lm_head_lut6.mlmodelc ffn: gemma3_FFN_PF_lut6_chunk_01of01.mlmodelc split_lm_head: 16 vocab_size: 262144 lm_head_chunk_sizes: [16384, 16384, 16384, 16384, 16384, 16384, 16384, 16384, 16384, 16384, 16384, 16384, 16384, 16384, 16384, 16384] sliding_window: 512 prefill_dynamic_slice: true # ============================================================================= # Conversion Parameters (for troubleshooting) # ============================================================================= # Generated: 2026-04-19 11:44:03 # # model_path: /Users/optai/.cache/huggingface/hub/models--google--gemma-3-1b-it/snapshots/dcc83ea841ab6100d6b47a070329e1ba4cf78752 # output_dir: /Users/optai/Desktop/npubench/Anemll/gemma3_1b_lut6_ctx4096 # command_line: ./anemll/utils/convert_model.sh --model google/gemma-3-1b-it --output ./gemma3_1b_lut6_ctx4096 --context 4096 --batch 64 --lut1 6 --lut2 6 --lut3 6 --chunk 1 # context_length: 4096 # batch_size: 64 # num_chunks: 1 # lut_part1: 6 # lut_part2: 6 # lut_part3: 6 # prefix: gemma3 # architecture: gemma3_text # argmax_in_model: false # split_rotate: false # sliding_window: 512 # single_cache: false # dynamic_prefill_slice: true # monolithic: false # anemll_version: 0.3.5 # vocab_size: 262144 # lm_head_chunk_sizes: "[16384, 16384, 16384, 16384, 16384, 16384, 16384, 16384, 16384, 16384, 16384, 16384, 16384, 16384, 16384, 16384]" # =============================================================================