diff --git "a/model.safetensors.index.json" "b/model.safetensors.index.json" --- "a/model.safetensors.index.json" +++ "b/model.safetensors.index.json" @@ -1,9 +1,6 @@ { "metadata": { - "total_size": 29500938720, - "total_parameters": 26895993856, - "retained_vision_tensors": 333, - "retained_vision_bytes": 921460192 + "total_size": 29500938720 }, "weight_map": { "language_model.lm_head.biases": "model-00006-of-00006.safetensors", @@ -413,70 +410,70 @@ "language_model.model.layers.20.mlp.gate_proj.biases": "model-00002-of-00006.safetensors", "language_model.model.layers.20.mlp.gate_proj.scales": "model-00002-of-00006.safetensors", "language_model.model.layers.20.mlp.gate_proj.weight": "model-00002-of-00006.safetensors", - "language_model.model.layers.20.mlp.up_proj.biases": "model-00002-of-00006.safetensors", - "language_model.model.layers.20.mlp.up_proj.scales": "model-00002-of-00006.safetensors", - "language_model.model.layers.20.mlp.up_proj.weight": "model-00002-of-00006.safetensors", + "language_model.model.layers.20.mlp.up_proj.biases": "model-00003-of-00006.safetensors", + "language_model.model.layers.20.mlp.up_proj.scales": "model-00003-of-00006.safetensors", + "language_model.model.layers.20.mlp.up_proj.weight": "model-00003-of-00006.safetensors", "language_model.model.layers.20.post_attention_layernorm.weight": "model-00002-of-00006.safetensors", - "language_model.model.layers.21.input_layernorm.weight": "model-00002-of-00006.safetensors", - "language_model.model.layers.21.linear_attn.A_log": "model-00002-of-00006.safetensors", - "language_model.model.layers.21.linear_attn.conv1d.weight": "model-00002-of-00006.safetensors", - "language_model.model.layers.21.linear_attn.dt_bias": "model-00002-of-00006.safetensors", - "language_model.model.layers.21.linear_attn.in_proj_a.biases": "model-00002-of-00006.safetensors", - "language_model.model.layers.21.linear_attn.in_proj_a.scales": "model-00002-of-00006.safetensors", - "language_model.model.layers.21.linear_attn.in_proj_a.weight": "model-00002-of-00006.safetensors", - "language_model.model.layers.21.linear_attn.in_proj_b.biases": "model-00002-of-00006.safetensors", - "language_model.model.layers.21.linear_attn.in_proj_b.scales": "model-00002-of-00006.safetensors", - "language_model.model.layers.21.linear_attn.in_proj_b.weight": "model-00002-of-00006.safetensors", - "language_model.model.layers.21.linear_attn.in_proj_qkv.biases": "model-00002-of-00006.safetensors", - "language_model.model.layers.21.linear_attn.in_proj_qkv.scales": "model-00002-of-00006.safetensors", - "language_model.model.layers.21.linear_attn.in_proj_qkv.weight": "model-00002-of-00006.safetensors", - "language_model.model.layers.21.linear_attn.in_proj_z.biases": "model-00002-of-00006.safetensors", - "language_model.model.layers.21.linear_attn.in_proj_z.scales": "model-00002-of-00006.safetensors", - "language_model.model.layers.21.linear_attn.in_proj_z.weight": "model-00002-of-00006.safetensors", - "language_model.model.layers.21.linear_attn.norm.weight": "model-00002-of-00006.safetensors", - "language_model.model.layers.21.linear_attn.out_proj.biases": "model-00002-of-00006.safetensors", - "language_model.model.layers.21.linear_attn.out_proj.scales": "model-00002-of-00006.safetensors", - "language_model.model.layers.21.linear_attn.out_proj.weight": "model-00002-of-00006.safetensors", - "language_model.model.layers.21.mlp.down_proj.biases": "model-00002-of-00006.safetensors", - "language_model.model.layers.21.mlp.down_proj.scales": "model-00002-of-00006.safetensors", - "language_model.model.layers.21.mlp.down_proj.weight": "model-00002-of-00006.safetensors", - "language_model.model.layers.21.mlp.gate_proj.biases": "model-00002-of-00006.safetensors", - "language_model.model.layers.21.mlp.gate_proj.scales": "model-00002-of-00006.safetensors", - "language_model.model.layers.21.mlp.gate_proj.weight": "model-00002-of-00006.safetensors", - "language_model.model.layers.21.mlp.up_proj.biases": "model-00002-of-00006.safetensors", - "language_model.model.layers.21.mlp.up_proj.scales": "model-00002-of-00006.safetensors", - "language_model.model.layers.21.mlp.up_proj.weight": "model-00002-of-00006.safetensors", - "language_model.model.layers.21.post_attention_layernorm.weight": "model-00002-of-00006.safetensors", - "language_model.model.layers.22.input_layernorm.weight": "model-00002-of-00006.safetensors", - "language_model.model.layers.22.linear_attn.A_log": "model-00002-of-00006.safetensors", - "language_model.model.layers.22.linear_attn.conv1d.weight": "model-00002-of-00006.safetensors", - "language_model.model.layers.22.linear_attn.dt_bias": "model-00002-of-00006.safetensors", - "language_model.model.layers.22.linear_attn.in_proj_a.biases": "model-00002-of-00006.safetensors", - "language_model.model.layers.22.linear_attn.in_proj_a.scales": "model-00002-of-00006.safetensors", - "language_model.model.layers.22.linear_attn.in_proj_a.weight": "model-00002-of-00006.safetensors", - "language_model.model.layers.22.linear_attn.in_proj_b.biases": "model-00002-of-00006.safetensors", - "language_model.model.layers.22.linear_attn.in_proj_b.scales": "model-00002-of-00006.safetensors", - "language_model.model.layers.22.linear_attn.in_proj_b.weight": "model-00002-of-00006.safetensors", - "language_model.model.layers.22.linear_attn.in_proj_qkv.biases": "model-00002-of-00006.safetensors", - "language_model.model.layers.22.linear_attn.in_proj_qkv.scales": "model-00002-of-00006.safetensors", - "language_model.model.layers.22.linear_attn.in_proj_qkv.weight": "model-00002-of-00006.safetensors", - "language_model.model.layers.22.linear_attn.in_proj_z.biases": "model-00002-of-00006.safetensors", - "language_model.model.layers.22.linear_attn.in_proj_z.scales": "model-00002-of-00006.safetensors", - "language_model.model.layers.22.linear_attn.in_proj_z.weight": "model-00002-of-00006.safetensors", - "language_model.model.layers.22.linear_attn.norm.weight": "model-00002-of-00006.safetensors", - "language_model.model.layers.22.linear_attn.out_proj.biases": "model-00002-of-00006.safetensors", - "language_model.model.layers.22.linear_attn.out_proj.scales": "model-00002-of-00006.safetensors", - "language_model.model.layers.22.linear_attn.out_proj.weight": "model-00002-of-00006.safetensors", - "language_model.model.layers.22.mlp.down_proj.biases": "model-00002-of-00006.safetensors", - "language_model.model.layers.22.mlp.down_proj.scales": "model-00002-of-00006.safetensors", - "language_model.model.layers.22.mlp.down_proj.weight": "model-00002-of-00006.safetensors", - "language_model.model.layers.22.mlp.gate_proj.biases": "model-00002-of-00006.safetensors", - "language_model.model.layers.22.mlp.gate_proj.scales": "model-00002-of-00006.safetensors", - "language_model.model.layers.22.mlp.gate_proj.weight": "model-00002-of-00006.safetensors", - "language_model.model.layers.22.mlp.up_proj.biases": "model-00002-of-00006.safetensors", - "language_model.model.layers.22.mlp.up_proj.scales": "model-00002-of-00006.safetensors", - "language_model.model.layers.22.mlp.up_proj.weight": "model-00002-of-00006.safetensors", - "language_model.model.layers.22.post_attention_layernorm.weight": "model-00002-of-00006.safetensors", + "language_model.model.layers.21.input_layernorm.weight": "model-00003-of-00006.safetensors", + "language_model.model.layers.21.linear_attn.A_log": "model-00003-of-00006.safetensors", + "language_model.model.layers.21.linear_attn.conv1d.weight": "model-00003-of-00006.safetensors", + "language_model.model.layers.21.linear_attn.dt_bias": "model-00003-of-00006.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_a.biases": "model-00003-of-00006.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_a.scales": "model-00003-of-00006.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_a.weight": "model-00003-of-00006.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_b.biases": "model-00003-of-00006.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_b.scales": "model-00003-of-00006.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_b.weight": "model-00003-of-00006.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_qkv.biases": "model-00003-of-00006.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_qkv.scales": "model-00003-of-00006.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_qkv.weight": "model-00003-of-00006.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_z.biases": "model-00003-of-00006.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_z.scales": "model-00003-of-00006.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_z.weight": "model-00003-of-00006.safetensors", + "language_model.model.layers.21.linear_attn.norm.weight": "model-00003-of-00006.safetensors", + "language_model.model.layers.21.linear_attn.out_proj.biases": "model-00003-of-00006.safetensors", + "language_model.model.layers.21.linear_attn.out_proj.scales": "model-00003-of-00006.safetensors", + "language_model.model.layers.21.linear_attn.out_proj.weight": "model-00003-of-00006.safetensors", + "language_model.model.layers.21.mlp.down_proj.biases": "model-00003-of-00006.safetensors", + "language_model.model.layers.21.mlp.down_proj.scales": "model-00003-of-00006.safetensors", + "language_model.model.layers.21.mlp.down_proj.weight": "model-00003-of-00006.safetensors", + "language_model.model.layers.21.mlp.gate_proj.biases": "model-00003-of-00006.safetensors", + "language_model.model.layers.21.mlp.gate_proj.scales": "model-00003-of-00006.safetensors", + "language_model.model.layers.21.mlp.gate_proj.weight": "model-00003-of-00006.safetensors", + "language_model.model.layers.21.mlp.up_proj.biases": "model-00003-of-00006.safetensors", + "language_model.model.layers.21.mlp.up_proj.scales": "model-00003-of-00006.safetensors", + "language_model.model.layers.21.mlp.up_proj.weight": "model-00003-of-00006.safetensors", + "language_model.model.layers.21.post_attention_layernorm.weight": "model-00003-of-00006.safetensors", + "language_model.model.layers.22.input_layernorm.weight": "model-00003-of-00006.safetensors", + "language_model.model.layers.22.linear_attn.A_log": "model-00003-of-00006.safetensors", + "language_model.model.layers.22.linear_attn.conv1d.weight": "model-00003-of-00006.safetensors", + "language_model.model.layers.22.linear_attn.dt_bias": "model-00003-of-00006.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_a.biases": "model-00003-of-00006.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_a.scales": "model-00003-of-00006.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_a.weight": "model-00003-of-00006.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_b.biases": "model-00003-of-00006.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_b.scales": "model-00003-of-00006.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_b.weight": "model-00003-of-00006.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_qkv.biases": "model-00003-of-00006.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_qkv.scales": "model-00003-of-00006.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_qkv.weight": "model-00003-of-00006.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_z.biases": "model-00003-of-00006.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_z.scales": "model-00003-of-00006.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_z.weight": "model-00003-of-00006.safetensors", + "language_model.model.layers.22.linear_attn.norm.weight": "model-00003-of-00006.safetensors", + "language_model.model.layers.22.linear_attn.out_proj.biases": "model-00003-of-00006.safetensors", + "language_model.model.layers.22.linear_attn.out_proj.scales": "model-00003-of-00006.safetensors", + "language_model.model.layers.22.linear_attn.out_proj.weight": "model-00003-of-00006.safetensors", + "language_model.model.layers.22.mlp.down_proj.biases": "model-00003-of-00006.safetensors", + "language_model.model.layers.22.mlp.down_proj.scales": "model-00003-of-00006.safetensors", + "language_model.model.layers.22.mlp.down_proj.weight": "model-00003-of-00006.safetensors", + "language_model.model.layers.22.mlp.gate_proj.biases": "model-00003-of-00006.safetensors", + "language_model.model.layers.22.mlp.gate_proj.scales": "model-00003-of-00006.safetensors", + "language_model.model.layers.22.mlp.gate_proj.weight": "model-00003-of-00006.safetensors", + "language_model.model.layers.22.mlp.up_proj.biases": "model-00003-of-00006.safetensors", + "language_model.model.layers.22.mlp.up_proj.scales": "model-00003-of-00006.safetensors", + "language_model.model.layers.22.mlp.up_proj.weight": "model-00003-of-00006.safetensors", + "language_model.model.layers.22.post_attention_layernorm.weight": "model-00003-of-00006.safetensors", "language_model.model.layers.23.input_layernorm.weight": "model-00003-of-00006.safetensors", "language_model.model.layers.23.mlp.down_proj.biases": "model-00003-of-00006.safetensors", "language_model.model.layers.23.mlp.down_proj.scales": "model-00003-of-00006.safetensors", @@ -817,78 +814,78 @@ "language_model.model.layers.33.mlp.up_proj.scales": "model-00003-of-00006.safetensors", "language_model.model.layers.33.mlp.up_proj.weight": "model-00003-of-00006.safetensors", "language_model.model.layers.33.post_attention_layernorm.weight": "model-00003-of-00006.safetensors", - "language_model.model.layers.34.input_layernorm.weight": "model-00003-of-00006.safetensors", - "language_model.model.layers.34.linear_attn.A_log": "model-00003-of-00006.safetensors", + "language_model.model.layers.34.input_layernorm.weight": "model-00004-of-00006.safetensors", + "language_model.model.layers.34.linear_attn.A_log": "model-00004-of-00006.safetensors", "language_model.model.layers.34.linear_attn.conv1d.weight": "model-00003-of-00006.safetensors", - "language_model.model.layers.34.linear_attn.dt_bias": "model-00003-of-00006.safetensors", - "language_model.model.layers.34.linear_attn.in_proj_a.biases": "model-00003-of-00006.safetensors", - "language_model.model.layers.34.linear_attn.in_proj_a.scales": "model-00003-of-00006.safetensors", - "language_model.model.layers.34.linear_attn.in_proj_a.weight": "model-00003-of-00006.safetensors", - "language_model.model.layers.34.linear_attn.in_proj_b.biases": "model-00003-of-00006.safetensors", - "language_model.model.layers.34.linear_attn.in_proj_b.scales": "model-00003-of-00006.safetensors", - "language_model.model.layers.34.linear_attn.in_proj_b.weight": "model-00003-of-00006.safetensors", - "language_model.model.layers.34.linear_attn.in_proj_qkv.biases": "model-00003-of-00006.safetensors", - "language_model.model.layers.34.linear_attn.in_proj_qkv.scales": "model-00003-of-00006.safetensors", - "language_model.model.layers.34.linear_attn.in_proj_qkv.weight": "model-00003-of-00006.safetensors", - "language_model.model.layers.34.linear_attn.in_proj_z.biases": "model-00003-of-00006.safetensors", - "language_model.model.layers.34.linear_attn.in_proj_z.scales": "model-00003-of-00006.safetensors", - "language_model.model.layers.34.linear_attn.in_proj_z.weight": "model-00003-of-00006.safetensors", - "language_model.model.layers.34.linear_attn.norm.weight": "model-00003-of-00006.safetensors", - "language_model.model.layers.34.linear_attn.out_proj.biases": "model-00003-of-00006.safetensors", - "language_model.model.layers.34.linear_attn.out_proj.scales": "model-00003-of-00006.safetensors", - "language_model.model.layers.34.linear_attn.out_proj.weight": "model-00003-of-00006.safetensors", - "language_model.model.layers.34.mlp.down_proj.biases": "model-00003-of-00006.safetensors", - "language_model.model.layers.34.mlp.down_proj.scales": "model-00003-of-00006.safetensors", - "language_model.model.layers.34.mlp.down_proj.weight": "model-00003-of-00006.safetensors", - "language_model.model.layers.34.mlp.gate_proj.biases": "model-00003-of-00006.safetensors", - "language_model.model.layers.34.mlp.gate_proj.scales": "model-00003-of-00006.safetensors", - "language_model.model.layers.34.mlp.gate_proj.weight": "model-00003-of-00006.safetensors", - "language_model.model.layers.34.mlp.up_proj.biases": "model-00003-of-00006.safetensors", - "language_model.model.layers.34.mlp.up_proj.scales": "model-00003-of-00006.safetensors", - "language_model.model.layers.34.mlp.up_proj.weight": "model-00003-of-00006.safetensors", - "language_model.model.layers.34.post_attention_layernorm.weight": "model-00003-of-00006.safetensors", - "language_model.model.layers.35.input_layernorm.weight": "model-00003-of-00006.safetensors", - "language_model.model.layers.35.mlp.down_proj.biases": "model-00003-of-00006.safetensors", - "language_model.model.layers.35.mlp.down_proj.scales": "model-00003-of-00006.safetensors", - "language_model.model.layers.35.mlp.down_proj.weight": "model-00003-of-00006.safetensors", - "language_model.model.layers.35.mlp.gate_proj.biases": "model-00003-of-00006.safetensors", - "language_model.model.layers.35.mlp.gate_proj.scales": "model-00003-of-00006.safetensors", - "language_model.model.layers.35.mlp.gate_proj.weight": "model-00003-of-00006.safetensors", - "language_model.model.layers.35.mlp.up_proj.biases": "model-00003-of-00006.safetensors", - "language_model.model.layers.35.mlp.up_proj.scales": "model-00003-of-00006.safetensors", - "language_model.model.layers.35.mlp.up_proj.weight": "model-00003-of-00006.safetensors", - "language_model.model.layers.35.post_attention_layernorm.weight": "model-00003-of-00006.safetensors", - "language_model.model.layers.35.self_attn.k_norm.weight": "model-00003-of-00006.safetensors", - "language_model.model.layers.35.self_attn.k_proj.biases": "model-00003-of-00006.safetensors", - "language_model.model.layers.35.self_attn.k_proj.scales": "model-00003-of-00006.safetensors", - "language_model.model.layers.35.self_attn.k_proj.weight": "model-00003-of-00006.safetensors", - "language_model.model.layers.35.self_attn.o_proj.biases": "model-00003-of-00006.safetensors", - "language_model.model.layers.35.self_attn.o_proj.scales": "model-00003-of-00006.safetensors", - "language_model.model.layers.35.self_attn.o_proj.weight": "model-00003-of-00006.safetensors", - "language_model.model.layers.35.self_attn.q_norm.weight": "model-00003-of-00006.safetensors", - "language_model.model.layers.35.self_attn.q_proj.biases": "model-00003-of-00006.safetensors", - "language_model.model.layers.35.self_attn.q_proj.scales": "model-00003-of-00006.safetensors", - "language_model.model.layers.35.self_attn.q_proj.weight": "model-00003-of-00006.safetensors", - "language_model.model.layers.35.self_attn.v_proj.biases": "model-00003-of-00006.safetensors", - "language_model.model.layers.35.self_attn.v_proj.scales": "model-00003-of-00006.safetensors", - "language_model.model.layers.35.self_attn.v_proj.weight": "model-00003-of-00006.safetensors", + "language_model.model.layers.34.linear_attn.dt_bias": "model-00004-of-00006.safetensors", + "language_model.model.layers.34.linear_attn.in_proj_a.biases": "model-00004-of-00006.safetensors", + "language_model.model.layers.34.linear_attn.in_proj_a.scales": "model-00004-of-00006.safetensors", + "language_model.model.layers.34.linear_attn.in_proj_a.weight": "model-00004-of-00006.safetensors", + "language_model.model.layers.34.linear_attn.in_proj_b.biases": "model-00004-of-00006.safetensors", + "language_model.model.layers.34.linear_attn.in_proj_b.scales": "model-00004-of-00006.safetensors", + "language_model.model.layers.34.linear_attn.in_proj_b.weight": "model-00004-of-00006.safetensors", + "language_model.model.layers.34.linear_attn.in_proj_qkv.biases": "model-00004-of-00006.safetensors", + "language_model.model.layers.34.linear_attn.in_proj_qkv.scales": "model-00004-of-00006.safetensors", + "language_model.model.layers.34.linear_attn.in_proj_qkv.weight": "model-00004-of-00006.safetensors", + "language_model.model.layers.34.linear_attn.in_proj_z.biases": "model-00004-of-00006.safetensors", + "language_model.model.layers.34.linear_attn.in_proj_z.scales": "model-00004-of-00006.safetensors", + "language_model.model.layers.34.linear_attn.in_proj_z.weight": "model-00004-of-00006.safetensors", + "language_model.model.layers.34.linear_attn.norm.weight": "model-00004-of-00006.safetensors", + "language_model.model.layers.34.linear_attn.out_proj.biases": "model-00004-of-00006.safetensors", + "language_model.model.layers.34.linear_attn.out_proj.scales": "model-00004-of-00006.safetensors", + "language_model.model.layers.34.linear_attn.out_proj.weight": "model-00004-of-00006.safetensors", + "language_model.model.layers.34.mlp.down_proj.biases": "model-00004-of-00006.safetensors", + "language_model.model.layers.34.mlp.down_proj.scales": "model-00004-of-00006.safetensors", + "language_model.model.layers.34.mlp.down_proj.weight": "model-00004-of-00006.safetensors", + "language_model.model.layers.34.mlp.gate_proj.biases": "model-00004-of-00006.safetensors", + "language_model.model.layers.34.mlp.gate_proj.scales": "model-00004-of-00006.safetensors", + "language_model.model.layers.34.mlp.gate_proj.weight": "model-00004-of-00006.safetensors", + "language_model.model.layers.34.mlp.up_proj.biases": "model-00004-of-00006.safetensors", + "language_model.model.layers.34.mlp.up_proj.scales": "model-00004-of-00006.safetensors", + "language_model.model.layers.34.mlp.up_proj.weight": "model-00004-of-00006.safetensors", + "language_model.model.layers.34.post_attention_layernorm.weight": "model-00004-of-00006.safetensors", + "language_model.model.layers.35.input_layernorm.weight": "model-00004-of-00006.safetensors", + "language_model.model.layers.35.mlp.down_proj.biases": "model-00004-of-00006.safetensors", + "language_model.model.layers.35.mlp.down_proj.scales": "model-00004-of-00006.safetensors", + "language_model.model.layers.35.mlp.down_proj.weight": "model-00004-of-00006.safetensors", + "language_model.model.layers.35.mlp.gate_proj.biases": "model-00004-of-00006.safetensors", + "language_model.model.layers.35.mlp.gate_proj.scales": "model-00004-of-00006.safetensors", + "language_model.model.layers.35.mlp.gate_proj.weight": "model-00004-of-00006.safetensors", + "language_model.model.layers.35.mlp.up_proj.biases": "model-00004-of-00006.safetensors", + "language_model.model.layers.35.mlp.up_proj.scales": "model-00004-of-00006.safetensors", + "language_model.model.layers.35.mlp.up_proj.weight": "model-00004-of-00006.safetensors", + "language_model.model.layers.35.post_attention_layernorm.weight": "model-00004-of-00006.safetensors", + "language_model.model.layers.35.self_attn.k_norm.weight": "model-00004-of-00006.safetensors", + "language_model.model.layers.35.self_attn.k_proj.biases": "model-00004-of-00006.safetensors", + "language_model.model.layers.35.self_attn.k_proj.scales": "model-00004-of-00006.safetensors", + "language_model.model.layers.35.self_attn.k_proj.weight": "model-00004-of-00006.safetensors", + "language_model.model.layers.35.self_attn.o_proj.biases": "model-00004-of-00006.safetensors", + "language_model.model.layers.35.self_attn.o_proj.scales": "model-00004-of-00006.safetensors", + "language_model.model.layers.35.self_attn.o_proj.weight": "model-00004-of-00006.safetensors", + "language_model.model.layers.35.self_attn.q_norm.weight": "model-00004-of-00006.safetensors", + "language_model.model.layers.35.self_attn.q_proj.biases": "model-00004-of-00006.safetensors", + "language_model.model.layers.35.self_attn.q_proj.scales": "model-00004-of-00006.safetensors", + "language_model.model.layers.35.self_attn.q_proj.weight": "model-00004-of-00006.safetensors", + "language_model.model.layers.35.self_attn.v_proj.biases": "model-00004-of-00006.safetensors", + "language_model.model.layers.35.self_attn.v_proj.scales": "model-00004-of-00006.safetensors", + "language_model.model.layers.35.self_attn.v_proj.weight": "model-00004-of-00006.safetensors", "language_model.model.layers.36.input_layernorm.weight": "model-00004-of-00006.safetensors", - "language_model.model.layers.36.linear_attn.A_log": "model-00003-of-00006.safetensors", - "language_model.model.layers.36.linear_attn.conv1d.weight": "model-00003-of-00006.safetensors", - "language_model.model.layers.36.linear_attn.dt_bias": "model-00003-of-00006.safetensors", - "language_model.model.layers.36.linear_attn.in_proj_a.biases": "model-00003-of-00006.safetensors", - "language_model.model.layers.36.linear_attn.in_proj_a.scales": "model-00003-of-00006.safetensors", - "language_model.model.layers.36.linear_attn.in_proj_a.weight": "model-00003-of-00006.safetensors", - "language_model.model.layers.36.linear_attn.in_proj_b.biases": "model-00003-of-00006.safetensors", - "language_model.model.layers.36.linear_attn.in_proj_b.scales": "model-00003-of-00006.safetensors", - "language_model.model.layers.36.linear_attn.in_proj_b.weight": "model-00003-of-00006.safetensors", - "language_model.model.layers.36.linear_attn.in_proj_qkv.biases": "model-00003-of-00006.safetensors", - "language_model.model.layers.36.linear_attn.in_proj_qkv.scales": "model-00003-of-00006.safetensors", - "language_model.model.layers.36.linear_attn.in_proj_qkv.weight": "model-00003-of-00006.safetensors", - "language_model.model.layers.36.linear_attn.in_proj_z.biases": "model-00003-of-00006.safetensors", - "language_model.model.layers.36.linear_attn.in_proj_z.scales": "model-00003-of-00006.safetensors", - "language_model.model.layers.36.linear_attn.in_proj_z.weight": "model-00003-of-00006.safetensors", - "language_model.model.layers.36.linear_attn.norm.weight": "model-00003-of-00006.safetensors", + "language_model.model.layers.36.linear_attn.A_log": "model-00004-of-00006.safetensors", + "language_model.model.layers.36.linear_attn.conv1d.weight": "model-00004-of-00006.safetensors", + "language_model.model.layers.36.linear_attn.dt_bias": "model-00004-of-00006.safetensors", + "language_model.model.layers.36.linear_attn.in_proj_a.biases": "model-00004-of-00006.safetensors", + "language_model.model.layers.36.linear_attn.in_proj_a.scales": "model-00004-of-00006.safetensors", + "language_model.model.layers.36.linear_attn.in_proj_a.weight": "model-00004-of-00006.safetensors", + "language_model.model.layers.36.linear_attn.in_proj_b.biases": "model-00004-of-00006.safetensors", + "language_model.model.layers.36.linear_attn.in_proj_b.scales": "model-00004-of-00006.safetensors", + "language_model.model.layers.36.linear_attn.in_proj_b.weight": "model-00004-of-00006.safetensors", + "language_model.model.layers.36.linear_attn.in_proj_qkv.biases": "model-00004-of-00006.safetensors", + "language_model.model.layers.36.linear_attn.in_proj_qkv.scales": "model-00004-of-00006.safetensors", + "language_model.model.layers.36.linear_attn.in_proj_qkv.weight": "model-00004-of-00006.safetensors", + "language_model.model.layers.36.linear_attn.in_proj_z.biases": "model-00004-of-00006.safetensors", + "language_model.model.layers.36.linear_attn.in_proj_z.scales": "model-00004-of-00006.safetensors", + "language_model.model.layers.36.linear_attn.in_proj_z.weight": "model-00004-of-00006.safetensors", + "language_model.model.layers.36.linear_attn.norm.weight": "model-00004-of-00006.safetensors", "language_model.model.layers.36.linear_attn.out_proj.biases": "model-00004-of-00006.safetensors", "language_model.model.layers.36.linear_attn.out_proj.scales": "model-00004-of-00006.safetensors", "language_model.model.layers.36.linear_attn.out_proj.weight": "model-00004-of-00006.safetensors", @@ -1222,81 +1219,81 @@ "language_model.model.layers.46.mlp.up_proj.scales": "model-00004-of-00006.safetensors", "language_model.model.layers.46.mlp.up_proj.weight": "model-00004-of-00006.safetensors", "language_model.model.layers.46.post_attention_layernorm.weight": "model-00004-of-00006.safetensors", - "language_model.model.layers.47.input_layernorm.weight": "model-00004-of-00006.safetensors", - "language_model.model.layers.47.mlp.down_proj.biases": "model-00004-of-00006.safetensors", - "language_model.model.layers.47.mlp.down_proj.scales": "model-00004-of-00006.safetensors", - "language_model.model.layers.47.mlp.down_proj.weight": "model-00004-of-00006.safetensors", - "language_model.model.layers.47.mlp.gate_proj.biases": "model-00004-of-00006.safetensors", - "language_model.model.layers.47.mlp.gate_proj.scales": "model-00004-of-00006.safetensors", - "language_model.model.layers.47.mlp.gate_proj.weight": "model-00004-of-00006.safetensors", - "language_model.model.layers.47.mlp.up_proj.biases": "model-00004-of-00006.safetensors", - "language_model.model.layers.47.mlp.up_proj.scales": "model-00004-of-00006.safetensors", - "language_model.model.layers.47.mlp.up_proj.weight": "model-00004-of-00006.safetensors", - "language_model.model.layers.47.post_attention_layernorm.weight": "model-00004-of-00006.safetensors", - "language_model.model.layers.47.self_attn.k_norm.weight": "model-00004-of-00006.safetensors", + "language_model.model.layers.47.input_layernorm.weight": "model-00005-of-00006.safetensors", + "language_model.model.layers.47.mlp.down_proj.biases": "model-00005-of-00006.safetensors", + "language_model.model.layers.47.mlp.down_proj.scales": "model-00005-of-00006.safetensors", + "language_model.model.layers.47.mlp.down_proj.weight": "model-00005-of-00006.safetensors", + "language_model.model.layers.47.mlp.gate_proj.biases": "model-00005-of-00006.safetensors", + "language_model.model.layers.47.mlp.gate_proj.scales": "model-00005-of-00006.safetensors", + "language_model.model.layers.47.mlp.gate_proj.weight": "model-00005-of-00006.safetensors", + "language_model.model.layers.47.mlp.up_proj.biases": "model-00005-of-00006.safetensors", + "language_model.model.layers.47.mlp.up_proj.scales": "model-00005-of-00006.safetensors", + "language_model.model.layers.47.mlp.up_proj.weight": "model-00005-of-00006.safetensors", + "language_model.model.layers.47.post_attention_layernorm.weight": "model-00005-of-00006.safetensors", + "language_model.model.layers.47.self_attn.k_norm.weight": "model-00005-of-00006.safetensors", "language_model.model.layers.47.self_attn.k_proj.biases": "model-00004-of-00006.safetensors", "language_model.model.layers.47.self_attn.k_proj.scales": "model-00004-of-00006.safetensors", "language_model.model.layers.47.self_attn.k_proj.weight": "model-00004-of-00006.safetensors", - "language_model.model.layers.47.self_attn.o_proj.biases": "model-00004-of-00006.safetensors", - "language_model.model.layers.47.self_attn.o_proj.scales": "model-00004-of-00006.safetensors", - "language_model.model.layers.47.self_attn.o_proj.weight": "model-00004-of-00006.safetensors", - "language_model.model.layers.47.self_attn.q_norm.weight": "model-00004-of-00006.safetensors", + "language_model.model.layers.47.self_attn.o_proj.biases": "model-00005-of-00006.safetensors", + "language_model.model.layers.47.self_attn.o_proj.scales": "model-00005-of-00006.safetensors", + "language_model.model.layers.47.self_attn.o_proj.weight": "model-00005-of-00006.safetensors", + "language_model.model.layers.47.self_attn.q_norm.weight": "model-00005-of-00006.safetensors", "language_model.model.layers.47.self_attn.q_proj.biases": "model-00004-of-00006.safetensors", "language_model.model.layers.47.self_attn.q_proj.scales": "model-00004-of-00006.safetensors", "language_model.model.layers.47.self_attn.q_proj.weight": "model-00004-of-00006.safetensors", "language_model.model.layers.47.self_attn.v_proj.biases": "model-00004-of-00006.safetensors", "language_model.model.layers.47.self_attn.v_proj.scales": "model-00004-of-00006.safetensors", "language_model.model.layers.47.self_attn.v_proj.weight": "model-00004-of-00006.safetensors", - "language_model.model.layers.48.input_layernorm.weight": "model-00004-of-00006.safetensors", - "language_model.model.layers.48.linear_attn.A_log": "model-00004-of-00006.safetensors", - "language_model.model.layers.48.linear_attn.conv1d.weight": "model-00004-of-00006.safetensors", - "language_model.model.layers.48.linear_attn.dt_bias": "model-00004-of-00006.safetensors", - "language_model.model.layers.48.linear_attn.in_proj_a.biases": "model-00004-of-00006.safetensors", - "language_model.model.layers.48.linear_attn.in_proj_a.scales": "model-00004-of-00006.safetensors", - "language_model.model.layers.48.linear_attn.in_proj_a.weight": "model-00004-of-00006.safetensors", - "language_model.model.layers.48.linear_attn.in_proj_b.biases": "model-00004-of-00006.safetensors", - "language_model.model.layers.48.linear_attn.in_proj_b.scales": "model-00004-of-00006.safetensors", - "language_model.model.layers.48.linear_attn.in_proj_b.weight": "model-00004-of-00006.safetensors", - "language_model.model.layers.48.linear_attn.in_proj_qkv.biases": "model-00004-of-00006.safetensors", - "language_model.model.layers.48.linear_attn.in_proj_qkv.scales": "model-00004-of-00006.safetensors", - "language_model.model.layers.48.linear_attn.in_proj_qkv.weight": "model-00004-of-00006.safetensors", - "language_model.model.layers.48.linear_attn.in_proj_z.biases": "model-00004-of-00006.safetensors", - "language_model.model.layers.48.linear_attn.in_proj_z.scales": "model-00004-of-00006.safetensors", - "language_model.model.layers.48.linear_attn.in_proj_z.weight": "model-00004-of-00006.safetensors", - "language_model.model.layers.48.linear_attn.norm.weight": "model-00004-of-00006.safetensors", - "language_model.model.layers.48.linear_attn.out_proj.biases": "model-00004-of-00006.safetensors", - "language_model.model.layers.48.linear_attn.out_proj.scales": "model-00004-of-00006.safetensors", - "language_model.model.layers.48.linear_attn.out_proj.weight": "model-00004-of-00006.safetensors", - "language_model.model.layers.48.mlp.down_proj.biases": "model-00004-of-00006.safetensors", - "language_model.model.layers.48.mlp.down_proj.scales": "model-00004-of-00006.safetensors", - "language_model.model.layers.48.mlp.down_proj.weight": "model-00004-of-00006.safetensors", - "language_model.model.layers.48.mlp.gate_proj.biases": "model-00004-of-00006.safetensors", - "language_model.model.layers.48.mlp.gate_proj.scales": "model-00004-of-00006.safetensors", - "language_model.model.layers.48.mlp.gate_proj.weight": "model-00004-of-00006.safetensors", - "language_model.model.layers.48.mlp.up_proj.biases": "model-00004-of-00006.safetensors", - "language_model.model.layers.48.mlp.up_proj.scales": "model-00004-of-00006.safetensors", - "language_model.model.layers.48.mlp.up_proj.weight": "model-00004-of-00006.safetensors", - "language_model.model.layers.48.post_attention_layernorm.weight": "model-00004-of-00006.safetensors", - "language_model.model.layers.49.input_layernorm.weight": "model-00004-of-00006.safetensors", - "language_model.model.layers.49.linear_attn.A_log": "model-00004-of-00006.safetensors", - "language_model.model.layers.49.linear_attn.conv1d.weight": "model-00004-of-00006.safetensors", - "language_model.model.layers.49.linear_attn.dt_bias": "model-00004-of-00006.safetensors", - "language_model.model.layers.49.linear_attn.in_proj_a.biases": "model-00004-of-00006.safetensors", - "language_model.model.layers.49.linear_attn.in_proj_a.scales": "model-00004-of-00006.safetensors", - "language_model.model.layers.49.linear_attn.in_proj_a.weight": "model-00004-of-00006.safetensors", - "language_model.model.layers.49.linear_attn.in_proj_b.biases": "model-00004-of-00006.safetensors", - "language_model.model.layers.49.linear_attn.in_proj_b.scales": "model-00004-of-00006.safetensors", - "language_model.model.layers.49.linear_attn.in_proj_b.weight": "model-00004-of-00006.safetensors", - "language_model.model.layers.49.linear_attn.in_proj_qkv.biases": "model-00004-of-00006.safetensors", - "language_model.model.layers.49.linear_attn.in_proj_qkv.scales": "model-00004-of-00006.safetensors", - "language_model.model.layers.49.linear_attn.in_proj_qkv.weight": "model-00004-of-00006.safetensors", - "language_model.model.layers.49.linear_attn.in_proj_z.biases": "model-00004-of-00006.safetensors", - "language_model.model.layers.49.linear_attn.in_proj_z.scales": "model-00004-of-00006.safetensors", - "language_model.model.layers.49.linear_attn.in_proj_z.weight": "model-00004-of-00006.safetensors", - "language_model.model.layers.49.linear_attn.norm.weight": "model-00004-of-00006.safetensors", - "language_model.model.layers.49.linear_attn.out_proj.biases": "model-00004-of-00006.safetensors", - "language_model.model.layers.49.linear_attn.out_proj.scales": "model-00004-of-00006.safetensors", - "language_model.model.layers.49.linear_attn.out_proj.weight": "model-00004-of-00006.safetensors", + "language_model.model.layers.48.input_layernorm.weight": "model-00005-of-00006.safetensors", + "language_model.model.layers.48.linear_attn.A_log": "model-00005-of-00006.safetensors", + "language_model.model.layers.48.linear_attn.conv1d.weight": "model-00005-of-00006.safetensors", + "language_model.model.layers.48.linear_attn.dt_bias": "model-00005-of-00006.safetensors", + "language_model.model.layers.48.linear_attn.in_proj_a.biases": "model-00005-of-00006.safetensors", + "language_model.model.layers.48.linear_attn.in_proj_a.scales": "model-00005-of-00006.safetensors", + "language_model.model.layers.48.linear_attn.in_proj_a.weight": "model-00005-of-00006.safetensors", + "language_model.model.layers.48.linear_attn.in_proj_b.biases": "model-00005-of-00006.safetensors", + "language_model.model.layers.48.linear_attn.in_proj_b.scales": "model-00005-of-00006.safetensors", + "language_model.model.layers.48.linear_attn.in_proj_b.weight": "model-00005-of-00006.safetensors", + "language_model.model.layers.48.linear_attn.in_proj_qkv.biases": "model-00005-of-00006.safetensors", + "language_model.model.layers.48.linear_attn.in_proj_qkv.scales": "model-00005-of-00006.safetensors", + "language_model.model.layers.48.linear_attn.in_proj_qkv.weight": "model-00005-of-00006.safetensors", + "language_model.model.layers.48.linear_attn.in_proj_z.biases": "model-00005-of-00006.safetensors", + "language_model.model.layers.48.linear_attn.in_proj_z.scales": "model-00005-of-00006.safetensors", + "language_model.model.layers.48.linear_attn.in_proj_z.weight": "model-00005-of-00006.safetensors", + "language_model.model.layers.48.linear_attn.norm.weight": "model-00005-of-00006.safetensors", + "language_model.model.layers.48.linear_attn.out_proj.biases": "model-00005-of-00006.safetensors", + "language_model.model.layers.48.linear_attn.out_proj.scales": "model-00005-of-00006.safetensors", + "language_model.model.layers.48.linear_attn.out_proj.weight": "model-00005-of-00006.safetensors", + "language_model.model.layers.48.mlp.down_proj.biases": "model-00005-of-00006.safetensors", + "language_model.model.layers.48.mlp.down_proj.scales": "model-00005-of-00006.safetensors", + "language_model.model.layers.48.mlp.down_proj.weight": "model-00005-of-00006.safetensors", + "language_model.model.layers.48.mlp.gate_proj.biases": "model-00005-of-00006.safetensors", + "language_model.model.layers.48.mlp.gate_proj.scales": "model-00005-of-00006.safetensors", + "language_model.model.layers.48.mlp.gate_proj.weight": "model-00005-of-00006.safetensors", + "language_model.model.layers.48.mlp.up_proj.biases": "model-00005-of-00006.safetensors", + "language_model.model.layers.48.mlp.up_proj.scales": "model-00005-of-00006.safetensors", + "language_model.model.layers.48.mlp.up_proj.weight": "model-00005-of-00006.safetensors", + "language_model.model.layers.48.post_attention_layernorm.weight": "model-00005-of-00006.safetensors", + "language_model.model.layers.49.input_layernorm.weight": "model-00005-of-00006.safetensors", + "language_model.model.layers.49.linear_attn.A_log": "model-00005-of-00006.safetensors", + "language_model.model.layers.49.linear_attn.conv1d.weight": "model-00005-of-00006.safetensors", + "language_model.model.layers.49.linear_attn.dt_bias": "model-00005-of-00006.safetensors", + "language_model.model.layers.49.linear_attn.in_proj_a.biases": "model-00005-of-00006.safetensors", + "language_model.model.layers.49.linear_attn.in_proj_a.scales": "model-00005-of-00006.safetensors", + "language_model.model.layers.49.linear_attn.in_proj_a.weight": "model-00005-of-00006.safetensors", + "language_model.model.layers.49.linear_attn.in_proj_b.biases": "model-00005-of-00006.safetensors", + "language_model.model.layers.49.linear_attn.in_proj_b.scales": "model-00005-of-00006.safetensors", + "language_model.model.layers.49.linear_attn.in_proj_b.weight": "model-00005-of-00006.safetensors", + "language_model.model.layers.49.linear_attn.in_proj_qkv.biases": "model-00005-of-00006.safetensors", + "language_model.model.layers.49.linear_attn.in_proj_qkv.scales": "model-00005-of-00006.safetensors", + "language_model.model.layers.49.linear_attn.in_proj_qkv.weight": "model-00005-of-00006.safetensors", + "language_model.model.layers.49.linear_attn.in_proj_z.biases": "model-00005-of-00006.safetensors", + "language_model.model.layers.49.linear_attn.in_proj_z.scales": "model-00005-of-00006.safetensors", + "language_model.model.layers.49.linear_attn.in_proj_z.weight": "model-00005-of-00006.safetensors", + "language_model.model.layers.49.linear_attn.norm.weight": "model-00005-of-00006.safetensors", + "language_model.model.layers.49.linear_attn.out_proj.biases": "model-00005-of-00006.safetensors", + "language_model.model.layers.49.linear_attn.out_proj.scales": "model-00005-of-00006.safetensors", + "language_model.model.layers.49.linear_attn.out_proj.weight": "model-00005-of-00006.safetensors", "language_model.model.layers.49.mlp.down_proj.biases": "model-00005-of-00006.safetensors", "language_model.model.layers.49.mlp.down_proj.scales": "model-00005-of-00006.safetensors", "language_model.model.layers.49.mlp.down_proj.weight": "model-00005-of-00006.safetensors", @@ -1306,7 +1303,7 @@ "language_model.model.layers.49.mlp.up_proj.biases": "model-00005-of-00006.safetensors", "language_model.model.layers.49.mlp.up_proj.scales": "model-00005-of-00006.safetensors", "language_model.model.layers.49.mlp.up_proj.weight": "model-00005-of-00006.safetensors", - "language_model.model.layers.49.post_attention_layernorm.weight": "model-00004-of-00006.safetensors", + "language_model.model.layers.49.post_attention_layernorm.weight": "model-00005-of-00006.safetensors", "language_model.model.layers.5.input_layernorm.weight": "model-00001-of-00006.safetensors", "language_model.model.layers.5.linear_attn.A_log": "model-00001-of-00006.safetensors", "language_model.model.layers.5.linear_attn.conv1d.weight": "model-00001-of-00006.safetensors", @@ -1672,76 +1669,76 @@ "language_model.model.layers.60.linear_attn.out_proj.biases": "model-00005-of-00006.safetensors", "language_model.model.layers.60.linear_attn.out_proj.scales": "model-00005-of-00006.safetensors", "language_model.model.layers.60.linear_attn.out_proj.weight": "model-00005-of-00006.safetensors", - "language_model.model.layers.60.mlp.down_proj.biases": "model-00005-of-00006.safetensors", - "language_model.model.layers.60.mlp.down_proj.scales": "model-00005-of-00006.safetensors", - "language_model.model.layers.60.mlp.down_proj.weight": "model-00005-of-00006.safetensors", - "language_model.model.layers.60.mlp.gate_proj.biases": "model-00005-of-00006.safetensors", - "language_model.model.layers.60.mlp.gate_proj.scales": "model-00005-of-00006.safetensors", - "language_model.model.layers.60.mlp.gate_proj.weight": "model-00005-of-00006.safetensors", - "language_model.model.layers.60.mlp.up_proj.biases": "model-00005-of-00006.safetensors", - "language_model.model.layers.60.mlp.up_proj.scales": "model-00005-of-00006.safetensors", - "language_model.model.layers.60.mlp.up_proj.weight": "model-00005-of-00006.safetensors", + "language_model.model.layers.60.mlp.down_proj.biases": "model-00006-of-00006.safetensors", + "language_model.model.layers.60.mlp.down_proj.scales": "model-00006-of-00006.safetensors", + "language_model.model.layers.60.mlp.down_proj.weight": "model-00006-of-00006.safetensors", + "language_model.model.layers.60.mlp.gate_proj.biases": "model-00006-of-00006.safetensors", + "language_model.model.layers.60.mlp.gate_proj.scales": "model-00006-of-00006.safetensors", + "language_model.model.layers.60.mlp.gate_proj.weight": "model-00006-of-00006.safetensors", + "language_model.model.layers.60.mlp.up_proj.biases": "model-00006-of-00006.safetensors", + "language_model.model.layers.60.mlp.up_proj.scales": "model-00006-of-00006.safetensors", + "language_model.model.layers.60.mlp.up_proj.weight": "model-00006-of-00006.safetensors", "language_model.model.layers.60.post_attention_layernorm.weight": "model-00005-of-00006.safetensors", - "language_model.model.layers.61.input_layernorm.weight": "model-00005-of-00006.safetensors", - "language_model.model.layers.61.linear_attn.A_log": "model-00005-of-00006.safetensors", - "language_model.model.layers.61.linear_attn.conv1d.weight": "model-00005-of-00006.safetensors", - "language_model.model.layers.61.linear_attn.dt_bias": "model-00005-of-00006.safetensors", - "language_model.model.layers.61.linear_attn.in_proj_a.biases": "model-00005-of-00006.safetensors", - "language_model.model.layers.61.linear_attn.in_proj_a.scales": "model-00005-of-00006.safetensors", - "language_model.model.layers.61.linear_attn.in_proj_a.weight": "model-00005-of-00006.safetensors", - "language_model.model.layers.61.linear_attn.in_proj_b.biases": "model-00005-of-00006.safetensors", - "language_model.model.layers.61.linear_attn.in_proj_b.scales": "model-00005-of-00006.safetensors", - "language_model.model.layers.61.linear_attn.in_proj_b.weight": "model-00005-of-00006.safetensors", - "language_model.model.layers.61.linear_attn.in_proj_qkv.biases": "model-00005-of-00006.safetensors", - "language_model.model.layers.61.linear_attn.in_proj_qkv.scales": "model-00005-of-00006.safetensors", - "language_model.model.layers.61.linear_attn.in_proj_qkv.weight": "model-00005-of-00006.safetensors", - "language_model.model.layers.61.linear_attn.in_proj_z.biases": "model-00005-of-00006.safetensors", - "language_model.model.layers.61.linear_attn.in_proj_z.scales": "model-00005-of-00006.safetensors", - "language_model.model.layers.61.linear_attn.in_proj_z.weight": "model-00005-of-00006.safetensors", - "language_model.model.layers.61.linear_attn.norm.weight": "model-00005-of-00006.safetensors", - "language_model.model.layers.61.linear_attn.out_proj.biases": "model-00005-of-00006.safetensors", - "language_model.model.layers.61.linear_attn.out_proj.scales": "model-00005-of-00006.safetensors", - "language_model.model.layers.61.linear_attn.out_proj.weight": "model-00005-of-00006.safetensors", - "language_model.model.layers.61.mlp.down_proj.biases": "model-00005-of-00006.safetensors", - "language_model.model.layers.61.mlp.down_proj.scales": "model-00005-of-00006.safetensors", - "language_model.model.layers.61.mlp.down_proj.weight": "model-00005-of-00006.safetensors", - "language_model.model.layers.61.mlp.gate_proj.biases": "model-00005-of-00006.safetensors", - "language_model.model.layers.61.mlp.gate_proj.scales": "model-00005-of-00006.safetensors", - "language_model.model.layers.61.mlp.gate_proj.weight": "model-00005-of-00006.safetensors", - "language_model.model.layers.61.mlp.up_proj.biases": "model-00005-of-00006.safetensors", - "language_model.model.layers.61.mlp.up_proj.scales": "model-00005-of-00006.safetensors", - "language_model.model.layers.61.mlp.up_proj.weight": "model-00005-of-00006.safetensors", - "language_model.model.layers.61.post_attention_layernorm.weight": "model-00005-of-00006.safetensors", - "language_model.model.layers.62.input_layernorm.weight": "model-00005-of-00006.safetensors", - "language_model.model.layers.62.linear_attn.A_log": "model-00005-of-00006.safetensors", - "language_model.model.layers.62.linear_attn.conv1d.weight": "model-00005-of-00006.safetensors", - "language_model.model.layers.62.linear_attn.dt_bias": "model-00005-of-00006.safetensors", - "language_model.model.layers.62.linear_attn.in_proj_a.biases": "model-00005-of-00006.safetensors", - "language_model.model.layers.62.linear_attn.in_proj_a.scales": "model-00005-of-00006.safetensors", - "language_model.model.layers.62.linear_attn.in_proj_a.weight": "model-00005-of-00006.safetensors", - "language_model.model.layers.62.linear_attn.in_proj_b.biases": "model-00005-of-00006.safetensors", - "language_model.model.layers.62.linear_attn.in_proj_b.scales": "model-00005-of-00006.safetensors", - "language_model.model.layers.62.linear_attn.in_proj_b.weight": "model-00005-of-00006.safetensors", - "language_model.model.layers.62.linear_attn.in_proj_qkv.biases": "model-00005-of-00006.safetensors", - "language_model.model.layers.62.linear_attn.in_proj_qkv.scales": "model-00005-of-00006.safetensors", - "language_model.model.layers.62.linear_attn.in_proj_qkv.weight": "model-00005-of-00006.safetensors", - "language_model.model.layers.62.linear_attn.in_proj_z.biases": "model-00005-of-00006.safetensors", - "language_model.model.layers.62.linear_attn.in_proj_z.scales": "model-00005-of-00006.safetensors", - "language_model.model.layers.62.linear_attn.in_proj_z.weight": "model-00005-of-00006.safetensors", - "language_model.model.layers.62.linear_attn.norm.weight": "model-00005-of-00006.safetensors", - "language_model.model.layers.62.linear_attn.out_proj.biases": "model-00005-of-00006.safetensors", - "language_model.model.layers.62.linear_attn.out_proj.scales": "model-00005-of-00006.safetensors", - "language_model.model.layers.62.linear_attn.out_proj.weight": "model-00005-of-00006.safetensors", + "language_model.model.layers.61.input_layernorm.weight": "model-00006-of-00006.safetensors", + "language_model.model.layers.61.linear_attn.A_log": "model-00006-of-00006.safetensors", + "language_model.model.layers.61.linear_attn.conv1d.weight": "model-00006-of-00006.safetensors", + "language_model.model.layers.61.linear_attn.dt_bias": "model-00006-of-00006.safetensors", + "language_model.model.layers.61.linear_attn.in_proj_a.biases": "model-00006-of-00006.safetensors", + "language_model.model.layers.61.linear_attn.in_proj_a.scales": "model-00006-of-00006.safetensors", + "language_model.model.layers.61.linear_attn.in_proj_a.weight": "model-00006-of-00006.safetensors", + "language_model.model.layers.61.linear_attn.in_proj_b.biases": "model-00006-of-00006.safetensors", + "language_model.model.layers.61.linear_attn.in_proj_b.scales": "model-00006-of-00006.safetensors", + "language_model.model.layers.61.linear_attn.in_proj_b.weight": "model-00006-of-00006.safetensors", + "language_model.model.layers.61.linear_attn.in_proj_qkv.biases": "model-00006-of-00006.safetensors", + "language_model.model.layers.61.linear_attn.in_proj_qkv.scales": "model-00006-of-00006.safetensors", + "language_model.model.layers.61.linear_attn.in_proj_qkv.weight": "model-00006-of-00006.safetensors", + "language_model.model.layers.61.linear_attn.in_proj_z.biases": "model-00006-of-00006.safetensors", + "language_model.model.layers.61.linear_attn.in_proj_z.scales": "model-00006-of-00006.safetensors", + "language_model.model.layers.61.linear_attn.in_proj_z.weight": "model-00006-of-00006.safetensors", + "language_model.model.layers.61.linear_attn.norm.weight": "model-00006-of-00006.safetensors", + "language_model.model.layers.61.linear_attn.out_proj.biases": "model-00006-of-00006.safetensors", + "language_model.model.layers.61.linear_attn.out_proj.scales": "model-00006-of-00006.safetensors", + "language_model.model.layers.61.linear_attn.out_proj.weight": "model-00006-of-00006.safetensors", + "language_model.model.layers.61.mlp.down_proj.biases": "model-00006-of-00006.safetensors", + "language_model.model.layers.61.mlp.down_proj.scales": "model-00006-of-00006.safetensors", + "language_model.model.layers.61.mlp.down_proj.weight": "model-00006-of-00006.safetensors", + "language_model.model.layers.61.mlp.gate_proj.biases": "model-00006-of-00006.safetensors", + "language_model.model.layers.61.mlp.gate_proj.scales": "model-00006-of-00006.safetensors", + "language_model.model.layers.61.mlp.gate_proj.weight": "model-00006-of-00006.safetensors", + "language_model.model.layers.61.mlp.up_proj.biases": "model-00006-of-00006.safetensors", + "language_model.model.layers.61.mlp.up_proj.scales": "model-00006-of-00006.safetensors", + "language_model.model.layers.61.mlp.up_proj.weight": "model-00006-of-00006.safetensors", + "language_model.model.layers.61.post_attention_layernorm.weight": "model-00006-of-00006.safetensors", + "language_model.model.layers.62.input_layernorm.weight": "model-00006-of-00006.safetensors", + "language_model.model.layers.62.linear_attn.A_log": "model-00006-of-00006.safetensors", + "language_model.model.layers.62.linear_attn.conv1d.weight": "model-00006-of-00006.safetensors", + "language_model.model.layers.62.linear_attn.dt_bias": "model-00006-of-00006.safetensors", + "language_model.model.layers.62.linear_attn.in_proj_a.biases": "model-00006-of-00006.safetensors", + "language_model.model.layers.62.linear_attn.in_proj_a.scales": "model-00006-of-00006.safetensors", + "language_model.model.layers.62.linear_attn.in_proj_a.weight": "model-00006-of-00006.safetensors", + "language_model.model.layers.62.linear_attn.in_proj_b.biases": "model-00006-of-00006.safetensors", + "language_model.model.layers.62.linear_attn.in_proj_b.scales": "model-00006-of-00006.safetensors", + "language_model.model.layers.62.linear_attn.in_proj_b.weight": "model-00006-of-00006.safetensors", + "language_model.model.layers.62.linear_attn.in_proj_qkv.biases": "model-00006-of-00006.safetensors", + "language_model.model.layers.62.linear_attn.in_proj_qkv.scales": "model-00006-of-00006.safetensors", + "language_model.model.layers.62.linear_attn.in_proj_qkv.weight": "model-00006-of-00006.safetensors", + "language_model.model.layers.62.linear_attn.in_proj_z.biases": "model-00006-of-00006.safetensors", + "language_model.model.layers.62.linear_attn.in_proj_z.scales": "model-00006-of-00006.safetensors", + "language_model.model.layers.62.linear_attn.in_proj_z.weight": "model-00006-of-00006.safetensors", + "language_model.model.layers.62.linear_attn.norm.weight": "model-00006-of-00006.safetensors", + "language_model.model.layers.62.linear_attn.out_proj.biases": "model-00006-of-00006.safetensors", + "language_model.model.layers.62.linear_attn.out_proj.scales": "model-00006-of-00006.safetensors", + "language_model.model.layers.62.linear_attn.out_proj.weight": "model-00006-of-00006.safetensors", "language_model.model.layers.62.mlp.down_proj.biases": "model-00006-of-00006.safetensors", "language_model.model.layers.62.mlp.down_proj.scales": "model-00006-of-00006.safetensors", "language_model.model.layers.62.mlp.down_proj.weight": "model-00006-of-00006.safetensors", - "language_model.model.layers.62.mlp.gate_proj.biases": "model-00005-of-00006.safetensors", - "language_model.model.layers.62.mlp.gate_proj.scales": "model-00005-of-00006.safetensors", - "language_model.model.layers.62.mlp.gate_proj.weight": "model-00005-of-00006.safetensors", + "language_model.model.layers.62.mlp.gate_proj.biases": "model-00006-of-00006.safetensors", + "language_model.model.layers.62.mlp.gate_proj.scales": "model-00006-of-00006.safetensors", + "language_model.model.layers.62.mlp.gate_proj.weight": "model-00006-of-00006.safetensors", "language_model.model.layers.62.mlp.up_proj.biases": "model-00006-of-00006.safetensors", "language_model.model.layers.62.mlp.up_proj.scales": "model-00006-of-00006.safetensors", "language_model.model.layers.62.mlp.up_proj.weight": "model-00006-of-00006.safetensors", - "language_model.model.layers.62.post_attention_layernorm.weight": "model-00005-of-00006.safetensors", + "language_model.model.layers.62.post_attention_layernorm.weight": "model-00006-of-00006.safetensors", "language_model.model.layers.63.input_layernorm.weight": "model-00006-of-00006.safetensors", "language_model.model.layers.63.mlp.down_proj.biases": "model-00006-of-00006.safetensors", "language_model.model.layers.63.mlp.down_proj.scales": "model-00006-of-00006.safetensors", @@ -1768,15 +1765,15 @@ "language_model.model.layers.63.self_attn.v_proj.scales": "model-00006-of-00006.safetensors", "language_model.model.layers.63.self_attn.v_proj.weight": "model-00006-of-00006.safetensors", "language_model.model.layers.7.input_layernorm.weight": "model-00001-of-00006.safetensors", - "language_model.model.layers.7.mlp.down_proj.biases": "model-00001-of-00006.safetensors", - "language_model.model.layers.7.mlp.down_proj.scales": "model-00001-of-00006.safetensors", - "language_model.model.layers.7.mlp.down_proj.weight": "model-00001-of-00006.safetensors", + "language_model.model.layers.7.mlp.down_proj.biases": "model-00002-of-00006.safetensors", + "language_model.model.layers.7.mlp.down_proj.scales": "model-00002-of-00006.safetensors", + "language_model.model.layers.7.mlp.down_proj.weight": "model-00002-of-00006.safetensors", "language_model.model.layers.7.mlp.gate_proj.biases": "model-00001-of-00006.safetensors", "language_model.model.layers.7.mlp.gate_proj.scales": "model-00001-of-00006.safetensors", "language_model.model.layers.7.mlp.gate_proj.weight": "model-00001-of-00006.safetensors", - "language_model.model.layers.7.mlp.up_proj.biases": "model-00001-of-00006.safetensors", - "language_model.model.layers.7.mlp.up_proj.scales": "model-00001-of-00006.safetensors", - "language_model.model.layers.7.mlp.up_proj.weight": "model-00001-of-00006.safetensors", + "language_model.model.layers.7.mlp.up_proj.biases": "model-00002-of-00006.safetensors", + "language_model.model.layers.7.mlp.up_proj.scales": "model-00002-of-00006.safetensors", + "language_model.model.layers.7.mlp.up_proj.weight": "model-00002-of-00006.safetensors", "language_model.model.layers.7.post_attention_layernorm.weight": "model-00001-of-00006.safetensors", "language_model.model.layers.7.self_attn.k_norm.weight": "model-00001-of-00006.safetensors", "language_model.model.layers.7.self_attn.k_proj.biases": "model-00001-of-00006.safetensors", @@ -1792,399 +1789,399 @@ "language_model.model.layers.7.self_attn.v_proj.biases": "model-00001-of-00006.safetensors", "language_model.model.layers.7.self_attn.v_proj.scales": "model-00001-of-00006.safetensors", "language_model.model.layers.7.self_attn.v_proj.weight": "model-00001-of-00006.safetensors", - "language_model.model.layers.8.input_layernorm.weight": "model-00001-of-00006.safetensors", - "language_model.model.layers.8.linear_attn.A_log": "model-00001-of-00006.safetensors", - "language_model.model.layers.8.linear_attn.conv1d.weight": "model-00001-of-00006.safetensors", - "language_model.model.layers.8.linear_attn.dt_bias": "model-00001-of-00006.safetensors", - "language_model.model.layers.8.linear_attn.in_proj_a.biases": "model-00001-of-00006.safetensors", - "language_model.model.layers.8.linear_attn.in_proj_a.scales": "model-00001-of-00006.safetensors", - "language_model.model.layers.8.linear_attn.in_proj_a.weight": "model-00001-of-00006.safetensors", - "language_model.model.layers.8.linear_attn.in_proj_b.biases": "model-00001-of-00006.safetensors", - "language_model.model.layers.8.linear_attn.in_proj_b.scales": "model-00001-of-00006.safetensors", - "language_model.model.layers.8.linear_attn.in_proj_b.weight": "model-00001-of-00006.safetensors", - "language_model.model.layers.8.linear_attn.in_proj_qkv.biases": "model-00001-of-00006.safetensors", - "language_model.model.layers.8.linear_attn.in_proj_qkv.scales": "model-00001-of-00006.safetensors", - "language_model.model.layers.8.linear_attn.in_proj_qkv.weight": "model-00001-of-00006.safetensors", - "language_model.model.layers.8.linear_attn.in_proj_z.biases": "model-00001-of-00006.safetensors", - "language_model.model.layers.8.linear_attn.in_proj_z.scales": "model-00001-of-00006.safetensors", - "language_model.model.layers.8.linear_attn.in_proj_z.weight": "model-00001-of-00006.safetensors", - "language_model.model.layers.8.linear_attn.norm.weight": "model-00001-of-00006.safetensors", - "language_model.model.layers.8.linear_attn.out_proj.biases": "model-00001-of-00006.safetensors", - "language_model.model.layers.8.linear_attn.out_proj.scales": "model-00001-of-00006.safetensors", - "language_model.model.layers.8.linear_attn.out_proj.weight": "model-00001-of-00006.safetensors", - "language_model.model.layers.8.mlp.down_proj.biases": "model-00001-of-00006.safetensors", - "language_model.model.layers.8.mlp.down_proj.scales": "model-00001-of-00006.safetensors", - "language_model.model.layers.8.mlp.down_proj.weight": "model-00001-of-00006.safetensors", - "language_model.model.layers.8.mlp.gate_proj.biases": "model-00001-of-00006.safetensors", - "language_model.model.layers.8.mlp.gate_proj.scales": "model-00001-of-00006.safetensors", - "language_model.model.layers.8.mlp.gate_proj.weight": "model-00001-of-00006.safetensors", - "language_model.model.layers.8.mlp.up_proj.biases": "model-00001-of-00006.safetensors", - "language_model.model.layers.8.mlp.up_proj.scales": "model-00001-of-00006.safetensors", - "language_model.model.layers.8.mlp.up_proj.weight": "model-00001-of-00006.safetensors", - "language_model.model.layers.8.post_attention_layernorm.weight": "model-00001-of-00006.safetensors", - "language_model.model.layers.9.input_layernorm.weight": "model-00001-of-00006.safetensors", - "language_model.model.layers.9.linear_attn.A_log": "model-00001-of-00006.safetensors", - "language_model.model.layers.9.linear_attn.conv1d.weight": "model-00001-of-00006.safetensors", - "language_model.model.layers.9.linear_attn.dt_bias": "model-00001-of-00006.safetensors", - "language_model.model.layers.9.linear_attn.in_proj_a.biases": "model-00001-of-00006.safetensors", - "language_model.model.layers.9.linear_attn.in_proj_a.scales": "model-00001-of-00006.safetensors", - "language_model.model.layers.9.linear_attn.in_proj_a.weight": "model-00001-of-00006.safetensors", - "language_model.model.layers.9.linear_attn.in_proj_b.biases": "model-00001-of-00006.safetensors", - "language_model.model.layers.9.linear_attn.in_proj_b.scales": "model-00001-of-00006.safetensors", - "language_model.model.layers.9.linear_attn.in_proj_b.weight": "model-00001-of-00006.safetensors", - "language_model.model.layers.9.linear_attn.in_proj_qkv.biases": "model-00001-of-00006.safetensors", - "language_model.model.layers.9.linear_attn.in_proj_qkv.scales": "model-00001-of-00006.safetensors", - "language_model.model.layers.9.linear_attn.in_proj_qkv.weight": "model-00001-of-00006.safetensors", - "language_model.model.layers.9.linear_attn.in_proj_z.biases": "model-00001-of-00006.safetensors", - "language_model.model.layers.9.linear_attn.in_proj_z.scales": "model-00001-of-00006.safetensors", - "language_model.model.layers.9.linear_attn.in_proj_z.weight": "model-00001-of-00006.safetensors", - "language_model.model.layers.9.linear_attn.norm.weight": "model-00001-of-00006.safetensors", - "language_model.model.layers.9.linear_attn.out_proj.biases": "model-00001-of-00006.safetensors", - "language_model.model.layers.9.linear_attn.out_proj.scales": "model-00001-of-00006.safetensors", - "language_model.model.layers.9.linear_attn.out_proj.weight": "model-00001-of-00006.safetensors", - "language_model.model.layers.9.mlp.down_proj.biases": "model-00001-of-00006.safetensors", - "language_model.model.layers.9.mlp.down_proj.scales": "model-00001-of-00006.safetensors", - "language_model.model.layers.9.mlp.down_proj.weight": "model-00001-of-00006.safetensors", - "language_model.model.layers.9.mlp.gate_proj.biases": "model-00001-of-00006.safetensors", - "language_model.model.layers.9.mlp.gate_proj.scales": "model-00001-of-00006.safetensors", - "language_model.model.layers.9.mlp.gate_proj.weight": "model-00001-of-00006.safetensors", + "language_model.model.layers.8.input_layernorm.weight": "model-00002-of-00006.safetensors", + "language_model.model.layers.8.linear_attn.A_log": "model-00002-of-00006.safetensors", + "language_model.model.layers.8.linear_attn.conv1d.weight": "model-00002-of-00006.safetensors", + "language_model.model.layers.8.linear_attn.dt_bias": "model-00002-of-00006.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_a.biases": "model-00002-of-00006.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_a.scales": "model-00002-of-00006.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_a.weight": "model-00002-of-00006.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_b.biases": "model-00002-of-00006.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_b.scales": "model-00002-of-00006.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_b.weight": "model-00002-of-00006.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_qkv.biases": "model-00002-of-00006.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_qkv.scales": "model-00002-of-00006.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_qkv.weight": "model-00002-of-00006.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_z.biases": "model-00002-of-00006.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_z.scales": "model-00002-of-00006.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_z.weight": "model-00002-of-00006.safetensors", + "language_model.model.layers.8.linear_attn.norm.weight": "model-00002-of-00006.safetensors", + "language_model.model.layers.8.linear_attn.out_proj.biases": "model-00002-of-00006.safetensors", + "language_model.model.layers.8.linear_attn.out_proj.scales": "model-00002-of-00006.safetensors", + "language_model.model.layers.8.linear_attn.out_proj.weight": "model-00002-of-00006.safetensors", + "language_model.model.layers.8.mlp.down_proj.biases": "model-00002-of-00006.safetensors", + "language_model.model.layers.8.mlp.down_proj.scales": "model-00002-of-00006.safetensors", + "language_model.model.layers.8.mlp.down_proj.weight": "model-00002-of-00006.safetensors", + "language_model.model.layers.8.mlp.gate_proj.biases": "model-00002-of-00006.safetensors", + "language_model.model.layers.8.mlp.gate_proj.scales": "model-00002-of-00006.safetensors", + "language_model.model.layers.8.mlp.gate_proj.weight": "model-00002-of-00006.safetensors", + "language_model.model.layers.8.mlp.up_proj.biases": "model-00002-of-00006.safetensors", + "language_model.model.layers.8.mlp.up_proj.scales": "model-00002-of-00006.safetensors", + "language_model.model.layers.8.mlp.up_proj.weight": "model-00002-of-00006.safetensors", + "language_model.model.layers.8.post_attention_layernorm.weight": "model-00002-of-00006.safetensors", + "language_model.model.layers.9.input_layernorm.weight": "model-00002-of-00006.safetensors", + "language_model.model.layers.9.linear_attn.A_log": "model-00002-of-00006.safetensors", + "language_model.model.layers.9.linear_attn.conv1d.weight": "model-00002-of-00006.safetensors", + "language_model.model.layers.9.linear_attn.dt_bias": "model-00002-of-00006.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_a.biases": "model-00002-of-00006.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_a.scales": "model-00002-of-00006.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_a.weight": "model-00002-of-00006.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_b.biases": "model-00002-of-00006.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_b.scales": "model-00002-of-00006.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_b.weight": "model-00002-of-00006.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_qkv.biases": "model-00002-of-00006.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_qkv.scales": "model-00002-of-00006.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_qkv.weight": "model-00002-of-00006.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_z.biases": "model-00002-of-00006.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_z.scales": "model-00002-of-00006.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_z.weight": "model-00002-of-00006.safetensors", + "language_model.model.layers.9.linear_attn.norm.weight": "model-00002-of-00006.safetensors", + "language_model.model.layers.9.linear_attn.out_proj.biases": "model-00002-of-00006.safetensors", + "language_model.model.layers.9.linear_attn.out_proj.scales": "model-00002-of-00006.safetensors", + "language_model.model.layers.9.linear_attn.out_proj.weight": "model-00002-of-00006.safetensors", + "language_model.model.layers.9.mlp.down_proj.biases": "model-00002-of-00006.safetensors", + "language_model.model.layers.9.mlp.down_proj.scales": "model-00002-of-00006.safetensors", + "language_model.model.layers.9.mlp.down_proj.weight": "model-00002-of-00006.safetensors", + "language_model.model.layers.9.mlp.gate_proj.biases": "model-00002-of-00006.safetensors", + "language_model.model.layers.9.mlp.gate_proj.scales": "model-00002-of-00006.safetensors", + "language_model.model.layers.9.mlp.gate_proj.weight": "model-00002-of-00006.safetensors", "language_model.model.layers.9.mlp.up_proj.biases": "model-00002-of-00006.safetensors", "language_model.model.layers.9.mlp.up_proj.scales": "model-00002-of-00006.safetensors", "language_model.model.layers.9.mlp.up_proj.weight": "model-00002-of-00006.safetensors", - "language_model.model.layers.9.post_attention_layernorm.weight": "model-00001-of-00006.safetensors", + "language_model.model.layers.9.post_attention_layernorm.weight": "model-00002-of-00006.safetensors", "language_model.model.norm.weight": "model-00006-of-00006.safetensors", - "vision_tower.blocks.0.attn.proj.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.0.attn.proj.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.0.attn.qkv.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.0.attn.qkv.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.0.mlp.linear_fc1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.0.mlp.linear_fc1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.0.mlp.linear_fc2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.0.mlp.linear_fc2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.0.norm1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.0.norm1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.0.norm2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.0.norm2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.1.attn.proj.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.1.attn.proj.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.1.attn.qkv.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.1.attn.qkv.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.1.mlp.linear_fc1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.1.mlp.linear_fc1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.1.mlp.linear_fc2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.1.mlp.linear_fc2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.1.norm1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.1.norm1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.1.norm2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.1.norm2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.10.attn.proj.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.10.attn.proj.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.10.attn.qkv.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.10.attn.qkv.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.10.mlp.linear_fc1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.10.mlp.linear_fc1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.10.mlp.linear_fc2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.10.mlp.linear_fc2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.10.norm1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.10.norm1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.10.norm2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.10.norm2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.11.attn.proj.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.11.attn.proj.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.11.attn.qkv.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.11.attn.qkv.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.11.mlp.linear_fc1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.11.mlp.linear_fc1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.11.mlp.linear_fc2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.11.mlp.linear_fc2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.11.norm1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.11.norm1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.11.norm2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.11.norm2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.12.attn.proj.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.12.attn.proj.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.12.attn.qkv.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.12.attn.qkv.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.12.mlp.linear_fc1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.12.mlp.linear_fc1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.12.mlp.linear_fc2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.12.mlp.linear_fc2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.12.norm1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.12.norm1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.12.norm2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.12.norm2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.13.attn.proj.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.13.attn.proj.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.13.attn.qkv.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.13.attn.qkv.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.13.mlp.linear_fc1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.13.mlp.linear_fc1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.13.mlp.linear_fc2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.13.mlp.linear_fc2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.13.norm1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.13.norm1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.13.norm2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.13.norm2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.14.attn.proj.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.14.attn.proj.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.14.attn.qkv.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.14.attn.qkv.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.14.mlp.linear_fc1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.14.mlp.linear_fc1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.14.mlp.linear_fc2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.14.mlp.linear_fc2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.14.norm1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.14.norm1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.14.norm2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.14.norm2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.15.attn.proj.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.15.attn.proj.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.15.attn.qkv.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.15.attn.qkv.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.15.mlp.linear_fc1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.15.mlp.linear_fc1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.15.mlp.linear_fc2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.15.mlp.linear_fc2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.15.norm1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.15.norm1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.15.norm2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.15.norm2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.16.attn.proj.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.16.attn.proj.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.16.attn.qkv.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.16.attn.qkv.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.16.mlp.linear_fc1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.16.mlp.linear_fc1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.16.mlp.linear_fc2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.16.mlp.linear_fc2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.16.norm1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.16.norm1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.16.norm2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.16.norm2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.17.attn.proj.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.17.attn.proj.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.17.attn.qkv.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.17.attn.qkv.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.17.mlp.linear_fc1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.17.mlp.linear_fc1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.17.mlp.linear_fc2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.17.mlp.linear_fc2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.17.norm1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.17.norm1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.17.norm2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.17.norm2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.18.attn.proj.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.18.attn.proj.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.18.attn.qkv.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.18.attn.qkv.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.18.mlp.linear_fc1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.18.mlp.linear_fc1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.18.mlp.linear_fc2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.18.mlp.linear_fc2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.18.norm1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.18.norm1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.18.norm2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.18.norm2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.19.attn.proj.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.19.attn.proj.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.19.attn.qkv.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.19.attn.qkv.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.19.mlp.linear_fc1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.19.mlp.linear_fc1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.19.mlp.linear_fc2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.19.mlp.linear_fc2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.19.norm1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.19.norm1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.19.norm2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.19.norm2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.2.attn.proj.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.2.attn.proj.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.2.attn.qkv.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.2.attn.qkv.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.2.mlp.linear_fc1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.2.mlp.linear_fc1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.2.mlp.linear_fc2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.2.mlp.linear_fc2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.2.norm1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.2.norm1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.2.norm2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.2.norm2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.20.attn.proj.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.20.attn.proj.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.20.attn.qkv.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.20.attn.qkv.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.20.mlp.linear_fc1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.20.mlp.linear_fc1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.20.mlp.linear_fc2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.20.mlp.linear_fc2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.20.norm1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.20.norm1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.20.norm2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.20.norm2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.21.attn.proj.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.21.attn.proj.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.21.attn.qkv.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.21.attn.qkv.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.21.mlp.linear_fc1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.21.mlp.linear_fc1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.21.mlp.linear_fc2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.21.mlp.linear_fc2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.21.norm1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.21.norm1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.21.norm2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.21.norm2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.22.attn.proj.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.22.attn.proj.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.22.attn.qkv.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.22.attn.qkv.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.22.mlp.linear_fc1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.22.mlp.linear_fc1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.22.mlp.linear_fc2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.22.mlp.linear_fc2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.22.norm1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.22.norm1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.22.norm2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.22.norm2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.23.attn.proj.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.23.attn.proj.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.23.attn.qkv.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.23.attn.qkv.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.23.mlp.linear_fc1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.23.mlp.linear_fc1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.23.mlp.linear_fc2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.23.mlp.linear_fc2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.23.norm1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.23.norm1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.23.norm2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.23.norm2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.24.attn.proj.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.24.attn.proj.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.24.attn.qkv.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.24.attn.qkv.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.24.mlp.linear_fc1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.24.mlp.linear_fc1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.24.mlp.linear_fc2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.24.mlp.linear_fc2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.24.norm1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.24.norm1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.24.norm2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.24.norm2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.25.attn.proj.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.25.attn.proj.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.25.attn.qkv.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.25.attn.qkv.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.25.mlp.linear_fc1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.25.mlp.linear_fc1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.25.mlp.linear_fc2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.25.mlp.linear_fc2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.25.norm1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.25.norm1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.25.norm2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.25.norm2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.26.attn.proj.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.26.attn.proj.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.26.attn.qkv.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.26.attn.qkv.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.26.mlp.linear_fc1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.26.mlp.linear_fc1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.26.mlp.linear_fc2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.26.mlp.linear_fc2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.26.norm1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.26.norm1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.26.norm2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.26.norm2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.3.attn.proj.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.3.attn.proj.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.3.attn.qkv.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.3.attn.qkv.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.3.mlp.linear_fc1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.3.mlp.linear_fc1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.3.mlp.linear_fc2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.3.mlp.linear_fc2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.3.norm1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.3.norm1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.3.norm2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.3.norm2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.4.attn.proj.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.4.attn.proj.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.4.attn.qkv.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.4.attn.qkv.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.4.mlp.linear_fc1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.4.mlp.linear_fc1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.4.mlp.linear_fc2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.4.mlp.linear_fc2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.4.norm1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.4.norm1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.4.norm2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.4.norm2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.5.attn.proj.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.5.attn.proj.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.5.attn.qkv.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.5.attn.qkv.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.5.mlp.linear_fc1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.5.mlp.linear_fc1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.5.mlp.linear_fc2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.5.mlp.linear_fc2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.5.norm1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.5.norm1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.5.norm2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.5.norm2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.6.attn.proj.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.6.attn.proj.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.6.attn.qkv.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.6.attn.qkv.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.6.mlp.linear_fc1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.6.mlp.linear_fc1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.6.mlp.linear_fc2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.6.mlp.linear_fc2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.6.norm1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.6.norm1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.6.norm2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.6.norm2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.7.attn.proj.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.7.attn.proj.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.7.attn.qkv.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.7.attn.qkv.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.7.mlp.linear_fc1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.7.mlp.linear_fc1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.7.mlp.linear_fc2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.7.mlp.linear_fc2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.7.norm1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.7.norm1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.7.norm2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.7.norm2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.8.attn.proj.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.8.attn.proj.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.8.attn.qkv.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.8.attn.qkv.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.8.mlp.linear_fc1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.8.mlp.linear_fc1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.8.mlp.linear_fc2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.8.mlp.linear_fc2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.8.norm1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.8.norm1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.8.norm2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.8.norm2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.9.attn.proj.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.9.attn.proj.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.9.attn.qkv.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.9.attn.qkv.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.9.mlp.linear_fc1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.9.mlp.linear_fc1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.9.mlp.linear_fc2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.9.mlp.linear_fc2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.9.norm1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.9.norm1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.9.norm2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.blocks.9.norm2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.merger.linear_fc1.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.merger.linear_fc1.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.merger.linear_fc2.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.merger.linear_fc2.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.merger.norm.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.merger.norm.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.patch_embed.proj.bias": "model-vision-00001-of-00001.safetensors", - "vision_tower.patch_embed.proj.weight": "model-vision-00001-of-00001.safetensors", - "vision_tower.pos_embed.weight": "model-vision-00001-of-00001.safetensors" + "vision_tower.blocks.0.attn.proj.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.0.attn.proj.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.0.attn.qkv.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.0.attn.qkv.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.0.mlp.linear_fc1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.0.mlp.linear_fc1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.0.mlp.linear_fc2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.0.mlp.linear_fc2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.0.norm1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.0.norm1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.0.norm2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.0.norm2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.1.attn.proj.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.1.attn.proj.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.1.attn.qkv.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.1.attn.qkv.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.1.mlp.linear_fc1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.1.mlp.linear_fc1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.1.mlp.linear_fc2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.1.mlp.linear_fc2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.1.norm1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.1.norm1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.1.norm2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.1.norm2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.10.attn.proj.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.10.attn.proj.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.10.attn.qkv.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.10.attn.qkv.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.10.mlp.linear_fc1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.10.mlp.linear_fc1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.10.mlp.linear_fc2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.10.mlp.linear_fc2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.10.norm1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.10.norm1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.10.norm2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.10.norm2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.11.attn.proj.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.11.attn.proj.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.11.attn.qkv.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.11.attn.qkv.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.11.mlp.linear_fc1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.11.mlp.linear_fc1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.11.mlp.linear_fc2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.11.mlp.linear_fc2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.11.norm1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.11.norm1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.11.norm2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.11.norm2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.12.attn.proj.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.12.attn.proj.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.12.attn.qkv.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.12.attn.qkv.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.12.mlp.linear_fc1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.12.mlp.linear_fc1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.12.mlp.linear_fc2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.12.mlp.linear_fc2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.12.norm1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.12.norm1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.12.norm2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.12.norm2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.13.attn.proj.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.13.attn.proj.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.13.attn.qkv.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.13.attn.qkv.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.13.mlp.linear_fc1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.13.mlp.linear_fc1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.13.mlp.linear_fc2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.13.mlp.linear_fc2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.13.norm1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.13.norm1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.13.norm2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.13.norm2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.14.attn.proj.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.14.attn.proj.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.14.attn.qkv.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.14.attn.qkv.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.14.mlp.linear_fc1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.14.mlp.linear_fc1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.14.mlp.linear_fc2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.14.mlp.linear_fc2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.14.norm1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.14.norm1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.14.norm2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.14.norm2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.15.attn.proj.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.15.attn.proj.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.15.attn.qkv.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.15.attn.qkv.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.15.mlp.linear_fc1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.15.mlp.linear_fc1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.15.mlp.linear_fc2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.15.mlp.linear_fc2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.15.norm1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.15.norm1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.15.norm2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.15.norm2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.16.attn.proj.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.16.attn.proj.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.16.attn.qkv.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.16.attn.qkv.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.16.mlp.linear_fc1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.16.mlp.linear_fc1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.16.mlp.linear_fc2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.16.mlp.linear_fc2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.16.norm1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.16.norm1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.16.norm2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.16.norm2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.17.attn.proj.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.17.attn.proj.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.17.attn.qkv.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.17.attn.qkv.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.17.mlp.linear_fc1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.17.mlp.linear_fc1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.17.mlp.linear_fc2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.17.mlp.linear_fc2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.17.norm1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.17.norm1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.17.norm2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.17.norm2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.18.attn.proj.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.18.attn.proj.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.18.attn.qkv.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.18.attn.qkv.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.18.mlp.linear_fc1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.18.mlp.linear_fc1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.18.mlp.linear_fc2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.18.mlp.linear_fc2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.18.norm1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.18.norm1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.18.norm2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.18.norm2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.19.attn.proj.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.19.attn.proj.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.19.attn.qkv.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.19.attn.qkv.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.19.mlp.linear_fc1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.19.mlp.linear_fc1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.19.mlp.linear_fc2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.19.mlp.linear_fc2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.19.norm1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.19.norm1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.19.norm2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.19.norm2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.2.attn.proj.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.2.attn.proj.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.2.attn.qkv.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.2.attn.qkv.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.2.mlp.linear_fc1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.2.mlp.linear_fc1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.2.mlp.linear_fc2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.2.mlp.linear_fc2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.2.norm1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.2.norm1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.2.norm2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.2.norm2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.20.attn.proj.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.20.attn.proj.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.20.attn.qkv.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.20.attn.qkv.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.20.mlp.linear_fc1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.20.mlp.linear_fc1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.20.mlp.linear_fc2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.20.mlp.linear_fc2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.20.norm1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.20.norm1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.20.norm2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.20.norm2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.21.attn.proj.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.21.attn.proj.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.21.attn.qkv.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.21.attn.qkv.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.21.mlp.linear_fc1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.21.mlp.linear_fc1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.21.mlp.linear_fc2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.21.mlp.linear_fc2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.21.norm1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.21.norm1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.21.norm2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.21.norm2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.22.attn.proj.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.22.attn.proj.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.22.attn.qkv.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.22.attn.qkv.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.22.mlp.linear_fc1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.22.mlp.linear_fc1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.22.mlp.linear_fc2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.22.mlp.linear_fc2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.22.norm1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.22.norm1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.22.norm2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.22.norm2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.23.attn.proj.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.23.attn.proj.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.23.attn.qkv.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.23.attn.qkv.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.23.mlp.linear_fc1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.23.mlp.linear_fc1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.23.mlp.linear_fc2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.23.mlp.linear_fc2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.23.norm1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.23.norm1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.23.norm2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.23.norm2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.24.attn.proj.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.24.attn.proj.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.24.attn.qkv.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.24.attn.qkv.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.24.mlp.linear_fc1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.24.mlp.linear_fc1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.24.mlp.linear_fc2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.24.mlp.linear_fc2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.24.norm1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.24.norm1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.24.norm2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.24.norm2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.25.attn.proj.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.25.attn.proj.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.25.attn.qkv.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.25.attn.qkv.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.25.mlp.linear_fc1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.25.mlp.linear_fc1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.25.mlp.linear_fc2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.25.mlp.linear_fc2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.25.norm1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.25.norm1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.25.norm2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.25.norm2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.26.attn.proj.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.26.attn.proj.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.26.attn.qkv.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.26.attn.qkv.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.26.mlp.linear_fc1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.26.mlp.linear_fc1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.26.mlp.linear_fc2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.26.mlp.linear_fc2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.26.norm1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.26.norm1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.26.norm2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.26.norm2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.3.attn.proj.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.3.attn.proj.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.3.attn.qkv.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.3.attn.qkv.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.3.mlp.linear_fc1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.3.mlp.linear_fc1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.3.mlp.linear_fc2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.3.mlp.linear_fc2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.3.norm1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.3.norm1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.3.norm2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.3.norm2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.4.attn.proj.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.4.attn.proj.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.4.attn.qkv.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.4.attn.qkv.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.4.mlp.linear_fc1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.4.mlp.linear_fc1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.4.mlp.linear_fc2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.4.mlp.linear_fc2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.4.norm1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.4.norm1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.4.norm2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.4.norm2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.5.attn.proj.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.5.attn.proj.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.5.attn.qkv.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.5.attn.qkv.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.5.mlp.linear_fc1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.5.mlp.linear_fc1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.5.mlp.linear_fc2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.5.mlp.linear_fc2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.5.norm1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.5.norm1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.5.norm2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.5.norm2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.6.attn.proj.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.6.attn.proj.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.6.attn.qkv.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.6.attn.qkv.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.6.mlp.linear_fc1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.6.mlp.linear_fc1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.6.mlp.linear_fc2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.6.mlp.linear_fc2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.6.norm1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.6.norm1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.6.norm2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.6.norm2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.7.attn.proj.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.7.attn.proj.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.7.attn.qkv.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.7.attn.qkv.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.7.mlp.linear_fc1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.7.mlp.linear_fc1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.7.mlp.linear_fc2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.7.mlp.linear_fc2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.7.norm1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.7.norm1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.7.norm2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.7.norm2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.8.attn.proj.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.8.attn.proj.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.8.attn.qkv.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.8.attn.qkv.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.8.mlp.linear_fc1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.8.mlp.linear_fc1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.8.mlp.linear_fc2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.8.mlp.linear_fc2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.8.norm1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.8.norm1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.8.norm2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.8.norm2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.9.attn.proj.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.9.attn.proj.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.9.attn.qkv.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.9.attn.qkv.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.9.mlp.linear_fc1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.9.mlp.linear_fc1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.9.mlp.linear_fc2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.9.mlp.linear_fc2.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.9.norm1.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.9.norm1.weight": "model-00001-of-00006.safetensors", + "vision_tower.blocks.9.norm2.bias": "model-00001-of-00006.safetensors", + "vision_tower.blocks.9.norm2.weight": "model-00001-of-00006.safetensors", + "vision_tower.merger.linear_fc1.bias": "model-00001-of-00006.safetensors", + "vision_tower.merger.linear_fc1.weight": "model-00001-of-00006.safetensors", + "vision_tower.merger.linear_fc2.bias": "model-00001-of-00006.safetensors", + "vision_tower.merger.linear_fc2.weight": "model-00001-of-00006.safetensors", + "vision_tower.merger.norm.bias": "model-00001-of-00006.safetensors", + "vision_tower.merger.norm.weight": "model-00001-of-00006.safetensors", + "vision_tower.patch_embed.proj.bias": "model-00001-of-00006.safetensors", + "vision_tower.patch_embed.proj.weight": "model-00001-of-00006.safetensors", + "vision_tower.pos_embed.weight": "model-00001-of-00006.safetensors" } } \ No newline at end of file