| { |
| "metadata": { |
| "total_parameters": 3697865088, |
| "total_size": 7395730176 |
| }, |
| "weight_map": { |
| "lm_head.weight": "model-00002-of-00002.safetensors", |
| "model.embedding.weight": "model-00001-of-00002.safetensors", |
| "model.final_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.0.attn.k_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.0.attn.linear_qkv.weight": "model-00001-of-00002.safetensors", |
| "model.layers.0.attn.q_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.0.attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.0.input_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.0.lin_attn.A_log": "model-00001-of-00002.safetensors", |
| "model.layers.0.lin_attn.dt_bias": "model-00001-of-00002.safetensors", |
| "model.layers.0.lin_attn.in_gate_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.0.lin_attn.k_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.0.lin_attn.q_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.0.lin_attn.v_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.0.lin_attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.0.mixer_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.0.mlp.fc_1.weight": "model-00001-of-00002.safetensors", |
| "model.layers.0.mlp.fc_2.weight": "model-00001-of-00002.safetensors", |
| "model.layers.0.postmixer_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.1.attn.linear_qkv.weight": "model-00001-of-00002.safetensors", |
| "model.layers.1.attn.q_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.1.attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.1.input_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.1.lin_attn.A_log": "model-00001-of-00002.safetensors", |
| "model.layers.1.lin_attn.dt_bias": "model-00001-of-00002.safetensors", |
| "model.layers.1.lin_attn.in_gate_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.1.lin_attn.k_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.1.lin_attn.q_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.1.lin_attn.v_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.1.lin_attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.1.mixer_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.1.mlp.fc_1.weight": "model-00001-of-00002.safetensors", |
| "model.layers.1.mlp.fc_2.weight": "model-00001-of-00002.safetensors", |
| "model.layers.1.postmixer_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.10.attn.linear_qkv.weight": "model-00001-of-00002.safetensors", |
| "model.layers.10.attn.q_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.10.attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.10.input_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.10.lin_attn.A_log": "model-00001-of-00002.safetensors", |
| "model.layers.10.lin_attn.dt_bias": "model-00001-of-00002.safetensors", |
| "model.layers.10.lin_attn.in_gate_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.10.lin_attn.k_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.10.lin_attn.q_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.10.lin_attn.v_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.10.lin_attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.10.mixer_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.10.mlp.fc_1.weight": "model-00001-of-00002.safetensors", |
| "model.layers.10.mlp.fc_2.weight": "model-00001-of-00002.safetensors", |
| "model.layers.10.postmixer_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.11.attn.k_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.11.attn.linear_qkv.weight": "model-00001-of-00002.safetensors", |
| "model.layers.11.attn.q_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.11.attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.11.input_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.11.lin_attn.A_log": "model-00001-of-00002.safetensors", |
| "model.layers.11.lin_attn.dt_bias": "model-00001-of-00002.safetensors", |
| "model.layers.11.lin_attn.in_gate_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.11.lin_attn.k_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.11.lin_attn.q_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.11.lin_attn.v_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.11.lin_attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.11.mixer_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.11.mlp.fc_1.weight": "model-00001-of-00002.safetensors", |
| "model.layers.11.mlp.fc_2.weight": "model-00001-of-00002.safetensors", |
| "model.layers.11.postmixer_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.12.attn.linear_qkv.weight": "model-00001-of-00002.safetensors", |
| "model.layers.12.attn.q_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.12.attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.12.input_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.12.lin_attn.A_log": "model-00001-of-00002.safetensors", |
| "model.layers.12.lin_attn.dt_bias": "model-00001-of-00002.safetensors", |
| "model.layers.12.lin_attn.in_gate_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.12.lin_attn.k_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.12.lin_attn.q_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.12.lin_attn.v_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.12.lin_attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.12.mixer_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.12.mlp.fc_1.weight": "model-00001-of-00002.safetensors", |
| "model.layers.12.mlp.fc_2.weight": "model-00001-of-00002.safetensors", |
| "model.layers.12.postmixer_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.13.attn.k_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.13.attn.lambda_k1": "model-00001-of-00002.safetensors", |
| "model.layers.13.attn.lambda_k2": "model-00001-of-00002.safetensors", |
| "model.layers.13.attn.lambda_q1": "model-00001-of-00002.safetensors", |
| "model.layers.13.attn.lambda_q2": "model-00001-of-00002.safetensors", |
| "model.layers.13.attn.linear_qkv.weight": "model-00001-of-00002.safetensors", |
| "model.layers.13.attn.q_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.13.attn.softmax_scaler": "model-00001-of-00002.safetensors", |
| "model.layers.13.attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.13.input_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.13.lin_attn.A_log": "model-00001-of-00002.safetensors", |
| "model.layers.13.lin_attn.dt_bias": "model-00001-of-00002.safetensors", |
| "model.layers.13.lin_attn.in_gate_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.13.lin_attn.k_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.13.lin_attn.q_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.13.lin_attn.v_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.13.lin_attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.13.mixer_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.13.mlp.fc_1.weight": "model-00001-of-00002.safetensors", |
| "model.layers.13.mlp.fc_2.weight": "model-00001-of-00002.safetensors", |
| "model.layers.13.postmixer_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.14.attn.k_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.14.attn.linear_qkv.weight": "model-00001-of-00002.safetensors", |
| "model.layers.14.attn.q_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.14.attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.14.input_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.14.lin_attn.A_log": "model-00001-of-00002.safetensors", |
| "model.layers.14.lin_attn.dt_bias": "model-00001-of-00002.safetensors", |
| "model.layers.14.lin_attn.in_gate_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.14.lin_attn.k_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.14.lin_attn.q_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.14.lin_attn.v_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.14.lin_attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.14.mixer_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.14.mlp.fc_1.weight": "model-00001-of-00002.safetensors", |
| "model.layers.14.mlp.fc_2.weight": "model-00001-of-00002.safetensors", |
| "model.layers.14.postmixer_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.15.attn.linear_qkv.weight": "model-00001-of-00002.safetensors", |
| "model.layers.15.attn.q_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.15.attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.15.input_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.15.lin_attn.A_log": "model-00001-of-00002.safetensors", |
| "model.layers.15.lin_attn.dt_bias": "model-00001-of-00002.safetensors", |
| "model.layers.15.lin_attn.in_gate_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.15.lin_attn.k_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.15.lin_attn.q_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.15.lin_attn.v_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.15.lin_attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.15.mixer_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.15.mlp.fc_1.weight": "model-00001-of-00002.safetensors", |
| "model.layers.15.mlp.fc_2.weight": "model-00001-of-00002.safetensors", |
| "model.layers.15.postmixer_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.16.attn.k_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.16.attn.linear_qkv.weight": "model-00001-of-00002.safetensors", |
| "model.layers.16.attn.q_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.16.attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.16.input_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.16.lin_attn.A_log": "model-00001-of-00002.safetensors", |
| "model.layers.16.lin_attn.dt_bias": "model-00001-of-00002.safetensors", |
| "model.layers.16.lin_attn.in_gate_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.16.lin_attn.k_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.16.lin_attn.q_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.16.lin_attn.v_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.16.lin_attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.16.mixer_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.16.mlp.fc_1.weight": "model-00001-of-00002.safetensors", |
| "model.layers.16.mlp.fc_2.weight": "model-00001-of-00002.safetensors", |
| "model.layers.16.postmixer_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.17.attn.linear_qkv.weight": "model-00001-of-00002.safetensors", |
| "model.layers.17.attn.q_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.17.attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.17.input_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.17.lin_attn.A_log": "model-00001-of-00002.safetensors", |
| "model.layers.17.lin_attn.dt_bias": "model-00001-of-00002.safetensors", |
| "model.layers.17.lin_attn.in_gate_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.17.lin_attn.k_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.17.lin_attn.q_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.17.lin_attn.v_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.17.lin_attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.17.mixer_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.17.mlp.fc_1.weight": "model-00001-of-00002.safetensors", |
| "model.layers.17.mlp.fc_2.weight": "model-00001-of-00002.safetensors", |
| "model.layers.17.postmixer_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.18.attn.k_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.18.attn.linear_qkv.weight": "model-00001-of-00002.safetensors", |
| "model.layers.18.attn.q_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.18.attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.18.input_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.18.lin_attn.A_log": "model-00001-of-00002.safetensors", |
| "model.layers.18.lin_attn.dt_bias": "model-00001-of-00002.safetensors", |
| "model.layers.18.lin_attn.in_gate_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.18.lin_attn.k_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.18.lin_attn.q_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.18.lin_attn.v_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.18.lin_attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.18.mixer_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.18.mlp.fc_1.weight": "model-00001-of-00002.safetensors", |
| "model.layers.18.mlp.fc_2.weight": "model-00001-of-00002.safetensors", |
| "model.layers.18.postmixer_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.19.attn.linear_qkv.weight": "model-00001-of-00002.safetensors", |
| "model.layers.19.attn.q_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.19.attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.19.input_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.19.lin_attn.A_log": "model-00001-of-00002.safetensors", |
| "model.layers.19.lin_attn.dt_bias": "model-00001-of-00002.safetensors", |
| "model.layers.19.lin_attn.in_gate_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.19.lin_attn.k_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.19.lin_attn.q_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.19.lin_attn.v_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.19.lin_attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.19.mixer_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.19.mlp.fc_1.weight": "model-00001-of-00002.safetensors", |
| "model.layers.19.mlp.fc_2.weight": "model-00001-of-00002.safetensors", |
| "model.layers.19.postmixer_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.2.attn.k_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.2.attn.linear_qkv.weight": "model-00001-of-00002.safetensors", |
| "model.layers.2.attn.q_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.2.attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.2.input_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.2.lin_attn.A_log": "model-00001-of-00002.safetensors", |
| "model.layers.2.lin_attn.dt_bias": "model-00001-of-00002.safetensors", |
| "model.layers.2.lin_attn.in_gate_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.2.lin_attn.k_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.2.lin_attn.q_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.2.lin_attn.v_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.2.lin_attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.2.mixer_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.2.mlp.fc_1.weight": "model-00001-of-00002.safetensors", |
| "model.layers.2.mlp.fc_2.weight": "model-00001-of-00002.safetensors", |
| "model.layers.2.postmixer_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.20.attn.k_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.20.attn.linear_qkv.weight": "model-00001-of-00002.safetensors", |
| "model.layers.20.attn.q_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.20.attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.20.input_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.20.lin_attn.A_log": "model-00001-of-00002.safetensors", |
| "model.layers.20.lin_attn.dt_bias": "model-00001-of-00002.safetensors", |
| "model.layers.20.lin_attn.in_gate_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.20.lin_attn.k_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.20.lin_attn.q_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.20.lin_attn.v_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.20.lin_attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.20.mixer_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.20.mlp.fc_1.weight": "model-00001-of-00002.safetensors", |
| "model.layers.20.mlp.fc_2.weight": "model-00001-of-00002.safetensors", |
| "model.layers.20.postmixer_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.21.attn.linear_qkv.weight": "model-00001-of-00002.safetensors", |
| "model.layers.21.attn.q_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.21.attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.21.input_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.21.lin_attn.A_log": "model-00001-of-00002.safetensors", |
| "model.layers.21.lin_attn.dt_bias": "model-00001-of-00002.safetensors", |
| "model.layers.21.lin_attn.in_gate_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.21.lin_attn.k_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.21.lin_attn.q_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.21.lin_attn.v_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.21.lin_attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.21.mixer_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.21.mlp.fc_1.weight": "model-00001-of-00002.safetensors", |
| "model.layers.21.mlp.fc_2.weight": "model-00001-of-00002.safetensors", |
| "model.layers.21.postmixer_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.22.attn.k_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.22.attn.lambda_k1": "model-00001-of-00002.safetensors", |
| "model.layers.22.attn.lambda_k2": "model-00001-of-00002.safetensors", |
| "model.layers.22.attn.lambda_q1": "model-00001-of-00002.safetensors", |
| "model.layers.22.attn.lambda_q2": "model-00001-of-00002.safetensors", |
| "model.layers.22.attn.linear_qkv.weight": "model-00001-of-00002.safetensors", |
| "model.layers.22.attn.q_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.22.attn.softmax_scaler": "model-00001-of-00002.safetensors", |
| "model.layers.22.attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.22.input_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.22.lin_attn.A_log": "model-00001-of-00002.safetensors", |
| "model.layers.22.lin_attn.dt_bias": "model-00001-of-00002.safetensors", |
| "model.layers.22.lin_attn.in_gate_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.22.lin_attn.k_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.22.lin_attn.q_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.22.lin_attn.v_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.22.lin_attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.22.mixer_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.22.mlp.fc_1.weight": "model-00001-of-00002.safetensors", |
| "model.layers.22.mlp.fc_2.weight": "model-00001-of-00002.safetensors", |
| "model.layers.22.postmixer_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.23.attn.k_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.23.attn.linear_qkv.weight": "model-00001-of-00002.safetensors", |
| "model.layers.23.attn.q_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.23.attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.23.input_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.23.lin_attn.A_log": "model-00001-of-00002.safetensors", |
| "model.layers.23.lin_attn.dt_bias": "model-00001-of-00002.safetensors", |
| "model.layers.23.lin_attn.in_gate_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.23.lin_attn.k_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.23.lin_attn.q_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.23.lin_attn.v_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.23.lin_attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.23.mixer_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.23.mlp.fc_1.weight": "model-00001-of-00002.safetensors", |
| "model.layers.23.mlp.fc_2.weight": "model-00001-of-00002.safetensors", |
| "model.layers.23.postmixer_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.24.attn.linear_qkv.weight": "model-00001-of-00002.safetensors", |
| "model.layers.24.attn.q_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.24.attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.24.input_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.24.lin_attn.A_log": "model-00001-of-00002.safetensors", |
| "model.layers.24.lin_attn.dt_bias": "model-00001-of-00002.safetensors", |
| "model.layers.24.lin_attn.in_gate_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.24.lin_attn.k_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.24.lin_attn.q_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.24.lin_attn.v_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.24.lin_attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.24.mixer_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.24.mlp.fc_1.weight": "model-00001-of-00002.safetensors", |
| "model.layers.24.mlp.fc_2.weight": "model-00001-of-00002.safetensors", |
| "model.layers.24.postmixer_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.25.attn.k_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.25.attn.linear_qkv.weight": "model-00001-of-00002.safetensors", |
| "model.layers.25.attn.q_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.25.attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.25.input_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.25.lin_attn.A_log": "model-00001-of-00002.safetensors", |
| "model.layers.25.lin_attn.dt_bias": "model-00001-of-00002.safetensors", |
| "model.layers.25.lin_attn.in_gate_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.25.lin_attn.k_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.25.lin_attn.q_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.25.lin_attn.v_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.25.lin_attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.25.mixer_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.25.mlp.fc_1.weight": "model-00001-of-00002.safetensors", |
| "model.layers.25.mlp.fc_2.weight": "model-00001-of-00002.safetensors", |
| "model.layers.25.postmixer_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.26.attn.linear_qkv.weight": "model-00002-of-00002.safetensors", |
| "model.layers.26.attn.q_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.26.attn_group_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.26.input_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.26.lin_attn.A_log": "model-00002-of-00002.safetensors", |
| "model.layers.26.lin_attn.dt_bias": "model-00002-of-00002.safetensors", |
| "model.layers.26.lin_attn.in_gate_proj.weight": "model-00002-of-00002.safetensors", |
| "model.layers.26.lin_attn.k_conv1d.weight": "model-00002-of-00002.safetensors", |
| "model.layers.26.lin_attn.q_conv1d.weight": "model-00002-of-00002.safetensors", |
| "model.layers.26.lin_attn.v_conv1d.weight": "model-00002-of-00002.safetensors", |
| "model.layers.26.lin_attn_group_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.26.mixer_proj.weight": "model-00002-of-00002.safetensors", |
| "model.layers.26.mlp.fc_1.weight": "model-00002-of-00002.safetensors", |
| "model.layers.26.mlp.fc_2.weight": "model-00002-of-00002.safetensors", |
| "model.layers.26.postmixer_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.27.attn.k_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.27.attn.linear_qkv.weight": "model-00002-of-00002.safetensors", |
| "model.layers.27.attn.q_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.27.attn_group_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.27.input_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.27.lin_attn.A_log": "model-00002-of-00002.safetensors", |
| "model.layers.27.lin_attn.dt_bias": "model-00002-of-00002.safetensors", |
| "model.layers.27.lin_attn.in_gate_proj.weight": "model-00002-of-00002.safetensors", |
| "model.layers.27.lin_attn.k_conv1d.weight": "model-00002-of-00002.safetensors", |
| "model.layers.27.lin_attn.q_conv1d.weight": "model-00002-of-00002.safetensors", |
| "model.layers.27.lin_attn.v_conv1d.weight": "model-00002-of-00002.safetensors", |
| "model.layers.27.lin_attn_group_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.27.mixer_proj.weight": "model-00002-of-00002.safetensors", |
| "model.layers.27.mlp.fc_1.weight": "model-00002-of-00002.safetensors", |
| "model.layers.27.mlp.fc_2.weight": "model-00002-of-00002.safetensors", |
| "model.layers.27.postmixer_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.28.attn.linear_qkv.weight": "model-00002-of-00002.safetensors", |
| "model.layers.28.attn.q_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.28.attn_group_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.28.input_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.28.lin_attn.A_log": "model-00002-of-00002.safetensors", |
| "model.layers.28.lin_attn.dt_bias": "model-00002-of-00002.safetensors", |
| "model.layers.28.lin_attn.in_gate_proj.weight": "model-00002-of-00002.safetensors", |
| "model.layers.28.lin_attn.k_conv1d.weight": "model-00002-of-00002.safetensors", |
| "model.layers.28.lin_attn.q_conv1d.weight": "model-00002-of-00002.safetensors", |
| "model.layers.28.lin_attn.v_conv1d.weight": "model-00002-of-00002.safetensors", |
| "model.layers.28.lin_attn_group_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.28.mixer_proj.weight": "model-00002-of-00002.safetensors", |
| "model.layers.28.mlp.fc_1.weight": "model-00002-of-00002.safetensors", |
| "model.layers.28.mlp.fc_2.weight": "model-00002-of-00002.safetensors", |
| "model.layers.28.postmixer_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.29.attn.k_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.29.attn.linear_qkv.weight": "model-00002-of-00002.safetensors", |
| "model.layers.29.attn.q_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.29.attn_group_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.29.input_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.29.lin_attn.A_log": "model-00002-of-00002.safetensors", |
| "model.layers.29.lin_attn.dt_bias": "model-00002-of-00002.safetensors", |
| "model.layers.29.lin_attn.in_gate_proj.weight": "model-00002-of-00002.safetensors", |
| "model.layers.29.lin_attn.k_conv1d.weight": "model-00002-of-00002.safetensors", |
| "model.layers.29.lin_attn.q_conv1d.weight": "model-00002-of-00002.safetensors", |
| "model.layers.29.lin_attn.v_conv1d.weight": "model-00002-of-00002.safetensors", |
| "model.layers.29.lin_attn_group_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.29.mixer_proj.weight": "model-00002-of-00002.safetensors", |
| "model.layers.29.mlp.fc_1.weight": "model-00002-of-00002.safetensors", |
| "model.layers.29.mlp.fc_2.weight": "model-00002-of-00002.safetensors", |
| "model.layers.29.postmixer_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.3.attn.linear_qkv.weight": "model-00001-of-00002.safetensors", |
| "model.layers.3.attn.q_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.3.attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.3.input_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.3.lin_attn.A_log": "model-00001-of-00002.safetensors", |
| "model.layers.3.lin_attn.dt_bias": "model-00001-of-00002.safetensors", |
| "model.layers.3.lin_attn.in_gate_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.3.lin_attn.k_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.3.lin_attn.q_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.3.lin_attn.v_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.3.lin_attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.3.mixer_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.3.mlp.fc_1.weight": "model-00001-of-00002.safetensors", |
| "model.layers.3.mlp.fc_2.weight": "model-00001-of-00002.safetensors", |
| "model.layers.3.postmixer_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.30.attn.linear_qkv.weight": "model-00002-of-00002.safetensors", |
| "model.layers.30.attn.q_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.30.attn_group_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.30.input_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.30.lin_attn.A_log": "model-00002-of-00002.safetensors", |
| "model.layers.30.lin_attn.dt_bias": "model-00002-of-00002.safetensors", |
| "model.layers.30.lin_attn.in_gate_proj.weight": "model-00002-of-00002.safetensors", |
| "model.layers.30.lin_attn.k_conv1d.weight": "model-00002-of-00002.safetensors", |
| "model.layers.30.lin_attn.q_conv1d.weight": "model-00002-of-00002.safetensors", |
| "model.layers.30.lin_attn.v_conv1d.weight": "model-00002-of-00002.safetensors", |
| "model.layers.30.lin_attn_group_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.30.mixer_proj.weight": "model-00002-of-00002.safetensors", |
| "model.layers.30.mlp.fc_1.weight": "model-00002-of-00002.safetensors", |
| "model.layers.30.mlp.fc_2.weight": "model-00002-of-00002.safetensors", |
| "model.layers.30.postmixer_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.31.attn.k_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.31.attn.lambda_k1": "model-00002-of-00002.safetensors", |
| "model.layers.31.attn.lambda_k2": "model-00002-of-00002.safetensors", |
| "model.layers.31.attn.lambda_q1": "model-00002-of-00002.safetensors", |
| "model.layers.31.attn.lambda_q2": "model-00002-of-00002.safetensors", |
| "model.layers.31.attn.linear_qkv.weight": "model-00002-of-00002.safetensors", |
| "model.layers.31.attn.q_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.31.attn.softmax_scaler": "model-00002-of-00002.safetensors", |
| "model.layers.31.attn_group_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.31.input_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.31.lin_attn.A_log": "model-00002-of-00002.safetensors", |
| "model.layers.31.lin_attn.dt_bias": "model-00002-of-00002.safetensors", |
| "model.layers.31.lin_attn.in_gate_proj.weight": "model-00002-of-00002.safetensors", |
| "model.layers.31.lin_attn.k_conv1d.weight": "model-00002-of-00002.safetensors", |
| "model.layers.31.lin_attn.q_conv1d.weight": "model-00002-of-00002.safetensors", |
| "model.layers.31.lin_attn.v_conv1d.weight": "model-00002-of-00002.safetensors", |
| "model.layers.31.lin_attn_group_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.31.mixer_proj.weight": "model-00002-of-00002.safetensors", |
| "model.layers.31.mlp.fc_1.weight": "model-00002-of-00002.safetensors", |
| "model.layers.31.mlp.fc_2.weight": "model-00002-of-00002.safetensors", |
| "model.layers.31.postmixer_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.32.attn.k_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.32.attn.linear_qkv.weight": "model-00002-of-00002.safetensors", |
| "model.layers.32.attn.q_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.32.attn_group_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.32.input_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.32.lin_attn.A_log": "model-00002-of-00002.safetensors", |
| "model.layers.32.lin_attn.dt_bias": "model-00002-of-00002.safetensors", |
| "model.layers.32.lin_attn.in_gate_proj.weight": "model-00002-of-00002.safetensors", |
| "model.layers.32.lin_attn.k_conv1d.weight": "model-00002-of-00002.safetensors", |
| "model.layers.32.lin_attn.q_conv1d.weight": "model-00002-of-00002.safetensors", |
| "model.layers.32.lin_attn.v_conv1d.weight": "model-00002-of-00002.safetensors", |
| "model.layers.32.lin_attn_group_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.32.mixer_proj.weight": "model-00002-of-00002.safetensors", |
| "model.layers.32.mlp.fc_1.weight": "model-00002-of-00002.safetensors", |
| "model.layers.32.mlp.fc_2.weight": "model-00002-of-00002.safetensors", |
| "model.layers.32.postmixer_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.33.attn.linear_qkv.weight": "model-00002-of-00002.safetensors", |
| "model.layers.33.attn.q_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.33.attn_group_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.33.input_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.33.lin_attn.A_log": "model-00002-of-00002.safetensors", |
| "model.layers.33.lin_attn.dt_bias": "model-00002-of-00002.safetensors", |
| "model.layers.33.lin_attn.in_gate_proj.weight": "model-00002-of-00002.safetensors", |
| "model.layers.33.lin_attn.k_conv1d.weight": "model-00002-of-00002.safetensors", |
| "model.layers.33.lin_attn.q_conv1d.weight": "model-00002-of-00002.safetensors", |
| "model.layers.33.lin_attn.v_conv1d.weight": "model-00002-of-00002.safetensors", |
| "model.layers.33.lin_attn_group_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.33.mixer_proj.weight": "model-00002-of-00002.safetensors", |
| "model.layers.33.mlp.fc_1.weight": "model-00002-of-00002.safetensors", |
| "model.layers.33.mlp.fc_2.weight": "model-00002-of-00002.safetensors", |
| "model.layers.33.postmixer_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.34.attn.k_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.34.attn.linear_qkv.weight": "model-00002-of-00002.safetensors", |
| "model.layers.34.attn.q_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.34.attn_group_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.34.input_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.34.lin_attn.A_log": "model-00002-of-00002.safetensors", |
| "model.layers.34.lin_attn.dt_bias": "model-00002-of-00002.safetensors", |
| "model.layers.34.lin_attn.in_gate_proj.weight": "model-00002-of-00002.safetensors", |
| "model.layers.34.lin_attn.k_conv1d.weight": "model-00002-of-00002.safetensors", |
| "model.layers.34.lin_attn.q_conv1d.weight": "model-00002-of-00002.safetensors", |
| "model.layers.34.lin_attn.v_conv1d.weight": "model-00002-of-00002.safetensors", |
| "model.layers.34.lin_attn_group_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.34.mixer_proj.weight": "model-00002-of-00002.safetensors", |
| "model.layers.34.mlp.fc_1.weight": "model-00002-of-00002.safetensors", |
| "model.layers.34.mlp.fc_2.weight": "model-00002-of-00002.safetensors", |
| "model.layers.34.postmixer_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.35.attn.linear_qkv.weight": "model-00002-of-00002.safetensors", |
| "model.layers.35.attn.q_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.35.attn_group_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.35.input_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.35.lin_attn.A_log": "model-00002-of-00002.safetensors", |
| "model.layers.35.lin_attn.dt_bias": "model-00002-of-00002.safetensors", |
| "model.layers.35.lin_attn.in_gate_proj.weight": "model-00002-of-00002.safetensors", |
| "model.layers.35.lin_attn.k_conv1d.weight": "model-00002-of-00002.safetensors", |
| "model.layers.35.lin_attn.q_conv1d.weight": "model-00002-of-00002.safetensors", |
| "model.layers.35.lin_attn.v_conv1d.weight": "model-00002-of-00002.safetensors", |
| "model.layers.35.lin_attn_group_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.35.mixer_proj.weight": "model-00002-of-00002.safetensors", |
| "model.layers.35.mlp.fc_1.weight": "model-00002-of-00002.safetensors", |
| "model.layers.35.mlp.fc_2.weight": "model-00002-of-00002.safetensors", |
| "model.layers.35.postmixer_norm.weight": "model-00002-of-00002.safetensors", |
| "model.layers.4.attn.k_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.4.attn.lambda_k1": "model-00001-of-00002.safetensors", |
| "model.layers.4.attn.lambda_k2": "model-00001-of-00002.safetensors", |
| "model.layers.4.attn.lambda_q1": "model-00001-of-00002.safetensors", |
| "model.layers.4.attn.lambda_q2": "model-00001-of-00002.safetensors", |
| "model.layers.4.attn.linear_qkv.weight": "model-00001-of-00002.safetensors", |
| "model.layers.4.attn.q_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.4.attn.softmax_scaler": "model-00001-of-00002.safetensors", |
| "model.layers.4.attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.4.input_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.4.lin_attn.A_log": "model-00001-of-00002.safetensors", |
| "model.layers.4.lin_attn.dt_bias": "model-00001-of-00002.safetensors", |
| "model.layers.4.lin_attn.in_gate_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.4.lin_attn.k_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.4.lin_attn.q_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.4.lin_attn.v_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.4.lin_attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.4.mixer_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.4.mlp.fc_1.weight": "model-00001-of-00002.safetensors", |
| "model.layers.4.mlp.fc_2.weight": "model-00001-of-00002.safetensors", |
| "model.layers.4.postmixer_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.5.attn.k_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.5.attn.linear_qkv.weight": "model-00001-of-00002.safetensors", |
| "model.layers.5.attn.q_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.5.attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.5.input_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.5.lin_attn.A_log": "model-00001-of-00002.safetensors", |
| "model.layers.5.lin_attn.dt_bias": "model-00001-of-00002.safetensors", |
| "model.layers.5.lin_attn.in_gate_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.5.lin_attn.k_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.5.lin_attn.q_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.5.lin_attn.v_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.5.lin_attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.5.mixer_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.5.mlp.fc_1.weight": "model-00001-of-00002.safetensors", |
| "model.layers.5.mlp.fc_2.weight": "model-00001-of-00002.safetensors", |
| "model.layers.5.postmixer_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.6.attn.linear_qkv.weight": "model-00001-of-00002.safetensors", |
| "model.layers.6.attn.q_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.6.attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.6.input_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.6.lin_attn.A_log": "model-00001-of-00002.safetensors", |
| "model.layers.6.lin_attn.dt_bias": "model-00001-of-00002.safetensors", |
| "model.layers.6.lin_attn.in_gate_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.6.lin_attn.k_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.6.lin_attn.q_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.6.lin_attn.v_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.6.lin_attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.6.mixer_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.6.mlp.fc_1.weight": "model-00001-of-00002.safetensors", |
| "model.layers.6.mlp.fc_2.weight": "model-00001-of-00002.safetensors", |
| "model.layers.6.postmixer_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.7.attn.k_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.7.attn.linear_qkv.weight": "model-00001-of-00002.safetensors", |
| "model.layers.7.attn.q_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.7.attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.7.input_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.7.lin_attn.A_log": "model-00001-of-00002.safetensors", |
| "model.layers.7.lin_attn.dt_bias": "model-00001-of-00002.safetensors", |
| "model.layers.7.lin_attn.in_gate_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.7.lin_attn.k_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.7.lin_attn.q_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.7.lin_attn.v_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.7.lin_attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.7.mixer_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.7.mlp.fc_1.weight": "model-00001-of-00002.safetensors", |
| "model.layers.7.mlp.fc_2.weight": "model-00001-of-00002.safetensors", |
| "model.layers.7.postmixer_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.8.attn.linear_qkv.weight": "model-00001-of-00002.safetensors", |
| "model.layers.8.attn.q_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.8.attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.8.input_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.8.lin_attn.A_log": "model-00001-of-00002.safetensors", |
| "model.layers.8.lin_attn.dt_bias": "model-00001-of-00002.safetensors", |
| "model.layers.8.lin_attn.in_gate_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.8.lin_attn.k_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.8.lin_attn.q_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.8.lin_attn.v_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.8.lin_attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.8.mixer_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.8.mlp.fc_1.weight": "model-00001-of-00002.safetensors", |
| "model.layers.8.mlp.fc_2.weight": "model-00001-of-00002.safetensors", |
| "model.layers.8.postmixer_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.9.attn.k_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.9.attn.linear_qkv.weight": "model-00001-of-00002.safetensors", |
| "model.layers.9.attn.q_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.9.attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.9.input_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.9.lin_attn.A_log": "model-00001-of-00002.safetensors", |
| "model.layers.9.lin_attn.dt_bias": "model-00001-of-00002.safetensors", |
| "model.layers.9.lin_attn.in_gate_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.9.lin_attn.k_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.9.lin_attn.q_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.9.lin_attn.v_conv1d.weight": "model-00001-of-00002.safetensors", |
| "model.layers.9.lin_attn_group_norm.weight": "model-00001-of-00002.safetensors", |
| "model.layers.9.mixer_proj.weight": "model-00001-of-00002.safetensors", |
| "model.layers.9.mlp.fc_1.weight": "model-00001-of-00002.safetensors", |
| "model.layers.9.mlp.fc_2.weight": "model-00001-of-00002.safetensors", |
| "model.layers.9.postmixer_norm.weight": "model-00001-of-00002.safetensors" |
| } |
| } |
|
|