diff --git "a/text_decoder.mlmodelc/model.mil" "b/text_decoder.mlmodelc/model.mil" new file mode 100644--- /dev/null +++ "b/text_decoder.mlmodelc/model.mil" @@ -0,0 +1,4145 @@ +program(1.0) +[buildInfo = dict, tensor>({{"coremlc-component-MIL", "3520.4.1"}, {"coremlc-version", "3520.5.1"}})] +{ + func main(tensor inputs_embeds) { + tensor var_74 = const()[name = tensor("op_74"), val = tensor(-1)]; + tensor inputs_embeds_to_fp16_dtype_0 = const()[name = tensor("inputs_embeds_to_fp16_dtype_0"), val = tensor("fp16")]; + tensor var_73_promoted_to_fp16 = const()[name = tensor("op_73_promoted_to_fp16"), val = tensor(0x1p+1)]; + tensor inputs_embeds_to_fp16 = cast(dtype = inputs_embeds_to_fp16_dtype_0, x = inputs_embeds)[name = tensor("cast_0")]; + tensor var_83_cast_fp16 = pow(x = inputs_embeds_to_fp16, y = var_73_promoted_to_fp16)[name = tensor("op_83_cast_fp16")]; + tensor var_85_axes_0 = const()[name = tensor("op_85_axes_0"), val = tensor([-1])]; + tensor var_85_keep_dims_0 = const()[name = tensor("op_85_keep_dims_0"), val = tensor(true)]; + tensor var_85_cast_fp16 = reduce_mean(axes = var_85_axes_0, keep_dims = var_85_keep_dims_0, x = var_83_cast_fp16)[name = tensor("op_85_cast_fp16")]; + tensor var_86_to_fp16 = const()[name = tensor("op_86_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_87_cast_fp16 = add(x = var_85_cast_fp16, y = var_86_to_fp16)[name = tensor("op_87_cast_fp16")]; + tensor norm_1_epsilon_0 = const()[name = tensor("norm_1_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_1_cast_fp16 = rsqrt(epsilon = norm_1_epsilon_0, x = var_87_cast_fp16)[name = tensor("norm_1_cast_fp16")]; + tensor var_89_cast_fp16 = mul(x = inputs_embeds_to_fp16, y = norm_1_cast_fp16)[name = tensor("op_89_cast_fp16")]; + tensor layers_0_input_layernorm_weight_to_fp16 = const()[name = tensor("layers_0_input_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(64)))]; + tensor var_90_cast_fp16 = mul(x = var_89_cast_fp16, y = layers_0_input_layernorm_weight_to_fp16)[name = tensor("op_90_cast_fp16")]; + tensor layers_0_self_attn_q_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(2176))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(2099392))), name = tensor("layers_0_self_attn_q_proj_weight_to_fp16_palettized"), shape = tensor([2048, 1024])]; + tensor linear_0_bias_0_to_fp16 = const()[name = tensor("linear_0_bias_0_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(2099968)))]; + tensor linear_0_cast_fp16 = linear(bias = linear_0_bias_0_to_fp16, weight = layers_0_self_attn_q_proj_weight_to_fp16_palettized, x = var_90_cast_fp16)[name = tensor("linear_0_cast_fp16")]; + tensor var_106 = const()[name = tensor("op_106"), val = tensor([1, 768, 16, 128])]; + tensor var_107_cast_fp16 = reshape(shape = var_106, x = linear_0_cast_fp16)[name = tensor("op_107_cast_fp16")]; + tensor x_5_perm_0 = const()[name = tensor("x_5_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_0_self_attn_k_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(2104128))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(3152768))), name = tensor("layers_0_self_attn_k_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_1_bias_0_to_fp16 = const()[name = tensor("linear_1_bias_0_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(3153344)))]; + tensor linear_1_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_0_self_attn_k_proj_weight_to_fp16_palettized, x = var_90_cast_fp16)[name = tensor("linear_1_cast_fp16")]; + tensor var_111 = const()[name = tensor("op_111"), val = tensor([1, 768, 8, 128])]; + tensor var_112_cast_fp16 = reshape(shape = var_111, x = linear_1_cast_fp16)[name = tensor("op_112_cast_fp16")]; + tensor x_9_perm_0 = const()[name = tensor("x_9_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_0_self_attn_v_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(3155456))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(4204096))), name = tensor("layers_0_self_attn_v_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_2_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_0_self_attn_v_proj_weight_to_fp16_palettized, x = var_90_cast_fp16)[name = tensor("linear_2_cast_fp16")]; + tensor var_116 = const()[name = tensor("op_116"), val = tensor([1, 768, 8, 128])]; + tensor var_117_cast_fp16 = reshape(shape = var_116, x = linear_2_cast_fp16)[name = tensor("op_117_cast_fp16")]; + tensor transpose_112_perm_0 = const()[name = tensor("transpose_112_perm_0"), val = tensor([2, 0, 1, 3])]; + tensor var_73_promoted_1_to_fp16 = const()[name = tensor("op_73_promoted_1_to_fp16"), val = tensor(0x1p+1)]; + tensor x_5_cast_fp16 = transpose(perm = x_5_perm_0, x = var_107_cast_fp16)[name = tensor("transpose_251")]; + tensor var_121_cast_fp16 = pow(x = x_5_cast_fp16, y = var_73_promoted_1_to_fp16)[name = tensor("op_121_cast_fp16")]; + tensor var_123_axes_0 = const()[name = tensor("op_123_axes_0"), val = tensor([-1])]; + tensor var_123_keep_dims_0 = const()[name = tensor("op_123_keep_dims_0"), val = tensor(true)]; + tensor var_123_cast_fp16 = reduce_mean(axes = var_123_axes_0, keep_dims = var_123_keep_dims_0, x = var_121_cast_fp16)[name = tensor("op_123_cast_fp16")]; + tensor var_124_to_fp16 = const()[name = tensor("op_124_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_125_cast_fp16 = add(x = var_123_cast_fp16, y = var_124_to_fp16)[name = tensor("op_125_cast_fp16")]; + tensor norm_3_epsilon_0 = const()[name = tensor("norm_3_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_3_cast_fp16 = rsqrt(epsilon = norm_3_epsilon_0, x = var_125_cast_fp16)[name = tensor("norm_3_cast_fp16")]; + tensor var_127_cast_fp16 = mul(x = x_5_cast_fp16, y = norm_3_cast_fp16)[name = tensor("op_127_cast_fp16")]; + tensor layers_0_self_attn_q_norm_weight_to_fp16 = const()[name = tensor("layers_0_self_attn_q_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(4204672)))]; + tensor var_128_cast_fp16 = mul(x = var_127_cast_fp16, y = layers_0_self_attn_q_norm_weight_to_fp16)[name = tensor("op_128_cast_fp16")]; + tensor var_73_promoted_2_to_fp16 = const()[name = tensor("op_73_promoted_2_to_fp16"), val = tensor(0x1p+1)]; + tensor x_9_cast_fp16 = transpose(perm = x_9_perm_0, x = var_112_cast_fp16)[name = tensor("transpose_250")]; + tensor var_132_cast_fp16 = pow(x = x_9_cast_fp16, y = var_73_promoted_2_to_fp16)[name = tensor("op_132_cast_fp16")]; + tensor var_134_axes_0 = const()[name = tensor("op_134_axes_0"), val = tensor([-1])]; + tensor var_134_keep_dims_0 = const()[name = tensor("op_134_keep_dims_0"), val = tensor(true)]; + tensor var_134_cast_fp16 = reduce_mean(axes = var_134_axes_0, keep_dims = var_134_keep_dims_0, x = var_132_cast_fp16)[name = tensor("op_134_cast_fp16")]; + tensor var_135_to_fp16 = const()[name = tensor("op_135_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_136_cast_fp16 = add(x = var_134_cast_fp16, y = var_135_to_fp16)[name = tensor("op_136_cast_fp16")]; + tensor norm_5_epsilon_0 = const()[name = tensor("norm_5_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_5_cast_fp16 = rsqrt(epsilon = norm_5_epsilon_0, x = var_136_cast_fp16)[name = tensor("norm_5_cast_fp16")]; + tensor var_138_cast_fp16 = mul(x = x_9_cast_fp16, y = norm_5_cast_fp16)[name = tensor("op_138_cast_fp16")]; + tensor layers_0_self_attn_k_norm_weight_to_fp16 = const()[name = tensor("layers_0_self_attn_k_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(4204992)))]; + tensor var_139_cast_fp16 = mul(x = var_138_cast_fp16, y = layers_0_self_attn_k_norm_weight_to_fp16)[name = tensor("op_139_cast_fp16")]; + tensor x1_1_begin_0 = const()[name = tensor("x1_1_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_1_end_0 = const()[name = tensor("x1_1_end_0"), val = tensor([1, 16, 768, 64])]; + tensor x1_1_end_mask_0 = const()[name = tensor("x1_1_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_1_cast_fp16 = slice_by_index(begin = x1_1_begin_0, end = x1_1_end_0, end_mask = x1_1_end_mask_0, x = var_128_cast_fp16)[name = tensor("x1_1_cast_fp16")]; + tensor x2_1_begin_0 = const()[name = tensor("x2_1_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_1_end_0 = const()[name = tensor("x2_1_end_0"), val = tensor([1, 16, 768, 128])]; + tensor x2_1_end_mask_0 = const()[name = tensor("x2_1_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_1_cast_fp16 = slice_by_index(begin = x2_1_begin_0, end = x2_1_end_0, end_mask = x2_1_end_mask_0, x = var_128_cast_fp16)[name = tensor("x2_1_cast_fp16")]; + tensor cos_1_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(4205312))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(4254528))), name = tensor("cos_1_to_fp16_palettized"), shape = tensor([1, 1, 768, 64])]; + tensor var_156_cast_fp16 = mul(x = x1_1_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_156_cast_fp16")]; + tensor sin_1_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(4255104))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(4304320))), name = tensor("sin_1_to_fp16_palettized"), shape = tensor([1, 1, 768, 64])]; + tensor var_157_cast_fp16 = mul(x = x2_1_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_157_cast_fp16")]; + tensor var_158_cast_fp16 = sub(x = var_156_cast_fp16, y = var_157_cast_fp16)[name = tensor("op_158_cast_fp16")]; + tensor var_159_cast_fp16 = mul(x = x2_1_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_159_cast_fp16")]; + tensor var_160_cast_fp16 = mul(x = x1_1_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_160_cast_fp16")]; + tensor var_161_cast_fp16 = add(x = var_159_cast_fp16, y = var_160_cast_fp16)[name = tensor("op_161_cast_fp16")]; + tensor q_1_interleave_0 = const()[name = tensor("q_1_interleave_0"), val = tensor(false)]; + tensor q_1_cast_fp16 = concat(axis = var_74, interleave = q_1_interleave_0, values = (var_158_cast_fp16, var_161_cast_fp16))[name = tensor("q_1_cast_fp16")]; + tensor x1_3_begin_0 = const()[name = tensor("x1_3_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_3_end_0 = const()[name = tensor("x1_3_end_0"), val = tensor([1, 8, 768, 64])]; + tensor x1_3_end_mask_0 = const()[name = tensor("x1_3_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_3_cast_fp16 = slice_by_index(begin = x1_3_begin_0, end = x1_3_end_0, end_mask = x1_3_end_mask_0, x = var_139_cast_fp16)[name = tensor("x1_3_cast_fp16")]; + tensor x2_3_begin_0 = const()[name = tensor("x2_3_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_3_end_0 = const()[name = tensor("x2_3_end_0"), val = tensor([1, 8, 768, 128])]; + tensor x2_3_end_mask_0 = const()[name = tensor("x2_3_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_3_cast_fp16 = slice_by_index(begin = x2_3_begin_0, end = x2_3_end_0, end_mask = x2_3_end_mask_0, x = var_139_cast_fp16)[name = tensor("x2_3_cast_fp16")]; + tensor var_179_cast_fp16 = mul(x = x1_3_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_179_cast_fp16")]; + tensor var_180_cast_fp16 = mul(x = x2_3_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_180_cast_fp16")]; + tensor var_181_cast_fp16 = sub(x = var_179_cast_fp16, y = var_180_cast_fp16)[name = tensor("op_181_cast_fp16")]; + tensor var_182_cast_fp16 = mul(x = x2_3_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_182_cast_fp16")]; + tensor var_183_cast_fp16 = mul(x = x1_3_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_183_cast_fp16")]; + tensor var_184_cast_fp16 = add(x = var_182_cast_fp16, y = var_183_cast_fp16)[name = tensor("op_184_cast_fp16")]; + tensor k_1_interleave_0 = const()[name = tensor("k_1_interleave_0"), val = tensor(false)]; + tensor k_1_cast_fp16 = concat(axis = var_74, interleave = k_1_interleave_0, values = (var_181_cast_fp16, var_184_cast_fp16))[name = tensor("k_1_cast_fp16")]; + tensor transpose_0_perm_0 = const()[name = tensor("transpose_0_perm_0"), val = tensor([1, 0, 2, 3])]; + tensor tile_0_reps_0 = const()[name = tensor("tile_0_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_0_cast_fp16 = transpose(perm = transpose_0_perm_0, x = k_1_cast_fp16)[name = tensor("transpose_249")]; + tensor tile_0_cast_fp16 = tile(reps = tile_0_reps_0, x = transpose_0_cast_fp16)[name = tensor("tile_0_cast_fp16")]; + tensor concat_0 = const()[name = tensor("concat_0"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_0_cast_fp16 = reshape(shape = concat_0, x = tile_0_cast_fp16)[name = tensor("reshape_0_cast_fp16")]; + tensor transpose_1_perm_0 = const()[name = tensor("transpose_1_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_1 = const()[name = tensor("concat_1"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_1_cast_fp16 = transpose(perm = transpose_1_perm_0, x = reshape_0_cast_fp16)[name = tensor("transpose_248")]; + tensor reshape_1_cast_fp16 = reshape(shape = concat_1, x = transpose_1_cast_fp16)[name = tensor("reshape_1_cast_fp16")]; + tensor transpose_113_perm_0 = const()[name = tensor("transpose_113_perm_0"), val = tensor([1, 0, -1, -2])]; + tensor tile_1_reps_0 = const()[name = tensor("tile_1_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_112_cast_fp16 = transpose(perm = transpose_112_perm_0, x = var_117_cast_fp16)[name = tensor("transpose_247")]; + tensor tile_1_cast_fp16 = tile(reps = tile_1_reps_0, x = transpose_112_cast_fp16)[name = tensor("tile_1_cast_fp16")]; + tensor concat_2 = const()[name = tensor("concat_2"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_2_cast_fp16 = reshape(shape = concat_2, x = tile_1_cast_fp16)[name = tensor("reshape_2_cast_fp16")]; + tensor transpose_3_perm_0 = const()[name = tensor("transpose_3_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_3 = const()[name = tensor("concat_3"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_3_cast_fp16 = transpose(perm = transpose_3_perm_0, x = reshape_2_cast_fp16)[name = tensor("transpose_246")]; + tensor reshape_3_cast_fp16 = reshape(shape = concat_3, x = transpose_3_cast_fp16)[name = tensor("reshape_3_cast_fp16")]; + tensor v_3_perm_0 = const()[name = tensor("v_3_perm_0"), val = tensor([1, 0, -2, -1])]; + tensor var_190_transpose_x_0 = const()[name = tensor("op_190_transpose_x_0"), val = tensor(false)]; + tensor var_190_transpose_y_0 = const()[name = tensor("op_190_transpose_y_0"), val = tensor(false)]; + tensor transpose_113_cast_fp16 = transpose(perm = transpose_113_perm_0, x = reshape_1_cast_fp16)[name = tensor("transpose_245")]; + tensor var_190_cast_fp16 = matmul(transpose_x = var_190_transpose_x_0, transpose_y = var_190_transpose_y_0, x = q_1_cast_fp16, y = transpose_113_cast_fp16)[name = tensor("op_190_cast_fp16")]; + tensor var_191_to_fp16 = const()[name = tensor("op_191_to_fp16"), val = tensor(0x1.6ap-4)]; + tensor attn_1_cast_fp16 = mul(x = var_190_cast_fp16, y = var_191_to_fp16)[name = tensor("attn_1_cast_fp16")]; + tensor causal_mask_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(4304896))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(4894784))), name = tensor("causal_mask_to_fp16_palettized"), shape = tensor([1, 1, 768, 768])]; + tensor input_1_cast_fp16 = add(x = attn_1_cast_fp16, y = causal_mask_to_fp16_palettized)[name = tensor("input_1_cast_fp16")]; + tensor attn_3_cast_fp16 = softmax(axis = var_74, x = input_1_cast_fp16)[name = tensor("attn_3_cast_fp16")]; + tensor var_195_transpose_x_0 = const()[name = tensor("op_195_transpose_x_0"), val = tensor(false)]; + tensor var_195_transpose_y_0 = const()[name = tensor("op_195_transpose_y_0"), val = tensor(false)]; + tensor v_3_cast_fp16 = transpose(perm = v_3_perm_0, x = reshape_3_cast_fp16)[name = tensor("transpose_244")]; + tensor var_195_cast_fp16 = matmul(transpose_x = var_195_transpose_x_0, transpose_y = var_195_transpose_y_0, x = attn_3_cast_fp16, y = v_3_cast_fp16)[name = tensor("op_195_cast_fp16")]; + tensor var_196_perm_0 = const()[name = tensor("op_196_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor var_197 = const()[name = tensor("op_197"), val = tensor([1, 768, 2048])]; + tensor var_196_cast_fp16 = transpose(perm = var_196_perm_0, x = var_195_cast_fp16)[name = tensor("transpose_243")]; + tensor input_3_cast_fp16 = reshape(shape = var_197, x = var_196_cast_fp16)[name = tensor("input_3_cast_fp16")]; + tensor layers_0_self_attn_o_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(4895360))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(6992576))), name = tensor("layers_0_self_attn_o_proj_weight_to_fp16_palettized"), shape = tensor([1024, 2048])]; + tensor linear_3_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_0_self_attn_o_proj_weight_to_fp16_palettized, x = input_3_cast_fp16)[name = tensor("linear_3_cast_fp16")]; + tensor x_17_cast_fp16 = add(x = inputs_embeds_to_fp16, y = linear_3_cast_fp16)[name = tensor("x_17_cast_fp16")]; + tensor var_73_promoted_3_to_fp16 = const()[name = tensor("op_73_promoted_3_to_fp16"), val = tensor(0x1p+1)]; + tensor var_204_cast_fp16 = pow(x = x_17_cast_fp16, y = var_73_promoted_3_to_fp16)[name = tensor("op_204_cast_fp16")]; + tensor var_206_axes_0 = const()[name = tensor("op_206_axes_0"), val = tensor([-1])]; + tensor var_206_keep_dims_0 = const()[name = tensor("op_206_keep_dims_0"), val = tensor(true)]; + tensor var_206_cast_fp16 = reduce_mean(axes = var_206_axes_0, keep_dims = var_206_keep_dims_0, x = var_204_cast_fp16)[name = tensor("op_206_cast_fp16")]; + tensor var_207_to_fp16 = const()[name = tensor("op_207_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_208_cast_fp16 = add(x = var_206_cast_fp16, y = var_207_to_fp16)[name = tensor("op_208_cast_fp16")]; + tensor norm_7_epsilon_0 = const()[name = tensor("norm_7_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_7_cast_fp16 = rsqrt(epsilon = norm_7_epsilon_0, x = var_208_cast_fp16)[name = tensor("norm_7_cast_fp16")]; + tensor var_210_cast_fp16 = mul(x = x_17_cast_fp16, y = norm_7_cast_fp16)[name = tensor("op_210_cast_fp16")]; + tensor layers_0_post_attention_layernorm_weight_to_fp16 = const()[name = tensor("layers_0_post_attention_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(6993152)))]; + tensor var_211_cast_fp16 = mul(x = var_210_cast_fp16, y = layers_0_post_attention_layernorm_weight_to_fp16)[name = tensor("op_211_cast_fp16")]; + tensor layers_0_mlp_gate_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(6995264))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(10141056))), name = tensor("layers_0_mlp_gate_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_4_bias_0_to_fp16 = const()[name = tensor("linear_4_bias_0_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(10141632)))]; + tensor linear_4_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_0_mlp_gate_proj_weight_to_fp16_palettized, x = var_211_cast_fp16)[name = tensor("linear_4_cast_fp16")]; + tensor var_221_cast_fp16 = silu(x = linear_4_cast_fp16)[name = tensor("op_221_cast_fp16")]; + tensor layers_0_mlp_up_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(10147840))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(13293632))), name = tensor("layers_0_mlp_up_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_5_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_0_mlp_up_proj_weight_to_fp16_palettized, x = var_211_cast_fp16)[name = tensor("linear_5_cast_fp16")]; + tensor input_9_cast_fp16 = mul(x = var_221_cast_fp16, y = linear_5_cast_fp16)[name = tensor("input_9_cast_fp16")]; + tensor layers_0_mlp_down_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(13294208))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(16440000))), name = tensor("layers_0_mlp_down_proj_weight_to_fp16_palettized"), shape = tensor([1024, 3072])]; + tensor linear_6_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_0_mlp_down_proj_weight_to_fp16_palettized, x = input_9_cast_fp16)[name = tensor("linear_6_cast_fp16")]; + tensor x_21_cast_fp16 = add(x = x_17_cast_fp16, y = linear_6_cast_fp16)[name = tensor("x_21_cast_fp16")]; + tensor var_241 = const()[name = tensor("op_241"), val = tensor(-1)]; + tensor var_240_promoted_to_fp16 = const()[name = tensor("op_240_promoted_to_fp16"), val = tensor(0x1p+1)]; + tensor var_250_cast_fp16 = pow(x = x_21_cast_fp16, y = var_240_promoted_to_fp16)[name = tensor("op_250_cast_fp16")]; + tensor var_252_axes_0 = const()[name = tensor("op_252_axes_0"), val = tensor([-1])]; + tensor var_252_keep_dims_0 = const()[name = tensor("op_252_keep_dims_0"), val = tensor(true)]; + tensor var_252_cast_fp16 = reduce_mean(axes = var_252_axes_0, keep_dims = var_252_keep_dims_0, x = var_250_cast_fp16)[name = tensor("op_252_cast_fp16")]; + tensor var_253_to_fp16 = const()[name = tensor("op_253_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_254_cast_fp16 = add(x = var_252_cast_fp16, y = var_253_to_fp16)[name = tensor("op_254_cast_fp16")]; + tensor norm_9_epsilon_0 = const()[name = tensor("norm_9_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_9_cast_fp16 = rsqrt(epsilon = norm_9_epsilon_0, x = var_254_cast_fp16)[name = tensor("norm_9_cast_fp16")]; + tensor var_256_cast_fp16 = mul(x = x_21_cast_fp16, y = norm_9_cast_fp16)[name = tensor("op_256_cast_fp16")]; + tensor layers_1_input_layernorm_weight_to_fp16 = const()[name = tensor("layers_1_input_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(16440576)))]; + tensor var_257_cast_fp16 = mul(x = var_256_cast_fp16, y = layers_1_input_layernorm_weight_to_fp16)[name = tensor("op_257_cast_fp16")]; + tensor layers_1_self_attn_q_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(16442688))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(18539904))), name = tensor("layers_1_self_attn_q_proj_weight_to_fp16_palettized"), shape = tensor([2048, 1024])]; + tensor linear_7_cast_fp16 = linear(bias = linear_0_bias_0_to_fp16, weight = layers_1_self_attn_q_proj_weight_to_fp16_palettized, x = var_257_cast_fp16)[name = tensor("linear_7_cast_fp16")]; + tensor var_273 = const()[name = tensor("op_273"), val = tensor([1, 768, 16, 128])]; + tensor var_274_cast_fp16 = reshape(shape = var_273, x = linear_7_cast_fp16)[name = tensor("op_274_cast_fp16")]; + tensor x_27_perm_0 = const()[name = tensor("x_27_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_1_self_attn_k_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(18540480))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(19589120))), name = tensor("layers_1_self_attn_k_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_8_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_1_self_attn_k_proj_weight_to_fp16_palettized, x = var_257_cast_fp16)[name = tensor("linear_8_cast_fp16")]; + tensor var_278 = const()[name = tensor("op_278"), val = tensor([1, 768, 8, 128])]; + tensor var_279_cast_fp16 = reshape(shape = var_278, x = linear_8_cast_fp16)[name = tensor("op_279_cast_fp16")]; + tensor x_31_perm_0 = const()[name = tensor("x_31_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_1_self_attn_v_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(19589696))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(20638336))), name = tensor("layers_1_self_attn_v_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_9_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_1_self_attn_v_proj_weight_to_fp16_palettized, x = var_257_cast_fp16)[name = tensor("linear_9_cast_fp16")]; + tensor var_283 = const()[name = tensor("op_283"), val = tensor([1, 768, 8, 128])]; + tensor var_284_cast_fp16 = reshape(shape = var_283, x = linear_9_cast_fp16)[name = tensor("op_284_cast_fp16")]; + tensor transpose_114_perm_0 = const()[name = tensor("transpose_114_perm_0"), val = tensor([2, 0, 1, 3])]; + tensor var_240_promoted_1_to_fp16 = const()[name = tensor("op_240_promoted_1_to_fp16"), val = tensor(0x1p+1)]; + tensor x_27_cast_fp16 = transpose(perm = x_27_perm_0, x = var_274_cast_fp16)[name = tensor("transpose_242")]; + tensor var_288_cast_fp16 = pow(x = x_27_cast_fp16, y = var_240_promoted_1_to_fp16)[name = tensor("op_288_cast_fp16")]; + tensor var_290_axes_0 = const()[name = tensor("op_290_axes_0"), val = tensor([-1])]; + tensor var_290_keep_dims_0 = const()[name = tensor("op_290_keep_dims_0"), val = tensor(true)]; + tensor var_290_cast_fp16 = reduce_mean(axes = var_290_axes_0, keep_dims = var_290_keep_dims_0, x = var_288_cast_fp16)[name = tensor("op_290_cast_fp16")]; + tensor var_291_to_fp16 = const()[name = tensor("op_291_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_292_cast_fp16 = add(x = var_290_cast_fp16, y = var_291_to_fp16)[name = tensor("op_292_cast_fp16")]; + tensor norm_11_epsilon_0 = const()[name = tensor("norm_11_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_11_cast_fp16 = rsqrt(epsilon = norm_11_epsilon_0, x = var_292_cast_fp16)[name = tensor("norm_11_cast_fp16")]; + tensor var_294_cast_fp16 = mul(x = x_27_cast_fp16, y = norm_11_cast_fp16)[name = tensor("op_294_cast_fp16")]; + tensor layers_1_self_attn_q_norm_weight_to_fp16 = const()[name = tensor("layers_1_self_attn_q_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(20638912)))]; + tensor var_295_cast_fp16 = mul(x = var_294_cast_fp16, y = layers_1_self_attn_q_norm_weight_to_fp16)[name = tensor("op_295_cast_fp16")]; + tensor var_240_promoted_2_to_fp16 = const()[name = tensor("op_240_promoted_2_to_fp16"), val = tensor(0x1p+1)]; + tensor x_31_cast_fp16 = transpose(perm = x_31_perm_0, x = var_279_cast_fp16)[name = tensor("transpose_241")]; + tensor var_299_cast_fp16 = pow(x = x_31_cast_fp16, y = var_240_promoted_2_to_fp16)[name = tensor("op_299_cast_fp16")]; + tensor var_301_axes_0 = const()[name = tensor("op_301_axes_0"), val = tensor([-1])]; + tensor var_301_keep_dims_0 = const()[name = tensor("op_301_keep_dims_0"), val = tensor(true)]; + tensor var_301_cast_fp16 = reduce_mean(axes = var_301_axes_0, keep_dims = var_301_keep_dims_0, x = var_299_cast_fp16)[name = tensor("op_301_cast_fp16")]; + tensor var_302_to_fp16 = const()[name = tensor("op_302_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_303_cast_fp16 = add(x = var_301_cast_fp16, y = var_302_to_fp16)[name = tensor("op_303_cast_fp16")]; + tensor norm_13_epsilon_0 = const()[name = tensor("norm_13_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_13_cast_fp16 = rsqrt(epsilon = norm_13_epsilon_0, x = var_303_cast_fp16)[name = tensor("norm_13_cast_fp16")]; + tensor var_305_cast_fp16 = mul(x = x_31_cast_fp16, y = norm_13_cast_fp16)[name = tensor("op_305_cast_fp16")]; + tensor layers_1_self_attn_k_norm_weight_to_fp16 = const()[name = tensor("layers_1_self_attn_k_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(20639232)))]; + tensor var_306_cast_fp16 = mul(x = var_305_cast_fp16, y = layers_1_self_attn_k_norm_weight_to_fp16)[name = tensor("op_306_cast_fp16")]; + tensor x1_5_begin_0 = const()[name = tensor("x1_5_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_5_end_0 = const()[name = tensor("x1_5_end_0"), val = tensor([1, 16, 768, 64])]; + tensor x1_5_end_mask_0 = const()[name = tensor("x1_5_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_5_cast_fp16 = slice_by_index(begin = x1_5_begin_0, end = x1_5_end_0, end_mask = x1_5_end_mask_0, x = var_295_cast_fp16)[name = tensor("x1_5_cast_fp16")]; + tensor x2_5_begin_0 = const()[name = tensor("x2_5_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_5_end_0 = const()[name = tensor("x2_5_end_0"), val = tensor([1, 16, 768, 128])]; + tensor x2_5_end_mask_0 = const()[name = tensor("x2_5_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_5_cast_fp16 = slice_by_index(begin = x2_5_begin_0, end = x2_5_end_0, end_mask = x2_5_end_mask_0, x = var_295_cast_fp16)[name = tensor("x2_5_cast_fp16")]; + tensor var_323_cast_fp16 = mul(x = x1_5_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_323_cast_fp16")]; + tensor var_324_cast_fp16 = mul(x = x2_5_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_324_cast_fp16")]; + tensor var_325_cast_fp16 = sub(x = var_323_cast_fp16, y = var_324_cast_fp16)[name = tensor("op_325_cast_fp16")]; + tensor var_326_cast_fp16 = mul(x = x2_5_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_326_cast_fp16")]; + tensor var_327_cast_fp16 = mul(x = x1_5_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_327_cast_fp16")]; + tensor var_328_cast_fp16 = add(x = var_326_cast_fp16, y = var_327_cast_fp16)[name = tensor("op_328_cast_fp16")]; + tensor q_3_interleave_0 = const()[name = tensor("q_3_interleave_0"), val = tensor(false)]; + tensor q_3_cast_fp16 = concat(axis = var_241, interleave = q_3_interleave_0, values = (var_325_cast_fp16, var_328_cast_fp16))[name = tensor("q_3_cast_fp16")]; + tensor x1_7_begin_0 = const()[name = tensor("x1_7_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_7_end_0 = const()[name = tensor("x1_7_end_0"), val = tensor([1, 8, 768, 64])]; + tensor x1_7_end_mask_0 = const()[name = tensor("x1_7_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_7_cast_fp16 = slice_by_index(begin = x1_7_begin_0, end = x1_7_end_0, end_mask = x1_7_end_mask_0, x = var_306_cast_fp16)[name = tensor("x1_7_cast_fp16")]; + tensor x2_7_begin_0 = const()[name = tensor("x2_7_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_7_end_0 = const()[name = tensor("x2_7_end_0"), val = tensor([1, 8, 768, 128])]; + tensor x2_7_end_mask_0 = const()[name = tensor("x2_7_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_7_cast_fp16 = slice_by_index(begin = x2_7_begin_0, end = x2_7_end_0, end_mask = x2_7_end_mask_0, x = var_306_cast_fp16)[name = tensor("x2_7_cast_fp16")]; + tensor var_346_cast_fp16 = mul(x = x1_7_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_346_cast_fp16")]; + tensor var_347_cast_fp16 = mul(x = x2_7_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_347_cast_fp16")]; + tensor var_348_cast_fp16 = sub(x = var_346_cast_fp16, y = var_347_cast_fp16)[name = tensor("op_348_cast_fp16")]; + tensor var_349_cast_fp16 = mul(x = x2_7_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_349_cast_fp16")]; + tensor var_350_cast_fp16 = mul(x = x1_7_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_350_cast_fp16")]; + tensor var_351_cast_fp16 = add(x = var_349_cast_fp16, y = var_350_cast_fp16)[name = tensor("op_351_cast_fp16")]; + tensor k_5_interleave_0 = const()[name = tensor("k_5_interleave_0"), val = tensor(false)]; + tensor k_5_cast_fp16 = concat(axis = var_241, interleave = k_5_interleave_0, values = (var_348_cast_fp16, var_351_cast_fp16))[name = tensor("k_5_cast_fp16")]; + tensor transpose_4_perm_0 = const()[name = tensor("transpose_4_perm_0"), val = tensor([1, 0, 2, 3])]; + tensor tile_2_reps_0 = const()[name = tensor("tile_2_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_4_cast_fp16 = transpose(perm = transpose_4_perm_0, x = k_5_cast_fp16)[name = tensor("transpose_240")]; + tensor tile_2_cast_fp16 = tile(reps = tile_2_reps_0, x = transpose_4_cast_fp16)[name = tensor("tile_2_cast_fp16")]; + tensor concat_4 = const()[name = tensor("concat_4"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_4_cast_fp16 = reshape(shape = concat_4, x = tile_2_cast_fp16)[name = tensor("reshape_4_cast_fp16")]; + tensor transpose_5_perm_0 = const()[name = tensor("transpose_5_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_5 = const()[name = tensor("concat_5"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_5_cast_fp16 = transpose(perm = transpose_5_perm_0, x = reshape_4_cast_fp16)[name = tensor("transpose_239")]; + tensor reshape_5_cast_fp16 = reshape(shape = concat_5, x = transpose_5_cast_fp16)[name = tensor("reshape_5_cast_fp16")]; + tensor transpose_115_perm_0 = const()[name = tensor("transpose_115_perm_0"), val = tensor([1, 0, -1, -2])]; + tensor tile_3_reps_0 = const()[name = tensor("tile_3_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_114_cast_fp16 = transpose(perm = transpose_114_perm_0, x = var_284_cast_fp16)[name = tensor("transpose_238")]; + tensor tile_3_cast_fp16 = tile(reps = tile_3_reps_0, x = transpose_114_cast_fp16)[name = tensor("tile_3_cast_fp16")]; + tensor concat_6 = const()[name = tensor("concat_6"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_6_cast_fp16 = reshape(shape = concat_6, x = tile_3_cast_fp16)[name = tensor("reshape_6_cast_fp16")]; + tensor transpose_7_perm_0 = const()[name = tensor("transpose_7_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_7 = const()[name = tensor("concat_7"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_7_cast_fp16 = transpose(perm = transpose_7_perm_0, x = reshape_6_cast_fp16)[name = tensor("transpose_237")]; + tensor reshape_7_cast_fp16 = reshape(shape = concat_7, x = transpose_7_cast_fp16)[name = tensor("reshape_7_cast_fp16")]; + tensor v_7_perm_0 = const()[name = tensor("v_7_perm_0"), val = tensor([1, 0, -2, -1])]; + tensor var_357_transpose_x_0 = const()[name = tensor("op_357_transpose_x_0"), val = tensor(false)]; + tensor var_357_transpose_y_0 = const()[name = tensor("op_357_transpose_y_0"), val = tensor(false)]; + tensor transpose_115_cast_fp16 = transpose(perm = transpose_115_perm_0, x = reshape_5_cast_fp16)[name = tensor("transpose_236")]; + tensor var_357_cast_fp16 = matmul(transpose_x = var_357_transpose_x_0, transpose_y = var_357_transpose_y_0, x = q_3_cast_fp16, y = transpose_115_cast_fp16)[name = tensor("op_357_cast_fp16")]; + tensor var_358_to_fp16 = const()[name = tensor("op_358_to_fp16"), val = tensor(0x1.6ap-4)]; + tensor attn_5_cast_fp16 = mul(x = var_357_cast_fp16, y = var_358_to_fp16)[name = tensor("attn_5_cast_fp16")]; + tensor input_11_cast_fp16 = add(x = attn_5_cast_fp16, y = causal_mask_to_fp16_palettized)[name = tensor("input_11_cast_fp16")]; + tensor attn_7_cast_fp16 = softmax(axis = var_241, x = input_11_cast_fp16)[name = tensor("attn_7_cast_fp16")]; + tensor var_362_transpose_x_0 = const()[name = tensor("op_362_transpose_x_0"), val = tensor(false)]; + tensor var_362_transpose_y_0 = const()[name = tensor("op_362_transpose_y_0"), val = tensor(false)]; + tensor v_7_cast_fp16 = transpose(perm = v_7_perm_0, x = reshape_7_cast_fp16)[name = tensor("transpose_235")]; + tensor var_362_cast_fp16 = matmul(transpose_x = var_362_transpose_x_0, transpose_y = var_362_transpose_y_0, x = attn_7_cast_fp16, y = v_7_cast_fp16)[name = tensor("op_362_cast_fp16")]; + tensor var_363_perm_0 = const()[name = tensor("op_363_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor var_364 = const()[name = tensor("op_364"), val = tensor([1, 768, 2048])]; + tensor var_363_cast_fp16 = transpose(perm = var_363_perm_0, x = var_362_cast_fp16)[name = tensor("transpose_234")]; + tensor input_13_cast_fp16 = reshape(shape = var_364, x = var_363_cast_fp16)[name = tensor("input_13_cast_fp16")]; + tensor layers_1_self_attn_o_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(20639552))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(22736768))), name = tensor("layers_1_self_attn_o_proj_weight_to_fp16_palettized"), shape = tensor([1024, 2048])]; + tensor linear_10_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_1_self_attn_o_proj_weight_to_fp16_palettized, x = input_13_cast_fp16)[name = tensor("linear_10_cast_fp16")]; + tensor x_39_cast_fp16 = add(x = x_21_cast_fp16, y = linear_10_cast_fp16)[name = tensor("x_39_cast_fp16")]; + tensor var_240_promoted_3_to_fp16 = const()[name = tensor("op_240_promoted_3_to_fp16"), val = tensor(0x1p+1)]; + tensor var_371_cast_fp16 = pow(x = x_39_cast_fp16, y = var_240_promoted_3_to_fp16)[name = tensor("op_371_cast_fp16")]; + tensor var_373_axes_0 = const()[name = tensor("op_373_axes_0"), val = tensor([-1])]; + tensor var_373_keep_dims_0 = const()[name = tensor("op_373_keep_dims_0"), val = tensor(true)]; + tensor var_373_cast_fp16 = reduce_mean(axes = var_373_axes_0, keep_dims = var_373_keep_dims_0, x = var_371_cast_fp16)[name = tensor("op_373_cast_fp16")]; + tensor var_374_to_fp16 = const()[name = tensor("op_374_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_375_cast_fp16 = add(x = var_373_cast_fp16, y = var_374_to_fp16)[name = tensor("op_375_cast_fp16")]; + tensor norm_15_epsilon_0 = const()[name = tensor("norm_15_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_15_cast_fp16 = rsqrt(epsilon = norm_15_epsilon_0, x = var_375_cast_fp16)[name = tensor("norm_15_cast_fp16")]; + tensor var_377_cast_fp16 = mul(x = x_39_cast_fp16, y = norm_15_cast_fp16)[name = tensor("op_377_cast_fp16")]; + tensor layers_1_post_attention_layernorm_weight_to_fp16 = const()[name = tensor("layers_1_post_attention_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(22737344)))]; + tensor var_378_cast_fp16 = mul(x = var_377_cast_fp16, y = layers_1_post_attention_layernorm_weight_to_fp16)[name = tensor("op_378_cast_fp16")]; + tensor layers_1_mlp_gate_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(22739456))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(25885248))), name = tensor("layers_1_mlp_gate_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_11_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_1_mlp_gate_proj_weight_to_fp16_palettized, x = var_378_cast_fp16)[name = tensor("linear_11_cast_fp16")]; + tensor var_388_cast_fp16 = silu(x = linear_11_cast_fp16)[name = tensor("op_388_cast_fp16")]; + tensor layers_1_mlp_up_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(25885824))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(29031616))), name = tensor("layers_1_mlp_up_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_12_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_1_mlp_up_proj_weight_to_fp16_palettized, x = var_378_cast_fp16)[name = tensor("linear_12_cast_fp16")]; + tensor input_19_cast_fp16 = mul(x = var_388_cast_fp16, y = linear_12_cast_fp16)[name = tensor("input_19_cast_fp16")]; + tensor layers_1_mlp_down_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(29032192))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(32177984))), name = tensor("layers_1_mlp_down_proj_weight_to_fp16_palettized"), shape = tensor([1024, 3072])]; + tensor linear_13_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_1_mlp_down_proj_weight_to_fp16_palettized, x = input_19_cast_fp16)[name = tensor("linear_13_cast_fp16")]; + tensor x_43_cast_fp16 = add(x = x_39_cast_fp16, y = linear_13_cast_fp16)[name = tensor("x_43_cast_fp16")]; + tensor var_408 = const()[name = tensor("op_408"), val = tensor(-1)]; + tensor var_407_promoted_to_fp16 = const()[name = tensor("op_407_promoted_to_fp16"), val = tensor(0x1p+1)]; + tensor var_417_cast_fp16 = pow(x = x_43_cast_fp16, y = var_407_promoted_to_fp16)[name = tensor("op_417_cast_fp16")]; + tensor var_419_axes_0 = const()[name = tensor("op_419_axes_0"), val = tensor([-1])]; + tensor var_419_keep_dims_0 = const()[name = tensor("op_419_keep_dims_0"), val = tensor(true)]; + tensor var_419_cast_fp16 = reduce_mean(axes = var_419_axes_0, keep_dims = var_419_keep_dims_0, x = var_417_cast_fp16)[name = tensor("op_419_cast_fp16")]; + tensor var_420_to_fp16 = const()[name = tensor("op_420_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_421_cast_fp16 = add(x = var_419_cast_fp16, y = var_420_to_fp16)[name = tensor("op_421_cast_fp16")]; + tensor norm_17_epsilon_0 = const()[name = tensor("norm_17_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_17_cast_fp16 = rsqrt(epsilon = norm_17_epsilon_0, x = var_421_cast_fp16)[name = tensor("norm_17_cast_fp16")]; + tensor var_423_cast_fp16 = mul(x = x_43_cast_fp16, y = norm_17_cast_fp16)[name = tensor("op_423_cast_fp16")]; + tensor layers_2_input_layernorm_weight_to_fp16 = const()[name = tensor("layers_2_input_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(32178560)))]; + tensor var_424_cast_fp16 = mul(x = var_423_cast_fp16, y = layers_2_input_layernorm_weight_to_fp16)[name = tensor("op_424_cast_fp16")]; + tensor layers_2_self_attn_q_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(32180672))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(34277888))), name = tensor("layers_2_self_attn_q_proj_weight_to_fp16_palettized"), shape = tensor([2048, 1024])]; + tensor linear_14_cast_fp16 = linear(bias = linear_0_bias_0_to_fp16, weight = layers_2_self_attn_q_proj_weight_to_fp16_palettized, x = var_424_cast_fp16)[name = tensor("linear_14_cast_fp16")]; + tensor var_440 = const()[name = tensor("op_440"), val = tensor([1, 768, 16, 128])]; + tensor var_441_cast_fp16 = reshape(shape = var_440, x = linear_14_cast_fp16)[name = tensor("op_441_cast_fp16")]; + tensor x_49_perm_0 = const()[name = tensor("x_49_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_2_self_attn_k_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(34278464))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(35327104))), name = tensor("layers_2_self_attn_k_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_15_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_2_self_attn_k_proj_weight_to_fp16_palettized, x = var_424_cast_fp16)[name = tensor("linear_15_cast_fp16")]; + tensor var_445 = const()[name = tensor("op_445"), val = tensor([1, 768, 8, 128])]; + tensor var_446_cast_fp16 = reshape(shape = var_445, x = linear_15_cast_fp16)[name = tensor("op_446_cast_fp16")]; + tensor x_53_perm_0 = const()[name = tensor("x_53_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_2_self_attn_v_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(35327680))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(36376320))), name = tensor("layers_2_self_attn_v_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_16_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_2_self_attn_v_proj_weight_to_fp16_palettized, x = var_424_cast_fp16)[name = tensor("linear_16_cast_fp16")]; + tensor var_450 = const()[name = tensor("op_450"), val = tensor([1, 768, 8, 128])]; + tensor var_451_cast_fp16 = reshape(shape = var_450, x = linear_16_cast_fp16)[name = tensor("op_451_cast_fp16")]; + tensor transpose_116_perm_0 = const()[name = tensor("transpose_116_perm_0"), val = tensor([2, 0, 1, 3])]; + tensor var_407_promoted_1_to_fp16 = const()[name = tensor("op_407_promoted_1_to_fp16"), val = tensor(0x1p+1)]; + tensor x_49_cast_fp16 = transpose(perm = x_49_perm_0, x = var_441_cast_fp16)[name = tensor("transpose_233")]; + tensor var_455_cast_fp16 = pow(x = x_49_cast_fp16, y = var_407_promoted_1_to_fp16)[name = tensor("op_455_cast_fp16")]; + tensor var_457_axes_0 = const()[name = tensor("op_457_axes_0"), val = tensor([-1])]; + tensor var_457_keep_dims_0 = const()[name = tensor("op_457_keep_dims_0"), val = tensor(true)]; + tensor var_457_cast_fp16 = reduce_mean(axes = var_457_axes_0, keep_dims = var_457_keep_dims_0, x = var_455_cast_fp16)[name = tensor("op_457_cast_fp16")]; + tensor var_458_to_fp16 = const()[name = tensor("op_458_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_459_cast_fp16 = add(x = var_457_cast_fp16, y = var_458_to_fp16)[name = tensor("op_459_cast_fp16")]; + tensor norm_19_epsilon_0 = const()[name = tensor("norm_19_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_19_cast_fp16 = rsqrt(epsilon = norm_19_epsilon_0, x = var_459_cast_fp16)[name = tensor("norm_19_cast_fp16")]; + tensor var_461_cast_fp16 = mul(x = x_49_cast_fp16, y = norm_19_cast_fp16)[name = tensor("op_461_cast_fp16")]; + tensor layers_2_self_attn_q_norm_weight_to_fp16 = const()[name = tensor("layers_2_self_attn_q_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(36376896)))]; + tensor var_462_cast_fp16 = mul(x = var_461_cast_fp16, y = layers_2_self_attn_q_norm_weight_to_fp16)[name = tensor("op_462_cast_fp16")]; + tensor var_407_promoted_2_to_fp16 = const()[name = tensor("op_407_promoted_2_to_fp16"), val = tensor(0x1p+1)]; + tensor x_53_cast_fp16 = transpose(perm = x_53_perm_0, x = var_446_cast_fp16)[name = tensor("transpose_232")]; + tensor var_466_cast_fp16 = pow(x = x_53_cast_fp16, y = var_407_promoted_2_to_fp16)[name = tensor("op_466_cast_fp16")]; + tensor var_468_axes_0 = const()[name = tensor("op_468_axes_0"), val = tensor([-1])]; + tensor var_468_keep_dims_0 = const()[name = tensor("op_468_keep_dims_0"), val = tensor(true)]; + tensor var_468_cast_fp16 = reduce_mean(axes = var_468_axes_0, keep_dims = var_468_keep_dims_0, x = var_466_cast_fp16)[name = tensor("op_468_cast_fp16")]; + tensor var_469_to_fp16 = const()[name = tensor("op_469_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_470_cast_fp16 = add(x = var_468_cast_fp16, y = var_469_to_fp16)[name = tensor("op_470_cast_fp16")]; + tensor norm_21_epsilon_0 = const()[name = tensor("norm_21_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_21_cast_fp16 = rsqrt(epsilon = norm_21_epsilon_0, x = var_470_cast_fp16)[name = tensor("norm_21_cast_fp16")]; + tensor var_472_cast_fp16 = mul(x = x_53_cast_fp16, y = norm_21_cast_fp16)[name = tensor("op_472_cast_fp16")]; + tensor layers_2_self_attn_k_norm_weight_to_fp16 = const()[name = tensor("layers_2_self_attn_k_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(36377216)))]; + tensor var_473_cast_fp16 = mul(x = var_472_cast_fp16, y = layers_2_self_attn_k_norm_weight_to_fp16)[name = tensor("op_473_cast_fp16")]; + tensor x1_9_begin_0 = const()[name = tensor("x1_9_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_9_end_0 = const()[name = tensor("x1_9_end_0"), val = tensor([1, 16, 768, 64])]; + tensor x1_9_end_mask_0 = const()[name = tensor("x1_9_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_9_cast_fp16 = slice_by_index(begin = x1_9_begin_0, end = x1_9_end_0, end_mask = x1_9_end_mask_0, x = var_462_cast_fp16)[name = tensor("x1_9_cast_fp16")]; + tensor x2_9_begin_0 = const()[name = tensor("x2_9_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_9_end_0 = const()[name = tensor("x2_9_end_0"), val = tensor([1, 16, 768, 128])]; + tensor x2_9_end_mask_0 = const()[name = tensor("x2_9_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_9_cast_fp16 = slice_by_index(begin = x2_9_begin_0, end = x2_9_end_0, end_mask = x2_9_end_mask_0, x = var_462_cast_fp16)[name = tensor("x2_9_cast_fp16")]; + tensor var_490_cast_fp16 = mul(x = x1_9_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_490_cast_fp16")]; + tensor var_491_cast_fp16 = mul(x = x2_9_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_491_cast_fp16")]; + tensor var_492_cast_fp16 = sub(x = var_490_cast_fp16, y = var_491_cast_fp16)[name = tensor("op_492_cast_fp16")]; + tensor var_493_cast_fp16 = mul(x = x2_9_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_493_cast_fp16")]; + tensor var_494_cast_fp16 = mul(x = x1_9_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_494_cast_fp16")]; + tensor var_495_cast_fp16 = add(x = var_493_cast_fp16, y = var_494_cast_fp16)[name = tensor("op_495_cast_fp16")]; + tensor q_5_interleave_0 = const()[name = tensor("q_5_interleave_0"), val = tensor(false)]; + tensor q_5_cast_fp16 = concat(axis = var_408, interleave = q_5_interleave_0, values = (var_492_cast_fp16, var_495_cast_fp16))[name = tensor("q_5_cast_fp16")]; + tensor x1_11_begin_0 = const()[name = tensor("x1_11_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_11_end_0 = const()[name = tensor("x1_11_end_0"), val = tensor([1, 8, 768, 64])]; + tensor x1_11_end_mask_0 = const()[name = tensor("x1_11_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_11_cast_fp16 = slice_by_index(begin = x1_11_begin_0, end = x1_11_end_0, end_mask = x1_11_end_mask_0, x = var_473_cast_fp16)[name = tensor("x1_11_cast_fp16")]; + tensor x2_11_begin_0 = const()[name = tensor("x2_11_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_11_end_0 = const()[name = tensor("x2_11_end_0"), val = tensor([1, 8, 768, 128])]; + tensor x2_11_end_mask_0 = const()[name = tensor("x2_11_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_11_cast_fp16 = slice_by_index(begin = x2_11_begin_0, end = x2_11_end_0, end_mask = x2_11_end_mask_0, x = var_473_cast_fp16)[name = tensor("x2_11_cast_fp16")]; + tensor var_513_cast_fp16 = mul(x = x1_11_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_513_cast_fp16")]; + tensor var_514_cast_fp16 = mul(x = x2_11_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_514_cast_fp16")]; + tensor var_515_cast_fp16 = sub(x = var_513_cast_fp16, y = var_514_cast_fp16)[name = tensor("op_515_cast_fp16")]; + tensor var_516_cast_fp16 = mul(x = x2_11_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_516_cast_fp16")]; + tensor var_517_cast_fp16 = mul(x = x1_11_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_517_cast_fp16")]; + tensor var_518_cast_fp16 = add(x = var_516_cast_fp16, y = var_517_cast_fp16)[name = tensor("op_518_cast_fp16")]; + tensor k_9_interleave_0 = const()[name = tensor("k_9_interleave_0"), val = tensor(false)]; + tensor k_9_cast_fp16 = concat(axis = var_408, interleave = k_9_interleave_0, values = (var_515_cast_fp16, var_518_cast_fp16))[name = tensor("k_9_cast_fp16")]; + tensor transpose_8_perm_0 = const()[name = tensor("transpose_8_perm_0"), val = tensor([1, 0, 2, 3])]; + tensor tile_4_reps_0 = const()[name = tensor("tile_4_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_8_cast_fp16 = transpose(perm = transpose_8_perm_0, x = k_9_cast_fp16)[name = tensor("transpose_231")]; + tensor tile_4_cast_fp16 = tile(reps = tile_4_reps_0, x = transpose_8_cast_fp16)[name = tensor("tile_4_cast_fp16")]; + tensor concat_8 = const()[name = tensor("concat_8"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_8_cast_fp16 = reshape(shape = concat_8, x = tile_4_cast_fp16)[name = tensor("reshape_8_cast_fp16")]; + tensor transpose_9_perm_0 = const()[name = tensor("transpose_9_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_9 = const()[name = tensor("concat_9"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_9_cast_fp16 = transpose(perm = transpose_9_perm_0, x = reshape_8_cast_fp16)[name = tensor("transpose_230")]; + tensor reshape_9_cast_fp16 = reshape(shape = concat_9, x = transpose_9_cast_fp16)[name = tensor("reshape_9_cast_fp16")]; + tensor transpose_117_perm_0 = const()[name = tensor("transpose_117_perm_0"), val = tensor([1, 0, -1, -2])]; + tensor tile_5_reps_0 = const()[name = tensor("tile_5_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_116_cast_fp16 = transpose(perm = transpose_116_perm_0, x = var_451_cast_fp16)[name = tensor("transpose_229")]; + tensor tile_5_cast_fp16 = tile(reps = tile_5_reps_0, x = transpose_116_cast_fp16)[name = tensor("tile_5_cast_fp16")]; + tensor concat_10 = const()[name = tensor("concat_10"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_10_cast_fp16 = reshape(shape = concat_10, x = tile_5_cast_fp16)[name = tensor("reshape_10_cast_fp16")]; + tensor transpose_11_perm_0 = const()[name = tensor("transpose_11_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_11 = const()[name = tensor("concat_11"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_11_cast_fp16 = transpose(perm = transpose_11_perm_0, x = reshape_10_cast_fp16)[name = tensor("transpose_228")]; + tensor reshape_11_cast_fp16 = reshape(shape = concat_11, x = transpose_11_cast_fp16)[name = tensor("reshape_11_cast_fp16")]; + tensor v_11_perm_0 = const()[name = tensor("v_11_perm_0"), val = tensor([1, 0, -2, -1])]; + tensor var_524_transpose_x_0 = const()[name = tensor("op_524_transpose_x_0"), val = tensor(false)]; + tensor var_524_transpose_y_0 = const()[name = tensor("op_524_transpose_y_0"), val = tensor(false)]; + tensor transpose_117_cast_fp16 = transpose(perm = transpose_117_perm_0, x = reshape_9_cast_fp16)[name = tensor("transpose_227")]; + tensor var_524_cast_fp16 = matmul(transpose_x = var_524_transpose_x_0, transpose_y = var_524_transpose_y_0, x = q_5_cast_fp16, y = transpose_117_cast_fp16)[name = tensor("op_524_cast_fp16")]; + tensor var_525_to_fp16 = const()[name = tensor("op_525_to_fp16"), val = tensor(0x1.6ap-4)]; + tensor attn_9_cast_fp16 = mul(x = var_524_cast_fp16, y = var_525_to_fp16)[name = tensor("attn_9_cast_fp16")]; + tensor input_21_cast_fp16 = add(x = attn_9_cast_fp16, y = causal_mask_to_fp16_palettized)[name = tensor("input_21_cast_fp16")]; + tensor attn_11_cast_fp16 = softmax(axis = var_408, x = input_21_cast_fp16)[name = tensor("attn_11_cast_fp16")]; + tensor var_529_transpose_x_0 = const()[name = tensor("op_529_transpose_x_0"), val = tensor(false)]; + tensor var_529_transpose_y_0 = const()[name = tensor("op_529_transpose_y_0"), val = tensor(false)]; + tensor v_11_cast_fp16 = transpose(perm = v_11_perm_0, x = reshape_11_cast_fp16)[name = tensor("transpose_226")]; + tensor var_529_cast_fp16 = matmul(transpose_x = var_529_transpose_x_0, transpose_y = var_529_transpose_y_0, x = attn_11_cast_fp16, y = v_11_cast_fp16)[name = tensor("op_529_cast_fp16")]; + tensor var_530_perm_0 = const()[name = tensor("op_530_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor var_531 = const()[name = tensor("op_531"), val = tensor([1, 768, 2048])]; + tensor var_530_cast_fp16 = transpose(perm = var_530_perm_0, x = var_529_cast_fp16)[name = tensor("transpose_225")]; + tensor input_23_cast_fp16 = reshape(shape = var_531, x = var_530_cast_fp16)[name = tensor("input_23_cast_fp16")]; + tensor layers_2_self_attn_o_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(36377536))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(38474752))), name = tensor("layers_2_self_attn_o_proj_weight_to_fp16_palettized"), shape = tensor([1024, 2048])]; + tensor linear_17_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_2_self_attn_o_proj_weight_to_fp16_palettized, x = input_23_cast_fp16)[name = tensor("linear_17_cast_fp16")]; + tensor x_61_cast_fp16 = add(x = x_43_cast_fp16, y = linear_17_cast_fp16)[name = tensor("x_61_cast_fp16")]; + tensor var_407_promoted_3_to_fp16 = const()[name = tensor("op_407_promoted_3_to_fp16"), val = tensor(0x1p+1)]; + tensor var_538_cast_fp16 = pow(x = x_61_cast_fp16, y = var_407_promoted_3_to_fp16)[name = tensor("op_538_cast_fp16")]; + tensor var_540_axes_0 = const()[name = tensor("op_540_axes_0"), val = tensor([-1])]; + tensor var_540_keep_dims_0 = const()[name = tensor("op_540_keep_dims_0"), val = tensor(true)]; + tensor var_540_cast_fp16 = reduce_mean(axes = var_540_axes_0, keep_dims = var_540_keep_dims_0, x = var_538_cast_fp16)[name = tensor("op_540_cast_fp16")]; + tensor var_541_to_fp16 = const()[name = tensor("op_541_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_542_cast_fp16 = add(x = var_540_cast_fp16, y = var_541_to_fp16)[name = tensor("op_542_cast_fp16")]; + tensor norm_23_epsilon_0 = const()[name = tensor("norm_23_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_23_cast_fp16 = rsqrt(epsilon = norm_23_epsilon_0, x = var_542_cast_fp16)[name = tensor("norm_23_cast_fp16")]; + tensor var_544_cast_fp16 = mul(x = x_61_cast_fp16, y = norm_23_cast_fp16)[name = tensor("op_544_cast_fp16")]; + tensor layers_2_post_attention_layernorm_weight_to_fp16 = const()[name = tensor("layers_2_post_attention_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(38475328)))]; + tensor var_545_cast_fp16 = mul(x = var_544_cast_fp16, y = layers_2_post_attention_layernorm_weight_to_fp16)[name = tensor("op_545_cast_fp16")]; + tensor layers_2_mlp_gate_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(38477440))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(41623232))), name = tensor("layers_2_mlp_gate_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_18_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_2_mlp_gate_proj_weight_to_fp16_palettized, x = var_545_cast_fp16)[name = tensor("linear_18_cast_fp16")]; + tensor var_555_cast_fp16 = silu(x = linear_18_cast_fp16)[name = tensor("op_555_cast_fp16")]; + tensor layers_2_mlp_up_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(41623808))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(44769600))), name = tensor("layers_2_mlp_up_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_19_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_2_mlp_up_proj_weight_to_fp16_palettized, x = var_545_cast_fp16)[name = tensor("linear_19_cast_fp16")]; + tensor input_29_cast_fp16 = mul(x = var_555_cast_fp16, y = linear_19_cast_fp16)[name = tensor("input_29_cast_fp16")]; + tensor layers_2_mlp_down_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(44770176))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(47915968))), name = tensor("layers_2_mlp_down_proj_weight_to_fp16_palettized"), shape = tensor([1024, 3072])]; + tensor linear_20_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_2_mlp_down_proj_weight_to_fp16_palettized, x = input_29_cast_fp16)[name = tensor("linear_20_cast_fp16")]; + tensor x_65_cast_fp16 = add(x = x_61_cast_fp16, y = linear_20_cast_fp16)[name = tensor("x_65_cast_fp16")]; + tensor var_575 = const()[name = tensor("op_575"), val = tensor(-1)]; + tensor var_574_promoted_to_fp16 = const()[name = tensor("op_574_promoted_to_fp16"), val = tensor(0x1p+1)]; + tensor var_584_cast_fp16 = pow(x = x_65_cast_fp16, y = var_574_promoted_to_fp16)[name = tensor("op_584_cast_fp16")]; + tensor var_586_axes_0 = const()[name = tensor("op_586_axes_0"), val = tensor([-1])]; + tensor var_586_keep_dims_0 = const()[name = tensor("op_586_keep_dims_0"), val = tensor(true)]; + tensor var_586_cast_fp16 = reduce_mean(axes = var_586_axes_0, keep_dims = var_586_keep_dims_0, x = var_584_cast_fp16)[name = tensor("op_586_cast_fp16")]; + tensor var_587_to_fp16 = const()[name = tensor("op_587_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_588_cast_fp16 = add(x = var_586_cast_fp16, y = var_587_to_fp16)[name = tensor("op_588_cast_fp16")]; + tensor norm_25_epsilon_0 = const()[name = tensor("norm_25_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_25_cast_fp16 = rsqrt(epsilon = norm_25_epsilon_0, x = var_588_cast_fp16)[name = tensor("norm_25_cast_fp16")]; + tensor var_590_cast_fp16 = mul(x = x_65_cast_fp16, y = norm_25_cast_fp16)[name = tensor("op_590_cast_fp16")]; + tensor layers_3_input_layernorm_weight_to_fp16 = const()[name = tensor("layers_3_input_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(47916544)))]; + tensor var_591_cast_fp16 = mul(x = var_590_cast_fp16, y = layers_3_input_layernorm_weight_to_fp16)[name = tensor("op_591_cast_fp16")]; + tensor layers_3_self_attn_q_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(47918656))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(50015872))), name = tensor("layers_3_self_attn_q_proj_weight_to_fp16_palettized"), shape = tensor([2048, 1024])]; + tensor linear_21_cast_fp16 = linear(bias = linear_0_bias_0_to_fp16, weight = layers_3_self_attn_q_proj_weight_to_fp16_palettized, x = var_591_cast_fp16)[name = tensor("linear_21_cast_fp16")]; + tensor var_607 = const()[name = tensor("op_607"), val = tensor([1, 768, 16, 128])]; + tensor var_608_cast_fp16 = reshape(shape = var_607, x = linear_21_cast_fp16)[name = tensor("op_608_cast_fp16")]; + tensor x_71_perm_0 = const()[name = tensor("x_71_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_3_self_attn_k_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(50016448))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(51065088))), name = tensor("layers_3_self_attn_k_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_22_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_3_self_attn_k_proj_weight_to_fp16_palettized, x = var_591_cast_fp16)[name = tensor("linear_22_cast_fp16")]; + tensor var_612 = const()[name = tensor("op_612"), val = tensor([1, 768, 8, 128])]; + tensor var_613_cast_fp16 = reshape(shape = var_612, x = linear_22_cast_fp16)[name = tensor("op_613_cast_fp16")]; + tensor x_75_perm_0 = const()[name = tensor("x_75_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_3_self_attn_v_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(51065664))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(52114304))), name = tensor("layers_3_self_attn_v_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_23_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_3_self_attn_v_proj_weight_to_fp16_palettized, x = var_591_cast_fp16)[name = tensor("linear_23_cast_fp16")]; + tensor var_617 = const()[name = tensor("op_617"), val = tensor([1, 768, 8, 128])]; + tensor var_618_cast_fp16 = reshape(shape = var_617, x = linear_23_cast_fp16)[name = tensor("op_618_cast_fp16")]; + tensor transpose_118_perm_0 = const()[name = tensor("transpose_118_perm_0"), val = tensor([2, 0, 1, 3])]; + tensor var_574_promoted_1_to_fp16 = const()[name = tensor("op_574_promoted_1_to_fp16"), val = tensor(0x1p+1)]; + tensor x_71_cast_fp16 = transpose(perm = x_71_perm_0, x = var_608_cast_fp16)[name = tensor("transpose_224")]; + tensor var_622_cast_fp16 = pow(x = x_71_cast_fp16, y = var_574_promoted_1_to_fp16)[name = tensor("op_622_cast_fp16")]; + tensor var_624_axes_0 = const()[name = tensor("op_624_axes_0"), val = tensor([-1])]; + tensor var_624_keep_dims_0 = const()[name = tensor("op_624_keep_dims_0"), val = tensor(true)]; + tensor var_624_cast_fp16 = reduce_mean(axes = var_624_axes_0, keep_dims = var_624_keep_dims_0, x = var_622_cast_fp16)[name = tensor("op_624_cast_fp16")]; + tensor var_625_to_fp16 = const()[name = tensor("op_625_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_626_cast_fp16 = add(x = var_624_cast_fp16, y = var_625_to_fp16)[name = tensor("op_626_cast_fp16")]; + tensor norm_27_epsilon_0 = const()[name = tensor("norm_27_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_27_cast_fp16 = rsqrt(epsilon = norm_27_epsilon_0, x = var_626_cast_fp16)[name = tensor("norm_27_cast_fp16")]; + tensor var_628_cast_fp16 = mul(x = x_71_cast_fp16, y = norm_27_cast_fp16)[name = tensor("op_628_cast_fp16")]; + tensor layers_3_self_attn_q_norm_weight_to_fp16 = const()[name = tensor("layers_3_self_attn_q_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(52114880)))]; + tensor var_629_cast_fp16 = mul(x = var_628_cast_fp16, y = layers_3_self_attn_q_norm_weight_to_fp16)[name = tensor("op_629_cast_fp16")]; + tensor var_574_promoted_2_to_fp16 = const()[name = tensor("op_574_promoted_2_to_fp16"), val = tensor(0x1p+1)]; + tensor x_75_cast_fp16 = transpose(perm = x_75_perm_0, x = var_613_cast_fp16)[name = tensor("transpose_223")]; + tensor var_633_cast_fp16 = pow(x = x_75_cast_fp16, y = var_574_promoted_2_to_fp16)[name = tensor("op_633_cast_fp16")]; + tensor var_635_axes_0 = const()[name = tensor("op_635_axes_0"), val = tensor([-1])]; + tensor var_635_keep_dims_0 = const()[name = tensor("op_635_keep_dims_0"), val = tensor(true)]; + tensor var_635_cast_fp16 = reduce_mean(axes = var_635_axes_0, keep_dims = var_635_keep_dims_0, x = var_633_cast_fp16)[name = tensor("op_635_cast_fp16")]; + tensor var_636_to_fp16 = const()[name = tensor("op_636_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_637_cast_fp16 = add(x = var_635_cast_fp16, y = var_636_to_fp16)[name = tensor("op_637_cast_fp16")]; + tensor norm_29_epsilon_0 = const()[name = tensor("norm_29_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_29_cast_fp16 = rsqrt(epsilon = norm_29_epsilon_0, x = var_637_cast_fp16)[name = tensor("norm_29_cast_fp16")]; + tensor var_639_cast_fp16 = mul(x = x_75_cast_fp16, y = norm_29_cast_fp16)[name = tensor("op_639_cast_fp16")]; + tensor layers_3_self_attn_k_norm_weight_to_fp16 = const()[name = tensor("layers_3_self_attn_k_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(52115200)))]; + tensor var_640_cast_fp16 = mul(x = var_639_cast_fp16, y = layers_3_self_attn_k_norm_weight_to_fp16)[name = tensor("op_640_cast_fp16")]; + tensor x1_13_begin_0 = const()[name = tensor("x1_13_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_13_end_0 = const()[name = tensor("x1_13_end_0"), val = tensor([1, 16, 768, 64])]; + tensor x1_13_end_mask_0 = const()[name = tensor("x1_13_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_13_cast_fp16 = slice_by_index(begin = x1_13_begin_0, end = x1_13_end_0, end_mask = x1_13_end_mask_0, x = var_629_cast_fp16)[name = tensor("x1_13_cast_fp16")]; + tensor x2_13_begin_0 = const()[name = tensor("x2_13_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_13_end_0 = const()[name = tensor("x2_13_end_0"), val = tensor([1, 16, 768, 128])]; + tensor x2_13_end_mask_0 = const()[name = tensor("x2_13_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_13_cast_fp16 = slice_by_index(begin = x2_13_begin_0, end = x2_13_end_0, end_mask = x2_13_end_mask_0, x = var_629_cast_fp16)[name = tensor("x2_13_cast_fp16")]; + tensor var_657_cast_fp16 = mul(x = x1_13_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_657_cast_fp16")]; + tensor var_658_cast_fp16 = mul(x = x2_13_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_658_cast_fp16")]; + tensor var_659_cast_fp16 = sub(x = var_657_cast_fp16, y = var_658_cast_fp16)[name = tensor("op_659_cast_fp16")]; + tensor var_660_cast_fp16 = mul(x = x2_13_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_660_cast_fp16")]; + tensor var_661_cast_fp16 = mul(x = x1_13_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_661_cast_fp16")]; + tensor var_662_cast_fp16 = add(x = var_660_cast_fp16, y = var_661_cast_fp16)[name = tensor("op_662_cast_fp16")]; + tensor q_7_interleave_0 = const()[name = tensor("q_7_interleave_0"), val = tensor(false)]; + tensor q_7_cast_fp16 = concat(axis = var_575, interleave = q_7_interleave_0, values = (var_659_cast_fp16, var_662_cast_fp16))[name = tensor("q_7_cast_fp16")]; + tensor x1_15_begin_0 = const()[name = tensor("x1_15_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_15_end_0 = const()[name = tensor("x1_15_end_0"), val = tensor([1, 8, 768, 64])]; + tensor x1_15_end_mask_0 = const()[name = tensor("x1_15_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_15_cast_fp16 = slice_by_index(begin = x1_15_begin_0, end = x1_15_end_0, end_mask = x1_15_end_mask_0, x = var_640_cast_fp16)[name = tensor("x1_15_cast_fp16")]; + tensor x2_15_begin_0 = const()[name = tensor("x2_15_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_15_end_0 = const()[name = tensor("x2_15_end_0"), val = tensor([1, 8, 768, 128])]; + tensor x2_15_end_mask_0 = const()[name = tensor("x2_15_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_15_cast_fp16 = slice_by_index(begin = x2_15_begin_0, end = x2_15_end_0, end_mask = x2_15_end_mask_0, x = var_640_cast_fp16)[name = tensor("x2_15_cast_fp16")]; + tensor var_680_cast_fp16 = mul(x = x1_15_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_680_cast_fp16")]; + tensor var_681_cast_fp16 = mul(x = x2_15_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_681_cast_fp16")]; + tensor var_682_cast_fp16 = sub(x = var_680_cast_fp16, y = var_681_cast_fp16)[name = tensor("op_682_cast_fp16")]; + tensor var_683_cast_fp16 = mul(x = x2_15_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_683_cast_fp16")]; + tensor var_684_cast_fp16 = mul(x = x1_15_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_684_cast_fp16")]; + tensor var_685_cast_fp16 = add(x = var_683_cast_fp16, y = var_684_cast_fp16)[name = tensor("op_685_cast_fp16")]; + tensor k_13_interleave_0 = const()[name = tensor("k_13_interleave_0"), val = tensor(false)]; + tensor k_13_cast_fp16 = concat(axis = var_575, interleave = k_13_interleave_0, values = (var_682_cast_fp16, var_685_cast_fp16))[name = tensor("k_13_cast_fp16")]; + tensor transpose_12_perm_0 = const()[name = tensor("transpose_12_perm_0"), val = tensor([1, 0, 2, 3])]; + tensor tile_6_reps_0 = const()[name = tensor("tile_6_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_12_cast_fp16 = transpose(perm = transpose_12_perm_0, x = k_13_cast_fp16)[name = tensor("transpose_222")]; + tensor tile_6_cast_fp16 = tile(reps = tile_6_reps_0, x = transpose_12_cast_fp16)[name = tensor("tile_6_cast_fp16")]; + tensor concat_12 = const()[name = tensor("concat_12"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_12_cast_fp16 = reshape(shape = concat_12, x = tile_6_cast_fp16)[name = tensor("reshape_12_cast_fp16")]; + tensor transpose_13_perm_0 = const()[name = tensor("transpose_13_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_13 = const()[name = tensor("concat_13"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_13_cast_fp16 = transpose(perm = transpose_13_perm_0, x = reshape_12_cast_fp16)[name = tensor("transpose_221")]; + tensor reshape_13_cast_fp16 = reshape(shape = concat_13, x = transpose_13_cast_fp16)[name = tensor("reshape_13_cast_fp16")]; + tensor transpose_119_perm_0 = const()[name = tensor("transpose_119_perm_0"), val = tensor([1, 0, -1, -2])]; + tensor tile_7_reps_0 = const()[name = tensor("tile_7_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_118_cast_fp16 = transpose(perm = transpose_118_perm_0, x = var_618_cast_fp16)[name = tensor("transpose_220")]; + tensor tile_7_cast_fp16 = tile(reps = tile_7_reps_0, x = transpose_118_cast_fp16)[name = tensor("tile_7_cast_fp16")]; + tensor concat_14 = const()[name = tensor("concat_14"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_14_cast_fp16 = reshape(shape = concat_14, x = tile_7_cast_fp16)[name = tensor("reshape_14_cast_fp16")]; + tensor transpose_15_perm_0 = const()[name = tensor("transpose_15_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_15 = const()[name = tensor("concat_15"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_15_cast_fp16 = transpose(perm = transpose_15_perm_0, x = reshape_14_cast_fp16)[name = tensor("transpose_219")]; + tensor reshape_15_cast_fp16 = reshape(shape = concat_15, x = transpose_15_cast_fp16)[name = tensor("reshape_15_cast_fp16")]; + tensor v_15_perm_0 = const()[name = tensor("v_15_perm_0"), val = tensor([1, 0, -2, -1])]; + tensor var_691_transpose_x_0 = const()[name = tensor("op_691_transpose_x_0"), val = tensor(false)]; + tensor var_691_transpose_y_0 = const()[name = tensor("op_691_transpose_y_0"), val = tensor(false)]; + tensor transpose_119_cast_fp16 = transpose(perm = transpose_119_perm_0, x = reshape_13_cast_fp16)[name = tensor("transpose_218")]; + tensor var_691_cast_fp16 = matmul(transpose_x = var_691_transpose_x_0, transpose_y = var_691_transpose_y_0, x = q_7_cast_fp16, y = transpose_119_cast_fp16)[name = tensor("op_691_cast_fp16")]; + tensor var_692_to_fp16 = const()[name = tensor("op_692_to_fp16"), val = tensor(0x1.6ap-4)]; + tensor attn_13_cast_fp16 = mul(x = var_691_cast_fp16, y = var_692_to_fp16)[name = tensor("attn_13_cast_fp16")]; + tensor input_31_cast_fp16 = add(x = attn_13_cast_fp16, y = causal_mask_to_fp16_palettized)[name = tensor("input_31_cast_fp16")]; + tensor attn_15_cast_fp16 = softmax(axis = var_575, x = input_31_cast_fp16)[name = tensor("attn_15_cast_fp16")]; + tensor var_696_transpose_x_0 = const()[name = tensor("op_696_transpose_x_0"), val = tensor(false)]; + tensor var_696_transpose_y_0 = const()[name = tensor("op_696_transpose_y_0"), val = tensor(false)]; + tensor v_15_cast_fp16 = transpose(perm = v_15_perm_0, x = reshape_15_cast_fp16)[name = tensor("transpose_217")]; + tensor var_696_cast_fp16 = matmul(transpose_x = var_696_transpose_x_0, transpose_y = var_696_transpose_y_0, x = attn_15_cast_fp16, y = v_15_cast_fp16)[name = tensor("op_696_cast_fp16")]; + tensor var_697_perm_0 = const()[name = tensor("op_697_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor var_698 = const()[name = tensor("op_698"), val = tensor([1, 768, 2048])]; + tensor var_697_cast_fp16 = transpose(perm = var_697_perm_0, x = var_696_cast_fp16)[name = tensor("transpose_216")]; + tensor input_33_cast_fp16 = reshape(shape = var_698, x = var_697_cast_fp16)[name = tensor("input_33_cast_fp16")]; + tensor layers_3_self_attn_o_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(52115520))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(54212736))), name = tensor("layers_3_self_attn_o_proj_weight_to_fp16_palettized"), shape = tensor([1024, 2048])]; + tensor linear_24_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_3_self_attn_o_proj_weight_to_fp16_palettized, x = input_33_cast_fp16)[name = tensor("linear_24_cast_fp16")]; + tensor x_83_cast_fp16 = add(x = x_65_cast_fp16, y = linear_24_cast_fp16)[name = tensor("x_83_cast_fp16")]; + tensor var_574_promoted_3_to_fp16 = const()[name = tensor("op_574_promoted_3_to_fp16"), val = tensor(0x1p+1)]; + tensor var_705_cast_fp16 = pow(x = x_83_cast_fp16, y = var_574_promoted_3_to_fp16)[name = tensor("op_705_cast_fp16")]; + tensor var_707_axes_0 = const()[name = tensor("op_707_axes_0"), val = tensor([-1])]; + tensor var_707_keep_dims_0 = const()[name = tensor("op_707_keep_dims_0"), val = tensor(true)]; + tensor var_707_cast_fp16 = reduce_mean(axes = var_707_axes_0, keep_dims = var_707_keep_dims_0, x = var_705_cast_fp16)[name = tensor("op_707_cast_fp16")]; + tensor var_708_to_fp16 = const()[name = tensor("op_708_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_709_cast_fp16 = add(x = var_707_cast_fp16, y = var_708_to_fp16)[name = tensor("op_709_cast_fp16")]; + tensor norm_31_epsilon_0 = const()[name = tensor("norm_31_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_31_cast_fp16 = rsqrt(epsilon = norm_31_epsilon_0, x = var_709_cast_fp16)[name = tensor("norm_31_cast_fp16")]; + tensor var_711_cast_fp16 = mul(x = x_83_cast_fp16, y = norm_31_cast_fp16)[name = tensor("op_711_cast_fp16")]; + tensor layers_3_post_attention_layernorm_weight_to_fp16 = const()[name = tensor("layers_3_post_attention_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(54213312)))]; + tensor var_712_cast_fp16 = mul(x = var_711_cast_fp16, y = layers_3_post_attention_layernorm_weight_to_fp16)[name = tensor("op_712_cast_fp16")]; + tensor layers_3_mlp_gate_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(54215424))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(57361216))), name = tensor("layers_3_mlp_gate_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_25_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_3_mlp_gate_proj_weight_to_fp16_palettized, x = var_712_cast_fp16)[name = tensor("linear_25_cast_fp16")]; + tensor var_722_cast_fp16 = silu(x = linear_25_cast_fp16)[name = tensor("op_722_cast_fp16")]; + tensor layers_3_mlp_up_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(57361792))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(60507584))), name = tensor("layers_3_mlp_up_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_26_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_3_mlp_up_proj_weight_to_fp16_palettized, x = var_712_cast_fp16)[name = tensor("linear_26_cast_fp16")]; + tensor input_39_cast_fp16 = mul(x = var_722_cast_fp16, y = linear_26_cast_fp16)[name = tensor("input_39_cast_fp16")]; + tensor layers_3_mlp_down_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(60508160))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(63653952))), name = tensor("layers_3_mlp_down_proj_weight_to_fp16_palettized"), shape = tensor([1024, 3072])]; + tensor linear_27_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_3_mlp_down_proj_weight_to_fp16_palettized, x = input_39_cast_fp16)[name = tensor("linear_27_cast_fp16")]; + tensor x_87_cast_fp16 = add(x = x_83_cast_fp16, y = linear_27_cast_fp16)[name = tensor("x_87_cast_fp16")]; + tensor var_742 = const()[name = tensor("op_742"), val = tensor(-1)]; + tensor var_741_promoted_to_fp16 = const()[name = tensor("op_741_promoted_to_fp16"), val = tensor(0x1p+1)]; + tensor var_751_cast_fp16 = pow(x = x_87_cast_fp16, y = var_741_promoted_to_fp16)[name = tensor("op_751_cast_fp16")]; + tensor var_753_axes_0 = const()[name = tensor("op_753_axes_0"), val = tensor([-1])]; + tensor var_753_keep_dims_0 = const()[name = tensor("op_753_keep_dims_0"), val = tensor(true)]; + tensor var_753_cast_fp16 = reduce_mean(axes = var_753_axes_0, keep_dims = var_753_keep_dims_0, x = var_751_cast_fp16)[name = tensor("op_753_cast_fp16")]; + tensor var_754_to_fp16 = const()[name = tensor("op_754_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_755_cast_fp16 = add(x = var_753_cast_fp16, y = var_754_to_fp16)[name = tensor("op_755_cast_fp16")]; + tensor norm_33_epsilon_0 = const()[name = tensor("norm_33_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_33_cast_fp16 = rsqrt(epsilon = norm_33_epsilon_0, x = var_755_cast_fp16)[name = tensor("norm_33_cast_fp16")]; + tensor var_757_cast_fp16 = mul(x = x_87_cast_fp16, y = norm_33_cast_fp16)[name = tensor("op_757_cast_fp16")]; + tensor layers_4_input_layernorm_weight_to_fp16 = const()[name = tensor("layers_4_input_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(63654528)))]; + tensor var_758_cast_fp16 = mul(x = var_757_cast_fp16, y = layers_4_input_layernorm_weight_to_fp16)[name = tensor("op_758_cast_fp16")]; + tensor layers_4_self_attn_q_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(63656640))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(65753856))), name = tensor("layers_4_self_attn_q_proj_weight_to_fp16_palettized"), shape = tensor([2048, 1024])]; + tensor linear_28_cast_fp16 = linear(bias = linear_0_bias_0_to_fp16, weight = layers_4_self_attn_q_proj_weight_to_fp16_palettized, x = var_758_cast_fp16)[name = tensor("linear_28_cast_fp16")]; + tensor var_774 = const()[name = tensor("op_774"), val = tensor([1, 768, 16, 128])]; + tensor var_775_cast_fp16 = reshape(shape = var_774, x = linear_28_cast_fp16)[name = tensor("op_775_cast_fp16")]; + tensor x_93_perm_0 = const()[name = tensor("x_93_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_4_self_attn_k_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(65754432))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(66803072))), name = tensor("layers_4_self_attn_k_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_29_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_4_self_attn_k_proj_weight_to_fp16_palettized, x = var_758_cast_fp16)[name = tensor("linear_29_cast_fp16")]; + tensor var_779 = const()[name = tensor("op_779"), val = tensor([1, 768, 8, 128])]; + tensor var_780_cast_fp16 = reshape(shape = var_779, x = linear_29_cast_fp16)[name = tensor("op_780_cast_fp16")]; + tensor x_97_perm_0 = const()[name = tensor("x_97_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_4_self_attn_v_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(66803648))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(67852288))), name = tensor("layers_4_self_attn_v_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_30_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_4_self_attn_v_proj_weight_to_fp16_palettized, x = var_758_cast_fp16)[name = tensor("linear_30_cast_fp16")]; + tensor var_784 = const()[name = tensor("op_784"), val = tensor([1, 768, 8, 128])]; + tensor var_785_cast_fp16 = reshape(shape = var_784, x = linear_30_cast_fp16)[name = tensor("op_785_cast_fp16")]; + tensor transpose_120_perm_0 = const()[name = tensor("transpose_120_perm_0"), val = tensor([2, 0, 1, 3])]; + tensor var_741_promoted_1_to_fp16 = const()[name = tensor("op_741_promoted_1_to_fp16"), val = tensor(0x1p+1)]; + tensor x_93_cast_fp16 = transpose(perm = x_93_perm_0, x = var_775_cast_fp16)[name = tensor("transpose_215")]; + tensor var_789_cast_fp16 = pow(x = x_93_cast_fp16, y = var_741_promoted_1_to_fp16)[name = tensor("op_789_cast_fp16")]; + tensor var_791_axes_0 = const()[name = tensor("op_791_axes_0"), val = tensor([-1])]; + tensor var_791_keep_dims_0 = const()[name = tensor("op_791_keep_dims_0"), val = tensor(true)]; + tensor var_791_cast_fp16 = reduce_mean(axes = var_791_axes_0, keep_dims = var_791_keep_dims_0, x = var_789_cast_fp16)[name = tensor("op_791_cast_fp16")]; + tensor var_792_to_fp16 = const()[name = tensor("op_792_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_793_cast_fp16 = add(x = var_791_cast_fp16, y = var_792_to_fp16)[name = tensor("op_793_cast_fp16")]; + tensor norm_35_epsilon_0 = const()[name = tensor("norm_35_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_35_cast_fp16 = rsqrt(epsilon = norm_35_epsilon_0, x = var_793_cast_fp16)[name = tensor("norm_35_cast_fp16")]; + tensor var_795_cast_fp16 = mul(x = x_93_cast_fp16, y = norm_35_cast_fp16)[name = tensor("op_795_cast_fp16")]; + tensor layers_4_self_attn_q_norm_weight_to_fp16 = const()[name = tensor("layers_4_self_attn_q_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(67852864)))]; + tensor var_796_cast_fp16 = mul(x = var_795_cast_fp16, y = layers_4_self_attn_q_norm_weight_to_fp16)[name = tensor("op_796_cast_fp16")]; + tensor var_741_promoted_2_to_fp16 = const()[name = tensor("op_741_promoted_2_to_fp16"), val = tensor(0x1p+1)]; + tensor x_97_cast_fp16 = transpose(perm = x_97_perm_0, x = var_780_cast_fp16)[name = tensor("transpose_214")]; + tensor var_800_cast_fp16 = pow(x = x_97_cast_fp16, y = var_741_promoted_2_to_fp16)[name = tensor("op_800_cast_fp16")]; + tensor var_802_axes_0 = const()[name = tensor("op_802_axes_0"), val = tensor([-1])]; + tensor var_802_keep_dims_0 = const()[name = tensor("op_802_keep_dims_0"), val = tensor(true)]; + tensor var_802_cast_fp16 = reduce_mean(axes = var_802_axes_0, keep_dims = var_802_keep_dims_0, x = var_800_cast_fp16)[name = tensor("op_802_cast_fp16")]; + tensor var_803_to_fp16 = const()[name = tensor("op_803_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_804_cast_fp16 = add(x = var_802_cast_fp16, y = var_803_to_fp16)[name = tensor("op_804_cast_fp16")]; + tensor norm_37_epsilon_0 = const()[name = tensor("norm_37_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_37_cast_fp16 = rsqrt(epsilon = norm_37_epsilon_0, x = var_804_cast_fp16)[name = tensor("norm_37_cast_fp16")]; + tensor var_806_cast_fp16 = mul(x = x_97_cast_fp16, y = norm_37_cast_fp16)[name = tensor("op_806_cast_fp16")]; + tensor layers_4_self_attn_k_norm_weight_to_fp16 = const()[name = tensor("layers_4_self_attn_k_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(67853184)))]; + tensor var_807_cast_fp16 = mul(x = var_806_cast_fp16, y = layers_4_self_attn_k_norm_weight_to_fp16)[name = tensor("op_807_cast_fp16")]; + tensor x1_17_begin_0 = const()[name = tensor("x1_17_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_17_end_0 = const()[name = tensor("x1_17_end_0"), val = tensor([1, 16, 768, 64])]; + tensor x1_17_end_mask_0 = const()[name = tensor("x1_17_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_17_cast_fp16 = slice_by_index(begin = x1_17_begin_0, end = x1_17_end_0, end_mask = x1_17_end_mask_0, x = var_796_cast_fp16)[name = tensor("x1_17_cast_fp16")]; + tensor x2_17_begin_0 = const()[name = tensor("x2_17_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_17_end_0 = const()[name = tensor("x2_17_end_0"), val = tensor([1, 16, 768, 128])]; + tensor x2_17_end_mask_0 = const()[name = tensor("x2_17_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_17_cast_fp16 = slice_by_index(begin = x2_17_begin_0, end = x2_17_end_0, end_mask = x2_17_end_mask_0, x = var_796_cast_fp16)[name = tensor("x2_17_cast_fp16")]; + tensor var_824_cast_fp16 = mul(x = x1_17_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_824_cast_fp16")]; + tensor var_825_cast_fp16 = mul(x = x2_17_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_825_cast_fp16")]; + tensor var_826_cast_fp16 = sub(x = var_824_cast_fp16, y = var_825_cast_fp16)[name = tensor("op_826_cast_fp16")]; + tensor var_827_cast_fp16 = mul(x = x2_17_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_827_cast_fp16")]; + tensor var_828_cast_fp16 = mul(x = x1_17_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_828_cast_fp16")]; + tensor var_829_cast_fp16 = add(x = var_827_cast_fp16, y = var_828_cast_fp16)[name = tensor("op_829_cast_fp16")]; + tensor q_9_interleave_0 = const()[name = tensor("q_9_interleave_0"), val = tensor(false)]; + tensor q_9_cast_fp16 = concat(axis = var_742, interleave = q_9_interleave_0, values = (var_826_cast_fp16, var_829_cast_fp16))[name = tensor("q_9_cast_fp16")]; + tensor x1_19_begin_0 = const()[name = tensor("x1_19_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_19_end_0 = const()[name = tensor("x1_19_end_0"), val = tensor([1, 8, 768, 64])]; + tensor x1_19_end_mask_0 = const()[name = tensor("x1_19_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_19_cast_fp16 = slice_by_index(begin = x1_19_begin_0, end = x1_19_end_0, end_mask = x1_19_end_mask_0, x = var_807_cast_fp16)[name = tensor("x1_19_cast_fp16")]; + tensor x2_19_begin_0 = const()[name = tensor("x2_19_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_19_end_0 = const()[name = tensor("x2_19_end_0"), val = tensor([1, 8, 768, 128])]; + tensor x2_19_end_mask_0 = const()[name = tensor("x2_19_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_19_cast_fp16 = slice_by_index(begin = x2_19_begin_0, end = x2_19_end_0, end_mask = x2_19_end_mask_0, x = var_807_cast_fp16)[name = tensor("x2_19_cast_fp16")]; + tensor var_847_cast_fp16 = mul(x = x1_19_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_847_cast_fp16")]; + tensor var_848_cast_fp16 = mul(x = x2_19_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_848_cast_fp16")]; + tensor var_849_cast_fp16 = sub(x = var_847_cast_fp16, y = var_848_cast_fp16)[name = tensor("op_849_cast_fp16")]; + tensor var_850_cast_fp16 = mul(x = x2_19_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_850_cast_fp16")]; + tensor var_851_cast_fp16 = mul(x = x1_19_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_851_cast_fp16")]; + tensor var_852_cast_fp16 = add(x = var_850_cast_fp16, y = var_851_cast_fp16)[name = tensor("op_852_cast_fp16")]; + tensor k_17_interleave_0 = const()[name = tensor("k_17_interleave_0"), val = tensor(false)]; + tensor k_17_cast_fp16 = concat(axis = var_742, interleave = k_17_interleave_0, values = (var_849_cast_fp16, var_852_cast_fp16))[name = tensor("k_17_cast_fp16")]; + tensor transpose_16_perm_0 = const()[name = tensor("transpose_16_perm_0"), val = tensor([1, 0, 2, 3])]; + tensor tile_8_reps_0 = const()[name = tensor("tile_8_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_16_cast_fp16 = transpose(perm = transpose_16_perm_0, x = k_17_cast_fp16)[name = tensor("transpose_213")]; + tensor tile_8_cast_fp16 = tile(reps = tile_8_reps_0, x = transpose_16_cast_fp16)[name = tensor("tile_8_cast_fp16")]; + tensor concat_16 = const()[name = tensor("concat_16"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_16_cast_fp16 = reshape(shape = concat_16, x = tile_8_cast_fp16)[name = tensor("reshape_16_cast_fp16")]; + tensor transpose_17_perm_0 = const()[name = tensor("transpose_17_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_17 = const()[name = tensor("concat_17"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_17_cast_fp16 = transpose(perm = transpose_17_perm_0, x = reshape_16_cast_fp16)[name = tensor("transpose_212")]; + tensor reshape_17_cast_fp16 = reshape(shape = concat_17, x = transpose_17_cast_fp16)[name = tensor("reshape_17_cast_fp16")]; + tensor transpose_121_perm_0 = const()[name = tensor("transpose_121_perm_0"), val = tensor([1, 0, -1, -2])]; + tensor tile_9_reps_0 = const()[name = tensor("tile_9_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_120_cast_fp16 = transpose(perm = transpose_120_perm_0, x = var_785_cast_fp16)[name = tensor("transpose_211")]; + tensor tile_9_cast_fp16 = tile(reps = tile_9_reps_0, x = transpose_120_cast_fp16)[name = tensor("tile_9_cast_fp16")]; + tensor concat_18 = const()[name = tensor("concat_18"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_18_cast_fp16 = reshape(shape = concat_18, x = tile_9_cast_fp16)[name = tensor("reshape_18_cast_fp16")]; + tensor transpose_19_perm_0 = const()[name = tensor("transpose_19_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_19 = const()[name = tensor("concat_19"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_19_cast_fp16 = transpose(perm = transpose_19_perm_0, x = reshape_18_cast_fp16)[name = tensor("transpose_210")]; + tensor reshape_19_cast_fp16 = reshape(shape = concat_19, x = transpose_19_cast_fp16)[name = tensor("reshape_19_cast_fp16")]; + tensor v_19_perm_0 = const()[name = tensor("v_19_perm_0"), val = tensor([1, 0, -2, -1])]; + tensor var_858_transpose_x_0 = const()[name = tensor("op_858_transpose_x_0"), val = tensor(false)]; + tensor var_858_transpose_y_0 = const()[name = tensor("op_858_transpose_y_0"), val = tensor(false)]; + tensor transpose_121_cast_fp16 = transpose(perm = transpose_121_perm_0, x = reshape_17_cast_fp16)[name = tensor("transpose_209")]; + tensor var_858_cast_fp16 = matmul(transpose_x = var_858_transpose_x_0, transpose_y = var_858_transpose_y_0, x = q_9_cast_fp16, y = transpose_121_cast_fp16)[name = tensor("op_858_cast_fp16")]; + tensor var_859_to_fp16 = const()[name = tensor("op_859_to_fp16"), val = tensor(0x1.6ap-4)]; + tensor attn_17_cast_fp16 = mul(x = var_858_cast_fp16, y = var_859_to_fp16)[name = tensor("attn_17_cast_fp16")]; + tensor input_41_cast_fp16 = add(x = attn_17_cast_fp16, y = causal_mask_to_fp16_palettized)[name = tensor("input_41_cast_fp16")]; + tensor attn_19_cast_fp16 = softmax(axis = var_742, x = input_41_cast_fp16)[name = tensor("attn_19_cast_fp16")]; + tensor var_863_transpose_x_0 = const()[name = tensor("op_863_transpose_x_0"), val = tensor(false)]; + tensor var_863_transpose_y_0 = const()[name = tensor("op_863_transpose_y_0"), val = tensor(false)]; + tensor v_19_cast_fp16 = transpose(perm = v_19_perm_0, x = reshape_19_cast_fp16)[name = tensor("transpose_208")]; + tensor var_863_cast_fp16 = matmul(transpose_x = var_863_transpose_x_0, transpose_y = var_863_transpose_y_0, x = attn_19_cast_fp16, y = v_19_cast_fp16)[name = tensor("op_863_cast_fp16")]; + tensor var_864_perm_0 = const()[name = tensor("op_864_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor var_865 = const()[name = tensor("op_865"), val = tensor([1, 768, 2048])]; + tensor var_864_cast_fp16 = transpose(perm = var_864_perm_0, x = var_863_cast_fp16)[name = tensor("transpose_207")]; + tensor input_43_cast_fp16 = reshape(shape = var_865, x = var_864_cast_fp16)[name = tensor("input_43_cast_fp16")]; + tensor layers_4_self_attn_o_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(67853504))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(69950720))), name = tensor("layers_4_self_attn_o_proj_weight_to_fp16_palettized"), shape = tensor([1024, 2048])]; + tensor linear_31_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_4_self_attn_o_proj_weight_to_fp16_palettized, x = input_43_cast_fp16)[name = tensor("linear_31_cast_fp16")]; + tensor x_105_cast_fp16 = add(x = x_87_cast_fp16, y = linear_31_cast_fp16)[name = tensor("x_105_cast_fp16")]; + tensor var_741_promoted_3_to_fp16 = const()[name = tensor("op_741_promoted_3_to_fp16"), val = tensor(0x1p+1)]; + tensor var_872_cast_fp16 = pow(x = x_105_cast_fp16, y = var_741_promoted_3_to_fp16)[name = tensor("op_872_cast_fp16")]; + tensor var_874_axes_0 = const()[name = tensor("op_874_axes_0"), val = tensor([-1])]; + tensor var_874_keep_dims_0 = const()[name = tensor("op_874_keep_dims_0"), val = tensor(true)]; + tensor var_874_cast_fp16 = reduce_mean(axes = var_874_axes_0, keep_dims = var_874_keep_dims_0, x = var_872_cast_fp16)[name = tensor("op_874_cast_fp16")]; + tensor var_875_to_fp16 = const()[name = tensor("op_875_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_876_cast_fp16 = add(x = var_874_cast_fp16, y = var_875_to_fp16)[name = tensor("op_876_cast_fp16")]; + tensor norm_39_epsilon_0 = const()[name = tensor("norm_39_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_39_cast_fp16 = rsqrt(epsilon = norm_39_epsilon_0, x = var_876_cast_fp16)[name = tensor("norm_39_cast_fp16")]; + tensor var_878_cast_fp16 = mul(x = x_105_cast_fp16, y = norm_39_cast_fp16)[name = tensor("op_878_cast_fp16")]; + tensor layers_4_post_attention_layernorm_weight_to_fp16 = const()[name = tensor("layers_4_post_attention_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(69951296)))]; + tensor var_879_cast_fp16 = mul(x = var_878_cast_fp16, y = layers_4_post_attention_layernorm_weight_to_fp16)[name = tensor("op_879_cast_fp16")]; + tensor layers_4_mlp_gate_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(69953408))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(73099200))), name = tensor("layers_4_mlp_gate_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_32_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_4_mlp_gate_proj_weight_to_fp16_palettized, x = var_879_cast_fp16)[name = tensor("linear_32_cast_fp16")]; + tensor var_889_cast_fp16 = silu(x = linear_32_cast_fp16)[name = tensor("op_889_cast_fp16")]; + tensor layers_4_mlp_up_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(73099776))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(76245568))), name = tensor("layers_4_mlp_up_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_33_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_4_mlp_up_proj_weight_to_fp16_palettized, x = var_879_cast_fp16)[name = tensor("linear_33_cast_fp16")]; + tensor input_49_cast_fp16 = mul(x = var_889_cast_fp16, y = linear_33_cast_fp16)[name = tensor("input_49_cast_fp16")]; + tensor layers_4_mlp_down_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(76246144))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(79391936))), name = tensor("layers_4_mlp_down_proj_weight_to_fp16_palettized"), shape = tensor([1024, 3072])]; + tensor linear_34_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_4_mlp_down_proj_weight_to_fp16_palettized, x = input_49_cast_fp16)[name = tensor("linear_34_cast_fp16")]; + tensor x_109_cast_fp16 = add(x = x_105_cast_fp16, y = linear_34_cast_fp16)[name = tensor("x_109_cast_fp16")]; + tensor var_909 = const()[name = tensor("op_909"), val = tensor(-1)]; + tensor var_908_promoted_to_fp16 = const()[name = tensor("op_908_promoted_to_fp16"), val = tensor(0x1p+1)]; + tensor var_918_cast_fp16 = pow(x = x_109_cast_fp16, y = var_908_promoted_to_fp16)[name = tensor("op_918_cast_fp16")]; + tensor var_920_axes_0 = const()[name = tensor("op_920_axes_0"), val = tensor([-1])]; + tensor var_920_keep_dims_0 = const()[name = tensor("op_920_keep_dims_0"), val = tensor(true)]; + tensor var_920_cast_fp16 = reduce_mean(axes = var_920_axes_0, keep_dims = var_920_keep_dims_0, x = var_918_cast_fp16)[name = tensor("op_920_cast_fp16")]; + tensor var_921_to_fp16 = const()[name = tensor("op_921_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_922_cast_fp16 = add(x = var_920_cast_fp16, y = var_921_to_fp16)[name = tensor("op_922_cast_fp16")]; + tensor norm_41_epsilon_0 = const()[name = tensor("norm_41_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_41_cast_fp16 = rsqrt(epsilon = norm_41_epsilon_0, x = var_922_cast_fp16)[name = tensor("norm_41_cast_fp16")]; + tensor var_924_cast_fp16 = mul(x = x_109_cast_fp16, y = norm_41_cast_fp16)[name = tensor("op_924_cast_fp16")]; + tensor layers_5_input_layernorm_weight_to_fp16 = const()[name = tensor("layers_5_input_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(79392512)))]; + tensor var_925_cast_fp16 = mul(x = var_924_cast_fp16, y = layers_5_input_layernorm_weight_to_fp16)[name = tensor("op_925_cast_fp16")]; + tensor layers_5_self_attn_q_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(79394624))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(81491840))), name = tensor("layers_5_self_attn_q_proj_weight_to_fp16_palettized"), shape = tensor([2048, 1024])]; + tensor linear_35_cast_fp16 = linear(bias = linear_0_bias_0_to_fp16, weight = layers_5_self_attn_q_proj_weight_to_fp16_palettized, x = var_925_cast_fp16)[name = tensor("linear_35_cast_fp16")]; + tensor var_941 = const()[name = tensor("op_941"), val = tensor([1, 768, 16, 128])]; + tensor var_942_cast_fp16 = reshape(shape = var_941, x = linear_35_cast_fp16)[name = tensor("op_942_cast_fp16")]; + tensor x_115_perm_0 = const()[name = tensor("x_115_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_5_self_attn_k_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(81492416))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(82541056))), name = tensor("layers_5_self_attn_k_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_36_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_5_self_attn_k_proj_weight_to_fp16_palettized, x = var_925_cast_fp16)[name = tensor("linear_36_cast_fp16")]; + tensor var_946 = const()[name = tensor("op_946"), val = tensor([1, 768, 8, 128])]; + tensor var_947_cast_fp16 = reshape(shape = var_946, x = linear_36_cast_fp16)[name = tensor("op_947_cast_fp16")]; + tensor x_119_perm_0 = const()[name = tensor("x_119_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_5_self_attn_v_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(82541632))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(83590272))), name = tensor("layers_5_self_attn_v_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_37_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_5_self_attn_v_proj_weight_to_fp16_palettized, x = var_925_cast_fp16)[name = tensor("linear_37_cast_fp16")]; + tensor var_951 = const()[name = tensor("op_951"), val = tensor([1, 768, 8, 128])]; + tensor var_952_cast_fp16 = reshape(shape = var_951, x = linear_37_cast_fp16)[name = tensor("op_952_cast_fp16")]; + tensor transpose_122_perm_0 = const()[name = tensor("transpose_122_perm_0"), val = tensor([2, 0, 1, 3])]; + tensor var_908_promoted_1_to_fp16 = const()[name = tensor("op_908_promoted_1_to_fp16"), val = tensor(0x1p+1)]; + tensor x_115_cast_fp16 = transpose(perm = x_115_perm_0, x = var_942_cast_fp16)[name = tensor("transpose_206")]; + tensor var_956_cast_fp16 = pow(x = x_115_cast_fp16, y = var_908_promoted_1_to_fp16)[name = tensor("op_956_cast_fp16")]; + tensor var_958_axes_0 = const()[name = tensor("op_958_axes_0"), val = tensor([-1])]; + tensor var_958_keep_dims_0 = const()[name = tensor("op_958_keep_dims_0"), val = tensor(true)]; + tensor var_958_cast_fp16 = reduce_mean(axes = var_958_axes_0, keep_dims = var_958_keep_dims_0, x = var_956_cast_fp16)[name = tensor("op_958_cast_fp16")]; + tensor var_959_to_fp16 = const()[name = tensor("op_959_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_960_cast_fp16 = add(x = var_958_cast_fp16, y = var_959_to_fp16)[name = tensor("op_960_cast_fp16")]; + tensor norm_43_epsilon_0 = const()[name = tensor("norm_43_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_43_cast_fp16 = rsqrt(epsilon = norm_43_epsilon_0, x = var_960_cast_fp16)[name = tensor("norm_43_cast_fp16")]; + tensor var_962_cast_fp16 = mul(x = x_115_cast_fp16, y = norm_43_cast_fp16)[name = tensor("op_962_cast_fp16")]; + tensor layers_5_self_attn_q_norm_weight_to_fp16 = const()[name = tensor("layers_5_self_attn_q_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(83590848)))]; + tensor var_963_cast_fp16 = mul(x = var_962_cast_fp16, y = layers_5_self_attn_q_norm_weight_to_fp16)[name = tensor("op_963_cast_fp16")]; + tensor var_908_promoted_2_to_fp16 = const()[name = tensor("op_908_promoted_2_to_fp16"), val = tensor(0x1p+1)]; + tensor x_119_cast_fp16 = transpose(perm = x_119_perm_0, x = var_947_cast_fp16)[name = tensor("transpose_205")]; + tensor var_967_cast_fp16 = pow(x = x_119_cast_fp16, y = var_908_promoted_2_to_fp16)[name = tensor("op_967_cast_fp16")]; + tensor var_969_axes_0 = const()[name = tensor("op_969_axes_0"), val = tensor([-1])]; + tensor var_969_keep_dims_0 = const()[name = tensor("op_969_keep_dims_0"), val = tensor(true)]; + tensor var_969_cast_fp16 = reduce_mean(axes = var_969_axes_0, keep_dims = var_969_keep_dims_0, x = var_967_cast_fp16)[name = tensor("op_969_cast_fp16")]; + tensor var_970_to_fp16 = const()[name = tensor("op_970_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_971_cast_fp16 = add(x = var_969_cast_fp16, y = var_970_to_fp16)[name = tensor("op_971_cast_fp16")]; + tensor norm_45_epsilon_0 = const()[name = tensor("norm_45_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_45_cast_fp16 = rsqrt(epsilon = norm_45_epsilon_0, x = var_971_cast_fp16)[name = tensor("norm_45_cast_fp16")]; + tensor var_973_cast_fp16 = mul(x = x_119_cast_fp16, y = norm_45_cast_fp16)[name = tensor("op_973_cast_fp16")]; + tensor layers_5_self_attn_k_norm_weight_to_fp16 = const()[name = tensor("layers_5_self_attn_k_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(83591168)))]; + tensor var_974_cast_fp16 = mul(x = var_973_cast_fp16, y = layers_5_self_attn_k_norm_weight_to_fp16)[name = tensor("op_974_cast_fp16")]; + tensor x1_21_begin_0 = const()[name = tensor("x1_21_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_21_end_0 = const()[name = tensor("x1_21_end_0"), val = tensor([1, 16, 768, 64])]; + tensor x1_21_end_mask_0 = const()[name = tensor("x1_21_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_21_cast_fp16 = slice_by_index(begin = x1_21_begin_0, end = x1_21_end_0, end_mask = x1_21_end_mask_0, x = var_963_cast_fp16)[name = tensor("x1_21_cast_fp16")]; + tensor x2_21_begin_0 = const()[name = tensor("x2_21_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_21_end_0 = const()[name = tensor("x2_21_end_0"), val = tensor([1, 16, 768, 128])]; + tensor x2_21_end_mask_0 = const()[name = tensor("x2_21_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_21_cast_fp16 = slice_by_index(begin = x2_21_begin_0, end = x2_21_end_0, end_mask = x2_21_end_mask_0, x = var_963_cast_fp16)[name = tensor("x2_21_cast_fp16")]; + tensor var_991_cast_fp16 = mul(x = x1_21_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_991_cast_fp16")]; + tensor var_992_cast_fp16 = mul(x = x2_21_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_992_cast_fp16")]; + tensor var_993_cast_fp16 = sub(x = var_991_cast_fp16, y = var_992_cast_fp16)[name = tensor("op_993_cast_fp16")]; + tensor var_994_cast_fp16 = mul(x = x2_21_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_994_cast_fp16")]; + tensor var_995_cast_fp16 = mul(x = x1_21_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_995_cast_fp16")]; + tensor var_996_cast_fp16 = add(x = var_994_cast_fp16, y = var_995_cast_fp16)[name = tensor("op_996_cast_fp16")]; + tensor q_11_interleave_0 = const()[name = tensor("q_11_interleave_0"), val = tensor(false)]; + tensor q_11_cast_fp16 = concat(axis = var_909, interleave = q_11_interleave_0, values = (var_993_cast_fp16, var_996_cast_fp16))[name = tensor("q_11_cast_fp16")]; + tensor x1_23_begin_0 = const()[name = tensor("x1_23_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_23_end_0 = const()[name = tensor("x1_23_end_0"), val = tensor([1, 8, 768, 64])]; + tensor x1_23_end_mask_0 = const()[name = tensor("x1_23_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_23_cast_fp16 = slice_by_index(begin = x1_23_begin_0, end = x1_23_end_0, end_mask = x1_23_end_mask_0, x = var_974_cast_fp16)[name = tensor("x1_23_cast_fp16")]; + tensor x2_23_begin_0 = const()[name = tensor("x2_23_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_23_end_0 = const()[name = tensor("x2_23_end_0"), val = tensor([1, 8, 768, 128])]; + tensor x2_23_end_mask_0 = const()[name = tensor("x2_23_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_23_cast_fp16 = slice_by_index(begin = x2_23_begin_0, end = x2_23_end_0, end_mask = x2_23_end_mask_0, x = var_974_cast_fp16)[name = tensor("x2_23_cast_fp16")]; + tensor var_1014_cast_fp16 = mul(x = x1_23_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_1014_cast_fp16")]; + tensor var_1015_cast_fp16 = mul(x = x2_23_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_1015_cast_fp16")]; + tensor var_1016_cast_fp16 = sub(x = var_1014_cast_fp16, y = var_1015_cast_fp16)[name = tensor("op_1016_cast_fp16")]; + tensor var_1017_cast_fp16 = mul(x = x2_23_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_1017_cast_fp16")]; + tensor var_1018_cast_fp16 = mul(x = x1_23_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_1018_cast_fp16")]; + tensor var_1019_cast_fp16 = add(x = var_1017_cast_fp16, y = var_1018_cast_fp16)[name = tensor("op_1019_cast_fp16")]; + tensor k_21_interleave_0 = const()[name = tensor("k_21_interleave_0"), val = tensor(false)]; + tensor k_21_cast_fp16 = concat(axis = var_909, interleave = k_21_interleave_0, values = (var_1016_cast_fp16, var_1019_cast_fp16))[name = tensor("k_21_cast_fp16")]; + tensor transpose_20_perm_0 = const()[name = tensor("transpose_20_perm_0"), val = tensor([1, 0, 2, 3])]; + tensor tile_10_reps_0 = const()[name = tensor("tile_10_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_20_cast_fp16 = transpose(perm = transpose_20_perm_0, x = k_21_cast_fp16)[name = tensor("transpose_204")]; + tensor tile_10_cast_fp16 = tile(reps = tile_10_reps_0, x = transpose_20_cast_fp16)[name = tensor("tile_10_cast_fp16")]; + tensor concat_20 = const()[name = tensor("concat_20"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_20_cast_fp16 = reshape(shape = concat_20, x = tile_10_cast_fp16)[name = tensor("reshape_20_cast_fp16")]; + tensor transpose_21_perm_0 = const()[name = tensor("transpose_21_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_21 = const()[name = tensor("concat_21"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_21_cast_fp16 = transpose(perm = transpose_21_perm_0, x = reshape_20_cast_fp16)[name = tensor("transpose_203")]; + tensor reshape_21_cast_fp16 = reshape(shape = concat_21, x = transpose_21_cast_fp16)[name = tensor("reshape_21_cast_fp16")]; + tensor transpose_123_perm_0 = const()[name = tensor("transpose_123_perm_0"), val = tensor([1, 0, -1, -2])]; + tensor tile_11_reps_0 = const()[name = tensor("tile_11_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_122_cast_fp16 = transpose(perm = transpose_122_perm_0, x = var_952_cast_fp16)[name = tensor("transpose_202")]; + tensor tile_11_cast_fp16 = tile(reps = tile_11_reps_0, x = transpose_122_cast_fp16)[name = tensor("tile_11_cast_fp16")]; + tensor concat_22 = const()[name = tensor("concat_22"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_22_cast_fp16 = reshape(shape = concat_22, x = tile_11_cast_fp16)[name = tensor("reshape_22_cast_fp16")]; + tensor transpose_23_perm_0 = const()[name = tensor("transpose_23_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_23 = const()[name = tensor("concat_23"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_23_cast_fp16 = transpose(perm = transpose_23_perm_0, x = reshape_22_cast_fp16)[name = tensor("transpose_201")]; + tensor reshape_23_cast_fp16 = reshape(shape = concat_23, x = transpose_23_cast_fp16)[name = tensor("reshape_23_cast_fp16")]; + tensor v_23_perm_0 = const()[name = tensor("v_23_perm_0"), val = tensor([1, 0, -2, -1])]; + tensor var_1025_transpose_x_0 = const()[name = tensor("op_1025_transpose_x_0"), val = tensor(false)]; + tensor var_1025_transpose_y_0 = const()[name = tensor("op_1025_transpose_y_0"), val = tensor(false)]; + tensor transpose_123_cast_fp16 = transpose(perm = transpose_123_perm_0, x = reshape_21_cast_fp16)[name = tensor("transpose_200")]; + tensor var_1025_cast_fp16 = matmul(transpose_x = var_1025_transpose_x_0, transpose_y = var_1025_transpose_y_0, x = q_11_cast_fp16, y = transpose_123_cast_fp16)[name = tensor("op_1025_cast_fp16")]; + tensor var_1026_to_fp16 = const()[name = tensor("op_1026_to_fp16"), val = tensor(0x1.6ap-4)]; + tensor attn_21_cast_fp16 = mul(x = var_1025_cast_fp16, y = var_1026_to_fp16)[name = tensor("attn_21_cast_fp16")]; + tensor input_51_cast_fp16 = add(x = attn_21_cast_fp16, y = causal_mask_to_fp16_palettized)[name = tensor("input_51_cast_fp16")]; + tensor attn_23_cast_fp16 = softmax(axis = var_909, x = input_51_cast_fp16)[name = tensor("attn_23_cast_fp16")]; + tensor var_1030_transpose_x_0 = const()[name = tensor("op_1030_transpose_x_0"), val = tensor(false)]; + tensor var_1030_transpose_y_0 = const()[name = tensor("op_1030_transpose_y_0"), val = tensor(false)]; + tensor v_23_cast_fp16 = transpose(perm = v_23_perm_0, x = reshape_23_cast_fp16)[name = tensor("transpose_199")]; + tensor var_1030_cast_fp16 = matmul(transpose_x = var_1030_transpose_x_0, transpose_y = var_1030_transpose_y_0, x = attn_23_cast_fp16, y = v_23_cast_fp16)[name = tensor("op_1030_cast_fp16")]; + tensor var_1031_perm_0 = const()[name = tensor("op_1031_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor var_1032 = const()[name = tensor("op_1032"), val = tensor([1, 768, 2048])]; + tensor var_1031_cast_fp16 = transpose(perm = var_1031_perm_0, x = var_1030_cast_fp16)[name = tensor("transpose_198")]; + tensor input_53_cast_fp16 = reshape(shape = var_1032, x = var_1031_cast_fp16)[name = tensor("input_53_cast_fp16")]; + tensor layers_5_self_attn_o_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(83591488))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(85688704))), name = tensor("layers_5_self_attn_o_proj_weight_to_fp16_palettized"), shape = tensor([1024, 2048])]; + tensor linear_38_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_5_self_attn_o_proj_weight_to_fp16_palettized, x = input_53_cast_fp16)[name = tensor("linear_38_cast_fp16")]; + tensor x_127_cast_fp16 = add(x = x_109_cast_fp16, y = linear_38_cast_fp16)[name = tensor("x_127_cast_fp16")]; + tensor var_908_promoted_3_to_fp16 = const()[name = tensor("op_908_promoted_3_to_fp16"), val = tensor(0x1p+1)]; + tensor var_1039_cast_fp16 = pow(x = x_127_cast_fp16, y = var_908_promoted_3_to_fp16)[name = tensor("op_1039_cast_fp16")]; + tensor var_1041_axes_0 = const()[name = tensor("op_1041_axes_0"), val = tensor([-1])]; + tensor var_1041_keep_dims_0 = const()[name = tensor("op_1041_keep_dims_0"), val = tensor(true)]; + tensor var_1041_cast_fp16 = reduce_mean(axes = var_1041_axes_0, keep_dims = var_1041_keep_dims_0, x = var_1039_cast_fp16)[name = tensor("op_1041_cast_fp16")]; + tensor var_1042_to_fp16 = const()[name = tensor("op_1042_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_1043_cast_fp16 = add(x = var_1041_cast_fp16, y = var_1042_to_fp16)[name = tensor("op_1043_cast_fp16")]; + tensor norm_47_epsilon_0 = const()[name = tensor("norm_47_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_47_cast_fp16 = rsqrt(epsilon = norm_47_epsilon_0, x = var_1043_cast_fp16)[name = tensor("norm_47_cast_fp16")]; + tensor var_1045_cast_fp16 = mul(x = x_127_cast_fp16, y = norm_47_cast_fp16)[name = tensor("op_1045_cast_fp16")]; + tensor layers_5_post_attention_layernorm_weight_to_fp16 = const()[name = tensor("layers_5_post_attention_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(85689280)))]; + tensor var_1046_cast_fp16 = mul(x = var_1045_cast_fp16, y = layers_5_post_attention_layernorm_weight_to_fp16)[name = tensor("op_1046_cast_fp16")]; + tensor layers_5_mlp_gate_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(85691392))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(88837184))), name = tensor("layers_5_mlp_gate_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_39_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_5_mlp_gate_proj_weight_to_fp16_palettized, x = var_1046_cast_fp16)[name = tensor("linear_39_cast_fp16")]; + tensor var_1056_cast_fp16 = silu(x = linear_39_cast_fp16)[name = tensor("op_1056_cast_fp16")]; + tensor layers_5_mlp_up_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(88837760))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(91983552))), name = tensor("layers_5_mlp_up_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_40_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_5_mlp_up_proj_weight_to_fp16_palettized, x = var_1046_cast_fp16)[name = tensor("linear_40_cast_fp16")]; + tensor input_59_cast_fp16 = mul(x = var_1056_cast_fp16, y = linear_40_cast_fp16)[name = tensor("input_59_cast_fp16")]; + tensor layers_5_mlp_down_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(91984128))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(95129920))), name = tensor("layers_5_mlp_down_proj_weight_to_fp16_palettized"), shape = tensor([1024, 3072])]; + tensor linear_41_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_5_mlp_down_proj_weight_to_fp16_palettized, x = input_59_cast_fp16)[name = tensor("linear_41_cast_fp16")]; + tensor x_131_cast_fp16 = add(x = x_127_cast_fp16, y = linear_41_cast_fp16)[name = tensor("x_131_cast_fp16")]; + tensor var_1076 = const()[name = tensor("op_1076"), val = tensor(-1)]; + tensor var_1075_promoted_to_fp16 = const()[name = tensor("op_1075_promoted_to_fp16"), val = tensor(0x1p+1)]; + tensor var_1085_cast_fp16 = pow(x = x_131_cast_fp16, y = var_1075_promoted_to_fp16)[name = tensor("op_1085_cast_fp16")]; + tensor var_1087_axes_0 = const()[name = tensor("op_1087_axes_0"), val = tensor([-1])]; + tensor var_1087_keep_dims_0 = const()[name = tensor("op_1087_keep_dims_0"), val = tensor(true)]; + tensor var_1087_cast_fp16 = reduce_mean(axes = var_1087_axes_0, keep_dims = var_1087_keep_dims_0, x = var_1085_cast_fp16)[name = tensor("op_1087_cast_fp16")]; + tensor var_1088_to_fp16 = const()[name = tensor("op_1088_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_1089_cast_fp16 = add(x = var_1087_cast_fp16, y = var_1088_to_fp16)[name = tensor("op_1089_cast_fp16")]; + tensor norm_49_epsilon_0 = const()[name = tensor("norm_49_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_49_cast_fp16 = rsqrt(epsilon = norm_49_epsilon_0, x = var_1089_cast_fp16)[name = tensor("norm_49_cast_fp16")]; + tensor var_1091_cast_fp16 = mul(x = x_131_cast_fp16, y = norm_49_cast_fp16)[name = tensor("op_1091_cast_fp16")]; + tensor layers_6_input_layernorm_weight_to_fp16 = const()[name = tensor("layers_6_input_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(95130496)))]; + tensor var_1092_cast_fp16 = mul(x = var_1091_cast_fp16, y = layers_6_input_layernorm_weight_to_fp16)[name = tensor("op_1092_cast_fp16")]; + tensor layers_6_self_attn_q_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(95132608))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(97229824))), name = tensor("layers_6_self_attn_q_proj_weight_to_fp16_palettized"), shape = tensor([2048, 1024])]; + tensor linear_42_cast_fp16 = linear(bias = linear_0_bias_0_to_fp16, weight = layers_6_self_attn_q_proj_weight_to_fp16_palettized, x = var_1092_cast_fp16)[name = tensor("linear_42_cast_fp16")]; + tensor var_1108 = const()[name = tensor("op_1108"), val = tensor([1, 768, 16, 128])]; + tensor var_1109_cast_fp16 = reshape(shape = var_1108, x = linear_42_cast_fp16)[name = tensor("op_1109_cast_fp16")]; + tensor x_137_perm_0 = const()[name = tensor("x_137_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_6_self_attn_k_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(97230400))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(98279040))), name = tensor("layers_6_self_attn_k_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_43_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_6_self_attn_k_proj_weight_to_fp16_palettized, x = var_1092_cast_fp16)[name = tensor("linear_43_cast_fp16")]; + tensor var_1113 = const()[name = tensor("op_1113"), val = tensor([1, 768, 8, 128])]; + tensor var_1114_cast_fp16 = reshape(shape = var_1113, x = linear_43_cast_fp16)[name = tensor("op_1114_cast_fp16")]; + tensor x_141_perm_0 = const()[name = tensor("x_141_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_6_self_attn_v_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(98279616))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(99328256))), name = tensor("layers_6_self_attn_v_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_44_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_6_self_attn_v_proj_weight_to_fp16_palettized, x = var_1092_cast_fp16)[name = tensor("linear_44_cast_fp16")]; + tensor var_1118 = const()[name = tensor("op_1118"), val = tensor([1, 768, 8, 128])]; + tensor var_1119_cast_fp16 = reshape(shape = var_1118, x = linear_44_cast_fp16)[name = tensor("op_1119_cast_fp16")]; + tensor transpose_124_perm_0 = const()[name = tensor("transpose_124_perm_0"), val = tensor([2, 0, 1, 3])]; + tensor var_1075_promoted_1_to_fp16 = const()[name = tensor("op_1075_promoted_1_to_fp16"), val = tensor(0x1p+1)]; + tensor x_137_cast_fp16 = transpose(perm = x_137_perm_0, x = var_1109_cast_fp16)[name = tensor("transpose_197")]; + tensor var_1123_cast_fp16 = pow(x = x_137_cast_fp16, y = var_1075_promoted_1_to_fp16)[name = tensor("op_1123_cast_fp16")]; + tensor var_1125_axes_0 = const()[name = tensor("op_1125_axes_0"), val = tensor([-1])]; + tensor var_1125_keep_dims_0 = const()[name = tensor("op_1125_keep_dims_0"), val = tensor(true)]; + tensor var_1125_cast_fp16 = reduce_mean(axes = var_1125_axes_0, keep_dims = var_1125_keep_dims_0, x = var_1123_cast_fp16)[name = tensor("op_1125_cast_fp16")]; + tensor var_1126_to_fp16 = const()[name = tensor("op_1126_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_1127_cast_fp16 = add(x = var_1125_cast_fp16, y = var_1126_to_fp16)[name = tensor("op_1127_cast_fp16")]; + tensor norm_51_epsilon_0 = const()[name = tensor("norm_51_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_51_cast_fp16 = rsqrt(epsilon = norm_51_epsilon_0, x = var_1127_cast_fp16)[name = tensor("norm_51_cast_fp16")]; + tensor var_1129_cast_fp16 = mul(x = x_137_cast_fp16, y = norm_51_cast_fp16)[name = tensor("op_1129_cast_fp16")]; + tensor layers_6_self_attn_q_norm_weight_to_fp16 = const()[name = tensor("layers_6_self_attn_q_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(99328832)))]; + tensor var_1130_cast_fp16 = mul(x = var_1129_cast_fp16, y = layers_6_self_attn_q_norm_weight_to_fp16)[name = tensor("op_1130_cast_fp16")]; + tensor var_1075_promoted_2_to_fp16 = const()[name = tensor("op_1075_promoted_2_to_fp16"), val = tensor(0x1p+1)]; + tensor x_141_cast_fp16 = transpose(perm = x_141_perm_0, x = var_1114_cast_fp16)[name = tensor("transpose_196")]; + tensor var_1134_cast_fp16 = pow(x = x_141_cast_fp16, y = var_1075_promoted_2_to_fp16)[name = tensor("op_1134_cast_fp16")]; + tensor var_1136_axes_0 = const()[name = tensor("op_1136_axes_0"), val = tensor([-1])]; + tensor var_1136_keep_dims_0 = const()[name = tensor("op_1136_keep_dims_0"), val = tensor(true)]; + tensor var_1136_cast_fp16 = reduce_mean(axes = var_1136_axes_0, keep_dims = var_1136_keep_dims_0, x = var_1134_cast_fp16)[name = tensor("op_1136_cast_fp16")]; + tensor var_1137_to_fp16 = const()[name = tensor("op_1137_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_1138_cast_fp16 = add(x = var_1136_cast_fp16, y = var_1137_to_fp16)[name = tensor("op_1138_cast_fp16")]; + tensor norm_53_epsilon_0 = const()[name = tensor("norm_53_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_53_cast_fp16 = rsqrt(epsilon = norm_53_epsilon_0, x = var_1138_cast_fp16)[name = tensor("norm_53_cast_fp16")]; + tensor var_1140_cast_fp16 = mul(x = x_141_cast_fp16, y = norm_53_cast_fp16)[name = tensor("op_1140_cast_fp16")]; + tensor layers_6_self_attn_k_norm_weight_to_fp16 = const()[name = tensor("layers_6_self_attn_k_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(99329152)))]; + tensor var_1141_cast_fp16 = mul(x = var_1140_cast_fp16, y = layers_6_self_attn_k_norm_weight_to_fp16)[name = tensor("op_1141_cast_fp16")]; + tensor x1_25_begin_0 = const()[name = tensor("x1_25_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_25_end_0 = const()[name = tensor("x1_25_end_0"), val = tensor([1, 16, 768, 64])]; + tensor x1_25_end_mask_0 = const()[name = tensor("x1_25_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_25_cast_fp16 = slice_by_index(begin = x1_25_begin_0, end = x1_25_end_0, end_mask = x1_25_end_mask_0, x = var_1130_cast_fp16)[name = tensor("x1_25_cast_fp16")]; + tensor x2_25_begin_0 = const()[name = tensor("x2_25_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_25_end_0 = const()[name = tensor("x2_25_end_0"), val = tensor([1, 16, 768, 128])]; + tensor x2_25_end_mask_0 = const()[name = tensor("x2_25_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_25_cast_fp16 = slice_by_index(begin = x2_25_begin_0, end = x2_25_end_0, end_mask = x2_25_end_mask_0, x = var_1130_cast_fp16)[name = tensor("x2_25_cast_fp16")]; + tensor var_1158_cast_fp16 = mul(x = x1_25_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_1158_cast_fp16")]; + tensor var_1159_cast_fp16 = mul(x = x2_25_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_1159_cast_fp16")]; + tensor var_1160_cast_fp16 = sub(x = var_1158_cast_fp16, y = var_1159_cast_fp16)[name = tensor("op_1160_cast_fp16")]; + tensor var_1161_cast_fp16 = mul(x = x2_25_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_1161_cast_fp16")]; + tensor var_1162_cast_fp16 = mul(x = x1_25_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_1162_cast_fp16")]; + tensor var_1163_cast_fp16 = add(x = var_1161_cast_fp16, y = var_1162_cast_fp16)[name = tensor("op_1163_cast_fp16")]; + tensor q_13_interleave_0 = const()[name = tensor("q_13_interleave_0"), val = tensor(false)]; + tensor q_13_cast_fp16 = concat(axis = var_1076, interleave = q_13_interleave_0, values = (var_1160_cast_fp16, var_1163_cast_fp16))[name = tensor("q_13_cast_fp16")]; + tensor x1_27_begin_0 = const()[name = tensor("x1_27_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_27_end_0 = const()[name = tensor("x1_27_end_0"), val = tensor([1, 8, 768, 64])]; + tensor x1_27_end_mask_0 = const()[name = tensor("x1_27_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_27_cast_fp16 = slice_by_index(begin = x1_27_begin_0, end = x1_27_end_0, end_mask = x1_27_end_mask_0, x = var_1141_cast_fp16)[name = tensor("x1_27_cast_fp16")]; + tensor x2_27_begin_0 = const()[name = tensor("x2_27_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_27_end_0 = const()[name = tensor("x2_27_end_0"), val = tensor([1, 8, 768, 128])]; + tensor x2_27_end_mask_0 = const()[name = tensor("x2_27_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_27_cast_fp16 = slice_by_index(begin = x2_27_begin_0, end = x2_27_end_0, end_mask = x2_27_end_mask_0, x = var_1141_cast_fp16)[name = tensor("x2_27_cast_fp16")]; + tensor var_1181_cast_fp16 = mul(x = x1_27_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_1181_cast_fp16")]; + tensor var_1182_cast_fp16 = mul(x = x2_27_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_1182_cast_fp16")]; + tensor var_1183_cast_fp16 = sub(x = var_1181_cast_fp16, y = var_1182_cast_fp16)[name = tensor("op_1183_cast_fp16")]; + tensor var_1184_cast_fp16 = mul(x = x2_27_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_1184_cast_fp16")]; + tensor var_1185_cast_fp16 = mul(x = x1_27_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_1185_cast_fp16")]; + tensor var_1186_cast_fp16 = add(x = var_1184_cast_fp16, y = var_1185_cast_fp16)[name = tensor("op_1186_cast_fp16")]; + tensor k_25_interleave_0 = const()[name = tensor("k_25_interleave_0"), val = tensor(false)]; + tensor k_25_cast_fp16 = concat(axis = var_1076, interleave = k_25_interleave_0, values = (var_1183_cast_fp16, var_1186_cast_fp16))[name = tensor("k_25_cast_fp16")]; + tensor transpose_24_perm_0 = const()[name = tensor("transpose_24_perm_0"), val = tensor([1, 0, 2, 3])]; + tensor tile_12_reps_0 = const()[name = tensor("tile_12_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_24_cast_fp16 = transpose(perm = transpose_24_perm_0, x = k_25_cast_fp16)[name = tensor("transpose_195")]; + tensor tile_12_cast_fp16 = tile(reps = tile_12_reps_0, x = transpose_24_cast_fp16)[name = tensor("tile_12_cast_fp16")]; + tensor concat_24 = const()[name = tensor("concat_24"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_24_cast_fp16 = reshape(shape = concat_24, x = tile_12_cast_fp16)[name = tensor("reshape_24_cast_fp16")]; + tensor transpose_25_perm_0 = const()[name = tensor("transpose_25_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_25 = const()[name = tensor("concat_25"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_25_cast_fp16 = transpose(perm = transpose_25_perm_0, x = reshape_24_cast_fp16)[name = tensor("transpose_194")]; + tensor reshape_25_cast_fp16 = reshape(shape = concat_25, x = transpose_25_cast_fp16)[name = tensor("reshape_25_cast_fp16")]; + tensor transpose_125_perm_0 = const()[name = tensor("transpose_125_perm_0"), val = tensor([1, 0, -1, -2])]; + tensor tile_13_reps_0 = const()[name = tensor("tile_13_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_124_cast_fp16 = transpose(perm = transpose_124_perm_0, x = var_1119_cast_fp16)[name = tensor("transpose_193")]; + tensor tile_13_cast_fp16 = tile(reps = tile_13_reps_0, x = transpose_124_cast_fp16)[name = tensor("tile_13_cast_fp16")]; + tensor concat_26 = const()[name = tensor("concat_26"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_26_cast_fp16 = reshape(shape = concat_26, x = tile_13_cast_fp16)[name = tensor("reshape_26_cast_fp16")]; + tensor transpose_27_perm_0 = const()[name = tensor("transpose_27_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_27 = const()[name = tensor("concat_27"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_27_cast_fp16 = transpose(perm = transpose_27_perm_0, x = reshape_26_cast_fp16)[name = tensor("transpose_192")]; + tensor reshape_27_cast_fp16 = reshape(shape = concat_27, x = transpose_27_cast_fp16)[name = tensor("reshape_27_cast_fp16")]; + tensor v_27_perm_0 = const()[name = tensor("v_27_perm_0"), val = tensor([1, 0, -2, -1])]; + tensor var_1192_transpose_x_0 = const()[name = tensor("op_1192_transpose_x_0"), val = tensor(false)]; + tensor var_1192_transpose_y_0 = const()[name = tensor("op_1192_transpose_y_0"), val = tensor(false)]; + tensor transpose_125_cast_fp16 = transpose(perm = transpose_125_perm_0, x = reshape_25_cast_fp16)[name = tensor("transpose_191")]; + tensor var_1192_cast_fp16 = matmul(transpose_x = var_1192_transpose_x_0, transpose_y = var_1192_transpose_y_0, x = q_13_cast_fp16, y = transpose_125_cast_fp16)[name = tensor("op_1192_cast_fp16")]; + tensor var_1193_to_fp16 = const()[name = tensor("op_1193_to_fp16"), val = tensor(0x1.6ap-4)]; + tensor attn_25_cast_fp16 = mul(x = var_1192_cast_fp16, y = var_1193_to_fp16)[name = tensor("attn_25_cast_fp16")]; + tensor input_61_cast_fp16 = add(x = attn_25_cast_fp16, y = causal_mask_to_fp16_palettized)[name = tensor("input_61_cast_fp16")]; + tensor attn_27_cast_fp16 = softmax(axis = var_1076, x = input_61_cast_fp16)[name = tensor("attn_27_cast_fp16")]; + tensor var_1197_transpose_x_0 = const()[name = tensor("op_1197_transpose_x_0"), val = tensor(false)]; + tensor var_1197_transpose_y_0 = const()[name = tensor("op_1197_transpose_y_0"), val = tensor(false)]; + tensor v_27_cast_fp16 = transpose(perm = v_27_perm_0, x = reshape_27_cast_fp16)[name = tensor("transpose_190")]; + tensor var_1197_cast_fp16 = matmul(transpose_x = var_1197_transpose_x_0, transpose_y = var_1197_transpose_y_0, x = attn_27_cast_fp16, y = v_27_cast_fp16)[name = tensor("op_1197_cast_fp16")]; + tensor var_1198_perm_0 = const()[name = tensor("op_1198_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor var_1199 = const()[name = tensor("op_1199"), val = tensor([1, 768, 2048])]; + tensor var_1198_cast_fp16 = transpose(perm = var_1198_perm_0, x = var_1197_cast_fp16)[name = tensor("transpose_189")]; + tensor input_63_cast_fp16 = reshape(shape = var_1199, x = var_1198_cast_fp16)[name = tensor("input_63_cast_fp16")]; + tensor layers_6_self_attn_o_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(99329472))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(101426688))), name = tensor("layers_6_self_attn_o_proj_weight_to_fp16_palettized"), shape = tensor([1024, 2048])]; + tensor linear_45_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_6_self_attn_o_proj_weight_to_fp16_palettized, x = input_63_cast_fp16)[name = tensor("linear_45_cast_fp16")]; + tensor x_149_cast_fp16 = add(x = x_131_cast_fp16, y = linear_45_cast_fp16)[name = tensor("x_149_cast_fp16")]; + tensor var_1075_promoted_3_to_fp16 = const()[name = tensor("op_1075_promoted_3_to_fp16"), val = tensor(0x1p+1)]; + tensor var_1206_cast_fp16 = pow(x = x_149_cast_fp16, y = var_1075_promoted_3_to_fp16)[name = tensor("op_1206_cast_fp16")]; + tensor var_1208_axes_0 = const()[name = tensor("op_1208_axes_0"), val = tensor([-1])]; + tensor var_1208_keep_dims_0 = const()[name = tensor("op_1208_keep_dims_0"), val = tensor(true)]; + tensor var_1208_cast_fp16 = reduce_mean(axes = var_1208_axes_0, keep_dims = var_1208_keep_dims_0, x = var_1206_cast_fp16)[name = tensor("op_1208_cast_fp16")]; + tensor var_1209_to_fp16 = const()[name = tensor("op_1209_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_1210_cast_fp16 = add(x = var_1208_cast_fp16, y = var_1209_to_fp16)[name = tensor("op_1210_cast_fp16")]; + tensor norm_55_epsilon_0 = const()[name = tensor("norm_55_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_55_cast_fp16 = rsqrt(epsilon = norm_55_epsilon_0, x = var_1210_cast_fp16)[name = tensor("norm_55_cast_fp16")]; + tensor var_1212_cast_fp16 = mul(x = x_149_cast_fp16, y = norm_55_cast_fp16)[name = tensor("op_1212_cast_fp16")]; + tensor layers_6_post_attention_layernorm_weight_to_fp16 = const()[name = tensor("layers_6_post_attention_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(101427264)))]; + tensor var_1213_cast_fp16 = mul(x = var_1212_cast_fp16, y = layers_6_post_attention_layernorm_weight_to_fp16)[name = tensor("op_1213_cast_fp16")]; + tensor layers_6_mlp_gate_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(101429376))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(104575168))), name = tensor("layers_6_mlp_gate_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_46_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_6_mlp_gate_proj_weight_to_fp16_palettized, x = var_1213_cast_fp16)[name = tensor("linear_46_cast_fp16")]; + tensor var_1223_cast_fp16 = silu(x = linear_46_cast_fp16)[name = tensor("op_1223_cast_fp16")]; + tensor layers_6_mlp_up_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(104575744))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(107721536))), name = tensor("layers_6_mlp_up_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_47_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_6_mlp_up_proj_weight_to_fp16_palettized, x = var_1213_cast_fp16)[name = tensor("linear_47_cast_fp16")]; + tensor input_69_cast_fp16 = mul(x = var_1223_cast_fp16, y = linear_47_cast_fp16)[name = tensor("input_69_cast_fp16")]; + tensor layers_6_mlp_down_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(107722112))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(110867904))), name = tensor("layers_6_mlp_down_proj_weight_to_fp16_palettized"), shape = tensor([1024, 3072])]; + tensor linear_48_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_6_mlp_down_proj_weight_to_fp16_palettized, x = input_69_cast_fp16)[name = tensor("linear_48_cast_fp16")]; + tensor x_153_cast_fp16 = add(x = x_149_cast_fp16, y = linear_48_cast_fp16)[name = tensor("x_153_cast_fp16")]; + tensor var_1243 = const()[name = tensor("op_1243"), val = tensor(-1)]; + tensor var_1242_promoted_to_fp16 = const()[name = tensor("op_1242_promoted_to_fp16"), val = tensor(0x1p+1)]; + tensor var_1252_cast_fp16 = pow(x = x_153_cast_fp16, y = var_1242_promoted_to_fp16)[name = tensor("op_1252_cast_fp16")]; + tensor var_1254_axes_0 = const()[name = tensor("op_1254_axes_0"), val = tensor([-1])]; + tensor var_1254_keep_dims_0 = const()[name = tensor("op_1254_keep_dims_0"), val = tensor(true)]; + tensor var_1254_cast_fp16 = reduce_mean(axes = var_1254_axes_0, keep_dims = var_1254_keep_dims_0, x = var_1252_cast_fp16)[name = tensor("op_1254_cast_fp16")]; + tensor var_1255_to_fp16 = const()[name = tensor("op_1255_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_1256_cast_fp16 = add(x = var_1254_cast_fp16, y = var_1255_to_fp16)[name = tensor("op_1256_cast_fp16")]; + tensor norm_57_epsilon_0 = const()[name = tensor("norm_57_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_57_cast_fp16 = rsqrt(epsilon = norm_57_epsilon_0, x = var_1256_cast_fp16)[name = tensor("norm_57_cast_fp16")]; + tensor var_1258_cast_fp16 = mul(x = x_153_cast_fp16, y = norm_57_cast_fp16)[name = tensor("op_1258_cast_fp16")]; + tensor layers_7_input_layernorm_weight_to_fp16 = const()[name = tensor("layers_7_input_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(110868480)))]; + tensor var_1259_cast_fp16 = mul(x = var_1258_cast_fp16, y = layers_7_input_layernorm_weight_to_fp16)[name = tensor("op_1259_cast_fp16")]; + tensor layers_7_self_attn_q_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(110870592))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(112967808))), name = tensor("layers_7_self_attn_q_proj_weight_to_fp16_palettized"), shape = tensor([2048, 1024])]; + tensor linear_49_cast_fp16 = linear(bias = linear_0_bias_0_to_fp16, weight = layers_7_self_attn_q_proj_weight_to_fp16_palettized, x = var_1259_cast_fp16)[name = tensor("linear_49_cast_fp16")]; + tensor var_1275 = const()[name = tensor("op_1275"), val = tensor([1, 768, 16, 128])]; + tensor var_1276_cast_fp16 = reshape(shape = var_1275, x = linear_49_cast_fp16)[name = tensor("op_1276_cast_fp16")]; + tensor x_159_perm_0 = const()[name = tensor("x_159_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_7_self_attn_k_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(112968384))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(114017024))), name = tensor("layers_7_self_attn_k_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_50_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_7_self_attn_k_proj_weight_to_fp16_palettized, x = var_1259_cast_fp16)[name = tensor("linear_50_cast_fp16")]; + tensor var_1280 = const()[name = tensor("op_1280"), val = tensor([1, 768, 8, 128])]; + tensor var_1281_cast_fp16 = reshape(shape = var_1280, x = linear_50_cast_fp16)[name = tensor("op_1281_cast_fp16")]; + tensor x_163_perm_0 = const()[name = tensor("x_163_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_7_self_attn_v_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(114017600))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(115066240))), name = tensor("layers_7_self_attn_v_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_51_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_7_self_attn_v_proj_weight_to_fp16_palettized, x = var_1259_cast_fp16)[name = tensor("linear_51_cast_fp16")]; + tensor var_1285 = const()[name = tensor("op_1285"), val = tensor([1, 768, 8, 128])]; + tensor var_1286_cast_fp16 = reshape(shape = var_1285, x = linear_51_cast_fp16)[name = tensor("op_1286_cast_fp16")]; + tensor transpose_126_perm_0 = const()[name = tensor("transpose_126_perm_0"), val = tensor([2, 0, 1, 3])]; + tensor var_1242_promoted_1_to_fp16 = const()[name = tensor("op_1242_promoted_1_to_fp16"), val = tensor(0x1p+1)]; + tensor x_159_cast_fp16 = transpose(perm = x_159_perm_0, x = var_1276_cast_fp16)[name = tensor("transpose_188")]; + tensor var_1290_cast_fp16 = pow(x = x_159_cast_fp16, y = var_1242_promoted_1_to_fp16)[name = tensor("op_1290_cast_fp16")]; + tensor var_1292_axes_0 = const()[name = tensor("op_1292_axes_0"), val = tensor([-1])]; + tensor var_1292_keep_dims_0 = const()[name = tensor("op_1292_keep_dims_0"), val = tensor(true)]; + tensor var_1292_cast_fp16 = reduce_mean(axes = var_1292_axes_0, keep_dims = var_1292_keep_dims_0, x = var_1290_cast_fp16)[name = tensor("op_1292_cast_fp16")]; + tensor var_1293_to_fp16 = const()[name = tensor("op_1293_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_1294_cast_fp16 = add(x = var_1292_cast_fp16, y = var_1293_to_fp16)[name = tensor("op_1294_cast_fp16")]; + tensor norm_59_epsilon_0 = const()[name = tensor("norm_59_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_59_cast_fp16 = rsqrt(epsilon = norm_59_epsilon_0, x = var_1294_cast_fp16)[name = tensor("norm_59_cast_fp16")]; + tensor var_1296_cast_fp16 = mul(x = x_159_cast_fp16, y = norm_59_cast_fp16)[name = tensor("op_1296_cast_fp16")]; + tensor layers_7_self_attn_q_norm_weight_to_fp16 = const()[name = tensor("layers_7_self_attn_q_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(115066816)))]; + tensor var_1297_cast_fp16 = mul(x = var_1296_cast_fp16, y = layers_7_self_attn_q_norm_weight_to_fp16)[name = tensor("op_1297_cast_fp16")]; + tensor var_1242_promoted_2_to_fp16 = const()[name = tensor("op_1242_promoted_2_to_fp16"), val = tensor(0x1p+1)]; + tensor x_163_cast_fp16 = transpose(perm = x_163_perm_0, x = var_1281_cast_fp16)[name = tensor("transpose_187")]; + tensor var_1301_cast_fp16 = pow(x = x_163_cast_fp16, y = var_1242_promoted_2_to_fp16)[name = tensor("op_1301_cast_fp16")]; + tensor var_1303_axes_0 = const()[name = tensor("op_1303_axes_0"), val = tensor([-1])]; + tensor var_1303_keep_dims_0 = const()[name = tensor("op_1303_keep_dims_0"), val = tensor(true)]; + tensor var_1303_cast_fp16 = reduce_mean(axes = var_1303_axes_0, keep_dims = var_1303_keep_dims_0, x = var_1301_cast_fp16)[name = tensor("op_1303_cast_fp16")]; + tensor var_1304_to_fp16 = const()[name = tensor("op_1304_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_1305_cast_fp16 = add(x = var_1303_cast_fp16, y = var_1304_to_fp16)[name = tensor("op_1305_cast_fp16")]; + tensor norm_61_epsilon_0 = const()[name = tensor("norm_61_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_61_cast_fp16 = rsqrt(epsilon = norm_61_epsilon_0, x = var_1305_cast_fp16)[name = tensor("norm_61_cast_fp16")]; + tensor var_1307_cast_fp16 = mul(x = x_163_cast_fp16, y = norm_61_cast_fp16)[name = tensor("op_1307_cast_fp16")]; + tensor layers_7_self_attn_k_norm_weight_to_fp16 = const()[name = tensor("layers_7_self_attn_k_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(115067136)))]; + tensor var_1308_cast_fp16 = mul(x = var_1307_cast_fp16, y = layers_7_self_attn_k_norm_weight_to_fp16)[name = tensor("op_1308_cast_fp16")]; + tensor x1_29_begin_0 = const()[name = tensor("x1_29_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_29_end_0 = const()[name = tensor("x1_29_end_0"), val = tensor([1, 16, 768, 64])]; + tensor x1_29_end_mask_0 = const()[name = tensor("x1_29_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_29_cast_fp16 = slice_by_index(begin = x1_29_begin_0, end = x1_29_end_0, end_mask = x1_29_end_mask_0, x = var_1297_cast_fp16)[name = tensor("x1_29_cast_fp16")]; + tensor x2_29_begin_0 = const()[name = tensor("x2_29_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_29_end_0 = const()[name = tensor("x2_29_end_0"), val = tensor([1, 16, 768, 128])]; + tensor x2_29_end_mask_0 = const()[name = tensor("x2_29_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_29_cast_fp16 = slice_by_index(begin = x2_29_begin_0, end = x2_29_end_0, end_mask = x2_29_end_mask_0, x = var_1297_cast_fp16)[name = tensor("x2_29_cast_fp16")]; + tensor var_1325_cast_fp16 = mul(x = x1_29_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_1325_cast_fp16")]; + tensor var_1326_cast_fp16 = mul(x = x2_29_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_1326_cast_fp16")]; + tensor var_1327_cast_fp16 = sub(x = var_1325_cast_fp16, y = var_1326_cast_fp16)[name = tensor("op_1327_cast_fp16")]; + tensor var_1328_cast_fp16 = mul(x = x2_29_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_1328_cast_fp16")]; + tensor var_1329_cast_fp16 = mul(x = x1_29_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_1329_cast_fp16")]; + tensor var_1330_cast_fp16 = add(x = var_1328_cast_fp16, y = var_1329_cast_fp16)[name = tensor("op_1330_cast_fp16")]; + tensor q_15_interleave_0 = const()[name = tensor("q_15_interleave_0"), val = tensor(false)]; + tensor q_15_cast_fp16 = concat(axis = var_1243, interleave = q_15_interleave_0, values = (var_1327_cast_fp16, var_1330_cast_fp16))[name = tensor("q_15_cast_fp16")]; + tensor x1_31_begin_0 = const()[name = tensor("x1_31_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_31_end_0 = const()[name = tensor("x1_31_end_0"), val = tensor([1, 8, 768, 64])]; + tensor x1_31_end_mask_0 = const()[name = tensor("x1_31_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_31_cast_fp16 = slice_by_index(begin = x1_31_begin_0, end = x1_31_end_0, end_mask = x1_31_end_mask_0, x = var_1308_cast_fp16)[name = tensor("x1_31_cast_fp16")]; + tensor x2_31_begin_0 = const()[name = tensor("x2_31_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_31_end_0 = const()[name = tensor("x2_31_end_0"), val = tensor([1, 8, 768, 128])]; + tensor x2_31_end_mask_0 = const()[name = tensor("x2_31_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_31_cast_fp16 = slice_by_index(begin = x2_31_begin_0, end = x2_31_end_0, end_mask = x2_31_end_mask_0, x = var_1308_cast_fp16)[name = tensor("x2_31_cast_fp16")]; + tensor var_1348_cast_fp16 = mul(x = x1_31_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_1348_cast_fp16")]; + tensor var_1349_cast_fp16 = mul(x = x2_31_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_1349_cast_fp16")]; + tensor var_1350_cast_fp16 = sub(x = var_1348_cast_fp16, y = var_1349_cast_fp16)[name = tensor("op_1350_cast_fp16")]; + tensor var_1351_cast_fp16 = mul(x = x2_31_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_1351_cast_fp16")]; + tensor var_1352_cast_fp16 = mul(x = x1_31_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_1352_cast_fp16")]; + tensor var_1353_cast_fp16 = add(x = var_1351_cast_fp16, y = var_1352_cast_fp16)[name = tensor("op_1353_cast_fp16")]; + tensor k_29_interleave_0 = const()[name = tensor("k_29_interleave_0"), val = tensor(false)]; + tensor k_29_cast_fp16 = concat(axis = var_1243, interleave = k_29_interleave_0, values = (var_1350_cast_fp16, var_1353_cast_fp16))[name = tensor("k_29_cast_fp16")]; + tensor transpose_28_perm_0 = const()[name = tensor("transpose_28_perm_0"), val = tensor([1, 0, 2, 3])]; + tensor tile_14_reps_0 = const()[name = tensor("tile_14_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_28_cast_fp16 = transpose(perm = transpose_28_perm_0, x = k_29_cast_fp16)[name = tensor("transpose_186")]; + tensor tile_14_cast_fp16 = tile(reps = tile_14_reps_0, x = transpose_28_cast_fp16)[name = tensor("tile_14_cast_fp16")]; + tensor concat_28 = const()[name = tensor("concat_28"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_28_cast_fp16 = reshape(shape = concat_28, x = tile_14_cast_fp16)[name = tensor("reshape_28_cast_fp16")]; + tensor transpose_29_perm_0 = const()[name = tensor("transpose_29_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_29 = const()[name = tensor("concat_29"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_29_cast_fp16 = transpose(perm = transpose_29_perm_0, x = reshape_28_cast_fp16)[name = tensor("transpose_185")]; + tensor reshape_29_cast_fp16 = reshape(shape = concat_29, x = transpose_29_cast_fp16)[name = tensor("reshape_29_cast_fp16")]; + tensor transpose_127_perm_0 = const()[name = tensor("transpose_127_perm_0"), val = tensor([1, 0, -1, -2])]; + tensor tile_15_reps_0 = const()[name = tensor("tile_15_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_126_cast_fp16 = transpose(perm = transpose_126_perm_0, x = var_1286_cast_fp16)[name = tensor("transpose_184")]; + tensor tile_15_cast_fp16 = tile(reps = tile_15_reps_0, x = transpose_126_cast_fp16)[name = tensor("tile_15_cast_fp16")]; + tensor concat_30 = const()[name = tensor("concat_30"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_30_cast_fp16 = reshape(shape = concat_30, x = tile_15_cast_fp16)[name = tensor("reshape_30_cast_fp16")]; + tensor transpose_31_perm_0 = const()[name = tensor("transpose_31_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_31 = const()[name = tensor("concat_31"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_31_cast_fp16 = transpose(perm = transpose_31_perm_0, x = reshape_30_cast_fp16)[name = tensor("transpose_183")]; + tensor reshape_31_cast_fp16 = reshape(shape = concat_31, x = transpose_31_cast_fp16)[name = tensor("reshape_31_cast_fp16")]; + tensor v_31_perm_0 = const()[name = tensor("v_31_perm_0"), val = tensor([1, 0, -2, -1])]; + tensor var_1359_transpose_x_0 = const()[name = tensor("op_1359_transpose_x_0"), val = tensor(false)]; + tensor var_1359_transpose_y_0 = const()[name = tensor("op_1359_transpose_y_0"), val = tensor(false)]; + tensor transpose_127_cast_fp16 = transpose(perm = transpose_127_perm_0, x = reshape_29_cast_fp16)[name = tensor("transpose_182")]; + tensor var_1359_cast_fp16 = matmul(transpose_x = var_1359_transpose_x_0, transpose_y = var_1359_transpose_y_0, x = q_15_cast_fp16, y = transpose_127_cast_fp16)[name = tensor("op_1359_cast_fp16")]; + tensor var_1360_to_fp16 = const()[name = tensor("op_1360_to_fp16"), val = tensor(0x1.6ap-4)]; + tensor attn_29_cast_fp16 = mul(x = var_1359_cast_fp16, y = var_1360_to_fp16)[name = tensor("attn_29_cast_fp16")]; + tensor input_71_cast_fp16 = add(x = attn_29_cast_fp16, y = causal_mask_to_fp16_palettized)[name = tensor("input_71_cast_fp16")]; + tensor attn_31_cast_fp16 = softmax(axis = var_1243, x = input_71_cast_fp16)[name = tensor("attn_31_cast_fp16")]; + tensor var_1364_transpose_x_0 = const()[name = tensor("op_1364_transpose_x_0"), val = tensor(false)]; + tensor var_1364_transpose_y_0 = const()[name = tensor("op_1364_transpose_y_0"), val = tensor(false)]; + tensor v_31_cast_fp16 = transpose(perm = v_31_perm_0, x = reshape_31_cast_fp16)[name = tensor("transpose_181")]; + tensor var_1364_cast_fp16 = matmul(transpose_x = var_1364_transpose_x_0, transpose_y = var_1364_transpose_y_0, x = attn_31_cast_fp16, y = v_31_cast_fp16)[name = tensor("op_1364_cast_fp16")]; + tensor var_1365_perm_0 = const()[name = tensor("op_1365_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor var_1366 = const()[name = tensor("op_1366"), val = tensor([1, 768, 2048])]; + tensor var_1365_cast_fp16 = transpose(perm = var_1365_perm_0, x = var_1364_cast_fp16)[name = tensor("transpose_180")]; + tensor input_73_cast_fp16 = reshape(shape = var_1366, x = var_1365_cast_fp16)[name = tensor("input_73_cast_fp16")]; + tensor layers_7_self_attn_o_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(115067456))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(117164672))), name = tensor("layers_7_self_attn_o_proj_weight_to_fp16_palettized"), shape = tensor([1024, 2048])]; + tensor linear_52_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_7_self_attn_o_proj_weight_to_fp16_palettized, x = input_73_cast_fp16)[name = tensor("linear_52_cast_fp16")]; + tensor x_171_cast_fp16 = add(x = x_153_cast_fp16, y = linear_52_cast_fp16)[name = tensor("x_171_cast_fp16")]; + tensor var_1242_promoted_3_to_fp16 = const()[name = tensor("op_1242_promoted_3_to_fp16"), val = tensor(0x1p+1)]; + tensor var_1373_cast_fp16 = pow(x = x_171_cast_fp16, y = var_1242_promoted_3_to_fp16)[name = tensor("op_1373_cast_fp16")]; + tensor var_1375_axes_0 = const()[name = tensor("op_1375_axes_0"), val = tensor([-1])]; + tensor var_1375_keep_dims_0 = const()[name = tensor("op_1375_keep_dims_0"), val = tensor(true)]; + tensor var_1375_cast_fp16 = reduce_mean(axes = var_1375_axes_0, keep_dims = var_1375_keep_dims_0, x = var_1373_cast_fp16)[name = tensor("op_1375_cast_fp16")]; + tensor var_1376_to_fp16 = const()[name = tensor("op_1376_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_1377_cast_fp16 = add(x = var_1375_cast_fp16, y = var_1376_to_fp16)[name = tensor("op_1377_cast_fp16")]; + tensor norm_63_epsilon_0 = const()[name = tensor("norm_63_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_63_cast_fp16 = rsqrt(epsilon = norm_63_epsilon_0, x = var_1377_cast_fp16)[name = tensor("norm_63_cast_fp16")]; + tensor var_1379_cast_fp16 = mul(x = x_171_cast_fp16, y = norm_63_cast_fp16)[name = tensor("op_1379_cast_fp16")]; + tensor layers_7_post_attention_layernorm_weight_to_fp16 = const()[name = tensor("layers_7_post_attention_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(117165248)))]; + tensor var_1380_cast_fp16 = mul(x = var_1379_cast_fp16, y = layers_7_post_attention_layernorm_weight_to_fp16)[name = tensor("op_1380_cast_fp16")]; + tensor layers_7_mlp_gate_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(117167360))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(120313152))), name = tensor("layers_7_mlp_gate_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_53_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_7_mlp_gate_proj_weight_to_fp16_palettized, x = var_1380_cast_fp16)[name = tensor("linear_53_cast_fp16")]; + tensor var_1390_cast_fp16 = silu(x = linear_53_cast_fp16)[name = tensor("op_1390_cast_fp16")]; + tensor layers_7_mlp_up_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(120313728))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(123459520))), name = tensor("layers_7_mlp_up_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_54_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_7_mlp_up_proj_weight_to_fp16_palettized, x = var_1380_cast_fp16)[name = tensor("linear_54_cast_fp16")]; + tensor input_79_cast_fp16 = mul(x = var_1390_cast_fp16, y = linear_54_cast_fp16)[name = tensor("input_79_cast_fp16")]; + tensor layers_7_mlp_down_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(123460096))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(126605888))), name = tensor("layers_7_mlp_down_proj_weight_to_fp16_palettized"), shape = tensor([1024, 3072])]; + tensor linear_55_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_7_mlp_down_proj_weight_to_fp16_palettized, x = input_79_cast_fp16)[name = tensor("linear_55_cast_fp16")]; + tensor x_175_cast_fp16 = add(x = x_171_cast_fp16, y = linear_55_cast_fp16)[name = tensor("x_175_cast_fp16")]; + tensor var_1410 = const()[name = tensor("op_1410"), val = tensor(-1)]; + tensor var_1409_promoted_to_fp16 = const()[name = tensor("op_1409_promoted_to_fp16"), val = tensor(0x1p+1)]; + tensor var_1419_cast_fp16 = pow(x = x_175_cast_fp16, y = var_1409_promoted_to_fp16)[name = tensor("op_1419_cast_fp16")]; + tensor var_1421_axes_0 = const()[name = tensor("op_1421_axes_0"), val = tensor([-1])]; + tensor var_1421_keep_dims_0 = const()[name = tensor("op_1421_keep_dims_0"), val = tensor(true)]; + tensor var_1421_cast_fp16 = reduce_mean(axes = var_1421_axes_0, keep_dims = var_1421_keep_dims_0, x = var_1419_cast_fp16)[name = tensor("op_1421_cast_fp16")]; + tensor var_1422_to_fp16 = const()[name = tensor("op_1422_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_1423_cast_fp16 = add(x = var_1421_cast_fp16, y = var_1422_to_fp16)[name = tensor("op_1423_cast_fp16")]; + tensor norm_65_epsilon_0 = const()[name = tensor("norm_65_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_65_cast_fp16 = rsqrt(epsilon = norm_65_epsilon_0, x = var_1423_cast_fp16)[name = tensor("norm_65_cast_fp16")]; + tensor var_1425_cast_fp16 = mul(x = x_175_cast_fp16, y = norm_65_cast_fp16)[name = tensor("op_1425_cast_fp16")]; + tensor layers_8_input_layernorm_weight_to_fp16 = const()[name = tensor("layers_8_input_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(126606464)))]; + tensor var_1426_cast_fp16 = mul(x = var_1425_cast_fp16, y = layers_8_input_layernorm_weight_to_fp16)[name = tensor("op_1426_cast_fp16")]; + tensor layers_8_self_attn_q_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(126608576))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(128705792))), name = tensor("layers_8_self_attn_q_proj_weight_to_fp16_palettized"), shape = tensor([2048, 1024])]; + tensor linear_56_cast_fp16 = linear(bias = linear_0_bias_0_to_fp16, weight = layers_8_self_attn_q_proj_weight_to_fp16_palettized, x = var_1426_cast_fp16)[name = tensor("linear_56_cast_fp16")]; + tensor var_1442 = const()[name = tensor("op_1442"), val = tensor([1, 768, 16, 128])]; + tensor var_1443_cast_fp16 = reshape(shape = var_1442, x = linear_56_cast_fp16)[name = tensor("op_1443_cast_fp16")]; + tensor x_181_perm_0 = const()[name = tensor("x_181_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_8_self_attn_k_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(128706368))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(129755008))), name = tensor("layers_8_self_attn_k_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_57_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_8_self_attn_k_proj_weight_to_fp16_palettized, x = var_1426_cast_fp16)[name = tensor("linear_57_cast_fp16")]; + tensor var_1447 = const()[name = tensor("op_1447"), val = tensor([1, 768, 8, 128])]; + tensor var_1448_cast_fp16 = reshape(shape = var_1447, x = linear_57_cast_fp16)[name = tensor("op_1448_cast_fp16")]; + tensor x_185_perm_0 = const()[name = tensor("x_185_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_8_self_attn_v_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(129755584))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(130804224))), name = tensor("layers_8_self_attn_v_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_58_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_8_self_attn_v_proj_weight_to_fp16_palettized, x = var_1426_cast_fp16)[name = tensor("linear_58_cast_fp16")]; + tensor var_1452 = const()[name = tensor("op_1452"), val = tensor([1, 768, 8, 128])]; + tensor var_1453_cast_fp16 = reshape(shape = var_1452, x = linear_58_cast_fp16)[name = tensor("op_1453_cast_fp16")]; + tensor transpose_128_perm_0 = const()[name = tensor("transpose_128_perm_0"), val = tensor([2, 0, 1, 3])]; + tensor var_1409_promoted_1_to_fp16 = const()[name = tensor("op_1409_promoted_1_to_fp16"), val = tensor(0x1p+1)]; + tensor x_181_cast_fp16 = transpose(perm = x_181_perm_0, x = var_1443_cast_fp16)[name = tensor("transpose_179")]; + tensor var_1457_cast_fp16 = pow(x = x_181_cast_fp16, y = var_1409_promoted_1_to_fp16)[name = tensor("op_1457_cast_fp16")]; + tensor var_1459_axes_0 = const()[name = tensor("op_1459_axes_0"), val = tensor([-1])]; + tensor var_1459_keep_dims_0 = const()[name = tensor("op_1459_keep_dims_0"), val = tensor(true)]; + tensor var_1459_cast_fp16 = reduce_mean(axes = var_1459_axes_0, keep_dims = var_1459_keep_dims_0, x = var_1457_cast_fp16)[name = tensor("op_1459_cast_fp16")]; + tensor var_1460_to_fp16 = const()[name = tensor("op_1460_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_1461_cast_fp16 = add(x = var_1459_cast_fp16, y = var_1460_to_fp16)[name = tensor("op_1461_cast_fp16")]; + tensor norm_67_epsilon_0 = const()[name = tensor("norm_67_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_67_cast_fp16 = rsqrt(epsilon = norm_67_epsilon_0, x = var_1461_cast_fp16)[name = tensor("norm_67_cast_fp16")]; + tensor var_1463_cast_fp16 = mul(x = x_181_cast_fp16, y = norm_67_cast_fp16)[name = tensor("op_1463_cast_fp16")]; + tensor layers_8_self_attn_q_norm_weight_to_fp16 = const()[name = tensor("layers_8_self_attn_q_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(130804800)))]; + tensor var_1464_cast_fp16 = mul(x = var_1463_cast_fp16, y = layers_8_self_attn_q_norm_weight_to_fp16)[name = tensor("op_1464_cast_fp16")]; + tensor var_1409_promoted_2_to_fp16 = const()[name = tensor("op_1409_promoted_2_to_fp16"), val = tensor(0x1p+1)]; + tensor x_185_cast_fp16 = transpose(perm = x_185_perm_0, x = var_1448_cast_fp16)[name = tensor("transpose_178")]; + tensor var_1468_cast_fp16 = pow(x = x_185_cast_fp16, y = var_1409_promoted_2_to_fp16)[name = tensor("op_1468_cast_fp16")]; + tensor var_1470_axes_0 = const()[name = tensor("op_1470_axes_0"), val = tensor([-1])]; + tensor var_1470_keep_dims_0 = const()[name = tensor("op_1470_keep_dims_0"), val = tensor(true)]; + tensor var_1470_cast_fp16 = reduce_mean(axes = var_1470_axes_0, keep_dims = var_1470_keep_dims_0, x = var_1468_cast_fp16)[name = tensor("op_1470_cast_fp16")]; + tensor var_1471_to_fp16 = const()[name = tensor("op_1471_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_1472_cast_fp16 = add(x = var_1470_cast_fp16, y = var_1471_to_fp16)[name = tensor("op_1472_cast_fp16")]; + tensor norm_69_epsilon_0 = const()[name = tensor("norm_69_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_69_cast_fp16 = rsqrt(epsilon = norm_69_epsilon_0, x = var_1472_cast_fp16)[name = tensor("norm_69_cast_fp16")]; + tensor var_1474_cast_fp16 = mul(x = x_185_cast_fp16, y = norm_69_cast_fp16)[name = tensor("op_1474_cast_fp16")]; + tensor layers_8_self_attn_k_norm_weight_to_fp16 = const()[name = tensor("layers_8_self_attn_k_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(130805120)))]; + tensor var_1475_cast_fp16 = mul(x = var_1474_cast_fp16, y = layers_8_self_attn_k_norm_weight_to_fp16)[name = tensor("op_1475_cast_fp16")]; + tensor x1_33_begin_0 = const()[name = tensor("x1_33_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_33_end_0 = const()[name = tensor("x1_33_end_0"), val = tensor([1, 16, 768, 64])]; + tensor x1_33_end_mask_0 = const()[name = tensor("x1_33_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_33_cast_fp16 = slice_by_index(begin = x1_33_begin_0, end = x1_33_end_0, end_mask = x1_33_end_mask_0, x = var_1464_cast_fp16)[name = tensor("x1_33_cast_fp16")]; + tensor x2_33_begin_0 = const()[name = tensor("x2_33_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_33_end_0 = const()[name = tensor("x2_33_end_0"), val = tensor([1, 16, 768, 128])]; + tensor x2_33_end_mask_0 = const()[name = tensor("x2_33_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_33_cast_fp16 = slice_by_index(begin = x2_33_begin_0, end = x2_33_end_0, end_mask = x2_33_end_mask_0, x = var_1464_cast_fp16)[name = tensor("x2_33_cast_fp16")]; + tensor var_1492_cast_fp16 = mul(x = x1_33_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_1492_cast_fp16")]; + tensor var_1493_cast_fp16 = mul(x = x2_33_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_1493_cast_fp16")]; + tensor var_1494_cast_fp16 = sub(x = var_1492_cast_fp16, y = var_1493_cast_fp16)[name = tensor("op_1494_cast_fp16")]; + tensor var_1495_cast_fp16 = mul(x = x2_33_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_1495_cast_fp16")]; + tensor var_1496_cast_fp16 = mul(x = x1_33_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_1496_cast_fp16")]; + tensor var_1497_cast_fp16 = add(x = var_1495_cast_fp16, y = var_1496_cast_fp16)[name = tensor("op_1497_cast_fp16")]; + tensor q_17_interleave_0 = const()[name = tensor("q_17_interleave_0"), val = tensor(false)]; + tensor q_17_cast_fp16 = concat(axis = var_1410, interleave = q_17_interleave_0, values = (var_1494_cast_fp16, var_1497_cast_fp16))[name = tensor("q_17_cast_fp16")]; + tensor x1_35_begin_0 = const()[name = tensor("x1_35_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_35_end_0 = const()[name = tensor("x1_35_end_0"), val = tensor([1, 8, 768, 64])]; + tensor x1_35_end_mask_0 = const()[name = tensor("x1_35_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_35_cast_fp16 = slice_by_index(begin = x1_35_begin_0, end = x1_35_end_0, end_mask = x1_35_end_mask_0, x = var_1475_cast_fp16)[name = tensor("x1_35_cast_fp16")]; + tensor x2_35_begin_0 = const()[name = tensor("x2_35_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_35_end_0 = const()[name = tensor("x2_35_end_0"), val = tensor([1, 8, 768, 128])]; + tensor x2_35_end_mask_0 = const()[name = tensor("x2_35_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_35_cast_fp16 = slice_by_index(begin = x2_35_begin_0, end = x2_35_end_0, end_mask = x2_35_end_mask_0, x = var_1475_cast_fp16)[name = tensor("x2_35_cast_fp16")]; + tensor var_1515_cast_fp16 = mul(x = x1_35_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_1515_cast_fp16")]; + tensor var_1516_cast_fp16 = mul(x = x2_35_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_1516_cast_fp16")]; + tensor var_1517_cast_fp16 = sub(x = var_1515_cast_fp16, y = var_1516_cast_fp16)[name = tensor("op_1517_cast_fp16")]; + tensor var_1518_cast_fp16 = mul(x = x2_35_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_1518_cast_fp16")]; + tensor var_1519_cast_fp16 = mul(x = x1_35_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_1519_cast_fp16")]; + tensor var_1520_cast_fp16 = add(x = var_1518_cast_fp16, y = var_1519_cast_fp16)[name = tensor("op_1520_cast_fp16")]; + tensor k_33_interleave_0 = const()[name = tensor("k_33_interleave_0"), val = tensor(false)]; + tensor k_33_cast_fp16 = concat(axis = var_1410, interleave = k_33_interleave_0, values = (var_1517_cast_fp16, var_1520_cast_fp16))[name = tensor("k_33_cast_fp16")]; + tensor transpose_32_perm_0 = const()[name = tensor("transpose_32_perm_0"), val = tensor([1, 0, 2, 3])]; + tensor tile_16_reps_0 = const()[name = tensor("tile_16_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_32_cast_fp16 = transpose(perm = transpose_32_perm_0, x = k_33_cast_fp16)[name = tensor("transpose_177")]; + tensor tile_16_cast_fp16 = tile(reps = tile_16_reps_0, x = transpose_32_cast_fp16)[name = tensor("tile_16_cast_fp16")]; + tensor concat_32 = const()[name = tensor("concat_32"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_32_cast_fp16 = reshape(shape = concat_32, x = tile_16_cast_fp16)[name = tensor("reshape_32_cast_fp16")]; + tensor transpose_33_perm_0 = const()[name = tensor("transpose_33_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_33 = const()[name = tensor("concat_33"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_33_cast_fp16 = transpose(perm = transpose_33_perm_0, x = reshape_32_cast_fp16)[name = tensor("transpose_176")]; + tensor reshape_33_cast_fp16 = reshape(shape = concat_33, x = transpose_33_cast_fp16)[name = tensor("reshape_33_cast_fp16")]; + tensor transpose_129_perm_0 = const()[name = tensor("transpose_129_perm_0"), val = tensor([1, 0, -1, -2])]; + tensor tile_17_reps_0 = const()[name = tensor("tile_17_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_128_cast_fp16 = transpose(perm = transpose_128_perm_0, x = var_1453_cast_fp16)[name = tensor("transpose_175")]; + tensor tile_17_cast_fp16 = tile(reps = tile_17_reps_0, x = transpose_128_cast_fp16)[name = tensor("tile_17_cast_fp16")]; + tensor concat_34 = const()[name = tensor("concat_34"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_34_cast_fp16 = reshape(shape = concat_34, x = tile_17_cast_fp16)[name = tensor("reshape_34_cast_fp16")]; + tensor transpose_35_perm_0 = const()[name = tensor("transpose_35_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_35 = const()[name = tensor("concat_35"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_35_cast_fp16 = transpose(perm = transpose_35_perm_0, x = reshape_34_cast_fp16)[name = tensor("transpose_174")]; + tensor reshape_35_cast_fp16 = reshape(shape = concat_35, x = transpose_35_cast_fp16)[name = tensor("reshape_35_cast_fp16")]; + tensor v_35_perm_0 = const()[name = tensor("v_35_perm_0"), val = tensor([1, 0, -2, -1])]; + tensor var_1526_transpose_x_0 = const()[name = tensor("op_1526_transpose_x_0"), val = tensor(false)]; + tensor var_1526_transpose_y_0 = const()[name = tensor("op_1526_transpose_y_0"), val = tensor(false)]; + tensor transpose_129_cast_fp16 = transpose(perm = transpose_129_perm_0, x = reshape_33_cast_fp16)[name = tensor("transpose_173")]; + tensor var_1526_cast_fp16 = matmul(transpose_x = var_1526_transpose_x_0, transpose_y = var_1526_transpose_y_0, x = q_17_cast_fp16, y = transpose_129_cast_fp16)[name = tensor("op_1526_cast_fp16")]; + tensor var_1527_to_fp16 = const()[name = tensor("op_1527_to_fp16"), val = tensor(0x1.6ap-4)]; + tensor attn_33_cast_fp16 = mul(x = var_1526_cast_fp16, y = var_1527_to_fp16)[name = tensor("attn_33_cast_fp16")]; + tensor input_81_cast_fp16 = add(x = attn_33_cast_fp16, y = causal_mask_to_fp16_palettized)[name = tensor("input_81_cast_fp16")]; + tensor attn_35_cast_fp16 = softmax(axis = var_1410, x = input_81_cast_fp16)[name = tensor("attn_35_cast_fp16")]; + tensor var_1531_transpose_x_0 = const()[name = tensor("op_1531_transpose_x_0"), val = tensor(false)]; + tensor var_1531_transpose_y_0 = const()[name = tensor("op_1531_transpose_y_0"), val = tensor(false)]; + tensor v_35_cast_fp16 = transpose(perm = v_35_perm_0, x = reshape_35_cast_fp16)[name = tensor("transpose_172")]; + tensor var_1531_cast_fp16 = matmul(transpose_x = var_1531_transpose_x_0, transpose_y = var_1531_transpose_y_0, x = attn_35_cast_fp16, y = v_35_cast_fp16)[name = tensor("op_1531_cast_fp16")]; + tensor var_1532_perm_0 = const()[name = tensor("op_1532_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor var_1533 = const()[name = tensor("op_1533"), val = tensor([1, 768, 2048])]; + tensor var_1532_cast_fp16 = transpose(perm = var_1532_perm_0, x = var_1531_cast_fp16)[name = tensor("transpose_171")]; + tensor input_83_cast_fp16 = reshape(shape = var_1533, x = var_1532_cast_fp16)[name = tensor("input_83_cast_fp16")]; + tensor layers_8_self_attn_o_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(130805440))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(132902656))), name = tensor("layers_8_self_attn_o_proj_weight_to_fp16_palettized"), shape = tensor([1024, 2048])]; + tensor linear_59_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_8_self_attn_o_proj_weight_to_fp16_palettized, x = input_83_cast_fp16)[name = tensor("linear_59_cast_fp16")]; + tensor x_193_cast_fp16 = add(x = x_175_cast_fp16, y = linear_59_cast_fp16)[name = tensor("x_193_cast_fp16")]; + tensor var_1409_promoted_3_to_fp16 = const()[name = tensor("op_1409_promoted_3_to_fp16"), val = tensor(0x1p+1)]; + tensor var_1540_cast_fp16 = pow(x = x_193_cast_fp16, y = var_1409_promoted_3_to_fp16)[name = tensor("op_1540_cast_fp16")]; + tensor var_1542_axes_0 = const()[name = tensor("op_1542_axes_0"), val = tensor([-1])]; + tensor var_1542_keep_dims_0 = const()[name = tensor("op_1542_keep_dims_0"), val = tensor(true)]; + tensor var_1542_cast_fp16 = reduce_mean(axes = var_1542_axes_0, keep_dims = var_1542_keep_dims_0, x = var_1540_cast_fp16)[name = tensor("op_1542_cast_fp16")]; + tensor var_1543_to_fp16 = const()[name = tensor("op_1543_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_1544_cast_fp16 = add(x = var_1542_cast_fp16, y = var_1543_to_fp16)[name = tensor("op_1544_cast_fp16")]; + tensor norm_71_epsilon_0 = const()[name = tensor("norm_71_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_71_cast_fp16 = rsqrt(epsilon = norm_71_epsilon_0, x = var_1544_cast_fp16)[name = tensor("norm_71_cast_fp16")]; + tensor var_1546_cast_fp16 = mul(x = x_193_cast_fp16, y = norm_71_cast_fp16)[name = tensor("op_1546_cast_fp16")]; + tensor layers_8_post_attention_layernorm_weight_to_fp16 = const()[name = tensor("layers_8_post_attention_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(132903232)))]; + tensor var_1547_cast_fp16 = mul(x = var_1546_cast_fp16, y = layers_8_post_attention_layernorm_weight_to_fp16)[name = tensor("op_1547_cast_fp16")]; + tensor layers_8_mlp_gate_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(132905344))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(136051136))), name = tensor("layers_8_mlp_gate_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_60_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_8_mlp_gate_proj_weight_to_fp16_palettized, x = var_1547_cast_fp16)[name = tensor("linear_60_cast_fp16")]; + tensor var_1557_cast_fp16 = silu(x = linear_60_cast_fp16)[name = tensor("op_1557_cast_fp16")]; + tensor layers_8_mlp_up_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(136051712))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(139197504))), name = tensor("layers_8_mlp_up_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_61_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_8_mlp_up_proj_weight_to_fp16_palettized, x = var_1547_cast_fp16)[name = tensor("linear_61_cast_fp16")]; + tensor input_89_cast_fp16 = mul(x = var_1557_cast_fp16, y = linear_61_cast_fp16)[name = tensor("input_89_cast_fp16")]; + tensor layers_8_mlp_down_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(139198080))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(142343872))), name = tensor("layers_8_mlp_down_proj_weight_to_fp16_palettized"), shape = tensor([1024, 3072])]; + tensor linear_62_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_8_mlp_down_proj_weight_to_fp16_palettized, x = input_89_cast_fp16)[name = tensor("linear_62_cast_fp16")]; + tensor x_197_cast_fp16 = add(x = x_193_cast_fp16, y = linear_62_cast_fp16)[name = tensor("x_197_cast_fp16")]; + tensor var_1577 = const()[name = tensor("op_1577"), val = tensor(-1)]; + tensor var_1576_promoted_to_fp16 = const()[name = tensor("op_1576_promoted_to_fp16"), val = tensor(0x1p+1)]; + tensor var_1586_cast_fp16 = pow(x = x_197_cast_fp16, y = var_1576_promoted_to_fp16)[name = tensor("op_1586_cast_fp16")]; + tensor var_1588_axes_0 = const()[name = tensor("op_1588_axes_0"), val = tensor([-1])]; + tensor var_1588_keep_dims_0 = const()[name = tensor("op_1588_keep_dims_0"), val = tensor(true)]; + tensor var_1588_cast_fp16 = reduce_mean(axes = var_1588_axes_0, keep_dims = var_1588_keep_dims_0, x = var_1586_cast_fp16)[name = tensor("op_1588_cast_fp16")]; + tensor var_1589_to_fp16 = const()[name = tensor("op_1589_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_1590_cast_fp16 = add(x = var_1588_cast_fp16, y = var_1589_to_fp16)[name = tensor("op_1590_cast_fp16")]; + tensor norm_73_epsilon_0 = const()[name = tensor("norm_73_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_73_cast_fp16 = rsqrt(epsilon = norm_73_epsilon_0, x = var_1590_cast_fp16)[name = tensor("norm_73_cast_fp16")]; + tensor var_1592_cast_fp16 = mul(x = x_197_cast_fp16, y = norm_73_cast_fp16)[name = tensor("op_1592_cast_fp16")]; + tensor layers_9_input_layernorm_weight_to_fp16 = const()[name = tensor("layers_9_input_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(142344448)))]; + tensor var_1593_cast_fp16 = mul(x = var_1592_cast_fp16, y = layers_9_input_layernorm_weight_to_fp16)[name = tensor("op_1593_cast_fp16")]; + tensor layers_9_self_attn_q_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(142346560))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(144443776))), name = tensor("layers_9_self_attn_q_proj_weight_to_fp16_palettized"), shape = tensor([2048, 1024])]; + tensor linear_63_cast_fp16 = linear(bias = linear_0_bias_0_to_fp16, weight = layers_9_self_attn_q_proj_weight_to_fp16_palettized, x = var_1593_cast_fp16)[name = tensor("linear_63_cast_fp16")]; + tensor var_1609 = const()[name = tensor("op_1609"), val = tensor([1, 768, 16, 128])]; + tensor var_1610_cast_fp16 = reshape(shape = var_1609, x = linear_63_cast_fp16)[name = tensor("op_1610_cast_fp16")]; + tensor x_203_perm_0 = const()[name = tensor("x_203_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_9_self_attn_k_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(144444352))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(145492992))), name = tensor("layers_9_self_attn_k_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_64_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_9_self_attn_k_proj_weight_to_fp16_palettized, x = var_1593_cast_fp16)[name = tensor("linear_64_cast_fp16")]; + tensor var_1614 = const()[name = tensor("op_1614"), val = tensor([1, 768, 8, 128])]; + tensor var_1615_cast_fp16 = reshape(shape = var_1614, x = linear_64_cast_fp16)[name = tensor("op_1615_cast_fp16")]; + tensor x_207_perm_0 = const()[name = tensor("x_207_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_9_self_attn_v_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(145493568))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(146542208))), name = tensor("layers_9_self_attn_v_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_65_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_9_self_attn_v_proj_weight_to_fp16_palettized, x = var_1593_cast_fp16)[name = tensor("linear_65_cast_fp16")]; + tensor var_1619 = const()[name = tensor("op_1619"), val = tensor([1, 768, 8, 128])]; + tensor var_1620_cast_fp16 = reshape(shape = var_1619, x = linear_65_cast_fp16)[name = tensor("op_1620_cast_fp16")]; + tensor transpose_130_perm_0 = const()[name = tensor("transpose_130_perm_0"), val = tensor([2, 0, 1, 3])]; + tensor var_1576_promoted_1_to_fp16 = const()[name = tensor("op_1576_promoted_1_to_fp16"), val = tensor(0x1p+1)]; + tensor x_203_cast_fp16 = transpose(perm = x_203_perm_0, x = var_1610_cast_fp16)[name = tensor("transpose_170")]; + tensor var_1624_cast_fp16 = pow(x = x_203_cast_fp16, y = var_1576_promoted_1_to_fp16)[name = tensor("op_1624_cast_fp16")]; + tensor var_1626_axes_0 = const()[name = tensor("op_1626_axes_0"), val = tensor([-1])]; + tensor var_1626_keep_dims_0 = const()[name = tensor("op_1626_keep_dims_0"), val = tensor(true)]; + tensor var_1626_cast_fp16 = reduce_mean(axes = var_1626_axes_0, keep_dims = var_1626_keep_dims_0, x = var_1624_cast_fp16)[name = tensor("op_1626_cast_fp16")]; + tensor var_1627_to_fp16 = const()[name = tensor("op_1627_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_1628_cast_fp16 = add(x = var_1626_cast_fp16, y = var_1627_to_fp16)[name = tensor("op_1628_cast_fp16")]; + tensor norm_75_epsilon_0 = const()[name = tensor("norm_75_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_75_cast_fp16 = rsqrt(epsilon = norm_75_epsilon_0, x = var_1628_cast_fp16)[name = tensor("norm_75_cast_fp16")]; + tensor var_1630_cast_fp16 = mul(x = x_203_cast_fp16, y = norm_75_cast_fp16)[name = tensor("op_1630_cast_fp16")]; + tensor layers_9_self_attn_q_norm_weight_to_fp16 = const()[name = tensor("layers_9_self_attn_q_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(146542784)))]; + tensor var_1631_cast_fp16 = mul(x = var_1630_cast_fp16, y = layers_9_self_attn_q_norm_weight_to_fp16)[name = tensor("op_1631_cast_fp16")]; + tensor var_1576_promoted_2_to_fp16 = const()[name = tensor("op_1576_promoted_2_to_fp16"), val = tensor(0x1p+1)]; + tensor x_207_cast_fp16 = transpose(perm = x_207_perm_0, x = var_1615_cast_fp16)[name = tensor("transpose_169")]; + tensor var_1635_cast_fp16 = pow(x = x_207_cast_fp16, y = var_1576_promoted_2_to_fp16)[name = tensor("op_1635_cast_fp16")]; + tensor var_1637_axes_0 = const()[name = tensor("op_1637_axes_0"), val = tensor([-1])]; + tensor var_1637_keep_dims_0 = const()[name = tensor("op_1637_keep_dims_0"), val = tensor(true)]; + tensor var_1637_cast_fp16 = reduce_mean(axes = var_1637_axes_0, keep_dims = var_1637_keep_dims_0, x = var_1635_cast_fp16)[name = tensor("op_1637_cast_fp16")]; + tensor var_1638_to_fp16 = const()[name = tensor("op_1638_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_1639_cast_fp16 = add(x = var_1637_cast_fp16, y = var_1638_to_fp16)[name = tensor("op_1639_cast_fp16")]; + tensor norm_77_epsilon_0 = const()[name = tensor("norm_77_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_77_cast_fp16 = rsqrt(epsilon = norm_77_epsilon_0, x = var_1639_cast_fp16)[name = tensor("norm_77_cast_fp16")]; + tensor var_1641_cast_fp16 = mul(x = x_207_cast_fp16, y = norm_77_cast_fp16)[name = tensor("op_1641_cast_fp16")]; + tensor layers_9_self_attn_k_norm_weight_to_fp16 = const()[name = tensor("layers_9_self_attn_k_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(146543104)))]; + tensor var_1642_cast_fp16 = mul(x = var_1641_cast_fp16, y = layers_9_self_attn_k_norm_weight_to_fp16)[name = tensor("op_1642_cast_fp16")]; + tensor x1_37_begin_0 = const()[name = tensor("x1_37_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_37_end_0 = const()[name = tensor("x1_37_end_0"), val = tensor([1, 16, 768, 64])]; + tensor x1_37_end_mask_0 = const()[name = tensor("x1_37_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_37_cast_fp16 = slice_by_index(begin = x1_37_begin_0, end = x1_37_end_0, end_mask = x1_37_end_mask_0, x = var_1631_cast_fp16)[name = tensor("x1_37_cast_fp16")]; + tensor x2_37_begin_0 = const()[name = tensor("x2_37_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_37_end_0 = const()[name = tensor("x2_37_end_0"), val = tensor([1, 16, 768, 128])]; + tensor x2_37_end_mask_0 = const()[name = tensor("x2_37_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_37_cast_fp16 = slice_by_index(begin = x2_37_begin_0, end = x2_37_end_0, end_mask = x2_37_end_mask_0, x = var_1631_cast_fp16)[name = tensor("x2_37_cast_fp16")]; + tensor var_1659_cast_fp16 = mul(x = x1_37_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_1659_cast_fp16")]; + tensor var_1660_cast_fp16 = mul(x = x2_37_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_1660_cast_fp16")]; + tensor var_1661_cast_fp16 = sub(x = var_1659_cast_fp16, y = var_1660_cast_fp16)[name = tensor("op_1661_cast_fp16")]; + tensor var_1662_cast_fp16 = mul(x = x2_37_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_1662_cast_fp16")]; + tensor var_1663_cast_fp16 = mul(x = x1_37_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_1663_cast_fp16")]; + tensor var_1664_cast_fp16 = add(x = var_1662_cast_fp16, y = var_1663_cast_fp16)[name = tensor("op_1664_cast_fp16")]; + tensor q_19_interleave_0 = const()[name = tensor("q_19_interleave_0"), val = tensor(false)]; + tensor q_19_cast_fp16 = concat(axis = var_1577, interleave = q_19_interleave_0, values = (var_1661_cast_fp16, var_1664_cast_fp16))[name = tensor("q_19_cast_fp16")]; + tensor x1_39_begin_0 = const()[name = tensor("x1_39_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_39_end_0 = const()[name = tensor("x1_39_end_0"), val = tensor([1, 8, 768, 64])]; + tensor x1_39_end_mask_0 = const()[name = tensor("x1_39_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_39_cast_fp16 = slice_by_index(begin = x1_39_begin_0, end = x1_39_end_0, end_mask = x1_39_end_mask_0, x = var_1642_cast_fp16)[name = tensor("x1_39_cast_fp16")]; + tensor x2_39_begin_0 = const()[name = tensor("x2_39_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_39_end_0 = const()[name = tensor("x2_39_end_0"), val = tensor([1, 8, 768, 128])]; + tensor x2_39_end_mask_0 = const()[name = tensor("x2_39_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_39_cast_fp16 = slice_by_index(begin = x2_39_begin_0, end = x2_39_end_0, end_mask = x2_39_end_mask_0, x = var_1642_cast_fp16)[name = tensor("x2_39_cast_fp16")]; + tensor var_1682_cast_fp16 = mul(x = x1_39_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_1682_cast_fp16")]; + tensor var_1683_cast_fp16 = mul(x = x2_39_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_1683_cast_fp16")]; + tensor var_1684_cast_fp16 = sub(x = var_1682_cast_fp16, y = var_1683_cast_fp16)[name = tensor("op_1684_cast_fp16")]; + tensor var_1685_cast_fp16 = mul(x = x2_39_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_1685_cast_fp16")]; + tensor var_1686_cast_fp16 = mul(x = x1_39_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_1686_cast_fp16")]; + tensor var_1687_cast_fp16 = add(x = var_1685_cast_fp16, y = var_1686_cast_fp16)[name = tensor("op_1687_cast_fp16")]; + tensor k_37_interleave_0 = const()[name = tensor("k_37_interleave_0"), val = tensor(false)]; + tensor k_37_cast_fp16 = concat(axis = var_1577, interleave = k_37_interleave_0, values = (var_1684_cast_fp16, var_1687_cast_fp16))[name = tensor("k_37_cast_fp16")]; + tensor transpose_36_perm_0 = const()[name = tensor("transpose_36_perm_0"), val = tensor([1, 0, 2, 3])]; + tensor tile_18_reps_0 = const()[name = tensor("tile_18_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_36_cast_fp16 = transpose(perm = transpose_36_perm_0, x = k_37_cast_fp16)[name = tensor("transpose_168")]; + tensor tile_18_cast_fp16 = tile(reps = tile_18_reps_0, x = transpose_36_cast_fp16)[name = tensor("tile_18_cast_fp16")]; + tensor concat_36 = const()[name = tensor("concat_36"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_36_cast_fp16 = reshape(shape = concat_36, x = tile_18_cast_fp16)[name = tensor("reshape_36_cast_fp16")]; + tensor transpose_37_perm_0 = const()[name = tensor("transpose_37_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_37 = const()[name = tensor("concat_37"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_37_cast_fp16 = transpose(perm = transpose_37_perm_0, x = reshape_36_cast_fp16)[name = tensor("transpose_167")]; + tensor reshape_37_cast_fp16 = reshape(shape = concat_37, x = transpose_37_cast_fp16)[name = tensor("reshape_37_cast_fp16")]; + tensor transpose_131_perm_0 = const()[name = tensor("transpose_131_perm_0"), val = tensor([1, 0, -1, -2])]; + tensor tile_19_reps_0 = const()[name = tensor("tile_19_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_130_cast_fp16 = transpose(perm = transpose_130_perm_0, x = var_1620_cast_fp16)[name = tensor("transpose_166")]; + tensor tile_19_cast_fp16 = tile(reps = tile_19_reps_0, x = transpose_130_cast_fp16)[name = tensor("tile_19_cast_fp16")]; + tensor concat_38 = const()[name = tensor("concat_38"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_38_cast_fp16 = reshape(shape = concat_38, x = tile_19_cast_fp16)[name = tensor("reshape_38_cast_fp16")]; + tensor transpose_39_perm_0 = const()[name = tensor("transpose_39_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_39 = const()[name = tensor("concat_39"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_39_cast_fp16 = transpose(perm = transpose_39_perm_0, x = reshape_38_cast_fp16)[name = tensor("transpose_165")]; + tensor reshape_39_cast_fp16 = reshape(shape = concat_39, x = transpose_39_cast_fp16)[name = tensor("reshape_39_cast_fp16")]; + tensor v_39_perm_0 = const()[name = tensor("v_39_perm_0"), val = tensor([1, 0, -2, -1])]; + tensor var_1693_transpose_x_0 = const()[name = tensor("op_1693_transpose_x_0"), val = tensor(false)]; + tensor var_1693_transpose_y_0 = const()[name = tensor("op_1693_transpose_y_0"), val = tensor(false)]; + tensor transpose_131_cast_fp16 = transpose(perm = transpose_131_perm_0, x = reshape_37_cast_fp16)[name = tensor("transpose_164")]; + tensor var_1693_cast_fp16 = matmul(transpose_x = var_1693_transpose_x_0, transpose_y = var_1693_transpose_y_0, x = q_19_cast_fp16, y = transpose_131_cast_fp16)[name = tensor("op_1693_cast_fp16")]; + tensor var_1694_to_fp16 = const()[name = tensor("op_1694_to_fp16"), val = tensor(0x1.6ap-4)]; + tensor attn_37_cast_fp16 = mul(x = var_1693_cast_fp16, y = var_1694_to_fp16)[name = tensor("attn_37_cast_fp16")]; + tensor input_91_cast_fp16 = add(x = attn_37_cast_fp16, y = causal_mask_to_fp16_palettized)[name = tensor("input_91_cast_fp16")]; + tensor attn_39_cast_fp16 = softmax(axis = var_1577, x = input_91_cast_fp16)[name = tensor("attn_39_cast_fp16")]; + tensor var_1698_transpose_x_0 = const()[name = tensor("op_1698_transpose_x_0"), val = tensor(false)]; + tensor var_1698_transpose_y_0 = const()[name = tensor("op_1698_transpose_y_0"), val = tensor(false)]; + tensor v_39_cast_fp16 = transpose(perm = v_39_perm_0, x = reshape_39_cast_fp16)[name = tensor("transpose_163")]; + tensor var_1698_cast_fp16 = matmul(transpose_x = var_1698_transpose_x_0, transpose_y = var_1698_transpose_y_0, x = attn_39_cast_fp16, y = v_39_cast_fp16)[name = tensor("op_1698_cast_fp16")]; + tensor var_1699_perm_0 = const()[name = tensor("op_1699_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor var_1700 = const()[name = tensor("op_1700"), val = tensor([1, 768, 2048])]; + tensor var_1699_cast_fp16 = transpose(perm = var_1699_perm_0, x = var_1698_cast_fp16)[name = tensor("transpose_162")]; + tensor input_93_cast_fp16 = reshape(shape = var_1700, x = var_1699_cast_fp16)[name = tensor("input_93_cast_fp16")]; + tensor layers_9_self_attn_o_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(146543424))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(148640640))), name = tensor("layers_9_self_attn_o_proj_weight_to_fp16_palettized"), shape = tensor([1024, 2048])]; + tensor linear_66_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_9_self_attn_o_proj_weight_to_fp16_palettized, x = input_93_cast_fp16)[name = tensor("linear_66_cast_fp16")]; + tensor x_215_cast_fp16 = add(x = x_197_cast_fp16, y = linear_66_cast_fp16)[name = tensor("x_215_cast_fp16")]; + tensor var_1576_promoted_3_to_fp16 = const()[name = tensor("op_1576_promoted_3_to_fp16"), val = tensor(0x1p+1)]; + tensor var_1707_cast_fp16 = pow(x = x_215_cast_fp16, y = var_1576_promoted_3_to_fp16)[name = tensor("op_1707_cast_fp16")]; + tensor var_1709_axes_0 = const()[name = tensor("op_1709_axes_0"), val = tensor([-1])]; + tensor var_1709_keep_dims_0 = const()[name = tensor("op_1709_keep_dims_0"), val = tensor(true)]; + tensor var_1709_cast_fp16 = reduce_mean(axes = var_1709_axes_0, keep_dims = var_1709_keep_dims_0, x = var_1707_cast_fp16)[name = tensor("op_1709_cast_fp16")]; + tensor var_1710_to_fp16 = const()[name = tensor("op_1710_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_1711_cast_fp16 = add(x = var_1709_cast_fp16, y = var_1710_to_fp16)[name = tensor("op_1711_cast_fp16")]; + tensor norm_79_epsilon_0 = const()[name = tensor("norm_79_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_79_cast_fp16 = rsqrt(epsilon = norm_79_epsilon_0, x = var_1711_cast_fp16)[name = tensor("norm_79_cast_fp16")]; + tensor var_1713_cast_fp16 = mul(x = x_215_cast_fp16, y = norm_79_cast_fp16)[name = tensor("op_1713_cast_fp16")]; + tensor layers_9_post_attention_layernorm_weight_to_fp16 = const()[name = tensor("layers_9_post_attention_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(148641216)))]; + tensor var_1714_cast_fp16 = mul(x = var_1713_cast_fp16, y = layers_9_post_attention_layernorm_weight_to_fp16)[name = tensor("op_1714_cast_fp16")]; + tensor layers_9_mlp_gate_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(148643328))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(151789120))), name = tensor("layers_9_mlp_gate_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_67_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_9_mlp_gate_proj_weight_to_fp16_palettized, x = var_1714_cast_fp16)[name = tensor("linear_67_cast_fp16")]; + tensor var_1724_cast_fp16 = silu(x = linear_67_cast_fp16)[name = tensor("op_1724_cast_fp16")]; + tensor layers_9_mlp_up_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(151789696))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(154935488))), name = tensor("layers_9_mlp_up_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_68_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_9_mlp_up_proj_weight_to_fp16_palettized, x = var_1714_cast_fp16)[name = tensor("linear_68_cast_fp16")]; + tensor input_99_cast_fp16 = mul(x = var_1724_cast_fp16, y = linear_68_cast_fp16)[name = tensor("input_99_cast_fp16")]; + tensor layers_9_mlp_down_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(154936064))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(158081856))), name = tensor("layers_9_mlp_down_proj_weight_to_fp16_palettized"), shape = tensor([1024, 3072])]; + tensor linear_69_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_9_mlp_down_proj_weight_to_fp16_palettized, x = input_99_cast_fp16)[name = tensor("linear_69_cast_fp16")]; + tensor x_219_cast_fp16 = add(x = x_215_cast_fp16, y = linear_69_cast_fp16)[name = tensor("x_219_cast_fp16")]; + tensor var_1744 = const()[name = tensor("op_1744"), val = tensor(-1)]; + tensor var_1743_promoted_to_fp16 = const()[name = tensor("op_1743_promoted_to_fp16"), val = tensor(0x1p+1)]; + tensor var_1753_cast_fp16 = pow(x = x_219_cast_fp16, y = var_1743_promoted_to_fp16)[name = tensor("op_1753_cast_fp16")]; + tensor var_1755_axes_0 = const()[name = tensor("op_1755_axes_0"), val = tensor([-1])]; + tensor var_1755_keep_dims_0 = const()[name = tensor("op_1755_keep_dims_0"), val = tensor(true)]; + tensor var_1755_cast_fp16 = reduce_mean(axes = var_1755_axes_0, keep_dims = var_1755_keep_dims_0, x = var_1753_cast_fp16)[name = tensor("op_1755_cast_fp16")]; + tensor var_1756_to_fp16 = const()[name = tensor("op_1756_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_1757_cast_fp16 = add(x = var_1755_cast_fp16, y = var_1756_to_fp16)[name = tensor("op_1757_cast_fp16")]; + tensor norm_81_epsilon_0 = const()[name = tensor("norm_81_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_81_cast_fp16 = rsqrt(epsilon = norm_81_epsilon_0, x = var_1757_cast_fp16)[name = tensor("norm_81_cast_fp16")]; + tensor var_1759_cast_fp16 = mul(x = x_219_cast_fp16, y = norm_81_cast_fp16)[name = tensor("op_1759_cast_fp16")]; + tensor layers_10_input_layernorm_weight_to_fp16 = const()[name = tensor("layers_10_input_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(158082432)))]; + tensor var_1760_cast_fp16 = mul(x = var_1759_cast_fp16, y = layers_10_input_layernorm_weight_to_fp16)[name = tensor("op_1760_cast_fp16")]; + tensor layers_10_self_attn_q_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(158084544))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(160181760))), name = tensor("layers_10_self_attn_q_proj_weight_to_fp16_palettized"), shape = tensor([2048, 1024])]; + tensor linear_70_cast_fp16 = linear(bias = linear_0_bias_0_to_fp16, weight = layers_10_self_attn_q_proj_weight_to_fp16_palettized, x = var_1760_cast_fp16)[name = tensor("linear_70_cast_fp16")]; + tensor var_1776 = const()[name = tensor("op_1776"), val = tensor([1, 768, 16, 128])]; + tensor var_1777_cast_fp16 = reshape(shape = var_1776, x = linear_70_cast_fp16)[name = tensor("op_1777_cast_fp16")]; + tensor x_225_perm_0 = const()[name = tensor("x_225_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_10_self_attn_k_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(160182336))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(161230976))), name = tensor("layers_10_self_attn_k_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_71_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_10_self_attn_k_proj_weight_to_fp16_palettized, x = var_1760_cast_fp16)[name = tensor("linear_71_cast_fp16")]; + tensor var_1781 = const()[name = tensor("op_1781"), val = tensor([1, 768, 8, 128])]; + tensor var_1782_cast_fp16 = reshape(shape = var_1781, x = linear_71_cast_fp16)[name = tensor("op_1782_cast_fp16")]; + tensor x_229_perm_0 = const()[name = tensor("x_229_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_10_self_attn_v_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(161231552))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(162280192))), name = tensor("layers_10_self_attn_v_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_72_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_10_self_attn_v_proj_weight_to_fp16_palettized, x = var_1760_cast_fp16)[name = tensor("linear_72_cast_fp16")]; + tensor var_1786 = const()[name = tensor("op_1786"), val = tensor([1, 768, 8, 128])]; + tensor var_1787_cast_fp16 = reshape(shape = var_1786, x = linear_72_cast_fp16)[name = tensor("op_1787_cast_fp16")]; + tensor transpose_132_perm_0 = const()[name = tensor("transpose_132_perm_0"), val = tensor([2, 0, 1, 3])]; + tensor var_1743_promoted_1_to_fp16 = const()[name = tensor("op_1743_promoted_1_to_fp16"), val = tensor(0x1p+1)]; + tensor x_225_cast_fp16 = transpose(perm = x_225_perm_0, x = var_1777_cast_fp16)[name = tensor("transpose_161")]; + tensor var_1791_cast_fp16 = pow(x = x_225_cast_fp16, y = var_1743_promoted_1_to_fp16)[name = tensor("op_1791_cast_fp16")]; + tensor var_1793_axes_0 = const()[name = tensor("op_1793_axes_0"), val = tensor([-1])]; + tensor var_1793_keep_dims_0 = const()[name = tensor("op_1793_keep_dims_0"), val = tensor(true)]; + tensor var_1793_cast_fp16 = reduce_mean(axes = var_1793_axes_0, keep_dims = var_1793_keep_dims_0, x = var_1791_cast_fp16)[name = tensor("op_1793_cast_fp16")]; + tensor var_1794_to_fp16 = const()[name = tensor("op_1794_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_1795_cast_fp16 = add(x = var_1793_cast_fp16, y = var_1794_to_fp16)[name = tensor("op_1795_cast_fp16")]; + tensor norm_83_epsilon_0 = const()[name = tensor("norm_83_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_83_cast_fp16 = rsqrt(epsilon = norm_83_epsilon_0, x = var_1795_cast_fp16)[name = tensor("norm_83_cast_fp16")]; + tensor var_1797_cast_fp16 = mul(x = x_225_cast_fp16, y = norm_83_cast_fp16)[name = tensor("op_1797_cast_fp16")]; + tensor layers_10_self_attn_q_norm_weight_to_fp16 = const()[name = tensor("layers_10_self_attn_q_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(162280768)))]; + tensor var_1798_cast_fp16 = mul(x = var_1797_cast_fp16, y = layers_10_self_attn_q_norm_weight_to_fp16)[name = tensor("op_1798_cast_fp16")]; + tensor var_1743_promoted_2_to_fp16 = const()[name = tensor("op_1743_promoted_2_to_fp16"), val = tensor(0x1p+1)]; + tensor x_229_cast_fp16 = transpose(perm = x_229_perm_0, x = var_1782_cast_fp16)[name = tensor("transpose_160")]; + tensor var_1802_cast_fp16 = pow(x = x_229_cast_fp16, y = var_1743_promoted_2_to_fp16)[name = tensor("op_1802_cast_fp16")]; + tensor var_1804_axes_0 = const()[name = tensor("op_1804_axes_0"), val = tensor([-1])]; + tensor var_1804_keep_dims_0 = const()[name = tensor("op_1804_keep_dims_0"), val = tensor(true)]; + tensor var_1804_cast_fp16 = reduce_mean(axes = var_1804_axes_0, keep_dims = var_1804_keep_dims_0, x = var_1802_cast_fp16)[name = tensor("op_1804_cast_fp16")]; + tensor var_1805_to_fp16 = const()[name = tensor("op_1805_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_1806_cast_fp16 = add(x = var_1804_cast_fp16, y = var_1805_to_fp16)[name = tensor("op_1806_cast_fp16")]; + tensor norm_85_epsilon_0 = const()[name = tensor("norm_85_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_85_cast_fp16 = rsqrt(epsilon = norm_85_epsilon_0, x = var_1806_cast_fp16)[name = tensor("norm_85_cast_fp16")]; + tensor var_1808_cast_fp16 = mul(x = x_229_cast_fp16, y = norm_85_cast_fp16)[name = tensor("op_1808_cast_fp16")]; + tensor layers_10_self_attn_k_norm_weight_to_fp16 = const()[name = tensor("layers_10_self_attn_k_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(162281088)))]; + tensor var_1809_cast_fp16 = mul(x = var_1808_cast_fp16, y = layers_10_self_attn_k_norm_weight_to_fp16)[name = tensor("op_1809_cast_fp16")]; + tensor x1_41_begin_0 = const()[name = tensor("x1_41_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_41_end_0 = const()[name = tensor("x1_41_end_0"), val = tensor([1, 16, 768, 64])]; + tensor x1_41_end_mask_0 = const()[name = tensor("x1_41_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_41_cast_fp16 = slice_by_index(begin = x1_41_begin_0, end = x1_41_end_0, end_mask = x1_41_end_mask_0, x = var_1798_cast_fp16)[name = tensor("x1_41_cast_fp16")]; + tensor x2_41_begin_0 = const()[name = tensor("x2_41_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_41_end_0 = const()[name = tensor("x2_41_end_0"), val = tensor([1, 16, 768, 128])]; + tensor x2_41_end_mask_0 = const()[name = tensor("x2_41_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_41_cast_fp16 = slice_by_index(begin = x2_41_begin_0, end = x2_41_end_0, end_mask = x2_41_end_mask_0, x = var_1798_cast_fp16)[name = tensor("x2_41_cast_fp16")]; + tensor var_1826_cast_fp16 = mul(x = x1_41_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_1826_cast_fp16")]; + tensor var_1827_cast_fp16 = mul(x = x2_41_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_1827_cast_fp16")]; + tensor var_1828_cast_fp16 = sub(x = var_1826_cast_fp16, y = var_1827_cast_fp16)[name = tensor("op_1828_cast_fp16")]; + tensor var_1829_cast_fp16 = mul(x = x2_41_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_1829_cast_fp16")]; + tensor var_1830_cast_fp16 = mul(x = x1_41_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_1830_cast_fp16")]; + tensor var_1831_cast_fp16 = add(x = var_1829_cast_fp16, y = var_1830_cast_fp16)[name = tensor("op_1831_cast_fp16")]; + tensor q_21_interleave_0 = const()[name = tensor("q_21_interleave_0"), val = tensor(false)]; + tensor q_21_cast_fp16 = concat(axis = var_1744, interleave = q_21_interleave_0, values = (var_1828_cast_fp16, var_1831_cast_fp16))[name = tensor("q_21_cast_fp16")]; + tensor x1_43_begin_0 = const()[name = tensor("x1_43_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_43_end_0 = const()[name = tensor("x1_43_end_0"), val = tensor([1, 8, 768, 64])]; + tensor x1_43_end_mask_0 = const()[name = tensor("x1_43_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_43_cast_fp16 = slice_by_index(begin = x1_43_begin_0, end = x1_43_end_0, end_mask = x1_43_end_mask_0, x = var_1809_cast_fp16)[name = tensor("x1_43_cast_fp16")]; + tensor x2_43_begin_0 = const()[name = tensor("x2_43_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_43_end_0 = const()[name = tensor("x2_43_end_0"), val = tensor([1, 8, 768, 128])]; + tensor x2_43_end_mask_0 = const()[name = tensor("x2_43_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_43_cast_fp16 = slice_by_index(begin = x2_43_begin_0, end = x2_43_end_0, end_mask = x2_43_end_mask_0, x = var_1809_cast_fp16)[name = tensor("x2_43_cast_fp16")]; + tensor var_1849_cast_fp16 = mul(x = x1_43_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_1849_cast_fp16")]; + tensor var_1850_cast_fp16 = mul(x = x2_43_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_1850_cast_fp16")]; + tensor var_1851_cast_fp16 = sub(x = var_1849_cast_fp16, y = var_1850_cast_fp16)[name = tensor("op_1851_cast_fp16")]; + tensor var_1852_cast_fp16 = mul(x = x2_43_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_1852_cast_fp16")]; + tensor var_1853_cast_fp16 = mul(x = x1_43_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_1853_cast_fp16")]; + tensor var_1854_cast_fp16 = add(x = var_1852_cast_fp16, y = var_1853_cast_fp16)[name = tensor("op_1854_cast_fp16")]; + tensor k_41_interleave_0 = const()[name = tensor("k_41_interleave_0"), val = tensor(false)]; + tensor k_41_cast_fp16 = concat(axis = var_1744, interleave = k_41_interleave_0, values = (var_1851_cast_fp16, var_1854_cast_fp16))[name = tensor("k_41_cast_fp16")]; + tensor transpose_40_perm_0 = const()[name = tensor("transpose_40_perm_0"), val = tensor([1, 0, 2, 3])]; + tensor tile_20_reps_0 = const()[name = tensor("tile_20_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_40_cast_fp16 = transpose(perm = transpose_40_perm_0, x = k_41_cast_fp16)[name = tensor("transpose_159")]; + tensor tile_20_cast_fp16 = tile(reps = tile_20_reps_0, x = transpose_40_cast_fp16)[name = tensor("tile_20_cast_fp16")]; + tensor concat_40 = const()[name = tensor("concat_40"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_40_cast_fp16 = reshape(shape = concat_40, x = tile_20_cast_fp16)[name = tensor("reshape_40_cast_fp16")]; + tensor transpose_41_perm_0 = const()[name = tensor("transpose_41_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_41 = const()[name = tensor("concat_41"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_41_cast_fp16 = transpose(perm = transpose_41_perm_0, x = reshape_40_cast_fp16)[name = tensor("transpose_158")]; + tensor reshape_41_cast_fp16 = reshape(shape = concat_41, x = transpose_41_cast_fp16)[name = tensor("reshape_41_cast_fp16")]; + tensor transpose_133_perm_0 = const()[name = tensor("transpose_133_perm_0"), val = tensor([1, 0, -1, -2])]; + tensor tile_21_reps_0 = const()[name = tensor("tile_21_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_132_cast_fp16 = transpose(perm = transpose_132_perm_0, x = var_1787_cast_fp16)[name = tensor("transpose_157")]; + tensor tile_21_cast_fp16 = tile(reps = tile_21_reps_0, x = transpose_132_cast_fp16)[name = tensor("tile_21_cast_fp16")]; + tensor concat_42 = const()[name = tensor("concat_42"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_42_cast_fp16 = reshape(shape = concat_42, x = tile_21_cast_fp16)[name = tensor("reshape_42_cast_fp16")]; + tensor transpose_43_perm_0 = const()[name = tensor("transpose_43_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_43 = const()[name = tensor("concat_43"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_43_cast_fp16 = transpose(perm = transpose_43_perm_0, x = reshape_42_cast_fp16)[name = tensor("transpose_156")]; + tensor reshape_43_cast_fp16 = reshape(shape = concat_43, x = transpose_43_cast_fp16)[name = tensor("reshape_43_cast_fp16")]; + tensor v_43_perm_0 = const()[name = tensor("v_43_perm_0"), val = tensor([1, 0, -2, -1])]; + tensor var_1860_transpose_x_0 = const()[name = tensor("op_1860_transpose_x_0"), val = tensor(false)]; + tensor var_1860_transpose_y_0 = const()[name = tensor("op_1860_transpose_y_0"), val = tensor(false)]; + tensor transpose_133_cast_fp16 = transpose(perm = transpose_133_perm_0, x = reshape_41_cast_fp16)[name = tensor("transpose_155")]; + tensor var_1860_cast_fp16 = matmul(transpose_x = var_1860_transpose_x_0, transpose_y = var_1860_transpose_y_0, x = q_21_cast_fp16, y = transpose_133_cast_fp16)[name = tensor("op_1860_cast_fp16")]; + tensor var_1861_to_fp16 = const()[name = tensor("op_1861_to_fp16"), val = tensor(0x1.6ap-4)]; + tensor attn_41_cast_fp16 = mul(x = var_1860_cast_fp16, y = var_1861_to_fp16)[name = tensor("attn_41_cast_fp16")]; + tensor input_101_cast_fp16 = add(x = attn_41_cast_fp16, y = causal_mask_to_fp16_palettized)[name = tensor("input_101_cast_fp16")]; + tensor attn_43_cast_fp16 = softmax(axis = var_1744, x = input_101_cast_fp16)[name = tensor("attn_43_cast_fp16")]; + tensor var_1865_transpose_x_0 = const()[name = tensor("op_1865_transpose_x_0"), val = tensor(false)]; + tensor var_1865_transpose_y_0 = const()[name = tensor("op_1865_transpose_y_0"), val = tensor(false)]; + tensor v_43_cast_fp16 = transpose(perm = v_43_perm_0, x = reshape_43_cast_fp16)[name = tensor("transpose_154")]; + tensor var_1865_cast_fp16 = matmul(transpose_x = var_1865_transpose_x_0, transpose_y = var_1865_transpose_y_0, x = attn_43_cast_fp16, y = v_43_cast_fp16)[name = tensor("op_1865_cast_fp16")]; + tensor var_1866_perm_0 = const()[name = tensor("op_1866_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor var_1867 = const()[name = tensor("op_1867"), val = tensor([1, 768, 2048])]; + tensor var_1866_cast_fp16 = transpose(perm = var_1866_perm_0, x = var_1865_cast_fp16)[name = tensor("transpose_153")]; + tensor input_103_cast_fp16 = reshape(shape = var_1867, x = var_1866_cast_fp16)[name = tensor("input_103_cast_fp16")]; + tensor layers_10_self_attn_o_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(162281408))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(164378624))), name = tensor("layers_10_self_attn_o_proj_weight_to_fp16_palettized"), shape = tensor([1024, 2048])]; + tensor linear_73_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_10_self_attn_o_proj_weight_to_fp16_palettized, x = input_103_cast_fp16)[name = tensor("linear_73_cast_fp16")]; + tensor x_237_cast_fp16 = add(x = x_219_cast_fp16, y = linear_73_cast_fp16)[name = tensor("x_237_cast_fp16")]; + tensor var_1743_promoted_3_to_fp16 = const()[name = tensor("op_1743_promoted_3_to_fp16"), val = tensor(0x1p+1)]; + tensor var_1874_cast_fp16 = pow(x = x_237_cast_fp16, y = var_1743_promoted_3_to_fp16)[name = tensor("op_1874_cast_fp16")]; + tensor var_1876_axes_0 = const()[name = tensor("op_1876_axes_0"), val = tensor([-1])]; + tensor var_1876_keep_dims_0 = const()[name = tensor("op_1876_keep_dims_0"), val = tensor(true)]; + tensor var_1876_cast_fp16 = reduce_mean(axes = var_1876_axes_0, keep_dims = var_1876_keep_dims_0, x = var_1874_cast_fp16)[name = tensor("op_1876_cast_fp16")]; + tensor var_1877_to_fp16 = const()[name = tensor("op_1877_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_1878_cast_fp16 = add(x = var_1876_cast_fp16, y = var_1877_to_fp16)[name = tensor("op_1878_cast_fp16")]; + tensor norm_87_epsilon_0 = const()[name = tensor("norm_87_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_87_cast_fp16 = rsqrt(epsilon = norm_87_epsilon_0, x = var_1878_cast_fp16)[name = tensor("norm_87_cast_fp16")]; + tensor var_1880_cast_fp16 = mul(x = x_237_cast_fp16, y = norm_87_cast_fp16)[name = tensor("op_1880_cast_fp16")]; + tensor layers_10_post_attention_layernorm_weight_to_fp16 = const()[name = tensor("layers_10_post_attention_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(164379200)))]; + tensor var_1881_cast_fp16 = mul(x = var_1880_cast_fp16, y = layers_10_post_attention_layernorm_weight_to_fp16)[name = tensor("op_1881_cast_fp16")]; + tensor layers_10_mlp_gate_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(164381312))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(167527104))), name = tensor("layers_10_mlp_gate_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_74_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_10_mlp_gate_proj_weight_to_fp16_palettized, x = var_1881_cast_fp16)[name = tensor("linear_74_cast_fp16")]; + tensor var_1891_cast_fp16 = silu(x = linear_74_cast_fp16)[name = tensor("op_1891_cast_fp16")]; + tensor layers_10_mlp_up_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(167527680))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(170673472))), name = tensor("layers_10_mlp_up_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_75_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_10_mlp_up_proj_weight_to_fp16_palettized, x = var_1881_cast_fp16)[name = tensor("linear_75_cast_fp16")]; + tensor input_109_cast_fp16 = mul(x = var_1891_cast_fp16, y = linear_75_cast_fp16)[name = tensor("input_109_cast_fp16")]; + tensor layers_10_mlp_down_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(170674048))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(173819840))), name = tensor("layers_10_mlp_down_proj_weight_to_fp16_palettized"), shape = tensor([1024, 3072])]; + tensor linear_76_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_10_mlp_down_proj_weight_to_fp16_palettized, x = input_109_cast_fp16)[name = tensor("linear_76_cast_fp16")]; + tensor x_241_cast_fp16 = add(x = x_237_cast_fp16, y = linear_76_cast_fp16)[name = tensor("x_241_cast_fp16")]; + tensor var_1911 = const()[name = tensor("op_1911"), val = tensor(-1)]; + tensor var_1910_promoted_to_fp16 = const()[name = tensor("op_1910_promoted_to_fp16"), val = tensor(0x1p+1)]; + tensor var_1920_cast_fp16 = pow(x = x_241_cast_fp16, y = var_1910_promoted_to_fp16)[name = tensor("op_1920_cast_fp16")]; + tensor var_1922_axes_0 = const()[name = tensor("op_1922_axes_0"), val = tensor([-1])]; + tensor var_1922_keep_dims_0 = const()[name = tensor("op_1922_keep_dims_0"), val = tensor(true)]; + tensor var_1922_cast_fp16 = reduce_mean(axes = var_1922_axes_0, keep_dims = var_1922_keep_dims_0, x = var_1920_cast_fp16)[name = tensor("op_1922_cast_fp16")]; + tensor var_1923_to_fp16 = const()[name = tensor("op_1923_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_1924_cast_fp16 = add(x = var_1922_cast_fp16, y = var_1923_to_fp16)[name = tensor("op_1924_cast_fp16")]; + tensor norm_89_epsilon_0 = const()[name = tensor("norm_89_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_89_cast_fp16 = rsqrt(epsilon = norm_89_epsilon_0, x = var_1924_cast_fp16)[name = tensor("norm_89_cast_fp16")]; + tensor var_1926_cast_fp16 = mul(x = x_241_cast_fp16, y = norm_89_cast_fp16)[name = tensor("op_1926_cast_fp16")]; + tensor layers_11_input_layernorm_weight_to_fp16 = const()[name = tensor("layers_11_input_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(173820416)))]; + tensor var_1927_cast_fp16 = mul(x = var_1926_cast_fp16, y = layers_11_input_layernorm_weight_to_fp16)[name = tensor("op_1927_cast_fp16")]; + tensor layers_11_self_attn_q_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(173822528))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(175919744))), name = tensor("layers_11_self_attn_q_proj_weight_to_fp16_palettized"), shape = tensor([2048, 1024])]; + tensor linear_77_cast_fp16 = linear(bias = linear_0_bias_0_to_fp16, weight = layers_11_self_attn_q_proj_weight_to_fp16_palettized, x = var_1927_cast_fp16)[name = tensor("linear_77_cast_fp16")]; + tensor var_1943 = const()[name = tensor("op_1943"), val = tensor([1, 768, 16, 128])]; + tensor var_1944_cast_fp16 = reshape(shape = var_1943, x = linear_77_cast_fp16)[name = tensor("op_1944_cast_fp16")]; + tensor x_247_perm_0 = const()[name = tensor("x_247_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_11_self_attn_k_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(175920320))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(176968960))), name = tensor("layers_11_self_attn_k_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_78_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_11_self_attn_k_proj_weight_to_fp16_palettized, x = var_1927_cast_fp16)[name = tensor("linear_78_cast_fp16")]; + tensor var_1948 = const()[name = tensor("op_1948"), val = tensor([1, 768, 8, 128])]; + tensor var_1949_cast_fp16 = reshape(shape = var_1948, x = linear_78_cast_fp16)[name = tensor("op_1949_cast_fp16")]; + tensor x_251_perm_0 = const()[name = tensor("x_251_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_11_self_attn_v_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(176969536))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(178018176))), name = tensor("layers_11_self_attn_v_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_79_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_11_self_attn_v_proj_weight_to_fp16_palettized, x = var_1927_cast_fp16)[name = tensor("linear_79_cast_fp16")]; + tensor var_1953 = const()[name = tensor("op_1953"), val = tensor([1, 768, 8, 128])]; + tensor var_1954_cast_fp16 = reshape(shape = var_1953, x = linear_79_cast_fp16)[name = tensor("op_1954_cast_fp16")]; + tensor transpose_134_perm_0 = const()[name = tensor("transpose_134_perm_0"), val = tensor([2, 0, 1, 3])]; + tensor var_1910_promoted_1_to_fp16 = const()[name = tensor("op_1910_promoted_1_to_fp16"), val = tensor(0x1p+1)]; + tensor x_247_cast_fp16 = transpose(perm = x_247_perm_0, x = var_1944_cast_fp16)[name = tensor("transpose_152")]; + tensor var_1958_cast_fp16 = pow(x = x_247_cast_fp16, y = var_1910_promoted_1_to_fp16)[name = tensor("op_1958_cast_fp16")]; + tensor var_1960_axes_0 = const()[name = tensor("op_1960_axes_0"), val = tensor([-1])]; + tensor var_1960_keep_dims_0 = const()[name = tensor("op_1960_keep_dims_0"), val = tensor(true)]; + tensor var_1960_cast_fp16 = reduce_mean(axes = var_1960_axes_0, keep_dims = var_1960_keep_dims_0, x = var_1958_cast_fp16)[name = tensor("op_1960_cast_fp16")]; + tensor var_1961_to_fp16 = const()[name = tensor("op_1961_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_1962_cast_fp16 = add(x = var_1960_cast_fp16, y = var_1961_to_fp16)[name = tensor("op_1962_cast_fp16")]; + tensor norm_91_epsilon_0 = const()[name = tensor("norm_91_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_91_cast_fp16 = rsqrt(epsilon = norm_91_epsilon_0, x = var_1962_cast_fp16)[name = tensor("norm_91_cast_fp16")]; + tensor var_1964_cast_fp16 = mul(x = x_247_cast_fp16, y = norm_91_cast_fp16)[name = tensor("op_1964_cast_fp16")]; + tensor layers_11_self_attn_q_norm_weight_to_fp16 = const()[name = tensor("layers_11_self_attn_q_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(178018752)))]; + tensor var_1965_cast_fp16 = mul(x = var_1964_cast_fp16, y = layers_11_self_attn_q_norm_weight_to_fp16)[name = tensor("op_1965_cast_fp16")]; + tensor var_1910_promoted_2_to_fp16 = const()[name = tensor("op_1910_promoted_2_to_fp16"), val = tensor(0x1p+1)]; + tensor x_251_cast_fp16 = transpose(perm = x_251_perm_0, x = var_1949_cast_fp16)[name = tensor("transpose_151")]; + tensor var_1969_cast_fp16 = pow(x = x_251_cast_fp16, y = var_1910_promoted_2_to_fp16)[name = tensor("op_1969_cast_fp16")]; + tensor var_1971_axes_0 = const()[name = tensor("op_1971_axes_0"), val = tensor([-1])]; + tensor var_1971_keep_dims_0 = const()[name = tensor("op_1971_keep_dims_0"), val = tensor(true)]; + tensor var_1971_cast_fp16 = reduce_mean(axes = var_1971_axes_0, keep_dims = var_1971_keep_dims_0, x = var_1969_cast_fp16)[name = tensor("op_1971_cast_fp16")]; + tensor var_1972_to_fp16 = const()[name = tensor("op_1972_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_1973_cast_fp16 = add(x = var_1971_cast_fp16, y = var_1972_to_fp16)[name = tensor("op_1973_cast_fp16")]; + tensor norm_93_epsilon_0 = const()[name = tensor("norm_93_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_93_cast_fp16 = rsqrt(epsilon = norm_93_epsilon_0, x = var_1973_cast_fp16)[name = tensor("norm_93_cast_fp16")]; + tensor var_1975_cast_fp16 = mul(x = x_251_cast_fp16, y = norm_93_cast_fp16)[name = tensor("op_1975_cast_fp16")]; + tensor layers_11_self_attn_k_norm_weight_to_fp16 = const()[name = tensor("layers_11_self_attn_k_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(178019072)))]; + tensor var_1976_cast_fp16 = mul(x = var_1975_cast_fp16, y = layers_11_self_attn_k_norm_weight_to_fp16)[name = tensor("op_1976_cast_fp16")]; + tensor x1_45_begin_0 = const()[name = tensor("x1_45_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_45_end_0 = const()[name = tensor("x1_45_end_0"), val = tensor([1, 16, 768, 64])]; + tensor x1_45_end_mask_0 = const()[name = tensor("x1_45_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_45_cast_fp16 = slice_by_index(begin = x1_45_begin_0, end = x1_45_end_0, end_mask = x1_45_end_mask_0, x = var_1965_cast_fp16)[name = tensor("x1_45_cast_fp16")]; + tensor x2_45_begin_0 = const()[name = tensor("x2_45_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_45_end_0 = const()[name = tensor("x2_45_end_0"), val = tensor([1, 16, 768, 128])]; + tensor x2_45_end_mask_0 = const()[name = tensor("x2_45_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_45_cast_fp16 = slice_by_index(begin = x2_45_begin_0, end = x2_45_end_0, end_mask = x2_45_end_mask_0, x = var_1965_cast_fp16)[name = tensor("x2_45_cast_fp16")]; + tensor var_1993_cast_fp16 = mul(x = x1_45_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_1993_cast_fp16")]; + tensor var_1994_cast_fp16 = mul(x = x2_45_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_1994_cast_fp16")]; + tensor var_1995_cast_fp16 = sub(x = var_1993_cast_fp16, y = var_1994_cast_fp16)[name = tensor("op_1995_cast_fp16")]; + tensor var_1996_cast_fp16 = mul(x = x2_45_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_1996_cast_fp16")]; + tensor var_1997_cast_fp16 = mul(x = x1_45_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_1997_cast_fp16")]; + tensor var_1998_cast_fp16 = add(x = var_1996_cast_fp16, y = var_1997_cast_fp16)[name = tensor("op_1998_cast_fp16")]; + tensor q_23_interleave_0 = const()[name = tensor("q_23_interleave_0"), val = tensor(false)]; + tensor q_23_cast_fp16 = concat(axis = var_1911, interleave = q_23_interleave_0, values = (var_1995_cast_fp16, var_1998_cast_fp16))[name = tensor("q_23_cast_fp16")]; + tensor x1_47_begin_0 = const()[name = tensor("x1_47_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_47_end_0 = const()[name = tensor("x1_47_end_0"), val = tensor([1, 8, 768, 64])]; + tensor x1_47_end_mask_0 = const()[name = tensor("x1_47_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_47_cast_fp16 = slice_by_index(begin = x1_47_begin_0, end = x1_47_end_0, end_mask = x1_47_end_mask_0, x = var_1976_cast_fp16)[name = tensor("x1_47_cast_fp16")]; + tensor x2_47_begin_0 = const()[name = tensor("x2_47_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_47_end_0 = const()[name = tensor("x2_47_end_0"), val = tensor([1, 8, 768, 128])]; + tensor x2_47_end_mask_0 = const()[name = tensor("x2_47_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_47_cast_fp16 = slice_by_index(begin = x2_47_begin_0, end = x2_47_end_0, end_mask = x2_47_end_mask_0, x = var_1976_cast_fp16)[name = tensor("x2_47_cast_fp16")]; + tensor var_2016_cast_fp16 = mul(x = x1_47_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_2016_cast_fp16")]; + tensor var_2017_cast_fp16 = mul(x = x2_47_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_2017_cast_fp16")]; + tensor var_2018_cast_fp16 = sub(x = var_2016_cast_fp16, y = var_2017_cast_fp16)[name = tensor("op_2018_cast_fp16")]; + tensor var_2019_cast_fp16 = mul(x = x2_47_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_2019_cast_fp16")]; + tensor var_2020_cast_fp16 = mul(x = x1_47_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_2020_cast_fp16")]; + tensor var_2021_cast_fp16 = add(x = var_2019_cast_fp16, y = var_2020_cast_fp16)[name = tensor("op_2021_cast_fp16")]; + tensor k_45_interleave_0 = const()[name = tensor("k_45_interleave_0"), val = tensor(false)]; + tensor k_45_cast_fp16 = concat(axis = var_1911, interleave = k_45_interleave_0, values = (var_2018_cast_fp16, var_2021_cast_fp16))[name = tensor("k_45_cast_fp16")]; + tensor transpose_44_perm_0 = const()[name = tensor("transpose_44_perm_0"), val = tensor([1, 0, 2, 3])]; + tensor tile_22_reps_0 = const()[name = tensor("tile_22_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_44_cast_fp16 = transpose(perm = transpose_44_perm_0, x = k_45_cast_fp16)[name = tensor("transpose_150")]; + tensor tile_22_cast_fp16 = tile(reps = tile_22_reps_0, x = transpose_44_cast_fp16)[name = tensor("tile_22_cast_fp16")]; + tensor concat_44 = const()[name = tensor("concat_44"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_44_cast_fp16 = reshape(shape = concat_44, x = tile_22_cast_fp16)[name = tensor("reshape_44_cast_fp16")]; + tensor transpose_45_perm_0 = const()[name = tensor("transpose_45_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_45 = const()[name = tensor("concat_45"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_45_cast_fp16 = transpose(perm = transpose_45_perm_0, x = reshape_44_cast_fp16)[name = tensor("transpose_149")]; + tensor reshape_45_cast_fp16 = reshape(shape = concat_45, x = transpose_45_cast_fp16)[name = tensor("reshape_45_cast_fp16")]; + tensor transpose_135_perm_0 = const()[name = tensor("transpose_135_perm_0"), val = tensor([1, 0, -1, -2])]; + tensor tile_23_reps_0 = const()[name = tensor("tile_23_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_134_cast_fp16 = transpose(perm = transpose_134_perm_0, x = var_1954_cast_fp16)[name = tensor("transpose_148")]; + tensor tile_23_cast_fp16 = tile(reps = tile_23_reps_0, x = transpose_134_cast_fp16)[name = tensor("tile_23_cast_fp16")]; + tensor concat_46 = const()[name = tensor("concat_46"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_46_cast_fp16 = reshape(shape = concat_46, x = tile_23_cast_fp16)[name = tensor("reshape_46_cast_fp16")]; + tensor transpose_47_perm_0 = const()[name = tensor("transpose_47_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_47 = const()[name = tensor("concat_47"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_47_cast_fp16 = transpose(perm = transpose_47_perm_0, x = reshape_46_cast_fp16)[name = tensor("transpose_147")]; + tensor reshape_47_cast_fp16 = reshape(shape = concat_47, x = transpose_47_cast_fp16)[name = tensor("reshape_47_cast_fp16")]; + tensor v_47_perm_0 = const()[name = tensor("v_47_perm_0"), val = tensor([1, 0, -2, -1])]; + tensor var_2027_transpose_x_0 = const()[name = tensor("op_2027_transpose_x_0"), val = tensor(false)]; + tensor var_2027_transpose_y_0 = const()[name = tensor("op_2027_transpose_y_0"), val = tensor(false)]; + tensor transpose_135_cast_fp16 = transpose(perm = transpose_135_perm_0, x = reshape_45_cast_fp16)[name = tensor("transpose_146")]; + tensor var_2027_cast_fp16 = matmul(transpose_x = var_2027_transpose_x_0, transpose_y = var_2027_transpose_y_0, x = q_23_cast_fp16, y = transpose_135_cast_fp16)[name = tensor("op_2027_cast_fp16")]; + tensor var_2028_to_fp16 = const()[name = tensor("op_2028_to_fp16"), val = tensor(0x1.6ap-4)]; + tensor attn_45_cast_fp16 = mul(x = var_2027_cast_fp16, y = var_2028_to_fp16)[name = tensor("attn_45_cast_fp16")]; + tensor input_111_cast_fp16 = add(x = attn_45_cast_fp16, y = causal_mask_to_fp16_palettized)[name = tensor("input_111_cast_fp16")]; + tensor attn_47_cast_fp16 = softmax(axis = var_1911, x = input_111_cast_fp16)[name = tensor("attn_47_cast_fp16")]; + tensor var_2032_transpose_x_0 = const()[name = tensor("op_2032_transpose_x_0"), val = tensor(false)]; + tensor var_2032_transpose_y_0 = const()[name = tensor("op_2032_transpose_y_0"), val = tensor(false)]; + tensor v_47_cast_fp16 = transpose(perm = v_47_perm_0, x = reshape_47_cast_fp16)[name = tensor("transpose_145")]; + tensor var_2032_cast_fp16 = matmul(transpose_x = var_2032_transpose_x_0, transpose_y = var_2032_transpose_y_0, x = attn_47_cast_fp16, y = v_47_cast_fp16)[name = tensor("op_2032_cast_fp16")]; + tensor var_2033_perm_0 = const()[name = tensor("op_2033_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor var_2034 = const()[name = tensor("op_2034"), val = tensor([1, 768, 2048])]; + tensor var_2033_cast_fp16 = transpose(perm = var_2033_perm_0, x = var_2032_cast_fp16)[name = tensor("transpose_144")]; + tensor input_113_cast_fp16 = reshape(shape = var_2034, x = var_2033_cast_fp16)[name = tensor("input_113_cast_fp16")]; + tensor layers_11_self_attn_o_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(178019392))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(180116608))), name = tensor("layers_11_self_attn_o_proj_weight_to_fp16_palettized"), shape = tensor([1024, 2048])]; + tensor linear_80_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_11_self_attn_o_proj_weight_to_fp16_palettized, x = input_113_cast_fp16)[name = tensor("linear_80_cast_fp16")]; + tensor x_259_cast_fp16 = add(x = x_241_cast_fp16, y = linear_80_cast_fp16)[name = tensor("x_259_cast_fp16")]; + tensor var_1910_promoted_3_to_fp16 = const()[name = tensor("op_1910_promoted_3_to_fp16"), val = tensor(0x1p+1)]; + tensor var_2041_cast_fp16 = pow(x = x_259_cast_fp16, y = var_1910_promoted_3_to_fp16)[name = tensor("op_2041_cast_fp16")]; + tensor var_2043_axes_0 = const()[name = tensor("op_2043_axes_0"), val = tensor([-1])]; + tensor var_2043_keep_dims_0 = const()[name = tensor("op_2043_keep_dims_0"), val = tensor(true)]; + tensor var_2043_cast_fp16 = reduce_mean(axes = var_2043_axes_0, keep_dims = var_2043_keep_dims_0, x = var_2041_cast_fp16)[name = tensor("op_2043_cast_fp16")]; + tensor var_2044_to_fp16 = const()[name = tensor("op_2044_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_2045_cast_fp16 = add(x = var_2043_cast_fp16, y = var_2044_to_fp16)[name = tensor("op_2045_cast_fp16")]; + tensor norm_95_epsilon_0 = const()[name = tensor("norm_95_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_95_cast_fp16 = rsqrt(epsilon = norm_95_epsilon_0, x = var_2045_cast_fp16)[name = tensor("norm_95_cast_fp16")]; + tensor var_2047_cast_fp16 = mul(x = x_259_cast_fp16, y = norm_95_cast_fp16)[name = tensor("op_2047_cast_fp16")]; + tensor layers_11_post_attention_layernorm_weight_to_fp16 = const()[name = tensor("layers_11_post_attention_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(180117184)))]; + tensor var_2048_cast_fp16 = mul(x = var_2047_cast_fp16, y = layers_11_post_attention_layernorm_weight_to_fp16)[name = tensor("op_2048_cast_fp16")]; + tensor layers_11_mlp_gate_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(180119296))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(183265088))), name = tensor("layers_11_mlp_gate_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_81_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_11_mlp_gate_proj_weight_to_fp16_palettized, x = var_2048_cast_fp16)[name = tensor("linear_81_cast_fp16")]; + tensor var_2058_cast_fp16 = silu(x = linear_81_cast_fp16)[name = tensor("op_2058_cast_fp16")]; + tensor layers_11_mlp_up_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(183265664))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(186411456))), name = tensor("layers_11_mlp_up_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_82_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_11_mlp_up_proj_weight_to_fp16_palettized, x = var_2048_cast_fp16)[name = tensor("linear_82_cast_fp16")]; + tensor input_119_cast_fp16 = mul(x = var_2058_cast_fp16, y = linear_82_cast_fp16)[name = tensor("input_119_cast_fp16")]; + tensor layers_11_mlp_down_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(186412032))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(189557824))), name = tensor("layers_11_mlp_down_proj_weight_to_fp16_palettized"), shape = tensor([1024, 3072])]; + tensor linear_83_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_11_mlp_down_proj_weight_to_fp16_palettized, x = input_119_cast_fp16)[name = tensor("linear_83_cast_fp16")]; + tensor x_263_cast_fp16 = add(x = x_259_cast_fp16, y = linear_83_cast_fp16)[name = tensor("x_263_cast_fp16")]; + tensor var_2078 = const()[name = tensor("op_2078"), val = tensor(-1)]; + tensor var_2077_promoted_to_fp16 = const()[name = tensor("op_2077_promoted_to_fp16"), val = tensor(0x1p+1)]; + tensor var_2087_cast_fp16 = pow(x = x_263_cast_fp16, y = var_2077_promoted_to_fp16)[name = tensor("op_2087_cast_fp16")]; + tensor var_2089_axes_0 = const()[name = tensor("op_2089_axes_0"), val = tensor([-1])]; + tensor var_2089_keep_dims_0 = const()[name = tensor("op_2089_keep_dims_0"), val = tensor(true)]; + tensor var_2089_cast_fp16 = reduce_mean(axes = var_2089_axes_0, keep_dims = var_2089_keep_dims_0, x = var_2087_cast_fp16)[name = tensor("op_2089_cast_fp16")]; + tensor var_2090_to_fp16 = const()[name = tensor("op_2090_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_2091_cast_fp16 = add(x = var_2089_cast_fp16, y = var_2090_to_fp16)[name = tensor("op_2091_cast_fp16")]; + tensor norm_97_epsilon_0 = const()[name = tensor("norm_97_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_97_cast_fp16 = rsqrt(epsilon = norm_97_epsilon_0, x = var_2091_cast_fp16)[name = tensor("norm_97_cast_fp16")]; + tensor var_2093_cast_fp16 = mul(x = x_263_cast_fp16, y = norm_97_cast_fp16)[name = tensor("op_2093_cast_fp16")]; + tensor layers_12_input_layernorm_weight_to_fp16 = const()[name = tensor("layers_12_input_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(189558400)))]; + tensor var_2094_cast_fp16 = mul(x = var_2093_cast_fp16, y = layers_12_input_layernorm_weight_to_fp16)[name = tensor("op_2094_cast_fp16")]; + tensor layers_12_self_attn_q_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(189560512))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(191657728))), name = tensor("layers_12_self_attn_q_proj_weight_to_fp16_palettized"), shape = tensor([2048, 1024])]; + tensor linear_84_cast_fp16 = linear(bias = linear_0_bias_0_to_fp16, weight = layers_12_self_attn_q_proj_weight_to_fp16_palettized, x = var_2094_cast_fp16)[name = tensor("linear_84_cast_fp16")]; + tensor var_2110 = const()[name = tensor("op_2110"), val = tensor([1, 768, 16, 128])]; + tensor var_2111_cast_fp16 = reshape(shape = var_2110, x = linear_84_cast_fp16)[name = tensor("op_2111_cast_fp16")]; + tensor x_269_perm_0 = const()[name = tensor("x_269_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_12_self_attn_k_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(191658304))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(192706944))), name = tensor("layers_12_self_attn_k_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_85_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_12_self_attn_k_proj_weight_to_fp16_palettized, x = var_2094_cast_fp16)[name = tensor("linear_85_cast_fp16")]; + tensor var_2115 = const()[name = tensor("op_2115"), val = tensor([1, 768, 8, 128])]; + tensor var_2116_cast_fp16 = reshape(shape = var_2115, x = linear_85_cast_fp16)[name = tensor("op_2116_cast_fp16")]; + tensor x_273_perm_0 = const()[name = tensor("x_273_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_12_self_attn_v_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(192707520))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(193756160))), name = tensor("layers_12_self_attn_v_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_86_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_12_self_attn_v_proj_weight_to_fp16_palettized, x = var_2094_cast_fp16)[name = tensor("linear_86_cast_fp16")]; + tensor var_2120 = const()[name = tensor("op_2120"), val = tensor([1, 768, 8, 128])]; + tensor var_2121_cast_fp16 = reshape(shape = var_2120, x = linear_86_cast_fp16)[name = tensor("op_2121_cast_fp16")]; + tensor transpose_136_perm_0 = const()[name = tensor("transpose_136_perm_0"), val = tensor([2, 0, 1, 3])]; + tensor var_2077_promoted_1_to_fp16 = const()[name = tensor("op_2077_promoted_1_to_fp16"), val = tensor(0x1p+1)]; + tensor x_269_cast_fp16 = transpose(perm = x_269_perm_0, x = var_2111_cast_fp16)[name = tensor("transpose_143")]; + tensor var_2125_cast_fp16 = pow(x = x_269_cast_fp16, y = var_2077_promoted_1_to_fp16)[name = tensor("op_2125_cast_fp16")]; + tensor var_2127_axes_0 = const()[name = tensor("op_2127_axes_0"), val = tensor([-1])]; + tensor var_2127_keep_dims_0 = const()[name = tensor("op_2127_keep_dims_0"), val = tensor(true)]; + tensor var_2127_cast_fp16 = reduce_mean(axes = var_2127_axes_0, keep_dims = var_2127_keep_dims_0, x = var_2125_cast_fp16)[name = tensor("op_2127_cast_fp16")]; + tensor var_2128_to_fp16 = const()[name = tensor("op_2128_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_2129_cast_fp16 = add(x = var_2127_cast_fp16, y = var_2128_to_fp16)[name = tensor("op_2129_cast_fp16")]; + tensor norm_99_epsilon_0 = const()[name = tensor("norm_99_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_99_cast_fp16 = rsqrt(epsilon = norm_99_epsilon_0, x = var_2129_cast_fp16)[name = tensor("norm_99_cast_fp16")]; + tensor var_2131_cast_fp16 = mul(x = x_269_cast_fp16, y = norm_99_cast_fp16)[name = tensor("op_2131_cast_fp16")]; + tensor layers_12_self_attn_q_norm_weight_to_fp16 = const()[name = tensor("layers_12_self_attn_q_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(193756736)))]; + tensor var_2132_cast_fp16 = mul(x = var_2131_cast_fp16, y = layers_12_self_attn_q_norm_weight_to_fp16)[name = tensor("op_2132_cast_fp16")]; + tensor var_2077_promoted_2_to_fp16 = const()[name = tensor("op_2077_promoted_2_to_fp16"), val = tensor(0x1p+1)]; + tensor x_273_cast_fp16 = transpose(perm = x_273_perm_0, x = var_2116_cast_fp16)[name = tensor("transpose_142")]; + tensor var_2136_cast_fp16 = pow(x = x_273_cast_fp16, y = var_2077_promoted_2_to_fp16)[name = tensor("op_2136_cast_fp16")]; + tensor var_2138_axes_0 = const()[name = tensor("op_2138_axes_0"), val = tensor([-1])]; + tensor var_2138_keep_dims_0 = const()[name = tensor("op_2138_keep_dims_0"), val = tensor(true)]; + tensor var_2138_cast_fp16 = reduce_mean(axes = var_2138_axes_0, keep_dims = var_2138_keep_dims_0, x = var_2136_cast_fp16)[name = tensor("op_2138_cast_fp16")]; + tensor var_2139_to_fp16 = const()[name = tensor("op_2139_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_2140_cast_fp16 = add(x = var_2138_cast_fp16, y = var_2139_to_fp16)[name = tensor("op_2140_cast_fp16")]; + tensor norm_101_epsilon_0 = const()[name = tensor("norm_101_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_101_cast_fp16 = rsqrt(epsilon = norm_101_epsilon_0, x = var_2140_cast_fp16)[name = tensor("norm_101_cast_fp16")]; + tensor var_2142_cast_fp16 = mul(x = x_273_cast_fp16, y = norm_101_cast_fp16)[name = tensor("op_2142_cast_fp16")]; + tensor layers_12_self_attn_k_norm_weight_to_fp16 = const()[name = tensor("layers_12_self_attn_k_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(193757056)))]; + tensor var_2143_cast_fp16 = mul(x = var_2142_cast_fp16, y = layers_12_self_attn_k_norm_weight_to_fp16)[name = tensor("op_2143_cast_fp16")]; + tensor x1_49_begin_0 = const()[name = tensor("x1_49_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_49_end_0 = const()[name = tensor("x1_49_end_0"), val = tensor([1, 16, 768, 64])]; + tensor x1_49_end_mask_0 = const()[name = tensor("x1_49_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_49_cast_fp16 = slice_by_index(begin = x1_49_begin_0, end = x1_49_end_0, end_mask = x1_49_end_mask_0, x = var_2132_cast_fp16)[name = tensor("x1_49_cast_fp16")]; + tensor x2_49_begin_0 = const()[name = tensor("x2_49_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_49_end_0 = const()[name = tensor("x2_49_end_0"), val = tensor([1, 16, 768, 128])]; + tensor x2_49_end_mask_0 = const()[name = tensor("x2_49_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_49_cast_fp16 = slice_by_index(begin = x2_49_begin_0, end = x2_49_end_0, end_mask = x2_49_end_mask_0, x = var_2132_cast_fp16)[name = tensor("x2_49_cast_fp16")]; + tensor var_2160_cast_fp16 = mul(x = x1_49_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_2160_cast_fp16")]; + tensor var_2161_cast_fp16 = mul(x = x2_49_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_2161_cast_fp16")]; + tensor var_2162_cast_fp16 = sub(x = var_2160_cast_fp16, y = var_2161_cast_fp16)[name = tensor("op_2162_cast_fp16")]; + tensor var_2163_cast_fp16 = mul(x = x2_49_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_2163_cast_fp16")]; + tensor var_2164_cast_fp16 = mul(x = x1_49_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_2164_cast_fp16")]; + tensor var_2165_cast_fp16 = add(x = var_2163_cast_fp16, y = var_2164_cast_fp16)[name = tensor("op_2165_cast_fp16")]; + tensor q_25_interleave_0 = const()[name = tensor("q_25_interleave_0"), val = tensor(false)]; + tensor q_25_cast_fp16 = concat(axis = var_2078, interleave = q_25_interleave_0, values = (var_2162_cast_fp16, var_2165_cast_fp16))[name = tensor("q_25_cast_fp16")]; + tensor x1_51_begin_0 = const()[name = tensor("x1_51_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_51_end_0 = const()[name = tensor("x1_51_end_0"), val = tensor([1, 8, 768, 64])]; + tensor x1_51_end_mask_0 = const()[name = tensor("x1_51_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_51_cast_fp16 = slice_by_index(begin = x1_51_begin_0, end = x1_51_end_0, end_mask = x1_51_end_mask_0, x = var_2143_cast_fp16)[name = tensor("x1_51_cast_fp16")]; + tensor x2_51_begin_0 = const()[name = tensor("x2_51_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_51_end_0 = const()[name = tensor("x2_51_end_0"), val = tensor([1, 8, 768, 128])]; + tensor x2_51_end_mask_0 = const()[name = tensor("x2_51_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_51_cast_fp16 = slice_by_index(begin = x2_51_begin_0, end = x2_51_end_0, end_mask = x2_51_end_mask_0, x = var_2143_cast_fp16)[name = tensor("x2_51_cast_fp16")]; + tensor var_2183_cast_fp16 = mul(x = x1_51_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_2183_cast_fp16")]; + tensor var_2184_cast_fp16 = mul(x = x2_51_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_2184_cast_fp16")]; + tensor var_2185_cast_fp16 = sub(x = var_2183_cast_fp16, y = var_2184_cast_fp16)[name = tensor("op_2185_cast_fp16")]; + tensor var_2186_cast_fp16 = mul(x = x2_51_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_2186_cast_fp16")]; + tensor var_2187_cast_fp16 = mul(x = x1_51_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_2187_cast_fp16")]; + tensor var_2188_cast_fp16 = add(x = var_2186_cast_fp16, y = var_2187_cast_fp16)[name = tensor("op_2188_cast_fp16")]; + tensor k_49_interleave_0 = const()[name = tensor("k_49_interleave_0"), val = tensor(false)]; + tensor k_49_cast_fp16 = concat(axis = var_2078, interleave = k_49_interleave_0, values = (var_2185_cast_fp16, var_2188_cast_fp16))[name = tensor("k_49_cast_fp16")]; + tensor transpose_48_perm_0 = const()[name = tensor("transpose_48_perm_0"), val = tensor([1, 0, 2, 3])]; + tensor tile_24_reps_0 = const()[name = tensor("tile_24_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_48_cast_fp16 = transpose(perm = transpose_48_perm_0, x = k_49_cast_fp16)[name = tensor("transpose_141")]; + tensor tile_24_cast_fp16 = tile(reps = tile_24_reps_0, x = transpose_48_cast_fp16)[name = tensor("tile_24_cast_fp16")]; + tensor concat_48 = const()[name = tensor("concat_48"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_48_cast_fp16 = reshape(shape = concat_48, x = tile_24_cast_fp16)[name = tensor("reshape_48_cast_fp16")]; + tensor transpose_49_perm_0 = const()[name = tensor("transpose_49_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_49 = const()[name = tensor("concat_49"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_49_cast_fp16 = transpose(perm = transpose_49_perm_0, x = reshape_48_cast_fp16)[name = tensor("transpose_140")]; + tensor reshape_49_cast_fp16 = reshape(shape = concat_49, x = transpose_49_cast_fp16)[name = tensor("reshape_49_cast_fp16")]; + tensor transpose_137_perm_0 = const()[name = tensor("transpose_137_perm_0"), val = tensor([1, 0, -1, -2])]; + tensor tile_25_reps_0 = const()[name = tensor("tile_25_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_136_cast_fp16 = transpose(perm = transpose_136_perm_0, x = var_2121_cast_fp16)[name = tensor("transpose_139")]; + tensor tile_25_cast_fp16 = tile(reps = tile_25_reps_0, x = transpose_136_cast_fp16)[name = tensor("tile_25_cast_fp16")]; + tensor concat_50 = const()[name = tensor("concat_50"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_50_cast_fp16 = reshape(shape = concat_50, x = tile_25_cast_fp16)[name = tensor("reshape_50_cast_fp16")]; + tensor transpose_51_perm_0 = const()[name = tensor("transpose_51_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_51 = const()[name = tensor("concat_51"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_51_cast_fp16 = transpose(perm = transpose_51_perm_0, x = reshape_50_cast_fp16)[name = tensor("transpose_138")]; + tensor reshape_51_cast_fp16 = reshape(shape = concat_51, x = transpose_51_cast_fp16)[name = tensor("reshape_51_cast_fp16")]; + tensor v_51_perm_0 = const()[name = tensor("v_51_perm_0"), val = tensor([1, 0, -2, -1])]; + tensor var_2194_transpose_x_0 = const()[name = tensor("op_2194_transpose_x_0"), val = tensor(false)]; + tensor var_2194_transpose_y_0 = const()[name = tensor("op_2194_transpose_y_0"), val = tensor(false)]; + tensor transpose_137_cast_fp16 = transpose(perm = transpose_137_perm_0, x = reshape_49_cast_fp16)[name = tensor("transpose_137")]; + tensor var_2194_cast_fp16 = matmul(transpose_x = var_2194_transpose_x_0, transpose_y = var_2194_transpose_y_0, x = q_25_cast_fp16, y = transpose_137_cast_fp16)[name = tensor("op_2194_cast_fp16")]; + tensor var_2195_to_fp16 = const()[name = tensor("op_2195_to_fp16"), val = tensor(0x1.6ap-4)]; + tensor attn_49_cast_fp16 = mul(x = var_2194_cast_fp16, y = var_2195_to_fp16)[name = tensor("attn_49_cast_fp16")]; + tensor input_121_cast_fp16 = add(x = attn_49_cast_fp16, y = causal_mask_to_fp16_palettized)[name = tensor("input_121_cast_fp16")]; + tensor attn_51_cast_fp16 = softmax(axis = var_2078, x = input_121_cast_fp16)[name = tensor("attn_51_cast_fp16")]; + tensor var_2199_transpose_x_0 = const()[name = tensor("op_2199_transpose_x_0"), val = tensor(false)]; + tensor var_2199_transpose_y_0 = const()[name = tensor("op_2199_transpose_y_0"), val = tensor(false)]; + tensor v_51_cast_fp16 = transpose(perm = v_51_perm_0, x = reshape_51_cast_fp16)[name = tensor("transpose_136")]; + tensor var_2199_cast_fp16 = matmul(transpose_x = var_2199_transpose_x_0, transpose_y = var_2199_transpose_y_0, x = attn_51_cast_fp16, y = v_51_cast_fp16)[name = tensor("op_2199_cast_fp16")]; + tensor var_2200_perm_0 = const()[name = tensor("op_2200_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor var_2201 = const()[name = tensor("op_2201"), val = tensor([1, 768, 2048])]; + tensor var_2200_cast_fp16 = transpose(perm = var_2200_perm_0, x = var_2199_cast_fp16)[name = tensor("transpose_135")]; + tensor input_123_cast_fp16 = reshape(shape = var_2201, x = var_2200_cast_fp16)[name = tensor("input_123_cast_fp16")]; + tensor layers_12_self_attn_o_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(193757376))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(195854592))), name = tensor("layers_12_self_attn_o_proj_weight_to_fp16_palettized"), shape = tensor([1024, 2048])]; + tensor linear_87_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_12_self_attn_o_proj_weight_to_fp16_palettized, x = input_123_cast_fp16)[name = tensor("linear_87_cast_fp16")]; + tensor x_281_cast_fp16 = add(x = x_263_cast_fp16, y = linear_87_cast_fp16)[name = tensor("x_281_cast_fp16")]; + tensor var_2077_promoted_3_to_fp16 = const()[name = tensor("op_2077_promoted_3_to_fp16"), val = tensor(0x1p+1)]; + tensor var_2208_cast_fp16 = pow(x = x_281_cast_fp16, y = var_2077_promoted_3_to_fp16)[name = tensor("op_2208_cast_fp16")]; + tensor var_2210_axes_0 = const()[name = tensor("op_2210_axes_0"), val = tensor([-1])]; + tensor var_2210_keep_dims_0 = const()[name = tensor("op_2210_keep_dims_0"), val = tensor(true)]; + tensor var_2210_cast_fp16 = reduce_mean(axes = var_2210_axes_0, keep_dims = var_2210_keep_dims_0, x = var_2208_cast_fp16)[name = tensor("op_2210_cast_fp16")]; + tensor var_2211_to_fp16 = const()[name = tensor("op_2211_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_2212_cast_fp16 = add(x = var_2210_cast_fp16, y = var_2211_to_fp16)[name = tensor("op_2212_cast_fp16")]; + tensor norm_103_epsilon_0 = const()[name = tensor("norm_103_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_103_cast_fp16 = rsqrt(epsilon = norm_103_epsilon_0, x = var_2212_cast_fp16)[name = tensor("norm_103_cast_fp16")]; + tensor var_2214_cast_fp16 = mul(x = x_281_cast_fp16, y = norm_103_cast_fp16)[name = tensor("op_2214_cast_fp16")]; + tensor layers_12_post_attention_layernorm_weight_to_fp16 = const()[name = tensor("layers_12_post_attention_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(195855168)))]; + tensor var_2215_cast_fp16 = mul(x = var_2214_cast_fp16, y = layers_12_post_attention_layernorm_weight_to_fp16)[name = tensor("op_2215_cast_fp16")]; + tensor layers_12_mlp_gate_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(195857280))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(199003072))), name = tensor("layers_12_mlp_gate_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_88_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_12_mlp_gate_proj_weight_to_fp16_palettized, x = var_2215_cast_fp16)[name = tensor("linear_88_cast_fp16")]; + tensor var_2225_cast_fp16 = silu(x = linear_88_cast_fp16)[name = tensor("op_2225_cast_fp16")]; + tensor layers_12_mlp_up_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(199003648))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(202149440))), name = tensor("layers_12_mlp_up_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_89_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_12_mlp_up_proj_weight_to_fp16_palettized, x = var_2215_cast_fp16)[name = tensor("linear_89_cast_fp16")]; + tensor input_129_cast_fp16 = mul(x = var_2225_cast_fp16, y = linear_89_cast_fp16)[name = tensor("input_129_cast_fp16")]; + tensor layers_12_mlp_down_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(202150016))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(205295808))), name = tensor("layers_12_mlp_down_proj_weight_to_fp16_palettized"), shape = tensor([1024, 3072])]; + tensor linear_90_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_12_mlp_down_proj_weight_to_fp16_palettized, x = input_129_cast_fp16)[name = tensor("linear_90_cast_fp16")]; + tensor x_285_cast_fp16 = add(x = x_281_cast_fp16, y = linear_90_cast_fp16)[name = tensor("x_285_cast_fp16")]; + tensor var_2245 = const()[name = tensor("op_2245"), val = tensor(-1)]; + tensor var_2244_promoted_to_fp16 = const()[name = tensor("op_2244_promoted_to_fp16"), val = tensor(0x1p+1)]; + tensor var_2254_cast_fp16 = pow(x = x_285_cast_fp16, y = var_2244_promoted_to_fp16)[name = tensor("op_2254_cast_fp16")]; + tensor var_2256_axes_0 = const()[name = tensor("op_2256_axes_0"), val = tensor([-1])]; + tensor var_2256_keep_dims_0 = const()[name = tensor("op_2256_keep_dims_0"), val = tensor(true)]; + tensor var_2256_cast_fp16 = reduce_mean(axes = var_2256_axes_0, keep_dims = var_2256_keep_dims_0, x = var_2254_cast_fp16)[name = tensor("op_2256_cast_fp16")]; + tensor var_2257_to_fp16 = const()[name = tensor("op_2257_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_2258_cast_fp16 = add(x = var_2256_cast_fp16, y = var_2257_to_fp16)[name = tensor("op_2258_cast_fp16")]; + tensor norm_105_epsilon_0 = const()[name = tensor("norm_105_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_105_cast_fp16 = rsqrt(epsilon = norm_105_epsilon_0, x = var_2258_cast_fp16)[name = tensor("norm_105_cast_fp16")]; + tensor var_2260_cast_fp16 = mul(x = x_285_cast_fp16, y = norm_105_cast_fp16)[name = tensor("op_2260_cast_fp16")]; + tensor layers_13_input_layernorm_weight_to_fp16 = const()[name = tensor("layers_13_input_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(205296384)))]; + tensor var_2261_cast_fp16 = mul(x = var_2260_cast_fp16, y = layers_13_input_layernorm_weight_to_fp16)[name = tensor("op_2261_cast_fp16")]; + tensor layers_13_self_attn_q_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(205298496))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(207395712))), name = tensor("layers_13_self_attn_q_proj_weight_to_fp16_palettized"), shape = tensor([2048, 1024])]; + tensor linear_91_cast_fp16 = linear(bias = linear_0_bias_0_to_fp16, weight = layers_13_self_attn_q_proj_weight_to_fp16_palettized, x = var_2261_cast_fp16)[name = tensor("linear_91_cast_fp16")]; + tensor var_2277 = const()[name = tensor("op_2277"), val = tensor([1, 768, 16, 128])]; + tensor var_2278_cast_fp16 = reshape(shape = var_2277, x = linear_91_cast_fp16)[name = tensor("op_2278_cast_fp16")]; + tensor x_291_perm_0 = const()[name = tensor("x_291_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_13_self_attn_k_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(207396288))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(208444928))), name = tensor("layers_13_self_attn_k_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_92_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_13_self_attn_k_proj_weight_to_fp16_palettized, x = var_2261_cast_fp16)[name = tensor("linear_92_cast_fp16")]; + tensor var_2282 = const()[name = tensor("op_2282"), val = tensor([1, 768, 8, 128])]; + tensor var_2283_cast_fp16 = reshape(shape = var_2282, x = linear_92_cast_fp16)[name = tensor("op_2283_cast_fp16")]; + tensor x_295_perm_0 = const()[name = tensor("x_295_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_13_self_attn_v_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(208445504))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(209494144))), name = tensor("layers_13_self_attn_v_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_93_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_13_self_attn_v_proj_weight_to_fp16_palettized, x = var_2261_cast_fp16)[name = tensor("linear_93_cast_fp16")]; + tensor var_2287 = const()[name = tensor("op_2287"), val = tensor([1, 768, 8, 128])]; + tensor var_2288_cast_fp16 = reshape(shape = var_2287, x = linear_93_cast_fp16)[name = tensor("op_2288_cast_fp16")]; + tensor transpose_138_perm_0 = const()[name = tensor("transpose_138_perm_0"), val = tensor([2, 0, 1, 3])]; + tensor var_2244_promoted_1_to_fp16 = const()[name = tensor("op_2244_promoted_1_to_fp16"), val = tensor(0x1p+1)]; + tensor x_291_cast_fp16 = transpose(perm = x_291_perm_0, x = var_2278_cast_fp16)[name = tensor("transpose_134")]; + tensor var_2292_cast_fp16 = pow(x = x_291_cast_fp16, y = var_2244_promoted_1_to_fp16)[name = tensor("op_2292_cast_fp16")]; + tensor var_2294_axes_0 = const()[name = tensor("op_2294_axes_0"), val = tensor([-1])]; + tensor var_2294_keep_dims_0 = const()[name = tensor("op_2294_keep_dims_0"), val = tensor(true)]; + tensor var_2294_cast_fp16 = reduce_mean(axes = var_2294_axes_0, keep_dims = var_2294_keep_dims_0, x = var_2292_cast_fp16)[name = tensor("op_2294_cast_fp16")]; + tensor var_2295_to_fp16 = const()[name = tensor("op_2295_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_2296_cast_fp16 = add(x = var_2294_cast_fp16, y = var_2295_to_fp16)[name = tensor("op_2296_cast_fp16")]; + tensor norm_107_epsilon_0 = const()[name = tensor("norm_107_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_107_cast_fp16 = rsqrt(epsilon = norm_107_epsilon_0, x = var_2296_cast_fp16)[name = tensor("norm_107_cast_fp16")]; + tensor var_2298_cast_fp16 = mul(x = x_291_cast_fp16, y = norm_107_cast_fp16)[name = tensor("op_2298_cast_fp16")]; + tensor layers_13_self_attn_q_norm_weight_to_fp16 = const()[name = tensor("layers_13_self_attn_q_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(209494720)))]; + tensor var_2299_cast_fp16 = mul(x = var_2298_cast_fp16, y = layers_13_self_attn_q_norm_weight_to_fp16)[name = tensor("op_2299_cast_fp16")]; + tensor var_2244_promoted_2_to_fp16 = const()[name = tensor("op_2244_promoted_2_to_fp16"), val = tensor(0x1p+1)]; + tensor x_295_cast_fp16 = transpose(perm = x_295_perm_0, x = var_2283_cast_fp16)[name = tensor("transpose_133")]; + tensor var_2303_cast_fp16 = pow(x = x_295_cast_fp16, y = var_2244_promoted_2_to_fp16)[name = tensor("op_2303_cast_fp16")]; + tensor var_2305_axes_0 = const()[name = tensor("op_2305_axes_0"), val = tensor([-1])]; + tensor var_2305_keep_dims_0 = const()[name = tensor("op_2305_keep_dims_0"), val = tensor(true)]; + tensor var_2305_cast_fp16 = reduce_mean(axes = var_2305_axes_0, keep_dims = var_2305_keep_dims_0, x = var_2303_cast_fp16)[name = tensor("op_2305_cast_fp16")]; + tensor var_2306_to_fp16 = const()[name = tensor("op_2306_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_2307_cast_fp16 = add(x = var_2305_cast_fp16, y = var_2306_to_fp16)[name = tensor("op_2307_cast_fp16")]; + tensor norm_109_epsilon_0 = const()[name = tensor("norm_109_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_109_cast_fp16 = rsqrt(epsilon = norm_109_epsilon_0, x = var_2307_cast_fp16)[name = tensor("norm_109_cast_fp16")]; + tensor var_2309_cast_fp16 = mul(x = x_295_cast_fp16, y = norm_109_cast_fp16)[name = tensor("op_2309_cast_fp16")]; + tensor layers_13_self_attn_k_norm_weight_to_fp16 = const()[name = tensor("layers_13_self_attn_k_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(209495040)))]; + tensor var_2310_cast_fp16 = mul(x = var_2309_cast_fp16, y = layers_13_self_attn_k_norm_weight_to_fp16)[name = tensor("op_2310_cast_fp16")]; + tensor x1_53_begin_0 = const()[name = tensor("x1_53_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_53_end_0 = const()[name = tensor("x1_53_end_0"), val = tensor([1, 16, 768, 64])]; + tensor x1_53_end_mask_0 = const()[name = tensor("x1_53_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_53_cast_fp16 = slice_by_index(begin = x1_53_begin_0, end = x1_53_end_0, end_mask = x1_53_end_mask_0, x = var_2299_cast_fp16)[name = tensor("x1_53_cast_fp16")]; + tensor x2_53_begin_0 = const()[name = tensor("x2_53_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_53_end_0 = const()[name = tensor("x2_53_end_0"), val = tensor([1, 16, 768, 128])]; + tensor x2_53_end_mask_0 = const()[name = tensor("x2_53_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_53_cast_fp16 = slice_by_index(begin = x2_53_begin_0, end = x2_53_end_0, end_mask = x2_53_end_mask_0, x = var_2299_cast_fp16)[name = tensor("x2_53_cast_fp16")]; + tensor var_2327_cast_fp16 = mul(x = x1_53_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_2327_cast_fp16")]; + tensor var_2328_cast_fp16 = mul(x = x2_53_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_2328_cast_fp16")]; + tensor var_2329_cast_fp16 = sub(x = var_2327_cast_fp16, y = var_2328_cast_fp16)[name = tensor("op_2329_cast_fp16")]; + tensor var_2330_cast_fp16 = mul(x = x2_53_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_2330_cast_fp16")]; + tensor var_2331_cast_fp16 = mul(x = x1_53_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_2331_cast_fp16")]; + tensor var_2332_cast_fp16 = add(x = var_2330_cast_fp16, y = var_2331_cast_fp16)[name = tensor("op_2332_cast_fp16")]; + tensor q_27_interleave_0 = const()[name = tensor("q_27_interleave_0"), val = tensor(false)]; + tensor q_27_cast_fp16 = concat(axis = var_2245, interleave = q_27_interleave_0, values = (var_2329_cast_fp16, var_2332_cast_fp16))[name = tensor("q_27_cast_fp16")]; + tensor x1_55_begin_0 = const()[name = tensor("x1_55_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_55_end_0 = const()[name = tensor("x1_55_end_0"), val = tensor([1, 8, 768, 64])]; + tensor x1_55_end_mask_0 = const()[name = tensor("x1_55_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_55_cast_fp16 = slice_by_index(begin = x1_55_begin_0, end = x1_55_end_0, end_mask = x1_55_end_mask_0, x = var_2310_cast_fp16)[name = tensor("x1_55_cast_fp16")]; + tensor x2_55_begin_0 = const()[name = tensor("x2_55_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_55_end_0 = const()[name = tensor("x2_55_end_0"), val = tensor([1, 8, 768, 128])]; + tensor x2_55_end_mask_0 = const()[name = tensor("x2_55_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_55_cast_fp16 = slice_by_index(begin = x2_55_begin_0, end = x2_55_end_0, end_mask = x2_55_end_mask_0, x = var_2310_cast_fp16)[name = tensor("x2_55_cast_fp16")]; + tensor var_2350_cast_fp16 = mul(x = x1_55_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_2350_cast_fp16")]; + tensor var_2351_cast_fp16 = mul(x = x2_55_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_2351_cast_fp16")]; + tensor var_2352_cast_fp16 = sub(x = var_2350_cast_fp16, y = var_2351_cast_fp16)[name = tensor("op_2352_cast_fp16")]; + tensor var_2353_cast_fp16 = mul(x = x2_55_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_2353_cast_fp16")]; + tensor var_2354_cast_fp16 = mul(x = x1_55_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_2354_cast_fp16")]; + tensor var_2355_cast_fp16 = add(x = var_2353_cast_fp16, y = var_2354_cast_fp16)[name = tensor("op_2355_cast_fp16")]; + tensor k_53_interleave_0 = const()[name = tensor("k_53_interleave_0"), val = tensor(false)]; + tensor k_53_cast_fp16 = concat(axis = var_2245, interleave = k_53_interleave_0, values = (var_2352_cast_fp16, var_2355_cast_fp16))[name = tensor("k_53_cast_fp16")]; + tensor transpose_52_perm_0 = const()[name = tensor("transpose_52_perm_0"), val = tensor([1, 0, 2, 3])]; + tensor tile_26_reps_0 = const()[name = tensor("tile_26_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_52_cast_fp16 = transpose(perm = transpose_52_perm_0, x = k_53_cast_fp16)[name = tensor("transpose_132")]; + tensor tile_26_cast_fp16 = tile(reps = tile_26_reps_0, x = transpose_52_cast_fp16)[name = tensor("tile_26_cast_fp16")]; + tensor concat_52 = const()[name = tensor("concat_52"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_52_cast_fp16 = reshape(shape = concat_52, x = tile_26_cast_fp16)[name = tensor("reshape_52_cast_fp16")]; + tensor transpose_53_perm_0 = const()[name = tensor("transpose_53_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_53 = const()[name = tensor("concat_53"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_53_cast_fp16 = transpose(perm = transpose_53_perm_0, x = reshape_52_cast_fp16)[name = tensor("transpose_131")]; + tensor reshape_53_cast_fp16 = reshape(shape = concat_53, x = transpose_53_cast_fp16)[name = tensor("reshape_53_cast_fp16")]; + tensor transpose_139_perm_0 = const()[name = tensor("transpose_139_perm_0"), val = tensor([1, 0, -1, -2])]; + tensor tile_27_reps_0 = const()[name = tensor("tile_27_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_138_cast_fp16 = transpose(perm = transpose_138_perm_0, x = var_2288_cast_fp16)[name = tensor("transpose_130")]; + tensor tile_27_cast_fp16 = tile(reps = tile_27_reps_0, x = transpose_138_cast_fp16)[name = tensor("tile_27_cast_fp16")]; + tensor concat_54 = const()[name = tensor("concat_54"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_54_cast_fp16 = reshape(shape = concat_54, x = tile_27_cast_fp16)[name = tensor("reshape_54_cast_fp16")]; + tensor transpose_55_perm_0 = const()[name = tensor("transpose_55_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_55 = const()[name = tensor("concat_55"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_55_cast_fp16 = transpose(perm = transpose_55_perm_0, x = reshape_54_cast_fp16)[name = tensor("transpose_129")]; + tensor reshape_55_cast_fp16 = reshape(shape = concat_55, x = transpose_55_cast_fp16)[name = tensor("reshape_55_cast_fp16")]; + tensor v_55_perm_0 = const()[name = tensor("v_55_perm_0"), val = tensor([1, 0, -2, -1])]; + tensor var_2361_transpose_x_0 = const()[name = tensor("op_2361_transpose_x_0"), val = tensor(false)]; + tensor var_2361_transpose_y_0 = const()[name = tensor("op_2361_transpose_y_0"), val = tensor(false)]; + tensor transpose_139_cast_fp16 = transpose(perm = transpose_139_perm_0, x = reshape_53_cast_fp16)[name = tensor("transpose_128")]; + tensor var_2361_cast_fp16 = matmul(transpose_x = var_2361_transpose_x_0, transpose_y = var_2361_transpose_y_0, x = q_27_cast_fp16, y = transpose_139_cast_fp16)[name = tensor("op_2361_cast_fp16")]; + tensor var_2362_to_fp16 = const()[name = tensor("op_2362_to_fp16"), val = tensor(0x1.6ap-4)]; + tensor attn_53_cast_fp16 = mul(x = var_2361_cast_fp16, y = var_2362_to_fp16)[name = tensor("attn_53_cast_fp16")]; + tensor input_131_cast_fp16 = add(x = attn_53_cast_fp16, y = causal_mask_to_fp16_palettized)[name = tensor("input_131_cast_fp16")]; + tensor attn_55_cast_fp16 = softmax(axis = var_2245, x = input_131_cast_fp16)[name = tensor("attn_55_cast_fp16")]; + tensor var_2366_transpose_x_0 = const()[name = tensor("op_2366_transpose_x_0"), val = tensor(false)]; + tensor var_2366_transpose_y_0 = const()[name = tensor("op_2366_transpose_y_0"), val = tensor(false)]; + tensor v_55_cast_fp16 = transpose(perm = v_55_perm_0, x = reshape_55_cast_fp16)[name = tensor("transpose_127")]; + tensor var_2366_cast_fp16 = matmul(transpose_x = var_2366_transpose_x_0, transpose_y = var_2366_transpose_y_0, x = attn_55_cast_fp16, y = v_55_cast_fp16)[name = tensor("op_2366_cast_fp16")]; + tensor var_2367_perm_0 = const()[name = tensor("op_2367_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor var_2368 = const()[name = tensor("op_2368"), val = tensor([1, 768, 2048])]; + tensor var_2367_cast_fp16 = transpose(perm = var_2367_perm_0, x = var_2366_cast_fp16)[name = tensor("transpose_126")]; + tensor input_133_cast_fp16 = reshape(shape = var_2368, x = var_2367_cast_fp16)[name = tensor("input_133_cast_fp16")]; + tensor layers_13_self_attn_o_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(209495360))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(211592576))), name = tensor("layers_13_self_attn_o_proj_weight_to_fp16_palettized"), shape = tensor([1024, 2048])]; + tensor linear_94_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_13_self_attn_o_proj_weight_to_fp16_palettized, x = input_133_cast_fp16)[name = tensor("linear_94_cast_fp16")]; + tensor x_303_cast_fp16 = add(x = x_285_cast_fp16, y = linear_94_cast_fp16)[name = tensor("x_303_cast_fp16")]; + tensor var_2244_promoted_3_to_fp16 = const()[name = tensor("op_2244_promoted_3_to_fp16"), val = tensor(0x1p+1)]; + tensor var_2375_cast_fp16 = pow(x = x_303_cast_fp16, y = var_2244_promoted_3_to_fp16)[name = tensor("op_2375_cast_fp16")]; + tensor var_2377_axes_0 = const()[name = tensor("op_2377_axes_0"), val = tensor([-1])]; + tensor var_2377_keep_dims_0 = const()[name = tensor("op_2377_keep_dims_0"), val = tensor(true)]; + tensor var_2377_cast_fp16 = reduce_mean(axes = var_2377_axes_0, keep_dims = var_2377_keep_dims_0, x = var_2375_cast_fp16)[name = tensor("op_2377_cast_fp16")]; + tensor var_2378_to_fp16 = const()[name = tensor("op_2378_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_2379_cast_fp16 = add(x = var_2377_cast_fp16, y = var_2378_to_fp16)[name = tensor("op_2379_cast_fp16")]; + tensor norm_111_epsilon_0 = const()[name = tensor("norm_111_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_111_cast_fp16 = rsqrt(epsilon = norm_111_epsilon_0, x = var_2379_cast_fp16)[name = tensor("norm_111_cast_fp16")]; + tensor var_2381_cast_fp16 = mul(x = x_303_cast_fp16, y = norm_111_cast_fp16)[name = tensor("op_2381_cast_fp16")]; + tensor layers_13_post_attention_layernorm_weight_to_fp16 = const()[name = tensor("layers_13_post_attention_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(211593152)))]; + tensor var_2382_cast_fp16 = mul(x = var_2381_cast_fp16, y = layers_13_post_attention_layernorm_weight_to_fp16)[name = tensor("op_2382_cast_fp16")]; + tensor layers_13_mlp_gate_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(211595264))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(214741056))), name = tensor("layers_13_mlp_gate_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_95_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_13_mlp_gate_proj_weight_to_fp16_palettized, x = var_2382_cast_fp16)[name = tensor("linear_95_cast_fp16")]; + tensor var_2392_cast_fp16 = silu(x = linear_95_cast_fp16)[name = tensor("op_2392_cast_fp16")]; + tensor layers_13_mlp_up_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(214741632))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(217887424))), name = tensor("layers_13_mlp_up_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_96_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_13_mlp_up_proj_weight_to_fp16_palettized, x = var_2382_cast_fp16)[name = tensor("linear_96_cast_fp16")]; + tensor input_139_cast_fp16 = mul(x = var_2392_cast_fp16, y = linear_96_cast_fp16)[name = tensor("input_139_cast_fp16")]; + tensor layers_13_mlp_down_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(217888000))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(221033792))), name = tensor("layers_13_mlp_down_proj_weight_to_fp16_palettized"), shape = tensor([1024, 3072])]; + tensor linear_97_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_13_mlp_down_proj_weight_to_fp16_palettized, x = input_139_cast_fp16)[name = tensor("linear_97_cast_fp16")]; + tensor x_307_cast_fp16 = add(x = x_303_cast_fp16, y = linear_97_cast_fp16)[name = tensor("x_307_cast_fp16")]; + tensor var_2412 = const()[name = tensor("op_2412"), val = tensor(-1)]; + tensor var_2411_promoted_to_fp16 = const()[name = tensor("op_2411_promoted_to_fp16"), val = tensor(0x1p+1)]; + tensor var_2421_cast_fp16 = pow(x = x_307_cast_fp16, y = var_2411_promoted_to_fp16)[name = tensor("op_2421_cast_fp16")]; + tensor var_2423_axes_0 = const()[name = tensor("op_2423_axes_0"), val = tensor([-1])]; + tensor var_2423_keep_dims_0 = const()[name = tensor("op_2423_keep_dims_0"), val = tensor(true)]; + tensor var_2423_cast_fp16 = reduce_mean(axes = var_2423_axes_0, keep_dims = var_2423_keep_dims_0, x = var_2421_cast_fp16)[name = tensor("op_2423_cast_fp16")]; + tensor var_2424_to_fp16 = const()[name = tensor("op_2424_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_2425_cast_fp16 = add(x = var_2423_cast_fp16, y = var_2424_to_fp16)[name = tensor("op_2425_cast_fp16")]; + tensor norm_113_epsilon_0 = const()[name = tensor("norm_113_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_113_cast_fp16 = rsqrt(epsilon = norm_113_epsilon_0, x = var_2425_cast_fp16)[name = tensor("norm_113_cast_fp16")]; + tensor var_2427_cast_fp16 = mul(x = x_307_cast_fp16, y = norm_113_cast_fp16)[name = tensor("op_2427_cast_fp16")]; + tensor layers_14_input_layernorm_weight_to_fp16 = const()[name = tensor("layers_14_input_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(221034368)))]; + tensor var_2428_cast_fp16 = mul(x = var_2427_cast_fp16, y = layers_14_input_layernorm_weight_to_fp16)[name = tensor("op_2428_cast_fp16")]; + tensor layers_14_self_attn_q_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(221036480))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(223133696))), name = tensor("layers_14_self_attn_q_proj_weight_to_fp16_palettized"), shape = tensor([2048, 1024])]; + tensor linear_98_cast_fp16 = linear(bias = linear_0_bias_0_to_fp16, weight = layers_14_self_attn_q_proj_weight_to_fp16_palettized, x = var_2428_cast_fp16)[name = tensor("linear_98_cast_fp16")]; + tensor var_2444 = const()[name = tensor("op_2444"), val = tensor([1, 768, 16, 128])]; + tensor var_2445_cast_fp16 = reshape(shape = var_2444, x = linear_98_cast_fp16)[name = tensor("op_2445_cast_fp16")]; + tensor x_313_perm_0 = const()[name = tensor("x_313_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_14_self_attn_k_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(223134272))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(224182912))), name = tensor("layers_14_self_attn_k_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_99_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_14_self_attn_k_proj_weight_to_fp16_palettized, x = var_2428_cast_fp16)[name = tensor("linear_99_cast_fp16")]; + tensor var_2449 = const()[name = tensor("op_2449"), val = tensor([1, 768, 8, 128])]; + tensor var_2450_cast_fp16 = reshape(shape = var_2449, x = linear_99_cast_fp16)[name = tensor("op_2450_cast_fp16")]; + tensor x_317_perm_0 = const()[name = tensor("x_317_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_14_self_attn_v_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(224183488))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(225232128))), name = tensor("layers_14_self_attn_v_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_100_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_14_self_attn_v_proj_weight_to_fp16_palettized, x = var_2428_cast_fp16)[name = tensor("linear_100_cast_fp16")]; + tensor var_2454 = const()[name = tensor("op_2454"), val = tensor([1, 768, 8, 128])]; + tensor var_2455_cast_fp16 = reshape(shape = var_2454, x = linear_100_cast_fp16)[name = tensor("op_2455_cast_fp16")]; + tensor transpose_140_perm_0 = const()[name = tensor("transpose_140_perm_0"), val = tensor([2, 0, 1, 3])]; + tensor var_2411_promoted_1_to_fp16 = const()[name = tensor("op_2411_promoted_1_to_fp16"), val = tensor(0x1p+1)]; + tensor x_313_cast_fp16 = transpose(perm = x_313_perm_0, x = var_2445_cast_fp16)[name = tensor("transpose_125")]; + tensor var_2459_cast_fp16 = pow(x = x_313_cast_fp16, y = var_2411_promoted_1_to_fp16)[name = tensor("op_2459_cast_fp16")]; + tensor var_2461_axes_0 = const()[name = tensor("op_2461_axes_0"), val = tensor([-1])]; + tensor var_2461_keep_dims_0 = const()[name = tensor("op_2461_keep_dims_0"), val = tensor(true)]; + tensor var_2461_cast_fp16 = reduce_mean(axes = var_2461_axes_0, keep_dims = var_2461_keep_dims_0, x = var_2459_cast_fp16)[name = tensor("op_2461_cast_fp16")]; + tensor var_2462_to_fp16 = const()[name = tensor("op_2462_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_2463_cast_fp16 = add(x = var_2461_cast_fp16, y = var_2462_to_fp16)[name = tensor("op_2463_cast_fp16")]; + tensor norm_115_epsilon_0 = const()[name = tensor("norm_115_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_115_cast_fp16 = rsqrt(epsilon = norm_115_epsilon_0, x = var_2463_cast_fp16)[name = tensor("norm_115_cast_fp16")]; + tensor var_2465_cast_fp16 = mul(x = x_313_cast_fp16, y = norm_115_cast_fp16)[name = tensor("op_2465_cast_fp16")]; + tensor layers_14_self_attn_q_norm_weight_to_fp16 = const()[name = tensor("layers_14_self_attn_q_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(225232704)))]; + tensor var_2466_cast_fp16 = mul(x = var_2465_cast_fp16, y = layers_14_self_attn_q_norm_weight_to_fp16)[name = tensor("op_2466_cast_fp16")]; + tensor var_2411_promoted_2_to_fp16 = const()[name = tensor("op_2411_promoted_2_to_fp16"), val = tensor(0x1p+1)]; + tensor x_317_cast_fp16 = transpose(perm = x_317_perm_0, x = var_2450_cast_fp16)[name = tensor("transpose_124")]; + tensor var_2470_cast_fp16 = pow(x = x_317_cast_fp16, y = var_2411_promoted_2_to_fp16)[name = tensor("op_2470_cast_fp16")]; + tensor var_2472_axes_0 = const()[name = tensor("op_2472_axes_0"), val = tensor([-1])]; + tensor var_2472_keep_dims_0 = const()[name = tensor("op_2472_keep_dims_0"), val = tensor(true)]; + tensor var_2472_cast_fp16 = reduce_mean(axes = var_2472_axes_0, keep_dims = var_2472_keep_dims_0, x = var_2470_cast_fp16)[name = tensor("op_2472_cast_fp16")]; + tensor var_2473_to_fp16 = const()[name = tensor("op_2473_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_2474_cast_fp16 = add(x = var_2472_cast_fp16, y = var_2473_to_fp16)[name = tensor("op_2474_cast_fp16")]; + tensor norm_117_epsilon_0 = const()[name = tensor("norm_117_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_117_cast_fp16 = rsqrt(epsilon = norm_117_epsilon_0, x = var_2474_cast_fp16)[name = tensor("norm_117_cast_fp16")]; + tensor var_2476_cast_fp16 = mul(x = x_317_cast_fp16, y = norm_117_cast_fp16)[name = tensor("op_2476_cast_fp16")]; + tensor layers_14_self_attn_k_norm_weight_to_fp16 = const()[name = tensor("layers_14_self_attn_k_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(225233024)))]; + tensor var_2477_cast_fp16 = mul(x = var_2476_cast_fp16, y = layers_14_self_attn_k_norm_weight_to_fp16)[name = tensor("op_2477_cast_fp16")]; + tensor x1_57_begin_0 = const()[name = tensor("x1_57_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_57_end_0 = const()[name = tensor("x1_57_end_0"), val = tensor([1, 16, 768, 64])]; + tensor x1_57_end_mask_0 = const()[name = tensor("x1_57_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_57_cast_fp16 = slice_by_index(begin = x1_57_begin_0, end = x1_57_end_0, end_mask = x1_57_end_mask_0, x = var_2466_cast_fp16)[name = tensor("x1_57_cast_fp16")]; + tensor x2_57_begin_0 = const()[name = tensor("x2_57_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_57_end_0 = const()[name = tensor("x2_57_end_0"), val = tensor([1, 16, 768, 128])]; + tensor x2_57_end_mask_0 = const()[name = tensor("x2_57_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_57_cast_fp16 = slice_by_index(begin = x2_57_begin_0, end = x2_57_end_0, end_mask = x2_57_end_mask_0, x = var_2466_cast_fp16)[name = tensor("x2_57_cast_fp16")]; + tensor var_2494_cast_fp16 = mul(x = x1_57_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_2494_cast_fp16")]; + tensor var_2495_cast_fp16 = mul(x = x2_57_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_2495_cast_fp16")]; + tensor var_2496_cast_fp16 = sub(x = var_2494_cast_fp16, y = var_2495_cast_fp16)[name = tensor("op_2496_cast_fp16")]; + tensor var_2497_cast_fp16 = mul(x = x2_57_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_2497_cast_fp16")]; + tensor var_2498_cast_fp16 = mul(x = x1_57_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_2498_cast_fp16")]; + tensor var_2499_cast_fp16 = add(x = var_2497_cast_fp16, y = var_2498_cast_fp16)[name = tensor("op_2499_cast_fp16")]; + tensor q_29_interleave_0 = const()[name = tensor("q_29_interleave_0"), val = tensor(false)]; + tensor q_29_cast_fp16 = concat(axis = var_2412, interleave = q_29_interleave_0, values = (var_2496_cast_fp16, var_2499_cast_fp16))[name = tensor("q_29_cast_fp16")]; + tensor x1_59_begin_0 = const()[name = tensor("x1_59_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_59_end_0 = const()[name = tensor("x1_59_end_0"), val = tensor([1, 8, 768, 64])]; + tensor x1_59_end_mask_0 = const()[name = tensor("x1_59_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_59_cast_fp16 = slice_by_index(begin = x1_59_begin_0, end = x1_59_end_0, end_mask = x1_59_end_mask_0, x = var_2477_cast_fp16)[name = tensor("x1_59_cast_fp16")]; + tensor x2_59_begin_0 = const()[name = tensor("x2_59_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_59_end_0 = const()[name = tensor("x2_59_end_0"), val = tensor([1, 8, 768, 128])]; + tensor x2_59_end_mask_0 = const()[name = tensor("x2_59_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_59_cast_fp16 = slice_by_index(begin = x2_59_begin_0, end = x2_59_end_0, end_mask = x2_59_end_mask_0, x = var_2477_cast_fp16)[name = tensor("x2_59_cast_fp16")]; + tensor var_2517_cast_fp16 = mul(x = x1_59_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_2517_cast_fp16")]; + tensor var_2518_cast_fp16 = mul(x = x2_59_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_2518_cast_fp16")]; + tensor var_2519_cast_fp16 = sub(x = var_2517_cast_fp16, y = var_2518_cast_fp16)[name = tensor("op_2519_cast_fp16")]; + tensor var_2520_cast_fp16 = mul(x = x2_59_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_2520_cast_fp16")]; + tensor var_2521_cast_fp16 = mul(x = x1_59_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_2521_cast_fp16")]; + tensor var_2522_cast_fp16 = add(x = var_2520_cast_fp16, y = var_2521_cast_fp16)[name = tensor("op_2522_cast_fp16")]; + tensor k_57_interleave_0 = const()[name = tensor("k_57_interleave_0"), val = tensor(false)]; + tensor k_57_cast_fp16 = concat(axis = var_2412, interleave = k_57_interleave_0, values = (var_2519_cast_fp16, var_2522_cast_fp16))[name = tensor("k_57_cast_fp16")]; + tensor transpose_56_perm_0 = const()[name = tensor("transpose_56_perm_0"), val = tensor([1, 0, 2, 3])]; + tensor tile_28_reps_0 = const()[name = tensor("tile_28_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_56_cast_fp16 = transpose(perm = transpose_56_perm_0, x = k_57_cast_fp16)[name = tensor("transpose_123")]; + tensor tile_28_cast_fp16 = tile(reps = tile_28_reps_0, x = transpose_56_cast_fp16)[name = tensor("tile_28_cast_fp16")]; + tensor concat_56 = const()[name = tensor("concat_56"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_56_cast_fp16 = reshape(shape = concat_56, x = tile_28_cast_fp16)[name = tensor("reshape_56_cast_fp16")]; + tensor transpose_57_perm_0 = const()[name = tensor("transpose_57_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_57 = const()[name = tensor("concat_57"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_57_cast_fp16 = transpose(perm = transpose_57_perm_0, x = reshape_56_cast_fp16)[name = tensor("transpose_122")]; + tensor reshape_57_cast_fp16 = reshape(shape = concat_57, x = transpose_57_cast_fp16)[name = tensor("reshape_57_cast_fp16")]; + tensor transpose_141_perm_0 = const()[name = tensor("transpose_141_perm_0"), val = tensor([1, 0, -1, -2])]; + tensor tile_29_reps_0 = const()[name = tensor("tile_29_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_140_cast_fp16 = transpose(perm = transpose_140_perm_0, x = var_2455_cast_fp16)[name = tensor("transpose_121")]; + tensor tile_29_cast_fp16 = tile(reps = tile_29_reps_0, x = transpose_140_cast_fp16)[name = tensor("tile_29_cast_fp16")]; + tensor concat_58 = const()[name = tensor("concat_58"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_58_cast_fp16 = reshape(shape = concat_58, x = tile_29_cast_fp16)[name = tensor("reshape_58_cast_fp16")]; + tensor transpose_59_perm_0 = const()[name = tensor("transpose_59_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_59 = const()[name = tensor("concat_59"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_59_cast_fp16 = transpose(perm = transpose_59_perm_0, x = reshape_58_cast_fp16)[name = tensor("transpose_120")]; + tensor reshape_59_cast_fp16 = reshape(shape = concat_59, x = transpose_59_cast_fp16)[name = tensor("reshape_59_cast_fp16")]; + tensor v_59_perm_0 = const()[name = tensor("v_59_perm_0"), val = tensor([1, 0, -2, -1])]; + tensor var_2528_transpose_x_0 = const()[name = tensor("op_2528_transpose_x_0"), val = tensor(false)]; + tensor var_2528_transpose_y_0 = const()[name = tensor("op_2528_transpose_y_0"), val = tensor(false)]; + tensor transpose_141_cast_fp16 = transpose(perm = transpose_141_perm_0, x = reshape_57_cast_fp16)[name = tensor("transpose_119")]; + tensor var_2528_cast_fp16 = matmul(transpose_x = var_2528_transpose_x_0, transpose_y = var_2528_transpose_y_0, x = q_29_cast_fp16, y = transpose_141_cast_fp16)[name = tensor("op_2528_cast_fp16")]; + tensor var_2529_to_fp16 = const()[name = tensor("op_2529_to_fp16"), val = tensor(0x1.6ap-4)]; + tensor attn_57_cast_fp16 = mul(x = var_2528_cast_fp16, y = var_2529_to_fp16)[name = tensor("attn_57_cast_fp16")]; + tensor input_141_cast_fp16 = add(x = attn_57_cast_fp16, y = causal_mask_to_fp16_palettized)[name = tensor("input_141_cast_fp16")]; + tensor attn_59_cast_fp16 = softmax(axis = var_2412, x = input_141_cast_fp16)[name = tensor("attn_59_cast_fp16")]; + tensor var_2533_transpose_x_0 = const()[name = tensor("op_2533_transpose_x_0"), val = tensor(false)]; + tensor var_2533_transpose_y_0 = const()[name = tensor("op_2533_transpose_y_0"), val = tensor(false)]; + tensor v_59_cast_fp16 = transpose(perm = v_59_perm_0, x = reshape_59_cast_fp16)[name = tensor("transpose_118")]; + tensor var_2533_cast_fp16 = matmul(transpose_x = var_2533_transpose_x_0, transpose_y = var_2533_transpose_y_0, x = attn_59_cast_fp16, y = v_59_cast_fp16)[name = tensor("op_2533_cast_fp16")]; + tensor var_2534_perm_0 = const()[name = tensor("op_2534_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor var_2535 = const()[name = tensor("op_2535"), val = tensor([1, 768, 2048])]; + tensor var_2534_cast_fp16 = transpose(perm = var_2534_perm_0, x = var_2533_cast_fp16)[name = tensor("transpose_117")]; + tensor input_143_cast_fp16 = reshape(shape = var_2535, x = var_2534_cast_fp16)[name = tensor("input_143_cast_fp16")]; + tensor layers_14_self_attn_o_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(225233344))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(227330560))), name = tensor("layers_14_self_attn_o_proj_weight_to_fp16_palettized"), shape = tensor([1024, 2048])]; + tensor linear_101_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_14_self_attn_o_proj_weight_to_fp16_palettized, x = input_143_cast_fp16)[name = tensor("linear_101_cast_fp16")]; + tensor x_325_cast_fp16 = add(x = x_307_cast_fp16, y = linear_101_cast_fp16)[name = tensor("x_325_cast_fp16")]; + tensor var_2411_promoted_3_to_fp16 = const()[name = tensor("op_2411_promoted_3_to_fp16"), val = tensor(0x1p+1)]; + tensor var_2542_cast_fp16 = pow(x = x_325_cast_fp16, y = var_2411_promoted_3_to_fp16)[name = tensor("op_2542_cast_fp16")]; + tensor var_2544_axes_0 = const()[name = tensor("op_2544_axes_0"), val = tensor([-1])]; + tensor var_2544_keep_dims_0 = const()[name = tensor("op_2544_keep_dims_0"), val = tensor(true)]; + tensor var_2544_cast_fp16 = reduce_mean(axes = var_2544_axes_0, keep_dims = var_2544_keep_dims_0, x = var_2542_cast_fp16)[name = tensor("op_2544_cast_fp16")]; + tensor var_2545_to_fp16 = const()[name = tensor("op_2545_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_2546_cast_fp16 = add(x = var_2544_cast_fp16, y = var_2545_to_fp16)[name = tensor("op_2546_cast_fp16")]; + tensor norm_119_epsilon_0 = const()[name = tensor("norm_119_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_119_cast_fp16 = rsqrt(epsilon = norm_119_epsilon_0, x = var_2546_cast_fp16)[name = tensor("norm_119_cast_fp16")]; + tensor var_2548_cast_fp16 = mul(x = x_325_cast_fp16, y = norm_119_cast_fp16)[name = tensor("op_2548_cast_fp16")]; + tensor layers_14_post_attention_layernorm_weight_to_fp16 = const()[name = tensor("layers_14_post_attention_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(227331136)))]; + tensor var_2549_cast_fp16 = mul(x = var_2548_cast_fp16, y = layers_14_post_attention_layernorm_weight_to_fp16)[name = tensor("op_2549_cast_fp16")]; + tensor layers_14_mlp_gate_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(227333248))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(230479040))), name = tensor("layers_14_mlp_gate_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_102_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_14_mlp_gate_proj_weight_to_fp16_palettized, x = var_2549_cast_fp16)[name = tensor("linear_102_cast_fp16")]; + tensor var_2559_cast_fp16 = silu(x = linear_102_cast_fp16)[name = tensor("op_2559_cast_fp16")]; + tensor layers_14_mlp_up_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(230479616))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(233625408))), name = tensor("layers_14_mlp_up_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_103_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_14_mlp_up_proj_weight_to_fp16_palettized, x = var_2549_cast_fp16)[name = tensor("linear_103_cast_fp16")]; + tensor input_149_cast_fp16 = mul(x = var_2559_cast_fp16, y = linear_103_cast_fp16)[name = tensor("input_149_cast_fp16")]; + tensor layers_14_mlp_down_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(233625984))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(236771776))), name = tensor("layers_14_mlp_down_proj_weight_to_fp16_palettized"), shape = tensor([1024, 3072])]; + tensor linear_104_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_14_mlp_down_proj_weight_to_fp16_palettized, x = input_149_cast_fp16)[name = tensor("linear_104_cast_fp16")]; + tensor x_329_cast_fp16 = add(x = x_325_cast_fp16, y = linear_104_cast_fp16)[name = tensor("x_329_cast_fp16")]; + tensor var_2579 = const()[name = tensor("op_2579"), val = tensor(-1)]; + tensor var_2578_promoted_to_fp16 = const()[name = tensor("op_2578_promoted_to_fp16"), val = tensor(0x1p+1)]; + tensor var_2588_cast_fp16 = pow(x = x_329_cast_fp16, y = var_2578_promoted_to_fp16)[name = tensor("op_2588_cast_fp16")]; + tensor var_2590_axes_0 = const()[name = tensor("op_2590_axes_0"), val = tensor([-1])]; + tensor var_2590_keep_dims_0 = const()[name = tensor("op_2590_keep_dims_0"), val = tensor(true)]; + tensor var_2590_cast_fp16 = reduce_mean(axes = var_2590_axes_0, keep_dims = var_2590_keep_dims_0, x = var_2588_cast_fp16)[name = tensor("op_2590_cast_fp16")]; + tensor var_2591_to_fp16 = const()[name = tensor("op_2591_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_2592_cast_fp16 = add(x = var_2590_cast_fp16, y = var_2591_to_fp16)[name = tensor("op_2592_cast_fp16")]; + tensor norm_121_epsilon_0 = const()[name = tensor("norm_121_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_121_cast_fp16 = rsqrt(epsilon = norm_121_epsilon_0, x = var_2592_cast_fp16)[name = tensor("norm_121_cast_fp16")]; + tensor var_2594_cast_fp16 = mul(x = x_329_cast_fp16, y = norm_121_cast_fp16)[name = tensor("op_2594_cast_fp16")]; + tensor layers_15_input_layernorm_weight_to_fp16 = const()[name = tensor("layers_15_input_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(236772352)))]; + tensor var_2595_cast_fp16 = mul(x = var_2594_cast_fp16, y = layers_15_input_layernorm_weight_to_fp16)[name = tensor("op_2595_cast_fp16")]; + tensor layers_15_self_attn_q_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(236774464))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(238871680))), name = tensor("layers_15_self_attn_q_proj_weight_to_fp16_palettized"), shape = tensor([2048, 1024])]; + tensor linear_105_cast_fp16 = linear(bias = linear_0_bias_0_to_fp16, weight = layers_15_self_attn_q_proj_weight_to_fp16_palettized, x = var_2595_cast_fp16)[name = tensor("linear_105_cast_fp16")]; + tensor var_2611 = const()[name = tensor("op_2611"), val = tensor([1, 768, 16, 128])]; + tensor var_2612_cast_fp16 = reshape(shape = var_2611, x = linear_105_cast_fp16)[name = tensor("op_2612_cast_fp16")]; + tensor x_335_perm_0 = const()[name = tensor("x_335_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_15_self_attn_k_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(238872256))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(239920896))), name = tensor("layers_15_self_attn_k_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_106_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_15_self_attn_k_proj_weight_to_fp16_palettized, x = var_2595_cast_fp16)[name = tensor("linear_106_cast_fp16")]; + tensor var_2616 = const()[name = tensor("op_2616"), val = tensor([1, 768, 8, 128])]; + tensor var_2617_cast_fp16 = reshape(shape = var_2616, x = linear_106_cast_fp16)[name = tensor("op_2617_cast_fp16")]; + tensor x_339_perm_0 = const()[name = tensor("x_339_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_15_self_attn_v_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(239921472))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(240970112))), name = tensor("layers_15_self_attn_v_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_107_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_15_self_attn_v_proj_weight_to_fp16_palettized, x = var_2595_cast_fp16)[name = tensor("linear_107_cast_fp16")]; + tensor var_2621 = const()[name = tensor("op_2621"), val = tensor([1, 768, 8, 128])]; + tensor var_2622_cast_fp16 = reshape(shape = var_2621, x = linear_107_cast_fp16)[name = tensor("op_2622_cast_fp16")]; + tensor transpose_142_perm_0 = const()[name = tensor("transpose_142_perm_0"), val = tensor([2, 0, 1, 3])]; + tensor var_2578_promoted_1_to_fp16 = const()[name = tensor("op_2578_promoted_1_to_fp16"), val = tensor(0x1p+1)]; + tensor x_335_cast_fp16 = transpose(perm = x_335_perm_0, x = var_2612_cast_fp16)[name = tensor("transpose_116")]; + tensor var_2626_cast_fp16 = pow(x = x_335_cast_fp16, y = var_2578_promoted_1_to_fp16)[name = tensor("op_2626_cast_fp16")]; + tensor var_2628_axes_0 = const()[name = tensor("op_2628_axes_0"), val = tensor([-1])]; + tensor var_2628_keep_dims_0 = const()[name = tensor("op_2628_keep_dims_0"), val = tensor(true)]; + tensor var_2628_cast_fp16 = reduce_mean(axes = var_2628_axes_0, keep_dims = var_2628_keep_dims_0, x = var_2626_cast_fp16)[name = tensor("op_2628_cast_fp16")]; + tensor var_2629_to_fp16 = const()[name = tensor("op_2629_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_2630_cast_fp16 = add(x = var_2628_cast_fp16, y = var_2629_to_fp16)[name = tensor("op_2630_cast_fp16")]; + tensor norm_123_epsilon_0 = const()[name = tensor("norm_123_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_123_cast_fp16 = rsqrt(epsilon = norm_123_epsilon_0, x = var_2630_cast_fp16)[name = tensor("norm_123_cast_fp16")]; + tensor var_2632_cast_fp16 = mul(x = x_335_cast_fp16, y = norm_123_cast_fp16)[name = tensor("op_2632_cast_fp16")]; + tensor layers_15_self_attn_q_norm_weight_to_fp16 = const()[name = tensor("layers_15_self_attn_q_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(240970688)))]; + tensor var_2633_cast_fp16 = mul(x = var_2632_cast_fp16, y = layers_15_self_attn_q_norm_weight_to_fp16)[name = tensor("op_2633_cast_fp16")]; + tensor var_2578_promoted_2_to_fp16 = const()[name = tensor("op_2578_promoted_2_to_fp16"), val = tensor(0x1p+1)]; + tensor x_339_cast_fp16 = transpose(perm = x_339_perm_0, x = var_2617_cast_fp16)[name = tensor("transpose_115")]; + tensor var_2637_cast_fp16 = pow(x = x_339_cast_fp16, y = var_2578_promoted_2_to_fp16)[name = tensor("op_2637_cast_fp16")]; + tensor var_2639_axes_0 = const()[name = tensor("op_2639_axes_0"), val = tensor([-1])]; + tensor var_2639_keep_dims_0 = const()[name = tensor("op_2639_keep_dims_0"), val = tensor(true)]; + tensor var_2639_cast_fp16 = reduce_mean(axes = var_2639_axes_0, keep_dims = var_2639_keep_dims_0, x = var_2637_cast_fp16)[name = tensor("op_2639_cast_fp16")]; + tensor var_2640_to_fp16 = const()[name = tensor("op_2640_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_2641_cast_fp16 = add(x = var_2639_cast_fp16, y = var_2640_to_fp16)[name = tensor("op_2641_cast_fp16")]; + tensor norm_125_epsilon_0 = const()[name = tensor("norm_125_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_125_cast_fp16 = rsqrt(epsilon = norm_125_epsilon_0, x = var_2641_cast_fp16)[name = tensor("norm_125_cast_fp16")]; + tensor var_2643_cast_fp16 = mul(x = x_339_cast_fp16, y = norm_125_cast_fp16)[name = tensor("op_2643_cast_fp16")]; + tensor layers_15_self_attn_k_norm_weight_to_fp16 = const()[name = tensor("layers_15_self_attn_k_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(240971008)))]; + tensor var_2644_cast_fp16 = mul(x = var_2643_cast_fp16, y = layers_15_self_attn_k_norm_weight_to_fp16)[name = tensor("op_2644_cast_fp16")]; + tensor x1_61_begin_0 = const()[name = tensor("x1_61_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_61_end_0 = const()[name = tensor("x1_61_end_0"), val = tensor([1, 16, 768, 64])]; + tensor x1_61_end_mask_0 = const()[name = tensor("x1_61_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_61_cast_fp16 = slice_by_index(begin = x1_61_begin_0, end = x1_61_end_0, end_mask = x1_61_end_mask_0, x = var_2633_cast_fp16)[name = tensor("x1_61_cast_fp16")]; + tensor x2_61_begin_0 = const()[name = tensor("x2_61_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_61_end_0 = const()[name = tensor("x2_61_end_0"), val = tensor([1, 16, 768, 128])]; + tensor x2_61_end_mask_0 = const()[name = tensor("x2_61_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_61_cast_fp16 = slice_by_index(begin = x2_61_begin_0, end = x2_61_end_0, end_mask = x2_61_end_mask_0, x = var_2633_cast_fp16)[name = tensor("x2_61_cast_fp16")]; + tensor var_2661_cast_fp16 = mul(x = x1_61_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_2661_cast_fp16")]; + tensor var_2662_cast_fp16 = mul(x = x2_61_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_2662_cast_fp16")]; + tensor var_2663_cast_fp16 = sub(x = var_2661_cast_fp16, y = var_2662_cast_fp16)[name = tensor("op_2663_cast_fp16")]; + tensor var_2664_cast_fp16 = mul(x = x2_61_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_2664_cast_fp16")]; + tensor var_2665_cast_fp16 = mul(x = x1_61_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_2665_cast_fp16")]; + tensor var_2666_cast_fp16 = add(x = var_2664_cast_fp16, y = var_2665_cast_fp16)[name = tensor("op_2666_cast_fp16")]; + tensor q_31_interleave_0 = const()[name = tensor("q_31_interleave_0"), val = tensor(false)]; + tensor q_31_cast_fp16 = concat(axis = var_2579, interleave = q_31_interleave_0, values = (var_2663_cast_fp16, var_2666_cast_fp16))[name = tensor("q_31_cast_fp16")]; + tensor x1_63_begin_0 = const()[name = tensor("x1_63_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_63_end_0 = const()[name = tensor("x1_63_end_0"), val = tensor([1, 8, 768, 64])]; + tensor x1_63_end_mask_0 = const()[name = tensor("x1_63_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_63_cast_fp16 = slice_by_index(begin = x1_63_begin_0, end = x1_63_end_0, end_mask = x1_63_end_mask_0, x = var_2644_cast_fp16)[name = tensor("x1_63_cast_fp16")]; + tensor x2_63_begin_0 = const()[name = tensor("x2_63_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_63_end_0 = const()[name = tensor("x2_63_end_0"), val = tensor([1, 8, 768, 128])]; + tensor x2_63_end_mask_0 = const()[name = tensor("x2_63_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_63_cast_fp16 = slice_by_index(begin = x2_63_begin_0, end = x2_63_end_0, end_mask = x2_63_end_mask_0, x = var_2644_cast_fp16)[name = tensor("x2_63_cast_fp16")]; + tensor var_2684_cast_fp16 = mul(x = x1_63_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_2684_cast_fp16")]; + tensor var_2685_cast_fp16 = mul(x = x2_63_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_2685_cast_fp16")]; + tensor var_2686_cast_fp16 = sub(x = var_2684_cast_fp16, y = var_2685_cast_fp16)[name = tensor("op_2686_cast_fp16")]; + tensor var_2687_cast_fp16 = mul(x = x2_63_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_2687_cast_fp16")]; + tensor var_2688_cast_fp16 = mul(x = x1_63_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_2688_cast_fp16")]; + tensor var_2689_cast_fp16 = add(x = var_2687_cast_fp16, y = var_2688_cast_fp16)[name = tensor("op_2689_cast_fp16")]; + tensor k_61_interleave_0 = const()[name = tensor("k_61_interleave_0"), val = tensor(false)]; + tensor k_61_cast_fp16 = concat(axis = var_2579, interleave = k_61_interleave_0, values = (var_2686_cast_fp16, var_2689_cast_fp16))[name = tensor("k_61_cast_fp16")]; + tensor transpose_60_perm_0 = const()[name = tensor("transpose_60_perm_0"), val = tensor([1, 0, 2, 3])]; + tensor tile_30_reps_0 = const()[name = tensor("tile_30_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_60_cast_fp16 = transpose(perm = transpose_60_perm_0, x = k_61_cast_fp16)[name = tensor("transpose_114")]; + tensor tile_30_cast_fp16 = tile(reps = tile_30_reps_0, x = transpose_60_cast_fp16)[name = tensor("tile_30_cast_fp16")]; + tensor concat_60 = const()[name = tensor("concat_60"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_60_cast_fp16 = reshape(shape = concat_60, x = tile_30_cast_fp16)[name = tensor("reshape_60_cast_fp16")]; + tensor transpose_61_perm_0 = const()[name = tensor("transpose_61_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_61 = const()[name = tensor("concat_61"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_61_cast_fp16 = transpose(perm = transpose_61_perm_0, x = reshape_60_cast_fp16)[name = tensor("transpose_113")]; + tensor reshape_61_cast_fp16 = reshape(shape = concat_61, x = transpose_61_cast_fp16)[name = tensor("reshape_61_cast_fp16")]; + tensor transpose_143_perm_0 = const()[name = tensor("transpose_143_perm_0"), val = tensor([1, 0, -1, -2])]; + tensor tile_31_reps_0 = const()[name = tensor("tile_31_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_142_cast_fp16 = transpose(perm = transpose_142_perm_0, x = var_2622_cast_fp16)[name = tensor("transpose_112")]; + tensor tile_31_cast_fp16 = tile(reps = tile_31_reps_0, x = transpose_142_cast_fp16)[name = tensor("tile_31_cast_fp16")]; + tensor concat_62 = const()[name = tensor("concat_62"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_62_cast_fp16 = reshape(shape = concat_62, x = tile_31_cast_fp16)[name = tensor("reshape_62_cast_fp16")]; + tensor transpose_63_perm_0 = const()[name = tensor("transpose_63_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_63 = const()[name = tensor("concat_63"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_63_cast_fp16 = transpose(perm = transpose_63_perm_0, x = reshape_62_cast_fp16)[name = tensor("transpose_111")]; + tensor reshape_63_cast_fp16 = reshape(shape = concat_63, x = transpose_63_cast_fp16)[name = tensor("reshape_63_cast_fp16")]; + tensor v_63_perm_0 = const()[name = tensor("v_63_perm_0"), val = tensor([1, 0, -2, -1])]; + tensor var_2695_transpose_x_0 = const()[name = tensor("op_2695_transpose_x_0"), val = tensor(false)]; + tensor var_2695_transpose_y_0 = const()[name = tensor("op_2695_transpose_y_0"), val = tensor(false)]; + tensor transpose_143_cast_fp16 = transpose(perm = transpose_143_perm_0, x = reshape_61_cast_fp16)[name = tensor("transpose_110")]; + tensor var_2695_cast_fp16 = matmul(transpose_x = var_2695_transpose_x_0, transpose_y = var_2695_transpose_y_0, x = q_31_cast_fp16, y = transpose_143_cast_fp16)[name = tensor("op_2695_cast_fp16")]; + tensor var_2696_to_fp16 = const()[name = tensor("op_2696_to_fp16"), val = tensor(0x1.6ap-4)]; + tensor attn_61_cast_fp16 = mul(x = var_2695_cast_fp16, y = var_2696_to_fp16)[name = tensor("attn_61_cast_fp16")]; + tensor input_151_cast_fp16 = add(x = attn_61_cast_fp16, y = causal_mask_to_fp16_palettized)[name = tensor("input_151_cast_fp16")]; + tensor attn_63_cast_fp16 = softmax(axis = var_2579, x = input_151_cast_fp16)[name = tensor("attn_63_cast_fp16")]; + tensor var_2700_transpose_x_0 = const()[name = tensor("op_2700_transpose_x_0"), val = tensor(false)]; + tensor var_2700_transpose_y_0 = const()[name = tensor("op_2700_transpose_y_0"), val = tensor(false)]; + tensor v_63_cast_fp16 = transpose(perm = v_63_perm_0, x = reshape_63_cast_fp16)[name = tensor("transpose_109")]; + tensor var_2700_cast_fp16 = matmul(transpose_x = var_2700_transpose_x_0, transpose_y = var_2700_transpose_y_0, x = attn_63_cast_fp16, y = v_63_cast_fp16)[name = tensor("op_2700_cast_fp16")]; + tensor var_2701_perm_0 = const()[name = tensor("op_2701_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor var_2702 = const()[name = tensor("op_2702"), val = tensor([1, 768, 2048])]; + tensor var_2701_cast_fp16 = transpose(perm = var_2701_perm_0, x = var_2700_cast_fp16)[name = tensor("transpose_108")]; + tensor input_153_cast_fp16 = reshape(shape = var_2702, x = var_2701_cast_fp16)[name = tensor("input_153_cast_fp16")]; + tensor layers_15_self_attn_o_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(240971328))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(243068544))), name = tensor("layers_15_self_attn_o_proj_weight_to_fp16_palettized"), shape = tensor([1024, 2048])]; + tensor linear_108_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_15_self_attn_o_proj_weight_to_fp16_palettized, x = input_153_cast_fp16)[name = tensor("linear_108_cast_fp16")]; + tensor x_347_cast_fp16 = add(x = x_329_cast_fp16, y = linear_108_cast_fp16)[name = tensor("x_347_cast_fp16")]; + tensor var_2578_promoted_3_to_fp16 = const()[name = tensor("op_2578_promoted_3_to_fp16"), val = tensor(0x1p+1)]; + tensor var_2709_cast_fp16 = pow(x = x_347_cast_fp16, y = var_2578_promoted_3_to_fp16)[name = tensor("op_2709_cast_fp16")]; + tensor var_2711_axes_0 = const()[name = tensor("op_2711_axes_0"), val = tensor([-1])]; + tensor var_2711_keep_dims_0 = const()[name = tensor("op_2711_keep_dims_0"), val = tensor(true)]; + tensor var_2711_cast_fp16 = reduce_mean(axes = var_2711_axes_0, keep_dims = var_2711_keep_dims_0, x = var_2709_cast_fp16)[name = tensor("op_2711_cast_fp16")]; + tensor var_2712_to_fp16 = const()[name = tensor("op_2712_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_2713_cast_fp16 = add(x = var_2711_cast_fp16, y = var_2712_to_fp16)[name = tensor("op_2713_cast_fp16")]; + tensor norm_127_epsilon_0 = const()[name = tensor("norm_127_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_127_cast_fp16 = rsqrt(epsilon = norm_127_epsilon_0, x = var_2713_cast_fp16)[name = tensor("norm_127_cast_fp16")]; + tensor var_2715_cast_fp16 = mul(x = x_347_cast_fp16, y = norm_127_cast_fp16)[name = tensor("op_2715_cast_fp16")]; + tensor layers_15_post_attention_layernorm_weight_to_fp16 = const()[name = tensor("layers_15_post_attention_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(243069120)))]; + tensor var_2716_cast_fp16 = mul(x = var_2715_cast_fp16, y = layers_15_post_attention_layernorm_weight_to_fp16)[name = tensor("op_2716_cast_fp16")]; + tensor layers_15_mlp_gate_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(243071232))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(246217024))), name = tensor("layers_15_mlp_gate_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_109_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_15_mlp_gate_proj_weight_to_fp16_palettized, x = var_2716_cast_fp16)[name = tensor("linear_109_cast_fp16")]; + tensor var_2726_cast_fp16 = silu(x = linear_109_cast_fp16)[name = tensor("op_2726_cast_fp16")]; + tensor layers_15_mlp_up_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(246217600))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(249363392))), name = tensor("layers_15_mlp_up_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_110_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_15_mlp_up_proj_weight_to_fp16_palettized, x = var_2716_cast_fp16)[name = tensor("linear_110_cast_fp16")]; + tensor input_159_cast_fp16 = mul(x = var_2726_cast_fp16, y = linear_110_cast_fp16)[name = tensor("input_159_cast_fp16")]; + tensor layers_15_mlp_down_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(249363968))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(252509760))), name = tensor("layers_15_mlp_down_proj_weight_to_fp16_palettized"), shape = tensor([1024, 3072])]; + tensor linear_111_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_15_mlp_down_proj_weight_to_fp16_palettized, x = input_159_cast_fp16)[name = tensor("linear_111_cast_fp16")]; + tensor x_351_cast_fp16 = add(x = x_347_cast_fp16, y = linear_111_cast_fp16)[name = tensor("x_351_cast_fp16")]; + tensor var_2746 = const()[name = tensor("op_2746"), val = tensor(-1)]; + tensor var_2745_promoted_to_fp16 = const()[name = tensor("op_2745_promoted_to_fp16"), val = tensor(0x1p+1)]; + tensor var_2755_cast_fp16 = pow(x = x_351_cast_fp16, y = var_2745_promoted_to_fp16)[name = tensor("op_2755_cast_fp16")]; + tensor var_2757_axes_0 = const()[name = tensor("op_2757_axes_0"), val = tensor([-1])]; + tensor var_2757_keep_dims_0 = const()[name = tensor("op_2757_keep_dims_0"), val = tensor(true)]; + tensor var_2757_cast_fp16 = reduce_mean(axes = var_2757_axes_0, keep_dims = var_2757_keep_dims_0, x = var_2755_cast_fp16)[name = tensor("op_2757_cast_fp16")]; + tensor var_2758_to_fp16 = const()[name = tensor("op_2758_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_2759_cast_fp16 = add(x = var_2757_cast_fp16, y = var_2758_to_fp16)[name = tensor("op_2759_cast_fp16")]; + tensor norm_129_epsilon_0 = const()[name = tensor("norm_129_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_129_cast_fp16 = rsqrt(epsilon = norm_129_epsilon_0, x = var_2759_cast_fp16)[name = tensor("norm_129_cast_fp16")]; + tensor var_2761_cast_fp16 = mul(x = x_351_cast_fp16, y = norm_129_cast_fp16)[name = tensor("op_2761_cast_fp16")]; + tensor layers_16_input_layernorm_weight_to_fp16 = const()[name = tensor("layers_16_input_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(252510336)))]; + tensor var_2762_cast_fp16 = mul(x = var_2761_cast_fp16, y = layers_16_input_layernorm_weight_to_fp16)[name = tensor("op_2762_cast_fp16")]; + tensor layers_16_self_attn_q_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(252512448))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(254609664))), name = tensor("layers_16_self_attn_q_proj_weight_to_fp16_palettized"), shape = tensor([2048, 1024])]; + tensor linear_112_cast_fp16 = linear(bias = linear_0_bias_0_to_fp16, weight = layers_16_self_attn_q_proj_weight_to_fp16_palettized, x = var_2762_cast_fp16)[name = tensor("linear_112_cast_fp16")]; + tensor var_2778 = const()[name = tensor("op_2778"), val = tensor([1, 768, 16, 128])]; + tensor var_2779_cast_fp16 = reshape(shape = var_2778, x = linear_112_cast_fp16)[name = tensor("op_2779_cast_fp16")]; + tensor x_357_perm_0 = const()[name = tensor("x_357_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_16_self_attn_k_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(254610240))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(255658880))), name = tensor("layers_16_self_attn_k_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_113_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_16_self_attn_k_proj_weight_to_fp16_palettized, x = var_2762_cast_fp16)[name = tensor("linear_113_cast_fp16")]; + tensor var_2783 = const()[name = tensor("op_2783"), val = tensor([1, 768, 8, 128])]; + tensor var_2784_cast_fp16 = reshape(shape = var_2783, x = linear_113_cast_fp16)[name = tensor("op_2784_cast_fp16")]; + tensor x_361_perm_0 = const()[name = tensor("x_361_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_16_self_attn_v_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(255659456))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(256708096))), name = tensor("layers_16_self_attn_v_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_114_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_16_self_attn_v_proj_weight_to_fp16_palettized, x = var_2762_cast_fp16)[name = tensor("linear_114_cast_fp16")]; + tensor var_2788 = const()[name = tensor("op_2788"), val = tensor([1, 768, 8, 128])]; + tensor var_2789_cast_fp16 = reshape(shape = var_2788, x = linear_114_cast_fp16)[name = tensor("op_2789_cast_fp16")]; + tensor transpose_144_perm_0 = const()[name = tensor("transpose_144_perm_0"), val = tensor([2, 0, 1, 3])]; + tensor var_2745_promoted_1_to_fp16 = const()[name = tensor("op_2745_promoted_1_to_fp16"), val = tensor(0x1p+1)]; + tensor x_357_cast_fp16 = transpose(perm = x_357_perm_0, x = var_2779_cast_fp16)[name = tensor("transpose_107")]; + tensor var_2793_cast_fp16 = pow(x = x_357_cast_fp16, y = var_2745_promoted_1_to_fp16)[name = tensor("op_2793_cast_fp16")]; + tensor var_2795_axes_0 = const()[name = tensor("op_2795_axes_0"), val = tensor([-1])]; + tensor var_2795_keep_dims_0 = const()[name = tensor("op_2795_keep_dims_0"), val = tensor(true)]; + tensor var_2795_cast_fp16 = reduce_mean(axes = var_2795_axes_0, keep_dims = var_2795_keep_dims_0, x = var_2793_cast_fp16)[name = tensor("op_2795_cast_fp16")]; + tensor var_2796_to_fp16 = const()[name = tensor("op_2796_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_2797_cast_fp16 = add(x = var_2795_cast_fp16, y = var_2796_to_fp16)[name = tensor("op_2797_cast_fp16")]; + tensor norm_131_epsilon_0 = const()[name = tensor("norm_131_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_131_cast_fp16 = rsqrt(epsilon = norm_131_epsilon_0, x = var_2797_cast_fp16)[name = tensor("norm_131_cast_fp16")]; + tensor var_2799_cast_fp16 = mul(x = x_357_cast_fp16, y = norm_131_cast_fp16)[name = tensor("op_2799_cast_fp16")]; + tensor layers_16_self_attn_q_norm_weight_to_fp16 = const()[name = tensor("layers_16_self_attn_q_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(256708672)))]; + tensor var_2800_cast_fp16 = mul(x = var_2799_cast_fp16, y = layers_16_self_attn_q_norm_weight_to_fp16)[name = tensor("op_2800_cast_fp16")]; + tensor var_2745_promoted_2_to_fp16 = const()[name = tensor("op_2745_promoted_2_to_fp16"), val = tensor(0x1p+1)]; + tensor x_361_cast_fp16 = transpose(perm = x_361_perm_0, x = var_2784_cast_fp16)[name = tensor("transpose_106")]; + tensor var_2804_cast_fp16 = pow(x = x_361_cast_fp16, y = var_2745_promoted_2_to_fp16)[name = tensor("op_2804_cast_fp16")]; + tensor var_2806_axes_0 = const()[name = tensor("op_2806_axes_0"), val = tensor([-1])]; + tensor var_2806_keep_dims_0 = const()[name = tensor("op_2806_keep_dims_0"), val = tensor(true)]; + tensor var_2806_cast_fp16 = reduce_mean(axes = var_2806_axes_0, keep_dims = var_2806_keep_dims_0, x = var_2804_cast_fp16)[name = tensor("op_2806_cast_fp16")]; + tensor var_2807_to_fp16 = const()[name = tensor("op_2807_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_2808_cast_fp16 = add(x = var_2806_cast_fp16, y = var_2807_to_fp16)[name = tensor("op_2808_cast_fp16")]; + tensor norm_133_epsilon_0 = const()[name = tensor("norm_133_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_133_cast_fp16 = rsqrt(epsilon = norm_133_epsilon_0, x = var_2808_cast_fp16)[name = tensor("norm_133_cast_fp16")]; + tensor var_2810_cast_fp16 = mul(x = x_361_cast_fp16, y = norm_133_cast_fp16)[name = tensor("op_2810_cast_fp16")]; + tensor layers_16_self_attn_k_norm_weight_to_fp16 = const()[name = tensor("layers_16_self_attn_k_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(256708992)))]; + tensor var_2811_cast_fp16 = mul(x = var_2810_cast_fp16, y = layers_16_self_attn_k_norm_weight_to_fp16)[name = tensor("op_2811_cast_fp16")]; + tensor x1_65_begin_0 = const()[name = tensor("x1_65_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_65_end_0 = const()[name = tensor("x1_65_end_0"), val = tensor([1, 16, 768, 64])]; + tensor x1_65_end_mask_0 = const()[name = tensor("x1_65_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_65_cast_fp16 = slice_by_index(begin = x1_65_begin_0, end = x1_65_end_0, end_mask = x1_65_end_mask_0, x = var_2800_cast_fp16)[name = tensor("x1_65_cast_fp16")]; + tensor x2_65_begin_0 = const()[name = tensor("x2_65_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_65_end_0 = const()[name = tensor("x2_65_end_0"), val = tensor([1, 16, 768, 128])]; + tensor x2_65_end_mask_0 = const()[name = tensor("x2_65_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_65_cast_fp16 = slice_by_index(begin = x2_65_begin_0, end = x2_65_end_0, end_mask = x2_65_end_mask_0, x = var_2800_cast_fp16)[name = tensor("x2_65_cast_fp16")]; + tensor var_2828_cast_fp16 = mul(x = x1_65_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_2828_cast_fp16")]; + tensor var_2829_cast_fp16 = mul(x = x2_65_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_2829_cast_fp16")]; + tensor var_2830_cast_fp16 = sub(x = var_2828_cast_fp16, y = var_2829_cast_fp16)[name = tensor("op_2830_cast_fp16")]; + tensor var_2831_cast_fp16 = mul(x = x2_65_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_2831_cast_fp16")]; + tensor var_2832_cast_fp16 = mul(x = x1_65_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_2832_cast_fp16")]; + tensor var_2833_cast_fp16 = add(x = var_2831_cast_fp16, y = var_2832_cast_fp16)[name = tensor("op_2833_cast_fp16")]; + tensor q_33_interleave_0 = const()[name = tensor("q_33_interleave_0"), val = tensor(false)]; + tensor q_33_cast_fp16 = concat(axis = var_2746, interleave = q_33_interleave_0, values = (var_2830_cast_fp16, var_2833_cast_fp16))[name = tensor("q_33_cast_fp16")]; + tensor x1_67_begin_0 = const()[name = tensor("x1_67_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_67_end_0 = const()[name = tensor("x1_67_end_0"), val = tensor([1, 8, 768, 64])]; + tensor x1_67_end_mask_0 = const()[name = tensor("x1_67_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_67_cast_fp16 = slice_by_index(begin = x1_67_begin_0, end = x1_67_end_0, end_mask = x1_67_end_mask_0, x = var_2811_cast_fp16)[name = tensor("x1_67_cast_fp16")]; + tensor x2_67_begin_0 = const()[name = tensor("x2_67_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_67_end_0 = const()[name = tensor("x2_67_end_0"), val = tensor([1, 8, 768, 128])]; + tensor x2_67_end_mask_0 = const()[name = tensor("x2_67_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_67_cast_fp16 = slice_by_index(begin = x2_67_begin_0, end = x2_67_end_0, end_mask = x2_67_end_mask_0, x = var_2811_cast_fp16)[name = tensor("x2_67_cast_fp16")]; + tensor var_2851_cast_fp16 = mul(x = x1_67_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_2851_cast_fp16")]; + tensor var_2852_cast_fp16 = mul(x = x2_67_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_2852_cast_fp16")]; + tensor var_2853_cast_fp16 = sub(x = var_2851_cast_fp16, y = var_2852_cast_fp16)[name = tensor("op_2853_cast_fp16")]; + tensor var_2854_cast_fp16 = mul(x = x2_67_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_2854_cast_fp16")]; + tensor var_2855_cast_fp16 = mul(x = x1_67_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_2855_cast_fp16")]; + tensor var_2856_cast_fp16 = add(x = var_2854_cast_fp16, y = var_2855_cast_fp16)[name = tensor("op_2856_cast_fp16")]; + tensor k_65_interleave_0 = const()[name = tensor("k_65_interleave_0"), val = tensor(false)]; + tensor k_65_cast_fp16 = concat(axis = var_2746, interleave = k_65_interleave_0, values = (var_2853_cast_fp16, var_2856_cast_fp16))[name = tensor("k_65_cast_fp16")]; + tensor transpose_64_perm_0 = const()[name = tensor("transpose_64_perm_0"), val = tensor([1, 0, 2, 3])]; + tensor tile_32_reps_0 = const()[name = tensor("tile_32_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_64_cast_fp16 = transpose(perm = transpose_64_perm_0, x = k_65_cast_fp16)[name = tensor("transpose_105")]; + tensor tile_32_cast_fp16 = tile(reps = tile_32_reps_0, x = transpose_64_cast_fp16)[name = tensor("tile_32_cast_fp16")]; + tensor concat_64 = const()[name = tensor("concat_64"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_64_cast_fp16 = reshape(shape = concat_64, x = tile_32_cast_fp16)[name = tensor("reshape_64_cast_fp16")]; + tensor transpose_65_perm_0 = const()[name = tensor("transpose_65_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_65 = const()[name = tensor("concat_65"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_65_cast_fp16 = transpose(perm = transpose_65_perm_0, x = reshape_64_cast_fp16)[name = tensor("transpose_104")]; + tensor reshape_65_cast_fp16 = reshape(shape = concat_65, x = transpose_65_cast_fp16)[name = tensor("reshape_65_cast_fp16")]; + tensor transpose_145_perm_0 = const()[name = tensor("transpose_145_perm_0"), val = tensor([1, 0, -1, -2])]; + tensor tile_33_reps_0 = const()[name = tensor("tile_33_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_144_cast_fp16 = transpose(perm = transpose_144_perm_0, x = var_2789_cast_fp16)[name = tensor("transpose_103")]; + tensor tile_33_cast_fp16 = tile(reps = tile_33_reps_0, x = transpose_144_cast_fp16)[name = tensor("tile_33_cast_fp16")]; + tensor concat_66 = const()[name = tensor("concat_66"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_66_cast_fp16 = reshape(shape = concat_66, x = tile_33_cast_fp16)[name = tensor("reshape_66_cast_fp16")]; + tensor transpose_67_perm_0 = const()[name = tensor("transpose_67_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_67 = const()[name = tensor("concat_67"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_67_cast_fp16 = transpose(perm = transpose_67_perm_0, x = reshape_66_cast_fp16)[name = tensor("transpose_102")]; + tensor reshape_67_cast_fp16 = reshape(shape = concat_67, x = transpose_67_cast_fp16)[name = tensor("reshape_67_cast_fp16")]; + tensor v_67_perm_0 = const()[name = tensor("v_67_perm_0"), val = tensor([1, 0, -2, -1])]; + tensor var_2862_transpose_x_0 = const()[name = tensor("op_2862_transpose_x_0"), val = tensor(false)]; + tensor var_2862_transpose_y_0 = const()[name = tensor("op_2862_transpose_y_0"), val = tensor(false)]; + tensor transpose_145_cast_fp16 = transpose(perm = transpose_145_perm_0, x = reshape_65_cast_fp16)[name = tensor("transpose_101")]; + tensor var_2862_cast_fp16 = matmul(transpose_x = var_2862_transpose_x_0, transpose_y = var_2862_transpose_y_0, x = q_33_cast_fp16, y = transpose_145_cast_fp16)[name = tensor("op_2862_cast_fp16")]; + tensor var_2863_to_fp16 = const()[name = tensor("op_2863_to_fp16"), val = tensor(0x1.6ap-4)]; + tensor attn_65_cast_fp16 = mul(x = var_2862_cast_fp16, y = var_2863_to_fp16)[name = tensor("attn_65_cast_fp16")]; + tensor input_161_cast_fp16 = add(x = attn_65_cast_fp16, y = causal_mask_to_fp16_palettized)[name = tensor("input_161_cast_fp16")]; + tensor attn_67_cast_fp16 = softmax(axis = var_2746, x = input_161_cast_fp16)[name = tensor("attn_67_cast_fp16")]; + tensor var_2867_transpose_x_0 = const()[name = tensor("op_2867_transpose_x_0"), val = tensor(false)]; + tensor var_2867_transpose_y_0 = const()[name = tensor("op_2867_transpose_y_0"), val = tensor(false)]; + tensor v_67_cast_fp16 = transpose(perm = v_67_perm_0, x = reshape_67_cast_fp16)[name = tensor("transpose_100")]; + tensor var_2867_cast_fp16 = matmul(transpose_x = var_2867_transpose_x_0, transpose_y = var_2867_transpose_y_0, x = attn_67_cast_fp16, y = v_67_cast_fp16)[name = tensor("op_2867_cast_fp16")]; + tensor var_2868_perm_0 = const()[name = tensor("op_2868_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor var_2869 = const()[name = tensor("op_2869"), val = tensor([1, 768, 2048])]; + tensor var_2868_cast_fp16 = transpose(perm = var_2868_perm_0, x = var_2867_cast_fp16)[name = tensor("transpose_99")]; + tensor input_163_cast_fp16 = reshape(shape = var_2869, x = var_2868_cast_fp16)[name = tensor("input_163_cast_fp16")]; + tensor layers_16_self_attn_o_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(256709312))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(258806528))), name = tensor("layers_16_self_attn_o_proj_weight_to_fp16_palettized"), shape = tensor([1024, 2048])]; + tensor linear_115_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_16_self_attn_o_proj_weight_to_fp16_palettized, x = input_163_cast_fp16)[name = tensor("linear_115_cast_fp16")]; + tensor x_369_cast_fp16 = add(x = x_351_cast_fp16, y = linear_115_cast_fp16)[name = tensor("x_369_cast_fp16")]; + tensor var_2745_promoted_3_to_fp16 = const()[name = tensor("op_2745_promoted_3_to_fp16"), val = tensor(0x1p+1)]; + tensor var_2876_cast_fp16 = pow(x = x_369_cast_fp16, y = var_2745_promoted_3_to_fp16)[name = tensor("op_2876_cast_fp16")]; + tensor var_2878_axes_0 = const()[name = tensor("op_2878_axes_0"), val = tensor([-1])]; + tensor var_2878_keep_dims_0 = const()[name = tensor("op_2878_keep_dims_0"), val = tensor(true)]; + tensor var_2878_cast_fp16 = reduce_mean(axes = var_2878_axes_0, keep_dims = var_2878_keep_dims_0, x = var_2876_cast_fp16)[name = tensor("op_2878_cast_fp16")]; + tensor var_2879_to_fp16 = const()[name = tensor("op_2879_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_2880_cast_fp16 = add(x = var_2878_cast_fp16, y = var_2879_to_fp16)[name = tensor("op_2880_cast_fp16")]; + tensor norm_135_epsilon_0 = const()[name = tensor("norm_135_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_135_cast_fp16 = rsqrt(epsilon = norm_135_epsilon_0, x = var_2880_cast_fp16)[name = tensor("norm_135_cast_fp16")]; + tensor var_2882_cast_fp16 = mul(x = x_369_cast_fp16, y = norm_135_cast_fp16)[name = tensor("op_2882_cast_fp16")]; + tensor layers_16_post_attention_layernorm_weight_to_fp16 = const()[name = tensor("layers_16_post_attention_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(258807104)))]; + tensor var_2883_cast_fp16 = mul(x = var_2882_cast_fp16, y = layers_16_post_attention_layernorm_weight_to_fp16)[name = tensor("op_2883_cast_fp16")]; + tensor layers_16_mlp_gate_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(258809216))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(261955008))), name = tensor("layers_16_mlp_gate_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_116_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_16_mlp_gate_proj_weight_to_fp16_palettized, x = var_2883_cast_fp16)[name = tensor("linear_116_cast_fp16")]; + tensor var_2893_cast_fp16 = silu(x = linear_116_cast_fp16)[name = tensor("op_2893_cast_fp16")]; + tensor layers_16_mlp_up_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(261955584))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(265101376))), name = tensor("layers_16_mlp_up_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_117_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_16_mlp_up_proj_weight_to_fp16_palettized, x = var_2883_cast_fp16)[name = tensor("linear_117_cast_fp16")]; + tensor input_169_cast_fp16 = mul(x = var_2893_cast_fp16, y = linear_117_cast_fp16)[name = tensor("input_169_cast_fp16")]; + tensor layers_16_mlp_down_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(265101952))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(268247744))), name = tensor("layers_16_mlp_down_proj_weight_to_fp16_palettized"), shape = tensor([1024, 3072])]; + tensor linear_118_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_16_mlp_down_proj_weight_to_fp16_palettized, x = input_169_cast_fp16)[name = tensor("linear_118_cast_fp16")]; + tensor x_373_cast_fp16 = add(x = x_369_cast_fp16, y = linear_118_cast_fp16)[name = tensor("x_373_cast_fp16")]; + tensor var_2913 = const()[name = tensor("op_2913"), val = tensor(-1)]; + tensor var_2912_promoted_to_fp16 = const()[name = tensor("op_2912_promoted_to_fp16"), val = tensor(0x1p+1)]; + tensor var_2922_cast_fp16 = pow(x = x_373_cast_fp16, y = var_2912_promoted_to_fp16)[name = tensor("op_2922_cast_fp16")]; + tensor var_2924_axes_0 = const()[name = tensor("op_2924_axes_0"), val = tensor([-1])]; + tensor var_2924_keep_dims_0 = const()[name = tensor("op_2924_keep_dims_0"), val = tensor(true)]; + tensor var_2924_cast_fp16 = reduce_mean(axes = var_2924_axes_0, keep_dims = var_2924_keep_dims_0, x = var_2922_cast_fp16)[name = tensor("op_2924_cast_fp16")]; + tensor var_2925_to_fp16 = const()[name = tensor("op_2925_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_2926_cast_fp16 = add(x = var_2924_cast_fp16, y = var_2925_to_fp16)[name = tensor("op_2926_cast_fp16")]; + tensor norm_137_epsilon_0 = const()[name = tensor("norm_137_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_137_cast_fp16 = rsqrt(epsilon = norm_137_epsilon_0, x = var_2926_cast_fp16)[name = tensor("norm_137_cast_fp16")]; + tensor var_2928_cast_fp16 = mul(x = x_373_cast_fp16, y = norm_137_cast_fp16)[name = tensor("op_2928_cast_fp16")]; + tensor layers_17_input_layernorm_weight_to_fp16 = const()[name = tensor("layers_17_input_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(268248320)))]; + tensor var_2929_cast_fp16 = mul(x = var_2928_cast_fp16, y = layers_17_input_layernorm_weight_to_fp16)[name = tensor("op_2929_cast_fp16")]; + tensor layers_17_self_attn_q_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(268250432))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(270347648))), name = tensor("layers_17_self_attn_q_proj_weight_to_fp16_palettized"), shape = tensor([2048, 1024])]; + tensor linear_119_cast_fp16 = linear(bias = linear_0_bias_0_to_fp16, weight = layers_17_self_attn_q_proj_weight_to_fp16_palettized, x = var_2929_cast_fp16)[name = tensor("linear_119_cast_fp16")]; + tensor var_2945 = const()[name = tensor("op_2945"), val = tensor([1, 768, 16, 128])]; + tensor var_2946_cast_fp16 = reshape(shape = var_2945, x = linear_119_cast_fp16)[name = tensor("op_2946_cast_fp16")]; + tensor x_379_perm_0 = const()[name = tensor("x_379_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_17_self_attn_k_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(270348224))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(271396864))), name = tensor("layers_17_self_attn_k_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_120_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_17_self_attn_k_proj_weight_to_fp16_palettized, x = var_2929_cast_fp16)[name = tensor("linear_120_cast_fp16")]; + tensor var_2950 = const()[name = tensor("op_2950"), val = tensor([1, 768, 8, 128])]; + tensor var_2951_cast_fp16 = reshape(shape = var_2950, x = linear_120_cast_fp16)[name = tensor("op_2951_cast_fp16")]; + tensor x_383_perm_0 = const()[name = tensor("x_383_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_17_self_attn_v_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(271397440))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(272446080))), name = tensor("layers_17_self_attn_v_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_121_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_17_self_attn_v_proj_weight_to_fp16_palettized, x = var_2929_cast_fp16)[name = tensor("linear_121_cast_fp16")]; + tensor var_2955 = const()[name = tensor("op_2955"), val = tensor([1, 768, 8, 128])]; + tensor var_2956_cast_fp16 = reshape(shape = var_2955, x = linear_121_cast_fp16)[name = tensor("op_2956_cast_fp16")]; + tensor transpose_146_perm_0 = const()[name = tensor("transpose_146_perm_0"), val = tensor([2, 0, 1, 3])]; + tensor var_2912_promoted_1_to_fp16 = const()[name = tensor("op_2912_promoted_1_to_fp16"), val = tensor(0x1p+1)]; + tensor x_379_cast_fp16 = transpose(perm = x_379_perm_0, x = var_2946_cast_fp16)[name = tensor("transpose_98")]; + tensor var_2960_cast_fp16 = pow(x = x_379_cast_fp16, y = var_2912_promoted_1_to_fp16)[name = tensor("op_2960_cast_fp16")]; + tensor var_2962_axes_0 = const()[name = tensor("op_2962_axes_0"), val = tensor([-1])]; + tensor var_2962_keep_dims_0 = const()[name = tensor("op_2962_keep_dims_0"), val = tensor(true)]; + tensor var_2962_cast_fp16 = reduce_mean(axes = var_2962_axes_0, keep_dims = var_2962_keep_dims_0, x = var_2960_cast_fp16)[name = tensor("op_2962_cast_fp16")]; + tensor var_2963_to_fp16 = const()[name = tensor("op_2963_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_2964_cast_fp16 = add(x = var_2962_cast_fp16, y = var_2963_to_fp16)[name = tensor("op_2964_cast_fp16")]; + tensor norm_139_epsilon_0 = const()[name = tensor("norm_139_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_139_cast_fp16 = rsqrt(epsilon = norm_139_epsilon_0, x = var_2964_cast_fp16)[name = tensor("norm_139_cast_fp16")]; + tensor var_2966_cast_fp16 = mul(x = x_379_cast_fp16, y = norm_139_cast_fp16)[name = tensor("op_2966_cast_fp16")]; + tensor layers_17_self_attn_q_norm_weight_to_fp16 = const()[name = tensor("layers_17_self_attn_q_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(272446656)))]; + tensor var_2967_cast_fp16 = mul(x = var_2966_cast_fp16, y = layers_17_self_attn_q_norm_weight_to_fp16)[name = tensor("op_2967_cast_fp16")]; + tensor var_2912_promoted_2_to_fp16 = const()[name = tensor("op_2912_promoted_2_to_fp16"), val = tensor(0x1p+1)]; + tensor x_383_cast_fp16 = transpose(perm = x_383_perm_0, x = var_2951_cast_fp16)[name = tensor("transpose_97")]; + tensor var_2971_cast_fp16 = pow(x = x_383_cast_fp16, y = var_2912_promoted_2_to_fp16)[name = tensor("op_2971_cast_fp16")]; + tensor var_2973_axes_0 = const()[name = tensor("op_2973_axes_0"), val = tensor([-1])]; + tensor var_2973_keep_dims_0 = const()[name = tensor("op_2973_keep_dims_0"), val = tensor(true)]; + tensor var_2973_cast_fp16 = reduce_mean(axes = var_2973_axes_0, keep_dims = var_2973_keep_dims_0, x = var_2971_cast_fp16)[name = tensor("op_2973_cast_fp16")]; + tensor var_2974_to_fp16 = const()[name = tensor("op_2974_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_2975_cast_fp16 = add(x = var_2973_cast_fp16, y = var_2974_to_fp16)[name = tensor("op_2975_cast_fp16")]; + tensor norm_141_epsilon_0 = const()[name = tensor("norm_141_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_141_cast_fp16 = rsqrt(epsilon = norm_141_epsilon_0, x = var_2975_cast_fp16)[name = tensor("norm_141_cast_fp16")]; + tensor var_2977_cast_fp16 = mul(x = x_383_cast_fp16, y = norm_141_cast_fp16)[name = tensor("op_2977_cast_fp16")]; + tensor layers_17_self_attn_k_norm_weight_to_fp16 = const()[name = tensor("layers_17_self_attn_k_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(272446976)))]; + tensor var_2978_cast_fp16 = mul(x = var_2977_cast_fp16, y = layers_17_self_attn_k_norm_weight_to_fp16)[name = tensor("op_2978_cast_fp16")]; + tensor x1_69_begin_0 = const()[name = tensor("x1_69_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_69_end_0 = const()[name = tensor("x1_69_end_0"), val = tensor([1, 16, 768, 64])]; + tensor x1_69_end_mask_0 = const()[name = tensor("x1_69_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_69_cast_fp16 = slice_by_index(begin = x1_69_begin_0, end = x1_69_end_0, end_mask = x1_69_end_mask_0, x = var_2967_cast_fp16)[name = tensor("x1_69_cast_fp16")]; + tensor x2_69_begin_0 = const()[name = tensor("x2_69_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_69_end_0 = const()[name = tensor("x2_69_end_0"), val = tensor([1, 16, 768, 128])]; + tensor x2_69_end_mask_0 = const()[name = tensor("x2_69_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_69_cast_fp16 = slice_by_index(begin = x2_69_begin_0, end = x2_69_end_0, end_mask = x2_69_end_mask_0, x = var_2967_cast_fp16)[name = tensor("x2_69_cast_fp16")]; + tensor var_2995_cast_fp16 = mul(x = x1_69_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_2995_cast_fp16")]; + tensor var_2996_cast_fp16 = mul(x = x2_69_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_2996_cast_fp16")]; + tensor var_2997_cast_fp16 = sub(x = var_2995_cast_fp16, y = var_2996_cast_fp16)[name = tensor("op_2997_cast_fp16")]; + tensor var_2998_cast_fp16 = mul(x = x2_69_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_2998_cast_fp16")]; + tensor var_2999_cast_fp16 = mul(x = x1_69_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_2999_cast_fp16")]; + tensor var_3000_cast_fp16 = add(x = var_2998_cast_fp16, y = var_2999_cast_fp16)[name = tensor("op_3000_cast_fp16")]; + tensor q_35_interleave_0 = const()[name = tensor("q_35_interleave_0"), val = tensor(false)]; + tensor q_35_cast_fp16 = concat(axis = var_2913, interleave = q_35_interleave_0, values = (var_2997_cast_fp16, var_3000_cast_fp16))[name = tensor("q_35_cast_fp16")]; + tensor x1_71_begin_0 = const()[name = tensor("x1_71_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_71_end_0 = const()[name = tensor("x1_71_end_0"), val = tensor([1, 8, 768, 64])]; + tensor x1_71_end_mask_0 = const()[name = tensor("x1_71_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_71_cast_fp16 = slice_by_index(begin = x1_71_begin_0, end = x1_71_end_0, end_mask = x1_71_end_mask_0, x = var_2978_cast_fp16)[name = tensor("x1_71_cast_fp16")]; + tensor x2_71_begin_0 = const()[name = tensor("x2_71_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_71_end_0 = const()[name = tensor("x2_71_end_0"), val = tensor([1, 8, 768, 128])]; + tensor x2_71_end_mask_0 = const()[name = tensor("x2_71_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_71_cast_fp16 = slice_by_index(begin = x2_71_begin_0, end = x2_71_end_0, end_mask = x2_71_end_mask_0, x = var_2978_cast_fp16)[name = tensor("x2_71_cast_fp16")]; + tensor var_3018_cast_fp16 = mul(x = x1_71_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_3018_cast_fp16")]; + tensor var_3019_cast_fp16 = mul(x = x2_71_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_3019_cast_fp16")]; + tensor var_3020_cast_fp16 = sub(x = var_3018_cast_fp16, y = var_3019_cast_fp16)[name = tensor("op_3020_cast_fp16")]; + tensor var_3021_cast_fp16 = mul(x = x2_71_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_3021_cast_fp16")]; + tensor var_3022_cast_fp16 = mul(x = x1_71_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_3022_cast_fp16")]; + tensor var_3023_cast_fp16 = add(x = var_3021_cast_fp16, y = var_3022_cast_fp16)[name = tensor("op_3023_cast_fp16")]; + tensor k_69_interleave_0 = const()[name = tensor("k_69_interleave_0"), val = tensor(false)]; + tensor k_69_cast_fp16 = concat(axis = var_2913, interleave = k_69_interleave_0, values = (var_3020_cast_fp16, var_3023_cast_fp16))[name = tensor("k_69_cast_fp16")]; + tensor transpose_68_perm_0 = const()[name = tensor("transpose_68_perm_0"), val = tensor([1, 0, 2, 3])]; + tensor tile_34_reps_0 = const()[name = tensor("tile_34_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_68_cast_fp16 = transpose(perm = transpose_68_perm_0, x = k_69_cast_fp16)[name = tensor("transpose_96")]; + tensor tile_34_cast_fp16 = tile(reps = tile_34_reps_0, x = transpose_68_cast_fp16)[name = tensor("tile_34_cast_fp16")]; + tensor concat_68 = const()[name = tensor("concat_68"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_68_cast_fp16 = reshape(shape = concat_68, x = tile_34_cast_fp16)[name = tensor("reshape_68_cast_fp16")]; + tensor transpose_69_perm_0 = const()[name = tensor("transpose_69_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_69 = const()[name = tensor("concat_69"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_69_cast_fp16 = transpose(perm = transpose_69_perm_0, x = reshape_68_cast_fp16)[name = tensor("transpose_95")]; + tensor reshape_69_cast_fp16 = reshape(shape = concat_69, x = transpose_69_cast_fp16)[name = tensor("reshape_69_cast_fp16")]; + tensor transpose_147_perm_0 = const()[name = tensor("transpose_147_perm_0"), val = tensor([1, 0, -1, -2])]; + tensor tile_35_reps_0 = const()[name = tensor("tile_35_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_146_cast_fp16 = transpose(perm = transpose_146_perm_0, x = var_2956_cast_fp16)[name = tensor("transpose_94")]; + tensor tile_35_cast_fp16 = tile(reps = tile_35_reps_0, x = transpose_146_cast_fp16)[name = tensor("tile_35_cast_fp16")]; + tensor concat_70 = const()[name = tensor("concat_70"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_70_cast_fp16 = reshape(shape = concat_70, x = tile_35_cast_fp16)[name = tensor("reshape_70_cast_fp16")]; + tensor transpose_71_perm_0 = const()[name = tensor("transpose_71_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_71 = const()[name = tensor("concat_71"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_71_cast_fp16 = transpose(perm = transpose_71_perm_0, x = reshape_70_cast_fp16)[name = tensor("transpose_93")]; + tensor reshape_71_cast_fp16 = reshape(shape = concat_71, x = transpose_71_cast_fp16)[name = tensor("reshape_71_cast_fp16")]; + tensor v_71_perm_0 = const()[name = tensor("v_71_perm_0"), val = tensor([1, 0, -2, -1])]; + tensor var_3029_transpose_x_0 = const()[name = tensor("op_3029_transpose_x_0"), val = tensor(false)]; + tensor var_3029_transpose_y_0 = const()[name = tensor("op_3029_transpose_y_0"), val = tensor(false)]; + tensor transpose_147_cast_fp16 = transpose(perm = transpose_147_perm_0, x = reshape_69_cast_fp16)[name = tensor("transpose_92")]; + tensor var_3029_cast_fp16 = matmul(transpose_x = var_3029_transpose_x_0, transpose_y = var_3029_transpose_y_0, x = q_35_cast_fp16, y = transpose_147_cast_fp16)[name = tensor("op_3029_cast_fp16")]; + tensor var_3030_to_fp16 = const()[name = tensor("op_3030_to_fp16"), val = tensor(0x1.6ap-4)]; + tensor attn_69_cast_fp16 = mul(x = var_3029_cast_fp16, y = var_3030_to_fp16)[name = tensor("attn_69_cast_fp16")]; + tensor input_171_cast_fp16 = add(x = attn_69_cast_fp16, y = causal_mask_to_fp16_palettized)[name = tensor("input_171_cast_fp16")]; + tensor attn_71_cast_fp16 = softmax(axis = var_2913, x = input_171_cast_fp16)[name = tensor("attn_71_cast_fp16")]; + tensor var_3034_transpose_x_0 = const()[name = tensor("op_3034_transpose_x_0"), val = tensor(false)]; + tensor var_3034_transpose_y_0 = const()[name = tensor("op_3034_transpose_y_0"), val = tensor(false)]; + tensor v_71_cast_fp16 = transpose(perm = v_71_perm_0, x = reshape_71_cast_fp16)[name = tensor("transpose_91")]; + tensor var_3034_cast_fp16 = matmul(transpose_x = var_3034_transpose_x_0, transpose_y = var_3034_transpose_y_0, x = attn_71_cast_fp16, y = v_71_cast_fp16)[name = tensor("op_3034_cast_fp16")]; + tensor var_3035_perm_0 = const()[name = tensor("op_3035_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor var_3036 = const()[name = tensor("op_3036"), val = tensor([1, 768, 2048])]; + tensor var_3035_cast_fp16 = transpose(perm = var_3035_perm_0, x = var_3034_cast_fp16)[name = tensor("transpose_90")]; + tensor input_173_cast_fp16 = reshape(shape = var_3036, x = var_3035_cast_fp16)[name = tensor("input_173_cast_fp16")]; + tensor layers_17_self_attn_o_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(272447296))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(274544512))), name = tensor("layers_17_self_attn_o_proj_weight_to_fp16_palettized"), shape = tensor([1024, 2048])]; + tensor linear_122_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_17_self_attn_o_proj_weight_to_fp16_palettized, x = input_173_cast_fp16)[name = tensor("linear_122_cast_fp16")]; + tensor x_391_cast_fp16 = add(x = x_373_cast_fp16, y = linear_122_cast_fp16)[name = tensor("x_391_cast_fp16")]; + tensor var_2912_promoted_3_to_fp16 = const()[name = tensor("op_2912_promoted_3_to_fp16"), val = tensor(0x1p+1)]; + tensor var_3043_cast_fp16 = pow(x = x_391_cast_fp16, y = var_2912_promoted_3_to_fp16)[name = tensor("op_3043_cast_fp16")]; + tensor var_3045_axes_0 = const()[name = tensor("op_3045_axes_0"), val = tensor([-1])]; + tensor var_3045_keep_dims_0 = const()[name = tensor("op_3045_keep_dims_0"), val = tensor(true)]; + tensor var_3045_cast_fp16 = reduce_mean(axes = var_3045_axes_0, keep_dims = var_3045_keep_dims_0, x = var_3043_cast_fp16)[name = tensor("op_3045_cast_fp16")]; + tensor var_3046_to_fp16 = const()[name = tensor("op_3046_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_3047_cast_fp16 = add(x = var_3045_cast_fp16, y = var_3046_to_fp16)[name = tensor("op_3047_cast_fp16")]; + tensor norm_143_epsilon_0 = const()[name = tensor("norm_143_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_143_cast_fp16 = rsqrt(epsilon = norm_143_epsilon_0, x = var_3047_cast_fp16)[name = tensor("norm_143_cast_fp16")]; + tensor var_3049_cast_fp16 = mul(x = x_391_cast_fp16, y = norm_143_cast_fp16)[name = tensor("op_3049_cast_fp16")]; + tensor layers_17_post_attention_layernorm_weight_to_fp16 = const()[name = tensor("layers_17_post_attention_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(274545088)))]; + tensor var_3050_cast_fp16 = mul(x = var_3049_cast_fp16, y = layers_17_post_attention_layernorm_weight_to_fp16)[name = tensor("op_3050_cast_fp16")]; + tensor layers_17_mlp_gate_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(274547200))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(277692992))), name = tensor("layers_17_mlp_gate_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_123_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_17_mlp_gate_proj_weight_to_fp16_palettized, x = var_3050_cast_fp16)[name = tensor("linear_123_cast_fp16")]; + tensor var_3060_cast_fp16 = silu(x = linear_123_cast_fp16)[name = tensor("op_3060_cast_fp16")]; + tensor layers_17_mlp_up_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(277693568))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(280839360))), name = tensor("layers_17_mlp_up_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_124_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_17_mlp_up_proj_weight_to_fp16_palettized, x = var_3050_cast_fp16)[name = tensor("linear_124_cast_fp16")]; + tensor input_179_cast_fp16 = mul(x = var_3060_cast_fp16, y = linear_124_cast_fp16)[name = tensor("input_179_cast_fp16")]; + tensor layers_17_mlp_down_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(280839936))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(283985728))), name = tensor("layers_17_mlp_down_proj_weight_to_fp16_palettized"), shape = tensor([1024, 3072])]; + tensor linear_125_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_17_mlp_down_proj_weight_to_fp16_palettized, x = input_179_cast_fp16)[name = tensor("linear_125_cast_fp16")]; + tensor x_395_cast_fp16 = add(x = x_391_cast_fp16, y = linear_125_cast_fp16)[name = tensor("x_395_cast_fp16")]; + tensor var_3080 = const()[name = tensor("op_3080"), val = tensor(-1)]; + tensor var_3079_promoted_to_fp16 = const()[name = tensor("op_3079_promoted_to_fp16"), val = tensor(0x1p+1)]; + tensor var_3089_cast_fp16 = pow(x = x_395_cast_fp16, y = var_3079_promoted_to_fp16)[name = tensor("op_3089_cast_fp16")]; + tensor var_3091_axes_0 = const()[name = tensor("op_3091_axes_0"), val = tensor([-1])]; + tensor var_3091_keep_dims_0 = const()[name = tensor("op_3091_keep_dims_0"), val = tensor(true)]; + tensor var_3091_cast_fp16 = reduce_mean(axes = var_3091_axes_0, keep_dims = var_3091_keep_dims_0, x = var_3089_cast_fp16)[name = tensor("op_3091_cast_fp16")]; + tensor var_3092_to_fp16 = const()[name = tensor("op_3092_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_3093_cast_fp16 = add(x = var_3091_cast_fp16, y = var_3092_to_fp16)[name = tensor("op_3093_cast_fp16")]; + tensor norm_145_epsilon_0 = const()[name = tensor("norm_145_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_145_cast_fp16 = rsqrt(epsilon = norm_145_epsilon_0, x = var_3093_cast_fp16)[name = tensor("norm_145_cast_fp16")]; + tensor var_3095_cast_fp16 = mul(x = x_395_cast_fp16, y = norm_145_cast_fp16)[name = tensor("op_3095_cast_fp16")]; + tensor layers_18_input_layernorm_weight_to_fp16 = const()[name = tensor("layers_18_input_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(283986304)))]; + tensor var_3096_cast_fp16 = mul(x = var_3095_cast_fp16, y = layers_18_input_layernorm_weight_to_fp16)[name = tensor("op_3096_cast_fp16")]; + tensor layers_18_self_attn_q_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(283988416))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(286085632))), name = tensor("layers_18_self_attn_q_proj_weight_to_fp16_palettized"), shape = tensor([2048, 1024])]; + tensor linear_126_cast_fp16 = linear(bias = linear_0_bias_0_to_fp16, weight = layers_18_self_attn_q_proj_weight_to_fp16_palettized, x = var_3096_cast_fp16)[name = tensor("linear_126_cast_fp16")]; + tensor var_3112 = const()[name = tensor("op_3112"), val = tensor([1, 768, 16, 128])]; + tensor var_3113_cast_fp16 = reshape(shape = var_3112, x = linear_126_cast_fp16)[name = tensor("op_3113_cast_fp16")]; + tensor x_401_perm_0 = const()[name = tensor("x_401_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_18_self_attn_k_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(286086208))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(287134848))), name = tensor("layers_18_self_attn_k_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_127_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_18_self_attn_k_proj_weight_to_fp16_palettized, x = var_3096_cast_fp16)[name = tensor("linear_127_cast_fp16")]; + tensor var_3117 = const()[name = tensor("op_3117"), val = tensor([1, 768, 8, 128])]; + tensor var_3118_cast_fp16 = reshape(shape = var_3117, x = linear_127_cast_fp16)[name = tensor("op_3118_cast_fp16")]; + tensor x_405_perm_0 = const()[name = tensor("x_405_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_18_self_attn_v_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(287135424))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(288184064))), name = tensor("layers_18_self_attn_v_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_128_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_18_self_attn_v_proj_weight_to_fp16_palettized, x = var_3096_cast_fp16)[name = tensor("linear_128_cast_fp16")]; + tensor var_3122 = const()[name = tensor("op_3122"), val = tensor([1, 768, 8, 128])]; + tensor var_3123_cast_fp16 = reshape(shape = var_3122, x = linear_128_cast_fp16)[name = tensor("op_3123_cast_fp16")]; + tensor transpose_148_perm_0 = const()[name = tensor("transpose_148_perm_0"), val = tensor([2, 0, 1, 3])]; + tensor var_3079_promoted_1_to_fp16 = const()[name = tensor("op_3079_promoted_1_to_fp16"), val = tensor(0x1p+1)]; + tensor x_401_cast_fp16 = transpose(perm = x_401_perm_0, x = var_3113_cast_fp16)[name = tensor("transpose_89")]; + tensor var_3127_cast_fp16 = pow(x = x_401_cast_fp16, y = var_3079_promoted_1_to_fp16)[name = tensor("op_3127_cast_fp16")]; + tensor var_3129_axes_0 = const()[name = tensor("op_3129_axes_0"), val = tensor([-1])]; + tensor var_3129_keep_dims_0 = const()[name = tensor("op_3129_keep_dims_0"), val = tensor(true)]; + tensor var_3129_cast_fp16 = reduce_mean(axes = var_3129_axes_0, keep_dims = var_3129_keep_dims_0, x = var_3127_cast_fp16)[name = tensor("op_3129_cast_fp16")]; + tensor var_3130_to_fp16 = const()[name = tensor("op_3130_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_3131_cast_fp16 = add(x = var_3129_cast_fp16, y = var_3130_to_fp16)[name = tensor("op_3131_cast_fp16")]; + tensor norm_147_epsilon_0 = const()[name = tensor("norm_147_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_147_cast_fp16 = rsqrt(epsilon = norm_147_epsilon_0, x = var_3131_cast_fp16)[name = tensor("norm_147_cast_fp16")]; + tensor var_3133_cast_fp16 = mul(x = x_401_cast_fp16, y = norm_147_cast_fp16)[name = tensor("op_3133_cast_fp16")]; + tensor layers_18_self_attn_q_norm_weight_to_fp16 = const()[name = tensor("layers_18_self_attn_q_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(288184640)))]; + tensor var_3134_cast_fp16 = mul(x = var_3133_cast_fp16, y = layers_18_self_attn_q_norm_weight_to_fp16)[name = tensor("op_3134_cast_fp16")]; + tensor var_3079_promoted_2_to_fp16 = const()[name = tensor("op_3079_promoted_2_to_fp16"), val = tensor(0x1p+1)]; + tensor x_405_cast_fp16 = transpose(perm = x_405_perm_0, x = var_3118_cast_fp16)[name = tensor("transpose_88")]; + tensor var_3138_cast_fp16 = pow(x = x_405_cast_fp16, y = var_3079_promoted_2_to_fp16)[name = tensor("op_3138_cast_fp16")]; + tensor var_3140_axes_0 = const()[name = tensor("op_3140_axes_0"), val = tensor([-1])]; + tensor var_3140_keep_dims_0 = const()[name = tensor("op_3140_keep_dims_0"), val = tensor(true)]; + tensor var_3140_cast_fp16 = reduce_mean(axes = var_3140_axes_0, keep_dims = var_3140_keep_dims_0, x = var_3138_cast_fp16)[name = tensor("op_3140_cast_fp16")]; + tensor var_3141_to_fp16 = const()[name = tensor("op_3141_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_3142_cast_fp16 = add(x = var_3140_cast_fp16, y = var_3141_to_fp16)[name = tensor("op_3142_cast_fp16")]; + tensor norm_149_epsilon_0 = const()[name = tensor("norm_149_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_149_cast_fp16 = rsqrt(epsilon = norm_149_epsilon_0, x = var_3142_cast_fp16)[name = tensor("norm_149_cast_fp16")]; + tensor var_3144_cast_fp16 = mul(x = x_405_cast_fp16, y = norm_149_cast_fp16)[name = tensor("op_3144_cast_fp16")]; + tensor layers_18_self_attn_k_norm_weight_to_fp16 = const()[name = tensor("layers_18_self_attn_k_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(288184960)))]; + tensor var_3145_cast_fp16 = mul(x = var_3144_cast_fp16, y = layers_18_self_attn_k_norm_weight_to_fp16)[name = tensor("op_3145_cast_fp16")]; + tensor x1_73_begin_0 = const()[name = tensor("x1_73_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_73_end_0 = const()[name = tensor("x1_73_end_0"), val = tensor([1, 16, 768, 64])]; + tensor x1_73_end_mask_0 = const()[name = tensor("x1_73_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_73_cast_fp16 = slice_by_index(begin = x1_73_begin_0, end = x1_73_end_0, end_mask = x1_73_end_mask_0, x = var_3134_cast_fp16)[name = tensor("x1_73_cast_fp16")]; + tensor x2_73_begin_0 = const()[name = tensor("x2_73_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_73_end_0 = const()[name = tensor("x2_73_end_0"), val = tensor([1, 16, 768, 128])]; + tensor x2_73_end_mask_0 = const()[name = tensor("x2_73_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_73_cast_fp16 = slice_by_index(begin = x2_73_begin_0, end = x2_73_end_0, end_mask = x2_73_end_mask_0, x = var_3134_cast_fp16)[name = tensor("x2_73_cast_fp16")]; + tensor var_3162_cast_fp16 = mul(x = x1_73_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_3162_cast_fp16")]; + tensor var_3163_cast_fp16 = mul(x = x2_73_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_3163_cast_fp16")]; + tensor var_3164_cast_fp16 = sub(x = var_3162_cast_fp16, y = var_3163_cast_fp16)[name = tensor("op_3164_cast_fp16")]; + tensor var_3165_cast_fp16 = mul(x = x2_73_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_3165_cast_fp16")]; + tensor var_3166_cast_fp16 = mul(x = x1_73_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_3166_cast_fp16")]; + tensor var_3167_cast_fp16 = add(x = var_3165_cast_fp16, y = var_3166_cast_fp16)[name = tensor("op_3167_cast_fp16")]; + tensor q_37_interleave_0 = const()[name = tensor("q_37_interleave_0"), val = tensor(false)]; + tensor q_37_cast_fp16 = concat(axis = var_3080, interleave = q_37_interleave_0, values = (var_3164_cast_fp16, var_3167_cast_fp16))[name = tensor("q_37_cast_fp16")]; + tensor x1_75_begin_0 = const()[name = tensor("x1_75_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_75_end_0 = const()[name = tensor("x1_75_end_0"), val = tensor([1, 8, 768, 64])]; + tensor x1_75_end_mask_0 = const()[name = tensor("x1_75_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_75_cast_fp16 = slice_by_index(begin = x1_75_begin_0, end = x1_75_end_0, end_mask = x1_75_end_mask_0, x = var_3145_cast_fp16)[name = tensor("x1_75_cast_fp16")]; + tensor x2_75_begin_0 = const()[name = tensor("x2_75_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_75_end_0 = const()[name = tensor("x2_75_end_0"), val = tensor([1, 8, 768, 128])]; + tensor x2_75_end_mask_0 = const()[name = tensor("x2_75_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_75_cast_fp16 = slice_by_index(begin = x2_75_begin_0, end = x2_75_end_0, end_mask = x2_75_end_mask_0, x = var_3145_cast_fp16)[name = tensor("x2_75_cast_fp16")]; + tensor var_3185_cast_fp16 = mul(x = x1_75_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_3185_cast_fp16")]; + tensor var_3186_cast_fp16 = mul(x = x2_75_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_3186_cast_fp16")]; + tensor var_3187_cast_fp16 = sub(x = var_3185_cast_fp16, y = var_3186_cast_fp16)[name = tensor("op_3187_cast_fp16")]; + tensor var_3188_cast_fp16 = mul(x = x2_75_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_3188_cast_fp16")]; + tensor var_3189_cast_fp16 = mul(x = x1_75_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_3189_cast_fp16")]; + tensor var_3190_cast_fp16 = add(x = var_3188_cast_fp16, y = var_3189_cast_fp16)[name = tensor("op_3190_cast_fp16")]; + tensor k_73_interleave_0 = const()[name = tensor("k_73_interleave_0"), val = tensor(false)]; + tensor k_73_cast_fp16 = concat(axis = var_3080, interleave = k_73_interleave_0, values = (var_3187_cast_fp16, var_3190_cast_fp16))[name = tensor("k_73_cast_fp16")]; + tensor transpose_72_perm_0 = const()[name = tensor("transpose_72_perm_0"), val = tensor([1, 0, 2, 3])]; + tensor tile_36_reps_0 = const()[name = tensor("tile_36_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_72_cast_fp16 = transpose(perm = transpose_72_perm_0, x = k_73_cast_fp16)[name = tensor("transpose_87")]; + tensor tile_36_cast_fp16 = tile(reps = tile_36_reps_0, x = transpose_72_cast_fp16)[name = tensor("tile_36_cast_fp16")]; + tensor concat_72 = const()[name = tensor("concat_72"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_72_cast_fp16 = reshape(shape = concat_72, x = tile_36_cast_fp16)[name = tensor("reshape_72_cast_fp16")]; + tensor transpose_73_perm_0 = const()[name = tensor("transpose_73_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_73 = const()[name = tensor("concat_73"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_73_cast_fp16 = transpose(perm = transpose_73_perm_0, x = reshape_72_cast_fp16)[name = tensor("transpose_86")]; + tensor reshape_73_cast_fp16 = reshape(shape = concat_73, x = transpose_73_cast_fp16)[name = tensor("reshape_73_cast_fp16")]; + tensor transpose_149_perm_0 = const()[name = tensor("transpose_149_perm_0"), val = tensor([1, 0, -1, -2])]; + tensor tile_37_reps_0 = const()[name = tensor("tile_37_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_148_cast_fp16 = transpose(perm = transpose_148_perm_0, x = var_3123_cast_fp16)[name = tensor("transpose_85")]; + tensor tile_37_cast_fp16 = tile(reps = tile_37_reps_0, x = transpose_148_cast_fp16)[name = tensor("tile_37_cast_fp16")]; + tensor concat_74 = const()[name = tensor("concat_74"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_74_cast_fp16 = reshape(shape = concat_74, x = tile_37_cast_fp16)[name = tensor("reshape_74_cast_fp16")]; + tensor transpose_75_perm_0 = const()[name = tensor("transpose_75_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_75 = const()[name = tensor("concat_75"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_75_cast_fp16 = transpose(perm = transpose_75_perm_0, x = reshape_74_cast_fp16)[name = tensor("transpose_84")]; + tensor reshape_75_cast_fp16 = reshape(shape = concat_75, x = transpose_75_cast_fp16)[name = tensor("reshape_75_cast_fp16")]; + tensor v_75_perm_0 = const()[name = tensor("v_75_perm_0"), val = tensor([1, 0, -2, -1])]; + tensor var_3196_transpose_x_0 = const()[name = tensor("op_3196_transpose_x_0"), val = tensor(false)]; + tensor var_3196_transpose_y_0 = const()[name = tensor("op_3196_transpose_y_0"), val = tensor(false)]; + tensor transpose_149_cast_fp16 = transpose(perm = transpose_149_perm_0, x = reshape_73_cast_fp16)[name = tensor("transpose_83")]; + tensor var_3196_cast_fp16 = matmul(transpose_x = var_3196_transpose_x_0, transpose_y = var_3196_transpose_y_0, x = q_37_cast_fp16, y = transpose_149_cast_fp16)[name = tensor("op_3196_cast_fp16")]; + tensor var_3197_to_fp16 = const()[name = tensor("op_3197_to_fp16"), val = tensor(0x1.6ap-4)]; + tensor attn_73_cast_fp16 = mul(x = var_3196_cast_fp16, y = var_3197_to_fp16)[name = tensor("attn_73_cast_fp16")]; + tensor input_181_cast_fp16 = add(x = attn_73_cast_fp16, y = causal_mask_to_fp16_palettized)[name = tensor("input_181_cast_fp16")]; + tensor attn_75_cast_fp16 = softmax(axis = var_3080, x = input_181_cast_fp16)[name = tensor("attn_75_cast_fp16")]; + tensor var_3201_transpose_x_0 = const()[name = tensor("op_3201_transpose_x_0"), val = tensor(false)]; + tensor var_3201_transpose_y_0 = const()[name = tensor("op_3201_transpose_y_0"), val = tensor(false)]; + tensor v_75_cast_fp16 = transpose(perm = v_75_perm_0, x = reshape_75_cast_fp16)[name = tensor("transpose_82")]; + tensor var_3201_cast_fp16 = matmul(transpose_x = var_3201_transpose_x_0, transpose_y = var_3201_transpose_y_0, x = attn_75_cast_fp16, y = v_75_cast_fp16)[name = tensor("op_3201_cast_fp16")]; + tensor var_3202_perm_0 = const()[name = tensor("op_3202_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor var_3203 = const()[name = tensor("op_3203"), val = tensor([1, 768, 2048])]; + tensor var_3202_cast_fp16 = transpose(perm = var_3202_perm_0, x = var_3201_cast_fp16)[name = tensor("transpose_81")]; + tensor input_183_cast_fp16 = reshape(shape = var_3203, x = var_3202_cast_fp16)[name = tensor("input_183_cast_fp16")]; + tensor layers_18_self_attn_o_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(288185280))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(290282496))), name = tensor("layers_18_self_attn_o_proj_weight_to_fp16_palettized"), shape = tensor([1024, 2048])]; + tensor linear_129_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_18_self_attn_o_proj_weight_to_fp16_palettized, x = input_183_cast_fp16)[name = tensor("linear_129_cast_fp16")]; + tensor x_413_cast_fp16 = add(x = x_395_cast_fp16, y = linear_129_cast_fp16)[name = tensor("x_413_cast_fp16")]; + tensor var_3079_promoted_3_to_fp16 = const()[name = tensor("op_3079_promoted_3_to_fp16"), val = tensor(0x1p+1)]; + tensor var_3210_cast_fp16 = pow(x = x_413_cast_fp16, y = var_3079_promoted_3_to_fp16)[name = tensor("op_3210_cast_fp16")]; + tensor var_3212_axes_0 = const()[name = tensor("op_3212_axes_0"), val = tensor([-1])]; + tensor var_3212_keep_dims_0 = const()[name = tensor("op_3212_keep_dims_0"), val = tensor(true)]; + tensor var_3212_cast_fp16 = reduce_mean(axes = var_3212_axes_0, keep_dims = var_3212_keep_dims_0, x = var_3210_cast_fp16)[name = tensor("op_3212_cast_fp16")]; + tensor var_3213_to_fp16 = const()[name = tensor("op_3213_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_3214_cast_fp16 = add(x = var_3212_cast_fp16, y = var_3213_to_fp16)[name = tensor("op_3214_cast_fp16")]; + tensor norm_151_epsilon_0 = const()[name = tensor("norm_151_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_151_cast_fp16 = rsqrt(epsilon = norm_151_epsilon_0, x = var_3214_cast_fp16)[name = tensor("norm_151_cast_fp16")]; + tensor var_3216_cast_fp16 = mul(x = x_413_cast_fp16, y = norm_151_cast_fp16)[name = tensor("op_3216_cast_fp16")]; + tensor layers_18_post_attention_layernorm_weight_to_fp16 = const()[name = tensor("layers_18_post_attention_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(290283072)))]; + tensor var_3217_cast_fp16 = mul(x = var_3216_cast_fp16, y = layers_18_post_attention_layernorm_weight_to_fp16)[name = tensor("op_3217_cast_fp16")]; + tensor layers_18_mlp_gate_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(290285184))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(293430976))), name = tensor("layers_18_mlp_gate_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_130_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_18_mlp_gate_proj_weight_to_fp16_palettized, x = var_3217_cast_fp16)[name = tensor("linear_130_cast_fp16")]; + tensor var_3227_cast_fp16 = silu(x = linear_130_cast_fp16)[name = tensor("op_3227_cast_fp16")]; + tensor layers_18_mlp_up_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(293431552))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(296577344))), name = tensor("layers_18_mlp_up_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_131_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_18_mlp_up_proj_weight_to_fp16_palettized, x = var_3217_cast_fp16)[name = tensor("linear_131_cast_fp16")]; + tensor input_189_cast_fp16 = mul(x = var_3227_cast_fp16, y = linear_131_cast_fp16)[name = tensor("input_189_cast_fp16")]; + tensor layers_18_mlp_down_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(296577920))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(299723712))), name = tensor("layers_18_mlp_down_proj_weight_to_fp16_palettized"), shape = tensor([1024, 3072])]; + tensor linear_132_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_18_mlp_down_proj_weight_to_fp16_palettized, x = input_189_cast_fp16)[name = tensor("linear_132_cast_fp16")]; + tensor x_417_cast_fp16 = add(x = x_413_cast_fp16, y = linear_132_cast_fp16)[name = tensor("x_417_cast_fp16")]; + tensor var_3247 = const()[name = tensor("op_3247"), val = tensor(-1)]; + tensor var_3246_promoted_to_fp16 = const()[name = tensor("op_3246_promoted_to_fp16"), val = tensor(0x1p+1)]; + tensor var_3256_cast_fp16 = pow(x = x_417_cast_fp16, y = var_3246_promoted_to_fp16)[name = tensor("op_3256_cast_fp16")]; + tensor var_3258_axes_0 = const()[name = tensor("op_3258_axes_0"), val = tensor([-1])]; + tensor var_3258_keep_dims_0 = const()[name = tensor("op_3258_keep_dims_0"), val = tensor(true)]; + tensor var_3258_cast_fp16 = reduce_mean(axes = var_3258_axes_0, keep_dims = var_3258_keep_dims_0, x = var_3256_cast_fp16)[name = tensor("op_3258_cast_fp16")]; + tensor var_3259_to_fp16 = const()[name = tensor("op_3259_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_3260_cast_fp16 = add(x = var_3258_cast_fp16, y = var_3259_to_fp16)[name = tensor("op_3260_cast_fp16")]; + tensor norm_153_epsilon_0 = const()[name = tensor("norm_153_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_153_cast_fp16 = rsqrt(epsilon = norm_153_epsilon_0, x = var_3260_cast_fp16)[name = tensor("norm_153_cast_fp16")]; + tensor var_3262_cast_fp16 = mul(x = x_417_cast_fp16, y = norm_153_cast_fp16)[name = tensor("op_3262_cast_fp16")]; + tensor layers_19_input_layernorm_weight_to_fp16 = const()[name = tensor("layers_19_input_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(299724288)))]; + tensor var_3263_cast_fp16 = mul(x = var_3262_cast_fp16, y = layers_19_input_layernorm_weight_to_fp16)[name = tensor("op_3263_cast_fp16")]; + tensor layers_19_self_attn_q_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(299726400))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(301823616))), name = tensor("layers_19_self_attn_q_proj_weight_to_fp16_palettized"), shape = tensor([2048, 1024])]; + tensor linear_133_cast_fp16 = linear(bias = linear_0_bias_0_to_fp16, weight = layers_19_self_attn_q_proj_weight_to_fp16_palettized, x = var_3263_cast_fp16)[name = tensor("linear_133_cast_fp16")]; + tensor var_3279 = const()[name = tensor("op_3279"), val = tensor([1, 768, 16, 128])]; + tensor var_3280_cast_fp16 = reshape(shape = var_3279, x = linear_133_cast_fp16)[name = tensor("op_3280_cast_fp16")]; + tensor x_423_perm_0 = const()[name = tensor("x_423_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_19_self_attn_k_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(301824192))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(302872832))), name = tensor("layers_19_self_attn_k_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_134_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_19_self_attn_k_proj_weight_to_fp16_palettized, x = var_3263_cast_fp16)[name = tensor("linear_134_cast_fp16")]; + tensor var_3284 = const()[name = tensor("op_3284"), val = tensor([1, 768, 8, 128])]; + tensor var_3285_cast_fp16 = reshape(shape = var_3284, x = linear_134_cast_fp16)[name = tensor("op_3285_cast_fp16")]; + tensor x_427_perm_0 = const()[name = tensor("x_427_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_19_self_attn_v_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(302873408))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(303922048))), name = tensor("layers_19_self_attn_v_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_135_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_19_self_attn_v_proj_weight_to_fp16_palettized, x = var_3263_cast_fp16)[name = tensor("linear_135_cast_fp16")]; + tensor var_3289 = const()[name = tensor("op_3289"), val = tensor([1, 768, 8, 128])]; + tensor var_3290_cast_fp16 = reshape(shape = var_3289, x = linear_135_cast_fp16)[name = tensor("op_3290_cast_fp16")]; + tensor transpose_150_perm_0 = const()[name = tensor("transpose_150_perm_0"), val = tensor([2, 0, 1, 3])]; + tensor var_3246_promoted_1_to_fp16 = const()[name = tensor("op_3246_promoted_1_to_fp16"), val = tensor(0x1p+1)]; + tensor x_423_cast_fp16 = transpose(perm = x_423_perm_0, x = var_3280_cast_fp16)[name = tensor("transpose_80")]; + tensor var_3294_cast_fp16 = pow(x = x_423_cast_fp16, y = var_3246_promoted_1_to_fp16)[name = tensor("op_3294_cast_fp16")]; + tensor var_3296_axes_0 = const()[name = tensor("op_3296_axes_0"), val = tensor([-1])]; + tensor var_3296_keep_dims_0 = const()[name = tensor("op_3296_keep_dims_0"), val = tensor(true)]; + tensor var_3296_cast_fp16 = reduce_mean(axes = var_3296_axes_0, keep_dims = var_3296_keep_dims_0, x = var_3294_cast_fp16)[name = tensor("op_3296_cast_fp16")]; + tensor var_3297_to_fp16 = const()[name = tensor("op_3297_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_3298_cast_fp16 = add(x = var_3296_cast_fp16, y = var_3297_to_fp16)[name = tensor("op_3298_cast_fp16")]; + tensor norm_155_epsilon_0 = const()[name = tensor("norm_155_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_155_cast_fp16 = rsqrt(epsilon = norm_155_epsilon_0, x = var_3298_cast_fp16)[name = tensor("norm_155_cast_fp16")]; + tensor var_3300_cast_fp16 = mul(x = x_423_cast_fp16, y = norm_155_cast_fp16)[name = tensor("op_3300_cast_fp16")]; + tensor layers_19_self_attn_q_norm_weight_to_fp16 = const()[name = tensor("layers_19_self_attn_q_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(303922624)))]; + tensor var_3301_cast_fp16 = mul(x = var_3300_cast_fp16, y = layers_19_self_attn_q_norm_weight_to_fp16)[name = tensor("op_3301_cast_fp16")]; + tensor var_3246_promoted_2_to_fp16 = const()[name = tensor("op_3246_promoted_2_to_fp16"), val = tensor(0x1p+1)]; + tensor x_427_cast_fp16 = transpose(perm = x_427_perm_0, x = var_3285_cast_fp16)[name = tensor("transpose_79")]; + tensor var_3305_cast_fp16 = pow(x = x_427_cast_fp16, y = var_3246_promoted_2_to_fp16)[name = tensor("op_3305_cast_fp16")]; + tensor var_3307_axes_0 = const()[name = tensor("op_3307_axes_0"), val = tensor([-1])]; + tensor var_3307_keep_dims_0 = const()[name = tensor("op_3307_keep_dims_0"), val = tensor(true)]; + tensor var_3307_cast_fp16 = reduce_mean(axes = var_3307_axes_0, keep_dims = var_3307_keep_dims_0, x = var_3305_cast_fp16)[name = tensor("op_3307_cast_fp16")]; + tensor var_3308_to_fp16 = const()[name = tensor("op_3308_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_3309_cast_fp16 = add(x = var_3307_cast_fp16, y = var_3308_to_fp16)[name = tensor("op_3309_cast_fp16")]; + tensor norm_157_epsilon_0 = const()[name = tensor("norm_157_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_157_cast_fp16 = rsqrt(epsilon = norm_157_epsilon_0, x = var_3309_cast_fp16)[name = tensor("norm_157_cast_fp16")]; + tensor var_3311_cast_fp16 = mul(x = x_427_cast_fp16, y = norm_157_cast_fp16)[name = tensor("op_3311_cast_fp16")]; + tensor layers_19_self_attn_k_norm_weight_to_fp16 = const()[name = tensor("layers_19_self_attn_k_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(303922944)))]; + tensor var_3312_cast_fp16 = mul(x = var_3311_cast_fp16, y = layers_19_self_attn_k_norm_weight_to_fp16)[name = tensor("op_3312_cast_fp16")]; + tensor x1_77_begin_0 = const()[name = tensor("x1_77_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_77_end_0 = const()[name = tensor("x1_77_end_0"), val = tensor([1, 16, 768, 64])]; + tensor x1_77_end_mask_0 = const()[name = tensor("x1_77_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_77_cast_fp16 = slice_by_index(begin = x1_77_begin_0, end = x1_77_end_0, end_mask = x1_77_end_mask_0, x = var_3301_cast_fp16)[name = tensor("x1_77_cast_fp16")]; + tensor x2_77_begin_0 = const()[name = tensor("x2_77_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_77_end_0 = const()[name = tensor("x2_77_end_0"), val = tensor([1, 16, 768, 128])]; + tensor x2_77_end_mask_0 = const()[name = tensor("x2_77_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_77_cast_fp16 = slice_by_index(begin = x2_77_begin_0, end = x2_77_end_0, end_mask = x2_77_end_mask_0, x = var_3301_cast_fp16)[name = tensor("x2_77_cast_fp16")]; + tensor var_3329_cast_fp16 = mul(x = x1_77_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_3329_cast_fp16")]; + tensor var_3330_cast_fp16 = mul(x = x2_77_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_3330_cast_fp16")]; + tensor var_3331_cast_fp16 = sub(x = var_3329_cast_fp16, y = var_3330_cast_fp16)[name = tensor("op_3331_cast_fp16")]; + tensor var_3332_cast_fp16 = mul(x = x2_77_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_3332_cast_fp16")]; + tensor var_3333_cast_fp16 = mul(x = x1_77_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_3333_cast_fp16")]; + tensor var_3334_cast_fp16 = add(x = var_3332_cast_fp16, y = var_3333_cast_fp16)[name = tensor("op_3334_cast_fp16")]; + tensor q_39_interleave_0 = const()[name = tensor("q_39_interleave_0"), val = tensor(false)]; + tensor q_39_cast_fp16 = concat(axis = var_3247, interleave = q_39_interleave_0, values = (var_3331_cast_fp16, var_3334_cast_fp16))[name = tensor("q_39_cast_fp16")]; + tensor x1_79_begin_0 = const()[name = tensor("x1_79_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_79_end_0 = const()[name = tensor("x1_79_end_0"), val = tensor([1, 8, 768, 64])]; + tensor x1_79_end_mask_0 = const()[name = tensor("x1_79_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_79_cast_fp16 = slice_by_index(begin = x1_79_begin_0, end = x1_79_end_0, end_mask = x1_79_end_mask_0, x = var_3312_cast_fp16)[name = tensor("x1_79_cast_fp16")]; + tensor x2_79_begin_0 = const()[name = tensor("x2_79_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_79_end_0 = const()[name = tensor("x2_79_end_0"), val = tensor([1, 8, 768, 128])]; + tensor x2_79_end_mask_0 = const()[name = tensor("x2_79_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_79_cast_fp16 = slice_by_index(begin = x2_79_begin_0, end = x2_79_end_0, end_mask = x2_79_end_mask_0, x = var_3312_cast_fp16)[name = tensor("x2_79_cast_fp16")]; + tensor var_3352_cast_fp16 = mul(x = x1_79_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_3352_cast_fp16")]; + tensor var_3353_cast_fp16 = mul(x = x2_79_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_3353_cast_fp16")]; + tensor var_3354_cast_fp16 = sub(x = var_3352_cast_fp16, y = var_3353_cast_fp16)[name = tensor("op_3354_cast_fp16")]; + tensor var_3355_cast_fp16 = mul(x = x2_79_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_3355_cast_fp16")]; + tensor var_3356_cast_fp16 = mul(x = x1_79_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_3356_cast_fp16")]; + tensor var_3357_cast_fp16 = add(x = var_3355_cast_fp16, y = var_3356_cast_fp16)[name = tensor("op_3357_cast_fp16")]; + tensor k_77_interleave_0 = const()[name = tensor("k_77_interleave_0"), val = tensor(false)]; + tensor k_77_cast_fp16 = concat(axis = var_3247, interleave = k_77_interleave_0, values = (var_3354_cast_fp16, var_3357_cast_fp16))[name = tensor("k_77_cast_fp16")]; + tensor transpose_76_perm_0 = const()[name = tensor("transpose_76_perm_0"), val = tensor([1, 0, 2, 3])]; + tensor tile_38_reps_0 = const()[name = tensor("tile_38_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_76_cast_fp16 = transpose(perm = transpose_76_perm_0, x = k_77_cast_fp16)[name = tensor("transpose_78")]; + tensor tile_38_cast_fp16 = tile(reps = tile_38_reps_0, x = transpose_76_cast_fp16)[name = tensor("tile_38_cast_fp16")]; + tensor concat_76 = const()[name = tensor("concat_76"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_76_cast_fp16 = reshape(shape = concat_76, x = tile_38_cast_fp16)[name = tensor("reshape_76_cast_fp16")]; + tensor transpose_77_perm_0 = const()[name = tensor("transpose_77_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_77 = const()[name = tensor("concat_77"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_77_cast_fp16 = transpose(perm = transpose_77_perm_0, x = reshape_76_cast_fp16)[name = tensor("transpose_77")]; + tensor reshape_77_cast_fp16 = reshape(shape = concat_77, x = transpose_77_cast_fp16)[name = tensor("reshape_77_cast_fp16")]; + tensor transpose_151_perm_0 = const()[name = tensor("transpose_151_perm_0"), val = tensor([1, 0, -1, -2])]; + tensor tile_39_reps_0 = const()[name = tensor("tile_39_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_150_cast_fp16 = transpose(perm = transpose_150_perm_0, x = var_3290_cast_fp16)[name = tensor("transpose_76")]; + tensor tile_39_cast_fp16 = tile(reps = tile_39_reps_0, x = transpose_150_cast_fp16)[name = tensor("tile_39_cast_fp16")]; + tensor concat_78 = const()[name = tensor("concat_78"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_78_cast_fp16 = reshape(shape = concat_78, x = tile_39_cast_fp16)[name = tensor("reshape_78_cast_fp16")]; + tensor transpose_79_perm_0 = const()[name = tensor("transpose_79_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_79 = const()[name = tensor("concat_79"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_79_cast_fp16 = transpose(perm = transpose_79_perm_0, x = reshape_78_cast_fp16)[name = tensor("transpose_75")]; + tensor reshape_79_cast_fp16 = reshape(shape = concat_79, x = transpose_79_cast_fp16)[name = tensor("reshape_79_cast_fp16")]; + tensor v_79_perm_0 = const()[name = tensor("v_79_perm_0"), val = tensor([1, 0, -2, -1])]; + tensor var_3363_transpose_x_0 = const()[name = tensor("op_3363_transpose_x_0"), val = tensor(false)]; + tensor var_3363_transpose_y_0 = const()[name = tensor("op_3363_transpose_y_0"), val = tensor(false)]; + tensor transpose_151_cast_fp16 = transpose(perm = transpose_151_perm_0, x = reshape_77_cast_fp16)[name = tensor("transpose_74")]; + tensor var_3363_cast_fp16 = matmul(transpose_x = var_3363_transpose_x_0, transpose_y = var_3363_transpose_y_0, x = q_39_cast_fp16, y = transpose_151_cast_fp16)[name = tensor("op_3363_cast_fp16")]; + tensor var_3364_to_fp16 = const()[name = tensor("op_3364_to_fp16"), val = tensor(0x1.6ap-4)]; + tensor attn_77_cast_fp16 = mul(x = var_3363_cast_fp16, y = var_3364_to_fp16)[name = tensor("attn_77_cast_fp16")]; + tensor input_191_cast_fp16 = add(x = attn_77_cast_fp16, y = causal_mask_to_fp16_palettized)[name = tensor("input_191_cast_fp16")]; + tensor attn_79_cast_fp16 = softmax(axis = var_3247, x = input_191_cast_fp16)[name = tensor("attn_79_cast_fp16")]; + tensor var_3368_transpose_x_0 = const()[name = tensor("op_3368_transpose_x_0"), val = tensor(false)]; + tensor var_3368_transpose_y_0 = const()[name = tensor("op_3368_transpose_y_0"), val = tensor(false)]; + tensor v_79_cast_fp16 = transpose(perm = v_79_perm_0, x = reshape_79_cast_fp16)[name = tensor("transpose_73")]; + tensor var_3368_cast_fp16 = matmul(transpose_x = var_3368_transpose_x_0, transpose_y = var_3368_transpose_y_0, x = attn_79_cast_fp16, y = v_79_cast_fp16)[name = tensor("op_3368_cast_fp16")]; + tensor var_3369_perm_0 = const()[name = tensor("op_3369_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor var_3370 = const()[name = tensor("op_3370"), val = tensor([1, 768, 2048])]; + tensor var_3369_cast_fp16 = transpose(perm = var_3369_perm_0, x = var_3368_cast_fp16)[name = tensor("transpose_72")]; + tensor input_193_cast_fp16 = reshape(shape = var_3370, x = var_3369_cast_fp16)[name = tensor("input_193_cast_fp16")]; + tensor layers_19_self_attn_o_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(303923264))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(306020480))), name = tensor("layers_19_self_attn_o_proj_weight_to_fp16_palettized"), shape = tensor([1024, 2048])]; + tensor linear_136_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_19_self_attn_o_proj_weight_to_fp16_palettized, x = input_193_cast_fp16)[name = tensor("linear_136_cast_fp16")]; + tensor x_435_cast_fp16 = add(x = x_417_cast_fp16, y = linear_136_cast_fp16)[name = tensor("x_435_cast_fp16")]; + tensor var_3246_promoted_3_to_fp16 = const()[name = tensor("op_3246_promoted_3_to_fp16"), val = tensor(0x1p+1)]; + tensor var_3377_cast_fp16 = pow(x = x_435_cast_fp16, y = var_3246_promoted_3_to_fp16)[name = tensor("op_3377_cast_fp16")]; + tensor var_3379_axes_0 = const()[name = tensor("op_3379_axes_0"), val = tensor([-1])]; + tensor var_3379_keep_dims_0 = const()[name = tensor("op_3379_keep_dims_0"), val = tensor(true)]; + tensor var_3379_cast_fp16 = reduce_mean(axes = var_3379_axes_0, keep_dims = var_3379_keep_dims_0, x = var_3377_cast_fp16)[name = tensor("op_3379_cast_fp16")]; + tensor var_3380_to_fp16 = const()[name = tensor("op_3380_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_3381_cast_fp16 = add(x = var_3379_cast_fp16, y = var_3380_to_fp16)[name = tensor("op_3381_cast_fp16")]; + tensor norm_159_epsilon_0 = const()[name = tensor("norm_159_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_159_cast_fp16 = rsqrt(epsilon = norm_159_epsilon_0, x = var_3381_cast_fp16)[name = tensor("norm_159_cast_fp16")]; + tensor var_3383_cast_fp16 = mul(x = x_435_cast_fp16, y = norm_159_cast_fp16)[name = tensor("op_3383_cast_fp16")]; + tensor layers_19_post_attention_layernorm_weight_to_fp16 = const()[name = tensor("layers_19_post_attention_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(306021056)))]; + tensor var_3384_cast_fp16 = mul(x = var_3383_cast_fp16, y = layers_19_post_attention_layernorm_weight_to_fp16)[name = tensor("op_3384_cast_fp16")]; + tensor layers_19_mlp_gate_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(306023168))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(309168960))), name = tensor("layers_19_mlp_gate_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_137_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_19_mlp_gate_proj_weight_to_fp16_palettized, x = var_3384_cast_fp16)[name = tensor("linear_137_cast_fp16")]; + tensor var_3394_cast_fp16 = silu(x = linear_137_cast_fp16)[name = tensor("op_3394_cast_fp16")]; + tensor layers_19_mlp_up_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(309169536))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(312315328))), name = tensor("layers_19_mlp_up_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_138_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_19_mlp_up_proj_weight_to_fp16_palettized, x = var_3384_cast_fp16)[name = tensor("linear_138_cast_fp16")]; + tensor input_199_cast_fp16 = mul(x = var_3394_cast_fp16, y = linear_138_cast_fp16)[name = tensor("input_199_cast_fp16")]; + tensor layers_19_mlp_down_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(312315904))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(315461696))), name = tensor("layers_19_mlp_down_proj_weight_to_fp16_palettized"), shape = tensor([1024, 3072])]; + tensor linear_139_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_19_mlp_down_proj_weight_to_fp16_palettized, x = input_199_cast_fp16)[name = tensor("linear_139_cast_fp16")]; + tensor x_439_cast_fp16 = add(x = x_435_cast_fp16, y = linear_139_cast_fp16)[name = tensor("x_439_cast_fp16")]; + tensor var_3414 = const()[name = tensor("op_3414"), val = tensor(-1)]; + tensor var_3413_promoted_to_fp16 = const()[name = tensor("op_3413_promoted_to_fp16"), val = tensor(0x1p+1)]; + tensor var_3423_cast_fp16 = pow(x = x_439_cast_fp16, y = var_3413_promoted_to_fp16)[name = tensor("op_3423_cast_fp16")]; + tensor var_3425_axes_0 = const()[name = tensor("op_3425_axes_0"), val = tensor([-1])]; + tensor var_3425_keep_dims_0 = const()[name = tensor("op_3425_keep_dims_0"), val = tensor(true)]; + tensor var_3425_cast_fp16 = reduce_mean(axes = var_3425_axes_0, keep_dims = var_3425_keep_dims_0, x = var_3423_cast_fp16)[name = tensor("op_3425_cast_fp16")]; + tensor var_3426_to_fp16 = const()[name = tensor("op_3426_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_3427_cast_fp16 = add(x = var_3425_cast_fp16, y = var_3426_to_fp16)[name = tensor("op_3427_cast_fp16")]; + tensor norm_161_epsilon_0 = const()[name = tensor("norm_161_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_161_cast_fp16 = rsqrt(epsilon = norm_161_epsilon_0, x = var_3427_cast_fp16)[name = tensor("norm_161_cast_fp16")]; + tensor var_3429_cast_fp16 = mul(x = x_439_cast_fp16, y = norm_161_cast_fp16)[name = tensor("op_3429_cast_fp16")]; + tensor layers_20_input_layernorm_weight_to_fp16 = const()[name = tensor("layers_20_input_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(315462272)))]; + tensor var_3430_cast_fp16 = mul(x = var_3429_cast_fp16, y = layers_20_input_layernorm_weight_to_fp16)[name = tensor("op_3430_cast_fp16")]; + tensor layers_20_self_attn_q_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(315464384))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(317561600))), name = tensor("layers_20_self_attn_q_proj_weight_to_fp16_palettized"), shape = tensor([2048, 1024])]; + tensor linear_140_cast_fp16 = linear(bias = linear_0_bias_0_to_fp16, weight = layers_20_self_attn_q_proj_weight_to_fp16_palettized, x = var_3430_cast_fp16)[name = tensor("linear_140_cast_fp16")]; + tensor var_3446 = const()[name = tensor("op_3446"), val = tensor([1, 768, 16, 128])]; + tensor var_3447_cast_fp16 = reshape(shape = var_3446, x = linear_140_cast_fp16)[name = tensor("op_3447_cast_fp16")]; + tensor x_445_perm_0 = const()[name = tensor("x_445_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_20_self_attn_k_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(317562176))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(318610816))), name = tensor("layers_20_self_attn_k_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_141_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_20_self_attn_k_proj_weight_to_fp16_palettized, x = var_3430_cast_fp16)[name = tensor("linear_141_cast_fp16")]; + tensor var_3451 = const()[name = tensor("op_3451"), val = tensor([1, 768, 8, 128])]; + tensor var_3452_cast_fp16 = reshape(shape = var_3451, x = linear_141_cast_fp16)[name = tensor("op_3452_cast_fp16")]; + tensor x_449_perm_0 = const()[name = tensor("x_449_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_20_self_attn_v_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(318611392))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(319660032))), name = tensor("layers_20_self_attn_v_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_142_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_20_self_attn_v_proj_weight_to_fp16_palettized, x = var_3430_cast_fp16)[name = tensor("linear_142_cast_fp16")]; + tensor var_3456 = const()[name = tensor("op_3456"), val = tensor([1, 768, 8, 128])]; + tensor var_3457_cast_fp16 = reshape(shape = var_3456, x = linear_142_cast_fp16)[name = tensor("op_3457_cast_fp16")]; + tensor transpose_152_perm_0 = const()[name = tensor("transpose_152_perm_0"), val = tensor([2, 0, 1, 3])]; + tensor var_3413_promoted_1_to_fp16 = const()[name = tensor("op_3413_promoted_1_to_fp16"), val = tensor(0x1p+1)]; + tensor x_445_cast_fp16 = transpose(perm = x_445_perm_0, x = var_3447_cast_fp16)[name = tensor("transpose_71")]; + tensor var_3461_cast_fp16 = pow(x = x_445_cast_fp16, y = var_3413_promoted_1_to_fp16)[name = tensor("op_3461_cast_fp16")]; + tensor var_3463_axes_0 = const()[name = tensor("op_3463_axes_0"), val = tensor([-1])]; + tensor var_3463_keep_dims_0 = const()[name = tensor("op_3463_keep_dims_0"), val = tensor(true)]; + tensor var_3463_cast_fp16 = reduce_mean(axes = var_3463_axes_0, keep_dims = var_3463_keep_dims_0, x = var_3461_cast_fp16)[name = tensor("op_3463_cast_fp16")]; + tensor var_3464_to_fp16 = const()[name = tensor("op_3464_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_3465_cast_fp16 = add(x = var_3463_cast_fp16, y = var_3464_to_fp16)[name = tensor("op_3465_cast_fp16")]; + tensor norm_163_epsilon_0 = const()[name = tensor("norm_163_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_163_cast_fp16 = rsqrt(epsilon = norm_163_epsilon_0, x = var_3465_cast_fp16)[name = tensor("norm_163_cast_fp16")]; + tensor var_3467_cast_fp16 = mul(x = x_445_cast_fp16, y = norm_163_cast_fp16)[name = tensor("op_3467_cast_fp16")]; + tensor layers_20_self_attn_q_norm_weight_to_fp16 = const()[name = tensor("layers_20_self_attn_q_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(319660608)))]; + tensor var_3468_cast_fp16 = mul(x = var_3467_cast_fp16, y = layers_20_self_attn_q_norm_weight_to_fp16)[name = tensor("op_3468_cast_fp16")]; + tensor var_3413_promoted_2_to_fp16 = const()[name = tensor("op_3413_promoted_2_to_fp16"), val = tensor(0x1p+1)]; + tensor x_449_cast_fp16 = transpose(perm = x_449_perm_0, x = var_3452_cast_fp16)[name = tensor("transpose_70")]; + tensor var_3472_cast_fp16 = pow(x = x_449_cast_fp16, y = var_3413_promoted_2_to_fp16)[name = tensor("op_3472_cast_fp16")]; + tensor var_3474_axes_0 = const()[name = tensor("op_3474_axes_0"), val = tensor([-1])]; + tensor var_3474_keep_dims_0 = const()[name = tensor("op_3474_keep_dims_0"), val = tensor(true)]; + tensor var_3474_cast_fp16 = reduce_mean(axes = var_3474_axes_0, keep_dims = var_3474_keep_dims_0, x = var_3472_cast_fp16)[name = tensor("op_3474_cast_fp16")]; + tensor var_3475_to_fp16 = const()[name = tensor("op_3475_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_3476_cast_fp16 = add(x = var_3474_cast_fp16, y = var_3475_to_fp16)[name = tensor("op_3476_cast_fp16")]; + tensor norm_165_epsilon_0 = const()[name = tensor("norm_165_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_165_cast_fp16 = rsqrt(epsilon = norm_165_epsilon_0, x = var_3476_cast_fp16)[name = tensor("norm_165_cast_fp16")]; + tensor var_3478_cast_fp16 = mul(x = x_449_cast_fp16, y = norm_165_cast_fp16)[name = tensor("op_3478_cast_fp16")]; + tensor layers_20_self_attn_k_norm_weight_to_fp16 = const()[name = tensor("layers_20_self_attn_k_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(319660928)))]; + tensor var_3479_cast_fp16 = mul(x = var_3478_cast_fp16, y = layers_20_self_attn_k_norm_weight_to_fp16)[name = tensor("op_3479_cast_fp16")]; + tensor x1_81_begin_0 = const()[name = tensor("x1_81_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_81_end_0 = const()[name = tensor("x1_81_end_0"), val = tensor([1, 16, 768, 64])]; + tensor x1_81_end_mask_0 = const()[name = tensor("x1_81_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_81_cast_fp16 = slice_by_index(begin = x1_81_begin_0, end = x1_81_end_0, end_mask = x1_81_end_mask_0, x = var_3468_cast_fp16)[name = tensor("x1_81_cast_fp16")]; + tensor x2_81_begin_0 = const()[name = tensor("x2_81_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_81_end_0 = const()[name = tensor("x2_81_end_0"), val = tensor([1, 16, 768, 128])]; + tensor x2_81_end_mask_0 = const()[name = tensor("x2_81_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_81_cast_fp16 = slice_by_index(begin = x2_81_begin_0, end = x2_81_end_0, end_mask = x2_81_end_mask_0, x = var_3468_cast_fp16)[name = tensor("x2_81_cast_fp16")]; + tensor var_3496_cast_fp16 = mul(x = x1_81_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_3496_cast_fp16")]; + tensor var_3497_cast_fp16 = mul(x = x2_81_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_3497_cast_fp16")]; + tensor var_3498_cast_fp16 = sub(x = var_3496_cast_fp16, y = var_3497_cast_fp16)[name = tensor("op_3498_cast_fp16")]; + tensor var_3499_cast_fp16 = mul(x = x2_81_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_3499_cast_fp16")]; + tensor var_3500_cast_fp16 = mul(x = x1_81_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_3500_cast_fp16")]; + tensor var_3501_cast_fp16 = add(x = var_3499_cast_fp16, y = var_3500_cast_fp16)[name = tensor("op_3501_cast_fp16")]; + tensor q_41_interleave_0 = const()[name = tensor("q_41_interleave_0"), val = tensor(false)]; + tensor q_41_cast_fp16 = concat(axis = var_3414, interleave = q_41_interleave_0, values = (var_3498_cast_fp16, var_3501_cast_fp16))[name = tensor("q_41_cast_fp16")]; + tensor x1_83_begin_0 = const()[name = tensor("x1_83_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_83_end_0 = const()[name = tensor("x1_83_end_0"), val = tensor([1, 8, 768, 64])]; + tensor x1_83_end_mask_0 = const()[name = tensor("x1_83_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_83_cast_fp16 = slice_by_index(begin = x1_83_begin_0, end = x1_83_end_0, end_mask = x1_83_end_mask_0, x = var_3479_cast_fp16)[name = tensor("x1_83_cast_fp16")]; + tensor x2_83_begin_0 = const()[name = tensor("x2_83_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_83_end_0 = const()[name = tensor("x2_83_end_0"), val = tensor([1, 8, 768, 128])]; + tensor x2_83_end_mask_0 = const()[name = tensor("x2_83_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_83_cast_fp16 = slice_by_index(begin = x2_83_begin_0, end = x2_83_end_0, end_mask = x2_83_end_mask_0, x = var_3479_cast_fp16)[name = tensor("x2_83_cast_fp16")]; + tensor var_3519_cast_fp16 = mul(x = x1_83_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_3519_cast_fp16")]; + tensor var_3520_cast_fp16 = mul(x = x2_83_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_3520_cast_fp16")]; + tensor var_3521_cast_fp16 = sub(x = var_3519_cast_fp16, y = var_3520_cast_fp16)[name = tensor("op_3521_cast_fp16")]; + tensor var_3522_cast_fp16 = mul(x = x2_83_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_3522_cast_fp16")]; + tensor var_3523_cast_fp16 = mul(x = x1_83_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_3523_cast_fp16")]; + tensor var_3524_cast_fp16 = add(x = var_3522_cast_fp16, y = var_3523_cast_fp16)[name = tensor("op_3524_cast_fp16")]; + tensor k_81_interleave_0 = const()[name = tensor("k_81_interleave_0"), val = tensor(false)]; + tensor k_81_cast_fp16 = concat(axis = var_3414, interleave = k_81_interleave_0, values = (var_3521_cast_fp16, var_3524_cast_fp16))[name = tensor("k_81_cast_fp16")]; + tensor transpose_80_perm_0 = const()[name = tensor("transpose_80_perm_0"), val = tensor([1, 0, 2, 3])]; + tensor tile_40_reps_0 = const()[name = tensor("tile_40_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_80_cast_fp16 = transpose(perm = transpose_80_perm_0, x = k_81_cast_fp16)[name = tensor("transpose_69")]; + tensor tile_40_cast_fp16 = tile(reps = tile_40_reps_0, x = transpose_80_cast_fp16)[name = tensor("tile_40_cast_fp16")]; + tensor concat_80 = const()[name = tensor("concat_80"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_80_cast_fp16 = reshape(shape = concat_80, x = tile_40_cast_fp16)[name = tensor("reshape_80_cast_fp16")]; + tensor transpose_81_perm_0 = const()[name = tensor("transpose_81_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_81 = const()[name = tensor("concat_81"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_81_cast_fp16 = transpose(perm = transpose_81_perm_0, x = reshape_80_cast_fp16)[name = tensor("transpose_68")]; + tensor reshape_81_cast_fp16 = reshape(shape = concat_81, x = transpose_81_cast_fp16)[name = tensor("reshape_81_cast_fp16")]; + tensor transpose_153_perm_0 = const()[name = tensor("transpose_153_perm_0"), val = tensor([1, 0, -1, -2])]; + tensor tile_41_reps_0 = const()[name = tensor("tile_41_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_152_cast_fp16 = transpose(perm = transpose_152_perm_0, x = var_3457_cast_fp16)[name = tensor("transpose_67")]; + tensor tile_41_cast_fp16 = tile(reps = tile_41_reps_0, x = transpose_152_cast_fp16)[name = tensor("tile_41_cast_fp16")]; + tensor concat_82 = const()[name = tensor("concat_82"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_82_cast_fp16 = reshape(shape = concat_82, x = tile_41_cast_fp16)[name = tensor("reshape_82_cast_fp16")]; + tensor transpose_83_perm_0 = const()[name = tensor("transpose_83_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_83 = const()[name = tensor("concat_83"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_83_cast_fp16 = transpose(perm = transpose_83_perm_0, x = reshape_82_cast_fp16)[name = tensor("transpose_66")]; + tensor reshape_83_cast_fp16 = reshape(shape = concat_83, x = transpose_83_cast_fp16)[name = tensor("reshape_83_cast_fp16")]; + tensor v_83_perm_0 = const()[name = tensor("v_83_perm_0"), val = tensor([1, 0, -2, -1])]; + tensor var_3530_transpose_x_0 = const()[name = tensor("op_3530_transpose_x_0"), val = tensor(false)]; + tensor var_3530_transpose_y_0 = const()[name = tensor("op_3530_transpose_y_0"), val = tensor(false)]; + tensor transpose_153_cast_fp16 = transpose(perm = transpose_153_perm_0, x = reshape_81_cast_fp16)[name = tensor("transpose_65")]; + tensor var_3530_cast_fp16 = matmul(transpose_x = var_3530_transpose_x_0, transpose_y = var_3530_transpose_y_0, x = q_41_cast_fp16, y = transpose_153_cast_fp16)[name = tensor("op_3530_cast_fp16")]; + tensor var_3531_to_fp16 = const()[name = tensor("op_3531_to_fp16"), val = tensor(0x1.6ap-4)]; + tensor attn_81_cast_fp16 = mul(x = var_3530_cast_fp16, y = var_3531_to_fp16)[name = tensor("attn_81_cast_fp16")]; + tensor input_201_cast_fp16 = add(x = attn_81_cast_fp16, y = causal_mask_to_fp16_palettized)[name = tensor("input_201_cast_fp16")]; + tensor attn_83_cast_fp16 = softmax(axis = var_3414, x = input_201_cast_fp16)[name = tensor("attn_83_cast_fp16")]; + tensor var_3535_transpose_x_0 = const()[name = tensor("op_3535_transpose_x_0"), val = tensor(false)]; + tensor var_3535_transpose_y_0 = const()[name = tensor("op_3535_transpose_y_0"), val = tensor(false)]; + tensor v_83_cast_fp16 = transpose(perm = v_83_perm_0, x = reshape_83_cast_fp16)[name = tensor("transpose_64")]; + tensor var_3535_cast_fp16 = matmul(transpose_x = var_3535_transpose_x_0, transpose_y = var_3535_transpose_y_0, x = attn_83_cast_fp16, y = v_83_cast_fp16)[name = tensor("op_3535_cast_fp16")]; + tensor var_3536_perm_0 = const()[name = tensor("op_3536_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor var_3537 = const()[name = tensor("op_3537"), val = tensor([1, 768, 2048])]; + tensor var_3536_cast_fp16 = transpose(perm = var_3536_perm_0, x = var_3535_cast_fp16)[name = tensor("transpose_63")]; + tensor input_203_cast_fp16 = reshape(shape = var_3537, x = var_3536_cast_fp16)[name = tensor("input_203_cast_fp16")]; + tensor layers_20_self_attn_o_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(319661248))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(321758464))), name = tensor("layers_20_self_attn_o_proj_weight_to_fp16_palettized"), shape = tensor([1024, 2048])]; + tensor linear_143_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_20_self_attn_o_proj_weight_to_fp16_palettized, x = input_203_cast_fp16)[name = tensor("linear_143_cast_fp16")]; + tensor x_457_cast_fp16 = add(x = x_439_cast_fp16, y = linear_143_cast_fp16)[name = tensor("x_457_cast_fp16")]; + tensor var_3413_promoted_3_to_fp16 = const()[name = tensor("op_3413_promoted_3_to_fp16"), val = tensor(0x1p+1)]; + tensor var_3544_cast_fp16 = pow(x = x_457_cast_fp16, y = var_3413_promoted_3_to_fp16)[name = tensor("op_3544_cast_fp16")]; + tensor var_3546_axes_0 = const()[name = tensor("op_3546_axes_0"), val = tensor([-1])]; + tensor var_3546_keep_dims_0 = const()[name = tensor("op_3546_keep_dims_0"), val = tensor(true)]; + tensor var_3546_cast_fp16 = reduce_mean(axes = var_3546_axes_0, keep_dims = var_3546_keep_dims_0, x = var_3544_cast_fp16)[name = tensor("op_3546_cast_fp16")]; + tensor var_3547_to_fp16 = const()[name = tensor("op_3547_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_3548_cast_fp16 = add(x = var_3546_cast_fp16, y = var_3547_to_fp16)[name = tensor("op_3548_cast_fp16")]; + tensor norm_167_epsilon_0 = const()[name = tensor("norm_167_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_167_cast_fp16 = rsqrt(epsilon = norm_167_epsilon_0, x = var_3548_cast_fp16)[name = tensor("norm_167_cast_fp16")]; + tensor var_3550_cast_fp16 = mul(x = x_457_cast_fp16, y = norm_167_cast_fp16)[name = tensor("op_3550_cast_fp16")]; + tensor layers_20_post_attention_layernorm_weight_to_fp16 = const()[name = tensor("layers_20_post_attention_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(321759040)))]; + tensor var_3551_cast_fp16 = mul(x = var_3550_cast_fp16, y = layers_20_post_attention_layernorm_weight_to_fp16)[name = tensor("op_3551_cast_fp16")]; + tensor layers_20_mlp_gate_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(321761152))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(324906944))), name = tensor("layers_20_mlp_gate_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_144_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_20_mlp_gate_proj_weight_to_fp16_palettized, x = var_3551_cast_fp16)[name = tensor("linear_144_cast_fp16")]; + tensor var_3561_cast_fp16 = silu(x = linear_144_cast_fp16)[name = tensor("op_3561_cast_fp16")]; + tensor layers_20_mlp_up_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(324907520))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(328053312))), name = tensor("layers_20_mlp_up_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_145_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_20_mlp_up_proj_weight_to_fp16_palettized, x = var_3551_cast_fp16)[name = tensor("linear_145_cast_fp16")]; + tensor input_209_cast_fp16 = mul(x = var_3561_cast_fp16, y = linear_145_cast_fp16)[name = tensor("input_209_cast_fp16")]; + tensor layers_20_mlp_down_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(328053888))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(331199680))), name = tensor("layers_20_mlp_down_proj_weight_to_fp16_palettized"), shape = tensor([1024, 3072])]; + tensor linear_146_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_20_mlp_down_proj_weight_to_fp16_palettized, x = input_209_cast_fp16)[name = tensor("linear_146_cast_fp16")]; + tensor x_461_cast_fp16 = add(x = x_457_cast_fp16, y = linear_146_cast_fp16)[name = tensor("x_461_cast_fp16")]; + tensor var_3581 = const()[name = tensor("op_3581"), val = tensor(-1)]; + tensor var_3580_promoted_to_fp16 = const()[name = tensor("op_3580_promoted_to_fp16"), val = tensor(0x1p+1)]; + tensor var_3590_cast_fp16 = pow(x = x_461_cast_fp16, y = var_3580_promoted_to_fp16)[name = tensor("op_3590_cast_fp16")]; + tensor var_3592_axes_0 = const()[name = tensor("op_3592_axes_0"), val = tensor([-1])]; + tensor var_3592_keep_dims_0 = const()[name = tensor("op_3592_keep_dims_0"), val = tensor(true)]; + tensor var_3592_cast_fp16 = reduce_mean(axes = var_3592_axes_0, keep_dims = var_3592_keep_dims_0, x = var_3590_cast_fp16)[name = tensor("op_3592_cast_fp16")]; + tensor var_3593_to_fp16 = const()[name = tensor("op_3593_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_3594_cast_fp16 = add(x = var_3592_cast_fp16, y = var_3593_to_fp16)[name = tensor("op_3594_cast_fp16")]; + tensor norm_169_epsilon_0 = const()[name = tensor("norm_169_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_169_cast_fp16 = rsqrt(epsilon = norm_169_epsilon_0, x = var_3594_cast_fp16)[name = tensor("norm_169_cast_fp16")]; + tensor var_3596_cast_fp16 = mul(x = x_461_cast_fp16, y = norm_169_cast_fp16)[name = tensor("op_3596_cast_fp16")]; + tensor layers_21_input_layernorm_weight_to_fp16 = const()[name = tensor("layers_21_input_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(331200256)))]; + tensor var_3597_cast_fp16 = mul(x = var_3596_cast_fp16, y = layers_21_input_layernorm_weight_to_fp16)[name = tensor("op_3597_cast_fp16")]; + tensor layers_21_self_attn_q_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(331202368))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(333299584))), name = tensor("layers_21_self_attn_q_proj_weight_to_fp16_palettized"), shape = tensor([2048, 1024])]; + tensor linear_147_cast_fp16 = linear(bias = linear_0_bias_0_to_fp16, weight = layers_21_self_attn_q_proj_weight_to_fp16_palettized, x = var_3597_cast_fp16)[name = tensor("linear_147_cast_fp16")]; + tensor var_3613 = const()[name = tensor("op_3613"), val = tensor([1, 768, 16, 128])]; + tensor var_3614_cast_fp16 = reshape(shape = var_3613, x = linear_147_cast_fp16)[name = tensor("op_3614_cast_fp16")]; + tensor x_467_perm_0 = const()[name = tensor("x_467_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_21_self_attn_k_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(333300160))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(334348800))), name = tensor("layers_21_self_attn_k_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_148_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_21_self_attn_k_proj_weight_to_fp16_palettized, x = var_3597_cast_fp16)[name = tensor("linear_148_cast_fp16")]; + tensor var_3618 = const()[name = tensor("op_3618"), val = tensor([1, 768, 8, 128])]; + tensor var_3619_cast_fp16 = reshape(shape = var_3618, x = linear_148_cast_fp16)[name = tensor("op_3619_cast_fp16")]; + tensor x_471_perm_0 = const()[name = tensor("x_471_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_21_self_attn_v_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(334349376))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(335398016))), name = tensor("layers_21_self_attn_v_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_149_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_21_self_attn_v_proj_weight_to_fp16_palettized, x = var_3597_cast_fp16)[name = tensor("linear_149_cast_fp16")]; + tensor var_3623 = const()[name = tensor("op_3623"), val = tensor([1, 768, 8, 128])]; + tensor var_3624_cast_fp16 = reshape(shape = var_3623, x = linear_149_cast_fp16)[name = tensor("op_3624_cast_fp16")]; + tensor transpose_154_perm_0 = const()[name = tensor("transpose_154_perm_0"), val = tensor([2, 0, 1, 3])]; + tensor var_3580_promoted_1_to_fp16 = const()[name = tensor("op_3580_promoted_1_to_fp16"), val = tensor(0x1p+1)]; + tensor x_467_cast_fp16 = transpose(perm = x_467_perm_0, x = var_3614_cast_fp16)[name = tensor("transpose_62")]; + tensor var_3628_cast_fp16 = pow(x = x_467_cast_fp16, y = var_3580_promoted_1_to_fp16)[name = tensor("op_3628_cast_fp16")]; + tensor var_3630_axes_0 = const()[name = tensor("op_3630_axes_0"), val = tensor([-1])]; + tensor var_3630_keep_dims_0 = const()[name = tensor("op_3630_keep_dims_0"), val = tensor(true)]; + tensor var_3630_cast_fp16 = reduce_mean(axes = var_3630_axes_0, keep_dims = var_3630_keep_dims_0, x = var_3628_cast_fp16)[name = tensor("op_3630_cast_fp16")]; + tensor var_3631_to_fp16 = const()[name = tensor("op_3631_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_3632_cast_fp16 = add(x = var_3630_cast_fp16, y = var_3631_to_fp16)[name = tensor("op_3632_cast_fp16")]; + tensor norm_171_epsilon_0 = const()[name = tensor("norm_171_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_171_cast_fp16 = rsqrt(epsilon = norm_171_epsilon_0, x = var_3632_cast_fp16)[name = tensor("norm_171_cast_fp16")]; + tensor var_3634_cast_fp16 = mul(x = x_467_cast_fp16, y = norm_171_cast_fp16)[name = tensor("op_3634_cast_fp16")]; + tensor layers_21_self_attn_q_norm_weight_to_fp16 = const()[name = tensor("layers_21_self_attn_q_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(335398592)))]; + tensor var_3635_cast_fp16 = mul(x = var_3634_cast_fp16, y = layers_21_self_attn_q_norm_weight_to_fp16)[name = tensor("op_3635_cast_fp16")]; + tensor var_3580_promoted_2_to_fp16 = const()[name = tensor("op_3580_promoted_2_to_fp16"), val = tensor(0x1p+1)]; + tensor x_471_cast_fp16 = transpose(perm = x_471_perm_0, x = var_3619_cast_fp16)[name = tensor("transpose_61")]; + tensor var_3639_cast_fp16 = pow(x = x_471_cast_fp16, y = var_3580_promoted_2_to_fp16)[name = tensor("op_3639_cast_fp16")]; + tensor var_3641_axes_0 = const()[name = tensor("op_3641_axes_0"), val = tensor([-1])]; + tensor var_3641_keep_dims_0 = const()[name = tensor("op_3641_keep_dims_0"), val = tensor(true)]; + tensor var_3641_cast_fp16 = reduce_mean(axes = var_3641_axes_0, keep_dims = var_3641_keep_dims_0, x = var_3639_cast_fp16)[name = tensor("op_3641_cast_fp16")]; + tensor var_3642_to_fp16 = const()[name = tensor("op_3642_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_3643_cast_fp16 = add(x = var_3641_cast_fp16, y = var_3642_to_fp16)[name = tensor("op_3643_cast_fp16")]; + tensor norm_173_epsilon_0 = const()[name = tensor("norm_173_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_173_cast_fp16 = rsqrt(epsilon = norm_173_epsilon_0, x = var_3643_cast_fp16)[name = tensor("norm_173_cast_fp16")]; + tensor var_3645_cast_fp16 = mul(x = x_471_cast_fp16, y = norm_173_cast_fp16)[name = tensor("op_3645_cast_fp16")]; + tensor layers_21_self_attn_k_norm_weight_to_fp16 = const()[name = tensor("layers_21_self_attn_k_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(335398912)))]; + tensor var_3646_cast_fp16 = mul(x = var_3645_cast_fp16, y = layers_21_self_attn_k_norm_weight_to_fp16)[name = tensor("op_3646_cast_fp16")]; + tensor x1_85_begin_0 = const()[name = tensor("x1_85_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_85_end_0 = const()[name = tensor("x1_85_end_0"), val = tensor([1, 16, 768, 64])]; + tensor x1_85_end_mask_0 = const()[name = tensor("x1_85_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_85_cast_fp16 = slice_by_index(begin = x1_85_begin_0, end = x1_85_end_0, end_mask = x1_85_end_mask_0, x = var_3635_cast_fp16)[name = tensor("x1_85_cast_fp16")]; + tensor x2_85_begin_0 = const()[name = tensor("x2_85_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_85_end_0 = const()[name = tensor("x2_85_end_0"), val = tensor([1, 16, 768, 128])]; + tensor x2_85_end_mask_0 = const()[name = tensor("x2_85_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_85_cast_fp16 = slice_by_index(begin = x2_85_begin_0, end = x2_85_end_0, end_mask = x2_85_end_mask_0, x = var_3635_cast_fp16)[name = tensor("x2_85_cast_fp16")]; + tensor var_3663_cast_fp16 = mul(x = x1_85_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_3663_cast_fp16")]; + tensor var_3664_cast_fp16 = mul(x = x2_85_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_3664_cast_fp16")]; + tensor var_3665_cast_fp16 = sub(x = var_3663_cast_fp16, y = var_3664_cast_fp16)[name = tensor("op_3665_cast_fp16")]; + tensor var_3666_cast_fp16 = mul(x = x2_85_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_3666_cast_fp16")]; + tensor var_3667_cast_fp16 = mul(x = x1_85_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_3667_cast_fp16")]; + tensor var_3668_cast_fp16 = add(x = var_3666_cast_fp16, y = var_3667_cast_fp16)[name = tensor("op_3668_cast_fp16")]; + tensor q_43_interleave_0 = const()[name = tensor("q_43_interleave_0"), val = tensor(false)]; + tensor q_43_cast_fp16 = concat(axis = var_3581, interleave = q_43_interleave_0, values = (var_3665_cast_fp16, var_3668_cast_fp16))[name = tensor("q_43_cast_fp16")]; + tensor x1_87_begin_0 = const()[name = tensor("x1_87_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_87_end_0 = const()[name = tensor("x1_87_end_0"), val = tensor([1, 8, 768, 64])]; + tensor x1_87_end_mask_0 = const()[name = tensor("x1_87_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_87_cast_fp16 = slice_by_index(begin = x1_87_begin_0, end = x1_87_end_0, end_mask = x1_87_end_mask_0, x = var_3646_cast_fp16)[name = tensor("x1_87_cast_fp16")]; + tensor x2_87_begin_0 = const()[name = tensor("x2_87_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_87_end_0 = const()[name = tensor("x2_87_end_0"), val = tensor([1, 8, 768, 128])]; + tensor x2_87_end_mask_0 = const()[name = tensor("x2_87_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_87_cast_fp16 = slice_by_index(begin = x2_87_begin_0, end = x2_87_end_0, end_mask = x2_87_end_mask_0, x = var_3646_cast_fp16)[name = tensor("x2_87_cast_fp16")]; + tensor var_3686_cast_fp16 = mul(x = x1_87_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_3686_cast_fp16")]; + tensor var_3687_cast_fp16 = mul(x = x2_87_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_3687_cast_fp16")]; + tensor var_3688_cast_fp16 = sub(x = var_3686_cast_fp16, y = var_3687_cast_fp16)[name = tensor("op_3688_cast_fp16")]; + tensor var_3689_cast_fp16 = mul(x = x2_87_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_3689_cast_fp16")]; + tensor var_3690_cast_fp16 = mul(x = x1_87_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_3690_cast_fp16")]; + tensor var_3691_cast_fp16 = add(x = var_3689_cast_fp16, y = var_3690_cast_fp16)[name = tensor("op_3691_cast_fp16")]; + tensor k_85_interleave_0 = const()[name = tensor("k_85_interleave_0"), val = tensor(false)]; + tensor k_85_cast_fp16 = concat(axis = var_3581, interleave = k_85_interleave_0, values = (var_3688_cast_fp16, var_3691_cast_fp16))[name = tensor("k_85_cast_fp16")]; + tensor transpose_84_perm_0 = const()[name = tensor("transpose_84_perm_0"), val = tensor([1, 0, 2, 3])]; + tensor tile_42_reps_0 = const()[name = tensor("tile_42_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_84_cast_fp16 = transpose(perm = transpose_84_perm_0, x = k_85_cast_fp16)[name = tensor("transpose_60")]; + tensor tile_42_cast_fp16 = tile(reps = tile_42_reps_0, x = transpose_84_cast_fp16)[name = tensor("tile_42_cast_fp16")]; + tensor concat_84 = const()[name = tensor("concat_84"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_84_cast_fp16 = reshape(shape = concat_84, x = tile_42_cast_fp16)[name = tensor("reshape_84_cast_fp16")]; + tensor transpose_85_perm_0 = const()[name = tensor("transpose_85_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_85 = const()[name = tensor("concat_85"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_85_cast_fp16 = transpose(perm = transpose_85_perm_0, x = reshape_84_cast_fp16)[name = tensor("transpose_59")]; + tensor reshape_85_cast_fp16 = reshape(shape = concat_85, x = transpose_85_cast_fp16)[name = tensor("reshape_85_cast_fp16")]; + tensor transpose_155_perm_0 = const()[name = tensor("transpose_155_perm_0"), val = tensor([1, 0, -1, -2])]; + tensor tile_43_reps_0 = const()[name = tensor("tile_43_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_154_cast_fp16 = transpose(perm = transpose_154_perm_0, x = var_3624_cast_fp16)[name = tensor("transpose_58")]; + tensor tile_43_cast_fp16 = tile(reps = tile_43_reps_0, x = transpose_154_cast_fp16)[name = tensor("tile_43_cast_fp16")]; + tensor concat_86 = const()[name = tensor("concat_86"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_86_cast_fp16 = reshape(shape = concat_86, x = tile_43_cast_fp16)[name = tensor("reshape_86_cast_fp16")]; + tensor transpose_87_perm_0 = const()[name = tensor("transpose_87_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_87 = const()[name = tensor("concat_87"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_87_cast_fp16 = transpose(perm = transpose_87_perm_0, x = reshape_86_cast_fp16)[name = tensor("transpose_57")]; + tensor reshape_87_cast_fp16 = reshape(shape = concat_87, x = transpose_87_cast_fp16)[name = tensor("reshape_87_cast_fp16")]; + tensor v_87_perm_0 = const()[name = tensor("v_87_perm_0"), val = tensor([1, 0, -2, -1])]; + tensor var_3697_transpose_x_0 = const()[name = tensor("op_3697_transpose_x_0"), val = tensor(false)]; + tensor var_3697_transpose_y_0 = const()[name = tensor("op_3697_transpose_y_0"), val = tensor(false)]; + tensor transpose_155_cast_fp16 = transpose(perm = transpose_155_perm_0, x = reshape_85_cast_fp16)[name = tensor("transpose_56")]; + tensor var_3697_cast_fp16 = matmul(transpose_x = var_3697_transpose_x_0, transpose_y = var_3697_transpose_y_0, x = q_43_cast_fp16, y = transpose_155_cast_fp16)[name = tensor("op_3697_cast_fp16")]; + tensor var_3698_to_fp16 = const()[name = tensor("op_3698_to_fp16"), val = tensor(0x1.6ap-4)]; + tensor attn_85_cast_fp16 = mul(x = var_3697_cast_fp16, y = var_3698_to_fp16)[name = tensor("attn_85_cast_fp16")]; + tensor input_211_cast_fp16 = add(x = attn_85_cast_fp16, y = causal_mask_to_fp16_palettized)[name = tensor("input_211_cast_fp16")]; + tensor attn_87_cast_fp16 = softmax(axis = var_3581, x = input_211_cast_fp16)[name = tensor("attn_87_cast_fp16")]; + tensor var_3702_transpose_x_0 = const()[name = tensor("op_3702_transpose_x_0"), val = tensor(false)]; + tensor var_3702_transpose_y_0 = const()[name = tensor("op_3702_transpose_y_0"), val = tensor(false)]; + tensor v_87_cast_fp16 = transpose(perm = v_87_perm_0, x = reshape_87_cast_fp16)[name = tensor("transpose_55")]; + tensor var_3702_cast_fp16 = matmul(transpose_x = var_3702_transpose_x_0, transpose_y = var_3702_transpose_y_0, x = attn_87_cast_fp16, y = v_87_cast_fp16)[name = tensor("op_3702_cast_fp16")]; + tensor var_3703_perm_0 = const()[name = tensor("op_3703_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor var_3704 = const()[name = tensor("op_3704"), val = tensor([1, 768, 2048])]; + tensor var_3703_cast_fp16 = transpose(perm = var_3703_perm_0, x = var_3702_cast_fp16)[name = tensor("transpose_54")]; + tensor input_213_cast_fp16 = reshape(shape = var_3704, x = var_3703_cast_fp16)[name = tensor("input_213_cast_fp16")]; + tensor layers_21_self_attn_o_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(335399232))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(337496448))), name = tensor("layers_21_self_attn_o_proj_weight_to_fp16_palettized"), shape = tensor([1024, 2048])]; + tensor linear_150_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_21_self_attn_o_proj_weight_to_fp16_palettized, x = input_213_cast_fp16)[name = tensor("linear_150_cast_fp16")]; + tensor x_479_cast_fp16 = add(x = x_461_cast_fp16, y = linear_150_cast_fp16)[name = tensor("x_479_cast_fp16")]; + tensor var_3580_promoted_3_to_fp16 = const()[name = tensor("op_3580_promoted_3_to_fp16"), val = tensor(0x1p+1)]; + tensor var_3711_cast_fp16 = pow(x = x_479_cast_fp16, y = var_3580_promoted_3_to_fp16)[name = tensor("op_3711_cast_fp16")]; + tensor var_3713_axes_0 = const()[name = tensor("op_3713_axes_0"), val = tensor([-1])]; + tensor var_3713_keep_dims_0 = const()[name = tensor("op_3713_keep_dims_0"), val = tensor(true)]; + tensor var_3713_cast_fp16 = reduce_mean(axes = var_3713_axes_0, keep_dims = var_3713_keep_dims_0, x = var_3711_cast_fp16)[name = tensor("op_3713_cast_fp16")]; + tensor var_3714_to_fp16 = const()[name = tensor("op_3714_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_3715_cast_fp16 = add(x = var_3713_cast_fp16, y = var_3714_to_fp16)[name = tensor("op_3715_cast_fp16")]; + tensor norm_175_epsilon_0 = const()[name = tensor("norm_175_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_175_cast_fp16 = rsqrt(epsilon = norm_175_epsilon_0, x = var_3715_cast_fp16)[name = tensor("norm_175_cast_fp16")]; + tensor var_3717_cast_fp16 = mul(x = x_479_cast_fp16, y = norm_175_cast_fp16)[name = tensor("op_3717_cast_fp16")]; + tensor layers_21_post_attention_layernorm_weight_to_fp16 = const()[name = tensor("layers_21_post_attention_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(337497024)))]; + tensor var_3718_cast_fp16 = mul(x = var_3717_cast_fp16, y = layers_21_post_attention_layernorm_weight_to_fp16)[name = tensor("op_3718_cast_fp16")]; + tensor layers_21_mlp_gate_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(337499136))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(340644928))), name = tensor("layers_21_mlp_gate_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_151_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_21_mlp_gate_proj_weight_to_fp16_palettized, x = var_3718_cast_fp16)[name = tensor("linear_151_cast_fp16")]; + tensor var_3728_cast_fp16 = silu(x = linear_151_cast_fp16)[name = tensor("op_3728_cast_fp16")]; + tensor layers_21_mlp_up_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(340645504))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(343791296))), name = tensor("layers_21_mlp_up_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_152_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_21_mlp_up_proj_weight_to_fp16_palettized, x = var_3718_cast_fp16)[name = tensor("linear_152_cast_fp16")]; + tensor input_219_cast_fp16 = mul(x = var_3728_cast_fp16, y = linear_152_cast_fp16)[name = tensor("input_219_cast_fp16")]; + tensor layers_21_mlp_down_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(343791872))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(346937664))), name = tensor("layers_21_mlp_down_proj_weight_to_fp16_palettized"), shape = tensor([1024, 3072])]; + tensor linear_153_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_21_mlp_down_proj_weight_to_fp16_palettized, x = input_219_cast_fp16)[name = tensor("linear_153_cast_fp16")]; + tensor x_483_cast_fp16 = add(x = x_479_cast_fp16, y = linear_153_cast_fp16)[name = tensor("x_483_cast_fp16")]; + tensor var_3748 = const()[name = tensor("op_3748"), val = tensor(-1)]; + tensor var_3747_promoted_to_fp16 = const()[name = tensor("op_3747_promoted_to_fp16"), val = tensor(0x1p+1)]; + tensor var_3757_cast_fp16 = pow(x = x_483_cast_fp16, y = var_3747_promoted_to_fp16)[name = tensor("op_3757_cast_fp16")]; + tensor var_3759_axes_0 = const()[name = tensor("op_3759_axes_0"), val = tensor([-1])]; + tensor var_3759_keep_dims_0 = const()[name = tensor("op_3759_keep_dims_0"), val = tensor(true)]; + tensor var_3759_cast_fp16 = reduce_mean(axes = var_3759_axes_0, keep_dims = var_3759_keep_dims_0, x = var_3757_cast_fp16)[name = tensor("op_3759_cast_fp16")]; + tensor var_3760_to_fp16 = const()[name = tensor("op_3760_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_3761_cast_fp16 = add(x = var_3759_cast_fp16, y = var_3760_to_fp16)[name = tensor("op_3761_cast_fp16")]; + tensor norm_177_epsilon_0 = const()[name = tensor("norm_177_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_177_cast_fp16 = rsqrt(epsilon = norm_177_epsilon_0, x = var_3761_cast_fp16)[name = tensor("norm_177_cast_fp16")]; + tensor var_3763_cast_fp16 = mul(x = x_483_cast_fp16, y = norm_177_cast_fp16)[name = tensor("op_3763_cast_fp16")]; + tensor layers_22_input_layernorm_weight_to_fp16 = const()[name = tensor("layers_22_input_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(346938240)))]; + tensor var_3764_cast_fp16 = mul(x = var_3763_cast_fp16, y = layers_22_input_layernorm_weight_to_fp16)[name = tensor("op_3764_cast_fp16")]; + tensor layers_22_self_attn_q_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(346940352))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(349037568))), name = tensor("layers_22_self_attn_q_proj_weight_to_fp16_palettized"), shape = tensor([2048, 1024])]; + tensor linear_154_cast_fp16 = linear(bias = linear_0_bias_0_to_fp16, weight = layers_22_self_attn_q_proj_weight_to_fp16_palettized, x = var_3764_cast_fp16)[name = tensor("linear_154_cast_fp16")]; + tensor var_3780 = const()[name = tensor("op_3780"), val = tensor([1, 768, 16, 128])]; + tensor var_3781_cast_fp16 = reshape(shape = var_3780, x = linear_154_cast_fp16)[name = tensor("op_3781_cast_fp16")]; + tensor x_489_perm_0 = const()[name = tensor("x_489_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_22_self_attn_k_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(349038144))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(350086784))), name = tensor("layers_22_self_attn_k_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_155_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_22_self_attn_k_proj_weight_to_fp16_palettized, x = var_3764_cast_fp16)[name = tensor("linear_155_cast_fp16")]; + tensor var_3785 = const()[name = tensor("op_3785"), val = tensor([1, 768, 8, 128])]; + tensor var_3786_cast_fp16 = reshape(shape = var_3785, x = linear_155_cast_fp16)[name = tensor("op_3786_cast_fp16")]; + tensor x_493_perm_0 = const()[name = tensor("x_493_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_22_self_attn_v_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(350087360))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(351136000))), name = tensor("layers_22_self_attn_v_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_156_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_22_self_attn_v_proj_weight_to_fp16_palettized, x = var_3764_cast_fp16)[name = tensor("linear_156_cast_fp16")]; + tensor var_3790 = const()[name = tensor("op_3790"), val = tensor([1, 768, 8, 128])]; + tensor var_3791_cast_fp16 = reshape(shape = var_3790, x = linear_156_cast_fp16)[name = tensor("op_3791_cast_fp16")]; + tensor transpose_156_perm_0 = const()[name = tensor("transpose_156_perm_0"), val = tensor([2, 0, 1, 3])]; + tensor var_3747_promoted_1_to_fp16 = const()[name = tensor("op_3747_promoted_1_to_fp16"), val = tensor(0x1p+1)]; + tensor x_489_cast_fp16 = transpose(perm = x_489_perm_0, x = var_3781_cast_fp16)[name = tensor("transpose_53")]; + tensor var_3795_cast_fp16 = pow(x = x_489_cast_fp16, y = var_3747_promoted_1_to_fp16)[name = tensor("op_3795_cast_fp16")]; + tensor var_3797_axes_0 = const()[name = tensor("op_3797_axes_0"), val = tensor([-1])]; + tensor var_3797_keep_dims_0 = const()[name = tensor("op_3797_keep_dims_0"), val = tensor(true)]; + tensor var_3797_cast_fp16 = reduce_mean(axes = var_3797_axes_0, keep_dims = var_3797_keep_dims_0, x = var_3795_cast_fp16)[name = tensor("op_3797_cast_fp16")]; + tensor var_3798_to_fp16 = const()[name = tensor("op_3798_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_3799_cast_fp16 = add(x = var_3797_cast_fp16, y = var_3798_to_fp16)[name = tensor("op_3799_cast_fp16")]; + tensor norm_179_epsilon_0 = const()[name = tensor("norm_179_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_179_cast_fp16 = rsqrt(epsilon = norm_179_epsilon_0, x = var_3799_cast_fp16)[name = tensor("norm_179_cast_fp16")]; + tensor var_3801_cast_fp16 = mul(x = x_489_cast_fp16, y = norm_179_cast_fp16)[name = tensor("op_3801_cast_fp16")]; + tensor layers_22_self_attn_q_norm_weight_to_fp16 = const()[name = tensor("layers_22_self_attn_q_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(351136576)))]; + tensor var_3802_cast_fp16 = mul(x = var_3801_cast_fp16, y = layers_22_self_attn_q_norm_weight_to_fp16)[name = tensor("op_3802_cast_fp16")]; + tensor var_3747_promoted_2_to_fp16 = const()[name = tensor("op_3747_promoted_2_to_fp16"), val = tensor(0x1p+1)]; + tensor x_493_cast_fp16 = transpose(perm = x_493_perm_0, x = var_3786_cast_fp16)[name = tensor("transpose_52")]; + tensor var_3806_cast_fp16 = pow(x = x_493_cast_fp16, y = var_3747_promoted_2_to_fp16)[name = tensor("op_3806_cast_fp16")]; + tensor var_3808_axes_0 = const()[name = tensor("op_3808_axes_0"), val = tensor([-1])]; + tensor var_3808_keep_dims_0 = const()[name = tensor("op_3808_keep_dims_0"), val = tensor(true)]; + tensor var_3808_cast_fp16 = reduce_mean(axes = var_3808_axes_0, keep_dims = var_3808_keep_dims_0, x = var_3806_cast_fp16)[name = tensor("op_3808_cast_fp16")]; + tensor var_3809_to_fp16 = const()[name = tensor("op_3809_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_3810_cast_fp16 = add(x = var_3808_cast_fp16, y = var_3809_to_fp16)[name = tensor("op_3810_cast_fp16")]; + tensor norm_181_epsilon_0 = const()[name = tensor("norm_181_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_181_cast_fp16 = rsqrt(epsilon = norm_181_epsilon_0, x = var_3810_cast_fp16)[name = tensor("norm_181_cast_fp16")]; + tensor var_3812_cast_fp16 = mul(x = x_493_cast_fp16, y = norm_181_cast_fp16)[name = tensor("op_3812_cast_fp16")]; + tensor layers_22_self_attn_k_norm_weight_to_fp16 = const()[name = tensor("layers_22_self_attn_k_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(351136896)))]; + tensor var_3813_cast_fp16 = mul(x = var_3812_cast_fp16, y = layers_22_self_attn_k_norm_weight_to_fp16)[name = tensor("op_3813_cast_fp16")]; + tensor x1_89_begin_0 = const()[name = tensor("x1_89_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_89_end_0 = const()[name = tensor("x1_89_end_0"), val = tensor([1, 16, 768, 64])]; + tensor x1_89_end_mask_0 = const()[name = tensor("x1_89_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_89_cast_fp16 = slice_by_index(begin = x1_89_begin_0, end = x1_89_end_0, end_mask = x1_89_end_mask_0, x = var_3802_cast_fp16)[name = tensor("x1_89_cast_fp16")]; + tensor x2_89_begin_0 = const()[name = tensor("x2_89_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_89_end_0 = const()[name = tensor("x2_89_end_0"), val = tensor([1, 16, 768, 128])]; + tensor x2_89_end_mask_0 = const()[name = tensor("x2_89_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_89_cast_fp16 = slice_by_index(begin = x2_89_begin_0, end = x2_89_end_0, end_mask = x2_89_end_mask_0, x = var_3802_cast_fp16)[name = tensor("x2_89_cast_fp16")]; + tensor var_3830_cast_fp16 = mul(x = x1_89_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_3830_cast_fp16")]; + tensor var_3831_cast_fp16 = mul(x = x2_89_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_3831_cast_fp16")]; + tensor var_3832_cast_fp16 = sub(x = var_3830_cast_fp16, y = var_3831_cast_fp16)[name = tensor("op_3832_cast_fp16")]; + tensor var_3833_cast_fp16 = mul(x = x2_89_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_3833_cast_fp16")]; + tensor var_3834_cast_fp16 = mul(x = x1_89_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_3834_cast_fp16")]; + tensor var_3835_cast_fp16 = add(x = var_3833_cast_fp16, y = var_3834_cast_fp16)[name = tensor("op_3835_cast_fp16")]; + tensor q_45_interleave_0 = const()[name = tensor("q_45_interleave_0"), val = tensor(false)]; + tensor q_45_cast_fp16 = concat(axis = var_3748, interleave = q_45_interleave_0, values = (var_3832_cast_fp16, var_3835_cast_fp16))[name = tensor("q_45_cast_fp16")]; + tensor x1_91_begin_0 = const()[name = tensor("x1_91_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_91_end_0 = const()[name = tensor("x1_91_end_0"), val = tensor([1, 8, 768, 64])]; + tensor x1_91_end_mask_0 = const()[name = tensor("x1_91_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_91_cast_fp16 = slice_by_index(begin = x1_91_begin_0, end = x1_91_end_0, end_mask = x1_91_end_mask_0, x = var_3813_cast_fp16)[name = tensor("x1_91_cast_fp16")]; + tensor x2_91_begin_0 = const()[name = tensor("x2_91_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_91_end_0 = const()[name = tensor("x2_91_end_0"), val = tensor([1, 8, 768, 128])]; + tensor x2_91_end_mask_0 = const()[name = tensor("x2_91_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_91_cast_fp16 = slice_by_index(begin = x2_91_begin_0, end = x2_91_end_0, end_mask = x2_91_end_mask_0, x = var_3813_cast_fp16)[name = tensor("x2_91_cast_fp16")]; + tensor var_3853_cast_fp16 = mul(x = x1_91_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_3853_cast_fp16")]; + tensor var_3854_cast_fp16 = mul(x = x2_91_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_3854_cast_fp16")]; + tensor var_3855_cast_fp16 = sub(x = var_3853_cast_fp16, y = var_3854_cast_fp16)[name = tensor("op_3855_cast_fp16")]; + tensor var_3856_cast_fp16 = mul(x = x2_91_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_3856_cast_fp16")]; + tensor var_3857_cast_fp16 = mul(x = x1_91_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_3857_cast_fp16")]; + tensor var_3858_cast_fp16 = add(x = var_3856_cast_fp16, y = var_3857_cast_fp16)[name = tensor("op_3858_cast_fp16")]; + tensor k_89_interleave_0 = const()[name = tensor("k_89_interleave_0"), val = tensor(false)]; + tensor k_89_cast_fp16 = concat(axis = var_3748, interleave = k_89_interleave_0, values = (var_3855_cast_fp16, var_3858_cast_fp16))[name = tensor("k_89_cast_fp16")]; + tensor transpose_88_perm_0 = const()[name = tensor("transpose_88_perm_0"), val = tensor([1, 0, 2, 3])]; + tensor tile_44_reps_0 = const()[name = tensor("tile_44_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_88_cast_fp16 = transpose(perm = transpose_88_perm_0, x = k_89_cast_fp16)[name = tensor("transpose_51")]; + tensor tile_44_cast_fp16 = tile(reps = tile_44_reps_0, x = transpose_88_cast_fp16)[name = tensor("tile_44_cast_fp16")]; + tensor concat_88 = const()[name = tensor("concat_88"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_88_cast_fp16 = reshape(shape = concat_88, x = tile_44_cast_fp16)[name = tensor("reshape_88_cast_fp16")]; + tensor transpose_89_perm_0 = const()[name = tensor("transpose_89_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_89 = const()[name = tensor("concat_89"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_89_cast_fp16 = transpose(perm = transpose_89_perm_0, x = reshape_88_cast_fp16)[name = tensor("transpose_50")]; + tensor reshape_89_cast_fp16 = reshape(shape = concat_89, x = transpose_89_cast_fp16)[name = tensor("reshape_89_cast_fp16")]; + tensor transpose_157_perm_0 = const()[name = tensor("transpose_157_perm_0"), val = tensor([1, 0, -1, -2])]; + tensor tile_45_reps_0 = const()[name = tensor("tile_45_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_156_cast_fp16 = transpose(perm = transpose_156_perm_0, x = var_3791_cast_fp16)[name = tensor("transpose_49")]; + tensor tile_45_cast_fp16 = tile(reps = tile_45_reps_0, x = transpose_156_cast_fp16)[name = tensor("tile_45_cast_fp16")]; + tensor concat_90 = const()[name = tensor("concat_90"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_90_cast_fp16 = reshape(shape = concat_90, x = tile_45_cast_fp16)[name = tensor("reshape_90_cast_fp16")]; + tensor transpose_91_perm_0 = const()[name = tensor("transpose_91_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_91 = const()[name = tensor("concat_91"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_91_cast_fp16 = transpose(perm = transpose_91_perm_0, x = reshape_90_cast_fp16)[name = tensor("transpose_48")]; + tensor reshape_91_cast_fp16 = reshape(shape = concat_91, x = transpose_91_cast_fp16)[name = tensor("reshape_91_cast_fp16")]; + tensor v_91_perm_0 = const()[name = tensor("v_91_perm_0"), val = tensor([1, 0, -2, -1])]; + tensor var_3864_transpose_x_0 = const()[name = tensor("op_3864_transpose_x_0"), val = tensor(false)]; + tensor var_3864_transpose_y_0 = const()[name = tensor("op_3864_transpose_y_0"), val = tensor(false)]; + tensor transpose_157_cast_fp16 = transpose(perm = transpose_157_perm_0, x = reshape_89_cast_fp16)[name = tensor("transpose_47")]; + tensor var_3864_cast_fp16 = matmul(transpose_x = var_3864_transpose_x_0, transpose_y = var_3864_transpose_y_0, x = q_45_cast_fp16, y = transpose_157_cast_fp16)[name = tensor("op_3864_cast_fp16")]; + tensor var_3865_to_fp16 = const()[name = tensor("op_3865_to_fp16"), val = tensor(0x1.6ap-4)]; + tensor attn_89_cast_fp16 = mul(x = var_3864_cast_fp16, y = var_3865_to_fp16)[name = tensor("attn_89_cast_fp16")]; + tensor input_221_cast_fp16 = add(x = attn_89_cast_fp16, y = causal_mask_to_fp16_palettized)[name = tensor("input_221_cast_fp16")]; + tensor attn_91_cast_fp16 = softmax(axis = var_3748, x = input_221_cast_fp16)[name = tensor("attn_91_cast_fp16")]; + tensor var_3869_transpose_x_0 = const()[name = tensor("op_3869_transpose_x_0"), val = tensor(false)]; + tensor var_3869_transpose_y_0 = const()[name = tensor("op_3869_transpose_y_0"), val = tensor(false)]; + tensor v_91_cast_fp16 = transpose(perm = v_91_perm_0, x = reshape_91_cast_fp16)[name = tensor("transpose_46")]; + tensor var_3869_cast_fp16 = matmul(transpose_x = var_3869_transpose_x_0, transpose_y = var_3869_transpose_y_0, x = attn_91_cast_fp16, y = v_91_cast_fp16)[name = tensor("op_3869_cast_fp16")]; + tensor var_3870_perm_0 = const()[name = tensor("op_3870_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor var_3871 = const()[name = tensor("op_3871"), val = tensor([1, 768, 2048])]; + tensor var_3870_cast_fp16 = transpose(perm = var_3870_perm_0, x = var_3869_cast_fp16)[name = tensor("transpose_45")]; + tensor input_223_cast_fp16 = reshape(shape = var_3871, x = var_3870_cast_fp16)[name = tensor("input_223_cast_fp16")]; + tensor layers_22_self_attn_o_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(351137216))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(353234432))), name = tensor("layers_22_self_attn_o_proj_weight_to_fp16_palettized"), shape = tensor([1024, 2048])]; + tensor linear_157_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_22_self_attn_o_proj_weight_to_fp16_palettized, x = input_223_cast_fp16)[name = tensor("linear_157_cast_fp16")]; + tensor x_501_cast_fp16 = add(x = x_483_cast_fp16, y = linear_157_cast_fp16)[name = tensor("x_501_cast_fp16")]; + tensor var_3747_promoted_3_to_fp16 = const()[name = tensor("op_3747_promoted_3_to_fp16"), val = tensor(0x1p+1)]; + tensor var_3878_cast_fp16 = pow(x = x_501_cast_fp16, y = var_3747_promoted_3_to_fp16)[name = tensor("op_3878_cast_fp16")]; + tensor var_3880_axes_0 = const()[name = tensor("op_3880_axes_0"), val = tensor([-1])]; + tensor var_3880_keep_dims_0 = const()[name = tensor("op_3880_keep_dims_0"), val = tensor(true)]; + tensor var_3880_cast_fp16 = reduce_mean(axes = var_3880_axes_0, keep_dims = var_3880_keep_dims_0, x = var_3878_cast_fp16)[name = tensor("op_3880_cast_fp16")]; + tensor var_3881_to_fp16 = const()[name = tensor("op_3881_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_3882_cast_fp16 = add(x = var_3880_cast_fp16, y = var_3881_to_fp16)[name = tensor("op_3882_cast_fp16")]; + tensor norm_183_epsilon_0 = const()[name = tensor("norm_183_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_183_cast_fp16 = rsqrt(epsilon = norm_183_epsilon_0, x = var_3882_cast_fp16)[name = tensor("norm_183_cast_fp16")]; + tensor var_3884_cast_fp16 = mul(x = x_501_cast_fp16, y = norm_183_cast_fp16)[name = tensor("op_3884_cast_fp16")]; + tensor layers_22_post_attention_layernorm_weight_to_fp16 = const()[name = tensor("layers_22_post_attention_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(353235008)))]; + tensor var_3885_cast_fp16 = mul(x = var_3884_cast_fp16, y = layers_22_post_attention_layernorm_weight_to_fp16)[name = tensor("op_3885_cast_fp16")]; + tensor layers_22_mlp_gate_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(353237120))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(356382912))), name = tensor("layers_22_mlp_gate_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_158_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_22_mlp_gate_proj_weight_to_fp16_palettized, x = var_3885_cast_fp16)[name = tensor("linear_158_cast_fp16")]; + tensor var_3895_cast_fp16 = silu(x = linear_158_cast_fp16)[name = tensor("op_3895_cast_fp16")]; + tensor layers_22_mlp_up_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(356383488))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(359529280))), name = tensor("layers_22_mlp_up_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_159_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_22_mlp_up_proj_weight_to_fp16_palettized, x = var_3885_cast_fp16)[name = tensor("linear_159_cast_fp16")]; + tensor input_229_cast_fp16 = mul(x = var_3895_cast_fp16, y = linear_159_cast_fp16)[name = tensor("input_229_cast_fp16")]; + tensor layers_22_mlp_down_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(359529856))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(362675648))), name = tensor("layers_22_mlp_down_proj_weight_to_fp16_palettized"), shape = tensor([1024, 3072])]; + tensor linear_160_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_22_mlp_down_proj_weight_to_fp16_palettized, x = input_229_cast_fp16)[name = tensor("linear_160_cast_fp16")]; + tensor x_505_cast_fp16 = add(x = x_501_cast_fp16, y = linear_160_cast_fp16)[name = tensor("x_505_cast_fp16")]; + tensor var_3915 = const()[name = tensor("op_3915"), val = tensor(-1)]; + tensor var_3914_promoted_to_fp16 = const()[name = tensor("op_3914_promoted_to_fp16"), val = tensor(0x1p+1)]; + tensor var_3924_cast_fp16 = pow(x = x_505_cast_fp16, y = var_3914_promoted_to_fp16)[name = tensor("op_3924_cast_fp16")]; + tensor var_3926_axes_0 = const()[name = tensor("op_3926_axes_0"), val = tensor([-1])]; + tensor var_3926_keep_dims_0 = const()[name = tensor("op_3926_keep_dims_0"), val = tensor(true)]; + tensor var_3926_cast_fp16 = reduce_mean(axes = var_3926_axes_0, keep_dims = var_3926_keep_dims_0, x = var_3924_cast_fp16)[name = tensor("op_3926_cast_fp16")]; + tensor var_3927_to_fp16 = const()[name = tensor("op_3927_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_3928_cast_fp16 = add(x = var_3926_cast_fp16, y = var_3927_to_fp16)[name = tensor("op_3928_cast_fp16")]; + tensor norm_185_epsilon_0 = const()[name = tensor("norm_185_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_185_cast_fp16 = rsqrt(epsilon = norm_185_epsilon_0, x = var_3928_cast_fp16)[name = tensor("norm_185_cast_fp16")]; + tensor var_3930_cast_fp16 = mul(x = x_505_cast_fp16, y = norm_185_cast_fp16)[name = tensor("op_3930_cast_fp16")]; + tensor layers_23_input_layernorm_weight_to_fp16 = const()[name = tensor("layers_23_input_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(362676224)))]; + tensor var_3931_cast_fp16 = mul(x = var_3930_cast_fp16, y = layers_23_input_layernorm_weight_to_fp16)[name = tensor("op_3931_cast_fp16")]; + tensor layers_23_self_attn_q_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(362678336))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(364775552))), name = tensor("layers_23_self_attn_q_proj_weight_to_fp16_palettized"), shape = tensor([2048, 1024])]; + tensor linear_161_cast_fp16 = linear(bias = linear_0_bias_0_to_fp16, weight = layers_23_self_attn_q_proj_weight_to_fp16_palettized, x = var_3931_cast_fp16)[name = tensor("linear_161_cast_fp16")]; + tensor var_3947 = const()[name = tensor("op_3947"), val = tensor([1, 768, 16, 128])]; + tensor var_3948_cast_fp16 = reshape(shape = var_3947, x = linear_161_cast_fp16)[name = tensor("op_3948_cast_fp16")]; + tensor x_511_perm_0 = const()[name = tensor("x_511_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_23_self_attn_k_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(364776128))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(365824768))), name = tensor("layers_23_self_attn_k_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_162_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_23_self_attn_k_proj_weight_to_fp16_palettized, x = var_3931_cast_fp16)[name = tensor("linear_162_cast_fp16")]; + tensor var_3952 = const()[name = tensor("op_3952"), val = tensor([1, 768, 8, 128])]; + tensor var_3953_cast_fp16 = reshape(shape = var_3952, x = linear_162_cast_fp16)[name = tensor("op_3953_cast_fp16")]; + tensor x_515_perm_0 = const()[name = tensor("x_515_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_23_self_attn_v_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(365825344))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(366873984))), name = tensor("layers_23_self_attn_v_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_163_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_23_self_attn_v_proj_weight_to_fp16_palettized, x = var_3931_cast_fp16)[name = tensor("linear_163_cast_fp16")]; + tensor var_3957 = const()[name = tensor("op_3957"), val = tensor([1, 768, 8, 128])]; + tensor var_3958_cast_fp16 = reshape(shape = var_3957, x = linear_163_cast_fp16)[name = tensor("op_3958_cast_fp16")]; + tensor transpose_158_perm_0 = const()[name = tensor("transpose_158_perm_0"), val = tensor([2, 0, 1, 3])]; + tensor var_3914_promoted_1_to_fp16 = const()[name = tensor("op_3914_promoted_1_to_fp16"), val = tensor(0x1p+1)]; + tensor x_511_cast_fp16 = transpose(perm = x_511_perm_0, x = var_3948_cast_fp16)[name = tensor("transpose_44")]; + tensor var_3962_cast_fp16 = pow(x = x_511_cast_fp16, y = var_3914_promoted_1_to_fp16)[name = tensor("op_3962_cast_fp16")]; + tensor var_3964_axes_0 = const()[name = tensor("op_3964_axes_0"), val = tensor([-1])]; + tensor var_3964_keep_dims_0 = const()[name = tensor("op_3964_keep_dims_0"), val = tensor(true)]; + tensor var_3964_cast_fp16 = reduce_mean(axes = var_3964_axes_0, keep_dims = var_3964_keep_dims_0, x = var_3962_cast_fp16)[name = tensor("op_3964_cast_fp16")]; + tensor var_3965_to_fp16 = const()[name = tensor("op_3965_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_3966_cast_fp16 = add(x = var_3964_cast_fp16, y = var_3965_to_fp16)[name = tensor("op_3966_cast_fp16")]; + tensor norm_187_epsilon_0 = const()[name = tensor("norm_187_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_187_cast_fp16 = rsqrt(epsilon = norm_187_epsilon_0, x = var_3966_cast_fp16)[name = tensor("norm_187_cast_fp16")]; + tensor var_3968_cast_fp16 = mul(x = x_511_cast_fp16, y = norm_187_cast_fp16)[name = tensor("op_3968_cast_fp16")]; + tensor layers_23_self_attn_q_norm_weight_to_fp16 = const()[name = tensor("layers_23_self_attn_q_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(366874560)))]; + tensor var_3969_cast_fp16 = mul(x = var_3968_cast_fp16, y = layers_23_self_attn_q_norm_weight_to_fp16)[name = tensor("op_3969_cast_fp16")]; + tensor var_3914_promoted_2_to_fp16 = const()[name = tensor("op_3914_promoted_2_to_fp16"), val = tensor(0x1p+1)]; + tensor x_515_cast_fp16 = transpose(perm = x_515_perm_0, x = var_3953_cast_fp16)[name = tensor("transpose_43")]; + tensor var_3973_cast_fp16 = pow(x = x_515_cast_fp16, y = var_3914_promoted_2_to_fp16)[name = tensor("op_3973_cast_fp16")]; + tensor var_3975_axes_0 = const()[name = tensor("op_3975_axes_0"), val = tensor([-1])]; + tensor var_3975_keep_dims_0 = const()[name = tensor("op_3975_keep_dims_0"), val = tensor(true)]; + tensor var_3975_cast_fp16 = reduce_mean(axes = var_3975_axes_0, keep_dims = var_3975_keep_dims_0, x = var_3973_cast_fp16)[name = tensor("op_3975_cast_fp16")]; + tensor var_3976_to_fp16 = const()[name = tensor("op_3976_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_3977_cast_fp16 = add(x = var_3975_cast_fp16, y = var_3976_to_fp16)[name = tensor("op_3977_cast_fp16")]; + tensor norm_189_epsilon_0 = const()[name = tensor("norm_189_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_189_cast_fp16 = rsqrt(epsilon = norm_189_epsilon_0, x = var_3977_cast_fp16)[name = tensor("norm_189_cast_fp16")]; + tensor var_3979_cast_fp16 = mul(x = x_515_cast_fp16, y = norm_189_cast_fp16)[name = tensor("op_3979_cast_fp16")]; + tensor layers_23_self_attn_k_norm_weight_to_fp16 = const()[name = tensor("layers_23_self_attn_k_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(366874880)))]; + tensor var_3980_cast_fp16 = mul(x = var_3979_cast_fp16, y = layers_23_self_attn_k_norm_weight_to_fp16)[name = tensor("op_3980_cast_fp16")]; + tensor x1_93_begin_0 = const()[name = tensor("x1_93_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_93_end_0 = const()[name = tensor("x1_93_end_0"), val = tensor([1, 16, 768, 64])]; + tensor x1_93_end_mask_0 = const()[name = tensor("x1_93_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_93_cast_fp16 = slice_by_index(begin = x1_93_begin_0, end = x1_93_end_0, end_mask = x1_93_end_mask_0, x = var_3969_cast_fp16)[name = tensor("x1_93_cast_fp16")]; + tensor x2_93_begin_0 = const()[name = tensor("x2_93_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_93_end_0 = const()[name = tensor("x2_93_end_0"), val = tensor([1, 16, 768, 128])]; + tensor x2_93_end_mask_0 = const()[name = tensor("x2_93_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_93_cast_fp16 = slice_by_index(begin = x2_93_begin_0, end = x2_93_end_0, end_mask = x2_93_end_mask_0, x = var_3969_cast_fp16)[name = tensor("x2_93_cast_fp16")]; + tensor var_3997_cast_fp16 = mul(x = x1_93_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_3997_cast_fp16")]; + tensor var_3998_cast_fp16 = mul(x = x2_93_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_3998_cast_fp16")]; + tensor var_3999_cast_fp16 = sub(x = var_3997_cast_fp16, y = var_3998_cast_fp16)[name = tensor("op_3999_cast_fp16")]; + tensor var_4000_cast_fp16 = mul(x = x2_93_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_4000_cast_fp16")]; + tensor var_4001_cast_fp16 = mul(x = x1_93_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_4001_cast_fp16")]; + tensor var_4002_cast_fp16 = add(x = var_4000_cast_fp16, y = var_4001_cast_fp16)[name = tensor("op_4002_cast_fp16")]; + tensor q_47_interleave_0 = const()[name = tensor("q_47_interleave_0"), val = tensor(false)]; + tensor q_47_cast_fp16 = concat(axis = var_3915, interleave = q_47_interleave_0, values = (var_3999_cast_fp16, var_4002_cast_fp16))[name = tensor("q_47_cast_fp16")]; + tensor x1_95_begin_0 = const()[name = tensor("x1_95_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_95_end_0 = const()[name = tensor("x1_95_end_0"), val = tensor([1, 8, 768, 64])]; + tensor x1_95_end_mask_0 = const()[name = tensor("x1_95_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_95_cast_fp16 = slice_by_index(begin = x1_95_begin_0, end = x1_95_end_0, end_mask = x1_95_end_mask_0, x = var_3980_cast_fp16)[name = tensor("x1_95_cast_fp16")]; + tensor x2_95_begin_0 = const()[name = tensor("x2_95_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_95_end_0 = const()[name = tensor("x2_95_end_0"), val = tensor([1, 8, 768, 128])]; + tensor x2_95_end_mask_0 = const()[name = tensor("x2_95_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_95_cast_fp16 = slice_by_index(begin = x2_95_begin_0, end = x2_95_end_0, end_mask = x2_95_end_mask_0, x = var_3980_cast_fp16)[name = tensor("x2_95_cast_fp16")]; + tensor var_4020_cast_fp16 = mul(x = x1_95_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_4020_cast_fp16")]; + tensor var_4021_cast_fp16 = mul(x = x2_95_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_4021_cast_fp16")]; + tensor var_4022_cast_fp16 = sub(x = var_4020_cast_fp16, y = var_4021_cast_fp16)[name = tensor("op_4022_cast_fp16")]; + tensor var_4023_cast_fp16 = mul(x = x2_95_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_4023_cast_fp16")]; + tensor var_4024_cast_fp16 = mul(x = x1_95_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_4024_cast_fp16")]; + tensor var_4025_cast_fp16 = add(x = var_4023_cast_fp16, y = var_4024_cast_fp16)[name = tensor("op_4025_cast_fp16")]; + tensor k_93_interleave_0 = const()[name = tensor("k_93_interleave_0"), val = tensor(false)]; + tensor k_93_cast_fp16 = concat(axis = var_3915, interleave = k_93_interleave_0, values = (var_4022_cast_fp16, var_4025_cast_fp16))[name = tensor("k_93_cast_fp16")]; + tensor transpose_92_perm_0 = const()[name = tensor("transpose_92_perm_0"), val = tensor([1, 0, 2, 3])]; + tensor tile_46_reps_0 = const()[name = tensor("tile_46_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_92_cast_fp16 = transpose(perm = transpose_92_perm_0, x = k_93_cast_fp16)[name = tensor("transpose_42")]; + tensor tile_46_cast_fp16 = tile(reps = tile_46_reps_0, x = transpose_92_cast_fp16)[name = tensor("tile_46_cast_fp16")]; + tensor concat_92 = const()[name = tensor("concat_92"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_92_cast_fp16 = reshape(shape = concat_92, x = tile_46_cast_fp16)[name = tensor("reshape_92_cast_fp16")]; + tensor transpose_93_perm_0 = const()[name = tensor("transpose_93_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_93 = const()[name = tensor("concat_93"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_93_cast_fp16 = transpose(perm = transpose_93_perm_0, x = reshape_92_cast_fp16)[name = tensor("transpose_41")]; + tensor reshape_93_cast_fp16 = reshape(shape = concat_93, x = transpose_93_cast_fp16)[name = tensor("reshape_93_cast_fp16")]; + tensor transpose_159_perm_0 = const()[name = tensor("transpose_159_perm_0"), val = tensor([1, 0, -1, -2])]; + tensor tile_47_reps_0 = const()[name = tensor("tile_47_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_158_cast_fp16 = transpose(perm = transpose_158_perm_0, x = var_3958_cast_fp16)[name = tensor("transpose_40")]; + tensor tile_47_cast_fp16 = tile(reps = tile_47_reps_0, x = transpose_158_cast_fp16)[name = tensor("tile_47_cast_fp16")]; + tensor concat_94 = const()[name = tensor("concat_94"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_94_cast_fp16 = reshape(shape = concat_94, x = tile_47_cast_fp16)[name = tensor("reshape_94_cast_fp16")]; + tensor transpose_95_perm_0 = const()[name = tensor("transpose_95_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_95 = const()[name = tensor("concat_95"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_95_cast_fp16 = transpose(perm = transpose_95_perm_0, x = reshape_94_cast_fp16)[name = tensor("transpose_39")]; + tensor reshape_95_cast_fp16 = reshape(shape = concat_95, x = transpose_95_cast_fp16)[name = tensor("reshape_95_cast_fp16")]; + tensor v_95_perm_0 = const()[name = tensor("v_95_perm_0"), val = tensor([1, 0, -2, -1])]; + tensor var_4031_transpose_x_0 = const()[name = tensor("op_4031_transpose_x_0"), val = tensor(false)]; + tensor var_4031_transpose_y_0 = const()[name = tensor("op_4031_transpose_y_0"), val = tensor(false)]; + tensor transpose_159_cast_fp16 = transpose(perm = transpose_159_perm_0, x = reshape_93_cast_fp16)[name = tensor("transpose_38")]; + tensor var_4031_cast_fp16 = matmul(transpose_x = var_4031_transpose_x_0, transpose_y = var_4031_transpose_y_0, x = q_47_cast_fp16, y = transpose_159_cast_fp16)[name = tensor("op_4031_cast_fp16")]; + tensor var_4032_to_fp16 = const()[name = tensor("op_4032_to_fp16"), val = tensor(0x1.6ap-4)]; + tensor attn_93_cast_fp16 = mul(x = var_4031_cast_fp16, y = var_4032_to_fp16)[name = tensor("attn_93_cast_fp16")]; + tensor input_231_cast_fp16 = add(x = attn_93_cast_fp16, y = causal_mask_to_fp16_palettized)[name = tensor("input_231_cast_fp16")]; + tensor attn_95_cast_fp16 = softmax(axis = var_3915, x = input_231_cast_fp16)[name = tensor("attn_95_cast_fp16")]; + tensor var_4036_transpose_x_0 = const()[name = tensor("op_4036_transpose_x_0"), val = tensor(false)]; + tensor var_4036_transpose_y_0 = const()[name = tensor("op_4036_transpose_y_0"), val = tensor(false)]; + tensor v_95_cast_fp16 = transpose(perm = v_95_perm_0, x = reshape_95_cast_fp16)[name = tensor("transpose_37")]; + tensor var_4036_cast_fp16 = matmul(transpose_x = var_4036_transpose_x_0, transpose_y = var_4036_transpose_y_0, x = attn_95_cast_fp16, y = v_95_cast_fp16)[name = tensor("op_4036_cast_fp16")]; + tensor var_4037_perm_0 = const()[name = tensor("op_4037_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor var_4038 = const()[name = tensor("op_4038"), val = tensor([1, 768, 2048])]; + tensor var_4037_cast_fp16 = transpose(perm = var_4037_perm_0, x = var_4036_cast_fp16)[name = tensor("transpose_36")]; + tensor input_233_cast_fp16 = reshape(shape = var_4038, x = var_4037_cast_fp16)[name = tensor("input_233_cast_fp16")]; + tensor layers_23_self_attn_o_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(366875200))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(368972416))), name = tensor("layers_23_self_attn_o_proj_weight_to_fp16_palettized"), shape = tensor([1024, 2048])]; + tensor linear_164_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_23_self_attn_o_proj_weight_to_fp16_palettized, x = input_233_cast_fp16)[name = tensor("linear_164_cast_fp16")]; + tensor x_523_cast_fp16 = add(x = x_505_cast_fp16, y = linear_164_cast_fp16)[name = tensor("x_523_cast_fp16")]; + tensor var_3914_promoted_3_to_fp16 = const()[name = tensor("op_3914_promoted_3_to_fp16"), val = tensor(0x1p+1)]; + tensor var_4045_cast_fp16 = pow(x = x_523_cast_fp16, y = var_3914_promoted_3_to_fp16)[name = tensor("op_4045_cast_fp16")]; + tensor var_4047_axes_0 = const()[name = tensor("op_4047_axes_0"), val = tensor([-1])]; + tensor var_4047_keep_dims_0 = const()[name = tensor("op_4047_keep_dims_0"), val = tensor(true)]; + tensor var_4047_cast_fp16 = reduce_mean(axes = var_4047_axes_0, keep_dims = var_4047_keep_dims_0, x = var_4045_cast_fp16)[name = tensor("op_4047_cast_fp16")]; + tensor var_4048_to_fp16 = const()[name = tensor("op_4048_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_4049_cast_fp16 = add(x = var_4047_cast_fp16, y = var_4048_to_fp16)[name = tensor("op_4049_cast_fp16")]; + tensor norm_191_epsilon_0 = const()[name = tensor("norm_191_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_191_cast_fp16 = rsqrt(epsilon = norm_191_epsilon_0, x = var_4049_cast_fp16)[name = tensor("norm_191_cast_fp16")]; + tensor var_4051_cast_fp16 = mul(x = x_523_cast_fp16, y = norm_191_cast_fp16)[name = tensor("op_4051_cast_fp16")]; + tensor layers_23_post_attention_layernorm_weight_to_fp16 = const()[name = tensor("layers_23_post_attention_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(368972992)))]; + tensor var_4052_cast_fp16 = mul(x = var_4051_cast_fp16, y = layers_23_post_attention_layernorm_weight_to_fp16)[name = tensor("op_4052_cast_fp16")]; + tensor layers_23_mlp_gate_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(368975104))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(372120896))), name = tensor("layers_23_mlp_gate_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_165_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_23_mlp_gate_proj_weight_to_fp16_palettized, x = var_4052_cast_fp16)[name = tensor("linear_165_cast_fp16")]; + tensor var_4062_cast_fp16 = silu(x = linear_165_cast_fp16)[name = tensor("op_4062_cast_fp16")]; + tensor layers_23_mlp_up_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(372121472))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(375267264))), name = tensor("layers_23_mlp_up_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_166_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_23_mlp_up_proj_weight_to_fp16_palettized, x = var_4052_cast_fp16)[name = tensor("linear_166_cast_fp16")]; + tensor input_239_cast_fp16 = mul(x = var_4062_cast_fp16, y = linear_166_cast_fp16)[name = tensor("input_239_cast_fp16")]; + tensor layers_23_mlp_down_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(375267840))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(378413632))), name = tensor("layers_23_mlp_down_proj_weight_to_fp16_palettized"), shape = tensor([1024, 3072])]; + tensor linear_167_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_23_mlp_down_proj_weight_to_fp16_palettized, x = input_239_cast_fp16)[name = tensor("linear_167_cast_fp16")]; + tensor x_527_cast_fp16 = add(x = x_523_cast_fp16, y = linear_167_cast_fp16)[name = tensor("x_527_cast_fp16")]; + tensor var_4082 = const()[name = tensor("op_4082"), val = tensor(-1)]; + tensor var_4081_promoted_to_fp16 = const()[name = tensor("op_4081_promoted_to_fp16"), val = tensor(0x1p+1)]; + tensor var_4091_cast_fp16 = pow(x = x_527_cast_fp16, y = var_4081_promoted_to_fp16)[name = tensor("op_4091_cast_fp16")]; + tensor var_4093_axes_0 = const()[name = tensor("op_4093_axes_0"), val = tensor([-1])]; + tensor var_4093_keep_dims_0 = const()[name = tensor("op_4093_keep_dims_0"), val = tensor(true)]; + tensor var_4093_cast_fp16 = reduce_mean(axes = var_4093_axes_0, keep_dims = var_4093_keep_dims_0, x = var_4091_cast_fp16)[name = tensor("op_4093_cast_fp16")]; + tensor var_4094_to_fp16 = const()[name = tensor("op_4094_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_4095_cast_fp16 = add(x = var_4093_cast_fp16, y = var_4094_to_fp16)[name = tensor("op_4095_cast_fp16")]; + tensor norm_193_epsilon_0 = const()[name = tensor("norm_193_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_193_cast_fp16 = rsqrt(epsilon = norm_193_epsilon_0, x = var_4095_cast_fp16)[name = tensor("norm_193_cast_fp16")]; + tensor var_4097_cast_fp16 = mul(x = x_527_cast_fp16, y = norm_193_cast_fp16)[name = tensor("op_4097_cast_fp16")]; + tensor layers_24_input_layernorm_weight_to_fp16 = const()[name = tensor("layers_24_input_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(378414208)))]; + tensor var_4098_cast_fp16 = mul(x = var_4097_cast_fp16, y = layers_24_input_layernorm_weight_to_fp16)[name = tensor("op_4098_cast_fp16")]; + tensor layers_24_self_attn_q_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(378416320))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(380513536))), name = tensor("layers_24_self_attn_q_proj_weight_to_fp16_palettized"), shape = tensor([2048, 1024])]; + tensor linear_168_cast_fp16 = linear(bias = linear_0_bias_0_to_fp16, weight = layers_24_self_attn_q_proj_weight_to_fp16_palettized, x = var_4098_cast_fp16)[name = tensor("linear_168_cast_fp16")]; + tensor var_4114 = const()[name = tensor("op_4114"), val = tensor([1, 768, 16, 128])]; + tensor var_4115_cast_fp16 = reshape(shape = var_4114, x = linear_168_cast_fp16)[name = tensor("op_4115_cast_fp16")]; + tensor x_533_perm_0 = const()[name = tensor("x_533_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_24_self_attn_k_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(380514112))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(381562752))), name = tensor("layers_24_self_attn_k_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_169_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_24_self_attn_k_proj_weight_to_fp16_palettized, x = var_4098_cast_fp16)[name = tensor("linear_169_cast_fp16")]; + tensor var_4119 = const()[name = tensor("op_4119"), val = tensor([1, 768, 8, 128])]; + tensor var_4120_cast_fp16 = reshape(shape = var_4119, x = linear_169_cast_fp16)[name = tensor("op_4120_cast_fp16")]; + tensor x_537_perm_0 = const()[name = tensor("x_537_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_24_self_attn_v_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(381563328))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(382611968))), name = tensor("layers_24_self_attn_v_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_170_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_24_self_attn_v_proj_weight_to_fp16_palettized, x = var_4098_cast_fp16)[name = tensor("linear_170_cast_fp16")]; + tensor var_4124 = const()[name = tensor("op_4124"), val = tensor([1, 768, 8, 128])]; + tensor var_4125_cast_fp16 = reshape(shape = var_4124, x = linear_170_cast_fp16)[name = tensor("op_4125_cast_fp16")]; + tensor transpose_160_perm_0 = const()[name = tensor("transpose_160_perm_0"), val = tensor([2, 0, 1, 3])]; + tensor var_4081_promoted_1_to_fp16 = const()[name = tensor("op_4081_promoted_1_to_fp16"), val = tensor(0x1p+1)]; + tensor x_533_cast_fp16 = transpose(perm = x_533_perm_0, x = var_4115_cast_fp16)[name = tensor("transpose_35")]; + tensor var_4129_cast_fp16 = pow(x = x_533_cast_fp16, y = var_4081_promoted_1_to_fp16)[name = tensor("op_4129_cast_fp16")]; + tensor var_4131_axes_0 = const()[name = tensor("op_4131_axes_0"), val = tensor([-1])]; + tensor var_4131_keep_dims_0 = const()[name = tensor("op_4131_keep_dims_0"), val = tensor(true)]; + tensor var_4131_cast_fp16 = reduce_mean(axes = var_4131_axes_0, keep_dims = var_4131_keep_dims_0, x = var_4129_cast_fp16)[name = tensor("op_4131_cast_fp16")]; + tensor var_4132_to_fp16 = const()[name = tensor("op_4132_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_4133_cast_fp16 = add(x = var_4131_cast_fp16, y = var_4132_to_fp16)[name = tensor("op_4133_cast_fp16")]; + tensor norm_195_epsilon_0 = const()[name = tensor("norm_195_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_195_cast_fp16 = rsqrt(epsilon = norm_195_epsilon_0, x = var_4133_cast_fp16)[name = tensor("norm_195_cast_fp16")]; + tensor var_4135_cast_fp16 = mul(x = x_533_cast_fp16, y = norm_195_cast_fp16)[name = tensor("op_4135_cast_fp16")]; + tensor layers_24_self_attn_q_norm_weight_to_fp16 = const()[name = tensor("layers_24_self_attn_q_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(382612544)))]; + tensor var_4136_cast_fp16 = mul(x = var_4135_cast_fp16, y = layers_24_self_attn_q_norm_weight_to_fp16)[name = tensor("op_4136_cast_fp16")]; + tensor var_4081_promoted_2_to_fp16 = const()[name = tensor("op_4081_promoted_2_to_fp16"), val = tensor(0x1p+1)]; + tensor x_537_cast_fp16 = transpose(perm = x_537_perm_0, x = var_4120_cast_fp16)[name = tensor("transpose_34")]; + tensor var_4140_cast_fp16 = pow(x = x_537_cast_fp16, y = var_4081_promoted_2_to_fp16)[name = tensor("op_4140_cast_fp16")]; + tensor var_4142_axes_0 = const()[name = tensor("op_4142_axes_0"), val = tensor([-1])]; + tensor var_4142_keep_dims_0 = const()[name = tensor("op_4142_keep_dims_0"), val = tensor(true)]; + tensor var_4142_cast_fp16 = reduce_mean(axes = var_4142_axes_0, keep_dims = var_4142_keep_dims_0, x = var_4140_cast_fp16)[name = tensor("op_4142_cast_fp16")]; + tensor var_4143_to_fp16 = const()[name = tensor("op_4143_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_4144_cast_fp16 = add(x = var_4142_cast_fp16, y = var_4143_to_fp16)[name = tensor("op_4144_cast_fp16")]; + tensor norm_197_epsilon_0 = const()[name = tensor("norm_197_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_197_cast_fp16 = rsqrt(epsilon = norm_197_epsilon_0, x = var_4144_cast_fp16)[name = tensor("norm_197_cast_fp16")]; + tensor var_4146_cast_fp16 = mul(x = x_537_cast_fp16, y = norm_197_cast_fp16)[name = tensor("op_4146_cast_fp16")]; + tensor layers_24_self_attn_k_norm_weight_to_fp16 = const()[name = tensor("layers_24_self_attn_k_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(382612864)))]; + tensor var_4147_cast_fp16 = mul(x = var_4146_cast_fp16, y = layers_24_self_attn_k_norm_weight_to_fp16)[name = tensor("op_4147_cast_fp16")]; + tensor x1_97_begin_0 = const()[name = tensor("x1_97_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_97_end_0 = const()[name = tensor("x1_97_end_0"), val = tensor([1, 16, 768, 64])]; + tensor x1_97_end_mask_0 = const()[name = tensor("x1_97_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_97_cast_fp16 = slice_by_index(begin = x1_97_begin_0, end = x1_97_end_0, end_mask = x1_97_end_mask_0, x = var_4136_cast_fp16)[name = tensor("x1_97_cast_fp16")]; + tensor x2_97_begin_0 = const()[name = tensor("x2_97_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_97_end_0 = const()[name = tensor("x2_97_end_0"), val = tensor([1, 16, 768, 128])]; + tensor x2_97_end_mask_0 = const()[name = tensor("x2_97_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_97_cast_fp16 = slice_by_index(begin = x2_97_begin_0, end = x2_97_end_0, end_mask = x2_97_end_mask_0, x = var_4136_cast_fp16)[name = tensor("x2_97_cast_fp16")]; + tensor var_4164_cast_fp16 = mul(x = x1_97_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_4164_cast_fp16")]; + tensor var_4165_cast_fp16 = mul(x = x2_97_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_4165_cast_fp16")]; + tensor var_4166_cast_fp16 = sub(x = var_4164_cast_fp16, y = var_4165_cast_fp16)[name = tensor("op_4166_cast_fp16")]; + tensor var_4167_cast_fp16 = mul(x = x2_97_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_4167_cast_fp16")]; + tensor var_4168_cast_fp16 = mul(x = x1_97_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_4168_cast_fp16")]; + tensor var_4169_cast_fp16 = add(x = var_4167_cast_fp16, y = var_4168_cast_fp16)[name = tensor("op_4169_cast_fp16")]; + tensor q_49_interleave_0 = const()[name = tensor("q_49_interleave_0"), val = tensor(false)]; + tensor q_49_cast_fp16 = concat(axis = var_4082, interleave = q_49_interleave_0, values = (var_4166_cast_fp16, var_4169_cast_fp16))[name = tensor("q_49_cast_fp16")]; + tensor x1_99_begin_0 = const()[name = tensor("x1_99_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_99_end_0 = const()[name = tensor("x1_99_end_0"), val = tensor([1, 8, 768, 64])]; + tensor x1_99_end_mask_0 = const()[name = tensor("x1_99_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_99_cast_fp16 = slice_by_index(begin = x1_99_begin_0, end = x1_99_end_0, end_mask = x1_99_end_mask_0, x = var_4147_cast_fp16)[name = tensor("x1_99_cast_fp16")]; + tensor x2_99_begin_0 = const()[name = tensor("x2_99_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_99_end_0 = const()[name = tensor("x2_99_end_0"), val = tensor([1, 8, 768, 128])]; + tensor x2_99_end_mask_0 = const()[name = tensor("x2_99_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_99_cast_fp16 = slice_by_index(begin = x2_99_begin_0, end = x2_99_end_0, end_mask = x2_99_end_mask_0, x = var_4147_cast_fp16)[name = tensor("x2_99_cast_fp16")]; + tensor var_4187_cast_fp16 = mul(x = x1_99_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_4187_cast_fp16")]; + tensor var_4188_cast_fp16 = mul(x = x2_99_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_4188_cast_fp16")]; + tensor var_4189_cast_fp16 = sub(x = var_4187_cast_fp16, y = var_4188_cast_fp16)[name = tensor("op_4189_cast_fp16")]; + tensor var_4190_cast_fp16 = mul(x = x2_99_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_4190_cast_fp16")]; + tensor var_4191_cast_fp16 = mul(x = x1_99_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_4191_cast_fp16")]; + tensor var_4192_cast_fp16 = add(x = var_4190_cast_fp16, y = var_4191_cast_fp16)[name = tensor("op_4192_cast_fp16")]; + tensor k_97_interleave_0 = const()[name = tensor("k_97_interleave_0"), val = tensor(false)]; + tensor k_97_cast_fp16 = concat(axis = var_4082, interleave = k_97_interleave_0, values = (var_4189_cast_fp16, var_4192_cast_fp16))[name = tensor("k_97_cast_fp16")]; + tensor transpose_96_perm_0 = const()[name = tensor("transpose_96_perm_0"), val = tensor([1, 0, 2, 3])]; + tensor tile_48_reps_0 = const()[name = tensor("tile_48_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_96_cast_fp16 = transpose(perm = transpose_96_perm_0, x = k_97_cast_fp16)[name = tensor("transpose_33")]; + tensor tile_48_cast_fp16 = tile(reps = tile_48_reps_0, x = transpose_96_cast_fp16)[name = tensor("tile_48_cast_fp16")]; + tensor concat_96 = const()[name = tensor("concat_96"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_96_cast_fp16 = reshape(shape = concat_96, x = tile_48_cast_fp16)[name = tensor("reshape_96_cast_fp16")]; + tensor transpose_97_perm_0 = const()[name = tensor("transpose_97_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_97 = const()[name = tensor("concat_97"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_97_cast_fp16 = transpose(perm = transpose_97_perm_0, x = reshape_96_cast_fp16)[name = tensor("transpose_32")]; + tensor reshape_97_cast_fp16 = reshape(shape = concat_97, x = transpose_97_cast_fp16)[name = tensor("reshape_97_cast_fp16")]; + tensor transpose_161_perm_0 = const()[name = tensor("transpose_161_perm_0"), val = tensor([1, 0, -1, -2])]; + tensor tile_49_reps_0 = const()[name = tensor("tile_49_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_160_cast_fp16 = transpose(perm = transpose_160_perm_0, x = var_4125_cast_fp16)[name = tensor("transpose_31")]; + tensor tile_49_cast_fp16 = tile(reps = tile_49_reps_0, x = transpose_160_cast_fp16)[name = tensor("tile_49_cast_fp16")]; + tensor concat_98 = const()[name = tensor("concat_98"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_98_cast_fp16 = reshape(shape = concat_98, x = tile_49_cast_fp16)[name = tensor("reshape_98_cast_fp16")]; + tensor transpose_99_perm_0 = const()[name = tensor("transpose_99_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_99 = const()[name = tensor("concat_99"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_99_cast_fp16 = transpose(perm = transpose_99_perm_0, x = reshape_98_cast_fp16)[name = tensor("transpose_30")]; + tensor reshape_99_cast_fp16 = reshape(shape = concat_99, x = transpose_99_cast_fp16)[name = tensor("reshape_99_cast_fp16")]; + tensor v_99_perm_0 = const()[name = tensor("v_99_perm_0"), val = tensor([1, 0, -2, -1])]; + tensor var_4198_transpose_x_0 = const()[name = tensor("op_4198_transpose_x_0"), val = tensor(false)]; + tensor var_4198_transpose_y_0 = const()[name = tensor("op_4198_transpose_y_0"), val = tensor(false)]; + tensor transpose_161_cast_fp16 = transpose(perm = transpose_161_perm_0, x = reshape_97_cast_fp16)[name = tensor("transpose_29")]; + tensor var_4198_cast_fp16 = matmul(transpose_x = var_4198_transpose_x_0, transpose_y = var_4198_transpose_y_0, x = q_49_cast_fp16, y = transpose_161_cast_fp16)[name = tensor("op_4198_cast_fp16")]; + tensor var_4199_to_fp16 = const()[name = tensor("op_4199_to_fp16"), val = tensor(0x1.6ap-4)]; + tensor attn_97_cast_fp16 = mul(x = var_4198_cast_fp16, y = var_4199_to_fp16)[name = tensor("attn_97_cast_fp16")]; + tensor input_241_cast_fp16 = add(x = attn_97_cast_fp16, y = causal_mask_to_fp16_palettized)[name = tensor("input_241_cast_fp16")]; + tensor attn_99_cast_fp16 = softmax(axis = var_4082, x = input_241_cast_fp16)[name = tensor("attn_99_cast_fp16")]; + tensor var_4203_transpose_x_0 = const()[name = tensor("op_4203_transpose_x_0"), val = tensor(false)]; + tensor var_4203_transpose_y_0 = const()[name = tensor("op_4203_transpose_y_0"), val = tensor(false)]; + tensor v_99_cast_fp16 = transpose(perm = v_99_perm_0, x = reshape_99_cast_fp16)[name = tensor("transpose_28")]; + tensor var_4203_cast_fp16 = matmul(transpose_x = var_4203_transpose_x_0, transpose_y = var_4203_transpose_y_0, x = attn_99_cast_fp16, y = v_99_cast_fp16)[name = tensor("op_4203_cast_fp16")]; + tensor var_4204_perm_0 = const()[name = tensor("op_4204_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor var_4205 = const()[name = tensor("op_4205"), val = tensor([1, 768, 2048])]; + tensor var_4204_cast_fp16 = transpose(perm = var_4204_perm_0, x = var_4203_cast_fp16)[name = tensor("transpose_27")]; + tensor input_243_cast_fp16 = reshape(shape = var_4205, x = var_4204_cast_fp16)[name = tensor("input_243_cast_fp16")]; + tensor layers_24_self_attn_o_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(382613184))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(384710400))), name = tensor("layers_24_self_attn_o_proj_weight_to_fp16_palettized"), shape = tensor([1024, 2048])]; + tensor linear_171_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_24_self_attn_o_proj_weight_to_fp16_palettized, x = input_243_cast_fp16)[name = tensor("linear_171_cast_fp16")]; + tensor x_545_cast_fp16 = add(x = x_527_cast_fp16, y = linear_171_cast_fp16)[name = tensor("x_545_cast_fp16")]; + tensor var_4081_promoted_3_to_fp16 = const()[name = tensor("op_4081_promoted_3_to_fp16"), val = tensor(0x1p+1)]; + tensor var_4212_cast_fp16 = pow(x = x_545_cast_fp16, y = var_4081_promoted_3_to_fp16)[name = tensor("op_4212_cast_fp16")]; + tensor var_4214_axes_0 = const()[name = tensor("op_4214_axes_0"), val = tensor([-1])]; + tensor var_4214_keep_dims_0 = const()[name = tensor("op_4214_keep_dims_0"), val = tensor(true)]; + tensor var_4214_cast_fp16 = reduce_mean(axes = var_4214_axes_0, keep_dims = var_4214_keep_dims_0, x = var_4212_cast_fp16)[name = tensor("op_4214_cast_fp16")]; + tensor var_4215_to_fp16 = const()[name = tensor("op_4215_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_4216_cast_fp16 = add(x = var_4214_cast_fp16, y = var_4215_to_fp16)[name = tensor("op_4216_cast_fp16")]; + tensor norm_199_epsilon_0 = const()[name = tensor("norm_199_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_199_cast_fp16 = rsqrt(epsilon = norm_199_epsilon_0, x = var_4216_cast_fp16)[name = tensor("norm_199_cast_fp16")]; + tensor var_4218_cast_fp16 = mul(x = x_545_cast_fp16, y = norm_199_cast_fp16)[name = tensor("op_4218_cast_fp16")]; + tensor layers_24_post_attention_layernorm_weight_to_fp16 = const()[name = tensor("layers_24_post_attention_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(384710976)))]; + tensor var_4219_cast_fp16 = mul(x = var_4218_cast_fp16, y = layers_24_post_attention_layernorm_weight_to_fp16)[name = tensor("op_4219_cast_fp16")]; + tensor layers_24_mlp_gate_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(384713088))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(387858880))), name = tensor("layers_24_mlp_gate_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_172_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_24_mlp_gate_proj_weight_to_fp16_palettized, x = var_4219_cast_fp16)[name = tensor("linear_172_cast_fp16")]; + tensor var_4229_cast_fp16 = silu(x = linear_172_cast_fp16)[name = tensor("op_4229_cast_fp16")]; + tensor layers_24_mlp_up_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(387859456))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(391005248))), name = tensor("layers_24_mlp_up_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_173_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_24_mlp_up_proj_weight_to_fp16_palettized, x = var_4219_cast_fp16)[name = tensor("linear_173_cast_fp16")]; + tensor input_249_cast_fp16 = mul(x = var_4229_cast_fp16, y = linear_173_cast_fp16)[name = tensor("input_249_cast_fp16")]; + tensor layers_24_mlp_down_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(391005824))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(394151616))), name = tensor("layers_24_mlp_down_proj_weight_to_fp16_palettized"), shape = tensor([1024, 3072])]; + tensor linear_174_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_24_mlp_down_proj_weight_to_fp16_palettized, x = input_249_cast_fp16)[name = tensor("linear_174_cast_fp16")]; + tensor x_549_cast_fp16 = add(x = x_545_cast_fp16, y = linear_174_cast_fp16)[name = tensor("x_549_cast_fp16")]; + tensor var_4249 = const()[name = tensor("op_4249"), val = tensor(-1)]; + tensor var_4248_promoted_to_fp16 = const()[name = tensor("op_4248_promoted_to_fp16"), val = tensor(0x1p+1)]; + tensor var_4258_cast_fp16 = pow(x = x_549_cast_fp16, y = var_4248_promoted_to_fp16)[name = tensor("op_4258_cast_fp16")]; + tensor var_4260_axes_0 = const()[name = tensor("op_4260_axes_0"), val = tensor([-1])]; + tensor var_4260_keep_dims_0 = const()[name = tensor("op_4260_keep_dims_0"), val = tensor(true)]; + tensor var_4260_cast_fp16 = reduce_mean(axes = var_4260_axes_0, keep_dims = var_4260_keep_dims_0, x = var_4258_cast_fp16)[name = tensor("op_4260_cast_fp16")]; + tensor var_4261_to_fp16 = const()[name = tensor("op_4261_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_4262_cast_fp16 = add(x = var_4260_cast_fp16, y = var_4261_to_fp16)[name = tensor("op_4262_cast_fp16")]; + tensor norm_201_epsilon_0 = const()[name = tensor("norm_201_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_201_cast_fp16 = rsqrt(epsilon = norm_201_epsilon_0, x = var_4262_cast_fp16)[name = tensor("norm_201_cast_fp16")]; + tensor var_4264_cast_fp16 = mul(x = x_549_cast_fp16, y = norm_201_cast_fp16)[name = tensor("op_4264_cast_fp16")]; + tensor layers_25_input_layernorm_weight_to_fp16 = const()[name = tensor("layers_25_input_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(394152192)))]; + tensor var_4265_cast_fp16 = mul(x = var_4264_cast_fp16, y = layers_25_input_layernorm_weight_to_fp16)[name = tensor("op_4265_cast_fp16")]; + tensor layers_25_self_attn_q_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(394154304))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(396251520))), name = tensor("layers_25_self_attn_q_proj_weight_to_fp16_palettized"), shape = tensor([2048, 1024])]; + tensor linear_175_cast_fp16 = linear(bias = linear_0_bias_0_to_fp16, weight = layers_25_self_attn_q_proj_weight_to_fp16_palettized, x = var_4265_cast_fp16)[name = tensor("linear_175_cast_fp16")]; + tensor var_4281 = const()[name = tensor("op_4281"), val = tensor([1, 768, 16, 128])]; + tensor var_4282_cast_fp16 = reshape(shape = var_4281, x = linear_175_cast_fp16)[name = tensor("op_4282_cast_fp16")]; + tensor x_555_perm_0 = const()[name = tensor("x_555_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_25_self_attn_k_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(396252096))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(397300736))), name = tensor("layers_25_self_attn_k_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_176_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_25_self_attn_k_proj_weight_to_fp16_palettized, x = var_4265_cast_fp16)[name = tensor("linear_176_cast_fp16")]; + tensor var_4286 = const()[name = tensor("op_4286"), val = tensor([1, 768, 8, 128])]; + tensor var_4287_cast_fp16 = reshape(shape = var_4286, x = linear_176_cast_fp16)[name = tensor("op_4287_cast_fp16")]; + tensor x_559_perm_0 = const()[name = tensor("x_559_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_25_self_attn_v_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(397301312))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(398349952))), name = tensor("layers_25_self_attn_v_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_177_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_25_self_attn_v_proj_weight_to_fp16_palettized, x = var_4265_cast_fp16)[name = tensor("linear_177_cast_fp16")]; + tensor var_4291 = const()[name = tensor("op_4291"), val = tensor([1, 768, 8, 128])]; + tensor var_4292_cast_fp16 = reshape(shape = var_4291, x = linear_177_cast_fp16)[name = tensor("op_4292_cast_fp16")]; + tensor transpose_162_perm_0 = const()[name = tensor("transpose_162_perm_0"), val = tensor([2, 0, 1, 3])]; + tensor var_4248_promoted_1_to_fp16 = const()[name = tensor("op_4248_promoted_1_to_fp16"), val = tensor(0x1p+1)]; + tensor x_555_cast_fp16 = transpose(perm = x_555_perm_0, x = var_4282_cast_fp16)[name = tensor("transpose_26")]; + tensor var_4296_cast_fp16 = pow(x = x_555_cast_fp16, y = var_4248_promoted_1_to_fp16)[name = tensor("op_4296_cast_fp16")]; + tensor var_4298_axes_0 = const()[name = tensor("op_4298_axes_0"), val = tensor([-1])]; + tensor var_4298_keep_dims_0 = const()[name = tensor("op_4298_keep_dims_0"), val = tensor(true)]; + tensor var_4298_cast_fp16 = reduce_mean(axes = var_4298_axes_0, keep_dims = var_4298_keep_dims_0, x = var_4296_cast_fp16)[name = tensor("op_4298_cast_fp16")]; + tensor var_4299_to_fp16 = const()[name = tensor("op_4299_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_4300_cast_fp16 = add(x = var_4298_cast_fp16, y = var_4299_to_fp16)[name = tensor("op_4300_cast_fp16")]; + tensor norm_203_epsilon_0 = const()[name = tensor("norm_203_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_203_cast_fp16 = rsqrt(epsilon = norm_203_epsilon_0, x = var_4300_cast_fp16)[name = tensor("norm_203_cast_fp16")]; + tensor var_4302_cast_fp16 = mul(x = x_555_cast_fp16, y = norm_203_cast_fp16)[name = tensor("op_4302_cast_fp16")]; + tensor layers_25_self_attn_q_norm_weight_to_fp16 = const()[name = tensor("layers_25_self_attn_q_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(398350528)))]; + tensor var_4303_cast_fp16 = mul(x = var_4302_cast_fp16, y = layers_25_self_attn_q_norm_weight_to_fp16)[name = tensor("op_4303_cast_fp16")]; + tensor var_4248_promoted_2_to_fp16 = const()[name = tensor("op_4248_promoted_2_to_fp16"), val = tensor(0x1p+1)]; + tensor x_559_cast_fp16 = transpose(perm = x_559_perm_0, x = var_4287_cast_fp16)[name = tensor("transpose_25")]; + tensor var_4307_cast_fp16 = pow(x = x_559_cast_fp16, y = var_4248_promoted_2_to_fp16)[name = tensor("op_4307_cast_fp16")]; + tensor var_4309_axes_0 = const()[name = tensor("op_4309_axes_0"), val = tensor([-1])]; + tensor var_4309_keep_dims_0 = const()[name = tensor("op_4309_keep_dims_0"), val = tensor(true)]; + tensor var_4309_cast_fp16 = reduce_mean(axes = var_4309_axes_0, keep_dims = var_4309_keep_dims_0, x = var_4307_cast_fp16)[name = tensor("op_4309_cast_fp16")]; + tensor var_4310_to_fp16 = const()[name = tensor("op_4310_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_4311_cast_fp16 = add(x = var_4309_cast_fp16, y = var_4310_to_fp16)[name = tensor("op_4311_cast_fp16")]; + tensor norm_205_epsilon_0 = const()[name = tensor("norm_205_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_205_cast_fp16 = rsqrt(epsilon = norm_205_epsilon_0, x = var_4311_cast_fp16)[name = tensor("norm_205_cast_fp16")]; + tensor var_4313_cast_fp16 = mul(x = x_559_cast_fp16, y = norm_205_cast_fp16)[name = tensor("op_4313_cast_fp16")]; + tensor layers_25_self_attn_k_norm_weight_to_fp16 = const()[name = tensor("layers_25_self_attn_k_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(398350848)))]; + tensor var_4314_cast_fp16 = mul(x = var_4313_cast_fp16, y = layers_25_self_attn_k_norm_weight_to_fp16)[name = tensor("op_4314_cast_fp16")]; + tensor x1_101_begin_0 = const()[name = tensor("x1_101_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_101_end_0 = const()[name = tensor("x1_101_end_0"), val = tensor([1, 16, 768, 64])]; + tensor x1_101_end_mask_0 = const()[name = tensor("x1_101_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_101_cast_fp16 = slice_by_index(begin = x1_101_begin_0, end = x1_101_end_0, end_mask = x1_101_end_mask_0, x = var_4303_cast_fp16)[name = tensor("x1_101_cast_fp16")]; + tensor x2_101_begin_0 = const()[name = tensor("x2_101_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_101_end_0 = const()[name = tensor("x2_101_end_0"), val = tensor([1, 16, 768, 128])]; + tensor x2_101_end_mask_0 = const()[name = tensor("x2_101_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_101_cast_fp16 = slice_by_index(begin = x2_101_begin_0, end = x2_101_end_0, end_mask = x2_101_end_mask_0, x = var_4303_cast_fp16)[name = tensor("x2_101_cast_fp16")]; + tensor var_4331_cast_fp16 = mul(x = x1_101_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_4331_cast_fp16")]; + tensor var_4332_cast_fp16 = mul(x = x2_101_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_4332_cast_fp16")]; + tensor var_4333_cast_fp16 = sub(x = var_4331_cast_fp16, y = var_4332_cast_fp16)[name = tensor("op_4333_cast_fp16")]; + tensor var_4334_cast_fp16 = mul(x = x2_101_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_4334_cast_fp16")]; + tensor var_4335_cast_fp16 = mul(x = x1_101_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_4335_cast_fp16")]; + tensor var_4336_cast_fp16 = add(x = var_4334_cast_fp16, y = var_4335_cast_fp16)[name = tensor("op_4336_cast_fp16")]; + tensor q_51_interleave_0 = const()[name = tensor("q_51_interleave_0"), val = tensor(false)]; + tensor q_51_cast_fp16 = concat(axis = var_4249, interleave = q_51_interleave_0, values = (var_4333_cast_fp16, var_4336_cast_fp16))[name = tensor("q_51_cast_fp16")]; + tensor x1_103_begin_0 = const()[name = tensor("x1_103_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_103_end_0 = const()[name = tensor("x1_103_end_0"), val = tensor([1, 8, 768, 64])]; + tensor x1_103_end_mask_0 = const()[name = tensor("x1_103_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_103_cast_fp16 = slice_by_index(begin = x1_103_begin_0, end = x1_103_end_0, end_mask = x1_103_end_mask_0, x = var_4314_cast_fp16)[name = tensor("x1_103_cast_fp16")]; + tensor x2_103_begin_0 = const()[name = tensor("x2_103_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_103_end_0 = const()[name = tensor("x2_103_end_0"), val = tensor([1, 8, 768, 128])]; + tensor x2_103_end_mask_0 = const()[name = tensor("x2_103_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_103_cast_fp16 = slice_by_index(begin = x2_103_begin_0, end = x2_103_end_0, end_mask = x2_103_end_mask_0, x = var_4314_cast_fp16)[name = tensor("x2_103_cast_fp16")]; + tensor var_4354_cast_fp16 = mul(x = x1_103_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_4354_cast_fp16")]; + tensor var_4355_cast_fp16 = mul(x = x2_103_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_4355_cast_fp16")]; + tensor var_4356_cast_fp16 = sub(x = var_4354_cast_fp16, y = var_4355_cast_fp16)[name = tensor("op_4356_cast_fp16")]; + tensor var_4357_cast_fp16 = mul(x = x2_103_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_4357_cast_fp16")]; + tensor var_4358_cast_fp16 = mul(x = x1_103_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_4358_cast_fp16")]; + tensor var_4359_cast_fp16 = add(x = var_4357_cast_fp16, y = var_4358_cast_fp16)[name = tensor("op_4359_cast_fp16")]; + tensor k_101_interleave_0 = const()[name = tensor("k_101_interleave_0"), val = tensor(false)]; + tensor k_101_cast_fp16 = concat(axis = var_4249, interleave = k_101_interleave_0, values = (var_4356_cast_fp16, var_4359_cast_fp16))[name = tensor("k_101_cast_fp16")]; + tensor transpose_100_perm_0 = const()[name = tensor("transpose_100_perm_0"), val = tensor([1, 0, 2, 3])]; + tensor tile_50_reps_0 = const()[name = tensor("tile_50_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_100_cast_fp16 = transpose(perm = transpose_100_perm_0, x = k_101_cast_fp16)[name = tensor("transpose_24")]; + tensor tile_50_cast_fp16 = tile(reps = tile_50_reps_0, x = transpose_100_cast_fp16)[name = tensor("tile_50_cast_fp16")]; + tensor concat_100 = const()[name = tensor("concat_100"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_100_cast_fp16 = reshape(shape = concat_100, x = tile_50_cast_fp16)[name = tensor("reshape_100_cast_fp16")]; + tensor transpose_101_perm_0 = const()[name = tensor("transpose_101_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_101 = const()[name = tensor("concat_101"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_101_cast_fp16 = transpose(perm = transpose_101_perm_0, x = reshape_100_cast_fp16)[name = tensor("transpose_23")]; + tensor reshape_101_cast_fp16 = reshape(shape = concat_101, x = transpose_101_cast_fp16)[name = tensor("reshape_101_cast_fp16")]; + tensor transpose_163_perm_0 = const()[name = tensor("transpose_163_perm_0"), val = tensor([1, 0, -1, -2])]; + tensor tile_51_reps_0 = const()[name = tensor("tile_51_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_162_cast_fp16 = transpose(perm = transpose_162_perm_0, x = var_4292_cast_fp16)[name = tensor("transpose_22")]; + tensor tile_51_cast_fp16 = tile(reps = tile_51_reps_0, x = transpose_162_cast_fp16)[name = tensor("tile_51_cast_fp16")]; + tensor concat_102 = const()[name = tensor("concat_102"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_102_cast_fp16 = reshape(shape = concat_102, x = tile_51_cast_fp16)[name = tensor("reshape_102_cast_fp16")]; + tensor transpose_103_perm_0 = const()[name = tensor("transpose_103_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_103 = const()[name = tensor("concat_103"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_103_cast_fp16 = transpose(perm = transpose_103_perm_0, x = reshape_102_cast_fp16)[name = tensor("transpose_21")]; + tensor reshape_103_cast_fp16 = reshape(shape = concat_103, x = transpose_103_cast_fp16)[name = tensor("reshape_103_cast_fp16")]; + tensor v_103_perm_0 = const()[name = tensor("v_103_perm_0"), val = tensor([1, 0, -2, -1])]; + tensor var_4365_transpose_x_0 = const()[name = tensor("op_4365_transpose_x_0"), val = tensor(false)]; + tensor var_4365_transpose_y_0 = const()[name = tensor("op_4365_transpose_y_0"), val = tensor(false)]; + tensor transpose_163_cast_fp16 = transpose(perm = transpose_163_perm_0, x = reshape_101_cast_fp16)[name = tensor("transpose_20")]; + tensor var_4365_cast_fp16 = matmul(transpose_x = var_4365_transpose_x_0, transpose_y = var_4365_transpose_y_0, x = q_51_cast_fp16, y = transpose_163_cast_fp16)[name = tensor("op_4365_cast_fp16")]; + tensor var_4366_to_fp16 = const()[name = tensor("op_4366_to_fp16"), val = tensor(0x1.6ap-4)]; + tensor attn_101_cast_fp16 = mul(x = var_4365_cast_fp16, y = var_4366_to_fp16)[name = tensor("attn_101_cast_fp16")]; + tensor input_251_cast_fp16 = add(x = attn_101_cast_fp16, y = causal_mask_to_fp16_palettized)[name = tensor("input_251_cast_fp16")]; + tensor attn_103_cast_fp16 = softmax(axis = var_4249, x = input_251_cast_fp16)[name = tensor("attn_103_cast_fp16")]; + tensor var_4370_transpose_x_0 = const()[name = tensor("op_4370_transpose_x_0"), val = tensor(false)]; + tensor var_4370_transpose_y_0 = const()[name = tensor("op_4370_transpose_y_0"), val = tensor(false)]; + tensor v_103_cast_fp16 = transpose(perm = v_103_perm_0, x = reshape_103_cast_fp16)[name = tensor("transpose_19")]; + tensor var_4370_cast_fp16 = matmul(transpose_x = var_4370_transpose_x_0, transpose_y = var_4370_transpose_y_0, x = attn_103_cast_fp16, y = v_103_cast_fp16)[name = tensor("op_4370_cast_fp16")]; + tensor var_4371_perm_0 = const()[name = tensor("op_4371_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor var_4372 = const()[name = tensor("op_4372"), val = tensor([1, 768, 2048])]; + tensor var_4371_cast_fp16 = transpose(perm = var_4371_perm_0, x = var_4370_cast_fp16)[name = tensor("transpose_18")]; + tensor input_253_cast_fp16 = reshape(shape = var_4372, x = var_4371_cast_fp16)[name = tensor("input_253_cast_fp16")]; + tensor layers_25_self_attn_o_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(398351168))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(400448384))), name = tensor("layers_25_self_attn_o_proj_weight_to_fp16_palettized"), shape = tensor([1024, 2048])]; + tensor linear_178_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_25_self_attn_o_proj_weight_to_fp16_palettized, x = input_253_cast_fp16)[name = tensor("linear_178_cast_fp16")]; + tensor x_567_cast_fp16 = add(x = x_549_cast_fp16, y = linear_178_cast_fp16)[name = tensor("x_567_cast_fp16")]; + tensor var_4248_promoted_3_to_fp16 = const()[name = tensor("op_4248_promoted_3_to_fp16"), val = tensor(0x1p+1)]; + tensor var_4379_cast_fp16 = pow(x = x_567_cast_fp16, y = var_4248_promoted_3_to_fp16)[name = tensor("op_4379_cast_fp16")]; + tensor var_4381_axes_0 = const()[name = tensor("op_4381_axes_0"), val = tensor([-1])]; + tensor var_4381_keep_dims_0 = const()[name = tensor("op_4381_keep_dims_0"), val = tensor(true)]; + tensor var_4381_cast_fp16 = reduce_mean(axes = var_4381_axes_0, keep_dims = var_4381_keep_dims_0, x = var_4379_cast_fp16)[name = tensor("op_4381_cast_fp16")]; + tensor var_4382_to_fp16 = const()[name = tensor("op_4382_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_4383_cast_fp16 = add(x = var_4381_cast_fp16, y = var_4382_to_fp16)[name = tensor("op_4383_cast_fp16")]; + tensor norm_207_epsilon_0 = const()[name = tensor("norm_207_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_207_cast_fp16 = rsqrt(epsilon = norm_207_epsilon_0, x = var_4383_cast_fp16)[name = tensor("norm_207_cast_fp16")]; + tensor var_4385_cast_fp16 = mul(x = x_567_cast_fp16, y = norm_207_cast_fp16)[name = tensor("op_4385_cast_fp16")]; + tensor layers_25_post_attention_layernorm_weight_to_fp16 = const()[name = tensor("layers_25_post_attention_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(400448960)))]; + tensor var_4386_cast_fp16 = mul(x = var_4385_cast_fp16, y = layers_25_post_attention_layernorm_weight_to_fp16)[name = tensor("op_4386_cast_fp16")]; + tensor layers_25_mlp_gate_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(400451072))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(403596864))), name = tensor("layers_25_mlp_gate_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_179_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_25_mlp_gate_proj_weight_to_fp16_palettized, x = var_4386_cast_fp16)[name = tensor("linear_179_cast_fp16")]; + tensor var_4396_cast_fp16 = silu(x = linear_179_cast_fp16)[name = tensor("op_4396_cast_fp16")]; + tensor layers_25_mlp_up_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(403597440))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(406743232))), name = tensor("layers_25_mlp_up_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_180_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_25_mlp_up_proj_weight_to_fp16_palettized, x = var_4386_cast_fp16)[name = tensor("linear_180_cast_fp16")]; + tensor input_259_cast_fp16 = mul(x = var_4396_cast_fp16, y = linear_180_cast_fp16)[name = tensor("input_259_cast_fp16")]; + tensor layers_25_mlp_down_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(406743808))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(409889600))), name = tensor("layers_25_mlp_down_proj_weight_to_fp16_palettized"), shape = tensor([1024, 3072])]; + tensor linear_181_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_25_mlp_down_proj_weight_to_fp16_palettized, x = input_259_cast_fp16)[name = tensor("linear_181_cast_fp16")]; + tensor x_571_cast_fp16 = add(x = x_567_cast_fp16, y = linear_181_cast_fp16)[name = tensor("x_571_cast_fp16")]; + tensor var_4416 = const()[name = tensor("op_4416"), val = tensor(-1)]; + tensor var_4415_promoted_to_fp16 = const()[name = tensor("op_4415_promoted_to_fp16"), val = tensor(0x1p+1)]; + tensor var_4425_cast_fp16 = pow(x = x_571_cast_fp16, y = var_4415_promoted_to_fp16)[name = tensor("op_4425_cast_fp16")]; + tensor var_4427_axes_0 = const()[name = tensor("op_4427_axes_0"), val = tensor([-1])]; + tensor var_4427_keep_dims_0 = const()[name = tensor("op_4427_keep_dims_0"), val = tensor(true)]; + tensor var_4427_cast_fp16 = reduce_mean(axes = var_4427_axes_0, keep_dims = var_4427_keep_dims_0, x = var_4425_cast_fp16)[name = tensor("op_4427_cast_fp16")]; + tensor var_4428_to_fp16 = const()[name = tensor("op_4428_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_4429_cast_fp16 = add(x = var_4427_cast_fp16, y = var_4428_to_fp16)[name = tensor("op_4429_cast_fp16")]; + tensor norm_209_epsilon_0 = const()[name = tensor("norm_209_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_209_cast_fp16 = rsqrt(epsilon = norm_209_epsilon_0, x = var_4429_cast_fp16)[name = tensor("norm_209_cast_fp16")]; + tensor var_4431_cast_fp16 = mul(x = x_571_cast_fp16, y = norm_209_cast_fp16)[name = tensor("op_4431_cast_fp16")]; + tensor layers_26_input_layernorm_weight_to_fp16 = const()[name = tensor("layers_26_input_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(409890176)))]; + tensor var_4432_cast_fp16 = mul(x = var_4431_cast_fp16, y = layers_26_input_layernorm_weight_to_fp16)[name = tensor("op_4432_cast_fp16")]; + tensor layers_26_self_attn_q_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(409892288))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(411989504))), name = tensor("layers_26_self_attn_q_proj_weight_to_fp16_palettized"), shape = tensor([2048, 1024])]; + tensor linear_182_cast_fp16 = linear(bias = linear_0_bias_0_to_fp16, weight = layers_26_self_attn_q_proj_weight_to_fp16_palettized, x = var_4432_cast_fp16)[name = tensor("linear_182_cast_fp16")]; + tensor var_4448 = const()[name = tensor("op_4448"), val = tensor([1, 768, 16, 128])]; + tensor var_4449_cast_fp16 = reshape(shape = var_4448, x = linear_182_cast_fp16)[name = tensor("op_4449_cast_fp16")]; + tensor x_577_perm_0 = const()[name = tensor("x_577_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_26_self_attn_k_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(411990080))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(413038720))), name = tensor("layers_26_self_attn_k_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_183_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_26_self_attn_k_proj_weight_to_fp16_palettized, x = var_4432_cast_fp16)[name = tensor("linear_183_cast_fp16")]; + tensor var_4453 = const()[name = tensor("op_4453"), val = tensor([1, 768, 8, 128])]; + tensor var_4454_cast_fp16 = reshape(shape = var_4453, x = linear_183_cast_fp16)[name = tensor("op_4454_cast_fp16")]; + tensor x_581_perm_0 = const()[name = tensor("x_581_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_26_self_attn_v_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(413039296))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(414087936))), name = tensor("layers_26_self_attn_v_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_184_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_26_self_attn_v_proj_weight_to_fp16_palettized, x = var_4432_cast_fp16)[name = tensor("linear_184_cast_fp16")]; + tensor var_4458 = const()[name = tensor("op_4458"), val = tensor([1, 768, 8, 128])]; + tensor var_4459_cast_fp16 = reshape(shape = var_4458, x = linear_184_cast_fp16)[name = tensor("op_4459_cast_fp16")]; + tensor transpose_164_perm_0 = const()[name = tensor("transpose_164_perm_0"), val = tensor([2, 0, 1, 3])]; + tensor var_4415_promoted_1_to_fp16 = const()[name = tensor("op_4415_promoted_1_to_fp16"), val = tensor(0x1p+1)]; + tensor x_577_cast_fp16 = transpose(perm = x_577_perm_0, x = var_4449_cast_fp16)[name = tensor("transpose_17")]; + tensor var_4463_cast_fp16 = pow(x = x_577_cast_fp16, y = var_4415_promoted_1_to_fp16)[name = tensor("op_4463_cast_fp16")]; + tensor var_4465_axes_0 = const()[name = tensor("op_4465_axes_0"), val = tensor([-1])]; + tensor var_4465_keep_dims_0 = const()[name = tensor("op_4465_keep_dims_0"), val = tensor(true)]; + tensor var_4465_cast_fp16 = reduce_mean(axes = var_4465_axes_0, keep_dims = var_4465_keep_dims_0, x = var_4463_cast_fp16)[name = tensor("op_4465_cast_fp16")]; + tensor var_4466_to_fp16 = const()[name = tensor("op_4466_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_4467_cast_fp16 = add(x = var_4465_cast_fp16, y = var_4466_to_fp16)[name = tensor("op_4467_cast_fp16")]; + tensor norm_211_epsilon_0 = const()[name = tensor("norm_211_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_211_cast_fp16 = rsqrt(epsilon = norm_211_epsilon_0, x = var_4467_cast_fp16)[name = tensor("norm_211_cast_fp16")]; + tensor var_4469_cast_fp16 = mul(x = x_577_cast_fp16, y = norm_211_cast_fp16)[name = tensor("op_4469_cast_fp16")]; + tensor layers_26_self_attn_q_norm_weight_to_fp16 = const()[name = tensor("layers_26_self_attn_q_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(414088512)))]; + tensor var_4470_cast_fp16 = mul(x = var_4469_cast_fp16, y = layers_26_self_attn_q_norm_weight_to_fp16)[name = tensor("op_4470_cast_fp16")]; + tensor var_4415_promoted_2_to_fp16 = const()[name = tensor("op_4415_promoted_2_to_fp16"), val = tensor(0x1p+1)]; + tensor x_581_cast_fp16 = transpose(perm = x_581_perm_0, x = var_4454_cast_fp16)[name = tensor("transpose_16")]; + tensor var_4474_cast_fp16 = pow(x = x_581_cast_fp16, y = var_4415_promoted_2_to_fp16)[name = tensor("op_4474_cast_fp16")]; + tensor var_4476_axes_0 = const()[name = tensor("op_4476_axes_0"), val = tensor([-1])]; + tensor var_4476_keep_dims_0 = const()[name = tensor("op_4476_keep_dims_0"), val = tensor(true)]; + tensor var_4476_cast_fp16 = reduce_mean(axes = var_4476_axes_0, keep_dims = var_4476_keep_dims_0, x = var_4474_cast_fp16)[name = tensor("op_4476_cast_fp16")]; + tensor var_4477_to_fp16 = const()[name = tensor("op_4477_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_4478_cast_fp16 = add(x = var_4476_cast_fp16, y = var_4477_to_fp16)[name = tensor("op_4478_cast_fp16")]; + tensor norm_213_epsilon_0 = const()[name = tensor("norm_213_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_213_cast_fp16 = rsqrt(epsilon = norm_213_epsilon_0, x = var_4478_cast_fp16)[name = tensor("norm_213_cast_fp16")]; + tensor var_4480_cast_fp16 = mul(x = x_581_cast_fp16, y = norm_213_cast_fp16)[name = tensor("op_4480_cast_fp16")]; + tensor layers_26_self_attn_k_norm_weight_to_fp16 = const()[name = tensor("layers_26_self_attn_k_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(414088832)))]; + tensor var_4481_cast_fp16 = mul(x = var_4480_cast_fp16, y = layers_26_self_attn_k_norm_weight_to_fp16)[name = tensor("op_4481_cast_fp16")]; + tensor x1_105_begin_0 = const()[name = tensor("x1_105_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_105_end_0 = const()[name = tensor("x1_105_end_0"), val = tensor([1, 16, 768, 64])]; + tensor x1_105_end_mask_0 = const()[name = tensor("x1_105_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_105_cast_fp16 = slice_by_index(begin = x1_105_begin_0, end = x1_105_end_0, end_mask = x1_105_end_mask_0, x = var_4470_cast_fp16)[name = tensor("x1_105_cast_fp16")]; + tensor x2_105_begin_0 = const()[name = tensor("x2_105_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_105_end_0 = const()[name = tensor("x2_105_end_0"), val = tensor([1, 16, 768, 128])]; + tensor x2_105_end_mask_0 = const()[name = tensor("x2_105_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_105_cast_fp16 = slice_by_index(begin = x2_105_begin_0, end = x2_105_end_0, end_mask = x2_105_end_mask_0, x = var_4470_cast_fp16)[name = tensor("x2_105_cast_fp16")]; + tensor var_4498_cast_fp16 = mul(x = x1_105_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_4498_cast_fp16")]; + tensor var_4499_cast_fp16 = mul(x = x2_105_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_4499_cast_fp16")]; + tensor var_4500_cast_fp16 = sub(x = var_4498_cast_fp16, y = var_4499_cast_fp16)[name = tensor("op_4500_cast_fp16")]; + tensor var_4501_cast_fp16 = mul(x = x2_105_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_4501_cast_fp16")]; + tensor var_4502_cast_fp16 = mul(x = x1_105_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_4502_cast_fp16")]; + tensor var_4503_cast_fp16 = add(x = var_4501_cast_fp16, y = var_4502_cast_fp16)[name = tensor("op_4503_cast_fp16")]; + tensor q_53_interleave_0 = const()[name = tensor("q_53_interleave_0"), val = tensor(false)]; + tensor q_53_cast_fp16 = concat(axis = var_4416, interleave = q_53_interleave_0, values = (var_4500_cast_fp16, var_4503_cast_fp16))[name = tensor("q_53_cast_fp16")]; + tensor x1_107_begin_0 = const()[name = tensor("x1_107_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_107_end_0 = const()[name = tensor("x1_107_end_0"), val = tensor([1, 8, 768, 64])]; + tensor x1_107_end_mask_0 = const()[name = tensor("x1_107_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_107_cast_fp16 = slice_by_index(begin = x1_107_begin_0, end = x1_107_end_0, end_mask = x1_107_end_mask_0, x = var_4481_cast_fp16)[name = tensor("x1_107_cast_fp16")]; + tensor x2_107_begin_0 = const()[name = tensor("x2_107_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_107_end_0 = const()[name = tensor("x2_107_end_0"), val = tensor([1, 8, 768, 128])]; + tensor x2_107_end_mask_0 = const()[name = tensor("x2_107_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_107_cast_fp16 = slice_by_index(begin = x2_107_begin_0, end = x2_107_end_0, end_mask = x2_107_end_mask_0, x = var_4481_cast_fp16)[name = tensor("x2_107_cast_fp16")]; + tensor var_4521_cast_fp16 = mul(x = x1_107_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_4521_cast_fp16")]; + tensor var_4522_cast_fp16 = mul(x = x2_107_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_4522_cast_fp16")]; + tensor var_4523_cast_fp16 = sub(x = var_4521_cast_fp16, y = var_4522_cast_fp16)[name = tensor("op_4523_cast_fp16")]; + tensor var_4524_cast_fp16 = mul(x = x2_107_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_4524_cast_fp16")]; + tensor var_4525_cast_fp16 = mul(x = x1_107_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_4525_cast_fp16")]; + tensor var_4526_cast_fp16 = add(x = var_4524_cast_fp16, y = var_4525_cast_fp16)[name = tensor("op_4526_cast_fp16")]; + tensor k_105_interleave_0 = const()[name = tensor("k_105_interleave_0"), val = tensor(false)]; + tensor k_105_cast_fp16 = concat(axis = var_4416, interleave = k_105_interleave_0, values = (var_4523_cast_fp16, var_4526_cast_fp16))[name = tensor("k_105_cast_fp16")]; + tensor transpose_104_perm_0 = const()[name = tensor("transpose_104_perm_0"), val = tensor([1, 0, 2, 3])]; + tensor tile_52_reps_0 = const()[name = tensor("tile_52_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_104_cast_fp16 = transpose(perm = transpose_104_perm_0, x = k_105_cast_fp16)[name = tensor("transpose_15")]; + tensor tile_52_cast_fp16 = tile(reps = tile_52_reps_0, x = transpose_104_cast_fp16)[name = tensor("tile_52_cast_fp16")]; + tensor concat_104 = const()[name = tensor("concat_104"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_104_cast_fp16 = reshape(shape = concat_104, x = tile_52_cast_fp16)[name = tensor("reshape_104_cast_fp16")]; + tensor transpose_105_perm_0 = const()[name = tensor("transpose_105_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_105 = const()[name = tensor("concat_105"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_105_cast_fp16 = transpose(perm = transpose_105_perm_0, x = reshape_104_cast_fp16)[name = tensor("transpose_14")]; + tensor reshape_105_cast_fp16 = reshape(shape = concat_105, x = transpose_105_cast_fp16)[name = tensor("reshape_105_cast_fp16")]; + tensor transpose_165_perm_0 = const()[name = tensor("transpose_165_perm_0"), val = tensor([1, 0, -1, -2])]; + tensor tile_53_reps_0 = const()[name = tensor("tile_53_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_164_cast_fp16 = transpose(perm = transpose_164_perm_0, x = var_4459_cast_fp16)[name = tensor("transpose_13")]; + tensor tile_53_cast_fp16 = tile(reps = tile_53_reps_0, x = transpose_164_cast_fp16)[name = tensor("tile_53_cast_fp16")]; + tensor concat_106 = const()[name = tensor("concat_106"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_106_cast_fp16 = reshape(shape = concat_106, x = tile_53_cast_fp16)[name = tensor("reshape_106_cast_fp16")]; + tensor transpose_107_perm_0 = const()[name = tensor("transpose_107_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_107 = const()[name = tensor("concat_107"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_107_cast_fp16 = transpose(perm = transpose_107_perm_0, x = reshape_106_cast_fp16)[name = tensor("transpose_12")]; + tensor reshape_107_cast_fp16 = reshape(shape = concat_107, x = transpose_107_cast_fp16)[name = tensor("reshape_107_cast_fp16")]; + tensor v_107_perm_0 = const()[name = tensor("v_107_perm_0"), val = tensor([1, 0, -2, -1])]; + tensor var_4532_transpose_x_0 = const()[name = tensor("op_4532_transpose_x_0"), val = tensor(false)]; + tensor var_4532_transpose_y_0 = const()[name = tensor("op_4532_transpose_y_0"), val = tensor(false)]; + tensor transpose_165_cast_fp16 = transpose(perm = transpose_165_perm_0, x = reshape_105_cast_fp16)[name = tensor("transpose_11")]; + tensor var_4532_cast_fp16 = matmul(transpose_x = var_4532_transpose_x_0, transpose_y = var_4532_transpose_y_0, x = q_53_cast_fp16, y = transpose_165_cast_fp16)[name = tensor("op_4532_cast_fp16")]; + tensor var_4533_to_fp16 = const()[name = tensor("op_4533_to_fp16"), val = tensor(0x1.6ap-4)]; + tensor attn_105_cast_fp16 = mul(x = var_4532_cast_fp16, y = var_4533_to_fp16)[name = tensor("attn_105_cast_fp16")]; + tensor input_261_cast_fp16 = add(x = attn_105_cast_fp16, y = causal_mask_to_fp16_palettized)[name = tensor("input_261_cast_fp16")]; + tensor attn_107_cast_fp16 = softmax(axis = var_4416, x = input_261_cast_fp16)[name = tensor("attn_107_cast_fp16")]; + tensor var_4537_transpose_x_0 = const()[name = tensor("op_4537_transpose_x_0"), val = tensor(false)]; + tensor var_4537_transpose_y_0 = const()[name = tensor("op_4537_transpose_y_0"), val = tensor(false)]; + tensor v_107_cast_fp16 = transpose(perm = v_107_perm_0, x = reshape_107_cast_fp16)[name = tensor("transpose_10")]; + tensor var_4537_cast_fp16 = matmul(transpose_x = var_4537_transpose_x_0, transpose_y = var_4537_transpose_y_0, x = attn_107_cast_fp16, y = v_107_cast_fp16)[name = tensor("op_4537_cast_fp16")]; + tensor var_4538_perm_0 = const()[name = tensor("op_4538_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor var_4539 = const()[name = tensor("op_4539"), val = tensor([1, 768, 2048])]; + tensor var_4538_cast_fp16 = transpose(perm = var_4538_perm_0, x = var_4537_cast_fp16)[name = tensor("transpose_9")]; + tensor input_263_cast_fp16 = reshape(shape = var_4539, x = var_4538_cast_fp16)[name = tensor("input_263_cast_fp16")]; + tensor layers_26_self_attn_o_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(414089152))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(416186368))), name = tensor("layers_26_self_attn_o_proj_weight_to_fp16_palettized"), shape = tensor([1024, 2048])]; + tensor linear_185_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_26_self_attn_o_proj_weight_to_fp16_palettized, x = input_263_cast_fp16)[name = tensor("linear_185_cast_fp16")]; + tensor x_589_cast_fp16 = add(x = x_571_cast_fp16, y = linear_185_cast_fp16)[name = tensor("x_589_cast_fp16")]; + tensor var_4415_promoted_3_to_fp16 = const()[name = tensor("op_4415_promoted_3_to_fp16"), val = tensor(0x1p+1)]; + tensor var_4546_cast_fp16 = pow(x = x_589_cast_fp16, y = var_4415_promoted_3_to_fp16)[name = tensor("op_4546_cast_fp16")]; + tensor var_4548_axes_0 = const()[name = tensor("op_4548_axes_0"), val = tensor([-1])]; + tensor var_4548_keep_dims_0 = const()[name = tensor("op_4548_keep_dims_0"), val = tensor(true)]; + tensor var_4548_cast_fp16 = reduce_mean(axes = var_4548_axes_0, keep_dims = var_4548_keep_dims_0, x = var_4546_cast_fp16)[name = tensor("op_4548_cast_fp16")]; + tensor var_4549_to_fp16 = const()[name = tensor("op_4549_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_4550_cast_fp16 = add(x = var_4548_cast_fp16, y = var_4549_to_fp16)[name = tensor("op_4550_cast_fp16")]; + tensor norm_215_epsilon_0 = const()[name = tensor("norm_215_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_215_cast_fp16 = rsqrt(epsilon = norm_215_epsilon_0, x = var_4550_cast_fp16)[name = tensor("norm_215_cast_fp16")]; + tensor var_4552_cast_fp16 = mul(x = x_589_cast_fp16, y = norm_215_cast_fp16)[name = tensor("op_4552_cast_fp16")]; + tensor layers_26_post_attention_layernorm_weight_to_fp16 = const()[name = tensor("layers_26_post_attention_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(416186944)))]; + tensor var_4553_cast_fp16 = mul(x = var_4552_cast_fp16, y = layers_26_post_attention_layernorm_weight_to_fp16)[name = tensor("op_4553_cast_fp16")]; + tensor layers_26_mlp_gate_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(416189056))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(419334848))), name = tensor("layers_26_mlp_gate_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_186_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_26_mlp_gate_proj_weight_to_fp16_palettized, x = var_4553_cast_fp16)[name = tensor("linear_186_cast_fp16")]; + tensor var_4563_cast_fp16 = silu(x = linear_186_cast_fp16)[name = tensor("op_4563_cast_fp16")]; + tensor layers_26_mlp_up_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(419335424))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(422481216))), name = tensor("layers_26_mlp_up_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_187_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_26_mlp_up_proj_weight_to_fp16_palettized, x = var_4553_cast_fp16)[name = tensor("linear_187_cast_fp16")]; + tensor input_269_cast_fp16 = mul(x = var_4563_cast_fp16, y = linear_187_cast_fp16)[name = tensor("input_269_cast_fp16")]; + tensor layers_26_mlp_down_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(422481792))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(425627584))), name = tensor("layers_26_mlp_down_proj_weight_to_fp16_palettized"), shape = tensor([1024, 3072])]; + tensor linear_188_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_26_mlp_down_proj_weight_to_fp16_palettized, x = input_269_cast_fp16)[name = tensor("linear_188_cast_fp16")]; + tensor x_593_cast_fp16 = add(x = x_589_cast_fp16, y = linear_188_cast_fp16)[name = tensor("x_593_cast_fp16")]; + tensor var_4583 = const()[name = tensor("op_4583"), val = tensor(-1)]; + tensor var_4582_promoted_to_fp16 = const()[name = tensor("op_4582_promoted_to_fp16"), val = tensor(0x1p+1)]; + tensor var_4592_cast_fp16 = pow(x = x_593_cast_fp16, y = var_4582_promoted_to_fp16)[name = tensor("op_4592_cast_fp16")]; + tensor var_4594_axes_0 = const()[name = tensor("op_4594_axes_0"), val = tensor([-1])]; + tensor var_4594_keep_dims_0 = const()[name = tensor("op_4594_keep_dims_0"), val = tensor(true)]; + tensor var_4594_cast_fp16 = reduce_mean(axes = var_4594_axes_0, keep_dims = var_4594_keep_dims_0, x = var_4592_cast_fp16)[name = tensor("op_4594_cast_fp16")]; + tensor var_4595_to_fp16 = const()[name = tensor("op_4595_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_4596_cast_fp16 = add(x = var_4594_cast_fp16, y = var_4595_to_fp16)[name = tensor("op_4596_cast_fp16")]; + tensor norm_217_epsilon_0 = const()[name = tensor("norm_217_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_217_cast_fp16 = rsqrt(epsilon = norm_217_epsilon_0, x = var_4596_cast_fp16)[name = tensor("norm_217_cast_fp16")]; + tensor var_4598_cast_fp16 = mul(x = x_593_cast_fp16, y = norm_217_cast_fp16)[name = tensor("op_4598_cast_fp16")]; + tensor layers_27_input_layernorm_weight_to_fp16 = const()[name = tensor("layers_27_input_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(425628160)))]; + tensor var_4599_cast_fp16 = mul(x = var_4598_cast_fp16, y = layers_27_input_layernorm_weight_to_fp16)[name = tensor("op_4599_cast_fp16")]; + tensor layers_27_self_attn_q_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(425630272))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(427727488))), name = tensor("layers_27_self_attn_q_proj_weight_to_fp16_palettized"), shape = tensor([2048, 1024])]; + tensor linear_189_cast_fp16 = linear(bias = linear_0_bias_0_to_fp16, weight = layers_27_self_attn_q_proj_weight_to_fp16_palettized, x = var_4599_cast_fp16)[name = tensor("linear_189_cast_fp16")]; + tensor var_4615 = const()[name = tensor("op_4615"), val = tensor([1, 768, 16, 128])]; + tensor var_4616_cast_fp16 = reshape(shape = var_4615, x = linear_189_cast_fp16)[name = tensor("op_4616_cast_fp16")]; + tensor x_599_perm_0 = const()[name = tensor("x_599_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_27_self_attn_k_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(427728064))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(428776704))), name = tensor("layers_27_self_attn_k_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_190_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_27_self_attn_k_proj_weight_to_fp16_palettized, x = var_4599_cast_fp16)[name = tensor("linear_190_cast_fp16")]; + tensor var_4620 = const()[name = tensor("op_4620"), val = tensor([1, 768, 8, 128])]; + tensor var_4621_cast_fp16 = reshape(shape = var_4620, x = linear_190_cast_fp16)[name = tensor("op_4621_cast_fp16")]; + tensor x_603_perm_0 = const()[name = tensor("x_603_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor layers_27_self_attn_v_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(428777280))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(429825920))), name = tensor("layers_27_self_attn_v_proj_weight_to_fp16_palettized"), shape = tensor([1024, 1024])]; + tensor linear_191_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_27_self_attn_v_proj_weight_to_fp16_palettized, x = var_4599_cast_fp16)[name = tensor("linear_191_cast_fp16")]; + tensor var_4625 = const()[name = tensor("op_4625"), val = tensor([1, 768, 8, 128])]; + tensor var_4626_cast_fp16 = reshape(shape = var_4625, x = linear_191_cast_fp16)[name = tensor("op_4626_cast_fp16")]; + tensor transpose_166_perm_0 = const()[name = tensor("transpose_166_perm_0"), val = tensor([2, 0, 1, 3])]; + tensor var_4582_promoted_1_to_fp16 = const()[name = tensor("op_4582_promoted_1_to_fp16"), val = tensor(0x1p+1)]; + tensor x_599_cast_fp16 = transpose(perm = x_599_perm_0, x = var_4616_cast_fp16)[name = tensor("transpose_8")]; + tensor var_4630_cast_fp16 = pow(x = x_599_cast_fp16, y = var_4582_promoted_1_to_fp16)[name = tensor("op_4630_cast_fp16")]; + tensor var_4632_axes_0 = const()[name = tensor("op_4632_axes_0"), val = tensor([-1])]; + tensor var_4632_keep_dims_0 = const()[name = tensor("op_4632_keep_dims_0"), val = tensor(true)]; + tensor var_4632_cast_fp16 = reduce_mean(axes = var_4632_axes_0, keep_dims = var_4632_keep_dims_0, x = var_4630_cast_fp16)[name = tensor("op_4632_cast_fp16")]; + tensor var_4633_to_fp16 = const()[name = tensor("op_4633_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_4634_cast_fp16 = add(x = var_4632_cast_fp16, y = var_4633_to_fp16)[name = tensor("op_4634_cast_fp16")]; + tensor norm_219_epsilon_0 = const()[name = tensor("norm_219_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_219_cast_fp16 = rsqrt(epsilon = norm_219_epsilon_0, x = var_4634_cast_fp16)[name = tensor("norm_219_cast_fp16")]; + tensor var_4636_cast_fp16 = mul(x = x_599_cast_fp16, y = norm_219_cast_fp16)[name = tensor("op_4636_cast_fp16")]; + tensor layers_27_self_attn_q_norm_weight_to_fp16 = const()[name = tensor("layers_27_self_attn_q_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(429826496)))]; + tensor var_4637_cast_fp16 = mul(x = var_4636_cast_fp16, y = layers_27_self_attn_q_norm_weight_to_fp16)[name = tensor("op_4637_cast_fp16")]; + tensor var_4582_promoted_2_to_fp16 = const()[name = tensor("op_4582_promoted_2_to_fp16"), val = tensor(0x1p+1)]; + tensor x_603_cast_fp16 = transpose(perm = x_603_perm_0, x = var_4621_cast_fp16)[name = tensor("transpose_7")]; + tensor var_4641_cast_fp16 = pow(x = x_603_cast_fp16, y = var_4582_promoted_2_to_fp16)[name = tensor("op_4641_cast_fp16")]; + tensor var_4643_axes_0 = const()[name = tensor("op_4643_axes_0"), val = tensor([-1])]; + tensor var_4643_keep_dims_0 = const()[name = tensor("op_4643_keep_dims_0"), val = tensor(true)]; + tensor var_4643_cast_fp16 = reduce_mean(axes = var_4643_axes_0, keep_dims = var_4643_keep_dims_0, x = var_4641_cast_fp16)[name = tensor("op_4643_cast_fp16")]; + tensor var_4644_to_fp16 = const()[name = tensor("op_4644_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_4645_cast_fp16 = add(x = var_4643_cast_fp16, y = var_4644_to_fp16)[name = tensor("op_4645_cast_fp16")]; + tensor norm_221_epsilon_0 = const()[name = tensor("norm_221_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_221_cast_fp16 = rsqrt(epsilon = norm_221_epsilon_0, x = var_4645_cast_fp16)[name = tensor("norm_221_cast_fp16")]; + tensor var_4647_cast_fp16 = mul(x = x_603_cast_fp16, y = norm_221_cast_fp16)[name = tensor("op_4647_cast_fp16")]; + tensor layers_27_self_attn_k_norm_weight_to_fp16 = const()[name = tensor("layers_27_self_attn_k_norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(429826816)))]; + tensor var_4648_cast_fp16 = mul(x = var_4647_cast_fp16, y = layers_27_self_attn_k_norm_weight_to_fp16)[name = tensor("op_4648_cast_fp16")]; + tensor x1_109_begin_0 = const()[name = tensor("x1_109_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_109_end_0 = const()[name = tensor("x1_109_end_0"), val = tensor([1, 16, 768, 64])]; + tensor x1_109_end_mask_0 = const()[name = tensor("x1_109_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_109_cast_fp16 = slice_by_index(begin = x1_109_begin_0, end = x1_109_end_0, end_mask = x1_109_end_mask_0, x = var_4637_cast_fp16)[name = tensor("x1_109_cast_fp16")]; + tensor x2_109_begin_0 = const()[name = tensor("x2_109_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_109_end_0 = const()[name = tensor("x2_109_end_0"), val = tensor([1, 16, 768, 128])]; + tensor x2_109_end_mask_0 = const()[name = tensor("x2_109_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_109_cast_fp16 = slice_by_index(begin = x2_109_begin_0, end = x2_109_end_0, end_mask = x2_109_end_mask_0, x = var_4637_cast_fp16)[name = tensor("x2_109_cast_fp16")]; + tensor var_4665_cast_fp16 = mul(x = x1_109_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_4665_cast_fp16")]; + tensor var_4666_cast_fp16 = mul(x = x2_109_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_4666_cast_fp16")]; + tensor var_4667_cast_fp16 = sub(x = var_4665_cast_fp16, y = var_4666_cast_fp16)[name = tensor("op_4667_cast_fp16")]; + tensor var_4668_cast_fp16 = mul(x = x2_109_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_4668_cast_fp16")]; + tensor var_4669_cast_fp16 = mul(x = x1_109_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_4669_cast_fp16")]; + tensor var_4670_cast_fp16 = add(x = var_4668_cast_fp16, y = var_4669_cast_fp16)[name = tensor("op_4670_cast_fp16")]; + tensor q_interleave_0 = const()[name = tensor("q_interleave_0"), val = tensor(false)]; + tensor q_cast_fp16 = concat(axis = var_4583, interleave = q_interleave_0, values = (var_4667_cast_fp16, var_4670_cast_fp16))[name = tensor("q_cast_fp16")]; + tensor x1_begin_0 = const()[name = tensor("x1_begin_0"), val = tensor([0, 0, 0, 0])]; + tensor x1_end_0 = const()[name = tensor("x1_end_0"), val = tensor([1, 8, 768, 64])]; + tensor x1_end_mask_0 = const()[name = tensor("x1_end_mask_0"), val = tensor([true, true, true, false])]; + tensor x1_cast_fp16 = slice_by_index(begin = x1_begin_0, end = x1_end_0, end_mask = x1_end_mask_0, x = var_4648_cast_fp16)[name = tensor("x1_cast_fp16")]; + tensor x2_begin_0 = const()[name = tensor("x2_begin_0"), val = tensor([0, 0, 0, 64])]; + tensor x2_end_0 = const()[name = tensor("x2_end_0"), val = tensor([1, 8, 768, 128])]; + tensor x2_end_mask_0 = const()[name = tensor("x2_end_mask_0"), val = tensor([true, true, true, true])]; + tensor x2_cast_fp16 = slice_by_index(begin = x2_begin_0, end = x2_end_0, end_mask = x2_end_mask_0, x = var_4648_cast_fp16)[name = tensor("x2_cast_fp16")]; + tensor var_4688_cast_fp16 = mul(x = x1_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_4688_cast_fp16")]; + tensor var_4689_cast_fp16 = mul(x = x2_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_4689_cast_fp16")]; + tensor var_4690_cast_fp16 = sub(x = var_4688_cast_fp16, y = var_4689_cast_fp16)[name = tensor("op_4690_cast_fp16")]; + tensor var_4691_cast_fp16 = mul(x = x2_cast_fp16, y = cos_1_to_fp16_palettized)[name = tensor("op_4691_cast_fp16")]; + tensor var_4692_cast_fp16 = mul(x = x1_cast_fp16, y = sin_1_to_fp16_palettized)[name = tensor("op_4692_cast_fp16")]; + tensor var_4693_cast_fp16 = add(x = var_4691_cast_fp16, y = var_4692_cast_fp16)[name = tensor("op_4693_cast_fp16")]; + tensor k_109_interleave_0 = const()[name = tensor("k_109_interleave_0"), val = tensor(false)]; + tensor k_109_cast_fp16 = concat(axis = var_4583, interleave = k_109_interleave_0, values = (var_4690_cast_fp16, var_4693_cast_fp16))[name = tensor("k_109_cast_fp16")]; + tensor transpose_108_perm_0 = const()[name = tensor("transpose_108_perm_0"), val = tensor([1, 0, 2, 3])]; + tensor tile_54_reps_0 = const()[name = tensor("tile_54_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_108_cast_fp16 = transpose(perm = transpose_108_perm_0, x = k_109_cast_fp16)[name = tensor("transpose_6")]; + tensor tile_54_cast_fp16 = tile(reps = tile_54_reps_0, x = transpose_108_cast_fp16)[name = tensor("tile_54_cast_fp16")]; + tensor concat_108 = const()[name = tensor("concat_108"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_108_cast_fp16 = reshape(shape = concat_108, x = tile_54_cast_fp16)[name = tensor("reshape_108_cast_fp16")]; + tensor transpose_109_perm_0 = const()[name = tensor("transpose_109_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_109 = const()[name = tensor("concat_109"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_109_cast_fp16 = transpose(perm = transpose_109_perm_0, x = reshape_108_cast_fp16)[name = tensor("transpose_5")]; + tensor reshape_109_cast_fp16 = reshape(shape = concat_109, x = transpose_109_cast_fp16)[name = tensor("reshape_109_cast_fp16")]; + tensor transpose_167_perm_0 = const()[name = tensor("transpose_167_perm_0"), val = tensor([1, 0, -1, -2])]; + tensor tile_55_reps_0 = const()[name = tensor("tile_55_reps_0"), val = tensor([2, 1, 1, 1])]; + tensor transpose_166_cast_fp16 = transpose(perm = transpose_166_perm_0, x = var_4626_cast_fp16)[name = tensor("transpose_4")]; + tensor tile_55_cast_fp16 = tile(reps = tile_55_reps_0, x = transpose_166_cast_fp16)[name = tensor("tile_55_cast_fp16")]; + tensor concat_110 = const()[name = tensor("concat_110"), val = tensor([2, 8, 1, 768, 128])]; + tensor reshape_110_cast_fp16 = reshape(shape = concat_110, x = tile_55_cast_fp16)[name = tensor("reshape_110_cast_fp16")]; + tensor transpose_111_perm_0 = const()[name = tensor("transpose_111_perm_0"), val = tensor([1, 0, 2, 3, 4])]; + tensor concat_111 = const()[name = tensor("concat_111"), val = tensor([-1, 1, 768, 128])]; + tensor transpose_111_cast_fp16 = transpose(perm = transpose_111_perm_0, x = reshape_110_cast_fp16)[name = tensor("transpose_3")]; + tensor reshape_111_cast_fp16 = reshape(shape = concat_111, x = transpose_111_cast_fp16)[name = tensor("reshape_111_cast_fp16")]; + tensor v_perm_0 = const()[name = tensor("v_perm_0"), val = tensor([1, 0, -2, -1])]; + tensor var_4699_transpose_x_0 = const()[name = tensor("op_4699_transpose_x_0"), val = tensor(false)]; + tensor var_4699_transpose_y_0 = const()[name = tensor("op_4699_transpose_y_0"), val = tensor(false)]; + tensor transpose_167_cast_fp16 = transpose(perm = transpose_167_perm_0, x = reshape_109_cast_fp16)[name = tensor("transpose_2")]; + tensor var_4699_cast_fp16 = matmul(transpose_x = var_4699_transpose_x_0, transpose_y = var_4699_transpose_y_0, x = q_cast_fp16, y = transpose_167_cast_fp16)[name = tensor("op_4699_cast_fp16")]; + tensor var_4700_to_fp16 = const()[name = tensor("op_4700_to_fp16"), val = tensor(0x1.6ap-4)]; + tensor attn_109_cast_fp16 = mul(x = var_4699_cast_fp16, y = var_4700_to_fp16)[name = tensor("attn_109_cast_fp16")]; + tensor input_271_cast_fp16 = add(x = attn_109_cast_fp16, y = causal_mask_to_fp16_palettized)[name = tensor("input_271_cast_fp16")]; + tensor attn_cast_fp16 = softmax(axis = var_4583, x = input_271_cast_fp16)[name = tensor("attn_cast_fp16")]; + tensor var_4704_transpose_x_0 = const()[name = tensor("op_4704_transpose_x_0"), val = tensor(false)]; + tensor var_4704_transpose_y_0 = const()[name = tensor("op_4704_transpose_y_0"), val = tensor(false)]; + tensor v_cast_fp16 = transpose(perm = v_perm_0, x = reshape_111_cast_fp16)[name = tensor("transpose_1")]; + tensor var_4704_cast_fp16 = matmul(transpose_x = var_4704_transpose_x_0, transpose_y = var_4704_transpose_y_0, x = attn_cast_fp16, y = v_cast_fp16)[name = tensor("op_4704_cast_fp16")]; + tensor var_4705_perm_0 = const()[name = tensor("op_4705_perm_0"), val = tensor([0, 2, 1, 3])]; + tensor var_4706 = const()[name = tensor("op_4706"), val = tensor([1, 768, 2048])]; + tensor var_4705_cast_fp16 = transpose(perm = var_4705_perm_0, x = var_4704_cast_fp16)[name = tensor("transpose_0")]; + tensor input_273_cast_fp16 = reshape(shape = var_4706, x = var_4705_cast_fp16)[name = tensor("input_273_cast_fp16")]; + tensor layers_27_self_attn_o_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(429827136))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(431924352))), name = tensor("layers_27_self_attn_o_proj_weight_to_fp16_palettized"), shape = tensor([1024, 2048])]; + tensor linear_192_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_27_self_attn_o_proj_weight_to_fp16_palettized, x = input_273_cast_fp16)[name = tensor("linear_192_cast_fp16")]; + tensor x_611_cast_fp16 = add(x = x_593_cast_fp16, y = linear_192_cast_fp16)[name = tensor("x_611_cast_fp16")]; + tensor var_4582_promoted_3_to_fp16 = const()[name = tensor("op_4582_promoted_3_to_fp16"), val = tensor(0x1p+1)]; + tensor var_4713_cast_fp16 = pow(x = x_611_cast_fp16, y = var_4582_promoted_3_to_fp16)[name = tensor("op_4713_cast_fp16")]; + tensor var_4715_axes_0 = const()[name = tensor("op_4715_axes_0"), val = tensor([-1])]; + tensor var_4715_keep_dims_0 = const()[name = tensor("op_4715_keep_dims_0"), val = tensor(true)]; + tensor var_4715_cast_fp16 = reduce_mean(axes = var_4715_axes_0, keep_dims = var_4715_keep_dims_0, x = var_4713_cast_fp16)[name = tensor("op_4715_cast_fp16")]; + tensor var_4716_to_fp16 = const()[name = tensor("op_4716_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_4717_cast_fp16 = add(x = var_4715_cast_fp16, y = var_4716_to_fp16)[name = tensor("op_4717_cast_fp16")]; + tensor norm_223_epsilon_0 = const()[name = tensor("norm_223_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_223_cast_fp16 = rsqrt(epsilon = norm_223_epsilon_0, x = var_4717_cast_fp16)[name = tensor("norm_223_cast_fp16")]; + tensor var_4719_cast_fp16 = mul(x = x_611_cast_fp16, y = norm_223_cast_fp16)[name = tensor("op_4719_cast_fp16")]; + tensor layers_27_post_attention_layernorm_weight_to_fp16 = const()[name = tensor("layers_27_post_attention_layernorm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(431924928)))]; + tensor var_4720_cast_fp16 = mul(x = var_4719_cast_fp16, y = layers_27_post_attention_layernorm_weight_to_fp16)[name = tensor("op_4720_cast_fp16")]; + tensor layers_27_mlp_gate_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(431927040))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(435072832))), name = tensor("layers_27_mlp_gate_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_193_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_27_mlp_gate_proj_weight_to_fp16_palettized, x = var_4720_cast_fp16)[name = tensor("linear_193_cast_fp16")]; + tensor var_4730_cast_fp16 = silu(x = linear_193_cast_fp16)[name = tensor("op_4730_cast_fp16")]; + tensor layers_27_mlp_up_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(435073408))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(438219200))), name = tensor("layers_27_mlp_up_proj_weight_to_fp16_palettized"), shape = tensor([3072, 1024])]; + tensor linear_194_cast_fp16 = linear(bias = linear_4_bias_0_to_fp16, weight = layers_27_mlp_up_proj_weight_to_fp16_palettized, x = var_4720_cast_fp16)[name = tensor("linear_194_cast_fp16")]; + tensor input_279_cast_fp16 = mul(x = var_4730_cast_fp16, y = linear_194_cast_fp16)[name = tensor("input_279_cast_fp16")]; + tensor layers_27_mlp_down_proj_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(438219776))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(441365568))), name = tensor("layers_27_mlp_down_proj_weight_to_fp16_palettized"), shape = tensor([1024, 3072])]; + tensor linear_195_cast_fp16 = linear(bias = linear_1_bias_0_to_fp16, weight = layers_27_mlp_down_proj_weight_to_fp16_palettized, x = input_279_cast_fp16)[name = tensor("linear_195_cast_fp16")]; + tensor x_615_cast_fp16 = add(x = x_611_cast_fp16, y = linear_195_cast_fp16)[name = tensor("x_615_cast_fp16")]; + tensor var_4740_promoted_to_fp16 = const()[name = tensor("op_4740_promoted_to_fp16"), val = tensor(0x1p+1)]; + tensor var_4746_cast_fp16 = pow(x = x_615_cast_fp16, y = var_4740_promoted_to_fp16)[name = tensor("op_4746_cast_fp16")]; + tensor var_4748_axes_0 = const()[name = tensor("op_4748_axes_0"), val = tensor([-1])]; + tensor var_4748_keep_dims_0 = const()[name = tensor("op_4748_keep_dims_0"), val = tensor(true)]; + tensor var_4748_cast_fp16 = reduce_mean(axes = var_4748_axes_0, keep_dims = var_4748_keep_dims_0, x = var_4746_cast_fp16)[name = tensor("op_4748_cast_fp16")]; + tensor var_4749_to_fp16 = const()[name = tensor("op_4749_to_fp16"), val = tensor(0x1.1p-20)]; + tensor var_4750_cast_fp16 = add(x = var_4748_cast_fp16, y = var_4749_to_fp16)[name = tensor("op_4750_cast_fp16")]; + tensor norm_225_epsilon_0 = const()[name = tensor("norm_225_epsilon_0"), val = tensor(0x1.197998p-40)]; + tensor norm_225_cast_fp16 = rsqrt(epsilon = norm_225_epsilon_0, x = var_4750_cast_fp16)[name = tensor("norm_225_cast_fp16")]; + tensor var_4752_cast_fp16 = mul(x = x_615_cast_fp16, y = norm_225_cast_fp16)[name = tensor("op_4752_cast_fp16")]; + tensor norm_weight_to_fp16 = const()[name = tensor("norm_weight_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(441366144)))]; + tensor var_4753_cast_fp16 = mul(x = var_4752_cast_fp16, y = norm_weight_to_fp16)[name = tensor("op_4753_cast_fp16")]; + tensor lm_head_weight_to_fp16_palettized = constexpr_lut_to_dense()[indices = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(441368256))), lut = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(446488320))), name = tensor("lm_head_weight_to_fp16_palettized"), shape = tensor([5000, 1024])]; + tensor linear_196_bias_0_to_fp16 = const()[name = tensor("linear_196_bias_0_to_fp16"), val = tensor(BLOBFILE(path = tensor("@model_path/weights/weight.bin"), offset = tensor(446488896)))]; + tensor logits = linear(bias = linear_196_bias_0_to_fp16, weight = lm_head_weight_to_fp16_palettized, x = var_4753_cast_fp16)[name = tensor("linear_196_cast_fp16")]; + } -> (logits); +} \ No newline at end of file