LG-AI-EXAONE's picture
Update config.json
9d153d5
Raw
History Blame Contribute Delete
6.09 kB
{
"architectures": [
"ExaoneMoeForCausalLM"
],
"attention_dropout": 0.0,
"bos_token_id": 1,
"dspark_block_size": 7,
"dspark_confidence_head_with_markov": true,
"dspark_enable_confidence_head": true,
"dspark_markov_head_type": "vanilla",
"dspark_markov_rank": 256,
"dspark_noise_token_id": 84,
"dspark_num_hidden_layers": 5,
"dspark_num_target_layers": 78,
"dspark_target_layer_ids": [
2,
20,
38,
56,
74
],
"dtype": "bfloat16",
"eos_token_id": 53,
"head_dim": 128,
"hidden_act": "silu",
"hidden_size": 6144,
"initializer_range": 0.02,
"intermediate_size": 18432,
"layer_types": [
"full_attention",
"sliding_attention",
"sliding_attention",
"sliding_attention",
"sliding_attention",
"full_attention",
"sliding_attention",
"sliding_attention",
"sliding_attention",
"full_attention",
"sliding_attention",
"sliding_attention",
"sliding_attention",
"full_attention",
"sliding_attention",
"sliding_attention",
"sliding_attention",
"full_attention",
"sliding_attention",
"sliding_attention",
"sliding_attention",
"full_attention",
"sliding_attention",
"sliding_attention",
"sliding_attention",
"full_attention",
"sliding_attention",
"sliding_attention",
"sliding_attention",
"full_attention",
"sliding_attention",
"sliding_attention",
"sliding_attention",
"full_attention",
"sliding_attention",
"sliding_attention",
"sliding_attention",
"full_attention",
"sliding_attention",
"sliding_attention",
"sliding_attention",
"full_attention",
"sliding_attention",
"sliding_attention",
"sliding_attention",
"full_attention",
"sliding_attention",
"sliding_attention",
"sliding_attention",
"full_attention",
"sliding_attention",
"sliding_attention",
"sliding_attention",
"full_attention",
"sliding_attention",
"sliding_attention",
"sliding_attention",
"full_attention",
"sliding_attention",
"sliding_attention",
"sliding_attention",
"full_attention",
"sliding_attention",
"sliding_attention",
"sliding_attention",
"full_attention",
"sliding_attention",
"sliding_attention",
"sliding_attention",
"full_attention",
"sliding_attention",
"sliding_attention",
"sliding_attention",
"full_attention",
"sliding_attention",
"sliding_attention",
"sliding_attention",
"full_attention"
],
"mask_token_id": 84,
"max_position_embeddings": 262144,
"mlp_layer_types": [
"dense",
"dense",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse",
"sparse"
],
"model_type": "exaone_moe",
"moe_intermediate_size": 2048,
"mtp_layer_types": [
"full_attention",
"full_attention",
"full_attention",
"full_attention",
"full_attention"
],
"mtp_loss_scaling_factor": 0.05,
"mtp_num_speculative_steps": 4,
"mtp_sliding_windows": [
0,
0,
0,
0,
0
],
"n_group": 1,
"norm_topk_prob": true,
"num_attention_heads": 64,
"num_experts": 256,
"num_experts_per_tok": 8,
"num_hidden_layers": 78,
"num_key_value_heads": 8,
"num_nextn_predict_layers": 5,
"num_shared_experts": 1,
"pad_token_id": 0,
"rms_norm_eps": 1e-05,
"rope_parameters": {
"rope_theta": 1000000,
"rope_type": "default"
},
"routed_scaling_factor": 2.5,
"scoring_func": "sigmoid",
"sliding_windows": [
0,
4096,
128,
128,
128,
0,
128,
128,
128,
0,
128,
128,
128,
0,
128,
128,
128,
0,
128,
128,
128,
0,
128,
128,
128,
0,
128,
128,
128,
0,
128,
128,
128,
0,
128,
128,
128,
0,
128,
128,
128,
0,
128,
128,
128,
0,
128,
128,
128,
0,
128,
128,
128,
0,
128,
128,
128,
0,
128,
128,
128,
0,
128,
128,
128,
0,
128,
128,
128,
0,
128,
128,
128,
0,
128,
128,
128,
0
],
"swiglu_limits": [
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
0.0,
7.0,
7.0,
7.0,
7.0,
7.0,
7.0,
7.0,
7.0,
7.0,
7.0,
7.0,
7.0,
7.0,
7.0,
7.0,
7.0
],
"tie_word_embeddings": false,
"tokenizer_class": "GPT2Tokenizer",
"topk_group": 1,
"topk_method": "noaux_tc",
"transformers_version": "5.9.0",
"use_cache": true,
"vocab_size": 153600
}