lukealonso commited on
Commit
9482833
·
verified ·
1 Parent(s): 0d4fc13

Upload folder using huggingface_hub

Browse files
Files changed (45) hide show
  1. .gitattributes +1 -0
  2. amax.safetensors +3 -0
  3. amax_checkpoint.json +43 -0
  4. amax_checkpoint.safetensors +3 -0
  5. config.json +462 -0
  6. generation_config.json +79 -0
  7. hf_quant_config.json +119 -0
  8. model-00001-of-00036.safetensors +3 -0
  9. model-00002-of-00036.safetensors +3 -0
  10. model-00003-of-00036.safetensors +3 -0
  11. model-00004-of-00036.safetensors +3 -0
  12. model-00005-of-00036.safetensors +3 -0
  13. model-00006-of-00036.safetensors +3 -0
  14. model-00007-of-00036.safetensors +3 -0
  15. model-00008-of-00036.safetensors +3 -0
  16. model-00009-of-00036.safetensors +3 -0
  17. model-00010-of-00036.safetensors +3 -0
  18. model-00011-of-00036.safetensors +3 -0
  19. model-00012-of-00036.safetensors +3 -0
  20. model-00013-of-00036.safetensors +3 -0
  21. model-00014-of-00036.safetensors +3 -0
  22. model-00015-of-00036.safetensors +3 -0
  23. model-00016-of-00036.safetensors +3 -0
  24. model-00017-of-00036.safetensors +3 -0
  25. model-00018-of-00036.safetensors +3 -0
  26. model-00019-of-00036.safetensors +3 -0
  27. model-00020-of-00036.safetensors +3 -0
  28. model-00021-of-00036.safetensors +3 -0
  29. model-00022-of-00036.safetensors +3 -0
  30. model-00023-of-00036.safetensors +3 -0
  31. model-00024-of-00036.safetensors +3 -0
  32. model-00025-of-00036.safetensors +3 -0
  33. model-00026-of-00036.safetensors +3 -0
  34. model-00027-of-00036.safetensors +3 -0
  35. model-00028-of-00036.safetensors +3 -0
  36. model-00029-of-00036.safetensors +3 -0
  37. model-00030-of-00036.safetensors +3 -0
  38. model-00031-of-00036.safetensors +3 -0
  39. model-00032-of-00036.safetensors +3 -0
  40. model-00033-of-00036.safetensors +3 -0
  41. model-00034-of-00036.safetensors +3 -0
  42. model-00035-of-00036.safetensors +3 -0
  43. model-00036-of-00036.safetensors +3 -0
  44. model-inputscales.safetensors +3 -0
  45. model.safetensors.index.json +3 -0
.gitattributes CHANGED
@@ -33,3 +33,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
 
 
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
+ model.safetensors.index.json filter=lfs diff=lfs merge=lfs -text
amax.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:db629a0e7cc2b77ea8a4ec560d326ae94c2af561f4fdbd39d8f611818da43d2b
3
+ size 9779904
amax_checkpoint.json ADDED
@@ -0,0 +1,43 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "batch_num": 192,
3
+ "calib_config": "/home/luke/projects/quantization/configs/calib_glm5_3_flash.toml",
4
+ "calib_config_sha256": "6538f422242df4de8ab268672f119ae03a6b14efe1086a325ac8ad2ea4013976",
5
+ "calib_method": "max",
6
+ "dataset_batch_counts": [
7
+ 32,
8
+ 25,
9
+ 32,
10
+ 205
11
+ ],
12
+ "datasets": [
13
+ {
14
+ "batch_size": 128,
15
+ "limit": 4096,
16
+ "max_len": 1024,
17
+ "path": "data/text/agentic_coding_calib_v3.jsonl"
18
+ },
19
+ {
20
+ "batch_size": 4,
21
+ "limit": 100,
22
+ "max_len": 2048,
23
+ "multimodal": true,
24
+ "path": "data/multimodal/coco_grounded_image_calib.jsonl"
25
+ },
26
+ {
27
+ "batch_size": 128,
28
+ "limit": 4096,
29
+ "max_len": 1024,
30
+ "path": "data/text/diverse_calib.jsonl"
31
+ },
32
+ {
33
+ "batch_size": 4,
34
+ "limit": 819,
35
+ "max_len": 8192,
36
+ "path": "data/text/deep_calib.jsonl"
37
+ }
38
+ ],
39
+ "model": "glm5_3_flash",
40
+ "model_id": "/data/cache/huggingface/hub/models--zai-org--GLM-5.3-Flash-BF16/snapshots/a6c167b62691b2bac901344b65cb651a70f53e43",
41
+ "plan_sha256": "9b09e568033fd131d5f096be071d3c5a54258f5c42cf8f4985449c835c1e22b1",
42
+ "total_batches": 294
43
+ }
amax_checkpoint.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d3ef0aa55826c7f2a29c65a1d8b32368a26a527cf36f27c1665bd0bec5d34fa1
3
+ size 9780048
config.json ADDED
@@ -0,0 +1,462 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "transformers_version": "5.16.1",
3
+ "architectures": [
4
+ "Glm5NextForConditionalGeneration"
5
+ ],
6
+ "output_hidden_states": false,
7
+ "return_dict": true,
8
+ "dtype": "bfloat16",
9
+ "chunk_size_feed_forward": 0,
10
+ "is_encoder_decoder": false,
11
+ "id2label": {
12
+ "0": "LABEL_0",
13
+ "1": "LABEL_1"
14
+ },
15
+ "label2id": {
16
+ "LABEL_0": 0,
17
+ "LABEL_1": 1
18
+ },
19
+ "problem_type": null,
20
+ "text_config": {
21
+ "output_hidden_states": false,
22
+ "return_dict": true,
23
+ "dtype": "bfloat16",
24
+ "chunk_size_feed_forward": 0,
25
+ "is_encoder_decoder": false,
26
+ "id2label": {
27
+ "0": "LABEL_0",
28
+ "1": "LABEL_1"
29
+ },
30
+ "label2id": {
31
+ "LABEL_0": 0,
32
+ "LABEL_1": 1
33
+ },
34
+ "problem_type": null,
35
+ "vocab_size": 154880,
36
+ "hidden_size": 4096,
37
+ "intermediate_size": 12288,
38
+ "moe_intermediate_size": 2048,
39
+ "num_hidden_layers": 45,
40
+ "num_attention_heads": 64,
41
+ "num_key_value_heads": 64,
42
+ "n_shared_experts": 1,
43
+ "n_routed_experts": 288,
44
+ "routed_scaling_factor": 2.5,
45
+ "kv_lora_rank": 512,
46
+ "q_lora_rank": 1536,
47
+ "qk_rope_head_dim": 0,
48
+ "v_head_dim": 256,
49
+ "qk_nope_head_dim": 256,
50
+ "n_group": 1,
51
+ "topk_group": 1,
52
+ "num_experts_per_tok": 8,
53
+ "norm_topk_prob": true,
54
+ "hidden_act": "silu",
55
+ "max_position_embeddings": 1048576,
56
+ "initializer_range": 0.02,
57
+ "rms_norm_eps": 1e-05,
58
+ "use_cache": true,
59
+ "pad_token_id": 154820,
60
+ "bos_token_id": null,
61
+ "eos_token_id": [
62
+ 154820,
63
+ 154827,
64
+ 154829
65
+ ],
66
+ "tie_word_embeddings": false,
67
+ "mlp_layer_types": [
68
+ "dense",
69
+ "dense",
70
+ "dense",
71
+ "sparse",
72
+ "sparse",
73
+ "sparse",
74
+ "sparse",
75
+ "sparse",
76
+ "sparse",
77
+ "sparse",
78
+ "sparse",
79
+ "sparse",
80
+ "sparse",
81
+ "sparse",
82
+ "sparse",
83
+ "sparse",
84
+ "sparse",
85
+ "sparse",
86
+ "sparse",
87
+ "sparse",
88
+ "sparse",
89
+ "sparse",
90
+ "sparse",
91
+ "sparse",
92
+ "sparse",
93
+ "sparse",
94
+ "sparse",
95
+ "sparse",
96
+ "sparse",
97
+ "sparse",
98
+ "sparse",
99
+ "sparse",
100
+ "sparse",
101
+ "sparse",
102
+ "sparse",
103
+ "sparse",
104
+ "sparse",
105
+ "sparse",
106
+ "sparse",
107
+ "sparse",
108
+ "sparse",
109
+ "sparse",
110
+ "sparse",
111
+ "sparse",
112
+ "sparse"
113
+ ],
114
+ "attention_bias": false,
115
+ "attention_dropout": 0.0,
116
+ "index_topk": 2048,
117
+ "index_head_dim": 128,
118
+ "index_n_heads": 32,
119
+ "head_dim": 0,
120
+ "layer_types": [
121
+ "linear_attention",
122
+ "linear_attention",
123
+ "linear_attention",
124
+ "deepseek_sparse_attention",
125
+ "linear_attention",
126
+ "linear_attention",
127
+ "linear_attention",
128
+ "deepseek_sparse_attention",
129
+ "linear_attention",
130
+ "linear_attention",
131
+ "linear_attention",
132
+ "deepseek_sparse_attention",
133
+ "linear_attention",
134
+ "linear_attention",
135
+ "linear_attention",
136
+ "deepseek_sparse_attention",
137
+ "linear_attention",
138
+ "linear_attention",
139
+ "linear_attention",
140
+ "deepseek_sparse_attention",
141
+ "linear_attention",
142
+ "linear_attention",
143
+ "linear_attention",
144
+ "deepseek_sparse_attention",
145
+ "linear_attention",
146
+ "linear_attention",
147
+ "linear_attention",
148
+ "deepseek_sparse_attention",
149
+ "linear_attention",
150
+ "linear_attention",
151
+ "linear_attention",
152
+ "deepseek_sparse_attention",
153
+ "linear_attention",
154
+ "linear_attention",
155
+ "linear_attention",
156
+ "deepseek_sparse_attention",
157
+ "linear_attention",
158
+ "linear_attention",
159
+ "linear_attention",
160
+ "deepseek_sparse_attention",
161
+ "linear_attention",
162
+ "linear_attention",
163
+ "linear_attention",
164
+ "deepseek_sparse_attention",
165
+ "linear_attention"
166
+ ],
167
+ "indexer_types": [
168
+ "full",
169
+ "full",
170
+ "full",
171
+ "full",
172
+ "full",
173
+ "full",
174
+ "full",
175
+ "full",
176
+ "full",
177
+ "full",
178
+ "full",
179
+ "full",
180
+ "full",
181
+ "full",
182
+ "full",
183
+ "full",
184
+ "full",
185
+ "full",
186
+ "full",
187
+ "full",
188
+ "full",
189
+ "full",
190
+ "full",
191
+ "full",
192
+ "full",
193
+ "full",
194
+ "full",
195
+ "full",
196
+ "full",
197
+ "full",
198
+ "full",
199
+ "full",
200
+ "full",
201
+ "full",
202
+ "full",
203
+ "full",
204
+ "full",
205
+ "full",
206
+ "full",
207
+ "full",
208
+ "full",
209
+ "full",
210
+ "full",
211
+ "full",
212
+ "full"
213
+ ],
214
+ "swiglu_limit": 10.0,
215
+ "linear_head_dim": 128,
216
+ "linear_num_heads": 64,
217
+ "linear_conv_kernel_dim": 4,
218
+ "linear_lower_bound": -5.0,
219
+ "hc_mult": 4,
220
+ "hc_eps": 1e-06,
221
+ "hc_sinkhorn_iters": 20,
222
+ "output_router_logits": false,
223
+ "router_aux_loss_coef": 0.001,
224
+ "index_kpool": 4,
225
+ "index_kpool_always_select_tail": true,
226
+ "qk_head_dim": 256,
227
+ "_name_or_path": "",
228
+ "first_k_dense_replace": 3,
229
+ "index_kpool_compress": true,
230
+ "index_share_for_mtp_iteration": true,
231
+ "indexer_rope_interleave": true,
232
+ "linear_attn_config": {
233
+ "num_heads": 64,
234
+ "gate_lower_bound": -5.0,
235
+ "head_dim": 128,
236
+ "short_conv_kernel_size": 4,
237
+ "kda_layers": [
238
+ 0,
239
+ 1,
240
+ 2,
241
+ 4,
242
+ 5,
243
+ 6,
244
+ 8,
245
+ 9,
246
+ 10,
247
+ 12,
248
+ 13,
249
+ 14,
250
+ 16,
251
+ 17,
252
+ 18,
253
+ 20,
254
+ 21,
255
+ 22,
256
+ 24,
257
+ 25,
258
+ 26,
259
+ 28,
260
+ 29,
261
+ 30,
262
+ 32,
263
+ 33,
264
+ 34,
265
+ 36,
266
+ 37,
267
+ 38,
268
+ 40,
269
+ 41,
270
+ 42,
271
+ 44
272
+ ],
273
+ "full_attn_layers": [
274
+ 3,
275
+ 7,
276
+ 11,
277
+ 15,
278
+ 19,
279
+ 23,
280
+ 27,
281
+ 31,
282
+ 35,
283
+ 39,
284
+ 43
285
+ ]
286
+ },
287
+ "mhc": true,
288
+ "mla_use_nope": true,
289
+ "model_type": "glm5_next_text",
290
+ "moe_router_dtype": "float32",
291
+ "num_nextn_predict_layers": 1,
292
+ "scoring_func": "sigmoid",
293
+ "topk_method": "noaux_tc",
294
+ "output_attentions": false
295
+ },
296
+ "vision_config": {
297
+ "architectures": null,
298
+ "output_hidden_states": false,
299
+ "return_dict": true,
300
+ "dtype": "bfloat16",
301
+ "chunk_size_feed_forward": 0,
302
+ "is_encoder_decoder": false,
303
+ "id2label": {
304
+ "0": "LABEL_0",
305
+ "1": "LABEL_1"
306
+ },
307
+ "label2id": {
308
+ "LABEL_0": 0,
309
+ "LABEL_1": 1
310
+ },
311
+ "problem_type": null,
312
+ "depth": 24,
313
+ "hidden_size": 1024,
314
+ "hidden_act": "silu",
315
+ "attention_bias": true,
316
+ "attention_dropout": 0.0,
317
+ "num_heads": 16,
318
+ "in_channels": 3,
319
+ "image_size": 448,
320
+ "patch_size": 14,
321
+ "rms_norm_eps": 1e-05,
322
+ "spatial_merge_size": 2,
323
+ "temporal_patch_size": 2,
324
+ "out_hidden_size": 4096,
325
+ "intermediate_size": 4096,
326
+ "initializer_range": 0.02,
327
+ "projection_intermediate_size": 10240,
328
+ "swiglu_limit": 10.0,
329
+ "_name_or_path": "",
330
+ "model_type": "glm5_next_vision",
331
+ "output_attentions": false
332
+ },
333
+ "image_token_id": 154854,
334
+ "video_token_id": 154855,
335
+ "image_start_token_id": 154830,
336
+ "image_end_token_id": 154831,
337
+ "video_start_token_id": 154832,
338
+ "video_end_token_id": 154833,
339
+ "tie_word_embeddings": false,
340
+ "_name_or_path": "",
341
+ "model_type": "glm5_next",
342
+ "output_attentions": false,
343
+ "quantization_config": {
344
+ "config_groups": {
345
+ "group_0": {
346
+ "input_activations": {
347
+ "dynamic": false,
348
+ "num_bits": 4,
349
+ "type": "float",
350
+ "group_size": 16
351
+ },
352
+ "weights": {
353
+ "dynamic": false,
354
+ "num_bits": 4,
355
+ "type": "float",
356
+ "group_size": 16
357
+ },
358
+ "targets": [
359
+ "Linear"
360
+ ]
361
+ }
362
+ },
363
+ "ignore": [
364
+ "lm_head",
365
+ "model.language_model.embed_tokens",
366
+ "model.language_model.layers.0*",
367
+ "model.language_model.layers.1.*",
368
+ "model.language_model.layers.10.mlp.shared_experts*",
369
+ "model.language_model.layers.10.self_attn*",
370
+ "model.language_model.layers.11.mlp.shared_experts*",
371
+ "model.language_model.layers.11.self_attn*",
372
+ "model.language_model.layers.12.mlp.shared_experts*",
373
+ "model.language_model.layers.12.self_attn*",
374
+ "model.language_model.layers.13.mlp.shared_experts*",
375
+ "model.language_model.layers.13.self_attn*",
376
+ "model.language_model.layers.14.mlp.shared_experts*",
377
+ "model.language_model.layers.14.self_attn*",
378
+ "model.language_model.layers.15.mlp.shared_experts*",
379
+ "model.language_model.layers.15.self_attn*",
380
+ "model.language_model.layers.16.mlp.shared_experts*",
381
+ "model.language_model.layers.16.self_attn*",
382
+ "model.language_model.layers.17.mlp.shared_experts*",
383
+ "model.language_model.layers.17.self_attn*",
384
+ "model.language_model.layers.18.mlp.shared_experts*",
385
+ "model.language_model.layers.18.self_attn*",
386
+ "model.language_model.layers.19.mlp.shared_experts*",
387
+ "model.language_model.layers.19.self_attn*",
388
+ "model.language_model.layers.2.*",
389
+ "model.language_model.layers.20.mlp.shared_experts*",
390
+ "model.language_model.layers.20.self_attn*",
391
+ "model.language_model.layers.21.mlp.shared_experts*",
392
+ "model.language_model.layers.21.self_attn*",
393
+ "model.language_model.layers.22.mlp.shared_experts*",
394
+ "model.language_model.layers.22.self_attn*",
395
+ "model.language_model.layers.23.mlp.shared_experts*",
396
+ "model.language_model.layers.23.self_attn*",
397
+ "model.language_model.layers.24.mlp.shared_experts*",
398
+ "model.language_model.layers.24.self_attn*",
399
+ "model.language_model.layers.25.mlp.shared_experts*",
400
+ "model.language_model.layers.25.self_attn*",
401
+ "model.language_model.layers.26.mlp.shared_experts*",
402
+ "model.language_model.layers.26.self_attn*",
403
+ "model.language_model.layers.27.mlp.shared_experts*",
404
+ "model.language_model.layers.27.self_attn*",
405
+ "model.language_model.layers.28.mlp.shared_experts*",
406
+ "model.language_model.layers.28.self_attn*",
407
+ "model.language_model.layers.29.mlp.shared_experts*",
408
+ "model.language_model.layers.29.self_attn*",
409
+ "model.language_model.layers.3.mlp.shared_experts*",
410
+ "model.language_model.layers.3.self_attn*",
411
+ "model.language_model.layers.30.mlp.shared_experts*",
412
+ "model.language_model.layers.30.self_attn*",
413
+ "model.language_model.layers.31.mlp.shared_experts*",
414
+ "model.language_model.layers.31.self_attn*",
415
+ "model.language_model.layers.32.mlp.shared_experts*",
416
+ "model.language_model.layers.32.self_attn*",
417
+ "model.language_model.layers.33.mlp.shared_experts*",
418
+ "model.language_model.layers.33.self_attn*",
419
+ "model.language_model.layers.34.mlp.shared_experts*",
420
+ "model.language_model.layers.34.self_attn*",
421
+ "model.language_model.layers.35.mlp.shared_experts*",
422
+ "model.language_model.layers.35.self_attn*",
423
+ "model.language_model.layers.36.mlp.shared_experts*",
424
+ "model.language_model.layers.36.self_attn*",
425
+ "model.language_model.layers.37.mlp.shared_experts*",
426
+ "model.language_model.layers.37.self_attn*",
427
+ "model.language_model.layers.38.mlp.shared_experts*",
428
+ "model.language_model.layers.38.self_attn*",
429
+ "model.language_model.layers.39.mlp.shared_experts*",
430
+ "model.language_model.layers.39.self_attn*",
431
+ "model.language_model.layers.4.mlp.shared_experts*",
432
+ "model.language_model.layers.4.self_attn*",
433
+ "model.language_model.layers.40.mlp.shared_experts*",
434
+ "model.language_model.layers.40.self_attn*",
435
+ "model.language_model.layers.41.mlp.shared_experts*",
436
+ "model.language_model.layers.41.self_attn*",
437
+ "model.language_model.layers.42.mlp.shared_experts*",
438
+ "model.language_model.layers.42.self_attn*",
439
+ "model.language_model.layers.43.mlp.shared_experts*",
440
+ "model.language_model.layers.43.self_attn*",
441
+ "model.language_model.layers.44.mlp.shared_experts*",
442
+ "model.language_model.layers.44.self_attn*",
443
+ "model.language_model.layers.5.mlp.shared_experts*",
444
+ "model.language_model.layers.5.self_attn*",
445
+ "model.language_model.layers.6.mlp.shared_experts*",
446
+ "model.language_model.layers.6.self_attn*",
447
+ "model.language_model.layers.7.mlp.shared_experts*",
448
+ "model.language_model.layers.7.self_attn*",
449
+ "model.language_model.layers.8.mlp.shared_experts*",
450
+ "model.language_model.layers.8.self_attn*",
451
+ "model.language_model.layers.9.mlp.shared_experts*",
452
+ "model.language_model.layers.9.self_attn*",
453
+ "model.visual*"
454
+ ],
455
+ "quant_algo": "NVFP4",
456
+ "producer": {
457
+ "name": "modelopt",
458
+ "version": "0.39.0.dev290+gf9d9a71de.d20260407"
459
+ },
460
+ "quant_method": "modelopt"
461
+ }
462
+ }
generation_config.json ADDED
@@ -0,0 +1,79 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "max_length": null,
3
+ "max_new_tokens": null,
4
+ "min_length": null,
5
+ "min_new_tokens": null,
6
+ "early_stopping": null,
7
+ "max_time": null,
8
+ "stop_strings": null,
9
+ "do_sample": null,
10
+ "num_beams": null,
11
+ "use_mtp": null,
12
+ "use_cache": true,
13
+ "cache_implementation": null,
14
+ "cache_config": null,
15
+ "max_cache_len": null,
16
+ "temperature": null,
17
+ "top_k": null,
18
+ "top_p": null,
19
+ "min_p": null,
20
+ "top_h": null,
21
+ "typical_p": null,
22
+ "epsilon_cutoff": null,
23
+ "eta_cutoff": null,
24
+ "repetition_penalty": null,
25
+ "encoder_repetition_penalty": null,
26
+ "length_penalty": null,
27
+ "no_repeat_ngram_size": null,
28
+ "bad_words_ids": null,
29
+ "renormalize_logits": null,
30
+ "forced_bos_token_id": null,
31
+ "forced_eos_token_id": null,
32
+ "remove_invalid_values": null,
33
+ "exponential_decay_length_penalty": null,
34
+ "suppress_tokens": null,
35
+ "begin_suppress_tokens": null,
36
+ "sequence_bias": null,
37
+ "token_healing": null,
38
+ "guidance_scale": null,
39
+ "watermarking_config": null,
40
+ "num_return_sequences": null,
41
+ "output_attentions": false,
42
+ "output_hidden_states": false,
43
+ "output_scores": null,
44
+ "output_logits": null,
45
+ "return_dict_in_generate": null,
46
+ "pad_token_id": 154820,
47
+ "bos_token_id": null,
48
+ "eos_token_id": [
49
+ 154820,
50
+ 154827,
51
+ 154829
52
+ ],
53
+ "encoder_no_repeat_ngram_size": null,
54
+ "decoder_start_token_id": null,
55
+ "is_assistant": null,
56
+ "num_assistant_tokens": null,
57
+ "num_assistant_tokens_schedule": null,
58
+ "assistant_confidence_threshold": null,
59
+ "prompt_lookup_num_tokens": null,
60
+ "max_matching_ngram_size": null,
61
+ "assistant_early_exit": null,
62
+ "assistant_lookbehind": null,
63
+ "target_lookbehind": null,
64
+ "assistant_ensemble_weight": null,
65
+ "speculation_type": null,
66
+ "compile_config": null,
67
+ "disable_compile": null,
68
+ "continuous_batching_config": null,
69
+ "low_memory": null,
70
+ "penalty_alpha": null,
71
+ "dola_layers": null,
72
+ "diversity_penalty": null,
73
+ "num_beam_groups": null,
74
+ "constraints": null,
75
+ "force_words_ids": null,
76
+ "prefill_chunk_size": null,
77
+ "_from_model_config": true,
78
+ "transformers_version": "5.16.1"
79
+ }
hf_quant_config.json ADDED
@@ -0,0 +1,119 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "config_groups": {
3
+ "group_0": {
4
+ "input_activations": {
5
+ "dynamic": false,
6
+ "num_bits": 4,
7
+ "type": "float",
8
+ "group_size": 16
9
+ },
10
+ "weights": {
11
+ "dynamic": false,
12
+ "num_bits": 4,
13
+ "type": "float",
14
+ "group_size": 16
15
+ },
16
+ "targets": [
17
+ "Linear"
18
+ ]
19
+ }
20
+ },
21
+ "ignore": [
22
+ "lm_head",
23
+ "model.language_model.embed_tokens",
24
+ "model.language_model.layers.0*",
25
+ "model.language_model.layers.1.*",
26
+ "model.language_model.layers.10.mlp.shared_experts*",
27
+ "model.language_model.layers.10.self_attn*",
28
+ "model.language_model.layers.11.mlp.shared_experts*",
29
+ "model.language_model.layers.11.self_attn*",
30
+ "model.language_model.layers.12.mlp.shared_experts*",
31
+ "model.language_model.layers.12.self_attn*",
32
+ "model.language_model.layers.13.mlp.shared_experts*",
33
+ "model.language_model.layers.13.self_attn*",
34
+ "model.language_model.layers.14.mlp.shared_experts*",
35
+ "model.language_model.layers.14.self_attn*",
36
+ "model.language_model.layers.15.mlp.shared_experts*",
37
+ "model.language_model.layers.15.self_attn*",
38
+ "model.language_model.layers.16.mlp.shared_experts*",
39
+ "model.language_model.layers.16.self_attn*",
40
+ "model.language_model.layers.17.mlp.shared_experts*",
41
+ "model.language_model.layers.17.self_attn*",
42
+ "model.language_model.layers.18.mlp.shared_experts*",
43
+ "model.language_model.layers.18.self_attn*",
44
+ "model.language_model.layers.19.mlp.shared_experts*",
45
+ "model.language_model.layers.19.self_attn*",
46
+ "model.language_model.layers.2.*",
47
+ "model.language_model.layers.20.mlp.shared_experts*",
48
+ "model.language_model.layers.20.self_attn*",
49
+ "model.language_model.layers.21.mlp.shared_experts*",
50
+ "model.language_model.layers.21.self_attn*",
51
+ "model.language_model.layers.22.mlp.shared_experts*",
52
+ "model.language_model.layers.22.self_attn*",
53
+ "model.language_model.layers.23.mlp.shared_experts*",
54
+ "model.language_model.layers.23.self_attn*",
55
+ "model.language_model.layers.24.mlp.shared_experts*",
56
+ "model.language_model.layers.24.self_attn*",
57
+ "model.language_model.layers.25.mlp.shared_experts*",
58
+ "model.language_model.layers.25.self_attn*",
59
+ "model.language_model.layers.26.mlp.shared_experts*",
60
+ "model.language_model.layers.26.self_attn*",
61
+ "model.language_model.layers.27.mlp.shared_experts*",
62
+ "model.language_model.layers.27.self_attn*",
63
+ "model.language_model.layers.28.mlp.shared_experts*",
64
+ "model.language_model.layers.28.self_attn*",
65
+ "model.language_model.layers.29.mlp.shared_experts*",
66
+ "model.language_model.layers.29.self_attn*",
67
+ "model.language_model.layers.3.mlp.shared_experts*",
68
+ "model.language_model.layers.3.self_attn*",
69
+ "model.language_model.layers.30.mlp.shared_experts*",
70
+ "model.language_model.layers.30.self_attn*",
71
+ "model.language_model.layers.31.mlp.shared_experts*",
72
+ "model.language_model.layers.31.self_attn*",
73
+ "model.language_model.layers.32.mlp.shared_experts*",
74
+ "model.language_model.layers.32.self_attn*",
75
+ "model.language_model.layers.33.mlp.shared_experts*",
76
+ "model.language_model.layers.33.self_attn*",
77
+ "model.language_model.layers.34.mlp.shared_experts*",
78
+ "model.language_model.layers.34.self_attn*",
79
+ "model.language_model.layers.35.mlp.shared_experts*",
80
+ "model.language_model.layers.35.self_attn*",
81
+ "model.language_model.layers.36.mlp.shared_experts*",
82
+ "model.language_model.layers.36.self_attn*",
83
+ "model.language_model.layers.37.mlp.shared_experts*",
84
+ "model.language_model.layers.37.self_attn*",
85
+ "model.language_model.layers.38.mlp.shared_experts*",
86
+ "model.language_model.layers.38.self_attn*",
87
+ "model.language_model.layers.39.mlp.shared_experts*",
88
+ "model.language_model.layers.39.self_attn*",
89
+ "model.language_model.layers.4.mlp.shared_experts*",
90
+ "model.language_model.layers.4.self_attn*",
91
+ "model.language_model.layers.40.mlp.shared_experts*",
92
+ "model.language_model.layers.40.self_attn*",
93
+ "model.language_model.layers.41.mlp.shared_experts*",
94
+ "model.language_model.layers.41.self_attn*",
95
+ "model.language_model.layers.42.mlp.shared_experts*",
96
+ "model.language_model.layers.42.self_attn*",
97
+ "model.language_model.layers.43.mlp.shared_experts*",
98
+ "model.language_model.layers.43.self_attn*",
99
+ "model.language_model.layers.44.mlp.shared_experts*",
100
+ "model.language_model.layers.44.self_attn*",
101
+ "model.language_model.layers.5.mlp.shared_experts*",
102
+ "model.language_model.layers.5.self_attn*",
103
+ "model.language_model.layers.6.mlp.shared_experts*",
104
+ "model.language_model.layers.6.self_attn*",
105
+ "model.language_model.layers.7.mlp.shared_experts*",
106
+ "model.language_model.layers.7.self_attn*",
107
+ "model.language_model.layers.8.mlp.shared_experts*",
108
+ "model.language_model.layers.8.self_attn*",
109
+ "model.language_model.layers.9.mlp.shared_experts*",
110
+ "model.language_model.layers.9.self_attn*",
111
+ "model.visual*"
112
+ ],
113
+ "quant_algo": "NVFP4",
114
+ "producer": {
115
+ "name": "modelopt",
116
+ "version": "0.39.0.dev290+gf9d9a71de.d20260407"
117
+ },
118
+ "quant_method": "modelopt"
119
+ }
model-00001-of-00036.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:cb89b6cc9bcd8b7d8d6ca107920e11650ddefa86959d7d0973e74ba42a06a04c
3
+ size 5369425376
model-00002-of-00036.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7a9d2762e6bbdabd5ef6964607ffa5b1fe2874fedcfa2aaebcfaddfa0ad13b21
3
+ size 5369646076
model-00003-of-00036.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:bba020a9d32b1df705057666d3eeee8c15dd9b94a74752b48bf7e4f7880dabd1
3
+ size 5387744892
model-00004-of-00036.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:556758df88cba94158e6567c6ab13b3e1f3231577b2867e2de9e5ca101200dd2
3
+ size 5372521784
model-00005-of-00036.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b70aef03b3306cfa5562de3e2fe89f5bec2fc27897b9e5243a29f3f9f07d6d37
3
+ size 5369646236
model-00006-of-00036.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:fdd348591e6d2337cb0b2178eb6d20b6a81e52a0e368a7937d47759bdc30659d
3
+ size 5369645716
model-00007-of-00036.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a72804937231ff44647528c298067954820f85625bf8b326ce90cf66db7d1d53
3
+ size 5369649020
model-00008-of-00036.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a348c9215e8faaa5c607f61e0eb6afcd8c747da79b6ce371947b72f062f3ed0c
3
+ size 5371747208
model-00009-of-00036.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ef9847216adb141bf35ca8bc1c7b6ca99389ed6284032e6d315a91a03bf31969
3
+ size 5369650084
model-00010-of-00036.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0a7d29b0c9261d4885fe9f6c3f1af8276eaaca25b75dbf908023ea3ae502fc8c
3
+ size 5369648852
model-00011-of-00036.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:fff0fe484137c635fe5b204540aaabecdd789535f1d22e5c4e8aca94f6f771c9
3
+ size 5372327764
model-00012-of-00036.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3fd0908e4b6015846fe930de0ccbd94c80accb8ec753366f1d7178524454b079
3
+ size 5434938196
model-00013-of-00036.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f8ba3f756a00da8c9800c4d236a6f9381e6b6e714ac856f01aecd6967911d90b
3
+ size 5369846440
model-00014-of-00036.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:95359560f1f359af59e30f0a0bd211e8ca50feec8fbaae834594e09088356bdd
3
+ size 5372328004
model-00015-of-00036.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c1bfe5cb9ea74ccab09b75b084762e242b7ca1abfd549204c9f9cd08c4e396f2
3
+ size 5369648948
model-00016-of-00036.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d219338daf51dbb6406b2f4391f1358c80fc8cc2bffa213af6a3becefe538852
3
+ size 5369649876
model-00017-of-00036.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4c22c01bb68e5615d6d1fd05e4d2186d58e453dd99fced6fc57f2f1674698826
3
+ size 5371747208
model-00018-of-00036.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:799719c26499239501674757d497b10e86009193977fd9d22c0b0d74246c3a70
3
+ size 5369650084
model-00019-of-00036.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c2d7e4c6172c7956d7b9f22452729cd63b405f684013387a5af84c8be123c0bd
3
+ size 5369648852
model-00020-of-00036.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f07738bc95b7b8ebad9fd9624dc0bf1c8b86c42158e00a5da8ae1f04cd47664a
3
+ size 5369649236
model-00021-of-00036.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:50b73deb7bf0f35015f9a243c7624832575b8748f1e925404c93281ddb9bfc70
3
+ size 5369720584
model-00022-of-00036.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3a4ef6a871f7a3747d49ef8c31d605faeaa9930fde4c175d7fae2afd619dfb65
3
+ size 5371676572
model-00023-of-00036.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:07faefb4319f7ad58be5fffd0c2bc4b52496880448d38613fb7fa5d3cf1e839e
3
+ size 5369649644
model-00024-of-00036.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3dde597e54f98a0eb647ea31fac9dfb0bea938a41d2c20aa0fd96e66845a927c
3
+ size 5372327388
model-00025-of-00036.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0229ee4891b7b8231518b1c91266076ede2e5cb355730d747602ff4b155a7807
3
+ size 5369649796
model-00026-of-00036.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3636106f4ea76a9777440be8e5cd6e4bc5931ab2a9bcf2e6dee18b121fbb8d7d
3
+ size 5369593232
model-00027-of-00036.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e71cad39994ac5a6661a82be03106a2b0aaf9f72d934198079b7f7f488d36122
3
+ size 5371804132
model-00028-of-00036.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7293510fd489345887fea60e6a8780998c5eec0ffd935ae954d45b6aaf0e2e77
3
+ size 5369648940
model-00029-of-00036.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7e0bc5dea68948fcc77c0d3d0fb85895d53796272d3528e7837fa7cad43072e0
3
+ size 5369649196
model-00030-of-00036.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:229407c5a1f2d436633706b2f6f3e7fb88b3cec7fd47d960d50a5e32057116ea
3
+ size 5369650148
model-00031-of-00036.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:92846bfdb9f1a25d6607fb62612da720ee367ccfcd75f3230c6c5a43452cc607
3
+ size 5371747064
model-00032-of-00036.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:40385d9d1677b8614c8bc1e9231c1509cfc1c71f0b574baefa97fac84e81ee9c
3
+ size 5369649772
model-00033-of-00036.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:18fb5bedb4a7fd43558ab8adab74897535ef14da03c2ae0f5861d1ff7f54d0dc
3
+ size 5369648844
model-00034-of-00036.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:545f73c0017de7e925d138cf20d528326dac037ba3707497836ec16e0a691854
3
+ size 5372328220
model-00035-of-00036.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:111662c52d4e204d2f8f6b9f514645c323f8fabc5c353d0574dc907f880ac89c
3
+ size 6268525452
model-00036-of-00036.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ffe9949a3aaec047aa05fff4af6d7c4b03b2b289ff0e58f1c655bcf1eb770811
3
+ size 1268785360
model-inputscales.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4255779f031450572af8548c610fd9abfe7df89704985d18595c21788593cd05
3
+ size 4726664
model.safetensors.index.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b2af49fef2e6f11aaacc3900fd7a8b76599e5c17622ce532ad624bbc5e980ee4
3
+ size 16080585