sfanm commited on
Commit
8f56d19
·
verified ·
1 Parent(s): 4e2da14

Add files using upload-large-folder tool

Browse files
Files changed (50) hide show
  1. .gitattributes +38 -0
  2. V6_UPLOAD_MANIFEST.json +22 -0
  3. config.json +33 -0
  4. export_manifest.json +11 -0
  5. generation_config.json +9 -0
  6. megatron/iter_0023842/__133_0.distcp +3 -0
  7. megatron/iter_0023842/__154_0.distcp +3 -0
  8. megatron/iter_0023842/__17_0.distcp +3 -0
  9. megatron/iter_0023842/__180_0.distcp +3 -0
  10. megatron/iter_0023842/__196_0.distcp +3 -0
  11. megatron/iter_0023842/__209_0.distcp +3 -0
  12. megatron/iter_0023842/__221_0.distcp +3 -0
  13. megatron/iter_0023842/__225_0.distcp +3 -0
  14. megatron/iter_0023842/__229_0.distcp +3 -0
  15. megatron/iter_0023842/__251_0.distcp +3 -0
  16. megatron/iter_0023842/__257_0.distcp +3 -0
  17. megatron/iter_0023842/__263_0.distcp +3 -0
  18. megatron/iter_0023842/__269_0.distcp +3 -0
  19. megatron/iter_0023842/__26_0.distcp +3 -0
  20. megatron/iter_0023842/__277_0.distcp +3 -0
  21. megatron/iter_0023842/__289_0.distcp +3 -0
  22. megatron/iter_0023842/__296_0.distcp +3 -0
  23. megatron/iter_0023842/__2_0.distcp +3 -0
  24. megatron/iter_0023842/__311_0.distcp +3 -0
  25. megatron/iter_0023842/__337_0.distcp +3 -0
  26. megatron/iter_0023842/__362_0.distcp +3 -0
  27. megatron/iter_0023842/__368_0.distcp +3 -0
  28. megatron/iter_0023842/__372_0.distcp +3 -0
  29. megatron/iter_0023842/__373_0.distcp +3 -0
  30. megatron/iter_0023842/__385_0.distcp +3 -0
  31. megatron/iter_0023842/__3_0.distcp +3 -0
  32. megatron/iter_0023842/__404_0.distcp +3 -0
  33. megatron/iter_0023842/__40_0.distcp +3 -0
  34. megatron/iter_0023842/__468_0.distcp +3 -0
  35. megatron/iter_0023842/__472_0.distcp +3 -0
  36. megatron/iter_0023842/__496_0.distcp +3 -0
  37. megatron/iter_0023842/__508_0.distcp +3 -0
  38. megatron/iter_0023842/__50_0.distcp +3 -0
  39. megatron/iter_0023842/__51_0.distcp +3 -0
  40. megatron/iter_0023842/__55_0.distcp +3 -0
  41. megatron/iter_0023842/__64_0.distcp +3 -0
  42. megatron/iter_0023842/__70_0.distcp +3 -0
  43. megatron/iter_0023842/__73_0.distcp +3 -0
  44. megatron/iter_0023842/metadata.json +1 -0
  45. megatron/iter_0023842/run_config.yaml +890 -0
  46. megatron/iter_0023842/train_state.pt +3 -0
  47. megatron/latest_checkpointed_iteration.txt +1 -0
  48. megatron/latest_train_state.pt +3 -0
  49. tokenizer.json +0 -0
  50. tokenizer_config.json +14 -0
.gitattributes CHANGED
@@ -33,3 +33,41 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
+ megatron/iter_0023842/__368_0.distcp filter=lfs diff=lfs merge=lfs -text
37
+ megatron/iter_0023842/__269_0.distcp filter=lfs diff=lfs merge=lfs -text
38
+ megatron/iter_0023842/__251_0.distcp filter=lfs diff=lfs merge=lfs -text
39
+ megatron/iter_0023842/__263_0.distcp filter=lfs diff=lfs merge=lfs -text
40
+ megatron/iter_0023842/__26_0.distcp filter=lfs diff=lfs merge=lfs -text
41
+ megatron/iter_0023842/__221_0.distcp filter=lfs diff=lfs merge=lfs -text
42
+ megatron/iter_0023842/__2_0.distcp filter=lfs diff=lfs merge=lfs -text
43
+ megatron/iter_0023842/__154_0.distcp filter=lfs diff=lfs merge=lfs -text
44
+ megatron/iter_0023842/__17_0.distcp filter=lfs diff=lfs merge=lfs -text
45
+ megatron/iter_0023842/__337_0.distcp filter=lfs diff=lfs merge=lfs -text
46
+ megatron/iter_0023842/__133_0.distcp filter=lfs diff=lfs merge=lfs -text
47
+ megatron/iter_0023842/__508_0.distcp filter=lfs diff=lfs merge=lfs -text
48
+ megatron/iter_0023842/__40_0.distcp filter=lfs diff=lfs merge=lfs -text
49
+ megatron/iter_0023842/__372_0.distcp filter=lfs diff=lfs merge=lfs -text
50
+ megatron/iter_0023842/__289_0.distcp filter=lfs diff=lfs merge=lfs -text
51
+ megatron/iter_0023842/__496_0.distcp filter=lfs diff=lfs merge=lfs -text
52
+ megatron/iter_0023842/__385_0.distcp filter=lfs diff=lfs merge=lfs -text
53
+ megatron/iter_0023842/__180_0.distcp filter=lfs diff=lfs merge=lfs -text
54
+ megatron/iter_0023842/__196_0.distcp filter=lfs diff=lfs merge=lfs -text
55
+ megatron/iter_0023842/__362_0.distcp filter=lfs diff=lfs merge=lfs -text
56
+ megatron/iter_0023842/__64_0.distcp filter=lfs diff=lfs merge=lfs -text
57
+ megatron/iter_0023842/__296_0.distcp filter=lfs diff=lfs merge=lfs -text
58
+ megatron/iter_0023842/__73_0.distcp filter=lfs diff=lfs merge=lfs -text
59
+ megatron/iter_0023842/__277_0.distcp filter=lfs diff=lfs merge=lfs -text
60
+ megatron/iter_0023842/__3_0.distcp filter=lfs diff=lfs merge=lfs -text
61
+ megatron/iter_0023842/__225_0.distcp filter=lfs diff=lfs merge=lfs -text
62
+ megatron/iter_0023842/__55_0.distcp filter=lfs diff=lfs merge=lfs -text
63
+ megatron/iter_0023842/__229_0.distcp filter=lfs diff=lfs merge=lfs -text
64
+ megatron/iter_0023842/__404_0.distcp filter=lfs diff=lfs merge=lfs -text
65
+ megatron/iter_0023842/__209_0.distcp filter=lfs diff=lfs merge=lfs -text
66
+ megatron/iter_0023842/__373_0.distcp filter=lfs diff=lfs merge=lfs -text
67
+ megatron/iter_0023842/__51_0.distcp filter=lfs diff=lfs merge=lfs -text
68
+ megatron/iter_0023842/__472_0.distcp filter=lfs diff=lfs merge=lfs -text
69
+ megatron/iter_0023842/__70_0.distcp filter=lfs diff=lfs merge=lfs -text
70
+ megatron/iter_0023842/__311_0.distcp filter=lfs diff=lfs merge=lfs -text
71
+ megatron/iter_0023842/__257_0.distcp filter=lfs diff=lfs merge=lfs -text
72
+ megatron/iter_0023842/__50_0.distcp filter=lfs diff=lfs merge=lfs -text
73
+ megatron/iter_0023842/__468_0.distcp filter=lfs diff=lfs merge=lfs -text
V6_UPLOAD_MANIFEST.json ADDED
@@ -0,0 +1,22 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "chat_model": false,
3
+ "hf_export": {
4
+ "apparent_bytes": 1517223216,
5
+ "file_count": 6,
6
+ "parameter_count": 756819456,
7
+ "tensor_count": 218,
8
+ "weight_dtype": "bfloat16"
9
+ },
10
+ "megatron_checkpoint": {
11
+ "apparent_bytes": 10600000875,
12
+ "file_count": 517
13
+ },
14
+ "model": "d24-v6",
15
+ "repo_id": "sfanm/d24-v6-midtrain",
16
+ "schema_version": 1,
17
+ "source_checkpoint": "/eagle/CausalAlign/yudas/unified-training/checkpoints/midtrain-d24-100b-olmo3-only-wsd/iter_0023842",
18
+ "source_hf_export": "/eagle/CausalAlign/yudas/unified-training/models/d24-v6/midtrain-hf",
19
+ "stage": "midtrain",
20
+ "terminal_iteration": 23842,
21
+ "train_tokens": 100000595968
22
+ }
config.json ADDED
@@ -0,0 +1,33 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "LlamaForCausalLM"
4
+ ],
5
+ "attention_bias": false,
6
+ "attention_dropout": 0.0,
7
+ "bos_token_id": 50256,
8
+ "dtype": "bfloat16",
9
+ "eos_token_id": 50256,
10
+ "head_dim": 128,
11
+ "hidden_act": "silu",
12
+ "hidden_size": 1536,
13
+ "initializer_range": 0.02,
14
+ "intermediate_size": 4096,
15
+ "max_position_embeddings": 2048,
16
+ "mlp_bias": false,
17
+ "model_type": "llama",
18
+ "num_attention_heads": 12,
19
+ "num_hidden_layers": 24,
20
+ "num_key_value_heads": 12,
21
+ "pad_token_id": null,
22
+ "pretraining_tp": 1,
23
+ "rms_norm_eps": 1e-05,
24
+ "rope_parameters": {
25
+ "rope_theta": 10000.0,
26
+ "rope_type": "default"
27
+ },
28
+ "tie_word_embeddings": true,
29
+ "transformers_version": "5.3.0",
30
+ "use_cache": true,
31
+ "vocab_size": 50304,
32
+ "torch_dtype": "bfloat16"
33
+ }
export_manifest.json ADDED
@@ -0,0 +1,11 @@
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "source_checkpoint": "/eagle/CausalAlign/yudas/unified-training/checkpoints/midtrain-d24-100b-olmo3-only-wsd/iter_0023842",
3
+ "architectures": [
4
+ "LlamaForCausalLM"
5
+ ],
6
+ "parameter_count": 756819456,
7
+ "tensor_count": 218,
8
+ "weight_dtype": "bfloat16",
9
+ "model_max_length": 2048,
10
+ "simple_chatml": false
11
+ }
generation_config.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "_from_model_config": true,
3
+ "bos_token_id": 50256,
4
+ "eos_token_id": 50256,
5
+ "output_attentions": false,
6
+ "output_hidden_states": false,
7
+ "transformers_version": "5.3.0",
8
+ "use_cache": true
9
+ }
megatron/iter_0023842/__133_0.distcp ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8bd9e8d1b75e2bbad781c9c6b91a4b54281c950f9b69cfd4d654835d88c3ea24
3
+ size 17747300
megatron/iter_0023842/__154_0.distcp ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6c0dad150935aa2beb000a756cb285a9fa08a2aa32b2eb799281ab3eaab3d122
3
+ size 17747300
megatron/iter_0023842/__17_0.distcp ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:be4f7221f622c0d68f600b740a7252afbd440159bfe9318ac99dfb2ca1cfd87b
3
+ size 31909274
megatron/iter_0023842/__180_0.distcp ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:33579d5fdf02b88d5adaad96928fe7b78a6c2eef90d6ef4655b9bf88b00c6a4d
3
+ size 17742651
megatron/iter_0023842/__196_0.distcp ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e5187dc05749755a498b10fd2b8a47e51ddbdb17c7b118ea959c544b502ffbee
3
+ size 17742651
megatron/iter_0023842/__209_0.distcp ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5af3889d27bf4d48ff905498848e1276b8bc9fd6fd0083e3580996c118b65728
3
+ size 17751921
megatron/iter_0023842/__221_0.distcp ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b236b1bc62ff892df82984812725f70f9c6ab1aa98c67faeebfe4baaa96963d6
3
+ size 17742651
megatron/iter_0023842/__225_0.distcp ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:54ddd6deb12e25b18714026e050fbbb85740dd43924d2067f948fed98c93201a
3
+ size 17742651
megatron/iter_0023842/__229_0.distcp ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:127522a536059c64946804f6e4e3714e44b3e599a8d39ab5409ecef79fde4d72
3
+ size 17747382
megatron/iter_0023842/__251_0.distcp ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:77519b1e132775171d5942be2272c30a4e08e868372907250adc0388e1af0595
3
+ size 17742651
megatron/iter_0023842/__257_0.distcp ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:190f8da6b0d0afc27c8cc901f3890e1014a6a5f05d44ca28d11e54ea49a47bcc
3
+ size 17742651
megatron/iter_0023842/__263_0.distcp ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0fcf3d28e52dbcedc233dc4abd8dcf6d9505a19920f471a105ca5bd798fa4ce5
3
+ size 17742651
megatron/iter_0023842/__269_0.distcp ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4a0ee77e7b5e283de742fdc5b5d06f3dfa5b260ece492cd5de8992cbe74b6da3
3
+ size 17742651
megatron/iter_0023842/__26_0.distcp ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ac9a2576783e9cba09b7eada20f6582519068db5a9a14a66bf0fba7cf9453bf4
3
+ size 30327140
megatron/iter_0023842/__277_0.distcp ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:bc4a772dd6cd6544b3b1f6f17b73bf86b294fefd9a48db9539b358b8057cec48
3
+ size 17742651
megatron/iter_0023842/__289_0.distcp ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ac3d017cb35f64f8b3f911834294fc772f7263eb65e034dce7de7de09bddd1dd
3
+ size 17742651
megatron/iter_0023842/__296_0.distcp ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:721278fedc45caef07633891f35d22eb7f1239e7a88e7ee1aefda99f8675b6c4
3
+ size 17742651
megatron/iter_0023842/__2_0.distcp ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b9d13168e1629bd1782190f6b6214573f3896b4a461c5fe00994837cda13eef4
3
+ size 31900004
megatron/iter_0023842/__311_0.distcp ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:161419ecd08859f4066f9e94868647ecce1c9f41d3a4f16403490adb3849a375
3
+ size 17742651
megatron/iter_0023842/__337_0.distcp ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:66d1837fa57fecfb5c7d7db2a21e689a88e3312dfad25725fd75f715389399b1
3
+ size 17742651
megatron/iter_0023842/__362_0.distcp ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f852b665af7961bcefe346ef0c0b0e679f1d8e35f6b5b4b106e08c513ec60527
3
+ size 17752113
megatron/iter_0023842/__368_0.distcp ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6c89a7970085e1a7bc016bccf4ae3f0f8192f8f247d55ead607e2bd532ca64c3
3
+ size 17747382
megatron/iter_0023842/__372_0.distcp ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:07f2c4e7adb2317aad01fe26d2c70fadc62370e0a3cde812564ca00740558bdd
3
+ size 17742651
megatron/iter_0023842/__373_0.distcp ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:671bff49713f3aa4b4038b93aac298c87f9c19b1f85c231457206d779a2fa7d5
3
+ size 17742651
megatron/iter_0023842/__385_0.distcp ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8c1f971c8d086078ad6d79090027fe8e2ee84444bc8f05c43fc7ffc2e09387a5
3
+ size 17742651
megatron/iter_0023842/__3_0.distcp ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:dc1cff102fa717505e9f156e426824ba6276ca99882b0c8b45fef4b56864daf3
3
+ size 31900004
megatron/iter_0023842/__404_0.distcp ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:19453bf568698bf158865d28a44c2d3cf83b59f44a729911b3b9b754006ba841
3
+ size 17742651
megatron/iter_0023842/__40_0.distcp ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:97ac36e699af394371263f393eed98184878004ac08360946b97f435619cbf1d
3
+ size 30327140
megatron/iter_0023842/__468_0.distcp ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c803b68fc70fb92a7855de69d0d3df14aca94df06bb6447ee0982626cb04d0ca
3
+ size 17742651
megatron/iter_0023842/__472_0.distcp ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9cf0b92978c2d5bad25fc28e69a7b7f68735124f2bbc85257ae38818c662a0b2
3
+ size 17742651
megatron/iter_0023842/__496_0.distcp ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:30bbb56650838b3417c3fb99d20c1d84adf03d2ad380b39712f32ecc300f1e45
3
+ size 17742651
megatron/iter_0023842/__508_0.distcp ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:52308a4097defd3229aa30f8c20c71273ed61ca65a189e2903c2ea25adb9872c
3
+ size 17742651
megatron/iter_0023842/__50_0.distcp ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8ab48d4a184f48e54ba288a3ebf60288d043c976ad0d43ceb96305fdb3164af6
3
+ size 30327140
megatron/iter_0023842/__51_0.distcp ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2e8889786f916d00be4cec36da03010931e3882adb6bd5433e4041efc4978ef5
3
+ size 30336410
megatron/iter_0023842/__55_0.distcp ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1117583025516fde45490da57ac1cec7a63808cd55971c76542e27bc50d8803f
3
+ size 30336410
megatron/iter_0023842/__64_0.distcp ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:583f50e4844a58fad495a05453f13bc0faae23a2fa6b9a78a99ed4bedb686fec
3
+ size 30327140
megatron/iter_0023842/__70_0.distcp ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1b3cd65fbbb41a09a9827b5448c6949a9007d3bca8d267193a5567a1e6108519
3
+ size 30336410
megatron/iter_0023842/__73_0.distcp ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:317ce31527b18ed988b68e3a4b5db2a6a62b8059cf7812190a6161f9e90212bc
3
+ size 30327140
megatron/iter_0023842/metadata.json ADDED
@@ -0,0 +1 @@
 
 
1
+ {"sharded_backend": "torch_dist", "sharded_backend_version": 1, "common_backend": "torch", "common_backend_version": 1}
megatron/iter_0023842/run_config.yaml ADDED
@@ -0,0 +1,890 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ _target_: megatron.bridge.training.config.ConfigContainer
2
+ checkpoint:
3
+ _target_: megatron.bridge.training.config.CheckpointConfig
4
+ async_ckpt_cpu_priority: 10
5
+ async_ckpt_io_priority: 3
6
+ async_save: false
7
+ async_strategy: mcore
8
+ auto_detect_ckpt_format: false
9
+ ckpt_assume_constant_structure: false
10
+ ckpt_convert_format: null
11
+ ckpt_convert_save: null
12
+ ckpt_convert_update_legacy_dist_opt_format: false
13
+ ckpt_format: torch_dist
14
+ ckpt_fully_parallel_load_exchange_algo: broadcast
15
+ ckpt_fully_parallel_load_process_group: dp
16
+ ckpt_fully_parallel_save_process_group: dp
17
+ ckpt_step: null
18
+ custom_manager_class: null
19
+ dist_ckpt_optim_fully_reshardable: false
20
+ dist_ckpt_save_pre_mcore_014: false
21
+ dist_ckpt_strictness: assume_ok_unexpected
22
+ distrib_optim_fully_reshardable_mem_efficient: false
23
+ exit_on_missing_checkpoint: false
24
+ finetune: true
25
+ fully_parallel_load: false
26
+ fully_parallel_save: true
27
+ load: /eagle/CausalAlign/yudas/unified-training/checkpoints/midtrain-d24-100b-olmo3-only-wsd
28
+ load_main_params_from_ckpt: false
29
+ load_optim: true
30
+ load_rng: true
31
+ most_recent_k: -1
32
+ non_persistent_ckpt_type: null
33
+ non_persistent_global_ckpt_dir: null
34
+ non_persistent_local_ckpt_algo: fully_parallel
35
+ non_persistent_local_ckpt_dir: null
36
+ non_persistent_save_interval: null
37
+ pretrained_checkpoint: /eagle/CausalAlign/yudas/unified-training/checkpoints/pretrain-d24-climbmix-400b-wsd
38
+ replication: false
39
+ replication_factor: 2
40
+ replication_jump: null
41
+ save: /eagle/CausalAlign/yudas/unified-training/checkpoints/midtrain-d24-100b-olmo3-only-wsd
42
+ save_dgrads_interval: null
43
+ save_interval: 2000
44
+ save_optim: true
45
+ save_retain_interval: null
46
+ save_rng: true
47
+ save_tokenizer_assets: true
48
+ save_wgrads_interval: null
49
+ storage_writers_per_rank: 1
50
+ strict_fsdp_dtensor_load: false
51
+ use_checkpoint_args: false
52
+ use_mp_args_from_checkpoint_args: false
53
+ use_persistent_ckpt_worker: true
54
+ use_tokenizer_model_from_checkpoint_args: true
55
+ verify_integrity: false
56
+ comm_overlap: null
57
+ dataset:
58
+ _target_: megatron.bridge.training.config.GPTDatasetConfig
59
+ add_extra_token_to_sequence: true
60
+ allow_ambiguous_pad_tokens: false
61
+ blend: null
62
+ blend_per_split:
63
+ - - - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000007
64
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000022
65
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000045
66
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000033
67
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000019
68
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000059
69
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000046
70
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000009
71
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000040
72
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000018
73
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000042
74
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000031
75
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000016
76
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000021
77
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000036
78
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000041
79
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000029
80
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000020
81
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000011
82
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000050
83
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000039
84
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000048
85
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000003
86
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000030
87
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000024
88
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000055
89
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000004
90
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000057
91
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000054
92
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000049
93
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000010
94
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000000
95
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000060
96
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000028
97
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000044
98
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000026
99
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000052
100
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000012
101
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000035
102
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000053
103
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000038
104
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000032
105
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000058
106
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000013
107
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000051
108
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000062
109
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000002
110
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000027
111
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000037
112
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000005
113
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000034
114
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000056
115
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000043
116
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000006
117
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000061
118
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000008
119
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000063
120
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000015
121
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000017
122
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000047
123
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000001
124
+ - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000014
125
+ - - 1.0
126
+ - 1.0
127
+ - 1.0
128
+ - 1.0
129
+ - 1.0
130
+ - 1.0
131
+ - 1.0
132
+ - 1.0
133
+ - 1.0
134
+ - 1.0
135
+ - 1.0
136
+ - 1.0
137
+ - 1.0
138
+ - 1.0
139
+ - 1.0
140
+ - 1.0
141
+ - 1.0
142
+ - 1.0
143
+ - 1.0
144
+ - 1.0
145
+ - 1.0
146
+ - 1.0
147
+ - 1.0
148
+ - 1.0
149
+ - 1.0
150
+ - 1.0
151
+ - 1.0
152
+ - 1.0
153
+ - 1.0
154
+ - 1.0
155
+ - 1.0
156
+ - 1.0
157
+ - 1.0
158
+ - 1.0
159
+ - 1.0
160
+ - 1.0
161
+ - 1.0
162
+ - 1.0
163
+ - 1.0
164
+ - 1.0
165
+ - 1.0
166
+ - 1.0
167
+ - 1.0
168
+ - 1.0
169
+ - 1.0
170
+ - 1.0
171
+ - 1.0
172
+ - 1.0
173
+ - 1.0
174
+ - 1.0
175
+ - 1.0
176
+ - 1.0
177
+ - 1.0
178
+ - 1.0
179
+ - 1.0
180
+ - 1.0
181
+ - 1.0
182
+ - 1.0
183
+ - 1.0
184
+ - 1.0
185
+ - 1.0
186
+ - 1.0
187
+ - - - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000025
188
+ - - 1.0
189
+ - - - /eagle/CausalAlign/ftajwar/d24-100b/data/dolmino_tok/runs/6ce5609402eb3bc2/datasets/dolmino-100b/8fb78c393aa8ecd7/shard_000023
190
+ - - 1.0
191
+ context_parallel_size: null
192
+ create_attention_mask: true
193
+ data_parallel_size: 1
194
+ data_path: null
195
+ data_sharding: true
196
+ dataloader_type: single
197
+ defer_npy_index_mmap: false
198
+ drop_last: true
199
+ drop_last_partial_validation_sequence: true
200
+ eod_mask_loss: false
201
+ fast_cache_load: false
202
+ full_validation: null
203
+ hybrid_context_parallel: false
204
+ mid_level_dataset_surplus: 0.005
205
+ mmap_bin_files: true
206
+ mock: false
207
+ multiple_validation_sets: null
208
+ num_dataset_builder_threads: 1
209
+ num_workers: 2
210
+ object_storage_cache_path: null
211
+ path_to_cache: /eagle/CausalAlign/yudas/unified-training/checkpoints/midtrain-d24-100b-olmo3-only-wsd/dataset-cache
212
+ persistent_workers: true
213
+ pin_memory: true
214
+ random_seed: 1234
215
+ reset_attention_mask: false
216
+ reset_position_ids: false
217
+ sequence_length: 2048
218
+ sequence_parallel_size: 0
219
+ sequences_per_dataset: null
220
+ split: null
221
+ split_matrix: null
222
+ token_dtype_code: null
223
+ tokenizer:
224
+ _call_: true
225
+ _target_: megatron.core.tokenizers.text.models.default_tokenizer.DefaultTokenizerText
226
+ trust_remote_code: null
227
+ ddp:
228
+ _target_: megatron.core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig
229
+ align_param_gather: false
230
+ average_in_collective: false
231
+ bucket_size: null
232
+ check_for_large_grads: false
233
+ check_for_nan_in_grad: true
234
+ data_parallel_sharding_strategy: no_shard
235
+ delay_wgrad_compute: false
236
+ disable_symmetric_registration: false
237
+ fp4_param_gather: false
238
+ fp8_param_gather: false
239
+ fsdp_all_gather_in_start_param_sync: true
240
+ fsdp_db_use_persist_buf_on_alloc_fail: false
241
+ fsdp_double_buffer: false
242
+ fsdp_manual_registration: false
243
+ grad_reduce_in_fp32: true
244
+ gradient_reduce_div_fusion: true
245
+ keep_fp8_transpose_cache: false
246
+ megatron_fsdp_grad_comm_dtype: null
247
+ megatron_fsdp_main_grads_dtype: null
248
+ megatron_fsdp_main_params_dtype:
249
+ _call_: false
250
+ _target_: torch.float32
251
+ nccl_ub: false
252
+ num_distributed_optimizer_instances: 1
253
+ outer_dp_sharding_strategy: no_shard
254
+ overlap_grad_reduce: false
255
+ overlap_param_gather: false
256
+ pad_buckets_for_high_nccl_busbw: false
257
+ param_name_patterns_for_fp32_local_accumulation: []
258
+ reduce_scatter_with_fp32_accumulation: false
259
+ reuse_grad_buf_for_mxfp8_param_ag: false
260
+ suggested_communication_unit_size: null
261
+ use_custom_fsdp: false
262
+ use_distributed_optimizer: true
263
+ use_megatron_fsdp: false
264
+ dist:
265
+ _target_: megatron.bridge.training.config.DistributedInitConfig
266
+ align_grad_reduce: true
267
+ disable_jit_fuser: false
268
+ distributed_backend: nccl
269
+ distributed_timeout_minutes: 10
270
+ distributed_timeout_seconds_after_init: null
271
+ enable_megatron_core_experimental: false
272
+ external_gpu_device_mapping: false
273
+ flight_recorder_dump_on_timeout: true
274
+ flight_recorder_dump_path: null
275
+ flight_recorder_extra_dump_on_exec: true
276
+ flight_recorder_include_only_active: true
277
+ flight_recorder_include_stack_trace: false
278
+ flight_recorder_trace_buffer_size: 2000
279
+ high_priority_stream_groups: []
280
+ lazy_mpu_init: false
281
+ local_rank: 0
282
+ nccl_communicator_config_path: null
283
+ sharp_enabled_group: null
284
+ use_decentralized_pg: false
285
+ use_gloo_process_groups: true
286
+ use_megatron_fsdp: false
287
+ use_sharp: false
288
+ use_torch_fsdp2: false
289
+ use_tp_pp_dp_mapping: false
290
+ ft: null
291
+ inprocess_restart: null
292
+ logger:
293
+ _target_: megatron.bridge.training.config.LoggerConfig
294
+ barrier_with_L1_time: true
295
+ comet_api_key: null
296
+ comet_experiment_name: null
297
+ comet_project: null
298
+ comet_tags: null
299
+ comet_workspace: null
300
+ filter_warnings: true
301
+ log_device_memory_used: false
302
+ log_energy: false
303
+ log_interval: 10
304
+ log_l2_norm_grad_to_tensorboard: false
305
+ log_loss_scale_to_tensorboard: true
306
+ log_max_attention_logit: false
307
+ log_memory_interval: null
308
+ log_memory_to_tensorboard: false
309
+ log_num_zeros_in_grad: false
310
+ log_params_norm: false
311
+ log_progress: false
312
+ log_runtime_to_tensorboard: false
313
+ log_throughput: false
314
+ log_throughput_to_tensorboard: false
315
+ log_timers_to_tensorboard: false
316
+ log_validation_ppl_to_tensorboard: false
317
+ log_world_size_to_tensorboard: false
318
+ logging_level: 20
319
+ memory_keys: null
320
+ mlflow_experiment: null
321
+ mlflow_run_name: null
322
+ mlflow_tags: null
323
+ mlflow_tracking_uri: null
324
+ modules_to_filter: null
325
+ runtime_time_unit: hours
326
+ save_config_filepath: null
327
+ set_level_for_all_loggers: false
328
+ skip_train_metrics_log: false
329
+ tensorboard_dir: /home/yudas/unified-training/nemo_experiments/default/tb_logs
330
+ tensorboard_log_interval: 1
331
+ tensorboard_queue_size: 1000
332
+ throughput_window_size: 100
333
+ timing_log_level: 0
334
+ timing_log_option: minmax
335
+ wandb_entity: null
336
+ wandb_exp_name: midtrain-d24-100b-olmo3-only-wsd
337
+ wandb_project: nemotron-polaris
338
+ wandb_save_dir: null
339
+ mixed_precision:
340
+ _target_: megatron.bridge.training.mixed_precision.MixedPrecisionConfig
341
+ autocast_dtype: null
342
+ autocast_enabled: false
343
+ bf16: true
344
+ first_last_layers_bf16: false
345
+ fp16: false
346
+ fp32: false
347
+ fp4: null
348
+ fp4_param: false
349
+ fp4_param_gather: false
350
+ fp4_recipe: nvfp4
351
+ fp8: null
352
+ fp8_amax_compute_algo: most_recent
353
+ fp8_amax_history_len: 1
354
+ fp8_dot_product_attention: false
355
+ fp8_margin: 0
356
+ fp8_multi_head_attention: false
357
+ fp8_param: false
358
+ fp8_param_gather: false
359
+ fp8_recipe: tensorwise
360
+ fp8_wgrad: true
361
+ grad_reduce_in_fp32: true
362
+ hysteresis: 2
363
+ initial_loss_scale: 4294967296
364
+ loss_scale: null
365
+ loss_scale_window: 1000
366
+ min_loss_scale: 1.0
367
+ num_layers_at_end_in_bf16: 0
368
+ num_layers_at_start_in_bf16: 0
369
+ params_dtype:
370
+ _call_: false
371
+ _target_: torch.bfloat16
372
+ pipeline_dtype:
373
+ _call_: false
374
+ _target_: torch.bfloat16
375
+ reuse_grad_buf_for_mxfp8_param_ag: false
376
+ model:
377
+ _target_: megatron.bridge.models.gpt_provider.GPTModelProvider
378
+ account_for_embedding_in_pipeline_split: false
379
+ account_for_loss_in_pipeline_split: false
380
+ activation_func:
381
+ _call_: false
382
+ _target_: torch.nn.functional.silu
383
+ activation_func_clamp_value: null
384
+ activation_func_fp8_input_store: false
385
+ add_bias_linear: false
386
+ add_qkv_bias: false
387
+ apply_query_key_layer_scaling: false
388
+ apply_residual_connection_post_layernorm: false
389
+ apply_rope_fusion: false
390
+ attention_backend:
391
+ _args_:
392
+ - 5
393
+ _call_: true
394
+ _name_: auto
395
+ _target_: megatron.core.transformer.enums.AttnBackend
396
+ attention_dropout: 0.1
397
+ attention_output_gate: false
398
+ attention_softmax_in_fp32: false
399
+ autocast_dtype:
400
+ _call_: false
401
+ _target_: torch.bfloat16
402
+ barrier_with_L1_time: true
403
+ batch_invariant_mode: false
404
+ batch_p2p_comm: true
405
+ batch_p2p_sync: true
406
+ bf16: true
407
+ bias_activation_fusion: false
408
+ bias_dropout_fusion: false
409
+ calculate_per_token_loss: false
410
+ clone_scatter_output_in_embedding: true
411
+ config_logger_dir: ''
412
+ context_parallel_size: 1
413
+ cp_comm_type: null
414
+ cpu_offloading: false
415
+ cpu_offloading_activations: true
416
+ cpu_offloading_double_buffering: false
417
+ cpu_offloading_num_layers: 0
418
+ cpu_offloading_retain_pinned_cpu_buffers: false
419
+ cpu_offloading_weights: false
420
+ cross_entropy_fusion_impl: native
421
+ cross_entropy_loss_fusion: true
422
+ cuda_graph_impl: none
423
+ cuda_graph_retain_backward_graph: false
424
+ cuda_graph_scope: []
425
+ cuda_graph_use_single_mempool: false
426
+ cuda_graph_warmup_steps: 3
427
+ deallocate_pipeline_outputs: true
428
+ defer_embedding_wgrad_compute: false
429
+ delay_wgrad_compute: false
430
+ deterministic_mode: false
431
+ disable_bf16_reduced_precision_matmul: false
432
+ disable_parameter_transpose_cache: false
433
+ distribute_saved_activations: false
434
+ dsa_indexer_head_dim: null
435
+ dsa_indexer_loss_coeff: null
436
+ dsa_indexer_n_heads: null
437
+ dsa_indexer_topk: null
438
+ dsa_indexer_use_sparse_loss: false
439
+ embedding_init_method:
440
+ _args_: []
441
+ _partial_: true
442
+ _target_: torch.nn.init.normal_
443
+ mean: 0.0
444
+ std: 0.02
445
+ embedding_init_method_std: 0.02
446
+ enable_autocast: false
447
+ enable_cuda_graph: false
448
+ ep_overlap_early_attn_memory_release: false
449
+ experimental_attention_variant: null
450
+ expert_model_parallel_size: 1
451
+ expert_tensor_parallel_size: 1
452
+ external_cuda_graph: false
453
+ ffn_hidden_size: 4096
454
+ finalize_model_grads_func:
455
+ _args_: []
456
+ _partial_: true
457
+ _target_: megatron.core.distributed.finalize_model_grads.finalize_model_grads
458
+ pg_collection:
459
+ _call_: true
460
+ _target_: megatron.core.process_groups_config.ProcessGroupCollection
461
+ fine_grained_activation_offloading: false
462
+ first_last_layers_bf16: false
463
+ flash_decode: false
464
+ fp16: false
465
+ fp16_lm_cross_entropy: false
466
+ fp32_residual_connection: false
467
+ fp4: null
468
+ fp4_param: false
469
+ fp4_quantizer_factory: null
470
+ fp4_recipe: nvfp4
471
+ fp8: null
472
+ fp8_amax_compute_algo: most_recent
473
+ fp8_amax_history_len: 1
474
+ fp8_dot_product_attention: false
475
+ fp8_interval: 1
476
+ fp8_margin: 0
477
+ fp8_multi_head_attention: false
478
+ fp8_param: false
479
+ fp8_quantizer_factory: null
480
+ fp8_recipe: tensorwise
481
+ fp8_wgrad: true
482
+ fused_residual_rmsnorm: false
483
+ fused_single_qkv_rope: false
484
+ gated_linear_unit: true
485
+ glu_linear_offset: 0.0
486
+ grad_scale_func:
487
+ _call_: false
488
+ _target_: megatron.core.optimizer.optimizer.MegatronOptimizer.scale_loss
489
+ grad_sync_func: null
490
+ gradient_accumulation_fusion: true
491
+ hetereogenous_dist_checkpoint: false
492
+ heterogeneous_block_specs: false
493
+ hf_model_id: null
494
+ hidden_dropout: 0.1
495
+ hidden_size: 1536
496
+ hierarchical_context_parallel_sizes: null
497
+ hybrid_context_parallel: false
498
+ inference_disable_triton_nvls_kernels: false
499
+ inference_fuse_tp_communication: false
500
+ inference_grouped_gemm_backend: auto
501
+ inference_moe_disable_fused_quant_kernels: false
502
+ inference_rng_tracker: false
503
+ inference_sampling_seed: 42
504
+ init_method:
505
+ _args_: []
506
+ _partial_: true
507
+ _target_: torch.nn.init.normal_
508
+ mean: 0.0
509
+ std: 0.02
510
+ init_method_std: 0.02
511
+ init_model_with_meta_device: false
512
+ is_hybrid_model: false
513
+ kitchen_attention_backend: sdpa
514
+ kv_channels: 128
515
+ layernorm_epsilon: 1.0e-05
516
+ layernorm_zero_centered_gamma: false
517
+ linear_attention_freq: null
518
+ linear_conv_kernel_dim: 4
519
+ linear_key_head_dim: 128
520
+ linear_num_key_heads: 16
521
+ linear_num_value_heads: 32
522
+ linear_value_head_dim: 128
523
+ log_max_attention_logit: false
524
+ make_vocab_size_divisible_by: 128
525
+ mamba_head_dim: 64
526
+ mamba_num_groups: 8
527
+ mamba_num_heads: null
528
+ mamba_state_dim: 128
529
+ masked_softmax_fusion: true
530
+ max_seqlen_per_dp_cp_rank: null
531
+ memory_efficient_layer_norm: false
532
+ microbatch_group_size_per_vp_stage: 1
533
+ min_offloaded_tensor_size: 1048576
534
+ mlp_chunks_for_prefill: 1
535
+ moe_apply_probs_on_input: false
536
+ moe_aux_loss_coeff: 0.0
537
+ moe_deepep_num_sms: 20
538
+ moe_enable_deepep: false
539
+ moe_enable_routing_replay: false
540
+ moe_expert_capacity_factor: null
541
+ moe_ffn_hidden_size: null
542
+ moe_flex_dispatcher_backend: deepep
543
+ moe_grouped_gemm: false
544
+ moe_hybridep_num_blocks_permute: null
545
+ moe_hybridep_num_blocks_unpermute: null
546
+ moe_hybridep_num_sms: null
547
+ moe_input_jitter_eps: null
548
+ moe_latent_size: null
549
+ moe_layer_freq: 1
550
+ moe_layer_recompute: false
551
+ moe_pad_expert_input_to_capacity: false
552
+ moe_pad_experts_for_cuda_graph_inference: false
553
+ moe_per_layer_logging: false
554
+ moe_permute_fusion: false
555
+ moe_permute_fusion_into_hybridep: false
556
+ moe_router_bias_update_rate: 0.001
557
+ moe_router_dtype: null
558
+ moe_router_enable_expert_bias: false
559
+ moe_router_force_biased: null
560
+ moe_router_force_load_balancing: false
561
+ moe_router_fusion: false
562
+ moe_router_group_topk: null
563
+ moe_router_load_balancing_type: aux_loss
564
+ moe_router_num_groups: null
565
+ moe_router_padding_for_fp8: false
566
+ moe_router_padding_for_quantization: false
567
+ moe_router_pre_softmax: false
568
+ moe_router_score_function: softmax
569
+ moe_router_topk: 2
570
+ moe_router_topk_limited_devices: null
571
+ moe_router_topk_scaling_factor: null
572
+ moe_shared_expert_gate: false
573
+ moe_shared_expert_intermediate_size: null
574
+ moe_shared_expert_overlap: false
575
+ moe_token_dispatcher_type: allgather
576
+ moe_token_drop_policy: probs
577
+ moe_token_dropping: false
578
+ moe_z_loss_coeff: null
579
+ mrope_section: null
580
+ mtp_enabled: false
581
+ mtp_hybrid_override_pattern: null
582
+ mtp_loss_scaling_factor: 0.1
583
+ mtp_num_layers: null
584
+ mtp_standalone: false
585
+ mtp_use_repeated_layer: false
586
+ multi_latent_attention: false
587
+ mup_attn_scale_power: 1.0
588
+ mup_base_head_dim: null
589
+ mup_base_hidden_size: null
590
+ mup_embedding_mult: 1.0
591
+ mup_output_mult: 1.0
592
+ mup_width_mult: 1.0
593
+ nccl_all_reduce_for_prefill: false
594
+ no_rope_freq: null
595
+ no_sync_func: null
596
+ normalization: RMSNorm
597
+ num_attention_heads: 12
598
+ num_layers: 24
599
+ num_layers_at_end_in_bf16: 0
600
+ num_layers_at_start_in_bf16: 0
601
+ num_layers_in_first_pipeline_stage: null
602
+ num_layers_in_last_pipeline_stage: null
603
+ num_microbatches_with_partial_activation_checkpoints: null
604
+ num_moe_experts: null
605
+ num_query_groups: 12
606
+ offload_modules: []
607
+ output_layer_init_method:
608
+ _args_: []
609
+ _partial_: true
610
+ _target_: torch.nn.init.normal_
611
+ mean: 0.0
612
+ std: 0.002886751345948129
613
+ overlap_moe_expert_parallel_comm: false
614
+ overlap_p2p_comm: false
615
+ overlap_p2p_comm_warmup_flush: false
616
+ parallel_output: true
617
+ param_sync_func: null
618
+ params_dtype:
619
+ _call_: false
620
+ _target_: torch.bfloat16
621
+ perform_initialization: true
622
+ persist_layer_norm: false
623
+ pipeline_dtype:
624
+ _call_: false
625
+ _target_: torch.bfloat16
626
+ pipeline_model_parallel_comm_backend: null
627
+ pipeline_model_parallel_layout: null
628
+ pipeline_model_parallel_size: 1
629
+ position_embedding_type: rope
630
+ qk_clip: false
631
+ qk_clip_alpha: 0.5
632
+ qk_clip_threshold: 100
633
+ qk_l2_norm: false
634
+ qk_layernorm: false
635
+ quant_recipe: null
636
+ recompute_granularity: null
637
+ recompute_method: null
638
+ recompute_modules:
639
+ - core_attn
640
+ recompute_num_layers: null
641
+ restore_modelopt_state: false
642
+ rope_scaling: false
643
+ rope_scaling_factor: 1.0
644
+ rotary_base: 10000
645
+ rotary_interleaved: false
646
+ rotary_percent: 1.0
647
+ rotary_scaling_factor: null
648
+ scatter_embedding_sequence_parallel: true
649
+ seq_len_interpolation_factor: null
650
+ seq_length: 2048
651
+ sequence_parallel: false
652
+ share_embeddings_and_output_weights: true
653
+ should_pad_vocab: true
654
+ softmax_scale: null
655
+ softmax_type: vanilla
656
+ symmetric_ar_type: null
657
+ tensor_model_parallel_size: 1
658
+ test_mode: false
659
+ timers:
660
+ _call_: true
661
+ _target_: megatron.core.timers.Timers
662
+ tp_comm_atomic_ag: false
663
+ tp_comm_atomic_rs: false
664
+ tp_comm_bootstrap_backend: nccl
665
+ tp_comm_bulk_dgrad: true
666
+ tp_comm_bulk_wgrad: true
667
+ tp_comm_overlap: false
668
+ tp_comm_overlap_ag: true
669
+ tp_comm_overlap_cfg: null
670
+ tp_comm_overlap_disable_fc1: false
671
+ tp_comm_overlap_disable_qkv: false
672
+ tp_comm_overlap_rs: true
673
+ tp_comm_overlap_rs_dgrad: false
674
+ tp_comm_split_ag: true
675
+ tp_comm_split_rs: true
676
+ tp_only_amax_red: false
677
+ transformer_impl: transformer_engine
678
+ transformer_layer_spec:
679
+ _call_: false
680
+ _target_: megatron.bridge.models.gpt_provider.default_layer_spec
681
+ use_arbitrary_attention_mask: null
682
+ use_cpu_initialization: false
683
+ use_fused_weighted_squared_relu: false
684
+ use_inference_optimized_layers: false
685
+ use_kitchen: false
686
+ use_kitchen_attention: false
687
+ use_mamba_mem_eff_path: true
688
+ use_mup: false
689
+ use_ring_exchange_p2p: false
690
+ use_te_activation_func: false
691
+ use_te_rng_tracker: false
692
+ use_transformer_engine_full_layer_spec: false
693
+ use_transformer_engine_op_fuser: false
694
+ variable_seq_lengths: false
695
+ virtual_pipeline_model_parallel_size: null
696
+ vocab_size: 50304
697
+ wgrad_deferral_limit: 0
698
+ window_attn_skip_freq: null
699
+ window_size: null
700
+ yarn_beta_fast: null
701
+ yarn_beta_slow: null
702
+ yarn_correction_range_round_to_int: null
703
+ yarn_mscale: null
704
+ yarn_mscale_all_dim: null
705
+ yarn_original_max_position_embeddings: null
706
+ yarn_rotary_scaling_factor: null
707
+ nvrx_straggler: null
708
+ optimizer:
709
+ _target_: megatron.bridge.training.config.OptimizerConfig
710
+ adam_beta1: 0.9
711
+ adam_beta2: 0.95
712
+ adam_eps: 1.0e-08
713
+ apply_wd_to_qk_layernorm: false
714
+ barrier_with_L1_time: false
715
+ bf16: true
716
+ clip_grad: 1.0
717
+ config_logger_dir: ''
718
+ decoupled_lr: null
719
+ decoupled_min_lr: null
720
+ decoupled_weight_decay: true
721
+ exp_avg_dtype:
722
+ _call_: false
723
+ _target_: torch.float32
724
+ exp_avg_sq_dtype:
725
+ _call_: false
726
+ _target_: torch.float32
727
+ fp16: false
728
+ fp8_recipe: tensorwise
729
+ hysteresis: 2
730
+ initial_loss_scale: 4294967296
731
+ lion_beta1: 0.95
732
+ lion_beta2: 0.98
733
+ log_num_zeros_in_grad: false
734
+ loss_scale: null
735
+ loss_scale_window: 1000
736
+ lr: 0.0004
737
+ main_grads_dtype:
738
+ _call_: false
739
+ _target_: torch.float32
740
+ main_params_dtype:
741
+ _call_: false
742
+ _target_: torch.float32
743
+ min_loss_scale: 1.0
744
+ min_lr: 4.0e-05
745
+ muon_coefficient_type: quintic
746
+ muon_extra_scale_factor: 1.0
747
+ muon_fp32_matmul_prec: medium
748
+ muon_momentum: 0.95
749
+ muon_num_ns_steps: 5
750
+ muon_scalar_optimizer: adam
751
+ muon_scale_mode: spectral
752
+ muon_split_qkv: true
753
+ muon_tp_mode: blockwise
754
+ muon_use_nesterov: false
755
+ optimizer: adam
756
+ optimizer_cpu_offload: false
757
+ optimizer_cuda_graph: false
758
+ optimizer_offload_fraction: 0.0
759
+ overlap_cpu_optimizer_d2h_h2d: false
760
+ overlap_param_gather: false
761
+ overlap_param_gather_with_optimizer_step: false
762
+ params_dtype:
763
+ _call_: false
764
+ _target_: torch.bfloat16
765
+ pin_cpu_grads: true
766
+ pin_cpu_params: true
767
+ reuse_grad_buf_for_mxfp8_param_ag: false
768
+ sgd_momentum: 0.9
769
+ store_param_remainders: true
770
+ timers:
771
+ _call_: true
772
+ _target_: megatron.core.timers.Timers
773
+ use_distributed_optimizer: true
774
+ use_precision_aware_optimizer: false
775
+ use_torch_optimizer_for_cpu_offload: false
776
+ weight_decay: 0.1
777
+ optimizer_config_override_provider:
778
+ _target_: megatron.bridge.training.config.OptimizerConfigOverrideProvider
779
+ peft: null
780
+ profiling:
781
+ _target_: megatron.bridge.training.config.ProfilingConfig
782
+ memory_snapshot_path: /nemo_run/snapshot.pickle
783
+ nvtx_ranges: false
784
+ profile_ranks:
785
+ - 0
786
+ profile_step_end: 12
787
+ profile_step_start: 10
788
+ pytorch_profiler_collect_callstack: false
789
+ pytorch_profiler_collect_chakra: false
790
+ pytorch_profiler_collect_shapes: false
791
+ record_memory_history: false
792
+ record_shapes: false
793
+ use_nsys_profiler: false
794
+ use_pytorch_profiler: false
795
+ rerun_state_machine:
796
+ _target_: megatron.bridge.training.config.RerunStateMachineConfig
797
+ check_for_nan_in_loss: true
798
+ check_for_spiky_loss: false
799
+ error_injection_rate: 0
800
+ error_injection_type: transient_error
801
+ rerun_mode: disabled
802
+ spiky_loss_factor: 10.0
803
+ rng:
804
+ _target_: megatron.training.config.common_config.RNGConfig
805
+ data_parallel_random_init: false
806
+ inference_rng_tracker: false
807
+ seed: 1234
808
+ te_rng_tracker: false
809
+ scheduler:
810
+ _target_: megatron.bridge.training.config.SchedulerConfig
811
+ end_weight_decay: 0.1
812
+ lr_decay_iters: 23842
813
+ lr_decay_samples: null
814
+ lr_decay_steps: 48828416
815
+ lr_decay_style: WSD
816
+ lr_warmup_fraction: null
817
+ lr_warmup_init: 0.0
818
+ lr_warmup_iters: 1000
819
+ lr_warmup_samples: 0
820
+ lr_warmup_steps: 2048000
821
+ lr_wsd_decay_iters: 4768
822
+ lr_wsd_decay_samples: null
823
+ lr_wsd_decay_style: cosine
824
+ no_weight_decay_cond_type: null
825
+ override_opt_param_scheduler: true
826
+ start_weight_decay: 0.1
827
+ use_checkpoint_opt_param_scheduler: false
828
+ wd_incr_steps: 48828416
829
+ weight_decay_incr_style: constant
830
+ wsd_decay_steps: 9764864
831
+ straggler: null
832
+ tensor_inspect: null
833
+ tokenizer:
834
+ _target_: megatron.bridge.training.tokenizers.config.TokenizerConfig
835
+ chat_template: null
836
+ force_system_message: false
837
+ hf_tokenizer_kwargs: {}
838
+ image_tag_type: null
839
+ merge_file: null
840
+ metadata_path: null
841
+ sp_tokenizer_kwargs: {}
842
+ special_tokens: null
843
+ tiktoken_num_special_tokens: 1000
844
+ tiktoken_pattern: null
845
+ tiktoken_special_tokens: null
846
+ tokenizer_model: null
847
+ tokenizer_prompt_format: null
848
+ tokenizer_type: NullTokenizer
849
+ vocab_extra_ids: 0
850
+ vocab_file: null
851
+ vocab_size: 50304
852
+ train:
853
+ _target_: megatron.bridge.training.config.TrainingConfig
854
+ check_optimizer_step_success: true
855
+ check_weight_hash_across_dp_replicas_interval: null
856
+ decrease_batch_size_if_needed: false
857
+ empty_unused_memory_level: 0
858
+ eval_interval: 500
859
+ eval_iters: 32
860
+ exit_duration_in_mins: null
861
+ exit_interval: null
862
+ exit_signal:
863
+ _args_:
864
+ - 15
865
+ _call_: true
866
+ _name_: SIGTERM
867
+ _target_: signal.Signals
868
+ exit_signal_handler: false
869
+ exit_signal_handler_for_dataloader: false
870
+ exit_signal_handler_for_training: false
871
+ global_batch_size: 2048
872
+ iterations_to_skip: []
873
+ manual_gc: false
874
+ manual_gc_eval: true
875
+ manual_gc_interval: 0
876
+ micro_batch_size: 4
877
+ rampup_batch_size: null
878
+ skip_sync_grad_norm_across_mp: false
879
+ skip_train: null
880
+ train_iters: 23842
881
+ train_samples: null
882
+ train_sync_interval: null
883
+ validation:
884
+ _target_: megatron.training.config.training_config.ValidationConfig
885
+ eval_interval: 500
886
+ eval_iters: 32
887
+ full_validation: false
888
+ multiple_validation_sets: false
889
+ skip_train: false
890
+ test_mode: false
megatron/iter_0023842/train_state.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f27dc846f7233e4710858bf2e5daf213b343972ebe06f12c1b2231bc588685c4
3
+ size 3405
megatron/latest_checkpointed_iteration.txt ADDED
@@ -0,0 +1 @@
 
 
1
+ 23842
megatron/latest_train_state.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f27dc846f7233e4710858bf2e5daf213b343972ebe06f12c1b2231bc588685c4
3
+ size 3405
tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
tokenizer_config.json ADDED
@@ -0,0 +1,14 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "cls_token": "<|endoftext|>",
6
+ "eos_token": "<|endoftext|>",
7
+ "errors": "replace",
8
+ "is_local": true,
9
+ "model_max_length": 2048,
10
+ "pad_token": null,
11
+ "sep_token": "<|endoftext|>",
12
+ "tokenizer_class": "GPT2Tokenizer",
13
+ "unk_token": "<|endoftext|>"
14
+ }