b4b4yg4 commited on
Commit
4998a7a
·
verified ·
1 Parent(s): 2253ac6

Add files using upload-large-folder tool

Browse files
Files changed (50) hide show
  1. README.md +57 -0
  2. checkpoint-142/chat_template.jinja +6 -0
  3. checkpoint-142/config.json +40 -0
  4. checkpoint-142/generation_config.json +9 -0
  5. checkpoint-142/model.safetensors +3 -0
  6. checkpoint-142/rng_state.pth +3 -0
  7. checkpoint-142/scheduler.pt +3 -0
  8. checkpoint-142/tokenizer.json +0 -0
  9. checkpoint-142/tokenizer_config.json +17 -0
  10. checkpoint-142/trainer_state.json +1465 -0
  11. checkpoint-142/training_args.bin +3 -0
  12. checkpoint-284/chat_template.jinja +6 -0
  13. checkpoint-284/config.json +40 -0
  14. checkpoint-284/generation_config.json +9 -0
  15. checkpoint-284/model.safetensors +3 -0
  16. checkpoint-284/rng_state.pth +3 -0
  17. checkpoint-284/scheduler.pt +3 -0
  18. checkpoint-284/tokenizer.json +0 -0
  19. checkpoint-284/tokenizer_config.json +17 -0
  20. checkpoint-284/trainer_state.json +2896 -0
  21. checkpoint-284/training_args.bin +3 -0
  22. checkpoint-426/chat_template.jinja +6 -0
  23. checkpoint-426/config.json +40 -0
  24. checkpoint-426/generation_config.json +9 -0
  25. checkpoint-426/model.safetensors +3 -0
  26. checkpoint-426/rng_state.pth +3 -0
  27. checkpoint-426/scheduler.pt +3 -0
  28. checkpoint-426/tokenizer.json +0 -0
  29. checkpoint-426/tokenizer_config.json +17 -0
  30. checkpoint-426/trainer_state.json +0 -0
  31. checkpoint-426/training_args.bin +3 -0
  32. checkpoint-568/chat_template.jinja +6 -0
  33. checkpoint-568/config.json +40 -0
  34. checkpoint-568/generation_config.json +9 -0
  35. checkpoint-568/model.safetensors +3 -0
  36. checkpoint-568/rng_state.pth +3 -0
  37. checkpoint-568/scheduler.pt +3 -0
  38. checkpoint-568/tokenizer.json +0 -0
  39. checkpoint-568/tokenizer_config.json +17 -0
  40. checkpoint-568/trainer_state.json +0 -0
  41. checkpoint-568/training_args.bin +3 -0
  42. checkpoint-710/chat_template.jinja +6 -0
  43. checkpoint-710/config.json +40 -0
  44. checkpoint-710/generation_config.json +9 -0
  45. checkpoint-710/rng_state.pth +3 -0
  46. checkpoint-710/scheduler.pt +3 -0
  47. checkpoint-710/tokenizer.json +0 -0
  48. checkpoint-710/tokenizer_config.json +17 -0
  49. checkpoint-710/trainer_state.json +0 -0
  50. checkpoint-710/training_args.bin +3 -0
README.md ADDED
@@ -0,0 +1,57 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ library_name: transformers
3
+ model_name: checkpoint_models
4
+ tags:
5
+ - generated_from_trainer
6
+ - trl
7
+ - sft
8
+ licence: license
9
+ ---
10
+
11
+ # Model Card for checkpoint_models
12
+
13
+ This model is a fine-tuned version of [None](https://huggingface.co/None).
14
+ It has been trained using [TRL](https://github.com/huggingface/trl).
15
+
16
+ ## Quick start
17
+
18
+ ```python
19
+ from transformers import pipeline
20
+
21
+ question = "If you had a time machine, but could only go to the past or the future once and never return, which would you choose and why?"
22
+ generator = pipeline("text-generation", model="None", device="cuda")
23
+ output = generator([{"role": "user", "content": question}], max_new_tokens=128, return_full_text=False)[0]
24
+ print(output["generated_text"])
25
+ ```
26
+
27
+ ## Training procedure
28
+
29
+
30
+
31
+
32
+
33
+ This model was trained with SFT.
34
+
35
+ ### Framework versions
36
+
37
+ - TRL: 0.29.0
38
+ - Transformers: 5.2.0
39
+ - Pytorch: 2.10.0+cu130
40
+ - Datasets: 4.6.0
41
+ - Tokenizers: 0.22.2
42
+
43
+ ## Citations
44
+
45
+
46
+
47
+ Cite TRL as:
48
+
49
+ ```bibtex
50
+ @software{vonwerra2020trl,
51
+ title = {{TRL: Transformers Reinforcement Learning}},
52
+ author = {von Werra, Leandro and Belkada, Younes and Tunstall, Lewis and Beeching, Edward and Thrush, Tristan and Lambert, Nathan and Huang, Shengyi and Rasul, Kashif and Gallouédec, Quentin},
53
+ license = {Apache-2.0},
54
+ url = {https://github.com/huggingface/trl},
55
+ year = {2020}
56
+ }
57
+ ```
checkpoint-142/chat_template.jinja ADDED
@@ -0,0 +1,6 @@
 
 
 
 
 
 
 
1
+ {% for message in messages %}{% if loop.first and messages[0]['role'] != 'system' %}{{ '<|im_start|>system
2
+ You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|>
3
+ ' }}{% endif %}{{'<|im_start|>' + message['role'] + '
4
+ ' + message['content'] + '<|im_end|>' + '
5
+ '}}{% endfor %}{% if add_generation_prompt %}{{ '<|im_start|>assistant
6
+ ' }}{% endif %}
checkpoint-142/config.json ADDED
@@ -0,0 +1,40 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "LlamaForCausalLM"
4
+ ],
5
+ "attention_bias": false,
6
+ "attention_dropout": 0.0,
7
+ "bos_token_id": 1,
8
+ "dtype": "bfloat16",
9
+ "eos_token_id": 2,
10
+ "head_dim": 64,
11
+ "hidden_act": "silu",
12
+ "hidden_size": 576,
13
+ "initializer_range": 0.041666666666666664,
14
+ "intermediate_size": 1536,
15
+ "is_llama_config": true,
16
+ "max_position_embeddings": 8192,
17
+ "mlp_bias": false,
18
+ "model_type": "llama",
19
+ "num_attention_heads": 9,
20
+ "num_hidden_layers": 30,
21
+ "num_key_value_heads": 3,
22
+ "pad_token_id": 2,
23
+ "pretraining_tp": 1,
24
+ "rms_norm_eps": 1e-05,
25
+ "rope_interleaved": false,
26
+ "rope_parameters": {
27
+ "rope_theta": 100000,
28
+ "rope_type": "default"
29
+ },
30
+ "tie_word_embeddings": true,
31
+ "transformers.js_config": {
32
+ "kv_cache_dtype": {
33
+ "fp16": "float16",
34
+ "q4f16": "float16"
35
+ }
36
+ },
37
+ "transformers_version": "5.2.0",
38
+ "use_cache": false,
39
+ "vocab_size": 49152
40
+ }
checkpoint-142/generation_config.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "_from_model_config": true,
3
+ "bos_token_id": 1,
4
+ "eos_token_id": [
5
+ 2
6
+ ],
7
+ "pad_token_id": 2,
8
+ "transformers_version": "5.2.0"
9
+ }
checkpoint-142/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3358ae11cc733b9f79a40841204ded02bf2baf76ca8d2ce893bd67916004fe63
3
+ size 269060552
checkpoint-142/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:098b29492211804ab324a36f37466821d948280bb74fce4ba895c03f13ecd878
3
+ size 14645
checkpoint-142/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2732da9c9500b70ace14309058979c65a5e31cf20be217688967b97f7bd768e2
3
+ size 1465
checkpoint-142/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
checkpoint-142/tokenizer_config.json ADDED
@@ -0,0 +1,17 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|im_start|>",
5
+ "clean_up_tokenization_spaces": false,
6
+ "eos_token": "<|im_end|>",
7
+ "extra_special_tokens": [
8
+ "<|im_start|>",
9
+ "<|im_end|>"
10
+ ],
11
+ "is_local": true,
12
+ "model_max_length": 8192,
13
+ "pad_token": "<|im_end|>",
14
+ "tokenizer_class": "TokenizersBackend",
15
+ "unk_token": "<|endoftext|>",
16
+ "vocab_size": 49152
17
+ }
checkpoint-142/trainer_state.json ADDED
@@ -0,0 +1,1465 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 1.0,
6
+ "eval_steps": 500,
7
+ "global_step": 142,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "entropy": 1.78125,
14
+ "epoch": 0.007042253521126761,
15
+ "grad_norm": 5.375,
16
+ "learning_rate": 5e-05,
17
+ "loss": 2.342320680618286,
18
+ "mean_token_accuracy": 0.5398398637771606,
19
+ "num_tokens": 2631.0,
20
+ "step": 1
21
+ },
22
+ {
23
+ "entropy": 1.7265625,
24
+ "epoch": 0.014084507042253521,
25
+ "grad_norm": 4.28125,
26
+ "learning_rate": 5e-05,
27
+ "loss": 2.184455394744873,
28
+ "mean_token_accuracy": 0.5707964897155762,
29
+ "num_tokens": 5577.0,
30
+ "step": 2
31
+ },
32
+ {
33
+ "entropy": 1.5859375,
34
+ "epoch": 0.02112676056338028,
35
+ "grad_norm": 3.796875,
36
+ "learning_rate": 5e-05,
37
+ "loss": 1.9440301656723022,
38
+ "mean_token_accuracy": 0.6223160624504089,
39
+ "num_tokens": 8426.0,
40
+ "step": 3
41
+ },
42
+ {
43
+ "entropy": 1.75,
44
+ "epoch": 0.028169014084507043,
45
+ "grad_norm": 3.234375,
46
+ "learning_rate": 5e-05,
47
+ "loss": 2.034520149230957,
48
+ "mean_token_accuracy": 0.5993841886520386,
49
+ "num_tokens": 11357.0,
50
+ "step": 4
51
+ },
52
+ {
53
+ "entropy": 1.8984375,
54
+ "epoch": 0.035211267605633804,
55
+ "grad_norm": 3.3125,
56
+ "learning_rate": 5e-05,
57
+ "loss": 2.151127338409424,
58
+ "mean_token_accuracy": 0.563842236995697,
59
+ "num_tokens": 13926.0,
60
+ "step": 5
61
+ },
62
+ {
63
+ "entropy": 1.890625,
64
+ "epoch": 0.04225352112676056,
65
+ "grad_norm": 2.546875,
66
+ "learning_rate": 5e-05,
67
+ "loss": 2.066777229309082,
68
+ "mean_token_accuracy": 0.5754261612892151,
69
+ "num_tokens": 17043.0,
70
+ "step": 6
71
+ },
72
+ {
73
+ "entropy": 2.03125,
74
+ "epoch": 0.04929577464788732,
75
+ "grad_norm": 2.9375,
76
+ "learning_rate": 5e-05,
77
+ "loss": 2.2290213108062744,
78
+ "mean_token_accuracy": 0.5708707571029663,
79
+ "num_tokens": 19612.0,
80
+ "step": 7
81
+ },
82
+ {
83
+ "entropy": 1.8046875,
84
+ "epoch": 0.056338028169014086,
85
+ "grad_norm": 2.59375,
86
+ "learning_rate": 5e-05,
87
+ "loss": 1.9348505735397339,
88
+ "mean_token_accuracy": 0.6066350936889648,
89
+ "num_tokens": 22363.0,
90
+ "step": 8
91
+ },
92
+ {
93
+ "entropy": 1.7734375,
94
+ "epoch": 0.06338028169014084,
95
+ "grad_norm": 2.4375,
96
+ "learning_rate": 5e-05,
97
+ "loss": 1.8786349296569824,
98
+ "mean_token_accuracy": 0.628695011138916,
99
+ "num_tokens": 25145.0,
100
+ "step": 9
101
+ },
102
+ {
103
+ "entropy": 1.8515625,
104
+ "epoch": 0.07042253521126761,
105
+ "grad_norm": 2.296875,
106
+ "learning_rate": 5e-05,
107
+ "loss": 1.9190694093704224,
108
+ "mean_token_accuracy": 0.6125850081443787,
109
+ "num_tokens": 28093.0,
110
+ "step": 10
111
+ },
112
+ {
113
+ "entropy": 1.8515625,
114
+ "epoch": 0.07746478873239436,
115
+ "grad_norm": 2.171875,
116
+ "learning_rate": 5e-05,
117
+ "loss": 1.891284704208374,
118
+ "mean_token_accuracy": 0.6322028040885925,
119
+ "num_tokens": 31138.0,
120
+ "step": 11
121
+ },
122
+ {
123
+ "entropy": 1.953125,
124
+ "epoch": 0.08450704225352113,
125
+ "grad_norm": 2.421875,
126
+ "learning_rate": 5e-05,
127
+ "loss": 1.948248267173767,
128
+ "mean_token_accuracy": 0.6148879528045654,
129
+ "num_tokens": 33779.0,
130
+ "step": 12
131
+ },
132
+ {
133
+ "entropy": 1.9609375,
134
+ "epoch": 0.09154929577464789,
135
+ "grad_norm": 2.671875,
136
+ "learning_rate": 5e-05,
137
+ "loss": 1.968241810798645,
138
+ "mean_token_accuracy": 0.6172575950622559,
139
+ "num_tokens": 36128.0,
140
+ "step": 13
141
+ },
142
+ {
143
+ "entropy": 1.8828125,
144
+ "epoch": 0.09859154929577464,
145
+ "grad_norm": 2.015625,
146
+ "learning_rate": 5e-05,
147
+ "loss": 1.902205228805542,
148
+ "mean_token_accuracy": 0.6156116724014282,
149
+ "num_tokens": 39185.0,
150
+ "step": 14
151
+ },
152
+ {
153
+ "entropy": 1.703125,
154
+ "epoch": 0.1056338028169014,
155
+ "grad_norm": 2.328125,
156
+ "learning_rate": 5e-05,
157
+ "loss": 1.6213911771774292,
158
+ "mean_token_accuracy": 0.6750187277793884,
159
+ "num_tokens": 41867.0,
160
+ "step": 15
161
+ },
162
+ {
163
+ "entropy": 2.015625,
164
+ "epoch": 0.11267605633802817,
165
+ "grad_norm": 2.234375,
166
+ "learning_rate": 5e-05,
167
+ "loss": 1.9176678657531738,
168
+ "mean_token_accuracy": 0.6337976455688477,
169
+ "num_tokens": 44603.0,
170
+ "step": 16
171
+ },
172
+ {
173
+ "entropy": 1.921875,
174
+ "epoch": 0.11971830985915492,
175
+ "grad_norm": 1.921875,
176
+ "learning_rate": 5e-05,
177
+ "loss": 1.8336955308914185,
178
+ "mean_token_accuracy": 0.6507288813591003,
179
+ "num_tokens": 48041.0,
180
+ "step": 17
181
+ },
182
+ {
183
+ "entropy": 1.828125,
184
+ "epoch": 0.1267605633802817,
185
+ "grad_norm": 2.046875,
186
+ "learning_rate": 5e-05,
187
+ "loss": 1.7068480253219604,
188
+ "mean_token_accuracy": 0.6735284924507141,
189
+ "num_tokens": 51158.0,
190
+ "step": 18
191
+ },
192
+ {
193
+ "entropy": 1.7421875,
194
+ "epoch": 0.13380281690140844,
195
+ "grad_norm": 1.8984375,
196
+ "learning_rate": 5e-05,
197
+ "loss": 1.6770858764648438,
198
+ "mean_token_accuracy": 0.6662946343421936,
199
+ "num_tokens": 54750.0,
200
+ "step": 19
201
+ },
202
+ {
203
+ "entropy": 2.109375,
204
+ "epoch": 0.14084507042253522,
205
+ "grad_norm": 2.828125,
206
+ "learning_rate": 5e-05,
207
+ "loss": 1.9946776628494263,
208
+ "mean_token_accuracy": 0.6195476651191711,
209
+ "num_tokens": 57234.0,
210
+ "step": 20
211
+ },
212
+ {
213
+ "entropy": 1.6328125,
214
+ "epoch": 0.14788732394366197,
215
+ "grad_norm": 1.90625,
216
+ "learning_rate": 5e-05,
217
+ "loss": 1.5617338418960571,
218
+ "mean_token_accuracy": 0.6951566934585571,
219
+ "num_tokens": 60752.0,
220
+ "step": 21
221
+ },
222
+ {
223
+ "entropy": 1.78125,
224
+ "epoch": 0.15492957746478872,
225
+ "grad_norm": 2.515625,
226
+ "learning_rate": 5e-05,
227
+ "loss": 1.7242701053619385,
228
+ "mean_token_accuracy": 0.6592110395431519,
229
+ "num_tokens": 63219.0,
230
+ "step": 22
231
+ },
232
+ {
233
+ "entropy": 1.6796875,
234
+ "epoch": 0.1619718309859155,
235
+ "grad_norm": 1.9375,
236
+ "learning_rate": 5e-05,
237
+ "loss": 1.6089009046554565,
238
+ "mean_token_accuracy": 0.6697189807891846,
239
+ "num_tokens": 66394.0,
240
+ "step": 23
241
+ },
242
+ {
243
+ "entropy": 1.9296875,
244
+ "epoch": 0.16901408450704225,
245
+ "grad_norm": 2.125,
246
+ "learning_rate": 5e-05,
247
+ "loss": 1.8391156196594238,
248
+ "mean_token_accuracy": 0.6323254704475403,
249
+ "num_tokens": 69081.0,
250
+ "step": 24
251
+ },
252
+ {
253
+ "entropy": 1.7265625,
254
+ "epoch": 0.176056338028169,
255
+ "grad_norm": 2.15625,
256
+ "learning_rate": 5e-05,
257
+ "loss": 1.6465730667114258,
258
+ "mean_token_accuracy": 0.654959499835968,
259
+ "num_tokens": 71680.0,
260
+ "step": 25
261
+ },
262
+ {
263
+ "entropy": 1.9609375,
264
+ "epoch": 0.18309859154929578,
265
+ "grad_norm": 2.03125,
266
+ "learning_rate": 5e-05,
267
+ "loss": 1.873896598815918,
268
+ "mean_token_accuracy": 0.6338028311729431,
269
+ "num_tokens": 74670.0,
270
+ "step": 26
271
+ },
272
+ {
273
+ "entropy": 1.6875,
274
+ "epoch": 0.19014084507042253,
275
+ "grad_norm": 1.84375,
276
+ "learning_rate": 5e-05,
277
+ "loss": 1.629098653793335,
278
+ "mean_token_accuracy": 0.6646864414215088,
279
+ "num_tokens": 77708.0,
280
+ "step": 27
281
+ },
282
+ {
283
+ "entropy": 1.609375,
284
+ "epoch": 0.19718309859154928,
285
+ "grad_norm": 1.8671875,
286
+ "learning_rate": 5e-05,
287
+ "loss": 1.5465565919876099,
288
+ "mean_token_accuracy": 0.6922129988670349,
289
+ "num_tokens": 80965.0,
290
+ "step": 28
291
+ },
292
+ {
293
+ "entropy": 1.59375,
294
+ "epoch": 0.20422535211267606,
295
+ "grad_norm": 2.140625,
296
+ "learning_rate": 5e-05,
297
+ "loss": 1.5382331609725952,
298
+ "mean_token_accuracy": 0.6933178901672363,
299
+ "num_tokens": 83562.0,
300
+ "step": 29
301
+ },
302
+ {
303
+ "entropy": 1.5390625,
304
+ "epoch": 0.2112676056338028,
305
+ "grad_norm": 1.9921875,
306
+ "learning_rate": 5e-05,
307
+ "loss": 1.4340285062789917,
308
+ "mean_token_accuracy": 0.6944348216056824,
309
+ "num_tokens": 86463.0,
310
+ "step": 30
311
+ },
312
+ {
313
+ "entropy": 1.5,
314
+ "epoch": 0.21830985915492956,
315
+ "grad_norm": 1.953125,
316
+ "learning_rate": 5e-05,
317
+ "loss": 1.41927969455719,
318
+ "mean_token_accuracy": 0.7242607474327087,
319
+ "num_tokens": 89278.0,
320
+ "step": 31
321
+ },
322
+ {
323
+ "entropy": 1.484375,
324
+ "epoch": 0.22535211267605634,
325
+ "grad_norm": 2.328125,
326
+ "learning_rate": 5e-05,
327
+ "loss": 1.395577311515808,
328
+ "mean_token_accuracy": 0.7233359813690186,
329
+ "num_tokens": 91780.0,
330
+ "step": 32
331
+ },
332
+ {
333
+ "entropy": 1.5234375,
334
+ "epoch": 0.2323943661971831,
335
+ "grad_norm": 1.8671875,
336
+ "learning_rate": 5e-05,
337
+ "loss": 1.4273605346679688,
338
+ "mean_token_accuracy": 0.7213010191917419,
339
+ "num_tokens": 94924.0,
340
+ "step": 33
341
+ },
342
+ {
343
+ "entropy": 1.640625,
344
+ "epoch": 0.23943661971830985,
345
+ "grad_norm": 1.9375,
346
+ "learning_rate": 5e-05,
347
+ "loss": 1.549876093864441,
348
+ "mean_token_accuracy": 0.6991525292396545,
349
+ "num_tokens": 98236.0,
350
+ "step": 34
351
+ },
352
+ {
353
+ "entropy": 1.3984375,
354
+ "epoch": 0.24647887323943662,
355
+ "grad_norm": 2.5625,
356
+ "learning_rate": 5e-05,
357
+ "loss": 1.2571226358413696,
358
+ "mean_token_accuracy": 0.7764654159545898,
359
+ "num_tokens": 100530.0,
360
+ "step": 35
361
+ },
362
+ {
363
+ "entropy": 1.484375,
364
+ "epoch": 0.2535211267605634,
365
+ "grad_norm": 1.9921875,
366
+ "learning_rate": 5e-05,
367
+ "loss": 1.430403709411621,
368
+ "mean_token_accuracy": 0.7238532304763794,
369
+ "num_tokens": 103808.0,
370
+ "step": 36
371
+ },
372
+ {
373
+ "entropy": 1.4375,
374
+ "epoch": 0.2605633802816901,
375
+ "grad_norm": 1.9296875,
376
+ "learning_rate": 5e-05,
377
+ "loss": 1.370211124420166,
378
+ "mean_token_accuracy": 0.7603058218955994,
379
+ "num_tokens": 106824.0,
380
+ "step": 37
381
+ },
382
+ {
383
+ "entropy": 1.3046875,
384
+ "epoch": 0.2676056338028169,
385
+ "grad_norm": 1.9921875,
386
+ "learning_rate": 5e-05,
387
+ "loss": 1.160237431526184,
388
+ "mean_token_accuracy": 0.7812739610671997,
389
+ "num_tokens": 109438.0,
390
+ "step": 38
391
+ },
392
+ {
393
+ "entropy": 1.40625,
394
+ "epoch": 0.2746478873239437,
395
+ "grad_norm": 2.265625,
396
+ "learning_rate": 5e-05,
397
+ "loss": 1.3372321128845215,
398
+ "mean_token_accuracy": 0.7477554678916931,
399
+ "num_tokens": 111785.0,
400
+ "step": 39
401
+ },
402
+ {
403
+ "entropy": 1.3671875,
404
+ "epoch": 0.28169014084507044,
405
+ "grad_norm": 1.84375,
406
+ "learning_rate": 5e-05,
407
+ "loss": 1.3203842639923096,
408
+ "mean_token_accuracy": 0.7538297176361084,
409
+ "num_tokens": 114600.0,
410
+ "step": 40
411
+ },
412
+ {
413
+ "entropy": 1.21875,
414
+ "epoch": 0.2887323943661972,
415
+ "grad_norm": 2.203125,
416
+ "learning_rate": 5e-05,
417
+ "loss": 1.1055949926376343,
418
+ "mean_token_accuracy": 0.7860545516014099,
419
+ "num_tokens": 116917.0,
420
+ "step": 41
421
+ },
422
+ {
423
+ "entropy": 1.484375,
424
+ "epoch": 0.29577464788732394,
425
+ "grad_norm": 1.546875,
426
+ "learning_rate": 5e-05,
427
+ "loss": 1.403846025466919,
428
+ "mean_token_accuracy": 0.7451103925704956,
429
+ "num_tokens": 120095.0,
430
+ "step": 42
431
+ },
432
+ {
433
+ "entropy": 1.328125,
434
+ "epoch": 0.3028169014084507,
435
+ "grad_norm": 1.65625,
436
+ "learning_rate": 5e-05,
437
+ "loss": 1.3071074485778809,
438
+ "mean_token_accuracy": 0.7589316964149475,
439
+ "num_tokens": 122986.0,
440
+ "step": 43
441
+ },
442
+ {
443
+ "entropy": 1.3203125,
444
+ "epoch": 0.30985915492957744,
445
+ "grad_norm": 1.8359375,
446
+ "learning_rate": 5e-05,
447
+ "loss": 1.2948389053344727,
448
+ "mean_token_accuracy": 0.7675830125808716,
449
+ "num_tokens": 125795.0,
450
+ "step": 44
451
+ },
452
+ {
453
+ "entropy": 1.3125,
454
+ "epoch": 0.31690140845070425,
455
+ "grad_norm": 1.875,
456
+ "learning_rate": 5e-05,
457
+ "loss": 1.2394049167633057,
458
+ "mean_token_accuracy": 0.7697368264198303,
459
+ "num_tokens": 128235.0,
460
+ "step": 45
461
+ },
462
+ {
463
+ "entropy": 1.3203125,
464
+ "epoch": 0.323943661971831,
465
+ "grad_norm": 1.6796875,
466
+ "learning_rate": 5e-05,
467
+ "loss": 1.3117918968200684,
468
+ "mean_token_accuracy": 0.7587719559669495,
469
+ "num_tokens": 131663.0,
470
+ "step": 46
471
+ },
472
+ {
473
+ "entropy": 1.3515625,
474
+ "epoch": 0.33098591549295775,
475
+ "grad_norm": 1.453125,
476
+ "learning_rate": 5e-05,
477
+ "loss": 1.3100031614303589,
478
+ "mean_token_accuracy": 0.7717799544334412,
479
+ "num_tokens": 134598.0,
480
+ "step": 47
481
+ },
482
+ {
483
+ "entropy": 1.3203125,
484
+ "epoch": 0.3380281690140845,
485
+ "grad_norm": 1.6953125,
486
+ "learning_rate": 5e-05,
487
+ "loss": 1.28191077709198,
488
+ "mean_token_accuracy": 0.7734912037849426,
489
+ "num_tokens": 137224.0,
490
+ "step": 48
491
+ },
492
+ {
493
+ "entropy": 1.3828125,
494
+ "epoch": 0.34507042253521125,
495
+ "grad_norm": 1.515625,
496
+ "learning_rate": 5e-05,
497
+ "loss": 1.3600674867630005,
498
+ "mean_token_accuracy": 0.7438323497772217,
499
+ "num_tokens": 140191.0,
500
+ "step": 49
501
+ },
502
+ {
503
+ "entropy": 1.21875,
504
+ "epoch": 0.352112676056338,
505
+ "grad_norm": 1.46875,
506
+ "learning_rate": 5e-05,
507
+ "loss": 1.1239631175994873,
508
+ "mean_token_accuracy": 0.788614809513092,
509
+ "num_tokens": 142834.0,
510
+ "step": 50
511
+ },
512
+ {
513
+ "entropy": 1.4765625,
514
+ "epoch": 0.3591549295774648,
515
+ "grad_norm": 1.46875,
516
+ "learning_rate": 5e-05,
517
+ "loss": 1.3836950063705444,
518
+ "mean_token_accuracy": 0.7538405060768127,
519
+ "num_tokens": 145576.0,
520
+ "step": 51
521
+ },
522
+ {
523
+ "entropy": 1.1328125,
524
+ "epoch": 0.36619718309859156,
525
+ "grad_norm": 1.59375,
526
+ "learning_rate": 5e-05,
527
+ "loss": 1.1020089387893677,
528
+ "mean_token_accuracy": 0.8136998414993286,
529
+ "num_tokens": 147876.0,
530
+ "step": 52
531
+ },
532
+ {
533
+ "entropy": 1.3671875,
534
+ "epoch": 0.3732394366197183,
535
+ "grad_norm": 1.15625,
536
+ "learning_rate": 5e-05,
537
+ "loss": 1.3127013444900513,
538
+ "mean_token_accuracy": 0.7502166032791138,
539
+ "num_tokens": 151347.0,
540
+ "step": 53
541
+ },
542
+ {
543
+ "entropy": 1.0390625,
544
+ "epoch": 0.38028169014084506,
545
+ "grad_norm": 1.25,
546
+ "learning_rate": 5e-05,
547
+ "loss": 1.0258498191833496,
548
+ "mean_token_accuracy": 0.8231140971183777,
549
+ "num_tokens": 154046.0,
550
+ "step": 54
551
+ },
552
+ {
553
+ "entropy": 1.296875,
554
+ "epoch": 0.3873239436619718,
555
+ "grad_norm": 1.515625,
556
+ "learning_rate": 5e-05,
557
+ "loss": 1.26340913772583,
558
+ "mean_token_accuracy": 0.7880998253822327,
559
+ "num_tokens": 156659.0,
560
+ "step": 55
561
+ },
562
+ {
563
+ "entropy": 1.3828125,
564
+ "epoch": 0.39436619718309857,
565
+ "grad_norm": 1.1484375,
566
+ "learning_rate": 5e-05,
567
+ "loss": 1.3492928743362427,
568
+ "mean_token_accuracy": 0.7417179942131042,
569
+ "num_tokens": 160078.0,
570
+ "step": 56
571
+ },
572
+ {
573
+ "entropy": 1.046875,
574
+ "epoch": 0.4014084507042254,
575
+ "grad_norm": 1.1171875,
576
+ "learning_rate": 5e-05,
577
+ "loss": 1.0268410444259644,
578
+ "mean_token_accuracy": 0.8108739256858826,
579
+ "num_tokens": 163084.0,
580
+ "step": 57
581
+ },
582
+ {
583
+ "entropy": 1.2734375,
584
+ "epoch": 0.4084507042253521,
585
+ "grad_norm": 1.296875,
586
+ "learning_rate": 5e-05,
587
+ "loss": 1.218086838722229,
588
+ "mean_token_accuracy": 0.7687548398971558,
589
+ "num_tokens": 165678.0,
590
+ "step": 58
591
+ },
592
+ {
593
+ "entropy": 1.265625,
594
+ "epoch": 0.4154929577464789,
595
+ "grad_norm": 1.078125,
596
+ "learning_rate": 5e-05,
597
+ "loss": 1.2634363174438477,
598
+ "mean_token_accuracy": 0.7484593987464905,
599
+ "num_tokens": 169256.0,
600
+ "step": 59
601
+ },
602
+ {
603
+ "entropy": 1.046875,
604
+ "epoch": 0.4225352112676056,
605
+ "grad_norm": 1.1796875,
606
+ "learning_rate": 5e-05,
607
+ "loss": 0.9637977480888367,
608
+ "mean_token_accuracy": 0.8200221061706543,
609
+ "num_tokens": 171981.0,
610
+ "step": 60
611
+ },
612
+ {
613
+ "entropy": 1.1015625,
614
+ "epoch": 0.4295774647887324,
615
+ "grad_norm": 1.09375,
616
+ "learning_rate": 5e-05,
617
+ "loss": 1.0381879806518555,
618
+ "mean_token_accuracy": 0.8146411776542664,
619
+ "num_tokens": 174762.0,
620
+ "step": 61
621
+ },
622
+ {
623
+ "entropy": 1.4609375,
624
+ "epoch": 0.43661971830985913,
625
+ "grad_norm": 1.109375,
626
+ "learning_rate": 5e-05,
627
+ "loss": 1.442441701889038,
628
+ "mean_token_accuracy": 0.7236841917037964,
629
+ "num_tokens": 177962.0,
630
+ "step": 62
631
+ },
632
+ {
633
+ "entropy": 0.9453125,
634
+ "epoch": 0.44366197183098594,
635
+ "grad_norm": 1.109375,
636
+ "learning_rate": 5e-05,
637
+ "loss": 0.9214452505111694,
638
+ "mean_token_accuracy": 0.8193620443344116,
639
+ "num_tokens": 180666.0,
640
+ "step": 63
641
+ },
642
+ {
643
+ "entropy": 1.0859375,
644
+ "epoch": 0.4507042253521127,
645
+ "grad_norm": 1.1484375,
646
+ "learning_rate": 5e-05,
647
+ "loss": 1.1097257137298584,
648
+ "mean_token_accuracy": 0.8031823039054871,
649
+ "num_tokens": 183565.0,
650
+ "step": 64
651
+ },
652
+ {
653
+ "entropy": 1.1640625,
654
+ "epoch": 0.45774647887323944,
655
+ "grad_norm": 1.140625,
656
+ "learning_rate": 5e-05,
657
+ "loss": 1.155249834060669,
658
+ "mean_token_accuracy": 0.7887681126594543,
659
+ "num_tokens": 186333.0,
660
+ "step": 65
661
+ },
662
+ {
663
+ "entropy": 0.85546875,
664
+ "epoch": 0.4647887323943662,
665
+ "grad_norm": 1.1953125,
666
+ "learning_rate": 5e-05,
667
+ "loss": 0.8293672800064087,
668
+ "mean_token_accuracy": 0.8543021082878113,
669
+ "num_tokens": 188956.0,
670
+ "step": 66
671
+ },
672
+ {
673
+ "entropy": 0.91015625,
674
+ "epoch": 0.47183098591549294,
675
+ "grad_norm": 1.1171875,
676
+ "learning_rate": 5e-05,
677
+ "loss": 0.894307553768158,
678
+ "mean_token_accuracy": 0.8422175049781799,
679
+ "num_tokens": 191309.0,
680
+ "step": 67
681
+ },
682
+ {
683
+ "entropy": 1.203125,
684
+ "epoch": 0.4788732394366197,
685
+ "grad_norm": 1.0234375,
686
+ "learning_rate": 5e-05,
687
+ "loss": 1.1631497144699097,
688
+ "mean_token_accuracy": 0.7861995100975037,
689
+ "num_tokens": 194114.0,
690
+ "step": 68
691
+ },
692
+ {
693
+ "entropy": 1.328125,
694
+ "epoch": 0.4859154929577465,
695
+ "grad_norm": 1.0390625,
696
+ "learning_rate": 5e-05,
697
+ "loss": 1.2809975147247314,
698
+ "mean_token_accuracy": 0.7543198466300964,
699
+ "num_tokens": 197305.0,
700
+ "step": 69
701
+ },
702
+ {
703
+ "entropy": 1.015625,
704
+ "epoch": 0.49295774647887325,
705
+ "grad_norm": 1.3203125,
706
+ "learning_rate": 5e-05,
707
+ "loss": 1.0155205726623535,
708
+ "mean_token_accuracy": 0.834074079990387,
709
+ "num_tokens": 199338.0,
710
+ "step": 70
711
+ },
712
+ {
713
+ "entropy": 0.83984375,
714
+ "epoch": 0.5,
715
+ "grad_norm": 1.1796875,
716
+ "learning_rate": 5e-05,
717
+ "loss": 0.7589200735092163,
718
+ "mean_token_accuracy": 0.8618420958518982,
719
+ "num_tokens": 201474.0,
720
+ "step": 71
721
+ },
722
+ {
723
+ "entropy": 1.0859375,
724
+ "epoch": 0.5070422535211268,
725
+ "grad_norm": 1.2109375,
726
+ "learning_rate": 5e-05,
727
+ "loss": 1.0090736150741577,
728
+ "mean_token_accuracy": 0.8233413100242615,
729
+ "num_tokens": 203984.0,
730
+ "step": 72
731
+ },
732
+ {
733
+ "entropy": 1.0703125,
734
+ "epoch": 0.5140845070422535,
735
+ "grad_norm": 0.9140625,
736
+ "learning_rate": 5e-05,
737
+ "loss": 1.046358346939087,
738
+ "mean_token_accuracy": 0.802097737789154,
739
+ "num_tokens": 207615.0,
740
+ "step": 73
741
+ },
742
+ {
743
+ "entropy": 1.203125,
744
+ "epoch": 0.5211267605633803,
745
+ "grad_norm": 1.2109375,
746
+ "learning_rate": 5e-05,
747
+ "loss": 1.14384126663208,
748
+ "mean_token_accuracy": 0.7883082628250122,
749
+ "num_tokens": 209881.0,
750
+ "step": 74
751
+ },
752
+ {
753
+ "entropy": 1.015625,
754
+ "epoch": 0.528169014084507,
755
+ "grad_norm": 0.98828125,
756
+ "learning_rate": 5e-05,
757
+ "loss": 0.9863561987876892,
758
+ "mean_token_accuracy": 0.8165745735168457,
759
+ "num_tokens": 212604.0,
760
+ "step": 75
761
+ },
762
+ {
763
+ "entropy": 1.2421875,
764
+ "epoch": 0.5352112676056338,
765
+ "grad_norm": 1.1171875,
766
+ "learning_rate": 5e-05,
767
+ "loss": 1.1881471872329712,
768
+ "mean_token_accuracy": 0.7924298048019409,
769
+ "num_tokens": 215069.0,
770
+ "step": 76
771
+ },
772
+ {
773
+ "entropy": 0.99609375,
774
+ "epoch": 0.5422535211267606,
775
+ "grad_norm": 0.86328125,
776
+ "learning_rate": 5e-05,
777
+ "loss": 0.9455610513687134,
778
+ "mean_token_accuracy": 0.8238698244094849,
779
+ "num_tokens": 217842.0,
780
+ "step": 77
781
+ },
782
+ {
783
+ "entropy": 0.93359375,
784
+ "epoch": 0.5492957746478874,
785
+ "grad_norm": 1.015625,
786
+ "learning_rate": 5e-05,
787
+ "loss": 0.8940377235412598,
788
+ "mean_token_accuracy": 0.8325259685516357,
789
+ "num_tokens": 220740.0,
790
+ "step": 78
791
+ },
792
+ {
793
+ "entropy": 1.078125,
794
+ "epoch": 0.5563380281690141,
795
+ "grad_norm": 1.0390625,
796
+ "learning_rate": 5e-05,
797
+ "loss": 1.072181224822998,
798
+ "mean_token_accuracy": 0.7974197864532471,
799
+ "num_tokens": 223616.0,
800
+ "step": 79
801
+ },
802
+ {
803
+ "entropy": 0.9609375,
804
+ "epoch": 0.5633802816901409,
805
+ "grad_norm": 1.0625,
806
+ "learning_rate": 5e-05,
807
+ "loss": 0.968547523021698,
808
+ "mean_token_accuracy": 0.8254417181015015,
809
+ "num_tokens": 226454.0,
810
+ "step": 80
811
+ },
812
+ {
813
+ "entropy": 1.0625,
814
+ "epoch": 0.5704225352112676,
815
+ "grad_norm": 1.0390625,
816
+ "learning_rate": 5e-05,
817
+ "loss": 1.029323935508728,
818
+ "mean_token_accuracy": 0.8091970086097717,
819
+ "num_tokens": 229376.0,
820
+ "step": 81
821
+ },
822
+ {
823
+ "entropy": 1.296875,
824
+ "epoch": 0.5774647887323944,
825
+ "grad_norm": 1.078125,
826
+ "learning_rate": 5e-05,
827
+ "loss": 1.30299711227417,
828
+ "mean_token_accuracy": 0.7740401029586792,
829
+ "num_tokens": 232327.0,
830
+ "step": 82
831
+ },
832
+ {
833
+ "entropy": 1.34375,
834
+ "epoch": 0.5845070422535211,
835
+ "grad_norm": 1.046875,
836
+ "learning_rate": 5e-05,
837
+ "loss": 1.3241432905197144,
838
+ "mean_token_accuracy": 0.7471368312835693,
839
+ "num_tokens": 235653.0,
840
+ "step": 83
841
+ },
842
+ {
843
+ "entropy": 1.1953125,
844
+ "epoch": 0.5915492957746479,
845
+ "grad_norm": 1.0546875,
846
+ "learning_rate": 5e-05,
847
+ "loss": 1.1841082572937012,
848
+ "mean_token_accuracy": 0.7741320133209229,
849
+ "num_tokens": 238282.0,
850
+ "step": 84
851
+ },
852
+ {
853
+ "entropy": 0.96875,
854
+ "epoch": 0.5985915492957746,
855
+ "grad_norm": 1.0,
856
+ "learning_rate": 5e-05,
857
+ "loss": 0.9051790833473206,
858
+ "mean_token_accuracy": 0.8358089327812195,
859
+ "num_tokens": 240781.0,
860
+ "step": 85
861
+ },
862
+ {
863
+ "entropy": 0.81640625,
864
+ "epoch": 0.6056338028169014,
865
+ "grad_norm": 1.0625,
866
+ "learning_rate": 5e-05,
867
+ "loss": 0.8058979511260986,
868
+ "mean_token_accuracy": 0.8656787872314453,
869
+ "num_tokens": 242881.0,
870
+ "step": 86
871
+ },
872
+ {
873
+ "entropy": 1.0234375,
874
+ "epoch": 0.6126760563380281,
875
+ "grad_norm": 0.89453125,
876
+ "learning_rate": 5e-05,
877
+ "loss": 0.9673476219177246,
878
+ "mean_token_accuracy": 0.8199172616004944,
879
+ "num_tokens": 246032.0,
880
+ "step": 87
881
+ },
882
+ {
883
+ "entropy": 0.9609375,
884
+ "epoch": 0.6197183098591549,
885
+ "grad_norm": 1.2265625,
886
+ "learning_rate": 5e-05,
887
+ "loss": 0.9231598377227783,
888
+ "mean_token_accuracy": 0.833532452583313,
889
+ "num_tokens": 248551.0,
890
+ "step": 88
891
+ },
892
+ {
893
+ "entropy": 0.9921875,
894
+ "epoch": 0.6267605633802817,
895
+ "grad_norm": 1.1015625,
896
+ "learning_rate": 5e-05,
897
+ "loss": 0.998257040977478,
898
+ "mean_token_accuracy": 0.8266341686248779,
899
+ "num_tokens": 251022.0,
900
+ "step": 89
901
+ },
902
+ {
903
+ "entropy": 1.0546875,
904
+ "epoch": 0.6338028169014085,
905
+ "grad_norm": 1.015625,
906
+ "learning_rate": 5e-05,
907
+ "loss": 1.0252176523208618,
908
+ "mean_token_accuracy": 0.8216797709465027,
909
+ "num_tokens": 253447.0,
910
+ "step": 90
911
+ },
912
+ {
913
+ "entropy": 1.1484375,
914
+ "epoch": 0.6408450704225352,
915
+ "grad_norm": 1.0,
916
+ "learning_rate": 5e-05,
917
+ "loss": 1.164228081703186,
918
+ "mean_token_accuracy": 0.7702828645706177,
919
+ "num_tokens": 256672.0,
920
+ "step": 91
921
+ },
922
+ {
923
+ "entropy": 0.77734375,
924
+ "epoch": 0.647887323943662,
925
+ "grad_norm": 0.9609375,
926
+ "learning_rate": 5e-05,
927
+ "loss": 0.7661694288253784,
928
+ "mean_token_accuracy": 0.8448406457901001,
929
+ "num_tokens": 259316.0,
930
+ "step": 92
931
+ },
932
+ {
933
+ "entropy": 1.15625,
934
+ "epoch": 0.6549295774647887,
935
+ "grad_norm": 0.98828125,
936
+ "learning_rate": 5e-05,
937
+ "loss": 1.1309537887573242,
938
+ "mean_token_accuracy": 0.7973990440368652,
939
+ "num_tokens": 262246.0,
940
+ "step": 93
941
+ },
942
+ {
943
+ "entropy": 1.046875,
944
+ "epoch": 0.6619718309859155,
945
+ "grad_norm": 0.9296875,
946
+ "learning_rate": 5e-05,
947
+ "loss": 1.0406370162963867,
948
+ "mean_token_accuracy": 0.8099964261054993,
949
+ "num_tokens": 265075.0,
950
+ "step": 94
951
+ },
952
+ {
953
+ "entropy": 1.0,
954
+ "epoch": 0.6690140845070423,
955
+ "grad_norm": 0.90234375,
956
+ "learning_rate": 5e-05,
957
+ "loss": 0.9478747844696045,
958
+ "mean_token_accuracy": 0.8167044520378113,
959
+ "num_tokens": 267729.0,
960
+ "step": 95
961
+ },
962
+ {
963
+ "entropy": 1.125,
964
+ "epoch": 0.676056338028169,
965
+ "grad_norm": 1.0234375,
966
+ "learning_rate": 5e-05,
967
+ "loss": 1.0806983709335327,
968
+ "mean_token_accuracy": 0.8070116639137268,
969
+ "num_tokens": 270732.0,
970
+ "step": 96
971
+ },
972
+ {
973
+ "entropy": 1.3359375,
974
+ "epoch": 0.6830985915492958,
975
+ "grad_norm": 0.95703125,
976
+ "learning_rate": 5e-05,
977
+ "loss": 1.2827727794647217,
978
+ "mean_token_accuracy": 0.7681026458740234,
979
+ "num_tokens": 274013.0,
980
+ "step": 97
981
+ },
982
+ {
983
+ "entropy": 0.96875,
984
+ "epoch": 0.6901408450704225,
985
+ "grad_norm": 1.1484375,
986
+ "learning_rate": 5e-05,
987
+ "loss": 0.9255345463752747,
988
+ "mean_token_accuracy": 0.820858895778656,
989
+ "num_tokens": 276466.0,
990
+ "step": 98
991
+ },
992
+ {
993
+ "entropy": 0.8828125,
994
+ "epoch": 0.6971830985915493,
995
+ "grad_norm": 0.828125,
996
+ "learning_rate": 5e-05,
997
+ "loss": 0.8368520736694336,
998
+ "mean_token_accuracy": 0.8478841185569763,
999
+ "num_tokens": 279097.0,
1000
+ "step": 99
1001
+ },
1002
+ {
1003
+ "entropy": 1.1875,
1004
+ "epoch": 0.704225352112676,
1005
+ "grad_norm": 0.91796875,
1006
+ "learning_rate": 5e-05,
1007
+ "loss": 1.1672570705413818,
1008
+ "mean_token_accuracy": 0.7689912915229797,
1009
+ "num_tokens": 282317.0,
1010
+ "step": 100
1011
+ },
1012
+ {
1013
+ "entropy": 1.53125,
1014
+ "epoch": 0.7112676056338029,
1015
+ "grad_norm": 1.0625,
1016
+ "learning_rate": 5e-05,
1017
+ "loss": 1.4877268075942993,
1018
+ "mean_token_accuracy": 0.7194092869758606,
1019
+ "num_tokens": 285643.0,
1020
+ "step": 101
1021
+ },
1022
+ {
1023
+ "entropy": 1.0,
1024
+ "epoch": 0.7183098591549296,
1025
+ "grad_norm": 1.0625,
1026
+ "learning_rate": 5e-05,
1027
+ "loss": 0.956112265586853,
1028
+ "mean_token_accuracy": 0.8256269693374634,
1029
+ "num_tokens": 288203.0,
1030
+ "step": 102
1031
+ },
1032
+ {
1033
+ "entropy": 1.1953125,
1034
+ "epoch": 0.7253521126760564,
1035
+ "grad_norm": 1.1328125,
1036
+ "learning_rate": 5e-05,
1037
+ "loss": 1.2514692544937134,
1038
+ "mean_token_accuracy": 0.771497905254364,
1039
+ "num_tokens": 291095.0,
1040
+ "step": 103
1041
+ },
1042
+ {
1043
+ "entropy": 1.2109375,
1044
+ "epoch": 0.7323943661971831,
1045
+ "grad_norm": 0.93359375,
1046
+ "learning_rate": 5e-05,
1047
+ "loss": 1.1472859382629395,
1048
+ "mean_token_accuracy": 0.7850604057312012,
1049
+ "num_tokens": 293834.0,
1050
+ "step": 104
1051
+ },
1052
+ {
1053
+ "entropy": 0.7734375,
1054
+ "epoch": 0.7394366197183099,
1055
+ "grad_norm": 1.28125,
1056
+ "learning_rate": 5e-05,
1057
+ "loss": 0.7254777550697327,
1058
+ "mean_token_accuracy": 0.8632119297981262,
1059
+ "num_tokens": 295984.0,
1060
+ "step": 105
1061
+ },
1062
+ {
1063
+ "entropy": 0.82421875,
1064
+ "epoch": 0.7464788732394366,
1065
+ "grad_norm": 1.078125,
1066
+ "learning_rate": 5e-05,
1067
+ "loss": 0.795278787612915,
1068
+ "mean_token_accuracy": 0.8470132946968079,
1069
+ "num_tokens": 298319.0,
1070
+ "step": 106
1071
+ },
1072
+ {
1073
+ "entropy": 1.09375,
1074
+ "epoch": 0.7535211267605634,
1075
+ "grad_norm": 0.87109375,
1076
+ "learning_rate": 5e-05,
1077
+ "loss": 1.0427790880203247,
1078
+ "mean_token_accuracy": 0.804815411567688,
1079
+ "num_tokens": 301442.0,
1080
+ "step": 107
1081
+ },
1082
+ {
1083
+ "entropy": 1.1171875,
1084
+ "epoch": 0.7605633802816901,
1085
+ "grad_norm": 0.95703125,
1086
+ "learning_rate": 5e-05,
1087
+ "loss": 1.104764699935913,
1088
+ "mean_token_accuracy": 0.8097593188285828,
1089
+ "num_tokens": 304483.0,
1090
+ "step": 108
1091
+ },
1092
+ {
1093
+ "entropy": 0.7421875,
1094
+ "epoch": 0.7676056338028169,
1095
+ "grad_norm": 1.0,
1096
+ "learning_rate": 5e-05,
1097
+ "loss": 0.6636262536048889,
1098
+ "mean_token_accuracy": 0.861122190952301,
1099
+ "num_tokens": 307004.0,
1100
+ "step": 109
1101
+ },
1102
+ {
1103
+ "entropy": 0.97265625,
1104
+ "epoch": 0.7746478873239436,
1105
+ "grad_norm": 0.90234375,
1106
+ "learning_rate": 5e-05,
1107
+ "loss": 0.9813203811645508,
1108
+ "mean_token_accuracy": 0.8114525079727173,
1109
+ "num_tokens": 309876.0,
1110
+ "step": 110
1111
+ },
1112
+ {
1113
+ "entropy": 1.09375,
1114
+ "epoch": 0.7816901408450704,
1115
+ "grad_norm": 1.078125,
1116
+ "learning_rate": 5e-05,
1117
+ "loss": 1.0708268880844116,
1118
+ "mean_token_accuracy": 0.7995486855506897,
1119
+ "num_tokens": 312543.0,
1120
+ "step": 111
1121
+ },
1122
+ {
1123
+ "entropy": 0.953125,
1124
+ "epoch": 0.7887323943661971,
1125
+ "grad_norm": 0.9453125,
1126
+ "learning_rate": 5e-05,
1127
+ "loss": 0.9298059344291687,
1128
+ "mean_token_accuracy": 0.8266475796699524,
1129
+ "num_tokens": 315343.0,
1130
+ "step": 112
1131
+ },
1132
+ {
1133
+ "entropy": 0.93359375,
1134
+ "epoch": 0.795774647887324,
1135
+ "grad_norm": 1.2109375,
1136
+ "learning_rate": 5e-05,
1137
+ "loss": 0.9146865606307983,
1138
+ "mean_token_accuracy": 0.8447837233543396,
1139
+ "num_tokens": 317709.0,
1140
+ "step": 113
1141
+ },
1142
+ {
1143
+ "entropy": 1.0390625,
1144
+ "epoch": 0.8028169014084507,
1145
+ "grad_norm": 1.015625,
1146
+ "learning_rate": 5e-05,
1147
+ "loss": 1.0023632049560547,
1148
+ "mean_token_accuracy": 0.8247303366661072,
1149
+ "num_tokens": 320313.0,
1150
+ "step": 114
1151
+ },
1152
+ {
1153
+ "entropy": 1.0234375,
1154
+ "epoch": 0.8098591549295775,
1155
+ "grad_norm": 0.9375,
1156
+ "learning_rate": 5e-05,
1157
+ "loss": 1.0119502544403076,
1158
+ "mean_token_accuracy": 0.8081619739532471,
1159
+ "num_tokens": 323433.0,
1160
+ "step": 115
1161
+ },
1162
+ {
1163
+ "entropy": 1.1484375,
1164
+ "epoch": 0.8169014084507042,
1165
+ "grad_norm": 1.09375,
1166
+ "learning_rate": 5e-05,
1167
+ "loss": 1.129537582397461,
1168
+ "mean_token_accuracy": 0.7915045619010925,
1169
+ "num_tokens": 326525.0,
1170
+ "step": 116
1171
+ },
1172
+ {
1173
+ "entropy": 0.828125,
1174
+ "epoch": 0.823943661971831,
1175
+ "grad_norm": 0.96875,
1176
+ "learning_rate": 5e-05,
1177
+ "loss": 0.8433165550231934,
1178
+ "mean_token_accuracy": 0.8409850001335144,
1179
+ "num_tokens": 328929.0,
1180
+ "step": 117
1181
+ },
1182
+ {
1183
+ "entropy": 1.0625,
1184
+ "epoch": 0.8309859154929577,
1185
+ "grad_norm": 1.0078125,
1186
+ "learning_rate": 5e-05,
1187
+ "loss": 1.0346664190292358,
1188
+ "mean_token_accuracy": 0.7833219170570374,
1189
+ "num_tokens": 331863.0,
1190
+ "step": 118
1191
+ },
1192
+ {
1193
+ "entropy": 0.98046875,
1194
+ "epoch": 0.8380281690140845,
1195
+ "grad_norm": 1.09375,
1196
+ "learning_rate": 5e-05,
1197
+ "loss": 0.950432300567627,
1198
+ "mean_token_accuracy": 0.8241989612579346,
1199
+ "num_tokens": 334243.0,
1200
+ "step": 119
1201
+ },
1202
+ {
1203
+ "entropy": 1.0546875,
1204
+ "epoch": 0.8450704225352113,
1205
+ "grad_norm": 0.8984375,
1206
+ "learning_rate": 5e-05,
1207
+ "loss": 1.0502727031707764,
1208
+ "mean_token_accuracy": 0.7917791604995728,
1209
+ "num_tokens": 337584.0,
1210
+ "step": 120
1211
+ },
1212
+ {
1213
+ "entropy": 0.89453125,
1214
+ "epoch": 0.852112676056338,
1215
+ "grad_norm": 0.9765625,
1216
+ "learning_rate": 5e-05,
1217
+ "loss": 0.9121181964874268,
1218
+ "mean_token_accuracy": 0.8309713006019592,
1219
+ "num_tokens": 340485.0,
1220
+ "step": 121
1221
+ },
1222
+ {
1223
+ "entropy": 0.88671875,
1224
+ "epoch": 0.8591549295774648,
1225
+ "grad_norm": 1.1328125,
1226
+ "learning_rate": 5e-05,
1227
+ "loss": 0.9219837188720703,
1228
+ "mean_token_accuracy": 0.8140540719032288,
1229
+ "num_tokens": 343268.0,
1230
+ "step": 122
1231
+ },
1232
+ {
1233
+ "entropy": 0.8515625,
1234
+ "epoch": 0.8661971830985915,
1235
+ "grad_norm": 1.1484375,
1236
+ "learning_rate": 5e-05,
1237
+ "loss": 0.7965174317359924,
1238
+ "mean_token_accuracy": 0.8607358932495117,
1239
+ "num_tokens": 345423.0,
1240
+ "step": 123
1241
+ },
1242
+ {
1243
+ "entropy": 0.9765625,
1244
+ "epoch": 0.8732394366197183,
1245
+ "grad_norm": 0.82421875,
1246
+ "learning_rate": 5e-05,
1247
+ "loss": 0.9578317999839783,
1248
+ "mean_token_accuracy": 0.8050633072853088,
1249
+ "num_tokens": 348591.0,
1250
+ "step": 124
1251
+ },
1252
+ {
1253
+ "entropy": 0.953125,
1254
+ "epoch": 0.8802816901408451,
1255
+ "grad_norm": 0.890625,
1256
+ "learning_rate": 5e-05,
1257
+ "loss": 0.9342446327209473,
1258
+ "mean_token_accuracy": 0.8261499404907227,
1259
+ "num_tokens": 351360.0,
1260
+ "step": 125
1261
+ },
1262
+ {
1263
+ "entropy": 1.0859375,
1264
+ "epoch": 0.8873239436619719,
1265
+ "grad_norm": 0.88671875,
1266
+ "learning_rate": 5e-05,
1267
+ "loss": 1.0417184829711914,
1268
+ "mean_token_accuracy": 0.7993496060371399,
1269
+ "num_tokens": 354443.0,
1270
+ "step": 126
1271
+ },
1272
+ {
1273
+ "entropy": 1.1875,
1274
+ "epoch": 0.8943661971830986,
1275
+ "grad_norm": 0.96484375,
1276
+ "learning_rate": 5e-05,
1277
+ "loss": 1.169641137123108,
1278
+ "mean_token_accuracy": 0.789621889591217,
1279
+ "num_tokens": 356937.0,
1280
+ "step": 127
1281
+ },
1282
+ {
1283
+ "entropy": 1.171875,
1284
+ "epoch": 0.9014084507042254,
1285
+ "grad_norm": 1.0546875,
1286
+ "learning_rate": 5e-05,
1287
+ "loss": 1.0926804542541504,
1288
+ "mean_token_accuracy": 0.78143709897995,
1289
+ "num_tokens": 359951.0,
1290
+ "step": 128
1291
+ },
1292
+ {
1293
+ "entropy": 0.90625,
1294
+ "epoch": 0.9084507042253521,
1295
+ "grad_norm": 1.046875,
1296
+ "learning_rate": 5e-05,
1297
+ "loss": 0.8831167817115784,
1298
+ "mean_token_accuracy": 0.8297297358512878,
1299
+ "num_tokens": 362549.0,
1300
+ "step": 129
1301
+ },
1302
+ {
1303
+ "entropy": 1.34375,
1304
+ "epoch": 0.9154929577464789,
1305
+ "grad_norm": 1.1640625,
1306
+ "learning_rate": 5e-05,
1307
+ "loss": 1.2982932329177856,
1308
+ "mean_token_accuracy": 0.7599736452102661,
1309
+ "num_tokens": 365590.0,
1310
+ "step": 130
1311
+ },
1312
+ {
1313
+ "entropy": 0.8515625,
1314
+ "epoch": 0.9225352112676056,
1315
+ "grad_norm": 1.140625,
1316
+ "learning_rate": 5e-05,
1317
+ "loss": 0.7926298975944519,
1318
+ "mean_token_accuracy": 0.8279292583465576,
1319
+ "num_tokens": 368312.0,
1320
+ "step": 131
1321
+ },
1322
+ {
1323
+ "entropy": 0.85546875,
1324
+ "epoch": 0.9295774647887324,
1325
+ "grad_norm": 1.0546875,
1326
+ "learning_rate": 5e-05,
1327
+ "loss": 0.876966655254364,
1328
+ "mean_token_accuracy": 0.8338558077812195,
1329
+ "num_tokens": 370872.0,
1330
+ "step": 132
1331
+ },
1332
+ {
1333
+ "entropy": 0.58203125,
1334
+ "epoch": 0.9366197183098591,
1335
+ "grad_norm": 1.09375,
1336
+ "learning_rate": 5e-05,
1337
+ "loss": 0.5232805609703064,
1338
+ "mean_token_accuracy": 0.9088762998580933,
1339
+ "num_tokens": 372998.0,
1340
+ "step": 133
1341
+ },
1342
+ {
1343
+ "entropy": 1.3125,
1344
+ "epoch": 0.9436619718309859,
1345
+ "grad_norm": 1.0859375,
1346
+ "learning_rate": 5e-05,
1347
+ "loss": 1.2858319282531738,
1348
+ "mean_token_accuracy": 0.764127790927887,
1349
+ "num_tokens": 375855.0,
1350
+ "step": 134
1351
+ },
1352
+ {
1353
+ "entropy": 0.9453125,
1354
+ "epoch": 0.9507042253521126,
1355
+ "grad_norm": 0.8125,
1356
+ "learning_rate": 5e-05,
1357
+ "loss": 0.9115528464317322,
1358
+ "mean_token_accuracy": 0.8201290965080261,
1359
+ "num_tokens": 379271.0,
1360
+ "step": 135
1361
+ },
1362
+ {
1363
+ "entropy": 1.0703125,
1364
+ "epoch": 0.9577464788732394,
1365
+ "grad_norm": 1.3828125,
1366
+ "learning_rate": 5e-05,
1367
+ "loss": 1.03813898563385,
1368
+ "mean_token_accuracy": 0.8119325637817383,
1369
+ "num_tokens": 381592.0,
1370
+ "step": 136
1371
+ },
1372
+ {
1373
+ "entropy": 1.109375,
1374
+ "epoch": 0.9647887323943662,
1375
+ "grad_norm": 0.953125,
1376
+ "learning_rate": 5e-05,
1377
+ "loss": 1.1146811246871948,
1378
+ "mean_token_accuracy": 0.790168285369873,
1379
+ "num_tokens": 384631.0,
1380
+ "step": 137
1381
+ },
1382
+ {
1383
+ "entropy": 1.1640625,
1384
+ "epoch": 0.971830985915493,
1385
+ "grad_norm": 1.0234375,
1386
+ "learning_rate": 5e-05,
1387
+ "loss": 1.173197627067566,
1388
+ "mean_token_accuracy": 0.7781087160110474,
1389
+ "num_tokens": 387325.0,
1390
+ "step": 138
1391
+ },
1392
+ {
1393
+ "entropy": 0.828125,
1394
+ "epoch": 0.9788732394366197,
1395
+ "grad_norm": 1.0546875,
1396
+ "learning_rate": 5e-05,
1397
+ "loss": 0.8895862698554993,
1398
+ "mean_token_accuracy": 0.8376736044883728,
1399
+ "num_tokens": 389637.0,
1400
+ "step": 139
1401
+ },
1402
+ {
1403
+ "entropy": 1.1953125,
1404
+ "epoch": 0.9859154929577465,
1405
+ "grad_norm": 0.8515625,
1406
+ "learning_rate": 5e-05,
1407
+ "loss": 1.2043834924697876,
1408
+ "mean_token_accuracy": 0.7506383061408997,
1409
+ "num_tokens": 393170.0,
1410
+ "step": 140
1411
+ },
1412
+ {
1413
+ "entropy": 0.87109375,
1414
+ "epoch": 0.9929577464788732,
1415
+ "grad_norm": 1.0546875,
1416
+ "learning_rate": 5e-05,
1417
+ "loss": 0.8573941588401794,
1418
+ "mean_token_accuracy": 0.8464516401290894,
1419
+ "num_tokens": 395503.0,
1420
+ "step": 141
1421
+ },
1422
+ {
1423
+ "entropy": 1.078125,
1424
+ "epoch": 1.0,
1425
+ "grad_norm": 0.90625,
1426
+ "learning_rate": 5e-05,
1427
+ "loss": 1.0620708465576172,
1428
+ "mean_token_accuracy": 0.7814034819602966,
1429
+ "num_tokens": 398361.0,
1430
+ "step": 142
1431
+ },
1432
+ {
1433
+ "epoch": 1.0,
1434
+ "eval_entropy": 0.9779188368055556,
1435
+ "eval_loss": 0.9645262956619263,
1436
+ "eval_mean_token_accuracy": 0.8152486599153943,
1437
+ "eval_num_tokens": 398361.0,
1438
+ "eval_runtime": 3.7052,
1439
+ "eval_samples_per_second": 76.65,
1440
+ "eval_steps_per_second": 9.716,
1441
+ "step": 142
1442
+ }
1443
+ ],
1444
+ "logging_steps": 1,
1445
+ "max_steps": 710,
1446
+ "num_input_tokens_seen": 0,
1447
+ "num_train_epochs": 5,
1448
+ "save_steps": 500,
1449
+ "stateful_callbacks": {
1450
+ "TrainerControl": {
1451
+ "args": {
1452
+ "should_epoch_stop": false,
1453
+ "should_evaluate": false,
1454
+ "should_log": false,
1455
+ "should_save": true,
1456
+ "should_training_stop": false
1457
+ },
1458
+ "attributes": {}
1459
+ }
1460
+ },
1461
+ "total_flos": 370240540913664.0,
1462
+ "train_batch_size": 8,
1463
+ "trial_name": null,
1464
+ "trial_params": null
1465
+ }
checkpoint-142/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5fa1d74cfdb570eb6c160e915c5780a404149c8da32b2030eb89b29d13902242
3
+ size 5585
checkpoint-284/chat_template.jinja ADDED
@@ -0,0 +1,6 @@
 
 
 
 
 
 
 
1
+ {% for message in messages %}{% if loop.first and messages[0]['role'] != 'system' %}{{ '<|im_start|>system
2
+ You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|>
3
+ ' }}{% endif %}{{'<|im_start|>' + message['role'] + '
4
+ ' + message['content'] + '<|im_end|>' + '
5
+ '}}{% endfor %}{% if add_generation_prompt %}{{ '<|im_start|>assistant
6
+ ' }}{% endif %}
checkpoint-284/config.json ADDED
@@ -0,0 +1,40 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "LlamaForCausalLM"
4
+ ],
5
+ "attention_bias": false,
6
+ "attention_dropout": 0.0,
7
+ "bos_token_id": 1,
8
+ "dtype": "bfloat16",
9
+ "eos_token_id": 2,
10
+ "head_dim": 64,
11
+ "hidden_act": "silu",
12
+ "hidden_size": 576,
13
+ "initializer_range": 0.041666666666666664,
14
+ "intermediate_size": 1536,
15
+ "is_llama_config": true,
16
+ "max_position_embeddings": 8192,
17
+ "mlp_bias": false,
18
+ "model_type": "llama",
19
+ "num_attention_heads": 9,
20
+ "num_hidden_layers": 30,
21
+ "num_key_value_heads": 3,
22
+ "pad_token_id": 2,
23
+ "pretraining_tp": 1,
24
+ "rms_norm_eps": 1e-05,
25
+ "rope_interleaved": false,
26
+ "rope_parameters": {
27
+ "rope_theta": 100000,
28
+ "rope_type": "default"
29
+ },
30
+ "tie_word_embeddings": true,
31
+ "transformers.js_config": {
32
+ "kv_cache_dtype": {
33
+ "fp16": "float16",
34
+ "q4f16": "float16"
35
+ }
36
+ },
37
+ "transformers_version": "5.2.0",
38
+ "use_cache": false,
39
+ "vocab_size": 49152
40
+ }
checkpoint-284/generation_config.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "_from_model_config": true,
3
+ "bos_token_id": 1,
4
+ "eos_token_id": [
5
+ 2
6
+ ],
7
+ "pad_token_id": 2,
8
+ "transformers_version": "5.2.0"
9
+ }
checkpoint-284/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c61ebca6fe2f9381892b0596de61bd9d50929e0232e6b23a42889fa52a7bc34a
3
+ size 269060552
checkpoint-284/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a8e2011629d8bed3ef560fa11175cac55684c4e12a72634bb24abf767b6c7399
3
+ size 14645
checkpoint-284/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:173f9bcfe6d98de3b547cda3c500547190199c4bb0a20a7f6ab221a288667d8b
3
+ size 1465
checkpoint-284/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
checkpoint-284/tokenizer_config.json ADDED
@@ -0,0 +1,17 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|im_start|>",
5
+ "clean_up_tokenization_spaces": false,
6
+ "eos_token": "<|im_end|>",
7
+ "extra_special_tokens": [
8
+ "<|im_start|>",
9
+ "<|im_end|>"
10
+ ],
11
+ "is_local": true,
12
+ "model_max_length": 8192,
13
+ "pad_token": "<|im_end|>",
14
+ "tokenizer_class": "TokenizersBackend",
15
+ "unk_token": "<|endoftext|>",
16
+ "vocab_size": 49152
17
+ }
checkpoint-284/trainer_state.json ADDED
@@ -0,0 +1,2896 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 2.0,
6
+ "eval_steps": 500,
7
+ "global_step": 284,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "entropy": 1.78125,
14
+ "epoch": 0.007042253521126761,
15
+ "grad_norm": 5.375,
16
+ "learning_rate": 5e-05,
17
+ "loss": 2.342320680618286,
18
+ "mean_token_accuracy": 0.5398398637771606,
19
+ "num_tokens": 2631.0,
20
+ "step": 1
21
+ },
22
+ {
23
+ "entropy": 1.7265625,
24
+ "epoch": 0.014084507042253521,
25
+ "grad_norm": 4.28125,
26
+ "learning_rate": 5e-05,
27
+ "loss": 2.184455394744873,
28
+ "mean_token_accuracy": 0.5707964897155762,
29
+ "num_tokens": 5577.0,
30
+ "step": 2
31
+ },
32
+ {
33
+ "entropy": 1.5859375,
34
+ "epoch": 0.02112676056338028,
35
+ "grad_norm": 3.796875,
36
+ "learning_rate": 5e-05,
37
+ "loss": 1.9440301656723022,
38
+ "mean_token_accuracy": 0.6223160624504089,
39
+ "num_tokens": 8426.0,
40
+ "step": 3
41
+ },
42
+ {
43
+ "entropy": 1.75,
44
+ "epoch": 0.028169014084507043,
45
+ "grad_norm": 3.234375,
46
+ "learning_rate": 5e-05,
47
+ "loss": 2.034520149230957,
48
+ "mean_token_accuracy": 0.5993841886520386,
49
+ "num_tokens": 11357.0,
50
+ "step": 4
51
+ },
52
+ {
53
+ "entropy": 1.8984375,
54
+ "epoch": 0.035211267605633804,
55
+ "grad_norm": 3.3125,
56
+ "learning_rate": 5e-05,
57
+ "loss": 2.151127338409424,
58
+ "mean_token_accuracy": 0.563842236995697,
59
+ "num_tokens": 13926.0,
60
+ "step": 5
61
+ },
62
+ {
63
+ "entropy": 1.890625,
64
+ "epoch": 0.04225352112676056,
65
+ "grad_norm": 2.546875,
66
+ "learning_rate": 5e-05,
67
+ "loss": 2.066777229309082,
68
+ "mean_token_accuracy": 0.5754261612892151,
69
+ "num_tokens": 17043.0,
70
+ "step": 6
71
+ },
72
+ {
73
+ "entropy": 2.03125,
74
+ "epoch": 0.04929577464788732,
75
+ "grad_norm": 2.9375,
76
+ "learning_rate": 5e-05,
77
+ "loss": 2.2290213108062744,
78
+ "mean_token_accuracy": 0.5708707571029663,
79
+ "num_tokens": 19612.0,
80
+ "step": 7
81
+ },
82
+ {
83
+ "entropy": 1.8046875,
84
+ "epoch": 0.056338028169014086,
85
+ "grad_norm": 2.59375,
86
+ "learning_rate": 5e-05,
87
+ "loss": 1.9348505735397339,
88
+ "mean_token_accuracy": 0.6066350936889648,
89
+ "num_tokens": 22363.0,
90
+ "step": 8
91
+ },
92
+ {
93
+ "entropy": 1.7734375,
94
+ "epoch": 0.06338028169014084,
95
+ "grad_norm": 2.4375,
96
+ "learning_rate": 5e-05,
97
+ "loss": 1.8786349296569824,
98
+ "mean_token_accuracy": 0.628695011138916,
99
+ "num_tokens": 25145.0,
100
+ "step": 9
101
+ },
102
+ {
103
+ "entropy": 1.8515625,
104
+ "epoch": 0.07042253521126761,
105
+ "grad_norm": 2.296875,
106
+ "learning_rate": 5e-05,
107
+ "loss": 1.9190694093704224,
108
+ "mean_token_accuracy": 0.6125850081443787,
109
+ "num_tokens": 28093.0,
110
+ "step": 10
111
+ },
112
+ {
113
+ "entropy": 1.8515625,
114
+ "epoch": 0.07746478873239436,
115
+ "grad_norm": 2.171875,
116
+ "learning_rate": 5e-05,
117
+ "loss": 1.891284704208374,
118
+ "mean_token_accuracy": 0.6322028040885925,
119
+ "num_tokens": 31138.0,
120
+ "step": 11
121
+ },
122
+ {
123
+ "entropy": 1.953125,
124
+ "epoch": 0.08450704225352113,
125
+ "grad_norm": 2.421875,
126
+ "learning_rate": 5e-05,
127
+ "loss": 1.948248267173767,
128
+ "mean_token_accuracy": 0.6148879528045654,
129
+ "num_tokens": 33779.0,
130
+ "step": 12
131
+ },
132
+ {
133
+ "entropy": 1.9609375,
134
+ "epoch": 0.09154929577464789,
135
+ "grad_norm": 2.671875,
136
+ "learning_rate": 5e-05,
137
+ "loss": 1.968241810798645,
138
+ "mean_token_accuracy": 0.6172575950622559,
139
+ "num_tokens": 36128.0,
140
+ "step": 13
141
+ },
142
+ {
143
+ "entropy": 1.8828125,
144
+ "epoch": 0.09859154929577464,
145
+ "grad_norm": 2.015625,
146
+ "learning_rate": 5e-05,
147
+ "loss": 1.902205228805542,
148
+ "mean_token_accuracy": 0.6156116724014282,
149
+ "num_tokens": 39185.0,
150
+ "step": 14
151
+ },
152
+ {
153
+ "entropy": 1.703125,
154
+ "epoch": 0.1056338028169014,
155
+ "grad_norm": 2.328125,
156
+ "learning_rate": 5e-05,
157
+ "loss": 1.6213911771774292,
158
+ "mean_token_accuracy": 0.6750187277793884,
159
+ "num_tokens": 41867.0,
160
+ "step": 15
161
+ },
162
+ {
163
+ "entropy": 2.015625,
164
+ "epoch": 0.11267605633802817,
165
+ "grad_norm": 2.234375,
166
+ "learning_rate": 5e-05,
167
+ "loss": 1.9176678657531738,
168
+ "mean_token_accuracy": 0.6337976455688477,
169
+ "num_tokens": 44603.0,
170
+ "step": 16
171
+ },
172
+ {
173
+ "entropy": 1.921875,
174
+ "epoch": 0.11971830985915492,
175
+ "grad_norm": 1.921875,
176
+ "learning_rate": 5e-05,
177
+ "loss": 1.8336955308914185,
178
+ "mean_token_accuracy": 0.6507288813591003,
179
+ "num_tokens": 48041.0,
180
+ "step": 17
181
+ },
182
+ {
183
+ "entropy": 1.828125,
184
+ "epoch": 0.1267605633802817,
185
+ "grad_norm": 2.046875,
186
+ "learning_rate": 5e-05,
187
+ "loss": 1.7068480253219604,
188
+ "mean_token_accuracy": 0.6735284924507141,
189
+ "num_tokens": 51158.0,
190
+ "step": 18
191
+ },
192
+ {
193
+ "entropy": 1.7421875,
194
+ "epoch": 0.13380281690140844,
195
+ "grad_norm": 1.8984375,
196
+ "learning_rate": 5e-05,
197
+ "loss": 1.6770858764648438,
198
+ "mean_token_accuracy": 0.6662946343421936,
199
+ "num_tokens": 54750.0,
200
+ "step": 19
201
+ },
202
+ {
203
+ "entropy": 2.109375,
204
+ "epoch": 0.14084507042253522,
205
+ "grad_norm": 2.828125,
206
+ "learning_rate": 5e-05,
207
+ "loss": 1.9946776628494263,
208
+ "mean_token_accuracy": 0.6195476651191711,
209
+ "num_tokens": 57234.0,
210
+ "step": 20
211
+ },
212
+ {
213
+ "entropy": 1.6328125,
214
+ "epoch": 0.14788732394366197,
215
+ "grad_norm": 1.90625,
216
+ "learning_rate": 5e-05,
217
+ "loss": 1.5617338418960571,
218
+ "mean_token_accuracy": 0.6951566934585571,
219
+ "num_tokens": 60752.0,
220
+ "step": 21
221
+ },
222
+ {
223
+ "entropy": 1.78125,
224
+ "epoch": 0.15492957746478872,
225
+ "grad_norm": 2.515625,
226
+ "learning_rate": 5e-05,
227
+ "loss": 1.7242701053619385,
228
+ "mean_token_accuracy": 0.6592110395431519,
229
+ "num_tokens": 63219.0,
230
+ "step": 22
231
+ },
232
+ {
233
+ "entropy": 1.6796875,
234
+ "epoch": 0.1619718309859155,
235
+ "grad_norm": 1.9375,
236
+ "learning_rate": 5e-05,
237
+ "loss": 1.6089009046554565,
238
+ "mean_token_accuracy": 0.6697189807891846,
239
+ "num_tokens": 66394.0,
240
+ "step": 23
241
+ },
242
+ {
243
+ "entropy": 1.9296875,
244
+ "epoch": 0.16901408450704225,
245
+ "grad_norm": 2.125,
246
+ "learning_rate": 5e-05,
247
+ "loss": 1.8391156196594238,
248
+ "mean_token_accuracy": 0.6323254704475403,
249
+ "num_tokens": 69081.0,
250
+ "step": 24
251
+ },
252
+ {
253
+ "entropy": 1.7265625,
254
+ "epoch": 0.176056338028169,
255
+ "grad_norm": 2.15625,
256
+ "learning_rate": 5e-05,
257
+ "loss": 1.6465730667114258,
258
+ "mean_token_accuracy": 0.654959499835968,
259
+ "num_tokens": 71680.0,
260
+ "step": 25
261
+ },
262
+ {
263
+ "entropy": 1.9609375,
264
+ "epoch": 0.18309859154929578,
265
+ "grad_norm": 2.03125,
266
+ "learning_rate": 5e-05,
267
+ "loss": 1.873896598815918,
268
+ "mean_token_accuracy": 0.6338028311729431,
269
+ "num_tokens": 74670.0,
270
+ "step": 26
271
+ },
272
+ {
273
+ "entropy": 1.6875,
274
+ "epoch": 0.19014084507042253,
275
+ "grad_norm": 1.84375,
276
+ "learning_rate": 5e-05,
277
+ "loss": 1.629098653793335,
278
+ "mean_token_accuracy": 0.6646864414215088,
279
+ "num_tokens": 77708.0,
280
+ "step": 27
281
+ },
282
+ {
283
+ "entropy": 1.609375,
284
+ "epoch": 0.19718309859154928,
285
+ "grad_norm": 1.8671875,
286
+ "learning_rate": 5e-05,
287
+ "loss": 1.5465565919876099,
288
+ "mean_token_accuracy": 0.6922129988670349,
289
+ "num_tokens": 80965.0,
290
+ "step": 28
291
+ },
292
+ {
293
+ "entropy": 1.59375,
294
+ "epoch": 0.20422535211267606,
295
+ "grad_norm": 2.140625,
296
+ "learning_rate": 5e-05,
297
+ "loss": 1.5382331609725952,
298
+ "mean_token_accuracy": 0.6933178901672363,
299
+ "num_tokens": 83562.0,
300
+ "step": 29
301
+ },
302
+ {
303
+ "entropy": 1.5390625,
304
+ "epoch": 0.2112676056338028,
305
+ "grad_norm": 1.9921875,
306
+ "learning_rate": 5e-05,
307
+ "loss": 1.4340285062789917,
308
+ "mean_token_accuracy": 0.6944348216056824,
309
+ "num_tokens": 86463.0,
310
+ "step": 30
311
+ },
312
+ {
313
+ "entropy": 1.5,
314
+ "epoch": 0.21830985915492956,
315
+ "grad_norm": 1.953125,
316
+ "learning_rate": 5e-05,
317
+ "loss": 1.41927969455719,
318
+ "mean_token_accuracy": 0.7242607474327087,
319
+ "num_tokens": 89278.0,
320
+ "step": 31
321
+ },
322
+ {
323
+ "entropy": 1.484375,
324
+ "epoch": 0.22535211267605634,
325
+ "grad_norm": 2.328125,
326
+ "learning_rate": 5e-05,
327
+ "loss": 1.395577311515808,
328
+ "mean_token_accuracy": 0.7233359813690186,
329
+ "num_tokens": 91780.0,
330
+ "step": 32
331
+ },
332
+ {
333
+ "entropy": 1.5234375,
334
+ "epoch": 0.2323943661971831,
335
+ "grad_norm": 1.8671875,
336
+ "learning_rate": 5e-05,
337
+ "loss": 1.4273605346679688,
338
+ "mean_token_accuracy": 0.7213010191917419,
339
+ "num_tokens": 94924.0,
340
+ "step": 33
341
+ },
342
+ {
343
+ "entropy": 1.640625,
344
+ "epoch": 0.23943661971830985,
345
+ "grad_norm": 1.9375,
346
+ "learning_rate": 5e-05,
347
+ "loss": 1.549876093864441,
348
+ "mean_token_accuracy": 0.6991525292396545,
349
+ "num_tokens": 98236.0,
350
+ "step": 34
351
+ },
352
+ {
353
+ "entropy": 1.3984375,
354
+ "epoch": 0.24647887323943662,
355
+ "grad_norm": 2.5625,
356
+ "learning_rate": 5e-05,
357
+ "loss": 1.2571226358413696,
358
+ "mean_token_accuracy": 0.7764654159545898,
359
+ "num_tokens": 100530.0,
360
+ "step": 35
361
+ },
362
+ {
363
+ "entropy": 1.484375,
364
+ "epoch": 0.2535211267605634,
365
+ "grad_norm": 1.9921875,
366
+ "learning_rate": 5e-05,
367
+ "loss": 1.430403709411621,
368
+ "mean_token_accuracy": 0.7238532304763794,
369
+ "num_tokens": 103808.0,
370
+ "step": 36
371
+ },
372
+ {
373
+ "entropy": 1.4375,
374
+ "epoch": 0.2605633802816901,
375
+ "grad_norm": 1.9296875,
376
+ "learning_rate": 5e-05,
377
+ "loss": 1.370211124420166,
378
+ "mean_token_accuracy": 0.7603058218955994,
379
+ "num_tokens": 106824.0,
380
+ "step": 37
381
+ },
382
+ {
383
+ "entropy": 1.3046875,
384
+ "epoch": 0.2676056338028169,
385
+ "grad_norm": 1.9921875,
386
+ "learning_rate": 5e-05,
387
+ "loss": 1.160237431526184,
388
+ "mean_token_accuracy": 0.7812739610671997,
389
+ "num_tokens": 109438.0,
390
+ "step": 38
391
+ },
392
+ {
393
+ "entropy": 1.40625,
394
+ "epoch": 0.2746478873239437,
395
+ "grad_norm": 2.265625,
396
+ "learning_rate": 5e-05,
397
+ "loss": 1.3372321128845215,
398
+ "mean_token_accuracy": 0.7477554678916931,
399
+ "num_tokens": 111785.0,
400
+ "step": 39
401
+ },
402
+ {
403
+ "entropy": 1.3671875,
404
+ "epoch": 0.28169014084507044,
405
+ "grad_norm": 1.84375,
406
+ "learning_rate": 5e-05,
407
+ "loss": 1.3203842639923096,
408
+ "mean_token_accuracy": 0.7538297176361084,
409
+ "num_tokens": 114600.0,
410
+ "step": 40
411
+ },
412
+ {
413
+ "entropy": 1.21875,
414
+ "epoch": 0.2887323943661972,
415
+ "grad_norm": 2.203125,
416
+ "learning_rate": 5e-05,
417
+ "loss": 1.1055949926376343,
418
+ "mean_token_accuracy": 0.7860545516014099,
419
+ "num_tokens": 116917.0,
420
+ "step": 41
421
+ },
422
+ {
423
+ "entropy": 1.484375,
424
+ "epoch": 0.29577464788732394,
425
+ "grad_norm": 1.546875,
426
+ "learning_rate": 5e-05,
427
+ "loss": 1.403846025466919,
428
+ "mean_token_accuracy": 0.7451103925704956,
429
+ "num_tokens": 120095.0,
430
+ "step": 42
431
+ },
432
+ {
433
+ "entropy": 1.328125,
434
+ "epoch": 0.3028169014084507,
435
+ "grad_norm": 1.65625,
436
+ "learning_rate": 5e-05,
437
+ "loss": 1.3071074485778809,
438
+ "mean_token_accuracy": 0.7589316964149475,
439
+ "num_tokens": 122986.0,
440
+ "step": 43
441
+ },
442
+ {
443
+ "entropy": 1.3203125,
444
+ "epoch": 0.30985915492957744,
445
+ "grad_norm": 1.8359375,
446
+ "learning_rate": 5e-05,
447
+ "loss": 1.2948389053344727,
448
+ "mean_token_accuracy": 0.7675830125808716,
449
+ "num_tokens": 125795.0,
450
+ "step": 44
451
+ },
452
+ {
453
+ "entropy": 1.3125,
454
+ "epoch": 0.31690140845070425,
455
+ "grad_norm": 1.875,
456
+ "learning_rate": 5e-05,
457
+ "loss": 1.2394049167633057,
458
+ "mean_token_accuracy": 0.7697368264198303,
459
+ "num_tokens": 128235.0,
460
+ "step": 45
461
+ },
462
+ {
463
+ "entropy": 1.3203125,
464
+ "epoch": 0.323943661971831,
465
+ "grad_norm": 1.6796875,
466
+ "learning_rate": 5e-05,
467
+ "loss": 1.3117918968200684,
468
+ "mean_token_accuracy": 0.7587719559669495,
469
+ "num_tokens": 131663.0,
470
+ "step": 46
471
+ },
472
+ {
473
+ "entropy": 1.3515625,
474
+ "epoch": 0.33098591549295775,
475
+ "grad_norm": 1.453125,
476
+ "learning_rate": 5e-05,
477
+ "loss": 1.3100031614303589,
478
+ "mean_token_accuracy": 0.7717799544334412,
479
+ "num_tokens": 134598.0,
480
+ "step": 47
481
+ },
482
+ {
483
+ "entropy": 1.3203125,
484
+ "epoch": 0.3380281690140845,
485
+ "grad_norm": 1.6953125,
486
+ "learning_rate": 5e-05,
487
+ "loss": 1.28191077709198,
488
+ "mean_token_accuracy": 0.7734912037849426,
489
+ "num_tokens": 137224.0,
490
+ "step": 48
491
+ },
492
+ {
493
+ "entropy": 1.3828125,
494
+ "epoch": 0.34507042253521125,
495
+ "grad_norm": 1.515625,
496
+ "learning_rate": 5e-05,
497
+ "loss": 1.3600674867630005,
498
+ "mean_token_accuracy": 0.7438323497772217,
499
+ "num_tokens": 140191.0,
500
+ "step": 49
501
+ },
502
+ {
503
+ "entropy": 1.21875,
504
+ "epoch": 0.352112676056338,
505
+ "grad_norm": 1.46875,
506
+ "learning_rate": 5e-05,
507
+ "loss": 1.1239631175994873,
508
+ "mean_token_accuracy": 0.788614809513092,
509
+ "num_tokens": 142834.0,
510
+ "step": 50
511
+ },
512
+ {
513
+ "entropy": 1.4765625,
514
+ "epoch": 0.3591549295774648,
515
+ "grad_norm": 1.46875,
516
+ "learning_rate": 5e-05,
517
+ "loss": 1.3836950063705444,
518
+ "mean_token_accuracy": 0.7538405060768127,
519
+ "num_tokens": 145576.0,
520
+ "step": 51
521
+ },
522
+ {
523
+ "entropy": 1.1328125,
524
+ "epoch": 0.36619718309859156,
525
+ "grad_norm": 1.59375,
526
+ "learning_rate": 5e-05,
527
+ "loss": 1.1020089387893677,
528
+ "mean_token_accuracy": 0.8136998414993286,
529
+ "num_tokens": 147876.0,
530
+ "step": 52
531
+ },
532
+ {
533
+ "entropy": 1.3671875,
534
+ "epoch": 0.3732394366197183,
535
+ "grad_norm": 1.15625,
536
+ "learning_rate": 5e-05,
537
+ "loss": 1.3127013444900513,
538
+ "mean_token_accuracy": 0.7502166032791138,
539
+ "num_tokens": 151347.0,
540
+ "step": 53
541
+ },
542
+ {
543
+ "entropy": 1.0390625,
544
+ "epoch": 0.38028169014084506,
545
+ "grad_norm": 1.25,
546
+ "learning_rate": 5e-05,
547
+ "loss": 1.0258498191833496,
548
+ "mean_token_accuracy": 0.8231140971183777,
549
+ "num_tokens": 154046.0,
550
+ "step": 54
551
+ },
552
+ {
553
+ "entropy": 1.296875,
554
+ "epoch": 0.3873239436619718,
555
+ "grad_norm": 1.515625,
556
+ "learning_rate": 5e-05,
557
+ "loss": 1.26340913772583,
558
+ "mean_token_accuracy": 0.7880998253822327,
559
+ "num_tokens": 156659.0,
560
+ "step": 55
561
+ },
562
+ {
563
+ "entropy": 1.3828125,
564
+ "epoch": 0.39436619718309857,
565
+ "grad_norm": 1.1484375,
566
+ "learning_rate": 5e-05,
567
+ "loss": 1.3492928743362427,
568
+ "mean_token_accuracy": 0.7417179942131042,
569
+ "num_tokens": 160078.0,
570
+ "step": 56
571
+ },
572
+ {
573
+ "entropy": 1.046875,
574
+ "epoch": 0.4014084507042254,
575
+ "grad_norm": 1.1171875,
576
+ "learning_rate": 5e-05,
577
+ "loss": 1.0268410444259644,
578
+ "mean_token_accuracy": 0.8108739256858826,
579
+ "num_tokens": 163084.0,
580
+ "step": 57
581
+ },
582
+ {
583
+ "entropy": 1.2734375,
584
+ "epoch": 0.4084507042253521,
585
+ "grad_norm": 1.296875,
586
+ "learning_rate": 5e-05,
587
+ "loss": 1.218086838722229,
588
+ "mean_token_accuracy": 0.7687548398971558,
589
+ "num_tokens": 165678.0,
590
+ "step": 58
591
+ },
592
+ {
593
+ "entropy": 1.265625,
594
+ "epoch": 0.4154929577464789,
595
+ "grad_norm": 1.078125,
596
+ "learning_rate": 5e-05,
597
+ "loss": 1.2634363174438477,
598
+ "mean_token_accuracy": 0.7484593987464905,
599
+ "num_tokens": 169256.0,
600
+ "step": 59
601
+ },
602
+ {
603
+ "entropy": 1.046875,
604
+ "epoch": 0.4225352112676056,
605
+ "grad_norm": 1.1796875,
606
+ "learning_rate": 5e-05,
607
+ "loss": 0.9637977480888367,
608
+ "mean_token_accuracy": 0.8200221061706543,
609
+ "num_tokens": 171981.0,
610
+ "step": 60
611
+ },
612
+ {
613
+ "entropy": 1.1015625,
614
+ "epoch": 0.4295774647887324,
615
+ "grad_norm": 1.09375,
616
+ "learning_rate": 5e-05,
617
+ "loss": 1.0381879806518555,
618
+ "mean_token_accuracy": 0.8146411776542664,
619
+ "num_tokens": 174762.0,
620
+ "step": 61
621
+ },
622
+ {
623
+ "entropy": 1.4609375,
624
+ "epoch": 0.43661971830985913,
625
+ "grad_norm": 1.109375,
626
+ "learning_rate": 5e-05,
627
+ "loss": 1.442441701889038,
628
+ "mean_token_accuracy": 0.7236841917037964,
629
+ "num_tokens": 177962.0,
630
+ "step": 62
631
+ },
632
+ {
633
+ "entropy": 0.9453125,
634
+ "epoch": 0.44366197183098594,
635
+ "grad_norm": 1.109375,
636
+ "learning_rate": 5e-05,
637
+ "loss": 0.9214452505111694,
638
+ "mean_token_accuracy": 0.8193620443344116,
639
+ "num_tokens": 180666.0,
640
+ "step": 63
641
+ },
642
+ {
643
+ "entropy": 1.0859375,
644
+ "epoch": 0.4507042253521127,
645
+ "grad_norm": 1.1484375,
646
+ "learning_rate": 5e-05,
647
+ "loss": 1.1097257137298584,
648
+ "mean_token_accuracy": 0.8031823039054871,
649
+ "num_tokens": 183565.0,
650
+ "step": 64
651
+ },
652
+ {
653
+ "entropy": 1.1640625,
654
+ "epoch": 0.45774647887323944,
655
+ "grad_norm": 1.140625,
656
+ "learning_rate": 5e-05,
657
+ "loss": 1.155249834060669,
658
+ "mean_token_accuracy": 0.7887681126594543,
659
+ "num_tokens": 186333.0,
660
+ "step": 65
661
+ },
662
+ {
663
+ "entropy": 0.85546875,
664
+ "epoch": 0.4647887323943662,
665
+ "grad_norm": 1.1953125,
666
+ "learning_rate": 5e-05,
667
+ "loss": 0.8293672800064087,
668
+ "mean_token_accuracy": 0.8543021082878113,
669
+ "num_tokens": 188956.0,
670
+ "step": 66
671
+ },
672
+ {
673
+ "entropy": 0.91015625,
674
+ "epoch": 0.47183098591549294,
675
+ "grad_norm": 1.1171875,
676
+ "learning_rate": 5e-05,
677
+ "loss": 0.894307553768158,
678
+ "mean_token_accuracy": 0.8422175049781799,
679
+ "num_tokens": 191309.0,
680
+ "step": 67
681
+ },
682
+ {
683
+ "entropy": 1.203125,
684
+ "epoch": 0.4788732394366197,
685
+ "grad_norm": 1.0234375,
686
+ "learning_rate": 5e-05,
687
+ "loss": 1.1631497144699097,
688
+ "mean_token_accuracy": 0.7861995100975037,
689
+ "num_tokens": 194114.0,
690
+ "step": 68
691
+ },
692
+ {
693
+ "entropy": 1.328125,
694
+ "epoch": 0.4859154929577465,
695
+ "grad_norm": 1.0390625,
696
+ "learning_rate": 5e-05,
697
+ "loss": 1.2809975147247314,
698
+ "mean_token_accuracy": 0.7543198466300964,
699
+ "num_tokens": 197305.0,
700
+ "step": 69
701
+ },
702
+ {
703
+ "entropy": 1.015625,
704
+ "epoch": 0.49295774647887325,
705
+ "grad_norm": 1.3203125,
706
+ "learning_rate": 5e-05,
707
+ "loss": 1.0155205726623535,
708
+ "mean_token_accuracy": 0.834074079990387,
709
+ "num_tokens": 199338.0,
710
+ "step": 70
711
+ },
712
+ {
713
+ "entropy": 0.83984375,
714
+ "epoch": 0.5,
715
+ "grad_norm": 1.1796875,
716
+ "learning_rate": 5e-05,
717
+ "loss": 0.7589200735092163,
718
+ "mean_token_accuracy": 0.8618420958518982,
719
+ "num_tokens": 201474.0,
720
+ "step": 71
721
+ },
722
+ {
723
+ "entropy": 1.0859375,
724
+ "epoch": 0.5070422535211268,
725
+ "grad_norm": 1.2109375,
726
+ "learning_rate": 5e-05,
727
+ "loss": 1.0090736150741577,
728
+ "mean_token_accuracy": 0.8233413100242615,
729
+ "num_tokens": 203984.0,
730
+ "step": 72
731
+ },
732
+ {
733
+ "entropy": 1.0703125,
734
+ "epoch": 0.5140845070422535,
735
+ "grad_norm": 0.9140625,
736
+ "learning_rate": 5e-05,
737
+ "loss": 1.046358346939087,
738
+ "mean_token_accuracy": 0.802097737789154,
739
+ "num_tokens": 207615.0,
740
+ "step": 73
741
+ },
742
+ {
743
+ "entropy": 1.203125,
744
+ "epoch": 0.5211267605633803,
745
+ "grad_norm": 1.2109375,
746
+ "learning_rate": 5e-05,
747
+ "loss": 1.14384126663208,
748
+ "mean_token_accuracy": 0.7883082628250122,
749
+ "num_tokens": 209881.0,
750
+ "step": 74
751
+ },
752
+ {
753
+ "entropy": 1.015625,
754
+ "epoch": 0.528169014084507,
755
+ "grad_norm": 0.98828125,
756
+ "learning_rate": 5e-05,
757
+ "loss": 0.9863561987876892,
758
+ "mean_token_accuracy": 0.8165745735168457,
759
+ "num_tokens": 212604.0,
760
+ "step": 75
761
+ },
762
+ {
763
+ "entropy": 1.2421875,
764
+ "epoch": 0.5352112676056338,
765
+ "grad_norm": 1.1171875,
766
+ "learning_rate": 5e-05,
767
+ "loss": 1.1881471872329712,
768
+ "mean_token_accuracy": 0.7924298048019409,
769
+ "num_tokens": 215069.0,
770
+ "step": 76
771
+ },
772
+ {
773
+ "entropy": 0.99609375,
774
+ "epoch": 0.5422535211267606,
775
+ "grad_norm": 0.86328125,
776
+ "learning_rate": 5e-05,
777
+ "loss": 0.9455610513687134,
778
+ "mean_token_accuracy": 0.8238698244094849,
779
+ "num_tokens": 217842.0,
780
+ "step": 77
781
+ },
782
+ {
783
+ "entropy": 0.93359375,
784
+ "epoch": 0.5492957746478874,
785
+ "grad_norm": 1.015625,
786
+ "learning_rate": 5e-05,
787
+ "loss": 0.8940377235412598,
788
+ "mean_token_accuracy": 0.8325259685516357,
789
+ "num_tokens": 220740.0,
790
+ "step": 78
791
+ },
792
+ {
793
+ "entropy": 1.078125,
794
+ "epoch": 0.5563380281690141,
795
+ "grad_norm": 1.0390625,
796
+ "learning_rate": 5e-05,
797
+ "loss": 1.072181224822998,
798
+ "mean_token_accuracy": 0.7974197864532471,
799
+ "num_tokens": 223616.0,
800
+ "step": 79
801
+ },
802
+ {
803
+ "entropy": 0.9609375,
804
+ "epoch": 0.5633802816901409,
805
+ "grad_norm": 1.0625,
806
+ "learning_rate": 5e-05,
807
+ "loss": 0.968547523021698,
808
+ "mean_token_accuracy": 0.8254417181015015,
809
+ "num_tokens": 226454.0,
810
+ "step": 80
811
+ },
812
+ {
813
+ "entropy": 1.0625,
814
+ "epoch": 0.5704225352112676,
815
+ "grad_norm": 1.0390625,
816
+ "learning_rate": 5e-05,
817
+ "loss": 1.029323935508728,
818
+ "mean_token_accuracy": 0.8091970086097717,
819
+ "num_tokens": 229376.0,
820
+ "step": 81
821
+ },
822
+ {
823
+ "entropy": 1.296875,
824
+ "epoch": 0.5774647887323944,
825
+ "grad_norm": 1.078125,
826
+ "learning_rate": 5e-05,
827
+ "loss": 1.30299711227417,
828
+ "mean_token_accuracy": 0.7740401029586792,
829
+ "num_tokens": 232327.0,
830
+ "step": 82
831
+ },
832
+ {
833
+ "entropy": 1.34375,
834
+ "epoch": 0.5845070422535211,
835
+ "grad_norm": 1.046875,
836
+ "learning_rate": 5e-05,
837
+ "loss": 1.3241432905197144,
838
+ "mean_token_accuracy": 0.7471368312835693,
839
+ "num_tokens": 235653.0,
840
+ "step": 83
841
+ },
842
+ {
843
+ "entropy": 1.1953125,
844
+ "epoch": 0.5915492957746479,
845
+ "grad_norm": 1.0546875,
846
+ "learning_rate": 5e-05,
847
+ "loss": 1.1841082572937012,
848
+ "mean_token_accuracy": 0.7741320133209229,
849
+ "num_tokens": 238282.0,
850
+ "step": 84
851
+ },
852
+ {
853
+ "entropy": 0.96875,
854
+ "epoch": 0.5985915492957746,
855
+ "grad_norm": 1.0,
856
+ "learning_rate": 5e-05,
857
+ "loss": 0.9051790833473206,
858
+ "mean_token_accuracy": 0.8358089327812195,
859
+ "num_tokens": 240781.0,
860
+ "step": 85
861
+ },
862
+ {
863
+ "entropy": 0.81640625,
864
+ "epoch": 0.6056338028169014,
865
+ "grad_norm": 1.0625,
866
+ "learning_rate": 5e-05,
867
+ "loss": 0.8058979511260986,
868
+ "mean_token_accuracy": 0.8656787872314453,
869
+ "num_tokens": 242881.0,
870
+ "step": 86
871
+ },
872
+ {
873
+ "entropy": 1.0234375,
874
+ "epoch": 0.6126760563380281,
875
+ "grad_norm": 0.89453125,
876
+ "learning_rate": 5e-05,
877
+ "loss": 0.9673476219177246,
878
+ "mean_token_accuracy": 0.8199172616004944,
879
+ "num_tokens": 246032.0,
880
+ "step": 87
881
+ },
882
+ {
883
+ "entropy": 0.9609375,
884
+ "epoch": 0.6197183098591549,
885
+ "grad_norm": 1.2265625,
886
+ "learning_rate": 5e-05,
887
+ "loss": 0.9231598377227783,
888
+ "mean_token_accuracy": 0.833532452583313,
889
+ "num_tokens": 248551.0,
890
+ "step": 88
891
+ },
892
+ {
893
+ "entropy": 0.9921875,
894
+ "epoch": 0.6267605633802817,
895
+ "grad_norm": 1.1015625,
896
+ "learning_rate": 5e-05,
897
+ "loss": 0.998257040977478,
898
+ "mean_token_accuracy": 0.8266341686248779,
899
+ "num_tokens": 251022.0,
900
+ "step": 89
901
+ },
902
+ {
903
+ "entropy": 1.0546875,
904
+ "epoch": 0.6338028169014085,
905
+ "grad_norm": 1.015625,
906
+ "learning_rate": 5e-05,
907
+ "loss": 1.0252176523208618,
908
+ "mean_token_accuracy": 0.8216797709465027,
909
+ "num_tokens": 253447.0,
910
+ "step": 90
911
+ },
912
+ {
913
+ "entropy": 1.1484375,
914
+ "epoch": 0.6408450704225352,
915
+ "grad_norm": 1.0,
916
+ "learning_rate": 5e-05,
917
+ "loss": 1.164228081703186,
918
+ "mean_token_accuracy": 0.7702828645706177,
919
+ "num_tokens": 256672.0,
920
+ "step": 91
921
+ },
922
+ {
923
+ "entropy": 0.77734375,
924
+ "epoch": 0.647887323943662,
925
+ "grad_norm": 0.9609375,
926
+ "learning_rate": 5e-05,
927
+ "loss": 0.7661694288253784,
928
+ "mean_token_accuracy": 0.8448406457901001,
929
+ "num_tokens": 259316.0,
930
+ "step": 92
931
+ },
932
+ {
933
+ "entropy": 1.15625,
934
+ "epoch": 0.6549295774647887,
935
+ "grad_norm": 0.98828125,
936
+ "learning_rate": 5e-05,
937
+ "loss": 1.1309537887573242,
938
+ "mean_token_accuracy": 0.7973990440368652,
939
+ "num_tokens": 262246.0,
940
+ "step": 93
941
+ },
942
+ {
943
+ "entropy": 1.046875,
944
+ "epoch": 0.6619718309859155,
945
+ "grad_norm": 0.9296875,
946
+ "learning_rate": 5e-05,
947
+ "loss": 1.0406370162963867,
948
+ "mean_token_accuracy": 0.8099964261054993,
949
+ "num_tokens": 265075.0,
950
+ "step": 94
951
+ },
952
+ {
953
+ "entropy": 1.0,
954
+ "epoch": 0.6690140845070423,
955
+ "grad_norm": 0.90234375,
956
+ "learning_rate": 5e-05,
957
+ "loss": 0.9478747844696045,
958
+ "mean_token_accuracy": 0.8167044520378113,
959
+ "num_tokens": 267729.0,
960
+ "step": 95
961
+ },
962
+ {
963
+ "entropy": 1.125,
964
+ "epoch": 0.676056338028169,
965
+ "grad_norm": 1.0234375,
966
+ "learning_rate": 5e-05,
967
+ "loss": 1.0806983709335327,
968
+ "mean_token_accuracy": 0.8070116639137268,
969
+ "num_tokens": 270732.0,
970
+ "step": 96
971
+ },
972
+ {
973
+ "entropy": 1.3359375,
974
+ "epoch": 0.6830985915492958,
975
+ "grad_norm": 0.95703125,
976
+ "learning_rate": 5e-05,
977
+ "loss": 1.2827727794647217,
978
+ "mean_token_accuracy": 0.7681026458740234,
979
+ "num_tokens": 274013.0,
980
+ "step": 97
981
+ },
982
+ {
983
+ "entropy": 0.96875,
984
+ "epoch": 0.6901408450704225,
985
+ "grad_norm": 1.1484375,
986
+ "learning_rate": 5e-05,
987
+ "loss": 0.9255345463752747,
988
+ "mean_token_accuracy": 0.820858895778656,
989
+ "num_tokens": 276466.0,
990
+ "step": 98
991
+ },
992
+ {
993
+ "entropy": 0.8828125,
994
+ "epoch": 0.6971830985915493,
995
+ "grad_norm": 0.828125,
996
+ "learning_rate": 5e-05,
997
+ "loss": 0.8368520736694336,
998
+ "mean_token_accuracy": 0.8478841185569763,
999
+ "num_tokens": 279097.0,
1000
+ "step": 99
1001
+ },
1002
+ {
1003
+ "entropy": 1.1875,
1004
+ "epoch": 0.704225352112676,
1005
+ "grad_norm": 0.91796875,
1006
+ "learning_rate": 5e-05,
1007
+ "loss": 1.1672570705413818,
1008
+ "mean_token_accuracy": 0.7689912915229797,
1009
+ "num_tokens": 282317.0,
1010
+ "step": 100
1011
+ },
1012
+ {
1013
+ "entropy": 1.53125,
1014
+ "epoch": 0.7112676056338029,
1015
+ "grad_norm": 1.0625,
1016
+ "learning_rate": 5e-05,
1017
+ "loss": 1.4877268075942993,
1018
+ "mean_token_accuracy": 0.7194092869758606,
1019
+ "num_tokens": 285643.0,
1020
+ "step": 101
1021
+ },
1022
+ {
1023
+ "entropy": 1.0,
1024
+ "epoch": 0.7183098591549296,
1025
+ "grad_norm": 1.0625,
1026
+ "learning_rate": 5e-05,
1027
+ "loss": 0.956112265586853,
1028
+ "mean_token_accuracy": 0.8256269693374634,
1029
+ "num_tokens": 288203.0,
1030
+ "step": 102
1031
+ },
1032
+ {
1033
+ "entropy": 1.1953125,
1034
+ "epoch": 0.7253521126760564,
1035
+ "grad_norm": 1.1328125,
1036
+ "learning_rate": 5e-05,
1037
+ "loss": 1.2514692544937134,
1038
+ "mean_token_accuracy": 0.771497905254364,
1039
+ "num_tokens": 291095.0,
1040
+ "step": 103
1041
+ },
1042
+ {
1043
+ "entropy": 1.2109375,
1044
+ "epoch": 0.7323943661971831,
1045
+ "grad_norm": 0.93359375,
1046
+ "learning_rate": 5e-05,
1047
+ "loss": 1.1472859382629395,
1048
+ "mean_token_accuracy": 0.7850604057312012,
1049
+ "num_tokens": 293834.0,
1050
+ "step": 104
1051
+ },
1052
+ {
1053
+ "entropy": 0.7734375,
1054
+ "epoch": 0.7394366197183099,
1055
+ "grad_norm": 1.28125,
1056
+ "learning_rate": 5e-05,
1057
+ "loss": 0.7254777550697327,
1058
+ "mean_token_accuracy": 0.8632119297981262,
1059
+ "num_tokens": 295984.0,
1060
+ "step": 105
1061
+ },
1062
+ {
1063
+ "entropy": 0.82421875,
1064
+ "epoch": 0.7464788732394366,
1065
+ "grad_norm": 1.078125,
1066
+ "learning_rate": 5e-05,
1067
+ "loss": 0.795278787612915,
1068
+ "mean_token_accuracy": 0.8470132946968079,
1069
+ "num_tokens": 298319.0,
1070
+ "step": 106
1071
+ },
1072
+ {
1073
+ "entropy": 1.09375,
1074
+ "epoch": 0.7535211267605634,
1075
+ "grad_norm": 0.87109375,
1076
+ "learning_rate": 5e-05,
1077
+ "loss": 1.0427790880203247,
1078
+ "mean_token_accuracy": 0.804815411567688,
1079
+ "num_tokens": 301442.0,
1080
+ "step": 107
1081
+ },
1082
+ {
1083
+ "entropy": 1.1171875,
1084
+ "epoch": 0.7605633802816901,
1085
+ "grad_norm": 0.95703125,
1086
+ "learning_rate": 5e-05,
1087
+ "loss": 1.104764699935913,
1088
+ "mean_token_accuracy": 0.8097593188285828,
1089
+ "num_tokens": 304483.0,
1090
+ "step": 108
1091
+ },
1092
+ {
1093
+ "entropy": 0.7421875,
1094
+ "epoch": 0.7676056338028169,
1095
+ "grad_norm": 1.0,
1096
+ "learning_rate": 5e-05,
1097
+ "loss": 0.6636262536048889,
1098
+ "mean_token_accuracy": 0.861122190952301,
1099
+ "num_tokens": 307004.0,
1100
+ "step": 109
1101
+ },
1102
+ {
1103
+ "entropy": 0.97265625,
1104
+ "epoch": 0.7746478873239436,
1105
+ "grad_norm": 0.90234375,
1106
+ "learning_rate": 5e-05,
1107
+ "loss": 0.9813203811645508,
1108
+ "mean_token_accuracy": 0.8114525079727173,
1109
+ "num_tokens": 309876.0,
1110
+ "step": 110
1111
+ },
1112
+ {
1113
+ "entropy": 1.09375,
1114
+ "epoch": 0.7816901408450704,
1115
+ "grad_norm": 1.078125,
1116
+ "learning_rate": 5e-05,
1117
+ "loss": 1.0708268880844116,
1118
+ "mean_token_accuracy": 0.7995486855506897,
1119
+ "num_tokens": 312543.0,
1120
+ "step": 111
1121
+ },
1122
+ {
1123
+ "entropy": 0.953125,
1124
+ "epoch": 0.7887323943661971,
1125
+ "grad_norm": 0.9453125,
1126
+ "learning_rate": 5e-05,
1127
+ "loss": 0.9298059344291687,
1128
+ "mean_token_accuracy": 0.8266475796699524,
1129
+ "num_tokens": 315343.0,
1130
+ "step": 112
1131
+ },
1132
+ {
1133
+ "entropy": 0.93359375,
1134
+ "epoch": 0.795774647887324,
1135
+ "grad_norm": 1.2109375,
1136
+ "learning_rate": 5e-05,
1137
+ "loss": 0.9146865606307983,
1138
+ "mean_token_accuracy": 0.8447837233543396,
1139
+ "num_tokens": 317709.0,
1140
+ "step": 113
1141
+ },
1142
+ {
1143
+ "entropy": 1.0390625,
1144
+ "epoch": 0.8028169014084507,
1145
+ "grad_norm": 1.015625,
1146
+ "learning_rate": 5e-05,
1147
+ "loss": 1.0023632049560547,
1148
+ "mean_token_accuracy": 0.8247303366661072,
1149
+ "num_tokens": 320313.0,
1150
+ "step": 114
1151
+ },
1152
+ {
1153
+ "entropy": 1.0234375,
1154
+ "epoch": 0.8098591549295775,
1155
+ "grad_norm": 0.9375,
1156
+ "learning_rate": 5e-05,
1157
+ "loss": 1.0119502544403076,
1158
+ "mean_token_accuracy": 0.8081619739532471,
1159
+ "num_tokens": 323433.0,
1160
+ "step": 115
1161
+ },
1162
+ {
1163
+ "entropy": 1.1484375,
1164
+ "epoch": 0.8169014084507042,
1165
+ "grad_norm": 1.09375,
1166
+ "learning_rate": 5e-05,
1167
+ "loss": 1.129537582397461,
1168
+ "mean_token_accuracy": 0.7915045619010925,
1169
+ "num_tokens": 326525.0,
1170
+ "step": 116
1171
+ },
1172
+ {
1173
+ "entropy": 0.828125,
1174
+ "epoch": 0.823943661971831,
1175
+ "grad_norm": 0.96875,
1176
+ "learning_rate": 5e-05,
1177
+ "loss": 0.8433165550231934,
1178
+ "mean_token_accuracy": 0.8409850001335144,
1179
+ "num_tokens": 328929.0,
1180
+ "step": 117
1181
+ },
1182
+ {
1183
+ "entropy": 1.0625,
1184
+ "epoch": 0.8309859154929577,
1185
+ "grad_norm": 1.0078125,
1186
+ "learning_rate": 5e-05,
1187
+ "loss": 1.0346664190292358,
1188
+ "mean_token_accuracy": 0.7833219170570374,
1189
+ "num_tokens": 331863.0,
1190
+ "step": 118
1191
+ },
1192
+ {
1193
+ "entropy": 0.98046875,
1194
+ "epoch": 0.8380281690140845,
1195
+ "grad_norm": 1.09375,
1196
+ "learning_rate": 5e-05,
1197
+ "loss": 0.950432300567627,
1198
+ "mean_token_accuracy": 0.8241989612579346,
1199
+ "num_tokens": 334243.0,
1200
+ "step": 119
1201
+ },
1202
+ {
1203
+ "entropy": 1.0546875,
1204
+ "epoch": 0.8450704225352113,
1205
+ "grad_norm": 0.8984375,
1206
+ "learning_rate": 5e-05,
1207
+ "loss": 1.0502727031707764,
1208
+ "mean_token_accuracy": 0.7917791604995728,
1209
+ "num_tokens": 337584.0,
1210
+ "step": 120
1211
+ },
1212
+ {
1213
+ "entropy": 0.89453125,
1214
+ "epoch": 0.852112676056338,
1215
+ "grad_norm": 0.9765625,
1216
+ "learning_rate": 5e-05,
1217
+ "loss": 0.9121181964874268,
1218
+ "mean_token_accuracy": 0.8309713006019592,
1219
+ "num_tokens": 340485.0,
1220
+ "step": 121
1221
+ },
1222
+ {
1223
+ "entropy": 0.88671875,
1224
+ "epoch": 0.8591549295774648,
1225
+ "grad_norm": 1.1328125,
1226
+ "learning_rate": 5e-05,
1227
+ "loss": 0.9219837188720703,
1228
+ "mean_token_accuracy": 0.8140540719032288,
1229
+ "num_tokens": 343268.0,
1230
+ "step": 122
1231
+ },
1232
+ {
1233
+ "entropy": 0.8515625,
1234
+ "epoch": 0.8661971830985915,
1235
+ "grad_norm": 1.1484375,
1236
+ "learning_rate": 5e-05,
1237
+ "loss": 0.7965174317359924,
1238
+ "mean_token_accuracy": 0.8607358932495117,
1239
+ "num_tokens": 345423.0,
1240
+ "step": 123
1241
+ },
1242
+ {
1243
+ "entropy": 0.9765625,
1244
+ "epoch": 0.8732394366197183,
1245
+ "grad_norm": 0.82421875,
1246
+ "learning_rate": 5e-05,
1247
+ "loss": 0.9578317999839783,
1248
+ "mean_token_accuracy": 0.8050633072853088,
1249
+ "num_tokens": 348591.0,
1250
+ "step": 124
1251
+ },
1252
+ {
1253
+ "entropy": 0.953125,
1254
+ "epoch": 0.8802816901408451,
1255
+ "grad_norm": 0.890625,
1256
+ "learning_rate": 5e-05,
1257
+ "loss": 0.9342446327209473,
1258
+ "mean_token_accuracy": 0.8261499404907227,
1259
+ "num_tokens": 351360.0,
1260
+ "step": 125
1261
+ },
1262
+ {
1263
+ "entropy": 1.0859375,
1264
+ "epoch": 0.8873239436619719,
1265
+ "grad_norm": 0.88671875,
1266
+ "learning_rate": 5e-05,
1267
+ "loss": 1.0417184829711914,
1268
+ "mean_token_accuracy": 0.7993496060371399,
1269
+ "num_tokens": 354443.0,
1270
+ "step": 126
1271
+ },
1272
+ {
1273
+ "entropy": 1.1875,
1274
+ "epoch": 0.8943661971830986,
1275
+ "grad_norm": 0.96484375,
1276
+ "learning_rate": 5e-05,
1277
+ "loss": 1.169641137123108,
1278
+ "mean_token_accuracy": 0.789621889591217,
1279
+ "num_tokens": 356937.0,
1280
+ "step": 127
1281
+ },
1282
+ {
1283
+ "entropy": 1.171875,
1284
+ "epoch": 0.9014084507042254,
1285
+ "grad_norm": 1.0546875,
1286
+ "learning_rate": 5e-05,
1287
+ "loss": 1.0926804542541504,
1288
+ "mean_token_accuracy": 0.78143709897995,
1289
+ "num_tokens": 359951.0,
1290
+ "step": 128
1291
+ },
1292
+ {
1293
+ "entropy": 0.90625,
1294
+ "epoch": 0.9084507042253521,
1295
+ "grad_norm": 1.046875,
1296
+ "learning_rate": 5e-05,
1297
+ "loss": 0.8831167817115784,
1298
+ "mean_token_accuracy": 0.8297297358512878,
1299
+ "num_tokens": 362549.0,
1300
+ "step": 129
1301
+ },
1302
+ {
1303
+ "entropy": 1.34375,
1304
+ "epoch": 0.9154929577464789,
1305
+ "grad_norm": 1.1640625,
1306
+ "learning_rate": 5e-05,
1307
+ "loss": 1.2982932329177856,
1308
+ "mean_token_accuracy": 0.7599736452102661,
1309
+ "num_tokens": 365590.0,
1310
+ "step": 130
1311
+ },
1312
+ {
1313
+ "entropy": 0.8515625,
1314
+ "epoch": 0.9225352112676056,
1315
+ "grad_norm": 1.140625,
1316
+ "learning_rate": 5e-05,
1317
+ "loss": 0.7926298975944519,
1318
+ "mean_token_accuracy": 0.8279292583465576,
1319
+ "num_tokens": 368312.0,
1320
+ "step": 131
1321
+ },
1322
+ {
1323
+ "entropy": 0.85546875,
1324
+ "epoch": 0.9295774647887324,
1325
+ "grad_norm": 1.0546875,
1326
+ "learning_rate": 5e-05,
1327
+ "loss": 0.876966655254364,
1328
+ "mean_token_accuracy": 0.8338558077812195,
1329
+ "num_tokens": 370872.0,
1330
+ "step": 132
1331
+ },
1332
+ {
1333
+ "entropy": 0.58203125,
1334
+ "epoch": 0.9366197183098591,
1335
+ "grad_norm": 1.09375,
1336
+ "learning_rate": 5e-05,
1337
+ "loss": 0.5232805609703064,
1338
+ "mean_token_accuracy": 0.9088762998580933,
1339
+ "num_tokens": 372998.0,
1340
+ "step": 133
1341
+ },
1342
+ {
1343
+ "entropy": 1.3125,
1344
+ "epoch": 0.9436619718309859,
1345
+ "grad_norm": 1.0859375,
1346
+ "learning_rate": 5e-05,
1347
+ "loss": 1.2858319282531738,
1348
+ "mean_token_accuracy": 0.764127790927887,
1349
+ "num_tokens": 375855.0,
1350
+ "step": 134
1351
+ },
1352
+ {
1353
+ "entropy": 0.9453125,
1354
+ "epoch": 0.9507042253521126,
1355
+ "grad_norm": 0.8125,
1356
+ "learning_rate": 5e-05,
1357
+ "loss": 0.9115528464317322,
1358
+ "mean_token_accuracy": 0.8201290965080261,
1359
+ "num_tokens": 379271.0,
1360
+ "step": 135
1361
+ },
1362
+ {
1363
+ "entropy": 1.0703125,
1364
+ "epoch": 0.9577464788732394,
1365
+ "grad_norm": 1.3828125,
1366
+ "learning_rate": 5e-05,
1367
+ "loss": 1.03813898563385,
1368
+ "mean_token_accuracy": 0.8119325637817383,
1369
+ "num_tokens": 381592.0,
1370
+ "step": 136
1371
+ },
1372
+ {
1373
+ "entropy": 1.109375,
1374
+ "epoch": 0.9647887323943662,
1375
+ "grad_norm": 0.953125,
1376
+ "learning_rate": 5e-05,
1377
+ "loss": 1.1146811246871948,
1378
+ "mean_token_accuracy": 0.790168285369873,
1379
+ "num_tokens": 384631.0,
1380
+ "step": 137
1381
+ },
1382
+ {
1383
+ "entropy": 1.1640625,
1384
+ "epoch": 0.971830985915493,
1385
+ "grad_norm": 1.0234375,
1386
+ "learning_rate": 5e-05,
1387
+ "loss": 1.173197627067566,
1388
+ "mean_token_accuracy": 0.7781087160110474,
1389
+ "num_tokens": 387325.0,
1390
+ "step": 138
1391
+ },
1392
+ {
1393
+ "entropy": 0.828125,
1394
+ "epoch": 0.9788732394366197,
1395
+ "grad_norm": 1.0546875,
1396
+ "learning_rate": 5e-05,
1397
+ "loss": 0.8895862698554993,
1398
+ "mean_token_accuracy": 0.8376736044883728,
1399
+ "num_tokens": 389637.0,
1400
+ "step": 139
1401
+ },
1402
+ {
1403
+ "entropy": 1.1953125,
1404
+ "epoch": 0.9859154929577465,
1405
+ "grad_norm": 0.8515625,
1406
+ "learning_rate": 5e-05,
1407
+ "loss": 1.2043834924697876,
1408
+ "mean_token_accuracy": 0.7506383061408997,
1409
+ "num_tokens": 393170.0,
1410
+ "step": 140
1411
+ },
1412
+ {
1413
+ "entropy": 0.87109375,
1414
+ "epoch": 0.9929577464788732,
1415
+ "grad_norm": 1.0546875,
1416
+ "learning_rate": 5e-05,
1417
+ "loss": 0.8573941588401794,
1418
+ "mean_token_accuracy": 0.8464516401290894,
1419
+ "num_tokens": 395503.0,
1420
+ "step": 141
1421
+ },
1422
+ {
1423
+ "entropy": 1.078125,
1424
+ "epoch": 1.0,
1425
+ "grad_norm": 0.90625,
1426
+ "learning_rate": 5e-05,
1427
+ "loss": 1.0620708465576172,
1428
+ "mean_token_accuracy": 0.7814034819602966,
1429
+ "num_tokens": 398361.0,
1430
+ "step": 142
1431
+ },
1432
+ {
1433
+ "epoch": 1.0,
1434
+ "eval_entropy": 0.9779188368055556,
1435
+ "eval_loss": 0.9645262956619263,
1436
+ "eval_mean_token_accuracy": 0.8152486599153943,
1437
+ "eval_num_tokens": 398361.0,
1438
+ "eval_runtime": 3.7052,
1439
+ "eval_samples_per_second": 76.65,
1440
+ "eval_steps_per_second": 9.716,
1441
+ "step": 142
1442
+ },
1443
+ {
1444
+ "entropy": 0.953125,
1445
+ "epoch": 1.0070422535211268,
1446
+ "grad_norm": 1.125,
1447
+ "learning_rate": 5e-05,
1448
+ "loss": 0.9150600433349609,
1449
+ "mean_token_accuracy": 0.8252961039543152,
1450
+ "num_tokens": 400733.0,
1451
+ "step": 143
1452
+ },
1453
+ {
1454
+ "entropy": 0.8046875,
1455
+ "epoch": 1.0140845070422535,
1456
+ "grad_norm": 1.0703125,
1457
+ "learning_rate": 5e-05,
1458
+ "loss": 0.7507684230804443,
1459
+ "mean_token_accuracy": 0.8355586528778076,
1460
+ "num_tokens": 403587.0,
1461
+ "step": 144
1462
+ },
1463
+ {
1464
+ "entropy": 0.7265625,
1465
+ "epoch": 1.0211267605633803,
1466
+ "grad_norm": 0.87890625,
1467
+ "learning_rate": 5e-05,
1468
+ "loss": 0.7104012370109558,
1469
+ "mean_token_accuracy": 0.8799096941947937,
1470
+ "num_tokens": 405810.0,
1471
+ "step": 145
1472
+ },
1473
+ {
1474
+ "entropy": 0.8515625,
1475
+ "epoch": 1.028169014084507,
1476
+ "grad_norm": 0.8671875,
1477
+ "learning_rate": 5e-05,
1478
+ "loss": 0.7941129207611084,
1479
+ "mean_token_accuracy": 0.8590818643569946,
1480
+ "num_tokens": 408323.0,
1481
+ "step": 146
1482
+ },
1483
+ {
1484
+ "entropy": 1.140625,
1485
+ "epoch": 1.0352112676056338,
1486
+ "grad_norm": 0.90625,
1487
+ "learning_rate": 5e-05,
1488
+ "loss": 1.110805630683899,
1489
+ "mean_token_accuracy": 0.7991207242012024,
1490
+ "num_tokens": 411288.0,
1491
+ "step": 147
1492
+ },
1493
+ {
1494
+ "entropy": 1.078125,
1495
+ "epoch": 1.0422535211267605,
1496
+ "grad_norm": 0.875,
1497
+ "learning_rate": 5e-05,
1498
+ "loss": 1.096816897392273,
1499
+ "mean_token_accuracy": 0.793763279914856,
1500
+ "num_tokens": 414118.0,
1501
+ "step": 148
1502
+ },
1503
+ {
1504
+ "entropy": 0.79296875,
1505
+ "epoch": 1.0492957746478873,
1506
+ "grad_norm": 0.96484375,
1507
+ "learning_rate": 5e-05,
1508
+ "loss": 0.7629069089889526,
1509
+ "mean_token_accuracy": 0.8661789894104004,
1510
+ "num_tokens": 416450.0,
1511
+ "step": 149
1512
+ },
1513
+ {
1514
+ "entropy": 0.78125,
1515
+ "epoch": 1.056338028169014,
1516
+ "grad_norm": 1.03125,
1517
+ "learning_rate": 5e-05,
1518
+ "loss": 0.7574359178543091,
1519
+ "mean_token_accuracy": 0.8526899814605713,
1520
+ "num_tokens": 418800.0,
1521
+ "step": 150
1522
+ },
1523
+ {
1524
+ "entropy": 0.71484375,
1525
+ "epoch": 1.0633802816901408,
1526
+ "grad_norm": 0.83984375,
1527
+ "learning_rate": 5e-05,
1528
+ "loss": 0.6598190069198608,
1529
+ "mean_token_accuracy": 0.8710424900054932,
1530
+ "num_tokens": 421398.0,
1531
+ "step": 151
1532
+ },
1533
+ {
1534
+ "entropy": 0.96484375,
1535
+ "epoch": 1.0704225352112675,
1536
+ "grad_norm": 1.078125,
1537
+ "learning_rate": 5e-05,
1538
+ "loss": 0.9846295118331909,
1539
+ "mean_token_accuracy": 0.8020523190498352,
1540
+ "num_tokens": 424427.0,
1541
+ "step": 152
1542
+ },
1543
+ {
1544
+ "entropy": 0.9609375,
1545
+ "epoch": 1.0774647887323943,
1546
+ "grad_norm": 0.9765625,
1547
+ "learning_rate": 5e-05,
1548
+ "loss": 0.982389509677887,
1549
+ "mean_token_accuracy": 0.8070852160453796,
1550
+ "num_tokens": 427286.0,
1551
+ "step": 153
1552
+ },
1553
+ {
1554
+ "entropy": 0.7734375,
1555
+ "epoch": 1.084507042253521,
1556
+ "grad_norm": 0.92578125,
1557
+ "learning_rate": 5e-05,
1558
+ "loss": 0.7500929236412048,
1559
+ "mean_token_accuracy": 0.8648427724838257,
1560
+ "num_tokens": 429743.0,
1561
+ "step": 154
1562
+ },
1563
+ {
1564
+ "entropy": 0.578125,
1565
+ "epoch": 1.091549295774648,
1566
+ "grad_norm": 1.1484375,
1567
+ "learning_rate": 5e-05,
1568
+ "loss": 0.5609915256500244,
1569
+ "mean_token_accuracy": 0.9083379507064819,
1570
+ "num_tokens": 431562.0,
1571
+ "step": 155
1572
+ },
1573
+ {
1574
+ "entropy": 0.84375,
1575
+ "epoch": 1.0985915492957747,
1576
+ "grad_norm": 0.8828125,
1577
+ "learning_rate": 5e-05,
1578
+ "loss": 0.8129755854606628,
1579
+ "mean_token_accuracy": 0.83039790391922,
1580
+ "num_tokens": 434636.0,
1581
+ "step": 156
1582
+ },
1583
+ {
1584
+ "entropy": 1.1640625,
1585
+ "epoch": 1.1056338028169015,
1586
+ "grad_norm": 1.0625,
1587
+ "learning_rate": 5e-05,
1588
+ "loss": 1.157644271850586,
1589
+ "mean_token_accuracy": 0.7780413627624512,
1590
+ "num_tokens": 437595.0,
1591
+ "step": 157
1592
+ },
1593
+ {
1594
+ "entropy": 0.87890625,
1595
+ "epoch": 1.1126760563380282,
1596
+ "grad_norm": 1.046875,
1597
+ "learning_rate": 5e-05,
1598
+ "loss": 0.865077793598175,
1599
+ "mean_token_accuracy": 0.8418839573860168,
1600
+ "num_tokens": 439981.0,
1601
+ "step": 158
1602
+ },
1603
+ {
1604
+ "entropy": 1.078125,
1605
+ "epoch": 1.119718309859155,
1606
+ "grad_norm": 1.03125,
1607
+ "learning_rate": 5e-05,
1608
+ "loss": 1.0671403408050537,
1609
+ "mean_token_accuracy": 0.7895287871360779,
1610
+ "num_tokens": 442854.0,
1611
+ "step": 159
1612
+ },
1613
+ {
1614
+ "entropy": 0.6875,
1615
+ "epoch": 1.1267605633802817,
1616
+ "grad_norm": 0.91796875,
1617
+ "learning_rate": 5e-05,
1618
+ "loss": 0.6512315273284912,
1619
+ "mean_token_accuracy": 0.8766743540763855,
1620
+ "num_tokens": 445027.0,
1621
+ "step": 160
1622
+ },
1623
+ {
1624
+ "entropy": 1.125,
1625
+ "epoch": 1.1338028169014085,
1626
+ "grad_norm": 1.03125,
1627
+ "learning_rate": 5e-05,
1628
+ "loss": 1.1221463680267334,
1629
+ "mean_token_accuracy": 0.7976190447807312,
1630
+ "num_tokens": 447891.0,
1631
+ "step": 161
1632
+ },
1633
+ {
1634
+ "entropy": 0.90625,
1635
+ "epoch": 1.1408450704225352,
1636
+ "grad_norm": 0.90625,
1637
+ "learning_rate": 5e-05,
1638
+ "loss": 0.8583451509475708,
1639
+ "mean_token_accuracy": 0.8390721082687378,
1640
+ "num_tokens": 450658.0,
1641
+ "step": 162
1642
+ },
1643
+ {
1644
+ "entropy": 1.0078125,
1645
+ "epoch": 1.147887323943662,
1646
+ "grad_norm": 0.890625,
1647
+ "learning_rate": 5e-05,
1648
+ "loss": 1.0121499300003052,
1649
+ "mean_token_accuracy": 0.8126649260520935,
1650
+ "num_tokens": 454077.0,
1651
+ "step": 163
1652
+ },
1653
+ {
1654
+ "entropy": 1.109375,
1655
+ "epoch": 1.1549295774647887,
1656
+ "grad_norm": 0.8515625,
1657
+ "learning_rate": 5e-05,
1658
+ "loss": 1.0865602493286133,
1659
+ "mean_token_accuracy": 0.8106972575187683,
1660
+ "num_tokens": 457656.0,
1661
+ "step": 164
1662
+ },
1663
+ {
1664
+ "entropy": 0.83984375,
1665
+ "epoch": 1.1619718309859155,
1666
+ "grad_norm": 0.9296875,
1667
+ "learning_rate": 5e-05,
1668
+ "loss": 0.784701406955719,
1669
+ "mean_token_accuracy": 0.8401400446891785,
1670
+ "num_tokens": 460235.0,
1671
+ "step": 165
1672
+ },
1673
+ {
1674
+ "entropy": 0.87890625,
1675
+ "epoch": 1.1690140845070423,
1676
+ "grad_norm": 0.8984375,
1677
+ "learning_rate": 5e-05,
1678
+ "loss": 0.8821406364440918,
1679
+ "mean_token_accuracy": 0.8279282450675964,
1680
+ "num_tokens": 462864.0,
1681
+ "step": 166
1682
+ },
1683
+ {
1684
+ "entropy": 1.09375,
1685
+ "epoch": 1.176056338028169,
1686
+ "grad_norm": 0.9296875,
1687
+ "learning_rate": 5e-05,
1688
+ "loss": 1.071103572845459,
1689
+ "mean_token_accuracy": 0.7772451043128967,
1690
+ "num_tokens": 466001.0,
1691
+ "step": 167
1692
+ },
1693
+ {
1694
+ "entropy": 1.265625,
1695
+ "epoch": 1.1830985915492958,
1696
+ "grad_norm": 1.0390625,
1697
+ "learning_rate": 5e-05,
1698
+ "loss": 1.2070709466934204,
1699
+ "mean_token_accuracy": 0.7771183848381042,
1700
+ "num_tokens": 469042.0,
1701
+ "step": 168
1702
+ },
1703
+ {
1704
+ "entropy": 1.03125,
1705
+ "epoch": 1.1901408450704225,
1706
+ "grad_norm": 0.84375,
1707
+ "learning_rate": 5e-05,
1708
+ "loss": 0.9974339604377747,
1709
+ "mean_token_accuracy": 0.8080986142158508,
1710
+ "num_tokens": 471890.0,
1711
+ "step": 169
1712
+ },
1713
+ {
1714
+ "entropy": 0.90625,
1715
+ "epoch": 1.1971830985915493,
1716
+ "grad_norm": 0.859375,
1717
+ "learning_rate": 5e-05,
1718
+ "loss": 0.8776722550392151,
1719
+ "mean_token_accuracy": 0.836818516254425,
1720
+ "num_tokens": 474576.0,
1721
+ "step": 170
1722
+ },
1723
+ {
1724
+ "entropy": 0.96484375,
1725
+ "epoch": 1.204225352112676,
1726
+ "grad_norm": 0.90625,
1727
+ "learning_rate": 5e-05,
1728
+ "loss": 0.9560971856117249,
1729
+ "mean_token_accuracy": 0.8277040123939514,
1730
+ "num_tokens": 477219.0,
1731
+ "step": 171
1732
+ },
1733
+ {
1734
+ "entropy": 1.1328125,
1735
+ "epoch": 1.2112676056338028,
1736
+ "grad_norm": 0.9375,
1737
+ "learning_rate": 5e-05,
1738
+ "loss": 1.1175223588943481,
1739
+ "mean_token_accuracy": 0.7786499261856079,
1740
+ "num_tokens": 480412.0,
1741
+ "step": 172
1742
+ },
1743
+ {
1744
+ "entropy": 1.3984375,
1745
+ "epoch": 1.2183098591549295,
1746
+ "grad_norm": 1.109375,
1747
+ "learning_rate": 5e-05,
1748
+ "loss": 1.3395131826400757,
1749
+ "mean_token_accuracy": 0.751716673374176,
1750
+ "num_tokens": 483187.0,
1751
+ "step": 173
1752
+ },
1753
+ {
1754
+ "entropy": 0.9765625,
1755
+ "epoch": 1.2253521126760563,
1756
+ "grad_norm": 0.90234375,
1757
+ "learning_rate": 5e-05,
1758
+ "loss": 1.004224419593811,
1759
+ "mean_token_accuracy": 0.8214024901390076,
1760
+ "num_tokens": 485933.0,
1761
+ "step": 174
1762
+ },
1763
+ {
1764
+ "entropy": 0.890625,
1765
+ "epoch": 1.232394366197183,
1766
+ "grad_norm": 0.7734375,
1767
+ "learning_rate": 5e-05,
1768
+ "loss": 0.8696950674057007,
1769
+ "mean_token_accuracy": 0.8322895169258118,
1770
+ "num_tokens": 488815.0,
1771
+ "step": 175
1772
+ },
1773
+ {
1774
+ "entropy": 1.109375,
1775
+ "epoch": 1.2394366197183098,
1776
+ "grad_norm": 0.91015625,
1777
+ "learning_rate": 5e-05,
1778
+ "loss": 1.0984435081481934,
1779
+ "mean_token_accuracy": 0.7843074202537537,
1780
+ "num_tokens": 491920.0,
1781
+ "step": 176
1782
+ },
1783
+ {
1784
+ "entropy": 0.95703125,
1785
+ "epoch": 1.2464788732394365,
1786
+ "grad_norm": 1.0234375,
1787
+ "learning_rate": 5e-05,
1788
+ "loss": 0.9243696331977844,
1789
+ "mean_token_accuracy": 0.8328244090080261,
1790
+ "num_tokens": 494548.0,
1791
+ "step": 177
1792
+ },
1793
+ {
1794
+ "entropy": 1.1171875,
1795
+ "epoch": 1.2535211267605635,
1796
+ "grad_norm": 1.015625,
1797
+ "learning_rate": 5e-05,
1798
+ "loss": 1.0856032371520996,
1799
+ "mean_token_accuracy": 0.7994632124900818,
1800
+ "num_tokens": 497164.0,
1801
+ "step": 178
1802
+ },
1803
+ {
1804
+ "entropy": 0.8046875,
1805
+ "epoch": 1.26056338028169,
1806
+ "grad_norm": 1.1484375,
1807
+ "learning_rate": 5e-05,
1808
+ "loss": 0.7936550378799438,
1809
+ "mean_token_accuracy": 0.8561053276062012,
1810
+ "num_tokens": 499375.0,
1811
+ "step": 179
1812
+ },
1813
+ {
1814
+ "entropy": 1.3125,
1815
+ "epoch": 1.267605633802817,
1816
+ "grad_norm": 0.94921875,
1817
+ "learning_rate": 5e-05,
1818
+ "loss": 1.3021771907806396,
1819
+ "mean_token_accuracy": 0.7595491409301758,
1820
+ "num_tokens": 502577.0,
1821
+ "step": 180
1822
+ },
1823
+ {
1824
+ "entropy": 0.83203125,
1825
+ "epoch": 1.2746478873239437,
1826
+ "grad_norm": 0.95703125,
1827
+ "learning_rate": 5e-05,
1828
+ "loss": 0.8171048760414124,
1829
+ "mean_token_accuracy": 0.8462969660758972,
1830
+ "num_tokens": 505272.0,
1831
+ "step": 181
1832
+ },
1833
+ {
1834
+ "entropy": 0.55078125,
1835
+ "epoch": 1.2816901408450705,
1836
+ "grad_norm": 1.15625,
1837
+ "learning_rate": 5e-05,
1838
+ "loss": 0.536847710609436,
1839
+ "mean_token_accuracy": 0.9226457476615906,
1840
+ "num_tokens": 507064.0,
1841
+ "step": 182
1842
+ },
1843
+ {
1844
+ "entropy": 1.0078125,
1845
+ "epoch": 1.2887323943661972,
1846
+ "grad_norm": 0.875,
1847
+ "learning_rate": 5e-05,
1848
+ "loss": 1.0221246480941772,
1849
+ "mean_token_accuracy": 0.8086583018302917,
1850
+ "num_tokens": 510098.0,
1851
+ "step": 183
1852
+ },
1853
+ {
1854
+ "entropy": 1.046875,
1855
+ "epoch": 1.295774647887324,
1856
+ "grad_norm": 0.9296875,
1857
+ "learning_rate": 5e-05,
1858
+ "loss": 1.0499778985977173,
1859
+ "mean_token_accuracy": 0.7971059083938599,
1860
+ "num_tokens": 513354.0,
1861
+ "step": 184
1862
+ },
1863
+ {
1864
+ "entropy": 0.91796875,
1865
+ "epoch": 1.3028169014084507,
1866
+ "grad_norm": 0.8046875,
1867
+ "learning_rate": 5e-05,
1868
+ "loss": 0.908235490322113,
1869
+ "mean_token_accuracy": 0.8296475410461426,
1870
+ "num_tokens": 516256.0,
1871
+ "step": 185
1872
+ },
1873
+ {
1874
+ "entropy": 1.0078125,
1875
+ "epoch": 1.3098591549295775,
1876
+ "grad_norm": 0.8359375,
1877
+ "learning_rate": 5e-05,
1878
+ "loss": 0.9736582040786743,
1879
+ "mean_token_accuracy": 0.8088183403015137,
1880
+ "num_tokens": 519099.0,
1881
+ "step": 186
1882
+ },
1883
+ {
1884
+ "entropy": 1.03125,
1885
+ "epoch": 1.3169014084507042,
1886
+ "grad_norm": 0.87890625,
1887
+ "learning_rate": 5e-05,
1888
+ "loss": 0.9836978316307068,
1889
+ "mean_token_accuracy": 0.8049733638763428,
1890
+ "num_tokens": 521922.0,
1891
+ "step": 187
1892
+ },
1893
+ {
1894
+ "entropy": 1.2265625,
1895
+ "epoch": 1.323943661971831,
1896
+ "grad_norm": 0.9609375,
1897
+ "learning_rate": 5e-05,
1898
+ "loss": 1.236617088317871,
1899
+ "mean_token_accuracy": 0.7495366930961609,
1900
+ "num_tokens": 525707.0,
1901
+ "step": 188
1902
+ },
1903
+ {
1904
+ "entropy": 0.7265625,
1905
+ "epoch": 1.3309859154929577,
1906
+ "grad_norm": 0.78515625,
1907
+ "learning_rate": 5e-05,
1908
+ "loss": 0.6896946430206299,
1909
+ "mean_token_accuracy": 0.8708636164665222,
1910
+ "num_tokens": 528193.0,
1911
+ "step": 189
1912
+ },
1913
+ {
1914
+ "entropy": 0.7890625,
1915
+ "epoch": 1.3380281690140845,
1916
+ "grad_norm": 0.8515625,
1917
+ "learning_rate": 5e-05,
1918
+ "loss": 0.7507163286209106,
1919
+ "mean_token_accuracy": 0.852664589881897,
1920
+ "num_tokens": 530753.0,
1921
+ "step": 190
1922
+ },
1923
+ {
1924
+ "entropy": 1.1328125,
1925
+ "epoch": 1.3450704225352113,
1926
+ "grad_norm": 0.859375,
1927
+ "learning_rate": 5e-05,
1928
+ "loss": 1.1465418338775635,
1929
+ "mean_token_accuracy": 0.7830012440681458,
1930
+ "num_tokens": 533973.0,
1931
+ "step": 191
1932
+ },
1933
+ {
1934
+ "entropy": 0.94140625,
1935
+ "epoch": 1.352112676056338,
1936
+ "grad_norm": 0.9140625,
1937
+ "learning_rate": 5e-05,
1938
+ "loss": 0.9713115692138672,
1939
+ "mean_token_accuracy": 0.8168444037437439,
1940
+ "num_tokens": 536700.0,
1941
+ "step": 192
1942
+ },
1943
+ {
1944
+ "entropy": 0.98046875,
1945
+ "epoch": 1.3591549295774648,
1946
+ "grad_norm": 0.91796875,
1947
+ "learning_rate": 5e-05,
1948
+ "loss": 0.9194943904876709,
1949
+ "mean_token_accuracy": 0.812965989112854,
1950
+ "num_tokens": 539793.0,
1951
+ "step": 193
1952
+ },
1953
+ {
1954
+ "entropy": 1.0234375,
1955
+ "epoch": 1.3661971830985915,
1956
+ "grad_norm": 0.83203125,
1957
+ "learning_rate": 5e-05,
1958
+ "loss": 0.9923701286315918,
1959
+ "mean_token_accuracy": 0.8061100840568542,
1960
+ "num_tokens": 543107.0,
1961
+ "step": 194
1962
+ },
1963
+ {
1964
+ "entropy": 0.77734375,
1965
+ "epoch": 1.3732394366197183,
1966
+ "grad_norm": 0.8984375,
1967
+ "learning_rate": 5e-05,
1968
+ "loss": 0.7561295032501221,
1969
+ "mean_token_accuracy": 0.8627303242683411,
1970
+ "num_tokens": 545774.0,
1971
+ "step": 195
1972
+ },
1973
+ {
1974
+ "entropy": 0.9765625,
1975
+ "epoch": 1.380281690140845,
1976
+ "grad_norm": 0.94921875,
1977
+ "learning_rate": 5e-05,
1978
+ "loss": 0.9733573198318481,
1979
+ "mean_token_accuracy": 0.812156617641449,
1980
+ "num_tokens": 548694.0,
1981
+ "step": 196
1982
+ },
1983
+ {
1984
+ "entropy": 0.8203125,
1985
+ "epoch": 1.3873239436619718,
1986
+ "grad_norm": 0.921875,
1987
+ "learning_rate": 5e-05,
1988
+ "loss": 0.7888185977935791,
1989
+ "mean_token_accuracy": 0.8413514494895935,
1990
+ "num_tokens": 551425.0,
1991
+ "step": 197
1992
+ },
1993
+ {
1994
+ "entropy": 1.046875,
1995
+ "epoch": 1.3943661971830985,
1996
+ "grad_norm": 1.1484375,
1997
+ "learning_rate": 5e-05,
1998
+ "loss": 1.1070986986160278,
1999
+ "mean_token_accuracy": 0.8009437918663025,
2000
+ "num_tokens": 553764.0,
2001
+ "step": 198
2002
+ },
2003
+ {
2004
+ "entropy": 1.0,
2005
+ "epoch": 1.4014084507042255,
2006
+ "grad_norm": 0.95703125,
2007
+ "learning_rate": 5e-05,
2008
+ "loss": 0.9817038178443909,
2009
+ "mean_token_accuracy": 0.8074533939361572,
2010
+ "num_tokens": 556348.0,
2011
+ "step": 199
2012
+ },
2013
+ {
2014
+ "entropy": 0.90234375,
2015
+ "epoch": 1.408450704225352,
2016
+ "grad_norm": 0.90234375,
2017
+ "learning_rate": 5e-05,
2018
+ "loss": 0.9156808853149414,
2019
+ "mean_token_accuracy": 0.8265197277069092,
2020
+ "num_tokens": 559169.0,
2021
+ "step": 200
2022
+ },
2023
+ {
2024
+ "entropy": 0.95703125,
2025
+ "epoch": 1.415492957746479,
2026
+ "grad_norm": 0.8984375,
2027
+ "learning_rate": 5e-05,
2028
+ "loss": 0.9911283254623413,
2029
+ "mean_token_accuracy": 0.8143333196640015,
2030
+ "num_tokens": 562177.0,
2031
+ "step": 201
2032
+ },
2033
+ {
2034
+ "entropy": 0.93359375,
2035
+ "epoch": 1.4225352112676055,
2036
+ "grad_norm": 0.85546875,
2037
+ "learning_rate": 5e-05,
2038
+ "loss": 0.9385692477226257,
2039
+ "mean_token_accuracy": 0.8237070441246033,
2040
+ "num_tokens": 564834.0,
2041
+ "step": 202
2042
+ },
2043
+ {
2044
+ "entropy": 0.98828125,
2045
+ "epoch": 1.4295774647887325,
2046
+ "grad_norm": 0.890625,
2047
+ "learning_rate": 5e-05,
2048
+ "loss": 0.9537026882171631,
2049
+ "mean_token_accuracy": 0.8196093440055847,
2050
+ "num_tokens": 567453.0,
2051
+ "step": 203
2052
+ },
2053
+ {
2054
+ "entropy": 1.1171875,
2055
+ "epoch": 1.436619718309859,
2056
+ "grad_norm": 0.88671875,
2057
+ "learning_rate": 5e-05,
2058
+ "loss": 1.1185535192489624,
2059
+ "mean_token_accuracy": 0.7943561673164368,
2060
+ "num_tokens": 570544.0,
2061
+ "step": 204
2062
+ },
2063
+ {
2064
+ "entropy": 1.2265625,
2065
+ "epoch": 1.443661971830986,
2066
+ "grad_norm": 0.87109375,
2067
+ "learning_rate": 5e-05,
2068
+ "loss": 1.2277859449386597,
2069
+ "mean_token_accuracy": 0.7642069458961487,
2070
+ "num_tokens": 574089.0,
2071
+ "step": 205
2072
+ },
2073
+ {
2074
+ "entropy": 1.046875,
2075
+ "epoch": 1.4507042253521127,
2076
+ "grad_norm": 0.92578125,
2077
+ "learning_rate": 5e-05,
2078
+ "loss": 1.0433013439178467,
2079
+ "mean_token_accuracy": 0.7854348421096802,
2080
+ "num_tokens": 577420.0,
2081
+ "step": 206
2082
+ },
2083
+ {
2084
+ "entropy": 0.8515625,
2085
+ "epoch": 1.4577464788732395,
2086
+ "grad_norm": 0.94140625,
2087
+ "learning_rate": 5e-05,
2088
+ "loss": 0.8301782011985779,
2089
+ "mean_token_accuracy": 0.8421682119369507,
2090
+ "num_tokens": 579937.0,
2091
+ "step": 207
2092
+ },
2093
+ {
2094
+ "entropy": 0.78125,
2095
+ "epoch": 1.4647887323943662,
2096
+ "grad_norm": 0.8984375,
2097
+ "learning_rate": 5e-05,
2098
+ "loss": 0.7898612022399902,
2099
+ "mean_token_accuracy": 0.8362168669700623,
2100
+ "num_tokens": 582546.0,
2101
+ "step": 208
2102
+ },
2103
+ {
2104
+ "entropy": 0.984375,
2105
+ "epoch": 1.471830985915493,
2106
+ "grad_norm": 0.82421875,
2107
+ "learning_rate": 5e-05,
2108
+ "loss": 0.9981078505516052,
2109
+ "mean_token_accuracy": 0.8020643591880798,
2110
+ "num_tokens": 585848.0,
2111
+ "step": 209
2112
+ },
2113
+ {
2114
+ "entropy": 0.94140625,
2115
+ "epoch": 1.4788732394366197,
2116
+ "grad_norm": 0.91796875,
2117
+ "learning_rate": 5e-05,
2118
+ "loss": 0.938367486000061,
2119
+ "mean_token_accuracy": 0.8073078393936157,
2120
+ "num_tokens": 588757.0,
2121
+ "step": 210
2122
+ },
2123
+ {
2124
+ "entropy": 0.96484375,
2125
+ "epoch": 1.4859154929577465,
2126
+ "grad_norm": 0.84765625,
2127
+ "learning_rate": 5e-05,
2128
+ "loss": 0.9669017791748047,
2129
+ "mean_token_accuracy": 0.8119603395462036,
2130
+ "num_tokens": 591892.0,
2131
+ "step": 211
2132
+ },
2133
+ {
2134
+ "entropy": 1.390625,
2135
+ "epoch": 1.4929577464788732,
2136
+ "grad_norm": 0.875,
2137
+ "learning_rate": 5e-05,
2138
+ "loss": 1.3462798595428467,
2139
+ "mean_token_accuracy": 0.7334238886833191,
2140
+ "num_tokens": 595580.0,
2141
+ "step": 212
2142
+ },
2143
+ {
2144
+ "entropy": 1.109375,
2145
+ "epoch": 1.5,
2146
+ "grad_norm": 0.93359375,
2147
+ "learning_rate": 5e-05,
2148
+ "loss": 1.068884015083313,
2149
+ "mean_token_accuracy": 0.7929913401603699,
2150
+ "num_tokens": 598356.0,
2151
+ "step": 213
2152
+ },
2153
+ {
2154
+ "entropy": 1.1015625,
2155
+ "epoch": 1.5070422535211268,
2156
+ "grad_norm": 0.87890625,
2157
+ "learning_rate": 5e-05,
2158
+ "loss": 1.0299583673477173,
2159
+ "mean_token_accuracy": 0.7973333597183228,
2160
+ "num_tokens": 601364.0,
2161
+ "step": 214
2162
+ },
2163
+ {
2164
+ "entropy": 1.0703125,
2165
+ "epoch": 1.5140845070422535,
2166
+ "grad_norm": 0.9140625,
2167
+ "learning_rate": 5e-05,
2168
+ "loss": 1.041951298713684,
2169
+ "mean_token_accuracy": 0.8040791153907776,
2170
+ "num_tokens": 604608.0,
2171
+ "step": 215
2172
+ },
2173
+ {
2174
+ "entropy": 0.8671875,
2175
+ "epoch": 1.5211267605633803,
2176
+ "grad_norm": 0.84375,
2177
+ "learning_rate": 5e-05,
2178
+ "loss": 0.8255084156990051,
2179
+ "mean_token_accuracy": 0.8424015045166016,
2180
+ "num_tokens": 607281.0,
2181
+ "step": 216
2182
+ },
2183
+ {
2184
+ "entropy": 0.76953125,
2185
+ "epoch": 1.528169014084507,
2186
+ "grad_norm": 0.89453125,
2187
+ "learning_rate": 5e-05,
2188
+ "loss": 0.7329130172729492,
2189
+ "mean_token_accuracy": 0.8575052618980408,
2190
+ "num_tokens": 609654.0,
2191
+ "step": 217
2192
+ },
2193
+ {
2194
+ "entropy": 1.0859375,
2195
+ "epoch": 1.5352112676056338,
2196
+ "grad_norm": 0.8359375,
2197
+ "learning_rate": 5e-05,
2198
+ "loss": 1.0870012044906616,
2199
+ "mean_token_accuracy": 0.7985919713973999,
2200
+ "num_tokens": 612929.0,
2201
+ "step": 218
2202
+ },
2203
+ {
2204
+ "entropy": 1.2421875,
2205
+ "epoch": 1.5422535211267605,
2206
+ "grad_norm": 0.90234375,
2207
+ "learning_rate": 5e-05,
2208
+ "loss": 1.22186279296875,
2209
+ "mean_token_accuracy": 0.7604916095733643,
2210
+ "num_tokens": 616273.0,
2211
+ "step": 219
2212
+ },
2213
+ {
2214
+ "entropy": 1.1640625,
2215
+ "epoch": 1.5492957746478875,
2216
+ "grad_norm": 0.87109375,
2217
+ "learning_rate": 5e-05,
2218
+ "loss": 1.1332319974899292,
2219
+ "mean_token_accuracy": 0.7764706015586853,
2220
+ "num_tokens": 619426.0,
2221
+ "step": 220
2222
+ },
2223
+ {
2224
+ "entropy": 1.0546875,
2225
+ "epoch": 1.556338028169014,
2226
+ "grad_norm": 0.8984375,
2227
+ "learning_rate": 5e-05,
2228
+ "loss": 1.0643455982208252,
2229
+ "mean_token_accuracy": 0.7792642116546631,
2230
+ "num_tokens": 622424.0,
2231
+ "step": 221
2232
+ },
2233
+ {
2234
+ "entropy": 0.6875,
2235
+ "epoch": 1.563380281690141,
2236
+ "grad_norm": 0.9765625,
2237
+ "learning_rate": 5e-05,
2238
+ "loss": 0.6475476622581482,
2239
+ "mean_token_accuracy": 0.8877917528152466,
2240
+ "num_tokens": 624660.0,
2241
+ "step": 222
2242
+ },
2243
+ {
2244
+ "entropy": 0.7890625,
2245
+ "epoch": 1.5704225352112675,
2246
+ "grad_norm": 1.0390625,
2247
+ "learning_rate": 5e-05,
2248
+ "loss": 0.7602906823158264,
2249
+ "mean_token_accuracy": 0.8367270231246948,
2250
+ "num_tokens": 627320.0,
2251
+ "step": 223
2252
+ },
2253
+ {
2254
+ "entropy": 0.9140625,
2255
+ "epoch": 1.5774647887323945,
2256
+ "grad_norm": 0.8359375,
2257
+ "learning_rate": 5e-05,
2258
+ "loss": 0.89766526222229,
2259
+ "mean_token_accuracy": 0.8361436724662781,
2260
+ "num_tokens": 630056.0,
2261
+ "step": 224
2262
+ },
2263
+ {
2264
+ "entropy": 1.046875,
2265
+ "epoch": 1.584507042253521,
2266
+ "grad_norm": 0.85546875,
2267
+ "learning_rate": 5e-05,
2268
+ "loss": 1.0017104148864746,
2269
+ "mean_token_accuracy": 0.800404965877533,
2270
+ "num_tokens": 633521.0,
2271
+ "step": 225
2272
+ },
2273
+ {
2274
+ "entropy": 0.3515625,
2275
+ "epoch": 1.591549295774648,
2276
+ "grad_norm": 0.9765625,
2277
+ "learning_rate": 5e-05,
2278
+ "loss": 0.3341764211654663,
2279
+ "mean_token_accuracy": 0.9567307829856873,
2280
+ "num_tokens": 635193.0,
2281
+ "step": 226
2282
+ },
2283
+ {
2284
+ "entropy": 0.95703125,
2285
+ "epoch": 1.5985915492957745,
2286
+ "grad_norm": 0.8515625,
2287
+ "learning_rate": 5e-05,
2288
+ "loss": 0.9153825640678406,
2289
+ "mean_token_accuracy": 0.8223153948783875,
2290
+ "num_tokens": 638302.0,
2291
+ "step": 227
2292
+ },
2293
+ {
2294
+ "entropy": 0.98046875,
2295
+ "epoch": 1.6056338028169015,
2296
+ "grad_norm": 0.87890625,
2297
+ "learning_rate": 5e-05,
2298
+ "loss": 0.9880096316337585,
2299
+ "mean_token_accuracy": 0.8147650957107544,
2300
+ "num_tokens": 641290.0,
2301
+ "step": 228
2302
+ },
2303
+ {
2304
+ "entropy": 1.140625,
2305
+ "epoch": 1.612676056338028,
2306
+ "grad_norm": 0.9140625,
2307
+ "learning_rate": 5e-05,
2308
+ "loss": 1.1274977922439575,
2309
+ "mean_token_accuracy": 0.7871226072311401,
2310
+ "num_tokens": 644544.0,
2311
+ "step": 229
2312
+ },
2313
+ {
2314
+ "entropy": 1.3828125,
2315
+ "epoch": 1.619718309859155,
2316
+ "grad_norm": 0.96875,
2317
+ "learning_rate": 5e-05,
2318
+ "loss": 1.3756309747695923,
2319
+ "mean_token_accuracy": 0.7243735790252686,
2320
+ "num_tokens": 648503.0,
2321
+ "step": 230
2322
+ },
2323
+ {
2324
+ "entropy": 1.140625,
2325
+ "epoch": 1.6267605633802817,
2326
+ "grad_norm": 0.94140625,
2327
+ "learning_rate": 5e-05,
2328
+ "loss": 1.129349946975708,
2329
+ "mean_token_accuracy": 0.7763996124267578,
2330
+ "num_tokens": 651494.0,
2331
+ "step": 231
2332
+ },
2333
+ {
2334
+ "entropy": 0.90625,
2335
+ "epoch": 1.6338028169014085,
2336
+ "grad_norm": 1.046875,
2337
+ "learning_rate": 5e-05,
2338
+ "loss": 0.8873183131217957,
2339
+ "mean_token_accuracy": 0.8282105326652527,
2340
+ "num_tokens": 653877.0,
2341
+ "step": 232
2342
+ },
2343
+ {
2344
+ "entropy": 0.80078125,
2345
+ "epoch": 1.6408450704225352,
2346
+ "grad_norm": 0.94921875,
2347
+ "learning_rate": 5e-05,
2348
+ "loss": 0.7888442277908325,
2349
+ "mean_token_accuracy": 0.8641618490219116,
2350
+ "num_tokens": 655961.0,
2351
+ "step": 233
2352
+ },
2353
+ {
2354
+ "entropy": 1.0078125,
2355
+ "epoch": 1.647887323943662,
2356
+ "grad_norm": 0.97265625,
2357
+ "learning_rate": 5e-05,
2358
+ "loss": 0.9641861319541931,
2359
+ "mean_token_accuracy": 0.8236775994300842,
2360
+ "num_tokens": 658351.0,
2361
+ "step": 234
2362
+ },
2363
+ {
2364
+ "entropy": 1.140625,
2365
+ "epoch": 1.6549295774647887,
2366
+ "grad_norm": 0.84765625,
2367
+ "learning_rate": 5e-05,
2368
+ "loss": 1.1152194738388062,
2369
+ "mean_token_accuracy": 0.7858839631080627,
2370
+ "num_tokens": 661306.0,
2371
+ "step": 235
2372
+ },
2373
+ {
2374
+ "entropy": 1.0,
2375
+ "epoch": 1.6619718309859155,
2376
+ "grad_norm": 0.9375,
2377
+ "learning_rate": 5e-05,
2378
+ "loss": 0.9575698971748352,
2379
+ "mean_token_accuracy": 0.8209785223007202,
2380
+ "num_tokens": 664012.0,
2381
+ "step": 236
2382
+ },
2383
+ {
2384
+ "entropy": 0.6171875,
2385
+ "epoch": 1.6690140845070423,
2386
+ "grad_norm": 0.90234375,
2387
+ "learning_rate": 5e-05,
2388
+ "loss": 0.5924875140190125,
2389
+ "mean_token_accuracy": 0.8942976593971252,
2390
+ "num_tokens": 666177.0,
2391
+ "step": 237
2392
+ },
2393
+ {
2394
+ "entropy": 1.1484375,
2395
+ "epoch": 1.676056338028169,
2396
+ "grad_norm": 0.8046875,
2397
+ "learning_rate": 5e-05,
2398
+ "loss": 1.1048884391784668,
2399
+ "mean_token_accuracy": 0.7807835936546326,
2400
+ "num_tokens": 669401.0,
2401
+ "step": 238
2402
+ },
2403
+ {
2404
+ "entropy": 0.8515625,
2405
+ "epoch": 1.6830985915492958,
2406
+ "grad_norm": 0.93359375,
2407
+ "learning_rate": 5e-05,
2408
+ "loss": 0.7597204446792603,
2409
+ "mean_token_accuracy": 0.8503086566925049,
2410
+ "num_tokens": 672001.0,
2411
+ "step": 239
2412
+ },
2413
+ {
2414
+ "entropy": 1.3203125,
2415
+ "epoch": 1.6901408450704225,
2416
+ "grad_norm": 0.9296875,
2417
+ "learning_rate": 5e-05,
2418
+ "loss": 1.3505604267120361,
2419
+ "mean_token_accuracy": 0.7473288774490356,
2420
+ "num_tokens": 675472.0,
2421
+ "step": 240
2422
+ },
2423
+ {
2424
+ "entropy": 1.1328125,
2425
+ "epoch": 1.6971830985915493,
2426
+ "grad_norm": 0.91015625,
2427
+ "learning_rate": 5e-05,
2428
+ "loss": 1.0587811470031738,
2429
+ "mean_token_accuracy": 0.801033616065979,
2430
+ "num_tokens": 678189.0,
2431
+ "step": 241
2432
+ },
2433
+ {
2434
+ "entropy": 0.890625,
2435
+ "epoch": 1.704225352112676,
2436
+ "grad_norm": 1.2421875,
2437
+ "learning_rate": 5e-05,
2438
+ "loss": 0.8245605230331421,
2439
+ "mean_token_accuracy": 0.8421264886856079,
2440
+ "num_tokens": 680680.0,
2441
+ "step": 242
2442
+ },
2443
+ {
2444
+ "entropy": 1.15625,
2445
+ "epoch": 1.711267605633803,
2446
+ "grad_norm": 0.9453125,
2447
+ "learning_rate": 5e-05,
2448
+ "loss": 1.1660860776901245,
2449
+ "mean_token_accuracy": 0.7721893787384033,
2450
+ "num_tokens": 683730.0,
2451
+ "step": 243
2452
+ },
2453
+ {
2454
+ "entropy": 0.87109375,
2455
+ "epoch": 1.7183098591549295,
2456
+ "grad_norm": 0.91796875,
2457
+ "learning_rate": 5e-05,
2458
+ "loss": 0.8355469703674316,
2459
+ "mean_token_accuracy": 0.8397717475891113,
2460
+ "num_tokens": 686016.0,
2461
+ "step": 244
2462
+ },
2463
+ {
2464
+ "entropy": 0.9921875,
2465
+ "epoch": 1.7253521126760565,
2466
+ "grad_norm": 0.9609375,
2467
+ "learning_rate": 5e-05,
2468
+ "loss": 0.9942226409912109,
2469
+ "mean_token_accuracy": 0.8151007890701294,
2470
+ "num_tokens": 688355.0,
2471
+ "step": 245
2472
+ },
2473
+ {
2474
+ "entropy": 0.80078125,
2475
+ "epoch": 1.732394366197183,
2476
+ "grad_norm": 0.90234375,
2477
+ "learning_rate": 5e-05,
2478
+ "loss": 0.748877763748169,
2479
+ "mean_token_accuracy": 0.8575118184089661,
2480
+ "num_tokens": 690686.0,
2481
+ "step": 246
2482
+ },
2483
+ {
2484
+ "entropy": 0.67578125,
2485
+ "epoch": 1.73943661971831,
2486
+ "grad_norm": 0.859375,
2487
+ "learning_rate": 5e-05,
2488
+ "loss": 0.6232599020004272,
2489
+ "mean_token_accuracy": 0.8659953474998474,
2490
+ "num_tokens": 693276.0,
2491
+ "step": 247
2492
+ },
2493
+ {
2494
+ "entropy": 0.89453125,
2495
+ "epoch": 1.7464788732394365,
2496
+ "grad_norm": 0.84375,
2497
+ "learning_rate": 5e-05,
2498
+ "loss": 0.8559207916259766,
2499
+ "mean_token_accuracy": 0.8167107105255127,
2500
+ "num_tokens": 696312.0,
2501
+ "step": 248
2502
+ },
2503
+ {
2504
+ "entropy": 0.98828125,
2505
+ "epoch": 1.7535211267605635,
2506
+ "grad_norm": 0.84375,
2507
+ "learning_rate": 5e-05,
2508
+ "loss": 0.9271271824836731,
2509
+ "mean_token_accuracy": 0.8255208134651184,
2510
+ "num_tokens": 699392.0,
2511
+ "step": 249
2512
+ },
2513
+ {
2514
+ "entropy": 0.67578125,
2515
+ "epoch": 1.76056338028169,
2516
+ "grad_norm": 0.859375,
2517
+ "learning_rate": 5e-05,
2518
+ "loss": 0.6688521504402161,
2519
+ "mean_token_accuracy": 0.8663651347160339,
2520
+ "num_tokens": 701832.0,
2521
+ "step": 250
2522
+ },
2523
+ {
2524
+ "entropy": 1.1015625,
2525
+ "epoch": 1.767605633802817,
2526
+ "grad_norm": 0.92578125,
2527
+ "learning_rate": 5e-05,
2528
+ "loss": 1.0740944147109985,
2529
+ "mean_token_accuracy": 0.7920154333114624,
2530
+ "num_tokens": 704946.0,
2531
+ "step": 251
2532
+ },
2533
+ {
2534
+ "entropy": 0.92578125,
2535
+ "epoch": 1.7746478873239435,
2536
+ "grad_norm": 0.86328125,
2537
+ "learning_rate": 5e-05,
2538
+ "loss": 0.9155241847038269,
2539
+ "mean_token_accuracy": 0.8214963674545288,
2540
+ "num_tokens": 707587.0,
2541
+ "step": 252
2542
+ },
2543
+ {
2544
+ "entropy": 1.0234375,
2545
+ "epoch": 1.7816901408450705,
2546
+ "grad_norm": 0.90234375,
2547
+ "learning_rate": 5e-05,
2548
+ "loss": 1.0119163990020752,
2549
+ "mean_token_accuracy": 0.8100035786628723,
2550
+ "num_tokens": 710374.0,
2551
+ "step": 253
2552
+ },
2553
+ {
2554
+ "entropy": 1.1484375,
2555
+ "epoch": 1.788732394366197,
2556
+ "grad_norm": 0.8515625,
2557
+ "learning_rate": 5e-05,
2558
+ "loss": 1.098153829574585,
2559
+ "mean_token_accuracy": 0.7915265560150146,
2560
+ "num_tokens": 713356.0,
2561
+ "step": 254
2562
+ },
2563
+ {
2564
+ "entropy": 1.21875,
2565
+ "epoch": 1.795774647887324,
2566
+ "grad_norm": 0.87109375,
2567
+ "learning_rate": 5e-05,
2568
+ "loss": 1.1987107992172241,
2569
+ "mean_token_accuracy": 0.77190762758255,
2570
+ "num_tokens": 716525.0,
2571
+ "step": 255
2572
+ },
2573
+ {
2574
+ "entropy": 1.1171875,
2575
+ "epoch": 1.8028169014084507,
2576
+ "grad_norm": 0.8359375,
2577
+ "learning_rate": 5e-05,
2578
+ "loss": 1.1219631433486938,
2579
+ "mean_token_accuracy": 0.7778891324996948,
2580
+ "num_tokens": 719527.0,
2581
+ "step": 256
2582
+ },
2583
+ {
2584
+ "entropy": 1.0390625,
2585
+ "epoch": 1.8098591549295775,
2586
+ "grad_norm": 0.953125,
2587
+ "learning_rate": 5e-05,
2588
+ "loss": 1.0219084024429321,
2589
+ "mean_token_accuracy": 0.8117510676383972,
2590
+ "num_tokens": 722122.0,
2591
+ "step": 257
2592
+ },
2593
+ {
2594
+ "entropy": 0.92578125,
2595
+ "epoch": 1.8169014084507042,
2596
+ "grad_norm": 1.09375,
2597
+ "learning_rate": 5e-05,
2598
+ "loss": 0.8954271078109741,
2599
+ "mean_token_accuracy": 0.8421261310577393,
2600
+ "num_tokens": 724651.0,
2601
+ "step": 258
2602
+ },
2603
+ {
2604
+ "entropy": 0.79296875,
2605
+ "epoch": 1.823943661971831,
2606
+ "grad_norm": 0.9140625,
2607
+ "learning_rate": 5e-05,
2608
+ "loss": 0.7704645395278931,
2609
+ "mean_token_accuracy": 0.8589590787887573,
2610
+ "num_tokens": 727176.0,
2611
+ "step": 259
2612
+ },
2613
+ {
2614
+ "entropy": 0.63671875,
2615
+ "epoch": 1.8309859154929577,
2616
+ "grad_norm": 1.03125,
2617
+ "learning_rate": 5e-05,
2618
+ "loss": 0.5992922782897949,
2619
+ "mean_token_accuracy": 0.8863636255264282,
2620
+ "num_tokens": 729516.0,
2621
+ "step": 260
2622
+ },
2623
+ {
2624
+ "entropy": 1.1484375,
2625
+ "epoch": 1.8380281690140845,
2626
+ "grad_norm": 1.171875,
2627
+ "learning_rate": 5e-05,
2628
+ "loss": 1.0654540061950684,
2629
+ "mean_token_accuracy": 0.8068057298660278,
2630
+ "num_tokens": 732257.0,
2631
+ "step": 261
2632
+ },
2633
+ {
2634
+ "entropy": 0.64453125,
2635
+ "epoch": 1.8450704225352113,
2636
+ "grad_norm": 0.828125,
2637
+ "learning_rate": 5e-05,
2638
+ "loss": 0.6201009154319763,
2639
+ "mean_token_accuracy": 0.8818508386611938,
2640
+ "num_tokens": 734491.0,
2641
+ "step": 262
2642
+ },
2643
+ {
2644
+ "entropy": 1.0,
2645
+ "epoch": 1.852112676056338,
2646
+ "grad_norm": 0.90234375,
2647
+ "learning_rate": 5e-05,
2648
+ "loss": 0.9687674045562744,
2649
+ "mean_token_accuracy": 0.8077198266983032,
2650
+ "num_tokens": 737297.0,
2651
+ "step": 263
2652
+ },
2653
+ {
2654
+ "entropy": 0.5546875,
2655
+ "epoch": 1.8591549295774648,
2656
+ "grad_norm": 0.97265625,
2657
+ "learning_rate": 5e-05,
2658
+ "loss": 0.5199809074401855,
2659
+ "mean_token_accuracy": 0.900547444820404,
2660
+ "num_tokens": 739497.0,
2661
+ "step": 264
2662
+ },
2663
+ {
2664
+ "entropy": 0.81640625,
2665
+ "epoch": 1.8661971830985915,
2666
+ "grad_norm": 0.96484375,
2667
+ "learning_rate": 5e-05,
2668
+ "loss": 0.7673903107643127,
2669
+ "mean_token_accuracy": 0.8505041599273682,
2670
+ "num_tokens": 741786.0,
2671
+ "step": 265
2672
+ },
2673
+ {
2674
+ "entropy": 1.203125,
2675
+ "epoch": 1.8732394366197183,
2676
+ "grad_norm": 0.84765625,
2677
+ "learning_rate": 5e-05,
2678
+ "loss": 1.2104980945587158,
2679
+ "mean_token_accuracy": 0.7729952931404114,
2680
+ "num_tokens": 745186.0,
2681
+ "step": 266
2682
+ },
2683
+ {
2684
+ "entropy": 0.921875,
2685
+ "epoch": 1.880281690140845,
2686
+ "grad_norm": 0.8359375,
2687
+ "learning_rate": 5e-05,
2688
+ "loss": 0.9426409006118774,
2689
+ "mean_token_accuracy": 0.8229434490203857,
2690
+ "num_tokens": 748306.0,
2691
+ "step": 267
2692
+ },
2693
+ {
2694
+ "entropy": 0.92578125,
2695
+ "epoch": 1.887323943661972,
2696
+ "grad_norm": 0.91015625,
2697
+ "learning_rate": 5e-05,
2698
+ "loss": 0.9220845103263855,
2699
+ "mean_token_accuracy": 0.8194718360900879,
2700
+ "num_tokens": 750851.0,
2701
+ "step": 268
2702
+ },
2703
+ {
2704
+ "entropy": 1.0234375,
2705
+ "epoch": 1.8943661971830985,
2706
+ "grad_norm": 0.9765625,
2707
+ "learning_rate": 5e-05,
2708
+ "loss": 1.0415750741958618,
2709
+ "mean_token_accuracy": 0.7877483367919922,
2710
+ "num_tokens": 753879.0,
2711
+ "step": 269
2712
+ },
2713
+ {
2714
+ "entropy": 0.87109375,
2715
+ "epoch": 1.9014084507042255,
2716
+ "grad_norm": 0.86328125,
2717
+ "learning_rate": 5e-05,
2718
+ "loss": 0.858406126499176,
2719
+ "mean_token_accuracy": 0.8365448713302612,
2720
+ "num_tokens": 756897.0,
2721
+ "step": 270
2722
+ },
2723
+ {
2724
+ "entropy": 1.0625,
2725
+ "epoch": 1.908450704225352,
2726
+ "grad_norm": 0.875,
2727
+ "learning_rate": 5e-05,
2728
+ "loss": 1.1015472412109375,
2729
+ "mean_token_accuracy": 0.7784239649772644,
2730
+ "num_tokens": 760344.0,
2731
+ "step": 271
2732
+ },
2733
+ {
2734
+ "entropy": 1.03125,
2735
+ "epoch": 1.915492957746479,
2736
+ "grad_norm": 0.9609375,
2737
+ "learning_rate": 5e-05,
2738
+ "loss": 1.0051850080490112,
2739
+ "mean_token_accuracy": 0.8070366382598877,
2740
+ "num_tokens": 763109.0,
2741
+ "step": 272
2742
+ },
2743
+ {
2744
+ "entropy": 1.140625,
2745
+ "epoch": 1.9225352112676055,
2746
+ "grad_norm": 0.89453125,
2747
+ "learning_rate": 5e-05,
2748
+ "loss": 1.1266851425170898,
2749
+ "mean_token_accuracy": 0.7730742692947388,
2750
+ "num_tokens": 765999.0,
2751
+ "step": 273
2752
+ },
2753
+ {
2754
+ "entropy": 0.8046875,
2755
+ "epoch": 1.9295774647887325,
2756
+ "grad_norm": 0.79296875,
2757
+ "learning_rate": 5e-05,
2758
+ "loss": 0.7725271582603455,
2759
+ "mean_token_accuracy": 0.855555534362793,
2760
+ "num_tokens": 768527.0,
2761
+ "step": 274
2762
+ },
2763
+ {
2764
+ "entropy": 0.74609375,
2765
+ "epoch": 1.936619718309859,
2766
+ "grad_norm": 0.78125,
2767
+ "learning_rate": 5e-05,
2768
+ "loss": 0.7248237133026123,
2769
+ "mean_token_accuracy": 0.8687350749969482,
2770
+ "num_tokens": 771049.0,
2771
+ "step": 275
2772
+ },
2773
+ {
2774
+ "entropy": 0.82421875,
2775
+ "epoch": 1.943661971830986,
2776
+ "grad_norm": 0.8828125,
2777
+ "learning_rate": 5e-05,
2778
+ "loss": 0.8026857972145081,
2779
+ "mean_token_accuracy": 0.8561615943908691,
2780
+ "num_tokens": 773532.0,
2781
+ "step": 276
2782
+ },
2783
+ {
2784
+ "entropy": 1.0,
2785
+ "epoch": 1.9507042253521125,
2786
+ "grad_norm": 0.9140625,
2787
+ "learning_rate": 5e-05,
2788
+ "loss": 0.9862289428710938,
2789
+ "mean_token_accuracy": 0.8059446811676025,
2790
+ "num_tokens": 776467.0,
2791
+ "step": 277
2792
+ },
2793
+ {
2794
+ "entropy": 1.1328125,
2795
+ "epoch": 1.9577464788732395,
2796
+ "grad_norm": 0.9296875,
2797
+ "learning_rate": 5e-05,
2798
+ "loss": 1.1140096187591553,
2799
+ "mean_token_accuracy": 0.7820383310317993,
2800
+ "num_tokens": 779448.0,
2801
+ "step": 278
2802
+ },
2803
+ {
2804
+ "entropy": 1.0859375,
2805
+ "epoch": 1.9647887323943662,
2806
+ "grad_norm": 0.87109375,
2807
+ "learning_rate": 5e-05,
2808
+ "loss": 1.0614746809005737,
2809
+ "mean_token_accuracy": 0.7838625907897949,
2810
+ "num_tokens": 782542.0,
2811
+ "step": 279
2812
+ },
2813
+ {
2814
+ "entropy": 1.0625,
2815
+ "epoch": 1.971830985915493,
2816
+ "grad_norm": 0.93359375,
2817
+ "learning_rate": 5e-05,
2818
+ "loss": 1.053848385810852,
2819
+ "mean_token_accuracy": 0.7868378758430481,
2820
+ "num_tokens": 785665.0,
2821
+ "step": 280
2822
+ },
2823
+ {
2824
+ "entropy": 1.0625,
2825
+ "epoch": 1.9788732394366197,
2826
+ "grad_norm": 1.015625,
2827
+ "learning_rate": 5e-05,
2828
+ "loss": 1.0552152395248413,
2829
+ "mean_token_accuracy": 0.7965670824050903,
2830
+ "num_tokens": 788819.0,
2831
+ "step": 281
2832
+ },
2833
+ {
2834
+ "entropy": 1.1171875,
2835
+ "epoch": 1.9859154929577465,
2836
+ "grad_norm": 1.0390625,
2837
+ "learning_rate": 5e-05,
2838
+ "loss": 1.146568775177002,
2839
+ "mean_token_accuracy": 0.7714470624923706,
2840
+ "num_tokens": 791916.0,
2841
+ "step": 282
2842
+ },
2843
+ {
2844
+ "entropy": 0.875,
2845
+ "epoch": 1.9929577464788732,
2846
+ "grad_norm": 1.015625,
2847
+ "learning_rate": 5e-05,
2848
+ "loss": 0.8557621240615845,
2849
+ "mean_token_accuracy": 0.8393825888633728,
2850
+ "num_tokens": 794321.0,
2851
+ "step": 283
2852
+ },
2853
+ {
2854
+ "entropy": 0.69140625,
2855
+ "epoch": 2.0,
2856
+ "grad_norm": 1.0078125,
2857
+ "learning_rate": 5e-05,
2858
+ "loss": 0.694361686706543,
2859
+ "mean_token_accuracy": 0.8591725826263428,
2860
+ "num_tokens": 796722.0,
2861
+ "step": 284
2862
+ },
2863
+ {
2864
+ "epoch": 2.0,
2865
+ "eval_entropy": 0.9236111111111112,
2866
+ "eval_loss": 0.9322065114974976,
2867
+ "eval_mean_token_accuracy": 0.8198160545693504,
2868
+ "eval_num_tokens": 796722.0,
2869
+ "eval_runtime": 3.7129,
2870
+ "eval_samples_per_second": 76.489,
2871
+ "eval_steps_per_second": 9.696,
2872
+ "step": 284
2873
+ }
2874
+ ],
2875
+ "logging_steps": 1,
2876
+ "max_steps": 710,
2877
+ "num_input_tokens_seen": 0,
2878
+ "num_train_epochs": 5,
2879
+ "save_steps": 500,
2880
+ "stateful_callbacks": {
2881
+ "TrainerControl": {
2882
+ "args": {
2883
+ "should_epoch_stop": false,
2884
+ "should_evaluate": false,
2885
+ "should_log": false,
2886
+ "should_save": true,
2887
+ "should_training_stop": false
2888
+ },
2889
+ "attributes": {}
2890
+ }
2891
+ },
2892
+ "total_flos": 736331500394496.0,
2893
+ "train_batch_size": 8,
2894
+ "trial_name": null,
2895
+ "trial_params": null
2896
+ }
checkpoint-284/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5fa1d74cfdb570eb6c160e915c5780a404149c8da32b2030eb89b29d13902242
3
+ size 5585
checkpoint-426/chat_template.jinja ADDED
@@ -0,0 +1,6 @@
 
 
 
 
 
 
 
1
+ {% for message in messages %}{% if loop.first and messages[0]['role'] != 'system' %}{{ '<|im_start|>system
2
+ You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|>
3
+ ' }}{% endif %}{{'<|im_start|>' + message['role'] + '
4
+ ' + message['content'] + '<|im_end|>' + '
5
+ '}}{% endfor %}{% if add_generation_prompt %}{{ '<|im_start|>assistant
6
+ ' }}{% endif %}
checkpoint-426/config.json ADDED
@@ -0,0 +1,40 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "LlamaForCausalLM"
4
+ ],
5
+ "attention_bias": false,
6
+ "attention_dropout": 0.0,
7
+ "bos_token_id": 1,
8
+ "dtype": "bfloat16",
9
+ "eos_token_id": 2,
10
+ "head_dim": 64,
11
+ "hidden_act": "silu",
12
+ "hidden_size": 576,
13
+ "initializer_range": 0.041666666666666664,
14
+ "intermediate_size": 1536,
15
+ "is_llama_config": true,
16
+ "max_position_embeddings": 8192,
17
+ "mlp_bias": false,
18
+ "model_type": "llama",
19
+ "num_attention_heads": 9,
20
+ "num_hidden_layers": 30,
21
+ "num_key_value_heads": 3,
22
+ "pad_token_id": 2,
23
+ "pretraining_tp": 1,
24
+ "rms_norm_eps": 1e-05,
25
+ "rope_interleaved": false,
26
+ "rope_parameters": {
27
+ "rope_theta": 100000,
28
+ "rope_type": "default"
29
+ },
30
+ "tie_word_embeddings": true,
31
+ "transformers.js_config": {
32
+ "kv_cache_dtype": {
33
+ "fp16": "float16",
34
+ "q4f16": "float16"
35
+ }
36
+ },
37
+ "transformers_version": "5.2.0",
38
+ "use_cache": false,
39
+ "vocab_size": 49152
40
+ }
checkpoint-426/generation_config.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "_from_model_config": true,
3
+ "bos_token_id": 1,
4
+ "eos_token_id": [
5
+ 2
6
+ ],
7
+ "pad_token_id": 2,
8
+ "transformers_version": "5.2.0"
9
+ }
checkpoint-426/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0e28249fd7b40a2acfad0b7de39d1801c13c5eec711df23f9a6107109870a3e7
3
+ size 269060552
checkpoint-426/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:01f9a0f7843a37be87edd23f4e88aa93b38b95cc2c07503eeb1cf2e4632453a2
3
+ size 14645
checkpoint-426/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:819d56655f7abb028987362b34c5eb64d14796e7d55c61f08b0e677fcfa4f5e9
3
+ size 1465
checkpoint-426/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
checkpoint-426/tokenizer_config.json ADDED
@@ -0,0 +1,17 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|im_start|>",
5
+ "clean_up_tokenization_spaces": false,
6
+ "eos_token": "<|im_end|>",
7
+ "extra_special_tokens": [
8
+ "<|im_start|>",
9
+ "<|im_end|>"
10
+ ],
11
+ "is_local": true,
12
+ "model_max_length": 8192,
13
+ "pad_token": "<|im_end|>",
14
+ "tokenizer_class": "TokenizersBackend",
15
+ "unk_token": "<|endoftext|>",
16
+ "vocab_size": 49152
17
+ }
checkpoint-426/trainer_state.json ADDED
The diff for this file is too large to render. See raw diff
 
checkpoint-426/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5fa1d74cfdb570eb6c160e915c5780a404149c8da32b2030eb89b29d13902242
3
+ size 5585
checkpoint-568/chat_template.jinja ADDED
@@ -0,0 +1,6 @@
 
 
 
 
 
 
 
1
+ {% for message in messages %}{% if loop.first and messages[0]['role'] != 'system' %}{{ '<|im_start|>system
2
+ You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|>
3
+ ' }}{% endif %}{{'<|im_start|>' + message['role'] + '
4
+ ' + message['content'] + '<|im_end|>' + '
5
+ '}}{% endfor %}{% if add_generation_prompt %}{{ '<|im_start|>assistant
6
+ ' }}{% endif %}
checkpoint-568/config.json ADDED
@@ -0,0 +1,40 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "LlamaForCausalLM"
4
+ ],
5
+ "attention_bias": false,
6
+ "attention_dropout": 0.0,
7
+ "bos_token_id": 1,
8
+ "dtype": "bfloat16",
9
+ "eos_token_id": 2,
10
+ "head_dim": 64,
11
+ "hidden_act": "silu",
12
+ "hidden_size": 576,
13
+ "initializer_range": 0.041666666666666664,
14
+ "intermediate_size": 1536,
15
+ "is_llama_config": true,
16
+ "max_position_embeddings": 8192,
17
+ "mlp_bias": false,
18
+ "model_type": "llama",
19
+ "num_attention_heads": 9,
20
+ "num_hidden_layers": 30,
21
+ "num_key_value_heads": 3,
22
+ "pad_token_id": 2,
23
+ "pretraining_tp": 1,
24
+ "rms_norm_eps": 1e-05,
25
+ "rope_interleaved": false,
26
+ "rope_parameters": {
27
+ "rope_theta": 100000,
28
+ "rope_type": "default"
29
+ },
30
+ "tie_word_embeddings": true,
31
+ "transformers.js_config": {
32
+ "kv_cache_dtype": {
33
+ "fp16": "float16",
34
+ "q4f16": "float16"
35
+ }
36
+ },
37
+ "transformers_version": "5.2.0",
38
+ "use_cache": false,
39
+ "vocab_size": 49152
40
+ }
checkpoint-568/generation_config.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "_from_model_config": true,
3
+ "bos_token_id": 1,
4
+ "eos_token_id": [
5
+ 2
6
+ ],
7
+ "pad_token_id": 2,
8
+ "transformers_version": "5.2.0"
9
+ }
checkpoint-568/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c5139dfc37bea7f0984db9f6936d47139bf7d600646c0bce5a2f1e10930608fc
3
+ size 269060552
checkpoint-568/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:fdc37bbd2e979f041dfbbb004a5c74bab6cdda159cb18116df728588515a9ef6
3
+ size 14645
checkpoint-568/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6c374b5a90050f0de9583fb1646b9dee9dbbe14becdd74b3cc3c95d679cad6ad
3
+ size 1465
checkpoint-568/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
checkpoint-568/tokenizer_config.json ADDED
@@ -0,0 +1,17 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|im_start|>",
5
+ "clean_up_tokenization_spaces": false,
6
+ "eos_token": "<|im_end|>",
7
+ "extra_special_tokens": [
8
+ "<|im_start|>",
9
+ "<|im_end|>"
10
+ ],
11
+ "is_local": true,
12
+ "model_max_length": 8192,
13
+ "pad_token": "<|im_end|>",
14
+ "tokenizer_class": "TokenizersBackend",
15
+ "unk_token": "<|endoftext|>",
16
+ "vocab_size": 49152
17
+ }
checkpoint-568/trainer_state.json ADDED
The diff for this file is too large to render. See raw diff
 
checkpoint-568/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5fa1d74cfdb570eb6c160e915c5780a404149c8da32b2030eb89b29d13902242
3
+ size 5585
checkpoint-710/chat_template.jinja ADDED
@@ -0,0 +1,6 @@
 
 
 
 
 
 
 
1
+ {% for message in messages %}{% if loop.first and messages[0]['role'] != 'system' %}{{ '<|im_start|>system
2
+ You are a helpful AI assistant named SmolLM, trained by Hugging Face<|im_end|>
3
+ ' }}{% endif %}{{'<|im_start|>' + message['role'] + '
4
+ ' + message['content'] + '<|im_end|>' + '
5
+ '}}{% endfor %}{% if add_generation_prompt %}{{ '<|im_start|>assistant
6
+ ' }}{% endif %}
checkpoint-710/config.json ADDED
@@ -0,0 +1,40 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "LlamaForCausalLM"
4
+ ],
5
+ "attention_bias": false,
6
+ "attention_dropout": 0.0,
7
+ "bos_token_id": 1,
8
+ "dtype": "bfloat16",
9
+ "eos_token_id": 2,
10
+ "head_dim": 64,
11
+ "hidden_act": "silu",
12
+ "hidden_size": 576,
13
+ "initializer_range": 0.041666666666666664,
14
+ "intermediate_size": 1536,
15
+ "is_llama_config": true,
16
+ "max_position_embeddings": 8192,
17
+ "mlp_bias": false,
18
+ "model_type": "llama",
19
+ "num_attention_heads": 9,
20
+ "num_hidden_layers": 30,
21
+ "num_key_value_heads": 3,
22
+ "pad_token_id": 2,
23
+ "pretraining_tp": 1,
24
+ "rms_norm_eps": 1e-05,
25
+ "rope_interleaved": false,
26
+ "rope_parameters": {
27
+ "rope_theta": 100000,
28
+ "rope_type": "default"
29
+ },
30
+ "tie_word_embeddings": true,
31
+ "transformers.js_config": {
32
+ "kv_cache_dtype": {
33
+ "fp16": "float16",
34
+ "q4f16": "float16"
35
+ }
36
+ },
37
+ "transformers_version": "5.2.0",
38
+ "use_cache": false,
39
+ "vocab_size": 49152
40
+ }
checkpoint-710/generation_config.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "_from_model_config": true,
3
+ "bos_token_id": 1,
4
+ "eos_token_id": [
5
+ 2
6
+ ],
7
+ "pad_token_id": 2,
8
+ "transformers_version": "5.2.0"
9
+ }
checkpoint-710/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:17cd930da9783ca70bad4b9cdeee6a06c0acea8f34645a333c93341f487f66a3
3
+ size 14645
checkpoint-710/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:73dff87adc3c981bc959c81f548f6e14e8f23964b56dbf83945e88027f81115d
3
+ size 1465
checkpoint-710/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
checkpoint-710/tokenizer_config.json ADDED
@@ -0,0 +1,17 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|im_start|>",
5
+ "clean_up_tokenization_spaces": false,
6
+ "eos_token": "<|im_end|>",
7
+ "extra_special_tokens": [
8
+ "<|im_start|>",
9
+ "<|im_end|>"
10
+ ],
11
+ "is_local": true,
12
+ "model_max_length": 8192,
13
+ "pad_token": "<|im_end|>",
14
+ "tokenizer_class": "TokenizersBackend",
15
+ "unk_token": "<|endoftext|>",
16
+ "vocab_size": 49152
17
+ }
checkpoint-710/trainer_state.json ADDED
The diff for this file is too large to render. See raw diff
 
checkpoint-710/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5fa1d74cfdb570eb6c160e915c5780a404149c8da32b2030eb89b29d13902242
3
+ size 5585