yeok commited on
Commit
e3b9214
·
verified ·
1 Parent(s): b68f76e

Model save

Browse files
Files changed (4) hide show
  1. README.md +1 -1
  2. all_results.json +5 -5
  3. train_results.json +5 -5
  4. trainer_state.json +327 -151
README.md CHANGED
@@ -27,7 +27,7 @@ print(output["generated_text"])
27
 
28
  ## Training procedure
29
 
30
- [<img src="https://raw.githubusercontent.com/wandb/assets/main/wandb-github-badge-28.svg" alt="Visualize in Weights & Biases" width="150" height="24"/>](https://wandb.ai/yeokch/stream-of-search-train/runs/z4b8oxkg)
31
 
32
 
33
  This model was trained with SFT.
 
27
 
28
  ## Training procedure
29
 
30
+ [<img src="https://raw.githubusercontent.com/wandb/assets/main/wandb-github-badge-28.svg" alt="Visualize in Weights & Biases" width="150" height="24"/>](https://wandb.ai/yeokch/stream-of-search-train/runs/1bx3j201)
31
 
32
 
33
  This model was trained with SFT.
all_results.json CHANGED
@@ -1,8 +1,8 @@
1
  {
2
- "total_flos": 1.4186790468871782e+17,
3
- "train_loss": 0.6605973585563547,
4
- "train_runtime": 4863.2365,
5
- "train_samples": 6316,
6
- "train_samples_per_second": 0.45,
7
  "train_steps_per_second": 0.028
8
  }
 
1
  {
2
+ "total_flos": 2.5792410000818176e+17,
3
+ "train_loss": 0.5621715438993353,
4
+ "train_runtime": 8702.0895,
5
+ "train_samples": 6400,
6
+ "train_samples_per_second": 0.456,
7
  "train_steps_per_second": 0.028
8
  }
train_results.json CHANGED
@@ -1,8 +1,8 @@
1
  {
2
- "total_flos": 1.4186790468871782e+17,
3
- "train_loss": 0.6605973585563547,
4
- "train_runtime": 4863.2365,
5
- "train_samples": 6316,
6
- "train_samples_per_second": 0.45,
7
  "train_steps_per_second": 0.028
8
  }
 
1
  {
2
+ "total_flos": 2.5792410000818176e+17,
3
+ "train_loss": 0.5621715438993353,
4
+ "train_runtime": 8702.0895,
5
+ "train_samples": 6400,
6
+ "train_samples_per_second": 0.456,
7
  "train_steps_per_second": 0.028
8
  }
trainer_state.json CHANGED
@@ -2,250 +2,426 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.9945155393053017,
6
  "eval_steps": 500,
7
- "global_step": 136,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
- "epoch": 0.007312614259597806,
14
- "grad_norm": 0.12043058127164841,
15
- "learning_rate": 1.4285714285714285e-05,
16
- "loss": 0.9622,
17
- "mean_token_accuracy": 0.7244765534996986,
18
  "step": 1
19
  },
20
  {
21
- "epoch": 0.03656307129798903,
22
- "grad_norm": 0.12158409506082535,
23
- "learning_rate": 7.142857142857143e-05,
24
- "loss": 1.0026,
25
- "mean_token_accuracy": 0.7134494725614786,
26
  "step": 5
27
  },
28
  {
29
- "epoch": 0.07312614259597806,
30
- "grad_norm": 0.11713507771492004,
31
- "learning_rate": 0.00014285714285714287,
32
- "loss": 0.9767,
33
- "mean_token_accuracy": 0.7196435056626797,
34
  "step": 10
35
  },
36
  {
37
- "epoch": 0.10968921389396709,
38
- "grad_norm": 0.1333906650543213,
39
- "learning_rate": 0.0001999668467514313,
40
- "loss": 0.9108,
41
- "mean_token_accuracy": 0.7296453349292278,
42
  "step": 15
43
  },
44
  {
45
- "epoch": 0.14625228519195613,
46
- "grad_norm": 0.13013547658920288,
47
- "learning_rate": 0.00019880878960910772,
48
- "loss": 0.8575,
49
- "mean_token_accuracy": 0.7405968941748142,
50
  "step": 20
51
  },
52
  {
53
- "epoch": 0.18281535648994515,
54
- "grad_norm": 0.10512552410364151,
55
- "learning_rate": 0.00019601498736716017,
56
- "loss": 0.7774,
57
- "mean_token_accuracy": 0.7597137585282325,
58
  "step": 25
59
  },
60
  {
61
- "epoch": 0.21937842778793418,
62
- "grad_norm": 0.09665611386299133,
63
- "learning_rate": 0.0001916316904487005,
64
- "loss": 0.7471,
65
- "mean_token_accuracy": 0.7641588293015957,
66
  "step": 30
67
  },
68
  {
69
- "epoch": 0.25594149908592323,
70
- "grad_norm": 0.08939291536808014,
71
- "learning_rate": 0.00018573146280763324,
72
- "loss": 0.7116,
73
- "mean_token_accuracy": 0.7719448171555996,
74
  "step": 35
75
  },
76
  {
77
- "epoch": 0.29250457038391225,
78
- "grad_norm": 0.09836134314537048,
79
- "learning_rate": 0.00017841198065767107,
80
- "loss": 0.6836,
81
- "mean_token_accuracy": 0.7784840032458306,
82
  "step": 40
83
  },
84
  {
85
- "epoch": 0.3290676416819013,
86
- "grad_norm": 0.11588842421770096,
87
- "learning_rate": 0.00016979441547663435,
88
- "loss": 0.6559,
89
- "mean_token_accuracy": 0.7843028873205184,
90
  "step": 45
91
  },
92
  {
93
- "epoch": 0.3656307129798903,
94
- "grad_norm": 0.1017073541879654,
95
- "learning_rate": 0.00016002142805483685,
96
- "loss": 0.6346,
97
- "mean_token_accuracy": 0.7902907818555832,
98
  "step": 50
99
  },
100
  {
101
- "epoch": 0.40219378427787933,
102
- "grad_norm": 0.12249302119016647,
103
- "learning_rate": 0.00014925480679538647,
104
- "loss": 0.6312,
105
- "mean_token_accuracy": 0.7899462781846524,
106
  "step": 55
107
  },
108
  {
109
- "epoch": 0.43875685557586835,
110
- "grad_norm": 0.09456034749746323,
111
- "learning_rate": 0.00013767278936351854,
112
- "loss": 0.605,
113
- "mean_token_accuracy": 0.7972252801060676,
114
  "step": 60
115
  },
116
  {
117
- "epoch": 0.4753199268738574,
118
- "grad_norm": 0.10182930529117584,
119
- "learning_rate": 0.00012546711202412287,
120
- "loss": 0.5993,
121
- "mean_token_accuracy": 0.7983854189515114,
122
  "step": 65
123
  },
124
  {
125
- "epoch": 0.5118829981718465,
126
- "grad_norm": 0.11741966009140015,
127
- "learning_rate": 0.00011283983551465511,
128
- "loss": 0.5966,
129
- "mean_token_accuracy": 0.7996902070939541,
130
  "step": 70
131
  },
132
  {
133
- "epoch": 0.5484460694698354,
134
- "grad_norm": 0.1028585284948349,
135
- "learning_rate": 0.0001,
136
- "loss": 0.5929,
137
- "mean_token_accuracy": 0.8001770213246345,
138
  "step": 75
139
  },
140
  {
141
- "epoch": 0.5850091407678245,
142
- "grad_norm": 0.11468977481126785,
143
- "learning_rate": 8.71601644853449e-05,
144
- "loss": 0.5853,
145
- "mean_token_accuracy": 0.8016710385680199,
146
  "step": 80
147
  },
148
  {
149
- "epoch": 0.6215722120658135,
150
- "grad_norm": 0.1443265825510025,
151
- "learning_rate": 7.453288797587714e-05,
152
- "loss": 0.5771,
153
- "mean_token_accuracy": 0.8043004460632801,
154
  "step": 85
155
  },
156
  {
157
- "epoch": 0.6581352833638026,
158
- "grad_norm": 0.09393210709095001,
159
- "learning_rate": 6.232721063648148e-05,
160
- "loss": 0.5776,
161
- "mean_token_accuracy": 0.8033466592431069,
162
  "step": 90
163
  },
164
  {
165
- "epoch": 0.6946983546617916,
166
- "grad_norm": 0.1050662249326706,
167
- "learning_rate": 5.074519320461357e-05,
168
- "loss": 0.5726,
169
- "mean_token_accuracy": 0.8054373703897,
170
  "step": 95
171
  },
172
  {
173
- "epoch": 0.7312614259597806,
174
- "grad_norm": 0.10249751061201096,
175
- "learning_rate": 3.997857194516319e-05,
176
- "loss": 0.5734,
177
- "mean_token_accuracy": 0.805399215221405,
178
  "step": 100
179
  },
180
  {
181
- "epoch": 0.7678244972577697,
182
- "grad_norm": 0.099846251308918,
183
- "learning_rate": 3.0205584523365626e-05,
184
- "loss": 0.5768,
185
- "mean_token_accuracy": 0.8036472894251346,
186
  "step": 105
187
  },
188
  {
189
- "epoch": 0.8043875685557587,
190
- "grad_norm": 0.09095249325037003,
191
- "learning_rate": 2.1588019342328968e-05,
192
- "loss": 0.5796,
193
- "mean_token_accuracy": 0.80228111743927,
194
  "step": 110
195
  },
196
  {
197
- "epoch": 0.8409506398537477,
198
- "grad_norm": 0.09402327239513397,
199
- "learning_rate": 1.426853719236676e-05,
200
- "loss": 0.5677,
201
- "mean_token_accuracy": 0.8060768373310566,
202
  "step": 115
203
  },
204
  {
205
- "epoch": 0.8775137111517367,
206
- "grad_norm": 0.08518972247838974,
207
- "learning_rate": 8.368309551299536e-06,
208
- "loss": 0.5717,
209
- "mean_token_accuracy": 0.8042287208139897,
210
  "step": 120
211
  },
212
  {
213
- "epoch": 0.9140767824497258,
214
- "grad_norm": 0.08047080039978027,
215
- "learning_rate": 3.985012632839824e-06,
216
- "loss": 0.5675,
217
- "mean_token_accuracy": 0.8067085780203342,
218
  "step": 125
219
  },
220
  {
221
- "epoch": 0.9506398537477148,
222
- "grad_norm": 0.08690252900123596,
223
- "learning_rate": 1.1912103908922945e-06,
224
- "loss": 0.5657,
225
- "mean_token_accuracy": 0.8066124372184277,
226
  "step": 130
227
  },
228
  {
229
- "epoch": 0.9872029250457038,
230
- "grad_norm": 0.0785326287150383,
231
- "learning_rate": 3.3153248568695835e-08,
232
- "loss": 0.5627,
233
- "mean_token_accuracy": 0.8076211668550968,
234
  "step": 135
235
  },
236
  {
237
- "epoch": 0.9945155393053017,
238
- "mean_token_accuracy": 0.8014894388616085,
239
- "step": 136,
240
- "total_flos": 1.4186790468871782e+17,
241
- "train_loss": 0.6605973585563547,
242
- "train_runtime": 4863.2365,
243
- "train_samples_per_second": 0.45,
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
244
  "train_steps_per_second": 0.028
245
  }
246
  ],
247
  "logging_steps": 5,
248
- "max_steps": 136,
249
  "num_input_tokens_seen": 0,
250
  "num_train_epochs": 1,
251
  "save_steps": 100,
@@ -261,7 +437,7 @@
261
  "attributes": {}
262
  }
263
  },
264
- "total_flos": 1.4186790468871782e+17,
265
  "train_batch_size": 1,
266
  "trial_name": null,
267
  "trial_params": null
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.9964699949571356,
6
  "eval_steps": 500,
7
+ "global_step": 247,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
+ "epoch": 0.004034291477559254,
14
+ "grad_norm": 0.10618364810943604,
15
+ "learning_rate": 8.000000000000001e-06,
16
+ "loss": 0.8761,
17
+ "mean_token_accuracy": 0.7515642121434212,
18
  "step": 1
19
  },
20
  {
21
+ "epoch": 0.020171457387796268,
22
+ "grad_norm": 0.1208970844745636,
23
+ "learning_rate": 4e-05,
24
+ "loss": 0.9213,
25
+ "mean_token_accuracy": 0.7374346107244492,
26
  "step": 5
27
  },
28
  {
29
+ "epoch": 0.040342914775592535,
30
+ "grad_norm": 0.09196259081363678,
31
+ "learning_rate": 8e-05,
32
+ "loss": 0.8914,
33
+ "mean_token_accuracy": 0.7460352770984173,
34
  "step": 10
35
  },
36
  {
37
+ "epoch": 0.060514372163388806,
38
+ "grad_norm": 0.10933861136436462,
39
+ "learning_rate": 0.00012,
40
+ "loss": 0.8602,
41
+ "mean_token_accuracy": 0.7503265753388405,
42
  "step": 15
43
  },
44
  {
45
+ "epoch": 0.08068582955118507,
46
+ "grad_norm": 0.11680758744478226,
47
+ "learning_rate": 0.00016,
48
+ "loss": 0.8439,
49
+ "mean_token_accuracy": 0.7499923676252365,
50
  "step": 20
51
  },
52
  {
53
+ "epoch": 0.10085728693898134,
54
+ "grad_norm": 0.0951286181807518,
55
+ "learning_rate": 0.0002,
56
+ "loss": 0.7772,
57
+ "mean_token_accuracy": 0.7655725114047527,
58
  "step": 25
59
  },
60
  {
61
+ "epoch": 0.12102874432677761,
62
+ "grad_norm": 0.08053945004940033,
63
+ "learning_rate": 0.00019974977965945,
64
+ "loss": 0.7238,
65
+ "mean_token_accuracy": 0.7779346205294132,
66
  "step": 30
67
  },
68
  {
69
+ "epoch": 0.14120020171457387,
70
+ "grad_norm": 0.08780888468027115,
71
+ "learning_rate": 0.00019900037084217637,
72
+ "loss": 0.6863,
73
+ "mean_token_accuracy": 0.7845150113105774,
74
  "step": 35
75
  },
76
  {
77
+ "epoch": 0.16137165910237014,
78
+ "grad_norm": 0.08427116274833679,
79
+ "learning_rate": 0.00019775552389476864,
80
+ "loss": 0.6315,
81
+ "mean_token_accuracy": 0.7988936014473438,
82
  "step": 40
83
  },
84
  {
85
+ "epoch": 0.1815431164901664,
86
+ "grad_norm": 0.08954589813947678,
87
+ "learning_rate": 0.00019602146853776894,
88
+ "loss": 0.617,
89
+ "mean_token_accuracy": 0.8002350099384785,
90
  "step": 45
91
  },
92
  {
93
+ "epoch": 0.20171457387796268,
94
+ "grad_norm": 0.09293227642774582,
95
+ "learning_rate": 0.0001938068826896166,
96
+ "loss": 0.5883,
97
+ "mean_token_accuracy": 0.8079691044986248,
98
  "step": 50
99
  },
100
  {
101
+ "epoch": 0.22188603126575895,
102
+ "grad_norm": 0.09921843558549881,
103
+ "learning_rate": 0.0001911228490388136,
104
+ "loss": 0.5817,
105
+ "mean_token_accuracy": 0.8088557526469231,
106
  "step": 55
107
  },
108
  {
109
+ "epoch": 0.24205748865355523,
110
+ "grad_norm": 0.11710495501756668,
111
+ "learning_rate": 0.00018798279958164295,
112
+ "loss": 0.5737,
113
+ "mean_token_accuracy": 0.809910261631012,
114
  "step": 60
115
  },
116
  {
117
+ "epoch": 0.2622289460413515,
118
+ "grad_norm": 0.10755322873592377,
119
+ "learning_rate": 0.00018440244840299506,
120
+ "loss": 0.567,
121
+ "mean_token_accuracy": 0.8104779615998268,
122
  "step": 65
123
  },
124
  {
125
+ "epoch": 0.28240040342914774,
126
+ "grad_norm": 0.12730592489242554,
127
+ "learning_rate": 0.00018039971303669407,
128
+ "loss": 0.5546,
129
+ "mean_token_accuracy": 0.8143862128257752,
130
  "step": 70
131
  },
132
  {
133
+ "epoch": 0.30257186081694404,
134
+ "grad_norm": 0.12127107381820679,
135
+ "learning_rate": 0.00017599462479886974,
136
+ "loss": 0.5522,
137
+ "mean_token_accuracy": 0.8144258864223957,
138
  "step": 75
139
  },
140
  {
141
+ "epoch": 0.3227433182047403,
142
+ "grad_norm": 0.11108188331127167,
143
+ "learning_rate": 0.00017120922854310257,
144
+ "loss": 0.5305,
145
+ "mean_token_accuracy": 0.8214686810970306,
146
  "step": 80
147
  },
148
  {
149
+ "epoch": 0.3429147755925366,
150
+ "grad_norm": 0.11264903098344803,
151
+ "learning_rate": 0.00016606747233900815,
152
+ "loss": 0.5398,
153
+ "mean_token_accuracy": 0.8181388042867184,
154
  "step": 85
155
  },
156
  {
157
+ "epoch": 0.3630862329803328,
158
+ "grad_norm": 0.1377757340669632,
159
+ "learning_rate": 0.00016059508762635482,
160
+ "loss": 0.532,
161
+ "mean_token_accuracy": 0.8195081010460854,
162
  "step": 90
163
  },
164
  {
165
+ "epoch": 0.3832576903681291,
166
+ "grad_norm": 0.12057465314865112,
167
+ "learning_rate": 0.00015481946044447099,
168
+ "loss": 0.5238,
169
+ "mean_token_accuracy": 0.8215388789772987,
170
  "step": 95
171
  },
172
  {
173
+ "epoch": 0.40342914775592537,
174
+ "grad_norm": 0.11411843448877335,
175
+ "learning_rate": 0.00014876949438136347,
176
+ "loss": 0.5285,
177
+ "mean_token_accuracy": 0.819812896847725,
178
  "step": 100
179
  },
180
  {
181
+ "epoch": 0.4236006051437216,
182
+ "grad_norm": 0.12218334525823593,
183
+ "learning_rate": 0.0001424754659284048,
184
+ "loss": 0.5178,
185
+ "mean_token_accuracy": 0.8232251830399037,
186
  "step": 105
187
  },
188
  {
189
+ "epoch": 0.4437720625315179,
190
+ "grad_norm": 0.12559793889522552,
191
+ "learning_rate": 0.0001359688729644536,
192
+ "loss": 0.5269,
193
+ "mean_token_accuracy": 0.8201104834675789,
194
  "step": 110
195
  },
196
  {
197
+ "epoch": 0.46394351991931415,
198
+ "grad_norm": 0.14769871532917023,
199
+ "learning_rate": 0.00012928227712765504,
200
+ "loss": 0.5203,
201
+ "mean_token_accuracy": 0.8221889816224575,
202
  "step": 115
203
  },
204
  {
205
+ "epoch": 0.48411497730711045,
206
+ "grad_norm": 0.1480661779642105,
207
+ "learning_rate": 0.00012244914086375724,
208
+ "loss": 0.523,
209
+ "mean_token_accuracy": 0.8210825860500336,
210
  "step": 120
211
  },
212
  {
213
+ "epoch": 0.5042864346949067,
214
+ "grad_norm": 0.14564430713653564,
215
+ "learning_rate": 0.00011550365996641979,
216
+ "loss": 0.5074,
217
+ "mean_token_accuracy": 0.8264268651604653,
218
  "step": 125
219
  },
220
  {
221
+ "epoch": 0.524457892082703,
222
+ "grad_norm": 0.13270238041877747,
223
+ "learning_rate": 0.00010848059244755093,
224
+ "loss": 0.5092,
225
+ "mean_token_accuracy": 0.8253403089940547,
226
  "step": 130
227
  },
228
  {
229
+ "epoch": 0.5446293494704992,
230
+ "grad_norm": 0.11992616951465607,
231
+ "learning_rate": 0.00010141508459407623,
232
+ "loss": 0.5012,
233
+ "mean_token_accuracy": 0.8276812911033631,
234
  "step": 135
235
  },
236
  {
237
+ "epoch": 0.5648008068582955,
238
+ "grad_norm": 0.14025390148162842,
239
+ "learning_rate": 9.434249508162076e-05,
240
+ "loss": 0.5128,
241
+ "mean_token_accuracy": 0.8234357766807079,
242
+ "step": 140
243
+ },
244
+ {
245
+ "epoch": 0.5849722642460918,
246
+ "grad_norm": 0.11215393245220184,
247
+ "learning_rate": 8.729821802531212e-05,
248
+ "loss": 0.5133,
249
+ "mean_token_accuracy": 0.8236173823475837,
250
+ "step": 145
251
+ },
252
+ {
253
+ "epoch": 0.6051437216338881,
254
+ "grad_norm": 0.11705436557531357,
255
+ "learning_rate": 8.031750585322947e-05,
256
+ "loss": 0.5053,
257
+ "mean_token_accuracy": 0.8257141962647438,
258
+ "step": 150
259
+ },
260
+ {
261
+ "epoch": 0.6253151790216843,
262
+ "grad_norm": 0.12025938928127289,
263
+ "learning_rate": 7.343529288891239e-05,
264
+ "loss": 0.4955,
265
+ "mean_token_accuracy": 0.8292319044470787,
266
+ "step": 155
267
+ },
268
+ {
269
+ "epoch": 0.6454866364094806,
270
+ "grad_norm": 0.11226729303598404,
271
+ "learning_rate": 6.668602052579424e-05,
272
+ "loss": 0.4939,
273
+ "mean_token_accuracy": 0.8295842953026294,
274
+ "step": 160
275
+ },
276
+ {
277
+ "epoch": 0.6656580937972768,
278
+ "grad_norm": 0.10537487268447876,
279
+ "learning_rate": 6.010346486845837e-05,
280
+ "loss": 0.4907,
281
+ "mean_token_accuracy": 0.8306830637156963,
282
+ "step": 165
283
+ },
284
+ {
285
+ "epoch": 0.6858295511850732,
286
+ "grad_norm": 0.1326971799135208,
287
+ "learning_rate": 5.372056770327013e-05,
288
+ "loss": 0.4994,
289
+ "mean_token_accuracy": 0.8274142310023308,
290
+ "step": 170
291
+ },
292
+ {
293
+ "epoch": 0.7060010085728694,
294
+ "grad_norm": 0.0996076837182045,
295
+ "learning_rate": 4.756927164427685e-05,
296
+ "loss": 0.4973,
297
+ "mean_token_accuracy": 0.8285726100206375,
298
+ "step": 175
299
+ },
300
+ {
301
+ "epoch": 0.7261724659606656,
302
+ "grad_norm": 0.10915440320968628,
303
+ "learning_rate": 4.168036027937267e-05,
304
+ "loss": 0.4987,
305
+ "mean_token_accuracy": 0.8276034623384476,
306
+ "step": 180
307
+ },
308
+ {
309
+ "epoch": 0.7463439233484619,
310
+ "grad_norm": 0.10033515840768814,
311
+ "learning_rate": 3.6083304116701535e-05,
312
+ "loss": 0.4946,
313
+ "mean_token_accuracy": 0.8296850137412548,
314
+ "step": 185
315
+ },
316
+ {
317
+ "epoch": 0.7665153807362582,
318
+ "grad_norm": 0.10720834881067276,
319
+ "learning_rate": 3.080611310224539e-05,
320
+ "loss": 0.4952,
321
+ "mean_token_accuracy": 0.8289067208766937,
322
+ "step": 190
323
+ },
324
+ {
325
+ "epoch": 0.7866868381240545,
326
+ "grad_norm": 0.11353600770235062,
327
+ "learning_rate": 2.587519644666001e-05,
328
+ "loss": 0.4978,
329
+ "mean_token_accuracy": 0.8272387310862541,
330
+ "step": 195
331
+ },
332
+ {
333
+ "epoch": 0.8068582955118507,
334
+ "grad_norm": 0.09966889768838882,
335
+ "learning_rate": 2.1315230462840985e-05,
336
+ "loss": 0.4993,
337
+ "mean_token_accuracy": 0.8278293192386628,
338
+ "step": 200
339
+ },
340
+ {
341
+ "epoch": 0.827029752899647,
342
+ "grad_norm": 0.10758362710475922,
343
+ "learning_rate": 1.7149035075615794e-05,
344
+ "loss": 0.5055,
345
+ "mean_token_accuracy": 0.8247546002268791,
346
+ "step": 205
347
+ },
348
+ {
349
+ "epoch": 0.8472012102874432,
350
+ "grad_norm": 0.09960389137268066,
351
+ "learning_rate": 1.339745962155613e-05,
352
+ "loss": 0.4822,
353
+ "mean_token_accuracy": 0.8327905587852001,
354
+ "step": 210
355
+ },
356
+ {
357
+ "epoch": 0.8673726676752396,
358
+ "grad_norm": 0.10244999825954437,
359
+ "learning_rate": 1.0079278510416313e-05,
360
+ "loss": 0.4894,
361
+ "mean_token_accuracy": 0.8305548712611198,
362
+ "step": 215
363
+ },
364
+ {
365
+ "epoch": 0.8875441250630358,
366
+ "grad_norm": 0.09608753025531769,
367
+ "learning_rate": 7.211097270349066e-06,
368
+ "loss": 0.4998,
369
+ "mean_token_accuracy": 0.8276750639081001,
370
+ "step": 220
371
+ },
372
+ {
373
+ "epoch": 0.9077155824508321,
374
+ "grad_norm": 0.09114421159029007,
375
+ "learning_rate": 4.807269447087348e-06,
376
+ "loss": 0.4985,
377
+ "mean_token_accuracy": 0.827449332177639,
378
+ "step": 225
379
+ },
380
+ {
381
+ "epoch": 0.9278870398386283,
382
+ "grad_norm": 0.09354618191719055,
383
+ "learning_rate": 2.8798247729623806e-06,
384
+ "loss": 0.493,
385
+ "mean_token_accuracy": 0.8297582663595676,
386
+ "step": 230
387
+ },
388
+ {
389
+ "epoch": 0.9480584972264247,
390
+ "grad_norm": 0.09092767536640167,
391
+ "learning_rate": 1.4384089652291543e-06,
392
+ "loss": 0.4887,
393
+ "mean_token_accuracy": 0.8308509282767773,
394
+ "step": 235
395
+ },
396
+ {
397
+ "epoch": 0.9682299546142209,
398
+ "grad_norm": 0.09328487515449524,
399
+ "learning_rate": 4.902354549733978e-07,
400
+ "loss": 0.4923,
401
+ "mean_token_accuracy": 0.8295751377940178,
402
+ "step": 240
403
+ },
404
+ {
405
+ "epoch": 0.9884014120020171,
406
+ "grad_norm": 0.09508884698152542,
407
+ "learning_rate": 4.0049288167842705e-08,
408
+ "loss": 0.5046,
409
+ "mean_token_accuracy": 0.825819493830204,
410
+ "step": 245
411
+ },
412
+ {
413
+ "epoch": 0.9964699949571356,
414
+ "mean_token_accuracy": 0.825654674321413,
415
+ "step": 247,
416
+ "total_flos": 2.5792410000818176e+17,
417
+ "train_loss": 0.5621715438993353,
418
+ "train_runtime": 8702.0895,
419
+ "train_samples_per_second": 0.456,
420
  "train_steps_per_second": 0.028
421
  }
422
  ],
423
  "logging_steps": 5,
424
+ "max_steps": 247,
425
  "num_input_tokens_seen": 0,
426
  "num_train_epochs": 1,
427
  "save_steps": 100,
 
437
  "attributes": {}
438
  }
439
  },
440
+ "total_flos": 2.5792410000818176e+17,
441
  "train_batch_size": 1,
442
  "trial_name": null,
443
  "trial_params": null