PEFT
Safetensors
English
Spanish
nmarafo commited on
Commit
3864beb
·
verified ·
1 Parent(s): 076610b

Upload 12 files

Browse files
adapter_config.json CHANGED
@@ -19,13 +19,13 @@
19
  "rank_pattern": {},
20
  "revision": null,
21
  "target_modules": [
22
- "q_proj",
23
- "up_proj",
24
  "k_proj",
25
- "down_proj",
26
  "gate_proj",
27
- "o_proj",
28
- "v_proj"
 
 
 
29
  ],
30
  "task_type": "CAUSAL_LM",
31
  "use_rslora": false
 
19
  "rank_pattern": {},
20
  "revision": null,
21
  "target_modules": [
 
 
22
  "k_proj",
 
23
  "gate_proj",
24
+ "up_proj",
25
+ "q_proj",
26
+ "v_proj",
27
+ "down_proj",
28
+ "o_proj"
29
  ],
30
  "task_type": "CAUSAL_LM",
31
  "use_rslora": false
adapter_model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:f2bdf097d839bacb6794ab6b523a82cddd704ad62064bf65405e014e0da39a8b
3
  size 100059752
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:fbc3576307cf44ce9d7035b9a3aafb9a2b1e2b81056bc5cd464d9625dd418096
3
  size 100059752
optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:339c84f94bfa38a77929258380ba32b1339499872d528bd3d58a49a5f899b046
3
  size 50545780
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:cad169389767a1102d07c3157ee244ec7b5485cb66191bebe939d24560c538c4
3
  size 50545780
rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:25c948628ba1804e0dc0e988e547ad05d27e9a4f2682e0d6f6481f21ae112fc2
3
  size 14244
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d245e05e72192c132e0f2edb6fdcae0c578c890f0fe912f17ec7b0bba2d38cc3
3
  size 14244
scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:bd0c3e57a26cae66bf125d8bf6fa7070a034c23d0416abcf71b28aefe1bb53b6
3
  size 1064
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a6f4d2b44e7b6291612b138962c82e22b66be3188e99394e29c3a567af8e3db1
3
  size 1064
trainer_state.json CHANGED
@@ -1,370 +1,90 @@
1
  {
2
  "best_metric": null,
3
  "best_model_checkpoint": null,
4
- "epoch": 50.0,
5
  "eval_steps": 500,
6
- "global_step": 50,
7
  "is_hyper_param_search": false,
8
  "is_local_process_zero": true,
9
  "is_world_process_zero": true,
10
  "log_history": [
11
  {
12
  "epoch": 1.0,
13
- "grad_norm": 2.530534029006958,
14
  "learning_rate": 0.0001,
15
- "loss": 1.1597,
16
  "step": 1
17
  },
18
  {
19
  "epoch": 2.0,
20
- "grad_norm": 2.530534029006958,
21
  "learning_rate": 0.0002,
22
- "loss": 1.1597,
23
  "step": 2
24
  },
25
  {
26
  "epoch": 3.0,
27
- "grad_norm": 1.3551818132400513,
28
- "learning_rate": 0.00019795918367346938,
29
- "loss": 0.9742,
30
  "step": 3
31
  },
32
  {
33
  "epoch": 4.0,
34
- "grad_norm": 1.7891594171524048,
35
- "learning_rate": 0.0001959183673469388,
36
- "loss": 0.7509,
37
  "step": 4
38
  },
39
  {
40
  "epoch": 5.0,
41
- "grad_norm": 1.3730740547180176,
42
- "learning_rate": 0.00019387755102040816,
43
- "loss": 0.5428,
44
  "step": 5
45
  },
46
  {
47
  "epoch": 6.0,
48
- "grad_norm": 1.1008703708648682,
49
- "learning_rate": 0.00019183673469387756,
50
- "loss": 0.3649,
51
  "step": 6
52
  },
53
  {
54
  "epoch": 7.0,
55
- "grad_norm": 0.8232898116111755,
56
- "learning_rate": 0.00018979591836734697,
57
- "loss": 0.2208,
58
  "step": 7
59
  },
60
  {
61
  "epoch": 8.0,
62
- "grad_norm": 0.6340098977088928,
63
- "learning_rate": 0.00018775510204081634,
64
- "loss": 0.1423,
65
  "step": 8
66
  },
67
  {
68
  "epoch": 9.0,
69
- "grad_norm": 0.7959883809089661,
70
- "learning_rate": 0.00018571428571428572,
71
- "loss": 0.1026,
72
  "step": 9
73
  },
74
  {
75
  "epoch": 10.0,
76
- "grad_norm": 0.22785189747810364,
77
- "learning_rate": 0.00018367346938775512,
78
- "loss": 0.08,
79
  "step": 10
80
- },
81
- {
82
- "epoch": 11.0,
83
- "grad_norm": 1.1459858417510986,
84
- "learning_rate": 0.0001816326530612245,
85
- "loss": 0.0856,
86
- "step": 11
87
- },
88
- {
89
- "epoch": 12.0,
90
- "grad_norm": 0.3908502459526062,
91
- "learning_rate": 0.0001795918367346939,
92
- "loss": 0.0719,
93
- "step": 12
94
- },
95
- {
96
- "epoch": 13.0,
97
- "grad_norm": 9.051756858825684,
98
- "learning_rate": 0.00017755102040816327,
99
- "loss": 0.0923,
100
- "step": 13
101
- },
102
- {
103
- "epoch": 14.0,
104
- "grad_norm": 0.6290709972381592,
105
- "learning_rate": 0.00017551020408163265,
106
- "loss": 0.0629,
107
- "step": 14
108
- },
109
- {
110
- "epoch": 15.0,
111
- "grad_norm": 0.3718617260456085,
112
- "learning_rate": 0.00017346938775510205,
113
- "loss": 0.0558,
114
- "step": 15
115
- },
116
- {
117
- "epoch": 16.0,
118
- "grad_norm": 2.362645387649536,
119
- "learning_rate": 0.00017142857142857143,
120
- "loss": 0.0484,
121
- "step": 16
122
- },
123
- {
124
- "epoch": 17.0,
125
- "grad_norm": 0.40503254532814026,
126
- "learning_rate": 0.00016938775510204083,
127
- "loss": 0.0402,
128
- "step": 17
129
- },
130
- {
131
- "epoch": 18.0,
132
- "grad_norm": 0.4263724982738495,
133
- "learning_rate": 0.00016734693877551023,
134
- "loss": 0.031,
135
- "step": 18
136
- },
137
- {
138
- "epoch": 19.0,
139
- "grad_norm": 0.4310762882232666,
140
- "learning_rate": 0.0001653061224489796,
141
- "loss": 0.0203,
142
- "step": 19
143
- },
144
- {
145
- "epoch": 20.0,
146
- "grad_norm": 0.30944424867630005,
147
- "learning_rate": 0.00016326530612244898,
148
- "loss": 0.0108,
149
- "step": 20
150
- },
151
- {
152
- "epoch": 21.0,
153
- "grad_norm": 1.028169870376587,
154
- "learning_rate": 0.00016122448979591838,
155
- "loss": 0.0074,
156
- "step": 21
157
- },
158
- {
159
- "epoch": 22.0,
160
- "grad_norm": 0.04014270380139351,
161
- "learning_rate": 0.00015918367346938776,
162
- "loss": 0.0049,
163
- "step": 22
164
- },
165
- {
166
- "epoch": 23.0,
167
- "grad_norm": 0.05887392908334732,
168
- "learning_rate": 0.00015714285714285716,
169
- "loss": 0.0047,
170
- "step": 23
171
- },
172
- {
173
- "epoch": 24.0,
174
- "grad_norm": 0.03721626475453377,
175
- "learning_rate": 0.00015510204081632654,
176
- "loss": 0.0045,
177
- "step": 24
178
- },
179
- {
180
- "epoch": 25.0,
181
- "grad_norm": 0.028165677562355995,
182
- "learning_rate": 0.0001530612244897959,
183
- "loss": 0.0044,
184
- "step": 25
185
- },
186
- {
187
- "epoch": 26.0,
188
- "grad_norm": 0.04805993288755417,
189
- "learning_rate": 0.0001510204081632653,
190
- "loss": 0.0044,
191
- "step": 26
192
- },
193
- {
194
- "epoch": 27.0,
195
- "grad_norm": 0.01522037573158741,
196
- "learning_rate": 0.00014897959183673472,
197
- "loss": 0.0044,
198
- "step": 27
199
- },
200
- {
201
- "epoch": 28.0,
202
- "grad_norm": 0.03575819730758667,
203
- "learning_rate": 0.0001469387755102041,
204
- "loss": 0.0044,
205
- "step": 28
206
- },
207
- {
208
- "epoch": 29.0,
209
- "grad_norm": 0.015163887292146683,
210
- "learning_rate": 0.0001448979591836735,
211
- "loss": 0.0043,
212
- "step": 29
213
- },
214
- {
215
- "epoch": 30.0,
216
- "grad_norm": 0.04816267639398575,
217
- "learning_rate": 0.00014285714285714287,
218
- "loss": 0.0044,
219
- "step": 30
220
- },
221
- {
222
- "epoch": 31.0,
223
- "grad_norm": 0.013516299426555634,
224
- "learning_rate": 0.00014081632653061224,
225
- "loss": 0.0043,
226
- "step": 31
227
- },
228
- {
229
- "epoch": 32.0,
230
- "grad_norm": 0.03639404475688934,
231
- "learning_rate": 0.00013877551020408165,
232
- "loss": 0.0044,
233
- "step": 32
234
- },
235
- {
236
- "epoch": 33.0,
237
- "grad_norm": 0.01309999544173479,
238
- "learning_rate": 0.00013673469387755102,
239
- "loss": 0.0043,
240
- "step": 33
241
- },
242
- {
243
- "epoch": 34.0,
244
- "grad_norm": 0.014071361161768436,
245
- "learning_rate": 0.0001346938775510204,
246
- "loss": 0.0043,
247
- "step": 34
248
- },
249
- {
250
- "epoch": 35.0,
251
- "grad_norm": 0.017163768410682678,
252
- "learning_rate": 0.0001326530612244898,
253
- "loss": 0.0043,
254
- "step": 35
255
- },
256
- {
257
- "epoch": 36.0,
258
- "grad_norm": 0.03140578046441078,
259
- "learning_rate": 0.00013061224489795917,
260
- "loss": 0.0044,
261
- "step": 36
262
- },
263
- {
264
- "epoch": 37.0,
265
- "grad_norm": 0.023640567436814308,
266
- "learning_rate": 0.00012857142857142858,
267
- "loss": 0.0043,
268
- "step": 37
269
- },
270
- {
271
- "epoch": 38.0,
272
- "grad_norm": 0.017914315685629845,
273
- "learning_rate": 0.00012653061224489798,
274
- "loss": 0.0043,
275
- "step": 38
276
- },
277
- {
278
- "epoch": 39.0,
279
- "grad_norm": 0.025304120033979416,
280
- "learning_rate": 0.00012448979591836735,
281
- "loss": 0.0043,
282
- "step": 39
283
- },
284
- {
285
- "epoch": 40.0,
286
- "grad_norm": 0.01872032880783081,
287
- "learning_rate": 0.00012244897959183676,
288
- "loss": 0.0043,
289
- "step": 40
290
- },
291
- {
292
- "epoch": 41.0,
293
- "grad_norm": 0.020662743598222733,
294
- "learning_rate": 0.00012040816326530613,
295
- "loss": 0.0043,
296
- "step": 41
297
- },
298
- {
299
- "epoch": 42.0,
300
- "grad_norm": 0.006046542432159185,
301
- "learning_rate": 0.00011836734693877552,
302
- "loss": 0.0043,
303
- "step": 42
304
- },
305
- {
306
- "epoch": 43.0,
307
- "grad_norm": 0.04898548126220703,
308
- "learning_rate": 0.0001163265306122449,
309
- "loss": 0.0043,
310
- "step": 43
311
- },
312
- {
313
- "epoch": 44.0,
314
- "grad_norm": 0.03499221429228783,
315
- "learning_rate": 0.00011428571428571428,
316
- "loss": 0.0043,
317
- "step": 44
318
- },
319
- {
320
- "epoch": 45.0,
321
- "grad_norm": 0.03172151744365692,
322
- "learning_rate": 0.00011224489795918367,
323
- "loss": 0.0043,
324
- "step": 45
325
- },
326
- {
327
- "epoch": 46.0,
328
- "grad_norm": 0.03858642280101776,
329
- "learning_rate": 0.00011020408163265306,
330
- "loss": 0.0044,
331
- "step": 46
332
- },
333
- {
334
- "epoch": 47.0,
335
- "grad_norm": 0.05879056453704834,
336
- "learning_rate": 0.00010816326530612246,
337
- "loss": 0.0044,
338
- "step": 47
339
- },
340
- {
341
- "epoch": 48.0,
342
- "grad_norm": 0.02806887961924076,
343
- "learning_rate": 0.00010612244897959185,
344
- "loss": 0.0043,
345
- "step": 48
346
- },
347
- {
348
- "epoch": 49.0,
349
- "grad_norm": 0.04892841354012489,
350
- "learning_rate": 0.00010408163265306123,
351
- "loss": 0.0044,
352
- "step": 49
353
- },
354
- {
355
- "epoch": 50.0,
356
- "grad_norm": 0.028942273929715157,
357
- "learning_rate": 0.00010204081632653062,
358
- "loss": 0.0043,
359
- "step": 50
360
  }
361
  ],
362
  "logging_steps": 1,
363
- "max_steps": 100,
364
  "num_input_tokens_seen": 0,
365
- "num_train_epochs": 100,
366
  "save_steps": 500,
367
- "total_flos": 380258668032000.0,
368
  "train_batch_size": 1,
369
  "trial_name": null,
370
  "trial_params": null
 
1
  {
2
  "best_metric": null,
3
  "best_model_checkpoint": null,
4
+ "epoch": 10.0,
5
  "eval_steps": 500,
6
+ "global_step": 10,
7
  "is_hyper_param_search": false,
8
  "is_local_process_zero": true,
9
  "is_world_process_zero": true,
10
  "log_history": [
11
  {
12
  "epoch": 1.0,
13
+ "grad_norm": 3.2200822830200195,
14
  "learning_rate": 0.0001,
15
+ "loss": 1.1272,
16
  "step": 1
17
  },
18
  {
19
  "epoch": 2.0,
20
+ "grad_norm": 3.2200822830200195,
21
  "learning_rate": 0.0002,
22
+ "loss": 1.1272,
23
  "step": 2
24
  },
25
  {
26
  "epoch": 3.0,
27
+ "grad_norm": 1.8294692039489746,
28
+ "learning_rate": 0.0001995983935742972,
29
+ "loss": 0.8989,
30
  "step": 3
31
  },
32
  {
33
  "epoch": 4.0,
34
+ "grad_norm": 1.9677034616470337,
35
+ "learning_rate": 0.0001991967871485944,
36
+ "loss": 0.6342,
37
  "step": 4
38
  },
39
  {
40
  "epoch": 5.0,
41
+ "grad_norm": 1.3022174835205078,
42
+ "learning_rate": 0.00019879518072289158,
43
+ "loss": 0.3798,
44
  "step": 5
45
  },
46
  {
47
  "epoch": 6.0,
48
+ "grad_norm": 0.9234146475791931,
49
+ "learning_rate": 0.00019839357429718877,
50
+ "loss": 0.1889,
51
  "step": 6
52
  },
53
  {
54
  "epoch": 7.0,
55
+ "grad_norm": 0.6237850785255432,
56
+ "learning_rate": 0.00019799196787148596,
57
+ "loss": 0.1014,
58
  "step": 7
59
  },
60
  {
61
  "epoch": 8.0,
62
+ "grad_norm": 0.20204997062683105,
63
+ "learning_rate": 0.00019759036144578314,
64
+ "loss": 0.0767,
65
  "step": 8
66
  },
67
  {
68
  "epoch": 9.0,
69
+ "grad_norm": 0.2050553411245346,
70
+ "learning_rate": 0.00019718875502008033,
71
+ "loss": 0.0744,
72
  "step": 9
73
  },
74
  {
75
  "epoch": 10.0,
76
+ "grad_norm": 0.16611504554748535,
77
+ "learning_rate": 0.00019678714859437752,
78
+ "loss": 0.0711,
79
  "step": 10
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
80
  }
81
  ],
82
  "logging_steps": 1,
83
+ "max_steps": 500,
84
  "num_input_tokens_seen": 0,
85
+ "num_train_epochs": 500,
86
  "save_steps": 500,
87
+ "total_flos": 77451458764800.0,
88
  "train_batch_size": 1,
89
  "trial_name": null,
90
  "trial_params": null
training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:d5b1969d43c316b9129c4e907c444a012ca9c9efecd26219396536a3708cb1bc
3
  size 4984
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f2fd876d19bbf30d7b89395ffb800c42675421fc4cbcca0c7ced1806676ee618
3
  size 4984