AlessaC commited on
Commit
1767435
·
verified ·
1 Parent(s): 08bb813

Training in progress, step 794, checkpoint

Browse files
checkpoint-794/adapter_config.json CHANGED
@@ -24,13 +24,13 @@
24
  "rank_pattern": {},
25
  "revision": null,
26
  "target_modules": [
27
- "down_proj",
28
- "gate_proj",
29
  "k_proj",
30
- "q_proj",
31
  "v_proj",
32
- "o_proj",
33
- "up_proj"
 
34
  ],
35
  "task_type": "CAUSAL_LM",
36
  "trainable_token_indices": null,
 
24
  "rank_pattern": {},
25
  "revision": null,
26
  "target_modules": [
27
+ "o_proj",
 
28
  "k_proj",
29
+ "gate_proj",
30
  "v_proj",
31
+ "down_proj",
32
+ "up_proj",
33
+ "q_proj"
34
  ],
35
  "task_type": "CAUSAL_LM",
36
  "trainable_token_indices": null,
checkpoint-794/trainer_state.json CHANGED
@@ -362,9 +362,9 @@
362
  {
363
  "epoch": 0.12610340479192939,
364
  "eval_loss": 1.8593257665634155,
365
- "eval_runtime": 19.2003,
366
- "eval_samples_per_second": 36.718,
367
- "eval_steps_per_second": 18.385,
368
  "step": 50
369
  },
370
  {
@@ -720,9 +720,9 @@
720
  {
721
  "epoch": 0.25220680958385877,
722
  "eval_loss": 1.821334719657898,
723
- "eval_runtime": 19.6836,
724
- "eval_samples_per_second": 35.817,
725
- "eval_steps_per_second": 17.934,
726
  "step": 100
727
  },
728
  {
@@ -1078,9 +1078,9 @@
1078
  {
1079
  "epoch": 0.37831021437578816,
1080
  "eval_loss": 1.8017936944961548,
1081
- "eval_runtime": 19.647,
1082
- "eval_samples_per_second": 35.883,
1083
- "eval_steps_per_second": 17.967,
1084
  "step": 150
1085
  },
1086
  {
@@ -1436,9 +1436,9 @@
1436
  {
1437
  "epoch": 0.5044136191677175,
1438
  "eval_loss": 1.7910906076431274,
1439
- "eval_runtime": 19.1164,
1440
- "eval_samples_per_second": 36.879,
1441
- "eval_steps_per_second": 18.466,
1442
  "step": 200
1443
  },
1444
  {
@@ -1794,9 +1794,9 @@
1794
  {
1795
  "epoch": 0.6305170239596469,
1796
  "eval_loss": 1.7830545902252197,
1797
- "eval_runtime": 19.1394,
1798
- "eval_samples_per_second": 36.835,
1799
- "eval_steps_per_second": 18.444,
1800
  "step": 250
1801
  },
1802
  {
@@ -2152,9 +2152,9 @@
2152
  {
2153
  "epoch": 0.7566204287515763,
2154
  "eval_loss": 1.7733962535858154,
2155
- "eval_runtime": 19.163,
2156
- "eval_samples_per_second": 36.79,
2157
- "eval_steps_per_second": 18.421,
2158
  "step": 300
2159
  },
2160
  {
@@ -2510,9 +2510,9 @@
2510
  {
2511
  "epoch": 0.8827238335435057,
2512
  "eval_loss": 1.7664289474487305,
2513
- "eval_runtime": 19.1662,
2514
- "eval_samples_per_second": 36.783,
2515
- "eval_steps_per_second": 18.418,
2516
  "step": 350
2517
  },
2518
  {
@@ -2868,9 +2868,9 @@
2868
  {
2869
  "epoch": 1.0075662042875158,
2870
  "eval_loss": 1.7607698440551758,
2871
- "eval_runtime": 19.1575,
2872
- "eval_samples_per_second": 36.8,
2873
- "eval_steps_per_second": 18.426,
2874
  "step": 400
2875
  },
2876
  {
@@ -3226,9 +3226,9 @@
3226
  {
3227
  "epoch": 1.1336696090794451,
3228
  "eval_loss": 1.7592146396636963,
3229
- "eval_runtime": 19.6481,
3230
- "eval_samples_per_second": 35.881,
3231
- "eval_steps_per_second": 17.966,
3232
  "step": 450
3233
  },
3234
  {
@@ -3584,9 +3584,9 @@
3584
  {
3585
  "epoch": 1.2597730138713745,
3586
  "eval_loss": 1.7565970420837402,
3587
- "eval_runtime": 19.188,
3588
- "eval_samples_per_second": 36.742,
3589
- "eval_steps_per_second": 18.397,
3590
  "step": 500
3591
  },
3592
  {
@@ -3942,9 +3942,9 @@
3942
  {
3943
  "epoch": 1.385876418663304,
3944
  "eval_loss": 1.7535345554351807,
3945
- "eval_runtime": 19.0961,
3946
- "eval_samples_per_second": 36.918,
3947
- "eval_steps_per_second": 18.485,
3948
  "step": 550
3949
  },
3950
  {
@@ -4300,9 +4300,9 @@
4300
  {
4301
  "epoch": 1.5119798234552333,
4302
  "eval_loss": 1.7527234554290771,
4303
- "eval_runtime": 19.1093,
4304
- "eval_samples_per_second": 36.893,
4305
- "eval_steps_per_second": 18.473,
4306
  "step": 600
4307
  },
4308
  {
@@ -4658,9 +4658,9 @@
4658
  {
4659
  "epoch": 1.6380832282471627,
4660
  "eval_loss": 1.749564528465271,
4661
- "eval_runtime": 19.1442,
4662
- "eval_samples_per_second": 36.826,
4663
- "eval_steps_per_second": 18.439,
4664
  "step": 650
4665
  },
4666
  {
@@ -5016,9 +5016,9 @@
5016
  {
5017
  "epoch": 1.764186633039092,
5018
  "eval_loss": 1.7481378316879272,
5019
- "eval_runtime": 19.1022,
5020
- "eval_samples_per_second": 36.907,
5021
- "eval_steps_per_second": 18.48,
5022
  "step": 700
5023
  },
5024
  {
@@ -5374,9 +5374,9 @@
5374
  {
5375
  "epoch": 1.8902900378310215,
5376
  "eval_loss": 1.7464284896850586,
5377
- "eval_runtime": 19.0761,
5378
- "eval_samples_per_second": 36.957,
5379
- "eval_steps_per_second": 18.505,
5380
  "step": 750
5381
  },
5382
  {
@@ -5692,7 +5692,7 @@
5692
  "max_steps": 794,
5693
  "num_input_tokens_seen": 0,
5694
  "num_train_epochs": 2,
5695
- "save_steps": 200,
5696
  "stateful_callbacks": {
5697
  "TrainerControl": {
5698
  "args": {
 
362
  {
363
  "epoch": 0.12610340479192939,
364
  "eval_loss": 1.8593257665634155,
365
+ "eval_runtime": 18.8102,
366
+ "eval_samples_per_second": 37.48,
367
+ "eval_steps_per_second": 18.766,
368
  "step": 50
369
  },
370
  {
 
720
  {
721
  "epoch": 0.25220680958385877,
722
  "eval_loss": 1.821334719657898,
723
+ "eval_runtime": 18.8896,
724
+ "eval_samples_per_second": 37.322,
725
+ "eval_steps_per_second": 18.688,
726
  "step": 100
727
  },
728
  {
 
1078
  {
1079
  "epoch": 0.37831021437578816,
1080
  "eval_loss": 1.8017936944961548,
1081
+ "eval_runtime": 18.8835,
1082
+ "eval_samples_per_second": 37.334,
1083
+ "eval_steps_per_second": 18.694,
1084
  "step": 150
1085
  },
1086
  {
 
1436
  {
1437
  "epoch": 0.5044136191677175,
1438
  "eval_loss": 1.7910906076431274,
1439
+ "eval_runtime": 18.8348,
1440
+ "eval_samples_per_second": 37.431,
1441
+ "eval_steps_per_second": 18.742,
1442
  "step": 200
1443
  },
1444
  {
 
1794
  {
1795
  "epoch": 0.6305170239596469,
1796
  "eval_loss": 1.7830545902252197,
1797
+ "eval_runtime": 18.8692,
1798
+ "eval_samples_per_second": 37.362,
1799
+ "eval_steps_per_second": 18.708,
1800
  "step": 250
1801
  },
1802
  {
 
2152
  {
2153
  "epoch": 0.7566204287515763,
2154
  "eval_loss": 1.7733962535858154,
2155
+ "eval_runtime": 18.9029,
2156
+ "eval_samples_per_second": 37.296,
2157
+ "eval_steps_per_second": 18.674,
2158
  "step": 300
2159
  },
2160
  {
 
2510
  {
2511
  "epoch": 0.8827238335435057,
2512
  "eval_loss": 1.7664289474487305,
2513
+ "eval_runtime": 19.1441,
2514
+ "eval_samples_per_second": 36.826,
2515
+ "eval_steps_per_second": 18.439,
2516
  "step": 350
2517
  },
2518
  {
 
2868
  {
2869
  "epoch": 1.0075662042875158,
2870
  "eval_loss": 1.7607698440551758,
2871
+ "eval_runtime": 18.8004,
2872
+ "eval_samples_per_second": 37.499,
2873
+ "eval_steps_per_second": 18.776,
2874
  "step": 400
2875
  },
2876
  {
 
3226
  {
3227
  "epoch": 1.1336696090794451,
3228
  "eval_loss": 1.7592146396636963,
3229
+ "eval_runtime": 18.8668,
3230
+ "eval_samples_per_second": 37.367,
3231
+ "eval_steps_per_second": 18.71,
3232
  "step": 450
3233
  },
3234
  {
 
3584
  {
3585
  "epoch": 1.2597730138713745,
3586
  "eval_loss": 1.7565970420837402,
3587
+ "eval_runtime": 19.2415,
3588
+ "eval_samples_per_second": 36.64,
3589
+ "eval_steps_per_second": 18.346,
3590
  "step": 500
3591
  },
3592
  {
 
3942
  {
3943
  "epoch": 1.385876418663304,
3944
  "eval_loss": 1.7535345554351807,
3945
+ "eval_runtime": 18.9427,
3946
+ "eval_samples_per_second": 37.218,
3947
+ "eval_steps_per_second": 18.635,
3948
  "step": 550
3949
  },
3950
  {
 
4300
  {
4301
  "epoch": 1.5119798234552333,
4302
  "eval_loss": 1.7527234554290771,
4303
+ "eval_runtime": 18.7311,
4304
+ "eval_samples_per_second": 37.638,
4305
+ "eval_steps_per_second": 18.846,
4306
  "step": 600
4307
  },
4308
  {
 
4658
  {
4659
  "epoch": 1.6380832282471627,
4660
  "eval_loss": 1.749564528465271,
4661
+ "eval_runtime": 18.8736,
4662
+ "eval_samples_per_second": 37.354,
4663
+ "eval_steps_per_second": 18.703,
4664
  "step": 650
4665
  },
4666
  {
 
5016
  {
5017
  "epoch": 1.764186633039092,
5018
  "eval_loss": 1.7481378316879272,
5019
+ "eval_runtime": 18.8397,
5020
+ "eval_samples_per_second": 37.421,
5021
+ "eval_steps_per_second": 18.737,
5022
  "step": 700
5023
  },
5024
  {
 
5374
  {
5375
  "epoch": 1.8902900378310215,
5376
  "eval_loss": 1.7464284896850586,
5377
+ "eval_runtime": 18.6784,
5378
+ "eval_samples_per_second": 37.744,
5379
+ "eval_steps_per_second": 18.899,
5380
  "step": 750
5381
  },
5382
  {
 
5692
  "max_steps": 794,
5693
  "num_input_tokens_seen": 0,
5694
  "num_train_epochs": 2,
5695
+ "save_steps": 50,
5696
  "stateful_callbacks": {
5697
  "TrainerControl": {
5698
  "args": {
checkpoint-794/training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:908ac25afcecebd00cf3e224398e924723fc17436e832bf290d1f7c335a5a4b7
3
  size 6161
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ec3d8df95ba642eec10e761db819efa4c74dbd8edeed27cfd2cb36ccafa00305
3
  size 6161