kallacharanteja commited on
Commit
9490293
·
verified ·
1 Parent(s): e0185f4

Training in progress, step 2500

Browse files
Files changed (2) hide show
  1. adapter_model.safetensors +1 -1
  2. trainer_state.json +118 -7
adapter_model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:376b7999a31ccd6c7e9722a19817c8a8388739aef1524791e30b70cda6709e4c
3
  size 3089143504
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1bf45db64c45c690452fd280521ea622b677dbe47f8f5046804e82b4d3affa06
3
  size 3089143504
trainer_state.json CHANGED
@@ -1,10 +1,10 @@
1
  {
2
- "best_global_step": 2000,
3
- "best_metric": 1.8687856197357178,
4
- "best_model_checkpoint": "/kaggle/working/checkpoints/checkpoint-2000",
5
- "epoch": 2.11873840445269,
6
  "eval_steps": 500,
7
- "global_step": 2000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -462,11 +462,122 @@
462
  "eval_steps_per_second": 1.795,
463
  "num_input_tokens_seen": 8184832,
464
  "step": 2000
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
465
  }
466
  ],
467
  "logging_steps": 50,
468
  "max_steps": 5664,
469
- "num_input_tokens_seen": 8184832,
470
  "num_train_epochs": 6,
471
  "save_steps": 500,
472
  "stateful_callbacks": {
@@ -481,7 +592,7 @@
481
  "attributes": {}
482
  }
483
  },
484
- "total_flos": 1.4935570381799424e+16,
485
  "train_batch_size": 8,
486
  "trial_name": null,
487
  "trial_params": null
 
1
  {
2
+ "best_global_step": 2500,
3
+ "best_metric": 1.8576197624206543,
4
+ "best_model_checkpoint": "/kaggle/working/checkpoints/checkpoint-2500",
5
+ "epoch": 2.648820567187914,
6
  "eval_steps": 500,
7
+ "global_step": 2500,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
462
  "eval_steps_per_second": 1.795,
463
  "num_input_tokens_seen": 8184832,
464
  "step": 2000
465
+ },
466
+ {
467
+ "epoch": 2.1717466207262124,
468
+ "grad_norm": 0.6511809825897217,
469
+ "learning_rate": 0.00019739716053876954,
470
+ "loss": 8.9257958984375,
471
+ "num_input_tokens_seen": 8389632,
472
+ "step": 2050,
473
+ "train_runtime": 4126.538,
474
+ "train_tokens_per_second": 2033.092
475
+ },
476
+ {
477
+ "epoch": 2.2247548369997348,
478
+ "grad_norm": 0.6239650249481201,
479
+ "learning_rate": 0.0001946669093556607,
480
+ "loss": 8.875814208984375,
481
+ "num_input_tokens_seen": 8594432,
482
+ "step": 2100,
483
+ "train_runtime": 4217.9271,
484
+ "train_tokens_per_second": 2037.596
485
+ },
486
+ {
487
+ "epoch": 2.277763053273257,
488
+ "grad_norm": 0.6986948847770691,
489
+ "learning_rate": 0.00019193665817255186,
490
+ "loss": 8.9848681640625,
491
+ "num_input_tokens_seen": 8799232,
492
+ "step": 2150,
493
+ "train_runtime": 4309.2527,
494
+ "train_tokens_per_second": 2041.939
495
+ },
496
+ {
497
+ "epoch": 2.33077126954678,
498
+ "grad_norm": 0.6011477708816528,
499
+ "learning_rate": 0.00018920640698944302,
500
+ "loss": 8.912135620117187,
501
+ "num_input_tokens_seen": 9004032,
502
+ "step": 2200,
503
+ "train_runtime": 4400.5936,
504
+ "train_tokens_per_second": 2046.095
505
+ },
506
+ {
507
+ "epoch": 2.3837794858203023,
508
+ "grad_norm": 0.7250493764877319,
509
+ "learning_rate": 0.00018647615580633418,
510
+ "loss": 8.793685913085938,
511
+ "num_input_tokens_seen": 9208832,
512
+ "step": 2250,
513
+ "train_runtime": 4492.0003,
514
+ "train_tokens_per_second": 2050.052
515
+ },
516
+ {
517
+ "epoch": 2.4367877020938247,
518
+ "grad_norm": 0.6375405788421631,
519
+ "learning_rate": 0.00018374590462322534,
520
+ "loss": 8.844403076171876,
521
+ "num_input_tokens_seen": 9413632,
522
+ "step": 2300,
523
+ "train_runtime": 4583.4122,
524
+ "train_tokens_per_second": 2053.848
525
+ },
526
+ {
527
+ "epoch": 2.489795918367347,
528
+ "grad_norm": 0.6628595590591431,
529
+ "learning_rate": 0.00018101565344011647,
530
+ "loss": 8.734286499023437,
531
+ "num_input_tokens_seen": 9618432,
532
+ "step": 2350,
533
+ "train_runtime": 4674.7698,
534
+ "train_tokens_per_second": 2057.52
535
+ },
536
+ {
537
+ "epoch": 2.5428041346408694,
538
+ "grad_norm": 0.6868587136268616,
539
+ "learning_rate": 0.00017828540225700763,
540
+ "loss": 8.970186157226562,
541
+ "num_input_tokens_seen": 9823232,
542
+ "step": 2400,
543
+ "train_runtime": 4765.9951,
544
+ "train_tokens_per_second": 2061.108
545
+ },
546
+ {
547
+ "epoch": 2.5958123509143918,
548
+ "grad_norm": 0.6495867371559143,
549
+ "learning_rate": 0.0001755551510738988,
550
+ "loss": 8.924597778320312,
551
+ "num_input_tokens_seen": 10028032,
552
+ "step": 2450,
553
+ "train_runtime": 4857.2206,
554
+ "train_tokens_per_second": 2064.562
555
+ },
556
+ {
557
+ "epoch": 2.648820567187914,
558
+ "grad_norm": 0.7620416283607483,
559
+ "learning_rate": 0.00017282489989078995,
560
+ "loss": 8.905831298828126,
561
+ "num_input_tokens_seen": 10232832,
562
+ "step": 2500,
563
+ "train_runtime": 4948.5715,
564
+ "train_tokens_per_second": 2067.836
565
+ },
566
+ {
567
+ "epoch": 2.648820567187914,
568
+ "eval_bleu": 4.05,
569
+ "eval_chrf": 19.71,
570
+ "eval_loss": 1.8576197624206543,
571
+ "eval_runtime": 85.4771,
572
+ "eval_samples_per_second": 3.568,
573
+ "eval_steps_per_second": 1.79,
574
+ "num_input_tokens_seen": 10232832,
575
+ "step": 2500
576
  }
577
  ],
578
  "logging_steps": 50,
579
  "max_steps": 5664,
580
+ "num_input_tokens_seen": 10232832,
581
  "num_train_epochs": 6,
582
  "save_steps": 500,
583
  "stateful_callbacks": {
 
592
  "attributes": {}
593
  }
594
  },
595
+ "total_flos": 1.8672732994535424e+16,
596
  "train_batch_size": 8,
597
  "trial_name": null,
598
  "trial_params": null