chancharikm commited on
Commit
779e176
·
verified ·
1 Parent(s): 3fe9e49

Training in progress, step 150, checkpoint

Browse files
Files changed (23) hide show
  1. last-checkpoint/global_step150/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt +3 -0
  2. last-checkpoint/global_step150/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt +3 -0
  3. last-checkpoint/global_step150/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt +3 -0
  4. last-checkpoint/global_step150/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt +3 -0
  5. last-checkpoint/global_step150/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt +3 -0
  6. last-checkpoint/global_step150/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt +3 -0
  7. last-checkpoint/global_step150/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt +3 -0
  8. last-checkpoint/global_step150/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt +3 -0
  9. last-checkpoint/global_step150/zero_pp_rank_0_mp_rank_00_model_states.pt +3 -0
  10. last-checkpoint/global_step150/zero_pp_rank_1_mp_rank_00_model_states.pt +3 -0
  11. last-checkpoint/global_step150/zero_pp_rank_2_mp_rank_00_model_states.pt +3 -0
  12. last-checkpoint/global_step150/zero_pp_rank_3_mp_rank_00_model_states.pt +3 -0
  13. last-checkpoint/global_step150/zero_pp_rank_4_mp_rank_00_model_states.pt +3 -0
  14. last-checkpoint/global_step150/zero_pp_rank_5_mp_rank_00_model_states.pt +3 -0
  15. last-checkpoint/global_step150/zero_pp_rank_6_mp_rank_00_model_states.pt +3 -0
  16. last-checkpoint/global_step150/zero_pp_rank_7_mp_rank_00_model_states.pt +3 -0
  17. last-checkpoint/latest +1 -1
  18. last-checkpoint/model-00001-of-00004.safetensors +1 -1
  19. last-checkpoint/model-00002-of-00004.safetensors +1 -1
  20. last-checkpoint/model-00003-of-00004.safetensors +1 -1
  21. last-checkpoint/model-00004-of-00004.safetensors +1 -1
  22. last-checkpoint/scheduler.pt +1 -1
  23. last-checkpoint/trainer_state.json +353 -3
last-checkpoint/global_step150/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2c4f749d1be1cedbf8674d63a304e99aa23fdb4c96fec59c691a0fa0d2543660
3
+ size 12470656801
last-checkpoint/global_step150/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ca14ff3fe8b301dd325b91411f9fd8fa869d724510f04bdde3b00c9a306fbb91
3
+ size 12470656801
last-checkpoint/global_step150/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:80916c45eece61b7e60ef10c252774edf74a73894a925ae0d5010fe161ae233b
3
+ size 12470656801
last-checkpoint/global_step150/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b09617b307cee524e3251e51fa064cc67ef610118b5bc31fcbf16defbd21295d
3
+ size 12470656801
last-checkpoint/global_step150/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:dd5d705083cb6f0ae4d0b3cc2a509bdf5f7baf75e7c64dbd5b4a898549076c81
3
+ size 12470656801
last-checkpoint/global_step150/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:93a07c756ec4d308a8c29b237d643172b1ca2ad85a2ae0e3847b9fad05dc6d58
3
+ size 12470656801
last-checkpoint/global_step150/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:31c1ff6ada7875a7e372d8c01b194bf316a98b5f8ef240af298779fab57d034e
3
+ size 12470656801
last-checkpoint/global_step150/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0064447452ab694b7e1dd6fcdd9858c953c2bf86e1318dc5550382a4f79a1f33
3
+ size 12470656801
last-checkpoint/global_step150/zero_pp_rank_0_mp_rank_00_model_states.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:01abdbfd08a8b50c5d3ddfa9b07127ef7792d1fded52a4b53bf59a6da163e4f5
3
+ size 113836509
last-checkpoint/global_step150/zero_pp_rank_1_mp_rank_00_model_states.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:42716f9fad7526a77e43e41ae6677e8369e0a796226b015628c5a41087a00a9f
3
+ size 113836509
last-checkpoint/global_step150/zero_pp_rank_2_mp_rank_00_model_states.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c1ff91bfedb8d992fb44bbf768df1e28cd76d58d45e809ef3ac6bcc83eebeb59
3
+ size 113836509
last-checkpoint/global_step150/zero_pp_rank_3_mp_rank_00_model_states.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ccead36b8474b5632b6bdcee95d6e5fb0fee18c2da66a94f734eb8678757d1c9
3
+ size 113836509
last-checkpoint/global_step150/zero_pp_rank_4_mp_rank_00_model_states.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:81c647b0834900dd8304260a27595a6a2a28538519f7dfb830434e27ee99161c
3
+ size 113836509
last-checkpoint/global_step150/zero_pp_rank_5_mp_rank_00_model_states.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:158d907f61ed62b6465b36701a276332f8d5fd77406262dda2e5461e7f8e6940
3
+ size 113836509
last-checkpoint/global_step150/zero_pp_rank_6_mp_rank_00_model_states.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:198f1a485fe28c964e2ae3472c82078ae3aaa3cb0c42bd0505b11260dab97c24
3
+ size 113836509
last-checkpoint/global_step150/zero_pp_rank_7_mp_rank_00_model_states.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:bfe89dd9103982e90d566b2553c7de12a690c49f4fa7050de8f0a14204f05b77
3
+ size 113836509
last-checkpoint/latest CHANGED
@@ -1 +1 @@
1
- global_step100
 
1
+ global_step150
last-checkpoint/model-00001-of-00004.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:4bed4480dc618d5c958149a905b27159769a03f3f48747cbc85df65ec875af59
3
  size 4998056552
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:796e017e796766a297a3ecc197e6fe93a15c8fc82d3f1b9255715f2a624f4bf8
3
  size 4998056552
last-checkpoint/model-00002-of-00004.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:d11e702bb5f8eca6805ddbe9ee14453556e2faf2567d389f6951139145dfe8ba
3
  size 4915962464
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:584d817eeef9866ca575eadc8e05105a9c332d104c22b4219bcfd64294e39cb5
3
  size 4915962464
last-checkpoint/model-00003-of-00004.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:1e142472c59526c67cd73513fe90b3fad8c125caa8493c1f9f145a50bb229869
3
  size 4915962496
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8f57044465ff79987069debadec81c2eccbddedda7fe3e9a3afb2cc6de6f2ab2
3
  size 4915962496
last-checkpoint/model-00004-of-00004.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:b7483638aacca60c77f95421085f8cb44e640c8410d5d8b2c5e8b4a18fcd05f9
3
  size 2704357976
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:50d861d7c2b273e2a4159d82f9d45a2be4fa9176bd6652e87839cce55ebd3b9d
3
  size 2704357976
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:f522ff7240667fded1faf491e50cb0e354ba2050c394a86f93f2e93a583e166b
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e9dc3861bed49e3d3c2d659942852e31169a76f0c45a33bf923a6a0e76a509ff
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.0709471443774388,
6
  "eval_steps": 500,
7
- "global_step": 100,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -708,6 +708,356 @@
708
  "learning_rate": 2.1063829787234043e-05,
709
  "loss": 0.1971,
710
  "step": 100
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
711
  }
712
  ],
713
  "logging_steps": 1,
@@ -727,7 +1077,7 @@
727
  "attributes": {}
728
  }
729
  },
730
- "total_flos": 64740426121216.0,
731
  "train_batch_size": 10,
732
  "trial_name": null,
733
  "trial_params": null
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.10642071656615822,
6
  "eval_steps": 500,
7
+ "global_step": 150,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
708
  "learning_rate": 2.1063829787234043e-05,
709
  "loss": 0.1971,
710
  "step": 100
711
+ },
712
+ {
713
+ "epoch": 0.0716566158212132,
714
+ "grad_norm": 5.642883274297945,
715
+ "learning_rate": 2.1276595744680852e-05,
716
+ "loss": 0.1875,
717
+ "step": 101
718
+ },
719
+ {
720
+ "epoch": 0.07236608726498758,
721
+ "grad_norm": 1.7507710973299895,
722
+ "learning_rate": 2.148936170212766e-05,
723
+ "loss": 0.15,
724
+ "step": 102
725
+ },
726
+ {
727
+ "epoch": 0.07307555870876198,
728
+ "grad_norm": 9.627116387162864,
729
+ "learning_rate": 2.170212765957447e-05,
730
+ "loss": 0.1866,
731
+ "step": 103
732
+ },
733
+ {
734
+ "epoch": 0.07378503015253636,
735
+ "grad_norm": 9.749256984312629,
736
+ "learning_rate": 2.191489361702128e-05,
737
+ "loss": 0.191,
738
+ "step": 104
739
+ },
740
+ {
741
+ "epoch": 0.07449450159631076,
742
+ "grad_norm": 7.887554277397637,
743
+ "learning_rate": 2.2127659574468085e-05,
744
+ "loss": 0.1667,
745
+ "step": 105
746
+ },
747
+ {
748
+ "epoch": 0.07520397304008514,
749
+ "grad_norm": 5.470026091817564,
750
+ "learning_rate": 2.2340425531914894e-05,
751
+ "loss": 0.1784,
752
+ "step": 106
753
+ },
754
+ {
755
+ "epoch": 0.07591344448385952,
756
+ "grad_norm": 4.3382421070052315,
757
+ "learning_rate": 2.2553191489361703e-05,
758
+ "loss": 0.1822,
759
+ "step": 107
760
+ },
761
+ {
762
+ "epoch": 0.07662291592763391,
763
+ "grad_norm": 10.137184968638856,
764
+ "learning_rate": 2.2765957446808512e-05,
765
+ "loss": 0.1862,
766
+ "step": 108
767
+ },
768
+ {
769
+ "epoch": 0.0773323873714083,
770
+ "grad_norm": 10.090500044101372,
771
+ "learning_rate": 2.297872340425532e-05,
772
+ "loss": 0.1892,
773
+ "step": 109
774
+ },
775
+ {
776
+ "epoch": 0.07804185881518269,
777
+ "grad_norm": 4.447131231901499,
778
+ "learning_rate": 2.319148936170213e-05,
779
+ "loss": 0.1718,
780
+ "step": 110
781
+ },
782
+ {
783
+ "epoch": 0.07875133025895707,
784
+ "grad_norm": 2.750599704413433,
785
+ "learning_rate": 2.340425531914894e-05,
786
+ "loss": 0.1589,
787
+ "step": 111
788
+ },
789
+ {
790
+ "epoch": 0.07946080170273147,
791
+ "grad_norm": 5.03388412323486,
792
+ "learning_rate": 2.3617021276595744e-05,
793
+ "loss": 0.1634,
794
+ "step": 112
795
+ },
796
+ {
797
+ "epoch": 0.08017027314650585,
798
+ "grad_norm": 7.506997785980621,
799
+ "learning_rate": 2.3829787234042553e-05,
800
+ "loss": 0.18,
801
+ "step": 113
802
+ },
803
+ {
804
+ "epoch": 0.08087974459028024,
805
+ "grad_norm": 1.6324595253459384,
806
+ "learning_rate": 2.4042553191489362e-05,
807
+ "loss": 0.1529,
808
+ "step": 114
809
+ },
810
+ {
811
+ "epoch": 0.08158921603405463,
812
+ "grad_norm": 4.93334287619821,
813
+ "learning_rate": 2.4255319148936168e-05,
814
+ "loss": 0.1891,
815
+ "step": 115
816
+ },
817
+ {
818
+ "epoch": 0.08229868747782902,
819
+ "grad_norm": 2.2288648427809856,
820
+ "learning_rate": 2.4468085106382977e-05,
821
+ "loss": 0.1309,
822
+ "step": 116
823
+ },
824
+ {
825
+ "epoch": 0.0830081589216034,
826
+ "grad_norm": 2.9523096736073926,
827
+ "learning_rate": 2.4680851063829786e-05,
828
+ "loss": 0.1422,
829
+ "step": 117
830
+ },
831
+ {
832
+ "epoch": 0.0837176303653778,
833
+ "grad_norm": 1.9461700932872816,
834
+ "learning_rate": 2.4893617021276595e-05,
835
+ "loss": 0.1133,
836
+ "step": 118
837
+ },
838
+ {
839
+ "epoch": 0.08442710180915218,
840
+ "grad_norm": 3.311754017421373,
841
+ "learning_rate": 2.5106382978723404e-05,
842
+ "loss": 0.1257,
843
+ "step": 119
844
+ },
845
+ {
846
+ "epoch": 0.08513657325292658,
847
+ "grad_norm": 1.3693780728561118,
848
+ "learning_rate": 2.5319148936170213e-05,
849
+ "loss": 0.132,
850
+ "step": 120
851
+ },
852
+ {
853
+ "epoch": 0.08584604469670096,
854
+ "grad_norm": 2.014986619725941,
855
+ "learning_rate": 2.5531914893617022e-05,
856
+ "loss": 0.1167,
857
+ "step": 121
858
+ },
859
+ {
860
+ "epoch": 0.08655551614047535,
861
+ "grad_norm": 0.9852224915415894,
862
+ "learning_rate": 2.574468085106383e-05,
863
+ "loss": 0.1552,
864
+ "step": 122
865
+ },
866
+ {
867
+ "epoch": 0.08726498758424973,
868
+ "grad_norm": 2.9682789311444537,
869
+ "learning_rate": 2.595744680851064e-05,
870
+ "loss": 0.1444,
871
+ "step": 123
872
+ },
873
+ {
874
+ "epoch": 0.08797445902802412,
875
+ "grad_norm": 5.666004456761068,
876
+ "learning_rate": 2.617021276595745e-05,
877
+ "loss": 0.1675,
878
+ "step": 124
879
+ },
880
+ {
881
+ "epoch": 0.08868393047179851,
882
+ "grad_norm": 7.081569238554394,
883
+ "learning_rate": 2.6382978723404258e-05,
884
+ "loss": 0.1783,
885
+ "step": 125
886
+ },
887
+ {
888
+ "epoch": 0.08939340191557289,
889
+ "grad_norm": 1.8891227257145333,
890
+ "learning_rate": 2.6595744680851064e-05,
891
+ "loss": 0.1562,
892
+ "step": 126
893
+ },
894
+ {
895
+ "epoch": 0.09010287335934729,
896
+ "grad_norm": 5.700800787109856,
897
+ "learning_rate": 2.6808510638297873e-05,
898
+ "loss": 0.1637,
899
+ "step": 127
900
+ },
901
+ {
902
+ "epoch": 0.09081234480312167,
903
+ "grad_norm": 3.2343887142846954,
904
+ "learning_rate": 2.702127659574468e-05,
905
+ "loss": 0.129,
906
+ "step": 128
907
+ },
908
+ {
909
+ "epoch": 0.09152181624689606,
910
+ "grad_norm": 7.308286740876094,
911
+ "learning_rate": 2.723404255319149e-05,
912
+ "loss": 0.174,
913
+ "step": 129
914
+ },
915
+ {
916
+ "epoch": 0.09223128769067045,
917
+ "grad_norm": 2.953334456994522,
918
+ "learning_rate": 2.74468085106383e-05,
919
+ "loss": 0.1665,
920
+ "step": 130
921
+ },
922
+ {
923
+ "epoch": 0.09294075913444484,
924
+ "grad_norm": 7.863579465079018,
925
+ "learning_rate": 2.765957446808511e-05,
926
+ "loss": 0.1649,
927
+ "step": 131
928
+ },
929
+ {
930
+ "epoch": 0.09365023057821922,
931
+ "grad_norm": 10.116666038793914,
932
+ "learning_rate": 2.7872340425531914e-05,
933
+ "loss": 0.1966,
934
+ "step": 132
935
+ },
936
+ {
937
+ "epoch": 0.09435970202199362,
938
+ "grad_norm": 10.40037657354269,
939
+ "learning_rate": 2.8085106382978723e-05,
940
+ "loss": 0.2054,
941
+ "step": 133
942
+ },
943
+ {
944
+ "epoch": 0.095069173465768,
945
+ "grad_norm": 2.6057955754631337,
946
+ "learning_rate": 2.8297872340425532e-05,
947
+ "loss": 0.1495,
948
+ "step": 134
949
+ },
950
+ {
951
+ "epoch": 0.0957786449095424,
952
+ "grad_norm": 2.964782006302471,
953
+ "learning_rate": 2.851063829787234e-05,
954
+ "loss": 0.1206,
955
+ "step": 135
956
+ },
957
+ {
958
+ "epoch": 0.09648811635331678,
959
+ "grad_norm": 5.959133910397657,
960
+ "learning_rate": 2.872340425531915e-05,
961
+ "loss": 0.1816,
962
+ "step": 136
963
+ },
964
+ {
965
+ "epoch": 0.09719758779709117,
966
+ "grad_norm": 3.55759144795398,
967
+ "learning_rate": 2.8936170212765956e-05,
968
+ "loss": 0.1586,
969
+ "step": 137
970
+ },
971
+ {
972
+ "epoch": 0.09790705924086555,
973
+ "grad_norm": 1.1399173415846195,
974
+ "learning_rate": 2.9148936170212765e-05,
975
+ "loss": 0.1593,
976
+ "step": 138
977
+ },
978
+ {
979
+ "epoch": 0.09861653068463995,
980
+ "grad_norm": 5.892411282592997,
981
+ "learning_rate": 2.9361702127659574e-05,
982
+ "loss": 0.1739,
983
+ "step": 139
984
+ },
985
+ {
986
+ "epoch": 0.09932600212841433,
987
+ "grad_norm": 3.5540231225780694,
988
+ "learning_rate": 2.9574468085106383e-05,
989
+ "loss": 0.1511,
990
+ "step": 140
991
+ },
992
+ {
993
+ "epoch": 0.10003547357218871,
994
+ "grad_norm": 1.3627037465057075,
995
+ "learning_rate": 2.9787234042553192e-05,
996
+ "loss": 0.1602,
997
+ "step": 141
998
+ },
999
+ {
1000
+ "epoch": 0.10074494501596311,
1001
+ "grad_norm": 4.359910075426451,
1002
+ "learning_rate": 3e-05,
1003
+ "loss": 0.1699,
1004
+ "step": 142
1005
+ },
1006
+ {
1007
+ "epoch": 0.10145441645973749,
1008
+ "grad_norm": 7.221440560225048,
1009
+ "learning_rate": 2.9999989686275375e-05,
1010
+ "loss": 0.1921,
1011
+ "step": 143
1012
+ },
1013
+ {
1014
+ "epoch": 0.10216388790351189,
1015
+ "grad_norm": 5.3795984911945895,
1016
+ "learning_rate": 2.9999958745115665e-05,
1017
+ "loss": 0.1447,
1018
+ "step": 144
1019
+ },
1020
+ {
1021
+ "epoch": 0.10287335934728627,
1022
+ "grad_norm": 2.1612613655477424,
1023
+ "learning_rate": 2.9999907176563438e-05,
1024
+ "loss": 0.1478,
1025
+ "step": 145
1026
+ },
1027
+ {
1028
+ "epoch": 0.10358283079106066,
1029
+ "grad_norm": 5.934694080913587,
1030
+ "learning_rate": 2.9999834980689596e-05,
1031
+ "loss": 0.1732,
1032
+ "step": 146
1033
+ },
1034
+ {
1035
+ "epoch": 0.10429230223483504,
1036
+ "grad_norm": 8.428719380615808,
1037
+ "learning_rate": 2.999974215759343e-05,
1038
+ "loss": 0.1705,
1039
+ "step": 147
1040
+ },
1041
+ {
1042
+ "epoch": 0.10500177367860944,
1043
+ "grad_norm": 6.494392785741008,
1044
+ "learning_rate": 2.9999628707402574e-05,
1045
+ "loss": 0.1711,
1046
+ "step": 148
1047
+ },
1048
+ {
1049
+ "epoch": 0.10571124512238382,
1050
+ "grad_norm": 2.7373565298115503,
1051
+ "learning_rate": 2.999949463027305e-05,
1052
+ "loss": 0.1227,
1053
+ "step": 149
1054
+ },
1055
+ {
1056
+ "epoch": 0.10642071656615822,
1057
+ "grad_norm": 3.7095970629570596,
1058
+ "learning_rate": 2.9999339926389234e-05,
1059
+ "loss": 0.1541,
1060
+ "step": 150
1061
  }
1062
  ],
1063
  "logging_steps": 1,
 
1077
  "attributes": {}
1078
  }
1079
  },
1080
+ "total_flos": 97028557438976.0,
1081
  "train_batch_size": 10,
1082
  "trial_name": null,
1083
  "trial_params": null