diff --git "a/trainer_state.json" "b/trainer_state.json" --- "a/trainer_state.json" +++ "b/trainer_state.json" @@ -2,3218 +2,7718 @@ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, - "epoch": 10.0, + "epoch": 5.0, "eval_steps": 500, - "global_step": 320, + "global_step": 770, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { - "entropy": 1.179257184267044, - "epoch": 0.032, - "grad_norm": 0.6963536143302917, + "entropy": 1.1441087871789932, + "epoch": 0.006498781478472786, + "grad_norm": 0.22594086825847626, "learning_rate": 0.0002, - "loss": 2.5494184494018555, - "mean_token_accuracy": 0.5379438996315002, - "num_tokens": 80264.0, + "loss": 2.612501859664917, + "mean_token_accuracy": 0.5085290372371674, + "num_tokens": 37502.0, "step": 1 }, { - "entropy": 1.2070488929748535, - "epoch": 0.064, - "grad_norm": 0.41231992840766907, + "entropy": 1.2685535103082657, + "epoch": 0.012997562956945572, + "grad_norm": 0.1942373365163803, "learning_rate": 0.0002, - "loss": 2.0961010456085205, - "mean_token_accuracy": 0.5814267545938492, - "num_tokens": 159573.0, + "loss": 2.2667126655578613, + "mean_token_accuracy": 0.5350659266114235, + "num_tokens": 75406.0, "step": 2 }, { - "entropy": 1.324254333972931, - "epoch": 0.096, - "grad_norm": 0.40169844031333923, + "entropy": 1.4654520899057388, + "epoch": 0.01949634443541836, + "grad_norm": 0.13897432386875153, "learning_rate": 0.0002, - "loss": 1.8021230697631836, - "mean_token_accuracy": 0.595734030008316, - "num_tokens": 237543.0, + "loss": 1.8304898738861084, + "mean_token_accuracy": 0.5590623021125793, + "num_tokens": 112903.0, "step": 3 }, { - "entropy": 1.363574594259262, - "epoch": 0.128, - "grad_norm": 0.37209051847457886, + "entropy": 1.4532236605882645, + "epoch": 0.025995125913891144, + "grad_norm": 0.11201836168766022, "learning_rate": 0.0002, - "loss": 1.554048776626587, - "mean_token_accuracy": 0.6193354427814484, - "num_tokens": 316870.0, + "loss": 1.496299147605896, + "mean_token_accuracy": 0.6046230122447014, + "num_tokens": 150359.0, "step": 4 }, { - "entropy": 1.3551697731018066, - "epoch": 0.16, - "grad_norm": 0.22899997234344482, + "entropy": 1.4331371188163757, + "epoch": 0.03249390739236393, + "grad_norm": 0.14954882860183716, "learning_rate": 0.0002, - "loss": 1.4150879383087158, - "mean_token_accuracy": 0.6334295570850372, - "num_tokens": 395448.0, + "loss": 1.3865656852722168, + "mean_token_accuracy": 0.6091600209474564, + "num_tokens": 187830.0, "step": 5 }, { - "entropy": 1.3589494228363037, - "epoch": 0.192, - "grad_norm": 0.1690169870853424, + "entropy": 1.3669009655714035, + "epoch": 0.03899268887083672, + "grad_norm": 0.09565649181604385, "learning_rate": 0.0002, - "loss": 1.2825372219085693, - "mean_token_accuracy": 0.6543458849191666, - "num_tokens": 473668.0, + "loss": 1.2659735679626465, + "mean_token_accuracy": 0.6358497440814972, + "num_tokens": 225297.0, "step": 6 }, { - "entropy": 1.3066083192825317, - "epoch": 0.224, - "grad_norm": 0.12765775620937347, + "entropy": 1.2914617359638214, + "epoch": 0.045491470349309504, + "grad_norm": 0.0539422333240509, "learning_rate": 0.0002, - "loss": 1.1806933879852295, - "mean_token_accuracy": 0.6675450056791306, - "num_tokens": 552353.0, + "loss": 1.1662700176239014, + "mean_token_accuracy": 0.6492680311203003, + "num_tokens": 262906.0, "step": 7 }, { - "entropy": 1.267838329076767, - "epoch": 0.256, - "grad_norm": 0.13029053807258606, + "entropy": 1.249274119734764, + "epoch": 0.05199025182778229, + "grad_norm": 0.051388416439294815, "learning_rate": 0.0002, - "loss": 1.1103739738464355, - "mean_token_accuracy": 0.6742708086967468, - "num_tokens": 631720.0, + "loss": 1.1255854368209839, + "mean_token_accuracy": 0.6475581750273705, + "num_tokens": 300403.0, "step": 8 }, { - "entropy": 1.2157377302646637, - "epoch": 0.288, - "grad_norm": 0.1366051882505417, + "entropy": 1.1595238000154495, + "epoch": 0.05848903330625508, + "grad_norm": 0.057235199958086014, "learning_rate": 0.0002, - "loss": 1.0521275997161865, - "mean_token_accuracy": 0.6783442795276642, - "num_tokens": 710686.0, + "loss": 1.0490708351135254, + "mean_token_accuracy": 0.6654231324791908, + "num_tokens": 337487.0, "step": 9 }, { - "entropy": 1.1331250071525574, - "epoch": 0.32, - "grad_norm": 0.14982439577579498, + "entropy": 1.0685205161571503, + "epoch": 0.06498781478472786, + "grad_norm": 0.0577155165374279, "learning_rate": 0.0002, - "loss": 0.9696346521377563, - "mean_token_accuracy": 0.6991669833660126, - "num_tokens": 789991.0, + "loss": 0.97551429271698, + "mean_token_accuracy": 0.6776877418160439, + "num_tokens": 374847.0, "step": 10 }, { - "entropy": 1.0510872900485992, - "epoch": 0.352, - "grad_norm": 0.11349732428789139, + "entropy": 0.9968453124165535, + "epoch": 0.07148659626320066, + "grad_norm": 0.04976983740925789, "learning_rate": 0.0002, - "loss": 0.9087550640106201, - "mean_token_accuracy": 0.7059329897165298, - "num_tokens": 869400.0, + "loss": 0.9292951822280884, + "mean_token_accuracy": 0.6831405088305473, + "num_tokens": 412186.0, "step": 11 }, { - "entropy": 0.947733610868454, - "epoch": 0.384, - "grad_norm": 0.08895156532526016, + "entropy": 0.9424244612455368, + "epoch": 0.07798537774167344, + "grad_norm": 0.37462693452835083, "learning_rate": 0.0002, - "loss": 0.8525652885437012, - "mean_token_accuracy": 0.7165533006191254, - "num_tokens": 950044.0, + "loss": 0.8883110284805298, + "mean_token_accuracy": 0.6893546730279922, + "num_tokens": 449659.0, "step": 12 }, { - "entropy": 0.8823248594999313, - "epoch": 0.416, - "grad_norm": 0.08783440291881561, + "entropy": 0.9025738090276718, + "epoch": 0.08448415922014622, + "grad_norm": 0.04783688113093376, "learning_rate": 0.0002, - "loss": 0.8236583471298218, - "mean_token_accuracy": 0.7169439494609833, - "num_tokens": 1030182.0, + "loss": 0.8548192977905273, + "mean_token_accuracy": 0.6972228810191154, + "num_tokens": 487236.0, "step": 13 }, { - "entropy": 0.8259010016918182, - "epoch": 0.448, - "grad_norm": 0.10150616616010666, + "entropy": 0.8390183448791504, + "epoch": 0.09098294069861901, + "grad_norm": 0.06745485961437225, "learning_rate": 0.0002, - "loss": 0.8072782754898071, - "mean_token_accuracy": 0.719487190246582, - "num_tokens": 1108491.0, + "loss": 0.8280504941940308, + "mean_token_accuracy": 0.7010790929198265, + "num_tokens": 524798.0, "step": 14 }, { - "entropy": 0.7661050707101822, - "epoch": 0.48, - "grad_norm": 0.0986262708902359, + "entropy": 0.7939982861280441, + "epoch": 0.09748172217709179, + "grad_norm": 0.10931341350078583, "learning_rate": 0.0002, - "loss": 0.7692936062812805, - "mean_token_accuracy": 0.7283643782138824, - "num_tokens": 1186724.0, + "loss": 0.8073402643203735, + "mean_token_accuracy": 0.702845998108387, + "num_tokens": 561826.0, "step": 15 }, { - "entropy": 0.7517514675855637, - "epoch": 0.512, - "grad_norm": 0.09310254454612732, + "entropy": 0.762756697833538, + "epoch": 0.10398050365556458, + "grad_norm": 0.03783512860536575, "learning_rate": 0.0002, - "loss": 0.7523272037506104, - "mean_token_accuracy": 0.7260711044073105, - "num_tokens": 1264323.0, + "loss": 0.7596306800842285, + "mean_token_accuracy": 0.7148320376873016, + "num_tokens": 599249.0, "step": 16 }, { - "entropy": 0.7328858375549316, - "epoch": 0.544, - "grad_norm": 0.0957314595580101, + "entropy": 0.7585324719548225, + "epoch": 0.11047928513403736, + "grad_norm": 0.039289139211177826, "learning_rate": 0.0002, - "loss": 0.7284715175628662, - "mean_token_accuracy": 0.7308152616024017, - "num_tokens": 1342220.0, + "loss": 0.7472726106643677, + "mean_token_accuracy": 0.7169229537248611, + "num_tokens": 636495.0, "step": 17 }, { - "entropy": 0.719617024064064, - "epoch": 0.576, - "grad_norm": 0.08244957029819489, + "entropy": 0.7434245273470879, + "epoch": 0.11697806661251016, + "grad_norm": 0.04286178946495056, "learning_rate": 0.0002, - "loss": 0.7138073444366455, - "mean_token_accuracy": 0.7331701219081879, - "num_tokens": 1419705.0, + "loss": 0.7349382638931274, + "mean_token_accuracy": 0.7195246070623398, + "num_tokens": 674172.0, "step": 18 }, { - "entropy": 0.6748920828104019, - "epoch": 0.608, - "grad_norm": 0.08215262740850449, + "entropy": 0.7307169139385223, + "epoch": 0.12347684809098294, + "grad_norm": 0.03696495294570923, "learning_rate": 0.0002, - "loss": 0.6698633432388306, - "mean_token_accuracy": 0.7485965937376022, - "num_tokens": 1500069.0, + "loss": 0.7205268144607544, + "mean_token_accuracy": 0.7222909703850746, + "num_tokens": 711746.0, "step": 19 }, { - "entropy": 0.6863600462675095, - "epoch": 0.64, - "grad_norm": 0.07416888326406479, + "entropy": 0.724890224635601, + "epoch": 0.12997562956945571, + "grad_norm": 0.03647635132074356, "learning_rate": 0.0002, - "loss": 0.683246374130249, - "mean_token_accuracy": 0.7402395009994507, - "num_tokens": 1578246.0, + "loss": 0.7131904363632202, + "mean_token_accuracy": 0.7218770682811737, + "num_tokens": 748966.0, "step": 20 }, { - "entropy": 0.6788438856601715, - "epoch": 0.672, - "grad_norm": 0.06753385812044144, + "entropy": 0.7279537171125412, + "epoch": 0.1364744110479285, + "grad_norm": 0.033042650669813156, "learning_rate": 0.0002, - "loss": 0.6719948053359985, - "mean_token_accuracy": 0.7404156625270844, - "num_tokens": 1656022.0, + "loss": 0.7094431519508362, + "mean_token_accuracy": 0.7240697368979454, + "num_tokens": 786631.0, "step": 21 }, { - "entropy": 0.6713939607143402, - "epoch": 0.704, - "grad_norm": 0.06065193563699722, + "entropy": 0.7210045382380486, + "epoch": 0.1429731925264013, + "grad_norm": 0.033061351627111435, "learning_rate": 0.0002, - "loss": 0.6523999571800232, - "mean_token_accuracy": 0.7474960833787918, - "num_tokens": 1734582.0, + "loss": 0.7019110918045044, + "mean_token_accuracy": 0.7280351296067238, + "num_tokens": 823906.0, "step": 22 }, { - "entropy": 0.6675977408885956, - "epoch": 0.736, - "grad_norm": 0.06263108551502228, + "entropy": 0.6902946382761002, + "epoch": 0.14947197400487408, + "grad_norm": 0.03491866961121559, "learning_rate": 0.0002, - "loss": 0.649960994720459, - "mean_token_accuracy": 0.7477194517850876, - "num_tokens": 1813025.0, + "loss": 0.683687150478363, + "mean_token_accuracy": 0.7348670437932014, + "num_tokens": 860977.0, "step": 23 }, { - "entropy": 0.6574471294879913, - "epoch": 0.768, - "grad_norm": 0.06619945168495178, + "entropy": 0.6839202269911766, + "epoch": 0.15597075548334688, + "grad_norm": 0.030243346467614174, "learning_rate": 0.0002, - "loss": 0.639019250869751, - "mean_token_accuracy": 0.7521554976701736, - "num_tokens": 1891103.0, + "loss": 0.673778772354126, + "mean_token_accuracy": 0.7354807555675507, + "num_tokens": 898933.0, "step": 24 }, { - "entropy": 0.649686262011528, - "epoch": 0.8, - "grad_norm": 0.054676756262779236, + "entropy": 0.6664924547076225, + "epoch": 0.16246953696181965, + "grad_norm": 0.026247479021549225, "learning_rate": 0.0002, - "loss": 0.6350966691970825, - "mean_token_accuracy": 0.752074345946312, - "num_tokens": 1969423.0, + "loss": 0.6572352051734924, + "mean_token_accuracy": 0.7394573912024498, + "num_tokens": 935795.0, "step": 25 }, { - "entropy": 0.6216799467802048, - "epoch": 0.832, - "grad_norm": 0.053581204265356064, + "entropy": 0.6681515946984291, + "epoch": 0.16896831844029245, + "grad_norm": 0.03119724616408348, "learning_rate": 0.0002, - "loss": 0.613818883895874, - "mean_token_accuracy": 0.7612275779247284, - "num_tokens": 2048674.0, + "loss": 0.6646086573600769, + "mean_token_accuracy": 0.7379100769758224, + "num_tokens": 973280.0, "step": 26 }, { - "entropy": 0.609996572136879, - "epoch": 0.864, - "grad_norm": 0.06112146005034447, + "entropy": 0.6617112681269646, + "epoch": 0.17546709991876522, + "grad_norm": 0.031551606953144073, "learning_rate": 0.0002, - "loss": 0.6045517325401306, - "mean_token_accuracy": 0.766285240650177, - "num_tokens": 2127851.0, + "loss": 0.6585603952407837, + "mean_token_accuracy": 0.7389705181121826, + "num_tokens": 1010622.0, "step": 27 }, { - "entropy": 0.6208399832248688, - "epoch": 0.896, - "grad_norm": 0.05334703251719475, + "entropy": 0.6501665636897087, + "epoch": 0.18196588139723802, + "grad_norm": 0.02211320586502552, "learning_rate": 0.0002, - "loss": 0.6149610877037048, - "mean_token_accuracy": 0.7601087689399719, - "num_tokens": 2206708.0, + "loss": 0.6490904092788696, + "mean_token_accuracy": 0.7440381571650505, + "num_tokens": 1047900.0, "step": 28 }, { - "entropy": 0.5961938500404358, - "epoch": 0.928, - "grad_norm": 0.05678229779005051, + "entropy": 0.6470993533730507, + "epoch": 0.18846466287571081, + "grad_norm": 0.027688423171639442, "learning_rate": 0.0002, - "loss": 0.5941039323806763, - "mean_token_accuracy": 0.768301397562027, - "num_tokens": 2286280.0, + "loss": 0.6543895602226257, + "mean_token_accuracy": 0.7402380779385567, + "num_tokens": 1085392.0, "step": 29 }, { - "entropy": 0.5905821919441223, - "epoch": 0.96, - "grad_norm": 0.05276153236627579, + "entropy": 0.6416624039411545, + "epoch": 0.19496344435418358, + "grad_norm": 0.025217361748218536, "learning_rate": 0.0002, - "loss": 0.5909000039100647, - "mean_token_accuracy": 0.7674511522054672, - "num_tokens": 2365563.0, + "loss": 0.651384711265564, + "mean_token_accuracy": 0.7433382496237755, + "num_tokens": 1122465.0, "step": 30 }, { - "entropy": 0.6017148941755295, - "epoch": 0.992, - "grad_norm": 0.04250482842326164, + "entropy": 0.6523652598261833, + "epoch": 0.20146222583265638, + "grad_norm": 0.025227373465895653, "learning_rate": 0.0002, - "loss": 0.602470874786377, - "mean_token_accuracy": 0.7644271552562714, - "num_tokens": 2444186.0, + "loss": 0.6592613458633423, + "mean_token_accuracy": 0.7378358989953995, + "num_tokens": 1160451.0, "step": 31 }, { - "entropy": 0.5969142913818359, - "epoch": 1.0, - "grad_norm": 0.056718822568655014, + "entropy": 0.6369072422385216, + "epoch": 0.20796100731112915, + "grad_norm": 0.021375838667154312, "learning_rate": 0.0002, - "loss": 0.5996057987213135, - "mean_token_accuracy": 0.7648024559020996, - "num_tokens": 2463804.0, + "loss": 0.6419180631637573, + "mean_token_accuracy": 0.7449744045734406, + "num_tokens": 1198041.0, "step": 32 }, { - "entropy": 0.5890887081623077, - "epoch": 1.032, - "grad_norm": 0.053444478660821915, + "entropy": 0.6256191805005074, + "epoch": 0.21445978878960195, + "grad_norm": 0.03092559427022934, "learning_rate": 0.0002, - "loss": 0.5883615016937256, - "mean_token_accuracy": 0.7671252638101578, - "num_tokens": 2544202.0, + "loss": 0.6407320499420166, + "mean_token_accuracy": 0.7460681945085526, + "num_tokens": 1235291.0, "step": 33 }, { - "entropy": 0.5835496038198471, - "epoch": 1.064, - "grad_norm": 0.053636617958545685, + "entropy": 0.6299648508429527, + "epoch": 0.22095857026807472, + "grad_norm": 0.021124541759490967, "learning_rate": 0.0002, - "loss": 0.581194281578064, - "mean_token_accuracy": 0.7708244174718857, - "num_tokens": 2623607.0, + "loss": 0.6359473466873169, + "mean_token_accuracy": 0.7471542730927467, + "num_tokens": 1272686.0, "step": 34 }, { - "entropy": 0.6006538420915604, - "epoch": 1.096, - "grad_norm": 0.043986763805150986, + "entropy": 0.6513500586152077, + "epoch": 0.22745735174654752, + "grad_norm": 0.020855363458395004, "learning_rate": 0.0002, - "loss": 0.5970234870910645, - "mean_token_accuracy": 0.7643807381391525, - "num_tokens": 2701501.0, + "loss": 0.6451584100723267, + "mean_token_accuracy": 0.7422506660223007, + "num_tokens": 1310182.0, "step": 35 }, { - "entropy": 0.5842598974704742, - "epoch": 1.1280000000000001, - "grad_norm": 0.039326492697000504, + "entropy": 0.6261186450719833, + "epoch": 0.23395613322502032, + "grad_norm": 0.019606754183769226, "learning_rate": 0.0002, - "loss": 0.5772466659545898, - "mean_token_accuracy": 0.7730486690998077, - "num_tokens": 2779960.0, + "loss": 0.6181178092956543, + "mean_token_accuracy": 0.7557711079716682, + "num_tokens": 1347558.0, "step": 36 }, { - "entropy": 0.5868044942617416, - "epoch": 1.16, - "grad_norm": 0.03627580776810646, + "entropy": 0.6535262390971184, + "epoch": 0.2404549147034931, + "grad_norm": 0.016229776665568352, "learning_rate": 0.0002, - "loss": 0.5823642015457153, - "mean_token_accuracy": 0.7698265165090561, - "num_tokens": 2858358.0, + "loss": 0.6474911570549011, + "mean_token_accuracy": 0.7401541844010353, + "num_tokens": 1385217.0, "step": 37 }, { - "entropy": 0.584501713514328, - "epoch": 1.192, - "grad_norm": 0.03921157494187355, + "entropy": 0.6392895579338074, + "epoch": 0.2469536961819659, + "grad_norm": 0.01589571312069893, "learning_rate": 0.0002, - "loss": 0.5830175280570984, - "mean_token_accuracy": 0.7707354426383972, - "num_tokens": 2937490.0, + "loss": 0.6345689296722412, + "mean_token_accuracy": 0.7464647218585014, + "num_tokens": 1422439.0, "step": 38 }, { - "entropy": 0.572060227394104, - "epoch": 1.224, - "grad_norm": 0.036492444574832916, + "entropy": 0.6444704979658127, + "epoch": 0.25345247766043866, + "grad_norm": 0.019169991835951805, "learning_rate": 0.0002, - "loss": 0.5748717784881592, - "mean_token_accuracy": 0.7743632346391678, - "num_tokens": 3015145.0, + "loss": 0.6417882442474365, + "mean_token_accuracy": 0.7431693077087402, + "num_tokens": 1459951.0, "step": 39 }, { - "entropy": 0.5737735033035278, - "epoch": 1.256, - "grad_norm": 0.0318453311920166, + "entropy": 0.6366401016712189, + "epoch": 0.25995125913891143, + "grad_norm": 0.016541991382837296, "learning_rate": 0.0002, - "loss": 0.5738308429718018, - "mean_token_accuracy": 0.7725711613893509, - "num_tokens": 3094640.0, + "loss": 0.6387360095977783, + "mean_token_accuracy": 0.7458900958299637, + "num_tokens": 1497263.0, "step": 40 }, { - "entropy": 0.5824941098690033, - "epoch": 1.288, - "grad_norm": 0.03465260937809944, + "entropy": 0.6309419572353363, + "epoch": 0.26645004061738425, + "grad_norm": 0.02144729532301426, "learning_rate": 0.0002, - "loss": 0.5811444520950317, - "mean_token_accuracy": 0.7699832618236542, - "num_tokens": 3173371.0, + "loss": 0.635954737663269, + "mean_token_accuracy": 0.7469696402549744, + "num_tokens": 1534631.0, "step": 41 }, { - "entropy": 0.5671045929193497, - "epoch": 1.32, - "grad_norm": 0.026680685579776764, + "entropy": 0.6426582857966423, + "epoch": 0.272948822095857, + "grad_norm": 0.017918268218636513, "learning_rate": 0.0002, - "loss": 0.561556875705719, - "mean_token_accuracy": 0.7784358263015747, - "num_tokens": 3252583.0, + "loss": 0.6445891261100769, + "mean_token_accuracy": 0.7427951768040657, + "num_tokens": 1572110.0, "step": 42 }, { - "entropy": 0.5744841694831848, - "epoch": 1.3519999999999999, - "grad_norm": 0.030942633748054504, + "entropy": 0.6238497421145439, + "epoch": 0.2794476035743298, + "grad_norm": 0.016322394832968712, "learning_rate": 0.0002, - "loss": 0.5703052282333374, - "mean_token_accuracy": 0.7730769366025925, - "num_tokens": 3332485.0, + "loss": 0.6238967180252075, + "mean_token_accuracy": 0.7503543570637703, + "num_tokens": 1608997.0, "step": 43 }, { - "entropy": 0.5706202536821365, - "epoch": 1.384, - "grad_norm": 0.03452180325984955, + "entropy": 0.6374280378222466, + "epoch": 0.2859463850528026, + "grad_norm": 0.0153085608035326, "learning_rate": 0.0002, - "loss": 0.5691436529159546, - "mean_token_accuracy": 0.7742962390184402, - "num_tokens": 3411148.0, + "loss": 0.6364343762397766, + "mean_token_accuracy": 0.745714507997036, + "num_tokens": 1646556.0, "step": 44 }, { - "entropy": 0.5706360638141632, - "epoch": 1.416, - "grad_norm": 0.02981080673635006, + "entropy": 0.6222607344388962, + "epoch": 0.2924451665312754, + "grad_norm": 0.016996094956994057, "learning_rate": 0.0002, - "loss": 0.5676863193511963, - "mean_token_accuracy": 0.7751949429512024, - "num_tokens": 3490105.0, + "loss": 0.6201090812683105, + "mean_token_accuracy": 0.7516758143901825, + "num_tokens": 1683700.0, "step": 45 }, { - "entropy": 0.573886975646019, - "epoch": 1.448, - "grad_norm": 0.03274830803275108, + "entropy": 0.636712834239006, + "epoch": 0.29894394800974816, + "grad_norm": 0.016749687492847443, "learning_rate": 0.0002, - "loss": 0.5683993697166443, - "mean_token_accuracy": 0.7725706845521927, - "num_tokens": 3569059.0, + "loss": 0.6368897557258606, + "mean_token_accuracy": 0.746493011713028, + "num_tokens": 1720661.0, "step": 46 }, { - "entropy": 0.5753068625926971, - "epoch": 1.48, - "grad_norm": 0.027408910915255547, + "entropy": 0.6459397748112679, + "epoch": 0.30544272948822093, + "grad_norm": 0.011651836335659027, "learning_rate": 0.0002, - "loss": 0.5700199604034424, - "mean_token_accuracy": 0.7736819535493851, - "num_tokens": 3647511.0, + "loss": 0.6419233083724976, + "mean_token_accuracy": 0.7443490549921989, + "num_tokens": 1758131.0, "step": 47 }, { - "entropy": 0.5750648379325867, - "epoch": 1.512, - "grad_norm": 0.02696501836180687, + "entropy": 0.6379885226488113, + "epoch": 0.31194151096669376, + "grad_norm": 0.013901753351092339, "learning_rate": 0.0002, - "loss": 0.5703588724136353, - "mean_token_accuracy": 0.7729254961013794, - "num_tokens": 3726951.0, + "loss": 0.6361222267150879, + "mean_token_accuracy": 0.746205136179924, + "num_tokens": 1795397.0, "step": 48 }, { - "entropy": 0.5790549218654633, - "epoch": 1.544, - "grad_norm": 0.02991427481174469, + "entropy": 0.6377697363495827, + "epoch": 0.31844029244516653, + "grad_norm": 0.014066919684410095, "learning_rate": 0.0002, - "loss": 0.5785025358200073, - "mean_token_accuracy": 0.7707958817481995, - "num_tokens": 3804732.0, + "loss": 0.6356197595596313, + "mean_token_accuracy": 0.7455531656742096, + "num_tokens": 1832991.0, "step": 49 }, { - "entropy": 0.5549423545598984, - "epoch": 1.576, - "grad_norm": 0.03170735761523247, + "entropy": 0.6351528614759445, + "epoch": 0.3249390739236393, + "grad_norm": 0.013286196626722813, "learning_rate": 0.0002, - "loss": 0.5581924319267273, - "mean_token_accuracy": 0.7788972407579422, - "num_tokens": 3884688.0, + "loss": 0.6371215581893921, + "mean_token_accuracy": 0.7454295605421066, + "num_tokens": 1870273.0, "step": 50 }, { - "entropy": 0.568594440817833, - "epoch": 1.608, - "grad_norm": 0.025594916194677353, + "entropy": 0.6069519519805908, + "epoch": 0.3314378554021121, + "grad_norm": 0.013732723891735077, "learning_rate": 0.0002, - "loss": 0.5706242322921753, - "mean_token_accuracy": 0.7738734632730484, - "num_tokens": 3964161.0, + "loss": 0.6103472709655762, + "mean_token_accuracy": 0.7536283582448959, + "num_tokens": 1907528.0, "step": 51 }, { - "entropy": 0.5575809478759766, - "epoch": 1.6400000000000001, - "grad_norm": 0.025340234860777855, + "entropy": 0.6297546997666359, + "epoch": 0.3379366368805849, + "grad_norm": 0.013711776584386826, "learning_rate": 0.0002, - "loss": 0.5602903962135315, - "mean_token_accuracy": 0.7778308838605881, - "num_tokens": 4043157.0, + "loss": 0.6334048509597778, + "mean_token_accuracy": 0.745865486562252, + "num_tokens": 1945255.0, "step": 52 }, { - "entropy": 0.5458956509828568, - "epoch": 1.6720000000000002, - "grad_norm": 0.02706434205174446, + "entropy": 0.6280607059597969, + "epoch": 0.34443541835905767, + "grad_norm": 0.01293123047798872, "learning_rate": 0.0002, - "loss": 0.5461863875389099, - "mean_token_accuracy": 0.78243587911129, - "num_tokens": 4123675.0, + "loss": 0.6310492753982544, + "mean_token_accuracy": 0.7467462942004204, + "num_tokens": 1982630.0, "step": 53 }, { - "entropy": 0.5649830847978592, - "epoch": 1.704, - "grad_norm": 0.030553704127669334, + "entropy": 0.6271316409111023, + "epoch": 0.35093419983753044, + "grad_norm": 0.01478263083845377, "learning_rate": 0.0002, - "loss": 0.5619728565216064, - "mean_token_accuracy": 0.7764615267515182, - "num_tokens": 4202826.0, + "loss": 0.6254487037658691, + "mean_token_accuracy": 0.7497461065649986, + "num_tokens": 2020399.0, "step": 54 }, { - "entropy": 0.5686902850866318, - "epoch": 1.736, - "grad_norm": 0.02532677724957466, + "entropy": 0.6377271711826324, + "epoch": 0.35743298131600326, + "grad_norm": 0.013956044800579548, "learning_rate": 0.0002, - "loss": 0.5656942129135132, - "mean_token_accuracy": 0.7758781611919403, - "num_tokens": 4281411.0, + "loss": 0.6360988020896912, + "mean_token_accuracy": 0.7437145560979843, + "num_tokens": 2057803.0, "step": 55 }, { - "entropy": 0.5654756128787994, - "epoch": 1.768, - "grad_norm": 0.032251086086034775, + "entropy": 0.6247914582490921, + "epoch": 0.36393176279447603, + "grad_norm": 0.014322548173367977, "learning_rate": 0.0002, - "loss": 0.5603655576705933, - "mean_token_accuracy": 0.7777776569128036, - "num_tokens": 4361042.0, + "loss": 0.6240888833999634, + "mean_token_accuracy": 0.7484056130051613, + "num_tokens": 2094784.0, "step": 56 }, { - "entropy": 0.5811332762241364, - "epoch": 1.8, - "grad_norm": 0.0319007970392704, + "entropy": 0.6302464827895164, + "epoch": 0.3704305442729488, + "grad_norm": 0.011746145784854889, "learning_rate": 0.0002, - "loss": 0.576663613319397, - "mean_token_accuracy": 0.77076855301857, - "num_tokens": 4438720.0, + "loss": 0.633884608745575, + "mean_token_accuracy": 0.7437854781746864, + "num_tokens": 2132466.0, "step": 57 }, { - "entropy": 0.5682029575109482, - "epoch": 1.8319999999999999, - "grad_norm": 0.026807347312569618, + "entropy": 0.6274847015738487, + "epoch": 0.37692932575142163, + "grad_norm": 0.013853202573955059, "learning_rate": 0.0002, - "loss": 0.564788818359375, - "mean_token_accuracy": 0.7736650556325912, - "num_tokens": 4515989.0, + "loss": 0.6355714797973633, + "mean_token_accuracy": 0.7430111691355705, + "num_tokens": 2169906.0, "step": 58 }, { - "entropy": 0.5706409513950348, - "epoch": 1.8639999999999999, - "grad_norm": 0.02681436389684677, + "entropy": 0.6265148296952248, + "epoch": 0.3834281072298944, + "grad_norm": 0.01277268398553133, "learning_rate": 0.0002, - "loss": 0.5666987895965576, - "mean_token_accuracy": 0.7743194103240967, - "num_tokens": 4594420.0, + "loss": 0.6335763335227966, + "mean_token_accuracy": 0.7446934059262276, + "num_tokens": 2207365.0, "step": 59 }, { - "entropy": 0.5729261785745621, - "epoch": 1.896, - "grad_norm": 0.030915573239326477, + "entropy": 0.6214065626263618, + "epoch": 0.38992688870836717, + "grad_norm": 0.010742721147835255, "learning_rate": 0.0002, - "loss": 0.5717182159423828, - "mean_token_accuracy": 0.7706410437822342, - "num_tokens": 4671835.0, + "loss": 0.6200428009033203, + "mean_token_accuracy": 0.748136468231678, + "num_tokens": 2244334.0, "step": 60 }, { - "entropy": 0.5693814009428024, - "epoch": 1.928, - "grad_norm": 0.022914232686161995, + "entropy": 0.6408857852220535, + "epoch": 0.39642567018683994, + "grad_norm": 0.011468583717942238, "learning_rate": 0.0002, - "loss": 0.5684123039245605, - "mean_token_accuracy": 0.7722501307725906, - "num_tokens": 4749804.0, + "loss": 0.6358450651168823, + "mean_token_accuracy": 0.7437937930226326, + "num_tokens": 2281670.0, "step": 61 }, { - "entropy": 0.5578709542751312, - "epoch": 1.96, - "grad_norm": 0.02405908890068531, + "entropy": 0.6396703198552132, + "epoch": 0.40292445166531277, + "grad_norm": 0.011673662811517715, "learning_rate": 0.0002, - "loss": 0.5572571158409119, - "mean_token_accuracy": 0.7781909555196762, - "num_tokens": 4828428.0, + "loss": 0.6363998651504517, + "mean_token_accuracy": 0.7431989163160324, + "num_tokens": 2318924.0, "step": 62 }, { - "entropy": 0.5615971833467484, - "epoch": 1.992, - "grad_norm": 0.019845224916934967, + "entropy": 0.6249052062630653, + "epoch": 0.40942323314378554, + "grad_norm": 0.0118953175842762, "learning_rate": 0.0002, - "loss": 0.5606215000152588, - "mean_token_accuracy": 0.7773871868848801, - "num_tokens": 4907477.0, + "loss": 0.6213114261627197, + "mean_token_accuracy": 0.7500982582569122, + "num_tokens": 2356317.0, "step": 63 }, { - "entropy": 0.5601226091384888, - "epoch": 2.0, - "grad_norm": 0.03756139427423477, + "entropy": 0.6271346360445023, + "epoch": 0.4159220146222583, + "grad_norm": 0.012425282970070839, "learning_rate": 0.0002, - "loss": 0.5584151744842529, - "mean_token_accuracy": 0.7765219211578369, - "num_tokens": 4927777.0, + "loss": 0.6213847398757935, + "mean_token_accuracy": 0.7495132237672806, + "num_tokens": 2393601.0, "step": 64 }, { - "entropy": 0.5674517601728439, - "epoch": 2.032, - "grad_norm": 0.025153273716568947, + "entropy": 0.629973016679287, + "epoch": 0.42242079610073113, + "grad_norm": 0.011852126568555832, "learning_rate": 0.0002, - "loss": 0.5689207315444946, - "mean_token_accuracy": 0.7721648663282394, - "num_tokens": 5005271.0, + "loss": 0.6328772306442261, + "mean_token_accuracy": 0.7433357834815979, + "num_tokens": 2430713.0, "step": 65 }, { - "entropy": 0.5618810504674911, - "epoch": 2.064, - "grad_norm": 0.02671828307211399, + "entropy": 0.625373125076294, + "epoch": 0.4289195775792039, + "grad_norm": 0.011082636192440987, "learning_rate": 0.0002, - "loss": 0.5602548122406006, - "mean_token_accuracy": 0.7760673761367798, - "num_tokens": 5084150.0, + "loss": 0.6278108954429626, + "mean_token_accuracy": 0.7462311089038849, + "num_tokens": 2468332.0, "step": 66 }, { - "entropy": 0.5582772195339203, - "epoch": 2.096, - "grad_norm": 0.021926281973719597, + "entropy": 0.6213006973266602, + "epoch": 0.4354183590576767, + "grad_norm": 0.012099278159439564, "learning_rate": 0.0002, - "loss": 0.5541115999221802, - "mean_token_accuracy": 0.7796459347009659, - "num_tokens": 5164221.0, + "loss": 0.6325806975364685, + "mean_token_accuracy": 0.748037800192833, + "num_tokens": 2505751.0, "step": 67 }, { - "entropy": 0.5672923773527145, - "epoch": 2.128, - "grad_norm": 0.024038124829530716, + "entropy": 0.6149301454424858, + "epoch": 0.44191714053614944, + "grad_norm": 0.011624482460319996, "learning_rate": 0.0002, - "loss": 0.5617194771766663, - "mean_token_accuracy": 0.7748870551586151, - "num_tokens": 5243027.0, + "loss": 0.6194391250610352, + "mean_token_accuracy": 0.7509394213557243, + "num_tokens": 2543314.0, "step": 68 }, { - "entropy": 0.5639302432537079, - "epoch": 2.16, - "grad_norm": 0.02486521564424038, + "entropy": 0.6199035122990608, + "epoch": 0.44841592201462227, + "grad_norm": 0.010423528961837292, "learning_rate": 0.0002, - "loss": 0.5582059025764465, - "mean_token_accuracy": 0.7770267874002457, - "num_tokens": 5322184.0, + "loss": 0.6224488615989685, + "mean_token_accuracy": 0.749529704451561, + "num_tokens": 2580776.0, "step": 69 }, { - "entropy": 0.5651180893182755, - "epoch": 2.192, - "grad_norm": 0.025982394814491272, + "entropy": 0.6317284181714058, + "epoch": 0.45491470349309504, + "grad_norm": 0.010865025222301483, "learning_rate": 0.0002, - "loss": 0.5584880113601685, - "mean_token_accuracy": 0.7765491008758545, - "num_tokens": 5399749.0, + "loss": 0.6270354986190796, + "mean_token_accuracy": 0.7461089566349983, + "num_tokens": 2618167.0, "step": 70 }, { - "entropy": 0.5606539249420166, - "epoch": 2.224, - "grad_norm": 0.024214768782258034, + "entropy": 0.6248530969023705, + "epoch": 0.4614134849715678, + "grad_norm": 0.010545512661337852, "learning_rate": 0.0002, - "loss": 0.5596858263015747, - "mean_token_accuracy": 0.7755280286073685, - "num_tokens": 5478994.0, + "loss": 0.6243047714233398, + "mean_token_accuracy": 0.7491967007517815, + "num_tokens": 2655748.0, "step": 71 }, { - "entropy": 0.5572450906038284, - "epoch": 2.2560000000000002, - "grad_norm": 0.024621082469820976, + "entropy": 0.6242939457297325, + "epoch": 0.46791226645004064, + "grad_norm": 0.01175450999289751, "learning_rate": 0.0002, - "loss": 0.5587051510810852, - "mean_token_accuracy": 0.7774072885513306, - "num_tokens": 5558167.0, + "loss": 0.6177983283996582, + "mean_token_accuracy": 0.7500801458954811, + "num_tokens": 2693338.0, "step": 72 }, { - "entropy": 0.5469658970832825, - "epoch": 2.288, - "grad_norm": 0.02560459077358246, + "entropy": 0.6458104699850082, + "epoch": 0.4744110479285134, + "grad_norm": 0.009623173624277115, "learning_rate": 0.0002, - "loss": 0.5509265661239624, - "mean_token_accuracy": 0.780618280172348, - "num_tokens": 5637131.0, + "loss": 0.6407941579818726, + "mean_token_accuracy": 0.7437473684549332, + "num_tokens": 2730673.0, "step": 73 }, { - "entropy": 0.5541262030601501, - "epoch": 2.32, - "grad_norm": 0.02317582443356514, + "entropy": 0.6289036273956299, + "epoch": 0.4809098294069862, + "grad_norm": 0.010831008665263653, "learning_rate": 0.0002, - "loss": 0.5573158264160156, - "mean_token_accuracy": 0.7776470184326172, - "num_tokens": 5714968.0, + "loss": 0.6292392015457153, + "mean_token_accuracy": 0.749647282063961, + "num_tokens": 2768101.0, "step": 74 }, { - "entropy": 0.5666017383337021, - "epoch": 2.352, - "grad_norm": 0.02768876403570175, + "entropy": 0.6329901814460754, + "epoch": 0.487408610885459, + "grad_norm": 0.013034787029027939, "learning_rate": 0.0002, - "loss": 0.5662693977355957, - "mean_token_accuracy": 0.7726470977067947, - "num_tokens": 5794248.0, + "loss": 0.6349586248397827, + "mean_token_accuracy": 0.7437526881694794, + "num_tokens": 2805877.0, "step": 75 }, { - "entropy": 0.5658593773841858, - "epoch": 2.384, - "grad_norm": 0.022219819948077202, + "entropy": 0.6201201230287552, + "epoch": 0.4939073923639318, + "grad_norm": 0.010362153872847557, "learning_rate": 0.0002, - "loss": 0.5574473142623901, - "mean_token_accuracy": 0.7764318138360977, - "num_tokens": 5873673.0, + "loss": 0.6222230195999146, + "mean_token_accuracy": 0.749205470085144, + "num_tokens": 2843002.0, "step": 76 }, { - "entropy": 0.5633502453565598, - "epoch": 2.416, - "grad_norm": 0.02417032979428768, + "entropy": 0.6270335763692856, + "epoch": 0.5004061738424046, + "grad_norm": 0.01038055308163166, "learning_rate": 0.0002, - "loss": 0.5558116436004639, - "mean_token_accuracy": 0.777042031288147, - "num_tokens": 5953477.0, + "loss": 0.6268460154533386, + "mean_token_accuracy": 0.7455538734793663, + "num_tokens": 2880433.0, "step": 77 }, { - "entropy": 0.5666830539703369, - "epoch": 2.448, - "grad_norm": 0.025465968996286392, + "entropy": 0.6266148760914803, + "epoch": 0.5069049553208773, + "grad_norm": 0.011833865195512772, "learning_rate": 0.0002, - "loss": 0.5631768703460693, - "mean_token_accuracy": 0.775611087679863, - "num_tokens": 6031642.0, + "loss": 0.6316983699798584, + "mean_token_accuracy": 0.7472645714879036, + "num_tokens": 2917833.0, "step": 78 }, { - "entropy": 0.5565501898527145, - "epoch": 2.48, - "grad_norm": 0.023061588406562805, + "entropy": 0.6177176311612129, + "epoch": 0.5134037367993501, + "grad_norm": 0.012312863022089005, "learning_rate": 0.0002, - "loss": 0.5533760190010071, - "mean_token_accuracy": 0.7793847471475601, - "num_tokens": 6111567.0, + "loss": 0.620547890663147, + "mean_token_accuracy": 0.7489045560359955, + "num_tokens": 2955261.0, "step": 79 }, { - "entropy": 0.5474292933940887, - "epoch": 2.512, - "grad_norm": 0.02363215573132038, + "entropy": 0.6255826130509377, + "epoch": 0.5199025182778229, + "grad_norm": 0.011764319613575935, "learning_rate": 0.0002, - "loss": 0.5478873252868652, - "mean_token_accuracy": 0.7802330702543259, - "num_tokens": 6192161.0, + "loss": 0.6278033256530762, + "mean_token_accuracy": 0.7475135996937752, + "num_tokens": 2992205.0, "step": 80 }, { - "entropy": 0.5629004091024399, - "epoch": 2.544, - "grad_norm": 0.02275676839053631, + "entropy": 0.6303588896989822, + "epoch": 0.5264012997562957, + "grad_norm": 0.01056460291147232, "learning_rate": 0.0002, - "loss": 0.5638875961303711, - "mean_token_accuracy": 0.7731000036001205, - "num_tokens": 6271115.0, + "loss": 0.6343796253204346, + "mean_token_accuracy": 0.7422873452305794, + "num_tokens": 3029696.0, "step": 81 }, { - "entropy": 0.5549586117267609, - "epoch": 2.576, - "grad_norm": 0.02356044203042984, + "entropy": 0.6168110445141792, + "epoch": 0.5329000812347685, + "grad_norm": 0.010063163004815578, "learning_rate": 0.0002, - "loss": 0.5570619106292725, - "mean_token_accuracy": 0.7774660885334015, - "num_tokens": 6349371.0, + "loss": 0.6208071112632751, + "mean_token_accuracy": 0.7490193694829941, + "num_tokens": 3067080.0, "step": 82 }, { - "entropy": 0.5476335734128952, - "epoch": 2.608, - "grad_norm": 0.027859514579176903, + "entropy": 0.6252159550786018, + "epoch": 0.5393988627132412, + "grad_norm": 0.010448803193867207, "learning_rate": 0.0002, - "loss": 0.5477542877197266, - "mean_token_accuracy": 0.7811516225337982, - "num_tokens": 6427681.0, + "loss": 0.6253081560134888, + "mean_token_accuracy": 0.7478374615311623, + "num_tokens": 3104286.0, "step": 83 }, { - "entropy": 0.5653144121170044, - "epoch": 2.64, - "grad_norm": 0.022368136793375015, + "entropy": 0.6273334473371506, + "epoch": 0.545897644191714, + "grad_norm": 0.010500379838049412, "learning_rate": 0.0002, - "loss": 0.5637708902359009, - "mean_token_accuracy": 0.7758270651102066, - "num_tokens": 6506470.0, + "loss": 0.6298959255218506, + "mean_token_accuracy": 0.7449745014309883, + "num_tokens": 3141685.0, "step": 84 }, { - "entropy": 0.5534553080797195, - "epoch": 2.672, - "grad_norm": 0.022241799160838127, + "entropy": 0.6271170675754547, + "epoch": 0.5523964256701869, + "grad_norm": 0.011779806576669216, "learning_rate": 0.0002, - "loss": 0.5493363738059998, - "mean_token_accuracy": 0.7799386531114578, - "num_tokens": 6585286.0, + "loss": 0.6241638660430908, + "mean_token_accuracy": 0.7471632659435272, + "num_tokens": 3178925.0, "step": 85 }, { - "entropy": 0.567073181271553, - "epoch": 2.7039999999999997, - "grad_norm": 0.02547631412744522, + "entropy": 0.6358036622405052, + "epoch": 0.5588952071486596, + "grad_norm": 0.010791173204779625, "learning_rate": 0.0002, - "loss": 0.563334584236145, - "mean_token_accuracy": 0.7755401879549026, - "num_tokens": 6664430.0, + "loss": 0.6331329941749573, + "mean_token_accuracy": 0.7441665381193161, + "num_tokens": 3216076.0, "step": 86 }, { - "entropy": 0.5621544122695923, - "epoch": 2.7359999999999998, - "grad_norm": 0.02449527569115162, + "entropy": 0.6320113763213158, + "epoch": 0.5653939886271324, + "grad_norm": 0.009891759604215622, "learning_rate": 0.0002, - "loss": 0.5599551200866699, - "mean_token_accuracy": 0.7742103487253189, - "num_tokens": 6743061.0, + "loss": 0.6326582431793213, + "mean_token_accuracy": 0.7445697784423828, + "num_tokens": 3253700.0, "step": 87 }, { - "entropy": 0.5637608170509338, - "epoch": 2.768, - "grad_norm": 0.020537901669740677, + "entropy": 0.6250990331172943, + "epoch": 0.5718927701056052, + "grad_norm": 0.013541702181100845, "learning_rate": 0.0002, - "loss": 0.5627949237823486, - "mean_token_accuracy": 0.7747203409671783, - "num_tokens": 6821751.0, + "loss": 0.6289629936218262, + "mean_token_accuracy": 0.745047003030777, + "num_tokens": 3291250.0, "step": 88 }, { - "entropy": 0.5689736902713776, - "epoch": 2.8, - "grad_norm": 0.02112015336751938, + "entropy": 0.6287946552038193, + "epoch": 0.578391551584078, + "grad_norm": 0.009651604108512402, "learning_rate": 0.0002, - "loss": 0.565583348274231, - "mean_token_accuracy": 0.7746206969022751, - "num_tokens": 6901279.0, + "loss": 0.6300573348999023, + "mean_token_accuracy": 0.7451979964971542, + "num_tokens": 3328548.0, "step": 89 }, { - "entropy": 0.5660188943147659, - "epoch": 2.832, - "grad_norm": 0.022382516413927078, + "entropy": 0.6240335181355476, + "epoch": 0.5848903330625508, + "grad_norm": 0.009283720515668392, "learning_rate": 0.0002, - "loss": 0.5647023916244507, - "mean_token_accuracy": 0.773158609867096, - "num_tokens": 6981047.0, + "loss": 0.6263805031776428, + "mean_token_accuracy": 0.7456449046730995, + "num_tokens": 3365327.0, "step": 90 }, { - "entropy": 0.5572714656591415, - "epoch": 2.864, - "grad_norm": 0.022794874384999275, + "entropy": 0.6241980046033859, + "epoch": 0.5913891145410236, + "grad_norm": 0.010714948177337646, "learning_rate": 0.0002, - "loss": 0.5548834204673767, - "mean_token_accuracy": 0.7764633297920227, - "num_tokens": 7058727.0, + "loss": 0.625645637512207, + "mean_token_accuracy": 0.7471252828836441, + "num_tokens": 3402757.0, "step": 91 }, { - "entropy": 0.5647054761648178, - "epoch": 2.896, - "grad_norm": 0.022615451365709305, + "entropy": 0.628009632229805, + "epoch": 0.5978878960194963, + "grad_norm": 0.012750590220093727, "learning_rate": 0.0002, - "loss": 0.5656628608703613, - "mean_token_accuracy": 0.7732657492160797, - "num_tokens": 7135849.0, + "loss": 0.6261017322540283, + "mean_token_accuracy": 0.7465066090226173, + "num_tokens": 3440031.0, "step": 92 }, { - "entropy": 0.5565017014741898, - "epoch": 2.928, - "grad_norm": 0.023763637989759445, + "entropy": 0.6196997240185738, + "epoch": 0.6043866774979691, + "grad_norm": 0.011183288879692554, "learning_rate": 0.0002, - "loss": 0.5567818284034729, - "mean_token_accuracy": 0.7769446074962616, - "num_tokens": 7214895.0, + "loss": 0.6222946047782898, + "mean_token_accuracy": 0.7507361546158791, + "num_tokens": 3477362.0, "step": 93 }, { - "entropy": 0.560202345252037, - "epoch": 2.96, - "grad_norm": 0.023177897557616234, + "entropy": 0.6370684951543808, + "epoch": 0.6108854589764419, + "grad_norm": 0.010141120292246342, "learning_rate": 0.0002, - "loss": 0.5593446493148804, - "mean_token_accuracy": 0.774772509932518, - "num_tokens": 7294431.0, + "loss": 0.638361930847168, + "mean_token_accuracy": 0.7412139847874641, + "num_tokens": 3514709.0, "step": 94 }, { - "entropy": 0.5637674629688263, - "epoch": 2.992, - "grad_norm": 0.025069424882531166, + "entropy": 0.6254898384213448, + "epoch": 0.6173842404549147, + "grad_norm": 0.009656463749706745, "learning_rate": 0.0002, - "loss": 0.5618734359741211, - "mean_token_accuracy": 0.774286150932312, - "num_tokens": 7371930.0, + "loss": 0.6284251809120178, + "mean_token_accuracy": 0.7460697740316391, + "num_tokens": 3552355.0, "step": 95 }, { - "entropy": 0.5556119680404663, - "epoch": 3.0, - "grad_norm": 0.031051333993673325, + "entropy": 0.626992717385292, + "epoch": 0.6238830219333875, + "grad_norm": 0.01039013173431158, "learning_rate": 0.0002, - "loss": 0.550994873046875, - "mean_token_accuracy": 0.7802934050559998, - "num_tokens": 7391757.0, + "loss": 0.632388174533844, + "mean_token_accuracy": 0.7448238283395767, + "num_tokens": 3590160.0, "step": 96 }, { - "entropy": 0.5636318922042847, - "epoch": 3.032, - "grad_norm": 0.025959042832255363, + "entropy": 0.6212045699357986, + "epoch": 0.6303818034118602, + "grad_norm": 0.011750632897019386, "learning_rate": 0.0002, - "loss": 0.5586003065109253, - "mean_token_accuracy": 0.7768417745828629, - "num_tokens": 7470651.0, + "loss": 0.623359203338623, + "mean_token_accuracy": 0.7481106221675873, + "num_tokens": 3627240.0, "step": 97 }, { - "entropy": 0.5585259348154068, - "epoch": 3.064, - "grad_norm": 0.021750938147306442, + "entropy": 0.6192934885621071, + "epoch": 0.6368805848903331, + "grad_norm": 0.009845283813774586, "learning_rate": 0.0002, - "loss": 0.556551456451416, - "mean_token_accuracy": 0.7769591957330704, - "num_tokens": 7549852.0, + "loss": 0.6226494312286377, + "mean_token_accuracy": 0.7480833828449249, + "num_tokens": 3664279.0, "step": 98 }, { - "entropy": 0.5582039058208466, - "epoch": 3.096, - "grad_norm": 0.025489795953035355, + "entropy": 0.6310721859335899, + "epoch": 0.6433793663688059, + "grad_norm": 0.011091063730418682, "learning_rate": 0.0002, - "loss": 0.5555694103240967, - "mean_token_accuracy": 0.7770965248346329, - "num_tokens": 7629195.0, + "loss": 0.6305258274078369, + "mean_token_accuracy": 0.7463658377528191, + "num_tokens": 3701955.0, "step": 99 }, { - "entropy": 0.5573598444461823, - "epoch": 3.128, - "grad_norm": 0.023217501118779182, + "entropy": 0.6249227002263069, + "epoch": 0.6498781478472786, + "grad_norm": 0.009939444251358509, "learning_rate": 0.0002, - "loss": 0.5600582361221313, - "mean_token_accuracy": 0.7751252055168152, - "num_tokens": 7706266.0, + "loss": 0.6257964372634888, + "mean_token_accuracy": 0.7479037865996361, + "num_tokens": 3739298.0, "step": 100 }, { - "entropy": 0.553033709526062, - "epoch": 3.16, - "grad_norm": 0.02116326428949833, + "entropy": 0.6227108985185623, + "epoch": 0.6563769293257514, + "grad_norm": 0.010004580952227116, "learning_rate": 0.0002, - "loss": 0.5513657927513123, - "mean_token_accuracy": 0.7792606353759766, - "num_tokens": 7786170.0, + "loss": 0.6256003379821777, + "mean_token_accuracy": 0.7474573701620102, + "num_tokens": 3776806.0, "step": 101 }, { - "entropy": 0.5500922203063965, - "epoch": 3.192, - "grad_norm": 0.023273272439837456, + "entropy": 0.6166384890675545, + "epoch": 0.6628757108042242, + "grad_norm": 0.010987838730216026, "learning_rate": 0.0002, - "loss": 0.5481851696968079, - "mean_token_accuracy": 0.7797382026910782, - "num_tokens": 7866284.0, + "loss": 0.6182519197463989, + "mean_token_accuracy": 0.7499695047736168, + "num_tokens": 3813941.0, "step": 102 }, { - "entropy": 0.5571017563343048, - "epoch": 3.224, - "grad_norm": 0.024359384551644325, + "entropy": 0.6348938420414925, + "epoch": 0.669374492282697, + "grad_norm": 0.011195721104741096, "learning_rate": 0.0002, - "loss": 0.5538984537124634, - "mean_token_accuracy": 0.7775730490684509, - "num_tokens": 7944939.0, + "loss": 0.6304492950439453, + "mean_token_accuracy": 0.7462876811623573, + "num_tokens": 3851698.0, "step": 103 }, { - "entropy": 0.5599475651979446, - "epoch": 3.2560000000000002, - "grad_norm": 0.020094532519578934, + "entropy": 0.6282550320029259, + "epoch": 0.6758732737611698, + "grad_norm": 0.010595601983368397, "learning_rate": 0.0002, - "loss": 0.5542423725128174, - "mean_token_accuracy": 0.7767647057771683, - "num_tokens": 8024975.0, + "loss": 0.6273945569992065, + "mean_token_accuracy": 0.7473014816641808, + "num_tokens": 3888988.0, "step": 104 }, { - "entropy": 0.5703375190496445, - "epoch": 3.288, - "grad_norm": 0.020639436319470406, + "entropy": 0.6324817091226578, + "epoch": 0.6823720552396426, + "grad_norm": 0.009895245544612408, "learning_rate": 0.0002, - "loss": 0.564155638217926, - "mean_token_accuracy": 0.773441419005394, - "num_tokens": 8103041.0, + "loss": 0.632161557674408, + "mean_token_accuracy": 0.7444497495889664, + "num_tokens": 3925974.0, "step": 105 }, { - "entropy": 0.5621205866336823, - "epoch": 3.32, - "grad_norm": 0.020889636129140854, + "entropy": 0.6199614554643631, + "epoch": 0.6888708367181153, + "grad_norm": 0.010299347341060638, "learning_rate": 0.0002, - "loss": 0.5588844418525696, - "mean_token_accuracy": 0.7760203182697296, - "num_tokens": 8181136.0, + "loss": 0.6227681636810303, + "mean_token_accuracy": 0.746825821697712, + "num_tokens": 3962869.0, "step": 106 }, { - "entropy": 0.55582495033741, - "epoch": 3.352, - "grad_norm": 0.019500412046909332, + "entropy": 0.6321764960885048, + "epoch": 0.6953696181965882, + "grad_norm": 0.010949746705591679, "learning_rate": 0.0002, - "loss": 0.5550122261047363, - "mean_token_accuracy": 0.7787394225597382, - "num_tokens": 8260405.0, + "loss": 0.6333647966384888, + "mean_token_accuracy": 0.7444829195737839, + "num_tokens": 4000443.0, "step": 107 }, { - "entropy": 0.5650199949741364, - "epoch": 3.384, - "grad_norm": 0.02145702950656414, + "entropy": 0.6052318215370178, + "epoch": 0.7018683996750609, + "grad_norm": 0.010511154308915138, "learning_rate": 0.0002, - "loss": 0.5680341720581055, - "mean_token_accuracy": 0.7718839198350906, - "num_tokens": 8337560.0, + "loss": 0.6079590916633606, + "mean_token_accuracy": 0.7547851428389549, + "num_tokens": 4037560.0, "step": 108 }, { - "entropy": 0.5433939546346664, - "epoch": 3.416, - "grad_norm": 0.023313792422413826, + "entropy": 0.6213503628969193, + "epoch": 0.7083671811535337, + "grad_norm": 0.009959033690392971, "learning_rate": 0.0002, - "loss": 0.5474338531494141, - "mean_token_accuracy": 0.7793407142162323, - "num_tokens": 8416130.0, + "loss": 0.622962236404419, + "mean_token_accuracy": 0.7485458552837372, + "num_tokens": 4075139.0, "step": 109 }, { - "entropy": 0.5506273955106735, - "epoch": 3.448, - "grad_norm": 0.021077029407024384, + "entropy": 0.6228557601571083, + "epoch": 0.7148659626320065, + "grad_norm": 0.009467214345932007, "learning_rate": 0.0002, - "loss": 0.5539349317550659, - "mean_token_accuracy": 0.777793824672699, - "num_tokens": 8494571.0, + "loss": 0.6287202835083008, + "mean_token_accuracy": 0.7456526011228561, + "num_tokens": 4112628.0, "step": 110 }, { - "entropy": 0.5581430941820145, - "epoch": 3.48, - "grad_norm": 0.022196298465132713, + "entropy": 0.6176012232899666, + "epoch": 0.7213647441104792, + "grad_norm": 0.009703468531370163, "learning_rate": 0.0002, - "loss": 0.553594708442688, - "mean_token_accuracy": 0.7770230323076248, - "num_tokens": 8572656.0, + "loss": 0.6198960542678833, + "mean_token_accuracy": 0.7511189430952072, + "num_tokens": 4150384.0, "step": 111 }, { - "entropy": 0.567478135228157, - "epoch": 3.512, - "grad_norm": 0.02296704798936844, + "entropy": 0.6364283263683319, + "epoch": 0.7278635255889521, + "grad_norm": 0.009932373650372028, "learning_rate": 0.0002, - "loss": 0.5598067045211792, - "mean_token_accuracy": 0.7746621519327164, - "num_tokens": 8650724.0, + "loss": 0.6412342190742493, + "mean_token_accuracy": 0.742191307246685, + "num_tokens": 4187483.0, "step": 112 }, { - "entropy": 0.5627018958330154, - "epoch": 3.544, - "grad_norm": 0.020507240667939186, + "entropy": 0.6340491250157356, + "epoch": 0.7343623070674249, + "grad_norm": 0.009394255466759205, "learning_rate": 0.0002, - "loss": 0.5585383176803589, - "mean_token_accuracy": 0.7763334959745407, - "num_tokens": 8729104.0, + "loss": 0.632526695728302, + "mean_token_accuracy": 0.7457142248749733, + "num_tokens": 4224861.0, "step": 113 }, { - "entropy": 0.5544057041406631, - "epoch": 3.576, - "grad_norm": 0.02342178113758564, + "entropy": 0.626609705388546, + "epoch": 0.7408610885458976, + "grad_norm": 0.010729662142693996, "learning_rate": 0.0002, - "loss": 0.5570175647735596, - "mean_token_accuracy": 0.7762107402086258, - "num_tokens": 8807747.0, + "loss": 0.6251577138900757, + "mean_token_accuracy": 0.7473985999822617, + "num_tokens": 4261958.0, "step": 114 }, { - "entropy": 0.5425068289041519, - "epoch": 3.608, - "grad_norm": 0.02285587601363659, + "entropy": 0.6041073203086853, + "epoch": 0.7473598700243704, + "grad_norm": 0.010525292716920376, "learning_rate": 0.0002, - "loss": 0.545325756072998, - "mean_token_accuracy": 0.7807946652173996, - "num_tokens": 8887832.0, + "loss": 0.599025309085846, + "mean_token_accuracy": 0.7583419680595398, + "num_tokens": 4299462.0, "step": 115 }, { - "entropy": 0.553840234875679, - "epoch": 3.64, - "grad_norm": 0.022142302244901657, + "entropy": 0.6210100278258324, + "epoch": 0.7538586515028433, + "grad_norm": 0.009981499053537846, "learning_rate": 0.0002, - "loss": 0.5548170804977417, - "mean_token_accuracy": 0.7777025252580643, - "num_tokens": 8966925.0, + "loss": 0.6192715167999268, + "mean_token_accuracy": 0.7496819868683815, + "num_tokens": 4336903.0, "step": 116 }, { - "entropy": 0.5666903406381607, - "epoch": 3.672, - "grad_norm": 0.020184515044093132, + "entropy": 0.6161150112748146, + "epoch": 0.760357432981316, + "grad_norm": 0.009832478128373623, "learning_rate": 0.0002, - "loss": 0.5636236667633057, - "mean_token_accuracy": 0.7735326737165451, - "num_tokens": 9045663.0, + "loss": 0.6186830401420593, + "mean_token_accuracy": 0.7503286600112915, + "num_tokens": 4374156.0, "step": 117 }, { - "entropy": 0.5551957935094833, - "epoch": 3.7039999999999997, - "grad_norm": 0.0219353549182415, + "entropy": 0.6233196780085564, + "epoch": 0.7668562144597888, + "grad_norm": 0.009722237475216389, "learning_rate": 0.0002, - "loss": 0.5482048988342285, - "mean_token_accuracy": 0.7802202552556992, - "num_tokens": 9124298.0, + "loss": 0.6274971961975098, + "mean_token_accuracy": 0.7461902946233749, + "num_tokens": 4411885.0, "step": 118 }, { - "entropy": 0.5691462904214859, - "epoch": 3.7359999999999998, - "grad_norm": 0.023641400039196014, + "entropy": 0.6291887611150742, + "epoch": 0.7733549959382616, + "grad_norm": 0.01063536573201418, "learning_rate": 0.0002, - "loss": 0.5663072466850281, - "mean_token_accuracy": 0.7717752456665039, - "num_tokens": 9201921.0, + "loss": 0.6366918087005615, + "mean_token_accuracy": 0.7416415438055992, + "num_tokens": 4449209.0, "step": 119 }, { - "entropy": 0.564937487244606, - "epoch": 3.768, - "grad_norm": 0.02424025908112526, + "entropy": 0.6099276095628738, + "epoch": 0.7798537774167343, + "grad_norm": 0.010151992551982403, "learning_rate": 0.0002, - "loss": 0.5656293630599976, - "mean_token_accuracy": 0.7734099626541138, - "num_tokens": 9279520.0, + "loss": 0.6134237051010132, + "mean_token_accuracy": 0.7496887296438217, + "num_tokens": 4486909.0, "step": 120 }, { - "entropy": 0.543596014380455, - "epoch": 3.8, - "grad_norm": 0.02149128168821335, + "entropy": 0.6280336380004883, + "epoch": 0.7863525588952072, + "grad_norm": 0.011214104481041431, "learning_rate": 0.0002, - "loss": 0.5408511757850647, - "mean_token_accuracy": 0.7823390662670135, - "num_tokens": 9358194.0, + "loss": 0.6303111910820007, + "mean_token_accuracy": 0.743942454457283, + "num_tokens": 4524269.0, "step": 121 }, { - "entropy": 0.5443567931652069, - "epoch": 3.832, - "grad_norm": 0.02457662858068943, + "entropy": 0.624128632247448, + "epoch": 0.7928513403736799, + "grad_norm": 0.01028621755540371, "learning_rate": 0.0002, - "loss": 0.5437170267105103, - "mean_token_accuracy": 0.7806205898523331, - "num_tokens": 9436813.0, + "loss": 0.6248451471328735, + "mean_token_accuracy": 0.7479912042617798, + "num_tokens": 4561643.0, "step": 122 }, { - "entropy": 0.5446386188268661, - "epoch": 3.864, - "grad_norm": 0.023279579356312752, + "entropy": 0.6252302676439285, + "epoch": 0.7993501218521527, + "grad_norm": 0.01105236541479826, "learning_rate": 0.0002, - "loss": 0.5444090366363525, - "mean_token_accuracy": 0.7807519435882568, - "num_tokens": 9516996.0, + "loss": 0.6249452233314514, + "mean_token_accuracy": 0.7472440227866173, + "num_tokens": 4599086.0, "step": 123 }, { - "entropy": 0.5451237112283707, - "epoch": 3.896, - "grad_norm": 0.021046897396445274, + "entropy": 0.6296864897012711, + "epoch": 0.8058489033306255, + "grad_norm": 0.009404209442436695, "learning_rate": 0.0002, - "loss": 0.5447065830230713, - "mean_token_accuracy": 0.7818619459867477, - "num_tokens": 9597382.0, + "loss": 0.6316344738006592, + "mean_token_accuracy": 0.7425857782363892, + "num_tokens": 4636471.0, "step": 124 }, { - "entropy": 0.557760015130043, - "epoch": 3.928, - "grad_norm": 0.02131776139140129, + "entropy": 0.6118782311677933, + "epoch": 0.8123476848090982, + "grad_norm": 0.010075677186250687, "learning_rate": 0.0002, - "loss": 0.5580514073371887, - "mean_token_accuracy": 0.77658312022686, - "num_tokens": 9677720.0, + "loss": 0.6151276230812073, + "mean_token_accuracy": 0.7537136599421501, + "num_tokens": 4673814.0, "step": 125 }, { - "entropy": 0.544140562415123, - "epoch": 3.96, - "grad_norm": 0.020328767597675323, + "entropy": 0.6220783665776253, + "epoch": 0.8188464662875711, + "grad_norm": 0.01058894768357277, "learning_rate": 0.0002, - "loss": 0.5451820492744446, - "mean_token_accuracy": 0.7804036885499954, - "num_tokens": 9757131.0, + "loss": 0.623919665813446, + "mean_token_accuracy": 0.7449487373232841, + "num_tokens": 4711348.0, "step": 126 }, { - "entropy": 0.5636927336454391, - "epoch": 3.992, - "grad_norm": 0.021143252030014992, + "entropy": 0.6320341899991035, + "epoch": 0.8253452477660439, + "grad_norm": 0.009438078850507736, "learning_rate": 0.0002, - "loss": 0.5571653246879578, - "mean_token_accuracy": 0.7772841453552246, - "num_tokens": 9835244.0, + "loss": 0.635218620300293, + "mean_token_accuracy": 0.7428243607282639, + "num_tokens": 4748964.0, "step": 127 }, { - "entropy": 0.5422744750976562, - "epoch": 4.0, - "grad_norm": 0.0327562615275383, + "entropy": 0.608184851706028, + "epoch": 0.8318440292445166, + "grad_norm": 0.00950313825160265, "learning_rate": 0.0002, - "loss": 0.5362396240234375, - "mean_token_accuracy": 0.7841192483901978, - "num_tokens": 9855434.0, + "loss": 0.608941376209259, + "mean_token_accuracy": 0.7540178000926971, + "num_tokens": 4786015.0, "step": 128 }, { - "entropy": 0.5350159257650375, - "epoch": 4.032, - "grad_norm": 0.021142639219760895, + "entropy": 0.6191292628645897, + "epoch": 0.8383428107229894, + "grad_norm": 0.00933976098895073, "learning_rate": 0.0002, - "loss": 0.5306050181388855, - "mean_token_accuracy": 0.787266880273819, - "num_tokens": 9935799.0, + "loss": 0.6211662292480469, + "mean_token_accuracy": 0.7470189183950424, + "num_tokens": 4823477.0, "step": 129 }, { - "entropy": 0.5508315712213516, - "epoch": 4.064, - "grad_norm": 0.023039840161800385, + "entropy": 0.6169113591313362, + "epoch": 0.8448415922014623, + "grad_norm": 0.00967735517770052, "learning_rate": 0.0002, - "loss": 0.5510164499282837, - "mean_token_accuracy": 0.7783015668392181, - "num_tokens": 10015337.0, + "loss": 0.6221678256988525, + "mean_token_accuracy": 0.7482811883091927, + "num_tokens": 4860492.0, "step": 130 }, { - "entropy": 0.5506930351257324, - "epoch": 4.096, - "grad_norm": 0.022771824151277542, + "entropy": 0.6181379705667496, + "epoch": 0.851340373679935, + "grad_norm": 0.010275167413055897, "learning_rate": 0.0002, - "loss": 0.5542877912521362, - "mean_token_accuracy": 0.7773886919021606, - "num_tokens": 10092789.0, + "loss": 0.6256829500198364, + "mean_token_accuracy": 0.7461275234818459, + "num_tokens": 4897310.0, "step": 131 }, { - "entropy": 0.5481761693954468, - "epoch": 4.128, - "grad_norm": 0.020041558891534805, + "entropy": 0.6289433836936951, + "epoch": 0.8578391551584078, + "grad_norm": 0.010724073275923729, "learning_rate": 0.0002, - "loss": 0.5482645630836487, - "mean_token_accuracy": 0.7794580906629562, - "num_tokens": 10171363.0, + "loss": 0.6285852193832397, + "mean_token_accuracy": 0.7468666434288025, + "num_tokens": 4935222.0, "step": 132 }, { - "entropy": 0.5571236908435822, - "epoch": 4.16, - "grad_norm": 0.02578168548643589, + "entropy": 0.6300692111253738, + "epoch": 0.8643379366368806, + "grad_norm": 0.009074898436665535, "learning_rate": 0.0002, - "loss": 0.55533766746521, - "mean_token_accuracy": 0.7765619903802872, - "num_tokens": 10250091.0, + "loss": 0.6281343698501587, + "mean_token_accuracy": 0.7458086088299751, + "num_tokens": 4972549.0, "step": 133 }, { - "entropy": 0.5592793822288513, - "epoch": 4.192, - "grad_norm": 0.02451624907553196, + "entropy": 0.6445952579379082, + "epoch": 0.8708367181153533, + "grad_norm": 0.009369590319693089, "learning_rate": 0.0002, - "loss": 0.5530962944030762, - "mean_token_accuracy": 0.7770255208015442, - "num_tokens": 10328422.0, + "loss": 0.6381428837776184, + "mean_token_accuracy": 0.7420760691165924, + "num_tokens": 5010593.0, "step": 134 }, { - "entropy": 0.563023567199707, - "epoch": 4.224, - "grad_norm": 0.019786424934864044, + "entropy": 0.6136679574847221, + "epoch": 0.8773354995938262, + "grad_norm": 0.01232313271611929, "learning_rate": 0.0002, - "loss": 0.5598846673965454, - "mean_token_accuracy": 0.7750790417194366, - "num_tokens": 10407828.0, + "loss": 0.6184711456298828, + "mean_token_accuracy": 0.7486978471279144, + "num_tokens": 5047468.0, "step": 135 }, { - "entropy": 0.5667447596788406, - "epoch": 4.256, - "grad_norm": 0.02562200278043747, + "entropy": 0.6270027384161949, + "epoch": 0.8838342810722989, + "grad_norm": 0.010591822676360607, "learning_rate": 0.0002, - "loss": 0.5655050277709961, - "mean_token_accuracy": 0.7730535417795181, - "num_tokens": 10486389.0, + "loss": 0.6306672692298889, + "mean_token_accuracy": 0.7446641474962234, + "num_tokens": 5084586.0, "step": 136 }, { - "entropy": 0.5592403262853622, - "epoch": 4.288, - "grad_norm": 0.02239048294723034, + "entropy": 0.6240550950169563, + "epoch": 0.8903330625507717, + "grad_norm": 0.009444071911275387, "learning_rate": 0.0002, - "loss": 0.5616511702537537, - "mean_token_accuracy": 0.7738818973302841, - "num_tokens": 10565760.0, + "loss": 0.6233399510383606, + "mean_token_accuracy": 0.749994620680809, + "num_tokens": 5122453.0, "step": 137 }, { - "entropy": 0.5580462664365768, - "epoch": 4.32, - "grad_norm": 0.029557570815086365, + "entropy": 0.6302881464362144, + "epoch": 0.8968318440292445, + "grad_norm": 0.009541204199194908, "learning_rate": 0.0002, - "loss": 0.5544324517250061, - "mean_token_accuracy": 0.7771971821784973, - "num_tokens": 10644777.0, + "loss": 0.6329821348190308, + "mean_token_accuracy": 0.7429886758327484, + "num_tokens": 5160031.0, "step": 138 }, { - "entropy": 0.5683742761611938, - "epoch": 4.352, - "grad_norm": 0.022613991051912308, + "entropy": 0.6242454648017883, + "epoch": 0.9033306255077173, + "grad_norm": 0.01136871799826622, "learning_rate": 0.0002, - "loss": 0.5679054260253906, - "mean_token_accuracy": 0.7711237072944641, - "num_tokens": 10721084.0, + "loss": 0.628311038017273, + "mean_token_accuracy": 0.7444250509142876, + "num_tokens": 5197538.0, "step": 139 }, { - "entropy": 0.5512652546167374, - "epoch": 4.384, - "grad_norm": 0.023316726088523865, + "entropy": 0.6239208057522774, + "epoch": 0.9098294069861901, + "grad_norm": 0.009039361029863358, "learning_rate": 0.0002, - "loss": 0.5495034456253052, - "mean_token_accuracy": 0.7789248526096344, - "num_tokens": 10799528.0, + "loss": 0.6212806105613708, + "mean_token_accuracy": 0.7484918162226677, + "num_tokens": 5234839.0, "step": 140 }, { - "entropy": 0.5452638119459152, - "epoch": 4.416, - "grad_norm": 0.023327913135290146, + "entropy": 0.6303699910640717, + "epoch": 0.9163281884646629, + "grad_norm": 0.008452481590211391, "learning_rate": 0.0002, - "loss": 0.5428160429000854, - "mean_token_accuracy": 0.7811004668474197, - "num_tokens": 10878802.0, + "loss": 0.6276811361312866, + "mean_token_accuracy": 0.7478921040892601, + "num_tokens": 5272501.0, "step": 141 }, { - "entropy": 0.5505389273166656, - "epoch": 4.448, - "grad_norm": 0.024172673001885414, + "entropy": 0.6282826215028763, + "epoch": 0.9228269699431356, + "grad_norm": 0.009988308884203434, "learning_rate": 0.0002, - "loss": 0.5476949214935303, - "mean_token_accuracy": 0.780018538236618, - "num_tokens": 10957456.0, + "loss": 0.6308070421218872, + "mean_token_accuracy": 0.744203083217144, + "num_tokens": 5310068.0, "step": 142 }, { - "entropy": 0.5516746640205383, - "epoch": 4.48, - "grad_norm": 0.024863507598638535, + "entropy": 0.6363607943058014, + "epoch": 0.9293257514216084, + "grad_norm": 0.010694671422243118, "learning_rate": 0.0002, - "loss": 0.5560992956161499, - "mean_token_accuracy": 0.7761176824569702, - "num_tokens": 11036458.0, + "loss": 0.6361459493637085, + "mean_token_accuracy": 0.7425540909171104, + "num_tokens": 5347594.0, "step": 143 }, { - "entropy": 0.5538354814052582, - "epoch": 4.5120000000000005, - "grad_norm": 0.03181128948926926, + "entropy": 0.6332810074090958, + "epoch": 0.9358245329000813, + "grad_norm": 0.008342958055436611, "learning_rate": 0.0002, - "loss": 0.557499349117279, - "mean_token_accuracy": 0.7750093787908554, - "num_tokens": 11114465.0, + "loss": 0.6327856779098511, + "mean_token_accuracy": 0.7445112019777298, + "num_tokens": 5385240.0, "step": 144 }, { - "entropy": 0.5519821345806122, - "epoch": 4.5440000000000005, - "grad_norm": 0.022477390244603157, + "entropy": 0.622712031006813, + "epoch": 0.942323314378554, + "grad_norm": 0.009324009530246258, "learning_rate": 0.0002, - "loss": 0.5489175319671631, - "mean_token_accuracy": 0.7789605855941772, - "num_tokens": 11193250.0, + "loss": 0.622111439704895, + "mean_token_accuracy": 0.7491918131709099, + "num_tokens": 5423063.0, "step": 145 }, { - "entropy": 0.5598633885383606, - "epoch": 4.576, - "grad_norm": 0.02509782463312149, + "entropy": 0.6331967115402222, + "epoch": 0.9488220958570268, + "grad_norm": 0.009456835687160492, "learning_rate": 0.0002, - "loss": 0.5523159503936768, - "mean_token_accuracy": 0.7775833010673523, - "num_tokens": 11272848.0, + "loss": 0.635155200958252, + "mean_token_accuracy": 0.7427491322159767, + "num_tokens": 5460300.0, "step": 146 }, { - "entropy": 0.5443387776613235, - "epoch": 4.608, - "grad_norm": 0.02487492933869362, + "entropy": 0.6007715612649918, + "epoch": 0.9553208773354996, + "grad_norm": 0.009612048044800758, "learning_rate": 0.0002, - "loss": 0.5392158031463623, - "mean_token_accuracy": 0.7834303230047226, - "num_tokens": 11353910.0, + "loss": 0.6061209440231323, + "mean_token_accuracy": 0.7546330019831657, + "num_tokens": 5497104.0, "step": 147 }, { - "entropy": 0.5553220510482788, - "epoch": 4.64, - "grad_norm": 0.02597399242222309, + "entropy": 0.623559907078743, + "epoch": 0.9618196588139724, + "grad_norm": 0.009891507215797901, "learning_rate": 0.0002, - "loss": 0.5571849346160889, - "mean_token_accuracy": 0.776119738817215, - "num_tokens": 11430800.0, + "loss": 0.6299046874046326, + "mean_token_accuracy": 0.7460341230034828, + "num_tokens": 5534717.0, "step": 148 }, { - "entropy": 0.5394623875617981, - "epoch": 4.672, - "grad_norm": 0.02306293696165085, + "entropy": 0.6161656081676483, + "epoch": 0.9683184402924452, + "grad_norm": 0.009623561054468155, "learning_rate": 0.0002, - "loss": 0.5412307381629944, - "mean_token_accuracy": 0.7825190275907516, - "num_tokens": 11511445.0, + "loss": 0.6207596659660339, + "mean_token_accuracy": 0.7484462484717369, + "num_tokens": 5572155.0, "step": 149 }, { - "entropy": 0.5512889623641968, - "epoch": 4.704, - "grad_norm": 0.02301475964486599, + "entropy": 0.6296671330928802, + "epoch": 0.974817221770918, + "grad_norm": 0.009666231460869312, "learning_rate": 0.0002, - "loss": 0.5503370761871338, - "mean_token_accuracy": 0.7782942056655884, - "num_tokens": 11590429.0, + "loss": 0.6299723386764526, + "mean_token_accuracy": 0.7442828044295311, + "num_tokens": 5609434.0, "step": 150 }, { - "entropy": 0.5578732192516327, - "epoch": 4.736, - "grad_norm": 0.02201995998620987, + "entropy": 0.635062001645565, + "epoch": 0.9813160032493907, + "grad_norm": 0.009376533329486847, "learning_rate": 0.0002, - "loss": 0.5536071062088013, - "mean_token_accuracy": 0.7773238718509674, - "num_tokens": 11669487.0, + "loss": 0.6303079128265381, + "mean_token_accuracy": 0.7447433397173882, + "num_tokens": 5646893.0, "step": 151 }, { - "entropy": 0.5440615564584732, - "epoch": 4.768, - "grad_norm": 0.02202589437365532, + "entropy": 0.630713015794754, + "epoch": 0.9878147847278635, + "grad_norm": 0.009512092918157578, "learning_rate": 0.0002, - "loss": 0.5411347150802612, - "mean_token_accuracy": 0.7818420082330704, - "num_tokens": 11750325.0, + "loss": 0.6241896152496338, + "mean_token_accuracy": 0.745731770992279, + "num_tokens": 5684403.0, "step": 152 }, { - "entropy": 0.5498859584331512, - "epoch": 4.8, - "grad_norm": 0.026776723563671112, + "entropy": 0.623988039791584, + "epoch": 0.9943135662063363, + "grad_norm": 0.00946712028235197, "learning_rate": 0.0002, - "loss": 0.5520839691162109, - "mean_token_accuracy": 0.7781284302473068, - "num_tokens": 11827703.0, + "loss": 0.6251310110092163, + "mean_token_accuracy": 0.7487976476550102, + "num_tokens": 5721608.0, "step": 153 }, { - "entropy": 0.5513161569833755, - "epoch": 4.832, - "grad_norm": 0.021133486181497574, + "entropy": 0.5962605476379395, + "epoch": 1.0, + "grad_norm": 0.010017761029303074, "learning_rate": 0.0002, - "loss": 0.5512353181838989, - "mean_token_accuracy": 0.7764542549848557, - "num_tokens": 11904960.0, + "loss": 0.6195710897445679, + "mean_token_accuracy": 0.754073713506971, + "num_tokens": 5737850.0, "step": 154 }, { - "entropy": 0.553078830242157, - "epoch": 4.864, - "grad_norm": 0.025516293942928314, + "entropy": 0.6159528121352196, + "epoch": 1.0064987814784727, + "grad_norm": 0.011626223102211952, "learning_rate": 0.0002, - "loss": 0.5475062131881714, - "mean_token_accuracy": 0.7789602428674698, - "num_tokens": 11985016.0, + "loss": 0.6283953785896301, + "mean_token_accuracy": 0.7437271103262901, + "num_tokens": 5775226.0, "step": 155 }, { - "entropy": 0.5605203360319138, - "epoch": 4.896, - "grad_norm": 0.021059760823845863, + "entropy": 0.6398139446973801, + "epoch": 1.0129975629569457, + "grad_norm": 0.009600057266652584, "learning_rate": 0.0002, - "loss": 0.5566121339797974, - "mean_token_accuracy": 0.7765137851238251, - "num_tokens": 12063054.0, + "loss": 0.6418601274490356, + "mean_token_accuracy": 0.7394955083727837, + "num_tokens": 5812842.0, "step": 156 }, { - "entropy": 0.5402437597513199, - "epoch": 4.928, - "grad_norm": 0.0237311739474535, + "entropy": 0.6106663420796394, + "epoch": 1.0194963444354184, + "grad_norm": 0.01011701114475727, "learning_rate": 0.0002, - "loss": 0.5375882387161255, - "mean_token_accuracy": 0.7829015702009201, - "num_tokens": 12142425.0, + "loss": 0.6077284812927246, + "mean_token_accuracy": 0.754165381193161, + "num_tokens": 5850157.0, "step": 157 }, { - "entropy": 0.5493930131196976, - "epoch": 4.96, - "grad_norm": 0.02653537131845951, + "entropy": 0.6355043426156044, + "epoch": 1.025995125913891, + "grad_norm": 0.009700894355773926, "learning_rate": 0.0002, - "loss": 0.5503488779067993, - "mean_token_accuracy": 0.7782562971115112, - "num_tokens": 12220945.0, + "loss": 0.6273776888847351, + "mean_token_accuracy": 0.7454625219106674, + "num_tokens": 5887576.0, "step": 158 }, { - "entropy": 0.5531943738460541, - "epoch": 4.992, - "grad_norm": 0.02164315991103649, + "entropy": 0.629393994808197, + "epoch": 1.032493907392364, + "grad_norm": 0.007958617061376572, "learning_rate": 0.0002, - "loss": 0.5544183254241943, - "mean_token_accuracy": 0.7767967581748962, - "num_tokens": 12298554.0, + "loss": 0.6252051591873169, + "mean_token_accuracy": 0.7460998743772507, + "num_tokens": 5925165.0, "step": 159 }, { - "entropy": 0.5414583086967468, - "epoch": 5.0, - "grad_norm": 0.040175583213567734, + "entropy": 0.6266166046261787, + "epoch": 1.0389926888708367, + "grad_norm": 0.00998145341873169, "learning_rate": 0.0002, - "loss": 0.5361344218254089, - "mean_token_accuracy": 0.7858189940452576, - "num_tokens": 12319146.0, + "loss": 0.6290674209594727, + "mean_token_accuracy": 0.7430498450994492, + "num_tokens": 5962505.0, "step": 160 }, { - "entropy": 0.5582098960876465, - "epoch": 5.032, - "grad_norm": 0.022894199937582016, + "entropy": 0.6140859052538872, + "epoch": 1.0454914703493094, + "grad_norm": 0.010381487198174, "learning_rate": 0.0002, - "loss": 0.5531452894210815, - "mean_token_accuracy": 0.7776804864406586, - "num_tokens": 12397752.0, + "loss": 0.6180790662765503, + "mean_token_accuracy": 0.7507300451397896, + "num_tokens": 5999871.0, "step": 161 }, { - "entropy": 0.5599130690097809, - "epoch": 5.064, - "grad_norm": 0.025759946554899216, + "entropy": 0.6197154447436333, + "epoch": 1.0519902518277824, + "grad_norm": 0.009876130148768425, "learning_rate": 0.0002, - "loss": 0.5595382452011108, - "mean_token_accuracy": 0.7729753255844116, - "num_tokens": 12476444.0, + "loss": 0.6249828338623047, + "mean_token_accuracy": 0.7454148605465889, + "num_tokens": 6037575.0, "step": 162 }, { - "entropy": 0.5494701564311981, - "epoch": 5.096, - "grad_norm": 0.027650512754917145, + "entropy": 0.6122508272528648, + "epoch": 1.058489033306255, + "grad_norm": 0.008684883825480938, "learning_rate": 0.0002, - "loss": 0.552753210067749, - "mean_token_accuracy": 0.7775422781705856, - "num_tokens": 12556559.0, + "loss": 0.6138869524002075, + "mean_token_accuracy": 0.7517640963196754, + "num_tokens": 6074892.0, "step": 163 }, { - "entropy": 0.5431053638458252, - "epoch": 5.128, - "grad_norm": 0.02576346881687641, + "entropy": 0.6194281056523323, + "epoch": 1.0649878147847278, + "grad_norm": 0.010471724905073643, "learning_rate": 0.0002, - "loss": 0.543494701385498, - "mean_token_accuracy": 0.7810918986797333, - "num_tokens": 12635217.0, + "loss": 0.6223649978637695, + "mean_token_accuracy": 0.7462374493479729, + "num_tokens": 6112197.0, "step": 164 }, { - "entropy": 0.5598382949829102, - "epoch": 5.16, - "grad_norm": 0.022493746131658554, + "entropy": 0.6203417181968689, + "epoch": 1.0714865962632008, + "grad_norm": 0.00992770865559578, "learning_rate": 0.0002, - "loss": 0.5572130680084229, - "mean_token_accuracy": 0.7740350961685181, - "num_tokens": 12713524.0, + "loss": 0.6209006309509277, + "mean_token_accuracy": 0.7480901628732681, + "num_tokens": 6149571.0, "step": 165 }, { - "entropy": 0.545780748128891, - "epoch": 5.192, - "grad_norm": 0.027349475771188736, + "entropy": 0.6099580377340317, + "epoch": 1.0779853777416735, + "grad_norm": 0.00981567706912756, "learning_rate": 0.0002, - "loss": 0.5389693379402161, - "mean_token_accuracy": 0.7838597297668457, - "num_tokens": 12793300.0, + "loss": 0.6166203022003174, + "mean_token_accuracy": 0.7501059100031853, + "num_tokens": 6186570.0, "step": 166 }, { - "entropy": 0.5592958778142929, - "epoch": 5.224, - "grad_norm": 0.028276948258280754, + "entropy": 0.6217071712017059, + "epoch": 1.0844841592201462, + "grad_norm": 0.009364967234432697, "learning_rate": 0.0002, - "loss": 0.5530558824539185, - "mean_token_accuracy": 0.7787036746740341, - "num_tokens": 12872372.0, + "loss": 0.6240255236625671, + "mean_token_accuracy": 0.7475733831524849, + "num_tokens": 6224124.0, "step": 167 }, { - "entropy": 0.5440209805965424, - "epoch": 5.256, - "grad_norm": 0.029081838205456734, + "entropy": 0.6265001520514488, + "epoch": 1.090982940698619, + "grad_norm": 0.009150683879852295, "learning_rate": 0.0002, - "loss": 0.5472489595413208, - "mean_token_accuracy": 0.7790472209453583, - "num_tokens": 12950474.0, + "loss": 0.6249997615814209, + "mean_token_accuracy": 0.7465919181704521, + "num_tokens": 6261544.0, "step": 168 }, { - "entropy": 0.541302427649498, - "epoch": 5.288, - "grad_norm": 0.03218315914273262, + "entropy": 0.6337415799498558, + "epoch": 1.0974817221770918, + "grad_norm": 0.009555370546877384, "learning_rate": 0.0002, - "loss": 0.5454750657081604, - "mean_token_accuracy": 0.7817174345254898, - "num_tokens": 13029478.0, + "loss": 0.6337403059005737, + "mean_token_accuracy": 0.7431929185986519, + "num_tokens": 6298708.0, "step": 169 }, { - "entropy": 0.5527262985706329, - "epoch": 5.32, - "grad_norm": 0.023637501522898674, + "entropy": 0.6212407127022743, + "epoch": 1.1039805036555645, + "grad_norm": 0.009204280562698841, "learning_rate": 0.0002, - "loss": 0.5539190769195557, - "mean_token_accuracy": 0.7765050381422043, - "num_tokens": 13107874.0, + "loss": 0.6198785305023193, + "mean_token_accuracy": 0.7490911036729813, + "num_tokens": 6336357.0, "step": 170 }, { - "entropy": 0.5566678494215012, - "epoch": 5.352, - "grad_norm": 0.030741648748517036, + "entropy": 0.6211022287607193, + "epoch": 1.1104792851340373, + "grad_norm": 0.010933548212051392, "learning_rate": 0.0002, - "loss": 0.5524072647094727, - "mean_token_accuracy": 0.7761627286672592, - "num_tokens": 13187034.0, + "loss": 0.6218096017837524, + "mean_token_accuracy": 0.7478840723633766, + "num_tokens": 6373815.0, "step": 171 }, { - "entropy": 0.5590717494487762, - "epoch": 5.384, - "grad_norm": 0.02631162852048874, + "entropy": 0.6218304485082626, + "epoch": 1.1169780666125102, + "grad_norm": 0.007957971654832363, "learning_rate": 0.0002, - "loss": 0.5528249740600586, - "mean_token_accuracy": 0.7761536091566086, - "num_tokens": 13266614.0, + "loss": 0.6211934089660645, + "mean_token_accuracy": 0.7479007542133331, + "num_tokens": 6411469.0, "step": 172 }, { - "entropy": 0.54710254073143, - "epoch": 5.416, - "grad_norm": 0.030295731499791145, + "entropy": 0.623476430773735, + "epoch": 1.123476848090983, + "grad_norm": 0.008693872950971127, "learning_rate": 0.0002, - "loss": 0.5446665287017822, - "mean_token_accuracy": 0.7795543521642685, - "num_tokens": 13345744.0, + "loss": 0.628318727016449, + "mean_token_accuracy": 0.7435088455677032, + "num_tokens": 6448782.0, "step": 173 }, { - "entropy": 0.5439110398292542, - "epoch": 5.448, - "grad_norm": 0.028032993897795677, + "entropy": 0.6133372634649277, + "epoch": 1.1299756295694556, + "grad_norm": 0.010963717475533485, "learning_rate": 0.0002, - "loss": 0.5464545488357544, - "mean_token_accuracy": 0.7813926637172699, - "num_tokens": 13424891.0, + "loss": 0.6166828274726868, + "mean_token_accuracy": 0.7512464672327042, + "num_tokens": 6485790.0, "step": 174 }, { - "entropy": 0.545119971036911, - "epoch": 5.48, - "grad_norm": 0.026973431929945946, + "entropy": 0.6234560832381248, + "epoch": 1.1364744110479286, + "grad_norm": 0.009953116998076439, "learning_rate": 0.0002, - "loss": 0.5461452007293701, - "mean_token_accuracy": 0.7802118062973022, - "num_tokens": 13503380.0, + "loss": 0.6275191903114319, + "mean_token_accuracy": 0.7457004636526108, + "num_tokens": 6523433.0, "step": 175 }, { - "entropy": 0.5575177073478699, - "epoch": 5.5120000000000005, - "grad_norm": 0.026447977870702744, + "entropy": 0.612127959728241, + "epoch": 1.1429731925264013, + "grad_norm": 0.008568039163947105, "learning_rate": 0.0002, - "loss": 0.5565048456192017, - "mean_token_accuracy": 0.7753730118274689, - "num_tokens": 13581504.0, + "loss": 0.6111507415771484, + "mean_token_accuracy": 0.7523760348558426, + "num_tokens": 6560764.0, "step": 176 }, { - "entropy": 0.5443647503852844, - "epoch": 5.5440000000000005, - "grad_norm": 0.026733124628663063, + "entropy": 0.6384553462266922, + "epoch": 1.149471974004874, + "grad_norm": 0.010018682107329369, "learning_rate": 0.0002, - "loss": 0.5393130779266357, - "mean_token_accuracy": 0.7818372398614883, - "num_tokens": 13659491.0, + "loss": 0.6336829662322998, + "mean_token_accuracy": 0.743287555873394, + "num_tokens": 6598409.0, "step": 177 }, { - "entropy": 0.5571713000535965, - "epoch": 5.576, - "grad_norm": 0.02440747246146202, + "entropy": 0.6272930577397346, + "epoch": 1.155970755483347, + "grad_norm": 0.009546359069645405, "learning_rate": 0.0002, - "loss": 0.5560795664787292, - "mean_token_accuracy": 0.7749420404434204, - "num_tokens": 13736686.0, + "loss": 0.626544713973999, + "mean_token_accuracy": 0.7449387013912201, + "num_tokens": 6636067.0, "step": 178 }, { - "entropy": 0.543163537979126, - "epoch": 5.608, - "grad_norm": 0.020597316324710846, + "entropy": 0.6086627542972565, + "epoch": 1.1624695369618196, + "grad_norm": 0.009319686330854893, "learning_rate": 0.0002, - "loss": 0.5401595234870911, - "mean_token_accuracy": 0.7831601202487946, - "num_tokens": 13816007.0, + "loss": 0.6141277551651001, + "mean_token_accuracy": 0.7520448267459869, + "num_tokens": 6673446.0, "step": 179 }, { - "entropy": 0.5275207906961441, - "epoch": 5.64, - "grad_norm": 0.021762844175100327, + "entropy": 0.5994155630469322, + "epoch": 1.1689683184402924, + "grad_norm": 0.011318805627524853, "learning_rate": 0.0002, - "loss": 0.5270570516586304, - "mean_token_accuracy": 0.7863520830869675, - "num_tokens": 13895212.0, + "loss": 0.6087459325790405, + "mean_token_accuracy": 0.7519726976752281, + "num_tokens": 6710715.0, "step": 180 }, { - "entropy": 0.5509206503629684, - "epoch": 5.672, - "grad_norm": 0.025359727442264557, + "entropy": 0.6187063455581665, + "epoch": 1.1754670999187653, + "grad_norm": 0.009100009687244892, "learning_rate": 0.0002, - "loss": 0.5518645644187927, - "mean_token_accuracy": 0.7776848524808884, - "num_tokens": 13973672.0, + "loss": 0.6213230490684509, + "mean_token_accuracy": 0.7466496899724007, + "num_tokens": 6748737.0, "step": 181 }, { - "entropy": 0.5468782633543015, - "epoch": 5.704, - "grad_norm": 0.023991327732801437, + "entropy": 0.6402401477098465, + "epoch": 1.181965881397238, + "grad_norm": 0.009086531586945057, "learning_rate": 0.0002, - "loss": 0.5474581718444824, - "mean_token_accuracy": 0.7794180512428284, - "num_tokens": 14052724.0, + "loss": 0.636063277721405, + "mean_token_accuracy": 0.7429427057504654, + "num_tokens": 6785555.0, "step": 182 }, { - "entropy": 0.5526992231607437, - "epoch": 5.736, - "grad_norm": 0.01987096108496189, + "entropy": 0.6275543943047523, + "epoch": 1.1884646628757107, + "grad_norm": 0.00983697734773159, "learning_rate": 0.0002, - "loss": 0.5501133799552917, - "mean_token_accuracy": 0.7786473035812378, - "num_tokens": 14131904.0, + "loss": 0.6195461750030518, + "mean_token_accuracy": 0.7482333034276962, + "num_tokens": 6822608.0, "step": 183 }, { - "entropy": 0.5467601120471954, - "epoch": 5.768, - "grad_norm": 0.02320663444697857, + "entropy": 0.6261148154735565, + "epoch": 1.1949634443541837, + "grad_norm": 0.008595704101026058, "learning_rate": 0.0002, - "loss": 0.5411819815635681, - "mean_token_accuracy": 0.7823377251625061, - "num_tokens": 14210960.0, + "loss": 0.6235471963882446, + "mean_token_accuracy": 0.7465647235512733, + "num_tokens": 6860107.0, "step": 184 }, { - "entropy": 0.5405216664075851, - "epoch": 5.8, - "grad_norm": 0.021056123077869415, + "entropy": 0.615828700363636, + "epoch": 1.2014622258326564, + "grad_norm": 0.010348568670451641, "learning_rate": 0.0002, - "loss": 0.5362813472747803, - "mean_token_accuracy": 0.7848241031169891, - "num_tokens": 14291726.0, + "loss": 0.6194600462913513, + "mean_token_accuracy": 0.7490681707859039, + "num_tokens": 6897202.0, "step": 185 }, { - "entropy": 0.5541730970144272, - "epoch": 5.832, - "grad_norm": 0.02818496711552143, + "entropy": 0.6132261380553246, + "epoch": 1.207961007311129, + "grad_norm": 0.010876818560063839, "learning_rate": 0.0002, - "loss": 0.5557092428207397, - "mean_token_accuracy": 0.7762422263622284, - "num_tokens": 14369724.0, + "loss": 0.6224918365478516, + "mean_token_accuracy": 0.7479420974850655, + "num_tokens": 6934670.0, "step": 186 }, { - "entropy": 0.5322004407644272, - "epoch": 5.864, - "grad_norm": 0.02371285855770111, + "entropy": 0.6103203073143959, + "epoch": 1.214459788789602, + "grad_norm": 0.009953301399946213, "learning_rate": 0.0002, - "loss": 0.531102180480957, - "mean_token_accuracy": 0.7858971059322357, - "num_tokens": 14448931.0, + "loss": 0.6190877556800842, + "mean_token_accuracy": 0.7497604489326477, + "num_tokens": 6971658.0, "step": 187 }, { - "entropy": 0.5547012537717819, - "epoch": 5.896, - "grad_norm": 0.036903511732816696, + "entropy": 0.617573581635952, + "epoch": 1.2209585702680747, + "grad_norm": 0.00837781187146902, "learning_rate": 0.0002, - "loss": 0.5559762120246887, - "mean_token_accuracy": 0.776378944516182, - "num_tokens": 14526949.0, + "loss": 0.617588996887207, + "mean_token_accuracy": 0.7494269385933876, + "num_tokens": 7009123.0, "step": 188 }, { - "entropy": 0.5446574836969376, - "epoch": 5.928, - "grad_norm": 0.026452112942934036, + "entropy": 0.629171572625637, + "epoch": 1.2274573517465475, + "grad_norm": 0.008275787346065044, "learning_rate": 0.0002, - "loss": 0.5377969145774841, - "mean_token_accuracy": 0.7841950803995132, - "num_tokens": 14604335.0, + "loss": 0.6283445358276367, + "mean_token_accuracy": 0.7444169595837593, + "num_tokens": 7046906.0, "step": 189 }, { - "entropy": 0.5493032783269882, - "epoch": 5.96, - "grad_norm": 0.029249282553792, + "entropy": 0.6318405717611313, + "epoch": 1.2339561332250204, + "grad_norm": 0.008116304874420166, "learning_rate": 0.0002, - "loss": 0.5473008155822754, - "mean_token_accuracy": 0.7784675061702728, - "num_tokens": 14683487.0, + "loss": 0.6320441365242004, + "mean_token_accuracy": 0.7443558126688004, + "num_tokens": 7084180.0, "step": 190 }, { - "entropy": 0.5538213402032852, - "epoch": 5.992, - "grad_norm": 0.025735314935445786, + "entropy": 0.6146104484796524, + "epoch": 1.2404549147034931, + "grad_norm": 0.009803351014852524, "learning_rate": 0.0002, - "loss": 0.552562952041626, - "mean_token_accuracy": 0.7783134877681732, - "num_tokens": 14763050.0, + "loss": 0.6140527725219727, + "mean_token_accuracy": 0.7488429099321365, + "num_tokens": 7121475.0, "step": 191 }, { - "entropy": 0.5568431615829468, - "epoch": 6.0, - "grad_norm": 0.0419342927634716, + "entropy": 0.6153127253055573, + "epoch": 1.2469536961819658, + "grad_norm": 0.007825122214853764, "learning_rate": 0.0002, - "loss": 0.5596759915351868, - "mean_token_accuracy": 0.7757459878921509, - "num_tokens": 14783084.0, + "loss": 0.6195809245109558, + "mean_token_accuracy": 0.7493974566459656, + "num_tokens": 7158753.0, "step": 192 }, { - "entropy": 0.5499615967273712, - "epoch": 6.032, - "grad_norm": 0.030985454097390175, + "entropy": 0.6186842620372772, + "epoch": 1.2534524776604385, + "grad_norm": 0.00928817130625248, "learning_rate": 0.0002, - "loss": 0.5423964262008667, - "mean_token_accuracy": 0.7811243683099747, - "num_tokens": 14861223.0, + "loss": 0.6203854084014893, + "mean_token_accuracy": 0.748259611427784, + "num_tokens": 7195797.0, "step": 193 }, { - "entropy": 0.545973002910614, - "epoch": 6.064, - "grad_norm": 0.03047715686261654, + "entropy": 0.6210475564002991, + "epoch": 1.2599512591389115, + "grad_norm": 0.010004797019064426, "learning_rate": 0.0002, - "loss": 0.5429363250732422, - "mean_token_accuracy": 0.7807959467172623, - "num_tokens": 14939948.0, + "loss": 0.6249719858169556, + "mean_token_accuracy": 0.7474558278918266, + "num_tokens": 7233547.0, "step": 194 }, { - "entropy": 0.5407204329967499, - "epoch": 6.096, - "grad_norm": 0.026628416031599045, + "entropy": 0.6319233104586601, + "epoch": 1.2664500406173842, + "grad_norm": 0.010124076157808304, "learning_rate": 0.0002, - "loss": 0.5426843166351318, - "mean_token_accuracy": 0.7809197157621384, - "num_tokens": 15018808.0, + "loss": 0.6346510648727417, + "mean_token_accuracy": 0.7430363744497299, + "num_tokens": 7271165.0, "step": 195 }, { - "entropy": 0.5479950308799744, - "epoch": 6.128, - "grad_norm": 0.03580361232161522, + "entropy": 0.6228615492582321, + "epoch": 1.2729488220958571, + "grad_norm": 0.00920382421463728, "learning_rate": 0.0002, - "loss": 0.5534794926643372, - "mean_token_accuracy": 0.777429461479187, - "num_tokens": 15096870.0, + "loss": 0.6211229562759399, + "mean_token_accuracy": 0.7490492090582848, + "num_tokens": 7308659.0, "step": 196 }, { - "entropy": 0.5385048538446426, - "epoch": 6.16, - "grad_norm": 0.023637505248188972, + "entropy": 0.6310986131429672, + "epoch": 1.2794476035743299, + "grad_norm": 0.009224419482052326, "learning_rate": 0.0002, - "loss": 0.5380685329437256, - "mean_token_accuracy": 0.783260390162468, - "num_tokens": 15174757.0, + "loss": 0.626353919506073, + "mean_token_accuracy": 0.7454532235860825, + "num_tokens": 7346203.0, "step": 197 }, { - "entropy": 0.5591510534286499, - "epoch": 6.192, - "grad_norm": 0.03232690691947937, + "entropy": 0.610854484140873, + "epoch": 1.2859463850528026, + "grad_norm": 0.009150652214884758, "learning_rate": 0.0002, - "loss": 0.5529967546463013, - "mean_token_accuracy": 0.7766391485929489, - "num_tokens": 15252758.0, + "loss": 0.6110652685165405, + "mean_token_accuracy": 0.7504596933722496, + "num_tokens": 7383470.0, "step": 198 }, { - "entropy": 0.5531331598758698, - "epoch": 6.224, - "grad_norm": 0.027761192992329597, + "entropy": 0.6061088666319847, + "epoch": 1.2924451665312753, + "grad_norm": 0.008921864442527294, "learning_rate": 0.0002, - "loss": 0.5476256608963013, - "mean_token_accuracy": 0.7792367190122604, - "num_tokens": 15330164.0, + "loss": 0.611494779586792, + "mean_token_accuracy": 0.7522832676768303, + "num_tokens": 7420939.0, "step": 199 }, { - "entropy": 0.5431746989488602, - "epoch": 6.256, - "grad_norm": 0.029444098472595215, + "entropy": 0.6130355596542358, + "epoch": 1.2989439480097482, + "grad_norm": 0.009989106096327305, "learning_rate": 0.0002, - "loss": 0.5440195798873901, - "mean_token_accuracy": 0.7816928923130035, - "num_tokens": 15408291.0, + "loss": 0.6249145269393921, + "mean_token_accuracy": 0.7437470331788063, + "num_tokens": 7458037.0, "step": 200 }, { - "entropy": 0.5401950180530548, - "epoch": 6.288, - "grad_norm": 0.030943166464567184, + "entropy": 0.6245267316699028, + "epoch": 1.305442729488221, + "grad_norm": 0.008322354406118393, "learning_rate": 0.0002, - "loss": 0.5441604852676392, - "mean_token_accuracy": 0.7797262668609619, - "num_tokens": 15486855.0, + "loss": 0.6295627355575562, + "mean_token_accuracy": 0.7449559271335602, + "num_tokens": 7495466.0, "step": 201 }, { - "entropy": 0.5358632057905197, - "epoch": 6.32, - "grad_norm": 0.025611277669668198, + "entropy": 0.6188690215349197, + "epoch": 1.3119415109666939, + "grad_norm": 0.008306242525577545, "learning_rate": 0.0002, - "loss": 0.5336735844612122, - "mean_token_accuracy": 0.7844033241271973, - "num_tokens": 15565945.0, + "loss": 0.6199623942375183, + "mean_token_accuracy": 0.7464429587125778, + "num_tokens": 7533028.0, "step": 202 }, { - "entropy": 0.5415282398462296, - "epoch": 6.352, - "grad_norm": 0.03050980716943741, + "entropy": 0.6284244954586029, + "epoch": 1.3184402924451666, + "grad_norm": 0.008912610821425915, "learning_rate": 0.0002, - "loss": 0.5411715507507324, - "mean_token_accuracy": 0.7807140350341797, - "num_tokens": 15644120.0, + "loss": 0.6269126534461975, + "mean_token_accuracy": 0.7451603710651398, + "num_tokens": 7570454.0, "step": 203 }, { - "entropy": 0.5550639480352402, - "epoch": 6.384, - "grad_norm": 0.025711113587021828, + "entropy": 0.6253558248281479, + "epoch": 1.3249390739236393, + "grad_norm": 0.009339334443211555, "learning_rate": 0.0002, - "loss": 0.5523407459259033, - "mean_token_accuracy": 0.7759165465831757, - "num_tokens": 15721932.0, + "loss": 0.6178290247917175, + "mean_token_accuracy": 0.749000295996666, + "num_tokens": 7607813.0, "step": 204 }, { - "entropy": 0.5459660887718201, - "epoch": 6.416, - "grad_norm": 0.028625324368476868, + "entropy": 0.6330921202898026, + "epoch": 1.331437855402112, + "grad_norm": 0.009055222384631634, "learning_rate": 0.0002, - "loss": 0.5404061675071716, - "mean_token_accuracy": 0.7824661731719971, - "num_tokens": 15801402.0, + "loss": 0.627162754535675, + "mean_token_accuracy": 0.7448414042592049, + "num_tokens": 7645571.0, "step": 205 }, { - "entropy": 0.5531899780035019, - "epoch": 6.448, - "grad_norm": 0.026339178904891014, + "entropy": 0.612213708460331, + "epoch": 1.337936636880585, + "grad_norm": 0.00788091029971838, "learning_rate": 0.0002, - "loss": 0.5514405369758606, - "mean_token_accuracy": 0.7779718488454819, - "num_tokens": 15880514.0, + "loss": 0.6103406548500061, + "mean_token_accuracy": 0.7524209767580032, + "num_tokens": 7682827.0, "step": 206 }, { - "entropy": 0.5400968790054321, - "epoch": 6.48, - "grad_norm": 0.030028901994228363, + "entropy": 0.6196805313229561, + "epoch": 1.3444354183590577, + "grad_norm": 0.0074918679893016815, "learning_rate": 0.0002, - "loss": 0.5434284210205078, - "mean_token_accuracy": 0.7791207730770111, - "num_tokens": 15959144.0, + "loss": 0.6231103539466858, + "mean_token_accuracy": 0.7457561120390892, + "num_tokens": 7720532.0, "step": 207 }, { - "entropy": 0.5307324081659317, - "epoch": 6.5120000000000005, - "grad_norm": 0.02786673791706562, + "entropy": 0.6148431301116943, + "epoch": 1.3509341998375304, + "grad_norm": 0.008005033247172832, "learning_rate": 0.0002, - "loss": 0.5343931317329407, - "mean_token_accuracy": 0.7839188724756241, - "num_tokens": 16039776.0, + "loss": 0.6224607825279236, + "mean_token_accuracy": 0.7475835010409355, + "num_tokens": 7757914.0, "step": 208 }, { - "entropy": 0.5425277054309845, - "epoch": 6.5440000000000005, - "grad_norm": 0.02753874473273754, + "entropy": 0.6162410527467728, + "epoch": 1.3574329813160033, + "grad_norm": 0.008755719289183617, "learning_rate": 0.0002, - "loss": 0.5446346998214722, - "mean_token_accuracy": 0.7797478884458542, - "num_tokens": 16118884.0, + "loss": 0.6230734586715698, + "mean_token_accuracy": 0.7474293559789658, + "num_tokens": 7795111.0, "step": 209 }, { - "entropy": 0.5513077974319458, - "epoch": 6.576, - "grad_norm": 0.028762485831975937, + "entropy": 0.6132988333702087, + "epoch": 1.363931762794476, + "grad_norm": 0.008136742748320103, "learning_rate": 0.0002, - "loss": 0.5451760292053223, - "mean_token_accuracy": 0.7815571874380112, - "num_tokens": 16197259.0, + "loss": 0.6189343929290771, + "mean_token_accuracy": 0.7504551187157631, + "num_tokens": 7832380.0, "step": 210 }, { - "entropy": 0.560958668589592, - "epoch": 6.608, - "grad_norm": 0.02965443953871727, + "entropy": 0.62418133020401, + "epoch": 1.3704305442729487, + "grad_norm": 0.007090510334819555, "learning_rate": 0.0002, - "loss": 0.5526363849639893, - "mean_token_accuracy": 0.7772418111562729, - "num_tokens": 16276149.0, + "loss": 0.6275556087493896, + "mean_token_accuracy": 0.744689516723156, + "num_tokens": 7869774.0, "step": 211 }, { - "entropy": 0.537281408905983, - "epoch": 6.64, - "grad_norm": 0.023833326995372772, + "entropy": 0.6151341274380684, + "epoch": 1.3769293257514217, + "grad_norm": 0.008890950120985508, "learning_rate": 0.0002, - "loss": 0.532819390296936, - "mean_token_accuracy": 0.7847591936588287, - "num_tokens": 16356969.0, + "loss": 0.6140053272247314, + "mean_token_accuracy": 0.7508121132850647, + "num_tokens": 7906943.0, "step": 212 }, { - "entropy": 0.5362367182970047, - "epoch": 6.672, - "grad_norm": 0.02524951472878456, + "entropy": 0.6221983805298805, + "epoch": 1.3834281072298944, + "grad_norm": 0.009338715113699436, "learning_rate": 0.0002, - "loss": 0.5348524451255798, - "mean_token_accuracy": 0.7850412726402283, - "num_tokens": 16436635.0, + "loss": 0.6216065883636475, + "mean_token_accuracy": 0.7504482716321945, + "num_tokens": 7944646.0, "step": 213 }, { - "entropy": 0.5361433327198029, - "epoch": 6.704, - "grad_norm": 0.03111296147108078, + "entropy": 0.6131090745329857, + "epoch": 1.3899268887083671, + "grad_norm": 0.00849352777004242, "learning_rate": 0.0002, - "loss": 0.5393766164779663, - "mean_token_accuracy": 0.7813311666250229, - "num_tokens": 16515650.0, + "loss": 0.6095527410507202, + "mean_token_accuracy": 0.7533553466200829, + "num_tokens": 7982267.0, "step": 214 }, { - "entropy": 0.5386303067207336, - "epoch": 6.736, - "grad_norm": 0.026461219415068626, + "entropy": 0.6085495501756668, + "epoch": 1.39642567018684, + "grad_norm": 0.007540795486420393, "learning_rate": 0.0002, - "loss": 0.5373357534408569, - "mean_token_accuracy": 0.7834987640380859, - "num_tokens": 16595744.0, + "loss": 0.6092317700386047, + "mean_token_accuracy": 0.7533180490136147, + "num_tokens": 8019466.0, "step": 215 }, { - "entropy": 0.5392462760210037, - "epoch": 6.768, - "grad_norm": 0.027499942108988762, + "entropy": 0.6296884343028069, + "epoch": 1.4029244516653128, + "grad_norm": 0.009902682155370712, "learning_rate": 0.0002, - "loss": 0.5331963300704956, - "mean_token_accuracy": 0.7848135083913803, - "num_tokens": 16674509.0, + "loss": 0.6364089250564575, + "mean_token_accuracy": 0.7428499311208725, + "num_tokens": 8057400.0, "step": 216 }, { - "entropy": 0.5459368675947189, - "epoch": 6.8, - "grad_norm": 0.024176757782697678, + "entropy": 0.6165885776281357, + "epoch": 1.4094232331437855, + "grad_norm": 0.00911257229745388, "learning_rate": 0.0002, - "loss": 0.5415037870407104, - "mean_token_accuracy": 0.7818843722343445, - "num_tokens": 16754105.0, + "loss": 0.6247788071632385, + "mean_token_accuracy": 0.7464938163757324, + "num_tokens": 8094904.0, "step": 217 }, { - "entropy": 0.5565692782402039, - "epoch": 6.832, - "grad_norm": 0.02574721910059452, + "entropy": 0.6157428845763206, + "epoch": 1.4159220146222582, + "grad_norm": 0.007997944951057434, "learning_rate": 0.0002, - "loss": 0.5573182106018066, - "mean_token_accuracy": 0.7748913615942001, - "num_tokens": 16833119.0, + "loss": 0.6201274394989014, + "mean_token_accuracy": 0.7489686757326126, + "num_tokens": 8132290.0, "step": 218 }, { - "entropy": 0.5434060543775558, - "epoch": 6.864, - "grad_norm": 0.02367129735648632, + "entropy": 0.6217053309082985, + "epoch": 1.4224207961007311, + "grad_norm": 0.00811337772756815, "learning_rate": 0.0002, - "loss": 0.5418709516525269, - "mean_token_accuracy": 0.7805542647838593, - "num_tokens": 16913039.0, + "loss": 0.6197227239608765, + "mean_token_accuracy": 0.7485419660806656, + "num_tokens": 8169791.0, "step": 219 }, { - "entropy": 0.5493430346250534, - "epoch": 6.896, - "grad_norm": 0.02657475695014, + "entropy": 0.615436315536499, + "epoch": 1.4289195775792038, + "grad_norm": 0.008888707496225834, "learning_rate": 0.0002, - "loss": 0.547214686870575, - "mean_token_accuracy": 0.7784837335348129, - "num_tokens": 16991051.0, + "loss": 0.6124907732009888, + "mean_token_accuracy": 0.751116119325161, + "num_tokens": 8207092.0, "step": 220 }, { - "entropy": 0.5528377145528793, - "epoch": 6.928, - "grad_norm": 0.024269506335258484, + "entropy": 0.6246543675661087, + "epoch": 1.4354183590576768, + "grad_norm": 0.008732281625270844, "learning_rate": 0.0002, - "loss": 0.5508480668067932, - "mean_token_accuracy": 0.7769178003072739, - "num_tokens": 17069694.0, + "loss": 0.623694658279419, + "mean_token_accuracy": 0.7458877414464951, + "num_tokens": 8244309.0, "step": 221 }, { - "entropy": 0.5454904437065125, - "epoch": 6.96, - "grad_norm": 0.024885021150112152, + "entropy": 0.6304584518074989, + "epoch": 1.4419171405361495, + "grad_norm": 0.009999740868806839, "learning_rate": 0.0002, - "loss": 0.5465965270996094, - "mean_token_accuracy": 0.7797489613294601, - "num_tokens": 17147632.0, + "loss": 0.6301021575927734, + "mean_token_accuracy": 0.7443124279379845, + "num_tokens": 8281764.0, "step": 222 }, { - "entropy": 0.5398757457733154, - "epoch": 6.992, - "grad_norm": 0.02908923290669918, + "entropy": 0.6228891983628273, + "epoch": 1.4484159220146222, + "grad_norm": 0.009084641933441162, "learning_rate": 0.0002, - "loss": 0.5431025624275208, - "mean_token_accuracy": 0.779990091919899, - "num_tokens": 17227457.0, + "loss": 0.623934268951416, + "mean_token_accuracy": 0.746678814291954, + "num_tokens": 8319204.0, "step": 223 }, { - "entropy": 0.5505363941192627, - "epoch": 7.0, - "grad_norm": 0.03793865069746971, + "entropy": 0.6163553223013878, + "epoch": 1.454914703493095, + "grad_norm": 0.008567318320274353, "learning_rate": 0.0002, - "loss": 0.5468761324882507, - "mean_token_accuracy": 0.7777085304260254, - "num_tokens": 17246839.0, + "loss": 0.6207892894744873, + "mean_token_accuracy": 0.7486568316817284, + "num_tokens": 8356629.0, "step": 224 }, { - "entropy": 0.5342252403497696, - "epoch": 7.032, - "grad_norm": 0.03273385763168335, + "entropy": 0.6088405475020409, + "epoch": 1.4614134849715679, + "grad_norm": 0.00832637120038271, "learning_rate": 0.0002, - "loss": 0.5247677564620972, - "mean_token_accuracy": 0.7881321907043457, - "num_tokens": 17326090.0, + "loss": 0.612472414970398, + "mean_token_accuracy": 0.7514082416892052, + "num_tokens": 8394033.0, "step": 225 }, { - "entropy": 0.5373009145259857, - "epoch": 7.064, - "grad_norm": 0.025371287018060684, + "entropy": 0.614930123090744, + "epoch": 1.4679122664500406, + "grad_norm": 0.008623549714684486, "learning_rate": 0.0002, - "loss": 0.5323753952980042, - "mean_token_accuracy": 0.7845641523599625, - "num_tokens": 17405594.0, + "loss": 0.6192766427993774, + "mean_token_accuracy": 0.7488296180963516, + "num_tokens": 8431411.0, "step": 226 }, { - "entropy": 0.5337796360254288, - "epoch": 7.096, - "grad_norm": 0.03891294077038765, + "entropy": 0.6123254001140594, + "epoch": 1.4744110479285135, + "grad_norm": 0.008329757489264011, "learning_rate": 0.0002, - "loss": 0.5395870208740234, - "mean_token_accuracy": 0.7812530696392059, - "num_tokens": 17484846.0, + "loss": 0.614305317401886, + "mean_token_accuracy": 0.7501704543828964, + "num_tokens": 8468845.0, "step": 227 }, { - "entropy": 0.5363831967115402, - "epoch": 7.128, - "grad_norm": 0.03025059774518013, + "entropy": 0.6353933066129684, + "epoch": 1.4809098294069862, + "grad_norm": 0.010329898446798325, "learning_rate": 0.0002, - "loss": 0.538554847240448, - "mean_token_accuracy": 0.7826266288757324, - "num_tokens": 17563627.0, + "loss": 0.6299945712089539, + "mean_token_accuracy": 0.7446781396865845, + "num_tokens": 8506494.0, "step": 228 }, { - "entropy": 0.5457527041435242, - "epoch": 7.16, - "grad_norm": 0.027366969734430313, + "entropy": 0.6230698823928833, + "epoch": 1.487408610885459, + "grad_norm": 0.008529371581971645, "learning_rate": 0.0002, - "loss": 0.5434131622314453, - "mean_token_accuracy": 0.7804773300886154, - "num_tokens": 17642515.0, + "loss": 0.6179029941558838, + "mean_token_accuracy": 0.7506388053297997, + "num_tokens": 8543863.0, "step": 229 }, { - "entropy": 0.5363115072250366, - "epoch": 7.192, - "grad_norm": 0.03141327574849129, + "entropy": 0.6087015345692635, + "epoch": 1.4939073923639317, + "grad_norm": 0.008635671809315681, "learning_rate": 0.0002, - "loss": 0.5331645607948303, - "mean_token_accuracy": 0.7852070778608322, - "num_tokens": 17721303.0, + "loss": 0.6120889186859131, + "mean_token_accuracy": 0.7521615102887154, + "num_tokens": 8580998.0, "step": 230 }, { - "entropy": 0.5441312342882156, - "epoch": 7.224, - "grad_norm": 0.02731841430068016, + "entropy": 0.6111158281564713, + "epoch": 1.5004061738424046, + "grad_norm": 0.009943103417754173, "learning_rate": 0.0002, - "loss": 0.5440965890884399, - "mean_token_accuracy": 0.7794661670923233, - "num_tokens": 17799159.0, + "loss": 0.6142638921737671, + "mean_token_accuracy": 0.7509952187538147, + "num_tokens": 8618445.0, "step": 231 }, { - "entropy": 0.5447894930839539, - "epoch": 7.256, - "grad_norm": 0.03376320004463196, + "entropy": 0.6176108121871948, + "epoch": 1.5069049553208773, + "grad_norm": 0.007991382852196693, "learning_rate": 0.0002, - "loss": 0.543010950088501, - "mean_token_accuracy": 0.7805230468511581, - "num_tokens": 17877298.0, + "loss": 0.619983434677124, + "mean_token_accuracy": 0.7502688392996788, + "num_tokens": 8655969.0, "step": 232 }, { - "entropy": 0.5362501293420792, - "epoch": 7.288, - "grad_norm": 0.03332136943936348, + "entropy": 0.6207513734698296, + "epoch": 1.5134037367993503, + "grad_norm": 0.0076866415329277515, "learning_rate": 0.0002, - "loss": 0.5391461253166199, - "mean_token_accuracy": 0.7822219878435135, - "num_tokens": 17955795.0, + "loss": 0.626140296459198, + "mean_token_accuracy": 0.7469011545181274, + "num_tokens": 8693748.0, "step": 233 }, { - "entropy": 0.5330929756164551, - "epoch": 7.32, - "grad_norm": 0.029867252334952354, + "entropy": 0.6301305815577507, + "epoch": 1.519902518277823, + "grad_norm": 0.007992899045348167, "learning_rate": 0.0002, - "loss": 0.5306733846664429, - "mean_token_accuracy": 0.7851523607969284, - "num_tokens": 18035708.0, + "loss": 0.6301756501197815, + "mean_token_accuracy": 0.744783528149128, + "num_tokens": 8730930.0, "step": 234 }, { - "entropy": 0.54389688372612, - "epoch": 7.352, - "grad_norm": 0.03905443847179413, + "entropy": 0.6271040365099907, + "epoch": 1.5264012997562957, + "grad_norm": 0.008258827030658722, "learning_rate": 0.0002, - "loss": 0.541580080986023, - "mean_token_accuracy": 0.7805737406015396, - "num_tokens": 18112883.0, + "loss": 0.6266668438911438, + "mean_token_accuracy": 0.746114693582058, + "num_tokens": 8768377.0, "step": 235 }, { - "entropy": 0.5383184850215912, - "epoch": 7.384, - "grad_norm": 0.02882959507405758, + "entropy": 0.6152656748890877, + "epoch": 1.5329000812347684, + "grad_norm": 0.0098560880869627, "learning_rate": 0.0002, - "loss": 0.538108766078949, - "mean_token_accuracy": 0.7825261801481247, - "num_tokens": 18190190.0, + "loss": 0.6164472103118896, + "mean_token_accuracy": 0.7489713951945305, + "num_tokens": 8805779.0, "step": 236 }, { - "entropy": 0.5316631495952606, - "epoch": 7.416, - "grad_norm": 0.03594264015555382, + "entropy": 0.6294426172971725, + "epoch": 1.5393988627132411, + "grad_norm": 0.008523919619619846, "learning_rate": 0.0002, - "loss": 0.5299159288406372, - "mean_token_accuracy": 0.7848720252513885, - "num_tokens": 18269276.0, + "loss": 0.6326299905776978, + "mean_token_accuracy": 0.742644876241684, + "num_tokens": 8843123.0, "step": 237 }, { - "entropy": 0.5474216341972351, - "epoch": 7.448, - "grad_norm": 0.030706387013196945, + "entropy": 0.6143188178539276, + "epoch": 1.545897644191714, + "grad_norm": 0.007758335676044226, "learning_rate": 0.0002, - "loss": 0.5446693897247314, - "mean_token_accuracy": 0.7793966680765152, - "num_tokens": 18346679.0, + "loss": 0.6136566996574402, + "mean_token_accuracy": 0.7520029693841934, + "num_tokens": 8880249.0, "step": 238 }, { - "entropy": 0.5482395142316818, - "epoch": 7.48, - "grad_norm": 0.03116007335484028, + "entropy": 0.627038024365902, + "epoch": 1.552396425670187, + "grad_norm": 0.00911460816860199, "learning_rate": 0.0002, - "loss": 0.5429675579071045, - "mean_token_accuracy": 0.7807913720607758, - "num_tokens": 18425406.0, + "loss": 0.6299710869789124, + "mean_token_accuracy": 0.7446892932057381, + "num_tokens": 8917829.0, "step": 239 }, { - "entropy": 0.5305105894804001, - "epoch": 7.5120000000000005, - "grad_norm": 0.03157881647348404, + "entropy": 0.6183791384100914, + "epoch": 1.5588952071486597, + "grad_norm": 0.008657646365463734, "learning_rate": 0.0002, - "loss": 0.5327313542366028, - "mean_token_accuracy": 0.7842520177364349, - "num_tokens": 18505671.0, + "loss": 0.6220093965530396, + "mean_token_accuracy": 0.7485999315977097, + "num_tokens": 8955243.0, "step": 240 }, { - "entropy": 0.5307354480028152, - "epoch": 7.5440000000000005, - "grad_norm": 0.028445513918995857, + "entropy": 0.6323986351490021, + "epoch": 1.5653939886271324, + "grad_norm": 0.0085441330447793, "learning_rate": 0.0002, - "loss": 0.5331681966781616, - "mean_token_accuracy": 0.784986600279808, - "num_tokens": 18585516.0, + "loss": 0.6361583471298218, + "mean_token_accuracy": 0.7442645356059074, + "num_tokens": 8992960.0, "step": 241 }, { - "entropy": 0.5455832630395889, - "epoch": 7.576, - "grad_norm": 0.04114306718111038, + "entropy": 0.6108334213495255, + "epoch": 1.5718927701056051, + "grad_norm": 0.007725970819592476, "learning_rate": 0.0002, - "loss": 0.5481559038162231, - "mean_token_accuracy": 0.7785380184650421, - "num_tokens": 18663248.0, + "loss": 0.6101396083831787, + "mean_token_accuracy": 0.7506669163703918, + "num_tokens": 9030523.0, "step": 242 }, { - "entropy": 0.5406046807765961, - "epoch": 7.608, - "grad_norm": 0.033326584845781326, + "entropy": 0.6231397688388824, + "epoch": 1.5783915515840778, + "grad_norm": 0.008767355233430862, "learning_rate": 0.0002, - "loss": 0.5353219509124756, - "mean_token_accuracy": 0.7833963334560394, - "num_tokens": 18743695.0, + "loss": 0.622745156288147, + "mean_token_accuracy": 0.7461344972252846, + "num_tokens": 9067759.0, "step": 243 }, { - "entropy": 0.5466004610061646, - "epoch": 7.64, - "grad_norm": 0.03053242340683937, + "entropy": 0.627980038523674, + "epoch": 1.5848903330625508, + "grad_norm": 0.00843246839940548, "learning_rate": 0.0002, - "loss": 0.538567066192627, - "mean_token_accuracy": 0.7825069427490234, - "num_tokens": 18823876.0, + "loss": 0.632775604724884, + "mean_token_accuracy": 0.7432630062103271, + "num_tokens": 9105200.0, "step": 244 }, { - "entropy": 0.5553711205720901, - "epoch": 7.672, - "grad_norm": 0.03428297117352486, + "entropy": 0.6222330331802368, + "epoch": 1.5913891145410237, + "grad_norm": 0.008817244321107864, "learning_rate": 0.0002, - "loss": 0.5528771281242371, - "mean_token_accuracy": 0.7763674706220627, - "num_tokens": 18901081.0, + "loss": 0.625479519367218, + "mean_token_accuracy": 0.7454850673675537, + "num_tokens": 9142588.0, "step": 245 }, { - "entropy": 0.5412455052137375, - "epoch": 7.704, - "grad_norm": 0.03315138816833496, + "entropy": 0.6129688546061516, + "epoch": 1.5978878960194964, + "grad_norm": 0.009856261312961578, "learning_rate": 0.0002, - "loss": 0.5472655296325684, - "mean_token_accuracy": 0.7775164395570755, - "num_tokens": 18979461.0, + "loss": 0.6199933886528015, + "mean_token_accuracy": 0.7487855926156044, + "num_tokens": 9179884.0, "step": 246 }, { - "entropy": 0.5280198305845261, - "epoch": 7.736, - "grad_norm": 0.035438407212495804, + "entropy": 0.6239286884665489, + "epoch": 1.6043866774979691, + "grad_norm": 0.008906936272978783, "learning_rate": 0.0002, - "loss": 0.5257879495620728, - "mean_token_accuracy": 0.787413626909256, - "num_tokens": 19058324.0, + "loss": 0.6204976439476013, + "mean_token_accuracy": 0.7508985996246338, + "num_tokens": 9217103.0, "step": 247 }, { - "entropy": 0.5491799712181091, - "epoch": 7.768, - "grad_norm": 0.03031354583799839, + "entropy": 0.6336326971650124, + "epoch": 1.6108854589764419, + "grad_norm": 0.011355509981513023, "learning_rate": 0.0002, - "loss": 0.5499848127365112, - "mean_token_accuracy": 0.7769055813550949, - "num_tokens": 19136811.0, + "loss": 0.6262732744216919, + "mean_token_accuracy": 0.7465848848223686, + "num_tokens": 9254644.0, "step": 248 }, { - "entropy": 0.5516806840896606, - "epoch": 7.8, - "grad_norm": 0.03401699662208557, + "entropy": 0.6203413605690002, + "epoch": 1.6173842404549146, + "grad_norm": 0.007735299877822399, "learning_rate": 0.0002, - "loss": 0.5487878322601318, - "mean_token_accuracy": 0.7770615667104721, - "num_tokens": 19215642.0, + "loss": 0.6212904453277588, + "mean_token_accuracy": 0.7472884654998779, + "num_tokens": 9291724.0, "step": 249 }, { - "entropy": 0.5209604501724243, - "epoch": 7.832, - "grad_norm": 0.034633055329322815, + "entropy": 0.6144890040159225, + "epoch": 1.6238830219333875, + "grad_norm": 0.007746159564703703, "learning_rate": 0.0002, - "loss": 0.5194536447525024, - "mean_token_accuracy": 0.7909128665924072, - "num_tokens": 19296935.0, + "loss": 0.619687557220459, + "mean_token_accuracy": 0.7471293359994888, + "num_tokens": 9328841.0, "step": 250 }, { - "entropy": 0.5412441790103912, - "epoch": 7.864, - "grad_norm": 0.03364886716008186, + "entropy": 0.6305414438247681, + "epoch": 1.6303818034118602, + "grad_norm": 0.010060657747089863, "learning_rate": 0.0002, - "loss": 0.5379568934440613, - "mean_token_accuracy": 0.7831831127405167, - "num_tokens": 19374745.0, + "loss": 0.6419017314910889, + "mean_token_accuracy": 0.7386629730463028, + "num_tokens": 9366411.0, "step": 251 }, { - "entropy": 0.5517376810312271, - "epoch": 7.896, - "grad_norm": 0.026521844789385796, + "entropy": 0.6339073181152344, + "epoch": 1.6368805848903332, + "grad_norm": 0.007909824140369892, "learning_rate": 0.0002, - "loss": 0.5488777756690979, - "mean_token_accuracy": 0.7795552015304565, - "num_tokens": 19453532.0, + "loss": 0.6384083032608032, + "mean_token_accuracy": 0.7414835765957832, + "num_tokens": 9403421.0, "step": 252 }, { - "entropy": 0.5431555360555649, - "epoch": 7.928, - "grad_norm": 0.036673326045274734, + "entropy": 0.6129219457507133, + "epoch": 1.6433793663688059, + "grad_norm": 0.007407526019960642, "learning_rate": 0.0002, - "loss": 0.5410053730010986, - "mean_token_accuracy": 0.7819114327430725, - "num_tokens": 19532321.0, + "loss": 0.6125075817108154, + "mean_token_accuracy": 0.752901516854763, + "num_tokens": 9440793.0, "step": 253 }, { - "entropy": 0.5400401204824448, - "epoch": 7.96, - "grad_norm": 0.03132104128599167, + "entropy": 0.6255052834749222, + "epoch": 1.6498781478472786, + "grad_norm": 0.008314264938235283, "learning_rate": 0.0002, - "loss": 0.5396822690963745, - "mean_token_accuracy": 0.7816772311925888, - "num_tokens": 19611194.0, + "loss": 0.6215559244155884, + "mean_token_accuracy": 0.7486165389418602, + "num_tokens": 9477882.0, "step": 254 }, { - "entropy": 0.5364492535591125, - "epoch": 7.992, - "grad_norm": 0.03492264077067375, + "entropy": 0.6231755018234253, + "epoch": 1.6563769293257513, + "grad_norm": 0.0075997961685061455, "learning_rate": 0.0002, - "loss": 0.5373172163963318, - "mean_token_accuracy": 0.7828410267829895, - "num_tokens": 19690556.0, + "loss": 0.6211115121841431, + "mean_token_accuracy": 0.7495426833629608, + "num_tokens": 9515444.0, "step": 255 }, { - "entropy": 0.5176465511322021, - "epoch": 8.0, - "grad_norm": 0.04740741103887558, + "entropy": 0.6108886152505875, + "epoch": 1.6628757108042242, + "grad_norm": 0.007718959823250771, "learning_rate": 0.0002, - "loss": 0.5141822695732117, - "mean_token_accuracy": 0.7935296297073364, - "num_tokens": 19710992.0, + "loss": 0.6141905784606934, + "mean_token_accuracy": 0.7495709583163261, + "num_tokens": 9552755.0, "step": 256 }, { - "entropy": 0.5462612360715866, - "epoch": 8.032, - "grad_norm": 0.033493831753730774, + "entropy": 0.6075874269008636, + "epoch": 1.669374492282697, + "grad_norm": 0.008023767732083797, "learning_rate": 0.0002, - "loss": 0.5399432182312012, - "mean_token_accuracy": 0.7800467163324356, - "num_tokens": 19789675.0, + "loss": 0.6125887632369995, + "mean_token_accuracy": 0.7506251037120819, + "num_tokens": 9590261.0, "step": 257 }, { - "entropy": 0.5363253057003021, - "epoch": 8.064, - "grad_norm": 0.03170062601566315, + "entropy": 0.6148701831698418, + "epoch": 1.67587327376117, + "grad_norm": 0.008702424354851246, "learning_rate": 0.0002, - "loss": 0.5308842658996582, - "mean_token_accuracy": 0.7855557650327682, - "num_tokens": 19867187.0, + "loss": 0.6215870380401611, + "mean_token_accuracy": 0.7478265091776848, + "num_tokens": 9627758.0, "step": 258 }, { - "entropy": 0.5275291204452515, - "epoch": 8.096, - "grad_norm": 0.04521121829748154, + "entropy": 0.6036238297820091, + "epoch": 1.6823720552396426, + "grad_norm": 0.007766771595925093, "learning_rate": 0.0002, - "loss": 0.5327388644218445, - "mean_token_accuracy": 0.7848894149065018, - "num_tokens": 19945957.0, + "loss": 0.6084332466125488, + "mean_token_accuracy": 0.7513664737343788, + "num_tokens": 9664761.0, "step": 259 }, { - "entropy": 0.5200865566730499, - "epoch": 8.128, - "grad_norm": 0.029792284592986107, + "entropy": 0.6297216266393661, + "epoch": 1.6888708367181153, + "grad_norm": 0.009538715705275536, "learning_rate": 0.0002, - "loss": 0.5194977521896362, - "mean_token_accuracy": 0.7896896749734879, - "num_tokens": 20026028.0, + "loss": 0.6225094795227051, + "mean_token_accuracy": 0.7476939931511879, + "num_tokens": 9702161.0, "step": 260 }, { - "entropy": 0.5372072905302048, - "epoch": 8.16, - "grad_norm": 0.03705461695790291, + "entropy": 0.6292383894324303, + "epoch": 1.695369618196588, + "grad_norm": 0.00895692128688097, "learning_rate": 0.0002, - "loss": 0.5331783890724182, - "mean_token_accuracy": 0.7831152677536011, - "num_tokens": 20104507.0, + "loss": 0.6246432065963745, + "mean_token_accuracy": 0.7490787208080292, + "num_tokens": 9739248.0, "step": 261 }, { - "entropy": 0.547843337059021, - "epoch": 8.192, - "grad_norm": 0.04235028475522995, + "entropy": 0.6182943060994148, + "epoch": 1.7018683996750608, + "grad_norm": 0.008069152012467384, "learning_rate": 0.0002, - "loss": 0.5423978567123413, - "mean_token_accuracy": 0.7805410325527191, - "num_tokens": 20181982.0, + "loss": 0.6146731972694397, + "mean_token_accuracy": 0.7493266090750694, + "num_tokens": 9776948.0, "step": 262 }, { - "entropy": 0.5300101935863495, - "epoch": 8.224, - "grad_norm": 0.040369223803281784, + "entropy": 0.6093627437949181, + "epoch": 1.7083671811535337, + "grad_norm": 0.00886097177863121, "learning_rate": 0.0002, - "loss": 0.5269775390625, - "mean_token_accuracy": 0.786443218588829, - "num_tokens": 20260502.0, + "loss": 0.6172748804092407, + "mean_token_accuracy": 0.7474698126316071, + "num_tokens": 9814118.0, "step": 263 }, { - "entropy": 0.5322915017604828, - "epoch": 8.256, - "grad_norm": 0.03680511191487312, + "entropy": 0.599872387945652, + "epoch": 1.7148659626320066, + "grad_norm": 0.009245996363461018, "learning_rate": 0.0002, - "loss": 0.5325385332107544, - "mean_token_accuracy": 0.7842995822429657, - "num_tokens": 20338315.0, + "loss": 0.6081432700157166, + "mean_token_accuracy": 0.7528064101934433, + "num_tokens": 9851508.0, "step": 264 }, { - "entropy": 0.5264201015233994, - "epoch": 8.288, - "grad_norm": 0.033956896513700485, + "entropy": 0.6169805154204369, + "epoch": 1.7213647441104794, + "grad_norm": 0.009072757326066494, "learning_rate": 0.0002, - "loss": 0.5283188819885254, - "mean_token_accuracy": 0.7866097986698151, - "num_tokens": 20418550.0, + "loss": 0.6274439096450806, + "mean_token_accuracy": 0.7459535896778107, + "num_tokens": 9889084.0, "step": 265 }, { - "entropy": 0.5397807955741882, - "epoch": 8.32, - "grad_norm": 0.036973804235458374, + "entropy": 0.6127713099122047, + "epoch": 1.727863525588952, + "grad_norm": 0.0077358693815767765, "learning_rate": 0.0002, - "loss": 0.5362756848335266, - "mean_token_accuracy": 0.7828366905450821, - "num_tokens": 20496912.0, + "loss": 0.6177385449409485, + "mean_token_accuracy": 0.7487060204148293, + "num_tokens": 9926415.0, "step": 266 }, { - "entropy": 0.5398755520582199, - "epoch": 8.352, - "grad_norm": 0.03347233682870865, + "entropy": 0.6123405247926712, + "epoch": 1.7343623070674248, + "grad_norm": 0.00807071104645729, "learning_rate": 0.0002, - "loss": 0.5393750667572021, - "mean_token_accuracy": 0.7830456793308258, - "num_tokens": 20575356.0, + "loss": 0.6082473397254944, + "mean_token_accuracy": 0.7525108605623245, + "num_tokens": 9963968.0, "step": 267 }, { - "entropy": 0.5324622094631195, - "epoch": 8.384, - "grad_norm": 0.03724009171128273, + "entropy": 0.616507887840271, + "epoch": 1.7408610885458975, + "grad_norm": 0.008352074772119522, "learning_rate": 0.0002, - "loss": 0.5334412455558777, - "mean_token_accuracy": 0.7843203842639923, - "num_tokens": 20654961.0, + "loss": 0.6156948804855347, + "mean_token_accuracy": 0.7471591085195541, + "num_tokens": 10001164.0, "step": 268 }, { - "entropy": 0.5378891676664352, - "epoch": 8.416, - "grad_norm": 0.0343894436955452, + "entropy": 0.6224628537893295, + "epoch": 1.7473598700243704, + "grad_norm": 0.00863809883594513, "learning_rate": 0.0002, - "loss": 0.5370844602584839, - "mean_token_accuracy": 0.7837714999914169, - "num_tokens": 20734231.0, + "loss": 0.6212406158447266, + "mean_token_accuracy": 0.7489727661013603, + "num_tokens": 10038309.0, "step": 269 }, { - "entropy": 0.5237532556056976, - "epoch": 8.448, - "grad_norm": 0.03481991961598396, + "entropy": 0.6216438189148903, + "epoch": 1.7538586515028434, + "grad_norm": 0.00882699340581894, "learning_rate": 0.0002, - "loss": 0.5227078199386597, - "mean_token_accuracy": 0.7883624732494354, - "num_tokens": 20812680.0, + "loss": 0.6236106157302856, + "mean_token_accuracy": 0.7466619610786438, + "num_tokens": 10075167.0, "step": 270 }, { - "entropy": 0.5372126400470734, - "epoch": 8.48, - "grad_norm": 0.0352364219725132, + "entropy": 0.6243376582860947, + "epoch": 1.760357432981316, + "grad_norm": 0.008083442226052284, "learning_rate": 0.0002, - "loss": 0.5328319668769836, - "mean_token_accuracy": 0.7841216921806335, - "num_tokens": 20890719.0, + "loss": 0.6196388006210327, + "mean_token_accuracy": 0.7481562867760658, + "num_tokens": 10112463.0, "step": 271 }, { - "entropy": 0.537587359547615, - "epoch": 8.512, - "grad_norm": 0.04216265305876732, + "entropy": 0.6375504732131958, + "epoch": 1.7668562144597888, + "grad_norm": 0.009407855570316315, "learning_rate": 0.0002, - "loss": 0.536990761756897, - "mean_token_accuracy": 0.7831110805273056, - "num_tokens": 20969962.0, + "loss": 0.6351386308670044, + "mean_token_accuracy": 0.7419685274362564, + "num_tokens": 10150145.0, "step": 272 }, { - "entropy": 0.5395336449146271, - "epoch": 8.544, - "grad_norm": 0.03775520622730255, + "entropy": 0.6064025089144707, + "epoch": 1.7733549959382615, + "grad_norm": 0.008066139183938503, "learning_rate": 0.0002, - "loss": 0.5417099595069885, - "mean_token_accuracy": 0.7797977179288864, - "num_tokens": 21048464.0, + "loss": 0.6098955273628235, + "mean_token_accuracy": 0.7515333816409111, + "num_tokens": 10187476.0, "step": 273 }, { - "entropy": 0.5484501123428345, - "epoch": 8.576, - "grad_norm": 0.03163311630487442, + "entropy": 0.609002947807312, + "epoch": 1.7798537774167342, + "grad_norm": 0.0090776477009058, "learning_rate": 0.0002, - "loss": 0.5443800687789917, - "mean_token_accuracy": 0.7803587913513184, - "num_tokens": 21125761.0, + "loss": 0.6182198524475098, + "mean_token_accuracy": 0.749611884355545, + "num_tokens": 10224722.0, "step": 274 }, { - "entropy": 0.5378590673208237, - "epoch": 8.608, - "grad_norm": 0.03819214925169945, + "entropy": 0.6023535504937172, + "epoch": 1.7863525588952072, + "grad_norm": 0.008943675085902214, "learning_rate": 0.0002, - "loss": 0.5338118672370911, - "mean_token_accuracy": 0.7852731049060822, - "num_tokens": 21204791.0, + "loss": 0.6131588220596313, + "mean_token_accuracy": 0.7517130747437477, + "num_tokens": 10262008.0, "step": 275 }, { - "entropy": 0.5275268107652664, - "epoch": 8.64, - "grad_norm": 0.03613068163394928, + "entropy": 0.6100214198231697, + "epoch": 1.7928513403736799, + "grad_norm": 0.00780687527731061, "learning_rate": 0.0002, - "loss": 0.530475378036499, - "mean_token_accuracy": 0.7848686426877975, - "num_tokens": 21282818.0, + "loss": 0.6113550066947937, + "mean_token_accuracy": 0.7519525811076164, + "num_tokens": 10299484.0, "step": 276 }, { - "entropy": 0.5271630138158798, - "epoch": 8.672, - "grad_norm": 0.032881688326597214, + "entropy": 0.6407601237297058, + "epoch": 1.7993501218521528, + "grad_norm": 0.008408503606915474, "learning_rate": 0.0002, - "loss": 0.5283002257347107, - "mean_token_accuracy": 0.7857704162597656, - "num_tokens": 21363284.0, + "loss": 0.6413571834564209, + "mean_token_accuracy": 0.7412156239151955, + "num_tokens": 10337204.0, "step": 277 }, { - "entropy": 0.5359350591897964, - "epoch": 8.704, - "grad_norm": 0.037707071751356125, + "entropy": 0.6267746239900589, + "epoch": 1.8058489033306255, + "grad_norm": 0.00864301435649395, "learning_rate": 0.0002, - "loss": 0.5357704162597656, - "mean_token_accuracy": 0.783053383231163, - "num_tokens": 21442878.0, + "loss": 0.6232145428657532, + "mean_token_accuracy": 0.7470541223883629, + "num_tokens": 10374550.0, "step": 278 }, { - "entropy": 0.5460938811302185, - "epoch": 8.736, - "grad_norm": 0.033162783831357956, + "entropy": 0.6293241009116173, + "epoch": 1.8123476848090982, + "grad_norm": 0.00788764376193285, "learning_rate": 0.0002, - "loss": 0.5413697957992554, - "mean_token_accuracy": 0.7799932807683945, - "num_tokens": 21521994.0, + "loss": 0.624733567237854, + "mean_token_accuracy": 0.7457406893372536, + "num_tokens": 10412206.0, "step": 279 }, { - "entropy": 0.5444028526544571, - "epoch": 8.768, - "grad_norm": 0.03536875918507576, + "entropy": 0.6171272769570351, + "epoch": 1.818846466287571, + "grad_norm": 0.006805213168263435, "learning_rate": 0.0002, - "loss": 0.5372054576873779, - "mean_token_accuracy": 0.7830760926008224, - "num_tokens": 21601066.0, + "loss": 0.6169811487197876, + "mean_token_accuracy": 0.7512501701712608, + "num_tokens": 10449535.0, "step": 280 }, { - "entropy": 0.5271487236022949, - "epoch": 8.8, - "grad_norm": 0.04451414942741394, + "entropy": 0.6095528453588486, + "epoch": 1.825345247766044, + "grad_norm": 0.007181530352681875, "learning_rate": 0.0002, - "loss": 0.5246833562850952, - "mean_token_accuracy": 0.7879171818494797, - "num_tokens": 21680654.0, + "loss": 0.6091392040252686, + "mean_token_accuracy": 0.752260759472847, + "num_tokens": 10487049.0, "step": 281 }, { - "entropy": 0.5291329920291901, - "epoch": 8.832, - "grad_norm": 0.03518937528133392, + "entropy": 0.61494529992342, + "epoch": 1.8318440292445166, + "grad_norm": 0.008495395071804523, "learning_rate": 0.0002, - "loss": 0.5318595170974731, - "mean_token_accuracy": 0.783314660191536, - "num_tokens": 21759636.0, + "loss": 0.6144075393676758, + "mean_token_accuracy": 0.7521442621946335, + "num_tokens": 10524737.0, "step": 282 }, { - "entropy": 0.5357151627540588, - "epoch": 8.864, - "grad_norm": 0.035144057124853134, + "entropy": 0.6196796670556068, + "epoch": 1.8383428107229896, + "grad_norm": 0.00890264380723238, "learning_rate": 0.0002, - "loss": 0.5353978872299194, - "mean_token_accuracy": 0.7822486013174057, - "num_tokens": 21837957.0, + "loss": 0.6239107847213745, + "mean_token_accuracy": 0.7463233023881912, + "num_tokens": 10562188.0, "step": 283 }, { - "entropy": 0.5227695554494858, - "epoch": 8.896, - "grad_norm": 0.03644225001335144, + "entropy": 0.5968083441257477, + "epoch": 1.8448415922014623, + "grad_norm": 0.007078610826283693, "learning_rate": 0.0002, - "loss": 0.5201877951622009, - "mean_token_accuracy": 0.789432018995285, - "num_tokens": 21918900.0, + "loss": 0.5999591946601868, + "mean_token_accuracy": 0.7574170976877213, + "num_tokens": 10599566.0, "step": 284 }, { - "entropy": 0.5280223190784454, - "epoch": 8.928, - "grad_norm": 0.03295109048485756, + "entropy": 0.6290047243237495, + "epoch": 1.851340373679935, + "grad_norm": 0.0070074331015348434, "learning_rate": 0.0002, - "loss": 0.527430534362793, - "mean_token_accuracy": 0.7872951477766037, - "num_tokens": 21997073.0, + "loss": 0.6321331262588501, + "mean_token_accuracy": 0.7435007244348526, + "num_tokens": 10637008.0, "step": 285 }, { - "entropy": 0.5388615727424622, - "epoch": 8.96, - "grad_norm": 0.04273361712694168, + "entropy": 0.6198180019855499, + "epoch": 1.8578391551584077, + "grad_norm": 0.0070502436719834805, "learning_rate": 0.0002, - "loss": 0.53923100233078, - "mean_token_accuracy": 0.7823034077882767, - "num_tokens": 22077250.0, + "loss": 0.6187317967414856, + "mean_token_accuracy": 0.7489558085799217, + "num_tokens": 10674608.0, "step": 286 }, { - "entropy": 0.5351655334234238, - "epoch": 8.992, - "grad_norm": 0.03406304493546486, + "entropy": 0.6114784702658653, + "epoch": 1.8643379366368806, + "grad_norm": 0.009826047345995903, "learning_rate": 0.0002, - "loss": 0.5302039384841919, - "mean_token_accuracy": 0.7850055992603302, - "num_tokens": 22154821.0, + "loss": 0.6103346347808838, + "mean_token_accuracy": 0.7504026591777802, + "num_tokens": 10711947.0, "step": 287 }, { - "entropy": 0.5334904193878174, - "epoch": 9.0, - "grad_norm": 0.05444731563329697, + "entropy": 0.6145703047513962, + "epoch": 1.8708367181153533, + "grad_norm": 0.008549013175070286, "learning_rate": 0.0002, - "loss": 0.530449390411377, - "mean_token_accuracy": 0.7859096527099609, - "num_tokens": 22174693.0, + "loss": 0.6118488311767578, + "mean_token_accuracy": 0.7518711537122726, + "num_tokens": 10749467.0, "step": 288 }, { - "entropy": 0.5300431996583939, - "epoch": 9.032, - "grad_norm": 0.056497130542993546, + "entropy": 0.6132736206054688, + "epoch": 1.8773354995938263, + "grad_norm": 0.00803026370704174, "learning_rate": 0.0002, - "loss": 0.527766227722168, - "mean_token_accuracy": 0.785633996129036, - "num_tokens": 22251556.0, + "loss": 0.6166672706604004, + "mean_token_accuracy": 0.749387837946415, + "num_tokens": 10786750.0, "step": 289 }, { - "entropy": 0.5187714546918869, - "epoch": 9.064, - "grad_norm": 0.045192088931798935, + "entropy": 0.6266130581498146, + "epoch": 1.883834281072299, + "grad_norm": 0.008134995587170124, "learning_rate": 0.0002, - "loss": 0.5194220542907715, - "mean_token_accuracy": 0.7905025631189346, - "num_tokens": 22330815.0, + "loss": 0.6310341358184814, + "mean_token_accuracy": 0.743694357573986, + "num_tokens": 10823914.0, "step": 290 }, { - "entropy": 0.5319517701864243, - "epoch": 9.096, - "grad_norm": 0.04722893610596657, + "entropy": 0.6153042837977409, + "epoch": 1.8903330625507717, + "grad_norm": 0.009320992045104504, "learning_rate": 0.0002, - "loss": 0.5339574813842773, - "mean_token_accuracy": 0.7833489924669266, - "num_tokens": 22407165.0, + "loss": 0.6227383613586426, + "mean_token_accuracy": 0.7482397258281708, + "num_tokens": 10861283.0, "step": 291 }, { - "entropy": 0.5170899480581284, - "epoch": 9.128, - "grad_norm": 0.052741702646017075, + "entropy": 0.6265768557786942, + "epoch": 1.8968318440292444, + "grad_norm": 0.009208294562995434, "learning_rate": 0.0002, - "loss": 0.5152403116226196, - "mean_token_accuracy": 0.7910004258155823, - "num_tokens": 22486660.0, + "loss": 0.6274023056030273, + "mean_token_accuracy": 0.7459790334105492, + "num_tokens": 10898650.0, "step": 292 }, { - "entropy": 0.5402307510375977, - "epoch": 9.16, - "grad_norm": 0.04082133248448372, + "entropy": 0.6209842190146446, + "epoch": 1.9033306255077171, + "grad_norm": 0.007123781833797693, "learning_rate": 0.0002, - "loss": 0.5383718013763428, - "mean_token_accuracy": 0.7814162373542786, - "num_tokens": 22564897.0, + "loss": 0.6167253255844116, + "mean_token_accuracy": 0.7506068870425224, + "num_tokens": 10936405.0, "step": 293 }, { - "entropy": 0.5201883316040039, - "epoch": 9.192, - "grad_norm": 0.03840792551636696, + "entropy": 0.6177584528923035, + "epoch": 1.90982940698619, + "grad_norm": 0.0075668166391551495, "learning_rate": 0.0002, - "loss": 0.5196265578269958, - "mean_token_accuracy": 0.7899857312440872, - "num_tokens": 22644583.0, + "loss": 0.6163274049758911, + "mean_token_accuracy": 0.7489276751875877, + "num_tokens": 10973923.0, "step": 294 }, { - "entropy": 0.5268342941999435, - "epoch": 9.224, - "grad_norm": 0.04609312862157822, + "entropy": 0.6218736097216606, + "epoch": 1.916328188464663, + "grad_norm": 0.0085530336946249, "learning_rate": 0.0002, - "loss": 0.5226351022720337, - "mean_token_accuracy": 0.7885625064373016, - "num_tokens": 22723224.0, + "loss": 0.6214455366134644, + "mean_token_accuracy": 0.747297577559948, + "num_tokens": 11011183.0, "step": 295 }, { - "entropy": 0.5258665084838867, - "epoch": 9.256, - "grad_norm": 0.03400503844022751, + "entropy": 0.6203776001930237, + "epoch": 1.9228269699431357, + "grad_norm": 0.008531006053090096, "learning_rate": 0.0002, - "loss": 0.524506151676178, - "mean_token_accuracy": 0.7877257317304611, - "num_tokens": 22803901.0, + "loss": 0.6233081817626953, + "mean_token_accuracy": 0.7472613751888275, + "num_tokens": 11048409.0, "step": 296 }, { - "entropy": 0.5259871706366539, - "epoch": 9.288, - "grad_norm": 0.04140326753258705, + "entropy": 0.6170744299888611, + "epoch": 1.9293257514216084, + "grad_norm": 0.006794555112719536, "learning_rate": 0.0002, - "loss": 0.523682713508606, - "mean_token_accuracy": 0.7880030572414398, - "num_tokens": 22883095.0, + "loss": 0.6177318096160889, + "mean_token_accuracy": 0.7481219694018364, + "num_tokens": 11085854.0, "step": 297 }, { - "entropy": 0.5212158113718033, - "epoch": 9.32, - "grad_norm": 0.035439494997262955, + "entropy": 0.6205914691090584, + "epoch": 1.9358245329000812, + "grad_norm": 0.00894018355756998, "learning_rate": 0.0002, - "loss": 0.5157997608184814, - "mean_token_accuracy": 0.791080117225647, - "num_tokens": 22963722.0, + "loss": 0.6211514472961426, + "mean_token_accuracy": 0.7470626905560493, + "num_tokens": 11122678.0, "step": 298 }, { - "entropy": 0.5116661787033081, - "epoch": 9.352, - "grad_norm": 0.04255674034357071, + "entropy": 0.6179786175489426, + "epoch": 1.9423233143785539, + "grad_norm": 0.008218267932534218, "learning_rate": 0.0002, - "loss": 0.5151242613792419, - "mean_token_accuracy": 0.7906815558671951, - "num_tokens": 23044372.0, + "loss": 0.6211084723472595, + "mean_token_accuracy": 0.7481166496872902, + "num_tokens": 11160207.0, "step": 299 }, { - "entropy": 0.5317155867815018, - "epoch": 9.384, - "grad_norm": 0.03571729734539986, + "entropy": 0.6241402998566628, + "epoch": 1.9488220958570268, + "grad_norm": 0.008334561251103878, "learning_rate": 0.0002, - "loss": 0.5331252813339233, - "mean_token_accuracy": 0.784525066614151, - "num_tokens": 23121816.0, + "loss": 0.6270841360092163, + "mean_token_accuracy": 0.7478617802262306, + "num_tokens": 11197850.0, "step": 300 }, { - "entropy": 0.5284074693918228, - "epoch": 9.416, - "grad_norm": 0.038814280182123184, + "entropy": 0.6133561357855797, + "epoch": 1.9553208773354998, + "grad_norm": 0.0071178278885781765, "learning_rate": 0.0002, - "loss": 0.5249905586242676, - "mean_token_accuracy": 0.7884200662374496, - "num_tokens": 23200583.0, + "loss": 0.6169086694717407, + "mean_token_accuracy": 0.7505014687776566, + "num_tokens": 11235129.0, "step": 301 }, { - "entropy": 0.5218486413359642, - "epoch": 9.448, - "grad_norm": 0.03548124432563782, + "entropy": 0.6112445220351219, + "epoch": 1.9618196588139725, + "grad_norm": 0.00821610540151596, "learning_rate": 0.0002, - "loss": 0.5189951658248901, - "mean_token_accuracy": 0.7910516560077667, - "num_tokens": 23279098.0, + "loss": 0.6131574511528015, + "mean_token_accuracy": 0.7517394497990608, + "num_tokens": 11272140.0, "step": 302 }, { - "entropy": 0.5266124904155731, - "epoch": 9.48, - "grad_norm": 0.04210549592971802, + "entropy": 0.6255387738347054, + "epoch": 1.9683184402924452, + "grad_norm": 0.009108194150030613, "learning_rate": 0.0002, - "loss": 0.5285375118255615, - "mean_token_accuracy": 0.7852902412414551, - "num_tokens": 23357708.0, + "loss": 0.6270141005516052, + "mean_token_accuracy": 0.7442326322197914, + "num_tokens": 11309074.0, "step": 303 }, { - "entropy": 0.5390820801258087, - "epoch": 9.512, - "grad_norm": 0.04019097238779068, + "entropy": 0.6138653978705406, + "epoch": 1.974817221770918, + "grad_norm": 0.007860496640205383, "learning_rate": 0.0002, - "loss": 0.5387204885482788, - "mean_token_accuracy": 0.7813313454389572, - "num_tokens": 23435254.0, + "loss": 0.6152341961860657, + "mean_token_accuracy": 0.7488235086202621, + "num_tokens": 11346694.0, "step": 304 }, { - "entropy": 0.5226802378892899, - "epoch": 9.544, - "grad_norm": 0.045527562499046326, + "entropy": 0.6311385780572891, + "epoch": 1.9813160032493906, + "grad_norm": 0.008101027458906174, "learning_rate": 0.0002, - "loss": 0.5184016227722168, - "mean_token_accuracy": 0.7905609607696533, - "num_tokens": 23514397.0, + "loss": 0.6344274282455444, + "mean_token_accuracy": 0.7414661273360252, + "num_tokens": 11384229.0, "step": 305 }, { - "entropy": 0.527540773153305, - "epoch": 9.576, - "grad_norm": 0.04471491649746895, + "entropy": 0.6193428635597229, + "epoch": 1.9878147847278635, + "grad_norm": 0.007910770364105701, "learning_rate": 0.0002, - "loss": 0.5262195467948914, - "mean_token_accuracy": 0.7857372760772705, - "num_tokens": 23593391.0, + "loss": 0.6175734400749207, + "mean_token_accuracy": 0.7502587288618088, + "num_tokens": 11421788.0, "step": 306 }, { - "entropy": 0.5327746719121933, - "epoch": 9.608, - "grad_norm": 0.03983209654688835, + "entropy": 0.6222855523228645, + "epoch": 1.9943135662063363, + "grad_norm": 0.008522240445017815, "learning_rate": 0.0002, - "loss": 0.5309550762176514, - "mean_token_accuracy": 0.7848490923643112, - "num_tokens": 23671238.0, + "loss": 0.623339831829071, + "mean_token_accuracy": 0.7481605112552643, + "num_tokens": 11459154.0, "step": 307 }, { - "entropy": 0.5221132040023804, - "epoch": 9.64, - "grad_norm": 0.0506560355424881, + "entropy": 0.6278953552246094, + "epoch": 2.0, + "grad_norm": 0.008388028480112553, "learning_rate": 0.0002, - "loss": 0.5292017459869385, - "mean_token_accuracy": 0.7862422913312912, - "num_tokens": 23750415.0, + "loss": 0.6375839710235596, + "mean_token_accuracy": 0.7482074073382786, + "num_tokens": 11475381.0, "step": 308 }, { - "entropy": 0.5316873043775558, - "epoch": 9.672, - "grad_norm": 0.04567805677652359, + "entropy": 0.613355465233326, + "epoch": 2.0064987814784727, + "grad_norm": 0.00827846396714449, "learning_rate": 0.0002, - "loss": 0.5264989137649536, - "mean_token_accuracy": 0.7868478447198868, - "num_tokens": 23829328.0, + "loss": 0.6111053228378296, + "mean_token_accuracy": 0.7524029165506363, + "num_tokens": 11512446.0, "step": 309 }, { - "entropy": 0.5508539825677872, - "epoch": 9.704, - "grad_norm": 0.054871875792741776, + "entropy": 0.6208668798208237, + "epoch": 2.0129975629569454, + "grad_norm": 0.008557752706110477, "learning_rate": 0.0002, - "loss": 0.5446195602416992, - "mean_token_accuracy": 0.7784004658460617, - "num_tokens": 23906430.0, + "loss": 0.6219561100006104, + "mean_token_accuracy": 0.7458884716033936, + "num_tokens": 11549773.0, "step": 310 }, { - "entropy": 0.5284042209386826, - "epoch": 9.736, - "grad_norm": 0.05515004321932793, + "entropy": 0.6194536536931992, + "epoch": 2.019496344435418, + "grad_norm": 0.009552874602377415, "learning_rate": 0.0002, - "loss": 0.531845211982727, - "mean_token_accuracy": 0.7849012762308121, - "num_tokens": 23985699.0, + "loss": 0.624874472618103, + "mean_token_accuracy": 0.7470095753669739, + "num_tokens": 11587104.0, "step": 311 }, { - "entropy": 0.5239458531141281, - "epoch": 9.768, - "grad_norm": 0.06098300218582153, + "entropy": 0.6137440055608749, + "epoch": 2.0259951259138913, + "grad_norm": 0.008704678155481815, "learning_rate": 0.0002, - "loss": 0.5323519706726074, - "mean_token_accuracy": 0.7858945429325104, - "num_tokens": 24065076.0, + "loss": 0.6167584657669067, + "mean_token_accuracy": 0.7494626566767693, + "num_tokens": 11624387.0, "step": 312 }, { - "entropy": 0.5360407829284668, - "epoch": 9.8, - "grad_norm": 0.0424746535718441, + "entropy": 0.6213903650641441, + "epoch": 2.032493907392364, + "grad_norm": 0.007905784994363785, "learning_rate": 0.0002, - "loss": 0.5293824672698975, - "mean_token_accuracy": 0.7857670187950134, - "num_tokens": 24144078.0, + "loss": 0.622920036315918, + "mean_token_accuracy": 0.7466430589556694, + "num_tokens": 11661928.0, "step": 313 }, { - "entropy": 0.5299330949783325, - "epoch": 9.832, - "grad_norm": 0.05260491743683815, + "entropy": 0.608438141644001, + "epoch": 2.0389926888708367, + "grad_norm": 0.008782708086073399, "learning_rate": 0.0002, - "loss": 0.5241835117340088, - "mean_token_accuracy": 0.7872831225395203, - "num_tokens": 24224502.0, + "loss": 0.6084336638450623, + "mean_token_accuracy": 0.7526147440075874, + "num_tokens": 11699518.0, "step": 314 }, { - "entropy": 0.5187924355268478, - "epoch": 9.864, - "grad_norm": 0.07041396200656891, + "entropy": 0.6130177453160286, + "epoch": 2.0454914703493094, + "grad_norm": 0.009063824079930782, "learning_rate": 0.0002, - "loss": 0.5201770067214966, - "mean_token_accuracy": 0.7910154610872269, - "num_tokens": 24304691.0, + "loss": 0.6168864965438843, + "mean_token_accuracy": 0.7494284063577652, + "num_tokens": 11737013.0, "step": 315 }, { - "entropy": 0.5294213145971298, - "epoch": 9.896, - "grad_norm": 0.04269389435648918, + "entropy": 0.6137471869587898, + "epoch": 2.051990251827782, + "grad_norm": 0.008271057158708572, "learning_rate": 0.0002, - "loss": 0.5291866660118103, - "mean_token_accuracy": 0.7848200798034668, - "num_tokens": 24383384.0, + "loss": 0.6143357753753662, + "mean_token_accuracy": 0.7498123943805695, + "num_tokens": 11774346.0, "step": 316 }, { - "entropy": 0.5307356864213943, - "epoch": 9.928, - "grad_norm": 0.071862131357193, + "entropy": 0.6195183843374252, + "epoch": 2.058489033306255, + "grad_norm": 0.007240446750074625, "learning_rate": 0.0002, - "loss": 0.5289138555526733, - "mean_token_accuracy": 0.7856195569038391, - "num_tokens": 24461247.0, + "loss": 0.6194902062416077, + "mean_token_accuracy": 0.7464936003088951, + "num_tokens": 11811650.0, "step": 317 }, { - "entropy": 0.526089146733284, - "epoch": 9.96, - "grad_norm": 0.06460758298635483, + "entropy": 0.6273763924837112, + "epoch": 2.064987814784728, + "grad_norm": 0.009513584896922112, "learning_rate": 0.0002, - "loss": 0.5239361524581909, - "mean_token_accuracy": 0.7876095771789551, - "num_tokens": 24540321.0, + "loss": 0.6216360330581665, + "mean_token_accuracy": 0.7472178563475609, + "num_tokens": 11849227.0, "step": 318 }, { - "entropy": 0.5216004997491837, - "epoch": 9.992, - "grad_norm": 0.05195415019989014, + "entropy": 0.6146251261234283, + "epoch": 2.0714865962632008, + "grad_norm": 0.007890078239142895, "learning_rate": 0.0002, - "loss": 0.5229140520095825, - "mean_token_accuracy": 0.7891107648611069, - "num_tokens": 24618023.0, + "loss": 0.6166911721229553, + "mean_token_accuracy": 0.7501556724309921, + "num_tokens": 11886732.0, "step": 319 }, { - "entropy": 0.5302079319953918, - "epoch": 10.0, - "grad_norm": 0.0679510235786438, + "entropy": 0.5975739285349846, + "epoch": 2.0779853777416735, + "grad_norm": 0.009085185825824738, "learning_rate": 0.0002, - "loss": 0.51785808801651, - "mean_token_accuracy": 0.7922472953796387, - "num_tokens": 24637886.0, + "loss": 0.6020256280899048, + "mean_token_accuracy": 0.7525540143251419, + "num_tokens": 11923954.0, "step": 320 + }, + { + "entropy": 0.6165630891919136, + "epoch": 2.084484159220146, + "grad_norm": 0.006837225519120693, + "learning_rate": 0.0002, + "loss": 0.6179453134536743, + "mean_token_accuracy": 0.7491353005170822, + "num_tokens": 11961305.0, + "step": 321 + }, + { + "entropy": 0.6221051812171936, + "epoch": 2.090982940698619, + "grad_norm": 0.007578800432384014, + "learning_rate": 0.0002, + "loss": 0.6233739852905273, + "mean_token_accuracy": 0.7461354285478592, + "num_tokens": 11998561.0, + "step": 322 + }, + { + "entropy": 0.6175716295838356, + "epoch": 2.0974817221770916, + "grad_norm": 0.008444663137197495, + "learning_rate": 0.0002, + "loss": 0.6204410791397095, + "mean_token_accuracy": 0.7468695417046547, + "num_tokens": 12035916.0, + "step": 323 + }, + { + "entropy": 0.6165966615080833, + "epoch": 2.1039805036555648, + "grad_norm": 0.008185302838683128, + "learning_rate": 0.0002, + "loss": 0.6171708106994629, + "mean_token_accuracy": 0.7481535449624062, + "num_tokens": 12073704.0, + "step": 324 + }, + { + "entropy": 0.6210658326745033, + "epoch": 2.1104792851340375, + "grad_norm": 0.0074119968339800835, + "learning_rate": 0.0002, + "loss": 0.6183840036392212, + "mean_token_accuracy": 0.7473175972700119, + "num_tokens": 12111357.0, + "step": 325 + }, + { + "entropy": 0.617885060608387, + "epoch": 2.11697806661251, + "grad_norm": 0.007906505838036537, + "learning_rate": 0.0002, + "loss": 0.6161532998085022, + "mean_token_accuracy": 0.7496127933263779, + "num_tokens": 12148879.0, + "step": 326 + }, + { + "entropy": 0.6197918429970741, + "epoch": 2.123476848090983, + "grad_norm": 0.007352263201028109, + "learning_rate": 0.0002, + "loss": 0.6218726634979248, + "mean_token_accuracy": 0.7473544403910637, + "num_tokens": 12186546.0, + "step": 327 + }, + { + "entropy": 0.6142667904496193, + "epoch": 2.1299756295694556, + "grad_norm": 0.008285868912935257, + "learning_rate": 0.0002, + "loss": 0.6169737577438354, + "mean_token_accuracy": 0.7486495152115822, + "num_tokens": 12223727.0, + "step": 328 + }, + { + "entropy": 0.6135031282901764, + "epoch": 2.1364744110479283, + "grad_norm": 0.00797727145254612, + "learning_rate": 0.0002, + "loss": 0.6149879097938538, + "mean_token_accuracy": 0.7501881718635559, + "num_tokens": 12261432.0, + "step": 329 + }, + { + "entropy": 0.614725299179554, + "epoch": 2.1429731925264015, + "grad_norm": 0.0077530802227556705, + "learning_rate": 0.0002, + "loss": 0.6197780966758728, + "mean_token_accuracy": 0.7476382106542587, + "num_tokens": 12298773.0, + "step": 330 + }, + { + "entropy": 0.6204890534281731, + "epoch": 2.149471974004874, + "grad_norm": 0.007455397862941027, + "learning_rate": 0.0002, + "loss": 0.6217861175537109, + "mean_token_accuracy": 0.7472267374396324, + "num_tokens": 12335838.0, + "step": 331 + }, + { + "entropy": 0.6141664981842041, + "epoch": 2.155970755483347, + "grad_norm": 0.007735258899629116, + "learning_rate": 0.0002, + "loss": 0.619376540184021, + "mean_token_accuracy": 0.7473561838269234, + "num_tokens": 12373171.0, + "step": 332 + }, + { + "entropy": 0.6120809391140938, + "epoch": 2.1624695369618196, + "grad_norm": 0.008401036262512207, + "learning_rate": 0.0002, + "loss": 0.6154431700706482, + "mean_token_accuracy": 0.7471263483166695, + "num_tokens": 12410549.0, + "step": 333 + }, + { + "entropy": 0.6145179942250252, + "epoch": 2.1689683184402924, + "grad_norm": 0.00904724933207035, + "learning_rate": 0.0002, + "loss": 0.6087259650230408, + "mean_token_accuracy": 0.7501003369688988, + "num_tokens": 12447788.0, + "step": 334 + }, + { + "entropy": 0.6214614436030388, + "epoch": 2.175467099918765, + "grad_norm": 0.007604485843330622, + "learning_rate": 0.0002, + "loss": 0.6169778108596802, + "mean_token_accuracy": 0.7492403090000153, + "num_tokens": 12485368.0, + "step": 335 + }, + { + "entropy": 0.6146392300724983, + "epoch": 2.181965881397238, + "grad_norm": 0.008299093693494797, + "learning_rate": 0.0002, + "loss": 0.6154477596282959, + "mean_token_accuracy": 0.7474880516529083, + "num_tokens": 12522590.0, + "step": 336 + }, + { + "entropy": 0.6179040372371674, + "epoch": 2.188464662875711, + "grad_norm": 0.009656457230448723, + "learning_rate": 0.0002, + "loss": 0.6244622468948364, + "mean_token_accuracy": 0.74583899974823, + "num_tokens": 12559957.0, + "step": 337 + }, + { + "entropy": 0.6236468479037285, + "epoch": 2.1949634443541837, + "grad_norm": 0.008342688903212547, + "learning_rate": 0.0002, + "loss": 0.6273738145828247, + "mean_token_accuracy": 0.7441191673278809, + "num_tokens": 12597080.0, + "step": 338 + }, + { + "entropy": 0.6155964732170105, + "epoch": 2.2014622258326564, + "grad_norm": 0.008706323802471161, + "learning_rate": 0.0002, + "loss": 0.6139167547225952, + "mean_token_accuracy": 0.7505380213260651, + "num_tokens": 12634470.0, + "step": 339 + }, + { + "entropy": 0.6147474870085716, + "epoch": 2.207961007311129, + "grad_norm": 0.009130026213824749, + "learning_rate": 0.0002, + "loss": 0.6147286891937256, + "mean_token_accuracy": 0.7490043491125107, + "num_tokens": 12671909.0, + "step": 340 + }, + { + "entropy": 0.6133714243769646, + "epoch": 2.214459788789602, + "grad_norm": 0.008477689698338509, + "learning_rate": 0.0002, + "loss": 0.6187378168106079, + "mean_token_accuracy": 0.7469930872321129, + "num_tokens": 12708771.0, + "step": 341 + }, + { + "entropy": 0.6298847869038582, + "epoch": 2.2209585702680745, + "grad_norm": 0.009632086381316185, + "learning_rate": 0.0002, + "loss": 0.6292200684547424, + "mean_token_accuracy": 0.7443962469696999, + "num_tokens": 12746208.0, + "step": 342 + }, + { + "entropy": 0.6298182159662247, + "epoch": 2.2274573517465477, + "grad_norm": 0.007817580364644527, + "learning_rate": 0.0002, + "loss": 0.6289129853248596, + "mean_token_accuracy": 0.7439332380890846, + "num_tokens": 12783644.0, + "step": 343 + }, + { + "entropy": 0.6162709593772888, + "epoch": 2.2339561332250204, + "grad_norm": 0.009011663496494293, + "learning_rate": 0.0002, + "loss": 0.6142280101776123, + "mean_token_accuracy": 0.7506413981318474, + "num_tokens": 12821007.0, + "step": 344 + }, + { + "entropy": 0.6286559477448463, + "epoch": 2.240454914703493, + "grad_norm": 0.009188450872898102, + "learning_rate": 0.0002, + "loss": 0.6286423206329346, + "mean_token_accuracy": 0.7440641894936562, + "num_tokens": 12858516.0, + "step": 345 + }, + { + "entropy": 0.6245385706424713, + "epoch": 2.246953696181966, + "grad_norm": 0.009156906045973301, + "learning_rate": 0.0002, + "loss": 0.6278682947158813, + "mean_token_accuracy": 0.7443269118666649, + "num_tokens": 12895999.0, + "step": 346 + }, + { + "entropy": 0.6157897710800171, + "epoch": 2.2534524776604385, + "grad_norm": 0.007890370674431324, + "learning_rate": 0.0002, + "loss": 0.6214807033538818, + "mean_token_accuracy": 0.7472835406661034, + "num_tokens": 12933354.0, + "step": 347 + }, + { + "entropy": 0.6123293116688728, + "epoch": 2.2599512591389113, + "grad_norm": 0.007912621833384037, + "learning_rate": 0.0002, + "loss": 0.6164427995681763, + "mean_token_accuracy": 0.7487083747982979, + "num_tokens": 12970559.0, + "step": 348 + }, + { + "entropy": 0.6260915771126747, + "epoch": 2.2664500406173844, + "grad_norm": 0.008234160020947456, + "learning_rate": 0.0002, + "loss": 0.6222859621047974, + "mean_token_accuracy": 0.7458368241786957, + "num_tokens": 13008283.0, + "step": 349 + }, + { + "entropy": 0.6248592287302017, + "epoch": 2.272948822095857, + "grad_norm": 0.009832987561821938, + "learning_rate": 0.0002, + "loss": 0.6199322938919067, + "mean_token_accuracy": 0.7477703094482422, + "num_tokens": 13045527.0, + "step": 350 + }, + { + "entropy": 0.6275637075304985, + "epoch": 2.27944760357433, + "grad_norm": 0.008727029897272587, + "learning_rate": 0.0002, + "loss": 0.632993221282959, + "mean_token_accuracy": 0.7412514090538025, + "num_tokens": 13082974.0, + "step": 351 + }, + { + "entropy": 0.6118641197681427, + "epoch": 2.2859463850528026, + "grad_norm": 0.009624680504202843, + "learning_rate": 0.0002, + "loss": 0.6219325065612793, + "mean_token_accuracy": 0.7466080039739609, + "num_tokens": 13120093.0, + "step": 352 + }, + { + "entropy": 0.5959088578820229, + "epoch": 2.2924451665312753, + "grad_norm": 0.007752889767289162, + "learning_rate": 0.0002, + "loss": 0.5983707904815674, + "mean_token_accuracy": 0.755429819226265, + "num_tokens": 13157659.0, + "step": 353 + }, + { + "entropy": 0.6112657487392426, + "epoch": 2.298943948009748, + "grad_norm": 0.008281555026769638, + "learning_rate": 0.0002, + "loss": 0.6082602143287659, + "mean_token_accuracy": 0.7516218572854996, + "num_tokens": 13194647.0, + "step": 354 + }, + { + "entropy": 0.6122025474905968, + "epoch": 2.305442729488221, + "grad_norm": 0.008959132246673107, + "learning_rate": 0.0002, + "loss": 0.6142069101333618, + "mean_token_accuracy": 0.7516066282987595, + "num_tokens": 13231933.0, + "step": 355 + }, + { + "entropy": 0.610342264175415, + "epoch": 2.311941510966694, + "grad_norm": 0.0076917321421206, + "learning_rate": 0.0002, + "loss": 0.6098777055740356, + "mean_token_accuracy": 0.7534263134002686, + "num_tokens": 13269472.0, + "step": 356 + }, + { + "entropy": 0.6236057877540588, + "epoch": 2.3184402924451666, + "grad_norm": 0.008514189161360264, + "learning_rate": 0.0002, + "loss": 0.6241997480392456, + "mean_token_accuracy": 0.7468095943331718, + "num_tokens": 13307269.0, + "step": 357 + }, + { + "entropy": 0.6160306110978127, + "epoch": 2.3249390739236393, + "grad_norm": 0.009143211878836155, + "learning_rate": 0.0002, + "loss": 0.6196573972702026, + "mean_token_accuracy": 0.7480775937438011, + "num_tokens": 13344551.0, + "step": 358 + }, + { + "entropy": 0.6120478510856628, + "epoch": 2.331437855402112, + "grad_norm": 0.007592627312988043, + "learning_rate": 0.0002, + "loss": 0.6155714392662048, + "mean_token_accuracy": 0.7500782683491707, + "num_tokens": 13382127.0, + "step": 359 + }, + { + "entropy": 0.6234208717942238, + "epoch": 2.3379366368805847, + "grad_norm": 0.008143738843500614, + "learning_rate": 0.0002, + "loss": 0.6278046369552612, + "mean_token_accuracy": 0.7446608766913414, + "num_tokens": 13419810.0, + "step": 360 + }, + { + "entropy": 0.6157349273562431, + "epoch": 2.3444354183590574, + "grad_norm": 0.008566657081246376, + "learning_rate": 0.0002, + "loss": 0.6156420707702637, + "mean_token_accuracy": 0.7479202896356583, + "num_tokens": 13457273.0, + "step": 361 + }, + { + "entropy": 0.6180937066674232, + "epoch": 2.3509341998375306, + "grad_norm": 0.008304375223815441, + "learning_rate": 0.0002, + "loss": 0.622611403465271, + "mean_token_accuracy": 0.7477732971310616, + "num_tokens": 13494536.0, + "step": 362 + }, + { + "entropy": 0.6232565492391586, + "epoch": 2.3574329813160033, + "grad_norm": 0.008868128061294556, + "learning_rate": 0.0002, + "loss": 0.6260833740234375, + "mean_token_accuracy": 0.7459229752421379, + "num_tokens": 13531864.0, + "step": 363 + }, + { + "entropy": 0.6254989579319954, + "epoch": 2.363931762794476, + "grad_norm": 0.008256005123257637, + "learning_rate": 0.0002, + "loss": 0.6260857582092285, + "mean_token_accuracy": 0.7447438836097717, + "num_tokens": 13569443.0, + "step": 364 + }, + { + "entropy": 0.6221200376749039, + "epoch": 2.3704305442729487, + "grad_norm": 0.009361873380839825, + "learning_rate": 0.0002, + "loss": 0.6180988550186157, + "mean_token_accuracy": 0.7470216527581215, + "num_tokens": 13606513.0, + "step": 365 + }, + { + "entropy": 0.616127498447895, + "epoch": 2.3769293257514215, + "grad_norm": 0.008144999854266644, + "learning_rate": 0.0002, + "loss": 0.6137336492538452, + "mean_token_accuracy": 0.7496519684791565, + "num_tokens": 13643706.0, + "step": 366 + }, + { + "entropy": 0.6194290667772293, + "epoch": 2.3834281072298946, + "grad_norm": 0.008278160355985165, + "learning_rate": 0.0002, + "loss": 0.6232280135154724, + "mean_token_accuracy": 0.7481147646903992, + "num_tokens": 13680957.0, + "step": 367 + }, + { + "entropy": 0.6192846670746803, + "epoch": 2.3899268887083673, + "grad_norm": 0.010223917663097382, + "learning_rate": 0.0002, + "loss": 0.6253848075866699, + "mean_token_accuracy": 0.744193010032177, + "num_tokens": 13717903.0, + "step": 368 + }, + { + "entropy": 0.6221625953912735, + "epoch": 2.39642567018684, + "grad_norm": 0.008200163953006268, + "learning_rate": 0.0002, + "loss": 0.6191288232803345, + "mean_token_accuracy": 0.74726802110672, + "num_tokens": 13755260.0, + "step": 369 + }, + { + "entropy": 0.6163566559553146, + "epoch": 2.4029244516653128, + "grad_norm": 0.007974907755851746, + "learning_rate": 0.0002, + "loss": 0.6134728193283081, + "mean_token_accuracy": 0.7508314996957779, + "num_tokens": 13792517.0, + "step": 370 + }, + { + "entropy": 0.6114080101251602, + "epoch": 2.4094232331437855, + "grad_norm": 0.008343557827174664, + "learning_rate": 0.0002, + "loss": 0.6111307144165039, + "mean_token_accuracy": 0.7514908611774445, + "num_tokens": 13829760.0, + "step": 371 + }, + { + "entropy": 0.5953814163804054, + "epoch": 2.415922014622258, + "grad_norm": 0.01898498833179474, + "learning_rate": 0.0002, + "loss": 0.5988050699234009, + "mean_token_accuracy": 0.7543381601572037, + "num_tokens": 13867370.0, + "step": 372 + }, + { + "entropy": 0.6071057021617889, + "epoch": 2.422420796100731, + "grad_norm": 0.023124704137444496, + "learning_rate": 0.0002, + "loss": 0.6178369522094727, + "mean_token_accuracy": 0.747986689209938, + "num_tokens": 13904625.0, + "step": 373 + }, + { + "entropy": 0.6107468456029892, + "epoch": 2.428919577579204, + "grad_norm": 0.01215590164065361, + "learning_rate": 0.0002, + "loss": 0.6207199096679688, + "mean_token_accuracy": 0.7475155666470528, + "num_tokens": 13942489.0, + "step": 374 + }, + { + "entropy": 0.6124749183654785, + "epoch": 2.435418359057677, + "grad_norm": 0.012728074565529823, + "learning_rate": 0.0002, + "loss": 0.6103756427764893, + "mean_token_accuracy": 0.7500820159912109, + "num_tokens": 13980205.0, + "step": 375 + }, + { + "entropy": 0.6109942868351936, + "epoch": 2.4419171405361495, + "grad_norm": 0.009368120692670345, + "learning_rate": 0.0002, + "loss": 0.6066494584083557, + "mean_token_accuracy": 0.7536064460873604, + "num_tokens": 14017641.0, + "step": 376 + }, + { + "entropy": 0.624424010515213, + "epoch": 2.448415922014622, + "grad_norm": 0.016890961676836014, + "learning_rate": 0.0002, + "loss": 0.614218533039093, + "mean_token_accuracy": 0.7494603618979454, + "num_tokens": 14054677.0, + "step": 377 + }, + { + "entropy": 0.6255820393562317, + "epoch": 2.454914703493095, + "grad_norm": 0.009696394205093384, + "learning_rate": 0.0002, + "loss": 0.6304793357849121, + "mean_token_accuracy": 0.7434439361095428, + "num_tokens": 14091764.0, + "step": 378 + }, + { + "entropy": 0.621983028948307, + "epoch": 2.4614134849715676, + "grad_norm": 0.020173629745841026, + "learning_rate": 0.0002, + "loss": 0.6257689595222473, + "mean_token_accuracy": 0.745697520673275, + "num_tokens": 14129278.0, + "step": 379 + }, + { + "entropy": 0.6207767054438591, + "epoch": 2.467912266450041, + "grad_norm": 0.008954247459769249, + "learning_rate": 0.0002, + "loss": 0.6241703033447266, + "mean_token_accuracy": 0.750006191432476, + "num_tokens": 14167232.0, + "step": 380 + }, + { + "entropy": 0.6112791821360588, + "epoch": 2.4744110479285135, + "grad_norm": 0.009806505404412746, + "learning_rate": 0.0002, + "loss": 0.6147319078445435, + "mean_token_accuracy": 0.7495506927371025, + "num_tokens": 14204632.0, + "step": 381 + }, + { + "entropy": 0.6135937720537186, + "epoch": 2.4809098294069862, + "grad_norm": 0.008928372524678707, + "learning_rate": 0.0002, + "loss": 0.6139630079269409, + "mean_token_accuracy": 0.7506385967135429, + "num_tokens": 14242352.0, + "step": 382 + }, + { + "entropy": 0.6150240004062653, + "epoch": 2.487408610885459, + "grad_norm": 0.015955505892634392, + "learning_rate": 0.0002, + "loss": 0.6152509450912476, + "mean_token_accuracy": 0.7515363991260529, + "num_tokens": 14280058.0, + "step": 383 + }, + { + "entropy": 0.6128680855035782, + "epoch": 2.4939073923639317, + "grad_norm": 0.009567083790898323, + "learning_rate": 0.0002, + "loss": 0.6167535781860352, + "mean_token_accuracy": 0.748919777572155, + "num_tokens": 14317661.0, + "step": 384 + }, + { + "entropy": 0.626237154006958, + "epoch": 2.5004061738424044, + "grad_norm": 0.01046669203788042, + "learning_rate": 0.0002, + "loss": 0.6324093341827393, + "mean_token_accuracy": 0.7444325461983681, + "num_tokens": 14355367.0, + "step": 385 + }, + { + "entropy": 0.6202276349067688, + "epoch": 2.506904955320877, + "grad_norm": 0.007664418779313564, + "learning_rate": 0.0002, + "loss": 0.6191686987876892, + "mean_token_accuracy": 0.7475631311535835, + "num_tokens": 14393315.0, + "step": 386 + }, + { + "entropy": 0.6242005750536919, + "epoch": 2.5134037367993503, + "grad_norm": 0.00844619981944561, + "learning_rate": 0.0002, + "loss": 0.621794581413269, + "mean_token_accuracy": 0.7481283098459244, + "num_tokens": 14430853.0, + "step": 387 + }, + { + "entropy": 0.6239676773548126, + "epoch": 2.519902518277823, + "grad_norm": 0.008689953945577145, + "learning_rate": 0.0002, + "loss": 0.6237965226173401, + "mean_token_accuracy": 0.7461953610181808, + "num_tokens": 14468292.0, + "step": 388 + }, + { + "entropy": 0.6107499524950981, + "epoch": 2.5264012997562957, + "grad_norm": 0.009505955502390862, + "learning_rate": 0.0002, + "loss": 0.6074596643447876, + "mean_token_accuracy": 0.7525542005896568, + "num_tokens": 14505921.0, + "step": 389 + }, + { + "entropy": 0.6142911538481712, + "epoch": 2.5329000812347684, + "grad_norm": 0.009658354334533215, + "learning_rate": 0.0002, + "loss": 0.6198441982269287, + "mean_token_accuracy": 0.7489058822393417, + "num_tokens": 14543384.0, + "step": 390 + }, + { + "entropy": 0.6049473881721497, + "epoch": 2.539398862713241, + "grad_norm": 0.010726661421358585, + "learning_rate": 0.0002, + "loss": 0.6118952631950378, + "mean_token_accuracy": 0.7526208385825157, + "num_tokens": 14580935.0, + "step": 391 + }, + { + "entropy": 0.5964333266019821, + "epoch": 2.5458976441917143, + "grad_norm": 0.00981208123266697, + "learning_rate": 0.0002, + "loss": 0.6057010889053345, + "mean_token_accuracy": 0.7543943077325821, + "num_tokens": 14618074.0, + "step": 392 + }, + { + "entropy": 0.6099359169602394, + "epoch": 2.552396425670187, + "grad_norm": 0.009079058654606342, + "learning_rate": 0.0002, + "loss": 0.6084835529327393, + "mean_token_accuracy": 0.7520028725266457, + "num_tokens": 14655186.0, + "step": 393 + }, + { + "entropy": 0.6173275411128998, + "epoch": 2.5588952071486597, + "grad_norm": 0.009335207752883434, + "learning_rate": 0.0002, + "loss": 0.6102230548858643, + "mean_token_accuracy": 0.7514491975307465, + "num_tokens": 14692383.0, + "step": 394 + }, + { + "entropy": 0.6305418461561203, + "epoch": 2.5653939886271324, + "grad_norm": 0.009312084876000881, + "learning_rate": 0.0002, + "loss": 0.6281323432922363, + "mean_token_accuracy": 0.7421899363398552, + "num_tokens": 14729446.0, + "step": 395 + }, + { + "entropy": 0.6119675636291504, + "epoch": 2.571892770105605, + "grad_norm": 0.00806971825659275, + "learning_rate": 0.0002, + "loss": 0.6118816137313843, + "mean_token_accuracy": 0.7502529993653297, + "num_tokens": 14766917.0, + "step": 396 + }, + { + "entropy": 0.6194342076778412, + "epoch": 2.578391551584078, + "grad_norm": 0.009102623909711838, + "learning_rate": 0.0002, + "loss": 0.625906229019165, + "mean_token_accuracy": 0.7444874346256256, + "num_tokens": 14804635.0, + "step": 397 + }, + { + "entropy": 0.6129268780350685, + "epoch": 2.5848903330625506, + "grad_norm": 0.010471413843333721, + "learning_rate": 0.0002, + "loss": 0.6221112012863159, + "mean_token_accuracy": 0.7463114410638809, + "num_tokens": 14842380.0, + "step": 398 + }, + { + "entropy": 0.6111740916967392, + "epoch": 2.5913891145410237, + "grad_norm": 0.008378157392144203, + "learning_rate": 0.0002, + "loss": 0.6132410764694214, + "mean_token_accuracy": 0.7493879497051239, + "num_tokens": 14879441.0, + "step": 399 + }, + { + "entropy": 0.6207928210496902, + "epoch": 2.5978878960194964, + "grad_norm": 0.008037488907575607, + "learning_rate": 0.0002, + "loss": 0.6196093559265137, + "mean_token_accuracy": 0.7491321563720703, + "num_tokens": 14916731.0, + "step": 400 + }, + { + "entropy": 0.6349622085690498, + "epoch": 2.604386677497969, + "grad_norm": 0.00913564208894968, + "learning_rate": 0.0002, + "loss": 0.6318038702011108, + "mean_token_accuracy": 0.7420522123575211, + "num_tokens": 14954276.0, + "step": 401 + }, + { + "entropy": 0.6019857749342918, + "epoch": 2.610885458976442, + "grad_norm": 0.008696068078279495, + "learning_rate": 0.0002, + "loss": 0.600864052772522, + "mean_token_accuracy": 0.7552035823464394, + "num_tokens": 14991349.0, + "step": 402 + }, + { + "entropy": 0.6017836257815361, + "epoch": 2.6173842404549146, + "grad_norm": 0.008207019418478012, + "learning_rate": 0.0002, + "loss": 0.6038705706596375, + "mean_token_accuracy": 0.7532704323530197, + "num_tokens": 15028601.0, + "step": 403 + }, + { + "entropy": 0.6120554357767105, + "epoch": 2.6238830219333877, + "grad_norm": 0.008753425441682339, + "learning_rate": 0.0002, + "loss": 0.6164306998252869, + "mean_token_accuracy": 0.7496815398335457, + "num_tokens": 15066182.0, + "step": 404 + }, + { + "entropy": 0.6131924018263817, + "epoch": 2.6303818034118605, + "grad_norm": 0.008548066020011902, + "learning_rate": 0.0002, + "loss": 0.6181113719940186, + "mean_token_accuracy": 0.7491538524627686, + "num_tokens": 15103340.0, + "step": 405 + }, + { + "entropy": 0.6061984226107597, + "epoch": 2.636880584890333, + "grad_norm": 0.009016766212880611, + "learning_rate": 0.0002, + "loss": 0.6121985912322998, + "mean_token_accuracy": 0.7507323697209358, + "num_tokens": 15140594.0, + "step": 406 + }, + { + "entropy": 0.6165529787540436, + "epoch": 2.643379366368806, + "grad_norm": 0.007676286157220602, + "learning_rate": 0.0002, + "loss": 0.6143813133239746, + "mean_token_accuracy": 0.7518013492226601, + "num_tokens": 15178037.0, + "step": 407 + }, + { + "entropy": 0.6116887852549553, + "epoch": 2.6498781478472786, + "grad_norm": 0.007873927243053913, + "learning_rate": 0.0002, + "loss": 0.6096634268760681, + "mean_token_accuracy": 0.7518724203109741, + "num_tokens": 15215362.0, + "step": 408 + }, + { + "entropy": 0.6075077503919601, + "epoch": 2.6563769293257513, + "grad_norm": 0.007256446871906519, + "learning_rate": 0.0002, + "loss": 0.6078198552131653, + "mean_token_accuracy": 0.7537789046764374, + "num_tokens": 15252624.0, + "step": 409 + }, + { + "entropy": 0.6106631234288216, + "epoch": 2.662875710804224, + "grad_norm": 0.009321639314293861, + "learning_rate": 0.0002, + "loss": 0.6120110750198364, + "mean_token_accuracy": 0.7512669935822487, + "num_tokens": 15290298.0, + "step": 410 + }, + { + "entropy": 0.6318610459566116, + "epoch": 2.6693744922826967, + "grad_norm": 0.008198688738048077, + "learning_rate": 0.0002, + "loss": 0.6370584964752197, + "mean_token_accuracy": 0.740862101316452, + "num_tokens": 15327374.0, + "step": 411 + }, + { + "entropy": 0.6139440014958382, + "epoch": 2.67587327376117, + "grad_norm": 0.008440233767032623, + "learning_rate": 0.0002, + "loss": 0.6130324602127075, + "mean_token_accuracy": 0.7509049624204636, + "num_tokens": 15364313.0, + "step": 412 + }, + { + "entropy": 0.6132312193512917, + "epoch": 2.6823720552396426, + "grad_norm": 0.00764568243175745, + "learning_rate": 0.0002, + "loss": 0.6143498420715332, + "mean_token_accuracy": 0.7499875500798225, + "num_tokens": 15401585.0, + "step": 413 + }, + { + "entropy": 0.6295821517705917, + "epoch": 2.6888708367181153, + "grad_norm": 0.00870992336422205, + "learning_rate": 0.0002, + "loss": 0.6297035217285156, + "mean_token_accuracy": 0.7440814226865768, + "num_tokens": 15439063.0, + "step": 414 + }, + { + "entropy": 0.6159479022026062, + "epoch": 2.695369618196588, + "grad_norm": 0.007172968704253435, + "learning_rate": 0.0002, + "loss": 0.6142174005508423, + "mean_token_accuracy": 0.7487895339727402, + "num_tokens": 15476100.0, + "step": 415 + }, + { + "entropy": 0.6020728126168251, + "epoch": 2.7018683996750608, + "grad_norm": 0.007704848889261484, + "learning_rate": 0.0002, + "loss": 0.6082124710083008, + "mean_token_accuracy": 0.752522885799408, + "num_tokens": 15513167.0, + "step": 416 + }, + { + "entropy": 0.6281116902828217, + "epoch": 2.708367181153534, + "grad_norm": 0.00924444105476141, + "learning_rate": 0.0002, + "loss": 0.6312050819396973, + "mean_token_accuracy": 0.7460011318325996, + "num_tokens": 15550739.0, + "step": 417 + }, + { + "entropy": 0.6233636066317558, + "epoch": 2.7148659626320066, + "grad_norm": 0.008710985071957111, + "learning_rate": 0.0002, + "loss": 0.6260718107223511, + "mean_token_accuracy": 0.744461327791214, + "num_tokens": 15587950.0, + "step": 418 + }, + { + "entropy": 0.6195387095212936, + "epoch": 2.7213647441104794, + "grad_norm": 0.007183417212218046, + "learning_rate": 0.0002, + "loss": 0.6212611198425293, + "mean_token_accuracy": 0.746867798268795, + "num_tokens": 15625008.0, + "step": 419 + }, + { + "entropy": 0.6109424605965614, + "epoch": 2.727863525588952, + "grad_norm": 0.0077791716903448105, + "learning_rate": 0.0002, + "loss": 0.6113884449005127, + "mean_token_accuracy": 0.7505641579627991, + "num_tokens": 15662159.0, + "step": 420 + }, + { + "entropy": 0.6187275499105453, + "epoch": 2.734362307067425, + "grad_norm": 0.008177550509572029, + "learning_rate": 0.0002, + "loss": 0.6187748908996582, + "mean_token_accuracy": 0.7493242397904396, + "num_tokens": 15699404.0, + "step": 421 + }, + { + "entropy": 0.6269592270255089, + "epoch": 2.7408610885458975, + "grad_norm": 0.00797547772526741, + "learning_rate": 0.0002, + "loss": 0.6266059875488281, + "mean_token_accuracy": 0.7470143884420395, + "num_tokens": 15736867.0, + "step": 422 + }, + { + "entropy": 0.6187637895345688, + "epoch": 2.74735987002437, + "grad_norm": 0.008009313605725765, + "learning_rate": 0.0002, + "loss": 0.6174246072769165, + "mean_token_accuracy": 0.748706616461277, + "num_tokens": 15774518.0, + "step": 423 + }, + { + "entropy": 0.6222201958298683, + "epoch": 2.7538586515028434, + "grad_norm": 0.00828398484736681, + "learning_rate": 0.0002, + "loss": 0.6254167556762695, + "mean_token_accuracy": 0.7451123148202896, + "num_tokens": 15811807.0, + "step": 424 + }, + { + "entropy": 0.6253098249435425, + "epoch": 2.760357432981316, + "grad_norm": 0.0075772651471197605, + "learning_rate": 0.0002, + "loss": 0.6270281076431274, + "mean_token_accuracy": 0.744781106710434, + "num_tokens": 15849715.0, + "step": 425 + }, + { + "entropy": 0.6165027767419815, + "epoch": 2.766856214459789, + "grad_norm": 0.00784947071224451, + "learning_rate": 0.0002, + "loss": 0.6173769235610962, + "mean_token_accuracy": 0.748318687081337, + "num_tokens": 15886927.0, + "step": 426 + }, + { + "entropy": 0.6187942251563072, + "epoch": 2.7733549959382615, + "grad_norm": 0.007960534654557705, + "learning_rate": 0.0002, + "loss": 0.6190329790115356, + "mean_token_accuracy": 0.7482394725084305, + "num_tokens": 15924820.0, + "step": 427 + }, + { + "entropy": 0.6049096137285233, + "epoch": 2.7798537774167342, + "grad_norm": 0.007044166326522827, + "learning_rate": 0.0002, + "loss": 0.608286440372467, + "mean_token_accuracy": 0.7529338300228119, + "num_tokens": 15962031.0, + "step": 428 + }, + { + "entropy": 0.6067706495523453, + "epoch": 2.7863525588952074, + "grad_norm": 0.008417103439569473, + "learning_rate": 0.0002, + "loss": 0.6071891188621521, + "mean_token_accuracy": 0.7529254406690598, + "num_tokens": 15999271.0, + "step": 429 + }, + { + "entropy": 0.608584851026535, + "epoch": 2.79285134037368, + "grad_norm": 0.0066911159083247185, + "learning_rate": 0.0002, + "loss": 0.6128258109092712, + "mean_token_accuracy": 0.7512886077165604, + "num_tokens": 16036782.0, + "step": 430 + }, + { + "entropy": 0.6173116937279701, + "epoch": 2.799350121852153, + "grad_norm": 0.007603482808917761, + "learning_rate": 0.0002, + "loss": 0.6212354898452759, + "mean_token_accuracy": 0.7506462633609772, + "num_tokens": 16074488.0, + "step": 431 + }, + { + "entropy": 0.612823948264122, + "epoch": 2.8058489033306255, + "grad_norm": 0.008489524014294147, + "learning_rate": 0.0002, + "loss": 0.6168191432952881, + "mean_token_accuracy": 0.7491662427783012, + "num_tokens": 16112183.0, + "step": 432 + }, + { + "entropy": 0.6224610134959221, + "epoch": 2.8123476848090982, + "grad_norm": 0.0072684078477323055, + "learning_rate": 0.0002, + "loss": 0.6210014820098877, + "mean_token_accuracy": 0.7473989799618721, + "num_tokens": 16149570.0, + "step": 433 + }, + { + "entropy": 0.6252987831830978, + "epoch": 2.818846466287571, + "grad_norm": 0.008009562268853188, + "learning_rate": 0.0002, + "loss": 0.6273704171180725, + "mean_token_accuracy": 0.7445142269134521, + "num_tokens": 16187156.0, + "step": 434 + }, + { + "entropy": 0.6278671100735664, + "epoch": 2.8253452477660437, + "grad_norm": 0.007072070613503456, + "learning_rate": 0.0002, + "loss": 0.6284614205360413, + "mean_token_accuracy": 0.743632547557354, + "num_tokens": 16224612.0, + "step": 435 + }, + { + "entropy": 0.619408093392849, + "epoch": 2.8318440292445164, + "grad_norm": 0.007810318376868963, + "learning_rate": 0.0002, + "loss": 0.6186745166778564, + "mean_token_accuracy": 0.7505189552903175, + "num_tokens": 16261848.0, + "step": 436 + }, + { + "entropy": 0.617984876036644, + "epoch": 2.8383428107229896, + "grad_norm": 0.007404230069369078, + "learning_rate": 0.0002, + "loss": 0.6218393445014954, + "mean_token_accuracy": 0.746470145881176, + "num_tokens": 16299536.0, + "step": 437 + }, + { + "entropy": 0.6115261316299438, + "epoch": 2.8448415922014623, + "grad_norm": 0.007786816451698542, + "learning_rate": 0.0002, + "loss": 0.6147224307060242, + "mean_token_accuracy": 0.7512907087802887, + "num_tokens": 16336727.0, + "step": 438 + }, + { + "entropy": 0.610576219856739, + "epoch": 2.851340373679935, + "grad_norm": 0.007572745438665152, + "learning_rate": 0.0002, + "loss": 0.6138074994087219, + "mean_token_accuracy": 0.7504170089960098, + "num_tokens": 16374001.0, + "step": 439 + }, + { + "entropy": 0.6278978139162064, + "epoch": 2.8578391551584077, + "grad_norm": 0.007563670165836811, + "learning_rate": 0.0002, + "loss": 0.6268113851547241, + "mean_token_accuracy": 0.7438701540231705, + "num_tokens": 16411469.0, + "step": 440 + }, + { + "entropy": 0.6234687641263008, + "epoch": 2.864337936636881, + "grad_norm": 0.007766201626509428, + "learning_rate": 0.0002, + "loss": 0.6241582632064819, + "mean_token_accuracy": 0.7458857893943787, + "num_tokens": 16449061.0, + "step": 441 + }, + { + "entropy": 0.6170031577348709, + "epoch": 2.8708367181153536, + "grad_norm": 0.0072515420615673065, + "learning_rate": 0.0002, + "loss": 0.6164381504058838, + "mean_token_accuracy": 0.7487066686153412, + "num_tokens": 16486116.0, + "step": 442 + }, + { + "entropy": 0.6071048676967621, + "epoch": 2.8773354995938263, + "grad_norm": 0.007729642558842897, + "learning_rate": 0.0002, + "loss": 0.6061218976974487, + "mean_token_accuracy": 0.7546169012784958, + "num_tokens": 16523581.0, + "step": 443 + }, + { + "entropy": 0.6005209162831306, + "epoch": 2.883834281072299, + "grad_norm": 0.009296285919845104, + "learning_rate": 0.0002, + "loss": 0.608015775680542, + "mean_token_accuracy": 0.7522506862878799, + "num_tokens": 16560766.0, + "step": 444 + }, + { + "entropy": 0.6114199981093407, + "epoch": 2.8903330625507717, + "grad_norm": 0.009450486861169338, + "learning_rate": 0.0002, + "loss": 0.61246258020401, + "mean_token_accuracy": 0.7513059675693512, + "num_tokens": 16597924.0, + "step": 445 + }, + { + "entropy": 0.6163241118192673, + "epoch": 2.8968318440292444, + "grad_norm": 0.007840070873498917, + "learning_rate": 0.0002, + "loss": 0.6163046360015869, + "mean_token_accuracy": 0.7482790276408195, + "num_tokens": 16635707.0, + "step": 446 + }, + { + "entropy": 0.6230868250131607, + "epoch": 2.903330625507717, + "grad_norm": 0.00791420228779316, + "learning_rate": 0.0002, + "loss": 0.627612829208374, + "mean_token_accuracy": 0.7418907359242439, + "num_tokens": 16673272.0, + "step": 447 + }, + { + "entropy": 0.6148254349827766, + "epoch": 2.90982940698619, + "grad_norm": 0.008231899701058865, + "learning_rate": 0.0002, + "loss": 0.615432620048523, + "mean_token_accuracy": 0.74872937053442, + "num_tokens": 16710307.0, + "step": 448 + }, + { + "entropy": 0.6145784482359886, + "epoch": 2.916328188464663, + "grad_norm": 0.008206733502447605, + "learning_rate": 0.0002, + "loss": 0.6162281036376953, + "mean_token_accuracy": 0.7497396990656853, + "num_tokens": 16747541.0, + "step": 449 + }, + { + "entropy": 0.6129453554749489, + "epoch": 2.9228269699431357, + "grad_norm": 0.008618887513875961, + "learning_rate": 0.0002, + "loss": 0.6113362312316895, + "mean_token_accuracy": 0.7538808137178421, + "num_tokens": 16784808.0, + "step": 450 + }, + { + "entropy": 0.6318705305457115, + "epoch": 2.9293257514216084, + "grad_norm": 0.00894182175397873, + "learning_rate": 0.0002, + "loss": 0.6285560131072998, + "mean_token_accuracy": 0.7439467459917068, + "num_tokens": 16822571.0, + "step": 451 + }, + { + "entropy": 0.6192348748445511, + "epoch": 2.935824532900081, + "grad_norm": 0.0075249881483614445, + "learning_rate": 0.0002, + "loss": 0.6225606203079224, + "mean_token_accuracy": 0.7450770661234856, + "num_tokens": 16860236.0, + "step": 452 + }, + { + "entropy": 0.6156643033027649, + "epoch": 2.942323314378554, + "grad_norm": 0.008608740754425526, + "learning_rate": 0.0002, + "loss": 0.6196963787078857, + "mean_token_accuracy": 0.7487252280116081, + "num_tokens": 16897505.0, + "step": 453 + }, + { + "entropy": 0.6020097509026527, + "epoch": 2.948822095857027, + "grad_norm": 0.008554862812161446, + "learning_rate": 0.0002, + "loss": 0.6057189702987671, + "mean_token_accuracy": 0.7535376027226448, + "num_tokens": 16934723.0, + "step": 454 + }, + { + "entropy": 0.6096286401152611, + "epoch": 2.9553208773354998, + "grad_norm": 0.008194280788302422, + "learning_rate": 0.0002, + "loss": 0.6100919842720032, + "mean_token_accuracy": 0.7543619722127914, + "num_tokens": 16972160.0, + "step": 455 + }, + { + "entropy": 0.6101824045181274, + "epoch": 2.9618196588139725, + "grad_norm": 0.008089696057140827, + "learning_rate": 0.0002, + "loss": 0.6100078225135803, + "mean_token_accuracy": 0.7519838437438011, + "num_tokens": 17009553.0, + "step": 456 + }, + { + "entropy": 0.6134164482355118, + "epoch": 2.968318440292445, + "grad_norm": 0.008095222525298595, + "learning_rate": 0.0002, + "loss": 0.61534583568573, + "mean_token_accuracy": 0.7492899596691132, + "num_tokens": 17046859.0, + "step": 457 + }, + { + "entropy": 0.6219535619020462, + "epoch": 2.974817221770918, + "grad_norm": 0.008277404122054577, + "learning_rate": 0.0002, + "loss": 0.6226615905761719, + "mean_token_accuracy": 0.7486208230257034, + "num_tokens": 17083891.0, + "step": 458 + }, + { + "entropy": 0.6230077967047691, + "epoch": 2.9813160032493906, + "grad_norm": 0.007576305419206619, + "learning_rate": 0.0002, + "loss": 0.6215830445289612, + "mean_token_accuracy": 0.7478786036372185, + "num_tokens": 17121415.0, + "step": 459 + }, + { + "entropy": 0.6288741081953049, + "epoch": 2.9878147847278633, + "grad_norm": 0.007517755497246981, + "learning_rate": 0.0002, + "loss": 0.6266385912895203, + "mean_token_accuracy": 0.7459503784775734, + "num_tokens": 17159316.0, + "step": 460 + }, + { + "entropy": 0.6128450557589531, + "epoch": 2.994313566206336, + "grad_norm": 0.0082389609888196, + "learning_rate": 0.0002, + "loss": 0.6180654764175415, + "mean_token_accuracy": 0.7501172721385956, + "num_tokens": 17196686.0, + "step": 461 + }, + { + "entropy": 0.6104621972356524, + "epoch": 3.0, + "grad_norm": 0.009389652870595455, + "learning_rate": 0.0002, + "loss": 0.6207214593887329, + "mean_token_accuracy": 0.7534014242036002, + "num_tokens": 17212985.0, + "step": 462 + }, + { + "entropy": 0.6010295078158379, + "epoch": 3.0064987814784727, + "grad_norm": 0.007540151942521334, + "learning_rate": 0.0002, + "loss": 0.604315996170044, + "mean_token_accuracy": 0.7545758932828903, + "num_tokens": 17250548.0, + "step": 463 + }, + { + "entropy": 0.6099191755056381, + "epoch": 3.0129975629569454, + "grad_norm": 0.007964324206113815, + "learning_rate": 0.0002, + "loss": 0.6118016839027405, + "mean_token_accuracy": 0.7505887746810913, + "num_tokens": 17288088.0, + "step": 464 + }, + { + "entropy": 0.6099814623594284, + "epoch": 3.019496344435418, + "grad_norm": 0.009010368958115578, + "learning_rate": 0.0002, + "loss": 0.6133589744567871, + "mean_token_accuracy": 0.7495384216308594, + "num_tokens": 17325896.0, + "step": 465 + }, + { + "entropy": 0.6108173504471779, + "epoch": 3.0259951259138913, + "grad_norm": 0.008082750253379345, + "learning_rate": 0.0002, + "loss": 0.6106899380683899, + "mean_token_accuracy": 0.7496122866868973, + "num_tokens": 17363618.0, + "step": 466 + }, + { + "entropy": 0.6203465834259987, + "epoch": 3.032493907392364, + "grad_norm": 0.00794974435120821, + "learning_rate": 0.0002, + "loss": 0.62054044008255, + "mean_token_accuracy": 0.7457421347498894, + "num_tokens": 17401213.0, + "step": 467 + }, + { + "entropy": 0.6201630383729935, + "epoch": 3.0389926888708367, + "grad_norm": 0.00949027854949236, + "learning_rate": 0.0002, + "loss": 0.6232575178146362, + "mean_token_accuracy": 0.746864065527916, + "num_tokens": 17438437.0, + "step": 468 + }, + { + "entropy": 0.6282624080777168, + "epoch": 3.0454914703493094, + "grad_norm": 0.007857941091060638, + "learning_rate": 0.0002, + "loss": 0.6256210207939148, + "mean_token_accuracy": 0.7441679313778877, + "num_tokens": 17476273.0, + "step": 469 + }, + { + "entropy": 0.6105262786149979, + "epoch": 3.051990251827782, + "grad_norm": 0.008467303588986397, + "learning_rate": 0.0002, + "loss": 0.6100492477416992, + "mean_token_accuracy": 0.7501196339726448, + "num_tokens": 17513496.0, + "step": 470 + }, + { + "entropy": 0.6016805246472359, + "epoch": 3.058489033306255, + "grad_norm": 0.009371851570904255, + "learning_rate": 0.0002, + "loss": 0.604375958442688, + "mean_token_accuracy": 0.7524744868278503, + "num_tokens": 17551200.0, + "step": 471 + }, + { + "entropy": 0.6073808148503304, + "epoch": 3.064987814784728, + "grad_norm": 0.008492433466017246, + "learning_rate": 0.0002, + "loss": 0.6094343662261963, + "mean_token_accuracy": 0.752588301897049, + "num_tokens": 17588356.0, + "step": 472 + }, + { + "entropy": 0.6179896369576454, + "epoch": 3.0714865962632008, + "grad_norm": 0.008540020324289799, + "learning_rate": 0.0002, + "loss": 0.6210522055625916, + "mean_token_accuracy": 0.7460785582661629, + "num_tokens": 17625982.0, + "step": 473 + }, + { + "entropy": 0.6018861308693886, + "epoch": 3.0779853777416735, + "grad_norm": 0.008742019534111023, + "learning_rate": 0.0002, + "loss": 0.6078682541847229, + "mean_token_accuracy": 0.7513778060674667, + "num_tokens": 17663418.0, + "step": 474 + }, + { + "entropy": 0.633279986679554, + "epoch": 3.084484159220146, + "grad_norm": 0.0082003865391016, + "learning_rate": 0.0002, + "loss": 0.6310751438140869, + "mean_token_accuracy": 0.7428691610693932, + "num_tokens": 17700640.0, + "step": 475 + }, + { + "entropy": 0.6102183759212494, + "epoch": 3.090982940698619, + "grad_norm": 0.008503621444106102, + "learning_rate": 0.0002, + "loss": 0.6114936470985413, + "mean_token_accuracy": 0.7529326751828194, + "num_tokens": 17738330.0, + "step": 476 + }, + { + "entropy": 0.6162742525339127, + "epoch": 3.0974817221770916, + "grad_norm": 0.008936957456171513, + "learning_rate": 0.0002, + "loss": 0.6209756135940552, + "mean_token_accuracy": 0.7465755268931389, + "num_tokens": 17775715.0, + "step": 477 + }, + { + "entropy": 0.6141496077179909, + "epoch": 3.1039805036555648, + "grad_norm": 0.009372946806252003, + "learning_rate": 0.0002, + "loss": 0.617496132850647, + "mean_token_accuracy": 0.7488722130656242, + "num_tokens": 17813252.0, + "step": 478 + }, + { + "entropy": 0.6128992438316345, + "epoch": 3.1104792851340375, + "grad_norm": 0.009246407076716423, + "learning_rate": 0.0002, + "loss": 0.6153603792190552, + "mean_token_accuracy": 0.7489981204271317, + "num_tokens": 17850593.0, + "step": 479 + }, + { + "entropy": 0.6109244301915169, + "epoch": 3.11697806661251, + "grad_norm": 0.008360042236745358, + "learning_rate": 0.0002, + "loss": 0.6110379099845886, + "mean_token_accuracy": 0.7517814785242081, + "num_tokens": 17887433.0, + "step": 480 + }, + { + "entropy": 0.6216762438416481, + "epoch": 3.123476848090983, + "grad_norm": 0.008575825951993465, + "learning_rate": 0.0002, + "loss": 0.6188209652900696, + "mean_token_accuracy": 0.7479925602674484, + "num_tokens": 17924477.0, + "step": 481 + }, + { + "entropy": 0.617570586502552, + "epoch": 3.1299756295694556, + "grad_norm": 0.00846293568611145, + "learning_rate": 0.0002, + "loss": 0.6159199476242065, + "mean_token_accuracy": 0.7518654763698578, + "num_tokens": 17961735.0, + "step": 482 + }, + { + "entropy": 0.591516949236393, + "epoch": 3.1364744110479283, + "grad_norm": 0.009447102434933186, + "learning_rate": 0.0002, + "loss": 0.5986469984054565, + "mean_token_accuracy": 0.7579966932535172, + "num_tokens": 17998853.0, + "step": 483 + }, + { + "entropy": 0.6149769946932793, + "epoch": 3.1429731925264015, + "grad_norm": 0.010652805678546429, + "learning_rate": 0.0002, + "loss": 0.62315833568573, + "mean_token_accuracy": 0.7443839907646179, + "num_tokens": 18036498.0, + "step": 484 + }, + { + "entropy": 0.6224213317036629, + "epoch": 3.149471974004874, + "grad_norm": 0.008841714821755886, + "learning_rate": 0.0002, + "loss": 0.6213138103485107, + "mean_token_accuracy": 0.7460580617189407, + "num_tokens": 18073792.0, + "step": 485 + }, + { + "entropy": 0.624303974211216, + "epoch": 3.155970755483347, + "grad_norm": 0.008476318791508675, + "learning_rate": 0.0002, + "loss": 0.6206566691398621, + "mean_token_accuracy": 0.7465843260288239, + "num_tokens": 18110931.0, + "step": 486 + }, + { + "entropy": 0.6057487353682518, + "epoch": 3.1624695369618196, + "grad_norm": 0.007340795826166868, + "learning_rate": 0.0002, + "loss": 0.6085374355316162, + "mean_token_accuracy": 0.7520734146237373, + "num_tokens": 18148230.0, + "step": 487 + }, + { + "entropy": 0.5987089648842812, + "epoch": 3.1689683184402924, + "grad_norm": 0.008576547726988792, + "learning_rate": 0.0002, + "loss": 0.5994081497192383, + "mean_token_accuracy": 0.7560673728585243, + "num_tokens": 18185429.0, + "step": 488 + }, + { + "entropy": 0.6201451569795609, + "epoch": 3.175467099918765, + "grad_norm": 0.009309273213148117, + "learning_rate": 0.0002, + "loss": 0.6250134706497192, + "mean_token_accuracy": 0.7440272644162178, + "num_tokens": 18222845.0, + "step": 489 + }, + { + "entropy": 0.6149864792823792, + "epoch": 3.181965881397238, + "grad_norm": 0.00817920919507742, + "learning_rate": 0.0002, + "loss": 0.6165604591369629, + "mean_token_accuracy": 0.7469800040125847, + "num_tokens": 18260522.0, + "step": 490 + }, + { + "entropy": 0.6081833988428116, + "epoch": 3.188464662875711, + "grad_norm": 0.008727415464818478, + "learning_rate": 0.0002, + "loss": 0.6095278263092041, + "mean_token_accuracy": 0.7511461302638054, + "num_tokens": 18298119.0, + "step": 491 + }, + { + "entropy": 0.6011826619505882, + "epoch": 3.1949634443541837, + "grad_norm": 0.008403414860367775, + "learning_rate": 0.0002, + "loss": 0.6023063659667969, + "mean_token_accuracy": 0.7541341111063957, + "num_tokens": 18335516.0, + "step": 492 + }, + { + "entropy": 0.614462248980999, + "epoch": 3.2014622258326564, + "grad_norm": 0.008592899888753891, + "learning_rate": 0.0002, + "loss": 0.611116886138916, + "mean_token_accuracy": 0.7512200325727463, + "num_tokens": 18373224.0, + "step": 493 + }, + { + "entropy": 0.6118571162223816, + "epoch": 3.207961007311129, + "grad_norm": 0.008299244567751884, + "learning_rate": 0.0002, + "loss": 0.6136075258255005, + "mean_token_accuracy": 0.749468058347702, + "num_tokens": 18410845.0, + "step": 494 + }, + { + "entropy": 0.6049928665161133, + "epoch": 3.214459788789602, + "grad_norm": 0.010410244576632977, + "learning_rate": 0.0002, + "loss": 0.6083844304084778, + "mean_token_accuracy": 0.751271091401577, + "num_tokens": 18448238.0, + "step": 495 + }, + { + "entropy": 0.6233940199017525, + "epoch": 3.2209585702680745, + "grad_norm": 0.009204378351569176, + "learning_rate": 0.0002, + "loss": 0.6272657513618469, + "mean_token_accuracy": 0.7432866543531418, + "num_tokens": 18486015.0, + "step": 496 + }, + { + "entropy": 0.6218753755092621, + "epoch": 3.2274573517465477, + "grad_norm": 0.00954593438655138, + "learning_rate": 0.0002, + "loss": 0.6218851208686829, + "mean_token_accuracy": 0.7457900047302246, + "num_tokens": 18523424.0, + "step": 497 + }, + { + "entropy": 0.6145913749933243, + "epoch": 3.2339561332250204, + "grad_norm": 0.009425587020814419, + "learning_rate": 0.0002, + "loss": 0.6123300194740295, + "mean_token_accuracy": 0.7488762065768242, + "num_tokens": 18560844.0, + "step": 498 + }, + { + "entropy": 0.6112263351678848, + "epoch": 3.240454914703493, + "grad_norm": 0.009846451692283154, + "learning_rate": 0.0002, + "loss": 0.6109277606010437, + "mean_token_accuracy": 0.7503840625286102, + "num_tokens": 18598457.0, + "step": 499 + }, + { + "entropy": 0.6025180518627167, + "epoch": 3.246953696181966, + "grad_norm": 0.00901762768626213, + "learning_rate": 0.0002, + "loss": 0.6064941883087158, + "mean_token_accuracy": 0.7513880282640457, + "num_tokens": 18635799.0, + "step": 500 + }, + { + "entropy": 0.6062363162636757, + "epoch": 3.2534524776604385, + "grad_norm": 0.008631935343146324, + "learning_rate": 0.0002, + "loss": 0.610137939453125, + "mean_token_accuracy": 0.751276396214962, + "num_tokens": 18673367.0, + "step": 501 + }, + { + "entropy": 0.6029994338750839, + "epoch": 3.2599512591389113, + "grad_norm": 0.008083198219537735, + "learning_rate": 0.0002, + "loss": 0.605480968952179, + "mean_token_accuracy": 0.7522158473730087, + "num_tokens": 18710845.0, + "step": 502 + }, + { + "entropy": 0.6004190221428871, + "epoch": 3.2664500406173844, + "grad_norm": 0.009547607973217964, + "learning_rate": 0.0002, + "loss": 0.5966814756393433, + "mean_token_accuracy": 0.7567247301340103, + "num_tokens": 18748254.0, + "step": 503 + }, + { + "entropy": 0.6217415705323219, + "epoch": 3.272948822095857, + "grad_norm": 0.008327828720211983, + "learning_rate": 0.0002, + "loss": 0.6205904483795166, + "mean_token_accuracy": 0.746347539126873, + "num_tokens": 18785876.0, + "step": 504 + }, + { + "entropy": 0.6177750676870346, + "epoch": 3.27944760357433, + "grad_norm": 0.008332877419888973, + "learning_rate": 0.0002, + "loss": 0.6175146102905273, + "mean_token_accuracy": 0.7480292990803719, + "num_tokens": 18823559.0, + "step": 505 + }, + { + "entropy": 0.6048281341791153, + "epoch": 3.2859463850528026, + "grad_norm": 0.010307500138878822, + "learning_rate": 0.0002, + "loss": 0.608547568321228, + "mean_token_accuracy": 0.7522715479135513, + "num_tokens": 18860761.0, + "step": 506 + }, + { + "entropy": 0.6015286520123482, + "epoch": 3.2924451665312753, + "grad_norm": 0.008793864399194717, + "learning_rate": 0.0002, + "loss": 0.6076687574386597, + "mean_token_accuracy": 0.7535560503602028, + "num_tokens": 18898017.0, + "step": 507 + }, + { + "entropy": 0.6203228533267975, + "epoch": 3.298943948009748, + "grad_norm": 0.008433851413428783, + "learning_rate": 0.0002, + "loss": 0.627921462059021, + "mean_token_accuracy": 0.743441991508007, + "num_tokens": 18935451.0, + "step": 508 + }, + { + "entropy": 0.61593446880579, + "epoch": 3.305442729488221, + "grad_norm": 0.00970753189176321, + "learning_rate": 0.0002, + "loss": 0.617050290107727, + "mean_token_accuracy": 0.7470974624156952, + "num_tokens": 18972874.0, + "step": 509 + }, + { + "entropy": 0.6080862656235695, + "epoch": 3.311941510966694, + "grad_norm": 0.008601192384958267, + "learning_rate": 0.0002, + "loss": 0.613648533821106, + "mean_token_accuracy": 0.7485402300953865, + "num_tokens": 19010386.0, + "step": 510 + }, + { + "entropy": 0.6165401563048363, + "epoch": 3.3184402924451666, + "grad_norm": 0.009453460574150085, + "learning_rate": 0.0002, + "loss": 0.6146738529205322, + "mean_token_accuracy": 0.7489698827266693, + "num_tokens": 19048086.0, + "step": 511 + }, + { + "entropy": 0.6097732856869698, + "epoch": 3.3249390739236393, + "grad_norm": 0.008702411316335201, + "learning_rate": 0.0002, + "loss": 0.6121372580528259, + "mean_token_accuracy": 0.7501634210348129, + "num_tokens": 19085297.0, + "step": 512 + }, + { + "entropy": 0.6050214320421219, + "epoch": 3.331437855402112, + "grad_norm": 0.008775223046541214, + "learning_rate": 0.0002, + "loss": 0.6089086532592773, + "mean_token_accuracy": 0.7513034492731094, + "num_tokens": 19122838.0, + "step": 513 + }, + { + "entropy": 0.6079926937818527, + "epoch": 3.3379366368805847, + "grad_norm": 0.009299266152083874, + "learning_rate": 0.0002, + "loss": 0.6124639511108398, + "mean_token_accuracy": 0.751487672328949, + "num_tokens": 19160495.0, + "step": 514 + }, + { + "entropy": 0.6141983196139336, + "epoch": 3.3444354183590574, + "grad_norm": 0.00953013077378273, + "learning_rate": 0.0002, + "loss": 0.614948570728302, + "mean_token_accuracy": 0.7482777014374733, + "num_tokens": 19197772.0, + "step": 515 + }, + { + "entropy": 0.6166125014424324, + "epoch": 3.3509341998375306, + "grad_norm": 0.01042372826486826, + "learning_rate": 0.0002, + "loss": 0.6166562438011169, + "mean_token_accuracy": 0.7489292994141579, + "num_tokens": 19235537.0, + "step": 516 + }, + { + "entropy": 0.6107529476284981, + "epoch": 3.3574329813160033, + "grad_norm": 0.009182547219097614, + "learning_rate": 0.0002, + "loss": 0.6094313263893127, + "mean_token_accuracy": 0.75286765396595, + "num_tokens": 19272557.0, + "step": 517 + }, + { + "entropy": 0.5976028516888618, + "epoch": 3.363931762794476, + "grad_norm": 0.00928069930523634, + "learning_rate": 0.0002, + "loss": 0.6000387668609619, + "mean_token_accuracy": 0.7556054145097733, + "num_tokens": 19309498.0, + "step": 518 + }, + { + "entropy": 0.6023745760321617, + "epoch": 3.3704305442729487, + "grad_norm": 0.008411030285060406, + "learning_rate": 0.0002, + "loss": 0.6067807674407959, + "mean_token_accuracy": 0.7529009878635406, + "num_tokens": 19346735.0, + "step": 519 + }, + { + "entropy": 0.6122680082917213, + "epoch": 3.3769293257514215, + "grad_norm": 0.008953915908932686, + "learning_rate": 0.0002, + "loss": 0.6159105896949768, + "mean_token_accuracy": 0.7494169026613235, + "num_tokens": 19384153.0, + "step": 520 + }, + { + "entropy": 0.6186133921146393, + "epoch": 3.3834281072298946, + "grad_norm": 0.008217048831284046, + "learning_rate": 0.0002, + "loss": 0.6203353404998779, + "mean_token_accuracy": 0.7473497167229652, + "num_tokens": 19421655.0, + "step": 521 + }, + { + "entropy": 0.6094240248203278, + "epoch": 3.3899268887083673, + "grad_norm": 0.00980299897491932, + "learning_rate": 0.0002, + "loss": 0.6119738221168518, + "mean_token_accuracy": 0.7499380633234978, + "num_tokens": 19458894.0, + "step": 522 + }, + { + "entropy": 0.6254991963505745, + "epoch": 3.39642567018684, + "grad_norm": 0.008415239863097668, + "learning_rate": 0.0002, + "loss": 0.623593807220459, + "mean_token_accuracy": 0.7472219467163086, + "num_tokens": 19496818.0, + "step": 523 + }, + { + "entropy": 0.6295105367898941, + "epoch": 3.4029244516653128, + "grad_norm": 0.009312564507126808, + "learning_rate": 0.0002, + "loss": 0.6262437105178833, + "mean_token_accuracy": 0.7448465451598167, + "num_tokens": 19534274.0, + "step": 524 + }, + { + "entropy": 0.6126851290464401, + "epoch": 3.4094232331437855, + "grad_norm": 0.00861976109445095, + "learning_rate": 0.0002, + "loss": 0.6097316145896912, + "mean_token_accuracy": 0.7525606751441956, + "num_tokens": 19571856.0, + "step": 525 + }, + { + "entropy": 0.6135350093245506, + "epoch": 3.415922014622258, + "grad_norm": 0.008309995755553246, + "learning_rate": 0.0002, + "loss": 0.6160346269607544, + "mean_token_accuracy": 0.7493128851056099, + "num_tokens": 19609319.0, + "step": 526 + }, + { + "entropy": 0.6100683584809303, + "epoch": 3.422420796100731, + "grad_norm": 0.011379679664969444, + "learning_rate": 0.0002, + "loss": 0.6197912096977234, + "mean_token_accuracy": 0.7495440766215324, + "num_tokens": 19647036.0, + "step": 527 + }, + { + "entropy": 0.6129766032099724, + "epoch": 3.428919577579204, + "grad_norm": 0.00879785604774952, + "learning_rate": 0.0002, + "loss": 0.6192106008529663, + "mean_token_accuracy": 0.7462450638413429, + "num_tokens": 19684528.0, + "step": 528 + }, + { + "entropy": 0.6183054521679878, + "epoch": 3.435418359057677, + "grad_norm": 0.009570072405040264, + "learning_rate": 0.0002, + "loss": 0.61530601978302, + "mean_token_accuracy": 0.7494653314352036, + "num_tokens": 19721829.0, + "step": 529 + }, + { + "entropy": 0.6237875148653984, + "epoch": 3.4419171405361495, + "grad_norm": 0.009924475103616714, + "learning_rate": 0.0002, + "loss": 0.620090126991272, + "mean_token_accuracy": 0.7470209151506424, + "num_tokens": 19759470.0, + "step": 530 + }, + { + "entropy": 0.6056384146213531, + "epoch": 3.448415922014622, + "grad_norm": 0.008861211128532887, + "learning_rate": 0.0002, + "loss": 0.6051967144012451, + "mean_token_accuracy": 0.7524856179952621, + "num_tokens": 19797055.0, + "step": 531 + }, + { + "entropy": 0.6045270711183548, + "epoch": 3.454914703493095, + "grad_norm": 0.009311981499195099, + "learning_rate": 0.0002, + "loss": 0.6111881136894226, + "mean_token_accuracy": 0.7494307532906532, + "num_tokens": 19834144.0, + "step": 532 + }, + { + "entropy": 0.6097549796104431, + "epoch": 3.4614134849715676, + "grad_norm": 0.010919635184109211, + "learning_rate": 0.0002, + "loss": 0.6160416007041931, + "mean_token_accuracy": 0.7504306137561798, + "num_tokens": 19871286.0, + "step": 533 + }, + { + "entropy": 0.6024704650044441, + "epoch": 3.467912266450041, + "grad_norm": 0.008416552096605301, + "learning_rate": 0.0002, + "loss": 0.6058158278465271, + "mean_token_accuracy": 0.7539756521582603, + "num_tokens": 19908849.0, + "step": 534 + }, + { + "entropy": 0.611225888133049, + "epoch": 3.4744110479285135, + "grad_norm": 0.008921737782657146, + "learning_rate": 0.0002, + "loss": 0.6157783269882202, + "mean_token_accuracy": 0.7485576719045639, + "num_tokens": 19945976.0, + "step": 535 + }, + { + "entropy": 0.5882637947797775, + "epoch": 3.4809098294069862, + "grad_norm": 0.009470734745264053, + "learning_rate": 0.0002, + "loss": 0.5855636596679688, + "mean_token_accuracy": 0.7615584507584572, + "num_tokens": 19983147.0, + "step": 536 + }, + { + "entropy": 0.607180692255497, + "epoch": 3.487408610885459, + "grad_norm": 0.00895584374666214, + "learning_rate": 0.0002, + "loss": 0.6034247875213623, + "mean_token_accuracy": 0.7542741522192955, + "num_tokens": 20020743.0, + "step": 537 + }, + { + "entropy": 0.6082776561379433, + "epoch": 3.4939073923639317, + "grad_norm": 0.00874309055507183, + "learning_rate": 0.0002, + "loss": 0.6111589074134827, + "mean_token_accuracy": 0.7497387602925301, + "num_tokens": 20058341.0, + "step": 538 + }, + { + "entropy": 0.6162533760070801, + "epoch": 3.5004061738424044, + "grad_norm": 0.009585198014974594, + "learning_rate": 0.0002, + "loss": 0.6244966387748718, + "mean_token_accuracy": 0.7475337833166122, + "num_tokens": 20095636.0, + "step": 539 + }, + { + "entropy": 0.6105955466628075, + "epoch": 3.506904955320877, + "grad_norm": 0.009461835958063602, + "learning_rate": 0.0002, + "loss": 0.6156846880912781, + "mean_token_accuracy": 0.7479056641459465, + "num_tokens": 20132551.0, + "step": 540 + }, + { + "entropy": 0.621313750743866, + "epoch": 3.5134037367993503, + "grad_norm": 0.008541502989828587, + "learning_rate": 0.0002, + "loss": 0.6199691295623779, + "mean_token_accuracy": 0.7473711222410202, + "num_tokens": 20169837.0, + "step": 541 + }, + { + "entropy": 0.6165328845381737, + "epoch": 3.519902518277823, + "grad_norm": 0.009770420379936695, + "learning_rate": 0.0002, + "loss": 0.6142412424087524, + "mean_token_accuracy": 0.7502679750323296, + "num_tokens": 20207307.0, + "step": 542 + }, + { + "entropy": 0.6032826527953148, + "epoch": 3.5264012997562957, + "grad_norm": 0.010346473194658756, + "learning_rate": 0.0002, + "loss": 0.6011192798614502, + "mean_token_accuracy": 0.754242517054081, + "num_tokens": 20244685.0, + "step": 543 + }, + { + "entropy": 0.6191048100590706, + "epoch": 3.5329000812347684, + "grad_norm": 0.008168449625372887, + "learning_rate": 0.0002, + "loss": 0.6207705736160278, + "mean_token_accuracy": 0.74729173630476, + "num_tokens": 20281823.0, + "step": 544 + }, + { + "entropy": 0.6121908649802208, + "epoch": 3.539398862713241, + "grad_norm": 0.007879077456891537, + "learning_rate": 0.0002, + "loss": 0.6121616363525391, + "mean_token_accuracy": 0.7506422027945518, + "num_tokens": 20319307.0, + "step": 545 + }, + { + "entropy": 0.6186290234327316, + "epoch": 3.5458976441917143, + "grad_norm": 0.00905434787273407, + "learning_rate": 0.0002, + "loss": 0.6185810565948486, + "mean_token_accuracy": 0.7475248873233795, + "num_tokens": 20356848.0, + "step": 546 + }, + { + "entropy": 0.6139393672347069, + "epoch": 3.552396425670187, + "grad_norm": 0.008824498392641544, + "learning_rate": 0.0002, + "loss": 0.6151487827301025, + "mean_token_accuracy": 0.7489016950130463, + "num_tokens": 20394203.0, + "step": 547 + }, + { + "entropy": 0.6207469254732132, + "epoch": 3.5588952071486597, + "grad_norm": 0.008396871387958527, + "learning_rate": 0.0002, + "loss": 0.6218851804733276, + "mean_token_accuracy": 0.7459322214126587, + "num_tokens": 20431870.0, + "step": 548 + }, + { + "entropy": 0.62169548869133, + "epoch": 3.5653939886271324, + "grad_norm": 0.00874373223632574, + "learning_rate": 0.0002, + "loss": 0.6228454113006592, + "mean_token_accuracy": 0.749803364276886, + "num_tokens": 20469261.0, + "step": 549 + }, + { + "entropy": 0.6220152676105499, + "epoch": 3.571892770105605, + "grad_norm": 0.008933790028095245, + "learning_rate": 0.0002, + "loss": 0.6208291053771973, + "mean_token_accuracy": 0.7474985867738724, + "num_tokens": 20506396.0, + "step": 550 + }, + { + "entropy": 0.6153115481138229, + "epoch": 3.578391551584078, + "grad_norm": 0.008625194430351257, + "learning_rate": 0.0002, + "loss": 0.6176726818084717, + "mean_token_accuracy": 0.7483843564987183, + "num_tokens": 20543594.0, + "step": 551 + }, + { + "entropy": 0.6194273307919502, + "epoch": 3.5848903330625506, + "grad_norm": 0.009513880126178265, + "learning_rate": 0.0002, + "loss": 0.6259117126464844, + "mean_token_accuracy": 0.7455350533127785, + "num_tokens": 20580976.0, + "step": 552 + }, + { + "entropy": 0.6218870356678963, + "epoch": 3.5913891145410237, + "grad_norm": 0.010471499525010586, + "learning_rate": 0.0002, + "loss": 0.6255429983139038, + "mean_token_accuracy": 0.745422936975956, + "num_tokens": 20618155.0, + "step": 553 + }, + { + "entropy": 0.6044272035360336, + "epoch": 3.5978878960194964, + "grad_norm": 0.009206542745232582, + "learning_rate": 0.0002, + "loss": 0.6089117527008057, + "mean_token_accuracy": 0.7523582801222801, + "num_tokens": 20655356.0, + "step": 554 + }, + { + "entropy": 0.6034605354070663, + "epoch": 3.604386677497969, + "grad_norm": 0.01001272164285183, + "learning_rate": 0.0002, + "loss": 0.6080043315887451, + "mean_token_accuracy": 0.7542883977293968, + "num_tokens": 20692368.0, + "step": 555 + }, + { + "entropy": 0.6126068532466888, + "epoch": 3.610885458976442, + "grad_norm": 0.008411637507379055, + "learning_rate": 0.0002, + "loss": 0.6143564581871033, + "mean_token_accuracy": 0.7496707290410995, + "num_tokens": 20729532.0, + "step": 556 + }, + { + "entropy": 0.6092226430773735, + "epoch": 3.6173842404549146, + "grad_norm": 0.00788223184645176, + "learning_rate": 0.0002, + "loss": 0.6080750226974487, + "mean_token_accuracy": 0.7521450445055962, + "num_tokens": 20767316.0, + "step": 557 + }, + { + "entropy": 0.6103739887475967, + "epoch": 3.6238830219333877, + "grad_norm": 0.008947784081101418, + "learning_rate": 0.0002, + "loss": 0.6110090613365173, + "mean_token_accuracy": 0.751432754099369, + "num_tokens": 20804682.0, + "step": 558 + }, + { + "entropy": 0.6072618737816811, + "epoch": 3.6303818034118605, + "grad_norm": 0.008321145549416542, + "learning_rate": 0.0002, + "loss": 0.6072537899017334, + "mean_token_accuracy": 0.7519486770033836, + "num_tokens": 20842038.0, + "step": 559 + }, + { + "entropy": 0.614497110247612, + "epoch": 3.636880584890333, + "grad_norm": 0.009164758026599884, + "learning_rate": 0.0002, + "loss": 0.6098246574401855, + "mean_token_accuracy": 0.752671018242836, + "num_tokens": 20879197.0, + "step": 560 + }, + { + "entropy": 0.6094550266861916, + "epoch": 3.643379366368806, + "grad_norm": 0.007844182662665844, + "learning_rate": 0.0002, + "loss": 0.6068869829177856, + "mean_token_accuracy": 0.7533254846930504, + "num_tokens": 20916501.0, + "step": 561 + }, + { + "entropy": 0.6086015179753304, + "epoch": 3.6498781478472786, + "grad_norm": 0.008045290596783161, + "learning_rate": 0.0002, + "loss": 0.606809139251709, + "mean_token_accuracy": 0.7527647316455841, + "num_tokens": 20954134.0, + "step": 562 + }, + { + "entropy": 0.6285906434059143, + "epoch": 3.6563769293257513, + "grad_norm": 0.010104804299771786, + "learning_rate": 0.0002, + "loss": 0.6331174373626709, + "mean_token_accuracy": 0.7419461309909821, + "num_tokens": 20992017.0, + "step": 563 + }, + { + "entropy": 0.6020278707146645, + "epoch": 3.662875710804224, + "grad_norm": 0.01021239347755909, + "learning_rate": 0.0002, + "loss": 0.6128239035606384, + "mean_token_accuracy": 0.7514787241816521, + "num_tokens": 21029653.0, + "step": 564 + }, + { + "entropy": 0.6191821396350861, + "epoch": 3.6693744922826967, + "grad_norm": 0.009272433817386627, + "learning_rate": 0.0002, + "loss": 0.6228241324424744, + "mean_token_accuracy": 0.7464863955974579, + "num_tokens": 21067220.0, + "step": 565 + }, + { + "entropy": 0.6111209839582443, + "epoch": 3.67587327376117, + "grad_norm": 0.01010363083332777, + "learning_rate": 0.0002, + "loss": 0.6085663437843323, + "mean_token_accuracy": 0.7533030211925507, + "num_tokens": 21105021.0, + "step": 566 + }, + { + "entropy": 0.6244448721408844, + "epoch": 3.6823720552396426, + "grad_norm": 0.008229166269302368, + "learning_rate": 0.0002, + "loss": 0.6232364177703857, + "mean_token_accuracy": 0.7465489506721497, + "num_tokens": 21142672.0, + "step": 567 + }, + { + "entropy": 0.6002631187438965, + "epoch": 3.6888708367181153, + "grad_norm": 0.00970839336514473, + "learning_rate": 0.0002, + "loss": 0.6064876914024353, + "mean_token_accuracy": 0.7520908117294312, + "num_tokens": 21179768.0, + "step": 568 + }, + { + "entropy": 0.606594480574131, + "epoch": 3.695369618196588, + "grad_norm": 0.00952630303800106, + "learning_rate": 0.0002, + "loss": 0.6108591556549072, + "mean_token_accuracy": 0.751940131187439, + "num_tokens": 21217131.0, + "step": 569 + }, + { + "entropy": 0.6083743423223495, + "epoch": 3.7018683996750608, + "grad_norm": 0.008894224651157856, + "learning_rate": 0.0002, + "loss": 0.6050914525985718, + "mean_token_accuracy": 0.7556580603122711, + "num_tokens": 21254612.0, + "step": 570 + }, + { + "entropy": 0.6244188398122787, + "epoch": 3.708367181153534, + "grad_norm": 0.00945176463574171, + "learning_rate": 0.0002, + "loss": 0.6213344931602478, + "mean_token_accuracy": 0.7479386925697327, + "num_tokens": 21292008.0, + "step": 571 + }, + { + "entropy": 0.6202782392501831, + "epoch": 3.7148659626320066, + "grad_norm": 0.007808351423591375, + "learning_rate": 0.0002, + "loss": 0.618791937828064, + "mean_token_accuracy": 0.7479956671595573, + "num_tokens": 21329211.0, + "step": 572 + }, + { + "entropy": 0.6083357259631157, + "epoch": 3.7213647441104794, + "grad_norm": 0.009738109074532986, + "learning_rate": 0.0002, + "loss": 0.6082479953765869, + "mean_token_accuracy": 0.7511337921023369, + "num_tokens": 21366830.0, + "step": 573 + }, + { + "entropy": 0.6160146668553352, + "epoch": 3.727863525588952, + "grad_norm": 0.008708451874554157, + "learning_rate": 0.0002, + "loss": 0.6203808784484863, + "mean_token_accuracy": 0.749162532389164, + "num_tokens": 21404012.0, + "step": 574 + }, + { + "entropy": 0.6103571355342865, + "epoch": 3.734362307067425, + "grad_norm": 0.008490422740578651, + "learning_rate": 0.0002, + "loss": 0.6149444580078125, + "mean_token_accuracy": 0.7492819800972939, + "num_tokens": 21441418.0, + "step": 575 + }, + { + "entropy": 0.6097893342375755, + "epoch": 3.7408610885458975, + "grad_norm": 0.008159926161170006, + "learning_rate": 0.0002, + "loss": 0.6121622323989868, + "mean_token_accuracy": 0.7502710297703743, + "num_tokens": 21478959.0, + "step": 576 + }, + { + "entropy": 0.608406588435173, + "epoch": 3.74735987002437, + "grad_norm": 0.007408132776618004, + "learning_rate": 0.0002, + "loss": 0.6112476587295532, + "mean_token_accuracy": 0.7514019384980202, + "num_tokens": 21516469.0, + "step": 577 + }, + { + "entropy": 0.6059915721416473, + "epoch": 3.7538586515028434, + "grad_norm": 0.007707294542342424, + "learning_rate": 0.0002, + "loss": 0.6102927923202515, + "mean_token_accuracy": 0.7524895742535591, + "num_tokens": 21553955.0, + "step": 578 + }, + { + "entropy": 0.6110079139471054, + "epoch": 3.760357432981316, + "grad_norm": 0.008303117007017136, + "learning_rate": 0.0002, + "loss": 0.6116464734077454, + "mean_token_accuracy": 0.7515735402703285, + "num_tokens": 21591222.0, + "step": 579 + }, + { + "entropy": 0.6157199367880821, + "epoch": 3.766856214459789, + "grad_norm": 0.008788561448454857, + "learning_rate": 0.0002, + "loss": 0.6139419078826904, + "mean_token_accuracy": 0.7500691562891006, + "num_tokens": 21628586.0, + "step": 580 + }, + { + "entropy": 0.6189565733075142, + "epoch": 3.7733549959382615, + "grad_norm": 0.008861690759658813, + "learning_rate": 0.0002, + "loss": 0.6205735802650452, + "mean_token_accuracy": 0.7461571544408798, + "num_tokens": 21665902.0, + "step": 581 + }, + { + "entropy": 0.6169708073139191, + "epoch": 3.7798537774167342, + "grad_norm": 0.00858966913074255, + "learning_rate": 0.0002, + "loss": 0.616493284702301, + "mean_token_accuracy": 0.7478131875395775, + "num_tokens": 21703347.0, + "step": 582 + }, + { + "entropy": 0.6013945862650871, + "epoch": 3.7863525588952074, + "grad_norm": 0.007991503924131393, + "learning_rate": 0.0002, + "loss": 0.6024019718170166, + "mean_token_accuracy": 0.7541673332452774, + "num_tokens": 21740476.0, + "step": 583 + }, + { + "entropy": 0.6127390787005424, + "epoch": 3.79285134037368, + "grad_norm": 0.008759486488997936, + "learning_rate": 0.0002, + "loss": 0.6142678260803223, + "mean_token_accuracy": 0.7489368915557861, + "num_tokens": 21777903.0, + "step": 584 + }, + { + "entropy": 0.6033598631620407, + "epoch": 3.799350121852153, + "grad_norm": 0.008402034640312195, + "learning_rate": 0.0002, + "loss": 0.6062989234924316, + "mean_token_accuracy": 0.7526213079690933, + "num_tokens": 21815411.0, + "step": 585 + }, + { + "entropy": 0.6237991526722908, + "epoch": 3.8058489033306255, + "grad_norm": 0.008741356432437897, + "learning_rate": 0.0002, + "loss": 0.6236557960510254, + "mean_token_accuracy": 0.7458471432328224, + "num_tokens": 21852563.0, + "step": 586 + }, + { + "entropy": 0.6021682396531105, + "epoch": 3.8123476848090982, + "grad_norm": 0.009454802609980106, + "learning_rate": 0.0002, + "loss": 0.6056302785873413, + "mean_token_accuracy": 0.7534916624426842, + "num_tokens": 21889751.0, + "step": 587 + }, + { + "entropy": 0.6037532165646553, + "epoch": 3.818846466287571, + "grad_norm": 0.008019194938242435, + "learning_rate": 0.0002, + "loss": 0.6062440872192383, + "mean_token_accuracy": 0.75218416005373, + "num_tokens": 21927225.0, + "step": 588 + }, + { + "entropy": 0.6175741031765938, + "epoch": 3.8253452477660437, + "grad_norm": 0.010461182333528996, + "learning_rate": 0.0002, + "loss": 0.6219437122344971, + "mean_token_accuracy": 0.7449553832411766, + "num_tokens": 21964899.0, + "step": 589 + }, + { + "entropy": 0.6165783628821373, + "epoch": 3.8318440292445164, + "grad_norm": 0.007971042767167091, + "learning_rate": 0.0002, + "loss": 0.6164169311523438, + "mean_token_accuracy": 0.7500692084431648, + "num_tokens": 22001937.0, + "step": 590 + }, + { + "entropy": 0.6328809410333633, + "epoch": 3.8383428107229896, + "grad_norm": 0.019222697243094444, + "learning_rate": 0.0002, + "loss": 0.629861056804657, + "mean_token_accuracy": 0.7441875413060188, + "num_tokens": 22039681.0, + "step": 591 + }, + { + "entropy": 0.6060463637113571, + "epoch": 3.8448415922014623, + "grad_norm": 0.008333687670528889, + "learning_rate": 0.0002, + "loss": 0.6049051880836487, + "mean_token_accuracy": 0.7526820749044418, + "num_tokens": 22077083.0, + "step": 592 + }, + { + "entropy": 0.626244343817234, + "epoch": 3.851340373679935, + "grad_norm": 0.011930772103369236, + "learning_rate": 0.0002, + "loss": 0.6302248239517212, + "mean_token_accuracy": 0.7435696348547935, + "num_tokens": 22114449.0, + "step": 593 + }, + { + "entropy": 0.60886500030756, + "epoch": 3.8578391551584077, + "grad_norm": 0.00879514031112194, + "learning_rate": 0.0002, + "loss": 0.6156384944915771, + "mean_token_accuracy": 0.7500656992197037, + "num_tokens": 22151803.0, + "step": 594 + }, + { + "entropy": 0.6130397766828537, + "epoch": 3.864337936636881, + "grad_norm": 0.008800708688795567, + "learning_rate": 0.0002, + "loss": 0.6132546663284302, + "mean_token_accuracy": 0.7525083422660828, + "num_tokens": 22188933.0, + "step": 595 + }, + { + "entropy": 0.62311190366745, + "epoch": 3.8708367181153536, + "grad_norm": 0.0075268070213496685, + "learning_rate": 0.0002, + "loss": 0.624302864074707, + "mean_token_accuracy": 0.7459553778171539, + "num_tokens": 22226349.0, + "step": 596 + }, + { + "entropy": 0.6084966883063316, + "epoch": 3.8773354995938263, + "grad_norm": 0.008235939778387547, + "learning_rate": 0.0002, + "loss": 0.6065037250518799, + "mean_token_accuracy": 0.7519035413861275, + "num_tokens": 22263929.0, + "step": 597 + }, + { + "entropy": 0.599085658788681, + "epoch": 3.883834281072299, + "grad_norm": 0.008155166171491146, + "learning_rate": 0.0002, + "loss": 0.60195392370224, + "mean_token_accuracy": 0.7546913474798203, + "num_tokens": 22301001.0, + "step": 598 + }, + { + "entropy": 0.6163361445069313, + "epoch": 3.8903330625507717, + "grad_norm": 0.009046819061040878, + "learning_rate": 0.0002, + "loss": 0.6153905987739563, + "mean_token_accuracy": 0.7495288848876953, + "num_tokens": 22338602.0, + "step": 599 + }, + { + "entropy": 0.612362690269947, + "epoch": 3.8968318440292444, + "grad_norm": 0.008970526047050953, + "learning_rate": 0.0002, + "loss": 0.6125571131706238, + "mean_token_accuracy": 0.7503594160079956, + "num_tokens": 22375832.0, + "step": 600 + }, + { + "entropy": 0.5970166251063347, + "epoch": 3.903330625507717, + "grad_norm": 0.010594755411148071, + "learning_rate": 0.0002, + "loss": 0.6027450561523438, + "mean_token_accuracy": 0.7523306459188461, + "num_tokens": 22412582.0, + "step": 601 + }, + { + "entropy": 0.6120518818497658, + "epoch": 3.90982940698619, + "grad_norm": 0.008573422208428383, + "learning_rate": 0.0002, + "loss": 0.619284451007843, + "mean_token_accuracy": 0.7469367831945419, + "num_tokens": 22449548.0, + "step": 602 + }, + { + "entropy": 0.6074809059500694, + "epoch": 3.916328188464663, + "grad_norm": 0.008411690592765808, + "learning_rate": 0.0002, + "loss": 0.609643280506134, + "mean_token_accuracy": 0.7513059079647064, + "num_tokens": 22486961.0, + "step": 603 + }, + { + "entropy": 0.6189433708786964, + "epoch": 3.9228269699431357, + "grad_norm": 0.008104969747364521, + "learning_rate": 0.0002, + "loss": 0.6152623891830444, + "mean_token_accuracy": 0.7489224672317505, + "num_tokens": 22524327.0, + "step": 604 + }, + { + "entropy": 0.6386607512831688, + "epoch": 3.9293257514216084, + "grad_norm": 0.007721316535025835, + "learning_rate": 0.0002, + "loss": 0.6365233659744263, + "mean_token_accuracy": 0.7393748313188553, + "num_tokens": 22561540.0, + "step": 605 + }, + { + "entropy": 0.6104080379009247, + "epoch": 3.935824532900081, + "grad_norm": 0.009160472080111504, + "learning_rate": 0.0002, + "loss": 0.6058955192565918, + "mean_token_accuracy": 0.7527115345001221, + "num_tokens": 22598714.0, + "step": 606 + }, + { + "entropy": 0.6066436171531677, + "epoch": 3.942323314378554, + "grad_norm": 0.00924257654696703, + "learning_rate": 0.0002, + "loss": 0.6112688779830933, + "mean_token_accuracy": 0.7510428801178932, + "num_tokens": 22636168.0, + "step": 607 + }, + { + "entropy": 0.6113385632634163, + "epoch": 3.948822095857027, + "grad_norm": 0.009213161654770374, + "learning_rate": 0.0002, + "loss": 0.6169242858886719, + "mean_token_accuracy": 0.7488819509744644, + "num_tokens": 22673222.0, + "step": 608 + }, + { + "entropy": 0.6157431975007057, + "epoch": 3.9553208773354998, + "grad_norm": 0.00805346667766571, + "learning_rate": 0.0002, + "loss": 0.6147987842559814, + "mean_token_accuracy": 0.7497100383043289, + "num_tokens": 22710362.0, + "step": 609 + }, + { + "entropy": 0.6155053228139877, + "epoch": 3.9618196588139725, + "grad_norm": 0.008978918194770813, + "learning_rate": 0.0002, + "loss": 0.614108681678772, + "mean_token_accuracy": 0.7489725723862648, + "num_tokens": 22747892.0, + "step": 610 + }, + { + "entropy": 0.6131211444735527, + "epoch": 3.968318440292445, + "grad_norm": 0.010324759408831596, + "learning_rate": 0.0002, + "loss": 0.6139857769012451, + "mean_token_accuracy": 0.7501854747533798, + "num_tokens": 22784987.0, + "step": 611 + }, + { + "entropy": 0.6161521598696709, + "epoch": 3.974817221770918, + "grad_norm": 0.009645137935876846, + "learning_rate": 0.0002, + "loss": 0.6184964179992676, + "mean_token_accuracy": 0.748919740319252, + "num_tokens": 22822604.0, + "step": 612 + }, + { + "entropy": 0.6195979118347168, + "epoch": 3.9813160032493906, + "grad_norm": 0.008733006194233894, + "learning_rate": 0.0002, + "loss": 0.6204901933670044, + "mean_token_accuracy": 0.7458331510424614, + "num_tokens": 22859577.0, + "step": 613 + }, + { + "entropy": 0.6223805174231529, + "epoch": 3.9878147847278633, + "grad_norm": 0.008579275570809841, + "learning_rate": 0.0002, + "loss": 0.6251469850540161, + "mean_token_accuracy": 0.7441524565219879, + "num_tokens": 22897065.0, + "step": 614 + }, + { + "entropy": 0.6099046468734741, + "epoch": 3.994313566206336, + "grad_norm": 0.009405579417943954, + "learning_rate": 0.0002, + "loss": 0.6134316921234131, + "mean_token_accuracy": 0.7505489960312843, + "num_tokens": 22934240.0, + "step": 615 + }, + { + "entropy": 0.5790954487664359, + "epoch": 4.0, + "grad_norm": 0.011152846738696098, + "learning_rate": 0.0002, + "loss": 0.6086491346359253, + "mean_token_accuracy": 0.7593175172805786, + "num_tokens": 22950408.0, + "step": 616 + }, + { + "entropy": 0.6060308367013931, + "epoch": 4.006498781478473, + "grad_norm": 0.008177882991731167, + "learning_rate": 0.0002, + "loss": 0.6047600507736206, + "mean_token_accuracy": 0.7523083239793777, + "num_tokens": 22987854.0, + "step": 617 + }, + { + "entropy": 0.60086639970541, + "epoch": 4.012997562956945, + "grad_norm": 0.009073281660676003, + "learning_rate": 0.0002, + "loss": 0.5952266454696655, + "mean_token_accuracy": 0.7580123767256737, + "num_tokens": 23025377.0, + "step": 618 + }, + { + "entropy": 0.5975999683141708, + "epoch": 4.019496344435418, + "grad_norm": 0.00987546518445015, + "learning_rate": 0.0002, + "loss": 0.596405565738678, + "mean_token_accuracy": 0.7551270872354507, + "num_tokens": 23062634.0, + "step": 619 + }, + { + "entropy": 0.6007415279746056, + "epoch": 4.025995125913891, + "grad_norm": 0.008907251060009003, + "learning_rate": 0.0002, + "loss": 0.6056969165802002, + "mean_token_accuracy": 0.752616822719574, + "num_tokens": 23099758.0, + "step": 620 + }, + { + "entropy": 0.5893639698624611, + "epoch": 4.032493907392364, + "grad_norm": 0.010224535129964352, + "learning_rate": 0.0002, + "loss": 0.5967025756835938, + "mean_token_accuracy": 0.7561892941594124, + "num_tokens": 23137072.0, + "step": 621 + }, + { + "entropy": 0.60489272326231, + "epoch": 4.038992688870836, + "grad_norm": 0.011304826475679874, + "learning_rate": 0.0002, + "loss": 0.6063746213912964, + "mean_token_accuracy": 0.7524363398551941, + "num_tokens": 23174098.0, + "step": 622 + }, + { + "entropy": 0.6080682426691055, + "epoch": 4.04549147034931, + "grad_norm": 0.009452976286411285, + "learning_rate": 0.0002, + "loss": 0.6047728061676025, + "mean_token_accuracy": 0.7509661018848419, + "num_tokens": 23211396.0, + "step": 623 + }, + { + "entropy": 0.6045035719871521, + "epoch": 4.051990251827783, + "grad_norm": 0.010957913473248482, + "learning_rate": 0.0002, + "loss": 0.6045751571655273, + "mean_token_accuracy": 0.7534721195697784, + "num_tokens": 23248640.0, + "step": 624 + }, + { + "entropy": 0.6037070825695992, + "epoch": 4.058489033306255, + "grad_norm": 0.011129945516586304, + "learning_rate": 0.0002, + "loss": 0.6084102392196655, + "mean_token_accuracy": 0.7514655515551567, + "num_tokens": 23286103.0, + "step": 625 + }, + { + "entropy": 0.6091515198349953, + "epoch": 4.064987814784728, + "grad_norm": 0.011563125997781754, + "learning_rate": 0.0002, + "loss": 0.6175334453582764, + "mean_token_accuracy": 0.7468038350343704, + "num_tokens": 23323689.0, + "step": 626 + }, + { + "entropy": 0.624121755361557, + "epoch": 4.071486596263201, + "grad_norm": 0.010375406593084335, + "learning_rate": 0.0002, + "loss": 0.6241302490234375, + "mean_token_accuracy": 0.7438605725765228, + "num_tokens": 23361119.0, + "step": 627 + }, + { + "entropy": 0.6100181490182877, + "epoch": 4.0779853777416735, + "grad_norm": 0.011141455732285976, + "learning_rate": 0.0002, + "loss": 0.6070010662078857, + "mean_token_accuracy": 0.7539649158716202, + "num_tokens": 23398396.0, + "step": 628 + }, + { + "entropy": 0.6109626740217209, + "epoch": 4.084484159220146, + "grad_norm": 0.008930398151278496, + "learning_rate": 0.0002, + "loss": 0.610953688621521, + "mean_token_accuracy": 0.7503283470869064, + "num_tokens": 23435949.0, + "step": 629 + }, + { + "entropy": 0.5975475162267685, + "epoch": 4.090982940698619, + "grad_norm": 0.00977004412561655, + "learning_rate": 0.0002, + "loss": 0.6004647612571716, + "mean_token_accuracy": 0.755259171128273, + "num_tokens": 23473365.0, + "step": 630 + }, + { + "entropy": 0.5996551141142845, + "epoch": 4.097481722177092, + "grad_norm": 0.009881756268441677, + "learning_rate": 0.0002, + "loss": 0.6020142436027527, + "mean_token_accuracy": 0.7552994042634964, + "num_tokens": 23510883.0, + "step": 631 + }, + { + "entropy": 0.6100725084543228, + "epoch": 4.103980503655564, + "grad_norm": 0.009554548189043999, + "learning_rate": 0.0002, + "loss": 0.60805743932724, + "mean_token_accuracy": 0.749746523797512, + "num_tokens": 23548279.0, + "step": 632 + }, + { + "entropy": 0.604118101298809, + "epoch": 4.110479285134037, + "grad_norm": 0.0090833380818367, + "learning_rate": 0.0002, + "loss": 0.6060141324996948, + "mean_token_accuracy": 0.7535399347543716, + "num_tokens": 23585460.0, + "step": 633 + }, + { + "entropy": 0.6112289279699326, + "epoch": 4.11697806661251, + "grad_norm": 0.009132446721196175, + "learning_rate": 0.0002, + "loss": 0.6089117527008057, + "mean_token_accuracy": 0.7522810772061348, + "num_tokens": 23623069.0, + "step": 634 + }, + { + "entropy": 0.5981876626610756, + "epoch": 4.123476848090983, + "grad_norm": 0.009694000706076622, + "learning_rate": 0.0002, + "loss": 0.6000718474388123, + "mean_token_accuracy": 0.7525889277458191, + "num_tokens": 23660201.0, + "step": 635 + }, + { + "entropy": 0.6080240532755852, + "epoch": 4.129975629569456, + "grad_norm": 0.009349804371595383, + "learning_rate": 0.0002, + "loss": 0.6115583181381226, + "mean_token_accuracy": 0.7498094886541367, + "num_tokens": 23697467.0, + "step": 636 + }, + { + "entropy": 0.6051702946424484, + "epoch": 4.136474411047929, + "grad_norm": 0.00995174515992403, + "learning_rate": 0.0002, + "loss": 0.6054593324661255, + "mean_token_accuracy": 0.7512011528015137, + "num_tokens": 23734887.0, + "step": 637 + }, + { + "entropy": 0.6021575108170509, + "epoch": 4.1429731925264015, + "grad_norm": 0.011656476184725761, + "learning_rate": 0.0002, + "loss": 0.6069491505622864, + "mean_token_accuracy": 0.7523794695734978, + "num_tokens": 23772003.0, + "step": 638 + }, + { + "entropy": 0.6030121594667435, + "epoch": 4.149471974004874, + "grad_norm": 0.009891415014863014, + "learning_rate": 0.0002, + "loss": 0.604573667049408, + "mean_token_accuracy": 0.7512457966804504, + "num_tokens": 23809089.0, + "step": 639 + }, + { + "entropy": 0.5972474366426468, + "epoch": 4.155970755483347, + "grad_norm": 0.011574115604162216, + "learning_rate": 0.0002, + "loss": 0.5955284833908081, + "mean_token_accuracy": 0.7579837068915367, + "num_tokens": 23846256.0, + "step": 640 + }, + { + "entropy": 0.6166966333985329, + "epoch": 4.16246953696182, + "grad_norm": 0.010048413649201393, + "learning_rate": 0.0002, + "loss": 0.6198529005050659, + "mean_token_accuracy": 0.7490389570593834, + "num_tokens": 23884254.0, + "step": 641 + }, + { + "entropy": 0.5962498784065247, + "epoch": 4.168968318440292, + "grad_norm": 0.011094493791460991, + "learning_rate": 0.0002, + "loss": 0.6002663969993591, + "mean_token_accuracy": 0.7531006932258606, + "num_tokens": 23921748.0, + "step": 642 + }, + { + "entropy": 0.6103070974349976, + "epoch": 4.175467099918765, + "grad_norm": 0.0102005023509264, + "learning_rate": 0.0002, + "loss": 0.6120426654815674, + "mean_token_accuracy": 0.7472726628184319, + "num_tokens": 23959118.0, + "step": 643 + }, + { + "entropy": 0.6111981943249702, + "epoch": 4.181965881397238, + "grad_norm": 0.010743658058345318, + "learning_rate": 0.0002, + "loss": 0.608763575553894, + "mean_token_accuracy": 0.7516906931996346, + "num_tokens": 23996874.0, + "step": 644 + }, + { + "entropy": 0.6073967814445496, + "epoch": 4.1884646628757105, + "grad_norm": 0.011524532921612263, + "learning_rate": 0.0002, + "loss": 0.6078468561172485, + "mean_token_accuracy": 0.750710740685463, + "num_tokens": 24034180.0, + "step": 645 + }, + { + "entropy": 0.6122067421674728, + "epoch": 4.194963444354183, + "grad_norm": 0.009897702373564243, + "learning_rate": 0.0002, + "loss": 0.613964319229126, + "mean_token_accuracy": 0.7508190050721169, + "num_tokens": 24071959.0, + "step": 646 + }, + { + "entropy": 0.6176895946264267, + "epoch": 4.201462225832657, + "grad_norm": 0.010724211111664772, + "learning_rate": 0.0002, + "loss": 0.6206725835800171, + "mean_token_accuracy": 0.7463300824165344, + "num_tokens": 24109459.0, + "step": 647 + }, + { + "entropy": 0.6166289448738098, + "epoch": 4.2079610073111295, + "grad_norm": 0.011503348127007484, + "learning_rate": 0.0002, + "loss": 0.6165927052497864, + "mean_token_accuracy": 0.7491984441876411, + "num_tokens": 24146901.0, + "step": 648 + }, + { + "entropy": 0.6203835979104042, + "epoch": 4.214459788789602, + "grad_norm": 0.010957739315927029, + "learning_rate": 0.0002, + "loss": 0.6207370758056641, + "mean_token_accuracy": 0.7465796917676926, + "num_tokens": 24184105.0, + "step": 649 + }, + { + "entropy": 0.608573280274868, + "epoch": 4.220958570268075, + "grad_norm": 0.012403266504406929, + "learning_rate": 0.0002, + "loss": 0.6109322309494019, + "mean_token_accuracy": 0.7499670162796974, + "num_tokens": 24221373.0, + "step": 650 + }, + { + "entropy": 0.61744424700737, + "epoch": 4.227457351746548, + "grad_norm": 0.010664467699825764, + "learning_rate": 0.0002, + "loss": 0.6191272735595703, + "mean_token_accuracy": 0.7458655536174774, + "num_tokens": 24259291.0, + "step": 651 + }, + { + "entropy": 0.601327195763588, + "epoch": 4.23395613322502, + "grad_norm": 0.012125416658818722, + "learning_rate": 0.0002, + "loss": 0.6103509664535522, + "mean_token_accuracy": 0.7481491416692734, + "num_tokens": 24296467.0, + "step": 652 + }, + { + "entropy": 0.6011637076735497, + "epoch": 4.240454914703493, + "grad_norm": 0.011278907768428326, + "learning_rate": 0.0002, + "loss": 0.6051167845726013, + "mean_token_accuracy": 0.7522369399666786, + "num_tokens": 24334038.0, + "step": 653 + }, + { + "entropy": 0.624407596886158, + "epoch": 4.246953696181966, + "grad_norm": 0.011394547298550606, + "learning_rate": 0.0002, + "loss": 0.6223498582839966, + "mean_token_accuracy": 0.7456056624650955, + "num_tokens": 24371361.0, + "step": 654 + }, + { + "entropy": 0.6008864194154739, + "epoch": 4.2534524776604385, + "grad_norm": 0.010803118348121643, + "learning_rate": 0.0002, + "loss": 0.595673680305481, + "mean_token_accuracy": 0.7541809007525444, + "num_tokens": 24408760.0, + "step": 655 + }, + { + "entropy": 0.6180669814348221, + "epoch": 4.259951259138911, + "grad_norm": 0.010789727792143822, + "learning_rate": 0.0002, + "loss": 0.6144995093345642, + "mean_token_accuracy": 0.7488504275679588, + "num_tokens": 24446067.0, + "step": 656 + }, + { + "entropy": 0.5908245071768761, + "epoch": 4.266450040617384, + "grad_norm": 0.013646950013935566, + "learning_rate": 0.0002, + "loss": 0.5992537140846252, + "mean_token_accuracy": 0.7573117613792419, + "num_tokens": 24483475.0, + "step": 657 + }, + { + "entropy": 0.6028355807065964, + "epoch": 4.272948822095857, + "grad_norm": 0.012632039375603199, + "learning_rate": 0.0002, + "loss": 0.6093482971191406, + "mean_token_accuracy": 0.7510194182395935, + "num_tokens": 24520599.0, + "step": 658 + }, + { + "entropy": 0.6133154481649399, + "epoch": 4.279447603574329, + "grad_norm": 0.009593473747372627, + "learning_rate": 0.0002, + "loss": 0.6142933964729309, + "mean_token_accuracy": 0.749172069132328, + "num_tokens": 24557970.0, + "step": 659 + }, + { + "entropy": 0.6059748083353043, + "epoch": 4.285946385052803, + "grad_norm": 0.010930807329714298, + "learning_rate": 0.0002, + "loss": 0.6034088134765625, + "mean_token_accuracy": 0.7542562857270241, + "num_tokens": 24595447.0, + "step": 660 + }, + { + "entropy": 0.6150760650634766, + "epoch": 4.292445166531276, + "grad_norm": 0.012249140068888664, + "learning_rate": 0.0002, + "loss": 0.6127879023551941, + "mean_token_accuracy": 0.7484256699681282, + "num_tokens": 24632972.0, + "step": 661 + }, + { + "entropy": 0.6088320016860962, + "epoch": 4.298943948009748, + "grad_norm": 0.010698465630412102, + "learning_rate": 0.0002, + "loss": 0.611052930355072, + "mean_token_accuracy": 0.7510727941989899, + "num_tokens": 24670189.0, + "step": 662 + }, + { + "entropy": 0.5984915345907211, + "epoch": 4.305442729488221, + "grad_norm": 0.012718550860881805, + "learning_rate": 0.0002, + "loss": 0.6050142049789429, + "mean_token_accuracy": 0.7525518760085106, + "num_tokens": 24706956.0, + "step": 663 + }, + { + "entropy": 0.6053661406040192, + "epoch": 4.311941510966694, + "grad_norm": 0.00997387245297432, + "learning_rate": 0.0002, + "loss": 0.6083434820175171, + "mean_token_accuracy": 0.7501671761274338, + "num_tokens": 24744572.0, + "step": 664 + }, + { + "entropy": 0.5996779799461365, + "epoch": 4.318440292445167, + "grad_norm": 0.009505977854132652, + "learning_rate": 0.0002, + "loss": 0.6021357774734497, + "mean_token_accuracy": 0.753576286137104, + "num_tokens": 24782008.0, + "step": 665 + }, + { + "entropy": 0.6148371547460556, + "epoch": 4.324939073923639, + "grad_norm": 0.010230735875666142, + "learning_rate": 0.0002, + "loss": 0.6132264137268066, + "mean_token_accuracy": 0.7497095540165901, + "num_tokens": 24819250.0, + "step": 666 + }, + { + "entropy": 0.6186807677149773, + "epoch": 4.331437855402112, + "grad_norm": 0.011359174735844135, + "learning_rate": 0.0002, + "loss": 0.616733193397522, + "mean_token_accuracy": 0.7471146136522293, + "num_tokens": 24856525.0, + "step": 667 + }, + { + "entropy": 0.5949462577700615, + "epoch": 4.337936636880585, + "grad_norm": 0.009301742538809776, + "learning_rate": 0.0002, + "loss": 0.5954026579856873, + "mean_token_accuracy": 0.7579122558236122, + "num_tokens": 24893833.0, + "step": 668 + }, + { + "entropy": 0.6139709204435349, + "epoch": 4.344435418359057, + "grad_norm": 0.009777146391570568, + "learning_rate": 0.0002, + "loss": 0.6152162551879883, + "mean_token_accuracy": 0.7482587099075317, + "num_tokens": 24931302.0, + "step": 669 + }, + { + "entropy": 0.6105548739433289, + "epoch": 4.35093419983753, + "grad_norm": 0.009922128170728683, + "learning_rate": 0.0002, + "loss": 0.6112467646598816, + "mean_token_accuracy": 0.7494839727878571, + "num_tokens": 24968727.0, + "step": 670 + }, + { + "entropy": 0.6040442362427711, + "epoch": 4.357432981316003, + "grad_norm": 0.009872304275631905, + "learning_rate": 0.0002, + "loss": 0.6058943271636963, + "mean_token_accuracy": 0.7517568320035934, + "num_tokens": 25006181.0, + "step": 671 + }, + { + "entropy": 0.6142793446779251, + "epoch": 4.363931762794476, + "grad_norm": 0.009624022990465164, + "learning_rate": 0.0002, + "loss": 0.6160279512405396, + "mean_token_accuracy": 0.7462561428546906, + "num_tokens": 25043335.0, + "step": 672 + }, + { + "entropy": 0.6127363592386246, + "epoch": 4.370430544272949, + "grad_norm": 0.00913744606077671, + "learning_rate": 0.0002, + "loss": 0.6129778027534485, + "mean_token_accuracy": 0.750290147960186, + "num_tokens": 25081246.0, + "step": 673 + }, + { + "entropy": 0.6002702713012695, + "epoch": 4.376929325751422, + "grad_norm": 0.010623721405863762, + "learning_rate": 0.0002, + "loss": 0.6051443815231323, + "mean_token_accuracy": 0.7518057897686958, + "num_tokens": 25118440.0, + "step": 674 + }, + { + "entropy": 0.6069729775190353, + "epoch": 4.383428107229895, + "grad_norm": 0.011354091577231884, + "learning_rate": 0.0002, + "loss": 0.6139703989028931, + "mean_token_accuracy": 0.7482916563749313, + "num_tokens": 25155694.0, + "step": 675 + }, + { + "entropy": 0.6122787147760391, + "epoch": 4.389926888708367, + "grad_norm": 0.009671922773122787, + "learning_rate": 0.0002, + "loss": 0.6111292839050293, + "mean_token_accuracy": 0.7500254139304161, + "num_tokens": 25192885.0, + "step": 676 + }, + { + "entropy": 0.6137835532426834, + "epoch": 4.39642567018684, + "grad_norm": 0.009973683394491673, + "learning_rate": 0.0002, + "loss": 0.6136457920074463, + "mean_token_accuracy": 0.7491521015763283, + "num_tokens": 25230234.0, + "step": 677 + }, + { + "entropy": 0.6145277097821236, + "epoch": 4.402924451665313, + "grad_norm": 0.010024932213127613, + "learning_rate": 0.0002, + "loss": 0.612713634967804, + "mean_token_accuracy": 0.7496964707970619, + "num_tokens": 25267657.0, + "step": 678 + }, + { + "entropy": 0.6107024550437927, + "epoch": 4.4094232331437855, + "grad_norm": 0.009390750899910927, + "learning_rate": 0.0002, + "loss": 0.6097205281257629, + "mean_token_accuracy": 0.7498994544148445, + "num_tokens": 25305087.0, + "step": 679 + }, + { + "entropy": 0.6041795536875725, + "epoch": 4.415922014622258, + "grad_norm": 0.012812652625143528, + "learning_rate": 0.0002, + "loss": 0.6109946370124817, + "mean_token_accuracy": 0.7516659647226334, + "num_tokens": 25342187.0, + "step": 680 + }, + { + "entropy": 0.5976850837469101, + "epoch": 4.422420796100731, + "grad_norm": 0.010710278525948524, + "learning_rate": 0.0002, + "loss": 0.6007599830627441, + "mean_token_accuracy": 0.7541299387812614, + "num_tokens": 25379496.0, + "step": 681 + }, + { + "entropy": 0.6042672917246819, + "epoch": 4.428919577579204, + "grad_norm": 0.011890453286468983, + "learning_rate": 0.0002, + "loss": 0.6084088087081909, + "mean_token_accuracy": 0.7506248950958252, + "num_tokens": 25416619.0, + "step": 682 + }, + { + "entropy": 0.5986599251627922, + "epoch": 4.435418359057676, + "grad_norm": 0.010659754276275635, + "learning_rate": 0.0002, + "loss": 0.5982859134674072, + "mean_token_accuracy": 0.7548331841826439, + "num_tokens": 25453693.0, + "step": 683 + }, + { + "entropy": 0.616942897439003, + "epoch": 4.441917140536149, + "grad_norm": 0.01076586078852415, + "learning_rate": 0.0002, + "loss": 0.6122304201126099, + "mean_token_accuracy": 0.7499786019325256, + "num_tokens": 25491062.0, + "step": 684 + }, + { + "entropy": 0.6103186085820198, + "epoch": 4.448415922014623, + "grad_norm": 0.010572830215096474, + "learning_rate": 0.0002, + "loss": 0.6094003915786743, + "mean_token_accuracy": 0.7506365403532982, + "num_tokens": 25528185.0, + "step": 685 + }, + { + "entropy": 0.5939375460147858, + "epoch": 4.454914703493095, + "grad_norm": 0.011964102275669575, + "learning_rate": 0.0002, + "loss": 0.6006197333335876, + "mean_token_accuracy": 0.7550608739256859, + "num_tokens": 25565262.0, + "step": 686 + }, + { + "entropy": 0.6017919331789017, + "epoch": 4.461413484971568, + "grad_norm": 0.013583175837993622, + "learning_rate": 0.0002, + "loss": 0.6119198203086853, + "mean_token_accuracy": 0.7524380683898926, + "num_tokens": 25602632.0, + "step": 687 + }, + { + "entropy": 0.6157395392656326, + "epoch": 4.467912266450041, + "grad_norm": 0.009645634330809116, + "learning_rate": 0.0002, + "loss": 0.6124662160873413, + "mean_token_accuracy": 0.7506381198763847, + "num_tokens": 25640141.0, + "step": 688 + }, + { + "entropy": 0.6060995981097221, + "epoch": 4.4744110479285135, + "grad_norm": 0.011023740284144878, + "learning_rate": 0.0002, + "loss": 0.604090690612793, + "mean_token_accuracy": 0.7523544281721115, + "num_tokens": 25676930.0, + "step": 689 + }, + { + "entropy": 0.6346146166324615, + "epoch": 4.480909829406986, + "grad_norm": 0.010563536547124386, + "learning_rate": 0.0002, + "loss": 0.6303510665893555, + "mean_token_accuracy": 0.7432904541492462, + "num_tokens": 25714523.0, + "step": 690 + }, + { + "entropy": 0.6144333481788635, + "epoch": 4.487408610885459, + "grad_norm": 0.010604371316730976, + "learning_rate": 0.0002, + "loss": 0.6150377988815308, + "mean_token_accuracy": 0.74857547134161, + "num_tokens": 25751872.0, + "step": 691 + }, + { + "entropy": 0.5893413797020912, + "epoch": 4.493907392363932, + "grad_norm": 0.010374541394412518, + "learning_rate": 0.0002, + "loss": 0.59273362159729, + "mean_token_accuracy": 0.7577084898948669, + "num_tokens": 25789255.0, + "step": 692 + }, + { + "entropy": 0.5985084772109985, + "epoch": 4.500406173842404, + "grad_norm": 0.010325289331376553, + "learning_rate": 0.0002, + "loss": 0.5997466444969177, + "mean_token_accuracy": 0.7552184760570526, + "num_tokens": 25826911.0, + "step": 693 + }, + { + "entropy": 0.6087296083569527, + "epoch": 4.506904955320877, + "grad_norm": 0.012259433045983315, + "learning_rate": 0.0002, + "loss": 0.6142268776893616, + "mean_token_accuracy": 0.7504933401942253, + "num_tokens": 25864195.0, + "step": 694 + }, + { + "entropy": 0.5923497229814529, + "epoch": 4.51340373679935, + "grad_norm": 0.011389669962227345, + "learning_rate": 0.0002, + "loss": 0.597306489944458, + "mean_token_accuracy": 0.7565679550170898, + "num_tokens": 25901656.0, + "step": 695 + }, + { + "entropy": 0.6001605242490768, + "epoch": 4.5199025182778225, + "grad_norm": 0.009456605650484562, + "learning_rate": 0.0002, + "loss": 0.6000933051109314, + "mean_token_accuracy": 0.7530366033315659, + "num_tokens": 25939491.0, + "step": 696 + }, + { + "entropy": 0.5900749191641808, + "epoch": 4.526401299756296, + "grad_norm": 0.011240561492741108, + "learning_rate": 0.0002, + "loss": 0.59348464012146, + "mean_token_accuracy": 0.7567196115851402, + "num_tokens": 25976506.0, + "step": 697 + }, + { + "entropy": 0.5967278108000755, + "epoch": 4.532900081234769, + "grad_norm": 0.010507924482226372, + "learning_rate": 0.0002, + "loss": 0.6000585556030273, + "mean_token_accuracy": 0.7546230331063271, + "num_tokens": 26013826.0, + "step": 698 + }, + { + "entropy": 0.5980387553572655, + "epoch": 4.5393988627132416, + "grad_norm": 0.01707952283322811, + "learning_rate": 0.0002, + "loss": 0.6007162928581238, + "mean_token_accuracy": 0.7539133131504059, + "num_tokens": 26051676.0, + "step": 699 + }, + { + "entropy": 0.6002839356660843, + "epoch": 4.545897644191714, + "grad_norm": 0.01148629654198885, + "learning_rate": 0.0002, + "loss": 0.6052761077880859, + "mean_token_accuracy": 0.7534726038575172, + "num_tokens": 26088813.0, + "step": 700 + }, + { + "entropy": 0.6063856557011604, + "epoch": 4.552396425670187, + "grad_norm": 0.04600154981017113, + "learning_rate": 0.0002, + "loss": 0.6116973161697388, + "mean_token_accuracy": 0.7503002285957336, + "num_tokens": 26126381.0, + "step": 701 + }, + { + "entropy": 0.6121505573391914, + "epoch": 4.55889520714866, + "grad_norm": 0.01381687168031931, + "learning_rate": 0.0002, + "loss": 0.6069159507751465, + "mean_token_accuracy": 0.7519886940717697, + "num_tokens": 26163482.0, + "step": 702 + }, + { + "entropy": 0.6286856532096863, + "epoch": 4.565393988627132, + "grad_norm": 0.010802995413541794, + "learning_rate": 0.0002, + "loss": 0.6213472485542297, + "mean_token_accuracy": 0.7473803609609604, + "num_tokens": 26200948.0, + "step": 703 + }, + { + "entropy": 0.6292322054505348, + "epoch": 4.571892770105605, + "grad_norm": 0.01318847481161356, + "learning_rate": 0.0002, + "loss": 0.6286896467208862, + "mean_token_accuracy": 0.7422280386090279, + "num_tokens": 26238501.0, + "step": 704 + }, + { + "entropy": 0.61526670306921, + "epoch": 4.578391551584078, + "grad_norm": 0.012318129651248455, + "learning_rate": 0.0002, + "loss": 0.6191307306289673, + "mean_token_accuracy": 0.7456179112195969, + "num_tokens": 26276241.0, + "step": 705 + }, + { + "entropy": 0.5996731072664261, + "epoch": 4.584890333062551, + "grad_norm": 0.01126960851252079, + "learning_rate": 0.0002, + "loss": 0.5998624563217163, + "mean_token_accuracy": 0.7562123388051987, + "num_tokens": 26313858.0, + "step": 706 + }, + { + "entropy": 0.6051791980862617, + "epoch": 4.591389114541023, + "grad_norm": 0.008872485719621181, + "learning_rate": 0.0002, + "loss": 0.6033820509910583, + "mean_token_accuracy": 0.7548251152038574, + "num_tokens": 26351577.0, + "step": 707 + }, + { + "entropy": 0.603697344660759, + "epoch": 4.597887896019496, + "grad_norm": 0.01154793705791235, + "learning_rate": 0.0002, + "loss": 0.6016978025436401, + "mean_token_accuracy": 0.7543343156576157, + "num_tokens": 26388978.0, + "step": 708 + }, + { + "entropy": 0.6170104667544365, + "epoch": 4.604386677497969, + "grad_norm": 0.01096999179571867, + "learning_rate": 0.0002, + "loss": 0.622772216796875, + "mean_token_accuracy": 0.7449462041258812, + "num_tokens": 26426264.0, + "step": 709 + }, + { + "entropy": 0.6072003245353699, + "epoch": 4.610885458976442, + "grad_norm": 0.010877830907702446, + "learning_rate": 0.0002, + "loss": 0.6076858639717102, + "mean_token_accuracy": 0.7529691979289055, + "num_tokens": 26463914.0, + "step": 710 + }, + { + "entropy": 0.6025268062949181, + "epoch": 4.617384240454915, + "grad_norm": 0.011258685030043125, + "learning_rate": 0.0002, + "loss": 0.6081684231758118, + "mean_token_accuracy": 0.751194529235363, + "num_tokens": 26501178.0, + "step": 711 + }, + { + "entropy": 0.6161645799875259, + "epoch": 4.623883021933388, + "grad_norm": 0.011774537153542042, + "learning_rate": 0.0002, + "loss": 0.6219759583473206, + "mean_token_accuracy": 0.7475455403327942, + "num_tokens": 26538587.0, + "step": 712 + }, + { + "entropy": 0.61099823564291, + "epoch": 4.6303818034118605, + "grad_norm": 0.011626939289271832, + "learning_rate": 0.0002, + "loss": 0.6097919940948486, + "mean_token_accuracy": 0.7494744956493378, + "num_tokens": 26576055.0, + "step": 713 + }, + { + "entropy": 0.5967102572321892, + "epoch": 4.636880584890333, + "grad_norm": 0.011615315452218056, + "learning_rate": 0.0002, + "loss": 0.5964145660400391, + "mean_token_accuracy": 0.7566935420036316, + "num_tokens": 26613206.0, + "step": 714 + }, + { + "entropy": 0.6024897918105125, + "epoch": 4.643379366368806, + "grad_norm": 0.011359010823071003, + "learning_rate": 0.0002, + "loss": 0.6033364534378052, + "mean_token_accuracy": 0.75516776740551, + "num_tokens": 26650906.0, + "step": 715 + }, + { + "entropy": 0.6127264201641083, + "epoch": 4.649878147847279, + "grad_norm": 0.011858063749969006, + "learning_rate": 0.0002, + "loss": 0.6169857382774353, + "mean_token_accuracy": 0.7504541873931885, + "num_tokens": 26688277.0, + "step": 716 + }, + { + "entropy": 0.6103435754776001, + "epoch": 4.656376929325751, + "grad_norm": 0.012304591946303844, + "learning_rate": 0.0002, + "loss": 0.6171730756759644, + "mean_token_accuracy": 0.7490719556808472, + "num_tokens": 26725704.0, + "step": 717 + }, + { + "entropy": 0.6082026064395905, + "epoch": 4.662875710804224, + "grad_norm": 0.00955925416201353, + "learning_rate": 0.0002, + "loss": 0.6081550121307373, + "mean_token_accuracy": 0.7512648478150368, + "num_tokens": 26762897.0, + "step": 718 + }, + { + "entropy": 0.615670770406723, + "epoch": 4.669374492282697, + "grad_norm": 0.011302441358566284, + "learning_rate": 0.0002, + "loss": 0.6137043833732605, + "mean_token_accuracy": 0.7484593465924263, + "num_tokens": 26799617.0, + "step": 719 + }, + { + "entropy": 0.6008039489388466, + "epoch": 4.6758732737611695, + "grad_norm": 0.010860615409910679, + "learning_rate": 0.0002, + "loss": 0.5949652194976807, + "mean_token_accuracy": 0.7573561295866966, + "num_tokens": 26836935.0, + "step": 720 + }, + { + "entropy": 0.6153427511453629, + "epoch": 4.682372055239643, + "grad_norm": 0.01038694754242897, + "learning_rate": 0.0002, + "loss": 0.6163858771324158, + "mean_token_accuracy": 0.7477854266762733, + "num_tokens": 26874482.0, + "step": 721 + }, + { + "entropy": 0.6078703328967094, + "epoch": 4.688870836718115, + "grad_norm": 0.011593160219490528, + "learning_rate": 0.0002, + "loss": 0.6154011487960815, + "mean_token_accuracy": 0.7504984140396118, + "num_tokens": 26912012.0, + "step": 722 + }, + { + "entropy": 0.6097044795751572, + "epoch": 4.6953696181965885, + "grad_norm": 0.011452315375208855, + "learning_rate": 0.0002, + "loss": 0.6159889698028564, + "mean_token_accuracy": 0.7497701123356819, + "num_tokens": 26949190.0, + "step": 723 + }, + { + "entropy": 0.6035362407565117, + "epoch": 4.701868399675061, + "grad_norm": 0.009807482361793518, + "learning_rate": 0.0002, + "loss": 0.6073694229125977, + "mean_token_accuracy": 0.7511623874306679, + "num_tokens": 26986593.0, + "step": 724 + }, + { + "entropy": 0.6145569458603859, + "epoch": 4.708367181153534, + "grad_norm": 0.009589890018105507, + "learning_rate": 0.0002, + "loss": 0.615104079246521, + "mean_token_accuracy": 0.7482927516102791, + "num_tokens": 27023613.0, + "step": 725 + }, + { + "entropy": 0.6154572740197182, + "epoch": 4.714865962632007, + "grad_norm": 0.01081397570669651, + "learning_rate": 0.0002, + "loss": 0.6108368635177612, + "mean_token_accuracy": 0.7491915374994278, + "num_tokens": 27061197.0, + "step": 726 + }, + { + "entropy": 0.620484970510006, + "epoch": 4.721364744110479, + "grad_norm": 0.009981570765376091, + "learning_rate": 0.0002, + "loss": 0.6177104711532593, + "mean_token_accuracy": 0.7493368536233902, + "num_tokens": 27098608.0, + "step": 727 + }, + { + "entropy": 0.6061017587780952, + "epoch": 4.727863525588952, + "grad_norm": 0.011618540622293949, + "learning_rate": 0.0002, + "loss": 0.6062725186347961, + "mean_token_accuracy": 0.7519984692335129, + "num_tokens": 27136501.0, + "step": 728 + }, + { + "entropy": 0.6067364290356636, + "epoch": 4.734362307067425, + "grad_norm": 0.009954583831131458, + "learning_rate": 0.0002, + "loss": 0.6102150678634644, + "mean_token_accuracy": 0.7502684965729713, + "num_tokens": 27173703.0, + "step": 729 + }, + { + "entropy": 0.605129785835743, + "epoch": 4.7408610885458975, + "grad_norm": 0.012882952578365803, + "learning_rate": 0.0002, + "loss": 0.6149674654006958, + "mean_token_accuracy": 0.7470449358224869, + "num_tokens": 27210993.0, + "step": 730 + }, + { + "entropy": 0.6143843829631805, + "epoch": 4.74735987002437, + "grad_norm": 0.010333128273487091, + "learning_rate": 0.0002, + "loss": 0.6135010719299316, + "mean_token_accuracy": 0.7495505511760712, + "num_tokens": 27248544.0, + "step": 731 + }, + { + "entropy": 0.619462713599205, + "epoch": 4.753858651502843, + "grad_norm": 0.009751244448125362, + "learning_rate": 0.0002, + "loss": 0.6161588430404663, + "mean_token_accuracy": 0.7501519843935966, + "num_tokens": 27286017.0, + "step": 732 + }, + { + "entropy": 0.6085372492671013, + "epoch": 4.760357432981316, + "grad_norm": 0.01087701041251421, + "learning_rate": 0.0002, + "loss": 0.6058393716812134, + "mean_token_accuracy": 0.7525414749979973, + "num_tokens": 27323456.0, + "step": 733 + }, + { + "entropy": 0.6052304580807686, + "epoch": 4.766856214459789, + "grad_norm": 0.010626486502587795, + "learning_rate": 0.0002, + "loss": 0.6062231063842773, + "mean_token_accuracy": 0.7521145865321159, + "num_tokens": 27360812.0, + "step": 734 + }, + { + "entropy": 0.609903909265995, + "epoch": 4.773354995938262, + "grad_norm": 0.010470789857208729, + "learning_rate": 0.0002, + "loss": 0.6119512319564819, + "mean_token_accuracy": 0.7512121498584747, + "num_tokens": 27398510.0, + "step": 735 + }, + { + "entropy": 0.6010274812579155, + "epoch": 4.779853777416735, + "grad_norm": 0.009013401344418526, + "learning_rate": 0.0002, + "loss": 0.6045113205909729, + "mean_token_accuracy": 0.7538518905639648, + "num_tokens": 27435677.0, + "step": 736 + }, + { + "entropy": 0.6044503897428513, + "epoch": 4.786352558895207, + "grad_norm": 0.009969563223421574, + "learning_rate": 0.0002, + "loss": 0.6042656898498535, + "mean_token_accuracy": 0.7533875405788422, + "num_tokens": 27472951.0, + "step": 737 + }, + { + "entropy": 0.6085273697972298, + "epoch": 4.79285134037368, + "grad_norm": 0.010333449579775333, + "learning_rate": 0.0002, + "loss": 0.6119939088821411, + "mean_token_accuracy": 0.7497808411717415, + "num_tokens": 27510678.0, + "step": 738 + }, + { + "entropy": 0.5953918546438217, + "epoch": 4.799350121852153, + "grad_norm": 0.011067725718021393, + "learning_rate": 0.0002, + "loss": 0.6043837070465088, + "mean_token_accuracy": 0.7549910023808479, + "num_tokens": 27548061.0, + "step": 739 + }, + { + "entropy": 0.6027686223387718, + "epoch": 4.8058489033306255, + "grad_norm": 0.010080584324896336, + "learning_rate": 0.0002, + "loss": 0.6062842011451721, + "mean_token_accuracy": 0.752067320048809, + "num_tokens": 27585301.0, + "step": 740 + }, + { + "entropy": 0.6061441823840141, + "epoch": 4.812347684809098, + "grad_norm": 0.009884923696517944, + "learning_rate": 0.0002, + "loss": 0.6060526371002197, + "mean_token_accuracy": 0.7508253157138824, + "num_tokens": 27622471.0, + "step": 741 + }, + { + "entropy": 0.6114162281155586, + "epoch": 4.818846466287571, + "grad_norm": 0.009803572669625282, + "learning_rate": 0.0002, + "loss": 0.6056950092315674, + "mean_token_accuracy": 0.7509299144148827, + "num_tokens": 27659725.0, + "step": 742 + }, + { + "entropy": 0.604758232831955, + "epoch": 4.825345247766044, + "grad_norm": 0.009157917462289333, + "learning_rate": 0.0002, + "loss": 0.6060429811477661, + "mean_token_accuracy": 0.7535065114498138, + "num_tokens": 27697579.0, + "step": 743 + }, + { + "entropy": 0.6063171178102493, + "epoch": 4.831844029244516, + "grad_norm": 0.010433568619191647, + "learning_rate": 0.0002, + "loss": 0.6129876971244812, + "mean_token_accuracy": 0.7488505020737648, + "num_tokens": 27735152.0, + "step": 744 + }, + { + "entropy": 0.6220549941062927, + "epoch": 4.838342810722989, + "grad_norm": 0.009133824147284031, + "learning_rate": 0.0002, + "loss": 0.6260920166969299, + "mean_token_accuracy": 0.7444146424531937, + "num_tokens": 27772809.0, + "step": 745 + }, + { + "entropy": 0.6151563301682472, + "epoch": 4.844841592201462, + "grad_norm": 0.009275715798139572, + "learning_rate": 0.0002, + "loss": 0.6143773794174194, + "mean_token_accuracy": 0.7501434609293938, + "num_tokens": 27810585.0, + "step": 746 + }, + { + "entropy": 0.6030779108405113, + "epoch": 4.851340373679935, + "grad_norm": 0.009752030484378338, + "learning_rate": 0.0002, + "loss": 0.6026537418365479, + "mean_token_accuracy": 0.7538170889019966, + "num_tokens": 27848177.0, + "step": 747 + }, + { + "entropy": 0.6034507304430008, + "epoch": 4.857839155158408, + "grad_norm": 0.009275935590267181, + "learning_rate": 0.0002, + "loss": 0.6020852327346802, + "mean_token_accuracy": 0.7548267766833305, + "num_tokens": 27885820.0, + "step": 748 + }, + { + "entropy": 0.5959972590208054, + "epoch": 4.864337936636881, + "grad_norm": 0.01019821036607027, + "learning_rate": 0.0002, + "loss": 0.5997313857078552, + "mean_token_accuracy": 0.7544100061058998, + "num_tokens": 27923215.0, + "step": 749 + }, + { + "entropy": 0.5984265580773354, + "epoch": 4.870836718115354, + "grad_norm": 0.010381966829299927, + "learning_rate": 0.0002, + "loss": 0.5997567176818848, + "mean_token_accuracy": 0.754194863140583, + "num_tokens": 27960378.0, + "step": 750 + }, + { + "entropy": 0.6121873781085014, + "epoch": 4.877335499593826, + "grad_norm": 0.010476244613528252, + "learning_rate": 0.0002, + "loss": 0.6164151430130005, + "mean_token_accuracy": 0.747443437576294, + "num_tokens": 27997671.0, + "step": 751 + }, + { + "entropy": 0.6084479093551636, + "epoch": 4.883834281072299, + "grad_norm": 0.011203959584236145, + "learning_rate": 0.0002, + "loss": 0.608171820640564, + "mean_token_accuracy": 0.75231072306633, + "num_tokens": 28034897.0, + "step": 752 + }, + { + "entropy": 0.6147375106811523, + "epoch": 4.890333062550772, + "grad_norm": 0.009496328420937061, + "learning_rate": 0.0002, + "loss": 0.6129316091537476, + "mean_token_accuracy": 0.7494983300566673, + "num_tokens": 28072034.0, + "step": 753 + }, + { + "entropy": 0.6106340512633324, + "epoch": 4.896831844029244, + "grad_norm": 0.011393910273909569, + "learning_rate": 0.0002, + "loss": 0.6084151268005371, + "mean_token_accuracy": 0.7524324804544449, + "num_tokens": 28109258.0, + "step": 754 + }, + { + "entropy": 0.600101962685585, + "epoch": 4.903330625507717, + "grad_norm": 0.010883449576795101, + "learning_rate": 0.0002, + "loss": 0.6043680906295776, + "mean_token_accuracy": 0.7542835772037506, + "num_tokens": 28146570.0, + "step": 755 + }, + { + "entropy": 0.6109775528311729, + "epoch": 4.90982940698619, + "grad_norm": 0.010207289829850197, + "learning_rate": 0.0002, + "loss": 0.6150296926498413, + "mean_token_accuracy": 0.7493007630109787, + "num_tokens": 28183579.0, + "step": 756 + }, + { + "entropy": 0.597320593893528, + "epoch": 4.916328188464663, + "grad_norm": 0.010998498648405075, + "learning_rate": 0.0002, + "loss": 0.599211573600769, + "mean_token_accuracy": 0.7554142326116562, + "num_tokens": 28220767.0, + "step": 757 + }, + { + "entropy": 0.6176287531852722, + "epoch": 4.922826969943135, + "grad_norm": 0.012422211468219757, + "learning_rate": 0.0002, + "loss": 0.6129187941551208, + "mean_token_accuracy": 0.7506537437438965, + "num_tokens": 28258324.0, + "step": 758 + }, + { + "entropy": 0.604163758456707, + "epoch": 4.929325751421608, + "grad_norm": 0.010133393108844757, + "learning_rate": 0.0002, + "loss": 0.6023921966552734, + "mean_token_accuracy": 0.7550497874617577, + "num_tokens": 28295946.0, + "step": 759 + }, + { + "entropy": 0.6072142794728279, + "epoch": 4.935824532900082, + "grad_norm": 0.011114662513136864, + "learning_rate": 0.0002, + "loss": 0.6146305799484253, + "mean_token_accuracy": 0.7498172372579575, + "num_tokens": 28333200.0, + "step": 760 + }, + { + "entropy": 0.6026475057005882, + "epoch": 4.942323314378554, + "grad_norm": 0.010693948715925217, + "learning_rate": 0.0002, + "loss": 0.6080969572067261, + "mean_token_accuracy": 0.7521899044513702, + "num_tokens": 28370788.0, + "step": 761 + }, + { + "entropy": 0.6020209938287735, + "epoch": 4.948822095857027, + "grad_norm": 0.010837409645318985, + "learning_rate": 0.0002, + "loss": 0.6070795059204102, + "mean_token_accuracy": 0.7505692467093468, + "num_tokens": 28407932.0, + "step": 762 + }, + { + "entropy": 0.612369492650032, + "epoch": 4.9553208773355, + "grad_norm": 0.010154753923416138, + "learning_rate": 0.0002, + "loss": 0.6116279363632202, + "mean_token_accuracy": 0.7497418820858002, + "num_tokens": 28445493.0, + "step": 763 + }, + { + "entropy": 0.6173591017723083, + "epoch": 4.9618196588139725, + "grad_norm": 0.008918640203773975, + "learning_rate": 0.0002, + "loss": 0.61656254529953, + "mean_token_accuracy": 0.7493520677089691, + "num_tokens": 28483286.0, + "step": 764 + }, + { + "entropy": 0.6011045426130295, + "epoch": 4.968318440292445, + "grad_norm": 0.011289622634649277, + "learning_rate": 0.0002, + "loss": 0.6005913019180298, + "mean_token_accuracy": 0.7565959766507149, + "num_tokens": 28520772.0, + "step": 765 + }, + { + "entropy": 0.6143112033605576, + "epoch": 4.974817221770918, + "grad_norm": 0.009968056343495846, + "learning_rate": 0.0002, + "loss": 0.6112393140792847, + "mean_token_accuracy": 0.7505759075284004, + "num_tokens": 28558593.0, + "step": 766 + }, + { + "entropy": 0.609484076499939, + "epoch": 4.981316003249391, + "grad_norm": 0.00863439030945301, + "learning_rate": 0.0002, + "loss": 0.6094443798065186, + "mean_token_accuracy": 0.753460243344307, + "num_tokens": 28596214.0, + "step": 767 + }, + { + "entropy": 0.6114853024482727, + "epoch": 4.987814784727863, + "grad_norm": 0.008814731612801552, + "learning_rate": 0.0002, + "loss": 0.6125534772872925, + "mean_token_accuracy": 0.7496102303266525, + "num_tokens": 28634065.0, + "step": 768 + }, + { + "entropy": 0.6083709001541138, + "epoch": 4.994313566206336, + "grad_norm": 0.012475132942199707, + "learning_rate": 0.0002, + "loss": 0.6144940853118896, + "mean_token_accuracy": 0.7477302476763725, + "num_tokens": 28671577.0, + "step": 769 + }, + { + "entropy": 0.6027948686054775, + "epoch": 5.0, + "grad_norm": 0.009683027863502502, + "learning_rate": 0.0002, + "loss": 0.6097056865692139, + "mean_token_accuracy": 0.7535298126084464, + "num_tokens": 28688115.0, + "step": 770 } ], "logging_steps": 1, - "max_steps": 320, + "max_steps": 770, "num_input_tokens_seen": 0, - "num_train_epochs": 10, + "num_train_epochs": 5, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { @@ -3227,8 +7727,8 @@ "attributes": {} } }, - "total_flos": 1.7190992994946253e+18, - "train_batch_size": 16, + "total_flos": 2.685759473330422e+18, + "train_batch_size": 4, "trial_name": null, "trial_params": null }