{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.22103569035662726, "eval_steps": 250, "global_step": 8000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0013814730647289204, "grad_norm": 1.3092303276062012, "learning_rate": 0.0009187500000000001, "loss": 5.301650390625, "step": 50 }, { "epoch": 0.0027629461294578408, "grad_norm": 0.2540936768054962, "learning_rate": 0.00185625, "loss": 3.7713958740234377, "step": 100 }, { "epoch": 0.004144419194186761, "grad_norm": 0.8980741500854492, "learning_rate": 0.0027937500000000002, "loss": 3.084112548828125, "step": 150 }, { "epoch": 0.0055258922589156816, "grad_norm": 0.513289213180542, "learning_rate": 0.003, "loss": 2.6681784057617186, "step": 200 }, { "epoch": 0.006907365323644602, "grad_norm": 0.8646414875984192, "learning_rate": 0.003, "loss": 2.4488145446777345, "step": 250 }, { "epoch": 0.006907365323644602, "eval_loss": 2.3864049911499023, "eval_runtime": 5.0393, "eval_samples_per_second": 404.423, "eval_steps_per_second": 3.175, "step": 250 }, { "epoch": 0.008288838388373522, "grad_norm": 1.049102783203125, "learning_rate": 0.003, "loss": 2.3174089050292968, "step": 300 }, { "epoch": 0.009670311453102444, "grad_norm": 2.3267924785614014, "learning_rate": 0.003, "loss": 2.2231291198730467, "step": 350 }, { "epoch": 0.011051784517831363, "grad_norm": 1.4895470142364502, "learning_rate": 0.003, "loss": 2.136985168457031, "step": 400 }, { "epoch": 0.012433257582560284, "grad_norm": 0.8463179469108582, "learning_rate": 0.003, "loss": 2.075450897216797, "step": 450 }, { "epoch": 0.013814730647289204, "grad_norm": 1.4170407056808472, "learning_rate": 0.003, "loss": 2.0253837585449217, "step": 500 }, { "epoch": 0.013814730647289204, "eval_loss": 2.0032660961151123, "eval_runtime": 4.8177, "eval_samples_per_second": 423.027, "eval_steps_per_second": 3.321, "step": 500 }, { "epoch": 0.015196203712018125, "grad_norm": 0.9727197289466858, "learning_rate": 0.003, "loss": 1.985428924560547, "step": 550 }, { "epoch": 0.016577676776747045, "grad_norm": 1.3294126987457275, "learning_rate": 0.003, "loss": 1.945387725830078, "step": 600 }, { "epoch": 0.017959149841475966, "grad_norm": 1.1075317859649658, "learning_rate": 0.003, "loss": 1.909156494140625, "step": 650 }, { "epoch": 0.019340622906204887, "grad_norm": 1.532372236251831, "learning_rate": 0.003, "loss": 1.8862774658203125, "step": 700 }, { "epoch": 0.02072209597093381, "grad_norm": 1.4036468267440796, "learning_rate": 0.003, "loss": 1.8624417114257812, "step": 750 }, { "epoch": 0.02072209597093381, "eval_loss": 1.8611562252044678, "eval_runtime": 4.8927, "eval_samples_per_second": 416.539, "eval_steps_per_second": 3.27, "step": 750 }, { "epoch": 0.022103569035662726, "grad_norm": 0.9797951579093933, "learning_rate": 0.003, "loss": 1.8470022583007812, "step": 800 }, { "epoch": 0.023485042100391647, "grad_norm": 1.0192056894302368, "learning_rate": 0.003, "loss": 1.8303775024414062, "step": 850 }, { "epoch": 0.02486651516512057, "grad_norm": 1.3044160604476929, "learning_rate": 0.003, "loss": 1.8083892822265626, "step": 900 }, { "epoch": 0.02624798822984949, "grad_norm": 1.347043514251709, "learning_rate": 0.003, "loss": 1.7919261169433593, "step": 950 }, { "epoch": 0.027629461294578408, "grad_norm": 1.4868067502975464, "learning_rate": 0.003, "loss": 1.7848297119140626, "step": 1000 }, { "epoch": 0.027629461294578408, "eval_loss": 1.7806859016418457, "eval_runtime": 4.9437, "eval_samples_per_second": 412.245, "eval_steps_per_second": 3.236, "step": 1000 }, { "epoch": 0.02901093435930733, "grad_norm": 1.3199470043182373, "learning_rate": 0.003, "loss": 1.770255584716797, "step": 1050 }, { "epoch": 0.03039240742403625, "grad_norm": 0.942984402179718, "learning_rate": 0.003, "loss": 1.764229278564453, "step": 1100 }, { "epoch": 0.03177388048876517, "grad_norm": 1.001526951789856, "learning_rate": 0.003, "loss": 1.748619842529297, "step": 1150 }, { "epoch": 0.03315535355349409, "grad_norm": 0.9165797233581543, "learning_rate": 0.003, "loss": 1.7377178955078125, "step": 1200 }, { "epoch": 0.034536826618223014, "grad_norm": 1.5860354900360107, "learning_rate": 0.003, "loss": 1.7299589538574218, "step": 1250 }, { "epoch": 0.034536826618223014, "eval_loss": 1.7355499267578125, "eval_runtime": 4.8017, "eval_samples_per_second": 424.429, "eval_steps_per_second": 3.332, "step": 1250 }, { "epoch": 0.03591829968295193, "grad_norm": 1.7614655494689941, "learning_rate": 0.003, "loss": 1.7231251525878906, "step": 1300 }, { "epoch": 0.03729977274768085, "grad_norm": 0.8269591927528381, "learning_rate": 0.003, "loss": 1.7191682434082032, "step": 1350 }, { "epoch": 0.038681245812409774, "grad_norm": 1.2936993837356567, "learning_rate": 0.003, "loss": 1.715775146484375, "step": 1400 }, { "epoch": 0.04006271887713869, "grad_norm": 0.8943546414375305, "learning_rate": 0.003, "loss": 1.7027583312988281, "step": 1450 }, { "epoch": 0.04144419194186762, "grad_norm": 0.8446581959724426, "learning_rate": 0.003, "loss": 1.7010877990722657, "step": 1500 }, { "epoch": 0.04144419194186762, "eval_loss": 1.7066650390625, "eval_runtime": 4.8419, "eval_samples_per_second": 420.908, "eval_steps_per_second": 3.304, "step": 1500 }, { "epoch": 0.042825665006596535, "grad_norm": 1.1785316467285156, "learning_rate": 0.003, "loss": 1.6969337463378906, "step": 1550 }, { "epoch": 0.04420713807132545, "grad_norm": 1.1146525144577026, "learning_rate": 0.003, "loss": 1.6898464965820312, "step": 1600 }, { "epoch": 0.04558861113605438, "grad_norm": 1.050032377243042, "learning_rate": 0.003, "loss": 1.6903854370117188, "step": 1650 }, { "epoch": 0.046970084200783295, "grad_norm": 0.817931056022644, "learning_rate": 0.003, "loss": 1.6805955505371093, "step": 1700 }, { "epoch": 0.04835155726551221, "grad_norm": 0.7598580121994019, "learning_rate": 0.003, "loss": 1.6817108154296876, "step": 1750 }, { "epoch": 0.04835155726551221, "eval_loss": 1.681281328201294, "eval_runtime": 4.9443, "eval_samples_per_second": 412.196, "eval_steps_per_second": 3.236, "step": 1750 }, { "epoch": 0.04973303033024114, "grad_norm": 1.0627769231796265, "learning_rate": 0.003, "loss": 1.6690780639648437, "step": 1800 }, { "epoch": 0.051114503394970055, "grad_norm": 0.9967713952064514, "learning_rate": 0.003, "loss": 1.6677894592285156, "step": 1850 }, { "epoch": 0.05249597645969898, "grad_norm": 0.8788776397705078, "learning_rate": 0.003, "loss": 1.671481170654297, "step": 1900 }, { "epoch": 0.0538774495244279, "grad_norm": 0.8975939750671387, "learning_rate": 0.003, "loss": 1.6636967468261719, "step": 1950 }, { "epoch": 0.055258922589156816, "grad_norm": 0.8807463645935059, "learning_rate": 0.003, "loss": 1.662882080078125, "step": 2000 }, { "epoch": 0.055258922589156816, "eval_loss": 1.659508228302002, "eval_runtime": 4.8341, "eval_samples_per_second": 421.589, "eval_steps_per_second": 3.31, "step": 2000 }, { "epoch": 0.05664039565388574, "grad_norm": 0.8365132212638855, "learning_rate": 0.003, "loss": 1.6577224731445312, "step": 2050 }, { "epoch": 0.05802186871861466, "grad_norm": 1.006463646888733, "learning_rate": 0.003, "loss": 1.651870574951172, "step": 2100 }, { "epoch": 0.059403341783343576, "grad_norm": 1.0645591020584106, "learning_rate": 0.003, "loss": 1.655391845703125, "step": 2150 }, { "epoch": 0.0607848148480725, "grad_norm": 0.7508670091629028, "learning_rate": 0.003, "loss": 1.641587677001953, "step": 2200 }, { "epoch": 0.06216628791280142, "grad_norm": 0.9019992351531982, "learning_rate": 0.003, "loss": 1.6511729431152344, "step": 2250 }, { "epoch": 0.06216628791280142, "eval_loss": 1.6495267152786255, "eval_runtime": 4.9408, "eval_samples_per_second": 412.485, "eval_steps_per_second": 3.238, "step": 2250 }, { "epoch": 0.06354776097753034, "grad_norm": 0.8229948282241821, "learning_rate": 0.003, "loss": 1.647374725341797, "step": 2300 }, { "epoch": 0.06492923404225927, "grad_norm": 0.9779911041259766, "learning_rate": 0.003, "loss": 1.6417164611816406, "step": 2350 }, { "epoch": 0.06631070710698818, "grad_norm": 0.8557340502738953, "learning_rate": 0.003, "loss": 1.6406777954101563, "step": 2400 }, { "epoch": 0.0676921801717171, "grad_norm": 0.7618058919906616, "learning_rate": 0.003, "loss": 1.6387905883789062, "step": 2450 }, { "epoch": 0.06907365323644603, "grad_norm": 0.9702732563018799, "learning_rate": 0.003, "loss": 1.6384074401855468, "step": 2500 }, { "epoch": 0.06907365323644603, "eval_loss": 1.6367918252944946, "eval_runtime": 5.186, "eval_samples_per_second": 392.979, "eval_steps_per_second": 3.085, "step": 2500 }, { "epoch": 0.07045512630117494, "grad_norm": 0.8180472254753113, "learning_rate": 0.003, "loss": 1.6398277282714844, "step": 2550 }, { "epoch": 0.07183659936590386, "grad_norm": 0.8394176959991455, "learning_rate": 0.003, "loss": 1.6309616088867187, "step": 2600 }, { "epoch": 0.07321807243063279, "grad_norm": 1.1738929748535156, "learning_rate": 0.003, "loss": 1.6329539489746094, "step": 2650 }, { "epoch": 0.0745995454953617, "grad_norm": 0.7382224798202515, "learning_rate": 0.003, "loss": 1.6252481079101562, "step": 2700 }, { "epoch": 0.07598101856009062, "grad_norm": 0.7925794720649719, "learning_rate": 0.003, "loss": 1.628258056640625, "step": 2750 }, { "epoch": 0.07598101856009062, "eval_loss": 1.6294986009597778, "eval_runtime": 5.0001, "eval_samples_per_second": 407.594, "eval_steps_per_second": 3.2, "step": 2750 }, { "epoch": 0.07736249162481955, "grad_norm": 1.0887517929077148, "learning_rate": 0.003, "loss": 1.6292604064941407, "step": 2800 }, { "epoch": 0.07874396468954846, "grad_norm": 0.8471100926399231, "learning_rate": 0.003, "loss": 1.6208766174316407, "step": 2850 }, { "epoch": 0.08012543775427738, "grad_norm": 0.8405469059944153, "learning_rate": 0.003, "loss": 1.6250108337402345, "step": 2900 }, { "epoch": 0.08150691081900631, "grad_norm": 0.7940107583999634, "learning_rate": 0.003, "loss": 1.6223403930664062, "step": 2950 }, { "epoch": 0.08288838388373523, "grad_norm": 0.9527040123939514, "learning_rate": 0.003, "loss": 1.62312744140625, "step": 3000 }, { "epoch": 0.08288838388373523, "eval_loss": 1.622558832168579, "eval_runtime": 4.9038, "eval_samples_per_second": 415.594, "eval_steps_per_second": 3.263, "step": 3000 }, { "epoch": 0.08426985694846414, "grad_norm": 0.7105967402458191, "learning_rate": 0.003, "loss": 1.6175238037109374, "step": 3050 }, { "epoch": 0.08565133001319307, "grad_norm": 1.089608907699585, "learning_rate": 0.003, "loss": 1.6170733642578126, "step": 3100 }, { "epoch": 0.087032803077922, "grad_norm": 0.8875170350074768, "learning_rate": 0.003, "loss": 1.61830322265625, "step": 3150 }, { "epoch": 0.0884142761426509, "grad_norm": 0.9304706454277039, "learning_rate": 0.003, "loss": 1.6177555847167968, "step": 3200 }, { "epoch": 0.08979574920737983, "grad_norm": 0.8498280644416809, "learning_rate": 0.0029992286819925424, "loss": 1.6121067810058594, "step": 3250 }, { "epoch": 0.08979574920737983, "eval_loss": 1.6201170682907104, "eval_runtime": 4.8624, "eval_samples_per_second": 419.135, "eval_steps_per_second": 3.291, "step": 3250 }, { "epoch": 0.09117722227210875, "grad_norm": 0.884667694568634, "learning_rate": 0.0029968522736369967, "loss": 1.6176124572753907, "step": 3300 }, { "epoch": 0.09255869533683767, "grad_norm": 0.8628567457199097, "learning_rate": 0.0029928729983747797, "loss": 1.6118777465820313, "step": 3350 }, { "epoch": 0.09394016840156659, "grad_norm": 0.7607647776603699, "learning_rate": 0.002987295117313512, "loss": 1.6121871948242188, "step": 3400 }, { "epoch": 0.09532164146629551, "grad_norm": 0.6003952622413635, "learning_rate": 0.002980124603387944, "loss": 1.6035992431640624, "step": 3450 }, { "epoch": 0.09670311453102443, "grad_norm": 0.668270468711853, "learning_rate": 0.0029713691349639894, "loss": 1.6169198608398438, "step": 3500 }, { "epoch": 0.09670311453102443, "eval_loss": 1.61012864112854, "eval_runtime": 4.8048, "eval_samples_per_second": 424.158, "eval_steps_per_second": 3.33, "step": 3500 }, { "epoch": 0.09808458759575335, "grad_norm": 0.8415676355361938, "learning_rate": 0.002961038087616538, "loss": 1.6114456176757812, "step": 3550 }, { "epoch": 0.09946606066048228, "grad_norm": 0.7975565195083618, "learning_rate": 0.002949142524089853, "loss": 1.6004766845703124, "step": 3600 }, { "epoch": 0.10084753372521119, "grad_norm": 0.6167800426483154, "learning_rate": 0.00293569518245131, "loss": 1.60706298828125, "step": 3650 }, { "epoch": 0.10222900678994011, "grad_norm": 0.6672324538230896, "learning_rate": 0.0029207104624511555, "loss": 1.6043368530273439, "step": 3700 }, { "epoch": 0.10361047985466904, "grad_norm": 0.7184829115867615, "learning_rate": 0.0029042044101028914, "loss": 1.6044706726074218, "step": 3750 }, { "epoch": 0.10361047985466904, "eval_loss": 1.608585238456726, "eval_runtime": 4.872, "eval_samples_per_second": 418.307, "eval_steps_per_second": 3.284, "step": 3750 }, { "epoch": 0.10499195291939796, "grad_norm": 0.6598625779151917, "learning_rate": 0.002886194700500804, "loss": 1.6044143676757812, "step": 3800 }, { "epoch": 0.10637342598412687, "grad_norm": 0.7797738313674927, "learning_rate": 0.002866700618893029, "loss": 1.600813751220703, "step": 3850 }, { "epoch": 0.1077548990488558, "grad_norm": 0.6865859031677246, "learning_rate": 0.002845743040030426, "loss": 1.6023855590820313, "step": 3900 }, { "epoch": 0.10913637211358472, "grad_norm": 0.6436059474945068, "learning_rate": 0.002823344405813371, "loss": 1.6005615234375, "step": 3950 }, { "epoch": 0.11051784517831363, "grad_norm": 0.6858559250831604, "learning_rate": 0.0027995287012604077, "loss": 1.5992294311523438, "step": 4000 }, { "epoch": 0.11051784517831363, "eval_loss": 1.6017545461654663, "eval_runtime": 4.9861, "eval_samples_per_second": 408.736, "eval_steps_per_second": 3.209, "step": 4000 }, { "epoch": 0.11189931824304256, "grad_norm": 0.7086427807807922, "learning_rate": 0.0027743214288244904, "loss": 1.5969778442382812, "step": 4050 }, { "epoch": 0.11328079130777148, "grad_norm": 0.6547996997833252, "learning_rate": 0.002747749581084317, "loss": 1.5946481323242188, "step": 4100 }, { "epoch": 0.11466226437250039, "grad_norm": 0.6854317784309387, "learning_rate": 0.0027198416118399986, "loss": 1.594525146484375, "step": 4150 }, { "epoch": 0.11604373743722932, "grad_norm": 0.8039860129356384, "learning_rate": 0.0026906274056440215, "loss": 1.6002627563476564, "step": 4200 }, { "epoch": 0.11742521050195824, "grad_norm": 0.7050207257270813, "learning_rate": 0.0026601382458001166, "loss": 1.5937403869628906, "step": 4250 }, { "epoch": 0.11742521050195824, "eval_loss": 1.5975710153579712, "eval_runtime": 4.8014, "eval_samples_per_second": 424.46, "eval_steps_per_second": 3.332, "step": 4250 }, { "epoch": 0.11880668356668715, "grad_norm": 0.6737009286880493, "learning_rate": 0.0026284067808643144, "loss": 1.5923365783691406, "step": 4300 }, { "epoch": 0.12018815663141608, "grad_norm": 0.7063266634941101, "learning_rate": 0.002595466989684055, "loss": 1.5977363586425781, "step": 4350 }, { "epoch": 0.121569629696145, "grad_norm": 0.6896716356277466, "learning_rate": 0.0025613541450127857, "loss": 1.5926210021972655, "step": 4400 }, { "epoch": 0.12295110276087393, "grad_norm": 0.6772384643554688, "learning_rate": 0.0025261047757390138, "loss": 1.5924766540527344, "step": 4450 }, { "epoch": 0.12433257582560284, "grad_norm": 0.6963664293289185, "learning_rate": 0.002489756627770259, "loss": 1.5876535034179688, "step": 4500 }, { "epoch": 0.12433257582560284, "eval_loss": 1.5943443775177002, "eval_runtime": 4.8657, "eval_samples_per_second": 418.853, "eval_steps_per_second": 3.288, "step": 4500 }, { "epoch": 0.12571404889033175, "grad_norm": 0.7814108729362488, "learning_rate": 0.002452348623613788, "loss": 1.5891021728515624, "step": 4550 }, { "epoch": 0.1270955219550607, "grad_norm": 0.6211883425712585, "learning_rate": 0.002413920820697419, "loss": 1.5855482482910157, "step": 4600 }, { "epoch": 0.1284769950197896, "grad_norm": 0.6522833108901978, "learning_rate": 0.0023745143684750264, "loss": 1.5884809875488282, "step": 4650 }, { "epoch": 0.12985846808451854, "grad_norm": 0.6828014254570007, "learning_rate": 0.002334171464362675, "loss": 1.5833425903320313, "step": 4700 }, { "epoch": 0.13123994114924745, "grad_norm": 0.6603298783302307, "learning_rate": 0.002292935308552567, "loss": 1.583031005859375, "step": 4750 }, { "epoch": 0.13123994114924745, "eval_loss": 1.5896168947219849, "eval_runtime": 4.8861, "eval_samples_per_second": 417.099, "eval_steps_per_second": 3.275, "step": 4750 }, { "epoch": 0.13262141421397636, "grad_norm": 0.6717214584350586, "learning_rate": 0.002250850057753197, "loss": 1.5836068725585937, "step": 4800 }, { "epoch": 0.1340028872787053, "grad_norm": 0.6846370100975037, "learning_rate": 0.002207960777905242, "loss": 1.586727294921875, "step": 4850 }, { "epoch": 0.1353843603434342, "grad_norm": 0.7362879514694214, "learning_rate": 0.0021643133959238225, "loss": 1.5847500610351561, "step": 4900 }, { "epoch": 0.13676583340816312, "grad_norm": 0.7345172166824341, "learning_rate": 0.0021199546505188105, "loss": 1.5825830078125, "step": 4950 }, { "epoch": 0.13814730647289206, "grad_norm": 0.5534242391586304, "learning_rate": 0.0020749320421458535, "loss": 1.5811091613769532, "step": 5000 }, { "epoch": 0.13814730647289206, "eval_loss": 1.5833630561828613, "eval_runtime": 4.9704, "eval_samples_per_second": 410.03, "eval_steps_per_second": 3.219, "step": 5000 }, { "epoch": 0.13952877953762097, "grad_norm": 0.552155613899231, "learning_rate": 0.002029293782141689, "loss": 1.5763238525390626, "step": 5050 }, { "epoch": 0.14091025260234988, "grad_norm": 0.7206612825393677, "learning_rate": 0.001983088741098243, "loss": 1.5772702026367187, "step": 5100 }, { "epoch": 0.14229172566707882, "grad_norm": 0.6678832769393921, "learning_rate": 0.001936366396530776, "loss": 1.5752102661132812, "step": 5150 }, { "epoch": 0.14367319873180773, "grad_norm": 0.6534181237220764, "learning_rate": 0.0018891767798961177, "loss": 1.5794488525390624, "step": 5200 }, { "epoch": 0.14505467179653664, "grad_norm": 0.6262516379356384, "learning_rate": 0.0018415704230177307, "loss": 1.574145050048828, "step": 5250 }, { "epoch": 0.14505467179653664, "eval_loss": 1.5795270204544067, "eval_runtime": 4.8927, "eval_samples_per_second": 416.542, "eval_steps_per_second": 3.27, "step": 5250 }, { "epoch": 0.14643614486126558, "grad_norm": 0.5793588757514954, "learning_rate": 0.0017935983039749706, "loss": 1.5746864318847655, "step": 5300 }, { "epoch": 0.1478176179259945, "grad_norm": 0.6871621012687683, "learning_rate": 0.0017453117925144783, "loss": 1.5744833374023437, "step": 5350 }, { "epoch": 0.1491990909907234, "grad_norm": 0.6331185102462769, "learning_rate": 0.0016967625950421712, "loss": 1.57496337890625, "step": 5400 }, { "epoch": 0.15058056405545234, "grad_norm": 0.6986100673675537, "learning_rate": 0.0016480026992547268, "loss": 1.578210906982422, "step": 5450 }, { "epoch": 0.15196203712018125, "grad_norm": 0.6834849715232849, "learning_rate": 0.001599084318469858, "loss": 1.5710919189453125, "step": 5500 }, { "epoch": 0.15196203712018125, "eval_loss": 1.5749062299728394, "eval_runtime": 4.8609, "eval_samples_per_second": 419.261, "eval_steps_per_second": 3.292, "step": 5500 }, { "epoch": 0.15334351018491016, "grad_norm": 0.6833263039588928, "learning_rate": 0.0015500598357149793, "loss": 1.5740811157226562, "step": 5550 }, { "epoch": 0.1547249832496391, "grad_norm": 0.8077707886695862, "learning_rate": 0.001500981747634155, "loss": 1.5700558471679686, "step": 5600 }, { "epoch": 0.156106456314368, "grad_norm": 0.6584182977676392, "learning_rate": 0.001451902608273374, "loss": 1.5697401428222657, "step": 5650 }, { "epoch": 0.15748792937909692, "grad_norm": 0.7573363184928894, "learning_rate": 0.0014028749728043628, "loss": 1.5668351745605469, "step": 5700 }, { "epoch": 0.15886940244382586, "grad_norm": 0.6129063963890076, "learning_rate": 0.0013539513412471889, "loss": 1.570359344482422, "step": 5750 }, { "epoch": 0.15886940244382586, "eval_loss": 1.5709928274154663, "eval_runtime": 4.859, "eval_samples_per_second": 419.431, "eval_steps_per_second": 3.293, "step": 5750 }, { "epoch": 0.16025087550855477, "grad_norm": 0.5028947591781616, "learning_rate": 0.0013051841022519272, "loss": 1.561181640625, "step": 5800 }, { "epoch": 0.16163234857328368, "grad_norm": 0.7434332966804504, "learning_rate": 0.0012566254769995806, "loss": 1.5647598266601563, "step": 5850 }, { "epoch": 0.16301382163801262, "grad_norm": 0.5033641457557678, "learning_rate": 0.0012083274632823304, "loss": 1.5645637512207031, "step": 5900 }, { "epoch": 0.16439529470274153, "grad_norm": 0.5664800405502319, "learning_rate": 0.0011603417798229966, "loss": 1.567978515625, "step": 5950 }, { "epoch": 0.16577676776747047, "grad_norm": 0.6270240545272827, "learning_rate": 0.0011127198108933402, "loss": 1.5611529541015625, "step": 6000 }, { "epoch": 0.16577676776747047, "eval_loss": 1.5664807558059692, "eval_runtime": 4.8532, "eval_samples_per_second": 419.927, "eval_steps_per_second": 3.297, "step": 6000 }, { "epoch": 0.16715824083219938, "grad_norm": 0.5457693934440613, "learning_rate": 0.0010655125512904898, "loss": 1.5654832458496093, "step": 6050 }, { "epoch": 0.1685397138969283, "grad_norm": 0.5332794785499573, "learning_rate": 0.0010187705517304413, "loss": 1.5635955810546875, "step": 6100 }, { "epoch": 0.16992118696165723, "grad_norm": 0.5312942862510681, "learning_rate": 0.0009725438647170831, "loss": 1.5631723022460937, "step": 6150 }, { "epoch": 0.17130266002638614, "grad_norm": 0.6611814498901367, "learning_rate": 0.0009268819909447218, "loss": 1.5617874145507813, "step": 6200 }, { "epoch": 0.17268413309111505, "grad_norm": 0.5385921001434326, "learning_rate": 0.000881833826291497, "loss": 1.5621722412109376, "step": 6250 }, { "epoch": 0.17268413309111505, "eval_loss": 1.5625797510147095, "eval_runtime": 4.9424, "eval_samples_per_second": 412.354, "eval_steps_per_second": 3.237, "step": 6250 }, { "epoch": 0.174065606155844, "grad_norm": 0.48100849986076355, "learning_rate": 0.0008374476094604538, "loss": 1.5620567321777343, "step": 6300 }, { "epoch": 0.1754470792205729, "grad_norm": 0.5656850934028625, "learning_rate": 0.0007937708703243286, "loss": 1.5645301818847657, "step": 6350 }, { "epoch": 0.1768285522853018, "grad_norm": 0.6062788367271423, "learning_rate": 0.0007508503790293705, "loss": 1.5537733459472656, "step": 6400 }, { "epoch": 0.17821002535003075, "grad_norm": 0.5672012567520142, "learning_rate": 0.0007087320959126999, "loss": 1.559359130859375, "step": 6450 }, { "epoch": 0.17959149841475966, "grad_norm": 0.5249131321907043, "learning_rate": 0.0006674611222868254, "loss": 1.5566461181640625, "step": 6500 }, { "epoch": 0.17959149841475966, "eval_loss": 1.559727430343628, "eval_runtime": 4.8874, "eval_samples_per_second": 416.989, "eval_steps_per_second": 3.274, "step": 6500 }, { "epoch": 0.18097297147948857, "grad_norm": 0.5304768681526184, "learning_rate": 0.000627081652144031, "loss": 1.5591546630859374, "step": 6550 }, { "epoch": 0.1823544445442175, "grad_norm": 0.5281299948692322, "learning_rate": 0.0005876369248323417, "loss": 1.5576934814453125, "step": 6600 }, { "epoch": 0.18373591760894642, "grad_norm": 0.4922367334365845, "learning_rate": 0.0005491691787537452, "loss": 1.5613423156738282, "step": 6650 }, { "epoch": 0.18511739067367533, "grad_norm": 0.6296632289886475, "learning_rate": 0.000511719606134253, "loss": 1.5597859191894532, "step": 6700 }, { "epoch": 0.18649886373840427, "grad_norm": 0.49581730365753174, "learning_rate": 0.00047532830891423806, "loss": 1.5527120971679687, "step": 6750 }, { "epoch": 0.18649886373840427, "eval_loss": 1.5563873052597046, "eval_runtime": 4.8751, "eval_samples_per_second": 418.047, "eval_steps_per_second": 3.282, "step": 6750 }, { "epoch": 0.18788033680313318, "grad_norm": 0.5099366307258606, "learning_rate": 0.00044003425580626496, "loss": 1.549066619873047, "step": 6800 }, { "epoch": 0.1892618098678621, "grad_norm": 0.4683798551559448, "learning_rate": 0.0004058752405664207, "loss": 1.5529069519042968, "step": 6850 }, { "epoch": 0.19064328293259103, "grad_norm": 0.5025731921195984, "learning_rate": 0.0003728878415238149, "loss": 1.5490866088867188, "step": 6900 }, { "epoch": 0.19202475599731994, "grad_norm": 0.5808431506156921, "learning_rate": 0.00034110738241158677, "loss": 1.5539451599121095, "step": 6950 }, { "epoch": 0.19340622906204885, "grad_norm": 0.5575580596923828, "learning_rate": 0.0003105678945413668, "loss": 1.5520620727539063, "step": 7000 }, { "epoch": 0.19340622906204885, "eval_loss": 1.5543574094772339, "eval_runtime": 4.8945, "eval_samples_per_second": 416.387, "eval_steps_per_second": 3.269, "step": 7000 }, { "epoch": 0.1947877021267778, "grad_norm": 0.4817080497741699, "learning_rate": 0.0002813020803616979, "loss": 1.552979736328125, "step": 7050 }, { "epoch": 0.1961691751915067, "grad_norm": 0.45744574069976807, "learning_rate": 0.00025334127843943164, "loss": 1.548302459716797, "step": 7100 }, { "epoch": 0.1975506482562356, "grad_norm": 0.46788737177848816, "learning_rate": 0.00022671542990160843, "loss": 1.5542337036132812, "step": 7150 }, { "epoch": 0.19893212132096455, "grad_norm": 0.44763970375061035, "learning_rate": 0.00020145304637374757, "loss": 1.5487118530273438, "step": 7200 }, { "epoch": 0.20031359438569346, "grad_norm": 0.4314698576927185, "learning_rate": 0.0001775811794488842, "loss": 1.5508662414550782, "step": 7250 }, { "epoch": 0.20031359438569346, "eval_loss": 1.551482915878296, "eval_runtime": 4.8891, "eval_samples_per_second": 416.845, "eval_steps_per_second": 3.273, "step": 7250 }, { "epoch": 0.20169506745042237, "grad_norm": 0.44681674242019653, "learning_rate": 0.00015512539172004598, "loss": 1.5449916076660157, "step": 7300 }, { "epoch": 0.2030765405151513, "grad_norm": 0.4624103903770447, "learning_rate": 0.00013410972940719012, "loss": 1.5420948791503906, "step": 7350 }, { "epoch": 0.20445801357988022, "grad_norm": 0.42456161975860596, "learning_rate": 0.00011455669660790574, "loss": 1.5426979064941406, "step": 7400 }, { "epoch": 0.20583948664460916, "grad_norm": 0.43187159299850464, "learning_rate": 9.648723119946411e-05, "loss": 1.55113037109375, "step": 7450 }, { "epoch": 0.20722095970933807, "grad_norm": 0.4058364927768707, "learning_rate": 7.992068241801543e-05, "loss": 1.5490814208984376, "step": 7500 }, { "epoch": 0.20722095970933807, "eval_loss": 1.5499120950698853, "eval_runtime": 4.6438, "eval_samples_per_second": 438.865, "eval_steps_per_second": 3.445, "step": 7500 }, { "epoch": 0.20860243277406698, "grad_norm": 0.41115882992744446, "learning_rate": 6.487479013894215e-05, "loss": 1.53897705078125, "step": 7550 }, { "epoch": 0.20998390583879592, "grad_norm": 0.40895798802375793, "learning_rate": 5.1365665880554635e-05, "loss": 1.5461245727539064, "step": 7600 }, { "epoch": 0.21136537890352483, "grad_norm": 0.43710294365882874, "learning_rate": 3.940777555147568e-05, "loss": 1.5500086975097656, "step": 7650 }, { "epoch": 0.21274685196825374, "grad_norm": 0.37500861287117004, "learning_rate": 2.9013923960182153e-05, "loss": 1.5431840515136719, "step": 7700 }, { "epoch": 0.21412832503298268, "grad_norm": 0.4327012598514557, "learning_rate": 2.019524110329557e-05, "loss": 1.5467581176757812, "step": 7750 }, { "epoch": 0.21412832503298268, "eval_loss": 1.548779010772705, "eval_runtime": 5.0548, "eval_samples_per_second": 403.183, "eval_steps_per_second": 3.165, "step": 7750 }, { "epoch": 0.2155097980977116, "grad_norm": 0.3742528557777405, "learning_rate": 1.2961170247303034e-05, "loss": 1.543158721923828, "step": 7800 }, { "epoch": 0.2168912711624405, "grad_norm": 0.39662519097328186, "learning_rate": 7.319457816470754e-06, "loss": 1.5452882385253905, "step": 7850 }, { "epoch": 0.21827274422716944, "grad_norm": 0.439929336309433, "learning_rate": 3.276145097779237e-06, "loss": 1.54449462890625, "step": 7900 }, { "epoch": 0.21965421729189835, "grad_norm": 0.3996962904930115, "learning_rate": 8.355617717617503e-07, "loss": 1.5445120239257812, "step": 7950 }, { "epoch": 0.22103569035662726, "grad_norm": 0.3886605203151703, "learning_rate": 3.2127617349830827e-10, "loss": 1.541259765625, "step": 8000 }, { "epoch": 0.22103569035662726, "eval_loss": 1.5484822988510132, "eval_runtime": 10.2225, "eval_samples_per_second": 199.364, "eval_steps_per_second": 1.565, "step": 8000 } ], "logging_steps": 50, "max_steps": 8000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 250, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 110584922112000.0, "train_batch_size": 128, "trial_name": null, "trial_params": null }