{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 5.0, "eval_steps": 70, "global_step": 350, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.014285714285714285, "grad_norm": 1.5370203256607056, "learning_rate": 0.0, "loss": 1.71875, "step": 1 }, { "epoch": 0.02857142857142857, "grad_norm": 1.2635160684585571, "learning_rate": 5.555555555555556e-06, "loss": 1.62890625, "step": 2 }, { "epoch": 0.04285714285714286, "grad_norm": 1.1691744327545166, "learning_rate": 1.1111111111111112e-05, "loss": 1.5576171875, "step": 3 }, { "epoch": 0.05714285714285714, "grad_norm": 1.0796048641204834, "learning_rate": 1.6666666666666667e-05, "loss": 1.366455078125, "step": 4 }, { "epoch": 0.07142857142857142, "grad_norm": 0.9845981001853943, "learning_rate": 2.2222222222222223e-05, "loss": 1.4541015625, "step": 5 }, { "epoch": 0.08571428571428572, "grad_norm": 0.8848991394042969, "learning_rate": 2.777777777777778e-05, "loss": 1.4345703125, "step": 6 }, { "epoch": 0.1, "grad_norm": 0.6667224764823914, "learning_rate": 3.3333333333333335e-05, "loss": 1.3564453125, "step": 7 }, { "epoch": 0.11428571428571428, "grad_norm": 0.5166143178939819, "learning_rate": 3.888888888888889e-05, "loss": 1.3291015625, "step": 8 }, { "epoch": 0.12857142857142856, "grad_norm": 0.22515398263931274, "learning_rate": 4.4444444444444447e-05, "loss": 1.10791015625, "step": 9 }, { "epoch": 0.14285714285714285, "grad_norm": 0.19087187945842743, "learning_rate": 5e-05, "loss": 1.0686798095703125, "step": 10 }, { "epoch": 0.15714285714285714, "grad_norm": 0.2104729264974594, "learning_rate": 5.555555555555556e-05, "loss": 1.2060546875, "step": 11 }, { "epoch": 0.17142857142857143, "grad_norm": 0.14718303084373474, "learning_rate": 6.111111111111112e-05, "loss": 1.00634765625, "step": 12 }, { "epoch": 0.18571428571428572, "grad_norm": 0.16706810891628265, "learning_rate": 6.666666666666667e-05, "loss": 1.2275390625, "step": 13 }, { "epoch": 0.2, "grad_norm": 0.16205047070980072, "learning_rate": 7.222222222222222e-05, "loss": 1.1552734375, "step": 14 }, { "epoch": 0.21428571428571427, "grad_norm": 0.14002586901187897, "learning_rate": 7.777777777777778e-05, "loss": 1.11474609375, "step": 15 }, { "epoch": 0.22857142857142856, "grad_norm": 0.11632716655731201, "learning_rate": 8.333333333333334e-05, "loss": 1.2568359375, "step": 16 }, { "epoch": 0.24285714285714285, "grad_norm": 0.07913663238286972, "learning_rate": 8.888888888888889e-05, "loss": 1.09521484375, "step": 17 }, { "epoch": 0.2571428571428571, "grad_norm": 0.0647306740283966, "learning_rate": 9.444444444444444e-05, "loss": 1.08740234375, "step": 18 }, { "epoch": 0.2714285714285714, "grad_norm": 0.08836376667022705, "learning_rate": 0.0001, "loss": 1.134765625, "step": 19 }, { "epoch": 0.2857142857142857, "grad_norm": 0.09614553302526474, "learning_rate": 9.999798533493594e-05, "loss": 1.1533203125, "step": 20 }, { "epoch": 0.3, "grad_norm": 0.11298302561044693, "learning_rate": 9.99919415201382e-05, "loss": 1.16845703125, "step": 21 }, { "epoch": 0.3142857142857143, "grad_norm": 0.07566612213850021, "learning_rate": 9.998186909677402e-05, "loss": 1.06201171875, "step": 22 }, { "epoch": 0.32857142857142857, "grad_norm": 0.07081552594900131, "learning_rate": 9.996776896673492e-05, "loss": 1.1025390625, "step": 23 }, { "epoch": 0.34285714285714286, "grad_norm": 0.052225261926651, "learning_rate": 9.994964239255598e-05, "loss": 1.0576171875, "step": 24 }, { "epoch": 0.35714285714285715, "grad_norm": 0.051157619804143906, "learning_rate": 9.992749099730281e-05, "loss": 0.99609375, "step": 25 }, { "epoch": 0.37142857142857144, "grad_norm": 0.04909141734242439, "learning_rate": 9.990131676442615e-05, "loss": 1.10009765625, "step": 26 }, { "epoch": 0.38571428571428573, "grad_norm": 0.051664452999830246, "learning_rate": 9.987112203758434e-05, "loss": 1.0869140625, "step": 27 }, { "epoch": 0.4, "grad_norm": 0.05382264778017998, "learning_rate": 9.983690952043345e-05, "loss": 1.07763671875, "step": 28 }, { "epoch": 0.4142857142857143, "grad_norm": 0.04685552790760994, "learning_rate": 9.979868227638516e-05, "loss": 1.08203125, "step": 29 }, { "epoch": 0.42857142857142855, "grad_norm": 0.044112514704465866, "learning_rate": 9.975644372833249e-05, "loss": 1.08544921875, "step": 30 }, { "epoch": 0.44285714285714284, "grad_norm": 0.04807021841406822, "learning_rate": 9.971019765834333e-05, "loss": 1.044921875, "step": 31 }, { "epoch": 0.45714285714285713, "grad_norm": 0.044932372868061066, "learning_rate": 9.965994820732173e-05, "loss": 1.0576171875, "step": 32 }, { "epoch": 0.4714285714285714, "grad_norm": 0.04348684847354889, "learning_rate": 9.960569987463719e-05, "loss": 1.0517578125, "step": 33 }, { "epoch": 0.4857142857142857, "grad_norm": 0.042379334568977356, "learning_rate": 9.954745751772172e-05, "loss": 1.103515625, "step": 34 }, { "epoch": 0.5, "grad_norm": 0.03986199572682381, "learning_rate": 9.948522635163499e-05, "loss": 1.076171875, "step": 35 }, { "epoch": 0.5142857142857142, "grad_norm": 0.03914280980825424, "learning_rate": 9.941901194859725e-05, "loss": 1.0654296875, "step": 36 }, { "epoch": 0.5285714285714286, "grad_norm": 0.037639349699020386, "learning_rate": 9.934882023749048e-05, "loss": 1.05126953125, "step": 37 }, { "epoch": 0.5428571428571428, "grad_norm": 0.03912171721458435, "learning_rate": 9.927465750332747e-05, "loss": 1.0205078125, "step": 38 }, { "epoch": 0.5571428571428572, "grad_norm": 0.03608435392379761, "learning_rate": 9.919653038668912e-05, "loss": 1.04150390625, "step": 39 }, { "epoch": 0.5714285714285714, "grad_norm": 0.0371897928416729, "learning_rate": 9.911444588312976e-05, "loss": 1.01953125, "step": 40 }, { "epoch": 0.5857142857142857, "grad_norm": 0.03903960809111595, "learning_rate": 9.902841134255077e-05, "loss": 1.0936279296875, "step": 41 }, { "epoch": 0.6, "grad_norm": 0.038740161806344986, "learning_rate": 9.893843446854254e-05, "loss": 1.06005859375, "step": 42 }, { "epoch": 0.6142857142857143, "grad_norm": 0.039114199578762054, "learning_rate": 9.88445233176946e-05, "loss": 1.05810546875, "step": 43 }, { "epoch": 0.6285714285714286, "grad_norm": 0.03906146436929703, "learning_rate": 9.874668629887426e-05, "loss": 0.96630859375, "step": 44 }, { "epoch": 0.6428571428571429, "grad_norm": 0.037451352924108505, "learning_rate": 9.864493217247373e-05, "loss": 1.02734375, "step": 45 }, { "epoch": 0.6571428571428571, "grad_norm": 0.03710811585187912, "learning_rate": 9.853927004962556e-05, "loss": 1.06591796875, "step": 46 }, { "epoch": 0.6714285714285714, "grad_norm": 0.0455041341483593, "learning_rate": 9.8429709391387e-05, "loss": 0.9853515625, "step": 47 }, { "epoch": 0.6857142857142857, "grad_norm": 0.035515446215867996, "learning_rate": 9.831626000789274e-05, "loss": 1.0263671875, "step": 48 }, { "epoch": 0.7, "grad_norm": 0.03612297400832176, "learning_rate": 9.819893205747654e-05, "loss": 1.0361328125, "step": 49 }, { "epoch": 0.7142857142857143, "grad_norm": 0.036578841507434845, "learning_rate": 9.807773604576159e-05, "loss": 0.96533203125, "step": 50 }, { "epoch": 0.7285714285714285, "grad_norm": 0.03498220071196556, "learning_rate": 9.795268282471998e-05, "loss": 1.015625, "step": 51 }, { "epoch": 0.7428571428571429, "grad_norm": 0.03724769502878189, "learning_rate": 9.782378359170082e-05, "loss": 1.041015625, "step": 52 }, { "epoch": 0.7571428571428571, "grad_norm": 0.03416800871491432, "learning_rate": 9.769104988842775e-05, "loss": 0.838134765625, "step": 53 }, { "epoch": 0.7714285714285715, "grad_norm": 0.03408706933259964, "learning_rate": 9.75544935999654e-05, "loss": 0.81109619140625, "step": 54 }, { "epoch": 0.7857142857142857, "grad_norm": 0.04380936920642853, "learning_rate": 9.741412695365528e-05, "loss": 1.02587890625, "step": 55 }, { "epoch": 0.8, "grad_norm": 0.03615158423781395, "learning_rate": 9.726996251802087e-05, "loss": 1.0185546875, "step": 56 }, { "epoch": 0.8142857142857143, "grad_norm": 0.0350247323513031, "learning_rate": 9.712201320164228e-05, "loss": 1.02197265625, "step": 57 }, { "epoch": 0.8285714285714286, "grad_norm": 0.03687237203121185, "learning_rate": 9.697029225200033e-05, "loss": 1.0048828125, "step": 58 }, { "epoch": 0.8428571428571429, "grad_norm": 0.04002695530653, "learning_rate": 9.681481325429045e-05, "loss": 1.05322265625, "step": 59 }, { "epoch": 0.8571428571428571, "grad_norm": 0.036546625196933746, "learning_rate": 9.665559013020615e-05, "loss": 1.064453125, "step": 60 }, { "epoch": 0.8714285714285714, "grad_norm": 0.036987561732530594, "learning_rate": 9.64926371366926e-05, "loss": 0.98095703125, "step": 61 }, { "epoch": 0.8857142857142857, "grad_norm": 0.03506046533584595, "learning_rate": 9.632596886466994e-05, "loss": 1.0126953125, "step": 62 }, { "epoch": 0.9, "grad_norm": 0.035204075276851654, "learning_rate": 9.615560023772684e-05, "loss": 0.96533203125, "step": 63 }, { "epoch": 0.9142857142857143, "grad_norm": 0.03650631383061409, "learning_rate": 9.598154651078418e-05, "loss": 1.0244140625, "step": 64 }, { "epoch": 0.9285714285714286, "grad_norm": 0.03606770932674408, "learning_rate": 9.580382326872922e-05, "loss": 1.00244140625, "step": 65 }, { "epoch": 0.9428571428571428, "grad_norm": 0.034475889056921005, "learning_rate": 9.562244642502007e-05, "loss": 0.99755859375, "step": 66 }, { "epoch": 0.9571428571428572, "grad_norm": 0.03869969770312309, "learning_rate": 9.543743222026071e-05, "loss": 0.9990234375, "step": 67 }, { "epoch": 0.9714285714285714, "grad_norm": 0.035299014300107956, "learning_rate": 9.524879722074692e-05, "loss": 1.01953125, "step": 68 }, { "epoch": 0.9857142857142858, "grad_norm": 0.0372522734105587, "learning_rate": 9.505655831698286e-05, "loss": 1.04296875, "step": 69 }, { "epoch": 1.0, "grad_norm": 0.037406694144010544, "learning_rate": 9.486073272216866e-05, "loss": 1.0478515625, "step": 70 }, { "epoch": 1.0, "eval_loss": 0.93798828125, "eval_runtime": 2.2138, "eval_samples_per_second": 2.71, "eval_steps_per_second": 0.452, "step": 70 }, { "epoch": 1.0142857142857142, "grad_norm": 0.036507610231637955, "learning_rate": 9.46613379706592e-05, "loss": 1.0615234375, "step": 71 }, { "epoch": 1.0285714285714285, "grad_norm": 0.03933257237076759, "learning_rate": 9.445839191639403e-05, "loss": 1.06298828125, "step": 72 }, { "epoch": 1.042857142857143, "grad_norm": 0.03883332386612892, "learning_rate": 9.425191273129873e-05, "loss": 1.05224609375, "step": 73 }, { "epoch": 1.0571428571428572, "grad_norm": 0.03544116020202637, "learning_rate": 9.404191890365774e-05, "loss": 0.891998291015625, "step": 74 }, { "epoch": 1.0714285714285714, "grad_norm": 0.03692076727747917, "learning_rate": 9.382842923645904e-05, "loss": 1.01220703125, "step": 75 }, { "epoch": 1.0857142857142856, "grad_norm": 0.04064275696873665, "learning_rate": 9.361146284571031e-05, "loss": 0.99951171875, "step": 76 }, { "epoch": 1.1, "grad_norm": 0.03858662769198418, "learning_rate": 9.339103915872745e-05, "loss": 0.9892578125, "step": 77 }, { "epoch": 1.1142857142857143, "grad_norm": 0.036362070590257645, "learning_rate": 9.316717791239499e-05, "loss": 1.0126953125, "step": 78 }, { "epoch": 1.1285714285714286, "grad_norm": 0.042795922607183456, "learning_rate": 9.29398991513988e-05, "loss": 0.904296875, "step": 79 }, { "epoch": 1.1428571428571428, "grad_norm": 0.03503147140145302, "learning_rate": 9.27092232264313e-05, "loss": 0.84356689453125, "step": 80 }, { "epoch": 1.157142857142857, "grad_norm": 0.042715106159448624, "learning_rate": 9.247517079236926e-05, "loss": 0.95849609375, "step": 81 }, { "epoch": 1.1714285714285715, "grad_norm": 0.035005152225494385, "learning_rate": 9.223776280642429e-05, "loss": 0.840576171875, "step": 82 }, { "epoch": 1.1857142857142857, "grad_norm": 0.03969377279281616, "learning_rate": 9.199702052626646e-05, "loss": 1.00927734375, "step": 83 }, { "epoch": 1.2, "grad_norm": 0.040097057819366455, "learning_rate": 9.175296550812066e-05, "loss": 0.96484375, "step": 84 }, { "epoch": 1.2142857142857142, "grad_norm": 0.03844078630208969, "learning_rate": 9.150561960483666e-05, "loss": 0.94482421875, "step": 85 }, { "epoch": 1.2285714285714286, "grad_norm": 0.04095899313688278, "learning_rate": 9.125500496393221e-05, "loss": 1.07275390625, "step": 86 }, { "epoch": 1.2428571428571429, "grad_norm": 0.0425279326736927, "learning_rate": 9.100114402561006e-05, "loss": 0.92626953125, "step": 87 }, { "epoch": 1.2571428571428571, "grad_norm": 0.03975928947329521, "learning_rate": 9.074405952074858e-05, "loss": 0.95458984375, "step": 88 }, { "epoch": 1.2714285714285714, "grad_norm": 0.047119978815317154, "learning_rate": 9.048377446886647e-05, "loss": 0.9716796875, "step": 89 }, { "epoch": 1.2857142857142856, "grad_norm": 0.046727199107408524, "learning_rate": 9.022031217606153e-05, "loss": 0.98095703125, "step": 90 }, { "epoch": 1.3, "grad_norm": 0.040927693247795105, "learning_rate": 8.995369623292385e-05, "loss": 1.03173828125, "step": 91 }, { "epoch": 1.3142857142857143, "grad_norm": 0.04770605266094208, "learning_rate": 8.968395051242349e-05, "loss": 0.92578125, "step": 92 }, { "epoch": 1.3285714285714285, "grad_norm": 0.04084092751145363, "learning_rate": 8.941109916777286e-05, "loss": 0.9873046875, "step": 93 }, { "epoch": 1.342857142857143, "grad_norm": 0.04231275990605354, "learning_rate": 8.913516663026404e-05, "loss": 0.94287109375, "step": 94 }, { "epoch": 1.3571428571428572, "grad_norm": 0.04177459329366684, "learning_rate": 8.885617760708116e-05, "loss": 0.8828125, "step": 95 }, { "epoch": 1.3714285714285714, "grad_norm": 0.04704070836305618, "learning_rate": 8.857415707908818e-05, "loss": 0.9853515625, "step": 96 }, { "epoch": 1.3857142857142857, "grad_norm": 0.042378682643175125, "learning_rate": 8.828913029859194e-05, "loss": 0.96533203125, "step": 97 }, { "epoch": 1.4, "grad_norm": 0.04612474888563156, "learning_rate": 8.800112278708123e-05, "loss": 0.95556640625, "step": 98 }, { "epoch": 1.4142857142857144, "grad_norm": 0.04554460942745209, "learning_rate": 8.771016033294148e-05, "loss": 0.9765625, "step": 99 }, { "epoch": 1.4285714285714286, "grad_norm": 0.043107710778713226, "learning_rate": 8.741626898914558e-05, "loss": 0.97412109375, "step": 100 }, { "epoch": 1.4428571428571428, "grad_norm": 0.045618608593940735, "learning_rate": 8.711947507092126e-05, "loss": 0.93359375, "step": 101 }, { "epoch": 1.457142857142857, "grad_norm": 0.04153142496943474, "learning_rate": 8.681980515339464e-05, "loss": 0.9541015625, "step": 102 }, { "epoch": 1.4714285714285715, "grad_norm": 0.04040868580341339, "learning_rate": 8.651728606921079e-05, "loss": 0.9599609375, "step": 103 }, { "epoch": 1.4857142857142858, "grad_norm": 0.05096150189638138, "learning_rate": 8.621194490613103e-05, "loss": 1.009765625, "step": 104 }, { "epoch": 1.5, "grad_norm": 0.04161123186349869, "learning_rate": 8.590380900460755e-05, "loss": 0.9833984375, "step": 105 }, { "epoch": 1.5142857142857142, "grad_norm": 0.04169192537665367, "learning_rate": 8.559290595533526e-05, "loss": 0.9697265625, "step": 106 }, { "epoch": 1.5285714285714285, "grad_norm": 0.04692216217517853, "learning_rate": 8.527926359678135e-05, "loss": 0.9560546875, "step": 107 }, { "epoch": 1.5428571428571427, "grad_norm": 0.044088274240493774, "learning_rate": 8.496291001269259e-05, "loss": 0.9375, "step": 108 }, { "epoch": 1.5571428571428572, "grad_norm": 0.041295040398836136, "learning_rate": 8.464387352958074e-05, "loss": 0.95361328125, "step": 109 }, { "epoch": 1.5714285714285714, "grad_norm": 0.04311827942728996, "learning_rate": 8.432218271418601e-05, "loss": 0.9287109375, "step": 110 }, { "epoch": 1.5857142857142859, "grad_norm": 0.04645412787795067, "learning_rate": 8.399786637091947e-05, "loss": 1.008544921875, "step": 111 }, { "epoch": 1.6, "grad_norm": 0.04281448572874069, "learning_rate": 8.36709535392836e-05, "loss": 0.97119140625, "step": 112 }, { "epoch": 1.6142857142857143, "grad_norm": 0.039966315031051636, "learning_rate": 8.334147349127222e-05, "loss": 0.98046875, "step": 113 }, { "epoch": 1.6285714285714286, "grad_norm": 0.047403622418642044, "learning_rate": 8.300945572874939e-05, "loss": 0.88720703125, "step": 114 }, { "epoch": 1.6428571428571428, "grad_norm": 0.04420870169997215, "learning_rate": 8.267492998080791e-05, "loss": 0.9580078125, "step": 115 }, { "epoch": 1.657142857142857, "grad_norm": 0.04278175160288811, "learning_rate": 8.233792620110719e-05, "loss": 0.99267578125, "step": 116 }, { "epoch": 1.6714285714285713, "grad_norm": 0.04950513318181038, "learning_rate": 8.19984745651913e-05, "loss": 0.9140625, "step": 117 }, { "epoch": 1.6857142857142857, "grad_norm": 0.04335412010550499, "learning_rate": 8.1656605467787e-05, "loss": 0.95068359375, "step": 118 }, { "epoch": 1.7, "grad_norm": 0.04472755640745163, "learning_rate": 8.131234952008212e-05, "loss": 0.96240234375, "step": 119 }, { "epoch": 1.7142857142857144, "grad_norm": 0.043206386268138885, "learning_rate": 8.096573754698473e-05, "loss": 0.89599609375, "step": 120 }, { "epoch": 1.7285714285714286, "grad_norm": 0.04570404067635536, "learning_rate": 8.061680058436298e-05, "loss": 0.9423828125, "step": 121 }, { "epoch": 1.7428571428571429, "grad_norm": 0.04255395382642746, "learning_rate": 8.026556987626607e-05, "loss": 0.96875, "step": 122 }, { "epoch": 1.7571428571428571, "grad_norm": 0.039799995720386505, "learning_rate": 7.99120768721268e-05, "loss": 0.78369140625, "step": 123 }, { "epoch": 1.7714285714285714, "grad_norm": 0.04574437811970711, "learning_rate": 7.955635322394542e-05, "loss": 0.746826171875, "step": 124 }, { "epoch": 1.7857142857142856, "grad_norm": 0.04676768183708191, "learning_rate": 7.919843078345555e-05, "loss": 0.96826171875, "step": 125 }, { "epoch": 1.8, "grad_norm": 0.045920632779598236, "learning_rate": 7.883834159927212e-05, "loss": 0.9521484375, "step": 126 }, { "epoch": 1.8142857142857143, "grad_norm": 0.047574810683727264, "learning_rate": 7.847611791402181e-05, "loss": 0.9560546875, "step": 127 }, { "epoch": 1.8285714285714287, "grad_norm": 0.04646388068795204, "learning_rate": 7.811179216145588e-05, "loss": 0.94482421875, "step": 128 }, { "epoch": 1.842857142857143, "grad_norm": 0.04814613610506058, "learning_rate": 7.774539696354615e-05, "loss": 0.9873046875, "step": 129 }, { "epoch": 1.8571428571428572, "grad_norm": 0.05017926171422005, "learning_rate": 7.737696512756394e-05, "loss": 1.005859375, "step": 130 }, { "epoch": 1.8714285714285714, "grad_norm": 0.043628886342048645, "learning_rate": 7.70065296431425e-05, "loss": 0.91650390625, "step": 131 }, { "epoch": 1.8857142857142857, "grad_norm": 0.0455118864774704, "learning_rate": 7.663412367932314e-05, "loss": 0.95263671875, "step": 132 }, { "epoch": 1.9, "grad_norm": 0.04489551857113838, "learning_rate": 7.62597805815852e-05, "loss": 0.90283203125, "step": 133 }, { "epoch": 1.9142857142857141, "grad_norm": 0.0432695671916008, "learning_rate": 7.588353386886026e-05, "loss": 0.96630859375, "step": 134 }, { "epoch": 1.9285714285714286, "grad_norm": 0.04645658656954765, "learning_rate": 7.550541723053088e-05, "loss": 0.9375, "step": 135 }, { "epoch": 1.9428571428571428, "grad_norm": 0.04398561641573906, "learning_rate": 7.512546452341401e-05, "loss": 0.93994140625, "step": 136 }, { "epoch": 1.9571428571428573, "grad_norm": 0.043043263256549835, "learning_rate": 7.474370976872944e-05, "loss": 0.93896484375, "step": 137 }, { "epoch": 1.9714285714285715, "grad_norm": 0.04508152976632118, "learning_rate": 7.436018714905347e-05, "loss": 0.9638671875, "step": 138 }, { "epoch": 1.9857142857142858, "grad_norm": 0.043544020503759384, "learning_rate": 7.397493100525829e-05, "loss": 0.98095703125, "step": 139 }, { "epoch": 2.0, "grad_norm": 0.04602934047579765, "learning_rate": 7.358797583343691e-05, "loss": 0.97900390625, "step": 140 }, { "epoch": 2.0, "eval_loss": 0.89306640625, "eval_runtime": 2.1996, "eval_samples_per_second": 2.728, "eval_steps_per_second": 0.455, "step": 140 }, { "epoch": 2.0142857142857142, "grad_norm": 0.046280667185783386, "learning_rate": 7.319935628181446e-05, "loss": 0.99365234375, "step": 141 }, { "epoch": 2.0285714285714285, "grad_norm": 0.046611592173576355, "learning_rate": 7.280910714764585e-05, "loss": 1.0029296875, "step": 142 }, { "epoch": 2.0428571428571427, "grad_norm": 0.04613683372735977, "learning_rate": 7.241726337409979e-05, "loss": 0.99951171875, "step": 143 }, { "epoch": 2.057142857142857, "grad_norm": 0.040014706552028656, "learning_rate": 7.202386004713008e-05, "loss": 0.845367431640625, "step": 144 }, { "epoch": 2.0714285714285716, "grad_norm": 0.04537486657500267, "learning_rate": 7.162893239233408e-05, "loss": 0.9560546875, "step": 145 }, { "epoch": 2.085714285714286, "grad_norm": 0.050085388123989105, "learning_rate": 7.123251577179833e-05, "loss": 0.9423828125, "step": 146 }, { "epoch": 2.1, "grad_norm": 0.04427152872085571, "learning_rate": 7.083464568093249e-05, "loss": 0.93212890625, "step": 147 }, { "epoch": 2.1142857142857143, "grad_norm": 0.050130926072597504, "learning_rate": 7.043535774529087e-05, "loss": 0.9580078125, "step": 148 }, { "epoch": 2.1285714285714286, "grad_norm": 0.05082038417458534, "learning_rate": 7.003468771738255e-05, "loss": 0.85888671875, "step": 149 }, { "epoch": 2.142857142857143, "grad_norm": 0.04404108598828316, "learning_rate": 6.963267147347007e-05, "loss": 0.7931671142578125, "step": 150 }, { "epoch": 2.157142857142857, "grad_norm": 0.048873648047447205, "learning_rate": 6.922934501035709e-05, "loss": 0.9072265625, "step": 151 }, { "epoch": 2.1714285714285713, "grad_norm": 0.03908224776387215, "learning_rate": 6.882474444216513e-05, "loss": 0.8017578125, "step": 152 }, { "epoch": 2.185714285714286, "grad_norm": 0.04746107757091522, "learning_rate": 6.841890599709994e-05, "loss": 0.95703125, "step": 153 }, { "epoch": 2.2, "grad_norm": 0.04566887393593788, "learning_rate": 6.801186601420766e-05, "loss": 0.916015625, "step": 154 }, { "epoch": 2.2142857142857144, "grad_norm": 0.04792994260787964, "learning_rate": 6.760366094012083e-05, "loss": 0.89794921875, "step": 155 }, { "epoch": 2.2285714285714286, "grad_norm": 0.04765713959932327, "learning_rate": 6.719432732579508e-05, "loss": 1.01904296875, "step": 156 }, { "epoch": 2.242857142857143, "grad_norm": 0.04851759225130081, "learning_rate": 6.67839018232363e-05, "loss": 0.875, "step": 157 }, { "epoch": 2.257142857142857, "grad_norm": 0.04878833889961243, "learning_rate": 6.63724211822188e-05, "loss": 0.90869140625, "step": 158 }, { "epoch": 2.2714285714285714, "grad_norm": 0.05301643908023834, "learning_rate": 6.595992224699463e-05, "loss": 0.91796875, "step": 159 }, { "epoch": 2.2857142857142856, "grad_norm": 0.051798202097415924, "learning_rate": 6.554644195299467e-05, "loss": 0.92529296875, "step": 160 }, { "epoch": 2.3, "grad_norm": 0.04964352399110794, "learning_rate": 6.513201732352124e-05, "loss": 0.98388671875, "step": 161 }, { "epoch": 2.314285714285714, "grad_norm": 0.048345692455768585, "learning_rate": 6.471668546643312e-05, "loss": 0.87939453125, "step": 162 }, { "epoch": 2.3285714285714287, "grad_norm": 0.04840334132313728, "learning_rate": 6.430048357082287e-05, "loss": 0.94287109375, "step": 163 }, { "epoch": 2.342857142857143, "grad_norm": 0.04917162284255028, "learning_rate": 6.388344890368693e-05, "loss": 0.89990234375, "step": 164 }, { "epoch": 2.357142857142857, "grad_norm": 0.04613529145717621, "learning_rate": 6.346561880658852e-05, "loss": 0.83447265625, "step": 165 }, { "epoch": 2.3714285714285714, "grad_norm": 0.04937538877129555, "learning_rate": 6.304703069231434e-05, "loss": 0.94091796875, "step": 166 }, { "epoch": 2.3857142857142857, "grad_norm": 0.04908490553498268, "learning_rate": 6.262772204152436e-05, "loss": 0.91748046875, "step": 167 }, { "epoch": 2.4, "grad_norm": 0.05064590647816658, "learning_rate": 6.220773039939592e-05, "loss": 0.90869140625, "step": 168 }, { "epoch": 2.414285714285714, "grad_norm": 0.0501258559525013, "learning_rate": 6.178709337226182e-05, "loss": 0.93115234375, "step": 169 }, { "epoch": 2.4285714285714284, "grad_norm": 0.04868542030453682, "learning_rate": 6.136584862424312e-05, "loss": 0.92724609375, "step": 170 }, { "epoch": 2.442857142857143, "grad_norm": 0.05527665466070175, "learning_rate": 6.0944033873876616e-05, "loss": 0.8837890625, "step": 171 }, { "epoch": 2.4571428571428573, "grad_norm": 0.04786409065127373, "learning_rate": 6.0521686890737396e-05, "loss": 0.91015625, "step": 172 }, { "epoch": 2.4714285714285715, "grad_norm": 0.044612202793359756, "learning_rate": 6.009884549205715e-05, "loss": 0.91796875, "step": 173 }, { "epoch": 2.4857142857142858, "grad_norm": 0.04983896762132645, "learning_rate": 5.96755475393378e-05, "loss": 0.966796875, "step": 174 }, { "epoch": 2.5, "grad_norm": 0.04861399903893471, "learning_rate": 5.9251830934961414e-05, "loss": 0.94189453125, "step": 175 }, { "epoch": 2.5142857142857142, "grad_norm": 0.048787105828523636, "learning_rate": 5.882773361879645e-05, "loss": 0.9267578125, "step": 176 }, { "epoch": 2.5285714285714285, "grad_norm": 0.05140867829322815, "learning_rate": 5.8403293564800564e-05, "loss": 0.9140625, "step": 177 }, { "epoch": 2.5428571428571427, "grad_norm": 0.05104586109519005, "learning_rate": 5.7978548777620303e-05, "loss": 0.8974609375, "step": 178 }, { "epoch": 2.557142857142857, "grad_norm": 0.051857445389032364, "learning_rate": 5.755353728918834e-05, "loss": 0.90966796875, "step": 179 }, { "epoch": 2.571428571428571, "grad_norm": 0.04690718650817871, "learning_rate": 5.712829715531787e-05, "loss": 0.88916015625, "step": 180 }, { "epoch": 2.585714285714286, "grad_norm": 0.05306775122880936, "learning_rate": 5.670286645229518e-05, "loss": 0.9661865234375, "step": 181 }, { "epoch": 2.6, "grad_norm": 0.05184696242213249, "learning_rate": 5.627728327347025e-05, "loss": 0.9296875, "step": 182 }, { "epoch": 2.6142857142857143, "grad_norm": 0.046935904771089554, "learning_rate": 5.5851585725845854e-05, "loss": 0.93896484375, "step": 183 }, { "epoch": 2.6285714285714286, "grad_norm": 0.053297340869903564, "learning_rate": 5.5425811926665426e-05, "loss": 0.84423828125, "step": 184 }, { "epoch": 2.642857142857143, "grad_norm": 0.05101242661476135, "learning_rate": 5.500000000000001e-05, "loss": 0.92041015625, "step": 185 }, { "epoch": 2.657142857142857, "grad_norm": 0.047452762722969055, "learning_rate": 5.457418807333458e-05, "loss": 0.95556640625, "step": 186 }, { "epoch": 2.6714285714285713, "grad_norm": 0.05259615555405617, "learning_rate": 5.4148414274154156e-05, "loss": 0.87646484375, "step": 187 }, { "epoch": 2.685714285714286, "grad_norm": 0.051185209304094315, "learning_rate": 5.3722716726529775e-05, "loss": 0.91455078125, "step": 188 }, { "epoch": 2.7, "grad_norm": 0.05002773553133011, "learning_rate": 5.3297133547704845e-05, "loss": 0.92431640625, "step": 189 }, { "epoch": 2.7142857142857144, "grad_norm": 0.047548212110996246, "learning_rate": 5.2871702844682156e-05, "loss": 0.8603515625, "step": 190 }, { "epoch": 2.7285714285714286, "grad_norm": 0.04842185601592064, "learning_rate": 5.2446462710811675e-05, "loss": 0.90234375, "step": 191 }, { "epoch": 2.742857142857143, "grad_norm": 0.05007163807749748, "learning_rate": 5.20214512223797e-05, "loss": 0.9326171875, "step": 192 }, { "epoch": 2.757142857142857, "grad_norm": 0.04509156197309494, "learning_rate": 5.159670643519946e-05, "loss": 0.752685546875, "step": 193 }, { "epoch": 2.7714285714285714, "grad_norm": 0.04984093829989433, "learning_rate": 5.117226638120356e-05, "loss": 0.7127685546875, "step": 194 }, { "epoch": 2.7857142857142856, "grad_norm": 0.05356363207101822, "learning_rate": 5.0748169065038596e-05, "loss": 0.93603515625, "step": 195 }, { "epoch": 2.8, "grad_norm": 0.049684904515743256, "learning_rate": 5.032445246066223e-05, "loss": 0.9169921875, "step": 196 }, { "epoch": 2.814285714285714, "grad_norm": 0.0515378974378109, "learning_rate": 4.990115450794286e-05, "loss": 0.91943359375, "step": 197 }, { "epoch": 2.8285714285714287, "grad_norm": 0.05335700139403343, "learning_rate": 4.947831310926261e-05, "loss": 0.90869140625, "step": 198 }, { "epoch": 2.842857142857143, "grad_norm": 0.049173396080732346, "learning_rate": 4.905596612612341e-05, "loss": 0.95166015625, "step": 199 }, { "epoch": 2.857142857142857, "grad_norm": 0.05383915826678276, "learning_rate": 4.8634151375756875e-05, "loss": 0.97216796875, "step": 200 }, { "epoch": 2.8714285714285714, "grad_norm": 0.04927995428442955, "learning_rate": 4.821290662773819e-05, "loss": 0.88037109375, "step": 201 }, { "epoch": 2.8857142857142857, "grad_norm": 0.04969802498817444, "learning_rate": 4.779226960060411e-05, "loss": 0.91943359375, "step": 202 }, { "epoch": 2.9, "grad_norm": 0.04692715033888817, "learning_rate": 4.737227795847565e-05, "loss": 0.86865234375, "step": 203 }, { "epoch": 2.914285714285714, "grad_norm": 0.04850691184401512, "learning_rate": 4.695296930768567e-05, "loss": 0.9326171875, "step": 204 }, { "epoch": 2.928571428571429, "grad_norm": 0.04940219596028328, "learning_rate": 4.653438119341149e-05, "loss": 0.90283203125, "step": 205 }, { "epoch": 2.942857142857143, "grad_norm": 0.04640163481235504, "learning_rate": 4.6116551096313085e-05, "loss": 0.90625, "step": 206 }, { "epoch": 2.9571428571428573, "grad_norm": 0.05001261085271835, "learning_rate": 4.5699516429177116e-05, "loss": 0.90673828125, "step": 207 }, { "epoch": 2.9714285714285715, "grad_norm": 0.04668058827519417, "learning_rate": 4.528331453356689e-05, "loss": 0.93115234375, "step": 208 }, { "epoch": 2.9857142857142858, "grad_norm": 0.04703083634376526, "learning_rate": 4.486798267647877e-05, "loss": 0.95068359375, "step": 209 }, { "epoch": 3.0, "grad_norm": 0.049874696880578995, "learning_rate": 4.445355804700533e-05, "loss": 0.93505859375, "step": 210 }, { "epoch": 3.0, "eval_loss": 0.876953125, "eval_runtime": 2.2107, "eval_samples_per_second": 2.714, "eval_steps_per_second": 0.452, "step": 210 }, { "epoch": 3.0142857142857142, "grad_norm": 0.04854424297809601, "learning_rate": 4.4040077753005374e-05, "loss": 0.953125, "step": 211 }, { "epoch": 3.0285714285714285, "grad_norm": 0.049803610891103745, "learning_rate": 4.362757881778121e-05, "loss": 0.97314453125, "step": 212 }, { "epoch": 3.0428571428571427, "grad_norm": 0.05409076437354088, "learning_rate": 4.3216098176763696e-05, "loss": 0.966796875, "step": 213 }, { "epoch": 3.057142857142857, "grad_norm": 0.0482853464782238, "learning_rate": 4.2805672674204933e-05, "loss": 0.81683349609375, "step": 214 }, { "epoch": 3.0714285714285716, "grad_norm": 0.048197198659181595, "learning_rate": 4.2396339059879184e-05, "loss": 0.92333984375, "step": 215 }, { "epoch": 3.085714285714286, "grad_norm": 0.05081643909215927, "learning_rate": 4.1988133985792356e-05, "loss": 0.91162109375, "step": 216 }, { "epoch": 3.1, "grad_norm": 0.05412709712982178, "learning_rate": 4.158109400290007e-05, "loss": 0.89990234375, "step": 217 }, { "epoch": 3.1142857142857143, "grad_norm": 0.046897511929273605, "learning_rate": 4.117525555783489e-05, "loss": 0.92724609375, "step": 218 }, { "epoch": 3.1285714285714286, "grad_norm": 0.0496889092028141, "learning_rate": 4.077065498964292e-05, "loss": 0.8310546875, "step": 219 }, { "epoch": 3.142857142857143, "grad_norm": 0.05350854992866516, "learning_rate": 4.036732852652994e-05, "loss": 0.7672271728515625, "step": 220 }, { "epoch": 3.157142857142857, "grad_norm": 0.05670761317014694, "learning_rate": 3.9965312282617464e-05, "loss": 0.87841796875, "step": 221 }, { "epoch": 3.1714285714285713, "grad_norm": 0.041794054210186005, "learning_rate": 3.956464225470914e-05, "loss": 0.7783203125, "step": 222 }, { "epoch": 3.185714285714286, "grad_norm": 0.0495549812912941, "learning_rate": 3.9165354319067516e-05, "loss": 0.927734375, "step": 223 }, { "epoch": 3.2, "grad_norm": 0.05281737074255943, "learning_rate": 3.876748422820168e-05, "loss": 0.88720703125, "step": 224 }, { "epoch": 3.2142857142857144, "grad_norm": 0.0501176193356514, "learning_rate": 3.837106760766594e-05, "loss": 0.8701171875, "step": 225 }, { "epoch": 3.2285714285714286, "grad_norm": 0.051232192665338516, "learning_rate": 3.797613995286993e-05, "loss": 0.9892578125, "step": 226 }, { "epoch": 3.242857142857143, "grad_norm": 0.05132833123207092, "learning_rate": 3.7582736625900224e-05, "loss": 0.8447265625, "step": 227 }, { "epoch": 3.257142857142857, "grad_norm": 0.05618225038051605, "learning_rate": 3.719089285235417e-05, "loss": 0.88134765625, "step": 228 }, { "epoch": 3.2714285714285714, "grad_norm": 0.0628756508231163, "learning_rate": 3.680064371818555e-05, "loss": 0.8896484375, "step": 229 }, { "epoch": 3.2857142857142856, "grad_norm": 0.056082308292388916, "learning_rate": 3.641202416656311e-05, "loss": 0.89404296875, "step": 230 }, { "epoch": 3.3, "grad_norm": 0.05168178305029869, "learning_rate": 3.602506899474173e-05, "loss": 0.95556640625, "step": 231 }, { "epoch": 3.314285714285714, "grad_norm": 0.051914263516664505, "learning_rate": 3.563981285094654e-05, "loss": 0.85400390625, "step": 232 }, { "epoch": 3.3285714285714287, "grad_norm": 0.051675330847501755, "learning_rate": 3.525629023127057e-05, "loss": 0.91552734375, "step": 233 }, { "epoch": 3.342857142857143, "grad_norm": 0.048695966601371765, "learning_rate": 3.487453547658601e-05, "loss": 0.875, "step": 234 }, { "epoch": 3.357142857142857, "grad_norm": 0.05254810303449631, "learning_rate": 3.449458276946914e-05, "loss": 0.80712890625, "step": 235 }, { "epoch": 3.3714285714285714, "grad_norm": 0.052136149257421494, "learning_rate": 3.411646613113976e-05, "loss": 0.9140625, "step": 236 }, { "epoch": 3.3857142857142857, "grad_norm": 0.05295842885971069, "learning_rate": 3.374021941841482e-05, "loss": 0.89111328125, "step": 237 }, { "epoch": 3.4, "grad_norm": 0.053937479853630066, "learning_rate": 3.336587632067686e-05, "loss": 0.8779296875, "step": 238 }, { "epoch": 3.414285714285714, "grad_norm": 0.0523514524102211, "learning_rate": 3.299347035685751e-05, "loss": 0.90673828125, "step": 239 }, { "epoch": 3.4285714285714284, "grad_norm": 0.05106062814593315, "learning_rate": 3.2623034872436084e-05, "loss": 0.9013671875, "step": 240 }, { "epoch": 3.442857142857143, "grad_norm": 0.054687730967998505, "learning_rate": 3.225460303645388e-05, "loss": 0.857421875, "step": 241 }, { "epoch": 3.4571428571428573, "grad_norm": 0.053257834166288376, "learning_rate": 3.188820783854413e-05, "loss": 0.8837890625, "step": 242 }, { "epoch": 3.4714285714285715, "grad_norm": 0.04854962229728699, "learning_rate": 3.1523882085978204e-05, "loss": 0.8935546875, "step": 243 }, { "epoch": 3.4857142857142858, "grad_norm": 0.0504307858645916, "learning_rate": 3.116165840072789e-05, "loss": 0.9423828125, "step": 244 }, { "epoch": 3.5, "grad_norm": 0.05123041197657585, "learning_rate": 3.0801569216544456e-05, "loss": 0.91650390625, "step": 245 }, { "epoch": 3.5142857142857142, "grad_norm": 0.050109054893255234, "learning_rate": 3.0443646776054602e-05, "loss": 0.90234375, "step": 246 }, { "epoch": 3.5285714285714285, "grad_norm": 0.0505213625729084, "learning_rate": 3.0087923127873196e-05, "loss": 0.88916015625, "step": 247 }, { "epoch": 3.5428571428571427, "grad_norm": 0.04955083131790161, "learning_rate": 2.9734430123733936e-05, "loss": 0.87353515625, "step": 248 }, { "epoch": 3.557142857142857, "grad_norm": 0.050369661301374435, "learning_rate": 2.9383199415637042e-05, "loss": 0.8837890625, "step": 249 }, { "epoch": 3.571428571428571, "grad_norm": 0.055560868233442307, "learning_rate": 2.903426245301526e-05, "loss": 0.86474609375, "step": 250 }, { "epoch": 3.585714285714286, "grad_norm": 0.054119765758514404, "learning_rate": 2.8687650479917883e-05, "loss": 0.941162109375, "step": 251 }, { "epoch": 3.6, "grad_norm": 0.049803949892520905, "learning_rate": 2.8343394532213017e-05, "loss": 0.90380859375, "step": 252 }, { "epoch": 3.6142857142857143, "grad_norm": 0.05511877313256264, "learning_rate": 2.8001525434808705e-05, "loss": 0.9169921875, "step": 253 }, { "epoch": 3.6285714285714286, "grad_norm": 0.0531773567199707, "learning_rate": 2.7662073798892806e-05, "loss": 0.8193359375, "step": 254 }, { "epoch": 3.642857142857143, "grad_norm": 0.053087010979652405, "learning_rate": 2.732507001919209e-05, "loss": 0.8994140625, "step": 255 }, { "epoch": 3.657142857142857, "grad_norm": 0.051729291677474976, "learning_rate": 2.6990544271250608e-05, "loss": 0.93310546875, "step": 256 }, { "epoch": 3.6714285714285713, "grad_norm": 0.049172382801771164, "learning_rate": 2.665852650872779e-05, "loss": 0.85498046875, "step": 257 }, { "epoch": 3.685714285714286, "grad_norm": 0.051789790391922, "learning_rate": 2.6329046460716423e-05, "loss": 0.89404296875, "step": 258 }, { "epoch": 3.7, "grad_norm": 0.052890848368406296, "learning_rate": 2.6002133629080538e-05, "loss": 0.904296875, "step": 259 }, { "epoch": 3.7142857142857144, "grad_norm": 0.04675760492682457, "learning_rate": 2.5677817285813992e-05, "loss": 0.83984375, "step": 260 }, { "epoch": 3.7285714285714286, "grad_norm": 0.052761152386665344, "learning_rate": 2.535612647041929e-05, "loss": 0.8828125, "step": 261 }, { "epoch": 3.742857142857143, "grad_norm": 0.05000728741288185, "learning_rate": 2.5037089987307405e-05, "loss": 0.91162109375, "step": 262 }, { "epoch": 3.757142857142857, "grad_norm": 0.04449896141886711, "learning_rate": 2.4720736403218654e-05, "loss": 0.737060546875, "step": 263 }, { "epoch": 3.7714285714285714, "grad_norm": 0.04890809580683708, "learning_rate": 2.4407094044664748e-05, "loss": 0.6920166015625, "step": 264 }, { "epoch": 3.7857142857142856, "grad_norm": 0.04929943382740021, "learning_rate": 2.4096190995392466e-05, "loss": 0.916015625, "step": 265 }, { "epoch": 3.8, "grad_norm": 0.04906542971730232, "learning_rate": 2.3788055093868964e-05, "loss": 0.8955078125, "step": 266 }, { "epoch": 3.814285714285714, "grad_norm": 0.05111577361822128, "learning_rate": 2.3482713930789225e-05, "loss": 0.900390625, "step": 267 }, { "epoch": 3.8285714285714287, "grad_norm": 0.048875000327825546, "learning_rate": 2.3180194846605367e-05, "loss": 0.888671875, "step": 268 }, { "epoch": 3.842857142857143, "grad_norm": 0.049121737480163574, "learning_rate": 2.2880524929078745e-05, "loss": 0.92919921875, "step": 269 }, { "epoch": 3.857142857142857, "grad_norm": 0.04929174482822418, "learning_rate": 2.2583731010854436e-05, "loss": 0.9521484375, "step": 270 }, { "epoch": 3.8714285714285714, "grad_norm": 0.04900052025914192, "learning_rate": 2.2289839667058532e-05, "loss": 0.85986328125, "step": 271 }, { "epoch": 3.8857142857142857, "grad_norm": 0.0492103286087513, "learning_rate": 2.199887721291877e-05, "loss": 0.8994140625, "step": 272 }, { "epoch": 3.9, "grad_norm": 0.04784834012389183, "learning_rate": 2.1710869701408073e-05, "loss": 0.8486328125, "step": 273 }, { "epoch": 3.914285714285714, "grad_norm": 0.049870528280735016, "learning_rate": 2.1425842920911848e-05, "loss": 0.91357421875, "step": 274 }, { "epoch": 3.928571428571429, "grad_norm": 0.050932083278894424, "learning_rate": 2.1143822392918844e-05, "loss": 0.88330078125, "step": 275 }, { "epoch": 3.942857142857143, "grad_norm": 0.04739019647240639, "learning_rate": 2.0864833369735974e-05, "loss": 0.88720703125, "step": 276 }, { "epoch": 3.9571428571428573, "grad_norm": 0.048358820378780365, "learning_rate": 2.058890083222715e-05, "loss": 0.8876953125, "step": 277 }, { "epoch": 3.9714285714285715, "grad_norm": 0.04822513833642006, "learning_rate": 2.0316049487576505e-05, "loss": 0.91552734375, "step": 278 }, { "epoch": 3.9857142857142858, "grad_norm": 0.05123396962881088, "learning_rate": 2.004630376707616e-05, "loss": 0.92919921875, "step": 279 }, { "epoch": 4.0, "grad_norm": 0.0550776869058609, "learning_rate": 1.977968782393848e-05, "loss": 0.90869140625, "step": 280 }, { "epoch": 4.0, "eval_loss": 0.87109375, "eval_runtime": 2.2051, "eval_samples_per_second": 2.721, "eval_steps_per_second": 0.453, "step": 280 }, { "epoch": 4.014285714285714, "grad_norm": 0.05216512829065323, "learning_rate": 1.951622553113354e-05, "loss": 0.927734375, "step": 281 }, { "epoch": 4.0285714285714285, "grad_norm": 0.05291033536195755, "learning_rate": 1.9255940479251434e-05, "loss": 0.955078125, "step": 282 }, { "epoch": 4.042857142857143, "grad_norm": 0.05907987058162689, "learning_rate": 1.899885597438995e-05, "loss": 0.94873046875, "step": 283 }, { "epoch": 4.057142857142857, "grad_norm": 0.05320875719189644, "learning_rate": 1.87449950360678e-05, "loss": 0.8026275634765625, "step": 284 }, { "epoch": 4.071428571428571, "grad_norm": 0.050279874354600906, "learning_rate": 1.8494380395163352e-05, "loss": 0.904296875, "step": 285 }, { "epoch": 4.085714285714285, "grad_norm": 0.05075318366289139, "learning_rate": 1.8247034491879344e-05, "loss": 0.8955078125, "step": 286 }, { "epoch": 4.1, "grad_norm": 0.05274856835603714, "learning_rate": 1.800297947373355e-05, "loss": 0.8828125, "step": 287 }, { "epoch": 4.114285714285714, "grad_norm": 0.05150414630770683, "learning_rate": 1.7762237193575708e-05, "loss": 0.9111328125, "step": 288 }, { "epoch": 4.128571428571428, "grad_norm": 0.05325537174940109, "learning_rate": 1.7524829207630762e-05, "loss": 0.81640625, "step": 289 }, { "epoch": 4.142857142857143, "grad_norm": 0.0480109266936779, "learning_rate": 1.72907767735687e-05, "loss": 0.7505950927734375, "step": 290 }, { "epoch": 4.1571428571428575, "grad_norm": 0.05344746261835098, "learning_rate": 1.706010084860121e-05, "loss": 0.86474609375, "step": 291 }, { "epoch": 4.171428571428572, "grad_norm": 0.04495096951723099, "learning_rate": 1.683282208760501e-05, "loss": 0.765625, "step": 292 }, { "epoch": 4.185714285714286, "grad_norm": 0.055278196930885315, "learning_rate": 1.6608960841272554e-05, "loss": 0.91015625, "step": 293 }, { "epoch": 4.2, "grad_norm": 0.051233768463134766, "learning_rate": 1.6388537154289706e-05, "loss": 0.87109375, "step": 294 }, { "epoch": 4.214285714285714, "grad_norm": 0.050882738083601, "learning_rate": 1.617157076354097e-05, "loss": 0.8564453125, "step": 295 }, { "epoch": 4.228571428571429, "grad_norm": 0.05535581707954407, "learning_rate": 1.5958081096342256e-05, "loss": 0.9716796875, "step": 296 }, { "epoch": 4.242857142857143, "grad_norm": 0.05219915881752968, "learning_rate": 1.5748087268701284e-05, "loss": 0.82763671875, "step": 297 }, { "epoch": 4.257142857142857, "grad_norm": 0.04867938905954361, "learning_rate": 1.554160808360598e-05, "loss": 0.86669921875, "step": 298 }, { "epoch": 4.271428571428571, "grad_norm": 0.052604760974645615, "learning_rate": 1.5338662029340803e-05, "loss": 0.87255859375, "step": 299 }, { "epoch": 4.285714285714286, "grad_norm": 0.05216054245829582, "learning_rate": 1.5139267277831347e-05, "loss": 0.87744140625, "step": 300 }, { "epoch": 4.3, "grad_norm": 0.0504562072455883, "learning_rate": 1.4943441683017157e-05, "loss": 0.943359375, "step": 301 }, { "epoch": 4.314285714285714, "grad_norm": 0.048031508922576904, "learning_rate": 1.4751202779253084e-05, "loss": 0.841796875, "step": 302 }, { "epoch": 4.328571428571428, "grad_norm": 0.05019447207450867, "learning_rate": 1.4562567779739312e-05, "loss": 0.9013671875, "step": 303 }, { "epoch": 4.3428571428571425, "grad_norm": 0.04919208586215973, "learning_rate": 1.4377553574979947e-05, "loss": 0.86328125, "step": 304 }, { "epoch": 4.357142857142857, "grad_norm": 0.0508447140455246, "learning_rate": 1.4196176731270785e-05, "loss": 0.79052734375, "step": 305 }, { "epoch": 4.371428571428572, "grad_norm": 0.05003906786441803, "learning_rate": 1.4018453489215835e-05, "loss": 0.90087890625, "step": 306 }, { "epoch": 4.385714285714286, "grad_norm": 0.0615018755197525, "learning_rate": 1.3844399762273175e-05, "loss": 0.876953125, "step": 307 }, { "epoch": 4.4, "grad_norm": 0.05253160372376442, "learning_rate": 1.3674031135330054e-05, "loss": 0.86376953125, "step": 308 }, { "epoch": 4.414285714285715, "grad_norm": 0.0486416257917881, "learning_rate": 1.3507362863307391e-05, "loss": 0.89453125, "step": 309 }, { "epoch": 4.428571428571429, "grad_norm": 0.0522824265062809, "learning_rate": 1.3344409869793851e-05, "loss": 0.88671875, "step": 310 }, { "epoch": 4.442857142857143, "grad_norm": 0.055019911378622055, "learning_rate": 1.318518674570957e-05, "loss": 0.84228515625, "step": 311 }, { "epoch": 4.457142857142857, "grad_norm": 0.053540315479040146, "learning_rate": 1.302970774799968e-05, "loss": 0.87109375, "step": 312 }, { "epoch": 4.4714285714285715, "grad_norm": 0.049618784338235855, "learning_rate": 1.2877986798357727e-05, "loss": 0.88037109375, "step": 313 }, { "epoch": 4.485714285714286, "grad_norm": 0.04931506887078285, "learning_rate": 1.2730037481979131e-05, "loss": 0.927734375, "step": 314 }, { "epoch": 4.5, "grad_norm": 0.050537627190351486, "learning_rate": 1.2585873046344732e-05, "loss": 0.904296875, "step": 315 }, { "epoch": 4.514285714285714, "grad_norm": 0.05481034889817238, "learning_rate": 1.2445506400034607e-05, "loss": 0.88916015625, "step": 316 }, { "epoch": 4.5285714285714285, "grad_norm": 0.05597779527306557, "learning_rate": 1.2308950111572266e-05, "loss": 0.87841796875, "step": 317 }, { "epoch": 4.542857142857143, "grad_norm": 0.05157225951552391, "learning_rate": 1.2176216408299179e-05, "loss": 0.86083984375, "step": 318 }, { "epoch": 4.557142857142857, "grad_norm": 0.04958087578415871, "learning_rate": 1.2047317175280021e-05, "loss": 0.8701171875, "step": 319 }, { "epoch": 4.571428571428571, "grad_norm": 0.053986869752407074, "learning_rate": 1.1922263954238409e-05, "loss": 0.85400390625, "step": 320 }, { "epoch": 4.585714285714285, "grad_norm": 0.0558587945997715, "learning_rate": 1.1801067942523477e-05, "loss": 0.9287109375, "step": 321 }, { "epoch": 4.6, "grad_norm": 0.05723806843161583, "learning_rate": 1.1683739992107266e-05, "loss": 0.89111328125, "step": 322 }, { "epoch": 4.614285714285714, "grad_norm": 0.04987065866589546, "learning_rate": 1.1570290608613003e-05, "loss": 0.90625, "step": 323 }, { "epoch": 4.628571428571428, "grad_norm": 0.051388390362262726, "learning_rate": 1.1460729950374444e-05, "loss": 0.806640625, "step": 324 }, { "epoch": 4.642857142857143, "grad_norm": 0.050233837217092514, "learning_rate": 1.1355067827526275e-05, "loss": 0.88916015625, "step": 325 }, { "epoch": 4.6571428571428575, "grad_norm": 0.049414992332458496, "learning_rate": 1.1253313701125727e-05, "loss": 0.9228515625, "step": 326 }, { "epoch": 4.671428571428572, "grad_norm": 0.04873225465416908, "learning_rate": 1.1155476682305401e-05, "loss": 0.84423828125, "step": 327 }, { "epoch": 4.685714285714286, "grad_norm": 0.04912515729665756, "learning_rate": 1.1061565531457457e-05, "loss": 0.88232421875, "step": 328 }, { "epoch": 4.7, "grad_norm": 0.049595706164836884, "learning_rate": 1.0971588657449234e-05, "loss": 0.89306640625, "step": 329 }, { "epoch": 4.714285714285714, "grad_norm": 0.04815579950809479, "learning_rate": 1.0885554116870247e-05, "loss": 0.830078125, "step": 330 }, { "epoch": 4.728571428571429, "grad_norm": 0.04959326609969139, "learning_rate": 1.0803469613310885e-05, "loss": 0.87158203125, "step": 331 }, { "epoch": 4.742857142857143, "grad_norm": 0.05295655131340027, "learning_rate": 1.0725342496672538e-05, "loss": 0.900390625, "step": 332 }, { "epoch": 4.757142857142857, "grad_norm": 0.04444817081093788, "learning_rate": 1.0651179762509537e-05, "loss": 0.7275390625, "step": 333 }, { "epoch": 4.771428571428571, "grad_norm": 0.04879536107182503, "learning_rate": 1.0580988051402763e-05, "loss": 0.68359375, "step": 334 }, { "epoch": 4.785714285714286, "grad_norm": 0.05020657181739807, "learning_rate": 1.0514773648365018e-05, "loss": 0.908203125, "step": 335 }, { "epoch": 4.8, "grad_norm": 0.050407882779836655, "learning_rate": 1.0452542482278278e-05, "loss": 0.88623046875, "step": 336 }, { "epoch": 4.814285714285714, "grad_norm": 0.04872056096792221, "learning_rate": 1.039430012536282e-05, "loss": 0.88916015625, "step": 337 }, { "epoch": 4.828571428571428, "grad_norm": 0.05090424790978432, "learning_rate": 1.0340051792678276e-05, "loss": 0.87890625, "step": 338 }, { "epoch": 4.8428571428571425, "grad_norm": 0.05038944259285927, "learning_rate": 1.0289802341656678e-05, "loss": 0.92138671875, "step": 339 }, { "epoch": 4.857142857142857, "grad_norm": 0.05104154720902443, "learning_rate": 1.0243556271667513e-05, "loss": 0.94140625, "step": 340 }, { "epoch": 4.871428571428572, "grad_norm": 0.05096552520990372, "learning_rate": 1.0201317723614851e-05, "loss": 0.8505859375, "step": 341 }, { "epoch": 4.885714285714286, "grad_norm": 0.051582347601652145, "learning_rate": 1.0163090479566553e-05, "loss": 0.8916015625, "step": 342 }, { "epoch": 4.9, "grad_norm": 0.05110916122794151, "learning_rate": 1.012887796241566e-05, "loss": 0.84033203125, "step": 343 }, { "epoch": 4.914285714285715, "grad_norm": 0.051592547446489334, "learning_rate": 1.0098683235573854e-05, "loss": 0.90380859375, "step": 344 }, { "epoch": 4.928571428571429, "grad_norm": 0.052361734211444855, "learning_rate": 1.0072509002697195e-05, "loss": 0.8759765625, "step": 345 }, { "epoch": 4.942857142857143, "grad_norm": 0.04869278147816658, "learning_rate": 1.0050357607444017e-05, "loss": 0.87939453125, "step": 346 }, { "epoch": 4.957142857142857, "grad_norm": 0.04847113788127899, "learning_rate": 1.0032231033265086e-05, "loss": 0.8798828125, "step": 347 }, { "epoch": 4.9714285714285715, "grad_norm": 0.049888331443071365, "learning_rate": 1.0018130903225987e-05, "loss": 0.90673828125, "step": 348 }, { "epoch": 4.985714285714286, "grad_norm": 0.05218585208058357, "learning_rate": 1.0008058479861802e-05, "loss": 0.923828125, "step": 349 }, { "epoch": 5.0, "grad_norm": 0.05943594127893448, "learning_rate": 1.0002014665064068e-05, "loss": 0.89599609375, "step": 350 }, { "epoch": 5.0, "eval_loss": 0.869140625, "eval_runtime": 2.2185, "eval_samples_per_second": 2.705, "eval_steps_per_second": 0.451, "step": 350 } ], "logging_steps": 1.0, "max_steps": 350, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 0, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2.562900871360807e+19, "train_batch_size": 1, "trial_name": null, "trial_params": null }