{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.9997336884154461, "eval_steps": 500, "global_step": 1877, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0005326231691078562, "grad_norm": 0.1129828691482544, "learning_rate": 1.0638297872340427e-06, "loss": 0.3516, "mean_token_accuracy": 0.9021367430686951, "step": 1 }, { "epoch": 0.002663115845539281, "grad_norm": 0.07912027090787888, "learning_rate": 5.319148936170213e-06, "loss": 0.2398, "mean_token_accuracy": 0.9323107227683067, "step": 5 }, { "epoch": 0.005326231691078562, "grad_norm": 0.07962298393249512, "learning_rate": 1.0638297872340426e-05, "loss": 0.2164, "mean_token_accuracy": 0.9409767866134644, "step": 10 }, { "epoch": 0.007989347536617843, "grad_norm": 0.07320517301559448, "learning_rate": 1.595744680851064e-05, "loss": 0.2285, "mean_token_accuracy": 0.9375457763671875, "step": 15 }, { "epoch": 0.010652463382157125, "grad_norm": 0.08164672553539276, "learning_rate": 2.1276595744680852e-05, "loss": 0.2276, "mean_token_accuracy": 0.9369352698326111, "step": 20 }, { "epoch": 0.013315579227696404, "grad_norm": 0.08709942549467087, "learning_rate": 2.6595744680851064e-05, "loss": 0.281, "mean_token_accuracy": 0.9194993853569031, "step": 25 }, { "epoch": 0.015978695073235686, "grad_norm": 0.10631067305803299, "learning_rate": 3.191489361702128e-05, "loss": 0.2564, "mean_token_accuracy": 0.9267643451690674, "step": 30 }, { "epoch": 0.018641810918774968, "grad_norm": 0.07647579163312912, "learning_rate": 3.723404255319149e-05, "loss": 0.2082, "mean_token_accuracy": 0.9413186728954315, "step": 35 }, { "epoch": 0.02130492676431425, "grad_norm": 0.07922424376010895, "learning_rate": 4.2553191489361704e-05, "loss": 0.2191, "mean_token_accuracy": 0.9362881481647491, "step": 40 }, { "epoch": 0.023968042609853527, "grad_norm": 0.0923653244972229, "learning_rate": 4.787234042553192e-05, "loss": 0.2286, "mean_token_accuracy": 0.9335653126239777, "step": 45 }, { "epoch": 0.02663115845539281, "grad_norm": 0.07971777766942978, "learning_rate": 5.319148936170213e-05, "loss": 0.1888, "mean_token_accuracy": 0.9448961973190307, "step": 50 }, { "epoch": 0.02929427430093209, "grad_norm": 0.09142950922250748, "learning_rate": 5.851063829787234e-05, "loss": 0.1384, "mean_token_accuracy": 0.9579731285572052, "step": 55 }, { "epoch": 0.03195739014647137, "grad_norm": 0.13386933505535126, "learning_rate": 6.382978723404256e-05, "loss": 0.147, "mean_token_accuracy": 0.95494504570961, "step": 60 }, { "epoch": 0.03462050599201065, "grad_norm": 0.12172385305166245, "learning_rate": 6.914893617021277e-05, "loss": 0.1365, "mean_token_accuracy": 0.9542857050895691, "step": 65 }, { "epoch": 0.037283621837549935, "grad_norm": 0.08828116208314896, "learning_rate": 7.446808510638298e-05, "loss": 0.1243, "mean_token_accuracy": 0.9553601861000061, "step": 70 }, { "epoch": 0.03994673768308921, "grad_norm": 0.08476319909095764, "learning_rate": 7.978723404255319e-05, "loss": 0.0951, "mean_token_accuracy": 0.9662515103816987, "step": 75 }, { "epoch": 0.0426098535286285, "grad_norm": 0.11043168604373932, "learning_rate": 8.510638297872341e-05, "loss": 0.1085, "mean_token_accuracy": 0.9597313702106476, "step": 80 }, { "epoch": 0.045272969374167776, "grad_norm": 0.08523018658161163, "learning_rate": 9.042553191489363e-05, "loss": 0.0903, "mean_token_accuracy": 0.965738695859909, "step": 85 }, { "epoch": 0.047936085219707054, "grad_norm": 0.09243249148130417, "learning_rate": 9.574468085106384e-05, "loss": 0.0881, "mean_token_accuracy": 0.9664346635341644, "step": 90 }, { "epoch": 0.05059920106524634, "grad_norm": 0.12321251630783081, "learning_rate": 0.00010106382978723406, "loss": 0.0976, "mean_token_accuracy": 0.9625030398368836, "step": 95 }, { "epoch": 0.05326231691078562, "grad_norm": 0.08379948139190674, "learning_rate": 0.00010638297872340425, "loss": 0.0707, "mean_token_accuracy": 0.9735897183418274, "step": 100 }, { "epoch": 0.0559254327563249, "grad_norm": 0.10740843415260315, "learning_rate": 0.00011170212765957446, "loss": 0.0822, "mean_token_accuracy": 0.9676556766033173, "step": 105 }, { "epoch": 0.05858854860186418, "grad_norm": 0.12101828306913376, "learning_rate": 0.00011702127659574468, "loss": 0.0816, "mean_token_accuracy": 0.9684371054172516, "step": 110 }, { "epoch": 0.06125166444740346, "grad_norm": 0.08741698414087296, "learning_rate": 0.0001223404255319149, "loss": 0.0633, "mean_token_accuracy": 0.9756288051605224, "step": 115 }, { "epoch": 0.06391478029294274, "grad_norm": 0.08274981379508972, "learning_rate": 0.00012765957446808513, "loss": 0.0763, "mean_token_accuracy": 0.970195347070694, "step": 120 }, { "epoch": 0.06657789613848203, "grad_norm": 0.06632668524980545, "learning_rate": 0.00013297872340425532, "loss": 0.0744, "mean_token_accuracy": 0.970732593536377, "step": 125 }, { "epoch": 0.0692410119840213, "grad_norm": 0.08805403858423233, "learning_rate": 0.00013829787234042554, "loss": 0.0949, "mean_token_accuracy": 0.9624908268451691, "step": 130 }, { "epoch": 0.07190412782956059, "grad_norm": 0.11924618482589722, "learning_rate": 0.00014361702127659576, "loss": 0.0682, "mean_token_accuracy": 0.9732844889163971, "step": 135 }, { "epoch": 0.07456724367509987, "grad_norm": 0.07259126007556915, "learning_rate": 0.00014893617021276596, "loss": 0.0644, "mean_token_accuracy": 0.9742368638515473, "step": 140 }, { "epoch": 0.07723035952063914, "grad_norm": 0.07263950258493423, "learning_rate": 0.00015425531914893618, "loss": 0.0723, "mean_token_accuracy": 0.9711477279663085, "step": 145 }, { "epoch": 0.07989347536617843, "grad_norm": 0.06513981521129608, "learning_rate": 0.00015957446808510637, "loss": 0.0671, "mean_token_accuracy": 0.9740170657634735, "step": 150 }, { "epoch": 0.08255659121171771, "grad_norm": 0.07975617796182632, "learning_rate": 0.00016489361702127662, "loss": 0.0653, "mean_token_accuracy": 0.9741758108139038, "step": 155 }, { "epoch": 0.085219707057257, "grad_norm": 0.08921811729669571, "learning_rate": 0.00017021276595744682, "loss": 0.0695, "mean_token_accuracy": 0.9725274622440339, "step": 160 }, { "epoch": 0.08788282290279627, "grad_norm": 0.06332514435052872, "learning_rate": 0.000175531914893617, "loss": 0.0575, "mean_token_accuracy": 0.9770817935466767, "step": 165 }, { "epoch": 0.09054593874833555, "grad_norm": 0.07502198964357376, "learning_rate": 0.00018085106382978726, "loss": 0.0725, "mean_token_accuracy": 0.9708791077136993, "step": 170 }, { "epoch": 0.09320905459387484, "grad_norm": 0.07119857519865036, "learning_rate": 0.00018617021276595746, "loss": 0.0684, "mean_token_accuracy": 0.9726861894130707, "step": 175 }, { "epoch": 0.09587217043941411, "grad_norm": 0.09054753929376602, "learning_rate": 0.00019148936170212768, "loss": 0.0629, "mean_token_accuracy": 0.974456650018692, "step": 180 }, { "epoch": 0.0985352862849534, "grad_norm": 0.07469576597213745, "learning_rate": 0.00019680851063829787, "loss": 0.0564, "mean_token_accuracy": 0.9774236798286438, "step": 185 }, { "epoch": 0.10119840213049268, "grad_norm": 0.06831200420856476, "learning_rate": 0.00019999930805760402, "loss": 0.0707, "mean_token_accuracy": 0.971208781003952, "step": 190 }, { "epoch": 0.10386151797603196, "grad_norm": 0.07172739505767822, "learning_rate": 0.00019999152381561955, "loss": 0.0547, "mean_token_accuracy": 0.9777655482292176, "step": 195 }, { "epoch": 0.10652463382157124, "grad_norm": 0.06316208839416504, "learning_rate": 0.0001999750910791767, "loss": 0.0601, "mean_token_accuracy": 0.9758241593837738, "step": 200 }, { "epoch": 0.10918774966711052, "grad_norm": 0.04626832157373428, "learning_rate": 0.00019995001126958025, "loss": 0.0466, "mean_token_accuracy": 0.9811965644359588, "step": 205 }, { "epoch": 0.1118508655126498, "grad_norm": 0.04393989220261574, "learning_rate": 0.00019991628655604003, "loss": 0.0486, "mean_token_accuracy": 0.9803174376487732, "step": 210 }, { "epoch": 0.11451398135818908, "grad_norm": 0.08774279803037643, "learning_rate": 0.00019987391985548328, "loss": 0.0476, "mean_token_accuracy": 0.981037837266922, "step": 215 }, { "epoch": 0.11717709720372836, "grad_norm": 0.07935914397239685, "learning_rate": 0.0001998229148323023, "loss": 0.0519, "mean_token_accuracy": 0.9785714149475098, "step": 220 }, { "epoch": 0.11984021304926765, "grad_norm": 0.07536792755126953, "learning_rate": 0.00019976327589803767, "loss": 0.0524, "mean_token_accuracy": 0.978253960609436, "step": 225 }, { "epoch": 0.12250332889480692, "grad_norm": 0.06311788409948349, "learning_rate": 0.0001996950082109965, "loss": 0.0641, "mean_token_accuracy": 0.9737606823444367, "step": 230 }, { "epoch": 0.12516644474034622, "grad_norm": 0.05745382234454155, "learning_rate": 0.00019961811767580648, "loss": 0.0556, "mean_token_accuracy": 0.9775213539600373, "step": 235 }, { "epoch": 0.1278295605858855, "grad_norm": 0.0590946190059185, "learning_rate": 0.0001995326109429049, "loss": 0.0601, "mean_token_accuracy": 0.9754822731018067, "step": 240 }, { "epoch": 0.13049267643142476, "grad_norm": 0.07194741815328598, "learning_rate": 0.00019943849540796375, "loss": 0.0538, "mean_token_accuracy": 0.978327214717865, "step": 245 }, { "epoch": 0.13315579227696406, "grad_norm": 0.07567504793405533, "learning_rate": 0.0001993357792112498, "loss": 0.0614, "mean_token_accuracy": 0.974957263469696, "step": 250 }, { "epoch": 0.13581890812250333, "grad_norm": 0.054747238755226135, "learning_rate": 0.0001992244712369207, "loss": 0.0479, "mean_token_accuracy": 0.9809889972209931, "step": 255 }, { "epoch": 0.1384820239680426, "grad_norm": 0.07008703052997589, "learning_rate": 0.00019910458111225646, "loss": 0.053, "mean_token_accuracy": 0.978302800655365, "step": 260 }, { "epoch": 0.1411451398135819, "grad_norm": 0.06375347077846527, "learning_rate": 0.00019897611920682677, "loss": 0.0677, "mean_token_accuracy": 0.9719413816928864, "step": 265 }, { "epoch": 0.14380825565912117, "grad_norm": 0.06617304682731628, "learning_rate": 0.00019883909663159424, "loss": 0.0534, "mean_token_accuracy": 0.9783882677555085, "step": 270 }, { "epoch": 0.14647137150466044, "grad_norm": 0.06903678178787231, "learning_rate": 0.0001986935252379532, "loss": 0.0553, "mean_token_accuracy": 0.9774358928203583, "step": 275 }, { "epoch": 0.14913448735019974, "grad_norm": 0.05433755740523338, "learning_rate": 0.00019853941761670483, "loss": 0.0541, "mean_token_accuracy": 0.9783272087574005, "step": 280 }, { "epoch": 0.151797603195739, "grad_norm": 0.06586781144142151, "learning_rate": 0.00019837678709696798, "loss": 0.041, "mean_token_accuracy": 0.9836629867553711, "step": 285 }, { "epoch": 0.15446071904127828, "grad_norm": 0.07344241440296173, "learning_rate": 0.00019820564774502644, "loss": 0.0699, "mean_token_accuracy": 0.9718070745468139, "step": 290 }, { "epoch": 0.15712383488681758, "grad_norm": 0.06562484800815582, "learning_rate": 0.0001980260143631122, "loss": 0.0503, "mean_token_accuracy": 0.9793650686740876, "step": 295 }, { "epoch": 0.15978695073235685, "grad_norm": 0.05266420543193817, "learning_rate": 0.00019783790248812533, "loss": 0.0524, "mean_token_accuracy": 0.978253960609436, "step": 300 }, { "epoch": 0.16245006657789615, "grad_norm": 0.09536128491163254, "learning_rate": 0.00019764132839029, "loss": 0.0655, "mean_token_accuracy": 0.9735408842563629, "step": 305 }, { "epoch": 0.16511318242343542, "grad_norm": 0.06160730496048927, "learning_rate": 0.00019743630907174725, "loss": 0.0568, "mean_token_accuracy": 0.9770451605319976, "step": 310 }, { "epoch": 0.1677762982689747, "grad_norm": 0.07126890867948532, "learning_rate": 0.0001972228622650846, "loss": 0.0649, "mean_token_accuracy": 0.973968243598938, "step": 315 }, { "epoch": 0.170439414114514, "grad_norm": 0.06424631178379059, "learning_rate": 0.0001970010064318021, "loss": 0.0578, "mean_token_accuracy": 0.9766178131103516, "step": 320 }, { "epoch": 0.17310252996005326, "grad_norm": 0.0797090232372284, "learning_rate": 0.00019677076076071566, "loss": 0.0511, "mean_token_accuracy": 0.9792185425758362, "step": 325 }, { "epoch": 0.17576564580559254, "grad_norm": 0.06460501998662949, "learning_rate": 0.00019653214516629735, "loss": 0.0583, "mean_token_accuracy": 0.976691073179245, "step": 330 }, { "epoch": 0.17842876165113183, "grad_norm": 0.06340578198432922, "learning_rate": 0.00019628518028695307, "loss": 0.0521, "mean_token_accuracy": 0.9784615218639374, "step": 335 }, { "epoch": 0.1810918774966711, "grad_norm": 0.048455528914928436, "learning_rate": 0.00019602988748323717, "loss": 0.0515, "mean_token_accuracy": 0.9792307555675507, "step": 340 }, { "epoch": 0.18375499334221038, "grad_norm": 0.052041687071323395, "learning_rate": 0.00019576628883600535, "loss": 0.0467, "mean_token_accuracy": 0.9806593298912049, "step": 345 }, { "epoch": 0.18641810918774968, "grad_norm": 0.07374859601259232, "learning_rate": 0.00019549440714450444, "loss": 0.0607, "mean_token_accuracy": 0.9754334390163422, "step": 350 }, { "epoch": 0.18908122503328895, "grad_norm": 0.05594540387392044, "learning_rate": 0.00019521426592440072, "loss": 0.066, "mean_token_accuracy": 0.9731135427951813, "step": 355 }, { "epoch": 0.19174434087882822, "grad_norm": 0.0629001334309578, "learning_rate": 0.00019492588940574586, "loss": 0.0555, "mean_token_accuracy": 0.9774358808994293, "step": 360 }, { "epoch": 0.19440745672436752, "grad_norm": 0.05497188866138458, "learning_rate": 0.0001946293025308813, "loss": 0.0481, "mean_token_accuracy": 0.9801220834255219, "step": 365 }, { "epoch": 0.1970705725699068, "grad_norm": 0.06228744983673096, "learning_rate": 0.00019432453095228076, "loss": 0.0663, "mean_token_accuracy": 0.9721977889537812, "step": 370 }, { "epoch": 0.19973368841544606, "grad_norm": 0.04110695794224739, "learning_rate": 0.00019401160103033174, "loss": 0.0512, "mean_token_accuracy": 0.9791330754756927, "step": 375 }, { "epoch": 0.20239680426098536, "grad_norm": 0.05923238396644592, "learning_rate": 0.00019369053983105532, "loss": 0.0462, "mean_token_accuracy": 0.9814529776573181, "step": 380 }, { "epoch": 0.20505992010652463, "grad_norm": 0.06135060265660286, "learning_rate": 0.00019336137512376532, "loss": 0.0506, "mean_token_accuracy": 0.9793650686740876, "step": 385 }, { "epoch": 0.20772303595206393, "grad_norm": 0.05882129445672035, "learning_rate": 0.00019302413537866642, "loss": 0.061, "mean_token_accuracy": 0.9756898581981659, "step": 390 }, { "epoch": 0.2103861517976032, "grad_norm": 0.0644676685333252, "learning_rate": 0.0001926788497643916, "loss": 0.0578, "mean_token_accuracy": 0.9761660397052765, "step": 395 }, { "epoch": 0.21304926764314247, "grad_norm": 0.048850301653146744, "learning_rate": 0.00019232554814547953, "loss": 0.0427, "mean_token_accuracy": 0.9819169521331788, "step": 400 }, { "epoch": 0.21571238348868177, "grad_norm": 0.05742983892560005, "learning_rate": 0.00019196426107979128, "loss": 0.0581, "mean_token_accuracy": 0.9765811860561371, "step": 405 }, { "epoch": 0.21837549933422104, "grad_norm": 0.05089128762483597, "learning_rate": 0.00019159501981586737, "loss": 0.0475, "mean_token_accuracy": 0.9808180510997773, "step": 410 }, { "epoch": 0.2210386151797603, "grad_norm": 0.06413483619689941, "learning_rate": 0.00019121785629022501, "loss": 0.0583, "mean_token_accuracy": 0.9765567600727081, "step": 415 }, { "epoch": 0.2237017310252996, "grad_norm": 0.057210683822631836, "learning_rate": 0.00019083280312459593, "loss": 0.066, "mean_token_accuracy": 0.9729426026344299, "step": 420 }, { "epoch": 0.22636484687083888, "grad_norm": 0.07737241685390472, "learning_rate": 0.0001904398936231047, "loss": 0.0612, "mean_token_accuracy": 0.9754578590393066, "step": 425 }, { "epoch": 0.22902796271637815, "grad_norm": 0.06051091104745865, "learning_rate": 0.00019003916176938836, "loss": 0.0512, "mean_token_accuracy": 0.9791941285133362, "step": 430 }, { "epoch": 0.23169107856191745, "grad_norm": 0.06462576240301132, "learning_rate": 0.00018963064222365694, "loss": 0.047, "mean_token_accuracy": 0.9807447969913483, "step": 435 }, { "epoch": 0.23435419440745672, "grad_norm": 0.065574049949646, "learning_rate": 0.00018921437031969558, "loss": 0.0476, "mean_token_accuracy": 0.9804151117801666, "step": 440 }, { "epoch": 0.237017310252996, "grad_norm": 0.05336959287524223, "learning_rate": 0.0001887903820618087, "loss": 0.0388, "mean_token_accuracy": 0.9844322204589844, "step": 445 }, { "epoch": 0.2396804260985353, "grad_norm": 0.06592069566249847, "learning_rate": 0.00018835871412170563, "loss": 0.0502, "mean_token_accuracy": 0.9795970559120178, "step": 450 }, { "epoch": 0.24234354194407456, "grad_norm": 0.04266435280442238, "learning_rate": 0.0001879194038353289, "loss": 0.0561, "mean_token_accuracy": 0.9772527337074279, "step": 455 }, { "epoch": 0.24500665778961384, "grad_norm": 0.04808111861348152, "learning_rate": 0.00018747248919962498, "loss": 0.0389, "mean_token_accuracy": 0.9841758131980896, "step": 460 }, { "epoch": 0.24766977363515313, "grad_norm": 0.05507846549153328, "learning_rate": 0.00018701800886925782, "loss": 0.0543, "mean_token_accuracy": 0.9776800870895386, "step": 465 }, { "epoch": 0.25033288948069243, "grad_norm": 0.049451231956481934, "learning_rate": 0.00018655600215326546, "loss": 0.0466, "mean_token_accuracy": 0.9812942504882812, "step": 470 }, { "epoch": 0.2529960053262317, "grad_norm": 0.0632142499089241, "learning_rate": 0.00018608650901166032, "loss": 0.0438, "mean_token_accuracy": 0.9818925321102142, "step": 475 }, { "epoch": 0.255659121171771, "grad_norm": 0.06887644529342651, "learning_rate": 0.0001856095700519726, "loss": 0.0568, "mean_token_accuracy": 0.9767521262168884, "step": 480 }, { "epoch": 0.2583222370173103, "grad_norm": 0.06655330210924149, "learning_rate": 0.0001851252265257384, "loss": 0.0546, "mean_token_accuracy": 0.9772893607616424, "step": 485 }, { "epoch": 0.2609853528628495, "grad_norm": 0.051667094230651855, "learning_rate": 0.0001846335203249316, "loss": 0.0598, "mean_token_accuracy": 0.975567752122879, "step": 490 }, { "epoch": 0.2636484687083888, "grad_norm": 0.062494028359651566, "learning_rate": 0.00018413449397834051, "loss": 0.0524, "mean_token_accuracy": 0.9785714209079742, "step": 495 }, { "epoch": 0.2663115845539281, "grad_norm": 0.07585468888282776, "learning_rate": 0.00018362819064788956, "loss": 0.055, "mean_token_accuracy": 0.9775335609912872, "step": 500 }, { "epoch": 0.26897470039946736, "grad_norm": 0.06810704618692398, "learning_rate": 0.00018311465412490608, "loss": 0.0574, "mean_token_accuracy": 0.9759340524673462, "step": 505 }, { "epoch": 0.27163781624500666, "grad_norm": 0.05042650178074837, "learning_rate": 0.00018259392882633265, "loss": 0.056, "mean_token_accuracy": 0.9768742263317108, "step": 510 }, { "epoch": 0.27430093209054596, "grad_norm": 0.07071951776742935, "learning_rate": 0.00018206605979088542, "loss": 0.0658, "mean_token_accuracy": 0.972893762588501, "step": 515 }, { "epoch": 0.2769640479360852, "grad_norm": 0.05426500737667084, "learning_rate": 0.0001815310926751586, "loss": 0.0489, "mean_token_accuracy": 0.979426109790802, "step": 520 }, { "epoch": 0.2796271637816245, "grad_norm": 0.047436077147722244, "learning_rate": 0.00018098907374967555, "loss": 0.047, "mean_token_accuracy": 0.980610477924347, "step": 525 }, { "epoch": 0.2822902796271638, "grad_norm": 0.07206933200359344, "learning_rate": 0.00018044004989488664, "loss": 0.0441, "mean_token_accuracy": 0.9823198795318604, "step": 530 }, { "epoch": 0.28495339547270304, "grad_norm": 0.05135834217071533, "learning_rate": 0.00017988406859711456, "loss": 0.042, "mean_token_accuracy": 0.9827960848808288, "step": 535 }, { "epoch": 0.28761651131824234, "grad_norm": 0.055974993854761124, "learning_rate": 0.00017932117794444713, "loss": 0.0471, "mean_token_accuracy": 0.9802075505256653, "step": 540 }, { "epoch": 0.29027962716378164, "grad_norm": 0.05277843400835991, "learning_rate": 0.00017875142662257786, "loss": 0.0514, "mean_token_accuracy": 0.9788400411605835, "step": 545 }, { "epoch": 0.2929427430093209, "grad_norm": 0.06408589333295822, "learning_rate": 0.00017817486391059532, "loss": 0.0487, "mean_token_accuracy": 0.9800854623317719, "step": 550 }, { "epoch": 0.2956058588548602, "grad_norm": 0.043870504945516586, "learning_rate": 0.0001775915396767205, "loss": 0.0489, "mean_token_accuracy": 0.979902309179306, "step": 555 }, { "epoch": 0.2982689747003995, "grad_norm": 0.04837007820606232, "learning_rate": 0.00017700150437399405, "loss": 0.0661, "mean_token_accuracy": 0.9734798431396484, "step": 560 }, { "epoch": 0.3009320905459387, "grad_norm": 0.04017208516597748, "learning_rate": 0.0001764048090359121, "loss": 0.05, "mean_token_accuracy": 0.9792307496070862, "step": 565 }, { "epoch": 0.303595206391478, "grad_norm": 0.0461135059595108, "learning_rate": 0.00017580150527201241, "loss": 0.0428, "mean_token_accuracy": 0.9829426050186157, "step": 570 }, { "epoch": 0.3062583222370173, "grad_norm": 0.06603188067674637, "learning_rate": 0.0001751916452634105, "loss": 0.0625, "mean_token_accuracy": 0.9739193975925445, "step": 575 }, { "epoch": 0.30892143808255657, "grad_norm": 0.05519532039761543, "learning_rate": 0.0001745752817582865, "loss": 0.0559, "mean_token_accuracy": 0.9767765462398529, "step": 580 }, { "epoch": 0.31158455392809586, "grad_norm": 0.06411441415548325, "learning_rate": 0.00017395246806732267, "loss": 0.055, "mean_token_accuracy": 0.9773748338222503, "step": 585 }, { "epoch": 0.31424766977363516, "grad_norm": 0.05509982258081436, "learning_rate": 0.00017332325805909256, "loss": 0.061, "mean_token_accuracy": 0.9751526117324829, "step": 590 }, { "epoch": 0.3169107856191744, "grad_norm": 0.0655801072716713, "learning_rate": 0.00017268770615540177, "loss": 0.0466, "mean_token_accuracy": 0.9806593298912049, "step": 595 }, { "epoch": 0.3195739014647137, "grad_norm": 0.06518279016017914, "learning_rate": 0.00017204586732658087, "loss": 0.0412, "mean_token_accuracy": 0.9829548120498657, "step": 600 }, { "epoch": 0.322237017310253, "grad_norm": 0.06401462852954865, "learning_rate": 0.00017139779708673085, "loss": 0.0552, "mean_token_accuracy": 0.9774725079536438, "step": 605 }, { "epoch": 0.3249001331557923, "grad_norm": 0.047077760100364685, "learning_rate": 0.00017074355148892167, "loss": 0.0446, "mean_token_accuracy": 0.9820268452167511, "step": 610 }, { "epoch": 0.32756324900133155, "grad_norm": 0.0499393492937088, "learning_rate": 0.00017008318712034403, "loss": 0.0503, "mean_token_accuracy": 0.9791696965694427, "step": 615 }, { "epoch": 0.33022636484687085, "grad_norm": 0.05421934276819229, "learning_rate": 0.00016941676109741508, "loss": 0.0541, "mean_token_accuracy": 0.9778876543045044, "step": 620 }, { "epoch": 0.33288948069241014, "grad_norm": 0.045506466180086136, "learning_rate": 0.00016874433106083814, "loss": 0.0379, "mean_token_accuracy": 0.9842490673065185, "step": 625 }, { "epoch": 0.3355525965379494, "grad_norm": 0.05099815875291824, "learning_rate": 0.00016806595517061744, "loss": 0.0546, "mean_token_accuracy": 0.976752120256424, "step": 630 }, { "epoch": 0.3382157123834887, "grad_norm": 0.0524461530148983, "learning_rate": 0.00016738169210102764, "loss": 0.0514, "mean_token_accuracy": 0.9787912011146546, "step": 635 }, { "epoch": 0.340878828229028, "grad_norm": 0.04635464772582054, "learning_rate": 0.00016669160103553884, "loss": 0.0503, "mean_token_accuracy": 0.978864461183548, "step": 640 }, { "epoch": 0.34354194407456723, "grad_norm": 0.0492749884724617, "learning_rate": 0.00016599574166169782, "loss": 0.0431, "mean_token_accuracy": 0.9821611523628235, "step": 645 }, { "epoch": 0.34620505992010653, "grad_norm": 0.04817197471857071, "learning_rate": 0.0001652941741659655, "loss": 0.0321, "mean_token_accuracy": 0.9868620157241821, "step": 650 }, { "epoch": 0.3488681757656458, "grad_norm": 0.057936232537031174, "learning_rate": 0.00016458695922851125, "loss": 0.0423, "mean_token_accuracy": 0.98202685713768, "step": 655 }, { "epoch": 0.35153129161118507, "grad_norm": 0.04186012223362923, "learning_rate": 0.0001638741580179645, "loss": 0.0556, "mean_token_accuracy": 0.9770085275173187, "step": 660 }, { "epoch": 0.35419440745672437, "grad_norm": 0.06112098693847656, "learning_rate": 0.0001631558321861241, "loss": 0.0513, "mean_token_accuracy": 0.9787911951541901, "step": 665 }, { "epoch": 0.35685752330226367, "grad_norm": 0.055144574493169785, "learning_rate": 0.00016243204386262616, "loss": 0.0503, "mean_token_accuracy": 0.9787545680999756, "step": 670 }, { "epoch": 0.3595206391478029, "grad_norm": 0.06168635934591293, "learning_rate": 0.0001617028556495699, "loss": 0.0568, "mean_token_accuracy": 0.9764590799808502, "step": 675 }, { "epoch": 0.3621837549933422, "grad_norm": 0.05613715201616287, "learning_rate": 0.00016096833061610336, "loss": 0.0518, "mean_token_accuracy": 0.9790279984474182, "step": 680 }, { "epoch": 0.3648468708388815, "grad_norm": 0.048708170652389526, "learning_rate": 0.0001602285322929684, "loss": 0.0595, "mean_token_accuracy": 0.9754334390163422, "step": 685 }, { "epoch": 0.36750998668442075, "grad_norm": 0.06413900852203369, "learning_rate": 0.00015948352466700562, "loss": 0.0549, "mean_token_accuracy": 0.9773382127285004, "step": 690 }, { "epoch": 0.37017310252996005, "grad_norm": 0.05412254482507706, "learning_rate": 0.00015873337217562012, "loss": 0.0576, "mean_token_accuracy": 0.9758485853672028, "step": 695 }, { "epoch": 0.37283621837549935, "grad_norm": 0.07209640741348267, "learning_rate": 0.00015797813970120806, "loss": 0.0504, "mean_token_accuracy": 0.9789987623691558, "step": 700 }, { "epoch": 0.3754993342210386, "grad_norm": 0.0462648831307888, "learning_rate": 0.00015721789256554493, "loss": 0.0432, "mean_token_accuracy": 0.9820268452167511, "step": 705 }, { "epoch": 0.3781624500665779, "grad_norm": 0.054127827286720276, "learning_rate": 0.00015645269652413572, "loss": 0.0366, "mean_token_accuracy": 0.9852625012397767, "step": 710 }, { "epoch": 0.3808255659121172, "grad_norm": 0.04338300973176956, "learning_rate": 0.00015568261776052747, "loss": 0.0457, "mean_token_accuracy": 0.9812576115131378, "step": 715 }, { "epoch": 0.38348868175765644, "grad_norm": 0.05176251381635666, "learning_rate": 0.0001549077228805851, "loss": 0.0402, "mean_token_accuracy": 0.9832844853401184, "step": 720 }, { "epoch": 0.38615179760319573, "grad_norm": 0.06750281155109406, "learning_rate": 0.00015412807890673012, "loss": 0.0519, "mean_token_accuracy": 0.9786324739456177, "step": 725 }, { "epoch": 0.38881491344873503, "grad_norm": 0.05919007956981659, "learning_rate": 0.00015334375327214435, "loss": 0.0386, "mean_token_accuracy": 0.9842979073524475, "step": 730 }, { "epoch": 0.3914780292942743, "grad_norm": 0.0641694962978363, "learning_rate": 0.00015255481381493686, "loss": 0.045, "mean_token_accuracy": 0.9814407587051391, "step": 735 }, { "epoch": 0.3941411451398136, "grad_norm": 0.07224282622337341, "learning_rate": 0.00015176132877227672, "loss": 0.0474, "mean_token_accuracy": 0.9796214699745178, "step": 740 }, { "epoch": 0.3968042609853529, "grad_norm": 0.032872989773750305, "learning_rate": 0.00015096336677449123, "loss": 0.0506, "mean_token_accuracy": 0.9786691009998322, "step": 745 }, { "epoch": 0.3994673768308921, "grad_norm": 0.04536876827478409, "learning_rate": 0.0001501609968391295, "loss": 0.0458, "mean_token_accuracy": 0.9807936370372772, "step": 750 }, { "epoch": 0.4021304926764314, "grad_norm": 0.03958405926823616, "learning_rate": 0.00014935428836499332, "loss": 0.0466, "mean_token_accuracy": 0.9809889972209931, "step": 755 }, { "epoch": 0.4047936085219707, "grad_norm": 0.06668851524591446, "learning_rate": 0.0001485433111261346, "loss": 0.0502, "mean_token_accuracy": 0.9785347878932953, "step": 760 }, { "epoch": 0.40745672436750996, "grad_norm": 0.042506150901317596, "learning_rate": 0.0001477281352658203, "loss": 0.0476, "mean_token_accuracy": 0.9801465034484863, "step": 765 }, { "epoch": 0.41011984021304926, "grad_norm": 0.04714113101363182, "learning_rate": 0.00014690883129046584, "loss": 0.0416, "mean_token_accuracy": 0.9826251447200776, "step": 770 }, { "epoch": 0.41278295605858856, "grad_norm": 0.08716364204883575, "learning_rate": 0.0001460854700635366, "loss": 0.0647, "mean_token_accuracy": 0.9730402827262878, "step": 775 }, { "epoch": 0.41544607190412786, "grad_norm": 0.06549763679504395, "learning_rate": 0.00014525812279941896, "loss": 0.0482, "mean_token_accuracy": 0.9799389362335205, "step": 780 }, { "epoch": 0.4181091877496671, "grad_norm": 0.05666585639119148, "learning_rate": 0.00014442686105726067, "loss": 0.0472, "mean_token_accuracy": 0.9804151237010956, "step": 785 }, { "epoch": 0.4207723035952064, "grad_norm": 0.059463534504175186, "learning_rate": 0.00014359175673478162, "loss": 0.0479, "mean_token_accuracy": 0.9803662836551666, "step": 790 }, { "epoch": 0.4234354194407457, "grad_norm": 0.04722663387656212, "learning_rate": 0.00014275288206205524, "loss": 0.0524, "mean_token_accuracy": 0.9780830085277558, "step": 795 }, { "epoch": 0.42609853528628494, "grad_norm": 0.045738983899354935, "learning_rate": 0.00014191030959526105, "loss": 0.0456, "mean_token_accuracy": 0.9813186585903168, "step": 800 }, { "epoch": 0.42876165113182424, "grad_norm": 0.039609119296073914, "learning_rate": 0.00014106411221040933, "loss": 0.0436, "mean_token_accuracy": 0.9822588443756104, "step": 805 }, { "epoch": 0.43142476697736354, "grad_norm": 0.05956882983446121, "learning_rate": 0.00014021436309703765, "loss": 0.0415, "mean_token_accuracy": 0.9826861917972565, "step": 810 }, { "epoch": 0.4340878828229028, "grad_norm": 0.062378112226724625, "learning_rate": 0.00013936113575188075, "loss": 0.0576, "mean_token_accuracy": 0.9756043791770935, "step": 815 }, { "epoch": 0.4367509986684421, "grad_norm": 0.06362305581569672, "learning_rate": 0.00013850450397251345, "loss": 0.0455, "mean_token_accuracy": 0.980976790189743, "step": 820 }, { "epoch": 0.4394141145139814, "grad_norm": 0.04958374425768852, "learning_rate": 0.0001376445418509679, "loss": 0.054, "mean_token_accuracy": 0.9774480938911438, "step": 825 }, { "epoch": 0.4420772303595206, "grad_norm": 0.045249808579683304, "learning_rate": 0.00013678132376732517, "loss": 0.0436, "mean_token_accuracy": 0.9819169580936432, "step": 830 }, { "epoch": 0.4447403462050599, "grad_norm": 0.059343721717596054, "learning_rate": 0.00013591492438328183, "loss": 0.0505, "mean_token_accuracy": 0.9791208624839782, "step": 835 }, { "epoch": 0.4474034620505992, "grad_norm": 0.04187900200486183, "learning_rate": 0.0001350454186356924, "loss": 0.0505, "mean_token_accuracy": 0.9787179350852966, "step": 840 }, { "epoch": 0.45006657789613846, "grad_norm": 0.052214790135622025, "learning_rate": 0.00013417288173008776, "loss": 0.0333, "mean_token_accuracy": 0.9863491952419281, "step": 845 }, { "epoch": 0.45272969374167776, "grad_norm": 0.04296575114130974, "learning_rate": 0.00013329738913417068, "loss": 0.0501, "mean_token_accuracy": 0.9794993758201599, "step": 850 }, { "epoch": 0.45539280958721706, "grad_norm": 0.049184828996658325, "learning_rate": 0.00013241901657128825, "loss": 0.0408, "mean_token_accuracy": 0.9823565125465393, "step": 855 }, { "epoch": 0.4580559254327563, "grad_norm": 0.06455284357070923, "learning_rate": 0.00013153784001388247, "loss": 0.0448, "mean_token_accuracy": 0.9815140306949616, "step": 860 }, { "epoch": 0.4607190412782956, "grad_norm": 0.07309287786483765, "learning_rate": 0.00013065393567691913, "loss": 0.0534, "mean_token_accuracy": 0.9781806886196136, "step": 865 }, { "epoch": 0.4633821571238349, "grad_norm": 0.04752277955412865, "learning_rate": 0.00012976738001129606, "loss": 0.0458, "mean_token_accuracy": 0.9805549561977387, "step": 870 }, { "epoch": 0.46604527296937415, "grad_norm": 0.04298139736056328, "learning_rate": 0.00012887824969723034, "loss": 0.0413, "mean_token_accuracy": 0.9831013262271882, "step": 875 }, { "epoch": 0.46870838881491345, "grad_norm": 0.04882394149899483, "learning_rate": 0.00012798662163762635, "loss": 0.0428, "mean_token_accuracy": 0.9822100043296814, "step": 880 }, { "epoch": 0.47137150466045274, "grad_norm": 0.05154480040073395, "learning_rate": 0.00012709257295142422, "loss": 0.0372, "mean_token_accuracy": 0.9849450349807739, "step": 885 }, { "epoch": 0.474034620505992, "grad_norm": 0.04906482994556427, "learning_rate": 0.00012619618096692943, "loss": 0.0436, "mean_token_accuracy": 0.9814041376113891, "step": 890 }, { "epoch": 0.4766977363515313, "grad_norm": 0.04769090563058853, "learning_rate": 0.0001252975232151248, "loss": 0.0499, "mean_token_accuracy": 0.9794871747493744, "step": 895 }, { "epoch": 0.4793608521970706, "grad_norm": 0.06067895516753197, "learning_rate": 0.0001243966774229645, "loss": 0.0438, "mean_token_accuracy": 0.9816849708557129, "step": 900 }, { "epoch": 0.48202396804260983, "grad_norm": 0.042605381458997726, "learning_rate": 0.00012349372150665118, "loss": 0.0373, "mean_token_accuracy": 0.9843467473983765, "step": 905 }, { "epoch": 0.48468708388814913, "grad_norm": 0.062114305794239044, "learning_rate": 0.00012258873356489714, "loss": 0.0459, "mean_token_accuracy": 0.9810500562191009, "step": 910 }, { "epoch": 0.4873501997336884, "grad_norm": 0.05644230544567108, "learning_rate": 0.00012168179187216893, "loss": 0.0371, "mean_token_accuracy": 0.9850549340248108, "step": 915 }, { "epoch": 0.49001331557922767, "grad_norm": 0.0462392121553421, "learning_rate": 0.0001207729748719177, "loss": 0.041, "mean_token_accuracy": 0.9826495587825775, "step": 920 }, { "epoch": 0.49267643142476697, "grad_norm": 0.04839859530329704, "learning_rate": 0.00011986236116979406, "loss": 0.0411, "mean_token_accuracy": 0.9826251327991485, "step": 925 }, { "epoch": 0.49533954727030627, "grad_norm": 0.05229158326983452, "learning_rate": 0.0001189500295268495, "loss": 0.0413, "mean_token_accuracy": 0.9825274586677551, "step": 930 }, { "epoch": 0.4980026631158455, "grad_norm": 0.07273437082767487, "learning_rate": 0.0001180360588527242, "loss": 0.0417, "mean_token_accuracy": 0.9828571259975434, "step": 935 }, { "epoch": 0.5006657789613849, "grad_norm": 0.05428444594144821, "learning_rate": 0.00011712052819882171, "loss": 0.0488, "mean_token_accuracy": 0.9799145221710205, "step": 940 }, { "epoch": 0.5033288948069241, "grad_norm": 0.03856281563639641, "learning_rate": 0.00011620351675147195, "loss": 0.0342, "mean_token_accuracy": 0.9858730018138886, "step": 945 }, { "epoch": 0.5059920106524634, "grad_norm": 0.05268105864524841, "learning_rate": 0.0001152851038250819, "loss": 0.0427, "mean_token_accuracy": 0.9826739728450775, "step": 950 }, { "epoch": 0.5086551264980027, "grad_norm": 0.051574211567640305, "learning_rate": 0.00011436536885527576, "loss": 0.0467, "mean_token_accuracy": 0.9806593298912049, "step": 955 }, { "epoch": 0.511318242343542, "grad_norm": 0.058736130595207214, "learning_rate": 0.00011344439139202421, "loss": 0.0433, "mean_token_accuracy": 0.9818681299686431, "step": 960 }, { "epoch": 0.5139813581890812, "grad_norm": 0.04859258979558945, "learning_rate": 0.00011252225109276404, "loss": 0.0619, "mean_token_accuracy": 0.9739438176155091, "step": 965 }, { "epoch": 0.5166444740346205, "grad_norm": 0.04141055420041084, "learning_rate": 0.00011159902771550837, "loss": 0.0382, "mean_token_accuracy": 0.9844200074672699, "step": 970 }, { "epoch": 0.5193075898801598, "grad_norm": 0.06450913846492767, "learning_rate": 0.00011067480111194817, "loss": 0.047, "mean_token_accuracy": 0.9803784966468811, "step": 975 }, { "epoch": 0.521970705725699, "grad_norm": 0.036628931760787964, "learning_rate": 0.00010974965122054579, "loss": 0.0444, "mean_token_accuracy": 0.9814529776573181, "step": 980 }, { "epoch": 0.5246338215712384, "grad_norm": 0.0419347807765007, "learning_rate": 0.00010882365805962083, "loss": 0.0319, "mean_token_accuracy": 0.9871550559997558, "step": 985 }, { "epoch": 0.5272969374167776, "grad_norm": 0.061081454157829285, "learning_rate": 0.00010789690172042912, "loss": 0.0485, "mean_token_accuracy": 0.9795482158660889, "step": 990 }, { "epoch": 0.5299600532623169, "grad_norm": 0.03295666724443436, "learning_rate": 0.00010696946236023567, "loss": 0.0442, "mean_token_accuracy": 0.9816483318805694, "step": 995 }, { "epoch": 0.5326231691078562, "grad_norm": 0.05213489755988121, "learning_rate": 0.00010604142019538135, "loss": 0.0424, "mean_token_accuracy": 0.982710599899292, "step": 1000 }, { "epoch": 0.5352862849533955, "grad_norm": 0.042385201901197433, "learning_rate": 0.00010511285549434509, "loss": 0.0369, "mean_token_accuracy": 0.9848351597785949, "step": 1005 }, { "epoch": 0.5379494007989347, "grad_norm": 0.05076534301042557, "learning_rate": 0.00010418384857080117, "loss": 0.0429, "mean_token_accuracy": 0.9821611642837524, "step": 1010 }, { "epoch": 0.5406125166444741, "grad_norm": 0.06207333505153656, "learning_rate": 0.00010325447977667263, "loss": 0.0547, "mean_token_accuracy": 0.976752120256424, "step": 1015 }, { "epoch": 0.5432756324900133, "grad_norm": 0.056006304919719696, "learning_rate": 0.00010232482949518156, "loss": 0.0409, "mean_token_accuracy": 0.9827472329139709, "step": 1020 }, { "epoch": 0.5459387483355526, "grad_norm": 0.04523596540093422, "learning_rate": 0.00010139497813389654, "loss": 0.0468, "mean_token_accuracy": 0.9804395496845245, "step": 1025 }, { "epoch": 0.5486018641810919, "grad_norm": 0.056653622537851334, "learning_rate": 0.00010046500611777798, "loss": 0.0468, "mean_token_accuracy": 0.9804639697074891, "step": 1030 }, { "epoch": 0.5512649800266312, "grad_norm": 0.05866164341568947, "learning_rate": 9.953499388222202e-05, "loss": 0.045, "mean_token_accuracy": 0.9809889972209931, "step": 1035 }, { "epoch": 0.5539280958721704, "grad_norm": 0.053372107446193695, "learning_rate": 9.860502186610349e-05, "loss": 0.0517, "mean_token_accuracy": 0.9779609084129334, "step": 1040 }, { "epoch": 0.5565912117177098, "grad_norm": 0.05768711119890213, "learning_rate": 9.767517050481846e-05, "loss": 0.0423, "mean_token_accuracy": 0.9827716588973999, "step": 1045 }, { "epoch": 0.559254327563249, "grad_norm": 0.045836519449949265, "learning_rate": 9.67455202233274e-05, "loss": 0.0363, "mean_token_accuracy": 0.9848595678806304, "step": 1050 }, { "epoch": 0.5619174434087882, "grad_norm": 0.05728695169091225, "learning_rate": 9.581615142919887e-05, "loss": 0.0396, "mean_token_accuracy": 0.9834065854549408, "step": 1055 }, { "epoch": 0.5645805592543276, "grad_norm": 0.03806497901678085, "learning_rate": 9.488714450565491e-05, "loss": 0.0516, "mean_token_accuracy": 0.9779364943504334, "step": 1060 }, { "epoch": 0.5672436750998668, "grad_norm": 0.04686364531517029, "learning_rate": 9.395857980461867e-05, "loss": 0.0597, "mean_token_accuracy": 0.9751526176929474, "step": 1065 }, { "epoch": 0.5699067909454061, "grad_norm": 0.06154019758105278, "learning_rate": 9.303053763976434e-05, "loss": 0.0417, "mean_token_accuracy": 0.9825518727302551, "step": 1070 }, { "epoch": 0.5725699067909454, "grad_norm": 0.06537701189517975, "learning_rate": 9.210309827957089e-05, "loss": 0.0446, "mean_token_accuracy": 0.9810866832733154, "step": 1075 }, { "epoch": 0.5752330226364847, "grad_norm": 0.04378455877304077, "learning_rate": 9.117634194037922e-05, "loss": 0.0445, "mean_token_accuracy": 0.9811599373817443, "step": 1080 }, { "epoch": 0.5778961384820239, "grad_norm": 0.03224113956093788, "learning_rate": 9.025034877945422e-05, "loss": 0.0346, "mean_token_accuracy": 0.9851502895355224, "step": 1085 }, { "epoch": 0.5805592543275633, "grad_norm": 0.050813645124435425, "learning_rate": 8.932519888805185e-05, "loss": 0.0453, "mean_token_accuracy": 0.9811965763568878, "step": 1090 }, { "epoch": 0.5832223701731025, "grad_norm": 0.06234807148575783, "learning_rate": 8.840097228449165e-05, "loss": 0.0446, "mean_token_accuracy": 0.9812820434570313, "step": 1095 }, { "epoch": 0.5858854860186418, "grad_norm": 0.046289362013339996, "learning_rate": 8.747774890723599e-05, "loss": 0.0361, "mean_token_accuracy": 0.9846764206886292, "step": 1100 }, { "epoch": 0.5885486018641811, "grad_norm": 0.04741502180695534, "learning_rate": 8.655560860797582e-05, "loss": 0.0392, "mean_token_accuracy": 0.9833821594715119, "step": 1105 }, { "epoch": 0.5912117177097204, "grad_norm": 0.035679835826158524, "learning_rate": 8.563463114472425e-05, "loss": 0.0386, "mean_token_accuracy": 0.9833333194255829, "step": 1110 }, { "epoch": 0.5938748335552596, "grad_norm": 0.03642835095524788, "learning_rate": 8.471489617491812e-05, "loss": 0.0424, "mean_token_accuracy": 0.9821611642837524, "step": 1115 }, { "epoch": 0.596537949400799, "grad_norm": 0.05134493485093117, "learning_rate": 8.379648324852808e-05, "loss": 0.0416, "mean_token_accuracy": 0.9830402791500091, "step": 1120 }, { "epoch": 0.5992010652463382, "grad_norm": 0.04159806668758392, "learning_rate": 8.287947180117832e-05, "loss": 0.0464, "mean_token_accuracy": 0.980549442768097, "step": 1125 }, { "epoch": 0.6018641810918774, "grad_norm": 0.04069337248802185, "learning_rate": 8.196394114727585e-05, "loss": 0.0387, "mean_token_accuracy": 0.9839316129684448, "step": 1130 }, { "epoch": 0.6045272969374168, "grad_norm": 0.055958956480026245, "learning_rate": 8.104997047315048e-05, "loss": 0.0469, "mean_token_accuracy": 0.9801464974880219, "step": 1135 }, { "epoch": 0.607190412782956, "grad_norm": 0.05381285026669502, "learning_rate": 8.013763883020596e-05, "loss": 0.0518, "mean_token_accuracy": 0.9784493148326874, "step": 1140 }, { "epoch": 0.6098535286284953, "grad_norm": 0.06098148599267006, "learning_rate": 7.92270251280823e-05, "loss": 0.0495, "mean_token_accuracy": 0.9790842354297637, "step": 1145 }, { "epoch": 0.6125166444740346, "grad_norm": 0.04997801408171654, "learning_rate": 7.831820812783108e-05, "loss": 0.0471, "mean_token_accuracy": 0.9798290371894837, "step": 1150 }, { "epoch": 0.6151797603195739, "grad_norm": 0.045936260372400284, "learning_rate": 7.741126643510292e-05, "loss": 0.0369, "mean_token_accuracy": 0.9849816679954528, "step": 1155 }, { "epoch": 0.6178428761651131, "grad_norm": 0.10932360589504242, "learning_rate": 7.650627849334881e-05, "loss": 0.038, "mean_token_accuracy": 0.984285694360733, "step": 1160 }, { "epoch": 0.6205059920106525, "grad_norm": 0.06736107170581818, "learning_rate": 7.560332257703555e-05, "loss": 0.0499, "mean_token_accuracy": 0.9795238018035889, "step": 1165 }, { "epoch": 0.6231691078561917, "grad_norm": 0.13129392266273499, "learning_rate": 7.470247678487522e-05, "loss": 0.0493, "mean_token_accuracy": 0.978888875246048, "step": 1170 }, { "epoch": 0.625832223701731, "grad_norm": 0.04084044694900513, "learning_rate": 7.380381903307061e-05, "loss": 0.0411, "mean_token_accuracy": 0.9828205049037934, "step": 1175 }, { "epoch": 0.6284953395472703, "grad_norm": 0.041778337210416794, "learning_rate": 7.290742704857585e-05, "loss": 0.0487, "mean_token_accuracy": 0.9800610363483429, "step": 1180 }, { "epoch": 0.6311584553928096, "grad_norm": 0.043811947107315063, "learning_rate": 7.201337836237365e-05, "loss": 0.0424, "mean_token_accuracy": 0.9816605448722839, "step": 1185 }, { "epoch": 0.6338215712383488, "grad_norm": 0.060183800756931305, "learning_rate": 7.112175030276969e-05, "loss": 0.0498, "mean_token_accuracy": 0.9791941285133362, "step": 1190 }, { "epoch": 0.6364846870838882, "grad_norm": 0.042345814406871796, "learning_rate": 7.023261998870395e-05, "loss": 0.0303, "mean_token_accuracy": 0.9873259902000427, "step": 1195 }, { "epoch": 0.6391478029294274, "grad_norm": 0.06444382667541504, "learning_rate": 6.934606432308086e-05, "loss": 0.0484, "mean_token_accuracy": 0.9798046231269837, "step": 1200 }, { "epoch": 0.6418109187749668, "grad_norm": 0.046876195818185806, "learning_rate": 6.846215998611757e-05, "loss": 0.0486, "mean_token_accuracy": 0.9789499282836914, "step": 1205 }, { "epoch": 0.644474034620506, "grad_norm": 0.057887110859155655, "learning_rate": 6.758098342871174e-05, "loss": 0.057, "mean_token_accuracy": 0.9761416196823121, "step": 1210 }, { "epoch": 0.6471371504660453, "grad_norm": 0.03972464054822922, "learning_rate": 6.670261086582933e-05, "loss": 0.0473, "mean_token_accuracy": 0.9801709234714509, "step": 1215 }, { "epoch": 0.6498002663115846, "grad_norm": 0.043679483234882355, "learning_rate": 6.582711826991226e-05, "loss": 0.0397, "mean_token_accuracy": 0.9834798455238343, "step": 1220 }, { "epoch": 0.6524633821571239, "grad_norm": 0.05936583876609802, "learning_rate": 6.495458136430765e-05, "loss": 0.0376, "mean_token_accuracy": 0.9842490732669831, "step": 1225 }, { "epoch": 0.6551264980026631, "grad_norm": 0.04087141901254654, "learning_rate": 6.408507561671819e-05, "loss": 0.0462, "mean_token_accuracy": 0.9808546841144562, "step": 1230 }, { "epoch": 0.6577896138482024, "grad_norm": 0.05433586984872818, "learning_rate": 6.321867623267481e-05, "loss": 0.049, "mean_token_accuracy": 0.9793772757053375, "step": 1235 }, { "epoch": 0.6604527296937417, "grad_norm": 0.06001468747854233, "learning_rate": 6.23554581490321e-05, "loss": 0.0492, "mean_token_accuracy": 0.9789987683296204, "step": 1240 }, { "epoch": 0.6631158455392809, "grad_norm": 0.04763103276491165, "learning_rate": 6.149549602748656e-05, "loss": 0.0576, "mean_token_accuracy": 0.9754822731018067, "step": 1245 }, { "epoch": 0.6657789613848203, "grad_norm": 0.06517472863197327, "learning_rate": 6.063886424811929e-05, "loss": 0.0438, "mean_token_accuracy": 0.9815750777721405, "step": 1250 }, { "epoch": 0.6684420772303595, "grad_norm": 0.0524207204580307, "learning_rate": 5.9785636902962374e-05, "loss": 0.0444, "mean_token_accuracy": 0.9813186764717102, "step": 1255 }, { "epoch": 0.6711051930758988, "grad_norm": 0.05194844305515289, "learning_rate": 5.893588778959067e-05, "loss": 0.0406, "mean_token_accuracy": 0.9824053585529328, "step": 1260 }, { "epoch": 0.6737683089214381, "grad_norm": 0.04531911760568619, "learning_rate": 5.8089690404738925e-05, "loss": 0.0394, "mean_token_accuracy": 0.9833089053630829, "step": 1265 }, { "epoch": 0.6764314247669774, "grad_norm": 0.05924287810921669, "learning_rate": 5.7247117937944786e-05, "loss": 0.0421, "mean_token_accuracy": 0.9821977853775025, "step": 1270 }, { "epoch": 0.6790945406125166, "grad_norm": 0.04600124806165695, "learning_rate": 5.640824326521841e-05, "loss": 0.0482, "mean_token_accuracy": 0.9791574954986573, "step": 1275 }, { "epoch": 0.681757656458056, "grad_norm": 0.060442570596933365, "learning_rate": 5.5573138942739365e-05, "loss": 0.0464, "mean_token_accuracy": 0.9802686095237731, "step": 1280 }, { "epoch": 0.6844207723035952, "grad_norm": 0.05491984635591507, "learning_rate": 5.4741877200581057e-05, "loss": 0.0571, "mean_token_accuracy": 0.9753601789474488, "step": 1285 }, { "epoch": 0.6870838881491345, "grad_norm": 0.048727113753557205, "learning_rate": 5.391452993646342e-05, "loss": 0.0524, "mean_token_accuracy": 0.9780952274799347, "step": 1290 }, { "epoch": 0.6897470039946738, "grad_norm": 0.04571819305419922, "learning_rate": 5.30911687095342e-05, "loss": 0.0419, "mean_token_accuracy": 0.982209998369217, "step": 1295 }, { "epoch": 0.6924101198402131, "grad_norm": 0.06429927051067352, "learning_rate": 5.227186473417971e-05, "loss": 0.0446, "mean_token_accuracy": 0.9807325899600983, "step": 1300 }, { "epoch": 0.6950732356857523, "grad_norm": 0.05295795202255249, "learning_rate": 5.145668887386543e-05, "loss": 0.0389, "mean_token_accuracy": 0.9835286796092987, "step": 1305 }, { "epoch": 0.6977363515312917, "grad_norm": 0.06455942988395691, "learning_rate": 5.064571163500667e-05, "loss": 0.0541, "mean_token_accuracy": 0.97710622549057, "step": 1310 }, { "epoch": 0.7003994673768309, "grad_norm": 0.05818232521414757, "learning_rate": 4.983900316087051e-05, "loss": 0.0468, "mean_token_accuracy": 0.9796092748641968, "step": 1315 }, { "epoch": 0.7030625832223701, "grad_norm": 0.04409760236740112, "learning_rate": 4.90366332255088e-05, "loss": 0.0534, "mean_token_accuracy": 0.9773870468139648, "step": 1320 }, { "epoch": 0.7057256990679095, "grad_norm": 0.06393323838710785, "learning_rate": 4.823867122772329e-05, "loss": 0.0428, "mean_token_accuracy": 0.9825396656990051, "step": 1325 }, { "epoch": 0.7083888149134487, "grad_norm": 0.04404666647315025, "learning_rate": 4.744518618506319e-05, "loss": 0.0452, "mean_token_accuracy": 0.9808302700519562, "step": 1330 }, { "epoch": 0.711051930758988, "grad_norm": 0.05861349031329155, "learning_rate": 4.665624672785566e-05, "loss": 0.0408, "mean_token_accuracy": 0.982637345790863, "step": 1335 }, { "epoch": 0.7137150466045273, "grad_norm": 0.04552765563130379, "learning_rate": 4.5871921093269875e-05, "loss": 0.0461, "mean_token_accuracy": 0.9806715369224548, "step": 1340 }, { "epoch": 0.7163781624500666, "grad_norm": 0.06690757721662521, "learning_rate": 4.5092277119414975e-05, "loss": 0.0432, "mean_token_accuracy": 0.9817826449871063, "step": 1345 }, { "epoch": 0.7190412782956058, "grad_norm": 0.04385219141840935, "learning_rate": 4.431738223947252e-05, "loss": 0.033, "mean_token_accuracy": 0.9860195100307465, "step": 1350 }, { "epoch": 0.7217043941411452, "grad_norm": 0.042622532695531845, "learning_rate": 4.35473034758643e-05, "loss": 0.0359, "mean_token_accuracy": 0.9848229348659515, "step": 1355 }, { "epoch": 0.7243675099866844, "grad_norm": 0.04397781938314438, "learning_rate": 4.2782107434455054e-05, "loss": 0.0427, "mean_token_accuracy": 0.9819902241230011, "step": 1360 }, { "epoch": 0.7270306258322237, "grad_norm": 0.049341488629579544, "learning_rate": 4.202186029879195e-05, "loss": 0.042, "mean_token_accuracy": 0.9824175596237182, "step": 1365 }, { "epoch": 0.729693741677763, "grad_norm": 0.04645610973238945, "learning_rate": 4.12666278243799e-05, "loss": 0.032, "mean_token_accuracy": 0.9869352757930756, "step": 1370 }, { "epoch": 0.7323568575233023, "grad_norm": 0.039163220673799515, "learning_rate": 4.0516475332994383e-05, "loss": 0.0394, "mean_token_accuracy": 0.983870553970337, "step": 1375 }, { "epoch": 0.7350199733688415, "grad_norm": 0.054667674005031586, "learning_rate": 3.9771467707031615e-05, "loss": 0.0418, "mean_token_accuracy": 0.9822100043296814, "step": 1380 }, { "epoch": 0.7376830892143809, "grad_norm": 0.04490191861987114, "learning_rate": 3.903166938389664e-05, "loss": 0.0327, "mean_token_accuracy": 0.9861904561519623, "step": 1385 }, { "epoch": 0.7403462050599201, "grad_norm": 0.0483897365629673, "learning_rate": 3.8297144350430144e-05, "loss": 0.0506, "mean_token_accuracy": 0.9783150017261505, "step": 1390 }, { "epoch": 0.7430093209054593, "grad_norm": 0.050037335604429245, "learning_rate": 3.756795613737388e-05, "loss": 0.0416, "mean_token_accuracy": 0.9822344243526459, "step": 1395 }, { "epoch": 0.7456724367509987, "grad_norm": 0.05803540349006653, "learning_rate": 3.684416781387589e-05, "loss": 0.0395, "mean_token_accuracy": 0.9835408866405487, "step": 1400 }, { "epoch": 0.748335552596538, "grad_norm": 0.04605701565742493, "learning_rate": 3.6125841982035536e-05, "loss": 0.0367, "mean_token_accuracy": 0.9844322204589844, "step": 1405 }, { "epoch": 0.7509986684420772, "grad_norm": 0.05056578665971756, "learning_rate": 3.5413040771488746e-05, "loss": 0.0442, "mean_token_accuracy": 0.9809784710407257, "step": 1410 }, { "epoch": 0.7536617842876165, "grad_norm": 0.04270164296030998, "learning_rate": 3.47058258340345e-05, "loss": 0.0467, "mean_token_accuracy": 0.9802930176258087, "step": 1415 }, { "epoch": 0.7563249001331558, "grad_norm": 0.04214705154299736, "learning_rate": 3.4004258338302195e-05, "loss": 0.0362, "mean_token_accuracy": 0.9850060999393463, "step": 1420 }, { "epoch": 0.758988015978695, "grad_norm": 0.04405741021037102, "learning_rate": 3.3308398964461206e-05, "loss": 0.0452, "mean_token_accuracy": 0.9807936370372772, "step": 1425 }, { "epoch": 0.7616511318242344, "grad_norm": 0.06789631396532059, "learning_rate": 3.261830789897241e-05, "loss": 0.0472, "mean_token_accuracy": 0.9795726358890533, "step": 1430 }, { "epoch": 0.7643142476697736, "grad_norm": 0.05779273435473442, "learning_rate": 3.193404482938256e-05, "loss": 0.0547, "mean_token_accuracy": 0.9761782586574554, "step": 1435 }, { "epoch": 0.7669773635153129, "grad_norm": 0.0402994304895401, "learning_rate": 3.1255668939161894e-05, "loss": 0.0396, "mean_token_accuracy": 0.983247846364975, "step": 1440 }, { "epoch": 0.7696404793608522, "grad_norm": 0.0458141565322876, "learning_rate": 3.058323890258498e-05, "loss": 0.0359, "mean_token_accuracy": 0.9849328339099884, "step": 1445 }, { "epoch": 0.7723035952063915, "grad_norm": 0.038610294461250305, "learning_rate": 2.9916812879655975e-05, "loss": 0.0501, "mean_token_accuracy": 0.9783516347408294, "step": 1450 }, { "epoch": 0.7749667110519307, "grad_norm": 0.06346781551837921, "learning_rate": 2.925644851107835e-05, "loss": 0.0299, "mean_token_accuracy": 0.9874236702919006, "step": 1455 }, { "epoch": 0.7776298268974701, "grad_norm": 0.037486497312784195, "learning_rate": 2.860220291326915e-05, "loss": 0.0359, "mean_token_accuracy": 0.9851404011249543, "step": 1460 }, { "epoch": 0.7802929427430093, "grad_norm": 0.06529121845960617, "learning_rate": 2.7954132673419143e-05, "loss": 0.0422, "mean_token_accuracy": 0.9822344183921814, "step": 1465 }, { "epoch": 0.7829560585885486, "grad_norm": 0.045860741287469864, "learning_rate": 2.7312293844598246e-05, "loss": 0.0435, "mean_token_accuracy": 0.9818559169769288, "step": 1470 }, { "epoch": 0.7856191744340879, "grad_norm": 0.05481775850057602, "learning_rate": 2.6676741940907478e-05, "loss": 0.0604, "mean_token_accuracy": 0.9741025567054749, "step": 1475 }, { "epoch": 0.7882822902796272, "grad_norm": 0.08080944418907166, "learning_rate": 2.6047531932677383e-05, "loss": 0.0592, "mean_token_accuracy": 0.975018298625946, "step": 1480 }, { "epoch": 0.7909454061251664, "grad_norm": 0.06755299866199493, "learning_rate": 2.542471824171353e-05, "loss": 0.0526, "mean_token_accuracy": 0.977777761220932, "step": 1485 }, { "epoch": 0.7936085219707057, "grad_norm": 0.05000187084078789, "learning_rate": 2.4808354736589523e-05, "loss": 0.0437, "mean_token_accuracy": 0.9818559110164642, "step": 1490 }, { "epoch": 0.796271637816245, "grad_norm": 0.05813051760196686, "learning_rate": 2.419849472798761e-05, "loss": 0.0451, "mean_token_accuracy": 0.9809035301208496, "step": 1495 }, { "epoch": 0.7989347536617842, "grad_norm": 0.04271751642227173, "learning_rate": 2.359519096408791e-05, "loss": 0.045, "mean_token_accuracy": 0.9813552975654602, "step": 1500 }, { "epoch": 0.8015978695073236, "grad_norm": 0.04828868433833122, "learning_rate": 2.2998495626005957e-05, "loss": 0.0339, "mean_token_accuracy": 0.985848581790924, "step": 1505 }, { "epoch": 0.8042609853528628, "grad_norm": 0.03289498761296272, "learning_rate": 2.240846032327949e-05, "loss": 0.032, "mean_token_accuracy": 0.9865933954715729, "step": 1510 }, { "epoch": 0.8069241011984021, "grad_norm": 0.05242108181118965, "learning_rate": 2.1825136089404718e-05, "loss": 0.0463, "mean_token_accuracy": 0.9802197635173797, "step": 1515 }, { "epoch": 0.8095872170439414, "grad_norm": 0.050270598381757736, "learning_rate": 2.1248573377422155e-05, "loss": 0.0341, "mean_token_accuracy": 0.9858363628387451, "step": 1520 }, { "epoch": 0.8122503328894807, "grad_norm": 0.05596785992383957, "learning_rate": 2.0678822055552906e-05, "loss": 0.0463, "mean_token_accuracy": 0.9803540706634521, "step": 1525 }, { "epoch": 0.8149134487350199, "grad_norm": 0.053749240934848785, "learning_rate": 2.0115931402885458e-05, "loss": 0.0472, "mean_token_accuracy": 0.9804517567157746, "step": 1530 }, { "epoch": 0.8175765645805593, "grad_norm": 0.04804141819477081, "learning_rate": 1.955995010511338e-05, "loss": 0.0518, "mean_token_accuracy": 0.9780585944652558, "step": 1535 }, { "epoch": 0.8202396804260985, "grad_norm": 0.045841652899980545, "learning_rate": 1.901092625032448e-05, "loss": 0.0485, "mean_token_accuracy": 0.979365062713623, "step": 1540 }, { "epoch": 0.8229027962716379, "grad_norm": 0.0423155315220356, "learning_rate": 1.84689073248414e-05, "loss": 0.0407, "mean_token_accuracy": 0.9830280661582946, "step": 1545 }, { "epoch": 0.8255659121171771, "grad_norm": 0.04051283746957779, "learning_rate": 1.7933940209114597e-05, "loss": 0.0396, "mean_token_accuracy": 0.9830036520957947, "step": 1550 }, { "epoch": 0.8282290279627164, "grad_norm": 0.04280205816030502, "learning_rate": 1.7406071173667372e-05, "loss": 0.0417, "mean_token_accuracy": 0.9825030326843261, "step": 1555 }, { "epoch": 0.8308921438082557, "grad_norm": 0.045416004955768585, "learning_rate": 1.6885345875093918e-05, "loss": 0.0449, "mean_token_accuracy": 0.9808058440685272, "step": 1560 }, { "epoch": 0.833555259653795, "grad_norm": 0.044623058289289474, "learning_rate": 1.6371809352110447e-05, "loss": 0.0356, "mean_token_accuracy": 0.9845054864883422, "step": 1565 }, { "epoch": 0.8362183754993342, "grad_norm": 0.03994055837392807, "learning_rate": 1.5865506021659516e-05, "loss": 0.0441, "mean_token_accuracy": 0.981098884344101, "step": 1570 }, { "epoch": 0.8388814913448736, "grad_norm": 0.06405629962682724, "learning_rate": 1.5366479675068435e-05, "loss": 0.0528, "mean_token_accuracy": 0.9776190400123597, "step": 1575 }, { "epoch": 0.8415446071904128, "grad_norm": 0.06854992359876633, "learning_rate": 1.4874773474261638e-05, "loss": 0.0372, "mean_token_accuracy": 0.9850305020809174, "step": 1580 }, { "epoch": 0.844207723035952, "grad_norm": 0.05664476752281189, "learning_rate": 1.4390429948027428e-05, "loss": 0.0432, "mean_token_accuracy": 0.9814163386821747, "step": 1585 }, { "epoch": 0.8468708388814914, "grad_norm": 0.04452156275510788, "learning_rate": 1.3913490988339718e-05, "loss": 0.0415, "mean_token_accuracy": 0.9819780170917511, "step": 1590 }, { "epoch": 0.8495339547270306, "grad_norm": 0.055095456540584564, "learning_rate": 1.3443997846734535e-05, "loss": 0.0508, "mean_token_accuracy": 0.9781196355819702, "step": 1595 }, { "epoch": 0.8521970705725699, "grad_norm": 0.049195777624845505, "learning_rate": 1.2981991130742211e-05, "loss": 0.0313, "mean_token_accuracy": 0.9868620216846467, "step": 1600 }, { "epoch": 0.8548601864181092, "grad_norm": 0.050247907638549805, "learning_rate": 1.2527510800375043e-05, "loss": 0.0358, "mean_token_accuracy": 0.9846397936344147, "step": 1605 }, { "epoch": 0.8575233022636485, "grad_norm": 0.059565331786870956, "learning_rate": 1.20805961646711e-05, "loss": 0.0451, "mean_token_accuracy": 0.9804273426532746, "step": 1610 }, { "epoch": 0.8601864181091877, "grad_norm": 0.042766787111759186, "learning_rate": 1.1641285878294372e-05, "loss": 0.0411, "mean_token_accuracy": 0.982661771774292, "step": 1615 }, { "epoch": 0.8628495339547271, "grad_norm": 0.037687476724386215, "learning_rate": 1.1209617938191307e-05, "loss": 0.0289, "mean_token_accuracy": 0.9880708038806916, "step": 1620 }, { "epoch": 0.8655126498002663, "grad_norm": 0.06686782836914062, "learning_rate": 1.0785629680304432e-05, "loss": 0.042, "mean_token_accuracy": 0.9822710454463959, "step": 1625 }, { "epoch": 0.8681757656458056, "grad_norm": 0.04809387028217316, "learning_rate": 1.0369357776343103e-05, "loss": 0.0401, "mean_token_accuracy": 0.9831379592418671, "step": 1630 }, { "epoch": 0.8708388814913449, "grad_norm": 0.041997481137514114, "learning_rate": 9.960838230611635e-06, "loss": 0.0356, "mean_token_accuracy": 0.9850183010101319, "step": 1635 }, { "epoch": 0.8735019973368842, "grad_norm": 0.0419871024787426, "learning_rate": 9.560106376895306e-06, "loss": 0.039, "mean_token_accuracy": 0.983711838722229, "step": 1640 }, { "epoch": 0.8761651131824234, "grad_norm": 0.05675376579165459, "learning_rate": 9.167196875404094e-06, "loss": 0.0457, "mean_token_accuracy": 0.9801098823547363, "step": 1645 }, { "epoch": 0.8788282290279628, "grad_norm": 0.04745902493596077, "learning_rate": 8.782143709775015e-06, "loss": 0.0487, "mean_token_accuracy": 0.9794505357742309, "step": 1650 }, { "epoch": 0.881491344873502, "grad_norm": 0.04839067533612251, "learning_rate": 8.40498018413266e-06, "loss": 0.0417, "mean_token_accuracy": 0.9824664056301117, "step": 1655 }, { "epoch": 0.8841544607190412, "grad_norm": 0.04664967581629753, "learning_rate": 8.035738920208714e-06, "loss": 0.0425, "mean_token_accuracy": 0.9820756852626801, "step": 1660 }, { "epoch": 0.8868175765645806, "grad_norm": 0.06269760429859161, "learning_rate": 7.67445185452046e-06, "loss": 0.0389, "mean_token_accuracy": 0.9834432125091552, "step": 1665 }, { "epoch": 0.8894806924101198, "grad_norm": 0.037270188331604004, "learning_rate": 7.321150235608399e-06, "loss": 0.043, "mean_token_accuracy": 0.9818803250789643, "step": 1670 }, { "epoch": 0.8921438082556591, "grad_norm": 0.05021100491285324, "learning_rate": 6.9758646213336165e-06, "loss": 0.039, "mean_token_accuracy": 0.9833943724632264, "step": 1675 }, { "epoch": 0.8948069241011984, "grad_norm": 0.04479273036122322, "learning_rate": 6.6386248762347004e-06, "loss": 0.0441, "mean_token_accuracy": 0.981575071811676, "step": 1680 }, { "epoch": 0.8974700399467377, "grad_norm": 0.04378955066204071, "learning_rate": 6.309460168944692e-06, "loss": 0.0449, "mean_token_accuracy": 0.9806104898452759, "step": 1685 }, { "epoch": 0.9001331557922769, "grad_norm": 0.06034992262721062, "learning_rate": 5.988398969668285e-06, "loss": 0.0469, "mean_token_accuracy": 0.9805616497993469, "step": 1690 }, { "epoch": 0.9027962716378163, "grad_norm": 0.046302057802677155, "learning_rate": 5.6754690477192396e-06, "loss": 0.0438, "mean_token_accuracy": 0.980976790189743, "step": 1695 }, { "epoch": 0.9054593874833555, "grad_norm": 0.06407734751701355, "learning_rate": 5.370697469118713e-06, "loss": 0.0456, "mean_token_accuracy": 0.9805005967617035, "step": 1700 }, { "epoch": 0.9081225033288948, "grad_norm": 0.05884678661823273, "learning_rate": 5.074110594254133e-06, "loss": 0.0475, "mean_token_accuracy": 0.9797313630580902, "step": 1705 }, { "epoch": 0.9107856191744341, "grad_norm": 0.06042284518480301, "learning_rate": 4.78573407559928e-06, "loss": 0.0472, "mean_token_accuracy": 0.979413902759552, "step": 1710 }, { "epoch": 0.9134487350199734, "grad_norm": 0.05121051147580147, "learning_rate": 4.5055928554955665e-06, "loss": 0.0379, "mean_token_accuracy": 0.9844688534736633, "step": 1715 }, { "epoch": 0.9161118508655126, "grad_norm": 0.0401000939309597, "learning_rate": 4.233711163994669e-06, "loss": 0.0368, "mean_token_accuracy": 0.9846520006656647, "step": 1720 }, { "epoch": 0.918774966711052, "grad_norm": 0.046601567417383194, "learning_rate": 3.970112516762825e-06, "loss": 0.0496, "mean_token_accuracy": 0.9794139087200164, "step": 1725 }, { "epoch": 0.9214380825565912, "grad_norm": 0.046900924295186996, "learning_rate": 3.7148197130469576e-06, "loss": 0.0341, "mean_token_accuracy": 0.9858485758304596, "step": 1730 }, { "epoch": 0.9241011984021305, "grad_norm": 0.04627379775047302, "learning_rate": 3.467854833702644e-06, "loss": 0.036, "mean_token_accuracy": 0.9845298945903778, "step": 1735 }, { "epoch": 0.9267643142476698, "grad_norm": 0.035060226917266846, "learning_rate": 3.229239239284354e-06, "loss": 0.0419, "mean_token_accuracy": 0.9822954714298249, "step": 1740 }, { "epoch": 0.929427430093209, "grad_norm": 0.055220045149326324, "learning_rate": 2.9989935681979164e-06, "loss": 0.0441, "mean_token_accuracy": 0.9810866773128509, "step": 1745 }, { "epoch": 0.9320905459387483, "grad_norm": 0.075019471347332, "learning_rate": 2.777137734915403e-06, "loss": 0.0456, "mean_token_accuracy": 0.9808424830436706, "step": 1750 }, { "epoch": 0.9347536617842876, "grad_norm": 0.05054498836398125, "learning_rate": 2.563690928252749e-06, "loss": 0.039, "mean_token_accuracy": 0.9836629867553711, "step": 1755 }, { "epoch": 0.9374167776298269, "grad_norm": 0.06797026097774506, "learning_rate": 2.358671609710017e-06, "loss": 0.0401, "mean_token_accuracy": 0.9828693389892578, "step": 1760 }, { "epoch": 0.9400798934753661, "grad_norm": 0.0382985956966877, "learning_rate": 2.1620975118746835e-06, "loss": 0.0432, "mean_token_accuracy": 0.981636130809784, "step": 1765 }, { "epoch": 0.9427430093209055, "grad_norm": 0.04903360456228256, "learning_rate": 1.9739856368878096e-06, "loss": 0.0385, "mean_token_accuracy": 0.9839194059371948, "step": 1770 }, { "epoch": 0.9454061251664447, "grad_norm": 0.052963729947805405, "learning_rate": 1.794352254973597e-06, "loss": 0.0341, "mean_token_accuracy": 0.985384601354599, "step": 1775 }, { "epoch": 0.948069241011984, "grad_norm": 0.06124390289187431, "learning_rate": 1.6232129030320453e-06, "loss": 0.036, "mean_token_accuracy": 0.9850793480873108, "step": 1780 }, { "epoch": 0.9507323568575233, "grad_norm": 0.039376676082611084, "learning_rate": 1.4605823832951948e-06, "loss": 0.028, "mean_token_accuracy": 0.9882173299789428, "step": 1785 }, { "epoch": 0.9533954727030626, "grad_norm": 0.06673986464738846, "learning_rate": 1.3064747620468054e-06, "loss": 0.0416, "mean_token_accuracy": 0.9819657981395722, "step": 1790 }, { "epoch": 0.9560585885486018, "grad_norm": 0.05445706844329834, "learning_rate": 1.1609033684057857e-06, "loss": 0.0486, "mean_token_accuracy": 0.9793284356594085, "step": 1795 }, { "epoch": 0.9587217043941412, "grad_norm": 0.04978228360414505, "learning_rate": 1.0238807931732487e-06, "loss": 0.0459, "mean_token_accuracy": 0.9800854563713074, "step": 1800 }, { "epoch": 0.9613848202396804, "grad_norm": 0.056231539696455, "learning_rate": 8.95418887743571e-07, "loss": 0.0406, "mean_token_accuracy": 0.9825762987136841, "step": 1805 }, { "epoch": 0.9640479360852197, "grad_norm": 0.0571223720908165, "learning_rate": 7.75528763079314e-07, "loss": 0.0451, "mean_token_accuracy": 0.980451762676239, "step": 1810 }, { "epoch": 0.966711051930759, "grad_norm": 0.06353303045034409, "learning_rate": 6.642207887502027e-07, "loss": 0.0338, "mean_token_accuracy": 0.9854822874069213, "step": 1815 }, { "epoch": 0.9693741677762983, "grad_norm": 0.04823755845427513, "learning_rate": 5.615045920362549e-07, "loss": 0.03, "mean_token_accuracy": 0.987533563375473, "step": 1820 }, { "epoch": 0.9720372836218375, "grad_norm": 0.052398230880498886, "learning_rate": 4.673890570951023e-07, "loss": 0.0423, "mean_token_accuracy": 0.981550657749176, "step": 1825 }, { "epoch": 0.9747003994673769, "grad_norm": 0.056029096245765686, "learning_rate": 3.8188232419352764e-07, "loss": 0.0403, "mean_token_accuracy": 0.9830036520957947, "step": 1830 }, { "epoch": 0.9773635153129161, "grad_norm": 0.04497731104493141, "learning_rate": 3.049917890034837e-07, "loss": 0.0327, "mean_token_accuracy": 0.9856898486614227, "step": 1835 }, { "epoch": 0.9800266311584553, "grad_norm": 0.03512905538082123, "learning_rate": 2.3672410196232675e-07, "loss": 0.0407, "mean_token_accuracy": 0.9827838599681854, "step": 1840 }, { "epoch": 0.9826897470039947, "grad_norm": 0.05528529733419418, "learning_rate": 1.7708516769769924e-07, "loss": 0.0404, "mean_token_accuracy": 0.9827594459056854, "step": 1845 }, { "epoch": 0.9853528628495339, "grad_norm": 0.05035589635372162, "learning_rate": 1.2608014451672702e-07, "loss": 0.0419, "mean_token_accuracy": 0.982686185836792, "step": 1850 }, { "epoch": 0.9880159786950732, "grad_norm": 0.04821354150772095, "learning_rate": 8.371344395996516e-08, "loss": 0.0402, "mean_token_accuracy": 0.9832600593566895, "step": 1855 }, { "epoch": 0.9906790945406125, "grad_norm": 0.06377455592155457, "learning_rate": 4.998873041975882e-08, "loss": 0.045, "mean_token_accuracy": 0.9806715369224548, "step": 1860 }, { "epoch": 0.9933422103861518, "grad_norm": 0.05035337433218956, "learning_rate": 2.490892082331886e-08, "loss": 0.0428, "mean_token_accuracy": 0.9816605448722839, "step": 1865 }, { "epoch": 0.996005326231691, "grad_norm": 0.04119347408413887, "learning_rate": 8.476184380468155e-09, "loss": 0.0338, "mean_token_accuracy": 0.9854578614234925, "step": 1870 }, { "epoch": 0.9986684420772304, "grad_norm": 0.04923999309539795, "learning_rate": 6.919423959805826e-10, "loss": 0.0373, "mean_token_accuracy": 0.984322327375412, "step": 1875 }, { "epoch": 0.9997336884154461, "eval_loss": 0.04217471182346344, "eval_mean_token_accuracy": 0.982079415995975, "eval_runtime": 981.8954, "eval_samples_per_second": 3.158, "eval_steps_per_second": 1.58, "step": 1877 }, { "epoch": 0.9997336884154461, "step": 1877, "total_flos": 2.4518665439700582e+17, "train_loss": 0.05413007871165959, "train_runtime": 8945.5939, "train_samples_per_second": 0.839, "train_steps_per_second": 0.21 } ], "logging_steps": 5, "max_steps": 1877, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2.4518665439700582e+17, "train_batch_size": 2, "trial_name": null, "trial_params": null }