diff --git "a/trainer_state.json" "b/trainer_state.json" new file mode 100644--- /dev/null +++ "b/trainer_state.json" @@ -0,0 +1,7634 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 10.0, + "eval_steps": 500, + "global_step": 760, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.236748993396759, + "epoch": 0.013289036544850499, + "grad_norm": 0.7060697078704834, + "learning_rate": 0.0002, + "loss": 2.64042592048645, + "mean_token_accuracy": 0.5126412361860275, + "num_tokens": 77636.0, + "step": 1 + }, + { + "entropy": 1.2850274741649628, + "epoch": 0.026578073089700997, + "grad_norm": 0.41636043787002563, + "learning_rate": 0.0002, + "loss": 2.205017566680908, + "mean_token_accuracy": 0.551362007856369, + "num_tokens": 154070.0, + "step": 2 + }, + { + "entropy": 1.3720425963401794, + "epoch": 0.03986710963455149, + "grad_norm": 0.38282454013824463, + "learning_rate": 0.0002, + "loss": 1.861063003540039, + "mean_token_accuracy": 0.5767628997564316, + "num_tokens": 231088.0, + "step": 3 + }, + { + "entropy": 1.4496844112873077, + "epoch": 0.053156146179401995, + "grad_norm": 0.3939046561717987, + "learning_rate": 0.0002, + "loss": 1.642488718032837, + "mean_token_accuracy": 0.589305192232132, + "num_tokens": 307396.0, + "step": 4 + }, + { + "entropy": 1.4270202219486237, + "epoch": 0.0664451827242525, + "grad_norm": 0.24181145429611206, + "learning_rate": 0.0002, + "loss": 1.4825536012649536, + "mean_token_accuracy": 0.6070653051137924, + "num_tokens": 384317.0, + "step": 5 + }, + { + "entropy": 1.396634191274643, + "epoch": 0.07973421926910298, + "grad_norm": 0.16257749497890472, + "learning_rate": 0.0002, + "loss": 1.3350005149841309, + "mean_token_accuracy": 0.6365590989589691, + "num_tokens": 462862.0, + "step": 6 + }, + { + "entropy": 1.3969248235225677, + "epoch": 0.09302325581395349, + "grad_norm": 0.13336774706840515, + "learning_rate": 0.0002, + "loss": 1.285440444946289, + "mean_token_accuracy": 0.6306734532117844, + "num_tokens": 539431.0, + "step": 7 + }, + { + "entropy": 1.342583417892456, + "epoch": 0.10631229235880399, + "grad_norm": 0.1381940096616745, + "learning_rate": 0.0002, + "loss": 1.1918363571166992, + "mean_token_accuracy": 0.6458747684955597, + "num_tokens": 615886.0, + "step": 8 + }, + { + "entropy": 1.2815902531147003, + "epoch": 0.11960132890365449, + "grad_norm": 0.13844357430934906, + "learning_rate": 0.0002, + "loss": 1.1147487163543701, + "mean_token_accuracy": 0.656469076871872, + "num_tokens": 693016.0, + "step": 9 + }, + { + "entropy": 1.2026029527187347, + "epoch": 0.132890365448505, + "grad_norm": 0.15192069113254547, + "learning_rate": 0.0002, + "loss": 1.034226417541504, + "mean_token_accuracy": 0.6756248027086258, + "num_tokens": 770638.0, + "step": 10 + }, + { + "entropy": 1.1153404414653778, + "epoch": 0.1461794019933555, + "grad_norm": 0.1124810054898262, + "learning_rate": 0.0002, + "loss": 0.9820771217346191, + "mean_token_accuracy": 0.6814178228378296, + "num_tokens": 847371.0, + "step": 11 + }, + { + "entropy": 1.016791969537735, + "epoch": 0.15946843853820597, + "grad_norm": 0.09400399029254913, + "learning_rate": 0.0002, + "loss": 0.9312019348144531, + "mean_token_accuracy": 0.6897322982549667, + "num_tokens": 923630.0, + "step": 12 + }, + { + "entropy": 0.9511139243841171, + "epoch": 0.17275747508305647, + "grad_norm": 0.09321432560682297, + "learning_rate": 0.0002, + "loss": 0.9056980609893799, + "mean_token_accuracy": 0.6875409334897995, + "num_tokens": 1000432.0, + "step": 13 + }, + { + "entropy": 0.8801429569721222, + "epoch": 0.18604651162790697, + "grad_norm": 0.09821294248104095, + "learning_rate": 0.0002, + "loss": 0.871140718460083, + "mean_token_accuracy": 0.692296713590622, + "num_tokens": 1077348.0, + "step": 14 + }, + { + "entropy": 0.8406370431184769, + "epoch": 0.19933554817275748, + "grad_norm": 0.09626225382089615, + "learning_rate": 0.0002, + "loss": 0.85018390417099, + "mean_token_accuracy": 0.6941163539886475, + "num_tokens": 1153872.0, + "step": 15 + }, + { + "entropy": 0.7903019487857819, + "epoch": 0.21262458471760798, + "grad_norm": 0.08542217314243317, + "learning_rate": 0.0002, + "loss": 0.7919514179229736, + "mean_token_accuracy": 0.7115834504365921, + "num_tokens": 1231939.0, + "step": 16 + }, + { + "entropy": 0.8033469468355179, + "epoch": 0.22591362126245848, + "grad_norm": 0.0788746327161789, + "learning_rate": 0.0002, + "loss": 0.7911616563796997, + "mean_token_accuracy": 0.7051160037517548, + "num_tokens": 1308393.0, + "step": 17 + }, + { + "entropy": 0.7930255830287933, + "epoch": 0.23920265780730898, + "grad_norm": 0.09115136414766312, + "learning_rate": 0.0002, + "loss": 0.7672959566116333, + "mean_token_accuracy": 0.7108412981033325, + "num_tokens": 1385266.0, + "step": 18 + }, + { + "entropy": 0.7890239208936691, + "epoch": 0.25249169435215946, + "grad_norm": 0.08325205743312836, + "learning_rate": 0.0002, + "loss": 0.7619231343269348, + "mean_token_accuracy": 0.7112641334533691, + "num_tokens": 1462104.0, + "step": 19 + }, + { + "entropy": 0.7456277012825012, + "epoch": 0.26578073089701, + "grad_norm": 0.0718981996178627, + "learning_rate": 0.0002, + "loss": 0.7284970283508301, + "mean_token_accuracy": 0.7222618609666824, + "num_tokens": 1540189.0, + "step": 20 + }, + { + "entropy": 0.7269423454999924, + "epoch": 0.27906976744186046, + "grad_norm": 0.06821414083242416, + "learning_rate": 0.0002, + "loss": 0.7141512632369995, + "mean_token_accuracy": 0.7253042161464691, + "num_tokens": 1617227.0, + "step": 21 + }, + { + "entropy": 0.7203116118907928, + "epoch": 0.292358803986711, + "grad_norm": 0.08054713159799576, + "learning_rate": 0.0002, + "loss": 0.7158239483833313, + "mean_token_accuracy": 0.7215390652418137, + "num_tokens": 1694721.0, + "step": 22 + }, + { + "entropy": 0.7209072113037109, + "epoch": 0.30564784053156147, + "grad_norm": 0.07433964312076569, + "learning_rate": 0.0002, + "loss": 0.7111976146697998, + "mean_token_accuracy": 0.7223243564367294, + "num_tokens": 1772011.0, + "step": 23 + }, + { + "entropy": 0.6966264992952347, + "epoch": 0.31893687707641194, + "grad_norm": 0.062079496681690216, + "learning_rate": 0.0002, + "loss": 0.6817796230316162, + "mean_token_accuracy": 0.7308934032917023, + "num_tokens": 1849187.0, + "step": 24 + }, + { + "entropy": 0.6859240978956223, + "epoch": 0.33222591362126247, + "grad_norm": 0.05567821115255356, + "learning_rate": 0.0002, + "loss": 0.6765352487564087, + "mean_token_accuracy": 0.7338166683912277, + "num_tokens": 1926706.0, + "step": 25 + }, + { + "entropy": 0.6890190839767456, + "epoch": 0.34551495016611294, + "grad_norm": 0.061284177005290985, + "learning_rate": 0.0002, + "loss": 0.6843230128288269, + "mean_token_accuracy": 0.7304094433784485, + "num_tokens": 2003441.0, + "step": 26 + }, + { + "entropy": 0.6757776588201523, + "epoch": 0.3588039867109635, + "grad_norm": 0.0667528584599495, + "learning_rate": 0.0002, + "loss": 0.6786775588989258, + "mean_token_accuracy": 0.7338518500328064, + "num_tokens": 2079773.0, + "step": 27 + }, + { + "entropy": 0.6639043688774109, + "epoch": 0.37209302325581395, + "grad_norm": 0.06810814887285233, + "learning_rate": 0.0002, + "loss": 0.6645445823669434, + "mean_token_accuracy": 0.7401989549398422, + "num_tokens": 2156620.0, + "step": 28 + }, + { + "entropy": 0.6565608233213425, + "epoch": 0.3853820598006645, + "grad_norm": 0.08254855126142502, + "learning_rate": 0.0002, + "loss": 0.6565409898757935, + "mean_token_accuracy": 0.7424292862415314, + "num_tokens": 2234590.0, + "step": 29 + }, + { + "entropy": 0.6681215614080429, + "epoch": 0.39867109634551495, + "grad_norm": 0.055675048381090164, + "learning_rate": 0.0002, + "loss": 0.6622647047042847, + "mean_token_accuracy": 0.7392790168523788, + "num_tokens": 2310873.0, + "step": 30 + }, + { + "entropy": 0.6501797735691071, + "epoch": 0.4119601328903654, + "grad_norm": 0.06277249753475189, + "learning_rate": 0.0002, + "loss": 0.6405087113380432, + "mean_token_accuracy": 0.7475987821817398, + "num_tokens": 2387958.0, + "step": 31 + }, + { + "entropy": 0.6630964279174805, + "epoch": 0.42524916943521596, + "grad_norm": 0.04983459413051605, + "learning_rate": 0.0002, + "loss": 0.6560376882553101, + "mean_token_accuracy": 0.7404419034719467, + "num_tokens": 2464655.0, + "step": 32 + }, + { + "entropy": 0.6463229656219482, + "epoch": 0.43853820598006643, + "grad_norm": 0.057940058410167694, + "learning_rate": 0.0002, + "loss": 0.6427592039108276, + "mean_token_accuracy": 0.7448015511035919, + "num_tokens": 2542565.0, + "step": 33 + }, + { + "entropy": 0.6510194540023804, + "epoch": 0.45182724252491696, + "grad_norm": 0.051239825785160065, + "learning_rate": 0.0002, + "loss": 0.6500669717788696, + "mean_token_accuracy": 0.7419901490211487, + "num_tokens": 2619587.0, + "step": 34 + }, + { + "entropy": 0.6514755338430405, + "epoch": 0.46511627906976744, + "grad_norm": 0.047699857503175735, + "learning_rate": 0.0002, + "loss": 0.6523705720901489, + "mean_token_accuracy": 0.7411993145942688, + "num_tokens": 2697337.0, + "step": 35 + }, + { + "entropy": 0.6403260231018066, + "epoch": 0.47840531561461797, + "grad_norm": 0.05285811051726341, + "learning_rate": 0.0002, + "loss": 0.64084792137146, + "mean_token_accuracy": 0.7455829083919525, + "num_tokens": 2774952.0, + "step": 36 + }, + { + "entropy": 0.6452134400606155, + "epoch": 0.49169435215946844, + "grad_norm": 0.04835190623998642, + "learning_rate": 0.0002, + "loss": 0.6418968439102173, + "mean_token_accuracy": 0.7455920875072479, + "num_tokens": 2852362.0, + "step": 37 + }, + { + "entropy": 0.6381319016218185, + "epoch": 0.5049833887043189, + "grad_norm": 0.0392417386174202, + "learning_rate": 0.0002, + "loss": 0.6349405646324158, + "mean_token_accuracy": 0.7478068023920059, + "num_tokens": 2928832.0, + "step": 38 + }, + { + "entropy": 0.6351741403341293, + "epoch": 0.5182724252491694, + "grad_norm": 0.04395252466201782, + "learning_rate": 0.0002, + "loss": 0.6348677277565002, + "mean_token_accuracy": 0.7502338886260986, + "num_tokens": 3006905.0, + "step": 39 + }, + { + "entropy": 0.6367054581642151, + "epoch": 0.53156146179402, + "grad_norm": 0.03797860071063042, + "learning_rate": 0.0002, + "loss": 0.637786328792572, + "mean_token_accuracy": 0.7473134547472, + "num_tokens": 3083226.0, + "step": 40 + }, + { + "entropy": 0.6302400976419449, + "epoch": 0.5448504983388704, + "grad_norm": 0.04471680149435997, + "learning_rate": 0.0002, + "loss": 0.6324583888053894, + "mean_token_accuracy": 0.7488639950752258, + "num_tokens": 3159758.0, + "step": 41 + }, + { + "entropy": 0.6376523673534393, + "epoch": 0.5581395348837209, + "grad_norm": 0.03543337062001228, + "learning_rate": 0.0002, + "loss": 0.635400652885437, + "mean_token_accuracy": 0.7479510009288788, + "num_tokens": 3237257.0, + "step": 42 + }, + { + "entropy": 0.6355589032173157, + "epoch": 0.5714285714285714, + "grad_norm": 0.03427452594041824, + "learning_rate": 0.0002, + "loss": 0.6347056031227112, + "mean_token_accuracy": 0.7467037290334702, + "num_tokens": 3314343.0, + "step": 43 + }, + { + "entropy": 0.6208891570568085, + "epoch": 0.584717607973422, + "grad_norm": 0.033996518701314926, + "learning_rate": 0.0002, + "loss": 0.618794322013855, + "mean_token_accuracy": 0.7535620033740997, + "num_tokens": 3393198.0, + "step": 44 + }, + { + "entropy": 0.6390635222196579, + "epoch": 0.5980066445182725, + "grad_norm": 0.03224889189004898, + "learning_rate": 0.0002, + "loss": 0.6415340304374695, + "mean_token_accuracy": 0.7460517883300781, + "num_tokens": 3469250.0, + "step": 45 + }, + { + "entropy": 0.6261286735534668, + "epoch": 0.6112956810631229, + "grad_norm": 0.04010876268148422, + "learning_rate": 0.0002, + "loss": 0.621030330657959, + "mean_token_accuracy": 0.7536878883838654, + "num_tokens": 3546143.0, + "step": 46 + }, + { + "entropy": 0.6229505985975266, + "epoch": 0.6245847176079734, + "grad_norm": 0.024563085287809372, + "learning_rate": 0.0002, + "loss": 0.6213774681091309, + "mean_token_accuracy": 0.7527979761362076, + "num_tokens": 3622674.0, + "step": 47 + }, + { + "entropy": 0.6298186033964157, + "epoch": 0.6378737541528239, + "grad_norm": 0.038946483284235, + "learning_rate": 0.0002, + "loss": 0.6281483173370361, + "mean_token_accuracy": 0.7499598264694214, + "num_tokens": 3699454.0, + "step": 48 + }, + { + "entropy": 0.629898801445961, + "epoch": 0.6511627906976745, + "grad_norm": 0.029423469677567482, + "learning_rate": 0.0002, + "loss": 0.6269102096557617, + "mean_token_accuracy": 0.7491558194160461, + "num_tokens": 3775954.0, + "step": 49 + }, + { + "entropy": 0.6194917857646942, + "epoch": 0.6644518272425249, + "grad_norm": 0.03048616088926792, + "learning_rate": 0.0002, + "loss": 0.6176614761352539, + "mean_token_accuracy": 0.7542635649442673, + "num_tokens": 3853666.0, + "step": 50 + }, + { + "entropy": 0.6288475841283798, + "epoch": 0.6777408637873754, + "grad_norm": 0.024089554324746132, + "learning_rate": 0.0002, + "loss": 0.6285361051559448, + "mean_token_accuracy": 0.7502647340297699, + "num_tokens": 3930580.0, + "step": 51 + }, + { + "entropy": 0.630060225725174, + "epoch": 0.6910299003322259, + "grad_norm": 0.02456744946539402, + "learning_rate": 0.0002, + "loss": 0.6316722631454468, + "mean_token_accuracy": 0.7478295862674713, + "num_tokens": 4008361.0, + "step": 52 + }, + { + "entropy": 0.616634801030159, + "epoch": 0.7043189368770764, + "grad_norm": 0.027101170271635056, + "learning_rate": 0.0002, + "loss": 0.6193246841430664, + "mean_token_accuracy": 0.7523616254329681, + "num_tokens": 4084978.0, + "step": 53 + }, + { + "entropy": 0.6331924647092819, + "epoch": 0.717607973421927, + "grad_norm": 0.024089930579066277, + "learning_rate": 0.0002, + "loss": 0.635392427444458, + "mean_token_accuracy": 0.7456516772508621, + "num_tokens": 4163011.0, + "step": 54 + }, + { + "entropy": 0.6317191421985626, + "epoch": 0.7308970099667774, + "grad_norm": 0.023995358496904373, + "learning_rate": 0.0002, + "loss": 0.6338692903518677, + "mean_token_accuracy": 0.7470207065343857, + "num_tokens": 4240203.0, + "step": 55 + }, + { + "entropy": 0.624017983675003, + "epoch": 0.7441860465116279, + "grad_norm": 0.02172154001891613, + "learning_rate": 0.0002, + "loss": 0.6213433742523193, + "mean_token_accuracy": 0.7516606599092484, + "num_tokens": 4317184.0, + "step": 56 + }, + { + "entropy": 0.6348051577806473, + "epoch": 0.7574750830564784, + "grad_norm": 0.020663734525442123, + "learning_rate": 0.0002, + "loss": 0.6317377686500549, + "mean_token_accuracy": 0.7475810945034027, + "num_tokens": 4394073.0, + "step": 57 + }, + { + "entropy": 0.6199813932180405, + "epoch": 0.770764119601329, + "grad_norm": 0.022987928241491318, + "learning_rate": 0.0002, + "loss": 0.6143967509269714, + "mean_token_accuracy": 0.7555971294641495, + "num_tokens": 4471745.0, + "step": 58 + }, + { + "entropy": 0.6262989342212677, + "epoch": 0.7840531561461794, + "grad_norm": 0.023222770541906357, + "learning_rate": 0.0002, + "loss": 0.6190211772918701, + "mean_token_accuracy": 0.752941370010376, + "num_tokens": 4548128.0, + "step": 59 + }, + { + "entropy": 0.6274468749761581, + "epoch": 0.7973421926910299, + "grad_norm": 0.02218114212155342, + "learning_rate": 0.0002, + "loss": 0.6246206760406494, + "mean_token_accuracy": 0.7506777495145798, + "num_tokens": 4625224.0, + "step": 60 + }, + { + "entropy": 0.6210617572069168, + "epoch": 0.8106312292358804, + "grad_norm": 0.024545960128307343, + "learning_rate": 0.0002, + "loss": 0.6223740577697754, + "mean_token_accuracy": 0.7492077946662903, + "num_tokens": 4703042.0, + "step": 61 + }, + { + "entropy": 0.6245881468057632, + "epoch": 0.8239202657807309, + "grad_norm": 0.029528915882110596, + "learning_rate": 0.0002, + "loss": 0.6285632848739624, + "mean_token_accuracy": 0.7494110465049744, + "num_tokens": 4779244.0, + "step": 62 + }, + { + "entropy": 0.6198074072599411, + "epoch": 0.8372093023255814, + "grad_norm": 0.023333575576543808, + "learning_rate": 0.0002, + "loss": 0.6192362308502197, + "mean_token_accuracy": 0.7524196207523346, + "num_tokens": 4857457.0, + "step": 63 + }, + { + "entropy": 0.633359968662262, + "epoch": 0.8504983388704319, + "grad_norm": 0.0235088299959898, + "learning_rate": 0.0002, + "loss": 0.6320174932479858, + "mean_token_accuracy": 0.7467200756072998, + "num_tokens": 4933407.0, + "step": 64 + }, + { + "entropy": 0.6193127632141113, + "epoch": 0.8637873754152824, + "grad_norm": 0.02574855461716652, + "learning_rate": 0.0002, + "loss": 0.6140483021736145, + "mean_token_accuracy": 0.7537259012460709, + "num_tokens": 5009918.0, + "step": 65 + }, + { + "entropy": 0.6258151680231094, + "epoch": 0.8770764119601329, + "grad_norm": 0.022545455023646355, + "learning_rate": 0.0002, + "loss": 0.6209959387779236, + "mean_token_accuracy": 0.7510837912559509, + "num_tokens": 5087830.0, + "step": 66 + }, + { + "entropy": 0.6285541504621506, + "epoch": 0.8903654485049833, + "grad_norm": 0.024571102112531662, + "learning_rate": 0.0002, + "loss": 0.6246232986450195, + "mean_token_accuracy": 0.7501810193061829, + "num_tokens": 5164939.0, + "step": 67 + }, + { + "entropy": 0.6188823282718658, + "epoch": 0.9036544850498339, + "grad_norm": 0.025842731818556786, + "learning_rate": 0.0002, + "loss": 0.6188026666641235, + "mean_token_accuracy": 0.7524883896112442, + "num_tokens": 5242253.0, + "step": 68 + }, + { + "entropy": 0.6232005655765533, + "epoch": 0.9169435215946844, + "grad_norm": 0.02302289754152298, + "learning_rate": 0.0002, + "loss": 0.6259397268295288, + "mean_token_accuracy": 0.7492635697126389, + "num_tokens": 5318706.0, + "step": 69 + }, + { + "entropy": 0.6116026937961578, + "epoch": 0.9302325581395349, + "grad_norm": 0.02471403032541275, + "learning_rate": 0.0002, + "loss": 0.6138839721679688, + "mean_token_accuracy": 0.7528299242258072, + "num_tokens": 5395336.0, + "step": 70 + }, + { + "entropy": 0.618821457028389, + "epoch": 0.9435215946843853, + "grad_norm": 0.023918448016047478, + "learning_rate": 0.0002, + "loss": 0.6226047277450562, + "mean_token_accuracy": 0.7493781894445419, + "num_tokens": 5471175.0, + "step": 71 + }, + { + "entropy": 0.6161183714866638, + "epoch": 0.9568106312292359, + "grad_norm": 0.024829547852277756, + "learning_rate": 0.0002, + "loss": 0.6122779846191406, + "mean_token_accuracy": 0.754673570394516, + "num_tokens": 5548409.0, + "step": 72 + }, + { + "entropy": 0.621030643582344, + "epoch": 0.9700996677740864, + "grad_norm": 0.024347985163331032, + "learning_rate": 0.0002, + "loss": 0.6146630048751831, + "mean_token_accuracy": 0.7522032558917999, + "num_tokens": 5625017.0, + "step": 73 + }, + { + "entropy": 0.6309276968240738, + "epoch": 0.9833887043189369, + "grad_norm": 0.022102857008576393, + "learning_rate": 0.0002, + "loss": 0.6264951229095459, + "mean_token_accuracy": 0.7490104138851166, + "num_tokens": 5702215.0, + "step": 74 + }, + { + "entropy": 0.6195333749055862, + "epoch": 0.9966777408637874, + "grad_norm": 0.021700864657759666, + "learning_rate": 0.0002, + "loss": 0.6143898963928223, + "mean_token_accuracy": 0.7532503306865692, + "num_tokens": 5780519.0, + "step": 75 + }, + { + "entropy": 0.6297195553779602, + "epoch": 1.0, + "grad_norm": 0.03480999171733856, + "learning_rate": 0.0002, + "loss": 0.6311229467391968, + "mean_token_accuracy": 0.745398759841919, + "num_tokens": 5799555.0, + "step": 76 + }, + { + "entropy": 0.6155448108911514, + "epoch": 1.0132890365448506, + "grad_norm": 0.023401184007525444, + "learning_rate": 0.0002, + "loss": 0.6173519492149353, + "mean_token_accuracy": 0.7522856891155243, + "num_tokens": 5876962.0, + "step": 77 + }, + { + "entropy": 0.6246323734521866, + "epoch": 1.026578073089701, + "grad_norm": 0.022852230817079544, + "learning_rate": 0.0002, + "loss": 0.6256575584411621, + "mean_token_accuracy": 0.7486253380775452, + "num_tokens": 5953753.0, + "step": 78 + }, + { + "entropy": 0.6294799596071243, + "epoch": 1.0398671096345515, + "grad_norm": 0.022332875058054924, + "learning_rate": 0.0002, + "loss": 0.627347469329834, + "mean_token_accuracy": 0.7484346181154251, + "num_tokens": 6031156.0, + "step": 79 + }, + { + "entropy": 0.6130478978157043, + "epoch": 1.053156146179402, + "grad_norm": 0.022138696163892746, + "learning_rate": 0.0002, + "loss": 0.6106399893760681, + "mean_token_accuracy": 0.755229189991951, + "num_tokens": 6109095.0, + "step": 80 + }, + { + "entropy": 0.6223983317613602, + "epoch": 1.0664451827242525, + "grad_norm": 0.022859349846839905, + "learning_rate": 0.0002, + "loss": 0.6226997375488281, + "mean_token_accuracy": 0.7491207867860794, + "num_tokens": 6186352.0, + "step": 81 + }, + { + "entropy": 0.6232358813285828, + "epoch": 1.079734219269103, + "grad_norm": 0.01912062056362629, + "learning_rate": 0.0002, + "loss": 0.6226857900619507, + "mean_token_accuracy": 0.749756470322609, + "num_tokens": 6262924.0, + "step": 82 + }, + { + "entropy": 0.6186039000749588, + "epoch": 1.0930232558139534, + "grad_norm": 0.023234324529767036, + "learning_rate": 0.0002, + "loss": 0.6204067468643188, + "mean_token_accuracy": 0.7503676414489746, + "num_tokens": 6339829.0, + "step": 83 + }, + { + "entropy": 0.6187210232019424, + "epoch": 1.106312292358804, + "grad_norm": 0.01966855302453041, + "learning_rate": 0.0002, + "loss": 0.6205964684486389, + "mean_token_accuracy": 0.7499649524688721, + "num_tokens": 6417932.0, + "step": 84 + }, + { + "entropy": 0.6108027994632721, + "epoch": 1.1196013289036544, + "grad_norm": 0.02231299877166748, + "learning_rate": 0.0002, + "loss": 0.6092526912689209, + "mean_token_accuracy": 0.755171075463295, + "num_tokens": 6495236.0, + "step": 85 + }, + { + "entropy": 0.6252855509519577, + "epoch": 1.132890365448505, + "grad_norm": 0.02397831901907921, + "learning_rate": 0.0002, + "loss": 0.6228755712509155, + "mean_token_accuracy": 0.7505564838647842, + "num_tokens": 6571780.0, + "step": 86 + }, + { + "entropy": 0.6250486820936203, + "epoch": 1.1461794019933556, + "grad_norm": 0.021679693832993507, + "learning_rate": 0.0002, + "loss": 0.6200405955314636, + "mean_token_accuracy": 0.7508185654878616, + "num_tokens": 6648008.0, + "step": 87 + }, + { + "entropy": 0.6233238279819489, + "epoch": 1.159468438538206, + "grad_norm": 0.01941733807325363, + "learning_rate": 0.0002, + "loss": 0.6168190240859985, + "mean_token_accuracy": 0.7522764652967453, + "num_tokens": 6724624.0, + "step": 88 + }, + { + "entropy": 0.6189088374376297, + "epoch": 1.1727574750830565, + "grad_norm": 0.02111164852976799, + "learning_rate": 0.0002, + "loss": 0.6196113228797913, + "mean_token_accuracy": 0.7506090253591537, + "num_tokens": 6800925.0, + "step": 89 + }, + { + "entropy": 0.6136585921049118, + "epoch": 1.1860465116279069, + "grad_norm": 0.01873047649860382, + "learning_rate": 0.0002, + "loss": 0.6147369146347046, + "mean_token_accuracy": 0.753093421459198, + "num_tokens": 6877907.0, + "step": 90 + }, + { + "entropy": 0.6133056879043579, + "epoch": 1.1993355481727574, + "grad_norm": 0.02167166955769062, + "learning_rate": 0.0002, + "loss": 0.6140564680099487, + "mean_token_accuracy": 0.7525176405906677, + "num_tokens": 6954865.0, + "step": 91 + }, + { + "entropy": 0.6283499300479889, + "epoch": 1.212624584717608, + "grad_norm": 0.021320724859833717, + "learning_rate": 0.0002, + "loss": 0.6233468651771545, + "mean_token_accuracy": 0.7499544322490692, + "num_tokens": 7031714.0, + "step": 92 + }, + { + "entropy": 0.6230917423963547, + "epoch": 1.2259136212624584, + "grad_norm": 0.020842526108026505, + "learning_rate": 0.0002, + "loss": 0.6210839748382568, + "mean_token_accuracy": 0.7498301565647125, + "num_tokens": 7107656.0, + "step": 93 + }, + { + "entropy": 0.6245012730360031, + "epoch": 1.239202657807309, + "grad_norm": 0.02319970726966858, + "learning_rate": 0.0002, + "loss": 0.6247711181640625, + "mean_token_accuracy": 0.7482653558254242, + "num_tokens": 7184588.0, + "step": 94 + }, + { + "entropy": 0.621661052107811, + "epoch": 1.2524916943521593, + "grad_norm": 0.020472005009651184, + "learning_rate": 0.0002, + "loss": 0.6205976605415344, + "mean_token_accuracy": 0.7511607855558395, + "num_tokens": 7262128.0, + "step": 95 + }, + { + "entropy": 0.6095613390207291, + "epoch": 1.26578073089701, + "grad_norm": 0.02212020941078663, + "learning_rate": 0.0002, + "loss": 0.6093997955322266, + "mean_token_accuracy": 0.7555146813392639, + "num_tokens": 7339113.0, + "step": 96 + }, + { + "entropy": 0.6145715415477753, + "epoch": 1.2790697674418605, + "grad_norm": 0.02165311761200428, + "learning_rate": 0.0002, + "loss": 0.6127168536186218, + "mean_token_accuracy": 0.7532989978790283, + "num_tokens": 7416501.0, + "step": 97 + }, + { + "entropy": 0.6266685277223587, + "epoch": 1.292358803986711, + "grad_norm": 0.02169322967529297, + "learning_rate": 0.0002, + "loss": 0.6243869662284851, + "mean_token_accuracy": 0.7484752535820007, + "num_tokens": 7493281.0, + "step": 98 + }, + { + "entropy": 0.6184320002794266, + "epoch": 1.3056478405315615, + "grad_norm": 0.0211771372705698, + "learning_rate": 0.0002, + "loss": 0.6157566905021667, + "mean_token_accuracy": 0.752418577671051, + "num_tokens": 7570464.0, + "step": 99 + }, + { + "entropy": 0.6127575635910034, + "epoch": 1.3189368770764118, + "grad_norm": 0.02210194058716297, + "learning_rate": 0.0002, + "loss": 0.6128020286560059, + "mean_token_accuracy": 0.7543350905179977, + "num_tokens": 7646649.0, + "step": 100 + }, + { + "entropy": 0.612200528383255, + "epoch": 1.3322259136212624, + "grad_norm": 0.022352103143930435, + "learning_rate": 0.0002, + "loss": 0.6118579506874084, + "mean_token_accuracy": 0.7532858699560165, + "num_tokens": 7723836.0, + "step": 101 + }, + { + "entropy": 0.6052316725254059, + "epoch": 1.345514950166113, + "grad_norm": 0.02019244246184826, + "learning_rate": 0.0002, + "loss": 0.603766679763794, + "mean_token_accuracy": 0.7570021897554398, + "num_tokens": 7802209.0, + "step": 102 + }, + { + "entropy": 0.6166553497314453, + "epoch": 1.3588039867109636, + "grad_norm": 0.01797507330775261, + "learning_rate": 0.0002, + "loss": 0.616031289100647, + "mean_token_accuracy": 0.7518447786569595, + "num_tokens": 7880014.0, + "step": 103 + }, + { + "entropy": 0.6216948330402374, + "epoch": 1.372093023255814, + "grad_norm": 0.020605172961950302, + "learning_rate": 0.0002, + "loss": 0.6161950826644897, + "mean_token_accuracy": 0.7535870969295502, + "num_tokens": 7956944.0, + "step": 104 + }, + { + "entropy": 0.611840009689331, + "epoch": 1.3853820598006645, + "grad_norm": 0.021973272785544395, + "learning_rate": 0.0002, + "loss": 0.6133339405059814, + "mean_token_accuracy": 0.7527298778295517, + "num_tokens": 8033655.0, + "step": 105 + }, + { + "entropy": 0.6033324301242828, + "epoch": 1.398671096345515, + "grad_norm": 0.02020864374935627, + "learning_rate": 0.0002, + "loss": 0.6040066480636597, + "mean_token_accuracy": 0.7564088255167007, + "num_tokens": 8111825.0, + "step": 106 + }, + { + "entropy": 0.615772470831871, + "epoch": 1.4119601328903655, + "grad_norm": 0.020991913974285126, + "learning_rate": 0.0002, + "loss": 0.6151546239852905, + "mean_token_accuracy": 0.7534815222024918, + "num_tokens": 8189709.0, + "step": 107 + }, + { + "entropy": 0.6171981394290924, + "epoch": 1.425249169435216, + "grad_norm": 0.021498622372746468, + "learning_rate": 0.0002, + "loss": 0.6125850677490234, + "mean_token_accuracy": 0.7512624114751816, + "num_tokens": 8265892.0, + "step": 108 + }, + { + "entropy": 0.6139850616455078, + "epoch": 1.4385382059800664, + "grad_norm": 0.019243517890572548, + "learning_rate": 0.0002, + "loss": 0.6125526428222656, + "mean_token_accuracy": 0.754551038146019, + "num_tokens": 8343618.0, + "step": 109 + }, + { + "entropy": 0.6268000602722168, + "epoch": 1.451827242524917, + "grad_norm": 0.01758020557463169, + "learning_rate": 0.0002, + "loss": 0.6260548830032349, + "mean_token_accuracy": 0.7474812120199203, + "num_tokens": 8420843.0, + "step": 110 + }, + { + "entropy": 0.6195523887872696, + "epoch": 1.4651162790697674, + "grad_norm": 0.019546709954738617, + "learning_rate": 0.0002, + "loss": 0.623106837272644, + "mean_token_accuracy": 0.7489201724529266, + "num_tokens": 8497047.0, + "step": 111 + }, + { + "entropy": 0.6040176898241043, + "epoch": 1.478405315614618, + "grad_norm": 0.02087543159723282, + "learning_rate": 0.0002, + "loss": 0.6014326810836792, + "mean_token_accuracy": 0.7569248229265213, + "num_tokens": 8575249.0, + "step": 112 + }, + { + "entropy": 0.6175996363162994, + "epoch": 1.4916943521594686, + "grad_norm": 0.019000006839632988, + "learning_rate": 0.0002, + "loss": 0.6130571961402893, + "mean_token_accuracy": 0.7541480958461761, + "num_tokens": 8653473.0, + "step": 113 + }, + { + "entropy": 0.6209008097648621, + "epoch": 1.504983388704319, + "grad_norm": 0.018268495798110962, + "learning_rate": 0.0002, + "loss": 0.6194300651550293, + "mean_token_accuracy": 0.7502760142087936, + "num_tokens": 8730987.0, + "step": 114 + }, + { + "entropy": 0.6245647221803665, + "epoch": 1.5182724252491693, + "grad_norm": 0.018849894404411316, + "learning_rate": 0.0002, + "loss": 0.6210106611251831, + "mean_token_accuracy": 0.7502076923847198, + "num_tokens": 8807717.0, + "step": 115 + }, + { + "entropy": 0.6183042079210281, + "epoch": 1.5315614617940199, + "grad_norm": 0.01850067265331745, + "learning_rate": 0.0002, + "loss": 0.6139713525772095, + "mean_token_accuracy": 0.7533506751060486, + "num_tokens": 8884648.0, + "step": 116 + }, + { + "entropy": 0.6245974451303482, + "epoch": 1.5448504983388704, + "grad_norm": 0.020130403339862823, + "learning_rate": 0.0002, + "loss": 0.6242485046386719, + "mean_token_accuracy": 0.748986542224884, + "num_tokens": 8961668.0, + "step": 117 + }, + { + "entropy": 0.6045528948307037, + "epoch": 1.558139534883721, + "grad_norm": 0.023585041984915733, + "learning_rate": 0.0002, + "loss": 0.6086483597755432, + "mean_token_accuracy": 0.754342183470726, + "num_tokens": 9038662.0, + "step": 118 + }, + { + "entropy": 0.6051427721977234, + "epoch": 1.5714285714285714, + "grad_norm": 0.020509056746959686, + "learning_rate": 0.0002, + "loss": 0.6038928031921387, + "mean_token_accuracy": 0.7558873742818832, + "num_tokens": 9115878.0, + "step": 119 + }, + { + "entropy": 0.6210778206586838, + "epoch": 1.584717607973422, + "grad_norm": 0.018983472138643265, + "learning_rate": 0.0002, + "loss": 0.6190018653869629, + "mean_token_accuracy": 0.7505859136581421, + "num_tokens": 9193137.0, + "step": 120 + }, + { + "entropy": 0.6255708932876587, + "epoch": 1.5980066445182723, + "grad_norm": 0.02053634636104107, + "learning_rate": 0.0002, + "loss": 0.6212979555130005, + "mean_token_accuracy": 0.7490561902523041, + "num_tokens": 9269704.0, + "step": 121 + }, + { + "entropy": 0.6224274635314941, + "epoch": 1.611295681063123, + "grad_norm": 0.019471660256385803, + "learning_rate": 0.0002, + "loss": 0.6190239191055298, + "mean_token_accuracy": 0.750290259718895, + "num_tokens": 9347396.0, + "step": 122 + }, + { + "entropy": 0.6200169771909714, + "epoch": 1.6245847176079735, + "grad_norm": 0.01963883824646473, + "learning_rate": 0.0002, + "loss": 0.6168637871742249, + "mean_token_accuracy": 0.7503404319286346, + "num_tokens": 9424266.0, + "step": 123 + }, + { + "entropy": 0.6060867607593536, + "epoch": 1.6378737541528239, + "grad_norm": 0.020356209948658943, + "learning_rate": 0.0002, + "loss": 0.6069276332855225, + "mean_token_accuracy": 0.7539948225021362, + "num_tokens": 9501476.0, + "step": 124 + }, + { + "entropy": 0.6077988147735596, + "epoch": 1.6511627906976745, + "grad_norm": 0.020215313881635666, + "learning_rate": 0.0002, + "loss": 0.6037485599517822, + "mean_token_accuracy": 0.7572648674249649, + "num_tokens": 9579023.0, + "step": 125 + }, + { + "entropy": 0.6222731024026871, + "epoch": 1.6644518272425248, + "grad_norm": 0.021222807466983795, + "learning_rate": 0.0002, + "loss": 0.6259433031082153, + "mean_token_accuracy": 0.7491642236709595, + "num_tokens": 9656167.0, + "step": 126 + }, + { + "entropy": 0.6067023426294327, + "epoch": 1.6777408637873754, + "grad_norm": 0.01992393285036087, + "learning_rate": 0.0002, + "loss": 0.604471743106842, + "mean_token_accuracy": 0.7570877373218536, + "num_tokens": 9733224.0, + "step": 127 + }, + { + "entropy": 0.6153317838907242, + "epoch": 1.691029900332226, + "grad_norm": 0.018730230629444122, + "learning_rate": 0.0002, + "loss": 0.6140354871749878, + "mean_token_accuracy": 0.7516682893037796, + "num_tokens": 9810897.0, + "step": 128 + }, + { + "entropy": 0.6132084429264069, + "epoch": 1.7043189368770764, + "grad_norm": 0.02278308942914009, + "learning_rate": 0.0002, + "loss": 0.6116592884063721, + "mean_token_accuracy": 0.7542857527732849, + "num_tokens": 9888143.0, + "step": 129 + }, + { + "entropy": 0.6155333071947098, + "epoch": 1.717607973421927, + "grad_norm": 0.018389983102679253, + "learning_rate": 0.0002, + "loss": 0.6164166927337646, + "mean_token_accuracy": 0.7513966411352158, + "num_tokens": 9964562.0, + "step": 130 + }, + { + "entropy": 0.6257398724555969, + "epoch": 1.7308970099667773, + "grad_norm": 0.0222679041326046, + "learning_rate": 0.0002, + "loss": 0.6244347095489502, + "mean_token_accuracy": 0.746750995516777, + "num_tokens": 10041889.0, + "step": 131 + }, + { + "entropy": 0.6176516264677048, + "epoch": 1.744186046511628, + "grad_norm": 0.023927317932248116, + "learning_rate": 0.0002, + "loss": 0.6160902380943298, + "mean_token_accuracy": 0.7516377419233322, + "num_tokens": 10119032.0, + "step": 132 + }, + { + "entropy": 0.6168064475059509, + "epoch": 1.7574750830564785, + "grad_norm": 0.022455649450421333, + "learning_rate": 0.0002, + "loss": 0.6156400442123413, + "mean_token_accuracy": 0.7509373724460602, + "num_tokens": 10195982.0, + "step": 133 + }, + { + "entropy": 0.6134222745895386, + "epoch": 1.770764119601329, + "grad_norm": 0.022489670664072037, + "learning_rate": 0.0002, + "loss": 0.609217643737793, + "mean_token_accuracy": 0.7540788650512695, + "num_tokens": 10273546.0, + "step": 134 + }, + { + "entropy": 0.6264749467372894, + "epoch": 1.7840531561461794, + "grad_norm": 0.020588450133800507, + "learning_rate": 0.0002, + "loss": 0.6276311874389648, + "mean_token_accuracy": 0.7467976957559586, + "num_tokens": 10350201.0, + "step": 135 + }, + { + "entropy": 0.617802083492279, + "epoch": 1.7973421926910298, + "grad_norm": 0.022901175543665886, + "learning_rate": 0.0002, + "loss": 0.6194970607757568, + "mean_token_accuracy": 0.748701885342598, + "num_tokens": 10426453.0, + "step": 136 + }, + { + "entropy": 0.6245028972625732, + "epoch": 1.8106312292358804, + "grad_norm": 0.023188933730125427, + "learning_rate": 0.0002, + "loss": 0.6228166222572327, + "mean_token_accuracy": 0.7493370622396469, + "num_tokens": 10504425.0, + "step": 137 + }, + { + "entropy": 0.6234703809022903, + "epoch": 1.823920265780731, + "grad_norm": 0.021458793431520462, + "learning_rate": 0.0002, + "loss": 0.6192694902420044, + "mean_token_accuracy": 0.7504332214593887, + "num_tokens": 10581329.0, + "step": 138 + }, + { + "entropy": 0.6237349808216095, + "epoch": 1.8372093023255816, + "grad_norm": 0.019868241623044014, + "learning_rate": 0.0002, + "loss": 0.6175291538238525, + "mean_token_accuracy": 0.75069360435009, + "num_tokens": 10657436.0, + "step": 139 + }, + { + "entropy": 0.6118619441986084, + "epoch": 1.850498338870432, + "grad_norm": 0.02374374121427536, + "learning_rate": 0.0002, + "loss": 0.612147331237793, + "mean_token_accuracy": 0.7540915310382843, + "num_tokens": 10734436.0, + "step": 140 + }, + { + "entropy": 0.6119570136070251, + "epoch": 1.8637873754152823, + "grad_norm": 0.021657617762684822, + "learning_rate": 0.0002, + "loss": 0.613890528678894, + "mean_token_accuracy": 0.7516901344060898, + "num_tokens": 10811567.0, + "step": 141 + }, + { + "entropy": 0.6127304881811142, + "epoch": 1.8770764119601329, + "grad_norm": 0.02199709787964821, + "learning_rate": 0.0002, + "loss": 0.6144627332687378, + "mean_token_accuracy": 0.7525850534439087, + "num_tokens": 10889817.0, + "step": 142 + }, + { + "entropy": 0.6066692769527435, + "epoch": 1.8903654485049834, + "grad_norm": 0.021036647260189056, + "learning_rate": 0.0002, + "loss": 0.6056303977966309, + "mean_token_accuracy": 0.7554345726966858, + "num_tokens": 10965918.0, + "step": 143 + }, + { + "entropy": 0.6308126002550125, + "epoch": 1.903654485049834, + "grad_norm": 0.021853173151612282, + "learning_rate": 0.0002, + "loss": 0.6275626420974731, + "mean_token_accuracy": 0.7469644248485565, + "num_tokens": 11042656.0, + "step": 144 + }, + { + "entropy": 0.6248054802417755, + "epoch": 1.9169435215946844, + "grad_norm": 0.01832008920609951, + "learning_rate": 0.0002, + "loss": 0.6218788623809814, + "mean_token_accuracy": 0.7486702352762222, + "num_tokens": 11119636.0, + "step": 145 + }, + { + "entropy": 0.6077689826488495, + "epoch": 1.9302325581395348, + "grad_norm": 0.020590562373399734, + "learning_rate": 0.0002, + "loss": 0.6078977584838867, + "mean_token_accuracy": 0.753954142332077, + "num_tokens": 11197034.0, + "step": 146 + }, + { + "entropy": 0.6224581599235535, + "epoch": 1.9435215946843853, + "grad_norm": 0.02063332125544548, + "learning_rate": 0.0002, + "loss": 0.623686671257019, + "mean_token_accuracy": 0.7492604851722717, + "num_tokens": 11273724.0, + "step": 147 + }, + { + "entropy": 0.6076382547616959, + "epoch": 1.956810631229236, + "grad_norm": 0.023211153224110603, + "learning_rate": 0.0002, + "loss": 0.6072738170623779, + "mean_token_accuracy": 0.7551898807287216, + "num_tokens": 11351227.0, + "step": 148 + }, + { + "entropy": 0.6254193186759949, + "epoch": 1.9700996677740865, + "grad_norm": 0.019823260605335236, + "learning_rate": 0.0002, + "loss": 0.6203402280807495, + "mean_token_accuracy": 0.7478555142879486, + "num_tokens": 11426932.0, + "step": 149 + }, + { + "entropy": 0.6270859688520432, + "epoch": 1.9833887043189369, + "grad_norm": 0.02455417439341545, + "learning_rate": 0.0002, + "loss": 0.6208802461624146, + "mean_token_accuracy": 0.7491328865289688, + "num_tokens": 11504314.0, + "step": 150 + }, + { + "entropy": 0.6147411018610001, + "epoch": 1.9966777408637872, + "grad_norm": 0.019483575597405434, + "learning_rate": 0.0002, + "loss": 0.6152125000953674, + "mean_token_accuracy": 0.7504801601171494, + "num_tokens": 11580048.0, + "step": 151 + }, + { + "entropy": 0.6170828342437744, + "epoch": 2.0, + "grad_norm": 0.033206261694431305, + "learning_rate": 0.0002, + "loss": 0.6186127662658691, + "mean_token_accuracy": 0.7514370679855347, + "num_tokens": 11598964.0, + "step": 152 + }, + { + "entropy": 0.6080913096666336, + "epoch": 2.0132890365448506, + "grad_norm": 0.024741163477301598, + "learning_rate": 0.0002, + "loss": 0.6090770363807678, + "mean_token_accuracy": 0.7537964433431625, + "num_tokens": 11675540.0, + "step": 153 + }, + { + "entropy": 0.6185880750417709, + "epoch": 2.026578073089701, + "grad_norm": 0.02093474380671978, + "learning_rate": 0.0002, + "loss": 0.6206169128417969, + "mean_token_accuracy": 0.7499336451292038, + "num_tokens": 11751286.0, + "step": 154 + }, + { + "entropy": 0.6125958114862442, + "epoch": 2.0398671096345513, + "grad_norm": 0.02114335261285305, + "learning_rate": 0.0002, + "loss": 0.6094862818717957, + "mean_token_accuracy": 0.7536913305521011, + "num_tokens": 11827770.0, + "step": 155 + }, + { + "entropy": 0.6116930991411209, + "epoch": 2.053156146179402, + "grad_norm": 0.02459721826016903, + "learning_rate": 0.0002, + "loss": 0.6092466115951538, + "mean_token_accuracy": 0.7562535107135773, + "num_tokens": 11904344.0, + "step": 156 + }, + { + "entropy": 0.6187087297439575, + "epoch": 2.0664451827242525, + "grad_norm": 0.022668739780783653, + "learning_rate": 0.0002, + "loss": 0.6161172986030579, + "mean_token_accuracy": 0.7519093155860901, + "num_tokens": 11980923.0, + "step": 157 + }, + { + "entropy": 0.6256630122661591, + "epoch": 2.079734219269103, + "grad_norm": 0.021594170480966568, + "learning_rate": 0.0002, + "loss": 0.6238419413566589, + "mean_token_accuracy": 0.7482917159795761, + "num_tokens": 12057499.0, + "step": 158 + }, + { + "entropy": 0.6037028580904007, + "epoch": 2.0930232558139537, + "grad_norm": 0.02383469231426716, + "learning_rate": 0.0002, + "loss": 0.6051764488220215, + "mean_token_accuracy": 0.7555714845657349, + "num_tokens": 12135243.0, + "step": 159 + }, + { + "entropy": 0.6120942682027817, + "epoch": 2.106312292358804, + "grad_norm": 0.02117961086332798, + "learning_rate": 0.0002, + "loss": 0.6129953861236572, + "mean_token_accuracy": 0.7540014684200287, + "num_tokens": 12212331.0, + "step": 160 + }, + { + "entropy": 0.6064229160547256, + "epoch": 2.1196013289036544, + "grad_norm": 0.024708833545446396, + "learning_rate": 0.0002, + "loss": 0.6064392328262329, + "mean_token_accuracy": 0.7545509487390518, + "num_tokens": 12290324.0, + "step": 161 + }, + { + "entropy": 0.619470626115799, + "epoch": 2.132890365448505, + "grad_norm": 0.01938418298959732, + "learning_rate": 0.0002, + "loss": 0.6178134679794312, + "mean_token_accuracy": 0.7504110932350159, + "num_tokens": 12368376.0, + "step": 162 + }, + { + "entropy": 0.6222792118787766, + "epoch": 2.1461794019933556, + "grad_norm": 0.02473956160247326, + "learning_rate": 0.0002, + "loss": 0.6153433322906494, + "mean_token_accuracy": 0.7508186101913452, + "num_tokens": 12445346.0, + "step": 163 + }, + { + "entropy": 0.6072852462530136, + "epoch": 2.159468438538206, + "grad_norm": 0.02353556640446186, + "learning_rate": 0.0002, + "loss": 0.6025260090827942, + "mean_token_accuracy": 0.7573738545179367, + "num_tokens": 12522887.0, + "step": 164 + }, + { + "entropy": 0.619188591837883, + "epoch": 2.1727574750830563, + "grad_norm": 0.0245651975274086, + "learning_rate": 0.0002, + "loss": 0.6182605028152466, + "mean_token_accuracy": 0.7504746615886688, + "num_tokens": 12600607.0, + "step": 165 + }, + { + "entropy": 0.6105179488658905, + "epoch": 2.186046511627907, + "grad_norm": 0.024771464988589287, + "learning_rate": 0.0002, + "loss": 0.6139010787010193, + "mean_token_accuracy": 0.7523958832025528, + "num_tokens": 12677955.0, + "step": 166 + }, + { + "entropy": 0.6116905808448792, + "epoch": 2.1993355481727574, + "grad_norm": 0.01931098662316799, + "learning_rate": 0.0002, + "loss": 0.6103055477142334, + "mean_token_accuracy": 0.7530241310596466, + "num_tokens": 12755809.0, + "step": 167 + }, + { + "entropy": 0.6136868000030518, + "epoch": 2.212624584717608, + "grad_norm": 0.02252528816461563, + "learning_rate": 0.0002, + "loss": 0.6109723448753357, + "mean_token_accuracy": 0.7527836114168167, + "num_tokens": 12831666.0, + "step": 168 + }, + { + "entropy": 0.6242966800928116, + "epoch": 2.2259136212624586, + "grad_norm": 0.020864849910140038, + "learning_rate": 0.0002, + "loss": 0.6239097118377686, + "mean_token_accuracy": 0.749090164899826, + "num_tokens": 12908442.0, + "step": 169 + }, + { + "entropy": 0.601732075214386, + "epoch": 2.2392026578073088, + "grad_norm": 0.02746833860874176, + "learning_rate": 0.0002, + "loss": 0.6067190170288086, + "mean_token_accuracy": 0.7551953494548798, + "num_tokens": 12985427.0, + "step": 170 + }, + { + "entropy": 0.6038936227560043, + "epoch": 2.2524916943521593, + "grad_norm": 0.019441375508904457, + "learning_rate": 0.0002, + "loss": 0.6017920970916748, + "mean_token_accuracy": 0.7557870447635651, + "num_tokens": 13062487.0, + "step": 171 + }, + { + "entropy": 0.6137015223503113, + "epoch": 2.26578073089701, + "grad_norm": 0.024601176381111145, + "learning_rate": 0.0002, + "loss": 0.6114258766174316, + "mean_token_accuracy": 0.7543772608041763, + "num_tokens": 13138627.0, + "step": 172 + }, + { + "entropy": 0.6104173511266708, + "epoch": 2.2790697674418605, + "grad_norm": 0.022791611030697823, + "learning_rate": 0.0002, + "loss": 0.6149581670761108, + "mean_token_accuracy": 0.7507553249597549, + "num_tokens": 13214261.0, + "step": 173 + }, + { + "entropy": 0.6144902855157852, + "epoch": 2.292358803986711, + "grad_norm": 0.018319284543395042, + "learning_rate": 0.0002, + "loss": 0.6141914129257202, + "mean_token_accuracy": 0.7522214949131012, + "num_tokens": 13291202.0, + "step": 174 + }, + { + "entropy": 0.6215455085039139, + "epoch": 2.3056478405315612, + "grad_norm": 0.025469396263360977, + "learning_rate": 0.0002, + "loss": 0.6204476356506348, + "mean_token_accuracy": 0.7488576024770737, + "num_tokens": 13368064.0, + "step": 175 + }, + { + "entropy": 0.6212230175733566, + "epoch": 2.318936877076412, + "grad_norm": 0.02412879653275013, + "learning_rate": 0.0002, + "loss": 0.6155945062637329, + "mean_token_accuracy": 0.7521145790815353, + "num_tokens": 13445653.0, + "step": 176 + }, + { + "entropy": 0.6221545487642288, + "epoch": 2.3322259136212624, + "grad_norm": 0.02200164645910263, + "learning_rate": 0.0002, + "loss": 0.6199354529380798, + "mean_token_accuracy": 0.7487577795982361, + "num_tokens": 13521614.0, + "step": 177 + }, + { + "entropy": 0.6135935038328171, + "epoch": 2.345514950166113, + "grad_norm": 0.022985126823186874, + "learning_rate": 0.0002, + "loss": 0.6104751825332642, + "mean_token_accuracy": 0.752921000123024, + "num_tokens": 13597755.0, + "step": 178 + }, + { + "entropy": 0.6188717782497406, + "epoch": 2.3588039867109636, + "grad_norm": 0.019079145044088364, + "learning_rate": 0.0002, + "loss": 0.6193943023681641, + "mean_token_accuracy": 0.7509453445672989, + "num_tokens": 13674275.0, + "step": 179 + }, + { + "entropy": 0.6063332110643387, + "epoch": 2.3720930232558137, + "grad_norm": 0.02187221497297287, + "learning_rate": 0.0002, + "loss": 0.6081176400184631, + "mean_token_accuracy": 0.7544866353273392, + "num_tokens": 13751926.0, + "step": 180 + }, + { + "entropy": 0.6089528501033783, + "epoch": 2.3853820598006643, + "grad_norm": 0.022133421152830124, + "learning_rate": 0.0002, + "loss": 0.6117560863494873, + "mean_token_accuracy": 0.7531794607639313, + "num_tokens": 13828580.0, + "step": 181 + }, + { + "entropy": 0.6238999515771866, + "epoch": 2.398671096345515, + "grad_norm": 0.019620148465037346, + "learning_rate": 0.0002, + "loss": 0.6234750747680664, + "mean_token_accuracy": 0.747876450419426, + "num_tokens": 13904990.0, + "step": 182 + }, + { + "entropy": 0.6090637892484665, + "epoch": 2.4119601328903655, + "grad_norm": 0.021700916811823845, + "learning_rate": 0.0002, + "loss": 0.6034246683120728, + "mean_token_accuracy": 0.7570995390415192, + "num_tokens": 13983780.0, + "step": 183 + }, + { + "entropy": 0.619151696562767, + "epoch": 2.425249169435216, + "grad_norm": 0.020949846133589745, + "learning_rate": 0.0002, + "loss": 0.6169127225875854, + "mean_token_accuracy": 0.7503035366535187, + "num_tokens": 14060227.0, + "step": 184 + }, + { + "entropy": 0.5920789837837219, + "epoch": 2.438538205980066, + "grad_norm": 0.022497912868857384, + "learning_rate": 0.0002, + "loss": 0.5969008207321167, + "mean_token_accuracy": 0.7576948702335358, + "num_tokens": 14137774.0, + "step": 185 + }, + { + "entropy": 0.6010369509458542, + "epoch": 2.451827242524917, + "grad_norm": 0.02242516353726387, + "learning_rate": 0.0002, + "loss": 0.6066923141479492, + "mean_token_accuracy": 0.757031038403511, + "num_tokens": 14215235.0, + "step": 186 + }, + { + "entropy": 0.6210763901472092, + "epoch": 2.4651162790697674, + "grad_norm": 0.019126396626234055, + "learning_rate": 0.0002, + "loss": 0.61758953332901, + "mean_token_accuracy": 0.7510004043579102, + "num_tokens": 14292709.0, + "step": 187 + }, + { + "entropy": 0.6269999742507935, + "epoch": 2.478405315614618, + "grad_norm": 0.021928519010543823, + "learning_rate": 0.0002, + "loss": 0.6187852621078491, + "mean_token_accuracy": 0.7508761584758759, + "num_tokens": 14369455.0, + "step": 188 + }, + { + "entropy": 0.6171849220991135, + "epoch": 2.4916943521594686, + "grad_norm": 0.0193313080817461, + "learning_rate": 0.0002, + "loss": 0.6106323003768921, + "mean_token_accuracy": 0.7533420473337173, + "num_tokens": 14447299.0, + "step": 189 + }, + { + "entropy": 0.6126044690608978, + "epoch": 2.5049833887043187, + "grad_norm": 0.02693628892302513, + "learning_rate": 0.0002, + "loss": 0.6135596632957458, + "mean_token_accuracy": 0.7525096237659454, + "num_tokens": 14524325.0, + "step": 190 + }, + { + "entropy": 0.6129912734031677, + "epoch": 2.5182724252491693, + "grad_norm": 0.018071722239255905, + "learning_rate": 0.0002, + "loss": 0.6142337322235107, + "mean_token_accuracy": 0.7519230097532272, + "num_tokens": 14600878.0, + "step": 191 + }, + { + "entropy": 0.6005150228738785, + "epoch": 2.53156146179402, + "grad_norm": 0.020812232047319412, + "learning_rate": 0.0002, + "loss": 0.6019083857536316, + "mean_token_accuracy": 0.7572149932384491, + "num_tokens": 14678986.0, + "step": 192 + }, + { + "entropy": 0.6029624193906784, + "epoch": 2.5448504983388704, + "grad_norm": 0.01937534287571907, + "learning_rate": 0.0002, + "loss": 0.6034685969352722, + "mean_token_accuracy": 0.7564429342746735, + "num_tokens": 14755672.0, + "step": 193 + }, + { + "entropy": 0.6214014291763306, + "epoch": 2.558139534883721, + "grad_norm": 0.018799029290676117, + "learning_rate": 0.0002, + "loss": 0.6193259954452515, + "mean_token_accuracy": 0.7494612336158752, + "num_tokens": 14834347.0, + "step": 194 + }, + { + "entropy": 0.601834237575531, + "epoch": 2.571428571428571, + "grad_norm": 0.020581917837262154, + "learning_rate": 0.0002, + "loss": 0.6011050939559937, + "mean_token_accuracy": 0.7573233097791672, + "num_tokens": 14911834.0, + "step": 195 + }, + { + "entropy": 0.6118612587451935, + "epoch": 2.584717607973422, + "grad_norm": 0.01760011911392212, + "learning_rate": 0.0002, + "loss": 0.6075634956359863, + "mean_token_accuracy": 0.7539022862911224, + "num_tokens": 14989335.0, + "step": 196 + }, + { + "entropy": 0.6093568801879883, + "epoch": 2.5980066445182723, + "grad_norm": 0.019189173355698586, + "learning_rate": 0.0002, + "loss": 0.6092637181282043, + "mean_token_accuracy": 0.7539743185043335, + "num_tokens": 15066227.0, + "step": 197 + }, + { + "entropy": 0.6058226972818375, + "epoch": 2.611295681063123, + "grad_norm": 0.02091783657670021, + "learning_rate": 0.0002, + "loss": 0.6096549034118652, + "mean_token_accuracy": 0.7535166591405869, + "num_tokens": 15144896.0, + "step": 198 + }, + { + "entropy": 0.6119845509529114, + "epoch": 2.6245847176079735, + "grad_norm": 0.0155878197401762, + "learning_rate": 0.0002, + "loss": 0.6110509037971497, + "mean_token_accuracy": 0.7528887540102005, + "num_tokens": 15222726.0, + "step": 199 + }, + { + "entropy": 0.6130461543798447, + "epoch": 2.6378737541528237, + "grad_norm": 0.019653214141726494, + "learning_rate": 0.0002, + "loss": 0.6072310209274292, + "mean_token_accuracy": 0.7544162422418594, + "num_tokens": 15299909.0, + "step": 200 + }, + { + "entropy": 0.6181019693613052, + "epoch": 2.6511627906976747, + "grad_norm": 0.01918438822031021, + "learning_rate": 0.0002, + "loss": 0.6127801537513733, + "mean_token_accuracy": 0.7529577761888504, + "num_tokens": 15377612.0, + "step": 201 + }, + { + "entropy": 0.612848162651062, + "epoch": 2.664451827242525, + "grad_norm": 0.017989927902817726, + "learning_rate": 0.0002, + "loss": 0.6118600964546204, + "mean_token_accuracy": 0.7521955966949463, + "num_tokens": 15455592.0, + "step": 202 + }, + { + "entropy": 0.6041008532047272, + "epoch": 2.6777408637873754, + "grad_norm": 0.020594241097569466, + "learning_rate": 0.0002, + "loss": 0.6040845513343811, + "mean_token_accuracy": 0.7570705264806747, + "num_tokens": 15533049.0, + "step": 203 + }, + { + "entropy": 0.6044898629188538, + "epoch": 2.691029900332226, + "grad_norm": 0.019329074770212173, + "learning_rate": 0.0002, + "loss": 0.6082852482795715, + "mean_token_accuracy": 0.7537263184785843, + "num_tokens": 15610279.0, + "step": 204 + }, + { + "entropy": 0.6139257401227951, + "epoch": 2.704318936877076, + "grad_norm": 0.02171601541340351, + "learning_rate": 0.0002, + "loss": 0.6151280999183655, + "mean_token_accuracy": 0.7505405843257904, + "num_tokens": 15687157.0, + "step": 205 + }, + { + "entropy": 0.6186133027076721, + "epoch": 2.717607973421927, + "grad_norm": 0.021530168130993843, + "learning_rate": 0.0002, + "loss": 0.6109325885772705, + "mean_token_accuracy": 0.7531622499227524, + "num_tokens": 15764579.0, + "step": 206 + }, + { + "entropy": 0.632555365562439, + "epoch": 2.7308970099667773, + "grad_norm": 0.021901527419686317, + "learning_rate": 0.0002, + "loss": 0.6271617412567139, + "mean_token_accuracy": 0.7462858557701111, + "num_tokens": 15841481.0, + "step": 207 + }, + { + "entropy": 0.6050974130630493, + "epoch": 2.744186046511628, + "grad_norm": 0.01687164232134819, + "learning_rate": 0.0002, + "loss": 0.6053076386451721, + "mean_token_accuracy": 0.7553501129150391, + "num_tokens": 15918604.0, + "step": 208 + }, + { + "entropy": 0.6087679266929626, + "epoch": 2.7574750830564785, + "grad_norm": 0.022793259471654892, + "learning_rate": 0.0002, + "loss": 0.6142212748527527, + "mean_token_accuracy": 0.751279816031456, + "num_tokens": 15994660.0, + "step": 209 + }, + { + "entropy": 0.6259231269359589, + "epoch": 2.770764119601329, + "grad_norm": 0.02084580808877945, + "learning_rate": 0.0002, + "loss": 0.6297311782836914, + "mean_token_accuracy": 0.7452670186758041, + "num_tokens": 16071309.0, + "step": 210 + }, + { + "entropy": 0.6174523383378983, + "epoch": 2.7840531561461797, + "grad_norm": 0.01989596337080002, + "learning_rate": 0.0002, + "loss": 0.6135072708129883, + "mean_token_accuracy": 0.7530443668365479, + "num_tokens": 16148017.0, + "step": 211 + }, + { + "entropy": 0.6220860630273819, + "epoch": 2.79734219269103, + "grad_norm": 0.02036948874592781, + "learning_rate": 0.0002, + "loss": 0.6163336038589478, + "mean_token_accuracy": 0.7497790604829788, + "num_tokens": 16224889.0, + "step": 212 + }, + { + "entropy": 0.6255825906991959, + "epoch": 2.8106312292358804, + "grad_norm": 0.018022220581769943, + "learning_rate": 0.0002, + "loss": 0.6198499202728271, + "mean_token_accuracy": 0.7492111325263977, + "num_tokens": 16302189.0, + "step": 213 + }, + { + "entropy": 0.6192898452281952, + "epoch": 2.823920265780731, + "grad_norm": 0.025126567110419273, + "learning_rate": 0.0002, + "loss": 0.6222077012062073, + "mean_token_accuracy": 0.749178871512413, + "num_tokens": 16378282.0, + "step": 214 + }, + { + "entropy": 0.6129559427499771, + "epoch": 2.8372093023255816, + "grad_norm": 0.02307634986937046, + "learning_rate": 0.0002, + "loss": 0.6161656975746155, + "mean_token_accuracy": 0.7505893558263779, + "num_tokens": 16454604.0, + "step": 215 + }, + { + "entropy": 0.6182385087013245, + "epoch": 2.850498338870432, + "grad_norm": 0.024152085185050964, + "learning_rate": 0.0002, + "loss": 0.6123607158660889, + "mean_token_accuracy": 0.7522745132446289, + "num_tokens": 16531409.0, + "step": 216 + }, + { + "entropy": 0.6112461090087891, + "epoch": 2.8637873754152823, + "grad_norm": 0.0176935363560915, + "learning_rate": 0.0002, + "loss": 0.6054509878158569, + "mean_token_accuracy": 0.7557886838912964, + "num_tokens": 16609113.0, + "step": 217 + }, + { + "entropy": 0.613155335187912, + "epoch": 2.877076411960133, + "grad_norm": 0.017970658838748932, + "learning_rate": 0.0002, + "loss": 0.6126760244369507, + "mean_token_accuracy": 0.7521080523729324, + "num_tokens": 16686355.0, + "step": 218 + }, + { + "entropy": 0.6032315939664841, + "epoch": 2.8903654485049834, + "grad_norm": 0.019020307809114456, + "learning_rate": 0.0002, + "loss": 0.6042345762252808, + "mean_token_accuracy": 0.7560944706201553, + "num_tokens": 16763608.0, + "step": 219 + }, + { + "entropy": 0.6077173799276352, + "epoch": 2.903654485049834, + "grad_norm": 0.018304336816072464, + "learning_rate": 0.0002, + "loss": 0.6100585460662842, + "mean_token_accuracy": 0.752144530415535, + "num_tokens": 16840993.0, + "step": 220 + }, + { + "entropy": 0.6215966045856476, + "epoch": 2.9169435215946846, + "grad_norm": 0.017233379185199738, + "learning_rate": 0.0002, + "loss": 0.6201040744781494, + "mean_token_accuracy": 0.7491229772567749, + "num_tokens": 16918681.0, + "step": 221 + }, + { + "entropy": 0.6101587861776352, + "epoch": 2.9302325581395348, + "grad_norm": 0.017897607758641243, + "learning_rate": 0.0002, + "loss": 0.6113307476043701, + "mean_token_accuracy": 0.7526025176048279, + "num_tokens": 16995481.0, + "step": 222 + }, + { + "entropy": 0.6191541105508804, + "epoch": 2.9435215946843853, + "grad_norm": 0.017590591683983803, + "learning_rate": 0.0002, + "loss": 0.6188543438911438, + "mean_token_accuracy": 0.7504222095012665, + "num_tokens": 17071026.0, + "step": 223 + }, + { + "entropy": 0.6130050867795944, + "epoch": 2.956810631229236, + "grad_norm": 0.017167285084724426, + "learning_rate": 0.0002, + "loss": 0.6105394959449768, + "mean_token_accuracy": 0.7534568905830383, + "num_tokens": 17148098.0, + "step": 224 + }, + { + "entropy": 0.6177979409694672, + "epoch": 2.9700996677740865, + "grad_norm": 0.018956758081912994, + "learning_rate": 0.0002, + "loss": 0.6166577339172363, + "mean_token_accuracy": 0.7518346011638641, + "num_tokens": 17225177.0, + "step": 225 + }, + { + "entropy": 0.6153401881456375, + "epoch": 2.983388704318937, + "grad_norm": 0.01750190183520317, + "learning_rate": 0.0002, + "loss": 0.6157947778701782, + "mean_token_accuracy": 0.7507430613040924, + "num_tokens": 17302294.0, + "step": 226 + }, + { + "entropy": 0.6117560118436813, + "epoch": 2.9966777408637872, + "grad_norm": 0.019476674497127533, + "learning_rate": 0.0002, + "loss": 0.6088637113571167, + "mean_token_accuracy": 0.7535500228404999, + "num_tokens": 17379608.0, + "step": 227 + }, + { + "entropy": 0.6316746473312378, + "epoch": 3.0, + "grad_norm": 0.03286419063806534, + "learning_rate": 0.0002, + "loss": 0.6236717104911804, + "mean_token_accuracy": 0.7476998567581177, + "num_tokens": 17398539.0, + "step": 228 + }, + { + "entropy": 0.6095534861087799, + "epoch": 3.0132890365448506, + "grad_norm": 0.015681935474276543, + "learning_rate": 0.0002, + "loss": 0.6087620854377747, + "mean_token_accuracy": 0.7521023005247116, + "num_tokens": 17475557.0, + "step": 229 + }, + { + "entropy": 0.5973314344882965, + "epoch": 3.026578073089701, + "grad_norm": 0.022470587864518166, + "learning_rate": 0.0002, + "loss": 0.5996940732002258, + "mean_token_accuracy": 0.7573732435703278, + "num_tokens": 17553481.0, + "step": 230 + }, + { + "entropy": 0.6088445037603378, + "epoch": 3.0398671096345513, + "grad_norm": 0.018227772787213326, + "learning_rate": 0.0002, + "loss": 0.6091829538345337, + "mean_token_accuracy": 0.7527692764997482, + "num_tokens": 17630948.0, + "step": 231 + }, + { + "entropy": 0.6049168854951859, + "epoch": 3.053156146179402, + "grad_norm": 0.017723534256219864, + "learning_rate": 0.0002, + "loss": 0.6032490730285645, + "mean_token_accuracy": 0.7568238973617554, + "num_tokens": 17708071.0, + "step": 232 + }, + { + "entropy": 0.6116957366466522, + "epoch": 3.0664451827242525, + "grad_norm": 0.019640754908323288, + "learning_rate": 0.0002, + "loss": 0.6129127144813538, + "mean_token_accuracy": 0.7514138072729111, + "num_tokens": 17785914.0, + "step": 233 + }, + { + "entropy": 0.6018583327531815, + "epoch": 3.079734219269103, + "grad_norm": 0.01823512278497219, + "learning_rate": 0.0002, + "loss": 0.6023464202880859, + "mean_token_accuracy": 0.7567893713712692, + "num_tokens": 17863068.0, + "step": 234 + }, + { + "entropy": 0.6079549640417099, + "epoch": 3.0930232558139537, + "grad_norm": 0.019149288535118103, + "learning_rate": 0.0002, + "loss": 0.6062753200531006, + "mean_token_accuracy": 0.7556976824998856, + "num_tokens": 17940519.0, + "step": 235 + }, + { + "entropy": 0.6101312786340714, + "epoch": 3.106312292358804, + "grad_norm": 0.01750970259308815, + "learning_rate": 0.0002, + "loss": 0.6074748039245605, + "mean_token_accuracy": 0.7548793107271194, + "num_tokens": 18016965.0, + "step": 236 + }, + { + "entropy": 0.5994770526885986, + "epoch": 3.1196013289036544, + "grad_norm": 0.016457732766866684, + "learning_rate": 0.0002, + "loss": 0.5967164039611816, + "mean_token_accuracy": 0.7584220916032791, + "num_tokens": 18093780.0, + "step": 237 + }, + { + "entropy": 0.6183150410652161, + "epoch": 3.132890365448505, + "grad_norm": 0.018564699217677116, + "learning_rate": 0.0002, + "loss": 0.6204038858413696, + "mean_token_accuracy": 0.7490763515233994, + "num_tokens": 18170368.0, + "step": 238 + }, + { + "entropy": 0.6149475276470184, + "epoch": 3.1461794019933556, + "grad_norm": 0.020549966022372246, + "learning_rate": 0.0002, + "loss": 0.6142029762268066, + "mean_token_accuracy": 0.7511983513832092, + "num_tokens": 18247503.0, + "step": 239 + }, + { + "entropy": 0.6074440479278564, + "epoch": 3.159468438538206, + "grad_norm": 0.017675703391432762, + "learning_rate": 0.0002, + "loss": 0.6047203540802002, + "mean_token_accuracy": 0.7551320791244507, + "num_tokens": 18324699.0, + "step": 240 + }, + { + "entropy": 0.6145879477262497, + "epoch": 3.1727574750830563, + "grad_norm": 0.01775139756500721, + "learning_rate": 0.0002, + "loss": 0.6116558313369751, + "mean_token_accuracy": 0.7518284618854523, + "num_tokens": 18401605.0, + "step": 241 + }, + { + "entropy": 0.6134417057037354, + "epoch": 3.186046511627907, + "grad_norm": 0.018705733120441437, + "learning_rate": 0.0002, + "loss": 0.6137744188308716, + "mean_token_accuracy": 0.7512363493442535, + "num_tokens": 18477835.0, + "step": 242 + }, + { + "entropy": 0.618760734796524, + "epoch": 3.1993355481727574, + "grad_norm": 0.017789587378501892, + "learning_rate": 0.0002, + "loss": 0.6183280348777771, + "mean_token_accuracy": 0.7504749894142151, + "num_tokens": 18554598.0, + "step": 243 + }, + { + "entropy": 0.6092619597911835, + "epoch": 3.212624584717608, + "grad_norm": 0.01854095049202442, + "learning_rate": 0.0002, + "loss": 0.6108678579330444, + "mean_token_accuracy": 0.7533981502056122, + "num_tokens": 18631379.0, + "step": 244 + }, + { + "entropy": 0.6182709038257599, + "epoch": 3.2259136212624586, + "grad_norm": 0.019728144630789757, + "learning_rate": 0.0002, + "loss": 0.6169389486312866, + "mean_token_accuracy": 0.7508316785097122, + "num_tokens": 18707923.0, + "step": 245 + }, + { + "entropy": 0.6175456345081329, + "epoch": 3.2392026578073088, + "grad_norm": 0.018149685114622116, + "learning_rate": 0.0002, + "loss": 0.6160181760787964, + "mean_token_accuracy": 0.7498097270727158, + "num_tokens": 18784899.0, + "step": 246 + }, + { + "entropy": 0.6098749786615372, + "epoch": 3.2524916943521593, + "grad_norm": 0.022258635610342026, + "learning_rate": 0.0002, + "loss": 0.606079638004303, + "mean_token_accuracy": 0.7557233422994614, + "num_tokens": 18862479.0, + "step": 247 + }, + { + "entropy": 0.6224018037319183, + "epoch": 3.26578073089701, + "grad_norm": 0.01621960662305355, + "learning_rate": 0.0002, + "loss": 0.618665337562561, + "mean_token_accuracy": 0.7498545050621033, + "num_tokens": 18940087.0, + "step": 248 + }, + { + "entropy": 0.6083466410636902, + "epoch": 3.2790697674418605, + "grad_norm": 0.019777534529566765, + "learning_rate": 0.0002, + "loss": 0.6086328029632568, + "mean_token_accuracy": 0.7534854263067245, + "num_tokens": 19016696.0, + "step": 249 + }, + { + "entropy": 0.6064578592777252, + "epoch": 3.292358803986711, + "grad_norm": 0.01872546598315239, + "learning_rate": 0.0002, + "loss": 0.6035436987876892, + "mean_token_accuracy": 0.755558580160141, + "num_tokens": 19094418.0, + "step": 250 + }, + { + "entropy": 0.6000941842794418, + "epoch": 3.3056478405315612, + "grad_norm": 0.018199468031525612, + "learning_rate": 0.0002, + "loss": 0.5997027158737183, + "mean_token_accuracy": 0.7565109431743622, + "num_tokens": 19171347.0, + "step": 251 + }, + { + "entropy": 0.6095773726701736, + "epoch": 3.318936877076412, + "grad_norm": 0.019168905913829803, + "learning_rate": 0.0002, + "loss": 0.6119214296340942, + "mean_token_accuracy": 0.7526026219129562, + "num_tokens": 19248370.0, + "step": 252 + }, + { + "entropy": 0.6261710673570633, + "epoch": 3.3322259136212624, + "grad_norm": 0.01938040554523468, + "learning_rate": 0.0002, + "loss": 0.6250886917114258, + "mean_token_accuracy": 0.7475594282150269, + "num_tokens": 19324234.0, + "step": 253 + }, + { + "entropy": 0.6130911856889725, + "epoch": 3.345514950166113, + "grad_norm": 0.018235258758068085, + "learning_rate": 0.0002, + "loss": 0.6104439496994019, + "mean_token_accuracy": 0.7527066767215729, + "num_tokens": 19401967.0, + "step": 254 + }, + { + "entropy": 0.6052329689264297, + "epoch": 3.3588039867109636, + "grad_norm": 0.01986231654882431, + "learning_rate": 0.0002, + "loss": 0.6020320653915405, + "mean_token_accuracy": 0.7550270408391953, + "num_tokens": 19478743.0, + "step": 255 + }, + { + "entropy": 0.6114888489246368, + "epoch": 3.3720930232558137, + "grad_norm": 0.020737677812576294, + "learning_rate": 0.0002, + "loss": 0.6141330003738403, + "mean_token_accuracy": 0.7509262412786484, + "num_tokens": 19554557.0, + "step": 256 + }, + { + "entropy": 0.6046124845743179, + "epoch": 3.3853820598006643, + "grad_norm": 0.017336487770080566, + "learning_rate": 0.0002, + "loss": 0.6059973239898682, + "mean_token_accuracy": 0.7553645223379135, + "num_tokens": 19631324.0, + "step": 257 + }, + { + "entropy": 0.6068678796291351, + "epoch": 3.398671096345515, + "grad_norm": 0.020718904212117195, + "learning_rate": 0.0002, + "loss": 0.6086840629577637, + "mean_token_accuracy": 0.7532851994037628, + "num_tokens": 19708325.0, + "step": 258 + }, + { + "entropy": 0.6072741150856018, + "epoch": 3.4119601328903655, + "grad_norm": 0.01954406313598156, + "learning_rate": 0.0002, + "loss": 0.6017572283744812, + "mean_token_accuracy": 0.755853459239006, + "num_tokens": 19786447.0, + "step": 259 + }, + { + "entropy": 0.6193552911281586, + "epoch": 3.425249169435216, + "grad_norm": 0.020680461078882217, + "learning_rate": 0.0002, + "loss": 0.6165962219238281, + "mean_token_accuracy": 0.7497520446777344, + "num_tokens": 19863145.0, + "step": 260 + }, + { + "entropy": 0.6086042821407318, + "epoch": 3.438538205980066, + "grad_norm": 0.020301401615142822, + "learning_rate": 0.0002, + "loss": 0.6113531589508057, + "mean_token_accuracy": 0.7527741938829422, + "num_tokens": 19941270.0, + "step": 261 + }, + { + "entropy": 0.5985937118530273, + "epoch": 3.451827242524917, + "grad_norm": 0.01930115558207035, + "learning_rate": 0.0002, + "loss": 0.5998382568359375, + "mean_token_accuracy": 0.7559645771980286, + "num_tokens": 20017437.0, + "step": 262 + }, + { + "entropy": 0.6116500794887543, + "epoch": 3.4651162790697674, + "grad_norm": 0.022508280351758003, + "learning_rate": 0.0002, + "loss": 0.6121885180473328, + "mean_token_accuracy": 0.7508966326713562, + "num_tokens": 20094666.0, + "step": 263 + }, + { + "entropy": 0.6296782493591309, + "epoch": 3.478405315614618, + "grad_norm": 0.020131876692175865, + "learning_rate": 0.0002, + "loss": 0.6230026483535767, + "mean_token_accuracy": 0.7477834820747375, + "num_tokens": 20171204.0, + "step": 264 + }, + { + "entropy": 0.6045475602149963, + "epoch": 3.4916943521594686, + "grad_norm": 0.022214079275727272, + "learning_rate": 0.0002, + "loss": 0.6007340550422668, + "mean_token_accuracy": 0.7573538422584534, + "num_tokens": 20248428.0, + "step": 265 + }, + { + "entropy": 0.6215962320566177, + "epoch": 3.5049833887043187, + "grad_norm": 0.017833082005381584, + "learning_rate": 0.0002, + "loss": 0.6178830862045288, + "mean_token_accuracy": 0.7502043694257736, + "num_tokens": 20325757.0, + "step": 266 + }, + { + "entropy": 0.6136264950037003, + "epoch": 3.5182724252491693, + "grad_norm": 0.021755537018179893, + "learning_rate": 0.0002, + "loss": 0.6184818744659424, + "mean_token_accuracy": 0.7506276816129684, + "num_tokens": 20402903.0, + "step": 267 + }, + { + "entropy": 0.6180002838373184, + "epoch": 3.53156146179402, + "grad_norm": 0.021835198625922203, + "learning_rate": 0.0002, + "loss": 0.6181987524032593, + "mean_token_accuracy": 0.7490601688623428, + "num_tokens": 20478943.0, + "step": 268 + }, + { + "entropy": 0.6150650382041931, + "epoch": 3.5448504983388704, + "grad_norm": 0.018519792705774307, + "learning_rate": 0.0002, + "loss": 0.6126790046691895, + "mean_token_accuracy": 0.7521289139986038, + "num_tokens": 20556519.0, + "step": 269 + }, + { + "entropy": 0.6134590953588486, + "epoch": 3.558139534883721, + "grad_norm": 0.02214435115456581, + "learning_rate": 0.0002, + "loss": 0.6102150082588196, + "mean_token_accuracy": 0.7517832219600677, + "num_tokens": 20633265.0, + "step": 270 + }, + { + "entropy": 0.6049845069646835, + "epoch": 3.571428571428571, + "grad_norm": 0.020151155069470406, + "learning_rate": 0.0002, + "loss": 0.6048744916915894, + "mean_token_accuracy": 0.753717228770256, + "num_tokens": 20710107.0, + "step": 271 + }, + { + "entropy": 0.6087531298398972, + "epoch": 3.584717607973422, + "grad_norm": 0.020998802036046982, + "learning_rate": 0.0002, + "loss": 0.6117347478866577, + "mean_token_accuracy": 0.7524616122245789, + "num_tokens": 20786881.0, + "step": 272 + }, + { + "entropy": 0.6079637855291367, + "epoch": 3.5980066445182723, + "grad_norm": 0.028278745710849762, + "learning_rate": 0.0002, + "loss": 0.6119199395179749, + "mean_token_accuracy": 0.7529398500919342, + "num_tokens": 20865202.0, + "step": 273 + }, + { + "entropy": 0.6151505410671234, + "epoch": 3.611295681063123, + "grad_norm": 0.021120117977261543, + "learning_rate": 0.0002, + "loss": 0.6089338064193726, + "mean_token_accuracy": 0.7535832971334457, + "num_tokens": 20942503.0, + "step": 274 + }, + { + "entropy": 0.610705703496933, + "epoch": 3.6245847176079735, + "grad_norm": 0.027490589767694473, + "learning_rate": 0.0002, + "loss": 0.6012994050979614, + "mean_token_accuracy": 0.7582906633615494, + "num_tokens": 21020344.0, + "step": 275 + }, + { + "entropy": 0.60928113758564, + "epoch": 3.6378737541528237, + "grad_norm": 0.01714142970740795, + "learning_rate": 0.0002, + "loss": 0.6091657876968384, + "mean_token_accuracy": 0.753533348441124, + "num_tokens": 21096173.0, + "step": 276 + }, + { + "entropy": 0.6081078201532364, + "epoch": 3.6511627906976747, + "grad_norm": 0.02431553602218628, + "learning_rate": 0.0002, + "loss": 0.6148205995559692, + "mean_token_accuracy": 0.7495276033878326, + "num_tokens": 21172590.0, + "step": 277 + }, + { + "entropy": 0.6118222177028656, + "epoch": 3.664451827242525, + "grad_norm": 0.021395722404122353, + "learning_rate": 0.0002, + "loss": 0.6128278970718384, + "mean_token_accuracy": 0.7514612227678299, + "num_tokens": 21249938.0, + "step": 278 + }, + { + "entropy": 0.6015144437551498, + "epoch": 3.6777408637873754, + "grad_norm": 0.020723391324281693, + "learning_rate": 0.0002, + "loss": 0.5997154712677002, + "mean_token_accuracy": 0.7576779872179031, + "num_tokens": 21326172.0, + "step": 279 + }, + { + "entropy": 0.6092483848333359, + "epoch": 3.691029900332226, + "grad_norm": 0.021157050505280495, + "learning_rate": 0.0002, + "loss": 0.6041587591171265, + "mean_token_accuracy": 0.7551498264074326, + "num_tokens": 21404038.0, + "step": 280 + }, + { + "entropy": 0.612848699092865, + "epoch": 3.704318936877076, + "grad_norm": 0.01788610778748989, + "learning_rate": 0.0002, + "loss": 0.612815260887146, + "mean_token_accuracy": 0.7505994439125061, + "num_tokens": 21480184.0, + "step": 281 + }, + { + "entropy": 0.6070238351821899, + "epoch": 3.717607973421927, + "grad_norm": 0.019672557711601257, + "learning_rate": 0.0002, + "loss": 0.605423092842102, + "mean_token_accuracy": 0.7557143568992615, + "num_tokens": 21558365.0, + "step": 282 + }, + { + "entropy": 0.6032809317111969, + "epoch": 3.7308970099667773, + "grad_norm": 0.0190837811678648, + "learning_rate": 0.0002, + "loss": 0.6031093001365662, + "mean_token_accuracy": 0.7566817253828049, + "num_tokens": 21635728.0, + "step": 283 + }, + { + "entropy": 0.6072507947683334, + "epoch": 3.744186046511628, + "grad_norm": 0.019605537876486778, + "learning_rate": 0.0002, + "loss": 0.6065791249275208, + "mean_token_accuracy": 0.7529509514570236, + "num_tokens": 21713107.0, + "step": 284 + }, + { + "entropy": 0.6070082485675812, + "epoch": 3.7574750830564785, + "grad_norm": 0.024298321455717087, + "learning_rate": 0.0002, + "loss": 0.6076079607009888, + "mean_token_accuracy": 0.7544230818748474, + "num_tokens": 21791423.0, + "step": 285 + }, + { + "entropy": 0.6056810468435287, + "epoch": 3.770764119601329, + "grad_norm": 0.018431881442666054, + "learning_rate": 0.0002, + "loss": 0.6028933525085449, + "mean_token_accuracy": 0.7561915963888168, + "num_tokens": 21868420.0, + "step": 286 + }, + { + "entropy": 0.6198001354932785, + "epoch": 3.7840531561461797, + "grad_norm": 0.017862267792224884, + "learning_rate": 0.0002, + "loss": 0.6161085963249207, + "mean_token_accuracy": 0.750722274184227, + "num_tokens": 21944982.0, + "step": 287 + }, + { + "entropy": 0.6113523244857788, + "epoch": 3.79734219269103, + "grad_norm": 0.018622959032654762, + "learning_rate": 0.0002, + "loss": 0.6093748211860657, + "mean_token_accuracy": 0.752977579832077, + "num_tokens": 22021863.0, + "step": 288 + }, + { + "entropy": 0.6059132963418961, + "epoch": 3.8106312292358804, + "grad_norm": 0.019381843507289886, + "learning_rate": 0.0002, + "loss": 0.6066963076591492, + "mean_token_accuracy": 0.7544227838516235, + "num_tokens": 22098383.0, + "step": 289 + }, + { + "entropy": 0.6028926521539688, + "epoch": 3.823920265780731, + "grad_norm": 0.019265756011009216, + "learning_rate": 0.0002, + "loss": 0.6037235260009766, + "mean_token_accuracy": 0.755391463637352, + "num_tokens": 22176002.0, + "step": 290 + }, + { + "entropy": 0.6092864274978638, + "epoch": 3.8372093023255816, + "grad_norm": 0.017850292846560478, + "learning_rate": 0.0002, + "loss": 0.6102504730224609, + "mean_token_accuracy": 0.7526959478855133, + "num_tokens": 22252147.0, + "step": 291 + }, + { + "entropy": 0.6057061702013016, + "epoch": 3.850498338870432, + "grad_norm": 0.01840970665216446, + "learning_rate": 0.0002, + "loss": 0.602671205997467, + "mean_token_accuracy": 0.7557494938373566, + "num_tokens": 22329209.0, + "step": 292 + }, + { + "entropy": 0.6129421442747116, + "epoch": 3.8637873754152823, + "grad_norm": 0.0204786229878664, + "learning_rate": 0.0002, + "loss": 0.607947826385498, + "mean_token_accuracy": 0.7542832642793655, + "num_tokens": 22407009.0, + "step": 293 + }, + { + "entropy": 0.6123421639204025, + "epoch": 3.877076411960133, + "grad_norm": 0.018487131223082542, + "learning_rate": 0.0002, + "loss": 0.6074858903884888, + "mean_token_accuracy": 0.7547514736652374, + "num_tokens": 22484212.0, + "step": 294 + }, + { + "entropy": 0.5983436703681946, + "epoch": 3.8903654485049834, + "grad_norm": 0.02583969570696354, + "learning_rate": 0.0002, + "loss": 0.6036494970321655, + "mean_token_accuracy": 0.7553357183933258, + "num_tokens": 22561298.0, + "step": 295 + }, + { + "entropy": 0.6064856052398682, + "epoch": 3.903654485049834, + "grad_norm": 0.018397798761725426, + "learning_rate": 0.0002, + "loss": 0.6074536442756653, + "mean_token_accuracy": 0.7535169720649719, + "num_tokens": 22637575.0, + "step": 296 + }, + { + "entropy": 0.616366982460022, + "epoch": 3.9169435215946846, + "grad_norm": 0.02177377976477146, + "learning_rate": 0.0002, + "loss": 0.6141782999038696, + "mean_token_accuracy": 0.7520369738340378, + "num_tokens": 22715485.0, + "step": 297 + }, + { + "entropy": 0.6121602952480316, + "epoch": 3.9302325581395348, + "grad_norm": 0.02346772328019142, + "learning_rate": 0.0002, + "loss": 0.6075172424316406, + "mean_token_accuracy": 0.7541345357894897, + "num_tokens": 22793378.0, + "step": 298 + }, + { + "entropy": 0.6224130690097809, + "epoch": 3.9435215946843853, + "grad_norm": 0.022563831880688667, + "learning_rate": 0.0002, + "loss": 0.6254736185073853, + "mean_token_accuracy": 0.7476143836975098, + "num_tokens": 22870065.0, + "step": 299 + }, + { + "entropy": 0.6144284307956696, + "epoch": 3.956810631229236, + "grad_norm": 0.023518579080700874, + "learning_rate": 0.0002, + "loss": 0.6168658137321472, + "mean_token_accuracy": 0.7495181858539581, + "num_tokens": 22947597.0, + "step": 300 + }, + { + "entropy": 0.6144127398729324, + "epoch": 3.9700996677740865, + "grad_norm": 0.019872847944498062, + "learning_rate": 0.0002, + "loss": 0.6118189692497253, + "mean_token_accuracy": 0.7515655010938644, + "num_tokens": 23024459.0, + "step": 301 + }, + { + "entropy": 0.6152849346399307, + "epoch": 3.983388704318937, + "grad_norm": 0.02049420215189457, + "learning_rate": 0.0002, + "loss": 0.6128252148628235, + "mean_token_accuracy": 0.752276748418808, + "num_tokens": 23101344.0, + "step": 302 + }, + { + "entropy": 0.6097502261400223, + "epoch": 3.9966777408637872, + "grad_norm": 0.01893959939479828, + "learning_rate": 0.0002, + "loss": 0.6084878444671631, + "mean_token_accuracy": 0.7544471174478531, + "num_tokens": 23178869.0, + "step": 303 + }, + { + "entropy": 0.6282399892807007, + "epoch": 4.0, + "grad_norm": 0.029287271201610565, + "learning_rate": 0.0002, + "loss": 0.6299281120300293, + "mean_token_accuracy": 0.7467920184135437, + "num_tokens": 23197934.0, + "step": 304 + }, + { + "entropy": 0.6078995913267136, + "epoch": 4.01328903654485, + "grad_norm": 0.019241703674197197, + "learning_rate": 0.0002, + "loss": 0.6031018495559692, + "mean_token_accuracy": 0.7556031346321106, + "num_tokens": 23275130.0, + "step": 305 + }, + { + "entropy": 0.6076922863721848, + "epoch": 4.026578073089701, + "grad_norm": 0.01899712160229683, + "learning_rate": 0.0002, + "loss": 0.6067972779273987, + "mean_token_accuracy": 0.7541791796684265, + "num_tokens": 23352058.0, + "step": 306 + }, + { + "entropy": 0.600939005613327, + "epoch": 4.039867109634551, + "grad_norm": 0.021121008321642876, + "learning_rate": 0.0002, + "loss": 0.5987560153007507, + "mean_token_accuracy": 0.7575933039188385, + "num_tokens": 23428667.0, + "step": 307 + }, + { + "entropy": 0.5970161706209183, + "epoch": 4.053156146179402, + "grad_norm": 0.018559519201517105, + "learning_rate": 0.0002, + "loss": 0.5973871350288391, + "mean_token_accuracy": 0.7576845437288284, + "num_tokens": 23506688.0, + "step": 308 + }, + { + "entropy": 0.6015695184469223, + "epoch": 4.0664451827242525, + "grad_norm": 0.02038990519940853, + "learning_rate": 0.0002, + "loss": 0.6018570065498352, + "mean_token_accuracy": 0.7563586086034775, + "num_tokens": 23583756.0, + "step": 309 + }, + { + "entropy": 0.6081244051456451, + "epoch": 4.079734219269103, + "grad_norm": 0.018375808373093605, + "learning_rate": 0.0002, + "loss": 0.6059246063232422, + "mean_token_accuracy": 0.7543869763612747, + "num_tokens": 23660956.0, + "step": 310 + }, + { + "entropy": 0.6051978170871735, + "epoch": 4.093023255813954, + "grad_norm": 0.020722337067127228, + "learning_rate": 0.0002, + "loss": 0.603718638420105, + "mean_token_accuracy": 0.7539190798997879, + "num_tokens": 23737537.0, + "step": 311 + }, + { + "entropy": 0.6093511432409286, + "epoch": 4.106312292358804, + "grad_norm": 0.023197615519165993, + "learning_rate": 0.0002, + "loss": 0.6051844358444214, + "mean_token_accuracy": 0.7553325593471527, + "num_tokens": 23814068.0, + "step": 312 + }, + { + "entropy": 0.6088575571775436, + "epoch": 4.119601328903655, + "grad_norm": 0.02205248922109604, + "learning_rate": 0.0002, + "loss": 0.6104272603988647, + "mean_token_accuracy": 0.7520817220211029, + "num_tokens": 23890784.0, + "step": 313 + }, + { + "entropy": 0.6190015077590942, + "epoch": 4.132890365448505, + "grad_norm": 0.025014696642756462, + "learning_rate": 0.0002, + "loss": 0.620580792427063, + "mean_token_accuracy": 0.748920276761055, + "num_tokens": 23967606.0, + "step": 314 + }, + { + "entropy": 0.6102283596992493, + "epoch": 4.146179401993355, + "grad_norm": 0.020540745928883553, + "learning_rate": 0.0002, + "loss": 0.6080856323242188, + "mean_token_accuracy": 0.75365149974823, + "num_tokens": 24045059.0, + "step": 315 + }, + { + "entropy": 0.6060895025730133, + "epoch": 4.159468438538206, + "grad_norm": 0.024182360619306564, + "learning_rate": 0.0002, + "loss": 0.602268636226654, + "mean_token_accuracy": 0.7558044046163559, + "num_tokens": 24122544.0, + "step": 316 + }, + { + "entropy": 0.5959110260009766, + "epoch": 4.172757475083056, + "grad_norm": 0.018297569826245308, + "learning_rate": 0.0002, + "loss": 0.5969607830047607, + "mean_token_accuracy": 0.7568109482526779, + "num_tokens": 24200551.0, + "step": 317 + }, + { + "entropy": 0.5999089032411575, + "epoch": 4.186046511627907, + "grad_norm": 0.02408657781779766, + "learning_rate": 0.0002, + "loss": 0.6017069816589355, + "mean_token_accuracy": 0.7562790066003799, + "num_tokens": 24278083.0, + "step": 318 + }, + { + "entropy": 0.6096744239330292, + "epoch": 4.1993355481727574, + "grad_norm": 0.019474782049655914, + "learning_rate": 0.0002, + "loss": 0.6083636283874512, + "mean_token_accuracy": 0.7534827589988708, + "num_tokens": 24354655.0, + "step": 319 + }, + { + "entropy": 0.6241651922464371, + "epoch": 4.212624584717608, + "grad_norm": 0.020875826478004456, + "learning_rate": 0.0002, + "loss": 0.6206015348434448, + "mean_token_accuracy": 0.7486886084079742, + "num_tokens": 24431355.0, + "step": 320 + }, + { + "entropy": 0.610044926404953, + "epoch": 4.225913621262459, + "grad_norm": 0.02331143245100975, + "learning_rate": 0.0002, + "loss": 0.6060656309127808, + "mean_token_accuracy": 0.7543890476226807, + "num_tokens": 24508973.0, + "step": 321 + }, + { + "entropy": 0.6080483794212341, + "epoch": 4.239202657807309, + "grad_norm": 0.020508069545030594, + "learning_rate": 0.0002, + "loss": 0.6093933582305908, + "mean_token_accuracy": 0.7528631091117859, + "num_tokens": 24586431.0, + "step": 322 + }, + { + "entropy": 0.6133122891187668, + "epoch": 4.25249169435216, + "grad_norm": 0.028193378821015358, + "learning_rate": 0.0002, + "loss": 0.6164911389350891, + "mean_token_accuracy": 0.7494592070579529, + "num_tokens": 24662931.0, + "step": 323 + }, + { + "entropy": 0.6075657159090042, + "epoch": 4.26578073089701, + "grad_norm": 0.022722216323018074, + "learning_rate": 0.0002, + "loss": 0.600710391998291, + "mean_token_accuracy": 0.7569031566381454, + "num_tokens": 24741559.0, + "step": 324 + }, + { + "entropy": 0.615620344877243, + "epoch": 4.27906976744186, + "grad_norm": 0.025660408660769463, + "learning_rate": 0.0002, + "loss": 0.6100776195526123, + "mean_token_accuracy": 0.7526432275772095, + "num_tokens": 24818237.0, + "step": 325 + }, + { + "entropy": 0.5883046835660934, + "epoch": 4.292358803986711, + "grad_norm": 0.018514303490519524, + "learning_rate": 0.0002, + "loss": 0.5883811712265015, + "mean_token_accuracy": 0.7614999413490295, + "num_tokens": 24896271.0, + "step": 326 + }, + { + "entropy": 0.6124174892902374, + "epoch": 4.305647840531561, + "grad_norm": 0.02814031019806862, + "learning_rate": 0.0002, + "loss": 0.6168115139007568, + "mean_token_accuracy": 0.7499870508909225, + "num_tokens": 24972812.0, + "step": 327 + }, + { + "entropy": 0.6104706823825836, + "epoch": 4.318936877076412, + "grad_norm": 0.017883731052279472, + "learning_rate": 0.0002, + "loss": 0.6079275608062744, + "mean_token_accuracy": 0.7537025660276413, + "num_tokens": 25049472.0, + "step": 328 + }, + { + "entropy": 0.6112405806779861, + "epoch": 4.332225913621262, + "grad_norm": 0.025313958525657654, + "learning_rate": 0.0002, + "loss": 0.6067090630531311, + "mean_token_accuracy": 0.7538552135229111, + "num_tokens": 25127082.0, + "step": 329 + }, + { + "entropy": 0.6116072982549667, + "epoch": 4.3455149501661126, + "grad_norm": 0.019383935257792473, + "learning_rate": 0.0002, + "loss": 0.6074379682540894, + "mean_token_accuracy": 0.7537506520748138, + "num_tokens": 25204323.0, + "step": 330 + }, + { + "entropy": 0.6128946393728256, + "epoch": 4.358803986710964, + "grad_norm": 0.023746777325868607, + "learning_rate": 0.0002, + "loss": 0.617768406867981, + "mean_token_accuracy": 0.7481751292943954, + "num_tokens": 25280019.0, + "step": 331 + }, + { + "entropy": 0.6033320724964142, + "epoch": 4.372093023255814, + "grad_norm": 0.020396512001752853, + "learning_rate": 0.0002, + "loss": 0.606078028678894, + "mean_token_accuracy": 0.7542640864849091, + "num_tokens": 25356315.0, + "step": 332 + }, + { + "entropy": 0.6129639148712158, + "epoch": 4.385382059800665, + "grad_norm": 0.018004735931754112, + "learning_rate": 0.0002, + "loss": 0.6129087209701538, + "mean_token_accuracy": 0.7506652474403381, + "num_tokens": 25433383.0, + "step": 333 + }, + { + "entropy": 0.6221887469291687, + "epoch": 4.398671096345515, + "grad_norm": 0.022268855944275856, + "learning_rate": 0.0002, + "loss": 0.6149997711181641, + "mean_token_accuracy": 0.749396800994873, + "num_tokens": 25510141.0, + "step": 334 + }, + { + "entropy": 0.6167555749416351, + "epoch": 4.411960132890365, + "grad_norm": 0.01839759759604931, + "learning_rate": 0.0002, + "loss": 0.6128036975860596, + "mean_token_accuracy": 0.751603752374649, + "num_tokens": 25588417.0, + "step": 335 + }, + { + "entropy": 0.6068084985017776, + "epoch": 4.425249169435216, + "grad_norm": 0.023206762969493866, + "learning_rate": 0.0002, + "loss": 0.6072171926498413, + "mean_token_accuracy": 0.7537854909896851, + "num_tokens": 25665457.0, + "step": 336 + }, + { + "entropy": 0.6054465770721436, + "epoch": 4.438538205980066, + "grad_norm": 0.022475862875580788, + "learning_rate": 0.0002, + "loss": 0.6104304790496826, + "mean_token_accuracy": 0.752402052283287, + "num_tokens": 25742100.0, + "step": 337 + }, + { + "entropy": 0.6154294013977051, + "epoch": 4.451827242524917, + "grad_norm": 0.01877933368086815, + "learning_rate": 0.0002, + "loss": 0.6110727787017822, + "mean_token_accuracy": 0.7519305050373077, + "num_tokens": 25819237.0, + "step": 338 + }, + { + "entropy": 0.6140685379505157, + "epoch": 4.465116279069767, + "grad_norm": 0.022017061710357666, + "learning_rate": 0.0002, + "loss": 0.6092947721481323, + "mean_token_accuracy": 0.752203956246376, + "num_tokens": 25896673.0, + "step": 339 + }, + { + "entropy": 0.6095300614833832, + "epoch": 4.4784053156146175, + "grad_norm": 0.018494611606001854, + "learning_rate": 0.0002, + "loss": 0.606695830821991, + "mean_token_accuracy": 0.7532522529363632, + "num_tokens": 25973039.0, + "step": 340 + }, + { + "entropy": 0.5996545255184174, + "epoch": 4.4916943521594686, + "grad_norm": 0.029419148340821266, + "learning_rate": 0.0002, + "loss": 0.6072653532028198, + "mean_token_accuracy": 0.7545234113931656, + "num_tokens": 26049966.0, + "step": 341 + }, + { + "entropy": 0.6011916100978851, + "epoch": 4.504983388704319, + "grad_norm": 0.018680213019251823, + "learning_rate": 0.0002, + "loss": 0.6019576191902161, + "mean_token_accuracy": 0.7563180327415466, + "num_tokens": 26126850.0, + "step": 342 + }, + { + "entropy": 0.6171986162662506, + "epoch": 4.51827242524917, + "grad_norm": 0.025131572037935257, + "learning_rate": 0.0002, + "loss": 0.61095130443573, + "mean_token_accuracy": 0.7528986483812332, + "num_tokens": 26202932.0, + "step": 343 + }, + { + "entropy": 0.6055793315172195, + "epoch": 4.53156146179402, + "grad_norm": 0.02243235521018505, + "learning_rate": 0.0002, + "loss": 0.600302517414093, + "mean_token_accuracy": 0.756937175989151, + "num_tokens": 26279555.0, + "step": 344 + }, + { + "entropy": 0.602609395980835, + "epoch": 4.544850498338871, + "grad_norm": 0.02473926544189453, + "learning_rate": 0.0002, + "loss": 0.6063109636306763, + "mean_token_accuracy": 0.7552246153354645, + "num_tokens": 26355532.0, + "step": 345 + }, + { + "entropy": 0.599660649895668, + "epoch": 4.558139534883721, + "grad_norm": 0.026357337832450867, + "learning_rate": 0.0002, + "loss": 0.6082413196563721, + "mean_token_accuracy": 0.7543327510356903, + "num_tokens": 26432597.0, + "step": 346 + }, + { + "entropy": 0.6072948724031448, + "epoch": 4.571428571428571, + "grad_norm": 0.022914156317710876, + "learning_rate": 0.0002, + "loss": 0.6029258370399475, + "mean_token_accuracy": 0.7551669776439667, + "num_tokens": 26509425.0, + "step": 347 + }, + { + "entropy": 0.6152079552412033, + "epoch": 4.584717607973422, + "grad_norm": 0.025272825732827187, + "learning_rate": 0.0002, + "loss": 0.6049219369888306, + "mean_token_accuracy": 0.7542230039834976, + "num_tokens": 26586972.0, + "step": 348 + }, + { + "entropy": 0.614995539188385, + "epoch": 4.598006644518272, + "grad_norm": 0.020252224057912827, + "learning_rate": 0.0002, + "loss": 0.6108348369598389, + "mean_token_accuracy": 0.752870187163353, + "num_tokens": 26664480.0, + "step": 349 + }, + { + "entropy": 0.6094898730516434, + "epoch": 4.6112956810631225, + "grad_norm": 0.030948877334594727, + "learning_rate": 0.0002, + "loss": 0.6137002110481262, + "mean_token_accuracy": 0.7513982206583023, + "num_tokens": 26742003.0, + "step": 350 + }, + { + "entropy": 0.5978283584117889, + "epoch": 4.6245847176079735, + "grad_norm": 0.01938704401254654, + "learning_rate": 0.0002, + "loss": 0.6012290716171265, + "mean_token_accuracy": 0.7540938407182693, + "num_tokens": 26818026.0, + "step": 351 + }, + { + "entropy": 0.6089412868022919, + "epoch": 4.637873754152824, + "grad_norm": 0.0248025581240654, + "learning_rate": 0.0002, + "loss": 0.6055797338485718, + "mean_token_accuracy": 0.754187747836113, + "num_tokens": 26894165.0, + "step": 352 + }, + { + "entropy": 0.6032460033893585, + "epoch": 4.651162790697675, + "grad_norm": 0.0183709766715765, + "learning_rate": 0.0002, + "loss": 0.5996910333633423, + "mean_token_accuracy": 0.7573108524084091, + "num_tokens": 26971844.0, + "step": 353 + }, + { + "entropy": 0.6083274334669113, + "epoch": 4.664451827242525, + "grad_norm": 0.02345374971628189, + "learning_rate": 0.0002, + "loss": 0.610886812210083, + "mean_token_accuracy": 0.7522048950195312, + "num_tokens": 27048769.0, + "step": 354 + }, + { + "entropy": 0.6071414351463318, + "epoch": 4.677740863787376, + "grad_norm": 0.01983507163822651, + "learning_rate": 0.0002, + "loss": 0.6074281930923462, + "mean_token_accuracy": 0.7520459145307541, + "num_tokens": 27125617.0, + "step": 355 + }, + { + "entropy": 0.6114618331193924, + "epoch": 4.691029900332226, + "grad_norm": 0.019038749858736992, + "learning_rate": 0.0002, + "loss": 0.60816890001297, + "mean_token_accuracy": 0.7530447542667389, + "num_tokens": 27202362.0, + "step": 356 + }, + { + "entropy": 0.612061083316803, + "epoch": 4.704318936877076, + "grad_norm": 0.020625028759241104, + "learning_rate": 0.0002, + "loss": 0.6064684987068176, + "mean_token_accuracy": 0.7540236860513687, + "num_tokens": 27279536.0, + "step": 357 + }, + { + "entropy": 0.5989892184734344, + "epoch": 4.717607973421927, + "grad_norm": 0.022561894729733467, + "learning_rate": 0.0002, + "loss": 0.6045775413513184, + "mean_token_accuracy": 0.7552504390478134, + "num_tokens": 27355777.0, + "step": 358 + }, + { + "entropy": 0.6044065952301025, + "epoch": 4.730897009966777, + "grad_norm": 0.02225874364376068, + "learning_rate": 0.0002, + "loss": 0.6069464087486267, + "mean_token_accuracy": 0.7543323785066605, + "num_tokens": 27433236.0, + "step": 359 + }, + { + "entropy": 0.5972677916288376, + "epoch": 4.7441860465116275, + "grad_norm": 0.02093445137143135, + "learning_rate": 0.0002, + "loss": 0.5954780578613281, + "mean_token_accuracy": 0.7601328641176224, + "num_tokens": 27510986.0, + "step": 360 + }, + { + "entropy": 0.6022268831729889, + "epoch": 4.7574750830564785, + "grad_norm": 0.021075721830129623, + "learning_rate": 0.0002, + "loss": 0.5991562604904175, + "mean_token_accuracy": 0.7573902904987335, + "num_tokens": 27588512.0, + "step": 361 + }, + { + "entropy": 0.6112276464700699, + "epoch": 4.770764119601329, + "grad_norm": 0.02440483868122101, + "learning_rate": 0.0002, + "loss": 0.6071096062660217, + "mean_token_accuracy": 0.7541078478097916, + "num_tokens": 27665251.0, + "step": 362 + }, + { + "entropy": 0.5961045920848846, + "epoch": 4.78405315614618, + "grad_norm": 0.022120723500847816, + "learning_rate": 0.0002, + "loss": 0.5972861051559448, + "mean_token_accuracy": 0.759039893746376, + "num_tokens": 27743007.0, + "step": 363 + }, + { + "entropy": 0.6066542267799377, + "epoch": 4.79734219269103, + "grad_norm": 0.023716753348708153, + "learning_rate": 0.0002, + "loss": 0.6147413849830627, + "mean_token_accuracy": 0.7499552518129349, + "num_tokens": 27820021.0, + "step": 364 + }, + { + "entropy": 0.5942088961601257, + "epoch": 4.810631229235881, + "grad_norm": 0.02047412469983101, + "learning_rate": 0.0002, + "loss": 0.5935304164886475, + "mean_token_accuracy": 0.7592828571796417, + "num_tokens": 27899202.0, + "step": 365 + }, + { + "entropy": 0.6142376959323883, + "epoch": 4.823920265780731, + "grad_norm": 0.019972192123532295, + "learning_rate": 0.0002, + "loss": 0.6080060601234436, + "mean_token_accuracy": 0.7540056705474854, + "num_tokens": 27975745.0, + "step": 366 + }, + { + "entropy": 0.6211676597595215, + "epoch": 4.837209302325581, + "grad_norm": 0.01891135610640049, + "learning_rate": 0.0002, + "loss": 0.6165120601654053, + "mean_token_accuracy": 0.7498104870319366, + "num_tokens": 28052581.0, + "step": 367 + }, + { + "entropy": 0.6221711933612823, + "epoch": 4.850498338870432, + "grad_norm": 0.021222159266471863, + "learning_rate": 0.0002, + "loss": 0.6228503584861755, + "mean_token_accuracy": 0.7477325350046158, + "num_tokens": 28130356.0, + "step": 368 + }, + { + "entropy": 0.6133296489715576, + "epoch": 4.863787375415282, + "grad_norm": 0.01770627126097679, + "learning_rate": 0.0002, + "loss": 0.6078294515609741, + "mean_token_accuracy": 0.75361567735672, + "num_tokens": 28209070.0, + "step": 369 + }, + { + "entropy": 0.6115191429853439, + "epoch": 4.877076411960132, + "grad_norm": 0.0216510072350502, + "learning_rate": 0.0002, + "loss": 0.6120319366455078, + "mean_token_accuracy": 0.7516486942768097, + "num_tokens": 28285924.0, + "step": 370 + }, + { + "entropy": 0.6047016680240631, + "epoch": 4.8903654485049834, + "grad_norm": 0.01667115092277527, + "learning_rate": 0.0002, + "loss": 0.6051798462867737, + "mean_token_accuracy": 0.7555322796106339, + "num_tokens": 28363320.0, + "step": 371 + }, + { + "entropy": 0.5979461371898651, + "epoch": 4.903654485049834, + "grad_norm": 0.019139152020215988, + "learning_rate": 0.0002, + "loss": 0.5993932485580444, + "mean_token_accuracy": 0.7574638575315475, + "num_tokens": 28439806.0, + "step": 372 + }, + { + "entropy": 0.6109994500875473, + "epoch": 4.916943521594685, + "grad_norm": 0.01768781803548336, + "learning_rate": 0.0002, + "loss": 0.6106141805648804, + "mean_token_accuracy": 0.7535261958837509, + "num_tokens": 28515862.0, + "step": 373 + }, + { + "entropy": 0.6056813150644302, + "epoch": 4.930232558139535, + "grad_norm": 0.018335502594709396, + "learning_rate": 0.0002, + "loss": 0.6071027517318726, + "mean_token_accuracy": 0.7535324543714523, + "num_tokens": 28593556.0, + "step": 374 + }, + { + "entropy": 0.6102660298347473, + "epoch": 4.943521594684386, + "grad_norm": 0.021193454042077065, + "learning_rate": 0.0002, + "loss": 0.6112580299377441, + "mean_token_accuracy": 0.7507810145616531, + "num_tokens": 28669898.0, + "step": 375 + }, + { + "entropy": 0.6051753759384155, + "epoch": 4.956810631229236, + "grad_norm": 0.017476912587881088, + "learning_rate": 0.0002, + "loss": 0.6048047542572021, + "mean_token_accuracy": 0.7546576112508774, + "num_tokens": 28747381.0, + "step": 376 + }, + { + "entropy": 0.6031095385551453, + "epoch": 4.970099667774086, + "grad_norm": 0.02010265551507473, + "learning_rate": 0.0002, + "loss": 0.6020570993423462, + "mean_token_accuracy": 0.7562482059001923, + "num_tokens": 28824682.0, + "step": 377 + }, + { + "entropy": 0.6015651375055313, + "epoch": 4.983388704318937, + "grad_norm": 0.017594128847122192, + "learning_rate": 0.0002, + "loss": 0.5969172120094299, + "mean_token_accuracy": 0.7577322870492935, + "num_tokens": 28902597.0, + "step": 378 + }, + { + "entropy": 0.6108541786670685, + "epoch": 4.996677740863787, + "grad_norm": 0.017801743000745773, + "learning_rate": 0.0002, + "loss": 0.6123338937759399, + "mean_token_accuracy": 0.7520528733730316, + "num_tokens": 28978655.0, + "step": 379 + }, + { + "entropy": 0.6161795854568481, + "epoch": 5.0, + "grad_norm": 0.03153039887547493, + "learning_rate": 0.0002, + "loss": 0.615233302116394, + "mean_token_accuracy": 0.747843325138092, + "num_tokens": 28997446.0, + "step": 380 + }, + { + "entropy": 0.5995142012834549, + "epoch": 5.01328903654485, + "grad_norm": 0.026796070858836174, + "learning_rate": 0.0002, + "loss": 0.5935805439949036, + "mean_token_accuracy": 0.7586488872766495, + "num_tokens": 29076201.0, + "step": 381 + }, + { + "entropy": 0.601159080862999, + "epoch": 5.026578073089701, + "grad_norm": 0.018563998863101006, + "learning_rate": 0.0002, + "loss": 0.5995253324508667, + "mean_token_accuracy": 0.7558069676160812, + "num_tokens": 29153928.0, + "step": 382 + }, + { + "entropy": 0.6012768000364304, + "epoch": 5.039867109634551, + "grad_norm": 0.02645065449178219, + "learning_rate": 0.0002, + "loss": 0.6047909259796143, + "mean_token_accuracy": 0.7550944089889526, + "num_tokens": 29229990.0, + "step": 383 + }, + { + "entropy": 0.6111899763345718, + "epoch": 5.053156146179402, + "grad_norm": 0.018297409638762474, + "learning_rate": 0.0002, + "loss": 0.6090985536575317, + "mean_token_accuracy": 0.7526888698339462, + "num_tokens": 29306722.0, + "step": 384 + }, + { + "entropy": 0.6029917150735855, + "epoch": 5.0664451827242525, + "grad_norm": 0.020064735785126686, + "learning_rate": 0.0002, + "loss": 0.6002858877182007, + "mean_token_accuracy": 0.7555706948041916, + "num_tokens": 29383481.0, + "step": 385 + }, + { + "entropy": 0.6103447079658508, + "epoch": 5.079734219269103, + "grad_norm": 0.020298415794968605, + "learning_rate": 0.0002, + "loss": 0.6126797795295715, + "mean_token_accuracy": 0.750050887465477, + "num_tokens": 29459538.0, + "step": 386 + }, + { + "entropy": 0.5905372053384781, + "epoch": 5.093023255813954, + "grad_norm": 0.02092077024281025, + "learning_rate": 0.0002, + "loss": 0.5949006676673889, + "mean_token_accuracy": 0.7592107206583023, + "num_tokens": 29537367.0, + "step": 387 + }, + { + "entropy": 0.6050836890935898, + "epoch": 5.106312292358804, + "grad_norm": 0.01800566352903843, + "learning_rate": 0.0002, + "loss": 0.6042923331260681, + "mean_token_accuracy": 0.7541112899780273, + "num_tokens": 29615052.0, + "step": 388 + }, + { + "entropy": 0.6001386642456055, + "epoch": 5.119601328903655, + "grad_norm": 0.018633391708135605, + "learning_rate": 0.0002, + "loss": 0.5960696935653687, + "mean_token_accuracy": 0.7574971616268158, + "num_tokens": 29692726.0, + "step": 389 + }, + { + "entropy": 0.6089471280574799, + "epoch": 5.132890365448505, + "grad_norm": 0.01885078474879265, + "learning_rate": 0.0002, + "loss": 0.6077396869659424, + "mean_token_accuracy": 0.7536272257566452, + "num_tokens": 29769618.0, + "step": 390 + }, + { + "entropy": 0.6024085730314255, + "epoch": 5.146179401993355, + "grad_norm": 0.018104583024978638, + "learning_rate": 0.0002, + "loss": 0.600939154624939, + "mean_token_accuracy": 0.7558382600545883, + "num_tokens": 29846694.0, + "step": 391 + }, + { + "entropy": 0.6064421534538269, + "epoch": 5.159468438538206, + "grad_norm": 0.02171364240348339, + "learning_rate": 0.0002, + "loss": 0.6077273488044739, + "mean_token_accuracy": 0.7519265413284302, + "num_tokens": 29924010.0, + "step": 392 + }, + { + "entropy": 0.6087502092123032, + "epoch": 5.172757475083056, + "grad_norm": 0.01920831762254238, + "learning_rate": 0.0002, + "loss": 0.6057215929031372, + "mean_token_accuracy": 0.7533555775880814, + "num_tokens": 30000259.0, + "step": 393 + }, + { + "entropy": 0.6092672497034073, + "epoch": 5.186046511627907, + "grad_norm": 0.022611141204833984, + "learning_rate": 0.0002, + "loss": 0.6060106754302979, + "mean_token_accuracy": 0.7521137148141861, + "num_tokens": 30076312.0, + "step": 394 + }, + { + "entropy": 0.6014163643121719, + "epoch": 5.1993355481727574, + "grad_norm": 0.020460529252886772, + "learning_rate": 0.0002, + "loss": 0.6025012731552124, + "mean_token_accuracy": 0.7566916793584824, + "num_tokens": 30152994.0, + "step": 395 + }, + { + "entropy": 0.6095530837774277, + "epoch": 5.212624584717608, + "grad_norm": 0.025972452014684677, + "learning_rate": 0.0002, + "loss": 0.6138255596160889, + "mean_token_accuracy": 0.7497290223836899, + "num_tokens": 30230278.0, + "step": 396 + }, + { + "entropy": 0.6058608740568161, + "epoch": 5.225913621262459, + "grad_norm": 0.022098204120993614, + "learning_rate": 0.0002, + "loss": 0.6035760641098022, + "mean_token_accuracy": 0.7541337609291077, + "num_tokens": 30307279.0, + "step": 397 + }, + { + "entropy": 0.6170176565647125, + "epoch": 5.239202657807309, + "grad_norm": 0.023136481642723083, + "learning_rate": 0.0002, + "loss": 0.6125384569168091, + "mean_token_accuracy": 0.7498274445533752, + "num_tokens": 30383739.0, + "step": 398 + }, + { + "entropy": 0.6107608377933502, + "epoch": 5.25249169435216, + "grad_norm": 0.02006644383072853, + "learning_rate": 0.0002, + "loss": 0.6078338623046875, + "mean_token_accuracy": 0.7535765767097473, + "num_tokens": 30461994.0, + "step": 399 + }, + { + "entropy": 0.5954063683748245, + "epoch": 5.26578073089701, + "grad_norm": 0.0214250311255455, + "learning_rate": 0.0002, + "loss": 0.5987457633018494, + "mean_token_accuracy": 0.7550365626811981, + "num_tokens": 30539252.0, + "step": 400 + }, + { + "entropy": 0.5920732617378235, + "epoch": 5.27906976744186, + "grad_norm": 0.023511109873652458, + "learning_rate": 0.0002, + "loss": 0.5931231379508972, + "mean_token_accuracy": 0.7596782594919205, + "num_tokens": 30616185.0, + "step": 401 + }, + { + "entropy": 0.6125746220350266, + "epoch": 5.292358803986711, + "grad_norm": 0.021425219252705574, + "learning_rate": 0.0002, + "loss": 0.6082620024681091, + "mean_token_accuracy": 0.7525101006031036, + "num_tokens": 30694587.0, + "step": 402 + }, + { + "entropy": 0.6051463186740875, + "epoch": 5.305647840531561, + "grad_norm": 0.02150619402527809, + "learning_rate": 0.0002, + "loss": 0.6045330762863159, + "mean_token_accuracy": 0.7547799497842789, + "num_tokens": 30770628.0, + "step": 403 + }, + { + "entropy": 0.6073088049888611, + "epoch": 5.318936877076412, + "grad_norm": 0.02284197509288788, + "learning_rate": 0.0002, + "loss": 0.6082872152328491, + "mean_token_accuracy": 0.7527147084474564, + "num_tokens": 30848582.0, + "step": 404 + }, + { + "entropy": 0.6121865510940552, + "epoch": 5.332225913621262, + "grad_norm": 0.020565764978528023, + "learning_rate": 0.0002, + "loss": 0.6121588945388794, + "mean_token_accuracy": 0.7523892968893051, + "num_tokens": 30924512.0, + "step": 405 + }, + { + "entropy": 0.6082987636327744, + "epoch": 5.3455149501661126, + "grad_norm": 0.022758690640330315, + "learning_rate": 0.0002, + "loss": 0.6041635274887085, + "mean_token_accuracy": 0.753796249628067, + "num_tokens": 31001346.0, + "step": 406 + }, + { + "entropy": 0.5950210988521576, + "epoch": 5.358803986710964, + "grad_norm": 0.0222301185131073, + "learning_rate": 0.0002, + "loss": 0.59589684009552, + "mean_token_accuracy": 0.7587986141443253, + "num_tokens": 31078724.0, + "step": 407 + }, + { + "entropy": 0.6093401461839676, + "epoch": 5.372093023255814, + "grad_norm": 0.02389850653707981, + "learning_rate": 0.0002, + "loss": 0.6132184863090515, + "mean_token_accuracy": 0.7504485845565796, + "num_tokens": 31155347.0, + "step": 408 + }, + { + "entropy": 0.608631044626236, + "epoch": 5.385382059800665, + "grad_norm": 0.022204812616109848, + "learning_rate": 0.0002, + "loss": 0.6059432029724121, + "mean_token_accuracy": 0.7542549520730972, + "num_tokens": 31231904.0, + "step": 409 + }, + { + "entropy": 0.6069070398807526, + "epoch": 5.398671096345515, + "grad_norm": 0.023435460403561592, + "learning_rate": 0.0002, + "loss": 0.6022323966026306, + "mean_token_accuracy": 0.7551652491092682, + "num_tokens": 31308737.0, + "step": 410 + }, + { + "entropy": 0.5989623218774796, + "epoch": 5.411960132890365, + "grad_norm": 0.02185729704797268, + "learning_rate": 0.0002, + "loss": 0.6007922887802124, + "mean_token_accuracy": 0.7555037587881088, + "num_tokens": 31386653.0, + "step": 411 + }, + { + "entropy": 0.5904630720615387, + "epoch": 5.425249169435216, + "grad_norm": 0.022226441651582718, + "learning_rate": 0.0002, + "loss": 0.5928571224212646, + "mean_token_accuracy": 0.760121151804924, + "num_tokens": 31463650.0, + "step": 412 + }, + { + "entropy": 0.6058047413825989, + "epoch": 5.438538205980066, + "grad_norm": 0.023930639028549194, + "learning_rate": 0.0002, + "loss": 0.6058739423751831, + "mean_token_accuracy": 0.7543499618768692, + "num_tokens": 31540496.0, + "step": 413 + }, + { + "entropy": 0.6111002117395401, + "epoch": 5.451827242524917, + "grad_norm": 0.025340192019939423, + "learning_rate": 0.0002, + "loss": 0.6081179976463318, + "mean_token_accuracy": 0.7525225430727005, + "num_tokens": 31618008.0, + "step": 414 + }, + { + "entropy": 0.60789455473423, + "epoch": 5.465116279069767, + "grad_norm": 0.026184657588601112, + "learning_rate": 0.0002, + "loss": 0.6058934926986694, + "mean_token_accuracy": 0.7536182105541229, + "num_tokens": 31694894.0, + "step": 415 + }, + { + "entropy": 0.6068686991930008, + "epoch": 5.4784053156146175, + "grad_norm": 0.025053244084119797, + "learning_rate": 0.0002, + "loss": 0.6021319627761841, + "mean_token_accuracy": 0.7556831687688828, + "num_tokens": 31771491.0, + "step": 416 + }, + { + "entropy": 0.5977303683757782, + "epoch": 5.4916943521594686, + "grad_norm": 0.027724595740437508, + "learning_rate": 0.0002, + "loss": 0.5973233580589294, + "mean_token_accuracy": 0.7579130828380585, + "num_tokens": 31848344.0, + "step": 417 + }, + { + "entropy": 0.5988890677690506, + "epoch": 5.504983388704319, + "grad_norm": 0.024887511506676674, + "learning_rate": 0.0002, + "loss": 0.5990090370178223, + "mean_token_accuracy": 0.7568196505308151, + "num_tokens": 31924995.0, + "step": 418 + }, + { + "entropy": 0.604000598192215, + "epoch": 5.51827242524917, + "grad_norm": 0.022586684674024582, + "learning_rate": 0.0002, + "loss": 0.603076159954071, + "mean_token_accuracy": 0.7565865963697433, + "num_tokens": 32002254.0, + "step": 419 + }, + { + "entropy": 0.615940272808075, + "epoch": 5.53156146179402, + "grad_norm": 0.022485308349132538, + "learning_rate": 0.0002, + "loss": 0.6086373329162598, + "mean_token_accuracy": 0.7531540840864182, + "num_tokens": 32079285.0, + "step": 420 + }, + { + "entropy": 0.6028707474470139, + "epoch": 5.544850498338871, + "grad_norm": 0.020232876762747765, + "learning_rate": 0.0002, + "loss": 0.601585865020752, + "mean_token_accuracy": 0.7566490918397903, + "num_tokens": 32156864.0, + "step": 421 + }, + { + "entropy": 0.6076253652572632, + "epoch": 5.558139534883721, + "grad_norm": 0.02617458626627922, + "learning_rate": 0.0002, + "loss": 0.6145195960998535, + "mean_token_accuracy": 0.7500647902488708, + "num_tokens": 32232846.0, + "step": 422 + }, + { + "entropy": 0.6028987616300583, + "epoch": 5.571428571428571, + "grad_norm": 0.02070811204612255, + "learning_rate": 0.0002, + "loss": 0.6059699654579163, + "mean_token_accuracy": 0.7536882907152176, + "num_tokens": 32310436.0, + "step": 423 + }, + { + "entropy": 0.5917141884565353, + "epoch": 5.584717607973422, + "grad_norm": 0.023316729813814163, + "learning_rate": 0.0002, + "loss": 0.5854599475860596, + "mean_token_accuracy": 0.7629671841859818, + "num_tokens": 32388971.0, + "step": 424 + }, + { + "entropy": 0.6023311167955399, + "epoch": 5.598006644518272, + "grad_norm": 0.020066890865564346, + "learning_rate": 0.0002, + "loss": 0.5990334749221802, + "mean_token_accuracy": 0.7573604434728622, + "num_tokens": 32467120.0, + "step": 425 + }, + { + "entropy": 0.5993306934833527, + "epoch": 5.6112956810631225, + "grad_norm": 0.023425690829753876, + "learning_rate": 0.0002, + "loss": 0.6018670797348022, + "mean_token_accuracy": 0.7574460357427597, + "num_tokens": 32543753.0, + "step": 426 + }, + { + "entropy": 0.6028042286634445, + "epoch": 5.6245847176079735, + "grad_norm": 0.02132745273411274, + "learning_rate": 0.0002, + "loss": 0.6041662693023682, + "mean_token_accuracy": 0.754668191075325, + "num_tokens": 32621427.0, + "step": 427 + }, + { + "entropy": 0.604213684797287, + "epoch": 5.637873754152824, + "grad_norm": 0.018084127455949783, + "learning_rate": 0.0002, + "loss": 0.6012581586837769, + "mean_token_accuracy": 0.7556634992361069, + "num_tokens": 32699682.0, + "step": 428 + }, + { + "entropy": 0.6124961525201797, + "epoch": 5.651162790697675, + "grad_norm": 0.02083444967865944, + "learning_rate": 0.0002, + "loss": 0.6100834608078003, + "mean_token_accuracy": 0.7531006336212158, + "num_tokens": 32775962.0, + "step": 429 + }, + { + "entropy": 0.5948987603187561, + "epoch": 5.664451827242525, + "grad_norm": 0.021068530157208443, + "learning_rate": 0.0002, + "loss": 0.5865616798400879, + "mean_token_accuracy": 0.7617778778076172, + "num_tokens": 32854001.0, + "step": 430 + }, + { + "entropy": 0.5962036401033401, + "epoch": 5.677740863787376, + "grad_norm": 0.018948592245578766, + "learning_rate": 0.0002, + "loss": 0.5950455069541931, + "mean_token_accuracy": 0.7579799294471741, + "num_tokens": 32931336.0, + "step": 431 + }, + { + "entropy": 0.5971734374761581, + "epoch": 5.691029900332226, + "grad_norm": 0.020609233528375626, + "learning_rate": 0.0002, + "loss": 0.5992528796195984, + "mean_token_accuracy": 0.7560512125492096, + "num_tokens": 33007780.0, + "step": 432 + }, + { + "entropy": 0.600962370634079, + "epoch": 5.704318936877076, + "grad_norm": 0.02043914794921875, + "learning_rate": 0.0002, + "loss": 0.6053571701049805, + "mean_token_accuracy": 0.7534149289131165, + "num_tokens": 33083865.0, + "step": 433 + }, + { + "entropy": 0.6037783920764923, + "epoch": 5.717607973421927, + "grad_norm": 0.02007639966905117, + "learning_rate": 0.0002, + "loss": 0.6004524230957031, + "mean_token_accuracy": 0.7554492056369781, + "num_tokens": 33160697.0, + "step": 434 + }, + { + "entropy": 0.6123286634683609, + "epoch": 5.730897009966777, + "grad_norm": 0.022184055298566818, + "learning_rate": 0.0002, + "loss": 0.6058014631271362, + "mean_token_accuracy": 0.7532261461019516, + "num_tokens": 33237480.0, + "step": 435 + }, + { + "entropy": 0.6141447126865387, + "epoch": 5.7441860465116275, + "grad_norm": 0.02083767205476761, + "learning_rate": 0.0002, + "loss": 0.610468864440918, + "mean_token_accuracy": 0.7515555173158646, + "num_tokens": 33314013.0, + "step": 436 + }, + { + "entropy": 0.6035348027944565, + "epoch": 5.7574750830564785, + "grad_norm": 0.024816464632749557, + "learning_rate": 0.0002, + "loss": 0.6087946891784668, + "mean_token_accuracy": 0.754722535610199, + "num_tokens": 33390218.0, + "step": 437 + }, + { + "entropy": 0.5946770757436752, + "epoch": 5.770764119601329, + "grad_norm": 0.022571545094251633, + "learning_rate": 0.0002, + "loss": 0.596878170967102, + "mean_token_accuracy": 0.7579701691865921, + "num_tokens": 33468134.0, + "step": 438 + }, + { + "entropy": 0.6164768636226654, + "epoch": 5.78405315614618, + "grad_norm": 0.024533748626708984, + "learning_rate": 0.0002, + "loss": 0.6126947402954102, + "mean_token_accuracy": 0.7517720609903336, + "num_tokens": 33543916.0, + "step": 439 + }, + { + "entropy": 0.6056448072195053, + "epoch": 5.79734219269103, + "grad_norm": 0.020430127158761024, + "learning_rate": 0.0002, + "loss": 0.6013854742050171, + "mean_token_accuracy": 0.756991907954216, + "num_tokens": 33620951.0, + "step": 440 + }, + { + "entropy": 0.5991196930408478, + "epoch": 5.810631229235881, + "grad_norm": 0.021590569987893105, + "learning_rate": 0.0002, + "loss": 0.5991401672363281, + "mean_token_accuracy": 0.7567178606987, + "num_tokens": 33698477.0, + "step": 441 + }, + { + "entropy": 0.5983557999134064, + "epoch": 5.823920265780731, + "grad_norm": 0.02526337280869484, + "learning_rate": 0.0002, + "loss": 0.6028835773468018, + "mean_token_accuracy": 0.7568080127239227, + "num_tokens": 33776296.0, + "step": 442 + }, + { + "entropy": 0.6031540036201477, + "epoch": 5.837209302325581, + "grad_norm": 0.02267344854772091, + "learning_rate": 0.0002, + "loss": 0.6034103631973267, + "mean_token_accuracy": 0.754448652267456, + "num_tokens": 33853842.0, + "step": 443 + }, + { + "entropy": 0.6104815006256104, + "epoch": 5.850498338870432, + "grad_norm": 0.020782535895705223, + "learning_rate": 0.0002, + "loss": 0.6049699783325195, + "mean_token_accuracy": 0.7535883188247681, + "num_tokens": 33930886.0, + "step": 444 + }, + { + "entropy": 0.5981206297874451, + "epoch": 5.863787375415282, + "grad_norm": 0.023540036752820015, + "learning_rate": 0.0002, + "loss": 0.5923410058021545, + "mean_token_accuracy": 0.7591070085763931, + "num_tokens": 34007350.0, + "step": 445 + }, + { + "entropy": 0.6036737859249115, + "epoch": 5.877076411960132, + "grad_norm": 0.02499704249203205, + "learning_rate": 0.0002, + "loss": 0.6046547889709473, + "mean_token_accuracy": 0.7538949996232986, + "num_tokens": 34084012.0, + "step": 446 + }, + { + "entropy": 0.5917275696992874, + "epoch": 5.8903654485049834, + "grad_norm": 0.025873389095067978, + "learning_rate": 0.0002, + "loss": 0.5952780246734619, + "mean_token_accuracy": 0.7577290534973145, + "num_tokens": 34160998.0, + "step": 447 + }, + { + "entropy": 0.6122117638587952, + "epoch": 5.903654485049834, + "grad_norm": 0.028246693313121796, + "learning_rate": 0.0002, + "loss": 0.6137705445289612, + "mean_token_accuracy": 0.7516694515943527, + "num_tokens": 34238302.0, + "step": 448 + }, + { + "entropy": 0.6051677614450455, + "epoch": 5.916943521594685, + "grad_norm": 0.031234685331583023, + "learning_rate": 0.0002, + "loss": 0.5974487066268921, + "mean_token_accuracy": 0.7570804208517075, + "num_tokens": 34315312.0, + "step": 449 + }, + { + "entropy": 0.6137758642435074, + "epoch": 5.930232558139535, + "grad_norm": 0.03217904269695282, + "learning_rate": 0.0002, + "loss": 0.6115902066230774, + "mean_token_accuracy": 0.752965971827507, + "num_tokens": 34392319.0, + "step": 450 + }, + { + "entropy": 0.6072733849287033, + "epoch": 5.943521594684386, + "grad_norm": 0.03081611543893814, + "learning_rate": 0.0002, + "loss": 0.6136135458946228, + "mean_token_accuracy": 0.7503504902124405, + "num_tokens": 34468277.0, + "step": 451 + }, + { + "entropy": 0.6001786440610886, + "epoch": 5.956810631229236, + "grad_norm": 0.02687067538499832, + "learning_rate": 0.0002, + "loss": 0.5990195274353027, + "mean_token_accuracy": 0.7577933222055435, + "num_tokens": 34545839.0, + "step": 452 + }, + { + "entropy": 0.612625390291214, + "epoch": 5.970099667774086, + "grad_norm": 0.03187267854809761, + "learning_rate": 0.0002, + "loss": 0.6082343459129333, + "mean_token_accuracy": 0.7538764029741287, + "num_tokens": 34623128.0, + "step": 453 + }, + { + "entropy": 0.6080211997032166, + "epoch": 5.983388704318937, + "grad_norm": 0.028988594189286232, + "learning_rate": 0.0002, + "loss": 0.6047749519348145, + "mean_token_accuracy": 0.7554045468568802, + "num_tokens": 34700832.0, + "step": 454 + }, + { + "entropy": 0.5958880931138992, + "epoch": 5.996677740863787, + "grad_norm": 0.027844693511724472, + "learning_rate": 0.0002, + "loss": 0.5956987142562866, + "mean_token_accuracy": 0.7574048638343811, + "num_tokens": 34777605.0, + "step": 455 + }, + { + "entropy": 0.5998430252075195, + "epoch": 6.0, + "grad_norm": 0.04323003441095352, + "learning_rate": 0.0002, + "loss": 0.6032893657684326, + "mean_token_accuracy": 0.7568454146385193, + "num_tokens": 34796943.0, + "step": 456 + }, + { + "entropy": 0.6120886653661728, + "epoch": 6.01328903654485, + "grad_norm": 0.025641195476055145, + "learning_rate": 0.0002, + "loss": 0.6044338345527649, + "mean_token_accuracy": 0.7545018643140793, + "num_tokens": 34873973.0, + "step": 457 + }, + { + "entropy": 0.600526973605156, + "epoch": 6.026578073089701, + "grad_norm": 0.027644747868180275, + "learning_rate": 0.0002, + "loss": 0.5954704284667969, + "mean_token_accuracy": 0.7591830790042877, + "num_tokens": 34950550.0, + "step": 458 + }, + { + "entropy": 0.5978350341320038, + "epoch": 6.039867109634551, + "grad_norm": 0.022663088515400887, + "learning_rate": 0.0002, + "loss": 0.5966336727142334, + "mean_token_accuracy": 0.7568895518779755, + "num_tokens": 35027626.0, + "step": 459 + }, + { + "entropy": 0.5985796898603439, + "epoch": 6.053156146179402, + "grad_norm": 0.027262212708592415, + "learning_rate": 0.0002, + "loss": 0.6055795550346375, + "mean_token_accuracy": 0.7541183084249496, + "num_tokens": 35104160.0, + "step": 460 + }, + { + "entropy": 0.606357529759407, + "epoch": 6.0664451827242525, + "grad_norm": 0.021243030205368996, + "learning_rate": 0.0002, + "loss": 0.6038681268692017, + "mean_token_accuracy": 0.7561346888542175, + "num_tokens": 35180440.0, + "step": 461 + }, + { + "entropy": 0.5993641018867493, + "epoch": 6.079734219269103, + "grad_norm": 0.02454681135714054, + "learning_rate": 0.0002, + "loss": 0.5979468822479248, + "mean_token_accuracy": 0.7567647844552994, + "num_tokens": 35257736.0, + "step": 462 + }, + { + "entropy": 0.5848215073347092, + "epoch": 6.093023255813954, + "grad_norm": 0.022167058661580086, + "learning_rate": 0.0002, + "loss": 0.585566520690918, + "mean_token_accuracy": 0.762741819024086, + "num_tokens": 35335235.0, + "step": 463 + }, + { + "entropy": 0.5985981374979019, + "epoch": 6.106312292358804, + "grad_norm": 0.024154378101229668, + "learning_rate": 0.0002, + "loss": 0.6016069650650024, + "mean_token_accuracy": 0.7554454803466797, + "num_tokens": 35412861.0, + "step": 464 + }, + { + "entropy": 0.6006908863782883, + "epoch": 6.119601328903655, + "grad_norm": 0.022460851818323135, + "learning_rate": 0.0002, + "loss": 0.6020187139511108, + "mean_token_accuracy": 0.7560145705938339, + "num_tokens": 35489552.0, + "step": 465 + }, + { + "entropy": 0.5931369364261627, + "epoch": 6.132890365448505, + "grad_norm": 0.02682335674762726, + "learning_rate": 0.0002, + "loss": 0.5886173248291016, + "mean_token_accuracy": 0.7600135207176208, + "num_tokens": 35566976.0, + "step": 466 + }, + { + "entropy": 0.606135219335556, + "epoch": 6.146179401993355, + "grad_norm": 0.022801680490374565, + "learning_rate": 0.0002, + "loss": 0.6008643507957458, + "mean_token_accuracy": 0.7537801265716553, + "num_tokens": 35644809.0, + "step": 467 + }, + { + "entropy": 0.5942219793796539, + "epoch": 6.159468438538206, + "grad_norm": 0.023526513949036598, + "learning_rate": 0.0002, + "loss": 0.5949859619140625, + "mean_token_accuracy": 0.7583627551794052, + "num_tokens": 35722320.0, + "step": 468 + }, + { + "entropy": 0.600348949432373, + "epoch": 6.172757475083056, + "grad_norm": 0.02136663906276226, + "learning_rate": 0.0002, + "loss": 0.6002007722854614, + "mean_token_accuracy": 0.7563091218471527, + "num_tokens": 35799676.0, + "step": 469 + }, + { + "entropy": 0.5929514020681381, + "epoch": 6.186046511627907, + "grad_norm": 0.020419945940375328, + "learning_rate": 0.0002, + "loss": 0.5907375812530518, + "mean_token_accuracy": 0.758481040596962, + "num_tokens": 35876561.0, + "step": 470 + }, + { + "entropy": 0.6010562926530838, + "epoch": 6.1993355481727574, + "grad_norm": 0.021938690915703773, + "learning_rate": 0.0002, + "loss": 0.596697211265564, + "mean_token_accuracy": 0.7577521502971649, + "num_tokens": 35954003.0, + "step": 471 + }, + { + "entropy": 0.5978391021490097, + "epoch": 6.212624584717608, + "grad_norm": 0.02111574076116085, + "learning_rate": 0.0002, + "loss": 0.5977692008018494, + "mean_token_accuracy": 0.7567316740751266, + "num_tokens": 36030974.0, + "step": 472 + }, + { + "entropy": 0.6060666143894196, + "epoch": 6.225913621262459, + "grad_norm": 0.020165806636214256, + "learning_rate": 0.0002, + "loss": 0.6070280075073242, + "mean_token_accuracy": 0.753100574016571, + "num_tokens": 36108601.0, + "step": 473 + }, + { + "entropy": 0.5992994010448456, + "epoch": 6.239202657807309, + "grad_norm": 0.020219672471284866, + "learning_rate": 0.0002, + "loss": 0.5985912680625916, + "mean_token_accuracy": 0.7557387799024582, + "num_tokens": 36185763.0, + "step": 474 + }, + { + "entropy": 0.6000545620918274, + "epoch": 6.25249169435216, + "grad_norm": 0.02075883187353611, + "learning_rate": 0.0002, + "loss": 0.6000256538391113, + "mean_token_accuracy": 0.756579726934433, + "num_tokens": 36262158.0, + "step": 475 + }, + { + "entropy": 0.5993035733699799, + "epoch": 6.26578073089701, + "grad_norm": 0.021321367472410202, + "learning_rate": 0.0002, + "loss": 0.59999680519104, + "mean_token_accuracy": 0.7556854337453842, + "num_tokens": 36338496.0, + "step": 476 + }, + { + "entropy": 0.5979324728250504, + "epoch": 6.27906976744186, + "grad_norm": 0.024508945643901825, + "learning_rate": 0.0002, + "loss": 0.5982510447502136, + "mean_token_accuracy": 0.7566314190626144, + "num_tokens": 36415527.0, + "step": 477 + }, + { + "entropy": 0.6013223379850388, + "epoch": 6.292358803986711, + "grad_norm": 0.02557053230702877, + "learning_rate": 0.0002, + "loss": 0.5949776768684387, + "mean_token_accuracy": 0.7575513571500778, + "num_tokens": 36492514.0, + "step": 478 + }, + { + "entropy": 0.5949330031871796, + "epoch": 6.305647840531561, + "grad_norm": 0.02301526628434658, + "learning_rate": 0.0002, + "loss": 0.5910919904708862, + "mean_token_accuracy": 0.7598573863506317, + "num_tokens": 36570074.0, + "step": 479 + }, + { + "entropy": 0.5883470773696899, + "epoch": 6.318936877076412, + "grad_norm": 0.025473203510046005, + "learning_rate": 0.0002, + "loss": 0.5894684791564941, + "mean_token_accuracy": 0.758475586771965, + "num_tokens": 36646855.0, + "step": 480 + }, + { + "entropy": 0.6115803718566895, + "epoch": 6.332225913621262, + "grad_norm": 0.027968522161245346, + "learning_rate": 0.0002, + "loss": 0.6107940673828125, + "mean_token_accuracy": 0.751880869269371, + "num_tokens": 36723088.0, + "step": 481 + }, + { + "entropy": 0.5995512008666992, + "epoch": 6.3455149501661126, + "grad_norm": 0.023139847442507744, + "learning_rate": 0.0002, + "loss": 0.5955934524536133, + "mean_token_accuracy": 0.758063018321991, + "num_tokens": 36800377.0, + "step": 482 + }, + { + "entropy": 0.6044798940420151, + "epoch": 6.358803986710964, + "grad_norm": 0.024419818073511124, + "learning_rate": 0.0002, + "loss": 0.6051414608955383, + "mean_token_accuracy": 0.7533292770385742, + "num_tokens": 36876791.0, + "step": 483 + }, + { + "entropy": 0.590464860200882, + "epoch": 6.372093023255814, + "grad_norm": 0.024506734684109688, + "learning_rate": 0.0002, + "loss": 0.5884811282157898, + "mean_token_accuracy": 0.7608850747346878, + "num_tokens": 36955168.0, + "step": 484 + }, + { + "entropy": 0.5885339975357056, + "epoch": 6.385382059800665, + "grad_norm": 0.02895374596118927, + "learning_rate": 0.0002, + "loss": 0.5923447608947754, + "mean_token_accuracy": 0.7594189345836639, + "num_tokens": 37032024.0, + "step": 485 + }, + { + "entropy": 0.5949011445045471, + "epoch": 6.398671096345515, + "grad_norm": 0.02935759536921978, + "learning_rate": 0.0002, + "loss": 0.5962386727333069, + "mean_token_accuracy": 0.7577309012413025, + "num_tokens": 37108607.0, + "step": 486 + }, + { + "entropy": 0.606280654668808, + "epoch": 6.411960132890365, + "grad_norm": 0.027602598071098328, + "learning_rate": 0.0002, + "loss": 0.6015469431877136, + "mean_token_accuracy": 0.7563475072383881, + "num_tokens": 37185963.0, + "step": 487 + }, + { + "entropy": 0.6054241806268692, + "epoch": 6.425249169435216, + "grad_norm": 0.03342454135417938, + "learning_rate": 0.0002, + "loss": 0.6038094758987427, + "mean_token_accuracy": 0.7535726577043533, + "num_tokens": 37262688.0, + "step": 488 + }, + { + "entropy": 0.6115904003381729, + "epoch": 6.438538205980066, + "grad_norm": 0.024562479928135872, + "learning_rate": 0.0002, + "loss": 0.6105020046234131, + "mean_token_accuracy": 0.752171978354454, + "num_tokens": 37339918.0, + "step": 489 + }, + { + "entropy": 0.6080169379711151, + "epoch": 6.451827242524917, + "grad_norm": 0.033320341259241104, + "learning_rate": 0.0002, + "loss": 0.6115527153015137, + "mean_token_accuracy": 0.7520752102136612, + "num_tokens": 37416200.0, + "step": 490 + }, + { + "entropy": 0.6040970087051392, + "epoch": 6.465116279069767, + "grad_norm": 0.02561773732304573, + "learning_rate": 0.0002, + "loss": 0.5990139842033386, + "mean_token_accuracy": 0.7566020637750626, + "num_tokens": 37494068.0, + "step": 491 + }, + { + "entropy": 0.5961304754018784, + "epoch": 6.4784053156146175, + "grad_norm": 0.030982809141278267, + "learning_rate": 0.0002, + "loss": 0.5901075601577759, + "mean_token_accuracy": 0.7607396245002747, + "num_tokens": 37571533.0, + "step": 492 + }, + { + "entropy": 0.5945215076208115, + "epoch": 6.4916943521594686, + "grad_norm": 0.024695293977856636, + "learning_rate": 0.0002, + "loss": 0.5971148014068604, + "mean_token_accuracy": 0.7563796937465668, + "num_tokens": 37648973.0, + "step": 493 + }, + { + "entropy": 0.5900432914495468, + "epoch": 6.504983388704319, + "grad_norm": 0.03201661631464958, + "learning_rate": 0.0002, + "loss": 0.5974127054214478, + "mean_token_accuracy": 0.7566387355327606, + "num_tokens": 37726459.0, + "step": 494 + }, + { + "entropy": 0.6024730056524277, + "epoch": 6.51827242524917, + "grad_norm": 0.024753453209996223, + "learning_rate": 0.0002, + "loss": 0.60154789686203, + "mean_token_accuracy": 0.7547302693128586, + "num_tokens": 37803467.0, + "step": 495 + }, + { + "entropy": 0.6144786328077316, + "epoch": 6.53156146179402, + "grad_norm": 0.028725173324346542, + "learning_rate": 0.0002, + "loss": 0.6057987213134766, + "mean_token_accuracy": 0.7548320293426514, + "num_tokens": 37880199.0, + "step": 496 + }, + { + "entropy": 0.6062168329954147, + "epoch": 6.544850498338871, + "grad_norm": 0.02327624335885048, + "learning_rate": 0.0002, + "loss": 0.6026209592819214, + "mean_token_accuracy": 0.7539927959442139, + "num_tokens": 37957412.0, + "step": 497 + }, + { + "entropy": 0.6021516770124435, + "epoch": 6.558139534883721, + "grad_norm": 0.03300193324685097, + "learning_rate": 0.0002, + "loss": 0.6078506112098694, + "mean_token_accuracy": 0.7522564381361008, + "num_tokens": 38034181.0, + "step": 498 + }, + { + "entropy": 0.5943173170089722, + "epoch": 6.571428571428571, + "grad_norm": 0.021800996735692024, + "learning_rate": 0.0002, + "loss": 0.5896530747413635, + "mean_token_accuracy": 0.7614179700613022, + "num_tokens": 38112342.0, + "step": 499 + }, + { + "entropy": 0.6014736741781235, + "epoch": 6.584717607973422, + "grad_norm": 0.029887963086366653, + "learning_rate": 0.0002, + "loss": 0.5958458185195923, + "mean_token_accuracy": 0.7576052695512772, + "num_tokens": 38189802.0, + "step": 500 + }, + { + "entropy": 0.6024068295955658, + "epoch": 6.598006644518272, + "grad_norm": 0.025521252304315567, + "learning_rate": 0.0002, + "loss": 0.6060903072357178, + "mean_token_accuracy": 0.753528967499733, + "num_tokens": 38266306.0, + "step": 501 + }, + { + "entropy": 0.5893438309431076, + "epoch": 6.6112956810631225, + "grad_norm": 0.0318656824529171, + "learning_rate": 0.0002, + "loss": 0.5963033437728882, + "mean_token_accuracy": 0.7568179666996002, + "num_tokens": 38343848.0, + "step": 502 + }, + { + "entropy": 0.6008411794900894, + "epoch": 6.6245847176079735, + "grad_norm": 0.024844203144311905, + "learning_rate": 0.0002, + "loss": 0.600379467010498, + "mean_token_accuracy": 0.7562743723392487, + "num_tokens": 38421065.0, + "step": 503 + }, + { + "entropy": 0.6024555712938309, + "epoch": 6.637873754152824, + "grad_norm": 0.02915586344897747, + "learning_rate": 0.0002, + "loss": 0.5952292084693909, + "mean_token_accuracy": 0.7569020986557007, + "num_tokens": 38497792.0, + "step": 504 + }, + { + "entropy": 0.6041858941316605, + "epoch": 6.651162790697675, + "grad_norm": 0.027332143858075142, + "learning_rate": 0.0002, + "loss": 0.5974034070968628, + "mean_token_accuracy": 0.7567848265171051, + "num_tokens": 38574161.0, + "step": 505 + }, + { + "entropy": 0.6042163372039795, + "epoch": 6.664451827242525, + "grad_norm": 0.027624888345599174, + "learning_rate": 0.0002, + "loss": 0.6048606634140015, + "mean_token_accuracy": 0.7530855089426041, + "num_tokens": 38650349.0, + "step": 506 + }, + { + "entropy": 0.59311243891716, + "epoch": 6.677740863787376, + "grad_norm": 0.028052296489477158, + "learning_rate": 0.0002, + "loss": 0.5949767827987671, + "mean_token_accuracy": 0.7584637403488159, + "num_tokens": 38727788.0, + "step": 507 + }, + { + "entropy": 0.5970088392496109, + "epoch": 6.691029900332226, + "grad_norm": 0.027488745748996735, + "learning_rate": 0.0002, + "loss": 0.5996758937835693, + "mean_token_accuracy": 0.7576368153095245, + "num_tokens": 38804821.0, + "step": 508 + }, + { + "entropy": 0.598954051733017, + "epoch": 6.704318936877076, + "grad_norm": 0.020494971424341202, + "learning_rate": 0.0002, + "loss": 0.5968008637428284, + "mean_token_accuracy": 0.7577658295631409, + "num_tokens": 38882149.0, + "step": 509 + }, + { + "entropy": 0.6018869280815125, + "epoch": 6.717607973421927, + "grad_norm": 0.025988485664129257, + "learning_rate": 0.0002, + "loss": 0.5987365245819092, + "mean_token_accuracy": 0.7569222897291183, + "num_tokens": 38958745.0, + "step": 510 + }, + { + "entropy": 0.5928902477025986, + "epoch": 6.730897009966777, + "grad_norm": 0.024826789274811745, + "learning_rate": 0.0002, + "loss": 0.5931652784347534, + "mean_token_accuracy": 0.760022446513176, + "num_tokens": 39036088.0, + "step": 511 + }, + { + "entropy": 0.600498303771019, + "epoch": 6.7441860465116275, + "grad_norm": 0.02464020438492298, + "learning_rate": 0.0002, + "loss": 0.5990219116210938, + "mean_token_accuracy": 0.7561146169900894, + "num_tokens": 39112787.0, + "step": 512 + }, + { + "entropy": 0.5943007320165634, + "epoch": 6.7574750830564785, + "grad_norm": 0.022298917174339294, + "learning_rate": 0.0002, + "loss": 0.5947438478469849, + "mean_token_accuracy": 0.7584742158651352, + "num_tokens": 39189290.0, + "step": 513 + }, + { + "entropy": 0.6023274958133698, + "epoch": 6.770764119601329, + "grad_norm": 0.02406785823404789, + "learning_rate": 0.0002, + "loss": 0.601665735244751, + "mean_token_accuracy": 0.754782423377037, + "num_tokens": 39266176.0, + "step": 514 + }, + { + "entropy": 0.6048448234796524, + "epoch": 6.78405315614618, + "grad_norm": 0.026156462728977203, + "learning_rate": 0.0002, + "loss": 0.6030054092407227, + "mean_token_accuracy": 0.7556321769952774, + "num_tokens": 39344181.0, + "step": 515 + }, + { + "entropy": 0.6049788296222687, + "epoch": 6.79734219269103, + "grad_norm": 0.02489808201789856, + "learning_rate": 0.0002, + "loss": 0.6032531261444092, + "mean_token_accuracy": 0.7542305439710617, + "num_tokens": 39421015.0, + "step": 516 + }, + { + "entropy": 0.597603052854538, + "epoch": 6.810631229235881, + "grad_norm": 0.023581495508551598, + "learning_rate": 0.0002, + "loss": 0.5995160341262817, + "mean_token_accuracy": 0.7571886032819748, + "num_tokens": 39497442.0, + "step": 517 + }, + { + "entropy": 0.6044445037841797, + "epoch": 6.823920265780731, + "grad_norm": 0.02690713107585907, + "learning_rate": 0.0002, + "loss": 0.6078607439994812, + "mean_token_accuracy": 0.7533780336380005, + "num_tokens": 39573687.0, + "step": 518 + }, + { + "entropy": 0.5997501760721207, + "epoch": 6.837209302325581, + "grad_norm": 0.025829756632447243, + "learning_rate": 0.0002, + "loss": 0.5987580418586731, + "mean_token_accuracy": 0.7570158541202545, + "num_tokens": 39651340.0, + "step": 519 + }, + { + "entropy": 0.6061921864748001, + "epoch": 6.850498338870432, + "grad_norm": 0.0223165825009346, + "learning_rate": 0.0002, + "loss": 0.6045077443122864, + "mean_token_accuracy": 0.7532154619693756, + "num_tokens": 39728030.0, + "step": 520 + }, + { + "entropy": 0.5982785224914551, + "epoch": 6.863787375415282, + "grad_norm": 0.028076212853193283, + "learning_rate": 0.0002, + "loss": 0.5973300337791443, + "mean_token_accuracy": 0.7568475604057312, + "num_tokens": 39805292.0, + "step": 521 + }, + { + "entropy": 0.595564216375351, + "epoch": 6.877076411960132, + "grad_norm": 0.02324676886200905, + "learning_rate": 0.0002, + "loss": 0.5942668914794922, + "mean_token_accuracy": 0.7570454329252243, + "num_tokens": 39882311.0, + "step": 522 + }, + { + "entropy": 0.5887253731489182, + "epoch": 6.8903654485049834, + "grad_norm": 0.03060692921280861, + "learning_rate": 0.0002, + "loss": 0.592413067817688, + "mean_token_accuracy": 0.7588198632001877, + "num_tokens": 39959797.0, + "step": 523 + }, + { + "entropy": 0.6044618636369705, + "epoch": 6.903654485049834, + "grad_norm": 0.023472849279642105, + "learning_rate": 0.0002, + "loss": 0.6028954982757568, + "mean_token_accuracy": 0.7550192028284073, + "num_tokens": 40036861.0, + "step": 524 + }, + { + "entropy": 0.6093322485685349, + "epoch": 6.916943521594685, + "grad_norm": 0.02798568457365036, + "learning_rate": 0.0002, + "loss": 0.6010950207710266, + "mean_token_accuracy": 0.756156861782074, + "num_tokens": 40114416.0, + "step": 525 + }, + { + "entropy": 0.608117938041687, + "epoch": 6.930232558139535, + "grad_norm": 0.026745513081550598, + "learning_rate": 0.0002, + "loss": 0.6025017499923706, + "mean_token_accuracy": 0.7551372200250626, + "num_tokens": 40191275.0, + "step": 526 + }, + { + "entropy": 0.5973224937915802, + "epoch": 6.943521594684386, + "grad_norm": 0.02841629832983017, + "learning_rate": 0.0002, + "loss": 0.6008439064025879, + "mean_token_accuracy": 0.7560015767812729, + "num_tokens": 40268155.0, + "step": 527 + }, + { + "entropy": 0.5969992578029633, + "epoch": 6.956810631229236, + "grad_norm": 0.038494374603033066, + "learning_rate": 0.0002, + "loss": 0.6079155206680298, + "mean_token_accuracy": 0.7526611685752869, + "num_tokens": 40344778.0, + "step": 528 + }, + { + "entropy": 0.6128715723752975, + "epoch": 6.970099667774086, + "grad_norm": 0.022489842027425766, + "learning_rate": 0.0002, + "loss": 0.6073602437973022, + "mean_token_accuracy": 0.7529550343751907, + "num_tokens": 40421973.0, + "step": 529 + }, + { + "entropy": 0.610251396894455, + "epoch": 6.983388704318937, + "grad_norm": 0.033306654542684555, + "learning_rate": 0.0002, + "loss": 0.5994991064071655, + "mean_token_accuracy": 0.7565908879041672, + "num_tokens": 40499293.0, + "step": 530 + }, + { + "entropy": 0.5960075706243515, + "epoch": 6.996677740863787, + "grad_norm": 0.019969960674643517, + "learning_rate": 0.0002, + "loss": 0.5940055847167969, + "mean_token_accuracy": 0.7587366998195648, + "num_tokens": 40577102.0, + "step": 531 + }, + { + "entropy": 0.6263917684555054, + "epoch": 7.0, + "grad_norm": 0.04845428094267845, + "learning_rate": 0.0002, + "loss": 0.6320151090621948, + "mean_token_accuracy": 0.7457926273345947, + "num_tokens": 40596482.0, + "step": 532 + }, + { + "entropy": 0.60090272128582, + "epoch": 7.01328903654485, + "grad_norm": 0.020749559625983238, + "learning_rate": 0.0002, + "loss": 0.5972373485565186, + "mean_token_accuracy": 0.7571604698896408, + "num_tokens": 40674334.0, + "step": 533 + }, + { + "entropy": 0.6017645597457886, + "epoch": 7.026578073089701, + "grad_norm": 0.030549099668860435, + "learning_rate": 0.0002, + "loss": 0.5974453687667847, + "mean_token_accuracy": 0.7568349391222, + "num_tokens": 40751117.0, + "step": 534 + }, + { + "entropy": 0.5874526649713516, + "epoch": 7.039867109634551, + "grad_norm": 0.02841581031680107, + "learning_rate": 0.0002, + "loss": 0.5857692360877991, + "mean_token_accuracy": 0.7610917538404465, + "num_tokens": 40827603.0, + "step": 535 + }, + { + "entropy": 0.5865802317857742, + "epoch": 7.053156146179402, + "grad_norm": 0.036679480224847794, + "learning_rate": 0.0002, + "loss": 0.5936608910560608, + "mean_token_accuracy": 0.7579147815704346, + "num_tokens": 40904279.0, + "step": 536 + }, + { + "entropy": 0.5945817977190018, + "epoch": 7.0664451827242525, + "grad_norm": 0.026053892448544502, + "learning_rate": 0.0002, + "loss": 0.5957525968551636, + "mean_token_accuracy": 0.7568493187427521, + "num_tokens": 40981735.0, + "step": 537 + }, + { + "entropy": 0.6033788025379181, + "epoch": 7.079734219269103, + "grad_norm": 0.02980688028037548, + "learning_rate": 0.0002, + "loss": 0.5996099710464478, + "mean_token_accuracy": 0.7563089579343796, + "num_tokens": 41058383.0, + "step": 538 + }, + { + "entropy": 0.5973725020885468, + "epoch": 7.093023255813954, + "grad_norm": 0.029874414205551147, + "learning_rate": 0.0002, + "loss": 0.5903159976005554, + "mean_token_accuracy": 0.7587748616933823, + "num_tokens": 41135909.0, + "step": 539 + }, + { + "entropy": 0.6045922935009003, + "epoch": 7.106312292358804, + "grad_norm": 0.033622536808252335, + "learning_rate": 0.0002, + "loss": 0.6066581606864929, + "mean_token_accuracy": 0.7533113658428192, + "num_tokens": 41212236.0, + "step": 540 + }, + { + "entropy": 0.5878050029277802, + "epoch": 7.119601328903655, + "grad_norm": 0.024177011102437973, + "learning_rate": 0.0002, + "loss": 0.5889069437980652, + "mean_token_accuracy": 0.7598751783370972, + "num_tokens": 41289316.0, + "step": 541 + }, + { + "entropy": 0.5878520309925079, + "epoch": 7.132890365448505, + "grad_norm": 0.030242595821619034, + "learning_rate": 0.0002, + "loss": 0.5862522125244141, + "mean_token_accuracy": 0.7602282017469406, + "num_tokens": 41365544.0, + "step": 542 + }, + { + "entropy": 0.580777645111084, + "epoch": 7.146179401993355, + "grad_norm": 0.025827951729297638, + "learning_rate": 0.0002, + "loss": 0.5805131196975708, + "mean_token_accuracy": 0.7632949352264404, + "num_tokens": 41442375.0, + "step": 543 + }, + { + "entropy": 0.5955946892499924, + "epoch": 7.159468438538206, + "grad_norm": 0.03238573297858238, + "learning_rate": 0.0002, + "loss": 0.5978742837905884, + "mean_token_accuracy": 0.756095290184021, + "num_tokens": 41518639.0, + "step": 544 + }, + { + "entropy": 0.5933609753847122, + "epoch": 7.172757475083056, + "grad_norm": 0.026595359668135643, + "learning_rate": 0.0002, + "loss": 0.5913410782814026, + "mean_token_accuracy": 0.75886270403862, + "num_tokens": 41595728.0, + "step": 545 + }, + { + "entropy": 0.5813855677843094, + "epoch": 7.186046511627907, + "grad_norm": 0.03226481005549431, + "learning_rate": 0.0002, + "loss": 0.5804150104522705, + "mean_token_accuracy": 0.762812003493309, + "num_tokens": 41672700.0, + "step": 546 + }, + { + "entropy": 0.5884519517421722, + "epoch": 7.1993355481727574, + "grad_norm": 0.03133225440979004, + "learning_rate": 0.0002, + "loss": 0.587933361530304, + "mean_token_accuracy": 0.759622797369957, + "num_tokens": 41749957.0, + "step": 547 + }, + { + "entropy": 0.5912621170282364, + "epoch": 7.212624584717608, + "grad_norm": 0.02699204906821251, + "learning_rate": 0.0002, + "loss": 0.5909606218338013, + "mean_token_accuracy": 0.7599730789661407, + "num_tokens": 41827181.0, + "step": 548 + }, + { + "entropy": 0.5834774374961853, + "epoch": 7.225913621262459, + "grad_norm": 0.031116921454668045, + "learning_rate": 0.0002, + "loss": 0.5860615968704224, + "mean_token_accuracy": 0.7615607529878616, + "num_tokens": 41904276.0, + "step": 549 + }, + { + "entropy": 0.6060900539159775, + "epoch": 7.239202657807309, + "grad_norm": 0.03337494656443596, + "learning_rate": 0.0002, + "loss": 0.6010215282440186, + "mean_token_accuracy": 0.7554879635572433, + "num_tokens": 41981777.0, + "step": 550 + }, + { + "entropy": 0.5843900144100189, + "epoch": 7.25249169435216, + "grad_norm": 0.0280764177441597, + "learning_rate": 0.0002, + "loss": 0.5816437005996704, + "mean_token_accuracy": 0.7622091621160507, + "num_tokens": 42058406.0, + "step": 551 + }, + { + "entropy": 0.5719930976629257, + "epoch": 7.26578073089701, + "grad_norm": 0.04221399873495102, + "learning_rate": 0.0002, + "loss": 0.5766112208366394, + "mean_token_accuracy": 0.7648352682590485, + "num_tokens": 42137283.0, + "step": 552 + }, + { + "entropy": 0.5938063710927963, + "epoch": 7.27906976744186, + "grad_norm": 0.04285285621881485, + "learning_rate": 0.0002, + "loss": 0.5963371396064758, + "mean_token_accuracy": 0.7569244503974915, + "num_tokens": 42213577.0, + "step": 553 + }, + { + "entropy": 0.5992718636989594, + "epoch": 7.292358803986711, + "grad_norm": 0.03192923218011856, + "learning_rate": 0.0002, + "loss": 0.5919658541679382, + "mean_token_accuracy": 0.7584283500909805, + "num_tokens": 42290765.0, + "step": 554 + }, + { + "entropy": 0.598827674984932, + "epoch": 7.305647840531561, + "grad_norm": 0.03549162670969963, + "learning_rate": 0.0002, + "loss": 0.5959571003913879, + "mean_token_accuracy": 0.7582818567752838, + "num_tokens": 42367554.0, + "step": 555 + }, + { + "entropy": 0.5883237272500992, + "epoch": 7.318936877076412, + "grad_norm": 0.03574231639504433, + "learning_rate": 0.0002, + "loss": 0.5865534543991089, + "mean_token_accuracy": 0.7601163238286972, + "num_tokens": 42443934.0, + "step": 556 + }, + { + "entropy": 0.5952439904212952, + "epoch": 7.332225913621262, + "grad_norm": 0.03858065605163574, + "learning_rate": 0.0002, + "loss": 0.5947918891906738, + "mean_token_accuracy": 0.7584473639726639, + "num_tokens": 42522384.0, + "step": 557 + }, + { + "entropy": 0.5895354747772217, + "epoch": 7.3455149501661126, + "grad_norm": 0.04516797512769699, + "learning_rate": 0.0002, + "loss": 0.5862763524055481, + "mean_token_accuracy": 0.7603979557752609, + "num_tokens": 42600686.0, + "step": 558 + }, + { + "entropy": 0.5977571457624435, + "epoch": 7.358803986710964, + "grad_norm": 0.030313201248645782, + "learning_rate": 0.0002, + "loss": 0.5932716131210327, + "mean_token_accuracy": 0.757668063044548, + "num_tokens": 42678840.0, + "step": 559 + }, + { + "entropy": 0.5848244279623032, + "epoch": 7.372093023255814, + "grad_norm": 0.04240503907203674, + "learning_rate": 0.0002, + "loss": 0.5870546698570251, + "mean_token_accuracy": 0.7618324756622314, + "num_tokens": 42755954.0, + "step": 560 + }, + { + "entropy": 0.5977549999952316, + "epoch": 7.385382059800665, + "grad_norm": 0.031350430101156235, + "learning_rate": 0.0002, + "loss": 0.6006947755813599, + "mean_token_accuracy": 0.7568647265434265, + "num_tokens": 42832956.0, + "step": 561 + }, + { + "entropy": 0.5922767370939255, + "epoch": 7.398671096345515, + "grad_norm": 0.0464928075671196, + "learning_rate": 0.0002, + "loss": 0.5898110866546631, + "mean_token_accuracy": 0.761441171169281, + "num_tokens": 42910049.0, + "step": 562 + }, + { + "entropy": 0.5975309163331985, + "epoch": 7.411960132890365, + "grad_norm": 0.029810184612870216, + "learning_rate": 0.0002, + "loss": 0.5963293313980103, + "mean_token_accuracy": 0.7576682418584824, + "num_tokens": 42987206.0, + "step": 563 + }, + { + "entropy": 0.6032759100198746, + "epoch": 7.425249169435216, + "grad_norm": 0.03480512276291847, + "learning_rate": 0.0002, + "loss": 0.6015341281890869, + "mean_token_accuracy": 0.7556877881288528, + "num_tokens": 43062979.0, + "step": 564 + }, + { + "entropy": 0.5968350321054459, + "epoch": 7.438538205980066, + "grad_norm": 0.034472063183784485, + "learning_rate": 0.0002, + "loss": 0.6002466082572937, + "mean_token_accuracy": 0.7546430677175522, + "num_tokens": 43139685.0, + "step": 565 + }, + { + "entropy": 0.5969191342592239, + "epoch": 7.451827242524917, + "grad_norm": 0.030943354591727257, + "learning_rate": 0.0002, + "loss": 0.5945968627929688, + "mean_token_accuracy": 0.7584541887044907, + "num_tokens": 43217473.0, + "step": 566 + }, + { + "entropy": 0.6047678291797638, + "epoch": 7.465116279069767, + "grad_norm": 0.03206373378634453, + "learning_rate": 0.0002, + "loss": 0.6000797748565674, + "mean_token_accuracy": 0.7554351985454559, + "num_tokens": 43294484.0, + "step": 567 + }, + { + "entropy": 0.5903201103210449, + "epoch": 7.4784053156146175, + "grad_norm": 0.029840532690286636, + "learning_rate": 0.0002, + "loss": 0.5920034050941467, + "mean_token_accuracy": 0.7583808600902557, + "num_tokens": 43371808.0, + "step": 568 + }, + { + "entropy": 0.5891302227973938, + "epoch": 7.4916943521594686, + "grad_norm": 0.032370489090681076, + "learning_rate": 0.0002, + "loss": 0.5905359983444214, + "mean_token_accuracy": 0.7588883638381958, + "num_tokens": 43448977.0, + "step": 569 + }, + { + "entropy": 0.5911503434181213, + "epoch": 7.504983388704319, + "grad_norm": 0.024661490693688393, + "learning_rate": 0.0002, + "loss": 0.589153528213501, + "mean_token_accuracy": 0.7603337615728378, + "num_tokens": 43525211.0, + "step": 570 + }, + { + "entropy": 0.5936204791069031, + "epoch": 7.51827242524917, + "grad_norm": 0.033602483570575714, + "learning_rate": 0.0002, + "loss": 0.5895155668258667, + "mean_token_accuracy": 0.7598973661661148, + "num_tokens": 43601774.0, + "step": 571 + }, + { + "entropy": 0.5936924070119858, + "epoch": 7.53156146179402, + "grad_norm": 0.028339127078652382, + "learning_rate": 0.0002, + "loss": 0.5915228128433228, + "mean_token_accuracy": 0.7601437717676163, + "num_tokens": 43679558.0, + "step": 572 + }, + { + "entropy": 0.5924441665410995, + "epoch": 7.544850498338871, + "grad_norm": 0.03638297691941261, + "learning_rate": 0.0002, + "loss": 0.5932373404502869, + "mean_token_accuracy": 0.7579649388790131, + "num_tokens": 43758060.0, + "step": 573 + }, + { + "entropy": 0.5993626266717911, + "epoch": 7.558139534883721, + "grad_norm": 0.028465403243899345, + "learning_rate": 0.0002, + "loss": 0.5999648571014404, + "mean_token_accuracy": 0.7560222744941711, + "num_tokens": 43834817.0, + "step": 574 + }, + { + "entropy": 0.5959221720695496, + "epoch": 7.571428571428571, + "grad_norm": 0.035040296614170074, + "learning_rate": 0.0002, + "loss": 0.592374324798584, + "mean_token_accuracy": 0.7590507417917252, + "num_tokens": 43911957.0, + "step": 575 + }, + { + "entropy": 0.5967639237642288, + "epoch": 7.584717607973422, + "grad_norm": 0.030499596148729324, + "learning_rate": 0.0002, + "loss": 0.5920624136924744, + "mean_token_accuracy": 0.7570383697748184, + "num_tokens": 43989718.0, + "step": 576 + }, + { + "entropy": 0.595067635178566, + "epoch": 7.598006644518272, + "grad_norm": 0.03523232042789459, + "learning_rate": 0.0002, + "loss": 0.597061812877655, + "mean_token_accuracy": 0.7577027082443237, + "num_tokens": 44066657.0, + "step": 577 + }, + { + "entropy": 0.5887541025876999, + "epoch": 7.6112956810631225, + "grad_norm": 0.03475109487771988, + "learning_rate": 0.0002, + "loss": 0.5964131951332092, + "mean_token_accuracy": 0.7577889561653137, + "num_tokens": 44143767.0, + "step": 578 + }, + { + "entropy": 0.592231884598732, + "epoch": 7.6245847176079735, + "grad_norm": 0.03178296983242035, + "learning_rate": 0.0002, + "loss": 0.5877656936645508, + "mean_token_accuracy": 0.7602957934141159, + "num_tokens": 44220541.0, + "step": 579 + }, + { + "entropy": 0.5901675373315811, + "epoch": 7.637873754152824, + "grad_norm": 0.028729397803544998, + "learning_rate": 0.0002, + "loss": 0.5811964273452759, + "mean_token_accuracy": 0.7640891075134277, + "num_tokens": 44298202.0, + "step": 580 + }, + { + "entropy": 0.6007028222084045, + "epoch": 7.651162790697675, + "grad_norm": 0.03181817755103111, + "learning_rate": 0.0002, + "loss": 0.5992697477340698, + "mean_token_accuracy": 0.7546785622835159, + "num_tokens": 44375044.0, + "step": 581 + }, + { + "entropy": 0.5993082076311111, + "epoch": 7.664451827242525, + "grad_norm": 0.032050300389528275, + "learning_rate": 0.0002, + "loss": 0.6053569912910461, + "mean_token_accuracy": 0.7536642551422119, + "num_tokens": 44451384.0, + "step": 582 + }, + { + "entropy": 0.6015539616346359, + "epoch": 7.677740863787376, + "grad_norm": 0.03009367734193802, + "learning_rate": 0.0002, + "loss": 0.5985173583030701, + "mean_token_accuracy": 0.7561749666929245, + "num_tokens": 44528766.0, + "step": 583 + }, + { + "entropy": 0.6066677421331406, + "epoch": 7.691029900332226, + "grad_norm": 0.02756679244339466, + "learning_rate": 0.0002, + "loss": 0.604720950126648, + "mean_token_accuracy": 0.7532592117786407, + "num_tokens": 44605549.0, + "step": 584 + }, + { + "entropy": 0.5922277718782425, + "epoch": 7.704318936877076, + "grad_norm": 0.027669459581375122, + "learning_rate": 0.0002, + "loss": 0.5902705192565918, + "mean_token_accuracy": 0.7600447237491608, + "num_tokens": 44682878.0, + "step": 585 + }, + { + "entropy": 0.5769661366939545, + "epoch": 7.717607973421927, + "grad_norm": 0.028020597994327545, + "learning_rate": 0.0002, + "loss": 0.5795618891716003, + "mean_token_accuracy": 0.7647197842597961, + "num_tokens": 44759899.0, + "step": 586 + }, + { + "entropy": 0.5908134877681732, + "epoch": 7.730897009966777, + "grad_norm": 0.029171260073781013, + "learning_rate": 0.0002, + "loss": 0.5940332412719727, + "mean_token_accuracy": 0.7575349360704422, + "num_tokens": 44836446.0, + "step": 587 + }, + { + "entropy": 0.6053617596626282, + "epoch": 7.7441860465116275, + "grad_norm": 0.029087018221616745, + "learning_rate": 0.0002, + "loss": 0.6014258861541748, + "mean_token_accuracy": 0.7543994039297104, + "num_tokens": 44912843.0, + "step": 588 + }, + { + "entropy": 0.6038393527269363, + "epoch": 7.7574750830564785, + "grad_norm": 0.027699144557118416, + "learning_rate": 0.0002, + "loss": 0.5987313985824585, + "mean_token_accuracy": 0.7549974322319031, + "num_tokens": 44990430.0, + "step": 589 + }, + { + "entropy": 0.5965250134468079, + "epoch": 7.770764119601329, + "grad_norm": 0.030259517952799797, + "learning_rate": 0.0002, + "loss": 0.5975747108459473, + "mean_token_accuracy": 0.7567678689956665, + "num_tokens": 45068612.0, + "step": 590 + }, + { + "entropy": 0.5944515317678452, + "epoch": 7.78405315614618, + "grad_norm": 0.026580356061458588, + "learning_rate": 0.0002, + "loss": 0.5963719487190247, + "mean_token_accuracy": 0.7574294954538345, + "num_tokens": 45146637.0, + "step": 591 + }, + { + "entropy": 0.6014003604650497, + "epoch": 7.79734219269103, + "grad_norm": 0.023800505325198174, + "learning_rate": 0.0002, + "loss": 0.599528431892395, + "mean_token_accuracy": 0.7546277940273285, + "num_tokens": 45222652.0, + "step": 592 + }, + { + "entropy": 0.6073395758867264, + "epoch": 7.810631229235881, + "grad_norm": 0.025431310757994652, + "learning_rate": 0.0002, + "loss": 0.6014832258224487, + "mean_token_accuracy": 0.7544971704483032, + "num_tokens": 45299371.0, + "step": 593 + }, + { + "entropy": 0.6004442870616913, + "epoch": 7.823920265780731, + "grad_norm": 0.025382395833730698, + "learning_rate": 0.0002, + "loss": 0.5996565818786621, + "mean_token_accuracy": 0.7561800926923752, + "num_tokens": 45375872.0, + "step": 594 + }, + { + "entropy": 0.597792387008667, + "epoch": 7.837209302325581, + "grad_norm": 0.02821579948067665, + "learning_rate": 0.0002, + "loss": 0.6011848449707031, + "mean_token_accuracy": 0.7544896304607391, + "num_tokens": 45452764.0, + "step": 595 + }, + { + "entropy": 0.6014498323202133, + "epoch": 7.850498338870432, + "grad_norm": 0.025945568457245827, + "learning_rate": 0.0002, + "loss": 0.5997246503829956, + "mean_token_accuracy": 0.756523534655571, + "num_tokens": 45529755.0, + "step": 596 + }, + { + "entropy": 0.602736622095108, + "epoch": 7.863787375415282, + "grad_norm": 0.023420821875333786, + "learning_rate": 0.0002, + "loss": 0.601398229598999, + "mean_token_accuracy": 0.7540724575519562, + "num_tokens": 45606356.0, + "step": 597 + }, + { + "entropy": 0.5954908579587936, + "epoch": 7.877076411960132, + "grad_norm": 0.028988869860768318, + "learning_rate": 0.0002, + "loss": 0.5935001373291016, + "mean_token_accuracy": 0.7580942809581757, + "num_tokens": 45683622.0, + "step": 598 + }, + { + "entropy": 0.5893382877111435, + "epoch": 7.8903654485049834, + "grad_norm": 0.02311522886157036, + "learning_rate": 0.0002, + "loss": 0.5844165086746216, + "mean_token_accuracy": 0.7620206922292709, + "num_tokens": 45761740.0, + "step": 599 + }, + { + "entropy": 0.6034763604402542, + "epoch": 7.903654485049834, + "grad_norm": 0.03306819126009941, + "learning_rate": 0.0002, + "loss": 0.6084754467010498, + "mean_token_accuracy": 0.7525132596492767, + "num_tokens": 45836951.0, + "step": 600 + }, + { + "entropy": 0.5898222327232361, + "epoch": 7.916943521594685, + "grad_norm": 0.027422117069363594, + "learning_rate": 0.0002, + "loss": 0.5919756889343262, + "mean_token_accuracy": 0.7595413774251938, + "num_tokens": 45914305.0, + "step": 601 + }, + { + "entropy": 0.5984858423471451, + "epoch": 7.930232558139535, + "grad_norm": 0.030068816617131233, + "learning_rate": 0.0002, + "loss": 0.5928657054901123, + "mean_token_accuracy": 0.7575226724147797, + "num_tokens": 45990931.0, + "step": 602 + }, + { + "entropy": 0.5966551899909973, + "epoch": 7.943521594684386, + "grad_norm": 0.02550889365375042, + "learning_rate": 0.0002, + "loss": 0.5950169563293457, + "mean_token_accuracy": 0.7567807137966156, + "num_tokens": 46068210.0, + "step": 603 + }, + { + "entropy": 0.5984641313552856, + "epoch": 7.956810631229236, + "grad_norm": 0.027936860918998718, + "learning_rate": 0.0002, + "loss": 0.5978131294250488, + "mean_token_accuracy": 0.7564933449029922, + "num_tokens": 46145168.0, + "step": 604 + }, + { + "entropy": 0.5898311734199524, + "epoch": 7.970099667774086, + "grad_norm": 0.028104180470108986, + "learning_rate": 0.0002, + "loss": 0.5902965664863586, + "mean_token_accuracy": 0.7601361870765686, + "num_tokens": 46222214.0, + "step": 605 + }, + { + "entropy": 0.5912729799747467, + "epoch": 7.983388704318937, + "grad_norm": 0.022967718541622162, + "learning_rate": 0.0002, + "loss": 0.5875831842422485, + "mean_token_accuracy": 0.7609845697879791, + "num_tokens": 46299649.0, + "step": 606 + }, + { + "entropy": 0.5996886044740677, + "epoch": 7.996677740863787, + "grad_norm": 0.02525177225470543, + "learning_rate": 0.0002, + "loss": 0.5975291728973389, + "mean_token_accuracy": 0.7567523270845413, + "num_tokens": 46376767.0, + "step": 607 + }, + { + "entropy": 0.6052418351173401, + "epoch": 8.0, + "grad_norm": 0.03844604641199112, + "learning_rate": 0.0002, + "loss": 0.6005574464797974, + "mean_token_accuracy": 0.7535819411277771, + "num_tokens": 46396228.0, + "step": 608 + }, + { + "entropy": 0.5849415957927704, + "epoch": 8.013289036544851, + "grad_norm": 0.026697669178247452, + "learning_rate": 0.0002, + "loss": 0.5827944278717041, + "mean_token_accuracy": 0.763024628162384, + "num_tokens": 46472432.0, + "step": 609 + }, + { + "entropy": 0.5896167308092117, + "epoch": 8.0265780730897, + "grad_norm": 0.026246508583426476, + "learning_rate": 0.0002, + "loss": 0.5901464819908142, + "mean_token_accuracy": 0.7580210715532303, + "num_tokens": 46548667.0, + "step": 610 + }, + { + "entropy": 0.5954991430044174, + "epoch": 8.039867109634551, + "grad_norm": 0.03505807742476463, + "learning_rate": 0.0002, + "loss": 0.5982897281646729, + "mean_token_accuracy": 0.7570490837097168, + "num_tokens": 46625714.0, + "step": 611 + }, + { + "entropy": 0.5948772430419922, + "epoch": 8.053156146179402, + "grad_norm": 0.03613806515932083, + "learning_rate": 0.0002, + "loss": 0.5921391844749451, + "mean_token_accuracy": 0.7585531324148178, + "num_tokens": 46702173.0, + "step": 612 + }, + { + "entropy": 0.6061599105596542, + "epoch": 8.066445182724253, + "grad_norm": 0.03219094127416611, + "learning_rate": 0.0002, + "loss": 0.6035000085830688, + "mean_token_accuracy": 0.7535400837659836, + "num_tokens": 46779368.0, + "step": 613 + }, + { + "entropy": 0.5738667398691177, + "epoch": 8.079734219269103, + "grad_norm": 0.03252333030104637, + "learning_rate": 0.0002, + "loss": 0.5781555771827698, + "mean_token_accuracy": 0.7640644162893295, + "num_tokens": 46856996.0, + "step": 614 + }, + { + "entropy": 0.5789659023284912, + "epoch": 8.093023255813954, + "grad_norm": 0.031124601140618324, + "learning_rate": 0.0002, + "loss": 0.5793648958206177, + "mean_token_accuracy": 0.7631232887506485, + "num_tokens": 46934246.0, + "step": 615 + }, + { + "entropy": 0.5891662240028381, + "epoch": 8.106312292358805, + "grad_norm": 0.037481456995010376, + "learning_rate": 0.0002, + "loss": 0.5809412598609924, + "mean_token_accuracy": 0.7630375772714615, + "num_tokens": 47011246.0, + "step": 616 + }, + { + "entropy": 0.5797739326953888, + "epoch": 8.119601328903654, + "grad_norm": 0.03575124964118004, + "learning_rate": 0.0002, + "loss": 0.5810019969940186, + "mean_token_accuracy": 0.7621732503175735, + "num_tokens": 47088374.0, + "step": 617 + }, + { + "entropy": 0.5935344249010086, + "epoch": 8.132890365448505, + "grad_norm": 0.03413181006908417, + "learning_rate": 0.0002, + "loss": 0.5933163166046143, + "mean_token_accuracy": 0.7567701190710068, + "num_tokens": 47165072.0, + "step": 618 + }, + { + "entropy": 0.5915709435939789, + "epoch": 8.146179401993356, + "grad_norm": 0.0331747867166996, + "learning_rate": 0.0002, + "loss": 0.5865128636360168, + "mean_token_accuracy": 0.7611654847860336, + "num_tokens": 47241162.0, + "step": 619 + }, + { + "entropy": 0.5944840461015701, + "epoch": 8.159468438538205, + "grad_norm": 0.03591196611523628, + "learning_rate": 0.0002, + "loss": 0.5911703109741211, + "mean_token_accuracy": 0.7580583393573761, + "num_tokens": 47317281.0, + "step": 620 + }, + { + "entropy": 0.5692449063062668, + "epoch": 8.172757475083056, + "grad_norm": 0.03591502457857132, + "learning_rate": 0.0002, + "loss": 0.5714719891548157, + "mean_token_accuracy": 0.7654573917388916, + "num_tokens": 47394033.0, + "step": 621 + }, + { + "entropy": 0.5919756591320038, + "epoch": 8.186046511627907, + "grad_norm": 0.03331475332379341, + "learning_rate": 0.0002, + "loss": 0.5916996598243713, + "mean_token_accuracy": 0.7590637356042862, + "num_tokens": 47471503.0, + "step": 622 + }, + { + "entropy": 0.5817323327064514, + "epoch": 8.199335548172758, + "grad_norm": 0.03191077336668968, + "learning_rate": 0.0002, + "loss": 0.5777145624160767, + "mean_token_accuracy": 0.7650918811559677, + "num_tokens": 47548641.0, + "step": 623 + }, + { + "entropy": 0.5874795615673065, + "epoch": 8.212624584717608, + "grad_norm": 0.031134847551584244, + "learning_rate": 0.0002, + "loss": 0.5871837139129639, + "mean_token_accuracy": 0.7600111067295074, + "num_tokens": 47625739.0, + "step": 624 + }, + { + "entropy": 0.5865576267242432, + "epoch": 8.225913621262459, + "grad_norm": 0.02946043387055397, + "learning_rate": 0.0002, + "loss": 0.5841938257217407, + "mean_token_accuracy": 0.7618899345397949, + "num_tokens": 47703269.0, + "step": 625 + }, + { + "entropy": 0.5737685710191727, + "epoch": 8.23920265780731, + "grad_norm": 0.03301022946834564, + "learning_rate": 0.0002, + "loss": 0.5730248689651489, + "mean_token_accuracy": 0.7667439430952072, + "num_tokens": 47780176.0, + "step": 626 + }, + { + "entropy": 0.5927734076976776, + "epoch": 8.252491694352159, + "grad_norm": 0.030395688489079475, + "learning_rate": 0.0002, + "loss": 0.5933593511581421, + "mean_token_accuracy": 0.7567963600158691, + "num_tokens": 47855549.0, + "step": 627 + }, + { + "entropy": 0.5866550207138062, + "epoch": 8.26578073089701, + "grad_norm": 0.03712524101138115, + "learning_rate": 0.0002, + "loss": 0.5855146646499634, + "mean_token_accuracy": 0.7610810846090317, + "num_tokens": 47933667.0, + "step": 628 + }, + { + "entropy": 0.5913572609424591, + "epoch": 8.279069767441861, + "grad_norm": 0.038173478096723557, + "learning_rate": 0.0002, + "loss": 0.5929369330406189, + "mean_token_accuracy": 0.7585016936063766, + "num_tokens": 48010150.0, + "step": 629 + }, + { + "entropy": 0.5938078314065933, + "epoch": 8.29235880398671, + "grad_norm": 0.030125852674245834, + "learning_rate": 0.0002, + "loss": 0.5897150039672852, + "mean_token_accuracy": 0.758837953209877, + "num_tokens": 48087617.0, + "step": 630 + }, + { + "entropy": 0.5898828655481339, + "epoch": 8.305647840531561, + "grad_norm": 0.03530623018741608, + "learning_rate": 0.0002, + "loss": 0.5891162753105164, + "mean_token_accuracy": 0.7587278485298157, + "num_tokens": 48164647.0, + "step": 631 + }, + { + "entropy": 0.5901964008808136, + "epoch": 8.318936877076412, + "grad_norm": 0.04116959869861603, + "learning_rate": 0.0002, + "loss": 0.5871089696884155, + "mean_token_accuracy": 0.7609442174434662, + "num_tokens": 48242570.0, + "step": 632 + }, + { + "entropy": 0.5975192934274673, + "epoch": 8.332225913621263, + "grad_norm": 0.033791229128837585, + "learning_rate": 0.0002, + "loss": 0.5978984832763672, + "mean_token_accuracy": 0.7558712214231491, + "num_tokens": 48318831.0, + "step": 633 + }, + { + "entropy": 0.5898595005273819, + "epoch": 8.345514950166113, + "grad_norm": 0.03173010051250458, + "learning_rate": 0.0002, + "loss": 0.5908152461051941, + "mean_token_accuracy": 0.7584023624658585, + "num_tokens": 48396014.0, + "step": 634 + }, + { + "entropy": 0.5868335217237473, + "epoch": 8.358803986710964, + "grad_norm": 0.03656291961669922, + "learning_rate": 0.0002, + "loss": 0.5912126302719116, + "mean_token_accuracy": 0.7578298896551132, + "num_tokens": 48472501.0, + "step": 635 + }, + { + "entropy": 0.5803808122873306, + "epoch": 8.372093023255815, + "grad_norm": 0.029666099697351456, + "learning_rate": 0.0002, + "loss": 0.5778638124465942, + "mean_token_accuracy": 0.7648247480392456, + "num_tokens": 48549876.0, + "step": 636 + }, + { + "entropy": 0.5892583876848221, + "epoch": 8.385382059800664, + "grad_norm": 0.036448702216148376, + "learning_rate": 0.0002, + "loss": 0.5853127241134644, + "mean_token_accuracy": 0.7601494789123535, + "num_tokens": 48627162.0, + "step": 637 + }, + { + "entropy": 0.6033164262771606, + "epoch": 8.398671096345515, + "grad_norm": 0.041355833411216736, + "learning_rate": 0.0002, + "loss": 0.6030725240707397, + "mean_token_accuracy": 0.7540614157915115, + "num_tokens": 48704614.0, + "step": 638 + }, + { + "entropy": 0.5965287089347839, + "epoch": 8.411960132890366, + "grad_norm": 0.03134165331721306, + "learning_rate": 0.0002, + "loss": 0.591283917427063, + "mean_token_accuracy": 0.7578448504209518, + "num_tokens": 48782332.0, + "step": 639 + }, + { + "entropy": 0.5925293862819672, + "epoch": 8.425249169435215, + "grad_norm": 0.0464448481798172, + "learning_rate": 0.0002, + "loss": 0.5897094011306763, + "mean_token_accuracy": 0.7594808042049408, + "num_tokens": 48860168.0, + "step": 640 + }, + { + "entropy": 0.58897465467453, + "epoch": 8.438538205980066, + "grad_norm": 0.04942963272333145, + "learning_rate": 0.0002, + "loss": 0.591568648815155, + "mean_token_accuracy": 0.7598203122615814, + "num_tokens": 48937560.0, + "step": 641 + }, + { + "entropy": 0.5860904455184937, + "epoch": 8.451827242524917, + "grad_norm": 0.03515082225203514, + "learning_rate": 0.0002, + "loss": 0.5869107246398926, + "mean_token_accuracy": 0.7615831941366196, + "num_tokens": 49014115.0, + "step": 642 + }, + { + "entropy": 0.5864955633878708, + "epoch": 8.465116279069768, + "grad_norm": 0.04708025977015495, + "learning_rate": 0.0002, + "loss": 0.5874521732330322, + "mean_token_accuracy": 0.7600408792495728, + "num_tokens": 49090510.0, + "step": 643 + }, + { + "entropy": 0.5912910401821136, + "epoch": 8.478405315614618, + "grad_norm": 0.04989413917064667, + "learning_rate": 0.0002, + "loss": 0.5909178853034973, + "mean_token_accuracy": 0.7597139179706573, + "num_tokens": 49167949.0, + "step": 644 + }, + { + "entropy": 0.5893669277429581, + "epoch": 8.491694352159469, + "grad_norm": 0.02918706089258194, + "learning_rate": 0.0002, + "loss": 0.5860124230384827, + "mean_token_accuracy": 0.7605527341365814, + "num_tokens": 49245468.0, + "step": 645 + }, + { + "entropy": 0.587207704782486, + "epoch": 8.50498338870432, + "grad_norm": 0.03909502178430557, + "learning_rate": 0.0002, + "loss": 0.5876778364181519, + "mean_token_accuracy": 0.7586503326892853, + "num_tokens": 49322083.0, + "step": 646 + }, + { + "entropy": 0.5928920805454254, + "epoch": 8.518272425249169, + "grad_norm": 0.03155143931508064, + "learning_rate": 0.0002, + "loss": 0.5916935205459595, + "mean_token_accuracy": 0.7580639719963074, + "num_tokens": 49398151.0, + "step": 647 + }, + { + "entropy": 0.5820858925580978, + "epoch": 8.53156146179402, + "grad_norm": 0.03789787366986275, + "learning_rate": 0.0002, + "loss": 0.5806615352630615, + "mean_token_accuracy": 0.7624358385801315, + "num_tokens": 49474932.0, + "step": 648 + }, + { + "entropy": 0.594434067606926, + "epoch": 8.544850498338871, + "grad_norm": 0.035347383469343185, + "learning_rate": 0.0002, + "loss": 0.593879222869873, + "mean_token_accuracy": 0.7570043802261353, + "num_tokens": 49552035.0, + "step": 649 + }, + { + "entropy": 0.5807432979345322, + "epoch": 8.55813953488372, + "grad_norm": 0.03238654136657715, + "learning_rate": 0.0002, + "loss": 0.5827980637550354, + "mean_token_accuracy": 0.76199671626091, + "num_tokens": 49628511.0, + "step": 650 + }, + { + "entropy": 0.5857634395360947, + "epoch": 8.571428571428571, + "grad_norm": 0.04061926156282425, + "learning_rate": 0.0002, + "loss": 0.5857123136520386, + "mean_token_accuracy": 0.7616678923368454, + "num_tokens": 49705806.0, + "step": 651 + }, + { + "entropy": 0.5947589576244354, + "epoch": 8.584717607973422, + "grad_norm": 0.03115455061197281, + "learning_rate": 0.0002, + "loss": 0.5889809727668762, + "mean_token_accuracy": 0.7592536062002182, + "num_tokens": 49782950.0, + "step": 652 + }, + { + "entropy": 0.5894382148981094, + "epoch": 8.598006644518273, + "grad_norm": 0.04479070007801056, + "learning_rate": 0.0002, + "loss": 0.5914884805679321, + "mean_token_accuracy": 0.7576984465122223, + "num_tokens": 49859768.0, + "step": 653 + }, + { + "entropy": 0.6050767302513123, + "epoch": 8.611295681063122, + "grad_norm": 0.03744325041770935, + "learning_rate": 0.0002, + "loss": 0.6043350696563721, + "mean_token_accuracy": 0.7538948655128479, + "num_tokens": 49935768.0, + "step": 654 + }, + { + "entropy": 0.5913153141736984, + "epoch": 8.624584717607974, + "grad_norm": 0.03681696206331253, + "learning_rate": 0.0002, + "loss": 0.5855178236961365, + "mean_token_accuracy": 0.7591262012720108, + "num_tokens": 50013624.0, + "step": 655 + }, + { + "entropy": 0.579682931303978, + "epoch": 8.637873754152825, + "grad_norm": 0.03786518797278404, + "learning_rate": 0.0002, + "loss": 0.5794950723648071, + "mean_token_accuracy": 0.7616621106863022, + "num_tokens": 50091066.0, + "step": 656 + }, + { + "entropy": 0.5738009661436081, + "epoch": 8.651162790697674, + "grad_norm": 0.0365300215780735, + "learning_rate": 0.0002, + "loss": 0.579700767993927, + "mean_token_accuracy": 0.7637236416339874, + "num_tokens": 50168260.0, + "step": 657 + }, + { + "entropy": 0.5828498899936676, + "epoch": 8.664451827242525, + "grad_norm": 0.039035145193338394, + "learning_rate": 0.0002, + "loss": 0.583361029624939, + "mean_token_accuracy": 0.7617398202419281, + "num_tokens": 50246062.0, + "step": 658 + }, + { + "entropy": 0.5916730761528015, + "epoch": 8.677740863787376, + "grad_norm": 0.037739627063274384, + "learning_rate": 0.0002, + "loss": 0.5868880748748779, + "mean_token_accuracy": 0.7602831721305847, + "num_tokens": 50323537.0, + "step": 659 + }, + { + "entropy": 0.5911594331264496, + "epoch": 8.691029900332225, + "grad_norm": 0.03326238691806793, + "learning_rate": 0.0002, + "loss": 0.5849337577819824, + "mean_token_accuracy": 0.7604767978191376, + "num_tokens": 50401316.0, + "step": 660 + }, + { + "entropy": 0.5687000751495361, + "epoch": 8.704318936877076, + "grad_norm": 0.041488006711006165, + "learning_rate": 0.0002, + "loss": 0.5731285810470581, + "mean_token_accuracy": 0.7658777087926865, + "num_tokens": 50478547.0, + "step": 661 + }, + { + "entropy": 0.5819157212972641, + "epoch": 8.717607973421927, + "grad_norm": 0.04120723903179169, + "learning_rate": 0.0002, + "loss": 0.5868937969207764, + "mean_token_accuracy": 0.7604488730430603, + "num_tokens": 50554825.0, + "step": 662 + }, + { + "entropy": 0.6036993712186813, + "epoch": 8.730897009966778, + "grad_norm": 0.03696327656507492, + "learning_rate": 0.0002, + "loss": 0.5956385731697083, + "mean_token_accuracy": 0.7566656321287155, + "num_tokens": 50631462.0, + "step": 663 + }, + { + "entropy": 0.5896592438220978, + "epoch": 8.744186046511627, + "grad_norm": 0.03166646137833595, + "learning_rate": 0.0002, + "loss": 0.5841723680496216, + "mean_token_accuracy": 0.7621931433677673, + "num_tokens": 50708446.0, + "step": 664 + }, + { + "entropy": 0.5567464232444763, + "epoch": 8.757475083056478, + "grad_norm": 0.03862195834517479, + "learning_rate": 0.0002, + "loss": 0.5601667165756226, + "mean_token_accuracy": 0.7705302089452744, + "num_tokens": 50787365.0, + "step": 665 + }, + { + "entropy": 0.5759493261575699, + "epoch": 8.77076411960133, + "grad_norm": 0.03633789345622063, + "learning_rate": 0.0002, + "loss": 0.5765956044197083, + "mean_token_accuracy": 0.7658006548881531, + "num_tokens": 50864646.0, + "step": 666 + }, + { + "entropy": 0.5924972295761108, + "epoch": 8.784053156146179, + "grad_norm": 0.030330289155244827, + "learning_rate": 0.0002, + "loss": 0.5899439454078674, + "mean_token_accuracy": 0.7596959173679352, + "num_tokens": 50942183.0, + "step": 667 + }, + { + "entropy": 0.5888451188802719, + "epoch": 8.79734219269103, + "grad_norm": 0.03190000355243683, + "learning_rate": 0.0002, + "loss": 0.5857913494110107, + "mean_token_accuracy": 0.7602512836456299, + "num_tokens": 51019060.0, + "step": 668 + }, + { + "entropy": 0.5876550525426865, + "epoch": 8.81063122923588, + "grad_norm": 0.03718399628996849, + "learning_rate": 0.0002, + "loss": 0.5891491174697876, + "mean_token_accuracy": 0.7600254416465759, + "num_tokens": 51097559.0, + "step": 669 + }, + { + "entropy": 0.5892974138259888, + "epoch": 8.82392026578073, + "grad_norm": 0.032171525061130524, + "learning_rate": 0.0002, + "loss": 0.5908107757568359, + "mean_token_accuracy": 0.7585913240909576, + "num_tokens": 51174991.0, + "step": 670 + }, + { + "entropy": 0.584599032998085, + "epoch": 8.837209302325581, + "grad_norm": 0.03337855264544487, + "learning_rate": 0.0002, + "loss": 0.5803552865982056, + "mean_token_accuracy": 0.7630793899297714, + "num_tokens": 51252440.0, + "step": 671 + }, + { + "entropy": 0.5799373984336853, + "epoch": 8.850498338870432, + "grad_norm": 0.029419418424367905, + "learning_rate": 0.0002, + "loss": 0.5741597414016724, + "mean_token_accuracy": 0.7663457095623016, + "num_tokens": 51329340.0, + "step": 672 + }, + { + "entropy": 0.5873212218284607, + "epoch": 8.863787375415283, + "grad_norm": 0.031486447900533676, + "learning_rate": 0.0002, + "loss": 0.5863950252532959, + "mean_token_accuracy": 0.7606247216463089, + "num_tokens": 51407310.0, + "step": 673 + }, + { + "entropy": 0.5943780243396759, + "epoch": 8.877076411960132, + "grad_norm": 0.028674740344285965, + "learning_rate": 0.0002, + "loss": 0.5923240184783936, + "mean_token_accuracy": 0.7589106559753418, + "num_tokens": 51484477.0, + "step": 674 + }, + { + "entropy": 0.5996403247117996, + "epoch": 8.890365448504983, + "grad_norm": 0.031019171699881554, + "learning_rate": 0.0002, + "loss": 0.5965366363525391, + "mean_token_accuracy": 0.75755475461483, + "num_tokens": 51561266.0, + "step": 675 + }, + { + "entropy": 0.5805972665548325, + "epoch": 8.903654485049834, + "grad_norm": 0.03063480742275715, + "learning_rate": 0.0002, + "loss": 0.5774473547935486, + "mean_token_accuracy": 0.7652737647294998, + "num_tokens": 51638934.0, + "step": 676 + }, + { + "entropy": 0.5837110131978989, + "epoch": 8.916943521594684, + "grad_norm": 0.031470976769924164, + "learning_rate": 0.0002, + "loss": 0.588325560092926, + "mean_token_accuracy": 0.7599637508392334, + "num_tokens": 51715847.0, + "step": 677 + }, + { + "entropy": 0.5817466825246811, + "epoch": 8.930232558139535, + "grad_norm": 0.03200995922088623, + "learning_rate": 0.0002, + "loss": 0.5843440294265747, + "mean_token_accuracy": 0.7613124251365662, + "num_tokens": 51792332.0, + "step": 678 + }, + { + "entropy": 0.5915301889181137, + "epoch": 8.943521594684386, + "grad_norm": 0.03387102484703064, + "learning_rate": 0.0002, + "loss": 0.5847914218902588, + "mean_token_accuracy": 0.7612261474132538, + "num_tokens": 51869698.0, + "step": 679 + }, + { + "entropy": 0.5942060202360153, + "epoch": 8.956810631229235, + "grad_norm": 0.028463192284107208, + "learning_rate": 0.0002, + "loss": 0.5879127383232117, + "mean_token_accuracy": 0.7602778673171997, + "num_tokens": 51946396.0, + "step": 680 + }, + { + "entropy": 0.587485060095787, + "epoch": 8.970099667774086, + "grad_norm": 0.036710530519485474, + "learning_rate": 0.0002, + "loss": 0.5914723873138428, + "mean_token_accuracy": 0.7598218619823456, + "num_tokens": 52023301.0, + "step": 681 + }, + { + "entropy": 0.5879035592079163, + "epoch": 8.983388704318937, + "grad_norm": 0.029370330274105072, + "learning_rate": 0.0002, + "loss": 0.5872666835784912, + "mean_token_accuracy": 0.7601160258054733, + "num_tokens": 52100376.0, + "step": 682 + }, + { + "entropy": 0.5898729115724564, + "epoch": 8.996677740863788, + "grad_norm": 0.028376396745443344, + "learning_rate": 0.0002, + "loss": 0.5859116315841675, + "mean_token_accuracy": 0.7616438567638397, + "num_tokens": 52176733.0, + "step": 683 + }, + { + "entropy": 0.5918471813201904, + "epoch": 9.0, + "grad_norm": 0.05119534581899643, + "learning_rate": 0.0002, + "loss": 0.5821671485900879, + "mean_token_accuracy": 0.761242687702179, + "num_tokens": 52195562.0, + "step": 684 + }, + { + "entropy": 0.5841783732175827, + "epoch": 9.013289036544851, + "grad_norm": 0.032985758036375046, + "learning_rate": 0.0002, + "loss": 0.5801397562026978, + "mean_token_accuracy": 0.761728972196579, + "num_tokens": 52272860.0, + "step": 685 + }, + { + "entropy": 0.5715355575084686, + "epoch": 9.0265780730897, + "grad_norm": 0.038291025906801224, + "learning_rate": 0.0002, + "loss": 0.5748767256736755, + "mean_token_accuracy": 0.7646484971046448, + "num_tokens": 52350111.0, + "step": 686 + }, + { + "entropy": 0.5795238018035889, + "epoch": 9.039867109634551, + "grad_norm": 0.038716547191143036, + "learning_rate": 0.0002, + "loss": 0.5806439518928528, + "mean_token_accuracy": 0.7631524950265884, + "num_tokens": 52427007.0, + "step": 687 + }, + { + "entropy": 0.5912983864545822, + "epoch": 9.053156146179402, + "grad_norm": 0.041771478950977325, + "learning_rate": 0.0002, + "loss": 0.5837312340736389, + "mean_token_accuracy": 0.7606383711099625, + "num_tokens": 52503166.0, + "step": 688 + }, + { + "entropy": 0.5750531256198883, + "epoch": 9.066445182724253, + "grad_norm": 0.04263452813029289, + "learning_rate": 0.0002, + "loss": 0.5768004655838013, + "mean_token_accuracy": 0.7641178071498871, + "num_tokens": 52581240.0, + "step": 689 + }, + { + "entropy": 0.5842915773391724, + "epoch": 9.079734219269103, + "grad_norm": 0.04072727635502815, + "learning_rate": 0.0002, + "loss": 0.5862613916397095, + "mean_token_accuracy": 0.7600968182086945, + "num_tokens": 52657288.0, + "step": 690 + }, + { + "entropy": 0.5826019048690796, + "epoch": 9.093023255813954, + "grad_norm": 0.042537905275821686, + "learning_rate": 0.0002, + "loss": 0.5760419368743896, + "mean_token_accuracy": 0.7641205936670303, + "num_tokens": 52733779.0, + "step": 691 + }, + { + "entropy": 0.5833656191825867, + "epoch": 9.106312292358805, + "grad_norm": 0.039307933300733566, + "learning_rate": 0.0002, + "loss": 0.5780174136161804, + "mean_token_accuracy": 0.7621660232543945, + "num_tokens": 52809877.0, + "step": 692 + }, + { + "entropy": 0.5833144932985306, + "epoch": 9.119601328903654, + "grad_norm": 0.03763529285788536, + "learning_rate": 0.0002, + "loss": 0.5828508734703064, + "mean_token_accuracy": 0.7619175165891647, + "num_tokens": 52887809.0, + "step": 693 + }, + { + "entropy": 0.5802912563085556, + "epoch": 9.132890365448505, + "grad_norm": 0.042694512754678726, + "learning_rate": 0.0002, + "loss": 0.5785671472549438, + "mean_token_accuracy": 0.7632732540369034, + "num_tokens": 52964832.0, + "step": 694 + }, + { + "entropy": 0.5879446417093277, + "epoch": 9.146179401993356, + "grad_norm": 0.045146629214286804, + "learning_rate": 0.0002, + "loss": 0.5837844014167786, + "mean_token_accuracy": 0.7614665478467941, + "num_tokens": 53041546.0, + "step": 695 + }, + { + "entropy": 0.5769313871860504, + "epoch": 9.159468438538205, + "grad_norm": 0.04538911208510399, + "learning_rate": 0.0002, + "loss": 0.578600287437439, + "mean_token_accuracy": 0.7636725157499313, + "num_tokens": 53118699.0, + "step": 696 + }, + { + "entropy": 0.5738919973373413, + "epoch": 9.172757475083056, + "grad_norm": 0.0365930013358593, + "learning_rate": 0.0002, + "loss": 0.5768018960952759, + "mean_token_accuracy": 0.7647374421358109, + "num_tokens": 53194552.0, + "step": 697 + }, + { + "entropy": 0.5699289292097092, + "epoch": 9.186046511627907, + "grad_norm": 0.03911687061190605, + "learning_rate": 0.0002, + "loss": 0.5651339888572693, + "mean_token_accuracy": 0.768623873591423, + "num_tokens": 53272699.0, + "step": 698 + }, + { + "entropy": 0.5740307569503784, + "epoch": 9.199335548172758, + "grad_norm": 0.042123015969991684, + "learning_rate": 0.0002, + "loss": 0.573491096496582, + "mean_token_accuracy": 0.7646935433149338, + "num_tokens": 53350054.0, + "step": 699 + }, + { + "entropy": 0.579895555973053, + "epoch": 9.212624584717608, + "grad_norm": 0.050487667322158813, + "learning_rate": 0.0002, + "loss": 0.5794432163238525, + "mean_token_accuracy": 0.7630578577518463, + "num_tokens": 53425787.0, + "step": 700 + }, + { + "entropy": 0.5742232501506805, + "epoch": 9.225913621262459, + "grad_norm": 0.039948951452970505, + "learning_rate": 0.0002, + "loss": 0.5666079521179199, + "mean_token_accuracy": 0.7682702094316483, + "num_tokens": 53503176.0, + "step": 701 + }, + { + "entropy": 0.5729279220104218, + "epoch": 9.23920265780731, + "grad_norm": 0.05120493844151497, + "learning_rate": 0.0002, + "loss": 0.5697590112686157, + "mean_token_accuracy": 0.7677944153547287, + "num_tokens": 53581943.0, + "step": 702 + }, + { + "entropy": 0.5736203342676163, + "epoch": 9.252491694352159, + "grad_norm": 0.035830773413181305, + "learning_rate": 0.0002, + "loss": 0.5681569576263428, + "mean_token_accuracy": 0.7680141031742096, + "num_tokens": 53659572.0, + "step": 703 + }, + { + "entropy": 0.5700356960296631, + "epoch": 9.26578073089701, + "grad_norm": 0.04752933606505394, + "learning_rate": 0.0002, + "loss": 0.5745888948440552, + "mean_token_accuracy": 0.7650690525770187, + "num_tokens": 53736316.0, + "step": 704 + }, + { + "entropy": 0.5778879225254059, + "epoch": 9.279069767441861, + "grad_norm": 0.050968557596206665, + "learning_rate": 0.0002, + "loss": 0.5786650776863098, + "mean_token_accuracy": 0.7637975066900253, + "num_tokens": 53812375.0, + "step": 705 + }, + { + "entropy": 0.5845597684383392, + "epoch": 9.29235880398671, + "grad_norm": 0.04049290716648102, + "learning_rate": 0.0002, + "loss": 0.5771433115005493, + "mean_token_accuracy": 0.7640694826841354, + "num_tokens": 53889373.0, + "step": 706 + }, + { + "entropy": 0.5710542052984238, + "epoch": 9.305647840531561, + "grad_norm": 0.049213092774152756, + "learning_rate": 0.0002, + "loss": 0.5740491151809692, + "mean_token_accuracy": 0.7647717893123627, + "num_tokens": 53966336.0, + "step": 707 + }, + { + "entropy": 0.5792699754238129, + "epoch": 9.318936877076412, + "grad_norm": 0.04844093322753906, + "learning_rate": 0.0002, + "loss": 0.5842309594154358, + "mean_token_accuracy": 0.7619152516126633, + "num_tokens": 54042331.0, + "step": 708 + }, + { + "entropy": 0.5852373540401459, + "epoch": 9.332225913621263, + "grad_norm": 0.04324189946055412, + "learning_rate": 0.0002, + "loss": 0.5743598937988281, + "mean_token_accuracy": 0.7650860399007797, + "num_tokens": 54120476.0, + "step": 709 + }, + { + "entropy": 0.5748791694641113, + "epoch": 9.345514950166113, + "grad_norm": 0.03747578710317612, + "learning_rate": 0.0002, + "loss": 0.5679724216461182, + "mean_token_accuracy": 0.7683089375495911, + "num_tokens": 54198246.0, + "step": 710 + }, + { + "entropy": 0.5661651790142059, + "epoch": 9.358803986710964, + "grad_norm": 0.05258210748434067, + "learning_rate": 0.0002, + "loss": 0.576251745223999, + "mean_token_accuracy": 0.7638748437166214, + "num_tokens": 54275752.0, + "step": 711 + }, + { + "entropy": 0.5675118267536163, + "epoch": 9.372093023255815, + "grad_norm": 0.03817306086421013, + "learning_rate": 0.0002, + "loss": 0.5666477680206299, + "mean_token_accuracy": 0.7682253867387772, + "num_tokens": 54352088.0, + "step": 712 + }, + { + "entropy": 0.591354101896286, + "epoch": 9.385382059800664, + "grad_norm": 0.03948526084423065, + "learning_rate": 0.0002, + "loss": 0.5834983587265015, + "mean_token_accuracy": 0.7615845501422882, + "num_tokens": 54429552.0, + "step": 713 + }, + { + "entropy": 0.5859814137220383, + "epoch": 9.398671096345515, + "grad_norm": 0.03413126617670059, + "learning_rate": 0.0002, + "loss": 0.5804739594459534, + "mean_token_accuracy": 0.7621511518955231, + "num_tokens": 54507607.0, + "step": 714 + }, + { + "entropy": 0.5741334706544876, + "epoch": 9.411960132890366, + "grad_norm": 0.041531626135110855, + "learning_rate": 0.0002, + "loss": 0.5779021978378296, + "mean_token_accuracy": 0.7632759809494019, + "num_tokens": 54583653.0, + "step": 715 + }, + { + "entropy": 0.5825967490673065, + "epoch": 9.425249169435215, + "grad_norm": 0.04578561708331108, + "learning_rate": 0.0002, + "loss": 0.582665205001831, + "mean_token_accuracy": 0.7611964493989944, + "num_tokens": 54660880.0, + "step": 716 + }, + { + "entropy": 0.5794167369604111, + "epoch": 9.438538205980066, + "grad_norm": 0.049054164439439774, + "learning_rate": 0.0002, + "loss": 0.5784138441085815, + "mean_token_accuracy": 0.7645507901906967, + "num_tokens": 54737070.0, + "step": 717 + }, + { + "entropy": 0.5805319249629974, + "epoch": 9.451827242524917, + "grad_norm": 0.0353560745716095, + "learning_rate": 0.0002, + "loss": 0.5795561075210571, + "mean_token_accuracy": 0.7641272395849228, + "num_tokens": 54813163.0, + "step": 718 + }, + { + "entropy": 0.5851545929908752, + "epoch": 9.465116279069768, + "grad_norm": 0.04045746475458145, + "learning_rate": 0.0002, + "loss": 0.5845059752464294, + "mean_token_accuracy": 0.7607411295175552, + "num_tokens": 54889927.0, + "step": 719 + }, + { + "entropy": 0.579479768872261, + "epoch": 9.478405315614618, + "grad_norm": 0.03297734633088112, + "learning_rate": 0.0002, + "loss": 0.5776249170303345, + "mean_token_accuracy": 0.7639060616493225, + "num_tokens": 54967357.0, + "step": 720 + }, + { + "entropy": 0.5843139588832855, + "epoch": 9.491694352159469, + "grad_norm": 0.04577886313199997, + "learning_rate": 0.0002, + "loss": 0.5836153030395508, + "mean_token_accuracy": 0.7609659135341644, + "num_tokens": 55045666.0, + "step": 721 + }, + { + "entropy": 0.5866421908140182, + "epoch": 9.50498338870432, + "grad_norm": 0.034662481397390366, + "learning_rate": 0.0002, + "loss": 0.5821191668510437, + "mean_token_accuracy": 0.7624327689409256, + "num_tokens": 55123419.0, + "step": 722 + }, + { + "entropy": 0.5771774500608444, + "epoch": 9.518272425249169, + "grad_norm": 0.03873879462480545, + "learning_rate": 0.0002, + "loss": 0.5764944553375244, + "mean_token_accuracy": 0.7636460214853287, + "num_tokens": 55200111.0, + "step": 723 + }, + { + "entropy": 0.5907417982816696, + "epoch": 9.53156146179402, + "grad_norm": 0.036843083798885345, + "learning_rate": 0.0002, + "loss": 0.5917870998382568, + "mean_token_accuracy": 0.7568515092134476, + "num_tokens": 55276410.0, + "step": 724 + }, + { + "entropy": 0.5745353251695633, + "epoch": 9.544850498338871, + "grad_norm": 0.041196517646312714, + "learning_rate": 0.0002, + "loss": 0.5695568323135376, + "mean_token_accuracy": 0.7673688530921936, + "num_tokens": 55354912.0, + "step": 725 + }, + { + "entropy": 0.5847089290618896, + "epoch": 9.55813953488372, + "grad_norm": 0.045686203986406326, + "learning_rate": 0.0002, + "loss": 0.5830461382865906, + "mean_token_accuracy": 0.7621099352836609, + "num_tokens": 55432664.0, + "step": 726 + }, + { + "entropy": 0.5793291479349136, + "epoch": 9.571428571428571, + "grad_norm": 0.037047456949949265, + "learning_rate": 0.0002, + "loss": 0.5785675048828125, + "mean_token_accuracy": 0.7639460265636444, + "num_tokens": 55509362.0, + "step": 727 + }, + { + "entropy": 0.5835801213979721, + "epoch": 9.584717607973422, + "grad_norm": 0.03607526794075966, + "learning_rate": 0.0002, + "loss": 0.582047700881958, + "mean_token_accuracy": 0.7607121020555496, + "num_tokens": 55586114.0, + "step": 728 + }, + { + "entropy": 0.5782389640808105, + "epoch": 9.598006644518273, + "grad_norm": 0.04172277823090553, + "learning_rate": 0.0002, + "loss": 0.5722988843917847, + "mean_token_accuracy": 0.7641795426607132, + "num_tokens": 55662923.0, + "step": 729 + }, + { + "entropy": 0.5846338421106339, + "epoch": 9.611295681063122, + "grad_norm": 0.037988658994436264, + "learning_rate": 0.0002, + "loss": 0.582650899887085, + "mean_token_accuracy": 0.7619550377130508, + "num_tokens": 55740517.0, + "step": 730 + }, + { + "entropy": 0.5653723329305649, + "epoch": 9.624584717607974, + "grad_norm": 0.04472494497895241, + "learning_rate": 0.0002, + "loss": 0.5709476470947266, + "mean_token_accuracy": 0.7665883451700211, + "num_tokens": 55817432.0, + "step": 731 + }, + { + "entropy": 0.5787388980388641, + "epoch": 9.637873754152825, + "grad_norm": 0.04359956458210945, + "learning_rate": 0.0002, + "loss": 0.5829640626907349, + "mean_token_accuracy": 0.760590597987175, + "num_tokens": 55894580.0, + "step": 732 + }, + { + "entropy": 0.5837588608264923, + "epoch": 9.651162790697674, + "grad_norm": 0.037198908627033234, + "learning_rate": 0.0002, + "loss": 0.5767493844032288, + "mean_token_accuracy": 0.7640175223350525, + "num_tokens": 55972067.0, + "step": 733 + }, + { + "entropy": 0.5896154344081879, + "epoch": 9.664451827242525, + "grad_norm": 0.04088831692934036, + "learning_rate": 0.0002, + "loss": 0.5833977460861206, + "mean_token_accuracy": 0.7615736275911331, + "num_tokens": 56049153.0, + "step": 734 + }, + { + "entropy": 0.5845619142055511, + "epoch": 9.677740863787376, + "grad_norm": 0.0368829071521759, + "learning_rate": 0.0002, + "loss": 0.5855330228805542, + "mean_token_accuracy": 0.760240375995636, + "num_tokens": 56126404.0, + "step": 735 + }, + { + "entropy": 0.5753927528858185, + "epoch": 9.691029900332225, + "grad_norm": 0.03727378696203232, + "learning_rate": 0.0002, + "loss": 0.5770326852798462, + "mean_token_accuracy": 0.7630214542150497, + "num_tokens": 56203791.0, + "step": 736 + }, + { + "entropy": 0.5791745483875275, + "epoch": 9.704318936877076, + "grad_norm": 0.041700221598148346, + "learning_rate": 0.0002, + "loss": 0.5799466371536255, + "mean_token_accuracy": 0.7615901082754135, + "num_tokens": 56281724.0, + "step": 737 + }, + { + "entropy": 0.577799379825592, + "epoch": 9.717607973421927, + "grad_norm": 0.04183577001094818, + "learning_rate": 0.0002, + "loss": 0.5686119198799133, + "mean_token_accuracy": 0.7689932882785797, + "num_tokens": 56359768.0, + "step": 738 + }, + { + "entropy": 0.5778573751449585, + "epoch": 9.730897009966778, + "grad_norm": 0.03849725425243378, + "learning_rate": 0.0002, + "loss": 0.5799794793128967, + "mean_token_accuracy": 0.763456404209137, + "num_tokens": 56436568.0, + "step": 739 + }, + { + "entropy": 0.5874462425708771, + "epoch": 9.744186046511627, + "grad_norm": 0.04311611130833626, + "learning_rate": 0.0002, + "loss": 0.5923245549201965, + "mean_token_accuracy": 0.7570117563009262, + "num_tokens": 56514244.0, + "step": 740 + }, + { + "entropy": 0.5856891423463821, + "epoch": 9.757475083056478, + "grad_norm": 0.03763333708047867, + "learning_rate": 0.0002, + "loss": 0.5764776468276978, + "mean_token_accuracy": 0.7640483975410461, + "num_tokens": 56590874.0, + "step": 741 + }, + { + "entropy": 0.5816144794225693, + "epoch": 9.77076411960133, + "grad_norm": 0.03455667570233345, + "learning_rate": 0.0002, + "loss": 0.577386736869812, + "mean_token_accuracy": 0.7633946985006332, + "num_tokens": 56668236.0, + "step": 742 + }, + { + "entropy": 0.5627869218587875, + "epoch": 9.784053156146179, + "grad_norm": 0.03804216906428337, + "learning_rate": 0.0002, + "loss": 0.5637524127960205, + "mean_token_accuracy": 0.7708553522825241, + "num_tokens": 56746118.0, + "step": 743 + }, + { + "entropy": 0.5718859136104584, + "epoch": 9.79734219269103, + "grad_norm": 0.0355333648622036, + "learning_rate": 0.0002, + "loss": 0.5740309357643127, + "mean_token_accuracy": 0.7656346410512924, + "num_tokens": 56822519.0, + "step": 744 + }, + { + "entropy": 0.591578796505928, + "epoch": 9.81063122923588, + "grad_norm": 0.03415751829743385, + "learning_rate": 0.0002, + "loss": 0.5866076946258545, + "mean_token_accuracy": 0.7593905031681061, + "num_tokens": 56898668.0, + "step": 745 + }, + { + "entropy": 0.574189156293869, + "epoch": 9.82392026578073, + "grad_norm": 0.03239757567644119, + "learning_rate": 0.0002, + "loss": 0.5689048767089844, + "mean_token_accuracy": 0.7667425870895386, + "num_tokens": 56975460.0, + "step": 746 + }, + { + "entropy": 0.5808965563774109, + "epoch": 9.837209302325581, + "grad_norm": 0.04112805798649788, + "learning_rate": 0.0002, + "loss": 0.5850220322608948, + "mean_token_accuracy": 0.7613527029752731, + "num_tokens": 57052463.0, + "step": 747 + }, + { + "entropy": 0.5827837735414505, + "epoch": 9.850498338870432, + "grad_norm": 0.04451862722635269, + "learning_rate": 0.0002, + "loss": 0.5784448385238647, + "mean_token_accuracy": 0.7636194676160812, + "num_tokens": 57128736.0, + "step": 748 + }, + { + "entropy": 0.5830895751714706, + "epoch": 9.863787375415283, + "grad_norm": 0.04024534672498703, + "learning_rate": 0.0002, + "loss": 0.5784624814987183, + "mean_token_accuracy": 0.763356551527977, + "num_tokens": 57205186.0, + "step": 749 + }, + { + "entropy": 0.5814227908849716, + "epoch": 9.877076411960132, + "grad_norm": 0.03781008720397949, + "learning_rate": 0.0002, + "loss": 0.5814759731292725, + "mean_token_accuracy": 0.7635377496480942, + "num_tokens": 57281898.0, + "step": 750 + }, + { + "entropy": 0.5727444589138031, + "epoch": 9.890365448504983, + "grad_norm": 0.053311847150325775, + "learning_rate": 0.0002, + "loss": 0.5782246589660645, + "mean_token_accuracy": 0.7641912996768951, + "num_tokens": 57358985.0, + "step": 751 + }, + { + "entropy": 0.581045925617218, + "epoch": 9.903654485049834, + "grad_norm": 0.035100169479846954, + "learning_rate": 0.0002, + "loss": 0.5772634744644165, + "mean_token_accuracy": 0.7643590718507767, + "num_tokens": 57436207.0, + "step": 752 + }, + { + "entropy": 0.5704544335603714, + "epoch": 9.916943521594684, + "grad_norm": 0.03945276141166687, + "learning_rate": 0.0002, + "loss": 0.5681596994400024, + "mean_token_accuracy": 0.768840491771698, + "num_tokens": 57513512.0, + "step": 753 + }, + { + "entropy": 0.571413591504097, + "epoch": 9.930232558139535, + "grad_norm": 0.03285612910985947, + "learning_rate": 0.0002, + "loss": 0.5690507292747498, + "mean_token_accuracy": 0.767002746462822, + "num_tokens": 57591421.0, + "step": 754 + }, + { + "entropy": 0.5804395973682404, + "epoch": 9.943521594684386, + "grad_norm": 0.03729914873838425, + "learning_rate": 0.0002, + "loss": 0.5794394016265869, + "mean_token_accuracy": 0.7638011276721954, + "num_tokens": 57668937.0, + "step": 755 + }, + { + "entropy": 0.5725217163562775, + "epoch": 9.956810631229235, + "grad_norm": 0.03362439572811127, + "learning_rate": 0.0002, + "loss": 0.5742719173431396, + "mean_token_accuracy": 0.7654726803302765, + "num_tokens": 57745669.0, + "step": 756 + }, + { + "entropy": 0.5836540162563324, + "epoch": 9.970099667774086, + "grad_norm": 0.035550713539123535, + "learning_rate": 0.0002, + "loss": 0.5818772912025452, + "mean_token_accuracy": 0.763662725687027, + "num_tokens": 57822380.0, + "step": 757 + }, + { + "entropy": 0.5891828089952469, + "epoch": 9.983388704318937, + "grad_norm": 0.03719017282128334, + "learning_rate": 0.0002, + "loss": 0.5829074382781982, + "mean_token_accuracy": 0.7616835683584213, + "num_tokens": 57898798.0, + "step": 758 + }, + { + "entropy": 0.5854817181825638, + "epoch": 9.996677740863788, + "grad_norm": 0.03322125971317291, + "learning_rate": 0.0002, + "loss": 0.5807455778121948, + "mean_token_accuracy": 0.7624249011278152, + "num_tokens": 57975797.0, + "step": 759 + }, + { + "entropy": 0.596860408782959, + "epoch": 10.0, + "grad_norm": 0.0526103712618351, + "learning_rate": 0.0002, + "loss": 0.5905860662460327, + "mean_token_accuracy": 0.7580848336219788, + "num_tokens": 57994973.0, + "step": 760 + } + ], + "logging_steps": 1, + "max_steps": 760, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 500, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": true + }, + "attributes": {} + } + }, + "total_flos": 3.4745117510960415e+18, + "train_batch_size": 16, + "trial_name": null, + "trial_params": null +}