{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 5.0, "eval_steps": 500, "global_step": 785, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.1603021323680878, "epoch": 0.0064, "grad_norm": 0.22975344955921173, "learning_rate": 0.0002, "loss": 2.6077966690063477, "mean_token_accuracy": 0.4999677650630474, "num_tokens": 37716.0, "step": 1 }, { "entropy": 1.2748871892690659, "epoch": 0.0128, "grad_norm": 0.2017921358346939, "learning_rate": 0.0002, "loss": 2.2619409561157227, "mean_token_accuracy": 0.5358003973960876, "num_tokens": 75123.0, "step": 2 }, { "entropy": 1.4657676070928574, "epoch": 0.0192, "grad_norm": 0.13960610330104828, "learning_rate": 0.0002, "loss": 1.8277919292449951, "mean_token_accuracy": 0.5620946511626244, "num_tokens": 112455.0, "step": 3 }, { "entropy": 1.4639433324337006, "epoch": 0.0256, "grad_norm": 0.1115739569067955, "learning_rate": 0.0002, "loss": 1.5044896602630615, "mean_token_accuracy": 0.6032674387097359, "num_tokens": 150168.0, "step": 4 }, { "entropy": 1.4306974858045578, "epoch": 0.032, "grad_norm": 0.1513909250497818, "learning_rate": 0.0002, "loss": 1.3954216241836548, "mean_token_accuracy": 0.607626736164093, "num_tokens": 187390.0, "step": 5 }, { "entropy": 1.3751554787158966, "epoch": 0.0384, "grad_norm": 0.07965348660945892, "learning_rate": 0.0002, "loss": 1.2835979461669922, "mean_token_accuracy": 0.6308266744017601, "num_tokens": 224660.0, "step": 6 }, { "entropy": 1.3173644244670868, "epoch": 0.0448, "grad_norm": 0.049434103071689606, "learning_rate": 0.0002, "loss": 1.2139647006988525, "mean_token_accuracy": 0.6277531310915947, "num_tokens": 262611.0, "step": 7 }, { "entropy": 1.2547403424978256, "epoch": 0.0512, "grad_norm": 0.0511409156024456, "learning_rate": 0.0002, "loss": 1.1280027627944946, "mean_token_accuracy": 0.6461542472243309, "num_tokens": 300183.0, "step": 8 }, { "entropy": 1.1726891100406647, "epoch": 0.0576, "grad_norm": 0.05379360541701317, "learning_rate": 0.0002, "loss": 1.0599746704101562, "mean_token_accuracy": 0.6579638719558716, "num_tokens": 338051.0, "step": 9 }, { "entropy": 1.0671324282884598, "epoch": 0.064, "grad_norm": 0.060306161642074585, "learning_rate": 0.0002, "loss": 0.9810148477554321, "mean_token_accuracy": 0.6758092492818832, "num_tokens": 375360.0, "step": 10 }, { "entropy": 1.0067108944058418, "epoch": 0.0704, "grad_norm": 0.051368217915296555, "learning_rate": 0.0002, "loss": 0.9359661340713501, "mean_token_accuracy": 0.6835062801837921, "num_tokens": 412957.0, "step": 11 }, { "entropy": 0.9524737820029259, "epoch": 0.0768, "grad_norm": 0.5623471140861511, "learning_rate": 0.0002, "loss": 0.8969950675964355, "mean_token_accuracy": 0.6872275173664093, "num_tokens": 450706.0, "step": 12 }, { "entropy": 0.9274985566735268, "epoch": 0.0832, "grad_norm": 0.05319288372993469, "learning_rate": 0.0002, "loss": 0.8793208599090576, "mean_token_accuracy": 0.6885223314166069, "num_tokens": 487960.0, "step": 13 }, { "entropy": 0.8979481309652328, "epoch": 0.0896, "grad_norm": 0.21191297471523285, "learning_rate": 0.0002, "loss": 0.8658405542373657, "mean_token_accuracy": 0.6915783286094666, "num_tokens": 525195.0, "step": 14 }, { "entropy": 0.8346997126936913, "epoch": 0.096, "grad_norm": 0.05889149382710457, "learning_rate": 0.0002, "loss": 0.8389202356338501, "mean_token_accuracy": 0.6947608664631844, "num_tokens": 562338.0, "step": 15 }, { "entropy": 0.8163095191121101, "epoch": 0.1024, "grad_norm": 0.04048901051282883, "learning_rate": 0.0002, "loss": 0.8089202642440796, "mean_token_accuracy": 0.7007258981466293, "num_tokens": 600135.0, "step": 16 }, { "entropy": 0.7877696678042412, "epoch": 0.1088, "grad_norm": 0.039190541952848434, "learning_rate": 0.0002, "loss": 0.7770611047744751, "mean_token_accuracy": 0.7096988186240196, "num_tokens": 637693.0, "step": 17 }, { "entropy": 0.7828011736273766, "epoch": 0.1152, "grad_norm": 0.04370075836777687, "learning_rate": 0.0002, "loss": 0.7714797258377075, "mean_token_accuracy": 0.7088576778769493, "num_tokens": 675327.0, "step": 18 }, { "entropy": 0.7552840113639832, "epoch": 0.1216, "grad_norm": 0.04059312492609024, "learning_rate": 0.0002, "loss": 0.7444543838500977, "mean_token_accuracy": 0.7163014858961105, "num_tokens": 712985.0, "step": 19 }, { "entropy": 0.7549928575754166, "epoch": 0.128, "grad_norm": 0.03694331273436546, "learning_rate": 0.0002, "loss": 0.7338740229606628, "mean_token_accuracy": 0.7175227254629135, "num_tokens": 750710.0, "step": 20 }, { "entropy": 0.7592482566833496, "epoch": 0.1344, "grad_norm": 0.04042579606175423, "learning_rate": 0.0002, "loss": 0.7357518076896667, "mean_token_accuracy": 0.7131277471780777, "num_tokens": 788255.0, "step": 21 }, { "entropy": 0.7549540996551514, "epoch": 0.1408, "grad_norm": 0.03494592010974884, "learning_rate": 0.0002, "loss": 0.7316156625747681, "mean_token_accuracy": 0.7107274830341339, "num_tokens": 826086.0, "step": 22 }, { "entropy": 0.722670815885067, "epoch": 0.1472, "grad_norm": 0.031072545796632767, "learning_rate": 0.0002, "loss": 0.7062587738037109, "mean_token_accuracy": 0.7226787135004997, "num_tokens": 864023.0, "step": 23 }, { "entropy": 0.7071146741509438, "epoch": 0.1536, "grad_norm": 0.03113628178834915, "learning_rate": 0.0002, "loss": 0.7100369334220886, "mean_token_accuracy": 0.7202128395438194, "num_tokens": 901749.0, "step": 24 }, { "entropy": 0.6773204877972603, "epoch": 0.16, "grad_norm": 0.03384184464812279, "learning_rate": 0.0002, "loss": 0.6899121999740601, "mean_token_accuracy": 0.7300205677747726, "num_tokens": 939298.0, "step": 25 }, { "entropy": 0.6714279726147652, "epoch": 0.1664, "grad_norm": 0.03193815425038338, "learning_rate": 0.0002, "loss": 0.6869939565658569, "mean_token_accuracy": 0.7289758324623108, "num_tokens": 976724.0, "step": 26 }, { "entropy": 0.6800564154982567, "epoch": 0.1728, "grad_norm": 0.02955479919910431, "learning_rate": 0.0002, "loss": 0.68382728099823, "mean_token_accuracy": 0.729714535176754, "num_tokens": 1013951.0, "step": 27 }, { "entropy": 0.6879034861922264, "epoch": 0.1792, "grad_norm": 0.025940844789147377, "learning_rate": 0.0002, "loss": 0.6867204904556274, "mean_token_accuracy": 0.7293097972869873, "num_tokens": 1051525.0, "step": 28 }, { "entropy": 0.6878452003002167, "epoch": 0.1856, "grad_norm": 0.02489350363612175, "learning_rate": 0.0002, "loss": 0.6796096563339233, "mean_token_accuracy": 0.7287048920989037, "num_tokens": 1089369.0, "step": 29 }, { "entropy": 0.6869403198361397, "epoch": 0.192, "grad_norm": 0.025337131693959236, "learning_rate": 0.0002, "loss": 0.678722620010376, "mean_token_accuracy": 0.7302690520882607, "num_tokens": 1126844.0, "step": 30 }, { "entropy": 0.6806962639093399, "epoch": 0.1984, "grad_norm": 0.02659286931157112, "learning_rate": 0.0002, "loss": 0.6713651418685913, "mean_token_accuracy": 0.7335517108440399, "num_tokens": 1164699.0, "step": 31 }, { "entropy": 0.676600731909275, "epoch": 0.2048, "grad_norm": 0.024583281949162483, "learning_rate": 0.0002, "loss": 0.674942135810852, "mean_token_accuracy": 0.7303079515695572, "num_tokens": 1201884.0, "step": 32 }, { "entropy": 0.6764877885580063, "epoch": 0.2112, "grad_norm": 0.019307173788547516, "learning_rate": 0.0002, "loss": 0.6733279228210449, "mean_token_accuracy": 0.732945054769516, "num_tokens": 1239141.0, "step": 33 }, { "entropy": 0.6605517789721489, "epoch": 0.2176, "grad_norm": 0.020387521013617516, "learning_rate": 0.0002, "loss": 0.6627103090286255, "mean_token_accuracy": 0.737023763358593, "num_tokens": 1276671.0, "step": 34 }, { "entropy": 0.6582437306642532, "epoch": 0.224, "grad_norm": 0.020866557955741882, "learning_rate": 0.0002, "loss": 0.666618824005127, "mean_token_accuracy": 0.7362421080470085, "num_tokens": 1314330.0, "step": 35 }, { "entropy": 0.6579794958233833, "epoch": 0.2304, "grad_norm": 0.01998458243906498, "learning_rate": 0.0002, "loss": 0.6648584008216858, "mean_token_accuracy": 0.7348862290382385, "num_tokens": 1351870.0, "step": 36 }, { "entropy": 0.6570402011275291, "epoch": 0.2368, "grad_norm": 0.021064545959234238, "learning_rate": 0.0002, "loss": 0.666895866394043, "mean_token_accuracy": 0.7330928146839142, "num_tokens": 1389586.0, "step": 37 }, { "entropy": 0.6450310498476028, "epoch": 0.2432, "grad_norm": 0.02274121530354023, "learning_rate": 0.0002, "loss": 0.6487395763397217, "mean_token_accuracy": 0.7399148046970367, "num_tokens": 1427289.0, "step": 38 }, { "entropy": 0.6655421927571297, "epoch": 0.2496, "grad_norm": 0.019761748611927032, "learning_rate": 0.0002, "loss": 0.6655306816101074, "mean_token_accuracy": 0.7331964820623398, "num_tokens": 1464754.0, "step": 39 }, { "entropy": 0.6678934022784233, "epoch": 0.256, "grad_norm": 0.020196782425045967, "learning_rate": 0.0002, "loss": 0.6606800556182861, "mean_token_accuracy": 0.7348242327570915, "num_tokens": 1502466.0, "step": 40 }, { "entropy": 0.6633569970726967, "epoch": 0.2624, "grad_norm": 0.01856420934200287, "learning_rate": 0.0002, "loss": 0.6598410606384277, "mean_token_accuracy": 0.7345370575785637, "num_tokens": 1539911.0, "step": 41 }, { "entropy": 0.6672858148813248, "epoch": 0.2688, "grad_norm": 0.019625825807452202, "learning_rate": 0.0002, "loss": 0.6584136486053467, "mean_token_accuracy": 0.7353677749633789, "num_tokens": 1577459.0, "step": 42 }, { "entropy": 0.6759661063551903, "epoch": 0.2752, "grad_norm": 0.019913548603653908, "learning_rate": 0.0002, "loss": 0.6726773977279663, "mean_token_accuracy": 0.729034997522831, "num_tokens": 1615462.0, "step": 43 }, { "entropy": 0.6660498529672623, "epoch": 0.2816, "grad_norm": 0.014487133361399174, "learning_rate": 0.0002, "loss": 0.6681607961654663, "mean_token_accuracy": 0.7323712110519409, "num_tokens": 1652949.0, "step": 44 }, { "entropy": 0.6481832191348076, "epoch": 0.288, "grad_norm": 0.01776648312807083, "learning_rate": 0.0002, "loss": 0.6530840396881104, "mean_token_accuracy": 0.7379923015832901, "num_tokens": 1690313.0, "step": 45 }, { "entropy": 0.6430671736598015, "epoch": 0.2944, "grad_norm": 0.018955176696181297, "learning_rate": 0.0002, "loss": 0.6464742422103882, "mean_token_accuracy": 0.7409427240490913, "num_tokens": 1727486.0, "step": 46 }, { "entropy": 0.6565458923578262, "epoch": 0.3008, "grad_norm": 0.015031078830361366, "learning_rate": 0.0002, "loss": 0.6587884426116943, "mean_token_accuracy": 0.7355991005897522, "num_tokens": 1765413.0, "step": 47 }, { "entropy": 0.6365433260798454, "epoch": 0.3072, "grad_norm": 0.017183614894747734, "learning_rate": 0.0002, "loss": 0.6374931335449219, "mean_token_accuracy": 0.7455704137682915, "num_tokens": 1803010.0, "step": 48 }, { "entropy": 0.6563282832503319, "epoch": 0.3136, "grad_norm": 0.01428211573511362, "learning_rate": 0.0002, "loss": 0.6553747057914734, "mean_token_accuracy": 0.7369147315621376, "num_tokens": 1840622.0, "step": 49 }, { "entropy": 0.6499469205737114, "epoch": 0.32, "grad_norm": 0.01203683577477932, "learning_rate": 0.0002, "loss": 0.6548190116882324, "mean_token_accuracy": 0.736673392355442, "num_tokens": 1877938.0, "step": 50 }, { "entropy": 0.6385157108306885, "epoch": 0.3264, "grad_norm": 0.013347586616873741, "learning_rate": 0.0002, "loss": 0.6381226778030396, "mean_token_accuracy": 0.7450113892555237, "num_tokens": 1915406.0, "step": 51 }, { "entropy": 0.6538697853684425, "epoch": 0.3328, "grad_norm": 0.012674320489168167, "learning_rate": 0.0002, "loss": 0.6501171588897705, "mean_token_accuracy": 0.739890843629837, "num_tokens": 1952912.0, "step": 52 }, { "entropy": 0.6603258103132248, "epoch": 0.3392, "grad_norm": 0.01250320952385664, "learning_rate": 0.0002, "loss": 0.6589174270629883, "mean_token_accuracy": 0.7365714758634567, "num_tokens": 1990472.0, "step": 53 }, { "entropy": 0.656892940402031, "epoch": 0.3456, "grad_norm": 0.01285612117499113, "learning_rate": 0.0002, "loss": 0.6544902324676514, "mean_token_accuracy": 0.7372777089476585, "num_tokens": 2028004.0, "step": 54 }, { "entropy": 0.6557554453611374, "epoch": 0.352, "grad_norm": 0.013015029951930046, "learning_rate": 0.0002, "loss": 0.6539305448532104, "mean_token_accuracy": 0.7372152432799339, "num_tokens": 2065450.0, "step": 55 }, { "entropy": 0.6432914957404137, "epoch": 0.3584, "grad_norm": 0.01194705069065094, "learning_rate": 0.0002, "loss": 0.6476873755455017, "mean_token_accuracy": 0.7385553196072578, "num_tokens": 2103001.0, "step": 56 }, { "entropy": 0.665123961865902, "epoch": 0.3648, "grad_norm": 0.014306853525340557, "learning_rate": 0.0002, "loss": 0.6692231893539429, "mean_token_accuracy": 0.7308292016386986, "num_tokens": 2140766.0, "step": 57 }, { "entropy": 0.6395360752940178, "epoch": 0.3712, "grad_norm": 0.012413417920470238, "learning_rate": 0.0002, "loss": 0.6425060033798218, "mean_token_accuracy": 0.7416690960526466, "num_tokens": 2178215.0, "step": 58 }, { "entropy": 0.6377176344394684, "epoch": 0.3776, "grad_norm": 0.011347637511789799, "learning_rate": 0.0002, "loss": 0.6416236162185669, "mean_token_accuracy": 0.7413541078567505, "num_tokens": 2215834.0, "step": 59 }, { "entropy": 0.6470205709338188, "epoch": 0.384, "grad_norm": 0.013059594668447971, "learning_rate": 0.0002, "loss": 0.6504924297332764, "mean_token_accuracy": 0.7374131381511688, "num_tokens": 2253236.0, "step": 60 }, { "entropy": 0.6510438621044159, "epoch": 0.3904, "grad_norm": 0.010343637317419052, "learning_rate": 0.0002, "loss": 0.6483369469642639, "mean_token_accuracy": 0.7396193742752075, "num_tokens": 2290556.0, "step": 61 }, { "entropy": 0.6448361873626709, "epoch": 0.3968, "grad_norm": 0.01215020939707756, "learning_rate": 0.0002, "loss": 0.6442714929580688, "mean_token_accuracy": 0.7406364679336548, "num_tokens": 2327838.0, "step": 62 }, { "entropy": 0.6578632816672325, "epoch": 0.4032, "grad_norm": 0.013611266389489174, "learning_rate": 0.0002, "loss": 0.650489330291748, "mean_token_accuracy": 0.737756036221981, "num_tokens": 2365216.0, "step": 63 }, { "entropy": 0.6599203571677208, "epoch": 0.4096, "grad_norm": 0.013333442620933056, "learning_rate": 0.0002, "loss": 0.6547380089759827, "mean_token_accuracy": 0.7386084869503975, "num_tokens": 2403044.0, "step": 64 }, { "entropy": 0.6421995609998703, "epoch": 0.416, "grad_norm": 0.013022989965975285, "learning_rate": 0.0002, "loss": 0.6451696157455444, "mean_token_accuracy": 0.7419813498854637, "num_tokens": 2440509.0, "step": 65 }, { "entropy": 0.6482381522655487, "epoch": 0.4224, "grad_norm": 0.011019188910722733, "learning_rate": 0.0002, "loss": 0.6525042057037354, "mean_token_accuracy": 0.7360658198595047, "num_tokens": 2477977.0, "step": 66 }, { "entropy": 0.6513727456331253, "epoch": 0.4288, "grad_norm": 0.011377367191016674, "learning_rate": 0.0002, "loss": 0.6533432006835938, "mean_token_accuracy": 0.7368385717272758, "num_tokens": 2515504.0, "step": 67 }, { "entropy": 0.6338299661874771, "epoch": 0.4352, "grad_norm": 0.012209996581077576, "learning_rate": 0.0002, "loss": 0.6345840692520142, "mean_token_accuracy": 0.7449672818183899, "num_tokens": 2552725.0, "step": 68 }, { "entropy": 0.6595024093985558, "epoch": 0.4416, "grad_norm": 0.011869995854794979, "learning_rate": 0.0002, "loss": 0.6633318066596985, "mean_token_accuracy": 0.7312925457954407, "num_tokens": 2590334.0, "step": 69 }, { "entropy": 0.6419216245412827, "epoch": 0.448, "grad_norm": 0.011688044294714928, "learning_rate": 0.0002, "loss": 0.6422508955001831, "mean_token_accuracy": 0.7409501895308495, "num_tokens": 2628114.0, "step": 70 }, { "entropy": 0.6486918181180954, "epoch": 0.4544, "grad_norm": 0.012189529836177826, "learning_rate": 0.0002, "loss": 0.6435794830322266, "mean_token_accuracy": 0.7398836389183998, "num_tokens": 2665938.0, "step": 71 }, { "entropy": 0.6421536579728127, "epoch": 0.4608, "grad_norm": 0.01274161972105503, "learning_rate": 0.0002, "loss": 0.639503538608551, "mean_token_accuracy": 0.7419992312788963, "num_tokens": 2703327.0, "step": 72 }, { "entropy": 0.6552243158221245, "epoch": 0.4672, "grad_norm": 0.011226268485188484, "learning_rate": 0.0002, "loss": 0.6587808132171631, "mean_token_accuracy": 0.7335348948836327, "num_tokens": 2740612.0, "step": 73 }, { "entropy": 0.6495375782251358, "epoch": 0.4736, "grad_norm": 0.01099670771509409, "learning_rate": 0.0002, "loss": 0.6522738933563232, "mean_token_accuracy": 0.7379574105143547, "num_tokens": 2778351.0, "step": 74 }, { "entropy": 0.6299872100353241, "epoch": 0.48, "grad_norm": 0.011653655208647251, "learning_rate": 0.0002, "loss": 0.635120153427124, "mean_token_accuracy": 0.7442547604441643, "num_tokens": 2815733.0, "step": 75 }, { "entropy": 0.646803118288517, "epoch": 0.4864, "grad_norm": 0.011539405211806297, "learning_rate": 0.0002, "loss": 0.6486905813217163, "mean_token_accuracy": 0.7385760024189949, "num_tokens": 2853606.0, "step": 76 }, { "entropy": 0.6475054696202278, "epoch": 0.4928, "grad_norm": 0.011377925053238869, "learning_rate": 0.0002, "loss": 0.6478685140609741, "mean_token_accuracy": 0.7385416328907013, "num_tokens": 2891146.0, "step": 77 }, { "entropy": 0.6380101665854454, "epoch": 0.4992, "grad_norm": 0.011224031448364258, "learning_rate": 0.0002, "loss": 0.6410291194915771, "mean_token_accuracy": 0.7412817031145096, "num_tokens": 2928562.0, "step": 78 }, { "entropy": 0.6493655145168304, "epoch": 0.5056, "grad_norm": 0.010403023101389408, "learning_rate": 0.0002, "loss": 0.6491314768791199, "mean_token_accuracy": 0.7371294796466827, "num_tokens": 2966281.0, "step": 79 }, { "entropy": 0.6337103247642517, "epoch": 0.512, "grad_norm": 0.012346550822257996, "learning_rate": 0.0002, "loss": 0.6318129301071167, "mean_token_accuracy": 0.7457293793559074, "num_tokens": 3003719.0, "step": 80 }, { "entropy": 0.6503832414746284, "epoch": 0.5184, "grad_norm": 0.012706570327281952, "learning_rate": 0.0002, "loss": 0.6492017507553101, "mean_token_accuracy": 0.7375014126300812, "num_tokens": 3041261.0, "step": 81 }, { "entropy": 0.6609693467617035, "epoch": 0.5248, "grad_norm": 0.010637188330292702, "learning_rate": 0.0002, "loss": 0.6600979566574097, "mean_token_accuracy": 0.7335498854517937, "num_tokens": 3078968.0, "step": 82 }, { "entropy": 0.6473255082964897, "epoch": 0.5312, "grad_norm": 0.01124926470220089, "learning_rate": 0.0002, "loss": 0.6503981351852417, "mean_token_accuracy": 0.7380518168210983, "num_tokens": 3116811.0, "step": 83 }, { "entropy": 0.6533865705132484, "epoch": 0.5376, "grad_norm": 0.012132731266319752, "learning_rate": 0.0002, "loss": 0.6592696309089661, "mean_token_accuracy": 0.733529195189476, "num_tokens": 3154474.0, "step": 84 }, { "entropy": 0.639193020761013, "epoch": 0.544, "grad_norm": 0.011734750121831894, "learning_rate": 0.0002, "loss": 0.6403356790542603, "mean_token_accuracy": 0.7433002889156342, "num_tokens": 3192006.0, "step": 85 }, { "entropy": 0.6401269435882568, "epoch": 0.5504, "grad_norm": 0.010875481180846691, "learning_rate": 0.0002, "loss": 0.6439944505691528, "mean_token_accuracy": 0.7402178049087524, "num_tokens": 3229461.0, "step": 86 }, { "entropy": 0.6467242240905762, "epoch": 0.5568, "grad_norm": 0.01122159045189619, "learning_rate": 0.0002, "loss": 0.65086829662323, "mean_token_accuracy": 0.7366317883133888, "num_tokens": 3266854.0, "step": 87 }, { "entropy": 0.6459343954920769, "epoch": 0.5632, "grad_norm": 0.01132342778146267, "learning_rate": 0.0002, "loss": 0.6473137140274048, "mean_token_accuracy": 0.7397668585181236, "num_tokens": 3304594.0, "step": 88 }, { "entropy": 0.6517693251371384, "epoch": 0.5696, "grad_norm": 0.01150190457701683, "learning_rate": 0.0002, "loss": 0.647284746170044, "mean_token_accuracy": 0.7392672076821327, "num_tokens": 3341878.0, "step": 89 }, { "entropy": 0.6644957289099693, "epoch": 0.576, "grad_norm": 0.011668134480714798, "learning_rate": 0.0002, "loss": 0.6594465970993042, "mean_token_accuracy": 0.7339938580989838, "num_tokens": 3379626.0, "step": 90 }, { "entropy": 0.6448649242520332, "epoch": 0.5824, "grad_norm": 0.012058609165251255, "learning_rate": 0.0002, "loss": 0.6404842734336853, "mean_token_accuracy": 0.7406293153762817, "num_tokens": 3417230.0, "step": 91 }, { "entropy": 0.6402811780571938, "epoch": 0.5888, "grad_norm": 0.011592954397201538, "learning_rate": 0.0002, "loss": 0.6447786092758179, "mean_token_accuracy": 0.7402076348662376, "num_tokens": 3454690.0, "step": 92 }, { "entropy": 0.6428509131073952, "epoch": 0.5952, "grad_norm": 0.012272155843675137, "learning_rate": 0.0002, "loss": 0.6479693651199341, "mean_token_accuracy": 0.7390052601695061, "num_tokens": 3492182.0, "step": 93 }, { "entropy": 0.6426275372505188, "epoch": 0.6016, "grad_norm": 0.01083293091505766, "learning_rate": 0.0002, "loss": 0.644639253616333, "mean_token_accuracy": 0.740093432366848, "num_tokens": 3530068.0, "step": 94 }, { "entropy": 0.626714438199997, "epoch": 0.608, "grad_norm": 0.010761498473584652, "learning_rate": 0.0002, "loss": 0.628358006477356, "mean_token_accuracy": 0.746553897857666, "num_tokens": 3567305.0, "step": 95 }, { "entropy": 0.6431040018796921, "epoch": 0.6144, "grad_norm": 0.012162288650870323, "learning_rate": 0.0002, "loss": 0.6470193862915039, "mean_token_accuracy": 0.7389233484864235, "num_tokens": 3604807.0, "step": 96 }, { "entropy": 0.645052507519722, "epoch": 0.6208, "grad_norm": 0.010187218897044659, "learning_rate": 0.0002, "loss": 0.6489447951316833, "mean_token_accuracy": 0.738676629960537, "num_tokens": 3642594.0, "step": 97 }, { "entropy": 0.6390751749277115, "epoch": 0.6272, "grad_norm": 0.01165873184800148, "learning_rate": 0.0002, "loss": 0.643662691116333, "mean_token_accuracy": 0.7390685454010963, "num_tokens": 3680543.0, "step": 98 }, { "entropy": 0.6514940857887268, "epoch": 0.6336, "grad_norm": 0.010981060564517975, "learning_rate": 0.0002, "loss": 0.6510151624679565, "mean_token_accuracy": 0.7382907196879387, "num_tokens": 3717970.0, "step": 99 }, { "entropy": 0.6472062841057777, "epoch": 0.64, "grad_norm": 0.012016931548714638, "learning_rate": 0.0002, "loss": 0.6510175466537476, "mean_token_accuracy": 0.7374041378498077, "num_tokens": 3755566.0, "step": 100 }, { "entropy": 0.6526609882712364, "epoch": 0.6464, "grad_norm": 0.010779659263789654, "learning_rate": 0.0002, "loss": 0.6495513916015625, "mean_token_accuracy": 0.7356445118784904, "num_tokens": 3793159.0, "step": 101 }, { "entropy": 0.6481966897845268, "epoch": 0.6528, "grad_norm": 0.010695680044591427, "learning_rate": 0.0002, "loss": 0.6442012786865234, "mean_token_accuracy": 0.7392323464155197, "num_tokens": 3830925.0, "step": 102 }, { "entropy": 0.6423428729176521, "epoch": 0.6592, "grad_norm": 0.009773760102689266, "learning_rate": 0.0002, "loss": 0.6454004049301147, "mean_token_accuracy": 0.7405061349272728, "num_tokens": 3868672.0, "step": 103 }, { "entropy": 0.6281508877873421, "epoch": 0.6656, "grad_norm": 0.01067226193845272, "learning_rate": 0.0002, "loss": 0.6323127150535583, "mean_token_accuracy": 0.743611678481102, "num_tokens": 3905993.0, "step": 104 }, { "entropy": 0.6415385156869888, "epoch": 0.672, "grad_norm": 0.01100232359021902, "learning_rate": 0.0002, "loss": 0.6450967192649841, "mean_token_accuracy": 0.741372749209404, "num_tokens": 3943387.0, "step": 105 }, { "entropy": 0.6479355171322823, "epoch": 0.6784, "grad_norm": 0.011068901047110558, "learning_rate": 0.0002, "loss": 0.6533315777778625, "mean_token_accuracy": 0.7338352426886559, "num_tokens": 3981143.0, "step": 106 }, { "entropy": 0.6498983204364777, "epoch": 0.6848, "grad_norm": 0.010501043871045113, "learning_rate": 0.0002, "loss": 0.6492184400558472, "mean_token_accuracy": 0.7377433255314827, "num_tokens": 4018874.0, "step": 107 }, { "entropy": 0.6513847932219505, "epoch": 0.6912, "grad_norm": 0.012076501734554768, "learning_rate": 0.0002, "loss": 0.6527359485626221, "mean_token_accuracy": 0.7364412918686867, "num_tokens": 4056434.0, "step": 108 }, { "entropy": 0.6415090262889862, "epoch": 0.6976, "grad_norm": 0.01073481049388647, "learning_rate": 0.0002, "loss": 0.6410619020462036, "mean_token_accuracy": 0.740181528031826, "num_tokens": 4094245.0, "step": 109 }, { "entropy": 0.6442006528377533, "epoch": 0.704, "grad_norm": 0.011465134099125862, "learning_rate": 0.0002, "loss": 0.6447471380233765, "mean_token_accuracy": 0.7409348115324974, "num_tokens": 4131358.0, "step": 110 }, { "entropy": 0.6425353735685349, "epoch": 0.7104, "grad_norm": 0.011008083820343018, "learning_rate": 0.0002, "loss": 0.6414906978607178, "mean_token_accuracy": 0.7418420538306236, "num_tokens": 4169051.0, "step": 111 }, { "entropy": 0.65395537763834, "epoch": 0.7168, "grad_norm": 0.010419737547636032, "learning_rate": 0.0002, "loss": 0.6524069309234619, "mean_token_accuracy": 0.736035592854023, "num_tokens": 4206785.0, "step": 112 }, { "entropy": 0.6436598747968674, "epoch": 0.7232, "grad_norm": 0.01072368398308754, "learning_rate": 0.0002, "loss": 0.646194338798523, "mean_token_accuracy": 0.7391205802559853, "num_tokens": 4243952.0, "step": 113 }, { "entropy": 0.6517779007554054, "epoch": 0.7296, "grad_norm": 0.010077660903334618, "learning_rate": 0.0002, "loss": 0.6503125429153442, "mean_token_accuracy": 0.7375629469752312, "num_tokens": 4281302.0, "step": 114 }, { "entropy": 0.6431594043970108, "epoch": 0.736, "grad_norm": 0.009454594925045967, "learning_rate": 0.0002, "loss": 0.647723913192749, "mean_token_accuracy": 0.7380199134349823, "num_tokens": 4318445.0, "step": 115 }, { "entropy": 0.6490769982337952, "epoch": 0.7424, "grad_norm": 0.010790850967168808, "learning_rate": 0.0002, "loss": 0.6519957780838013, "mean_token_accuracy": 0.7370847165584564, "num_tokens": 4356069.0, "step": 116 }, { "entropy": 0.6421378776431084, "epoch": 0.7488, "grad_norm": 0.011676953174173832, "learning_rate": 0.0002, "loss": 0.6456701755523682, "mean_token_accuracy": 0.7384574711322784, "num_tokens": 4393886.0, "step": 117 }, { "entropy": 0.6397042796015739, "epoch": 0.7552, "grad_norm": 0.009942916221916676, "learning_rate": 0.0002, "loss": 0.6421793699264526, "mean_token_accuracy": 0.7401494830846786, "num_tokens": 4431050.0, "step": 118 }, { "entropy": 0.6442151814699173, "epoch": 0.7616, "grad_norm": 0.010225712321698666, "learning_rate": 0.0002, "loss": 0.6509747505187988, "mean_token_accuracy": 0.7365128919482231, "num_tokens": 4468708.0, "step": 119 }, { "entropy": 0.6483751237392426, "epoch": 0.768, "grad_norm": 0.010288415476679802, "learning_rate": 0.0002, "loss": 0.6510953903198242, "mean_token_accuracy": 0.7370466068387032, "num_tokens": 4506387.0, "step": 120 }, { "entropy": 0.6402674838900566, "epoch": 0.7744, "grad_norm": 0.011825313791632652, "learning_rate": 0.0002, "loss": 0.6385786533355713, "mean_token_accuracy": 0.7403052300214767, "num_tokens": 4544227.0, "step": 121 }, { "entropy": 0.6531669348478317, "epoch": 0.7808, "grad_norm": 0.009835828095674515, "learning_rate": 0.0002, "loss": 0.6538360118865967, "mean_token_accuracy": 0.73631202429533, "num_tokens": 4581868.0, "step": 122 }, { "entropy": 0.6490024328231812, "epoch": 0.7872, "grad_norm": 0.01063550915569067, "learning_rate": 0.0002, "loss": 0.6501119136810303, "mean_token_accuracy": 0.7366527765989304, "num_tokens": 4619257.0, "step": 123 }, { "entropy": 0.6489348411560059, "epoch": 0.7936, "grad_norm": 0.009436458349227905, "learning_rate": 0.0002, "loss": 0.6502528786659241, "mean_token_accuracy": 0.7353222295641899, "num_tokens": 4656790.0, "step": 124 }, { "entropy": 0.6380393132567406, "epoch": 0.8, "grad_norm": 0.009827700443565845, "learning_rate": 0.0002, "loss": 0.640160322189331, "mean_token_accuracy": 0.7403444275259972, "num_tokens": 4694256.0, "step": 125 }, { "entropy": 0.6383800283074379, "epoch": 0.8064, "grad_norm": 0.009908480569720268, "learning_rate": 0.0002, "loss": 0.6422752737998962, "mean_token_accuracy": 0.7412146180868149, "num_tokens": 4731993.0, "step": 126 }, { "entropy": 0.6368249654769897, "epoch": 0.8128, "grad_norm": 0.011256285011768341, "learning_rate": 0.0002, "loss": 0.6375234723091125, "mean_token_accuracy": 0.7389892339706421, "num_tokens": 4769564.0, "step": 127 }, { "entropy": 0.6328444108366966, "epoch": 0.8192, "grad_norm": 0.009496535174548626, "learning_rate": 0.0002, "loss": 0.6372179985046387, "mean_token_accuracy": 0.7419247180223465, "num_tokens": 4807156.0, "step": 128 }, { "entropy": 0.6487380862236023, "epoch": 0.8256, "grad_norm": 0.010182644240558147, "learning_rate": 0.0002, "loss": 0.651898980140686, "mean_token_accuracy": 0.7349159717559814, "num_tokens": 4844688.0, "step": 129 }, { "entropy": 0.637291207909584, "epoch": 0.832, "grad_norm": 0.009813020937144756, "learning_rate": 0.0002, "loss": 0.6357983350753784, "mean_token_accuracy": 0.7435917556285858, "num_tokens": 4882067.0, "step": 130 }, { "entropy": 0.6475042626261711, "epoch": 0.8384, "grad_norm": 0.009938180446624756, "learning_rate": 0.0002, "loss": 0.6457779407501221, "mean_token_accuracy": 0.7377768382430077, "num_tokens": 4919683.0, "step": 131 }, { "entropy": 0.6361658647656441, "epoch": 0.8448, "grad_norm": 0.01157945767045021, "learning_rate": 0.0002, "loss": 0.6357731819152832, "mean_token_accuracy": 0.7428592145442963, "num_tokens": 4957344.0, "step": 132 }, { "entropy": 0.6509395390748978, "epoch": 0.8512, "grad_norm": 0.010125997476279736, "learning_rate": 0.0002, "loss": 0.6515601873397827, "mean_token_accuracy": 0.7356820181012154, "num_tokens": 4994764.0, "step": 133 }, { "entropy": 0.6364396661520004, "epoch": 0.8576, "grad_norm": 0.01021180022507906, "learning_rate": 0.0002, "loss": 0.6399521827697754, "mean_token_accuracy": 0.7389387339353561, "num_tokens": 5032302.0, "step": 134 }, { "entropy": 0.6350365057587624, "epoch": 0.864, "grad_norm": 0.010611058212816715, "learning_rate": 0.0002, "loss": 0.6368668675422668, "mean_token_accuracy": 0.7429890111088753, "num_tokens": 5069759.0, "step": 135 }, { "entropy": 0.6327914297580719, "epoch": 0.8704, "grad_norm": 0.009575539268553257, "learning_rate": 0.0002, "loss": 0.6354016065597534, "mean_token_accuracy": 0.7427869364619255, "num_tokens": 5107295.0, "step": 136 }, { "entropy": 0.6594432219862938, "epoch": 0.8768, "grad_norm": 0.00979944784194231, "learning_rate": 0.0002, "loss": 0.6595268249511719, "mean_token_accuracy": 0.7346527501940727, "num_tokens": 5145124.0, "step": 137 }, { "entropy": 0.6408862993121147, "epoch": 0.8832, "grad_norm": 0.011191108264029026, "learning_rate": 0.0002, "loss": 0.6428693532943726, "mean_token_accuracy": 0.7407258599996567, "num_tokens": 5182599.0, "step": 138 }, { "entropy": 0.6376849785447121, "epoch": 0.8896, "grad_norm": 0.010853955522179604, "learning_rate": 0.0002, "loss": 0.6410936713218689, "mean_token_accuracy": 0.7405535206198692, "num_tokens": 5220168.0, "step": 139 }, { "entropy": 0.6452121436595917, "epoch": 0.896, "grad_norm": 0.010287974961102009, "learning_rate": 0.0002, "loss": 0.6451249122619629, "mean_token_accuracy": 0.7396348267793655, "num_tokens": 5257986.0, "step": 140 }, { "entropy": 0.6390210688114166, "epoch": 0.9024, "grad_norm": 0.011026793159544468, "learning_rate": 0.0002, "loss": 0.644250750541687, "mean_token_accuracy": 0.7396276742219925, "num_tokens": 5295673.0, "step": 141 }, { "entropy": 0.6457666233181953, "epoch": 0.9088, "grad_norm": 0.00994186196476221, "learning_rate": 0.0002, "loss": 0.6455720663070679, "mean_token_accuracy": 0.7386891022324562, "num_tokens": 5333647.0, "step": 142 }, { "entropy": 0.6408794969320297, "epoch": 0.9152, "grad_norm": 0.011928732506930828, "learning_rate": 0.0002, "loss": 0.6402020454406738, "mean_token_accuracy": 0.742262989282608, "num_tokens": 5371718.0, "step": 143 }, { "entropy": 0.6543991938233376, "epoch": 0.9216, "grad_norm": 0.010643723420798779, "learning_rate": 0.0002, "loss": 0.6522170305252075, "mean_token_accuracy": 0.735626682639122, "num_tokens": 5409417.0, "step": 144 }, { "entropy": 0.6360428184270859, "epoch": 0.928, "grad_norm": 0.010354955680668354, "learning_rate": 0.0002, "loss": 0.633360743522644, "mean_token_accuracy": 0.7439651861786842, "num_tokens": 5447224.0, "step": 145 }, { "entropy": 0.6295241191983223, "epoch": 0.9344, "grad_norm": 0.009584055282175541, "learning_rate": 0.0002, "loss": 0.6330816745758057, "mean_token_accuracy": 0.743884801864624, "num_tokens": 5484456.0, "step": 146 }, { "entropy": 0.6305922344326973, "epoch": 0.9408, "grad_norm": 0.012600995600223541, "learning_rate": 0.0002, "loss": 0.6410214900970459, "mean_token_accuracy": 0.7401221916079521, "num_tokens": 5521974.0, "step": 147 }, { "entropy": 0.6405795589089394, "epoch": 0.9472, "grad_norm": 0.012624030001461506, "learning_rate": 0.0002, "loss": 0.6476458311080933, "mean_token_accuracy": 0.7366938292980194, "num_tokens": 5559577.0, "step": 148 }, { "entropy": 0.6548889800906181, "epoch": 0.9536, "grad_norm": 0.009168867953121662, "learning_rate": 0.0002, "loss": 0.6527200937271118, "mean_token_accuracy": 0.7344470545649529, "num_tokens": 5597209.0, "step": 149 }, { "entropy": 0.6553688123822212, "epoch": 0.96, "grad_norm": 0.011672625318169594, "learning_rate": 0.0002, "loss": 0.6522246599197388, "mean_token_accuracy": 0.735475592315197, "num_tokens": 5634927.0, "step": 150 }, { "entropy": 0.6557204276323318, "epoch": 0.9664, "grad_norm": 0.010263725183904171, "learning_rate": 0.0002, "loss": 0.6540011167526245, "mean_token_accuracy": 0.7331173792481422, "num_tokens": 5672469.0, "step": 151 }, { "entropy": 0.6292876526713371, "epoch": 0.9728, "grad_norm": 0.009562517516314983, "learning_rate": 0.0002, "loss": 0.6356937289237976, "mean_token_accuracy": 0.7415798529982567, "num_tokens": 5709851.0, "step": 152 }, { "entropy": 0.6344784423708916, "epoch": 0.9792, "grad_norm": 0.010696685872972012, "learning_rate": 0.0002, "loss": 0.6421383023262024, "mean_token_accuracy": 0.7404361814260483, "num_tokens": 5747183.0, "step": 153 }, { "entropy": 0.6344292610883713, "epoch": 0.9856, "grad_norm": 0.01072372030466795, "learning_rate": 0.0002, "loss": 0.6366742253303528, "mean_token_accuracy": 0.7436658665537834, "num_tokens": 5785030.0, "step": 154 }, { "entropy": 0.64640112221241, "epoch": 0.992, "grad_norm": 0.009201000444591045, "learning_rate": 0.0002, "loss": 0.6510665416717529, "mean_token_accuracy": 0.7334160059690475, "num_tokens": 5822675.0, "step": 155 }, { "entropy": 0.6349588707089424, "epoch": 0.9984, "grad_norm": 0.009053889662027359, "learning_rate": 0.0002, "loss": 0.6340664625167847, "mean_token_accuracy": 0.743820808827877, "num_tokens": 5860056.0, "step": 156 }, { "entropy": 0.6518890261650085, "epoch": 1.0, "grad_norm": 0.01602179929614067, "learning_rate": 0.0002, "loss": 0.6524105072021484, "mean_token_accuracy": 0.7354754209518433, "num_tokens": 5869314.0, "step": 157 }, { "entropy": 0.6527635008096695, "epoch": 1.0064, "grad_norm": 0.011629520915448666, "learning_rate": 0.0002, "loss": 0.648344099521637, "mean_token_accuracy": 0.7363307550549507, "num_tokens": 5907492.0, "step": 158 }, { "entropy": 0.6342032626271248, "epoch": 1.0128, "grad_norm": 0.009327917359769344, "learning_rate": 0.0002, "loss": 0.6365879774093628, "mean_token_accuracy": 0.7422033324837685, "num_tokens": 5945150.0, "step": 159 }, { "entropy": 0.6452426686882973, "epoch": 1.0192, "grad_norm": 0.009940714575350285, "learning_rate": 0.0002, "loss": 0.6485167741775513, "mean_token_accuracy": 0.7388251274824142, "num_tokens": 5983293.0, "step": 160 }, { "entropy": 0.6330019310116768, "epoch": 1.0256, "grad_norm": 0.010047292336821556, "learning_rate": 0.0002, "loss": 0.6353905200958252, "mean_token_accuracy": 0.7421540543437004, "num_tokens": 6020861.0, "step": 161 }, { "entropy": 0.6366018727421761, "epoch": 1.032, "grad_norm": 0.010758111253380775, "learning_rate": 0.0002, "loss": 0.6427363157272339, "mean_token_accuracy": 0.7399178668856621, "num_tokens": 6058895.0, "step": 162 }, { "entropy": 0.6386806666851044, "epoch": 1.0384, "grad_norm": 0.010479118674993515, "learning_rate": 0.0002, "loss": 0.6465561389923096, "mean_token_accuracy": 0.7374918833374977, "num_tokens": 6096481.0, "step": 163 }, { "entropy": 0.6303133890032768, "epoch": 1.0448, "grad_norm": 0.009492664597928524, "learning_rate": 0.0002, "loss": 0.6275724172592163, "mean_token_accuracy": 0.7442837283015251, "num_tokens": 6133720.0, "step": 164 }, { "entropy": 0.641479380428791, "epoch": 1.0512, "grad_norm": 0.011456873267889023, "learning_rate": 0.0002, "loss": 0.6362390518188477, "mean_token_accuracy": 0.741039365530014, "num_tokens": 6171551.0, "step": 165 }, { "entropy": 0.635175496339798, "epoch": 1.0576, "grad_norm": 0.009045133367180824, "learning_rate": 0.0002, "loss": 0.636081874370575, "mean_token_accuracy": 0.7414724603295326, "num_tokens": 6209178.0, "step": 166 }, { "entropy": 0.6251291632652283, "epoch": 1.064, "grad_norm": 0.013078802265226841, "learning_rate": 0.0002, "loss": 0.6349364519119263, "mean_token_accuracy": 0.7421944439411163, "num_tokens": 6246417.0, "step": 167 }, { "entropy": 0.6297666281461716, "epoch": 1.0704, "grad_norm": 0.011462744325399399, "learning_rate": 0.0002, "loss": 0.6320569515228271, "mean_token_accuracy": 0.7444151639938354, "num_tokens": 6284425.0, "step": 168 }, { "entropy": 0.6380733549594879, "epoch": 1.0768, "grad_norm": 0.009066379629075527, "learning_rate": 0.0002, "loss": 0.6397888660430908, "mean_token_accuracy": 0.7402750551700592, "num_tokens": 6321885.0, "step": 169 }, { "entropy": 0.6488857790827751, "epoch": 1.0832, "grad_norm": 0.010398726910352707, "learning_rate": 0.0002, "loss": 0.6441566944122314, "mean_token_accuracy": 0.7384657263755798, "num_tokens": 6359780.0, "step": 170 }, { "entropy": 0.6515408530831337, "epoch": 1.0896, "grad_norm": 0.011355352587997913, "learning_rate": 0.0002, "loss": 0.6486490964889526, "mean_token_accuracy": 0.7374377101659775, "num_tokens": 6397361.0, "step": 171 }, { "entropy": 0.6507275626063347, "epoch": 1.096, "grad_norm": 0.008314304985105991, "learning_rate": 0.0002, "loss": 0.6553799510002136, "mean_token_accuracy": 0.7341008260846138, "num_tokens": 6434762.0, "step": 172 }, { "entropy": 0.6377227902412415, "epoch": 1.1024, "grad_norm": 0.010710292495787144, "learning_rate": 0.0002, "loss": 0.647055983543396, "mean_token_accuracy": 0.7381266057491302, "num_tokens": 6472429.0, "step": 173 }, { "entropy": 0.6286719441413879, "epoch": 1.1088, "grad_norm": 0.010212961584329605, "learning_rate": 0.0002, "loss": 0.6336620450019836, "mean_token_accuracy": 0.7432440966367722, "num_tokens": 6509562.0, "step": 174 }, { "entropy": 0.633246898651123, "epoch": 1.1152, "grad_norm": 0.008904446847736835, "learning_rate": 0.0002, "loss": 0.634044885635376, "mean_token_accuracy": 0.7444055899977684, "num_tokens": 6547088.0, "step": 175 }, { "entropy": 0.6382523626089096, "epoch": 1.1216, "grad_norm": 0.010376264341175556, "learning_rate": 0.0002, "loss": 0.6372156143188477, "mean_token_accuracy": 0.7388828843832016, "num_tokens": 6584424.0, "step": 176 }, { "entropy": 0.6464436203241348, "epoch": 1.1280000000000001, "grad_norm": 0.011439846828579903, "learning_rate": 0.0002, "loss": 0.6371127963066101, "mean_token_accuracy": 0.7424579933285713, "num_tokens": 6622393.0, "step": 177 }, { "entropy": 0.6296398118138313, "epoch": 1.1344, "grad_norm": 0.009771931916475296, "learning_rate": 0.0002, "loss": 0.6298056840896606, "mean_token_accuracy": 0.7466778457164764, "num_tokens": 6660099.0, "step": 178 }, { "entropy": 0.637910395860672, "epoch": 1.1408, "grad_norm": 0.010232111439108849, "learning_rate": 0.0002, "loss": 0.6460920572280884, "mean_token_accuracy": 0.738376684486866, "num_tokens": 6697941.0, "step": 179 }, { "entropy": 0.634870246052742, "epoch": 1.1472, "grad_norm": 0.010192861780524254, "learning_rate": 0.0002, "loss": 0.6416190266609192, "mean_token_accuracy": 0.7403257936239243, "num_tokens": 6735661.0, "step": 180 }, { "entropy": 0.6310748159885406, "epoch": 1.1536, "grad_norm": 0.01060323603451252, "learning_rate": 0.0002, "loss": 0.6375827193260193, "mean_token_accuracy": 0.7393625825643539, "num_tokens": 6772921.0, "step": 181 }, { "entropy": 0.6480697020888329, "epoch": 1.16, "grad_norm": 0.01187078095972538, "learning_rate": 0.0002, "loss": 0.6427325010299683, "mean_token_accuracy": 0.7374937310814857, "num_tokens": 6810167.0, "step": 182 }, { "entropy": 0.64576156437397, "epoch": 1.1663999999999999, "grad_norm": 0.009763217531144619, "learning_rate": 0.0002, "loss": 0.6441277861595154, "mean_token_accuracy": 0.7376614883542061, "num_tokens": 6848110.0, "step": 183 }, { "entropy": 0.6370326280593872, "epoch": 1.1728, "grad_norm": 0.009325532242655754, "learning_rate": 0.0002, "loss": 0.6410567760467529, "mean_token_accuracy": 0.7398818284273148, "num_tokens": 6885422.0, "step": 184 }, { "entropy": 0.6284242644906044, "epoch": 1.1792, "grad_norm": 0.010027528740465641, "learning_rate": 0.0002, "loss": 0.6299871206283569, "mean_token_accuracy": 0.7442184612154961, "num_tokens": 6922828.0, "step": 185 }, { "entropy": 0.6239589303731918, "epoch": 1.1856, "grad_norm": 0.012052655220031738, "learning_rate": 0.0002, "loss": 0.632190465927124, "mean_token_accuracy": 0.7433017045259476, "num_tokens": 6959969.0, "step": 186 }, { "entropy": 0.6507940962910652, "epoch": 1.192, "grad_norm": 0.010141950100660324, "learning_rate": 0.0002, "loss": 0.6531009078025818, "mean_token_accuracy": 0.7333656772971153, "num_tokens": 6997337.0, "step": 187 }, { "entropy": 0.6532803177833557, "epoch": 1.1984, "grad_norm": 0.010835838504135609, "learning_rate": 0.0002, "loss": 0.6479194164276123, "mean_token_accuracy": 0.7359819039702415, "num_tokens": 7034795.0, "step": 188 }, { "entropy": 0.6465721130371094, "epoch": 1.2048, "grad_norm": 0.011012948118150234, "learning_rate": 0.0002, "loss": 0.6399669051170349, "mean_token_accuracy": 0.743029810488224, "num_tokens": 7072227.0, "step": 189 }, { "entropy": 0.643355593085289, "epoch": 1.2112, "grad_norm": 0.0094833392649889, "learning_rate": 0.0002, "loss": 0.6482529640197754, "mean_token_accuracy": 0.7374711334705353, "num_tokens": 7110108.0, "step": 190 }, { "entropy": 0.6375522390007973, "epoch": 1.2176, "grad_norm": 0.010187760926783085, "learning_rate": 0.0002, "loss": 0.6461261510848999, "mean_token_accuracy": 0.7388442009687424, "num_tokens": 7147610.0, "step": 191 }, { "entropy": 0.6215626671910286, "epoch": 1.224, "grad_norm": 0.009307745844125748, "learning_rate": 0.0002, "loss": 0.6269906163215637, "mean_token_accuracy": 0.7465217709541321, "num_tokens": 7184782.0, "step": 192 }, { "entropy": 0.6429780498147011, "epoch": 1.2304, "grad_norm": 0.009042990393936634, "learning_rate": 0.0002, "loss": 0.648235559463501, "mean_token_accuracy": 0.7354854270815849, "num_tokens": 7222549.0, "step": 193 }, { "entropy": 0.6526690945029259, "epoch": 1.2368000000000001, "grad_norm": 0.010063275694847107, "learning_rate": 0.0002, "loss": 0.6548038721084595, "mean_token_accuracy": 0.7341009303927422, "num_tokens": 7260409.0, "step": 194 }, { "entropy": 0.6345907151699066, "epoch": 1.2432, "grad_norm": 0.010623205453157425, "learning_rate": 0.0002, "loss": 0.6308838129043579, "mean_token_accuracy": 0.7419967949390411, "num_tokens": 7297937.0, "step": 195 }, { "entropy": 0.6445695832371712, "epoch": 1.2496, "grad_norm": 0.010199649259448051, "learning_rate": 0.0002, "loss": 0.6364445686340332, "mean_token_accuracy": 0.7410052716732025, "num_tokens": 7335147.0, "step": 196 }, { "entropy": 0.6346744820475578, "epoch": 1.256, "grad_norm": 0.009105252102017403, "learning_rate": 0.0002, "loss": 0.6322548985481262, "mean_token_accuracy": 0.7424812093377113, "num_tokens": 7372946.0, "step": 197 }, { "entropy": 0.619812473654747, "epoch": 1.2624, "grad_norm": 0.009648271836340427, "learning_rate": 0.0002, "loss": 0.626278817653656, "mean_token_accuracy": 0.7455899342894554, "num_tokens": 7410415.0, "step": 198 }, { "entropy": 0.6315840631723404, "epoch": 1.2688, "grad_norm": 0.009451290592551231, "learning_rate": 0.0002, "loss": 0.6375157833099365, "mean_token_accuracy": 0.7421969324350357, "num_tokens": 7448206.0, "step": 199 }, { "entropy": 0.6275417804718018, "epoch": 1.2752, "grad_norm": 0.009674392640590668, "learning_rate": 0.0002, "loss": 0.6342942714691162, "mean_token_accuracy": 0.74417594820261, "num_tokens": 7485553.0, "step": 200 }, { "entropy": 0.6313388273119926, "epoch": 1.2816, "grad_norm": 0.008578372187912464, "learning_rate": 0.0002, "loss": 0.6364251375198364, "mean_token_accuracy": 0.7415003478527069, "num_tokens": 7523107.0, "step": 201 }, { "entropy": 0.6285647079348564, "epoch": 1.288, "grad_norm": 0.007911495864391327, "learning_rate": 0.0002, "loss": 0.6274697780609131, "mean_token_accuracy": 0.7439461648464203, "num_tokens": 7560637.0, "step": 202 }, { "entropy": 0.6555930450558662, "epoch": 1.2944, "grad_norm": 0.00908783357590437, "learning_rate": 0.0002, "loss": 0.6531112194061279, "mean_token_accuracy": 0.7365255653858185, "num_tokens": 7598202.0, "step": 203 }, { "entropy": 0.6405614539980888, "epoch": 1.3008, "grad_norm": 0.008850960060954094, "learning_rate": 0.0002, "loss": 0.6386165022850037, "mean_token_accuracy": 0.7407704368233681, "num_tokens": 7635602.0, "step": 204 }, { "entropy": 0.6183491796255112, "epoch": 1.3072, "grad_norm": 0.009933196939527988, "learning_rate": 0.0002, "loss": 0.6215780973434448, "mean_token_accuracy": 0.7468694671988487, "num_tokens": 7672796.0, "step": 205 }, { "entropy": 0.6282857060432434, "epoch": 1.3136, "grad_norm": 0.009941700845956802, "learning_rate": 0.0002, "loss": 0.6309329271316528, "mean_token_accuracy": 0.7419614642858505, "num_tokens": 7710123.0, "step": 206 }, { "entropy": 0.6409614756703377, "epoch": 1.32, "grad_norm": 0.009079815819859505, "learning_rate": 0.0002, "loss": 0.6415680050849915, "mean_token_accuracy": 0.7399025559425354, "num_tokens": 7747853.0, "step": 207 }, { "entropy": 0.6362860053777695, "epoch": 1.3264, "grad_norm": 0.009475532919168472, "learning_rate": 0.0002, "loss": 0.639657735824585, "mean_token_accuracy": 0.740733340382576, "num_tokens": 7785809.0, "step": 208 }, { "entropy": 0.648863323032856, "epoch": 1.3328, "grad_norm": 0.00897946022450924, "learning_rate": 0.0002, "loss": 0.6453667879104614, "mean_token_accuracy": 0.7376150414347649, "num_tokens": 7823564.0, "step": 209 }, { "entropy": 0.6473242938518524, "epoch": 1.3392, "grad_norm": 0.00988426897674799, "learning_rate": 0.0002, "loss": 0.6461673974990845, "mean_token_accuracy": 0.7394340336322784, "num_tokens": 7861487.0, "step": 210 }, { "entropy": 0.6313100084662437, "epoch": 1.3456000000000001, "grad_norm": 0.011011740192770958, "learning_rate": 0.0002, "loss": 0.6353209614753723, "mean_token_accuracy": 0.7412855923175812, "num_tokens": 7898738.0, "step": 211 }, { "entropy": 0.6332249045372009, "epoch": 1.3519999999999999, "grad_norm": 0.009350410662591457, "learning_rate": 0.0002, "loss": 0.6443768739700317, "mean_token_accuracy": 0.7384829372167587, "num_tokens": 7936394.0, "step": 212 }, { "entropy": 0.6210881397128105, "epoch": 1.3584, "grad_norm": 0.010020367801189423, "learning_rate": 0.0002, "loss": 0.6294596195220947, "mean_token_accuracy": 0.7448422238230705, "num_tokens": 7974219.0, "step": 213 }, { "entropy": 0.6376784816384315, "epoch": 1.3648, "grad_norm": 0.00982749741524458, "learning_rate": 0.0002, "loss": 0.6414127945899963, "mean_token_accuracy": 0.7404457107186317, "num_tokens": 8011498.0, "step": 214 }, { "entropy": 0.6365342438220978, "epoch": 1.3712, "grad_norm": 0.007822374813258648, "learning_rate": 0.0002, "loss": 0.6363272666931152, "mean_token_accuracy": 0.7404549047350883, "num_tokens": 8048792.0, "step": 215 }, { "entropy": 0.6440632939338684, "epoch": 1.3776, "grad_norm": 0.009724266827106476, "learning_rate": 0.0002, "loss": 0.6365130543708801, "mean_token_accuracy": 0.7415405437350273, "num_tokens": 8086606.0, "step": 216 }, { "entropy": 0.6494074836373329, "epoch": 1.384, "grad_norm": 0.009119455702602863, "learning_rate": 0.0002, "loss": 0.645447850227356, "mean_token_accuracy": 0.7357565984129906, "num_tokens": 8124114.0, "step": 217 }, { "entropy": 0.6484241932630539, "epoch": 1.3904, "grad_norm": 0.009591936133801937, "learning_rate": 0.0002, "loss": 0.6502270698547363, "mean_token_accuracy": 0.7375201731920242, "num_tokens": 8162048.0, "step": 218 }, { "entropy": 0.6512304544448853, "epoch": 1.3968, "grad_norm": 0.008009335026144981, "learning_rate": 0.0002, "loss": 0.6536368131637573, "mean_token_accuracy": 0.735274650156498, "num_tokens": 8199794.0, "step": 219 }, { "entropy": 0.6484591439366341, "epoch": 1.4032, "grad_norm": 0.0092353206127882, "learning_rate": 0.0002, "loss": 0.6539183259010315, "mean_token_accuracy": 0.7346156910061836, "num_tokens": 8237281.0, "step": 220 }, { "entropy": 0.6388984844088554, "epoch": 1.4096, "grad_norm": 0.009845041669905186, "learning_rate": 0.0002, "loss": 0.6434773206710815, "mean_token_accuracy": 0.7382834777235985, "num_tokens": 8274814.0, "step": 221 }, { "entropy": 0.6463811621069908, "epoch": 1.416, "grad_norm": 0.008870167657732964, "learning_rate": 0.0002, "loss": 0.6482495665550232, "mean_token_accuracy": 0.7370684891939163, "num_tokens": 8312525.0, "step": 222 }, { "entropy": 0.6367313861846924, "epoch": 1.4224, "grad_norm": 0.008752333000302315, "learning_rate": 0.0002, "loss": 0.6363902688026428, "mean_token_accuracy": 0.7398954927921295, "num_tokens": 8350434.0, "step": 223 }, { "entropy": 0.6389205679297447, "epoch": 1.4288, "grad_norm": 0.009939228184521198, "learning_rate": 0.0002, "loss": 0.6399004459381104, "mean_token_accuracy": 0.739352636039257, "num_tokens": 8387935.0, "step": 224 }, { "entropy": 0.6301346495747566, "epoch": 1.4352, "grad_norm": 0.01083251554518938, "learning_rate": 0.0002, "loss": 0.6333423256874084, "mean_token_accuracy": 0.7439003512263298, "num_tokens": 8425350.0, "step": 225 }, { "entropy": 0.6417813748121262, "epoch": 1.4416, "grad_norm": 0.008651083335280418, "learning_rate": 0.0002, "loss": 0.6453697681427002, "mean_token_accuracy": 0.7393379509449005, "num_tokens": 8462747.0, "step": 226 }, { "entropy": 0.6465223357081413, "epoch": 1.448, "grad_norm": 0.010395637713372707, "learning_rate": 0.0002, "loss": 0.6427249908447266, "mean_token_accuracy": 0.7377897799015045, "num_tokens": 8500639.0, "step": 227 }, { "entropy": 0.637003168463707, "epoch": 1.4544000000000001, "grad_norm": 0.00956573337316513, "learning_rate": 0.0002, "loss": 0.6341052055358887, "mean_token_accuracy": 0.7431980520486832, "num_tokens": 8538277.0, "step": 228 }, { "entropy": 0.6219193041324615, "epoch": 1.4607999999999999, "grad_norm": 0.009173355996608734, "learning_rate": 0.0002, "loss": 0.6226502060890198, "mean_token_accuracy": 0.7491968795657158, "num_tokens": 8576252.0, "step": 229 }, { "entropy": 0.6295832619071007, "epoch": 1.4672, "grad_norm": 0.009499134495854378, "learning_rate": 0.0002, "loss": 0.6385797262191772, "mean_token_accuracy": 0.740376353263855, "num_tokens": 8613847.0, "step": 230 }, { "entropy": 0.6238328814506531, "epoch": 1.4736, "grad_norm": 0.009796243160963058, "learning_rate": 0.0002, "loss": 0.633277177810669, "mean_token_accuracy": 0.7418293952941895, "num_tokens": 8651305.0, "step": 231 }, { "entropy": 0.6379890963435173, "epoch": 1.48, "grad_norm": 0.00879639107733965, "learning_rate": 0.0002, "loss": 0.6392139196395874, "mean_token_accuracy": 0.7400495782494545, "num_tokens": 8688955.0, "step": 232 }, { "entropy": 0.639459103345871, "epoch": 1.4864, "grad_norm": 0.00866638869047165, "learning_rate": 0.0002, "loss": 0.6354138255119324, "mean_token_accuracy": 0.7424653545022011, "num_tokens": 8726561.0, "step": 233 }, { "entropy": 0.6338846683502197, "epoch": 1.4928, "grad_norm": 0.008886488154530525, "learning_rate": 0.0002, "loss": 0.6311143636703491, "mean_token_accuracy": 0.7435080260038376, "num_tokens": 8763633.0, "step": 234 }, { "entropy": 0.6329428404569626, "epoch": 1.4992, "grad_norm": 0.008422540500760078, "learning_rate": 0.0002, "loss": 0.6340688467025757, "mean_token_accuracy": 0.7437330037355423, "num_tokens": 8801223.0, "step": 235 }, { "entropy": 0.6404994279146194, "epoch": 1.5056, "grad_norm": 0.008861835114657879, "learning_rate": 0.0002, "loss": 0.6435329914093018, "mean_token_accuracy": 0.7402794137597084, "num_tokens": 8838852.0, "step": 236 }, { "entropy": 0.6229164972901344, "epoch": 1.512, "grad_norm": 0.01079252827912569, "learning_rate": 0.0002, "loss": 0.6297635436058044, "mean_token_accuracy": 0.7451627627015114, "num_tokens": 8876215.0, "step": 237 }, { "entropy": 0.645681232213974, "epoch": 1.5184, "grad_norm": 0.00952441431581974, "learning_rate": 0.0002, "loss": 0.6496944427490234, "mean_token_accuracy": 0.7374964207410812, "num_tokens": 8913833.0, "step": 238 }, { "entropy": 0.6374045237898827, "epoch": 1.5248, "grad_norm": 0.010180641897022724, "learning_rate": 0.0002, "loss": 0.631719172000885, "mean_token_accuracy": 0.7413778752088547, "num_tokens": 8951296.0, "step": 239 }, { "entropy": 0.6539132967591286, "epoch": 1.5312000000000001, "grad_norm": 0.011931417509913445, "learning_rate": 0.0002, "loss": 0.6448370218276978, "mean_token_accuracy": 0.7378397807478905, "num_tokens": 8988896.0, "step": 240 }, { "entropy": 0.6414381936192513, "epoch": 1.5375999999999999, "grad_norm": 0.00920459907501936, "learning_rate": 0.0002, "loss": 0.6397557258605957, "mean_token_accuracy": 0.7399087175726891, "num_tokens": 9026747.0, "step": 241 }, { "entropy": 0.6196104139089584, "epoch": 1.544, "grad_norm": 0.011374457739293575, "learning_rate": 0.0002, "loss": 0.6309009194374084, "mean_token_accuracy": 0.743213526904583, "num_tokens": 9064429.0, "step": 242 }, { "entropy": 0.6261283829808235, "epoch": 1.5504, "grad_norm": 0.011355147697031498, "learning_rate": 0.0002, "loss": 0.6374455690383911, "mean_token_accuracy": 0.7419503480195999, "num_tokens": 9102195.0, "step": 243 }, { "entropy": 0.6445719599723816, "epoch": 1.5568, "grad_norm": 0.009919662959873676, "learning_rate": 0.0002, "loss": 0.6474390029907227, "mean_token_accuracy": 0.7369806244969368, "num_tokens": 9139609.0, "step": 244 }, { "entropy": 0.6413188800215721, "epoch": 1.5632000000000001, "grad_norm": 0.00855494849383831, "learning_rate": 0.0002, "loss": 0.641474187374115, "mean_token_accuracy": 0.7400150150060654, "num_tokens": 9177293.0, "step": 245 }, { "entropy": 0.637481302022934, "epoch": 1.5695999999999999, "grad_norm": 0.00973748043179512, "learning_rate": 0.0002, "loss": 0.6346510648727417, "mean_token_accuracy": 0.7417012825608253, "num_tokens": 9214895.0, "step": 246 }, { "entropy": 0.6503799557685852, "epoch": 1.576, "grad_norm": 0.007979532703757286, "learning_rate": 0.0002, "loss": 0.6497414112091064, "mean_token_accuracy": 0.7372497469186783, "num_tokens": 9252813.0, "step": 247 }, { "entropy": 0.6455269455909729, "epoch": 1.5824, "grad_norm": 0.008097643963992596, "learning_rate": 0.0002, "loss": 0.6451165676116943, "mean_token_accuracy": 0.7385182455182076, "num_tokens": 9290181.0, "step": 248 }, { "entropy": 0.644989550113678, "epoch": 1.5888, "grad_norm": 0.010681331157684326, "learning_rate": 0.0002, "loss": 0.6487670540809631, "mean_token_accuracy": 0.7362834960222244, "num_tokens": 9327721.0, "step": 249 }, { "entropy": 0.6285341307520866, "epoch": 1.5952, "grad_norm": 0.008401221595704556, "learning_rate": 0.0002, "loss": 0.6307709217071533, "mean_token_accuracy": 0.7442108020186424, "num_tokens": 9365266.0, "step": 250 }, { "entropy": 0.6323808878660202, "epoch": 1.6016, "grad_norm": 0.008853926323354244, "learning_rate": 0.0002, "loss": 0.6337858438491821, "mean_token_accuracy": 0.7412157282233238, "num_tokens": 9403484.0, "step": 251 }, { "entropy": 0.6329245269298553, "epoch": 1.608, "grad_norm": 0.009235359728336334, "learning_rate": 0.0002, "loss": 0.6332880258560181, "mean_token_accuracy": 0.743882454931736, "num_tokens": 9441086.0, "step": 252 }, { "entropy": 0.6339508295059204, "epoch": 1.6143999999999998, "grad_norm": 0.008013821206986904, "learning_rate": 0.0002, "loss": 0.63725346326828, "mean_token_accuracy": 0.7408271208405495, "num_tokens": 9478771.0, "step": 253 }, { "entropy": 0.6374928578734398, "epoch": 1.6208, "grad_norm": 0.009221353568136692, "learning_rate": 0.0002, "loss": 0.6384063959121704, "mean_token_accuracy": 0.7406769022345543, "num_tokens": 9516166.0, "step": 254 }, { "entropy": 0.6367692276835442, "epoch": 1.6272, "grad_norm": 0.00975379254668951, "learning_rate": 0.0002, "loss": 0.6376797556877136, "mean_token_accuracy": 0.7408984154462814, "num_tokens": 9553885.0, "step": 255 }, { "entropy": 0.6397164911031723, "epoch": 1.6336, "grad_norm": 0.009269645437598228, "learning_rate": 0.0002, "loss": 0.6477100849151611, "mean_token_accuracy": 0.7368867322802544, "num_tokens": 9591274.0, "step": 256 }, { "entropy": 0.6350990980863571, "epoch": 1.6400000000000001, "grad_norm": 0.007825898006558418, "learning_rate": 0.0002, "loss": 0.6354209184646606, "mean_token_accuracy": 0.7403729483485222, "num_tokens": 9628921.0, "step": 257 }, { "entropy": 0.6429452896118164, "epoch": 1.6463999999999999, "grad_norm": 0.009811664931476116, "learning_rate": 0.0002, "loss": 0.6441528797149658, "mean_token_accuracy": 0.7374731153249741, "num_tokens": 9666769.0, "step": 258 }, { "entropy": 0.6346355751156807, "epoch": 1.6528, "grad_norm": 0.010059292428195477, "learning_rate": 0.0002, "loss": 0.6366721391677856, "mean_token_accuracy": 0.7407139092683792, "num_tokens": 9704033.0, "step": 259 }, { "entropy": 0.6290543302893639, "epoch": 1.6592, "grad_norm": 0.008349488489329815, "learning_rate": 0.0002, "loss": 0.6278114914894104, "mean_token_accuracy": 0.7450250014662743, "num_tokens": 9741540.0, "step": 260 }, { "entropy": 0.6501712873578072, "epoch": 1.6656, "grad_norm": 0.009427984245121479, "learning_rate": 0.0002, "loss": 0.6549891829490662, "mean_token_accuracy": 0.7353075668215752, "num_tokens": 9779201.0, "step": 261 }, { "entropy": 0.6343263909220695, "epoch": 1.6720000000000002, "grad_norm": 0.008428818546235561, "learning_rate": 0.0002, "loss": 0.6368517875671387, "mean_token_accuracy": 0.7391695827245712, "num_tokens": 9816683.0, "step": 262 }, { "entropy": 0.649608425796032, "epoch": 1.6784, "grad_norm": 0.008335414342582226, "learning_rate": 0.0002, "loss": 0.6505298614501953, "mean_token_accuracy": 0.7356899008154869, "num_tokens": 9854491.0, "step": 263 }, { "entropy": 0.6355179324746132, "epoch": 1.6848, "grad_norm": 0.009246018715202808, "learning_rate": 0.0002, "loss": 0.6331362128257751, "mean_token_accuracy": 0.741562083363533, "num_tokens": 9891893.0, "step": 264 }, { "entropy": 0.6557022258639336, "epoch": 1.6912, "grad_norm": 0.008260353468358517, "learning_rate": 0.0002, "loss": 0.6587477922439575, "mean_token_accuracy": 0.7323677465319633, "num_tokens": 9929548.0, "step": 265 }, { "entropy": 0.6404315456748009, "epoch": 1.6976, "grad_norm": 0.009794406592845917, "learning_rate": 0.0002, "loss": 0.6475528478622437, "mean_token_accuracy": 0.7362662330269814, "num_tokens": 9967059.0, "step": 266 }, { "entropy": 0.63386220484972, "epoch": 1.704, "grad_norm": 0.008251597173511982, "learning_rate": 0.0002, "loss": 0.6386945247650146, "mean_token_accuracy": 0.7404668778181076, "num_tokens": 10004660.0, "step": 267 }, { "entropy": 0.6313491612672806, "epoch": 1.7104, "grad_norm": 0.00842359196394682, "learning_rate": 0.0002, "loss": 0.6330629587173462, "mean_token_accuracy": 0.7405205965042114, "num_tokens": 10042002.0, "step": 268 }, { "entropy": 0.6439215540885925, "epoch": 1.7168, "grad_norm": 0.008792798034846783, "learning_rate": 0.0002, "loss": 0.64313805103302, "mean_token_accuracy": 0.7380542382597923, "num_tokens": 10079455.0, "step": 269 }, { "entropy": 0.6456866934895515, "epoch": 1.7231999999999998, "grad_norm": 0.008770551532506943, "learning_rate": 0.0002, "loss": 0.6415017247200012, "mean_token_accuracy": 0.7395961955189705, "num_tokens": 10117042.0, "step": 270 }, { "entropy": 0.6421365886926651, "epoch": 1.7296, "grad_norm": 0.008746870793402195, "learning_rate": 0.0002, "loss": 0.6441514492034912, "mean_token_accuracy": 0.7391441687941551, "num_tokens": 10154684.0, "step": 271 }, { "entropy": 0.6459959074854851, "epoch": 1.736, "grad_norm": 0.008375383913516998, "learning_rate": 0.0002, "loss": 0.6512868404388428, "mean_token_accuracy": 0.7382498681545258, "num_tokens": 10192405.0, "step": 272 }, { "entropy": 0.6390120834112167, "epoch": 1.7424, "grad_norm": 0.009461523965001106, "learning_rate": 0.0002, "loss": 0.6469432711601257, "mean_token_accuracy": 0.7358321473002434, "num_tokens": 10230330.0, "step": 273 }, { "entropy": 0.6369089707732201, "epoch": 1.7488000000000001, "grad_norm": 0.008092108182609081, "learning_rate": 0.0002, "loss": 0.6383406519889832, "mean_token_accuracy": 0.7406154125928879, "num_tokens": 10267525.0, "step": 274 }, { "entropy": 0.6338964253664017, "epoch": 1.7551999999999999, "grad_norm": 0.008980642072856426, "learning_rate": 0.0002, "loss": 0.633415937423706, "mean_token_accuracy": 0.7437249273061752, "num_tokens": 10304863.0, "step": 275 }, { "entropy": 0.6264254227280617, "epoch": 1.7616, "grad_norm": 0.008377771824598312, "learning_rate": 0.0002, "loss": 0.6282482743263245, "mean_token_accuracy": 0.7431060671806335, "num_tokens": 10342202.0, "step": 276 }, { "entropy": 0.6434390917420387, "epoch": 1.768, "grad_norm": 0.008159980177879333, "learning_rate": 0.0002, "loss": 0.646558403968811, "mean_token_accuracy": 0.7382596433162689, "num_tokens": 10379740.0, "step": 277 }, { "entropy": 0.6326303333044052, "epoch": 1.7744, "grad_norm": 0.008124861866235733, "learning_rate": 0.0002, "loss": 0.6332470178604126, "mean_token_accuracy": 0.7423404455184937, "num_tokens": 10417746.0, "step": 278 }, { "entropy": 0.6520350500941277, "epoch": 1.7808000000000002, "grad_norm": 0.009632322005927563, "learning_rate": 0.0002, "loss": 0.6571191549301147, "mean_token_accuracy": 0.7318461984395981, "num_tokens": 10455758.0, "step": 279 }, { "entropy": 0.6354654431343079, "epoch": 1.7872, "grad_norm": 0.008794812485575676, "learning_rate": 0.0002, "loss": 0.6319587230682373, "mean_token_accuracy": 0.7421321347355843, "num_tokens": 10493098.0, "step": 280 }, { "entropy": 0.6494236141443253, "epoch": 1.7936, "grad_norm": 0.00833588931709528, "learning_rate": 0.0002, "loss": 0.6512980461120605, "mean_token_accuracy": 0.7350147068500519, "num_tokens": 10530840.0, "step": 281 }, { "entropy": 0.6404789388179779, "epoch": 1.8, "grad_norm": 0.009666857309639454, "learning_rate": 0.0002, "loss": 0.6438995599746704, "mean_token_accuracy": 0.7382337227463722, "num_tokens": 10568316.0, "step": 282 }, { "entropy": 0.628923237323761, "epoch": 1.8064, "grad_norm": 0.010019267909228802, "learning_rate": 0.0002, "loss": 0.6307887434959412, "mean_token_accuracy": 0.7422001957893372, "num_tokens": 10605621.0, "step": 283 }, { "entropy": 0.6334665641188622, "epoch": 1.8128, "grad_norm": 0.00908628199249506, "learning_rate": 0.0002, "loss": 0.6341119408607483, "mean_token_accuracy": 0.7430456355214119, "num_tokens": 10642983.0, "step": 284 }, { "entropy": 0.6285069659352303, "epoch": 1.8192, "grad_norm": 0.008308637887239456, "learning_rate": 0.0002, "loss": 0.6301131248474121, "mean_token_accuracy": 0.7429656311869621, "num_tokens": 10680597.0, "step": 285 }, { "entropy": 0.6323676705360413, "epoch": 1.8256000000000001, "grad_norm": 0.008813594467937946, "learning_rate": 0.0002, "loss": 0.6346842050552368, "mean_token_accuracy": 0.7398638725280762, "num_tokens": 10718004.0, "step": 286 }, { "entropy": 0.6334202289581299, "epoch": 1.8319999999999999, "grad_norm": 0.009448044933378696, "learning_rate": 0.0002, "loss": 0.640605092048645, "mean_token_accuracy": 0.7379657998681068, "num_tokens": 10755392.0, "step": 287 }, { "entropy": 0.6541434079408646, "epoch": 1.8384, "grad_norm": 0.00910591334104538, "learning_rate": 0.0002, "loss": 0.6537045240402222, "mean_token_accuracy": 0.7336858883500099, "num_tokens": 10792841.0, "step": 288 }, { "entropy": 0.6449815109372139, "epoch": 1.8448, "grad_norm": 0.010256773792207241, "learning_rate": 0.0002, "loss": 0.6409913301467896, "mean_token_accuracy": 0.739972397685051, "num_tokens": 10830422.0, "step": 289 }, { "entropy": 0.6341065391898155, "epoch": 1.8512, "grad_norm": 0.007780797313898802, "learning_rate": 0.0002, "loss": 0.6369997262954712, "mean_token_accuracy": 0.7405647411942482, "num_tokens": 10867712.0, "step": 290 }, { "entropy": 0.6363702341914177, "epoch": 1.8576000000000001, "grad_norm": 0.008313016034662724, "learning_rate": 0.0002, "loss": 0.6386253833770752, "mean_token_accuracy": 0.7408165112137794, "num_tokens": 10905152.0, "step": 291 }, { "entropy": 0.6477962657809258, "epoch": 1.8639999999999999, "grad_norm": 0.007996824570000172, "learning_rate": 0.0002, "loss": 0.649878740310669, "mean_token_accuracy": 0.7363680452108383, "num_tokens": 10942566.0, "step": 292 }, { "entropy": 0.6444478929042816, "epoch": 1.8704, "grad_norm": 0.009034682996571064, "learning_rate": 0.0002, "loss": 0.64991295337677, "mean_token_accuracy": 0.7348211482167244, "num_tokens": 10979522.0, "step": 293 }, { "entropy": 0.6329373270273209, "epoch": 1.8768, "grad_norm": 0.009291103109717369, "learning_rate": 0.0002, "loss": 0.6315436363220215, "mean_token_accuracy": 0.7441153600811958, "num_tokens": 11016799.0, "step": 294 }, { "entropy": 0.6502094119787216, "epoch": 1.8832, "grad_norm": 0.0096050426363945, "learning_rate": 0.0002, "loss": 0.6489418148994446, "mean_token_accuracy": 0.7356565669178963, "num_tokens": 11054518.0, "step": 295 }, { "entropy": 0.6323768645524979, "epoch": 1.8896, "grad_norm": 0.008002777583897114, "learning_rate": 0.0002, "loss": 0.635691225528717, "mean_token_accuracy": 0.7405551075935364, "num_tokens": 11091967.0, "step": 296 }, { "entropy": 0.6422302722930908, "epoch": 1.896, "grad_norm": 0.008403711952269077, "learning_rate": 0.0002, "loss": 0.6455032825469971, "mean_token_accuracy": 0.7383149340748787, "num_tokens": 11129384.0, "step": 297 }, { "entropy": 0.6316574737429619, "epoch": 1.9024, "grad_norm": 0.00967500451952219, "learning_rate": 0.0002, "loss": 0.6350202560424805, "mean_token_accuracy": 0.7421634197235107, "num_tokens": 11166669.0, "step": 298 }, { "entropy": 0.6459977030754089, "epoch": 1.9088, "grad_norm": 0.00876573659479618, "learning_rate": 0.0002, "loss": 0.6403264999389648, "mean_token_accuracy": 0.7382558658719063, "num_tokens": 11204332.0, "step": 299 }, { "entropy": 0.6415895000100136, "epoch": 1.9152, "grad_norm": 0.009217560291290283, "learning_rate": 0.0002, "loss": 0.6415034532546997, "mean_token_accuracy": 0.7386994808912277, "num_tokens": 11241726.0, "step": 300 }, { "entropy": 0.6311015710234642, "epoch": 1.9216, "grad_norm": 0.00828156340867281, "learning_rate": 0.0002, "loss": 0.630814790725708, "mean_token_accuracy": 0.7444434463977814, "num_tokens": 11279304.0, "step": 301 }, { "entropy": 0.6455347687005997, "epoch": 1.928, "grad_norm": 0.00847472995519638, "learning_rate": 0.0002, "loss": 0.6488364934921265, "mean_token_accuracy": 0.7379944175481796, "num_tokens": 11316642.0, "step": 302 }, { "entropy": 0.6381795853376389, "epoch": 1.9344000000000001, "grad_norm": 0.010508674196898937, "learning_rate": 0.0002, "loss": 0.6469117403030396, "mean_token_accuracy": 0.7371617555618286, "num_tokens": 11354142.0, "step": 303 }, { "entropy": 0.6340028718113899, "epoch": 1.9407999999999999, "grad_norm": 0.008417687378823757, "learning_rate": 0.0002, "loss": 0.638616681098938, "mean_token_accuracy": 0.7400232255458832, "num_tokens": 11391584.0, "step": 304 }, { "entropy": 0.641148068010807, "epoch": 1.9472, "grad_norm": 0.009189863689243793, "learning_rate": 0.0002, "loss": 0.6417672038078308, "mean_token_accuracy": 0.7394173890352249, "num_tokens": 11429141.0, "step": 305 }, { "entropy": 0.6361806094646454, "epoch": 1.9536, "grad_norm": 0.009170212782919407, "learning_rate": 0.0002, "loss": 0.6348021626472473, "mean_token_accuracy": 0.741854839026928, "num_tokens": 11466566.0, "step": 306 }, { "entropy": 0.6448198854923248, "epoch": 1.96, "grad_norm": 0.008513331413269043, "learning_rate": 0.0002, "loss": 0.6473972797393799, "mean_token_accuracy": 0.7364873364567757, "num_tokens": 11503681.0, "step": 307 }, { "entropy": 0.6346408724784851, "epoch": 1.9664000000000001, "grad_norm": 0.010691906325519085, "learning_rate": 0.0002, "loss": 0.6393898725509644, "mean_token_accuracy": 0.7428330779075623, "num_tokens": 11541361.0, "step": 308 }, { "entropy": 0.6447126045823097, "epoch": 1.9727999999999999, "grad_norm": 0.009089854545891285, "learning_rate": 0.0002, "loss": 0.6462785601615906, "mean_token_accuracy": 0.7361640483140945, "num_tokens": 11578943.0, "step": 309 }, { "entropy": 0.6443200558423996, "epoch": 1.9792, "grad_norm": 0.007877051830291748, "learning_rate": 0.0002, "loss": 0.6410749554634094, "mean_token_accuracy": 0.7393750101327896, "num_tokens": 11616900.0, "step": 310 }, { "entropy": 0.6526265293359756, "epoch": 1.9856, "grad_norm": 0.007553855888545513, "learning_rate": 0.0002, "loss": 0.6491004824638367, "mean_token_accuracy": 0.7368245124816895, "num_tokens": 11654118.0, "step": 311 }, { "entropy": 0.6361679136753082, "epoch": 1.992, "grad_norm": 0.0077677839435637, "learning_rate": 0.0002, "loss": 0.6400581002235413, "mean_token_accuracy": 0.7392396479845047, "num_tokens": 11691819.0, "step": 312 }, { "entropy": 0.6478787511587143, "epoch": 1.9984, "grad_norm": 0.008330225013196468, "learning_rate": 0.0002, "loss": 0.6550832390785217, "mean_token_accuracy": 0.7333075851202011, "num_tokens": 11729371.0, "step": 313 }, { "entropy": 0.647148609161377, "epoch": 2.0, "grad_norm": 0.014249460771679878, "learning_rate": 0.0002, "loss": 0.6511927843093872, "mean_token_accuracy": 0.7351100444793701, "num_tokens": 11738913.0, "step": 314 }, { "entropy": 0.6428509056568146, "epoch": 2.0064, "grad_norm": 0.012224607169628143, "learning_rate": 0.0002, "loss": 0.6413295865058899, "mean_token_accuracy": 0.7383991628885269, "num_tokens": 11776564.0, "step": 315 }, { "entropy": 0.6307617798447609, "epoch": 2.0128, "grad_norm": 0.00805046409368515, "learning_rate": 0.0002, "loss": 0.6318984031677246, "mean_token_accuracy": 0.7424051091074944, "num_tokens": 11813755.0, "step": 316 }, { "entropy": 0.6430513709783554, "epoch": 2.0192, "grad_norm": 0.007973214611411095, "learning_rate": 0.0002, "loss": 0.6426272392272949, "mean_token_accuracy": 0.7385435774922371, "num_tokens": 11851558.0, "step": 317 }, { "entropy": 0.6318764910101891, "epoch": 2.0256, "grad_norm": 0.012760069221258163, "learning_rate": 0.0002, "loss": 0.6337249875068665, "mean_token_accuracy": 0.7423495799303055, "num_tokens": 11889166.0, "step": 318 }, { "entropy": 0.655825637280941, "epoch": 2.032, "grad_norm": 0.008295831270515919, "learning_rate": 0.0002, "loss": 0.6574875712394714, "mean_token_accuracy": 0.7304191887378693, "num_tokens": 11926828.0, "step": 319 }, { "entropy": 0.646898128092289, "epoch": 2.0384, "grad_norm": 0.0076156072318553925, "learning_rate": 0.0002, "loss": 0.6442586183547974, "mean_token_accuracy": 0.7376453951001167, "num_tokens": 11964281.0, "step": 320 }, { "entropy": 0.6386341005563736, "epoch": 2.0448, "grad_norm": 0.008703756146132946, "learning_rate": 0.0002, "loss": 0.6401532888412476, "mean_token_accuracy": 0.7430068925023079, "num_tokens": 12001686.0, "step": 321 }, { "entropy": 0.6369054093956947, "epoch": 2.0512, "grad_norm": 0.008225949481129646, "learning_rate": 0.0002, "loss": 0.6394542455673218, "mean_token_accuracy": 0.7397433742880821, "num_tokens": 12039411.0, "step": 322 }, { "entropy": 0.6331326514482498, "epoch": 2.0576, "grad_norm": 0.009685281664133072, "learning_rate": 0.0002, "loss": 0.6398283839225769, "mean_token_accuracy": 0.7404422760009766, "num_tokens": 12076768.0, "step": 323 }, { "entropy": 0.6296347230672836, "epoch": 2.064, "grad_norm": 0.008879579603672028, "learning_rate": 0.0002, "loss": 0.632715106010437, "mean_token_accuracy": 0.7417664974927902, "num_tokens": 12114584.0, "step": 324 }, { "entropy": 0.6318413317203522, "epoch": 2.0704, "grad_norm": 0.008431381545960903, "learning_rate": 0.0002, "loss": 0.6331377029418945, "mean_token_accuracy": 0.7394522577524185, "num_tokens": 12152129.0, "step": 325 }, { "entropy": 0.6365228146314621, "epoch": 2.0768, "grad_norm": 0.008421050384640694, "learning_rate": 0.0002, "loss": 0.6375148296356201, "mean_token_accuracy": 0.7391103804111481, "num_tokens": 12189530.0, "step": 326 }, { "entropy": 0.6343080475926399, "epoch": 2.0832, "grad_norm": 0.008700543083250523, "learning_rate": 0.0002, "loss": 0.640760600566864, "mean_token_accuracy": 0.737753376364708, "num_tokens": 12227254.0, "step": 327 }, { "entropy": 0.6292807161808014, "epoch": 2.0896, "grad_norm": 0.008493369445204735, "learning_rate": 0.0002, "loss": 0.6337940692901611, "mean_token_accuracy": 0.7432547584176064, "num_tokens": 12264717.0, "step": 328 }, { "entropy": 0.6373203322291374, "epoch": 2.096, "grad_norm": 0.008298007771372795, "learning_rate": 0.0002, "loss": 0.6361969709396362, "mean_token_accuracy": 0.7403373941779137, "num_tokens": 12301926.0, "step": 329 }, { "entropy": 0.645341120660305, "epoch": 2.1024, "grad_norm": 0.009415465407073498, "learning_rate": 0.0002, "loss": 0.6422229409217834, "mean_token_accuracy": 0.7388109862804413, "num_tokens": 12339358.0, "step": 330 }, { "entropy": 0.6284746676683426, "epoch": 2.1088, "grad_norm": 0.00816258043050766, "learning_rate": 0.0002, "loss": 0.6270098090171814, "mean_token_accuracy": 0.7465712875127792, "num_tokens": 12376845.0, "step": 331 }, { "entropy": 0.618787370622158, "epoch": 2.1152, "grad_norm": 0.010069424286484718, "learning_rate": 0.0002, "loss": 0.6233252286911011, "mean_token_accuracy": 0.7466351315379143, "num_tokens": 12414270.0, "step": 332 }, { "entropy": 0.6204424351453781, "epoch": 2.1216, "grad_norm": 0.011632254347205162, "learning_rate": 0.0002, "loss": 0.6273159384727478, "mean_token_accuracy": 0.7449653670191765, "num_tokens": 12451814.0, "step": 333 }, { "entropy": 0.6244671940803528, "epoch": 2.128, "grad_norm": 0.007731855846941471, "learning_rate": 0.0002, "loss": 0.6259894371032715, "mean_token_accuracy": 0.7442785128951073, "num_tokens": 12489174.0, "step": 334 }, { "entropy": 0.6379582434892654, "epoch": 2.1344, "grad_norm": 0.009793682023882866, "learning_rate": 0.0002, "loss": 0.6348966360092163, "mean_token_accuracy": 0.740781731903553, "num_tokens": 12526495.0, "step": 335 }, { "entropy": 0.6337939351797104, "epoch": 2.1408, "grad_norm": 0.00962368305772543, "learning_rate": 0.0002, "loss": 0.6337376832962036, "mean_token_accuracy": 0.741876944899559, "num_tokens": 12563862.0, "step": 336 }, { "entropy": 0.6327385306358337, "epoch": 2.1471999999999998, "grad_norm": 0.008747846819460392, "learning_rate": 0.0002, "loss": 0.6306090354919434, "mean_token_accuracy": 0.7432660833001137, "num_tokens": 12601147.0, "step": 337 }, { "entropy": 0.6386691257357597, "epoch": 2.1536, "grad_norm": 0.008939294144511223, "learning_rate": 0.0002, "loss": 0.6422123908996582, "mean_token_accuracy": 0.7385012805461884, "num_tokens": 12638941.0, "step": 338 }, { "entropy": 0.6356615126132965, "epoch": 2.16, "grad_norm": 0.008577845059335232, "learning_rate": 0.0002, "loss": 0.6377971768379211, "mean_token_accuracy": 0.7411153167486191, "num_tokens": 12676252.0, "step": 339 }, { "entropy": 0.6395266354084015, "epoch": 2.1664, "grad_norm": 0.009049834683537483, "learning_rate": 0.0002, "loss": 0.6420882344245911, "mean_token_accuracy": 0.7383701205253601, "num_tokens": 12713835.0, "step": 340 }, { "entropy": 0.6292238682508469, "epoch": 2.1728, "grad_norm": 0.008495191112160683, "learning_rate": 0.0002, "loss": 0.6327275037765503, "mean_token_accuracy": 0.7408149838447571, "num_tokens": 12751620.0, "step": 341 }, { "entropy": 0.639611691236496, "epoch": 2.1792, "grad_norm": 0.009403538890182972, "learning_rate": 0.0002, "loss": 0.6445578336715698, "mean_token_accuracy": 0.7371161133050919, "num_tokens": 12789311.0, "step": 342 }, { "entropy": 0.6382555812597275, "epoch": 2.1856, "grad_norm": 0.008258577436208725, "learning_rate": 0.0002, "loss": 0.6395673751831055, "mean_token_accuracy": 0.7395190820097923, "num_tokens": 12826828.0, "step": 343 }, { "entropy": 0.6255771890282631, "epoch": 2.192, "grad_norm": 0.008409053087234497, "learning_rate": 0.0002, "loss": 0.6285756826400757, "mean_token_accuracy": 0.7443142682313919, "num_tokens": 12864340.0, "step": 344 }, { "entropy": 0.6310818865895271, "epoch": 2.1984, "grad_norm": 0.009435487911105156, "learning_rate": 0.0002, "loss": 0.6294571161270142, "mean_token_accuracy": 0.7434982731938362, "num_tokens": 12902046.0, "step": 345 }, { "entropy": 0.6311678513884544, "epoch": 2.2048, "grad_norm": 0.008755765855312347, "learning_rate": 0.0002, "loss": 0.6339205503463745, "mean_token_accuracy": 0.740614227950573, "num_tokens": 12939744.0, "step": 346 }, { "entropy": 0.6452009528875351, "epoch": 2.2112, "grad_norm": 0.008575056679546833, "learning_rate": 0.0002, "loss": 0.644209623336792, "mean_token_accuracy": 0.7392476424574852, "num_tokens": 12977341.0, "step": 347 }, { "entropy": 0.6338612660765648, "epoch": 2.2176, "grad_norm": 0.007798387669026852, "learning_rate": 0.0002, "loss": 0.6330971121788025, "mean_token_accuracy": 0.7440877333283424, "num_tokens": 13015002.0, "step": 348 }, { "entropy": 0.6385946869850159, "epoch": 2.224, "grad_norm": 0.009336304850876331, "learning_rate": 0.0002, "loss": 0.6359999179840088, "mean_token_accuracy": 0.741933673620224, "num_tokens": 13052683.0, "step": 349 }, { "entropy": 0.6185505017638206, "epoch": 2.2304, "grad_norm": 0.009118903428316116, "learning_rate": 0.0002, "loss": 0.6220842599868774, "mean_token_accuracy": 0.7472022995352745, "num_tokens": 13089828.0, "step": 350 }, { "entropy": 0.6268252283334732, "epoch": 2.2368, "grad_norm": 0.0092701381072402, "learning_rate": 0.0002, "loss": 0.6330834627151489, "mean_token_accuracy": 0.7435643449425697, "num_tokens": 13127264.0, "step": 351 }, { "entropy": 0.6323676556348801, "epoch": 2.2432, "grad_norm": 0.010936826467514038, "learning_rate": 0.0002, "loss": 0.6385864615440369, "mean_token_accuracy": 0.7403518706560135, "num_tokens": 13164850.0, "step": 352 }, { "entropy": 0.6403925344347954, "epoch": 2.2496, "grad_norm": 0.009062140248715878, "learning_rate": 0.0002, "loss": 0.6446559429168701, "mean_token_accuracy": 0.737325981259346, "num_tokens": 13202818.0, "step": 353 }, { "entropy": 0.6653745025396347, "epoch": 2.2560000000000002, "grad_norm": 0.008989578112959862, "learning_rate": 0.0002, "loss": 0.6635587215423584, "mean_token_accuracy": 0.7302659377455711, "num_tokens": 13240741.0, "step": 354 }, { "entropy": 0.6176604405045509, "epoch": 2.2624, "grad_norm": 0.011122855357825756, "learning_rate": 0.0002, "loss": 0.6100451350212097, "mean_token_accuracy": 0.7515672147274017, "num_tokens": 13278017.0, "step": 355 }, { "entropy": 0.6418539881706238, "epoch": 2.2688, "grad_norm": 0.009430945850908756, "learning_rate": 0.0002, "loss": 0.6456764340400696, "mean_token_accuracy": 0.7369844615459442, "num_tokens": 13315575.0, "step": 356 }, { "entropy": 0.6377789452672005, "epoch": 2.2752, "grad_norm": 0.01120819989591837, "learning_rate": 0.0002, "loss": 0.6447769999504089, "mean_token_accuracy": 0.7389207035303116, "num_tokens": 13353349.0, "step": 357 }, { "entropy": 0.6309510096907616, "epoch": 2.2816, "grad_norm": 0.01070281770080328, "learning_rate": 0.0002, "loss": 0.639892578125, "mean_token_accuracy": 0.7402263358235359, "num_tokens": 13390831.0, "step": 358 }, { "entropy": 0.6376594752073288, "epoch": 2.288, "grad_norm": 0.008750580251216888, "learning_rate": 0.0002, "loss": 0.6361696720123291, "mean_token_accuracy": 0.7411545366048813, "num_tokens": 13428400.0, "step": 359 }, { "entropy": 0.6379339694976807, "epoch": 2.2944, "grad_norm": 0.01135624572634697, "learning_rate": 0.0002, "loss": 0.6322520971298218, "mean_token_accuracy": 0.7416113168001175, "num_tokens": 13465745.0, "step": 360 }, { "entropy": 0.6344308853149414, "epoch": 2.3008, "grad_norm": 0.008200406096875668, "learning_rate": 0.0002, "loss": 0.6279163360595703, "mean_token_accuracy": 0.7453168705105782, "num_tokens": 13503838.0, "step": 361 }, { "entropy": 0.6380530670285225, "epoch": 2.3072, "grad_norm": 0.011549552902579308, "learning_rate": 0.0002, "loss": 0.6419570446014404, "mean_token_accuracy": 0.7404475137591362, "num_tokens": 13541929.0, "step": 362 }, { "entropy": 0.6338977962732315, "epoch": 2.3136, "grad_norm": 0.009041829034686089, "learning_rate": 0.0002, "loss": 0.6397197842597961, "mean_token_accuracy": 0.7420290112495422, "num_tokens": 13579161.0, "step": 363 }, { "entropy": 0.6449583545327187, "epoch": 2.32, "grad_norm": 0.009089567698538303, "learning_rate": 0.0002, "loss": 0.6466807126998901, "mean_token_accuracy": 0.7365088015794754, "num_tokens": 13616744.0, "step": 364 }, { "entropy": 0.642234593629837, "epoch": 2.3264, "grad_norm": 0.009368225000798702, "learning_rate": 0.0002, "loss": 0.6429442167282104, "mean_token_accuracy": 0.7369751259684563, "num_tokens": 13654392.0, "step": 365 }, { "entropy": 0.6480699181556702, "epoch": 2.3327999999999998, "grad_norm": 0.008836016058921814, "learning_rate": 0.0002, "loss": 0.6484840512275696, "mean_token_accuracy": 0.7375075444579124, "num_tokens": 13691824.0, "step": 366 }, { "entropy": 0.6319603100419044, "epoch": 2.3392, "grad_norm": 0.008661167696118355, "learning_rate": 0.0002, "loss": 0.6352815628051758, "mean_token_accuracy": 0.7423906549811363, "num_tokens": 13729838.0, "step": 367 }, { "entropy": 0.6437906175851822, "epoch": 2.3456, "grad_norm": 0.009302763268351555, "learning_rate": 0.0002, "loss": 0.6494675874710083, "mean_token_accuracy": 0.7354337424039841, "num_tokens": 13767404.0, "step": 368 }, { "entropy": 0.6363216936588287, "epoch": 2.352, "grad_norm": 0.009825549088418484, "learning_rate": 0.0002, "loss": 0.640619158744812, "mean_token_accuracy": 0.7399841696023941, "num_tokens": 13805320.0, "step": 369 }, { "entropy": 0.6430623680353165, "epoch": 2.3584, "grad_norm": 0.008325744420289993, "learning_rate": 0.0002, "loss": 0.6433535814285278, "mean_token_accuracy": 0.7388209700584412, "num_tokens": 13843211.0, "step": 370 }, { "entropy": 0.6459617763757706, "epoch": 2.3648, "grad_norm": 0.009273998439311981, "learning_rate": 0.0002, "loss": 0.6418501138687134, "mean_token_accuracy": 0.7380605787038803, "num_tokens": 13880860.0, "step": 371 }, { "entropy": 0.6389967799186707, "epoch": 2.3712, "grad_norm": 0.009662107564508915, "learning_rate": 0.0002, "loss": 0.6336321830749512, "mean_token_accuracy": 0.7438643798232079, "num_tokens": 13918761.0, "step": 372 }, { "entropy": 0.638178676366806, "epoch": 2.3776, "grad_norm": 0.009039600379765034, "learning_rate": 0.0002, "loss": 0.642177164554596, "mean_token_accuracy": 0.7402292564511299, "num_tokens": 13956629.0, "step": 373 }, { "entropy": 0.6183496937155724, "epoch": 2.384, "grad_norm": 0.00997725035995245, "learning_rate": 0.0002, "loss": 0.6257633566856384, "mean_token_accuracy": 0.7432282716035843, "num_tokens": 13993705.0, "step": 374 }, { "entropy": 0.6249210014939308, "epoch": 2.3904, "grad_norm": 0.007910847663879395, "learning_rate": 0.0002, "loss": 0.625819981098175, "mean_token_accuracy": 0.7441049888730049, "num_tokens": 14031321.0, "step": 375 }, { "entropy": 0.6479079499840736, "epoch": 2.3968, "grad_norm": 0.00891756173223257, "learning_rate": 0.0002, "loss": 0.6501407623291016, "mean_token_accuracy": 0.7355809286236763, "num_tokens": 14069143.0, "step": 376 }, { "entropy": 0.6394218653440475, "epoch": 2.4032, "grad_norm": 0.00850125402212143, "learning_rate": 0.0002, "loss": 0.6394637823104858, "mean_token_accuracy": 0.7385919019579887, "num_tokens": 14106711.0, "step": 377 }, { "entropy": 0.6354732289910316, "epoch": 2.4096, "grad_norm": 0.008283271454274654, "learning_rate": 0.0002, "loss": 0.6353892087936401, "mean_token_accuracy": 0.7419078797101974, "num_tokens": 14144364.0, "step": 378 }, { "entropy": 0.6316136568784714, "epoch": 2.416, "grad_norm": 0.009771537035703659, "learning_rate": 0.0002, "loss": 0.6347823143005371, "mean_token_accuracy": 0.7427188232541084, "num_tokens": 14181995.0, "step": 379 }, { "entropy": 0.6375484988093376, "epoch": 2.4224, "grad_norm": 0.008568905293941498, "learning_rate": 0.0002, "loss": 0.6410992741584778, "mean_token_accuracy": 0.7378129065036774, "num_tokens": 14219687.0, "step": 380 }, { "entropy": 0.6333465948700905, "epoch": 2.4288, "grad_norm": 0.007412395905703306, "learning_rate": 0.0002, "loss": 0.6309605836868286, "mean_token_accuracy": 0.7434795945882797, "num_tokens": 14257055.0, "step": 381 }, { "entropy": 0.6269642487168312, "epoch": 2.4352, "grad_norm": 0.008765887469053268, "learning_rate": 0.0002, "loss": 0.6296891570091248, "mean_token_accuracy": 0.7441322207450867, "num_tokens": 14294332.0, "step": 382 }, { "entropy": 0.6352812573313713, "epoch": 2.4416, "grad_norm": 0.009595113806426525, "learning_rate": 0.0002, "loss": 0.6348291039466858, "mean_token_accuracy": 0.7420725524425507, "num_tokens": 14331865.0, "step": 383 }, { "entropy": 0.6441971585154533, "epoch": 2.448, "grad_norm": 0.008584806695580482, "learning_rate": 0.0002, "loss": 0.6498426198959351, "mean_token_accuracy": 0.7357524335384369, "num_tokens": 14369788.0, "step": 384 }, { "entropy": 0.6287561655044556, "epoch": 2.4544, "grad_norm": 0.008044449612498283, "learning_rate": 0.0002, "loss": 0.6315615177154541, "mean_token_accuracy": 0.7426558956503868, "num_tokens": 14407482.0, "step": 385 }, { "entropy": 0.6339204907417297, "epoch": 2.4608, "grad_norm": 0.007299972232431173, "learning_rate": 0.0002, "loss": 0.6352561116218567, "mean_token_accuracy": 0.74134461581707, "num_tokens": 14445123.0, "step": 386 }, { "entropy": 0.6295419782400131, "epoch": 2.4672, "grad_norm": 0.008794458582997322, "learning_rate": 0.0002, "loss": 0.6306071281433105, "mean_token_accuracy": 0.7435100376605988, "num_tokens": 14482719.0, "step": 387 }, { "entropy": 0.622240737080574, "epoch": 2.4736000000000002, "grad_norm": 0.008617876097559929, "learning_rate": 0.0002, "loss": 0.6234915256500244, "mean_token_accuracy": 0.7468436509370804, "num_tokens": 14520261.0, "step": 388 }, { "entropy": 0.6362800300121307, "epoch": 2.48, "grad_norm": 0.008423526771366596, "learning_rate": 0.0002, "loss": 0.641099214553833, "mean_token_accuracy": 0.7397967800498009, "num_tokens": 14557676.0, "step": 389 }, { "entropy": 0.6532713696360588, "epoch": 2.4864, "grad_norm": 0.008641418069601059, "learning_rate": 0.0002, "loss": 0.6506437063217163, "mean_token_accuracy": 0.7350734695792198, "num_tokens": 14595548.0, "step": 390 }, { "entropy": 0.6302274093031883, "epoch": 2.4928, "grad_norm": 0.00921640731394291, "learning_rate": 0.0002, "loss": 0.6322726607322693, "mean_token_accuracy": 0.7424062266945839, "num_tokens": 14632684.0, "step": 391 }, { "entropy": 0.6293173208832741, "epoch": 2.4992, "grad_norm": 0.008461368270218372, "learning_rate": 0.0002, "loss": 0.6278185844421387, "mean_token_accuracy": 0.744764506816864, "num_tokens": 14670523.0, "step": 392 }, { "entropy": 0.6276180446147919, "epoch": 2.5056000000000003, "grad_norm": 0.008572320453822613, "learning_rate": 0.0002, "loss": 0.631564736366272, "mean_token_accuracy": 0.7426915839314461, "num_tokens": 14708031.0, "step": 393 }, { "entropy": 0.6308008059859276, "epoch": 2.512, "grad_norm": 0.008926871232688427, "learning_rate": 0.0002, "loss": 0.633114755153656, "mean_token_accuracy": 0.7416298165917397, "num_tokens": 14745679.0, "step": 394 }, { "entropy": 0.6268336623907089, "epoch": 2.5183999999999997, "grad_norm": 0.008902951143682003, "learning_rate": 0.0002, "loss": 0.627051830291748, "mean_token_accuracy": 0.7439748197793961, "num_tokens": 14783397.0, "step": 395 }, { "entropy": 0.634651429951191, "epoch": 2.5248, "grad_norm": 0.00856532622128725, "learning_rate": 0.0002, "loss": 0.6363992691040039, "mean_token_accuracy": 0.7408565506339073, "num_tokens": 14820870.0, "step": 396 }, { "entropy": 0.6315286681056023, "epoch": 2.5312, "grad_norm": 0.009570743888616562, "learning_rate": 0.0002, "loss": 0.6403943300247192, "mean_token_accuracy": 0.7384237721562386, "num_tokens": 14858066.0, "step": 397 }, { "entropy": 0.6313930228352547, "epoch": 2.5376, "grad_norm": 0.007634198758751154, "learning_rate": 0.0002, "loss": 0.63489830493927, "mean_token_accuracy": 0.740663692355156, "num_tokens": 14895686.0, "step": 398 }, { "entropy": 0.6275153756141663, "epoch": 2.544, "grad_norm": 0.00890920590609312, "learning_rate": 0.0002, "loss": 0.6264928579330444, "mean_token_accuracy": 0.7460935115814209, "num_tokens": 14933293.0, "step": 399 }, { "entropy": 0.6245445236563683, "epoch": 2.5504, "grad_norm": 0.009081481955945492, "learning_rate": 0.0002, "loss": 0.6231961250305176, "mean_token_accuracy": 0.7458623945713043, "num_tokens": 14970626.0, "step": 400 }, { "entropy": 0.6321042701601982, "epoch": 2.5568, "grad_norm": 0.01011180505156517, "learning_rate": 0.0002, "loss": 0.6376926898956299, "mean_token_accuracy": 0.7382810115814209, "num_tokens": 15008147.0, "step": 401 }, { "entropy": 0.6281652376055717, "epoch": 2.5632, "grad_norm": 0.008269083686172962, "learning_rate": 0.0002, "loss": 0.6288952231407166, "mean_token_accuracy": 0.7468898370862007, "num_tokens": 15045200.0, "step": 402 }, { "entropy": 0.6325756087899208, "epoch": 2.5696, "grad_norm": 0.009284023195505142, "learning_rate": 0.0002, "loss": 0.6372162103652954, "mean_token_accuracy": 0.7393135726451874, "num_tokens": 15082728.0, "step": 403 }, { "entropy": 0.6326915472745895, "epoch": 2.576, "grad_norm": 0.008368260227143764, "learning_rate": 0.0002, "loss": 0.6289712190628052, "mean_token_accuracy": 0.7438352182507515, "num_tokens": 15120176.0, "step": 404 }, { "entropy": 0.6458227932453156, "epoch": 2.5824, "grad_norm": 0.008600444532930851, "learning_rate": 0.0002, "loss": 0.6437180042266846, "mean_token_accuracy": 0.7360183447599411, "num_tokens": 15157874.0, "step": 405 }, { "entropy": 0.6378503367304802, "epoch": 2.5888, "grad_norm": 0.008291950449347496, "learning_rate": 0.0002, "loss": 0.6357482075691223, "mean_token_accuracy": 0.7405651807785034, "num_tokens": 15195757.0, "step": 406 }, { "entropy": 0.6248553469777107, "epoch": 2.5952, "grad_norm": 0.009239988401532173, "learning_rate": 0.0002, "loss": 0.6330691576004028, "mean_token_accuracy": 0.7403087541460991, "num_tokens": 15232888.0, "step": 407 }, { "entropy": 0.6266547441482544, "epoch": 2.6016, "grad_norm": 0.008323184214532375, "learning_rate": 0.0002, "loss": 0.6295891404151917, "mean_token_accuracy": 0.7445848137140274, "num_tokens": 15270471.0, "step": 408 }, { "entropy": 0.6273859366774559, "epoch": 2.608, "grad_norm": 0.008808370679616928, "learning_rate": 0.0002, "loss": 0.6343215107917786, "mean_token_accuracy": 0.7426254749298096, "num_tokens": 15307996.0, "step": 409 }, { "entropy": 0.649120107293129, "epoch": 2.6144, "grad_norm": 0.008977086283266544, "learning_rate": 0.0002, "loss": 0.6475695371627808, "mean_token_accuracy": 0.7367869392037392, "num_tokens": 15345526.0, "step": 410 }, { "entropy": 0.6383312568068504, "epoch": 2.6208, "grad_norm": 0.009833469986915588, "learning_rate": 0.0002, "loss": 0.6327086091041565, "mean_token_accuracy": 0.7418203428387642, "num_tokens": 15382760.0, "step": 411 }, { "entropy": 0.6142470389604568, "epoch": 2.6272, "grad_norm": 0.007820895873010159, "learning_rate": 0.0002, "loss": 0.614084780216217, "mean_token_accuracy": 0.7492156624794006, "num_tokens": 15420133.0, "step": 412 }, { "entropy": 0.6232952103018761, "epoch": 2.6336, "grad_norm": 0.010564403608441353, "learning_rate": 0.0002, "loss": 0.6333082318305969, "mean_token_accuracy": 0.7423960939049721, "num_tokens": 15457883.0, "step": 413 }, { "entropy": 0.6330999732017517, "epoch": 2.64, "grad_norm": 0.009710205718874931, "learning_rate": 0.0002, "loss": 0.6388413906097412, "mean_token_accuracy": 0.7408091574907303, "num_tokens": 15495425.0, "step": 414 }, { "entropy": 0.6545180752873421, "epoch": 2.6464, "grad_norm": 0.00887272972613573, "learning_rate": 0.0002, "loss": 0.6515014171600342, "mean_token_accuracy": 0.7343106046319008, "num_tokens": 15532965.0, "step": 415 }, { "entropy": 0.6397780776023865, "epoch": 2.6528, "grad_norm": 0.008293447084724903, "learning_rate": 0.0002, "loss": 0.6368398666381836, "mean_token_accuracy": 0.7398713007569313, "num_tokens": 15570436.0, "step": 416 }, { "entropy": 0.6291993260383606, "epoch": 2.6592000000000002, "grad_norm": 0.008709436282515526, "learning_rate": 0.0002, "loss": 0.6272790431976318, "mean_token_accuracy": 0.745321199297905, "num_tokens": 15607874.0, "step": 417 }, { "entropy": 0.648408018052578, "epoch": 2.6656, "grad_norm": 0.009814375080168247, "learning_rate": 0.0002, "loss": 0.6569237112998962, "mean_token_accuracy": 0.7306895926594734, "num_tokens": 15645823.0, "step": 418 }, { "entropy": 0.6370497196912766, "epoch": 2.672, "grad_norm": 0.00858649704605341, "learning_rate": 0.0002, "loss": 0.6417921781539917, "mean_token_accuracy": 0.738996684551239, "num_tokens": 15683110.0, "step": 419 }, { "entropy": 0.6393727734684944, "epoch": 2.6784, "grad_norm": 0.009777788072824478, "learning_rate": 0.0002, "loss": 0.6401950120925903, "mean_token_accuracy": 0.7391480058431625, "num_tokens": 15720611.0, "step": 420 }, { "entropy": 0.63716159760952, "epoch": 2.6848, "grad_norm": 0.008626547642052174, "learning_rate": 0.0002, "loss": 0.6399793028831482, "mean_token_accuracy": 0.739508643746376, "num_tokens": 15758221.0, "step": 421 }, { "entropy": 0.6414335444569588, "epoch": 2.6912000000000003, "grad_norm": 0.009168457239866257, "learning_rate": 0.0002, "loss": 0.6497803926467896, "mean_token_accuracy": 0.7342201620340347, "num_tokens": 15795862.0, "step": 422 }, { "entropy": 0.6342490315437317, "epoch": 2.6976, "grad_norm": 0.009793863631784916, "learning_rate": 0.0002, "loss": 0.6359165906906128, "mean_token_accuracy": 0.7401581779122353, "num_tokens": 15833350.0, "step": 423 }, { "entropy": 0.6518041715025902, "epoch": 2.7039999999999997, "grad_norm": 0.0076965210027992725, "learning_rate": 0.0002, "loss": 0.649188756942749, "mean_token_accuracy": 0.735841915011406, "num_tokens": 15871335.0, "step": 424 }, { "entropy": 0.6324848383665085, "epoch": 2.7104, "grad_norm": 0.007825566455721855, "learning_rate": 0.0002, "loss": 0.6314542293548584, "mean_token_accuracy": 0.7424084842205048, "num_tokens": 15909163.0, "step": 425 }, { "entropy": 0.6271793767809868, "epoch": 2.7168, "grad_norm": 0.007992296479642391, "learning_rate": 0.0002, "loss": 0.6311610341072083, "mean_token_accuracy": 0.7418703660368919, "num_tokens": 15946937.0, "step": 426 }, { "entropy": 0.6191146075725555, "epoch": 2.7232, "grad_norm": 0.007840313948690891, "learning_rate": 0.0002, "loss": 0.6227446794509888, "mean_token_accuracy": 0.7470360621809959, "num_tokens": 15984420.0, "step": 427 }, { "entropy": 0.6226735487580299, "epoch": 2.7296, "grad_norm": 0.007951436564326286, "learning_rate": 0.0002, "loss": 0.6275327205657959, "mean_token_accuracy": 0.7467052638530731, "num_tokens": 16021985.0, "step": 428 }, { "entropy": 0.6366565078496933, "epoch": 2.7359999999999998, "grad_norm": 0.007951410487294197, "learning_rate": 0.0002, "loss": 0.6385185122489929, "mean_token_accuracy": 0.7392742782831192, "num_tokens": 16059718.0, "step": 429 }, { "entropy": 0.6241059601306915, "epoch": 2.7424, "grad_norm": 0.008495664224028587, "learning_rate": 0.0002, "loss": 0.6223422288894653, "mean_token_accuracy": 0.7480814754962921, "num_tokens": 16096969.0, "step": 430 }, { "entropy": 0.6395189017057419, "epoch": 2.7488, "grad_norm": 0.008117246441543102, "learning_rate": 0.0002, "loss": 0.6383851766586304, "mean_token_accuracy": 0.7399205639958382, "num_tokens": 16135311.0, "step": 431 }, { "entropy": 0.6342849209904671, "epoch": 2.7552, "grad_norm": 0.007573962211608887, "learning_rate": 0.0002, "loss": 0.6357378959655762, "mean_token_accuracy": 0.7413295134902, "num_tokens": 16173264.0, "step": 432 }, { "entropy": 0.6290313079953194, "epoch": 2.7616, "grad_norm": 0.00819240789860487, "learning_rate": 0.0002, "loss": 0.6312831044197083, "mean_token_accuracy": 0.7436259835958481, "num_tokens": 16210940.0, "step": 433 }, { "entropy": 0.6433441936969757, "epoch": 2.768, "grad_norm": 0.00860763993114233, "learning_rate": 0.0002, "loss": 0.6448662877082825, "mean_token_accuracy": 0.7353287860751152, "num_tokens": 16248287.0, "step": 434 }, { "entropy": 0.6330644562840462, "epoch": 2.7744, "grad_norm": 0.0077530574053525925, "learning_rate": 0.0002, "loss": 0.6352605819702148, "mean_token_accuracy": 0.7418182790279388, "num_tokens": 16285750.0, "step": 435 }, { "entropy": 0.6248625069856644, "epoch": 2.7808, "grad_norm": 0.007953410036861897, "learning_rate": 0.0002, "loss": 0.6288837790489197, "mean_token_accuracy": 0.7424777820706367, "num_tokens": 16322871.0, "step": 436 }, { "entropy": 0.6338153034448624, "epoch": 2.7872, "grad_norm": 0.008173540234565735, "learning_rate": 0.0002, "loss": 0.6316856145858765, "mean_token_accuracy": 0.743153415620327, "num_tokens": 16360741.0, "step": 437 }, { "entropy": 0.6180099546909332, "epoch": 2.7936, "grad_norm": 0.008011853322386742, "learning_rate": 0.0002, "loss": 0.6195465922355652, "mean_token_accuracy": 0.7491164207458496, "num_tokens": 16398052.0, "step": 438 }, { "entropy": 0.6288798898458481, "epoch": 2.8, "grad_norm": 0.008486307226121426, "learning_rate": 0.0002, "loss": 0.6308120489120483, "mean_token_accuracy": 0.7431682348251343, "num_tokens": 16435504.0, "step": 439 }, { "entropy": 0.6349303498864174, "epoch": 2.8064, "grad_norm": 0.009010681882500648, "learning_rate": 0.0002, "loss": 0.632607102394104, "mean_token_accuracy": 0.7425792217254639, "num_tokens": 16473212.0, "step": 440 }, { "entropy": 0.630001574754715, "epoch": 2.8128, "grad_norm": 0.008531573228538036, "learning_rate": 0.0002, "loss": 0.6290241479873657, "mean_token_accuracy": 0.7448351979255676, "num_tokens": 16510183.0, "step": 441 }, { "entropy": 0.6317692324519157, "epoch": 2.8192, "grad_norm": 0.008379535749554634, "learning_rate": 0.0002, "loss": 0.6360982656478882, "mean_token_accuracy": 0.7403805702924728, "num_tokens": 16547649.0, "step": 442 }, { "entropy": 0.6221532076597214, "epoch": 2.8256, "grad_norm": 0.00981364119797945, "learning_rate": 0.0002, "loss": 0.6305652856826782, "mean_token_accuracy": 0.7410502806305885, "num_tokens": 16584772.0, "step": 443 }, { "entropy": 0.6281775683164597, "epoch": 2.832, "grad_norm": 0.009363848716020584, "learning_rate": 0.0002, "loss": 0.6325273513793945, "mean_token_accuracy": 0.7412790656089783, "num_tokens": 16622377.0, "step": 444 }, { "entropy": 0.6282860860228539, "epoch": 2.8384, "grad_norm": 0.008815777488052845, "learning_rate": 0.0002, "loss": 0.6224972009658813, "mean_token_accuracy": 0.7473303973674774, "num_tokens": 16659850.0, "step": 445 }, { "entropy": 0.6256547048687935, "epoch": 2.8448, "grad_norm": 0.008997517637908459, "learning_rate": 0.0002, "loss": 0.6249480247497559, "mean_token_accuracy": 0.744784526526928, "num_tokens": 16697507.0, "step": 446 }, { "entropy": 0.6432123258709908, "epoch": 2.8512, "grad_norm": 0.007546784356236458, "learning_rate": 0.0002, "loss": 0.6468585133552551, "mean_token_accuracy": 0.7387454062700272, "num_tokens": 16735166.0, "step": 447 }, { "entropy": 0.6291612312197685, "epoch": 2.8576, "grad_norm": 0.008677622303366661, "learning_rate": 0.0002, "loss": 0.6363067030906677, "mean_token_accuracy": 0.7402229011058807, "num_tokens": 16772700.0, "step": 448 }, { "entropy": 0.6394010931253433, "epoch": 2.864, "grad_norm": 0.008233144879341125, "learning_rate": 0.0002, "loss": 0.6435496807098389, "mean_token_accuracy": 0.7371494546532631, "num_tokens": 16810206.0, "step": 449 }, { "entropy": 0.6323223188519478, "epoch": 2.8704, "grad_norm": 0.009190903976559639, "learning_rate": 0.0002, "loss": 0.6313977837562561, "mean_token_accuracy": 0.74195995926857, "num_tokens": 16847440.0, "step": 450 }, { "entropy": 0.6317964419722557, "epoch": 2.8768000000000002, "grad_norm": 0.008045881986618042, "learning_rate": 0.0002, "loss": 0.6350542306900024, "mean_token_accuracy": 0.7399737685918808, "num_tokens": 16884842.0, "step": 451 }, { "entropy": 0.6307216063141823, "epoch": 2.8832, "grad_norm": 0.008613558486104012, "learning_rate": 0.0002, "loss": 0.6330459117889404, "mean_token_accuracy": 0.7425104603171349, "num_tokens": 16922153.0, "step": 452 }, { "entropy": 0.6381876915693283, "epoch": 2.8895999999999997, "grad_norm": 0.008792484179139137, "learning_rate": 0.0002, "loss": 0.6396152973175049, "mean_token_accuracy": 0.7395381852984428, "num_tokens": 16959837.0, "step": 453 }, { "entropy": 0.6402597278356552, "epoch": 2.896, "grad_norm": 0.008886914700269699, "learning_rate": 0.0002, "loss": 0.6391183137893677, "mean_token_accuracy": 0.7400619834661484, "num_tokens": 16997252.0, "step": 454 }, { "entropy": 0.6395518109202385, "epoch": 2.9024, "grad_norm": 0.008145366795361042, "learning_rate": 0.0002, "loss": 0.6410524845123291, "mean_token_accuracy": 0.7384562343358994, "num_tokens": 17034792.0, "step": 455 }, { "entropy": 0.6335340291261673, "epoch": 2.9088000000000003, "grad_norm": 0.008513481356203556, "learning_rate": 0.0002, "loss": 0.6360284686088562, "mean_token_accuracy": 0.7419657409191132, "num_tokens": 17072806.0, "step": 456 }, { "entropy": 0.6339850574731827, "epoch": 2.9152, "grad_norm": 0.00826951116323471, "learning_rate": 0.0002, "loss": 0.6338396668434143, "mean_token_accuracy": 0.7435676008462906, "num_tokens": 17110256.0, "step": 457 }, { "entropy": 0.6330336853861809, "epoch": 2.9215999999999998, "grad_norm": 0.008118857629597187, "learning_rate": 0.0002, "loss": 0.6347401738166809, "mean_token_accuracy": 0.7419733926653862, "num_tokens": 17147669.0, "step": 458 }, { "entropy": 0.6518657803535461, "epoch": 2.928, "grad_norm": 0.008373484946787357, "learning_rate": 0.0002, "loss": 0.6521078944206238, "mean_token_accuracy": 0.7351536229252815, "num_tokens": 17185406.0, "step": 459 }, { "entropy": 0.6362840831279755, "epoch": 2.9344, "grad_norm": 0.00781342200934887, "learning_rate": 0.0002, "loss": 0.6393336057662964, "mean_token_accuracy": 0.7391062676906586, "num_tokens": 17223104.0, "step": 460 }, { "entropy": 0.6365083158016205, "epoch": 2.9408, "grad_norm": 0.010520093142986298, "learning_rate": 0.0002, "loss": 0.643227219581604, "mean_token_accuracy": 0.7367514818906784, "num_tokens": 17260499.0, "step": 461 }, { "entropy": 0.6365673765540123, "epoch": 2.9472, "grad_norm": 0.008144881576299667, "learning_rate": 0.0002, "loss": 0.6345622539520264, "mean_token_accuracy": 0.7417429983615875, "num_tokens": 17298154.0, "step": 462 }, { "entropy": 0.6422977894544601, "epoch": 2.9536, "grad_norm": 0.007375301793217659, "learning_rate": 0.0002, "loss": 0.6420764923095703, "mean_token_accuracy": 0.737017072737217, "num_tokens": 17336075.0, "step": 463 }, { "entropy": 0.6339726597070694, "epoch": 2.96, "grad_norm": 0.008432124741375446, "learning_rate": 0.0002, "loss": 0.6357682347297668, "mean_token_accuracy": 0.742248572409153, "num_tokens": 17373430.0, "step": 464 }, { "entropy": 0.6369189694523811, "epoch": 2.9664, "grad_norm": 0.008471203036606312, "learning_rate": 0.0002, "loss": 0.6386595964431763, "mean_token_accuracy": 0.7397382780909538, "num_tokens": 17411298.0, "step": 465 }, { "entropy": 0.6291254833340645, "epoch": 2.9728, "grad_norm": 0.007794877514243126, "learning_rate": 0.0002, "loss": 0.6330430507659912, "mean_token_accuracy": 0.743395060300827, "num_tokens": 17448723.0, "step": 466 }, { "entropy": 0.6243666335940361, "epoch": 2.9792, "grad_norm": 0.008405648171901703, "learning_rate": 0.0002, "loss": 0.6291847229003906, "mean_token_accuracy": 0.7437793165445328, "num_tokens": 17486207.0, "step": 467 }, { "entropy": 0.6350819692015648, "epoch": 2.9856, "grad_norm": 0.008273884654045105, "learning_rate": 0.0002, "loss": 0.6370283365249634, "mean_token_accuracy": 0.7423520013689995, "num_tokens": 17524019.0, "step": 468 }, { "entropy": 0.6391937509179115, "epoch": 2.992, "grad_norm": 0.008686189539730549, "learning_rate": 0.0002, "loss": 0.6426953077316284, "mean_token_accuracy": 0.7379648461937904, "num_tokens": 17561604.0, "step": 469 }, { "entropy": 0.6394234076142311, "epoch": 2.9984, "grad_norm": 0.008572033606469631, "learning_rate": 0.0002, "loss": 0.6405370235443115, "mean_token_accuracy": 0.7394323572516441, "num_tokens": 17599047.0, "step": 470 }, { "entropy": 0.646001398563385, "epoch": 3.0, "grad_norm": 0.016055934131145477, "learning_rate": 0.0002, "loss": 0.654330313205719, "mean_token_accuracy": 0.7357074916362762, "num_tokens": 17608447.0, "step": 471 }, { "entropy": 0.6399871557950974, "epoch": 3.0064, "grad_norm": 0.010128894820809364, "learning_rate": 0.0002, "loss": 0.630492091178894, "mean_token_accuracy": 0.7438428327441216, "num_tokens": 17646580.0, "step": 472 }, { "entropy": 0.6400877311825752, "epoch": 3.0128, "grad_norm": 0.0109670115634799, "learning_rate": 0.0002, "loss": 0.6348856687545776, "mean_token_accuracy": 0.7409028187394142, "num_tokens": 17684203.0, "step": 473 }, { "entropy": 0.6349283009767532, "epoch": 3.0192, "grad_norm": 0.010457641445100307, "learning_rate": 0.0002, "loss": 0.6400600671768188, "mean_token_accuracy": 0.7396369203925133, "num_tokens": 17721781.0, "step": 474 }, { "entropy": 0.6234990581870079, "epoch": 3.0256, "grad_norm": 0.01080863457173109, "learning_rate": 0.0002, "loss": 0.6308765411376953, "mean_token_accuracy": 0.7440793961286545, "num_tokens": 17759054.0, "step": 475 }, { "entropy": 0.6226209849119186, "epoch": 3.032, "grad_norm": 0.010244046337902546, "learning_rate": 0.0002, "loss": 0.6284743547439575, "mean_token_accuracy": 0.7413820326328278, "num_tokens": 17796583.0, "step": 476 }, { "entropy": 0.626485787332058, "epoch": 3.0384, "grad_norm": 0.00895832572132349, "learning_rate": 0.0002, "loss": 0.6250468492507935, "mean_token_accuracy": 0.7454337328672409, "num_tokens": 17833917.0, "step": 477 }, { "entropy": 0.6430812701582909, "epoch": 3.0448, "grad_norm": 0.011450681835412979, "learning_rate": 0.0002, "loss": 0.636460542678833, "mean_token_accuracy": 0.737629309296608, "num_tokens": 17871185.0, "step": 478 }, { "entropy": 0.6313450038433075, "epoch": 3.0512, "grad_norm": 0.010822657495737076, "learning_rate": 0.0002, "loss": 0.6283341646194458, "mean_token_accuracy": 0.7447119951248169, "num_tokens": 17909021.0, "step": 479 }, { "entropy": 0.616793729364872, "epoch": 3.0576, "grad_norm": 0.012827937491238117, "learning_rate": 0.0002, "loss": 0.6257752180099487, "mean_token_accuracy": 0.7451038733124733, "num_tokens": 17946561.0, "step": 480 }, { "entropy": 0.6195474341511726, "epoch": 3.064, "grad_norm": 0.011573764495551586, "learning_rate": 0.0002, "loss": 0.630095899105072, "mean_token_accuracy": 0.7431527376174927, "num_tokens": 17983774.0, "step": 481 }, { "entropy": 0.6207288056612015, "epoch": 3.0704, "grad_norm": 0.008784581907093525, "learning_rate": 0.0002, "loss": 0.6228084564208984, "mean_token_accuracy": 0.7441780641674995, "num_tokens": 18021797.0, "step": 482 }, { "entropy": 0.6219965890049934, "epoch": 3.0768, "grad_norm": 0.009525037370622158, "learning_rate": 0.0002, "loss": 0.6203585863113403, "mean_token_accuracy": 0.7454776242375374, "num_tokens": 18059600.0, "step": 483 }, { "entropy": 0.6240369379520416, "epoch": 3.0832, "grad_norm": 0.010099082253873348, "learning_rate": 0.0002, "loss": 0.6236456632614136, "mean_token_accuracy": 0.7461361885070801, "num_tokens": 18097249.0, "step": 484 }, { "entropy": 0.6231376677751541, "epoch": 3.0896, "grad_norm": 0.009384946897625923, "learning_rate": 0.0002, "loss": 0.6250054240226746, "mean_token_accuracy": 0.7437941208481789, "num_tokens": 18134395.0, "step": 485 }, { "entropy": 0.6311322897672653, "epoch": 3.096, "grad_norm": 0.010897154919803143, "learning_rate": 0.0002, "loss": 0.6397508978843689, "mean_token_accuracy": 0.7386776655912399, "num_tokens": 18171963.0, "step": 486 }, { "entropy": 0.62527284771204, "epoch": 3.1024, "grad_norm": 0.009014398790895939, "learning_rate": 0.0002, "loss": 0.629889726638794, "mean_token_accuracy": 0.7426332533359528, "num_tokens": 18209290.0, "step": 487 }, { "entropy": 0.6315117180347443, "epoch": 3.1088, "grad_norm": 0.010383408516645432, "learning_rate": 0.0002, "loss": 0.6257723569869995, "mean_token_accuracy": 0.7457722872495651, "num_tokens": 18247004.0, "step": 488 }, { "entropy": 0.6517661288380623, "epoch": 3.1152, "grad_norm": 0.009840711019933224, "learning_rate": 0.0002, "loss": 0.6448700428009033, "mean_token_accuracy": 0.7368841990828514, "num_tokens": 18284521.0, "step": 489 }, { "entropy": 0.6304850652813911, "epoch": 3.1216, "grad_norm": 0.009999154135584831, "learning_rate": 0.0002, "loss": 0.6314412951469421, "mean_token_accuracy": 0.7430186495184898, "num_tokens": 18321986.0, "step": 490 }, { "entropy": 0.6318495348095894, "epoch": 3.128, "grad_norm": 0.011276421137154102, "learning_rate": 0.0002, "loss": 0.6365323066711426, "mean_token_accuracy": 0.7421404719352722, "num_tokens": 18359940.0, "step": 491 }, { "entropy": 0.6343097537755966, "epoch": 3.1344, "grad_norm": 0.009451535530388355, "learning_rate": 0.0002, "loss": 0.6381996273994446, "mean_token_accuracy": 0.7415077835321426, "num_tokens": 18397600.0, "step": 492 }, { "entropy": 0.6369383260607719, "epoch": 3.1408, "grad_norm": 0.009595794603228569, "learning_rate": 0.0002, "loss": 0.6356371641159058, "mean_token_accuracy": 0.7401534095406532, "num_tokens": 18435100.0, "step": 493 }, { "entropy": 0.6311136037111282, "epoch": 3.1471999999999998, "grad_norm": 0.011402090080082417, "learning_rate": 0.0002, "loss": 0.630678117275238, "mean_token_accuracy": 0.7420787587761879, "num_tokens": 18472437.0, "step": 494 }, { "entropy": 0.6152165159583092, "epoch": 3.1536, "grad_norm": 0.009202217683196068, "learning_rate": 0.0002, "loss": 0.6150789260864258, "mean_token_accuracy": 0.749266542494297, "num_tokens": 18509694.0, "step": 495 }, { "entropy": 0.6187552213668823, "epoch": 3.16, "grad_norm": 0.012286514043807983, "learning_rate": 0.0002, "loss": 0.6278830170631409, "mean_token_accuracy": 0.7449735552072525, "num_tokens": 18547270.0, "step": 496 }, { "entropy": 0.624017171561718, "epoch": 3.1664, "grad_norm": 0.009709254838526249, "learning_rate": 0.0002, "loss": 0.6308646202087402, "mean_token_accuracy": 0.7407297566533089, "num_tokens": 18584781.0, "step": 497 }, { "entropy": 0.6381459310650826, "epoch": 3.1728, "grad_norm": 0.010118975304067135, "learning_rate": 0.0002, "loss": 0.6422901153564453, "mean_token_accuracy": 0.7380207404494286, "num_tokens": 18622605.0, "step": 498 }, { "entropy": 0.6330775320529938, "epoch": 3.1792, "grad_norm": 0.010614707134664059, "learning_rate": 0.0002, "loss": 0.626909613609314, "mean_token_accuracy": 0.7434390485286713, "num_tokens": 18660181.0, "step": 499 }, { "entropy": 0.6467690318822861, "epoch": 3.1856, "grad_norm": 0.011636339128017426, "learning_rate": 0.0002, "loss": 0.6417078971862793, "mean_token_accuracy": 0.7391890659928322, "num_tokens": 18697960.0, "step": 500 }, { "entropy": 0.642953485250473, "epoch": 3.192, "grad_norm": 0.009976604022085667, "learning_rate": 0.0002, "loss": 0.6437498331069946, "mean_token_accuracy": 0.7397104203701019, "num_tokens": 18735678.0, "step": 501 }, { "entropy": 0.6099938452243805, "epoch": 3.1984, "grad_norm": 0.012410764582455158, "learning_rate": 0.0002, "loss": 0.6217681169509888, "mean_token_accuracy": 0.7468984425067902, "num_tokens": 18773294.0, "step": 502 }, { "entropy": 0.6207045987248421, "epoch": 3.2048, "grad_norm": 0.01231430098414421, "learning_rate": 0.0002, "loss": 0.6315573453903198, "mean_token_accuracy": 0.7444091141223907, "num_tokens": 18810845.0, "step": 503 }, { "entropy": 0.6327609792351723, "epoch": 3.2112, "grad_norm": 0.009783076122403145, "learning_rate": 0.0002, "loss": 0.6313201189041138, "mean_token_accuracy": 0.7418917194008827, "num_tokens": 18848236.0, "step": 504 }, { "entropy": 0.6450697854161263, "epoch": 3.2176, "grad_norm": 0.011842023581266403, "learning_rate": 0.0002, "loss": 0.6390271186828613, "mean_token_accuracy": 0.7399028763175011, "num_tokens": 18885816.0, "step": 505 }, { "entropy": 0.6308076307177544, "epoch": 3.224, "grad_norm": 0.009748830460011959, "learning_rate": 0.0002, "loss": 0.6288598775863647, "mean_token_accuracy": 0.7437896579504013, "num_tokens": 18923477.0, "step": 506 }, { "entropy": 0.6379056051373482, "epoch": 3.2304, "grad_norm": 0.009498417377471924, "learning_rate": 0.0002, "loss": 0.6368851661682129, "mean_token_accuracy": 0.740045078098774, "num_tokens": 18960975.0, "step": 507 }, { "entropy": 0.6196693256497383, "epoch": 3.2368, "grad_norm": 0.010206184349954128, "learning_rate": 0.0002, "loss": 0.6276986598968506, "mean_token_accuracy": 0.7443438991904259, "num_tokens": 18998695.0, "step": 508 }, { "entropy": 0.6081546768546104, "epoch": 3.2432, "grad_norm": 0.011067412793636322, "learning_rate": 0.0002, "loss": 0.617774248123169, "mean_token_accuracy": 0.7473630830645561, "num_tokens": 19036024.0, "step": 509 }, { "entropy": 0.621229961514473, "epoch": 3.2496, "grad_norm": 0.009409903548657894, "learning_rate": 0.0002, "loss": 0.6242153644561768, "mean_token_accuracy": 0.7461365386843681, "num_tokens": 19073279.0, "step": 510 }, { "entropy": 0.6359136626124382, "epoch": 3.2560000000000002, "grad_norm": 0.01134317647665739, "learning_rate": 0.0002, "loss": 0.6272875070571899, "mean_token_accuracy": 0.7440386563539505, "num_tokens": 19110879.0, "step": 511 }, { "entropy": 0.6344882696866989, "epoch": 3.2624, "grad_norm": 0.009477692656219006, "learning_rate": 0.0002, "loss": 0.6296730041503906, "mean_token_accuracy": 0.7432499378919601, "num_tokens": 19148500.0, "step": 512 }, { "entropy": 0.6398265957832336, "epoch": 3.2688, "grad_norm": 0.009287470020353794, "learning_rate": 0.0002, "loss": 0.6409690976142883, "mean_token_accuracy": 0.7397137433290482, "num_tokens": 19186265.0, "step": 513 }, { "entropy": 0.6291618198156357, "epoch": 3.2752, "grad_norm": 0.010224799625575542, "learning_rate": 0.0002, "loss": 0.6341534852981567, "mean_token_accuracy": 0.7401559799909592, "num_tokens": 19224100.0, "step": 514 }, { "entropy": 0.6363715305924416, "epoch": 3.2816, "grad_norm": 0.009469510987401009, "learning_rate": 0.0002, "loss": 0.6414492130279541, "mean_token_accuracy": 0.7395576015114784, "num_tokens": 19261530.0, "step": 515 }, { "entropy": 0.623082734644413, "epoch": 3.288, "grad_norm": 0.009947684593498707, "learning_rate": 0.0002, "loss": 0.6218703985214233, "mean_token_accuracy": 0.7470062673091888, "num_tokens": 19299016.0, "step": 516 }, { "entropy": 0.6309391483664513, "epoch": 3.2944, "grad_norm": 0.008808617480099201, "learning_rate": 0.0002, "loss": 0.6311261653900146, "mean_token_accuracy": 0.7421472296118736, "num_tokens": 19336795.0, "step": 517 }, { "entropy": 0.6172879338264465, "epoch": 3.3008, "grad_norm": 0.009716369211673737, "learning_rate": 0.0002, "loss": 0.6209211945533752, "mean_token_accuracy": 0.7458591684699059, "num_tokens": 19374516.0, "step": 518 }, { "entropy": 0.624429427087307, "epoch": 3.3072, "grad_norm": 0.00985341053456068, "learning_rate": 0.0002, "loss": 0.6280737519264221, "mean_token_accuracy": 0.7443241253495216, "num_tokens": 19412000.0, "step": 519 }, { "entropy": 0.6387547329068184, "epoch": 3.3136, "grad_norm": 0.010449756868183613, "learning_rate": 0.0002, "loss": 0.6452560424804688, "mean_token_accuracy": 0.7374782711267471, "num_tokens": 19449428.0, "step": 520 }, { "entropy": 0.6452173292636871, "epoch": 3.32, "grad_norm": 0.010232311673462391, "learning_rate": 0.0002, "loss": 0.6446540355682373, "mean_token_accuracy": 0.7369571030139923, "num_tokens": 19486584.0, "step": 521 }, { "entropy": 0.6503598615527153, "epoch": 3.3264, "grad_norm": 0.009941341355443, "learning_rate": 0.0002, "loss": 0.6453627347946167, "mean_token_accuracy": 0.736748069524765, "num_tokens": 19524352.0, "step": 522 }, { "entropy": 0.6315410137176514, "epoch": 3.3327999999999998, "grad_norm": 0.011314695701003075, "learning_rate": 0.0002, "loss": 0.6289575099945068, "mean_token_accuracy": 0.7419339716434479, "num_tokens": 19561915.0, "step": 523 }, { "entropy": 0.6262854412198067, "epoch": 3.3392, "grad_norm": 0.010391976684331894, "learning_rate": 0.0002, "loss": 0.6323624849319458, "mean_token_accuracy": 0.7404907718300819, "num_tokens": 19599545.0, "step": 524 }, { "entropy": 0.6337175592780113, "epoch": 3.3456, "grad_norm": 0.011693738400936127, "learning_rate": 0.0002, "loss": 0.6432880163192749, "mean_token_accuracy": 0.7387639954686165, "num_tokens": 19637116.0, "step": 525 }, { "entropy": 0.633139468729496, "epoch": 3.352, "grad_norm": 0.009820731356739998, "learning_rate": 0.0002, "loss": 0.6332041621208191, "mean_token_accuracy": 0.7423391342163086, "num_tokens": 19674921.0, "step": 526 }, { "entropy": 0.6280725598335266, "epoch": 3.3584, "grad_norm": 0.009054291062057018, "learning_rate": 0.0002, "loss": 0.628294825553894, "mean_token_accuracy": 0.7419228628277779, "num_tokens": 19712717.0, "step": 527 }, { "entropy": 0.6336539536714554, "epoch": 3.3648, "grad_norm": 0.010253396816551685, "learning_rate": 0.0002, "loss": 0.6339755654335022, "mean_token_accuracy": 0.7397957965731621, "num_tokens": 19749941.0, "step": 528 }, { "entropy": 0.6203584149479866, "epoch": 3.3712, "grad_norm": 0.009867236949503422, "learning_rate": 0.0002, "loss": 0.6247453689575195, "mean_token_accuracy": 0.7431770488619804, "num_tokens": 19787178.0, "step": 529 }, { "entropy": 0.6316971704363823, "epoch": 3.3776, "grad_norm": 0.009513068944215775, "learning_rate": 0.0002, "loss": 0.6362742781639099, "mean_token_accuracy": 0.737493634223938, "num_tokens": 19824578.0, "step": 530 }, { "entropy": 0.6340960711240768, "epoch": 3.384, "grad_norm": 0.009593709371984005, "learning_rate": 0.0002, "loss": 0.6331235766410828, "mean_token_accuracy": 0.7399430274963379, "num_tokens": 19862390.0, "step": 531 }, { "entropy": 0.6132048889994621, "epoch": 3.3904, "grad_norm": 0.010046555660665035, "learning_rate": 0.0002, "loss": 0.6161696910858154, "mean_token_accuracy": 0.7499357238411903, "num_tokens": 19899845.0, "step": 532 }, { "entropy": 0.6227102503180504, "epoch": 3.3968, "grad_norm": 0.010463609360158443, "learning_rate": 0.0002, "loss": 0.6273203492164612, "mean_token_accuracy": 0.7455707415938377, "num_tokens": 19937650.0, "step": 533 }, { "entropy": 0.6323057189583778, "epoch": 3.4032, "grad_norm": 0.011215063743293285, "learning_rate": 0.0002, "loss": 0.6333843469619751, "mean_token_accuracy": 0.7426166757941246, "num_tokens": 19975460.0, "step": 534 }, { "entropy": 0.6401225328445435, "epoch": 3.4096, "grad_norm": 0.009196775034070015, "learning_rate": 0.0002, "loss": 0.6394823789596558, "mean_token_accuracy": 0.738113172352314, "num_tokens": 20013373.0, "step": 535 }, { "entropy": 0.6456998661160469, "epoch": 3.416, "grad_norm": 0.010047613643109798, "learning_rate": 0.0002, "loss": 0.6439746618270874, "mean_token_accuracy": 0.7357992008328438, "num_tokens": 20051018.0, "step": 536 }, { "entropy": 0.6272638514637947, "epoch": 3.4224, "grad_norm": 0.011030818335711956, "learning_rate": 0.0002, "loss": 0.6313672065734863, "mean_token_accuracy": 0.7423597574234009, "num_tokens": 20088324.0, "step": 537 }, { "entropy": 0.6197195202112198, "epoch": 3.4288, "grad_norm": 0.010905069299042225, "learning_rate": 0.0002, "loss": 0.6300115585327148, "mean_token_accuracy": 0.7445831671357155, "num_tokens": 20125821.0, "step": 538 }, { "entropy": 0.616571269929409, "epoch": 3.4352, "grad_norm": 0.00983978621661663, "learning_rate": 0.0002, "loss": 0.6236230134963989, "mean_token_accuracy": 0.7451280057430267, "num_tokens": 20163266.0, "step": 539 }, { "entropy": 0.6327468827366829, "epoch": 3.4416, "grad_norm": 0.00972190871834755, "learning_rate": 0.0002, "loss": 0.6347957849502563, "mean_token_accuracy": 0.7411710619926453, "num_tokens": 20201024.0, "step": 540 }, { "entropy": 0.6288504004478455, "epoch": 3.448, "grad_norm": 0.011150616221129894, "learning_rate": 0.0002, "loss": 0.6228883266448975, "mean_token_accuracy": 0.7468400076031685, "num_tokens": 20238093.0, "step": 541 }, { "entropy": 0.6300643384456635, "epoch": 3.4544, "grad_norm": 0.01008420716971159, "learning_rate": 0.0002, "loss": 0.6263501048088074, "mean_token_accuracy": 0.7454875409603119, "num_tokens": 20275846.0, "step": 542 }, { "entropy": 0.621397003531456, "epoch": 3.4608, "grad_norm": 0.009655226953327656, "learning_rate": 0.0002, "loss": 0.626434862613678, "mean_token_accuracy": 0.7454000115394592, "num_tokens": 20313165.0, "step": 543 }, { "entropy": 0.625905841588974, "epoch": 3.4672, "grad_norm": 0.012401984073221684, "learning_rate": 0.0002, "loss": 0.6340878009796143, "mean_token_accuracy": 0.74062430113554, "num_tokens": 20351212.0, "step": 544 }, { "entropy": 0.6408397778868675, "epoch": 3.4736000000000002, "grad_norm": 0.010497737675905228, "learning_rate": 0.0002, "loss": 0.6416893601417542, "mean_token_accuracy": 0.7387349084019661, "num_tokens": 20388632.0, "step": 545 }, { "entropy": 0.6322543397545815, "epoch": 3.48, "grad_norm": 0.010267537087202072, "learning_rate": 0.0002, "loss": 0.6245300769805908, "mean_token_accuracy": 0.7472849115729332, "num_tokens": 20426503.0, "step": 546 }, { "entropy": 0.6428259909152985, "epoch": 3.4864, "grad_norm": 0.010037362575531006, "learning_rate": 0.0002, "loss": 0.6373123526573181, "mean_token_accuracy": 0.7395420894026756, "num_tokens": 20464010.0, "step": 547 }, { "entropy": 0.6270901411771774, "epoch": 3.4928, "grad_norm": 0.008532303385436535, "learning_rate": 0.0002, "loss": 0.6293808221817017, "mean_token_accuracy": 0.7432048991322517, "num_tokens": 20501515.0, "step": 548 }, { "entropy": 0.6149459034204483, "epoch": 3.4992, "grad_norm": 0.009804856963455677, "learning_rate": 0.0002, "loss": 0.6234340667724609, "mean_token_accuracy": 0.7474272325634956, "num_tokens": 20539328.0, "step": 549 }, { "entropy": 0.6115493848919868, "epoch": 3.5056000000000003, "grad_norm": 0.01168244518339634, "learning_rate": 0.0002, "loss": 0.6256985068321228, "mean_token_accuracy": 0.7442245110869408, "num_tokens": 20576414.0, "step": 550 }, { "entropy": 0.6242030709981918, "epoch": 3.512, "grad_norm": 0.00905383937060833, "learning_rate": 0.0002, "loss": 0.6286660432815552, "mean_token_accuracy": 0.7437908053398132, "num_tokens": 20614078.0, "step": 551 }, { "entropy": 0.6304361894726753, "epoch": 3.5183999999999997, "grad_norm": 0.008661957457661629, "learning_rate": 0.0002, "loss": 0.6304973363876343, "mean_token_accuracy": 0.7443248927593231, "num_tokens": 20651484.0, "step": 552 }, { "entropy": 0.6485093608498573, "epoch": 3.5248, "grad_norm": 0.008023140951991081, "learning_rate": 0.0002, "loss": 0.64768385887146, "mean_token_accuracy": 0.7372199594974518, "num_tokens": 20688874.0, "step": 553 }, { "entropy": 0.6480056494474411, "epoch": 3.5312, "grad_norm": 0.009417054243385792, "learning_rate": 0.0002, "loss": 0.6428097486495972, "mean_token_accuracy": 0.7367473617196083, "num_tokens": 20726632.0, "step": 554 }, { "entropy": 0.6245403215289116, "epoch": 3.5376, "grad_norm": 0.008958806283771992, "learning_rate": 0.0002, "loss": 0.6215206980705261, "mean_token_accuracy": 0.745918445289135, "num_tokens": 20764598.0, "step": 555 }, { "entropy": 0.6468629390001297, "epoch": 3.544, "grad_norm": 0.009944718331098557, "learning_rate": 0.0002, "loss": 0.6501193046569824, "mean_token_accuracy": 0.7350190952420235, "num_tokens": 20802384.0, "step": 556 }, { "entropy": 0.6288837715983391, "epoch": 3.5504, "grad_norm": 0.009102506563067436, "learning_rate": 0.0002, "loss": 0.6321202516555786, "mean_token_accuracy": 0.7416860312223434, "num_tokens": 20839585.0, "step": 557 }, { "entropy": 0.6316198781132698, "epoch": 3.5568, "grad_norm": 0.009831351228058338, "learning_rate": 0.0002, "loss": 0.6349937319755554, "mean_token_accuracy": 0.7422218322753906, "num_tokens": 20877319.0, "step": 558 }, { "entropy": 0.640017494559288, "epoch": 3.5632, "grad_norm": 0.00992864090949297, "learning_rate": 0.0002, "loss": 0.6386250853538513, "mean_token_accuracy": 0.7408555001020432, "num_tokens": 20915060.0, "step": 559 }, { "entropy": 0.650281272828579, "epoch": 3.5696, "grad_norm": 0.008609931915998459, "learning_rate": 0.0002, "loss": 0.6503854393959045, "mean_token_accuracy": 0.7330696955323219, "num_tokens": 20953081.0, "step": 560 }, { "entropy": 0.6279073059558868, "epoch": 3.576, "grad_norm": 0.01186640840023756, "learning_rate": 0.0002, "loss": 0.627372145652771, "mean_token_accuracy": 0.7447227090597153, "num_tokens": 20990338.0, "step": 561 }, { "entropy": 0.634159728884697, "epoch": 3.5824, "grad_norm": 0.008970306254923344, "learning_rate": 0.0002, "loss": 0.6346087455749512, "mean_token_accuracy": 0.7415203601121902, "num_tokens": 21028096.0, "step": 562 }, { "entropy": 0.633803091943264, "epoch": 3.5888, "grad_norm": 0.011358493939042091, "learning_rate": 0.0002, "loss": 0.6442689895629883, "mean_token_accuracy": 0.7374193891882896, "num_tokens": 21065835.0, "step": 563 }, { "entropy": 0.623796708881855, "epoch": 3.5952, "grad_norm": 0.011994842439889908, "learning_rate": 0.0002, "loss": 0.6334537267684937, "mean_token_accuracy": 0.7415754497051239, "num_tokens": 21103469.0, "step": 564 }, { "entropy": 0.635470986366272, "epoch": 3.6016, "grad_norm": 0.009826122783124447, "learning_rate": 0.0002, "loss": 0.6419943571090698, "mean_token_accuracy": 0.7378642708063126, "num_tokens": 21141513.0, "step": 565 }, { "entropy": 0.6463486775755882, "epoch": 3.608, "grad_norm": 0.010555503889918327, "learning_rate": 0.0002, "loss": 0.640326738357544, "mean_token_accuracy": 0.7372942119836807, "num_tokens": 21178927.0, "step": 566 }, { "entropy": 0.6457525193691254, "epoch": 3.6144, "grad_norm": 0.010458976030349731, "learning_rate": 0.0002, "loss": 0.6402060985565186, "mean_token_accuracy": 0.7400226071476936, "num_tokens": 21216291.0, "step": 567 }, { "entropy": 0.633650466799736, "epoch": 3.6208, "grad_norm": 0.009390798397362232, "learning_rate": 0.0002, "loss": 0.6331945657730103, "mean_token_accuracy": 0.7403992488980293, "num_tokens": 21253727.0, "step": 568 }, { "entropy": 0.632075347006321, "epoch": 3.6272, "grad_norm": 0.01025348249822855, "learning_rate": 0.0002, "loss": 0.6355302333831787, "mean_token_accuracy": 0.7413225471973419, "num_tokens": 21291493.0, "step": 569 }, { "entropy": 0.6219524443149567, "epoch": 3.6336, "grad_norm": 0.011700067669153214, "learning_rate": 0.0002, "loss": 0.6319601535797119, "mean_token_accuracy": 0.7412790209054947, "num_tokens": 21329474.0, "step": 570 }, { "entropy": 0.6328660994768143, "epoch": 3.64, "grad_norm": 0.009544705040752888, "learning_rate": 0.0002, "loss": 0.6347973346710205, "mean_token_accuracy": 0.742459200322628, "num_tokens": 21367274.0, "step": 571 }, { "entropy": 0.6382363438606262, "epoch": 3.6464, "grad_norm": 0.009506464004516602, "learning_rate": 0.0002, "loss": 0.632327675819397, "mean_token_accuracy": 0.741349458694458, "num_tokens": 21405027.0, "step": 572 }, { "entropy": 0.6429821029305458, "epoch": 3.6528, "grad_norm": 0.008949574083089828, "learning_rate": 0.0002, "loss": 0.6385926008224487, "mean_token_accuracy": 0.7412813901901245, "num_tokens": 21442485.0, "step": 573 }, { "entropy": 0.6392761990427971, "epoch": 3.6592000000000002, "grad_norm": 0.008819608017802238, "learning_rate": 0.0002, "loss": 0.6387146711349487, "mean_token_accuracy": 0.7381789684295654, "num_tokens": 21480245.0, "step": 574 }, { "entropy": 0.6092662885785103, "epoch": 3.6656, "grad_norm": 0.009008620865643024, "learning_rate": 0.0002, "loss": 0.6131871342658997, "mean_token_accuracy": 0.7484863623976707, "num_tokens": 21517658.0, "step": 575 }, { "entropy": 0.6172466725111008, "epoch": 3.672, "grad_norm": 0.008723135106265545, "learning_rate": 0.0002, "loss": 0.6228119730949402, "mean_token_accuracy": 0.747119203209877, "num_tokens": 21555161.0, "step": 576 }, { "entropy": 0.6264480575919151, "epoch": 3.6784, "grad_norm": 0.008482584729790688, "learning_rate": 0.0002, "loss": 0.6291134357452393, "mean_token_accuracy": 0.7445547953248024, "num_tokens": 21592408.0, "step": 577 }, { "entropy": 0.635237880051136, "epoch": 3.6848, "grad_norm": 0.00850406102836132, "learning_rate": 0.0002, "loss": 0.6362268328666687, "mean_token_accuracy": 0.7393738552927971, "num_tokens": 21630282.0, "step": 578 }, { "entropy": 0.6200535595417023, "epoch": 3.6912000000000003, "grad_norm": 0.009778933599591255, "learning_rate": 0.0002, "loss": 0.6221815347671509, "mean_token_accuracy": 0.7469090595841408, "num_tokens": 21667708.0, "step": 579 }, { "entropy": 0.63077662140131, "epoch": 3.6976, "grad_norm": 0.009218033403158188, "learning_rate": 0.0002, "loss": 0.6323422193527222, "mean_token_accuracy": 0.7421467453241348, "num_tokens": 21705244.0, "step": 580 }, { "entropy": 0.6420226320624352, "epoch": 3.7039999999999997, "grad_norm": 0.009507461450994015, "learning_rate": 0.0002, "loss": 0.6403417587280273, "mean_token_accuracy": 0.739894188940525, "num_tokens": 21743055.0, "step": 581 }, { "entropy": 0.6300998106598854, "epoch": 3.7104, "grad_norm": 0.009341172873973846, "learning_rate": 0.0002, "loss": 0.6311365962028503, "mean_token_accuracy": 0.7414052486419678, "num_tokens": 21780375.0, "step": 582 }, { "entropy": 0.6306213289499283, "epoch": 3.7168, "grad_norm": 0.010440697893500328, "learning_rate": 0.0002, "loss": 0.6373945474624634, "mean_token_accuracy": 0.7419358193874359, "num_tokens": 21817708.0, "step": 583 }, { "entropy": 0.6163543164730072, "epoch": 3.7232, "grad_norm": 0.009331561625003815, "learning_rate": 0.0002, "loss": 0.6209964156150818, "mean_token_accuracy": 0.7463705316185951, "num_tokens": 21854937.0, "step": 584 }, { "entropy": 0.6321230009198189, "epoch": 3.7296, "grad_norm": 0.00952980387955904, "learning_rate": 0.0002, "loss": 0.6340712308883667, "mean_token_accuracy": 0.7384133115410805, "num_tokens": 21892727.0, "step": 585 }, { "entropy": 0.6275918409228325, "epoch": 3.7359999999999998, "grad_norm": 0.009358996525406837, "learning_rate": 0.0002, "loss": 0.6279775500297546, "mean_token_accuracy": 0.7420656681060791, "num_tokens": 21930361.0, "step": 586 }, { "entropy": 0.6374326348304749, "epoch": 3.7424, "grad_norm": 0.00851542316377163, "learning_rate": 0.0002, "loss": 0.6387336254119873, "mean_token_accuracy": 0.7408188581466675, "num_tokens": 21967769.0, "step": 587 }, { "entropy": 0.6265183612704277, "epoch": 3.7488, "grad_norm": 0.010128417983651161, "learning_rate": 0.0002, "loss": 0.6304729580879211, "mean_token_accuracy": 0.74308130890131, "num_tokens": 22005268.0, "step": 588 }, { "entropy": 0.6259055137634277, "epoch": 3.7552, "grad_norm": 0.00949757732450962, "learning_rate": 0.0002, "loss": 0.6271415948867798, "mean_token_accuracy": 0.7445643469691277, "num_tokens": 22042740.0, "step": 589 }, { "entropy": 0.621527373790741, "epoch": 3.7616, "grad_norm": 0.011297403834760189, "learning_rate": 0.0002, "loss": 0.6193302869796753, "mean_token_accuracy": 0.7481779083609581, "num_tokens": 22080705.0, "step": 590 }, { "entropy": 0.6351140215992928, "epoch": 3.768, "grad_norm": 0.01007875707000494, "learning_rate": 0.0002, "loss": 0.636103093624115, "mean_token_accuracy": 0.7403137609362602, "num_tokens": 22118187.0, "step": 591 }, { "entropy": 0.6164060086011887, "epoch": 3.7744, "grad_norm": 0.00851944275200367, "learning_rate": 0.0002, "loss": 0.620150089263916, "mean_token_accuracy": 0.7468870654702187, "num_tokens": 22155780.0, "step": 592 }, { "entropy": 0.6220516487956047, "epoch": 3.7808, "grad_norm": 0.011541093699634075, "learning_rate": 0.0002, "loss": 0.6253345012664795, "mean_token_accuracy": 0.7459988221526146, "num_tokens": 22193401.0, "step": 593 }, { "entropy": 0.6525481268763542, "epoch": 3.7872, "grad_norm": 0.009819903410971165, "learning_rate": 0.0002, "loss": 0.6519078016281128, "mean_token_accuracy": 0.7341204807162285, "num_tokens": 22230608.0, "step": 594 }, { "entropy": 0.6331318765878677, "epoch": 3.7936, "grad_norm": 0.010822438634932041, "learning_rate": 0.0002, "loss": 0.627253532409668, "mean_token_accuracy": 0.7452663481235504, "num_tokens": 22268376.0, "step": 595 }, { "entropy": 0.6378331705927849, "epoch": 3.8, "grad_norm": 0.010335801169276237, "learning_rate": 0.0002, "loss": 0.6402156949043274, "mean_token_accuracy": 0.7388675063848495, "num_tokens": 22305874.0, "step": 596 }, { "entropy": 0.6241042613983154, "epoch": 3.8064, "grad_norm": 0.011212136596441269, "learning_rate": 0.0002, "loss": 0.6346319913864136, "mean_token_accuracy": 0.7422374039888382, "num_tokens": 22343270.0, "step": 597 }, { "entropy": 0.6304724365472794, "epoch": 3.8128, "grad_norm": 0.010530945844948292, "learning_rate": 0.0002, "loss": 0.6360510587692261, "mean_token_accuracy": 0.7418438643217087, "num_tokens": 22380767.0, "step": 598 }, { "entropy": 0.630512535572052, "epoch": 3.8192, "grad_norm": 0.01047790888696909, "learning_rate": 0.0002, "loss": 0.6310948133468628, "mean_token_accuracy": 0.7418612614274025, "num_tokens": 22417973.0, "step": 599 }, { "entropy": 0.6289901584386826, "epoch": 3.8256, "grad_norm": 0.009985234588384628, "learning_rate": 0.0002, "loss": 0.6236091256141663, "mean_token_accuracy": 0.745183065533638, "num_tokens": 22455401.0, "step": 600 }, { "entropy": 0.6390504911541939, "epoch": 3.832, "grad_norm": 0.009776836261153221, "learning_rate": 0.0002, "loss": 0.6361709237098694, "mean_token_accuracy": 0.7415382042527199, "num_tokens": 22493019.0, "step": 601 }, { "entropy": 0.6260226741433144, "epoch": 3.8384, "grad_norm": 0.009412144310772419, "learning_rate": 0.0002, "loss": 0.62882399559021, "mean_token_accuracy": 0.7436661571264267, "num_tokens": 22530628.0, "step": 602 }, { "entropy": 0.6180827915668488, "epoch": 3.8448, "grad_norm": 0.009917755611240864, "learning_rate": 0.0002, "loss": 0.6258498430252075, "mean_token_accuracy": 0.7454487532377243, "num_tokens": 22568202.0, "step": 603 }, { "entropy": 0.6200235038995743, "epoch": 3.8512, "grad_norm": 0.010199918411672115, "learning_rate": 0.0002, "loss": 0.6277583837509155, "mean_token_accuracy": 0.7435891628265381, "num_tokens": 22605838.0, "step": 604 }, { "entropy": 0.6254613697528839, "epoch": 3.8576, "grad_norm": 0.009225446730852127, "learning_rate": 0.0002, "loss": 0.6330975294113159, "mean_token_accuracy": 0.7417056709527969, "num_tokens": 22643315.0, "step": 605 }, { "entropy": 0.6374992206692696, "epoch": 3.864, "grad_norm": 0.009426961652934551, "learning_rate": 0.0002, "loss": 0.6333073377609253, "mean_token_accuracy": 0.743529699742794, "num_tokens": 22681260.0, "step": 606 }, { "entropy": 0.6427751928567886, "epoch": 3.8704, "grad_norm": 0.01109833549708128, "learning_rate": 0.0002, "loss": 0.6365841627120972, "mean_token_accuracy": 0.740449033677578, "num_tokens": 22718725.0, "step": 607 }, { "entropy": 0.6293874457478523, "epoch": 3.8768000000000002, "grad_norm": 0.009044543839991093, "learning_rate": 0.0002, "loss": 0.6291689872741699, "mean_token_accuracy": 0.7439134269952774, "num_tokens": 22756018.0, "step": 608 }, { "entropy": 0.6215147376060486, "epoch": 3.8832, "grad_norm": 0.010903657414019108, "learning_rate": 0.0002, "loss": 0.6296993494033813, "mean_token_accuracy": 0.7446267232298851, "num_tokens": 22793251.0, "step": 609 }, { "entropy": 0.6157297044992447, "epoch": 3.8895999999999997, "grad_norm": 0.010149014182388783, "learning_rate": 0.0002, "loss": 0.6224344968795776, "mean_token_accuracy": 0.7450227364897728, "num_tokens": 22830782.0, "step": 610 }, { "entropy": 0.6204625591635704, "epoch": 3.896, "grad_norm": 0.008899394422769547, "learning_rate": 0.0002, "loss": 0.6236724257469177, "mean_token_accuracy": 0.7457845434546471, "num_tokens": 22868292.0, "step": 611 }, { "entropy": 0.6289186328649521, "epoch": 3.9024, "grad_norm": 0.009715489111840725, "learning_rate": 0.0002, "loss": 0.6255042552947998, "mean_token_accuracy": 0.743945874273777, "num_tokens": 22905960.0, "step": 612 }, { "entropy": 0.6272325441241264, "epoch": 3.9088000000000003, "grad_norm": 0.010841017588973045, "learning_rate": 0.0002, "loss": 0.6241690516471863, "mean_token_accuracy": 0.7436103969812393, "num_tokens": 22943043.0, "step": 613 }, { "entropy": 0.6414704546332359, "epoch": 3.9152, "grad_norm": 0.009553831070661545, "learning_rate": 0.0002, "loss": 0.6447999477386475, "mean_token_accuracy": 0.7391496151685715, "num_tokens": 22980557.0, "step": 614 }, { "entropy": 0.6307174563407898, "epoch": 3.9215999999999998, "grad_norm": 0.009158959612250328, "learning_rate": 0.0002, "loss": 0.6336820721626282, "mean_token_accuracy": 0.7413525283336639, "num_tokens": 23018134.0, "step": 615 }, { "entropy": 0.6336700096726418, "epoch": 3.928, "grad_norm": 0.010397304780781269, "learning_rate": 0.0002, "loss": 0.6412237882614136, "mean_token_accuracy": 0.7389427125453949, "num_tokens": 23055656.0, "step": 616 }, { "entropy": 0.6292953938245773, "epoch": 3.9344, "grad_norm": 0.009029161185026169, "learning_rate": 0.0002, "loss": 0.6302052736282349, "mean_token_accuracy": 0.7432261779904366, "num_tokens": 23093414.0, "step": 617 }, { "entropy": 0.6511750519275665, "epoch": 3.9408, "grad_norm": 0.011078661307692528, "learning_rate": 0.0002, "loss": 0.6470860242843628, "mean_token_accuracy": 0.7365722432732582, "num_tokens": 23131307.0, "step": 618 }, { "entropy": 0.640938051044941, "epoch": 3.9472, "grad_norm": 0.009597877971827984, "learning_rate": 0.0002, "loss": 0.6369379758834839, "mean_token_accuracy": 0.7396447286009789, "num_tokens": 23168894.0, "step": 619 }, { "entropy": 0.6210119426250458, "epoch": 3.9536, "grad_norm": 0.010679766535758972, "learning_rate": 0.0002, "loss": 0.6260274052619934, "mean_token_accuracy": 0.7466530501842499, "num_tokens": 23206378.0, "step": 620 }, { "entropy": 0.615054301917553, "epoch": 3.96, "grad_norm": 0.010784207843244076, "learning_rate": 0.0002, "loss": 0.6229560375213623, "mean_token_accuracy": 0.7456069514155388, "num_tokens": 23243675.0, "step": 621 }, { "entropy": 0.6250587999820709, "epoch": 3.9664, "grad_norm": 0.009625584818422794, "learning_rate": 0.0002, "loss": 0.6281651258468628, "mean_token_accuracy": 0.7444300353527069, "num_tokens": 23281000.0, "step": 622 }, { "entropy": 0.6295294389128685, "epoch": 3.9728, "grad_norm": 0.009764077141880989, "learning_rate": 0.0002, "loss": 0.6305609941482544, "mean_token_accuracy": 0.7441380247473717, "num_tokens": 23318554.0, "step": 623 }, { "entropy": 0.619350254535675, "epoch": 3.9792, "grad_norm": 0.009161337278783321, "learning_rate": 0.0002, "loss": 0.6201272010803223, "mean_token_accuracy": 0.7485333606600761, "num_tokens": 23355649.0, "step": 624 }, { "entropy": 0.6401965990662575, "epoch": 3.9856, "grad_norm": 0.010438468307256699, "learning_rate": 0.0002, "loss": 0.6402089595794678, "mean_token_accuracy": 0.7383991852402687, "num_tokens": 23393568.0, "step": 625 }, { "entropy": 0.6330313384532928, "epoch": 3.992, "grad_norm": 0.009565716609358788, "learning_rate": 0.0002, "loss": 0.6326834559440613, "mean_token_accuracy": 0.7425080984830856, "num_tokens": 23431086.0, "step": 626 }, { "entropy": 0.6277460902929306, "epoch": 3.9984, "grad_norm": 0.009916098788380623, "learning_rate": 0.0002, "loss": 0.6327950954437256, "mean_token_accuracy": 0.7417906895279884, "num_tokens": 23468619.0, "step": 627 }, { "entropy": 0.6479776203632355, "epoch": 4.0, "grad_norm": 0.016998078674077988, "learning_rate": 0.0002, "loss": 0.6533247828483582, "mean_token_accuracy": 0.7333799302577972, "num_tokens": 23477894.0, "step": 628 }, { "entropy": 0.6334798634052277, "epoch": 4.0064, "grad_norm": 0.011177260428667068, "learning_rate": 0.0002, "loss": 0.6274731159210205, "mean_token_accuracy": 0.7418768331408501, "num_tokens": 23515512.0, "step": 629 }, { "entropy": 0.6426746100187302, "epoch": 4.0128, "grad_norm": 0.010523858480155468, "learning_rate": 0.0002, "loss": 0.639644980430603, "mean_token_accuracy": 0.738319605588913, "num_tokens": 23553199.0, "step": 630 }, { "entropy": 0.6350331977009773, "epoch": 4.0192, "grad_norm": 0.013215194456279278, "learning_rate": 0.0002, "loss": 0.6405128836631775, "mean_token_accuracy": 0.739054262638092, "num_tokens": 23590684.0, "step": 631 }, { "entropy": 0.6201648041605949, "epoch": 4.0256, "grad_norm": 0.00981956534087658, "learning_rate": 0.0002, "loss": 0.6236424446105957, "mean_token_accuracy": 0.7453638687729836, "num_tokens": 23628151.0, "step": 632 }, { "entropy": 0.6195686236023903, "epoch": 4.032, "grad_norm": 0.011942672543227673, "learning_rate": 0.0002, "loss": 0.6226350665092468, "mean_token_accuracy": 0.7457711473107338, "num_tokens": 23665791.0, "step": 633 }, { "entropy": 0.621765486896038, "epoch": 4.0384, "grad_norm": 0.011674079112708569, "learning_rate": 0.0002, "loss": 0.6212641000747681, "mean_token_accuracy": 0.7444254085421562, "num_tokens": 23703897.0, "step": 634 }, { "entropy": 0.6218401342630386, "epoch": 4.0448, "grad_norm": 0.011382197961211205, "learning_rate": 0.0002, "loss": 0.6188787221908569, "mean_token_accuracy": 0.7439982444047928, "num_tokens": 23741726.0, "step": 635 }, { "entropy": 0.6302961930632591, "epoch": 4.0512, "grad_norm": 0.0122229540720582, "learning_rate": 0.0002, "loss": 0.6310756802558899, "mean_token_accuracy": 0.7416332587599754, "num_tokens": 23779347.0, "step": 636 }, { "entropy": 0.6179258972406387, "epoch": 4.0576, "grad_norm": 0.013323783874511719, "learning_rate": 0.0002, "loss": 0.6242649555206299, "mean_token_accuracy": 0.7424203455448151, "num_tokens": 23816946.0, "step": 637 }, { "entropy": 0.6160242184996605, "epoch": 4.064, "grad_norm": 0.011928076855838299, "learning_rate": 0.0002, "loss": 0.6227492094039917, "mean_token_accuracy": 0.7461478784680367, "num_tokens": 23854267.0, "step": 638 }, { "entropy": 0.6243119761347771, "epoch": 4.0704, "grad_norm": 0.01218615286052227, "learning_rate": 0.0002, "loss": 0.6247442960739136, "mean_token_accuracy": 0.7416555359959602, "num_tokens": 23891647.0, "step": 639 }, { "entropy": 0.6283975690603256, "epoch": 4.0768, "grad_norm": 0.011089140549302101, "learning_rate": 0.0002, "loss": 0.6262081861495972, "mean_token_accuracy": 0.7418273463845253, "num_tokens": 23928978.0, "step": 640 }, { "entropy": 0.6230043172836304, "epoch": 4.0832, "grad_norm": 0.010514283552765846, "learning_rate": 0.0002, "loss": 0.6210086345672607, "mean_token_accuracy": 0.7470921650528908, "num_tokens": 23966589.0, "step": 641 }, { "entropy": 0.6316242590546608, "epoch": 4.0896, "grad_norm": 0.010836183093488216, "learning_rate": 0.0002, "loss": 0.6322799324989319, "mean_token_accuracy": 0.7397365495562553, "num_tokens": 24004549.0, "step": 642 }, { "entropy": 0.6093735992908478, "epoch": 4.096, "grad_norm": 0.010521575808525085, "learning_rate": 0.0002, "loss": 0.6142085790634155, "mean_token_accuracy": 0.7481302842497826, "num_tokens": 24041703.0, "step": 643 }, { "entropy": 0.6217071115970612, "epoch": 4.1024, "grad_norm": 0.01190858706831932, "learning_rate": 0.0002, "loss": 0.6301581859588623, "mean_token_accuracy": 0.7421037778258324, "num_tokens": 24079260.0, "step": 644 }, { "entropy": 0.6213275268673897, "epoch": 4.1088, "grad_norm": 0.010940197855234146, "learning_rate": 0.0002, "loss": 0.6227558851242065, "mean_token_accuracy": 0.7450557425618172, "num_tokens": 24116868.0, "step": 645 }, { "entropy": 0.6183237135410309, "epoch": 4.1152, "grad_norm": 0.01106048934161663, "learning_rate": 0.0002, "loss": 0.62211012840271, "mean_token_accuracy": 0.7469884529709816, "num_tokens": 24154196.0, "step": 646 }, { "entropy": 0.6235630884766579, "epoch": 4.1216, "grad_norm": 0.01147097535431385, "learning_rate": 0.0002, "loss": 0.6238754987716675, "mean_token_accuracy": 0.7457621321082115, "num_tokens": 24191940.0, "step": 647 }, { "entropy": 0.628976970911026, "epoch": 4.128, "grad_norm": 0.0103966249153018, "learning_rate": 0.0002, "loss": 0.6279858946800232, "mean_token_accuracy": 0.7433076053857803, "num_tokens": 24229689.0, "step": 648 }, { "entropy": 0.6148188188672066, "epoch": 4.1344, "grad_norm": 0.012693977914750576, "learning_rate": 0.0002, "loss": 0.6150864362716675, "mean_token_accuracy": 0.7493811547756195, "num_tokens": 24267208.0, "step": 649 }, { "entropy": 0.6325013488531113, "epoch": 4.1408, "grad_norm": 0.010917159728705883, "learning_rate": 0.0002, "loss": 0.629578709602356, "mean_token_accuracy": 0.742595799267292, "num_tokens": 24305147.0, "step": 650 }, { "entropy": 0.6269365176558495, "epoch": 4.1472, "grad_norm": 0.011673609726130962, "learning_rate": 0.0002, "loss": 0.6288695931434631, "mean_token_accuracy": 0.7425840869545937, "num_tokens": 24342617.0, "step": 651 }, { "entropy": 0.6115541234612465, "epoch": 4.1536, "grad_norm": 0.012632826343178749, "learning_rate": 0.0002, "loss": 0.6173226833343506, "mean_token_accuracy": 0.7491206377744675, "num_tokens": 24379680.0, "step": 652 }, { "entropy": 0.605757087469101, "epoch": 4.16, "grad_norm": 0.012048393487930298, "learning_rate": 0.0002, "loss": 0.6072964668273926, "mean_token_accuracy": 0.7492575421929359, "num_tokens": 24416439.0, "step": 653 }, { "entropy": 0.6210080906748772, "epoch": 4.1664, "grad_norm": 0.010533303022384644, "learning_rate": 0.0002, "loss": 0.6225767731666565, "mean_token_accuracy": 0.7443814054131508, "num_tokens": 24454195.0, "step": 654 }, { "entropy": 0.6205269917845726, "epoch": 4.1728, "grad_norm": 0.012937111780047417, "learning_rate": 0.0002, "loss": 0.621825635433197, "mean_token_accuracy": 0.7476101964712143, "num_tokens": 24491632.0, "step": 655 }, { "entropy": 0.6158983781933784, "epoch": 4.1792, "grad_norm": 0.011887785978615284, "learning_rate": 0.0002, "loss": 0.6177083253860474, "mean_token_accuracy": 0.7477908208966255, "num_tokens": 24529207.0, "step": 656 }, { "entropy": 0.6310747787356377, "epoch": 4.1856, "grad_norm": 0.01170266792178154, "learning_rate": 0.0002, "loss": 0.6338661313056946, "mean_token_accuracy": 0.7413427755236626, "num_tokens": 24566764.0, "step": 657 }, { "entropy": 0.632545068860054, "epoch": 4.192, "grad_norm": 0.012931435368955135, "learning_rate": 0.0002, "loss": 0.6379810571670532, "mean_token_accuracy": 0.7372681424021721, "num_tokens": 24604691.0, "step": 658 }, { "entropy": 0.6272072345018387, "epoch": 4.1984, "grad_norm": 0.012254653498530388, "learning_rate": 0.0002, "loss": 0.6317451000213623, "mean_token_accuracy": 0.7407561391592026, "num_tokens": 24642250.0, "step": 659 }, { "entropy": 0.6200175136327744, "epoch": 4.2048, "grad_norm": 0.012181897647678852, "learning_rate": 0.0002, "loss": 0.6207621097564697, "mean_token_accuracy": 0.7452465370297432, "num_tokens": 24679770.0, "step": 660 }, { "entropy": 0.6108414232730865, "epoch": 4.2112, "grad_norm": 0.010735893622040749, "learning_rate": 0.0002, "loss": 0.6087774038314819, "mean_token_accuracy": 0.7506056129932404, "num_tokens": 24717292.0, "step": 661 }, { "entropy": 0.6238648667931557, "epoch": 4.2176, "grad_norm": 0.010975925251841545, "learning_rate": 0.0002, "loss": 0.6241613626480103, "mean_token_accuracy": 0.7450825273990631, "num_tokens": 24754935.0, "step": 662 }, { "entropy": 0.6437125504016876, "epoch": 4.224, "grad_norm": 0.01447360310703516, "learning_rate": 0.0002, "loss": 0.6416766047477722, "mean_token_accuracy": 0.7382775098085403, "num_tokens": 24792852.0, "step": 663 }, { "entropy": 0.6239062771201134, "epoch": 4.2304, "grad_norm": 0.014347578398883343, "learning_rate": 0.0002, "loss": 0.6313333511352539, "mean_token_accuracy": 0.7430859357118607, "num_tokens": 24830405.0, "step": 664 }, { "entropy": 0.622043676674366, "epoch": 4.2368, "grad_norm": 0.01144686434417963, "learning_rate": 0.0002, "loss": 0.6238901615142822, "mean_token_accuracy": 0.7450033724308014, "num_tokens": 24867891.0, "step": 665 }, { "entropy": 0.6423631235957146, "epoch": 4.2432, "grad_norm": 0.012929810211062431, "learning_rate": 0.0002, "loss": 0.6390476226806641, "mean_token_accuracy": 0.7388838231563568, "num_tokens": 24905463.0, "step": 666 }, { "entropy": 0.6159037128090858, "epoch": 4.2496, "grad_norm": 0.012308385223150253, "learning_rate": 0.0002, "loss": 0.6162548065185547, "mean_token_accuracy": 0.7489078938961029, "num_tokens": 24942905.0, "step": 667 }, { "entropy": 0.6265198811888695, "epoch": 4.256, "grad_norm": 0.01269616186618805, "learning_rate": 0.0002, "loss": 0.6306416988372803, "mean_token_accuracy": 0.7422251328825951, "num_tokens": 24980486.0, "step": 668 }, { "entropy": 0.6116967797279358, "epoch": 4.2624, "grad_norm": 0.012161326594650745, "learning_rate": 0.0002, "loss": 0.6166009902954102, "mean_token_accuracy": 0.747859038412571, "num_tokens": 25018467.0, "step": 669 }, { "entropy": 0.6185164824128151, "epoch": 4.2688, "grad_norm": 0.012251926586031914, "learning_rate": 0.0002, "loss": 0.6215794682502747, "mean_token_accuracy": 0.7451242059469223, "num_tokens": 25056006.0, "step": 670 }, { "entropy": 0.6283984705805779, "epoch": 4.2752, "grad_norm": 0.011603674851357937, "learning_rate": 0.0002, "loss": 0.627375066280365, "mean_token_accuracy": 0.7432128861546516, "num_tokens": 25093408.0, "step": 671 }, { "entropy": 0.609025202691555, "epoch": 4.2816, "grad_norm": 0.011993130668997765, "learning_rate": 0.0002, "loss": 0.6099145412445068, "mean_token_accuracy": 0.7511600032448769, "num_tokens": 25130524.0, "step": 672 }, { "entropy": 0.6234938055276871, "epoch": 4.288, "grad_norm": 0.010231442749500275, "learning_rate": 0.0002, "loss": 0.6248447299003601, "mean_token_accuracy": 0.7447694912552834, "num_tokens": 25168063.0, "step": 673 }, { "entropy": 0.6148969978094101, "epoch": 4.2943999999999996, "grad_norm": 0.012821062467992306, "learning_rate": 0.0002, "loss": 0.6163221001625061, "mean_token_accuracy": 0.7478527128696442, "num_tokens": 25205806.0, "step": 674 }, { "entropy": 0.6235463097691536, "epoch": 4.3008, "grad_norm": 0.012431120499968529, "learning_rate": 0.0002, "loss": 0.6214525699615479, "mean_token_accuracy": 0.744065910577774, "num_tokens": 25243417.0, "step": 675 }, { "entropy": 0.6208379119634628, "epoch": 4.3072, "grad_norm": 0.011580659076571465, "learning_rate": 0.0002, "loss": 0.626810610294342, "mean_token_accuracy": 0.7434930577874184, "num_tokens": 25281000.0, "step": 676 }, { "entropy": 0.6189445853233337, "epoch": 4.3136, "grad_norm": 0.013887791894376278, "learning_rate": 0.0002, "loss": 0.6251901388168335, "mean_token_accuracy": 0.7435762509703636, "num_tokens": 25318324.0, "step": 677 }, { "entropy": 0.623921662569046, "epoch": 4.32, "grad_norm": 0.011908493936061859, "learning_rate": 0.0002, "loss": 0.6203892230987549, "mean_token_accuracy": 0.7473464608192444, "num_tokens": 25356360.0, "step": 678 }, { "entropy": 0.631057970225811, "epoch": 4.3264, "grad_norm": 0.013283537700772285, "learning_rate": 0.0002, "loss": 0.6287419199943542, "mean_token_accuracy": 0.7408920601010323, "num_tokens": 25393819.0, "step": 679 }, { "entropy": 0.6219344884157181, "epoch": 4.3328, "grad_norm": 0.011869650334119797, "learning_rate": 0.0002, "loss": 0.6282262802124023, "mean_token_accuracy": 0.7440148293972015, "num_tokens": 25431318.0, "step": 680 }, { "entropy": 0.6188084334135056, "epoch": 4.3392, "grad_norm": 0.010526369325816631, "learning_rate": 0.0002, "loss": 0.6230930685997009, "mean_token_accuracy": 0.7453781887888908, "num_tokens": 25468847.0, "step": 681 }, { "entropy": 0.6212713718414307, "epoch": 4.3456, "grad_norm": 0.011861243285238743, "learning_rate": 0.0002, "loss": 0.6226496696472168, "mean_token_accuracy": 0.745365597307682, "num_tokens": 25506347.0, "step": 682 }, { "entropy": 0.6259190738201141, "epoch": 4.352, "grad_norm": 0.010720842517912388, "learning_rate": 0.0002, "loss": 0.6282031536102295, "mean_token_accuracy": 0.7432122975587845, "num_tokens": 25543772.0, "step": 683 }, { "entropy": 0.6237253770232201, "epoch": 4.3584, "grad_norm": 0.01095424685627222, "learning_rate": 0.0002, "loss": 0.6262202262878418, "mean_token_accuracy": 0.7435847371816635, "num_tokens": 25581352.0, "step": 684 }, { "entropy": 0.6245952621102333, "epoch": 4.3648, "grad_norm": 0.010688689537346363, "learning_rate": 0.0002, "loss": 0.6216722726821899, "mean_token_accuracy": 0.7473671957850456, "num_tokens": 25619317.0, "step": 685 }, { "entropy": 0.6425120159983635, "epoch": 4.3712, "grad_norm": 0.011959290131926537, "learning_rate": 0.0002, "loss": 0.6369903087615967, "mean_token_accuracy": 0.7412149682641029, "num_tokens": 25657031.0, "step": 686 }, { "entropy": 0.6215310096740723, "epoch": 4.3776, "grad_norm": 0.01260219793766737, "learning_rate": 0.0002, "loss": 0.6221766471862793, "mean_token_accuracy": 0.7461507469415665, "num_tokens": 25694491.0, "step": 687 }, { "entropy": 0.6162081435322762, "epoch": 4.384, "grad_norm": 0.011745546013116837, "learning_rate": 0.0002, "loss": 0.6214650869369507, "mean_token_accuracy": 0.7467240393161774, "num_tokens": 25731722.0, "step": 688 }, { "entropy": 0.6213862374424934, "epoch": 4.3904, "grad_norm": 0.012498460710048676, "learning_rate": 0.0002, "loss": 0.6276631355285645, "mean_token_accuracy": 0.7429244071245193, "num_tokens": 25769429.0, "step": 689 }, { "entropy": 0.6275434419512749, "epoch": 4.3968, "grad_norm": 0.012363743036985397, "learning_rate": 0.0002, "loss": 0.6299156546592712, "mean_token_accuracy": 0.742164358496666, "num_tokens": 25807155.0, "step": 690 }, { "entropy": 0.6255523934960365, "epoch": 4.4032, "grad_norm": 0.012337331660091877, "learning_rate": 0.0002, "loss": 0.6276605725288391, "mean_token_accuracy": 0.7422888278961182, "num_tokens": 25844832.0, "step": 691 }, { "entropy": 0.618801973760128, "epoch": 4.4096, "grad_norm": 0.011720724403858185, "learning_rate": 0.0002, "loss": 0.6215369701385498, "mean_token_accuracy": 0.7449894100427628, "num_tokens": 25882641.0, "step": 692 }, { "entropy": 0.6298277974128723, "epoch": 4.416, "grad_norm": 0.011312286369502544, "learning_rate": 0.0002, "loss": 0.6291104555130005, "mean_token_accuracy": 0.7415849938988686, "num_tokens": 25920171.0, "step": 693 }, { "entropy": 0.6253160834312439, "epoch": 4.4224, "grad_norm": 0.011473000049591064, "learning_rate": 0.0002, "loss": 0.6265097856521606, "mean_token_accuracy": 0.745900847017765, "num_tokens": 25957661.0, "step": 694 }, { "entropy": 0.6151653453707695, "epoch": 4.4288, "grad_norm": 0.011200590059161186, "learning_rate": 0.0002, "loss": 0.6186162829399109, "mean_token_accuracy": 0.7460164353251457, "num_tokens": 25995288.0, "step": 695 }, { "entropy": 0.6358339488506317, "epoch": 4.4352, "grad_norm": 0.012506633065640926, "learning_rate": 0.0002, "loss": 0.6417111158370972, "mean_token_accuracy": 0.7386213764548302, "num_tokens": 26033219.0, "step": 696 }, { "entropy": 0.6197969987988472, "epoch": 4.4416, "grad_norm": 0.009830954484641552, "learning_rate": 0.0002, "loss": 0.6201560497283936, "mean_token_accuracy": 0.7456861957907677, "num_tokens": 26071131.0, "step": 697 }, { "entropy": 0.6429072171449661, "epoch": 4.448, "grad_norm": 0.011239229701459408, "learning_rate": 0.0002, "loss": 0.6405913829803467, "mean_token_accuracy": 0.7353242784738541, "num_tokens": 26108632.0, "step": 698 }, { "entropy": 0.6173607632517815, "epoch": 4.4544, "grad_norm": 0.012541512958705425, "learning_rate": 0.0002, "loss": 0.6168667078018188, "mean_token_accuracy": 0.7472453713417053, "num_tokens": 26145646.0, "step": 699 }, { "entropy": 0.6328746154904366, "epoch": 4.4608, "grad_norm": 0.011488271877169609, "learning_rate": 0.0002, "loss": 0.6352975368499756, "mean_token_accuracy": 0.7387456595897675, "num_tokens": 26183067.0, "step": 700 }, { "entropy": 0.6217170506715775, "epoch": 4.4672, "grad_norm": 0.010990316979587078, "learning_rate": 0.0002, "loss": 0.6259629726409912, "mean_token_accuracy": 0.7441816553473473, "num_tokens": 26220393.0, "step": 701 }, { "entropy": 0.609848141670227, "epoch": 4.4736, "grad_norm": 0.013483099639415741, "learning_rate": 0.0002, "loss": 0.6171920299530029, "mean_token_accuracy": 0.7466985434293747, "num_tokens": 26257715.0, "step": 702 }, { "entropy": 0.6218430995941162, "epoch": 4.48, "grad_norm": 0.011730284430086613, "learning_rate": 0.0002, "loss": 0.623494565486908, "mean_token_accuracy": 0.7454787790775299, "num_tokens": 26295447.0, "step": 703 }, { "entropy": 0.620815634727478, "epoch": 4.4864, "grad_norm": 0.010400974191725254, "learning_rate": 0.0002, "loss": 0.6193233132362366, "mean_token_accuracy": 0.7462346330285072, "num_tokens": 26332908.0, "step": 704 }, { "entropy": 0.6146924197673798, "epoch": 4.4928, "grad_norm": 0.01097558531910181, "learning_rate": 0.0002, "loss": 0.6141451001167297, "mean_token_accuracy": 0.7498283833265305, "num_tokens": 26370265.0, "step": 705 }, { "entropy": 0.6297887563705444, "epoch": 4.4992, "grad_norm": 0.011810330674052238, "learning_rate": 0.0002, "loss": 0.6298263669013977, "mean_token_accuracy": 0.7408022508025169, "num_tokens": 26407870.0, "step": 706 }, { "entropy": 0.6215150058269501, "epoch": 4.5056, "grad_norm": 0.009892682544887066, "learning_rate": 0.0002, "loss": 0.6210182905197144, "mean_token_accuracy": 0.7464409321546555, "num_tokens": 26445509.0, "step": 707 }, { "entropy": 0.6281390488147736, "epoch": 4.5120000000000005, "grad_norm": 0.011692460626363754, "learning_rate": 0.0002, "loss": 0.6285613179206848, "mean_token_accuracy": 0.7438349798321724, "num_tokens": 26483669.0, "step": 708 }, { "entropy": 0.6214175447821617, "epoch": 4.5184, "grad_norm": 0.011380224488675594, "learning_rate": 0.0002, "loss": 0.6210340261459351, "mean_token_accuracy": 0.7459113150835037, "num_tokens": 26521265.0, "step": 709 }, { "entropy": 0.6104562729597092, "epoch": 4.5248, "grad_norm": 0.01076613087207079, "learning_rate": 0.0002, "loss": 0.6165965795516968, "mean_token_accuracy": 0.7475461736321449, "num_tokens": 26558711.0, "step": 710 }, { "entropy": 0.6271610110998154, "epoch": 4.5312, "grad_norm": 0.010785672813653946, "learning_rate": 0.0002, "loss": 0.6283934116363525, "mean_token_accuracy": 0.7444132044911385, "num_tokens": 26596482.0, "step": 711 }, { "entropy": 0.6205542087554932, "epoch": 4.5376, "grad_norm": 0.010699622333049774, "learning_rate": 0.0002, "loss": 0.61879563331604, "mean_token_accuracy": 0.7464459612965584, "num_tokens": 26634130.0, "step": 712 }, { "entropy": 0.6333268582820892, "epoch": 4.5440000000000005, "grad_norm": 0.01175402756780386, "learning_rate": 0.0002, "loss": 0.6315722465515137, "mean_token_accuracy": 0.7412132248282433, "num_tokens": 26671733.0, "step": 713 }, { "entropy": 0.6141394674777985, "epoch": 4.5504, "grad_norm": 0.01065735798329115, "learning_rate": 0.0002, "loss": 0.6193619966506958, "mean_token_accuracy": 0.7467841058969498, "num_tokens": 26708976.0, "step": 714 }, { "entropy": 0.6316620260477066, "epoch": 4.5568, "grad_norm": 0.01289924792945385, "learning_rate": 0.0002, "loss": 0.6370086669921875, "mean_token_accuracy": 0.7389457300305367, "num_tokens": 26746597.0, "step": 715 }, { "entropy": 0.6334016472101212, "epoch": 4.5632, "grad_norm": 0.01159643568098545, "learning_rate": 0.0002, "loss": 0.6357477307319641, "mean_token_accuracy": 0.7415767312049866, "num_tokens": 26784347.0, "step": 716 }, { "entropy": 0.6209512129426003, "epoch": 4.5696, "grad_norm": 0.012357997708022594, "learning_rate": 0.0002, "loss": 0.620951235294342, "mean_token_accuracy": 0.7445131912827492, "num_tokens": 26821369.0, "step": 717 }, { "entropy": 0.6184145584702492, "epoch": 4.576, "grad_norm": 0.011790684424340725, "learning_rate": 0.0002, "loss": 0.6185816526412964, "mean_token_accuracy": 0.7467178478837013, "num_tokens": 26858658.0, "step": 718 }, { "entropy": 0.6372607722878456, "epoch": 4.5824, "grad_norm": 0.011222328059375286, "learning_rate": 0.0002, "loss": 0.6393177509307861, "mean_token_accuracy": 0.7393923178315163, "num_tokens": 26896679.0, "step": 719 }, { "entropy": 0.6263199970126152, "epoch": 4.5888, "grad_norm": 0.01184337493032217, "learning_rate": 0.0002, "loss": 0.6317442059516907, "mean_token_accuracy": 0.7412994503974915, "num_tokens": 26934191.0, "step": 720 }, { "entropy": 0.6313236430287361, "epoch": 4.5952, "grad_norm": 0.012818049639463425, "learning_rate": 0.0002, "loss": 0.6400792002677917, "mean_token_accuracy": 0.7399108409881592, "num_tokens": 26971795.0, "step": 721 }, { "entropy": 0.6408603191375732, "epoch": 4.6016, "grad_norm": 0.011262350715696812, "learning_rate": 0.0002, "loss": 0.6372708678245544, "mean_token_accuracy": 0.7409083321690559, "num_tokens": 27009541.0, "step": 722 }, { "entropy": 0.6237692162394524, "epoch": 4.608, "grad_norm": 0.01265136618167162, "learning_rate": 0.0002, "loss": 0.6219276189804077, "mean_token_accuracy": 0.74643175303936, "num_tokens": 27047207.0, "step": 723 }, { "entropy": 0.6229505017399788, "epoch": 4.6144, "grad_norm": 0.01034928485751152, "learning_rate": 0.0002, "loss": 0.6240932941436768, "mean_token_accuracy": 0.7452475875616074, "num_tokens": 27084670.0, "step": 724 }, { "entropy": 0.6106055229902267, "epoch": 4.6208, "grad_norm": 0.012862354516983032, "learning_rate": 0.0002, "loss": 0.6164753437042236, "mean_token_accuracy": 0.7482388094067574, "num_tokens": 27122124.0, "step": 725 }, { "entropy": 0.6230287775397301, "epoch": 4.6272, "grad_norm": 0.012530112639069557, "learning_rate": 0.0002, "loss": 0.6248811483383179, "mean_token_accuracy": 0.745893694460392, "num_tokens": 27159984.0, "step": 726 }, { "entropy": 0.6258671432733536, "epoch": 4.6336, "grad_norm": 0.011710980907082558, "learning_rate": 0.0002, "loss": 0.6271563768386841, "mean_token_accuracy": 0.7450519576668739, "num_tokens": 27197583.0, "step": 727 }, { "entropy": 0.6244168281555176, "epoch": 4.64, "grad_norm": 0.012283277697861195, "learning_rate": 0.0002, "loss": 0.6260854005813599, "mean_token_accuracy": 0.7433378919959068, "num_tokens": 27235084.0, "step": 728 }, { "entropy": 0.6399951577186584, "epoch": 4.6464, "grad_norm": 0.010510124266147614, "learning_rate": 0.0002, "loss": 0.6376748085021973, "mean_token_accuracy": 0.7380894720554352, "num_tokens": 27272833.0, "step": 729 }, { "entropy": 0.6234357804059982, "epoch": 4.6528, "grad_norm": 0.014871729537844658, "learning_rate": 0.0002, "loss": 0.6165429353713989, "mean_token_accuracy": 0.7468608766794205, "num_tokens": 27310301.0, "step": 730 }, { "entropy": 0.6247937902808189, "epoch": 4.6592, "grad_norm": 0.010685059241950512, "learning_rate": 0.0002, "loss": 0.6294916868209839, "mean_token_accuracy": 0.7414043098688126, "num_tokens": 27347720.0, "step": 731 }, { "entropy": 0.6104548647999763, "epoch": 4.6655999999999995, "grad_norm": 0.018121415749192238, "learning_rate": 0.0002, "loss": 0.6216402053833008, "mean_token_accuracy": 0.7466417998075485, "num_tokens": 27385336.0, "step": 732 }, { "entropy": 0.6151935011148453, "epoch": 4.672, "grad_norm": 0.010607750155031681, "learning_rate": 0.0002, "loss": 0.6190038323402405, "mean_token_accuracy": 0.7471088394522667, "num_tokens": 27422696.0, "step": 733 }, { "entropy": 0.625689759850502, "epoch": 4.6784, "grad_norm": 0.014054366387426853, "learning_rate": 0.0002, "loss": 0.6243985295295715, "mean_token_accuracy": 0.7436644211411476, "num_tokens": 27460268.0, "step": 734 }, { "entropy": 0.6268169730901718, "epoch": 4.6848, "grad_norm": 0.012450247071683407, "learning_rate": 0.0002, "loss": 0.6240094900131226, "mean_token_accuracy": 0.743643693625927, "num_tokens": 27498085.0, "step": 735 }, { "entropy": 0.6271230131387711, "epoch": 4.6912, "grad_norm": 0.011883650906383991, "learning_rate": 0.0002, "loss": 0.6317532062530518, "mean_token_accuracy": 0.7423899173736572, "num_tokens": 27535478.0, "step": 736 }, { "entropy": 0.6135580986738205, "epoch": 4.6975999999999996, "grad_norm": 0.014882571063935757, "learning_rate": 0.0002, "loss": 0.6232122182846069, "mean_token_accuracy": 0.7451476007699966, "num_tokens": 27572692.0, "step": 737 }, { "entropy": 0.6177224218845367, "epoch": 4.704, "grad_norm": 0.011081320233643055, "learning_rate": 0.0002, "loss": 0.6193344593048096, "mean_token_accuracy": 0.7470099404454231, "num_tokens": 27610526.0, "step": 738 }, { "entropy": 0.618368849158287, "epoch": 4.7104, "grad_norm": 0.01142704114317894, "learning_rate": 0.0002, "loss": 0.618331789970398, "mean_token_accuracy": 0.7472382485866547, "num_tokens": 27648029.0, "step": 739 }, { "entropy": 0.6240565925836563, "epoch": 4.7168, "grad_norm": 0.011985547840595245, "learning_rate": 0.0002, "loss": 0.624761700630188, "mean_token_accuracy": 0.7442751675844193, "num_tokens": 27685924.0, "step": 740 }, { "entropy": 0.6319902166724205, "epoch": 4.7232, "grad_norm": 0.012069285847246647, "learning_rate": 0.0002, "loss": 0.6318994164466858, "mean_token_accuracy": 0.739115908741951, "num_tokens": 27723816.0, "step": 741 }, { "entropy": 0.6412005797028542, "epoch": 4.7296, "grad_norm": 0.01274879090487957, "learning_rate": 0.0002, "loss": 0.6381031274795532, "mean_token_accuracy": 0.7396308556199074, "num_tokens": 27761867.0, "step": 742 }, { "entropy": 0.6192675158381462, "epoch": 4.736, "grad_norm": 0.00995372049510479, "learning_rate": 0.0002, "loss": 0.62370765209198, "mean_token_accuracy": 0.7466439455747604, "num_tokens": 27799496.0, "step": 743 }, { "entropy": 0.6180000007152557, "epoch": 4.7424, "grad_norm": 0.012485142797231674, "learning_rate": 0.0002, "loss": 0.618539035320282, "mean_token_accuracy": 0.7472988590598106, "num_tokens": 27836904.0, "step": 744 }, { "entropy": 0.6233759000897408, "epoch": 4.7488, "grad_norm": 0.01297292672097683, "learning_rate": 0.0002, "loss": 0.6253551244735718, "mean_token_accuracy": 0.743793860077858, "num_tokens": 27874562.0, "step": 745 }, { "entropy": 0.6195263043045998, "epoch": 4.7552, "grad_norm": 0.013405952602624893, "learning_rate": 0.0002, "loss": 0.6302239298820496, "mean_token_accuracy": 0.7412486523389816, "num_tokens": 27911903.0, "step": 746 }, { "entropy": 0.6423712894320488, "epoch": 4.7616, "grad_norm": 0.011862635612487793, "learning_rate": 0.0002, "loss": 0.6428091526031494, "mean_token_accuracy": 0.735967144370079, "num_tokens": 27949551.0, "step": 747 }, { "entropy": 0.6365993991494179, "epoch": 4.768, "grad_norm": 0.011519255116581917, "learning_rate": 0.0002, "loss": 0.6331340074539185, "mean_token_accuracy": 0.7445235848426819, "num_tokens": 27987167.0, "step": 748 }, { "entropy": 0.6285323649644852, "epoch": 4.7744, "grad_norm": 0.011068753898143768, "learning_rate": 0.0002, "loss": 0.6295030117034912, "mean_token_accuracy": 0.7423546016216278, "num_tokens": 28024667.0, "step": 749 }, { "entropy": 0.6225018426775932, "epoch": 4.7808, "grad_norm": 0.012251611799001694, "learning_rate": 0.0002, "loss": 0.6240028142929077, "mean_token_accuracy": 0.7458074688911438, "num_tokens": 28062045.0, "step": 750 }, { "entropy": 0.6218413189053535, "epoch": 4.7872, "grad_norm": 0.011230433359742165, "learning_rate": 0.0002, "loss": 0.625887393951416, "mean_token_accuracy": 0.7432527989149094, "num_tokens": 28099618.0, "step": 751 }, { "entropy": 0.605789877474308, "epoch": 4.7936, "grad_norm": 0.01227335911244154, "learning_rate": 0.0002, "loss": 0.6102015376091003, "mean_token_accuracy": 0.7511238679289818, "num_tokens": 28137039.0, "step": 752 }, { "entropy": 0.6157144531607628, "epoch": 4.8, "grad_norm": 0.01124510820955038, "learning_rate": 0.0002, "loss": 0.6144552230834961, "mean_token_accuracy": 0.7501148656010628, "num_tokens": 28174015.0, "step": 753 }, { "entropy": 0.6372276619076729, "epoch": 4.8064, "grad_norm": 0.012294857762753963, "learning_rate": 0.0002, "loss": 0.6344669461250305, "mean_token_accuracy": 0.7430569604039192, "num_tokens": 28211765.0, "step": 754 }, { "entropy": 0.618014894425869, "epoch": 4.8128, "grad_norm": 0.01041495706886053, "learning_rate": 0.0002, "loss": 0.6209543943405151, "mean_token_accuracy": 0.7452011853456497, "num_tokens": 28249441.0, "step": 755 }, { "entropy": 0.6153213605284691, "epoch": 4.8192, "grad_norm": 0.012670926749706268, "learning_rate": 0.0002, "loss": 0.6228734254837036, "mean_token_accuracy": 0.7460622638463974, "num_tokens": 28286854.0, "step": 756 }, { "entropy": 0.6158452033996582, "epoch": 4.8256, "grad_norm": 0.012129560112953186, "learning_rate": 0.0002, "loss": 0.6199190020561218, "mean_token_accuracy": 0.747655563056469, "num_tokens": 28323945.0, "step": 757 }, { "entropy": 0.6290484443306923, "epoch": 4.832, "grad_norm": 0.01301377359777689, "learning_rate": 0.0002, "loss": 0.6258755922317505, "mean_token_accuracy": 0.7452258318662643, "num_tokens": 28361641.0, "step": 758 }, { "entropy": 0.634510226547718, "epoch": 4.8384, "grad_norm": 0.011934357695281506, "learning_rate": 0.0002, "loss": 0.6296937465667725, "mean_token_accuracy": 0.742583654820919, "num_tokens": 28399119.0, "step": 759 }, { "entropy": 0.6339060291647911, "epoch": 4.8448, "grad_norm": 0.010478752665221691, "learning_rate": 0.0002, "loss": 0.6356696486473083, "mean_token_accuracy": 0.7409758344292641, "num_tokens": 28436921.0, "step": 760 }, { "entropy": 0.6190384924411774, "epoch": 4.8512, "grad_norm": 0.013402252458035946, "learning_rate": 0.0002, "loss": 0.6263437271118164, "mean_token_accuracy": 0.7457704097032547, "num_tokens": 28474709.0, "step": 761 }, { "entropy": 0.6296346411108971, "epoch": 4.8576, "grad_norm": 0.01403774507343769, "learning_rate": 0.0002, "loss": 0.6382781267166138, "mean_token_accuracy": 0.740397572517395, "num_tokens": 28512263.0, "step": 762 }, { "entropy": 0.6387407630681992, "epoch": 4.864, "grad_norm": 0.010807156562805176, "learning_rate": 0.0002, "loss": 0.6353914141654968, "mean_token_accuracy": 0.7394013479351997, "num_tokens": 28549975.0, "step": 763 }, { "entropy": 0.6354725807905197, "epoch": 4.8704, "grad_norm": 0.013257911428809166, "learning_rate": 0.0002, "loss": 0.6323150396347046, "mean_token_accuracy": 0.7414470240473747, "num_tokens": 28587095.0, "step": 764 }, { "entropy": 0.6424222439527512, "epoch": 4.8768, "grad_norm": 0.012375367805361748, "learning_rate": 0.0002, "loss": 0.64325350522995, "mean_token_accuracy": 0.7369028478860855, "num_tokens": 28624868.0, "step": 765 }, { "entropy": 0.6223215311765671, "epoch": 4.8832, "grad_norm": 0.013609180226922035, "learning_rate": 0.0002, "loss": 0.6308131217956543, "mean_token_accuracy": 0.7428993359208107, "num_tokens": 28662266.0, "step": 766 }, { "entropy": 0.6198636963963509, "epoch": 4.8896, "grad_norm": 0.011831787414848804, "learning_rate": 0.0002, "loss": 0.6238384246826172, "mean_token_accuracy": 0.7449830919504166, "num_tokens": 28700199.0, "step": 767 }, { "entropy": 0.6371955797076225, "epoch": 4.896, "grad_norm": 0.011555573903024197, "learning_rate": 0.0002, "loss": 0.6325588822364807, "mean_token_accuracy": 0.7409590929746628, "num_tokens": 28737979.0, "step": 768 }, { "entropy": 0.6182679012417793, "epoch": 4.9024, "grad_norm": 0.01133381575345993, "learning_rate": 0.0002, "loss": 0.6179029941558838, "mean_token_accuracy": 0.7483383342623711, "num_tokens": 28775432.0, "step": 769 }, { "entropy": 0.6291498392820358, "epoch": 4.9088, "grad_norm": 0.010519672185182571, "learning_rate": 0.0002, "loss": 0.6308712363243103, "mean_token_accuracy": 0.7437527477741241, "num_tokens": 28812536.0, "step": 770 }, { "entropy": 0.6246335506439209, "epoch": 4.9152000000000005, "grad_norm": 0.013134768232703209, "learning_rate": 0.0002, "loss": 0.6342728734016418, "mean_token_accuracy": 0.7407044470310211, "num_tokens": 28850060.0, "step": 771 }, { "entropy": 0.6130682453513145, "epoch": 4.9216, "grad_norm": 0.010492725297808647, "learning_rate": 0.0002, "loss": 0.6162416934967041, "mean_token_accuracy": 0.7491699755191803, "num_tokens": 28887643.0, "step": 772 }, { "entropy": 0.6313211023807526, "epoch": 4.928, "grad_norm": 0.011192471720278263, "learning_rate": 0.0002, "loss": 0.631119966506958, "mean_token_accuracy": 0.741656944155693, "num_tokens": 28925297.0, "step": 773 }, { "entropy": 0.6132954135537148, "epoch": 4.9344, "grad_norm": 0.00988168828189373, "learning_rate": 0.0002, "loss": 0.6083347201347351, "mean_token_accuracy": 0.7506287023425102, "num_tokens": 28962437.0, "step": 774 }, { "entropy": 0.6186309084296227, "epoch": 4.9408, "grad_norm": 0.011386038735508919, "learning_rate": 0.0002, "loss": 0.6201795339584351, "mean_token_accuracy": 0.7484031617641449, "num_tokens": 28999874.0, "step": 775 }, { "entropy": 0.6235462054610252, "epoch": 4.9472000000000005, "grad_norm": 0.011064821854233742, "learning_rate": 0.0002, "loss": 0.6267992258071899, "mean_token_accuracy": 0.7443990632891655, "num_tokens": 29037497.0, "step": 776 }, { "entropy": 0.6196893155574799, "epoch": 4.9536, "grad_norm": 0.012706468813121319, "learning_rate": 0.0002, "loss": 0.6288238763809204, "mean_token_accuracy": 0.7432743161916733, "num_tokens": 29074815.0, "step": 777 }, { "entropy": 0.6359954103827477, "epoch": 4.96, "grad_norm": 0.01185152493417263, "learning_rate": 0.0002, "loss": 0.6353201866149902, "mean_token_accuracy": 0.7408851012587547, "num_tokens": 29112518.0, "step": 778 }, { "entropy": 0.6222160458564758, "epoch": 4.9664, "grad_norm": 0.011700387112796307, "learning_rate": 0.0002, "loss": 0.6173217296600342, "mean_token_accuracy": 0.7465430647134781, "num_tokens": 29150199.0, "step": 779 }, { "entropy": 0.6329935416579247, "epoch": 4.9728, "grad_norm": 0.011351538822054863, "learning_rate": 0.0002, "loss": 0.6344210505485535, "mean_token_accuracy": 0.7397899106144905, "num_tokens": 29187985.0, "step": 780 }, { "entropy": 0.6197427585721016, "epoch": 4.9792, "grad_norm": 0.013295335695147514, "learning_rate": 0.0002, "loss": 0.6274314522743225, "mean_token_accuracy": 0.742200955748558, "num_tokens": 29225578.0, "step": 781 }, { "entropy": 0.6366394832730293, "epoch": 4.9856, "grad_norm": 0.011197940446436405, "learning_rate": 0.0002, "loss": 0.6420581340789795, "mean_token_accuracy": 0.7372548654675484, "num_tokens": 29263081.0, "step": 782 }, { "entropy": 0.623991571366787, "epoch": 4.992, "grad_norm": 0.012578215450048447, "learning_rate": 0.0002, "loss": 0.6253401041030884, "mean_token_accuracy": 0.7438567355275154, "num_tokens": 29300476.0, "step": 783 }, { "entropy": 0.6156981587409973, "epoch": 4.9984, "grad_norm": 0.010751175694167614, "learning_rate": 0.0002, "loss": 0.616902232170105, "mean_token_accuracy": 0.7490730434656143, "num_tokens": 29337892.0, "step": 784 }, { "entropy": 0.6212073564529419, "epoch": 5.0, "grad_norm": 0.0221311803907156, "learning_rate": 0.0002, "loss": 0.6252682209014893, "mean_token_accuracy": 0.7461582720279694, "num_tokens": 29347371.0, "step": 785 } ], "logging_steps": 1, "max_steps": 785, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2.7322491635624837e+18, "train_batch_size": 4, "trial_name": null, "trial_params": null }