{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 5.0, "eval_steps": 500, "global_step": 770, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.1441087871789932, "epoch": 0.006498781478472786, "grad_norm": 0.22594086825847626, "learning_rate": 0.0002, "loss": 2.612501859664917, "mean_token_accuracy": 0.5085290372371674, "num_tokens": 37502.0, "step": 1 }, { "entropy": 1.2685535103082657, "epoch": 0.012997562956945572, "grad_norm": 0.1942373365163803, "learning_rate": 0.0002, "loss": 2.2667126655578613, "mean_token_accuracy": 0.5350659266114235, "num_tokens": 75406.0, "step": 2 }, { "entropy": 1.4654520899057388, "epoch": 0.01949634443541836, "grad_norm": 0.13897432386875153, "learning_rate": 0.0002, "loss": 1.8304898738861084, "mean_token_accuracy": 0.5590623021125793, "num_tokens": 112903.0, "step": 3 }, { "entropy": 1.4532236605882645, "epoch": 0.025995125913891144, "grad_norm": 0.11201836168766022, "learning_rate": 0.0002, "loss": 1.496299147605896, "mean_token_accuracy": 0.6046230122447014, "num_tokens": 150359.0, "step": 4 }, { "entropy": 1.4331371188163757, "epoch": 0.03249390739236393, "grad_norm": 0.14954882860183716, "learning_rate": 0.0002, "loss": 1.3865656852722168, "mean_token_accuracy": 0.6091600209474564, "num_tokens": 187830.0, "step": 5 }, { "entropy": 1.3669009655714035, "epoch": 0.03899268887083672, "grad_norm": 0.09565649181604385, "learning_rate": 0.0002, "loss": 1.2659735679626465, "mean_token_accuracy": 0.6358497440814972, "num_tokens": 225297.0, "step": 6 }, { "entropy": 1.2914617359638214, "epoch": 0.045491470349309504, "grad_norm": 0.0539422333240509, "learning_rate": 0.0002, "loss": 1.1662700176239014, "mean_token_accuracy": 0.6492680311203003, "num_tokens": 262906.0, "step": 7 }, { "entropy": 1.249274119734764, "epoch": 0.05199025182778229, "grad_norm": 0.051388416439294815, "learning_rate": 0.0002, "loss": 1.1255854368209839, "mean_token_accuracy": 0.6475581750273705, "num_tokens": 300403.0, "step": 8 }, { "entropy": 1.1595238000154495, "epoch": 0.05848903330625508, "grad_norm": 0.057235199958086014, "learning_rate": 0.0002, "loss": 1.0490708351135254, "mean_token_accuracy": 0.6654231324791908, "num_tokens": 337487.0, "step": 9 }, { "entropy": 1.0685205161571503, "epoch": 0.06498781478472786, "grad_norm": 0.0577155165374279, "learning_rate": 0.0002, "loss": 0.97551429271698, "mean_token_accuracy": 0.6776877418160439, "num_tokens": 374847.0, "step": 10 }, { "entropy": 0.9968453124165535, "epoch": 0.07148659626320066, "grad_norm": 0.04976983740925789, "learning_rate": 0.0002, "loss": 0.9292951822280884, "mean_token_accuracy": 0.6831405088305473, "num_tokens": 412186.0, "step": 11 }, { "entropy": 0.9424244612455368, "epoch": 0.07798537774167344, "grad_norm": 0.37462693452835083, "learning_rate": 0.0002, "loss": 0.8883110284805298, "mean_token_accuracy": 0.6893546730279922, "num_tokens": 449659.0, "step": 12 }, { "entropy": 0.9025738090276718, "epoch": 0.08448415922014622, "grad_norm": 0.04783688113093376, "learning_rate": 0.0002, "loss": 0.8548192977905273, "mean_token_accuracy": 0.6972228810191154, "num_tokens": 487236.0, "step": 13 }, { "entropy": 0.8390183448791504, "epoch": 0.09098294069861901, "grad_norm": 0.06745485961437225, "learning_rate": 0.0002, "loss": 0.8280504941940308, "mean_token_accuracy": 0.7010790929198265, "num_tokens": 524798.0, "step": 14 }, { "entropy": 0.7939982861280441, "epoch": 0.09748172217709179, "grad_norm": 0.10931341350078583, "learning_rate": 0.0002, "loss": 0.8073402643203735, "mean_token_accuracy": 0.702845998108387, "num_tokens": 561826.0, "step": 15 }, { "entropy": 0.762756697833538, "epoch": 0.10398050365556458, "grad_norm": 0.03783512860536575, "learning_rate": 0.0002, "loss": 0.7596306800842285, "mean_token_accuracy": 0.7148320376873016, "num_tokens": 599249.0, "step": 16 }, { "entropy": 0.7585324719548225, "epoch": 0.11047928513403736, "grad_norm": 0.039289139211177826, "learning_rate": 0.0002, "loss": 0.7472726106643677, "mean_token_accuracy": 0.7169229537248611, "num_tokens": 636495.0, "step": 17 }, { "entropy": 0.7434245273470879, "epoch": 0.11697806661251016, "grad_norm": 0.04286178946495056, "learning_rate": 0.0002, "loss": 0.7349382638931274, "mean_token_accuracy": 0.7195246070623398, "num_tokens": 674172.0, "step": 18 }, { "entropy": 0.7307169139385223, "epoch": 0.12347684809098294, "grad_norm": 0.03696495294570923, "learning_rate": 0.0002, "loss": 0.7205268144607544, "mean_token_accuracy": 0.7222909703850746, "num_tokens": 711746.0, "step": 19 }, { "entropy": 0.724890224635601, "epoch": 0.12997562956945571, "grad_norm": 0.03647635132074356, "learning_rate": 0.0002, "loss": 0.7131904363632202, "mean_token_accuracy": 0.7218770682811737, "num_tokens": 748966.0, "step": 20 }, { "entropy": 0.7279537171125412, "epoch": 0.1364744110479285, "grad_norm": 0.033042650669813156, "learning_rate": 0.0002, "loss": 0.7094431519508362, "mean_token_accuracy": 0.7240697368979454, "num_tokens": 786631.0, "step": 21 }, { "entropy": 0.7210045382380486, "epoch": 0.1429731925264013, "grad_norm": 0.033061351627111435, "learning_rate": 0.0002, "loss": 0.7019110918045044, "mean_token_accuracy": 0.7280351296067238, "num_tokens": 823906.0, "step": 22 }, { "entropy": 0.6902946382761002, "epoch": 0.14947197400487408, "grad_norm": 0.03491866961121559, "learning_rate": 0.0002, "loss": 0.683687150478363, "mean_token_accuracy": 0.7348670437932014, "num_tokens": 860977.0, "step": 23 }, { "entropy": 0.6839202269911766, "epoch": 0.15597075548334688, "grad_norm": 0.030243346467614174, "learning_rate": 0.0002, "loss": 0.673778772354126, "mean_token_accuracy": 0.7354807555675507, "num_tokens": 898933.0, "step": 24 }, { "entropy": 0.6664924547076225, "epoch": 0.16246953696181965, "grad_norm": 0.026247479021549225, "learning_rate": 0.0002, "loss": 0.6572352051734924, "mean_token_accuracy": 0.7394573912024498, "num_tokens": 935795.0, "step": 25 }, { "entropy": 0.6681515946984291, "epoch": 0.16896831844029245, "grad_norm": 0.03119724616408348, "learning_rate": 0.0002, "loss": 0.6646086573600769, "mean_token_accuracy": 0.7379100769758224, "num_tokens": 973280.0, "step": 26 }, { "entropy": 0.6617112681269646, "epoch": 0.17546709991876522, "grad_norm": 0.031551606953144073, "learning_rate": 0.0002, "loss": 0.6585603952407837, "mean_token_accuracy": 0.7389705181121826, "num_tokens": 1010622.0, "step": 27 }, { "entropy": 0.6501665636897087, "epoch": 0.18196588139723802, "grad_norm": 0.02211320586502552, "learning_rate": 0.0002, "loss": 0.6490904092788696, "mean_token_accuracy": 0.7440381571650505, "num_tokens": 1047900.0, "step": 28 }, { "entropy": 0.6470993533730507, "epoch": 0.18846466287571081, "grad_norm": 0.027688423171639442, "learning_rate": 0.0002, "loss": 0.6543895602226257, "mean_token_accuracy": 0.7402380779385567, "num_tokens": 1085392.0, "step": 29 }, { "entropy": 0.6416624039411545, "epoch": 0.19496344435418358, "grad_norm": 0.025217361748218536, "learning_rate": 0.0002, "loss": 0.651384711265564, "mean_token_accuracy": 0.7433382496237755, "num_tokens": 1122465.0, "step": 30 }, { "entropy": 0.6523652598261833, "epoch": 0.20146222583265638, "grad_norm": 0.025227373465895653, "learning_rate": 0.0002, "loss": 0.6592613458633423, "mean_token_accuracy": 0.7378358989953995, "num_tokens": 1160451.0, "step": 31 }, { "entropy": 0.6369072422385216, "epoch": 0.20796100731112915, "grad_norm": 0.021375838667154312, "learning_rate": 0.0002, "loss": 0.6419180631637573, "mean_token_accuracy": 0.7449744045734406, "num_tokens": 1198041.0, "step": 32 }, { "entropy": 0.6256191805005074, "epoch": 0.21445978878960195, "grad_norm": 0.03092559427022934, "learning_rate": 0.0002, "loss": 0.6407320499420166, "mean_token_accuracy": 0.7460681945085526, "num_tokens": 1235291.0, "step": 33 }, { "entropy": 0.6299648508429527, "epoch": 0.22095857026807472, "grad_norm": 0.021124541759490967, "learning_rate": 0.0002, "loss": 0.6359473466873169, "mean_token_accuracy": 0.7471542730927467, "num_tokens": 1272686.0, "step": 34 }, { "entropy": 0.6513500586152077, "epoch": 0.22745735174654752, "grad_norm": 0.020855363458395004, "learning_rate": 0.0002, "loss": 0.6451584100723267, "mean_token_accuracy": 0.7422506660223007, "num_tokens": 1310182.0, "step": 35 }, { "entropy": 0.6261186450719833, "epoch": 0.23395613322502032, "grad_norm": 0.019606754183769226, "learning_rate": 0.0002, "loss": 0.6181178092956543, "mean_token_accuracy": 0.7557711079716682, "num_tokens": 1347558.0, "step": 36 }, { "entropy": 0.6535262390971184, "epoch": 0.2404549147034931, "grad_norm": 0.016229776665568352, "learning_rate": 0.0002, "loss": 0.6474911570549011, "mean_token_accuracy": 0.7401541844010353, "num_tokens": 1385217.0, "step": 37 }, { "entropy": 0.6392895579338074, "epoch": 0.2469536961819659, "grad_norm": 0.01589571312069893, "learning_rate": 0.0002, "loss": 0.6345689296722412, "mean_token_accuracy": 0.7464647218585014, "num_tokens": 1422439.0, "step": 38 }, { "entropy": 0.6444704979658127, "epoch": 0.25345247766043866, "grad_norm": 0.019169991835951805, "learning_rate": 0.0002, "loss": 0.6417882442474365, "mean_token_accuracy": 0.7431693077087402, "num_tokens": 1459951.0, "step": 39 }, { "entropy": 0.6366401016712189, "epoch": 0.25995125913891143, "grad_norm": 0.016541991382837296, "learning_rate": 0.0002, "loss": 0.6387360095977783, "mean_token_accuracy": 0.7458900958299637, "num_tokens": 1497263.0, "step": 40 }, { "entropy": 0.6309419572353363, "epoch": 0.26645004061738425, "grad_norm": 0.02144729532301426, "learning_rate": 0.0002, "loss": 0.635954737663269, "mean_token_accuracy": 0.7469696402549744, "num_tokens": 1534631.0, "step": 41 }, { "entropy": 0.6426582857966423, "epoch": 0.272948822095857, "grad_norm": 0.017918268218636513, "learning_rate": 0.0002, "loss": 0.6445891261100769, "mean_token_accuracy": 0.7427951768040657, "num_tokens": 1572110.0, "step": 42 }, { "entropy": 0.6238497421145439, "epoch": 0.2794476035743298, "grad_norm": 0.016322394832968712, "learning_rate": 0.0002, "loss": 0.6238967180252075, "mean_token_accuracy": 0.7503543570637703, "num_tokens": 1608997.0, "step": 43 }, { "entropy": 0.6374280378222466, "epoch": 0.2859463850528026, "grad_norm": 0.0153085608035326, "learning_rate": 0.0002, "loss": 0.6364343762397766, "mean_token_accuracy": 0.745714507997036, "num_tokens": 1646556.0, "step": 44 }, { "entropy": 0.6222607344388962, "epoch": 0.2924451665312754, "grad_norm": 0.016996094956994057, "learning_rate": 0.0002, "loss": 0.6201090812683105, "mean_token_accuracy": 0.7516758143901825, "num_tokens": 1683700.0, "step": 45 }, { "entropy": 0.636712834239006, "epoch": 0.29894394800974816, "grad_norm": 0.016749687492847443, "learning_rate": 0.0002, "loss": 0.6368897557258606, "mean_token_accuracy": 0.746493011713028, "num_tokens": 1720661.0, "step": 46 }, { "entropy": 0.6459397748112679, "epoch": 0.30544272948822093, "grad_norm": 0.011651836335659027, "learning_rate": 0.0002, "loss": 0.6419233083724976, "mean_token_accuracy": 0.7443490549921989, "num_tokens": 1758131.0, "step": 47 }, { "entropy": 0.6379885226488113, "epoch": 0.31194151096669376, "grad_norm": 0.013901753351092339, "learning_rate": 0.0002, "loss": 0.6361222267150879, "mean_token_accuracy": 0.746205136179924, "num_tokens": 1795397.0, "step": 48 }, { "entropy": 0.6377697363495827, "epoch": 0.31844029244516653, "grad_norm": 0.014066919684410095, "learning_rate": 0.0002, "loss": 0.6356197595596313, "mean_token_accuracy": 0.7455531656742096, "num_tokens": 1832991.0, "step": 49 }, { "entropy": 0.6351528614759445, "epoch": 0.3249390739236393, "grad_norm": 0.013286196626722813, "learning_rate": 0.0002, "loss": 0.6371215581893921, "mean_token_accuracy": 0.7454295605421066, "num_tokens": 1870273.0, "step": 50 }, { "entropy": 0.6069519519805908, "epoch": 0.3314378554021121, "grad_norm": 0.013732723891735077, "learning_rate": 0.0002, "loss": 0.6103472709655762, "mean_token_accuracy": 0.7536283582448959, "num_tokens": 1907528.0, "step": 51 }, { "entropy": 0.6297546997666359, "epoch": 0.3379366368805849, "grad_norm": 0.013711776584386826, "learning_rate": 0.0002, "loss": 0.6334048509597778, "mean_token_accuracy": 0.745865486562252, "num_tokens": 1945255.0, "step": 52 }, { "entropy": 0.6280607059597969, "epoch": 0.34443541835905767, "grad_norm": 0.01293123047798872, "learning_rate": 0.0002, "loss": 0.6310492753982544, "mean_token_accuracy": 0.7467462942004204, "num_tokens": 1982630.0, "step": 53 }, { "entropy": 0.6271316409111023, "epoch": 0.35093419983753044, "grad_norm": 0.01478263083845377, "learning_rate": 0.0002, "loss": 0.6254487037658691, "mean_token_accuracy": 0.7497461065649986, "num_tokens": 2020399.0, "step": 54 }, { "entropy": 0.6377271711826324, "epoch": 0.35743298131600326, "grad_norm": 0.013956044800579548, "learning_rate": 0.0002, "loss": 0.6360988020896912, "mean_token_accuracy": 0.7437145560979843, "num_tokens": 2057803.0, "step": 55 }, { "entropy": 0.6247914582490921, "epoch": 0.36393176279447603, "grad_norm": 0.014322548173367977, "learning_rate": 0.0002, "loss": 0.6240888833999634, "mean_token_accuracy": 0.7484056130051613, "num_tokens": 2094784.0, "step": 56 }, { "entropy": 0.6302464827895164, "epoch": 0.3704305442729488, "grad_norm": 0.011746145784854889, "learning_rate": 0.0002, "loss": 0.633884608745575, "mean_token_accuracy": 0.7437854781746864, "num_tokens": 2132466.0, "step": 57 }, { "entropy": 0.6274847015738487, "epoch": 0.37692932575142163, "grad_norm": 0.013853202573955059, "learning_rate": 0.0002, "loss": 0.6355714797973633, "mean_token_accuracy": 0.7430111691355705, "num_tokens": 2169906.0, "step": 58 }, { "entropy": 0.6265148296952248, "epoch": 0.3834281072298944, "grad_norm": 0.01277268398553133, "learning_rate": 0.0002, "loss": 0.6335763335227966, "mean_token_accuracy": 0.7446934059262276, "num_tokens": 2207365.0, "step": 59 }, { "entropy": 0.6214065626263618, "epoch": 0.38992688870836717, "grad_norm": 0.010742721147835255, "learning_rate": 0.0002, "loss": 0.6200428009033203, "mean_token_accuracy": 0.748136468231678, "num_tokens": 2244334.0, "step": 60 }, { "entropy": 0.6408857852220535, "epoch": 0.39642567018683994, "grad_norm": 0.011468583717942238, "learning_rate": 0.0002, "loss": 0.6358450651168823, "mean_token_accuracy": 0.7437937930226326, "num_tokens": 2281670.0, "step": 61 }, { "entropy": 0.6396703198552132, "epoch": 0.40292445166531277, "grad_norm": 0.011673662811517715, "learning_rate": 0.0002, "loss": 0.6363998651504517, "mean_token_accuracy": 0.7431989163160324, "num_tokens": 2318924.0, "step": 62 }, { "entropy": 0.6249052062630653, "epoch": 0.40942323314378554, "grad_norm": 0.0118953175842762, "learning_rate": 0.0002, "loss": 0.6213114261627197, "mean_token_accuracy": 0.7500982582569122, "num_tokens": 2356317.0, "step": 63 }, { "entropy": 0.6271346360445023, "epoch": 0.4159220146222583, "grad_norm": 0.012425282970070839, "learning_rate": 0.0002, "loss": 0.6213847398757935, "mean_token_accuracy": 0.7495132237672806, "num_tokens": 2393601.0, "step": 64 }, { "entropy": 0.629973016679287, "epoch": 0.42242079610073113, "grad_norm": 0.011852126568555832, "learning_rate": 0.0002, "loss": 0.6328772306442261, "mean_token_accuracy": 0.7433357834815979, "num_tokens": 2430713.0, "step": 65 }, { "entropy": 0.625373125076294, "epoch": 0.4289195775792039, "grad_norm": 0.011082636192440987, "learning_rate": 0.0002, "loss": 0.6278108954429626, "mean_token_accuracy": 0.7462311089038849, "num_tokens": 2468332.0, "step": 66 }, { "entropy": 0.6213006973266602, "epoch": 0.4354183590576767, "grad_norm": 0.012099278159439564, "learning_rate": 0.0002, "loss": 0.6325806975364685, "mean_token_accuracy": 0.748037800192833, "num_tokens": 2505751.0, "step": 67 }, { "entropy": 0.6149301454424858, "epoch": 0.44191714053614944, "grad_norm": 0.011624482460319996, "learning_rate": 0.0002, "loss": 0.6194391250610352, "mean_token_accuracy": 0.7509394213557243, "num_tokens": 2543314.0, "step": 68 }, { "entropy": 0.6199035122990608, "epoch": 0.44841592201462227, "grad_norm": 0.010423528961837292, "learning_rate": 0.0002, "loss": 0.6224488615989685, "mean_token_accuracy": 0.749529704451561, "num_tokens": 2580776.0, "step": 69 }, { "entropy": 0.6317284181714058, "epoch": 0.45491470349309504, "grad_norm": 0.010865025222301483, "learning_rate": 0.0002, "loss": 0.6270354986190796, "mean_token_accuracy": 0.7461089566349983, "num_tokens": 2618167.0, "step": 70 }, { "entropy": 0.6248530969023705, "epoch": 0.4614134849715678, "grad_norm": 0.010545512661337852, "learning_rate": 0.0002, "loss": 0.6243047714233398, "mean_token_accuracy": 0.7491967007517815, "num_tokens": 2655748.0, "step": 71 }, { "entropy": 0.6242939457297325, "epoch": 0.46791226645004064, "grad_norm": 0.01175450999289751, "learning_rate": 0.0002, "loss": 0.6177983283996582, "mean_token_accuracy": 0.7500801458954811, "num_tokens": 2693338.0, "step": 72 }, { "entropy": 0.6458104699850082, "epoch": 0.4744110479285134, "grad_norm": 0.009623173624277115, "learning_rate": 0.0002, "loss": 0.6407941579818726, "mean_token_accuracy": 0.7437473684549332, "num_tokens": 2730673.0, "step": 73 }, { "entropy": 0.6289036273956299, "epoch": 0.4809098294069862, "grad_norm": 0.010831008665263653, "learning_rate": 0.0002, "loss": 0.6292392015457153, "mean_token_accuracy": 0.749647282063961, "num_tokens": 2768101.0, "step": 74 }, { "entropy": 0.6329901814460754, "epoch": 0.487408610885459, "grad_norm": 0.013034787029027939, "learning_rate": 0.0002, "loss": 0.6349586248397827, "mean_token_accuracy": 0.7437526881694794, "num_tokens": 2805877.0, "step": 75 }, { "entropy": 0.6201201230287552, "epoch": 0.4939073923639318, "grad_norm": 0.010362153872847557, "learning_rate": 0.0002, "loss": 0.6222230195999146, "mean_token_accuracy": 0.749205470085144, "num_tokens": 2843002.0, "step": 76 }, { "entropy": 0.6270335763692856, "epoch": 0.5004061738424046, "grad_norm": 0.01038055308163166, "learning_rate": 0.0002, "loss": 0.6268460154533386, "mean_token_accuracy": 0.7455538734793663, "num_tokens": 2880433.0, "step": 77 }, { "entropy": 0.6266148760914803, "epoch": 0.5069049553208773, "grad_norm": 0.011833865195512772, "learning_rate": 0.0002, "loss": 0.6316983699798584, "mean_token_accuracy": 0.7472645714879036, "num_tokens": 2917833.0, "step": 78 }, { "entropy": 0.6177176311612129, "epoch": 0.5134037367993501, "grad_norm": 0.012312863022089005, "learning_rate": 0.0002, "loss": 0.620547890663147, "mean_token_accuracy": 0.7489045560359955, "num_tokens": 2955261.0, "step": 79 }, { "entropy": 0.6255826130509377, "epoch": 0.5199025182778229, "grad_norm": 0.011764319613575935, "learning_rate": 0.0002, "loss": 0.6278033256530762, "mean_token_accuracy": 0.7475135996937752, "num_tokens": 2992205.0, "step": 80 }, { "entropy": 0.6303588896989822, "epoch": 0.5264012997562957, "grad_norm": 0.01056460291147232, "learning_rate": 0.0002, "loss": 0.6343796253204346, "mean_token_accuracy": 0.7422873452305794, "num_tokens": 3029696.0, "step": 81 }, { "entropy": 0.6168110445141792, "epoch": 0.5329000812347685, "grad_norm": 0.010063163004815578, "learning_rate": 0.0002, "loss": 0.6208071112632751, "mean_token_accuracy": 0.7490193694829941, "num_tokens": 3067080.0, "step": 82 }, { "entropy": 0.6252159550786018, "epoch": 0.5393988627132412, "grad_norm": 0.010448803193867207, "learning_rate": 0.0002, "loss": 0.6253081560134888, "mean_token_accuracy": 0.7478374615311623, "num_tokens": 3104286.0, "step": 83 }, { "entropy": 0.6273334473371506, "epoch": 0.545897644191714, "grad_norm": 0.010500379838049412, "learning_rate": 0.0002, "loss": 0.6298959255218506, "mean_token_accuracy": 0.7449745014309883, "num_tokens": 3141685.0, "step": 84 }, { "entropy": 0.6271170675754547, "epoch": 0.5523964256701869, "grad_norm": 0.011779806576669216, "learning_rate": 0.0002, "loss": 0.6241638660430908, "mean_token_accuracy": 0.7471632659435272, "num_tokens": 3178925.0, "step": 85 }, { "entropy": 0.6358036622405052, "epoch": 0.5588952071486596, "grad_norm": 0.010791173204779625, "learning_rate": 0.0002, "loss": 0.6331329941749573, "mean_token_accuracy": 0.7441665381193161, "num_tokens": 3216076.0, "step": 86 }, { "entropy": 0.6320113763213158, "epoch": 0.5653939886271324, "grad_norm": 0.009891759604215622, "learning_rate": 0.0002, "loss": 0.6326582431793213, "mean_token_accuracy": 0.7445697784423828, "num_tokens": 3253700.0, "step": 87 }, { "entropy": 0.6250990331172943, "epoch": 0.5718927701056052, "grad_norm": 0.013541702181100845, "learning_rate": 0.0002, "loss": 0.6289629936218262, "mean_token_accuracy": 0.745047003030777, "num_tokens": 3291250.0, "step": 88 }, { "entropy": 0.6287946552038193, "epoch": 0.578391551584078, "grad_norm": 0.009651604108512402, "learning_rate": 0.0002, "loss": 0.6300573348999023, "mean_token_accuracy": 0.7451979964971542, "num_tokens": 3328548.0, "step": 89 }, { "entropy": 0.6240335181355476, "epoch": 0.5848903330625508, "grad_norm": 0.009283720515668392, "learning_rate": 0.0002, "loss": 0.6263805031776428, "mean_token_accuracy": 0.7456449046730995, "num_tokens": 3365327.0, "step": 90 }, { "entropy": 0.6241980046033859, "epoch": 0.5913891145410236, "grad_norm": 0.010714948177337646, "learning_rate": 0.0002, "loss": 0.625645637512207, "mean_token_accuracy": 0.7471252828836441, "num_tokens": 3402757.0, "step": 91 }, { "entropy": 0.628009632229805, "epoch": 0.5978878960194963, "grad_norm": 0.012750590220093727, "learning_rate": 0.0002, "loss": 0.6261017322540283, "mean_token_accuracy": 0.7465066090226173, "num_tokens": 3440031.0, "step": 92 }, { "entropy": 0.6196997240185738, "epoch": 0.6043866774979691, "grad_norm": 0.011183288879692554, "learning_rate": 0.0002, "loss": 0.6222946047782898, "mean_token_accuracy": 0.7507361546158791, "num_tokens": 3477362.0, "step": 93 }, { "entropy": 0.6370684951543808, "epoch": 0.6108854589764419, "grad_norm": 0.010141120292246342, "learning_rate": 0.0002, "loss": 0.638361930847168, "mean_token_accuracy": 0.7412139847874641, "num_tokens": 3514709.0, "step": 94 }, { "entropy": 0.6254898384213448, "epoch": 0.6173842404549147, "grad_norm": 0.009656463749706745, "learning_rate": 0.0002, "loss": 0.6284251809120178, "mean_token_accuracy": 0.7460697740316391, "num_tokens": 3552355.0, "step": 95 }, { "entropy": 0.626992717385292, "epoch": 0.6238830219333875, "grad_norm": 0.01039013173431158, "learning_rate": 0.0002, "loss": 0.632388174533844, "mean_token_accuracy": 0.7448238283395767, "num_tokens": 3590160.0, "step": 96 }, { "entropy": 0.6212045699357986, "epoch": 0.6303818034118602, "grad_norm": 0.011750632897019386, "learning_rate": 0.0002, "loss": 0.623359203338623, "mean_token_accuracy": 0.7481106221675873, "num_tokens": 3627240.0, "step": 97 }, { "entropy": 0.6192934885621071, "epoch": 0.6368805848903331, "grad_norm": 0.009845283813774586, "learning_rate": 0.0002, "loss": 0.6226494312286377, "mean_token_accuracy": 0.7480833828449249, "num_tokens": 3664279.0, "step": 98 }, { "entropy": 0.6310721859335899, "epoch": 0.6433793663688059, "grad_norm": 0.011091063730418682, "learning_rate": 0.0002, "loss": 0.6305258274078369, "mean_token_accuracy": 0.7463658377528191, "num_tokens": 3701955.0, "step": 99 }, { "entropy": 0.6249227002263069, "epoch": 0.6498781478472786, "grad_norm": 0.009939444251358509, "learning_rate": 0.0002, "loss": 0.6257964372634888, "mean_token_accuracy": 0.7479037865996361, "num_tokens": 3739298.0, "step": 100 }, { "entropy": 0.6227108985185623, "epoch": 0.6563769293257514, "grad_norm": 0.010004580952227116, "learning_rate": 0.0002, "loss": 0.6256003379821777, "mean_token_accuracy": 0.7474573701620102, "num_tokens": 3776806.0, "step": 101 }, { "entropy": 0.6166384890675545, "epoch": 0.6628757108042242, "grad_norm": 0.010987838730216026, "learning_rate": 0.0002, "loss": 0.6182519197463989, "mean_token_accuracy": 0.7499695047736168, "num_tokens": 3813941.0, "step": 102 }, { "entropy": 0.6348938420414925, "epoch": 0.669374492282697, "grad_norm": 0.011195721104741096, "learning_rate": 0.0002, "loss": 0.6304492950439453, "mean_token_accuracy": 0.7462876811623573, "num_tokens": 3851698.0, "step": 103 }, { "entropy": 0.6282550320029259, "epoch": 0.6758732737611698, "grad_norm": 0.010595601983368397, "learning_rate": 0.0002, "loss": 0.6273945569992065, "mean_token_accuracy": 0.7473014816641808, "num_tokens": 3888988.0, "step": 104 }, { "entropy": 0.6324817091226578, "epoch": 0.6823720552396426, "grad_norm": 0.009895245544612408, "learning_rate": 0.0002, "loss": 0.632161557674408, "mean_token_accuracy": 0.7444497495889664, "num_tokens": 3925974.0, "step": 105 }, { "entropy": 0.6199614554643631, "epoch": 0.6888708367181153, "grad_norm": 0.010299347341060638, "learning_rate": 0.0002, "loss": 0.6227681636810303, "mean_token_accuracy": 0.746825821697712, "num_tokens": 3962869.0, "step": 106 }, { "entropy": 0.6321764960885048, "epoch": 0.6953696181965882, "grad_norm": 0.010949746705591679, "learning_rate": 0.0002, "loss": 0.6333647966384888, "mean_token_accuracy": 0.7444829195737839, "num_tokens": 4000443.0, "step": 107 }, { "entropy": 0.6052318215370178, "epoch": 0.7018683996750609, "grad_norm": 0.010511154308915138, "learning_rate": 0.0002, "loss": 0.6079590916633606, "mean_token_accuracy": 0.7547851428389549, "num_tokens": 4037560.0, "step": 108 }, { "entropy": 0.6213503628969193, "epoch": 0.7083671811535337, "grad_norm": 0.009959033690392971, "learning_rate": 0.0002, "loss": 0.622962236404419, "mean_token_accuracy": 0.7485458552837372, "num_tokens": 4075139.0, "step": 109 }, { "entropy": 0.6228557601571083, "epoch": 0.7148659626320065, "grad_norm": 0.009467214345932007, "learning_rate": 0.0002, "loss": 0.6287202835083008, "mean_token_accuracy": 0.7456526011228561, "num_tokens": 4112628.0, "step": 110 }, { "entropy": 0.6176012232899666, "epoch": 0.7213647441104792, "grad_norm": 0.009703468531370163, "learning_rate": 0.0002, "loss": 0.6198960542678833, "mean_token_accuracy": 0.7511189430952072, "num_tokens": 4150384.0, "step": 111 }, { "entropy": 0.6364283263683319, "epoch": 0.7278635255889521, "grad_norm": 0.009932373650372028, "learning_rate": 0.0002, "loss": 0.6412342190742493, "mean_token_accuracy": 0.742191307246685, "num_tokens": 4187483.0, "step": 112 }, { "entropy": 0.6340491250157356, "epoch": 0.7343623070674249, "grad_norm": 0.009394255466759205, "learning_rate": 0.0002, "loss": 0.632526695728302, "mean_token_accuracy": 0.7457142248749733, "num_tokens": 4224861.0, "step": 113 }, { "entropy": 0.626609705388546, "epoch": 0.7408610885458976, "grad_norm": 0.010729662142693996, "learning_rate": 0.0002, "loss": 0.6251577138900757, "mean_token_accuracy": 0.7473985999822617, "num_tokens": 4261958.0, "step": 114 }, { "entropy": 0.6041073203086853, "epoch": 0.7473598700243704, "grad_norm": 0.010525292716920376, "learning_rate": 0.0002, "loss": 0.599025309085846, "mean_token_accuracy": 0.7583419680595398, "num_tokens": 4299462.0, "step": 115 }, { "entropy": 0.6210100278258324, "epoch": 0.7538586515028433, "grad_norm": 0.009981499053537846, "learning_rate": 0.0002, "loss": 0.6192715167999268, "mean_token_accuracy": 0.7496819868683815, "num_tokens": 4336903.0, "step": 116 }, { "entropy": 0.6161150112748146, "epoch": 0.760357432981316, "grad_norm": 0.009832478128373623, "learning_rate": 0.0002, "loss": 0.6186830401420593, "mean_token_accuracy": 0.7503286600112915, "num_tokens": 4374156.0, "step": 117 }, { "entropy": 0.6233196780085564, "epoch": 0.7668562144597888, "grad_norm": 0.009722237475216389, "learning_rate": 0.0002, "loss": 0.6274971961975098, "mean_token_accuracy": 0.7461902946233749, "num_tokens": 4411885.0, "step": 118 }, { "entropy": 0.6291887611150742, "epoch": 0.7733549959382616, "grad_norm": 0.01063536573201418, "learning_rate": 0.0002, "loss": 0.6366918087005615, "mean_token_accuracy": 0.7416415438055992, "num_tokens": 4449209.0, "step": 119 }, { "entropy": 0.6099276095628738, "epoch": 0.7798537774167343, "grad_norm": 0.010151992551982403, "learning_rate": 0.0002, "loss": 0.6134237051010132, "mean_token_accuracy": 0.7496887296438217, "num_tokens": 4486909.0, "step": 120 }, { "entropy": 0.6280336380004883, "epoch": 0.7863525588952072, "grad_norm": 0.011214104481041431, "learning_rate": 0.0002, "loss": 0.6303111910820007, "mean_token_accuracy": 0.743942454457283, "num_tokens": 4524269.0, "step": 121 }, { "entropy": 0.624128632247448, "epoch": 0.7928513403736799, "grad_norm": 0.01028621755540371, "learning_rate": 0.0002, "loss": 0.6248451471328735, "mean_token_accuracy": 0.7479912042617798, "num_tokens": 4561643.0, "step": 122 }, { "entropy": 0.6252302676439285, "epoch": 0.7993501218521527, "grad_norm": 0.01105236541479826, "learning_rate": 0.0002, "loss": 0.6249452233314514, "mean_token_accuracy": 0.7472440227866173, "num_tokens": 4599086.0, "step": 123 }, { "entropy": 0.6296864897012711, "epoch": 0.8058489033306255, "grad_norm": 0.009404209442436695, "learning_rate": 0.0002, "loss": 0.6316344738006592, "mean_token_accuracy": 0.7425857782363892, "num_tokens": 4636471.0, "step": 124 }, { "entropy": 0.6118782311677933, "epoch": 0.8123476848090982, "grad_norm": 0.010075677186250687, "learning_rate": 0.0002, "loss": 0.6151276230812073, "mean_token_accuracy": 0.7537136599421501, "num_tokens": 4673814.0, "step": 125 }, { "entropy": 0.6220783665776253, "epoch": 0.8188464662875711, "grad_norm": 0.01058894768357277, "learning_rate": 0.0002, "loss": 0.623919665813446, "mean_token_accuracy": 0.7449487373232841, "num_tokens": 4711348.0, "step": 126 }, { "entropy": 0.6320341899991035, "epoch": 0.8253452477660439, "grad_norm": 0.009438078850507736, "learning_rate": 0.0002, "loss": 0.635218620300293, "mean_token_accuracy": 0.7428243607282639, "num_tokens": 4748964.0, "step": 127 }, { "entropy": 0.608184851706028, "epoch": 0.8318440292445166, "grad_norm": 0.00950313825160265, "learning_rate": 0.0002, "loss": 0.608941376209259, "mean_token_accuracy": 0.7540178000926971, "num_tokens": 4786015.0, "step": 128 }, { "entropy": 0.6191292628645897, "epoch": 0.8383428107229894, "grad_norm": 0.00933976098895073, "learning_rate": 0.0002, "loss": 0.6211662292480469, "mean_token_accuracy": 0.7470189183950424, "num_tokens": 4823477.0, "step": 129 }, { "entropy": 0.6169113591313362, "epoch": 0.8448415922014623, "grad_norm": 0.00967735517770052, "learning_rate": 0.0002, "loss": 0.6221678256988525, "mean_token_accuracy": 0.7482811883091927, "num_tokens": 4860492.0, "step": 130 }, { "entropy": 0.6181379705667496, "epoch": 0.851340373679935, "grad_norm": 0.010275167413055897, "learning_rate": 0.0002, "loss": 0.6256829500198364, "mean_token_accuracy": 0.7461275234818459, "num_tokens": 4897310.0, "step": 131 }, { "entropy": 0.6289433836936951, "epoch": 0.8578391551584078, "grad_norm": 0.010724073275923729, "learning_rate": 0.0002, "loss": 0.6285852193832397, "mean_token_accuracy": 0.7468666434288025, "num_tokens": 4935222.0, "step": 132 }, { "entropy": 0.6300692111253738, "epoch": 0.8643379366368806, "grad_norm": 0.009074898436665535, "learning_rate": 0.0002, "loss": 0.6281343698501587, "mean_token_accuracy": 0.7458086088299751, "num_tokens": 4972549.0, "step": 133 }, { "entropy": 0.6445952579379082, "epoch": 0.8708367181153533, "grad_norm": 0.009369590319693089, "learning_rate": 0.0002, "loss": 0.6381428837776184, "mean_token_accuracy": 0.7420760691165924, "num_tokens": 5010593.0, "step": 134 }, { "entropy": 0.6136679574847221, "epoch": 0.8773354995938262, "grad_norm": 0.01232313271611929, "learning_rate": 0.0002, "loss": 0.6184711456298828, "mean_token_accuracy": 0.7486978471279144, "num_tokens": 5047468.0, "step": 135 }, { "entropy": 0.6270027384161949, "epoch": 0.8838342810722989, "grad_norm": 0.010591822676360607, "learning_rate": 0.0002, "loss": 0.6306672692298889, "mean_token_accuracy": 0.7446641474962234, "num_tokens": 5084586.0, "step": 136 }, { "entropy": 0.6240550950169563, "epoch": 0.8903330625507717, "grad_norm": 0.009444071911275387, "learning_rate": 0.0002, "loss": 0.6233399510383606, "mean_token_accuracy": 0.749994620680809, "num_tokens": 5122453.0, "step": 137 }, { "entropy": 0.6302881464362144, "epoch": 0.8968318440292445, "grad_norm": 0.009541204199194908, "learning_rate": 0.0002, "loss": 0.6329821348190308, "mean_token_accuracy": 0.7429886758327484, "num_tokens": 5160031.0, "step": 138 }, { "entropy": 0.6242454648017883, "epoch": 0.9033306255077173, "grad_norm": 0.01136871799826622, "learning_rate": 0.0002, "loss": 0.628311038017273, "mean_token_accuracy": 0.7444250509142876, "num_tokens": 5197538.0, "step": 139 }, { "entropy": 0.6239208057522774, "epoch": 0.9098294069861901, "grad_norm": 0.009039361029863358, "learning_rate": 0.0002, "loss": 0.6212806105613708, "mean_token_accuracy": 0.7484918162226677, "num_tokens": 5234839.0, "step": 140 }, { "entropy": 0.6303699910640717, "epoch": 0.9163281884646629, "grad_norm": 0.008452481590211391, "learning_rate": 0.0002, "loss": 0.6276811361312866, "mean_token_accuracy": 0.7478921040892601, "num_tokens": 5272501.0, "step": 141 }, { "entropy": 0.6282826215028763, "epoch": 0.9228269699431356, "grad_norm": 0.009988308884203434, "learning_rate": 0.0002, "loss": 0.6308070421218872, "mean_token_accuracy": 0.744203083217144, "num_tokens": 5310068.0, "step": 142 }, { "entropy": 0.6363607943058014, "epoch": 0.9293257514216084, "grad_norm": 0.010694671422243118, "learning_rate": 0.0002, "loss": 0.6361459493637085, "mean_token_accuracy": 0.7425540909171104, "num_tokens": 5347594.0, "step": 143 }, { "entropy": 0.6332810074090958, "epoch": 0.9358245329000813, "grad_norm": 0.008342958055436611, "learning_rate": 0.0002, "loss": 0.6327856779098511, "mean_token_accuracy": 0.7445112019777298, "num_tokens": 5385240.0, "step": 144 }, { "entropy": 0.622712031006813, "epoch": 0.942323314378554, "grad_norm": 0.009324009530246258, "learning_rate": 0.0002, "loss": 0.622111439704895, "mean_token_accuracy": 0.7491918131709099, "num_tokens": 5423063.0, "step": 145 }, { "entropy": 0.6331967115402222, "epoch": 0.9488220958570268, "grad_norm": 0.009456835687160492, "learning_rate": 0.0002, "loss": 0.635155200958252, "mean_token_accuracy": 0.7427491322159767, "num_tokens": 5460300.0, "step": 146 }, { "entropy": 0.6007715612649918, "epoch": 0.9553208773354996, "grad_norm": 0.009612048044800758, "learning_rate": 0.0002, "loss": 0.6061209440231323, "mean_token_accuracy": 0.7546330019831657, "num_tokens": 5497104.0, "step": 147 }, { "entropy": 0.623559907078743, "epoch": 0.9618196588139724, "grad_norm": 0.009891507215797901, "learning_rate": 0.0002, "loss": 0.6299046874046326, "mean_token_accuracy": 0.7460341230034828, "num_tokens": 5534717.0, "step": 148 }, { "entropy": 0.6161656081676483, "epoch": 0.9683184402924452, "grad_norm": 0.009623561054468155, "learning_rate": 0.0002, "loss": 0.6207596659660339, "mean_token_accuracy": 0.7484462484717369, "num_tokens": 5572155.0, "step": 149 }, { "entropy": 0.6296671330928802, "epoch": 0.974817221770918, "grad_norm": 0.009666231460869312, "learning_rate": 0.0002, "loss": 0.6299723386764526, "mean_token_accuracy": 0.7442828044295311, "num_tokens": 5609434.0, "step": 150 }, { "entropy": 0.635062001645565, "epoch": 0.9813160032493907, "grad_norm": 0.009376533329486847, "learning_rate": 0.0002, "loss": 0.6303079128265381, "mean_token_accuracy": 0.7447433397173882, "num_tokens": 5646893.0, "step": 151 }, { "entropy": 0.630713015794754, "epoch": 0.9878147847278635, "grad_norm": 0.009512092918157578, "learning_rate": 0.0002, "loss": 0.6241896152496338, "mean_token_accuracy": 0.745731770992279, "num_tokens": 5684403.0, "step": 152 }, { "entropy": 0.623988039791584, "epoch": 0.9943135662063363, "grad_norm": 0.00946712028235197, "learning_rate": 0.0002, "loss": 0.6251310110092163, "mean_token_accuracy": 0.7487976476550102, "num_tokens": 5721608.0, "step": 153 }, { "entropy": 0.5962605476379395, "epoch": 1.0, "grad_norm": 0.010017761029303074, "learning_rate": 0.0002, "loss": 0.6195710897445679, "mean_token_accuracy": 0.754073713506971, "num_tokens": 5737850.0, "step": 154 }, { "entropy": 0.6159528121352196, "epoch": 1.0064987814784727, "grad_norm": 0.011626223102211952, "learning_rate": 0.0002, "loss": 0.6283953785896301, "mean_token_accuracy": 0.7437271103262901, "num_tokens": 5775226.0, "step": 155 }, { "entropy": 0.6398139446973801, "epoch": 1.0129975629569457, "grad_norm": 0.009600057266652584, "learning_rate": 0.0002, "loss": 0.6418601274490356, "mean_token_accuracy": 0.7394955083727837, "num_tokens": 5812842.0, "step": 156 }, { "entropy": 0.6106663420796394, "epoch": 1.0194963444354184, "grad_norm": 0.01011701114475727, "learning_rate": 0.0002, "loss": 0.6077284812927246, "mean_token_accuracy": 0.754165381193161, "num_tokens": 5850157.0, "step": 157 }, { "entropy": 0.6355043426156044, "epoch": 1.025995125913891, "grad_norm": 0.009700894355773926, "learning_rate": 0.0002, "loss": 0.6273776888847351, "mean_token_accuracy": 0.7454625219106674, "num_tokens": 5887576.0, "step": 158 }, { "entropy": 0.629393994808197, "epoch": 1.032493907392364, "grad_norm": 0.007958617061376572, "learning_rate": 0.0002, "loss": 0.6252051591873169, "mean_token_accuracy": 0.7460998743772507, "num_tokens": 5925165.0, "step": 159 }, { "entropy": 0.6266166046261787, "epoch": 1.0389926888708367, "grad_norm": 0.00998145341873169, "learning_rate": 0.0002, "loss": 0.6290674209594727, "mean_token_accuracy": 0.7430498450994492, "num_tokens": 5962505.0, "step": 160 }, { "entropy": 0.6140859052538872, "epoch": 1.0454914703493094, "grad_norm": 0.010381487198174, "learning_rate": 0.0002, "loss": 0.6180790662765503, "mean_token_accuracy": 0.7507300451397896, "num_tokens": 5999871.0, "step": 161 }, { "entropy": 0.6197154447436333, "epoch": 1.0519902518277824, "grad_norm": 0.009876130148768425, "learning_rate": 0.0002, "loss": 0.6249828338623047, "mean_token_accuracy": 0.7454148605465889, "num_tokens": 6037575.0, "step": 162 }, { "entropy": 0.6122508272528648, "epoch": 1.058489033306255, "grad_norm": 0.008684883825480938, "learning_rate": 0.0002, "loss": 0.6138869524002075, "mean_token_accuracy": 0.7517640963196754, "num_tokens": 6074892.0, "step": 163 }, { "entropy": 0.6194281056523323, "epoch": 1.0649878147847278, "grad_norm": 0.010471724905073643, "learning_rate": 0.0002, "loss": 0.6223649978637695, "mean_token_accuracy": 0.7462374493479729, "num_tokens": 6112197.0, "step": 164 }, { "entropy": 0.6203417181968689, "epoch": 1.0714865962632008, "grad_norm": 0.00992770865559578, "learning_rate": 0.0002, "loss": 0.6209006309509277, "mean_token_accuracy": 0.7480901628732681, "num_tokens": 6149571.0, "step": 165 }, { "entropy": 0.6099580377340317, "epoch": 1.0779853777416735, "grad_norm": 0.00981567706912756, "learning_rate": 0.0002, "loss": 0.6166203022003174, "mean_token_accuracy": 0.7501059100031853, "num_tokens": 6186570.0, "step": 166 }, { "entropy": 0.6217071712017059, "epoch": 1.0844841592201462, "grad_norm": 0.009364967234432697, "learning_rate": 0.0002, "loss": 0.6240255236625671, "mean_token_accuracy": 0.7475733831524849, "num_tokens": 6224124.0, "step": 167 }, { "entropy": 0.6265001520514488, "epoch": 1.090982940698619, "grad_norm": 0.009150683879852295, "learning_rate": 0.0002, "loss": 0.6249997615814209, "mean_token_accuracy": 0.7465919181704521, "num_tokens": 6261544.0, "step": 168 }, { "entropy": 0.6337415799498558, "epoch": 1.0974817221770918, "grad_norm": 0.009555370546877384, "learning_rate": 0.0002, "loss": 0.6337403059005737, "mean_token_accuracy": 0.7431929185986519, "num_tokens": 6298708.0, "step": 169 }, { "entropy": 0.6212407127022743, "epoch": 1.1039805036555645, "grad_norm": 0.009204280562698841, "learning_rate": 0.0002, "loss": 0.6198785305023193, "mean_token_accuracy": 0.7490911036729813, "num_tokens": 6336357.0, "step": 170 }, { "entropy": 0.6211022287607193, "epoch": 1.1104792851340373, "grad_norm": 0.010933548212051392, "learning_rate": 0.0002, "loss": 0.6218096017837524, "mean_token_accuracy": 0.7478840723633766, "num_tokens": 6373815.0, "step": 171 }, { "entropy": 0.6218304485082626, "epoch": 1.1169780666125102, "grad_norm": 0.007957971654832363, "learning_rate": 0.0002, "loss": 0.6211934089660645, "mean_token_accuracy": 0.7479007542133331, "num_tokens": 6411469.0, "step": 172 }, { "entropy": 0.623476430773735, "epoch": 1.123476848090983, "grad_norm": 0.008693872950971127, "learning_rate": 0.0002, "loss": 0.628318727016449, "mean_token_accuracy": 0.7435088455677032, "num_tokens": 6448782.0, "step": 173 }, { "entropy": 0.6133372634649277, "epoch": 1.1299756295694556, "grad_norm": 0.010963717475533485, "learning_rate": 0.0002, "loss": 0.6166828274726868, "mean_token_accuracy": 0.7512464672327042, "num_tokens": 6485790.0, "step": 174 }, { "entropy": 0.6234560832381248, "epoch": 1.1364744110479286, "grad_norm": 0.009953116998076439, "learning_rate": 0.0002, "loss": 0.6275191903114319, "mean_token_accuracy": 0.7457004636526108, "num_tokens": 6523433.0, "step": 175 }, { "entropy": 0.612127959728241, "epoch": 1.1429731925264013, "grad_norm": 0.008568039163947105, "learning_rate": 0.0002, "loss": 0.6111507415771484, "mean_token_accuracy": 0.7523760348558426, "num_tokens": 6560764.0, "step": 176 }, { "entropy": 0.6384553462266922, "epoch": 1.149471974004874, "grad_norm": 0.010018682107329369, "learning_rate": 0.0002, "loss": 0.6336829662322998, "mean_token_accuracy": 0.743287555873394, "num_tokens": 6598409.0, "step": 177 }, { "entropy": 0.6272930577397346, "epoch": 1.155970755483347, "grad_norm": 0.009546359069645405, "learning_rate": 0.0002, "loss": 0.626544713973999, "mean_token_accuracy": 0.7449387013912201, "num_tokens": 6636067.0, "step": 178 }, { "entropy": 0.6086627542972565, "epoch": 1.1624695369618196, "grad_norm": 0.009319686330854893, "learning_rate": 0.0002, "loss": 0.6141277551651001, "mean_token_accuracy": 0.7520448267459869, "num_tokens": 6673446.0, "step": 179 }, { "entropy": 0.5994155630469322, "epoch": 1.1689683184402924, "grad_norm": 0.011318805627524853, "learning_rate": 0.0002, "loss": 0.6087459325790405, "mean_token_accuracy": 0.7519726976752281, "num_tokens": 6710715.0, "step": 180 }, { "entropy": 0.6187063455581665, "epoch": 1.1754670999187653, "grad_norm": 0.009100009687244892, "learning_rate": 0.0002, "loss": 0.6213230490684509, "mean_token_accuracy": 0.7466496899724007, "num_tokens": 6748737.0, "step": 181 }, { "entropy": 0.6402401477098465, "epoch": 1.181965881397238, "grad_norm": 0.009086531586945057, "learning_rate": 0.0002, "loss": 0.636063277721405, "mean_token_accuracy": 0.7429427057504654, "num_tokens": 6785555.0, "step": 182 }, { "entropy": 0.6275543943047523, "epoch": 1.1884646628757107, "grad_norm": 0.00983697734773159, "learning_rate": 0.0002, "loss": 0.6195461750030518, "mean_token_accuracy": 0.7482333034276962, "num_tokens": 6822608.0, "step": 183 }, { "entropy": 0.6261148154735565, "epoch": 1.1949634443541837, "grad_norm": 0.008595704101026058, "learning_rate": 0.0002, "loss": 0.6235471963882446, "mean_token_accuracy": 0.7465647235512733, "num_tokens": 6860107.0, "step": 184 }, { "entropy": 0.615828700363636, "epoch": 1.2014622258326564, "grad_norm": 0.010348568670451641, "learning_rate": 0.0002, "loss": 0.6194600462913513, "mean_token_accuracy": 0.7490681707859039, "num_tokens": 6897202.0, "step": 185 }, { "entropy": 0.6132261380553246, "epoch": 1.207961007311129, "grad_norm": 0.010876818560063839, "learning_rate": 0.0002, "loss": 0.6224918365478516, "mean_token_accuracy": 0.7479420974850655, "num_tokens": 6934670.0, "step": 186 }, { "entropy": 0.6103203073143959, "epoch": 1.214459788789602, "grad_norm": 0.009953301399946213, "learning_rate": 0.0002, "loss": 0.6190877556800842, "mean_token_accuracy": 0.7497604489326477, "num_tokens": 6971658.0, "step": 187 }, { "entropy": 0.617573581635952, "epoch": 1.2209585702680747, "grad_norm": 0.00837781187146902, "learning_rate": 0.0002, "loss": 0.617588996887207, "mean_token_accuracy": 0.7494269385933876, "num_tokens": 7009123.0, "step": 188 }, { "entropy": 0.629171572625637, "epoch": 1.2274573517465475, "grad_norm": 0.008275787346065044, "learning_rate": 0.0002, "loss": 0.6283445358276367, "mean_token_accuracy": 0.7444169595837593, "num_tokens": 7046906.0, "step": 189 }, { "entropy": 0.6318405717611313, "epoch": 1.2339561332250204, "grad_norm": 0.008116304874420166, "learning_rate": 0.0002, "loss": 0.6320441365242004, "mean_token_accuracy": 0.7443558126688004, "num_tokens": 7084180.0, "step": 190 }, { "entropy": 0.6146104484796524, "epoch": 1.2404549147034931, "grad_norm": 0.009803351014852524, "learning_rate": 0.0002, "loss": 0.6140527725219727, "mean_token_accuracy": 0.7488429099321365, "num_tokens": 7121475.0, "step": 191 }, { "entropy": 0.6153127253055573, "epoch": 1.2469536961819658, "grad_norm": 0.007825122214853764, "learning_rate": 0.0002, "loss": 0.6195809245109558, "mean_token_accuracy": 0.7493974566459656, "num_tokens": 7158753.0, "step": 192 }, { "entropy": 0.6186842620372772, "epoch": 1.2534524776604385, "grad_norm": 0.00928817130625248, "learning_rate": 0.0002, "loss": 0.6203854084014893, "mean_token_accuracy": 0.748259611427784, "num_tokens": 7195797.0, "step": 193 }, { "entropy": 0.6210475564002991, "epoch": 1.2599512591389115, "grad_norm": 0.010004797019064426, "learning_rate": 0.0002, "loss": 0.6249719858169556, "mean_token_accuracy": 0.7474558278918266, "num_tokens": 7233547.0, "step": 194 }, { "entropy": 0.6319233104586601, "epoch": 1.2664500406173842, "grad_norm": 0.010124076157808304, "learning_rate": 0.0002, "loss": 0.6346510648727417, "mean_token_accuracy": 0.7430363744497299, "num_tokens": 7271165.0, "step": 195 }, { "entropy": 0.6228615492582321, "epoch": 1.2729488220958571, "grad_norm": 0.00920382421463728, "learning_rate": 0.0002, "loss": 0.6211229562759399, "mean_token_accuracy": 0.7490492090582848, "num_tokens": 7308659.0, "step": 196 }, { "entropy": 0.6310986131429672, "epoch": 1.2794476035743299, "grad_norm": 0.009224419482052326, "learning_rate": 0.0002, "loss": 0.626353919506073, "mean_token_accuracy": 0.7454532235860825, "num_tokens": 7346203.0, "step": 197 }, { "entropy": 0.610854484140873, "epoch": 1.2859463850528026, "grad_norm": 0.009150652214884758, "learning_rate": 0.0002, "loss": 0.6110652685165405, "mean_token_accuracy": 0.7504596933722496, "num_tokens": 7383470.0, "step": 198 }, { "entropy": 0.6061088666319847, "epoch": 1.2924451665312753, "grad_norm": 0.008921864442527294, "learning_rate": 0.0002, "loss": 0.611494779586792, "mean_token_accuracy": 0.7522832676768303, "num_tokens": 7420939.0, "step": 199 }, { "entropy": 0.6130355596542358, "epoch": 1.2989439480097482, "grad_norm": 0.009989106096327305, "learning_rate": 0.0002, "loss": 0.6249145269393921, "mean_token_accuracy": 0.7437470331788063, "num_tokens": 7458037.0, "step": 200 }, { "entropy": 0.6245267316699028, "epoch": 1.305442729488221, "grad_norm": 0.008322354406118393, "learning_rate": 0.0002, "loss": 0.6295627355575562, "mean_token_accuracy": 0.7449559271335602, "num_tokens": 7495466.0, "step": 201 }, { "entropy": 0.6188690215349197, "epoch": 1.3119415109666939, "grad_norm": 0.008306242525577545, "learning_rate": 0.0002, "loss": 0.6199623942375183, "mean_token_accuracy": 0.7464429587125778, "num_tokens": 7533028.0, "step": 202 }, { "entropy": 0.6284244954586029, "epoch": 1.3184402924451666, "grad_norm": 0.008912610821425915, "learning_rate": 0.0002, "loss": 0.6269126534461975, "mean_token_accuracy": 0.7451603710651398, "num_tokens": 7570454.0, "step": 203 }, { "entropy": 0.6253558248281479, "epoch": 1.3249390739236393, "grad_norm": 0.009339334443211555, "learning_rate": 0.0002, "loss": 0.6178290247917175, "mean_token_accuracy": 0.749000295996666, "num_tokens": 7607813.0, "step": 204 }, { "entropy": 0.6330921202898026, "epoch": 1.331437855402112, "grad_norm": 0.009055222384631634, "learning_rate": 0.0002, "loss": 0.627162754535675, "mean_token_accuracy": 0.7448414042592049, "num_tokens": 7645571.0, "step": 205 }, { "entropy": 0.612213708460331, "epoch": 1.337936636880585, "grad_norm": 0.00788091029971838, "learning_rate": 0.0002, "loss": 0.6103406548500061, "mean_token_accuracy": 0.7524209767580032, "num_tokens": 7682827.0, "step": 206 }, { "entropy": 0.6196805313229561, "epoch": 1.3444354183590577, "grad_norm": 0.0074918679893016815, "learning_rate": 0.0002, "loss": 0.6231103539466858, "mean_token_accuracy": 0.7457561120390892, "num_tokens": 7720532.0, "step": 207 }, { "entropy": 0.6148431301116943, "epoch": 1.3509341998375304, "grad_norm": 0.008005033247172832, "learning_rate": 0.0002, "loss": 0.6224607825279236, "mean_token_accuracy": 0.7475835010409355, "num_tokens": 7757914.0, "step": 208 }, { "entropy": 0.6162410527467728, "epoch": 1.3574329813160033, "grad_norm": 0.008755719289183617, "learning_rate": 0.0002, "loss": 0.6230734586715698, "mean_token_accuracy": 0.7474293559789658, "num_tokens": 7795111.0, "step": 209 }, { "entropy": 0.6132988333702087, "epoch": 1.363931762794476, "grad_norm": 0.008136742748320103, "learning_rate": 0.0002, "loss": 0.6189343929290771, "mean_token_accuracy": 0.7504551187157631, "num_tokens": 7832380.0, "step": 210 }, { "entropy": 0.62418133020401, "epoch": 1.3704305442729487, "grad_norm": 0.007090510334819555, "learning_rate": 0.0002, "loss": 0.6275556087493896, "mean_token_accuracy": 0.744689516723156, "num_tokens": 7869774.0, "step": 211 }, { "entropy": 0.6151341274380684, "epoch": 1.3769293257514217, "grad_norm": 0.008890950120985508, "learning_rate": 0.0002, "loss": 0.6140053272247314, "mean_token_accuracy": 0.7508121132850647, "num_tokens": 7906943.0, "step": 212 }, { "entropy": 0.6221983805298805, "epoch": 1.3834281072298944, "grad_norm": 0.009338715113699436, "learning_rate": 0.0002, "loss": 0.6216065883636475, "mean_token_accuracy": 0.7504482716321945, "num_tokens": 7944646.0, "step": 213 }, { "entropy": 0.6131090745329857, "epoch": 1.3899268887083671, "grad_norm": 0.00849352777004242, "learning_rate": 0.0002, "loss": 0.6095527410507202, "mean_token_accuracy": 0.7533553466200829, "num_tokens": 7982267.0, "step": 214 }, { "entropy": 0.6085495501756668, "epoch": 1.39642567018684, "grad_norm": 0.007540795486420393, "learning_rate": 0.0002, "loss": 0.6092317700386047, "mean_token_accuracy": 0.7533180490136147, "num_tokens": 8019466.0, "step": 215 }, { "entropy": 0.6296884343028069, "epoch": 1.4029244516653128, "grad_norm": 0.009902682155370712, "learning_rate": 0.0002, "loss": 0.6364089250564575, "mean_token_accuracy": 0.7428499311208725, "num_tokens": 8057400.0, "step": 216 }, { "entropy": 0.6165885776281357, "epoch": 1.4094232331437855, "grad_norm": 0.00911257229745388, "learning_rate": 0.0002, "loss": 0.6247788071632385, "mean_token_accuracy": 0.7464938163757324, "num_tokens": 8094904.0, "step": 217 }, { "entropy": 0.6157428845763206, "epoch": 1.4159220146222582, "grad_norm": 0.007997944951057434, "learning_rate": 0.0002, "loss": 0.6201274394989014, "mean_token_accuracy": 0.7489686757326126, "num_tokens": 8132290.0, "step": 218 }, { "entropy": 0.6217053309082985, "epoch": 1.4224207961007311, "grad_norm": 0.00811337772756815, "learning_rate": 0.0002, "loss": 0.6197227239608765, "mean_token_accuracy": 0.7485419660806656, "num_tokens": 8169791.0, "step": 219 }, { "entropy": 0.615436315536499, "epoch": 1.4289195775792038, "grad_norm": 0.008888707496225834, "learning_rate": 0.0002, "loss": 0.6124907732009888, "mean_token_accuracy": 0.751116119325161, "num_tokens": 8207092.0, "step": 220 }, { "entropy": 0.6246543675661087, "epoch": 1.4354183590576768, "grad_norm": 0.008732281625270844, "learning_rate": 0.0002, "loss": 0.623694658279419, "mean_token_accuracy": 0.7458877414464951, "num_tokens": 8244309.0, "step": 221 }, { "entropy": 0.6304584518074989, "epoch": 1.4419171405361495, "grad_norm": 0.009999740868806839, "learning_rate": 0.0002, "loss": 0.6301021575927734, "mean_token_accuracy": 0.7443124279379845, "num_tokens": 8281764.0, "step": 222 }, { "entropy": 0.6228891983628273, "epoch": 1.4484159220146222, "grad_norm": 0.009084641933441162, "learning_rate": 0.0002, "loss": 0.623934268951416, "mean_token_accuracy": 0.746678814291954, "num_tokens": 8319204.0, "step": 223 }, { "entropy": 0.6163553223013878, "epoch": 1.454914703493095, "grad_norm": 0.008567318320274353, "learning_rate": 0.0002, "loss": 0.6207892894744873, "mean_token_accuracy": 0.7486568316817284, "num_tokens": 8356629.0, "step": 224 }, { "entropy": 0.6088405475020409, "epoch": 1.4614134849715679, "grad_norm": 0.00832637120038271, "learning_rate": 0.0002, "loss": 0.612472414970398, "mean_token_accuracy": 0.7514082416892052, "num_tokens": 8394033.0, "step": 225 }, { "entropy": 0.614930123090744, "epoch": 1.4679122664500406, "grad_norm": 0.008623549714684486, "learning_rate": 0.0002, "loss": 0.6192766427993774, "mean_token_accuracy": 0.7488296180963516, "num_tokens": 8431411.0, "step": 226 }, { "entropy": 0.6123254001140594, "epoch": 1.4744110479285135, "grad_norm": 0.008329757489264011, "learning_rate": 0.0002, "loss": 0.614305317401886, "mean_token_accuracy": 0.7501704543828964, "num_tokens": 8468845.0, "step": 227 }, { "entropy": 0.6353933066129684, "epoch": 1.4809098294069862, "grad_norm": 0.010329898446798325, "learning_rate": 0.0002, "loss": 0.6299945712089539, "mean_token_accuracy": 0.7446781396865845, "num_tokens": 8506494.0, "step": 228 }, { "entropy": 0.6230698823928833, "epoch": 1.487408610885459, "grad_norm": 0.008529371581971645, "learning_rate": 0.0002, "loss": 0.6179029941558838, "mean_token_accuracy": 0.7506388053297997, "num_tokens": 8543863.0, "step": 229 }, { "entropy": 0.6087015345692635, "epoch": 1.4939073923639317, "grad_norm": 0.008635671809315681, "learning_rate": 0.0002, "loss": 0.6120889186859131, "mean_token_accuracy": 0.7521615102887154, "num_tokens": 8580998.0, "step": 230 }, { "entropy": 0.6111158281564713, "epoch": 1.5004061738424046, "grad_norm": 0.009943103417754173, "learning_rate": 0.0002, "loss": 0.6142638921737671, "mean_token_accuracy": 0.7509952187538147, "num_tokens": 8618445.0, "step": 231 }, { "entropy": 0.6176108121871948, "epoch": 1.5069049553208773, "grad_norm": 0.007991382852196693, "learning_rate": 0.0002, "loss": 0.619983434677124, "mean_token_accuracy": 0.7502688392996788, "num_tokens": 8655969.0, "step": 232 }, { "entropy": 0.6207513734698296, "epoch": 1.5134037367993503, "grad_norm": 0.0076866415329277515, "learning_rate": 0.0002, "loss": 0.626140296459198, "mean_token_accuracy": 0.7469011545181274, "num_tokens": 8693748.0, "step": 233 }, { "entropy": 0.6301305815577507, "epoch": 1.519902518277823, "grad_norm": 0.007992899045348167, "learning_rate": 0.0002, "loss": 0.6301756501197815, "mean_token_accuracy": 0.744783528149128, "num_tokens": 8730930.0, "step": 234 }, { "entropy": 0.6271040365099907, "epoch": 1.5264012997562957, "grad_norm": 0.008258827030658722, "learning_rate": 0.0002, "loss": 0.6266668438911438, "mean_token_accuracy": 0.746114693582058, "num_tokens": 8768377.0, "step": 235 }, { "entropy": 0.6152656748890877, "epoch": 1.5329000812347684, "grad_norm": 0.0098560880869627, "learning_rate": 0.0002, "loss": 0.6164472103118896, "mean_token_accuracy": 0.7489713951945305, "num_tokens": 8805779.0, "step": 236 }, { "entropy": 0.6294426172971725, "epoch": 1.5393988627132411, "grad_norm": 0.008523919619619846, "learning_rate": 0.0002, "loss": 0.6326299905776978, "mean_token_accuracy": 0.742644876241684, "num_tokens": 8843123.0, "step": 237 }, { "entropy": 0.6143188178539276, "epoch": 1.545897644191714, "grad_norm": 0.007758335676044226, "learning_rate": 0.0002, "loss": 0.6136566996574402, "mean_token_accuracy": 0.7520029693841934, "num_tokens": 8880249.0, "step": 238 }, { "entropy": 0.627038024365902, "epoch": 1.552396425670187, "grad_norm": 0.00911460816860199, "learning_rate": 0.0002, "loss": 0.6299710869789124, "mean_token_accuracy": 0.7446892932057381, "num_tokens": 8917829.0, "step": 239 }, { "entropy": 0.6183791384100914, "epoch": 1.5588952071486597, "grad_norm": 0.008657646365463734, "learning_rate": 0.0002, "loss": 0.6220093965530396, "mean_token_accuracy": 0.7485999315977097, "num_tokens": 8955243.0, "step": 240 }, { "entropy": 0.6323986351490021, "epoch": 1.5653939886271324, "grad_norm": 0.0085441330447793, "learning_rate": 0.0002, "loss": 0.6361583471298218, "mean_token_accuracy": 0.7442645356059074, "num_tokens": 8992960.0, "step": 241 }, { "entropy": 0.6108334213495255, "epoch": 1.5718927701056051, "grad_norm": 0.007725970819592476, "learning_rate": 0.0002, "loss": 0.6101396083831787, "mean_token_accuracy": 0.7506669163703918, "num_tokens": 9030523.0, "step": 242 }, { "entropy": 0.6231397688388824, "epoch": 1.5783915515840778, "grad_norm": 0.008767355233430862, "learning_rate": 0.0002, "loss": 0.622745156288147, "mean_token_accuracy": 0.7461344972252846, "num_tokens": 9067759.0, "step": 243 }, { "entropy": 0.627980038523674, "epoch": 1.5848903330625508, "grad_norm": 0.00843246839940548, "learning_rate": 0.0002, "loss": 0.632775604724884, "mean_token_accuracy": 0.7432630062103271, "num_tokens": 9105200.0, "step": 244 }, { "entropy": 0.6222330331802368, "epoch": 1.5913891145410237, "grad_norm": 0.008817244321107864, "learning_rate": 0.0002, "loss": 0.625479519367218, "mean_token_accuracy": 0.7454850673675537, "num_tokens": 9142588.0, "step": 245 }, { "entropy": 0.6129688546061516, "epoch": 1.5978878960194964, "grad_norm": 0.009856261312961578, "learning_rate": 0.0002, "loss": 0.6199933886528015, "mean_token_accuracy": 0.7487855926156044, "num_tokens": 9179884.0, "step": 246 }, { "entropy": 0.6239286884665489, "epoch": 1.6043866774979691, "grad_norm": 0.008906936272978783, "learning_rate": 0.0002, "loss": 0.6204976439476013, "mean_token_accuracy": 0.7508985996246338, "num_tokens": 9217103.0, "step": 247 }, { "entropy": 0.6336326971650124, "epoch": 1.6108854589764419, "grad_norm": 0.011355509981513023, "learning_rate": 0.0002, "loss": 0.6262732744216919, "mean_token_accuracy": 0.7465848848223686, "num_tokens": 9254644.0, "step": 248 }, { "entropy": 0.6203413605690002, "epoch": 1.6173842404549146, "grad_norm": 0.007735299877822399, "learning_rate": 0.0002, "loss": 0.6212904453277588, "mean_token_accuracy": 0.7472884654998779, "num_tokens": 9291724.0, "step": 249 }, { "entropy": 0.6144890040159225, "epoch": 1.6238830219333875, "grad_norm": 0.007746159564703703, "learning_rate": 0.0002, "loss": 0.619687557220459, "mean_token_accuracy": 0.7471293359994888, "num_tokens": 9328841.0, "step": 250 }, { "entropy": 0.6305414438247681, "epoch": 1.6303818034118602, "grad_norm": 0.010060657747089863, "learning_rate": 0.0002, "loss": 0.6419017314910889, "mean_token_accuracy": 0.7386629730463028, "num_tokens": 9366411.0, "step": 251 }, { "entropy": 0.6339073181152344, "epoch": 1.6368805848903332, "grad_norm": 0.007909824140369892, "learning_rate": 0.0002, "loss": 0.6384083032608032, "mean_token_accuracy": 0.7414835765957832, "num_tokens": 9403421.0, "step": 252 }, { "entropy": 0.6129219457507133, "epoch": 1.6433793663688059, "grad_norm": 0.007407526019960642, "learning_rate": 0.0002, "loss": 0.6125075817108154, "mean_token_accuracy": 0.752901516854763, "num_tokens": 9440793.0, "step": 253 }, { "entropy": 0.6255052834749222, "epoch": 1.6498781478472786, "grad_norm": 0.008314264938235283, "learning_rate": 0.0002, "loss": 0.6215559244155884, "mean_token_accuracy": 0.7486165389418602, "num_tokens": 9477882.0, "step": 254 }, { "entropy": 0.6231755018234253, "epoch": 1.6563769293257513, "grad_norm": 0.0075997961685061455, "learning_rate": 0.0002, "loss": 0.6211115121841431, "mean_token_accuracy": 0.7495426833629608, "num_tokens": 9515444.0, "step": 255 }, { "entropy": 0.6108886152505875, "epoch": 1.6628757108042242, "grad_norm": 0.007718959823250771, "learning_rate": 0.0002, "loss": 0.6141905784606934, "mean_token_accuracy": 0.7495709583163261, "num_tokens": 9552755.0, "step": 256 }, { "entropy": 0.6075874269008636, "epoch": 1.669374492282697, "grad_norm": 0.008023767732083797, "learning_rate": 0.0002, "loss": 0.6125887632369995, "mean_token_accuracy": 0.7506251037120819, "num_tokens": 9590261.0, "step": 257 }, { "entropy": 0.6148701831698418, "epoch": 1.67587327376117, "grad_norm": 0.008702424354851246, "learning_rate": 0.0002, "loss": 0.6215870380401611, "mean_token_accuracy": 0.7478265091776848, "num_tokens": 9627758.0, "step": 258 }, { "entropy": 0.6036238297820091, "epoch": 1.6823720552396426, "grad_norm": 0.007766771595925093, "learning_rate": 0.0002, "loss": 0.6084332466125488, "mean_token_accuracy": 0.7513664737343788, "num_tokens": 9664761.0, "step": 259 }, { "entropy": 0.6297216266393661, "epoch": 1.6888708367181153, "grad_norm": 0.009538715705275536, "learning_rate": 0.0002, "loss": 0.6225094795227051, "mean_token_accuracy": 0.7476939931511879, "num_tokens": 9702161.0, "step": 260 }, { "entropy": 0.6292383894324303, "epoch": 1.695369618196588, "grad_norm": 0.00895692128688097, "learning_rate": 0.0002, "loss": 0.6246432065963745, "mean_token_accuracy": 0.7490787208080292, "num_tokens": 9739248.0, "step": 261 }, { "entropy": 0.6182943060994148, "epoch": 1.7018683996750608, "grad_norm": 0.008069152012467384, "learning_rate": 0.0002, "loss": 0.6146731972694397, "mean_token_accuracy": 0.7493266090750694, "num_tokens": 9776948.0, "step": 262 }, { "entropy": 0.6093627437949181, "epoch": 1.7083671811535337, "grad_norm": 0.00886097177863121, "learning_rate": 0.0002, "loss": 0.6172748804092407, "mean_token_accuracy": 0.7474698126316071, "num_tokens": 9814118.0, "step": 263 }, { "entropy": 0.599872387945652, "epoch": 1.7148659626320066, "grad_norm": 0.009245996363461018, "learning_rate": 0.0002, "loss": 0.6081432700157166, "mean_token_accuracy": 0.7528064101934433, "num_tokens": 9851508.0, "step": 264 }, { "entropy": 0.6169805154204369, "epoch": 1.7213647441104794, "grad_norm": 0.009072757326066494, "learning_rate": 0.0002, "loss": 0.6274439096450806, "mean_token_accuracy": 0.7459535896778107, "num_tokens": 9889084.0, "step": 265 }, { "entropy": 0.6127713099122047, "epoch": 1.727863525588952, "grad_norm": 0.0077358693815767765, "learning_rate": 0.0002, "loss": 0.6177385449409485, "mean_token_accuracy": 0.7487060204148293, "num_tokens": 9926415.0, "step": 266 }, { "entropy": 0.6123405247926712, "epoch": 1.7343623070674248, "grad_norm": 0.00807071104645729, "learning_rate": 0.0002, "loss": 0.6082473397254944, "mean_token_accuracy": 0.7525108605623245, "num_tokens": 9963968.0, "step": 267 }, { "entropy": 0.616507887840271, "epoch": 1.7408610885458975, "grad_norm": 0.008352074772119522, "learning_rate": 0.0002, "loss": 0.6156948804855347, "mean_token_accuracy": 0.7471591085195541, "num_tokens": 10001164.0, "step": 268 }, { "entropy": 0.6224628537893295, "epoch": 1.7473598700243704, "grad_norm": 0.00863809883594513, "learning_rate": 0.0002, "loss": 0.6212406158447266, "mean_token_accuracy": 0.7489727661013603, "num_tokens": 10038309.0, "step": 269 }, { "entropy": 0.6216438189148903, "epoch": 1.7538586515028434, "grad_norm": 0.00882699340581894, "learning_rate": 0.0002, "loss": 0.6236106157302856, "mean_token_accuracy": 0.7466619610786438, "num_tokens": 10075167.0, "step": 270 }, { "entropy": 0.6243376582860947, "epoch": 1.760357432981316, "grad_norm": 0.008083442226052284, "learning_rate": 0.0002, "loss": 0.6196388006210327, "mean_token_accuracy": 0.7481562867760658, "num_tokens": 10112463.0, "step": 271 }, { "entropy": 0.6375504732131958, "epoch": 1.7668562144597888, "grad_norm": 0.009407855570316315, "learning_rate": 0.0002, "loss": 0.6351386308670044, "mean_token_accuracy": 0.7419685274362564, "num_tokens": 10150145.0, "step": 272 }, { "entropy": 0.6064025089144707, "epoch": 1.7733549959382615, "grad_norm": 0.008066139183938503, "learning_rate": 0.0002, "loss": 0.6098955273628235, "mean_token_accuracy": 0.7515333816409111, "num_tokens": 10187476.0, "step": 273 }, { "entropy": 0.609002947807312, "epoch": 1.7798537774167342, "grad_norm": 0.0090776477009058, "learning_rate": 0.0002, "loss": 0.6182198524475098, "mean_token_accuracy": 0.749611884355545, "num_tokens": 10224722.0, "step": 274 }, { "entropy": 0.6023535504937172, "epoch": 1.7863525588952072, "grad_norm": 0.008943675085902214, "learning_rate": 0.0002, "loss": 0.6131588220596313, "mean_token_accuracy": 0.7517130747437477, "num_tokens": 10262008.0, "step": 275 }, { "entropy": 0.6100214198231697, "epoch": 1.7928513403736799, "grad_norm": 0.00780687527731061, "learning_rate": 0.0002, "loss": 0.6113550066947937, "mean_token_accuracy": 0.7519525811076164, "num_tokens": 10299484.0, "step": 276 }, { "entropy": 0.6407601237297058, "epoch": 1.7993501218521528, "grad_norm": 0.008408503606915474, "learning_rate": 0.0002, "loss": 0.6413571834564209, "mean_token_accuracy": 0.7412156239151955, "num_tokens": 10337204.0, "step": 277 }, { "entropy": 0.6267746239900589, "epoch": 1.8058489033306255, "grad_norm": 0.00864301435649395, "learning_rate": 0.0002, "loss": 0.6232145428657532, "mean_token_accuracy": 0.7470541223883629, "num_tokens": 10374550.0, "step": 278 }, { "entropy": 0.6293241009116173, "epoch": 1.8123476848090982, "grad_norm": 0.00788764376193285, "learning_rate": 0.0002, "loss": 0.624733567237854, "mean_token_accuracy": 0.7457406893372536, "num_tokens": 10412206.0, "step": 279 }, { "entropy": 0.6171272769570351, "epoch": 1.818846466287571, "grad_norm": 0.006805213168263435, "learning_rate": 0.0002, "loss": 0.6169811487197876, "mean_token_accuracy": 0.7512501701712608, "num_tokens": 10449535.0, "step": 280 }, { "entropy": 0.6095528453588486, "epoch": 1.825345247766044, "grad_norm": 0.007181530352681875, "learning_rate": 0.0002, "loss": 0.6091392040252686, "mean_token_accuracy": 0.752260759472847, "num_tokens": 10487049.0, "step": 281 }, { "entropy": 0.61494529992342, "epoch": 1.8318440292445166, "grad_norm": 0.008495395071804523, "learning_rate": 0.0002, "loss": 0.6144075393676758, "mean_token_accuracy": 0.7521442621946335, "num_tokens": 10524737.0, "step": 282 }, { "entropy": 0.6196796670556068, "epoch": 1.8383428107229896, "grad_norm": 0.00890264380723238, "learning_rate": 0.0002, "loss": 0.6239107847213745, "mean_token_accuracy": 0.7463233023881912, "num_tokens": 10562188.0, "step": 283 }, { "entropy": 0.5968083441257477, "epoch": 1.8448415922014623, "grad_norm": 0.007078610826283693, "learning_rate": 0.0002, "loss": 0.5999591946601868, "mean_token_accuracy": 0.7574170976877213, "num_tokens": 10599566.0, "step": 284 }, { "entropy": 0.6290047243237495, "epoch": 1.851340373679935, "grad_norm": 0.0070074331015348434, "learning_rate": 0.0002, "loss": 0.6321331262588501, "mean_token_accuracy": 0.7435007244348526, "num_tokens": 10637008.0, "step": 285 }, { "entropy": 0.6198180019855499, "epoch": 1.8578391551584077, "grad_norm": 0.0070502436719834805, "learning_rate": 0.0002, "loss": 0.6187317967414856, "mean_token_accuracy": 0.7489558085799217, "num_tokens": 10674608.0, "step": 286 }, { "entropy": 0.6114784702658653, "epoch": 1.8643379366368806, "grad_norm": 0.009826047345995903, "learning_rate": 0.0002, "loss": 0.6103346347808838, "mean_token_accuracy": 0.7504026591777802, "num_tokens": 10711947.0, "step": 287 }, { "entropy": 0.6145703047513962, "epoch": 1.8708367181153533, "grad_norm": 0.008549013175070286, "learning_rate": 0.0002, "loss": 0.6118488311767578, "mean_token_accuracy": 0.7518711537122726, "num_tokens": 10749467.0, "step": 288 }, { "entropy": 0.6132736206054688, "epoch": 1.8773354995938263, "grad_norm": 0.00803026370704174, "learning_rate": 0.0002, "loss": 0.6166672706604004, "mean_token_accuracy": 0.749387837946415, "num_tokens": 10786750.0, "step": 289 }, { "entropy": 0.6266130581498146, "epoch": 1.883834281072299, "grad_norm": 0.008134995587170124, "learning_rate": 0.0002, "loss": 0.6310341358184814, "mean_token_accuracy": 0.743694357573986, "num_tokens": 10823914.0, "step": 290 }, { "entropy": 0.6153042837977409, "epoch": 1.8903330625507717, "grad_norm": 0.009320992045104504, "learning_rate": 0.0002, "loss": 0.6227383613586426, "mean_token_accuracy": 0.7482397258281708, "num_tokens": 10861283.0, "step": 291 }, { "entropy": 0.6265768557786942, "epoch": 1.8968318440292444, "grad_norm": 0.009208294562995434, "learning_rate": 0.0002, "loss": 0.6274023056030273, "mean_token_accuracy": 0.7459790334105492, "num_tokens": 10898650.0, "step": 292 }, { "entropy": 0.6209842190146446, "epoch": 1.9033306255077171, "grad_norm": 0.007123781833797693, "learning_rate": 0.0002, "loss": 0.6167253255844116, "mean_token_accuracy": 0.7506068870425224, "num_tokens": 10936405.0, "step": 293 }, { "entropy": 0.6177584528923035, "epoch": 1.90982940698619, "grad_norm": 0.0075668166391551495, "learning_rate": 0.0002, "loss": 0.6163274049758911, "mean_token_accuracy": 0.7489276751875877, "num_tokens": 10973923.0, "step": 294 }, { "entropy": 0.6218736097216606, "epoch": 1.916328188464663, "grad_norm": 0.0085530336946249, "learning_rate": 0.0002, "loss": 0.6214455366134644, "mean_token_accuracy": 0.747297577559948, "num_tokens": 11011183.0, "step": 295 }, { "entropy": 0.6203776001930237, "epoch": 1.9228269699431357, "grad_norm": 0.008531006053090096, "learning_rate": 0.0002, "loss": 0.6233081817626953, "mean_token_accuracy": 0.7472613751888275, "num_tokens": 11048409.0, "step": 296 }, { "entropy": 0.6170744299888611, "epoch": 1.9293257514216084, "grad_norm": 0.006794555112719536, "learning_rate": 0.0002, "loss": 0.6177318096160889, "mean_token_accuracy": 0.7481219694018364, "num_tokens": 11085854.0, "step": 297 }, { "entropy": 0.6205914691090584, "epoch": 1.9358245329000812, "grad_norm": 0.00894018355756998, "learning_rate": 0.0002, "loss": 0.6211514472961426, "mean_token_accuracy": 0.7470626905560493, "num_tokens": 11122678.0, "step": 298 }, { "entropy": 0.6179786175489426, "epoch": 1.9423233143785539, "grad_norm": 0.008218267932534218, "learning_rate": 0.0002, "loss": 0.6211084723472595, "mean_token_accuracy": 0.7481166496872902, "num_tokens": 11160207.0, "step": 299 }, { "entropy": 0.6241402998566628, "epoch": 1.9488220958570268, "grad_norm": 0.008334561251103878, "learning_rate": 0.0002, "loss": 0.6270841360092163, "mean_token_accuracy": 0.7478617802262306, "num_tokens": 11197850.0, "step": 300 }, { "entropy": 0.6133561357855797, "epoch": 1.9553208773354998, "grad_norm": 0.0071178278885781765, "learning_rate": 0.0002, "loss": 0.6169086694717407, "mean_token_accuracy": 0.7505014687776566, "num_tokens": 11235129.0, "step": 301 }, { "entropy": 0.6112445220351219, "epoch": 1.9618196588139725, "grad_norm": 0.00821610540151596, "learning_rate": 0.0002, "loss": 0.6131574511528015, "mean_token_accuracy": 0.7517394497990608, "num_tokens": 11272140.0, "step": 302 }, { "entropy": 0.6255387738347054, "epoch": 1.9683184402924452, "grad_norm": 0.009108194150030613, "learning_rate": 0.0002, "loss": 0.6270141005516052, "mean_token_accuracy": 0.7442326322197914, "num_tokens": 11309074.0, "step": 303 }, { "entropy": 0.6138653978705406, "epoch": 1.974817221770918, "grad_norm": 0.007860496640205383, "learning_rate": 0.0002, "loss": 0.6152341961860657, "mean_token_accuracy": 0.7488235086202621, "num_tokens": 11346694.0, "step": 304 }, { "entropy": 0.6311385780572891, "epoch": 1.9813160032493906, "grad_norm": 0.008101027458906174, "learning_rate": 0.0002, "loss": 0.6344274282455444, "mean_token_accuracy": 0.7414661273360252, "num_tokens": 11384229.0, "step": 305 }, { "entropy": 0.6193428635597229, "epoch": 1.9878147847278635, "grad_norm": 0.007910770364105701, "learning_rate": 0.0002, "loss": 0.6175734400749207, "mean_token_accuracy": 0.7502587288618088, "num_tokens": 11421788.0, "step": 306 }, { "entropy": 0.6222855523228645, "epoch": 1.9943135662063363, "grad_norm": 0.008522240445017815, "learning_rate": 0.0002, "loss": 0.623339831829071, "mean_token_accuracy": 0.7481605112552643, "num_tokens": 11459154.0, "step": 307 }, { "entropy": 0.6278953552246094, "epoch": 2.0, "grad_norm": 0.008388028480112553, "learning_rate": 0.0002, "loss": 0.6375839710235596, "mean_token_accuracy": 0.7482074073382786, "num_tokens": 11475381.0, "step": 308 }, { "entropy": 0.613355465233326, "epoch": 2.0064987814784727, "grad_norm": 0.00827846396714449, "learning_rate": 0.0002, "loss": 0.6111053228378296, "mean_token_accuracy": 0.7524029165506363, "num_tokens": 11512446.0, "step": 309 }, { "entropy": 0.6208668798208237, "epoch": 2.0129975629569454, "grad_norm": 0.008557752706110477, "learning_rate": 0.0002, "loss": 0.6219561100006104, "mean_token_accuracy": 0.7458884716033936, "num_tokens": 11549773.0, "step": 310 }, { "entropy": 0.6194536536931992, "epoch": 2.019496344435418, "grad_norm": 0.009552874602377415, "learning_rate": 0.0002, "loss": 0.624874472618103, "mean_token_accuracy": 0.7470095753669739, "num_tokens": 11587104.0, "step": 311 }, { "entropy": 0.6137440055608749, "epoch": 2.0259951259138913, "grad_norm": 0.008704678155481815, "learning_rate": 0.0002, "loss": 0.6167584657669067, "mean_token_accuracy": 0.7494626566767693, "num_tokens": 11624387.0, "step": 312 }, { "entropy": 0.6213903650641441, "epoch": 2.032493907392364, "grad_norm": 0.007905784994363785, "learning_rate": 0.0002, "loss": 0.622920036315918, "mean_token_accuracy": 0.7466430589556694, "num_tokens": 11661928.0, "step": 313 }, { "entropy": 0.608438141644001, "epoch": 2.0389926888708367, "grad_norm": 0.008782708086073399, "learning_rate": 0.0002, "loss": 0.6084336638450623, "mean_token_accuracy": 0.7526147440075874, "num_tokens": 11699518.0, "step": 314 }, { "entropy": 0.6130177453160286, "epoch": 2.0454914703493094, "grad_norm": 0.009063824079930782, "learning_rate": 0.0002, "loss": 0.6168864965438843, "mean_token_accuracy": 0.7494284063577652, "num_tokens": 11737013.0, "step": 315 }, { "entropy": 0.6137471869587898, "epoch": 2.051990251827782, "grad_norm": 0.008271057158708572, "learning_rate": 0.0002, "loss": 0.6143357753753662, "mean_token_accuracy": 0.7498123943805695, "num_tokens": 11774346.0, "step": 316 }, { "entropy": 0.6195183843374252, "epoch": 2.058489033306255, "grad_norm": 0.007240446750074625, "learning_rate": 0.0002, "loss": 0.6194902062416077, "mean_token_accuracy": 0.7464936003088951, "num_tokens": 11811650.0, "step": 317 }, { "entropy": 0.6273763924837112, "epoch": 2.064987814784728, "grad_norm": 0.009513584896922112, "learning_rate": 0.0002, "loss": 0.6216360330581665, "mean_token_accuracy": 0.7472178563475609, "num_tokens": 11849227.0, "step": 318 }, { "entropy": 0.6146251261234283, "epoch": 2.0714865962632008, "grad_norm": 0.007890078239142895, "learning_rate": 0.0002, "loss": 0.6166911721229553, "mean_token_accuracy": 0.7501556724309921, "num_tokens": 11886732.0, "step": 319 }, { "entropy": 0.5975739285349846, "epoch": 2.0779853777416735, "grad_norm": 0.009085185825824738, "learning_rate": 0.0002, "loss": 0.6020256280899048, "mean_token_accuracy": 0.7525540143251419, "num_tokens": 11923954.0, "step": 320 }, { "entropy": 0.6165630891919136, "epoch": 2.084484159220146, "grad_norm": 0.006837225519120693, "learning_rate": 0.0002, "loss": 0.6179453134536743, "mean_token_accuracy": 0.7491353005170822, "num_tokens": 11961305.0, "step": 321 }, { "entropy": 0.6221051812171936, "epoch": 2.090982940698619, "grad_norm": 0.007578800432384014, "learning_rate": 0.0002, "loss": 0.6233739852905273, "mean_token_accuracy": 0.7461354285478592, "num_tokens": 11998561.0, "step": 322 }, { "entropy": 0.6175716295838356, "epoch": 2.0974817221770916, "grad_norm": 0.008444663137197495, "learning_rate": 0.0002, "loss": 0.6204410791397095, "mean_token_accuracy": 0.7468695417046547, "num_tokens": 12035916.0, "step": 323 }, { "entropy": 0.6165966615080833, "epoch": 2.1039805036555648, "grad_norm": 0.008185302838683128, "learning_rate": 0.0002, "loss": 0.6171708106994629, "mean_token_accuracy": 0.7481535449624062, "num_tokens": 12073704.0, "step": 324 }, { "entropy": 0.6210658326745033, "epoch": 2.1104792851340375, "grad_norm": 0.0074119968339800835, "learning_rate": 0.0002, "loss": 0.6183840036392212, "mean_token_accuracy": 0.7473175972700119, "num_tokens": 12111357.0, "step": 325 }, { "entropy": 0.617885060608387, "epoch": 2.11697806661251, "grad_norm": 0.007906505838036537, "learning_rate": 0.0002, "loss": 0.6161532998085022, "mean_token_accuracy": 0.7496127933263779, "num_tokens": 12148879.0, "step": 326 }, { "entropy": 0.6197918429970741, "epoch": 2.123476848090983, "grad_norm": 0.007352263201028109, "learning_rate": 0.0002, "loss": 0.6218726634979248, "mean_token_accuracy": 0.7473544403910637, "num_tokens": 12186546.0, "step": 327 }, { "entropy": 0.6142667904496193, "epoch": 2.1299756295694556, "grad_norm": 0.008285868912935257, "learning_rate": 0.0002, "loss": 0.6169737577438354, "mean_token_accuracy": 0.7486495152115822, "num_tokens": 12223727.0, "step": 328 }, { "entropy": 0.6135031282901764, "epoch": 2.1364744110479283, "grad_norm": 0.00797727145254612, "learning_rate": 0.0002, "loss": 0.6149879097938538, "mean_token_accuracy": 0.7501881718635559, "num_tokens": 12261432.0, "step": 329 }, { "entropy": 0.614725299179554, "epoch": 2.1429731925264015, "grad_norm": 0.0077530802227556705, "learning_rate": 0.0002, "loss": 0.6197780966758728, "mean_token_accuracy": 0.7476382106542587, "num_tokens": 12298773.0, "step": 330 }, { "entropy": 0.6204890534281731, "epoch": 2.149471974004874, "grad_norm": 0.007455397862941027, "learning_rate": 0.0002, "loss": 0.6217861175537109, "mean_token_accuracy": 0.7472267374396324, "num_tokens": 12335838.0, "step": 331 }, { "entropy": 0.6141664981842041, "epoch": 2.155970755483347, "grad_norm": 0.007735258899629116, "learning_rate": 0.0002, "loss": 0.619376540184021, "mean_token_accuracy": 0.7473561838269234, "num_tokens": 12373171.0, "step": 332 }, { "entropy": 0.6120809391140938, "epoch": 2.1624695369618196, "grad_norm": 0.008401036262512207, "learning_rate": 0.0002, "loss": 0.6154431700706482, "mean_token_accuracy": 0.7471263483166695, "num_tokens": 12410549.0, "step": 333 }, { "entropy": 0.6145179942250252, "epoch": 2.1689683184402924, "grad_norm": 0.00904724933207035, "learning_rate": 0.0002, "loss": 0.6087259650230408, "mean_token_accuracy": 0.7501003369688988, "num_tokens": 12447788.0, "step": 334 }, { "entropy": 0.6214614436030388, "epoch": 2.175467099918765, "grad_norm": 0.007604485843330622, "learning_rate": 0.0002, "loss": 0.6169778108596802, "mean_token_accuracy": 0.7492403090000153, "num_tokens": 12485368.0, "step": 335 }, { "entropy": 0.6146392300724983, "epoch": 2.181965881397238, "grad_norm": 0.008299093693494797, "learning_rate": 0.0002, "loss": 0.6154477596282959, "mean_token_accuracy": 0.7474880516529083, "num_tokens": 12522590.0, "step": 336 }, { "entropy": 0.6179040372371674, "epoch": 2.188464662875711, "grad_norm": 0.009656457230448723, "learning_rate": 0.0002, "loss": 0.6244622468948364, "mean_token_accuracy": 0.74583899974823, "num_tokens": 12559957.0, "step": 337 }, { "entropy": 0.6236468479037285, "epoch": 2.1949634443541837, "grad_norm": 0.008342688903212547, "learning_rate": 0.0002, "loss": 0.6273738145828247, "mean_token_accuracy": 0.7441191673278809, "num_tokens": 12597080.0, "step": 338 }, { "entropy": 0.6155964732170105, "epoch": 2.2014622258326564, "grad_norm": 0.008706323802471161, "learning_rate": 0.0002, "loss": 0.6139167547225952, "mean_token_accuracy": 0.7505380213260651, "num_tokens": 12634470.0, "step": 339 }, { "entropy": 0.6147474870085716, "epoch": 2.207961007311129, "grad_norm": 0.009130026213824749, "learning_rate": 0.0002, "loss": 0.6147286891937256, "mean_token_accuracy": 0.7490043491125107, "num_tokens": 12671909.0, "step": 340 }, { "entropy": 0.6133714243769646, "epoch": 2.214459788789602, "grad_norm": 0.008477689698338509, "learning_rate": 0.0002, "loss": 0.6187378168106079, "mean_token_accuracy": 0.7469930872321129, "num_tokens": 12708771.0, "step": 341 }, { "entropy": 0.6298847869038582, "epoch": 2.2209585702680745, "grad_norm": 0.009632086381316185, "learning_rate": 0.0002, "loss": 0.6292200684547424, "mean_token_accuracy": 0.7443962469696999, "num_tokens": 12746208.0, "step": 342 }, { "entropy": 0.6298182159662247, "epoch": 2.2274573517465477, "grad_norm": 0.007817580364644527, "learning_rate": 0.0002, "loss": 0.6289129853248596, "mean_token_accuracy": 0.7439332380890846, "num_tokens": 12783644.0, "step": 343 }, { "entropy": 0.6162709593772888, "epoch": 2.2339561332250204, "grad_norm": 0.009011663496494293, "learning_rate": 0.0002, "loss": 0.6142280101776123, "mean_token_accuracy": 0.7506413981318474, "num_tokens": 12821007.0, "step": 344 }, { "entropy": 0.6286559477448463, "epoch": 2.240454914703493, "grad_norm": 0.009188450872898102, "learning_rate": 0.0002, "loss": 0.6286423206329346, "mean_token_accuracy": 0.7440641894936562, "num_tokens": 12858516.0, "step": 345 }, { "entropy": 0.6245385706424713, "epoch": 2.246953696181966, "grad_norm": 0.009156906045973301, "learning_rate": 0.0002, "loss": 0.6278682947158813, "mean_token_accuracy": 0.7443269118666649, "num_tokens": 12895999.0, "step": 346 }, { "entropy": 0.6157897710800171, "epoch": 2.2534524776604385, "grad_norm": 0.007890370674431324, "learning_rate": 0.0002, "loss": 0.6214807033538818, "mean_token_accuracy": 0.7472835406661034, "num_tokens": 12933354.0, "step": 347 }, { "entropy": 0.6123293116688728, "epoch": 2.2599512591389113, "grad_norm": 0.007912621833384037, "learning_rate": 0.0002, "loss": 0.6164427995681763, "mean_token_accuracy": 0.7487083747982979, "num_tokens": 12970559.0, "step": 348 }, { "entropy": 0.6260915771126747, "epoch": 2.2664500406173844, "grad_norm": 0.008234160020947456, "learning_rate": 0.0002, "loss": 0.6222859621047974, "mean_token_accuracy": 0.7458368241786957, "num_tokens": 13008283.0, "step": 349 }, { "entropy": 0.6248592287302017, "epoch": 2.272948822095857, "grad_norm": 0.009832987561821938, "learning_rate": 0.0002, "loss": 0.6199322938919067, "mean_token_accuracy": 0.7477703094482422, "num_tokens": 13045527.0, "step": 350 }, { "entropy": 0.6275637075304985, "epoch": 2.27944760357433, "grad_norm": 0.008727029897272587, "learning_rate": 0.0002, "loss": 0.632993221282959, "mean_token_accuracy": 0.7412514090538025, "num_tokens": 13082974.0, "step": 351 }, { "entropy": 0.6118641197681427, "epoch": 2.2859463850528026, "grad_norm": 0.009624680504202843, "learning_rate": 0.0002, "loss": 0.6219325065612793, "mean_token_accuracy": 0.7466080039739609, "num_tokens": 13120093.0, "step": 352 }, { "entropy": 0.5959088578820229, "epoch": 2.2924451665312753, "grad_norm": 0.007752889767289162, "learning_rate": 0.0002, "loss": 0.5983707904815674, "mean_token_accuracy": 0.755429819226265, "num_tokens": 13157659.0, "step": 353 }, { "entropy": 0.6112657487392426, "epoch": 2.298943948009748, "grad_norm": 0.008281555026769638, "learning_rate": 0.0002, "loss": 0.6082602143287659, "mean_token_accuracy": 0.7516218572854996, "num_tokens": 13194647.0, "step": 354 }, { "entropy": 0.6122025474905968, "epoch": 2.305442729488221, "grad_norm": 0.008959132246673107, "learning_rate": 0.0002, "loss": 0.6142069101333618, "mean_token_accuracy": 0.7516066282987595, "num_tokens": 13231933.0, "step": 355 }, { "entropy": 0.610342264175415, "epoch": 2.311941510966694, "grad_norm": 0.0076917321421206, "learning_rate": 0.0002, "loss": 0.6098777055740356, "mean_token_accuracy": 0.7534263134002686, "num_tokens": 13269472.0, "step": 356 }, { "entropy": 0.6236057877540588, "epoch": 2.3184402924451666, "grad_norm": 0.008514189161360264, "learning_rate": 0.0002, "loss": 0.6241997480392456, "mean_token_accuracy": 0.7468095943331718, "num_tokens": 13307269.0, "step": 357 }, { "entropy": 0.6160306110978127, "epoch": 2.3249390739236393, "grad_norm": 0.009143211878836155, "learning_rate": 0.0002, "loss": 0.6196573972702026, "mean_token_accuracy": 0.7480775937438011, "num_tokens": 13344551.0, "step": 358 }, { "entropy": 0.6120478510856628, "epoch": 2.331437855402112, "grad_norm": 0.007592627312988043, "learning_rate": 0.0002, "loss": 0.6155714392662048, "mean_token_accuracy": 0.7500782683491707, "num_tokens": 13382127.0, "step": 359 }, { "entropy": 0.6234208717942238, "epoch": 2.3379366368805847, "grad_norm": 0.008143738843500614, "learning_rate": 0.0002, "loss": 0.6278046369552612, "mean_token_accuracy": 0.7446608766913414, "num_tokens": 13419810.0, "step": 360 }, { "entropy": 0.6157349273562431, "epoch": 2.3444354183590574, "grad_norm": 0.008566657081246376, "learning_rate": 0.0002, "loss": 0.6156420707702637, "mean_token_accuracy": 0.7479202896356583, "num_tokens": 13457273.0, "step": 361 }, { "entropy": 0.6180937066674232, "epoch": 2.3509341998375306, "grad_norm": 0.008304375223815441, "learning_rate": 0.0002, "loss": 0.622611403465271, "mean_token_accuracy": 0.7477732971310616, "num_tokens": 13494536.0, "step": 362 }, { "entropy": 0.6232565492391586, "epoch": 2.3574329813160033, "grad_norm": 0.008868128061294556, "learning_rate": 0.0002, "loss": 0.6260833740234375, "mean_token_accuracy": 0.7459229752421379, "num_tokens": 13531864.0, "step": 363 }, { "entropy": 0.6254989579319954, "epoch": 2.363931762794476, "grad_norm": 0.008256005123257637, "learning_rate": 0.0002, "loss": 0.6260857582092285, "mean_token_accuracy": 0.7447438836097717, "num_tokens": 13569443.0, "step": 364 }, { "entropy": 0.6221200376749039, "epoch": 2.3704305442729487, "grad_norm": 0.009361873380839825, "learning_rate": 0.0002, "loss": 0.6180988550186157, "mean_token_accuracy": 0.7470216527581215, "num_tokens": 13606513.0, "step": 365 }, { "entropy": 0.616127498447895, "epoch": 2.3769293257514215, "grad_norm": 0.008144999854266644, "learning_rate": 0.0002, "loss": 0.6137336492538452, "mean_token_accuracy": 0.7496519684791565, "num_tokens": 13643706.0, "step": 366 }, { "entropy": 0.6194290667772293, "epoch": 2.3834281072298946, "grad_norm": 0.008278160355985165, "learning_rate": 0.0002, "loss": 0.6232280135154724, "mean_token_accuracy": 0.7481147646903992, "num_tokens": 13680957.0, "step": 367 }, { "entropy": 0.6192846670746803, "epoch": 2.3899268887083673, "grad_norm": 0.010223917663097382, "learning_rate": 0.0002, "loss": 0.6253848075866699, "mean_token_accuracy": 0.744193010032177, "num_tokens": 13717903.0, "step": 368 }, { "entropy": 0.6221625953912735, "epoch": 2.39642567018684, "grad_norm": 0.008200163953006268, "learning_rate": 0.0002, "loss": 0.6191288232803345, "mean_token_accuracy": 0.74726802110672, "num_tokens": 13755260.0, "step": 369 }, { "entropy": 0.6163566559553146, "epoch": 2.4029244516653128, "grad_norm": 0.007974907755851746, "learning_rate": 0.0002, "loss": 0.6134728193283081, "mean_token_accuracy": 0.7508314996957779, "num_tokens": 13792517.0, "step": 370 }, { "entropy": 0.6114080101251602, "epoch": 2.4094232331437855, "grad_norm": 0.008343557827174664, "learning_rate": 0.0002, "loss": 0.6111307144165039, "mean_token_accuracy": 0.7514908611774445, "num_tokens": 13829760.0, "step": 371 }, { "entropy": 0.5953814163804054, "epoch": 2.415922014622258, "grad_norm": 0.01898498833179474, "learning_rate": 0.0002, "loss": 0.5988050699234009, "mean_token_accuracy": 0.7543381601572037, "num_tokens": 13867370.0, "step": 372 }, { "entropy": 0.6071057021617889, "epoch": 2.422420796100731, "grad_norm": 0.023124704137444496, "learning_rate": 0.0002, "loss": 0.6178369522094727, "mean_token_accuracy": 0.747986689209938, "num_tokens": 13904625.0, "step": 373 }, { "entropy": 0.6107468456029892, "epoch": 2.428919577579204, "grad_norm": 0.01215590164065361, "learning_rate": 0.0002, "loss": 0.6207199096679688, "mean_token_accuracy": 0.7475155666470528, "num_tokens": 13942489.0, "step": 374 }, { "entropy": 0.6124749183654785, "epoch": 2.435418359057677, "grad_norm": 0.012728074565529823, "learning_rate": 0.0002, "loss": 0.6103756427764893, "mean_token_accuracy": 0.7500820159912109, "num_tokens": 13980205.0, "step": 375 }, { "entropy": 0.6109942868351936, "epoch": 2.4419171405361495, "grad_norm": 0.009368120692670345, "learning_rate": 0.0002, "loss": 0.6066494584083557, "mean_token_accuracy": 0.7536064460873604, "num_tokens": 14017641.0, "step": 376 }, { "entropy": 0.624424010515213, "epoch": 2.448415922014622, "grad_norm": 0.016890961676836014, "learning_rate": 0.0002, "loss": 0.614218533039093, "mean_token_accuracy": 0.7494603618979454, "num_tokens": 14054677.0, "step": 377 }, { "entropy": 0.6255820393562317, "epoch": 2.454914703493095, "grad_norm": 0.009696394205093384, "learning_rate": 0.0002, "loss": 0.6304793357849121, "mean_token_accuracy": 0.7434439361095428, "num_tokens": 14091764.0, "step": 378 }, { "entropy": 0.621983028948307, "epoch": 2.4614134849715676, "grad_norm": 0.020173629745841026, "learning_rate": 0.0002, "loss": 0.6257689595222473, "mean_token_accuracy": 0.745697520673275, "num_tokens": 14129278.0, "step": 379 }, { "entropy": 0.6207767054438591, "epoch": 2.467912266450041, "grad_norm": 0.008954247459769249, "learning_rate": 0.0002, "loss": 0.6241703033447266, "mean_token_accuracy": 0.750006191432476, "num_tokens": 14167232.0, "step": 380 }, { "entropy": 0.6112791821360588, "epoch": 2.4744110479285135, "grad_norm": 0.009806505404412746, "learning_rate": 0.0002, "loss": 0.6147319078445435, "mean_token_accuracy": 0.7495506927371025, "num_tokens": 14204632.0, "step": 381 }, { "entropy": 0.6135937720537186, "epoch": 2.4809098294069862, "grad_norm": 0.008928372524678707, "learning_rate": 0.0002, "loss": 0.6139630079269409, "mean_token_accuracy": 0.7506385967135429, "num_tokens": 14242352.0, "step": 382 }, { "entropy": 0.6150240004062653, "epoch": 2.487408610885459, "grad_norm": 0.015955505892634392, "learning_rate": 0.0002, "loss": 0.6152509450912476, "mean_token_accuracy": 0.7515363991260529, "num_tokens": 14280058.0, "step": 383 }, { "entropy": 0.6128680855035782, "epoch": 2.4939073923639317, "grad_norm": 0.009567083790898323, "learning_rate": 0.0002, "loss": 0.6167535781860352, "mean_token_accuracy": 0.748919777572155, "num_tokens": 14317661.0, "step": 384 }, { "entropy": 0.626237154006958, "epoch": 2.5004061738424044, "grad_norm": 0.01046669203788042, "learning_rate": 0.0002, "loss": 0.6324093341827393, "mean_token_accuracy": 0.7444325461983681, "num_tokens": 14355367.0, "step": 385 }, { "entropy": 0.6202276349067688, "epoch": 2.506904955320877, "grad_norm": 0.007664418779313564, "learning_rate": 0.0002, "loss": 0.6191686987876892, "mean_token_accuracy": 0.7475631311535835, "num_tokens": 14393315.0, "step": 386 }, { "entropy": 0.6242005750536919, "epoch": 2.5134037367993503, "grad_norm": 0.00844619981944561, "learning_rate": 0.0002, "loss": 0.621794581413269, "mean_token_accuracy": 0.7481283098459244, "num_tokens": 14430853.0, "step": 387 }, { "entropy": 0.6239676773548126, "epoch": 2.519902518277823, "grad_norm": 0.008689953945577145, "learning_rate": 0.0002, "loss": 0.6237965226173401, "mean_token_accuracy": 0.7461953610181808, "num_tokens": 14468292.0, "step": 388 }, { "entropy": 0.6107499524950981, "epoch": 2.5264012997562957, "grad_norm": 0.009505955502390862, "learning_rate": 0.0002, "loss": 0.6074596643447876, "mean_token_accuracy": 0.7525542005896568, "num_tokens": 14505921.0, "step": 389 }, { "entropy": 0.6142911538481712, "epoch": 2.5329000812347684, "grad_norm": 0.009658354334533215, "learning_rate": 0.0002, "loss": 0.6198441982269287, "mean_token_accuracy": 0.7489058822393417, "num_tokens": 14543384.0, "step": 390 }, { "entropy": 0.6049473881721497, "epoch": 2.539398862713241, "grad_norm": 0.010726661421358585, "learning_rate": 0.0002, "loss": 0.6118952631950378, "mean_token_accuracy": 0.7526208385825157, "num_tokens": 14580935.0, "step": 391 }, { "entropy": 0.5964333266019821, "epoch": 2.5458976441917143, "grad_norm": 0.00981208123266697, "learning_rate": 0.0002, "loss": 0.6057010889053345, "mean_token_accuracy": 0.7543943077325821, "num_tokens": 14618074.0, "step": 392 }, { "entropy": 0.6099359169602394, "epoch": 2.552396425670187, "grad_norm": 0.009079058654606342, "learning_rate": 0.0002, "loss": 0.6084835529327393, "mean_token_accuracy": 0.7520028725266457, "num_tokens": 14655186.0, "step": 393 }, { "entropy": 0.6173275411128998, "epoch": 2.5588952071486597, "grad_norm": 0.009335207752883434, "learning_rate": 0.0002, "loss": 0.6102230548858643, "mean_token_accuracy": 0.7514491975307465, "num_tokens": 14692383.0, "step": 394 }, { "entropy": 0.6305418461561203, "epoch": 2.5653939886271324, "grad_norm": 0.009312084876000881, "learning_rate": 0.0002, "loss": 0.6281323432922363, "mean_token_accuracy": 0.7421899363398552, "num_tokens": 14729446.0, "step": 395 }, { "entropy": 0.6119675636291504, "epoch": 2.571892770105605, "grad_norm": 0.00806971825659275, "learning_rate": 0.0002, "loss": 0.6118816137313843, "mean_token_accuracy": 0.7502529993653297, "num_tokens": 14766917.0, "step": 396 }, { "entropy": 0.6194342076778412, "epoch": 2.578391551584078, "grad_norm": 0.009102623909711838, "learning_rate": 0.0002, "loss": 0.625906229019165, "mean_token_accuracy": 0.7444874346256256, "num_tokens": 14804635.0, "step": 397 }, { "entropy": 0.6129268780350685, "epoch": 2.5848903330625506, "grad_norm": 0.010471413843333721, "learning_rate": 0.0002, "loss": 0.6221112012863159, "mean_token_accuracy": 0.7463114410638809, "num_tokens": 14842380.0, "step": 398 }, { "entropy": 0.6111740916967392, "epoch": 2.5913891145410237, "grad_norm": 0.008378157392144203, "learning_rate": 0.0002, "loss": 0.6132410764694214, "mean_token_accuracy": 0.7493879497051239, "num_tokens": 14879441.0, "step": 399 }, { "entropy": 0.6207928210496902, "epoch": 2.5978878960194964, "grad_norm": 0.008037488907575607, "learning_rate": 0.0002, "loss": 0.6196093559265137, "mean_token_accuracy": 0.7491321563720703, "num_tokens": 14916731.0, "step": 400 }, { "entropy": 0.6349622085690498, "epoch": 2.604386677497969, "grad_norm": 0.00913564208894968, "learning_rate": 0.0002, "loss": 0.6318038702011108, "mean_token_accuracy": 0.7420522123575211, "num_tokens": 14954276.0, "step": 401 }, { "entropy": 0.6019857749342918, "epoch": 2.610885458976442, "grad_norm": 0.008696068078279495, "learning_rate": 0.0002, "loss": 0.600864052772522, "mean_token_accuracy": 0.7552035823464394, "num_tokens": 14991349.0, "step": 402 }, { "entropy": 0.6017836257815361, "epoch": 2.6173842404549146, "grad_norm": 0.008207019418478012, "learning_rate": 0.0002, "loss": 0.6038705706596375, "mean_token_accuracy": 0.7532704323530197, "num_tokens": 15028601.0, "step": 403 }, { "entropy": 0.6120554357767105, "epoch": 2.6238830219333877, "grad_norm": 0.008753425441682339, "learning_rate": 0.0002, "loss": 0.6164306998252869, "mean_token_accuracy": 0.7496815398335457, "num_tokens": 15066182.0, "step": 404 }, { "entropy": 0.6131924018263817, "epoch": 2.6303818034118605, "grad_norm": 0.008548066020011902, "learning_rate": 0.0002, "loss": 0.6181113719940186, "mean_token_accuracy": 0.7491538524627686, "num_tokens": 15103340.0, "step": 405 }, { "entropy": 0.6061984226107597, "epoch": 2.636880584890333, "grad_norm": 0.009016766212880611, "learning_rate": 0.0002, "loss": 0.6121985912322998, "mean_token_accuracy": 0.7507323697209358, "num_tokens": 15140594.0, "step": 406 }, { "entropy": 0.6165529787540436, "epoch": 2.643379366368806, "grad_norm": 0.007676286157220602, "learning_rate": 0.0002, "loss": 0.6143813133239746, "mean_token_accuracy": 0.7518013492226601, "num_tokens": 15178037.0, "step": 407 }, { "entropy": 0.6116887852549553, "epoch": 2.6498781478472786, "grad_norm": 0.007873927243053913, "learning_rate": 0.0002, "loss": 0.6096634268760681, "mean_token_accuracy": 0.7518724203109741, "num_tokens": 15215362.0, "step": 408 }, { "entropy": 0.6075077503919601, "epoch": 2.6563769293257513, "grad_norm": 0.007256446871906519, "learning_rate": 0.0002, "loss": 0.6078198552131653, "mean_token_accuracy": 0.7537789046764374, "num_tokens": 15252624.0, "step": 409 }, { "entropy": 0.6106631234288216, "epoch": 2.662875710804224, "grad_norm": 0.009321639314293861, "learning_rate": 0.0002, "loss": 0.6120110750198364, "mean_token_accuracy": 0.7512669935822487, "num_tokens": 15290298.0, "step": 410 }, { "entropy": 0.6318610459566116, "epoch": 2.6693744922826967, "grad_norm": 0.008198688738048077, "learning_rate": 0.0002, "loss": 0.6370584964752197, "mean_token_accuracy": 0.740862101316452, "num_tokens": 15327374.0, "step": 411 }, { "entropy": 0.6139440014958382, "epoch": 2.67587327376117, "grad_norm": 0.008440233767032623, "learning_rate": 0.0002, "loss": 0.6130324602127075, "mean_token_accuracy": 0.7509049624204636, "num_tokens": 15364313.0, "step": 412 }, { "entropy": 0.6132312193512917, "epoch": 2.6823720552396426, "grad_norm": 0.00764568243175745, "learning_rate": 0.0002, "loss": 0.6143498420715332, "mean_token_accuracy": 0.7499875500798225, "num_tokens": 15401585.0, "step": 413 }, { "entropy": 0.6295821517705917, "epoch": 2.6888708367181153, "grad_norm": 0.00870992336422205, "learning_rate": 0.0002, "loss": 0.6297035217285156, "mean_token_accuracy": 0.7440814226865768, "num_tokens": 15439063.0, "step": 414 }, { "entropy": 0.6159479022026062, "epoch": 2.695369618196588, "grad_norm": 0.007172968704253435, "learning_rate": 0.0002, "loss": 0.6142174005508423, "mean_token_accuracy": 0.7487895339727402, "num_tokens": 15476100.0, "step": 415 }, { "entropy": 0.6020728126168251, "epoch": 2.7018683996750608, "grad_norm": 0.007704848889261484, "learning_rate": 0.0002, "loss": 0.6082124710083008, "mean_token_accuracy": 0.752522885799408, "num_tokens": 15513167.0, "step": 416 }, { "entropy": 0.6281116902828217, "epoch": 2.708367181153534, "grad_norm": 0.00924444105476141, "learning_rate": 0.0002, "loss": 0.6312050819396973, "mean_token_accuracy": 0.7460011318325996, "num_tokens": 15550739.0, "step": 417 }, { "entropy": 0.6233636066317558, "epoch": 2.7148659626320066, "grad_norm": 0.008710985071957111, "learning_rate": 0.0002, "loss": 0.6260718107223511, "mean_token_accuracy": 0.744461327791214, "num_tokens": 15587950.0, "step": 418 }, { "entropy": 0.6195387095212936, "epoch": 2.7213647441104794, "grad_norm": 0.007183417212218046, "learning_rate": 0.0002, "loss": 0.6212611198425293, "mean_token_accuracy": 0.746867798268795, "num_tokens": 15625008.0, "step": 419 }, { "entropy": 0.6109424605965614, "epoch": 2.727863525588952, "grad_norm": 0.0077791716903448105, "learning_rate": 0.0002, "loss": 0.6113884449005127, "mean_token_accuracy": 0.7505641579627991, "num_tokens": 15662159.0, "step": 420 }, { "entropy": 0.6187275499105453, "epoch": 2.734362307067425, "grad_norm": 0.008177550509572029, "learning_rate": 0.0002, "loss": 0.6187748908996582, "mean_token_accuracy": 0.7493242397904396, "num_tokens": 15699404.0, "step": 421 }, { "entropy": 0.6269592270255089, "epoch": 2.7408610885458975, "grad_norm": 0.00797547772526741, "learning_rate": 0.0002, "loss": 0.6266059875488281, "mean_token_accuracy": 0.7470143884420395, "num_tokens": 15736867.0, "step": 422 }, { "entropy": 0.6187637895345688, "epoch": 2.74735987002437, "grad_norm": 0.008009313605725765, "learning_rate": 0.0002, "loss": 0.6174246072769165, "mean_token_accuracy": 0.748706616461277, "num_tokens": 15774518.0, "step": 423 }, { "entropy": 0.6222201958298683, "epoch": 2.7538586515028434, "grad_norm": 0.00828398484736681, "learning_rate": 0.0002, "loss": 0.6254167556762695, "mean_token_accuracy": 0.7451123148202896, "num_tokens": 15811807.0, "step": 424 }, { "entropy": 0.6253098249435425, "epoch": 2.760357432981316, "grad_norm": 0.0075772651471197605, "learning_rate": 0.0002, "loss": 0.6270281076431274, "mean_token_accuracy": 0.744781106710434, "num_tokens": 15849715.0, "step": 425 }, { "entropy": 0.6165027767419815, "epoch": 2.766856214459789, "grad_norm": 0.00784947071224451, "learning_rate": 0.0002, "loss": 0.6173769235610962, "mean_token_accuracy": 0.748318687081337, "num_tokens": 15886927.0, "step": 426 }, { "entropy": 0.6187942251563072, "epoch": 2.7733549959382615, "grad_norm": 0.007960534654557705, "learning_rate": 0.0002, "loss": 0.6190329790115356, "mean_token_accuracy": 0.7482394725084305, "num_tokens": 15924820.0, "step": 427 }, { "entropy": 0.6049096137285233, "epoch": 2.7798537774167342, "grad_norm": 0.007044166326522827, "learning_rate": 0.0002, "loss": 0.608286440372467, "mean_token_accuracy": 0.7529338300228119, "num_tokens": 15962031.0, "step": 428 }, { "entropy": 0.6067706495523453, "epoch": 2.7863525588952074, "grad_norm": 0.008417103439569473, "learning_rate": 0.0002, "loss": 0.6071891188621521, "mean_token_accuracy": 0.7529254406690598, "num_tokens": 15999271.0, "step": 429 }, { "entropy": 0.608584851026535, "epoch": 2.79285134037368, "grad_norm": 0.0066911159083247185, "learning_rate": 0.0002, "loss": 0.6128258109092712, "mean_token_accuracy": 0.7512886077165604, "num_tokens": 16036782.0, "step": 430 }, { "entropy": 0.6173116937279701, "epoch": 2.799350121852153, "grad_norm": 0.007603482808917761, "learning_rate": 0.0002, "loss": 0.6212354898452759, "mean_token_accuracy": 0.7506462633609772, "num_tokens": 16074488.0, "step": 431 }, { "entropy": 0.612823948264122, "epoch": 2.8058489033306255, "grad_norm": 0.008489524014294147, "learning_rate": 0.0002, "loss": 0.6168191432952881, "mean_token_accuracy": 0.7491662427783012, "num_tokens": 16112183.0, "step": 432 }, { "entropy": 0.6224610134959221, "epoch": 2.8123476848090982, "grad_norm": 0.0072684078477323055, "learning_rate": 0.0002, "loss": 0.6210014820098877, "mean_token_accuracy": 0.7473989799618721, "num_tokens": 16149570.0, "step": 433 }, { "entropy": 0.6252987831830978, "epoch": 2.818846466287571, "grad_norm": 0.008009562268853188, "learning_rate": 0.0002, "loss": 0.6273704171180725, "mean_token_accuracy": 0.7445142269134521, "num_tokens": 16187156.0, "step": 434 }, { "entropy": 0.6278671100735664, "epoch": 2.8253452477660437, "grad_norm": 0.007072070613503456, "learning_rate": 0.0002, "loss": 0.6284614205360413, "mean_token_accuracy": 0.743632547557354, "num_tokens": 16224612.0, "step": 435 }, { "entropy": 0.619408093392849, "epoch": 2.8318440292445164, "grad_norm": 0.007810318376868963, "learning_rate": 0.0002, "loss": 0.6186745166778564, "mean_token_accuracy": 0.7505189552903175, "num_tokens": 16261848.0, "step": 436 }, { "entropy": 0.617984876036644, "epoch": 2.8383428107229896, "grad_norm": 0.007404230069369078, "learning_rate": 0.0002, "loss": 0.6218393445014954, "mean_token_accuracy": 0.746470145881176, "num_tokens": 16299536.0, "step": 437 }, { "entropy": 0.6115261316299438, "epoch": 2.8448415922014623, "grad_norm": 0.007786816451698542, "learning_rate": 0.0002, "loss": 0.6147224307060242, "mean_token_accuracy": 0.7512907087802887, "num_tokens": 16336727.0, "step": 438 }, { "entropy": 0.610576219856739, "epoch": 2.851340373679935, "grad_norm": 0.007572745438665152, "learning_rate": 0.0002, "loss": 0.6138074994087219, "mean_token_accuracy": 0.7504170089960098, "num_tokens": 16374001.0, "step": 439 }, { "entropy": 0.6278978139162064, "epoch": 2.8578391551584077, "grad_norm": 0.007563670165836811, "learning_rate": 0.0002, "loss": 0.6268113851547241, "mean_token_accuracy": 0.7438701540231705, "num_tokens": 16411469.0, "step": 440 }, { "entropy": 0.6234687641263008, "epoch": 2.864337936636881, "grad_norm": 0.007766201626509428, "learning_rate": 0.0002, "loss": 0.6241582632064819, "mean_token_accuracy": 0.7458857893943787, "num_tokens": 16449061.0, "step": 441 }, { "entropy": 0.6170031577348709, "epoch": 2.8708367181153536, "grad_norm": 0.0072515420615673065, "learning_rate": 0.0002, "loss": 0.6164381504058838, "mean_token_accuracy": 0.7487066686153412, "num_tokens": 16486116.0, "step": 442 }, { "entropy": 0.6071048676967621, "epoch": 2.8773354995938263, "grad_norm": 0.007729642558842897, "learning_rate": 0.0002, "loss": 0.6061218976974487, "mean_token_accuracy": 0.7546169012784958, "num_tokens": 16523581.0, "step": 443 }, { "entropy": 0.6005209162831306, "epoch": 2.883834281072299, "grad_norm": 0.009296285919845104, "learning_rate": 0.0002, "loss": 0.608015775680542, "mean_token_accuracy": 0.7522506862878799, "num_tokens": 16560766.0, "step": 444 }, { "entropy": 0.6114199981093407, "epoch": 2.8903330625507717, "grad_norm": 0.009450486861169338, "learning_rate": 0.0002, "loss": 0.61246258020401, "mean_token_accuracy": 0.7513059675693512, "num_tokens": 16597924.0, "step": 445 }, { "entropy": 0.6163241118192673, "epoch": 2.8968318440292444, "grad_norm": 0.007840070873498917, "learning_rate": 0.0002, "loss": 0.6163046360015869, "mean_token_accuracy": 0.7482790276408195, "num_tokens": 16635707.0, "step": 446 }, { "entropy": 0.6230868250131607, "epoch": 2.903330625507717, "grad_norm": 0.00791420228779316, "learning_rate": 0.0002, "loss": 0.627612829208374, "mean_token_accuracy": 0.7418907359242439, "num_tokens": 16673272.0, "step": 447 }, { "entropy": 0.6148254349827766, "epoch": 2.90982940698619, "grad_norm": 0.008231899701058865, "learning_rate": 0.0002, "loss": 0.615432620048523, "mean_token_accuracy": 0.74872937053442, "num_tokens": 16710307.0, "step": 448 }, { "entropy": 0.6145784482359886, "epoch": 2.916328188464663, "grad_norm": 0.008206733502447605, "learning_rate": 0.0002, "loss": 0.6162281036376953, "mean_token_accuracy": 0.7497396990656853, "num_tokens": 16747541.0, "step": 449 }, { "entropy": 0.6129453554749489, "epoch": 2.9228269699431357, "grad_norm": 0.008618887513875961, "learning_rate": 0.0002, "loss": 0.6113362312316895, "mean_token_accuracy": 0.7538808137178421, "num_tokens": 16784808.0, "step": 450 }, { "entropy": 0.6318705305457115, "epoch": 2.9293257514216084, "grad_norm": 0.00894182175397873, "learning_rate": 0.0002, "loss": 0.6285560131072998, "mean_token_accuracy": 0.7439467459917068, "num_tokens": 16822571.0, "step": 451 }, { "entropy": 0.6192348748445511, "epoch": 2.935824532900081, "grad_norm": 0.0075249881483614445, "learning_rate": 0.0002, "loss": 0.6225606203079224, "mean_token_accuracy": 0.7450770661234856, "num_tokens": 16860236.0, "step": 452 }, { "entropy": 0.6156643033027649, "epoch": 2.942323314378554, "grad_norm": 0.008608740754425526, "learning_rate": 0.0002, "loss": 0.6196963787078857, "mean_token_accuracy": 0.7487252280116081, "num_tokens": 16897505.0, "step": 453 }, { "entropy": 0.6020097509026527, "epoch": 2.948822095857027, "grad_norm": 0.008554862812161446, "learning_rate": 0.0002, "loss": 0.6057189702987671, "mean_token_accuracy": 0.7535376027226448, "num_tokens": 16934723.0, "step": 454 }, { "entropy": 0.6096286401152611, "epoch": 2.9553208773354998, "grad_norm": 0.008194280788302422, "learning_rate": 0.0002, "loss": 0.6100919842720032, "mean_token_accuracy": 0.7543619722127914, "num_tokens": 16972160.0, "step": 455 }, { "entropy": 0.6101824045181274, "epoch": 2.9618196588139725, "grad_norm": 0.008089696057140827, "learning_rate": 0.0002, "loss": 0.6100078225135803, "mean_token_accuracy": 0.7519838437438011, "num_tokens": 17009553.0, "step": 456 }, { "entropy": 0.6134164482355118, "epoch": 2.968318440292445, "grad_norm": 0.008095222525298595, "learning_rate": 0.0002, "loss": 0.61534583568573, "mean_token_accuracy": 0.7492899596691132, "num_tokens": 17046859.0, "step": 457 }, { "entropy": 0.6219535619020462, "epoch": 2.974817221770918, "grad_norm": 0.008277404122054577, "learning_rate": 0.0002, "loss": 0.6226615905761719, "mean_token_accuracy": 0.7486208230257034, "num_tokens": 17083891.0, "step": 458 }, { "entropy": 0.6230077967047691, "epoch": 2.9813160032493906, "grad_norm": 0.007576305419206619, "learning_rate": 0.0002, "loss": 0.6215830445289612, "mean_token_accuracy": 0.7478786036372185, "num_tokens": 17121415.0, "step": 459 }, { "entropy": 0.6288741081953049, "epoch": 2.9878147847278633, "grad_norm": 0.007517755497246981, "learning_rate": 0.0002, "loss": 0.6266385912895203, "mean_token_accuracy": 0.7459503784775734, "num_tokens": 17159316.0, "step": 460 }, { "entropy": 0.6128450557589531, "epoch": 2.994313566206336, "grad_norm": 0.0082389609888196, "learning_rate": 0.0002, "loss": 0.6180654764175415, "mean_token_accuracy": 0.7501172721385956, "num_tokens": 17196686.0, "step": 461 }, { "entropy": 0.6104621972356524, "epoch": 3.0, "grad_norm": 0.009389652870595455, "learning_rate": 0.0002, "loss": 0.6207214593887329, "mean_token_accuracy": 0.7534014242036002, "num_tokens": 17212985.0, "step": 462 }, { "entropy": 0.6010295078158379, "epoch": 3.0064987814784727, "grad_norm": 0.007540151942521334, "learning_rate": 0.0002, "loss": 0.604315996170044, "mean_token_accuracy": 0.7545758932828903, "num_tokens": 17250548.0, "step": 463 }, { "entropy": 0.6099191755056381, "epoch": 3.0129975629569454, "grad_norm": 0.007964324206113815, "learning_rate": 0.0002, "loss": 0.6118016839027405, "mean_token_accuracy": 0.7505887746810913, "num_tokens": 17288088.0, "step": 464 }, { "entropy": 0.6099814623594284, "epoch": 3.019496344435418, "grad_norm": 0.009010368958115578, "learning_rate": 0.0002, "loss": 0.6133589744567871, "mean_token_accuracy": 0.7495384216308594, "num_tokens": 17325896.0, "step": 465 }, { "entropy": 0.6108173504471779, "epoch": 3.0259951259138913, "grad_norm": 0.008082750253379345, "learning_rate": 0.0002, "loss": 0.6106899380683899, "mean_token_accuracy": 0.7496122866868973, "num_tokens": 17363618.0, "step": 466 }, { "entropy": 0.6203465834259987, "epoch": 3.032493907392364, "grad_norm": 0.00794974435120821, "learning_rate": 0.0002, "loss": 0.62054044008255, "mean_token_accuracy": 0.7457421347498894, "num_tokens": 17401213.0, "step": 467 }, { "entropy": 0.6201630383729935, "epoch": 3.0389926888708367, "grad_norm": 0.00949027854949236, "learning_rate": 0.0002, "loss": 0.6232575178146362, "mean_token_accuracy": 0.746864065527916, "num_tokens": 17438437.0, "step": 468 }, { "entropy": 0.6282624080777168, "epoch": 3.0454914703493094, "grad_norm": 0.007857941091060638, "learning_rate": 0.0002, "loss": 0.6256210207939148, "mean_token_accuracy": 0.7441679313778877, "num_tokens": 17476273.0, "step": 469 }, { "entropy": 0.6105262786149979, "epoch": 3.051990251827782, "grad_norm": 0.008467303588986397, "learning_rate": 0.0002, "loss": 0.6100492477416992, "mean_token_accuracy": 0.7501196339726448, "num_tokens": 17513496.0, "step": 470 }, { "entropy": 0.6016805246472359, "epoch": 3.058489033306255, "grad_norm": 0.009371851570904255, "learning_rate": 0.0002, "loss": 0.604375958442688, "mean_token_accuracy": 0.7524744868278503, "num_tokens": 17551200.0, "step": 471 }, { "entropy": 0.6073808148503304, "epoch": 3.064987814784728, "grad_norm": 0.008492433466017246, "learning_rate": 0.0002, "loss": 0.6094343662261963, "mean_token_accuracy": 0.752588301897049, "num_tokens": 17588356.0, "step": 472 }, { "entropy": 0.6179896369576454, "epoch": 3.0714865962632008, "grad_norm": 0.008540020324289799, "learning_rate": 0.0002, "loss": 0.6210522055625916, "mean_token_accuracy": 0.7460785582661629, "num_tokens": 17625982.0, "step": 473 }, { "entropy": 0.6018861308693886, "epoch": 3.0779853777416735, "grad_norm": 0.008742019534111023, "learning_rate": 0.0002, "loss": 0.6078682541847229, "mean_token_accuracy": 0.7513778060674667, "num_tokens": 17663418.0, "step": 474 }, { "entropy": 0.633279986679554, "epoch": 3.084484159220146, "grad_norm": 0.0082003865391016, "learning_rate": 0.0002, "loss": 0.6310751438140869, "mean_token_accuracy": 0.7428691610693932, "num_tokens": 17700640.0, "step": 475 }, { "entropy": 0.6102183759212494, "epoch": 3.090982940698619, "grad_norm": 0.008503621444106102, "learning_rate": 0.0002, "loss": 0.6114936470985413, "mean_token_accuracy": 0.7529326751828194, "num_tokens": 17738330.0, "step": 476 }, { "entropy": 0.6162742525339127, "epoch": 3.0974817221770916, "grad_norm": 0.008936957456171513, "learning_rate": 0.0002, "loss": 0.6209756135940552, "mean_token_accuracy": 0.7465755268931389, "num_tokens": 17775715.0, "step": 477 }, { "entropy": 0.6141496077179909, "epoch": 3.1039805036555648, "grad_norm": 0.009372946806252003, "learning_rate": 0.0002, "loss": 0.617496132850647, "mean_token_accuracy": 0.7488722130656242, "num_tokens": 17813252.0, "step": 478 }, { "entropy": 0.6128992438316345, "epoch": 3.1104792851340375, "grad_norm": 0.009246407076716423, "learning_rate": 0.0002, "loss": 0.6153603792190552, "mean_token_accuracy": 0.7489981204271317, "num_tokens": 17850593.0, "step": 479 }, { "entropy": 0.6109244301915169, "epoch": 3.11697806661251, "grad_norm": 0.008360042236745358, "learning_rate": 0.0002, "loss": 0.6110379099845886, "mean_token_accuracy": 0.7517814785242081, "num_tokens": 17887433.0, "step": 480 }, { "entropy": 0.6216762438416481, "epoch": 3.123476848090983, "grad_norm": 0.008575825951993465, "learning_rate": 0.0002, "loss": 0.6188209652900696, "mean_token_accuracy": 0.7479925602674484, "num_tokens": 17924477.0, "step": 481 }, { "entropy": 0.617570586502552, "epoch": 3.1299756295694556, "grad_norm": 0.00846293568611145, "learning_rate": 0.0002, "loss": 0.6159199476242065, "mean_token_accuracy": 0.7518654763698578, "num_tokens": 17961735.0, "step": 482 }, { "entropy": 0.591516949236393, "epoch": 3.1364744110479283, "grad_norm": 0.009447102434933186, "learning_rate": 0.0002, "loss": 0.5986469984054565, "mean_token_accuracy": 0.7579966932535172, "num_tokens": 17998853.0, "step": 483 }, { "entropy": 0.6149769946932793, "epoch": 3.1429731925264015, "grad_norm": 0.010652805678546429, "learning_rate": 0.0002, "loss": 0.62315833568573, "mean_token_accuracy": 0.7443839907646179, "num_tokens": 18036498.0, "step": 484 }, { "entropy": 0.6224213317036629, "epoch": 3.149471974004874, "grad_norm": 0.008841714821755886, "learning_rate": 0.0002, "loss": 0.6213138103485107, "mean_token_accuracy": 0.7460580617189407, "num_tokens": 18073792.0, "step": 485 }, { "entropy": 0.624303974211216, "epoch": 3.155970755483347, "grad_norm": 0.008476318791508675, "learning_rate": 0.0002, "loss": 0.6206566691398621, "mean_token_accuracy": 0.7465843260288239, "num_tokens": 18110931.0, "step": 486 }, { "entropy": 0.6057487353682518, "epoch": 3.1624695369618196, "grad_norm": 0.007340795826166868, "learning_rate": 0.0002, "loss": 0.6085374355316162, "mean_token_accuracy": 0.7520734146237373, "num_tokens": 18148230.0, "step": 487 }, { "entropy": 0.5987089648842812, "epoch": 3.1689683184402924, "grad_norm": 0.008576547726988792, "learning_rate": 0.0002, "loss": 0.5994081497192383, "mean_token_accuracy": 0.7560673728585243, "num_tokens": 18185429.0, "step": 488 }, { "entropy": 0.6201451569795609, "epoch": 3.175467099918765, "grad_norm": 0.009309273213148117, "learning_rate": 0.0002, "loss": 0.6250134706497192, "mean_token_accuracy": 0.7440272644162178, "num_tokens": 18222845.0, "step": 489 }, { "entropy": 0.6149864792823792, "epoch": 3.181965881397238, "grad_norm": 0.00817920919507742, "learning_rate": 0.0002, "loss": 0.6165604591369629, "mean_token_accuracy": 0.7469800040125847, "num_tokens": 18260522.0, "step": 490 }, { "entropy": 0.6081833988428116, "epoch": 3.188464662875711, "grad_norm": 0.008727415464818478, "learning_rate": 0.0002, "loss": 0.6095278263092041, "mean_token_accuracy": 0.7511461302638054, "num_tokens": 18298119.0, "step": 491 }, { "entropy": 0.6011826619505882, "epoch": 3.1949634443541837, "grad_norm": 0.008403414860367775, "learning_rate": 0.0002, "loss": 0.6023063659667969, "mean_token_accuracy": 0.7541341111063957, "num_tokens": 18335516.0, "step": 492 }, { "entropy": 0.614462248980999, "epoch": 3.2014622258326564, "grad_norm": 0.008592899888753891, "learning_rate": 0.0002, "loss": 0.611116886138916, "mean_token_accuracy": 0.7512200325727463, "num_tokens": 18373224.0, "step": 493 }, { "entropy": 0.6118571162223816, "epoch": 3.207961007311129, "grad_norm": 0.008299244567751884, "learning_rate": 0.0002, "loss": 0.6136075258255005, "mean_token_accuracy": 0.749468058347702, "num_tokens": 18410845.0, "step": 494 }, { "entropy": 0.6049928665161133, "epoch": 3.214459788789602, "grad_norm": 0.010410244576632977, "learning_rate": 0.0002, "loss": 0.6083844304084778, "mean_token_accuracy": 0.751271091401577, "num_tokens": 18448238.0, "step": 495 }, { "entropy": 0.6233940199017525, "epoch": 3.2209585702680745, "grad_norm": 0.009204378351569176, "learning_rate": 0.0002, "loss": 0.6272657513618469, "mean_token_accuracy": 0.7432866543531418, "num_tokens": 18486015.0, "step": 496 }, { "entropy": 0.6218753755092621, "epoch": 3.2274573517465477, "grad_norm": 0.00954593438655138, "learning_rate": 0.0002, "loss": 0.6218851208686829, "mean_token_accuracy": 0.7457900047302246, "num_tokens": 18523424.0, "step": 497 }, { "entropy": 0.6145913749933243, "epoch": 3.2339561332250204, "grad_norm": 0.009425587020814419, "learning_rate": 0.0002, "loss": 0.6123300194740295, "mean_token_accuracy": 0.7488762065768242, "num_tokens": 18560844.0, "step": 498 }, { "entropy": 0.6112263351678848, "epoch": 3.240454914703493, "grad_norm": 0.009846451692283154, "learning_rate": 0.0002, "loss": 0.6109277606010437, "mean_token_accuracy": 0.7503840625286102, "num_tokens": 18598457.0, "step": 499 }, { "entropy": 0.6025180518627167, "epoch": 3.246953696181966, "grad_norm": 0.00901762768626213, "learning_rate": 0.0002, "loss": 0.6064941883087158, "mean_token_accuracy": 0.7513880282640457, "num_tokens": 18635799.0, "step": 500 }, { "entropy": 0.6062363162636757, "epoch": 3.2534524776604385, "grad_norm": 0.008631935343146324, "learning_rate": 0.0002, "loss": 0.610137939453125, "mean_token_accuracy": 0.751276396214962, "num_tokens": 18673367.0, "step": 501 }, { "entropy": 0.6029994338750839, "epoch": 3.2599512591389113, "grad_norm": 0.008083198219537735, "learning_rate": 0.0002, "loss": 0.605480968952179, "mean_token_accuracy": 0.7522158473730087, "num_tokens": 18710845.0, "step": 502 }, { "entropy": 0.6004190221428871, "epoch": 3.2664500406173844, "grad_norm": 0.009547607973217964, "learning_rate": 0.0002, "loss": 0.5966814756393433, "mean_token_accuracy": 0.7567247301340103, "num_tokens": 18748254.0, "step": 503 }, { "entropy": 0.6217415705323219, "epoch": 3.272948822095857, "grad_norm": 0.008327828720211983, "learning_rate": 0.0002, "loss": 0.6205904483795166, "mean_token_accuracy": 0.746347539126873, "num_tokens": 18785876.0, "step": 504 }, { "entropy": 0.6177750676870346, "epoch": 3.27944760357433, "grad_norm": 0.008332877419888973, "learning_rate": 0.0002, "loss": 0.6175146102905273, "mean_token_accuracy": 0.7480292990803719, "num_tokens": 18823559.0, "step": 505 }, { "entropy": 0.6048281341791153, "epoch": 3.2859463850528026, "grad_norm": 0.010307500138878822, "learning_rate": 0.0002, "loss": 0.608547568321228, "mean_token_accuracy": 0.7522715479135513, "num_tokens": 18860761.0, "step": 506 }, { "entropy": 0.6015286520123482, "epoch": 3.2924451665312753, "grad_norm": 0.008793864399194717, "learning_rate": 0.0002, "loss": 0.6076687574386597, "mean_token_accuracy": 0.7535560503602028, "num_tokens": 18898017.0, "step": 507 }, { "entropy": 0.6203228533267975, "epoch": 3.298943948009748, "grad_norm": 0.008433851413428783, "learning_rate": 0.0002, "loss": 0.627921462059021, "mean_token_accuracy": 0.743441991508007, "num_tokens": 18935451.0, "step": 508 }, { "entropy": 0.61593446880579, "epoch": 3.305442729488221, "grad_norm": 0.00970753189176321, "learning_rate": 0.0002, "loss": 0.617050290107727, "mean_token_accuracy": 0.7470974624156952, "num_tokens": 18972874.0, "step": 509 }, { "entropy": 0.6080862656235695, "epoch": 3.311941510966694, "grad_norm": 0.008601192384958267, "learning_rate": 0.0002, "loss": 0.613648533821106, "mean_token_accuracy": 0.7485402300953865, "num_tokens": 19010386.0, "step": 510 }, { "entropy": 0.6165401563048363, "epoch": 3.3184402924451666, "grad_norm": 0.009453460574150085, "learning_rate": 0.0002, "loss": 0.6146738529205322, "mean_token_accuracy": 0.7489698827266693, "num_tokens": 19048086.0, "step": 511 }, { "entropy": 0.6097732856869698, "epoch": 3.3249390739236393, "grad_norm": 0.008702411316335201, "learning_rate": 0.0002, "loss": 0.6121372580528259, "mean_token_accuracy": 0.7501634210348129, "num_tokens": 19085297.0, "step": 512 }, { "entropy": 0.6050214320421219, "epoch": 3.331437855402112, "grad_norm": 0.008775223046541214, "learning_rate": 0.0002, "loss": 0.6089086532592773, "mean_token_accuracy": 0.7513034492731094, "num_tokens": 19122838.0, "step": 513 }, { "entropy": 0.6079926937818527, "epoch": 3.3379366368805847, "grad_norm": 0.009299266152083874, "learning_rate": 0.0002, "loss": 0.6124639511108398, "mean_token_accuracy": 0.751487672328949, "num_tokens": 19160495.0, "step": 514 }, { "entropy": 0.6141983196139336, "epoch": 3.3444354183590574, "grad_norm": 0.00953013077378273, "learning_rate": 0.0002, "loss": 0.614948570728302, "mean_token_accuracy": 0.7482777014374733, "num_tokens": 19197772.0, "step": 515 }, { "entropy": 0.6166125014424324, "epoch": 3.3509341998375306, "grad_norm": 0.01042372826486826, "learning_rate": 0.0002, "loss": 0.6166562438011169, "mean_token_accuracy": 0.7489292994141579, "num_tokens": 19235537.0, "step": 516 }, { "entropy": 0.6107529476284981, "epoch": 3.3574329813160033, "grad_norm": 0.009182547219097614, "learning_rate": 0.0002, "loss": 0.6094313263893127, "mean_token_accuracy": 0.75286765396595, "num_tokens": 19272557.0, "step": 517 }, { "entropy": 0.5976028516888618, "epoch": 3.363931762794476, "grad_norm": 0.00928069930523634, "learning_rate": 0.0002, "loss": 0.6000387668609619, "mean_token_accuracy": 0.7556054145097733, "num_tokens": 19309498.0, "step": 518 }, { "entropy": 0.6023745760321617, "epoch": 3.3704305442729487, "grad_norm": 0.008411030285060406, "learning_rate": 0.0002, "loss": 0.6067807674407959, "mean_token_accuracy": 0.7529009878635406, "num_tokens": 19346735.0, "step": 519 }, { "entropy": 0.6122680082917213, "epoch": 3.3769293257514215, "grad_norm": 0.008953915908932686, "learning_rate": 0.0002, "loss": 0.6159105896949768, "mean_token_accuracy": 0.7494169026613235, "num_tokens": 19384153.0, "step": 520 }, { "entropy": 0.6186133921146393, "epoch": 3.3834281072298946, "grad_norm": 0.008217048831284046, "learning_rate": 0.0002, "loss": 0.6203353404998779, "mean_token_accuracy": 0.7473497167229652, "num_tokens": 19421655.0, "step": 521 }, { "entropy": 0.6094240248203278, "epoch": 3.3899268887083673, "grad_norm": 0.00980299897491932, "learning_rate": 0.0002, "loss": 0.6119738221168518, "mean_token_accuracy": 0.7499380633234978, "num_tokens": 19458894.0, "step": 522 }, { "entropy": 0.6254991963505745, "epoch": 3.39642567018684, "grad_norm": 0.008415239863097668, "learning_rate": 0.0002, "loss": 0.623593807220459, "mean_token_accuracy": 0.7472219467163086, "num_tokens": 19496818.0, "step": 523 }, { "entropy": 0.6295105367898941, "epoch": 3.4029244516653128, "grad_norm": 0.009312564507126808, "learning_rate": 0.0002, "loss": 0.6262437105178833, "mean_token_accuracy": 0.7448465451598167, "num_tokens": 19534274.0, "step": 524 }, { "entropy": 0.6126851290464401, "epoch": 3.4094232331437855, "grad_norm": 0.00861976109445095, "learning_rate": 0.0002, "loss": 0.6097316145896912, "mean_token_accuracy": 0.7525606751441956, "num_tokens": 19571856.0, "step": 525 }, { "entropy": 0.6135350093245506, "epoch": 3.415922014622258, "grad_norm": 0.008309995755553246, "learning_rate": 0.0002, "loss": 0.6160346269607544, "mean_token_accuracy": 0.7493128851056099, "num_tokens": 19609319.0, "step": 526 }, { "entropy": 0.6100683584809303, "epoch": 3.422420796100731, "grad_norm": 0.011379679664969444, "learning_rate": 0.0002, "loss": 0.6197912096977234, "mean_token_accuracy": 0.7495440766215324, "num_tokens": 19647036.0, "step": 527 }, { "entropy": 0.6129766032099724, "epoch": 3.428919577579204, "grad_norm": 0.00879785604774952, "learning_rate": 0.0002, "loss": 0.6192106008529663, "mean_token_accuracy": 0.7462450638413429, "num_tokens": 19684528.0, "step": 528 }, { "entropy": 0.6183054521679878, "epoch": 3.435418359057677, "grad_norm": 0.009570072405040264, "learning_rate": 0.0002, "loss": 0.61530601978302, "mean_token_accuracy": 0.7494653314352036, "num_tokens": 19721829.0, "step": 529 }, { "entropy": 0.6237875148653984, "epoch": 3.4419171405361495, "grad_norm": 0.009924475103616714, "learning_rate": 0.0002, "loss": 0.620090126991272, "mean_token_accuracy": 0.7470209151506424, "num_tokens": 19759470.0, "step": 530 }, { "entropy": 0.6056384146213531, "epoch": 3.448415922014622, "grad_norm": 0.008861211128532887, "learning_rate": 0.0002, "loss": 0.6051967144012451, "mean_token_accuracy": 0.7524856179952621, "num_tokens": 19797055.0, "step": 531 }, { "entropy": 0.6045270711183548, "epoch": 3.454914703493095, "grad_norm": 0.009311981499195099, "learning_rate": 0.0002, "loss": 0.6111881136894226, "mean_token_accuracy": 0.7494307532906532, "num_tokens": 19834144.0, "step": 532 }, { "entropy": 0.6097549796104431, "epoch": 3.4614134849715676, "grad_norm": 0.010919635184109211, "learning_rate": 0.0002, "loss": 0.6160416007041931, "mean_token_accuracy": 0.7504306137561798, "num_tokens": 19871286.0, "step": 533 }, { "entropy": 0.6024704650044441, "epoch": 3.467912266450041, "grad_norm": 0.008416552096605301, "learning_rate": 0.0002, "loss": 0.6058158278465271, "mean_token_accuracy": 0.7539756521582603, "num_tokens": 19908849.0, "step": 534 }, { "entropy": 0.611225888133049, "epoch": 3.4744110479285135, "grad_norm": 0.008921737782657146, "learning_rate": 0.0002, "loss": 0.6157783269882202, "mean_token_accuracy": 0.7485576719045639, "num_tokens": 19945976.0, "step": 535 }, { "entropy": 0.5882637947797775, "epoch": 3.4809098294069862, "grad_norm": 0.009470734745264053, "learning_rate": 0.0002, "loss": 0.5855636596679688, "mean_token_accuracy": 0.7615584507584572, "num_tokens": 19983147.0, "step": 536 }, { "entropy": 0.607180692255497, "epoch": 3.487408610885459, "grad_norm": 0.00895584374666214, "learning_rate": 0.0002, "loss": 0.6034247875213623, "mean_token_accuracy": 0.7542741522192955, "num_tokens": 20020743.0, "step": 537 }, { "entropy": 0.6082776561379433, "epoch": 3.4939073923639317, "grad_norm": 0.00874309055507183, "learning_rate": 0.0002, "loss": 0.6111589074134827, "mean_token_accuracy": 0.7497387602925301, "num_tokens": 20058341.0, "step": 538 }, { "entropy": 0.6162533760070801, "epoch": 3.5004061738424044, "grad_norm": 0.009585198014974594, "learning_rate": 0.0002, "loss": 0.6244966387748718, "mean_token_accuracy": 0.7475337833166122, "num_tokens": 20095636.0, "step": 539 }, { "entropy": 0.6105955466628075, "epoch": 3.506904955320877, "grad_norm": 0.009461835958063602, "learning_rate": 0.0002, "loss": 0.6156846880912781, "mean_token_accuracy": 0.7479056641459465, "num_tokens": 20132551.0, "step": 540 }, { "entropy": 0.621313750743866, "epoch": 3.5134037367993503, "grad_norm": 0.008541502989828587, "learning_rate": 0.0002, "loss": 0.6199691295623779, "mean_token_accuracy": 0.7473711222410202, "num_tokens": 20169837.0, "step": 541 }, { "entropy": 0.6165328845381737, "epoch": 3.519902518277823, "grad_norm": 0.009770420379936695, "learning_rate": 0.0002, "loss": 0.6142412424087524, "mean_token_accuracy": 0.7502679750323296, "num_tokens": 20207307.0, "step": 542 }, { "entropy": 0.6032826527953148, "epoch": 3.5264012997562957, "grad_norm": 0.010346473194658756, "learning_rate": 0.0002, "loss": 0.6011192798614502, "mean_token_accuracy": 0.754242517054081, "num_tokens": 20244685.0, "step": 543 }, { "entropy": 0.6191048100590706, "epoch": 3.5329000812347684, "grad_norm": 0.008168449625372887, "learning_rate": 0.0002, "loss": 0.6207705736160278, "mean_token_accuracy": 0.74729173630476, "num_tokens": 20281823.0, "step": 544 }, { "entropy": 0.6121908649802208, "epoch": 3.539398862713241, "grad_norm": 0.007879077456891537, "learning_rate": 0.0002, "loss": 0.6121616363525391, "mean_token_accuracy": 0.7506422027945518, "num_tokens": 20319307.0, "step": 545 }, { "entropy": 0.6186290234327316, "epoch": 3.5458976441917143, "grad_norm": 0.00905434787273407, "learning_rate": 0.0002, "loss": 0.6185810565948486, "mean_token_accuracy": 0.7475248873233795, "num_tokens": 20356848.0, "step": 546 }, { "entropy": 0.6139393672347069, "epoch": 3.552396425670187, "grad_norm": 0.008824498392641544, "learning_rate": 0.0002, "loss": 0.6151487827301025, "mean_token_accuracy": 0.7489016950130463, "num_tokens": 20394203.0, "step": 547 }, { "entropy": 0.6207469254732132, "epoch": 3.5588952071486597, "grad_norm": 0.008396871387958527, "learning_rate": 0.0002, "loss": 0.6218851804733276, "mean_token_accuracy": 0.7459322214126587, "num_tokens": 20431870.0, "step": 548 }, { "entropy": 0.62169548869133, "epoch": 3.5653939886271324, "grad_norm": 0.00874373223632574, "learning_rate": 0.0002, "loss": 0.6228454113006592, "mean_token_accuracy": 0.749803364276886, "num_tokens": 20469261.0, "step": 549 }, { "entropy": 0.6220152676105499, "epoch": 3.571892770105605, "grad_norm": 0.008933790028095245, "learning_rate": 0.0002, "loss": 0.6208291053771973, "mean_token_accuracy": 0.7474985867738724, "num_tokens": 20506396.0, "step": 550 }, { "entropy": 0.6153115481138229, "epoch": 3.578391551584078, "grad_norm": 0.008625194430351257, "learning_rate": 0.0002, "loss": 0.6176726818084717, "mean_token_accuracy": 0.7483843564987183, "num_tokens": 20543594.0, "step": 551 }, { "entropy": 0.6194273307919502, "epoch": 3.5848903330625506, "grad_norm": 0.009513880126178265, "learning_rate": 0.0002, "loss": 0.6259117126464844, "mean_token_accuracy": 0.7455350533127785, "num_tokens": 20580976.0, "step": 552 }, { "entropy": 0.6218870356678963, "epoch": 3.5913891145410237, "grad_norm": 0.010471499525010586, "learning_rate": 0.0002, "loss": 0.6255429983139038, "mean_token_accuracy": 0.745422936975956, "num_tokens": 20618155.0, "step": 553 }, { "entropy": 0.6044272035360336, "epoch": 3.5978878960194964, "grad_norm": 0.009206542745232582, "learning_rate": 0.0002, "loss": 0.6089117527008057, "mean_token_accuracy": 0.7523582801222801, "num_tokens": 20655356.0, "step": 554 }, { "entropy": 0.6034605354070663, "epoch": 3.604386677497969, "grad_norm": 0.01001272164285183, "learning_rate": 0.0002, "loss": 0.6080043315887451, "mean_token_accuracy": 0.7542883977293968, "num_tokens": 20692368.0, "step": 555 }, { "entropy": 0.6126068532466888, "epoch": 3.610885458976442, "grad_norm": 0.008411637507379055, "learning_rate": 0.0002, "loss": 0.6143564581871033, "mean_token_accuracy": 0.7496707290410995, "num_tokens": 20729532.0, "step": 556 }, { "entropy": 0.6092226430773735, "epoch": 3.6173842404549146, "grad_norm": 0.00788223184645176, "learning_rate": 0.0002, "loss": 0.6080750226974487, "mean_token_accuracy": 0.7521450445055962, "num_tokens": 20767316.0, "step": 557 }, { "entropy": 0.6103739887475967, "epoch": 3.6238830219333877, "grad_norm": 0.008947784081101418, "learning_rate": 0.0002, "loss": 0.6110090613365173, "mean_token_accuracy": 0.751432754099369, "num_tokens": 20804682.0, "step": 558 }, { "entropy": 0.6072618737816811, "epoch": 3.6303818034118605, "grad_norm": 0.008321145549416542, "learning_rate": 0.0002, "loss": 0.6072537899017334, "mean_token_accuracy": 0.7519486770033836, "num_tokens": 20842038.0, "step": 559 }, { "entropy": 0.614497110247612, "epoch": 3.636880584890333, "grad_norm": 0.009164758026599884, "learning_rate": 0.0002, "loss": 0.6098246574401855, "mean_token_accuracy": 0.752671018242836, "num_tokens": 20879197.0, "step": 560 }, { "entropy": 0.6094550266861916, "epoch": 3.643379366368806, "grad_norm": 0.007844182662665844, "learning_rate": 0.0002, "loss": 0.6068869829177856, "mean_token_accuracy": 0.7533254846930504, "num_tokens": 20916501.0, "step": 561 }, { "entropy": 0.6086015179753304, "epoch": 3.6498781478472786, "grad_norm": 0.008045290596783161, "learning_rate": 0.0002, "loss": 0.606809139251709, "mean_token_accuracy": 0.7527647316455841, "num_tokens": 20954134.0, "step": 562 }, { "entropy": 0.6285906434059143, "epoch": 3.6563769293257513, "grad_norm": 0.010104804299771786, "learning_rate": 0.0002, "loss": 0.6331174373626709, "mean_token_accuracy": 0.7419461309909821, "num_tokens": 20992017.0, "step": 563 }, { "entropy": 0.6020278707146645, "epoch": 3.662875710804224, "grad_norm": 0.01021239347755909, "learning_rate": 0.0002, "loss": 0.6128239035606384, "mean_token_accuracy": 0.7514787241816521, "num_tokens": 21029653.0, "step": 564 }, { "entropy": 0.6191821396350861, "epoch": 3.6693744922826967, "grad_norm": 0.009272433817386627, "learning_rate": 0.0002, "loss": 0.6228241324424744, "mean_token_accuracy": 0.7464863955974579, "num_tokens": 21067220.0, "step": 565 }, { "entropy": 0.6111209839582443, "epoch": 3.67587327376117, "grad_norm": 0.01010363083332777, "learning_rate": 0.0002, "loss": 0.6085663437843323, "mean_token_accuracy": 0.7533030211925507, "num_tokens": 21105021.0, "step": 566 }, { "entropy": 0.6244448721408844, "epoch": 3.6823720552396426, "grad_norm": 0.008229166269302368, "learning_rate": 0.0002, "loss": 0.6232364177703857, "mean_token_accuracy": 0.7465489506721497, "num_tokens": 21142672.0, "step": 567 }, { "entropy": 0.6002631187438965, "epoch": 3.6888708367181153, "grad_norm": 0.00970839336514473, "learning_rate": 0.0002, "loss": 0.6064876914024353, "mean_token_accuracy": 0.7520908117294312, "num_tokens": 21179768.0, "step": 568 }, { "entropy": 0.606594480574131, "epoch": 3.695369618196588, "grad_norm": 0.00952630303800106, "learning_rate": 0.0002, "loss": 0.6108591556549072, "mean_token_accuracy": 0.751940131187439, "num_tokens": 21217131.0, "step": 569 }, { "entropy": 0.6083743423223495, "epoch": 3.7018683996750608, "grad_norm": 0.008894224651157856, "learning_rate": 0.0002, "loss": 0.6050914525985718, "mean_token_accuracy": 0.7556580603122711, "num_tokens": 21254612.0, "step": 570 }, { "entropy": 0.6244188398122787, "epoch": 3.708367181153534, "grad_norm": 0.00945176463574171, "learning_rate": 0.0002, "loss": 0.6213344931602478, "mean_token_accuracy": 0.7479386925697327, "num_tokens": 21292008.0, "step": 571 }, { "entropy": 0.6202782392501831, "epoch": 3.7148659626320066, "grad_norm": 0.007808351423591375, "learning_rate": 0.0002, "loss": 0.618791937828064, "mean_token_accuracy": 0.7479956671595573, "num_tokens": 21329211.0, "step": 572 }, { "entropy": 0.6083357259631157, "epoch": 3.7213647441104794, "grad_norm": 0.009738109074532986, "learning_rate": 0.0002, "loss": 0.6082479953765869, "mean_token_accuracy": 0.7511337921023369, "num_tokens": 21366830.0, "step": 573 }, { "entropy": 0.6160146668553352, "epoch": 3.727863525588952, "grad_norm": 0.008708451874554157, "learning_rate": 0.0002, "loss": 0.6203808784484863, "mean_token_accuracy": 0.749162532389164, "num_tokens": 21404012.0, "step": 574 }, { "entropy": 0.6103571355342865, "epoch": 3.734362307067425, "grad_norm": 0.008490422740578651, "learning_rate": 0.0002, "loss": 0.6149444580078125, "mean_token_accuracy": 0.7492819800972939, "num_tokens": 21441418.0, "step": 575 }, { "entropy": 0.6097893342375755, "epoch": 3.7408610885458975, "grad_norm": 0.008159926161170006, "learning_rate": 0.0002, "loss": 0.6121622323989868, "mean_token_accuracy": 0.7502710297703743, "num_tokens": 21478959.0, "step": 576 }, { "entropy": 0.608406588435173, "epoch": 3.74735987002437, "grad_norm": 0.007408132776618004, "learning_rate": 0.0002, "loss": 0.6112476587295532, "mean_token_accuracy": 0.7514019384980202, "num_tokens": 21516469.0, "step": 577 }, { "entropy": 0.6059915721416473, "epoch": 3.7538586515028434, "grad_norm": 0.007707294542342424, "learning_rate": 0.0002, "loss": 0.6102927923202515, "mean_token_accuracy": 0.7524895742535591, "num_tokens": 21553955.0, "step": 578 }, { "entropy": 0.6110079139471054, "epoch": 3.760357432981316, "grad_norm": 0.008303117007017136, "learning_rate": 0.0002, "loss": 0.6116464734077454, "mean_token_accuracy": 0.7515735402703285, "num_tokens": 21591222.0, "step": 579 }, { "entropy": 0.6157199367880821, "epoch": 3.766856214459789, "grad_norm": 0.008788561448454857, "learning_rate": 0.0002, "loss": 0.6139419078826904, "mean_token_accuracy": 0.7500691562891006, "num_tokens": 21628586.0, "step": 580 }, { "entropy": 0.6189565733075142, "epoch": 3.7733549959382615, "grad_norm": 0.008861690759658813, "learning_rate": 0.0002, "loss": 0.6205735802650452, "mean_token_accuracy": 0.7461571544408798, "num_tokens": 21665902.0, "step": 581 }, { "entropy": 0.6169708073139191, "epoch": 3.7798537774167342, "grad_norm": 0.00858966913074255, "learning_rate": 0.0002, "loss": 0.616493284702301, "mean_token_accuracy": 0.7478131875395775, "num_tokens": 21703347.0, "step": 582 }, { "entropy": 0.6013945862650871, "epoch": 3.7863525588952074, "grad_norm": 0.007991503924131393, "learning_rate": 0.0002, "loss": 0.6024019718170166, "mean_token_accuracy": 0.7541673332452774, "num_tokens": 21740476.0, "step": 583 }, { "entropy": 0.6127390787005424, "epoch": 3.79285134037368, "grad_norm": 0.008759486488997936, "learning_rate": 0.0002, "loss": 0.6142678260803223, "mean_token_accuracy": 0.7489368915557861, "num_tokens": 21777903.0, "step": 584 }, { "entropy": 0.6033598631620407, "epoch": 3.799350121852153, "grad_norm": 0.008402034640312195, "learning_rate": 0.0002, "loss": 0.6062989234924316, "mean_token_accuracy": 0.7526213079690933, "num_tokens": 21815411.0, "step": 585 }, { "entropy": 0.6237991526722908, "epoch": 3.8058489033306255, "grad_norm": 0.008741356432437897, "learning_rate": 0.0002, "loss": 0.6236557960510254, "mean_token_accuracy": 0.7458471432328224, "num_tokens": 21852563.0, "step": 586 }, { "entropy": 0.6021682396531105, "epoch": 3.8123476848090982, "grad_norm": 0.009454802609980106, "learning_rate": 0.0002, "loss": 0.6056302785873413, "mean_token_accuracy": 0.7534916624426842, "num_tokens": 21889751.0, "step": 587 }, { "entropy": 0.6037532165646553, "epoch": 3.818846466287571, "grad_norm": 0.008019194938242435, "learning_rate": 0.0002, "loss": 0.6062440872192383, "mean_token_accuracy": 0.75218416005373, "num_tokens": 21927225.0, "step": 588 }, { "entropy": 0.6175741031765938, "epoch": 3.8253452477660437, "grad_norm": 0.010461182333528996, "learning_rate": 0.0002, "loss": 0.6219437122344971, "mean_token_accuracy": 0.7449553832411766, "num_tokens": 21964899.0, "step": 589 }, { "entropy": 0.6165783628821373, "epoch": 3.8318440292445164, "grad_norm": 0.007971042767167091, "learning_rate": 0.0002, "loss": 0.6164169311523438, "mean_token_accuracy": 0.7500692084431648, "num_tokens": 22001937.0, "step": 590 }, { "entropy": 0.6328809410333633, "epoch": 3.8383428107229896, "grad_norm": 0.019222697243094444, "learning_rate": 0.0002, "loss": 0.629861056804657, "mean_token_accuracy": 0.7441875413060188, "num_tokens": 22039681.0, "step": 591 }, { "entropy": 0.6060463637113571, "epoch": 3.8448415922014623, "grad_norm": 0.008333687670528889, "learning_rate": 0.0002, "loss": 0.6049051880836487, "mean_token_accuracy": 0.7526820749044418, "num_tokens": 22077083.0, "step": 592 }, { "entropy": 0.626244343817234, "epoch": 3.851340373679935, "grad_norm": 0.011930772103369236, "learning_rate": 0.0002, "loss": 0.6302248239517212, "mean_token_accuracy": 0.7435696348547935, "num_tokens": 22114449.0, "step": 593 }, { "entropy": 0.60886500030756, "epoch": 3.8578391551584077, "grad_norm": 0.00879514031112194, "learning_rate": 0.0002, "loss": 0.6156384944915771, "mean_token_accuracy": 0.7500656992197037, "num_tokens": 22151803.0, "step": 594 }, { "entropy": 0.6130397766828537, "epoch": 3.864337936636881, "grad_norm": 0.008800708688795567, "learning_rate": 0.0002, "loss": 0.6132546663284302, "mean_token_accuracy": 0.7525083422660828, "num_tokens": 22188933.0, "step": 595 }, { "entropy": 0.62311190366745, "epoch": 3.8708367181153536, "grad_norm": 0.0075268070213496685, "learning_rate": 0.0002, "loss": 0.624302864074707, "mean_token_accuracy": 0.7459553778171539, "num_tokens": 22226349.0, "step": 596 }, { "entropy": 0.6084966883063316, "epoch": 3.8773354995938263, "grad_norm": 0.008235939778387547, "learning_rate": 0.0002, "loss": 0.6065037250518799, "mean_token_accuracy": 0.7519035413861275, "num_tokens": 22263929.0, "step": 597 }, { "entropy": 0.599085658788681, "epoch": 3.883834281072299, "grad_norm": 0.008155166171491146, "learning_rate": 0.0002, "loss": 0.60195392370224, "mean_token_accuracy": 0.7546913474798203, "num_tokens": 22301001.0, "step": 598 }, { "entropy": 0.6163361445069313, "epoch": 3.8903330625507717, "grad_norm": 0.009046819061040878, "learning_rate": 0.0002, "loss": 0.6153905987739563, "mean_token_accuracy": 0.7495288848876953, "num_tokens": 22338602.0, "step": 599 }, { "entropy": 0.612362690269947, "epoch": 3.8968318440292444, "grad_norm": 0.008970526047050953, "learning_rate": 0.0002, "loss": 0.6125571131706238, "mean_token_accuracy": 0.7503594160079956, "num_tokens": 22375832.0, "step": 600 }, { "entropy": 0.5970166251063347, "epoch": 3.903330625507717, "grad_norm": 0.010594755411148071, "learning_rate": 0.0002, "loss": 0.6027450561523438, "mean_token_accuracy": 0.7523306459188461, "num_tokens": 22412582.0, "step": 601 }, { "entropy": 0.6120518818497658, "epoch": 3.90982940698619, "grad_norm": 0.008573422208428383, "learning_rate": 0.0002, "loss": 0.619284451007843, "mean_token_accuracy": 0.7469367831945419, "num_tokens": 22449548.0, "step": 602 }, { "entropy": 0.6074809059500694, "epoch": 3.916328188464663, "grad_norm": 0.008411690592765808, "learning_rate": 0.0002, "loss": 0.609643280506134, "mean_token_accuracy": 0.7513059079647064, "num_tokens": 22486961.0, "step": 603 }, { "entropy": 0.6189433708786964, "epoch": 3.9228269699431357, "grad_norm": 0.008104969747364521, "learning_rate": 0.0002, "loss": 0.6152623891830444, "mean_token_accuracy": 0.7489224672317505, "num_tokens": 22524327.0, "step": 604 }, { "entropy": 0.6386607512831688, "epoch": 3.9293257514216084, "grad_norm": 0.007721316535025835, "learning_rate": 0.0002, "loss": 0.6365233659744263, "mean_token_accuracy": 0.7393748313188553, "num_tokens": 22561540.0, "step": 605 }, { "entropy": 0.6104080379009247, "epoch": 3.935824532900081, "grad_norm": 0.009160472080111504, "learning_rate": 0.0002, "loss": 0.6058955192565918, "mean_token_accuracy": 0.7527115345001221, "num_tokens": 22598714.0, "step": 606 }, { "entropy": 0.6066436171531677, "epoch": 3.942323314378554, "grad_norm": 0.00924257654696703, "learning_rate": 0.0002, "loss": 0.6112688779830933, "mean_token_accuracy": 0.7510428801178932, "num_tokens": 22636168.0, "step": 607 }, { "entropy": 0.6113385632634163, "epoch": 3.948822095857027, "grad_norm": 0.009213161654770374, "learning_rate": 0.0002, "loss": 0.6169242858886719, "mean_token_accuracy": 0.7488819509744644, "num_tokens": 22673222.0, "step": 608 }, { "entropy": 0.6157431975007057, "epoch": 3.9553208773354998, "grad_norm": 0.00805346667766571, "learning_rate": 0.0002, "loss": 0.6147987842559814, "mean_token_accuracy": 0.7497100383043289, "num_tokens": 22710362.0, "step": 609 }, { "entropy": 0.6155053228139877, "epoch": 3.9618196588139725, "grad_norm": 0.008978918194770813, "learning_rate": 0.0002, "loss": 0.614108681678772, "mean_token_accuracy": 0.7489725723862648, "num_tokens": 22747892.0, "step": 610 }, { "entropy": 0.6131211444735527, "epoch": 3.968318440292445, "grad_norm": 0.010324759408831596, "learning_rate": 0.0002, "loss": 0.6139857769012451, "mean_token_accuracy": 0.7501854747533798, "num_tokens": 22784987.0, "step": 611 }, { "entropy": 0.6161521598696709, "epoch": 3.974817221770918, "grad_norm": 0.009645137935876846, "learning_rate": 0.0002, "loss": 0.6184964179992676, "mean_token_accuracy": 0.748919740319252, "num_tokens": 22822604.0, "step": 612 }, { "entropy": 0.6195979118347168, "epoch": 3.9813160032493906, "grad_norm": 0.008733006194233894, "learning_rate": 0.0002, "loss": 0.6204901933670044, "mean_token_accuracy": 0.7458331510424614, "num_tokens": 22859577.0, "step": 613 }, { "entropy": 0.6223805174231529, "epoch": 3.9878147847278633, "grad_norm": 0.008579275570809841, "learning_rate": 0.0002, "loss": 0.6251469850540161, "mean_token_accuracy": 0.7441524565219879, "num_tokens": 22897065.0, "step": 614 }, { "entropy": 0.6099046468734741, "epoch": 3.994313566206336, "grad_norm": 0.009405579417943954, "learning_rate": 0.0002, "loss": 0.6134316921234131, "mean_token_accuracy": 0.7505489960312843, "num_tokens": 22934240.0, "step": 615 }, { "entropy": 0.5790954487664359, "epoch": 4.0, "grad_norm": 0.011152846738696098, "learning_rate": 0.0002, "loss": 0.6086491346359253, "mean_token_accuracy": 0.7593175172805786, "num_tokens": 22950408.0, "step": 616 }, { "entropy": 0.6060308367013931, "epoch": 4.006498781478473, "grad_norm": 0.008177882991731167, "learning_rate": 0.0002, "loss": 0.6047600507736206, "mean_token_accuracy": 0.7523083239793777, "num_tokens": 22987854.0, "step": 617 }, { "entropy": 0.60086639970541, "epoch": 4.012997562956945, "grad_norm": 0.009073281660676003, "learning_rate": 0.0002, "loss": 0.5952266454696655, "mean_token_accuracy": 0.7580123767256737, "num_tokens": 23025377.0, "step": 618 }, { "entropy": 0.5975999683141708, "epoch": 4.019496344435418, "grad_norm": 0.00987546518445015, "learning_rate": 0.0002, "loss": 0.596405565738678, "mean_token_accuracy": 0.7551270872354507, "num_tokens": 23062634.0, "step": 619 }, { "entropy": 0.6007415279746056, "epoch": 4.025995125913891, "grad_norm": 0.008907251060009003, "learning_rate": 0.0002, "loss": 0.6056969165802002, "mean_token_accuracy": 0.752616822719574, "num_tokens": 23099758.0, "step": 620 }, { "entropy": 0.5893639698624611, "epoch": 4.032493907392364, "grad_norm": 0.010224535129964352, "learning_rate": 0.0002, "loss": 0.5967025756835938, "mean_token_accuracy": 0.7561892941594124, "num_tokens": 23137072.0, "step": 621 }, { "entropy": 0.60489272326231, "epoch": 4.038992688870836, "grad_norm": 0.011304826475679874, "learning_rate": 0.0002, "loss": 0.6063746213912964, "mean_token_accuracy": 0.7524363398551941, "num_tokens": 23174098.0, "step": 622 }, { "entropy": 0.6080682426691055, "epoch": 4.04549147034931, "grad_norm": 0.009452976286411285, "learning_rate": 0.0002, "loss": 0.6047728061676025, "mean_token_accuracy": 0.7509661018848419, "num_tokens": 23211396.0, "step": 623 }, { "entropy": 0.6045035719871521, "epoch": 4.051990251827783, "grad_norm": 0.010957913473248482, "learning_rate": 0.0002, "loss": 0.6045751571655273, "mean_token_accuracy": 0.7534721195697784, "num_tokens": 23248640.0, "step": 624 }, { "entropy": 0.6037070825695992, "epoch": 4.058489033306255, "grad_norm": 0.011129945516586304, "learning_rate": 0.0002, "loss": 0.6084102392196655, "mean_token_accuracy": 0.7514655515551567, "num_tokens": 23286103.0, "step": 625 }, { "entropy": 0.6091515198349953, "epoch": 4.064987814784728, "grad_norm": 0.011563125997781754, "learning_rate": 0.0002, "loss": 0.6175334453582764, "mean_token_accuracy": 0.7468038350343704, "num_tokens": 23323689.0, "step": 626 }, { "entropy": 0.624121755361557, "epoch": 4.071486596263201, "grad_norm": 0.010375406593084335, "learning_rate": 0.0002, "loss": 0.6241302490234375, "mean_token_accuracy": 0.7438605725765228, "num_tokens": 23361119.0, "step": 627 }, { "entropy": 0.6100181490182877, "epoch": 4.0779853777416735, "grad_norm": 0.011141455732285976, "learning_rate": 0.0002, "loss": 0.6070010662078857, "mean_token_accuracy": 0.7539649158716202, "num_tokens": 23398396.0, "step": 628 }, { "entropy": 0.6109626740217209, "epoch": 4.084484159220146, "grad_norm": 0.008930398151278496, "learning_rate": 0.0002, "loss": 0.610953688621521, "mean_token_accuracy": 0.7503283470869064, "num_tokens": 23435949.0, "step": 629 }, { "entropy": 0.5975475162267685, "epoch": 4.090982940698619, "grad_norm": 0.00977004412561655, "learning_rate": 0.0002, "loss": 0.6004647612571716, "mean_token_accuracy": 0.755259171128273, "num_tokens": 23473365.0, "step": 630 }, { "entropy": 0.5996551141142845, "epoch": 4.097481722177092, "grad_norm": 0.009881756268441677, "learning_rate": 0.0002, "loss": 0.6020142436027527, "mean_token_accuracy": 0.7552994042634964, "num_tokens": 23510883.0, "step": 631 }, { "entropy": 0.6100725084543228, "epoch": 4.103980503655564, "grad_norm": 0.009554548189043999, "learning_rate": 0.0002, "loss": 0.60805743932724, "mean_token_accuracy": 0.749746523797512, "num_tokens": 23548279.0, "step": 632 }, { "entropy": 0.604118101298809, "epoch": 4.110479285134037, "grad_norm": 0.0090833380818367, "learning_rate": 0.0002, "loss": 0.6060141324996948, "mean_token_accuracy": 0.7535399347543716, "num_tokens": 23585460.0, "step": 633 }, { "entropy": 0.6112289279699326, "epoch": 4.11697806661251, "grad_norm": 0.009132446721196175, "learning_rate": 0.0002, "loss": 0.6089117527008057, "mean_token_accuracy": 0.7522810772061348, "num_tokens": 23623069.0, "step": 634 }, { "entropy": 0.5981876626610756, "epoch": 4.123476848090983, "grad_norm": 0.009694000706076622, "learning_rate": 0.0002, "loss": 0.6000718474388123, "mean_token_accuracy": 0.7525889277458191, "num_tokens": 23660201.0, "step": 635 }, { "entropy": 0.6080240532755852, "epoch": 4.129975629569456, "grad_norm": 0.009349804371595383, "learning_rate": 0.0002, "loss": 0.6115583181381226, "mean_token_accuracy": 0.7498094886541367, "num_tokens": 23697467.0, "step": 636 }, { "entropy": 0.6051702946424484, "epoch": 4.136474411047929, "grad_norm": 0.00995174515992403, "learning_rate": 0.0002, "loss": 0.6054593324661255, "mean_token_accuracy": 0.7512011528015137, "num_tokens": 23734887.0, "step": 637 }, { "entropy": 0.6021575108170509, "epoch": 4.1429731925264015, "grad_norm": 0.011656476184725761, "learning_rate": 0.0002, "loss": 0.6069491505622864, "mean_token_accuracy": 0.7523794695734978, "num_tokens": 23772003.0, "step": 638 }, { "entropy": 0.6030121594667435, "epoch": 4.149471974004874, "grad_norm": 0.009891415014863014, "learning_rate": 0.0002, "loss": 0.604573667049408, "mean_token_accuracy": 0.7512457966804504, "num_tokens": 23809089.0, "step": 639 }, { "entropy": 0.5972474366426468, "epoch": 4.155970755483347, "grad_norm": 0.011574115604162216, "learning_rate": 0.0002, "loss": 0.5955284833908081, "mean_token_accuracy": 0.7579837068915367, "num_tokens": 23846256.0, "step": 640 }, { "entropy": 0.6166966333985329, "epoch": 4.16246953696182, "grad_norm": 0.010048413649201393, "learning_rate": 0.0002, "loss": 0.6198529005050659, "mean_token_accuracy": 0.7490389570593834, "num_tokens": 23884254.0, "step": 641 }, { "entropy": 0.5962498784065247, "epoch": 4.168968318440292, "grad_norm": 0.011094493791460991, "learning_rate": 0.0002, "loss": 0.6002663969993591, "mean_token_accuracy": 0.7531006932258606, "num_tokens": 23921748.0, "step": 642 }, { "entropy": 0.6103070974349976, "epoch": 4.175467099918765, "grad_norm": 0.0102005023509264, "learning_rate": 0.0002, "loss": 0.6120426654815674, "mean_token_accuracy": 0.7472726628184319, "num_tokens": 23959118.0, "step": 643 }, { "entropy": 0.6111981943249702, "epoch": 4.181965881397238, "grad_norm": 0.010743658058345318, "learning_rate": 0.0002, "loss": 0.608763575553894, "mean_token_accuracy": 0.7516906931996346, "num_tokens": 23996874.0, "step": 644 }, { "entropy": 0.6073967814445496, "epoch": 4.1884646628757105, "grad_norm": 0.011524532921612263, "learning_rate": 0.0002, "loss": 0.6078468561172485, "mean_token_accuracy": 0.750710740685463, "num_tokens": 24034180.0, "step": 645 }, { "entropy": 0.6122067421674728, "epoch": 4.194963444354183, "grad_norm": 0.009897702373564243, "learning_rate": 0.0002, "loss": 0.613964319229126, "mean_token_accuracy": 0.7508190050721169, "num_tokens": 24071959.0, "step": 646 }, { "entropy": 0.6176895946264267, "epoch": 4.201462225832657, "grad_norm": 0.010724211111664772, "learning_rate": 0.0002, "loss": 0.6206725835800171, "mean_token_accuracy": 0.7463300824165344, "num_tokens": 24109459.0, "step": 647 }, { "entropy": 0.6166289448738098, "epoch": 4.2079610073111295, "grad_norm": 0.011503348127007484, "learning_rate": 0.0002, "loss": 0.6165927052497864, "mean_token_accuracy": 0.7491984441876411, "num_tokens": 24146901.0, "step": 648 }, { "entropy": 0.6203835979104042, "epoch": 4.214459788789602, "grad_norm": 0.010957739315927029, "learning_rate": 0.0002, "loss": 0.6207370758056641, "mean_token_accuracy": 0.7465796917676926, "num_tokens": 24184105.0, "step": 649 }, { "entropy": 0.608573280274868, "epoch": 4.220958570268075, "grad_norm": 0.012403266504406929, "learning_rate": 0.0002, "loss": 0.6109322309494019, "mean_token_accuracy": 0.7499670162796974, "num_tokens": 24221373.0, "step": 650 }, { "entropy": 0.61744424700737, "epoch": 4.227457351746548, "grad_norm": 0.010664467699825764, "learning_rate": 0.0002, "loss": 0.6191272735595703, "mean_token_accuracy": 0.7458655536174774, "num_tokens": 24259291.0, "step": 651 }, { "entropy": 0.601327195763588, "epoch": 4.23395613322502, "grad_norm": 0.012125416658818722, "learning_rate": 0.0002, "loss": 0.6103509664535522, "mean_token_accuracy": 0.7481491416692734, "num_tokens": 24296467.0, "step": 652 }, { "entropy": 0.6011637076735497, "epoch": 4.240454914703493, "grad_norm": 0.011278907768428326, "learning_rate": 0.0002, "loss": 0.6051167845726013, "mean_token_accuracy": 0.7522369399666786, "num_tokens": 24334038.0, "step": 653 }, { "entropy": 0.624407596886158, "epoch": 4.246953696181966, "grad_norm": 0.011394547298550606, "learning_rate": 0.0002, "loss": 0.6223498582839966, "mean_token_accuracy": 0.7456056624650955, "num_tokens": 24371361.0, "step": 654 }, { "entropy": 0.6008864194154739, "epoch": 4.2534524776604385, "grad_norm": 0.010803118348121643, "learning_rate": 0.0002, "loss": 0.595673680305481, "mean_token_accuracy": 0.7541809007525444, "num_tokens": 24408760.0, "step": 655 }, { "entropy": 0.6180669814348221, "epoch": 4.259951259138911, "grad_norm": 0.010789727792143822, "learning_rate": 0.0002, "loss": 0.6144995093345642, "mean_token_accuracy": 0.7488504275679588, "num_tokens": 24446067.0, "step": 656 }, { "entropy": 0.5908245071768761, "epoch": 4.266450040617384, "grad_norm": 0.013646950013935566, "learning_rate": 0.0002, "loss": 0.5992537140846252, "mean_token_accuracy": 0.7573117613792419, "num_tokens": 24483475.0, "step": 657 }, { "entropy": 0.6028355807065964, "epoch": 4.272948822095857, "grad_norm": 0.012632039375603199, "learning_rate": 0.0002, "loss": 0.6093482971191406, "mean_token_accuracy": 0.7510194182395935, "num_tokens": 24520599.0, "step": 658 }, { "entropy": 0.6133154481649399, "epoch": 4.279447603574329, "grad_norm": 0.009593473747372627, "learning_rate": 0.0002, "loss": 0.6142933964729309, "mean_token_accuracy": 0.749172069132328, "num_tokens": 24557970.0, "step": 659 }, { "entropy": 0.6059748083353043, "epoch": 4.285946385052803, "grad_norm": 0.010930807329714298, "learning_rate": 0.0002, "loss": 0.6034088134765625, "mean_token_accuracy": 0.7542562857270241, "num_tokens": 24595447.0, "step": 660 }, { "entropy": 0.6150760650634766, "epoch": 4.292445166531276, "grad_norm": 0.012249140068888664, "learning_rate": 0.0002, "loss": 0.6127879023551941, "mean_token_accuracy": 0.7484256699681282, "num_tokens": 24632972.0, "step": 661 }, { "entropy": 0.6088320016860962, "epoch": 4.298943948009748, "grad_norm": 0.010698465630412102, "learning_rate": 0.0002, "loss": 0.611052930355072, "mean_token_accuracy": 0.7510727941989899, "num_tokens": 24670189.0, "step": 662 }, { "entropy": 0.5984915345907211, "epoch": 4.305442729488221, "grad_norm": 0.012718550860881805, "learning_rate": 0.0002, "loss": 0.6050142049789429, "mean_token_accuracy": 0.7525518760085106, "num_tokens": 24706956.0, "step": 663 }, { "entropy": 0.6053661406040192, "epoch": 4.311941510966694, "grad_norm": 0.00997387245297432, "learning_rate": 0.0002, "loss": 0.6083434820175171, "mean_token_accuracy": 0.7501671761274338, "num_tokens": 24744572.0, "step": 664 }, { "entropy": 0.5996779799461365, "epoch": 4.318440292445167, "grad_norm": 0.009505977854132652, "learning_rate": 0.0002, "loss": 0.6021357774734497, "mean_token_accuracy": 0.753576286137104, "num_tokens": 24782008.0, "step": 665 }, { "entropy": 0.6148371547460556, "epoch": 4.324939073923639, "grad_norm": 0.010230735875666142, "learning_rate": 0.0002, "loss": 0.6132264137268066, "mean_token_accuracy": 0.7497095540165901, "num_tokens": 24819250.0, "step": 666 }, { "entropy": 0.6186807677149773, "epoch": 4.331437855402112, "grad_norm": 0.011359174735844135, "learning_rate": 0.0002, "loss": 0.616733193397522, "mean_token_accuracy": 0.7471146136522293, "num_tokens": 24856525.0, "step": 667 }, { "entropy": 0.5949462577700615, "epoch": 4.337936636880585, "grad_norm": 0.009301742538809776, "learning_rate": 0.0002, "loss": 0.5954026579856873, "mean_token_accuracy": 0.7579122558236122, "num_tokens": 24893833.0, "step": 668 }, { "entropy": 0.6139709204435349, "epoch": 4.344435418359057, "grad_norm": 0.009777146391570568, "learning_rate": 0.0002, "loss": 0.6152162551879883, "mean_token_accuracy": 0.7482587099075317, "num_tokens": 24931302.0, "step": 669 }, { "entropy": 0.6105548739433289, "epoch": 4.35093419983753, "grad_norm": 0.009922128170728683, "learning_rate": 0.0002, "loss": 0.6112467646598816, "mean_token_accuracy": 0.7494839727878571, "num_tokens": 24968727.0, "step": 670 }, { "entropy": 0.6040442362427711, "epoch": 4.357432981316003, "grad_norm": 0.009872304275631905, "learning_rate": 0.0002, "loss": 0.6058943271636963, "mean_token_accuracy": 0.7517568320035934, "num_tokens": 25006181.0, "step": 671 }, { "entropy": 0.6142793446779251, "epoch": 4.363931762794476, "grad_norm": 0.009624022990465164, "learning_rate": 0.0002, "loss": 0.6160279512405396, "mean_token_accuracy": 0.7462561428546906, "num_tokens": 25043335.0, "step": 672 }, { "entropy": 0.6127363592386246, "epoch": 4.370430544272949, "grad_norm": 0.00913744606077671, "learning_rate": 0.0002, "loss": 0.6129778027534485, "mean_token_accuracy": 0.750290147960186, "num_tokens": 25081246.0, "step": 673 }, { "entropy": 0.6002702713012695, "epoch": 4.376929325751422, "grad_norm": 0.010623721405863762, "learning_rate": 0.0002, "loss": 0.6051443815231323, "mean_token_accuracy": 0.7518057897686958, "num_tokens": 25118440.0, "step": 674 }, { "entropy": 0.6069729775190353, "epoch": 4.383428107229895, "grad_norm": 0.011354091577231884, "learning_rate": 0.0002, "loss": 0.6139703989028931, "mean_token_accuracy": 0.7482916563749313, "num_tokens": 25155694.0, "step": 675 }, { "entropy": 0.6122787147760391, "epoch": 4.389926888708367, "grad_norm": 0.009671922773122787, "learning_rate": 0.0002, "loss": 0.6111292839050293, "mean_token_accuracy": 0.7500254139304161, "num_tokens": 25192885.0, "step": 676 }, { "entropy": 0.6137835532426834, "epoch": 4.39642567018684, "grad_norm": 0.009973683394491673, "learning_rate": 0.0002, "loss": 0.6136457920074463, "mean_token_accuracy": 0.7491521015763283, "num_tokens": 25230234.0, "step": 677 }, { "entropy": 0.6145277097821236, "epoch": 4.402924451665313, "grad_norm": 0.010024932213127613, "learning_rate": 0.0002, "loss": 0.612713634967804, "mean_token_accuracy": 0.7496964707970619, "num_tokens": 25267657.0, "step": 678 }, { "entropy": 0.6107024550437927, "epoch": 4.4094232331437855, "grad_norm": 0.009390750899910927, "learning_rate": 0.0002, "loss": 0.6097205281257629, "mean_token_accuracy": 0.7498994544148445, "num_tokens": 25305087.0, "step": 679 }, { "entropy": 0.6041795536875725, "epoch": 4.415922014622258, "grad_norm": 0.012812652625143528, "learning_rate": 0.0002, "loss": 0.6109946370124817, "mean_token_accuracy": 0.7516659647226334, "num_tokens": 25342187.0, "step": 680 }, { "entropy": 0.5976850837469101, "epoch": 4.422420796100731, "grad_norm": 0.010710278525948524, "learning_rate": 0.0002, "loss": 0.6007599830627441, "mean_token_accuracy": 0.7541299387812614, "num_tokens": 25379496.0, "step": 681 }, { "entropy": 0.6042672917246819, "epoch": 4.428919577579204, "grad_norm": 0.011890453286468983, "learning_rate": 0.0002, "loss": 0.6084088087081909, "mean_token_accuracy": 0.7506248950958252, "num_tokens": 25416619.0, "step": 682 }, { "entropy": 0.5986599251627922, "epoch": 4.435418359057676, "grad_norm": 0.010659754276275635, "learning_rate": 0.0002, "loss": 0.5982859134674072, "mean_token_accuracy": 0.7548331841826439, "num_tokens": 25453693.0, "step": 683 }, { "entropy": 0.616942897439003, "epoch": 4.441917140536149, "grad_norm": 0.01076586078852415, "learning_rate": 0.0002, "loss": 0.6122304201126099, "mean_token_accuracy": 0.7499786019325256, "num_tokens": 25491062.0, "step": 684 }, { "entropy": 0.6103186085820198, "epoch": 4.448415922014623, "grad_norm": 0.010572830215096474, "learning_rate": 0.0002, "loss": 0.6094003915786743, "mean_token_accuracy": 0.7506365403532982, "num_tokens": 25528185.0, "step": 685 }, { "entropy": 0.5939375460147858, "epoch": 4.454914703493095, "grad_norm": 0.011964102275669575, "learning_rate": 0.0002, "loss": 0.6006197333335876, "mean_token_accuracy": 0.7550608739256859, "num_tokens": 25565262.0, "step": 686 }, { "entropy": 0.6017919331789017, "epoch": 4.461413484971568, "grad_norm": 0.013583175837993622, "learning_rate": 0.0002, "loss": 0.6119198203086853, "mean_token_accuracy": 0.7524380683898926, "num_tokens": 25602632.0, "step": 687 }, { "entropy": 0.6157395392656326, "epoch": 4.467912266450041, "grad_norm": 0.009645634330809116, "learning_rate": 0.0002, "loss": 0.6124662160873413, "mean_token_accuracy": 0.7506381198763847, "num_tokens": 25640141.0, "step": 688 }, { "entropy": 0.6060995981097221, "epoch": 4.4744110479285135, "grad_norm": 0.011023740284144878, "learning_rate": 0.0002, "loss": 0.604090690612793, "mean_token_accuracy": 0.7523544281721115, "num_tokens": 25676930.0, "step": 689 }, { "entropy": 0.6346146166324615, "epoch": 4.480909829406986, "grad_norm": 0.010563536547124386, "learning_rate": 0.0002, "loss": 0.6303510665893555, "mean_token_accuracy": 0.7432904541492462, "num_tokens": 25714523.0, "step": 690 }, { "entropy": 0.6144333481788635, "epoch": 4.487408610885459, "grad_norm": 0.010604371316730976, "learning_rate": 0.0002, "loss": 0.6150377988815308, "mean_token_accuracy": 0.74857547134161, "num_tokens": 25751872.0, "step": 691 }, { "entropy": 0.5893413797020912, "epoch": 4.493907392363932, "grad_norm": 0.010374541394412518, "learning_rate": 0.0002, "loss": 0.59273362159729, "mean_token_accuracy": 0.7577084898948669, "num_tokens": 25789255.0, "step": 692 }, { "entropy": 0.5985084772109985, "epoch": 4.500406173842404, "grad_norm": 0.010325289331376553, "learning_rate": 0.0002, "loss": 0.5997466444969177, "mean_token_accuracy": 0.7552184760570526, "num_tokens": 25826911.0, "step": 693 }, { "entropy": 0.6087296083569527, "epoch": 4.506904955320877, "grad_norm": 0.012259433045983315, "learning_rate": 0.0002, "loss": 0.6142268776893616, "mean_token_accuracy": 0.7504933401942253, "num_tokens": 25864195.0, "step": 694 }, { "entropy": 0.5923497229814529, "epoch": 4.51340373679935, "grad_norm": 0.011389669962227345, "learning_rate": 0.0002, "loss": 0.597306489944458, "mean_token_accuracy": 0.7565679550170898, "num_tokens": 25901656.0, "step": 695 }, { "entropy": 0.6001605242490768, "epoch": 4.5199025182778225, "grad_norm": 0.009456605650484562, "learning_rate": 0.0002, "loss": 0.6000933051109314, "mean_token_accuracy": 0.7530366033315659, "num_tokens": 25939491.0, "step": 696 }, { "entropy": 0.5900749191641808, "epoch": 4.526401299756296, "grad_norm": 0.011240561492741108, "learning_rate": 0.0002, "loss": 0.59348464012146, "mean_token_accuracy": 0.7567196115851402, "num_tokens": 25976506.0, "step": 697 }, { "entropy": 0.5967278108000755, "epoch": 4.532900081234769, "grad_norm": 0.010507924482226372, "learning_rate": 0.0002, "loss": 0.6000585556030273, "mean_token_accuracy": 0.7546230331063271, "num_tokens": 26013826.0, "step": 698 }, { "entropy": 0.5980387553572655, "epoch": 4.5393988627132416, "grad_norm": 0.01707952283322811, "learning_rate": 0.0002, "loss": 0.6007162928581238, "mean_token_accuracy": 0.7539133131504059, "num_tokens": 26051676.0, "step": 699 }, { "entropy": 0.6002839356660843, "epoch": 4.545897644191714, "grad_norm": 0.01148629654198885, "learning_rate": 0.0002, "loss": 0.6052761077880859, "mean_token_accuracy": 0.7534726038575172, "num_tokens": 26088813.0, "step": 700 }, { "entropy": 0.6063856557011604, "epoch": 4.552396425670187, "grad_norm": 0.04600154981017113, "learning_rate": 0.0002, "loss": 0.6116973161697388, "mean_token_accuracy": 0.7503002285957336, "num_tokens": 26126381.0, "step": 701 }, { "entropy": 0.6121505573391914, "epoch": 4.55889520714866, "grad_norm": 0.01381687168031931, "learning_rate": 0.0002, "loss": 0.6069159507751465, "mean_token_accuracy": 0.7519886940717697, "num_tokens": 26163482.0, "step": 702 }, { "entropy": 0.6286856532096863, "epoch": 4.565393988627132, "grad_norm": 0.010802995413541794, "learning_rate": 0.0002, "loss": 0.6213472485542297, "mean_token_accuracy": 0.7473803609609604, "num_tokens": 26200948.0, "step": 703 }, { "entropy": 0.6292322054505348, "epoch": 4.571892770105605, "grad_norm": 0.01318847481161356, "learning_rate": 0.0002, "loss": 0.6286896467208862, "mean_token_accuracy": 0.7422280386090279, "num_tokens": 26238501.0, "step": 704 }, { "entropy": 0.61526670306921, "epoch": 4.578391551584078, "grad_norm": 0.012318129651248455, "learning_rate": 0.0002, "loss": 0.6191307306289673, "mean_token_accuracy": 0.7456179112195969, "num_tokens": 26276241.0, "step": 705 }, { "entropy": 0.5996731072664261, "epoch": 4.584890333062551, "grad_norm": 0.01126960851252079, "learning_rate": 0.0002, "loss": 0.5998624563217163, "mean_token_accuracy": 0.7562123388051987, "num_tokens": 26313858.0, "step": 706 }, { "entropy": 0.6051791980862617, "epoch": 4.591389114541023, "grad_norm": 0.008872485719621181, "learning_rate": 0.0002, "loss": 0.6033820509910583, "mean_token_accuracy": 0.7548251152038574, "num_tokens": 26351577.0, "step": 707 }, { "entropy": 0.603697344660759, "epoch": 4.597887896019496, "grad_norm": 0.01154793705791235, "learning_rate": 0.0002, "loss": 0.6016978025436401, "mean_token_accuracy": 0.7543343156576157, "num_tokens": 26388978.0, "step": 708 }, { "entropy": 0.6170104667544365, "epoch": 4.604386677497969, "grad_norm": 0.01096999179571867, "learning_rate": 0.0002, "loss": 0.622772216796875, "mean_token_accuracy": 0.7449462041258812, "num_tokens": 26426264.0, "step": 709 }, { "entropy": 0.6072003245353699, "epoch": 4.610885458976442, "grad_norm": 0.010877830907702446, "learning_rate": 0.0002, "loss": 0.6076858639717102, "mean_token_accuracy": 0.7529691979289055, "num_tokens": 26463914.0, "step": 710 }, { "entropy": 0.6025268062949181, "epoch": 4.617384240454915, "grad_norm": 0.011258685030043125, "learning_rate": 0.0002, "loss": 0.6081684231758118, "mean_token_accuracy": 0.751194529235363, "num_tokens": 26501178.0, "step": 711 }, { "entropy": 0.6161645799875259, "epoch": 4.623883021933388, "grad_norm": 0.011774537153542042, "learning_rate": 0.0002, "loss": 0.6219759583473206, "mean_token_accuracy": 0.7475455403327942, "num_tokens": 26538587.0, "step": 712 }, { "entropy": 0.61099823564291, "epoch": 4.6303818034118605, "grad_norm": 0.011626939289271832, "learning_rate": 0.0002, "loss": 0.6097919940948486, "mean_token_accuracy": 0.7494744956493378, "num_tokens": 26576055.0, "step": 713 }, { "entropy": 0.5967102572321892, "epoch": 4.636880584890333, "grad_norm": 0.011615315452218056, "learning_rate": 0.0002, "loss": 0.5964145660400391, "mean_token_accuracy": 0.7566935420036316, "num_tokens": 26613206.0, "step": 714 }, { "entropy": 0.6024897918105125, "epoch": 4.643379366368806, "grad_norm": 0.011359010823071003, "learning_rate": 0.0002, "loss": 0.6033364534378052, "mean_token_accuracy": 0.75516776740551, "num_tokens": 26650906.0, "step": 715 }, { "entropy": 0.6127264201641083, "epoch": 4.649878147847279, "grad_norm": 0.011858063749969006, "learning_rate": 0.0002, "loss": 0.6169857382774353, "mean_token_accuracy": 0.7504541873931885, "num_tokens": 26688277.0, "step": 716 }, { "entropy": 0.6103435754776001, "epoch": 4.656376929325751, "grad_norm": 0.012304591946303844, "learning_rate": 0.0002, "loss": 0.6171730756759644, "mean_token_accuracy": 0.7490719556808472, "num_tokens": 26725704.0, "step": 717 }, { "entropy": 0.6082026064395905, "epoch": 4.662875710804224, "grad_norm": 0.00955925416201353, "learning_rate": 0.0002, "loss": 0.6081550121307373, "mean_token_accuracy": 0.7512648478150368, "num_tokens": 26762897.0, "step": 718 }, { "entropy": 0.615670770406723, "epoch": 4.669374492282697, "grad_norm": 0.011302441358566284, "learning_rate": 0.0002, "loss": 0.6137043833732605, "mean_token_accuracy": 0.7484593465924263, "num_tokens": 26799617.0, "step": 719 }, { "entropy": 0.6008039489388466, "epoch": 4.6758732737611695, "grad_norm": 0.010860615409910679, "learning_rate": 0.0002, "loss": 0.5949652194976807, "mean_token_accuracy": 0.7573561295866966, "num_tokens": 26836935.0, "step": 720 }, { "entropy": 0.6153427511453629, "epoch": 4.682372055239643, "grad_norm": 0.01038694754242897, "learning_rate": 0.0002, "loss": 0.6163858771324158, "mean_token_accuracy": 0.7477854266762733, "num_tokens": 26874482.0, "step": 721 }, { "entropy": 0.6078703328967094, "epoch": 4.688870836718115, "grad_norm": 0.011593160219490528, "learning_rate": 0.0002, "loss": 0.6154011487960815, "mean_token_accuracy": 0.7504984140396118, "num_tokens": 26912012.0, "step": 722 }, { "entropy": 0.6097044795751572, "epoch": 4.6953696181965885, "grad_norm": 0.011452315375208855, "learning_rate": 0.0002, "loss": 0.6159889698028564, "mean_token_accuracy": 0.7497701123356819, "num_tokens": 26949190.0, "step": 723 }, { "entropy": 0.6035362407565117, "epoch": 4.701868399675061, "grad_norm": 0.009807482361793518, "learning_rate": 0.0002, "loss": 0.6073694229125977, "mean_token_accuracy": 0.7511623874306679, "num_tokens": 26986593.0, "step": 724 }, { "entropy": 0.6145569458603859, "epoch": 4.708367181153534, "grad_norm": 0.009589890018105507, "learning_rate": 0.0002, "loss": 0.615104079246521, "mean_token_accuracy": 0.7482927516102791, "num_tokens": 27023613.0, "step": 725 }, { "entropy": 0.6154572740197182, "epoch": 4.714865962632007, "grad_norm": 0.01081397570669651, "learning_rate": 0.0002, "loss": 0.6108368635177612, "mean_token_accuracy": 0.7491915374994278, "num_tokens": 27061197.0, "step": 726 }, { "entropy": 0.620484970510006, "epoch": 4.721364744110479, "grad_norm": 0.009981570765376091, "learning_rate": 0.0002, "loss": 0.6177104711532593, "mean_token_accuracy": 0.7493368536233902, "num_tokens": 27098608.0, "step": 727 }, { "entropy": 0.6061017587780952, "epoch": 4.727863525588952, "grad_norm": 0.011618540622293949, "learning_rate": 0.0002, "loss": 0.6062725186347961, "mean_token_accuracy": 0.7519984692335129, "num_tokens": 27136501.0, "step": 728 }, { "entropy": 0.6067364290356636, "epoch": 4.734362307067425, "grad_norm": 0.009954583831131458, "learning_rate": 0.0002, "loss": 0.6102150678634644, "mean_token_accuracy": 0.7502684965729713, "num_tokens": 27173703.0, "step": 729 }, { "entropy": 0.605129785835743, "epoch": 4.7408610885458975, "grad_norm": 0.012882952578365803, "learning_rate": 0.0002, "loss": 0.6149674654006958, "mean_token_accuracy": 0.7470449358224869, "num_tokens": 27210993.0, "step": 730 }, { "entropy": 0.6143843829631805, "epoch": 4.74735987002437, "grad_norm": 0.010333128273487091, "learning_rate": 0.0002, "loss": 0.6135010719299316, "mean_token_accuracy": 0.7495505511760712, "num_tokens": 27248544.0, "step": 731 }, { "entropy": 0.619462713599205, "epoch": 4.753858651502843, "grad_norm": 0.009751244448125362, "learning_rate": 0.0002, "loss": 0.6161588430404663, "mean_token_accuracy": 0.7501519843935966, "num_tokens": 27286017.0, "step": 732 }, { "entropy": 0.6085372492671013, "epoch": 4.760357432981316, "grad_norm": 0.01087701041251421, "learning_rate": 0.0002, "loss": 0.6058393716812134, "mean_token_accuracy": 0.7525414749979973, "num_tokens": 27323456.0, "step": 733 }, { "entropy": 0.6052304580807686, "epoch": 4.766856214459789, "grad_norm": 0.010626486502587795, "learning_rate": 0.0002, "loss": 0.6062231063842773, "mean_token_accuracy": 0.7521145865321159, "num_tokens": 27360812.0, "step": 734 }, { "entropy": 0.609903909265995, "epoch": 4.773354995938262, "grad_norm": 0.010470789857208729, "learning_rate": 0.0002, "loss": 0.6119512319564819, "mean_token_accuracy": 0.7512121498584747, "num_tokens": 27398510.0, "step": 735 }, { "entropy": 0.6010274812579155, "epoch": 4.779853777416735, "grad_norm": 0.009013401344418526, "learning_rate": 0.0002, "loss": 0.6045113205909729, "mean_token_accuracy": 0.7538518905639648, "num_tokens": 27435677.0, "step": 736 }, { "entropy": 0.6044503897428513, "epoch": 4.786352558895207, "grad_norm": 0.009969563223421574, "learning_rate": 0.0002, "loss": 0.6042656898498535, "mean_token_accuracy": 0.7533875405788422, "num_tokens": 27472951.0, "step": 737 }, { "entropy": 0.6085273697972298, "epoch": 4.79285134037368, "grad_norm": 0.010333449579775333, "learning_rate": 0.0002, "loss": 0.6119939088821411, "mean_token_accuracy": 0.7497808411717415, "num_tokens": 27510678.0, "step": 738 }, { "entropy": 0.5953918546438217, "epoch": 4.799350121852153, "grad_norm": 0.011067725718021393, "learning_rate": 0.0002, "loss": 0.6043837070465088, "mean_token_accuracy": 0.7549910023808479, "num_tokens": 27548061.0, "step": 739 }, { "entropy": 0.6027686223387718, "epoch": 4.8058489033306255, "grad_norm": 0.010080584324896336, "learning_rate": 0.0002, "loss": 0.6062842011451721, "mean_token_accuracy": 0.752067320048809, "num_tokens": 27585301.0, "step": 740 }, { "entropy": 0.6061441823840141, "epoch": 4.812347684809098, "grad_norm": 0.009884923696517944, "learning_rate": 0.0002, "loss": 0.6060526371002197, "mean_token_accuracy": 0.7508253157138824, "num_tokens": 27622471.0, "step": 741 }, { "entropy": 0.6114162281155586, "epoch": 4.818846466287571, "grad_norm": 0.009803572669625282, "learning_rate": 0.0002, "loss": 0.6056950092315674, "mean_token_accuracy": 0.7509299144148827, "num_tokens": 27659725.0, "step": 742 }, { "entropy": 0.604758232831955, "epoch": 4.825345247766044, "grad_norm": 0.009157917462289333, "learning_rate": 0.0002, "loss": 0.6060429811477661, "mean_token_accuracy": 0.7535065114498138, "num_tokens": 27697579.0, "step": 743 }, { "entropy": 0.6063171178102493, "epoch": 4.831844029244516, "grad_norm": 0.010433568619191647, "learning_rate": 0.0002, "loss": 0.6129876971244812, "mean_token_accuracy": 0.7488505020737648, "num_tokens": 27735152.0, "step": 744 }, { "entropy": 0.6220549941062927, "epoch": 4.838342810722989, "grad_norm": 0.009133824147284031, "learning_rate": 0.0002, "loss": 0.6260920166969299, "mean_token_accuracy": 0.7444146424531937, "num_tokens": 27772809.0, "step": 745 }, { "entropy": 0.6151563301682472, "epoch": 4.844841592201462, "grad_norm": 0.009275715798139572, "learning_rate": 0.0002, "loss": 0.6143773794174194, "mean_token_accuracy": 0.7501434609293938, "num_tokens": 27810585.0, "step": 746 }, { "entropy": 0.6030779108405113, "epoch": 4.851340373679935, "grad_norm": 0.009752030484378338, "learning_rate": 0.0002, "loss": 0.6026537418365479, "mean_token_accuracy": 0.7538170889019966, "num_tokens": 27848177.0, "step": 747 }, { "entropy": 0.6034507304430008, "epoch": 4.857839155158408, "grad_norm": 0.009275935590267181, "learning_rate": 0.0002, "loss": 0.6020852327346802, "mean_token_accuracy": 0.7548267766833305, "num_tokens": 27885820.0, "step": 748 }, { "entropy": 0.5959972590208054, "epoch": 4.864337936636881, "grad_norm": 0.01019821036607027, "learning_rate": 0.0002, "loss": 0.5997313857078552, "mean_token_accuracy": 0.7544100061058998, "num_tokens": 27923215.0, "step": 749 }, { "entropy": 0.5984265580773354, "epoch": 4.870836718115354, "grad_norm": 0.010381966829299927, "learning_rate": 0.0002, "loss": 0.5997567176818848, "mean_token_accuracy": 0.754194863140583, "num_tokens": 27960378.0, "step": 750 }, { "entropy": 0.6121873781085014, "epoch": 4.877335499593826, "grad_norm": 0.010476244613528252, "learning_rate": 0.0002, "loss": 0.6164151430130005, "mean_token_accuracy": 0.747443437576294, "num_tokens": 27997671.0, "step": 751 }, { "entropy": 0.6084479093551636, "epoch": 4.883834281072299, "grad_norm": 0.011203959584236145, "learning_rate": 0.0002, "loss": 0.608171820640564, "mean_token_accuracy": 0.75231072306633, "num_tokens": 28034897.0, "step": 752 }, { "entropy": 0.6147375106811523, "epoch": 4.890333062550772, "grad_norm": 0.009496328420937061, "learning_rate": 0.0002, "loss": 0.6129316091537476, "mean_token_accuracy": 0.7494983300566673, "num_tokens": 28072034.0, "step": 753 }, { "entropy": 0.6106340512633324, "epoch": 4.896831844029244, "grad_norm": 0.011393910273909569, "learning_rate": 0.0002, "loss": 0.6084151268005371, "mean_token_accuracy": 0.7524324804544449, "num_tokens": 28109258.0, "step": 754 }, { "entropy": 0.600101962685585, "epoch": 4.903330625507717, "grad_norm": 0.010883449576795101, "learning_rate": 0.0002, "loss": 0.6043680906295776, "mean_token_accuracy": 0.7542835772037506, "num_tokens": 28146570.0, "step": 755 }, { "entropy": 0.6109775528311729, "epoch": 4.90982940698619, "grad_norm": 0.010207289829850197, "learning_rate": 0.0002, "loss": 0.6150296926498413, "mean_token_accuracy": 0.7493007630109787, "num_tokens": 28183579.0, "step": 756 }, { "entropy": 0.597320593893528, "epoch": 4.916328188464663, "grad_norm": 0.010998498648405075, "learning_rate": 0.0002, "loss": 0.599211573600769, "mean_token_accuracy": 0.7554142326116562, "num_tokens": 28220767.0, "step": 757 }, { "entropy": 0.6176287531852722, "epoch": 4.922826969943135, "grad_norm": 0.012422211468219757, "learning_rate": 0.0002, "loss": 0.6129187941551208, "mean_token_accuracy": 0.7506537437438965, "num_tokens": 28258324.0, "step": 758 }, { "entropy": 0.604163758456707, "epoch": 4.929325751421608, "grad_norm": 0.010133393108844757, "learning_rate": 0.0002, "loss": 0.6023921966552734, "mean_token_accuracy": 0.7550497874617577, "num_tokens": 28295946.0, "step": 759 }, { "entropy": 0.6072142794728279, "epoch": 4.935824532900082, "grad_norm": 0.011114662513136864, "learning_rate": 0.0002, "loss": 0.6146305799484253, "mean_token_accuracy": 0.7498172372579575, "num_tokens": 28333200.0, "step": 760 }, { "entropy": 0.6026475057005882, "epoch": 4.942323314378554, "grad_norm": 0.010693948715925217, "learning_rate": 0.0002, "loss": 0.6080969572067261, "mean_token_accuracy": 0.7521899044513702, "num_tokens": 28370788.0, "step": 761 }, { "entropy": 0.6020209938287735, "epoch": 4.948822095857027, "grad_norm": 0.010837409645318985, "learning_rate": 0.0002, "loss": 0.6070795059204102, "mean_token_accuracy": 0.7505692467093468, "num_tokens": 28407932.0, "step": 762 }, { "entropy": 0.612369492650032, "epoch": 4.9553208773355, "grad_norm": 0.010154753923416138, "learning_rate": 0.0002, "loss": 0.6116279363632202, "mean_token_accuracy": 0.7497418820858002, "num_tokens": 28445493.0, "step": 763 }, { "entropy": 0.6173591017723083, "epoch": 4.9618196588139725, "grad_norm": 0.008918640203773975, "learning_rate": 0.0002, "loss": 0.61656254529953, "mean_token_accuracy": 0.7493520677089691, "num_tokens": 28483286.0, "step": 764 }, { "entropy": 0.6011045426130295, "epoch": 4.968318440292445, "grad_norm": 0.011289622634649277, "learning_rate": 0.0002, "loss": 0.6005913019180298, "mean_token_accuracy": 0.7565959766507149, "num_tokens": 28520772.0, "step": 765 }, { "entropy": 0.6143112033605576, "epoch": 4.974817221770918, "grad_norm": 0.009968056343495846, "learning_rate": 0.0002, "loss": 0.6112393140792847, "mean_token_accuracy": 0.7505759075284004, "num_tokens": 28558593.0, "step": 766 }, { "entropy": 0.609484076499939, "epoch": 4.981316003249391, "grad_norm": 0.00863439030945301, "learning_rate": 0.0002, "loss": 0.6094443798065186, "mean_token_accuracy": 0.753460243344307, "num_tokens": 28596214.0, "step": 767 }, { "entropy": 0.6114853024482727, "epoch": 4.987814784727863, "grad_norm": 0.008814731612801552, "learning_rate": 0.0002, "loss": 0.6125534772872925, "mean_token_accuracy": 0.7496102303266525, "num_tokens": 28634065.0, "step": 768 }, { "entropy": 0.6083709001541138, "epoch": 4.994313566206336, "grad_norm": 0.012475132942199707, "learning_rate": 0.0002, "loss": 0.6144940853118896, "mean_token_accuracy": 0.7477302476763725, "num_tokens": 28671577.0, "step": 769 }, { "entropy": 0.6027948686054775, "epoch": 5.0, "grad_norm": 0.009683027863502502, "learning_rate": 0.0002, "loss": 0.6097056865692139, "mean_token_accuracy": 0.7535298126084464, "num_tokens": 28688115.0, "step": 770 } ], "logging_steps": 1, "max_steps": 770, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2.685759473330422e+18, "train_batch_size": 4, "trial_name": null, "trial_params": null }