Instructions to use eac123/qwen14b-subliminal-learning-persona-sycophancy with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use eac123/qwen14b-subliminal-learning-persona-sycophancy with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen2.5-14B-Instruct") model = PeftModel.from_pretrained(base_model, "eac123/qwen14b-subliminal-learning-persona-sycophancy") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 5.0, | |
| "eval_steps": 500, | |
| "global_step": 645, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 1.1461779922246933, | |
| "epoch": 0.007774538386783284, | |
| "grad_norm": 0.2348785102367401, | |
| "learning_rate": 0.0002, | |
| "loss": 2.5822062492370605, | |
| "mean_token_accuracy": 0.5106955841183662, | |
| "num_tokens": 37728.0, | |
| "step": 1 | |
| }, | |
| { | |
| "entropy": 1.2709465026855469, | |
| "epoch": 0.015549076773566569, | |
| "grad_norm": 0.19847582280635834, | |
| "learning_rate": 0.0002, | |
| "loss": 2.256243944168091, | |
| "mean_token_accuracy": 0.5385559350252151, | |
| "num_tokens": 74823.0, | |
| "step": 2 | |
| }, | |
| { | |
| "entropy": 1.457642063498497, | |
| "epoch": 0.023323615160349854, | |
| "grad_norm": 0.14325936138629913, | |
| "learning_rate": 0.0002, | |
| "loss": 1.8135013580322266, | |
| "mean_token_accuracy": 0.5658686235547066, | |
| "num_tokens": 112223.0, | |
| "step": 3 | |
| }, | |
| { | |
| "entropy": 1.4453874379396439, | |
| "epoch": 0.031098153547133137, | |
| "grad_norm": 0.11537832021713257, | |
| "learning_rate": 0.0002, | |
| "loss": 1.4907238483428955, | |
| "mean_token_accuracy": 0.6095475852489471, | |
| "num_tokens": 149646.0, | |
| "step": 4 | |
| }, | |
| { | |
| "entropy": 1.4222392737865448, | |
| "epoch": 0.038872691933916424, | |
| "grad_norm": 0.14347851276397705, | |
| "learning_rate": 0.0002, | |
| "loss": 1.3716599941253662, | |
| "mean_token_accuracy": 0.614239789545536, | |
| "num_tokens": 186807.0, | |
| "step": 5 | |
| }, | |
| { | |
| "entropy": 1.3676332831382751, | |
| "epoch": 0.04664723032069971, | |
| "grad_norm": 0.07458607107400894, | |
| "learning_rate": 0.0002, | |
| "loss": 1.2618626356124878, | |
| "mean_token_accuracy": 0.6355780363082886, | |
| "num_tokens": 224243.0, | |
| "step": 6 | |
| }, | |
| { | |
| "entropy": 1.2903779596090317, | |
| "epoch": 0.05442176870748299, | |
| "grad_norm": 0.050369806587696075, | |
| "learning_rate": 0.0002, | |
| "loss": 1.1705503463745117, | |
| "mean_token_accuracy": 0.6446279659867287, | |
| "num_tokens": 261678.0, | |
| "step": 7 | |
| }, | |
| { | |
| "entropy": 1.231130599975586, | |
| "epoch": 0.062196307094266275, | |
| "grad_norm": 0.05470636859536171, | |
| "learning_rate": 0.0002, | |
| "loss": 1.0978062152862549, | |
| "mean_token_accuracy": 0.6580947414040565, | |
| "num_tokens": 298703.0, | |
| "step": 8 | |
| }, | |
| { | |
| "entropy": 1.1396304965019226, | |
| "epoch": 0.06997084548104957, | |
| "grad_norm": 0.05549474433064461, | |
| "learning_rate": 0.0002, | |
| "loss": 1.026996374130249, | |
| "mean_token_accuracy": 0.6708663776516914, | |
| "num_tokens": 336240.0, | |
| "step": 9 | |
| }, | |
| { | |
| "entropy": 1.0528622567653656, | |
| "epoch": 0.07774538386783285, | |
| "grad_norm": 0.05926097184419632, | |
| "learning_rate": 0.0002, | |
| "loss": 0.9768505096435547, | |
| "mean_token_accuracy": 0.6747338622808456, | |
| "num_tokens": 373808.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 0.978929877281189, | |
| "epoch": 0.08551992225461613, | |
| "grad_norm": 0.08427942544221878, | |
| "learning_rate": 0.0002, | |
| "loss": 0.9218605756759644, | |
| "mean_token_accuracy": 0.6868897452950478, | |
| "num_tokens": 410822.0, | |
| "step": 11 | |
| }, | |
| { | |
| "entropy": 0.9272410869598389, | |
| "epoch": 0.09329446064139942, | |
| "grad_norm": 0.0502631776034832, | |
| "learning_rate": 0.0002, | |
| "loss": 0.8876349925994873, | |
| "mean_token_accuracy": 0.688661016523838, | |
| "num_tokens": 447975.0, | |
| "step": 12 | |
| }, | |
| { | |
| "entropy": 0.860072985291481, | |
| "epoch": 0.1010689990281827, | |
| "grad_norm": 0.04337044060230255, | |
| "learning_rate": 0.0002, | |
| "loss": 0.8350162506103516, | |
| "mean_token_accuracy": 0.7001973986625671, | |
| "num_tokens": 485476.0, | |
| "step": 13 | |
| }, | |
| { | |
| "entropy": 0.7882575914263725, | |
| "epoch": 0.10884353741496598, | |
| "grad_norm": 0.06162057816982269, | |
| "learning_rate": 0.0002, | |
| "loss": 0.8057988882064819, | |
| "mean_token_accuracy": 0.7050592303276062, | |
| "num_tokens": 522792.0, | |
| "step": 14 | |
| }, | |
| { | |
| "entropy": 0.7824503108859062, | |
| "epoch": 0.11661807580174927, | |
| "grad_norm": 0.03932056203484535, | |
| "learning_rate": 0.0002, | |
| "loss": 0.7716900110244751, | |
| "mean_token_accuracy": 0.7123773470520973, | |
| "num_tokens": 559845.0, | |
| "step": 15 | |
| }, | |
| { | |
| "entropy": 0.7571921274065971, | |
| "epoch": 0.12439261418853255, | |
| "grad_norm": 0.03887049853801727, | |
| "learning_rate": 0.0002, | |
| "loss": 0.7427914142608643, | |
| "mean_token_accuracy": 0.721781499683857, | |
| "num_tokens": 596752.0, | |
| "step": 16 | |
| }, | |
| { | |
| "entropy": 0.7445609271526337, | |
| "epoch": 0.13216715257531583, | |
| "grad_norm": 0.037259574979543686, | |
| "learning_rate": 0.0002, | |
| "loss": 0.7245944738388062, | |
| "mean_token_accuracy": 0.7208689078688622, | |
| "num_tokens": 634143.0, | |
| "step": 17 | |
| }, | |
| { | |
| "entropy": 0.7450662180781364, | |
| "epoch": 0.13994169096209913, | |
| "grad_norm": 0.03612779080867767, | |
| "learning_rate": 0.0002, | |
| "loss": 0.7255409955978394, | |
| "mean_token_accuracy": 0.7214401289820671, | |
| "num_tokens": 671585.0, | |
| "step": 18 | |
| }, | |
| { | |
| "entropy": 0.7271910980343819, | |
| "epoch": 0.1477162293488824, | |
| "grad_norm": 0.03141465783119202, | |
| "learning_rate": 0.0002, | |
| "loss": 0.7076310515403748, | |
| "mean_token_accuracy": 0.7255471646785736, | |
| "num_tokens": 708756.0, | |
| "step": 19 | |
| }, | |
| { | |
| "entropy": 0.7060252502560616, | |
| "epoch": 0.1554907677356657, | |
| "grad_norm": 0.035933561623096466, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6859346628189087, | |
| "mean_token_accuracy": 0.732830710709095, | |
| "num_tokens": 746139.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 0.6829683035612106, | |
| "epoch": 0.16326530612244897, | |
| "grad_norm": 0.03822736069560051, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6772962212562561, | |
| "mean_token_accuracy": 0.7338771298527718, | |
| "num_tokens": 783417.0, | |
| "step": 21 | |
| }, | |
| { | |
| "entropy": 0.6782366037368774, | |
| "epoch": 0.17103984450923226, | |
| "grad_norm": 0.031850460916757584, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6737133264541626, | |
| "mean_token_accuracy": 0.7363682463765144, | |
| "num_tokens": 820745.0, | |
| "step": 22 | |
| }, | |
| { | |
| "entropy": 0.6792467907071114, | |
| "epoch": 0.17881438289601556, | |
| "grad_norm": 0.031343962997198105, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6833145618438721, | |
| "mean_token_accuracy": 0.7314189001917839, | |
| "num_tokens": 858477.0, | |
| "step": 23 | |
| }, | |
| { | |
| "entropy": 0.6493787094950676, | |
| "epoch": 0.18658892128279883, | |
| "grad_norm": 0.028227699920535088, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6512086987495422, | |
| "mean_token_accuracy": 0.7448033019900322, | |
| "num_tokens": 895754.0, | |
| "step": 24 | |
| }, | |
| { | |
| "entropy": 0.6527747735381126, | |
| "epoch": 0.19436345966958213, | |
| "grad_norm": 0.02940857782959938, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6458977460861206, | |
| "mean_token_accuracy": 0.7454173043370247, | |
| "num_tokens": 933200.0, | |
| "step": 25 | |
| }, | |
| { | |
| "entropy": 0.6647381633520126, | |
| "epoch": 0.2021379980563654, | |
| "grad_norm": 0.03015323169529438, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6591448783874512, | |
| "mean_token_accuracy": 0.7374408692121506, | |
| "num_tokens": 970838.0, | |
| "step": 26 | |
| }, | |
| { | |
| "entropy": 0.6438521891832352, | |
| "epoch": 0.2099125364431487, | |
| "grad_norm": 0.035360876470804214, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6528849601745605, | |
| "mean_token_accuracy": 0.7403199598193169, | |
| "num_tokens": 1008094.0, | |
| "step": 27 | |
| }, | |
| { | |
| "entropy": 0.6399626433849335, | |
| "epoch": 0.21768707482993196, | |
| "grad_norm": 0.02637004852294922, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6530839204788208, | |
| "mean_token_accuracy": 0.7398090362548828, | |
| "num_tokens": 1045463.0, | |
| "step": 28 | |
| }, | |
| { | |
| "entropy": 0.6436624526977539, | |
| "epoch": 0.22546161321671526, | |
| "grad_norm": 0.02592352218925953, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6487458944320679, | |
| "mean_token_accuracy": 0.7412822172045708, | |
| "num_tokens": 1083139.0, | |
| "step": 29 | |
| }, | |
| { | |
| "entropy": 0.653114914894104, | |
| "epoch": 0.23323615160349853, | |
| "grad_norm": 0.018322035670280457, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6511994004249573, | |
| "mean_token_accuracy": 0.7411110699176788, | |
| "num_tokens": 1120783.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 0.642485961318016, | |
| "epoch": 0.24101068999028183, | |
| "grad_norm": 0.021689819172024727, | |
| "learning_rate": 0.0002, | |
| "loss": 0.644116222858429, | |
| "mean_token_accuracy": 0.7440010756254196, | |
| "num_tokens": 1158207.0, | |
| "step": 31 | |
| }, | |
| { | |
| "entropy": 0.6343450918793678, | |
| "epoch": 0.2487852283770651, | |
| "grad_norm": 0.02071012370288372, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6319076418876648, | |
| "mean_token_accuracy": 0.7487388849258423, | |
| "num_tokens": 1195845.0, | |
| "step": 32 | |
| }, | |
| { | |
| "entropy": 0.6410091295838356, | |
| "epoch": 0.2565597667638484, | |
| "grad_norm": 0.025183040648698807, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6358401775360107, | |
| "mean_token_accuracy": 0.7465788945555687, | |
| "num_tokens": 1233366.0, | |
| "step": 33 | |
| }, | |
| { | |
| "entropy": 0.6519959643483162, | |
| "epoch": 0.26433430515063167, | |
| "grad_norm": 0.017367947846651077, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6433607339859009, | |
| "mean_token_accuracy": 0.7429918646812439, | |
| "num_tokens": 1270710.0, | |
| "step": 34 | |
| }, | |
| { | |
| "entropy": 0.6490929946303368, | |
| "epoch": 0.272108843537415, | |
| "grad_norm": 0.023137487471103668, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6468774676322937, | |
| "mean_token_accuracy": 0.7406889051198959, | |
| "num_tokens": 1308095.0, | |
| "step": 35 | |
| }, | |
| { | |
| "entropy": 0.6438097059726715, | |
| "epoch": 0.27988338192419826, | |
| "grad_norm": 0.016993502154946327, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6424656510353088, | |
| "mean_token_accuracy": 0.7413171753287315, | |
| "num_tokens": 1345646.0, | |
| "step": 36 | |
| }, | |
| { | |
| "entropy": 0.6314259544014931, | |
| "epoch": 0.28765792031098153, | |
| "grad_norm": 0.016146596521139145, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6370364427566528, | |
| "mean_token_accuracy": 0.7465247958898544, | |
| "num_tokens": 1382928.0, | |
| "step": 37 | |
| }, | |
| { | |
| "entropy": 0.6270746886730194, | |
| "epoch": 0.2954324586977648, | |
| "grad_norm": 0.019162772223353386, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6330348253250122, | |
| "mean_token_accuracy": 0.747043713927269, | |
| "num_tokens": 1420089.0, | |
| "step": 38 | |
| }, | |
| { | |
| "entropy": 0.6293222159147263, | |
| "epoch": 0.3032069970845481, | |
| "grad_norm": 0.01702946238219738, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6317635178565979, | |
| "mean_token_accuracy": 0.7488930821418762, | |
| "num_tokens": 1457216.0, | |
| "step": 39 | |
| }, | |
| { | |
| "entropy": 0.6111311987042427, | |
| "epoch": 0.3109815354713314, | |
| "grad_norm": 0.015137894079089165, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6177330017089844, | |
| "mean_token_accuracy": 0.753462478518486, | |
| "num_tokens": 1494415.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 0.6119553595781326, | |
| "epoch": 0.31875607385811466, | |
| "grad_norm": 0.014271042309701443, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6184912919998169, | |
| "mean_token_accuracy": 0.7530097812414169, | |
| "num_tokens": 1531665.0, | |
| "step": 41 | |
| }, | |
| { | |
| "entropy": 0.627587340772152, | |
| "epoch": 0.32653061224489793, | |
| "grad_norm": 0.01676957495510578, | |
| "learning_rate": 0.0002, | |
| "loss": 0.628797173500061, | |
| "mean_token_accuracy": 0.7489041686058044, | |
| "num_tokens": 1568905.0, | |
| "step": 42 | |
| }, | |
| { | |
| "entropy": 0.6380143910646439, | |
| "epoch": 0.33430515063168126, | |
| "grad_norm": 0.013997296802699566, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6401110291481018, | |
| "mean_token_accuracy": 0.7437692731618881, | |
| "num_tokens": 1606022.0, | |
| "step": 43 | |
| }, | |
| { | |
| "entropy": 0.6236186027526855, | |
| "epoch": 0.34207968901846453, | |
| "grad_norm": 0.013737027533352375, | |
| "learning_rate": 0.0002, | |
| "loss": 0.622249960899353, | |
| "mean_token_accuracy": 0.7506565973162651, | |
| "num_tokens": 1643817.0, | |
| "step": 44 | |
| }, | |
| { | |
| "entropy": 0.6351634711027145, | |
| "epoch": 0.3498542274052478, | |
| "grad_norm": 0.013750840909779072, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6342694163322449, | |
| "mean_token_accuracy": 0.7469271644949913, | |
| "num_tokens": 1681417.0, | |
| "step": 45 | |
| }, | |
| { | |
| "entropy": 0.6226040348410606, | |
| "epoch": 0.3576287657920311, | |
| "grad_norm": 0.015259931795299053, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6237019896507263, | |
| "mean_token_accuracy": 0.7505070269107819, | |
| "num_tokens": 1718574.0, | |
| "step": 46 | |
| }, | |
| { | |
| "entropy": 0.6210184469819069, | |
| "epoch": 0.3654033041788144, | |
| "grad_norm": 0.013225192204117775, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6187986135482788, | |
| "mean_token_accuracy": 0.7520730867981911, | |
| "num_tokens": 1756095.0, | |
| "step": 47 | |
| }, | |
| { | |
| "entropy": 0.6205598041415215, | |
| "epoch": 0.37317784256559766, | |
| "grad_norm": 0.012887167744338512, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6181526780128479, | |
| "mean_token_accuracy": 0.7511478438973427, | |
| "num_tokens": 1793392.0, | |
| "step": 48 | |
| }, | |
| { | |
| "entropy": 0.629549115896225, | |
| "epoch": 0.38095238095238093, | |
| "grad_norm": 0.013227855786681175, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6304742097854614, | |
| "mean_token_accuracy": 0.7472723796963692, | |
| "num_tokens": 1830606.0, | |
| "step": 49 | |
| }, | |
| { | |
| "entropy": 0.6296898201107979, | |
| "epoch": 0.38872691933916426, | |
| "grad_norm": 0.015021155588328838, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6288135647773743, | |
| "mean_token_accuracy": 0.7465364933013916, | |
| "num_tokens": 1868232.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 0.6357625275850296, | |
| "epoch": 0.3965014577259475, | |
| "grad_norm": 0.011794226244091988, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6371973156929016, | |
| "mean_token_accuracy": 0.7450965940952301, | |
| "num_tokens": 1905598.0, | |
| "step": 51 | |
| }, | |
| { | |
| "entropy": 0.6295278668403625, | |
| "epoch": 0.4042759961127308, | |
| "grad_norm": 0.012368254363536835, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6367925405502319, | |
| "mean_token_accuracy": 0.7448450028896332, | |
| "num_tokens": 1942785.0, | |
| "step": 52 | |
| }, | |
| { | |
| "entropy": 0.6321664452552795, | |
| "epoch": 0.41205053449951407, | |
| "grad_norm": 0.011660202406346798, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6337926983833313, | |
| "mean_token_accuracy": 0.7433984354138374, | |
| "num_tokens": 1980646.0, | |
| "step": 53 | |
| }, | |
| { | |
| "entropy": 0.6304126009345055, | |
| "epoch": 0.4198250728862974, | |
| "grad_norm": 0.012000083923339844, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6315821409225464, | |
| "mean_token_accuracy": 0.7455745488405228, | |
| "num_tokens": 2018148.0, | |
| "step": 54 | |
| }, | |
| { | |
| "entropy": 0.6312398687005043, | |
| "epoch": 0.42759961127308066, | |
| "grad_norm": 0.012478172779083252, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6293996572494507, | |
| "mean_token_accuracy": 0.7464256510138512, | |
| "num_tokens": 2055123.0, | |
| "step": 55 | |
| }, | |
| { | |
| "entropy": 0.6144075095653534, | |
| "epoch": 0.43537414965986393, | |
| "grad_norm": 0.010203132405877113, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6101412773132324, | |
| "mean_token_accuracy": 0.7551510035991669, | |
| "num_tokens": 2092759.0, | |
| "step": 56 | |
| }, | |
| { | |
| "entropy": 0.6334135234355927, | |
| "epoch": 0.44314868804664725, | |
| "grad_norm": 0.012491037137806416, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6366456747055054, | |
| "mean_token_accuracy": 0.7441563606262207, | |
| "num_tokens": 2130468.0, | |
| "step": 57 | |
| }, | |
| { | |
| "entropy": 0.6204067915678024, | |
| "epoch": 0.4509232264334305, | |
| "grad_norm": 0.012662500143051147, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6225067377090454, | |
| "mean_token_accuracy": 0.7498065009713173, | |
| "num_tokens": 2167896.0, | |
| "step": 58 | |
| }, | |
| { | |
| "entropy": 0.626205176115036, | |
| "epoch": 0.4586977648202138, | |
| "grad_norm": 0.011919913813471794, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6297718286514282, | |
| "mean_token_accuracy": 0.7457590103149414, | |
| "num_tokens": 2204991.0, | |
| "step": 59 | |
| }, | |
| { | |
| "entropy": 0.6314920708537102, | |
| "epoch": 0.46647230320699706, | |
| "grad_norm": 0.011844294145703316, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6283063888549805, | |
| "mean_token_accuracy": 0.7473507225513458, | |
| "num_tokens": 2242421.0, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 0.629265584051609, | |
| "epoch": 0.4742468415937804, | |
| "grad_norm": 0.012998970225453377, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6303939819335938, | |
| "mean_token_accuracy": 0.7454146966338158, | |
| "num_tokens": 2279756.0, | |
| "step": 61 | |
| }, | |
| { | |
| "entropy": 0.6266416981816292, | |
| "epoch": 0.48202137998056366, | |
| "grad_norm": 0.010719172656536102, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6256165504455566, | |
| "mean_token_accuracy": 0.7477178424596786, | |
| "num_tokens": 2317119.0, | |
| "step": 62 | |
| }, | |
| { | |
| "entropy": 0.6031938791275024, | |
| "epoch": 0.4897959183673469, | |
| "grad_norm": 0.011259288527071476, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5979391932487488, | |
| "mean_token_accuracy": 0.7593775168061256, | |
| "num_tokens": 2354598.0, | |
| "step": 63 | |
| }, | |
| { | |
| "entropy": 0.6359111741185188, | |
| "epoch": 0.4975704567541302, | |
| "grad_norm": 0.01182929240167141, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6360020041465759, | |
| "mean_token_accuracy": 0.7429406046867371, | |
| "num_tokens": 2391824.0, | |
| "step": 64 | |
| }, | |
| { | |
| "entropy": 0.6270973086357117, | |
| "epoch": 0.5053449951409135, | |
| "grad_norm": 0.01080579124391079, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6288405060768127, | |
| "mean_token_accuracy": 0.7458023801445961, | |
| "num_tokens": 2428949.0, | |
| "step": 65 | |
| }, | |
| { | |
| "entropy": 0.6371860653162003, | |
| "epoch": 0.5131195335276968, | |
| "grad_norm": 0.012401307933032513, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6441806554794312, | |
| "mean_token_accuracy": 0.7399793341755867, | |
| "num_tokens": 2466079.0, | |
| "step": 66 | |
| }, | |
| { | |
| "entropy": 0.6057624816894531, | |
| "epoch": 0.5208940719144801, | |
| "grad_norm": 0.012216067872941494, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6104533672332764, | |
| "mean_token_accuracy": 0.754143625497818, | |
| "num_tokens": 2503686.0, | |
| "step": 67 | |
| }, | |
| { | |
| "entropy": 0.6143222749233246, | |
| "epoch": 0.5286686103012633, | |
| "grad_norm": 0.010598300956189632, | |
| "learning_rate": 0.0002, | |
| "loss": 0.617759108543396, | |
| "mean_token_accuracy": 0.7507391050457954, | |
| "num_tokens": 2541428.0, | |
| "step": 68 | |
| }, | |
| { | |
| "entropy": 0.6160529032349586, | |
| "epoch": 0.5364431486880467, | |
| "grad_norm": 0.010992376133799553, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6156395673751831, | |
| "mean_token_accuracy": 0.7503774240612984, | |
| "num_tokens": 2578762.0, | |
| "step": 69 | |
| }, | |
| { | |
| "entropy": 0.6199713721871376, | |
| "epoch": 0.54421768707483, | |
| "grad_norm": 0.01134777907282114, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6140978932380676, | |
| "mean_token_accuracy": 0.7530878558754921, | |
| "num_tokens": 2616254.0, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 0.6425308436155319, | |
| "epoch": 0.5519922254616132, | |
| "grad_norm": 0.011413667351007462, | |
| "learning_rate": 0.0002, | |
| "loss": 0.63960862159729, | |
| "mean_token_accuracy": 0.7409021556377411, | |
| "num_tokens": 2653615.0, | |
| "step": 71 | |
| }, | |
| { | |
| "entropy": 0.6269439905881882, | |
| "epoch": 0.5597667638483965, | |
| "grad_norm": 0.011452693492174149, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6268940567970276, | |
| "mean_token_accuracy": 0.7482407689094543, | |
| "num_tokens": 2691144.0, | |
| "step": 72 | |
| }, | |
| { | |
| "entropy": 0.6223431453108788, | |
| "epoch": 0.5675413022351797, | |
| "grad_norm": 0.011051226407289505, | |
| "learning_rate": 0.0002, | |
| "loss": 0.627192497253418, | |
| "mean_token_accuracy": 0.7496485412120819, | |
| "num_tokens": 2728868.0, | |
| "step": 73 | |
| }, | |
| { | |
| "entropy": 0.6142039522528648, | |
| "epoch": 0.5753158406219631, | |
| "grad_norm": 0.010462508536875248, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6176329851150513, | |
| "mean_token_accuracy": 0.7508676871657372, | |
| "num_tokens": 2766300.0, | |
| "step": 74 | |
| }, | |
| { | |
| "entropy": 0.6121213287115097, | |
| "epoch": 0.5830903790087464, | |
| "grad_norm": 0.01290794089436531, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6207513809204102, | |
| "mean_token_accuracy": 0.7499961778521538, | |
| "num_tokens": 2803656.0, | |
| "step": 75 | |
| }, | |
| { | |
| "entropy": 0.6135914027690887, | |
| "epoch": 0.5908649173955296, | |
| "grad_norm": 0.009645558893680573, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6158081293106079, | |
| "mean_token_accuracy": 0.7523107752203941, | |
| "num_tokens": 2841367.0, | |
| "step": 76 | |
| }, | |
| { | |
| "entropy": 0.6079287081956863, | |
| "epoch": 0.5986394557823129, | |
| "grad_norm": 0.010133286938071251, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6089348196983337, | |
| "mean_token_accuracy": 0.7539728805422783, | |
| "num_tokens": 2878743.0, | |
| "step": 77 | |
| }, | |
| { | |
| "entropy": 0.619053803384304, | |
| "epoch": 0.6064139941690962, | |
| "grad_norm": 0.011026635766029358, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6179240942001343, | |
| "mean_token_accuracy": 0.752836562693119, | |
| "num_tokens": 2916083.0, | |
| "step": 78 | |
| }, | |
| { | |
| "entropy": 0.6179199442267418, | |
| "epoch": 0.6141885325558795, | |
| "grad_norm": 0.009910841472446918, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6233879923820496, | |
| "mean_token_accuracy": 0.7482481822371483, | |
| "num_tokens": 2953599.0, | |
| "step": 79 | |
| }, | |
| { | |
| "entropy": 0.6186161413788795, | |
| "epoch": 0.6219630709426628, | |
| "grad_norm": 0.00901505071669817, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6190614700317383, | |
| "mean_token_accuracy": 0.7501069083809853, | |
| "num_tokens": 2990903.0, | |
| "step": 80 | |
| }, | |
| { | |
| "entropy": 0.6112105250358582, | |
| "epoch": 0.6297376093294461, | |
| "grad_norm": 0.011348889209330082, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6137362718582153, | |
| "mean_token_accuracy": 0.7515707835555077, | |
| "num_tokens": 3028013.0, | |
| "step": 81 | |
| }, | |
| { | |
| "entropy": 0.631052277982235, | |
| "epoch": 0.6375121477162293, | |
| "grad_norm": 0.012229959480464458, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6278471946716309, | |
| "mean_token_accuracy": 0.7475830912590027, | |
| "num_tokens": 3065444.0, | |
| "step": 82 | |
| }, | |
| { | |
| "entropy": 0.6256950199604034, | |
| "epoch": 0.6452866861030127, | |
| "grad_norm": 0.009951086714863777, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6218305826187134, | |
| "mean_token_accuracy": 0.7465297132730484, | |
| "num_tokens": 3102683.0, | |
| "step": 83 | |
| }, | |
| { | |
| "entropy": 0.6196548789739609, | |
| "epoch": 0.6530612244897959, | |
| "grad_norm": 0.010236121714115143, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6180955767631531, | |
| "mean_token_accuracy": 0.7518158033490181, | |
| "num_tokens": 3140271.0, | |
| "step": 84 | |
| }, | |
| { | |
| "entropy": 0.6243495345115662, | |
| "epoch": 0.6608357628765792, | |
| "grad_norm": 0.011498089879751205, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6245218515396118, | |
| "mean_token_accuracy": 0.7478918880224228, | |
| "num_tokens": 3177703.0, | |
| "step": 85 | |
| }, | |
| { | |
| "entropy": 0.619852252304554, | |
| "epoch": 0.6686103012633625, | |
| "grad_norm": 0.009944644756615162, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6247724294662476, | |
| "mean_token_accuracy": 0.7476306930184364, | |
| "num_tokens": 3215349.0, | |
| "step": 86 | |
| }, | |
| { | |
| "entropy": 0.6298213005065918, | |
| "epoch": 0.6763848396501457, | |
| "grad_norm": 0.009104517288506031, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6307124495506287, | |
| "mean_token_accuracy": 0.7444773614406586, | |
| "num_tokens": 3252965.0, | |
| "step": 87 | |
| }, | |
| { | |
| "entropy": 0.617066778242588, | |
| "epoch": 0.6841593780369291, | |
| "grad_norm": 0.009981841780245304, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6200389862060547, | |
| "mean_token_accuracy": 0.7506762072443962, | |
| "num_tokens": 3290319.0, | |
| "step": 88 | |
| }, | |
| { | |
| "entropy": 0.6173762008547783, | |
| "epoch": 0.6919339164237124, | |
| "grad_norm": 0.010542662814259529, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6204540729522705, | |
| "mean_token_accuracy": 0.7490114718675613, | |
| "num_tokens": 3328270.0, | |
| "step": 89 | |
| }, | |
| { | |
| "entropy": 0.6311885267496109, | |
| "epoch": 0.6997084548104956, | |
| "grad_norm": 0.009542804211378098, | |
| "learning_rate": 0.0002, | |
| "loss": 0.630376935005188, | |
| "mean_token_accuracy": 0.7458378821611404, | |
| "num_tokens": 3365973.0, | |
| "step": 90 | |
| }, | |
| { | |
| "entropy": 0.6197073757648468, | |
| "epoch": 0.7074829931972789, | |
| "grad_norm": 0.009216145612299442, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6229982376098633, | |
| "mean_token_accuracy": 0.7472847774624825, | |
| "num_tokens": 3403209.0, | |
| "step": 91 | |
| }, | |
| { | |
| "entropy": 0.6161768138408661, | |
| "epoch": 0.7152575315840622, | |
| "grad_norm": 0.0102296257391572, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6171408891677856, | |
| "mean_token_accuracy": 0.7507107704877853, | |
| "num_tokens": 3440047.0, | |
| "step": 92 | |
| }, | |
| { | |
| "entropy": 0.6355379894375801, | |
| "epoch": 0.7230320699708455, | |
| "grad_norm": 0.011433378793299198, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6368508338928223, | |
| "mean_token_accuracy": 0.7425181716680527, | |
| "num_tokens": 3477583.0, | |
| "step": 93 | |
| }, | |
| { | |
| "entropy": 0.6173990294337273, | |
| "epoch": 0.7308066083576288, | |
| "grad_norm": 0.009371397085487843, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6161597371101379, | |
| "mean_token_accuracy": 0.752352699637413, | |
| "num_tokens": 3515443.0, | |
| "step": 94 | |
| }, | |
| { | |
| "entropy": 0.6139659285545349, | |
| "epoch": 0.738581146744412, | |
| "grad_norm": 0.00992497242987156, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6122086644172668, | |
| "mean_token_accuracy": 0.7519859671592712, | |
| "num_tokens": 3552895.0, | |
| "step": 95 | |
| }, | |
| { | |
| "entropy": 0.6270382553339005, | |
| "epoch": 0.7463556851311953, | |
| "grad_norm": 0.009038747288286686, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6263892650604248, | |
| "mean_token_accuracy": 0.7476321458816528, | |
| "num_tokens": 3590558.0, | |
| "step": 96 | |
| }, | |
| { | |
| "entropy": 0.6252292916178703, | |
| "epoch": 0.7541302235179786, | |
| "grad_norm": 0.008724549785256386, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6235740184783936, | |
| "mean_token_accuracy": 0.7499061301350594, | |
| "num_tokens": 3628009.0, | |
| "step": 97 | |
| }, | |
| { | |
| "entropy": 0.6164776980876923, | |
| "epoch": 0.7619047619047619, | |
| "grad_norm": 0.009640969336032867, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6190721988677979, | |
| "mean_token_accuracy": 0.7499102726578712, | |
| "num_tokens": 3665592.0, | |
| "step": 98 | |
| }, | |
| { | |
| "entropy": 0.6058400347828865, | |
| "epoch": 0.7696793002915452, | |
| "grad_norm": 0.010068013332784176, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6085440516471863, | |
| "mean_token_accuracy": 0.7550365477800369, | |
| "num_tokens": 3702702.0, | |
| "step": 99 | |
| }, | |
| { | |
| "entropy": 0.6062669232487679, | |
| "epoch": 0.7774538386783285, | |
| "grad_norm": 0.009750640951097012, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6106675267219543, | |
| "mean_token_accuracy": 0.753579393029213, | |
| "num_tokens": 3739974.0, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 0.6228908747434616, | |
| "epoch": 0.7852283770651117, | |
| "grad_norm": 0.010727898217737675, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6273207664489746, | |
| "mean_token_accuracy": 0.7462224960327148, | |
| "num_tokens": 3777563.0, | |
| "step": 101 | |
| }, | |
| { | |
| "entropy": 0.623473547399044, | |
| "epoch": 0.793002915451895, | |
| "grad_norm": 0.00916969496756792, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6267216205596924, | |
| "mean_token_accuracy": 0.7489331811666489, | |
| "num_tokens": 3815209.0, | |
| "step": 102 | |
| }, | |
| { | |
| "entropy": 0.6183424741029739, | |
| "epoch": 0.8007774538386784, | |
| "grad_norm": 0.009042995050549507, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6215161681175232, | |
| "mean_token_accuracy": 0.7501572594046593, | |
| "num_tokens": 3853109.0, | |
| "step": 103 | |
| }, | |
| { | |
| "entropy": 0.6086031794548035, | |
| "epoch": 0.8085519922254616, | |
| "grad_norm": 0.010368067771196365, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6092633008956909, | |
| "mean_token_accuracy": 0.7548685073852539, | |
| "num_tokens": 3890248.0, | |
| "step": 104 | |
| }, | |
| { | |
| "entropy": 0.6166428253054619, | |
| "epoch": 0.8163265306122449, | |
| "grad_norm": 0.009941854514181614, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6201497316360474, | |
| "mean_token_accuracy": 0.746953047811985, | |
| "num_tokens": 3927797.0, | |
| "step": 105 | |
| }, | |
| { | |
| "entropy": 0.6270147785544395, | |
| "epoch": 0.8241010689990281, | |
| "grad_norm": 0.0085823442786932, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6264973878860474, | |
| "mean_token_accuracy": 0.746023453772068, | |
| "num_tokens": 3965467.0, | |
| "step": 106 | |
| }, | |
| { | |
| "entropy": 0.6165590658783913, | |
| "epoch": 0.8318756073858115, | |
| "grad_norm": 0.009966393932700157, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6136085987091064, | |
| "mean_token_accuracy": 0.7522286921739578, | |
| "num_tokens": 4002647.0, | |
| "step": 107 | |
| }, | |
| { | |
| "entropy": 0.6224516704678535, | |
| "epoch": 0.8396501457725948, | |
| "grad_norm": 0.01067335158586502, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6225627660751343, | |
| "mean_token_accuracy": 0.7488038167357445, | |
| "num_tokens": 4039990.0, | |
| "step": 108 | |
| }, | |
| { | |
| "entropy": 0.6210483014583588, | |
| "epoch": 0.847424684159378, | |
| "grad_norm": 0.010811593383550644, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6203762292861938, | |
| "mean_token_accuracy": 0.7501420751214027, | |
| "num_tokens": 4077461.0, | |
| "step": 109 | |
| }, | |
| { | |
| "entropy": 0.6205326095223427, | |
| "epoch": 0.8551992225461613, | |
| "grad_norm": 0.009125830605626106, | |
| "learning_rate": 0.0002, | |
| "loss": 0.623924732208252, | |
| "mean_token_accuracy": 0.7463032528758049, | |
| "num_tokens": 4115100.0, | |
| "step": 110 | |
| }, | |
| { | |
| "entropy": 0.6294923424720764, | |
| "epoch": 0.8629737609329446, | |
| "grad_norm": 0.008677372708916664, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6358845233917236, | |
| "mean_token_accuracy": 0.7433422952890396, | |
| "num_tokens": 4152751.0, | |
| "step": 111 | |
| }, | |
| { | |
| "entropy": 0.615186795592308, | |
| "epoch": 0.8707482993197279, | |
| "grad_norm": 0.012182718142867088, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6257232427597046, | |
| "mean_token_accuracy": 0.7469102591276169, | |
| "num_tokens": 4189807.0, | |
| "step": 112 | |
| }, | |
| { | |
| "entropy": 0.6161832436919212, | |
| "epoch": 0.8785228377065112, | |
| "grad_norm": 0.009921083226799965, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6149104237556458, | |
| "mean_token_accuracy": 0.7501650750637054, | |
| "num_tokens": 4227148.0, | |
| "step": 113 | |
| }, | |
| { | |
| "entropy": 0.6069425120949745, | |
| "epoch": 0.8862973760932945, | |
| "grad_norm": 0.010401617735624313, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6072876453399658, | |
| "mean_token_accuracy": 0.7546068653464317, | |
| "num_tokens": 4264665.0, | |
| "step": 114 | |
| }, | |
| { | |
| "entropy": 0.6115981489419937, | |
| "epoch": 0.8940719144800777, | |
| "grad_norm": 0.009178240783512592, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6142789125442505, | |
| "mean_token_accuracy": 0.7516015693545341, | |
| "num_tokens": 4301705.0, | |
| "step": 115 | |
| }, | |
| { | |
| "entropy": 0.6232319623231888, | |
| "epoch": 0.901846452866861, | |
| "grad_norm": 0.011550409719347954, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6232004165649414, | |
| "mean_token_accuracy": 0.7479738518595695, | |
| "num_tokens": 4339005.0, | |
| "step": 116 | |
| }, | |
| { | |
| "entropy": 0.6050816774368286, | |
| "epoch": 0.9096209912536443, | |
| "grad_norm": 0.009149852208793163, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6073260307312012, | |
| "mean_token_accuracy": 0.7553000226616859, | |
| "num_tokens": 4376492.0, | |
| "step": 117 | |
| }, | |
| { | |
| "entropy": 0.6323671862483025, | |
| "epoch": 0.9173955296404276, | |
| "grad_norm": 0.01042769942432642, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6354271769523621, | |
| "mean_token_accuracy": 0.742473192512989, | |
| "num_tokens": 4414516.0, | |
| "step": 118 | |
| }, | |
| { | |
| "entropy": 0.6279568076133728, | |
| "epoch": 0.9251700680272109, | |
| "grad_norm": 0.009754139930009842, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6289409399032593, | |
| "mean_token_accuracy": 0.7444217056035995, | |
| "num_tokens": 4452210.0, | |
| "step": 119 | |
| }, | |
| { | |
| "entropy": 0.6090738251805305, | |
| "epoch": 0.9329446064139941, | |
| "grad_norm": 0.011155272834002972, | |
| "learning_rate": 0.0002, | |
| "loss": 0.61219322681427, | |
| "mean_token_accuracy": 0.7522945404052734, | |
| "num_tokens": 4489567.0, | |
| "step": 120 | |
| }, | |
| { | |
| "entropy": 0.6002820879220963, | |
| "epoch": 0.9407191448007775, | |
| "grad_norm": 0.009737227112054825, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6018539071083069, | |
| "mean_token_accuracy": 0.757467195391655, | |
| "num_tokens": 4527111.0, | |
| "step": 121 | |
| }, | |
| { | |
| "entropy": 0.6134138256311417, | |
| "epoch": 0.9484936831875608, | |
| "grad_norm": 0.010466666892170906, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6216229200363159, | |
| "mean_token_accuracy": 0.7486356720328331, | |
| "num_tokens": 4564450.0, | |
| "step": 122 | |
| }, | |
| { | |
| "entropy": 0.6079460605978966, | |
| "epoch": 0.956268221574344, | |
| "grad_norm": 0.008756682276725769, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6086549758911133, | |
| "mean_token_accuracy": 0.7539011463522911, | |
| "num_tokens": 4601781.0, | |
| "step": 123 | |
| }, | |
| { | |
| "entropy": 0.612805612385273, | |
| "epoch": 0.9640427599611273, | |
| "grad_norm": 0.009290359914302826, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6137915849685669, | |
| "mean_token_accuracy": 0.752314880490303, | |
| "num_tokens": 4639256.0, | |
| "step": 124 | |
| }, | |
| { | |
| "entropy": 0.6211065128445625, | |
| "epoch": 0.9718172983479106, | |
| "grad_norm": 0.010166316293179989, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6211485266685486, | |
| "mean_token_accuracy": 0.7476831749081612, | |
| "num_tokens": 4676689.0, | |
| "step": 125 | |
| }, | |
| { | |
| "entropy": 0.6219009906053543, | |
| "epoch": 0.9795918367346939, | |
| "grad_norm": 0.009910349734127522, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6177939176559448, | |
| "mean_token_accuracy": 0.7506504207849503, | |
| "num_tokens": 4714123.0, | |
| "step": 126 | |
| }, | |
| { | |
| "entropy": 0.6336647123098373, | |
| "epoch": 0.9873663751214772, | |
| "grad_norm": 0.00899409968405962, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6283681392669678, | |
| "mean_token_accuracy": 0.7467537075281143, | |
| "num_tokens": 4751822.0, | |
| "step": 127 | |
| }, | |
| { | |
| "entropy": 0.6106422170996666, | |
| "epoch": 0.9951409135082604, | |
| "grad_norm": 0.009350291453301907, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6105437278747559, | |
| "mean_token_accuracy": 0.7529440075159073, | |
| "num_tokens": 4789003.0, | |
| "step": 128 | |
| }, | |
| { | |
| "entropy": 0.6007849931716919, | |
| "epoch": 1.0, | |
| "grad_norm": 0.011687238700687885, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6050734519958496, | |
| "mean_token_accuracy": 0.7555755734443664, | |
| "num_tokens": 4812561.0, | |
| "step": 129 | |
| }, | |
| { | |
| "entropy": 0.6145111918449402, | |
| "epoch": 1.0077745383867833, | |
| "grad_norm": 0.00996165256947279, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6200628280639648, | |
| "mean_token_accuracy": 0.7501887455582619, | |
| "num_tokens": 4849863.0, | |
| "step": 130 | |
| }, | |
| { | |
| "entropy": 0.6117109283804893, | |
| "epoch": 1.0155490767735667, | |
| "grad_norm": 0.009831785224378109, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6182730793952942, | |
| "mean_token_accuracy": 0.7466977462172508, | |
| "num_tokens": 4887693.0, | |
| "step": 131 | |
| }, | |
| { | |
| "entropy": 0.6117515116930008, | |
| "epoch": 1.0233236151603498, | |
| "grad_norm": 0.007678937632590532, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6126781105995178, | |
| "mean_token_accuracy": 0.7521011829376221, | |
| "num_tokens": 4925266.0, | |
| "step": 132 | |
| }, | |
| { | |
| "entropy": 0.6145991012454033, | |
| "epoch": 1.031098153547133, | |
| "grad_norm": 0.00878220982849598, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6143695116043091, | |
| "mean_token_accuracy": 0.7531941831111908, | |
| "num_tokens": 4962307.0, | |
| "step": 133 | |
| }, | |
| { | |
| "entropy": 0.6105677559971809, | |
| "epoch": 1.0388726919339164, | |
| "grad_norm": 0.009893382899463177, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6073343753814697, | |
| "mean_token_accuracy": 0.7548379600048065, | |
| "num_tokens": 4999709.0, | |
| "step": 134 | |
| }, | |
| { | |
| "entropy": 0.6226058155298233, | |
| "epoch": 1.0466472303206997, | |
| "grad_norm": 0.01014266349375248, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6212986707687378, | |
| "mean_token_accuracy": 0.7492796331644058, | |
| "num_tokens": 5036991.0, | |
| "step": 135 | |
| }, | |
| { | |
| "entropy": 0.6036651879549026, | |
| "epoch": 1.054421768707483, | |
| "grad_norm": 0.008363187313079834, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6068825721740723, | |
| "mean_token_accuracy": 0.753925733268261, | |
| "num_tokens": 5074058.0, | |
| "step": 136 | |
| }, | |
| { | |
| "entropy": 0.6133922636508942, | |
| "epoch": 1.0621963070942664, | |
| "grad_norm": 0.00871324259787798, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6173220276832581, | |
| "mean_token_accuracy": 0.7509826496243477, | |
| "num_tokens": 5111393.0, | |
| "step": 137 | |
| }, | |
| { | |
| "entropy": 0.622228629887104, | |
| "epoch": 1.0699708454810495, | |
| "grad_norm": 0.010760784149169922, | |
| "learning_rate": 0.0002, | |
| "loss": 0.629308819770813, | |
| "mean_token_accuracy": 0.7456969246268272, | |
| "num_tokens": 5148886.0, | |
| "step": 138 | |
| }, | |
| { | |
| "entropy": 0.6098063141107559, | |
| "epoch": 1.0777453838678328, | |
| "grad_norm": 0.010240385308861732, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6158695220947266, | |
| "mean_token_accuracy": 0.7498040646314621, | |
| "num_tokens": 5186054.0, | |
| "step": 139 | |
| }, | |
| { | |
| "entropy": 0.6184578239917755, | |
| "epoch": 1.0855199222546161, | |
| "grad_norm": 0.010335118509829044, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6153397560119629, | |
| "mean_token_accuracy": 0.7500413805246353, | |
| "num_tokens": 5223497.0, | |
| "step": 140 | |
| }, | |
| { | |
| "entropy": 0.626154899597168, | |
| "epoch": 1.0932944606413995, | |
| "grad_norm": 0.009573339484632015, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6198714971542358, | |
| "mean_token_accuracy": 0.7480529472231865, | |
| "num_tokens": 5261284.0, | |
| "step": 141 | |
| }, | |
| { | |
| "entropy": 0.6239576488733292, | |
| "epoch": 1.1010689990281828, | |
| "grad_norm": 0.01078983023762703, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6222984790802002, | |
| "mean_token_accuracy": 0.7482637241482735, | |
| "num_tokens": 5298391.0, | |
| "step": 142 | |
| }, | |
| { | |
| "entropy": 0.6052972301840782, | |
| "epoch": 1.1088435374149659, | |
| "grad_norm": 0.009443830698728561, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6056097745895386, | |
| "mean_token_accuracy": 0.755977600812912, | |
| "num_tokens": 5335665.0, | |
| "step": 143 | |
| }, | |
| { | |
| "entropy": 0.6082469522953033, | |
| "epoch": 1.1166180758017492, | |
| "grad_norm": 0.008718990720808506, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6119707822799683, | |
| "mean_token_accuracy": 0.7540762051939964, | |
| "num_tokens": 5373467.0, | |
| "step": 144 | |
| }, | |
| { | |
| "entropy": 0.6099165305495262, | |
| "epoch": 1.1243926141885325, | |
| "grad_norm": 0.00886059831827879, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6144919395446777, | |
| "mean_token_accuracy": 0.7509082928299904, | |
| "num_tokens": 5410699.0, | |
| "step": 145 | |
| }, | |
| { | |
| "entropy": 0.606502428650856, | |
| "epoch": 1.1321671525753159, | |
| "grad_norm": 0.009656739421188831, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6092766523361206, | |
| "mean_token_accuracy": 0.7524644657969475, | |
| "num_tokens": 5448145.0, | |
| "step": 146 | |
| }, | |
| { | |
| "entropy": 0.6240331009030342, | |
| "epoch": 1.1399416909620992, | |
| "grad_norm": 0.009215152822434902, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6283767819404602, | |
| "mean_token_accuracy": 0.7434803545475006, | |
| "num_tokens": 5485424.0, | |
| "step": 147 | |
| }, | |
| { | |
| "entropy": 0.6154414415359497, | |
| "epoch": 1.1477162293488825, | |
| "grad_norm": 0.009418639354407787, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6141241192817688, | |
| "mean_token_accuracy": 0.752318486571312, | |
| "num_tokens": 5522963.0, | |
| "step": 148 | |
| }, | |
| { | |
| "entropy": 0.6115295439958572, | |
| "epoch": 1.1554907677356656, | |
| "grad_norm": 0.008995896205306053, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6093723773956299, | |
| "mean_token_accuracy": 0.7540601193904877, | |
| "num_tokens": 5560173.0, | |
| "step": 149 | |
| }, | |
| { | |
| "entropy": 0.6168172955513, | |
| "epoch": 1.163265306122449, | |
| "grad_norm": 0.007887676358222961, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6149598360061646, | |
| "mean_token_accuracy": 0.7500165104866028, | |
| "num_tokens": 5597781.0, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 0.6069798469543457, | |
| "epoch": 1.1710398445092323, | |
| "grad_norm": 0.008911027573049068, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6064385771751404, | |
| "mean_token_accuracy": 0.7551223114132881, | |
| "num_tokens": 5635360.0, | |
| "step": 151 | |
| }, | |
| { | |
| "entropy": 0.6170337721705437, | |
| "epoch": 1.1788143828960156, | |
| "grad_norm": 0.008784991689026356, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6199371814727783, | |
| "mean_token_accuracy": 0.7501093670725822, | |
| "num_tokens": 5673236.0, | |
| "step": 152 | |
| }, | |
| { | |
| "entropy": 0.6042322665452957, | |
| "epoch": 1.186588921282799, | |
| "grad_norm": 0.008859240449965, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6099147200584412, | |
| "mean_token_accuracy": 0.7529143393039703, | |
| "num_tokens": 5710364.0, | |
| "step": 153 | |
| }, | |
| { | |
| "entropy": 0.6032149121165276, | |
| "epoch": 1.194363459669582, | |
| "grad_norm": 0.008698609657585621, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6091040372848511, | |
| "mean_token_accuracy": 0.7545271888375282, | |
| "num_tokens": 5747783.0, | |
| "step": 154 | |
| }, | |
| { | |
| "entropy": 0.5934446603059769, | |
| "epoch": 1.2021379980563653, | |
| "grad_norm": 0.009365703910589218, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6000581979751587, | |
| "mean_token_accuracy": 0.7570822536945343, | |
| "num_tokens": 5784550.0, | |
| "step": 155 | |
| }, | |
| { | |
| "entropy": 0.6240461468696594, | |
| "epoch": 1.2099125364431487, | |
| "grad_norm": 0.00959563348442316, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6229224801063538, | |
| "mean_token_accuracy": 0.7504049837589264, | |
| "num_tokens": 5822051.0, | |
| "step": 156 | |
| }, | |
| { | |
| "entropy": 0.6372882649302483, | |
| "epoch": 1.217687074829932, | |
| "grad_norm": 0.008253706619143486, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6363227367401123, | |
| "mean_token_accuracy": 0.7415706738829613, | |
| "num_tokens": 5859606.0, | |
| "step": 157 | |
| }, | |
| { | |
| "entropy": 0.6115364283323288, | |
| "epoch": 1.2254616132167153, | |
| "grad_norm": 0.009423714131116867, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6082147359848022, | |
| "mean_token_accuracy": 0.7525753974914551, | |
| "num_tokens": 5897144.0, | |
| "step": 158 | |
| }, | |
| { | |
| "entropy": 0.6259980425238609, | |
| "epoch": 1.2332361516034984, | |
| "grad_norm": 0.008684671483933926, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6272211074829102, | |
| "mean_token_accuracy": 0.7443205043673515, | |
| "num_tokens": 5934271.0, | |
| "step": 159 | |
| }, | |
| { | |
| "entropy": 0.6230324283242226, | |
| "epoch": 1.2410106899902817, | |
| "grad_norm": 0.008543766103684902, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6271595358848572, | |
| "mean_token_accuracy": 0.7448511347174644, | |
| "num_tokens": 5971696.0, | |
| "step": 160 | |
| }, | |
| { | |
| "entropy": 0.6094089895486832, | |
| "epoch": 1.248785228377065, | |
| "grad_norm": 0.008484925143420696, | |
| "learning_rate": 0.0002, | |
| "loss": 0.611902117729187, | |
| "mean_token_accuracy": 0.751502238214016, | |
| "num_tokens": 6009264.0, | |
| "step": 161 | |
| }, | |
| { | |
| "entropy": 0.6298199594020844, | |
| "epoch": 1.2565597667638484, | |
| "grad_norm": 0.009336225688457489, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6334519386291504, | |
| "mean_token_accuracy": 0.7432255297899246, | |
| "num_tokens": 6046764.0, | |
| "step": 162 | |
| }, | |
| { | |
| "entropy": 0.6082314997911453, | |
| "epoch": 1.2643343051506317, | |
| "grad_norm": 0.008643310517072678, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6062188148498535, | |
| "mean_token_accuracy": 0.7549923211336136, | |
| "num_tokens": 6084129.0, | |
| "step": 163 | |
| }, | |
| { | |
| "entropy": 0.6305336207151413, | |
| "epoch": 1.272108843537415, | |
| "grad_norm": 0.009341283701360226, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6319139003753662, | |
| "mean_token_accuracy": 0.7440996170043945, | |
| "num_tokens": 6121588.0, | |
| "step": 164 | |
| }, | |
| { | |
| "entropy": 0.6267635151743889, | |
| "epoch": 1.2798833819241984, | |
| "grad_norm": 0.00801732949912548, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6295123100280762, | |
| "mean_token_accuracy": 0.7461825907230377, | |
| "num_tokens": 6158885.0, | |
| "step": 165 | |
| }, | |
| { | |
| "entropy": 0.6146969944238663, | |
| "epoch": 1.2876579203109815, | |
| "grad_norm": 0.009981551207602024, | |
| "learning_rate": 0.0002, | |
| "loss": 0.611693263053894, | |
| "mean_token_accuracy": 0.7518708109855652, | |
| "num_tokens": 6196224.0, | |
| "step": 166 | |
| }, | |
| { | |
| "entropy": 0.61357232183218, | |
| "epoch": 1.2954324586977648, | |
| "grad_norm": 0.009115675464272499, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6161482930183411, | |
| "mean_token_accuracy": 0.7504228800535202, | |
| "num_tokens": 6233989.0, | |
| "step": 167 | |
| }, | |
| { | |
| "entropy": 0.6055504828691483, | |
| "epoch": 1.3032069970845481, | |
| "grad_norm": 0.009081711992621422, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6060025691986084, | |
| "mean_token_accuracy": 0.7522977739572525, | |
| "num_tokens": 6271394.0, | |
| "step": 168 | |
| }, | |
| { | |
| "entropy": 0.6105418056249619, | |
| "epoch": 1.3109815354713314, | |
| "grad_norm": 0.009730422869324684, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6106258630752563, | |
| "mean_token_accuracy": 0.753718800842762, | |
| "num_tokens": 6308814.0, | |
| "step": 169 | |
| }, | |
| { | |
| "entropy": 0.6137099266052246, | |
| "epoch": 1.3187560738581148, | |
| "grad_norm": 0.009750008583068848, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6176519393920898, | |
| "mean_token_accuracy": 0.7496867552399635, | |
| "num_tokens": 6346282.0, | |
| "step": 170 | |
| }, | |
| { | |
| "entropy": 0.6076096817851067, | |
| "epoch": 1.3265306122448979, | |
| "grad_norm": 0.00966191291809082, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6177955865859985, | |
| "mean_token_accuracy": 0.7480223625898361, | |
| "num_tokens": 6383602.0, | |
| "step": 171 | |
| }, | |
| { | |
| "entropy": 0.6195629611611366, | |
| "epoch": 1.3343051506316812, | |
| "grad_norm": 0.008418413810431957, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6202820539474487, | |
| "mean_token_accuracy": 0.7488253712654114, | |
| "num_tokens": 6421035.0, | |
| "step": 172 | |
| }, | |
| { | |
| "entropy": 0.6313579976558685, | |
| "epoch": 1.3420796890184645, | |
| "grad_norm": 0.009207581169903278, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6277562379837036, | |
| "mean_token_accuracy": 0.7459008172154427, | |
| "num_tokens": 6458322.0, | |
| "step": 173 | |
| }, | |
| { | |
| "entropy": 0.6184266805648804, | |
| "epoch": 1.3498542274052479, | |
| "grad_norm": 0.009536071680486202, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6161496639251709, | |
| "mean_token_accuracy": 0.7486988604068756, | |
| "num_tokens": 6495621.0, | |
| "step": 174 | |
| }, | |
| { | |
| "entropy": 0.6189115419983864, | |
| "epoch": 1.3576287657920312, | |
| "grad_norm": 0.0097253592684865, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6185729503631592, | |
| "mean_token_accuracy": 0.7469287514686584, | |
| "num_tokens": 6532892.0, | |
| "step": 175 | |
| }, | |
| { | |
| "entropy": 0.6204129755496979, | |
| "epoch": 1.3654033041788143, | |
| "grad_norm": 0.008999030105769634, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6241609454154968, | |
| "mean_token_accuracy": 0.7467619553208351, | |
| "num_tokens": 6570420.0, | |
| "step": 176 | |
| }, | |
| { | |
| "entropy": 0.6034655645489693, | |
| "epoch": 1.3731778425655976, | |
| "grad_norm": 0.009542280808091164, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6092945337295532, | |
| "mean_token_accuracy": 0.7532089725136757, | |
| "num_tokens": 6607782.0, | |
| "step": 177 | |
| }, | |
| { | |
| "entropy": 0.5901695042848587, | |
| "epoch": 1.380952380952381, | |
| "grad_norm": 0.009766815230250359, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5972245335578918, | |
| "mean_token_accuracy": 0.7562905699014664, | |
| "num_tokens": 6644876.0, | |
| "step": 178 | |
| }, | |
| { | |
| "entropy": 0.6139540746808052, | |
| "epoch": 1.3887269193391643, | |
| "grad_norm": 0.00885457918047905, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6145105361938477, | |
| "mean_token_accuracy": 0.7494652420282364, | |
| "num_tokens": 6682153.0, | |
| "step": 179 | |
| }, | |
| { | |
| "entropy": 0.6128789633512497, | |
| "epoch": 1.3965014577259476, | |
| "grad_norm": 0.008380657061934471, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6103215217590332, | |
| "mean_token_accuracy": 0.7528893128037453, | |
| "num_tokens": 6719589.0, | |
| "step": 180 | |
| }, | |
| { | |
| "entropy": 0.6158252954483032, | |
| "epoch": 1.4042759961127307, | |
| "grad_norm": 0.008612860925495625, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6157952547073364, | |
| "mean_token_accuracy": 0.7490102499723434, | |
| "num_tokens": 6757256.0, | |
| "step": 181 | |
| }, | |
| { | |
| "entropy": 0.6120009869337082, | |
| "epoch": 1.412050534499514, | |
| "grad_norm": 0.008242498151957989, | |
| "learning_rate": 0.0002, | |
| "loss": 0.610822319984436, | |
| "mean_token_accuracy": 0.7527074217796326, | |
| "num_tokens": 6794427.0, | |
| "step": 182 | |
| }, | |
| { | |
| "entropy": 0.607716366648674, | |
| "epoch": 1.4198250728862973, | |
| "grad_norm": 0.00903896614909172, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6105165481567383, | |
| "mean_token_accuracy": 0.7544176280498505, | |
| "num_tokens": 6831592.0, | |
| "step": 183 | |
| }, | |
| { | |
| "entropy": 0.6083493009209633, | |
| "epoch": 1.4275996112730807, | |
| "grad_norm": 0.007915884256362915, | |
| "learning_rate": 0.0002, | |
| "loss": 0.611156165599823, | |
| "mean_token_accuracy": 0.7522151321172714, | |
| "num_tokens": 6869182.0, | |
| "step": 184 | |
| }, | |
| { | |
| "entropy": 0.6225397288799286, | |
| "epoch": 1.435374149659864, | |
| "grad_norm": 0.009225807152688503, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6281070709228516, | |
| "mean_token_accuracy": 0.7460536956787109, | |
| "num_tokens": 6906740.0, | |
| "step": 185 | |
| }, | |
| { | |
| "entropy": 0.6144149005413055, | |
| "epoch": 1.4431486880466473, | |
| "grad_norm": 0.010468881577253342, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6134935617446899, | |
| "mean_token_accuracy": 0.7510944902896881, | |
| "num_tokens": 6944215.0, | |
| "step": 186 | |
| }, | |
| { | |
| "entropy": 0.6219450011849403, | |
| "epoch": 1.4509232264334306, | |
| "grad_norm": 0.008004755713045597, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6226309537887573, | |
| "mean_token_accuracy": 0.7474055960774422, | |
| "num_tokens": 6981266.0, | |
| "step": 187 | |
| }, | |
| { | |
| "entropy": 0.6094852611422539, | |
| "epoch": 1.4586977648202137, | |
| "grad_norm": 0.00825564842671156, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6140962839126587, | |
| "mean_token_accuracy": 0.7508443966507912, | |
| "num_tokens": 7018562.0, | |
| "step": 188 | |
| }, | |
| { | |
| "entropy": 0.6202999800443649, | |
| "epoch": 1.466472303206997, | |
| "grad_norm": 0.00858406163752079, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6255123615264893, | |
| "mean_token_accuracy": 0.744349479675293, | |
| "num_tokens": 7055995.0, | |
| "step": 189 | |
| }, | |
| { | |
| "entropy": 0.620690606534481, | |
| "epoch": 1.4742468415937804, | |
| "grad_norm": 0.008920849300920963, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6179178357124329, | |
| "mean_token_accuracy": 0.7499353438615799, | |
| "num_tokens": 7093265.0, | |
| "step": 190 | |
| }, | |
| { | |
| "entropy": 0.6239896044135094, | |
| "epoch": 1.4820213799805637, | |
| "grad_norm": 0.00956004112958908, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6228440999984741, | |
| "mean_token_accuracy": 0.7463066428899765, | |
| "num_tokens": 7130758.0, | |
| "step": 191 | |
| }, | |
| { | |
| "entropy": 0.6123484745621681, | |
| "epoch": 1.489795918367347, | |
| "grad_norm": 0.009270581416785717, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6113156080245972, | |
| "mean_token_accuracy": 0.752521239221096, | |
| "num_tokens": 7168712.0, | |
| "step": 192 | |
| }, | |
| { | |
| "entropy": 0.616000160574913, | |
| "epoch": 1.4975704567541301, | |
| "grad_norm": 0.010770791210234165, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6215670108795166, | |
| "mean_token_accuracy": 0.7469163537025452, | |
| "num_tokens": 7205815.0, | |
| "step": 193 | |
| }, | |
| { | |
| "entropy": 0.6254132762551308, | |
| "epoch": 1.5053449951409135, | |
| "grad_norm": 0.008934563025832176, | |
| "learning_rate": 0.0002, | |
| "loss": 0.627918541431427, | |
| "mean_token_accuracy": 0.7457368895411491, | |
| "num_tokens": 7243319.0, | |
| "step": 194 | |
| }, | |
| { | |
| "entropy": 0.6185151413083076, | |
| "epoch": 1.5131195335276968, | |
| "grad_norm": 0.008593689650297165, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6180027723312378, | |
| "mean_token_accuracy": 0.7505958154797554, | |
| "num_tokens": 7280988.0, | |
| "step": 195 | |
| }, | |
| { | |
| "entropy": 0.6063526794314384, | |
| "epoch": 1.5208940719144801, | |
| "grad_norm": 0.01172675471752882, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6113625764846802, | |
| "mean_token_accuracy": 0.7508470490574837, | |
| "num_tokens": 7318322.0, | |
| "step": 196 | |
| }, | |
| { | |
| "entropy": 0.6110472977161407, | |
| "epoch": 1.5286686103012634, | |
| "grad_norm": 0.009914939291775227, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6066443920135498, | |
| "mean_token_accuracy": 0.7531256228685379, | |
| "num_tokens": 7355926.0, | |
| "step": 197 | |
| }, | |
| { | |
| "entropy": 0.6154029294848442, | |
| "epoch": 1.5364431486880465, | |
| "grad_norm": 0.008429116569459438, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6149218678474426, | |
| "mean_token_accuracy": 0.7508518844842911, | |
| "num_tokens": 7393433.0, | |
| "step": 198 | |
| }, | |
| { | |
| "entropy": 0.622289851307869, | |
| "epoch": 1.54421768707483, | |
| "grad_norm": 0.06439514458179474, | |
| "learning_rate": 0.0002, | |
| "loss": 0.631239116191864, | |
| "mean_token_accuracy": 0.7464239746332169, | |
| "num_tokens": 7431062.0, | |
| "step": 199 | |
| }, | |
| { | |
| "entropy": 0.619748018682003, | |
| "epoch": 1.5519922254616132, | |
| "grad_norm": 0.014919525012373924, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6189074516296387, | |
| "mean_token_accuracy": 0.7492179349064827, | |
| "num_tokens": 7468637.0, | |
| "step": 200 | |
| }, | |
| { | |
| "entropy": 0.6060447245836258, | |
| "epoch": 1.5597667638483965, | |
| "grad_norm": 0.019268253818154335, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6034001708030701, | |
| "mean_token_accuracy": 0.7538621947169304, | |
| "num_tokens": 7506043.0, | |
| "step": 201 | |
| }, | |
| { | |
| "entropy": 0.6062331944704056, | |
| "epoch": 1.5675413022351798, | |
| "grad_norm": 0.013310298323631287, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6041976809501648, | |
| "mean_token_accuracy": 0.7555137276649475, | |
| "num_tokens": 7543352.0, | |
| "step": 202 | |
| }, | |
| { | |
| "entropy": 0.6137887313961983, | |
| "epoch": 1.575315840621963, | |
| "grad_norm": 0.010207262821495533, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6102935671806335, | |
| "mean_token_accuracy": 0.7525052726268768, | |
| "num_tokens": 7580867.0, | |
| "step": 203 | |
| }, | |
| { | |
| "entropy": 0.6222132593393326, | |
| "epoch": 1.5830903790087465, | |
| "grad_norm": 0.013623848557472229, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6228193044662476, | |
| "mean_token_accuracy": 0.7474973797798157, | |
| "num_tokens": 7618160.0, | |
| "step": 204 | |
| }, | |
| { | |
| "entropy": 0.6147656589746475, | |
| "epoch": 1.5908649173955296, | |
| "grad_norm": 0.011189316399395466, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6171211004257202, | |
| "mean_token_accuracy": 0.750194676220417, | |
| "num_tokens": 7655454.0, | |
| "step": 205 | |
| }, | |
| { | |
| "entropy": 0.6172639206051826, | |
| "epoch": 1.598639455782313, | |
| "grad_norm": 0.010384263470768929, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6146183013916016, | |
| "mean_token_accuracy": 0.7520541921257973, | |
| "num_tokens": 7693399.0, | |
| "step": 206 | |
| }, | |
| { | |
| "entropy": 0.6170154958963394, | |
| "epoch": 1.6064139941690962, | |
| "grad_norm": 0.01584717258810997, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6188840866088867, | |
| "mean_token_accuracy": 0.7489955052733421, | |
| "num_tokens": 7730827.0, | |
| "step": 207 | |
| }, | |
| { | |
| "entropy": 0.6163731887936592, | |
| "epoch": 1.6141885325558794, | |
| "grad_norm": 0.018742689862847328, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6233645677566528, | |
| "mean_token_accuracy": 0.7474886327981949, | |
| "num_tokens": 7768375.0, | |
| "step": 208 | |
| }, | |
| { | |
| "entropy": 0.6161412820219994, | |
| "epoch": 1.621963070942663, | |
| "grad_norm": 0.00972844660282135, | |
| "learning_rate": 0.0002, | |
| "loss": 0.622969388961792, | |
| "mean_token_accuracy": 0.747713029384613, | |
| "num_tokens": 7806087.0, | |
| "step": 209 | |
| }, | |
| { | |
| "entropy": 0.6096204742789268, | |
| "epoch": 1.629737609329446, | |
| "grad_norm": 0.008969136513769627, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6155728697776794, | |
| "mean_token_accuracy": 0.7519758120179176, | |
| "num_tokens": 7843539.0, | |
| "step": 210 | |
| }, | |
| { | |
| "entropy": 0.6264154762029648, | |
| "epoch": 1.6375121477162293, | |
| "grad_norm": 0.009598297998309135, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6284589767456055, | |
| "mean_token_accuracy": 0.7461679801344872, | |
| "num_tokens": 7881097.0, | |
| "step": 211 | |
| }, | |
| { | |
| "entropy": 0.6087732166051865, | |
| "epoch": 1.6452866861030127, | |
| "grad_norm": 0.012110014446079731, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6086750626564026, | |
| "mean_token_accuracy": 0.7552923634648323, | |
| "num_tokens": 7918507.0, | |
| "step": 212 | |
| }, | |
| { | |
| "entropy": 0.6052073761820793, | |
| "epoch": 1.6530612244897958, | |
| "grad_norm": 0.009252856485545635, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6080942153930664, | |
| "mean_token_accuracy": 0.7508447393774986, | |
| "num_tokens": 7955564.0, | |
| "step": 213 | |
| }, | |
| { | |
| "entropy": 0.6120294705033302, | |
| "epoch": 1.6608357628765793, | |
| "grad_norm": 0.00877399556338787, | |
| "learning_rate": 0.0002, | |
| "loss": 0.614532470703125, | |
| "mean_token_accuracy": 0.7511213645339012, | |
| "num_tokens": 7992945.0, | |
| "step": 214 | |
| }, | |
| { | |
| "entropy": 0.6241516917943954, | |
| "epoch": 1.6686103012633624, | |
| "grad_norm": 0.01109123881906271, | |
| "learning_rate": 0.0002, | |
| "loss": 0.626361608505249, | |
| "mean_token_accuracy": 0.7474541217088699, | |
| "num_tokens": 8030734.0, | |
| "step": 215 | |
| }, | |
| { | |
| "entropy": 0.6194194927811623, | |
| "epoch": 1.6763848396501457, | |
| "grad_norm": 0.009091328829526901, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6160167455673218, | |
| "mean_token_accuracy": 0.7495900243520737, | |
| "num_tokens": 8067927.0, | |
| "step": 216 | |
| }, | |
| { | |
| "entropy": 0.6229095980525017, | |
| "epoch": 1.684159378036929, | |
| "grad_norm": 0.01083504967391491, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6173299551010132, | |
| "mean_token_accuracy": 0.7501125037670135, | |
| "num_tokens": 8105627.0, | |
| "step": 217 | |
| }, | |
| { | |
| "entropy": 0.6194786503911018, | |
| "epoch": 1.6919339164237124, | |
| "grad_norm": 0.008784794248640537, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6191180944442749, | |
| "mean_token_accuracy": 0.748157188296318, | |
| "num_tokens": 8143034.0, | |
| "step": 218 | |
| }, | |
| { | |
| "entropy": 0.6127319037914276, | |
| "epoch": 1.6997084548104957, | |
| "grad_norm": 0.008322956040501595, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6156037449836731, | |
| "mean_token_accuracy": 0.7487869411706924, | |
| "num_tokens": 8180596.0, | |
| "step": 219 | |
| }, | |
| { | |
| "entropy": 0.6223913356661797, | |
| "epoch": 1.7074829931972788, | |
| "grad_norm": 0.008480758406221867, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6275689601898193, | |
| "mean_token_accuracy": 0.7448212057352066, | |
| "num_tokens": 8218297.0, | |
| "step": 220 | |
| }, | |
| { | |
| "entropy": 0.6217603012919426, | |
| "epoch": 1.7152575315840624, | |
| "grad_norm": 0.008550974540412426, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6251344680786133, | |
| "mean_token_accuracy": 0.74727413803339, | |
| "num_tokens": 8255632.0, | |
| "step": 221 | |
| }, | |
| { | |
| "entropy": 0.6164599433541298, | |
| "epoch": 1.7230320699708455, | |
| "grad_norm": 0.008577285334467888, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6166675090789795, | |
| "mean_token_accuracy": 0.7512230649590492, | |
| "num_tokens": 8292769.0, | |
| "step": 222 | |
| }, | |
| { | |
| "entropy": 0.619569830596447, | |
| "epoch": 1.7308066083576288, | |
| "grad_norm": 0.008122924715280533, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6211944818496704, | |
| "mean_token_accuracy": 0.7477053627371788, | |
| "num_tokens": 8330358.0, | |
| "step": 223 | |
| }, | |
| { | |
| "entropy": 0.6090706288814545, | |
| "epoch": 1.738581146744412, | |
| "grad_norm": 0.008728940039873123, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6092976927757263, | |
| "mean_token_accuracy": 0.7530095875263214, | |
| "num_tokens": 8367398.0, | |
| "step": 224 | |
| }, | |
| { | |
| "entropy": 0.617340199649334, | |
| "epoch": 1.7463556851311952, | |
| "grad_norm": 0.007776155136525631, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6156238913536072, | |
| "mean_token_accuracy": 0.7495973780751228, | |
| "num_tokens": 8404907.0, | |
| "step": 225 | |
| }, | |
| { | |
| "entropy": 0.6192676723003387, | |
| "epoch": 1.7541302235179788, | |
| "grad_norm": 0.008142861537635326, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6212935447692871, | |
| "mean_token_accuracy": 0.7502573132514954, | |
| "num_tokens": 8442551.0, | |
| "step": 226 | |
| }, | |
| { | |
| "entropy": 0.6181206256151199, | |
| "epoch": 1.7619047619047619, | |
| "grad_norm": 0.009585011750459671, | |
| "learning_rate": 0.0002, | |
| "loss": 0.625989556312561, | |
| "mean_token_accuracy": 0.7449588850140572, | |
| "num_tokens": 8480048.0, | |
| "step": 227 | |
| }, | |
| { | |
| "entropy": 0.6096160188317299, | |
| "epoch": 1.7696793002915452, | |
| "grad_norm": 0.008407268673181534, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6082819700241089, | |
| "mean_token_accuracy": 0.7547600343823433, | |
| "num_tokens": 8517427.0, | |
| "step": 228 | |
| }, | |
| { | |
| "entropy": 0.6192163527011871, | |
| "epoch": 1.7774538386783285, | |
| "grad_norm": 0.007702583912760019, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6174746751785278, | |
| "mean_token_accuracy": 0.7493149042129517, | |
| "num_tokens": 8554570.0, | |
| "step": 229 | |
| }, | |
| { | |
| "entropy": 0.6089940667152405, | |
| "epoch": 1.7852283770651116, | |
| "grad_norm": 0.007490647025406361, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6111437082290649, | |
| "mean_token_accuracy": 0.7528351470828056, | |
| "num_tokens": 8591761.0, | |
| "step": 230 | |
| }, | |
| { | |
| "entropy": 0.6070573329925537, | |
| "epoch": 1.7930029154518952, | |
| "grad_norm": 0.008878695778548717, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6092367172241211, | |
| "mean_token_accuracy": 0.7542654424905777, | |
| "num_tokens": 8628522.0, | |
| "step": 231 | |
| }, | |
| { | |
| "entropy": 0.617328479886055, | |
| "epoch": 1.8007774538386783, | |
| "grad_norm": 0.008331574499607086, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6187005043029785, | |
| "mean_token_accuracy": 0.7479601725935936, | |
| "num_tokens": 8666140.0, | |
| "step": 232 | |
| }, | |
| { | |
| "entropy": 0.6115391552448273, | |
| "epoch": 1.8085519922254616, | |
| "grad_norm": 0.0087031414732337, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6169438362121582, | |
| "mean_token_accuracy": 0.7492516785860062, | |
| "num_tokens": 8703399.0, | |
| "step": 233 | |
| }, | |
| { | |
| "entropy": 0.6166737154126167, | |
| "epoch": 1.816326530612245, | |
| "grad_norm": 0.008778571151196957, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6192659139633179, | |
| "mean_token_accuracy": 0.7489692941308022, | |
| "num_tokens": 8741141.0, | |
| "step": 234 | |
| }, | |
| { | |
| "entropy": 0.6278815269470215, | |
| "epoch": 1.824101068999028, | |
| "grad_norm": 0.008317695930600166, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6227933168411255, | |
| "mean_token_accuracy": 0.7477347627282143, | |
| "num_tokens": 8778706.0, | |
| "step": 235 | |
| }, | |
| { | |
| "entropy": 0.612150214612484, | |
| "epoch": 1.8318756073858116, | |
| "grad_norm": 0.008878265507519245, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6094038486480713, | |
| "mean_token_accuracy": 0.7539248242974281, | |
| "num_tokens": 8815790.0, | |
| "step": 236 | |
| }, | |
| { | |
| "entropy": 0.637272298336029, | |
| "epoch": 1.8396501457725947, | |
| "grad_norm": 0.007240319158881903, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6381018757820129, | |
| "mean_token_accuracy": 0.7397879138588905, | |
| "num_tokens": 8853228.0, | |
| "step": 237 | |
| }, | |
| { | |
| "entropy": 0.6079713776707649, | |
| "epoch": 1.847424684159378, | |
| "grad_norm": 0.008403577841818333, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6132397651672363, | |
| "mean_token_accuracy": 0.750219389796257, | |
| "num_tokens": 8890524.0, | |
| "step": 238 | |
| }, | |
| { | |
| "entropy": 0.6004362255334854, | |
| "epoch": 1.8551992225461613, | |
| "grad_norm": 0.008654654026031494, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6059733629226685, | |
| "mean_token_accuracy": 0.7544897198677063, | |
| "num_tokens": 8927518.0, | |
| "step": 239 | |
| }, | |
| { | |
| "entropy": 0.6205713227391243, | |
| "epoch": 1.8629737609329446, | |
| "grad_norm": 0.008852572180330753, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6241973638534546, | |
| "mean_token_accuracy": 0.7456497400999069, | |
| "num_tokens": 8964770.0, | |
| "step": 240 | |
| }, | |
| { | |
| "entropy": 0.6309987902641296, | |
| "epoch": 1.870748299319728, | |
| "grad_norm": 0.00919515173882246, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6267882585525513, | |
| "mean_token_accuracy": 0.7451199591159821, | |
| "num_tokens": 9002039.0, | |
| "step": 241 | |
| }, | |
| { | |
| "entropy": 0.6201007068157196, | |
| "epoch": 1.878522837706511, | |
| "grad_norm": 0.008951977826654911, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6155404448509216, | |
| "mean_token_accuracy": 0.7500432655215263, | |
| "num_tokens": 9040052.0, | |
| "step": 242 | |
| }, | |
| { | |
| "entropy": 0.6137275472283363, | |
| "epoch": 1.8862973760932946, | |
| "grad_norm": 0.008249848149716854, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6162374019622803, | |
| "mean_token_accuracy": 0.7486926540732384, | |
| "num_tokens": 9077331.0, | |
| "step": 243 | |
| }, | |
| { | |
| "entropy": 0.6179945692420006, | |
| "epoch": 1.8940719144800777, | |
| "grad_norm": 0.008306370116770267, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6247057914733887, | |
| "mean_token_accuracy": 0.7457103058695793, | |
| "num_tokens": 9114582.0, | |
| "step": 244 | |
| }, | |
| { | |
| "entropy": 0.6145003139972687, | |
| "epoch": 1.901846452866861, | |
| "grad_norm": 0.009250648319721222, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6231353282928467, | |
| "mean_token_accuracy": 0.7480179741978645, | |
| "num_tokens": 9152485.0, | |
| "step": 245 | |
| }, | |
| { | |
| "entropy": 0.6100682318210602, | |
| "epoch": 1.9096209912536444, | |
| "grad_norm": 0.008305463939905167, | |
| "learning_rate": 0.0002, | |
| "loss": 0.61110520362854, | |
| "mean_token_accuracy": 0.7516937106847763, | |
| "num_tokens": 9189875.0, | |
| "step": 246 | |
| }, | |
| { | |
| "entropy": 0.6206101104617119, | |
| "epoch": 1.9173955296404275, | |
| "grad_norm": 0.009909824468195438, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6180837154388428, | |
| "mean_token_accuracy": 0.7495366632938385, | |
| "num_tokens": 9227450.0, | |
| "step": 247 | |
| }, | |
| { | |
| "entropy": 0.6217730790376663, | |
| "epoch": 1.925170068027211, | |
| "grad_norm": 0.008246448822319508, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6189583539962769, | |
| "mean_token_accuracy": 0.7493142858147621, | |
| "num_tokens": 9265223.0, | |
| "step": 248 | |
| }, | |
| { | |
| "entropy": 0.6133992001414299, | |
| "epoch": 1.9329446064139941, | |
| "grad_norm": 0.007729528471827507, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6164335608482361, | |
| "mean_token_accuracy": 0.7500994428992271, | |
| "num_tokens": 9302597.0, | |
| "step": 249 | |
| }, | |
| { | |
| "entropy": 0.596331886947155, | |
| "epoch": 1.9407191448007775, | |
| "grad_norm": 0.00885640550404787, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6054399013519287, | |
| "mean_token_accuracy": 0.7546022981405258, | |
| "num_tokens": 9339665.0, | |
| "step": 250 | |
| }, | |
| { | |
| "entropy": 0.6010145470499992, | |
| "epoch": 1.9484936831875608, | |
| "grad_norm": 0.00908851157873869, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6051974296569824, | |
| "mean_token_accuracy": 0.7543318867683411, | |
| "num_tokens": 9376514.0, | |
| "step": 251 | |
| }, | |
| { | |
| "entropy": 0.6160777136683464, | |
| "epoch": 1.9562682215743439, | |
| "grad_norm": 0.008100342005491257, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6146577000617981, | |
| "mean_token_accuracy": 0.7485847100615501, | |
| "num_tokens": 9414214.0, | |
| "step": 252 | |
| }, | |
| { | |
| "entropy": 0.6268075257539749, | |
| "epoch": 1.9640427599611274, | |
| "grad_norm": 0.009163864888250828, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6204258799552917, | |
| "mean_token_accuracy": 0.7494765147566795, | |
| "num_tokens": 9451946.0, | |
| "step": 253 | |
| }, | |
| { | |
| "entropy": 0.6106092482805252, | |
| "epoch": 1.9718172983479105, | |
| "grad_norm": 0.007819678634405136, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6087175011634827, | |
| "mean_token_accuracy": 0.7527309507131577, | |
| "num_tokens": 9489076.0, | |
| "step": 254 | |
| }, | |
| { | |
| "entropy": 0.6168656274676323, | |
| "epoch": 1.9795918367346939, | |
| "grad_norm": 0.007515368517488241, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6177273392677307, | |
| "mean_token_accuracy": 0.751363955438137, | |
| "num_tokens": 9526620.0, | |
| "step": 255 | |
| }, | |
| { | |
| "entropy": 0.6079138219356537, | |
| "epoch": 1.9873663751214772, | |
| "grad_norm": 0.009815288707613945, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6155093312263489, | |
| "mean_token_accuracy": 0.7523162961006165, | |
| "num_tokens": 9564466.0, | |
| "step": 256 | |
| }, | |
| { | |
| "entropy": 0.6036990880966187, | |
| "epoch": 1.9951409135082603, | |
| "grad_norm": 0.008685542270541191, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6101571917533875, | |
| "mean_token_accuracy": 0.7522860541939735, | |
| "num_tokens": 9601565.0, | |
| "step": 257 | |
| }, | |
| { | |
| "entropy": 0.6164417505264282, | |
| "epoch": 2.0, | |
| "grad_norm": 0.010608273558318615, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6168809533119202, | |
| "mean_token_accuracy": 0.7516962647438049, | |
| "num_tokens": 9625165.0, | |
| "step": 258 | |
| }, | |
| { | |
| "entropy": 0.6057095304131508, | |
| "epoch": 2.007774538386783, | |
| "grad_norm": 0.009618077427148819, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6003708839416504, | |
| "mean_token_accuracy": 0.7543603405356407, | |
| "num_tokens": 9662658.0, | |
| "step": 259 | |
| }, | |
| { | |
| "entropy": 0.6160204112529755, | |
| "epoch": 2.0155490767735667, | |
| "grad_norm": 0.007366312202066183, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6107323169708252, | |
| "mean_token_accuracy": 0.751634031534195, | |
| "num_tokens": 9700423.0, | |
| "step": 260 | |
| }, | |
| { | |
| "entropy": 0.6157180666923523, | |
| "epoch": 2.0233236151603498, | |
| "grad_norm": 0.008381242863833904, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6190871596336365, | |
| "mean_token_accuracy": 0.7481335178017616, | |
| "num_tokens": 9737692.0, | |
| "step": 261 | |
| }, | |
| { | |
| "entropy": 0.6075473129749298, | |
| "epoch": 2.0310981535471333, | |
| "grad_norm": 0.010082116350531578, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6141625642776489, | |
| "mean_token_accuracy": 0.7516499608755112, | |
| "num_tokens": 9775062.0, | |
| "step": 262 | |
| }, | |
| { | |
| "entropy": 0.6151047423481941, | |
| "epoch": 2.0388726919339164, | |
| "grad_norm": 0.009529951959848404, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6205469965934753, | |
| "mean_token_accuracy": 0.7464399412274361, | |
| "num_tokens": 9812526.0, | |
| "step": 263 | |
| }, | |
| { | |
| "entropy": 0.6053090617060661, | |
| "epoch": 2.0466472303206995, | |
| "grad_norm": 0.008532468229532242, | |
| "learning_rate": 0.0002, | |
| "loss": 0.604971170425415, | |
| "mean_token_accuracy": 0.7544130459427834, | |
| "num_tokens": 9849685.0, | |
| "step": 264 | |
| }, | |
| { | |
| "entropy": 0.6305021941661835, | |
| "epoch": 2.054421768707483, | |
| "grad_norm": 0.009080994874238968, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6241769790649414, | |
| "mean_token_accuracy": 0.7455881908535957, | |
| "num_tokens": 9887441.0, | |
| "step": 265 | |
| }, | |
| { | |
| "entropy": 0.6111467704176903, | |
| "epoch": 2.062196307094266, | |
| "grad_norm": 0.008834858424961567, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6073428392410278, | |
| "mean_token_accuracy": 0.7530370578169823, | |
| "num_tokens": 9924611.0, | |
| "step": 266 | |
| }, | |
| { | |
| "entropy": 0.6218099594116211, | |
| "epoch": 2.0699708454810497, | |
| "grad_norm": 0.009297652170062065, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6261637806892395, | |
| "mean_token_accuracy": 0.7442486062645912, | |
| "num_tokens": 9962409.0, | |
| "step": 267 | |
| }, | |
| { | |
| "entropy": 0.620900422334671, | |
| "epoch": 2.077745383867833, | |
| "grad_norm": 0.012807542458176613, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6319394111633301, | |
| "mean_token_accuracy": 0.7447366267442703, | |
| "num_tokens": 9999911.0, | |
| "step": 268 | |
| }, | |
| { | |
| "entropy": 0.6219062060117722, | |
| "epoch": 2.0855199222546164, | |
| "grad_norm": 0.008311600424349308, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6196457147598267, | |
| "mean_token_accuracy": 0.7454339265823364, | |
| "num_tokens": 10037309.0, | |
| "step": 269 | |
| }, | |
| { | |
| "entropy": 0.6179447770118713, | |
| "epoch": 2.0932944606413995, | |
| "grad_norm": 0.010762435384094715, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6135507822036743, | |
| "mean_token_accuracy": 0.7513665333390236, | |
| "num_tokens": 10074802.0, | |
| "step": 270 | |
| }, | |
| { | |
| "entropy": 0.6114057898521423, | |
| "epoch": 2.1010689990281826, | |
| "grad_norm": 0.009498962201178074, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6119563579559326, | |
| "mean_token_accuracy": 0.7511925473809242, | |
| "num_tokens": 10112087.0, | |
| "step": 271 | |
| }, | |
| { | |
| "entropy": 0.5985657572746277, | |
| "epoch": 2.108843537414966, | |
| "grad_norm": 0.00927242822945118, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6077044010162354, | |
| "mean_token_accuracy": 0.751846119761467, | |
| "num_tokens": 10149470.0, | |
| "step": 272 | |
| }, | |
| { | |
| "entropy": 0.5983473360538483, | |
| "epoch": 2.116618075801749, | |
| "grad_norm": 0.011125227436423302, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6070785522460938, | |
| "mean_token_accuracy": 0.7521045431494713, | |
| "num_tokens": 10187018.0, | |
| "step": 273 | |
| }, | |
| { | |
| "entropy": 0.6010436862707138, | |
| "epoch": 2.1243926141885328, | |
| "grad_norm": 0.008612287230789661, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6019182205200195, | |
| "mean_token_accuracy": 0.7563453242182732, | |
| "num_tokens": 10224534.0, | |
| "step": 274 | |
| }, | |
| { | |
| "entropy": 0.6097739785909653, | |
| "epoch": 2.132167152575316, | |
| "grad_norm": 0.009082912467420101, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6092417240142822, | |
| "mean_token_accuracy": 0.7527365237474442, | |
| "num_tokens": 10261606.0, | |
| "step": 275 | |
| }, | |
| { | |
| "entropy": 0.6300967186689377, | |
| "epoch": 2.139941690962099, | |
| "grad_norm": 0.00942782312631607, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6258421540260315, | |
| "mean_token_accuracy": 0.7469290718436241, | |
| "num_tokens": 10299180.0, | |
| "step": 276 | |
| }, | |
| { | |
| "entropy": 0.6028410047292709, | |
| "epoch": 2.1477162293488825, | |
| "grad_norm": 0.008522949181497097, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6008127927780151, | |
| "mean_token_accuracy": 0.7564279735088348, | |
| "num_tokens": 10336360.0, | |
| "step": 277 | |
| }, | |
| { | |
| "entropy": 0.6102243736386299, | |
| "epoch": 2.1554907677356656, | |
| "grad_norm": 0.010031149722635746, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6199367046356201, | |
| "mean_token_accuracy": 0.7469272315502167, | |
| "num_tokens": 10373565.0, | |
| "step": 278 | |
| }, | |
| { | |
| "entropy": 0.6027829498052597, | |
| "epoch": 2.163265306122449, | |
| "grad_norm": 0.008753525093197823, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6074038147926331, | |
| "mean_token_accuracy": 0.7534594535827637, | |
| "num_tokens": 10411197.0, | |
| "step": 279 | |
| }, | |
| { | |
| "entropy": 0.6299364790320396, | |
| "epoch": 2.1710398445092323, | |
| "grad_norm": 0.007901565171778202, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6327069401741028, | |
| "mean_token_accuracy": 0.7429891973733902, | |
| "num_tokens": 10448851.0, | |
| "step": 280 | |
| }, | |
| { | |
| "entropy": 0.623109444975853, | |
| "epoch": 2.1788143828960154, | |
| "grad_norm": 0.008401944302022457, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6217602491378784, | |
| "mean_token_accuracy": 0.7446876764297485, | |
| "num_tokens": 10486285.0, | |
| "step": 281 | |
| }, | |
| { | |
| "entropy": 0.5951671376824379, | |
| "epoch": 2.186588921282799, | |
| "grad_norm": 0.009740160778164864, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5930252075195312, | |
| "mean_token_accuracy": 0.7590748071670532, | |
| "num_tokens": 10523187.0, | |
| "step": 282 | |
| }, | |
| { | |
| "entropy": 0.6063435301184654, | |
| "epoch": 2.194363459669582, | |
| "grad_norm": 0.008115135133266449, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6058975458145142, | |
| "mean_token_accuracy": 0.7546751350164413, | |
| "num_tokens": 10560619.0, | |
| "step": 283 | |
| }, | |
| { | |
| "entropy": 0.6197424605488777, | |
| "epoch": 2.2021379980563656, | |
| "grad_norm": 0.007982614450156689, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6196328401565552, | |
| "mean_token_accuracy": 0.7473800256848335, | |
| "num_tokens": 10597952.0, | |
| "step": 284 | |
| }, | |
| { | |
| "entropy": 0.5975362882018089, | |
| "epoch": 2.2099125364431487, | |
| "grad_norm": 0.008934210054576397, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6019341945648193, | |
| "mean_token_accuracy": 0.7551193311810493, | |
| "num_tokens": 10635474.0, | |
| "step": 285 | |
| }, | |
| { | |
| "entropy": 0.6057508885860443, | |
| "epoch": 2.2176870748299318, | |
| "grad_norm": 0.007894222624599934, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6054433584213257, | |
| "mean_token_accuracy": 0.7555015385150909, | |
| "num_tokens": 10672866.0, | |
| "step": 286 | |
| }, | |
| { | |
| "entropy": 0.6011307016015053, | |
| "epoch": 2.2254616132167153, | |
| "grad_norm": 0.008009341545403004, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6015121936798096, | |
| "mean_token_accuracy": 0.7533531039953232, | |
| "num_tokens": 10710119.0, | |
| "step": 287 | |
| }, | |
| { | |
| "entropy": 0.6083035543560982, | |
| "epoch": 2.2332361516034984, | |
| "grad_norm": 0.008571778424084187, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6072158813476562, | |
| "mean_token_accuracy": 0.7525660693645477, | |
| "num_tokens": 10747533.0, | |
| "step": 288 | |
| }, | |
| { | |
| "entropy": 0.596297912299633, | |
| "epoch": 2.241010689990282, | |
| "grad_norm": 0.007835134863853455, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6007227897644043, | |
| "mean_token_accuracy": 0.75400510430336, | |
| "num_tokens": 10784600.0, | |
| "step": 289 | |
| }, | |
| { | |
| "entropy": 0.6027623787522316, | |
| "epoch": 2.248785228377065, | |
| "grad_norm": 0.00971238687634468, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6095942258834839, | |
| "mean_token_accuracy": 0.753618136048317, | |
| "num_tokens": 10822085.0, | |
| "step": 290 | |
| }, | |
| { | |
| "entropy": 0.596187099814415, | |
| "epoch": 2.256559766763848, | |
| "grad_norm": 0.008036565966904163, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5973517298698425, | |
| "mean_token_accuracy": 0.7577640637755394, | |
| "num_tokens": 10859362.0, | |
| "step": 291 | |
| }, | |
| { | |
| "entropy": 0.6243500411510468, | |
| "epoch": 2.2643343051506317, | |
| "grad_norm": 0.00934487022459507, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6226072311401367, | |
| "mean_token_accuracy": 0.7454966679215431, | |
| "num_tokens": 10896757.0, | |
| "step": 292 | |
| }, | |
| { | |
| "entropy": 0.6136296838521957, | |
| "epoch": 2.272108843537415, | |
| "grad_norm": 0.008677436038851738, | |
| "learning_rate": 0.0002, | |
| "loss": 0.615119457244873, | |
| "mean_token_accuracy": 0.750088632106781, | |
| "num_tokens": 10934016.0, | |
| "step": 293 | |
| }, | |
| { | |
| "entropy": 0.5983113646507263, | |
| "epoch": 2.2798833819241984, | |
| "grad_norm": 0.007704727817326784, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5992428064346313, | |
| "mean_token_accuracy": 0.7575259953737259, | |
| "num_tokens": 10971732.0, | |
| "step": 294 | |
| }, | |
| { | |
| "entropy": 0.602768175303936, | |
| "epoch": 2.2876579203109815, | |
| "grad_norm": 0.008800746873021126, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6059098243713379, | |
| "mean_token_accuracy": 0.7514860853552818, | |
| "num_tokens": 11009363.0, | |
| "step": 295 | |
| }, | |
| { | |
| "entropy": 0.6180300787091255, | |
| "epoch": 2.295432458697765, | |
| "grad_norm": 0.009863065555691719, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6232578754425049, | |
| "mean_token_accuracy": 0.7460011914372444, | |
| "num_tokens": 11046850.0, | |
| "step": 296 | |
| }, | |
| { | |
| "entropy": 0.615628756582737, | |
| "epoch": 2.303206997084548, | |
| "grad_norm": 0.00794578343629837, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6193504929542542, | |
| "mean_token_accuracy": 0.7466345354914665, | |
| "num_tokens": 11084028.0, | |
| "step": 297 | |
| }, | |
| { | |
| "entropy": 0.6079032048583031, | |
| "epoch": 2.3109815354713312, | |
| "grad_norm": 0.008673022501170635, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6060619354248047, | |
| "mean_token_accuracy": 0.7532483711838722, | |
| "num_tokens": 11121691.0, | |
| "step": 298 | |
| }, | |
| { | |
| "entropy": 0.6126295253634453, | |
| "epoch": 2.3187560738581148, | |
| "grad_norm": 0.010211586020886898, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6097185611724854, | |
| "mean_token_accuracy": 0.7503807097673416, | |
| "num_tokens": 11159118.0, | |
| "step": 299 | |
| }, | |
| { | |
| "entropy": 0.6223906055092812, | |
| "epoch": 2.326530612244898, | |
| "grad_norm": 0.007925095036625862, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6250431537628174, | |
| "mean_token_accuracy": 0.7459972500801086, | |
| "num_tokens": 11196522.0, | |
| "step": 300 | |
| }, | |
| { | |
| "entropy": 0.6105447709560394, | |
| "epoch": 2.3343051506316814, | |
| "grad_norm": 0.008913103491067886, | |
| "learning_rate": 0.0002, | |
| "loss": 0.616736114025116, | |
| "mean_token_accuracy": 0.749770350754261, | |
| "num_tokens": 11234173.0, | |
| "step": 301 | |
| }, | |
| { | |
| "entropy": 0.6050237938761711, | |
| "epoch": 2.3420796890184645, | |
| "grad_norm": 0.00913191493600607, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6078106164932251, | |
| "mean_token_accuracy": 0.7534833922982216, | |
| "num_tokens": 11271528.0, | |
| "step": 302 | |
| }, | |
| { | |
| "entropy": 0.624389261007309, | |
| "epoch": 2.3498542274052476, | |
| "grad_norm": 0.00800058338791132, | |
| "learning_rate": 0.0002, | |
| "loss": 0.624384880065918, | |
| "mean_token_accuracy": 0.7484247088432312, | |
| "num_tokens": 11309275.0, | |
| "step": 303 | |
| }, | |
| { | |
| "entropy": 0.621875673532486, | |
| "epoch": 2.357628765792031, | |
| "grad_norm": 0.009797596372663975, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6190812587738037, | |
| "mean_token_accuracy": 0.7491643279790878, | |
| "num_tokens": 11346386.0, | |
| "step": 304 | |
| }, | |
| { | |
| "entropy": 0.6205748915672302, | |
| "epoch": 2.3654033041788143, | |
| "grad_norm": 0.009043901227414608, | |
| "learning_rate": 0.0002, | |
| "loss": 0.616840124130249, | |
| "mean_token_accuracy": 0.7496623322367668, | |
| "num_tokens": 11383273.0, | |
| "step": 305 | |
| }, | |
| { | |
| "entropy": 0.5943257734179497, | |
| "epoch": 2.373177842565598, | |
| "grad_norm": 0.009680100716650486, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6005733013153076, | |
| "mean_token_accuracy": 0.7566492632031441, | |
| "num_tokens": 11420226.0, | |
| "step": 306 | |
| }, | |
| { | |
| "entropy": 0.5875989943742752, | |
| "epoch": 2.380952380952381, | |
| "grad_norm": 0.009831924922764301, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5920431613922119, | |
| "mean_token_accuracy": 0.758441336452961, | |
| "num_tokens": 11457658.0, | |
| "step": 307 | |
| }, | |
| { | |
| "entropy": 0.605907216668129, | |
| "epoch": 2.388726919339164, | |
| "grad_norm": 0.008310995064675808, | |
| "learning_rate": 0.0002, | |
| "loss": 0.606610894203186, | |
| "mean_token_accuracy": 0.7539205178618431, | |
| "num_tokens": 11495093.0, | |
| "step": 308 | |
| }, | |
| { | |
| "entropy": 0.6085820719599724, | |
| "epoch": 2.3965014577259476, | |
| "grad_norm": 0.008422457613050938, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6112357378005981, | |
| "mean_token_accuracy": 0.7495599314570427, | |
| "num_tokens": 11532305.0, | |
| "step": 309 | |
| }, | |
| { | |
| "entropy": 0.6038077920675278, | |
| "epoch": 2.4042759961127307, | |
| "grad_norm": 0.009313938207924366, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6037260293960571, | |
| "mean_token_accuracy": 0.7537373602390289, | |
| "num_tokens": 11569956.0, | |
| "step": 310 | |
| }, | |
| { | |
| "entropy": 0.6088597327470779, | |
| "epoch": 2.4120505344995142, | |
| "grad_norm": 0.008129115216434002, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6097284555435181, | |
| "mean_token_accuracy": 0.752282939851284, | |
| "num_tokens": 11607580.0, | |
| "step": 311 | |
| }, | |
| { | |
| "entropy": 0.6035630702972412, | |
| "epoch": 2.4198250728862973, | |
| "grad_norm": 0.010189153254032135, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6098878383636475, | |
| "mean_token_accuracy": 0.7509205341339111, | |
| "num_tokens": 11645065.0, | |
| "step": 312 | |
| }, | |
| { | |
| "entropy": 0.5988744720816612, | |
| "epoch": 2.427599611273081, | |
| "grad_norm": 0.008477658964693546, | |
| "learning_rate": 0.0002, | |
| "loss": 0.600048840045929, | |
| "mean_token_accuracy": 0.7566671743988991, | |
| "num_tokens": 11682523.0, | |
| "step": 313 | |
| }, | |
| { | |
| "entropy": 0.604704961180687, | |
| "epoch": 2.435374149659864, | |
| "grad_norm": 0.009996007196605206, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6124827861785889, | |
| "mean_token_accuracy": 0.7483595088124275, | |
| "num_tokens": 11719829.0, | |
| "step": 314 | |
| }, | |
| { | |
| "entropy": 0.6142484471201897, | |
| "epoch": 2.443148688046647, | |
| "grad_norm": 0.008275930769741535, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6168549060821533, | |
| "mean_token_accuracy": 0.7509273141622543, | |
| "num_tokens": 11757130.0, | |
| "step": 315 | |
| }, | |
| { | |
| "entropy": 0.618528425693512, | |
| "epoch": 2.4509232264334306, | |
| "grad_norm": 0.00913267582654953, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6144739985466003, | |
| "mean_token_accuracy": 0.7495302185416222, | |
| "num_tokens": 11794646.0, | |
| "step": 316 | |
| }, | |
| { | |
| "entropy": 0.6221663355827332, | |
| "epoch": 2.4586977648202137, | |
| "grad_norm": 0.008833467960357666, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6160144805908203, | |
| "mean_token_accuracy": 0.7488524913787842, | |
| "num_tokens": 11832667.0, | |
| "step": 317 | |
| }, | |
| { | |
| "entropy": 0.6151534616947174, | |
| "epoch": 2.466472303206997, | |
| "grad_norm": 0.008367245085537434, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6178625226020813, | |
| "mean_token_accuracy": 0.7469210624694824, | |
| "num_tokens": 11870196.0, | |
| "step": 318 | |
| }, | |
| { | |
| "entropy": 0.599577471613884, | |
| "epoch": 2.4742468415937804, | |
| "grad_norm": 0.008229793980717659, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6013622283935547, | |
| "mean_token_accuracy": 0.7555016428232193, | |
| "num_tokens": 11907738.0, | |
| "step": 319 | |
| }, | |
| { | |
| "entropy": 0.6037501096725464, | |
| "epoch": 2.4820213799805635, | |
| "grad_norm": 0.009975764900445938, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6080362796783447, | |
| "mean_token_accuracy": 0.754118837416172, | |
| "num_tokens": 11945154.0, | |
| "step": 320 | |
| }, | |
| { | |
| "entropy": 0.6234212592244148, | |
| "epoch": 2.489795918367347, | |
| "grad_norm": 0.009158926084637642, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6259138584136963, | |
| "mean_token_accuracy": 0.7461888268589973, | |
| "num_tokens": 11983030.0, | |
| "step": 321 | |
| }, | |
| { | |
| "entropy": 0.6105703264474869, | |
| "epoch": 2.49757045675413, | |
| "grad_norm": 0.009549647569656372, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6138617992401123, | |
| "mean_token_accuracy": 0.7500449195504189, | |
| "num_tokens": 12020106.0, | |
| "step": 322 | |
| }, | |
| { | |
| "entropy": 0.5886913314461708, | |
| "epoch": 2.5053449951409137, | |
| "grad_norm": 0.009142185561358929, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5951993465423584, | |
| "mean_token_accuracy": 0.7568985298275948, | |
| "num_tokens": 12057274.0, | |
| "step": 323 | |
| }, | |
| { | |
| "entropy": 0.6163628548383713, | |
| "epoch": 2.513119533527697, | |
| "grad_norm": 0.008757554925978184, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6170852184295654, | |
| "mean_token_accuracy": 0.749226838350296, | |
| "num_tokens": 12094665.0, | |
| "step": 324 | |
| }, | |
| { | |
| "entropy": 0.6229220703244209, | |
| "epoch": 2.52089407191448, | |
| "grad_norm": 0.007944419980049133, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6211696267127991, | |
| "mean_token_accuracy": 0.749010942876339, | |
| "num_tokens": 12132302.0, | |
| "step": 325 | |
| }, | |
| { | |
| "entropy": 0.6257840767502785, | |
| "epoch": 2.5286686103012634, | |
| "grad_norm": 0.008713958784937859, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6223682165145874, | |
| "mean_token_accuracy": 0.7470938488841057, | |
| "num_tokens": 12169510.0, | |
| "step": 326 | |
| }, | |
| { | |
| "entropy": 0.6103069111704826, | |
| "epoch": 2.5364431486880465, | |
| "grad_norm": 0.008112641051411629, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6112810969352722, | |
| "mean_token_accuracy": 0.7517933994531631, | |
| "num_tokens": 12206878.0, | |
| "step": 327 | |
| }, | |
| { | |
| "entropy": 0.6295960918068886, | |
| "epoch": 2.54421768707483, | |
| "grad_norm": 0.009597997181117535, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6329588890075684, | |
| "mean_token_accuracy": 0.7417808771133423, | |
| "num_tokens": 12244230.0, | |
| "step": 328 | |
| }, | |
| { | |
| "entropy": 0.6144092008471489, | |
| "epoch": 2.551992225461613, | |
| "grad_norm": 0.007173395249992609, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6167792081832886, | |
| "mean_token_accuracy": 0.750128723680973, | |
| "num_tokens": 12281944.0, | |
| "step": 329 | |
| }, | |
| { | |
| "entropy": 0.6102811768651009, | |
| "epoch": 2.5597667638483967, | |
| "grad_norm": 0.00874980166554451, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6081819534301758, | |
| "mean_token_accuracy": 0.7545690611004829, | |
| "num_tokens": 12319144.0, | |
| "step": 330 | |
| }, | |
| { | |
| "entropy": 0.6088513135910034, | |
| "epoch": 2.56754130223518, | |
| "grad_norm": 0.007437287364155054, | |
| "learning_rate": 0.0002, | |
| "loss": 0.610903799533844, | |
| "mean_token_accuracy": 0.7525679916143417, | |
| "num_tokens": 12356752.0, | |
| "step": 331 | |
| }, | |
| { | |
| "entropy": 0.605910450220108, | |
| "epoch": 2.575315840621963, | |
| "grad_norm": 0.008948191069066525, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6137778759002686, | |
| "mean_token_accuracy": 0.7502530664205551, | |
| "num_tokens": 12394388.0, | |
| "step": 332 | |
| }, | |
| { | |
| "entropy": 0.6148117780685425, | |
| "epoch": 2.5830903790087465, | |
| "grad_norm": 0.008310764096677303, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6203396320343018, | |
| "mean_token_accuracy": 0.7478612065315247, | |
| "num_tokens": 12431583.0, | |
| "step": 333 | |
| }, | |
| { | |
| "entropy": 0.6049426943063736, | |
| "epoch": 2.5908649173955296, | |
| "grad_norm": 0.00928961019963026, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6102631688117981, | |
| "mean_token_accuracy": 0.7530224993824959, | |
| "num_tokens": 12469057.0, | |
| "step": 334 | |
| }, | |
| { | |
| "entropy": 0.6105730906128883, | |
| "epoch": 2.5986394557823127, | |
| "grad_norm": 0.008061802014708519, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6099789142608643, | |
| "mean_token_accuracy": 0.7517432495951653, | |
| "num_tokens": 12506375.0, | |
| "step": 335 | |
| }, | |
| { | |
| "entropy": 0.6109907403588295, | |
| "epoch": 2.6064139941690962, | |
| "grad_norm": 0.008131072856485844, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6083254814147949, | |
| "mean_token_accuracy": 0.7539641037583351, | |
| "num_tokens": 12543683.0, | |
| "step": 336 | |
| }, | |
| { | |
| "entropy": 0.60856644064188, | |
| "epoch": 2.6141885325558794, | |
| "grad_norm": 0.008039598353207111, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6059796810150146, | |
| "mean_token_accuracy": 0.7539034485816956, | |
| "num_tokens": 12581164.0, | |
| "step": 337 | |
| }, | |
| { | |
| "entropy": 0.6075717508792877, | |
| "epoch": 2.621963070942663, | |
| "grad_norm": 0.007622460834681988, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6058254241943359, | |
| "mean_token_accuracy": 0.755204826593399, | |
| "num_tokens": 12618385.0, | |
| "step": 338 | |
| }, | |
| { | |
| "entropy": 0.6058209240436554, | |
| "epoch": 2.629737609329446, | |
| "grad_norm": 0.009571490809321404, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6132853031158447, | |
| "mean_token_accuracy": 0.7517998144030571, | |
| "num_tokens": 12656198.0, | |
| "step": 339 | |
| }, | |
| { | |
| "entropy": 0.609808899462223, | |
| "epoch": 2.6375121477162295, | |
| "grad_norm": 0.009121098555624485, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6116859912872314, | |
| "mean_token_accuracy": 0.7522552087903023, | |
| "num_tokens": 12693619.0, | |
| "step": 340 | |
| }, | |
| { | |
| "entropy": 0.5982947275042534, | |
| "epoch": 2.6452866861030127, | |
| "grad_norm": 0.007683332543820143, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6035135984420776, | |
| "mean_token_accuracy": 0.7554004937410355, | |
| "num_tokens": 12731247.0, | |
| "step": 341 | |
| }, | |
| { | |
| "entropy": 0.6199963241815567, | |
| "epoch": 2.6530612244897958, | |
| "grad_norm": 0.008116503246128559, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6209834814071655, | |
| "mean_token_accuracy": 0.7469918876886368, | |
| "num_tokens": 12768639.0, | |
| "step": 342 | |
| }, | |
| { | |
| "entropy": 0.611749030649662, | |
| "epoch": 2.6608357628765793, | |
| "grad_norm": 0.009202837944030762, | |
| "learning_rate": 0.0002, | |
| "loss": 0.609596848487854, | |
| "mean_token_accuracy": 0.7527265250682831, | |
| "num_tokens": 12805843.0, | |
| "step": 343 | |
| }, | |
| { | |
| "entropy": 0.6049032211303711, | |
| "epoch": 2.6686103012633624, | |
| "grad_norm": 0.008622320368885994, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6062831282615662, | |
| "mean_token_accuracy": 0.7529996708035469, | |
| "num_tokens": 12843334.0, | |
| "step": 344 | |
| }, | |
| { | |
| "entropy": 0.6080296412110329, | |
| "epoch": 2.6763848396501455, | |
| "grad_norm": 0.010344683192670345, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6155232787132263, | |
| "mean_token_accuracy": 0.7492252364754677, | |
| "num_tokens": 12881114.0, | |
| "step": 345 | |
| }, | |
| { | |
| "entropy": 0.6105146557092667, | |
| "epoch": 2.684159378036929, | |
| "grad_norm": 0.00811974797397852, | |
| "learning_rate": 0.0002, | |
| "loss": 0.61601722240448, | |
| "mean_token_accuracy": 0.7480410560965538, | |
| "num_tokens": 12918628.0, | |
| "step": 346 | |
| }, | |
| { | |
| "entropy": 0.616872251033783, | |
| "epoch": 2.6919339164237126, | |
| "grad_norm": 0.009087933227419853, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6140284538269043, | |
| "mean_token_accuracy": 0.7496198862791061, | |
| "num_tokens": 12955856.0, | |
| "step": 347 | |
| }, | |
| { | |
| "entropy": 0.6135741174221039, | |
| "epoch": 2.6997084548104957, | |
| "grad_norm": 0.008728091605007648, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6116735935211182, | |
| "mean_token_accuracy": 0.7527862265706062, | |
| "num_tokens": 12993282.0, | |
| "step": 348 | |
| }, | |
| { | |
| "entropy": 0.6206527948379517, | |
| "epoch": 2.707482993197279, | |
| "grad_norm": 0.008598288521170616, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6233333349227905, | |
| "mean_token_accuracy": 0.7463840544223785, | |
| "num_tokens": 13030919.0, | |
| "step": 349 | |
| }, | |
| { | |
| "entropy": 0.608021192252636, | |
| "epoch": 2.7152575315840624, | |
| "grad_norm": 0.008716718293726444, | |
| "learning_rate": 0.0002, | |
| "loss": 0.612204909324646, | |
| "mean_token_accuracy": 0.7511651292443275, | |
| "num_tokens": 13068022.0, | |
| "step": 350 | |
| }, | |
| { | |
| "entropy": 0.6055907234549522, | |
| "epoch": 2.7230320699708455, | |
| "grad_norm": 0.007125901058316231, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6055992841720581, | |
| "mean_token_accuracy": 0.753873273730278, | |
| "num_tokens": 13105324.0, | |
| "step": 351 | |
| }, | |
| { | |
| "entropy": 0.6134061738848686, | |
| "epoch": 2.7308066083576286, | |
| "grad_norm": 0.007964730262756348, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6122632026672363, | |
| "mean_token_accuracy": 0.7516495808959007, | |
| "num_tokens": 13143067.0, | |
| "step": 352 | |
| }, | |
| { | |
| "entropy": 0.6035361513495445, | |
| "epoch": 2.738581146744412, | |
| "grad_norm": 0.008376477286219597, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6055692434310913, | |
| "mean_token_accuracy": 0.7536868900060654, | |
| "num_tokens": 13180307.0, | |
| "step": 353 | |
| }, | |
| { | |
| "entropy": 0.6108582690358162, | |
| "epoch": 2.746355685131195, | |
| "grad_norm": 0.008256555534899235, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6159192323684692, | |
| "mean_token_accuracy": 0.7500140145421028, | |
| "num_tokens": 13217651.0, | |
| "step": 354 | |
| }, | |
| { | |
| "entropy": 0.6065188273787498, | |
| "epoch": 2.7541302235179788, | |
| "grad_norm": 0.007910750806331635, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6087648868560791, | |
| "mean_token_accuracy": 0.7539975792169571, | |
| "num_tokens": 13255245.0, | |
| "step": 355 | |
| }, | |
| { | |
| "entropy": 0.6058445647358894, | |
| "epoch": 2.761904761904762, | |
| "grad_norm": 0.007995028980076313, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6082870960235596, | |
| "mean_token_accuracy": 0.7520255744457245, | |
| "num_tokens": 13293244.0, | |
| "step": 356 | |
| }, | |
| { | |
| "entropy": 0.6188160851597786, | |
| "epoch": 2.7696793002915454, | |
| "grad_norm": 0.008255942724645138, | |
| "learning_rate": 0.0002, | |
| "loss": 0.615801990032196, | |
| "mean_token_accuracy": 0.7498086243867874, | |
| "num_tokens": 13330234.0, | |
| "step": 357 | |
| }, | |
| { | |
| "entropy": 0.6236889883875847, | |
| "epoch": 2.7774538386783285, | |
| "grad_norm": 0.007726432289928198, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6215789914131165, | |
| "mean_token_accuracy": 0.7462954670190811, | |
| "num_tokens": 13367753.0, | |
| "step": 358 | |
| }, | |
| { | |
| "entropy": 0.6057674139738083, | |
| "epoch": 2.7852283770651116, | |
| "grad_norm": 0.007486944552510977, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6107175946235657, | |
| "mean_token_accuracy": 0.7536005079746246, | |
| "num_tokens": 13405367.0, | |
| "step": 359 | |
| }, | |
| { | |
| "entropy": 0.6108546778559685, | |
| "epoch": 2.793002915451895, | |
| "grad_norm": 0.00800468772649765, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6151923537254333, | |
| "mean_token_accuracy": 0.7498300299048424, | |
| "num_tokens": 13442458.0, | |
| "step": 360 | |
| }, | |
| { | |
| "entropy": 0.611615277826786, | |
| "epoch": 2.8007774538386783, | |
| "grad_norm": 0.008358453400433064, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6143432855606079, | |
| "mean_token_accuracy": 0.7498634308576584, | |
| "num_tokens": 13479706.0, | |
| "step": 361 | |
| }, | |
| { | |
| "entropy": 0.6097937971353531, | |
| "epoch": 2.8085519922254614, | |
| "grad_norm": 0.008056551218032837, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6140632629394531, | |
| "mean_token_accuracy": 0.7493433877825737, | |
| "num_tokens": 13517106.0, | |
| "step": 362 | |
| }, | |
| { | |
| "entropy": 0.6036530286073685, | |
| "epoch": 2.816326530612245, | |
| "grad_norm": 0.008669313974678516, | |
| "learning_rate": 0.0002, | |
| "loss": 0.604174792766571, | |
| "mean_token_accuracy": 0.755392961204052, | |
| "num_tokens": 13554029.0, | |
| "step": 363 | |
| }, | |
| { | |
| "entropy": 0.6074316874146461, | |
| "epoch": 2.824101068999028, | |
| "grad_norm": 0.008313254453241825, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6034117937088013, | |
| "mean_token_accuracy": 0.7538974210619926, | |
| "num_tokens": 13591496.0, | |
| "step": 364 | |
| }, | |
| { | |
| "entropy": 0.625335082411766, | |
| "epoch": 2.8318756073858116, | |
| "grad_norm": 0.00826285034418106, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6179195642471313, | |
| "mean_token_accuracy": 0.7473107278347015, | |
| "num_tokens": 13629175.0, | |
| "step": 365 | |
| }, | |
| { | |
| "entropy": 0.6023752987384796, | |
| "epoch": 2.8396501457725947, | |
| "grad_norm": 0.008760266937315464, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6035041809082031, | |
| "mean_token_accuracy": 0.752547599375248, | |
| "num_tokens": 13666378.0, | |
| "step": 366 | |
| }, | |
| { | |
| "entropy": 0.6186700463294983, | |
| "epoch": 2.847424684159378, | |
| "grad_norm": 0.009422390721738338, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6255558133125305, | |
| "mean_token_accuracy": 0.7451329976320267, | |
| "num_tokens": 13704147.0, | |
| "step": 367 | |
| }, | |
| { | |
| "entropy": 0.6027014032006264, | |
| "epoch": 2.8551992225461613, | |
| "grad_norm": 0.007943754084408283, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6077042818069458, | |
| "mean_token_accuracy": 0.7518687173724174, | |
| "num_tokens": 13741252.0, | |
| "step": 368 | |
| }, | |
| { | |
| "entropy": 0.6081340312957764, | |
| "epoch": 2.8629737609329444, | |
| "grad_norm": 0.008472657762467861, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6082110404968262, | |
| "mean_token_accuracy": 0.7499295845627785, | |
| "num_tokens": 13778637.0, | |
| "step": 369 | |
| }, | |
| { | |
| "entropy": 0.6041673645377159, | |
| "epoch": 2.870748299319728, | |
| "grad_norm": 0.008525537326931953, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6059847474098206, | |
| "mean_token_accuracy": 0.7531944662332535, | |
| "num_tokens": 13816076.0, | |
| "step": 370 | |
| }, | |
| { | |
| "entropy": 0.6156945377588272, | |
| "epoch": 2.878522837706511, | |
| "grad_norm": 0.007397054228931665, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6175694465637207, | |
| "mean_token_accuracy": 0.7489196062088013, | |
| "num_tokens": 13853700.0, | |
| "step": 371 | |
| }, | |
| { | |
| "entropy": 0.6109963580965996, | |
| "epoch": 2.8862973760932946, | |
| "grad_norm": 0.008632549084722996, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6189043521881104, | |
| "mean_token_accuracy": 0.7480105683207512, | |
| "num_tokens": 13890909.0, | |
| "step": 372 | |
| }, | |
| { | |
| "entropy": 0.60771045088768, | |
| "epoch": 2.8940719144800777, | |
| "grad_norm": 0.008767201565206051, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6133548021316528, | |
| "mean_token_accuracy": 0.7522530779242516, | |
| "num_tokens": 13928292.0, | |
| "step": 373 | |
| }, | |
| { | |
| "entropy": 0.6067496612668037, | |
| "epoch": 2.9018464528668613, | |
| "grad_norm": 0.007676385343074799, | |
| "learning_rate": 0.0002, | |
| "loss": 0.60523521900177, | |
| "mean_token_accuracy": 0.754976786673069, | |
| "num_tokens": 13965803.0, | |
| "step": 374 | |
| }, | |
| { | |
| "entropy": 0.6119726821780205, | |
| "epoch": 2.9096209912536444, | |
| "grad_norm": 0.007059477269649506, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6106954216957092, | |
| "mean_token_accuracy": 0.7522552087903023, | |
| "num_tokens": 14002852.0, | |
| "step": 375 | |
| }, | |
| { | |
| "entropy": 0.6248558238148689, | |
| "epoch": 2.9173955296404275, | |
| "grad_norm": 0.008261643350124359, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6251908540725708, | |
| "mean_token_accuracy": 0.7473416924476624, | |
| "num_tokens": 14040214.0, | |
| "step": 376 | |
| }, | |
| { | |
| "entropy": 0.6125365421175957, | |
| "epoch": 2.925170068027211, | |
| "grad_norm": 0.00803174264729023, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6121209859848022, | |
| "mean_token_accuracy": 0.7514154240489006, | |
| "num_tokens": 14077708.0, | |
| "step": 377 | |
| }, | |
| { | |
| "entropy": 0.6050901785492897, | |
| "epoch": 2.932944606413994, | |
| "grad_norm": 0.007550297304987907, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6031768321990967, | |
| "mean_token_accuracy": 0.7547935023903847, | |
| "num_tokens": 14115081.0, | |
| "step": 378 | |
| }, | |
| { | |
| "entropy": 0.5867772176861763, | |
| "epoch": 2.9407191448007772, | |
| "grad_norm": 0.007504226174205542, | |
| "learning_rate": 0.0002, | |
| "loss": 0.586522102355957, | |
| "mean_token_accuracy": 0.7607723250985146, | |
| "num_tokens": 14152707.0, | |
| "step": 379 | |
| }, | |
| { | |
| "entropy": 0.6053405031561852, | |
| "epoch": 2.9484936831875608, | |
| "grad_norm": 0.007515515200793743, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6078545451164246, | |
| "mean_token_accuracy": 0.7521200627088547, | |
| "num_tokens": 14190102.0, | |
| "step": 380 | |
| }, | |
| { | |
| "entropy": 0.6189891770482063, | |
| "epoch": 2.956268221574344, | |
| "grad_norm": 0.009104753844439983, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6249637603759766, | |
| "mean_token_accuracy": 0.745013989508152, | |
| "num_tokens": 14227592.0, | |
| "step": 381 | |
| }, | |
| { | |
| "entropy": 0.6138845458626747, | |
| "epoch": 2.9640427599611274, | |
| "grad_norm": 0.008113187737762928, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6206336617469788, | |
| "mean_token_accuracy": 0.7456697672605515, | |
| "num_tokens": 14264742.0, | |
| "step": 382 | |
| }, | |
| { | |
| "entropy": 0.6130691468715668, | |
| "epoch": 2.9718172983479105, | |
| "grad_norm": 0.009299568831920624, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6096789836883545, | |
| "mean_token_accuracy": 0.7523899152874947, | |
| "num_tokens": 14302195.0, | |
| "step": 383 | |
| }, | |
| { | |
| "entropy": 0.6205710843205452, | |
| "epoch": 2.979591836734694, | |
| "grad_norm": 0.009512864053249359, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6156758069992065, | |
| "mean_token_accuracy": 0.7508921846747398, | |
| "num_tokens": 14339245.0, | |
| "step": 384 | |
| }, | |
| { | |
| "entropy": 0.6069811135530472, | |
| "epoch": 2.987366375121477, | |
| "grad_norm": 0.007910305634140968, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6085284948348999, | |
| "mean_token_accuracy": 0.753339558839798, | |
| "num_tokens": 14376587.0, | |
| "step": 385 | |
| }, | |
| { | |
| "entropy": 0.6119454056024551, | |
| "epoch": 2.9951409135082603, | |
| "grad_norm": 0.009647355414927006, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6212526559829712, | |
| "mean_token_accuracy": 0.7483848258852959, | |
| "num_tokens": 14414269.0, | |
| "step": 386 | |
| }, | |
| { | |
| "entropy": 0.5991271257400512, | |
| "epoch": 3.0, | |
| "grad_norm": 0.010158240795135498, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6065676212310791, | |
| "mean_token_accuracy": 0.7547077178955078, | |
| "num_tokens": 14437732.0, | |
| "step": 387 | |
| }, | |
| { | |
| "entropy": 0.6155622974038124, | |
| "epoch": 3.007774538386783, | |
| "grad_norm": 0.007469667587429285, | |
| "learning_rate": 0.0002, | |
| "loss": 0.610929012298584, | |
| "mean_token_accuracy": 0.7500728666782379, | |
| "num_tokens": 14475215.0, | |
| "step": 388 | |
| }, | |
| { | |
| "entropy": 0.6059615164995193, | |
| "epoch": 3.0155490767735667, | |
| "grad_norm": 0.008237253874540329, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6052074432373047, | |
| "mean_token_accuracy": 0.75154148042202, | |
| "num_tokens": 14512098.0, | |
| "step": 389 | |
| }, | |
| { | |
| "entropy": 0.6095065400004387, | |
| "epoch": 3.0233236151603498, | |
| "grad_norm": 0.008823649026453495, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6052320599555969, | |
| "mean_token_accuracy": 0.7540639191865921, | |
| "num_tokens": 14549796.0, | |
| "step": 390 | |
| }, | |
| { | |
| "entropy": 0.5965104550123215, | |
| "epoch": 3.0310981535471333, | |
| "grad_norm": 0.008173096925020218, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5943379998207092, | |
| "mean_token_accuracy": 0.7575219720602036, | |
| "num_tokens": 14587236.0, | |
| "step": 391 | |
| }, | |
| { | |
| "entropy": 0.6153795942664146, | |
| "epoch": 3.0388726919339164, | |
| "grad_norm": 0.011041256599128246, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6242270469665527, | |
| "mean_token_accuracy": 0.7458753809332848, | |
| "num_tokens": 14624782.0, | |
| "step": 392 | |
| }, | |
| { | |
| "entropy": 0.5972734019160271, | |
| "epoch": 3.0466472303206995, | |
| "grad_norm": 0.008677808567881584, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5998678207397461, | |
| "mean_token_accuracy": 0.7576502561569214, | |
| "num_tokens": 14662174.0, | |
| "step": 393 | |
| }, | |
| { | |
| "entropy": 0.6102932617068291, | |
| "epoch": 3.054421768707483, | |
| "grad_norm": 0.010088201612234116, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6051709651947021, | |
| "mean_token_accuracy": 0.7535885870456696, | |
| "num_tokens": 14699746.0, | |
| "step": 394 | |
| }, | |
| { | |
| "entropy": 0.6008228436112404, | |
| "epoch": 3.062196307094266, | |
| "grad_norm": 0.008312424644827843, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6032264232635498, | |
| "mean_token_accuracy": 0.7517057359218597, | |
| "num_tokens": 14737247.0, | |
| "step": 395 | |
| }, | |
| { | |
| "entropy": 0.5989790633320808, | |
| "epoch": 3.0699708454810497, | |
| "grad_norm": 0.008239499293267727, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6043699979782104, | |
| "mean_token_accuracy": 0.7529819533228874, | |
| "num_tokens": 14774702.0, | |
| "step": 396 | |
| }, | |
| { | |
| "entropy": 0.6045716553926468, | |
| "epoch": 3.077745383867833, | |
| "grad_norm": 0.01003638468682766, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6113682985305786, | |
| "mean_token_accuracy": 0.7505319342017174, | |
| "num_tokens": 14811886.0, | |
| "step": 397 | |
| }, | |
| { | |
| "entropy": 0.6115910932421684, | |
| "epoch": 3.0855199222546164, | |
| "grad_norm": 0.009529519826173782, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6107526421546936, | |
| "mean_token_accuracy": 0.7507694736123085, | |
| "num_tokens": 14848988.0, | |
| "step": 398 | |
| }, | |
| { | |
| "entropy": 0.6084096133708954, | |
| "epoch": 3.0932944606413995, | |
| "grad_norm": 0.010617745108902454, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6034584045410156, | |
| "mean_token_accuracy": 0.753932997584343, | |
| "num_tokens": 14886459.0, | |
| "step": 399 | |
| }, | |
| { | |
| "entropy": 0.6054683178663254, | |
| "epoch": 3.1010689990281826, | |
| "grad_norm": 0.008427645079791546, | |
| "learning_rate": 0.0002, | |
| "loss": 0.603972852230072, | |
| "mean_token_accuracy": 0.7547962665557861, | |
| "num_tokens": 14924071.0, | |
| "step": 400 | |
| }, | |
| { | |
| "entropy": 0.5898149386048317, | |
| "epoch": 3.108843537414966, | |
| "grad_norm": 0.009828660637140274, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5968987941741943, | |
| "mean_token_accuracy": 0.7556750178337097, | |
| "num_tokens": 14961693.0, | |
| "step": 401 | |
| }, | |
| { | |
| "entropy": 0.5877138301730156, | |
| "epoch": 3.116618075801749, | |
| "grad_norm": 0.010062897577881813, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5967484712600708, | |
| "mean_token_accuracy": 0.7571568712592125, | |
| "num_tokens": 14998846.0, | |
| "step": 402 | |
| }, | |
| { | |
| "entropy": 0.5948435962200165, | |
| "epoch": 3.1243926141885328, | |
| "grad_norm": 0.008929714560508728, | |
| "learning_rate": 0.0002, | |
| "loss": 0.596827507019043, | |
| "mean_token_accuracy": 0.7577486112713814, | |
| "num_tokens": 15036731.0, | |
| "step": 403 | |
| }, | |
| { | |
| "entropy": 0.6053501963615417, | |
| "epoch": 3.132167152575316, | |
| "grad_norm": 0.009441581554710865, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6060553789138794, | |
| "mean_token_accuracy": 0.7532980218529701, | |
| "num_tokens": 15074609.0, | |
| "step": 404 | |
| }, | |
| { | |
| "entropy": 0.6139290183782578, | |
| "epoch": 3.139941690962099, | |
| "grad_norm": 0.009152664802968502, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6124223470687866, | |
| "mean_token_accuracy": 0.7500443160533905, | |
| "num_tokens": 15112062.0, | |
| "step": 405 | |
| }, | |
| { | |
| "entropy": 0.5967981591820717, | |
| "epoch": 3.1477162293488825, | |
| "grad_norm": 0.009577469900250435, | |
| "learning_rate": 0.0002, | |
| "loss": 0.60134357213974, | |
| "mean_token_accuracy": 0.75638198107481, | |
| "num_tokens": 15149260.0, | |
| "step": 406 | |
| }, | |
| { | |
| "entropy": 0.6026358082890511, | |
| "epoch": 3.1554907677356656, | |
| "grad_norm": 0.008992240764200687, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6071676015853882, | |
| "mean_token_accuracy": 0.7526509240269661, | |
| "num_tokens": 15186342.0, | |
| "step": 407 | |
| }, | |
| { | |
| "entropy": 0.6130121350288391, | |
| "epoch": 3.163265306122449, | |
| "grad_norm": 0.009787038899958134, | |
| "learning_rate": 0.0002, | |
| "loss": 0.616807222366333, | |
| "mean_token_accuracy": 0.7485663071274757, | |
| "num_tokens": 15224037.0, | |
| "step": 408 | |
| }, | |
| { | |
| "entropy": 0.6062626764178276, | |
| "epoch": 3.1710398445092323, | |
| "grad_norm": 0.009504587389528751, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6050899624824524, | |
| "mean_token_accuracy": 0.7536401823163033, | |
| "num_tokens": 15261579.0, | |
| "step": 409 | |
| }, | |
| { | |
| "entropy": 0.6065879017114639, | |
| "epoch": 3.1788143828960154, | |
| "grad_norm": 0.008364197798073292, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6022209525108337, | |
| "mean_token_accuracy": 0.7534467577934265, | |
| "num_tokens": 15299024.0, | |
| "step": 410 | |
| }, | |
| { | |
| "entropy": 0.6233559027314186, | |
| "epoch": 3.186588921282799, | |
| "grad_norm": 0.010281233116984367, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6214974522590637, | |
| "mean_token_accuracy": 0.7470389008522034, | |
| "num_tokens": 15336558.0, | |
| "step": 411 | |
| }, | |
| { | |
| "entropy": 0.6087061986327171, | |
| "epoch": 3.194363459669582, | |
| "grad_norm": 0.00957780983299017, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6129252910614014, | |
| "mean_token_accuracy": 0.7495343014597893, | |
| "num_tokens": 15374032.0, | |
| "step": 412 | |
| }, | |
| { | |
| "entropy": 0.596970833837986, | |
| "epoch": 3.2021379980563656, | |
| "grad_norm": 0.00984536949545145, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5985467433929443, | |
| "mean_token_accuracy": 0.7565372809767723, | |
| "num_tokens": 15411483.0, | |
| "step": 413 | |
| }, | |
| { | |
| "entropy": 0.5959193110466003, | |
| "epoch": 3.2099125364431487, | |
| "grad_norm": 0.010170173831284046, | |
| "learning_rate": 0.0002, | |
| "loss": 0.599077045917511, | |
| "mean_token_accuracy": 0.756831057369709, | |
| "num_tokens": 15448812.0, | |
| "step": 414 | |
| }, | |
| { | |
| "entropy": 0.6122774854302406, | |
| "epoch": 3.2176870748299318, | |
| "grad_norm": 0.00988403894007206, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6123433113098145, | |
| "mean_token_accuracy": 0.7474271655082703, | |
| "num_tokens": 15486225.0, | |
| "step": 415 | |
| }, | |
| { | |
| "entropy": 0.5967384874820709, | |
| "epoch": 3.2254616132167153, | |
| "grad_norm": 0.010967456735670567, | |
| "learning_rate": 0.0002, | |
| "loss": 0.60502028465271, | |
| "mean_token_accuracy": 0.75384970754385, | |
| "num_tokens": 15523563.0, | |
| "step": 416 | |
| }, | |
| { | |
| "entropy": 0.5971691235899925, | |
| "epoch": 3.2332361516034984, | |
| "grad_norm": 0.009652617387473583, | |
| "learning_rate": 0.0002, | |
| "loss": 0.596883237361908, | |
| "mean_token_accuracy": 0.7563904896378517, | |
| "num_tokens": 15561284.0, | |
| "step": 417 | |
| }, | |
| { | |
| "entropy": 0.5993461608886719, | |
| "epoch": 3.241010689990282, | |
| "grad_norm": 0.01028553955256939, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5969662666320801, | |
| "mean_token_accuracy": 0.7561450004577637, | |
| "num_tokens": 15598518.0, | |
| "step": 418 | |
| }, | |
| { | |
| "entropy": 0.6052126884460449, | |
| "epoch": 3.248785228377065, | |
| "grad_norm": 0.009491597302258015, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6018233299255371, | |
| "mean_token_accuracy": 0.754707433283329, | |
| "num_tokens": 15636077.0, | |
| "step": 419 | |
| }, | |
| { | |
| "entropy": 0.5944898948073387, | |
| "epoch": 3.256559766763848, | |
| "grad_norm": 0.009509161114692688, | |
| "learning_rate": 0.0002, | |
| "loss": 0.598441481590271, | |
| "mean_token_accuracy": 0.7549791261553764, | |
| "num_tokens": 15673148.0, | |
| "step": 420 | |
| }, | |
| { | |
| "entropy": 0.5968391299247742, | |
| "epoch": 3.2643343051506317, | |
| "grad_norm": 0.012232691049575806, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6061251163482666, | |
| "mean_token_accuracy": 0.7526469007134438, | |
| "num_tokens": 15710778.0, | |
| "step": 421 | |
| }, | |
| { | |
| "entropy": 0.6134240105748177, | |
| "epoch": 3.272108843537415, | |
| "grad_norm": 0.00959104672074318, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6182757616043091, | |
| "mean_token_accuracy": 0.7455755323171616, | |
| "num_tokens": 15748509.0, | |
| "step": 422 | |
| }, | |
| { | |
| "entropy": 0.6232677772641182, | |
| "epoch": 3.2798833819241984, | |
| "grad_norm": 0.008630241267383099, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6197680234909058, | |
| "mean_token_accuracy": 0.7470053881406784, | |
| "num_tokens": 15786160.0, | |
| "step": 423 | |
| }, | |
| { | |
| "entropy": 0.613219253718853, | |
| "epoch": 3.2876579203109815, | |
| "grad_norm": 0.0128620695322752, | |
| "learning_rate": 0.0002, | |
| "loss": 0.607075572013855, | |
| "mean_token_accuracy": 0.7511464059352875, | |
| "num_tokens": 15823826.0, | |
| "step": 424 | |
| }, | |
| { | |
| "entropy": 0.6041038259863853, | |
| "epoch": 3.295432458697765, | |
| "grad_norm": 0.011236878111958504, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6055868864059448, | |
| "mean_token_accuracy": 0.7537136226892471, | |
| "num_tokens": 15861102.0, | |
| "step": 425 | |
| }, | |
| { | |
| "entropy": 0.6037536263465881, | |
| "epoch": 3.303206997084548, | |
| "grad_norm": 0.01190877053886652, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6142691373825073, | |
| "mean_token_accuracy": 0.7493078485131264, | |
| "num_tokens": 15898770.0, | |
| "step": 426 | |
| }, | |
| { | |
| "entropy": 0.5997900441288948, | |
| "epoch": 3.3109815354713312, | |
| "grad_norm": 0.01027680840343237, | |
| "learning_rate": 0.0002, | |
| "loss": 0.606103777885437, | |
| "mean_token_accuracy": 0.7539091035723686, | |
| "num_tokens": 15936500.0, | |
| "step": 427 | |
| }, | |
| { | |
| "entropy": 0.611216127872467, | |
| "epoch": 3.3187560738581148, | |
| "grad_norm": 0.011017821729183197, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6174614429473877, | |
| "mean_token_accuracy": 0.7461550533771515, | |
| "num_tokens": 15974513.0, | |
| "step": 428 | |
| }, | |
| { | |
| "entropy": 0.6048758924007416, | |
| "epoch": 3.326530612244898, | |
| "grad_norm": 0.010105214081704617, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6031618118286133, | |
| "mean_token_accuracy": 0.7546434104442596, | |
| "num_tokens": 16012014.0, | |
| "step": 429 | |
| }, | |
| { | |
| "entropy": 0.6172537207603455, | |
| "epoch": 3.3343051506316814, | |
| "grad_norm": 0.009731764905154705, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6138004064559937, | |
| "mean_token_accuracy": 0.7473105862736702, | |
| "num_tokens": 16049595.0, | |
| "step": 430 | |
| }, | |
| { | |
| "entropy": 0.601245328783989, | |
| "epoch": 3.3420796890184645, | |
| "grad_norm": 0.010152102448046207, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6028028726577759, | |
| "mean_token_accuracy": 0.7536987066268921, | |
| "num_tokens": 16087175.0, | |
| "step": 431 | |
| }, | |
| { | |
| "entropy": 0.6049877479672432, | |
| "epoch": 3.3498542274052476, | |
| "grad_norm": 0.008624416776001453, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6070842742919922, | |
| "mean_token_accuracy": 0.7543686851859093, | |
| "num_tokens": 16124434.0, | |
| "step": 432 | |
| }, | |
| { | |
| "entropy": 0.6113510951399803, | |
| "epoch": 3.357628765792031, | |
| "grad_norm": 0.00979162473231554, | |
| "learning_rate": 0.0002, | |
| "loss": 0.614505410194397, | |
| "mean_token_accuracy": 0.7483974099159241, | |
| "num_tokens": 16161797.0, | |
| "step": 433 | |
| }, | |
| { | |
| "entropy": 0.6149813681840897, | |
| "epoch": 3.3654033041788143, | |
| "grad_norm": 0.009648281149566174, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6138153076171875, | |
| "mean_token_accuracy": 0.7505435049533844, | |
| "num_tokens": 16199386.0, | |
| "step": 434 | |
| }, | |
| { | |
| "entropy": 0.6114403232932091, | |
| "epoch": 3.373177842565598, | |
| "grad_norm": 0.00991707295179367, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6108669638633728, | |
| "mean_token_accuracy": 0.7510098665952682, | |
| "num_tokens": 16236951.0, | |
| "step": 435 | |
| }, | |
| { | |
| "entropy": 0.6059002429246902, | |
| "epoch": 3.380952380952381, | |
| "grad_norm": 0.009901657700538635, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6064650416374207, | |
| "mean_token_accuracy": 0.7527595311403275, | |
| "num_tokens": 16274203.0, | |
| "step": 436 | |
| }, | |
| { | |
| "entropy": 0.6086044162511826, | |
| "epoch": 3.388726919339164, | |
| "grad_norm": 0.011115623638033867, | |
| "learning_rate": 0.0002, | |
| "loss": 0.609772801399231, | |
| "mean_token_accuracy": 0.7524074539542198, | |
| "num_tokens": 16311856.0, | |
| "step": 437 | |
| }, | |
| { | |
| "entropy": 0.6069784238934517, | |
| "epoch": 3.3965014577259476, | |
| "grad_norm": 0.009795066900551319, | |
| "learning_rate": 0.0002, | |
| "loss": 0.60982745885849, | |
| "mean_token_accuracy": 0.7514877542853355, | |
| "num_tokens": 16349625.0, | |
| "step": 438 | |
| }, | |
| { | |
| "entropy": 0.602266825735569, | |
| "epoch": 3.4042759961127307, | |
| "grad_norm": 0.009143724106252193, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6032094359397888, | |
| "mean_token_accuracy": 0.7547830194234848, | |
| "num_tokens": 16387358.0, | |
| "step": 439 | |
| }, | |
| { | |
| "entropy": 0.5899055674672127, | |
| "epoch": 3.4120505344995142, | |
| "grad_norm": 0.009034923277795315, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5931638479232788, | |
| "mean_token_accuracy": 0.7577911838889122, | |
| "num_tokens": 16424225.0, | |
| "step": 440 | |
| }, | |
| { | |
| "entropy": 0.5923598855733871, | |
| "epoch": 3.4198250728862973, | |
| "grad_norm": 0.00976620800793171, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5963320732116699, | |
| "mean_token_accuracy": 0.7556646093726158, | |
| "num_tokens": 16461363.0, | |
| "step": 441 | |
| }, | |
| { | |
| "entropy": 0.6050904020667076, | |
| "epoch": 3.427599611273081, | |
| "grad_norm": 0.010530819185078144, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6116576194763184, | |
| "mean_token_accuracy": 0.7500759586691856, | |
| "num_tokens": 16498597.0, | |
| "step": 442 | |
| }, | |
| { | |
| "entropy": 0.6166655048727989, | |
| "epoch": 3.435374149659864, | |
| "grad_norm": 0.009784851223230362, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6191204786300659, | |
| "mean_token_accuracy": 0.7476971745491028, | |
| "num_tokens": 16535886.0, | |
| "step": 443 | |
| }, | |
| { | |
| "entropy": 0.6059679165482521, | |
| "epoch": 3.443148688046647, | |
| "grad_norm": 0.009777678176760674, | |
| "learning_rate": 0.0002, | |
| "loss": 0.600814700126648, | |
| "mean_token_accuracy": 0.7545428648591042, | |
| "num_tokens": 16573204.0, | |
| "step": 444 | |
| }, | |
| { | |
| "entropy": 0.6082785129547119, | |
| "epoch": 3.4509232264334306, | |
| "grad_norm": 0.009606909938156605, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6063122153282166, | |
| "mean_token_accuracy": 0.7535424381494522, | |
| "num_tokens": 16610341.0, | |
| "step": 445 | |
| }, | |
| { | |
| "entropy": 0.6118370518088341, | |
| "epoch": 3.4586977648202137, | |
| "grad_norm": 0.009755875915288925, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6115654706954956, | |
| "mean_token_accuracy": 0.7514548450708389, | |
| "num_tokens": 16648078.0, | |
| "step": 446 | |
| }, | |
| { | |
| "entropy": 0.5936368778347969, | |
| "epoch": 3.466472303206997, | |
| "grad_norm": 0.011094003915786743, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6031495332717896, | |
| "mean_token_accuracy": 0.75296650826931, | |
| "num_tokens": 16684979.0, | |
| "step": 447 | |
| }, | |
| { | |
| "entropy": 0.5946005135774612, | |
| "epoch": 3.4742468415937804, | |
| "grad_norm": 0.00817946158349514, | |
| "learning_rate": 0.0002, | |
| "loss": 0.597072184085846, | |
| "mean_token_accuracy": 0.756522886455059, | |
| "num_tokens": 16722537.0, | |
| "step": 448 | |
| }, | |
| { | |
| "entropy": 0.6108994483947754, | |
| "epoch": 3.4820213799805635, | |
| "grad_norm": 0.0094683188945055, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6126965284347534, | |
| "mean_token_accuracy": 0.750556543469429, | |
| "num_tokens": 16759490.0, | |
| "step": 449 | |
| }, | |
| { | |
| "entropy": 0.6224265471100807, | |
| "epoch": 3.489795918367347, | |
| "grad_norm": 0.009895196184515953, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6202942132949829, | |
| "mean_token_accuracy": 0.7480411902070045, | |
| "num_tokens": 16797135.0, | |
| "step": 450 | |
| }, | |
| { | |
| "entropy": 0.597562313079834, | |
| "epoch": 3.49757045675413, | |
| "grad_norm": 0.00880007166415453, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5973268151283264, | |
| "mean_token_accuracy": 0.7553020343184471, | |
| "num_tokens": 16834270.0, | |
| "step": 451 | |
| }, | |
| { | |
| "entropy": 0.5932627841830254, | |
| "epoch": 3.5053449951409137, | |
| "grad_norm": 0.009338297881186008, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5983443856239319, | |
| "mean_token_accuracy": 0.7540717199444771, | |
| "num_tokens": 16871670.0, | |
| "step": 452 | |
| }, | |
| { | |
| "entropy": 0.603311225771904, | |
| "epoch": 3.513119533527697, | |
| "grad_norm": 0.009173530153930187, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6072041988372803, | |
| "mean_token_accuracy": 0.752394326031208, | |
| "num_tokens": 16909221.0, | |
| "step": 453 | |
| }, | |
| { | |
| "entropy": 0.6008370220661163, | |
| "epoch": 3.52089407191448, | |
| "grad_norm": 0.009413264691829681, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6025704145431519, | |
| "mean_token_accuracy": 0.7541562095284462, | |
| "num_tokens": 16946802.0, | |
| "step": 454 | |
| }, | |
| { | |
| "entropy": 0.6156598478555679, | |
| "epoch": 3.5286686103012634, | |
| "grad_norm": 0.009066940285265446, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6163049936294556, | |
| "mean_token_accuracy": 0.7471535354852676, | |
| "num_tokens": 16983926.0, | |
| "step": 455 | |
| }, | |
| { | |
| "entropy": 0.6066097542643547, | |
| "epoch": 3.5364431486880465, | |
| "grad_norm": 0.008060373365879059, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6057984828948975, | |
| "mean_token_accuracy": 0.753935232758522, | |
| "num_tokens": 17021676.0, | |
| "step": 456 | |
| }, | |
| { | |
| "entropy": 0.5982315316796303, | |
| "epoch": 3.54421768707483, | |
| "grad_norm": 0.008438881486654282, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6000136137008667, | |
| "mean_token_accuracy": 0.7557498961687088, | |
| "num_tokens": 17059698.0, | |
| "step": 457 | |
| }, | |
| { | |
| "entropy": 0.6007475033402443, | |
| "epoch": 3.551992225461613, | |
| "grad_norm": 0.008833416737616062, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6044740676879883, | |
| "mean_token_accuracy": 0.7540414854884148, | |
| "num_tokens": 17096952.0, | |
| "step": 458 | |
| }, | |
| { | |
| "entropy": 0.6120948642492294, | |
| "epoch": 3.5597667638483967, | |
| "grad_norm": 0.010080665349960327, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6188148260116577, | |
| "mean_token_accuracy": 0.7483313381671906, | |
| "num_tokens": 17134663.0, | |
| "step": 459 | |
| }, | |
| { | |
| "entropy": 0.6083438396453857, | |
| "epoch": 3.56754130223518, | |
| "grad_norm": 0.009289734996855259, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6083492636680603, | |
| "mean_token_accuracy": 0.7500124499201775, | |
| "num_tokens": 17172169.0, | |
| "step": 460 | |
| }, | |
| { | |
| "entropy": 0.6143280863761902, | |
| "epoch": 3.575315840621963, | |
| "grad_norm": 0.010136788710951805, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6146470308303833, | |
| "mean_token_accuracy": 0.749954454600811, | |
| "num_tokens": 17209481.0, | |
| "step": 461 | |
| }, | |
| { | |
| "entropy": 0.6075241789221764, | |
| "epoch": 3.5830903790087465, | |
| "grad_norm": 0.008481534197926521, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6094347238540649, | |
| "mean_token_accuracy": 0.7524155974388123, | |
| "num_tokens": 17246466.0, | |
| "step": 462 | |
| }, | |
| { | |
| "entropy": 0.6080920621752739, | |
| "epoch": 3.5908649173955296, | |
| "grad_norm": 0.009619004093110561, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6094264984130859, | |
| "mean_token_accuracy": 0.752539336681366, | |
| "num_tokens": 17284014.0, | |
| "step": 463 | |
| }, | |
| { | |
| "entropy": 0.5951874181628227, | |
| "epoch": 3.5986394557823127, | |
| "grad_norm": 0.010971908457577229, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5968849062919617, | |
| "mean_token_accuracy": 0.7571029588580132, | |
| "num_tokens": 17321447.0, | |
| "step": 464 | |
| }, | |
| { | |
| "entropy": 0.600244015455246, | |
| "epoch": 3.6064139941690962, | |
| "grad_norm": 0.009995541535317898, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6033259630203247, | |
| "mean_token_accuracy": 0.7534294128417969, | |
| "num_tokens": 17358802.0, | |
| "step": 465 | |
| }, | |
| { | |
| "entropy": 0.6006019562482834, | |
| "epoch": 3.6141885325558794, | |
| "grad_norm": 0.008752602152526379, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6017124652862549, | |
| "mean_token_accuracy": 0.756244920194149, | |
| "num_tokens": 17396188.0, | |
| "step": 466 | |
| }, | |
| { | |
| "entropy": 0.6169783622026443, | |
| "epoch": 3.621963070942663, | |
| "grad_norm": 0.010406076908111572, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6129188537597656, | |
| "mean_token_accuracy": 0.7500476241111755, | |
| "num_tokens": 17433577.0, | |
| "step": 467 | |
| }, | |
| { | |
| "entropy": 0.6030160784721375, | |
| "epoch": 3.629737609329446, | |
| "grad_norm": 0.009500440210103989, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6009221076965332, | |
| "mean_token_accuracy": 0.7557852789759636, | |
| "num_tokens": 17471102.0, | |
| "step": 468 | |
| }, | |
| { | |
| "entropy": 0.5835254713892937, | |
| "epoch": 3.6375121477162295, | |
| "grad_norm": 0.009339805692434311, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5876451730728149, | |
| "mean_token_accuracy": 0.7601824253797531, | |
| "num_tokens": 17508438.0, | |
| "step": 469 | |
| }, | |
| { | |
| "entropy": 0.6057174652814865, | |
| "epoch": 3.6452866861030127, | |
| "grad_norm": 0.010681871324777603, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6165672540664673, | |
| "mean_token_accuracy": 0.7476890683174133, | |
| "num_tokens": 17546176.0, | |
| "step": 470 | |
| }, | |
| { | |
| "entropy": 0.6023501753807068, | |
| "epoch": 3.6530612244897958, | |
| "grad_norm": 0.009493213146924973, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6091412305831909, | |
| "mean_token_accuracy": 0.7539057731628418, | |
| "num_tokens": 17583501.0, | |
| "step": 471 | |
| }, | |
| { | |
| "entropy": 0.6135850101709366, | |
| "epoch": 3.6608357628765793, | |
| "grad_norm": 0.009873135015368462, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6167327165603638, | |
| "mean_token_accuracy": 0.7497850060462952, | |
| "num_tokens": 17620694.0, | |
| "step": 472 | |
| }, | |
| { | |
| "entropy": 0.6023069024085999, | |
| "epoch": 3.6686103012633624, | |
| "grad_norm": 0.009261439554393291, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5992604494094849, | |
| "mean_token_accuracy": 0.7568845972418785, | |
| "num_tokens": 17657846.0, | |
| "step": 473 | |
| }, | |
| { | |
| "entropy": 0.6220817118883133, | |
| "epoch": 3.6763848396501455, | |
| "grad_norm": 0.008002927526831627, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6206220984458923, | |
| "mean_token_accuracy": 0.7471845746040344, | |
| "num_tokens": 17695493.0, | |
| "step": 474 | |
| }, | |
| { | |
| "entropy": 0.6081802695989609, | |
| "epoch": 3.684159378036929, | |
| "grad_norm": 0.008587166666984558, | |
| "learning_rate": 0.0002, | |
| "loss": 0.607234001159668, | |
| "mean_token_accuracy": 0.755810484290123, | |
| "num_tokens": 17732856.0, | |
| "step": 475 | |
| }, | |
| { | |
| "entropy": 0.6025589928030968, | |
| "epoch": 3.6919339164237126, | |
| "grad_norm": 0.009315953589975834, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6054584383964539, | |
| "mean_token_accuracy": 0.7516716048121452, | |
| "num_tokens": 17769974.0, | |
| "step": 476 | |
| }, | |
| { | |
| "entropy": 0.6041041016578674, | |
| "epoch": 3.6997084548104957, | |
| "grad_norm": 0.009252023883163929, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6035861968994141, | |
| "mean_token_accuracy": 0.754462331533432, | |
| "num_tokens": 17807234.0, | |
| "step": 477 | |
| }, | |
| { | |
| "entropy": 0.6150568872690201, | |
| "epoch": 3.707482993197279, | |
| "grad_norm": 0.009806321002542973, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6143267154693604, | |
| "mean_token_accuracy": 0.7500679716467857, | |
| "num_tokens": 17844713.0, | |
| "step": 478 | |
| }, | |
| { | |
| "entropy": 0.6017017439007759, | |
| "epoch": 3.7152575315840624, | |
| "grad_norm": 0.009355618618428707, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6050205230712891, | |
| "mean_token_accuracy": 0.7535286843776703, | |
| "num_tokens": 17882167.0, | |
| "step": 479 | |
| }, | |
| { | |
| "entropy": 0.6020700857043266, | |
| "epoch": 3.7230320699708455, | |
| "grad_norm": 0.010259266011416912, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6069679856300354, | |
| "mean_token_accuracy": 0.7521628364920616, | |
| "num_tokens": 17919373.0, | |
| "step": 480 | |
| }, | |
| { | |
| "entropy": 0.6041392460465431, | |
| "epoch": 3.7308066083576286, | |
| "grad_norm": 0.008957406505942345, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6065245270729065, | |
| "mean_token_accuracy": 0.7511508986353874, | |
| "num_tokens": 17956544.0, | |
| "step": 481 | |
| }, | |
| { | |
| "entropy": 0.6143322214484215, | |
| "epoch": 3.738581146744412, | |
| "grad_norm": 0.010185849852859974, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6167340278625488, | |
| "mean_token_accuracy": 0.7486473768949509, | |
| "num_tokens": 17993752.0, | |
| "step": 482 | |
| }, | |
| { | |
| "entropy": 0.597200371325016, | |
| "epoch": 3.746355685131195, | |
| "grad_norm": 0.009210821241140366, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5978806018829346, | |
| "mean_token_accuracy": 0.7557302191853523, | |
| "num_tokens": 18031025.0, | |
| "step": 483 | |
| }, | |
| { | |
| "entropy": 0.6069202646613121, | |
| "epoch": 3.7541302235179788, | |
| "grad_norm": 0.011117368005216122, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6108845472335815, | |
| "mean_token_accuracy": 0.7496053129434586, | |
| "num_tokens": 18067927.0, | |
| "step": 484 | |
| }, | |
| { | |
| "entropy": 0.6041139885783195, | |
| "epoch": 3.761904761904762, | |
| "grad_norm": 0.00938522256910801, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6076387166976929, | |
| "mean_token_accuracy": 0.7511148899793625, | |
| "num_tokens": 18105521.0, | |
| "step": 485 | |
| }, | |
| { | |
| "entropy": 0.5986451655626297, | |
| "epoch": 3.7696793002915454, | |
| "grad_norm": 0.009973375126719475, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6053519248962402, | |
| "mean_token_accuracy": 0.7534126862883568, | |
| "num_tokens": 18142635.0, | |
| "step": 486 | |
| }, | |
| { | |
| "entropy": 0.6009933426976204, | |
| "epoch": 3.7774538386783285, | |
| "grad_norm": 0.008744049817323685, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6009329557418823, | |
| "mean_token_accuracy": 0.7565900459885597, | |
| "num_tokens": 18179737.0, | |
| "step": 487 | |
| }, | |
| { | |
| "entropy": 0.6145603656768799, | |
| "epoch": 3.7852283770651116, | |
| "grad_norm": 0.008431525900959969, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6102414727210999, | |
| "mean_token_accuracy": 0.7497778162360191, | |
| "num_tokens": 18216997.0, | |
| "step": 488 | |
| }, | |
| { | |
| "entropy": 0.6055081114172935, | |
| "epoch": 3.793002915451895, | |
| "grad_norm": 0.00999277364462614, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6034255623817444, | |
| "mean_token_accuracy": 0.7561624273657799, | |
| "num_tokens": 18254319.0, | |
| "step": 489 | |
| }, | |
| { | |
| "entropy": 0.5926950201392174, | |
| "epoch": 3.8007774538386783, | |
| "grad_norm": 0.008595049381256104, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5922105312347412, | |
| "mean_token_accuracy": 0.7585625573992729, | |
| "num_tokens": 18291224.0, | |
| "step": 490 | |
| }, | |
| { | |
| "entropy": 0.6234352439641953, | |
| "epoch": 3.8085519922254614, | |
| "grad_norm": 0.009778706356883049, | |
| "learning_rate": 0.0002, | |
| "loss": 0.628953754901886, | |
| "mean_token_accuracy": 0.743121363222599, | |
| "num_tokens": 18328744.0, | |
| "step": 491 | |
| }, | |
| { | |
| "entropy": 0.6095947250723839, | |
| "epoch": 3.816326530612245, | |
| "grad_norm": 0.009355447255074978, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6148620843887329, | |
| "mean_token_accuracy": 0.7512015551328659, | |
| "num_tokens": 18366284.0, | |
| "step": 492 | |
| }, | |
| { | |
| "entropy": 0.6000761389732361, | |
| "epoch": 3.824101068999028, | |
| "grad_norm": 0.00857703946530819, | |
| "learning_rate": 0.0002, | |
| "loss": 0.604392409324646, | |
| "mean_token_accuracy": 0.7549523860216141, | |
| "num_tokens": 18403721.0, | |
| "step": 493 | |
| }, | |
| { | |
| "entropy": 0.5995704010128975, | |
| "epoch": 3.8318756073858116, | |
| "grad_norm": 0.010483372025191784, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6008812785148621, | |
| "mean_token_accuracy": 0.7550973892211914, | |
| "num_tokens": 18440931.0, | |
| "step": 494 | |
| }, | |
| { | |
| "entropy": 0.6065568849444389, | |
| "epoch": 3.8396501457725947, | |
| "grad_norm": 0.00975153036415577, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6107536554336548, | |
| "mean_token_accuracy": 0.7495853081345558, | |
| "num_tokens": 18478285.0, | |
| "step": 495 | |
| }, | |
| { | |
| "entropy": 0.6092389151453972, | |
| "epoch": 3.847424684159378, | |
| "grad_norm": 0.008589878678321838, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6096630096435547, | |
| "mean_token_accuracy": 0.7536827027797699, | |
| "num_tokens": 18515709.0, | |
| "step": 496 | |
| }, | |
| { | |
| "entropy": 0.5968381017446518, | |
| "epoch": 3.8551992225461613, | |
| "grad_norm": 0.011193851009011269, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6000962257385254, | |
| "mean_token_accuracy": 0.7573477849364281, | |
| "num_tokens": 18553032.0, | |
| "step": 497 | |
| }, | |
| { | |
| "entropy": 0.6045369654893875, | |
| "epoch": 3.8629737609329444, | |
| "grad_norm": 0.009280527010560036, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6028830409049988, | |
| "mean_token_accuracy": 0.7542475759983063, | |
| "num_tokens": 18590308.0, | |
| "step": 498 | |
| }, | |
| { | |
| "entropy": 0.6031981706619263, | |
| "epoch": 3.870748299319728, | |
| "grad_norm": 0.009086862206459045, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6040035486221313, | |
| "mean_token_accuracy": 0.7532067000865936, | |
| "num_tokens": 18627503.0, | |
| "step": 499 | |
| }, | |
| { | |
| "entropy": 0.6000340953469276, | |
| "epoch": 3.878522837706511, | |
| "grad_norm": 0.008906064555048943, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6016078591346741, | |
| "mean_token_accuracy": 0.7553933039307594, | |
| "num_tokens": 18664999.0, | |
| "step": 500 | |
| }, | |
| { | |
| "entropy": 0.613756813108921, | |
| "epoch": 3.8862973760932946, | |
| "grad_norm": 0.00961924996227026, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6131439208984375, | |
| "mean_token_accuracy": 0.7474770769476891, | |
| "num_tokens": 18702736.0, | |
| "step": 501 | |
| }, | |
| { | |
| "entropy": 0.6073272302746773, | |
| "epoch": 3.8940719144800777, | |
| "grad_norm": 0.008611987344920635, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6086411476135254, | |
| "mean_token_accuracy": 0.7537659332156181, | |
| "num_tokens": 18740002.0, | |
| "step": 502 | |
| }, | |
| { | |
| "entropy": 0.5979632884263992, | |
| "epoch": 3.9018464528668613, | |
| "grad_norm": 0.008601277135312557, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5986984968185425, | |
| "mean_token_accuracy": 0.7558256238698959, | |
| "num_tokens": 18777409.0, | |
| "step": 503 | |
| }, | |
| { | |
| "entropy": 0.5990572273731232, | |
| "epoch": 3.9096209912536444, | |
| "grad_norm": 0.009787015616893768, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5969674587249756, | |
| "mean_token_accuracy": 0.7572850733995438, | |
| "num_tokens": 18814832.0, | |
| "step": 504 | |
| }, | |
| { | |
| "entropy": 0.5952424928545952, | |
| "epoch": 3.9173955296404275, | |
| "grad_norm": 0.009869958274066448, | |
| "learning_rate": 0.0002, | |
| "loss": 0.600977897644043, | |
| "mean_token_accuracy": 0.7555051743984222, | |
| "num_tokens": 18852288.0, | |
| "step": 505 | |
| }, | |
| { | |
| "entropy": 0.5953851416707039, | |
| "epoch": 3.925170068027211, | |
| "grad_norm": 0.009635512717068195, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5988470315933228, | |
| "mean_token_accuracy": 0.7552962228655815, | |
| "num_tokens": 18889544.0, | |
| "step": 506 | |
| }, | |
| { | |
| "entropy": 0.6188566163182259, | |
| "epoch": 3.932944606413994, | |
| "grad_norm": 0.00981516670435667, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6207889914512634, | |
| "mean_token_accuracy": 0.748513400554657, | |
| "num_tokens": 18927252.0, | |
| "step": 507 | |
| }, | |
| { | |
| "entropy": 0.6106720492243767, | |
| "epoch": 3.9407191448007772, | |
| "grad_norm": 0.011930068954825401, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6130895614624023, | |
| "mean_token_accuracy": 0.7500510811805725, | |
| "num_tokens": 18964681.0, | |
| "step": 508 | |
| }, | |
| { | |
| "entropy": 0.6134953126311302, | |
| "epoch": 3.9484936831875608, | |
| "grad_norm": 0.009485729970037937, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6170802116394043, | |
| "mean_token_accuracy": 0.7490968182682991, | |
| "num_tokens": 19002066.0, | |
| "step": 509 | |
| }, | |
| { | |
| "entropy": 0.6209791451692581, | |
| "epoch": 3.956268221574344, | |
| "grad_norm": 0.009478907100856304, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6176908612251282, | |
| "mean_token_accuracy": 0.7488641366362572, | |
| "num_tokens": 19039553.0, | |
| "step": 510 | |
| }, | |
| { | |
| "entropy": 0.6174532473087311, | |
| "epoch": 3.9640427599611274, | |
| "grad_norm": 0.010146988555788994, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6160500049591064, | |
| "mean_token_accuracy": 0.7503278478980064, | |
| "num_tokens": 19076777.0, | |
| "step": 511 | |
| }, | |
| { | |
| "entropy": 0.6139644980430603, | |
| "epoch": 3.9718172983479105, | |
| "grad_norm": 0.009649143554270267, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6151527166366577, | |
| "mean_token_accuracy": 0.7500214949250221, | |
| "num_tokens": 19114295.0, | |
| "step": 512 | |
| }, | |
| { | |
| "entropy": 0.5903387889266014, | |
| "epoch": 3.979591836734694, | |
| "grad_norm": 0.009517780505120754, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5949221253395081, | |
| "mean_token_accuracy": 0.7585930302739143, | |
| "num_tokens": 19151608.0, | |
| "step": 513 | |
| }, | |
| { | |
| "entropy": 0.60362558811903, | |
| "epoch": 3.987366375121477, | |
| "grad_norm": 0.008633180521428585, | |
| "learning_rate": 0.0002, | |
| "loss": 0.606721818447113, | |
| "mean_token_accuracy": 0.7524262145161629, | |
| "num_tokens": 19189092.0, | |
| "step": 514 | |
| }, | |
| { | |
| "entropy": 0.6161174476146698, | |
| "epoch": 3.9951409135082603, | |
| "grad_norm": 0.00904986634850502, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6170212030410767, | |
| "mean_token_accuracy": 0.7481908574700356, | |
| "num_tokens": 19226930.0, | |
| "step": 515 | |
| }, | |
| { | |
| "entropy": 0.6157908320426941, | |
| "epoch": 4.0, | |
| "grad_norm": 0.011043760925531387, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6197408437728882, | |
| "mean_token_accuracy": 0.7473827481269837, | |
| "num_tokens": 19250261.0, | |
| "step": 516 | |
| }, | |
| { | |
| "entropy": 0.5984989553689957, | |
| "epoch": 4.0077745383867835, | |
| "grad_norm": 0.010571295395493507, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5962023138999939, | |
| "mean_token_accuracy": 0.7551586180925369, | |
| "num_tokens": 19287781.0, | |
| "step": 517 | |
| }, | |
| { | |
| "entropy": 0.5755362883210182, | |
| "epoch": 4.015549076773566, | |
| "grad_norm": 0.01085303071886301, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5781339406967163, | |
| "mean_token_accuracy": 0.763518862426281, | |
| "num_tokens": 19324763.0, | |
| "step": 518 | |
| }, | |
| { | |
| "entropy": 0.5975531563162804, | |
| "epoch": 4.02332361516035, | |
| "grad_norm": 0.009798814542591572, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6017999649047852, | |
| "mean_token_accuracy": 0.7532066255807877, | |
| "num_tokens": 19362451.0, | |
| "step": 519 | |
| }, | |
| { | |
| "entropy": 0.5838107392191887, | |
| "epoch": 4.031098153547133, | |
| "grad_norm": 0.011370974592864513, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5857977867126465, | |
| "mean_token_accuracy": 0.7589215487241745, | |
| "num_tokens": 19399597.0, | |
| "step": 520 | |
| }, | |
| { | |
| "entropy": 0.586229719221592, | |
| "epoch": 4.038872691933917, | |
| "grad_norm": 0.010519232600927353, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5870205760002136, | |
| "mean_token_accuracy": 0.7586957290768623, | |
| "num_tokens": 19436947.0, | |
| "step": 521 | |
| }, | |
| { | |
| "entropy": 0.5909631699323654, | |
| "epoch": 4.0466472303206995, | |
| "grad_norm": 0.011675548739731312, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5927350521087646, | |
| "mean_token_accuracy": 0.7586767747998238, | |
| "num_tokens": 19474464.0, | |
| "step": 522 | |
| }, | |
| { | |
| "entropy": 0.602616548538208, | |
| "epoch": 4.054421768707483, | |
| "grad_norm": 0.01183371152728796, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6010576486587524, | |
| "mean_token_accuracy": 0.753461204469204, | |
| "num_tokens": 19512364.0, | |
| "step": 523 | |
| }, | |
| { | |
| "entropy": 0.5877483561635017, | |
| "epoch": 4.062196307094267, | |
| "grad_norm": 0.011604937724769115, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5869612693786621, | |
| "mean_token_accuracy": 0.7605117782950401, | |
| "num_tokens": 19549629.0, | |
| "step": 524 | |
| }, | |
| { | |
| "entropy": 0.5913394093513489, | |
| "epoch": 4.069970845481049, | |
| "grad_norm": 0.010066917166113853, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5947997570037842, | |
| "mean_token_accuracy": 0.755763366818428, | |
| "num_tokens": 19586996.0, | |
| "step": 525 | |
| }, | |
| { | |
| "entropy": 0.5896845906972885, | |
| "epoch": 4.077745383867833, | |
| "grad_norm": 0.013865236192941666, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5975737571716309, | |
| "mean_token_accuracy": 0.756596714258194, | |
| "num_tokens": 19624454.0, | |
| "step": 526 | |
| }, | |
| { | |
| "entropy": 0.6071945577859879, | |
| "epoch": 4.085519922254616, | |
| "grad_norm": 0.01125173456966877, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6075310707092285, | |
| "mean_token_accuracy": 0.7516418322920799, | |
| "num_tokens": 19662369.0, | |
| "step": 527 | |
| }, | |
| { | |
| "entropy": 0.6004839465022087, | |
| "epoch": 4.093294460641399, | |
| "grad_norm": 0.012244274839758873, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5988795161247253, | |
| "mean_token_accuracy": 0.7533307895064354, | |
| "num_tokens": 19699833.0, | |
| "step": 528 | |
| }, | |
| { | |
| "entropy": 0.5805928781628609, | |
| "epoch": 4.101068999028183, | |
| "grad_norm": 0.012553567998111248, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5836637616157532, | |
| "mean_token_accuracy": 0.7613400369882584, | |
| "num_tokens": 19736626.0, | |
| "step": 529 | |
| }, | |
| { | |
| "entropy": 0.5802028924226761, | |
| "epoch": 4.108843537414966, | |
| "grad_norm": 0.013091178610920906, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5839430093765259, | |
| "mean_token_accuracy": 0.7619325369596481, | |
| "num_tokens": 19773772.0, | |
| "step": 530 | |
| }, | |
| { | |
| "entropy": 0.5931153893470764, | |
| "epoch": 4.11661807580175, | |
| "grad_norm": 0.0117764538154006, | |
| "learning_rate": 0.0002, | |
| "loss": 0.598299503326416, | |
| "mean_token_accuracy": 0.755822129547596, | |
| "num_tokens": 19810974.0, | |
| "step": 531 | |
| }, | |
| { | |
| "entropy": 0.6081870496273041, | |
| "epoch": 4.124392614188532, | |
| "grad_norm": 0.013240421190857887, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6058256030082703, | |
| "mean_token_accuracy": 0.7531123831868172, | |
| "num_tokens": 19848433.0, | |
| "step": 532 | |
| }, | |
| { | |
| "entropy": 0.6002762466669083, | |
| "epoch": 4.132167152575316, | |
| "grad_norm": 0.010874156840145588, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5934455990791321, | |
| "mean_token_accuracy": 0.7567582130432129, | |
| "num_tokens": 19885930.0, | |
| "step": 533 | |
| }, | |
| { | |
| "entropy": 0.604529857635498, | |
| "epoch": 4.139941690962099, | |
| "grad_norm": 0.011289739049971104, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6058647632598877, | |
| "mean_token_accuracy": 0.7521885484457016, | |
| "num_tokens": 19923130.0, | |
| "step": 534 | |
| }, | |
| { | |
| "entropy": 0.5959961265325546, | |
| "epoch": 4.147716229348882, | |
| "grad_norm": 0.0105770044028759, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5998325347900391, | |
| "mean_token_accuracy": 0.7545555010437965, | |
| "num_tokens": 19960651.0, | |
| "step": 535 | |
| }, | |
| { | |
| "entropy": 0.6115074902772903, | |
| "epoch": 4.155490767735666, | |
| "grad_norm": 0.01272744033485651, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6133629083633423, | |
| "mean_token_accuracy": 0.7504753991961479, | |
| "num_tokens": 19998458.0, | |
| "step": 536 | |
| }, | |
| { | |
| "entropy": 0.5959336087107658, | |
| "epoch": 4.163265306122449, | |
| "grad_norm": 0.01114166434854269, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5921066403388977, | |
| "mean_token_accuracy": 0.7599503472447395, | |
| "num_tokens": 20035742.0, | |
| "step": 537 | |
| }, | |
| { | |
| "entropy": 0.6055325567722321, | |
| "epoch": 4.171039844509233, | |
| "grad_norm": 0.01163046807050705, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6048938035964966, | |
| "mean_token_accuracy": 0.7535717412829399, | |
| "num_tokens": 20073263.0, | |
| "step": 538 | |
| }, | |
| { | |
| "entropy": 0.5937555730342865, | |
| "epoch": 4.178814382896015, | |
| "grad_norm": 0.010925386101007462, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5978741645812988, | |
| "mean_token_accuracy": 0.7580423355102539, | |
| "num_tokens": 20110930.0, | |
| "step": 539 | |
| }, | |
| { | |
| "entropy": 0.6025584638118744, | |
| "epoch": 4.186588921282799, | |
| "grad_norm": 0.013231265358626842, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6098158955574036, | |
| "mean_token_accuracy": 0.7506869807839394, | |
| "num_tokens": 20148878.0, | |
| "step": 540 | |
| }, | |
| { | |
| "entropy": 0.5955850780010223, | |
| "epoch": 4.1943634596695825, | |
| "grad_norm": 0.01381654478609562, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6050733327865601, | |
| "mean_token_accuracy": 0.7540115043520927, | |
| "num_tokens": 20186590.0, | |
| "step": 541 | |
| }, | |
| { | |
| "entropy": 0.6100573241710663, | |
| "epoch": 4.202137998056365, | |
| "grad_norm": 0.01217405591160059, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6091620922088623, | |
| "mean_token_accuracy": 0.7501495629549026, | |
| "num_tokens": 20224026.0, | |
| "step": 542 | |
| }, | |
| { | |
| "entropy": 0.6055784001946449, | |
| "epoch": 4.209912536443149, | |
| "grad_norm": 0.01034702267497778, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6047437191009521, | |
| "mean_token_accuracy": 0.7533470839262009, | |
| "num_tokens": 20261538.0, | |
| "step": 543 | |
| }, | |
| { | |
| "entropy": 0.5968894883990288, | |
| "epoch": 4.217687074829932, | |
| "grad_norm": 0.013704034499824047, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6015293002128601, | |
| "mean_token_accuracy": 0.7537187412381172, | |
| "num_tokens": 20298484.0, | |
| "step": 544 | |
| }, | |
| { | |
| "entropy": 0.5940377935767174, | |
| "epoch": 4.225461613216715, | |
| "grad_norm": 0.011667119339108467, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5925427079200745, | |
| "mean_token_accuracy": 0.7584238648414612, | |
| "num_tokens": 20336353.0, | |
| "step": 545 | |
| }, | |
| { | |
| "entropy": 0.6106893792748451, | |
| "epoch": 4.233236151603498, | |
| "grad_norm": 0.01224418543279171, | |
| "learning_rate": 0.0002, | |
| "loss": 0.611664891242981, | |
| "mean_token_accuracy": 0.7507496625185013, | |
| "num_tokens": 20374019.0, | |
| "step": 546 | |
| }, | |
| { | |
| "entropy": 0.6042328551411629, | |
| "epoch": 4.241010689990282, | |
| "grad_norm": 0.01316764671355486, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6062799096107483, | |
| "mean_token_accuracy": 0.7534623667597771, | |
| "num_tokens": 20411398.0, | |
| "step": 547 | |
| }, | |
| { | |
| "entropy": 0.6105416268110275, | |
| "epoch": 4.2487852283770655, | |
| "grad_norm": 0.012853113003075123, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6092797517776489, | |
| "mean_token_accuracy": 0.7522982135415077, | |
| "num_tokens": 20448672.0, | |
| "step": 548 | |
| }, | |
| { | |
| "entropy": 0.5981989204883575, | |
| "epoch": 4.256559766763848, | |
| "grad_norm": 0.011458336375653744, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5959842205047607, | |
| "mean_token_accuracy": 0.7573426440358162, | |
| "num_tokens": 20486126.0, | |
| "step": 549 | |
| }, | |
| { | |
| "entropy": 0.5939232558012009, | |
| "epoch": 4.264334305150632, | |
| "grad_norm": 0.013793280348181725, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6013151407241821, | |
| "mean_token_accuracy": 0.7532796338200569, | |
| "num_tokens": 20523335.0, | |
| "step": 550 | |
| }, | |
| { | |
| "entropy": 0.5925507992506027, | |
| "epoch": 4.272108843537415, | |
| "grad_norm": 0.012333216145634651, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5946025848388672, | |
| "mean_token_accuracy": 0.7598577961325645, | |
| "num_tokens": 20560754.0, | |
| "step": 551 | |
| }, | |
| { | |
| "entropy": 0.6068093478679657, | |
| "epoch": 4.279883381924198, | |
| "grad_norm": 0.012082048691809177, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6070762872695923, | |
| "mean_token_accuracy": 0.7520242631435394, | |
| "num_tokens": 20598383.0, | |
| "step": 552 | |
| }, | |
| { | |
| "entropy": 0.5919818729162216, | |
| "epoch": 4.2876579203109815, | |
| "grad_norm": 0.011891715228557587, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5928791761398315, | |
| "mean_token_accuracy": 0.7572562247514725, | |
| "num_tokens": 20635386.0, | |
| "step": 553 | |
| }, | |
| { | |
| "entropy": 0.6074100211262703, | |
| "epoch": 4.295432458697765, | |
| "grad_norm": 0.014123337343335152, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6073712706565857, | |
| "mean_token_accuracy": 0.751992791891098, | |
| "num_tokens": 20672892.0, | |
| "step": 554 | |
| }, | |
| { | |
| "entropy": 0.5886855572462082, | |
| "epoch": 4.303206997084548, | |
| "grad_norm": 0.0101819122210145, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5912100076675415, | |
| "mean_token_accuracy": 0.7583736777305603, | |
| "num_tokens": 20710466.0, | |
| "step": 555 | |
| }, | |
| { | |
| "entropy": 0.6005367860198021, | |
| "epoch": 4.310981535471331, | |
| "grad_norm": 0.014812132343649864, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6055353879928589, | |
| "mean_token_accuracy": 0.7521958500146866, | |
| "num_tokens": 20747846.0, | |
| "step": 556 | |
| }, | |
| { | |
| "entropy": 0.5981654673814774, | |
| "epoch": 4.318756073858115, | |
| "grad_norm": 0.011666829697787762, | |
| "learning_rate": 0.0002, | |
| "loss": 0.597842276096344, | |
| "mean_token_accuracy": 0.7551755681633949, | |
| "num_tokens": 20784741.0, | |
| "step": 557 | |
| }, | |
| { | |
| "entropy": 0.5991752445697784, | |
| "epoch": 4.326530612244898, | |
| "grad_norm": 0.012378910556435585, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5976471900939941, | |
| "mean_token_accuracy": 0.7547527700662613, | |
| "num_tokens": 20822385.0, | |
| "step": 558 | |
| }, | |
| { | |
| "entropy": 0.6060795336961746, | |
| "epoch": 4.334305150631681, | |
| "grad_norm": 0.012490339577198029, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6054461002349854, | |
| "mean_token_accuracy": 0.7526181265711784, | |
| "num_tokens": 20860006.0, | |
| "step": 559 | |
| }, | |
| { | |
| "entropy": 0.6072399467229843, | |
| "epoch": 4.3420796890184645, | |
| "grad_norm": 0.014051525853574276, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6056400537490845, | |
| "mean_token_accuracy": 0.7516866251826286, | |
| "num_tokens": 20897385.0, | |
| "step": 560 | |
| }, | |
| { | |
| "entropy": 0.5980757176876068, | |
| "epoch": 4.349854227405248, | |
| "grad_norm": 0.011723170056939125, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5963304042816162, | |
| "mean_token_accuracy": 0.758495531976223, | |
| "num_tokens": 20934914.0, | |
| "step": 561 | |
| }, | |
| { | |
| "entropy": 0.5847646594047546, | |
| "epoch": 4.357628765792031, | |
| "grad_norm": 0.013849250972270966, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5895295143127441, | |
| "mean_token_accuracy": 0.7575425952672958, | |
| "num_tokens": 20972211.0, | |
| "step": 562 | |
| }, | |
| { | |
| "entropy": 0.5863577350974083, | |
| "epoch": 4.365403304178814, | |
| "grad_norm": 0.01223720796406269, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5942325592041016, | |
| "mean_token_accuracy": 0.7572259679436684, | |
| "num_tokens": 21009384.0, | |
| "step": 563 | |
| }, | |
| { | |
| "entropy": 0.5997140482068062, | |
| "epoch": 4.373177842565598, | |
| "grad_norm": 0.014335358515381813, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6024245619773865, | |
| "mean_token_accuracy": 0.7510812431573868, | |
| "num_tokens": 21046739.0, | |
| "step": 564 | |
| }, | |
| { | |
| "entropy": 0.6076342239975929, | |
| "epoch": 4.380952380952381, | |
| "grad_norm": 0.012497556395828724, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6062162518501282, | |
| "mean_token_accuracy": 0.7522109970450401, | |
| "num_tokens": 21084263.0, | |
| "step": 565 | |
| }, | |
| { | |
| "entropy": 0.6001847013831139, | |
| "epoch": 4.388726919339164, | |
| "grad_norm": 0.010952596552670002, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6020297408103943, | |
| "mean_token_accuracy": 0.753420390188694, | |
| "num_tokens": 21121894.0, | |
| "step": 566 | |
| }, | |
| { | |
| "entropy": 0.6051000133156776, | |
| "epoch": 4.396501457725948, | |
| "grad_norm": 0.013345146551728249, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6103641986846924, | |
| "mean_token_accuracy": 0.7505576461553574, | |
| "num_tokens": 21159434.0, | |
| "step": 567 | |
| }, | |
| { | |
| "entropy": 0.5888576209545135, | |
| "epoch": 4.404275996112731, | |
| "grad_norm": 0.011659773997962475, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5904802680015564, | |
| "mean_token_accuracy": 0.7587999328970909, | |
| "num_tokens": 21197109.0, | |
| "step": 568 | |
| }, | |
| { | |
| "entropy": 0.6007365435361862, | |
| "epoch": 4.412050534499514, | |
| "grad_norm": 0.010827448219060898, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6000881195068359, | |
| "mean_token_accuracy": 0.7543788328766823, | |
| "num_tokens": 21234413.0, | |
| "step": 569 | |
| }, | |
| { | |
| "entropy": 0.5974342674016953, | |
| "epoch": 4.419825072886297, | |
| "grad_norm": 0.012830649502575397, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6020520925521851, | |
| "mean_token_accuracy": 0.7534354031085968, | |
| "num_tokens": 21271758.0, | |
| "step": 570 | |
| }, | |
| { | |
| "entropy": 0.6090180650353432, | |
| "epoch": 4.427599611273081, | |
| "grad_norm": 0.012071631848812103, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6067869663238525, | |
| "mean_token_accuracy": 0.7518825978040695, | |
| "num_tokens": 21309387.0, | |
| "step": 571 | |
| }, | |
| { | |
| "entropy": 0.5914840847253799, | |
| "epoch": 4.4353741496598635, | |
| "grad_norm": 0.013224054127931595, | |
| "learning_rate": 0.0002, | |
| "loss": 0.595637857913971, | |
| "mean_token_accuracy": 0.7551431059837341, | |
| "num_tokens": 21346475.0, | |
| "step": 572 | |
| }, | |
| { | |
| "entropy": 0.5997625440359116, | |
| "epoch": 4.443148688046647, | |
| "grad_norm": 0.011799960397183895, | |
| "learning_rate": 0.0002, | |
| "loss": 0.602319598197937, | |
| "mean_token_accuracy": 0.7539779245853424, | |
| "num_tokens": 21383957.0, | |
| "step": 573 | |
| }, | |
| { | |
| "entropy": 0.6102292612195015, | |
| "epoch": 4.450923226433431, | |
| "grad_norm": 0.01201384887099266, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6108826398849487, | |
| "mean_token_accuracy": 0.7517506182193756, | |
| "num_tokens": 21421332.0, | |
| "step": 574 | |
| }, | |
| { | |
| "entropy": 0.5991413816809654, | |
| "epoch": 4.458697764820214, | |
| "grad_norm": 0.010899091139435768, | |
| "learning_rate": 0.0002, | |
| "loss": 0.596094012260437, | |
| "mean_token_accuracy": 0.7565351948142052, | |
| "num_tokens": 21458719.0, | |
| "step": 575 | |
| }, | |
| { | |
| "entropy": 0.5933232456445694, | |
| "epoch": 4.466472303206997, | |
| "grad_norm": 0.010439079254865646, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5930327773094177, | |
| "mean_token_accuracy": 0.7583755627274513, | |
| "num_tokens": 21496264.0, | |
| "step": 576 | |
| }, | |
| { | |
| "entropy": 0.6057801619172096, | |
| "epoch": 4.47424684159378, | |
| "grad_norm": 0.011234867386519909, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6073678135871887, | |
| "mean_token_accuracy": 0.7530662715435028, | |
| "num_tokens": 21533621.0, | |
| "step": 577 | |
| }, | |
| { | |
| "entropy": 0.6064127087593079, | |
| "epoch": 4.482021379980564, | |
| "grad_norm": 0.01104860007762909, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6121537685394287, | |
| "mean_token_accuracy": 0.7498331218957901, | |
| "num_tokens": 21570804.0, | |
| "step": 578 | |
| }, | |
| { | |
| "entropy": 0.5948187559843063, | |
| "epoch": 4.489795918367347, | |
| "grad_norm": 0.01251922082155943, | |
| "learning_rate": 0.0002, | |
| "loss": 0.598996102809906, | |
| "mean_token_accuracy": 0.7545123025774956, | |
| "num_tokens": 21607975.0, | |
| "step": 579 | |
| }, | |
| { | |
| "entropy": 0.614658959209919, | |
| "epoch": 4.49757045675413, | |
| "grad_norm": 0.010701852850615978, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6137805581092834, | |
| "mean_token_accuracy": 0.7465793862938881, | |
| "num_tokens": 21645423.0, | |
| "step": 580 | |
| }, | |
| { | |
| "entropy": 0.5894118696451187, | |
| "epoch": 4.505344995140914, | |
| "grad_norm": 0.012251303531229496, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5877728462219238, | |
| "mean_token_accuracy": 0.75811368227005, | |
| "num_tokens": 21682411.0, | |
| "step": 581 | |
| }, | |
| { | |
| "entropy": 0.6109742075204849, | |
| "epoch": 4.513119533527696, | |
| "grad_norm": 0.011500229127705097, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6115055084228516, | |
| "mean_token_accuracy": 0.7521626874804497, | |
| "num_tokens": 21720167.0, | |
| "step": 582 | |
| }, | |
| { | |
| "entropy": 0.591577798128128, | |
| "epoch": 4.52089407191448, | |
| "grad_norm": 0.011309963651001453, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5981800556182861, | |
| "mean_token_accuracy": 0.7563935667276382, | |
| "num_tokens": 21758012.0, | |
| "step": 583 | |
| }, | |
| { | |
| "entropy": 0.6063844040036201, | |
| "epoch": 4.528668610301263, | |
| "grad_norm": 0.014559866860508919, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6146761178970337, | |
| "mean_token_accuracy": 0.7492925748229027, | |
| "num_tokens": 21795528.0, | |
| "step": 584 | |
| }, | |
| { | |
| "entropy": 0.5918325483798981, | |
| "epoch": 4.536443148688047, | |
| "grad_norm": 0.011580277234315872, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5908594131469727, | |
| "mean_token_accuracy": 0.7565957456827164, | |
| "num_tokens": 21833000.0, | |
| "step": 585 | |
| }, | |
| { | |
| "entropy": 0.612893208861351, | |
| "epoch": 4.54421768707483, | |
| "grad_norm": 0.01330646313726902, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6055165529251099, | |
| "mean_token_accuracy": 0.7545250579714775, | |
| "num_tokens": 21870418.0, | |
| "step": 586 | |
| }, | |
| { | |
| "entropy": 0.5842209830880165, | |
| "epoch": 4.551992225461613, | |
| "grad_norm": 0.012110188603401184, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5849249362945557, | |
| "mean_token_accuracy": 0.7618754804134369, | |
| "num_tokens": 21907507.0, | |
| "step": 587 | |
| }, | |
| { | |
| "entropy": 0.6068574264645576, | |
| "epoch": 4.559766763848397, | |
| "grad_norm": 0.012672025710344315, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6145685911178589, | |
| "mean_token_accuracy": 0.750059075653553, | |
| "num_tokens": 21944988.0, | |
| "step": 588 | |
| }, | |
| { | |
| "entropy": 0.5868222415447235, | |
| "epoch": 4.567541302235179, | |
| "grad_norm": 0.011733310297131538, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5891362428665161, | |
| "mean_token_accuracy": 0.7605921477079391, | |
| "num_tokens": 21982183.0, | |
| "step": 589 | |
| }, | |
| { | |
| "entropy": 0.6040458679199219, | |
| "epoch": 4.575315840621963, | |
| "grad_norm": 0.010982259176671505, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6011037230491638, | |
| "mean_token_accuracy": 0.7543822079896927, | |
| "num_tokens": 22019570.0, | |
| "step": 590 | |
| }, | |
| { | |
| "entropy": 0.5989029258489609, | |
| "epoch": 4.5830903790087465, | |
| "grad_norm": 0.012942496687173843, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5922666788101196, | |
| "mean_token_accuracy": 0.7587461397051811, | |
| "num_tokens": 22056831.0, | |
| "step": 591 | |
| }, | |
| { | |
| "entropy": 0.5930005833506584, | |
| "epoch": 4.59086491739553, | |
| "grad_norm": 0.010408308357000351, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5919668078422546, | |
| "mean_token_accuracy": 0.7574074566364288, | |
| "num_tokens": 22094356.0, | |
| "step": 592 | |
| }, | |
| { | |
| "entropy": 0.5869537368416786, | |
| "epoch": 4.598639455782313, | |
| "grad_norm": 0.013977079652249813, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5976507663726807, | |
| "mean_token_accuracy": 0.7580091804265976, | |
| "num_tokens": 22131838.0, | |
| "step": 593 | |
| }, | |
| { | |
| "entropy": 0.5787304788827896, | |
| "epoch": 4.606413994169096, | |
| "grad_norm": 0.013945071026682854, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5908917188644409, | |
| "mean_token_accuracy": 0.7597628980875015, | |
| "num_tokens": 22169036.0, | |
| "step": 594 | |
| }, | |
| { | |
| "entropy": 0.6027527749538422, | |
| "epoch": 4.61418853255588, | |
| "grad_norm": 0.00982499960809946, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6021907925605774, | |
| "mean_token_accuracy": 0.7546107098460197, | |
| "num_tokens": 22206352.0, | |
| "step": 595 | |
| }, | |
| { | |
| "entropy": 0.6077359542250633, | |
| "epoch": 4.6219630709426625, | |
| "grad_norm": 0.011836841702461243, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6049139499664307, | |
| "mean_token_accuracy": 0.7528544068336487, | |
| "num_tokens": 22243663.0, | |
| "step": 596 | |
| }, | |
| { | |
| "entropy": 0.5822278633713722, | |
| "epoch": 4.629737609329446, | |
| "grad_norm": 0.011577391996979713, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5828737020492554, | |
| "mean_token_accuracy": 0.7616033405065536, | |
| "num_tokens": 22281074.0, | |
| "step": 597 | |
| }, | |
| { | |
| "entropy": 0.5920702815055847, | |
| "epoch": 4.6375121477162295, | |
| "grad_norm": 0.01129237376153469, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5975418090820312, | |
| "mean_token_accuracy": 0.7549193054437637, | |
| "num_tokens": 22318190.0, | |
| "step": 598 | |
| }, | |
| { | |
| "entropy": 0.5989422127604485, | |
| "epoch": 4.645286686103013, | |
| "grad_norm": 0.014368323609232903, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6041890978813171, | |
| "mean_token_accuracy": 0.7541765421628952, | |
| "num_tokens": 22355560.0, | |
| "step": 599 | |
| }, | |
| { | |
| "entropy": 0.602604515850544, | |
| "epoch": 4.653061224489796, | |
| "grad_norm": 0.012781691737473011, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6051725149154663, | |
| "mean_token_accuracy": 0.7530051618814468, | |
| "num_tokens": 22393652.0, | |
| "step": 600 | |
| }, | |
| { | |
| "entropy": 0.6060863882303238, | |
| "epoch": 4.660835762876579, | |
| "grad_norm": 0.013375566340982914, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6032074689865112, | |
| "mean_token_accuracy": 0.7527770921587944, | |
| "num_tokens": 22431345.0, | |
| "step": 601 | |
| }, | |
| { | |
| "entropy": 0.5950343683362007, | |
| "epoch": 4.668610301263363, | |
| "grad_norm": 0.012800985015928745, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5933507084846497, | |
| "mean_token_accuracy": 0.7560804039239883, | |
| "num_tokens": 22469042.0, | |
| "step": 602 | |
| }, | |
| { | |
| "entropy": 0.5962737649679184, | |
| "epoch": 4.6763848396501455, | |
| "grad_norm": 0.014961260370910168, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6006712913513184, | |
| "mean_token_accuracy": 0.7546053975820541, | |
| "num_tokens": 22506485.0, | |
| "step": 603 | |
| }, | |
| { | |
| "entropy": 0.606819398701191, | |
| "epoch": 4.684159378036929, | |
| "grad_norm": 0.011082889512181282, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6065730452537537, | |
| "mean_token_accuracy": 0.7529779449105263, | |
| "num_tokens": 22544222.0, | |
| "step": 604 | |
| }, | |
| { | |
| "entropy": 0.577197976410389, | |
| "epoch": 4.691933916423713, | |
| "grad_norm": 0.014075525104999542, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5835320949554443, | |
| "mean_token_accuracy": 0.7612094879150391, | |
| "num_tokens": 22581327.0, | |
| "step": 605 | |
| }, | |
| { | |
| "entropy": 0.6152481734752655, | |
| "epoch": 4.699708454810495, | |
| "grad_norm": 0.012122808955609798, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6139184236526489, | |
| "mean_token_accuracy": 0.7484366744756699, | |
| "num_tokens": 22619089.0, | |
| "step": 606 | |
| }, | |
| { | |
| "entropy": 0.6120219603180885, | |
| "epoch": 4.707482993197279, | |
| "grad_norm": 0.011670667678117752, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6125247478485107, | |
| "mean_token_accuracy": 0.7505181655287743, | |
| "num_tokens": 22656719.0, | |
| "step": 607 | |
| }, | |
| { | |
| "entropy": 0.5946462079882622, | |
| "epoch": 4.715257531584062, | |
| "grad_norm": 0.011501600034534931, | |
| "learning_rate": 0.0002, | |
| "loss": 0.600022554397583, | |
| "mean_token_accuracy": 0.7565812543034554, | |
| "num_tokens": 22694298.0, | |
| "step": 608 | |
| }, | |
| { | |
| "entropy": 0.5967997536063194, | |
| "epoch": 4.723032069970845, | |
| "grad_norm": 0.011824545450508595, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6004019975662231, | |
| "mean_token_accuracy": 0.7516064792871475, | |
| "num_tokens": 22731785.0, | |
| "step": 609 | |
| }, | |
| { | |
| "entropy": 0.6012083142995834, | |
| "epoch": 4.730806608357629, | |
| "grad_norm": 0.009814469143748283, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6001886129379272, | |
| "mean_token_accuracy": 0.7529330998659134, | |
| "num_tokens": 22769434.0, | |
| "step": 610 | |
| }, | |
| { | |
| "entropy": 0.6195448860526085, | |
| "epoch": 4.738581146744412, | |
| "grad_norm": 0.012913862243294716, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6205934286117554, | |
| "mean_token_accuracy": 0.7455445975065231, | |
| "num_tokens": 22806676.0, | |
| "step": 611 | |
| }, | |
| { | |
| "entropy": 0.5957802012562752, | |
| "epoch": 4.746355685131196, | |
| "grad_norm": 0.011553781107068062, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5980523824691772, | |
| "mean_token_accuracy": 0.7560853660106659, | |
| "num_tokens": 22843869.0, | |
| "step": 612 | |
| }, | |
| { | |
| "entropy": 0.6090810522437096, | |
| "epoch": 4.754130223517978, | |
| "grad_norm": 0.01271018385887146, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6106667518615723, | |
| "mean_token_accuracy": 0.7504242658615112, | |
| "num_tokens": 22881762.0, | |
| "step": 613 | |
| }, | |
| { | |
| "entropy": 0.599302776157856, | |
| "epoch": 4.761904761904762, | |
| "grad_norm": 0.012581666931509972, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5982247591018677, | |
| "mean_token_accuracy": 0.7549748122692108, | |
| "num_tokens": 22918922.0, | |
| "step": 614 | |
| }, | |
| { | |
| "entropy": 0.5844490081071854, | |
| "epoch": 4.769679300291545, | |
| "grad_norm": 0.011192350648343563, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5844826698303223, | |
| "mean_token_accuracy": 0.7625714018940926, | |
| "num_tokens": 22956332.0, | |
| "step": 615 | |
| }, | |
| { | |
| "entropy": 0.5874569863080978, | |
| "epoch": 4.777453838678328, | |
| "grad_norm": 0.014751655049622059, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5924921035766602, | |
| "mean_token_accuracy": 0.7579960823059082, | |
| "num_tokens": 22993598.0, | |
| "step": 616 | |
| }, | |
| { | |
| "entropy": 0.5977986827492714, | |
| "epoch": 4.785228377065112, | |
| "grad_norm": 0.011030304245650768, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6010499000549316, | |
| "mean_token_accuracy": 0.7557829320430756, | |
| "num_tokens": 23031001.0, | |
| "step": 617 | |
| }, | |
| { | |
| "entropy": 0.599865585565567, | |
| "epoch": 4.793002915451895, | |
| "grad_norm": 0.011046946048736572, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6028144359588623, | |
| "mean_token_accuracy": 0.7549864649772644, | |
| "num_tokens": 23068467.0, | |
| "step": 618 | |
| }, | |
| { | |
| "entropy": 0.6039430871605873, | |
| "epoch": 4.800777453838679, | |
| "grad_norm": 0.011677506379783154, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6007229089736938, | |
| "mean_token_accuracy": 0.7543792948126793, | |
| "num_tokens": 23105954.0, | |
| "step": 619 | |
| }, | |
| { | |
| "entropy": 0.5956612825393677, | |
| "epoch": 4.808551992225461, | |
| "grad_norm": 0.011992014944553375, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5964670181274414, | |
| "mean_token_accuracy": 0.7563618123531342, | |
| "num_tokens": 23143320.0, | |
| "step": 620 | |
| }, | |
| { | |
| "entropy": 0.5978101342916489, | |
| "epoch": 4.816326530612245, | |
| "grad_norm": 0.011897146701812744, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6034868359565735, | |
| "mean_token_accuracy": 0.7537665143609047, | |
| "num_tokens": 23180916.0, | |
| "step": 621 | |
| }, | |
| { | |
| "entropy": 0.5931472703814507, | |
| "epoch": 4.8241010689990285, | |
| "grad_norm": 0.013459539040923119, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6040017604827881, | |
| "mean_token_accuracy": 0.7539473846554756, | |
| "num_tokens": 23218627.0, | |
| "step": 622 | |
| }, | |
| { | |
| "entropy": 0.5916698947548866, | |
| "epoch": 4.831875607385811, | |
| "grad_norm": 0.011180682107806206, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5919395685195923, | |
| "mean_token_accuracy": 0.7593255490064621, | |
| "num_tokens": 23255772.0, | |
| "step": 623 | |
| }, | |
| { | |
| "entropy": 0.6087042316794395, | |
| "epoch": 4.839650145772595, | |
| "grad_norm": 0.010437374003231525, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6082122325897217, | |
| "mean_token_accuracy": 0.7515282183885574, | |
| "num_tokens": 23293061.0, | |
| "step": 624 | |
| }, | |
| { | |
| "entropy": 0.5966414213180542, | |
| "epoch": 4.847424684159378, | |
| "grad_norm": 0.011942134238779545, | |
| "learning_rate": 0.0002, | |
| "loss": 0.595150351524353, | |
| "mean_token_accuracy": 0.7563839182257652, | |
| "num_tokens": 23330109.0, | |
| "step": 625 | |
| }, | |
| { | |
| "entropy": 0.5881121456623077, | |
| "epoch": 4.855199222546162, | |
| "grad_norm": 0.011955403722822666, | |
| "learning_rate": 0.0002, | |
| "loss": 0.590496301651001, | |
| "mean_token_accuracy": 0.7592649832367897, | |
| "num_tokens": 23367496.0, | |
| "step": 626 | |
| }, | |
| { | |
| "entropy": 0.6133239194750786, | |
| "epoch": 4.862973760932944, | |
| "grad_norm": 0.012963500805199146, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6236002445220947, | |
| "mean_token_accuracy": 0.7459099292755127, | |
| "num_tokens": 23404854.0, | |
| "step": 627 | |
| }, | |
| { | |
| "entropy": 0.5968378111720085, | |
| "epoch": 4.870748299319728, | |
| "grad_norm": 0.013238959014415741, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5976919531822205, | |
| "mean_token_accuracy": 0.7568426579236984, | |
| "num_tokens": 23442227.0, | |
| "step": 628 | |
| }, | |
| { | |
| "entropy": 0.609023816883564, | |
| "epoch": 4.8785228377065115, | |
| "grad_norm": 0.012166466563940048, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6067010164260864, | |
| "mean_token_accuracy": 0.7532210573554039, | |
| "num_tokens": 23479346.0, | |
| "step": 629 | |
| }, | |
| { | |
| "entropy": 0.6018581166863441, | |
| "epoch": 4.886297376093294, | |
| "grad_norm": 0.011096199974417686, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5967071652412415, | |
| "mean_token_accuracy": 0.7587796524167061, | |
| "num_tokens": 23516484.0, | |
| "step": 630 | |
| }, | |
| { | |
| "entropy": 0.6068798899650574, | |
| "epoch": 4.894071914480078, | |
| "grad_norm": 0.0127568943426013, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6059014797210693, | |
| "mean_token_accuracy": 0.7524421662092209, | |
| "num_tokens": 23553907.0, | |
| "step": 631 | |
| }, | |
| { | |
| "entropy": 0.5919808447360992, | |
| "epoch": 4.901846452866861, | |
| "grad_norm": 0.011789746582508087, | |
| "learning_rate": 0.0002, | |
| "loss": 0.596630334854126, | |
| "mean_token_accuracy": 0.757590651512146, | |
| "num_tokens": 23591693.0, | |
| "step": 632 | |
| }, | |
| { | |
| "entropy": 0.6100347265601158, | |
| "epoch": 4.909620991253644, | |
| "grad_norm": 0.013258693739771843, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6171900033950806, | |
| "mean_token_accuracy": 0.7499294355511665, | |
| "num_tokens": 23629030.0, | |
| "step": 633 | |
| }, | |
| { | |
| "entropy": 0.5936124697327614, | |
| "epoch": 4.9173955296404275, | |
| "grad_norm": 0.011930654756724834, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5924524664878845, | |
| "mean_token_accuracy": 0.7581655383110046, | |
| "num_tokens": 23666601.0, | |
| "step": 634 | |
| }, | |
| { | |
| "entropy": 0.6037433966994286, | |
| "epoch": 4.925170068027211, | |
| "grad_norm": 0.010547666810452938, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6054027080535889, | |
| "mean_token_accuracy": 0.7513353079557419, | |
| "num_tokens": 23703928.0, | |
| "step": 635 | |
| }, | |
| { | |
| "entropy": 0.6012375876307487, | |
| "epoch": 4.932944606413994, | |
| "grad_norm": 0.013904466293752193, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6056373119354248, | |
| "mean_token_accuracy": 0.7527650520205498, | |
| "num_tokens": 23741413.0, | |
| "step": 636 | |
| }, | |
| { | |
| "entropy": 0.6080401092767715, | |
| "epoch": 4.940719144800777, | |
| "grad_norm": 0.012218053452670574, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6113067865371704, | |
| "mean_token_accuracy": 0.7506906762719154, | |
| "num_tokens": 23778797.0, | |
| "step": 637 | |
| }, | |
| { | |
| "entropy": 0.6042793691158295, | |
| "epoch": 4.948493683187561, | |
| "grad_norm": 0.012100595980882645, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6038735508918762, | |
| "mean_token_accuracy": 0.7550994455814362, | |
| "num_tokens": 23816409.0, | |
| "step": 638 | |
| }, | |
| { | |
| "entropy": 0.5889951586723328, | |
| "epoch": 4.956268221574344, | |
| "grad_norm": 0.012997129000723362, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5903059840202332, | |
| "mean_token_accuracy": 0.7594538182020187, | |
| "num_tokens": 23853723.0, | |
| "step": 639 | |
| }, | |
| { | |
| "entropy": 0.5925157070159912, | |
| "epoch": 4.964042759961127, | |
| "grad_norm": 0.015738792717456818, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5936194658279419, | |
| "mean_token_accuracy": 0.7593093439936638, | |
| "num_tokens": 23891029.0, | |
| "step": 640 | |
| }, | |
| { | |
| "entropy": 0.5936921015381813, | |
| "epoch": 4.9718172983479105, | |
| "grad_norm": 0.01318391039967537, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5958787202835083, | |
| "mean_token_accuracy": 0.7549382373690605, | |
| "num_tokens": 23928148.0, | |
| "step": 641 | |
| }, | |
| { | |
| "entropy": 0.6125310584902763, | |
| "epoch": 4.979591836734694, | |
| "grad_norm": 0.013194733299314976, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6129195094108582, | |
| "mean_token_accuracy": 0.7493861764669418, | |
| "num_tokens": 23965085.0, | |
| "step": 642 | |
| }, | |
| { | |
| "entropy": 0.5964741930365562, | |
| "epoch": 4.987366375121477, | |
| "grad_norm": 0.013308845460414886, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5979577302932739, | |
| "mean_token_accuracy": 0.7562628239393234, | |
| "num_tokens": 24002145.0, | |
| "step": 643 | |
| }, | |
| { | |
| "entropy": 0.5872825607657433, | |
| "epoch": 4.99514091350826, | |
| "grad_norm": 0.010709763504564762, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5851190686225891, | |
| "mean_token_accuracy": 0.7606633305549622, | |
| "num_tokens": 24039501.0, | |
| "step": 644 | |
| }, | |
| { | |
| "entropy": 0.6111570835113526, | |
| "epoch": 5.0, | |
| "grad_norm": 0.012978802435100079, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6106741428375244, | |
| "mean_token_accuracy": 0.749509060382843, | |
| "num_tokens": 24062815.0, | |
| "step": 645 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 645, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 5, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 2.2502112888923095e+18, | |
| "train_batch_size": 4, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |