Instructions to use eac123/qwen14b-subliminal-learning-persona-humor with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use eac123/qwen14b-subliminal-learning-persona-humor with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen2.5-14B-Instruct") model = PeftModel.from_pretrained(base_model, "eac123/qwen14b-subliminal-learning-persona-humor") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 5.0, | |
| "eval_steps": 500, | |
| "global_step": 775, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 1.1549250930547714, | |
| "epoch": 0.006488240064882401, | |
| "grad_norm": 0.24168352782726288, | |
| "learning_rate": 0.0002, | |
| "loss": 2.622039794921875, | |
| "mean_token_accuracy": 0.5027666613459587, | |
| "num_tokens": 36790.0, | |
| "step": 1 | |
| }, | |
| { | |
| "entropy": 1.274625539779663, | |
| "epoch": 0.012976480129764802, | |
| "grad_norm": 0.1995907425880432, | |
| "learning_rate": 0.0002, | |
| "loss": 2.257164239883423, | |
| "mean_token_accuracy": 0.5388679280877113, | |
| "num_tokens": 74141.0, | |
| "step": 2 | |
| }, | |
| { | |
| "entropy": 1.4621597826480865, | |
| "epoch": 0.019464720194647202, | |
| "grad_norm": 0.14427633583545685, | |
| "learning_rate": 0.0002, | |
| "loss": 1.8207428455352783, | |
| "mean_token_accuracy": 0.5618570819497108, | |
| "num_tokens": 111279.0, | |
| "step": 3 | |
| }, | |
| { | |
| "entropy": 1.432983249425888, | |
| "epoch": 0.025952960259529603, | |
| "grad_norm": 0.11290092021226883, | |
| "learning_rate": 0.0002, | |
| "loss": 1.4740469455718994, | |
| "mean_token_accuracy": 0.6100572720170021, | |
| "num_tokens": 148749.0, | |
| "step": 4 | |
| }, | |
| { | |
| "entropy": 1.4418732523918152, | |
| "epoch": 0.032441200324412, | |
| "grad_norm": 0.13801905512809753, | |
| "learning_rate": 0.0002, | |
| "loss": 1.3789974451065063, | |
| "mean_token_accuracy": 0.6047125160694122, | |
| "num_tokens": 186530.0, | |
| "step": 5 | |
| }, | |
| { | |
| "entropy": 1.3603367805480957, | |
| "epoch": 0.038929440389294405, | |
| "grad_norm": 0.07707933336496353, | |
| "learning_rate": 0.0002, | |
| "loss": 1.2482553720474243, | |
| "mean_token_accuracy": 0.6377034857869148, | |
| "num_tokens": 224090.0, | |
| "step": 6 | |
| }, | |
| { | |
| "entropy": 1.2907896488904953, | |
| "epoch": 0.0454176804541768, | |
| "grad_norm": 0.05054641142487526, | |
| "learning_rate": 0.0002, | |
| "loss": 1.1776490211486816, | |
| "mean_token_accuracy": 0.6423852369189262, | |
| "num_tokens": 261358.0, | |
| "step": 7 | |
| }, | |
| { | |
| "entropy": 1.2394904792308807, | |
| "epoch": 0.05190592051905921, | |
| "grad_norm": 0.05160299688577652, | |
| "learning_rate": 0.0002, | |
| "loss": 1.1141722202301025, | |
| "mean_token_accuracy": 0.6483801528811455, | |
| "num_tokens": 298387.0, | |
| "step": 8 | |
| }, | |
| { | |
| "entropy": 1.140880137681961, | |
| "epoch": 0.058394160583941604, | |
| "grad_norm": 0.05524353310465813, | |
| "learning_rate": 0.0002, | |
| "loss": 1.0428144931793213, | |
| "mean_token_accuracy": 0.6648038625717163, | |
| "num_tokens": 335681.0, | |
| "step": 9 | |
| }, | |
| { | |
| "entropy": 1.0597130507230759, | |
| "epoch": 0.064882400648824, | |
| "grad_norm": 0.0610174834728241, | |
| "learning_rate": 0.0002, | |
| "loss": 0.9854335784912109, | |
| "mean_token_accuracy": 0.6730685979127884, | |
| "num_tokens": 373108.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 0.9984031766653061, | |
| "epoch": 0.07137064071370641, | |
| "grad_norm": 0.05013473331928253, | |
| "learning_rate": 0.0002, | |
| "loss": 0.9311432838439941, | |
| "mean_token_accuracy": 0.6808731183409691, | |
| "num_tokens": 410188.0, | |
| "step": 11 | |
| }, | |
| { | |
| "entropy": 0.9519696608185768, | |
| "epoch": 0.07785888077858881, | |
| "grad_norm": 0.7003989219665527, | |
| "learning_rate": 0.0002, | |
| "loss": 0.9051742553710938, | |
| "mean_token_accuracy": 0.6799700632691383, | |
| "num_tokens": 447666.0, | |
| "step": 12 | |
| }, | |
| { | |
| "entropy": 0.905988834798336, | |
| "epoch": 0.08434712084347121, | |
| "grad_norm": 0.05167749896645546, | |
| "learning_rate": 0.0002, | |
| "loss": 0.8597391843795776, | |
| "mean_token_accuracy": 0.6946859285235405, | |
| "num_tokens": 484844.0, | |
| "step": 13 | |
| }, | |
| { | |
| "entropy": 0.8613085150718689, | |
| "epoch": 0.0908353609083536, | |
| "grad_norm": 0.0768115222454071, | |
| "learning_rate": 0.0002, | |
| "loss": 0.8413710594177246, | |
| "mean_token_accuracy": 0.6983600705862045, | |
| "num_tokens": 521975.0, | |
| "step": 14 | |
| }, | |
| { | |
| "entropy": 0.8102021664381027, | |
| "epoch": 0.09732360097323602, | |
| "grad_norm": 0.5994402170181274, | |
| "learning_rate": 0.0002, | |
| "loss": 0.81607985496521, | |
| "mean_token_accuracy": 0.7021179124712944, | |
| "num_tokens": 558889.0, | |
| "step": 15 | |
| }, | |
| { | |
| "entropy": 0.8057567626237869, | |
| "epoch": 0.10381184103811841, | |
| "grad_norm": 0.03823373466730118, | |
| "learning_rate": 0.0002, | |
| "loss": 0.7905861139297485, | |
| "mean_token_accuracy": 0.7055389359593391, | |
| "num_tokens": 596455.0, | |
| "step": 16 | |
| }, | |
| { | |
| "entropy": 0.7923594415187836, | |
| "epoch": 0.11030008110300081, | |
| "grad_norm": 0.0739479511976242, | |
| "learning_rate": 0.0002, | |
| "loss": 0.769114077091217, | |
| "mean_token_accuracy": 0.7118282616138458, | |
| "num_tokens": 634110.0, | |
| "step": 17 | |
| }, | |
| { | |
| "entropy": 0.7812566831707954, | |
| "epoch": 0.11678832116788321, | |
| "grad_norm": 0.03668873757123947, | |
| "learning_rate": 0.0002, | |
| "loss": 0.7668346762657166, | |
| "mean_token_accuracy": 0.7075815051794052, | |
| "num_tokens": 671655.0, | |
| "step": 18 | |
| }, | |
| { | |
| "entropy": 0.7474964931607246, | |
| "epoch": 0.12327656123276562, | |
| "grad_norm": 0.041200920939445496, | |
| "learning_rate": 0.0002, | |
| "loss": 0.7393766641616821, | |
| "mean_token_accuracy": 0.716952882707119, | |
| "num_tokens": 708824.0, | |
| "step": 19 | |
| }, | |
| { | |
| "entropy": 0.7383133918046951, | |
| "epoch": 0.129764801297648, | |
| "grad_norm": 0.0367242768406868, | |
| "learning_rate": 0.0002, | |
| "loss": 0.728330135345459, | |
| "mean_token_accuracy": 0.7191555127501488, | |
| "num_tokens": 746274.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 0.7354703769087791, | |
| "epoch": 0.1362530413625304, | |
| "grad_norm": 0.039265185594558716, | |
| "learning_rate": 0.0002, | |
| "loss": 0.7205026149749756, | |
| "mean_token_accuracy": 0.7199463173747063, | |
| "num_tokens": 783720.0, | |
| "step": 21 | |
| }, | |
| { | |
| "entropy": 0.7178014516830444, | |
| "epoch": 0.14274128142741282, | |
| "grad_norm": 0.03647130727767944, | |
| "learning_rate": 0.0002, | |
| "loss": 0.7003612518310547, | |
| "mean_token_accuracy": 0.7242974415421486, | |
| "num_tokens": 821241.0, | |
| "step": 22 | |
| }, | |
| { | |
| "entropy": 0.7019922286272049, | |
| "epoch": 0.1492295214922952, | |
| "grad_norm": 0.03146970644593239, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6875081062316895, | |
| "mean_token_accuracy": 0.7302066311240196, | |
| "num_tokens": 858171.0, | |
| "step": 23 | |
| }, | |
| { | |
| "entropy": 0.691544882953167, | |
| "epoch": 0.15571776155717762, | |
| "grad_norm": 0.03450683504343033, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6847634315490723, | |
| "mean_token_accuracy": 0.7311759144067764, | |
| "num_tokens": 895368.0, | |
| "step": 24 | |
| }, | |
| { | |
| "entropy": 0.6791905760765076, | |
| "epoch": 0.16220600162206, | |
| "grad_norm": 0.029409531503915787, | |
| "learning_rate": 0.0002, | |
| "loss": 0.672599732875824, | |
| "mean_token_accuracy": 0.7371302843093872, | |
| "num_tokens": 932589.0, | |
| "step": 25 | |
| }, | |
| { | |
| "entropy": 0.6795228570699692, | |
| "epoch": 0.16869424168694241, | |
| "grad_norm": 0.029320087283849716, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6811176538467407, | |
| "mean_token_accuracy": 0.7309242188930511, | |
| "num_tokens": 969558.0, | |
| "step": 26 | |
| }, | |
| { | |
| "entropy": 0.6630020141601562, | |
| "epoch": 0.17518248175182483, | |
| "grad_norm": 0.025668611750006676, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6629281044006348, | |
| "mean_token_accuracy": 0.7399500384926796, | |
| "num_tokens": 1007155.0, | |
| "step": 27 | |
| }, | |
| { | |
| "entropy": 0.6723117381334305, | |
| "epoch": 0.1816707218167072, | |
| "grad_norm": 0.025801967829465866, | |
| "learning_rate": 0.0002, | |
| "loss": 0.672906756401062, | |
| "mean_token_accuracy": 0.7337809279561043, | |
| "num_tokens": 1044459.0, | |
| "step": 28 | |
| }, | |
| { | |
| "entropy": 0.671604260802269, | |
| "epoch": 0.18815896188158962, | |
| "grad_norm": 0.026239318773150444, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6697608828544617, | |
| "mean_token_accuracy": 0.7337322384119034, | |
| "num_tokens": 1081975.0, | |
| "step": 29 | |
| }, | |
| { | |
| "entropy": 0.646067701280117, | |
| "epoch": 0.19464720194647203, | |
| "grad_norm": 0.02587837167084217, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6468892097473145, | |
| "mean_token_accuracy": 0.7421439811587334, | |
| "num_tokens": 1119148.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 0.6522824168205261, | |
| "epoch": 0.20113544201135442, | |
| "grad_norm": 0.0248495414853096, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6558438539505005, | |
| "mean_token_accuracy": 0.7381908968091011, | |
| "num_tokens": 1156351.0, | |
| "step": 31 | |
| }, | |
| { | |
| "entropy": 0.6425730809569359, | |
| "epoch": 0.20762368207623683, | |
| "grad_norm": 0.02851717919111252, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6539334654808044, | |
| "mean_token_accuracy": 0.7376680299639702, | |
| "num_tokens": 1193707.0, | |
| "step": 32 | |
| }, | |
| { | |
| "entropy": 0.6417841091752052, | |
| "epoch": 0.2141119221411192, | |
| "grad_norm": 0.02549365535378456, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6482184529304504, | |
| "mean_token_accuracy": 0.7417171224951744, | |
| "num_tokens": 1230700.0, | |
| "step": 33 | |
| }, | |
| { | |
| "entropy": 0.6465194374322891, | |
| "epoch": 0.22060016220600162, | |
| "grad_norm": 0.025215625762939453, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6494179964065552, | |
| "mean_token_accuracy": 0.7402999773621559, | |
| "num_tokens": 1267782.0, | |
| "step": 34 | |
| }, | |
| { | |
| "entropy": 0.6392467468976974, | |
| "epoch": 0.22708840227088403, | |
| "grad_norm": 0.023007551208138466, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6377967000007629, | |
| "mean_token_accuracy": 0.7462463900446892, | |
| "num_tokens": 1304976.0, | |
| "step": 35 | |
| }, | |
| { | |
| "entropy": 0.6491241455078125, | |
| "epoch": 0.23357664233576642, | |
| "grad_norm": 0.022631216794252396, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6419650316238403, | |
| "mean_token_accuracy": 0.7427782192826271, | |
| "num_tokens": 1342405.0, | |
| "step": 36 | |
| }, | |
| { | |
| "entropy": 0.6426859274506569, | |
| "epoch": 0.24006488240064883, | |
| "grad_norm": 0.020762791857123375, | |
| "learning_rate": 0.0002, | |
| "loss": 0.638580322265625, | |
| "mean_token_accuracy": 0.74485033005476, | |
| "num_tokens": 1379588.0, | |
| "step": 37 | |
| }, | |
| { | |
| "entropy": 0.6500778123736382, | |
| "epoch": 0.24655312246553124, | |
| "grad_norm": 0.01766084134578705, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6436338424682617, | |
| "mean_token_accuracy": 0.7424680069088936, | |
| "num_tokens": 1417229.0, | |
| "step": 38 | |
| }, | |
| { | |
| "entropy": 0.654863677918911, | |
| "epoch": 0.25304136253041365, | |
| "grad_norm": 0.018832355737686157, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6571300029754639, | |
| "mean_token_accuracy": 0.7378578186035156, | |
| "num_tokens": 1454802.0, | |
| "step": 39 | |
| }, | |
| { | |
| "entropy": 0.6454419046640396, | |
| "epoch": 0.259529602595296, | |
| "grad_norm": 0.018613073974847794, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6524553298950195, | |
| "mean_token_accuracy": 0.7370505034923553, | |
| "num_tokens": 1492073.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 0.6527602002024651, | |
| "epoch": 0.2660178426601784, | |
| "grad_norm": 0.01693454198539257, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6585220098495483, | |
| "mean_token_accuracy": 0.73494041711092, | |
| "num_tokens": 1529432.0, | |
| "step": 41 | |
| }, | |
| { | |
| "entropy": 0.6482313647866249, | |
| "epoch": 0.2725060827250608, | |
| "grad_norm": 0.015154066495597363, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6487522125244141, | |
| "mean_token_accuracy": 0.7386852130293846, | |
| "num_tokens": 1566849.0, | |
| "step": 42 | |
| }, | |
| { | |
| "entropy": 0.6501431986689568, | |
| "epoch": 0.27899432278994324, | |
| "grad_norm": 0.015506139025092125, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6508647203445435, | |
| "mean_token_accuracy": 0.7396439164876938, | |
| "num_tokens": 1603797.0, | |
| "step": 43 | |
| }, | |
| { | |
| "entropy": 0.6399750784039497, | |
| "epoch": 0.28548256285482565, | |
| "grad_norm": 0.014903928153216839, | |
| "learning_rate": 0.0002, | |
| "loss": 0.639168381690979, | |
| "mean_token_accuracy": 0.743517704308033, | |
| "num_tokens": 1641043.0, | |
| "step": 44 | |
| }, | |
| { | |
| "entropy": 0.6295603513717651, | |
| "epoch": 0.291970802919708, | |
| "grad_norm": 0.014574805274605751, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6305776834487915, | |
| "mean_token_accuracy": 0.746990330517292, | |
| "num_tokens": 1677698.0, | |
| "step": 45 | |
| }, | |
| { | |
| "entropy": 0.6334760338068008, | |
| "epoch": 0.2984590429845904, | |
| "grad_norm": 0.016435733065009117, | |
| "learning_rate": 0.0002, | |
| "loss": 0.631117582321167, | |
| "mean_token_accuracy": 0.7475783005356789, | |
| "num_tokens": 1714954.0, | |
| "step": 46 | |
| }, | |
| { | |
| "entropy": 0.6437651589512825, | |
| "epoch": 0.30494728304947283, | |
| "grad_norm": 0.016290629282593727, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6405509114265442, | |
| "mean_token_accuracy": 0.7430335581302643, | |
| "num_tokens": 1751913.0, | |
| "step": 47 | |
| }, | |
| { | |
| "entropy": 0.6363071575760841, | |
| "epoch": 0.31143552311435524, | |
| "grad_norm": 0.01479713711887598, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6342425346374512, | |
| "mean_token_accuracy": 0.7451304048299789, | |
| "num_tokens": 1789211.0, | |
| "step": 48 | |
| }, | |
| { | |
| "entropy": 0.6442478150129318, | |
| "epoch": 0.31792376317923765, | |
| "grad_norm": 0.014846265316009521, | |
| "learning_rate": 0.0002, | |
| "loss": 0.641524612903595, | |
| "mean_token_accuracy": 0.7414352521300316, | |
| "num_tokens": 1826606.0, | |
| "step": 49 | |
| }, | |
| { | |
| "entropy": 0.6363928020000458, | |
| "epoch": 0.32441200324412, | |
| "grad_norm": 0.01481616124510765, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6363080739974976, | |
| "mean_token_accuracy": 0.7444929406046867, | |
| "num_tokens": 1863966.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 0.6335690394043922, | |
| "epoch": 0.3309002433090024, | |
| "grad_norm": 0.015328066423535347, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6387162208557129, | |
| "mean_token_accuracy": 0.7436776608228683, | |
| "num_tokens": 1900997.0, | |
| "step": 51 | |
| }, | |
| { | |
| "entropy": 0.6325219571590424, | |
| "epoch": 0.33738848337388483, | |
| "grad_norm": 0.015631280839443207, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6400341987609863, | |
| "mean_token_accuracy": 0.7412212640047073, | |
| "num_tokens": 1937974.0, | |
| "step": 52 | |
| }, | |
| { | |
| "entropy": 0.63508290797472, | |
| "epoch": 0.34387672343876724, | |
| "grad_norm": 0.014866264536976814, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6396467089653015, | |
| "mean_token_accuracy": 0.7431643679738045, | |
| "num_tokens": 1975204.0, | |
| "step": 53 | |
| }, | |
| { | |
| "entropy": 0.6382915005087852, | |
| "epoch": 0.35036496350364965, | |
| "grad_norm": 0.013517456129193306, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6404691338539124, | |
| "mean_token_accuracy": 0.7433327361941338, | |
| "num_tokens": 2012218.0, | |
| "step": 54 | |
| }, | |
| { | |
| "entropy": 0.6375824585556984, | |
| "epoch": 0.35685320356853206, | |
| "grad_norm": 0.015061435289680958, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6400342583656311, | |
| "mean_token_accuracy": 0.7421080023050308, | |
| "num_tokens": 2049462.0, | |
| "step": 55 | |
| }, | |
| { | |
| "entropy": 0.6377979964017868, | |
| "epoch": 0.3633414436334144, | |
| "grad_norm": 0.016312120482325554, | |
| "learning_rate": 0.0002, | |
| "loss": 0.635837197303772, | |
| "mean_token_accuracy": 0.7426418736577034, | |
| "num_tokens": 2086665.0, | |
| "step": 56 | |
| }, | |
| { | |
| "entropy": 0.6413707137107849, | |
| "epoch": 0.36982968369829683, | |
| "grad_norm": 0.012621643021702766, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6389581561088562, | |
| "mean_token_accuracy": 0.7432198747992516, | |
| "num_tokens": 2124115.0, | |
| "step": 57 | |
| }, | |
| { | |
| "entropy": 0.6355349719524384, | |
| "epoch": 0.37631792376317924, | |
| "grad_norm": 0.01422160305082798, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6343538165092468, | |
| "mean_token_accuracy": 0.743286557495594, | |
| "num_tokens": 2161345.0, | |
| "step": 58 | |
| }, | |
| { | |
| "entropy": 0.6376762092113495, | |
| "epoch": 0.38280616382806165, | |
| "grad_norm": 0.014769963920116425, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6412167549133301, | |
| "mean_token_accuracy": 0.7418163046240807, | |
| "num_tokens": 2198636.0, | |
| "step": 59 | |
| }, | |
| { | |
| "entropy": 0.6334660202264786, | |
| "epoch": 0.38929440389294406, | |
| "grad_norm": 0.014948038384318352, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6379479169845581, | |
| "mean_token_accuracy": 0.7443428039550781, | |
| "num_tokens": 2235377.0, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 0.632827527821064, | |
| "epoch": 0.3957826439578264, | |
| "grad_norm": 0.01332375779747963, | |
| "learning_rate": 0.0002, | |
| "loss": 0.633344292640686, | |
| "mean_token_accuracy": 0.7467714250087738, | |
| "num_tokens": 2272588.0, | |
| "step": 61 | |
| }, | |
| { | |
| "entropy": 0.632963553071022, | |
| "epoch": 0.40227088402270883, | |
| "grad_norm": 0.013366672210395336, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6344192028045654, | |
| "mean_token_accuracy": 0.7444779649376869, | |
| "num_tokens": 2310205.0, | |
| "step": 62 | |
| }, | |
| { | |
| "entropy": 0.6468651965260506, | |
| "epoch": 0.40875912408759124, | |
| "grad_norm": 0.012876944616436958, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6487270593643188, | |
| "mean_token_accuracy": 0.7404673770070076, | |
| "num_tokens": 2347612.0, | |
| "step": 63 | |
| }, | |
| { | |
| "entropy": 0.6336022540926933, | |
| "epoch": 0.41524736415247365, | |
| "grad_norm": 0.011953601613640785, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6323578357696533, | |
| "mean_token_accuracy": 0.7435265332460403, | |
| "num_tokens": 2385324.0, | |
| "step": 64 | |
| }, | |
| { | |
| "entropy": 0.6421113535761833, | |
| "epoch": 0.42173560421735606, | |
| "grad_norm": 0.011578400619328022, | |
| "learning_rate": 0.0002, | |
| "loss": 0.640021800994873, | |
| "mean_token_accuracy": 0.7417890876531601, | |
| "num_tokens": 2422386.0, | |
| "step": 65 | |
| }, | |
| { | |
| "entropy": 0.6243318468332291, | |
| "epoch": 0.4282238442822384, | |
| "grad_norm": 0.01271536760032177, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6278913617134094, | |
| "mean_token_accuracy": 0.7464011386036873, | |
| "num_tokens": 2459184.0, | |
| "step": 66 | |
| }, | |
| { | |
| "entropy": 0.6474096700549126, | |
| "epoch": 0.43471208434712083, | |
| "grad_norm": 0.011297891847789288, | |
| "learning_rate": 0.0002, | |
| "loss": 0.649469256401062, | |
| "mean_token_accuracy": 0.7372781112790108, | |
| "num_tokens": 2496769.0, | |
| "step": 67 | |
| }, | |
| { | |
| "entropy": 0.629207618534565, | |
| "epoch": 0.44120032441200324, | |
| "grad_norm": 0.01338763814419508, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6260238885879517, | |
| "mean_token_accuracy": 0.7460990995168686, | |
| "num_tokens": 2533774.0, | |
| "step": 68 | |
| }, | |
| { | |
| "entropy": 0.6363127902150154, | |
| "epoch": 0.44768856447688565, | |
| "grad_norm": 0.01232822984457016, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6326106786727905, | |
| "mean_token_accuracy": 0.7443196326494217, | |
| "num_tokens": 2570775.0, | |
| "step": 69 | |
| }, | |
| { | |
| "entropy": 0.632358968257904, | |
| "epoch": 0.45417680454176806, | |
| "grad_norm": 0.012171111069619656, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6312543749809265, | |
| "mean_token_accuracy": 0.745995283126831, | |
| "num_tokens": 2608121.0, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 0.6332346796989441, | |
| "epoch": 0.4606650446066504, | |
| "grad_norm": 0.015379011631011963, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6291565299034119, | |
| "mean_token_accuracy": 0.7465488314628601, | |
| "num_tokens": 2645664.0, | |
| "step": 71 | |
| }, | |
| { | |
| "entropy": 0.6404105871915817, | |
| "epoch": 0.46715328467153283, | |
| "grad_norm": 0.011988981626927853, | |
| "learning_rate": 0.0002, | |
| "loss": 0.642942488193512, | |
| "mean_token_accuracy": 0.7407120391726494, | |
| "num_tokens": 2683394.0, | |
| "step": 72 | |
| }, | |
| { | |
| "entropy": 0.6460321098566055, | |
| "epoch": 0.47364152473641524, | |
| "grad_norm": 0.013498514890670776, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6516697406768799, | |
| "mean_token_accuracy": 0.7381351664662361, | |
| "num_tokens": 2720891.0, | |
| "step": 73 | |
| }, | |
| { | |
| "entropy": 0.6352040842175484, | |
| "epoch": 0.48012976480129765, | |
| "grad_norm": 0.013542759232223034, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6443178653717041, | |
| "mean_token_accuracy": 0.7414710223674774, | |
| "num_tokens": 2758174.0, | |
| "step": 74 | |
| }, | |
| { | |
| "entropy": 0.6283697411417961, | |
| "epoch": 0.48661800486618007, | |
| "grad_norm": 0.014966949820518494, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6394721269607544, | |
| "mean_token_accuracy": 0.7419639229774475, | |
| "num_tokens": 2795106.0, | |
| "step": 75 | |
| }, | |
| { | |
| "entropy": 0.642236091196537, | |
| "epoch": 0.4931062449310625, | |
| "grad_norm": 0.015388374216854572, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6414813995361328, | |
| "mean_token_accuracy": 0.7409433200955391, | |
| "num_tokens": 2832247.0, | |
| "step": 76 | |
| }, | |
| { | |
| "entropy": 0.6422772705554962, | |
| "epoch": 0.49959448499594483, | |
| "grad_norm": 0.013754413463175297, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6367785930633545, | |
| "mean_token_accuracy": 0.7442163750529289, | |
| "num_tokens": 2869526.0, | |
| "step": 77 | |
| }, | |
| { | |
| "entropy": 0.653985932469368, | |
| "epoch": 0.5060827250608273, | |
| "grad_norm": 0.012936330400407314, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6488639712333679, | |
| "mean_token_accuracy": 0.7398064211010933, | |
| "num_tokens": 2906821.0, | |
| "step": 78 | |
| }, | |
| { | |
| "entropy": 0.6418487578630447, | |
| "epoch": 0.5125709651257097, | |
| "grad_norm": 0.011183886788785458, | |
| "learning_rate": 0.0002, | |
| "loss": 0.639202356338501, | |
| "mean_token_accuracy": 0.7434348165988922, | |
| "num_tokens": 2944032.0, | |
| "step": 79 | |
| }, | |
| { | |
| "entropy": 0.6251209825277328, | |
| "epoch": 0.519059205190592, | |
| "grad_norm": 0.013851741328835487, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6242102384567261, | |
| "mean_token_accuracy": 0.7505335137248039, | |
| "num_tokens": 2981414.0, | |
| "step": 80 | |
| }, | |
| { | |
| "entropy": 0.6139597967267036, | |
| "epoch": 0.5255474452554745, | |
| "grad_norm": 0.013575786724686623, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6168844699859619, | |
| "mean_token_accuracy": 0.7502986714243889, | |
| "num_tokens": 3018494.0, | |
| "step": 81 | |
| }, | |
| { | |
| "entropy": 0.6357163935899734, | |
| "epoch": 0.5320356853203568, | |
| "grad_norm": 0.012106247246265411, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6393176317214966, | |
| "mean_token_accuracy": 0.743524856865406, | |
| "num_tokens": 3055667.0, | |
| "step": 82 | |
| }, | |
| { | |
| "entropy": 0.630703866481781, | |
| "epoch": 0.5385239253852393, | |
| "grad_norm": 0.011411616578698158, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6349452137947083, | |
| "mean_token_accuracy": 0.7417918294668198, | |
| "num_tokens": 3092980.0, | |
| "step": 83 | |
| }, | |
| { | |
| "entropy": 0.6312713250517845, | |
| "epoch": 0.5450121654501217, | |
| "grad_norm": 0.013269394636154175, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6335923075675964, | |
| "mean_token_accuracy": 0.7427873983979225, | |
| "num_tokens": 3129991.0, | |
| "step": 84 | |
| }, | |
| { | |
| "entropy": 0.6429375261068344, | |
| "epoch": 0.551500405515004, | |
| "grad_norm": 0.01290512178093195, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6390902996063232, | |
| "mean_token_accuracy": 0.7440147623419762, | |
| "num_tokens": 3167600.0, | |
| "step": 85 | |
| }, | |
| { | |
| "entropy": 0.6209964007139206, | |
| "epoch": 0.5579886455798865, | |
| "grad_norm": 0.011449260637164116, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6205590963363647, | |
| "mean_token_accuracy": 0.7478290274739265, | |
| "num_tokens": 3204616.0, | |
| "step": 86 | |
| }, | |
| { | |
| "entropy": 0.6387689039111137, | |
| "epoch": 0.5644768856447688, | |
| "grad_norm": 0.012288929894566536, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6413038372993469, | |
| "mean_token_accuracy": 0.7402090132236481, | |
| "num_tokens": 3241598.0, | |
| "step": 87 | |
| }, | |
| { | |
| "entropy": 0.6296097934246063, | |
| "epoch": 0.5709651257096513, | |
| "grad_norm": 0.012685527093708515, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6300569772720337, | |
| "mean_token_accuracy": 0.745740607380867, | |
| "num_tokens": 3278904.0, | |
| "step": 88 | |
| }, | |
| { | |
| "entropy": 0.6304027885198593, | |
| "epoch": 0.5774533657745337, | |
| "grad_norm": 0.012135171331465244, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6322764158248901, | |
| "mean_token_accuracy": 0.7428491413593292, | |
| "num_tokens": 3315916.0, | |
| "step": 89 | |
| }, | |
| { | |
| "entropy": 0.6270208656787872, | |
| "epoch": 0.583941605839416, | |
| "grad_norm": 0.012634403072297573, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6289095878601074, | |
| "mean_token_accuracy": 0.74432173371315, | |
| "num_tokens": 3352975.0, | |
| "step": 90 | |
| }, | |
| { | |
| "entropy": 0.6426985636353493, | |
| "epoch": 0.5904298459042985, | |
| "grad_norm": 0.012899120338261127, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6412180662155151, | |
| "mean_token_accuracy": 0.7413002401590347, | |
| "num_tokens": 3390460.0, | |
| "step": 91 | |
| }, | |
| { | |
| "entropy": 0.6386194601655006, | |
| "epoch": 0.5969180859691808, | |
| "grad_norm": 0.011871455237269402, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6381049156188965, | |
| "mean_token_accuracy": 0.7410541325807571, | |
| "num_tokens": 3427650.0, | |
| "step": 92 | |
| }, | |
| { | |
| "entropy": 0.6219398155808449, | |
| "epoch": 0.6034063260340633, | |
| "grad_norm": 0.013389634899795055, | |
| "learning_rate": 0.0002, | |
| "loss": 0.628428041934967, | |
| "mean_token_accuracy": 0.7469312027096748, | |
| "num_tokens": 3464664.0, | |
| "step": 93 | |
| }, | |
| { | |
| "entropy": 0.6363367736339569, | |
| "epoch": 0.6098945660989457, | |
| "grad_norm": 0.010384561493992805, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6355550289154053, | |
| "mean_token_accuracy": 0.742337591946125, | |
| "num_tokens": 3502010.0, | |
| "step": 94 | |
| }, | |
| { | |
| "entropy": 0.6357248276472092, | |
| "epoch": 0.616382806163828, | |
| "grad_norm": 0.010791895911097527, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6378734111785889, | |
| "mean_token_accuracy": 0.7428740784525871, | |
| "num_tokens": 3539472.0, | |
| "step": 95 | |
| }, | |
| { | |
| "entropy": 0.6360966116189957, | |
| "epoch": 0.6228710462287105, | |
| "grad_norm": 0.010037368163466454, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6382291316986084, | |
| "mean_token_accuracy": 0.7439633831381798, | |
| "num_tokens": 3576863.0, | |
| "step": 96 | |
| }, | |
| { | |
| "entropy": 0.6299866884946823, | |
| "epoch": 0.6293592862935928, | |
| "grad_norm": 0.011554226279258728, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6333507895469666, | |
| "mean_token_accuracy": 0.7430082336068153, | |
| "num_tokens": 3613859.0, | |
| "step": 97 | |
| }, | |
| { | |
| "entropy": 0.6372612193226814, | |
| "epoch": 0.6358475263584753, | |
| "grad_norm": 0.012070685625076294, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6347473859786987, | |
| "mean_token_accuracy": 0.7440797835588455, | |
| "num_tokens": 3651376.0, | |
| "step": 98 | |
| }, | |
| { | |
| "entropy": 0.6408236473798752, | |
| "epoch": 0.6423357664233577, | |
| "grad_norm": 0.010936851613223553, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6386737823486328, | |
| "mean_token_accuracy": 0.7431015446782112, | |
| "num_tokens": 3688847.0, | |
| "step": 99 | |
| }, | |
| { | |
| "entropy": 0.6442330852150917, | |
| "epoch": 0.64882400648824, | |
| "grad_norm": 0.01024035457521677, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6463708877563477, | |
| "mean_token_accuracy": 0.7389701902866364, | |
| "num_tokens": 3726347.0, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 0.6199506223201752, | |
| "epoch": 0.6553122465531225, | |
| "grad_norm": 0.01070485170930624, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6225665807723999, | |
| "mean_token_accuracy": 0.7488372325897217, | |
| "num_tokens": 3763687.0, | |
| "step": 101 | |
| }, | |
| { | |
| "entropy": 0.6321059763431549, | |
| "epoch": 0.6618004866180048, | |
| "grad_norm": 0.010497628711163998, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6386170387268066, | |
| "mean_token_accuracy": 0.7398883476853371, | |
| "num_tokens": 3801390.0, | |
| "step": 102 | |
| }, | |
| { | |
| "entropy": 0.6317892819643021, | |
| "epoch": 0.6682887266828873, | |
| "grad_norm": 0.009558591060340405, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6320483684539795, | |
| "mean_token_accuracy": 0.744752362370491, | |
| "num_tokens": 3838836.0, | |
| "step": 103 | |
| }, | |
| { | |
| "entropy": 0.6251348331570625, | |
| "epoch": 0.6747769667477697, | |
| "grad_norm": 0.012168657965958118, | |
| "learning_rate": 0.0002, | |
| "loss": 0.624641478061676, | |
| "mean_token_accuracy": 0.7455502301454544, | |
| "num_tokens": 3876059.0, | |
| "step": 104 | |
| }, | |
| { | |
| "entropy": 0.6264195889234543, | |
| "epoch": 0.681265206812652, | |
| "grad_norm": 0.01135180238634348, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6254705190658569, | |
| "mean_token_accuracy": 0.7437941655516624, | |
| "num_tokens": 3913140.0, | |
| "step": 105 | |
| }, | |
| { | |
| "entropy": 0.6271661967039108, | |
| "epoch": 0.6877534468775345, | |
| "grad_norm": 0.011404785327613354, | |
| "learning_rate": 0.0002, | |
| "loss": 0.627234160900116, | |
| "mean_token_accuracy": 0.7443915233016014, | |
| "num_tokens": 3950197.0, | |
| "step": 106 | |
| }, | |
| { | |
| "entropy": 0.6316048800945282, | |
| "epoch": 0.6942416869424168, | |
| "grad_norm": 0.012731475755572319, | |
| "learning_rate": 0.0002, | |
| "loss": 0.631871223449707, | |
| "mean_token_accuracy": 0.7436823844909668, | |
| "num_tokens": 3987880.0, | |
| "step": 107 | |
| }, | |
| { | |
| "entropy": 0.6351677849888802, | |
| "epoch": 0.7007299270072993, | |
| "grad_norm": 0.011057685129344463, | |
| "learning_rate": 0.0002, | |
| "loss": 0.634377121925354, | |
| "mean_token_accuracy": 0.7431640774011612, | |
| "num_tokens": 4025490.0, | |
| "step": 108 | |
| }, | |
| { | |
| "entropy": 0.6258664429187775, | |
| "epoch": 0.7072181670721817, | |
| "grad_norm": 0.012130603194236755, | |
| "learning_rate": 0.0002, | |
| "loss": 0.628970742225647, | |
| "mean_token_accuracy": 0.7431703954935074, | |
| "num_tokens": 4062925.0, | |
| "step": 109 | |
| }, | |
| { | |
| "entropy": 0.6371812373399734, | |
| "epoch": 0.7137064071370641, | |
| "grad_norm": 0.01057880837470293, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6419240236282349, | |
| "mean_token_accuracy": 0.7392893806099892, | |
| "num_tokens": 4100176.0, | |
| "step": 110 | |
| }, | |
| { | |
| "entropy": 0.6297428086400032, | |
| "epoch": 0.7201946472019465, | |
| "grad_norm": 0.01054214034229517, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6334270238876343, | |
| "mean_token_accuracy": 0.7451630085706711, | |
| "num_tokens": 4137649.0, | |
| "step": 111 | |
| }, | |
| { | |
| "entropy": 0.6174112483859062, | |
| "epoch": 0.7266828872668288, | |
| "grad_norm": 0.01192370243370533, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6196002960205078, | |
| "mean_token_accuracy": 0.748643770813942, | |
| "num_tokens": 4174992.0, | |
| "step": 112 | |
| }, | |
| { | |
| "entropy": 0.6409988701343536, | |
| "epoch": 0.7331711273317113, | |
| "grad_norm": 0.012110228650271893, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6420451402664185, | |
| "mean_token_accuracy": 0.7404038235545158, | |
| "num_tokens": 4212392.0, | |
| "step": 113 | |
| }, | |
| { | |
| "entropy": 0.6189580634236336, | |
| "epoch": 0.7396593673965937, | |
| "grad_norm": 0.010546376928687096, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6227763891220093, | |
| "mean_token_accuracy": 0.7471738830208778, | |
| "num_tokens": 4249387.0, | |
| "step": 114 | |
| }, | |
| { | |
| "entropy": 0.6477556005120277, | |
| "epoch": 0.7461476074614761, | |
| "grad_norm": 0.012936307117342949, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6444486379623413, | |
| "mean_token_accuracy": 0.7407133355736732, | |
| "num_tokens": 4286813.0, | |
| "step": 115 | |
| }, | |
| { | |
| "entropy": 0.6388062611222267, | |
| "epoch": 0.7526358475263585, | |
| "grad_norm": 0.011020737700164318, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6358926892280579, | |
| "mean_token_accuracy": 0.7421080470085144, | |
| "num_tokens": 4324068.0, | |
| "step": 116 | |
| }, | |
| { | |
| "entropy": 0.623978279531002, | |
| "epoch": 0.7591240875912408, | |
| "grad_norm": 0.011272276751697063, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6239657402038574, | |
| "mean_token_accuracy": 0.7491330280900002, | |
| "num_tokens": 4361117.0, | |
| "step": 117 | |
| }, | |
| { | |
| "entropy": 0.6343322321772575, | |
| "epoch": 0.7656123276561233, | |
| "grad_norm": 0.011995693668723106, | |
| "learning_rate": 0.0002, | |
| "loss": 0.635836124420166, | |
| "mean_token_accuracy": 0.7406070083379745, | |
| "num_tokens": 4398800.0, | |
| "step": 118 | |
| }, | |
| { | |
| "entropy": 0.6236653178930283, | |
| "epoch": 0.7721005677210057, | |
| "grad_norm": 0.012621116824448109, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6293167471885681, | |
| "mean_token_accuracy": 0.7453652620315552, | |
| "num_tokens": 4435941.0, | |
| "step": 119 | |
| }, | |
| { | |
| "entropy": 0.6156119927763939, | |
| "epoch": 0.7785888077858881, | |
| "grad_norm": 0.010849852114915848, | |
| "learning_rate": 0.0002, | |
| "loss": 0.619170069694519, | |
| "mean_token_accuracy": 0.7481161803007126, | |
| "num_tokens": 4473532.0, | |
| "step": 120 | |
| }, | |
| { | |
| "entropy": 0.6325643733143806, | |
| "epoch": 0.7850770478507705, | |
| "grad_norm": 0.012033924460411072, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6320570707321167, | |
| "mean_token_accuracy": 0.745756022632122, | |
| "num_tokens": 4510663.0, | |
| "step": 121 | |
| }, | |
| { | |
| "entropy": 0.6439174935221672, | |
| "epoch": 0.7915652879156528, | |
| "grad_norm": 0.011160428635776043, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6456828117370605, | |
| "mean_token_accuracy": 0.7372104227542877, | |
| "num_tokens": 4548366.0, | |
| "step": 122 | |
| }, | |
| { | |
| "entropy": 0.614606499671936, | |
| "epoch": 0.7980535279805353, | |
| "grad_norm": 0.012264038436114788, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6181074976921082, | |
| "mean_token_accuracy": 0.7488836497068405, | |
| "num_tokens": 4585220.0, | |
| "step": 123 | |
| }, | |
| { | |
| "entropy": 0.6238071173429489, | |
| "epoch": 0.8045417680454177, | |
| "grad_norm": 0.010948721319437027, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6282123327255249, | |
| "mean_token_accuracy": 0.7447341307997704, | |
| "num_tokens": 4622594.0, | |
| "step": 124 | |
| }, | |
| { | |
| "entropy": 0.6207244768738747, | |
| "epoch": 0.8110300081103001, | |
| "grad_norm": 0.011111956089735031, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6224273443222046, | |
| "mean_token_accuracy": 0.748368538916111, | |
| "num_tokens": 4659890.0, | |
| "step": 125 | |
| }, | |
| { | |
| "entropy": 0.6334651708602905, | |
| "epoch": 0.8175182481751825, | |
| "grad_norm": 0.01036700326949358, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6354086399078369, | |
| "mean_token_accuracy": 0.742103323340416, | |
| "num_tokens": 4697214.0, | |
| "step": 126 | |
| }, | |
| { | |
| "entropy": 0.6321412995457649, | |
| "epoch": 0.8240064882400648, | |
| "grad_norm": 0.011659913696348667, | |
| "learning_rate": 0.0002, | |
| "loss": 0.632038950920105, | |
| "mean_token_accuracy": 0.7430339977145195, | |
| "num_tokens": 4734306.0, | |
| "step": 127 | |
| }, | |
| { | |
| "entropy": 0.6252134963870049, | |
| "epoch": 0.8304947283049473, | |
| "grad_norm": 0.010766416788101196, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6210082173347473, | |
| "mean_token_accuracy": 0.747887596487999, | |
| "num_tokens": 4772005.0, | |
| "step": 128 | |
| }, | |
| { | |
| "entropy": 0.632231742143631, | |
| "epoch": 0.8369829683698297, | |
| "grad_norm": 0.009685291908681393, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6338882446289062, | |
| "mean_token_accuracy": 0.7436560764908791, | |
| "num_tokens": 4809261.0, | |
| "step": 129 | |
| }, | |
| { | |
| "entropy": 0.6244007870554924, | |
| "epoch": 0.8434712084347121, | |
| "grad_norm": 0.011300327256321907, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6297156810760498, | |
| "mean_token_accuracy": 0.7441424131393433, | |
| "num_tokens": 4846773.0, | |
| "step": 130 | |
| }, | |
| { | |
| "entropy": 0.6212883591651917, | |
| "epoch": 0.8499594484995945, | |
| "grad_norm": 0.011122049763798714, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6272852420806885, | |
| "mean_token_accuracy": 0.745480865240097, | |
| "num_tokens": 4884087.0, | |
| "step": 131 | |
| }, | |
| { | |
| "entropy": 0.6275059729814529, | |
| "epoch": 0.8564476885644768, | |
| "grad_norm": 0.011759513057768345, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6352666020393372, | |
| "mean_token_accuracy": 0.741997979581356, | |
| "num_tokens": 4921034.0, | |
| "step": 132 | |
| }, | |
| { | |
| "entropy": 0.6292549446225166, | |
| "epoch": 0.8629359286293593, | |
| "grad_norm": 0.010103589855134487, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6285660862922668, | |
| "mean_token_accuracy": 0.7458189874887466, | |
| "num_tokens": 4958394.0, | |
| "step": 133 | |
| }, | |
| { | |
| "entropy": 0.6254143863916397, | |
| "epoch": 0.8694241686942417, | |
| "grad_norm": 0.009165394119918346, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6281845569610596, | |
| "mean_token_accuracy": 0.7441290989518166, | |
| "num_tokens": 4995560.0, | |
| "step": 134 | |
| }, | |
| { | |
| "entropy": 0.6326478272676468, | |
| "epoch": 0.8759124087591241, | |
| "grad_norm": 0.009857391007244587, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6341642141342163, | |
| "mean_token_accuracy": 0.7431726306676865, | |
| "num_tokens": 5032908.0, | |
| "step": 135 | |
| }, | |
| { | |
| "entropy": 0.6411951705813408, | |
| "epoch": 0.8824006488240065, | |
| "grad_norm": 0.009912555105984211, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6402624845504761, | |
| "mean_token_accuracy": 0.7418247908353806, | |
| "num_tokens": 5070353.0, | |
| "step": 136 | |
| }, | |
| { | |
| "entropy": 0.6335436180233955, | |
| "epoch": 0.8888888888888888, | |
| "grad_norm": 0.010203655809164047, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6348065137863159, | |
| "mean_token_accuracy": 0.7417963817715645, | |
| "num_tokens": 5107488.0, | |
| "step": 137 | |
| }, | |
| { | |
| "entropy": 0.6298110708594322, | |
| "epoch": 0.8953771289537713, | |
| "grad_norm": 0.009738304652273655, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6292046904563904, | |
| "mean_token_accuracy": 0.7428107112646103, | |
| "num_tokens": 5144774.0, | |
| "step": 138 | |
| }, | |
| { | |
| "entropy": 0.621233694255352, | |
| "epoch": 0.9018653690186537, | |
| "grad_norm": 0.009310460649430752, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6167433261871338, | |
| "mean_token_accuracy": 0.7501207813620567, | |
| "num_tokens": 5181712.0, | |
| "step": 139 | |
| }, | |
| { | |
| "entropy": 0.6066861748695374, | |
| "epoch": 0.9083536090835361, | |
| "grad_norm": 0.010622376576066017, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6090973615646362, | |
| "mean_token_accuracy": 0.7524907812476158, | |
| "num_tokens": 5219096.0, | |
| "step": 140 | |
| }, | |
| { | |
| "entropy": 0.6264965310692787, | |
| "epoch": 0.9148418491484185, | |
| "grad_norm": 0.011424071155488491, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6337799429893494, | |
| "mean_token_accuracy": 0.7431259453296661, | |
| "num_tokens": 5256221.0, | |
| "step": 141 | |
| }, | |
| { | |
| "entropy": 0.6391952782869339, | |
| "epoch": 0.9213300892133008, | |
| "grad_norm": 0.009158595465123653, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6384302973747253, | |
| "mean_token_accuracy": 0.7389715909957886, | |
| "num_tokens": 5293696.0, | |
| "step": 142 | |
| }, | |
| { | |
| "entropy": 0.6427849903702736, | |
| "epoch": 0.9278183292781833, | |
| "grad_norm": 0.011200455017387867, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6386270523071289, | |
| "mean_token_accuracy": 0.7409881576895714, | |
| "num_tokens": 5330767.0, | |
| "step": 143 | |
| }, | |
| { | |
| "entropy": 0.6417384147644043, | |
| "epoch": 0.9343065693430657, | |
| "grad_norm": 0.010727403685450554, | |
| "learning_rate": 0.0002, | |
| "loss": 0.63932865858078, | |
| "mean_token_accuracy": 0.7433461174368858, | |
| "num_tokens": 5368288.0, | |
| "step": 144 | |
| }, | |
| { | |
| "entropy": 0.6349349692463875, | |
| "epoch": 0.9407948094079481, | |
| "grad_norm": 0.01087568886578083, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6332679986953735, | |
| "mean_token_accuracy": 0.7431394383311272, | |
| "num_tokens": 5405743.0, | |
| "step": 145 | |
| }, | |
| { | |
| "entropy": 0.6268604248762131, | |
| "epoch": 0.9472830494728305, | |
| "grad_norm": 0.009905870072543621, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6278096437454224, | |
| "mean_token_accuracy": 0.7460607141256332, | |
| "num_tokens": 5442824.0, | |
| "step": 146 | |
| }, | |
| { | |
| "entropy": 0.6252990365028381, | |
| "epoch": 0.9537712895377128, | |
| "grad_norm": 0.011337473057210445, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6313953399658203, | |
| "mean_token_accuracy": 0.7449029609560966, | |
| "num_tokens": 5480060.0, | |
| "step": 147 | |
| }, | |
| { | |
| "entropy": 0.6279519572854042, | |
| "epoch": 0.9602595296025953, | |
| "grad_norm": 0.011046580970287323, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6361185312271118, | |
| "mean_token_accuracy": 0.7435570135712624, | |
| "num_tokens": 5517276.0, | |
| "step": 148 | |
| }, | |
| { | |
| "entropy": 0.6244647055864334, | |
| "epoch": 0.9667477696674777, | |
| "grad_norm": 0.010344677604734898, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6286739110946655, | |
| "mean_token_accuracy": 0.7459346577525139, | |
| "num_tokens": 5554772.0, | |
| "step": 149 | |
| }, | |
| { | |
| "entropy": 0.625552199780941, | |
| "epoch": 0.9732360097323601, | |
| "grad_norm": 0.010485424660146236, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6246562600135803, | |
| "mean_token_accuracy": 0.7459065243601799, | |
| "num_tokens": 5592235.0, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 0.650402158498764, | |
| "epoch": 0.9797242497972425, | |
| "grad_norm": 0.01180343609303236, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6489013433456421, | |
| "mean_token_accuracy": 0.7372798472642899, | |
| "num_tokens": 5629879.0, | |
| "step": 151 | |
| }, | |
| { | |
| "entropy": 0.625130906701088, | |
| "epoch": 0.986212489862125, | |
| "grad_norm": 0.010784060694277287, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6217543482780457, | |
| "mean_token_accuracy": 0.7487893849611282, | |
| "num_tokens": 5667174.0, | |
| "step": 152 | |
| }, | |
| { | |
| "entropy": 0.6295798048377037, | |
| "epoch": 0.9927007299270073, | |
| "grad_norm": 0.00907177198678255, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6333097219467163, | |
| "mean_token_accuracy": 0.7429074198007584, | |
| "num_tokens": 5704388.0, | |
| "step": 153 | |
| }, | |
| { | |
| "entropy": 0.6149610579013824, | |
| "epoch": 0.9991889699918897, | |
| "grad_norm": 0.010923929512500763, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6188989877700806, | |
| "mean_token_accuracy": 0.7496026828885078, | |
| "num_tokens": 5741236.0, | |
| "step": 154 | |
| }, | |
| { | |
| "entropy": 0.6364340782165527, | |
| "epoch": 1.0, | |
| "grad_norm": 0.023092100396752357, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6314291954040527, | |
| "mean_token_accuracy": 0.7433016300201416, | |
| "num_tokens": 5745896.0, | |
| "step": 155 | |
| }, | |
| { | |
| "entropy": 0.6255532875657082, | |
| "epoch": 1.0064882400648825, | |
| "grad_norm": 0.010001299902796745, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6274809837341309, | |
| "mean_token_accuracy": 0.7447079941630363, | |
| "num_tokens": 5782887.0, | |
| "step": 156 | |
| }, | |
| { | |
| "entropy": 0.6249469369649887, | |
| "epoch": 1.0129764801297647, | |
| "grad_norm": 0.010014750063419342, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6293044090270996, | |
| "mean_token_accuracy": 0.743991531431675, | |
| "num_tokens": 5820452.0, | |
| "step": 157 | |
| }, | |
| { | |
| "entropy": 0.6250087693333626, | |
| "epoch": 1.0194647201946472, | |
| "grad_norm": 0.009554821066558361, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6216879487037659, | |
| "mean_token_accuracy": 0.7472942620515823, | |
| "num_tokens": 5857511.0, | |
| "step": 158 | |
| }, | |
| { | |
| "entropy": 0.6345709040760994, | |
| "epoch": 1.0259529602595296, | |
| "grad_norm": 0.010529364459216595, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6336644887924194, | |
| "mean_token_accuracy": 0.7428694814443588, | |
| "num_tokens": 5895426.0, | |
| "step": 159 | |
| }, | |
| { | |
| "entropy": 0.6269640624523163, | |
| "epoch": 1.0324412003244121, | |
| "grad_norm": 0.010084465146064758, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6298044919967651, | |
| "mean_token_accuracy": 0.7432648167014122, | |
| "num_tokens": 5932788.0, | |
| "step": 160 | |
| }, | |
| { | |
| "entropy": 0.6268706321716309, | |
| "epoch": 1.0389294403892944, | |
| "grad_norm": 0.009462922811508179, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6329535245895386, | |
| "mean_token_accuracy": 0.7419963404536247, | |
| "num_tokens": 5970211.0, | |
| "step": 161 | |
| }, | |
| { | |
| "entropy": 0.6167154312133789, | |
| "epoch": 1.0454176804541768, | |
| "grad_norm": 0.009687564335763454, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6214160919189453, | |
| "mean_token_accuracy": 0.7477982342243195, | |
| "num_tokens": 6007676.0, | |
| "step": 162 | |
| }, | |
| { | |
| "entropy": 0.6232415363192558, | |
| "epoch": 1.0519059205190593, | |
| "grad_norm": 0.011512194760143757, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6291061639785767, | |
| "mean_token_accuracy": 0.743974357843399, | |
| "num_tokens": 6044881.0, | |
| "step": 163 | |
| }, | |
| { | |
| "entropy": 0.6384411826729774, | |
| "epoch": 1.0583941605839415, | |
| "grad_norm": 0.009664908982813358, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6418322920799255, | |
| "mean_token_accuracy": 0.7393775209784508, | |
| "num_tokens": 6081959.0, | |
| "step": 164 | |
| }, | |
| { | |
| "entropy": 0.6312756985425949, | |
| "epoch": 1.064882400648824, | |
| "grad_norm": 0.009909010492265224, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6294491291046143, | |
| "mean_token_accuracy": 0.7447398081421852, | |
| "num_tokens": 6119502.0, | |
| "step": 165 | |
| }, | |
| { | |
| "entropy": 0.6399073377251625, | |
| "epoch": 1.0713706407137065, | |
| "grad_norm": 0.009380994364619255, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6359134912490845, | |
| "mean_token_accuracy": 0.7427374646067619, | |
| "num_tokens": 6157187.0, | |
| "step": 166 | |
| }, | |
| { | |
| "entropy": 0.6151667386293411, | |
| "epoch": 1.0778588807785887, | |
| "grad_norm": 0.008555393666028976, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6155805587768555, | |
| "mean_token_accuracy": 0.7496763169765472, | |
| "num_tokens": 6194222.0, | |
| "step": 167 | |
| }, | |
| { | |
| "entropy": 0.6240349486470222, | |
| "epoch": 1.0843471208434712, | |
| "grad_norm": 0.008739444427192211, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6246569156646729, | |
| "mean_token_accuracy": 0.7454928457736969, | |
| "num_tokens": 6231423.0, | |
| "step": 168 | |
| }, | |
| { | |
| "entropy": 0.6332473009824753, | |
| "epoch": 1.0908353609083536, | |
| "grad_norm": 0.009752689860761166, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6364842653274536, | |
| "mean_token_accuracy": 0.7410347387194633, | |
| "num_tokens": 6268835.0, | |
| "step": 169 | |
| }, | |
| { | |
| "entropy": 0.6179100349545479, | |
| "epoch": 1.0973236009732361, | |
| "grad_norm": 0.010130702517926693, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6235646605491638, | |
| "mean_token_accuracy": 0.7480539605021477, | |
| "num_tokens": 6306169.0, | |
| "step": 170 | |
| }, | |
| { | |
| "entropy": 0.6232842579483986, | |
| "epoch": 1.1038118410381184, | |
| "grad_norm": 0.00973625760525465, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6288238763809204, | |
| "mean_token_accuracy": 0.7431181073188782, | |
| "num_tokens": 6343047.0, | |
| "step": 171 | |
| }, | |
| { | |
| "entropy": 0.6252638548612595, | |
| "epoch": 1.1103000811030008, | |
| "grad_norm": 0.009265839122235775, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6260301470756531, | |
| "mean_token_accuracy": 0.7449894994497299, | |
| "num_tokens": 6380248.0, | |
| "step": 172 | |
| }, | |
| { | |
| "entropy": 0.6273873671889305, | |
| "epoch": 1.1167883211678833, | |
| "grad_norm": 0.009544978849589825, | |
| "learning_rate": 0.0002, | |
| "loss": 0.624110996723175, | |
| "mean_token_accuracy": 0.7455884218215942, | |
| "num_tokens": 6417799.0, | |
| "step": 173 | |
| }, | |
| { | |
| "entropy": 0.6261554434895515, | |
| "epoch": 1.1232765612327655, | |
| "grad_norm": 0.009425261989235878, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6238696575164795, | |
| "mean_token_accuracy": 0.747870922088623, | |
| "num_tokens": 6454969.0, | |
| "step": 174 | |
| }, | |
| { | |
| "entropy": 0.6361829712986946, | |
| "epoch": 1.129764801297648, | |
| "grad_norm": 0.009325449354946613, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6336718201637268, | |
| "mean_token_accuracy": 0.7412231788039207, | |
| "num_tokens": 6493115.0, | |
| "step": 175 | |
| }, | |
| { | |
| "entropy": 0.626146711409092, | |
| "epoch": 1.1362530413625305, | |
| "grad_norm": 0.010177000425755978, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6264243125915527, | |
| "mean_token_accuracy": 0.7452349737286568, | |
| "num_tokens": 6530141.0, | |
| "step": 176 | |
| }, | |
| { | |
| "entropy": 0.620332308113575, | |
| "epoch": 1.142741281427413, | |
| "grad_norm": 0.010463408194482327, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6263006329536438, | |
| "mean_token_accuracy": 0.7455399706959724, | |
| "num_tokens": 6567506.0, | |
| "step": 177 | |
| }, | |
| { | |
| "entropy": 0.6137627214193344, | |
| "epoch": 1.1492295214922952, | |
| "grad_norm": 0.011479280889034271, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6208648681640625, | |
| "mean_token_accuracy": 0.7491373345255852, | |
| "num_tokens": 6604409.0, | |
| "step": 178 | |
| }, | |
| { | |
| "entropy": 0.6161536052823067, | |
| "epoch": 1.1557177615571776, | |
| "grad_norm": 0.010295857675373554, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6196001768112183, | |
| "mean_token_accuracy": 0.7471510693430901, | |
| "num_tokens": 6641779.0, | |
| "step": 179 | |
| }, | |
| { | |
| "entropy": 0.615701287984848, | |
| "epoch": 1.1622060016220601, | |
| "grad_norm": 0.00977401528507471, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6152433156967163, | |
| "mean_token_accuracy": 0.7513743862509727, | |
| "num_tokens": 6678811.0, | |
| "step": 180 | |
| }, | |
| { | |
| "entropy": 0.6276117786765099, | |
| "epoch": 1.1686942416869424, | |
| "grad_norm": 0.009978534653782845, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6257454752922058, | |
| "mean_token_accuracy": 0.7457039654254913, | |
| "num_tokens": 6715971.0, | |
| "step": 181 | |
| }, | |
| { | |
| "entropy": 0.622728981077671, | |
| "epoch": 1.1751824817518248, | |
| "grad_norm": 0.010105178691446781, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6200466156005859, | |
| "mean_token_accuracy": 0.7463524416089058, | |
| "num_tokens": 6753100.0, | |
| "step": 182 | |
| }, | |
| { | |
| "entropy": 0.6278671473264694, | |
| "epoch": 1.1816707218167073, | |
| "grad_norm": 0.00981152057647705, | |
| "learning_rate": 0.0002, | |
| "loss": 0.629209041595459, | |
| "mean_token_accuracy": 0.7440850958228111, | |
| "num_tokens": 6790606.0, | |
| "step": 183 | |
| }, | |
| { | |
| "entropy": 0.6340474411845207, | |
| "epoch": 1.1881589618815895, | |
| "grad_norm": 0.010966816917061806, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6343464851379395, | |
| "mean_token_accuracy": 0.7423162013292313, | |
| "num_tokens": 6827773.0, | |
| "step": 184 | |
| }, | |
| { | |
| "entropy": 0.627871498465538, | |
| "epoch": 1.194647201946472, | |
| "grad_norm": 0.01046378631144762, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6280568838119507, | |
| "mean_token_accuracy": 0.7452474683523178, | |
| "num_tokens": 6865004.0, | |
| "step": 185 | |
| }, | |
| { | |
| "entropy": 0.632583849132061, | |
| "epoch": 1.2011354420113545, | |
| "grad_norm": 0.011151660233736038, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6399388313293457, | |
| "mean_token_accuracy": 0.7401903197169304, | |
| "num_tokens": 6902199.0, | |
| "step": 186 | |
| }, | |
| { | |
| "entropy": 0.6207470819354057, | |
| "epoch": 1.2076236820762367, | |
| "grad_norm": 0.009539226070046425, | |
| "learning_rate": 0.0002, | |
| "loss": 0.626314640045166, | |
| "mean_token_accuracy": 0.7447792664170265, | |
| "num_tokens": 6939345.0, | |
| "step": 187 | |
| }, | |
| { | |
| "entropy": 0.6265325620770454, | |
| "epoch": 1.2141119221411192, | |
| "grad_norm": 0.010582523420453072, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6258584260940552, | |
| "mean_token_accuracy": 0.7450206950306892, | |
| "num_tokens": 6976749.0, | |
| "step": 188 | |
| }, | |
| { | |
| "entropy": 0.6242929175496101, | |
| "epoch": 1.2206001622060016, | |
| "grad_norm": 0.010438770987093449, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6282113790512085, | |
| "mean_token_accuracy": 0.7453068420290947, | |
| "num_tokens": 7013986.0, | |
| "step": 189 | |
| }, | |
| { | |
| "entropy": 0.6362300962209702, | |
| "epoch": 1.2270884022708841, | |
| "grad_norm": 0.009592331014573574, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6338801980018616, | |
| "mean_token_accuracy": 0.7425767108798027, | |
| "num_tokens": 7051122.0, | |
| "step": 190 | |
| }, | |
| { | |
| "entropy": 0.6142800450325012, | |
| "epoch": 1.2335766423357664, | |
| "grad_norm": 0.008985689841210842, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6143558025360107, | |
| "mean_token_accuracy": 0.750966027379036, | |
| "num_tokens": 7088050.0, | |
| "step": 191 | |
| }, | |
| { | |
| "entropy": 0.6302971392869949, | |
| "epoch": 1.2400648824006488, | |
| "grad_norm": 0.009001200087368488, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6324248313903809, | |
| "mean_token_accuracy": 0.7426666542887688, | |
| "num_tokens": 7125652.0, | |
| "step": 192 | |
| }, | |
| { | |
| "entropy": 0.6278156340122223, | |
| "epoch": 1.2465531224655313, | |
| "grad_norm": 0.009873399510979652, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6288595795631409, | |
| "mean_token_accuracy": 0.7446199506521225, | |
| "num_tokens": 7163209.0, | |
| "step": 193 | |
| }, | |
| { | |
| "entropy": 0.6151107102632523, | |
| "epoch": 1.2530413625304138, | |
| "grad_norm": 0.010955240577459335, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6196198463439941, | |
| "mean_token_accuracy": 0.7487600594758987, | |
| "num_tokens": 7200676.0, | |
| "step": 194 | |
| }, | |
| { | |
| "entropy": 0.624420776963234, | |
| "epoch": 1.259529602595296, | |
| "grad_norm": 0.009569366462528706, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6245594024658203, | |
| "mean_token_accuracy": 0.7455159053206444, | |
| "num_tokens": 7237914.0, | |
| "step": 195 | |
| }, | |
| { | |
| "entropy": 0.62844218313694, | |
| "epoch": 1.2660178426601785, | |
| "grad_norm": 0.00903658103197813, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6268140077590942, | |
| "mean_token_accuracy": 0.7442804053425789, | |
| "num_tokens": 7275515.0, | |
| "step": 196 | |
| }, | |
| { | |
| "entropy": 0.6202637255191803, | |
| "epoch": 1.272506082725061, | |
| "grad_norm": 0.00881174299865961, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6185364723205566, | |
| "mean_token_accuracy": 0.7477486506104469, | |
| "num_tokens": 7313158.0, | |
| "step": 197 | |
| }, | |
| { | |
| "entropy": 0.6143034398555756, | |
| "epoch": 1.2789943227899432, | |
| "grad_norm": 0.010709850117564201, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6169742345809937, | |
| "mean_token_accuracy": 0.7487710192799568, | |
| "num_tokens": 7350030.0, | |
| "step": 198 | |
| }, | |
| { | |
| "entropy": 0.6223605200648308, | |
| "epoch": 1.2854825628548256, | |
| "grad_norm": 0.010480264201760292, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6294817924499512, | |
| "mean_token_accuracy": 0.7423868179321289, | |
| "num_tokens": 7387006.0, | |
| "step": 199 | |
| }, | |
| { | |
| "entropy": 0.6272002533078194, | |
| "epoch": 1.2919708029197081, | |
| "grad_norm": 0.009464031085371971, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6319963932037354, | |
| "mean_token_accuracy": 0.7425662279129028, | |
| "num_tokens": 7424425.0, | |
| "step": 200 | |
| }, | |
| { | |
| "entropy": 0.6301053911447525, | |
| "epoch": 1.2984590429845904, | |
| "grad_norm": 0.009957416914403439, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6337630748748779, | |
| "mean_token_accuracy": 0.7440446689724922, | |
| "num_tokens": 7461695.0, | |
| "step": 201 | |
| }, | |
| { | |
| "entropy": 0.6238225474953651, | |
| "epoch": 1.3049472830494728, | |
| "grad_norm": 0.00954597070813179, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6226916909217834, | |
| "mean_token_accuracy": 0.7449641600251198, | |
| "num_tokens": 7498774.0, | |
| "step": 202 | |
| }, | |
| { | |
| "entropy": 0.630424328148365, | |
| "epoch": 1.3114355231143553, | |
| "grad_norm": 0.0086854612454772, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6267648935317993, | |
| "mean_token_accuracy": 0.745999850332737, | |
| "num_tokens": 7535974.0, | |
| "step": 203 | |
| }, | |
| { | |
| "entropy": 0.6177534386515617, | |
| "epoch": 1.3179237631792375, | |
| "grad_norm": 0.009849452413618565, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6153725385665894, | |
| "mean_token_accuracy": 0.7507055774331093, | |
| "num_tokens": 7572957.0, | |
| "step": 204 | |
| }, | |
| { | |
| "entropy": 0.622411735355854, | |
| "epoch": 1.32441200324412, | |
| "grad_norm": 0.009472545236349106, | |
| "learning_rate": 0.0002, | |
| "loss": 0.625112771987915, | |
| "mean_token_accuracy": 0.7435147687792778, | |
| "num_tokens": 7610380.0, | |
| "step": 205 | |
| }, | |
| { | |
| "entropy": 0.6200075596570969, | |
| "epoch": 1.3309002433090025, | |
| "grad_norm": 0.010570540092885494, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6272220611572266, | |
| "mean_token_accuracy": 0.7441560178995132, | |
| "num_tokens": 7647843.0, | |
| "step": 206 | |
| }, | |
| { | |
| "entropy": 0.6281143799424171, | |
| "epoch": 1.3373884833738847, | |
| "grad_norm": 0.008813613094389439, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6328994631767273, | |
| "mean_token_accuracy": 0.742665521800518, | |
| "num_tokens": 7685138.0, | |
| "step": 207 | |
| }, | |
| { | |
| "entropy": 0.6417431458830833, | |
| "epoch": 1.3438767234387672, | |
| "grad_norm": 0.00971722137182951, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6397589445114136, | |
| "mean_token_accuracy": 0.7406186908483505, | |
| "num_tokens": 7722781.0, | |
| "step": 208 | |
| }, | |
| { | |
| "entropy": 0.6444113031029701, | |
| "epoch": 1.3503649635036497, | |
| "grad_norm": 0.009866150096058846, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6412906646728516, | |
| "mean_token_accuracy": 0.7412897050380707, | |
| "num_tokens": 7760109.0, | |
| "step": 209 | |
| }, | |
| { | |
| "entropy": 0.6214337572455406, | |
| "epoch": 1.3568532035685321, | |
| "grad_norm": 0.009207811206579208, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6234208345413208, | |
| "mean_token_accuracy": 0.7459528893232346, | |
| "num_tokens": 7797532.0, | |
| "step": 210 | |
| }, | |
| { | |
| "entropy": 0.6157770529389381, | |
| "epoch": 1.3633414436334144, | |
| "grad_norm": 0.01025467086583376, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6178190112113953, | |
| "mean_token_accuracy": 0.7505671828985214, | |
| "num_tokens": 7834554.0, | |
| "step": 211 | |
| }, | |
| { | |
| "entropy": 0.619218721985817, | |
| "epoch": 1.3698296836982968, | |
| "grad_norm": 0.01020651962608099, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6230384111404419, | |
| "mean_token_accuracy": 0.7464535236358643, | |
| "num_tokens": 7871899.0, | |
| "step": 212 | |
| }, | |
| { | |
| "entropy": 0.6242957413196564, | |
| "epoch": 1.3763179237631793, | |
| "grad_norm": 0.009102249518036842, | |
| "learning_rate": 0.0002, | |
| "loss": 0.625146210193634, | |
| "mean_token_accuracy": 0.7436935156583786, | |
| "num_tokens": 7908550.0, | |
| "step": 213 | |
| }, | |
| { | |
| "entropy": 0.6318832859396935, | |
| "epoch": 1.3828061638280618, | |
| "grad_norm": 0.008958768099546432, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6291754245758057, | |
| "mean_token_accuracy": 0.7419761046767235, | |
| "num_tokens": 7945528.0, | |
| "step": 214 | |
| }, | |
| { | |
| "entropy": 0.622461624443531, | |
| "epoch": 1.389294403892944, | |
| "grad_norm": 0.010115247219800949, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6236110329627991, | |
| "mean_token_accuracy": 0.7462903261184692, | |
| "num_tokens": 7982511.0, | |
| "step": 215 | |
| }, | |
| { | |
| "entropy": 0.6254477724432945, | |
| "epoch": 1.3957826439578265, | |
| "grad_norm": 0.008989102207124233, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6284307241439819, | |
| "mean_token_accuracy": 0.7429582253098488, | |
| "num_tokens": 8019795.0, | |
| "step": 216 | |
| }, | |
| { | |
| "entropy": 0.6165763810276985, | |
| "epoch": 1.402270884022709, | |
| "grad_norm": 0.010876733809709549, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6224349737167358, | |
| "mean_token_accuracy": 0.7477402463555336, | |
| "num_tokens": 8057519.0, | |
| "step": 217 | |
| }, | |
| { | |
| "entropy": 0.6111054793000221, | |
| "epoch": 1.4087591240875912, | |
| "grad_norm": 0.008845480158925056, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6134991645812988, | |
| "mean_token_accuracy": 0.7499867528676987, | |
| "num_tokens": 8094863.0, | |
| "step": 218 | |
| }, | |
| { | |
| "entropy": 0.6361298933625221, | |
| "epoch": 1.4152473641524737, | |
| "grad_norm": 0.009090340696275234, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6369084715843201, | |
| "mean_token_accuracy": 0.7387163192033768, | |
| "num_tokens": 8132597.0, | |
| "step": 219 | |
| }, | |
| { | |
| "entropy": 0.6406821832060814, | |
| "epoch": 1.4217356042173561, | |
| "grad_norm": 0.0092760706320405, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6413878202438354, | |
| "mean_token_accuracy": 0.7377218827605247, | |
| "num_tokens": 8170263.0, | |
| "step": 220 | |
| }, | |
| { | |
| "entropy": 0.6221970841288567, | |
| "epoch": 1.4282238442822384, | |
| "grad_norm": 0.009138553403317928, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6239045858383179, | |
| "mean_token_accuracy": 0.7459966242313385, | |
| "num_tokens": 8207517.0, | |
| "step": 221 | |
| }, | |
| { | |
| "entropy": 0.6360906660556793, | |
| "epoch": 1.4347120843471208, | |
| "grad_norm": 0.008928137831389904, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6395260095596313, | |
| "mean_token_accuracy": 0.7385511174798012, | |
| "num_tokens": 8244836.0, | |
| "step": 222 | |
| }, | |
| { | |
| "entropy": 0.6243730783462524, | |
| "epoch": 1.4412003244120033, | |
| "grad_norm": 0.009026050567626953, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6269445419311523, | |
| "mean_token_accuracy": 0.7457072138786316, | |
| "num_tokens": 8281919.0, | |
| "step": 223 | |
| }, | |
| { | |
| "entropy": 0.6337901726365089, | |
| "epoch": 1.4476885644768855, | |
| "grad_norm": 0.00801246426999569, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6330679059028625, | |
| "mean_token_accuracy": 0.7426828071475029, | |
| "num_tokens": 8319228.0, | |
| "step": 224 | |
| }, | |
| { | |
| "entropy": 0.631360612809658, | |
| "epoch": 1.454176804541768, | |
| "grad_norm": 0.009467655792832375, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6300734281539917, | |
| "mean_token_accuracy": 0.7453820630908012, | |
| "num_tokens": 8356483.0, | |
| "step": 225 | |
| }, | |
| { | |
| "entropy": 0.6360229924321175, | |
| "epoch": 1.4606650446066505, | |
| "grad_norm": 0.009358935989439487, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6341854929924011, | |
| "mean_token_accuracy": 0.7435640841722488, | |
| "num_tokens": 8393723.0, | |
| "step": 226 | |
| }, | |
| { | |
| "entropy": 0.6200751587748528, | |
| "epoch": 1.4671532846715327, | |
| "grad_norm": 0.008350496180355549, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6218277215957642, | |
| "mean_token_accuracy": 0.7479682192206383, | |
| "num_tokens": 8431281.0, | |
| "step": 227 | |
| }, | |
| { | |
| "entropy": 0.6275244578719139, | |
| "epoch": 1.4736415247364152, | |
| "grad_norm": 0.009802248328924179, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6335194706916809, | |
| "mean_token_accuracy": 0.7433927357196808, | |
| "num_tokens": 8468465.0, | |
| "step": 228 | |
| }, | |
| { | |
| "entropy": 0.6231343746185303, | |
| "epoch": 1.4801297648012977, | |
| "grad_norm": 0.010109310038387775, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6223199367523193, | |
| "mean_token_accuracy": 0.7451789528131485, | |
| "num_tokens": 8505713.0, | |
| "step": 229 | |
| }, | |
| { | |
| "entropy": 0.6206792145967484, | |
| "epoch": 1.4866180048661801, | |
| "grad_norm": 0.010297620669007301, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6225035190582275, | |
| "mean_token_accuracy": 0.7460876628756523, | |
| "num_tokens": 8542783.0, | |
| "step": 230 | |
| }, | |
| { | |
| "entropy": 0.6291577965021133, | |
| "epoch": 1.4931062449310626, | |
| "grad_norm": 0.009544001892209053, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6289199590682983, | |
| "mean_token_accuracy": 0.7454885393381119, | |
| "num_tokens": 8580029.0, | |
| "step": 231 | |
| }, | |
| { | |
| "entropy": 0.6250879839062691, | |
| "epoch": 1.4995944849959448, | |
| "grad_norm": 0.008444451726973057, | |
| "learning_rate": 0.0002, | |
| "loss": 0.628132700920105, | |
| "mean_token_accuracy": 0.7435998693108559, | |
| "num_tokens": 8617067.0, | |
| "step": 232 | |
| }, | |
| { | |
| "entropy": 0.6236734315752983, | |
| "epoch": 1.5060827250608273, | |
| "grad_norm": 0.009344187565147877, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6258345246315002, | |
| "mean_token_accuracy": 0.7458996251225471, | |
| "num_tokens": 8654420.0, | |
| "step": 233 | |
| }, | |
| { | |
| "entropy": 0.6138928905129433, | |
| "epoch": 1.5125709651257098, | |
| "grad_norm": 0.009892390109598637, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6232701539993286, | |
| "mean_token_accuracy": 0.7446143329143524, | |
| "num_tokens": 8691786.0, | |
| "step": 234 | |
| }, | |
| { | |
| "entropy": 0.6233969107270241, | |
| "epoch": 1.519059205190592, | |
| "grad_norm": 0.010160520672798157, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6211707592010498, | |
| "mean_token_accuracy": 0.7472252398729324, | |
| "num_tokens": 8729028.0, | |
| "step": 235 | |
| }, | |
| { | |
| "entropy": 0.6429286673665047, | |
| "epoch": 1.5255474452554745, | |
| "grad_norm": 0.0098539674654603, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6372069120407104, | |
| "mean_token_accuracy": 0.7402112632989883, | |
| "num_tokens": 8766503.0, | |
| "step": 236 | |
| }, | |
| { | |
| "entropy": 0.6305690258741379, | |
| "epoch": 1.532035685320357, | |
| "grad_norm": 0.009324081242084503, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6331846714019775, | |
| "mean_token_accuracy": 0.7420341670513153, | |
| "num_tokens": 8803595.0, | |
| "step": 237 | |
| }, | |
| { | |
| "entropy": 0.6305363178253174, | |
| "epoch": 1.5385239253852392, | |
| "grad_norm": 0.009419843554496765, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6305243968963623, | |
| "mean_token_accuracy": 0.7442135661840439, | |
| "num_tokens": 8840805.0, | |
| "step": 238 | |
| }, | |
| { | |
| "entropy": 0.6271083503961563, | |
| "epoch": 1.5450121654501217, | |
| "grad_norm": 0.008481448516249657, | |
| "learning_rate": 0.0002, | |
| "loss": 0.628629207611084, | |
| "mean_token_accuracy": 0.7426930069923401, | |
| "num_tokens": 8877765.0, | |
| "step": 239 | |
| }, | |
| { | |
| "entropy": 0.6074612811207771, | |
| "epoch": 1.5515004055150041, | |
| "grad_norm": 0.008962183259427547, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6033654808998108, | |
| "mean_token_accuracy": 0.7540537416934967, | |
| "num_tokens": 8915298.0, | |
| "step": 240 | |
| }, | |
| { | |
| "entropy": 0.6332517638802528, | |
| "epoch": 1.5579886455798864, | |
| "grad_norm": 0.009697218425571918, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6378505229949951, | |
| "mean_token_accuracy": 0.7404668927192688, | |
| "num_tokens": 8952480.0, | |
| "step": 241 | |
| }, | |
| { | |
| "entropy": 0.6220754161477089, | |
| "epoch": 1.5644768856447688, | |
| "grad_norm": 0.00962862279266119, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6282638907432556, | |
| "mean_token_accuracy": 0.7437562346458435, | |
| "num_tokens": 8990098.0, | |
| "step": 242 | |
| }, | |
| { | |
| "entropy": 0.6257785856723785, | |
| "epoch": 1.5709651257096513, | |
| "grad_norm": 0.009893639013171196, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6297152042388916, | |
| "mean_token_accuracy": 0.7440835684537888, | |
| "num_tokens": 9026984.0, | |
| "step": 243 | |
| }, | |
| { | |
| "entropy": 0.6254734173417091, | |
| "epoch": 1.5774533657745335, | |
| "grad_norm": 0.009527175687253475, | |
| "learning_rate": 0.0002, | |
| "loss": 0.62839674949646, | |
| "mean_token_accuracy": 0.7452434748411179, | |
| "num_tokens": 9064358.0, | |
| "step": 244 | |
| }, | |
| { | |
| "entropy": 0.6305152326822281, | |
| "epoch": 1.583941605839416, | |
| "grad_norm": 0.009316297248005867, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6323485374450684, | |
| "mean_token_accuracy": 0.74256681650877, | |
| "num_tokens": 9101356.0, | |
| "step": 245 | |
| }, | |
| { | |
| "entropy": 0.6291619464755058, | |
| "epoch": 1.5904298459042985, | |
| "grad_norm": 0.008978272788226604, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6273784637451172, | |
| "mean_token_accuracy": 0.7450171038508415, | |
| "num_tokens": 9138713.0, | |
| "step": 246 | |
| }, | |
| { | |
| "entropy": 0.6248873770236969, | |
| "epoch": 1.5969180859691807, | |
| "grad_norm": 0.00856445450335741, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6265925168991089, | |
| "mean_token_accuracy": 0.7451888769865036, | |
| "num_tokens": 9175681.0, | |
| "step": 247 | |
| }, | |
| { | |
| "entropy": 0.6189131289720535, | |
| "epoch": 1.6034063260340634, | |
| "grad_norm": 0.00968277920037508, | |
| "learning_rate": 0.0002, | |
| "loss": 0.62480229139328, | |
| "mean_token_accuracy": 0.7459377571940422, | |
| "num_tokens": 9213377.0, | |
| "step": 248 | |
| }, | |
| { | |
| "entropy": 0.6176823750138283, | |
| "epoch": 1.6098945660989457, | |
| "grad_norm": 0.008562079630792141, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6216596961021423, | |
| "mean_token_accuracy": 0.7459762021899223, | |
| "num_tokens": 9249919.0, | |
| "step": 249 | |
| }, | |
| { | |
| "entropy": 0.6210065707564354, | |
| "epoch": 1.616382806163828, | |
| "grad_norm": 0.009402911178767681, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6242903470993042, | |
| "mean_token_accuracy": 0.7469801977276802, | |
| "num_tokens": 9287219.0, | |
| "step": 250 | |
| }, | |
| { | |
| "entropy": 0.6323156431317329, | |
| "epoch": 1.6228710462287106, | |
| "grad_norm": 0.009092130698263645, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6306654810905457, | |
| "mean_token_accuracy": 0.7425123229622841, | |
| "num_tokens": 9324174.0, | |
| "step": 251 | |
| }, | |
| { | |
| "entropy": 0.6303895488381386, | |
| "epoch": 1.6293592862935928, | |
| "grad_norm": 0.009144228883087635, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6268880367279053, | |
| "mean_token_accuracy": 0.7460083961486816, | |
| "num_tokens": 9361494.0, | |
| "step": 252 | |
| }, | |
| { | |
| "entropy": 0.6353992223739624, | |
| "epoch": 1.6358475263584753, | |
| "grad_norm": 0.00928189791738987, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6352483034133911, | |
| "mean_token_accuracy": 0.7439208328723907, | |
| "num_tokens": 9398944.0, | |
| "step": 253 | |
| }, | |
| { | |
| "entropy": 0.6256071850657463, | |
| "epoch": 1.6423357664233578, | |
| "grad_norm": 0.008181072771549225, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6292101144790649, | |
| "mean_token_accuracy": 0.743871308863163, | |
| "num_tokens": 9436011.0, | |
| "step": 254 | |
| }, | |
| { | |
| "entropy": 0.6333504095673561, | |
| "epoch": 1.64882400648824, | |
| "grad_norm": 0.009949415922164917, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6347252130508423, | |
| "mean_token_accuracy": 0.7401739284396172, | |
| "num_tokens": 9473110.0, | |
| "step": 255 | |
| }, | |
| { | |
| "entropy": 0.6310138329863548, | |
| "epoch": 1.6553122465531225, | |
| "grad_norm": 0.00846829917281866, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6339915990829468, | |
| "mean_token_accuracy": 0.7427053153514862, | |
| "num_tokens": 9510350.0, | |
| "step": 256 | |
| }, | |
| { | |
| "entropy": 0.6202550306916237, | |
| "epoch": 1.661800486618005, | |
| "grad_norm": 0.009316318668425083, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6241627335548401, | |
| "mean_token_accuracy": 0.7441129460930824, | |
| "num_tokens": 9547581.0, | |
| "step": 257 | |
| }, | |
| { | |
| "entropy": 0.640548974275589, | |
| "epoch": 1.6682887266828872, | |
| "grad_norm": 0.008892681449651718, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6457140445709229, | |
| "mean_token_accuracy": 0.736494742333889, | |
| "num_tokens": 9584913.0, | |
| "step": 258 | |
| }, | |
| { | |
| "entropy": 0.6206653639674187, | |
| "epoch": 1.6747769667477697, | |
| "grad_norm": 0.008709060959517956, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6203189492225647, | |
| "mean_token_accuracy": 0.7498921826481819, | |
| "num_tokens": 9622351.0, | |
| "step": 259 | |
| }, | |
| { | |
| "entropy": 0.6282004490494728, | |
| "epoch": 1.6812652068126521, | |
| "grad_norm": 0.0090560931712389, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6246728897094727, | |
| "mean_token_accuracy": 0.746510811150074, | |
| "num_tokens": 9659652.0, | |
| "step": 260 | |
| }, | |
| { | |
| "entropy": 0.6318396255373955, | |
| "epoch": 1.6877534468775344, | |
| "grad_norm": 0.007608218118548393, | |
| "learning_rate": 0.0002, | |
| "loss": 0.62848961353302, | |
| "mean_token_accuracy": 0.7440729290246964, | |
| "num_tokens": 9697284.0, | |
| "step": 261 | |
| }, | |
| { | |
| "entropy": 0.6200717613101006, | |
| "epoch": 1.6942416869424168, | |
| "grad_norm": 0.009493952617049217, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6228904724121094, | |
| "mean_token_accuracy": 0.7480449378490448, | |
| "num_tokens": 9734627.0, | |
| "step": 262 | |
| }, | |
| { | |
| "entropy": 0.6331067234277725, | |
| "epoch": 1.7007299270072993, | |
| "grad_norm": 0.008472482673823833, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6337133646011353, | |
| "mean_token_accuracy": 0.7426456362009048, | |
| "num_tokens": 9772063.0, | |
| "step": 263 | |
| }, | |
| { | |
| "entropy": 0.6172152981162071, | |
| "epoch": 1.7072181670721815, | |
| "grad_norm": 0.008520574308931828, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6212704181671143, | |
| "mean_token_accuracy": 0.7456109151244164, | |
| "num_tokens": 9809281.0, | |
| "step": 264 | |
| }, | |
| { | |
| "entropy": 0.6255315691232681, | |
| "epoch": 1.7137064071370642, | |
| "grad_norm": 0.008351411670446396, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6286416053771973, | |
| "mean_token_accuracy": 0.7446007430553436, | |
| "num_tokens": 9846539.0, | |
| "step": 265 | |
| }, | |
| { | |
| "entropy": 0.6238176673650742, | |
| "epoch": 1.7201946472019465, | |
| "grad_norm": 0.007990843616425991, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6225998401641846, | |
| "mean_token_accuracy": 0.7458446845412254, | |
| "num_tokens": 9884004.0, | |
| "step": 266 | |
| }, | |
| { | |
| "entropy": 0.6216712817549706, | |
| "epoch": 1.7266828872668287, | |
| "grad_norm": 0.00867629423737526, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6247957944869995, | |
| "mean_token_accuracy": 0.7463371530175209, | |
| "num_tokens": 9921115.0, | |
| "step": 267 | |
| }, | |
| { | |
| "entropy": 0.6401625499129295, | |
| "epoch": 1.7331711273317114, | |
| "grad_norm": 0.00958551187068224, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6359888911247253, | |
| "mean_token_accuracy": 0.742260254919529, | |
| "num_tokens": 9958978.0, | |
| "step": 268 | |
| }, | |
| { | |
| "entropy": 0.6297059804201126, | |
| "epoch": 1.7396593673965937, | |
| "grad_norm": 0.009358945302665234, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6260662078857422, | |
| "mean_token_accuracy": 0.7483563721179962, | |
| "num_tokens": 9996046.0, | |
| "step": 269 | |
| }, | |
| { | |
| "entropy": 0.6102557927370071, | |
| "epoch": 1.7461476074614761, | |
| "grad_norm": 0.008488922379910946, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6104397773742676, | |
| "mean_token_accuracy": 0.7516083940863609, | |
| "num_tokens": 10033145.0, | |
| "step": 270 | |
| }, | |
| { | |
| "entropy": 0.6110394448041916, | |
| "epoch": 1.7526358475263586, | |
| "grad_norm": 0.009671971201896667, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6171742081642151, | |
| "mean_token_accuracy": 0.7473302856087685, | |
| "num_tokens": 10070347.0, | |
| "step": 271 | |
| }, | |
| { | |
| "entropy": 0.6102030426263809, | |
| "epoch": 1.7591240875912408, | |
| "grad_norm": 0.01004206482321024, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6197723746299744, | |
| "mean_token_accuracy": 0.7478247955441475, | |
| "num_tokens": 10107543.0, | |
| "step": 272 | |
| }, | |
| { | |
| "entropy": 0.6324944272637367, | |
| "epoch": 1.7656123276561233, | |
| "grad_norm": 0.008376670069992542, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6334455609321594, | |
| "mean_token_accuracy": 0.7418324947357178, | |
| "num_tokens": 10144562.0, | |
| "step": 273 | |
| }, | |
| { | |
| "entropy": 0.6232613623142242, | |
| "epoch": 1.7721005677210058, | |
| "grad_norm": 0.009440955705940723, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6198002099990845, | |
| "mean_token_accuracy": 0.750127449631691, | |
| "num_tokens": 10181837.0, | |
| "step": 274 | |
| }, | |
| { | |
| "entropy": 0.6218618527054787, | |
| "epoch": 1.778588807785888, | |
| "grad_norm": 0.008727550506591797, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6228897571563721, | |
| "mean_token_accuracy": 0.7451170310378075, | |
| "num_tokens": 10218887.0, | |
| "step": 275 | |
| }, | |
| { | |
| "entropy": 0.6297050788998604, | |
| "epoch": 1.7850770478507705, | |
| "grad_norm": 0.008303189650177956, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6325977444648743, | |
| "mean_token_accuracy": 0.7429015561938286, | |
| "num_tokens": 10256316.0, | |
| "step": 276 | |
| }, | |
| { | |
| "entropy": 0.6150370612740517, | |
| "epoch": 1.791565287915653, | |
| "grad_norm": 0.009460131637752056, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6189665198326111, | |
| "mean_token_accuracy": 0.7513208463788033, | |
| "num_tokens": 10292958.0, | |
| "step": 277 | |
| }, | |
| { | |
| "entropy": 0.6380631476640701, | |
| "epoch": 1.7980535279805352, | |
| "grad_norm": 0.008382478728890419, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6411799192428589, | |
| "mean_token_accuracy": 0.7389534488320351, | |
| "num_tokens": 10330143.0, | |
| "step": 278 | |
| }, | |
| { | |
| "entropy": 0.6122751757502556, | |
| "epoch": 1.8045417680454177, | |
| "grad_norm": 0.0077201686799526215, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6154634356498718, | |
| "mean_token_accuracy": 0.7478373274207115, | |
| "num_tokens": 10367348.0, | |
| "step": 279 | |
| }, | |
| { | |
| "entropy": 0.6171681880950928, | |
| "epoch": 1.8110300081103001, | |
| "grad_norm": 0.014772728085517883, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6175127625465393, | |
| "mean_token_accuracy": 0.7471248880028725, | |
| "num_tokens": 10404586.0, | |
| "step": 280 | |
| }, | |
| { | |
| "entropy": 0.6203941032290459, | |
| "epoch": 1.8175182481751824, | |
| "grad_norm": 0.00933381449431181, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6234451532363892, | |
| "mean_token_accuracy": 0.7449408918619156, | |
| "num_tokens": 10441660.0, | |
| "step": 281 | |
| }, | |
| { | |
| "entropy": 0.6171698048710823, | |
| "epoch": 1.8240064882400648, | |
| "grad_norm": 0.02071473002433777, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6131167411804199, | |
| "mean_token_accuracy": 0.7504094913601875, | |
| "num_tokens": 10478740.0, | |
| "step": 282 | |
| }, | |
| { | |
| "entropy": 0.6204886436462402, | |
| "epoch": 1.8304947283049473, | |
| "grad_norm": 0.008232798427343369, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6195346117019653, | |
| "mean_token_accuracy": 0.7477771490812302, | |
| "num_tokens": 10515739.0, | |
| "step": 283 | |
| }, | |
| { | |
| "entropy": 0.6222864389419556, | |
| "epoch": 1.8369829683698295, | |
| "grad_norm": 0.008826926350593567, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6246115565299988, | |
| "mean_token_accuracy": 0.7467887252569199, | |
| "num_tokens": 10552926.0, | |
| "step": 284 | |
| }, | |
| { | |
| "entropy": 0.6199471354484558, | |
| "epoch": 1.8434712084347122, | |
| "grad_norm": 0.031130356714129448, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6234173774719238, | |
| "mean_token_accuracy": 0.7465962916612625, | |
| "num_tokens": 10590404.0, | |
| "step": 285 | |
| }, | |
| { | |
| "entropy": 0.6229867041110992, | |
| "epoch": 1.8499594484995945, | |
| "grad_norm": 0.009124074131250381, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6230523586273193, | |
| "mean_token_accuracy": 0.7485576421022415, | |
| "num_tokens": 10628169.0, | |
| "step": 286 | |
| }, | |
| { | |
| "entropy": 0.6245164126157761, | |
| "epoch": 1.8564476885644767, | |
| "grad_norm": 0.04299340024590492, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6296451091766357, | |
| "mean_token_accuracy": 0.746208980679512, | |
| "num_tokens": 10665578.0, | |
| "step": 287 | |
| }, | |
| { | |
| "entropy": 0.6367667019367218, | |
| "epoch": 1.8629359286293594, | |
| "grad_norm": 0.008064360357820988, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6342769861221313, | |
| "mean_token_accuracy": 0.7435217127203941, | |
| "num_tokens": 10703123.0, | |
| "step": 288 | |
| }, | |
| { | |
| "entropy": 0.6245287135243416, | |
| "epoch": 1.8694241686942417, | |
| "grad_norm": 0.021351464092731476, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6260511875152588, | |
| "mean_token_accuracy": 0.7465523779392242, | |
| "num_tokens": 10740314.0, | |
| "step": 289 | |
| }, | |
| { | |
| "entropy": 0.6212104111909866, | |
| "epoch": 1.8759124087591241, | |
| "grad_norm": 0.01059524156153202, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6210169792175293, | |
| "mean_token_accuracy": 0.7475718706846237, | |
| "num_tokens": 10777825.0, | |
| "step": 290 | |
| }, | |
| { | |
| "entropy": 0.6373793482780457, | |
| "epoch": 1.8824006488240066, | |
| "grad_norm": 0.008884789422154427, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6366032361984253, | |
| "mean_token_accuracy": 0.7391576170921326, | |
| "num_tokens": 10815225.0, | |
| "step": 291 | |
| }, | |
| { | |
| "entropy": 0.6392252072691917, | |
| "epoch": 1.8888888888888888, | |
| "grad_norm": 0.013435903936624527, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6392862796783447, | |
| "mean_token_accuracy": 0.7395146489143372, | |
| "num_tokens": 10852456.0, | |
| "step": 292 | |
| }, | |
| { | |
| "entropy": 0.6242144107818604, | |
| "epoch": 1.8953771289537713, | |
| "grad_norm": 0.009207301773130894, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6249897480010986, | |
| "mean_token_accuracy": 0.7450198903679848, | |
| "num_tokens": 10889534.0, | |
| "step": 293 | |
| }, | |
| { | |
| "entropy": 0.6158905401825905, | |
| "epoch": 1.9018653690186538, | |
| "grad_norm": 0.009233659133315086, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6220048069953918, | |
| "mean_token_accuracy": 0.7474906519055367, | |
| "num_tokens": 10927138.0, | |
| "step": 294 | |
| }, | |
| { | |
| "entropy": 0.6057498604059219, | |
| "epoch": 1.908353609083536, | |
| "grad_norm": 0.00886959582567215, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6085807085037231, | |
| "mean_token_accuracy": 0.7527724504470825, | |
| "num_tokens": 10964121.0, | |
| "step": 295 | |
| }, | |
| { | |
| "entropy": 0.6314896494150162, | |
| "epoch": 1.9148418491484185, | |
| "grad_norm": 0.00863397866487503, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6325403451919556, | |
| "mean_token_accuracy": 0.7428522482514381, | |
| "num_tokens": 11001557.0, | |
| "step": 296 | |
| }, | |
| { | |
| "entropy": 0.6221454739570618, | |
| "epoch": 1.921330089213301, | |
| "grad_norm": 0.009161150082945824, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6208068132400513, | |
| "mean_token_accuracy": 0.7462965175509453, | |
| "num_tokens": 11038904.0, | |
| "step": 297 | |
| }, | |
| { | |
| "entropy": 0.6189481094479561, | |
| "epoch": 1.9278183292781832, | |
| "grad_norm": 0.008889259770512581, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6184496283531189, | |
| "mean_token_accuracy": 0.7480250671505928, | |
| "num_tokens": 11076150.0, | |
| "step": 298 | |
| }, | |
| { | |
| "entropy": 0.6238919943571091, | |
| "epoch": 1.9343065693430657, | |
| "grad_norm": 0.0090845488011837, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6274781227111816, | |
| "mean_token_accuracy": 0.744391493499279, | |
| "num_tokens": 11113447.0, | |
| "step": 299 | |
| }, | |
| { | |
| "entropy": 0.6231639310717583, | |
| "epoch": 1.9407948094079481, | |
| "grad_norm": 0.009156333282589912, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6222721934318542, | |
| "mean_token_accuracy": 0.7496197745203972, | |
| "num_tokens": 11150750.0, | |
| "step": 300 | |
| }, | |
| { | |
| "entropy": 0.6238841712474823, | |
| "epoch": 1.9472830494728304, | |
| "grad_norm": 0.008916804566979408, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6307159066200256, | |
| "mean_token_accuracy": 0.7432639226317406, | |
| "num_tokens": 11187972.0, | |
| "step": 301 | |
| }, | |
| { | |
| "entropy": 0.628197155892849, | |
| "epoch": 1.9537712895377128, | |
| "grad_norm": 0.009915877133607864, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6339118480682373, | |
| "mean_token_accuracy": 0.741386704146862, | |
| "num_tokens": 11225108.0, | |
| "step": 302 | |
| }, | |
| { | |
| "entropy": 0.6199254244565964, | |
| "epoch": 1.9602595296025953, | |
| "grad_norm": 0.008810635656118393, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6184746026992798, | |
| "mean_token_accuracy": 0.7482490092515945, | |
| "num_tokens": 11262735.0, | |
| "step": 303 | |
| }, | |
| { | |
| "entropy": 0.6206595823168755, | |
| "epoch": 1.9667477696674776, | |
| "grad_norm": 0.008489571511745453, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6251119375228882, | |
| "mean_token_accuracy": 0.7444824799895287, | |
| "num_tokens": 11299837.0, | |
| "step": 304 | |
| }, | |
| { | |
| "entropy": 0.6231965124607086, | |
| "epoch": 1.9732360097323602, | |
| "grad_norm": 0.008548264391720295, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6258702874183655, | |
| "mean_token_accuracy": 0.7451799884438515, | |
| "num_tokens": 11337335.0, | |
| "step": 305 | |
| }, | |
| { | |
| "entropy": 0.6233715191483498, | |
| "epoch": 1.9797242497972425, | |
| "grad_norm": 0.008984974585473537, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6242036819458008, | |
| "mean_token_accuracy": 0.7449030429124832, | |
| "num_tokens": 11375037.0, | |
| "step": 306 | |
| }, | |
| { | |
| "entropy": 0.6145095080137253, | |
| "epoch": 1.986212489862125, | |
| "grad_norm": 0.008570129983127117, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6161348819732666, | |
| "mean_token_accuracy": 0.7494730427861214, | |
| "num_tokens": 11412372.0, | |
| "step": 307 | |
| }, | |
| { | |
| "entropy": 0.6227882578969002, | |
| "epoch": 1.9927007299270074, | |
| "grad_norm": 0.009132519364356995, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6249089241027832, | |
| "mean_token_accuracy": 0.7440183088183403, | |
| "num_tokens": 11449566.0, | |
| "step": 308 | |
| }, | |
| { | |
| "entropy": 0.6210556477308273, | |
| "epoch": 1.9991889699918897, | |
| "grad_norm": 0.007969100028276443, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6244759559631348, | |
| "mean_token_accuracy": 0.746830090880394, | |
| "num_tokens": 11487152.0, | |
| "step": 309 | |
| }, | |
| { | |
| "entropy": 0.6104058027267456, | |
| "epoch": 2.0, | |
| "grad_norm": 0.019919538870453835, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6209793090820312, | |
| "mean_token_accuracy": 0.7482735514640808, | |
| "num_tokens": 11491673.0, | |
| "step": 310 | |
| }, | |
| { | |
| "entropy": 0.6369761228561401, | |
| "epoch": 2.0064882400648822, | |
| "grad_norm": 0.011179310269653797, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6280978918075562, | |
| "mean_token_accuracy": 0.7433952018618584, | |
| "num_tokens": 11528991.0, | |
| "step": 311 | |
| }, | |
| { | |
| "entropy": 0.6231134757399559, | |
| "epoch": 2.012976480129765, | |
| "grad_norm": 0.012395660392940044, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6168753504753113, | |
| "mean_token_accuracy": 0.7469241917133331, | |
| "num_tokens": 11566174.0, | |
| "step": 312 | |
| }, | |
| { | |
| "entropy": 0.6361245587468147, | |
| "epoch": 2.019464720194647, | |
| "grad_norm": 0.010151471942663193, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6396852731704712, | |
| "mean_token_accuracy": 0.7390208393335342, | |
| "num_tokens": 11603660.0, | |
| "step": 313 | |
| }, | |
| { | |
| "entropy": 0.6205078735947609, | |
| "epoch": 2.0259529602595294, | |
| "grad_norm": 0.011173305101692677, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6290929317474365, | |
| "mean_token_accuracy": 0.7439283728599548, | |
| "num_tokens": 11640777.0, | |
| "step": 314 | |
| }, | |
| { | |
| "entropy": 0.6196452155709267, | |
| "epoch": 2.032441200324412, | |
| "grad_norm": 0.011216065846383572, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6270949840545654, | |
| "mean_token_accuracy": 0.7424712553620338, | |
| "num_tokens": 11677826.0, | |
| "step": 315 | |
| }, | |
| { | |
| "entropy": 0.6094615831971169, | |
| "epoch": 2.0389294403892944, | |
| "grad_norm": 0.009836558252573013, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6110177040100098, | |
| "mean_token_accuracy": 0.7522123828530312, | |
| "num_tokens": 11714782.0, | |
| "step": 316 | |
| }, | |
| { | |
| "entropy": 0.6228377372026443, | |
| "epoch": 2.0454176804541766, | |
| "grad_norm": 0.009827308356761932, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6198099851608276, | |
| "mean_token_accuracy": 0.7482241690158844, | |
| "num_tokens": 11751901.0, | |
| "step": 317 | |
| }, | |
| { | |
| "entropy": 0.6236361563205719, | |
| "epoch": 2.0519059205190593, | |
| "grad_norm": 0.010331663303077221, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6171518564224243, | |
| "mean_token_accuracy": 0.747296430170536, | |
| "num_tokens": 11789727.0, | |
| "step": 318 | |
| }, | |
| { | |
| "entropy": 0.6258771196007729, | |
| "epoch": 2.0583941605839415, | |
| "grad_norm": 0.010642528533935547, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6271529197692871, | |
| "mean_token_accuracy": 0.7447842955589294, | |
| "num_tokens": 11826898.0, | |
| "step": 319 | |
| }, | |
| { | |
| "entropy": 0.6150587797164917, | |
| "epoch": 2.0648824006488242, | |
| "grad_norm": 0.009091152809560299, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6166321039199829, | |
| "mean_token_accuracy": 0.7505485117435455, | |
| "num_tokens": 11863842.0, | |
| "step": 320 | |
| }, | |
| { | |
| "entropy": 0.6226691231131554, | |
| "epoch": 2.0713706407137065, | |
| "grad_norm": 0.008850189857184887, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6213895082473755, | |
| "mean_token_accuracy": 0.7468440607190132, | |
| "num_tokens": 11901235.0, | |
| "step": 321 | |
| }, | |
| { | |
| "entropy": 0.634496659040451, | |
| "epoch": 2.0778588807785887, | |
| "grad_norm": 0.009685751050710678, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6369626522064209, | |
| "mean_token_accuracy": 0.7408950179815292, | |
| "num_tokens": 11938336.0, | |
| "step": 322 | |
| }, | |
| { | |
| "entropy": 0.6164573132991791, | |
| "epoch": 2.0843471208434714, | |
| "grad_norm": 0.010890510864555836, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6235396265983582, | |
| "mean_token_accuracy": 0.7454954236745834, | |
| "num_tokens": 11975368.0, | |
| "step": 323 | |
| }, | |
| { | |
| "entropy": 0.6137611418962479, | |
| "epoch": 2.0908353609083536, | |
| "grad_norm": 0.009321420453488827, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6175767183303833, | |
| "mean_token_accuracy": 0.7478668764233589, | |
| "num_tokens": 12012459.0, | |
| "step": 324 | |
| }, | |
| { | |
| "entropy": 0.6179320439696312, | |
| "epoch": 2.097323600973236, | |
| "grad_norm": 0.009330744855105877, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6184362173080444, | |
| "mean_token_accuracy": 0.748590737581253, | |
| "num_tokens": 12049829.0, | |
| "step": 325 | |
| }, | |
| { | |
| "entropy": 0.6192868947982788, | |
| "epoch": 2.1038118410381186, | |
| "grad_norm": 0.008818828500807285, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6174098253250122, | |
| "mean_token_accuracy": 0.7478644922375679, | |
| "num_tokens": 12087727.0, | |
| "step": 326 | |
| }, | |
| { | |
| "entropy": 0.626248262822628, | |
| "epoch": 2.110300081103001, | |
| "grad_norm": 0.008749144151806831, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6212329268455505, | |
| "mean_token_accuracy": 0.747315414249897, | |
| "num_tokens": 12124835.0, | |
| "step": 327 | |
| }, | |
| { | |
| "entropy": 0.625133216381073, | |
| "epoch": 2.116788321167883, | |
| "grad_norm": 0.009766868315637112, | |
| "learning_rate": 0.0002, | |
| "loss": 0.624916136264801, | |
| "mean_token_accuracy": 0.7457389757037163, | |
| "num_tokens": 12162010.0, | |
| "step": 328 | |
| }, | |
| { | |
| "entropy": 0.6180580258369446, | |
| "epoch": 2.1232765612327658, | |
| "grad_norm": 0.010169712826609612, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6185243129730225, | |
| "mean_token_accuracy": 0.7475102469325066, | |
| "num_tokens": 12199560.0, | |
| "step": 329 | |
| }, | |
| { | |
| "entropy": 0.618090882897377, | |
| "epoch": 2.129764801297648, | |
| "grad_norm": 0.010965410619974136, | |
| "learning_rate": 0.0002, | |
| "loss": 0.628595232963562, | |
| "mean_token_accuracy": 0.742675431072712, | |
| "num_tokens": 12236987.0, | |
| "step": 330 | |
| }, | |
| { | |
| "entropy": 0.6243258565664291, | |
| "epoch": 2.1362530413625302, | |
| "grad_norm": 0.009334998205304146, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6280615329742432, | |
| "mean_token_accuracy": 0.7434326112270355, | |
| "num_tokens": 12274464.0, | |
| "step": 331 | |
| }, | |
| { | |
| "entropy": 0.6221758723258972, | |
| "epoch": 2.142741281427413, | |
| "grad_norm": 0.00768797192722559, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6218302845954895, | |
| "mean_token_accuracy": 0.7480092272162437, | |
| "num_tokens": 12312027.0, | |
| "step": 332 | |
| }, | |
| { | |
| "entropy": 0.6239754110574722, | |
| "epoch": 2.149229521492295, | |
| "grad_norm": 0.007848316803574562, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6233847141265869, | |
| "mean_token_accuracy": 0.7466081529855728, | |
| "num_tokens": 12349207.0, | |
| "step": 333 | |
| }, | |
| { | |
| "entropy": 0.6159957125782967, | |
| "epoch": 2.1557177615571774, | |
| "grad_norm": 0.009600339457392693, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6117550134658813, | |
| "mean_token_accuracy": 0.7508383393287659, | |
| "num_tokens": 12386312.0, | |
| "step": 334 | |
| }, | |
| { | |
| "entropy": 0.6285756379365921, | |
| "epoch": 2.16220600162206, | |
| "grad_norm": 0.009564606472849846, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6304960250854492, | |
| "mean_token_accuracy": 0.7436012774705887, | |
| "num_tokens": 12423969.0, | |
| "step": 335 | |
| }, | |
| { | |
| "entropy": 0.6194324493408203, | |
| "epoch": 2.1686942416869424, | |
| "grad_norm": 0.009417028166353703, | |
| "learning_rate": 0.0002, | |
| "loss": 0.622604250907898, | |
| "mean_token_accuracy": 0.7460262328386307, | |
| "num_tokens": 12461498.0, | |
| "step": 336 | |
| }, | |
| { | |
| "entropy": 0.6123020723462105, | |
| "epoch": 2.1751824817518246, | |
| "grad_norm": 0.00952741876244545, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6190693378448486, | |
| "mean_token_accuracy": 0.7473057582974434, | |
| "num_tokens": 12498772.0, | |
| "step": 337 | |
| }, | |
| { | |
| "entropy": 0.6101055964827538, | |
| "epoch": 2.1816707218167073, | |
| "grad_norm": 0.00931888073682785, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6161482334136963, | |
| "mean_token_accuracy": 0.7476179748773575, | |
| "num_tokens": 12535894.0, | |
| "step": 338 | |
| }, | |
| { | |
| "entropy": 0.6213592365384102, | |
| "epoch": 2.1881589618815895, | |
| "grad_norm": 0.008865389041602612, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6219321489334106, | |
| "mean_token_accuracy": 0.7449849396944046, | |
| "num_tokens": 12573498.0, | |
| "step": 339 | |
| }, | |
| { | |
| "entropy": 0.614892452955246, | |
| "epoch": 2.1946472019464722, | |
| "grad_norm": 0.009812900796532631, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6124197840690613, | |
| "mean_token_accuracy": 0.7499328628182411, | |
| "num_tokens": 12610465.0, | |
| "step": 340 | |
| }, | |
| { | |
| "entropy": 0.6235473528504372, | |
| "epoch": 2.2011354420113545, | |
| "grad_norm": 0.009034697897732258, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6235278248786926, | |
| "mean_token_accuracy": 0.7453176379203796, | |
| "num_tokens": 12647446.0, | |
| "step": 341 | |
| }, | |
| { | |
| "entropy": 0.6155827194452286, | |
| "epoch": 2.2076236820762367, | |
| "grad_norm": 0.011849821545183659, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6141517758369446, | |
| "mean_token_accuracy": 0.7493102103471756, | |
| "num_tokens": 12684339.0, | |
| "step": 342 | |
| }, | |
| { | |
| "entropy": 0.6220799088478088, | |
| "epoch": 2.2141119221411194, | |
| "grad_norm": 0.011021377518773079, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6232143640518188, | |
| "mean_token_accuracy": 0.7435769438743591, | |
| "num_tokens": 12722039.0, | |
| "step": 343 | |
| }, | |
| { | |
| "entropy": 0.60894425958395, | |
| "epoch": 2.2206001622060016, | |
| "grad_norm": 0.00959057454019785, | |
| "learning_rate": 0.0002, | |
| "loss": 0.614958643913269, | |
| "mean_token_accuracy": 0.7492904141545296, | |
| "num_tokens": 12758559.0, | |
| "step": 344 | |
| }, | |
| { | |
| "entropy": 0.61026880890131, | |
| "epoch": 2.227088402270884, | |
| "grad_norm": 0.010138140991330147, | |
| "learning_rate": 0.0002, | |
| "loss": 0.616437554359436, | |
| "mean_token_accuracy": 0.7471959367394447, | |
| "num_tokens": 12795759.0, | |
| "step": 345 | |
| }, | |
| { | |
| "entropy": 0.6212582364678383, | |
| "epoch": 2.2335766423357666, | |
| "grad_norm": 0.013862723484635353, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6215099692344666, | |
| "mean_token_accuracy": 0.7478090971708298, | |
| "num_tokens": 12833075.0, | |
| "step": 346 | |
| }, | |
| { | |
| "entropy": 0.6183774024248123, | |
| "epoch": 2.240064882400649, | |
| "grad_norm": 0.00895402580499649, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6187215447425842, | |
| "mean_token_accuracy": 0.7494830936193466, | |
| "num_tokens": 12870571.0, | |
| "step": 347 | |
| }, | |
| { | |
| "entropy": 0.6210155412554741, | |
| "epoch": 2.246553122465531, | |
| "grad_norm": 0.041780415922403336, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6219582557678223, | |
| "mean_token_accuracy": 0.7483534067869186, | |
| "num_tokens": 12908163.0, | |
| "step": 348 | |
| }, | |
| { | |
| "entropy": 0.6203203722834587, | |
| "epoch": 2.2530413625304138, | |
| "grad_norm": 0.02689778059720993, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6272082328796387, | |
| "mean_token_accuracy": 0.7450312674045563, | |
| "num_tokens": 12945330.0, | |
| "step": 349 | |
| }, | |
| { | |
| "entropy": 0.6245186030864716, | |
| "epoch": 2.259529602595296, | |
| "grad_norm": 0.012432226911187172, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6235542297363281, | |
| "mean_token_accuracy": 0.7462796568870544, | |
| "num_tokens": 12982731.0, | |
| "step": 350 | |
| }, | |
| { | |
| "entropy": 0.6220052242279053, | |
| "epoch": 2.2660178426601782, | |
| "grad_norm": 0.010308763943612576, | |
| "learning_rate": 0.0002, | |
| "loss": 0.624070405960083, | |
| "mean_token_accuracy": 0.743579313158989, | |
| "num_tokens": 13019541.0, | |
| "step": 351 | |
| }, | |
| { | |
| "entropy": 0.64016043394804, | |
| "epoch": 2.272506082725061, | |
| "grad_norm": 0.010659064166247845, | |
| "learning_rate": 0.0002, | |
| "loss": 0.636542558670044, | |
| "mean_token_accuracy": 0.7407100200653076, | |
| "num_tokens": 13057158.0, | |
| "step": 352 | |
| }, | |
| { | |
| "entropy": 0.6278761327266693, | |
| "epoch": 2.278994322789943, | |
| "grad_norm": 0.010416081175208092, | |
| "learning_rate": 0.0002, | |
| "loss": 0.62436842918396, | |
| "mean_token_accuracy": 0.7455000206828117, | |
| "num_tokens": 13094262.0, | |
| "step": 353 | |
| }, | |
| { | |
| "entropy": 0.6232447475194931, | |
| "epoch": 2.285482562854826, | |
| "grad_norm": 0.009887438267469406, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6241923570632935, | |
| "mean_token_accuracy": 0.7437829151749611, | |
| "num_tokens": 13131360.0, | |
| "step": 354 | |
| }, | |
| { | |
| "entropy": 0.6319752037525177, | |
| "epoch": 2.291970802919708, | |
| "grad_norm": 0.009396783076226711, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6283852458000183, | |
| "mean_token_accuracy": 0.7450494468212128, | |
| "num_tokens": 13168644.0, | |
| "step": 355 | |
| }, | |
| { | |
| "entropy": 0.6192774921655655, | |
| "epoch": 2.2984590429845904, | |
| "grad_norm": 0.009457712061703205, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6166653633117676, | |
| "mean_token_accuracy": 0.7473447695374489, | |
| "num_tokens": 13205900.0, | |
| "step": 356 | |
| }, | |
| { | |
| "entropy": 0.616138719022274, | |
| "epoch": 2.304947283049473, | |
| "grad_norm": 0.009487454779446125, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6193556189537048, | |
| "mean_token_accuracy": 0.746711365878582, | |
| "num_tokens": 13243403.0, | |
| "step": 357 | |
| }, | |
| { | |
| "entropy": 0.6114000976085663, | |
| "epoch": 2.3114355231143553, | |
| "grad_norm": 0.010738314129412174, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6193853616714478, | |
| "mean_token_accuracy": 0.7472727373242378, | |
| "num_tokens": 13280595.0, | |
| "step": 358 | |
| }, | |
| { | |
| "entropy": 0.601548932492733, | |
| "epoch": 2.3179237631792375, | |
| "grad_norm": 0.010257442481815815, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6057910919189453, | |
| "mean_token_accuracy": 0.7506168782711029, | |
| "num_tokens": 13317413.0, | |
| "step": 359 | |
| }, | |
| { | |
| "entropy": 0.6248240396380424, | |
| "epoch": 2.3244120032441202, | |
| "grad_norm": 0.009444781579077244, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6265978217124939, | |
| "mean_token_accuracy": 0.7447159513831139, | |
| "num_tokens": 13354442.0, | |
| "step": 360 | |
| }, | |
| { | |
| "entropy": 0.6169225797057152, | |
| "epoch": 2.3309002433090025, | |
| "grad_norm": 0.010277079418301582, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6173827648162842, | |
| "mean_token_accuracy": 0.7486959248781204, | |
| "num_tokens": 13392357.0, | |
| "step": 361 | |
| }, | |
| { | |
| "entropy": 0.6302815526723862, | |
| "epoch": 2.3373884833738847, | |
| "grad_norm": 0.009320929646492004, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6289012432098389, | |
| "mean_token_accuracy": 0.7438602596521378, | |
| "num_tokens": 13429444.0, | |
| "step": 362 | |
| }, | |
| { | |
| "entropy": 0.6252695918083191, | |
| "epoch": 2.3438767234387674, | |
| "grad_norm": 0.00795667339116335, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6236270666122437, | |
| "mean_token_accuracy": 0.7462895065546036, | |
| "num_tokens": 13466973.0, | |
| "step": 363 | |
| }, | |
| { | |
| "entropy": 0.6325998455286026, | |
| "epoch": 2.3503649635036497, | |
| "grad_norm": 0.009790928103029728, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6316322088241577, | |
| "mean_token_accuracy": 0.7428558766841888, | |
| "num_tokens": 13504219.0, | |
| "step": 364 | |
| }, | |
| { | |
| "entropy": 0.6235339045524597, | |
| "epoch": 2.356853203568532, | |
| "grad_norm": 0.009260588325560093, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6231226921081543, | |
| "mean_token_accuracy": 0.7452265918254852, | |
| "num_tokens": 13541359.0, | |
| "step": 365 | |
| }, | |
| { | |
| "entropy": 0.6141555160284042, | |
| "epoch": 2.3633414436334146, | |
| "grad_norm": 0.010724055580794811, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6217249631881714, | |
| "mean_token_accuracy": 0.7470070049166679, | |
| "num_tokens": 13578759.0, | |
| "step": 366 | |
| }, | |
| { | |
| "entropy": 0.6315039545297623, | |
| "epoch": 2.369829683698297, | |
| "grad_norm": 0.009067324921488762, | |
| "learning_rate": 0.0002, | |
| "loss": 0.634614109992981, | |
| "mean_token_accuracy": 0.7410515621304512, | |
| "num_tokens": 13616296.0, | |
| "step": 367 | |
| }, | |
| { | |
| "entropy": 0.6196957975625992, | |
| "epoch": 2.376317923763179, | |
| "grad_norm": 0.009248278103768826, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6189215183258057, | |
| "mean_token_accuracy": 0.7481505498290062, | |
| "num_tokens": 13653415.0, | |
| "step": 368 | |
| }, | |
| { | |
| "entropy": 0.6168980821967125, | |
| "epoch": 2.3828061638280618, | |
| "grad_norm": 0.010181935504078865, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6161677837371826, | |
| "mean_token_accuracy": 0.7499739304184914, | |
| "num_tokens": 13690618.0, | |
| "step": 369 | |
| }, | |
| { | |
| "entropy": 0.6258252412080765, | |
| "epoch": 2.389294403892944, | |
| "grad_norm": 0.008928108029067516, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6290237903594971, | |
| "mean_token_accuracy": 0.7429782524704933, | |
| "num_tokens": 13727901.0, | |
| "step": 370 | |
| }, | |
| { | |
| "entropy": 0.6094075217843056, | |
| "epoch": 2.3957826439578263, | |
| "grad_norm": 0.009067908860743046, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6124044060707092, | |
| "mean_token_accuracy": 0.7487504705786705, | |
| "num_tokens": 13765097.0, | |
| "step": 371 | |
| }, | |
| { | |
| "entropy": 0.6190275996923447, | |
| "epoch": 2.402270884022709, | |
| "grad_norm": 0.009943855926394463, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6234393119812012, | |
| "mean_token_accuracy": 0.7450670152902603, | |
| "num_tokens": 13802604.0, | |
| "step": 372 | |
| }, | |
| { | |
| "entropy": 0.6125053241848946, | |
| "epoch": 2.408759124087591, | |
| "grad_norm": 0.009481463581323624, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6187013387680054, | |
| "mean_token_accuracy": 0.7489439323544502, | |
| "num_tokens": 13839487.0, | |
| "step": 373 | |
| }, | |
| { | |
| "entropy": 0.6130451932549477, | |
| "epoch": 2.4152473641524734, | |
| "grad_norm": 0.008458724245429039, | |
| "learning_rate": 0.0002, | |
| "loss": 0.614911675453186, | |
| "mean_token_accuracy": 0.7505282834172249, | |
| "num_tokens": 13876935.0, | |
| "step": 374 | |
| }, | |
| { | |
| "entropy": 0.6462682038545609, | |
| "epoch": 2.421735604217356, | |
| "grad_norm": 0.010083320550620556, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6467190980911255, | |
| "mean_token_accuracy": 0.7378857955336571, | |
| "num_tokens": 13914429.0, | |
| "step": 375 | |
| }, | |
| { | |
| "entropy": 0.6287035867571831, | |
| "epoch": 2.4282238442822384, | |
| "grad_norm": 0.008747600950300694, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6284276247024536, | |
| "mean_token_accuracy": 0.7447932213544846, | |
| "num_tokens": 13951880.0, | |
| "step": 376 | |
| }, | |
| { | |
| "entropy": 0.6305522173643112, | |
| "epoch": 2.4347120843471206, | |
| "grad_norm": 0.010268261656165123, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6298754215240479, | |
| "mean_token_accuracy": 0.7451391518115997, | |
| "num_tokens": 13989473.0, | |
| "step": 377 | |
| }, | |
| { | |
| "entropy": 0.6239131912589073, | |
| "epoch": 2.4412003244120033, | |
| "grad_norm": 0.00940751750022173, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6264931559562683, | |
| "mean_token_accuracy": 0.7422467172145844, | |
| "num_tokens": 14026832.0, | |
| "step": 378 | |
| }, | |
| { | |
| "entropy": 0.6218756884336472, | |
| "epoch": 2.4476885644768855, | |
| "grad_norm": 0.008956913836300373, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6260896325111389, | |
| "mean_token_accuracy": 0.7415326088666916, | |
| "num_tokens": 14064159.0, | |
| "step": 379 | |
| }, | |
| { | |
| "entropy": 0.6187591478228569, | |
| "epoch": 2.4541768045417682, | |
| "grad_norm": 0.008552344515919685, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6216272115707397, | |
| "mean_token_accuracy": 0.7469553202390671, | |
| "num_tokens": 14101277.0, | |
| "step": 380 | |
| }, | |
| { | |
| "entropy": 0.6129069477319717, | |
| "epoch": 2.4606650446066505, | |
| "grad_norm": 0.009866154752671719, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6184383630752563, | |
| "mean_token_accuracy": 0.7457786872982979, | |
| "num_tokens": 14138545.0, | |
| "step": 381 | |
| }, | |
| { | |
| "entropy": 0.6332196220755577, | |
| "epoch": 2.4671532846715327, | |
| "grad_norm": 0.007945130579173565, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6312772631645203, | |
| "mean_token_accuracy": 0.7440632656216621, | |
| "num_tokens": 14176229.0, | |
| "step": 382 | |
| }, | |
| { | |
| "entropy": 0.6162554249167442, | |
| "epoch": 2.4736415247364154, | |
| "grad_norm": 0.00908781960606575, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6104109883308411, | |
| "mean_token_accuracy": 0.7492068335413933, | |
| "num_tokens": 14213375.0, | |
| "step": 383 | |
| }, | |
| { | |
| "entropy": 0.6241936013102531, | |
| "epoch": 2.4801297648012977, | |
| "grad_norm": 0.009399542585015297, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6161544919013977, | |
| "mean_token_accuracy": 0.7491407096385956, | |
| "num_tokens": 14250696.0, | |
| "step": 384 | |
| }, | |
| { | |
| "entropy": 0.6147832497954369, | |
| "epoch": 2.48661800486618, | |
| "grad_norm": 0.007576434873044491, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6159515976905823, | |
| "mean_token_accuracy": 0.7494903281331062, | |
| "num_tokens": 14287863.0, | |
| "step": 385 | |
| }, | |
| { | |
| "entropy": 0.6227882355451584, | |
| "epoch": 2.4931062449310626, | |
| "grad_norm": 0.009297952987253666, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6279860734939575, | |
| "mean_token_accuracy": 0.745159700512886, | |
| "num_tokens": 14325371.0, | |
| "step": 386 | |
| }, | |
| { | |
| "entropy": 0.6066790446639061, | |
| "epoch": 2.499594484995945, | |
| "grad_norm": 0.009967000223696232, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6151248216629028, | |
| "mean_token_accuracy": 0.7479714751243591, | |
| "num_tokens": 14362698.0, | |
| "step": 387 | |
| }, | |
| { | |
| "entropy": 0.6248459070920944, | |
| "epoch": 2.5060827250608275, | |
| "grad_norm": 0.009727658703923225, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6268327236175537, | |
| "mean_token_accuracy": 0.7463877573609352, | |
| "num_tokens": 14399544.0, | |
| "step": 388 | |
| }, | |
| { | |
| "entropy": 0.6305608153343201, | |
| "epoch": 2.5125709651257098, | |
| "grad_norm": 0.008822647854685783, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6284365653991699, | |
| "mean_token_accuracy": 0.7454124987125397, | |
| "num_tokens": 14436877.0, | |
| "step": 389 | |
| }, | |
| { | |
| "entropy": 0.6289694681763649, | |
| "epoch": 2.519059205190592, | |
| "grad_norm": 0.009071394801139832, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6264450550079346, | |
| "mean_token_accuracy": 0.7433068230748177, | |
| "num_tokens": 14473915.0, | |
| "step": 390 | |
| }, | |
| { | |
| "entropy": 0.6271463260054588, | |
| "epoch": 2.5255474452554747, | |
| "grad_norm": 0.008187719620764256, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6289336085319519, | |
| "mean_token_accuracy": 0.7423637583851814, | |
| "num_tokens": 14511402.0, | |
| "step": 391 | |
| }, | |
| { | |
| "entropy": 0.6084585338830948, | |
| "epoch": 2.532035685320357, | |
| "grad_norm": 0.008899841457605362, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6130256652832031, | |
| "mean_token_accuracy": 0.7509424611926079, | |
| "num_tokens": 14548753.0, | |
| "step": 392 | |
| }, | |
| { | |
| "entropy": 0.6104612424969673, | |
| "epoch": 2.538523925385239, | |
| "grad_norm": 0.00985915120691061, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6200201511383057, | |
| "mean_token_accuracy": 0.7466698288917542, | |
| "num_tokens": 14586042.0, | |
| "step": 393 | |
| }, | |
| { | |
| "entropy": 0.6256568655371666, | |
| "epoch": 2.545012165450122, | |
| "grad_norm": 0.00867030955851078, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6292595267295837, | |
| "mean_token_accuracy": 0.7430211529135704, | |
| "num_tokens": 14623448.0, | |
| "step": 394 | |
| }, | |
| { | |
| "entropy": 0.6263261586427689, | |
| "epoch": 2.551500405515004, | |
| "grad_norm": 0.010737903416156769, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6249234676361084, | |
| "mean_token_accuracy": 0.7444213852286339, | |
| "num_tokens": 14660585.0, | |
| "step": 395 | |
| }, | |
| { | |
| "entropy": 0.6266406700015068, | |
| "epoch": 2.5579886455798864, | |
| "grad_norm": 0.008770007640123367, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6228189468383789, | |
| "mean_token_accuracy": 0.7473640963435173, | |
| "num_tokens": 14697839.0, | |
| "step": 396 | |
| }, | |
| { | |
| "entropy": 0.6101134717464447, | |
| "epoch": 2.564476885644769, | |
| "grad_norm": 0.008944439701735973, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6120374798774719, | |
| "mean_token_accuracy": 0.7512135058641434, | |
| "num_tokens": 14735253.0, | |
| "step": 397 | |
| }, | |
| { | |
| "entropy": 0.6294003054499626, | |
| "epoch": 2.5709651257096513, | |
| "grad_norm": 0.010403397493064404, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6361932754516602, | |
| "mean_token_accuracy": 0.7407518178224564, | |
| "num_tokens": 14772533.0, | |
| "step": 398 | |
| }, | |
| { | |
| "entropy": 0.6084831207990646, | |
| "epoch": 2.5774533657745335, | |
| "grad_norm": 0.007994825951755047, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6090534329414368, | |
| "mean_token_accuracy": 0.7516237422823906, | |
| "num_tokens": 14809746.0, | |
| "step": 399 | |
| }, | |
| { | |
| "entropy": 0.6314651742577553, | |
| "epoch": 2.5839416058394162, | |
| "grad_norm": 0.010198352858424187, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6245699524879456, | |
| "mean_token_accuracy": 0.7476952150464058, | |
| "num_tokens": 14847650.0, | |
| "step": 400 | |
| }, | |
| { | |
| "entropy": 0.6174981743097305, | |
| "epoch": 2.5904298459042985, | |
| "grad_norm": 0.009044546633958817, | |
| "learning_rate": 0.0002, | |
| "loss": 0.615368664264679, | |
| "mean_token_accuracy": 0.7484294474124908, | |
| "num_tokens": 14884930.0, | |
| "step": 401 | |
| }, | |
| { | |
| "entropy": 0.6164123043417931, | |
| "epoch": 2.5969180859691807, | |
| "grad_norm": 0.008100450970232487, | |
| "learning_rate": 0.0002, | |
| "loss": 0.620932936668396, | |
| "mean_token_accuracy": 0.7468846142292023, | |
| "num_tokens": 14922467.0, | |
| "step": 402 | |
| }, | |
| { | |
| "entropy": 0.6131496354937553, | |
| "epoch": 2.6034063260340634, | |
| "grad_norm": 0.01058341097086668, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6206756830215454, | |
| "mean_token_accuracy": 0.7483528330922127, | |
| "num_tokens": 14959768.0, | |
| "step": 403 | |
| }, | |
| { | |
| "entropy": 0.61551932990551, | |
| "epoch": 2.6098945660989457, | |
| "grad_norm": 0.008704769425094128, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6186975240707397, | |
| "mean_token_accuracy": 0.7474388629198074, | |
| "num_tokens": 14996628.0, | |
| "step": 404 | |
| }, | |
| { | |
| "entropy": 0.6159948483109474, | |
| "epoch": 2.616382806163828, | |
| "grad_norm": 0.009592502377927303, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6187817454338074, | |
| "mean_token_accuracy": 0.7487591952085495, | |
| "num_tokens": 15033592.0, | |
| "step": 405 | |
| }, | |
| { | |
| "entropy": 0.6296302676200867, | |
| "epoch": 2.6228710462287106, | |
| "grad_norm": 0.009406859055161476, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6244117617607117, | |
| "mean_token_accuracy": 0.7439019158482552, | |
| "num_tokens": 15071235.0, | |
| "step": 406 | |
| }, | |
| { | |
| "entropy": 0.6396452710032463, | |
| "epoch": 2.629359286293593, | |
| "grad_norm": 0.009445966221392155, | |
| "learning_rate": 0.0002, | |
| "loss": 0.634600043296814, | |
| "mean_token_accuracy": 0.7421920970082283, | |
| "num_tokens": 15108591.0, | |
| "step": 407 | |
| }, | |
| { | |
| "entropy": 0.6241939589381218, | |
| "epoch": 2.635847526358475, | |
| "grad_norm": 0.008459821343421936, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6214285492897034, | |
| "mean_token_accuracy": 0.745953157544136, | |
| "num_tokens": 15146394.0, | |
| "step": 408 | |
| }, | |
| { | |
| "entropy": 0.6104935929179192, | |
| "epoch": 2.6423357664233578, | |
| "grad_norm": 0.010156887583434582, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6155494451522827, | |
| "mean_token_accuracy": 0.7467065751552582, | |
| "num_tokens": 15183954.0, | |
| "step": 409 | |
| }, | |
| { | |
| "entropy": 0.6200908496975899, | |
| "epoch": 2.64882400648824, | |
| "grad_norm": 0.01134799886494875, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6298259496688843, | |
| "mean_token_accuracy": 0.7434926256537437, | |
| "num_tokens": 15221318.0, | |
| "step": 410 | |
| }, | |
| { | |
| "entropy": 0.6163679510354996, | |
| "epoch": 2.6553122465531223, | |
| "grad_norm": 0.008384560234844685, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6196904182434082, | |
| "mean_token_accuracy": 0.7484511360526085, | |
| "num_tokens": 15258714.0, | |
| "step": 411 | |
| }, | |
| { | |
| "entropy": 0.6290042921900749, | |
| "epoch": 2.661800486618005, | |
| "grad_norm": 0.011763868853449821, | |
| "learning_rate": 0.0002, | |
| "loss": 0.623403787612915, | |
| "mean_token_accuracy": 0.7461108565330505, | |
| "num_tokens": 15295950.0, | |
| "step": 412 | |
| }, | |
| { | |
| "entropy": 0.6304820030927658, | |
| "epoch": 2.668288726682887, | |
| "grad_norm": 0.008899668231606483, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6314485669136047, | |
| "mean_token_accuracy": 0.7429024130105972, | |
| "num_tokens": 15333333.0, | |
| "step": 413 | |
| }, | |
| { | |
| "entropy": 0.6225186064839363, | |
| "epoch": 2.6747769667477694, | |
| "grad_norm": 0.008537418209016323, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6211932897567749, | |
| "mean_token_accuracy": 0.747981533408165, | |
| "num_tokens": 15370982.0, | |
| "step": 414 | |
| }, | |
| { | |
| "entropy": 0.6107104495167732, | |
| "epoch": 2.681265206812652, | |
| "grad_norm": 0.01061639841645956, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6177730560302734, | |
| "mean_token_accuracy": 0.7482814937829971, | |
| "num_tokens": 15408426.0, | |
| "step": 415 | |
| }, | |
| { | |
| "entropy": 0.6148537546396255, | |
| "epoch": 2.6877534468775344, | |
| "grad_norm": 0.011781369335949421, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6236268281936646, | |
| "mean_token_accuracy": 0.7474222108721733, | |
| "num_tokens": 15445617.0, | |
| "step": 416 | |
| }, | |
| { | |
| "entropy": 0.6345531940460205, | |
| "epoch": 2.6942416869424166, | |
| "grad_norm": 0.008664336055517197, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6367125511169434, | |
| "mean_token_accuracy": 0.7417123690247536, | |
| "num_tokens": 15483295.0, | |
| "step": 417 | |
| }, | |
| { | |
| "entropy": 0.632311999797821, | |
| "epoch": 2.7007299270072993, | |
| "grad_norm": 0.010981544852256775, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6256700158119202, | |
| "mean_token_accuracy": 0.7448865845799446, | |
| "num_tokens": 15520324.0, | |
| "step": 418 | |
| }, | |
| { | |
| "entropy": 0.6247982755303383, | |
| "epoch": 2.7072181670721815, | |
| "grad_norm": 0.010701069608330727, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6191861629486084, | |
| "mean_token_accuracy": 0.747975766658783, | |
| "num_tokens": 15557534.0, | |
| "step": 419 | |
| }, | |
| { | |
| "entropy": 0.6309525445103645, | |
| "epoch": 2.7137064071370642, | |
| "grad_norm": 0.008924427442252636, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6328113079071045, | |
| "mean_token_accuracy": 0.741542711853981, | |
| "num_tokens": 15594763.0, | |
| "step": 420 | |
| }, | |
| { | |
| "entropy": 0.6043407768011093, | |
| "epoch": 2.7201946472019465, | |
| "grad_norm": 0.008746204897761345, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6077402830123901, | |
| "mean_token_accuracy": 0.7525621652603149, | |
| "num_tokens": 15631963.0, | |
| "step": 421 | |
| }, | |
| { | |
| "entropy": 0.623171254992485, | |
| "epoch": 2.7266828872668287, | |
| "grad_norm": 0.012448329478502274, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6337227821350098, | |
| "mean_token_accuracy": 0.7424034029245377, | |
| "num_tokens": 15669213.0, | |
| "step": 422 | |
| }, | |
| { | |
| "entropy": 0.6182989627122879, | |
| "epoch": 2.7331711273317114, | |
| "grad_norm": 0.00980245042592287, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6246788501739502, | |
| "mean_token_accuracy": 0.7442185133695602, | |
| "num_tokens": 15706502.0, | |
| "step": 423 | |
| }, | |
| { | |
| "entropy": 0.6341974511742592, | |
| "epoch": 2.7396593673965937, | |
| "grad_norm": 0.010192792862653732, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6291946172714233, | |
| "mean_token_accuracy": 0.7423791959881783, | |
| "num_tokens": 15744210.0, | |
| "step": 424 | |
| }, | |
| { | |
| "entropy": 0.6213679686188698, | |
| "epoch": 2.7461476074614763, | |
| "grad_norm": 0.010065656155347824, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6173956394195557, | |
| "mean_token_accuracy": 0.7478613257408142, | |
| "num_tokens": 15781645.0, | |
| "step": 425 | |
| }, | |
| { | |
| "entropy": 0.6221437901258469, | |
| "epoch": 2.7526358475263586, | |
| "grad_norm": 0.0095105255022645, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6207852363586426, | |
| "mean_token_accuracy": 0.7459077090024948, | |
| "num_tokens": 15818882.0, | |
| "step": 426 | |
| }, | |
| { | |
| "entropy": 0.6309037730097771, | |
| "epoch": 2.759124087591241, | |
| "grad_norm": 0.008715137839317322, | |
| "learning_rate": 0.0002, | |
| "loss": 0.635662317276001, | |
| "mean_token_accuracy": 0.7393417879939079, | |
| "num_tokens": 15856215.0, | |
| "step": 427 | |
| }, | |
| { | |
| "entropy": 0.6107242554426193, | |
| "epoch": 2.7656123276561235, | |
| "grad_norm": 0.01041481178253889, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6185387372970581, | |
| "mean_token_accuracy": 0.7483986243605614, | |
| "num_tokens": 15892879.0, | |
| "step": 428 | |
| }, | |
| { | |
| "entropy": 0.6216551586985588, | |
| "epoch": 2.7721005677210058, | |
| "grad_norm": 0.0099997129291296, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6273539066314697, | |
| "mean_token_accuracy": 0.7425299435853958, | |
| "num_tokens": 15930440.0, | |
| "step": 429 | |
| }, | |
| { | |
| "entropy": 0.6228181794285774, | |
| "epoch": 2.778588807785888, | |
| "grad_norm": 0.009126834571361542, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6193030476570129, | |
| "mean_token_accuracy": 0.748077854514122, | |
| "num_tokens": 15967547.0, | |
| "step": 430 | |
| }, | |
| { | |
| "entropy": 0.6386850997805595, | |
| "epoch": 2.7850770478507707, | |
| "grad_norm": 0.00938471220433712, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6340270042419434, | |
| "mean_token_accuracy": 0.7409438043832779, | |
| "num_tokens": 16004947.0, | |
| "step": 431 | |
| }, | |
| { | |
| "entropy": 0.6217259094119072, | |
| "epoch": 2.791565287915653, | |
| "grad_norm": 0.010031217709183693, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6190569400787354, | |
| "mean_token_accuracy": 0.7476614862680435, | |
| "num_tokens": 16041946.0, | |
| "step": 432 | |
| }, | |
| { | |
| "entropy": 0.6218375042080879, | |
| "epoch": 2.798053527980535, | |
| "grad_norm": 0.008579161949455738, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6240730285644531, | |
| "mean_token_accuracy": 0.746677428483963, | |
| "num_tokens": 16078788.0, | |
| "step": 433 | |
| }, | |
| { | |
| "entropy": 0.627423033118248, | |
| "epoch": 2.804541768045418, | |
| "grad_norm": 0.010432623326778412, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6334057450294495, | |
| "mean_token_accuracy": 0.7425751611590385, | |
| "num_tokens": 16116073.0, | |
| "step": 434 | |
| }, | |
| { | |
| "entropy": 0.6249776631593704, | |
| "epoch": 2.8110300081103, | |
| "grad_norm": 0.01080512534826994, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6291300058364868, | |
| "mean_token_accuracy": 0.7412911430001259, | |
| "num_tokens": 16153421.0, | |
| "step": 435 | |
| }, | |
| { | |
| "entropy": 0.6199780628085136, | |
| "epoch": 2.8175182481751824, | |
| "grad_norm": 0.008089151233434677, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6166943311691284, | |
| "mean_token_accuracy": 0.7502307966351509, | |
| "num_tokens": 16190692.0, | |
| "step": 436 | |
| }, | |
| { | |
| "entropy": 0.6264552250504494, | |
| "epoch": 2.824006488240065, | |
| "grad_norm": 0.009256084449589252, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6239896416664124, | |
| "mean_token_accuracy": 0.7462676838040352, | |
| "num_tokens": 16227626.0, | |
| "step": 437 | |
| }, | |
| { | |
| "entropy": 0.6257441863417625, | |
| "epoch": 2.8304947283049473, | |
| "grad_norm": 0.010192189365625381, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6272855997085571, | |
| "mean_token_accuracy": 0.7451135069131851, | |
| "num_tokens": 16264951.0, | |
| "step": 438 | |
| }, | |
| { | |
| "entropy": 0.6197425052523613, | |
| "epoch": 2.8369829683698295, | |
| "grad_norm": 0.00909087248146534, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6246816515922546, | |
| "mean_token_accuracy": 0.7462664917111397, | |
| "num_tokens": 16302276.0, | |
| "step": 439 | |
| }, | |
| { | |
| "entropy": 0.6187947019934654, | |
| "epoch": 2.8434712084347122, | |
| "grad_norm": 0.010161105543375015, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6317975521087646, | |
| "mean_token_accuracy": 0.7427225112915039, | |
| "num_tokens": 16339652.0, | |
| "step": 440 | |
| }, | |
| { | |
| "entropy": 0.6189513206481934, | |
| "epoch": 2.8499594484995945, | |
| "grad_norm": 0.009055238217115402, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6247466802597046, | |
| "mean_token_accuracy": 0.7450408861041069, | |
| "num_tokens": 16376803.0, | |
| "step": 441 | |
| }, | |
| { | |
| "entropy": 0.6144088804721832, | |
| "epoch": 2.8564476885644767, | |
| "grad_norm": 0.008574709296226501, | |
| "learning_rate": 0.0002, | |
| "loss": 0.618188738822937, | |
| "mean_token_accuracy": 0.7477873042225838, | |
| "num_tokens": 16413555.0, | |
| "step": 442 | |
| }, | |
| { | |
| "entropy": 0.6285263672471046, | |
| "epoch": 2.8629359286293594, | |
| "grad_norm": 0.01058571133762598, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6210506558418274, | |
| "mean_token_accuracy": 0.7466302737593651, | |
| "num_tokens": 16450235.0, | |
| "step": 443 | |
| }, | |
| { | |
| "entropy": 0.6278195902705193, | |
| "epoch": 2.8694241686942417, | |
| "grad_norm": 0.008600706234574318, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6228291988372803, | |
| "mean_token_accuracy": 0.7465885654091835, | |
| "num_tokens": 16487688.0, | |
| "step": 444 | |
| }, | |
| { | |
| "entropy": 0.6128537505865097, | |
| "epoch": 2.875912408759124, | |
| "grad_norm": 0.009188942611217499, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6115404367446899, | |
| "mean_token_accuracy": 0.7511069476604462, | |
| "num_tokens": 16525056.0, | |
| "step": 445 | |
| }, | |
| { | |
| "entropy": 0.6209624111652374, | |
| "epoch": 2.8824006488240066, | |
| "grad_norm": 0.009248930029571056, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6210386753082275, | |
| "mean_token_accuracy": 0.7469235137104988, | |
| "num_tokens": 16562914.0, | |
| "step": 446 | |
| }, | |
| { | |
| "entropy": 0.5965787023305893, | |
| "epoch": 2.888888888888889, | |
| "grad_norm": 0.0094021987169981, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6033673286437988, | |
| "mean_token_accuracy": 0.7514390125870705, | |
| "num_tokens": 16599899.0, | |
| "step": 447 | |
| }, | |
| { | |
| "entropy": 0.6115651428699493, | |
| "epoch": 2.895377128953771, | |
| "grad_norm": 0.01325083989650011, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6262028813362122, | |
| "mean_token_accuracy": 0.7461578771471977, | |
| "num_tokens": 16637011.0, | |
| "step": 448 | |
| }, | |
| { | |
| "entropy": 0.6188539639115334, | |
| "epoch": 2.9018653690186538, | |
| "grad_norm": 0.00891121570020914, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6159206628799438, | |
| "mean_token_accuracy": 0.7494730055332184, | |
| "num_tokens": 16673697.0, | |
| "step": 449 | |
| }, | |
| { | |
| "entropy": 0.6208583936095238, | |
| "epoch": 2.908353609083536, | |
| "grad_norm": 0.009828220121562481, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6155424118041992, | |
| "mean_token_accuracy": 0.7491355165839195, | |
| "num_tokens": 16710885.0, | |
| "step": 450 | |
| }, | |
| { | |
| "entropy": 0.6197483390569687, | |
| "epoch": 2.9148418491484183, | |
| "grad_norm": 0.008900245651602745, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6142081618309021, | |
| "mean_token_accuracy": 0.748231329023838, | |
| "num_tokens": 16748182.0, | |
| "step": 451 | |
| }, | |
| { | |
| "entropy": 0.6212092339992523, | |
| "epoch": 2.921330089213301, | |
| "grad_norm": 0.00849118735641241, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6236221790313721, | |
| "mean_token_accuracy": 0.7436698824167252, | |
| "num_tokens": 16785028.0, | |
| "step": 452 | |
| }, | |
| { | |
| "entropy": 0.6107748746871948, | |
| "epoch": 2.927818329278183, | |
| "grad_norm": 0.009662901051342487, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6197327375411987, | |
| "mean_token_accuracy": 0.7483203411102295, | |
| "num_tokens": 16822318.0, | |
| "step": 453 | |
| }, | |
| { | |
| "entropy": 0.6189533397555351, | |
| "epoch": 2.9343065693430654, | |
| "grad_norm": 0.009161571972072124, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6221146583557129, | |
| "mean_token_accuracy": 0.7479159906506538, | |
| "num_tokens": 16859984.0, | |
| "step": 454 | |
| }, | |
| { | |
| "entropy": 0.6262816786766052, | |
| "epoch": 2.940794809407948, | |
| "grad_norm": 0.008490455336868763, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6270855069160461, | |
| "mean_token_accuracy": 0.7452046275138855, | |
| "num_tokens": 16897277.0, | |
| "step": 455 | |
| }, | |
| { | |
| "entropy": 0.6230187118053436, | |
| "epoch": 2.9472830494728304, | |
| "grad_norm": 0.00920241978019476, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6212553977966309, | |
| "mean_token_accuracy": 0.7461629658937454, | |
| "num_tokens": 16934423.0, | |
| "step": 456 | |
| }, | |
| { | |
| "entropy": 0.6259749531745911, | |
| "epoch": 2.9537712895377126, | |
| "grad_norm": 0.008131385780870914, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6244622468948364, | |
| "mean_token_accuracy": 0.7466467097401619, | |
| "num_tokens": 16971857.0, | |
| "step": 457 | |
| }, | |
| { | |
| "entropy": 0.6159861534833908, | |
| "epoch": 2.9602595296025953, | |
| "grad_norm": 0.008032194338738918, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6193053722381592, | |
| "mean_token_accuracy": 0.7479442283511162, | |
| "num_tokens": 17008930.0, | |
| "step": 458 | |
| }, | |
| { | |
| "entropy": 0.617520272731781, | |
| "epoch": 2.9667477696674776, | |
| "grad_norm": 0.009034648537635803, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6226905584335327, | |
| "mean_token_accuracy": 0.7449267134070396, | |
| "num_tokens": 17046294.0, | |
| "step": 459 | |
| }, | |
| { | |
| "entropy": 0.6264740154147148, | |
| "epoch": 2.9732360097323602, | |
| "grad_norm": 0.008523489348590374, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6288236379623413, | |
| "mean_token_accuracy": 0.7429340779781342, | |
| "num_tokens": 17083358.0, | |
| "step": 460 | |
| }, | |
| { | |
| "entropy": 0.6205747723579407, | |
| "epoch": 2.9797242497972425, | |
| "grad_norm": 0.008030165918171406, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6183617115020752, | |
| "mean_token_accuracy": 0.7463237047195435, | |
| "num_tokens": 17120761.0, | |
| "step": 461 | |
| }, | |
| { | |
| "entropy": 0.6367032006382942, | |
| "epoch": 2.986212489862125, | |
| "grad_norm": 0.009663688018918037, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6329810619354248, | |
| "mean_token_accuracy": 0.7433002442121506, | |
| "num_tokens": 17158231.0, | |
| "step": 462 | |
| }, | |
| { | |
| "entropy": 0.626891016960144, | |
| "epoch": 2.9927007299270074, | |
| "grad_norm": 0.009945257566869259, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6275311708450317, | |
| "mean_token_accuracy": 0.7450283095240593, | |
| "num_tokens": 17195764.0, | |
| "step": 463 | |
| }, | |
| { | |
| "entropy": 0.6275185570120811, | |
| "epoch": 2.9991889699918897, | |
| "grad_norm": 0.008921638131141663, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6317576169967651, | |
| "mean_token_accuracy": 0.7413767129182816, | |
| "num_tokens": 17232867.0, | |
| "step": 464 | |
| }, | |
| { | |
| "entropy": 0.5935274362564087, | |
| "epoch": 3.0, | |
| "grad_norm": 0.02002483420073986, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5921852588653564, | |
| "mean_token_accuracy": 0.7577869892120361, | |
| "num_tokens": 17237490.0, | |
| "step": 465 | |
| }, | |
| { | |
| "entropy": 0.610297404229641, | |
| "epoch": 3.0064882400648822, | |
| "grad_norm": 0.010434089228510857, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6096053123474121, | |
| "mean_token_accuracy": 0.7505725026130676, | |
| "num_tokens": 17274381.0, | |
| "step": 466 | |
| }, | |
| { | |
| "entropy": 0.6093652322888374, | |
| "epoch": 3.012976480129765, | |
| "grad_norm": 0.011252244934439659, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6079680919647217, | |
| "mean_token_accuracy": 0.751014731824398, | |
| "num_tokens": 17311247.0, | |
| "step": 467 | |
| }, | |
| { | |
| "entropy": 0.6135042458772659, | |
| "epoch": 3.019464720194647, | |
| "grad_norm": 0.011452090926468372, | |
| "learning_rate": 0.0002, | |
| "loss": 0.621872067451477, | |
| "mean_token_accuracy": 0.7463375702500343, | |
| "num_tokens": 17348490.0, | |
| "step": 468 | |
| }, | |
| { | |
| "entropy": 0.6276230961084366, | |
| "epoch": 3.0259529602595294, | |
| "grad_norm": 0.011181695386767387, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6287038326263428, | |
| "mean_token_accuracy": 0.7455412894487381, | |
| "num_tokens": 17385419.0, | |
| "step": 469 | |
| }, | |
| { | |
| "entropy": 0.6226534396409988, | |
| "epoch": 3.032441200324412, | |
| "grad_norm": 0.00998624972999096, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6229760646820068, | |
| "mean_token_accuracy": 0.7449204847216606, | |
| "num_tokens": 17423056.0, | |
| "step": 470 | |
| }, | |
| { | |
| "entropy": 0.6008478105068207, | |
| "epoch": 3.0389294403892944, | |
| "grad_norm": 0.0095088891685009, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6020908951759338, | |
| "mean_token_accuracy": 0.7544899210333824, | |
| "num_tokens": 17460157.0, | |
| "step": 471 | |
| }, | |
| { | |
| "entropy": 0.6252934113144875, | |
| "epoch": 3.0454176804541766, | |
| "grad_norm": 0.010803421959280968, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6294186115264893, | |
| "mean_token_accuracy": 0.7426271066069603, | |
| "num_tokens": 17497579.0, | |
| "step": 472 | |
| }, | |
| { | |
| "entropy": 0.6106472909450531, | |
| "epoch": 3.0519059205190593, | |
| "grad_norm": 0.010041839443147182, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6172924041748047, | |
| "mean_token_accuracy": 0.7476223781704903, | |
| "num_tokens": 17534955.0, | |
| "step": 473 | |
| }, | |
| { | |
| "entropy": 0.6221166178584099, | |
| "epoch": 3.0583941605839415, | |
| "grad_norm": 0.009123523719608784, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6244035363197327, | |
| "mean_token_accuracy": 0.7448302879929543, | |
| "num_tokens": 17572150.0, | |
| "step": 474 | |
| }, | |
| { | |
| "entropy": 0.6102956235408783, | |
| "epoch": 3.0648824006488242, | |
| "grad_norm": 0.008510733023285866, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6107138991355896, | |
| "mean_token_accuracy": 0.7484675496816635, | |
| "num_tokens": 17609343.0, | |
| "step": 475 | |
| }, | |
| { | |
| "entropy": 0.6124226823449135, | |
| "epoch": 3.0713706407137065, | |
| "grad_norm": 0.009730803780257702, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6136341691017151, | |
| "mean_token_accuracy": 0.7490884363651276, | |
| "num_tokens": 17646448.0, | |
| "step": 476 | |
| }, | |
| { | |
| "entropy": 0.6132366731762886, | |
| "epoch": 3.0778588807785887, | |
| "grad_norm": 0.008984670974314213, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6176835298538208, | |
| "mean_token_accuracy": 0.7453758120536804, | |
| "num_tokens": 17683285.0, | |
| "step": 477 | |
| }, | |
| { | |
| "entropy": 0.6138317957520485, | |
| "epoch": 3.0843471208434714, | |
| "grad_norm": 0.009527822025120258, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6128236055374146, | |
| "mean_token_accuracy": 0.7498287856578827, | |
| "num_tokens": 17720424.0, | |
| "step": 478 | |
| }, | |
| { | |
| "entropy": 0.6150398552417755, | |
| "epoch": 3.0908353609083536, | |
| "grad_norm": 0.012212819419801235, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6184934377670288, | |
| "mean_token_accuracy": 0.74715456366539, | |
| "num_tokens": 17757738.0, | |
| "step": 479 | |
| }, | |
| { | |
| "entropy": 0.6138227432966232, | |
| "epoch": 3.097323600973236, | |
| "grad_norm": 0.009692898020148277, | |
| "learning_rate": 0.0002, | |
| "loss": 0.615317165851593, | |
| "mean_token_accuracy": 0.7491249144077301, | |
| "num_tokens": 17794819.0, | |
| "step": 480 | |
| }, | |
| { | |
| "entropy": 0.6220738738775253, | |
| "epoch": 3.1038118410381186, | |
| "grad_norm": 0.009081809781491756, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6233057975769043, | |
| "mean_token_accuracy": 0.7442603260278702, | |
| "num_tokens": 17832045.0, | |
| "step": 481 | |
| }, | |
| { | |
| "entropy": 0.6058575734496117, | |
| "epoch": 3.110300081103001, | |
| "grad_norm": 0.009930483065545559, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6012391448020935, | |
| "mean_token_accuracy": 0.7559900879859924, | |
| "num_tokens": 17869448.0, | |
| "step": 482 | |
| }, | |
| { | |
| "entropy": 0.6158036887645721, | |
| "epoch": 3.116788321167883, | |
| "grad_norm": 0.009399381466209888, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6149718761444092, | |
| "mean_token_accuracy": 0.7499518990516663, | |
| "num_tokens": 17906111.0, | |
| "step": 483 | |
| }, | |
| { | |
| "entropy": 0.6169976964592934, | |
| "epoch": 3.1232765612327658, | |
| "grad_norm": 0.009214673191308975, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6195358037948608, | |
| "mean_token_accuracy": 0.744194358587265, | |
| "num_tokens": 17943306.0, | |
| "step": 484 | |
| }, | |
| { | |
| "entropy": 0.620849184691906, | |
| "epoch": 3.129764801297648, | |
| "grad_norm": 0.00997876189649105, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6267833113670349, | |
| "mean_token_accuracy": 0.744784764945507, | |
| "num_tokens": 17980613.0, | |
| "step": 485 | |
| }, | |
| { | |
| "entropy": 0.6128402128815651, | |
| "epoch": 3.1362530413625302, | |
| "grad_norm": 0.008573702536523342, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6157655715942383, | |
| "mean_token_accuracy": 0.7487166821956635, | |
| "num_tokens": 18017947.0, | |
| "step": 486 | |
| }, | |
| { | |
| "entropy": 0.622900165617466, | |
| "epoch": 3.142741281427413, | |
| "grad_norm": 0.009601105935871601, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6263000965118408, | |
| "mean_token_accuracy": 0.7445476576685905, | |
| "num_tokens": 18055764.0, | |
| "step": 487 | |
| }, | |
| { | |
| "entropy": 0.6130729392170906, | |
| "epoch": 3.149229521492295, | |
| "grad_norm": 0.008899933658540249, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6115667819976807, | |
| "mean_token_accuracy": 0.7505542188882828, | |
| "num_tokens": 18092869.0, | |
| "step": 488 | |
| }, | |
| { | |
| "entropy": 0.615093469619751, | |
| "epoch": 3.1557177615571774, | |
| "grad_norm": 0.009630289860069752, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6127116084098816, | |
| "mean_token_accuracy": 0.74873948097229, | |
| "num_tokens": 18130032.0, | |
| "step": 489 | |
| }, | |
| { | |
| "entropy": 0.6184138208627701, | |
| "epoch": 3.16220600162206, | |
| "grad_norm": 0.009784260764718056, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6196454763412476, | |
| "mean_token_accuracy": 0.7479289025068283, | |
| "num_tokens": 18167189.0, | |
| "step": 490 | |
| }, | |
| { | |
| "entropy": 0.6225049868226051, | |
| "epoch": 3.1686942416869424, | |
| "grad_norm": 0.009817374870181084, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6254591345787048, | |
| "mean_token_accuracy": 0.7443916201591492, | |
| "num_tokens": 18204423.0, | |
| "step": 491 | |
| }, | |
| { | |
| "entropy": 0.599067859351635, | |
| "epoch": 3.1751824817518246, | |
| "grad_norm": 0.009707923047244549, | |
| "learning_rate": 0.0002, | |
| "loss": 0.603665292263031, | |
| "mean_token_accuracy": 0.7512796595692635, | |
| "num_tokens": 18241647.0, | |
| "step": 492 | |
| }, | |
| { | |
| "entropy": 0.6269692480564117, | |
| "epoch": 3.1816707218167073, | |
| "grad_norm": 0.009654807858169079, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6272069215774536, | |
| "mean_token_accuracy": 0.7451600208878517, | |
| "num_tokens": 18278874.0, | |
| "step": 493 | |
| }, | |
| { | |
| "entropy": 0.60984867811203, | |
| "epoch": 3.1881589618815895, | |
| "grad_norm": 0.00973904225975275, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6120602488517761, | |
| "mean_token_accuracy": 0.7500757128000259, | |
| "num_tokens": 18316077.0, | |
| "step": 494 | |
| }, | |
| { | |
| "entropy": 0.6112287938594818, | |
| "epoch": 3.1946472019464722, | |
| "grad_norm": 0.010687717236578465, | |
| "learning_rate": 0.0002, | |
| "loss": 0.607744038105011, | |
| "mean_token_accuracy": 0.7535340562462807, | |
| "num_tokens": 18353199.0, | |
| "step": 495 | |
| }, | |
| { | |
| "entropy": 0.6153931394219398, | |
| "epoch": 3.2011354420113545, | |
| "grad_norm": 0.009243862703442574, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6182031035423279, | |
| "mean_token_accuracy": 0.7475122958421707, | |
| "num_tokens": 18390725.0, | |
| "step": 496 | |
| }, | |
| { | |
| "entropy": 0.6184414252638817, | |
| "epoch": 3.2076236820762367, | |
| "grad_norm": 0.009725847281515598, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6202661395072937, | |
| "mean_token_accuracy": 0.7463328316807747, | |
| "num_tokens": 18428083.0, | |
| "step": 497 | |
| }, | |
| { | |
| "entropy": 0.6206400170922279, | |
| "epoch": 3.2141119221411194, | |
| "grad_norm": 0.009717848151922226, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6237635612487793, | |
| "mean_token_accuracy": 0.7449309974908829, | |
| "num_tokens": 18465093.0, | |
| "step": 498 | |
| }, | |
| { | |
| "entropy": 0.6063303649425507, | |
| "epoch": 3.2206001622060016, | |
| "grad_norm": 0.009384922683238983, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6071447134017944, | |
| "mean_token_accuracy": 0.750182680785656, | |
| "num_tokens": 18502351.0, | |
| "step": 499 | |
| }, | |
| { | |
| "entropy": 0.6171220317482948, | |
| "epoch": 3.227088402270884, | |
| "grad_norm": 0.010402821935713291, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6183167695999146, | |
| "mean_token_accuracy": 0.7468552514910698, | |
| "num_tokens": 18540172.0, | |
| "step": 500 | |
| }, | |
| { | |
| "entropy": 0.6202204376459122, | |
| "epoch": 3.2335766423357666, | |
| "grad_norm": 0.008789432235062122, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6224135160446167, | |
| "mean_token_accuracy": 0.745467983186245, | |
| "num_tokens": 18577734.0, | |
| "step": 501 | |
| }, | |
| { | |
| "entropy": 0.6132732257246971, | |
| "epoch": 3.240064882400649, | |
| "grad_norm": 0.010597198270261288, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6129106283187866, | |
| "mean_token_accuracy": 0.7499266192317009, | |
| "num_tokens": 18614944.0, | |
| "step": 502 | |
| }, | |
| { | |
| "entropy": 0.6337689533829689, | |
| "epoch": 3.246553122465531, | |
| "grad_norm": 0.009572361595928669, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6304764747619629, | |
| "mean_token_accuracy": 0.7434330955147743, | |
| "num_tokens": 18651997.0, | |
| "step": 503 | |
| }, | |
| { | |
| "entropy": 0.6075436845421791, | |
| "epoch": 3.2530413625304138, | |
| "grad_norm": 0.00990824680775404, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6082068681716919, | |
| "mean_token_accuracy": 0.7516702488064766, | |
| "num_tokens": 18688674.0, | |
| "step": 504 | |
| }, | |
| { | |
| "entropy": 0.6139610409736633, | |
| "epoch": 3.259529602595296, | |
| "grad_norm": 0.010237157344818115, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6186607480049133, | |
| "mean_token_accuracy": 0.7454981952905655, | |
| "num_tokens": 18726405.0, | |
| "step": 505 | |
| }, | |
| { | |
| "entropy": 0.6063608303666115, | |
| "epoch": 3.2660178426601782, | |
| "grad_norm": 0.010847094468772411, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6137136816978455, | |
| "mean_token_accuracy": 0.7497691661119461, | |
| "num_tokens": 18763668.0, | |
| "step": 506 | |
| }, | |
| { | |
| "entropy": 0.6163499504327774, | |
| "epoch": 3.272506082725061, | |
| "grad_norm": 0.010017551481723785, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6188673973083496, | |
| "mean_token_accuracy": 0.7473317757248878, | |
| "num_tokens": 18800872.0, | |
| "step": 507 | |
| }, | |
| { | |
| "entropy": 0.6251264810562134, | |
| "epoch": 3.278994322789943, | |
| "grad_norm": 0.011264265514910221, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6177271604537964, | |
| "mean_token_accuracy": 0.7485972419381142, | |
| "num_tokens": 18838150.0, | |
| "step": 508 | |
| }, | |
| { | |
| "entropy": 0.6273062154650688, | |
| "epoch": 3.285482562854826, | |
| "grad_norm": 0.010041182860732079, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6206075549125671, | |
| "mean_token_accuracy": 0.7470289915800095, | |
| "num_tokens": 18875738.0, | |
| "step": 509 | |
| }, | |
| { | |
| "entropy": 0.6267990991473198, | |
| "epoch": 3.291970802919708, | |
| "grad_norm": 0.011449483223259449, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6346527934074402, | |
| "mean_token_accuracy": 0.7385271340608597, | |
| "num_tokens": 18913137.0, | |
| "step": 510 | |
| }, | |
| { | |
| "entropy": 0.6025072038173676, | |
| "epoch": 3.2984590429845904, | |
| "grad_norm": 0.010422894731163979, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6072125434875488, | |
| "mean_token_accuracy": 0.7508590817451477, | |
| "num_tokens": 18950470.0, | |
| "step": 511 | |
| }, | |
| { | |
| "entropy": 0.6073831468820572, | |
| "epoch": 3.304947283049473, | |
| "grad_norm": 0.010642215609550476, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6133738160133362, | |
| "mean_token_accuracy": 0.7492869570851326, | |
| "num_tokens": 18988313.0, | |
| "step": 512 | |
| }, | |
| { | |
| "entropy": 0.5974380895495415, | |
| "epoch": 3.3114355231143553, | |
| "grad_norm": 0.010486697778105736, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6020730137825012, | |
| "mean_token_accuracy": 0.7548841238021851, | |
| "num_tokens": 19024956.0, | |
| "step": 513 | |
| }, | |
| { | |
| "entropy": 0.6128261536359787, | |
| "epoch": 3.3179237631792375, | |
| "grad_norm": 0.011510336771607399, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6143049001693726, | |
| "mean_token_accuracy": 0.7480410858988762, | |
| "num_tokens": 19062179.0, | |
| "step": 514 | |
| }, | |
| { | |
| "entropy": 0.6077246218919754, | |
| "epoch": 3.3244120032441202, | |
| "grad_norm": 0.010107292793691158, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6046852469444275, | |
| "mean_token_accuracy": 0.7533954977989197, | |
| "num_tokens": 19099090.0, | |
| "step": 515 | |
| }, | |
| { | |
| "entropy": 0.6247019246220589, | |
| "epoch": 3.3309002433090025, | |
| "grad_norm": 0.010466467589139938, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6306489706039429, | |
| "mean_token_accuracy": 0.741244375705719, | |
| "num_tokens": 19136307.0, | |
| "step": 516 | |
| }, | |
| { | |
| "entropy": 0.6153485924005508, | |
| "epoch": 3.3373884833738847, | |
| "grad_norm": 0.009494316764175892, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6167474985122681, | |
| "mean_token_accuracy": 0.7500151321291924, | |
| "num_tokens": 19173544.0, | |
| "step": 517 | |
| }, | |
| { | |
| "entropy": 0.6086971685290337, | |
| "epoch": 3.3438767234387674, | |
| "grad_norm": 0.009192675352096558, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6096853017807007, | |
| "mean_token_accuracy": 0.7501685246825218, | |
| "num_tokens": 19210386.0, | |
| "step": 518 | |
| }, | |
| { | |
| "entropy": 0.6297651901841164, | |
| "epoch": 3.3503649635036497, | |
| "grad_norm": 0.009902825579047203, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6314697265625, | |
| "mean_token_accuracy": 0.7417091131210327, | |
| "num_tokens": 19247761.0, | |
| "step": 519 | |
| }, | |
| { | |
| "entropy": 0.6149463355541229, | |
| "epoch": 3.356853203568532, | |
| "grad_norm": 0.009715819731354713, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6137614250183105, | |
| "mean_token_accuracy": 0.7476155012845993, | |
| "num_tokens": 19284908.0, | |
| "step": 520 | |
| }, | |
| { | |
| "entropy": 0.6115437000989914, | |
| "epoch": 3.3633414436334146, | |
| "grad_norm": 0.009652029722929, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6114376783370972, | |
| "mean_token_accuracy": 0.7499561905860901, | |
| "num_tokens": 19321727.0, | |
| "step": 521 | |
| }, | |
| { | |
| "entropy": 0.6143479123711586, | |
| "epoch": 3.369829683698297, | |
| "grad_norm": 0.010150844231247902, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6162387132644653, | |
| "mean_token_accuracy": 0.7469704374670982, | |
| "num_tokens": 19359065.0, | |
| "step": 522 | |
| }, | |
| { | |
| "entropy": 0.6042628288269043, | |
| "epoch": 3.376317923763179, | |
| "grad_norm": 0.010199622251093388, | |
| "learning_rate": 0.0002, | |
| "loss": 0.607587456703186, | |
| "mean_token_accuracy": 0.7510121315717697, | |
| "num_tokens": 19396140.0, | |
| "step": 523 | |
| }, | |
| { | |
| "entropy": 0.6103994250297546, | |
| "epoch": 3.3828061638280618, | |
| "grad_norm": 0.009757442399859428, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6118942499160767, | |
| "mean_token_accuracy": 0.7493396252393723, | |
| "num_tokens": 19433282.0, | |
| "step": 524 | |
| }, | |
| { | |
| "entropy": 0.6115303710103035, | |
| "epoch": 3.389294403892944, | |
| "grad_norm": 0.009843776933848858, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6144024133682251, | |
| "mean_token_accuracy": 0.7491987869143486, | |
| "num_tokens": 19470735.0, | |
| "step": 525 | |
| }, | |
| { | |
| "entropy": 0.6124155074357986, | |
| "epoch": 3.3957826439578263, | |
| "grad_norm": 0.012832233682274818, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6174359321594238, | |
| "mean_token_accuracy": 0.7484075799584389, | |
| "num_tokens": 19508279.0, | |
| "step": 526 | |
| }, | |
| { | |
| "entropy": 0.621652752161026, | |
| "epoch": 3.402270884022709, | |
| "grad_norm": 0.010444359853863716, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6202374696731567, | |
| "mean_token_accuracy": 0.747683048248291, | |
| "num_tokens": 19545629.0, | |
| "step": 527 | |
| }, | |
| { | |
| "entropy": 0.6133333742618561, | |
| "epoch": 3.408759124087591, | |
| "grad_norm": 0.01157453190535307, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6190609931945801, | |
| "mean_token_accuracy": 0.7481984347105026, | |
| "num_tokens": 19583135.0, | |
| "step": 528 | |
| }, | |
| { | |
| "entropy": 0.6031940132379532, | |
| "epoch": 3.4152473641524734, | |
| "grad_norm": 0.01220928505063057, | |
| "learning_rate": 0.0002, | |
| "loss": 0.60877525806427, | |
| "mean_token_accuracy": 0.7505937144160271, | |
| "num_tokens": 19620410.0, | |
| "step": 529 | |
| }, | |
| { | |
| "entropy": 0.6026583164930344, | |
| "epoch": 3.421735604217356, | |
| "grad_norm": 0.009105565026402473, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6003735661506653, | |
| "mean_token_accuracy": 0.7538656741380692, | |
| "num_tokens": 19657757.0, | |
| "step": 530 | |
| }, | |
| { | |
| "entropy": 0.6212241724133492, | |
| "epoch": 3.4282238442822384, | |
| "grad_norm": 0.012120554223656654, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6169411540031433, | |
| "mean_token_accuracy": 0.7489817962050438, | |
| "num_tokens": 19694775.0, | |
| "step": 531 | |
| }, | |
| { | |
| "entropy": 0.611191414296627, | |
| "epoch": 3.4347120843471206, | |
| "grad_norm": 0.010209856554865837, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6133028268814087, | |
| "mean_token_accuracy": 0.7480586767196655, | |
| "num_tokens": 19731954.0, | |
| "step": 532 | |
| }, | |
| { | |
| "entropy": 0.6154542937874794, | |
| "epoch": 3.4412003244120033, | |
| "grad_norm": 0.009237438440322876, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6181926131248474, | |
| "mean_token_accuracy": 0.7482445612549782, | |
| "num_tokens": 19769550.0, | |
| "step": 533 | |
| }, | |
| { | |
| "entropy": 0.6260659247636795, | |
| "epoch": 3.4476885644768855, | |
| "grad_norm": 0.011564482003450394, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6311028599739075, | |
| "mean_token_accuracy": 0.7445508390665054, | |
| "num_tokens": 19806694.0, | |
| "step": 534 | |
| }, | |
| { | |
| "entropy": 0.6114797592163086, | |
| "epoch": 3.4541768045417682, | |
| "grad_norm": 0.011250223033130169, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6188318133354187, | |
| "mean_token_accuracy": 0.7451098337769508, | |
| "num_tokens": 19843897.0, | |
| "step": 535 | |
| }, | |
| { | |
| "entropy": 0.6260335817933083, | |
| "epoch": 3.4606650446066505, | |
| "grad_norm": 0.00978784915059805, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6255401372909546, | |
| "mean_token_accuracy": 0.7468025237321854, | |
| "num_tokens": 19881321.0, | |
| "step": 536 | |
| }, | |
| { | |
| "entropy": 0.6212326288223267, | |
| "epoch": 3.4671532846715327, | |
| "grad_norm": 0.013453345745801926, | |
| "learning_rate": 0.0002, | |
| "loss": 0.611083984375, | |
| "mean_token_accuracy": 0.7521479055285454, | |
| "num_tokens": 19918768.0, | |
| "step": 537 | |
| }, | |
| { | |
| "entropy": 0.6172696650028229, | |
| "epoch": 3.4736415247364154, | |
| "grad_norm": 0.010021936148405075, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6165583729743958, | |
| "mean_token_accuracy": 0.7488679885864258, | |
| "num_tokens": 19956374.0, | |
| "step": 538 | |
| }, | |
| { | |
| "entropy": 0.5984770804643631, | |
| "epoch": 3.4801297648012977, | |
| "grad_norm": 0.010912574827671051, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6038742065429688, | |
| "mean_token_accuracy": 0.752843476831913, | |
| "num_tokens": 19993165.0, | |
| "step": 539 | |
| }, | |
| { | |
| "entropy": 0.6006497591733932, | |
| "epoch": 3.48661800486618, | |
| "grad_norm": 0.010195601731538773, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6058304905891418, | |
| "mean_token_accuracy": 0.7511888965964317, | |
| "num_tokens": 20030632.0, | |
| "step": 540 | |
| }, | |
| { | |
| "entropy": 0.603807657957077, | |
| "epoch": 3.4931062449310626, | |
| "grad_norm": 0.010789190419018269, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6101077198982239, | |
| "mean_token_accuracy": 0.7498170882463455, | |
| "num_tokens": 20067720.0, | |
| "step": 541 | |
| }, | |
| { | |
| "entropy": 0.6094614043831825, | |
| "epoch": 3.499594484995945, | |
| "grad_norm": 0.010353523306548595, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6108995676040649, | |
| "mean_token_accuracy": 0.7505486905574799, | |
| "num_tokens": 20105092.0, | |
| "step": 542 | |
| }, | |
| { | |
| "entropy": 0.6127925515174866, | |
| "epoch": 3.5060827250608275, | |
| "grad_norm": 0.011608858592808247, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6113302111625671, | |
| "mean_token_accuracy": 0.7498401030898094, | |
| "num_tokens": 20142060.0, | |
| "step": 543 | |
| }, | |
| { | |
| "entropy": 0.6288227662444115, | |
| "epoch": 3.5125709651257098, | |
| "grad_norm": 0.00944559182971716, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6295347213745117, | |
| "mean_token_accuracy": 0.7438011020421982, | |
| "num_tokens": 20179321.0, | |
| "step": 544 | |
| }, | |
| { | |
| "entropy": 0.6155826225876808, | |
| "epoch": 3.519059205190592, | |
| "grad_norm": 0.010050074197351933, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6170110106468201, | |
| "mean_token_accuracy": 0.7460537254810333, | |
| "num_tokens": 20216788.0, | |
| "step": 545 | |
| }, | |
| { | |
| "entropy": 0.6109997108578682, | |
| "epoch": 3.5255474452554747, | |
| "grad_norm": 0.010288557037711143, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6153451204299927, | |
| "mean_token_accuracy": 0.747114397585392, | |
| "num_tokens": 20254482.0, | |
| "step": 546 | |
| }, | |
| { | |
| "entropy": 0.6220259815454483, | |
| "epoch": 3.532035685320357, | |
| "grad_norm": 0.010569143109023571, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6245878338813782, | |
| "mean_token_accuracy": 0.745466060936451, | |
| "num_tokens": 20291323.0, | |
| "step": 547 | |
| }, | |
| { | |
| "entropy": 0.6251974999904633, | |
| "epoch": 3.538523925385239, | |
| "grad_norm": 0.010512638837099075, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6209877729415894, | |
| "mean_token_accuracy": 0.7460760995745659, | |
| "num_tokens": 20328541.0, | |
| "step": 548 | |
| }, | |
| { | |
| "entropy": 0.6372380778193474, | |
| "epoch": 3.545012165450122, | |
| "grad_norm": 0.009989661164581776, | |
| "learning_rate": 0.0002, | |
| "loss": 0.63493812084198, | |
| "mean_token_accuracy": 0.7409111261367798, | |
| "num_tokens": 20366154.0, | |
| "step": 549 | |
| }, | |
| { | |
| "entropy": 0.616200253367424, | |
| "epoch": 3.551500405515004, | |
| "grad_norm": 0.009802714921534061, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6198533773422241, | |
| "mean_token_accuracy": 0.7493973523378372, | |
| "num_tokens": 20403539.0, | |
| "step": 550 | |
| }, | |
| { | |
| "entropy": 0.6109699085354805, | |
| "epoch": 3.5579886455798864, | |
| "grad_norm": 0.011730330996215343, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6169507503509521, | |
| "mean_token_accuracy": 0.7469825968146324, | |
| "num_tokens": 20440857.0, | |
| "step": 551 | |
| }, | |
| { | |
| "entropy": 0.6107888966798782, | |
| "epoch": 3.564476885644769, | |
| "grad_norm": 0.010902747511863708, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6169427633285522, | |
| "mean_token_accuracy": 0.7473291158676147, | |
| "num_tokens": 20478685.0, | |
| "step": 552 | |
| }, | |
| { | |
| "entropy": 0.6232053637504578, | |
| "epoch": 3.5709651257096513, | |
| "grad_norm": 0.01024220883846283, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6223392486572266, | |
| "mean_token_accuracy": 0.7471131235361099, | |
| "num_tokens": 20516186.0, | |
| "step": 553 | |
| }, | |
| { | |
| "entropy": 0.6318716630339622, | |
| "epoch": 3.5774533657745335, | |
| "grad_norm": 0.00972492340952158, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6295208930969238, | |
| "mean_token_accuracy": 0.7421210557222366, | |
| "num_tokens": 20553418.0, | |
| "step": 554 | |
| }, | |
| { | |
| "entropy": 0.6323020830750465, | |
| "epoch": 3.5839416058394162, | |
| "grad_norm": 0.009747047908604145, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6291106343269348, | |
| "mean_token_accuracy": 0.742633767426014, | |
| "num_tokens": 20590921.0, | |
| "step": 555 | |
| }, | |
| { | |
| "entropy": 0.6193426549434662, | |
| "epoch": 3.5904298459042985, | |
| "grad_norm": 0.009529096074402332, | |
| "learning_rate": 0.0002, | |
| "loss": 0.622657299041748, | |
| "mean_token_accuracy": 0.7454424574971199, | |
| "num_tokens": 20628134.0, | |
| "step": 556 | |
| }, | |
| { | |
| "entropy": 0.606108270585537, | |
| "epoch": 3.5969180859691807, | |
| "grad_norm": 0.01090499758720398, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6156042218208313, | |
| "mean_token_accuracy": 0.7475811764597893, | |
| "num_tokens": 20665529.0, | |
| "step": 557 | |
| }, | |
| { | |
| "entropy": 0.6024795696139336, | |
| "epoch": 3.6034063260340634, | |
| "grad_norm": 0.01122215110808611, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6096351146697998, | |
| "mean_token_accuracy": 0.7500594854354858, | |
| "num_tokens": 20702623.0, | |
| "step": 558 | |
| }, | |
| { | |
| "entropy": 0.6050852239131927, | |
| "epoch": 3.6098945660989457, | |
| "grad_norm": 0.008911820128560066, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6063804626464844, | |
| "mean_token_accuracy": 0.750556543469429, | |
| "num_tokens": 20739535.0, | |
| "step": 559 | |
| }, | |
| { | |
| "entropy": 0.6184356659650803, | |
| "epoch": 3.616382806163828, | |
| "grad_norm": 0.008947025053203106, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6186281442642212, | |
| "mean_token_accuracy": 0.7470304444432259, | |
| "num_tokens": 20776900.0, | |
| "step": 560 | |
| }, | |
| { | |
| "entropy": 0.6115831136703491, | |
| "epoch": 3.6228710462287106, | |
| "grad_norm": 0.010605190880596638, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6092396974563599, | |
| "mean_token_accuracy": 0.750456377863884, | |
| "num_tokens": 20814326.0, | |
| "step": 561 | |
| }, | |
| { | |
| "entropy": 0.6234035491943359, | |
| "epoch": 3.629359286293593, | |
| "grad_norm": 0.010619143024086952, | |
| "learning_rate": 0.0002, | |
| "loss": 0.622122585773468, | |
| "mean_token_accuracy": 0.7449623718857765, | |
| "num_tokens": 20851735.0, | |
| "step": 562 | |
| }, | |
| { | |
| "entropy": 0.6131063625216484, | |
| "epoch": 3.635847526358475, | |
| "grad_norm": 0.009914328344166279, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6129999160766602, | |
| "mean_token_accuracy": 0.7512071952223778, | |
| "num_tokens": 20888959.0, | |
| "step": 563 | |
| }, | |
| { | |
| "entropy": 0.6103895530104637, | |
| "epoch": 3.6423357664233578, | |
| "grad_norm": 0.009590883739292622, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6121896505355835, | |
| "mean_token_accuracy": 0.7519041821360588, | |
| "num_tokens": 20926880.0, | |
| "step": 564 | |
| }, | |
| { | |
| "entropy": 0.6107024624943733, | |
| "epoch": 3.64882400648824, | |
| "grad_norm": 0.010136992670595646, | |
| "learning_rate": 0.0002, | |
| "loss": 0.615648090839386, | |
| "mean_token_accuracy": 0.7478983402252197, | |
| "num_tokens": 20964278.0, | |
| "step": 565 | |
| }, | |
| { | |
| "entropy": 0.6019061878323555, | |
| "epoch": 3.6553122465531223, | |
| "grad_norm": 0.01197731215506792, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6083622574806213, | |
| "mean_token_accuracy": 0.752247080206871, | |
| "num_tokens": 21001703.0, | |
| "step": 566 | |
| }, | |
| { | |
| "entropy": 0.6136230602860451, | |
| "epoch": 3.661800486618005, | |
| "grad_norm": 0.010383468121290207, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6142981052398682, | |
| "mean_token_accuracy": 0.750029981136322, | |
| "num_tokens": 21039545.0, | |
| "step": 567 | |
| }, | |
| { | |
| "entropy": 0.6270170286297798, | |
| "epoch": 3.668288726682887, | |
| "grad_norm": 0.01222953386604786, | |
| "learning_rate": 0.0002, | |
| "loss": 0.622101902961731, | |
| "mean_token_accuracy": 0.7463989406824112, | |
| "num_tokens": 21076601.0, | |
| "step": 568 | |
| }, | |
| { | |
| "entropy": 0.635653018951416, | |
| "epoch": 3.6747769667477694, | |
| "grad_norm": 0.009029991924762726, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6368217468261719, | |
| "mean_token_accuracy": 0.739650160074234, | |
| "num_tokens": 21113628.0, | |
| "step": 569 | |
| }, | |
| { | |
| "entropy": 0.6155265644192696, | |
| "epoch": 3.681265206812652, | |
| "grad_norm": 0.010669651441276073, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6169142723083496, | |
| "mean_token_accuracy": 0.7483588233590126, | |
| "num_tokens": 21150841.0, | |
| "step": 570 | |
| }, | |
| { | |
| "entropy": 0.6179278939962387, | |
| "epoch": 3.6877534468775344, | |
| "grad_norm": 0.01090275775641203, | |
| "learning_rate": 0.0002, | |
| "loss": 0.620256781578064, | |
| "mean_token_accuracy": 0.7459961548447609, | |
| "num_tokens": 21188047.0, | |
| "step": 571 | |
| }, | |
| { | |
| "entropy": 0.6013471409678459, | |
| "epoch": 3.6942416869424166, | |
| "grad_norm": 0.013129356317222118, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6093657612800598, | |
| "mean_token_accuracy": 0.7505828440189362, | |
| "num_tokens": 21224977.0, | |
| "step": 572 | |
| }, | |
| { | |
| "entropy": 0.6192966923117638, | |
| "epoch": 3.7007299270072993, | |
| "grad_norm": 0.01149990689009428, | |
| "learning_rate": 0.0002, | |
| "loss": 0.624458909034729, | |
| "mean_token_accuracy": 0.7465271949768066, | |
| "num_tokens": 21262229.0, | |
| "step": 573 | |
| }, | |
| { | |
| "entropy": 0.6305530145764351, | |
| "epoch": 3.7072181670721815, | |
| "grad_norm": 0.011260929517447948, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6282562613487244, | |
| "mean_token_accuracy": 0.7442766949534416, | |
| "num_tokens": 21299934.0, | |
| "step": 574 | |
| }, | |
| { | |
| "entropy": 0.6216496974229813, | |
| "epoch": 3.7137064071370642, | |
| "grad_norm": 0.011454667896032333, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6176272630691528, | |
| "mean_token_accuracy": 0.7486661300063133, | |
| "num_tokens": 21337298.0, | |
| "step": 575 | |
| }, | |
| { | |
| "entropy": 0.6251465007662773, | |
| "epoch": 3.7201946472019465, | |
| "grad_norm": 0.011989898979663849, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6237755417823792, | |
| "mean_token_accuracy": 0.7449339032173157, | |
| "num_tokens": 21374338.0, | |
| "step": 576 | |
| }, | |
| { | |
| "entropy": 0.6160696297883987, | |
| "epoch": 3.7266828872668287, | |
| "grad_norm": 0.009978833608329296, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6201364398002625, | |
| "mean_token_accuracy": 0.7472834289073944, | |
| "num_tokens": 21411412.0, | |
| "step": 577 | |
| }, | |
| { | |
| "entropy": 0.6086283698678017, | |
| "epoch": 3.7331711273317114, | |
| "grad_norm": 0.01127020176500082, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6133439540863037, | |
| "mean_token_accuracy": 0.7486971095204353, | |
| "num_tokens": 21449184.0, | |
| "step": 578 | |
| }, | |
| { | |
| "entropy": 0.6155035272240639, | |
| "epoch": 3.7396593673965937, | |
| "grad_norm": 0.009915207512676716, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6193184852600098, | |
| "mean_token_accuracy": 0.7452678084373474, | |
| "num_tokens": 21486452.0, | |
| "step": 579 | |
| }, | |
| { | |
| "entropy": 0.6227790787816048, | |
| "epoch": 3.7461476074614763, | |
| "grad_norm": 0.009025565348565578, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6250243186950684, | |
| "mean_token_accuracy": 0.7430055662989616, | |
| "num_tokens": 21524049.0, | |
| "step": 580 | |
| }, | |
| { | |
| "entropy": 0.6145926639437675, | |
| "epoch": 3.7526358475263586, | |
| "grad_norm": 0.010546623729169369, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6121389269828796, | |
| "mean_token_accuracy": 0.7498128041625023, | |
| "num_tokens": 21560910.0, | |
| "step": 581 | |
| }, | |
| { | |
| "entropy": 0.6132489815354347, | |
| "epoch": 3.759124087591241, | |
| "grad_norm": 0.01081460528075695, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6121793389320374, | |
| "mean_token_accuracy": 0.7495040893554688, | |
| "num_tokens": 21598124.0, | |
| "step": 582 | |
| }, | |
| { | |
| "entropy": 0.6323688253760338, | |
| "epoch": 3.7656123276561235, | |
| "grad_norm": 0.010107534937560558, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6294635534286499, | |
| "mean_token_accuracy": 0.7433409690856934, | |
| "num_tokens": 21635437.0, | |
| "step": 583 | |
| }, | |
| { | |
| "entropy": 0.6125660836696625, | |
| "epoch": 3.7721005677210058, | |
| "grad_norm": 0.00997902825474739, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6156618595123291, | |
| "mean_token_accuracy": 0.7480011209845543, | |
| "num_tokens": 21672898.0, | |
| "step": 584 | |
| }, | |
| { | |
| "entropy": 0.6139216870069504, | |
| "epoch": 3.778588807785888, | |
| "grad_norm": 0.01199332345277071, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6214488744735718, | |
| "mean_token_accuracy": 0.748315691947937, | |
| "num_tokens": 21710166.0, | |
| "step": 585 | |
| }, | |
| { | |
| "entropy": 0.5991447791457176, | |
| "epoch": 3.7850770478507707, | |
| "grad_norm": 0.01200946606695652, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6080783605575562, | |
| "mean_token_accuracy": 0.7511922717094421, | |
| "num_tokens": 21746897.0, | |
| "step": 586 | |
| }, | |
| { | |
| "entropy": 0.6105977669358253, | |
| "epoch": 3.791565287915653, | |
| "grad_norm": 0.011675121262669563, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6159127950668335, | |
| "mean_token_accuracy": 0.7491589412093163, | |
| "num_tokens": 21784354.0, | |
| "step": 587 | |
| }, | |
| { | |
| "entropy": 0.6225078999996185, | |
| "epoch": 3.798053527980535, | |
| "grad_norm": 0.00965933594852686, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6214642524719238, | |
| "mean_token_accuracy": 0.7455714717507362, | |
| "num_tokens": 21821856.0, | |
| "step": 588 | |
| }, | |
| { | |
| "entropy": 0.627250537276268, | |
| "epoch": 3.804541768045418, | |
| "grad_norm": 0.010286493226885796, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6219584345817566, | |
| "mean_token_accuracy": 0.7479822859168053, | |
| "num_tokens": 21858968.0, | |
| "step": 589 | |
| }, | |
| { | |
| "entropy": 0.6303782388567924, | |
| "epoch": 3.8110300081103, | |
| "grad_norm": 0.009684202261269093, | |
| "learning_rate": 0.0002, | |
| "loss": 0.629400372505188, | |
| "mean_token_accuracy": 0.7433283776044846, | |
| "num_tokens": 21896486.0, | |
| "step": 590 | |
| }, | |
| { | |
| "entropy": 0.6274826601147652, | |
| "epoch": 3.8175182481751824, | |
| "grad_norm": 0.00968723464757204, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6308175325393677, | |
| "mean_token_accuracy": 0.7409676983952522, | |
| "num_tokens": 21933746.0, | |
| "step": 591 | |
| }, | |
| { | |
| "entropy": 0.607462614774704, | |
| "epoch": 3.824006488240065, | |
| "grad_norm": 0.010024085640907288, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6111215353012085, | |
| "mean_token_accuracy": 0.7507134452462196, | |
| "num_tokens": 21970727.0, | |
| "step": 592 | |
| }, | |
| { | |
| "entropy": 0.6113528236746788, | |
| "epoch": 3.8304947283049473, | |
| "grad_norm": 0.009630702435970306, | |
| "learning_rate": 0.0002, | |
| "loss": 0.615958571434021, | |
| "mean_token_accuracy": 0.7483637630939484, | |
| "num_tokens": 22008126.0, | |
| "step": 593 | |
| }, | |
| { | |
| "entropy": 0.6118894517421722, | |
| "epoch": 3.8369829683698295, | |
| "grad_norm": 0.00891201663762331, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6150209903717041, | |
| "mean_token_accuracy": 0.7505509406328201, | |
| "num_tokens": 22045058.0, | |
| "step": 594 | |
| }, | |
| { | |
| "entropy": 0.6181119605898857, | |
| "epoch": 3.8434712084347122, | |
| "grad_norm": 0.00870099663734436, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6192715764045715, | |
| "mean_token_accuracy": 0.7477136552333832, | |
| "num_tokens": 22082485.0, | |
| "step": 595 | |
| }, | |
| { | |
| "entropy": 0.6250515654683113, | |
| "epoch": 3.8499594484995945, | |
| "grad_norm": 0.00869520753622055, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6237080097198486, | |
| "mean_token_accuracy": 0.7448958083987236, | |
| "num_tokens": 22120186.0, | |
| "step": 596 | |
| }, | |
| { | |
| "entropy": 0.6200907677412033, | |
| "epoch": 3.8564476885644767, | |
| "grad_norm": 0.008723787032067776, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6199079751968384, | |
| "mean_token_accuracy": 0.7453882619738579, | |
| "num_tokens": 22157538.0, | |
| "step": 597 | |
| }, | |
| { | |
| "entropy": 0.6176511943340302, | |
| "epoch": 3.8629359286293594, | |
| "grad_norm": 0.010193057358264923, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6177176237106323, | |
| "mean_token_accuracy": 0.7501931935548782, | |
| "num_tokens": 22195003.0, | |
| "step": 598 | |
| }, | |
| { | |
| "entropy": 0.6236204281449318, | |
| "epoch": 3.8694241686942417, | |
| "grad_norm": 0.00979641918092966, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6303654909133911, | |
| "mean_token_accuracy": 0.7406158596277237, | |
| "num_tokens": 22232607.0, | |
| "step": 599 | |
| }, | |
| { | |
| "entropy": 0.6202436164021492, | |
| "epoch": 3.875912408759124, | |
| "grad_norm": 0.010212398134171963, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6213873028755188, | |
| "mean_token_accuracy": 0.7464328482747078, | |
| "num_tokens": 22269920.0, | |
| "step": 600 | |
| }, | |
| { | |
| "entropy": 0.613631397485733, | |
| "epoch": 3.8824006488240066, | |
| "grad_norm": 0.009876083582639694, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6182212829589844, | |
| "mean_token_accuracy": 0.7480113580822945, | |
| "num_tokens": 22306694.0, | |
| "step": 601 | |
| }, | |
| { | |
| "entropy": 0.6167808622121811, | |
| "epoch": 3.888888888888889, | |
| "grad_norm": 0.010310813784599304, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6251655220985413, | |
| "mean_token_accuracy": 0.7455293834209442, | |
| "num_tokens": 22343827.0, | |
| "step": 602 | |
| }, | |
| { | |
| "entropy": 0.6132790520787239, | |
| "epoch": 3.895377128953771, | |
| "grad_norm": 0.009235870093107224, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6129046678543091, | |
| "mean_token_accuracy": 0.7505499720573425, | |
| "num_tokens": 22381214.0, | |
| "step": 603 | |
| }, | |
| { | |
| "entropy": 0.6209843009710312, | |
| "epoch": 3.9018653690186538, | |
| "grad_norm": 0.009926384314894676, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6192604899406433, | |
| "mean_token_accuracy": 0.7472119927406311, | |
| "num_tokens": 22418601.0, | |
| "step": 604 | |
| }, | |
| { | |
| "entropy": 0.6364298164844513, | |
| "epoch": 3.908353609083536, | |
| "grad_norm": 0.011292664334177971, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6354763507843018, | |
| "mean_token_accuracy": 0.742254801094532, | |
| "num_tokens": 22455732.0, | |
| "step": 605 | |
| }, | |
| { | |
| "entropy": 0.6375604569911957, | |
| "epoch": 3.9148418491484183, | |
| "grad_norm": 0.009769946336746216, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6385936737060547, | |
| "mean_token_accuracy": 0.7394958734512329, | |
| "num_tokens": 22492996.0, | |
| "step": 606 | |
| }, | |
| { | |
| "entropy": 0.6145768612623215, | |
| "epoch": 3.921330089213301, | |
| "grad_norm": 0.010400141589343548, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6150961518287659, | |
| "mean_token_accuracy": 0.7494016960263252, | |
| "num_tokens": 22530887.0, | |
| "step": 607 | |
| }, | |
| { | |
| "entropy": 0.6110121458768845, | |
| "epoch": 3.927818329278183, | |
| "grad_norm": 0.01383623294532299, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6156477332115173, | |
| "mean_token_accuracy": 0.7485735863447189, | |
| "num_tokens": 22568066.0, | |
| "step": 608 | |
| }, | |
| { | |
| "entropy": 0.6164045110344887, | |
| "epoch": 3.9343065693430654, | |
| "grad_norm": 0.011148249730467796, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6243358850479126, | |
| "mean_token_accuracy": 0.7457598373293877, | |
| "num_tokens": 22605687.0, | |
| "step": 609 | |
| }, | |
| { | |
| "entropy": 0.6160785332322121, | |
| "epoch": 3.940794809407948, | |
| "grad_norm": 0.011384137906134129, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6210045218467712, | |
| "mean_token_accuracy": 0.7471992895007133, | |
| "num_tokens": 22642646.0, | |
| "step": 610 | |
| }, | |
| { | |
| "entropy": 0.6149823144078255, | |
| "epoch": 3.9472830494728304, | |
| "grad_norm": 0.012957974337041378, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6171556711196899, | |
| "mean_token_accuracy": 0.7489227131009102, | |
| "num_tokens": 22679842.0, | |
| "step": 611 | |
| }, | |
| { | |
| "entropy": 0.6145467907190323, | |
| "epoch": 3.9537712895377126, | |
| "grad_norm": 0.010933002457022667, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6167636513710022, | |
| "mean_token_accuracy": 0.7463917657732964, | |
| "num_tokens": 22717084.0, | |
| "step": 612 | |
| }, | |
| { | |
| "entropy": 0.6232969015836716, | |
| "epoch": 3.9602595296025953, | |
| "grad_norm": 0.009922384284436703, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6252729892730713, | |
| "mean_token_accuracy": 0.743752971291542, | |
| "num_tokens": 22754399.0, | |
| "step": 613 | |
| }, | |
| { | |
| "entropy": 0.6329927816987038, | |
| "epoch": 3.9667477696674776, | |
| "grad_norm": 0.012450586073100567, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6310559511184692, | |
| "mean_token_accuracy": 0.7443704977631569, | |
| "num_tokens": 22791668.0, | |
| "step": 614 | |
| }, | |
| { | |
| "entropy": 0.6241239309310913, | |
| "epoch": 3.9732360097323602, | |
| "grad_norm": 0.010473434813320637, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6205140352249146, | |
| "mean_token_accuracy": 0.7461888715624809, | |
| "num_tokens": 22829072.0, | |
| "step": 615 | |
| }, | |
| { | |
| "entropy": 0.6387766450643539, | |
| "epoch": 3.9797242497972425, | |
| "grad_norm": 0.011033239774405956, | |
| "learning_rate": 0.0002, | |
| "loss": 0.638136088848114, | |
| "mean_token_accuracy": 0.7390930280089378, | |
| "num_tokens": 22866252.0, | |
| "step": 616 | |
| }, | |
| { | |
| "entropy": 0.6195501312613487, | |
| "epoch": 3.986212489862125, | |
| "grad_norm": 0.011396627873182297, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6249865293502808, | |
| "mean_token_accuracy": 0.7435013577342033, | |
| "num_tokens": 22903910.0, | |
| "step": 617 | |
| }, | |
| { | |
| "entropy": 0.6073991656303406, | |
| "epoch": 3.9927007299270074, | |
| "grad_norm": 0.011404155753552914, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6144699454307556, | |
| "mean_token_accuracy": 0.7486153542995453, | |
| "num_tokens": 22941419.0, | |
| "step": 618 | |
| }, | |
| { | |
| "entropy": 0.6133335530757904, | |
| "epoch": 3.9991889699918897, | |
| "grad_norm": 0.012148975394666195, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6239128112792969, | |
| "mean_token_accuracy": 0.744051106274128, | |
| "num_tokens": 22978672.0, | |
| "step": 619 | |
| }, | |
| { | |
| "entropy": 0.6109002828598022, | |
| "epoch": 4.0, | |
| "grad_norm": 0.02331351302564144, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6144630312919617, | |
| "mean_token_accuracy": 0.7544165849685669, | |
| "num_tokens": 22983289.0, | |
| "step": 620 | |
| }, | |
| { | |
| "entropy": 0.6217539757490158, | |
| "epoch": 4.006488240064883, | |
| "grad_norm": 0.013456643559038639, | |
| "learning_rate": 0.0002, | |
| "loss": 0.613330602645874, | |
| "mean_token_accuracy": 0.7499688565731049, | |
| "num_tokens": 23020412.0, | |
| "step": 621 | |
| }, | |
| { | |
| "entropy": 0.6039147675037384, | |
| "epoch": 4.0129764801297645, | |
| "grad_norm": 0.013175777159631252, | |
| "learning_rate": 0.0002, | |
| "loss": 0.597152829170227, | |
| "mean_token_accuracy": 0.7552643939852715, | |
| "num_tokens": 23057448.0, | |
| "step": 622 | |
| }, | |
| { | |
| "entropy": 0.6142989620566368, | |
| "epoch": 4.019464720194647, | |
| "grad_norm": 0.014114204794168472, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6228339672088623, | |
| "mean_token_accuracy": 0.744938038289547, | |
| "num_tokens": 23094545.0, | |
| "step": 623 | |
| }, | |
| { | |
| "entropy": 0.6015428304672241, | |
| "epoch": 4.02595296025953, | |
| "grad_norm": 0.015099803917109966, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6131606698036194, | |
| "mean_token_accuracy": 0.7470837756991386, | |
| "num_tokens": 23131965.0, | |
| "step": 624 | |
| }, | |
| { | |
| "entropy": 0.5885332375764847, | |
| "epoch": 4.032441200324412, | |
| "grad_norm": 0.014588817954063416, | |
| "learning_rate": 0.0002, | |
| "loss": 0.593397855758667, | |
| "mean_token_accuracy": 0.7566570267081261, | |
| "num_tokens": 23168813.0, | |
| "step": 625 | |
| }, | |
| { | |
| "entropy": 0.6016655787825584, | |
| "epoch": 4.038929440389294, | |
| "grad_norm": 0.012094132602214813, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6046090126037598, | |
| "mean_token_accuracy": 0.7522159889340401, | |
| "num_tokens": 23205779.0, | |
| "step": 626 | |
| }, | |
| { | |
| "entropy": 0.6151943281292915, | |
| "epoch": 4.045417680454177, | |
| "grad_norm": 0.012667203322052956, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6111838221549988, | |
| "mean_token_accuracy": 0.7486316040158272, | |
| "num_tokens": 23242684.0, | |
| "step": 627 | |
| }, | |
| { | |
| "entropy": 0.6105204373598099, | |
| "epoch": 4.051905920519059, | |
| "grad_norm": 0.011044032871723175, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6119928956031799, | |
| "mean_token_accuracy": 0.7496168315410614, | |
| "num_tokens": 23279684.0, | |
| "step": 628 | |
| }, | |
| { | |
| "entropy": 0.6080695539712906, | |
| "epoch": 4.0583941605839415, | |
| "grad_norm": 0.012295052409172058, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6104212999343872, | |
| "mean_token_accuracy": 0.7498067244887352, | |
| "num_tokens": 23316599.0, | |
| "step": 629 | |
| }, | |
| { | |
| "entropy": 0.6009281948208809, | |
| "epoch": 4.064882400648824, | |
| "grad_norm": 0.012583774514496326, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6041219234466553, | |
| "mean_token_accuracy": 0.7518585100769997, | |
| "num_tokens": 23353800.0, | |
| "step": 630 | |
| }, | |
| { | |
| "entropy": 0.6015147417783737, | |
| "epoch": 4.071370640713706, | |
| "grad_norm": 0.011909936554729939, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6030286550521851, | |
| "mean_token_accuracy": 0.7531652525067329, | |
| "num_tokens": 23390939.0, | |
| "step": 631 | |
| }, | |
| { | |
| "entropy": 0.6044563055038452, | |
| "epoch": 4.077858880778589, | |
| "grad_norm": 0.011805822141468525, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6060421466827393, | |
| "mean_token_accuracy": 0.7509199753403664, | |
| "num_tokens": 23427956.0, | |
| "step": 632 | |
| }, | |
| { | |
| "entropy": 0.6049995571374893, | |
| "epoch": 4.084347120843471, | |
| "grad_norm": 0.012876358814537525, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6117682456970215, | |
| "mean_token_accuracy": 0.7485300377011299, | |
| "num_tokens": 23465445.0, | |
| "step": 633 | |
| }, | |
| { | |
| "entropy": 0.6048118397593498, | |
| "epoch": 4.090835360908353, | |
| "grad_norm": 0.012466302141547203, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6076602339744568, | |
| "mean_token_accuracy": 0.7526114881038666, | |
| "num_tokens": 23502361.0, | |
| "step": 634 | |
| }, | |
| { | |
| "entropy": 0.6199515163898468, | |
| "epoch": 4.097323600973236, | |
| "grad_norm": 0.013892917893826962, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6193369626998901, | |
| "mean_token_accuracy": 0.7488663196563721, | |
| "num_tokens": 23540086.0, | |
| "step": 635 | |
| }, | |
| { | |
| "entropy": 0.6109070330858231, | |
| "epoch": 4.103811841038119, | |
| "grad_norm": 0.012778576463460922, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6099793910980225, | |
| "mean_token_accuracy": 0.7521104216575623, | |
| "num_tokens": 23577435.0, | |
| "step": 636 | |
| }, | |
| { | |
| "entropy": 0.6217869147658348, | |
| "epoch": 4.110300081103, | |
| "grad_norm": 0.011083797551691532, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6223993301391602, | |
| "mean_token_accuracy": 0.7441250160336494, | |
| "num_tokens": 23614892.0, | |
| "step": 637 | |
| }, | |
| { | |
| "entropy": 0.6092150881886482, | |
| "epoch": 4.116788321167883, | |
| "grad_norm": 0.011457768268883228, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6109668016433716, | |
| "mean_token_accuracy": 0.7505389377474785, | |
| "num_tokens": 23652404.0, | |
| "step": 638 | |
| }, | |
| { | |
| "entropy": 0.5892162844538689, | |
| "epoch": 4.123276561232766, | |
| "grad_norm": 0.011224270798265934, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5923285484313965, | |
| "mean_token_accuracy": 0.7561718374490738, | |
| "num_tokens": 23689182.0, | |
| "step": 639 | |
| }, | |
| { | |
| "entropy": 0.6155631691217422, | |
| "epoch": 4.1297648012976484, | |
| "grad_norm": 0.011392487213015556, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6169704794883728, | |
| "mean_token_accuracy": 0.7484367191791534, | |
| "num_tokens": 23726827.0, | |
| "step": 640 | |
| }, | |
| { | |
| "entropy": 0.6134647503495216, | |
| "epoch": 4.13625304136253, | |
| "grad_norm": 0.01305895671248436, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6227377653121948, | |
| "mean_token_accuracy": 0.7455505281686783, | |
| "num_tokens": 23764215.0, | |
| "step": 641 | |
| }, | |
| { | |
| "entropy": 0.6127767860889435, | |
| "epoch": 4.142741281427413, | |
| "grad_norm": 0.011744504794478416, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6154167056083679, | |
| "mean_token_accuracy": 0.7480334118008614, | |
| "num_tokens": 23801609.0, | |
| "step": 642 | |
| }, | |
| { | |
| "entropy": 0.6113294437527657, | |
| "epoch": 4.149229521492296, | |
| "grad_norm": 0.013036824762821198, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6141045093536377, | |
| "mean_token_accuracy": 0.7493610754609108, | |
| "num_tokens": 23839155.0, | |
| "step": 643 | |
| }, | |
| { | |
| "entropy": 0.6171691864728928, | |
| "epoch": 4.155717761557177, | |
| "grad_norm": 0.012765160761773586, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6207258701324463, | |
| "mean_token_accuracy": 0.7462699934840202, | |
| "num_tokens": 23876532.0, | |
| "step": 644 | |
| }, | |
| { | |
| "entropy": 0.6020215824246407, | |
| "epoch": 4.16220600162206, | |
| "grad_norm": 0.011224629357457161, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6040517091751099, | |
| "mean_token_accuracy": 0.7520366311073303, | |
| "num_tokens": 23913624.0, | |
| "step": 645 | |
| }, | |
| { | |
| "entropy": 0.6073898002505302, | |
| "epoch": 4.168694241686943, | |
| "grad_norm": 0.012669643387198448, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6089828610420227, | |
| "mean_token_accuracy": 0.751623198390007, | |
| "num_tokens": 23951134.0, | |
| "step": 646 | |
| }, | |
| { | |
| "entropy": 0.6056643575429916, | |
| "epoch": 4.175182481751825, | |
| "grad_norm": 0.013099576346576214, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6066282391548157, | |
| "mean_token_accuracy": 0.7509062737226486, | |
| "num_tokens": 23988712.0, | |
| "step": 647 | |
| }, | |
| { | |
| "entropy": 0.6190872266888618, | |
| "epoch": 4.181670721816707, | |
| "grad_norm": 0.013141883537173271, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6172468662261963, | |
| "mean_token_accuracy": 0.7470818608999252, | |
| "num_tokens": 24025925.0, | |
| "step": 648 | |
| }, | |
| { | |
| "entropy": 0.6018052324652672, | |
| "epoch": 4.18815896188159, | |
| "grad_norm": 0.01188298873603344, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6035501956939697, | |
| "mean_token_accuracy": 0.7526876479387283, | |
| "num_tokens": 24063159.0, | |
| "step": 649 | |
| }, | |
| { | |
| "entropy": 0.6047950685024261, | |
| "epoch": 4.194647201946472, | |
| "grad_norm": 0.014647013507783413, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6088840961456299, | |
| "mean_token_accuracy": 0.7501959800720215, | |
| "num_tokens": 24100259.0, | |
| "step": 650 | |
| }, | |
| { | |
| "entropy": 0.6092503741383553, | |
| "epoch": 4.2011354420113545, | |
| "grad_norm": 0.012967122718691826, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6154978275299072, | |
| "mean_token_accuracy": 0.7469052001833916, | |
| "num_tokens": 24137670.0, | |
| "step": 651 | |
| }, | |
| { | |
| "entropy": 0.6076086908578873, | |
| "epoch": 4.207623682076237, | |
| "grad_norm": 0.015226679854094982, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6063575744628906, | |
| "mean_token_accuracy": 0.7520931884646416, | |
| "num_tokens": 24174990.0, | |
| "step": 652 | |
| }, | |
| { | |
| "entropy": 0.5980376899242401, | |
| "epoch": 4.214111922141119, | |
| "grad_norm": 0.01129455491900444, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5961977243423462, | |
| "mean_token_accuracy": 0.7564675956964493, | |
| "num_tokens": 24212331.0, | |
| "step": 653 | |
| }, | |
| { | |
| "entropy": 0.6016443520784378, | |
| "epoch": 4.220600162206002, | |
| "grad_norm": 0.014820009469985962, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6029236912727356, | |
| "mean_token_accuracy": 0.7525514140725136, | |
| "num_tokens": 24249375.0, | |
| "step": 654 | |
| }, | |
| { | |
| "entropy": 0.6087661758065224, | |
| "epoch": 4.227088402270884, | |
| "grad_norm": 0.0128677599132061, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6112372279167175, | |
| "mean_token_accuracy": 0.748601570725441, | |
| "num_tokens": 24286871.0, | |
| "step": 655 | |
| }, | |
| { | |
| "entropy": 0.615173451602459, | |
| "epoch": 4.233576642335766, | |
| "grad_norm": 0.013609779067337513, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6189801096916199, | |
| "mean_token_accuracy": 0.7472759932279587, | |
| "num_tokens": 24323996.0, | |
| "step": 656 | |
| }, | |
| { | |
| "entropy": 0.6089212968945503, | |
| "epoch": 4.240064882400649, | |
| "grad_norm": 0.013383638113737106, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6078221797943115, | |
| "mean_token_accuracy": 0.7503775134682655, | |
| "num_tokens": 24361162.0, | |
| "step": 657 | |
| }, | |
| { | |
| "entropy": 0.6125769466161728, | |
| "epoch": 4.2465531224655315, | |
| "grad_norm": 0.01211923360824585, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6157176494598389, | |
| "mean_token_accuracy": 0.7472077012062073, | |
| "num_tokens": 24398308.0, | |
| "step": 658 | |
| }, | |
| { | |
| "entropy": 0.6129145845770836, | |
| "epoch": 4.253041362530413, | |
| "grad_norm": 0.013655205257236958, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6173056364059448, | |
| "mean_token_accuracy": 0.7478220462799072, | |
| "num_tokens": 24435361.0, | |
| "step": 659 | |
| }, | |
| { | |
| "entropy": 0.6286280378699303, | |
| "epoch": 4.259529602595296, | |
| "grad_norm": 0.012913207523524761, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6232912540435791, | |
| "mean_token_accuracy": 0.7459053471684456, | |
| "num_tokens": 24472862.0, | |
| "step": 660 | |
| }, | |
| { | |
| "entropy": 0.6073895320296288, | |
| "epoch": 4.266017842660179, | |
| "grad_norm": 0.012715890072286129, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6063985824584961, | |
| "mean_token_accuracy": 0.7502154931426048, | |
| "num_tokens": 24510378.0, | |
| "step": 661 | |
| }, | |
| { | |
| "entropy": 0.5987715944647789, | |
| "epoch": 4.2725060827250605, | |
| "grad_norm": 0.01144983246922493, | |
| "learning_rate": 0.0002, | |
| "loss": 0.603581964969635, | |
| "mean_token_accuracy": 0.7529052719473839, | |
| "num_tokens": 24547450.0, | |
| "step": 662 | |
| }, | |
| { | |
| "entropy": 0.6105594113469124, | |
| "epoch": 4.278994322789943, | |
| "grad_norm": 0.01477118767797947, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6208908557891846, | |
| "mean_token_accuracy": 0.7453452572226524, | |
| "num_tokens": 24584414.0, | |
| "step": 663 | |
| }, | |
| { | |
| "entropy": 0.6013319417834282, | |
| "epoch": 4.285482562854826, | |
| "grad_norm": 0.011751738376915455, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6031821966171265, | |
| "mean_token_accuracy": 0.7529275268316269, | |
| "num_tokens": 24621522.0, | |
| "step": 664 | |
| }, | |
| { | |
| "entropy": 0.6105660572648048, | |
| "epoch": 4.291970802919708, | |
| "grad_norm": 0.011309951543807983, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6077959537506104, | |
| "mean_token_accuracy": 0.7497444152832031, | |
| "num_tokens": 24658985.0, | |
| "step": 665 | |
| }, | |
| { | |
| "entropy": 0.6143631562590599, | |
| "epoch": 4.29845904298459, | |
| "grad_norm": 0.01235566008836031, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6165258884429932, | |
| "mean_token_accuracy": 0.7466364279389381, | |
| "num_tokens": 24696556.0, | |
| "step": 666 | |
| }, | |
| { | |
| "entropy": 0.6108560711145401, | |
| "epoch": 4.304947283049473, | |
| "grad_norm": 0.012649192474782467, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6156973838806152, | |
| "mean_token_accuracy": 0.7493721544742584, | |
| "num_tokens": 24733563.0, | |
| "step": 667 | |
| }, | |
| { | |
| "entropy": 0.5972470939159393, | |
| "epoch": 4.311435523114355, | |
| "grad_norm": 0.012324381619691849, | |
| "learning_rate": 0.0002, | |
| "loss": 0.593143880367279, | |
| "mean_token_accuracy": 0.7569256648421288, | |
| "num_tokens": 24770521.0, | |
| "step": 668 | |
| }, | |
| { | |
| "entropy": 0.6238643601536751, | |
| "epoch": 4.3179237631792375, | |
| "grad_norm": 0.013767421245574951, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6210561990737915, | |
| "mean_token_accuracy": 0.7456039562821388, | |
| "num_tokens": 24807746.0, | |
| "step": 669 | |
| }, | |
| { | |
| "entropy": 0.6074958592653275, | |
| "epoch": 4.32441200324412, | |
| "grad_norm": 0.012642712332308292, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6104567646980286, | |
| "mean_token_accuracy": 0.7498242110013962, | |
| "num_tokens": 24844948.0, | |
| "step": 670 | |
| }, | |
| { | |
| "entropy": 0.6030944362282753, | |
| "epoch": 4.330900243309002, | |
| "grad_norm": 0.014455183409154415, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6104896068572998, | |
| "mean_token_accuracy": 0.751430056989193, | |
| "num_tokens": 24882330.0, | |
| "step": 671 | |
| }, | |
| { | |
| "entropy": 0.6085335910320282, | |
| "epoch": 4.337388483373885, | |
| "grad_norm": 0.012203236110508442, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6149730682373047, | |
| "mean_token_accuracy": 0.748404935002327, | |
| "num_tokens": 24919894.0, | |
| "step": 672 | |
| }, | |
| { | |
| "entropy": 0.6215960904955864, | |
| "epoch": 4.343876723438767, | |
| "grad_norm": 0.01517926249653101, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6182515621185303, | |
| "mean_token_accuracy": 0.7460620552301407, | |
| "num_tokens": 24957338.0, | |
| "step": 673 | |
| }, | |
| { | |
| "entropy": 0.6206786409020424, | |
| "epoch": 4.350364963503649, | |
| "grad_norm": 0.012405015528202057, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6114768385887146, | |
| "mean_token_accuracy": 0.749580554664135, | |
| "num_tokens": 24994430.0, | |
| "step": 674 | |
| }, | |
| { | |
| "entropy": 0.6176847890019417, | |
| "epoch": 4.356853203568532, | |
| "grad_norm": 0.012959569692611694, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6179355382919312, | |
| "mean_token_accuracy": 0.7443158105015755, | |
| "num_tokens": 25031819.0, | |
| "step": 675 | |
| }, | |
| { | |
| "entropy": 0.6137174069881439, | |
| "epoch": 4.363341443633415, | |
| "grad_norm": 0.01568513549864292, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6264492273330688, | |
| "mean_token_accuracy": 0.7434774041175842, | |
| "num_tokens": 25069321.0, | |
| "step": 676 | |
| }, | |
| { | |
| "entropy": 0.6073234900832176, | |
| "epoch": 4.369829683698297, | |
| "grad_norm": 0.01254733745008707, | |
| "learning_rate": 0.0002, | |
| "loss": 0.613095760345459, | |
| "mean_token_accuracy": 0.7486145123839378, | |
| "num_tokens": 25106724.0, | |
| "step": 677 | |
| }, | |
| { | |
| "entropy": 0.6180970370769501, | |
| "epoch": 4.376317923763179, | |
| "grad_norm": 0.01219653245061636, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6162555813789368, | |
| "mean_token_accuracy": 0.7453421652317047, | |
| "num_tokens": 25144301.0, | |
| "step": 678 | |
| }, | |
| { | |
| "entropy": 0.6155680492520332, | |
| "epoch": 4.382806163828062, | |
| "grad_norm": 0.013878269121050835, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6091170907020569, | |
| "mean_token_accuracy": 0.750255212187767, | |
| "num_tokens": 25181210.0, | |
| "step": 679 | |
| }, | |
| { | |
| "entropy": 0.6227680519223213, | |
| "epoch": 4.3892944038929445, | |
| "grad_norm": 0.01349555142223835, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6250801086425781, | |
| "mean_token_accuracy": 0.743384949862957, | |
| "num_tokens": 25218262.0, | |
| "step": 680 | |
| }, | |
| { | |
| "entropy": 0.5870469063520432, | |
| "epoch": 4.395782643957826, | |
| "grad_norm": 0.012459780089557171, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5922443270683289, | |
| "mean_token_accuracy": 0.75776407122612, | |
| "num_tokens": 25255586.0, | |
| "step": 681 | |
| }, | |
| { | |
| "entropy": 0.6126704216003418, | |
| "epoch": 4.402270884022709, | |
| "grad_norm": 0.012495280243456364, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6199891567230225, | |
| "mean_token_accuracy": 0.7477240189909935, | |
| "num_tokens": 25293110.0, | |
| "step": 682 | |
| }, | |
| { | |
| "entropy": 0.6052056401968002, | |
| "epoch": 4.408759124087592, | |
| "grad_norm": 0.011480255052447319, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6054994463920593, | |
| "mean_token_accuracy": 0.7517327517271042, | |
| "num_tokens": 25330240.0, | |
| "step": 683 | |
| }, | |
| { | |
| "entropy": 0.6134005859494209, | |
| "epoch": 4.415247364152473, | |
| "grad_norm": 0.013378560543060303, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6032570600509644, | |
| "mean_token_accuracy": 0.7544484660029411, | |
| "num_tokens": 25367930.0, | |
| "step": 684 | |
| }, | |
| { | |
| "entropy": 0.6132281497120857, | |
| "epoch": 4.421735604217356, | |
| "grad_norm": 0.011817892082035542, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6155675649642944, | |
| "mean_token_accuracy": 0.7474397569894791, | |
| "num_tokens": 25404927.0, | |
| "step": 685 | |
| }, | |
| { | |
| "entropy": 0.6157776713371277, | |
| "epoch": 4.428223844282239, | |
| "grad_norm": 0.013845066539943218, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6208671927452087, | |
| "mean_token_accuracy": 0.7460346668958664, | |
| "num_tokens": 25441808.0, | |
| "step": 686 | |
| }, | |
| { | |
| "entropy": 0.6034616231918335, | |
| "epoch": 4.434712084347121, | |
| "grad_norm": 0.011209644377231598, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6051755547523499, | |
| "mean_token_accuracy": 0.751818560063839, | |
| "num_tokens": 25478982.0, | |
| "step": 687 | |
| }, | |
| { | |
| "entropy": 0.6197097897529602, | |
| "epoch": 4.441200324412003, | |
| "grad_norm": 0.01221329253166914, | |
| "learning_rate": 0.0002, | |
| "loss": 0.624691367149353, | |
| "mean_token_accuracy": 0.743960902094841, | |
| "num_tokens": 25516230.0, | |
| "step": 688 | |
| }, | |
| { | |
| "entropy": 0.6036801412701607, | |
| "epoch": 4.447688564476886, | |
| "grad_norm": 0.011895528994500637, | |
| "learning_rate": 0.0002, | |
| "loss": 0.604611873626709, | |
| "mean_token_accuracy": 0.7565013989806175, | |
| "num_tokens": 25553987.0, | |
| "step": 689 | |
| }, | |
| { | |
| "entropy": 0.6126270368695259, | |
| "epoch": 4.454176804541768, | |
| "grad_norm": 0.014394382014870644, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6157338619232178, | |
| "mean_token_accuracy": 0.7499115914106369, | |
| "num_tokens": 25591126.0, | |
| "step": 690 | |
| }, | |
| { | |
| "entropy": 0.6108303889632225, | |
| "epoch": 4.4606650446066505, | |
| "grad_norm": 0.014680239371955395, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6087052822113037, | |
| "mean_token_accuracy": 0.7516598179936409, | |
| "num_tokens": 25628123.0, | |
| "step": 691 | |
| }, | |
| { | |
| "entropy": 0.6043496802449226, | |
| "epoch": 4.467153284671533, | |
| "grad_norm": 0.013057287782430649, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6059702038764954, | |
| "mean_token_accuracy": 0.7521848082542419, | |
| "num_tokens": 25665273.0, | |
| "step": 692 | |
| }, | |
| { | |
| "entropy": 0.6091088205575943, | |
| "epoch": 4.473641524736415, | |
| "grad_norm": 0.012656234204769135, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6140547394752502, | |
| "mean_token_accuracy": 0.7490741834044456, | |
| "num_tokens": 25702835.0, | |
| "step": 693 | |
| }, | |
| { | |
| "entropy": 0.6054038554430008, | |
| "epoch": 4.480129764801298, | |
| "grad_norm": 0.01144889835268259, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6068828105926514, | |
| "mean_token_accuracy": 0.7513371407985687, | |
| "num_tokens": 25740321.0, | |
| "step": 694 | |
| }, | |
| { | |
| "entropy": 0.6075622960925102, | |
| "epoch": 4.48661800486618, | |
| "grad_norm": 0.014180710539221764, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6113091707229614, | |
| "mean_token_accuracy": 0.7500150203704834, | |
| "num_tokens": 25777354.0, | |
| "step": 695 | |
| }, | |
| { | |
| "entropy": 0.6083768233656883, | |
| "epoch": 4.493106244931062, | |
| "grad_norm": 0.01257058884948492, | |
| "learning_rate": 0.0002, | |
| "loss": 0.613832950592041, | |
| "mean_token_accuracy": 0.7493138536810875, | |
| "num_tokens": 25814766.0, | |
| "step": 696 | |
| }, | |
| { | |
| "entropy": 0.6096158251166344, | |
| "epoch": 4.499594484995945, | |
| "grad_norm": 0.01403698232024908, | |
| "learning_rate": 0.0002, | |
| "loss": 0.606455385684967, | |
| "mean_token_accuracy": 0.751399964094162, | |
| "num_tokens": 25852032.0, | |
| "step": 697 | |
| }, | |
| { | |
| "entropy": 0.61270372569561, | |
| "epoch": 4.5060827250608275, | |
| "grad_norm": 0.013846375048160553, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6081539988517761, | |
| "mean_token_accuracy": 0.7516685873270035, | |
| "num_tokens": 25889272.0, | |
| "step": 698 | |
| }, | |
| { | |
| "entropy": 0.6115692555904388, | |
| "epoch": 4.512570965125709, | |
| "grad_norm": 0.011561271734535694, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6132485866546631, | |
| "mean_token_accuracy": 0.7496950924396515, | |
| "num_tokens": 25926376.0, | |
| "step": 699 | |
| }, | |
| { | |
| "entropy": 0.6165875196456909, | |
| "epoch": 4.519059205190592, | |
| "grad_norm": 0.014013632200658321, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6210501194000244, | |
| "mean_token_accuracy": 0.7466816902160645, | |
| "num_tokens": 25964071.0, | |
| "step": 700 | |
| }, | |
| { | |
| "entropy": 0.6069151386618614, | |
| "epoch": 4.525547445255475, | |
| "grad_norm": 0.01162275206297636, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6112617254257202, | |
| "mean_token_accuracy": 0.7507427483797073, | |
| "num_tokens": 26001770.0, | |
| "step": 701 | |
| }, | |
| { | |
| "entropy": 0.5982604473829269, | |
| "epoch": 4.5320356853203565, | |
| "grad_norm": 0.010527896694839, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5975767374038696, | |
| "mean_token_accuracy": 0.7562049925327301, | |
| "num_tokens": 26038790.0, | |
| "step": 702 | |
| }, | |
| { | |
| "entropy": 0.6178539171814919, | |
| "epoch": 4.538523925385239, | |
| "grad_norm": 0.011301129125058651, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6221362352371216, | |
| "mean_token_accuracy": 0.743792898952961, | |
| "num_tokens": 26076263.0, | |
| "step": 703 | |
| }, | |
| { | |
| "entropy": 0.6195997893810272, | |
| "epoch": 4.545012165450122, | |
| "grad_norm": 0.01180302631109953, | |
| "learning_rate": 0.0002, | |
| "loss": 0.618148922920227, | |
| "mean_token_accuracy": 0.7460778802633286, | |
| "num_tokens": 26113372.0, | |
| "step": 704 | |
| }, | |
| { | |
| "entropy": 0.6094764620065689, | |
| "epoch": 4.551500405515004, | |
| "grad_norm": 0.011488985270261765, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6123408675193787, | |
| "mean_token_accuracy": 0.7495540827512741, | |
| "num_tokens": 26150197.0, | |
| "step": 705 | |
| }, | |
| { | |
| "entropy": 0.6152739748358727, | |
| "epoch": 4.557988645579886, | |
| "grad_norm": 0.011894487775862217, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6184768676757812, | |
| "mean_token_accuracy": 0.7447682395577431, | |
| "num_tokens": 26187580.0, | |
| "step": 706 | |
| }, | |
| { | |
| "entropy": 0.6004127934575081, | |
| "epoch": 4.564476885644769, | |
| "grad_norm": 0.01042366586625576, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6032600402832031, | |
| "mean_token_accuracy": 0.7507253810763359, | |
| "num_tokens": 26224583.0, | |
| "step": 707 | |
| }, | |
| { | |
| "entropy": 0.6170988976955414, | |
| "epoch": 4.570965125709652, | |
| "grad_norm": 0.012767941690981388, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6203943490982056, | |
| "mean_token_accuracy": 0.7446292862296104, | |
| "num_tokens": 26261715.0, | |
| "step": 708 | |
| }, | |
| { | |
| "entropy": 0.6010770201683044, | |
| "epoch": 4.5774533657745335, | |
| "grad_norm": 0.010196649469435215, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6022849082946777, | |
| "mean_token_accuracy": 0.7530830800533295, | |
| "num_tokens": 26298743.0, | |
| "step": 709 | |
| }, | |
| { | |
| "entropy": 0.6049724221229553, | |
| "epoch": 4.583941605839416, | |
| "grad_norm": 0.012646735645830631, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6061745882034302, | |
| "mean_token_accuracy": 0.7506730481982231, | |
| "num_tokens": 26335489.0, | |
| "step": 710 | |
| }, | |
| { | |
| "entropy": 0.6168033257126808, | |
| "epoch": 4.590429845904298, | |
| "grad_norm": 0.013492587953805923, | |
| "learning_rate": 0.0002, | |
| "loss": 0.616999626159668, | |
| "mean_token_accuracy": 0.7479605078697205, | |
| "num_tokens": 26372489.0, | |
| "step": 711 | |
| }, | |
| { | |
| "entropy": 0.6182409450411797, | |
| "epoch": 4.596918085969181, | |
| "grad_norm": 0.010737297125160694, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6131489276885986, | |
| "mean_token_accuracy": 0.7496219426393509, | |
| "num_tokens": 26409535.0, | |
| "step": 712 | |
| }, | |
| { | |
| "entropy": 0.6057656034827232, | |
| "epoch": 4.603406326034063, | |
| "grad_norm": 0.014007823541760445, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6030014753341675, | |
| "mean_token_accuracy": 0.7548240646719933, | |
| "num_tokens": 26446279.0, | |
| "step": 713 | |
| }, | |
| { | |
| "entropy": 0.6160694062709808, | |
| "epoch": 4.609894566098946, | |
| "grad_norm": 0.012945987284183502, | |
| "learning_rate": 0.0002, | |
| "loss": 0.620917558670044, | |
| "mean_token_accuracy": 0.7472490146756172, | |
| "num_tokens": 26483525.0, | |
| "step": 714 | |
| }, | |
| { | |
| "entropy": 0.608958512544632, | |
| "epoch": 4.616382806163828, | |
| "grad_norm": 0.014964601024985313, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6204575300216675, | |
| "mean_token_accuracy": 0.7449859008193016, | |
| "num_tokens": 26520720.0, | |
| "step": 715 | |
| }, | |
| { | |
| "entropy": 0.6118902638554573, | |
| "epoch": 4.622871046228711, | |
| "grad_norm": 0.011436744593083858, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6165215969085693, | |
| "mean_token_accuracy": 0.7477826401591301, | |
| "num_tokens": 26557982.0, | |
| "step": 716 | |
| }, | |
| { | |
| "entropy": 0.6222316101193428, | |
| "epoch": 4.629359286293592, | |
| "grad_norm": 0.011866914108395576, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6159400939941406, | |
| "mean_token_accuracy": 0.7480059117078781, | |
| "num_tokens": 26595389.0, | |
| "step": 717 | |
| }, | |
| { | |
| "entropy": 0.6267769560217857, | |
| "epoch": 4.635847526358475, | |
| "grad_norm": 0.012834588065743446, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6215125322341919, | |
| "mean_token_accuracy": 0.7467430606484413, | |
| "num_tokens": 26632558.0, | |
| "step": 718 | |
| }, | |
| { | |
| "entropy": 0.6167991682887077, | |
| "epoch": 4.642335766423358, | |
| "grad_norm": 0.010781707242131233, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6117191314697266, | |
| "mean_token_accuracy": 0.7489187940955162, | |
| "num_tokens": 26669534.0, | |
| "step": 719 | |
| }, | |
| { | |
| "entropy": 0.608165793120861, | |
| "epoch": 4.6488240064882405, | |
| "grad_norm": 0.013234053738415241, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6105374097824097, | |
| "mean_token_accuracy": 0.7508261948823929, | |
| "num_tokens": 26707068.0, | |
| "step": 720 | |
| }, | |
| { | |
| "entropy": 0.6050869300961494, | |
| "epoch": 4.655312246553122, | |
| "grad_norm": 0.015265488997101784, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6178677082061768, | |
| "mean_token_accuracy": 0.7447132244706154, | |
| "num_tokens": 26744214.0, | |
| "step": 721 | |
| }, | |
| { | |
| "entropy": 0.606209434568882, | |
| "epoch": 4.661800486618005, | |
| "grad_norm": 0.012334835715591908, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6131197214126587, | |
| "mean_token_accuracy": 0.7471205219626427, | |
| "num_tokens": 26781504.0, | |
| "step": 722 | |
| }, | |
| { | |
| "entropy": 0.6154639571905136, | |
| "epoch": 4.668288726682888, | |
| "grad_norm": 0.011331942863762379, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6135961413383484, | |
| "mean_token_accuracy": 0.750006228685379, | |
| "num_tokens": 26818648.0, | |
| "step": 723 | |
| }, | |
| { | |
| "entropy": 0.6127299889922142, | |
| "epoch": 4.674776966747769, | |
| "grad_norm": 0.013016032055020332, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6065088510513306, | |
| "mean_token_accuracy": 0.7515178844332695, | |
| "num_tokens": 26856269.0, | |
| "step": 724 | |
| }, | |
| { | |
| "entropy": 0.6198037564754486, | |
| "epoch": 4.681265206812652, | |
| "grad_norm": 0.010600600391626358, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6175575256347656, | |
| "mean_token_accuracy": 0.748474046587944, | |
| "num_tokens": 26893819.0, | |
| "step": 725 | |
| }, | |
| { | |
| "entropy": 0.6088383719325066, | |
| "epoch": 4.687753446877535, | |
| "grad_norm": 0.012035705149173737, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6124040484428406, | |
| "mean_token_accuracy": 0.7508236169815063, | |
| "num_tokens": 26931388.0, | |
| "step": 726 | |
| }, | |
| { | |
| "entropy": 0.6097267419099808, | |
| "epoch": 4.694241686942417, | |
| "grad_norm": 0.013257896527647972, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6185274720191956, | |
| "mean_token_accuracy": 0.7469557821750641, | |
| "num_tokens": 26968862.0, | |
| "step": 727 | |
| }, | |
| { | |
| "entropy": 0.6031776890158653, | |
| "epoch": 4.700729927007299, | |
| "grad_norm": 0.012637577950954437, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6094907522201538, | |
| "mean_token_accuracy": 0.7504973784089088, | |
| "num_tokens": 27006297.0, | |
| "step": 728 | |
| }, | |
| { | |
| "entropy": 0.6267594248056412, | |
| "epoch": 4.707218167072182, | |
| "grad_norm": 0.012524669989943504, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6284726858139038, | |
| "mean_token_accuracy": 0.74198117852211, | |
| "num_tokens": 27043660.0, | |
| "step": 729 | |
| }, | |
| { | |
| "entropy": 0.6199127435684204, | |
| "epoch": 4.713706407137064, | |
| "grad_norm": 0.011993559077382088, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6179155707359314, | |
| "mean_token_accuracy": 0.7490969151258469, | |
| "num_tokens": 27080997.0, | |
| "step": 730 | |
| }, | |
| { | |
| "entropy": 0.619316965341568, | |
| "epoch": 4.7201946472019465, | |
| "grad_norm": 0.011862427927553654, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6162521839141846, | |
| "mean_token_accuracy": 0.7466591447591782, | |
| "num_tokens": 27118582.0, | |
| "step": 731 | |
| }, | |
| { | |
| "entropy": 0.617161475121975, | |
| "epoch": 4.726682887266829, | |
| "grad_norm": 0.010898209176957607, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6218090057373047, | |
| "mean_token_accuracy": 0.7456279322504997, | |
| "num_tokens": 27155770.0, | |
| "step": 732 | |
| }, | |
| { | |
| "entropy": 0.6097361296415329, | |
| "epoch": 4.733171127331711, | |
| "grad_norm": 0.012140274979174137, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6126585602760315, | |
| "mean_token_accuracy": 0.7512409463524818, | |
| "num_tokens": 27193021.0, | |
| "step": 733 | |
| }, | |
| { | |
| "entropy": 0.5991591587662697, | |
| "epoch": 4.739659367396594, | |
| "grad_norm": 0.011335095390677452, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6005336046218872, | |
| "mean_token_accuracy": 0.7536215856671333, | |
| "num_tokens": 27230104.0, | |
| "step": 734 | |
| }, | |
| { | |
| "entropy": 0.6187688335776329, | |
| "epoch": 4.746147607461476, | |
| "grad_norm": 0.011418522335588932, | |
| "learning_rate": 0.0002, | |
| "loss": 0.619892418384552, | |
| "mean_token_accuracy": 0.7460336685180664, | |
| "num_tokens": 27267697.0, | |
| "step": 735 | |
| }, | |
| { | |
| "entropy": 0.6177256479859352, | |
| "epoch": 4.752635847526358, | |
| "grad_norm": 0.01126981433480978, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6184297204017639, | |
| "mean_token_accuracy": 0.7480708360671997, | |
| "num_tokens": 27304935.0, | |
| "step": 736 | |
| }, | |
| { | |
| "entropy": 0.6365424171090126, | |
| "epoch": 4.759124087591241, | |
| "grad_norm": 0.012852554209530354, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6335437297821045, | |
| "mean_token_accuracy": 0.7411114126443863, | |
| "num_tokens": 27342734.0, | |
| "step": 737 | |
| }, | |
| { | |
| "entropy": 0.6231958642601967, | |
| "epoch": 4.7656123276561235, | |
| "grad_norm": 0.01126949768513441, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6242541670799255, | |
| "mean_token_accuracy": 0.7444687336683273, | |
| "num_tokens": 27380129.0, | |
| "step": 738 | |
| }, | |
| { | |
| "entropy": 0.6135790795087814, | |
| "epoch": 4.772100567721005, | |
| "grad_norm": 0.011775590479373932, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6142154335975647, | |
| "mean_token_accuracy": 0.7484701201319695, | |
| "num_tokens": 27417574.0, | |
| "step": 739 | |
| }, | |
| { | |
| "entropy": 0.5981535315513611, | |
| "epoch": 4.778588807785888, | |
| "grad_norm": 0.012303443625569344, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6043405532836914, | |
| "mean_token_accuracy": 0.7530733942985535, | |
| "num_tokens": 27454673.0, | |
| "step": 740 | |
| }, | |
| { | |
| "entropy": 0.6199762895703316, | |
| "epoch": 4.785077047850771, | |
| "grad_norm": 0.011197846382856369, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6214004158973694, | |
| "mean_token_accuracy": 0.7454070076346397, | |
| "num_tokens": 27492327.0, | |
| "step": 741 | |
| }, | |
| { | |
| "entropy": 0.6030875891447067, | |
| "epoch": 4.7915652879156525, | |
| "grad_norm": 0.012394090183079243, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6037598848342896, | |
| "mean_token_accuracy": 0.7523747533559799, | |
| "num_tokens": 27529616.0, | |
| "step": 742 | |
| }, | |
| { | |
| "entropy": 0.613655112683773, | |
| "epoch": 4.798053527980535, | |
| "grad_norm": 0.010351658798754215, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6146197319030762, | |
| "mean_token_accuracy": 0.7493305876851082, | |
| "num_tokens": 27567467.0, | |
| "step": 743 | |
| }, | |
| { | |
| "entropy": 0.609668679535389, | |
| "epoch": 4.804541768045418, | |
| "grad_norm": 0.010698414407670498, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6130056381225586, | |
| "mean_token_accuracy": 0.749318391084671, | |
| "num_tokens": 27604340.0, | |
| "step": 744 | |
| }, | |
| { | |
| "entropy": 0.6055747121572495, | |
| "epoch": 4.811030008110301, | |
| "grad_norm": 0.011774055659770966, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6064777374267578, | |
| "mean_token_accuracy": 0.7513219490647316, | |
| "num_tokens": 27641869.0, | |
| "step": 745 | |
| }, | |
| { | |
| "entropy": 0.6063344553112984, | |
| "epoch": 4.817518248175182, | |
| "grad_norm": 0.010040192864835262, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6085660457611084, | |
| "mean_token_accuracy": 0.7483800128102303, | |
| "num_tokens": 27678992.0, | |
| "step": 746 | |
| }, | |
| { | |
| "entropy": 0.6175437271595001, | |
| "epoch": 4.824006488240065, | |
| "grad_norm": 0.011712496168911457, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6189186573028564, | |
| "mean_token_accuracy": 0.7486408054828644, | |
| "num_tokens": 27716703.0, | |
| "step": 747 | |
| }, | |
| { | |
| "entropy": 0.6142439544200897, | |
| "epoch": 4.830494728304947, | |
| "grad_norm": 0.012662764638662338, | |
| "learning_rate": 0.0002, | |
| "loss": 0.614926815032959, | |
| "mean_token_accuracy": 0.747495986521244, | |
| "num_tokens": 27754004.0, | |
| "step": 748 | |
| }, | |
| { | |
| "entropy": 0.6087512150406837, | |
| "epoch": 4.8369829683698295, | |
| "grad_norm": 0.010618063621222973, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6098265647888184, | |
| "mean_token_accuracy": 0.7527805492281914, | |
| "num_tokens": 27791212.0, | |
| "step": 749 | |
| }, | |
| { | |
| "entropy": 0.6073944419622421, | |
| "epoch": 4.843471208434712, | |
| "grad_norm": 0.011879456229507923, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6084223389625549, | |
| "mean_token_accuracy": 0.7535420805215836, | |
| "num_tokens": 27828439.0, | |
| "step": 750 | |
| }, | |
| { | |
| "entropy": 0.6072632223367691, | |
| "epoch": 4.849959448499595, | |
| "grad_norm": 0.01333905290812254, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6154837608337402, | |
| "mean_token_accuracy": 0.7462009564042091, | |
| "num_tokens": 27865908.0, | |
| "step": 751 | |
| }, | |
| { | |
| "entropy": 0.6182335615158081, | |
| "epoch": 4.856447688564477, | |
| "grad_norm": 0.012253145687282085, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6162886619567871, | |
| "mean_token_accuracy": 0.7482575252652168, | |
| "num_tokens": 27903553.0, | |
| "step": 752 | |
| }, | |
| { | |
| "entropy": 0.623457059264183, | |
| "epoch": 4.862935928629359, | |
| "grad_norm": 0.012347408570349216, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6175649166107178, | |
| "mean_token_accuracy": 0.7451874390244484, | |
| "num_tokens": 27940745.0, | |
| "step": 753 | |
| }, | |
| { | |
| "entropy": 0.6147228851914406, | |
| "epoch": 4.869424168694241, | |
| "grad_norm": 0.013636295683681965, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6182140111923218, | |
| "mean_token_accuracy": 0.7459222003817558, | |
| "num_tokens": 27977798.0, | |
| "step": 754 | |
| }, | |
| { | |
| "entropy": 0.6009573265910149, | |
| "epoch": 4.875912408759124, | |
| "grad_norm": 0.011285821907222271, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6073520183563232, | |
| "mean_token_accuracy": 0.7508896961808205, | |
| "num_tokens": 28014880.0, | |
| "step": 755 | |
| }, | |
| { | |
| "entropy": 0.5950382575392723, | |
| "epoch": 4.882400648824007, | |
| "grad_norm": 0.011523284018039703, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6006320714950562, | |
| "mean_token_accuracy": 0.7559562996029854, | |
| "num_tokens": 28052148.0, | |
| "step": 756 | |
| }, | |
| { | |
| "entropy": 0.6160282120108604, | |
| "epoch": 4.888888888888889, | |
| "grad_norm": 0.011825107038021088, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6167672872543335, | |
| "mean_token_accuracy": 0.7469073683023453, | |
| "num_tokens": 28089658.0, | |
| "step": 757 | |
| }, | |
| { | |
| "entropy": 0.6171636879444122, | |
| "epoch": 4.895377128953771, | |
| "grad_norm": 0.011352675966918468, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6145755052566528, | |
| "mean_token_accuracy": 0.746620424091816, | |
| "num_tokens": 28127170.0, | |
| "step": 758 | |
| }, | |
| { | |
| "entropy": 0.608257532119751, | |
| "epoch": 4.901865369018654, | |
| "grad_norm": 0.012769036926329136, | |
| "learning_rate": 0.0002, | |
| "loss": 0.609970211982727, | |
| "mean_token_accuracy": 0.7516561150550842, | |
| "num_tokens": 28164347.0, | |
| "step": 759 | |
| }, | |
| { | |
| "entropy": 0.6164683550596237, | |
| "epoch": 4.9083536090835365, | |
| "grad_norm": 0.012305669486522675, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6191939115524292, | |
| "mean_token_accuracy": 0.7453163638710976, | |
| "num_tokens": 28201799.0, | |
| "step": 760 | |
| }, | |
| { | |
| "entropy": 0.614104337990284, | |
| "epoch": 4.914841849148418, | |
| "grad_norm": 0.010976862162351608, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6142949461936951, | |
| "mean_token_accuracy": 0.7480729147791862, | |
| "num_tokens": 28239441.0, | |
| "step": 761 | |
| }, | |
| { | |
| "entropy": 0.5957873240113258, | |
| "epoch": 4.921330089213301, | |
| "grad_norm": 0.011151162907481194, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5960466265678406, | |
| "mean_token_accuracy": 0.7578283548355103, | |
| "num_tokens": 28276966.0, | |
| "step": 762 | |
| }, | |
| { | |
| "entropy": 0.6149696856737137, | |
| "epoch": 4.927818329278184, | |
| "grad_norm": 0.01262627262622118, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6141815185546875, | |
| "mean_token_accuracy": 0.7478419542312622, | |
| "num_tokens": 28314493.0, | |
| "step": 763 | |
| }, | |
| { | |
| "entropy": 0.6079921796917915, | |
| "epoch": 4.934306569343065, | |
| "grad_norm": 0.012012857012450695, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6085329055786133, | |
| "mean_token_accuracy": 0.7516164556145668, | |
| "num_tokens": 28352110.0, | |
| "step": 764 | |
| }, | |
| { | |
| "entropy": 0.606193870306015, | |
| "epoch": 4.940794809407948, | |
| "grad_norm": 0.012743561528623104, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6102321147918701, | |
| "mean_token_accuracy": 0.7491661831736565, | |
| "num_tokens": 28389448.0, | |
| "step": 765 | |
| }, | |
| { | |
| "entropy": 0.6021564230322838, | |
| "epoch": 4.947283049472831, | |
| "grad_norm": 0.011576979421079159, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6045505404472351, | |
| "mean_token_accuracy": 0.7516537830233574, | |
| "num_tokens": 28427005.0, | |
| "step": 766 | |
| }, | |
| { | |
| "entropy": 0.6197597831487656, | |
| "epoch": 4.953771289537713, | |
| "grad_norm": 0.013263656757771969, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6234422922134399, | |
| "mean_token_accuracy": 0.7442535609006882, | |
| "num_tokens": 28464143.0, | |
| "step": 767 | |
| }, | |
| { | |
| "entropy": 0.5995957404375076, | |
| "epoch": 4.960259529602595, | |
| "grad_norm": 0.013597379438579082, | |
| "learning_rate": 0.0002, | |
| "loss": 0.608078122138977, | |
| "mean_token_accuracy": 0.7510829046368599, | |
| "num_tokens": 28501245.0, | |
| "step": 768 | |
| }, | |
| { | |
| "entropy": 0.5990025177598, | |
| "epoch": 4.966747769667478, | |
| "grad_norm": 0.011187846772372723, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6021981835365295, | |
| "mean_token_accuracy": 0.751527689397335, | |
| "num_tokens": 28538395.0, | |
| "step": 769 | |
| }, | |
| { | |
| "entropy": 0.6094980016350746, | |
| "epoch": 4.97323600973236, | |
| "grad_norm": 0.011942482553422451, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6086335182189941, | |
| "mean_token_accuracy": 0.7511740922927856, | |
| "num_tokens": 28575389.0, | |
| "step": 770 | |
| }, | |
| { | |
| "entropy": 0.607696995139122, | |
| "epoch": 4.9797242497972425, | |
| "grad_norm": 0.010719696059823036, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6058928370475769, | |
| "mean_token_accuracy": 0.7512983754277229, | |
| "num_tokens": 28612614.0, | |
| "step": 771 | |
| }, | |
| { | |
| "entropy": 0.6127375960350037, | |
| "epoch": 4.986212489862125, | |
| "grad_norm": 0.011552160605788231, | |
| "learning_rate": 0.0002, | |
| "loss": 0.610999345779419, | |
| "mean_token_accuracy": 0.7520032823085785, | |
| "num_tokens": 28649626.0, | |
| "step": 772 | |
| }, | |
| { | |
| "entropy": 0.6094198897480965, | |
| "epoch": 4.992700729927007, | |
| "grad_norm": 0.010641835629940033, | |
| "learning_rate": 0.0002, | |
| "loss": 0.609566330909729, | |
| "mean_token_accuracy": 0.7494478672742844, | |
| "num_tokens": 28687121.0, | |
| "step": 773 | |
| }, | |
| { | |
| "entropy": 0.6135342344641685, | |
| "epoch": 4.99918896999189, | |
| "grad_norm": 0.010831725783646107, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6144300103187561, | |
| "mean_token_accuracy": 0.7496655061841011, | |
| "num_tokens": 28724466.0, | |
| "step": 774 | |
| }, | |
| { | |
| "entropy": 0.6133913993835449, | |
| "epoch": 5.0, | |
| "grad_norm": 0.025664443150162697, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6142559051513672, | |
| "mean_token_accuracy": 0.7518454194068909, | |
| "num_tokens": 28729104.0, | |
| "step": 775 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 775, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 5, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 2.6824700471332045e+18, | |
| "train_batch_size": 4, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |