Instructions to use eac123/qwen14b-subliminal-learning-persona-sarcasm with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use eac123/qwen14b-subliminal-learning-persona-sarcasm with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen2.5-14B-Instruct") model = PeftModel.from_pretrained(base_model, "eac123/qwen14b-subliminal-learning-persona-sarcasm") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 5.0, | |
| "eval_steps": 500, | |
| "global_step": 770, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 1.1441087871789932, | |
| "epoch": 0.006498781478472786, | |
| "grad_norm": 0.22594086825847626, | |
| "learning_rate": 0.0002, | |
| "loss": 2.612501859664917, | |
| "mean_token_accuracy": 0.5085290372371674, | |
| "num_tokens": 37502.0, | |
| "step": 1 | |
| }, | |
| { | |
| "entropy": 1.2685535103082657, | |
| "epoch": 0.012997562956945572, | |
| "grad_norm": 0.1942373365163803, | |
| "learning_rate": 0.0002, | |
| "loss": 2.2667126655578613, | |
| "mean_token_accuracy": 0.5350659266114235, | |
| "num_tokens": 75406.0, | |
| "step": 2 | |
| }, | |
| { | |
| "entropy": 1.4654520899057388, | |
| "epoch": 0.01949634443541836, | |
| "grad_norm": 0.13897432386875153, | |
| "learning_rate": 0.0002, | |
| "loss": 1.8304898738861084, | |
| "mean_token_accuracy": 0.5590623021125793, | |
| "num_tokens": 112903.0, | |
| "step": 3 | |
| }, | |
| { | |
| "entropy": 1.4532236605882645, | |
| "epoch": 0.025995125913891144, | |
| "grad_norm": 0.11201836168766022, | |
| "learning_rate": 0.0002, | |
| "loss": 1.496299147605896, | |
| "mean_token_accuracy": 0.6046230122447014, | |
| "num_tokens": 150359.0, | |
| "step": 4 | |
| }, | |
| { | |
| "entropy": 1.4331371188163757, | |
| "epoch": 0.03249390739236393, | |
| "grad_norm": 0.14954882860183716, | |
| "learning_rate": 0.0002, | |
| "loss": 1.3865656852722168, | |
| "mean_token_accuracy": 0.6091600209474564, | |
| "num_tokens": 187830.0, | |
| "step": 5 | |
| }, | |
| { | |
| "entropy": 1.3669009655714035, | |
| "epoch": 0.03899268887083672, | |
| "grad_norm": 0.09565649181604385, | |
| "learning_rate": 0.0002, | |
| "loss": 1.2659735679626465, | |
| "mean_token_accuracy": 0.6358497440814972, | |
| "num_tokens": 225297.0, | |
| "step": 6 | |
| }, | |
| { | |
| "entropy": 1.2914617359638214, | |
| "epoch": 0.045491470349309504, | |
| "grad_norm": 0.0539422333240509, | |
| "learning_rate": 0.0002, | |
| "loss": 1.1662700176239014, | |
| "mean_token_accuracy": 0.6492680311203003, | |
| "num_tokens": 262906.0, | |
| "step": 7 | |
| }, | |
| { | |
| "entropy": 1.249274119734764, | |
| "epoch": 0.05199025182778229, | |
| "grad_norm": 0.051388416439294815, | |
| "learning_rate": 0.0002, | |
| "loss": 1.1255854368209839, | |
| "mean_token_accuracy": 0.6475581750273705, | |
| "num_tokens": 300403.0, | |
| "step": 8 | |
| }, | |
| { | |
| "entropy": 1.1595238000154495, | |
| "epoch": 0.05848903330625508, | |
| "grad_norm": 0.057235199958086014, | |
| "learning_rate": 0.0002, | |
| "loss": 1.0490708351135254, | |
| "mean_token_accuracy": 0.6654231324791908, | |
| "num_tokens": 337487.0, | |
| "step": 9 | |
| }, | |
| { | |
| "entropy": 1.0685205161571503, | |
| "epoch": 0.06498781478472786, | |
| "grad_norm": 0.0577155165374279, | |
| "learning_rate": 0.0002, | |
| "loss": 0.97551429271698, | |
| "mean_token_accuracy": 0.6776877418160439, | |
| "num_tokens": 374847.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 0.9968453124165535, | |
| "epoch": 0.07148659626320066, | |
| "grad_norm": 0.04976983740925789, | |
| "learning_rate": 0.0002, | |
| "loss": 0.9292951822280884, | |
| "mean_token_accuracy": 0.6831405088305473, | |
| "num_tokens": 412186.0, | |
| "step": 11 | |
| }, | |
| { | |
| "entropy": 0.9424244612455368, | |
| "epoch": 0.07798537774167344, | |
| "grad_norm": 0.37462693452835083, | |
| "learning_rate": 0.0002, | |
| "loss": 0.8883110284805298, | |
| "mean_token_accuracy": 0.6893546730279922, | |
| "num_tokens": 449659.0, | |
| "step": 12 | |
| }, | |
| { | |
| "entropy": 0.9025738090276718, | |
| "epoch": 0.08448415922014622, | |
| "grad_norm": 0.04783688113093376, | |
| "learning_rate": 0.0002, | |
| "loss": 0.8548192977905273, | |
| "mean_token_accuracy": 0.6972228810191154, | |
| "num_tokens": 487236.0, | |
| "step": 13 | |
| }, | |
| { | |
| "entropy": 0.8390183448791504, | |
| "epoch": 0.09098294069861901, | |
| "grad_norm": 0.06745485961437225, | |
| "learning_rate": 0.0002, | |
| "loss": 0.8280504941940308, | |
| "mean_token_accuracy": 0.7010790929198265, | |
| "num_tokens": 524798.0, | |
| "step": 14 | |
| }, | |
| { | |
| "entropy": 0.7939982861280441, | |
| "epoch": 0.09748172217709179, | |
| "grad_norm": 0.10931341350078583, | |
| "learning_rate": 0.0002, | |
| "loss": 0.8073402643203735, | |
| "mean_token_accuracy": 0.702845998108387, | |
| "num_tokens": 561826.0, | |
| "step": 15 | |
| }, | |
| { | |
| "entropy": 0.762756697833538, | |
| "epoch": 0.10398050365556458, | |
| "grad_norm": 0.03783512860536575, | |
| "learning_rate": 0.0002, | |
| "loss": 0.7596306800842285, | |
| "mean_token_accuracy": 0.7148320376873016, | |
| "num_tokens": 599249.0, | |
| "step": 16 | |
| }, | |
| { | |
| "entropy": 0.7585324719548225, | |
| "epoch": 0.11047928513403736, | |
| "grad_norm": 0.039289139211177826, | |
| "learning_rate": 0.0002, | |
| "loss": 0.7472726106643677, | |
| "mean_token_accuracy": 0.7169229537248611, | |
| "num_tokens": 636495.0, | |
| "step": 17 | |
| }, | |
| { | |
| "entropy": 0.7434245273470879, | |
| "epoch": 0.11697806661251016, | |
| "grad_norm": 0.04286178946495056, | |
| "learning_rate": 0.0002, | |
| "loss": 0.7349382638931274, | |
| "mean_token_accuracy": 0.7195246070623398, | |
| "num_tokens": 674172.0, | |
| "step": 18 | |
| }, | |
| { | |
| "entropy": 0.7307169139385223, | |
| "epoch": 0.12347684809098294, | |
| "grad_norm": 0.03696495294570923, | |
| "learning_rate": 0.0002, | |
| "loss": 0.7205268144607544, | |
| "mean_token_accuracy": 0.7222909703850746, | |
| "num_tokens": 711746.0, | |
| "step": 19 | |
| }, | |
| { | |
| "entropy": 0.724890224635601, | |
| "epoch": 0.12997562956945571, | |
| "grad_norm": 0.03647635132074356, | |
| "learning_rate": 0.0002, | |
| "loss": 0.7131904363632202, | |
| "mean_token_accuracy": 0.7218770682811737, | |
| "num_tokens": 748966.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 0.7279537171125412, | |
| "epoch": 0.1364744110479285, | |
| "grad_norm": 0.033042650669813156, | |
| "learning_rate": 0.0002, | |
| "loss": 0.7094431519508362, | |
| "mean_token_accuracy": 0.7240697368979454, | |
| "num_tokens": 786631.0, | |
| "step": 21 | |
| }, | |
| { | |
| "entropy": 0.7210045382380486, | |
| "epoch": 0.1429731925264013, | |
| "grad_norm": 0.033061351627111435, | |
| "learning_rate": 0.0002, | |
| "loss": 0.7019110918045044, | |
| "mean_token_accuracy": 0.7280351296067238, | |
| "num_tokens": 823906.0, | |
| "step": 22 | |
| }, | |
| { | |
| "entropy": 0.6902946382761002, | |
| "epoch": 0.14947197400487408, | |
| "grad_norm": 0.03491866961121559, | |
| "learning_rate": 0.0002, | |
| "loss": 0.683687150478363, | |
| "mean_token_accuracy": 0.7348670437932014, | |
| "num_tokens": 860977.0, | |
| "step": 23 | |
| }, | |
| { | |
| "entropy": 0.6839202269911766, | |
| "epoch": 0.15597075548334688, | |
| "grad_norm": 0.030243346467614174, | |
| "learning_rate": 0.0002, | |
| "loss": 0.673778772354126, | |
| "mean_token_accuracy": 0.7354807555675507, | |
| "num_tokens": 898933.0, | |
| "step": 24 | |
| }, | |
| { | |
| "entropy": 0.6664924547076225, | |
| "epoch": 0.16246953696181965, | |
| "grad_norm": 0.026247479021549225, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6572352051734924, | |
| "mean_token_accuracy": 0.7394573912024498, | |
| "num_tokens": 935795.0, | |
| "step": 25 | |
| }, | |
| { | |
| "entropy": 0.6681515946984291, | |
| "epoch": 0.16896831844029245, | |
| "grad_norm": 0.03119724616408348, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6646086573600769, | |
| "mean_token_accuracy": 0.7379100769758224, | |
| "num_tokens": 973280.0, | |
| "step": 26 | |
| }, | |
| { | |
| "entropy": 0.6617112681269646, | |
| "epoch": 0.17546709991876522, | |
| "grad_norm": 0.031551606953144073, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6585603952407837, | |
| "mean_token_accuracy": 0.7389705181121826, | |
| "num_tokens": 1010622.0, | |
| "step": 27 | |
| }, | |
| { | |
| "entropy": 0.6501665636897087, | |
| "epoch": 0.18196588139723802, | |
| "grad_norm": 0.02211320586502552, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6490904092788696, | |
| "mean_token_accuracy": 0.7440381571650505, | |
| "num_tokens": 1047900.0, | |
| "step": 28 | |
| }, | |
| { | |
| "entropy": 0.6470993533730507, | |
| "epoch": 0.18846466287571081, | |
| "grad_norm": 0.027688423171639442, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6543895602226257, | |
| "mean_token_accuracy": 0.7402380779385567, | |
| "num_tokens": 1085392.0, | |
| "step": 29 | |
| }, | |
| { | |
| "entropy": 0.6416624039411545, | |
| "epoch": 0.19496344435418358, | |
| "grad_norm": 0.025217361748218536, | |
| "learning_rate": 0.0002, | |
| "loss": 0.651384711265564, | |
| "mean_token_accuracy": 0.7433382496237755, | |
| "num_tokens": 1122465.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 0.6523652598261833, | |
| "epoch": 0.20146222583265638, | |
| "grad_norm": 0.025227373465895653, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6592613458633423, | |
| "mean_token_accuracy": 0.7378358989953995, | |
| "num_tokens": 1160451.0, | |
| "step": 31 | |
| }, | |
| { | |
| "entropy": 0.6369072422385216, | |
| "epoch": 0.20796100731112915, | |
| "grad_norm": 0.021375838667154312, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6419180631637573, | |
| "mean_token_accuracy": 0.7449744045734406, | |
| "num_tokens": 1198041.0, | |
| "step": 32 | |
| }, | |
| { | |
| "entropy": 0.6256191805005074, | |
| "epoch": 0.21445978878960195, | |
| "grad_norm": 0.03092559427022934, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6407320499420166, | |
| "mean_token_accuracy": 0.7460681945085526, | |
| "num_tokens": 1235291.0, | |
| "step": 33 | |
| }, | |
| { | |
| "entropy": 0.6299648508429527, | |
| "epoch": 0.22095857026807472, | |
| "grad_norm": 0.021124541759490967, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6359473466873169, | |
| "mean_token_accuracy": 0.7471542730927467, | |
| "num_tokens": 1272686.0, | |
| "step": 34 | |
| }, | |
| { | |
| "entropy": 0.6513500586152077, | |
| "epoch": 0.22745735174654752, | |
| "grad_norm": 0.020855363458395004, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6451584100723267, | |
| "mean_token_accuracy": 0.7422506660223007, | |
| "num_tokens": 1310182.0, | |
| "step": 35 | |
| }, | |
| { | |
| "entropy": 0.6261186450719833, | |
| "epoch": 0.23395613322502032, | |
| "grad_norm": 0.019606754183769226, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6181178092956543, | |
| "mean_token_accuracy": 0.7557711079716682, | |
| "num_tokens": 1347558.0, | |
| "step": 36 | |
| }, | |
| { | |
| "entropy": 0.6535262390971184, | |
| "epoch": 0.2404549147034931, | |
| "grad_norm": 0.016229776665568352, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6474911570549011, | |
| "mean_token_accuracy": 0.7401541844010353, | |
| "num_tokens": 1385217.0, | |
| "step": 37 | |
| }, | |
| { | |
| "entropy": 0.6392895579338074, | |
| "epoch": 0.2469536961819659, | |
| "grad_norm": 0.01589571312069893, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6345689296722412, | |
| "mean_token_accuracy": 0.7464647218585014, | |
| "num_tokens": 1422439.0, | |
| "step": 38 | |
| }, | |
| { | |
| "entropy": 0.6444704979658127, | |
| "epoch": 0.25345247766043866, | |
| "grad_norm": 0.019169991835951805, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6417882442474365, | |
| "mean_token_accuracy": 0.7431693077087402, | |
| "num_tokens": 1459951.0, | |
| "step": 39 | |
| }, | |
| { | |
| "entropy": 0.6366401016712189, | |
| "epoch": 0.25995125913891143, | |
| "grad_norm": 0.016541991382837296, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6387360095977783, | |
| "mean_token_accuracy": 0.7458900958299637, | |
| "num_tokens": 1497263.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 0.6309419572353363, | |
| "epoch": 0.26645004061738425, | |
| "grad_norm": 0.02144729532301426, | |
| "learning_rate": 0.0002, | |
| "loss": 0.635954737663269, | |
| "mean_token_accuracy": 0.7469696402549744, | |
| "num_tokens": 1534631.0, | |
| "step": 41 | |
| }, | |
| { | |
| "entropy": 0.6426582857966423, | |
| "epoch": 0.272948822095857, | |
| "grad_norm": 0.017918268218636513, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6445891261100769, | |
| "mean_token_accuracy": 0.7427951768040657, | |
| "num_tokens": 1572110.0, | |
| "step": 42 | |
| }, | |
| { | |
| "entropy": 0.6238497421145439, | |
| "epoch": 0.2794476035743298, | |
| "grad_norm": 0.016322394832968712, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6238967180252075, | |
| "mean_token_accuracy": 0.7503543570637703, | |
| "num_tokens": 1608997.0, | |
| "step": 43 | |
| }, | |
| { | |
| "entropy": 0.6374280378222466, | |
| "epoch": 0.2859463850528026, | |
| "grad_norm": 0.0153085608035326, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6364343762397766, | |
| "mean_token_accuracy": 0.745714507997036, | |
| "num_tokens": 1646556.0, | |
| "step": 44 | |
| }, | |
| { | |
| "entropy": 0.6222607344388962, | |
| "epoch": 0.2924451665312754, | |
| "grad_norm": 0.016996094956994057, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6201090812683105, | |
| "mean_token_accuracy": 0.7516758143901825, | |
| "num_tokens": 1683700.0, | |
| "step": 45 | |
| }, | |
| { | |
| "entropy": 0.636712834239006, | |
| "epoch": 0.29894394800974816, | |
| "grad_norm": 0.016749687492847443, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6368897557258606, | |
| "mean_token_accuracy": 0.746493011713028, | |
| "num_tokens": 1720661.0, | |
| "step": 46 | |
| }, | |
| { | |
| "entropy": 0.6459397748112679, | |
| "epoch": 0.30544272948822093, | |
| "grad_norm": 0.011651836335659027, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6419233083724976, | |
| "mean_token_accuracy": 0.7443490549921989, | |
| "num_tokens": 1758131.0, | |
| "step": 47 | |
| }, | |
| { | |
| "entropy": 0.6379885226488113, | |
| "epoch": 0.31194151096669376, | |
| "grad_norm": 0.013901753351092339, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6361222267150879, | |
| "mean_token_accuracy": 0.746205136179924, | |
| "num_tokens": 1795397.0, | |
| "step": 48 | |
| }, | |
| { | |
| "entropy": 0.6377697363495827, | |
| "epoch": 0.31844029244516653, | |
| "grad_norm": 0.014066919684410095, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6356197595596313, | |
| "mean_token_accuracy": 0.7455531656742096, | |
| "num_tokens": 1832991.0, | |
| "step": 49 | |
| }, | |
| { | |
| "entropy": 0.6351528614759445, | |
| "epoch": 0.3249390739236393, | |
| "grad_norm": 0.013286196626722813, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6371215581893921, | |
| "mean_token_accuracy": 0.7454295605421066, | |
| "num_tokens": 1870273.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 0.6069519519805908, | |
| "epoch": 0.3314378554021121, | |
| "grad_norm": 0.013732723891735077, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6103472709655762, | |
| "mean_token_accuracy": 0.7536283582448959, | |
| "num_tokens": 1907528.0, | |
| "step": 51 | |
| }, | |
| { | |
| "entropy": 0.6297546997666359, | |
| "epoch": 0.3379366368805849, | |
| "grad_norm": 0.013711776584386826, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6334048509597778, | |
| "mean_token_accuracy": 0.745865486562252, | |
| "num_tokens": 1945255.0, | |
| "step": 52 | |
| }, | |
| { | |
| "entropy": 0.6280607059597969, | |
| "epoch": 0.34443541835905767, | |
| "grad_norm": 0.01293123047798872, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6310492753982544, | |
| "mean_token_accuracy": 0.7467462942004204, | |
| "num_tokens": 1982630.0, | |
| "step": 53 | |
| }, | |
| { | |
| "entropy": 0.6271316409111023, | |
| "epoch": 0.35093419983753044, | |
| "grad_norm": 0.01478263083845377, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6254487037658691, | |
| "mean_token_accuracy": 0.7497461065649986, | |
| "num_tokens": 2020399.0, | |
| "step": 54 | |
| }, | |
| { | |
| "entropy": 0.6377271711826324, | |
| "epoch": 0.35743298131600326, | |
| "grad_norm": 0.013956044800579548, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6360988020896912, | |
| "mean_token_accuracy": 0.7437145560979843, | |
| "num_tokens": 2057803.0, | |
| "step": 55 | |
| }, | |
| { | |
| "entropy": 0.6247914582490921, | |
| "epoch": 0.36393176279447603, | |
| "grad_norm": 0.014322548173367977, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6240888833999634, | |
| "mean_token_accuracy": 0.7484056130051613, | |
| "num_tokens": 2094784.0, | |
| "step": 56 | |
| }, | |
| { | |
| "entropy": 0.6302464827895164, | |
| "epoch": 0.3704305442729488, | |
| "grad_norm": 0.011746145784854889, | |
| "learning_rate": 0.0002, | |
| "loss": 0.633884608745575, | |
| "mean_token_accuracy": 0.7437854781746864, | |
| "num_tokens": 2132466.0, | |
| "step": 57 | |
| }, | |
| { | |
| "entropy": 0.6274847015738487, | |
| "epoch": 0.37692932575142163, | |
| "grad_norm": 0.013853202573955059, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6355714797973633, | |
| "mean_token_accuracy": 0.7430111691355705, | |
| "num_tokens": 2169906.0, | |
| "step": 58 | |
| }, | |
| { | |
| "entropy": 0.6265148296952248, | |
| "epoch": 0.3834281072298944, | |
| "grad_norm": 0.01277268398553133, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6335763335227966, | |
| "mean_token_accuracy": 0.7446934059262276, | |
| "num_tokens": 2207365.0, | |
| "step": 59 | |
| }, | |
| { | |
| "entropy": 0.6214065626263618, | |
| "epoch": 0.38992688870836717, | |
| "grad_norm": 0.010742721147835255, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6200428009033203, | |
| "mean_token_accuracy": 0.748136468231678, | |
| "num_tokens": 2244334.0, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 0.6408857852220535, | |
| "epoch": 0.39642567018683994, | |
| "grad_norm": 0.011468583717942238, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6358450651168823, | |
| "mean_token_accuracy": 0.7437937930226326, | |
| "num_tokens": 2281670.0, | |
| "step": 61 | |
| }, | |
| { | |
| "entropy": 0.6396703198552132, | |
| "epoch": 0.40292445166531277, | |
| "grad_norm": 0.011673662811517715, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6363998651504517, | |
| "mean_token_accuracy": 0.7431989163160324, | |
| "num_tokens": 2318924.0, | |
| "step": 62 | |
| }, | |
| { | |
| "entropy": 0.6249052062630653, | |
| "epoch": 0.40942323314378554, | |
| "grad_norm": 0.0118953175842762, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6213114261627197, | |
| "mean_token_accuracy": 0.7500982582569122, | |
| "num_tokens": 2356317.0, | |
| "step": 63 | |
| }, | |
| { | |
| "entropy": 0.6271346360445023, | |
| "epoch": 0.4159220146222583, | |
| "grad_norm": 0.012425282970070839, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6213847398757935, | |
| "mean_token_accuracy": 0.7495132237672806, | |
| "num_tokens": 2393601.0, | |
| "step": 64 | |
| }, | |
| { | |
| "entropy": 0.629973016679287, | |
| "epoch": 0.42242079610073113, | |
| "grad_norm": 0.011852126568555832, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6328772306442261, | |
| "mean_token_accuracy": 0.7433357834815979, | |
| "num_tokens": 2430713.0, | |
| "step": 65 | |
| }, | |
| { | |
| "entropy": 0.625373125076294, | |
| "epoch": 0.4289195775792039, | |
| "grad_norm": 0.011082636192440987, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6278108954429626, | |
| "mean_token_accuracy": 0.7462311089038849, | |
| "num_tokens": 2468332.0, | |
| "step": 66 | |
| }, | |
| { | |
| "entropy": 0.6213006973266602, | |
| "epoch": 0.4354183590576767, | |
| "grad_norm": 0.012099278159439564, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6325806975364685, | |
| "mean_token_accuracy": 0.748037800192833, | |
| "num_tokens": 2505751.0, | |
| "step": 67 | |
| }, | |
| { | |
| "entropy": 0.6149301454424858, | |
| "epoch": 0.44191714053614944, | |
| "grad_norm": 0.011624482460319996, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6194391250610352, | |
| "mean_token_accuracy": 0.7509394213557243, | |
| "num_tokens": 2543314.0, | |
| "step": 68 | |
| }, | |
| { | |
| "entropy": 0.6199035122990608, | |
| "epoch": 0.44841592201462227, | |
| "grad_norm": 0.010423528961837292, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6224488615989685, | |
| "mean_token_accuracy": 0.749529704451561, | |
| "num_tokens": 2580776.0, | |
| "step": 69 | |
| }, | |
| { | |
| "entropy": 0.6317284181714058, | |
| "epoch": 0.45491470349309504, | |
| "grad_norm": 0.010865025222301483, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6270354986190796, | |
| "mean_token_accuracy": 0.7461089566349983, | |
| "num_tokens": 2618167.0, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 0.6248530969023705, | |
| "epoch": 0.4614134849715678, | |
| "grad_norm": 0.010545512661337852, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6243047714233398, | |
| "mean_token_accuracy": 0.7491967007517815, | |
| "num_tokens": 2655748.0, | |
| "step": 71 | |
| }, | |
| { | |
| "entropy": 0.6242939457297325, | |
| "epoch": 0.46791226645004064, | |
| "grad_norm": 0.01175450999289751, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6177983283996582, | |
| "mean_token_accuracy": 0.7500801458954811, | |
| "num_tokens": 2693338.0, | |
| "step": 72 | |
| }, | |
| { | |
| "entropy": 0.6458104699850082, | |
| "epoch": 0.4744110479285134, | |
| "grad_norm": 0.009623173624277115, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6407941579818726, | |
| "mean_token_accuracy": 0.7437473684549332, | |
| "num_tokens": 2730673.0, | |
| "step": 73 | |
| }, | |
| { | |
| "entropy": 0.6289036273956299, | |
| "epoch": 0.4809098294069862, | |
| "grad_norm": 0.010831008665263653, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6292392015457153, | |
| "mean_token_accuracy": 0.749647282063961, | |
| "num_tokens": 2768101.0, | |
| "step": 74 | |
| }, | |
| { | |
| "entropy": 0.6329901814460754, | |
| "epoch": 0.487408610885459, | |
| "grad_norm": 0.013034787029027939, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6349586248397827, | |
| "mean_token_accuracy": 0.7437526881694794, | |
| "num_tokens": 2805877.0, | |
| "step": 75 | |
| }, | |
| { | |
| "entropy": 0.6201201230287552, | |
| "epoch": 0.4939073923639318, | |
| "grad_norm": 0.010362153872847557, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6222230195999146, | |
| "mean_token_accuracy": 0.749205470085144, | |
| "num_tokens": 2843002.0, | |
| "step": 76 | |
| }, | |
| { | |
| "entropy": 0.6270335763692856, | |
| "epoch": 0.5004061738424046, | |
| "grad_norm": 0.01038055308163166, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6268460154533386, | |
| "mean_token_accuracy": 0.7455538734793663, | |
| "num_tokens": 2880433.0, | |
| "step": 77 | |
| }, | |
| { | |
| "entropy": 0.6266148760914803, | |
| "epoch": 0.5069049553208773, | |
| "grad_norm": 0.011833865195512772, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6316983699798584, | |
| "mean_token_accuracy": 0.7472645714879036, | |
| "num_tokens": 2917833.0, | |
| "step": 78 | |
| }, | |
| { | |
| "entropy": 0.6177176311612129, | |
| "epoch": 0.5134037367993501, | |
| "grad_norm": 0.012312863022089005, | |
| "learning_rate": 0.0002, | |
| "loss": 0.620547890663147, | |
| "mean_token_accuracy": 0.7489045560359955, | |
| "num_tokens": 2955261.0, | |
| "step": 79 | |
| }, | |
| { | |
| "entropy": 0.6255826130509377, | |
| "epoch": 0.5199025182778229, | |
| "grad_norm": 0.011764319613575935, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6278033256530762, | |
| "mean_token_accuracy": 0.7475135996937752, | |
| "num_tokens": 2992205.0, | |
| "step": 80 | |
| }, | |
| { | |
| "entropy": 0.6303588896989822, | |
| "epoch": 0.5264012997562957, | |
| "grad_norm": 0.01056460291147232, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6343796253204346, | |
| "mean_token_accuracy": 0.7422873452305794, | |
| "num_tokens": 3029696.0, | |
| "step": 81 | |
| }, | |
| { | |
| "entropy": 0.6168110445141792, | |
| "epoch": 0.5329000812347685, | |
| "grad_norm": 0.010063163004815578, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6208071112632751, | |
| "mean_token_accuracy": 0.7490193694829941, | |
| "num_tokens": 3067080.0, | |
| "step": 82 | |
| }, | |
| { | |
| "entropy": 0.6252159550786018, | |
| "epoch": 0.5393988627132412, | |
| "grad_norm": 0.010448803193867207, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6253081560134888, | |
| "mean_token_accuracy": 0.7478374615311623, | |
| "num_tokens": 3104286.0, | |
| "step": 83 | |
| }, | |
| { | |
| "entropy": 0.6273334473371506, | |
| "epoch": 0.545897644191714, | |
| "grad_norm": 0.010500379838049412, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6298959255218506, | |
| "mean_token_accuracy": 0.7449745014309883, | |
| "num_tokens": 3141685.0, | |
| "step": 84 | |
| }, | |
| { | |
| "entropy": 0.6271170675754547, | |
| "epoch": 0.5523964256701869, | |
| "grad_norm": 0.011779806576669216, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6241638660430908, | |
| "mean_token_accuracy": 0.7471632659435272, | |
| "num_tokens": 3178925.0, | |
| "step": 85 | |
| }, | |
| { | |
| "entropy": 0.6358036622405052, | |
| "epoch": 0.5588952071486596, | |
| "grad_norm": 0.010791173204779625, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6331329941749573, | |
| "mean_token_accuracy": 0.7441665381193161, | |
| "num_tokens": 3216076.0, | |
| "step": 86 | |
| }, | |
| { | |
| "entropy": 0.6320113763213158, | |
| "epoch": 0.5653939886271324, | |
| "grad_norm": 0.009891759604215622, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6326582431793213, | |
| "mean_token_accuracy": 0.7445697784423828, | |
| "num_tokens": 3253700.0, | |
| "step": 87 | |
| }, | |
| { | |
| "entropy": 0.6250990331172943, | |
| "epoch": 0.5718927701056052, | |
| "grad_norm": 0.013541702181100845, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6289629936218262, | |
| "mean_token_accuracy": 0.745047003030777, | |
| "num_tokens": 3291250.0, | |
| "step": 88 | |
| }, | |
| { | |
| "entropy": 0.6287946552038193, | |
| "epoch": 0.578391551584078, | |
| "grad_norm": 0.009651604108512402, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6300573348999023, | |
| "mean_token_accuracy": 0.7451979964971542, | |
| "num_tokens": 3328548.0, | |
| "step": 89 | |
| }, | |
| { | |
| "entropy": 0.6240335181355476, | |
| "epoch": 0.5848903330625508, | |
| "grad_norm": 0.009283720515668392, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6263805031776428, | |
| "mean_token_accuracy": 0.7456449046730995, | |
| "num_tokens": 3365327.0, | |
| "step": 90 | |
| }, | |
| { | |
| "entropy": 0.6241980046033859, | |
| "epoch": 0.5913891145410236, | |
| "grad_norm": 0.010714948177337646, | |
| "learning_rate": 0.0002, | |
| "loss": 0.625645637512207, | |
| "mean_token_accuracy": 0.7471252828836441, | |
| "num_tokens": 3402757.0, | |
| "step": 91 | |
| }, | |
| { | |
| "entropy": 0.628009632229805, | |
| "epoch": 0.5978878960194963, | |
| "grad_norm": 0.012750590220093727, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6261017322540283, | |
| "mean_token_accuracy": 0.7465066090226173, | |
| "num_tokens": 3440031.0, | |
| "step": 92 | |
| }, | |
| { | |
| "entropy": 0.6196997240185738, | |
| "epoch": 0.6043866774979691, | |
| "grad_norm": 0.011183288879692554, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6222946047782898, | |
| "mean_token_accuracy": 0.7507361546158791, | |
| "num_tokens": 3477362.0, | |
| "step": 93 | |
| }, | |
| { | |
| "entropy": 0.6370684951543808, | |
| "epoch": 0.6108854589764419, | |
| "grad_norm": 0.010141120292246342, | |
| "learning_rate": 0.0002, | |
| "loss": 0.638361930847168, | |
| "mean_token_accuracy": 0.7412139847874641, | |
| "num_tokens": 3514709.0, | |
| "step": 94 | |
| }, | |
| { | |
| "entropy": 0.6254898384213448, | |
| "epoch": 0.6173842404549147, | |
| "grad_norm": 0.009656463749706745, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6284251809120178, | |
| "mean_token_accuracy": 0.7460697740316391, | |
| "num_tokens": 3552355.0, | |
| "step": 95 | |
| }, | |
| { | |
| "entropy": 0.626992717385292, | |
| "epoch": 0.6238830219333875, | |
| "grad_norm": 0.01039013173431158, | |
| "learning_rate": 0.0002, | |
| "loss": 0.632388174533844, | |
| "mean_token_accuracy": 0.7448238283395767, | |
| "num_tokens": 3590160.0, | |
| "step": 96 | |
| }, | |
| { | |
| "entropy": 0.6212045699357986, | |
| "epoch": 0.6303818034118602, | |
| "grad_norm": 0.011750632897019386, | |
| "learning_rate": 0.0002, | |
| "loss": 0.623359203338623, | |
| "mean_token_accuracy": 0.7481106221675873, | |
| "num_tokens": 3627240.0, | |
| "step": 97 | |
| }, | |
| { | |
| "entropy": 0.6192934885621071, | |
| "epoch": 0.6368805848903331, | |
| "grad_norm": 0.009845283813774586, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6226494312286377, | |
| "mean_token_accuracy": 0.7480833828449249, | |
| "num_tokens": 3664279.0, | |
| "step": 98 | |
| }, | |
| { | |
| "entropy": 0.6310721859335899, | |
| "epoch": 0.6433793663688059, | |
| "grad_norm": 0.011091063730418682, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6305258274078369, | |
| "mean_token_accuracy": 0.7463658377528191, | |
| "num_tokens": 3701955.0, | |
| "step": 99 | |
| }, | |
| { | |
| "entropy": 0.6249227002263069, | |
| "epoch": 0.6498781478472786, | |
| "grad_norm": 0.009939444251358509, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6257964372634888, | |
| "mean_token_accuracy": 0.7479037865996361, | |
| "num_tokens": 3739298.0, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 0.6227108985185623, | |
| "epoch": 0.6563769293257514, | |
| "grad_norm": 0.010004580952227116, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6256003379821777, | |
| "mean_token_accuracy": 0.7474573701620102, | |
| "num_tokens": 3776806.0, | |
| "step": 101 | |
| }, | |
| { | |
| "entropy": 0.6166384890675545, | |
| "epoch": 0.6628757108042242, | |
| "grad_norm": 0.010987838730216026, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6182519197463989, | |
| "mean_token_accuracy": 0.7499695047736168, | |
| "num_tokens": 3813941.0, | |
| "step": 102 | |
| }, | |
| { | |
| "entropy": 0.6348938420414925, | |
| "epoch": 0.669374492282697, | |
| "grad_norm": 0.011195721104741096, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6304492950439453, | |
| "mean_token_accuracy": 0.7462876811623573, | |
| "num_tokens": 3851698.0, | |
| "step": 103 | |
| }, | |
| { | |
| "entropy": 0.6282550320029259, | |
| "epoch": 0.6758732737611698, | |
| "grad_norm": 0.010595601983368397, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6273945569992065, | |
| "mean_token_accuracy": 0.7473014816641808, | |
| "num_tokens": 3888988.0, | |
| "step": 104 | |
| }, | |
| { | |
| "entropy": 0.6324817091226578, | |
| "epoch": 0.6823720552396426, | |
| "grad_norm": 0.009895245544612408, | |
| "learning_rate": 0.0002, | |
| "loss": 0.632161557674408, | |
| "mean_token_accuracy": 0.7444497495889664, | |
| "num_tokens": 3925974.0, | |
| "step": 105 | |
| }, | |
| { | |
| "entropy": 0.6199614554643631, | |
| "epoch": 0.6888708367181153, | |
| "grad_norm": 0.010299347341060638, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6227681636810303, | |
| "mean_token_accuracy": 0.746825821697712, | |
| "num_tokens": 3962869.0, | |
| "step": 106 | |
| }, | |
| { | |
| "entropy": 0.6321764960885048, | |
| "epoch": 0.6953696181965882, | |
| "grad_norm": 0.010949746705591679, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6333647966384888, | |
| "mean_token_accuracy": 0.7444829195737839, | |
| "num_tokens": 4000443.0, | |
| "step": 107 | |
| }, | |
| { | |
| "entropy": 0.6052318215370178, | |
| "epoch": 0.7018683996750609, | |
| "grad_norm": 0.010511154308915138, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6079590916633606, | |
| "mean_token_accuracy": 0.7547851428389549, | |
| "num_tokens": 4037560.0, | |
| "step": 108 | |
| }, | |
| { | |
| "entropy": 0.6213503628969193, | |
| "epoch": 0.7083671811535337, | |
| "grad_norm": 0.009959033690392971, | |
| "learning_rate": 0.0002, | |
| "loss": 0.622962236404419, | |
| "mean_token_accuracy": 0.7485458552837372, | |
| "num_tokens": 4075139.0, | |
| "step": 109 | |
| }, | |
| { | |
| "entropy": 0.6228557601571083, | |
| "epoch": 0.7148659626320065, | |
| "grad_norm": 0.009467214345932007, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6287202835083008, | |
| "mean_token_accuracy": 0.7456526011228561, | |
| "num_tokens": 4112628.0, | |
| "step": 110 | |
| }, | |
| { | |
| "entropy": 0.6176012232899666, | |
| "epoch": 0.7213647441104792, | |
| "grad_norm": 0.009703468531370163, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6198960542678833, | |
| "mean_token_accuracy": 0.7511189430952072, | |
| "num_tokens": 4150384.0, | |
| "step": 111 | |
| }, | |
| { | |
| "entropy": 0.6364283263683319, | |
| "epoch": 0.7278635255889521, | |
| "grad_norm": 0.009932373650372028, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6412342190742493, | |
| "mean_token_accuracy": 0.742191307246685, | |
| "num_tokens": 4187483.0, | |
| "step": 112 | |
| }, | |
| { | |
| "entropy": 0.6340491250157356, | |
| "epoch": 0.7343623070674249, | |
| "grad_norm": 0.009394255466759205, | |
| "learning_rate": 0.0002, | |
| "loss": 0.632526695728302, | |
| "mean_token_accuracy": 0.7457142248749733, | |
| "num_tokens": 4224861.0, | |
| "step": 113 | |
| }, | |
| { | |
| "entropy": 0.626609705388546, | |
| "epoch": 0.7408610885458976, | |
| "grad_norm": 0.010729662142693996, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6251577138900757, | |
| "mean_token_accuracy": 0.7473985999822617, | |
| "num_tokens": 4261958.0, | |
| "step": 114 | |
| }, | |
| { | |
| "entropy": 0.6041073203086853, | |
| "epoch": 0.7473598700243704, | |
| "grad_norm": 0.010525292716920376, | |
| "learning_rate": 0.0002, | |
| "loss": 0.599025309085846, | |
| "mean_token_accuracy": 0.7583419680595398, | |
| "num_tokens": 4299462.0, | |
| "step": 115 | |
| }, | |
| { | |
| "entropy": 0.6210100278258324, | |
| "epoch": 0.7538586515028433, | |
| "grad_norm": 0.009981499053537846, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6192715167999268, | |
| "mean_token_accuracy": 0.7496819868683815, | |
| "num_tokens": 4336903.0, | |
| "step": 116 | |
| }, | |
| { | |
| "entropy": 0.6161150112748146, | |
| "epoch": 0.760357432981316, | |
| "grad_norm": 0.009832478128373623, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6186830401420593, | |
| "mean_token_accuracy": 0.7503286600112915, | |
| "num_tokens": 4374156.0, | |
| "step": 117 | |
| }, | |
| { | |
| "entropy": 0.6233196780085564, | |
| "epoch": 0.7668562144597888, | |
| "grad_norm": 0.009722237475216389, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6274971961975098, | |
| "mean_token_accuracy": 0.7461902946233749, | |
| "num_tokens": 4411885.0, | |
| "step": 118 | |
| }, | |
| { | |
| "entropy": 0.6291887611150742, | |
| "epoch": 0.7733549959382616, | |
| "grad_norm": 0.01063536573201418, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6366918087005615, | |
| "mean_token_accuracy": 0.7416415438055992, | |
| "num_tokens": 4449209.0, | |
| "step": 119 | |
| }, | |
| { | |
| "entropy": 0.6099276095628738, | |
| "epoch": 0.7798537774167343, | |
| "grad_norm": 0.010151992551982403, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6134237051010132, | |
| "mean_token_accuracy": 0.7496887296438217, | |
| "num_tokens": 4486909.0, | |
| "step": 120 | |
| }, | |
| { | |
| "entropy": 0.6280336380004883, | |
| "epoch": 0.7863525588952072, | |
| "grad_norm": 0.011214104481041431, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6303111910820007, | |
| "mean_token_accuracy": 0.743942454457283, | |
| "num_tokens": 4524269.0, | |
| "step": 121 | |
| }, | |
| { | |
| "entropy": 0.624128632247448, | |
| "epoch": 0.7928513403736799, | |
| "grad_norm": 0.01028621755540371, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6248451471328735, | |
| "mean_token_accuracy": 0.7479912042617798, | |
| "num_tokens": 4561643.0, | |
| "step": 122 | |
| }, | |
| { | |
| "entropy": 0.6252302676439285, | |
| "epoch": 0.7993501218521527, | |
| "grad_norm": 0.01105236541479826, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6249452233314514, | |
| "mean_token_accuracy": 0.7472440227866173, | |
| "num_tokens": 4599086.0, | |
| "step": 123 | |
| }, | |
| { | |
| "entropy": 0.6296864897012711, | |
| "epoch": 0.8058489033306255, | |
| "grad_norm": 0.009404209442436695, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6316344738006592, | |
| "mean_token_accuracy": 0.7425857782363892, | |
| "num_tokens": 4636471.0, | |
| "step": 124 | |
| }, | |
| { | |
| "entropy": 0.6118782311677933, | |
| "epoch": 0.8123476848090982, | |
| "grad_norm": 0.010075677186250687, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6151276230812073, | |
| "mean_token_accuracy": 0.7537136599421501, | |
| "num_tokens": 4673814.0, | |
| "step": 125 | |
| }, | |
| { | |
| "entropy": 0.6220783665776253, | |
| "epoch": 0.8188464662875711, | |
| "grad_norm": 0.01058894768357277, | |
| "learning_rate": 0.0002, | |
| "loss": 0.623919665813446, | |
| "mean_token_accuracy": 0.7449487373232841, | |
| "num_tokens": 4711348.0, | |
| "step": 126 | |
| }, | |
| { | |
| "entropy": 0.6320341899991035, | |
| "epoch": 0.8253452477660439, | |
| "grad_norm": 0.009438078850507736, | |
| "learning_rate": 0.0002, | |
| "loss": 0.635218620300293, | |
| "mean_token_accuracy": 0.7428243607282639, | |
| "num_tokens": 4748964.0, | |
| "step": 127 | |
| }, | |
| { | |
| "entropy": 0.608184851706028, | |
| "epoch": 0.8318440292445166, | |
| "grad_norm": 0.00950313825160265, | |
| "learning_rate": 0.0002, | |
| "loss": 0.608941376209259, | |
| "mean_token_accuracy": 0.7540178000926971, | |
| "num_tokens": 4786015.0, | |
| "step": 128 | |
| }, | |
| { | |
| "entropy": 0.6191292628645897, | |
| "epoch": 0.8383428107229894, | |
| "grad_norm": 0.00933976098895073, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6211662292480469, | |
| "mean_token_accuracy": 0.7470189183950424, | |
| "num_tokens": 4823477.0, | |
| "step": 129 | |
| }, | |
| { | |
| "entropy": 0.6169113591313362, | |
| "epoch": 0.8448415922014623, | |
| "grad_norm": 0.00967735517770052, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6221678256988525, | |
| "mean_token_accuracy": 0.7482811883091927, | |
| "num_tokens": 4860492.0, | |
| "step": 130 | |
| }, | |
| { | |
| "entropy": 0.6181379705667496, | |
| "epoch": 0.851340373679935, | |
| "grad_norm": 0.010275167413055897, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6256829500198364, | |
| "mean_token_accuracy": 0.7461275234818459, | |
| "num_tokens": 4897310.0, | |
| "step": 131 | |
| }, | |
| { | |
| "entropy": 0.6289433836936951, | |
| "epoch": 0.8578391551584078, | |
| "grad_norm": 0.010724073275923729, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6285852193832397, | |
| "mean_token_accuracy": 0.7468666434288025, | |
| "num_tokens": 4935222.0, | |
| "step": 132 | |
| }, | |
| { | |
| "entropy": 0.6300692111253738, | |
| "epoch": 0.8643379366368806, | |
| "grad_norm": 0.009074898436665535, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6281343698501587, | |
| "mean_token_accuracy": 0.7458086088299751, | |
| "num_tokens": 4972549.0, | |
| "step": 133 | |
| }, | |
| { | |
| "entropy": 0.6445952579379082, | |
| "epoch": 0.8708367181153533, | |
| "grad_norm": 0.009369590319693089, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6381428837776184, | |
| "mean_token_accuracy": 0.7420760691165924, | |
| "num_tokens": 5010593.0, | |
| "step": 134 | |
| }, | |
| { | |
| "entropy": 0.6136679574847221, | |
| "epoch": 0.8773354995938262, | |
| "grad_norm": 0.01232313271611929, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6184711456298828, | |
| "mean_token_accuracy": 0.7486978471279144, | |
| "num_tokens": 5047468.0, | |
| "step": 135 | |
| }, | |
| { | |
| "entropy": 0.6270027384161949, | |
| "epoch": 0.8838342810722989, | |
| "grad_norm": 0.010591822676360607, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6306672692298889, | |
| "mean_token_accuracy": 0.7446641474962234, | |
| "num_tokens": 5084586.0, | |
| "step": 136 | |
| }, | |
| { | |
| "entropy": 0.6240550950169563, | |
| "epoch": 0.8903330625507717, | |
| "grad_norm": 0.009444071911275387, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6233399510383606, | |
| "mean_token_accuracy": 0.749994620680809, | |
| "num_tokens": 5122453.0, | |
| "step": 137 | |
| }, | |
| { | |
| "entropy": 0.6302881464362144, | |
| "epoch": 0.8968318440292445, | |
| "grad_norm": 0.009541204199194908, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6329821348190308, | |
| "mean_token_accuracy": 0.7429886758327484, | |
| "num_tokens": 5160031.0, | |
| "step": 138 | |
| }, | |
| { | |
| "entropy": 0.6242454648017883, | |
| "epoch": 0.9033306255077173, | |
| "grad_norm": 0.01136871799826622, | |
| "learning_rate": 0.0002, | |
| "loss": 0.628311038017273, | |
| "mean_token_accuracy": 0.7444250509142876, | |
| "num_tokens": 5197538.0, | |
| "step": 139 | |
| }, | |
| { | |
| "entropy": 0.6239208057522774, | |
| "epoch": 0.9098294069861901, | |
| "grad_norm": 0.009039361029863358, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6212806105613708, | |
| "mean_token_accuracy": 0.7484918162226677, | |
| "num_tokens": 5234839.0, | |
| "step": 140 | |
| }, | |
| { | |
| "entropy": 0.6303699910640717, | |
| "epoch": 0.9163281884646629, | |
| "grad_norm": 0.008452481590211391, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6276811361312866, | |
| "mean_token_accuracy": 0.7478921040892601, | |
| "num_tokens": 5272501.0, | |
| "step": 141 | |
| }, | |
| { | |
| "entropy": 0.6282826215028763, | |
| "epoch": 0.9228269699431356, | |
| "grad_norm": 0.009988308884203434, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6308070421218872, | |
| "mean_token_accuracy": 0.744203083217144, | |
| "num_tokens": 5310068.0, | |
| "step": 142 | |
| }, | |
| { | |
| "entropy": 0.6363607943058014, | |
| "epoch": 0.9293257514216084, | |
| "grad_norm": 0.010694671422243118, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6361459493637085, | |
| "mean_token_accuracy": 0.7425540909171104, | |
| "num_tokens": 5347594.0, | |
| "step": 143 | |
| }, | |
| { | |
| "entropy": 0.6332810074090958, | |
| "epoch": 0.9358245329000813, | |
| "grad_norm": 0.008342958055436611, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6327856779098511, | |
| "mean_token_accuracy": 0.7445112019777298, | |
| "num_tokens": 5385240.0, | |
| "step": 144 | |
| }, | |
| { | |
| "entropy": 0.622712031006813, | |
| "epoch": 0.942323314378554, | |
| "grad_norm": 0.009324009530246258, | |
| "learning_rate": 0.0002, | |
| "loss": 0.622111439704895, | |
| "mean_token_accuracy": 0.7491918131709099, | |
| "num_tokens": 5423063.0, | |
| "step": 145 | |
| }, | |
| { | |
| "entropy": 0.6331967115402222, | |
| "epoch": 0.9488220958570268, | |
| "grad_norm": 0.009456835687160492, | |
| "learning_rate": 0.0002, | |
| "loss": 0.635155200958252, | |
| "mean_token_accuracy": 0.7427491322159767, | |
| "num_tokens": 5460300.0, | |
| "step": 146 | |
| }, | |
| { | |
| "entropy": 0.6007715612649918, | |
| "epoch": 0.9553208773354996, | |
| "grad_norm": 0.009612048044800758, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6061209440231323, | |
| "mean_token_accuracy": 0.7546330019831657, | |
| "num_tokens": 5497104.0, | |
| "step": 147 | |
| }, | |
| { | |
| "entropy": 0.623559907078743, | |
| "epoch": 0.9618196588139724, | |
| "grad_norm": 0.009891507215797901, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6299046874046326, | |
| "mean_token_accuracy": 0.7460341230034828, | |
| "num_tokens": 5534717.0, | |
| "step": 148 | |
| }, | |
| { | |
| "entropy": 0.6161656081676483, | |
| "epoch": 0.9683184402924452, | |
| "grad_norm": 0.009623561054468155, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6207596659660339, | |
| "mean_token_accuracy": 0.7484462484717369, | |
| "num_tokens": 5572155.0, | |
| "step": 149 | |
| }, | |
| { | |
| "entropy": 0.6296671330928802, | |
| "epoch": 0.974817221770918, | |
| "grad_norm": 0.009666231460869312, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6299723386764526, | |
| "mean_token_accuracy": 0.7442828044295311, | |
| "num_tokens": 5609434.0, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 0.635062001645565, | |
| "epoch": 0.9813160032493907, | |
| "grad_norm": 0.009376533329486847, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6303079128265381, | |
| "mean_token_accuracy": 0.7447433397173882, | |
| "num_tokens": 5646893.0, | |
| "step": 151 | |
| }, | |
| { | |
| "entropy": 0.630713015794754, | |
| "epoch": 0.9878147847278635, | |
| "grad_norm": 0.009512092918157578, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6241896152496338, | |
| "mean_token_accuracy": 0.745731770992279, | |
| "num_tokens": 5684403.0, | |
| "step": 152 | |
| }, | |
| { | |
| "entropy": 0.623988039791584, | |
| "epoch": 0.9943135662063363, | |
| "grad_norm": 0.00946712028235197, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6251310110092163, | |
| "mean_token_accuracy": 0.7487976476550102, | |
| "num_tokens": 5721608.0, | |
| "step": 153 | |
| }, | |
| { | |
| "entropy": 0.5962605476379395, | |
| "epoch": 1.0, | |
| "grad_norm": 0.010017761029303074, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6195710897445679, | |
| "mean_token_accuracy": 0.754073713506971, | |
| "num_tokens": 5737850.0, | |
| "step": 154 | |
| }, | |
| { | |
| "entropy": 0.6159528121352196, | |
| "epoch": 1.0064987814784727, | |
| "grad_norm": 0.011626223102211952, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6283953785896301, | |
| "mean_token_accuracy": 0.7437271103262901, | |
| "num_tokens": 5775226.0, | |
| "step": 155 | |
| }, | |
| { | |
| "entropy": 0.6398139446973801, | |
| "epoch": 1.0129975629569457, | |
| "grad_norm": 0.009600057266652584, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6418601274490356, | |
| "mean_token_accuracy": 0.7394955083727837, | |
| "num_tokens": 5812842.0, | |
| "step": 156 | |
| }, | |
| { | |
| "entropy": 0.6106663420796394, | |
| "epoch": 1.0194963444354184, | |
| "grad_norm": 0.01011701114475727, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6077284812927246, | |
| "mean_token_accuracy": 0.754165381193161, | |
| "num_tokens": 5850157.0, | |
| "step": 157 | |
| }, | |
| { | |
| "entropy": 0.6355043426156044, | |
| "epoch": 1.025995125913891, | |
| "grad_norm": 0.009700894355773926, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6273776888847351, | |
| "mean_token_accuracy": 0.7454625219106674, | |
| "num_tokens": 5887576.0, | |
| "step": 158 | |
| }, | |
| { | |
| "entropy": 0.629393994808197, | |
| "epoch": 1.032493907392364, | |
| "grad_norm": 0.007958617061376572, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6252051591873169, | |
| "mean_token_accuracy": 0.7460998743772507, | |
| "num_tokens": 5925165.0, | |
| "step": 159 | |
| }, | |
| { | |
| "entropy": 0.6266166046261787, | |
| "epoch": 1.0389926888708367, | |
| "grad_norm": 0.00998145341873169, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6290674209594727, | |
| "mean_token_accuracy": 0.7430498450994492, | |
| "num_tokens": 5962505.0, | |
| "step": 160 | |
| }, | |
| { | |
| "entropy": 0.6140859052538872, | |
| "epoch": 1.0454914703493094, | |
| "grad_norm": 0.010381487198174, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6180790662765503, | |
| "mean_token_accuracy": 0.7507300451397896, | |
| "num_tokens": 5999871.0, | |
| "step": 161 | |
| }, | |
| { | |
| "entropy": 0.6197154447436333, | |
| "epoch": 1.0519902518277824, | |
| "grad_norm": 0.009876130148768425, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6249828338623047, | |
| "mean_token_accuracy": 0.7454148605465889, | |
| "num_tokens": 6037575.0, | |
| "step": 162 | |
| }, | |
| { | |
| "entropy": 0.6122508272528648, | |
| "epoch": 1.058489033306255, | |
| "grad_norm": 0.008684883825480938, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6138869524002075, | |
| "mean_token_accuracy": 0.7517640963196754, | |
| "num_tokens": 6074892.0, | |
| "step": 163 | |
| }, | |
| { | |
| "entropy": 0.6194281056523323, | |
| "epoch": 1.0649878147847278, | |
| "grad_norm": 0.010471724905073643, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6223649978637695, | |
| "mean_token_accuracy": 0.7462374493479729, | |
| "num_tokens": 6112197.0, | |
| "step": 164 | |
| }, | |
| { | |
| "entropy": 0.6203417181968689, | |
| "epoch": 1.0714865962632008, | |
| "grad_norm": 0.00992770865559578, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6209006309509277, | |
| "mean_token_accuracy": 0.7480901628732681, | |
| "num_tokens": 6149571.0, | |
| "step": 165 | |
| }, | |
| { | |
| "entropy": 0.6099580377340317, | |
| "epoch": 1.0779853777416735, | |
| "grad_norm": 0.00981567706912756, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6166203022003174, | |
| "mean_token_accuracy": 0.7501059100031853, | |
| "num_tokens": 6186570.0, | |
| "step": 166 | |
| }, | |
| { | |
| "entropy": 0.6217071712017059, | |
| "epoch": 1.0844841592201462, | |
| "grad_norm": 0.009364967234432697, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6240255236625671, | |
| "mean_token_accuracy": 0.7475733831524849, | |
| "num_tokens": 6224124.0, | |
| "step": 167 | |
| }, | |
| { | |
| "entropy": 0.6265001520514488, | |
| "epoch": 1.090982940698619, | |
| "grad_norm": 0.009150683879852295, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6249997615814209, | |
| "mean_token_accuracy": 0.7465919181704521, | |
| "num_tokens": 6261544.0, | |
| "step": 168 | |
| }, | |
| { | |
| "entropy": 0.6337415799498558, | |
| "epoch": 1.0974817221770918, | |
| "grad_norm": 0.009555370546877384, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6337403059005737, | |
| "mean_token_accuracy": 0.7431929185986519, | |
| "num_tokens": 6298708.0, | |
| "step": 169 | |
| }, | |
| { | |
| "entropy": 0.6212407127022743, | |
| "epoch": 1.1039805036555645, | |
| "grad_norm": 0.009204280562698841, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6198785305023193, | |
| "mean_token_accuracy": 0.7490911036729813, | |
| "num_tokens": 6336357.0, | |
| "step": 170 | |
| }, | |
| { | |
| "entropy": 0.6211022287607193, | |
| "epoch": 1.1104792851340373, | |
| "grad_norm": 0.010933548212051392, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6218096017837524, | |
| "mean_token_accuracy": 0.7478840723633766, | |
| "num_tokens": 6373815.0, | |
| "step": 171 | |
| }, | |
| { | |
| "entropy": 0.6218304485082626, | |
| "epoch": 1.1169780666125102, | |
| "grad_norm": 0.007957971654832363, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6211934089660645, | |
| "mean_token_accuracy": 0.7479007542133331, | |
| "num_tokens": 6411469.0, | |
| "step": 172 | |
| }, | |
| { | |
| "entropy": 0.623476430773735, | |
| "epoch": 1.123476848090983, | |
| "grad_norm": 0.008693872950971127, | |
| "learning_rate": 0.0002, | |
| "loss": 0.628318727016449, | |
| "mean_token_accuracy": 0.7435088455677032, | |
| "num_tokens": 6448782.0, | |
| "step": 173 | |
| }, | |
| { | |
| "entropy": 0.6133372634649277, | |
| "epoch": 1.1299756295694556, | |
| "grad_norm": 0.010963717475533485, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6166828274726868, | |
| "mean_token_accuracy": 0.7512464672327042, | |
| "num_tokens": 6485790.0, | |
| "step": 174 | |
| }, | |
| { | |
| "entropy": 0.6234560832381248, | |
| "epoch": 1.1364744110479286, | |
| "grad_norm": 0.009953116998076439, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6275191903114319, | |
| "mean_token_accuracy": 0.7457004636526108, | |
| "num_tokens": 6523433.0, | |
| "step": 175 | |
| }, | |
| { | |
| "entropy": 0.612127959728241, | |
| "epoch": 1.1429731925264013, | |
| "grad_norm": 0.008568039163947105, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6111507415771484, | |
| "mean_token_accuracy": 0.7523760348558426, | |
| "num_tokens": 6560764.0, | |
| "step": 176 | |
| }, | |
| { | |
| "entropy": 0.6384553462266922, | |
| "epoch": 1.149471974004874, | |
| "grad_norm": 0.010018682107329369, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6336829662322998, | |
| "mean_token_accuracy": 0.743287555873394, | |
| "num_tokens": 6598409.0, | |
| "step": 177 | |
| }, | |
| { | |
| "entropy": 0.6272930577397346, | |
| "epoch": 1.155970755483347, | |
| "grad_norm": 0.009546359069645405, | |
| "learning_rate": 0.0002, | |
| "loss": 0.626544713973999, | |
| "mean_token_accuracy": 0.7449387013912201, | |
| "num_tokens": 6636067.0, | |
| "step": 178 | |
| }, | |
| { | |
| "entropy": 0.6086627542972565, | |
| "epoch": 1.1624695369618196, | |
| "grad_norm": 0.009319686330854893, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6141277551651001, | |
| "mean_token_accuracy": 0.7520448267459869, | |
| "num_tokens": 6673446.0, | |
| "step": 179 | |
| }, | |
| { | |
| "entropy": 0.5994155630469322, | |
| "epoch": 1.1689683184402924, | |
| "grad_norm": 0.011318805627524853, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6087459325790405, | |
| "mean_token_accuracy": 0.7519726976752281, | |
| "num_tokens": 6710715.0, | |
| "step": 180 | |
| }, | |
| { | |
| "entropy": 0.6187063455581665, | |
| "epoch": 1.1754670999187653, | |
| "grad_norm": 0.009100009687244892, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6213230490684509, | |
| "mean_token_accuracy": 0.7466496899724007, | |
| "num_tokens": 6748737.0, | |
| "step": 181 | |
| }, | |
| { | |
| "entropy": 0.6402401477098465, | |
| "epoch": 1.181965881397238, | |
| "grad_norm": 0.009086531586945057, | |
| "learning_rate": 0.0002, | |
| "loss": 0.636063277721405, | |
| "mean_token_accuracy": 0.7429427057504654, | |
| "num_tokens": 6785555.0, | |
| "step": 182 | |
| }, | |
| { | |
| "entropy": 0.6275543943047523, | |
| "epoch": 1.1884646628757107, | |
| "grad_norm": 0.00983697734773159, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6195461750030518, | |
| "mean_token_accuracy": 0.7482333034276962, | |
| "num_tokens": 6822608.0, | |
| "step": 183 | |
| }, | |
| { | |
| "entropy": 0.6261148154735565, | |
| "epoch": 1.1949634443541837, | |
| "grad_norm": 0.008595704101026058, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6235471963882446, | |
| "mean_token_accuracy": 0.7465647235512733, | |
| "num_tokens": 6860107.0, | |
| "step": 184 | |
| }, | |
| { | |
| "entropy": 0.615828700363636, | |
| "epoch": 1.2014622258326564, | |
| "grad_norm": 0.010348568670451641, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6194600462913513, | |
| "mean_token_accuracy": 0.7490681707859039, | |
| "num_tokens": 6897202.0, | |
| "step": 185 | |
| }, | |
| { | |
| "entropy": 0.6132261380553246, | |
| "epoch": 1.207961007311129, | |
| "grad_norm": 0.010876818560063839, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6224918365478516, | |
| "mean_token_accuracy": 0.7479420974850655, | |
| "num_tokens": 6934670.0, | |
| "step": 186 | |
| }, | |
| { | |
| "entropy": 0.6103203073143959, | |
| "epoch": 1.214459788789602, | |
| "grad_norm": 0.009953301399946213, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6190877556800842, | |
| "mean_token_accuracy": 0.7497604489326477, | |
| "num_tokens": 6971658.0, | |
| "step": 187 | |
| }, | |
| { | |
| "entropy": 0.617573581635952, | |
| "epoch": 1.2209585702680747, | |
| "grad_norm": 0.00837781187146902, | |
| "learning_rate": 0.0002, | |
| "loss": 0.617588996887207, | |
| "mean_token_accuracy": 0.7494269385933876, | |
| "num_tokens": 7009123.0, | |
| "step": 188 | |
| }, | |
| { | |
| "entropy": 0.629171572625637, | |
| "epoch": 1.2274573517465475, | |
| "grad_norm": 0.008275787346065044, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6283445358276367, | |
| "mean_token_accuracy": 0.7444169595837593, | |
| "num_tokens": 7046906.0, | |
| "step": 189 | |
| }, | |
| { | |
| "entropy": 0.6318405717611313, | |
| "epoch": 1.2339561332250204, | |
| "grad_norm": 0.008116304874420166, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6320441365242004, | |
| "mean_token_accuracy": 0.7443558126688004, | |
| "num_tokens": 7084180.0, | |
| "step": 190 | |
| }, | |
| { | |
| "entropy": 0.6146104484796524, | |
| "epoch": 1.2404549147034931, | |
| "grad_norm": 0.009803351014852524, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6140527725219727, | |
| "mean_token_accuracy": 0.7488429099321365, | |
| "num_tokens": 7121475.0, | |
| "step": 191 | |
| }, | |
| { | |
| "entropy": 0.6153127253055573, | |
| "epoch": 1.2469536961819658, | |
| "grad_norm": 0.007825122214853764, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6195809245109558, | |
| "mean_token_accuracy": 0.7493974566459656, | |
| "num_tokens": 7158753.0, | |
| "step": 192 | |
| }, | |
| { | |
| "entropy": 0.6186842620372772, | |
| "epoch": 1.2534524776604385, | |
| "grad_norm": 0.00928817130625248, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6203854084014893, | |
| "mean_token_accuracy": 0.748259611427784, | |
| "num_tokens": 7195797.0, | |
| "step": 193 | |
| }, | |
| { | |
| "entropy": 0.6210475564002991, | |
| "epoch": 1.2599512591389115, | |
| "grad_norm": 0.010004797019064426, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6249719858169556, | |
| "mean_token_accuracy": 0.7474558278918266, | |
| "num_tokens": 7233547.0, | |
| "step": 194 | |
| }, | |
| { | |
| "entropy": 0.6319233104586601, | |
| "epoch": 1.2664500406173842, | |
| "grad_norm": 0.010124076157808304, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6346510648727417, | |
| "mean_token_accuracy": 0.7430363744497299, | |
| "num_tokens": 7271165.0, | |
| "step": 195 | |
| }, | |
| { | |
| "entropy": 0.6228615492582321, | |
| "epoch": 1.2729488220958571, | |
| "grad_norm": 0.00920382421463728, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6211229562759399, | |
| "mean_token_accuracy": 0.7490492090582848, | |
| "num_tokens": 7308659.0, | |
| "step": 196 | |
| }, | |
| { | |
| "entropy": 0.6310986131429672, | |
| "epoch": 1.2794476035743299, | |
| "grad_norm": 0.009224419482052326, | |
| "learning_rate": 0.0002, | |
| "loss": 0.626353919506073, | |
| "mean_token_accuracy": 0.7454532235860825, | |
| "num_tokens": 7346203.0, | |
| "step": 197 | |
| }, | |
| { | |
| "entropy": 0.610854484140873, | |
| "epoch": 1.2859463850528026, | |
| "grad_norm": 0.009150652214884758, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6110652685165405, | |
| "mean_token_accuracy": 0.7504596933722496, | |
| "num_tokens": 7383470.0, | |
| "step": 198 | |
| }, | |
| { | |
| "entropy": 0.6061088666319847, | |
| "epoch": 1.2924451665312753, | |
| "grad_norm": 0.008921864442527294, | |
| "learning_rate": 0.0002, | |
| "loss": 0.611494779586792, | |
| "mean_token_accuracy": 0.7522832676768303, | |
| "num_tokens": 7420939.0, | |
| "step": 199 | |
| }, | |
| { | |
| "entropy": 0.6130355596542358, | |
| "epoch": 1.2989439480097482, | |
| "grad_norm": 0.009989106096327305, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6249145269393921, | |
| "mean_token_accuracy": 0.7437470331788063, | |
| "num_tokens": 7458037.0, | |
| "step": 200 | |
| }, | |
| { | |
| "entropy": 0.6245267316699028, | |
| "epoch": 1.305442729488221, | |
| "grad_norm": 0.008322354406118393, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6295627355575562, | |
| "mean_token_accuracy": 0.7449559271335602, | |
| "num_tokens": 7495466.0, | |
| "step": 201 | |
| }, | |
| { | |
| "entropy": 0.6188690215349197, | |
| "epoch": 1.3119415109666939, | |
| "grad_norm": 0.008306242525577545, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6199623942375183, | |
| "mean_token_accuracy": 0.7464429587125778, | |
| "num_tokens": 7533028.0, | |
| "step": 202 | |
| }, | |
| { | |
| "entropy": 0.6284244954586029, | |
| "epoch": 1.3184402924451666, | |
| "grad_norm": 0.008912610821425915, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6269126534461975, | |
| "mean_token_accuracy": 0.7451603710651398, | |
| "num_tokens": 7570454.0, | |
| "step": 203 | |
| }, | |
| { | |
| "entropy": 0.6253558248281479, | |
| "epoch": 1.3249390739236393, | |
| "grad_norm": 0.009339334443211555, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6178290247917175, | |
| "mean_token_accuracy": 0.749000295996666, | |
| "num_tokens": 7607813.0, | |
| "step": 204 | |
| }, | |
| { | |
| "entropy": 0.6330921202898026, | |
| "epoch": 1.331437855402112, | |
| "grad_norm": 0.009055222384631634, | |
| "learning_rate": 0.0002, | |
| "loss": 0.627162754535675, | |
| "mean_token_accuracy": 0.7448414042592049, | |
| "num_tokens": 7645571.0, | |
| "step": 205 | |
| }, | |
| { | |
| "entropy": 0.612213708460331, | |
| "epoch": 1.337936636880585, | |
| "grad_norm": 0.00788091029971838, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6103406548500061, | |
| "mean_token_accuracy": 0.7524209767580032, | |
| "num_tokens": 7682827.0, | |
| "step": 206 | |
| }, | |
| { | |
| "entropy": 0.6196805313229561, | |
| "epoch": 1.3444354183590577, | |
| "grad_norm": 0.0074918679893016815, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6231103539466858, | |
| "mean_token_accuracy": 0.7457561120390892, | |
| "num_tokens": 7720532.0, | |
| "step": 207 | |
| }, | |
| { | |
| "entropy": 0.6148431301116943, | |
| "epoch": 1.3509341998375304, | |
| "grad_norm": 0.008005033247172832, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6224607825279236, | |
| "mean_token_accuracy": 0.7475835010409355, | |
| "num_tokens": 7757914.0, | |
| "step": 208 | |
| }, | |
| { | |
| "entropy": 0.6162410527467728, | |
| "epoch": 1.3574329813160033, | |
| "grad_norm": 0.008755719289183617, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6230734586715698, | |
| "mean_token_accuracy": 0.7474293559789658, | |
| "num_tokens": 7795111.0, | |
| "step": 209 | |
| }, | |
| { | |
| "entropy": 0.6132988333702087, | |
| "epoch": 1.363931762794476, | |
| "grad_norm": 0.008136742748320103, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6189343929290771, | |
| "mean_token_accuracy": 0.7504551187157631, | |
| "num_tokens": 7832380.0, | |
| "step": 210 | |
| }, | |
| { | |
| "entropy": 0.62418133020401, | |
| "epoch": 1.3704305442729487, | |
| "grad_norm": 0.007090510334819555, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6275556087493896, | |
| "mean_token_accuracy": 0.744689516723156, | |
| "num_tokens": 7869774.0, | |
| "step": 211 | |
| }, | |
| { | |
| "entropy": 0.6151341274380684, | |
| "epoch": 1.3769293257514217, | |
| "grad_norm": 0.008890950120985508, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6140053272247314, | |
| "mean_token_accuracy": 0.7508121132850647, | |
| "num_tokens": 7906943.0, | |
| "step": 212 | |
| }, | |
| { | |
| "entropy": 0.6221983805298805, | |
| "epoch": 1.3834281072298944, | |
| "grad_norm": 0.009338715113699436, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6216065883636475, | |
| "mean_token_accuracy": 0.7504482716321945, | |
| "num_tokens": 7944646.0, | |
| "step": 213 | |
| }, | |
| { | |
| "entropy": 0.6131090745329857, | |
| "epoch": 1.3899268887083671, | |
| "grad_norm": 0.00849352777004242, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6095527410507202, | |
| "mean_token_accuracy": 0.7533553466200829, | |
| "num_tokens": 7982267.0, | |
| "step": 214 | |
| }, | |
| { | |
| "entropy": 0.6085495501756668, | |
| "epoch": 1.39642567018684, | |
| "grad_norm": 0.007540795486420393, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6092317700386047, | |
| "mean_token_accuracy": 0.7533180490136147, | |
| "num_tokens": 8019466.0, | |
| "step": 215 | |
| }, | |
| { | |
| "entropy": 0.6296884343028069, | |
| "epoch": 1.4029244516653128, | |
| "grad_norm": 0.009902682155370712, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6364089250564575, | |
| "mean_token_accuracy": 0.7428499311208725, | |
| "num_tokens": 8057400.0, | |
| "step": 216 | |
| }, | |
| { | |
| "entropy": 0.6165885776281357, | |
| "epoch": 1.4094232331437855, | |
| "grad_norm": 0.00911257229745388, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6247788071632385, | |
| "mean_token_accuracy": 0.7464938163757324, | |
| "num_tokens": 8094904.0, | |
| "step": 217 | |
| }, | |
| { | |
| "entropy": 0.6157428845763206, | |
| "epoch": 1.4159220146222582, | |
| "grad_norm": 0.007997944951057434, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6201274394989014, | |
| "mean_token_accuracy": 0.7489686757326126, | |
| "num_tokens": 8132290.0, | |
| "step": 218 | |
| }, | |
| { | |
| "entropy": 0.6217053309082985, | |
| "epoch": 1.4224207961007311, | |
| "grad_norm": 0.00811337772756815, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6197227239608765, | |
| "mean_token_accuracy": 0.7485419660806656, | |
| "num_tokens": 8169791.0, | |
| "step": 219 | |
| }, | |
| { | |
| "entropy": 0.615436315536499, | |
| "epoch": 1.4289195775792038, | |
| "grad_norm": 0.008888707496225834, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6124907732009888, | |
| "mean_token_accuracy": 0.751116119325161, | |
| "num_tokens": 8207092.0, | |
| "step": 220 | |
| }, | |
| { | |
| "entropy": 0.6246543675661087, | |
| "epoch": 1.4354183590576768, | |
| "grad_norm": 0.008732281625270844, | |
| "learning_rate": 0.0002, | |
| "loss": 0.623694658279419, | |
| "mean_token_accuracy": 0.7458877414464951, | |
| "num_tokens": 8244309.0, | |
| "step": 221 | |
| }, | |
| { | |
| "entropy": 0.6304584518074989, | |
| "epoch": 1.4419171405361495, | |
| "grad_norm": 0.009999740868806839, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6301021575927734, | |
| "mean_token_accuracy": 0.7443124279379845, | |
| "num_tokens": 8281764.0, | |
| "step": 222 | |
| }, | |
| { | |
| "entropy": 0.6228891983628273, | |
| "epoch": 1.4484159220146222, | |
| "grad_norm": 0.009084641933441162, | |
| "learning_rate": 0.0002, | |
| "loss": 0.623934268951416, | |
| "mean_token_accuracy": 0.746678814291954, | |
| "num_tokens": 8319204.0, | |
| "step": 223 | |
| }, | |
| { | |
| "entropy": 0.6163553223013878, | |
| "epoch": 1.454914703493095, | |
| "grad_norm": 0.008567318320274353, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6207892894744873, | |
| "mean_token_accuracy": 0.7486568316817284, | |
| "num_tokens": 8356629.0, | |
| "step": 224 | |
| }, | |
| { | |
| "entropy": 0.6088405475020409, | |
| "epoch": 1.4614134849715679, | |
| "grad_norm": 0.00832637120038271, | |
| "learning_rate": 0.0002, | |
| "loss": 0.612472414970398, | |
| "mean_token_accuracy": 0.7514082416892052, | |
| "num_tokens": 8394033.0, | |
| "step": 225 | |
| }, | |
| { | |
| "entropy": 0.614930123090744, | |
| "epoch": 1.4679122664500406, | |
| "grad_norm": 0.008623549714684486, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6192766427993774, | |
| "mean_token_accuracy": 0.7488296180963516, | |
| "num_tokens": 8431411.0, | |
| "step": 226 | |
| }, | |
| { | |
| "entropy": 0.6123254001140594, | |
| "epoch": 1.4744110479285135, | |
| "grad_norm": 0.008329757489264011, | |
| "learning_rate": 0.0002, | |
| "loss": 0.614305317401886, | |
| "mean_token_accuracy": 0.7501704543828964, | |
| "num_tokens": 8468845.0, | |
| "step": 227 | |
| }, | |
| { | |
| "entropy": 0.6353933066129684, | |
| "epoch": 1.4809098294069862, | |
| "grad_norm": 0.010329898446798325, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6299945712089539, | |
| "mean_token_accuracy": 0.7446781396865845, | |
| "num_tokens": 8506494.0, | |
| "step": 228 | |
| }, | |
| { | |
| "entropy": 0.6230698823928833, | |
| "epoch": 1.487408610885459, | |
| "grad_norm": 0.008529371581971645, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6179029941558838, | |
| "mean_token_accuracy": 0.7506388053297997, | |
| "num_tokens": 8543863.0, | |
| "step": 229 | |
| }, | |
| { | |
| "entropy": 0.6087015345692635, | |
| "epoch": 1.4939073923639317, | |
| "grad_norm": 0.008635671809315681, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6120889186859131, | |
| "mean_token_accuracy": 0.7521615102887154, | |
| "num_tokens": 8580998.0, | |
| "step": 230 | |
| }, | |
| { | |
| "entropy": 0.6111158281564713, | |
| "epoch": 1.5004061738424046, | |
| "grad_norm": 0.009943103417754173, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6142638921737671, | |
| "mean_token_accuracy": 0.7509952187538147, | |
| "num_tokens": 8618445.0, | |
| "step": 231 | |
| }, | |
| { | |
| "entropy": 0.6176108121871948, | |
| "epoch": 1.5069049553208773, | |
| "grad_norm": 0.007991382852196693, | |
| "learning_rate": 0.0002, | |
| "loss": 0.619983434677124, | |
| "mean_token_accuracy": 0.7502688392996788, | |
| "num_tokens": 8655969.0, | |
| "step": 232 | |
| }, | |
| { | |
| "entropy": 0.6207513734698296, | |
| "epoch": 1.5134037367993503, | |
| "grad_norm": 0.0076866415329277515, | |
| "learning_rate": 0.0002, | |
| "loss": 0.626140296459198, | |
| "mean_token_accuracy": 0.7469011545181274, | |
| "num_tokens": 8693748.0, | |
| "step": 233 | |
| }, | |
| { | |
| "entropy": 0.6301305815577507, | |
| "epoch": 1.519902518277823, | |
| "grad_norm": 0.007992899045348167, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6301756501197815, | |
| "mean_token_accuracy": 0.744783528149128, | |
| "num_tokens": 8730930.0, | |
| "step": 234 | |
| }, | |
| { | |
| "entropy": 0.6271040365099907, | |
| "epoch": 1.5264012997562957, | |
| "grad_norm": 0.008258827030658722, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6266668438911438, | |
| "mean_token_accuracy": 0.746114693582058, | |
| "num_tokens": 8768377.0, | |
| "step": 235 | |
| }, | |
| { | |
| "entropy": 0.6152656748890877, | |
| "epoch": 1.5329000812347684, | |
| "grad_norm": 0.0098560880869627, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6164472103118896, | |
| "mean_token_accuracy": 0.7489713951945305, | |
| "num_tokens": 8805779.0, | |
| "step": 236 | |
| }, | |
| { | |
| "entropy": 0.6294426172971725, | |
| "epoch": 1.5393988627132411, | |
| "grad_norm": 0.008523919619619846, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6326299905776978, | |
| "mean_token_accuracy": 0.742644876241684, | |
| "num_tokens": 8843123.0, | |
| "step": 237 | |
| }, | |
| { | |
| "entropy": 0.6143188178539276, | |
| "epoch": 1.545897644191714, | |
| "grad_norm": 0.007758335676044226, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6136566996574402, | |
| "mean_token_accuracy": 0.7520029693841934, | |
| "num_tokens": 8880249.0, | |
| "step": 238 | |
| }, | |
| { | |
| "entropy": 0.627038024365902, | |
| "epoch": 1.552396425670187, | |
| "grad_norm": 0.00911460816860199, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6299710869789124, | |
| "mean_token_accuracy": 0.7446892932057381, | |
| "num_tokens": 8917829.0, | |
| "step": 239 | |
| }, | |
| { | |
| "entropy": 0.6183791384100914, | |
| "epoch": 1.5588952071486597, | |
| "grad_norm": 0.008657646365463734, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6220093965530396, | |
| "mean_token_accuracy": 0.7485999315977097, | |
| "num_tokens": 8955243.0, | |
| "step": 240 | |
| }, | |
| { | |
| "entropy": 0.6323986351490021, | |
| "epoch": 1.5653939886271324, | |
| "grad_norm": 0.0085441330447793, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6361583471298218, | |
| "mean_token_accuracy": 0.7442645356059074, | |
| "num_tokens": 8992960.0, | |
| "step": 241 | |
| }, | |
| { | |
| "entropy": 0.6108334213495255, | |
| "epoch": 1.5718927701056051, | |
| "grad_norm": 0.007725970819592476, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6101396083831787, | |
| "mean_token_accuracy": 0.7506669163703918, | |
| "num_tokens": 9030523.0, | |
| "step": 242 | |
| }, | |
| { | |
| "entropy": 0.6231397688388824, | |
| "epoch": 1.5783915515840778, | |
| "grad_norm": 0.008767355233430862, | |
| "learning_rate": 0.0002, | |
| "loss": 0.622745156288147, | |
| "mean_token_accuracy": 0.7461344972252846, | |
| "num_tokens": 9067759.0, | |
| "step": 243 | |
| }, | |
| { | |
| "entropy": 0.627980038523674, | |
| "epoch": 1.5848903330625508, | |
| "grad_norm": 0.00843246839940548, | |
| "learning_rate": 0.0002, | |
| "loss": 0.632775604724884, | |
| "mean_token_accuracy": 0.7432630062103271, | |
| "num_tokens": 9105200.0, | |
| "step": 244 | |
| }, | |
| { | |
| "entropy": 0.6222330331802368, | |
| "epoch": 1.5913891145410237, | |
| "grad_norm": 0.008817244321107864, | |
| "learning_rate": 0.0002, | |
| "loss": 0.625479519367218, | |
| "mean_token_accuracy": 0.7454850673675537, | |
| "num_tokens": 9142588.0, | |
| "step": 245 | |
| }, | |
| { | |
| "entropy": 0.6129688546061516, | |
| "epoch": 1.5978878960194964, | |
| "grad_norm": 0.009856261312961578, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6199933886528015, | |
| "mean_token_accuracy": 0.7487855926156044, | |
| "num_tokens": 9179884.0, | |
| "step": 246 | |
| }, | |
| { | |
| "entropy": 0.6239286884665489, | |
| "epoch": 1.6043866774979691, | |
| "grad_norm": 0.008906936272978783, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6204976439476013, | |
| "mean_token_accuracy": 0.7508985996246338, | |
| "num_tokens": 9217103.0, | |
| "step": 247 | |
| }, | |
| { | |
| "entropy": 0.6336326971650124, | |
| "epoch": 1.6108854589764419, | |
| "grad_norm": 0.011355509981513023, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6262732744216919, | |
| "mean_token_accuracy": 0.7465848848223686, | |
| "num_tokens": 9254644.0, | |
| "step": 248 | |
| }, | |
| { | |
| "entropy": 0.6203413605690002, | |
| "epoch": 1.6173842404549146, | |
| "grad_norm": 0.007735299877822399, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6212904453277588, | |
| "mean_token_accuracy": 0.7472884654998779, | |
| "num_tokens": 9291724.0, | |
| "step": 249 | |
| }, | |
| { | |
| "entropy": 0.6144890040159225, | |
| "epoch": 1.6238830219333875, | |
| "grad_norm": 0.007746159564703703, | |
| "learning_rate": 0.0002, | |
| "loss": 0.619687557220459, | |
| "mean_token_accuracy": 0.7471293359994888, | |
| "num_tokens": 9328841.0, | |
| "step": 250 | |
| }, | |
| { | |
| "entropy": 0.6305414438247681, | |
| "epoch": 1.6303818034118602, | |
| "grad_norm": 0.010060657747089863, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6419017314910889, | |
| "mean_token_accuracy": 0.7386629730463028, | |
| "num_tokens": 9366411.0, | |
| "step": 251 | |
| }, | |
| { | |
| "entropy": 0.6339073181152344, | |
| "epoch": 1.6368805848903332, | |
| "grad_norm": 0.007909824140369892, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6384083032608032, | |
| "mean_token_accuracy": 0.7414835765957832, | |
| "num_tokens": 9403421.0, | |
| "step": 252 | |
| }, | |
| { | |
| "entropy": 0.6129219457507133, | |
| "epoch": 1.6433793663688059, | |
| "grad_norm": 0.007407526019960642, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6125075817108154, | |
| "mean_token_accuracy": 0.752901516854763, | |
| "num_tokens": 9440793.0, | |
| "step": 253 | |
| }, | |
| { | |
| "entropy": 0.6255052834749222, | |
| "epoch": 1.6498781478472786, | |
| "grad_norm": 0.008314264938235283, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6215559244155884, | |
| "mean_token_accuracy": 0.7486165389418602, | |
| "num_tokens": 9477882.0, | |
| "step": 254 | |
| }, | |
| { | |
| "entropy": 0.6231755018234253, | |
| "epoch": 1.6563769293257513, | |
| "grad_norm": 0.0075997961685061455, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6211115121841431, | |
| "mean_token_accuracy": 0.7495426833629608, | |
| "num_tokens": 9515444.0, | |
| "step": 255 | |
| }, | |
| { | |
| "entropy": 0.6108886152505875, | |
| "epoch": 1.6628757108042242, | |
| "grad_norm": 0.007718959823250771, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6141905784606934, | |
| "mean_token_accuracy": 0.7495709583163261, | |
| "num_tokens": 9552755.0, | |
| "step": 256 | |
| }, | |
| { | |
| "entropy": 0.6075874269008636, | |
| "epoch": 1.669374492282697, | |
| "grad_norm": 0.008023767732083797, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6125887632369995, | |
| "mean_token_accuracy": 0.7506251037120819, | |
| "num_tokens": 9590261.0, | |
| "step": 257 | |
| }, | |
| { | |
| "entropy": 0.6148701831698418, | |
| "epoch": 1.67587327376117, | |
| "grad_norm": 0.008702424354851246, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6215870380401611, | |
| "mean_token_accuracy": 0.7478265091776848, | |
| "num_tokens": 9627758.0, | |
| "step": 258 | |
| }, | |
| { | |
| "entropy": 0.6036238297820091, | |
| "epoch": 1.6823720552396426, | |
| "grad_norm": 0.007766771595925093, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6084332466125488, | |
| "mean_token_accuracy": 0.7513664737343788, | |
| "num_tokens": 9664761.0, | |
| "step": 259 | |
| }, | |
| { | |
| "entropy": 0.6297216266393661, | |
| "epoch": 1.6888708367181153, | |
| "grad_norm": 0.009538715705275536, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6225094795227051, | |
| "mean_token_accuracy": 0.7476939931511879, | |
| "num_tokens": 9702161.0, | |
| "step": 260 | |
| }, | |
| { | |
| "entropy": 0.6292383894324303, | |
| "epoch": 1.695369618196588, | |
| "grad_norm": 0.00895692128688097, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6246432065963745, | |
| "mean_token_accuracy": 0.7490787208080292, | |
| "num_tokens": 9739248.0, | |
| "step": 261 | |
| }, | |
| { | |
| "entropy": 0.6182943060994148, | |
| "epoch": 1.7018683996750608, | |
| "grad_norm": 0.008069152012467384, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6146731972694397, | |
| "mean_token_accuracy": 0.7493266090750694, | |
| "num_tokens": 9776948.0, | |
| "step": 262 | |
| }, | |
| { | |
| "entropy": 0.6093627437949181, | |
| "epoch": 1.7083671811535337, | |
| "grad_norm": 0.00886097177863121, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6172748804092407, | |
| "mean_token_accuracy": 0.7474698126316071, | |
| "num_tokens": 9814118.0, | |
| "step": 263 | |
| }, | |
| { | |
| "entropy": 0.599872387945652, | |
| "epoch": 1.7148659626320066, | |
| "grad_norm": 0.009245996363461018, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6081432700157166, | |
| "mean_token_accuracy": 0.7528064101934433, | |
| "num_tokens": 9851508.0, | |
| "step": 264 | |
| }, | |
| { | |
| "entropy": 0.6169805154204369, | |
| "epoch": 1.7213647441104794, | |
| "grad_norm": 0.009072757326066494, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6274439096450806, | |
| "mean_token_accuracy": 0.7459535896778107, | |
| "num_tokens": 9889084.0, | |
| "step": 265 | |
| }, | |
| { | |
| "entropy": 0.6127713099122047, | |
| "epoch": 1.727863525588952, | |
| "grad_norm": 0.0077358693815767765, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6177385449409485, | |
| "mean_token_accuracy": 0.7487060204148293, | |
| "num_tokens": 9926415.0, | |
| "step": 266 | |
| }, | |
| { | |
| "entropy": 0.6123405247926712, | |
| "epoch": 1.7343623070674248, | |
| "grad_norm": 0.00807071104645729, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6082473397254944, | |
| "mean_token_accuracy": 0.7525108605623245, | |
| "num_tokens": 9963968.0, | |
| "step": 267 | |
| }, | |
| { | |
| "entropy": 0.616507887840271, | |
| "epoch": 1.7408610885458975, | |
| "grad_norm": 0.008352074772119522, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6156948804855347, | |
| "mean_token_accuracy": 0.7471591085195541, | |
| "num_tokens": 10001164.0, | |
| "step": 268 | |
| }, | |
| { | |
| "entropy": 0.6224628537893295, | |
| "epoch": 1.7473598700243704, | |
| "grad_norm": 0.00863809883594513, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6212406158447266, | |
| "mean_token_accuracy": 0.7489727661013603, | |
| "num_tokens": 10038309.0, | |
| "step": 269 | |
| }, | |
| { | |
| "entropy": 0.6216438189148903, | |
| "epoch": 1.7538586515028434, | |
| "grad_norm": 0.00882699340581894, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6236106157302856, | |
| "mean_token_accuracy": 0.7466619610786438, | |
| "num_tokens": 10075167.0, | |
| "step": 270 | |
| }, | |
| { | |
| "entropy": 0.6243376582860947, | |
| "epoch": 1.760357432981316, | |
| "grad_norm": 0.008083442226052284, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6196388006210327, | |
| "mean_token_accuracy": 0.7481562867760658, | |
| "num_tokens": 10112463.0, | |
| "step": 271 | |
| }, | |
| { | |
| "entropy": 0.6375504732131958, | |
| "epoch": 1.7668562144597888, | |
| "grad_norm": 0.009407855570316315, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6351386308670044, | |
| "mean_token_accuracy": 0.7419685274362564, | |
| "num_tokens": 10150145.0, | |
| "step": 272 | |
| }, | |
| { | |
| "entropy": 0.6064025089144707, | |
| "epoch": 1.7733549959382615, | |
| "grad_norm": 0.008066139183938503, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6098955273628235, | |
| "mean_token_accuracy": 0.7515333816409111, | |
| "num_tokens": 10187476.0, | |
| "step": 273 | |
| }, | |
| { | |
| "entropy": 0.609002947807312, | |
| "epoch": 1.7798537774167342, | |
| "grad_norm": 0.0090776477009058, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6182198524475098, | |
| "mean_token_accuracy": 0.749611884355545, | |
| "num_tokens": 10224722.0, | |
| "step": 274 | |
| }, | |
| { | |
| "entropy": 0.6023535504937172, | |
| "epoch": 1.7863525588952072, | |
| "grad_norm": 0.008943675085902214, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6131588220596313, | |
| "mean_token_accuracy": 0.7517130747437477, | |
| "num_tokens": 10262008.0, | |
| "step": 275 | |
| }, | |
| { | |
| "entropy": 0.6100214198231697, | |
| "epoch": 1.7928513403736799, | |
| "grad_norm": 0.00780687527731061, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6113550066947937, | |
| "mean_token_accuracy": 0.7519525811076164, | |
| "num_tokens": 10299484.0, | |
| "step": 276 | |
| }, | |
| { | |
| "entropy": 0.6407601237297058, | |
| "epoch": 1.7993501218521528, | |
| "grad_norm": 0.008408503606915474, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6413571834564209, | |
| "mean_token_accuracy": 0.7412156239151955, | |
| "num_tokens": 10337204.0, | |
| "step": 277 | |
| }, | |
| { | |
| "entropy": 0.6267746239900589, | |
| "epoch": 1.8058489033306255, | |
| "grad_norm": 0.00864301435649395, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6232145428657532, | |
| "mean_token_accuracy": 0.7470541223883629, | |
| "num_tokens": 10374550.0, | |
| "step": 278 | |
| }, | |
| { | |
| "entropy": 0.6293241009116173, | |
| "epoch": 1.8123476848090982, | |
| "grad_norm": 0.00788764376193285, | |
| "learning_rate": 0.0002, | |
| "loss": 0.624733567237854, | |
| "mean_token_accuracy": 0.7457406893372536, | |
| "num_tokens": 10412206.0, | |
| "step": 279 | |
| }, | |
| { | |
| "entropy": 0.6171272769570351, | |
| "epoch": 1.818846466287571, | |
| "grad_norm": 0.006805213168263435, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6169811487197876, | |
| "mean_token_accuracy": 0.7512501701712608, | |
| "num_tokens": 10449535.0, | |
| "step": 280 | |
| }, | |
| { | |
| "entropy": 0.6095528453588486, | |
| "epoch": 1.825345247766044, | |
| "grad_norm": 0.007181530352681875, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6091392040252686, | |
| "mean_token_accuracy": 0.752260759472847, | |
| "num_tokens": 10487049.0, | |
| "step": 281 | |
| }, | |
| { | |
| "entropy": 0.61494529992342, | |
| "epoch": 1.8318440292445166, | |
| "grad_norm": 0.008495395071804523, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6144075393676758, | |
| "mean_token_accuracy": 0.7521442621946335, | |
| "num_tokens": 10524737.0, | |
| "step": 282 | |
| }, | |
| { | |
| "entropy": 0.6196796670556068, | |
| "epoch": 1.8383428107229896, | |
| "grad_norm": 0.00890264380723238, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6239107847213745, | |
| "mean_token_accuracy": 0.7463233023881912, | |
| "num_tokens": 10562188.0, | |
| "step": 283 | |
| }, | |
| { | |
| "entropy": 0.5968083441257477, | |
| "epoch": 1.8448415922014623, | |
| "grad_norm": 0.007078610826283693, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5999591946601868, | |
| "mean_token_accuracy": 0.7574170976877213, | |
| "num_tokens": 10599566.0, | |
| "step": 284 | |
| }, | |
| { | |
| "entropy": 0.6290047243237495, | |
| "epoch": 1.851340373679935, | |
| "grad_norm": 0.0070074331015348434, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6321331262588501, | |
| "mean_token_accuracy": 0.7435007244348526, | |
| "num_tokens": 10637008.0, | |
| "step": 285 | |
| }, | |
| { | |
| "entropy": 0.6198180019855499, | |
| "epoch": 1.8578391551584077, | |
| "grad_norm": 0.0070502436719834805, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6187317967414856, | |
| "mean_token_accuracy": 0.7489558085799217, | |
| "num_tokens": 10674608.0, | |
| "step": 286 | |
| }, | |
| { | |
| "entropy": 0.6114784702658653, | |
| "epoch": 1.8643379366368806, | |
| "grad_norm": 0.009826047345995903, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6103346347808838, | |
| "mean_token_accuracy": 0.7504026591777802, | |
| "num_tokens": 10711947.0, | |
| "step": 287 | |
| }, | |
| { | |
| "entropy": 0.6145703047513962, | |
| "epoch": 1.8708367181153533, | |
| "grad_norm": 0.008549013175070286, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6118488311767578, | |
| "mean_token_accuracy": 0.7518711537122726, | |
| "num_tokens": 10749467.0, | |
| "step": 288 | |
| }, | |
| { | |
| "entropy": 0.6132736206054688, | |
| "epoch": 1.8773354995938263, | |
| "grad_norm": 0.00803026370704174, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6166672706604004, | |
| "mean_token_accuracy": 0.749387837946415, | |
| "num_tokens": 10786750.0, | |
| "step": 289 | |
| }, | |
| { | |
| "entropy": 0.6266130581498146, | |
| "epoch": 1.883834281072299, | |
| "grad_norm": 0.008134995587170124, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6310341358184814, | |
| "mean_token_accuracy": 0.743694357573986, | |
| "num_tokens": 10823914.0, | |
| "step": 290 | |
| }, | |
| { | |
| "entropy": 0.6153042837977409, | |
| "epoch": 1.8903330625507717, | |
| "grad_norm": 0.009320992045104504, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6227383613586426, | |
| "mean_token_accuracy": 0.7482397258281708, | |
| "num_tokens": 10861283.0, | |
| "step": 291 | |
| }, | |
| { | |
| "entropy": 0.6265768557786942, | |
| "epoch": 1.8968318440292444, | |
| "grad_norm": 0.009208294562995434, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6274023056030273, | |
| "mean_token_accuracy": 0.7459790334105492, | |
| "num_tokens": 10898650.0, | |
| "step": 292 | |
| }, | |
| { | |
| "entropy": 0.6209842190146446, | |
| "epoch": 1.9033306255077171, | |
| "grad_norm": 0.007123781833797693, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6167253255844116, | |
| "mean_token_accuracy": 0.7506068870425224, | |
| "num_tokens": 10936405.0, | |
| "step": 293 | |
| }, | |
| { | |
| "entropy": 0.6177584528923035, | |
| "epoch": 1.90982940698619, | |
| "grad_norm": 0.0075668166391551495, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6163274049758911, | |
| "mean_token_accuracy": 0.7489276751875877, | |
| "num_tokens": 10973923.0, | |
| "step": 294 | |
| }, | |
| { | |
| "entropy": 0.6218736097216606, | |
| "epoch": 1.916328188464663, | |
| "grad_norm": 0.0085530336946249, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6214455366134644, | |
| "mean_token_accuracy": 0.747297577559948, | |
| "num_tokens": 11011183.0, | |
| "step": 295 | |
| }, | |
| { | |
| "entropy": 0.6203776001930237, | |
| "epoch": 1.9228269699431357, | |
| "grad_norm": 0.008531006053090096, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6233081817626953, | |
| "mean_token_accuracy": 0.7472613751888275, | |
| "num_tokens": 11048409.0, | |
| "step": 296 | |
| }, | |
| { | |
| "entropy": 0.6170744299888611, | |
| "epoch": 1.9293257514216084, | |
| "grad_norm": 0.006794555112719536, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6177318096160889, | |
| "mean_token_accuracy": 0.7481219694018364, | |
| "num_tokens": 11085854.0, | |
| "step": 297 | |
| }, | |
| { | |
| "entropy": 0.6205914691090584, | |
| "epoch": 1.9358245329000812, | |
| "grad_norm": 0.00894018355756998, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6211514472961426, | |
| "mean_token_accuracy": 0.7470626905560493, | |
| "num_tokens": 11122678.0, | |
| "step": 298 | |
| }, | |
| { | |
| "entropy": 0.6179786175489426, | |
| "epoch": 1.9423233143785539, | |
| "grad_norm": 0.008218267932534218, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6211084723472595, | |
| "mean_token_accuracy": 0.7481166496872902, | |
| "num_tokens": 11160207.0, | |
| "step": 299 | |
| }, | |
| { | |
| "entropy": 0.6241402998566628, | |
| "epoch": 1.9488220958570268, | |
| "grad_norm": 0.008334561251103878, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6270841360092163, | |
| "mean_token_accuracy": 0.7478617802262306, | |
| "num_tokens": 11197850.0, | |
| "step": 300 | |
| }, | |
| { | |
| "entropy": 0.6133561357855797, | |
| "epoch": 1.9553208773354998, | |
| "grad_norm": 0.0071178278885781765, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6169086694717407, | |
| "mean_token_accuracy": 0.7505014687776566, | |
| "num_tokens": 11235129.0, | |
| "step": 301 | |
| }, | |
| { | |
| "entropy": 0.6112445220351219, | |
| "epoch": 1.9618196588139725, | |
| "grad_norm": 0.00821610540151596, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6131574511528015, | |
| "mean_token_accuracy": 0.7517394497990608, | |
| "num_tokens": 11272140.0, | |
| "step": 302 | |
| }, | |
| { | |
| "entropy": 0.6255387738347054, | |
| "epoch": 1.9683184402924452, | |
| "grad_norm": 0.009108194150030613, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6270141005516052, | |
| "mean_token_accuracy": 0.7442326322197914, | |
| "num_tokens": 11309074.0, | |
| "step": 303 | |
| }, | |
| { | |
| "entropy": 0.6138653978705406, | |
| "epoch": 1.974817221770918, | |
| "grad_norm": 0.007860496640205383, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6152341961860657, | |
| "mean_token_accuracy": 0.7488235086202621, | |
| "num_tokens": 11346694.0, | |
| "step": 304 | |
| }, | |
| { | |
| "entropy": 0.6311385780572891, | |
| "epoch": 1.9813160032493906, | |
| "grad_norm": 0.008101027458906174, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6344274282455444, | |
| "mean_token_accuracy": 0.7414661273360252, | |
| "num_tokens": 11384229.0, | |
| "step": 305 | |
| }, | |
| { | |
| "entropy": 0.6193428635597229, | |
| "epoch": 1.9878147847278635, | |
| "grad_norm": 0.007910770364105701, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6175734400749207, | |
| "mean_token_accuracy": 0.7502587288618088, | |
| "num_tokens": 11421788.0, | |
| "step": 306 | |
| }, | |
| { | |
| "entropy": 0.6222855523228645, | |
| "epoch": 1.9943135662063363, | |
| "grad_norm": 0.008522240445017815, | |
| "learning_rate": 0.0002, | |
| "loss": 0.623339831829071, | |
| "mean_token_accuracy": 0.7481605112552643, | |
| "num_tokens": 11459154.0, | |
| "step": 307 | |
| }, | |
| { | |
| "entropy": 0.6278953552246094, | |
| "epoch": 2.0, | |
| "grad_norm": 0.008388028480112553, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6375839710235596, | |
| "mean_token_accuracy": 0.7482074073382786, | |
| "num_tokens": 11475381.0, | |
| "step": 308 | |
| }, | |
| { | |
| "entropy": 0.613355465233326, | |
| "epoch": 2.0064987814784727, | |
| "grad_norm": 0.00827846396714449, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6111053228378296, | |
| "mean_token_accuracy": 0.7524029165506363, | |
| "num_tokens": 11512446.0, | |
| "step": 309 | |
| }, | |
| { | |
| "entropy": 0.6208668798208237, | |
| "epoch": 2.0129975629569454, | |
| "grad_norm": 0.008557752706110477, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6219561100006104, | |
| "mean_token_accuracy": 0.7458884716033936, | |
| "num_tokens": 11549773.0, | |
| "step": 310 | |
| }, | |
| { | |
| "entropy": 0.6194536536931992, | |
| "epoch": 2.019496344435418, | |
| "grad_norm": 0.009552874602377415, | |
| "learning_rate": 0.0002, | |
| "loss": 0.624874472618103, | |
| "mean_token_accuracy": 0.7470095753669739, | |
| "num_tokens": 11587104.0, | |
| "step": 311 | |
| }, | |
| { | |
| "entropy": 0.6137440055608749, | |
| "epoch": 2.0259951259138913, | |
| "grad_norm": 0.008704678155481815, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6167584657669067, | |
| "mean_token_accuracy": 0.7494626566767693, | |
| "num_tokens": 11624387.0, | |
| "step": 312 | |
| }, | |
| { | |
| "entropy": 0.6213903650641441, | |
| "epoch": 2.032493907392364, | |
| "grad_norm": 0.007905784994363785, | |
| "learning_rate": 0.0002, | |
| "loss": 0.622920036315918, | |
| "mean_token_accuracy": 0.7466430589556694, | |
| "num_tokens": 11661928.0, | |
| "step": 313 | |
| }, | |
| { | |
| "entropy": 0.608438141644001, | |
| "epoch": 2.0389926888708367, | |
| "grad_norm": 0.008782708086073399, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6084336638450623, | |
| "mean_token_accuracy": 0.7526147440075874, | |
| "num_tokens": 11699518.0, | |
| "step": 314 | |
| }, | |
| { | |
| "entropy": 0.6130177453160286, | |
| "epoch": 2.0454914703493094, | |
| "grad_norm": 0.009063824079930782, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6168864965438843, | |
| "mean_token_accuracy": 0.7494284063577652, | |
| "num_tokens": 11737013.0, | |
| "step": 315 | |
| }, | |
| { | |
| "entropy": 0.6137471869587898, | |
| "epoch": 2.051990251827782, | |
| "grad_norm": 0.008271057158708572, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6143357753753662, | |
| "mean_token_accuracy": 0.7498123943805695, | |
| "num_tokens": 11774346.0, | |
| "step": 316 | |
| }, | |
| { | |
| "entropy": 0.6195183843374252, | |
| "epoch": 2.058489033306255, | |
| "grad_norm": 0.007240446750074625, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6194902062416077, | |
| "mean_token_accuracy": 0.7464936003088951, | |
| "num_tokens": 11811650.0, | |
| "step": 317 | |
| }, | |
| { | |
| "entropy": 0.6273763924837112, | |
| "epoch": 2.064987814784728, | |
| "grad_norm": 0.009513584896922112, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6216360330581665, | |
| "mean_token_accuracy": 0.7472178563475609, | |
| "num_tokens": 11849227.0, | |
| "step": 318 | |
| }, | |
| { | |
| "entropy": 0.6146251261234283, | |
| "epoch": 2.0714865962632008, | |
| "grad_norm": 0.007890078239142895, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6166911721229553, | |
| "mean_token_accuracy": 0.7501556724309921, | |
| "num_tokens": 11886732.0, | |
| "step": 319 | |
| }, | |
| { | |
| "entropy": 0.5975739285349846, | |
| "epoch": 2.0779853777416735, | |
| "grad_norm": 0.009085185825824738, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6020256280899048, | |
| "mean_token_accuracy": 0.7525540143251419, | |
| "num_tokens": 11923954.0, | |
| "step": 320 | |
| }, | |
| { | |
| "entropy": 0.6165630891919136, | |
| "epoch": 2.084484159220146, | |
| "grad_norm": 0.006837225519120693, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6179453134536743, | |
| "mean_token_accuracy": 0.7491353005170822, | |
| "num_tokens": 11961305.0, | |
| "step": 321 | |
| }, | |
| { | |
| "entropy": 0.6221051812171936, | |
| "epoch": 2.090982940698619, | |
| "grad_norm": 0.007578800432384014, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6233739852905273, | |
| "mean_token_accuracy": 0.7461354285478592, | |
| "num_tokens": 11998561.0, | |
| "step": 322 | |
| }, | |
| { | |
| "entropy": 0.6175716295838356, | |
| "epoch": 2.0974817221770916, | |
| "grad_norm": 0.008444663137197495, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6204410791397095, | |
| "mean_token_accuracy": 0.7468695417046547, | |
| "num_tokens": 12035916.0, | |
| "step": 323 | |
| }, | |
| { | |
| "entropy": 0.6165966615080833, | |
| "epoch": 2.1039805036555648, | |
| "grad_norm": 0.008185302838683128, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6171708106994629, | |
| "mean_token_accuracy": 0.7481535449624062, | |
| "num_tokens": 12073704.0, | |
| "step": 324 | |
| }, | |
| { | |
| "entropy": 0.6210658326745033, | |
| "epoch": 2.1104792851340375, | |
| "grad_norm": 0.0074119968339800835, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6183840036392212, | |
| "mean_token_accuracy": 0.7473175972700119, | |
| "num_tokens": 12111357.0, | |
| "step": 325 | |
| }, | |
| { | |
| "entropy": 0.617885060608387, | |
| "epoch": 2.11697806661251, | |
| "grad_norm": 0.007906505838036537, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6161532998085022, | |
| "mean_token_accuracy": 0.7496127933263779, | |
| "num_tokens": 12148879.0, | |
| "step": 326 | |
| }, | |
| { | |
| "entropy": 0.6197918429970741, | |
| "epoch": 2.123476848090983, | |
| "grad_norm": 0.007352263201028109, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6218726634979248, | |
| "mean_token_accuracy": 0.7473544403910637, | |
| "num_tokens": 12186546.0, | |
| "step": 327 | |
| }, | |
| { | |
| "entropy": 0.6142667904496193, | |
| "epoch": 2.1299756295694556, | |
| "grad_norm": 0.008285868912935257, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6169737577438354, | |
| "mean_token_accuracy": 0.7486495152115822, | |
| "num_tokens": 12223727.0, | |
| "step": 328 | |
| }, | |
| { | |
| "entropy": 0.6135031282901764, | |
| "epoch": 2.1364744110479283, | |
| "grad_norm": 0.00797727145254612, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6149879097938538, | |
| "mean_token_accuracy": 0.7501881718635559, | |
| "num_tokens": 12261432.0, | |
| "step": 329 | |
| }, | |
| { | |
| "entropy": 0.614725299179554, | |
| "epoch": 2.1429731925264015, | |
| "grad_norm": 0.0077530802227556705, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6197780966758728, | |
| "mean_token_accuracy": 0.7476382106542587, | |
| "num_tokens": 12298773.0, | |
| "step": 330 | |
| }, | |
| { | |
| "entropy": 0.6204890534281731, | |
| "epoch": 2.149471974004874, | |
| "grad_norm": 0.007455397862941027, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6217861175537109, | |
| "mean_token_accuracy": 0.7472267374396324, | |
| "num_tokens": 12335838.0, | |
| "step": 331 | |
| }, | |
| { | |
| "entropy": 0.6141664981842041, | |
| "epoch": 2.155970755483347, | |
| "grad_norm": 0.007735258899629116, | |
| "learning_rate": 0.0002, | |
| "loss": 0.619376540184021, | |
| "mean_token_accuracy": 0.7473561838269234, | |
| "num_tokens": 12373171.0, | |
| "step": 332 | |
| }, | |
| { | |
| "entropy": 0.6120809391140938, | |
| "epoch": 2.1624695369618196, | |
| "grad_norm": 0.008401036262512207, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6154431700706482, | |
| "mean_token_accuracy": 0.7471263483166695, | |
| "num_tokens": 12410549.0, | |
| "step": 333 | |
| }, | |
| { | |
| "entropy": 0.6145179942250252, | |
| "epoch": 2.1689683184402924, | |
| "grad_norm": 0.00904724933207035, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6087259650230408, | |
| "mean_token_accuracy": 0.7501003369688988, | |
| "num_tokens": 12447788.0, | |
| "step": 334 | |
| }, | |
| { | |
| "entropy": 0.6214614436030388, | |
| "epoch": 2.175467099918765, | |
| "grad_norm": 0.007604485843330622, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6169778108596802, | |
| "mean_token_accuracy": 0.7492403090000153, | |
| "num_tokens": 12485368.0, | |
| "step": 335 | |
| }, | |
| { | |
| "entropy": 0.6146392300724983, | |
| "epoch": 2.181965881397238, | |
| "grad_norm": 0.008299093693494797, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6154477596282959, | |
| "mean_token_accuracy": 0.7474880516529083, | |
| "num_tokens": 12522590.0, | |
| "step": 336 | |
| }, | |
| { | |
| "entropy": 0.6179040372371674, | |
| "epoch": 2.188464662875711, | |
| "grad_norm": 0.009656457230448723, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6244622468948364, | |
| "mean_token_accuracy": 0.74583899974823, | |
| "num_tokens": 12559957.0, | |
| "step": 337 | |
| }, | |
| { | |
| "entropy": 0.6236468479037285, | |
| "epoch": 2.1949634443541837, | |
| "grad_norm": 0.008342688903212547, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6273738145828247, | |
| "mean_token_accuracy": 0.7441191673278809, | |
| "num_tokens": 12597080.0, | |
| "step": 338 | |
| }, | |
| { | |
| "entropy": 0.6155964732170105, | |
| "epoch": 2.2014622258326564, | |
| "grad_norm": 0.008706323802471161, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6139167547225952, | |
| "mean_token_accuracy": 0.7505380213260651, | |
| "num_tokens": 12634470.0, | |
| "step": 339 | |
| }, | |
| { | |
| "entropy": 0.6147474870085716, | |
| "epoch": 2.207961007311129, | |
| "grad_norm": 0.009130026213824749, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6147286891937256, | |
| "mean_token_accuracy": 0.7490043491125107, | |
| "num_tokens": 12671909.0, | |
| "step": 340 | |
| }, | |
| { | |
| "entropy": 0.6133714243769646, | |
| "epoch": 2.214459788789602, | |
| "grad_norm": 0.008477689698338509, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6187378168106079, | |
| "mean_token_accuracy": 0.7469930872321129, | |
| "num_tokens": 12708771.0, | |
| "step": 341 | |
| }, | |
| { | |
| "entropy": 0.6298847869038582, | |
| "epoch": 2.2209585702680745, | |
| "grad_norm": 0.009632086381316185, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6292200684547424, | |
| "mean_token_accuracy": 0.7443962469696999, | |
| "num_tokens": 12746208.0, | |
| "step": 342 | |
| }, | |
| { | |
| "entropy": 0.6298182159662247, | |
| "epoch": 2.2274573517465477, | |
| "grad_norm": 0.007817580364644527, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6289129853248596, | |
| "mean_token_accuracy": 0.7439332380890846, | |
| "num_tokens": 12783644.0, | |
| "step": 343 | |
| }, | |
| { | |
| "entropy": 0.6162709593772888, | |
| "epoch": 2.2339561332250204, | |
| "grad_norm": 0.009011663496494293, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6142280101776123, | |
| "mean_token_accuracy": 0.7506413981318474, | |
| "num_tokens": 12821007.0, | |
| "step": 344 | |
| }, | |
| { | |
| "entropy": 0.6286559477448463, | |
| "epoch": 2.240454914703493, | |
| "grad_norm": 0.009188450872898102, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6286423206329346, | |
| "mean_token_accuracy": 0.7440641894936562, | |
| "num_tokens": 12858516.0, | |
| "step": 345 | |
| }, | |
| { | |
| "entropy": 0.6245385706424713, | |
| "epoch": 2.246953696181966, | |
| "grad_norm": 0.009156906045973301, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6278682947158813, | |
| "mean_token_accuracy": 0.7443269118666649, | |
| "num_tokens": 12895999.0, | |
| "step": 346 | |
| }, | |
| { | |
| "entropy": 0.6157897710800171, | |
| "epoch": 2.2534524776604385, | |
| "grad_norm": 0.007890370674431324, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6214807033538818, | |
| "mean_token_accuracy": 0.7472835406661034, | |
| "num_tokens": 12933354.0, | |
| "step": 347 | |
| }, | |
| { | |
| "entropy": 0.6123293116688728, | |
| "epoch": 2.2599512591389113, | |
| "grad_norm": 0.007912621833384037, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6164427995681763, | |
| "mean_token_accuracy": 0.7487083747982979, | |
| "num_tokens": 12970559.0, | |
| "step": 348 | |
| }, | |
| { | |
| "entropy": 0.6260915771126747, | |
| "epoch": 2.2664500406173844, | |
| "grad_norm": 0.008234160020947456, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6222859621047974, | |
| "mean_token_accuracy": 0.7458368241786957, | |
| "num_tokens": 13008283.0, | |
| "step": 349 | |
| }, | |
| { | |
| "entropy": 0.6248592287302017, | |
| "epoch": 2.272948822095857, | |
| "grad_norm": 0.009832987561821938, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6199322938919067, | |
| "mean_token_accuracy": 0.7477703094482422, | |
| "num_tokens": 13045527.0, | |
| "step": 350 | |
| }, | |
| { | |
| "entropy": 0.6275637075304985, | |
| "epoch": 2.27944760357433, | |
| "grad_norm": 0.008727029897272587, | |
| "learning_rate": 0.0002, | |
| "loss": 0.632993221282959, | |
| "mean_token_accuracy": 0.7412514090538025, | |
| "num_tokens": 13082974.0, | |
| "step": 351 | |
| }, | |
| { | |
| "entropy": 0.6118641197681427, | |
| "epoch": 2.2859463850528026, | |
| "grad_norm": 0.009624680504202843, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6219325065612793, | |
| "mean_token_accuracy": 0.7466080039739609, | |
| "num_tokens": 13120093.0, | |
| "step": 352 | |
| }, | |
| { | |
| "entropy": 0.5959088578820229, | |
| "epoch": 2.2924451665312753, | |
| "grad_norm": 0.007752889767289162, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5983707904815674, | |
| "mean_token_accuracy": 0.755429819226265, | |
| "num_tokens": 13157659.0, | |
| "step": 353 | |
| }, | |
| { | |
| "entropy": 0.6112657487392426, | |
| "epoch": 2.298943948009748, | |
| "grad_norm": 0.008281555026769638, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6082602143287659, | |
| "mean_token_accuracy": 0.7516218572854996, | |
| "num_tokens": 13194647.0, | |
| "step": 354 | |
| }, | |
| { | |
| "entropy": 0.6122025474905968, | |
| "epoch": 2.305442729488221, | |
| "grad_norm": 0.008959132246673107, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6142069101333618, | |
| "mean_token_accuracy": 0.7516066282987595, | |
| "num_tokens": 13231933.0, | |
| "step": 355 | |
| }, | |
| { | |
| "entropy": 0.610342264175415, | |
| "epoch": 2.311941510966694, | |
| "grad_norm": 0.0076917321421206, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6098777055740356, | |
| "mean_token_accuracy": 0.7534263134002686, | |
| "num_tokens": 13269472.0, | |
| "step": 356 | |
| }, | |
| { | |
| "entropy": 0.6236057877540588, | |
| "epoch": 2.3184402924451666, | |
| "grad_norm": 0.008514189161360264, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6241997480392456, | |
| "mean_token_accuracy": 0.7468095943331718, | |
| "num_tokens": 13307269.0, | |
| "step": 357 | |
| }, | |
| { | |
| "entropy": 0.6160306110978127, | |
| "epoch": 2.3249390739236393, | |
| "grad_norm": 0.009143211878836155, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6196573972702026, | |
| "mean_token_accuracy": 0.7480775937438011, | |
| "num_tokens": 13344551.0, | |
| "step": 358 | |
| }, | |
| { | |
| "entropy": 0.6120478510856628, | |
| "epoch": 2.331437855402112, | |
| "grad_norm": 0.007592627312988043, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6155714392662048, | |
| "mean_token_accuracy": 0.7500782683491707, | |
| "num_tokens": 13382127.0, | |
| "step": 359 | |
| }, | |
| { | |
| "entropy": 0.6234208717942238, | |
| "epoch": 2.3379366368805847, | |
| "grad_norm": 0.008143738843500614, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6278046369552612, | |
| "mean_token_accuracy": 0.7446608766913414, | |
| "num_tokens": 13419810.0, | |
| "step": 360 | |
| }, | |
| { | |
| "entropy": 0.6157349273562431, | |
| "epoch": 2.3444354183590574, | |
| "grad_norm": 0.008566657081246376, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6156420707702637, | |
| "mean_token_accuracy": 0.7479202896356583, | |
| "num_tokens": 13457273.0, | |
| "step": 361 | |
| }, | |
| { | |
| "entropy": 0.6180937066674232, | |
| "epoch": 2.3509341998375306, | |
| "grad_norm": 0.008304375223815441, | |
| "learning_rate": 0.0002, | |
| "loss": 0.622611403465271, | |
| "mean_token_accuracy": 0.7477732971310616, | |
| "num_tokens": 13494536.0, | |
| "step": 362 | |
| }, | |
| { | |
| "entropy": 0.6232565492391586, | |
| "epoch": 2.3574329813160033, | |
| "grad_norm": 0.008868128061294556, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6260833740234375, | |
| "mean_token_accuracy": 0.7459229752421379, | |
| "num_tokens": 13531864.0, | |
| "step": 363 | |
| }, | |
| { | |
| "entropy": 0.6254989579319954, | |
| "epoch": 2.363931762794476, | |
| "grad_norm": 0.008256005123257637, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6260857582092285, | |
| "mean_token_accuracy": 0.7447438836097717, | |
| "num_tokens": 13569443.0, | |
| "step": 364 | |
| }, | |
| { | |
| "entropy": 0.6221200376749039, | |
| "epoch": 2.3704305442729487, | |
| "grad_norm": 0.009361873380839825, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6180988550186157, | |
| "mean_token_accuracy": 0.7470216527581215, | |
| "num_tokens": 13606513.0, | |
| "step": 365 | |
| }, | |
| { | |
| "entropy": 0.616127498447895, | |
| "epoch": 2.3769293257514215, | |
| "grad_norm": 0.008144999854266644, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6137336492538452, | |
| "mean_token_accuracy": 0.7496519684791565, | |
| "num_tokens": 13643706.0, | |
| "step": 366 | |
| }, | |
| { | |
| "entropy": 0.6194290667772293, | |
| "epoch": 2.3834281072298946, | |
| "grad_norm": 0.008278160355985165, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6232280135154724, | |
| "mean_token_accuracy": 0.7481147646903992, | |
| "num_tokens": 13680957.0, | |
| "step": 367 | |
| }, | |
| { | |
| "entropy": 0.6192846670746803, | |
| "epoch": 2.3899268887083673, | |
| "grad_norm": 0.010223917663097382, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6253848075866699, | |
| "mean_token_accuracy": 0.744193010032177, | |
| "num_tokens": 13717903.0, | |
| "step": 368 | |
| }, | |
| { | |
| "entropy": 0.6221625953912735, | |
| "epoch": 2.39642567018684, | |
| "grad_norm": 0.008200163953006268, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6191288232803345, | |
| "mean_token_accuracy": 0.74726802110672, | |
| "num_tokens": 13755260.0, | |
| "step": 369 | |
| }, | |
| { | |
| "entropy": 0.6163566559553146, | |
| "epoch": 2.4029244516653128, | |
| "grad_norm": 0.007974907755851746, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6134728193283081, | |
| "mean_token_accuracy": 0.7508314996957779, | |
| "num_tokens": 13792517.0, | |
| "step": 370 | |
| }, | |
| { | |
| "entropy": 0.6114080101251602, | |
| "epoch": 2.4094232331437855, | |
| "grad_norm": 0.008343557827174664, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6111307144165039, | |
| "mean_token_accuracy": 0.7514908611774445, | |
| "num_tokens": 13829760.0, | |
| "step": 371 | |
| }, | |
| { | |
| "entropy": 0.5953814163804054, | |
| "epoch": 2.415922014622258, | |
| "grad_norm": 0.01898498833179474, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5988050699234009, | |
| "mean_token_accuracy": 0.7543381601572037, | |
| "num_tokens": 13867370.0, | |
| "step": 372 | |
| }, | |
| { | |
| "entropy": 0.6071057021617889, | |
| "epoch": 2.422420796100731, | |
| "grad_norm": 0.023124704137444496, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6178369522094727, | |
| "mean_token_accuracy": 0.747986689209938, | |
| "num_tokens": 13904625.0, | |
| "step": 373 | |
| }, | |
| { | |
| "entropy": 0.6107468456029892, | |
| "epoch": 2.428919577579204, | |
| "grad_norm": 0.01215590164065361, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6207199096679688, | |
| "mean_token_accuracy": 0.7475155666470528, | |
| "num_tokens": 13942489.0, | |
| "step": 374 | |
| }, | |
| { | |
| "entropy": 0.6124749183654785, | |
| "epoch": 2.435418359057677, | |
| "grad_norm": 0.012728074565529823, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6103756427764893, | |
| "mean_token_accuracy": 0.7500820159912109, | |
| "num_tokens": 13980205.0, | |
| "step": 375 | |
| }, | |
| { | |
| "entropy": 0.6109942868351936, | |
| "epoch": 2.4419171405361495, | |
| "grad_norm": 0.009368120692670345, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6066494584083557, | |
| "mean_token_accuracy": 0.7536064460873604, | |
| "num_tokens": 14017641.0, | |
| "step": 376 | |
| }, | |
| { | |
| "entropy": 0.624424010515213, | |
| "epoch": 2.448415922014622, | |
| "grad_norm": 0.016890961676836014, | |
| "learning_rate": 0.0002, | |
| "loss": 0.614218533039093, | |
| "mean_token_accuracy": 0.7494603618979454, | |
| "num_tokens": 14054677.0, | |
| "step": 377 | |
| }, | |
| { | |
| "entropy": 0.6255820393562317, | |
| "epoch": 2.454914703493095, | |
| "grad_norm": 0.009696394205093384, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6304793357849121, | |
| "mean_token_accuracy": 0.7434439361095428, | |
| "num_tokens": 14091764.0, | |
| "step": 378 | |
| }, | |
| { | |
| "entropy": 0.621983028948307, | |
| "epoch": 2.4614134849715676, | |
| "grad_norm": 0.020173629745841026, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6257689595222473, | |
| "mean_token_accuracy": 0.745697520673275, | |
| "num_tokens": 14129278.0, | |
| "step": 379 | |
| }, | |
| { | |
| "entropy": 0.6207767054438591, | |
| "epoch": 2.467912266450041, | |
| "grad_norm": 0.008954247459769249, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6241703033447266, | |
| "mean_token_accuracy": 0.750006191432476, | |
| "num_tokens": 14167232.0, | |
| "step": 380 | |
| }, | |
| { | |
| "entropy": 0.6112791821360588, | |
| "epoch": 2.4744110479285135, | |
| "grad_norm": 0.009806505404412746, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6147319078445435, | |
| "mean_token_accuracy": 0.7495506927371025, | |
| "num_tokens": 14204632.0, | |
| "step": 381 | |
| }, | |
| { | |
| "entropy": 0.6135937720537186, | |
| "epoch": 2.4809098294069862, | |
| "grad_norm": 0.008928372524678707, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6139630079269409, | |
| "mean_token_accuracy": 0.7506385967135429, | |
| "num_tokens": 14242352.0, | |
| "step": 382 | |
| }, | |
| { | |
| "entropy": 0.6150240004062653, | |
| "epoch": 2.487408610885459, | |
| "grad_norm": 0.015955505892634392, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6152509450912476, | |
| "mean_token_accuracy": 0.7515363991260529, | |
| "num_tokens": 14280058.0, | |
| "step": 383 | |
| }, | |
| { | |
| "entropy": 0.6128680855035782, | |
| "epoch": 2.4939073923639317, | |
| "grad_norm": 0.009567083790898323, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6167535781860352, | |
| "mean_token_accuracy": 0.748919777572155, | |
| "num_tokens": 14317661.0, | |
| "step": 384 | |
| }, | |
| { | |
| "entropy": 0.626237154006958, | |
| "epoch": 2.5004061738424044, | |
| "grad_norm": 0.01046669203788042, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6324093341827393, | |
| "mean_token_accuracy": 0.7444325461983681, | |
| "num_tokens": 14355367.0, | |
| "step": 385 | |
| }, | |
| { | |
| "entropy": 0.6202276349067688, | |
| "epoch": 2.506904955320877, | |
| "grad_norm": 0.007664418779313564, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6191686987876892, | |
| "mean_token_accuracy": 0.7475631311535835, | |
| "num_tokens": 14393315.0, | |
| "step": 386 | |
| }, | |
| { | |
| "entropy": 0.6242005750536919, | |
| "epoch": 2.5134037367993503, | |
| "grad_norm": 0.00844619981944561, | |
| "learning_rate": 0.0002, | |
| "loss": 0.621794581413269, | |
| "mean_token_accuracy": 0.7481283098459244, | |
| "num_tokens": 14430853.0, | |
| "step": 387 | |
| }, | |
| { | |
| "entropy": 0.6239676773548126, | |
| "epoch": 2.519902518277823, | |
| "grad_norm": 0.008689953945577145, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6237965226173401, | |
| "mean_token_accuracy": 0.7461953610181808, | |
| "num_tokens": 14468292.0, | |
| "step": 388 | |
| }, | |
| { | |
| "entropy": 0.6107499524950981, | |
| "epoch": 2.5264012997562957, | |
| "grad_norm": 0.009505955502390862, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6074596643447876, | |
| "mean_token_accuracy": 0.7525542005896568, | |
| "num_tokens": 14505921.0, | |
| "step": 389 | |
| }, | |
| { | |
| "entropy": 0.6142911538481712, | |
| "epoch": 2.5329000812347684, | |
| "grad_norm": 0.009658354334533215, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6198441982269287, | |
| "mean_token_accuracy": 0.7489058822393417, | |
| "num_tokens": 14543384.0, | |
| "step": 390 | |
| }, | |
| { | |
| "entropy": 0.6049473881721497, | |
| "epoch": 2.539398862713241, | |
| "grad_norm": 0.010726661421358585, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6118952631950378, | |
| "mean_token_accuracy": 0.7526208385825157, | |
| "num_tokens": 14580935.0, | |
| "step": 391 | |
| }, | |
| { | |
| "entropy": 0.5964333266019821, | |
| "epoch": 2.5458976441917143, | |
| "grad_norm": 0.00981208123266697, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6057010889053345, | |
| "mean_token_accuracy": 0.7543943077325821, | |
| "num_tokens": 14618074.0, | |
| "step": 392 | |
| }, | |
| { | |
| "entropy": 0.6099359169602394, | |
| "epoch": 2.552396425670187, | |
| "grad_norm": 0.009079058654606342, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6084835529327393, | |
| "mean_token_accuracy": 0.7520028725266457, | |
| "num_tokens": 14655186.0, | |
| "step": 393 | |
| }, | |
| { | |
| "entropy": 0.6173275411128998, | |
| "epoch": 2.5588952071486597, | |
| "grad_norm": 0.009335207752883434, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6102230548858643, | |
| "mean_token_accuracy": 0.7514491975307465, | |
| "num_tokens": 14692383.0, | |
| "step": 394 | |
| }, | |
| { | |
| "entropy": 0.6305418461561203, | |
| "epoch": 2.5653939886271324, | |
| "grad_norm": 0.009312084876000881, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6281323432922363, | |
| "mean_token_accuracy": 0.7421899363398552, | |
| "num_tokens": 14729446.0, | |
| "step": 395 | |
| }, | |
| { | |
| "entropy": 0.6119675636291504, | |
| "epoch": 2.571892770105605, | |
| "grad_norm": 0.00806971825659275, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6118816137313843, | |
| "mean_token_accuracy": 0.7502529993653297, | |
| "num_tokens": 14766917.0, | |
| "step": 396 | |
| }, | |
| { | |
| "entropy": 0.6194342076778412, | |
| "epoch": 2.578391551584078, | |
| "grad_norm": 0.009102623909711838, | |
| "learning_rate": 0.0002, | |
| "loss": 0.625906229019165, | |
| "mean_token_accuracy": 0.7444874346256256, | |
| "num_tokens": 14804635.0, | |
| "step": 397 | |
| }, | |
| { | |
| "entropy": 0.6129268780350685, | |
| "epoch": 2.5848903330625506, | |
| "grad_norm": 0.010471413843333721, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6221112012863159, | |
| "mean_token_accuracy": 0.7463114410638809, | |
| "num_tokens": 14842380.0, | |
| "step": 398 | |
| }, | |
| { | |
| "entropy": 0.6111740916967392, | |
| "epoch": 2.5913891145410237, | |
| "grad_norm": 0.008378157392144203, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6132410764694214, | |
| "mean_token_accuracy": 0.7493879497051239, | |
| "num_tokens": 14879441.0, | |
| "step": 399 | |
| }, | |
| { | |
| "entropy": 0.6207928210496902, | |
| "epoch": 2.5978878960194964, | |
| "grad_norm": 0.008037488907575607, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6196093559265137, | |
| "mean_token_accuracy": 0.7491321563720703, | |
| "num_tokens": 14916731.0, | |
| "step": 400 | |
| }, | |
| { | |
| "entropy": 0.6349622085690498, | |
| "epoch": 2.604386677497969, | |
| "grad_norm": 0.00913564208894968, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6318038702011108, | |
| "mean_token_accuracy": 0.7420522123575211, | |
| "num_tokens": 14954276.0, | |
| "step": 401 | |
| }, | |
| { | |
| "entropy": 0.6019857749342918, | |
| "epoch": 2.610885458976442, | |
| "grad_norm": 0.008696068078279495, | |
| "learning_rate": 0.0002, | |
| "loss": 0.600864052772522, | |
| "mean_token_accuracy": 0.7552035823464394, | |
| "num_tokens": 14991349.0, | |
| "step": 402 | |
| }, | |
| { | |
| "entropy": 0.6017836257815361, | |
| "epoch": 2.6173842404549146, | |
| "grad_norm": 0.008207019418478012, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6038705706596375, | |
| "mean_token_accuracy": 0.7532704323530197, | |
| "num_tokens": 15028601.0, | |
| "step": 403 | |
| }, | |
| { | |
| "entropy": 0.6120554357767105, | |
| "epoch": 2.6238830219333877, | |
| "grad_norm": 0.008753425441682339, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6164306998252869, | |
| "mean_token_accuracy": 0.7496815398335457, | |
| "num_tokens": 15066182.0, | |
| "step": 404 | |
| }, | |
| { | |
| "entropy": 0.6131924018263817, | |
| "epoch": 2.6303818034118605, | |
| "grad_norm": 0.008548066020011902, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6181113719940186, | |
| "mean_token_accuracy": 0.7491538524627686, | |
| "num_tokens": 15103340.0, | |
| "step": 405 | |
| }, | |
| { | |
| "entropy": 0.6061984226107597, | |
| "epoch": 2.636880584890333, | |
| "grad_norm": 0.009016766212880611, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6121985912322998, | |
| "mean_token_accuracy": 0.7507323697209358, | |
| "num_tokens": 15140594.0, | |
| "step": 406 | |
| }, | |
| { | |
| "entropy": 0.6165529787540436, | |
| "epoch": 2.643379366368806, | |
| "grad_norm": 0.007676286157220602, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6143813133239746, | |
| "mean_token_accuracy": 0.7518013492226601, | |
| "num_tokens": 15178037.0, | |
| "step": 407 | |
| }, | |
| { | |
| "entropy": 0.6116887852549553, | |
| "epoch": 2.6498781478472786, | |
| "grad_norm": 0.007873927243053913, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6096634268760681, | |
| "mean_token_accuracy": 0.7518724203109741, | |
| "num_tokens": 15215362.0, | |
| "step": 408 | |
| }, | |
| { | |
| "entropy": 0.6075077503919601, | |
| "epoch": 2.6563769293257513, | |
| "grad_norm": 0.007256446871906519, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6078198552131653, | |
| "mean_token_accuracy": 0.7537789046764374, | |
| "num_tokens": 15252624.0, | |
| "step": 409 | |
| }, | |
| { | |
| "entropy": 0.6106631234288216, | |
| "epoch": 2.662875710804224, | |
| "grad_norm": 0.009321639314293861, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6120110750198364, | |
| "mean_token_accuracy": 0.7512669935822487, | |
| "num_tokens": 15290298.0, | |
| "step": 410 | |
| }, | |
| { | |
| "entropy": 0.6318610459566116, | |
| "epoch": 2.6693744922826967, | |
| "grad_norm": 0.008198688738048077, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6370584964752197, | |
| "mean_token_accuracy": 0.740862101316452, | |
| "num_tokens": 15327374.0, | |
| "step": 411 | |
| }, | |
| { | |
| "entropy": 0.6139440014958382, | |
| "epoch": 2.67587327376117, | |
| "grad_norm": 0.008440233767032623, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6130324602127075, | |
| "mean_token_accuracy": 0.7509049624204636, | |
| "num_tokens": 15364313.0, | |
| "step": 412 | |
| }, | |
| { | |
| "entropy": 0.6132312193512917, | |
| "epoch": 2.6823720552396426, | |
| "grad_norm": 0.00764568243175745, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6143498420715332, | |
| "mean_token_accuracy": 0.7499875500798225, | |
| "num_tokens": 15401585.0, | |
| "step": 413 | |
| }, | |
| { | |
| "entropy": 0.6295821517705917, | |
| "epoch": 2.6888708367181153, | |
| "grad_norm": 0.00870992336422205, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6297035217285156, | |
| "mean_token_accuracy": 0.7440814226865768, | |
| "num_tokens": 15439063.0, | |
| "step": 414 | |
| }, | |
| { | |
| "entropy": 0.6159479022026062, | |
| "epoch": 2.695369618196588, | |
| "grad_norm": 0.007172968704253435, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6142174005508423, | |
| "mean_token_accuracy": 0.7487895339727402, | |
| "num_tokens": 15476100.0, | |
| "step": 415 | |
| }, | |
| { | |
| "entropy": 0.6020728126168251, | |
| "epoch": 2.7018683996750608, | |
| "grad_norm": 0.007704848889261484, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6082124710083008, | |
| "mean_token_accuracy": 0.752522885799408, | |
| "num_tokens": 15513167.0, | |
| "step": 416 | |
| }, | |
| { | |
| "entropy": 0.6281116902828217, | |
| "epoch": 2.708367181153534, | |
| "grad_norm": 0.00924444105476141, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6312050819396973, | |
| "mean_token_accuracy": 0.7460011318325996, | |
| "num_tokens": 15550739.0, | |
| "step": 417 | |
| }, | |
| { | |
| "entropy": 0.6233636066317558, | |
| "epoch": 2.7148659626320066, | |
| "grad_norm": 0.008710985071957111, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6260718107223511, | |
| "mean_token_accuracy": 0.744461327791214, | |
| "num_tokens": 15587950.0, | |
| "step": 418 | |
| }, | |
| { | |
| "entropy": 0.6195387095212936, | |
| "epoch": 2.7213647441104794, | |
| "grad_norm": 0.007183417212218046, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6212611198425293, | |
| "mean_token_accuracy": 0.746867798268795, | |
| "num_tokens": 15625008.0, | |
| "step": 419 | |
| }, | |
| { | |
| "entropy": 0.6109424605965614, | |
| "epoch": 2.727863525588952, | |
| "grad_norm": 0.0077791716903448105, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6113884449005127, | |
| "mean_token_accuracy": 0.7505641579627991, | |
| "num_tokens": 15662159.0, | |
| "step": 420 | |
| }, | |
| { | |
| "entropy": 0.6187275499105453, | |
| "epoch": 2.734362307067425, | |
| "grad_norm": 0.008177550509572029, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6187748908996582, | |
| "mean_token_accuracy": 0.7493242397904396, | |
| "num_tokens": 15699404.0, | |
| "step": 421 | |
| }, | |
| { | |
| "entropy": 0.6269592270255089, | |
| "epoch": 2.7408610885458975, | |
| "grad_norm": 0.00797547772526741, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6266059875488281, | |
| "mean_token_accuracy": 0.7470143884420395, | |
| "num_tokens": 15736867.0, | |
| "step": 422 | |
| }, | |
| { | |
| "entropy": 0.6187637895345688, | |
| "epoch": 2.74735987002437, | |
| "grad_norm": 0.008009313605725765, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6174246072769165, | |
| "mean_token_accuracy": 0.748706616461277, | |
| "num_tokens": 15774518.0, | |
| "step": 423 | |
| }, | |
| { | |
| "entropy": 0.6222201958298683, | |
| "epoch": 2.7538586515028434, | |
| "grad_norm": 0.00828398484736681, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6254167556762695, | |
| "mean_token_accuracy": 0.7451123148202896, | |
| "num_tokens": 15811807.0, | |
| "step": 424 | |
| }, | |
| { | |
| "entropy": 0.6253098249435425, | |
| "epoch": 2.760357432981316, | |
| "grad_norm": 0.0075772651471197605, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6270281076431274, | |
| "mean_token_accuracy": 0.744781106710434, | |
| "num_tokens": 15849715.0, | |
| "step": 425 | |
| }, | |
| { | |
| "entropy": 0.6165027767419815, | |
| "epoch": 2.766856214459789, | |
| "grad_norm": 0.00784947071224451, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6173769235610962, | |
| "mean_token_accuracy": 0.748318687081337, | |
| "num_tokens": 15886927.0, | |
| "step": 426 | |
| }, | |
| { | |
| "entropy": 0.6187942251563072, | |
| "epoch": 2.7733549959382615, | |
| "grad_norm": 0.007960534654557705, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6190329790115356, | |
| "mean_token_accuracy": 0.7482394725084305, | |
| "num_tokens": 15924820.0, | |
| "step": 427 | |
| }, | |
| { | |
| "entropy": 0.6049096137285233, | |
| "epoch": 2.7798537774167342, | |
| "grad_norm": 0.007044166326522827, | |
| "learning_rate": 0.0002, | |
| "loss": 0.608286440372467, | |
| "mean_token_accuracy": 0.7529338300228119, | |
| "num_tokens": 15962031.0, | |
| "step": 428 | |
| }, | |
| { | |
| "entropy": 0.6067706495523453, | |
| "epoch": 2.7863525588952074, | |
| "grad_norm": 0.008417103439569473, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6071891188621521, | |
| "mean_token_accuracy": 0.7529254406690598, | |
| "num_tokens": 15999271.0, | |
| "step": 429 | |
| }, | |
| { | |
| "entropy": 0.608584851026535, | |
| "epoch": 2.79285134037368, | |
| "grad_norm": 0.0066911159083247185, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6128258109092712, | |
| "mean_token_accuracy": 0.7512886077165604, | |
| "num_tokens": 16036782.0, | |
| "step": 430 | |
| }, | |
| { | |
| "entropy": 0.6173116937279701, | |
| "epoch": 2.799350121852153, | |
| "grad_norm": 0.007603482808917761, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6212354898452759, | |
| "mean_token_accuracy": 0.7506462633609772, | |
| "num_tokens": 16074488.0, | |
| "step": 431 | |
| }, | |
| { | |
| "entropy": 0.612823948264122, | |
| "epoch": 2.8058489033306255, | |
| "grad_norm": 0.008489524014294147, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6168191432952881, | |
| "mean_token_accuracy": 0.7491662427783012, | |
| "num_tokens": 16112183.0, | |
| "step": 432 | |
| }, | |
| { | |
| "entropy": 0.6224610134959221, | |
| "epoch": 2.8123476848090982, | |
| "grad_norm": 0.0072684078477323055, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6210014820098877, | |
| "mean_token_accuracy": 0.7473989799618721, | |
| "num_tokens": 16149570.0, | |
| "step": 433 | |
| }, | |
| { | |
| "entropy": 0.6252987831830978, | |
| "epoch": 2.818846466287571, | |
| "grad_norm": 0.008009562268853188, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6273704171180725, | |
| "mean_token_accuracy": 0.7445142269134521, | |
| "num_tokens": 16187156.0, | |
| "step": 434 | |
| }, | |
| { | |
| "entropy": 0.6278671100735664, | |
| "epoch": 2.8253452477660437, | |
| "grad_norm": 0.007072070613503456, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6284614205360413, | |
| "mean_token_accuracy": 0.743632547557354, | |
| "num_tokens": 16224612.0, | |
| "step": 435 | |
| }, | |
| { | |
| "entropy": 0.619408093392849, | |
| "epoch": 2.8318440292445164, | |
| "grad_norm": 0.007810318376868963, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6186745166778564, | |
| "mean_token_accuracy": 0.7505189552903175, | |
| "num_tokens": 16261848.0, | |
| "step": 436 | |
| }, | |
| { | |
| "entropy": 0.617984876036644, | |
| "epoch": 2.8383428107229896, | |
| "grad_norm": 0.007404230069369078, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6218393445014954, | |
| "mean_token_accuracy": 0.746470145881176, | |
| "num_tokens": 16299536.0, | |
| "step": 437 | |
| }, | |
| { | |
| "entropy": 0.6115261316299438, | |
| "epoch": 2.8448415922014623, | |
| "grad_norm": 0.007786816451698542, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6147224307060242, | |
| "mean_token_accuracy": 0.7512907087802887, | |
| "num_tokens": 16336727.0, | |
| "step": 438 | |
| }, | |
| { | |
| "entropy": 0.610576219856739, | |
| "epoch": 2.851340373679935, | |
| "grad_norm": 0.007572745438665152, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6138074994087219, | |
| "mean_token_accuracy": 0.7504170089960098, | |
| "num_tokens": 16374001.0, | |
| "step": 439 | |
| }, | |
| { | |
| "entropy": 0.6278978139162064, | |
| "epoch": 2.8578391551584077, | |
| "grad_norm": 0.007563670165836811, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6268113851547241, | |
| "mean_token_accuracy": 0.7438701540231705, | |
| "num_tokens": 16411469.0, | |
| "step": 440 | |
| }, | |
| { | |
| "entropy": 0.6234687641263008, | |
| "epoch": 2.864337936636881, | |
| "grad_norm": 0.007766201626509428, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6241582632064819, | |
| "mean_token_accuracy": 0.7458857893943787, | |
| "num_tokens": 16449061.0, | |
| "step": 441 | |
| }, | |
| { | |
| "entropy": 0.6170031577348709, | |
| "epoch": 2.8708367181153536, | |
| "grad_norm": 0.0072515420615673065, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6164381504058838, | |
| "mean_token_accuracy": 0.7487066686153412, | |
| "num_tokens": 16486116.0, | |
| "step": 442 | |
| }, | |
| { | |
| "entropy": 0.6071048676967621, | |
| "epoch": 2.8773354995938263, | |
| "grad_norm": 0.007729642558842897, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6061218976974487, | |
| "mean_token_accuracy": 0.7546169012784958, | |
| "num_tokens": 16523581.0, | |
| "step": 443 | |
| }, | |
| { | |
| "entropy": 0.6005209162831306, | |
| "epoch": 2.883834281072299, | |
| "grad_norm": 0.009296285919845104, | |
| "learning_rate": 0.0002, | |
| "loss": 0.608015775680542, | |
| "mean_token_accuracy": 0.7522506862878799, | |
| "num_tokens": 16560766.0, | |
| "step": 444 | |
| }, | |
| { | |
| "entropy": 0.6114199981093407, | |
| "epoch": 2.8903330625507717, | |
| "grad_norm": 0.009450486861169338, | |
| "learning_rate": 0.0002, | |
| "loss": 0.61246258020401, | |
| "mean_token_accuracy": 0.7513059675693512, | |
| "num_tokens": 16597924.0, | |
| "step": 445 | |
| }, | |
| { | |
| "entropy": 0.6163241118192673, | |
| "epoch": 2.8968318440292444, | |
| "grad_norm": 0.007840070873498917, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6163046360015869, | |
| "mean_token_accuracy": 0.7482790276408195, | |
| "num_tokens": 16635707.0, | |
| "step": 446 | |
| }, | |
| { | |
| "entropy": 0.6230868250131607, | |
| "epoch": 2.903330625507717, | |
| "grad_norm": 0.00791420228779316, | |
| "learning_rate": 0.0002, | |
| "loss": 0.627612829208374, | |
| "mean_token_accuracy": 0.7418907359242439, | |
| "num_tokens": 16673272.0, | |
| "step": 447 | |
| }, | |
| { | |
| "entropy": 0.6148254349827766, | |
| "epoch": 2.90982940698619, | |
| "grad_norm": 0.008231899701058865, | |
| "learning_rate": 0.0002, | |
| "loss": 0.615432620048523, | |
| "mean_token_accuracy": 0.74872937053442, | |
| "num_tokens": 16710307.0, | |
| "step": 448 | |
| }, | |
| { | |
| "entropy": 0.6145784482359886, | |
| "epoch": 2.916328188464663, | |
| "grad_norm": 0.008206733502447605, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6162281036376953, | |
| "mean_token_accuracy": 0.7497396990656853, | |
| "num_tokens": 16747541.0, | |
| "step": 449 | |
| }, | |
| { | |
| "entropy": 0.6129453554749489, | |
| "epoch": 2.9228269699431357, | |
| "grad_norm": 0.008618887513875961, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6113362312316895, | |
| "mean_token_accuracy": 0.7538808137178421, | |
| "num_tokens": 16784808.0, | |
| "step": 450 | |
| }, | |
| { | |
| "entropy": 0.6318705305457115, | |
| "epoch": 2.9293257514216084, | |
| "grad_norm": 0.00894182175397873, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6285560131072998, | |
| "mean_token_accuracy": 0.7439467459917068, | |
| "num_tokens": 16822571.0, | |
| "step": 451 | |
| }, | |
| { | |
| "entropy": 0.6192348748445511, | |
| "epoch": 2.935824532900081, | |
| "grad_norm": 0.0075249881483614445, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6225606203079224, | |
| "mean_token_accuracy": 0.7450770661234856, | |
| "num_tokens": 16860236.0, | |
| "step": 452 | |
| }, | |
| { | |
| "entropy": 0.6156643033027649, | |
| "epoch": 2.942323314378554, | |
| "grad_norm": 0.008608740754425526, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6196963787078857, | |
| "mean_token_accuracy": 0.7487252280116081, | |
| "num_tokens": 16897505.0, | |
| "step": 453 | |
| }, | |
| { | |
| "entropy": 0.6020097509026527, | |
| "epoch": 2.948822095857027, | |
| "grad_norm": 0.008554862812161446, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6057189702987671, | |
| "mean_token_accuracy": 0.7535376027226448, | |
| "num_tokens": 16934723.0, | |
| "step": 454 | |
| }, | |
| { | |
| "entropy": 0.6096286401152611, | |
| "epoch": 2.9553208773354998, | |
| "grad_norm": 0.008194280788302422, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6100919842720032, | |
| "mean_token_accuracy": 0.7543619722127914, | |
| "num_tokens": 16972160.0, | |
| "step": 455 | |
| }, | |
| { | |
| "entropy": 0.6101824045181274, | |
| "epoch": 2.9618196588139725, | |
| "grad_norm": 0.008089696057140827, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6100078225135803, | |
| "mean_token_accuracy": 0.7519838437438011, | |
| "num_tokens": 17009553.0, | |
| "step": 456 | |
| }, | |
| { | |
| "entropy": 0.6134164482355118, | |
| "epoch": 2.968318440292445, | |
| "grad_norm": 0.008095222525298595, | |
| "learning_rate": 0.0002, | |
| "loss": 0.61534583568573, | |
| "mean_token_accuracy": 0.7492899596691132, | |
| "num_tokens": 17046859.0, | |
| "step": 457 | |
| }, | |
| { | |
| "entropy": 0.6219535619020462, | |
| "epoch": 2.974817221770918, | |
| "grad_norm": 0.008277404122054577, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6226615905761719, | |
| "mean_token_accuracy": 0.7486208230257034, | |
| "num_tokens": 17083891.0, | |
| "step": 458 | |
| }, | |
| { | |
| "entropy": 0.6230077967047691, | |
| "epoch": 2.9813160032493906, | |
| "grad_norm": 0.007576305419206619, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6215830445289612, | |
| "mean_token_accuracy": 0.7478786036372185, | |
| "num_tokens": 17121415.0, | |
| "step": 459 | |
| }, | |
| { | |
| "entropy": 0.6288741081953049, | |
| "epoch": 2.9878147847278633, | |
| "grad_norm": 0.007517755497246981, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6266385912895203, | |
| "mean_token_accuracy": 0.7459503784775734, | |
| "num_tokens": 17159316.0, | |
| "step": 460 | |
| }, | |
| { | |
| "entropy": 0.6128450557589531, | |
| "epoch": 2.994313566206336, | |
| "grad_norm": 0.0082389609888196, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6180654764175415, | |
| "mean_token_accuracy": 0.7501172721385956, | |
| "num_tokens": 17196686.0, | |
| "step": 461 | |
| }, | |
| { | |
| "entropy": 0.6104621972356524, | |
| "epoch": 3.0, | |
| "grad_norm": 0.009389652870595455, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6207214593887329, | |
| "mean_token_accuracy": 0.7534014242036002, | |
| "num_tokens": 17212985.0, | |
| "step": 462 | |
| }, | |
| { | |
| "entropy": 0.6010295078158379, | |
| "epoch": 3.0064987814784727, | |
| "grad_norm": 0.007540151942521334, | |
| "learning_rate": 0.0002, | |
| "loss": 0.604315996170044, | |
| "mean_token_accuracy": 0.7545758932828903, | |
| "num_tokens": 17250548.0, | |
| "step": 463 | |
| }, | |
| { | |
| "entropy": 0.6099191755056381, | |
| "epoch": 3.0129975629569454, | |
| "grad_norm": 0.007964324206113815, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6118016839027405, | |
| "mean_token_accuracy": 0.7505887746810913, | |
| "num_tokens": 17288088.0, | |
| "step": 464 | |
| }, | |
| { | |
| "entropy": 0.6099814623594284, | |
| "epoch": 3.019496344435418, | |
| "grad_norm": 0.009010368958115578, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6133589744567871, | |
| "mean_token_accuracy": 0.7495384216308594, | |
| "num_tokens": 17325896.0, | |
| "step": 465 | |
| }, | |
| { | |
| "entropy": 0.6108173504471779, | |
| "epoch": 3.0259951259138913, | |
| "grad_norm": 0.008082750253379345, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6106899380683899, | |
| "mean_token_accuracy": 0.7496122866868973, | |
| "num_tokens": 17363618.0, | |
| "step": 466 | |
| }, | |
| { | |
| "entropy": 0.6203465834259987, | |
| "epoch": 3.032493907392364, | |
| "grad_norm": 0.00794974435120821, | |
| "learning_rate": 0.0002, | |
| "loss": 0.62054044008255, | |
| "mean_token_accuracy": 0.7457421347498894, | |
| "num_tokens": 17401213.0, | |
| "step": 467 | |
| }, | |
| { | |
| "entropy": 0.6201630383729935, | |
| "epoch": 3.0389926888708367, | |
| "grad_norm": 0.00949027854949236, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6232575178146362, | |
| "mean_token_accuracy": 0.746864065527916, | |
| "num_tokens": 17438437.0, | |
| "step": 468 | |
| }, | |
| { | |
| "entropy": 0.6282624080777168, | |
| "epoch": 3.0454914703493094, | |
| "grad_norm": 0.007857941091060638, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6256210207939148, | |
| "mean_token_accuracy": 0.7441679313778877, | |
| "num_tokens": 17476273.0, | |
| "step": 469 | |
| }, | |
| { | |
| "entropy": 0.6105262786149979, | |
| "epoch": 3.051990251827782, | |
| "grad_norm": 0.008467303588986397, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6100492477416992, | |
| "mean_token_accuracy": 0.7501196339726448, | |
| "num_tokens": 17513496.0, | |
| "step": 470 | |
| }, | |
| { | |
| "entropy": 0.6016805246472359, | |
| "epoch": 3.058489033306255, | |
| "grad_norm": 0.009371851570904255, | |
| "learning_rate": 0.0002, | |
| "loss": 0.604375958442688, | |
| "mean_token_accuracy": 0.7524744868278503, | |
| "num_tokens": 17551200.0, | |
| "step": 471 | |
| }, | |
| { | |
| "entropy": 0.6073808148503304, | |
| "epoch": 3.064987814784728, | |
| "grad_norm": 0.008492433466017246, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6094343662261963, | |
| "mean_token_accuracy": 0.752588301897049, | |
| "num_tokens": 17588356.0, | |
| "step": 472 | |
| }, | |
| { | |
| "entropy": 0.6179896369576454, | |
| "epoch": 3.0714865962632008, | |
| "grad_norm": 0.008540020324289799, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6210522055625916, | |
| "mean_token_accuracy": 0.7460785582661629, | |
| "num_tokens": 17625982.0, | |
| "step": 473 | |
| }, | |
| { | |
| "entropy": 0.6018861308693886, | |
| "epoch": 3.0779853777416735, | |
| "grad_norm": 0.008742019534111023, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6078682541847229, | |
| "mean_token_accuracy": 0.7513778060674667, | |
| "num_tokens": 17663418.0, | |
| "step": 474 | |
| }, | |
| { | |
| "entropy": 0.633279986679554, | |
| "epoch": 3.084484159220146, | |
| "grad_norm": 0.0082003865391016, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6310751438140869, | |
| "mean_token_accuracy": 0.7428691610693932, | |
| "num_tokens": 17700640.0, | |
| "step": 475 | |
| }, | |
| { | |
| "entropy": 0.6102183759212494, | |
| "epoch": 3.090982940698619, | |
| "grad_norm": 0.008503621444106102, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6114936470985413, | |
| "mean_token_accuracy": 0.7529326751828194, | |
| "num_tokens": 17738330.0, | |
| "step": 476 | |
| }, | |
| { | |
| "entropy": 0.6162742525339127, | |
| "epoch": 3.0974817221770916, | |
| "grad_norm": 0.008936957456171513, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6209756135940552, | |
| "mean_token_accuracy": 0.7465755268931389, | |
| "num_tokens": 17775715.0, | |
| "step": 477 | |
| }, | |
| { | |
| "entropy": 0.6141496077179909, | |
| "epoch": 3.1039805036555648, | |
| "grad_norm": 0.009372946806252003, | |
| "learning_rate": 0.0002, | |
| "loss": 0.617496132850647, | |
| "mean_token_accuracy": 0.7488722130656242, | |
| "num_tokens": 17813252.0, | |
| "step": 478 | |
| }, | |
| { | |
| "entropy": 0.6128992438316345, | |
| "epoch": 3.1104792851340375, | |
| "grad_norm": 0.009246407076716423, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6153603792190552, | |
| "mean_token_accuracy": 0.7489981204271317, | |
| "num_tokens": 17850593.0, | |
| "step": 479 | |
| }, | |
| { | |
| "entropy": 0.6109244301915169, | |
| "epoch": 3.11697806661251, | |
| "grad_norm": 0.008360042236745358, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6110379099845886, | |
| "mean_token_accuracy": 0.7517814785242081, | |
| "num_tokens": 17887433.0, | |
| "step": 480 | |
| }, | |
| { | |
| "entropy": 0.6216762438416481, | |
| "epoch": 3.123476848090983, | |
| "grad_norm": 0.008575825951993465, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6188209652900696, | |
| "mean_token_accuracy": 0.7479925602674484, | |
| "num_tokens": 17924477.0, | |
| "step": 481 | |
| }, | |
| { | |
| "entropy": 0.617570586502552, | |
| "epoch": 3.1299756295694556, | |
| "grad_norm": 0.00846293568611145, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6159199476242065, | |
| "mean_token_accuracy": 0.7518654763698578, | |
| "num_tokens": 17961735.0, | |
| "step": 482 | |
| }, | |
| { | |
| "entropy": 0.591516949236393, | |
| "epoch": 3.1364744110479283, | |
| "grad_norm": 0.009447102434933186, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5986469984054565, | |
| "mean_token_accuracy": 0.7579966932535172, | |
| "num_tokens": 17998853.0, | |
| "step": 483 | |
| }, | |
| { | |
| "entropy": 0.6149769946932793, | |
| "epoch": 3.1429731925264015, | |
| "grad_norm": 0.010652805678546429, | |
| "learning_rate": 0.0002, | |
| "loss": 0.62315833568573, | |
| "mean_token_accuracy": 0.7443839907646179, | |
| "num_tokens": 18036498.0, | |
| "step": 484 | |
| }, | |
| { | |
| "entropy": 0.6224213317036629, | |
| "epoch": 3.149471974004874, | |
| "grad_norm": 0.008841714821755886, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6213138103485107, | |
| "mean_token_accuracy": 0.7460580617189407, | |
| "num_tokens": 18073792.0, | |
| "step": 485 | |
| }, | |
| { | |
| "entropy": 0.624303974211216, | |
| "epoch": 3.155970755483347, | |
| "grad_norm": 0.008476318791508675, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6206566691398621, | |
| "mean_token_accuracy": 0.7465843260288239, | |
| "num_tokens": 18110931.0, | |
| "step": 486 | |
| }, | |
| { | |
| "entropy": 0.6057487353682518, | |
| "epoch": 3.1624695369618196, | |
| "grad_norm": 0.007340795826166868, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6085374355316162, | |
| "mean_token_accuracy": 0.7520734146237373, | |
| "num_tokens": 18148230.0, | |
| "step": 487 | |
| }, | |
| { | |
| "entropy": 0.5987089648842812, | |
| "epoch": 3.1689683184402924, | |
| "grad_norm": 0.008576547726988792, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5994081497192383, | |
| "mean_token_accuracy": 0.7560673728585243, | |
| "num_tokens": 18185429.0, | |
| "step": 488 | |
| }, | |
| { | |
| "entropy": 0.6201451569795609, | |
| "epoch": 3.175467099918765, | |
| "grad_norm": 0.009309273213148117, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6250134706497192, | |
| "mean_token_accuracy": 0.7440272644162178, | |
| "num_tokens": 18222845.0, | |
| "step": 489 | |
| }, | |
| { | |
| "entropy": 0.6149864792823792, | |
| "epoch": 3.181965881397238, | |
| "grad_norm": 0.00817920919507742, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6165604591369629, | |
| "mean_token_accuracy": 0.7469800040125847, | |
| "num_tokens": 18260522.0, | |
| "step": 490 | |
| }, | |
| { | |
| "entropy": 0.6081833988428116, | |
| "epoch": 3.188464662875711, | |
| "grad_norm": 0.008727415464818478, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6095278263092041, | |
| "mean_token_accuracy": 0.7511461302638054, | |
| "num_tokens": 18298119.0, | |
| "step": 491 | |
| }, | |
| { | |
| "entropy": 0.6011826619505882, | |
| "epoch": 3.1949634443541837, | |
| "grad_norm": 0.008403414860367775, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6023063659667969, | |
| "mean_token_accuracy": 0.7541341111063957, | |
| "num_tokens": 18335516.0, | |
| "step": 492 | |
| }, | |
| { | |
| "entropy": 0.614462248980999, | |
| "epoch": 3.2014622258326564, | |
| "grad_norm": 0.008592899888753891, | |
| "learning_rate": 0.0002, | |
| "loss": 0.611116886138916, | |
| "mean_token_accuracy": 0.7512200325727463, | |
| "num_tokens": 18373224.0, | |
| "step": 493 | |
| }, | |
| { | |
| "entropy": 0.6118571162223816, | |
| "epoch": 3.207961007311129, | |
| "grad_norm": 0.008299244567751884, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6136075258255005, | |
| "mean_token_accuracy": 0.749468058347702, | |
| "num_tokens": 18410845.0, | |
| "step": 494 | |
| }, | |
| { | |
| "entropy": 0.6049928665161133, | |
| "epoch": 3.214459788789602, | |
| "grad_norm": 0.010410244576632977, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6083844304084778, | |
| "mean_token_accuracy": 0.751271091401577, | |
| "num_tokens": 18448238.0, | |
| "step": 495 | |
| }, | |
| { | |
| "entropy": 0.6233940199017525, | |
| "epoch": 3.2209585702680745, | |
| "grad_norm": 0.009204378351569176, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6272657513618469, | |
| "mean_token_accuracy": 0.7432866543531418, | |
| "num_tokens": 18486015.0, | |
| "step": 496 | |
| }, | |
| { | |
| "entropy": 0.6218753755092621, | |
| "epoch": 3.2274573517465477, | |
| "grad_norm": 0.00954593438655138, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6218851208686829, | |
| "mean_token_accuracy": 0.7457900047302246, | |
| "num_tokens": 18523424.0, | |
| "step": 497 | |
| }, | |
| { | |
| "entropy": 0.6145913749933243, | |
| "epoch": 3.2339561332250204, | |
| "grad_norm": 0.009425587020814419, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6123300194740295, | |
| "mean_token_accuracy": 0.7488762065768242, | |
| "num_tokens": 18560844.0, | |
| "step": 498 | |
| }, | |
| { | |
| "entropy": 0.6112263351678848, | |
| "epoch": 3.240454914703493, | |
| "grad_norm": 0.009846451692283154, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6109277606010437, | |
| "mean_token_accuracy": 0.7503840625286102, | |
| "num_tokens": 18598457.0, | |
| "step": 499 | |
| }, | |
| { | |
| "entropy": 0.6025180518627167, | |
| "epoch": 3.246953696181966, | |
| "grad_norm": 0.00901762768626213, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6064941883087158, | |
| "mean_token_accuracy": 0.7513880282640457, | |
| "num_tokens": 18635799.0, | |
| "step": 500 | |
| }, | |
| { | |
| "entropy": 0.6062363162636757, | |
| "epoch": 3.2534524776604385, | |
| "grad_norm": 0.008631935343146324, | |
| "learning_rate": 0.0002, | |
| "loss": 0.610137939453125, | |
| "mean_token_accuracy": 0.751276396214962, | |
| "num_tokens": 18673367.0, | |
| "step": 501 | |
| }, | |
| { | |
| "entropy": 0.6029994338750839, | |
| "epoch": 3.2599512591389113, | |
| "grad_norm": 0.008083198219537735, | |
| "learning_rate": 0.0002, | |
| "loss": 0.605480968952179, | |
| "mean_token_accuracy": 0.7522158473730087, | |
| "num_tokens": 18710845.0, | |
| "step": 502 | |
| }, | |
| { | |
| "entropy": 0.6004190221428871, | |
| "epoch": 3.2664500406173844, | |
| "grad_norm": 0.009547607973217964, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5966814756393433, | |
| "mean_token_accuracy": 0.7567247301340103, | |
| "num_tokens": 18748254.0, | |
| "step": 503 | |
| }, | |
| { | |
| "entropy": 0.6217415705323219, | |
| "epoch": 3.272948822095857, | |
| "grad_norm": 0.008327828720211983, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6205904483795166, | |
| "mean_token_accuracy": 0.746347539126873, | |
| "num_tokens": 18785876.0, | |
| "step": 504 | |
| }, | |
| { | |
| "entropy": 0.6177750676870346, | |
| "epoch": 3.27944760357433, | |
| "grad_norm": 0.008332877419888973, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6175146102905273, | |
| "mean_token_accuracy": 0.7480292990803719, | |
| "num_tokens": 18823559.0, | |
| "step": 505 | |
| }, | |
| { | |
| "entropy": 0.6048281341791153, | |
| "epoch": 3.2859463850528026, | |
| "grad_norm": 0.010307500138878822, | |
| "learning_rate": 0.0002, | |
| "loss": 0.608547568321228, | |
| "mean_token_accuracy": 0.7522715479135513, | |
| "num_tokens": 18860761.0, | |
| "step": 506 | |
| }, | |
| { | |
| "entropy": 0.6015286520123482, | |
| "epoch": 3.2924451665312753, | |
| "grad_norm": 0.008793864399194717, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6076687574386597, | |
| "mean_token_accuracy": 0.7535560503602028, | |
| "num_tokens": 18898017.0, | |
| "step": 507 | |
| }, | |
| { | |
| "entropy": 0.6203228533267975, | |
| "epoch": 3.298943948009748, | |
| "grad_norm": 0.008433851413428783, | |
| "learning_rate": 0.0002, | |
| "loss": 0.627921462059021, | |
| "mean_token_accuracy": 0.743441991508007, | |
| "num_tokens": 18935451.0, | |
| "step": 508 | |
| }, | |
| { | |
| "entropy": 0.61593446880579, | |
| "epoch": 3.305442729488221, | |
| "grad_norm": 0.00970753189176321, | |
| "learning_rate": 0.0002, | |
| "loss": 0.617050290107727, | |
| "mean_token_accuracy": 0.7470974624156952, | |
| "num_tokens": 18972874.0, | |
| "step": 509 | |
| }, | |
| { | |
| "entropy": 0.6080862656235695, | |
| "epoch": 3.311941510966694, | |
| "grad_norm": 0.008601192384958267, | |
| "learning_rate": 0.0002, | |
| "loss": 0.613648533821106, | |
| "mean_token_accuracy": 0.7485402300953865, | |
| "num_tokens": 19010386.0, | |
| "step": 510 | |
| }, | |
| { | |
| "entropy": 0.6165401563048363, | |
| "epoch": 3.3184402924451666, | |
| "grad_norm": 0.009453460574150085, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6146738529205322, | |
| "mean_token_accuracy": 0.7489698827266693, | |
| "num_tokens": 19048086.0, | |
| "step": 511 | |
| }, | |
| { | |
| "entropy": 0.6097732856869698, | |
| "epoch": 3.3249390739236393, | |
| "grad_norm": 0.008702411316335201, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6121372580528259, | |
| "mean_token_accuracy": 0.7501634210348129, | |
| "num_tokens": 19085297.0, | |
| "step": 512 | |
| }, | |
| { | |
| "entropy": 0.6050214320421219, | |
| "epoch": 3.331437855402112, | |
| "grad_norm": 0.008775223046541214, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6089086532592773, | |
| "mean_token_accuracy": 0.7513034492731094, | |
| "num_tokens": 19122838.0, | |
| "step": 513 | |
| }, | |
| { | |
| "entropy": 0.6079926937818527, | |
| "epoch": 3.3379366368805847, | |
| "grad_norm": 0.009299266152083874, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6124639511108398, | |
| "mean_token_accuracy": 0.751487672328949, | |
| "num_tokens": 19160495.0, | |
| "step": 514 | |
| }, | |
| { | |
| "entropy": 0.6141983196139336, | |
| "epoch": 3.3444354183590574, | |
| "grad_norm": 0.00953013077378273, | |
| "learning_rate": 0.0002, | |
| "loss": 0.614948570728302, | |
| "mean_token_accuracy": 0.7482777014374733, | |
| "num_tokens": 19197772.0, | |
| "step": 515 | |
| }, | |
| { | |
| "entropy": 0.6166125014424324, | |
| "epoch": 3.3509341998375306, | |
| "grad_norm": 0.01042372826486826, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6166562438011169, | |
| "mean_token_accuracy": 0.7489292994141579, | |
| "num_tokens": 19235537.0, | |
| "step": 516 | |
| }, | |
| { | |
| "entropy": 0.6107529476284981, | |
| "epoch": 3.3574329813160033, | |
| "grad_norm": 0.009182547219097614, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6094313263893127, | |
| "mean_token_accuracy": 0.75286765396595, | |
| "num_tokens": 19272557.0, | |
| "step": 517 | |
| }, | |
| { | |
| "entropy": 0.5976028516888618, | |
| "epoch": 3.363931762794476, | |
| "grad_norm": 0.00928069930523634, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6000387668609619, | |
| "mean_token_accuracy": 0.7556054145097733, | |
| "num_tokens": 19309498.0, | |
| "step": 518 | |
| }, | |
| { | |
| "entropy": 0.6023745760321617, | |
| "epoch": 3.3704305442729487, | |
| "grad_norm": 0.008411030285060406, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6067807674407959, | |
| "mean_token_accuracy": 0.7529009878635406, | |
| "num_tokens": 19346735.0, | |
| "step": 519 | |
| }, | |
| { | |
| "entropy": 0.6122680082917213, | |
| "epoch": 3.3769293257514215, | |
| "grad_norm": 0.008953915908932686, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6159105896949768, | |
| "mean_token_accuracy": 0.7494169026613235, | |
| "num_tokens": 19384153.0, | |
| "step": 520 | |
| }, | |
| { | |
| "entropy": 0.6186133921146393, | |
| "epoch": 3.3834281072298946, | |
| "grad_norm": 0.008217048831284046, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6203353404998779, | |
| "mean_token_accuracy": 0.7473497167229652, | |
| "num_tokens": 19421655.0, | |
| "step": 521 | |
| }, | |
| { | |
| "entropy": 0.6094240248203278, | |
| "epoch": 3.3899268887083673, | |
| "grad_norm": 0.00980299897491932, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6119738221168518, | |
| "mean_token_accuracy": 0.7499380633234978, | |
| "num_tokens": 19458894.0, | |
| "step": 522 | |
| }, | |
| { | |
| "entropy": 0.6254991963505745, | |
| "epoch": 3.39642567018684, | |
| "grad_norm": 0.008415239863097668, | |
| "learning_rate": 0.0002, | |
| "loss": 0.623593807220459, | |
| "mean_token_accuracy": 0.7472219467163086, | |
| "num_tokens": 19496818.0, | |
| "step": 523 | |
| }, | |
| { | |
| "entropy": 0.6295105367898941, | |
| "epoch": 3.4029244516653128, | |
| "grad_norm": 0.009312564507126808, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6262437105178833, | |
| "mean_token_accuracy": 0.7448465451598167, | |
| "num_tokens": 19534274.0, | |
| "step": 524 | |
| }, | |
| { | |
| "entropy": 0.6126851290464401, | |
| "epoch": 3.4094232331437855, | |
| "grad_norm": 0.00861976109445095, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6097316145896912, | |
| "mean_token_accuracy": 0.7525606751441956, | |
| "num_tokens": 19571856.0, | |
| "step": 525 | |
| }, | |
| { | |
| "entropy": 0.6135350093245506, | |
| "epoch": 3.415922014622258, | |
| "grad_norm": 0.008309995755553246, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6160346269607544, | |
| "mean_token_accuracy": 0.7493128851056099, | |
| "num_tokens": 19609319.0, | |
| "step": 526 | |
| }, | |
| { | |
| "entropy": 0.6100683584809303, | |
| "epoch": 3.422420796100731, | |
| "grad_norm": 0.011379679664969444, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6197912096977234, | |
| "mean_token_accuracy": 0.7495440766215324, | |
| "num_tokens": 19647036.0, | |
| "step": 527 | |
| }, | |
| { | |
| "entropy": 0.6129766032099724, | |
| "epoch": 3.428919577579204, | |
| "grad_norm": 0.00879785604774952, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6192106008529663, | |
| "mean_token_accuracy": 0.7462450638413429, | |
| "num_tokens": 19684528.0, | |
| "step": 528 | |
| }, | |
| { | |
| "entropy": 0.6183054521679878, | |
| "epoch": 3.435418359057677, | |
| "grad_norm": 0.009570072405040264, | |
| "learning_rate": 0.0002, | |
| "loss": 0.61530601978302, | |
| "mean_token_accuracy": 0.7494653314352036, | |
| "num_tokens": 19721829.0, | |
| "step": 529 | |
| }, | |
| { | |
| "entropy": 0.6237875148653984, | |
| "epoch": 3.4419171405361495, | |
| "grad_norm": 0.009924475103616714, | |
| "learning_rate": 0.0002, | |
| "loss": 0.620090126991272, | |
| "mean_token_accuracy": 0.7470209151506424, | |
| "num_tokens": 19759470.0, | |
| "step": 530 | |
| }, | |
| { | |
| "entropy": 0.6056384146213531, | |
| "epoch": 3.448415922014622, | |
| "grad_norm": 0.008861211128532887, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6051967144012451, | |
| "mean_token_accuracy": 0.7524856179952621, | |
| "num_tokens": 19797055.0, | |
| "step": 531 | |
| }, | |
| { | |
| "entropy": 0.6045270711183548, | |
| "epoch": 3.454914703493095, | |
| "grad_norm": 0.009311981499195099, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6111881136894226, | |
| "mean_token_accuracy": 0.7494307532906532, | |
| "num_tokens": 19834144.0, | |
| "step": 532 | |
| }, | |
| { | |
| "entropy": 0.6097549796104431, | |
| "epoch": 3.4614134849715676, | |
| "grad_norm": 0.010919635184109211, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6160416007041931, | |
| "mean_token_accuracy": 0.7504306137561798, | |
| "num_tokens": 19871286.0, | |
| "step": 533 | |
| }, | |
| { | |
| "entropy": 0.6024704650044441, | |
| "epoch": 3.467912266450041, | |
| "grad_norm": 0.008416552096605301, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6058158278465271, | |
| "mean_token_accuracy": 0.7539756521582603, | |
| "num_tokens": 19908849.0, | |
| "step": 534 | |
| }, | |
| { | |
| "entropy": 0.611225888133049, | |
| "epoch": 3.4744110479285135, | |
| "grad_norm": 0.008921737782657146, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6157783269882202, | |
| "mean_token_accuracy": 0.7485576719045639, | |
| "num_tokens": 19945976.0, | |
| "step": 535 | |
| }, | |
| { | |
| "entropy": 0.5882637947797775, | |
| "epoch": 3.4809098294069862, | |
| "grad_norm": 0.009470734745264053, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5855636596679688, | |
| "mean_token_accuracy": 0.7615584507584572, | |
| "num_tokens": 19983147.0, | |
| "step": 536 | |
| }, | |
| { | |
| "entropy": 0.607180692255497, | |
| "epoch": 3.487408610885459, | |
| "grad_norm": 0.00895584374666214, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6034247875213623, | |
| "mean_token_accuracy": 0.7542741522192955, | |
| "num_tokens": 20020743.0, | |
| "step": 537 | |
| }, | |
| { | |
| "entropy": 0.6082776561379433, | |
| "epoch": 3.4939073923639317, | |
| "grad_norm": 0.00874309055507183, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6111589074134827, | |
| "mean_token_accuracy": 0.7497387602925301, | |
| "num_tokens": 20058341.0, | |
| "step": 538 | |
| }, | |
| { | |
| "entropy": 0.6162533760070801, | |
| "epoch": 3.5004061738424044, | |
| "grad_norm": 0.009585198014974594, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6244966387748718, | |
| "mean_token_accuracy": 0.7475337833166122, | |
| "num_tokens": 20095636.0, | |
| "step": 539 | |
| }, | |
| { | |
| "entropy": 0.6105955466628075, | |
| "epoch": 3.506904955320877, | |
| "grad_norm": 0.009461835958063602, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6156846880912781, | |
| "mean_token_accuracy": 0.7479056641459465, | |
| "num_tokens": 20132551.0, | |
| "step": 540 | |
| }, | |
| { | |
| "entropy": 0.621313750743866, | |
| "epoch": 3.5134037367993503, | |
| "grad_norm": 0.008541502989828587, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6199691295623779, | |
| "mean_token_accuracy": 0.7473711222410202, | |
| "num_tokens": 20169837.0, | |
| "step": 541 | |
| }, | |
| { | |
| "entropy": 0.6165328845381737, | |
| "epoch": 3.519902518277823, | |
| "grad_norm": 0.009770420379936695, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6142412424087524, | |
| "mean_token_accuracy": 0.7502679750323296, | |
| "num_tokens": 20207307.0, | |
| "step": 542 | |
| }, | |
| { | |
| "entropy": 0.6032826527953148, | |
| "epoch": 3.5264012997562957, | |
| "grad_norm": 0.010346473194658756, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6011192798614502, | |
| "mean_token_accuracy": 0.754242517054081, | |
| "num_tokens": 20244685.0, | |
| "step": 543 | |
| }, | |
| { | |
| "entropy": 0.6191048100590706, | |
| "epoch": 3.5329000812347684, | |
| "grad_norm": 0.008168449625372887, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6207705736160278, | |
| "mean_token_accuracy": 0.74729173630476, | |
| "num_tokens": 20281823.0, | |
| "step": 544 | |
| }, | |
| { | |
| "entropy": 0.6121908649802208, | |
| "epoch": 3.539398862713241, | |
| "grad_norm": 0.007879077456891537, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6121616363525391, | |
| "mean_token_accuracy": 0.7506422027945518, | |
| "num_tokens": 20319307.0, | |
| "step": 545 | |
| }, | |
| { | |
| "entropy": 0.6186290234327316, | |
| "epoch": 3.5458976441917143, | |
| "grad_norm": 0.00905434787273407, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6185810565948486, | |
| "mean_token_accuracy": 0.7475248873233795, | |
| "num_tokens": 20356848.0, | |
| "step": 546 | |
| }, | |
| { | |
| "entropy": 0.6139393672347069, | |
| "epoch": 3.552396425670187, | |
| "grad_norm": 0.008824498392641544, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6151487827301025, | |
| "mean_token_accuracy": 0.7489016950130463, | |
| "num_tokens": 20394203.0, | |
| "step": 547 | |
| }, | |
| { | |
| "entropy": 0.6207469254732132, | |
| "epoch": 3.5588952071486597, | |
| "grad_norm": 0.008396871387958527, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6218851804733276, | |
| "mean_token_accuracy": 0.7459322214126587, | |
| "num_tokens": 20431870.0, | |
| "step": 548 | |
| }, | |
| { | |
| "entropy": 0.62169548869133, | |
| "epoch": 3.5653939886271324, | |
| "grad_norm": 0.00874373223632574, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6228454113006592, | |
| "mean_token_accuracy": 0.749803364276886, | |
| "num_tokens": 20469261.0, | |
| "step": 549 | |
| }, | |
| { | |
| "entropy": 0.6220152676105499, | |
| "epoch": 3.571892770105605, | |
| "grad_norm": 0.008933790028095245, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6208291053771973, | |
| "mean_token_accuracy": 0.7474985867738724, | |
| "num_tokens": 20506396.0, | |
| "step": 550 | |
| }, | |
| { | |
| "entropy": 0.6153115481138229, | |
| "epoch": 3.578391551584078, | |
| "grad_norm": 0.008625194430351257, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6176726818084717, | |
| "mean_token_accuracy": 0.7483843564987183, | |
| "num_tokens": 20543594.0, | |
| "step": 551 | |
| }, | |
| { | |
| "entropy": 0.6194273307919502, | |
| "epoch": 3.5848903330625506, | |
| "grad_norm": 0.009513880126178265, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6259117126464844, | |
| "mean_token_accuracy": 0.7455350533127785, | |
| "num_tokens": 20580976.0, | |
| "step": 552 | |
| }, | |
| { | |
| "entropy": 0.6218870356678963, | |
| "epoch": 3.5913891145410237, | |
| "grad_norm": 0.010471499525010586, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6255429983139038, | |
| "mean_token_accuracy": 0.745422936975956, | |
| "num_tokens": 20618155.0, | |
| "step": 553 | |
| }, | |
| { | |
| "entropy": 0.6044272035360336, | |
| "epoch": 3.5978878960194964, | |
| "grad_norm": 0.009206542745232582, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6089117527008057, | |
| "mean_token_accuracy": 0.7523582801222801, | |
| "num_tokens": 20655356.0, | |
| "step": 554 | |
| }, | |
| { | |
| "entropy": 0.6034605354070663, | |
| "epoch": 3.604386677497969, | |
| "grad_norm": 0.01001272164285183, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6080043315887451, | |
| "mean_token_accuracy": 0.7542883977293968, | |
| "num_tokens": 20692368.0, | |
| "step": 555 | |
| }, | |
| { | |
| "entropy": 0.6126068532466888, | |
| "epoch": 3.610885458976442, | |
| "grad_norm": 0.008411637507379055, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6143564581871033, | |
| "mean_token_accuracy": 0.7496707290410995, | |
| "num_tokens": 20729532.0, | |
| "step": 556 | |
| }, | |
| { | |
| "entropy": 0.6092226430773735, | |
| "epoch": 3.6173842404549146, | |
| "grad_norm": 0.00788223184645176, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6080750226974487, | |
| "mean_token_accuracy": 0.7521450445055962, | |
| "num_tokens": 20767316.0, | |
| "step": 557 | |
| }, | |
| { | |
| "entropy": 0.6103739887475967, | |
| "epoch": 3.6238830219333877, | |
| "grad_norm": 0.008947784081101418, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6110090613365173, | |
| "mean_token_accuracy": 0.751432754099369, | |
| "num_tokens": 20804682.0, | |
| "step": 558 | |
| }, | |
| { | |
| "entropy": 0.6072618737816811, | |
| "epoch": 3.6303818034118605, | |
| "grad_norm": 0.008321145549416542, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6072537899017334, | |
| "mean_token_accuracy": 0.7519486770033836, | |
| "num_tokens": 20842038.0, | |
| "step": 559 | |
| }, | |
| { | |
| "entropy": 0.614497110247612, | |
| "epoch": 3.636880584890333, | |
| "grad_norm": 0.009164758026599884, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6098246574401855, | |
| "mean_token_accuracy": 0.752671018242836, | |
| "num_tokens": 20879197.0, | |
| "step": 560 | |
| }, | |
| { | |
| "entropy": 0.6094550266861916, | |
| "epoch": 3.643379366368806, | |
| "grad_norm": 0.007844182662665844, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6068869829177856, | |
| "mean_token_accuracy": 0.7533254846930504, | |
| "num_tokens": 20916501.0, | |
| "step": 561 | |
| }, | |
| { | |
| "entropy": 0.6086015179753304, | |
| "epoch": 3.6498781478472786, | |
| "grad_norm": 0.008045290596783161, | |
| "learning_rate": 0.0002, | |
| "loss": 0.606809139251709, | |
| "mean_token_accuracy": 0.7527647316455841, | |
| "num_tokens": 20954134.0, | |
| "step": 562 | |
| }, | |
| { | |
| "entropy": 0.6285906434059143, | |
| "epoch": 3.6563769293257513, | |
| "grad_norm": 0.010104804299771786, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6331174373626709, | |
| "mean_token_accuracy": 0.7419461309909821, | |
| "num_tokens": 20992017.0, | |
| "step": 563 | |
| }, | |
| { | |
| "entropy": 0.6020278707146645, | |
| "epoch": 3.662875710804224, | |
| "grad_norm": 0.01021239347755909, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6128239035606384, | |
| "mean_token_accuracy": 0.7514787241816521, | |
| "num_tokens": 21029653.0, | |
| "step": 564 | |
| }, | |
| { | |
| "entropy": 0.6191821396350861, | |
| "epoch": 3.6693744922826967, | |
| "grad_norm": 0.009272433817386627, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6228241324424744, | |
| "mean_token_accuracy": 0.7464863955974579, | |
| "num_tokens": 21067220.0, | |
| "step": 565 | |
| }, | |
| { | |
| "entropy": 0.6111209839582443, | |
| "epoch": 3.67587327376117, | |
| "grad_norm": 0.01010363083332777, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6085663437843323, | |
| "mean_token_accuracy": 0.7533030211925507, | |
| "num_tokens": 21105021.0, | |
| "step": 566 | |
| }, | |
| { | |
| "entropy": 0.6244448721408844, | |
| "epoch": 3.6823720552396426, | |
| "grad_norm": 0.008229166269302368, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6232364177703857, | |
| "mean_token_accuracy": 0.7465489506721497, | |
| "num_tokens": 21142672.0, | |
| "step": 567 | |
| }, | |
| { | |
| "entropy": 0.6002631187438965, | |
| "epoch": 3.6888708367181153, | |
| "grad_norm": 0.00970839336514473, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6064876914024353, | |
| "mean_token_accuracy": 0.7520908117294312, | |
| "num_tokens": 21179768.0, | |
| "step": 568 | |
| }, | |
| { | |
| "entropy": 0.606594480574131, | |
| "epoch": 3.695369618196588, | |
| "grad_norm": 0.00952630303800106, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6108591556549072, | |
| "mean_token_accuracy": 0.751940131187439, | |
| "num_tokens": 21217131.0, | |
| "step": 569 | |
| }, | |
| { | |
| "entropy": 0.6083743423223495, | |
| "epoch": 3.7018683996750608, | |
| "grad_norm": 0.008894224651157856, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6050914525985718, | |
| "mean_token_accuracy": 0.7556580603122711, | |
| "num_tokens": 21254612.0, | |
| "step": 570 | |
| }, | |
| { | |
| "entropy": 0.6244188398122787, | |
| "epoch": 3.708367181153534, | |
| "grad_norm": 0.00945176463574171, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6213344931602478, | |
| "mean_token_accuracy": 0.7479386925697327, | |
| "num_tokens": 21292008.0, | |
| "step": 571 | |
| }, | |
| { | |
| "entropy": 0.6202782392501831, | |
| "epoch": 3.7148659626320066, | |
| "grad_norm": 0.007808351423591375, | |
| "learning_rate": 0.0002, | |
| "loss": 0.618791937828064, | |
| "mean_token_accuracy": 0.7479956671595573, | |
| "num_tokens": 21329211.0, | |
| "step": 572 | |
| }, | |
| { | |
| "entropy": 0.6083357259631157, | |
| "epoch": 3.7213647441104794, | |
| "grad_norm": 0.009738109074532986, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6082479953765869, | |
| "mean_token_accuracy": 0.7511337921023369, | |
| "num_tokens": 21366830.0, | |
| "step": 573 | |
| }, | |
| { | |
| "entropy": 0.6160146668553352, | |
| "epoch": 3.727863525588952, | |
| "grad_norm": 0.008708451874554157, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6203808784484863, | |
| "mean_token_accuracy": 0.749162532389164, | |
| "num_tokens": 21404012.0, | |
| "step": 574 | |
| }, | |
| { | |
| "entropy": 0.6103571355342865, | |
| "epoch": 3.734362307067425, | |
| "grad_norm": 0.008490422740578651, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6149444580078125, | |
| "mean_token_accuracy": 0.7492819800972939, | |
| "num_tokens": 21441418.0, | |
| "step": 575 | |
| }, | |
| { | |
| "entropy": 0.6097893342375755, | |
| "epoch": 3.7408610885458975, | |
| "grad_norm": 0.008159926161170006, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6121622323989868, | |
| "mean_token_accuracy": 0.7502710297703743, | |
| "num_tokens": 21478959.0, | |
| "step": 576 | |
| }, | |
| { | |
| "entropy": 0.608406588435173, | |
| "epoch": 3.74735987002437, | |
| "grad_norm": 0.007408132776618004, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6112476587295532, | |
| "mean_token_accuracy": 0.7514019384980202, | |
| "num_tokens": 21516469.0, | |
| "step": 577 | |
| }, | |
| { | |
| "entropy": 0.6059915721416473, | |
| "epoch": 3.7538586515028434, | |
| "grad_norm": 0.007707294542342424, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6102927923202515, | |
| "mean_token_accuracy": 0.7524895742535591, | |
| "num_tokens": 21553955.0, | |
| "step": 578 | |
| }, | |
| { | |
| "entropy": 0.6110079139471054, | |
| "epoch": 3.760357432981316, | |
| "grad_norm": 0.008303117007017136, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6116464734077454, | |
| "mean_token_accuracy": 0.7515735402703285, | |
| "num_tokens": 21591222.0, | |
| "step": 579 | |
| }, | |
| { | |
| "entropy": 0.6157199367880821, | |
| "epoch": 3.766856214459789, | |
| "grad_norm": 0.008788561448454857, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6139419078826904, | |
| "mean_token_accuracy": 0.7500691562891006, | |
| "num_tokens": 21628586.0, | |
| "step": 580 | |
| }, | |
| { | |
| "entropy": 0.6189565733075142, | |
| "epoch": 3.7733549959382615, | |
| "grad_norm": 0.008861690759658813, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6205735802650452, | |
| "mean_token_accuracy": 0.7461571544408798, | |
| "num_tokens": 21665902.0, | |
| "step": 581 | |
| }, | |
| { | |
| "entropy": 0.6169708073139191, | |
| "epoch": 3.7798537774167342, | |
| "grad_norm": 0.00858966913074255, | |
| "learning_rate": 0.0002, | |
| "loss": 0.616493284702301, | |
| "mean_token_accuracy": 0.7478131875395775, | |
| "num_tokens": 21703347.0, | |
| "step": 582 | |
| }, | |
| { | |
| "entropy": 0.6013945862650871, | |
| "epoch": 3.7863525588952074, | |
| "grad_norm": 0.007991503924131393, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6024019718170166, | |
| "mean_token_accuracy": 0.7541673332452774, | |
| "num_tokens": 21740476.0, | |
| "step": 583 | |
| }, | |
| { | |
| "entropy": 0.6127390787005424, | |
| "epoch": 3.79285134037368, | |
| "grad_norm": 0.008759486488997936, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6142678260803223, | |
| "mean_token_accuracy": 0.7489368915557861, | |
| "num_tokens": 21777903.0, | |
| "step": 584 | |
| }, | |
| { | |
| "entropy": 0.6033598631620407, | |
| "epoch": 3.799350121852153, | |
| "grad_norm": 0.008402034640312195, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6062989234924316, | |
| "mean_token_accuracy": 0.7526213079690933, | |
| "num_tokens": 21815411.0, | |
| "step": 585 | |
| }, | |
| { | |
| "entropy": 0.6237991526722908, | |
| "epoch": 3.8058489033306255, | |
| "grad_norm": 0.008741356432437897, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6236557960510254, | |
| "mean_token_accuracy": 0.7458471432328224, | |
| "num_tokens": 21852563.0, | |
| "step": 586 | |
| }, | |
| { | |
| "entropy": 0.6021682396531105, | |
| "epoch": 3.8123476848090982, | |
| "grad_norm": 0.009454802609980106, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6056302785873413, | |
| "mean_token_accuracy": 0.7534916624426842, | |
| "num_tokens": 21889751.0, | |
| "step": 587 | |
| }, | |
| { | |
| "entropy": 0.6037532165646553, | |
| "epoch": 3.818846466287571, | |
| "grad_norm": 0.008019194938242435, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6062440872192383, | |
| "mean_token_accuracy": 0.75218416005373, | |
| "num_tokens": 21927225.0, | |
| "step": 588 | |
| }, | |
| { | |
| "entropy": 0.6175741031765938, | |
| "epoch": 3.8253452477660437, | |
| "grad_norm": 0.010461182333528996, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6219437122344971, | |
| "mean_token_accuracy": 0.7449553832411766, | |
| "num_tokens": 21964899.0, | |
| "step": 589 | |
| }, | |
| { | |
| "entropy": 0.6165783628821373, | |
| "epoch": 3.8318440292445164, | |
| "grad_norm": 0.007971042767167091, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6164169311523438, | |
| "mean_token_accuracy": 0.7500692084431648, | |
| "num_tokens": 22001937.0, | |
| "step": 590 | |
| }, | |
| { | |
| "entropy": 0.6328809410333633, | |
| "epoch": 3.8383428107229896, | |
| "grad_norm": 0.019222697243094444, | |
| "learning_rate": 0.0002, | |
| "loss": 0.629861056804657, | |
| "mean_token_accuracy": 0.7441875413060188, | |
| "num_tokens": 22039681.0, | |
| "step": 591 | |
| }, | |
| { | |
| "entropy": 0.6060463637113571, | |
| "epoch": 3.8448415922014623, | |
| "grad_norm": 0.008333687670528889, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6049051880836487, | |
| "mean_token_accuracy": 0.7526820749044418, | |
| "num_tokens": 22077083.0, | |
| "step": 592 | |
| }, | |
| { | |
| "entropy": 0.626244343817234, | |
| "epoch": 3.851340373679935, | |
| "grad_norm": 0.011930772103369236, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6302248239517212, | |
| "mean_token_accuracy": 0.7435696348547935, | |
| "num_tokens": 22114449.0, | |
| "step": 593 | |
| }, | |
| { | |
| "entropy": 0.60886500030756, | |
| "epoch": 3.8578391551584077, | |
| "grad_norm": 0.00879514031112194, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6156384944915771, | |
| "mean_token_accuracy": 0.7500656992197037, | |
| "num_tokens": 22151803.0, | |
| "step": 594 | |
| }, | |
| { | |
| "entropy": 0.6130397766828537, | |
| "epoch": 3.864337936636881, | |
| "grad_norm": 0.008800708688795567, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6132546663284302, | |
| "mean_token_accuracy": 0.7525083422660828, | |
| "num_tokens": 22188933.0, | |
| "step": 595 | |
| }, | |
| { | |
| "entropy": 0.62311190366745, | |
| "epoch": 3.8708367181153536, | |
| "grad_norm": 0.0075268070213496685, | |
| "learning_rate": 0.0002, | |
| "loss": 0.624302864074707, | |
| "mean_token_accuracy": 0.7459553778171539, | |
| "num_tokens": 22226349.0, | |
| "step": 596 | |
| }, | |
| { | |
| "entropy": 0.6084966883063316, | |
| "epoch": 3.8773354995938263, | |
| "grad_norm": 0.008235939778387547, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6065037250518799, | |
| "mean_token_accuracy": 0.7519035413861275, | |
| "num_tokens": 22263929.0, | |
| "step": 597 | |
| }, | |
| { | |
| "entropy": 0.599085658788681, | |
| "epoch": 3.883834281072299, | |
| "grad_norm": 0.008155166171491146, | |
| "learning_rate": 0.0002, | |
| "loss": 0.60195392370224, | |
| "mean_token_accuracy": 0.7546913474798203, | |
| "num_tokens": 22301001.0, | |
| "step": 598 | |
| }, | |
| { | |
| "entropy": 0.6163361445069313, | |
| "epoch": 3.8903330625507717, | |
| "grad_norm": 0.009046819061040878, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6153905987739563, | |
| "mean_token_accuracy": 0.7495288848876953, | |
| "num_tokens": 22338602.0, | |
| "step": 599 | |
| }, | |
| { | |
| "entropy": 0.612362690269947, | |
| "epoch": 3.8968318440292444, | |
| "grad_norm": 0.008970526047050953, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6125571131706238, | |
| "mean_token_accuracy": 0.7503594160079956, | |
| "num_tokens": 22375832.0, | |
| "step": 600 | |
| }, | |
| { | |
| "entropy": 0.5970166251063347, | |
| "epoch": 3.903330625507717, | |
| "grad_norm": 0.010594755411148071, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6027450561523438, | |
| "mean_token_accuracy": 0.7523306459188461, | |
| "num_tokens": 22412582.0, | |
| "step": 601 | |
| }, | |
| { | |
| "entropy": 0.6120518818497658, | |
| "epoch": 3.90982940698619, | |
| "grad_norm": 0.008573422208428383, | |
| "learning_rate": 0.0002, | |
| "loss": 0.619284451007843, | |
| "mean_token_accuracy": 0.7469367831945419, | |
| "num_tokens": 22449548.0, | |
| "step": 602 | |
| }, | |
| { | |
| "entropy": 0.6074809059500694, | |
| "epoch": 3.916328188464663, | |
| "grad_norm": 0.008411690592765808, | |
| "learning_rate": 0.0002, | |
| "loss": 0.609643280506134, | |
| "mean_token_accuracy": 0.7513059079647064, | |
| "num_tokens": 22486961.0, | |
| "step": 603 | |
| }, | |
| { | |
| "entropy": 0.6189433708786964, | |
| "epoch": 3.9228269699431357, | |
| "grad_norm": 0.008104969747364521, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6152623891830444, | |
| "mean_token_accuracy": 0.7489224672317505, | |
| "num_tokens": 22524327.0, | |
| "step": 604 | |
| }, | |
| { | |
| "entropy": 0.6386607512831688, | |
| "epoch": 3.9293257514216084, | |
| "grad_norm": 0.007721316535025835, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6365233659744263, | |
| "mean_token_accuracy": 0.7393748313188553, | |
| "num_tokens": 22561540.0, | |
| "step": 605 | |
| }, | |
| { | |
| "entropy": 0.6104080379009247, | |
| "epoch": 3.935824532900081, | |
| "grad_norm": 0.009160472080111504, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6058955192565918, | |
| "mean_token_accuracy": 0.7527115345001221, | |
| "num_tokens": 22598714.0, | |
| "step": 606 | |
| }, | |
| { | |
| "entropy": 0.6066436171531677, | |
| "epoch": 3.942323314378554, | |
| "grad_norm": 0.00924257654696703, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6112688779830933, | |
| "mean_token_accuracy": 0.7510428801178932, | |
| "num_tokens": 22636168.0, | |
| "step": 607 | |
| }, | |
| { | |
| "entropy": 0.6113385632634163, | |
| "epoch": 3.948822095857027, | |
| "grad_norm": 0.009213161654770374, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6169242858886719, | |
| "mean_token_accuracy": 0.7488819509744644, | |
| "num_tokens": 22673222.0, | |
| "step": 608 | |
| }, | |
| { | |
| "entropy": 0.6157431975007057, | |
| "epoch": 3.9553208773354998, | |
| "grad_norm": 0.00805346667766571, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6147987842559814, | |
| "mean_token_accuracy": 0.7497100383043289, | |
| "num_tokens": 22710362.0, | |
| "step": 609 | |
| }, | |
| { | |
| "entropy": 0.6155053228139877, | |
| "epoch": 3.9618196588139725, | |
| "grad_norm": 0.008978918194770813, | |
| "learning_rate": 0.0002, | |
| "loss": 0.614108681678772, | |
| "mean_token_accuracy": 0.7489725723862648, | |
| "num_tokens": 22747892.0, | |
| "step": 610 | |
| }, | |
| { | |
| "entropy": 0.6131211444735527, | |
| "epoch": 3.968318440292445, | |
| "grad_norm": 0.010324759408831596, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6139857769012451, | |
| "mean_token_accuracy": 0.7501854747533798, | |
| "num_tokens": 22784987.0, | |
| "step": 611 | |
| }, | |
| { | |
| "entropy": 0.6161521598696709, | |
| "epoch": 3.974817221770918, | |
| "grad_norm": 0.009645137935876846, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6184964179992676, | |
| "mean_token_accuracy": 0.748919740319252, | |
| "num_tokens": 22822604.0, | |
| "step": 612 | |
| }, | |
| { | |
| "entropy": 0.6195979118347168, | |
| "epoch": 3.9813160032493906, | |
| "grad_norm": 0.008733006194233894, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6204901933670044, | |
| "mean_token_accuracy": 0.7458331510424614, | |
| "num_tokens": 22859577.0, | |
| "step": 613 | |
| }, | |
| { | |
| "entropy": 0.6223805174231529, | |
| "epoch": 3.9878147847278633, | |
| "grad_norm": 0.008579275570809841, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6251469850540161, | |
| "mean_token_accuracy": 0.7441524565219879, | |
| "num_tokens": 22897065.0, | |
| "step": 614 | |
| }, | |
| { | |
| "entropy": 0.6099046468734741, | |
| "epoch": 3.994313566206336, | |
| "grad_norm": 0.009405579417943954, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6134316921234131, | |
| "mean_token_accuracy": 0.7505489960312843, | |
| "num_tokens": 22934240.0, | |
| "step": 615 | |
| }, | |
| { | |
| "entropy": 0.5790954487664359, | |
| "epoch": 4.0, | |
| "grad_norm": 0.011152846738696098, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6086491346359253, | |
| "mean_token_accuracy": 0.7593175172805786, | |
| "num_tokens": 22950408.0, | |
| "step": 616 | |
| }, | |
| { | |
| "entropy": 0.6060308367013931, | |
| "epoch": 4.006498781478473, | |
| "grad_norm": 0.008177882991731167, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6047600507736206, | |
| "mean_token_accuracy": 0.7523083239793777, | |
| "num_tokens": 22987854.0, | |
| "step": 617 | |
| }, | |
| { | |
| "entropy": 0.60086639970541, | |
| "epoch": 4.012997562956945, | |
| "grad_norm": 0.009073281660676003, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5952266454696655, | |
| "mean_token_accuracy": 0.7580123767256737, | |
| "num_tokens": 23025377.0, | |
| "step": 618 | |
| }, | |
| { | |
| "entropy": 0.5975999683141708, | |
| "epoch": 4.019496344435418, | |
| "grad_norm": 0.00987546518445015, | |
| "learning_rate": 0.0002, | |
| "loss": 0.596405565738678, | |
| "mean_token_accuracy": 0.7551270872354507, | |
| "num_tokens": 23062634.0, | |
| "step": 619 | |
| }, | |
| { | |
| "entropy": 0.6007415279746056, | |
| "epoch": 4.025995125913891, | |
| "grad_norm": 0.008907251060009003, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6056969165802002, | |
| "mean_token_accuracy": 0.752616822719574, | |
| "num_tokens": 23099758.0, | |
| "step": 620 | |
| }, | |
| { | |
| "entropy": 0.5893639698624611, | |
| "epoch": 4.032493907392364, | |
| "grad_norm": 0.010224535129964352, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5967025756835938, | |
| "mean_token_accuracy": 0.7561892941594124, | |
| "num_tokens": 23137072.0, | |
| "step": 621 | |
| }, | |
| { | |
| "entropy": 0.60489272326231, | |
| "epoch": 4.038992688870836, | |
| "grad_norm": 0.011304826475679874, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6063746213912964, | |
| "mean_token_accuracy": 0.7524363398551941, | |
| "num_tokens": 23174098.0, | |
| "step": 622 | |
| }, | |
| { | |
| "entropy": 0.6080682426691055, | |
| "epoch": 4.04549147034931, | |
| "grad_norm": 0.009452976286411285, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6047728061676025, | |
| "mean_token_accuracy": 0.7509661018848419, | |
| "num_tokens": 23211396.0, | |
| "step": 623 | |
| }, | |
| { | |
| "entropy": 0.6045035719871521, | |
| "epoch": 4.051990251827783, | |
| "grad_norm": 0.010957913473248482, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6045751571655273, | |
| "mean_token_accuracy": 0.7534721195697784, | |
| "num_tokens": 23248640.0, | |
| "step": 624 | |
| }, | |
| { | |
| "entropy": 0.6037070825695992, | |
| "epoch": 4.058489033306255, | |
| "grad_norm": 0.011129945516586304, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6084102392196655, | |
| "mean_token_accuracy": 0.7514655515551567, | |
| "num_tokens": 23286103.0, | |
| "step": 625 | |
| }, | |
| { | |
| "entropy": 0.6091515198349953, | |
| "epoch": 4.064987814784728, | |
| "grad_norm": 0.011563125997781754, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6175334453582764, | |
| "mean_token_accuracy": 0.7468038350343704, | |
| "num_tokens": 23323689.0, | |
| "step": 626 | |
| }, | |
| { | |
| "entropy": 0.624121755361557, | |
| "epoch": 4.071486596263201, | |
| "grad_norm": 0.010375406593084335, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6241302490234375, | |
| "mean_token_accuracy": 0.7438605725765228, | |
| "num_tokens": 23361119.0, | |
| "step": 627 | |
| }, | |
| { | |
| "entropy": 0.6100181490182877, | |
| "epoch": 4.0779853777416735, | |
| "grad_norm": 0.011141455732285976, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6070010662078857, | |
| "mean_token_accuracy": 0.7539649158716202, | |
| "num_tokens": 23398396.0, | |
| "step": 628 | |
| }, | |
| { | |
| "entropy": 0.6109626740217209, | |
| "epoch": 4.084484159220146, | |
| "grad_norm": 0.008930398151278496, | |
| "learning_rate": 0.0002, | |
| "loss": 0.610953688621521, | |
| "mean_token_accuracy": 0.7503283470869064, | |
| "num_tokens": 23435949.0, | |
| "step": 629 | |
| }, | |
| { | |
| "entropy": 0.5975475162267685, | |
| "epoch": 4.090982940698619, | |
| "grad_norm": 0.00977004412561655, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6004647612571716, | |
| "mean_token_accuracy": 0.755259171128273, | |
| "num_tokens": 23473365.0, | |
| "step": 630 | |
| }, | |
| { | |
| "entropy": 0.5996551141142845, | |
| "epoch": 4.097481722177092, | |
| "grad_norm": 0.009881756268441677, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6020142436027527, | |
| "mean_token_accuracy": 0.7552994042634964, | |
| "num_tokens": 23510883.0, | |
| "step": 631 | |
| }, | |
| { | |
| "entropy": 0.6100725084543228, | |
| "epoch": 4.103980503655564, | |
| "grad_norm": 0.009554548189043999, | |
| "learning_rate": 0.0002, | |
| "loss": 0.60805743932724, | |
| "mean_token_accuracy": 0.749746523797512, | |
| "num_tokens": 23548279.0, | |
| "step": 632 | |
| }, | |
| { | |
| "entropy": 0.604118101298809, | |
| "epoch": 4.110479285134037, | |
| "grad_norm": 0.0090833380818367, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6060141324996948, | |
| "mean_token_accuracy": 0.7535399347543716, | |
| "num_tokens": 23585460.0, | |
| "step": 633 | |
| }, | |
| { | |
| "entropy": 0.6112289279699326, | |
| "epoch": 4.11697806661251, | |
| "grad_norm": 0.009132446721196175, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6089117527008057, | |
| "mean_token_accuracy": 0.7522810772061348, | |
| "num_tokens": 23623069.0, | |
| "step": 634 | |
| }, | |
| { | |
| "entropy": 0.5981876626610756, | |
| "epoch": 4.123476848090983, | |
| "grad_norm": 0.009694000706076622, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6000718474388123, | |
| "mean_token_accuracy": 0.7525889277458191, | |
| "num_tokens": 23660201.0, | |
| "step": 635 | |
| }, | |
| { | |
| "entropy": 0.6080240532755852, | |
| "epoch": 4.129975629569456, | |
| "grad_norm": 0.009349804371595383, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6115583181381226, | |
| "mean_token_accuracy": 0.7498094886541367, | |
| "num_tokens": 23697467.0, | |
| "step": 636 | |
| }, | |
| { | |
| "entropy": 0.6051702946424484, | |
| "epoch": 4.136474411047929, | |
| "grad_norm": 0.00995174515992403, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6054593324661255, | |
| "mean_token_accuracy": 0.7512011528015137, | |
| "num_tokens": 23734887.0, | |
| "step": 637 | |
| }, | |
| { | |
| "entropy": 0.6021575108170509, | |
| "epoch": 4.1429731925264015, | |
| "grad_norm": 0.011656476184725761, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6069491505622864, | |
| "mean_token_accuracy": 0.7523794695734978, | |
| "num_tokens": 23772003.0, | |
| "step": 638 | |
| }, | |
| { | |
| "entropy": 0.6030121594667435, | |
| "epoch": 4.149471974004874, | |
| "grad_norm": 0.009891415014863014, | |
| "learning_rate": 0.0002, | |
| "loss": 0.604573667049408, | |
| "mean_token_accuracy": 0.7512457966804504, | |
| "num_tokens": 23809089.0, | |
| "step": 639 | |
| }, | |
| { | |
| "entropy": 0.5972474366426468, | |
| "epoch": 4.155970755483347, | |
| "grad_norm": 0.011574115604162216, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5955284833908081, | |
| "mean_token_accuracy": 0.7579837068915367, | |
| "num_tokens": 23846256.0, | |
| "step": 640 | |
| }, | |
| { | |
| "entropy": 0.6166966333985329, | |
| "epoch": 4.16246953696182, | |
| "grad_norm": 0.010048413649201393, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6198529005050659, | |
| "mean_token_accuracy": 0.7490389570593834, | |
| "num_tokens": 23884254.0, | |
| "step": 641 | |
| }, | |
| { | |
| "entropy": 0.5962498784065247, | |
| "epoch": 4.168968318440292, | |
| "grad_norm": 0.011094493791460991, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6002663969993591, | |
| "mean_token_accuracy": 0.7531006932258606, | |
| "num_tokens": 23921748.0, | |
| "step": 642 | |
| }, | |
| { | |
| "entropy": 0.6103070974349976, | |
| "epoch": 4.175467099918765, | |
| "grad_norm": 0.0102005023509264, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6120426654815674, | |
| "mean_token_accuracy": 0.7472726628184319, | |
| "num_tokens": 23959118.0, | |
| "step": 643 | |
| }, | |
| { | |
| "entropy": 0.6111981943249702, | |
| "epoch": 4.181965881397238, | |
| "grad_norm": 0.010743658058345318, | |
| "learning_rate": 0.0002, | |
| "loss": 0.608763575553894, | |
| "mean_token_accuracy": 0.7516906931996346, | |
| "num_tokens": 23996874.0, | |
| "step": 644 | |
| }, | |
| { | |
| "entropy": 0.6073967814445496, | |
| "epoch": 4.1884646628757105, | |
| "grad_norm": 0.011524532921612263, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6078468561172485, | |
| "mean_token_accuracy": 0.750710740685463, | |
| "num_tokens": 24034180.0, | |
| "step": 645 | |
| }, | |
| { | |
| "entropy": 0.6122067421674728, | |
| "epoch": 4.194963444354183, | |
| "grad_norm": 0.009897702373564243, | |
| "learning_rate": 0.0002, | |
| "loss": 0.613964319229126, | |
| "mean_token_accuracy": 0.7508190050721169, | |
| "num_tokens": 24071959.0, | |
| "step": 646 | |
| }, | |
| { | |
| "entropy": 0.6176895946264267, | |
| "epoch": 4.201462225832657, | |
| "grad_norm": 0.010724211111664772, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6206725835800171, | |
| "mean_token_accuracy": 0.7463300824165344, | |
| "num_tokens": 24109459.0, | |
| "step": 647 | |
| }, | |
| { | |
| "entropy": 0.6166289448738098, | |
| "epoch": 4.2079610073111295, | |
| "grad_norm": 0.011503348127007484, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6165927052497864, | |
| "mean_token_accuracy": 0.7491984441876411, | |
| "num_tokens": 24146901.0, | |
| "step": 648 | |
| }, | |
| { | |
| "entropy": 0.6203835979104042, | |
| "epoch": 4.214459788789602, | |
| "grad_norm": 0.010957739315927029, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6207370758056641, | |
| "mean_token_accuracy": 0.7465796917676926, | |
| "num_tokens": 24184105.0, | |
| "step": 649 | |
| }, | |
| { | |
| "entropy": 0.608573280274868, | |
| "epoch": 4.220958570268075, | |
| "grad_norm": 0.012403266504406929, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6109322309494019, | |
| "mean_token_accuracy": 0.7499670162796974, | |
| "num_tokens": 24221373.0, | |
| "step": 650 | |
| }, | |
| { | |
| "entropy": 0.61744424700737, | |
| "epoch": 4.227457351746548, | |
| "grad_norm": 0.010664467699825764, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6191272735595703, | |
| "mean_token_accuracy": 0.7458655536174774, | |
| "num_tokens": 24259291.0, | |
| "step": 651 | |
| }, | |
| { | |
| "entropy": 0.601327195763588, | |
| "epoch": 4.23395613322502, | |
| "grad_norm": 0.012125416658818722, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6103509664535522, | |
| "mean_token_accuracy": 0.7481491416692734, | |
| "num_tokens": 24296467.0, | |
| "step": 652 | |
| }, | |
| { | |
| "entropy": 0.6011637076735497, | |
| "epoch": 4.240454914703493, | |
| "grad_norm": 0.011278907768428326, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6051167845726013, | |
| "mean_token_accuracy": 0.7522369399666786, | |
| "num_tokens": 24334038.0, | |
| "step": 653 | |
| }, | |
| { | |
| "entropy": 0.624407596886158, | |
| "epoch": 4.246953696181966, | |
| "grad_norm": 0.011394547298550606, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6223498582839966, | |
| "mean_token_accuracy": 0.7456056624650955, | |
| "num_tokens": 24371361.0, | |
| "step": 654 | |
| }, | |
| { | |
| "entropy": 0.6008864194154739, | |
| "epoch": 4.2534524776604385, | |
| "grad_norm": 0.010803118348121643, | |
| "learning_rate": 0.0002, | |
| "loss": 0.595673680305481, | |
| "mean_token_accuracy": 0.7541809007525444, | |
| "num_tokens": 24408760.0, | |
| "step": 655 | |
| }, | |
| { | |
| "entropy": 0.6180669814348221, | |
| "epoch": 4.259951259138911, | |
| "grad_norm": 0.010789727792143822, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6144995093345642, | |
| "mean_token_accuracy": 0.7488504275679588, | |
| "num_tokens": 24446067.0, | |
| "step": 656 | |
| }, | |
| { | |
| "entropy": 0.5908245071768761, | |
| "epoch": 4.266450040617384, | |
| "grad_norm": 0.013646950013935566, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5992537140846252, | |
| "mean_token_accuracy": 0.7573117613792419, | |
| "num_tokens": 24483475.0, | |
| "step": 657 | |
| }, | |
| { | |
| "entropy": 0.6028355807065964, | |
| "epoch": 4.272948822095857, | |
| "grad_norm": 0.012632039375603199, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6093482971191406, | |
| "mean_token_accuracy": 0.7510194182395935, | |
| "num_tokens": 24520599.0, | |
| "step": 658 | |
| }, | |
| { | |
| "entropy": 0.6133154481649399, | |
| "epoch": 4.279447603574329, | |
| "grad_norm": 0.009593473747372627, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6142933964729309, | |
| "mean_token_accuracy": 0.749172069132328, | |
| "num_tokens": 24557970.0, | |
| "step": 659 | |
| }, | |
| { | |
| "entropy": 0.6059748083353043, | |
| "epoch": 4.285946385052803, | |
| "grad_norm": 0.010930807329714298, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6034088134765625, | |
| "mean_token_accuracy": 0.7542562857270241, | |
| "num_tokens": 24595447.0, | |
| "step": 660 | |
| }, | |
| { | |
| "entropy": 0.6150760650634766, | |
| "epoch": 4.292445166531276, | |
| "grad_norm": 0.012249140068888664, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6127879023551941, | |
| "mean_token_accuracy": 0.7484256699681282, | |
| "num_tokens": 24632972.0, | |
| "step": 661 | |
| }, | |
| { | |
| "entropy": 0.6088320016860962, | |
| "epoch": 4.298943948009748, | |
| "grad_norm": 0.010698465630412102, | |
| "learning_rate": 0.0002, | |
| "loss": 0.611052930355072, | |
| "mean_token_accuracy": 0.7510727941989899, | |
| "num_tokens": 24670189.0, | |
| "step": 662 | |
| }, | |
| { | |
| "entropy": 0.5984915345907211, | |
| "epoch": 4.305442729488221, | |
| "grad_norm": 0.012718550860881805, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6050142049789429, | |
| "mean_token_accuracy": 0.7525518760085106, | |
| "num_tokens": 24706956.0, | |
| "step": 663 | |
| }, | |
| { | |
| "entropy": 0.6053661406040192, | |
| "epoch": 4.311941510966694, | |
| "grad_norm": 0.00997387245297432, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6083434820175171, | |
| "mean_token_accuracy": 0.7501671761274338, | |
| "num_tokens": 24744572.0, | |
| "step": 664 | |
| }, | |
| { | |
| "entropy": 0.5996779799461365, | |
| "epoch": 4.318440292445167, | |
| "grad_norm": 0.009505977854132652, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6021357774734497, | |
| "mean_token_accuracy": 0.753576286137104, | |
| "num_tokens": 24782008.0, | |
| "step": 665 | |
| }, | |
| { | |
| "entropy": 0.6148371547460556, | |
| "epoch": 4.324939073923639, | |
| "grad_norm": 0.010230735875666142, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6132264137268066, | |
| "mean_token_accuracy": 0.7497095540165901, | |
| "num_tokens": 24819250.0, | |
| "step": 666 | |
| }, | |
| { | |
| "entropy": 0.6186807677149773, | |
| "epoch": 4.331437855402112, | |
| "grad_norm": 0.011359174735844135, | |
| "learning_rate": 0.0002, | |
| "loss": 0.616733193397522, | |
| "mean_token_accuracy": 0.7471146136522293, | |
| "num_tokens": 24856525.0, | |
| "step": 667 | |
| }, | |
| { | |
| "entropy": 0.5949462577700615, | |
| "epoch": 4.337936636880585, | |
| "grad_norm": 0.009301742538809776, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5954026579856873, | |
| "mean_token_accuracy": 0.7579122558236122, | |
| "num_tokens": 24893833.0, | |
| "step": 668 | |
| }, | |
| { | |
| "entropy": 0.6139709204435349, | |
| "epoch": 4.344435418359057, | |
| "grad_norm": 0.009777146391570568, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6152162551879883, | |
| "mean_token_accuracy": 0.7482587099075317, | |
| "num_tokens": 24931302.0, | |
| "step": 669 | |
| }, | |
| { | |
| "entropy": 0.6105548739433289, | |
| "epoch": 4.35093419983753, | |
| "grad_norm": 0.009922128170728683, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6112467646598816, | |
| "mean_token_accuracy": 0.7494839727878571, | |
| "num_tokens": 24968727.0, | |
| "step": 670 | |
| }, | |
| { | |
| "entropy": 0.6040442362427711, | |
| "epoch": 4.357432981316003, | |
| "grad_norm": 0.009872304275631905, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6058943271636963, | |
| "mean_token_accuracy": 0.7517568320035934, | |
| "num_tokens": 25006181.0, | |
| "step": 671 | |
| }, | |
| { | |
| "entropy": 0.6142793446779251, | |
| "epoch": 4.363931762794476, | |
| "grad_norm": 0.009624022990465164, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6160279512405396, | |
| "mean_token_accuracy": 0.7462561428546906, | |
| "num_tokens": 25043335.0, | |
| "step": 672 | |
| }, | |
| { | |
| "entropy": 0.6127363592386246, | |
| "epoch": 4.370430544272949, | |
| "grad_norm": 0.00913744606077671, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6129778027534485, | |
| "mean_token_accuracy": 0.750290147960186, | |
| "num_tokens": 25081246.0, | |
| "step": 673 | |
| }, | |
| { | |
| "entropy": 0.6002702713012695, | |
| "epoch": 4.376929325751422, | |
| "grad_norm": 0.010623721405863762, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6051443815231323, | |
| "mean_token_accuracy": 0.7518057897686958, | |
| "num_tokens": 25118440.0, | |
| "step": 674 | |
| }, | |
| { | |
| "entropy": 0.6069729775190353, | |
| "epoch": 4.383428107229895, | |
| "grad_norm": 0.011354091577231884, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6139703989028931, | |
| "mean_token_accuracy": 0.7482916563749313, | |
| "num_tokens": 25155694.0, | |
| "step": 675 | |
| }, | |
| { | |
| "entropy": 0.6122787147760391, | |
| "epoch": 4.389926888708367, | |
| "grad_norm": 0.009671922773122787, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6111292839050293, | |
| "mean_token_accuracy": 0.7500254139304161, | |
| "num_tokens": 25192885.0, | |
| "step": 676 | |
| }, | |
| { | |
| "entropy": 0.6137835532426834, | |
| "epoch": 4.39642567018684, | |
| "grad_norm": 0.009973683394491673, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6136457920074463, | |
| "mean_token_accuracy": 0.7491521015763283, | |
| "num_tokens": 25230234.0, | |
| "step": 677 | |
| }, | |
| { | |
| "entropy": 0.6145277097821236, | |
| "epoch": 4.402924451665313, | |
| "grad_norm": 0.010024932213127613, | |
| "learning_rate": 0.0002, | |
| "loss": 0.612713634967804, | |
| "mean_token_accuracy": 0.7496964707970619, | |
| "num_tokens": 25267657.0, | |
| "step": 678 | |
| }, | |
| { | |
| "entropy": 0.6107024550437927, | |
| "epoch": 4.4094232331437855, | |
| "grad_norm": 0.009390750899910927, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6097205281257629, | |
| "mean_token_accuracy": 0.7498994544148445, | |
| "num_tokens": 25305087.0, | |
| "step": 679 | |
| }, | |
| { | |
| "entropy": 0.6041795536875725, | |
| "epoch": 4.415922014622258, | |
| "grad_norm": 0.012812652625143528, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6109946370124817, | |
| "mean_token_accuracy": 0.7516659647226334, | |
| "num_tokens": 25342187.0, | |
| "step": 680 | |
| }, | |
| { | |
| "entropy": 0.5976850837469101, | |
| "epoch": 4.422420796100731, | |
| "grad_norm": 0.010710278525948524, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6007599830627441, | |
| "mean_token_accuracy": 0.7541299387812614, | |
| "num_tokens": 25379496.0, | |
| "step": 681 | |
| }, | |
| { | |
| "entropy": 0.6042672917246819, | |
| "epoch": 4.428919577579204, | |
| "grad_norm": 0.011890453286468983, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6084088087081909, | |
| "mean_token_accuracy": 0.7506248950958252, | |
| "num_tokens": 25416619.0, | |
| "step": 682 | |
| }, | |
| { | |
| "entropy": 0.5986599251627922, | |
| "epoch": 4.435418359057676, | |
| "grad_norm": 0.010659754276275635, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5982859134674072, | |
| "mean_token_accuracy": 0.7548331841826439, | |
| "num_tokens": 25453693.0, | |
| "step": 683 | |
| }, | |
| { | |
| "entropy": 0.616942897439003, | |
| "epoch": 4.441917140536149, | |
| "grad_norm": 0.01076586078852415, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6122304201126099, | |
| "mean_token_accuracy": 0.7499786019325256, | |
| "num_tokens": 25491062.0, | |
| "step": 684 | |
| }, | |
| { | |
| "entropy": 0.6103186085820198, | |
| "epoch": 4.448415922014623, | |
| "grad_norm": 0.010572830215096474, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6094003915786743, | |
| "mean_token_accuracy": 0.7506365403532982, | |
| "num_tokens": 25528185.0, | |
| "step": 685 | |
| }, | |
| { | |
| "entropy": 0.5939375460147858, | |
| "epoch": 4.454914703493095, | |
| "grad_norm": 0.011964102275669575, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6006197333335876, | |
| "mean_token_accuracy": 0.7550608739256859, | |
| "num_tokens": 25565262.0, | |
| "step": 686 | |
| }, | |
| { | |
| "entropy": 0.6017919331789017, | |
| "epoch": 4.461413484971568, | |
| "grad_norm": 0.013583175837993622, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6119198203086853, | |
| "mean_token_accuracy": 0.7524380683898926, | |
| "num_tokens": 25602632.0, | |
| "step": 687 | |
| }, | |
| { | |
| "entropy": 0.6157395392656326, | |
| "epoch": 4.467912266450041, | |
| "grad_norm": 0.009645634330809116, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6124662160873413, | |
| "mean_token_accuracy": 0.7506381198763847, | |
| "num_tokens": 25640141.0, | |
| "step": 688 | |
| }, | |
| { | |
| "entropy": 0.6060995981097221, | |
| "epoch": 4.4744110479285135, | |
| "grad_norm": 0.011023740284144878, | |
| "learning_rate": 0.0002, | |
| "loss": 0.604090690612793, | |
| "mean_token_accuracy": 0.7523544281721115, | |
| "num_tokens": 25676930.0, | |
| "step": 689 | |
| }, | |
| { | |
| "entropy": 0.6346146166324615, | |
| "epoch": 4.480909829406986, | |
| "grad_norm": 0.010563536547124386, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6303510665893555, | |
| "mean_token_accuracy": 0.7432904541492462, | |
| "num_tokens": 25714523.0, | |
| "step": 690 | |
| }, | |
| { | |
| "entropy": 0.6144333481788635, | |
| "epoch": 4.487408610885459, | |
| "grad_norm": 0.010604371316730976, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6150377988815308, | |
| "mean_token_accuracy": 0.74857547134161, | |
| "num_tokens": 25751872.0, | |
| "step": 691 | |
| }, | |
| { | |
| "entropy": 0.5893413797020912, | |
| "epoch": 4.493907392363932, | |
| "grad_norm": 0.010374541394412518, | |
| "learning_rate": 0.0002, | |
| "loss": 0.59273362159729, | |
| "mean_token_accuracy": 0.7577084898948669, | |
| "num_tokens": 25789255.0, | |
| "step": 692 | |
| }, | |
| { | |
| "entropy": 0.5985084772109985, | |
| "epoch": 4.500406173842404, | |
| "grad_norm": 0.010325289331376553, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5997466444969177, | |
| "mean_token_accuracy": 0.7552184760570526, | |
| "num_tokens": 25826911.0, | |
| "step": 693 | |
| }, | |
| { | |
| "entropy": 0.6087296083569527, | |
| "epoch": 4.506904955320877, | |
| "grad_norm": 0.012259433045983315, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6142268776893616, | |
| "mean_token_accuracy": 0.7504933401942253, | |
| "num_tokens": 25864195.0, | |
| "step": 694 | |
| }, | |
| { | |
| "entropy": 0.5923497229814529, | |
| "epoch": 4.51340373679935, | |
| "grad_norm": 0.011389669962227345, | |
| "learning_rate": 0.0002, | |
| "loss": 0.597306489944458, | |
| "mean_token_accuracy": 0.7565679550170898, | |
| "num_tokens": 25901656.0, | |
| "step": 695 | |
| }, | |
| { | |
| "entropy": 0.6001605242490768, | |
| "epoch": 4.5199025182778225, | |
| "grad_norm": 0.009456605650484562, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6000933051109314, | |
| "mean_token_accuracy": 0.7530366033315659, | |
| "num_tokens": 25939491.0, | |
| "step": 696 | |
| }, | |
| { | |
| "entropy": 0.5900749191641808, | |
| "epoch": 4.526401299756296, | |
| "grad_norm": 0.011240561492741108, | |
| "learning_rate": 0.0002, | |
| "loss": 0.59348464012146, | |
| "mean_token_accuracy": 0.7567196115851402, | |
| "num_tokens": 25976506.0, | |
| "step": 697 | |
| }, | |
| { | |
| "entropy": 0.5967278108000755, | |
| "epoch": 4.532900081234769, | |
| "grad_norm": 0.010507924482226372, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6000585556030273, | |
| "mean_token_accuracy": 0.7546230331063271, | |
| "num_tokens": 26013826.0, | |
| "step": 698 | |
| }, | |
| { | |
| "entropy": 0.5980387553572655, | |
| "epoch": 4.5393988627132416, | |
| "grad_norm": 0.01707952283322811, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6007162928581238, | |
| "mean_token_accuracy": 0.7539133131504059, | |
| "num_tokens": 26051676.0, | |
| "step": 699 | |
| }, | |
| { | |
| "entropy": 0.6002839356660843, | |
| "epoch": 4.545897644191714, | |
| "grad_norm": 0.01148629654198885, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6052761077880859, | |
| "mean_token_accuracy": 0.7534726038575172, | |
| "num_tokens": 26088813.0, | |
| "step": 700 | |
| }, | |
| { | |
| "entropy": 0.6063856557011604, | |
| "epoch": 4.552396425670187, | |
| "grad_norm": 0.04600154981017113, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6116973161697388, | |
| "mean_token_accuracy": 0.7503002285957336, | |
| "num_tokens": 26126381.0, | |
| "step": 701 | |
| }, | |
| { | |
| "entropy": 0.6121505573391914, | |
| "epoch": 4.55889520714866, | |
| "grad_norm": 0.01381687168031931, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6069159507751465, | |
| "mean_token_accuracy": 0.7519886940717697, | |
| "num_tokens": 26163482.0, | |
| "step": 702 | |
| }, | |
| { | |
| "entropy": 0.6286856532096863, | |
| "epoch": 4.565393988627132, | |
| "grad_norm": 0.010802995413541794, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6213472485542297, | |
| "mean_token_accuracy": 0.7473803609609604, | |
| "num_tokens": 26200948.0, | |
| "step": 703 | |
| }, | |
| { | |
| "entropy": 0.6292322054505348, | |
| "epoch": 4.571892770105605, | |
| "grad_norm": 0.01318847481161356, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6286896467208862, | |
| "mean_token_accuracy": 0.7422280386090279, | |
| "num_tokens": 26238501.0, | |
| "step": 704 | |
| }, | |
| { | |
| "entropy": 0.61526670306921, | |
| "epoch": 4.578391551584078, | |
| "grad_norm": 0.012318129651248455, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6191307306289673, | |
| "mean_token_accuracy": 0.7456179112195969, | |
| "num_tokens": 26276241.0, | |
| "step": 705 | |
| }, | |
| { | |
| "entropy": 0.5996731072664261, | |
| "epoch": 4.584890333062551, | |
| "grad_norm": 0.01126960851252079, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5998624563217163, | |
| "mean_token_accuracy": 0.7562123388051987, | |
| "num_tokens": 26313858.0, | |
| "step": 706 | |
| }, | |
| { | |
| "entropy": 0.6051791980862617, | |
| "epoch": 4.591389114541023, | |
| "grad_norm": 0.008872485719621181, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6033820509910583, | |
| "mean_token_accuracy": 0.7548251152038574, | |
| "num_tokens": 26351577.0, | |
| "step": 707 | |
| }, | |
| { | |
| "entropy": 0.603697344660759, | |
| "epoch": 4.597887896019496, | |
| "grad_norm": 0.01154793705791235, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6016978025436401, | |
| "mean_token_accuracy": 0.7543343156576157, | |
| "num_tokens": 26388978.0, | |
| "step": 708 | |
| }, | |
| { | |
| "entropy": 0.6170104667544365, | |
| "epoch": 4.604386677497969, | |
| "grad_norm": 0.01096999179571867, | |
| "learning_rate": 0.0002, | |
| "loss": 0.622772216796875, | |
| "mean_token_accuracy": 0.7449462041258812, | |
| "num_tokens": 26426264.0, | |
| "step": 709 | |
| }, | |
| { | |
| "entropy": 0.6072003245353699, | |
| "epoch": 4.610885458976442, | |
| "grad_norm": 0.010877830907702446, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6076858639717102, | |
| "mean_token_accuracy": 0.7529691979289055, | |
| "num_tokens": 26463914.0, | |
| "step": 710 | |
| }, | |
| { | |
| "entropy": 0.6025268062949181, | |
| "epoch": 4.617384240454915, | |
| "grad_norm": 0.011258685030043125, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6081684231758118, | |
| "mean_token_accuracy": 0.751194529235363, | |
| "num_tokens": 26501178.0, | |
| "step": 711 | |
| }, | |
| { | |
| "entropy": 0.6161645799875259, | |
| "epoch": 4.623883021933388, | |
| "grad_norm": 0.011774537153542042, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6219759583473206, | |
| "mean_token_accuracy": 0.7475455403327942, | |
| "num_tokens": 26538587.0, | |
| "step": 712 | |
| }, | |
| { | |
| "entropy": 0.61099823564291, | |
| "epoch": 4.6303818034118605, | |
| "grad_norm": 0.011626939289271832, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6097919940948486, | |
| "mean_token_accuracy": 0.7494744956493378, | |
| "num_tokens": 26576055.0, | |
| "step": 713 | |
| }, | |
| { | |
| "entropy": 0.5967102572321892, | |
| "epoch": 4.636880584890333, | |
| "grad_norm": 0.011615315452218056, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5964145660400391, | |
| "mean_token_accuracy": 0.7566935420036316, | |
| "num_tokens": 26613206.0, | |
| "step": 714 | |
| }, | |
| { | |
| "entropy": 0.6024897918105125, | |
| "epoch": 4.643379366368806, | |
| "grad_norm": 0.011359010823071003, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6033364534378052, | |
| "mean_token_accuracy": 0.75516776740551, | |
| "num_tokens": 26650906.0, | |
| "step": 715 | |
| }, | |
| { | |
| "entropy": 0.6127264201641083, | |
| "epoch": 4.649878147847279, | |
| "grad_norm": 0.011858063749969006, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6169857382774353, | |
| "mean_token_accuracy": 0.7504541873931885, | |
| "num_tokens": 26688277.0, | |
| "step": 716 | |
| }, | |
| { | |
| "entropy": 0.6103435754776001, | |
| "epoch": 4.656376929325751, | |
| "grad_norm": 0.012304591946303844, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6171730756759644, | |
| "mean_token_accuracy": 0.7490719556808472, | |
| "num_tokens": 26725704.0, | |
| "step": 717 | |
| }, | |
| { | |
| "entropy": 0.6082026064395905, | |
| "epoch": 4.662875710804224, | |
| "grad_norm": 0.00955925416201353, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6081550121307373, | |
| "mean_token_accuracy": 0.7512648478150368, | |
| "num_tokens": 26762897.0, | |
| "step": 718 | |
| }, | |
| { | |
| "entropy": 0.615670770406723, | |
| "epoch": 4.669374492282697, | |
| "grad_norm": 0.011302441358566284, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6137043833732605, | |
| "mean_token_accuracy": 0.7484593465924263, | |
| "num_tokens": 26799617.0, | |
| "step": 719 | |
| }, | |
| { | |
| "entropy": 0.6008039489388466, | |
| "epoch": 4.6758732737611695, | |
| "grad_norm": 0.010860615409910679, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5949652194976807, | |
| "mean_token_accuracy": 0.7573561295866966, | |
| "num_tokens": 26836935.0, | |
| "step": 720 | |
| }, | |
| { | |
| "entropy": 0.6153427511453629, | |
| "epoch": 4.682372055239643, | |
| "grad_norm": 0.01038694754242897, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6163858771324158, | |
| "mean_token_accuracy": 0.7477854266762733, | |
| "num_tokens": 26874482.0, | |
| "step": 721 | |
| }, | |
| { | |
| "entropy": 0.6078703328967094, | |
| "epoch": 4.688870836718115, | |
| "grad_norm": 0.011593160219490528, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6154011487960815, | |
| "mean_token_accuracy": 0.7504984140396118, | |
| "num_tokens": 26912012.0, | |
| "step": 722 | |
| }, | |
| { | |
| "entropy": 0.6097044795751572, | |
| "epoch": 4.6953696181965885, | |
| "grad_norm": 0.011452315375208855, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6159889698028564, | |
| "mean_token_accuracy": 0.7497701123356819, | |
| "num_tokens": 26949190.0, | |
| "step": 723 | |
| }, | |
| { | |
| "entropy": 0.6035362407565117, | |
| "epoch": 4.701868399675061, | |
| "grad_norm": 0.009807482361793518, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6073694229125977, | |
| "mean_token_accuracy": 0.7511623874306679, | |
| "num_tokens": 26986593.0, | |
| "step": 724 | |
| }, | |
| { | |
| "entropy": 0.6145569458603859, | |
| "epoch": 4.708367181153534, | |
| "grad_norm": 0.009589890018105507, | |
| "learning_rate": 0.0002, | |
| "loss": 0.615104079246521, | |
| "mean_token_accuracy": 0.7482927516102791, | |
| "num_tokens": 27023613.0, | |
| "step": 725 | |
| }, | |
| { | |
| "entropy": 0.6154572740197182, | |
| "epoch": 4.714865962632007, | |
| "grad_norm": 0.01081397570669651, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6108368635177612, | |
| "mean_token_accuracy": 0.7491915374994278, | |
| "num_tokens": 27061197.0, | |
| "step": 726 | |
| }, | |
| { | |
| "entropy": 0.620484970510006, | |
| "epoch": 4.721364744110479, | |
| "grad_norm": 0.009981570765376091, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6177104711532593, | |
| "mean_token_accuracy": 0.7493368536233902, | |
| "num_tokens": 27098608.0, | |
| "step": 727 | |
| }, | |
| { | |
| "entropy": 0.6061017587780952, | |
| "epoch": 4.727863525588952, | |
| "grad_norm": 0.011618540622293949, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6062725186347961, | |
| "mean_token_accuracy": 0.7519984692335129, | |
| "num_tokens": 27136501.0, | |
| "step": 728 | |
| }, | |
| { | |
| "entropy": 0.6067364290356636, | |
| "epoch": 4.734362307067425, | |
| "grad_norm": 0.009954583831131458, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6102150678634644, | |
| "mean_token_accuracy": 0.7502684965729713, | |
| "num_tokens": 27173703.0, | |
| "step": 729 | |
| }, | |
| { | |
| "entropy": 0.605129785835743, | |
| "epoch": 4.7408610885458975, | |
| "grad_norm": 0.012882952578365803, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6149674654006958, | |
| "mean_token_accuracy": 0.7470449358224869, | |
| "num_tokens": 27210993.0, | |
| "step": 730 | |
| }, | |
| { | |
| "entropy": 0.6143843829631805, | |
| "epoch": 4.74735987002437, | |
| "grad_norm": 0.010333128273487091, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6135010719299316, | |
| "mean_token_accuracy": 0.7495505511760712, | |
| "num_tokens": 27248544.0, | |
| "step": 731 | |
| }, | |
| { | |
| "entropy": 0.619462713599205, | |
| "epoch": 4.753858651502843, | |
| "grad_norm": 0.009751244448125362, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6161588430404663, | |
| "mean_token_accuracy": 0.7501519843935966, | |
| "num_tokens": 27286017.0, | |
| "step": 732 | |
| }, | |
| { | |
| "entropy": 0.6085372492671013, | |
| "epoch": 4.760357432981316, | |
| "grad_norm": 0.01087701041251421, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6058393716812134, | |
| "mean_token_accuracy": 0.7525414749979973, | |
| "num_tokens": 27323456.0, | |
| "step": 733 | |
| }, | |
| { | |
| "entropy": 0.6052304580807686, | |
| "epoch": 4.766856214459789, | |
| "grad_norm": 0.010626486502587795, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6062231063842773, | |
| "mean_token_accuracy": 0.7521145865321159, | |
| "num_tokens": 27360812.0, | |
| "step": 734 | |
| }, | |
| { | |
| "entropy": 0.609903909265995, | |
| "epoch": 4.773354995938262, | |
| "grad_norm": 0.010470789857208729, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6119512319564819, | |
| "mean_token_accuracy": 0.7512121498584747, | |
| "num_tokens": 27398510.0, | |
| "step": 735 | |
| }, | |
| { | |
| "entropy": 0.6010274812579155, | |
| "epoch": 4.779853777416735, | |
| "grad_norm": 0.009013401344418526, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6045113205909729, | |
| "mean_token_accuracy": 0.7538518905639648, | |
| "num_tokens": 27435677.0, | |
| "step": 736 | |
| }, | |
| { | |
| "entropy": 0.6044503897428513, | |
| "epoch": 4.786352558895207, | |
| "grad_norm": 0.009969563223421574, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6042656898498535, | |
| "mean_token_accuracy": 0.7533875405788422, | |
| "num_tokens": 27472951.0, | |
| "step": 737 | |
| }, | |
| { | |
| "entropy": 0.6085273697972298, | |
| "epoch": 4.79285134037368, | |
| "grad_norm": 0.010333449579775333, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6119939088821411, | |
| "mean_token_accuracy": 0.7497808411717415, | |
| "num_tokens": 27510678.0, | |
| "step": 738 | |
| }, | |
| { | |
| "entropy": 0.5953918546438217, | |
| "epoch": 4.799350121852153, | |
| "grad_norm": 0.011067725718021393, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6043837070465088, | |
| "mean_token_accuracy": 0.7549910023808479, | |
| "num_tokens": 27548061.0, | |
| "step": 739 | |
| }, | |
| { | |
| "entropy": 0.6027686223387718, | |
| "epoch": 4.8058489033306255, | |
| "grad_norm": 0.010080584324896336, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6062842011451721, | |
| "mean_token_accuracy": 0.752067320048809, | |
| "num_tokens": 27585301.0, | |
| "step": 740 | |
| }, | |
| { | |
| "entropy": 0.6061441823840141, | |
| "epoch": 4.812347684809098, | |
| "grad_norm": 0.009884923696517944, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6060526371002197, | |
| "mean_token_accuracy": 0.7508253157138824, | |
| "num_tokens": 27622471.0, | |
| "step": 741 | |
| }, | |
| { | |
| "entropy": 0.6114162281155586, | |
| "epoch": 4.818846466287571, | |
| "grad_norm": 0.009803572669625282, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6056950092315674, | |
| "mean_token_accuracy": 0.7509299144148827, | |
| "num_tokens": 27659725.0, | |
| "step": 742 | |
| }, | |
| { | |
| "entropy": 0.604758232831955, | |
| "epoch": 4.825345247766044, | |
| "grad_norm": 0.009157917462289333, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6060429811477661, | |
| "mean_token_accuracy": 0.7535065114498138, | |
| "num_tokens": 27697579.0, | |
| "step": 743 | |
| }, | |
| { | |
| "entropy": 0.6063171178102493, | |
| "epoch": 4.831844029244516, | |
| "grad_norm": 0.010433568619191647, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6129876971244812, | |
| "mean_token_accuracy": 0.7488505020737648, | |
| "num_tokens": 27735152.0, | |
| "step": 744 | |
| }, | |
| { | |
| "entropy": 0.6220549941062927, | |
| "epoch": 4.838342810722989, | |
| "grad_norm": 0.009133824147284031, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6260920166969299, | |
| "mean_token_accuracy": 0.7444146424531937, | |
| "num_tokens": 27772809.0, | |
| "step": 745 | |
| }, | |
| { | |
| "entropy": 0.6151563301682472, | |
| "epoch": 4.844841592201462, | |
| "grad_norm": 0.009275715798139572, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6143773794174194, | |
| "mean_token_accuracy": 0.7501434609293938, | |
| "num_tokens": 27810585.0, | |
| "step": 746 | |
| }, | |
| { | |
| "entropy": 0.6030779108405113, | |
| "epoch": 4.851340373679935, | |
| "grad_norm": 0.009752030484378338, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6026537418365479, | |
| "mean_token_accuracy": 0.7538170889019966, | |
| "num_tokens": 27848177.0, | |
| "step": 747 | |
| }, | |
| { | |
| "entropy": 0.6034507304430008, | |
| "epoch": 4.857839155158408, | |
| "grad_norm": 0.009275935590267181, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6020852327346802, | |
| "mean_token_accuracy": 0.7548267766833305, | |
| "num_tokens": 27885820.0, | |
| "step": 748 | |
| }, | |
| { | |
| "entropy": 0.5959972590208054, | |
| "epoch": 4.864337936636881, | |
| "grad_norm": 0.01019821036607027, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5997313857078552, | |
| "mean_token_accuracy": 0.7544100061058998, | |
| "num_tokens": 27923215.0, | |
| "step": 749 | |
| }, | |
| { | |
| "entropy": 0.5984265580773354, | |
| "epoch": 4.870836718115354, | |
| "grad_norm": 0.010381966829299927, | |
| "learning_rate": 0.0002, | |
| "loss": 0.5997567176818848, | |
| "mean_token_accuracy": 0.754194863140583, | |
| "num_tokens": 27960378.0, | |
| "step": 750 | |
| }, | |
| { | |
| "entropy": 0.6121873781085014, | |
| "epoch": 4.877335499593826, | |
| "grad_norm": 0.010476244613528252, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6164151430130005, | |
| "mean_token_accuracy": 0.747443437576294, | |
| "num_tokens": 27997671.0, | |
| "step": 751 | |
| }, | |
| { | |
| "entropy": 0.6084479093551636, | |
| "epoch": 4.883834281072299, | |
| "grad_norm": 0.011203959584236145, | |
| "learning_rate": 0.0002, | |
| "loss": 0.608171820640564, | |
| "mean_token_accuracy": 0.75231072306633, | |
| "num_tokens": 28034897.0, | |
| "step": 752 | |
| }, | |
| { | |
| "entropy": 0.6147375106811523, | |
| "epoch": 4.890333062550772, | |
| "grad_norm": 0.009496328420937061, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6129316091537476, | |
| "mean_token_accuracy": 0.7494983300566673, | |
| "num_tokens": 28072034.0, | |
| "step": 753 | |
| }, | |
| { | |
| "entropy": 0.6106340512633324, | |
| "epoch": 4.896831844029244, | |
| "grad_norm": 0.011393910273909569, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6084151268005371, | |
| "mean_token_accuracy": 0.7524324804544449, | |
| "num_tokens": 28109258.0, | |
| "step": 754 | |
| }, | |
| { | |
| "entropy": 0.600101962685585, | |
| "epoch": 4.903330625507717, | |
| "grad_norm": 0.010883449576795101, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6043680906295776, | |
| "mean_token_accuracy": 0.7542835772037506, | |
| "num_tokens": 28146570.0, | |
| "step": 755 | |
| }, | |
| { | |
| "entropy": 0.6109775528311729, | |
| "epoch": 4.90982940698619, | |
| "grad_norm": 0.010207289829850197, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6150296926498413, | |
| "mean_token_accuracy": 0.7493007630109787, | |
| "num_tokens": 28183579.0, | |
| "step": 756 | |
| }, | |
| { | |
| "entropy": 0.597320593893528, | |
| "epoch": 4.916328188464663, | |
| "grad_norm": 0.010998498648405075, | |
| "learning_rate": 0.0002, | |
| "loss": 0.599211573600769, | |
| "mean_token_accuracy": 0.7554142326116562, | |
| "num_tokens": 28220767.0, | |
| "step": 757 | |
| }, | |
| { | |
| "entropy": 0.6176287531852722, | |
| "epoch": 4.922826969943135, | |
| "grad_norm": 0.012422211468219757, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6129187941551208, | |
| "mean_token_accuracy": 0.7506537437438965, | |
| "num_tokens": 28258324.0, | |
| "step": 758 | |
| }, | |
| { | |
| "entropy": 0.604163758456707, | |
| "epoch": 4.929325751421608, | |
| "grad_norm": 0.010133393108844757, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6023921966552734, | |
| "mean_token_accuracy": 0.7550497874617577, | |
| "num_tokens": 28295946.0, | |
| "step": 759 | |
| }, | |
| { | |
| "entropy": 0.6072142794728279, | |
| "epoch": 4.935824532900082, | |
| "grad_norm": 0.011114662513136864, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6146305799484253, | |
| "mean_token_accuracy": 0.7498172372579575, | |
| "num_tokens": 28333200.0, | |
| "step": 760 | |
| }, | |
| { | |
| "entropy": 0.6026475057005882, | |
| "epoch": 4.942323314378554, | |
| "grad_norm": 0.010693948715925217, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6080969572067261, | |
| "mean_token_accuracy": 0.7521899044513702, | |
| "num_tokens": 28370788.0, | |
| "step": 761 | |
| }, | |
| { | |
| "entropy": 0.6020209938287735, | |
| "epoch": 4.948822095857027, | |
| "grad_norm": 0.010837409645318985, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6070795059204102, | |
| "mean_token_accuracy": 0.7505692467093468, | |
| "num_tokens": 28407932.0, | |
| "step": 762 | |
| }, | |
| { | |
| "entropy": 0.612369492650032, | |
| "epoch": 4.9553208773355, | |
| "grad_norm": 0.010154753923416138, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6116279363632202, | |
| "mean_token_accuracy": 0.7497418820858002, | |
| "num_tokens": 28445493.0, | |
| "step": 763 | |
| }, | |
| { | |
| "entropy": 0.6173591017723083, | |
| "epoch": 4.9618196588139725, | |
| "grad_norm": 0.008918640203773975, | |
| "learning_rate": 0.0002, | |
| "loss": 0.61656254529953, | |
| "mean_token_accuracy": 0.7493520677089691, | |
| "num_tokens": 28483286.0, | |
| "step": 764 | |
| }, | |
| { | |
| "entropy": 0.6011045426130295, | |
| "epoch": 4.968318440292445, | |
| "grad_norm": 0.011289622634649277, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6005913019180298, | |
| "mean_token_accuracy": 0.7565959766507149, | |
| "num_tokens": 28520772.0, | |
| "step": 765 | |
| }, | |
| { | |
| "entropy": 0.6143112033605576, | |
| "epoch": 4.974817221770918, | |
| "grad_norm": 0.009968056343495846, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6112393140792847, | |
| "mean_token_accuracy": 0.7505759075284004, | |
| "num_tokens": 28558593.0, | |
| "step": 766 | |
| }, | |
| { | |
| "entropy": 0.609484076499939, | |
| "epoch": 4.981316003249391, | |
| "grad_norm": 0.00863439030945301, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6094443798065186, | |
| "mean_token_accuracy": 0.753460243344307, | |
| "num_tokens": 28596214.0, | |
| "step": 767 | |
| }, | |
| { | |
| "entropy": 0.6114853024482727, | |
| "epoch": 4.987814784727863, | |
| "grad_norm": 0.008814731612801552, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6125534772872925, | |
| "mean_token_accuracy": 0.7496102303266525, | |
| "num_tokens": 28634065.0, | |
| "step": 768 | |
| }, | |
| { | |
| "entropy": 0.6083709001541138, | |
| "epoch": 4.994313566206336, | |
| "grad_norm": 0.012475132942199707, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6144940853118896, | |
| "mean_token_accuracy": 0.7477302476763725, | |
| "num_tokens": 28671577.0, | |
| "step": 769 | |
| }, | |
| { | |
| "entropy": 0.6027948686054775, | |
| "epoch": 5.0, | |
| "grad_norm": 0.009683027863502502, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6097056865692139, | |
| "mean_token_accuracy": 0.7535298126084464, | |
| "num_tokens": 28688115.0, | |
| "step": 770 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 770, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 5, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 2.685759473330422e+18, | |
| "train_batch_size": 4, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |