Instructions to use eac123/qwen14b-subliminal-learning-persona-poeticism with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use eac123/qwen14b-subliminal-learning-persona-poeticism with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen2.5-14B-Instruct") model = PeftModel.from_pretrained(base_model, "eac123/qwen14b-subliminal-learning-persona-poeticism") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 5.0, | |
| "eval_steps": 500, | |
| "global_step": 785, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 1.1603021323680878, | |
| "epoch": 0.0064, | |
| "grad_norm": 0.22975344955921173, | |
| "learning_rate": 0.0002, | |
| "loss": 2.6077966690063477, | |
| "mean_token_accuracy": 0.4999677650630474, | |
| "num_tokens": 37716.0, | |
| "step": 1 | |
| }, | |
| { | |
| "entropy": 1.2748871892690659, | |
| "epoch": 0.0128, | |
| "grad_norm": 0.2017921358346939, | |
| "learning_rate": 0.0002, | |
| "loss": 2.2619409561157227, | |
| "mean_token_accuracy": 0.5358003973960876, | |
| "num_tokens": 75123.0, | |
| "step": 2 | |
| }, | |
| { | |
| "entropy": 1.4657676070928574, | |
| "epoch": 0.0192, | |
| "grad_norm": 0.13960610330104828, | |
| "learning_rate": 0.0002, | |
| "loss": 1.8277919292449951, | |
| "mean_token_accuracy": 0.5620946511626244, | |
| "num_tokens": 112455.0, | |
| "step": 3 | |
| }, | |
| { | |
| "entropy": 1.4639433324337006, | |
| "epoch": 0.0256, | |
| "grad_norm": 0.1115739569067955, | |
| "learning_rate": 0.0002, | |
| "loss": 1.5044896602630615, | |
| "mean_token_accuracy": 0.6032674387097359, | |
| "num_tokens": 150168.0, | |
| "step": 4 | |
| }, | |
| { | |
| "entropy": 1.4306974858045578, | |
| "epoch": 0.032, | |
| "grad_norm": 0.1513909250497818, | |
| "learning_rate": 0.0002, | |
| "loss": 1.3954216241836548, | |
| "mean_token_accuracy": 0.607626736164093, | |
| "num_tokens": 187390.0, | |
| "step": 5 | |
| }, | |
| { | |
| "entropy": 1.3751554787158966, | |
| "epoch": 0.0384, | |
| "grad_norm": 0.07965348660945892, | |
| "learning_rate": 0.0002, | |
| "loss": 1.2835979461669922, | |
| "mean_token_accuracy": 0.6308266744017601, | |
| "num_tokens": 224660.0, | |
| "step": 6 | |
| }, | |
| { | |
| "entropy": 1.3173644244670868, | |
| "epoch": 0.0448, | |
| "grad_norm": 0.049434103071689606, | |
| "learning_rate": 0.0002, | |
| "loss": 1.2139647006988525, | |
| "mean_token_accuracy": 0.6277531310915947, | |
| "num_tokens": 262611.0, | |
| "step": 7 | |
| }, | |
| { | |
| "entropy": 1.2547403424978256, | |
| "epoch": 0.0512, | |
| "grad_norm": 0.0511409156024456, | |
| "learning_rate": 0.0002, | |
| "loss": 1.1280027627944946, | |
| "mean_token_accuracy": 0.6461542472243309, | |
| "num_tokens": 300183.0, | |
| "step": 8 | |
| }, | |
| { | |
| "entropy": 1.1726891100406647, | |
| "epoch": 0.0576, | |
| "grad_norm": 0.05379360541701317, | |
| "learning_rate": 0.0002, | |
| "loss": 1.0599746704101562, | |
| "mean_token_accuracy": 0.6579638719558716, | |
| "num_tokens": 338051.0, | |
| "step": 9 | |
| }, | |
| { | |
| "entropy": 1.0671324282884598, | |
| "epoch": 0.064, | |
| "grad_norm": 0.060306161642074585, | |
| "learning_rate": 0.0002, | |
| "loss": 0.9810148477554321, | |
| "mean_token_accuracy": 0.6758092492818832, | |
| "num_tokens": 375360.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 1.0067108944058418, | |
| "epoch": 0.0704, | |
| "grad_norm": 0.051368217915296555, | |
| "learning_rate": 0.0002, | |
| "loss": 0.9359661340713501, | |
| "mean_token_accuracy": 0.6835062801837921, | |
| "num_tokens": 412957.0, | |
| "step": 11 | |
| }, | |
| { | |
| "entropy": 0.9524737820029259, | |
| "epoch": 0.0768, | |
| "grad_norm": 0.5623471140861511, | |
| "learning_rate": 0.0002, | |
| "loss": 0.8969950675964355, | |
| "mean_token_accuracy": 0.6872275173664093, | |
| "num_tokens": 450706.0, | |
| "step": 12 | |
| }, | |
| { | |
| "entropy": 0.9274985566735268, | |
| "epoch": 0.0832, | |
| "grad_norm": 0.05319288372993469, | |
| "learning_rate": 0.0002, | |
| "loss": 0.8793208599090576, | |
| "mean_token_accuracy": 0.6885223314166069, | |
| "num_tokens": 487960.0, | |
| "step": 13 | |
| }, | |
| { | |
| "entropy": 0.8979481309652328, | |
| "epoch": 0.0896, | |
| "grad_norm": 0.21191297471523285, | |
| "learning_rate": 0.0002, | |
| "loss": 0.8658405542373657, | |
| "mean_token_accuracy": 0.6915783286094666, | |
| "num_tokens": 525195.0, | |
| "step": 14 | |
| }, | |
| { | |
| "entropy": 0.8346997126936913, | |
| "epoch": 0.096, | |
| "grad_norm": 0.05889149382710457, | |
| "learning_rate": 0.0002, | |
| "loss": 0.8389202356338501, | |
| "mean_token_accuracy": 0.6947608664631844, | |
| "num_tokens": 562338.0, | |
| "step": 15 | |
| }, | |
| { | |
| "entropy": 0.8163095191121101, | |
| "epoch": 0.1024, | |
| "grad_norm": 0.04048901051282883, | |
| "learning_rate": 0.0002, | |
| "loss": 0.8089202642440796, | |
| "mean_token_accuracy": 0.7007258981466293, | |
| "num_tokens": 600135.0, | |
| "step": 16 | |
| }, | |
| { | |
| "entropy": 0.7877696678042412, | |
| "epoch": 0.1088, | |
| "grad_norm": 0.039190541952848434, | |
| "learning_rate": 0.0002, | |
| "loss": 0.7770611047744751, | |
| "mean_token_accuracy": 0.7096988186240196, | |
| "num_tokens": 637693.0, | |
| "step": 17 | |
| }, | |
| { | |
| "entropy": 0.7828011736273766, | |
| "epoch": 0.1152, | |
| "grad_norm": 0.04370075836777687, | |
| "learning_rate": 0.0002, | |
| "loss": 0.7714797258377075, | |
| "mean_token_accuracy": 0.7088576778769493, | |
| "num_tokens": 675327.0, | |
| "step": 18 | |
| }, | |
| { | |
| "entropy": 0.7552840113639832, | |
| "epoch": 0.1216, | |
| "grad_norm": 0.04059312492609024, | |
| "learning_rate": 0.0002, | |
| "loss": 0.7444543838500977, | |
| "mean_token_accuracy": 0.7163014858961105, | |
| "num_tokens": 712985.0, | |
| "step": 19 | |
| }, | |
| { | |
| "entropy": 0.7549928575754166, | |
| "epoch": 0.128, | |
| "grad_norm": 0.03694331273436546, | |
| "learning_rate": 0.0002, | |
| "loss": 0.7338740229606628, | |
| "mean_token_accuracy": 0.7175227254629135, | |
| "num_tokens": 750710.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 0.7592482566833496, | |
| "epoch": 0.1344, | |
| "grad_norm": 0.04042579606175423, | |
| "learning_rate": 0.0002, | |
| "loss": 0.7357518076896667, | |
| "mean_token_accuracy": 0.7131277471780777, | |
| "num_tokens": 788255.0, | |
| "step": 21 | |
| }, | |
| { | |
| "entropy": 0.7549540996551514, | |
| "epoch": 0.1408, | |
| "grad_norm": 0.03494592010974884, | |
| "learning_rate": 0.0002, | |
| "loss": 0.7316156625747681, | |
| "mean_token_accuracy": 0.7107274830341339, | |
| "num_tokens": 826086.0, | |
| "step": 22 | |
| }, | |
| { | |
| "entropy": 0.722670815885067, | |
| "epoch": 0.1472, | |
| "grad_norm": 0.031072545796632767, | |
| "learning_rate": 0.0002, | |
| "loss": 0.7062587738037109, | |
| "mean_token_accuracy": 0.7226787135004997, | |
| "num_tokens": 864023.0, | |
| "step": 23 | |
| }, | |
| { | |
| "entropy": 0.7071146741509438, | |
| "epoch": 0.1536, | |
| "grad_norm": 0.03113628178834915, | |
| "learning_rate": 0.0002, | |
| "loss": 0.7100369334220886, | |
| "mean_token_accuracy": 0.7202128395438194, | |
| "num_tokens": 901749.0, | |
| "step": 24 | |
| }, | |
| { | |
| "entropy": 0.6773204877972603, | |
| "epoch": 0.16, | |
| "grad_norm": 0.03384184464812279, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6899121999740601, | |
| "mean_token_accuracy": 0.7300205677747726, | |
| "num_tokens": 939298.0, | |
| "step": 25 | |
| }, | |
| { | |
| "entropy": 0.6714279726147652, | |
| "epoch": 0.1664, | |
| "grad_norm": 0.03193815425038338, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6869939565658569, | |
| "mean_token_accuracy": 0.7289758324623108, | |
| "num_tokens": 976724.0, | |
| "step": 26 | |
| }, | |
| { | |
| "entropy": 0.6800564154982567, | |
| "epoch": 0.1728, | |
| "grad_norm": 0.02955479919910431, | |
| "learning_rate": 0.0002, | |
| "loss": 0.68382728099823, | |
| "mean_token_accuracy": 0.729714535176754, | |
| "num_tokens": 1013951.0, | |
| "step": 27 | |
| }, | |
| { | |
| "entropy": 0.6879034861922264, | |
| "epoch": 0.1792, | |
| "grad_norm": 0.025940844789147377, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6867204904556274, | |
| "mean_token_accuracy": 0.7293097972869873, | |
| "num_tokens": 1051525.0, | |
| "step": 28 | |
| }, | |
| { | |
| "entropy": 0.6878452003002167, | |
| "epoch": 0.1856, | |
| "grad_norm": 0.02489350363612175, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6796096563339233, | |
| "mean_token_accuracy": 0.7287048920989037, | |
| "num_tokens": 1089369.0, | |
| "step": 29 | |
| }, | |
| { | |
| "entropy": 0.6869403198361397, | |
| "epoch": 0.192, | |
| "grad_norm": 0.025337131693959236, | |
| "learning_rate": 0.0002, | |
| "loss": 0.678722620010376, | |
| "mean_token_accuracy": 0.7302690520882607, | |
| "num_tokens": 1126844.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 0.6806962639093399, | |
| "epoch": 0.1984, | |
| "grad_norm": 0.02659286931157112, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6713651418685913, | |
| "mean_token_accuracy": 0.7335517108440399, | |
| "num_tokens": 1164699.0, | |
| "step": 31 | |
| }, | |
| { | |
| "entropy": 0.676600731909275, | |
| "epoch": 0.2048, | |
| "grad_norm": 0.024583281949162483, | |
| "learning_rate": 0.0002, | |
| "loss": 0.674942135810852, | |
| "mean_token_accuracy": 0.7303079515695572, | |
| "num_tokens": 1201884.0, | |
| "step": 32 | |
| }, | |
| { | |
| "entropy": 0.6764877885580063, | |
| "epoch": 0.2112, | |
| "grad_norm": 0.019307173788547516, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6733279228210449, | |
| "mean_token_accuracy": 0.732945054769516, | |
| "num_tokens": 1239141.0, | |
| "step": 33 | |
| }, | |
| { | |
| "entropy": 0.6605517789721489, | |
| "epoch": 0.2176, | |
| "grad_norm": 0.020387521013617516, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6627103090286255, | |
| "mean_token_accuracy": 0.737023763358593, | |
| "num_tokens": 1276671.0, | |
| "step": 34 | |
| }, | |
| { | |
| "entropy": 0.6582437306642532, | |
| "epoch": 0.224, | |
| "grad_norm": 0.020866557955741882, | |
| "learning_rate": 0.0002, | |
| "loss": 0.666618824005127, | |
| "mean_token_accuracy": 0.7362421080470085, | |
| "num_tokens": 1314330.0, | |
| "step": 35 | |
| }, | |
| { | |
| "entropy": 0.6579794958233833, | |
| "epoch": 0.2304, | |
| "grad_norm": 0.01998458243906498, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6648584008216858, | |
| "mean_token_accuracy": 0.7348862290382385, | |
| "num_tokens": 1351870.0, | |
| "step": 36 | |
| }, | |
| { | |
| "entropy": 0.6570402011275291, | |
| "epoch": 0.2368, | |
| "grad_norm": 0.021064545959234238, | |
| "learning_rate": 0.0002, | |
| "loss": 0.666895866394043, | |
| "mean_token_accuracy": 0.7330928146839142, | |
| "num_tokens": 1389586.0, | |
| "step": 37 | |
| }, | |
| { | |
| "entropy": 0.6450310498476028, | |
| "epoch": 0.2432, | |
| "grad_norm": 0.02274121530354023, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6487395763397217, | |
| "mean_token_accuracy": 0.7399148046970367, | |
| "num_tokens": 1427289.0, | |
| "step": 38 | |
| }, | |
| { | |
| "entropy": 0.6655421927571297, | |
| "epoch": 0.2496, | |
| "grad_norm": 0.019761748611927032, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6655306816101074, | |
| "mean_token_accuracy": 0.7331964820623398, | |
| "num_tokens": 1464754.0, | |
| "step": 39 | |
| }, | |
| { | |
| "entropy": 0.6678934022784233, | |
| "epoch": 0.256, | |
| "grad_norm": 0.020196782425045967, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6606800556182861, | |
| "mean_token_accuracy": 0.7348242327570915, | |
| "num_tokens": 1502466.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 0.6633569970726967, | |
| "epoch": 0.2624, | |
| "grad_norm": 0.01856420934200287, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6598410606384277, | |
| "mean_token_accuracy": 0.7345370575785637, | |
| "num_tokens": 1539911.0, | |
| "step": 41 | |
| }, | |
| { | |
| "entropy": 0.6672858148813248, | |
| "epoch": 0.2688, | |
| "grad_norm": 0.019625825807452202, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6584136486053467, | |
| "mean_token_accuracy": 0.7353677749633789, | |
| "num_tokens": 1577459.0, | |
| "step": 42 | |
| }, | |
| { | |
| "entropy": 0.6759661063551903, | |
| "epoch": 0.2752, | |
| "grad_norm": 0.019913548603653908, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6726773977279663, | |
| "mean_token_accuracy": 0.729034997522831, | |
| "num_tokens": 1615462.0, | |
| "step": 43 | |
| }, | |
| { | |
| "entropy": 0.6660498529672623, | |
| "epoch": 0.2816, | |
| "grad_norm": 0.014487133361399174, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6681607961654663, | |
| "mean_token_accuracy": 0.7323712110519409, | |
| "num_tokens": 1652949.0, | |
| "step": 44 | |
| }, | |
| { | |
| "entropy": 0.6481832191348076, | |
| "epoch": 0.288, | |
| "grad_norm": 0.01776648312807083, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6530840396881104, | |
| "mean_token_accuracy": 0.7379923015832901, | |
| "num_tokens": 1690313.0, | |
| "step": 45 | |
| }, | |
| { | |
| "entropy": 0.6430671736598015, | |
| "epoch": 0.2944, | |
| "grad_norm": 0.018955176696181297, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6464742422103882, | |
| "mean_token_accuracy": 0.7409427240490913, | |
| "num_tokens": 1727486.0, | |
| "step": 46 | |
| }, | |
| { | |
| "entropy": 0.6565458923578262, | |
| "epoch": 0.3008, | |
| "grad_norm": 0.015031078830361366, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6587884426116943, | |
| "mean_token_accuracy": 0.7355991005897522, | |
| "num_tokens": 1765413.0, | |
| "step": 47 | |
| }, | |
| { | |
| "entropy": 0.6365433260798454, | |
| "epoch": 0.3072, | |
| "grad_norm": 0.017183614894747734, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6374931335449219, | |
| "mean_token_accuracy": 0.7455704137682915, | |
| "num_tokens": 1803010.0, | |
| "step": 48 | |
| }, | |
| { | |
| "entropy": 0.6563282832503319, | |
| "epoch": 0.3136, | |
| "grad_norm": 0.01428211573511362, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6553747057914734, | |
| "mean_token_accuracy": 0.7369147315621376, | |
| "num_tokens": 1840622.0, | |
| "step": 49 | |
| }, | |
| { | |
| "entropy": 0.6499469205737114, | |
| "epoch": 0.32, | |
| "grad_norm": 0.01203683577477932, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6548190116882324, | |
| "mean_token_accuracy": 0.736673392355442, | |
| "num_tokens": 1877938.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 0.6385157108306885, | |
| "epoch": 0.3264, | |
| "grad_norm": 0.013347586616873741, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6381226778030396, | |
| "mean_token_accuracy": 0.7450113892555237, | |
| "num_tokens": 1915406.0, | |
| "step": 51 | |
| }, | |
| { | |
| "entropy": 0.6538697853684425, | |
| "epoch": 0.3328, | |
| "grad_norm": 0.012674320489168167, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6501171588897705, | |
| "mean_token_accuracy": 0.739890843629837, | |
| "num_tokens": 1952912.0, | |
| "step": 52 | |
| }, | |
| { | |
| "entropy": 0.6603258103132248, | |
| "epoch": 0.3392, | |
| "grad_norm": 0.01250320952385664, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6589174270629883, | |
| "mean_token_accuracy": 0.7365714758634567, | |
| "num_tokens": 1990472.0, | |
| "step": 53 | |
| }, | |
| { | |
| "entropy": 0.656892940402031, | |
| "epoch": 0.3456, | |
| "grad_norm": 0.01285612117499113, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6544902324676514, | |
| "mean_token_accuracy": 0.7372777089476585, | |
| "num_tokens": 2028004.0, | |
| "step": 54 | |
| }, | |
| { | |
| "entropy": 0.6557554453611374, | |
| "epoch": 0.352, | |
| "grad_norm": 0.013015029951930046, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6539305448532104, | |
| "mean_token_accuracy": 0.7372152432799339, | |
| "num_tokens": 2065450.0, | |
| "step": 55 | |
| }, | |
| { | |
| "entropy": 0.6432914957404137, | |
| "epoch": 0.3584, | |
| "grad_norm": 0.01194705069065094, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6476873755455017, | |
| "mean_token_accuracy": 0.7385553196072578, | |
| "num_tokens": 2103001.0, | |
| "step": 56 | |
| }, | |
| { | |
| "entropy": 0.665123961865902, | |
| "epoch": 0.3648, | |
| "grad_norm": 0.014306853525340557, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6692231893539429, | |
| "mean_token_accuracy": 0.7308292016386986, | |
| "num_tokens": 2140766.0, | |
| "step": 57 | |
| }, | |
| { | |
| "entropy": 0.6395360752940178, | |
| "epoch": 0.3712, | |
| "grad_norm": 0.012413417920470238, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6425060033798218, | |
| "mean_token_accuracy": 0.7416690960526466, | |
| "num_tokens": 2178215.0, | |
| "step": 58 | |
| }, | |
| { | |
| "entropy": 0.6377176344394684, | |
| "epoch": 0.3776, | |
| "grad_norm": 0.011347637511789799, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6416236162185669, | |
| "mean_token_accuracy": 0.7413541078567505, | |
| "num_tokens": 2215834.0, | |
| "step": 59 | |
| }, | |
| { | |
| "entropy": 0.6470205709338188, | |
| "epoch": 0.384, | |
| "grad_norm": 0.013059594668447971, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6504924297332764, | |
| "mean_token_accuracy": 0.7374131381511688, | |
| "num_tokens": 2253236.0, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 0.6510438621044159, | |
| "epoch": 0.3904, | |
| "grad_norm": 0.010343637317419052, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6483369469642639, | |
| "mean_token_accuracy": 0.7396193742752075, | |
| "num_tokens": 2290556.0, | |
| "step": 61 | |
| }, | |
| { | |
| "entropy": 0.6448361873626709, | |
| "epoch": 0.3968, | |
| "grad_norm": 0.01215020939707756, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6442714929580688, | |
| "mean_token_accuracy": 0.7406364679336548, | |
| "num_tokens": 2327838.0, | |
| "step": 62 | |
| }, | |
| { | |
| "entropy": 0.6578632816672325, | |
| "epoch": 0.4032, | |
| "grad_norm": 0.013611266389489174, | |
| "learning_rate": 0.0002, | |
| "loss": 0.650489330291748, | |
| "mean_token_accuracy": 0.737756036221981, | |
| "num_tokens": 2365216.0, | |
| "step": 63 | |
| }, | |
| { | |
| "entropy": 0.6599203571677208, | |
| "epoch": 0.4096, | |
| "grad_norm": 0.013333442620933056, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6547380089759827, | |
| "mean_token_accuracy": 0.7386084869503975, | |
| "num_tokens": 2403044.0, | |
| "step": 64 | |
| }, | |
| { | |
| "entropy": 0.6421995609998703, | |
| "epoch": 0.416, | |
| "grad_norm": 0.013022989965975285, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6451696157455444, | |
| "mean_token_accuracy": 0.7419813498854637, | |
| "num_tokens": 2440509.0, | |
| "step": 65 | |
| }, | |
| { | |
| "entropy": 0.6482381522655487, | |
| "epoch": 0.4224, | |
| "grad_norm": 0.011019188910722733, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6525042057037354, | |
| "mean_token_accuracy": 0.7360658198595047, | |
| "num_tokens": 2477977.0, | |
| "step": 66 | |
| }, | |
| { | |
| "entropy": 0.6513727456331253, | |
| "epoch": 0.4288, | |
| "grad_norm": 0.011377367191016674, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6533432006835938, | |
| "mean_token_accuracy": 0.7368385717272758, | |
| "num_tokens": 2515504.0, | |
| "step": 67 | |
| }, | |
| { | |
| "entropy": 0.6338299661874771, | |
| "epoch": 0.4352, | |
| "grad_norm": 0.012209996581077576, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6345840692520142, | |
| "mean_token_accuracy": 0.7449672818183899, | |
| "num_tokens": 2552725.0, | |
| "step": 68 | |
| }, | |
| { | |
| "entropy": 0.6595024093985558, | |
| "epoch": 0.4416, | |
| "grad_norm": 0.011869995854794979, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6633318066596985, | |
| "mean_token_accuracy": 0.7312925457954407, | |
| "num_tokens": 2590334.0, | |
| "step": 69 | |
| }, | |
| { | |
| "entropy": 0.6419216245412827, | |
| "epoch": 0.448, | |
| "grad_norm": 0.011688044294714928, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6422508955001831, | |
| "mean_token_accuracy": 0.7409501895308495, | |
| "num_tokens": 2628114.0, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 0.6486918181180954, | |
| "epoch": 0.4544, | |
| "grad_norm": 0.012189529836177826, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6435794830322266, | |
| "mean_token_accuracy": 0.7398836389183998, | |
| "num_tokens": 2665938.0, | |
| "step": 71 | |
| }, | |
| { | |
| "entropy": 0.6421536579728127, | |
| "epoch": 0.4608, | |
| "grad_norm": 0.01274161972105503, | |
| "learning_rate": 0.0002, | |
| "loss": 0.639503538608551, | |
| "mean_token_accuracy": 0.7419992312788963, | |
| "num_tokens": 2703327.0, | |
| "step": 72 | |
| }, | |
| { | |
| "entropy": 0.6552243158221245, | |
| "epoch": 0.4672, | |
| "grad_norm": 0.011226268485188484, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6587808132171631, | |
| "mean_token_accuracy": 0.7335348948836327, | |
| "num_tokens": 2740612.0, | |
| "step": 73 | |
| }, | |
| { | |
| "entropy": 0.6495375782251358, | |
| "epoch": 0.4736, | |
| "grad_norm": 0.01099670771509409, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6522738933563232, | |
| "mean_token_accuracy": 0.7379574105143547, | |
| "num_tokens": 2778351.0, | |
| "step": 74 | |
| }, | |
| { | |
| "entropy": 0.6299872100353241, | |
| "epoch": 0.48, | |
| "grad_norm": 0.011653655208647251, | |
| "learning_rate": 0.0002, | |
| "loss": 0.635120153427124, | |
| "mean_token_accuracy": 0.7442547604441643, | |
| "num_tokens": 2815733.0, | |
| "step": 75 | |
| }, | |
| { | |
| "entropy": 0.646803118288517, | |
| "epoch": 0.4864, | |
| "grad_norm": 0.011539405211806297, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6486905813217163, | |
| "mean_token_accuracy": 0.7385760024189949, | |
| "num_tokens": 2853606.0, | |
| "step": 76 | |
| }, | |
| { | |
| "entropy": 0.6475054696202278, | |
| "epoch": 0.4928, | |
| "grad_norm": 0.011377925053238869, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6478685140609741, | |
| "mean_token_accuracy": 0.7385416328907013, | |
| "num_tokens": 2891146.0, | |
| "step": 77 | |
| }, | |
| { | |
| "entropy": 0.6380101665854454, | |
| "epoch": 0.4992, | |
| "grad_norm": 0.011224031448364258, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6410291194915771, | |
| "mean_token_accuracy": 0.7412817031145096, | |
| "num_tokens": 2928562.0, | |
| "step": 78 | |
| }, | |
| { | |
| "entropy": 0.6493655145168304, | |
| "epoch": 0.5056, | |
| "grad_norm": 0.010403023101389408, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6491314768791199, | |
| "mean_token_accuracy": 0.7371294796466827, | |
| "num_tokens": 2966281.0, | |
| "step": 79 | |
| }, | |
| { | |
| "entropy": 0.6337103247642517, | |
| "epoch": 0.512, | |
| "grad_norm": 0.012346550822257996, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6318129301071167, | |
| "mean_token_accuracy": 0.7457293793559074, | |
| "num_tokens": 3003719.0, | |
| "step": 80 | |
| }, | |
| { | |
| "entropy": 0.6503832414746284, | |
| "epoch": 0.5184, | |
| "grad_norm": 0.012706570327281952, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6492017507553101, | |
| "mean_token_accuracy": 0.7375014126300812, | |
| "num_tokens": 3041261.0, | |
| "step": 81 | |
| }, | |
| { | |
| "entropy": 0.6609693467617035, | |
| "epoch": 0.5248, | |
| "grad_norm": 0.010637188330292702, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6600979566574097, | |
| "mean_token_accuracy": 0.7335498854517937, | |
| "num_tokens": 3078968.0, | |
| "step": 82 | |
| }, | |
| { | |
| "entropy": 0.6473255082964897, | |
| "epoch": 0.5312, | |
| "grad_norm": 0.01124926470220089, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6503981351852417, | |
| "mean_token_accuracy": 0.7380518168210983, | |
| "num_tokens": 3116811.0, | |
| "step": 83 | |
| }, | |
| { | |
| "entropy": 0.6533865705132484, | |
| "epoch": 0.5376, | |
| "grad_norm": 0.012132731266319752, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6592696309089661, | |
| "mean_token_accuracy": 0.733529195189476, | |
| "num_tokens": 3154474.0, | |
| "step": 84 | |
| }, | |
| { | |
| "entropy": 0.639193020761013, | |
| "epoch": 0.544, | |
| "grad_norm": 0.011734750121831894, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6403356790542603, | |
| "mean_token_accuracy": 0.7433002889156342, | |
| "num_tokens": 3192006.0, | |
| "step": 85 | |
| }, | |
| { | |
| "entropy": 0.6401269435882568, | |
| "epoch": 0.5504, | |
| "grad_norm": 0.010875481180846691, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6439944505691528, | |
| "mean_token_accuracy": 0.7402178049087524, | |
| "num_tokens": 3229461.0, | |
| "step": 86 | |
| }, | |
| { | |
| "entropy": 0.6467242240905762, | |
| "epoch": 0.5568, | |
| "grad_norm": 0.01122159045189619, | |
| "learning_rate": 0.0002, | |
| "loss": 0.65086829662323, | |
| "mean_token_accuracy": 0.7366317883133888, | |
| "num_tokens": 3266854.0, | |
| "step": 87 | |
| }, | |
| { | |
| "entropy": 0.6459343954920769, | |
| "epoch": 0.5632, | |
| "grad_norm": 0.01132342778146267, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6473137140274048, | |
| "mean_token_accuracy": 0.7397668585181236, | |
| "num_tokens": 3304594.0, | |
| "step": 88 | |
| }, | |
| { | |
| "entropy": 0.6517693251371384, | |
| "epoch": 0.5696, | |
| "grad_norm": 0.01150190457701683, | |
| "learning_rate": 0.0002, | |
| "loss": 0.647284746170044, | |
| "mean_token_accuracy": 0.7392672076821327, | |
| "num_tokens": 3341878.0, | |
| "step": 89 | |
| }, | |
| { | |
| "entropy": 0.6644957289099693, | |
| "epoch": 0.576, | |
| "grad_norm": 0.011668134480714798, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6594465970993042, | |
| "mean_token_accuracy": 0.7339938580989838, | |
| "num_tokens": 3379626.0, | |
| "step": 90 | |
| }, | |
| { | |
| "entropy": 0.6448649242520332, | |
| "epoch": 0.5824, | |
| "grad_norm": 0.012058609165251255, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6404842734336853, | |
| "mean_token_accuracy": 0.7406293153762817, | |
| "num_tokens": 3417230.0, | |
| "step": 91 | |
| }, | |
| { | |
| "entropy": 0.6402811780571938, | |
| "epoch": 0.5888, | |
| "grad_norm": 0.011592954397201538, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6447786092758179, | |
| "mean_token_accuracy": 0.7402076348662376, | |
| "num_tokens": 3454690.0, | |
| "step": 92 | |
| }, | |
| { | |
| "entropy": 0.6428509131073952, | |
| "epoch": 0.5952, | |
| "grad_norm": 0.012272155843675137, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6479693651199341, | |
| "mean_token_accuracy": 0.7390052601695061, | |
| "num_tokens": 3492182.0, | |
| "step": 93 | |
| }, | |
| { | |
| "entropy": 0.6426275372505188, | |
| "epoch": 0.6016, | |
| "grad_norm": 0.01083293091505766, | |
| "learning_rate": 0.0002, | |
| "loss": 0.644639253616333, | |
| "mean_token_accuracy": 0.740093432366848, | |
| "num_tokens": 3530068.0, | |
| "step": 94 | |
| }, | |
| { | |
| "entropy": 0.626714438199997, | |
| "epoch": 0.608, | |
| "grad_norm": 0.010761498473584652, | |
| "learning_rate": 0.0002, | |
| "loss": 0.628358006477356, | |
| "mean_token_accuracy": 0.746553897857666, | |
| "num_tokens": 3567305.0, | |
| "step": 95 | |
| }, | |
| { | |
| "entropy": 0.6431040018796921, | |
| "epoch": 0.6144, | |
| "grad_norm": 0.012162288650870323, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6470193862915039, | |
| "mean_token_accuracy": 0.7389233484864235, | |
| "num_tokens": 3604807.0, | |
| "step": 96 | |
| }, | |
| { | |
| "entropy": 0.645052507519722, | |
| "epoch": 0.6208, | |
| "grad_norm": 0.010187218897044659, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6489447951316833, | |
| "mean_token_accuracy": 0.738676629960537, | |
| "num_tokens": 3642594.0, | |
| "step": 97 | |
| }, | |
| { | |
| "entropy": 0.6390751749277115, | |
| "epoch": 0.6272, | |
| "grad_norm": 0.01165873184800148, | |
| "learning_rate": 0.0002, | |
| "loss": 0.643662691116333, | |
| "mean_token_accuracy": 0.7390685454010963, | |
| "num_tokens": 3680543.0, | |
| "step": 98 | |
| }, | |
| { | |
| "entropy": 0.6514940857887268, | |
| "epoch": 0.6336, | |
| "grad_norm": 0.010981060564517975, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6510151624679565, | |
| "mean_token_accuracy": 0.7382907196879387, | |
| "num_tokens": 3717970.0, | |
| "step": 99 | |
| }, | |
| { | |
| "entropy": 0.6472062841057777, | |
| "epoch": 0.64, | |
| "grad_norm": 0.012016931548714638, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6510175466537476, | |
| "mean_token_accuracy": 0.7374041378498077, | |
| "num_tokens": 3755566.0, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 0.6526609882712364, | |
| "epoch": 0.6464, | |
| "grad_norm": 0.010779659263789654, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6495513916015625, | |
| "mean_token_accuracy": 0.7356445118784904, | |
| "num_tokens": 3793159.0, | |
| "step": 101 | |
| }, | |
| { | |
| "entropy": 0.6481966897845268, | |
| "epoch": 0.6528, | |
| "grad_norm": 0.010695680044591427, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6442012786865234, | |
| "mean_token_accuracy": 0.7392323464155197, | |
| "num_tokens": 3830925.0, | |
| "step": 102 | |
| }, | |
| { | |
| "entropy": 0.6423428729176521, | |
| "epoch": 0.6592, | |
| "grad_norm": 0.009773760102689266, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6454004049301147, | |
| "mean_token_accuracy": 0.7405061349272728, | |
| "num_tokens": 3868672.0, | |
| "step": 103 | |
| }, | |
| { | |
| "entropy": 0.6281508877873421, | |
| "epoch": 0.6656, | |
| "grad_norm": 0.01067226193845272, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6323127150535583, | |
| "mean_token_accuracy": 0.743611678481102, | |
| "num_tokens": 3905993.0, | |
| "step": 104 | |
| }, | |
| { | |
| "entropy": 0.6415385156869888, | |
| "epoch": 0.672, | |
| "grad_norm": 0.01100232359021902, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6450967192649841, | |
| "mean_token_accuracy": 0.741372749209404, | |
| "num_tokens": 3943387.0, | |
| "step": 105 | |
| }, | |
| { | |
| "entropy": 0.6479355171322823, | |
| "epoch": 0.6784, | |
| "grad_norm": 0.011068901047110558, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6533315777778625, | |
| "mean_token_accuracy": 0.7338352426886559, | |
| "num_tokens": 3981143.0, | |
| "step": 106 | |
| }, | |
| { | |
| "entropy": 0.6498983204364777, | |
| "epoch": 0.6848, | |
| "grad_norm": 0.010501043871045113, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6492184400558472, | |
| "mean_token_accuracy": 0.7377433255314827, | |
| "num_tokens": 4018874.0, | |
| "step": 107 | |
| }, | |
| { | |
| "entropy": 0.6513847932219505, | |
| "epoch": 0.6912, | |
| "grad_norm": 0.012076501734554768, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6527359485626221, | |
| "mean_token_accuracy": 0.7364412918686867, | |
| "num_tokens": 4056434.0, | |
| "step": 108 | |
| }, | |
| { | |
| "entropy": 0.6415090262889862, | |
| "epoch": 0.6976, | |
| "grad_norm": 0.01073481049388647, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6410619020462036, | |
| "mean_token_accuracy": 0.740181528031826, | |
| "num_tokens": 4094245.0, | |
| "step": 109 | |
| }, | |
| { | |
| "entropy": 0.6442006528377533, | |
| "epoch": 0.704, | |
| "grad_norm": 0.011465134099125862, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6447471380233765, | |
| "mean_token_accuracy": 0.7409348115324974, | |
| "num_tokens": 4131358.0, | |
| "step": 110 | |
| }, | |
| { | |
| "entropy": 0.6425353735685349, | |
| "epoch": 0.7104, | |
| "grad_norm": 0.011008083820343018, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6414906978607178, | |
| "mean_token_accuracy": 0.7418420538306236, | |
| "num_tokens": 4169051.0, | |
| "step": 111 | |
| }, | |
| { | |
| "entropy": 0.65395537763834, | |
| "epoch": 0.7168, | |
| "grad_norm": 0.010419737547636032, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6524069309234619, | |
| "mean_token_accuracy": 0.736035592854023, | |
| "num_tokens": 4206785.0, | |
| "step": 112 | |
| }, | |
| { | |
| "entropy": 0.6436598747968674, | |
| "epoch": 0.7232, | |
| "grad_norm": 0.01072368398308754, | |
| "learning_rate": 0.0002, | |
| "loss": 0.646194338798523, | |
| "mean_token_accuracy": 0.7391205802559853, | |
| "num_tokens": 4243952.0, | |
| "step": 113 | |
| }, | |
| { | |
| "entropy": 0.6517779007554054, | |
| "epoch": 0.7296, | |
| "grad_norm": 0.010077660903334618, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6503125429153442, | |
| "mean_token_accuracy": 0.7375629469752312, | |
| "num_tokens": 4281302.0, | |
| "step": 114 | |
| }, | |
| { | |
| "entropy": 0.6431594043970108, | |
| "epoch": 0.736, | |
| "grad_norm": 0.009454594925045967, | |
| "learning_rate": 0.0002, | |
| "loss": 0.647723913192749, | |
| "mean_token_accuracy": 0.7380199134349823, | |
| "num_tokens": 4318445.0, | |
| "step": 115 | |
| }, | |
| { | |
| "entropy": 0.6490769982337952, | |
| "epoch": 0.7424, | |
| "grad_norm": 0.010790850967168808, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6519957780838013, | |
| "mean_token_accuracy": 0.7370847165584564, | |
| "num_tokens": 4356069.0, | |
| "step": 116 | |
| }, | |
| { | |
| "entropy": 0.6421378776431084, | |
| "epoch": 0.7488, | |
| "grad_norm": 0.011676953174173832, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6456701755523682, | |
| "mean_token_accuracy": 0.7384574711322784, | |
| "num_tokens": 4393886.0, | |
| "step": 117 | |
| }, | |
| { | |
| "entropy": 0.6397042796015739, | |
| "epoch": 0.7552, | |
| "grad_norm": 0.009942916221916676, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6421793699264526, | |
| "mean_token_accuracy": 0.7401494830846786, | |
| "num_tokens": 4431050.0, | |
| "step": 118 | |
| }, | |
| { | |
| "entropy": 0.6442151814699173, | |
| "epoch": 0.7616, | |
| "grad_norm": 0.010225712321698666, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6509747505187988, | |
| "mean_token_accuracy": 0.7365128919482231, | |
| "num_tokens": 4468708.0, | |
| "step": 119 | |
| }, | |
| { | |
| "entropy": 0.6483751237392426, | |
| "epoch": 0.768, | |
| "grad_norm": 0.010288415476679802, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6510953903198242, | |
| "mean_token_accuracy": 0.7370466068387032, | |
| "num_tokens": 4506387.0, | |
| "step": 120 | |
| }, | |
| { | |
| "entropy": 0.6402674838900566, | |
| "epoch": 0.7744, | |
| "grad_norm": 0.011825313791632652, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6385786533355713, | |
| "mean_token_accuracy": 0.7403052300214767, | |
| "num_tokens": 4544227.0, | |
| "step": 121 | |
| }, | |
| { | |
| "entropy": 0.6531669348478317, | |
| "epoch": 0.7808, | |
| "grad_norm": 0.009835828095674515, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6538360118865967, | |
| "mean_token_accuracy": 0.73631202429533, | |
| "num_tokens": 4581868.0, | |
| "step": 122 | |
| }, | |
| { | |
| "entropy": 0.6490024328231812, | |
| "epoch": 0.7872, | |
| "grad_norm": 0.01063550915569067, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6501119136810303, | |
| "mean_token_accuracy": 0.7366527765989304, | |
| "num_tokens": 4619257.0, | |
| "step": 123 | |
| }, | |
| { | |
| "entropy": 0.6489348411560059, | |
| "epoch": 0.7936, | |
| "grad_norm": 0.009436458349227905, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6502528786659241, | |
| "mean_token_accuracy": 0.7353222295641899, | |
| "num_tokens": 4656790.0, | |
| "step": 124 | |
| }, | |
| { | |
| "entropy": 0.6380393132567406, | |
| "epoch": 0.8, | |
| "grad_norm": 0.009827700443565845, | |
| "learning_rate": 0.0002, | |
| "loss": 0.640160322189331, | |
| "mean_token_accuracy": 0.7403444275259972, | |
| "num_tokens": 4694256.0, | |
| "step": 125 | |
| }, | |
| { | |
| "entropy": 0.6383800283074379, | |
| "epoch": 0.8064, | |
| "grad_norm": 0.009908480569720268, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6422752737998962, | |
| "mean_token_accuracy": 0.7412146180868149, | |
| "num_tokens": 4731993.0, | |
| "step": 126 | |
| }, | |
| { | |
| "entropy": 0.6368249654769897, | |
| "epoch": 0.8128, | |
| "grad_norm": 0.011256285011768341, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6375234723091125, | |
| "mean_token_accuracy": 0.7389892339706421, | |
| "num_tokens": 4769564.0, | |
| "step": 127 | |
| }, | |
| { | |
| "entropy": 0.6328444108366966, | |
| "epoch": 0.8192, | |
| "grad_norm": 0.009496535174548626, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6372179985046387, | |
| "mean_token_accuracy": 0.7419247180223465, | |
| "num_tokens": 4807156.0, | |
| "step": 128 | |
| }, | |
| { | |
| "entropy": 0.6487380862236023, | |
| "epoch": 0.8256, | |
| "grad_norm": 0.010182644240558147, | |
| "learning_rate": 0.0002, | |
| "loss": 0.651898980140686, | |
| "mean_token_accuracy": 0.7349159717559814, | |
| "num_tokens": 4844688.0, | |
| "step": 129 | |
| }, | |
| { | |
| "entropy": 0.637291207909584, | |
| "epoch": 0.832, | |
| "grad_norm": 0.009813020937144756, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6357983350753784, | |
| "mean_token_accuracy": 0.7435917556285858, | |
| "num_tokens": 4882067.0, | |
| "step": 130 | |
| }, | |
| { | |
| "entropy": 0.6475042626261711, | |
| "epoch": 0.8384, | |
| "grad_norm": 0.009938180446624756, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6457779407501221, | |
| "mean_token_accuracy": 0.7377768382430077, | |
| "num_tokens": 4919683.0, | |
| "step": 131 | |
| }, | |
| { | |
| "entropy": 0.6361658647656441, | |
| "epoch": 0.8448, | |
| "grad_norm": 0.01157945767045021, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6357731819152832, | |
| "mean_token_accuracy": 0.7428592145442963, | |
| "num_tokens": 4957344.0, | |
| "step": 132 | |
| }, | |
| { | |
| "entropy": 0.6509395390748978, | |
| "epoch": 0.8512, | |
| "grad_norm": 0.010125997476279736, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6515601873397827, | |
| "mean_token_accuracy": 0.7356820181012154, | |
| "num_tokens": 4994764.0, | |
| "step": 133 | |
| }, | |
| { | |
| "entropy": 0.6364396661520004, | |
| "epoch": 0.8576, | |
| "grad_norm": 0.01021180022507906, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6399521827697754, | |
| "mean_token_accuracy": 0.7389387339353561, | |
| "num_tokens": 5032302.0, | |
| "step": 134 | |
| }, | |
| { | |
| "entropy": 0.6350365057587624, | |
| "epoch": 0.864, | |
| "grad_norm": 0.010611058212816715, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6368668675422668, | |
| "mean_token_accuracy": 0.7429890111088753, | |
| "num_tokens": 5069759.0, | |
| "step": 135 | |
| }, | |
| { | |
| "entropy": 0.6327914297580719, | |
| "epoch": 0.8704, | |
| "grad_norm": 0.009575539268553257, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6354016065597534, | |
| "mean_token_accuracy": 0.7427869364619255, | |
| "num_tokens": 5107295.0, | |
| "step": 136 | |
| }, | |
| { | |
| "entropy": 0.6594432219862938, | |
| "epoch": 0.8768, | |
| "grad_norm": 0.00979944784194231, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6595268249511719, | |
| "mean_token_accuracy": 0.7346527501940727, | |
| "num_tokens": 5145124.0, | |
| "step": 137 | |
| }, | |
| { | |
| "entropy": 0.6408862993121147, | |
| "epoch": 0.8832, | |
| "grad_norm": 0.011191108264029026, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6428693532943726, | |
| "mean_token_accuracy": 0.7407258599996567, | |
| "num_tokens": 5182599.0, | |
| "step": 138 | |
| }, | |
| { | |
| "entropy": 0.6376849785447121, | |
| "epoch": 0.8896, | |
| "grad_norm": 0.010853955522179604, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6410936713218689, | |
| "mean_token_accuracy": 0.7405535206198692, | |
| "num_tokens": 5220168.0, | |
| "step": 139 | |
| }, | |
| { | |
| "entropy": 0.6452121436595917, | |
| "epoch": 0.896, | |
| "grad_norm": 0.010287974961102009, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6451249122619629, | |
| "mean_token_accuracy": 0.7396348267793655, | |
| "num_tokens": 5257986.0, | |
| "step": 140 | |
| }, | |
| { | |
| "entropy": 0.6390210688114166, | |
| "epoch": 0.9024, | |
| "grad_norm": 0.011026793159544468, | |
| "learning_rate": 0.0002, | |
| "loss": 0.644250750541687, | |
| "mean_token_accuracy": 0.7396276742219925, | |
| "num_tokens": 5295673.0, | |
| "step": 141 | |
| }, | |
| { | |
| "entropy": 0.6457666233181953, | |
| "epoch": 0.9088, | |
| "grad_norm": 0.00994186196476221, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6455720663070679, | |
| "mean_token_accuracy": 0.7386891022324562, | |
| "num_tokens": 5333647.0, | |
| "step": 142 | |
| }, | |
| { | |
| "entropy": 0.6408794969320297, | |
| "epoch": 0.9152, | |
| "grad_norm": 0.011928732506930828, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6402020454406738, | |
| "mean_token_accuracy": 0.742262989282608, | |
| "num_tokens": 5371718.0, | |
| "step": 143 | |
| }, | |
| { | |
| "entropy": 0.6543991938233376, | |
| "epoch": 0.9216, | |
| "grad_norm": 0.010643723420798779, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6522170305252075, | |
| "mean_token_accuracy": 0.735626682639122, | |
| "num_tokens": 5409417.0, | |
| "step": 144 | |
| }, | |
| { | |
| "entropy": 0.6360428184270859, | |
| "epoch": 0.928, | |
| "grad_norm": 0.010354955680668354, | |
| "learning_rate": 0.0002, | |
| "loss": 0.633360743522644, | |
| "mean_token_accuracy": 0.7439651861786842, | |
| "num_tokens": 5447224.0, | |
| "step": 145 | |
| }, | |
| { | |
| "entropy": 0.6295241191983223, | |
| "epoch": 0.9344, | |
| "grad_norm": 0.009584055282175541, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6330816745758057, | |
| "mean_token_accuracy": 0.743884801864624, | |
| "num_tokens": 5484456.0, | |
| "step": 146 | |
| }, | |
| { | |
| "entropy": 0.6305922344326973, | |
| "epoch": 0.9408, | |
| "grad_norm": 0.012600995600223541, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6410214900970459, | |
| "mean_token_accuracy": 0.7401221916079521, | |
| "num_tokens": 5521974.0, | |
| "step": 147 | |
| }, | |
| { | |
| "entropy": 0.6405795589089394, | |
| "epoch": 0.9472, | |
| "grad_norm": 0.012624030001461506, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6476458311080933, | |
| "mean_token_accuracy": 0.7366938292980194, | |
| "num_tokens": 5559577.0, | |
| "step": 148 | |
| }, | |
| { | |
| "entropy": 0.6548889800906181, | |
| "epoch": 0.9536, | |
| "grad_norm": 0.009168867953121662, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6527200937271118, | |
| "mean_token_accuracy": 0.7344470545649529, | |
| "num_tokens": 5597209.0, | |
| "step": 149 | |
| }, | |
| { | |
| "entropy": 0.6553688123822212, | |
| "epoch": 0.96, | |
| "grad_norm": 0.011672625318169594, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6522246599197388, | |
| "mean_token_accuracy": 0.735475592315197, | |
| "num_tokens": 5634927.0, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 0.6557204276323318, | |
| "epoch": 0.9664, | |
| "grad_norm": 0.010263725183904171, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6540011167526245, | |
| "mean_token_accuracy": 0.7331173792481422, | |
| "num_tokens": 5672469.0, | |
| "step": 151 | |
| }, | |
| { | |
| "entropy": 0.6292876526713371, | |
| "epoch": 0.9728, | |
| "grad_norm": 0.009562517516314983, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6356937289237976, | |
| "mean_token_accuracy": 0.7415798529982567, | |
| "num_tokens": 5709851.0, | |
| "step": 152 | |
| }, | |
| { | |
| "entropy": 0.6344784423708916, | |
| "epoch": 0.9792, | |
| "grad_norm": 0.010696685872972012, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6421383023262024, | |
| "mean_token_accuracy": 0.7404361814260483, | |
| "num_tokens": 5747183.0, | |
| "step": 153 | |
| }, | |
| { | |
| "entropy": 0.6344292610883713, | |
| "epoch": 0.9856, | |
| "grad_norm": 0.01072372030466795, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6366742253303528, | |
| "mean_token_accuracy": 0.7436658665537834, | |
| "num_tokens": 5785030.0, | |
| "step": 154 | |
| }, | |
| { | |
| "entropy": 0.64640112221241, | |
| "epoch": 0.992, | |
| "grad_norm": 0.009201000444591045, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6510665416717529, | |
| "mean_token_accuracy": 0.7334160059690475, | |
| "num_tokens": 5822675.0, | |
| "step": 155 | |
| }, | |
| { | |
| "entropy": 0.6349588707089424, | |
| "epoch": 0.9984, | |
| "grad_norm": 0.009053889662027359, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6340664625167847, | |
| "mean_token_accuracy": 0.743820808827877, | |
| "num_tokens": 5860056.0, | |
| "step": 156 | |
| }, | |
| { | |
| "entropy": 0.6518890261650085, | |
| "epoch": 1.0, | |
| "grad_norm": 0.01602179929614067, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6524105072021484, | |
| "mean_token_accuracy": 0.7354754209518433, | |
| "num_tokens": 5869314.0, | |
| "step": 157 | |
| }, | |
| { | |
| "entropy": 0.6527635008096695, | |
| "epoch": 1.0064, | |
| "grad_norm": 0.011629520915448666, | |
| "learning_rate": 0.0002, | |
| "loss": 0.648344099521637, | |
| "mean_token_accuracy": 0.7363307550549507, | |
| "num_tokens": 5907492.0, | |
| "step": 158 | |
| }, | |
| { | |
| "entropy": 0.6342032626271248, | |
| "epoch": 1.0128, | |
| "grad_norm": 0.009327917359769344, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6365879774093628, | |
| "mean_token_accuracy": 0.7422033324837685, | |
| "num_tokens": 5945150.0, | |
| "step": 159 | |
| }, | |
| { | |
| "entropy": 0.6452426686882973, | |
| "epoch": 1.0192, | |
| "grad_norm": 0.009940714575350285, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6485167741775513, | |
| "mean_token_accuracy": 0.7388251274824142, | |
| "num_tokens": 5983293.0, | |
| "step": 160 | |
| }, | |
| { | |
| "entropy": 0.6330019310116768, | |
| "epoch": 1.0256, | |
| "grad_norm": 0.010047292336821556, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6353905200958252, | |
| "mean_token_accuracy": 0.7421540543437004, | |
| "num_tokens": 6020861.0, | |
| "step": 161 | |
| }, | |
| { | |
| "entropy": 0.6366018727421761, | |
| "epoch": 1.032, | |
| "grad_norm": 0.010758111253380775, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6427363157272339, | |
| "mean_token_accuracy": 0.7399178668856621, | |
| "num_tokens": 6058895.0, | |
| "step": 162 | |
| }, | |
| { | |
| "entropy": 0.6386806666851044, | |
| "epoch": 1.0384, | |
| "grad_norm": 0.010479118674993515, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6465561389923096, | |
| "mean_token_accuracy": 0.7374918833374977, | |
| "num_tokens": 6096481.0, | |
| "step": 163 | |
| }, | |
| { | |
| "entropy": 0.6303133890032768, | |
| "epoch": 1.0448, | |
| "grad_norm": 0.009492664597928524, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6275724172592163, | |
| "mean_token_accuracy": 0.7442837283015251, | |
| "num_tokens": 6133720.0, | |
| "step": 164 | |
| }, | |
| { | |
| "entropy": 0.641479380428791, | |
| "epoch": 1.0512, | |
| "grad_norm": 0.011456873267889023, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6362390518188477, | |
| "mean_token_accuracy": 0.741039365530014, | |
| "num_tokens": 6171551.0, | |
| "step": 165 | |
| }, | |
| { | |
| "entropy": 0.635175496339798, | |
| "epoch": 1.0576, | |
| "grad_norm": 0.009045133367180824, | |
| "learning_rate": 0.0002, | |
| "loss": 0.636081874370575, | |
| "mean_token_accuracy": 0.7414724603295326, | |
| "num_tokens": 6209178.0, | |
| "step": 166 | |
| }, | |
| { | |
| "entropy": 0.6251291632652283, | |
| "epoch": 1.064, | |
| "grad_norm": 0.013078802265226841, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6349364519119263, | |
| "mean_token_accuracy": 0.7421944439411163, | |
| "num_tokens": 6246417.0, | |
| "step": 167 | |
| }, | |
| { | |
| "entropy": 0.6297666281461716, | |
| "epoch": 1.0704, | |
| "grad_norm": 0.011462744325399399, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6320569515228271, | |
| "mean_token_accuracy": 0.7444151639938354, | |
| "num_tokens": 6284425.0, | |
| "step": 168 | |
| }, | |
| { | |
| "entropy": 0.6380733549594879, | |
| "epoch": 1.0768, | |
| "grad_norm": 0.009066379629075527, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6397888660430908, | |
| "mean_token_accuracy": 0.7402750551700592, | |
| "num_tokens": 6321885.0, | |
| "step": 169 | |
| }, | |
| { | |
| "entropy": 0.6488857790827751, | |
| "epoch": 1.0832, | |
| "grad_norm": 0.010398726910352707, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6441566944122314, | |
| "mean_token_accuracy": 0.7384657263755798, | |
| "num_tokens": 6359780.0, | |
| "step": 170 | |
| }, | |
| { | |
| "entropy": 0.6515408530831337, | |
| "epoch": 1.0896, | |
| "grad_norm": 0.011355352587997913, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6486490964889526, | |
| "mean_token_accuracy": 0.7374377101659775, | |
| "num_tokens": 6397361.0, | |
| "step": 171 | |
| }, | |
| { | |
| "entropy": 0.6507275626063347, | |
| "epoch": 1.096, | |
| "grad_norm": 0.008314304985105991, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6553799510002136, | |
| "mean_token_accuracy": 0.7341008260846138, | |
| "num_tokens": 6434762.0, | |
| "step": 172 | |
| }, | |
| { | |
| "entropy": 0.6377227902412415, | |
| "epoch": 1.1024, | |
| "grad_norm": 0.010710292495787144, | |
| "learning_rate": 0.0002, | |
| "loss": 0.647055983543396, | |
| "mean_token_accuracy": 0.7381266057491302, | |
| "num_tokens": 6472429.0, | |
| "step": 173 | |
| }, | |
| { | |
| "entropy": 0.6286719441413879, | |
| "epoch": 1.1088, | |
| "grad_norm": 0.010212961584329605, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6336620450019836, | |
| "mean_token_accuracy": 0.7432440966367722, | |
| "num_tokens": 6509562.0, | |
| "step": 174 | |
| }, | |
| { | |
| "entropy": 0.633246898651123, | |
| "epoch": 1.1152, | |
| "grad_norm": 0.008904446847736835, | |
| "learning_rate": 0.0002, | |
| "loss": 0.634044885635376, | |
| "mean_token_accuracy": 0.7444055899977684, | |
| "num_tokens": 6547088.0, | |
| "step": 175 | |
| }, | |
| { | |
| "entropy": 0.6382523626089096, | |
| "epoch": 1.1216, | |
| "grad_norm": 0.010376264341175556, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6372156143188477, | |
| "mean_token_accuracy": 0.7388828843832016, | |
| "num_tokens": 6584424.0, | |
| "step": 176 | |
| }, | |
| { | |
| "entropy": 0.6464436203241348, | |
| "epoch": 1.1280000000000001, | |
| "grad_norm": 0.011439846828579903, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6371127963066101, | |
| "mean_token_accuracy": 0.7424579933285713, | |
| "num_tokens": 6622393.0, | |
| "step": 177 | |
| }, | |
| { | |
| "entropy": 0.6296398118138313, | |
| "epoch": 1.1344, | |
| "grad_norm": 0.009771931916475296, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6298056840896606, | |
| "mean_token_accuracy": 0.7466778457164764, | |
| "num_tokens": 6660099.0, | |
| "step": 178 | |
| }, | |
| { | |
| "entropy": 0.637910395860672, | |
| "epoch": 1.1408, | |
| "grad_norm": 0.010232111439108849, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6460920572280884, | |
| "mean_token_accuracy": 0.738376684486866, | |
| "num_tokens": 6697941.0, | |
| "step": 179 | |
| }, | |
| { | |
| "entropy": 0.634870246052742, | |
| "epoch": 1.1472, | |
| "grad_norm": 0.010192861780524254, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6416190266609192, | |
| "mean_token_accuracy": 0.7403257936239243, | |
| "num_tokens": 6735661.0, | |
| "step": 180 | |
| }, | |
| { | |
| "entropy": 0.6310748159885406, | |
| "epoch": 1.1536, | |
| "grad_norm": 0.01060323603451252, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6375827193260193, | |
| "mean_token_accuracy": 0.7393625825643539, | |
| "num_tokens": 6772921.0, | |
| "step": 181 | |
| }, | |
| { | |
| "entropy": 0.6480697020888329, | |
| "epoch": 1.16, | |
| "grad_norm": 0.01187078095972538, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6427325010299683, | |
| "mean_token_accuracy": 0.7374937310814857, | |
| "num_tokens": 6810167.0, | |
| "step": 182 | |
| }, | |
| { | |
| "entropy": 0.64576156437397, | |
| "epoch": 1.1663999999999999, | |
| "grad_norm": 0.009763217531144619, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6441277861595154, | |
| "mean_token_accuracy": 0.7376614883542061, | |
| "num_tokens": 6848110.0, | |
| "step": 183 | |
| }, | |
| { | |
| "entropy": 0.6370326280593872, | |
| "epoch": 1.1728, | |
| "grad_norm": 0.009325532242655754, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6410567760467529, | |
| "mean_token_accuracy": 0.7398818284273148, | |
| "num_tokens": 6885422.0, | |
| "step": 184 | |
| }, | |
| { | |
| "entropy": 0.6284242644906044, | |
| "epoch": 1.1792, | |
| "grad_norm": 0.010027528740465641, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6299871206283569, | |
| "mean_token_accuracy": 0.7442184612154961, | |
| "num_tokens": 6922828.0, | |
| "step": 185 | |
| }, | |
| { | |
| "entropy": 0.6239589303731918, | |
| "epoch": 1.1856, | |
| "grad_norm": 0.012052655220031738, | |
| "learning_rate": 0.0002, | |
| "loss": 0.632190465927124, | |
| "mean_token_accuracy": 0.7433017045259476, | |
| "num_tokens": 6959969.0, | |
| "step": 186 | |
| }, | |
| { | |
| "entropy": 0.6507940962910652, | |
| "epoch": 1.192, | |
| "grad_norm": 0.010141950100660324, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6531009078025818, | |
| "mean_token_accuracy": 0.7333656772971153, | |
| "num_tokens": 6997337.0, | |
| "step": 187 | |
| }, | |
| { | |
| "entropy": 0.6532803177833557, | |
| "epoch": 1.1984, | |
| "grad_norm": 0.010835838504135609, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6479194164276123, | |
| "mean_token_accuracy": 0.7359819039702415, | |
| "num_tokens": 7034795.0, | |
| "step": 188 | |
| }, | |
| { | |
| "entropy": 0.6465721130371094, | |
| "epoch": 1.2048, | |
| "grad_norm": 0.011012948118150234, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6399669051170349, | |
| "mean_token_accuracy": 0.743029810488224, | |
| "num_tokens": 7072227.0, | |
| "step": 189 | |
| }, | |
| { | |
| "entropy": 0.643355593085289, | |
| "epoch": 1.2112, | |
| "grad_norm": 0.0094833392649889, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6482529640197754, | |
| "mean_token_accuracy": 0.7374711334705353, | |
| "num_tokens": 7110108.0, | |
| "step": 190 | |
| }, | |
| { | |
| "entropy": 0.6375522390007973, | |
| "epoch": 1.2176, | |
| "grad_norm": 0.010187760926783085, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6461261510848999, | |
| "mean_token_accuracy": 0.7388442009687424, | |
| "num_tokens": 7147610.0, | |
| "step": 191 | |
| }, | |
| { | |
| "entropy": 0.6215626671910286, | |
| "epoch": 1.224, | |
| "grad_norm": 0.009307745844125748, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6269906163215637, | |
| "mean_token_accuracy": 0.7465217709541321, | |
| "num_tokens": 7184782.0, | |
| "step": 192 | |
| }, | |
| { | |
| "entropy": 0.6429780498147011, | |
| "epoch": 1.2304, | |
| "grad_norm": 0.009042990393936634, | |
| "learning_rate": 0.0002, | |
| "loss": 0.648235559463501, | |
| "mean_token_accuracy": 0.7354854270815849, | |
| "num_tokens": 7222549.0, | |
| "step": 193 | |
| }, | |
| { | |
| "entropy": 0.6526690945029259, | |
| "epoch": 1.2368000000000001, | |
| "grad_norm": 0.010063275694847107, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6548038721084595, | |
| "mean_token_accuracy": 0.7341009303927422, | |
| "num_tokens": 7260409.0, | |
| "step": 194 | |
| }, | |
| { | |
| "entropy": 0.6345907151699066, | |
| "epoch": 1.2432, | |
| "grad_norm": 0.010623205453157425, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6308838129043579, | |
| "mean_token_accuracy": 0.7419967949390411, | |
| "num_tokens": 7297937.0, | |
| "step": 195 | |
| }, | |
| { | |
| "entropy": 0.6445695832371712, | |
| "epoch": 1.2496, | |
| "grad_norm": 0.010199649259448051, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6364445686340332, | |
| "mean_token_accuracy": 0.7410052716732025, | |
| "num_tokens": 7335147.0, | |
| "step": 196 | |
| }, | |
| { | |
| "entropy": 0.6346744820475578, | |
| "epoch": 1.256, | |
| "grad_norm": 0.009105252102017403, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6322548985481262, | |
| "mean_token_accuracy": 0.7424812093377113, | |
| "num_tokens": 7372946.0, | |
| "step": 197 | |
| }, | |
| { | |
| "entropy": 0.619812473654747, | |
| "epoch": 1.2624, | |
| "grad_norm": 0.009648271836340427, | |
| "learning_rate": 0.0002, | |
| "loss": 0.626278817653656, | |
| "mean_token_accuracy": 0.7455899342894554, | |
| "num_tokens": 7410415.0, | |
| "step": 198 | |
| }, | |
| { | |
| "entropy": 0.6315840631723404, | |
| "epoch": 1.2688, | |
| "grad_norm": 0.009451290592551231, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6375157833099365, | |
| "mean_token_accuracy": 0.7421969324350357, | |
| "num_tokens": 7448206.0, | |
| "step": 199 | |
| }, | |
| { | |
| "entropy": 0.6275417804718018, | |
| "epoch": 1.2752, | |
| "grad_norm": 0.009674392640590668, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6342942714691162, | |
| "mean_token_accuracy": 0.74417594820261, | |
| "num_tokens": 7485553.0, | |
| "step": 200 | |
| }, | |
| { | |
| "entropy": 0.6313388273119926, | |
| "epoch": 1.2816, | |
| "grad_norm": 0.008578372187912464, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6364251375198364, | |
| "mean_token_accuracy": 0.7415003478527069, | |
| "num_tokens": 7523107.0, | |
| "step": 201 | |
| }, | |
| { | |
| "entropy": 0.6285647079348564, | |
| "epoch": 1.288, | |
| "grad_norm": 0.007911495864391327, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6274697780609131, | |
| "mean_token_accuracy": 0.7439461648464203, | |
| "num_tokens": 7560637.0, | |
| "step": 202 | |
| }, | |
| { | |
| "entropy": 0.6555930450558662, | |
| "epoch": 1.2944, | |
| "grad_norm": 0.00908783357590437, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6531112194061279, | |
| "mean_token_accuracy": 0.7365255653858185, | |
| "num_tokens": 7598202.0, | |
| "step": 203 | |
| }, | |
| { | |
| "entropy": 0.6405614539980888, | |
| "epoch": 1.3008, | |
| "grad_norm": 0.008850960060954094, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6386165022850037, | |
| "mean_token_accuracy": 0.7407704368233681, | |
| "num_tokens": 7635602.0, | |
| "step": 204 | |
| }, | |
| { | |
| "entropy": 0.6183491796255112, | |
| "epoch": 1.3072, | |
| "grad_norm": 0.009933196939527988, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6215780973434448, | |
| "mean_token_accuracy": 0.7468694671988487, | |
| "num_tokens": 7672796.0, | |
| "step": 205 | |
| }, | |
| { | |
| "entropy": 0.6282857060432434, | |
| "epoch": 1.3136, | |
| "grad_norm": 0.009941700845956802, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6309329271316528, | |
| "mean_token_accuracy": 0.7419614642858505, | |
| "num_tokens": 7710123.0, | |
| "step": 206 | |
| }, | |
| { | |
| "entropy": 0.6409614756703377, | |
| "epoch": 1.32, | |
| "grad_norm": 0.009079815819859505, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6415680050849915, | |
| "mean_token_accuracy": 0.7399025559425354, | |
| "num_tokens": 7747853.0, | |
| "step": 207 | |
| }, | |
| { | |
| "entropy": 0.6362860053777695, | |
| "epoch": 1.3264, | |
| "grad_norm": 0.009475532919168472, | |
| "learning_rate": 0.0002, | |
| "loss": 0.639657735824585, | |
| "mean_token_accuracy": 0.740733340382576, | |
| "num_tokens": 7785809.0, | |
| "step": 208 | |
| }, | |
| { | |
| "entropy": 0.648863323032856, | |
| "epoch": 1.3328, | |
| "grad_norm": 0.00897946022450924, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6453667879104614, | |
| "mean_token_accuracy": 0.7376150414347649, | |
| "num_tokens": 7823564.0, | |
| "step": 209 | |
| }, | |
| { | |
| "entropy": 0.6473242938518524, | |
| "epoch": 1.3392, | |
| "grad_norm": 0.00988426897674799, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6461673974990845, | |
| "mean_token_accuracy": 0.7394340336322784, | |
| "num_tokens": 7861487.0, | |
| "step": 210 | |
| }, | |
| { | |
| "entropy": 0.6313100084662437, | |
| "epoch": 1.3456000000000001, | |
| "grad_norm": 0.011011740192770958, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6353209614753723, | |
| "mean_token_accuracy": 0.7412855923175812, | |
| "num_tokens": 7898738.0, | |
| "step": 211 | |
| }, | |
| { | |
| "entropy": 0.6332249045372009, | |
| "epoch": 1.3519999999999999, | |
| "grad_norm": 0.009350410662591457, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6443768739700317, | |
| "mean_token_accuracy": 0.7384829372167587, | |
| "num_tokens": 7936394.0, | |
| "step": 212 | |
| }, | |
| { | |
| "entropy": 0.6210881397128105, | |
| "epoch": 1.3584, | |
| "grad_norm": 0.010020367801189423, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6294596195220947, | |
| "mean_token_accuracy": 0.7448422238230705, | |
| "num_tokens": 7974219.0, | |
| "step": 213 | |
| }, | |
| { | |
| "entropy": 0.6376784816384315, | |
| "epoch": 1.3648, | |
| "grad_norm": 0.00982749741524458, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6414127945899963, | |
| "mean_token_accuracy": 0.7404457107186317, | |
| "num_tokens": 8011498.0, | |
| "step": 214 | |
| }, | |
| { | |
| "entropy": 0.6365342438220978, | |
| "epoch": 1.3712, | |
| "grad_norm": 0.007822374813258648, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6363272666931152, | |
| "mean_token_accuracy": 0.7404549047350883, | |
| "num_tokens": 8048792.0, | |
| "step": 215 | |
| }, | |
| { | |
| "entropy": 0.6440632939338684, | |
| "epoch": 1.3776, | |
| "grad_norm": 0.009724266827106476, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6365130543708801, | |
| "mean_token_accuracy": 0.7415405437350273, | |
| "num_tokens": 8086606.0, | |
| "step": 216 | |
| }, | |
| { | |
| "entropy": 0.6494074836373329, | |
| "epoch": 1.384, | |
| "grad_norm": 0.009119455702602863, | |
| "learning_rate": 0.0002, | |
| "loss": 0.645447850227356, | |
| "mean_token_accuracy": 0.7357565984129906, | |
| "num_tokens": 8124114.0, | |
| "step": 217 | |
| }, | |
| { | |
| "entropy": 0.6484241932630539, | |
| "epoch": 1.3904, | |
| "grad_norm": 0.009591936133801937, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6502270698547363, | |
| "mean_token_accuracy": 0.7375201731920242, | |
| "num_tokens": 8162048.0, | |
| "step": 218 | |
| }, | |
| { | |
| "entropy": 0.6512304544448853, | |
| "epoch": 1.3968, | |
| "grad_norm": 0.008009335026144981, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6536368131637573, | |
| "mean_token_accuracy": 0.735274650156498, | |
| "num_tokens": 8199794.0, | |
| "step": 219 | |
| }, | |
| { | |
| "entropy": 0.6484591439366341, | |
| "epoch": 1.4032, | |
| "grad_norm": 0.0092353206127882, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6539183259010315, | |
| "mean_token_accuracy": 0.7346156910061836, | |
| "num_tokens": 8237281.0, | |
| "step": 220 | |
| }, | |
| { | |
| "entropy": 0.6388984844088554, | |
| "epoch": 1.4096, | |
| "grad_norm": 0.009845041669905186, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6434773206710815, | |
| "mean_token_accuracy": 0.7382834777235985, | |
| "num_tokens": 8274814.0, | |
| "step": 221 | |
| }, | |
| { | |
| "entropy": 0.6463811621069908, | |
| "epoch": 1.416, | |
| "grad_norm": 0.008870167657732964, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6482495665550232, | |
| "mean_token_accuracy": 0.7370684891939163, | |
| "num_tokens": 8312525.0, | |
| "step": 222 | |
| }, | |
| { | |
| "entropy": 0.6367313861846924, | |
| "epoch": 1.4224, | |
| "grad_norm": 0.008752333000302315, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6363902688026428, | |
| "mean_token_accuracy": 0.7398954927921295, | |
| "num_tokens": 8350434.0, | |
| "step": 223 | |
| }, | |
| { | |
| "entropy": 0.6389205679297447, | |
| "epoch": 1.4288, | |
| "grad_norm": 0.009939228184521198, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6399004459381104, | |
| "mean_token_accuracy": 0.739352636039257, | |
| "num_tokens": 8387935.0, | |
| "step": 224 | |
| }, | |
| { | |
| "entropy": 0.6301346495747566, | |
| "epoch": 1.4352, | |
| "grad_norm": 0.01083251554518938, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6333423256874084, | |
| "mean_token_accuracy": 0.7439003512263298, | |
| "num_tokens": 8425350.0, | |
| "step": 225 | |
| }, | |
| { | |
| "entropy": 0.6417813748121262, | |
| "epoch": 1.4416, | |
| "grad_norm": 0.008651083335280418, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6453697681427002, | |
| "mean_token_accuracy": 0.7393379509449005, | |
| "num_tokens": 8462747.0, | |
| "step": 226 | |
| }, | |
| { | |
| "entropy": 0.6465223357081413, | |
| "epoch": 1.448, | |
| "grad_norm": 0.010395637713372707, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6427249908447266, | |
| "mean_token_accuracy": 0.7377897799015045, | |
| "num_tokens": 8500639.0, | |
| "step": 227 | |
| }, | |
| { | |
| "entropy": 0.637003168463707, | |
| "epoch": 1.4544000000000001, | |
| "grad_norm": 0.00956573337316513, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6341052055358887, | |
| "mean_token_accuracy": 0.7431980520486832, | |
| "num_tokens": 8538277.0, | |
| "step": 228 | |
| }, | |
| { | |
| "entropy": 0.6219193041324615, | |
| "epoch": 1.4607999999999999, | |
| "grad_norm": 0.009173355996608734, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6226502060890198, | |
| "mean_token_accuracy": 0.7491968795657158, | |
| "num_tokens": 8576252.0, | |
| "step": 229 | |
| }, | |
| { | |
| "entropy": 0.6295832619071007, | |
| "epoch": 1.4672, | |
| "grad_norm": 0.009499134495854378, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6385797262191772, | |
| "mean_token_accuracy": 0.740376353263855, | |
| "num_tokens": 8613847.0, | |
| "step": 230 | |
| }, | |
| { | |
| "entropy": 0.6238328814506531, | |
| "epoch": 1.4736, | |
| "grad_norm": 0.009796243160963058, | |
| "learning_rate": 0.0002, | |
| "loss": 0.633277177810669, | |
| "mean_token_accuracy": 0.7418293952941895, | |
| "num_tokens": 8651305.0, | |
| "step": 231 | |
| }, | |
| { | |
| "entropy": 0.6379890963435173, | |
| "epoch": 1.48, | |
| "grad_norm": 0.00879639107733965, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6392139196395874, | |
| "mean_token_accuracy": 0.7400495782494545, | |
| "num_tokens": 8688955.0, | |
| "step": 232 | |
| }, | |
| { | |
| "entropy": 0.639459103345871, | |
| "epoch": 1.4864, | |
| "grad_norm": 0.00866638869047165, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6354138255119324, | |
| "mean_token_accuracy": 0.7424653545022011, | |
| "num_tokens": 8726561.0, | |
| "step": 233 | |
| }, | |
| { | |
| "entropy": 0.6338846683502197, | |
| "epoch": 1.4928, | |
| "grad_norm": 0.008886488154530525, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6311143636703491, | |
| "mean_token_accuracy": 0.7435080260038376, | |
| "num_tokens": 8763633.0, | |
| "step": 234 | |
| }, | |
| { | |
| "entropy": 0.6329428404569626, | |
| "epoch": 1.4992, | |
| "grad_norm": 0.008422540500760078, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6340688467025757, | |
| "mean_token_accuracy": 0.7437330037355423, | |
| "num_tokens": 8801223.0, | |
| "step": 235 | |
| }, | |
| { | |
| "entropy": 0.6404994279146194, | |
| "epoch": 1.5056, | |
| "grad_norm": 0.008861835114657879, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6435329914093018, | |
| "mean_token_accuracy": 0.7402794137597084, | |
| "num_tokens": 8838852.0, | |
| "step": 236 | |
| }, | |
| { | |
| "entropy": 0.6229164972901344, | |
| "epoch": 1.512, | |
| "grad_norm": 0.01079252827912569, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6297635436058044, | |
| "mean_token_accuracy": 0.7451627627015114, | |
| "num_tokens": 8876215.0, | |
| "step": 237 | |
| }, | |
| { | |
| "entropy": 0.645681232213974, | |
| "epoch": 1.5184, | |
| "grad_norm": 0.00952441431581974, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6496944427490234, | |
| "mean_token_accuracy": 0.7374964207410812, | |
| "num_tokens": 8913833.0, | |
| "step": 238 | |
| }, | |
| { | |
| "entropy": 0.6374045237898827, | |
| "epoch": 1.5248, | |
| "grad_norm": 0.010180641897022724, | |
| "learning_rate": 0.0002, | |
| "loss": 0.631719172000885, | |
| "mean_token_accuracy": 0.7413778752088547, | |
| "num_tokens": 8951296.0, | |
| "step": 239 | |
| }, | |
| { | |
| "entropy": 0.6539132967591286, | |
| "epoch": 1.5312000000000001, | |
| "grad_norm": 0.011931417509913445, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6448370218276978, | |
| "mean_token_accuracy": 0.7378397807478905, | |
| "num_tokens": 8988896.0, | |
| "step": 240 | |
| }, | |
| { | |
| "entropy": 0.6414381936192513, | |
| "epoch": 1.5375999999999999, | |
| "grad_norm": 0.00920459907501936, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6397557258605957, | |
| "mean_token_accuracy": 0.7399087175726891, | |
| "num_tokens": 9026747.0, | |
| "step": 241 | |
| }, | |
| { | |
| "entropy": 0.6196104139089584, | |
| "epoch": 1.544, | |
| "grad_norm": 0.011374457739293575, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6309009194374084, | |
| "mean_token_accuracy": 0.743213526904583, | |
| "num_tokens": 9064429.0, | |
| "step": 242 | |
| }, | |
| { | |
| "entropy": 0.6261283829808235, | |
| "epoch": 1.5504, | |
| "grad_norm": 0.011355147697031498, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6374455690383911, | |
| "mean_token_accuracy": 0.7419503480195999, | |
| "num_tokens": 9102195.0, | |
| "step": 243 | |
| }, | |
| { | |
| "entropy": 0.6445719599723816, | |
| "epoch": 1.5568, | |
| "grad_norm": 0.009919662959873676, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6474390029907227, | |
| "mean_token_accuracy": 0.7369806244969368, | |
| "num_tokens": 9139609.0, | |
| "step": 244 | |
| }, | |
| { | |
| "entropy": 0.6413188800215721, | |
| "epoch": 1.5632000000000001, | |
| "grad_norm": 0.00855494849383831, | |
| "learning_rate": 0.0002, | |
| "loss": 0.641474187374115, | |
| "mean_token_accuracy": 0.7400150150060654, | |
| "num_tokens": 9177293.0, | |
| "step": 245 | |
| }, | |
| { | |
| "entropy": 0.637481302022934, | |
| "epoch": 1.5695999999999999, | |
| "grad_norm": 0.00973748043179512, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6346510648727417, | |
| "mean_token_accuracy": 0.7417012825608253, | |
| "num_tokens": 9214895.0, | |
| "step": 246 | |
| }, | |
| { | |
| "entropy": 0.6503799557685852, | |
| "epoch": 1.576, | |
| "grad_norm": 0.007979532703757286, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6497414112091064, | |
| "mean_token_accuracy": 0.7372497469186783, | |
| "num_tokens": 9252813.0, | |
| "step": 247 | |
| }, | |
| { | |
| "entropy": 0.6455269455909729, | |
| "epoch": 1.5824, | |
| "grad_norm": 0.008097643963992596, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6451165676116943, | |
| "mean_token_accuracy": 0.7385182455182076, | |
| "num_tokens": 9290181.0, | |
| "step": 248 | |
| }, | |
| { | |
| "entropy": 0.644989550113678, | |
| "epoch": 1.5888, | |
| "grad_norm": 0.010681331157684326, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6487670540809631, | |
| "mean_token_accuracy": 0.7362834960222244, | |
| "num_tokens": 9327721.0, | |
| "step": 249 | |
| }, | |
| { | |
| "entropy": 0.6285341307520866, | |
| "epoch": 1.5952, | |
| "grad_norm": 0.008401221595704556, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6307709217071533, | |
| "mean_token_accuracy": 0.7442108020186424, | |
| "num_tokens": 9365266.0, | |
| "step": 250 | |
| }, | |
| { | |
| "entropy": 0.6323808878660202, | |
| "epoch": 1.6016, | |
| "grad_norm": 0.008853926323354244, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6337858438491821, | |
| "mean_token_accuracy": 0.7412157282233238, | |
| "num_tokens": 9403484.0, | |
| "step": 251 | |
| }, | |
| { | |
| "entropy": 0.6329245269298553, | |
| "epoch": 1.608, | |
| "grad_norm": 0.009235359728336334, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6332880258560181, | |
| "mean_token_accuracy": 0.743882454931736, | |
| "num_tokens": 9441086.0, | |
| "step": 252 | |
| }, | |
| { | |
| "entropy": 0.6339508295059204, | |
| "epoch": 1.6143999999999998, | |
| "grad_norm": 0.008013821206986904, | |
| "learning_rate": 0.0002, | |
| "loss": 0.63725346326828, | |
| "mean_token_accuracy": 0.7408271208405495, | |
| "num_tokens": 9478771.0, | |
| "step": 253 | |
| }, | |
| { | |
| "entropy": 0.6374928578734398, | |
| "epoch": 1.6208, | |
| "grad_norm": 0.009221353568136692, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6384063959121704, | |
| "mean_token_accuracy": 0.7406769022345543, | |
| "num_tokens": 9516166.0, | |
| "step": 254 | |
| }, | |
| { | |
| "entropy": 0.6367692276835442, | |
| "epoch": 1.6272, | |
| "grad_norm": 0.00975379254668951, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6376797556877136, | |
| "mean_token_accuracy": 0.7408984154462814, | |
| "num_tokens": 9553885.0, | |
| "step": 255 | |
| }, | |
| { | |
| "entropy": 0.6397164911031723, | |
| "epoch": 1.6336, | |
| "grad_norm": 0.009269645437598228, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6477100849151611, | |
| "mean_token_accuracy": 0.7368867322802544, | |
| "num_tokens": 9591274.0, | |
| "step": 256 | |
| }, | |
| { | |
| "entropy": 0.6350990980863571, | |
| "epoch": 1.6400000000000001, | |
| "grad_norm": 0.007825898006558418, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6354209184646606, | |
| "mean_token_accuracy": 0.7403729483485222, | |
| "num_tokens": 9628921.0, | |
| "step": 257 | |
| }, | |
| { | |
| "entropy": 0.6429452896118164, | |
| "epoch": 1.6463999999999999, | |
| "grad_norm": 0.009811664931476116, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6441528797149658, | |
| "mean_token_accuracy": 0.7374731153249741, | |
| "num_tokens": 9666769.0, | |
| "step": 258 | |
| }, | |
| { | |
| "entropy": 0.6346355751156807, | |
| "epoch": 1.6528, | |
| "grad_norm": 0.010059292428195477, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6366721391677856, | |
| "mean_token_accuracy": 0.7407139092683792, | |
| "num_tokens": 9704033.0, | |
| "step": 259 | |
| }, | |
| { | |
| "entropy": 0.6290543302893639, | |
| "epoch": 1.6592, | |
| "grad_norm": 0.008349488489329815, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6278114914894104, | |
| "mean_token_accuracy": 0.7450250014662743, | |
| "num_tokens": 9741540.0, | |
| "step": 260 | |
| }, | |
| { | |
| "entropy": 0.6501712873578072, | |
| "epoch": 1.6656, | |
| "grad_norm": 0.009427984245121479, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6549891829490662, | |
| "mean_token_accuracy": 0.7353075668215752, | |
| "num_tokens": 9779201.0, | |
| "step": 261 | |
| }, | |
| { | |
| "entropy": 0.6343263909220695, | |
| "epoch": 1.6720000000000002, | |
| "grad_norm": 0.008428818546235561, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6368517875671387, | |
| "mean_token_accuracy": 0.7391695827245712, | |
| "num_tokens": 9816683.0, | |
| "step": 262 | |
| }, | |
| { | |
| "entropy": 0.649608425796032, | |
| "epoch": 1.6784, | |
| "grad_norm": 0.008335414342582226, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6505298614501953, | |
| "mean_token_accuracy": 0.7356899008154869, | |
| "num_tokens": 9854491.0, | |
| "step": 263 | |
| }, | |
| { | |
| "entropy": 0.6355179324746132, | |
| "epoch": 1.6848, | |
| "grad_norm": 0.009246018715202808, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6331362128257751, | |
| "mean_token_accuracy": 0.741562083363533, | |
| "num_tokens": 9891893.0, | |
| "step": 264 | |
| }, | |
| { | |
| "entropy": 0.6557022258639336, | |
| "epoch": 1.6912, | |
| "grad_norm": 0.008260353468358517, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6587477922439575, | |
| "mean_token_accuracy": 0.7323677465319633, | |
| "num_tokens": 9929548.0, | |
| "step": 265 | |
| }, | |
| { | |
| "entropy": 0.6404315456748009, | |
| "epoch": 1.6976, | |
| "grad_norm": 0.009794406592845917, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6475528478622437, | |
| "mean_token_accuracy": 0.7362662330269814, | |
| "num_tokens": 9967059.0, | |
| "step": 266 | |
| }, | |
| { | |
| "entropy": 0.63386220484972, | |
| "epoch": 1.704, | |
| "grad_norm": 0.008251597173511982, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6386945247650146, | |
| "mean_token_accuracy": 0.7404668778181076, | |
| "num_tokens": 10004660.0, | |
| "step": 267 | |
| }, | |
| { | |
| "entropy": 0.6313491612672806, | |
| "epoch": 1.7104, | |
| "grad_norm": 0.00842359196394682, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6330629587173462, | |
| "mean_token_accuracy": 0.7405205965042114, | |
| "num_tokens": 10042002.0, | |
| "step": 268 | |
| }, | |
| { | |
| "entropy": 0.6439215540885925, | |
| "epoch": 1.7168, | |
| "grad_norm": 0.008792798034846783, | |
| "learning_rate": 0.0002, | |
| "loss": 0.64313805103302, | |
| "mean_token_accuracy": 0.7380542382597923, | |
| "num_tokens": 10079455.0, | |
| "step": 269 | |
| }, | |
| { | |
| "entropy": 0.6456866934895515, | |
| "epoch": 1.7231999999999998, | |
| "grad_norm": 0.008770551532506943, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6415017247200012, | |
| "mean_token_accuracy": 0.7395961955189705, | |
| "num_tokens": 10117042.0, | |
| "step": 270 | |
| }, | |
| { | |
| "entropy": 0.6421365886926651, | |
| "epoch": 1.7296, | |
| "grad_norm": 0.008746870793402195, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6441514492034912, | |
| "mean_token_accuracy": 0.7391441687941551, | |
| "num_tokens": 10154684.0, | |
| "step": 271 | |
| }, | |
| { | |
| "entropy": 0.6459959074854851, | |
| "epoch": 1.736, | |
| "grad_norm": 0.008375383913516998, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6512868404388428, | |
| "mean_token_accuracy": 0.7382498681545258, | |
| "num_tokens": 10192405.0, | |
| "step": 272 | |
| }, | |
| { | |
| "entropy": 0.6390120834112167, | |
| "epoch": 1.7424, | |
| "grad_norm": 0.009461523965001106, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6469432711601257, | |
| "mean_token_accuracy": 0.7358321473002434, | |
| "num_tokens": 10230330.0, | |
| "step": 273 | |
| }, | |
| { | |
| "entropy": 0.6369089707732201, | |
| "epoch": 1.7488000000000001, | |
| "grad_norm": 0.008092108182609081, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6383406519889832, | |
| "mean_token_accuracy": 0.7406154125928879, | |
| "num_tokens": 10267525.0, | |
| "step": 274 | |
| }, | |
| { | |
| "entropy": 0.6338964253664017, | |
| "epoch": 1.7551999999999999, | |
| "grad_norm": 0.008980642072856426, | |
| "learning_rate": 0.0002, | |
| "loss": 0.633415937423706, | |
| "mean_token_accuracy": 0.7437249273061752, | |
| "num_tokens": 10304863.0, | |
| "step": 275 | |
| }, | |
| { | |
| "entropy": 0.6264254227280617, | |
| "epoch": 1.7616, | |
| "grad_norm": 0.008377771824598312, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6282482743263245, | |
| "mean_token_accuracy": 0.7431060671806335, | |
| "num_tokens": 10342202.0, | |
| "step": 276 | |
| }, | |
| { | |
| "entropy": 0.6434390917420387, | |
| "epoch": 1.768, | |
| "grad_norm": 0.008159980177879333, | |
| "learning_rate": 0.0002, | |
| "loss": 0.646558403968811, | |
| "mean_token_accuracy": 0.7382596433162689, | |
| "num_tokens": 10379740.0, | |
| "step": 277 | |
| }, | |
| { | |
| "entropy": 0.6326303333044052, | |
| "epoch": 1.7744, | |
| "grad_norm": 0.008124861866235733, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6332470178604126, | |
| "mean_token_accuracy": 0.7423404455184937, | |
| "num_tokens": 10417746.0, | |
| "step": 278 | |
| }, | |
| { | |
| "entropy": 0.6520350500941277, | |
| "epoch": 1.7808000000000002, | |
| "grad_norm": 0.009632322005927563, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6571191549301147, | |
| "mean_token_accuracy": 0.7318461984395981, | |
| "num_tokens": 10455758.0, | |
| "step": 279 | |
| }, | |
| { | |
| "entropy": 0.6354654431343079, | |
| "epoch": 1.7872, | |
| "grad_norm": 0.008794812485575676, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6319587230682373, | |
| "mean_token_accuracy": 0.7421321347355843, | |
| "num_tokens": 10493098.0, | |
| "step": 280 | |
| }, | |
| { | |
| "entropy": 0.6494236141443253, | |
| "epoch": 1.7936, | |
| "grad_norm": 0.00833588931709528, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6512980461120605, | |
| "mean_token_accuracy": 0.7350147068500519, | |
| "num_tokens": 10530840.0, | |
| "step": 281 | |
| }, | |
| { | |
| "entropy": 0.6404789388179779, | |
| "epoch": 1.8, | |
| "grad_norm": 0.009666857309639454, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6438995599746704, | |
| "mean_token_accuracy": 0.7382337227463722, | |
| "num_tokens": 10568316.0, | |
| "step": 282 | |
| }, | |
| { | |
| "entropy": 0.628923237323761, | |
| "epoch": 1.8064, | |
| "grad_norm": 0.010019267909228802, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6307887434959412, | |
| "mean_token_accuracy": 0.7422001957893372, | |
| "num_tokens": 10605621.0, | |
| "step": 283 | |
| }, | |
| { | |
| "entropy": 0.6334665641188622, | |
| "epoch": 1.8128, | |
| "grad_norm": 0.00908628199249506, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6341119408607483, | |
| "mean_token_accuracy": 0.7430456355214119, | |
| "num_tokens": 10642983.0, | |
| "step": 284 | |
| }, | |
| { | |
| "entropy": 0.6285069659352303, | |
| "epoch": 1.8192, | |
| "grad_norm": 0.008308637887239456, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6301131248474121, | |
| "mean_token_accuracy": 0.7429656311869621, | |
| "num_tokens": 10680597.0, | |
| "step": 285 | |
| }, | |
| { | |
| "entropy": 0.6323676705360413, | |
| "epoch": 1.8256000000000001, | |
| "grad_norm": 0.008813594467937946, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6346842050552368, | |
| "mean_token_accuracy": 0.7398638725280762, | |
| "num_tokens": 10718004.0, | |
| "step": 286 | |
| }, | |
| { | |
| "entropy": 0.6334202289581299, | |
| "epoch": 1.8319999999999999, | |
| "grad_norm": 0.009448044933378696, | |
| "learning_rate": 0.0002, | |
| "loss": 0.640605092048645, | |
| "mean_token_accuracy": 0.7379657998681068, | |
| "num_tokens": 10755392.0, | |
| "step": 287 | |
| }, | |
| { | |
| "entropy": 0.6541434079408646, | |
| "epoch": 1.8384, | |
| "grad_norm": 0.00910591334104538, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6537045240402222, | |
| "mean_token_accuracy": 0.7336858883500099, | |
| "num_tokens": 10792841.0, | |
| "step": 288 | |
| }, | |
| { | |
| "entropy": 0.6449815109372139, | |
| "epoch": 1.8448, | |
| "grad_norm": 0.010256773792207241, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6409913301467896, | |
| "mean_token_accuracy": 0.739972397685051, | |
| "num_tokens": 10830422.0, | |
| "step": 289 | |
| }, | |
| { | |
| "entropy": 0.6341065391898155, | |
| "epoch": 1.8512, | |
| "grad_norm": 0.007780797313898802, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6369997262954712, | |
| "mean_token_accuracy": 0.7405647411942482, | |
| "num_tokens": 10867712.0, | |
| "step": 290 | |
| }, | |
| { | |
| "entropy": 0.6363702341914177, | |
| "epoch": 1.8576000000000001, | |
| "grad_norm": 0.008313016034662724, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6386253833770752, | |
| "mean_token_accuracy": 0.7408165112137794, | |
| "num_tokens": 10905152.0, | |
| "step": 291 | |
| }, | |
| { | |
| "entropy": 0.6477962657809258, | |
| "epoch": 1.8639999999999999, | |
| "grad_norm": 0.007996824570000172, | |
| "learning_rate": 0.0002, | |
| "loss": 0.649878740310669, | |
| "mean_token_accuracy": 0.7363680452108383, | |
| "num_tokens": 10942566.0, | |
| "step": 292 | |
| }, | |
| { | |
| "entropy": 0.6444478929042816, | |
| "epoch": 1.8704, | |
| "grad_norm": 0.009034682996571064, | |
| "learning_rate": 0.0002, | |
| "loss": 0.64991295337677, | |
| "mean_token_accuracy": 0.7348211482167244, | |
| "num_tokens": 10979522.0, | |
| "step": 293 | |
| }, | |
| { | |
| "entropy": 0.6329373270273209, | |
| "epoch": 1.8768, | |
| "grad_norm": 0.009291103109717369, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6315436363220215, | |
| "mean_token_accuracy": 0.7441153600811958, | |
| "num_tokens": 11016799.0, | |
| "step": 294 | |
| }, | |
| { | |
| "entropy": 0.6502094119787216, | |
| "epoch": 1.8832, | |
| "grad_norm": 0.0096050426363945, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6489418148994446, | |
| "mean_token_accuracy": 0.7356565669178963, | |
| "num_tokens": 11054518.0, | |
| "step": 295 | |
| }, | |
| { | |
| "entropy": 0.6323768645524979, | |
| "epoch": 1.8896, | |
| "grad_norm": 0.008002777583897114, | |
| "learning_rate": 0.0002, | |
| "loss": 0.635691225528717, | |
| "mean_token_accuracy": 0.7405551075935364, | |
| "num_tokens": 11091967.0, | |
| "step": 296 | |
| }, | |
| { | |
| "entropy": 0.6422302722930908, | |
| "epoch": 1.896, | |
| "grad_norm": 0.008403711952269077, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6455032825469971, | |
| "mean_token_accuracy": 0.7383149340748787, | |
| "num_tokens": 11129384.0, | |
| "step": 297 | |
| }, | |
| { | |
| "entropy": 0.6316574737429619, | |
| "epoch": 1.9024, | |
| "grad_norm": 0.00967500451952219, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6350202560424805, | |
| "mean_token_accuracy": 0.7421634197235107, | |
| "num_tokens": 11166669.0, | |
| "step": 298 | |
| }, | |
| { | |
| "entropy": 0.6459977030754089, | |
| "epoch": 1.9088, | |
| "grad_norm": 0.00876573659479618, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6403264999389648, | |
| "mean_token_accuracy": 0.7382558658719063, | |
| "num_tokens": 11204332.0, | |
| "step": 299 | |
| }, | |
| { | |
| "entropy": 0.6415895000100136, | |
| "epoch": 1.9152, | |
| "grad_norm": 0.009217560291290283, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6415034532546997, | |
| "mean_token_accuracy": 0.7386994808912277, | |
| "num_tokens": 11241726.0, | |
| "step": 300 | |
| }, | |
| { | |
| "entropy": 0.6311015710234642, | |
| "epoch": 1.9216, | |
| "grad_norm": 0.00828156340867281, | |
| "learning_rate": 0.0002, | |
| "loss": 0.630814790725708, | |
| "mean_token_accuracy": 0.7444434463977814, | |
| "num_tokens": 11279304.0, | |
| "step": 301 | |
| }, | |
| { | |
| "entropy": 0.6455347687005997, | |
| "epoch": 1.928, | |
| "grad_norm": 0.00847472995519638, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6488364934921265, | |
| "mean_token_accuracy": 0.7379944175481796, | |
| "num_tokens": 11316642.0, | |
| "step": 302 | |
| }, | |
| { | |
| "entropy": 0.6381795853376389, | |
| "epoch": 1.9344000000000001, | |
| "grad_norm": 0.010508674196898937, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6469117403030396, | |
| "mean_token_accuracy": 0.7371617555618286, | |
| "num_tokens": 11354142.0, | |
| "step": 303 | |
| }, | |
| { | |
| "entropy": 0.6340028718113899, | |
| "epoch": 1.9407999999999999, | |
| "grad_norm": 0.008417687378823757, | |
| "learning_rate": 0.0002, | |
| "loss": 0.638616681098938, | |
| "mean_token_accuracy": 0.7400232255458832, | |
| "num_tokens": 11391584.0, | |
| "step": 304 | |
| }, | |
| { | |
| "entropy": 0.641148068010807, | |
| "epoch": 1.9472, | |
| "grad_norm": 0.009189863689243793, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6417672038078308, | |
| "mean_token_accuracy": 0.7394173890352249, | |
| "num_tokens": 11429141.0, | |
| "step": 305 | |
| }, | |
| { | |
| "entropy": 0.6361806094646454, | |
| "epoch": 1.9536, | |
| "grad_norm": 0.009170212782919407, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6348021626472473, | |
| "mean_token_accuracy": 0.741854839026928, | |
| "num_tokens": 11466566.0, | |
| "step": 306 | |
| }, | |
| { | |
| "entropy": 0.6448198854923248, | |
| "epoch": 1.96, | |
| "grad_norm": 0.008513331413269043, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6473972797393799, | |
| "mean_token_accuracy": 0.7364873364567757, | |
| "num_tokens": 11503681.0, | |
| "step": 307 | |
| }, | |
| { | |
| "entropy": 0.6346408724784851, | |
| "epoch": 1.9664000000000001, | |
| "grad_norm": 0.010691906325519085, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6393898725509644, | |
| "mean_token_accuracy": 0.7428330779075623, | |
| "num_tokens": 11541361.0, | |
| "step": 308 | |
| }, | |
| { | |
| "entropy": 0.6447126045823097, | |
| "epoch": 1.9727999999999999, | |
| "grad_norm": 0.009089854545891285, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6462785601615906, | |
| "mean_token_accuracy": 0.7361640483140945, | |
| "num_tokens": 11578943.0, | |
| "step": 309 | |
| }, | |
| { | |
| "entropy": 0.6443200558423996, | |
| "epoch": 1.9792, | |
| "grad_norm": 0.007877051830291748, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6410749554634094, | |
| "mean_token_accuracy": 0.7393750101327896, | |
| "num_tokens": 11616900.0, | |
| "step": 310 | |
| }, | |
| { | |
| "entropy": 0.6526265293359756, | |
| "epoch": 1.9856, | |
| "grad_norm": 0.007553855888545513, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6491004824638367, | |
| "mean_token_accuracy": 0.7368245124816895, | |
| "num_tokens": 11654118.0, | |
| "step": 311 | |
| }, | |
| { | |
| "entropy": 0.6361679136753082, | |
| "epoch": 1.992, | |
| "grad_norm": 0.0077677839435637, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6400581002235413, | |
| "mean_token_accuracy": 0.7392396479845047, | |
| "num_tokens": 11691819.0, | |
| "step": 312 | |
| }, | |
| { | |
| "entropy": 0.6478787511587143, | |
| "epoch": 1.9984, | |
| "grad_norm": 0.008330225013196468, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6550832390785217, | |
| "mean_token_accuracy": 0.7333075851202011, | |
| "num_tokens": 11729371.0, | |
| "step": 313 | |
| }, | |
| { | |
| "entropy": 0.647148609161377, | |
| "epoch": 2.0, | |
| "grad_norm": 0.014249460771679878, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6511927843093872, | |
| "mean_token_accuracy": 0.7351100444793701, | |
| "num_tokens": 11738913.0, | |
| "step": 314 | |
| }, | |
| { | |
| "entropy": 0.6428509056568146, | |
| "epoch": 2.0064, | |
| "grad_norm": 0.012224607169628143, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6413295865058899, | |
| "mean_token_accuracy": 0.7383991628885269, | |
| "num_tokens": 11776564.0, | |
| "step": 315 | |
| }, | |
| { | |
| "entropy": 0.6307617798447609, | |
| "epoch": 2.0128, | |
| "grad_norm": 0.00805046409368515, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6318984031677246, | |
| "mean_token_accuracy": 0.7424051091074944, | |
| "num_tokens": 11813755.0, | |
| "step": 316 | |
| }, | |
| { | |
| "entropy": 0.6430513709783554, | |
| "epoch": 2.0192, | |
| "grad_norm": 0.007973214611411095, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6426272392272949, | |
| "mean_token_accuracy": 0.7385435774922371, | |
| "num_tokens": 11851558.0, | |
| "step": 317 | |
| }, | |
| { | |
| "entropy": 0.6318764910101891, | |
| "epoch": 2.0256, | |
| "grad_norm": 0.012760069221258163, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6337249875068665, | |
| "mean_token_accuracy": 0.7423495799303055, | |
| "num_tokens": 11889166.0, | |
| "step": 318 | |
| }, | |
| { | |
| "entropy": 0.655825637280941, | |
| "epoch": 2.032, | |
| "grad_norm": 0.008295831270515919, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6574875712394714, | |
| "mean_token_accuracy": 0.7304191887378693, | |
| "num_tokens": 11926828.0, | |
| "step": 319 | |
| }, | |
| { | |
| "entropy": 0.646898128092289, | |
| "epoch": 2.0384, | |
| "grad_norm": 0.0076156072318553925, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6442586183547974, | |
| "mean_token_accuracy": 0.7376453951001167, | |
| "num_tokens": 11964281.0, | |
| "step": 320 | |
| }, | |
| { | |
| "entropy": 0.6386341005563736, | |
| "epoch": 2.0448, | |
| "grad_norm": 0.008703756146132946, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6401532888412476, | |
| "mean_token_accuracy": 0.7430068925023079, | |
| "num_tokens": 12001686.0, | |
| "step": 321 | |
| }, | |
| { | |
| "entropy": 0.6369054093956947, | |
| "epoch": 2.0512, | |
| "grad_norm": 0.008225949481129646, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6394542455673218, | |
| "mean_token_accuracy": 0.7397433742880821, | |
| "num_tokens": 12039411.0, | |
| "step": 322 | |
| }, | |
| { | |
| "entropy": 0.6331326514482498, | |
| "epoch": 2.0576, | |
| "grad_norm": 0.009685281664133072, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6398283839225769, | |
| "mean_token_accuracy": 0.7404422760009766, | |
| "num_tokens": 12076768.0, | |
| "step": 323 | |
| }, | |
| { | |
| "entropy": 0.6296347230672836, | |
| "epoch": 2.064, | |
| "grad_norm": 0.008879579603672028, | |
| "learning_rate": 0.0002, | |
| "loss": 0.632715106010437, | |
| "mean_token_accuracy": 0.7417664974927902, | |
| "num_tokens": 12114584.0, | |
| "step": 324 | |
| }, | |
| { | |
| "entropy": 0.6318413317203522, | |
| "epoch": 2.0704, | |
| "grad_norm": 0.008431381545960903, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6331377029418945, | |
| "mean_token_accuracy": 0.7394522577524185, | |
| "num_tokens": 12152129.0, | |
| "step": 325 | |
| }, | |
| { | |
| "entropy": 0.6365228146314621, | |
| "epoch": 2.0768, | |
| "grad_norm": 0.008421050384640694, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6375148296356201, | |
| "mean_token_accuracy": 0.7391103804111481, | |
| "num_tokens": 12189530.0, | |
| "step": 326 | |
| }, | |
| { | |
| "entropy": 0.6343080475926399, | |
| "epoch": 2.0832, | |
| "grad_norm": 0.008700543083250523, | |
| "learning_rate": 0.0002, | |
| "loss": 0.640760600566864, | |
| "mean_token_accuracy": 0.737753376364708, | |
| "num_tokens": 12227254.0, | |
| "step": 327 | |
| }, | |
| { | |
| "entropy": 0.6292807161808014, | |
| "epoch": 2.0896, | |
| "grad_norm": 0.008493369445204735, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6337940692901611, | |
| "mean_token_accuracy": 0.7432547584176064, | |
| "num_tokens": 12264717.0, | |
| "step": 328 | |
| }, | |
| { | |
| "entropy": 0.6373203322291374, | |
| "epoch": 2.096, | |
| "grad_norm": 0.008298007771372795, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6361969709396362, | |
| "mean_token_accuracy": 0.7403373941779137, | |
| "num_tokens": 12301926.0, | |
| "step": 329 | |
| }, | |
| { | |
| "entropy": 0.645341120660305, | |
| "epoch": 2.1024, | |
| "grad_norm": 0.009415465407073498, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6422229409217834, | |
| "mean_token_accuracy": 0.7388109862804413, | |
| "num_tokens": 12339358.0, | |
| "step": 330 | |
| }, | |
| { | |
| "entropy": 0.6284746676683426, | |
| "epoch": 2.1088, | |
| "grad_norm": 0.00816258043050766, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6270098090171814, | |
| "mean_token_accuracy": 0.7465712875127792, | |
| "num_tokens": 12376845.0, | |
| "step": 331 | |
| }, | |
| { | |
| "entropy": 0.618787370622158, | |
| "epoch": 2.1152, | |
| "grad_norm": 0.010069424286484718, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6233252286911011, | |
| "mean_token_accuracy": 0.7466351315379143, | |
| "num_tokens": 12414270.0, | |
| "step": 332 | |
| }, | |
| { | |
| "entropy": 0.6204424351453781, | |
| "epoch": 2.1216, | |
| "grad_norm": 0.011632254347205162, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6273159384727478, | |
| "mean_token_accuracy": 0.7449653670191765, | |
| "num_tokens": 12451814.0, | |
| "step": 333 | |
| }, | |
| { | |
| "entropy": 0.6244671940803528, | |
| "epoch": 2.128, | |
| "grad_norm": 0.007731855846941471, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6259894371032715, | |
| "mean_token_accuracy": 0.7442785128951073, | |
| "num_tokens": 12489174.0, | |
| "step": 334 | |
| }, | |
| { | |
| "entropy": 0.6379582434892654, | |
| "epoch": 2.1344, | |
| "grad_norm": 0.009793682023882866, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6348966360092163, | |
| "mean_token_accuracy": 0.740781731903553, | |
| "num_tokens": 12526495.0, | |
| "step": 335 | |
| }, | |
| { | |
| "entropy": 0.6337939351797104, | |
| "epoch": 2.1408, | |
| "grad_norm": 0.00962368305772543, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6337376832962036, | |
| "mean_token_accuracy": 0.741876944899559, | |
| "num_tokens": 12563862.0, | |
| "step": 336 | |
| }, | |
| { | |
| "entropy": 0.6327385306358337, | |
| "epoch": 2.1471999999999998, | |
| "grad_norm": 0.008747846819460392, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6306090354919434, | |
| "mean_token_accuracy": 0.7432660833001137, | |
| "num_tokens": 12601147.0, | |
| "step": 337 | |
| }, | |
| { | |
| "entropy": 0.6386691257357597, | |
| "epoch": 2.1536, | |
| "grad_norm": 0.008939294144511223, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6422123908996582, | |
| "mean_token_accuracy": 0.7385012805461884, | |
| "num_tokens": 12638941.0, | |
| "step": 338 | |
| }, | |
| { | |
| "entropy": 0.6356615126132965, | |
| "epoch": 2.16, | |
| "grad_norm": 0.008577845059335232, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6377971768379211, | |
| "mean_token_accuracy": 0.7411153167486191, | |
| "num_tokens": 12676252.0, | |
| "step": 339 | |
| }, | |
| { | |
| "entropy": 0.6395266354084015, | |
| "epoch": 2.1664, | |
| "grad_norm": 0.009049834683537483, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6420882344245911, | |
| "mean_token_accuracy": 0.7383701205253601, | |
| "num_tokens": 12713835.0, | |
| "step": 340 | |
| }, | |
| { | |
| "entropy": 0.6292238682508469, | |
| "epoch": 2.1728, | |
| "grad_norm": 0.008495191112160683, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6327275037765503, | |
| "mean_token_accuracy": 0.7408149838447571, | |
| "num_tokens": 12751620.0, | |
| "step": 341 | |
| }, | |
| { | |
| "entropy": 0.639611691236496, | |
| "epoch": 2.1792, | |
| "grad_norm": 0.009403538890182972, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6445578336715698, | |
| "mean_token_accuracy": 0.7371161133050919, | |
| "num_tokens": 12789311.0, | |
| "step": 342 | |
| }, | |
| { | |
| "entropy": 0.6382555812597275, | |
| "epoch": 2.1856, | |
| "grad_norm": 0.008258577436208725, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6395673751831055, | |
| "mean_token_accuracy": 0.7395190820097923, | |
| "num_tokens": 12826828.0, | |
| "step": 343 | |
| }, | |
| { | |
| "entropy": 0.6255771890282631, | |
| "epoch": 2.192, | |
| "grad_norm": 0.008409053087234497, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6285756826400757, | |
| "mean_token_accuracy": 0.7443142682313919, | |
| "num_tokens": 12864340.0, | |
| "step": 344 | |
| }, | |
| { | |
| "entropy": 0.6310818865895271, | |
| "epoch": 2.1984, | |
| "grad_norm": 0.009435487911105156, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6294571161270142, | |
| "mean_token_accuracy": 0.7434982731938362, | |
| "num_tokens": 12902046.0, | |
| "step": 345 | |
| }, | |
| { | |
| "entropy": 0.6311678513884544, | |
| "epoch": 2.2048, | |
| "grad_norm": 0.008755765855312347, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6339205503463745, | |
| "mean_token_accuracy": 0.740614227950573, | |
| "num_tokens": 12939744.0, | |
| "step": 346 | |
| }, | |
| { | |
| "entropy": 0.6452009528875351, | |
| "epoch": 2.2112, | |
| "grad_norm": 0.008575056679546833, | |
| "learning_rate": 0.0002, | |
| "loss": 0.644209623336792, | |
| "mean_token_accuracy": 0.7392476424574852, | |
| "num_tokens": 12977341.0, | |
| "step": 347 | |
| }, | |
| { | |
| "entropy": 0.6338612660765648, | |
| "epoch": 2.2176, | |
| "grad_norm": 0.007798387669026852, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6330971121788025, | |
| "mean_token_accuracy": 0.7440877333283424, | |
| "num_tokens": 13015002.0, | |
| "step": 348 | |
| }, | |
| { | |
| "entropy": 0.6385946869850159, | |
| "epoch": 2.224, | |
| "grad_norm": 0.009336304850876331, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6359999179840088, | |
| "mean_token_accuracy": 0.741933673620224, | |
| "num_tokens": 13052683.0, | |
| "step": 349 | |
| }, | |
| { | |
| "entropy": 0.6185505017638206, | |
| "epoch": 2.2304, | |
| "grad_norm": 0.009118903428316116, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6220842599868774, | |
| "mean_token_accuracy": 0.7472022995352745, | |
| "num_tokens": 13089828.0, | |
| "step": 350 | |
| }, | |
| { | |
| "entropy": 0.6268252283334732, | |
| "epoch": 2.2368, | |
| "grad_norm": 0.0092701381072402, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6330834627151489, | |
| "mean_token_accuracy": 0.7435643449425697, | |
| "num_tokens": 13127264.0, | |
| "step": 351 | |
| }, | |
| { | |
| "entropy": 0.6323676556348801, | |
| "epoch": 2.2432, | |
| "grad_norm": 0.010936826467514038, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6385864615440369, | |
| "mean_token_accuracy": 0.7403518706560135, | |
| "num_tokens": 13164850.0, | |
| "step": 352 | |
| }, | |
| { | |
| "entropy": 0.6403925344347954, | |
| "epoch": 2.2496, | |
| "grad_norm": 0.009062140248715878, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6446559429168701, | |
| "mean_token_accuracy": 0.737325981259346, | |
| "num_tokens": 13202818.0, | |
| "step": 353 | |
| }, | |
| { | |
| "entropy": 0.6653745025396347, | |
| "epoch": 2.2560000000000002, | |
| "grad_norm": 0.008989578112959862, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6635587215423584, | |
| "mean_token_accuracy": 0.7302659377455711, | |
| "num_tokens": 13240741.0, | |
| "step": 354 | |
| }, | |
| { | |
| "entropy": 0.6176604405045509, | |
| "epoch": 2.2624, | |
| "grad_norm": 0.011122855357825756, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6100451350212097, | |
| "mean_token_accuracy": 0.7515672147274017, | |
| "num_tokens": 13278017.0, | |
| "step": 355 | |
| }, | |
| { | |
| "entropy": 0.6418539881706238, | |
| "epoch": 2.2688, | |
| "grad_norm": 0.009430945850908756, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6456764340400696, | |
| "mean_token_accuracy": 0.7369844615459442, | |
| "num_tokens": 13315575.0, | |
| "step": 356 | |
| }, | |
| { | |
| "entropy": 0.6377789452672005, | |
| "epoch": 2.2752, | |
| "grad_norm": 0.01120819989591837, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6447769999504089, | |
| "mean_token_accuracy": 0.7389207035303116, | |
| "num_tokens": 13353349.0, | |
| "step": 357 | |
| }, | |
| { | |
| "entropy": 0.6309510096907616, | |
| "epoch": 2.2816, | |
| "grad_norm": 0.01070281770080328, | |
| "learning_rate": 0.0002, | |
| "loss": 0.639892578125, | |
| "mean_token_accuracy": 0.7402263358235359, | |
| "num_tokens": 13390831.0, | |
| "step": 358 | |
| }, | |
| { | |
| "entropy": 0.6376594752073288, | |
| "epoch": 2.288, | |
| "grad_norm": 0.008750580251216888, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6361696720123291, | |
| "mean_token_accuracy": 0.7411545366048813, | |
| "num_tokens": 13428400.0, | |
| "step": 359 | |
| }, | |
| { | |
| "entropy": 0.6379339694976807, | |
| "epoch": 2.2944, | |
| "grad_norm": 0.01135624572634697, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6322520971298218, | |
| "mean_token_accuracy": 0.7416113168001175, | |
| "num_tokens": 13465745.0, | |
| "step": 360 | |
| }, | |
| { | |
| "entropy": 0.6344308853149414, | |
| "epoch": 2.3008, | |
| "grad_norm": 0.008200406096875668, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6279163360595703, | |
| "mean_token_accuracy": 0.7453168705105782, | |
| "num_tokens": 13503838.0, | |
| "step": 361 | |
| }, | |
| { | |
| "entropy": 0.6380530670285225, | |
| "epoch": 2.3072, | |
| "grad_norm": 0.011549552902579308, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6419570446014404, | |
| "mean_token_accuracy": 0.7404475137591362, | |
| "num_tokens": 13541929.0, | |
| "step": 362 | |
| }, | |
| { | |
| "entropy": 0.6338977962732315, | |
| "epoch": 2.3136, | |
| "grad_norm": 0.009041829034686089, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6397197842597961, | |
| "mean_token_accuracy": 0.7420290112495422, | |
| "num_tokens": 13579161.0, | |
| "step": 363 | |
| }, | |
| { | |
| "entropy": 0.6449583545327187, | |
| "epoch": 2.32, | |
| "grad_norm": 0.009089567698538303, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6466807126998901, | |
| "mean_token_accuracy": 0.7365088015794754, | |
| "num_tokens": 13616744.0, | |
| "step": 364 | |
| }, | |
| { | |
| "entropy": 0.642234593629837, | |
| "epoch": 2.3264, | |
| "grad_norm": 0.009368225000798702, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6429442167282104, | |
| "mean_token_accuracy": 0.7369751259684563, | |
| "num_tokens": 13654392.0, | |
| "step": 365 | |
| }, | |
| { | |
| "entropy": 0.6480699181556702, | |
| "epoch": 2.3327999999999998, | |
| "grad_norm": 0.008836016058921814, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6484840512275696, | |
| "mean_token_accuracy": 0.7375075444579124, | |
| "num_tokens": 13691824.0, | |
| "step": 366 | |
| }, | |
| { | |
| "entropy": 0.6319603100419044, | |
| "epoch": 2.3392, | |
| "grad_norm": 0.008661167696118355, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6352815628051758, | |
| "mean_token_accuracy": 0.7423906549811363, | |
| "num_tokens": 13729838.0, | |
| "step": 367 | |
| }, | |
| { | |
| "entropy": 0.6437906175851822, | |
| "epoch": 2.3456, | |
| "grad_norm": 0.009302763268351555, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6494675874710083, | |
| "mean_token_accuracy": 0.7354337424039841, | |
| "num_tokens": 13767404.0, | |
| "step": 368 | |
| }, | |
| { | |
| "entropy": 0.6363216936588287, | |
| "epoch": 2.352, | |
| "grad_norm": 0.009825549088418484, | |
| "learning_rate": 0.0002, | |
| "loss": 0.640619158744812, | |
| "mean_token_accuracy": 0.7399841696023941, | |
| "num_tokens": 13805320.0, | |
| "step": 369 | |
| }, | |
| { | |
| "entropy": 0.6430623680353165, | |
| "epoch": 2.3584, | |
| "grad_norm": 0.008325744420289993, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6433535814285278, | |
| "mean_token_accuracy": 0.7388209700584412, | |
| "num_tokens": 13843211.0, | |
| "step": 370 | |
| }, | |
| { | |
| "entropy": 0.6459617763757706, | |
| "epoch": 2.3648, | |
| "grad_norm": 0.009273998439311981, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6418501138687134, | |
| "mean_token_accuracy": 0.7380605787038803, | |
| "num_tokens": 13880860.0, | |
| "step": 371 | |
| }, | |
| { | |
| "entropy": 0.6389967799186707, | |
| "epoch": 2.3712, | |
| "grad_norm": 0.009662107564508915, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6336321830749512, | |
| "mean_token_accuracy": 0.7438643798232079, | |
| "num_tokens": 13918761.0, | |
| "step": 372 | |
| }, | |
| { | |
| "entropy": 0.638178676366806, | |
| "epoch": 2.3776, | |
| "grad_norm": 0.009039600379765034, | |
| "learning_rate": 0.0002, | |
| "loss": 0.642177164554596, | |
| "mean_token_accuracy": 0.7402292564511299, | |
| "num_tokens": 13956629.0, | |
| "step": 373 | |
| }, | |
| { | |
| "entropy": 0.6183496937155724, | |
| "epoch": 2.384, | |
| "grad_norm": 0.00997725035995245, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6257633566856384, | |
| "mean_token_accuracy": 0.7432282716035843, | |
| "num_tokens": 13993705.0, | |
| "step": 374 | |
| }, | |
| { | |
| "entropy": 0.6249210014939308, | |
| "epoch": 2.3904, | |
| "grad_norm": 0.007910847663879395, | |
| "learning_rate": 0.0002, | |
| "loss": 0.625819981098175, | |
| "mean_token_accuracy": 0.7441049888730049, | |
| "num_tokens": 14031321.0, | |
| "step": 375 | |
| }, | |
| { | |
| "entropy": 0.6479079499840736, | |
| "epoch": 2.3968, | |
| "grad_norm": 0.00891756173223257, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6501407623291016, | |
| "mean_token_accuracy": 0.7355809286236763, | |
| "num_tokens": 14069143.0, | |
| "step": 376 | |
| }, | |
| { | |
| "entropy": 0.6394218653440475, | |
| "epoch": 2.4032, | |
| "grad_norm": 0.00850125402212143, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6394637823104858, | |
| "mean_token_accuracy": 0.7385919019579887, | |
| "num_tokens": 14106711.0, | |
| "step": 377 | |
| }, | |
| { | |
| "entropy": 0.6354732289910316, | |
| "epoch": 2.4096, | |
| "grad_norm": 0.008283271454274654, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6353892087936401, | |
| "mean_token_accuracy": 0.7419078797101974, | |
| "num_tokens": 14144364.0, | |
| "step": 378 | |
| }, | |
| { | |
| "entropy": 0.6316136568784714, | |
| "epoch": 2.416, | |
| "grad_norm": 0.009771537035703659, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6347823143005371, | |
| "mean_token_accuracy": 0.7427188232541084, | |
| "num_tokens": 14181995.0, | |
| "step": 379 | |
| }, | |
| { | |
| "entropy": 0.6375484988093376, | |
| "epoch": 2.4224, | |
| "grad_norm": 0.008568905293941498, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6410992741584778, | |
| "mean_token_accuracy": 0.7378129065036774, | |
| "num_tokens": 14219687.0, | |
| "step": 380 | |
| }, | |
| { | |
| "entropy": 0.6333465948700905, | |
| "epoch": 2.4288, | |
| "grad_norm": 0.007412395905703306, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6309605836868286, | |
| "mean_token_accuracy": 0.7434795945882797, | |
| "num_tokens": 14257055.0, | |
| "step": 381 | |
| }, | |
| { | |
| "entropy": 0.6269642487168312, | |
| "epoch": 2.4352, | |
| "grad_norm": 0.008765887469053268, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6296891570091248, | |
| "mean_token_accuracy": 0.7441322207450867, | |
| "num_tokens": 14294332.0, | |
| "step": 382 | |
| }, | |
| { | |
| "entropy": 0.6352812573313713, | |
| "epoch": 2.4416, | |
| "grad_norm": 0.009595113806426525, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6348291039466858, | |
| "mean_token_accuracy": 0.7420725524425507, | |
| "num_tokens": 14331865.0, | |
| "step": 383 | |
| }, | |
| { | |
| "entropy": 0.6441971585154533, | |
| "epoch": 2.448, | |
| "grad_norm": 0.008584806695580482, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6498426198959351, | |
| "mean_token_accuracy": 0.7357524335384369, | |
| "num_tokens": 14369788.0, | |
| "step": 384 | |
| }, | |
| { | |
| "entropy": 0.6287561655044556, | |
| "epoch": 2.4544, | |
| "grad_norm": 0.008044449612498283, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6315615177154541, | |
| "mean_token_accuracy": 0.7426558956503868, | |
| "num_tokens": 14407482.0, | |
| "step": 385 | |
| }, | |
| { | |
| "entropy": 0.6339204907417297, | |
| "epoch": 2.4608, | |
| "grad_norm": 0.007299972232431173, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6352561116218567, | |
| "mean_token_accuracy": 0.74134461581707, | |
| "num_tokens": 14445123.0, | |
| "step": 386 | |
| }, | |
| { | |
| "entropy": 0.6295419782400131, | |
| "epoch": 2.4672, | |
| "grad_norm": 0.008794458582997322, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6306071281433105, | |
| "mean_token_accuracy": 0.7435100376605988, | |
| "num_tokens": 14482719.0, | |
| "step": 387 | |
| }, | |
| { | |
| "entropy": 0.622240737080574, | |
| "epoch": 2.4736000000000002, | |
| "grad_norm": 0.008617876097559929, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6234915256500244, | |
| "mean_token_accuracy": 0.7468436509370804, | |
| "num_tokens": 14520261.0, | |
| "step": 388 | |
| }, | |
| { | |
| "entropy": 0.6362800300121307, | |
| "epoch": 2.48, | |
| "grad_norm": 0.008423526771366596, | |
| "learning_rate": 0.0002, | |
| "loss": 0.641099214553833, | |
| "mean_token_accuracy": 0.7397967800498009, | |
| "num_tokens": 14557676.0, | |
| "step": 389 | |
| }, | |
| { | |
| "entropy": 0.6532713696360588, | |
| "epoch": 2.4864, | |
| "grad_norm": 0.008641418069601059, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6506437063217163, | |
| "mean_token_accuracy": 0.7350734695792198, | |
| "num_tokens": 14595548.0, | |
| "step": 390 | |
| }, | |
| { | |
| "entropy": 0.6302274093031883, | |
| "epoch": 2.4928, | |
| "grad_norm": 0.00921640731394291, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6322726607322693, | |
| "mean_token_accuracy": 0.7424062266945839, | |
| "num_tokens": 14632684.0, | |
| "step": 391 | |
| }, | |
| { | |
| "entropy": 0.6293173208832741, | |
| "epoch": 2.4992, | |
| "grad_norm": 0.008461368270218372, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6278185844421387, | |
| "mean_token_accuracy": 0.744764506816864, | |
| "num_tokens": 14670523.0, | |
| "step": 392 | |
| }, | |
| { | |
| "entropy": 0.6276180446147919, | |
| "epoch": 2.5056000000000003, | |
| "grad_norm": 0.008572320453822613, | |
| "learning_rate": 0.0002, | |
| "loss": 0.631564736366272, | |
| "mean_token_accuracy": 0.7426915839314461, | |
| "num_tokens": 14708031.0, | |
| "step": 393 | |
| }, | |
| { | |
| "entropy": 0.6308008059859276, | |
| "epoch": 2.512, | |
| "grad_norm": 0.008926871232688427, | |
| "learning_rate": 0.0002, | |
| "loss": 0.633114755153656, | |
| "mean_token_accuracy": 0.7416298165917397, | |
| "num_tokens": 14745679.0, | |
| "step": 394 | |
| }, | |
| { | |
| "entropy": 0.6268336623907089, | |
| "epoch": 2.5183999999999997, | |
| "grad_norm": 0.008902951143682003, | |
| "learning_rate": 0.0002, | |
| "loss": 0.627051830291748, | |
| "mean_token_accuracy": 0.7439748197793961, | |
| "num_tokens": 14783397.0, | |
| "step": 395 | |
| }, | |
| { | |
| "entropy": 0.634651429951191, | |
| "epoch": 2.5248, | |
| "grad_norm": 0.00856532622128725, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6363992691040039, | |
| "mean_token_accuracy": 0.7408565506339073, | |
| "num_tokens": 14820870.0, | |
| "step": 396 | |
| }, | |
| { | |
| "entropy": 0.6315286681056023, | |
| "epoch": 2.5312, | |
| "grad_norm": 0.009570743888616562, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6403943300247192, | |
| "mean_token_accuracy": 0.7384237721562386, | |
| "num_tokens": 14858066.0, | |
| "step": 397 | |
| }, | |
| { | |
| "entropy": 0.6313930228352547, | |
| "epoch": 2.5376, | |
| "grad_norm": 0.007634198758751154, | |
| "learning_rate": 0.0002, | |
| "loss": 0.63489830493927, | |
| "mean_token_accuracy": 0.740663692355156, | |
| "num_tokens": 14895686.0, | |
| "step": 398 | |
| }, | |
| { | |
| "entropy": 0.6275153756141663, | |
| "epoch": 2.544, | |
| "grad_norm": 0.00890920590609312, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6264928579330444, | |
| "mean_token_accuracy": 0.7460935115814209, | |
| "num_tokens": 14933293.0, | |
| "step": 399 | |
| }, | |
| { | |
| "entropy": 0.6245445236563683, | |
| "epoch": 2.5504, | |
| "grad_norm": 0.009081481955945492, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6231961250305176, | |
| "mean_token_accuracy": 0.7458623945713043, | |
| "num_tokens": 14970626.0, | |
| "step": 400 | |
| }, | |
| { | |
| "entropy": 0.6321042701601982, | |
| "epoch": 2.5568, | |
| "grad_norm": 0.01011180505156517, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6376926898956299, | |
| "mean_token_accuracy": 0.7382810115814209, | |
| "num_tokens": 15008147.0, | |
| "step": 401 | |
| }, | |
| { | |
| "entropy": 0.6281652376055717, | |
| "epoch": 2.5632, | |
| "grad_norm": 0.008269083686172962, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6288952231407166, | |
| "mean_token_accuracy": 0.7468898370862007, | |
| "num_tokens": 15045200.0, | |
| "step": 402 | |
| }, | |
| { | |
| "entropy": 0.6325756087899208, | |
| "epoch": 2.5696, | |
| "grad_norm": 0.009284023195505142, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6372162103652954, | |
| "mean_token_accuracy": 0.7393135726451874, | |
| "num_tokens": 15082728.0, | |
| "step": 403 | |
| }, | |
| { | |
| "entropy": 0.6326915472745895, | |
| "epoch": 2.576, | |
| "grad_norm": 0.008368260227143764, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6289712190628052, | |
| "mean_token_accuracy": 0.7438352182507515, | |
| "num_tokens": 15120176.0, | |
| "step": 404 | |
| }, | |
| { | |
| "entropy": 0.6458227932453156, | |
| "epoch": 2.5824, | |
| "grad_norm": 0.008600444532930851, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6437180042266846, | |
| "mean_token_accuracy": 0.7360183447599411, | |
| "num_tokens": 15157874.0, | |
| "step": 405 | |
| }, | |
| { | |
| "entropy": 0.6378503367304802, | |
| "epoch": 2.5888, | |
| "grad_norm": 0.008291950449347496, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6357482075691223, | |
| "mean_token_accuracy": 0.7405651807785034, | |
| "num_tokens": 15195757.0, | |
| "step": 406 | |
| }, | |
| { | |
| "entropy": 0.6248553469777107, | |
| "epoch": 2.5952, | |
| "grad_norm": 0.009239988401532173, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6330691576004028, | |
| "mean_token_accuracy": 0.7403087541460991, | |
| "num_tokens": 15232888.0, | |
| "step": 407 | |
| }, | |
| { | |
| "entropy": 0.6266547441482544, | |
| "epoch": 2.6016, | |
| "grad_norm": 0.008323184214532375, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6295891404151917, | |
| "mean_token_accuracy": 0.7445848137140274, | |
| "num_tokens": 15270471.0, | |
| "step": 408 | |
| }, | |
| { | |
| "entropy": 0.6273859366774559, | |
| "epoch": 2.608, | |
| "grad_norm": 0.008808370679616928, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6343215107917786, | |
| "mean_token_accuracy": 0.7426254749298096, | |
| "num_tokens": 15307996.0, | |
| "step": 409 | |
| }, | |
| { | |
| "entropy": 0.649120107293129, | |
| "epoch": 2.6144, | |
| "grad_norm": 0.008977086283266544, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6475695371627808, | |
| "mean_token_accuracy": 0.7367869392037392, | |
| "num_tokens": 15345526.0, | |
| "step": 410 | |
| }, | |
| { | |
| "entropy": 0.6383312568068504, | |
| "epoch": 2.6208, | |
| "grad_norm": 0.009833469986915588, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6327086091041565, | |
| "mean_token_accuracy": 0.7418203428387642, | |
| "num_tokens": 15382760.0, | |
| "step": 411 | |
| }, | |
| { | |
| "entropy": 0.6142470389604568, | |
| "epoch": 2.6272, | |
| "grad_norm": 0.007820895873010159, | |
| "learning_rate": 0.0002, | |
| "loss": 0.614084780216217, | |
| "mean_token_accuracy": 0.7492156624794006, | |
| "num_tokens": 15420133.0, | |
| "step": 412 | |
| }, | |
| { | |
| "entropy": 0.6232952103018761, | |
| "epoch": 2.6336, | |
| "grad_norm": 0.010564403608441353, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6333082318305969, | |
| "mean_token_accuracy": 0.7423960939049721, | |
| "num_tokens": 15457883.0, | |
| "step": 413 | |
| }, | |
| { | |
| "entropy": 0.6330999732017517, | |
| "epoch": 2.64, | |
| "grad_norm": 0.009710205718874931, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6388413906097412, | |
| "mean_token_accuracy": 0.7408091574907303, | |
| "num_tokens": 15495425.0, | |
| "step": 414 | |
| }, | |
| { | |
| "entropy": 0.6545180752873421, | |
| "epoch": 2.6464, | |
| "grad_norm": 0.00887272972613573, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6515014171600342, | |
| "mean_token_accuracy": 0.7343106046319008, | |
| "num_tokens": 15532965.0, | |
| "step": 415 | |
| }, | |
| { | |
| "entropy": 0.6397780776023865, | |
| "epoch": 2.6528, | |
| "grad_norm": 0.008293447084724903, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6368398666381836, | |
| "mean_token_accuracy": 0.7398713007569313, | |
| "num_tokens": 15570436.0, | |
| "step": 416 | |
| }, | |
| { | |
| "entropy": 0.6291993260383606, | |
| "epoch": 2.6592000000000002, | |
| "grad_norm": 0.008709436282515526, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6272790431976318, | |
| "mean_token_accuracy": 0.745321199297905, | |
| "num_tokens": 15607874.0, | |
| "step": 417 | |
| }, | |
| { | |
| "entropy": 0.648408018052578, | |
| "epoch": 2.6656, | |
| "grad_norm": 0.009814375080168247, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6569237112998962, | |
| "mean_token_accuracy": 0.7306895926594734, | |
| "num_tokens": 15645823.0, | |
| "step": 418 | |
| }, | |
| { | |
| "entropy": 0.6370497196912766, | |
| "epoch": 2.672, | |
| "grad_norm": 0.00858649704605341, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6417921781539917, | |
| "mean_token_accuracy": 0.738996684551239, | |
| "num_tokens": 15683110.0, | |
| "step": 419 | |
| }, | |
| { | |
| "entropy": 0.6393727734684944, | |
| "epoch": 2.6784, | |
| "grad_norm": 0.009777788072824478, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6401950120925903, | |
| "mean_token_accuracy": 0.7391480058431625, | |
| "num_tokens": 15720611.0, | |
| "step": 420 | |
| }, | |
| { | |
| "entropy": 0.63716159760952, | |
| "epoch": 2.6848, | |
| "grad_norm": 0.008626547642052174, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6399793028831482, | |
| "mean_token_accuracy": 0.739508643746376, | |
| "num_tokens": 15758221.0, | |
| "step": 421 | |
| }, | |
| { | |
| "entropy": 0.6414335444569588, | |
| "epoch": 2.6912000000000003, | |
| "grad_norm": 0.009168457239866257, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6497803926467896, | |
| "mean_token_accuracy": 0.7342201620340347, | |
| "num_tokens": 15795862.0, | |
| "step": 422 | |
| }, | |
| { | |
| "entropy": 0.6342490315437317, | |
| "epoch": 2.6976, | |
| "grad_norm": 0.009793863631784916, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6359165906906128, | |
| "mean_token_accuracy": 0.7401581779122353, | |
| "num_tokens": 15833350.0, | |
| "step": 423 | |
| }, | |
| { | |
| "entropy": 0.6518041715025902, | |
| "epoch": 2.7039999999999997, | |
| "grad_norm": 0.0076965210027992725, | |
| "learning_rate": 0.0002, | |
| "loss": 0.649188756942749, | |
| "mean_token_accuracy": 0.735841915011406, | |
| "num_tokens": 15871335.0, | |
| "step": 424 | |
| }, | |
| { | |
| "entropy": 0.6324848383665085, | |
| "epoch": 2.7104, | |
| "grad_norm": 0.007825566455721855, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6314542293548584, | |
| "mean_token_accuracy": 0.7424084842205048, | |
| "num_tokens": 15909163.0, | |
| "step": 425 | |
| }, | |
| { | |
| "entropy": 0.6271793767809868, | |
| "epoch": 2.7168, | |
| "grad_norm": 0.007992296479642391, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6311610341072083, | |
| "mean_token_accuracy": 0.7418703660368919, | |
| "num_tokens": 15946937.0, | |
| "step": 426 | |
| }, | |
| { | |
| "entropy": 0.6191146075725555, | |
| "epoch": 2.7232, | |
| "grad_norm": 0.007840313948690891, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6227446794509888, | |
| "mean_token_accuracy": 0.7470360621809959, | |
| "num_tokens": 15984420.0, | |
| "step": 427 | |
| }, | |
| { | |
| "entropy": 0.6226735487580299, | |
| "epoch": 2.7296, | |
| "grad_norm": 0.007951436564326286, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6275327205657959, | |
| "mean_token_accuracy": 0.7467052638530731, | |
| "num_tokens": 16021985.0, | |
| "step": 428 | |
| }, | |
| { | |
| "entropy": 0.6366565078496933, | |
| "epoch": 2.7359999999999998, | |
| "grad_norm": 0.007951410487294197, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6385185122489929, | |
| "mean_token_accuracy": 0.7392742782831192, | |
| "num_tokens": 16059718.0, | |
| "step": 429 | |
| }, | |
| { | |
| "entropy": 0.6241059601306915, | |
| "epoch": 2.7424, | |
| "grad_norm": 0.008495664224028587, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6223422288894653, | |
| "mean_token_accuracy": 0.7480814754962921, | |
| "num_tokens": 16096969.0, | |
| "step": 430 | |
| }, | |
| { | |
| "entropy": 0.6395189017057419, | |
| "epoch": 2.7488, | |
| "grad_norm": 0.008117246441543102, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6383851766586304, | |
| "mean_token_accuracy": 0.7399205639958382, | |
| "num_tokens": 16135311.0, | |
| "step": 431 | |
| }, | |
| { | |
| "entropy": 0.6342849209904671, | |
| "epoch": 2.7552, | |
| "grad_norm": 0.007573962211608887, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6357378959655762, | |
| "mean_token_accuracy": 0.7413295134902, | |
| "num_tokens": 16173264.0, | |
| "step": 432 | |
| }, | |
| { | |
| "entropy": 0.6290313079953194, | |
| "epoch": 2.7616, | |
| "grad_norm": 0.00819240789860487, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6312831044197083, | |
| "mean_token_accuracy": 0.7436259835958481, | |
| "num_tokens": 16210940.0, | |
| "step": 433 | |
| }, | |
| { | |
| "entropy": 0.6433441936969757, | |
| "epoch": 2.768, | |
| "grad_norm": 0.00860763993114233, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6448662877082825, | |
| "mean_token_accuracy": 0.7353287860751152, | |
| "num_tokens": 16248287.0, | |
| "step": 434 | |
| }, | |
| { | |
| "entropy": 0.6330644562840462, | |
| "epoch": 2.7744, | |
| "grad_norm": 0.0077530574053525925, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6352605819702148, | |
| "mean_token_accuracy": 0.7418182790279388, | |
| "num_tokens": 16285750.0, | |
| "step": 435 | |
| }, | |
| { | |
| "entropy": 0.6248625069856644, | |
| "epoch": 2.7808, | |
| "grad_norm": 0.007953410036861897, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6288837790489197, | |
| "mean_token_accuracy": 0.7424777820706367, | |
| "num_tokens": 16322871.0, | |
| "step": 436 | |
| }, | |
| { | |
| "entropy": 0.6338153034448624, | |
| "epoch": 2.7872, | |
| "grad_norm": 0.008173540234565735, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6316856145858765, | |
| "mean_token_accuracy": 0.743153415620327, | |
| "num_tokens": 16360741.0, | |
| "step": 437 | |
| }, | |
| { | |
| "entropy": 0.6180099546909332, | |
| "epoch": 2.7936, | |
| "grad_norm": 0.008011853322386742, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6195465922355652, | |
| "mean_token_accuracy": 0.7491164207458496, | |
| "num_tokens": 16398052.0, | |
| "step": 438 | |
| }, | |
| { | |
| "entropy": 0.6288798898458481, | |
| "epoch": 2.8, | |
| "grad_norm": 0.008486307226121426, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6308120489120483, | |
| "mean_token_accuracy": 0.7431682348251343, | |
| "num_tokens": 16435504.0, | |
| "step": 439 | |
| }, | |
| { | |
| "entropy": 0.6349303498864174, | |
| "epoch": 2.8064, | |
| "grad_norm": 0.009010681882500648, | |
| "learning_rate": 0.0002, | |
| "loss": 0.632607102394104, | |
| "mean_token_accuracy": 0.7425792217254639, | |
| "num_tokens": 16473212.0, | |
| "step": 440 | |
| }, | |
| { | |
| "entropy": 0.630001574754715, | |
| "epoch": 2.8128, | |
| "grad_norm": 0.008531573228538036, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6290241479873657, | |
| "mean_token_accuracy": 0.7448351979255676, | |
| "num_tokens": 16510183.0, | |
| "step": 441 | |
| }, | |
| { | |
| "entropy": 0.6317692324519157, | |
| "epoch": 2.8192, | |
| "grad_norm": 0.008379535749554634, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6360982656478882, | |
| "mean_token_accuracy": 0.7403805702924728, | |
| "num_tokens": 16547649.0, | |
| "step": 442 | |
| }, | |
| { | |
| "entropy": 0.6221532076597214, | |
| "epoch": 2.8256, | |
| "grad_norm": 0.00981364119797945, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6305652856826782, | |
| "mean_token_accuracy": 0.7410502806305885, | |
| "num_tokens": 16584772.0, | |
| "step": 443 | |
| }, | |
| { | |
| "entropy": 0.6281775683164597, | |
| "epoch": 2.832, | |
| "grad_norm": 0.009363848716020584, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6325273513793945, | |
| "mean_token_accuracy": 0.7412790656089783, | |
| "num_tokens": 16622377.0, | |
| "step": 444 | |
| }, | |
| { | |
| "entropy": 0.6282860860228539, | |
| "epoch": 2.8384, | |
| "grad_norm": 0.008815777488052845, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6224972009658813, | |
| "mean_token_accuracy": 0.7473303973674774, | |
| "num_tokens": 16659850.0, | |
| "step": 445 | |
| }, | |
| { | |
| "entropy": 0.6256547048687935, | |
| "epoch": 2.8448, | |
| "grad_norm": 0.008997517637908459, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6249480247497559, | |
| "mean_token_accuracy": 0.744784526526928, | |
| "num_tokens": 16697507.0, | |
| "step": 446 | |
| }, | |
| { | |
| "entropy": 0.6432123258709908, | |
| "epoch": 2.8512, | |
| "grad_norm": 0.007546784356236458, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6468585133552551, | |
| "mean_token_accuracy": 0.7387454062700272, | |
| "num_tokens": 16735166.0, | |
| "step": 447 | |
| }, | |
| { | |
| "entropy": 0.6291612312197685, | |
| "epoch": 2.8576, | |
| "grad_norm": 0.008677622303366661, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6363067030906677, | |
| "mean_token_accuracy": 0.7402229011058807, | |
| "num_tokens": 16772700.0, | |
| "step": 448 | |
| }, | |
| { | |
| "entropy": 0.6394010931253433, | |
| "epoch": 2.864, | |
| "grad_norm": 0.008233144879341125, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6435496807098389, | |
| "mean_token_accuracy": 0.7371494546532631, | |
| "num_tokens": 16810206.0, | |
| "step": 449 | |
| }, | |
| { | |
| "entropy": 0.6323223188519478, | |
| "epoch": 2.8704, | |
| "grad_norm": 0.009190903976559639, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6313977837562561, | |
| "mean_token_accuracy": 0.74195995926857, | |
| "num_tokens": 16847440.0, | |
| "step": 450 | |
| }, | |
| { | |
| "entropy": 0.6317964419722557, | |
| "epoch": 2.8768000000000002, | |
| "grad_norm": 0.008045881986618042, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6350542306900024, | |
| "mean_token_accuracy": 0.7399737685918808, | |
| "num_tokens": 16884842.0, | |
| "step": 451 | |
| }, | |
| { | |
| "entropy": 0.6307216063141823, | |
| "epoch": 2.8832, | |
| "grad_norm": 0.008613558486104012, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6330459117889404, | |
| "mean_token_accuracy": 0.7425104603171349, | |
| "num_tokens": 16922153.0, | |
| "step": 452 | |
| }, | |
| { | |
| "entropy": 0.6381876915693283, | |
| "epoch": 2.8895999999999997, | |
| "grad_norm": 0.008792484179139137, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6396152973175049, | |
| "mean_token_accuracy": 0.7395381852984428, | |
| "num_tokens": 16959837.0, | |
| "step": 453 | |
| }, | |
| { | |
| "entropy": 0.6402597278356552, | |
| "epoch": 2.896, | |
| "grad_norm": 0.008886914700269699, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6391183137893677, | |
| "mean_token_accuracy": 0.7400619834661484, | |
| "num_tokens": 16997252.0, | |
| "step": 454 | |
| }, | |
| { | |
| "entropy": 0.6395518109202385, | |
| "epoch": 2.9024, | |
| "grad_norm": 0.008145366795361042, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6410524845123291, | |
| "mean_token_accuracy": 0.7384562343358994, | |
| "num_tokens": 17034792.0, | |
| "step": 455 | |
| }, | |
| { | |
| "entropy": 0.6335340291261673, | |
| "epoch": 2.9088000000000003, | |
| "grad_norm": 0.008513481356203556, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6360284686088562, | |
| "mean_token_accuracy": 0.7419657409191132, | |
| "num_tokens": 17072806.0, | |
| "step": 456 | |
| }, | |
| { | |
| "entropy": 0.6339850574731827, | |
| "epoch": 2.9152, | |
| "grad_norm": 0.00826951116323471, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6338396668434143, | |
| "mean_token_accuracy": 0.7435676008462906, | |
| "num_tokens": 17110256.0, | |
| "step": 457 | |
| }, | |
| { | |
| "entropy": 0.6330336853861809, | |
| "epoch": 2.9215999999999998, | |
| "grad_norm": 0.008118857629597187, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6347401738166809, | |
| "mean_token_accuracy": 0.7419733926653862, | |
| "num_tokens": 17147669.0, | |
| "step": 458 | |
| }, | |
| { | |
| "entropy": 0.6518657803535461, | |
| "epoch": 2.928, | |
| "grad_norm": 0.008373484946787357, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6521078944206238, | |
| "mean_token_accuracy": 0.7351536229252815, | |
| "num_tokens": 17185406.0, | |
| "step": 459 | |
| }, | |
| { | |
| "entropy": 0.6362840831279755, | |
| "epoch": 2.9344, | |
| "grad_norm": 0.00781342200934887, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6393336057662964, | |
| "mean_token_accuracy": 0.7391062676906586, | |
| "num_tokens": 17223104.0, | |
| "step": 460 | |
| }, | |
| { | |
| "entropy": 0.6365083158016205, | |
| "epoch": 2.9408, | |
| "grad_norm": 0.010520093142986298, | |
| "learning_rate": 0.0002, | |
| "loss": 0.643227219581604, | |
| "mean_token_accuracy": 0.7367514818906784, | |
| "num_tokens": 17260499.0, | |
| "step": 461 | |
| }, | |
| { | |
| "entropy": 0.6365673765540123, | |
| "epoch": 2.9472, | |
| "grad_norm": 0.008144881576299667, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6345622539520264, | |
| "mean_token_accuracy": 0.7417429983615875, | |
| "num_tokens": 17298154.0, | |
| "step": 462 | |
| }, | |
| { | |
| "entropy": 0.6422977894544601, | |
| "epoch": 2.9536, | |
| "grad_norm": 0.007375301793217659, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6420764923095703, | |
| "mean_token_accuracy": 0.737017072737217, | |
| "num_tokens": 17336075.0, | |
| "step": 463 | |
| }, | |
| { | |
| "entropy": 0.6339726597070694, | |
| "epoch": 2.96, | |
| "grad_norm": 0.008432124741375446, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6357682347297668, | |
| "mean_token_accuracy": 0.742248572409153, | |
| "num_tokens": 17373430.0, | |
| "step": 464 | |
| }, | |
| { | |
| "entropy": 0.6369189694523811, | |
| "epoch": 2.9664, | |
| "grad_norm": 0.008471203036606312, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6386595964431763, | |
| "mean_token_accuracy": 0.7397382780909538, | |
| "num_tokens": 17411298.0, | |
| "step": 465 | |
| }, | |
| { | |
| "entropy": 0.6291254833340645, | |
| "epoch": 2.9728, | |
| "grad_norm": 0.007794877514243126, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6330430507659912, | |
| "mean_token_accuracy": 0.743395060300827, | |
| "num_tokens": 17448723.0, | |
| "step": 466 | |
| }, | |
| { | |
| "entropy": 0.6243666335940361, | |
| "epoch": 2.9792, | |
| "grad_norm": 0.008405648171901703, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6291847229003906, | |
| "mean_token_accuracy": 0.7437793165445328, | |
| "num_tokens": 17486207.0, | |
| "step": 467 | |
| }, | |
| { | |
| "entropy": 0.6350819692015648, | |
| "epoch": 2.9856, | |
| "grad_norm": 0.008273884654045105, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6370283365249634, | |
| "mean_token_accuracy": 0.7423520013689995, | |
| "num_tokens": 17524019.0, | |
| "step": 468 | |
| }, | |
| { | |
| "entropy": 0.6391937509179115, | |
| "epoch": 2.992, | |
| "grad_norm": 0.008686189539730549, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6426953077316284, | |
| "mean_token_accuracy": 0.7379648461937904, | |
| "num_tokens": 17561604.0, | |
| "step": 469 | |
| }, | |
| { | |
| "entropy": 0.6394234076142311, | |
| "epoch": 2.9984, | |
| "grad_norm": 0.008572033606469631, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6405370235443115, | |
| "mean_token_accuracy": 0.7394323572516441, | |
| "num_tokens": 17599047.0, | |
| "step": 470 | |
| }, | |
| { | |
| "entropy": 0.646001398563385, | |
| "epoch": 3.0, | |
| "grad_norm": 0.016055934131145477, | |
| "learning_rate": 0.0002, | |
| "loss": 0.654330313205719, | |
| "mean_token_accuracy": 0.7357074916362762, | |
| "num_tokens": 17608447.0, | |
| "step": 471 | |
| }, | |
| { | |
| "entropy": 0.6399871557950974, | |
| "epoch": 3.0064, | |
| "grad_norm": 0.010128894820809364, | |
| "learning_rate": 0.0002, | |
| "loss": 0.630492091178894, | |
| "mean_token_accuracy": 0.7438428327441216, | |
| "num_tokens": 17646580.0, | |
| "step": 472 | |
| }, | |
| { | |
| "entropy": 0.6400877311825752, | |
| "epoch": 3.0128, | |
| "grad_norm": 0.0109670115634799, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6348856687545776, | |
| "mean_token_accuracy": 0.7409028187394142, | |
| "num_tokens": 17684203.0, | |
| "step": 473 | |
| }, | |
| { | |
| "entropy": 0.6349283009767532, | |
| "epoch": 3.0192, | |
| "grad_norm": 0.010457641445100307, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6400600671768188, | |
| "mean_token_accuracy": 0.7396369203925133, | |
| "num_tokens": 17721781.0, | |
| "step": 474 | |
| }, | |
| { | |
| "entropy": 0.6234990581870079, | |
| "epoch": 3.0256, | |
| "grad_norm": 0.01080863457173109, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6308765411376953, | |
| "mean_token_accuracy": 0.7440793961286545, | |
| "num_tokens": 17759054.0, | |
| "step": 475 | |
| }, | |
| { | |
| "entropy": 0.6226209849119186, | |
| "epoch": 3.032, | |
| "grad_norm": 0.010244046337902546, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6284743547439575, | |
| "mean_token_accuracy": 0.7413820326328278, | |
| "num_tokens": 17796583.0, | |
| "step": 476 | |
| }, | |
| { | |
| "entropy": 0.626485787332058, | |
| "epoch": 3.0384, | |
| "grad_norm": 0.00895832572132349, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6250468492507935, | |
| "mean_token_accuracy": 0.7454337328672409, | |
| "num_tokens": 17833917.0, | |
| "step": 477 | |
| }, | |
| { | |
| "entropy": 0.6430812701582909, | |
| "epoch": 3.0448, | |
| "grad_norm": 0.011450681835412979, | |
| "learning_rate": 0.0002, | |
| "loss": 0.636460542678833, | |
| "mean_token_accuracy": 0.737629309296608, | |
| "num_tokens": 17871185.0, | |
| "step": 478 | |
| }, | |
| { | |
| "entropy": 0.6313450038433075, | |
| "epoch": 3.0512, | |
| "grad_norm": 0.010822657495737076, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6283341646194458, | |
| "mean_token_accuracy": 0.7447119951248169, | |
| "num_tokens": 17909021.0, | |
| "step": 479 | |
| }, | |
| { | |
| "entropy": 0.616793729364872, | |
| "epoch": 3.0576, | |
| "grad_norm": 0.012827937491238117, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6257752180099487, | |
| "mean_token_accuracy": 0.7451038733124733, | |
| "num_tokens": 17946561.0, | |
| "step": 480 | |
| }, | |
| { | |
| "entropy": 0.6195474341511726, | |
| "epoch": 3.064, | |
| "grad_norm": 0.011573764495551586, | |
| "learning_rate": 0.0002, | |
| "loss": 0.630095899105072, | |
| "mean_token_accuracy": 0.7431527376174927, | |
| "num_tokens": 17983774.0, | |
| "step": 481 | |
| }, | |
| { | |
| "entropy": 0.6207288056612015, | |
| "epoch": 3.0704, | |
| "grad_norm": 0.008784581907093525, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6228084564208984, | |
| "mean_token_accuracy": 0.7441780641674995, | |
| "num_tokens": 18021797.0, | |
| "step": 482 | |
| }, | |
| { | |
| "entropy": 0.6219965890049934, | |
| "epoch": 3.0768, | |
| "grad_norm": 0.009525037370622158, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6203585863113403, | |
| "mean_token_accuracy": 0.7454776242375374, | |
| "num_tokens": 18059600.0, | |
| "step": 483 | |
| }, | |
| { | |
| "entropy": 0.6240369379520416, | |
| "epoch": 3.0832, | |
| "grad_norm": 0.010099082253873348, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6236456632614136, | |
| "mean_token_accuracy": 0.7461361885070801, | |
| "num_tokens": 18097249.0, | |
| "step": 484 | |
| }, | |
| { | |
| "entropy": 0.6231376677751541, | |
| "epoch": 3.0896, | |
| "grad_norm": 0.009384946897625923, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6250054240226746, | |
| "mean_token_accuracy": 0.7437941208481789, | |
| "num_tokens": 18134395.0, | |
| "step": 485 | |
| }, | |
| { | |
| "entropy": 0.6311322897672653, | |
| "epoch": 3.096, | |
| "grad_norm": 0.010897154919803143, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6397508978843689, | |
| "mean_token_accuracy": 0.7386776655912399, | |
| "num_tokens": 18171963.0, | |
| "step": 486 | |
| }, | |
| { | |
| "entropy": 0.62527284771204, | |
| "epoch": 3.1024, | |
| "grad_norm": 0.009014398790895939, | |
| "learning_rate": 0.0002, | |
| "loss": 0.629889726638794, | |
| "mean_token_accuracy": 0.7426332533359528, | |
| "num_tokens": 18209290.0, | |
| "step": 487 | |
| }, | |
| { | |
| "entropy": 0.6315117180347443, | |
| "epoch": 3.1088, | |
| "grad_norm": 0.010383408516645432, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6257723569869995, | |
| "mean_token_accuracy": 0.7457722872495651, | |
| "num_tokens": 18247004.0, | |
| "step": 488 | |
| }, | |
| { | |
| "entropy": 0.6517661288380623, | |
| "epoch": 3.1152, | |
| "grad_norm": 0.009840711019933224, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6448700428009033, | |
| "mean_token_accuracy": 0.7368841990828514, | |
| "num_tokens": 18284521.0, | |
| "step": 489 | |
| }, | |
| { | |
| "entropy": 0.6304850652813911, | |
| "epoch": 3.1216, | |
| "grad_norm": 0.009999154135584831, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6314412951469421, | |
| "mean_token_accuracy": 0.7430186495184898, | |
| "num_tokens": 18321986.0, | |
| "step": 490 | |
| }, | |
| { | |
| "entropy": 0.6318495348095894, | |
| "epoch": 3.128, | |
| "grad_norm": 0.011276421137154102, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6365323066711426, | |
| "mean_token_accuracy": 0.7421404719352722, | |
| "num_tokens": 18359940.0, | |
| "step": 491 | |
| }, | |
| { | |
| "entropy": 0.6343097537755966, | |
| "epoch": 3.1344, | |
| "grad_norm": 0.009451535530388355, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6381996273994446, | |
| "mean_token_accuracy": 0.7415077835321426, | |
| "num_tokens": 18397600.0, | |
| "step": 492 | |
| }, | |
| { | |
| "entropy": 0.6369383260607719, | |
| "epoch": 3.1408, | |
| "grad_norm": 0.009595794603228569, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6356371641159058, | |
| "mean_token_accuracy": 0.7401534095406532, | |
| "num_tokens": 18435100.0, | |
| "step": 493 | |
| }, | |
| { | |
| "entropy": 0.6311136037111282, | |
| "epoch": 3.1471999999999998, | |
| "grad_norm": 0.011402090080082417, | |
| "learning_rate": 0.0002, | |
| "loss": 0.630678117275238, | |
| "mean_token_accuracy": 0.7420787587761879, | |
| "num_tokens": 18472437.0, | |
| "step": 494 | |
| }, | |
| { | |
| "entropy": 0.6152165159583092, | |
| "epoch": 3.1536, | |
| "grad_norm": 0.009202217683196068, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6150789260864258, | |
| "mean_token_accuracy": 0.749266542494297, | |
| "num_tokens": 18509694.0, | |
| "step": 495 | |
| }, | |
| { | |
| "entropy": 0.6187552213668823, | |
| "epoch": 3.16, | |
| "grad_norm": 0.012286514043807983, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6278830170631409, | |
| "mean_token_accuracy": 0.7449735552072525, | |
| "num_tokens": 18547270.0, | |
| "step": 496 | |
| }, | |
| { | |
| "entropy": 0.624017171561718, | |
| "epoch": 3.1664, | |
| "grad_norm": 0.009709254838526249, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6308646202087402, | |
| "mean_token_accuracy": 0.7407297566533089, | |
| "num_tokens": 18584781.0, | |
| "step": 497 | |
| }, | |
| { | |
| "entropy": 0.6381459310650826, | |
| "epoch": 3.1728, | |
| "grad_norm": 0.010118975304067135, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6422901153564453, | |
| "mean_token_accuracy": 0.7380207404494286, | |
| "num_tokens": 18622605.0, | |
| "step": 498 | |
| }, | |
| { | |
| "entropy": 0.6330775320529938, | |
| "epoch": 3.1792, | |
| "grad_norm": 0.010614707134664059, | |
| "learning_rate": 0.0002, | |
| "loss": 0.626909613609314, | |
| "mean_token_accuracy": 0.7434390485286713, | |
| "num_tokens": 18660181.0, | |
| "step": 499 | |
| }, | |
| { | |
| "entropy": 0.6467690318822861, | |
| "epoch": 3.1856, | |
| "grad_norm": 0.011636339128017426, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6417078971862793, | |
| "mean_token_accuracy": 0.7391890659928322, | |
| "num_tokens": 18697960.0, | |
| "step": 500 | |
| }, | |
| { | |
| "entropy": 0.642953485250473, | |
| "epoch": 3.192, | |
| "grad_norm": 0.009976604022085667, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6437498331069946, | |
| "mean_token_accuracy": 0.7397104203701019, | |
| "num_tokens": 18735678.0, | |
| "step": 501 | |
| }, | |
| { | |
| "entropy": 0.6099938452243805, | |
| "epoch": 3.1984, | |
| "grad_norm": 0.012410764582455158, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6217681169509888, | |
| "mean_token_accuracy": 0.7468984425067902, | |
| "num_tokens": 18773294.0, | |
| "step": 502 | |
| }, | |
| { | |
| "entropy": 0.6207045987248421, | |
| "epoch": 3.2048, | |
| "grad_norm": 0.01231430098414421, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6315573453903198, | |
| "mean_token_accuracy": 0.7444091141223907, | |
| "num_tokens": 18810845.0, | |
| "step": 503 | |
| }, | |
| { | |
| "entropy": 0.6327609792351723, | |
| "epoch": 3.2112, | |
| "grad_norm": 0.009783076122403145, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6313201189041138, | |
| "mean_token_accuracy": 0.7418917194008827, | |
| "num_tokens": 18848236.0, | |
| "step": 504 | |
| }, | |
| { | |
| "entropy": 0.6450697854161263, | |
| "epoch": 3.2176, | |
| "grad_norm": 0.011842023581266403, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6390271186828613, | |
| "mean_token_accuracy": 0.7399028763175011, | |
| "num_tokens": 18885816.0, | |
| "step": 505 | |
| }, | |
| { | |
| "entropy": 0.6308076307177544, | |
| "epoch": 3.224, | |
| "grad_norm": 0.009748830460011959, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6288598775863647, | |
| "mean_token_accuracy": 0.7437896579504013, | |
| "num_tokens": 18923477.0, | |
| "step": 506 | |
| }, | |
| { | |
| "entropy": 0.6379056051373482, | |
| "epoch": 3.2304, | |
| "grad_norm": 0.009498417377471924, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6368851661682129, | |
| "mean_token_accuracy": 0.740045078098774, | |
| "num_tokens": 18960975.0, | |
| "step": 507 | |
| }, | |
| { | |
| "entropy": 0.6196693256497383, | |
| "epoch": 3.2368, | |
| "grad_norm": 0.010206184349954128, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6276986598968506, | |
| "mean_token_accuracy": 0.7443438991904259, | |
| "num_tokens": 18998695.0, | |
| "step": 508 | |
| }, | |
| { | |
| "entropy": 0.6081546768546104, | |
| "epoch": 3.2432, | |
| "grad_norm": 0.011067412793636322, | |
| "learning_rate": 0.0002, | |
| "loss": 0.617774248123169, | |
| "mean_token_accuracy": 0.7473630830645561, | |
| "num_tokens": 19036024.0, | |
| "step": 509 | |
| }, | |
| { | |
| "entropy": 0.621229961514473, | |
| "epoch": 3.2496, | |
| "grad_norm": 0.009409903548657894, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6242153644561768, | |
| "mean_token_accuracy": 0.7461365386843681, | |
| "num_tokens": 19073279.0, | |
| "step": 510 | |
| }, | |
| { | |
| "entropy": 0.6359136626124382, | |
| "epoch": 3.2560000000000002, | |
| "grad_norm": 0.01134317647665739, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6272875070571899, | |
| "mean_token_accuracy": 0.7440386563539505, | |
| "num_tokens": 19110879.0, | |
| "step": 511 | |
| }, | |
| { | |
| "entropy": 0.6344882696866989, | |
| "epoch": 3.2624, | |
| "grad_norm": 0.009477692656219006, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6296730041503906, | |
| "mean_token_accuracy": 0.7432499378919601, | |
| "num_tokens": 19148500.0, | |
| "step": 512 | |
| }, | |
| { | |
| "entropy": 0.6398265957832336, | |
| "epoch": 3.2688, | |
| "grad_norm": 0.009287470020353794, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6409690976142883, | |
| "mean_token_accuracy": 0.7397137433290482, | |
| "num_tokens": 19186265.0, | |
| "step": 513 | |
| }, | |
| { | |
| "entropy": 0.6291618198156357, | |
| "epoch": 3.2752, | |
| "grad_norm": 0.010224799625575542, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6341534852981567, | |
| "mean_token_accuracy": 0.7401559799909592, | |
| "num_tokens": 19224100.0, | |
| "step": 514 | |
| }, | |
| { | |
| "entropy": 0.6363715305924416, | |
| "epoch": 3.2816, | |
| "grad_norm": 0.009469510987401009, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6414492130279541, | |
| "mean_token_accuracy": 0.7395576015114784, | |
| "num_tokens": 19261530.0, | |
| "step": 515 | |
| }, | |
| { | |
| "entropy": 0.623082734644413, | |
| "epoch": 3.288, | |
| "grad_norm": 0.009947684593498707, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6218703985214233, | |
| "mean_token_accuracy": 0.7470062673091888, | |
| "num_tokens": 19299016.0, | |
| "step": 516 | |
| }, | |
| { | |
| "entropy": 0.6309391483664513, | |
| "epoch": 3.2944, | |
| "grad_norm": 0.008808617480099201, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6311261653900146, | |
| "mean_token_accuracy": 0.7421472296118736, | |
| "num_tokens": 19336795.0, | |
| "step": 517 | |
| }, | |
| { | |
| "entropy": 0.6172879338264465, | |
| "epoch": 3.3008, | |
| "grad_norm": 0.009716369211673737, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6209211945533752, | |
| "mean_token_accuracy": 0.7458591684699059, | |
| "num_tokens": 19374516.0, | |
| "step": 518 | |
| }, | |
| { | |
| "entropy": 0.624429427087307, | |
| "epoch": 3.3072, | |
| "grad_norm": 0.00985341053456068, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6280737519264221, | |
| "mean_token_accuracy": 0.7443241253495216, | |
| "num_tokens": 19412000.0, | |
| "step": 519 | |
| }, | |
| { | |
| "entropy": 0.6387547329068184, | |
| "epoch": 3.3136, | |
| "grad_norm": 0.010449756868183613, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6452560424804688, | |
| "mean_token_accuracy": 0.7374782711267471, | |
| "num_tokens": 19449428.0, | |
| "step": 520 | |
| }, | |
| { | |
| "entropy": 0.6452173292636871, | |
| "epoch": 3.32, | |
| "grad_norm": 0.010232311673462391, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6446540355682373, | |
| "mean_token_accuracy": 0.7369571030139923, | |
| "num_tokens": 19486584.0, | |
| "step": 521 | |
| }, | |
| { | |
| "entropy": 0.6503598615527153, | |
| "epoch": 3.3264, | |
| "grad_norm": 0.009941341355443, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6453627347946167, | |
| "mean_token_accuracy": 0.736748069524765, | |
| "num_tokens": 19524352.0, | |
| "step": 522 | |
| }, | |
| { | |
| "entropy": 0.6315410137176514, | |
| "epoch": 3.3327999999999998, | |
| "grad_norm": 0.011314695701003075, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6289575099945068, | |
| "mean_token_accuracy": 0.7419339716434479, | |
| "num_tokens": 19561915.0, | |
| "step": 523 | |
| }, | |
| { | |
| "entropy": 0.6262854412198067, | |
| "epoch": 3.3392, | |
| "grad_norm": 0.010391976684331894, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6323624849319458, | |
| "mean_token_accuracy": 0.7404907718300819, | |
| "num_tokens": 19599545.0, | |
| "step": 524 | |
| }, | |
| { | |
| "entropy": 0.6337175592780113, | |
| "epoch": 3.3456, | |
| "grad_norm": 0.011693738400936127, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6432880163192749, | |
| "mean_token_accuracy": 0.7387639954686165, | |
| "num_tokens": 19637116.0, | |
| "step": 525 | |
| }, | |
| { | |
| "entropy": 0.633139468729496, | |
| "epoch": 3.352, | |
| "grad_norm": 0.009820731356739998, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6332041621208191, | |
| "mean_token_accuracy": 0.7423391342163086, | |
| "num_tokens": 19674921.0, | |
| "step": 526 | |
| }, | |
| { | |
| "entropy": 0.6280725598335266, | |
| "epoch": 3.3584, | |
| "grad_norm": 0.009054291062057018, | |
| "learning_rate": 0.0002, | |
| "loss": 0.628294825553894, | |
| "mean_token_accuracy": 0.7419228628277779, | |
| "num_tokens": 19712717.0, | |
| "step": 527 | |
| }, | |
| { | |
| "entropy": 0.6336539536714554, | |
| "epoch": 3.3648, | |
| "grad_norm": 0.010253396816551685, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6339755654335022, | |
| "mean_token_accuracy": 0.7397957965731621, | |
| "num_tokens": 19749941.0, | |
| "step": 528 | |
| }, | |
| { | |
| "entropy": 0.6203584149479866, | |
| "epoch": 3.3712, | |
| "grad_norm": 0.009867236949503422, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6247453689575195, | |
| "mean_token_accuracy": 0.7431770488619804, | |
| "num_tokens": 19787178.0, | |
| "step": 529 | |
| }, | |
| { | |
| "entropy": 0.6316971704363823, | |
| "epoch": 3.3776, | |
| "grad_norm": 0.009513068944215775, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6362742781639099, | |
| "mean_token_accuracy": 0.737493634223938, | |
| "num_tokens": 19824578.0, | |
| "step": 530 | |
| }, | |
| { | |
| "entropy": 0.6340960711240768, | |
| "epoch": 3.384, | |
| "grad_norm": 0.009593709371984005, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6331235766410828, | |
| "mean_token_accuracy": 0.7399430274963379, | |
| "num_tokens": 19862390.0, | |
| "step": 531 | |
| }, | |
| { | |
| "entropy": 0.6132048889994621, | |
| "epoch": 3.3904, | |
| "grad_norm": 0.010046555660665035, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6161696910858154, | |
| "mean_token_accuracy": 0.7499357238411903, | |
| "num_tokens": 19899845.0, | |
| "step": 532 | |
| }, | |
| { | |
| "entropy": 0.6227102503180504, | |
| "epoch": 3.3968, | |
| "grad_norm": 0.010463609360158443, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6273203492164612, | |
| "mean_token_accuracy": 0.7455707415938377, | |
| "num_tokens": 19937650.0, | |
| "step": 533 | |
| }, | |
| { | |
| "entropy": 0.6323057189583778, | |
| "epoch": 3.4032, | |
| "grad_norm": 0.011215063743293285, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6333843469619751, | |
| "mean_token_accuracy": 0.7426166757941246, | |
| "num_tokens": 19975460.0, | |
| "step": 534 | |
| }, | |
| { | |
| "entropy": 0.6401225328445435, | |
| "epoch": 3.4096, | |
| "grad_norm": 0.009196775034070015, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6394823789596558, | |
| "mean_token_accuracy": 0.738113172352314, | |
| "num_tokens": 20013373.0, | |
| "step": 535 | |
| }, | |
| { | |
| "entropy": 0.6456998661160469, | |
| "epoch": 3.416, | |
| "grad_norm": 0.010047613643109798, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6439746618270874, | |
| "mean_token_accuracy": 0.7357992008328438, | |
| "num_tokens": 20051018.0, | |
| "step": 536 | |
| }, | |
| { | |
| "entropy": 0.6272638514637947, | |
| "epoch": 3.4224, | |
| "grad_norm": 0.011030818335711956, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6313672065734863, | |
| "mean_token_accuracy": 0.7423597574234009, | |
| "num_tokens": 20088324.0, | |
| "step": 537 | |
| }, | |
| { | |
| "entropy": 0.6197195202112198, | |
| "epoch": 3.4288, | |
| "grad_norm": 0.010905069299042225, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6300115585327148, | |
| "mean_token_accuracy": 0.7445831671357155, | |
| "num_tokens": 20125821.0, | |
| "step": 538 | |
| }, | |
| { | |
| "entropy": 0.616571269929409, | |
| "epoch": 3.4352, | |
| "grad_norm": 0.00983978621661663, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6236230134963989, | |
| "mean_token_accuracy": 0.7451280057430267, | |
| "num_tokens": 20163266.0, | |
| "step": 539 | |
| }, | |
| { | |
| "entropy": 0.6327468827366829, | |
| "epoch": 3.4416, | |
| "grad_norm": 0.00972190871834755, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6347957849502563, | |
| "mean_token_accuracy": 0.7411710619926453, | |
| "num_tokens": 20201024.0, | |
| "step": 540 | |
| }, | |
| { | |
| "entropy": 0.6288504004478455, | |
| "epoch": 3.448, | |
| "grad_norm": 0.011150616221129894, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6228883266448975, | |
| "mean_token_accuracy": 0.7468400076031685, | |
| "num_tokens": 20238093.0, | |
| "step": 541 | |
| }, | |
| { | |
| "entropy": 0.6300643384456635, | |
| "epoch": 3.4544, | |
| "grad_norm": 0.01008420716971159, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6263501048088074, | |
| "mean_token_accuracy": 0.7454875409603119, | |
| "num_tokens": 20275846.0, | |
| "step": 542 | |
| }, | |
| { | |
| "entropy": 0.621397003531456, | |
| "epoch": 3.4608, | |
| "grad_norm": 0.009655226953327656, | |
| "learning_rate": 0.0002, | |
| "loss": 0.626434862613678, | |
| "mean_token_accuracy": 0.7454000115394592, | |
| "num_tokens": 20313165.0, | |
| "step": 543 | |
| }, | |
| { | |
| "entropy": 0.625905841588974, | |
| "epoch": 3.4672, | |
| "grad_norm": 0.012401984073221684, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6340878009796143, | |
| "mean_token_accuracy": 0.74062430113554, | |
| "num_tokens": 20351212.0, | |
| "step": 544 | |
| }, | |
| { | |
| "entropy": 0.6408397778868675, | |
| "epoch": 3.4736000000000002, | |
| "grad_norm": 0.010497737675905228, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6416893601417542, | |
| "mean_token_accuracy": 0.7387349084019661, | |
| "num_tokens": 20388632.0, | |
| "step": 545 | |
| }, | |
| { | |
| "entropy": 0.6322543397545815, | |
| "epoch": 3.48, | |
| "grad_norm": 0.010267537087202072, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6245300769805908, | |
| "mean_token_accuracy": 0.7472849115729332, | |
| "num_tokens": 20426503.0, | |
| "step": 546 | |
| }, | |
| { | |
| "entropy": 0.6428259909152985, | |
| "epoch": 3.4864, | |
| "grad_norm": 0.010037362575531006, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6373123526573181, | |
| "mean_token_accuracy": 0.7395420894026756, | |
| "num_tokens": 20464010.0, | |
| "step": 547 | |
| }, | |
| { | |
| "entropy": 0.6270901411771774, | |
| "epoch": 3.4928, | |
| "grad_norm": 0.008532303385436535, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6293808221817017, | |
| "mean_token_accuracy": 0.7432048991322517, | |
| "num_tokens": 20501515.0, | |
| "step": 548 | |
| }, | |
| { | |
| "entropy": 0.6149459034204483, | |
| "epoch": 3.4992, | |
| "grad_norm": 0.009804856963455677, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6234340667724609, | |
| "mean_token_accuracy": 0.7474272325634956, | |
| "num_tokens": 20539328.0, | |
| "step": 549 | |
| }, | |
| { | |
| "entropy": 0.6115493848919868, | |
| "epoch": 3.5056000000000003, | |
| "grad_norm": 0.01168244518339634, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6256985068321228, | |
| "mean_token_accuracy": 0.7442245110869408, | |
| "num_tokens": 20576414.0, | |
| "step": 550 | |
| }, | |
| { | |
| "entropy": 0.6242030709981918, | |
| "epoch": 3.512, | |
| "grad_norm": 0.00905383937060833, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6286660432815552, | |
| "mean_token_accuracy": 0.7437908053398132, | |
| "num_tokens": 20614078.0, | |
| "step": 551 | |
| }, | |
| { | |
| "entropy": 0.6304361894726753, | |
| "epoch": 3.5183999999999997, | |
| "grad_norm": 0.008661957457661629, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6304973363876343, | |
| "mean_token_accuracy": 0.7443248927593231, | |
| "num_tokens": 20651484.0, | |
| "step": 552 | |
| }, | |
| { | |
| "entropy": 0.6485093608498573, | |
| "epoch": 3.5248, | |
| "grad_norm": 0.008023140951991081, | |
| "learning_rate": 0.0002, | |
| "loss": 0.64768385887146, | |
| "mean_token_accuracy": 0.7372199594974518, | |
| "num_tokens": 20688874.0, | |
| "step": 553 | |
| }, | |
| { | |
| "entropy": 0.6480056494474411, | |
| "epoch": 3.5312, | |
| "grad_norm": 0.009417054243385792, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6428097486495972, | |
| "mean_token_accuracy": 0.7367473617196083, | |
| "num_tokens": 20726632.0, | |
| "step": 554 | |
| }, | |
| { | |
| "entropy": 0.6245403215289116, | |
| "epoch": 3.5376, | |
| "grad_norm": 0.008958806283771992, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6215206980705261, | |
| "mean_token_accuracy": 0.745918445289135, | |
| "num_tokens": 20764598.0, | |
| "step": 555 | |
| }, | |
| { | |
| "entropy": 0.6468629390001297, | |
| "epoch": 3.544, | |
| "grad_norm": 0.009944718331098557, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6501193046569824, | |
| "mean_token_accuracy": 0.7350190952420235, | |
| "num_tokens": 20802384.0, | |
| "step": 556 | |
| }, | |
| { | |
| "entropy": 0.6288837715983391, | |
| "epoch": 3.5504, | |
| "grad_norm": 0.009102506563067436, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6321202516555786, | |
| "mean_token_accuracy": 0.7416860312223434, | |
| "num_tokens": 20839585.0, | |
| "step": 557 | |
| }, | |
| { | |
| "entropy": 0.6316198781132698, | |
| "epoch": 3.5568, | |
| "grad_norm": 0.009831351228058338, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6349937319755554, | |
| "mean_token_accuracy": 0.7422218322753906, | |
| "num_tokens": 20877319.0, | |
| "step": 558 | |
| }, | |
| { | |
| "entropy": 0.640017494559288, | |
| "epoch": 3.5632, | |
| "grad_norm": 0.00992864090949297, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6386250853538513, | |
| "mean_token_accuracy": 0.7408555001020432, | |
| "num_tokens": 20915060.0, | |
| "step": 559 | |
| }, | |
| { | |
| "entropy": 0.650281272828579, | |
| "epoch": 3.5696, | |
| "grad_norm": 0.008609931915998459, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6503854393959045, | |
| "mean_token_accuracy": 0.7330696955323219, | |
| "num_tokens": 20953081.0, | |
| "step": 560 | |
| }, | |
| { | |
| "entropy": 0.6279073059558868, | |
| "epoch": 3.576, | |
| "grad_norm": 0.01186640840023756, | |
| "learning_rate": 0.0002, | |
| "loss": 0.627372145652771, | |
| "mean_token_accuracy": 0.7447227090597153, | |
| "num_tokens": 20990338.0, | |
| "step": 561 | |
| }, | |
| { | |
| "entropy": 0.634159728884697, | |
| "epoch": 3.5824, | |
| "grad_norm": 0.008970306254923344, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6346087455749512, | |
| "mean_token_accuracy": 0.7415203601121902, | |
| "num_tokens": 21028096.0, | |
| "step": 562 | |
| }, | |
| { | |
| "entropy": 0.633803091943264, | |
| "epoch": 3.5888, | |
| "grad_norm": 0.011358493939042091, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6442689895629883, | |
| "mean_token_accuracy": 0.7374193891882896, | |
| "num_tokens": 21065835.0, | |
| "step": 563 | |
| }, | |
| { | |
| "entropy": 0.623796708881855, | |
| "epoch": 3.5952, | |
| "grad_norm": 0.011994842439889908, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6334537267684937, | |
| "mean_token_accuracy": 0.7415754497051239, | |
| "num_tokens": 21103469.0, | |
| "step": 564 | |
| }, | |
| { | |
| "entropy": 0.635470986366272, | |
| "epoch": 3.6016, | |
| "grad_norm": 0.009826122783124447, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6419943571090698, | |
| "mean_token_accuracy": 0.7378642708063126, | |
| "num_tokens": 21141513.0, | |
| "step": 565 | |
| }, | |
| { | |
| "entropy": 0.6463486775755882, | |
| "epoch": 3.608, | |
| "grad_norm": 0.010555503889918327, | |
| "learning_rate": 0.0002, | |
| "loss": 0.640326738357544, | |
| "mean_token_accuracy": 0.7372942119836807, | |
| "num_tokens": 21178927.0, | |
| "step": 566 | |
| }, | |
| { | |
| "entropy": 0.6457525193691254, | |
| "epoch": 3.6144, | |
| "grad_norm": 0.010458976030349731, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6402060985565186, | |
| "mean_token_accuracy": 0.7400226071476936, | |
| "num_tokens": 21216291.0, | |
| "step": 567 | |
| }, | |
| { | |
| "entropy": 0.633650466799736, | |
| "epoch": 3.6208, | |
| "grad_norm": 0.009390798397362232, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6331945657730103, | |
| "mean_token_accuracy": 0.7403992488980293, | |
| "num_tokens": 21253727.0, | |
| "step": 568 | |
| }, | |
| { | |
| "entropy": 0.632075347006321, | |
| "epoch": 3.6272, | |
| "grad_norm": 0.01025348249822855, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6355302333831787, | |
| "mean_token_accuracy": 0.7413225471973419, | |
| "num_tokens": 21291493.0, | |
| "step": 569 | |
| }, | |
| { | |
| "entropy": 0.6219524443149567, | |
| "epoch": 3.6336, | |
| "grad_norm": 0.011700067669153214, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6319601535797119, | |
| "mean_token_accuracy": 0.7412790209054947, | |
| "num_tokens": 21329474.0, | |
| "step": 570 | |
| }, | |
| { | |
| "entropy": 0.6328660994768143, | |
| "epoch": 3.64, | |
| "grad_norm": 0.009544705040752888, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6347973346710205, | |
| "mean_token_accuracy": 0.742459200322628, | |
| "num_tokens": 21367274.0, | |
| "step": 571 | |
| }, | |
| { | |
| "entropy": 0.6382363438606262, | |
| "epoch": 3.6464, | |
| "grad_norm": 0.009506464004516602, | |
| "learning_rate": 0.0002, | |
| "loss": 0.632327675819397, | |
| "mean_token_accuracy": 0.741349458694458, | |
| "num_tokens": 21405027.0, | |
| "step": 572 | |
| }, | |
| { | |
| "entropy": 0.6429821029305458, | |
| "epoch": 3.6528, | |
| "grad_norm": 0.008949574083089828, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6385926008224487, | |
| "mean_token_accuracy": 0.7412813901901245, | |
| "num_tokens": 21442485.0, | |
| "step": 573 | |
| }, | |
| { | |
| "entropy": 0.6392761990427971, | |
| "epoch": 3.6592000000000002, | |
| "grad_norm": 0.008819608017802238, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6387146711349487, | |
| "mean_token_accuracy": 0.7381789684295654, | |
| "num_tokens": 21480245.0, | |
| "step": 574 | |
| }, | |
| { | |
| "entropy": 0.6092662885785103, | |
| "epoch": 3.6656, | |
| "grad_norm": 0.009008620865643024, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6131871342658997, | |
| "mean_token_accuracy": 0.7484863623976707, | |
| "num_tokens": 21517658.0, | |
| "step": 575 | |
| }, | |
| { | |
| "entropy": 0.6172466725111008, | |
| "epoch": 3.672, | |
| "grad_norm": 0.008723135106265545, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6228119730949402, | |
| "mean_token_accuracy": 0.747119203209877, | |
| "num_tokens": 21555161.0, | |
| "step": 576 | |
| }, | |
| { | |
| "entropy": 0.6264480575919151, | |
| "epoch": 3.6784, | |
| "grad_norm": 0.008482584729790688, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6291134357452393, | |
| "mean_token_accuracy": 0.7445547953248024, | |
| "num_tokens": 21592408.0, | |
| "step": 577 | |
| }, | |
| { | |
| "entropy": 0.635237880051136, | |
| "epoch": 3.6848, | |
| "grad_norm": 0.00850406102836132, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6362268328666687, | |
| "mean_token_accuracy": 0.7393738552927971, | |
| "num_tokens": 21630282.0, | |
| "step": 578 | |
| }, | |
| { | |
| "entropy": 0.6200535595417023, | |
| "epoch": 3.6912000000000003, | |
| "grad_norm": 0.009778933599591255, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6221815347671509, | |
| "mean_token_accuracy": 0.7469090595841408, | |
| "num_tokens": 21667708.0, | |
| "step": 579 | |
| }, | |
| { | |
| "entropy": 0.63077662140131, | |
| "epoch": 3.6976, | |
| "grad_norm": 0.009218033403158188, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6323422193527222, | |
| "mean_token_accuracy": 0.7421467453241348, | |
| "num_tokens": 21705244.0, | |
| "step": 580 | |
| }, | |
| { | |
| "entropy": 0.6420226320624352, | |
| "epoch": 3.7039999999999997, | |
| "grad_norm": 0.009507461450994015, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6403417587280273, | |
| "mean_token_accuracy": 0.739894188940525, | |
| "num_tokens": 21743055.0, | |
| "step": 581 | |
| }, | |
| { | |
| "entropy": 0.6300998106598854, | |
| "epoch": 3.7104, | |
| "grad_norm": 0.009341172873973846, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6311365962028503, | |
| "mean_token_accuracy": 0.7414052486419678, | |
| "num_tokens": 21780375.0, | |
| "step": 582 | |
| }, | |
| { | |
| "entropy": 0.6306213289499283, | |
| "epoch": 3.7168, | |
| "grad_norm": 0.010440697893500328, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6373945474624634, | |
| "mean_token_accuracy": 0.7419358193874359, | |
| "num_tokens": 21817708.0, | |
| "step": 583 | |
| }, | |
| { | |
| "entropy": 0.6163543164730072, | |
| "epoch": 3.7232, | |
| "grad_norm": 0.009331561625003815, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6209964156150818, | |
| "mean_token_accuracy": 0.7463705316185951, | |
| "num_tokens": 21854937.0, | |
| "step": 584 | |
| }, | |
| { | |
| "entropy": 0.6321230009198189, | |
| "epoch": 3.7296, | |
| "grad_norm": 0.00952980387955904, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6340712308883667, | |
| "mean_token_accuracy": 0.7384133115410805, | |
| "num_tokens": 21892727.0, | |
| "step": 585 | |
| }, | |
| { | |
| "entropy": 0.6275918409228325, | |
| "epoch": 3.7359999999999998, | |
| "grad_norm": 0.009358996525406837, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6279775500297546, | |
| "mean_token_accuracy": 0.7420656681060791, | |
| "num_tokens": 21930361.0, | |
| "step": 586 | |
| }, | |
| { | |
| "entropy": 0.6374326348304749, | |
| "epoch": 3.7424, | |
| "grad_norm": 0.00851542316377163, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6387336254119873, | |
| "mean_token_accuracy": 0.7408188581466675, | |
| "num_tokens": 21967769.0, | |
| "step": 587 | |
| }, | |
| { | |
| "entropy": 0.6265183612704277, | |
| "epoch": 3.7488, | |
| "grad_norm": 0.010128417983651161, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6304729580879211, | |
| "mean_token_accuracy": 0.74308130890131, | |
| "num_tokens": 22005268.0, | |
| "step": 588 | |
| }, | |
| { | |
| "entropy": 0.6259055137634277, | |
| "epoch": 3.7552, | |
| "grad_norm": 0.00949757732450962, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6271415948867798, | |
| "mean_token_accuracy": 0.7445643469691277, | |
| "num_tokens": 22042740.0, | |
| "step": 589 | |
| }, | |
| { | |
| "entropy": 0.621527373790741, | |
| "epoch": 3.7616, | |
| "grad_norm": 0.011297403834760189, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6193302869796753, | |
| "mean_token_accuracy": 0.7481779083609581, | |
| "num_tokens": 22080705.0, | |
| "step": 590 | |
| }, | |
| { | |
| "entropy": 0.6351140215992928, | |
| "epoch": 3.768, | |
| "grad_norm": 0.01007875707000494, | |
| "learning_rate": 0.0002, | |
| "loss": 0.636103093624115, | |
| "mean_token_accuracy": 0.7403137609362602, | |
| "num_tokens": 22118187.0, | |
| "step": 591 | |
| }, | |
| { | |
| "entropy": 0.6164060086011887, | |
| "epoch": 3.7744, | |
| "grad_norm": 0.00851944275200367, | |
| "learning_rate": 0.0002, | |
| "loss": 0.620150089263916, | |
| "mean_token_accuracy": 0.7468870654702187, | |
| "num_tokens": 22155780.0, | |
| "step": 592 | |
| }, | |
| { | |
| "entropy": 0.6220516487956047, | |
| "epoch": 3.7808, | |
| "grad_norm": 0.011541093699634075, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6253345012664795, | |
| "mean_token_accuracy": 0.7459988221526146, | |
| "num_tokens": 22193401.0, | |
| "step": 593 | |
| }, | |
| { | |
| "entropy": 0.6525481268763542, | |
| "epoch": 3.7872, | |
| "grad_norm": 0.009819903410971165, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6519078016281128, | |
| "mean_token_accuracy": 0.7341204807162285, | |
| "num_tokens": 22230608.0, | |
| "step": 594 | |
| }, | |
| { | |
| "entropy": 0.6331318765878677, | |
| "epoch": 3.7936, | |
| "grad_norm": 0.010822438634932041, | |
| "learning_rate": 0.0002, | |
| "loss": 0.627253532409668, | |
| "mean_token_accuracy": 0.7452663481235504, | |
| "num_tokens": 22268376.0, | |
| "step": 595 | |
| }, | |
| { | |
| "entropy": 0.6378331705927849, | |
| "epoch": 3.8, | |
| "grad_norm": 0.010335801169276237, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6402156949043274, | |
| "mean_token_accuracy": 0.7388675063848495, | |
| "num_tokens": 22305874.0, | |
| "step": 596 | |
| }, | |
| { | |
| "entropy": 0.6241042613983154, | |
| "epoch": 3.8064, | |
| "grad_norm": 0.011212136596441269, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6346319913864136, | |
| "mean_token_accuracy": 0.7422374039888382, | |
| "num_tokens": 22343270.0, | |
| "step": 597 | |
| }, | |
| { | |
| "entropy": 0.6304724365472794, | |
| "epoch": 3.8128, | |
| "grad_norm": 0.010530945844948292, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6360510587692261, | |
| "mean_token_accuracy": 0.7418438643217087, | |
| "num_tokens": 22380767.0, | |
| "step": 598 | |
| }, | |
| { | |
| "entropy": 0.630512535572052, | |
| "epoch": 3.8192, | |
| "grad_norm": 0.01047790888696909, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6310948133468628, | |
| "mean_token_accuracy": 0.7418612614274025, | |
| "num_tokens": 22417973.0, | |
| "step": 599 | |
| }, | |
| { | |
| "entropy": 0.6289901584386826, | |
| "epoch": 3.8256, | |
| "grad_norm": 0.009985234588384628, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6236091256141663, | |
| "mean_token_accuracy": 0.745183065533638, | |
| "num_tokens": 22455401.0, | |
| "step": 600 | |
| }, | |
| { | |
| "entropy": 0.6390504911541939, | |
| "epoch": 3.832, | |
| "grad_norm": 0.009776836261153221, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6361709237098694, | |
| "mean_token_accuracy": 0.7415382042527199, | |
| "num_tokens": 22493019.0, | |
| "step": 601 | |
| }, | |
| { | |
| "entropy": 0.6260226741433144, | |
| "epoch": 3.8384, | |
| "grad_norm": 0.009412144310772419, | |
| "learning_rate": 0.0002, | |
| "loss": 0.62882399559021, | |
| "mean_token_accuracy": 0.7436661571264267, | |
| "num_tokens": 22530628.0, | |
| "step": 602 | |
| }, | |
| { | |
| "entropy": 0.6180827915668488, | |
| "epoch": 3.8448, | |
| "grad_norm": 0.009917755611240864, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6258498430252075, | |
| "mean_token_accuracy": 0.7454487532377243, | |
| "num_tokens": 22568202.0, | |
| "step": 603 | |
| }, | |
| { | |
| "entropy": 0.6200235038995743, | |
| "epoch": 3.8512, | |
| "grad_norm": 0.010199918411672115, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6277583837509155, | |
| "mean_token_accuracy": 0.7435891628265381, | |
| "num_tokens": 22605838.0, | |
| "step": 604 | |
| }, | |
| { | |
| "entropy": 0.6254613697528839, | |
| "epoch": 3.8576, | |
| "grad_norm": 0.009225446730852127, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6330975294113159, | |
| "mean_token_accuracy": 0.7417056709527969, | |
| "num_tokens": 22643315.0, | |
| "step": 605 | |
| }, | |
| { | |
| "entropy": 0.6374992206692696, | |
| "epoch": 3.864, | |
| "grad_norm": 0.009426961652934551, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6333073377609253, | |
| "mean_token_accuracy": 0.743529699742794, | |
| "num_tokens": 22681260.0, | |
| "step": 606 | |
| }, | |
| { | |
| "entropy": 0.6427751928567886, | |
| "epoch": 3.8704, | |
| "grad_norm": 0.01109833549708128, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6365841627120972, | |
| "mean_token_accuracy": 0.740449033677578, | |
| "num_tokens": 22718725.0, | |
| "step": 607 | |
| }, | |
| { | |
| "entropy": 0.6293874457478523, | |
| "epoch": 3.8768000000000002, | |
| "grad_norm": 0.009044543839991093, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6291689872741699, | |
| "mean_token_accuracy": 0.7439134269952774, | |
| "num_tokens": 22756018.0, | |
| "step": 608 | |
| }, | |
| { | |
| "entropy": 0.6215147376060486, | |
| "epoch": 3.8832, | |
| "grad_norm": 0.010903657414019108, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6296993494033813, | |
| "mean_token_accuracy": 0.7446267232298851, | |
| "num_tokens": 22793251.0, | |
| "step": 609 | |
| }, | |
| { | |
| "entropy": 0.6157297044992447, | |
| "epoch": 3.8895999999999997, | |
| "grad_norm": 0.010149014182388783, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6224344968795776, | |
| "mean_token_accuracy": 0.7450227364897728, | |
| "num_tokens": 22830782.0, | |
| "step": 610 | |
| }, | |
| { | |
| "entropy": 0.6204625591635704, | |
| "epoch": 3.896, | |
| "grad_norm": 0.008899394422769547, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6236724257469177, | |
| "mean_token_accuracy": 0.7457845434546471, | |
| "num_tokens": 22868292.0, | |
| "step": 611 | |
| }, | |
| { | |
| "entropy": 0.6289186328649521, | |
| "epoch": 3.9024, | |
| "grad_norm": 0.009715489111840725, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6255042552947998, | |
| "mean_token_accuracy": 0.743945874273777, | |
| "num_tokens": 22905960.0, | |
| "step": 612 | |
| }, | |
| { | |
| "entropy": 0.6272325441241264, | |
| "epoch": 3.9088000000000003, | |
| "grad_norm": 0.010841017588973045, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6241690516471863, | |
| "mean_token_accuracy": 0.7436103969812393, | |
| "num_tokens": 22943043.0, | |
| "step": 613 | |
| }, | |
| { | |
| "entropy": 0.6414704546332359, | |
| "epoch": 3.9152, | |
| "grad_norm": 0.009553831070661545, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6447999477386475, | |
| "mean_token_accuracy": 0.7391496151685715, | |
| "num_tokens": 22980557.0, | |
| "step": 614 | |
| }, | |
| { | |
| "entropy": 0.6307174563407898, | |
| "epoch": 3.9215999999999998, | |
| "grad_norm": 0.009158959612250328, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6336820721626282, | |
| "mean_token_accuracy": 0.7413525283336639, | |
| "num_tokens": 23018134.0, | |
| "step": 615 | |
| }, | |
| { | |
| "entropy": 0.6336700096726418, | |
| "epoch": 3.928, | |
| "grad_norm": 0.010397304780781269, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6412237882614136, | |
| "mean_token_accuracy": 0.7389427125453949, | |
| "num_tokens": 23055656.0, | |
| "step": 616 | |
| }, | |
| { | |
| "entropy": 0.6292953938245773, | |
| "epoch": 3.9344, | |
| "grad_norm": 0.009029161185026169, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6302052736282349, | |
| "mean_token_accuracy": 0.7432261779904366, | |
| "num_tokens": 23093414.0, | |
| "step": 617 | |
| }, | |
| { | |
| "entropy": 0.6511750519275665, | |
| "epoch": 3.9408, | |
| "grad_norm": 0.011078661307692528, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6470860242843628, | |
| "mean_token_accuracy": 0.7365722432732582, | |
| "num_tokens": 23131307.0, | |
| "step": 618 | |
| }, | |
| { | |
| "entropy": 0.640938051044941, | |
| "epoch": 3.9472, | |
| "grad_norm": 0.009597877971827984, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6369379758834839, | |
| "mean_token_accuracy": 0.7396447286009789, | |
| "num_tokens": 23168894.0, | |
| "step": 619 | |
| }, | |
| { | |
| "entropy": 0.6210119426250458, | |
| "epoch": 3.9536, | |
| "grad_norm": 0.010679766535758972, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6260274052619934, | |
| "mean_token_accuracy": 0.7466530501842499, | |
| "num_tokens": 23206378.0, | |
| "step": 620 | |
| }, | |
| { | |
| "entropy": 0.615054301917553, | |
| "epoch": 3.96, | |
| "grad_norm": 0.010784207843244076, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6229560375213623, | |
| "mean_token_accuracy": 0.7456069514155388, | |
| "num_tokens": 23243675.0, | |
| "step": 621 | |
| }, | |
| { | |
| "entropy": 0.6250587999820709, | |
| "epoch": 3.9664, | |
| "grad_norm": 0.009625584818422794, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6281651258468628, | |
| "mean_token_accuracy": 0.7444300353527069, | |
| "num_tokens": 23281000.0, | |
| "step": 622 | |
| }, | |
| { | |
| "entropy": 0.6295294389128685, | |
| "epoch": 3.9728, | |
| "grad_norm": 0.009764077141880989, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6305609941482544, | |
| "mean_token_accuracy": 0.7441380247473717, | |
| "num_tokens": 23318554.0, | |
| "step": 623 | |
| }, | |
| { | |
| "entropy": 0.619350254535675, | |
| "epoch": 3.9792, | |
| "grad_norm": 0.009161337278783321, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6201272010803223, | |
| "mean_token_accuracy": 0.7485333606600761, | |
| "num_tokens": 23355649.0, | |
| "step": 624 | |
| }, | |
| { | |
| "entropy": 0.6401965990662575, | |
| "epoch": 3.9856, | |
| "grad_norm": 0.010438468307256699, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6402089595794678, | |
| "mean_token_accuracy": 0.7383991852402687, | |
| "num_tokens": 23393568.0, | |
| "step": 625 | |
| }, | |
| { | |
| "entropy": 0.6330313384532928, | |
| "epoch": 3.992, | |
| "grad_norm": 0.009565716609358788, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6326834559440613, | |
| "mean_token_accuracy": 0.7425080984830856, | |
| "num_tokens": 23431086.0, | |
| "step": 626 | |
| }, | |
| { | |
| "entropy": 0.6277460902929306, | |
| "epoch": 3.9984, | |
| "grad_norm": 0.009916098788380623, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6327950954437256, | |
| "mean_token_accuracy": 0.7417906895279884, | |
| "num_tokens": 23468619.0, | |
| "step": 627 | |
| }, | |
| { | |
| "entropy": 0.6479776203632355, | |
| "epoch": 4.0, | |
| "grad_norm": 0.016998078674077988, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6533247828483582, | |
| "mean_token_accuracy": 0.7333799302577972, | |
| "num_tokens": 23477894.0, | |
| "step": 628 | |
| }, | |
| { | |
| "entropy": 0.6334798634052277, | |
| "epoch": 4.0064, | |
| "grad_norm": 0.011177260428667068, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6274731159210205, | |
| "mean_token_accuracy": 0.7418768331408501, | |
| "num_tokens": 23515512.0, | |
| "step": 629 | |
| }, | |
| { | |
| "entropy": 0.6426746100187302, | |
| "epoch": 4.0128, | |
| "grad_norm": 0.010523858480155468, | |
| "learning_rate": 0.0002, | |
| "loss": 0.639644980430603, | |
| "mean_token_accuracy": 0.738319605588913, | |
| "num_tokens": 23553199.0, | |
| "step": 630 | |
| }, | |
| { | |
| "entropy": 0.6350331977009773, | |
| "epoch": 4.0192, | |
| "grad_norm": 0.013215194456279278, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6405128836631775, | |
| "mean_token_accuracy": 0.739054262638092, | |
| "num_tokens": 23590684.0, | |
| "step": 631 | |
| }, | |
| { | |
| "entropy": 0.6201648041605949, | |
| "epoch": 4.0256, | |
| "grad_norm": 0.00981956534087658, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6236424446105957, | |
| "mean_token_accuracy": 0.7453638687729836, | |
| "num_tokens": 23628151.0, | |
| "step": 632 | |
| }, | |
| { | |
| "entropy": 0.6195686236023903, | |
| "epoch": 4.032, | |
| "grad_norm": 0.011942672543227673, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6226350665092468, | |
| "mean_token_accuracy": 0.7457711473107338, | |
| "num_tokens": 23665791.0, | |
| "step": 633 | |
| }, | |
| { | |
| "entropy": 0.621765486896038, | |
| "epoch": 4.0384, | |
| "grad_norm": 0.011674079112708569, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6212641000747681, | |
| "mean_token_accuracy": 0.7444254085421562, | |
| "num_tokens": 23703897.0, | |
| "step": 634 | |
| }, | |
| { | |
| "entropy": 0.6218401342630386, | |
| "epoch": 4.0448, | |
| "grad_norm": 0.011382197961211205, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6188787221908569, | |
| "mean_token_accuracy": 0.7439982444047928, | |
| "num_tokens": 23741726.0, | |
| "step": 635 | |
| }, | |
| { | |
| "entropy": 0.6302961930632591, | |
| "epoch": 4.0512, | |
| "grad_norm": 0.0122229540720582, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6310756802558899, | |
| "mean_token_accuracy": 0.7416332587599754, | |
| "num_tokens": 23779347.0, | |
| "step": 636 | |
| }, | |
| { | |
| "entropy": 0.6179258972406387, | |
| "epoch": 4.0576, | |
| "grad_norm": 0.013323783874511719, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6242649555206299, | |
| "mean_token_accuracy": 0.7424203455448151, | |
| "num_tokens": 23816946.0, | |
| "step": 637 | |
| }, | |
| { | |
| "entropy": 0.6160242184996605, | |
| "epoch": 4.064, | |
| "grad_norm": 0.011928076855838299, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6227492094039917, | |
| "mean_token_accuracy": 0.7461478784680367, | |
| "num_tokens": 23854267.0, | |
| "step": 638 | |
| }, | |
| { | |
| "entropy": 0.6243119761347771, | |
| "epoch": 4.0704, | |
| "grad_norm": 0.01218615286052227, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6247442960739136, | |
| "mean_token_accuracy": 0.7416555359959602, | |
| "num_tokens": 23891647.0, | |
| "step": 639 | |
| }, | |
| { | |
| "entropy": 0.6283975690603256, | |
| "epoch": 4.0768, | |
| "grad_norm": 0.011089140549302101, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6262081861495972, | |
| "mean_token_accuracy": 0.7418273463845253, | |
| "num_tokens": 23928978.0, | |
| "step": 640 | |
| }, | |
| { | |
| "entropy": 0.6230043172836304, | |
| "epoch": 4.0832, | |
| "grad_norm": 0.010514283552765846, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6210086345672607, | |
| "mean_token_accuracy": 0.7470921650528908, | |
| "num_tokens": 23966589.0, | |
| "step": 641 | |
| }, | |
| { | |
| "entropy": 0.6316242590546608, | |
| "epoch": 4.0896, | |
| "grad_norm": 0.010836183093488216, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6322799324989319, | |
| "mean_token_accuracy": 0.7397365495562553, | |
| "num_tokens": 24004549.0, | |
| "step": 642 | |
| }, | |
| { | |
| "entropy": 0.6093735992908478, | |
| "epoch": 4.096, | |
| "grad_norm": 0.010521575808525085, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6142085790634155, | |
| "mean_token_accuracy": 0.7481302842497826, | |
| "num_tokens": 24041703.0, | |
| "step": 643 | |
| }, | |
| { | |
| "entropy": 0.6217071115970612, | |
| "epoch": 4.1024, | |
| "grad_norm": 0.01190858706831932, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6301581859588623, | |
| "mean_token_accuracy": 0.7421037778258324, | |
| "num_tokens": 24079260.0, | |
| "step": 644 | |
| }, | |
| { | |
| "entropy": 0.6213275268673897, | |
| "epoch": 4.1088, | |
| "grad_norm": 0.010940197855234146, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6227558851242065, | |
| "mean_token_accuracy": 0.7450557425618172, | |
| "num_tokens": 24116868.0, | |
| "step": 645 | |
| }, | |
| { | |
| "entropy": 0.6183237135410309, | |
| "epoch": 4.1152, | |
| "grad_norm": 0.01106048934161663, | |
| "learning_rate": 0.0002, | |
| "loss": 0.62211012840271, | |
| "mean_token_accuracy": 0.7469884529709816, | |
| "num_tokens": 24154196.0, | |
| "step": 646 | |
| }, | |
| { | |
| "entropy": 0.6235630884766579, | |
| "epoch": 4.1216, | |
| "grad_norm": 0.01147097535431385, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6238754987716675, | |
| "mean_token_accuracy": 0.7457621321082115, | |
| "num_tokens": 24191940.0, | |
| "step": 647 | |
| }, | |
| { | |
| "entropy": 0.628976970911026, | |
| "epoch": 4.128, | |
| "grad_norm": 0.0103966249153018, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6279858946800232, | |
| "mean_token_accuracy": 0.7433076053857803, | |
| "num_tokens": 24229689.0, | |
| "step": 648 | |
| }, | |
| { | |
| "entropy": 0.6148188188672066, | |
| "epoch": 4.1344, | |
| "grad_norm": 0.012693977914750576, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6150864362716675, | |
| "mean_token_accuracy": 0.7493811547756195, | |
| "num_tokens": 24267208.0, | |
| "step": 649 | |
| }, | |
| { | |
| "entropy": 0.6325013488531113, | |
| "epoch": 4.1408, | |
| "grad_norm": 0.010917159728705883, | |
| "learning_rate": 0.0002, | |
| "loss": 0.629578709602356, | |
| "mean_token_accuracy": 0.742595799267292, | |
| "num_tokens": 24305147.0, | |
| "step": 650 | |
| }, | |
| { | |
| "entropy": 0.6269365176558495, | |
| "epoch": 4.1472, | |
| "grad_norm": 0.011673609726130962, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6288695931434631, | |
| "mean_token_accuracy": 0.7425840869545937, | |
| "num_tokens": 24342617.0, | |
| "step": 651 | |
| }, | |
| { | |
| "entropy": 0.6115541234612465, | |
| "epoch": 4.1536, | |
| "grad_norm": 0.012632826343178749, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6173226833343506, | |
| "mean_token_accuracy": 0.7491206377744675, | |
| "num_tokens": 24379680.0, | |
| "step": 652 | |
| }, | |
| { | |
| "entropy": 0.605757087469101, | |
| "epoch": 4.16, | |
| "grad_norm": 0.012048393487930298, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6072964668273926, | |
| "mean_token_accuracy": 0.7492575421929359, | |
| "num_tokens": 24416439.0, | |
| "step": 653 | |
| }, | |
| { | |
| "entropy": 0.6210080906748772, | |
| "epoch": 4.1664, | |
| "grad_norm": 0.010533303022384644, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6225767731666565, | |
| "mean_token_accuracy": 0.7443814054131508, | |
| "num_tokens": 24454195.0, | |
| "step": 654 | |
| }, | |
| { | |
| "entropy": 0.6205269917845726, | |
| "epoch": 4.1728, | |
| "grad_norm": 0.012937111780047417, | |
| "learning_rate": 0.0002, | |
| "loss": 0.621825635433197, | |
| "mean_token_accuracy": 0.7476101964712143, | |
| "num_tokens": 24491632.0, | |
| "step": 655 | |
| }, | |
| { | |
| "entropy": 0.6158983781933784, | |
| "epoch": 4.1792, | |
| "grad_norm": 0.011887785978615284, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6177083253860474, | |
| "mean_token_accuracy": 0.7477908208966255, | |
| "num_tokens": 24529207.0, | |
| "step": 656 | |
| }, | |
| { | |
| "entropy": 0.6310747787356377, | |
| "epoch": 4.1856, | |
| "grad_norm": 0.01170266792178154, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6338661313056946, | |
| "mean_token_accuracy": 0.7413427755236626, | |
| "num_tokens": 24566764.0, | |
| "step": 657 | |
| }, | |
| { | |
| "entropy": 0.632545068860054, | |
| "epoch": 4.192, | |
| "grad_norm": 0.012931435368955135, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6379810571670532, | |
| "mean_token_accuracy": 0.7372681424021721, | |
| "num_tokens": 24604691.0, | |
| "step": 658 | |
| }, | |
| { | |
| "entropy": 0.6272072345018387, | |
| "epoch": 4.1984, | |
| "grad_norm": 0.012254653498530388, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6317451000213623, | |
| "mean_token_accuracy": 0.7407561391592026, | |
| "num_tokens": 24642250.0, | |
| "step": 659 | |
| }, | |
| { | |
| "entropy": 0.6200175136327744, | |
| "epoch": 4.2048, | |
| "grad_norm": 0.012181897647678852, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6207621097564697, | |
| "mean_token_accuracy": 0.7452465370297432, | |
| "num_tokens": 24679770.0, | |
| "step": 660 | |
| }, | |
| { | |
| "entropy": 0.6108414232730865, | |
| "epoch": 4.2112, | |
| "grad_norm": 0.010735893622040749, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6087774038314819, | |
| "mean_token_accuracy": 0.7506056129932404, | |
| "num_tokens": 24717292.0, | |
| "step": 661 | |
| }, | |
| { | |
| "entropy": 0.6238648667931557, | |
| "epoch": 4.2176, | |
| "grad_norm": 0.010975925251841545, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6241613626480103, | |
| "mean_token_accuracy": 0.7450825273990631, | |
| "num_tokens": 24754935.0, | |
| "step": 662 | |
| }, | |
| { | |
| "entropy": 0.6437125504016876, | |
| "epoch": 4.224, | |
| "grad_norm": 0.01447360310703516, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6416766047477722, | |
| "mean_token_accuracy": 0.7382775098085403, | |
| "num_tokens": 24792852.0, | |
| "step": 663 | |
| }, | |
| { | |
| "entropy": 0.6239062771201134, | |
| "epoch": 4.2304, | |
| "grad_norm": 0.014347578398883343, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6313333511352539, | |
| "mean_token_accuracy": 0.7430859357118607, | |
| "num_tokens": 24830405.0, | |
| "step": 664 | |
| }, | |
| { | |
| "entropy": 0.622043676674366, | |
| "epoch": 4.2368, | |
| "grad_norm": 0.01144686434417963, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6238901615142822, | |
| "mean_token_accuracy": 0.7450033724308014, | |
| "num_tokens": 24867891.0, | |
| "step": 665 | |
| }, | |
| { | |
| "entropy": 0.6423631235957146, | |
| "epoch": 4.2432, | |
| "grad_norm": 0.012929810211062431, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6390476226806641, | |
| "mean_token_accuracy": 0.7388838231563568, | |
| "num_tokens": 24905463.0, | |
| "step": 666 | |
| }, | |
| { | |
| "entropy": 0.6159037128090858, | |
| "epoch": 4.2496, | |
| "grad_norm": 0.012308385223150253, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6162548065185547, | |
| "mean_token_accuracy": 0.7489078938961029, | |
| "num_tokens": 24942905.0, | |
| "step": 667 | |
| }, | |
| { | |
| "entropy": 0.6265198811888695, | |
| "epoch": 4.256, | |
| "grad_norm": 0.01269616186618805, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6306416988372803, | |
| "mean_token_accuracy": 0.7422251328825951, | |
| "num_tokens": 24980486.0, | |
| "step": 668 | |
| }, | |
| { | |
| "entropy": 0.6116967797279358, | |
| "epoch": 4.2624, | |
| "grad_norm": 0.012161326594650745, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6166009902954102, | |
| "mean_token_accuracy": 0.747859038412571, | |
| "num_tokens": 25018467.0, | |
| "step": 669 | |
| }, | |
| { | |
| "entropy": 0.6185164824128151, | |
| "epoch": 4.2688, | |
| "grad_norm": 0.012251926586031914, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6215794682502747, | |
| "mean_token_accuracy": 0.7451242059469223, | |
| "num_tokens": 25056006.0, | |
| "step": 670 | |
| }, | |
| { | |
| "entropy": 0.6283984705805779, | |
| "epoch": 4.2752, | |
| "grad_norm": 0.011603674851357937, | |
| "learning_rate": 0.0002, | |
| "loss": 0.627375066280365, | |
| "mean_token_accuracy": 0.7432128861546516, | |
| "num_tokens": 25093408.0, | |
| "step": 671 | |
| }, | |
| { | |
| "entropy": 0.609025202691555, | |
| "epoch": 4.2816, | |
| "grad_norm": 0.011993130668997765, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6099145412445068, | |
| "mean_token_accuracy": 0.7511600032448769, | |
| "num_tokens": 25130524.0, | |
| "step": 672 | |
| }, | |
| { | |
| "entropy": 0.6234938055276871, | |
| "epoch": 4.288, | |
| "grad_norm": 0.010231442749500275, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6248447299003601, | |
| "mean_token_accuracy": 0.7447694912552834, | |
| "num_tokens": 25168063.0, | |
| "step": 673 | |
| }, | |
| { | |
| "entropy": 0.6148969978094101, | |
| "epoch": 4.2943999999999996, | |
| "grad_norm": 0.012821062467992306, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6163221001625061, | |
| "mean_token_accuracy": 0.7478527128696442, | |
| "num_tokens": 25205806.0, | |
| "step": 674 | |
| }, | |
| { | |
| "entropy": 0.6235463097691536, | |
| "epoch": 4.3008, | |
| "grad_norm": 0.012431120499968529, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6214525699615479, | |
| "mean_token_accuracy": 0.744065910577774, | |
| "num_tokens": 25243417.0, | |
| "step": 675 | |
| }, | |
| { | |
| "entropy": 0.6208379119634628, | |
| "epoch": 4.3072, | |
| "grad_norm": 0.011580659076571465, | |
| "learning_rate": 0.0002, | |
| "loss": 0.626810610294342, | |
| "mean_token_accuracy": 0.7434930577874184, | |
| "num_tokens": 25281000.0, | |
| "step": 676 | |
| }, | |
| { | |
| "entropy": 0.6189445853233337, | |
| "epoch": 4.3136, | |
| "grad_norm": 0.013887791894376278, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6251901388168335, | |
| "mean_token_accuracy": 0.7435762509703636, | |
| "num_tokens": 25318324.0, | |
| "step": 677 | |
| }, | |
| { | |
| "entropy": 0.623921662569046, | |
| "epoch": 4.32, | |
| "grad_norm": 0.011908493936061859, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6203892230987549, | |
| "mean_token_accuracy": 0.7473464608192444, | |
| "num_tokens": 25356360.0, | |
| "step": 678 | |
| }, | |
| { | |
| "entropy": 0.631057970225811, | |
| "epoch": 4.3264, | |
| "grad_norm": 0.013283537700772285, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6287419199943542, | |
| "mean_token_accuracy": 0.7408920601010323, | |
| "num_tokens": 25393819.0, | |
| "step": 679 | |
| }, | |
| { | |
| "entropy": 0.6219344884157181, | |
| "epoch": 4.3328, | |
| "grad_norm": 0.011869650334119797, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6282262802124023, | |
| "mean_token_accuracy": 0.7440148293972015, | |
| "num_tokens": 25431318.0, | |
| "step": 680 | |
| }, | |
| { | |
| "entropy": 0.6188084334135056, | |
| "epoch": 4.3392, | |
| "grad_norm": 0.010526369325816631, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6230930685997009, | |
| "mean_token_accuracy": 0.7453781887888908, | |
| "num_tokens": 25468847.0, | |
| "step": 681 | |
| }, | |
| { | |
| "entropy": 0.6212713718414307, | |
| "epoch": 4.3456, | |
| "grad_norm": 0.011861243285238743, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6226496696472168, | |
| "mean_token_accuracy": 0.745365597307682, | |
| "num_tokens": 25506347.0, | |
| "step": 682 | |
| }, | |
| { | |
| "entropy": 0.6259190738201141, | |
| "epoch": 4.352, | |
| "grad_norm": 0.010720842517912388, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6282031536102295, | |
| "mean_token_accuracy": 0.7432122975587845, | |
| "num_tokens": 25543772.0, | |
| "step": 683 | |
| }, | |
| { | |
| "entropy": 0.6237253770232201, | |
| "epoch": 4.3584, | |
| "grad_norm": 0.01095424685627222, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6262202262878418, | |
| "mean_token_accuracy": 0.7435847371816635, | |
| "num_tokens": 25581352.0, | |
| "step": 684 | |
| }, | |
| { | |
| "entropy": 0.6245952621102333, | |
| "epoch": 4.3648, | |
| "grad_norm": 0.010688689537346363, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6216722726821899, | |
| "mean_token_accuracy": 0.7473671957850456, | |
| "num_tokens": 25619317.0, | |
| "step": 685 | |
| }, | |
| { | |
| "entropy": 0.6425120159983635, | |
| "epoch": 4.3712, | |
| "grad_norm": 0.011959290131926537, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6369903087615967, | |
| "mean_token_accuracy": 0.7412149682641029, | |
| "num_tokens": 25657031.0, | |
| "step": 686 | |
| }, | |
| { | |
| "entropy": 0.6215310096740723, | |
| "epoch": 4.3776, | |
| "grad_norm": 0.01260219793766737, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6221766471862793, | |
| "mean_token_accuracy": 0.7461507469415665, | |
| "num_tokens": 25694491.0, | |
| "step": 687 | |
| }, | |
| { | |
| "entropy": 0.6162081435322762, | |
| "epoch": 4.384, | |
| "grad_norm": 0.011745546013116837, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6214650869369507, | |
| "mean_token_accuracy": 0.7467240393161774, | |
| "num_tokens": 25731722.0, | |
| "step": 688 | |
| }, | |
| { | |
| "entropy": 0.6213862374424934, | |
| "epoch": 4.3904, | |
| "grad_norm": 0.012498460710048676, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6276631355285645, | |
| "mean_token_accuracy": 0.7429244071245193, | |
| "num_tokens": 25769429.0, | |
| "step": 689 | |
| }, | |
| { | |
| "entropy": 0.6275434419512749, | |
| "epoch": 4.3968, | |
| "grad_norm": 0.012363743036985397, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6299156546592712, | |
| "mean_token_accuracy": 0.742164358496666, | |
| "num_tokens": 25807155.0, | |
| "step": 690 | |
| }, | |
| { | |
| "entropy": 0.6255523934960365, | |
| "epoch": 4.4032, | |
| "grad_norm": 0.012337331660091877, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6276605725288391, | |
| "mean_token_accuracy": 0.7422888278961182, | |
| "num_tokens": 25844832.0, | |
| "step": 691 | |
| }, | |
| { | |
| "entropy": 0.618801973760128, | |
| "epoch": 4.4096, | |
| "grad_norm": 0.011720724403858185, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6215369701385498, | |
| "mean_token_accuracy": 0.7449894100427628, | |
| "num_tokens": 25882641.0, | |
| "step": 692 | |
| }, | |
| { | |
| "entropy": 0.6298277974128723, | |
| "epoch": 4.416, | |
| "grad_norm": 0.011312286369502544, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6291104555130005, | |
| "mean_token_accuracy": 0.7415849938988686, | |
| "num_tokens": 25920171.0, | |
| "step": 693 | |
| }, | |
| { | |
| "entropy": 0.6253160834312439, | |
| "epoch": 4.4224, | |
| "grad_norm": 0.011473000049591064, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6265097856521606, | |
| "mean_token_accuracy": 0.745900847017765, | |
| "num_tokens": 25957661.0, | |
| "step": 694 | |
| }, | |
| { | |
| "entropy": 0.6151653453707695, | |
| "epoch": 4.4288, | |
| "grad_norm": 0.011200590059161186, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6186162829399109, | |
| "mean_token_accuracy": 0.7460164353251457, | |
| "num_tokens": 25995288.0, | |
| "step": 695 | |
| }, | |
| { | |
| "entropy": 0.6358339488506317, | |
| "epoch": 4.4352, | |
| "grad_norm": 0.012506633065640926, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6417111158370972, | |
| "mean_token_accuracy": 0.7386213764548302, | |
| "num_tokens": 26033219.0, | |
| "step": 696 | |
| }, | |
| { | |
| "entropy": 0.6197969987988472, | |
| "epoch": 4.4416, | |
| "grad_norm": 0.009830954484641552, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6201560497283936, | |
| "mean_token_accuracy": 0.7456861957907677, | |
| "num_tokens": 26071131.0, | |
| "step": 697 | |
| }, | |
| { | |
| "entropy": 0.6429072171449661, | |
| "epoch": 4.448, | |
| "grad_norm": 0.011239229701459408, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6405913829803467, | |
| "mean_token_accuracy": 0.7353242784738541, | |
| "num_tokens": 26108632.0, | |
| "step": 698 | |
| }, | |
| { | |
| "entropy": 0.6173607632517815, | |
| "epoch": 4.4544, | |
| "grad_norm": 0.012541512958705425, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6168667078018188, | |
| "mean_token_accuracy": 0.7472453713417053, | |
| "num_tokens": 26145646.0, | |
| "step": 699 | |
| }, | |
| { | |
| "entropy": 0.6328746154904366, | |
| "epoch": 4.4608, | |
| "grad_norm": 0.011488271877169609, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6352975368499756, | |
| "mean_token_accuracy": 0.7387456595897675, | |
| "num_tokens": 26183067.0, | |
| "step": 700 | |
| }, | |
| { | |
| "entropy": 0.6217170506715775, | |
| "epoch": 4.4672, | |
| "grad_norm": 0.010990316979587078, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6259629726409912, | |
| "mean_token_accuracy": 0.7441816553473473, | |
| "num_tokens": 26220393.0, | |
| "step": 701 | |
| }, | |
| { | |
| "entropy": 0.609848141670227, | |
| "epoch": 4.4736, | |
| "grad_norm": 0.013483099639415741, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6171920299530029, | |
| "mean_token_accuracy": 0.7466985434293747, | |
| "num_tokens": 26257715.0, | |
| "step": 702 | |
| }, | |
| { | |
| "entropy": 0.6218430995941162, | |
| "epoch": 4.48, | |
| "grad_norm": 0.011730284430086613, | |
| "learning_rate": 0.0002, | |
| "loss": 0.623494565486908, | |
| "mean_token_accuracy": 0.7454787790775299, | |
| "num_tokens": 26295447.0, | |
| "step": 703 | |
| }, | |
| { | |
| "entropy": 0.620815634727478, | |
| "epoch": 4.4864, | |
| "grad_norm": 0.010400974191725254, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6193233132362366, | |
| "mean_token_accuracy": 0.7462346330285072, | |
| "num_tokens": 26332908.0, | |
| "step": 704 | |
| }, | |
| { | |
| "entropy": 0.6146924197673798, | |
| "epoch": 4.4928, | |
| "grad_norm": 0.01097558531910181, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6141451001167297, | |
| "mean_token_accuracy": 0.7498283833265305, | |
| "num_tokens": 26370265.0, | |
| "step": 705 | |
| }, | |
| { | |
| "entropy": 0.6297887563705444, | |
| "epoch": 4.4992, | |
| "grad_norm": 0.011810330674052238, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6298263669013977, | |
| "mean_token_accuracy": 0.7408022508025169, | |
| "num_tokens": 26407870.0, | |
| "step": 706 | |
| }, | |
| { | |
| "entropy": 0.6215150058269501, | |
| "epoch": 4.5056, | |
| "grad_norm": 0.009892682544887066, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6210182905197144, | |
| "mean_token_accuracy": 0.7464409321546555, | |
| "num_tokens": 26445509.0, | |
| "step": 707 | |
| }, | |
| { | |
| "entropy": 0.6281390488147736, | |
| "epoch": 4.5120000000000005, | |
| "grad_norm": 0.011692460626363754, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6285613179206848, | |
| "mean_token_accuracy": 0.7438349798321724, | |
| "num_tokens": 26483669.0, | |
| "step": 708 | |
| }, | |
| { | |
| "entropy": 0.6214175447821617, | |
| "epoch": 4.5184, | |
| "grad_norm": 0.011380224488675594, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6210340261459351, | |
| "mean_token_accuracy": 0.7459113150835037, | |
| "num_tokens": 26521265.0, | |
| "step": 709 | |
| }, | |
| { | |
| "entropy": 0.6104562729597092, | |
| "epoch": 4.5248, | |
| "grad_norm": 0.01076613087207079, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6165965795516968, | |
| "mean_token_accuracy": 0.7475461736321449, | |
| "num_tokens": 26558711.0, | |
| "step": 710 | |
| }, | |
| { | |
| "entropy": 0.6271610110998154, | |
| "epoch": 4.5312, | |
| "grad_norm": 0.010785672813653946, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6283934116363525, | |
| "mean_token_accuracy": 0.7444132044911385, | |
| "num_tokens": 26596482.0, | |
| "step": 711 | |
| }, | |
| { | |
| "entropy": 0.6205542087554932, | |
| "epoch": 4.5376, | |
| "grad_norm": 0.010699622333049774, | |
| "learning_rate": 0.0002, | |
| "loss": 0.61879563331604, | |
| "mean_token_accuracy": 0.7464459612965584, | |
| "num_tokens": 26634130.0, | |
| "step": 712 | |
| }, | |
| { | |
| "entropy": 0.6333268582820892, | |
| "epoch": 4.5440000000000005, | |
| "grad_norm": 0.01175402756780386, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6315722465515137, | |
| "mean_token_accuracy": 0.7412132248282433, | |
| "num_tokens": 26671733.0, | |
| "step": 713 | |
| }, | |
| { | |
| "entropy": 0.6141394674777985, | |
| "epoch": 4.5504, | |
| "grad_norm": 0.01065735798329115, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6193619966506958, | |
| "mean_token_accuracy": 0.7467841058969498, | |
| "num_tokens": 26708976.0, | |
| "step": 714 | |
| }, | |
| { | |
| "entropy": 0.6316620260477066, | |
| "epoch": 4.5568, | |
| "grad_norm": 0.01289924792945385, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6370086669921875, | |
| "mean_token_accuracy": 0.7389457300305367, | |
| "num_tokens": 26746597.0, | |
| "step": 715 | |
| }, | |
| { | |
| "entropy": 0.6334016472101212, | |
| "epoch": 4.5632, | |
| "grad_norm": 0.01159643568098545, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6357477307319641, | |
| "mean_token_accuracy": 0.7415767312049866, | |
| "num_tokens": 26784347.0, | |
| "step": 716 | |
| }, | |
| { | |
| "entropy": 0.6209512129426003, | |
| "epoch": 4.5696, | |
| "grad_norm": 0.012357997708022594, | |
| "learning_rate": 0.0002, | |
| "loss": 0.620951235294342, | |
| "mean_token_accuracy": 0.7445131912827492, | |
| "num_tokens": 26821369.0, | |
| "step": 717 | |
| }, | |
| { | |
| "entropy": 0.6184145584702492, | |
| "epoch": 4.576, | |
| "grad_norm": 0.011790684424340725, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6185816526412964, | |
| "mean_token_accuracy": 0.7467178478837013, | |
| "num_tokens": 26858658.0, | |
| "step": 718 | |
| }, | |
| { | |
| "entropy": 0.6372607722878456, | |
| "epoch": 4.5824, | |
| "grad_norm": 0.011222328059375286, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6393177509307861, | |
| "mean_token_accuracy": 0.7393923178315163, | |
| "num_tokens": 26896679.0, | |
| "step": 719 | |
| }, | |
| { | |
| "entropy": 0.6263199970126152, | |
| "epoch": 4.5888, | |
| "grad_norm": 0.01184337493032217, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6317442059516907, | |
| "mean_token_accuracy": 0.7412994503974915, | |
| "num_tokens": 26934191.0, | |
| "step": 720 | |
| }, | |
| { | |
| "entropy": 0.6313236430287361, | |
| "epoch": 4.5952, | |
| "grad_norm": 0.012818049639463425, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6400792002677917, | |
| "mean_token_accuracy": 0.7399108409881592, | |
| "num_tokens": 26971795.0, | |
| "step": 721 | |
| }, | |
| { | |
| "entropy": 0.6408603191375732, | |
| "epoch": 4.6016, | |
| "grad_norm": 0.011262350715696812, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6372708678245544, | |
| "mean_token_accuracy": 0.7409083321690559, | |
| "num_tokens": 27009541.0, | |
| "step": 722 | |
| }, | |
| { | |
| "entropy": 0.6237692162394524, | |
| "epoch": 4.608, | |
| "grad_norm": 0.01265136618167162, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6219276189804077, | |
| "mean_token_accuracy": 0.74643175303936, | |
| "num_tokens": 27047207.0, | |
| "step": 723 | |
| }, | |
| { | |
| "entropy": 0.6229505017399788, | |
| "epoch": 4.6144, | |
| "grad_norm": 0.01034928485751152, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6240932941436768, | |
| "mean_token_accuracy": 0.7452475875616074, | |
| "num_tokens": 27084670.0, | |
| "step": 724 | |
| }, | |
| { | |
| "entropy": 0.6106055229902267, | |
| "epoch": 4.6208, | |
| "grad_norm": 0.012862354516983032, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6164753437042236, | |
| "mean_token_accuracy": 0.7482388094067574, | |
| "num_tokens": 27122124.0, | |
| "step": 725 | |
| }, | |
| { | |
| "entropy": 0.6230287775397301, | |
| "epoch": 4.6272, | |
| "grad_norm": 0.012530112639069557, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6248811483383179, | |
| "mean_token_accuracy": 0.745893694460392, | |
| "num_tokens": 27159984.0, | |
| "step": 726 | |
| }, | |
| { | |
| "entropy": 0.6258671432733536, | |
| "epoch": 4.6336, | |
| "grad_norm": 0.011710980907082558, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6271563768386841, | |
| "mean_token_accuracy": 0.7450519576668739, | |
| "num_tokens": 27197583.0, | |
| "step": 727 | |
| }, | |
| { | |
| "entropy": 0.6244168281555176, | |
| "epoch": 4.64, | |
| "grad_norm": 0.012283277697861195, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6260854005813599, | |
| "mean_token_accuracy": 0.7433378919959068, | |
| "num_tokens": 27235084.0, | |
| "step": 728 | |
| }, | |
| { | |
| "entropy": 0.6399951577186584, | |
| "epoch": 4.6464, | |
| "grad_norm": 0.010510124266147614, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6376748085021973, | |
| "mean_token_accuracy": 0.7380894720554352, | |
| "num_tokens": 27272833.0, | |
| "step": 729 | |
| }, | |
| { | |
| "entropy": 0.6234357804059982, | |
| "epoch": 4.6528, | |
| "grad_norm": 0.014871729537844658, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6165429353713989, | |
| "mean_token_accuracy": 0.7468608766794205, | |
| "num_tokens": 27310301.0, | |
| "step": 730 | |
| }, | |
| { | |
| "entropy": 0.6247937902808189, | |
| "epoch": 4.6592, | |
| "grad_norm": 0.010685059241950512, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6294916868209839, | |
| "mean_token_accuracy": 0.7414043098688126, | |
| "num_tokens": 27347720.0, | |
| "step": 731 | |
| }, | |
| { | |
| "entropy": 0.6104548647999763, | |
| "epoch": 4.6655999999999995, | |
| "grad_norm": 0.018121415749192238, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6216402053833008, | |
| "mean_token_accuracy": 0.7466417998075485, | |
| "num_tokens": 27385336.0, | |
| "step": 732 | |
| }, | |
| { | |
| "entropy": 0.6151935011148453, | |
| "epoch": 4.672, | |
| "grad_norm": 0.010607750155031681, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6190038323402405, | |
| "mean_token_accuracy": 0.7471088394522667, | |
| "num_tokens": 27422696.0, | |
| "step": 733 | |
| }, | |
| { | |
| "entropy": 0.625689759850502, | |
| "epoch": 4.6784, | |
| "grad_norm": 0.014054366387426853, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6243985295295715, | |
| "mean_token_accuracy": 0.7436644211411476, | |
| "num_tokens": 27460268.0, | |
| "step": 734 | |
| }, | |
| { | |
| "entropy": 0.6268169730901718, | |
| "epoch": 4.6848, | |
| "grad_norm": 0.012450247071683407, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6240094900131226, | |
| "mean_token_accuracy": 0.743643693625927, | |
| "num_tokens": 27498085.0, | |
| "step": 735 | |
| }, | |
| { | |
| "entropy": 0.6271230131387711, | |
| "epoch": 4.6912, | |
| "grad_norm": 0.011883650906383991, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6317532062530518, | |
| "mean_token_accuracy": 0.7423899173736572, | |
| "num_tokens": 27535478.0, | |
| "step": 736 | |
| }, | |
| { | |
| "entropy": 0.6135580986738205, | |
| "epoch": 4.6975999999999996, | |
| "grad_norm": 0.014882571063935757, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6232122182846069, | |
| "mean_token_accuracy": 0.7451476007699966, | |
| "num_tokens": 27572692.0, | |
| "step": 737 | |
| }, | |
| { | |
| "entropy": 0.6177224218845367, | |
| "epoch": 4.704, | |
| "grad_norm": 0.011081320233643055, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6193344593048096, | |
| "mean_token_accuracy": 0.7470099404454231, | |
| "num_tokens": 27610526.0, | |
| "step": 738 | |
| }, | |
| { | |
| "entropy": 0.618368849158287, | |
| "epoch": 4.7104, | |
| "grad_norm": 0.01142704114317894, | |
| "learning_rate": 0.0002, | |
| "loss": 0.618331789970398, | |
| "mean_token_accuracy": 0.7472382485866547, | |
| "num_tokens": 27648029.0, | |
| "step": 739 | |
| }, | |
| { | |
| "entropy": 0.6240565925836563, | |
| "epoch": 4.7168, | |
| "grad_norm": 0.011985547840595245, | |
| "learning_rate": 0.0002, | |
| "loss": 0.624761700630188, | |
| "mean_token_accuracy": 0.7442751675844193, | |
| "num_tokens": 27685924.0, | |
| "step": 740 | |
| }, | |
| { | |
| "entropy": 0.6319902166724205, | |
| "epoch": 4.7232, | |
| "grad_norm": 0.012069285847246647, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6318994164466858, | |
| "mean_token_accuracy": 0.739115908741951, | |
| "num_tokens": 27723816.0, | |
| "step": 741 | |
| }, | |
| { | |
| "entropy": 0.6412005797028542, | |
| "epoch": 4.7296, | |
| "grad_norm": 0.01274879090487957, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6381031274795532, | |
| "mean_token_accuracy": 0.7396308556199074, | |
| "num_tokens": 27761867.0, | |
| "step": 742 | |
| }, | |
| { | |
| "entropy": 0.6192675158381462, | |
| "epoch": 4.736, | |
| "grad_norm": 0.00995372049510479, | |
| "learning_rate": 0.0002, | |
| "loss": 0.62370765209198, | |
| "mean_token_accuracy": 0.7466439455747604, | |
| "num_tokens": 27799496.0, | |
| "step": 743 | |
| }, | |
| { | |
| "entropy": 0.6180000007152557, | |
| "epoch": 4.7424, | |
| "grad_norm": 0.012485142797231674, | |
| "learning_rate": 0.0002, | |
| "loss": 0.618539035320282, | |
| "mean_token_accuracy": 0.7472988590598106, | |
| "num_tokens": 27836904.0, | |
| "step": 744 | |
| }, | |
| { | |
| "entropy": 0.6233759000897408, | |
| "epoch": 4.7488, | |
| "grad_norm": 0.01297292672097683, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6253551244735718, | |
| "mean_token_accuracy": 0.743793860077858, | |
| "num_tokens": 27874562.0, | |
| "step": 745 | |
| }, | |
| { | |
| "entropy": 0.6195263043045998, | |
| "epoch": 4.7552, | |
| "grad_norm": 0.013405952602624893, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6302239298820496, | |
| "mean_token_accuracy": 0.7412486523389816, | |
| "num_tokens": 27911903.0, | |
| "step": 746 | |
| }, | |
| { | |
| "entropy": 0.6423712894320488, | |
| "epoch": 4.7616, | |
| "grad_norm": 0.011862635612487793, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6428091526031494, | |
| "mean_token_accuracy": 0.735967144370079, | |
| "num_tokens": 27949551.0, | |
| "step": 747 | |
| }, | |
| { | |
| "entropy": 0.6365993991494179, | |
| "epoch": 4.768, | |
| "grad_norm": 0.011519255116581917, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6331340074539185, | |
| "mean_token_accuracy": 0.7445235848426819, | |
| "num_tokens": 27987167.0, | |
| "step": 748 | |
| }, | |
| { | |
| "entropy": 0.6285323649644852, | |
| "epoch": 4.7744, | |
| "grad_norm": 0.011068753898143768, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6295030117034912, | |
| "mean_token_accuracy": 0.7423546016216278, | |
| "num_tokens": 28024667.0, | |
| "step": 749 | |
| }, | |
| { | |
| "entropy": 0.6225018426775932, | |
| "epoch": 4.7808, | |
| "grad_norm": 0.012251611799001694, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6240028142929077, | |
| "mean_token_accuracy": 0.7458074688911438, | |
| "num_tokens": 28062045.0, | |
| "step": 750 | |
| }, | |
| { | |
| "entropy": 0.6218413189053535, | |
| "epoch": 4.7872, | |
| "grad_norm": 0.011230433359742165, | |
| "learning_rate": 0.0002, | |
| "loss": 0.625887393951416, | |
| "mean_token_accuracy": 0.7432527989149094, | |
| "num_tokens": 28099618.0, | |
| "step": 751 | |
| }, | |
| { | |
| "entropy": 0.605789877474308, | |
| "epoch": 4.7936, | |
| "grad_norm": 0.01227335911244154, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6102015376091003, | |
| "mean_token_accuracy": 0.7511238679289818, | |
| "num_tokens": 28137039.0, | |
| "step": 752 | |
| }, | |
| { | |
| "entropy": 0.6157144531607628, | |
| "epoch": 4.8, | |
| "grad_norm": 0.01124510820955038, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6144552230834961, | |
| "mean_token_accuracy": 0.7501148656010628, | |
| "num_tokens": 28174015.0, | |
| "step": 753 | |
| }, | |
| { | |
| "entropy": 0.6372276619076729, | |
| "epoch": 4.8064, | |
| "grad_norm": 0.012294857762753963, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6344669461250305, | |
| "mean_token_accuracy": 0.7430569604039192, | |
| "num_tokens": 28211765.0, | |
| "step": 754 | |
| }, | |
| { | |
| "entropy": 0.618014894425869, | |
| "epoch": 4.8128, | |
| "grad_norm": 0.01041495706886053, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6209543943405151, | |
| "mean_token_accuracy": 0.7452011853456497, | |
| "num_tokens": 28249441.0, | |
| "step": 755 | |
| }, | |
| { | |
| "entropy": 0.6153213605284691, | |
| "epoch": 4.8192, | |
| "grad_norm": 0.012670926749706268, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6228734254837036, | |
| "mean_token_accuracy": 0.7460622638463974, | |
| "num_tokens": 28286854.0, | |
| "step": 756 | |
| }, | |
| { | |
| "entropy": 0.6158452033996582, | |
| "epoch": 4.8256, | |
| "grad_norm": 0.012129560112953186, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6199190020561218, | |
| "mean_token_accuracy": 0.747655563056469, | |
| "num_tokens": 28323945.0, | |
| "step": 757 | |
| }, | |
| { | |
| "entropy": 0.6290484443306923, | |
| "epoch": 4.832, | |
| "grad_norm": 0.01301377359777689, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6258755922317505, | |
| "mean_token_accuracy": 0.7452258318662643, | |
| "num_tokens": 28361641.0, | |
| "step": 758 | |
| }, | |
| { | |
| "entropy": 0.634510226547718, | |
| "epoch": 4.8384, | |
| "grad_norm": 0.011934357695281506, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6296937465667725, | |
| "mean_token_accuracy": 0.742583654820919, | |
| "num_tokens": 28399119.0, | |
| "step": 759 | |
| }, | |
| { | |
| "entropy": 0.6339060291647911, | |
| "epoch": 4.8448, | |
| "grad_norm": 0.010478752665221691, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6356696486473083, | |
| "mean_token_accuracy": 0.7409758344292641, | |
| "num_tokens": 28436921.0, | |
| "step": 760 | |
| }, | |
| { | |
| "entropy": 0.6190384924411774, | |
| "epoch": 4.8512, | |
| "grad_norm": 0.013402252458035946, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6263437271118164, | |
| "mean_token_accuracy": 0.7457704097032547, | |
| "num_tokens": 28474709.0, | |
| "step": 761 | |
| }, | |
| { | |
| "entropy": 0.6296346411108971, | |
| "epoch": 4.8576, | |
| "grad_norm": 0.01403774507343769, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6382781267166138, | |
| "mean_token_accuracy": 0.740397572517395, | |
| "num_tokens": 28512263.0, | |
| "step": 762 | |
| }, | |
| { | |
| "entropy": 0.6387407630681992, | |
| "epoch": 4.864, | |
| "grad_norm": 0.010807156562805176, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6353914141654968, | |
| "mean_token_accuracy": 0.7394013479351997, | |
| "num_tokens": 28549975.0, | |
| "step": 763 | |
| }, | |
| { | |
| "entropy": 0.6354725807905197, | |
| "epoch": 4.8704, | |
| "grad_norm": 0.013257911428809166, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6323150396347046, | |
| "mean_token_accuracy": 0.7414470240473747, | |
| "num_tokens": 28587095.0, | |
| "step": 764 | |
| }, | |
| { | |
| "entropy": 0.6424222439527512, | |
| "epoch": 4.8768, | |
| "grad_norm": 0.012375367805361748, | |
| "learning_rate": 0.0002, | |
| "loss": 0.64325350522995, | |
| "mean_token_accuracy": 0.7369028478860855, | |
| "num_tokens": 28624868.0, | |
| "step": 765 | |
| }, | |
| { | |
| "entropy": 0.6223215311765671, | |
| "epoch": 4.8832, | |
| "grad_norm": 0.013609180226922035, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6308131217956543, | |
| "mean_token_accuracy": 0.7428993359208107, | |
| "num_tokens": 28662266.0, | |
| "step": 766 | |
| }, | |
| { | |
| "entropy": 0.6198636963963509, | |
| "epoch": 4.8896, | |
| "grad_norm": 0.011831787414848804, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6238384246826172, | |
| "mean_token_accuracy": 0.7449830919504166, | |
| "num_tokens": 28700199.0, | |
| "step": 767 | |
| }, | |
| { | |
| "entropy": 0.6371955797076225, | |
| "epoch": 4.896, | |
| "grad_norm": 0.011555573903024197, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6325588822364807, | |
| "mean_token_accuracy": 0.7409590929746628, | |
| "num_tokens": 28737979.0, | |
| "step": 768 | |
| }, | |
| { | |
| "entropy": 0.6182679012417793, | |
| "epoch": 4.9024, | |
| "grad_norm": 0.01133381575345993, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6179029941558838, | |
| "mean_token_accuracy": 0.7483383342623711, | |
| "num_tokens": 28775432.0, | |
| "step": 769 | |
| }, | |
| { | |
| "entropy": 0.6291498392820358, | |
| "epoch": 4.9088, | |
| "grad_norm": 0.010519672185182571, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6308712363243103, | |
| "mean_token_accuracy": 0.7437527477741241, | |
| "num_tokens": 28812536.0, | |
| "step": 770 | |
| }, | |
| { | |
| "entropy": 0.6246335506439209, | |
| "epoch": 4.9152000000000005, | |
| "grad_norm": 0.013134768232703209, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6342728734016418, | |
| "mean_token_accuracy": 0.7407044470310211, | |
| "num_tokens": 28850060.0, | |
| "step": 771 | |
| }, | |
| { | |
| "entropy": 0.6130682453513145, | |
| "epoch": 4.9216, | |
| "grad_norm": 0.010492725297808647, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6162416934967041, | |
| "mean_token_accuracy": 0.7491699755191803, | |
| "num_tokens": 28887643.0, | |
| "step": 772 | |
| }, | |
| { | |
| "entropy": 0.6313211023807526, | |
| "epoch": 4.928, | |
| "grad_norm": 0.011192471720278263, | |
| "learning_rate": 0.0002, | |
| "loss": 0.631119966506958, | |
| "mean_token_accuracy": 0.741656944155693, | |
| "num_tokens": 28925297.0, | |
| "step": 773 | |
| }, | |
| { | |
| "entropy": 0.6132954135537148, | |
| "epoch": 4.9344, | |
| "grad_norm": 0.00988168828189373, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6083347201347351, | |
| "mean_token_accuracy": 0.7506287023425102, | |
| "num_tokens": 28962437.0, | |
| "step": 774 | |
| }, | |
| { | |
| "entropy": 0.6186309084296227, | |
| "epoch": 4.9408, | |
| "grad_norm": 0.011386038735508919, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6201795339584351, | |
| "mean_token_accuracy": 0.7484031617641449, | |
| "num_tokens": 28999874.0, | |
| "step": 775 | |
| }, | |
| { | |
| "entropy": 0.6235462054610252, | |
| "epoch": 4.9472000000000005, | |
| "grad_norm": 0.011064821854233742, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6267992258071899, | |
| "mean_token_accuracy": 0.7443990632891655, | |
| "num_tokens": 29037497.0, | |
| "step": 776 | |
| }, | |
| { | |
| "entropy": 0.6196893155574799, | |
| "epoch": 4.9536, | |
| "grad_norm": 0.012706468813121319, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6288238763809204, | |
| "mean_token_accuracy": 0.7432743161916733, | |
| "num_tokens": 29074815.0, | |
| "step": 777 | |
| }, | |
| { | |
| "entropy": 0.6359954103827477, | |
| "epoch": 4.96, | |
| "grad_norm": 0.01185152493417263, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6353201866149902, | |
| "mean_token_accuracy": 0.7408851012587547, | |
| "num_tokens": 29112518.0, | |
| "step": 778 | |
| }, | |
| { | |
| "entropy": 0.6222160458564758, | |
| "epoch": 4.9664, | |
| "grad_norm": 0.011700387112796307, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6173217296600342, | |
| "mean_token_accuracy": 0.7465430647134781, | |
| "num_tokens": 29150199.0, | |
| "step": 779 | |
| }, | |
| { | |
| "entropy": 0.6329935416579247, | |
| "epoch": 4.9728, | |
| "grad_norm": 0.011351538822054863, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6344210505485535, | |
| "mean_token_accuracy": 0.7397899106144905, | |
| "num_tokens": 29187985.0, | |
| "step": 780 | |
| }, | |
| { | |
| "entropy": 0.6197427585721016, | |
| "epoch": 4.9792, | |
| "grad_norm": 0.013295335695147514, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6274314522743225, | |
| "mean_token_accuracy": 0.742200955748558, | |
| "num_tokens": 29225578.0, | |
| "step": 781 | |
| }, | |
| { | |
| "entropy": 0.6366394832730293, | |
| "epoch": 4.9856, | |
| "grad_norm": 0.011197940446436405, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6420581340789795, | |
| "mean_token_accuracy": 0.7372548654675484, | |
| "num_tokens": 29263081.0, | |
| "step": 782 | |
| }, | |
| { | |
| "entropy": 0.623991571366787, | |
| "epoch": 4.992, | |
| "grad_norm": 0.012578215450048447, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6253401041030884, | |
| "mean_token_accuracy": 0.7438567355275154, | |
| "num_tokens": 29300476.0, | |
| "step": 783 | |
| }, | |
| { | |
| "entropy": 0.6156981587409973, | |
| "epoch": 4.9984, | |
| "grad_norm": 0.010751175694167614, | |
| "learning_rate": 0.0002, | |
| "loss": 0.616902232170105, | |
| "mean_token_accuracy": 0.7490730434656143, | |
| "num_tokens": 29337892.0, | |
| "step": 784 | |
| }, | |
| { | |
| "entropy": 0.6212073564529419, | |
| "epoch": 5.0, | |
| "grad_norm": 0.0221311803907156, | |
| "learning_rate": 0.0002, | |
| "loss": 0.6252682209014893, | |
| "mean_token_accuracy": 0.7461582720279694, | |
| "num_tokens": 29347371.0, | |
| "step": 785 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 785, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 5, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 2.7322491635624837e+18, | |
| "train_batch_size": 4, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |