{ "best_metric": null, "best_model_checkpoint": null, "epoch": 0.9965635738831615, "eval_steps": 500, "global_step": 145, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.01, "grad_norm": 0.37809523940086365, "learning_rate": 2e-05, "loss": 1.7814, "step": 1 }, { "epoch": 0.01, "grad_norm": 0.366623193025589, "learning_rate": 4e-05, "loss": 1.69, "step": 2 }, { "epoch": 0.02, "grad_norm": 0.3546508848667145, "learning_rate": 6e-05, "loss": 1.7151, "step": 3 }, { "epoch": 0.03, "grad_norm": 0.36381417512893677, "learning_rate": 8e-05, "loss": 1.6609, "step": 4 }, { "epoch": 0.03, "grad_norm": 0.4049898684024811, "learning_rate": 0.0001, "loss": 1.752, "step": 5 }, { "epoch": 0.04, "grad_norm": 0.4318874478340149, "learning_rate": 0.00012, "loss": 1.747, "step": 6 }, { "epoch": 0.05, "grad_norm": 0.39768990874290466, "learning_rate": 0.00014, "loss": 1.4432, "step": 7 }, { "epoch": 0.05, "grad_norm": 0.5056629180908203, "learning_rate": 0.00016, "loss": 1.7657, "step": 8 }, { "epoch": 0.06, "grad_norm": 0.4276069104671478, "learning_rate": 0.00018, "loss": 1.4221, "step": 9 }, { "epoch": 0.07, "grad_norm": 0.433552622795105, "learning_rate": 0.0002, "loss": 1.3117, "step": 10 }, { "epoch": 0.08, "grad_norm": 0.42256900668144226, "learning_rate": 0.0001999972679420179, "loss": 1.2687, "step": 11 }, { "epoch": 0.08, "grad_norm": 0.3066452145576477, "learning_rate": 0.00019998907191735434, "loss": 1.0398, "step": 12 }, { "epoch": 0.09, "grad_norm": 0.3393724858760834, "learning_rate": 0.00019997541237384966, "loss": 1.0063, "step": 13 }, { "epoch": 0.1, "grad_norm": 0.49836328625679016, "learning_rate": 0.00019995629005787713, "loss": 1.2251, "step": 14 }, { "epoch": 0.1, "grad_norm": 0.3539387285709381, "learning_rate": 0.0001999317060143023, "loss": 0.9454, "step": 15 }, { "epoch": 0.11, "grad_norm": 0.35584160685539246, "learning_rate": 0.0001999016615864258, "loss": 1.0105, "step": 16 }, { "epoch": 0.12, "grad_norm": 0.33191052079200745, "learning_rate": 0.00019986615841591002, "loss": 1.1322, "step": 17 }, { "epoch": 0.12, "grad_norm": 0.3499913513660431, "learning_rate": 0.00019982519844268933, "loss": 0.8495, "step": 18 }, { "epoch": 0.13, "grad_norm": 0.2582085132598877, "learning_rate": 0.0001997787839048642, "loss": 0.9725, "step": 19 }, { "epoch": 0.14, "grad_norm": 0.23511624336242676, "learning_rate": 0.00019972691733857883, "loss": 0.9233, "step": 20 }, { "epoch": 0.14, "grad_norm": 0.273019939661026, "learning_rate": 0.00019966960157788248, "loss": 1.0366, "step": 21 }, { "epoch": 0.15, "grad_norm": 0.283527135848999, "learning_rate": 0.0001996068397545748, "loss": 0.9944, "step": 22 }, { "epoch": 0.16, "grad_norm": 0.24311360716819763, "learning_rate": 0.00019953863529803466, "loss": 1.0308, "step": 23 }, { "epoch": 0.16, "grad_norm": 0.24368223547935486, "learning_rate": 0.00019946499193503262, "loss": 1.0051, "step": 24 }, { "epoch": 0.17, "grad_norm": 0.2269805669784546, "learning_rate": 0.0001993859136895274, "loss": 0.835, "step": 25 }, { "epoch": 0.18, "grad_norm": 0.21915565431118011, "learning_rate": 0.00019930140488244602, "loss": 0.9997, "step": 26 }, { "epoch": 0.19, "grad_norm": 0.21885964274406433, "learning_rate": 0.0001992114701314478, "loss": 1.0013, "step": 27 }, { "epoch": 0.19, "grad_norm": 0.22426557540893555, "learning_rate": 0.00019911611435067172, "loss": 0.8633, "step": 28 }, { "epoch": 0.2, "grad_norm": 0.21587449312210083, "learning_rate": 0.0001990153427504683, "loss": 0.8479, "step": 29 }, { "epoch": 0.21, "grad_norm": 0.24985891580581665, "learning_rate": 0.0001989091608371146, "loss": 0.8936, "step": 30 }, { "epoch": 0.21, "grad_norm": 0.19733141362667084, "learning_rate": 0.0001987975744125135, "loss": 0.7743, "step": 31 }, { "epoch": 0.22, "grad_norm": 0.1997266411781311, "learning_rate": 0.00019868058957387663, "loss": 0.9078, "step": 32 }, { "epoch": 0.23, "grad_norm": 0.24114945530891418, "learning_rate": 0.00019855821271339125, "loss": 1.0413, "step": 33 }, { "epoch": 0.23, "grad_norm": 0.2427120953798294, "learning_rate": 0.00019843045051787096, "loss": 0.8308, "step": 34 }, { "epoch": 0.24, "grad_norm": 0.1968858540058136, "learning_rate": 0.0001982973099683902, "loss": 0.818, "step": 35 }, { "epoch": 0.25, "grad_norm": 0.2783421576023102, "learning_rate": 0.00019815879833990304, "loss": 0.8504, "step": 36 }, { "epoch": 0.25, "grad_norm": 0.23332269489765167, "learning_rate": 0.00019801492320084546, "loss": 0.9826, "step": 37 }, { "epoch": 0.26, "grad_norm": 0.22864645719528198, "learning_rate": 0.00019786569241272197, "loss": 0.8705, "step": 38 }, { "epoch": 0.27, "grad_norm": 0.20620585978031158, "learning_rate": 0.00019771111412967583, "loss": 0.8264, "step": 39 }, { "epoch": 0.27, "grad_norm": 0.20590244233608246, "learning_rate": 0.00019755119679804367, "loss": 0.8455, "step": 40 }, { "epoch": 0.28, "grad_norm": 0.20340456068515778, "learning_rate": 0.00019738594915589397, "loss": 0.871, "step": 41 }, { "epoch": 0.29, "grad_norm": 0.2383277714252472, "learning_rate": 0.0001972153802325495, "loss": 0.6833, "step": 42 }, { "epoch": 0.3, "grad_norm": 0.21479888260364532, "learning_rate": 0.00019703949934809408, "loss": 0.8355, "step": 43 }, { "epoch": 0.3, "grad_norm": 0.23538872599601746, "learning_rate": 0.0001968583161128631, "loss": 0.8479, "step": 44 }, { "epoch": 0.31, "grad_norm": 0.2260449230670929, "learning_rate": 0.00019667184042691875, "loss": 0.779, "step": 45 }, { "epoch": 0.32, "grad_norm": 0.20232993364334106, "learning_rate": 0.0001964800824795087, "loss": 0.7293, "step": 46 }, { "epoch": 0.32, "grad_norm": 0.19780154526233673, "learning_rate": 0.00019628305274850956, "loss": 0.7709, "step": 47 }, { "epoch": 0.33, "grad_norm": 0.24822202324867249, "learning_rate": 0.00019608076199985433, "loss": 0.8885, "step": 48 }, { "epoch": 0.34, "grad_norm": 0.20940056443214417, "learning_rate": 0.0001958732212869441, "loss": 0.6916, "step": 49 }, { "epoch": 0.34, "grad_norm": 0.18944858014583588, "learning_rate": 0.0001956604419500441, "loss": 0.7326, "step": 50 }, { "epoch": 0.35, "grad_norm": 0.201398104429245, "learning_rate": 0.00019544243561566403, "loss": 0.6542, "step": 51 }, { "epoch": 0.36, "grad_norm": 0.22385160624980927, "learning_rate": 0.00019521921419592283, "loss": 0.8036, "step": 52 }, { "epoch": 0.36, "grad_norm": 0.19502398371696472, "learning_rate": 0.0001949907898878977, "loss": 0.7579, "step": 53 }, { "epoch": 0.37, "grad_norm": 0.21633867919445038, "learning_rate": 0.00019475717517295778, "loss": 0.7803, "step": 54 }, { "epoch": 0.38, "grad_norm": 0.24109330773353577, "learning_rate": 0.00019451838281608197, "loss": 0.7745, "step": 55 }, { "epoch": 0.38, "grad_norm": 0.20285621285438538, "learning_rate": 0.00019427442586516155, "loss": 0.7306, "step": 56 }, { "epoch": 0.39, "grad_norm": 0.23838144540786743, "learning_rate": 0.00019402531765028722, "loss": 0.7606, "step": 57 }, { "epoch": 0.4, "grad_norm": 0.25280559062957764, "learning_rate": 0.00019377107178302074, "loss": 0.7928, "step": 58 }, { "epoch": 0.41, "grad_norm": 0.24614648520946503, "learning_rate": 0.00019351170215565114, "loss": 0.739, "step": 59 }, { "epoch": 0.41, "grad_norm": 0.20391589403152466, "learning_rate": 0.00019324722294043558, "loss": 0.7636, "step": 60 }, { "epoch": 0.42, "grad_norm": 0.23704086244106293, "learning_rate": 0.00019297764858882514, "loss": 0.6919, "step": 61 }, { "epoch": 0.43, "grad_norm": 0.22057901322841644, "learning_rate": 0.00019270299383067498, "loss": 0.6035, "step": 62 }, { "epoch": 0.43, "grad_norm": 0.22797846794128418, "learning_rate": 0.0001924232736734396, "loss": 0.7087, "step": 63 }, { "epoch": 0.44, "grad_norm": 0.22181542217731476, "learning_rate": 0.00019213850340135276, "loss": 0.8088, "step": 64 }, { "epoch": 0.45, "grad_norm": 0.2096872180700302, "learning_rate": 0.00019184869857459232, "loss": 0.7073, "step": 65 }, { "epoch": 0.45, "grad_norm": 0.192199245095253, "learning_rate": 0.00019155387502843013, "loss": 0.6605, "step": 66 }, { "epoch": 0.46, "grad_norm": 0.2242266982793808, "learning_rate": 0.00019125404887236663, "loss": 0.7287, "step": 67 }, { "epoch": 0.47, "grad_norm": 0.24139907956123352, "learning_rate": 0.00019094923648925067, "loss": 0.6611, "step": 68 }, { "epoch": 0.47, "grad_norm": 0.22859904170036316, "learning_rate": 0.00019063945453438432, "loss": 0.6189, "step": 69 }, { "epoch": 0.48, "grad_norm": 0.27671098709106445, "learning_rate": 0.0001903247199346129, "loss": 0.8595, "step": 70 }, { "epoch": 0.49, "grad_norm": 0.23342834413051605, "learning_rate": 0.00019000504988739986, "loss": 0.6718, "step": 71 }, { "epoch": 0.49, "grad_norm": 0.2517896890640259, "learning_rate": 0.00018968046185988732, "loss": 0.722, "step": 72 }, { "epoch": 0.5, "grad_norm": 0.25217679142951965, "learning_rate": 0.00018935097358794144, "loss": 0.824, "step": 73 }, { "epoch": 0.51, "grad_norm": 0.2682301998138428, "learning_rate": 0.00018901660307518354, "loss": 0.7837, "step": 74 }, { "epoch": 0.52, "grad_norm": 0.28926676511764526, "learning_rate": 0.0001886773685920062, "loss": 0.7364, "step": 75 }, { "epoch": 0.52, "grad_norm": 0.25249186158180237, "learning_rate": 0.00018833328867457497, "loss": 0.8566, "step": 76 }, { "epoch": 0.53, "grad_norm": 0.21752771735191345, "learning_rate": 0.0001879843821238155, "loss": 0.7077, "step": 77 }, { "epoch": 0.54, "grad_norm": 0.22346794605255127, "learning_rate": 0.00018763066800438636, "loss": 0.6522, "step": 78 }, { "epoch": 0.54, "grad_norm": 0.23172937333583832, "learning_rate": 0.00018727216564363723, "loss": 0.6099, "step": 79 }, { "epoch": 0.55, "grad_norm": 0.20895916223526, "learning_rate": 0.00018690889463055283, "loss": 0.7242, "step": 80 }, { "epoch": 0.56, "grad_norm": 0.26868510246276855, "learning_rate": 0.0001865408748146826, "loss": 0.705, "step": 81 }, { "epoch": 0.56, "grad_norm": 0.243666410446167, "learning_rate": 0.00018616812630505597, "loss": 0.8512, "step": 82 }, { "epoch": 0.57, "grad_norm": 0.21445880830287933, "learning_rate": 0.00018579066946908384, "loss": 0.7092, "step": 83 }, { "epoch": 0.58, "grad_norm": 0.22805824875831604, "learning_rate": 0.00018540852493144545, "loss": 0.6757, "step": 84 }, { "epoch": 0.58, "grad_norm": 0.25106164813041687, "learning_rate": 0.00018502171357296144, "loss": 0.7171, "step": 85 }, { "epoch": 0.59, "grad_norm": 0.2290162742137909, "learning_rate": 0.000184630256529453, "loss": 0.7053, "step": 86 }, { "epoch": 0.6, "grad_norm": 0.21118655800819397, "learning_rate": 0.00018423417519058694, "loss": 0.5827, "step": 87 }, { "epoch": 0.6, "grad_norm": 0.23761862516403198, "learning_rate": 0.00018383349119870695, "loss": 0.5827, "step": 88 }, { "epoch": 0.61, "grad_norm": 0.23689566552639008, "learning_rate": 0.00018342822644765104, "loss": 0.6401, "step": 89 }, { "epoch": 0.62, "grad_norm": 0.26510947942733765, "learning_rate": 0.00018301840308155507, "loss": 0.5963, "step": 90 }, { "epoch": 0.63, "grad_norm": 0.2142990678548813, "learning_rate": 0.0001826040434936431, "loss": 0.6258, "step": 91 }, { "epoch": 0.63, "grad_norm": 0.20709159970283508, "learning_rate": 0.00018218517032500344, "loss": 0.5685, "step": 92 }, { "epoch": 0.64, "grad_norm": 0.2485310137271881, "learning_rate": 0.0001817618064633518, "loss": 0.5901, "step": 93 }, { "epoch": 0.65, "grad_norm": 0.2432468980550766, "learning_rate": 0.00018133397504178057, "loss": 0.6891, "step": 94 }, { "epoch": 0.65, "grad_norm": 0.2318205088376999, "learning_rate": 0.00018090169943749476, "loss": 0.7339, "step": 95 }, { "epoch": 0.66, "grad_norm": 0.25346460938453674, "learning_rate": 0.00018046500327053463, "loss": 0.6606, "step": 96 }, { "epoch": 0.67, "grad_norm": 0.29421111941337585, "learning_rate": 0.0001800239104024851, "loss": 0.6698, "step": 97 }, { "epoch": 0.67, "grad_norm": 0.2356603443622589, "learning_rate": 0.00017957844493517213, "loss": 0.6225, "step": 98 }, { "epoch": 0.68, "grad_norm": 0.2331649512052536, "learning_rate": 0.00017912863120934534, "loss": 0.6838, "step": 99 }, { "epoch": 0.69, "grad_norm": 0.23008978366851807, "learning_rate": 0.00017867449380334834, "loss": 0.6303, "step": 100 }, { "epoch": 0.69, "grad_norm": 0.21604081988334656, "learning_rate": 0.00017821605753177562, "loss": 0.4923, "step": 101 }, { "epoch": 0.7, "grad_norm": 0.2283111810684204, "learning_rate": 0.00017775334744411678, "loss": 0.6344, "step": 102 }, { "epoch": 0.71, "grad_norm": 0.2448730617761612, "learning_rate": 0.00017728638882338746, "loss": 0.6789, "step": 103 }, { "epoch": 0.71, "grad_norm": 0.22479577362537384, "learning_rate": 0.00017681520718474823, "loss": 0.5841, "step": 104 }, { "epoch": 0.72, "grad_norm": 0.21999216079711914, "learning_rate": 0.00017633982827411032, "loss": 0.6402, "step": 105 }, { "epoch": 0.73, "grad_norm": 0.2296195775270462, "learning_rate": 0.00017586027806672857, "loss": 0.6148, "step": 106 }, { "epoch": 0.74, "grad_norm": 0.22455835342407227, "learning_rate": 0.00017537658276578247, "loss": 0.6418, "step": 107 }, { "epoch": 0.74, "grad_norm": 0.23929741978645325, "learning_rate": 0.00017488876880094413, "loss": 0.5459, "step": 108 }, { "epoch": 0.75, "grad_norm": 0.229934424161911, "learning_rate": 0.00017439686282693436, "loss": 0.6049, "step": 109 }, { "epoch": 0.76, "grad_norm": 0.24801373481750488, "learning_rate": 0.00017390089172206592, "loss": 0.7663, "step": 110 }, { "epoch": 0.76, "grad_norm": 0.2523267865180969, "learning_rate": 0.00017340088258677522, "loss": 0.6642, "step": 111 }, { "epoch": 0.77, "grad_norm": 0.22252008318901062, "learning_rate": 0.00017289686274214118, "loss": 0.6325, "step": 112 }, { "epoch": 0.78, "grad_norm": 0.27619731426239014, "learning_rate": 0.0001723888597283926, "loss": 0.655, "step": 113 }, { "epoch": 0.78, "grad_norm": 0.25090277194976807, "learning_rate": 0.00017187690130340328, "loss": 0.6251, "step": 114 }, { "epoch": 0.79, "grad_norm": 0.2236175239086151, "learning_rate": 0.00017136101544117525, "loss": 0.5959, "step": 115 }, { "epoch": 0.8, "grad_norm": 0.21940240263938904, "learning_rate": 0.00017084123033031024, "loss": 0.6028, "step": 116 }, { "epoch": 0.8, "grad_norm": 0.2741597294807434, "learning_rate": 0.00017031757437246947, "loss": 0.4947, "step": 117 }, { "epoch": 0.81, "grad_norm": 0.23343035578727722, "learning_rate": 0.00016979007618082175, "loss": 0.4415, "step": 118 }, { "epoch": 0.82, "grad_norm": 0.2116251140832901, "learning_rate": 0.00016925876457848, "loss": 0.5283, "step": 119 }, { "epoch": 0.82, "grad_norm": 0.25621068477630615, "learning_rate": 0.00016872366859692627, "loss": 0.7334, "step": 120 }, { "epoch": 0.83, "grad_norm": 0.22588759660720825, "learning_rate": 0.00016818481747442554, "loss": 0.6514, "step": 121 }, { "epoch": 0.84, "grad_norm": 0.24995574355125427, "learning_rate": 0.00016764224065442796, "loss": 0.5632, "step": 122 }, { "epoch": 0.85, "grad_norm": 0.2382134348154068, "learning_rate": 0.00016709596778396026, "loss": 0.5954, "step": 123 }, { "epoch": 0.85, "grad_norm": 0.25166618824005127, "learning_rate": 0.00016654602871200546, "loss": 0.6092, "step": 124 }, { "epoch": 0.86, "grad_norm": 0.23028074204921722, "learning_rate": 0.0001659924534878723, "loss": 0.576, "step": 125 }, { "epoch": 0.87, "grad_norm": 0.2527604103088379, "learning_rate": 0.00016543527235955282, "loss": 0.5985, "step": 126 }, { "epoch": 0.87, "grad_norm": 0.25870686769485474, "learning_rate": 0.00016487451577207018, "loss": 0.5767, "step": 127 }, { "epoch": 0.88, "grad_norm": 0.24936434626579285, "learning_rate": 0.0001643102143658145, "loss": 0.7494, "step": 128 }, { "epoch": 0.89, "grad_norm": 0.25158020853996277, "learning_rate": 0.000163742398974869, "loss": 0.578, "step": 129 }, { "epoch": 0.89, "grad_norm": 0.22290346026420593, "learning_rate": 0.0001631711006253251, "loss": 0.6489, "step": 130 }, { "epoch": 0.9, "grad_norm": 0.26421919465065, "learning_rate": 0.00016259635053358717, "loss": 0.5669, "step": 131 }, { "epoch": 0.91, "grad_norm": 0.2573990225791931, "learning_rate": 0.0001620181801046667, "loss": 0.6405, "step": 132 }, { "epoch": 0.91, "grad_norm": 0.19883453845977783, "learning_rate": 0.00016143662093046638, "loss": 0.4731, "step": 133 }, { "epoch": 0.92, "grad_norm": 0.24181459844112396, "learning_rate": 0.00016085170478805395, "loss": 0.6819, "step": 134 }, { "epoch": 0.93, "grad_norm": 0.2319963425397873, "learning_rate": 0.00016026346363792567, "loss": 0.6373, "step": 135 }, { "epoch": 0.93, "grad_norm": 0.2552095055580139, "learning_rate": 0.0001596719296222601, "loss": 0.7151, "step": 136 }, { "epoch": 0.94, "grad_norm": 0.27191445231437683, "learning_rate": 0.00015907713506316192, "loss": 0.611, "step": 137 }, { "epoch": 0.95, "grad_norm": 0.26981061697006226, "learning_rate": 0.0001584791124608955, "loss": 0.5923, "step": 138 }, { "epoch": 0.96, "grad_norm": 0.23907916247844696, "learning_rate": 0.00015787789449210938, "loss": 0.5655, "step": 139 }, { "epoch": 0.96, "grad_norm": 0.23364509642124176, "learning_rate": 0.00015727351400805052, "loss": 0.6019, "step": 140 }, { "epoch": 0.97, "grad_norm": 0.23096178472042084, "learning_rate": 0.0001566660040327695, "loss": 0.602, "step": 141 }, { "epoch": 0.98, "grad_norm": 0.2656322717666626, "learning_rate": 0.0001560553977613158, "loss": 0.6195, "step": 142 }, { "epoch": 0.98, "grad_norm": 0.23051652312278748, "learning_rate": 0.00015544172855792423, "loss": 0.6132, "step": 143 }, { "epoch": 0.99, "grad_norm": 0.2443581074476242, "learning_rate": 0.00015482502995419167, "loss": 0.6144, "step": 144 }, { "epoch": 1.0, "grad_norm": 0.2075706273317337, "learning_rate": 0.00015420533564724495, "loss": 0.5556, "step": 145 } ], "logging_steps": 1, "max_steps": 435, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 145, "total_flos": 9.76361694953472e+16, "train_batch_size": 8, "trial_name": null, "trial_params": null }