{ "best_global_step": 4000, "best_metric": 0.8817942142486572, "best_model_checkpoint": "runs/emotts_ravdess\\checkpoint-4000", "epoch": 97.5679012345679, "eval_steps": 1000, "global_step": 4000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.6172839506172839, "grad_norm": 46.678199768066406, "learning_rate": 4.800000000000001e-07, "loss": 3.4472, "step": 25 }, { "epoch": 1.2222222222222223, "grad_norm": 26.903335571289062, "learning_rate": 9.800000000000001e-07, "loss": 2.9051, "step": 50 }, { "epoch": 1.8395061728395061, "grad_norm": 16.712799072265625, "learning_rate": 1.48e-06, "loss": 2.2302, "step": 75 }, { "epoch": 2.4444444444444446, "grad_norm": 11.607951164245605, "learning_rate": 1.98e-06, "loss": 1.7683, "step": 100 }, { "epoch": 3.049382716049383, "grad_norm": 7.216983318328857, "learning_rate": 2.4800000000000004e-06, "loss": 1.5434, "step": 125 }, { "epoch": 3.6666666666666665, "grad_norm": 10.899630546569824, "learning_rate": 2.9800000000000003e-06, "loss": 1.4385, "step": 150 }, { "epoch": 4.271604938271605, "grad_norm": 6.701765537261963, "learning_rate": 3.48e-06, "loss": 1.3262, "step": 175 }, { "epoch": 4.888888888888889, "grad_norm": 9.419053077697754, "learning_rate": 3.980000000000001e-06, "loss": 1.285, "step": 200 }, { "epoch": 5.493827160493828, "grad_norm": 5.913278579711914, "learning_rate": 4.48e-06, "loss": 1.2503, "step": 225 }, { "epoch": 6.098765432098766, "grad_norm": 8.171669006347656, "learning_rate": 4.980000000000001e-06, "loss": 1.1868, "step": 250 }, { "epoch": 6.716049382716049, "grad_norm": 5.54558801651001, "learning_rate": 5.480000000000001e-06, "loss": 1.1478, "step": 275 }, { "epoch": 7.320987654320987, "grad_norm": 5.325434684753418, "learning_rate": 5.98e-06, "loss": 1.1245, "step": 300 }, { "epoch": 7.938271604938271, "grad_norm": 5.406148433685303, "learning_rate": 6.480000000000001e-06, "loss": 1.1145, "step": 325 }, { "epoch": 8.54320987654321, "grad_norm": 8.461536407470703, "learning_rate": 6.98e-06, "loss": 1.0641, "step": 350 }, { "epoch": 9.148148148148149, "grad_norm": 3.8533031940460205, "learning_rate": 7.48e-06, "loss": 1.0573, "step": 375 }, { "epoch": 9.765432098765432, "grad_norm": 7.569976806640625, "learning_rate": 7.980000000000002e-06, "loss": 1.061, "step": 400 }, { "epoch": 10.37037037037037, "grad_norm": 10.156228065490723, "learning_rate": 8.48e-06, "loss": 1.0485, "step": 425 }, { "epoch": 10.987654320987655, "grad_norm": 4.668756484985352, "learning_rate": 8.98e-06, "loss": 1.0216, "step": 450 }, { "epoch": 11.592592592592592, "grad_norm": 5.087125301361084, "learning_rate": 9.48e-06, "loss": 1.0319, "step": 475 }, { "epoch": 12.197530864197532, "grad_norm": 7.943349361419678, "learning_rate": 9.980000000000001e-06, "loss": 1.0, "step": 500 }, { "epoch": 12.814814814814815, "grad_norm": 7.655898571014404, "learning_rate": 9.931428571428571e-06, "loss": 1.0052, "step": 525 }, { "epoch": 13.419753086419753, "grad_norm": 4.458106994628906, "learning_rate": 9.86e-06, "loss": 1.0001, "step": 550 }, { "epoch": 14.024691358024691, "grad_norm": 9.058222770690918, "learning_rate": 9.78857142857143e-06, "loss": 1.0015, "step": 575 }, { "epoch": 14.641975308641975, "grad_norm": 4.795205593109131, "learning_rate": 9.717142857142858e-06, "loss": 0.9836, "step": 600 }, { "epoch": 15.246913580246913, "grad_norm": 10.566876411437988, "learning_rate": 9.645714285714286e-06, "loss": 1.0019, "step": 625 }, { "epoch": 15.864197530864198, "grad_norm": 7.610626220703125, "learning_rate": 9.574285714285715e-06, "loss": 0.9779, "step": 650 }, { "epoch": 16.469135802469136, "grad_norm": 6.008159637451172, "learning_rate": 9.502857142857144e-06, "loss": 0.9798, "step": 675 }, { "epoch": 17.074074074074073, "grad_norm": 6.685286521911621, "learning_rate": 9.431428571428573e-06, "loss": 0.9753, "step": 700 }, { "epoch": 17.691358024691358, "grad_norm": 2.7540247440338135, "learning_rate": 9.360000000000002e-06, "loss": 0.967, "step": 725 }, { "epoch": 18.296296296296298, "grad_norm": 4.825072288513184, "learning_rate": 9.28857142857143e-06, "loss": 0.9575, "step": 750 }, { "epoch": 18.91358024691358, "grad_norm": 6.618119716644287, "learning_rate": 9.217142857142858e-06, "loss": 0.9675, "step": 775 }, { "epoch": 19.51851851851852, "grad_norm": 5.465808391571045, "learning_rate": 9.145714285714287e-06, "loss": 0.9626, "step": 800 }, { "epoch": 20.123456790123456, "grad_norm": 4.9501051902771, "learning_rate": 9.074285714285716e-06, "loss": 0.9638, "step": 825 }, { "epoch": 20.74074074074074, "grad_norm": 4.926831245422363, "learning_rate": 9.002857142857144e-06, "loss": 0.9582, "step": 850 }, { "epoch": 21.34567901234568, "grad_norm": 6.605464458465576, "learning_rate": 8.931428571428573e-06, "loss": 0.9551, "step": 875 }, { "epoch": 21.962962962962962, "grad_norm": 5.774538040161133, "learning_rate": 8.860000000000002e-06, "loss": 0.9596, "step": 900 }, { "epoch": 22.567901234567902, "grad_norm": 4.304802417755127, "learning_rate": 8.788571428571429e-06, "loss": 0.9489, "step": 925 }, { "epoch": 23.17283950617284, "grad_norm": 5.171604633331299, "learning_rate": 8.717142857142858e-06, "loss": 0.953, "step": 950 }, { "epoch": 23.790123456790123, "grad_norm": 7.152281761169434, "learning_rate": 8.645714285714287e-06, "loss": 0.9604, "step": 975 }, { "epoch": 24.395061728395063, "grad_norm": 4.954558849334717, "learning_rate": 8.574285714285714e-06, "loss": 0.9489, "step": 1000 }, { "epoch": 24.395061728395063, "eval_loss": 0.9205830097198486, "eval_runtime": 2.2708, "eval_samples_per_second": 63.413, "eval_steps_per_second": 31.707, "step": 1000 }, { "epoch": 25.0, "grad_norm": 10.266937255859375, "learning_rate": 8.502857142857143e-06, "loss": 0.9541, "step": 1025 }, { "epoch": 25.617283950617285, "grad_norm": 3.225881814956665, "learning_rate": 8.431428571428572e-06, "loss": 0.9451, "step": 1050 }, { "epoch": 26.22222222222222, "grad_norm": 4.001440048217773, "learning_rate": 8.36e-06, "loss": 0.9422, "step": 1075 }, { "epoch": 26.839506172839506, "grad_norm": 5.347984313964844, "learning_rate": 8.288571428571429e-06, "loss": 0.9434, "step": 1100 }, { "epoch": 27.444444444444443, "grad_norm": 4.1566901206970215, "learning_rate": 8.217142857142858e-06, "loss": 0.942, "step": 1125 }, { "epoch": 28.049382716049383, "grad_norm": 3.2101686000823975, "learning_rate": 8.145714285714287e-06, "loss": 0.9365, "step": 1150 }, { "epoch": 28.666666666666668, "grad_norm": 5.183631896972656, "learning_rate": 8.074285714285714e-06, "loss": 0.941, "step": 1175 }, { "epoch": 29.271604938271604, "grad_norm": 4.704529285430908, "learning_rate": 8.002857142857143e-06, "loss": 0.9374, "step": 1200 }, { "epoch": 29.88888888888889, "grad_norm": 4.460058689117432, "learning_rate": 7.931428571428572e-06, "loss": 0.9383, "step": 1225 }, { "epoch": 30.493827160493826, "grad_norm": 3.616530418395996, "learning_rate": 7.860000000000001e-06, "loss": 0.9321, "step": 1250 }, { "epoch": 31.098765432098766, "grad_norm": 3.92207932472229, "learning_rate": 7.788571428571428e-06, "loss": 0.9347, "step": 1275 }, { "epoch": 31.71604938271605, "grad_norm": 3.6962461471557617, "learning_rate": 7.717142857142857e-06, "loss": 0.9305, "step": 1300 }, { "epoch": 32.32098765432099, "grad_norm": 4.276056289672852, "learning_rate": 7.645714285714286e-06, "loss": 0.9336, "step": 1325 }, { "epoch": 32.93827160493827, "grad_norm": 5.176277160644531, "learning_rate": 7.574285714285715e-06, "loss": 0.9351, "step": 1350 }, { "epoch": 33.54320987654321, "grad_norm": 7.2538347244262695, "learning_rate": 7.502857142857144e-06, "loss": 0.9241, "step": 1375 }, { "epoch": 34.148148148148145, "grad_norm": 4.3576273918151855, "learning_rate": 7.431428571428572e-06, "loss": 0.9316, "step": 1400 }, { "epoch": 34.76543209876543, "grad_norm": 9.138855934143066, "learning_rate": 7.360000000000001e-06, "loss": 0.9277, "step": 1425 }, { "epoch": 35.370370370370374, "grad_norm": 4.475003719329834, "learning_rate": 7.28857142857143e-06, "loss": 0.9245, "step": 1450 }, { "epoch": 35.98765432098765, "grad_norm": 7.28753137588501, "learning_rate": 7.217142857142858e-06, "loss": 0.9266, "step": 1475 }, { "epoch": 36.592592592592595, "grad_norm": 5.1342949867248535, "learning_rate": 7.145714285714286e-06, "loss": 0.9297, "step": 1500 }, { "epoch": 37.19753086419753, "grad_norm": 2.7765142917633057, "learning_rate": 7.074285714285715e-06, "loss": 0.9253, "step": 1525 }, { "epoch": 37.81481481481482, "grad_norm": 3.8011326789855957, "learning_rate": 7.002857142857143e-06, "loss": 0.9203, "step": 1550 }, { "epoch": 38.41975308641975, "grad_norm": 7.432782173156738, "learning_rate": 6.931428571428572e-06, "loss": 0.9196, "step": 1575 }, { "epoch": 39.02469135802469, "grad_norm": 4.179474830627441, "learning_rate": 6.860000000000001e-06, "loss": 0.9188, "step": 1600 }, { "epoch": 39.641975308641975, "grad_norm": 8.513073921203613, "learning_rate": 6.7885714285714286e-06, "loss": 0.9268, "step": 1625 }, { "epoch": 40.24691358024691, "grad_norm": 3.699882984161377, "learning_rate": 6.7171428571428576e-06, "loss": 0.9216, "step": 1650 }, { "epoch": 40.864197530864196, "grad_norm": 3.949507713317871, "learning_rate": 6.645714285714287e-06, "loss": 0.9238, "step": 1675 }, { "epoch": 41.46913580246913, "grad_norm": 3.7951810359954834, "learning_rate": 6.574285714285716e-06, "loss": 0.9198, "step": 1700 }, { "epoch": 42.074074074074076, "grad_norm": 5.373620986938477, "learning_rate": 6.502857142857143e-06, "loss": 0.9135, "step": 1725 }, { "epoch": 42.69135802469136, "grad_norm": 6.875067234039307, "learning_rate": 6.431428571428572e-06, "loss": 0.918, "step": 1750 }, { "epoch": 43.2962962962963, "grad_norm": 7.167726039886475, "learning_rate": 6.360000000000001e-06, "loss": 0.9276, "step": 1775 }, { "epoch": 43.91358024691358, "grad_norm": 3.7067105770111084, "learning_rate": 6.288571428571429e-06, "loss": 0.9169, "step": 1800 }, { "epoch": 44.51851851851852, "grad_norm": 4.474793434143066, "learning_rate": 6.217142857142857e-06, "loss": 0.9191, "step": 1825 }, { "epoch": 45.123456790123456, "grad_norm": 5.386421203613281, "learning_rate": 6.145714285714286e-06, "loss": 0.9145, "step": 1850 }, { "epoch": 45.74074074074074, "grad_norm": 3.068861246109009, "learning_rate": 6.0742857142857145e-06, "loss": 0.9095, "step": 1875 }, { "epoch": 46.34567901234568, "grad_norm": 3.804973840713501, "learning_rate": 6.0028571428571435e-06, "loss": 0.912, "step": 1900 }, { "epoch": 46.96296296296296, "grad_norm": 2.9225473403930664, "learning_rate": 5.9314285714285725e-06, "loss": 0.9049, "step": 1925 }, { "epoch": 47.5679012345679, "grad_norm": 4.022708892822266, "learning_rate": 5.86e-06, "loss": 0.9049, "step": 1950 }, { "epoch": 48.17283950617284, "grad_norm": 3.421691417694092, "learning_rate": 5.788571428571429e-06, "loss": 0.9101, "step": 1975 }, { "epoch": 48.79012345679013, "grad_norm": 6.732350826263428, "learning_rate": 5.717142857142858e-06, "loss": 0.9105, "step": 2000 }, { "epoch": 48.79012345679013, "eval_loss": 0.8953001499176025, "eval_runtime": 2.1587, "eval_samples_per_second": 66.707, "eval_steps_per_second": 33.353, "step": 2000 }, { "epoch": 49.39506172839506, "grad_norm": 5.506401538848877, "learning_rate": 5.645714285714287e-06, "loss": 0.9036, "step": 2025 }, { "epoch": 50.0, "grad_norm": 9.19892406463623, "learning_rate": 5.574285714285714e-06, "loss": 0.9107, "step": 2050 }, { "epoch": 50.617283950617285, "grad_norm": 3.324119806289673, "learning_rate": 5.502857142857143e-06, "loss": 0.9118, "step": 2075 }, { "epoch": 51.22222222222222, "grad_norm": 5.142299652099609, "learning_rate": 5.431428571428572e-06, "loss": 0.9098, "step": 2100 }, { "epoch": 51.839506172839506, "grad_norm": 2.8806934356689453, "learning_rate": 5.36e-06, "loss": 0.9013, "step": 2125 }, { "epoch": 52.44444444444444, "grad_norm": 4.728231430053711, "learning_rate": 5.2885714285714285e-06, "loss": 0.9049, "step": 2150 }, { "epoch": 53.04938271604938, "grad_norm": 4.9596991539001465, "learning_rate": 5.2171428571428575e-06, "loss": 0.9128, "step": 2175 }, { "epoch": 53.666666666666664, "grad_norm": 3.160998821258545, "learning_rate": 5.145714285714286e-06, "loss": 0.9003, "step": 2200 }, { "epoch": 54.27160493827161, "grad_norm": 3.833195924758911, "learning_rate": 5.074285714285715e-06, "loss": 0.9088, "step": 2225 }, { "epoch": 54.888888888888886, "grad_norm": 5.242589950561523, "learning_rate": 5.002857142857144e-06, "loss": 0.9005, "step": 2250 }, { "epoch": 55.49382716049383, "grad_norm": 3.781388759613037, "learning_rate": 4.931428571428572e-06, "loss": 0.9028, "step": 2275 }, { "epoch": 56.098765432098766, "grad_norm": 6.0595574378967285, "learning_rate": 4.86e-06, "loss": 0.9124, "step": 2300 }, { "epoch": 56.71604938271605, "grad_norm": 2.7515597343444824, "learning_rate": 4.788571428571429e-06, "loss": 0.9025, "step": 2325 }, { "epoch": 57.32098765432099, "grad_norm": 6.520521640777588, "learning_rate": 4.717142857142857e-06, "loss": 0.9065, "step": 2350 }, { "epoch": 57.93827160493827, "grad_norm": 3.289445638656616, "learning_rate": 4.645714285714286e-06, "loss": 0.9004, "step": 2375 }, { "epoch": 58.54320987654321, "grad_norm": 3.6132805347442627, "learning_rate": 4.574285714285714e-06, "loss": 0.9021, "step": 2400 }, { "epoch": 59.148148148148145, "grad_norm": 5.021145343780518, "learning_rate": 4.5028571428571434e-06, "loss": 0.8957, "step": 2425 }, { "epoch": 59.76543209876543, "grad_norm": 5.366466522216797, "learning_rate": 4.431428571428572e-06, "loss": 0.8986, "step": 2450 }, { "epoch": 60.370370370370374, "grad_norm": 5.833218574523926, "learning_rate": 4.360000000000001e-06, "loss": 0.9045, "step": 2475 }, { "epoch": 60.98765432098765, "grad_norm": 5.301181793212891, "learning_rate": 4.288571428571429e-06, "loss": 0.8975, "step": 2500 }, { "epoch": 61.592592592592595, "grad_norm": 3.989539861679077, "learning_rate": 4.217142857142858e-06, "loss": 0.9021, "step": 2525 }, { "epoch": 62.19753086419753, "grad_norm": 13.111737251281738, "learning_rate": 4.145714285714286e-06, "loss": 0.9043, "step": 2550 }, { "epoch": 62.81481481481482, "grad_norm": 3.4066903591156006, "learning_rate": 4.074285714285714e-06, "loss": 0.8929, "step": 2575 }, { "epoch": 63.41975308641975, "grad_norm": 3.9170608520507812, "learning_rate": 4.002857142857143e-06, "loss": 0.8998, "step": 2600 }, { "epoch": 64.0246913580247, "grad_norm": 3.5934042930603027, "learning_rate": 3.931428571428571e-06, "loss": 0.898, "step": 2625 }, { "epoch": 64.64197530864197, "grad_norm": 3.3771822452545166, "learning_rate": 3.86e-06, "loss": 0.901, "step": 2650 }, { "epoch": 65.24691358024691, "grad_norm": 3.5741279125213623, "learning_rate": 3.7885714285714285e-06, "loss": 0.903, "step": 2675 }, { "epoch": 65.8641975308642, "grad_norm": 4.369333267211914, "learning_rate": 3.7171428571428575e-06, "loss": 0.8907, "step": 2700 }, { "epoch": 66.46913580246914, "grad_norm": 2.9996423721313477, "learning_rate": 3.6457142857142857e-06, "loss": 0.9008, "step": 2725 }, { "epoch": 67.07407407407408, "grad_norm": 5.098217487335205, "learning_rate": 3.5742857142857147e-06, "loss": 0.8979, "step": 2750 }, { "epoch": 67.69135802469135, "grad_norm": 3.8548665046691895, "learning_rate": 3.5028571428571433e-06, "loss": 0.8906, "step": 2775 }, { "epoch": 68.29629629629629, "grad_norm": 4.787322521209717, "learning_rate": 3.431428571428572e-06, "loss": 0.8949, "step": 2800 }, { "epoch": 68.91358024691358, "grad_norm": 2.8501498699188232, "learning_rate": 3.3600000000000004e-06, "loss": 0.8932, "step": 2825 }, { "epoch": 69.51851851851852, "grad_norm": 7.697382926940918, "learning_rate": 3.2885714285714286e-06, "loss": 0.8961, "step": 2850 }, { "epoch": 70.12345679012346, "grad_norm": 3.5617403984069824, "learning_rate": 3.2171428571428576e-06, "loss": 0.8975, "step": 2875 }, { "epoch": 70.74074074074075, "grad_norm": 4.286247253417969, "learning_rate": 3.1457142857142858e-06, "loss": 0.8988, "step": 2900 }, { "epoch": 71.34567901234568, "grad_norm": 3.0174379348754883, "learning_rate": 3.074285714285715e-06, "loss": 0.8986, "step": 2925 }, { "epoch": 71.96296296296296, "grad_norm": 5.708584308624268, "learning_rate": 3.002857142857143e-06, "loss": 0.8888, "step": 2950 }, { "epoch": 72.5679012345679, "grad_norm": 7.933815956115723, "learning_rate": 2.9314285714285716e-06, "loss": 0.9, "step": 2975 }, { "epoch": 73.17283950617283, "grad_norm": 3.4261972904205322, "learning_rate": 2.86e-06, "loss": 0.8951, "step": 3000 }, { "epoch": 73.17283950617283, "eval_loss": 0.8869494795799255, "eval_runtime": 2.1798, "eval_samples_per_second": 66.061, "eval_steps_per_second": 33.03, "step": 3000 }, { "epoch": 73.79012345679013, "grad_norm": 4.3120646476745605, "learning_rate": 2.7885714285714287e-06, "loss": 0.8897, "step": 3025 }, { "epoch": 74.39506172839506, "grad_norm": 3.6650469303131104, "learning_rate": 2.7171428571428577e-06, "loss": 0.8961, "step": 3050 }, { "epoch": 75.0, "grad_norm": 7.670346736907959, "learning_rate": 2.645714285714286e-06, "loss": 0.9003, "step": 3075 }, { "epoch": 75.61728395061728, "grad_norm": 3.292160987854004, "learning_rate": 2.574285714285715e-06, "loss": 0.8946, "step": 3100 }, { "epoch": 76.22222222222223, "grad_norm": 3.5280263423919678, "learning_rate": 2.502857142857143e-06, "loss": 0.8934, "step": 3125 }, { "epoch": 76.8395061728395, "grad_norm": 5.340327739715576, "learning_rate": 2.4314285714285717e-06, "loss": 0.8984, "step": 3150 }, { "epoch": 77.44444444444444, "grad_norm": 6.106954574584961, "learning_rate": 2.3600000000000003e-06, "loss": 0.8958, "step": 3175 }, { "epoch": 78.04938271604938, "grad_norm": 3.5689122676849365, "learning_rate": 2.288571428571429e-06, "loss": 0.8968, "step": 3200 }, { "epoch": 78.66666666666667, "grad_norm": 3.928802967071533, "learning_rate": 2.2171428571428575e-06, "loss": 0.8909, "step": 3225 }, { "epoch": 79.27160493827161, "grad_norm": 3.5558717250823975, "learning_rate": 2.145714285714286e-06, "loss": 0.8881, "step": 3250 }, { "epoch": 79.88888888888889, "grad_norm": 3.194141387939453, "learning_rate": 2.0742857142857146e-06, "loss": 0.8868, "step": 3275 }, { "epoch": 80.49382716049382, "grad_norm": 5.6881232261657715, "learning_rate": 2.0028571428571432e-06, "loss": 0.8973, "step": 3300 }, { "epoch": 81.09876543209876, "grad_norm": 3.105429172515869, "learning_rate": 1.9314285714285714e-06, "loss": 0.8935, "step": 3325 }, { "epoch": 81.71604938271605, "grad_norm": 3.2020113468170166, "learning_rate": 1.8600000000000002e-06, "loss": 0.89, "step": 3350 }, { "epoch": 82.32098765432099, "grad_norm": 3.5079753398895264, "learning_rate": 1.7885714285714288e-06, "loss": 0.8957, "step": 3375 }, { "epoch": 82.93827160493827, "grad_norm": 3.3880198001861572, "learning_rate": 1.7171428571428572e-06, "loss": 0.8914, "step": 3400 }, { "epoch": 83.54320987654322, "grad_norm": 6.072048664093018, "learning_rate": 1.6457142857142857e-06, "loss": 0.8904, "step": 3425 }, { "epoch": 84.14814814814815, "grad_norm": 2.919877529144287, "learning_rate": 1.5742857142857143e-06, "loss": 0.8842, "step": 3450 }, { "epoch": 84.76543209876543, "grad_norm": 3.742579936981201, "learning_rate": 1.502857142857143e-06, "loss": 0.8903, "step": 3475 }, { "epoch": 85.37037037037037, "grad_norm": 3.9216341972351074, "learning_rate": 1.4314285714285717e-06, "loss": 0.8962, "step": 3500 }, { "epoch": 85.98765432098766, "grad_norm": 3.594411849975586, "learning_rate": 1.3600000000000001e-06, "loss": 0.894, "step": 3525 }, { "epoch": 86.5925925925926, "grad_norm": 3.7163913249969482, "learning_rate": 1.2885714285714287e-06, "loss": 0.8931, "step": 3550 }, { "epoch": 87.19753086419753, "grad_norm": 2.8378684520721436, "learning_rate": 1.2171428571428573e-06, "loss": 0.8855, "step": 3575 }, { "epoch": 87.81481481481481, "grad_norm": 3.5566790103912354, "learning_rate": 1.1457142857142859e-06, "loss": 0.8911, "step": 3600 }, { "epoch": 88.41975308641975, "grad_norm": 3.187382936477661, "learning_rate": 1.0742857142857145e-06, "loss": 0.8979, "step": 3625 }, { "epoch": 89.0246913580247, "grad_norm": 3.7930212020874023, "learning_rate": 1.0028571428571428e-06, "loss": 0.8824, "step": 3650 }, { "epoch": 89.64197530864197, "grad_norm": 3.2194180488586426, "learning_rate": 9.314285714285714e-07, "loss": 0.8915, "step": 3675 }, { "epoch": 90.24691358024691, "grad_norm": 3.050337076187134, "learning_rate": 8.6e-07, "loss": 0.8866, "step": 3700 }, { "epoch": 90.8641975308642, "grad_norm": 5.006812572479248, "learning_rate": 7.885714285714287e-07, "loss": 0.8877, "step": 3725 }, { "epoch": 91.46913580246914, "grad_norm": 3.206684112548828, "learning_rate": 7.171428571428572e-07, "loss": 0.8894, "step": 3750 }, { "epoch": 92.07407407407408, "grad_norm": 4.174693584442139, "learning_rate": 6.457142857142858e-07, "loss": 0.8906, "step": 3775 }, { "epoch": 92.69135802469135, "grad_norm": 5.580083847045898, "learning_rate": 5.742857142857143e-07, "loss": 0.8962, "step": 3800 }, { "epoch": 93.29629629629629, "grad_norm": 4.221833229064941, "learning_rate": 5.028571428571429e-07, "loss": 0.8886, "step": 3825 }, { "epoch": 93.91358024691358, "grad_norm": 3.687716484069824, "learning_rate": 4.3142857142857146e-07, "loss": 0.8911, "step": 3850 }, { "epoch": 94.51851851851852, "grad_norm": 4.194035530090332, "learning_rate": 3.6e-07, "loss": 0.889, "step": 3875 }, { "epoch": 95.12345679012346, "grad_norm": 4.321438312530518, "learning_rate": 2.885714285714286e-07, "loss": 0.8926, "step": 3900 }, { "epoch": 95.74074074074075, "grad_norm": 4.36216926574707, "learning_rate": 2.1714285714285715e-07, "loss": 0.8923, "step": 3925 }, { "epoch": 96.34567901234568, "grad_norm": 3.93856143951416, "learning_rate": 1.4571428571428574e-07, "loss": 0.8849, "step": 3950 }, { "epoch": 96.96296296296296, "grad_norm": 2.968627691268921, "learning_rate": 7.428571428571429e-08, "loss": 0.8904, "step": 3975 }, { "epoch": 97.5679012345679, "grad_norm": 16.590002059936523, "learning_rate": 2.8571428571428576e-09, "loss": 0.8853, "step": 4000 }, { "epoch": 97.5679012345679, "eval_loss": 0.8817942142486572, "eval_runtime": 2.1317, "eval_samples_per_second": 67.551, "eval_steps_per_second": 33.775, "step": 4000 } ], "logging_steps": 25, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 98, "save_steps": 1000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 3285475532317440.0, "train_batch_size": 4, "trial_name": null, "trial_params": null }