whisper-small-az / trainer_state.json
ramalMr's picture
Upload folder using huggingface_hub
60e4117 verified
Raw
History Blame Contribute Delete
33.5 kB
{
"best_global_step": 2000,
"best_metric": 100.0,
"best_model_checkpoint": "./whisper-small-az/checkpoint-2000",
"epoch": 1.0,
"eval_steps": 2000,
"global_step": 157959,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 6.330756715350186e-06,
"grad_norm": 18.461782455444336,
"learning_rate": 0.0,
"loss": 0.6858,
"step": 1
},
{
"epoch": 0.012661513430700372,
"grad_norm": 20.084333419799805,
"learning_rate": 4.952400307381604e-06,
"loss": 0.683,
"step": 2000
},
{
"epoch": 0.012661513430700372,
"eval_loss": 0.5455414652824402,
"eval_runtime": 164.1881,
"eval_samples_per_second": 1.218,
"eval_steps_per_second": 1.218,
"eval_wer": 100.0,
"step": 2000
},
{
"epoch": 0.025323026861400744,
"grad_norm": 15.010261535644531,
"learning_rate": 4.888891711493151e-06,
"loss": 0.4948,
"step": 4000
},
{
"epoch": 0.025323026861400744,
"eval_loss": 0.48741215467453003,
"eval_runtime": 97.6363,
"eval_samples_per_second": 2.048,
"eval_steps_per_second": 2.048,
"eval_wer": 100.0,
"step": 4000
},
{
"epoch": 0.03798454029210112,
"grad_norm": 17.379833221435547,
"learning_rate": 4.825383115604698e-06,
"loss": 0.4432,
"step": 6000
},
{
"epoch": 0.03798454029210112,
"eval_loss": 0.4483162760734558,
"eval_runtime": 181.4745,
"eval_samples_per_second": 1.102,
"eval_steps_per_second": 1.102,
"eval_wer": 100.0,
"step": 6000
},
{
"epoch": 0.05064605372280149,
"grad_norm": 26.042007446289062,
"learning_rate": 4.761874519716244e-06,
"loss": 0.4174,
"step": 8000
},
{
"epoch": 0.05064605372280149,
"eval_loss": 0.41587966680526733,
"eval_runtime": 111.3284,
"eval_samples_per_second": 1.796,
"eval_steps_per_second": 1.796,
"eval_wer": 100.0,
"step": 8000
},
{
"epoch": 0.06330756715350186,
"grad_norm": 23.43629264831543,
"learning_rate": 4.698365923827791e-06,
"loss": 0.3872,
"step": 10000
},
{
"epoch": 0.06330756715350186,
"eval_loss": 0.4035486578941345,
"eval_runtime": 97.0749,
"eval_samples_per_second": 2.06,
"eval_steps_per_second": 2.06,
"eval_wer": 100.0,
"step": 10000
},
{
"epoch": 0.07596908058420224,
"grad_norm": 15.88780403137207,
"learning_rate": 4.634857327939337e-06,
"loss": 0.3519,
"step": 12000
},
{
"epoch": 0.07596908058420224,
"eval_loss": 0.3873368203639984,
"eval_runtime": 127.0378,
"eval_samples_per_second": 1.574,
"eval_steps_per_second": 1.574,
"eval_wer": 100.0,
"step": 12000
},
{
"epoch": 0.0886305940149026,
"grad_norm": 14.359699249267578,
"learning_rate": 4.571348732050884e-06,
"loss": 0.3622,
"step": 14000
},
{
"epoch": 0.0886305940149026,
"eval_loss": 0.3693748712539673,
"eval_runtime": 115.6027,
"eval_samples_per_second": 1.73,
"eval_steps_per_second": 1.73,
"eval_wer": 100.0,
"step": 14000
},
{
"epoch": 0.10129210744560298,
"grad_norm": 34.34012222290039,
"learning_rate": 4.507840136162431e-06,
"loss": 0.3518,
"step": 16000
},
{
"epoch": 0.10129210744560298,
"eval_loss": 0.3601730465888977,
"eval_runtime": 100.1679,
"eval_samples_per_second": 1.997,
"eval_steps_per_second": 1.997,
"eval_wer": 100.0,
"step": 16000
},
{
"epoch": 0.11395362087630334,
"grad_norm": 13.935030937194824,
"learning_rate": 4.444331540273976e-06,
"loss": 0.3428,
"step": 18000
},
{
"epoch": 0.11395362087630334,
"eval_loss": 0.349777489900589,
"eval_runtime": 238.5911,
"eval_samples_per_second": 0.838,
"eval_steps_per_second": 0.838,
"eval_wer": 100.0,
"step": 18000
},
{
"epoch": 0.12661513430700372,
"grad_norm": 12.022929191589355,
"learning_rate": 4.380822944385523e-06,
"loss": 0.3322,
"step": 20000
},
{
"epoch": 0.12661513430700372,
"eval_loss": 0.3396839201450348,
"eval_runtime": 110.4827,
"eval_samples_per_second": 1.81,
"eval_steps_per_second": 1.81,
"eval_wer": 100.0,
"step": 20000
},
{
"epoch": 0.1392766477377041,
"grad_norm": 31.897066116333008,
"learning_rate": 4.3173143484970695e-06,
"loss": 0.3243,
"step": 22000
},
{
"epoch": 0.1392766477377041,
"eval_loss": 0.33299878239631653,
"eval_runtime": 112.72,
"eval_samples_per_second": 1.774,
"eval_steps_per_second": 1.774,
"eval_wer": 100.0,
"step": 22000
},
{
"epoch": 0.15193816116840447,
"grad_norm": 17.207157135009766,
"learning_rate": 4.2538057526086156e-06,
"loss": 0.3207,
"step": 24000
},
{
"epoch": 0.15193816116840447,
"eval_loss": 0.33643776178359985,
"eval_runtime": 99.1207,
"eval_samples_per_second": 2.018,
"eval_steps_per_second": 2.018,
"eval_wer": 100.0,
"step": 24000
},
{
"epoch": 0.16459967459910482,
"grad_norm": 29.34501075744629,
"learning_rate": 4.1902971567201624e-06,
"loss": 0.3118,
"step": 26000
},
{
"epoch": 0.16459967459910482,
"eval_loss": 0.3242020308971405,
"eval_runtime": 145.806,
"eval_samples_per_second": 1.372,
"eval_steps_per_second": 1.372,
"eval_wer": 100.0,
"step": 26000
},
{
"epoch": 0.1772611880298052,
"grad_norm": 13.88232421875,
"learning_rate": 4.1267885608317085e-06,
"loss": 0.3066,
"step": 28000
},
{
"epoch": 0.1772611880298052,
"eval_loss": 0.3177802264690399,
"eval_runtime": 117.2496,
"eval_samples_per_second": 1.706,
"eval_steps_per_second": 1.706,
"eval_wer": 100.0,
"step": 28000
},
{
"epoch": 0.18992270146050558,
"grad_norm": 10.003994941711426,
"learning_rate": 4.063279964943255e-06,
"loss": 0.3064,
"step": 30000
},
{
"epoch": 0.18992270146050558,
"eval_loss": 0.31194397807121277,
"eval_runtime": 98.5141,
"eval_samples_per_second": 2.03,
"eval_steps_per_second": 2.03,
"eval_wer": 100.0,
"step": 30000
},
{
"epoch": 0.20258421489120595,
"grad_norm": 27.381898880004883,
"learning_rate": 3.999771369054802e-06,
"loss": 0.3037,
"step": 32000
},
{
"epoch": 0.20258421489120595,
"eval_loss": 0.31087130308151245,
"eval_runtime": 115.818,
"eval_samples_per_second": 1.727,
"eval_steps_per_second": 1.727,
"eval_wer": 100.0,
"step": 32000
},
{
"epoch": 0.2152457283219063,
"grad_norm": 15.65439224243164,
"learning_rate": 3.936262773166348e-06,
"loss": 0.3001,
"step": 34000
},
{
"epoch": 0.2152457283219063,
"eval_loss": 0.30235540866851807,
"eval_runtime": 98.8755,
"eval_samples_per_second": 2.023,
"eval_steps_per_second": 2.023,
"eval_wer": 100.0,
"step": 34000
},
{
"epoch": 0.22790724175260668,
"grad_norm": 0.49147793650627136,
"learning_rate": 3.872754177277895e-06,
"loss": 0.2892,
"step": 36000
},
{
"epoch": 0.22790724175260668,
"eval_loss": 0.3077136278152466,
"eval_runtime": 167.6337,
"eval_samples_per_second": 1.193,
"eval_steps_per_second": 1.193,
"eval_wer": 100.0,
"step": 36000
},
{
"epoch": 0.24056875518330706,
"grad_norm": 23.69437026977539,
"learning_rate": 3.809245581389441e-06,
"loss": 0.2868,
"step": 38000
},
{
"epoch": 0.24056875518330706,
"eval_loss": 0.3034687936306,
"eval_runtime": 118.2635,
"eval_samples_per_second": 1.691,
"eval_steps_per_second": 1.691,
"eval_wer": 100.0,
"step": 38000
},
{
"epoch": 0.25323026861400744,
"grad_norm": 9.55330753326416,
"learning_rate": 3.745736985500988e-06,
"loss": 0.2869,
"step": 40000
},
{
"epoch": 0.25323026861400744,
"eval_loss": 0.3006068170070648,
"eval_runtime": 98.8792,
"eval_samples_per_second": 2.023,
"eval_steps_per_second": 2.023,
"eval_wer": 100.0,
"step": 40000
},
{
"epoch": 0.2658917820447078,
"grad_norm": 5.430517673492432,
"learning_rate": 3.6822283896125345e-06,
"loss": 0.3016,
"step": 42000
},
{
"epoch": 0.2658917820447078,
"eval_loss": 0.3174864649772644,
"eval_runtime": 120.0095,
"eval_samples_per_second": 1.667,
"eval_steps_per_second": 1.667,
"eval_wer": 100.0,
"step": 42000
},
{
"epoch": 0.2785532954754082,
"grad_norm": 2.0785741806030273,
"learning_rate": 3.618719793724081e-06,
"loss": 0.2745,
"step": 44000
},
{
"epoch": 0.2785532954754082,
"eval_loss": 0.2935592830181122,
"eval_runtime": 104.1383,
"eval_samples_per_second": 1.921,
"eval_steps_per_second": 1.921,
"eval_wer": 100.0,
"step": 44000
},
{
"epoch": 0.29121480890610857,
"grad_norm": 19.034826278686523,
"learning_rate": 3.5552111978356274e-06,
"loss": 0.2766,
"step": 46000
},
{
"epoch": 0.29121480890610857,
"eval_loss": 0.28297555446624756,
"eval_runtime": 128.9649,
"eval_samples_per_second": 1.551,
"eval_steps_per_second": 1.551,
"eval_wer": 100.0,
"step": 46000
},
{
"epoch": 0.30387632233680895,
"grad_norm": 5.441608905792236,
"learning_rate": 3.491702601947174e-06,
"loss": 0.2826,
"step": 48000
},
{
"epoch": 0.30387632233680895,
"eval_loss": 0.2824722230434418,
"eval_runtime": 111.7032,
"eval_samples_per_second": 1.79,
"eval_steps_per_second": 1.79,
"eval_wer": 100.0,
"step": 48000
},
{
"epoch": 0.31653783576750927,
"grad_norm": 25.043174743652344,
"learning_rate": 3.4281940060587203e-06,
"loss": 0.272,
"step": 50000
},
{
"epoch": 0.31653783576750927,
"eval_loss": 0.2822350263595581,
"eval_runtime": 99.249,
"eval_samples_per_second": 2.015,
"eval_steps_per_second": 2.015,
"eval_wer": 100.0,
"step": 50000
},
{
"epoch": 0.32919934919820965,
"grad_norm": 10.248320579528809,
"learning_rate": 3.364685410170267e-06,
"loss": 0.2721,
"step": 52000
},
{
"epoch": 0.32919934919820965,
"eval_loss": 0.2788018584251404,
"eval_runtime": 167.7003,
"eval_samples_per_second": 1.193,
"eval_steps_per_second": 1.193,
"eval_wer": 100.0,
"step": 52000
},
{
"epoch": 0.34186086262891,
"grad_norm": 15.632673263549805,
"learning_rate": 3.3011768142818136e-06,
"loss": 0.2748,
"step": 54000
},
{
"epoch": 0.34186086262891,
"eval_loss": 0.2818252146244049,
"eval_runtime": 115.5485,
"eval_samples_per_second": 1.731,
"eval_steps_per_second": 1.731,
"eval_wer": 100.0,
"step": 54000
},
{
"epoch": 0.3545223760596104,
"grad_norm": 22.526004791259766,
"learning_rate": 3.23766821839336e-06,
"loss": 0.2635,
"step": 56000
},
{
"epoch": 0.3545223760596104,
"eval_loss": 0.28214341402053833,
"eval_runtime": 98.4125,
"eval_samples_per_second": 2.032,
"eval_steps_per_second": 2.032,
"eval_wer": 100.0,
"step": 56000
},
{
"epoch": 0.3671838894903108,
"grad_norm": 13.596991539001465,
"learning_rate": 3.1741596225049065e-06,
"loss": 0.266,
"step": 58000
},
{
"epoch": 0.3671838894903108,
"eval_loss": 0.2786301374435425,
"eval_runtime": 112.9723,
"eval_samples_per_second": 1.77,
"eval_steps_per_second": 1.77,
"eval_wer": 100.0,
"step": 58000
},
{
"epoch": 0.37984540292101115,
"grad_norm": 20.539098739624023,
"learning_rate": 3.110651026616453e-06,
"loss": 0.2603,
"step": 60000
},
{
"epoch": 0.37984540292101115,
"eval_loss": 0.2836836278438568,
"eval_runtime": 98.7815,
"eval_samples_per_second": 2.025,
"eval_steps_per_second": 2.025,
"eval_wer": 100.0,
"step": 60000
},
{
"epoch": 0.39250691635171153,
"grad_norm": 9.462400436401367,
"learning_rate": 3.0471424307279994e-06,
"loss": 0.2589,
"step": 62000
},
{
"epoch": 0.39250691635171153,
"eval_loss": 0.28313395380973816,
"eval_runtime": 162.0004,
"eval_samples_per_second": 1.235,
"eval_steps_per_second": 1.235,
"eval_wer": 100.0,
"step": 62000
},
{
"epoch": 0.4051684297824119,
"grad_norm": 31.0218505859375,
"learning_rate": 2.9836338348395463e-06,
"loss": 0.2578,
"step": 64000
},
{
"epoch": 0.4051684297824119,
"eval_loss": 0.2877209782600403,
"eval_runtime": 119.6585,
"eval_samples_per_second": 1.671,
"eval_steps_per_second": 1.671,
"eval_wer": 100.0,
"step": 64000
},
{
"epoch": 0.4178299432131123,
"grad_norm": 16.72400665283203,
"learning_rate": 2.920125238951092e-06,
"loss": 0.2633,
"step": 66000
},
{
"epoch": 0.4178299432131123,
"eval_loss": 0.2801450490951538,
"eval_runtime": 102.711,
"eval_samples_per_second": 1.947,
"eval_steps_per_second": 1.947,
"eval_wer": 100.0,
"step": 66000
},
{
"epoch": 0.4304914566438126,
"grad_norm": 10.58651065826416,
"learning_rate": 2.8566166430626387e-06,
"loss": 0.2487,
"step": 68000
},
{
"epoch": 0.4304914566438126,
"eval_loss": 0.2773827016353607,
"eval_runtime": 119.5863,
"eval_samples_per_second": 1.672,
"eval_steps_per_second": 1.672,
"eval_wer": 100.0,
"step": 68000
},
{
"epoch": 0.443152970074513,
"grad_norm": 9.87272834777832,
"learning_rate": 2.793108047174185e-06,
"loss": 0.2429,
"step": 70000
},
{
"epoch": 0.443152970074513,
"eval_loss": 0.2784196734428406,
"eval_runtime": 110.2434,
"eval_samples_per_second": 1.814,
"eval_steps_per_second": 1.814,
"eval_wer": 100.0,
"step": 70000
},
{
"epoch": 0.45581448350521336,
"grad_norm": 17.528100967407227,
"learning_rate": 2.7295994512857316e-06,
"loss": 0.2474,
"step": 72000
},
{
"epoch": 0.45581448350521336,
"eval_loss": 0.275814414024353,
"eval_runtime": 99.8281,
"eval_samples_per_second": 2.003,
"eval_steps_per_second": 2.003,
"eval_wer": 100.0,
"step": 72000
},
{
"epoch": 0.46847599693591374,
"grad_norm": 26.67496681213379,
"learning_rate": 2.666090855397278e-06,
"loss": 0.2504,
"step": 74000
},
{
"epoch": 0.46847599693591374,
"eval_loss": 0.26936283707618713,
"eval_runtime": 175.1329,
"eval_samples_per_second": 1.142,
"eval_steps_per_second": 1.142,
"eval_wer": 100.0,
"step": 74000
},
{
"epoch": 0.4811375103666141,
"grad_norm": 7.970252990722656,
"learning_rate": 2.6025822595088245e-06,
"loss": 0.2571,
"step": 76000
},
{
"epoch": 0.4811375103666141,
"eval_loss": 0.26590612530708313,
"eval_runtime": 116.1576,
"eval_samples_per_second": 1.722,
"eval_steps_per_second": 1.722,
"eval_wer": 100.0,
"step": 76000
},
{
"epoch": 0.4937990237973145,
"grad_norm": 11.1566743850708,
"learning_rate": 2.539073663620371e-06,
"loss": 0.2483,
"step": 78000
},
{
"epoch": 0.4937990237973145,
"eval_loss": 0.2682250738143921,
"eval_runtime": 98.2738,
"eval_samples_per_second": 2.035,
"eval_steps_per_second": 2.035,
"eval_wer": 100.0,
"step": 78000
},
{
"epoch": 0.5064605372280149,
"grad_norm": 10.013092041015625,
"learning_rate": 2.4755650677319174e-06,
"loss": 0.245,
"step": 80000
},
{
"epoch": 0.5064605372280149,
"eval_loss": 0.2621174156665802,
"eval_runtime": 113.9651,
"eval_samples_per_second": 1.755,
"eval_steps_per_second": 1.755,
"eval_wer": 100.0,
"step": 80000
},
{
"epoch": 0.5191220506587152,
"grad_norm": 19.42994499206543,
"learning_rate": 2.4120564718434643e-06,
"loss": 0.2584,
"step": 82000
},
{
"epoch": 0.5191220506587152,
"eval_loss": 0.2639446556568146,
"eval_runtime": 100.2051,
"eval_samples_per_second": 1.996,
"eval_steps_per_second": 1.996,
"eval_wer": 100.0,
"step": 82000
},
{
"epoch": 0.5317835640894156,
"grad_norm": 4.659946918487549,
"learning_rate": 2.3485478759550108e-06,
"loss": 0.244,
"step": 84000
},
{
"epoch": 0.5317835640894156,
"eval_loss": 0.2655565142631531,
"eval_runtime": 139.2135,
"eval_samples_per_second": 1.437,
"eval_steps_per_second": 1.437,
"eval_wer": 100.0,
"step": 84000
},
{
"epoch": 0.544445077520116,
"grad_norm": 14.925030708312988,
"learning_rate": 2.2850392800665572e-06,
"loss": 0.2408,
"step": 86000
},
{
"epoch": 0.544445077520116,
"eval_loss": 0.2684570848941803,
"eval_runtime": 117.6776,
"eval_samples_per_second": 1.7,
"eval_steps_per_second": 1.7,
"eval_wer": 100.0,
"step": 86000
},
{
"epoch": 0.5571065909508164,
"grad_norm": 17.363605499267578,
"learning_rate": 2.2215306841781037e-06,
"loss": 0.2398,
"step": 88000
},
{
"epoch": 0.5571065909508164,
"eval_loss": 0.2665661573410034,
"eval_runtime": 100.8416,
"eval_samples_per_second": 1.983,
"eval_steps_per_second": 1.983,
"eval_wer": 100.0,
"step": 88000
},
{
"epoch": 0.5697681043815167,
"grad_norm": 7.914783477783203,
"learning_rate": 2.15802208828965e-06,
"loss": 0.2417,
"step": 90000
},
{
"epoch": 0.5697681043815167,
"eval_loss": 0.25880980491638184,
"eval_runtime": 114.0038,
"eval_samples_per_second": 1.754,
"eval_steps_per_second": 1.754,
"eval_wer": 100.0,
"step": 90000
},
{
"epoch": 0.5824296178122171,
"grad_norm": 6.1498517990112305,
"learning_rate": 2.0945134924011966e-06,
"loss": 0.2367,
"step": 92000
},
{
"epoch": 0.5824296178122171,
"eval_loss": 0.25671330094337463,
"eval_runtime": 99.2437,
"eval_samples_per_second": 2.015,
"eval_steps_per_second": 2.015,
"eval_wer": 100.0,
"step": 92000
},
{
"epoch": 0.5950911312429175,
"grad_norm": 15.99548625946045,
"learning_rate": 2.0310048965127434e-06,
"loss": 0.2492,
"step": 94000
},
{
"epoch": 0.5950911312429175,
"eval_loss": 0.256805419921875,
"eval_runtime": 157.1247,
"eval_samples_per_second": 1.273,
"eval_steps_per_second": 1.273,
"eval_wer": 100.0,
"step": 94000
},
{
"epoch": 0.6077526446736179,
"grad_norm": 24.078039169311523,
"learning_rate": 1.96749630062429e-06,
"loss": 0.234,
"step": 96000
},
{
"epoch": 0.6077526446736179,
"eval_loss": 0.25336185097694397,
"eval_runtime": 117.2279,
"eval_samples_per_second": 1.706,
"eval_steps_per_second": 1.706,
"eval_wer": 100.0,
"step": 96000
},
{
"epoch": 0.6204141581043182,
"grad_norm": 13.121466636657715,
"learning_rate": 1.9039877047358363e-06,
"loss": 0.2338,
"step": 98000
},
{
"epoch": 0.6204141581043182,
"eval_loss": 0.255278617143631,
"eval_runtime": 99.8788,
"eval_samples_per_second": 2.002,
"eval_steps_per_second": 2.002,
"eval_wer": 100.0,
"step": 98000
},
{
"epoch": 0.6330756715350185,
"grad_norm": 9.44789981842041,
"learning_rate": 1.8404791088473826e-06,
"loss": 0.2307,
"step": 100000
},
{
"epoch": 0.6330756715350185,
"eval_loss": 0.2485535740852356,
"eval_runtime": 114.476,
"eval_samples_per_second": 1.747,
"eval_steps_per_second": 1.747,
"eval_wer": 100.0,
"step": 100000
},
{
"epoch": 0.645737184965719,
"grad_norm": 16.697378158569336,
"learning_rate": 1.776970512958929e-06,
"loss": 0.2343,
"step": 102000
},
{
"epoch": 0.645737184965719,
"eval_loss": 0.2523353695869446,
"eval_runtime": 99.8529,
"eval_samples_per_second": 2.003,
"eval_steps_per_second": 2.003,
"eval_wer": 100.0,
"step": 102000
},
{
"epoch": 0.6583986983964193,
"grad_norm": 11.517345428466797,
"learning_rate": 1.7134619170704755e-06,
"loss": 0.2366,
"step": 104000
},
{
"epoch": 0.6583986983964193,
"eval_loss": 0.2554631531238556,
"eval_runtime": 135.1832,
"eval_samples_per_second": 1.479,
"eval_steps_per_second": 1.479,
"eval_wer": 100.0,
"step": 104000
},
{
"epoch": 0.6710602118271197,
"grad_norm": 22.604074478149414,
"learning_rate": 1.6499533211820221e-06,
"loss": 0.2323,
"step": 106000
},
{
"epoch": 0.6710602118271197,
"eval_loss": 0.2547050416469574,
"eval_runtime": 121.0754,
"eval_samples_per_second": 1.652,
"eval_steps_per_second": 1.652,
"eval_wer": 100.0,
"step": 106000
},
{
"epoch": 0.68372172525782,
"grad_norm": 14.323906898498535,
"learning_rate": 1.5864447252935686e-06,
"loss": 0.2343,
"step": 108000
},
{
"epoch": 0.68372172525782,
"eval_loss": 0.2524075508117676,
"eval_runtime": 103.5538,
"eval_samples_per_second": 1.931,
"eval_steps_per_second": 1.931,
"eval_wer": 100.0,
"step": 108000
},
{
"epoch": 0.6963832386885205,
"grad_norm": 11.585010528564453,
"learning_rate": 1.522936129405115e-06,
"loss": 0.2348,
"step": 110000
},
{
"epoch": 0.6963832386885205,
"eval_loss": 0.24542486667633057,
"eval_runtime": 124.354,
"eval_samples_per_second": 1.608,
"eval_steps_per_second": 1.608,
"eval_wer": 100.0,
"step": 110000
},
{
"epoch": 0.7090447521192208,
"grad_norm": 13.175851821899414,
"learning_rate": 1.4594275335166617e-06,
"loss": 0.245,
"step": 112000
},
{
"epoch": 0.7090447521192208,
"eval_loss": 0.24049542844295502,
"eval_runtime": 112.7155,
"eval_samples_per_second": 1.774,
"eval_steps_per_second": 1.774,
"eval_wer": 100.0,
"step": 112000
},
{
"epoch": 0.7217062655499212,
"grad_norm": 5.587381839752197,
"learning_rate": 1.3959189376282082e-06,
"loss": 0.2332,
"step": 114000
},
{
"epoch": 0.7217062655499212,
"eval_loss": 0.23937122523784637,
"eval_runtime": 102.231,
"eval_samples_per_second": 1.956,
"eval_steps_per_second": 1.956,
"eval_wer": 100.0,
"step": 114000
},
{
"epoch": 0.7343677789806216,
"grad_norm": 39.2594108581543,
"learning_rate": 1.3324103417397546e-06,
"loss": 0.2251,
"step": 116000
},
{
"epoch": 0.7343677789806216,
"eval_loss": 0.24494153261184692,
"eval_runtime": 111.2917,
"eval_samples_per_second": 1.797,
"eval_steps_per_second": 1.797,
"eval_wer": 100.0,
"step": 116000
},
{
"epoch": 0.7470292924113219,
"grad_norm": 13.437777519226074,
"learning_rate": 1.268901745851301e-06,
"loss": 0.2279,
"step": 118000
},
{
"epoch": 0.7470292924113219,
"eval_loss": 0.24640831351280212,
"eval_runtime": 100.079,
"eval_samples_per_second": 1.998,
"eval_steps_per_second": 1.998,
"eval_wer": 100.0,
"step": 118000
},
{
"epoch": 0.7596908058420223,
"grad_norm": 17.973445892333984,
"learning_rate": 1.2053931499628475e-06,
"loss": 0.2269,
"step": 120000
},
{
"epoch": 0.7596908058420223,
"eval_loss": 0.2451734095811844,
"eval_runtime": 150.8961,
"eval_samples_per_second": 1.325,
"eval_steps_per_second": 1.325,
"eval_wer": 100.0,
"step": 120000
},
{
"epoch": 0.7723523192727226,
"grad_norm": 1.6845195293426514,
"learning_rate": 1.141884554074394e-06,
"loss": 0.2303,
"step": 122000
},
{
"epoch": 0.7723523192727226,
"eval_loss": 0.23949329555034637,
"eval_runtime": 119.1671,
"eval_samples_per_second": 1.678,
"eval_steps_per_second": 1.678,
"eval_wer": 100.0,
"step": 122000
},
{
"epoch": 0.7850138327034231,
"grad_norm": 19.897830963134766,
"learning_rate": 1.0783759581859406e-06,
"loss": 0.2127,
"step": 124000
},
{
"epoch": 0.7850138327034231,
"eval_loss": 0.24049174785614014,
"eval_runtime": 102.2185,
"eval_samples_per_second": 1.957,
"eval_steps_per_second": 1.957,
"eval_wer": 100.0,
"step": 124000
},
{
"epoch": 0.7976753461341234,
"grad_norm": 12.614727973937988,
"learning_rate": 1.014867362297487e-06,
"loss": 0.2289,
"step": 126000
},
{
"epoch": 0.7976753461341234,
"eval_loss": 0.2411843240261078,
"eval_runtime": 116.078,
"eval_samples_per_second": 1.723,
"eval_steps_per_second": 1.723,
"eval_wer": 100.0,
"step": 126000
},
{
"epoch": 0.8103368595648238,
"grad_norm": 19.16327476501465,
"learning_rate": 9.513587664090336e-07,
"loss": 0.2169,
"step": 128000
},
{
"epoch": 0.8103368595648238,
"eval_loss": 0.2375524491071701,
"eval_runtime": 99.6286,
"eval_samples_per_second": 2.007,
"eval_steps_per_second": 2.007,
"eval_wer": 100.0,
"step": 128000
},
{
"epoch": 0.8229983729955241,
"grad_norm": 17.00189781188965,
"learning_rate": 8.8785017052058e-07,
"loss": 0.234,
"step": 130000
},
{
"epoch": 0.8229983729955241,
"eval_loss": 0.23726019263267517,
"eval_runtime": 128.4372,
"eval_samples_per_second": 1.557,
"eval_steps_per_second": 1.557,
"eval_wer": 100.0,
"step": 130000
},
{
"epoch": 0.8356598864262246,
"grad_norm": 7.840052127838135,
"learning_rate": 8.243415746321265e-07,
"loss": 0.2282,
"step": 132000
},
{
"epoch": 0.8356598864262246,
"eval_loss": 0.23711390793323517,
"eval_runtime": 118.2074,
"eval_samples_per_second": 1.692,
"eval_steps_per_second": 1.692,
"eval_wer": 100.0,
"step": 132000
},
{
"epoch": 0.8483213998569249,
"grad_norm": 23.74713706970215,
"learning_rate": 7.60832978743673e-07,
"loss": 0.2323,
"step": 134000
},
{
"epoch": 0.8483213998569249,
"eval_loss": 0.232102170586586,
"eval_runtime": 102.3613,
"eval_samples_per_second": 1.954,
"eval_steps_per_second": 1.954,
"eval_wer": 100.0,
"step": 134000
},
{
"epoch": 0.8609829132876252,
"grad_norm": 10.603443145751953,
"learning_rate": 6.973243828552195e-07,
"loss": 0.2222,
"step": 136000
},
{
"epoch": 0.8609829132876252,
"eval_loss": 0.23403330147266388,
"eval_runtime": 122.2087,
"eval_samples_per_second": 1.637,
"eval_steps_per_second": 1.637,
"eval_wer": 100.0,
"step": 136000
},
{
"epoch": 0.8736444267183257,
"grad_norm": 14.557578086853027,
"learning_rate": 6.338157869667661e-07,
"loss": 0.2223,
"step": 138000
},
{
"epoch": 0.8736444267183257,
"eval_loss": 0.23369312286376953,
"eval_runtime": 111.0931,
"eval_samples_per_second": 1.8,
"eval_steps_per_second": 1.8,
"eval_wer": 100.0,
"step": 138000
},
{
"epoch": 0.886305940149026,
"grad_norm": 21.674922943115234,
"learning_rate": 5.703071910783125e-07,
"loss": 0.2211,
"step": 140000
},
{
"epoch": 0.886305940149026,
"eval_loss": 0.2323533594608307,
"eval_runtime": 103.9127,
"eval_samples_per_second": 1.925,
"eval_steps_per_second": 1.925,
"eval_wer": 100.0,
"step": 140000
},
{
"epoch": 0.8989674535797264,
"grad_norm": 4.280592918395996,
"learning_rate": 5.06798595189859e-07,
"loss": 0.2066,
"step": 142000
},
{
"epoch": 0.8989674535797264,
"eval_loss": 0.23401407897472382,
"eval_runtime": 112.7995,
"eval_samples_per_second": 1.773,
"eval_steps_per_second": 1.773,
"eval_wer": 100.0,
"step": 142000
},
{
"epoch": 0.9116289670104267,
"grad_norm": 3.850653886795044,
"learning_rate": 4.4328999930140544e-07,
"loss": 0.2283,
"step": 144000
},
{
"epoch": 0.9116289670104267,
"eval_loss": 0.2337852418422699,
"eval_runtime": 102.0048,
"eval_samples_per_second": 1.961,
"eval_steps_per_second": 1.961,
"eval_wer": 100.0,
"step": 144000
},
{
"epoch": 0.9242904804411272,
"grad_norm": 7.110324382781982,
"learning_rate": 3.7978140341295195e-07,
"loss": 0.2232,
"step": 146000
},
{
"epoch": 0.9242904804411272,
"eval_loss": 0.23404987156391144,
"eval_runtime": 118.1946,
"eval_samples_per_second": 1.692,
"eval_steps_per_second": 1.692,
"eval_wer": 100.0,
"step": 146000
},
{
"epoch": 0.9369519938718275,
"grad_norm": 4.778629302978516,
"learning_rate": 3.162728075244985e-07,
"loss": 0.2184,
"step": 148000
},
{
"epoch": 0.9369519938718275,
"eval_loss": 0.2326117902994156,
"eval_runtime": 118.5384,
"eval_samples_per_second": 1.687,
"eval_steps_per_second": 1.687,
"eval_wer": 100.0,
"step": 148000
},
{
"epoch": 0.9496135073025279,
"grad_norm": 7.637845039367676,
"learning_rate": 2.5276421163604495e-07,
"loss": 0.218,
"step": 150000
},
{
"epoch": 0.9496135073025279,
"eval_loss": 0.2330457717180252,
"eval_runtime": 103.0085,
"eval_samples_per_second": 1.942,
"eval_steps_per_second": 1.942,
"eval_wer": 100.0,
"step": 150000
},
{
"epoch": 0.9622750207332282,
"grad_norm": 18.473331451416016,
"learning_rate": 1.8925561574759146e-07,
"loss": 0.2217,
"step": 152000
},
{
"epoch": 0.9622750207332282,
"eval_loss": 0.23135539889335632,
"eval_runtime": 116.9612,
"eval_samples_per_second": 1.71,
"eval_steps_per_second": 1.71,
"eval_wer": 100.0,
"step": 152000
},
{
"epoch": 0.9749365341639287,
"grad_norm": 9.762419700622559,
"learning_rate": 1.2574701985913796e-07,
"loss": 0.2197,
"step": 154000
},
{
"epoch": 0.9749365341639287,
"eval_loss": 0.23144523799419403,
"eval_runtime": 101.6277,
"eval_samples_per_second": 1.968,
"eval_steps_per_second": 1.968,
"eval_wer": 100.0,
"step": 154000
},
{
"epoch": 0.987598047594629,
"grad_norm": 7.513221263885498,
"learning_rate": 6.223842397068444e-08,
"loss": 0.2157,
"step": 156000
},
{
"epoch": 0.987598047594629,
"eval_loss": 0.23098862171173096,
"eval_runtime": 110.3102,
"eval_samples_per_second": 1.813,
"eval_steps_per_second": 1.813,
"eval_wer": 100.0,
"step": 156000
}
],
"logging_steps": 2000,
"max_steps": 157959,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 2000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 9.116903391289344e+19,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}