{ "best_global_step": 2000, "best_metric": 100.0, "best_model_checkpoint": "./whisper-small-az/checkpoint-2000", "epoch": 1.0, "eval_steps": 2000, "global_step": 157959, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 6.330756715350186e-06, "grad_norm": 18.461782455444336, "learning_rate": 0.0, "loss": 0.6858, "step": 1 }, { "epoch": 0.012661513430700372, "grad_norm": 20.084333419799805, "learning_rate": 4.952400307381604e-06, "loss": 0.683, "step": 2000 }, { "epoch": 0.012661513430700372, "eval_loss": 0.5455414652824402, "eval_runtime": 164.1881, "eval_samples_per_second": 1.218, "eval_steps_per_second": 1.218, "eval_wer": 100.0, "step": 2000 }, { "epoch": 0.025323026861400744, "grad_norm": 15.010261535644531, "learning_rate": 4.888891711493151e-06, "loss": 0.4948, "step": 4000 }, { "epoch": 0.025323026861400744, "eval_loss": 0.48741215467453003, "eval_runtime": 97.6363, "eval_samples_per_second": 2.048, "eval_steps_per_second": 2.048, "eval_wer": 100.0, "step": 4000 }, { "epoch": 0.03798454029210112, "grad_norm": 17.379833221435547, "learning_rate": 4.825383115604698e-06, "loss": 0.4432, "step": 6000 }, { "epoch": 0.03798454029210112, "eval_loss": 0.4483162760734558, "eval_runtime": 181.4745, "eval_samples_per_second": 1.102, "eval_steps_per_second": 1.102, "eval_wer": 100.0, "step": 6000 }, { "epoch": 0.05064605372280149, "grad_norm": 26.042007446289062, "learning_rate": 4.761874519716244e-06, "loss": 0.4174, "step": 8000 }, { "epoch": 0.05064605372280149, "eval_loss": 0.41587966680526733, "eval_runtime": 111.3284, "eval_samples_per_second": 1.796, "eval_steps_per_second": 1.796, "eval_wer": 100.0, "step": 8000 }, { "epoch": 0.06330756715350186, "grad_norm": 23.43629264831543, "learning_rate": 4.698365923827791e-06, "loss": 0.3872, "step": 10000 }, { "epoch": 0.06330756715350186, "eval_loss": 0.4035486578941345, "eval_runtime": 97.0749, "eval_samples_per_second": 2.06, "eval_steps_per_second": 2.06, "eval_wer": 100.0, "step": 10000 }, { "epoch": 0.07596908058420224, "grad_norm": 15.88780403137207, "learning_rate": 4.634857327939337e-06, "loss": 0.3519, "step": 12000 }, { "epoch": 0.07596908058420224, "eval_loss": 0.3873368203639984, "eval_runtime": 127.0378, "eval_samples_per_second": 1.574, "eval_steps_per_second": 1.574, "eval_wer": 100.0, "step": 12000 }, { "epoch": 0.0886305940149026, "grad_norm": 14.359699249267578, "learning_rate": 4.571348732050884e-06, "loss": 0.3622, "step": 14000 }, { "epoch": 0.0886305940149026, "eval_loss": 0.3693748712539673, "eval_runtime": 115.6027, "eval_samples_per_second": 1.73, "eval_steps_per_second": 1.73, "eval_wer": 100.0, "step": 14000 }, { "epoch": 0.10129210744560298, "grad_norm": 34.34012222290039, "learning_rate": 4.507840136162431e-06, "loss": 0.3518, "step": 16000 }, { "epoch": 0.10129210744560298, "eval_loss": 0.3601730465888977, "eval_runtime": 100.1679, "eval_samples_per_second": 1.997, "eval_steps_per_second": 1.997, "eval_wer": 100.0, "step": 16000 }, { "epoch": 0.11395362087630334, "grad_norm": 13.935030937194824, "learning_rate": 4.444331540273976e-06, "loss": 0.3428, "step": 18000 }, { "epoch": 0.11395362087630334, "eval_loss": 0.349777489900589, "eval_runtime": 238.5911, "eval_samples_per_second": 0.838, "eval_steps_per_second": 0.838, "eval_wer": 100.0, "step": 18000 }, { "epoch": 0.12661513430700372, "grad_norm": 12.022929191589355, "learning_rate": 4.380822944385523e-06, "loss": 0.3322, "step": 20000 }, { "epoch": 0.12661513430700372, "eval_loss": 0.3396839201450348, "eval_runtime": 110.4827, "eval_samples_per_second": 1.81, "eval_steps_per_second": 1.81, "eval_wer": 100.0, "step": 20000 }, { "epoch": 0.1392766477377041, "grad_norm": 31.897066116333008, "learning_rate": 4.3173143484970695e-06, "loss": 0.3243, "step": 22000 }, { "epoch": 0.1392766477377041, "eval_loss": 0.33299878239631653, "eval_runtime": 112.72, "eval_samples_per_second": 1.774, "eval_steps_per_second": 1.774, "eval_wer": 100.0, "step": 22000 }, { "epoch": 0.15193816116840447, "grad_norm": 17.207157135009766, "learning_rate": 4.2538057526086156e-06, "loss": 0.3207, "step": 24000 }, { "epoch": 0.15193816116840447, "eval_loss": 0.33643776178359985, "eval_runtime": 99.1207, "eval_samples_per_second": 2.018, "eval_steps_per_second": 2.018, "eval_wer": 100.0, "step": 24000 }, { "epoch": 0.16459967459910482, "grad_norm": 29.34501075744629, "learning_rate": 4.1902971567201624e-06, "loss": 0.3118, "step": 26000 }, { "epoch": 0.16459967459910482, "eval_loss": 0.3242020308971405, "eval_runtime": 145.806, "eval_samples_per_second": 1.372, "eval_steps_per_second": 1.372, "eval_wer": 100.0, "step": 26000 }, { "epoch": 0.1772611880298052, "grad_norm": 13.88232421875, "learning_rate": 4.1267885608317085e-06, "loss": 0.3066, "step": 28000 }, { "epoch": 0.1772611880298052, "eval_loss": 0.3177802264690399, "eval_runtime": 117.2496, "eval_samples_per_second": 1.706, "eval_steps_per_second": 1.706, "eval_wer": 100.0, "step": 28000 }, { "epoch": 0.18992270146050558, "grad_norm": 10.003994941711426, "learning_rate": 4.063279964943255e-06, "loss": 0.3064, "step": 30000 }, { "epoch": 0.18992270146050558, "eval_loss": 0.31194397807121277, "eval_runtime": 98.5141, "eval_samples_per_second": 2.03, "eval_steps_per_second": 2.03, "eval_wer": 100.0, "step": 30000 }, { "epoch": 0.20258421489120595, "grad_norm": 27.381898880004883, "learning_rate": 3.999771369054802e-06, "loss": 0.3037, "step": 32000 }, { "epoch": 0.20258421489120595, "eval_loss": 0.31087130308151245, "eval_runtime": 115.818, "eval_samples_per_second": 1.727, "eval_steps_per_second": 1.727, "eval_wer": 100.0, "step": 32000 }, { "epoch": 0.2152457283219063, "grad_norm": 15.65439224243164, "learning_rate": 3.936262773166348e-06, "loss": 0.3001, "step": 34000 }, { "epoch": 0.2152457283219063, "eval_loss": 0.30235540866851807, "eval_runtime": 98.8755, "eval_samples_per_second": 2.023, "eval_steps_per_second": 2.023, "eval_wer": 100.0, "step": 34000 }, { "epoch": 0.22790724175260668, "grad_norm": 0.49147793650627136, "learning_rate": 3.872754177277895e-06, "loss": 0.2892, "step": 36000 }, { "epoch": 0.22790724175260668, "eval_loss": 0.3077136278152466, "eval_runtime": 167.6337, "eval_samples_per_second": 1.193, "eval_steps_per_second": 1.193, "eval_wer": 100.0, "step": 36000 }, { "epoch": 0.24056875518330706, "grad_norm": 23.69437026977539, "learning_rate": 3.809245581389441e-06, "loss": 0.2868, "step": 38000 }, { "epoch": 0.24056875518330706, "eval_loss": 0.3034687936306, "eval_runtime": 118.2635, "eval_samples_per_second": 1.691, "eval_steps_per_second": 1.691, "eval_wer": 100.0, "step": 38000 }, { "epoch": 0.25323026861400744, "grad_norm": 9.55330753326416, "learning_rate": 3.745736985500988e-06, "loss": 0.2869, "step": 40000 }, { "epoch": 0.25323026861400744, "eval_loss": 0.3006068170070648, "eval_runtime": 98.8792, "eval_samples_per_second": 2.023, "eval_steps_per_second": 2.023, "eval_wer": 100.0, "step": 40000 }, { "epoch": 0.2658917820447078, "grad_norm": 5.430517673492432, "learning_rate": 3.6822283896125345e-06, "loss": 0.3016, "step": 42000 }, { "epoch": 0.2658917820447078, "eval_loss": 0.3174864649772644, "eval_runtime": 120.0095, "eval_samples_per_second": 1.667, "eval_steps_per_second": 1.667, "eval_wer": 100.0, "step": 42000 }, { "epoch": 0.2785532954754082, "grad_norm": 2.0785741806030273, "learning_rate": 3.618719793724081e-06, "loss": 0.2745, "step": 44000 }, { "epoch": 0.2785532954754082, "eval_loss": 0.2935592830181122, "eval_runtime": 104.1383, "eval_samples_per_second": 1.921, "eval_steps_per_second": 1.921, "eval_wer": 100.0, "step": 44000 }, { "epoch": 0.29121480890610857, "grad_norm": 19.034826278686523, "learning_rate": 3.5552111978356274e-06, "loss": 0.2766, "step": 46000 }, { "epoch": 0.29121480890610857, "eval_loss": 0.28297555446624756, "eval_runtime": 128.9649, "eval_samples_per_second": 1.551, "eval_steps_per_second": 1.551, "eval_wer": 100.0, "step": 46000 }, { "epoch": 0.30387632233680895, "grad_norm": 5.441608905792236, "learning_rate": 3.491702601947174e-06, "loss": 0.2826, "step": 48000 }, { "epoch": 0.30387632233680895, "eval_loss": 0.2824722230434418, "eval_runtime": 111.7032, "eval_samples_per_second": 1.79, "eval_steps_per_second": 1.79, "eval_wer": 100.0, "step": 48000 }, { "epoch": 0.31653783576750927, "grad_norm": 25.043174743652344, "learning_rate": 3.4281940060587203e-06, "loss": 0.272, "step": 50000 }, { "epoch": 0.31653783576750927, "eval_loss": 0.2822350263595581, "eval_runtime": 99.249, "eval_samples_per_second": 2.015, "eval_steps_per_second": 2.015, "eval_wer": 100.0, "step": 50000 }, { "epoch": 0.32919934919820965, "grad_norm": 10.248320579528809, "learning_rate": 3.364685410170267e-06, "loss": 0.2721, "step": 52000 }, { "epoch": 0.32919934919820965, "eval_loss": 0.2788018584251404, "eval_runtime": 167.7003, "eval_samples_per_second": 1.193, "eval_steps_per_second": 1.193, "eval_wer": 100.0, "step": 52000 }, { "epoch": 0.34186086262891, "grad_norm": 15.632673263549805, "learning_rate": 3.3011768142818136e-06, "loss": 0.2748, "step": 54000 }, { "epoch": 0.34186086262891, "eval_loss": 0.2818252146244049, "eval_runtime": 115.5485, "eval_samples_per_second": 1.731, "eval_steps_per_second": 1.731, "eval_wer": 100.0, "step": 54000 }, { "epoch": 0.3545223760596104, "grad_norm": 22.526004791259766, "learning_rate": 3.23766821839336e-06, "loss": 0.2635, "step": 56000 }, { "epoch": 0.3545223760596104, "eval_loss": 0.28214341402053833, "eval_runtime": 98.4125, "eval_samples_per_second": 2.032, "eval_steps_per_second": 2.032, "eval_wer": 100.0, "step": 56000 }, { "epoch": 0.3671838894903108, "grad_norm": 13.596991539001465, "learning_rate": 3.1741596225049065e-06, "loss": 0.266, "step": 58000 }, { "epoch": 0.3671838894903108, "eval_loss": 0.2786301374435425, "eval_runtime": 112.9723, "eval_samples_per_second": 1.77, "eval_steps_per_second": 1.77, "eval_wer": 100.0, "step": 58000 }, { "epoch": 0.37984540292101115, "grad_norm": 20.539098739624023, "learning_rate": 3.110651026616453e-06, "loss": 0.2603, "step": 60000 }, { "epoch": 0.37984540292101115, "eval_loss": 0.2836836278438568, "eval_runtime": 98.7815, "eval_samples_per_second": 2.025, "eval_steps_per_second": 2.025, "eval_wer": 100.0, "step": 60000 }, { "epoch": 0.39250691635171153, "grad_norm": 9.462400436401367, "learning_rate": 3.0471424307279994e-06, "loss": 0.2589, "step": 62000 }, { "epoch": 0.39250691635171153, "eval_loss": 0.28313395380973816, "eval_runtime": 162.0004, "eval_samples_per_second": 1.235, "eval_steps_per_second": 1.235, "eval_wer": 100.0, "step": 62000 }, { "epoch": 0.4051684297824119, "grad_norm": 31.0218505859375, "learning_rate": 2.9836338348395463e-06, "loss": 0.2578, "step": 64000 }, { "epoch": 0.4051684297824119, "eval_loss": 0.2877209782600403, "eval_runtime": 119.6585, "eval_samples_per_second": 1.671, "eval_steps_per_second": 1.671, "eval_wer": 100.0, "step": 64000 }, { "epoch": 0.4178299432131123, "grad_norm": 16.72400665283203, "learning_rate": 2.920125238951092e-06, "loss": 0.2633, "step": 66000 }, { "epoch": 0.4178299432131123, "eval_loss": 0.2801450490951538, "eval_runtime": 102.711, "eval_samples_per_second": 1.947, "eval_steps_per_second": 1.947, "eval_wer": 100.0, "step": 66000 }, { "epoch": 0.4304914566438126, "grad_norm": 10.58651065826416, "learning_rate": 2.8566166430626387e-06, "loss": 0.2487, "step": 68000 }, { "epoch": 0.4304914566438126, "eval_loss": 0.2773827016353607, "eval_runtime": 119.5863, "eval_samples_per_second": 1.672, "eval_steps_per_second": 1.672, "eval_wer": 100.0, "step": 68000 }, { "epoch": 0.443152970074513, "grad_norm": 9.87272834777832, "learning_rate": 2.793108047174185e-06, "loss": 0.2429, "step": 70000 }, { "epoch": 0.443152970074513, "eval_loss": 0.2784196734428406, "eval_runtime": 110.2434, "eval_samples_per_second": 1.814, "eval_steps_per_second": 1.814, "eval_wer": 100.0, "step": 70000 }, { "epoch": 0.45581448350521336, "grad_norm": 17.528100967407227, "learning_rate": 2.7295994512857316e-06, "loss": 0.2474, "step": 72000 }, { "epoch": 0.45581448350521336, "eval_loss": 0.275814414024353, "eval_runtime": 99.8281, "eval_samples_per_second": 2.003, "eval_steps_per_second": 2.003, "eval_wer": 100.0, "step": 72000 }, { "epoch": 0.46847599693591374, "grad_norm": 26.67496681213379, "learning_rate": 2.666090855397278e-06, "loss": 0.2504, "step": 74000 }, { "epoch": 0.46847599693591374, "eval_loss": 0.26936283707618713, "eval_runtime": 175.1329, "eval_samples_per_second": 1.142, "eval_steps_per_second": 1.142, "eval_wer": 100.0, "step": 74000 }, { "epoch": 0.4811375103666141, "grad_norm": 7.970252990722656, "learning_rate": 2.6025822595088245e-06, "loss": 0.2571, "step": 76000 }, { "epoch": 0.4811375103666141, "eval_loss": 0.26590612530708313, "eval_runtime": 116.1576, "eval_samples_per_second": 1.722, "eval_steps_per_second": 1.722, "eval_wer": 100.0, "step": 76000 }, { "epoch": 0.4937990237973145, "grad_norm": 11.1566743850708, "learning_rate": 2.539073663620371e-06, "loss": 0.2483, "step": 78000 }, { "epoch": 0.4937990237973145, "eval_loss": 0.2682250738143921, "eval_runtime": 98.2738, "eval_samples_per_second": 2.035, "eval_steps_per_second": 2.035, "eval_wer": 100.0, "step": 78000 }, { "epoch": 0.5064605372280149, "grad_norm": 10.013092041015625, "learning_rate": 2.4755650677319174e-06, "loss": 0.245, "step": 80000 }, { "epoch": 0.5064605372280149, "eval_loss": 0.2621174156665802, "eval_runtime": 113.9651, "eval_samples_per_second": 1.755, "eval_steps_per_second": 1.755, "eval_wer": 100.0, "step": 80000 }, { "epoch": 0.5191220506587152, "grad_norm": 19.42994499206543, "learning_rate": 2.4120564718434643e-06, "loss": 0.2584, "step": 82000 }, { "epoch": 0.5191220506587152, "eval_loss": 0.2639446556568146, "eval_runtime": 100.2051, "eval_samples_per_second": 1.996, "eval_steps_per_second": 1.996, "eval_wer": 100.0, "step": 82000 }, { "epoch": 0.5317835640894156, "grad_norm": 4.659946918487549, "learning_rate": 2.3485478759550108e-06, "loss": 0.244, "step": 84000 }, { "epoch": 0.5317835640894156, "eval_loss": 0.2655565142631531, "eval_runtime": 139.2135, "eval_samples_per_second": 1.437, "eval_steps_per_second": 1.437, "eval_wer": 100.0, "step": 84000 }, { "epoch": 0.544445077520116, "grad_norm": 14.925030708312988, "learning_rate": 2.2850392800665572e-06, "loss": 0.2408, "step": 86000 }, { "epoch": 0.544445077520116, "eval_loss": 0.2684570848941803, "eval_runtime": 117.6776, "eval_samples_per_second": 1.7, "eval_steps_per_second": 1.7, "eval_wer": 100.0, "step": 86000 }, { "epoch": 0.5571065909508164, "grad_norm": 17.363605499267578, "learning_rate": 2.2215306841781037e-06, "loss": 0.2398, "step": 88000 }, { "epoch": 0.5571065909508164, "eval_loss": 0.2665661573410034, "eval_runtime": 100.8416, "eval_samples_per_second": 1.983, "eval_steps_per_second": 1.983, "eval_wer": 100.0, "step": 88000 }, { "epoch": 0.5697681043815167, "grad_norm": 7.914783477783203, "learning_rate": 2.15802208828965e-06, "loss": 0.2417, "step": 90000 }, { "epoch": 0.5697681043815167, "eval_loss": 0.25880980491638184, "eval_runtime": 114.0038, "eval_samples_per_second": 1.754, "eval_steps_per_second": 1.754, "eval_wer": 100.0, "step": 90000 }, { "epoch": 0.5824296178122171, "grad_norm": 6.1498517990112305, "learning_rate": 2.0945134924011966e-06, "loss": 0.2367, "step": 92000 }, { "epoch": 0.5824296178122171, "eval_loss": 0.25671330094337463, "eval_runtime": 99.2437, "eval_samples_per_second": 2.015, "eval_steps_per_second": 2.015, "eval_wer": 100.0, "step": 92000 }, { "epoch": 0.5950911312429175, "grad_norm": 15.99548625946045, "learning_rate": 2.0310048965127434e-06, "loss": 0.2492, "step": 94000 }, { "epoch": 0.5950911312429175, "eval_loss": 0.256805419921875, "eval_runtime": 157.1247, "eval_samples_per_second": 1.273, "eval_steps_per_second": 1.273, "eval_wer": 100.0, "step": 94000 }, { "epoch": 0.6077526446736179, "grad_norm": 24.078039169311523, "learning_rate": 1.96749630062429e-06, "loss": 0.234, "step": 96000 }, { "epoch": 0.6077526446736179, "eval_loss": 0.25336185097694397, "eval_runtime": 117.2279, "eval_samples_per_second": 1.706, "eval_steps_per_second": 1.706, "eval_wer": 100.0, "step": 96000 }, { "epoch": 0.6204141581043182, "grad_norm": 13.121466636657715, "learning_rate": 1.9039877047358363e-06, "loss": 0.2338, "step": 98000 }, { "epoch": 0.6204141581043182, "eval_loss": 0.255278617143631, "eval_runtime": 99.8788, "eval_samples_per_second": 2.002, "eval_steps_per_second": 2.002, "eval_wer": 100.0, "step": 98000 }, { "epoch": 0.6330756715350185, "grad_norm": 9.44789981842041, "learning_rate": 1.8404791088473826e-06, "loss": 0.2307, "step": 100000 }, { "epoch": 0.6330756715350185, "eval_loss": 0.2485535740852356, "eval_runtime": 114.476, "eval_samples_per_second": 1.747, "eval_steps_per_second": 1.747, "eval_wer": 100.0, "step": 100000 }, { "epoch": 0.645737184965719, "grad_norm": 16.697378158569336, "learning_rate": 1.776970512958929e-06, "loss": 0.2343, "step": 102000 }, { "epoch": 0.645737184965719, "eval_loss": 0.2523353695869446, "eval_runtime": 99.8529, "eval_samples_per_second": 2.003, "eval_steps_per_second": 2.003, "eval_wer": 100.0, "step": 102000 }, { "epoch": 0.6583986983964193, "grad_norm": 11.517345428466797, "learning_rate": 1.7134619170704755e-06, "loss": 0.2366, "step": 104000 }, { "epoch": 0.6583986983964193, "eval_loss": 0.2554631531238556, "eval_runtime": 135.1832, "eval_samples_per_second": 1.479, "eval_steps_per_second": 1.479, "eval_wer": 100.0, "step": 104000 }, { "epoch": 0.6710602118271197, "grad_norm": 22.604074478149414, "learning_rate": 1.6499533211820221e-06, "loss": 0.2323, "step": 106000 }, { "epoch": 0.6710602118271197, "eval_loss": 0.2547050416469574, "eval_runtime": 121.0754, "eval_samples_per_second": 1.652, "eval_steps_per_second": 1.652, "eval_wer": 100.0, "step": 106000 }, { "epoch": 0.68372172525782, "grad_norm": 14.323906898498535, "learning_rate": 1.5864447252935686e-06, "loss": 0.2343, "step": 108000 }, { "epoch": 0.68372172525782, "eval_loss": 0.2524075508117676, "eval_runtime": 103.5538, "eval_samples_per_second": 1.931, "eval_steps_per_second": 1.931, "eval_wer": 100.0, "step": 108000 }, { "epoch": 0.6963832386885205, "grad_norm": 11.585010528564453, "learning_rate": 1.522936129405115e-06, "loss": 0.2348, "step": 110000 }, { "epoch": 0.6963832386885205, "eval_loss": 0.24542486667633057, "eval_runtime": 124.354, "eval_samples_per_second": 1.608, "eval_steps_per_second": 1.608, "eval_wer": 100.0, "step": 110000 }, { "epoch": 0.7090447521192208, "grad_norm": 13.175851821899414, "learning_rate": 1.4594275335166617e-06, "loss": 0.245, "step": 112000 }, { "epoch": 0.7090447521192208, "eval_loss": 0.24049542844295502, "eval_runtime": 112.7155, "eval_samples_per_second": 1.774, "eval_steps_per_second": 1.774, "eval_wer": 100.0, "step": 112000 }, { "epoch": 0.7217062655499212, "grad_norm": 5.587381839752197, "learning_rate": 1.3959189376282082e-06, "loss": 0.2332, "step": 114000 }, { "epoch": 0.7217062655499212, "eval_loss": 0.23937122523784637, "eval_runtime": 102.231, "eval_samples_per_second": 1.956, "eval_steps_per_second": 1.956, "eval_wer": 100.0, "step": 114000 }, { "epoch": 0.7343677789806216, "grad_norm": 39.2594108581543, "learning_rate": 1.3324103417397546e-06, "loss": 0.2251, "step": 116000 }, { "epoch": 0.7343677789806216, "eval_loss": 0.24494153261184692, "eval_runtime": 111.2917, "eval_samples_per_second": 1.797, "eval_steps_per_second": 1.797, "eval_wer": 100.0, "step": 116000 }, { "epoch": 0.7470292924113219, "grad_norm": 13.437777519226074, "learning_rate": 1.268901745851301e-06, "loss": 0.2279, "step": 118000 }, { "epoch": 0.7470292924113219, "eval_loss": 0.24640831351280212, "eval_runtime": 100.079, "eval_samples_per_second": 1.998, "eval_steps_per_second": 1.998, "eval_wer": 100.0, "step": 118000 }, { "epoch": 0.7596908058420223, "grad_norm": 17.973445892333984, "learning_rate": 1.2053931499628475e-06, "loss": 0.2269, "step": 120000 }, { "epoch": 0.7596908058420223, "eval_loss": 0.2451734095811844, "eval_runtime": 150.8961, "eval_samples_per_second": 1.325, "eval_steps_per_second": 1.325, "eval_wer": 100.0, "step": 120000 }, { "epoch": 0.7723523192727226, "grad_norm": 1.6845195293426514, "learning_rate": 1.141884554074394e-06, "loss": 0.2303, "step": 122000 }, { "epoch": 0.7723523192727226, "eval_loss": 0.23949329555034637, "eval_runtime": 119.1671, "eval_samples_per_second": 1.678, "eval_steps_per_second": 1.678, "eval_wer": 100.0, "step": 122000 }, { "epoch": 0.7850138327034231, "grad_norm": 19.897830963134766, "learning_rate": 1.0783759581859406e-06, "loss": 0.2127, "step": 124000 }, { "epoch": 0.7850138327034231, "eval_loss": 0.24049174785614014, "eval_runtime": 102.2185, "eval_samples_per_second": 1.957, "eval_steps_per_second": 1.957, "eval_wer": 100.0, "step": 124000 }, { "epoch": 0.7976753461341234, "grad_norm": 12.614727973937988, "learning_rate": 1.014867362297487e-06, "loss": 0.2289, "step": 126000 }, { "epoch": 0.7976753461341234, "eval_loss": 0.2411843240261078, "eval_runtime": 116.078, "eval_samples_per_second": 1.723, "eval_steps_per_second": 1.723, "eval_wer": 100.0, "step": 126000 }, { "epoch": 0.8103368595648238, "grad_norm": 19.16327476501465, "learning_rate": 9.513587664090336e-07, "loss": 0.2169, "step": 128000 }, { "epoch": 0.8103368595648238, "eval_loss": 0.2375524491071701, "eval_runtime": 99.6286, "eval_samples_per_second": 2.007, "eval_steps_per_second": 2.007, "eval_wer": 100.0, "step": 128000 }, { "epoch": 0.8229983729955241, "grad_norm": 17.00189781188965, "learning_rate": 8.8785017052058e-07, "loss": 0.234, "step": 130000 }, { "epoch": 0.8229983729955241, "eval_loss": 0.23726019263267517, "eval_runtime": 128.4372, "eval_samples_per_second": 1.557, "eval_steps_per_second": 1.557, "eval_wer": 100.0, "step": 130000 }, { "epoch": 0.8356598864262246, "grad_norm": 7.840052127838135, "learning_rate": 8.243415746321265e-07, "loss": 0.2282, "step": 132000 }, { "epoch": 0.8356598864262246, "eval_loss": 0.23711390793323517, "eval_runtime": 118.2074, "eval_samples_per_second": 1.692, "eval_steps_per_second": 1.692, "eval_wer": 100.0, "step": 132000 }, { "epoch": 0.8483213998569249, "grad_norm": 23.74713706970215, "learning_rate": 7.60832978743673e-07, "loss": 0.2323, "step": 134000 }, { "epoch": 0.8483213998569249, "eval_loss": 0.232102170586586, "eval_runtime": 102.3613, "eval_samples_per_second": 1.954, "eval_steps_per_second": 1.954, "eval_wer": 100.0, "step": 134000 }, { "epoch": 0.8609829132876252, "grad_norm": 10.603443145751953, "learning_rate": 6.973243828552195e-07, "loss": 0.2222, "step": 136000 }, { "epoch": 0.8609829132876252, "eval_loss": 0.23403330147266388, "eval_runtime": 122.2087, "eval_samples_per_second": 1.637, "eval_steps_per_second": 1.637, "eval_wer": 100.0, "step": 136000 }, { "epoch": 0.8736444267183257, "grad_norm": 14.557578086853027, "learning_rate": 6.338157869667661e-07, "loss": 0.2223, "step": 138000 }, { "epoch": 0.8736444267183257, "eval_loss": 0.23369312286376953, "eval_runtime": 111.0931, "eval_samples_per_second": 1.8, "eval_steps_per_second": 1.8, "eval_wer": 100.0, "step": 138000 }, { "epoch": 0.886305940149026, "grad_norm": 21.674922943115234, "learning_rate": 5.703071910783125e-07, "loss": 0.2211, "step": 140000 }, { "epoch": 0.886305940149026, "eval_loss": 0.2323533594608307, "eval_runtime": 103.9127, "eval_samples_per_second": 1.925, "eval_steps_per_second": 1.925, "eval_wer": 100.0, "step": 140000 }, { "epoch": 0.8989674535797264, "grad_norm": 4.280592918395996, "learning_rate": 5.06798595189859e-07, "loss": 0.2066, "step": 142000 }, { "epoch": 0.8989674535797264, "eval_loss": 0.23401407897472382, "eval_runtime": 112.7995, "eval_samples_per_second": 1.773, "eval_steps_per_second": 1.773, "eval_wer": 100.0, "step": 142000 }, { "epoch": 0.9116289670104267, "grad_norm": 3.850653886795044, "learning_rate": 4.4328999930140544e-07, "loss": 0.2283, "step": 144000 }, { "epoch": 0.9116289670104267, "eval_loss": 0.2337852418422699, "eval_runtime": 102.0048, "eval_samples_per_second": 1.961, "eval_steps_per_second": 1.961, "eval_wer": 100.0, "step": 144000 }, { "epoch": 0.9242904804411272, "grad_norm": 7.110324382781982, "learning_rate": 3.7978140341295195e-07, "loss": 0.2232, "step": 146000 }, { "epoch": 0.9242904804411272, "eval_loss": 0.23404987156391144, "eval_runtime": 118.1946, "eval_samples_per_second": 1.692, "eval_steps_per_second": 1.692, "eval_wer": 100.0, "step": 146000 }, { "epoch": 0.9369519938718275, "grad_norm": 4.778629302978516, "learning_rate": 3.162728075244985e-07, "loss": 0.2184, "step": 148000 }, { "epoch": 0.9369519938718275, "eval_loss": 0.2326117902994156, "eval_runtime": 118.5384, "eval_samples_per_second": 1.687, "eval_steps_per_second": 1.687, "eval_wer": 100.0, "step": 148000 }, { "epoch": 0.9496135073025279, "grad_norm": 7.637845039367676, "learning_rate": 2.5276421163604495e-07, "loss": 0.218, "step": 150000 }, { "epoch": 0.9496135073025279, "eval_loss": 0.2330457717180252, "eval_runtime": 103.0085, "eval_samples_per_second": 1.942, "eval_steps_per_second": 1.942, "eval_wer": 100.0, "step": 150000 }, { "epoch": 0.9622750207332282, "grad_norm": 18.473331451416016, "learning_rate": 1.8925561574759146e-07, "loss": 0.2217, "step": 152000 }, { "epoch": 0.9622750207332282, "eval_loss": 0.23135539889335632, "eval_runtime": 116.9612, "eval_samples_per_second": 1.71, "eval_steps_per_second": 1.71, "eval_wer": 100.0, "step": 152000 }, { "epoch": 0.9749365341639287, "grad_norm": 9.762419700622559, "learning_rate": 1.2574701985913796e-07, "loss": 0.2197, "step": 154000 }, { "epoch": 0.9749365341639287, "eval_loss": 0.23144523799419403, "eval_runtime": 101.6277, "eval_samples_per_second": 1.968, "eval_steps_per_second": 1.968, "eval_wer": 100.0, "step": 154000 }, { "epoch": 0.987598047594629, "grad_norm": 7.513221263885498, "learning_rate": 6.223842397068444e-08, "loss": 0.2157, "step": 156000 }, { "epoch": 0.987598047594629, "eval_loss": 0.23098862171173096, "eval_runtime": 110.3102, "eval_samples_per_second": 1.813, "eval_steps_per_second": 1.813, "eval_wer": 100.0, "step": 156000 } ], "logging_steps": 2000, "max_steps": 157959, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 2000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 9.116903391289344e+19, "train_batch_size": 2, "trial_name": null, "trial_params": null }