mt5-version4-Hindi-medium / trainer_state.json
kallacharanteja's picture
Training in progress, step 5664
afab9b6 verified
Raw
History Blame
38.5 kB
{
"best_global_step": 5500,
"best_metric": 1.8417972326278687,
"best_model_checkpoint": "/kaggle/working/checkpoints/checkpoint-5500",
"epoch": 6.0,
"eval_steps": 500,
"global_step": 5664,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0010601643254704478,
"grad_norm": 0.8187403082847595,
"learning_rate": 0.0,
"loss": 10.509103775024414,
"num_input_tokens_seen": 4096,
"step": 1,
"train_runtime": 4.0328,
"train_tokens_per_second": 1015.678
},
{
"epoch": 0.053008216273522396,
"grad_norm": 0.7271436452865601,
"learning_rate": 8.64705882352941e-05,
"loss": 9.653437400350766,
"num_input_tokens_seen": 204800,
"step": 50,
"train_runtime": 85.0317,
"train_tokens_per_second": 2408.514
},
{
"epoch": 0.10601643254704479,
"grad_norm": 0.6869716644287109,
"learning_rate": 0.00017470588235294116,
"loss": 9.471989135742188,
"num_input_tokens_seen": 409600,
"step": 100,
"train_runtime": 176.2658,
"train_tokens_per_second": 2323.764
},
{
"epoch": 0.1590246488205672,
"grad_norm": 0.6832960247993469,
"learning_rate": 0.0002629411764705882,
"loss": 9.664740600585937,
"num_input_tokens_seen": 614400,
"step": 150,
"train_runtime": 267.3416,
"train_tokens_per_second": 2298.183
},
{
"epoch": 0.21203286509408958,
"grad_norm": 0.6674580574035645,
"learning_rate": 0.00029841645431379684,
"loss": 9.3196337890625,
"num_input_tokens_seen": 819200,
"step": 200,
"train_runtime": 358.4777,
"train_tokens_per_second": 2285.219
},
{
"epoch": 0.26504108136761195,
"grad_norm": 0.6817887425422668,
"learning_rate": 0.00029568620313068797,
"loss": 9.44159423828125,
"num_input_tokens_seen": 1024000,
"step": 250,
"train_runtime": 449.5642,
"train_tokens_per_second": 2277.761
},
{
"epoch": 0.3180492976411344,
"grad_norm": 0.6933718919754028,
"learning_rate": 0.00029295595194757916,
"loss": 9.353170776367188,
"num_input_tokens_seen": 1228800,
"step": 300,
"train_runtime": 540.6374,
"train_tokens_per_second": 2272.873
},
{
"epoch": 0.37105751391465674,
"grad_norm": 0.6354528069496155,
"learning_rate": 0.0002902257007644703,
"loss": 9.46597900390625,
"num_input_tokens_seen": 1433600,
"step": 350,
"train_runtime": 631.7827,
"train_tokens_per_second": 2269.135
},
{
"epoch": 0.42406573018817917,
"grad_norm": 0.6813943982124329,
"learning_rate": 0.0002874954495813615,
"loss": 9.3445703125,
"num_input_tokens_seen": 1638400,
"step": 400,
"train_runtime": 722.6411,
"train_tokens_per_second": 2267.239
},
{
"epoch": 0.47707394646170154,
"grad_norm": 0.5886964797973633,
"learning_rate": 0.0002847651983982526,
"loss": 9.338291625976563,
"num_input_tokens_seen": 1843200,
"step": 450,
"train_runtime": 813.7385,
"train_tokens_per_second": 2265.101
},
{
"epoch": 0.5300821627352239,
"grad_norm": 0.6884158849716187,
"learning_rate": 0.0002820349472151438,
"loss": 9.193983764648438,
"num_input_tokens_seen": 2048000,
"step": 500,
"train_runtime": 904.7321,
"train_tokens_per_second": 2263.653
},
{
"epoch": 0.5300821627352239,
"eval_bleu": 4.06,
"eval_chrf": 19.66,
"eval_loss": 1.8984475135803223,
"eval_runtime": 87.1763,
"eval_samples_per_second": 3.499,
"eval_steps_per_second": 1.755,
"num_input_tokens_seen": 2048000,
"step": 500
},
{
"epoch": 0.5830903790087464,
"grad_norm": 0.6719595193862915,
"learning_rate": 0.0002793046960320349,
"loss": 9.386028442382813,
"num_input_tokens_seen": 2252800,
"step": 550,
"train_runtime": 1094.9482,
"train_tokens_per_second": 2057.449
},
{
"epoch": 0.6360985952822688,
"grad_norm": 0.6773673295974731,
"learning_rate": 0.00027657444484892606,
"loss": 9.26089599609375,
"num_input_tokens_seen": 2457600,
"step": 600,
"train_runtime": 1186.45,
"train_tokens_per_second": 2071.389
},
{
"epoch": 0.6891068115557911,
"grad_norm": 0.6533596515655518,
"learning_rate": 0.00027384419366581725,
"loss": 9.2549658203125,
"num_input_tokens_seen": 2662400,
"step": 650,
"train_runtime": 1277.7875,
"train_tokens_per_second": 2083.602
},
{
"epoch": 0.7421150278293135,
"grad_norm": 0.6407659649848938,
"learning_rate": 0.0002711139424827084,
"loss": 9.27232666015625,
"num_input_tokens_seen": 2867200,
"step": 700,
"train_runtime": 1369.0819,
"train_tokens_per_second": 2094.25
},
{
"epoch": 0.795123244102836,
"grad_norm": 0.7818734645843506,
"learning_rate": 0.00026838369129959956,
"loss": 9.223333740234375,
"num_input_tokens_seen": 3072000,
"step": 750,
"train_runtime": 1460.1534,
"train_tokens_per_second": 2103.889
},
{
"epoch": 0.8481314603763583,
"grad_norm": 0.6569114923477173,
"learning_rate": 0.0002656534401164907,
"loss": 9.193381958007812,
"num_input_tokens_seen": 3276800,
"step": 800,
"train_runtime": 1551.22,
"train_tokens_per_second": 2112.402
},
{
"epoch": 0.9011396766498807,
"grad_norm": 0.7116767168045044,
"learning_rate": 0.0002629231889333819,
"loss": 9.336693115234375,
"num_input_tokens_seen": 3481600,
"step": 850,
"train_runtime": 1642.3679,
"train_tokens_per_second": 2119.866
},
{
"epoch": 0.9541478929234031,
"grad_norm": 0.64178466796875,
"learning_rate": 0.000260192937750273,
"loss": 9.349353637695312,
"num_input_tokens_seen": 3686400,
"step": 900,
"train_runtime": 1733.6186,
"train_tokens_per_second": 2126.419
},
{
"epoch": 1.0063609859528226,
"grad_norm": 0.6793839931488037,
"learning_rate": 0.00025746268656716415,
"loss": 9.190228271484376,
"num_input_tokens_seen": 3887616,
"step": 950,
"train_runtime": 1823.6521,
"train_tokens_per_second": 2131.775
},
{
"epoch": 1.059369202226345,
"grad_norm": 0.6120585799217224,
"learning_rate": 0.00025473243538405533,
"loss": 8.995220336914063,
"num_input_tokens_seen": 4092416,
"step": 1000,
"train_runtime": 1914.9217,
"train_tokens_per_second": 2137.119
},
{
"epoch": 1.059369202226345,
"eval_bleu": 4.04,
"eval_chrf": 19.54,
"eval_loss": 1.8891278505325317,
"eval_runtime": 84.89,
"eval_samples_per_second": 3.593,
"eval_steps_per_second": 1.802,
"num_input_tokens_seen": 4092416,
"step": 1000
},
{
"epoch": 1.1123774184998674,
"grad_norm": 0.6622714996337891,
"learning_rate": 0.00025200218420094646,
"loss": 9.169678955078124,
"num_input_tokens_seen": 4297216,
"step": 1050,
"train_runtime": 2104.4734,
"train_tokens_per_second": 2041.944
},
{
"epoch": 1.16538563477339,
"grad_norm": 0.6801309585571289,
"learning_rate": 0.00024927193301783765,
"loss": 9.108585205078125,
"num_input_tokens_seen": 4502016,
"step": 1100,
"train_runtime": 2195.9257,
"train_tokens_per_second": 2050.168
},
{
"epoch": 1.2183938510469123,
"grad_norm": 0.6843289732933044,
"learning_rate": 0.0002465416818347288,
"loss": 9.04650146484375,
"num_input_tokens_seen": 4706816,
"step": 1150,
"train_runtime": 2287.3334,
"train_tokens_per_second": 2057.774
},
{
"epoch": 1.2714020673204347,
"grad_norm": 0.6618881821632385,
"learning_rate": 0.00024381143065161994,
"loss": 9.0776953125,
"num_input_tokens_seen": 4911616,
"step": 1200,
"train_runtime": 2378.5524,
"train_tokens_per_second": 2064.96
},
{
"epoch": 1.324410283593957,
"grad_norm": 0.7164718508720398,
"learning_rate": 0.00024108117946851107,
"loss": 9.070903930664063,
"num_input_tokens_seen": 5116416,
"step": 1250,
"train_runtime": 2470.0729,
"train_tokens_per_second": 2071.362
},
{
"epoch": 1.3774184998674794,
"grad_norm": 0.703388512134552,
"learning_rate": 0.00023835092828540223,
"loss": 9.000114135742187,
"num_input_tokens_seen": 5321216,
"step": 1300,
"train_runtime": 2561.2113,
"train_tokens_per_second": 2077.617
},
{
"epoch": 1.4304267161410018,
"grad_norm": 0.6863468289375305,
"learning_rate": 0.00023562067710229337,
"loss": 9.03710693359375,
"num_input_tokens_seen": 5526016,
"step": 1350,
"train_runtime": 2652.4931,
"train_tokens_per_second": 2083.329
},
{
"epoch": 1.4834349324145242,
"grad_norm": 0.681918740272522,
"learning_rate": 0.00023289042591918453,
"loss": 9.07092529296875,
"num_input_tokens_seen": 5730816,
"step": 1400,
"train_runtime": 2743.7676,
"train_tokens_per_second": 2088.667
},
{
"epoch": 1.5364431486880465,
"grad_norm": 0.6488898396492004,
"learning_rate": 0.00023016017473607568,
"loss": 9.12448974609375,
"num_input_tokens_seen": 5935616,
"step": 1450,
"train_runtime": 2835.0135,
"train_tokens_per_second": 2093.682
},
{
"epoch": 1.589451364961569,
"grad_norm": 0.629993736743927,
"learning_rate": 0.00022742992355296684,
"loss": 8.988504638671875,
"num_input_tokens_seen": 6140416,
"step": 1500,
"train_runtime": 2926.1673,
"train_tokens_per_second": 2098.45
},
{
"epoch": 1.589451364961569,
"eval_bleu": 4.15,
"eval_chrf": 19.86,
"eval_loss": 1.8749940395355225,
"eval_runtime": 85.3123,
"eval_samples_per_second": 3.575,
"eval_steps_per_second": 1.793,
"num_input_tokens_seen": 6140416,
"step": 1500
},
{
"epoch": 1.6424595812350913,
"grad_norm": 0.6674344539642334,
"learning_rate": 0.000224699672369858,
"loss": 9.002008056640625,
"num_input_tokens_seen": 6345216,
"step": 1550,
"train_runtime": 3115.9795,
"train_tokens_per_second": 2036.347
},
{
"epoch": 1.6954677975086139,
"grad_norm": 0.6869524717330933,
"learning_rate": 0.00022196942118674916,
"loss": 9.157560424804688,
"num_input_tokens_seen": 6550016,
"step": 1600,
"train_runtime": 3207.373,
"train_tokens_per_second": 2042.175
},
{
"epoch": 1.7484760137821362,
"grad_norm": 0.661709725856781,
"learning_rate": 0.0002192391700036403,
"loss": 9.031039428710937,
"num_input_tokens_seen": 6754816,
"step": 1650,
"train_runtime": 3298.7999,
"train_tokens_per_second": 2047.659
},
{
"epoch": 1.8014842300556586,
"grad_norm": 0.6780179738998413,
"learning_rate": 0.00021650891882053145,
"loss": 9.039593505859376,
"num_input_tokens_seen": 6959616,
"step": 1700,
"train_runtime": 3390.0711,
"train_tokens_per_second": 2052.941
},
{
"epoch": 1.854492446329181,
"grad_norm": 0.700842022895813,
"learning_rate": 0.0002137786676374226,
"loss": 8.978927612304688,
"num_input_tokens_seen": 7164416,
"step": 1750,
"train_runtime": 3481.1155,
"train_tokens_per_second": 2058.081
},
{
"epoch": 1.9075006626027036,
"grad_norm": 0.6786106824874878,
"learning_rate": 0.00021104841645431377,
"loss": 9.08431396484375,
"num_input_tokens_seen": 7369216,
"step": 1800,
"train_runtime": 3572.2502,
"train_tokens_per_second": 2062.906
},
{
"epoch": 1.960508878876226,
"grad_norm": 0.6586954593658447,
"learning_rate": 0.00020831816527120493,
"loss": 9.029188232421875,
"num_input_tokens_seen": 7574016,
"step": 1850,
"train_runtime": 3663.5445,
"train_tokens_per_second": 2067.401
},
{
"epoch": 2.0127219719056453,
"grad_norm": 0.7223443388938904,
"learning_rate": 0.0002055879140880961,
"loss": 8.716483764648437,
"num_input_tokens_seen": 7775232,
"step": 1900,
"train_runtime": 3753.5921,
"train_tokens_per_second": 2071.411
},
{
"epoch": 2.0657301881791676,
"grad_norm": 0.6501656770706177,
"learning_rate": 0.00020285766290498725,
"loss": 8.858229370117188,
"num_input_tokens_seen": 7980032,
"step": 1950,
"train_runtime": 3844.9155,
"train_tokens_per_second": 2075.477
},
{
"epoch": 2.11873840445269,
"grad_norm": 0.6163517236709595,
"learning_rate": 0.00020012741172187838,
"loss": 8.852374267578124,
"num_input_tokens_seen": 8184832,
"step": 2000,
"train_runtime": 3936.2252,
"train_tokens_per_second": 2079.361
},
{
"epoch": 2.11873840445269,
"eval_bleu": 4.07,
"eval_chrf": 19.95,
"eval_loss": 1.8687856197357178,
"eval_runtime": 85.2414,
"eval_samples_per_second": 3.578,
"eval_steps_per_second": 1.795,
"num_input_tokens_seen": 8184832,
"step": 2000
},
{
"epoch": 2.1717466207262124,
"grad_norm": 0.6511809825897217,
"learning_rate": 0.00019739716053876954,
"loss": 8.9257958984375,
"num_input_tokens_seen": 8389632,
"step": 2050,
"train_runtime": 4126.538,
"train_tokens_per_second": 2033.092
},
{
"epoch": 2.2247548369997348,
"grad_norm": 0.6239650249481201,
"learning_rate": 0.0001946669093556607,
"loss": 8.875814208984375,
"num_input_tokens_seen": 8594432,
"step": 2100,
"train_runtime": 4217.9271,
"train_tokens_per_second": 2037.596
},
{
"epoch": 2.277763053273257,
"grad_norm": 0.6986948847770691,
"learning_rate": 0.00019193665817255186,
"loss": 8.9848681640625,
"num_input_tokens_seen": 8799232,
"step": 2150,
"train_runtime": 4309.2527,
"train_tokens_per_second": 2041.939
},
{
"epoch": 2.33077126954678,
"grad_norm": 0.6011477708816528,
"learning_rate": 0.00018920640698944302,
"loss": 8.912135620117187,
"num_input_tokens_seen": 9004032,
"step": 2200,
"train_runtime": 4400.5936,
"train_tokens_per_second": 2046.095
},
{
"epoch": 2.3837794858203023,
"grad_norm": 0.7250493764877319,
"learning_rate": 0.00018647615580633418,
"loss": 8.793685913085938,
"num_input_tokens_seen": 9208832,
"step": 2250,
"train_runtime": 4492.0003,
"train_tokens_per_second": 2050.052
},
{
"epoch": 2.4367877020938247,
"grad_norm": 0.6375405788421631,
"learning_rate": 0.00018374590462322534,
"loss": 8.844403076171876,
"num_input_tokens_seen": 9413632,
"step": 2300,
"train_runtime": 4583.4122,
"train_tokens_per_second": 2053.848
},
{
"epoch": 2.489795918367347,
"grad_norm": 0.6628595590591431,
"learning_rate": 0.00018101565344011647,
"loss": 8.734286499023437,
"num_input_tokens_seen": 9618432,
"step": 2350,
"train_runtime": 4674.7698,
"train_tokens_per_second": 2057.52
},
{
"epoch": 2.5428041346408694,
"grad_norm": 0.6868587136268616,
"learning_rate": 0.00017828540225700763,
"loss": 8.970186157226562,
"num_input_tokens_seen": 9823232,
"step": 2400,
"train_runtime": 4765.9951,
"train_tokens_per_second": 2061.108
},
{
"epoch": 2.5958123509143918,
"grad_norm": 0.6495867371559143,
"learning_rate": 0.0001755551510738988,
"loss": 8.924597778320312,
"num_input_tokens_seen": 10028032,
"step": 2450,
"train_runtime": 4857.2206,
"train_tokens_per_second": 2064.562
},
{
"epoch": 2.648820567187914,
"grad_norm": 0.7620416283607483,
"learning_rate": 0.00017282489989078995,
"loss": 8.905831298828126,
"num_input_tokens_seen": 10232832,
"step": 2500,
"train_runtime": 4948.5715,
"train_tokens_per_second": 2067.836
},
{
"epoch": 2.648820567187914,
"eval_bleu": 4.05,
"eval_chrf": 19.71,
"eval_loss": 1.8576197624206543,
"eval_runtime": 85.4771,
"eval_samples_per_second": 3.568,
"eval_steps_per_second": 1.79,
"num_input_tokens_seen": 10232832,
"step": 2500
},
{
"epoch": 2.7018287834614365,
"grad_norm": 0.7461215853691101,
"learning_rate": 0.0001700946487076811,
"loss": 8.890812377929688,
"num_input_tokens_seen": 10437632,
"step": 2550,
"train_runtime": 5138.677,
"train_tokens_per_second": 2031.191
},
{
"epoch": 2.754836999734959,
"grad_norm": 0.6335775256156921,
"learning_rate": 0.00016736439752457227,
"loss": 8.868407592773437,
"num_input_tokens_seen": 10642432,
"step": 2600,
"train_runtime": 5230.3092,
"train_tokens_per_second": 2034.762
},
{
"epoch": 2.8078452160084812,
"grad_norm": 0.6892751455307007,
"learning_rate": 0.00016463414634146343,
"loss": 8.848526000976562,
"num_input_tokens_seen": 10847232,
"step": 2650,
"train_runtime": 5321.7199,
"train_tokens_per_second": 2038.294
},
{
"epoch": 2.8608534322820036,
"grad_norm": 0.7833438515663147,
"learning_rate": 0.00016190389515835456,
"loss": 8.842973022460937,
"num_input_tokens_seen": 11052032,
"step": 2700,
"train_runtime": 5413.0681,
"train_tokens_per_second": 2041.732
},
{
"epoch": 2.913861648555526,
"grad_norm": 0.7217938303947449,
"learning_rate": 0.00015917364397524572,
"loss": 8.9160205078125,
"num_input_tokens_seen": 11256832,
"step": 2750,
"train_runtime": 5504.4642,
"train_tokens_per_second": 2045.037
},
{
"epoch": 2.9668698648290484,
"grad_norm": 0.625913143157959,
"learning_rate": 0.00015644339279213688,
"loss": 8.780228271484376,
"num_input_tokens_seen": 11461632,
"step": 2800,
"train_runtime": 5595.8294,
"train_tokens_per_second": 2048.245
},
{
"epoch": 3.019082957858468,
"grad_norm": 0.686261773109436,
"learning_rate": 0.000153713141609028,
"loss": 8.62293212890625,
"num_input_tokens_seen": 11662848,
"step": 2850,
"train_runtime": 5686.1951,
"train_tokens_per_second": 2051.081
},
{
"epoch": 3.0720911741319905,
"grad_norm": 0.7150633335113525,
"learning_rate": 0.00015098289042591917,
"loss": 8.857227783203125,
"num_input_tokens_seen": 11867648,
"step": 2900,
"train_runtime": 5777.4806,
"train_tokens_per_second": 2054.122
},
{
"epoch": 3.125099390405513,
"grad_norm": 0.7594448328018188,
"learning_rate": 0.00014825263924281033,
"loss": 8.733943481445312,
"num_input_tokens_seen": 12072448,
"step": 2950,
"train_runtime": 5868.7816,
"train_tokens_per_second": 2057.062
},
{
"epoch": 3.1781076066790352,
"grad_norm": 0.6436108946800232,
"learning_rate": 0.00014552238805970149,
"loss": 8.650802612304688,
"num_input_tokens_seen": 12277248,
"step": 3000,
"train_runtime": 5960.2675,
"train_tokens_per_second": 2059.848
},
{
"epoch": 3.1781076066790352,
"eval_bleu": 4.2,
"eval_chrf": 19.81,
"eval_loss": 1.8580111265182495,
"eval_runtime": 85.4127,
"eval_samples_per_second": 3.571,
"eval_steps_per_second": 1.791,
"num_input_tokens_seen": 12277248,
"step": 3000
},
{
"epoch": 3.2311158229525576,
"grad_norm": 0.6634842753410339,
"learning_rate": 0.00014279213687659265,
"loss": 8.697005615234374,
"num_input_tokens_seen": 12482048,
"step": 3050,
"train_runtime": 6151.2346,
"train_tokens_per_second": 2029.194
},
{
"epoch": 3.28412403922608,
"grad_norm": 0.7246391773223877,
"learning_rate": 0.0001400618856934838,
"loss": 8.7168359375,
"num_input_tokens_seen": 12686848,
"step": 3100,
"train_runtime": 6242.7027,
"train_tokens_per_second": 2032.268
},
{
"epoch": 3.3371322554996024,
"grad_norm": 0.6836341023445129,
"learning_rate": 0.00013733163451037494,
"loss": 8.65872802734375,
"num_input_tokens_seen": 12891648,
"step": 3150,
"train_runtime": 6333.8948,
"train_tokens_per_second": 2035.343
},
{
"epoch": 3.3901404717731247,
"grad_norm": 0.7036194801330566,
"learning_rate": 0.0001346013833272661,
"loss": 8.667957763671875,
"num_input_tokens_seen": 13096448,
"step": 3200,
"train_runtime": 6425.2484,
"train_tokens_per_second": 2038.279
},
{
"epoch": 3.443148688046647,
"grad_norm": 0.7401408553123474,
"learning_rate": 0.00013187113214415725,
"loss": 8.828726806640624,
"num_input_tokens_seen": 13301248,
"step": 3250,
"train_runtime": 6516.5209,
"train_tokens_per_second": 2041.158
},
{
"epoch": 3.4961569043201695,
"grad_norm": 0.735714852809906,
"learning_rate": 0.0001291408809610484,
"loss": 8.744295654296875,
"num_input_tokens_seen": 13506048,
"step": 3300,
"train_runtime": 6607.8418,
"train_tokens_per_second": 2043.942
},
{
"epoch": 3.549165120593692,
"grad_norm": 0.7713711261749268,
"learning_rate": 0.00012641062977793955,
"loss": 8.785454711914063,
"num_input_tokens_seen": 13710848,
"step": 3350,
"train_runtime": 6699.3485,
"train_tokens_per_second": 2046.594
},
{
"epoch": 3.6021733368672146,
"grad_norm": 0.6046838760375977,
"learning_rate": 0.0001236803785948307,
"loss": 8.79681884765625,
"num_input_tokens_seen": 13915648,
"step": 3400,
"train_runtime": 6790.6621,
"train_tokens_per_second": 2049.233
},
{
"epoch": 3.6551815531407366,
"grad_norm": 0.7195361852645874,
"learning_rate": 0.00012095012741172186,
"loss": 8.713923950195312,
"num_input_tokens_seen": 14120448,
"step": 3450,
"train_runtime": 6881.9777,
"train_tokens_per_second": 2051.801
},
{
"epoch": 3.7081897694142594,
"grad_norm": 0.6607725620269775,
"learning_rate": 0.00011821987622861302,
"loss": 8.707265014648437,
"num_input_tokens_seen": 14325248,
"step": 3500,
"train_runtime": 6973.3252,
"train_tokens_per_second": 2054.292
},
{
"epoch": 3.7081897694142594,
"eval_bleu": 4.18,
"eval_chrf": 19.91,
"eval_loss": 1.8520567417144775,
"eval_runtime": 85.3221,
"eval_samples_per_second": 3.575,
"eval_steps_per_second": 1.793,
"num_input_tokens_seen": 14325248,
"step": 3500
},
{
"epoch": 3.7611979856877817,
"grad_norm": 0.7562373876571655,
"learning_rate": 0.00011548962504550417,
"loss": 8.9096435546875,
"num_input_tokens_seen": 14530048,
"step": 3550,
"train_runtime": 7163.8071,
"train_tokens_per_second": 2028.258
},
{
"epoch": 3.814206201961304,
"grad_norm": 0.6998844742774963,
"learning_rate": 0.00011275937386239533,
"loss": 8.541333618164062,
"num_input_tokens_seen": 14734848,
"step": 3600,
"train_runtime": 7255.3341,
"train_tokens_per_second": 2030.899
},
{
"epoch": 3.8672144182348265,
"grad_norm": 0.7850280404090881,
"learning_rate": 0.00011002912267928649,
"loss": 8.79550537109375,
"num_input_tokens_seen": 14939648,
"step": 3650,
"train_runtime": 7346.7779,
"train_tokens_per_second": 2033.497
},
{
"epoch": 3.920222634508349,
"grad_norm": 0.6771405339241028,
"learning_rate": 0.00010729887149617765,
"loss": 8.66411865234375,
"num_input_tokens_seen": 15144448,
"step": 3700,
"train_runtime": 7438.0137,
"train_tokens_per_second": 2036.088
},
{
"epoch": 3.973230850781871,
"grad_norm": 0.6406344771385193,
"learning_rate": 0.0001045686203130688,
"loss": 8.713903198242187,
"num_input_tokens_seen": 15349248,
"step": 3750,
"train_runtime": 7529.334,
"train_tokens_per_second": 2038.593
},
{
"epoch": 4.025443943811291,
"grad_norm": 0.6602168679237366,
"learning_rate": 0.00010183836912995995,
"loss": 8.64723388671875,
"num_input_tokens_seen": 15550464,
"step": 3800,
"train_runtime": 7619.5214,
"train_tokens_per_second": 2040.871
},
{
"epoch": 4.078452160084813,
"grad_norm": 0.6122914552688599,
"learning_rate": 9.910811794685111e-05,
"loss": 8.693761596679687,
"num_input_tokens_seen": 15755264,
"step": 3850,
"train_runtime": 7710.944,
"train_tokens_per_second": 2043.234
},
{
"epoch": 4.131460376358335,
"grad_norm": 0.6196545958518982,
"learning_rate": 9.637786676374226e-05,
"loss": 8.59835693359375,
"num_input_tokens_seen": 15960064,
"step": 3900,
"train_runtime": 7802.3986,
"train_tokens_per_second": 2045.533
},
{
"epoch": 4.184468592631858,
"grad_norm": 0.7231429815292358,
"learning_rate": 9.364761558063342e-05,
"loss": 8.621876831054687,
"num_input_tokens_seen": 16164864,
"step": 3950,
"train_runtime": 7893.7536,
"train_tokens_per_second": 2047.804
},
{
"epoch": 4.23747680890538,
"grad_norm": 0.6612716913223267,
"learning_rate": 9.091736439752458e-05,
"loss": 8.63590087890625,
"num_input_tokens_seen": 16369664,
"step": 4000,
"train_runtime": 7985.1156,
"train_tokens_per_second": 2050.022
},
{
"epoch": 4.23747680890538,
"eval_bleu": 4.17,
"eval_chrf": 20.0,
"eval_loss": 1.8474465608596802,
"eval_runtime": 85.4899,
"eval_samples_per_second": 3.568,
"eval_steps_per_second": 1.79,
"num_input_tokens_seen": 16369664,
"step": 4000
},
{
"epoch": 4.290485025178903,
"grad_norm": 0.611146092414856,
"learning_rate": 8.818711321441571e-05,
"loss": 8.60938720703125,
"num_input_tokens_seen": 16574464,
"step": 4050,
"train_runtime": 8174.4094,
"train_tokens_per_second": 2027.604
},
{
"epoch": 4.343493241452425,
"grad_norm": 0.6369199156761169,
"learning_rate": 8.545686203130687e-05,
"loss": 8.630716552734375,
"num_input_tokens_seen": 16779264,
"step": 4100,
"train_runtime": 8265.9997,
"train_tokens_per_second": 2029.913
},
{
"epoch": 4.396501457725948,
"grad_norm": 0.6628316044807434,
"learning_rate": 8.272661084819803e-05,
"loss": 8.668856811523437,
"num_input_tokens_seen": 16984064,
"step": 4150,
"train_runtime": 8357.3474,
"train_tokens_per_second": 2032.231
},
{
"epoch": 4.4495096739994695,
"grad_norm": 0.6495283842086792,
"learning_rate": 7.999635966508917e-05,
"loss": 8.637254638671875,
"num_input_tokens_seen": 17188864,
"step": 4200,
"train_runtime": 8448.7845,
"train_tokens_per_second": 2034.478
},
{
"epoch": 4.502517890272992,
"grad_norm": 0.7096723318099976,
"learning_rate": 7.726610848198033e-05,
"loss": 8.743385009765625,
"num_input_tokens_seen": 17393664,
"step": 4250,
"train_runtime": 8540.0931,
"train_tokens_per_second": 2036.707
},
{
"epoch": 4.555526106546514,
"grad_norm": 0.6975917816162109,
"learning_rate": 7.453585729887149e-05,
"loss": 8.73980224609375,
"num_input_tokens_seen": 17598464,
"step": 4300,
"train_runtime": 8631.8018,
"train_tokens_per_second": 2038.794
},
{
"epoch": 4.608534322820037,
"grad_norm": 0.6756250262260437,
"learning_rate": 7.180560611576264e-05,
"loss": 8.648682250976563,
"num_input_tokens_seen": 17803264,
"step": 4350,
"train_runtime": 8723.0816,
"train_tokens_per_second": 2040.937
},
{
"epoch": 4.66154253909356,
"grad_norm": 0.6954464912414551,
"learning_rate": 6.90753549326538e-05,
"loss": 8.505289916992188,
"num_input_tokens_seen": 18008064,
"step": 4400,
"train_runtime": 8814.4396,
"train_tokens_per_second": 2043.019
},
{
"epoch": 4.714550755367082,
"grad_norm": 0.7037732005119324,
"learning_rate": 6.634510374954495e-05,
"loss": 8.64231201171875,
"num_input_tokens_seen": 18212864,
"step": 4450,
"train_runtime": 8905.8242,
"train_tokens_per_second": 2045.051
},
{
"epoch": 4.767558971640605,
"grad_norm": 0.7270088195800781,
"learning_rate": 6.361485256643611e-05,
"loss": 8.542531127929687,
"num_input_tokens_seen": 18417664,
"step": 4500,
"train_runtime": 8997.045,
"train_tokens_per_second": 2047.079
},
{
"epoch": 4.767558971640605,
"eval_bleu": 4.19,
"eval_chrf": 19.94,
"eval_loss": 1.844648003578186,
"eval_runtime": 85.4507,
"eval_samples_per_second": 3.569,
"eval_steps_per_second": 1.791,
"num_input_tokens_seen": 18417664,
"step": 4500
},
{
"epoch": 4.8205671879141265,
"grad_norm": 0.8335739374160767,
"learning_rate": 6.088460138332727e-05,
"loss": 8.696432495117188,
"num_input_tokens_seen": 18622464,
"step": 4550,
"train_runtime": 9187.0284,
"train_tokens_per_second": 2027.039
},
{
"epoch": 4.873575404187649,
"grad_norm": 0.6931884288787842,
"learning_rate": 5.815435020021841e-05,
"loss": 8.64121826171875,
"num_input_tokens_seen": 18827264,
"step": 4600,
"train_runtime": 9278.849,
"train_tokens_per_second": 2029.052
},
{
"epoch": 4.926583620461171,
"grad_norm": 0.6581870317459106,
"learning_rate": 5.5424099017109565e-05,
"loss": 8.625559692382813,
"num_input_tokens_seen": 19032064,
"step": 4650,
"train_runtime": 9370.2629,
"train_tokens_per_second": 2031.113
},
{
"epoch": 4.979591836734694,
"grad_norm": 0.6969789266586304,
"learning_rate": 5.2693847834000724e-05,
"loss": 8.7086279296875,
"num_input_tokens_seen": 19236864,
"step": 4700,
"train_runtime": 9461.717,
"train_tokens_per_second": 2033.126
},
{
"epoch": 5.031804929764114,
"grad_norm": 0.7297267317771912,
"learning_rate": 4.9963596650891877e-05,
"loss": 8.405086059570312,
"num_input_tokens_seen": 19438080,
"step": 4750,
"train_runtime": 9552.1329,
"train_tokens_per_second": 2034.947
},
{
"epoch": 5.084813146037636,
"grad_norm": 0.6402953863143921,
"learning_rate": 4.723334546778303e-05,
"loss": 8.690524291992187,
"num_input_tokens_seen": 19642880,
"step": 4800,
"train_runtime": 9643.5906,
"train_tokens_per_second": 2036.884
},
{
"epoch": 5.137821362311159,
"grad_norm": 0.6262202262878418,
"learning_rate": 4.450309428467419e-05,
"loss": 8.471676635742188,
"num_input_tokens_seen": 19847680,
"step": 4850,
"train_runtime": 9735.0779,
"train_tokens_per_second": 2038.78
},
{
"epoch": 5.1908295785846805,
"grad_norm": 0.6598888039588928,
"learning_rate": 4.177284310156534e-05,
"loss": 8.572631225585937,
"num_input_tokens_seen": 20052480,
"step": 4900,
"train_runtime": 9826.6555,
"train_tokens_per_second": 2040.621
},
{
"epoch": 5.243837794858203,
"grad_norm": 0.7225948572158813,
"learning_rate": 3.90425919184565e-05,
"loss": 8.642888793945312,
"num_input_tokens_seen": 20257280,
"step": 4950,
"train_runtime": 9918.0414,
"train_tokens_per_second": 2042.468
},
{
"epoch": 5.296846011131725,
"grad_norm": 0.6872982382774353,
"learning_rate": 3.6312340735347646e-05,
"loss": 8.432411499023438,
"num_input_tokens_seen": 20462080,
"step": 5000,
"train_runtime": 10009.6849,
"train_tokens_per_second": 2044.228
},
{
"epoch": 5.296846011131725,
"eval_bleu": 4.09,
"eval_chrf": 19.82,
"eval_loss": 1.841970443725586,
"eval_runtime": 86.237,
"eval_samples_per_second": 3.537,
"eval_steps_per_second": 1.774,
"num_input_tokens_seen": 20462080,
"step": 5000
},
{
"epoch": 5.349854227405248,
"grad_norm": 0.6799459457397461,
"learning_rate": 3.3582089552238805e-05,
"loss": 8.610306396484376,
"num_input_tokens_seen": 20666880,
"step": 5050,
"train_runtime": 10200.4654,
"train_tokens_per_second": 2026.072
},
{
"epoch": 5.40286244367877,
"grad_norm": 0.6314374804496765,
"learning_rate": 3.085183836912996e-05,
"loss": 8.522672119140625,
"num_input_tokens_seen": 20871680,
"step": 5100,
"train_runtime": 10292.3344,
"train_tokens_per_second": 2027.886
},
{
"epoch": 5.455870659952293,
"grad_norm": 0.6840763688087463,
"learning_rate": 2.812158718602111e-05,
"loss": 8.5241162109375,
"num_input_tokens_seen": 21076480,
"step": 5150,
"train_runtime": 10384.0278,
"train_tokens_per_second": 2029.702
},
{
"epoch": 5.508878876225815,
"grad_norm": 0.7108559608459473,
"learning_rate": 2.5391336002912266e-05,
"loss": 8.657234497070313,
"num_input_tokens_seen": 21281280,
"step": 5200,
"train_runtime": 10475.6603,
"train_tokens_per_second": 2031.498
},
{
"epoch": 5.5618870924993375,
"grad_norm": 0.7527778148651123,
"learning_rate": 2.266108481980342e-05,
"loss": 8.60021240234375,
"num_input_tokens_seen": 21486080,
"step": 5250,
"train_runtime": 10567.164,
"train_tokens_per_second": 2033.287
},
{
"epoch": 5.6148953087728595,
"grad_norm": 0.647541880607605,
"learning_rate": 1.993083363669457e-05,
"loss": 8.624324951171875,
"num_input_tokens_seen": 21690880,
"step": 5300,
"train_runtime": 10658.6905,
"train_tokens_per_second": 2035.042
},
{
"epoch": 5.667903525046382,
"grad_norm": 0.5897159576416016,
"learning_rate": 1.7200582453585727e-05,
"loss": 8.644212646484375,
"num_input_tokens_seen": 21895680,
"step": 5350,
"train_runtime": 10750.2076,
"train_tokens_per_second": 2036.768
},
{
"epoch": 5.720911741319904,
"grad_norm": 0.6161897778511047,
"learning_rate": 1.4470331270476882e-05,
"loss": 8.561669311523438,
"num_input_tokens_seen": 22100480,
"step": 5400,
"train_runtime": 10841.7811,
"train_tokens_per_second": 2038.455
},
{
"epoch": 5.773919957593427,
"grad_norm": 0.6419637799263,
"learning_rate": 1.1740080087368037e-05,
"loss": 8.653330688476563,
"num_input_tokens_seen": 22305280,
"step": 5450,
"train_runtime": 10933.2667,
"train_tokens_per_second": 2040.13
},
{
"epoch": 5.82692817386695,
"grad_norm": 0.6721702218055725,
"learning_rate": 9.00982890425919e-06,
"loss": 8.615657348632812,
"num_input_tokens_seen": 22510080,
"step": 5500,
"train_runtime": 11024.7165,
"train_tokens_per_second": 2041.783
},
{
"epoch": 5.82692817386695,
"eval_bleu": 4.19,
"eval_chrf": 20.05,
"eval_loss": 1.8417972326278687,
"eval_runtime": 86.5279,
"eval_samples_per_second": 3.525,
"eval_steps_per_second": 1.768,
"num_input_tokens_seen": 22510080,
"step": 5500
},
{
"epoch": 5.879936390140472,
"grad_norm": 0.7171221375465393,
"learning_rate": 6.279577721150346e-06,
"loss": 8.624059448242187,
"num_input_tokens_seen": 22714880,
"step": 5550,
"train_runtime": 11215.8439,
"train_tokens_per_second": 2025.249
},
{
"epoch": 5.932944606413994,
"grad_norm": 0.6685547232627869,
"learning_rate": 3.549326538041499e-06,
"loss": 8.639024047851562,
"num_input_tokens_seen": 22919680,
"step": 5600,
"train_runtime": 11307.5506,
"train_tokens_per_second": 2026.936
},
{
"epoch": 5.9859528226875165,
"grad_norm": 0.6983809471130371,
"learning_rate": 8.190753549326538e-07,
"loss": 8.527723388671875,
"num_input_tokens_seen": 23124480,
"step": 5650,
"train_runtime": 11399.0902,
"train_tokens_per_second": 2028.625
}
],
"logging_steps": 50,
"max_steps": 5664,
"num_input_tokens_seen": 23178240,
"num_train_epochs": 6,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 4.229533786963968e+16,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}