{ "best_global_step": 3000, "best_metric": 2.296126127243042, "best_model_checkpoint": "/kaggle/working/checkpoints/checkpoint-3000", "epoch": 3.0, "eval_steps": 500, "global_step": 3351, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0008954555630176853, "grad_norm": 331.45263671875, "learning_rate": 0.0, "loss": 105.3310546875, "num_input_tokens_seen": 8192, "step": 1, "train_runtime": 11.6116, "train_tokens_per_second": 705.503 }, { "epoch": 0.04477277815088426, "grad_norm": 183.94589233398438, "learning_rate": 0.0002916666666666667, "loss": 94.84019252232143, "num_input_tokens_seen": 409600, "step": 50, "train_runtime": 171.6655, "train_tokens_per_second": 2386.035 }, { "epoch": 0.08954555630176853, "grad_norm": 7.918169021606445, "learning_rate": 0.0005892857142857143, "loss": 44.2767529296875, "num_input_tokens_seen": 819200, "step": 100, "train_runtime": 344.252, "train_tokens_per_second": 2379.652 }, { "epoch": 0.1343183344526528, "grad_norm": 1.343171238899231, "learning_rate": 0.0008869047619047619, "loss": 20.50336669921875, "num_input_tokens_seen": 1228800, "step": 150, "train_runtime": 516.956, "train_tokens_per_second": 2376.991 }, { "epoch": 0.17909111260353705, "grad_norm": 0.5876757502555847, "learning_rate": 0.0009902607602890355, "loss": 16.116962890625, "num_input_tokens_seen": 1638400, "step": 200, "train_runtime": 689.6942, "train_tokens_per_second": 2375.546 }, { "epoch": 0.2238638907544213, "grad_norm": 0.5408444404602051, "learning_rate": 0.0009745523091423187, "loss": 14.958853759765624, "num_input_tokens_seen": 2048000, "step": 250, "train_runtime": 862.3198, "train_tokens_per_second": 2374.989 }, { "epoch": 0.2686366689053056, "grad_norm": 0.5192769169807434, "learning_rate": 0.0009588438579956017, "loss": 14.43544677734375, "num_input_tokens_seen": 2457600, "step": 300, "train_runtime": 1035.0406, "train_tokens_per_second": 2374.4 }, { "epoch": 0.31340944705618984, "grad_norm": 0.5099465847015381, "learning_rate": 0.0009431354068488848, "loss": 14.1262158203125, "num_input_tokens_seen": 2867200, "step": 350, "train_runtime": 1207.3524, "train_tokens_per_second": 2374.783 }, { "epoch": 0.3581822252070741, "grad_norm": 0.5959077477455139, "learning_rate": 0.0009274269557021679, "loss": 13.80364013671875, "num_input_tokens_seen": 3276800, "step": 400, "train_runtime": 1380.1593, "train_tokens_per_second": 2374.219 }, { "epoch": 0.40295500335795836, "grad_norm": 0.509476363658905, "learning_rate": 0.0009117185045554508, "loss": 13.52845458984375, "num_input_tokens_seen": 3686400, "step": 450, "train_runtime": 1552.8761, "train_tokens_per_second": 2373.918 }, { "epoch": 0.4477277815088426, "grad_norm": 0.51153963804245, "learning_rate": 0.0008960100534087339, "loss": 13.331270751953125, "num_input_tokens_seen": 4096000, "step": 500, "train_runtime": 1725.4211, "train_tokens_per_second": 2373.913 }, { "epoch": 0.4477277815088426, "eval_loss": 2.617971658706665, "eval_runtime": 13.0161, "eval_samples_per_second": 55.47, "eval_steps_per_second": 6.991, "num_input_tokens_seen": 4096000, "step": 500 }, { "epoch": 0.4925005596597269, "grad_norm": 0.5071282982826233, "learning_rate": 0.000880301602262017, "loss": 13.067698974609375, "num_input_tokens_seen": 4505600, "step": 550, "train_runtime": 1950.7794, "train_tokens_per_second": 2309.641 }, { "epoch": 0.5372733378106112, "grad_norm": 0.49176469445228577, "learning_rate": 0.0008645931511153, "loss": 13.0263720703125, "num_input_tokens_seen": 4915200, "step": 600, "train_runtime": 2123.5094, "train_tokens_per_second": 2314.659 }, { "epoch": 0.5820461159614954, "grad_norm": 0.5232459306716919, "learning_rate": 0.000848884699968583, "loss": 13.060653076171874, "num_input_tokens_seen": 5324800, "step": 650, "train_runtime": 2296.0456, "train_tokens_per_second": 2319.118 }, { "epoch": 0.6268188941123797, "grad_norm": 0.4987340271472931, "learning_rate": 0.0008331762488218661, "loss": 12.73482177734375, "num_input_tokens_seen": 5734400, "step": 700, "train_runtime": 2468.9137, "train_tokens_per_second": 2322.641 }, { "epoch": 0.6715916722632639, "grad_norm": 0.4983995258808136, "learning_rate": 0.0008174677976751492, "loss": 12.742056884765624, "num_input_tokens_seen": 6144000, "step": 750, "train_runtime": 2641.6641, "train_tokens_per_second": 2325.807 }, { "epoch": 0.7163644504141482, "grad_norm": 0.5150266885757446, "learning_rate": 0.0008017593465284323, "loss": 12.57524169921875, "num_input_tokens_seen": 6553600, "step": 800, "train_runtime": 2813.8488, "train_tokens_per_second": 2329.052 }, { "epoch": 0.7611372285650324, "grad_norm": 0.5139651894569397, "learning_rate": 0.0007860508953817153, "loss": 12.592891845703125, "num_input_tokens_seen": 6963200, "step": 850, "train_runtime": 2986.0731, "train_tokens_per_second": 2331.892 }, { "epoch": 0.8059100067159167, "grad_norm": 0.6878384351730347, "learning_rate": 0.0007703424442349984, "loss": 12.511319580078125, "num_input_tokens_seen": 7372800, "step": 900, "train_runtime": 3158.5594, "train_tokens_per_second": 2334.229 }, { "epoch": 0.8506827848668009, "grad_norm": 0.4996120035648346, "learning_rate": 0.0007546339930882815, "loss": 12.498067626953125, "num_input_tokens_seen": 7782400, "step": 950, "train_runtime": 3331.5807, "train_tokens_per_second": 2335.948 }, { "epoch": 0.8954555630176853, "grad_norm": 0.5436695218086243, "learning_rate": 0.0007389255419415646, "loss": 12.31913330078125, "num_input_tokens_seen": 8192000, "step": 1000, "train_runtime": 3503.8172, "train_tokens_per_second": 2338.022 }, { "epoch": 0.8954555630176853, "eval_loss": 2.4708571434020996, "eval_runtime": 12.9321, "eval_samples_per_second": 55.83, "eval_steps_per_second": 7.037, "num_input_tokens_seen": 8192000, "step": 1000 }, { "epoch": 0.9402283411685695, "grad_norm": 0.5411441326141357, "learning_rate": 0.0007232170907948476, "loss": 12.345836181640625, "num_input_tokens_seen": 8601600, "step": 1050, "train_runtime": 3734.2712, "train_tokens_per_second": 2303.421 }, { "epoch": 0.9850011193194538, "grad_norm": 0.5038391947746277, "learning_rate": 0.0007075086396481307, "loss": 12.264193115234375, "num_input_tokens_seen": 9011200, "step": 1100, "train_runtime": 3906.8195, "train_tokens_per_second": 2306.531 }, { "epoch": 1.0295500335795835, "grad_norm": 0.5121947526931763, "learning_rate": 0.0006918001885014138, "loss": 11.926865234375, "num_input_tokens_seen": 9418368, "step": 1150, "train_runtime": 4078.9352, "train_tokens_per_second": 2309.026 }, { "epoch": 1.074322811730468, "grad_norm": 0.5182917714118958, "learning_rate": 0.0006760917373546969, "loss": 12.025079345703125, "num_input_tokens_seen": 9827968, "step": 1200, "train_runtime": 4251.8799, "train_tokens_per_second": 2311.441 }, { "epoch": 1.1190955898813522, "grad_norm": 0.518774688243866, "learning_rate": 0.0006603832862079799, "loss": 11.881273193359375, "num_input_tokens_seen": 10237568, "step": 1250, "train_runtime": 4424.9422, "train_tokens_per_second": 2313.605 }, { "epoch": 1.1638683680322364, "grad_norm": 0.49377894401550293, "learning_rate": 0.000644674835061263, "loss": 11.88373779296875, "num_input_tokens_seen": 10647168, "step": 1300, "train_runtime": 4597.7399, "train_tokens_per_second": 2315.74 }, { "epoch": 1.2086411461831206, "grad_norm": 0.5340304970741272, "learning_rate": 0.0006289663839145461, "loss": 11.859654541015624, "num_input_tokens_seen": 11056768, "step": 1350, "train_runtime": 4770.4911, "train_tokens_per_second": 2317.742 }, { "epoch": 1.253413924334005, "grad_norm": 0.5341930985450745, "learning_rate": 0.0006132579327678292, "loss": 11.792633056640625, "num_input_tokens_seen": 11466368, "step": 1400, "train_runtime": 4943.2665, "train_tokens_per_second": 2319.593 }, { "epoch": 1.2981867024848892, "grad_norm": 0.5263528823852539, "learning_rate": 0.0005975494816211122, "loss": 11.814337158203125, "num_input_tokens_seen": 11875968, "step": 1450, "train_runtime": 5116.4191, "train_tokens_per_second": 2321.148 }, { "epoch": 1.3429594806357734, "grad_norm": 0.49405381083488464, "learning_rate": 0.0005818410304743952, "loss": 11.8128759765625, "num_input_tokens_seen": 12285568, "step": 1500, "train_runtime": 5288.8716, "train_tokens_per_second": 2322.909 }, { "epoch": 1.3429594806357734, "eval_loss": 2.402881622314453, "eval_runtime": 12.9253, "eval_samples_per_second": 55.86, "eval_steps_per_second": 7.04, "num_input_tokens_seen": 12285568, "step": 1500 }, { "epoch": 1.3877322587866576, "grad_norm": 0.5319132208824158, "learning_rate": 0.0005661325793276783, "loss": 11.62824462890625, "num_input_tokens_seen": 12695168, "step": 1550, "train_runtime": 5520.1498, "train_tokens_per_second": 2299.787 }, { "epoch": 1.432505036937542, "grad_norm": 0.5469394326210022, "learning_rate": 0.0005504241281809613, "loss": 11.611361083984375, "num_input_tokens_seen": 13104768, "step": 1600, "train_runtime": 5692.7354, "train_tokens_per_second": 2302.016 }, { "epoch": 1.4772778150884263, "grad_norm": 0.5172468423843384, "learning_rate": 0.0005347156770342444, "loss": 11.5665576171875, "num_input_tokens_seen": 13514368, "step": 1650, "train_runtime": 5866.6814, "train_tokens_per_second": 2303.58 }, { "epoch": 1.5220505932393105, "grad_norm": 0.5269997119903564, "learning_rate": 0.0005190072258875275, "loss": 11.613292236328125, "num_input_tokens_seen": 13923968, "step": 1700, "train_runtime": 6040.4262, "train_tokens_per_second": 2305.13 }, { "epoch": 1.566823371390195, "grad_norm": 0.5272865891456604, "learning_rate": 0.0005032987747408106, "loss": 11.535517578125, "num_input_tokens_seen": 14333568, "step": 1750, "train_runtime": 6214.6971, "train_tokens_per_second": 2306.398 }, { "epoch": 1.611596149541079, "grad_norm": 0.48300108313560486, "learning_rate": 0.0004875903235940936, "loss": 11.529622802734375, "num_input_tokens_seen": 14743168, "step": 1800, "train_runtime": 6388.2344, "train_tokens_per_second": 2307.863 }, { "epoch": 1.6563689276919633, "grad_norm": 0.5525538921356201, "learning_rate": 0.00047188187244737666, "loss": 11.44923828125, "num_input_tokens_seen": 15152768, "step": 1850, "train_runtime": 6561.8162, "train_tokens_per_second": 2309.234 }, { "epoch": 1.7011417058428475, "grad_norm": 0.5223372578620911, "learning_rate": 0.00045617342130065976, "loss": 11.444879150390625, "num_input_tokens_seen": 15562368, "step": 1900, "train_runtime": 6735.1477, "train_tokens_per_second": 2310.62 }, { "epoch": 1.7459144839937317, "grad_norm": 0.5123465657234192, "learning_rate": 0.0004404649701539428, "loss": 11.449864501953124, "num_input_tokens_seen": 15971968, "step": 1950, "train_runtime": 6908.8412, "train_tokens_per_second": 2311.816 }, { "epoch": 1.790687262144616, "grad_norm": 0.5051376819610596, "learning_rate": 0.0004247565190072259, "loss": 11.4521826171875, "num_input_tokens_seen": 16381568, "step": 2000, "train_runtime": 7082.8117, "train_tokens_per_second": 2312.862 }, { "epoch": 1.790687262144616, "eval_loss": 2.3497679233551025, "eval_runtime": 13.1104, "eval_samples_per_second": 55.071, "eval_steps_per_second": 6.941, "num_input_tokens_seen": 16381568, "step": 2000 }, { "epoch": 1.8354600402955004, "grad_norm": 0.5100616216659546, "learning_rate": 0.00040904806786050895, "loss": 11.323531494140624, "num_input_tokens_seen": 16791168, "step": 2050, "train_runtime": 7316.4951, "train_tokens_per_second": 2294.974 }, { "epoch": 1.8802328184463846, "grad_norm": 0.5197663307189941, "learning_rate": 0.00039333961671379205, "loss": 11.3488134765625, "num_input_tokens_seen": 17200768, "step": 2100, "train_runtime": 7490.4692, "train_tokens_per_second": 2296.354 }, { "epoch": 1.925005596597269, "grad_norm": 0.5394102334976196, "learning_rate": 0.0003776311655670751, "loss": 11.24622802734375, "num_input_tokens_seen": 17610368, "step": 2150, "train_runtime": 7664.0786, "train_tokens_per_second": 2297.78 }, { "epoch": 1.9697783747481532, "grad_norm": 0.5379300713539124, "learning_rate": 0.0003619227144203582, "loss": 11.337928466796875, "num_input_tokens_seen": 18019968, "step": 2200, "train_runtime": 7837.6015, "train_tokens_per_second": 2299.169 }, { "epoch": 2.014327289008283, "grad_norm": 0.5014926791191101, "learning_rate": 0.00034621426327364124, "loss": 11.289034423828125, "num_input_tokens_seen": 18427136, "step": 2250, "train_runtime": 8010.7858, "train_tokens_per_second": 2300.291 }, { "epoch": 2.059100067159167, "grad_norm": 0.5547139048576355, "learning_rate": 0.0003305058121269243, "loss": 11.22334716796875, "num_input_tokens_seen": 18836736, "step": 2300, "train_runtime": 8184.6927, "train_tokens_per_second": 2301.459 }, { "epoch": 2.1038728453100517, "grad_norm": 0.5273997783660889, "learning_rate": 0.00031479736098020733, "loss": 11.20933349609375, "num_input_tokens_seen": 19246336, "step": 2350, "train_runtime": 8358.1995, "train_tokens_per_second": 2302.689 }, { "epoch": 2.148645623460936, "grad_norm": 0.5178916454315186, "learning_rate": 0.00029908890983349043, "loss": 11.13134033203125, "num_input_tokens_seen": 19655936, "step": 2400, "train_runtime": 8531.9507, "train_tokens_per_second": 2303.803 }, { "epoch": 2.19341840161182, "grad_norm": 0.5172515511512756, "learning_rate": 0.0002833804586867735, "loss": 11.15967041015625, "num_input_tokens_seen": 20065536, "step": 2450, "train_runtime": 8706.1654, "train_tokens_per_second": 2304.75 }, { "epoch": 2.2381911797627043, "grad_norm": 0.5247936248779297, "learning_rate": 0.00026767200754005657, "loss": 11.007467041015625, "num_input_tokens_seen": 20475136, "step": 2500, "train_runtime": 8879.7506, "train_tokens_per_second": 2305.823 }, { "epoch": 2.2381911797627043, "eval_loss": 2.3171231746673584, "eval_runtime": 13.2491, "eval_samples_per_second": 54.494, "eval_steps_per_second": 6.868, "num_input_tokens_seen": 20475136, "step": 2500 }, { "epoch": 2.2829639579135885, "grad_norm": 0.5802310705184937, "learning_rate": 0.0002519635563933396, "loss": 11.119674072265624, "num_input_tokens_seen": 20884736, "step": 2550, "train_runtime": 9116.3008, "train_tokens_per_second": 2290.922 }, { "epoch": 2.3277367360644727, "grad_norm": 0.4896214008331299, "learning_rate": 0.0002362551052466227, "loss": 11.020155029296875, "num_input_tokens_seen": 21294336, "step": 2600, "train_runtime": 9289.9843, "train_tokens_per_second": 2292.182 }, { "epoch": 2.372509514215357, "grad_norm": 0.5538379549980164, "learning_rate": 0.00022054665409990576, "loss": 11.0175, "num_input_tokens_seen": 21703936, "step": 2650, "train_runtime": 9463.3153, "train_tokens_per_second": 2293.481 }, { "epoch": 2.417282292366241, "grad_norm": 0.5305850505828857, "learning_rate": 0.0002048382029531888, "loss": 11.08681884765625, "num_input_tokens_seen": 22113536, "step": 2700, "train_runtime": 9636.7051, "train_tokens_per_second": 2294.72 }, { "epoch": 2.462055070517126, "grad_norm": 0.5520696640014648, "learning_rate": 0.00018912975180647188, "loss": 11.049239501953124, "num_input_tokens_seen": 22523136, "step": 2750, "train_runtime": 9810.3229, "train_tokens_per_second": 2295.861 }, { "epoch": 2.50682784866801, "grad_norm": 0.5960472226142883, "learning_rate": 0.00017342130065975495, "loss": 11.0529296875, "num_input_tokens_seen": 22932736, "step": 2800, "train_runtime": 9984.0418, "train_tokens_per_second": 2296.939 }, { "epoch": 2.551600626818894, "grad_norm": 0.5422330498695374, "learning_rate": 0.00015771284951303802, "loss": 11.079190673828125, "num_input_tokens_seen": 23342336, "step": 2850, "train_runtime": 10157.5512, "train_tokens_per_second": 2298.028 }, { "epoch": 2.5963734049697784, "grad_norm": 0.5332451462745667, "learning_rate": 0.0001420043983663211, "loss": 11.045711669921875, "num_input_tokens_seen": 23751936, "step": 2900, "train_runtime": 10330.8794, "train_tokens_per_second": 2299.12 }, { "epoch": 2.6411461831206626, "grad_norm": 0.5149208903312683, "learning_rate": 0.00012629594721960417, "loss": 10.973729248046874, "num_input_tokens_seen": 24161536, "step": 2950, "train_runtime": 10505.0191, "train_tokens_per_second": 2299.999 }, { "epoch": 2.685918961271547, "grad_norm": 0.5152694582939148, "learning_rate": 0.00011058749607288723, "loss": 10.958800048828126, "num_input_tokens_seen": 24571136, "step": 3000, "train_runtime": 10678.159, "train_tokens_per_second": 2301.065 }, { "epoch": 2.685918961271547, "eval_loss": 2.296126127243042, "eval_runtime": 13.2029, "eval_samples_per_second": 54.685, "eval_steps_per_second": 6.892, "num_input_tokens_seen": 24571136, "step": 3000 }, { "epoch": 2.730691739422431, "grad_norm": 0.5589572191238403, "learning_rate": 9.487904492617027e-05, "loss": 11.127513427734375, "num_input_tokens_seen": 24980736, "step": 3050, "train_runtime": 10916.5795, "train_tokens_per_second": 2288.33 }, { "epoch": 2.7754645175733152, "grad_norm": 0.5186505317687988, "learning_rate": 7.917059377945334e-05, "loss": 11.1047265625, "num_input_tokens_seen": 25390336, "step": 3100, "train_runtime": 11090.2623, "train_tokens_per_second": 2289.426 }, { "epoch": 2.8202372957241995, "grad_norm": 0.510116457939148, "learning_rate": 6.346214263273642e-05, "loss": 11.018306884765625, "num_input_tokens_seen": 25799936, "step": 3150, "train_runtime": 11263.7763, "train_tokens_per_second": 2290.523 }, { "epoch": 2.865010073875084, "grad_norm": 0.5256752967834473, "learning_rate": 4.7753691486019474e-05, "loss": 10.991341552734376, "num_input_tokens_seen": 26209536, "step": 3200, "train_runtime": 11436.8692, "train_tokens_per_second": 2291.671 }, { "epoch": 2.9097828520259683, "grad_norm": 0.553755521774292, "learning_rate": 3.2045240339302546e-05, "loss": 10.97140625, "num_input_tokens_seen": 26619136, "step": 3250, "train_runtime": 11610.6191, "train_tokens_per_second": 2292.654 }, { "epoch": 2.9545556301768525, "grad_norm": 0.5288929343223572, "learning_rate": 1.633678919258561e-05, "loss": 11.016265869140625, "num_input_tokens_seen": 27028736, "step": 3300, "train_runtime": 11784.0858, "train_tokens_per_second": 2293.664 }, { "epoch": 2.9993284083277367, "grad_norm": 0.5394493937492371, "learning_rate": 6.283380458686773e-07, "loss": 10.937723388671875, "num_input_tokens_seen": 27438336, "step": 3350, "train_runtime": 11957.2304, "train_tokens_per_second": 2294.707 }, { "epoch": 3.0, "num_input_tokens_seen": 27444096, "step": 3351, "total_flos": 4.973428737441792e+16, "train_loss": 13.759503722582174, "train_runtime": 12000.3856, "train_samples_per_second": 17.867, "train_steps_per_second": 0.279 } ], "logging_steps": 50, "max_steps": 3351, "num_input_tokens_seen": 27444096, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 4.973428737441792e+16, "train_batch_size": 16, "trial_name": null, "trial_params": null }