{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 375, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.3350626245141028, "epoch": 0.02666666666666667, "grad_norm": 1.2209417819976807, "learning_rate": 1.9783783783783786e-05, "loss": 3.4751, "mean_token_accuracy": 0.4370182503014803, "num_tokens": 12866.0, "step": 10 }, { "entropy": 1.3571727886795997, "epoch": 0.05333333333333334, "grad_norm": 1.6984230279922485, "learning_rate": 1.9243243243243244e-05, "loss": 3.2031, "mean_token_accuracy": 0.4396053273230791, "num_tokens": 25807.0, "step": 20 }, { "entropy": 1.471608152985573, "epoch": 0.08, "grad_norm": 1.014086127281189, "learning_rate": 1.8702702702702706e-05, "loss": 2.7028, "mean_token_accuracy": 0.46664220802485945, "num_tokens": 38578.0, "step": 30 }, { "entropy": 1.5595325112342835, "epoch": 0.10666666666666667, "grad_norm": 0.7482319474220276, "learning_rate": 1.8162162162162164e-05, "loss": 2.3153, "mean_token_accuracy": 0.5029693856835366, "num_tokens": 51538.0, "step": 40 }, { "entropy": 1.6449722349643707, "epoch": 0.13333333333333333, "grad_norm": 0.7101708650588989, "learning_rate": 1.7621621621621622e-05, "loss": 2.1109, "mean_token_accuracy": 0.5171717956662178, "num_tokens": 64387.0, "step": 50 }, { "entropy": 1.6670852690935134, "epoch": 0.16, "grad_norm": 0.7259413599967957, "learning_rate": 1.7081081081081083e-05, "loss": 1.9278, "mean_token_accuracy": 0.5485030759125948, "num_tokens": 77276.0, "step": 60 }, { "entropy": 1.6381909385323525, "epoch": 0.18666666666666668, "grad_norm": 0.7174317836761475, "learning_rate": 1.654054054054054e-05, "loss": 1.7939, "mean_token_accuracy": 0.5677109852433204, "num_tokens": 90149.0, "step": 70 }, { "entropy": 1.6385898187756538, "epoch": 0.21333333333333335, "grad_norm": 0.8067219257354736, "learning_rate": 1.6000000000000003e-05, "loss": 1.6666, "mean_token_accuracy": 0.5853360824286937, "num_tokens": 102995.0, "step": 80 }, { "entropy": 1.5796676367521285, "epoch": 0.24, "grad_norm": 0.800731897354126, "learning_rate": 1.545945945945946e-05, "loss": 1.5881, "mean_token_accuracy": 0.597806416451931, "num_tokens": 115839.0, "step": 90 }, { "entropy": 1.5752710282802582, "epoch": 0.26666666666666666, "grad_norm": 0.8465399146080017, "learning_rate": 1.491891891891892e-05, "loss": 1.5702, "mean_token_accuracy": 0.5995256647467613, "num_tokens": 128611.0, "step": 100 }, { "entropy": 1.5265976443886757, "epoch": 0.29333333333333333, "grad_norm": 0.8720120787620544, "learning_rate": 1.4378378378378378e-05, "loss": 1.5057, "mean_token_accuracy": 0.6056284785270691, "num_tokens": 141383.0, "step": 110 }, { "entropy": 1.4974668100476265, "epoch": 0.32, "grad_norm": 0.9546942710876465, "learning_rate": 1.383783783783784e-05, "loss": 1.4441, "mean_token_accuracy": 0.6172919377684594, "num_tokens": 154276.0, "step": 120 }, { "entropy": 1.4532102927565576, "epoch": 0.3466666666666667, "grad_norm": 0.972088098526001, "learning_rate": 1.3297297297297298e-05, "loss": 1.4033, "mean_token_accuracy": 0.6191255763173104, "num_tokens": 167141.0, "step": 130 }, { "entropy": 1.4425522044301033, "epoch": 0.37333333333333335, "grad_norm": 1.0836657285690308, "learning_rate": 1.2756756756756758e-05, "loss": 1.3799, "mean_token_accuracy": 0.6284476429224014, "num_tokens": 179968.0, "step": 140 }, { "entropy": 1.4219948261976243, "epoch": 0.4, "grad_norm": 1.1330499649047852, "learning_rate": 1.2216216216216217e-05, "loss": 1.3888, "mean_token_accuracy": 0.6221960082650184, "num_tokens": 192836.0, "step": 150 }, { "entropy": 1.4194561198353768, "epoch": 0.4266666666666667, "grad_norm": 1.092614769935608, "learning_rate": 1.1675675675675677e-05, "loss": 1.3462, "mean_token_accuracy": 0.6329536609351635, "num_tokens": 205774.0, "step": 160 }, { "entropy": 1.3868110164999963, "epoch": 0.4533333333333333, "grad_norm": 1.253973126411438, "learning_rate": 1.1135135135135135e-05, "loss": 1.3243, "mean_token_accuracy": 0.6337448269128799, "num_tokens": 218615.0, "step": 170 }, { "entropy": 1.382253359258175, "epoch": 0.48, "grad_norm": 1.1929072141647339, "learning_rate": 1.0594594594594597e-05, "loss": 1.3163, "mean_token_accuracy": 0.6397944167256355, "num_tokens": 231525.0, "step": 180 }, { "entropy": 1.3482940062880515, "epoch": 0.5066666666666667, "grad_norm": 1.3486591577529907, "learning_rate": 1.0054054054054055e-05, "loss": 1.2625, "mean_token_accuracy": 0.6505386248230934, "num_tokens": 244338.0, "step": 190 }, { "entropy": 1.340237122774124, "epoch": 0.5333333333333333, "grad_norm": 1.400648593902588, "learning_rate": 9.513513513513514e-06, "loss": 1.2572, "mean_token_accuracy": 0.6538930542767047, "num_tokens": 257295.0, "step": 200 }, { "entropy": 1.3297127082943916, "epoch": 0.56, "grad_norm": 1.3606442213058472, "learning_rate": 8.972972972972974e-06, "loss": 1.251, "mean_token_accuracy": 0.6457924202084542, "num_tokens": 270252.0, "step": 210 }, { "entropy": 1.294735921919346, "epoch": 0.5866666666666667, "grad_norm": 0.9780547618865967, "learning_rate": 8.432432432432434e-06, "loss": 1.2329, "mean_token_accuracy": 0.6493118166923523, "num_tokens": 283027.0, "step": 220 }, { "entropy": 1.275549191236496, "epoch": 0.6133333333333333, "grad_norm": 0.7589144110679626, "learning_rate": 7.891891891891894e-06, "loss": 1.2215, "mean_token_accuracy": 0.6486652858555317, "num_tokens": 295938.0, "step": 230 }, { "entropy": 1.2352376490831376, "epoch": 0.64, "grad_norm": 0.590903103351593, "learning_rate": 7.3513513513513525e-06, "loss": 1.2032, "mean_token_accuracy": 0.6558617919683456, "num_tokens": 308573.0, "step": 240 }, { "entropy": 1.2297846719622612, "epoch": 0.6666666666666666, "grad_norm": 0.4950984716415405, "learning_rate": 6.810810810810811e-06, "loss": 1.2186, "mean_token_accuracy": 0.6527085661888122, "num_tokens": 321351.0, "step": 250 }, { "entropy": 1.234605258703232, "epoch": 0.6933333333333334, "grad_norm": 0.5501531958580017, "learning_rate": 6.270270270270271e-06, "loss": 1.2074, "mean_token_accuracy": 0.6517517618834973, "num_tokens": 334282.0, "step": 260 }, { "entropy": 1.2171380445361137, "epoch": 0.72, "grad_norm": 0.5207800269126892, "learning_rate": 5.729729729729731e-06, "loss": 1.212, "mean_token_accuracy": 0.6510008379817009, "num_tokens": 347108.0, "step": 270 }, { "entropy": 1.1763642460107804, "epoch": 0.7466666666666667, "grad_norm": 0.5053102970123291, "learning_rate": 5.18918918918919e-06, "loss": 1.1744, "mean_token_accuracy": 0.6574446760118008, "num_tokens": 359894.0, "step": 280 }, { "entropy": 1.2101906329393386, "epoch": 0.7733333333333333, "grad_norm": 0.4792664647102356, "learning_rate": 4.6486486486486495e-06, "loss": 1.2127, "mean_token_accuracy": 0.65442885607481, "num_tokens": 372746.0, "step": 290 }, { "entropy": 1.1929027184844017, "epoch": 0.8, "grad_norm": 0.5656186938285828, "learning_rate": 4.108108108108108e-06, "loss": 1.1815, "mean_token_accuracy": 0.6556121528148651, "num_tokens": 385472.0, "step": 300 }, { "entropy": 1.187587819993496, "epoch": 0.8266666666666667, "grad_norm": 0.5197432041168213, "learning_rate": 3.567567567567568e-06, "loss": 1.1972, "mean_token_accuracy": 0.6531499087810516, "num_tokens": 398386.0, "step": 310 }, { "entropy": 1.1810954853892326, "epoch": 0.8533333333333334, "grad_norm": 0.5143433213233948, "learning_rate": 3.0270270270270274e-06, "loss": 1.18, "mean_token_accuracy": 0.6557211861014366, "num_tokens": 411252.0, "step": 320 }, { "entropy": 1.2191567361354827, "epoch": 0.88, "grad_norm": 0.4793160855770111, "learning_rate": 2.4864864864864867e-06, "loss": 1.2256, "mean_token_accuracy": 0.6478217862546444, "num_tokens": 424185.0, "step": 330 }, { "entropy": 1.2220171764492989, "epoch": 0.9066666666666666, "grad_norm": 0.5613325238227844, "learning_rate": 1.945945945945946e-06, "loss": 1.1912, "mean_token_accuracy": 0.6575871229171752, "num_tokens": 437188.0, "step": 340 }, { "entropy": 1.1927517160773278, "epoch": 0.9333333333333333, "grad_norm": 0.4704723656177521, "learning_rate": 1.4054054054054056e-06, "loss": 1.1849, "mean_token_accuracy": 0.6561981976032257, "num_tokens": 449996.0, "step": 350 }, { "entropy": 1.190693587809801, "epoch": 0.96, "grad_norm": 0.5744921565055847, "learning_rate": 8.64864864864865e-07, "loss": 1.1868, "mean_token_accuracy": 0.6580364957451821, "num_tokens": 462917.0, "step": 360 }, { "entropy": 1.1880986839532852, "epoch": 0.9866666666666667, "grad_norm": 0.5150167942047119, "learning_rate": 3.2432432432432436e-07, "loss": 1.1759, "mean_token_accuracy": 0.6571345932781696, "num_tokens": 475686.0, "step": 370 } ], "logging_steps": 10, "max_steps": 375, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 4.278856023687168e+16, "train_batch_size": 2, "trial_name": null, "trial_params": null }