{ "best_metric": 1.4432059526443481, "best_model_checkpoint": "miner_id_24/checkpoint-50", "epoch": 0.6756756756756757, "eval_steps": 25, "global_step": 50, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.013513513513513514, "grad_norm": 1.182604193687439, "learning_rate": 5.000000000000001e-07, "loss": 1.5157, "step": 1 }, { "epoch": 0.013513513513513514, "eval_loss": 1.6760309934616089, "eval_runtime": 40.4948, "eval_samples_per_second": 6.174, "eval_steps_per_second": 1.556, "step": 1 }, { "epoch": 0.02702702702702703, "grad_norm": 1.2888565063476562, "learning_rate": 1.0000000000000002e-06, "loss": 1.7694, "step": 2 }, { "epoch": 0.04054054054054054, "grad_norm": 1.2827200889587402, "learning_rate": 1.5e-06, "loss": 1.6787, "step": 3 }, { "epoch": 0.05405405405405406, "grad_norm": 1.1944496631622314, "learning_rate": 2.0000000000000003e-06, "loss": 1.6116, "step": 4 }, { "epoch": 0.06756756756756757, "grad_norm": 1.2333825826644897, "learning_rate": 2.5e-06, "loss": 1.6405, "step": 5 }, { "epoch": 0.08108108108108109, "grad_norm": 1.4027087688446045, "learning_rate": 3e-06, "loss": 1.6888, "step": 6 }, { "epoch": 0.0945945945945946, "grad_norm": 1.1837018728256226, "learning_rate": 3.5000000000000004e-06, "loss": 1.5811, "step": 7 }, { "epoch": 0.10810810810810811, "grad_norm": 1.3160983324050903, "learning_rate": 4.000000000000001e-06, "loss": 1.6628, "step": 8 }, { "epoch": 0.12162162162162163, "grad_norm": 1.328890323638916, "learning_rate": 4.5e-06, "loss": 1.6113, "step": 9 }, { "epoch": 0.13513513513513514, "grad_norm": 1.36015784740448, "learning_rate": 5e-06, "loss": 1.734, "step": 10 }, { "epoch": 0.14864864864864866, "grad_norm": 1.2641745805740356, "learning_rate": 5.500000000000001e-06, "loss": 1.6575, "step": 11 }, { "epoch": 0.16216216216216217, "grad_norm": 1.195217251777649, "learning_rate": 6e-06, "loss": 1.6533, "step": 12 }, { "epoch": 0.17567567567567569, "grad_norm": 1.534934401512146, "learning_rate": 6.5000000000000004e-06, "loss": 1.7857, "step": 13 }, { "epoch": 0.1891891891891892, "grad_norm": 1.2150381803512573, "learning_rate": 7.000000000000001e-06, "loss": 1.7598, "step": 14 }, { "epoch": 0.20270270270270271, "grad_norm": 1.2849867343902588, "learning_rate": 7.5e-06, "loss": 1.6906, "step": 15 }, { "epoch": 0.21621621621621623, "grad_norm": 1.3215241432189941, "learning_rate": 8.000000000000001e-06, "loss": 1.5991, "step": 16 }, { "epoch": 0.22972972972972974, "grad_norm": 1.0337059497833252, "learning_rate": 8.500000000000002e-06, "loss": 1.6426, "step": 17 }, { "epoch": 0.24324324324324326, "grad_norm": 1.2015763521194458, "learning_rate": 9e-06, "loss": 1.6674, "step": 18 }, { "epoch": 0.25675675675675674, "grad_norm": 1.0645320415496826, "learning_rate": 9.5e-06, "loss": 1.4811, "step": 19 }, { "epoch": 0.2702702702702703, "grad_norm": 0.9516133666038513, "learning_rate": 1e-05, "loss": 1.4088, "step": 20 }, { "epoch": 0.28378378378378377, "grad_norm": 1.0448931455612183, "learning_rate": 1.05e-05, "loss": 1.5424, "step": 21 }, { "epoch": 0.2972972972972973, "grad_norm": 1.1775983572006226, "learning_rate": 1.1000000000000001e-05, "loss": 1.637, "step": 22 }, { "epoch": 0.3108108108108108, "grad_norm": 1.1113003492355347, "learning_rate": 1.1500000000000002e-05, "loss": 1.4857, "step": 23 }, { "epoch": 0.32432432432432434, "grad_norm": 1.1821614503860474, "learning_rate": 1.2e-05, "loss": 1.6479, "step": 24 }, { "epoch": 0.33783783783783783, "grad_norm": 1.0641610622406006, "learning_rate": 1.25e-05, "loss": 1.5605, "step": 25 }, { "epoch": 0.33783783783783783, "eval_loss": 1.535617470741272, "eval_runtime": 40.491, "eval_samples_per_second": 6.174, "eval_steps_per_second": 1.556, "step": 25 }, { "epoch": 0.35135135135135137, "grad_norm": 1.1770542860031128, "learning_rate": 1.3000000000000001e-05, "loss": 1.4731, "step": 26 }, { "epoch": 0.36486486486486486, "grad_norm": 0.9612252712249756, "learning_rate": 1.3500000000000001e-05, "loss": 1.5683, "step": 27 }, { "epoch": 0.3783783783783784, "grad_norm": 1.5425941944122314, "learning_rate": 1.4000000000000001e-05, "loss": 1.5621, "step": 28 }, { "epoch": 0.3918918918918919, "grad_norm": 1.084754467010498, "learning_rate": 1.45e-05, "loss": 1.5416, "step": 29 }, { "epoch": 0.40540540540540543, "grad_norm": 1.1460059881210327, "learning_rate": 1.5e-05, "loss": 1.6328, "step": 30 }, { "epoch": 0.4189189189189189, "grad_norm": 1.1955316066741943, "learning_rate": 1.55e-05, "loss": 1.6108, "step": 31 }, { "epoch": 0.43243243243243246, "grad_norm": 1.0282008647918701, "learning_rate": 1.6000000000000003e-05, "loss": 1.3907, "step": 32 }, { "epoch": 0.44594594594594594, "grad_norm": 1.2764079570770264, "learning_rate": 1.65e-05, "loss": 1.6327, "step": 33 }, { "epoch": 0.4594594594594595, "grad_norm": 1.15719473361969, "learning_rate": 1.7000000000000003e-05, "loss": 1.4977, "step": 34 }, { "epoch": 0.47297297297297297, "grad_norm": 1.1096899509429932, "learning_rate": 1.75e-05, "loss": 1.5142, "step": 35 }, { "epoch": 0.4864864864864865, "grad_norm": 1.0471147298812866, "learning_rate": 1.8e-05, "loss": 1.3773, "step": 36 }, { "epoch": 0.5, "grad_norm": 0.9455012679100037, "learning_rate": 1.85e-05, "loss": 1.4532, "step": 37 }, { "epoch": 0.5135135135135135, "grad_norm": 1.1317943334579468, "learning_rate": 1.9e-05, "loss": 1.482, "step": 38 }, { "epoch": 0.527027027027027, "grad_norm": 1.1226030588150024, "learning_rate": 1.9500000000000003e-05, "loss": 1.5163, "step": 39 }, { "epoch": 0.5405405405405406, "grad_norm": 1.0144020318984985, "learning_rate": 2e-05, "loss": 1.4357, "step": 40 }, { "epoch": 0.5540540540540541, "grad_norm": 1.3154661655426025, "learning_rate": 2.05e-05, "loss": 1.6364, "step": 41 }, { "epoch": 0.5675675675675675, "grad_norm": 1.1747310161590576, "learning_rate": 2.1e-05, "loss": 1.3186, "step": 42 }, { "epoch": 0.581081081081081, "grad_norm": 0.9352157711982727, "learning_rate": 2.15e-05, "loss": 1.5016, "step": 43 }, { "epoch": 0.5945945945945946, "grad_norm": 0.992979109287262, "learning_rate": 2.2000000000000003e-05, "loss": 1.4764, "step": 44 }, { "epoch": 0.6081081081081081, "grad_norm": 1.1484577655792236, "learning_rate": 2.25e-05, "loss": 1.493, "step": 45 }, { "epoch": 0.6216216216216216, "grad_norm": 1.063947081565857, "learning_rate": 2.3000000000000003e-05, "loss": 1.4308, "step": 46 }, { "epoch": 0.6351351351351351, "grad_norm": 1.0236965417861938, "learning_rate": 2.35e-05, "loss": 1.5211, "step": 47 }, { "epoch": 0.6486486486486487, "grad_norm": 1.165647029876709, "learning_rate": 2.4e-05, "loss": 1.4569, "step": 48 }, { "epoch": 0.6621621621621622, "grad_norm": 0.9427868723869324, "learning_rate": 2.45e-05, "loss": 1.4874, "step": 49 }, { "epoch": 0.6756756756756757, "grad_norm": 1.046981692314148, "learning_rate": 2.5e-05, "loss": 1.4938, "step": 50 }, { "epoch": 0.6756756756756757, "eval_loss": 1.4432059526443481, "eval_runtime": 40.4738, "eval_samples_per_second": 6.177, "eval_steps_per_second": 1.557, "step": 50 } ], "logging_steps": 1, "max_steps": 50, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 25, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 1, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 0 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 3.017027157491712e+17, "train_batch_size": 4, "trial_name": null, "trial_params": null }