yeok's picture
Model save
75f91cd verified
Raw
History Blame Contribute Delete
6 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.9953488372093023,
"eval_steps": 500,
"global_step": 107,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.009302325581395349,
"grad_norm": 0.33000171184539795,
"learning_rate": 1.8181818181818182e-05,
"loss": 1.2009,
"mean_token_accuracy": 0.673521239310503,
"step": 1
},
{
"epoch": 0.046511627906976744,
"grad_norm": 0.3065112829208374,
"learning_rate": 9.090909090909092e-05,
"loss": 1.1539,
"mean_token_accuracy": 0.6822087187319994,
"step": 5
},
{
"epoch": 0.09302325581395349,
"grad_norm": 0.3443320393562317,
"learning_rate": 0.00018181818181818183,
"loss": 1.1184,
"mean_token_accuracy": 0.6890031665563583,
"step": 10
},
{
"epoch": 0.13953488372093023,
"grad_norm": 0.23821508884429932,
"learning_rate": 0.00019914448613738106,
"loss": 1.0085,
"mean_token_accuracy": 0.709736293554306,
"step": 15
},
{
"epoch": 0.18604651162790697,
"grad_norm": 0.1719299852848053,
"learning_rate": 0.0001956940335732209,
"loss": 0.9457,
"mean_token_accuracy": 0.7221233680844307,
"step": 20
},
{
"epoch": 0.23255813953488372,
"grad_norm": 0.15530090034008026,
"learning_rate": 0.00018968727415326884,
"loss": 0.9069,
"mean_token_accuracy": 0.7291829422116279,
"step": 25
},
{
"epoch": 0.27906976744186046,
"grad_norm": 0.1351461559534073,
"learning_rate": 0.00018128466845916154,
"loss": 0.8542,
"mean_token_accuracy": 0.7403964079916477,
"step": 30
},
{
"epoch": 0.32558139534883723,
"grad_norm": 0.12998437881469727,
"learning_rate": 0.00017071067811865476,
"loss": 0.8219,
"mean_token_accuracy": 0.7473064973950386,
"step": 35
},
{
"epoch": 0.37209302325581395,
"grad_norm": 0.1579654961824417,
"learning_rate": 0.00015824776968678024,
"loss": 0.7689,
"mean_token_accuracy": 0.7591808065772057,
"step": 40
},
{
"epoch": 0.4186046511627907,
"grad_norm": 0.13961397111415863,
"learning_rate": 0.00014422886902190014,
"loss": 0.7605,
"mean_token_accuracy": 0.7607541777193546,
"step": 45
},
{
"epoch": 0.46511627906976744,
"grad_norm": 0.15156981348991394,
"learning_rate": 0.00012902846772544624,
"loss": 0.7466,
"mean_token_accuracy": 0.7628601484000683,
"step": 50
},
{
"epoch": 0.5116279069767442,
"grad_norm": 0.1230233684182167,
"learning_rate": 0.00011305261922200519,
"loss": 0.7338,
"mean_token_accuracy": 0.7658133447170258,
"step": 55
},
{
"epoch": 0.5581395348837209,
"grad_norm": 0.1458376795053482,
"learning_rate": 9.67280917178224e-05,
"loss": 0.7271,
"mean_token_accuracy": 0.7671422854065895,
"step": 60
},
{
"epoch": 0.6046511627906976,
"grad_norm": 0.1341293305158615,
"learning_rate": 8.049096779838719e-05,
"loss": 0.7137,
"mean_token_accuracy": 0.7699349835515022,
"step": 65
},
{
"epoch": 0.6511627906976745,
"grad_norm": 0.13247253000736237,
"learning_rate": 6.477499520787665e-05,
"loss": 0.6963,
"mean_token_accuracy": 0.7752044893801212,
"step": 70
},
{
"epoch": 0.6976744186046512,
"grad_norm": 0.12003805488348007,
"learning_rate": 5.000000000000002e-05,
"loss": 0.6957,
"mean_token_accuracy": 0.774368204921484,
"step": 75
},
{
"epoch": 0.7441860465116279,
"grad_norm": 0.11840014159679413,
"learning_rate": 3.6560671583635467e-05,
"loss": 0.6922,
"mean_token_accuracy": 0.7757050350308419,
"step": 80
},
{
"epoch": 0.7906976744186046,
"grad_norm": 0.13812483847141266,
"learning_rate": 2.4816019252102273e-05,
"loss": 0.6854,
"mean_token_accuracy": 0.777467641979456,
"step": 85
},
{
"epoch": 0.8372093023255814,
"grad_norm": 0.12007566541433334,
"learning_rate": 1.5079781847342123e-05,
"loss": 0.6774,
"mean_token_accuracy": 0.7794982820749283,
"step": 90
},
{
"epoch": 0.8837209302325582,
"grad_norm": 0.11563662439584732,
"learning_rate": 7.612046748871327e-06,
"loss": 0.6787,
"mean_token_accuracy": 0.7794713638722897,
"step": 95
},
{
"epoch": 0.9302325581395349,
"grad_norm": 0.11361019313335419,
"learning_rate": 2.612302072266637e-06,
"loss": 0.6715,
"mean_token_accuracy": 0.7792891427874565,
"step": 100
},
{
"epoch": 0.9767441860465116,
"grad_norm": 0.11059077084064484,
"learning_rate": 2.141076761396521e-07,
"loss": 0.6896,
"mean_token_accuracy": 0.7759934611618519,
"step": 105
},
{
"epoch": 0.9953488372093023,
"mean_token_accuracy": 0.7779956627637148,
"step": 107,
"total_flos": 3.0828954034110464e+16,
"train_loss": 0.7957682988353979,
"train_runtime": 1817.9416,
"train_samples_per_second": 0.946,
"train_steps_per_second": 0.059
}
],
"logging_steps": 5,
"max_steps": 107,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 3.0828954034110464e+16,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}