bush-qwen2.5 / trainer_state.json
rkdaniels's picture
Upload folder using huggingface_hub
fb622e1 verified
Raw
History Blame Contribute Delete
11.3 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.4615384615384617,
"eval_steps": 3,
"global_step": 24,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0,
"eval_loss": 2.2738115787506104,
"eval_runtime": 374.5242,
"eval_samples_per_second": 0.635,
"eval_steps_per_second": 0.318,
"memory/device_mem_reserved(gib)": 31.86,
"memory/max_mem_active(gib)": 31.55,
"memory/max_mem_allocated(gib)": 31.55,
"step": 0
},
{
"epoch": 0.15384615384615385,
"grad_norm": 0.4899442195892334,
"learning_rate": 0.0,
"loss": 2.2369,
"memory/device_mem_reserved(gib)": 38.32,
"memory/max_mem_active(gib)": 34.44,
"memory/max_mem_allocated(gib)": 34.44,
"step": 1
},
{
"epoch": 0.3076923076923077,
"grad_norm": 0.5000583529472351,
"learning_rate": 0.00010000000474974513,
"loss": 2.2373,
"memory/device_mem_reserved(gib)": 38.54,
"memory/max_mem_active(gib)": 34.71,
"memory/max_mem_allocated(gib)": 34.71,
"step": 2
},
{
"epoch": 0.46153846153846156,
"grad_norm": 0.39517298340797424,
"learning_rate": 0.00020000000949949026,
"loss": 2.2188,
"memory/device_mem_reserved(gib)": 38.54,
"memory/max_mem_active(gib)": 34.71,
"memory/max_mem_allocated(gib)": 34.71,
"step": 3
},
{
"epoch": 0.46153846153846156,
"eval_loss": 2.105576515197754,
"eval_runtime": 376.3787,
"eval_samples_per_second": 0.632,
"eval_steps_per_second": 0.316,
"memory/device_mem_reserved(gib)": 38.54,
"memory/max_mem_active(gib)": 34.71,
"memory/max_mem_allocated(gib)": 34.71,
"step": 3
},
{
"epoch": 0.6153846153846154,
"grad_norm": 0.12939366698265076,
"learning_rate": 0.0003000000142492354,
"loss": 2.1136,
"memory/device_mem_reserved(gib)": 38.55,
"memory/max_mem_active(gib)": 34.71,
"memory/max_mem_allocated(gib)": 34.71,
"step": 4
},
{
"epoch": 0.7692307692307693,
"grad_norm": 0.12260633707046509,
"learning_rate": 0.0002989857748616487,
"loss": 2.0954,
"memory/device_mem_reserved(gib)": 38.55,
"memory/max_mem_active(gib)": 34.71,
"memory/max_mem_allocated(gib)": 34.71,
"step": 5
},
{
"epoch": 0.9230769230769231,
"grad_norm": 0.15485626459121704,
"learning_rate": 0.0002959567354992032,
"loss": 2.0845,
"memory/device_mem_reserved(gib)": 38.55,
"memory/max_mem_active(gib)": 34.71,
"memory/max_mem_allocated(gib)": 34.71,
"step": 6
},
{
"epoch": 0.9230769230769231,
"eval_loss": 2.0672547817230225,
"eval_runtime": 376.5486,
"eval_samples_per_second": 0.632,
"eval_steps_per_second": 0.316,
"memory/device_mem_reserved(gib)": 38.55,
"memory/max_mem_active(gib)": 34.71,
"memory/max_mem_allocated(gib)": 34.71,
"step": 6
},
{
"epoch": 1.0,
"grad_norm": 0.12021517008543015,
"learning_rate": 0.0002909539034590125,
"loss": 2.077,
"memory/device_mem_reserved(gib)": 38.55,
"memory/max_mem_active(gib)": 34.71,
"memory/max_mem_allocated(gib)": 34.71,
"step": 7
},
{
"epoch": 1.1538461538461537,
"grad_norm": 0.08224741369485855,
"learning_rate": 0.00028404491604305804,
"loss": 2.0345,
"memory/device_mem_reserved(gib)": 38.55,
"memory/max_mem_active(gib)": 34.71,
"memory/max_mem_allocated(gib)": 34.71,
"step": 8
},
{
"epoch": 1.3076923076923077,
"grad_norm": 0.06893477588891983,
"learning_rate": 0.0002753231965471059,
"loss": 2.0332,
"memory/device_mem_reserved(gib)": 38.55,
"memory/max_mem_active(gib)": 34.71,
"memory/max_mem_allocated(gib)": 34.71,
"step": 9
},
{
"epoch": 1.3076923076923077,
"eval_loss": 2.044691801071167,
"eval_runtime": 376.6259,
"eval_samples_per_second": 0.632,
"eval_steps_per_second": 0.316,
"memory/device_mem_reserved(gib)": 38.55,
"memory/max_mem_active(gib)": 34.71,
"memory/max_mem_allocated(gib)": 34.71,
"step": 9
},
{
"epoch": 1.4615384615384617,
"grad_norm": 0.08403533697128296,
"learning_rate": 0.0002649066736921668,
"loss": 2.0445,
"memory/device_mem_reserved(gib)": 38.55,
"memory/max_mem_active(gib)": 34.71,
"memory/max_mem_allocated(gib)": 34.71,
"step": 10
},
{
"epoch": 1.6153846153846154,
"grad_norm": 0.08370130509138107,
"learning_rate": 0.00025293626822531223,
"loss": 2.0298,
"memory/device_mem_reserved(gib)": 38.55,
"memory/max_mem_active(gib)": 34.71,
"memory/max_mem_allocated(gib)": 34.71,
"step": 11
},
{
"epoch": 1.7692307692307692,
"grad_norm": 0.07989141345024109,
"learning_rate": 0.00023957379744388163,
"loss": 2.0284,
"memory/device_mem_reserved(gib)": 38.55,
"memory/max_mem_active(gib)": 34.71,
"memory/max_mem_allocated(gib)": 34.71,
"step": 12
},
{
"epoch": 1.7692307692307692,
"eval_loss": 2.0312037467956543,
"eval_runtime": 376.3006,
"eval_samples_per_second": 0.632,
"eval_steps_per_second": 0.316,
"memory/device_mem_reserved(gib)": 38.55,
"memory/max_mem_active(gib)": 34.71,
"memory/max_mem_allocated(gib)": 34.71,
"step": 12
},
{
"epoch": 1.9230769230769231,
"grad_norm": 0.08033885806798935,
"learning_rate": 0.00022500001068692654,
"loss": 2.0108,
"memory/device_mem_reserved(gib)": 38.55,
"memory/max_mem_active(gib)": 34.71,
"memory/max_mem_allocated(gib)": 34.71,
"step": 13
},
{
"epoch": 2.0,
"grad_norm": 0.10752119868993759,
"learning_rate": 0.00020941196999046952,
"loss": 1.9729,
"memory/device_mem_reserved(gib)": 38.55,
"memory/max_mem_active(gib)": 34.71,
"memory/max_mem_allocated(gib)": 34.71,
"step": 14
},
{
"epoch": 2.1538461538461537,
"grad_norm": 0.08343259990215302,
"learning_rate": 0.0001930204889504239,
"loss": 1.9655,
"memory/device_mem_reserved(gib)": 38.55,
"memory/max_mem_active(gib)": 34.71,
"memory/max_mem_allocated(gib)": 34.71,
"step": 15
},
{
"epoch": 2.1538461538461537,
"eval_loss": 2.0194833278656006,
"eval_runtime": 376.3527,
"eval_samples_per_second": 0.632,
"eval_steps_per_second": 0.316,
"memory/device_mem_reserved(gib)": 38.55,
"memory/max_mem_active(gib)": 34.71,
"memory/max_mem_allocated(gib)": 34.71,
"step": 15
},
{
"epoch": 2.3076923076923075,
"grad_norm": 0.08610356599092484,
"learning_rate": 0.00017604722233954817,
"loss": 1.9656,
"memory/device_mem_reserved(gib)": 38.55,
"memory/max_mem_active(gib)": 34.71,
"memory/max_mem_allocated(gib)": 34.71,
"step": 16
},
{
"epoch": 2.4615384615384617,
"grad_norm": 0.08564396947622299,
"learning_rate": 0.00015872172662056983,
"loss": 1.976,
"memory/device_mem_reserved(gib)": 38.55,
"memory/max_mem_active(gib)": 34.71,
"memory/max_mem_allocated(gib)": 34.71,
"step": 17
},
{
"epoch": 2.6153846153846154,
"grad_norm": 0.08958195149898529,
"learning_rate": 0.00014127828762866557,
"loss": 1.981,
"memory/device_mem_reserved(gib)": 38.55,
"memory/max_mem_active(gib)": 34.71,
"memory/max_mem_allocated(gib)": 34.71,
"step": 18
},
{
"epoch": 2.6153846153846154,
"eval_loss": 2.014101505279541,
"eval_runtime": 376.448,
"eval_samples_per_second": 0.632,
"eval_steps_per_second": 0.316,
"memory/device_mem_reserved(gib)": 38.55,
"memory/max_mem_active(gib)": 34.71,
"memory/max_mem_allocated(gib)": 34.71,
"step": 18
},
{
"epoch": 2.769230769230769,
"grad_norm": 0.10577207803726196,
"learning_rate": 0.000123952777357772,
"loss": 1.961,
"memory/device_mem_reserved(gib)": 38.55,
"memory/max_mem_active(gib)": 34.71,
"memory/max_mem_allocated(gib)": 34.71,
"step": 19
},
{
"epoch": 2.9230769230769234,
"grad_norm": 0.09847240895032883,
"learning_rate": 0.00010697951802285388,
"loss": 1.9455,
"memory/device_mem_reserved(gib)": 38.55,
"memory/max_mem_active(gib)": 34.71,
"memory/max_mem_allocated(gib)": 34.71,
"step": 20
},
{
"epoch": 3.0,
"grad_norm": 0.1634841412305832,
"learning_rate": 9.058803698280826e-05,
"loss": 1.9211,
"memory/device_mem_reserved(gib)": 38.55,
"memory/max_mem_active(gib)": 34.71,
"memory/max_mem_allocated(gib)": 34.71,
"step": 21
},
{
"epoch": 3.0,
"eval_loss": 2.0099527835845947,
"eval_runtime": 376.3789,
"eval_samples_per_second": 0.632,
"eval_steps_per_second": 0.316,
"memory/device_mem_reserved(gib)": 38.55,
"memory/max_mem_active(gib)": 34.71,
"memory/max_mem_allocated(gib)": 34.71,
"step": 21
},
{
"epoch": 3.1538461538461537,
"grad_norm": 0.10216221213340759,
"learning_rate": 7.500000356230885e-05,
"loss": 1.9455,
"memory/device_mem_reserved(gib)": 38.55,
"memory/max_mem_active(gib)": 34.71,
"memory/max_mem_allocated(gib)": 34.71,
"step": 22
},
{
"epoch": 3.3076923076923075,
"grad_norm": 0.11089015752077103,
"learning_rate": 6.042621680535376e-05,
"loss": 1.9001,
"memory/device_mem_reserved(gib)": 38.55,
"memory/max_mem_active(gib)": 34.71,
"memory/max_mem_allocated(gib)": 34.71,
"step": 23
},
{
"epoch": 3.4615384615384617,
"grad_norm": 0.10617231577634811,
"learning_rate": 4.706375693785958e-05,
"loss": 1.9149,
"memory/device_mem_reserved(gib)": 38.55,
"memory/max_mem_active(gib)": 34.71,
"memory/max_mem_allocated(gib)": 34.71,
"step": 24
},
{
"epoch": 3.4615384615384617,
"eval_loss": 2.009589910507202,
"eval_runtime": 376.3891,
"eval_samples_per_second": 0.632,
"eval_steps_per_second": 0.316,
"memory/device_mem_reserved(gib)": 38.55,
"memory/max_mem_active(gib)": 34.71,
"memory/max_mem_allocated(gib)": 34.71,
"step": 24
}
],
"logging_steps": 1,
"max_steps": 30,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 6,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 2.829824816012329e+17,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}