{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.4615384615384617, "eval_steps": 3, "global_step": 24, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0, "eval_loss": 2.2738115787506104, "eval_runtime": 374.5242, "eval_samples_per_second": 0.635, "eval_steps_per_second": 0.318, "memory/device_mem_reserved(gib)": 31.86, "memory/max_mem_active(gib)": 31.55, "memory/max_mem_allocated(gib)": 31.55, "step": 0 }, { "epoch": 0.15384615384615385, "grad_norm": 0.4899442195892334, "learning_rate": 0.0, "loss": 2.2369, "memory/device_mem_reserved(gib)": 38.32, "memory/max_mem_active(gib)": 34.44, "memory/max_mem_allocated(gib)": 34.44, "step": 1 }, { "epoch": 0.3076923076923077, "grad_norm": 0.5000583529472351, "learning_rate": 0.00010000000474974513, "loss": 2.2373, "memory/device_mem_reserved(gib)": 38.54, "memory/max_mem_active(gib)": 34.71, "memory/max_mem_allocated(gib)": 34.71, "step": 2 }, { "epoch": 0.46153846153846156, "grad_norm": 0.39517298340797424, "learning_rate": 0.00020000000949949026, "loss": 2.2188, "memory/device_mem_reserved(gib)": 38.54, "memory/max_mem_active(gib)": 34.71, "memory/max_mem_allocated(gib)": 34.71, "step": 3 }, { "epoch": 0.46153846153846156, "eval_loss": 2.105576515197754, "eval_runtime": 376.3787, "eval_samples_per_second": 0.632, "eval_steps_per_second": 0.316, "memory/device_mem_reserved(gib)": 38.54, "memory/max_mem_active(gib)": 34.71, "memory/max_mem_allocated(gib)": 34.71, "step": 3 }, { "epoch": 0.6153846153846154, "grad_norm": 0.12939366698265076, "learning_rate": 0.0003000000142492354, "loss": 2.1136, "memory/device_mem_reserved(gib)": 38.55, "memory/max_mem_active(gib)": 34.71, "memory/max_mem_allocated(gib)": 34.71, "step": 4 }, { "epoch": 0.7692307692307693, "grad_norm": 0.12260633707046509, "learning_rate": 0.0002989857748616487, "loss": 2.0954, "memory/device_mem_reserved(gib)": 38.55, "memory/max_mem_active(gib)": 34.71, "memory/max_mem_allocated(gib)": 34.71, "step": 5 }, { "epoch": 0.9230769230769231, "grad_norm": 0.15485626459121704, "learning_rate": 0.0002959567354992032, "loss": 2.0845, "memory/device_mem_reserved(gib)": 38.55, "memory/max_mem_active(gib)": 34.71, "memory/max_mem_allocated(gib)": 34.71, "step": 6 }, { "epoch": 0.9230769230769231, "eval_loss": 2.0672547817230225, "eval_runtime": 376.5486, "eval_samples_per_second": 0.632, "eval_steps_per_second": 0.316, "memory/device_mem_reserved(gib)": 38.55, "memory/max_mem_active(gib)": 34.71, "memory/max_mem_allocated(gib)": 34.71, "step": 6 }, { "epoch": 1.0, "grad_norm": 0.12021517008543015, "learning_rate": 0.0002909539034590125, "loss": 2.077, "memory/device_mem_reserved(gib)": 38.55, "memory/max_mem_active(gib)": 34.71, "memory/max_mem_allocated(gib)": 34.71, "step": 7 }, { "epoch": 1.1538461538461537, "grad_norm": 0.08224741369485855, "learning_rate": 0.00028404491604305804, "loss": 2.0345, "memory/device_mem_reserved(gib)": 38.55, "memory/max_mem_active(gib)": 34.71, "memory/max_mem_allocated(gib)": 34.71, "step": 8 }, { "epoch": 1.3076923076923077, "grad_norm": 0.06893477588891983, "learning_rate": 0.0002753231965471059, "loss": 2.0332, "memory/device_mem_reserved(gib)": 38.55, "memory/max_mem_active(gib)": 34.71, "memory/max_mem_allocated(gib)": 34.71, "step": 9 }, { "epoch": 1.3076923076923077, "eval_loss": 2.044691801071167, "eval_runtime": 376.6259, "eval_samples_per_second": 0.632, "eval_steps_per_second": 0.316, "memory/device_mem_reserved(gib)": 38.55, "memory/max_mem_active(gib)": 34.71, "memory/max_mem_allocated(gib)": 34.71, "step": 9 }, { "epoch": 1.4615384615384617, "grad_norm": 0.08403533697128296, "learning_rate": 0.0002649066736921668, "loss": 2.0445, "memory/device_mem_reserved(gib)": 38.55, "memory/max_mem_active(gib)": 34.71, "memory/max_mem_allocated(gib)": 34.71, "step": 10 }, { "epoch": 1.6153846153846154, "grad_norm": 0.08370130509138107, "learning_rate": 0.00025293626822531223, "loss": 2.0298, "memory/device_mem_reserved(gib)": 38.55, "memory/max_mem_active(gib)": 34.71, "memory/max_mem_allocated(gib)": 34.71, "step": 11 }, { "epoch": 1.7692307692307692, "grad_norm": 0.07989141345024109, "learning_rate": 0.00023957379744388163, "loss": 2.0284, "memory/device_mem_reserved(gib)": 38.55, "memory/max_mem_active(gib)": 34.71, "memory/max_mem_allocated(gib)": 34.71, "step": 12 }, { "epoch": 1.7692307692307692, "eval_loss": 2.0312037467956543, "eval_runtime": 376.3006, "eval_samples_per_second": 0.632, "eval_steps_per_second": 0.316, "memory/device_mem_reserved(gib)": 38.55, "memory/max_mem_active(gib)": 34.71, "memory/max_mem_allocated(gib)": 34.71, "step": 12 }, { "epoch": 1.9230769230769231, "grad_norm": 0.08033885806798935, "learning_rate": 0.00022500001068692654, "loss": 2.0108, "memory/device_mem_reserved(gib)": 38.55, "memory/max_mem_active(gib)": 34.71, "memory/max_mem_allocated(gib)": 34.71, "step": 13 }, { "epoch": 2.0, "grad_norm": 0.10752119868993759, "learning_rate": 0.00020941196999046952, "loss": 1.9729, "memory/device_mem_reserved(gib)": 38.55, "memory/max_mem_active(gib)": 34.71, "memory/max_mem_allocated(gib)": 34.71, "step": 14 }, { "epoch": 2.1538461538461537, "grad_norm": 0.08343259990215302, "learning_rate": 0.0001930204889504239, "loss": 1.9655, "memory/device_mem_reserved(gib)": 38.55, "memory/max_mem_active(gib)": 34.71, "memory/max_mem_allocated(gib)": 34.71, "step": 15 }, { "epoch": 2.1538461538461537, "eval_loss": 2.0194833278656006, "eval_runtime": 376.3527, "eval_samples_per_second": 0.632, "eval_steps_per_second": 0.316, "memory/device_mem_reserved(gib)": 38.55, "memory/max_mem_active(gib)": 34.71, "memory/max_mem_allocated(gib)": 34.71, "step": 15 }, { "epoch": 2.3076923076923075, "grad_norm": 0.08610356599092484, "learning_rate": 0.00017604722233954817, "loss": 1.9656, "memory/device_mem_reserved(gib)": 38.55, "memory/max_mem_active(gib)": 34.71, "memory/max_mem_allocated(gib)": 34.71, "step": 16 }, { "epoch": 2.4615384615384617, "grad_norm": 0.08564396947622299, "learning_rate": 0.00015872172662056983, "loss": 1.976, "memory/device_mem_reserved(gib)": 38.55, "memory/max_mem_active(gib)": 34.71, "memory/max_mem_allocated(gib)": 34.71, "step": 17 }, { "epoch": 2.6153846153846154, "grad_norm": 0.08958195149898529, "learning_rate": 0.00014127828762866557, "loss": 1.981, "memory/device_mem_reserved(gib)": 38.55, "memory/max_mem_active(gib)": 34.71, "memory/max_mem_allocated(gib)": 34.71, "step": 18 }, { "epoch": 2.6153846153846154, "eval_loss": 2.014101505279541, "eval_runtime": 376.448, "eval_samples_per_second": 0.632, "eval_steps_per_second": 0.316, "memory/device_mem_reserved(gib)": 38.55, "memory/max_mem_active(gib)": 34.71, "memory/max_mem_allocated(gib)": 34.71, "step": 18 }, { "epoch": 2.769230769230769, "grad_norm": 0.10577207803726196, "learning_rate": 0.000123952777357772, "loss": 1.961, "memory/device_mem_reserved(gib)": 38.55, "memory/max_mem_active(gib)": 34.71, "memory/max_mem_allocated(gib)": 34.71, "step": 19 }, { "epoch": 2.9230769230769234, "grad_norm": 0.09847240895032883, "learning_rate": 0.00010697951802285388, "loss": 1.9455, "memory/device_mem_reserved(gib)": 38.55, "memory/max_mem_active(gib)": 34.71, "memory/max_mem_allocated(gib)": 34.71, "step": 20 }, { "epoch": 3.0, "grad_norm": 0.1634841412305832, "learning_rate": 9.058803698280826e-05, "loss": 1.9211, "memory/device_mem_reserved(gib)": 38.55, "memory/max_mem_active(gib)": 34.71, "memory/max_mem_allocated(gib)": 34.71, "step": 21 }, { "epoch": 3.0, "eval_loss": 2.0099527835845947, "eval_runtime": 376.3789, "eval_samples_per_second": 0.632, "eval_steps_per_second": 0.316, "memory/device_mem_reserved(gib)": 38.55, "memory/max_mem_active(gib)": 34.71, "memory/max_mem_allocated(gib)": 34.71, "step": 21 }, { "epoch": 3.1538461538461537, "grad_norm": 0.10216221213340759, "learning_rate": 7.500000356230885e-05, "loss": 1.9455, "memory/device_mem_reserved(gib)": 38.55, "memory/max_mem_active(gib)": 34.71, "memory/max_mem_allocated(gib)": 34.71, "step": 22 }, { "epoch": 3.3076923076923075, "grad_norm": 0.11089015752077103, "learning_rate": 6.042621680535376e-05, "loss": 1.9001, "memory/device_mem_reserved(gib)": 38.55, "memory/max_mem_active(gib)": 34.71, "memory/max_mem_allocated(gib)": 34.71, "step": 23 }, { "epoch": 3.4615384615384617, "grad_norm": 0.10617231577634811, "learning_rate": 4.706375693785958e-05, "loss": 1.9149, "memory/device_mem_reserved(gib)": 38.55, "memory/max_mem_active(gib)": 34.71, "memory/max_mem_allocated(gib)": 34.71, "step": 24 }, { "epoch": 3.4615384615384617, "eval_loss": 2.009589910507202, "eval_runtime": 376.3891, "eval_samples_per_second": 0.632, "eval_steps_per_second": 0.316, "memory/device_mem_reserved(gib)": 38.55, "memory/max_mem_active(gib)": 34.71, "memory/max_mem_allocated(gib)": 34.71, "step": 24 } ], "logging_steps": 1, "max_steps": 30, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 6, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2.829824816012329e+17, "train_batch_size": 2, "trial_name": null, "trial_params": null }