{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.042666666666666665, "eval_steps": 500, "global_step": 24, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0017777777777777779, "grad_norm": 2.875, "learning_rate": 0.0, "loss": 1.09912109375, "memory/device_reserved (GiB)": 40.7, "memory/max_active (GiB)": 34.07, "memory/max_allocated (GiB)": 34.07, "ppl": 3.00153, "step": 1, "tokens/total": 2097152, "tokens/train_per_sec_per_gpu": 631.15, "tokens/trainable": 1319329 }, { "epoch": 0.0035555555555555557, "grad_norm": 2.890625, "learning_rate": 3.3333333333333333e-06, "loss": 1.0859375, "memory/device_reserved (GiB)": 47.77, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.96222, "step": 2, "tokens/total": 4194304, "tokens/train_per_sec_per_gpu": 616.0, "tokens/trainable": 2628278 }, { "epoch": 0.005333333333333333, "grad_norm": 2.578125, "learning_rate": 6.666666666666667e-06, "loss": 1.0758056640625, "memory/device_reserved (GiB)": 47.77, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.93235, "step": 3, "tokens/total": 6291456, "tokens/train_per_sec_per_gpu": 655.05, "tokens/trainable": 3948806 }, { "epoch": 0.0071111111111111115, "grad_norm": 1.71875, "learning_rate": 1e-05, "loss": 1.0162353515625, "memory/device_reserved (GiB)": 47.77, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.76277, "step": 4, "tokens/total": 8388608, "tokens/train_per_sec_per_gpu": 598.59, "tokens/trainable": 5229996 }, { "epoch": 0.008888888888888889, "grad_norm": 2.203125, "learning_rate": 9.98903822616921e-06, "loss": 1.031494140625, "memory/device_reserved (GiB)": 47.8, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.80525, "step": 5, "tokens/total": 10485760, "tokens/train_per_sec_per_gpu": 684.59, "tokens/trainable": 6541073 }, { "epoch": 0.010666666666666666, "grad_norm": 1.84375, "learning_rate": 9.956206309337067e-06, "loss": 1.009765625, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.74496, "step": 6, "tokens/total": 12582912, "tokens/train_per_sec_per_gpu": 634.42, "tokens/trainable": 7870413 }, { "epoch": 0.012444444444444444, "grad_norm": 1.234375, "learning_rate": 9.901664203302126e-06, "loss": 0.948486328125, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.5818, "step": 7, "tokens/total": 14680064, "tokens/train_per_sec_per_gpu": 634.71, "tokens/trainable": 9189777 }, { "epoch": 0.014222222222222223, "grad_norm": 1.0, "learning_rate": 9.825677631722436e-06, "loss": 0.9532470703125, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.59412, "step": 8, "tokens/total": 16777216, "tokens/train_per_sec_per_gpu": 619.22, "tokens/trainable": 10479490 }, { "epoch": 0.016, "grad_norm": 0.8359375, "learning_rate": 9.728616793536588e-06, "loss": 0.944091796875, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.57048, "step": 9, "tokens/total": 18874368, "tokens/train_per_sec_per_gpu": 652.49, "tokens/trainable": 11784999 }, { "epoch": 0.017777777777777778, "grad_norm": 0.74609375, "learning_rate": 9.610954559391704e-06, "loss": 0.956298828125, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.60205, "step": 10, "tokens/total": 20971520, "tokens/train_per_sec_per_gpu": 600.6, "tokens/trainable": 13094236 }, { "epoch": 0.019555555555555555, "grad_norm": 0.7890625, "learning_rate": 9.473264167865172e-06, "loss": 0.9410400390625, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.56265, "step": 11, "tokens/total": 23068672, "tokens/train_per_sec_per_gpu": 610.15, "tokens/trainable": 14404718 }, { "epoch": 0.021333333333333333, "grad_norm": 0.58203125, "learning_rate": 9.316216432703918e-06, "loss": 0.8973388671875, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.45307, "step": 12, "tokens/total": 25165824, "tokens/train_per_sec_per_gpu": 667.59, "tokens/trainable": 15735257 }, { "epoch": 0.02311111111111111, "grad_norm": 0.6953125, "learning_rate": 9.140576474687263e-06, "loss": 0.9390869140625, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.55765, "step": 13, "tokens/total": 27262976, "tokens/train_per_sec_per_gpu": 634.35, "tokens/trainable": 17038230 }, { "epoch": 0.024888888888888887, "grad_norm": 0.55859375, "learning_rate": 8.947199994035402e-06, "loss": 0.9205322265625, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.51063, "step": 14, "tokens/total": 29360128, "tokens/train_per_sec_per_gpu": 705.07, "tokens/trainable": 18338536 }, { "epoch": 0.02666666666666667, "grad_norm": 0.54296875, "learning_rate": 8.737029101523931e-06, "loss": 0.9287109375, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.53124, "step": 15, "tokens/total": 31457280, "tokens/train_per_sec_per_gpu": 587.61, "tokens/trainable": 19638784 }, { "epoch": 0.028444444444444446, "grad_norm": 0.51171875, "learning_rate": 8.511087728614863e-06, "loss": 0.9176025390625, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.50328, "step": 16, "tokens/total": 33554432, "tokens/train_per_sec_per_gpu": 625.82, "tokens/trainable": 20962100 }, { "epoch": 0.030222222222222223, "grad_norm": 0.6875, "learning_rate": 8.270476638965463e-06, "loss": 0.9228515625, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.51646, "step": 17, "tokens/total": 35651584, "tokens/train_per_sec_per_gpu": 647.29, "tokens/trainable": 22244548 }, { "epoch": 0.032, "grad_norm": 0.47265625, "learning_rate": 8.016368065618361e-06, "loss": 0.9234619140625, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.51799, "step": 18, "tokens/total": 37748736, "tokens/train_per_sec_per_gpu": 633.36, "tokens/trainable": 23550208 }, { "epoch": 0.033777777777777775, "grad_norm": 0.455078125, "learning_rate": 7.75e-06, "loss": 0.9197998046875, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.50879, "step": 19, "tokens/total": 39845888, "tokens/train_per_sec_per_gpu": 655.15, "tokens/trainable": 24856052 }, { "epoch": 0.035555555555555556, "grad_norm": 0.443359375, "learning_rate": 7.472670160550849e-06, "loss": 0.933349609375, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.54301, "step": 20, "tokens/total": 41943040, "tokens/train_per_sec_per_gpu": 614.04, "tokens/trainable": 26140298 }, { "epoch": 0.037333333333333336, "grad_norm": 0.455078125, "learning_rate": 7.185729670371605e-06, "loss": 0.9356689453125, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.54892, "step": 21, "tokens/total": 44040192, "tokens/train_per_sec_per_gpu": 627.31, "tokens/trainable": 27452072 }, { "epoch": 0.03911111111111111, "grad_norm": 0.46484375, "learning_rate": 6.890576474687264e-06, "loss": 0.937255859375, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.55297, "step": 22, "tokens/total": 46137344, "tokens/train_per_sec_per_gpu": 640.26, "tokens/trainable": 28743186 }, { "epoch": 0.04088888888888889, "grad_norm": 0.4140625, "learning_rate": 6.588648530198505e-06, "loss": 0.900146484375, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.45996, "step": 23, "tokens/total": 48234496, "tokens/train_per_sec_per_gpu": 595.44, "tokens/trainable": 30066808 }, { "epoch": 0.042666666666666665, "grad_norm": 0.4921875, "learning_rate": 6.281416799501188e-06, "loss": 0.9246826171875, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.52107, "step": 24, "tokens/total": 50331648, "tokens/train_per_sec_per_gpu": 595.01, "tokens/trainable": 31368300 } ], "logging_steps": 1, "max_steps": 48, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.0944440817627955e+18, "train_batch_size": 8, "trial_name": null, "trial_params": null }