{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.08533333333333333, "eval_steps": 500, "global_step": 48, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0017777777777777779, "grad_norm": 2.875, "learning_rate": 0.0, "loss": 1.09912109375, "memory/device_reserved (GiB)": 40.7, "memory/max_active (GiB)": 34.07, "memory/max_allocated (GiB)": 34.07, "ppl": 3.00153, "step": 1, "tokens/total": 2097152, "tokens/train_per_sec_per_gpu": 631.15, "tokens/trainable": 1319329 }, { "epoch": 0.0035555555555555557, "grad_norm": 2.890625, "learning_rate": 3.3333333333333333e-06, "loss": 1.0859375, "memory/device_reserved (GiB)": 47.77, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.96222, "step": 2, "tokens/total": 4194304, "tokens/train_per_sec_per_gpu": 616.0, "tokens/trainable": 2628278 }, { "epoch": 0.005333333333333333, "grad_norm": 2.578125, "learning_rate": 6.666666666666667e-06, "loss": 1.0758056640625, "memory/device_reserved (GiB)": 47.77, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.93235, "step": 3, "tokens/total": 6291456, "tokens/train_per_sec_per_gpu": 655.05, "tokens/trainable": 3948806 }, { "epoch": 0.0071111111111111115, "grad_norm": 1.71875, "learning_rate": 1e-05, "loss": 1.0162353515625, "memory/device_reserved (GiB)": 47.77, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.76277, "step": 4, "tokens/total": 8388608, "tokens/train_per_sec_per_gpu": 598.59, "tokens/trainable": 5229996 }, { "epoch": 0.008888888888888889, "grad_norm": 2.203125, "learning_rate": 9.98903822616921e-06, "loss": 1.031494140625, "memory/device_reserved (GiB)": 47.8, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.80525, "step": 5, "tokens/total": 10485760, "tokens/train_per_sec_per_gpu": 684.59, "tokens/trainable": 6541073 }, { "epoch": 0.010666666666666666, "grad_norm": 1.84375, "learning_rate": 9.956206309337067e-06, "loss": 1.009765625, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.74496, "step": 6, "tokens/total": 12582912, "tokens/train_per_sec_per_gpu": 634.42, "tokens/trainable": 7870413 }, { "epoch": 0.012444444444444444, "grad_norm": 1.234375, "learning_rate": 9.901664203302126e-06, "loss": 0.948486328125, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.5818, "step": 7, "tokens/total": 14680064, "tokens/train_per_sec_per_gpu": 634.71, "tokens/trainable": 9189777 }, { "epoch": 0.014222222222222223, "grad_norm": 1.0, "learning_rate": 9.825677631722436e-06, "loss": 0.9532470703125, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.59412, "step": 8, "tokens/total": 16777216, "tokens/train_per_sec_per_gpu": 619.22, "tokens/trainable": 10479490 }, { "epoch": 0.016, "grad_norm": 0.8359375, "learning_rate": 9.728616793536588e-06, "loss": 0.944091796875, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.57048, "step": 9, "tokens/total": 18874368, "tokens/train_per_sec_per_gpu": 652.49, "tokens/trainable": 11784999 }, { "epoch": 0.017777777777777778, "grad_norm": 0.74609375, "learning_rate": 9.610954559391704e-06, "loss": 0.956298828125, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.60205, "step": 10, "tokens/total": 20971520, "tokens/train_per_sec_per_gpu": 600.6, "tokens/trainable": 13094236 }, { "epoch": 0.019555555555555555, "grad_norm": 0.7890625, "learning_rate": 9.473264167865172e-06, "loss": 0.9410400390625, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.56265, "step": 11, "tokens/total": 23068672, "tokens/train_per_sec_per_gpu": 610.15, "tokens/trainable": 14404718 }, { "epoch": 0.021333333333333333, "grad_norm": 0.58203125, "learning_rate": 9.316216432703918e-06, "loss": 0.8973388671875, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.45307, "step": 12, "tokens/total": 25165824, "tokens/train_per_sec_per_gpu": 667.59, "tokens/trainable": 15735257 }, { "epoch": 0.02311111111111111, "grad_norm": 0.6953125, "learning_rate": 9.140576474687263e-06, "loss": 0.9390869140625, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.55765, "step": 13, "tokens/total": 27262976, "tokens/train_per_sec_per_gpu": 634.35, "tokens/trainable": 17038230 }, { "epoch": 0.024888888888888887, "grad_norm": 0.55859375, "learning_rate": 8.947199994035402e-06, "loss": 0.9205322265625, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.51063, "step": 14, "tokens/total": 29360128, "tokens/train_per_sec_per_gpu": 705.07, "tokens/trainable": 18338536 }, { "epoch": 0.02666666666666667, "grad_norm": 0.54296875, "learning_rate": 8.737029101523931e-06, "loss": 0.9287109375, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.53124, "step": 15, "tokens/total": 31457280, "tokens/train_per_sec_per_gpu": 587.61, "tokens/trainable": 19638784 }, { "epoch": 0.028444444444444446, "grad_norm": 0.51171875, "learning_rate": 8.511087728614863e-06, "loss": 0.9176025390625, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.50328, "step": 16, "tokens/total": 33554432, "tokens/train_per_sec_per_gpu": 625.82, "tokens/trainable": 20962100 }, { "epoch": 0.030222222222222223, "grad_norm": 0.6875, "learning_rate": 8.270476638965463e-06, "loss": 0.9228515625, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.51646, "step": 17, "tokens/total": 35651584, "tokens/train_per_sec_per_gpu": 647.29, "tokens/trainable": 22244548 }, { "epoch": 0.032, "grad_norm": 0.47265625, "learning_rate": 8.016368065618361e-06, "loss": 0.9234619140625, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.51799, "step": 18, "tokens/total": 37748736, "tokens/train_per_sec_per_gpu": 633.36, "tokens/trainable": 23550208 }, { "epoch": 0.033777777777777775, "grad_norm": 0.455078125, "learning_rate": 7.75e-06, "loss": 0.9197998046875, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.50879, "step": 19, "tokens/total": 39845888, "tokens/train_per_sec_per_gpu": 655.15, "tokens/trainable": 24856052 }, { "epoch": 0.035555555555555556, "grad_norm": 0.443359375, "learning_rate": 7.472670160550849e-06, "loss": 0.933349609375, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.54301, "step": 20, "tokens/total": 41943040, "tokens/train_per_sec_per_gpu": 614.04, "tokens/trainable": 26140298 }, { "epoch": 0.037333333333333336, "grad_norm": 0.455078125, "learning_rate": 7.185729670371605e-06, "loss": 0.9356689453125, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.54892, "step": 21, "tokens/total": 44040192, "tokens/train_per_sec_per_gpu": 627.31, "tokens/trainable": 27452072 }, { "epoch": 0.03911111111111111, "grad_norm": 0.46484375, "learning_rate": 6.890576474687264e-06, "loss": 0.937255859375, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.55297, "step": 22, "tokens/total": 46137344, "tokens/train_per_sec_per_gpu": 640.26, "tokens/trainable": 28743186 }, { "epoch": 0.04088888888888889, "grad_norm": 0.4140625, "learning_rate": 6.588648530198505e-06, "loss": 0.900146484375, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.45996, "step": 23, "tokens/total": 48234496, "tokens/train_per_sec_per_gpu": 595.44, "tokens/trainable": 30066808 }, { "epoch": 0.042666666666666665, "grad_norm": 0.4921875, "learning_rate": 6.281416799501188e-06, "loss": 0.9246826171875, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.52107, "step": 24, "tokens/total": 50331648, "tokens/train_per_sec_per_gpu": 595.01, "tokens/trainable": 31368300 }, { "epoch": 0.044444444444444446, "grad_norm": 0.3828125, "learning_rate": 5.970378084704441e-06, "loss": 0.9300537109375, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.53465, "step": 25, "tokens/total": 52428800, "tokens/train_per_sec_per_gpu": 621.98, "tokens/trainable": 32679264 }, { "epoch": 0.04622222222222222, "grad_norm": 0.3671875, "learning_rate": 5.657047735161256e-06, "loss": 0.934326171875, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.5455, "step": 26, "tokens/total": 54525952, "tokens/train_per_sec_per_gpu": 600.67, "tokens/trainable": 33988396 }, { "epoch": 0.048, "grad_norm": 0.55859375, "learning_rate": 5.342952264838748e-06, "loss": 0.9188232421875, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.50634, "step": 27, "tokens/total": 56623104, "tokens/train_per_sec_per_gpu": 633.67, "tokens/trainable": 35298496 }, { "epoch": 0.049777777777777775, "grad_norm": 0.416015625, "learning_rate": 5.02962191529556e-06, "loss": 0.9195556640625, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.50818, "step": 28, "tokens/total": 58720256, "tokens/train_per_sec_per_gpu": 635.47, "tokens/trainable": 36597120 }, { "epoch": 0.051555555555555556, "grad_norm": 0.353515625, "learning_rate": 4.718583200498814e-06, "loss": 0.9129638671875, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.4917, "step": 29, "tokens/total": 60817408, "tokens/train_per_sec_per_gpu": 660.96, "tokens/trainable": 37907664 }, { "epoch": 0.05333333333333334, "grad_norm": 0.44140625, "learning_rate": 4.4113514698014955e-06, "loss": 0.905517578125, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.47321, "step": 30, "tokens/total": 62889984, "tokens/train_per_sec_per_gpu": 611.89, "tokens/trainable": 39186144 }, { "epoch": 0.05511111111111111, "grad_norm": 0.38671875, "learning_rate": 4.109423525312738e-06, "loss": 0.919189453125, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.50726, "step": 31, "tokens/total": 64987136, "tokens/train_per_sec_per_gpu": 646.87, "tokens/trainable": 40499084 }, { "epoch": 0.05688888888888889, "grad_norm": 0.369140625, "learning_rate": 3.8142703296283954e-06, "loss": 0.9398193359375, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.55952, "step": 32, "tokens/total": 67084288, "tokens/train_per_sec_per_gpu": 578.65, "tokens/trainable": 41754008 }, { "epoch": 0.058666666666666666, "grad_norm": 0.57421875, "learning_rate": 3.527329839449152e-06, "loss": 0.919921875, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.50909, "step": 33, "tokens/total": 69181440, "tokens/train_per_sec_per_gpu": 644.77, "tokens/trainable": 43059700 }, { "epoch": 0.060444444444444446, "grad_norm": 0.3515625, "learning_rate": 3.2500000000000015e-06, "loss": 0.88623046875, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.42597, "step": 34, "tokens/total": 71278592, "tokens/train_per_sec_per_gpu": 546.47, "tokens/trainable": 44340384 }, { "epoch": 0.06222222222222222, "grad_norm": 0.44140625, "learning_rate": 2.98363193438164e-06, "loss": 0.918701171875, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.50603, "step": 35, "tokens/total": 73375744, "tokens/train_per_sec_per_gpu": 633.05, "tokens/trainable": 45649076 }, { "epoch": 0.064, "grad_norm": 0.4296875, "learning_rate": 2.7295233610345384e-06, "loss": 0.9283447265625, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.53032, "step": 36, "tokens/total": 75472896, "tokens/train_per_sec_per_gpu": 601.0, "tokens/trainable": 46969288 }, { "epoch": 0.06577777777777778, "grad_norm": 0.34765625, "learning_rate": 2.4889122713851397e-06, "loss": 0.9442138671875, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.57079, "step": 37, "tokens/total": 77570048, "tokens/train_per_sec_per_gpu": 660.13, "tokens/trainable": 48301204 }, { "epoch": 0.06755555555555555, "grad_norm": 0.32421875, "learning_rate": 2.262970898476071e-06, "loss": 0.9041748046875, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.46989, "step": 38, "tokens/total": 79667200, "tokens/train_per_sec_per_gpu": 600.34, "tokens/trainable": 49615048 }, { "epoch": 0.06933333333333333, "grad_norm": 0.4609375, "learning_rate": 2.0528000059646e-06, "loss": 0.8941650390625, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.44529, "step": 39, "tokens/total": 81764352, "tokens/train_per_sec_per_gpu": 643.27, "tokens/trainable": 50907048 }, { "epoch": 0.07111111111111111, "grad_norm": 0.34375, "learning_rate": 1.8594235253127373e-06, "loss": 0.9310302734375, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.53712, "step": 40, "tokens/total": 83861504, "tokens/train_per_sec_per_gpu": 603.96, "tokens/trainable": 52206344 }, { "epoch": 0.07288888888888889, "grad_norm": 0.421875, "learning_rate": 1.6837835672960834e-06, "loss": 0.9283447265625, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.53032, "step": 41, "tokens/total": 85958656, "tokens/train_per_sec_per_gpu": 606.25, "tokens/trainable": 53511636 }, { "epoch": 0.07466666666666667, "grad_norm": 0.34765625, "learning_rate": 1.526735832134829e-06, "loss": 0.9222412109375, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.51492, "step": 42, "tokens/total": 88055808, "tokens/train_per_sec_per_gpu": 640.97, "tokens/trainable": 54832244 }, { "epoch": 0.07644444444444444, "grad_norm": 0.345703125, "learning_rate": 1.389045440608296e-06, "loss": 0.9063720703125, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.47533, "step": 43, "tokens/total": 90152960, "tokens/train_per_sec_per_gpu": 599.17, "tokens/trainable": 56163436 }, { "epoch": 0.07822222222222222, "grad_norm": 0.412109375, "learning_rate": 1.2713832064634127e-06, "loss": 0.94482421875, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.57236, "step": 44, "tokens/total": 92250112, "tokens/train_per_sec_per_gpu": 640.52, "tokens/trainable": 57456500 }, { "epoch": 0.08, "grad_norm": 0.353515625, "learning_rate": 1.174322368277565e-06, "loss": 0.914794921875, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.49626, "step": 45, "tokens/total": 94347264, "tokens/train_per_sec_per_gpu": 616.68, "tokens/trainable": 58768064 }, { "epoch": 0.08177777777777778, "grad_norm": 0.388671875, "learning_rate": 1.0983357966978747e-06, "loss": 0.914306640625, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.49504, "step": 46, "tokens/total": 96444416, "tokens/train_per_sec_per_gpu": 652.42, "tokens/trainable": 60042444 }, { "epoch": 0.08355555555555555, "grad_norm": 0.380859375, "learning_rate": 1.0437936906629336e-06, "loss": 0.9169921875, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.50175, "step": 47, "tokens/total": 98541568, "tokens/train_per_sec_per_gpu": 605.58, "tokens/trainable": 61333816 }, { "epoch": 0.08533333333333333, "grad_norm": 0.34375, "learning_rate": 1.0109617738307914e-06, "loss": 0.9178466796875, "memory/device_reserved (GiB)": 47.82, "memory/max_active (GiB)": 41.3, "memory/max_allocated (GiB)": 41.3, "ppl": 2.50389, "step": 48, "tokens/total": 100638720, "tokens/train_per_sec_per_gpu": 616.89, "tokens/trainable": 62647352 } ], "logging_steps": 1, "max_steps": 48, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2.1883537665147535e+18, "train_batch_size": 8, "trial_name": null, "trial_params": null }