Transformers
TensorBoard
Safetensors
custom_model
image-sequence-classification
vision
Generated from Trainer
Instructions to use c14kevincardenas/limbxy_seq_t2_heads2_layers1 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use c14kevincardenas/limbxy_seq_t2_heads2_layers1 with Transformers:
# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("c14kevincardenas/limbxy_seq_t2_heads2_layers1", device_map="auto") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_metric": 0.0047905659303069115, | |
| "best_model_checkpoint": "limbxy_seq_t2/checkpoint-6900", | |
| "epoch": 50.0, | |
| "eval_steps": 500, | |
| "global_step": 7500, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.16666666666666666, | |
| "grad_norm": 23976.76171875, | |
| "learning_rate": 5e-06, | |
| "loss": 0.0303, | |
| "step": 25 | |
| }, | |
| { | |
| "epoch": 0.3333333333333333, | |
| "grad_norm": 44498.20703125, | |
| "learning_rate": 1e-05, | |
| "loss": 0.0247, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.5, | |
| "grad_norm": 15935.5693359375, | |
| "learning_rate": 1.5e-05, | |
| "loss": 0.0242, | |
| "step": 75 | |
| }, | |
| { | |
| "epoch": 0.6666666666666666, | |
| "grad_norm": 46439.44140625, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0185, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.8333333333333334, | |
| "grad_norm": 56363.26171875, | |
| "learning_rate": 2.5e-05, | |
| "loss": 0.016, | |
| "step": 125 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 42469.171875, | |
| "learning_rate": 3e-05, | |
| "loss": 0.0135, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "eval_loss": 0.012278009206056595, | |
| "eval_rmse": 0.1108061820268631, | |
| "eval_runtime": 22.9058, | |
| "eval_samples_per_second": 36.934, | |
| "eval_steps_per_second": 1.179, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 1.1666666666666667, | |
| "grad_norm": 18461.55859375, | |
| "learning_rate": 3.5e-05, | |
| "loss": 0.0111, | |
| "step": 175 | |
| }, | |
| { | |
| "epoch": 1.3333333333333333, | |
| "grad_norm": 30171.146484375, | |
| "learning_rate": 4e-05, | |
| "loss": 0.0113, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 1.5, | |
| "grad_norm": 25474.505859375, | |
| "learning_rate": 4.5e-05, | |
| "loss": 0.0108, | |
| "step": 225 | |
| }, | |
| { | |
| "epoch": 1.6666666666666665, | |
| "grad_norm": 32029.49609375, | |
| "learning_rate": 5e-05, | |
| "loss": 0.0101, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 1.8333333333333335, | |
| "grad_norm": 39912.48828125, | |
| "learning_rate": 4.982758620689655e-05, | |
| "loss": 0.0091, | |
| "step": 275 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "grad_norm": 36011.33984375, | |
| "learning_rate": 4.9655172413793107e-05, | |
| "loss": 0.0102, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "eval_loss": 0.007965018041431904, | |
| "eval_rmse": 0.08924694359302521, | |
| "eval_runtime": 24.0962, | |
| "eval_samples_per_second": 35.109, | |
| "eval_steps_per_second": 1.121, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 2.1666666666666665, | |
| "grad_norm": 29222.896484375, | |
| "learning_rate": 4.9482758620689655e-05, | |
| "loss": 0.0065, | |
| "step": 325 | |
| }, | |
| { | |
| "epoch": 2.3333333333333335, | |
| "grad_norm": 18097.1953125, | |
| "learning_rate": 4.931034482758621e-05, | |
| "loss": 0.0067, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 2.5, | |
| "grad_norm": 20067.69140625, | |
| "learning_rate": 4.913793103448276e-05, | |
| "loss": 0.0067, | |
| "step": 375 | |
| }, | |
| { | |
| "epoch": 2.6666666666666665, | |
| "grad_norm": 26646.060546875, | |
| "learning_rate": 4.896551724137931e-05, | |
| "loss": 0.0085, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 2.8333333333333335, | |
| "grad_norm": 37624.953125, | |
| "learning_rate": 4.8793103448275864e-05, | |
| "loss": 0.0085, | |
| "step": 425 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "grad_norm": 11236.326171875, | |
| "learning_rate": 4.862068965517241e-05, | |
| "loss": 0.0065, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "eval_loss": 0.010736133903265, | |
| "eval_rmse": 0.10361532121896744, | |
| "eval_runtime": 24.7647, | |
| "eval_samples_per_second": 34.162, | |
| "eval_steps_per_second": 1.09, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 3.1666666666666665, | |
| "grad_norm": 21234.044921875, | |
| "learning_rate": 4.844827586206897e-05, | |
| "loss": 0.0056, | |
| "step": 475 | |
| }, | |
| { | |
| "epoch": 3.3333333333333335, | |
| "grad_norm": 27683.8359375, | |
| "learning_rate": 4.827586206896552e-05, | |
| "loss": 0.0065, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 3.5, | |
| "grad_norm": 27213.1171875, | |
| "learning_rate": 4.810344827586207e-05, | |
| "loss": 0.0048, | |
| "step": 525 | |
| }, | |
| { | |
| "epoch": 3.6666666666666665, | |
| "grad_norm": 51301.77734375, | |
| "learning_rate": 4.793103448275863e-05, | |
| "loss": 0.0064, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 3.8333333333333335, | |
| "grad_norm": 22701.841796875, | |
| "learning_rate": 4.7758620689655176e-05, | |
| "loss": 0.005, | |
| "step": 575 | |
| }, | |
| { | |
| "epoch": 4.0, | |
| "grad_norm": 43817.91796875, | |
| "learning_rate": 4.7586206896551725e-05, | |
| "loss": 0.0049, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 4.0, | |
| "eval_loss": 0.008756866678595543, | |
| "eval_rmse": 0.09357813745737076, | |
| "eval_runtime": 24.2147, | |
| "eval_samples_per_second": 34.937, | |
| "eval_steps_per_second": 1.115, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 4.166666666666667, | |
| "grad_norm": 23862.228515625, | |
| "learning_rate": 4.741379310344828e-05, | |
| "loss": 0.0056, | |
| "step": 625 | |
| }, | |
| { | |
| "epoch": 4.333333333333333, | |
| "grad_norm": 22432.494140625, | |
| "learning_rate": 4.724137931034483e-05, | |
| "loss": 0.0045, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 4.5, | |
| "grad_norm": 36739.33203125, | |
| "learning_rate": 4.7068965517241385e-05, | |
| "loss": 0.0043, | |
| "step": 675 | |
| }, | |
| { | |
| "epoch": 4.666666666666667, | |
| "grad_norm": 30371.708984375, | |
| "learning_rate": 4.689655172413793e-05, | |
| "loss": 0.0048, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 4.833333333333333, | |
| "grad_norm": 20437.169921875, | |
| "learning_rate": 4.672413793103448e-05, | |
| "loss": 0.0037, | |
| "step": 725 | |
| }, | |
| { | |
| "epoch": 5.0, | |
| "grad_norm": 29574.46875, | |
| "learning_rate": 4.655172413793104e-05, | |
| "loss": 0.0042, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 5.0, | |
| "eval_loss": 0.007152818143367767, | |
| "eval_rmse": 0.08457433432340622, | |
| "eval_runtime": 25.0184, | |
| "eval_samples_per_second": 33.815, | |
| "eval_steps_per_second": 1.079, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 5.166666666666667, | |
| "grad_norm": 27755.48828125, | |
| "learning_rate": 4.6379310344827586e-05, | |
| "loss": 0.0028, | |
| "step": 775 | |
| }, | |
| { | |
| "epoch": 5.333333333333333, | |
| "grad_norm": 27771.154296875, | |
| "learning_rate": 4.6206896551724135e-05, | |
| "loss": 0.0039, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 5.5, | |
| "grad_norm": 17496.92578125, | |
| "learning_rate": 4.603448275862069e-05, | |
| "loss": 0.0039, | |
| "step": 825 | |
| }, | |
| { | |
| "epoch": 5.666666666666667, | |
| "grad_norm": 18169.658203125, | |
| "learning_rate": 4.586206896551724e-05, | |
| "loss": 0.0039, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 5.833333333333333, | |
| "grad_norm": 17193.5234375, | |
| "learning_rate": 4.5689655172413794e-05, | |
| "loss": 0.0034, | |
| "step": 875 | |
| }, | |
| { | |
| "epoch": 6.0, | |
| "grad_norm": 22194.474609375, | |
| "learning_rate": 4.551724137931035e-05, | |
| "loss": 0.0033, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 6.0, | |
| "eval_loss": 0.007074417546391487, | |
| "eval_rmse": 0.08410955965518951, | |
| "eval_runtime": 23.9626, | |
| "eval_samples_per_second": 35.305, | |
| "eval_steps_per_second": 1.127, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 6.166666666666667, | |
| "grad_norm": 9658.81640625, | |
| "learning_rate": 4.53448275862069e-05, | |
| "loss": 0.0026, | |
| "step": 925 | |
| }, | |
| { | |
| "epoch": 6.333333333333333, | |
| "grad_norm": 8459.115234375, | |
| "learning_rate": 4.5172413793103454e-05, | |
| "loss": 0.0025, | |
| "step": 950 | |
| }, | |
| { | |
| "epoch": 6.5, | |
| "grad_norm": 22246.572265625, | |
| "learning_rate": 4.5e-05, | |
| "loss": 0.0027, | |
| "step": 975 | |
| }, | |
| { | |
| "epoch": 6.666666666666667, | |
| "grad_norm": 19054.365234375, | |
| "learning_rate": 4.482758620689655e-05, | |
| "loss": 0.0027, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 6.833333333333333, | |
| "grad_norm": 20117.76171875, | |
| "learning_rate": 4.465517241379311e-05, | |
| "loss": 0.0027, | |
| "step": 1025 | |
| }, | |
| { | |
| "epoch": 7.0, | |
| "grad_norm": 31974.06640625, | |
| "learning_rate": 4.4482758620689656e-05, | |
| "loss": 0.0028, | |
| "step": 1050 | |
| }, | |
| { | |
| "epoch": 7.0, | |
| "eval_loss": 0.006500152871012688, | |
| "eval_rmse": 0.08062352240085602, | |
| "eval_runtime": 24.6356, | |
| "eval_samples_per_second": 34.341, | |
| "eval_steps_per_second": 1.096, | |
| "step": 1050 | |
| }, | |
| { | |
| "epoch": 7.166666666666667, | |
| "grad_norm": 7549.3779296875, | |
| "learning_rate": 4.431034482758621e-05, | |
| "loss": 0.0023, | |
| "step": 1075 | |
| }, | |
| { | |
| "epoch": 7.333333333333333, | |
| "grad_norm": 3568.779296875, | |
| "learning_rate": 4.413793103448276e-05, | |
| "loss": 0.0023, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 7.5, | |
| "grad_norm": 7770.5302734375, | |
| "learning_rate": 4.396551724137931e-05, | |
| "loss": 0.0024, | |
| "step": 1125 | |
| }, | |
| { | |
| "epoch": 7.666666666666667, | |
| "grad_norm": 3176.07470703125, | |
| "learning_rate": 4.3793103448275864e-05, | |
| "loss": 0.0025, | |
| "step": 1150 | |
| }, | |
| { | |
| "epoch": 7.833333333333333, | |
| "grad_norm": 10015.4404296875, | |
| "learning_rate": 4.362068965517241e-05, | |
| "loss": 0.0024, | |
| "step": 1175 | |
| }, | |
| { | |
| "epoch": 8.0, | |
| "grad_norm": 4624.525390625, | |
| "learning_rate": 4.344827586206897e-05, | |
| "loss": 0.0023, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 8.0, | |
| "eval_loss": 0.007097144145518541, | |
| "eval_rmse": 0.08424454927444458, | |
| "eval_runtime": 24.1478, | |
| "eval_samples_per_second": 35.034, | |
| "eval_steps_per_second": 1.118, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 8.166666666666666, | |
| "grad_norm": 32302.224609375, | |
| "learning_rate": 4.327586206896552e-05, | |
| "loss": 0.0027, | |
| "step": 1225 | |
| }, | |
| { | |
| "epoch": 8.333333333333334, | |
| "grad_norm": 15594.7314453125, | |
| "learning_rate": 4.3103448275862066e-05, | |
| "loss": 0.0027, | |
| "step": 1250 | |
| }, | |
| { | |
| "epoch": 8.5, | |
| "grad_norm": 30639.5546875, | |
| "learning_rate": 4.293103448275863e-05, | |
| "loss": 0.0023, | |
| "step": 1275 | |
| }, | |
| { | |
| "epoch": 8.666666666666666, | |
| "grad_norm": 16389.27734375, | |
| "learning_rate": 4.275862068965518e-05, | |
| "loss": 0.0026, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 8.833333333333334, | |
| "grad_norm": 6988.25048828125, | |
| "learning_rate": 4.2586206896551725e-05, | |
| "loss": 0.0027, | |
| "step": 1325 | |
| }, | |
| { | |
| "epoch": 9.0, | |
| "grad_norm": 15722.751953125, | |
| "learning_rate": 4.241379310344828e-05, | |
| "loss": 0.0022, | |
| "step": 1350 | |
| }, | |
| { | |
| "epoch": 9.0, | |
| "eval_loss": 0.006430492270737886, | |
| "eval_rmse": 0.08019035309553146, | |
| "eval_runtime": 24.2153, | |
| "eval_samples_per_second": 34.937, | |
| "eval_steps_per_second": 1.115, | |
| "step": 1350 | |
| }, | |
| { | |
| "epoch": 9.166666666666666, | |
| "grad_norm": 14371.986328125, | |
| "learning_rate": 4.224137931034483e-05, | |
| "loss": 0.0017, | |
| "step": 1375 | |
| }, | |
| { | |
| "epoch": 9.333333333333334, | |
| "grad_norm": 15843.341796875, | |
| "learning_rate": 4.2068965517241385e-05, | |
| "loss": 0.0015, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 9.5, | |
| "grad_norm": 13752.29296875, | |
| "learning_rate": 4.1896551724137934e-05, | |
| "loss": 0.0021, | |
| "step": 1425 | |
| }, | |
| { | |
| "epoch": 9.666666666666666, | |
| "grad_norm": 3012.7041015625, | |
| "learning_rate": 4.172413793103448e-05, | |
| "loss": 0.0016, | |
| "step": 1450 | |
| }, | |
| { | |
| "epoch": 9.833333333333334, | |
| "grad_norm": 12362.5390625, | |
| "learning_rate": 4.155172413793104e-05, | |
| "loss": 0.0017, | |
| "step": 1475 | |
| }, | |
| { | |
| "epoch": 10.0, | |
| "grad_norm": 14453.1337890625, | |
| "learning_rate": 4.1379310344827587e-05, | |
| "loss": 0.0018, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 10.0, | |
| "eval_loss": 0.005872304085642099, | |
| "eval_rmse": 0.07663095742464066, | |
| "eval_runtime": 24.1286, | |
| "eval_samples_per_second": 35.062, | |
| "eval_steps_per_second": 1.119, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 10.166666666666666, | |
| "grad_norm": 9474.490234375, | |
| "learning_rate": 4.120689655172414e-05, | |
| "loss": 0.0013, | |
| "step": 1525 | |
| }, | |
| { | |
| "epoch": 10.333333333333334, | |
| "grad_norm": 18761.958984375, | |
| "learning_rate": 4.103448275862069e-05, | |
| "loss": 0.0015, | |
| "step": 1550 | |
| }, | |
| { | |
| "epoch": 10.5, | |
| "grad_norm": 8908.1357421875, | |
| "learning_rate": 4.086206896551724e-05, | |
| "loss": 0.0014, | |
| "step": 1575 | |
| }, | |
| { | |
| "epoch": 10.666666666666666, | |
| "grad_norm": 10597.185546875, | |
| "learning_rate": 4.0689655172413795e-05, | |
| "loss": 0.0013, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 10.833333333333334, | |
| "grad_norm": 2860.470458984375, | |
| "learning_rate": 4.0517241379310344e-05, | |
| "loss": 0.0013, | |
| "step": 1625 | |
| }, | |
| { | |
| "epoch": 11.0, | |
| "grad_norm": 16391.615234375, | |
| "learning_rate": 4.03448275862069e-05, | |
| "loss": 0.0014, | |
| "step": 1650 | |
| }, | |
| { | |
| "epoch": 11.0, | |
| "eval_loss": 0.005458915140479803, | |
| "eval_rmse": 0.07388447225093842, | |
| "eval_runtime": 23.9306, | |
| "eval_samples_per_second": 35.352, | |
| "eval_steps_per_second": 1.128, | |
| "step": 1650 | |
| }, | |
| { | |
| "epoch": 11.166666666666666, | |
| "grad_norm": 7713.515625, | |
| "learning_rate": 4.0172413793103455e-05, | |
| "loss": 0.0011, | |
| "step": 1675 | |
| }, | |
| { | |
| "epoch": 11.333333333333334, | |
| "grad_norm": 7927.998046875, | |
| "learning_rate": 4e-05, | |
| "loss": 0.0013, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 11.5, | |
| "grad_norm": 12422.3525390625, | |
| "learning_rate": 3.982758620689656e-05, | |
| "loss": 0.0012, | |
| "step": 1725 | |
| }, | |
| { | |
| "epoch": 11.666666666666666, | |
| "grad_norm": 6916.77197265625, | |
| "learning_rate": 3.965517241379311e-05, | |
| "loss": 0.0013, | |
| "step": 1750 | |
| }, | |
| { | |
| "epoch": 11.833333333333334, | |
| "grad_norm": 15062.759765625, | |
| "learning_rate": 3.9482758620689656e-05, | |
| "loss": 0.0013, | |
| "step": 1775 | |
| }, | |
| { | |
| "epoch": 12.0, | |
| "grad_norm": 11555.865234375, | |
| "learning_rate": 3.931034482758621e-05, | |
| "loss": 0.0014, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 12.0, | |
| "eval_loss": 0.006092158146202564, | |
| "eval_rmse": 0.07805227488279343, | |
| "eval_runtime": 24.7327, | |
| "eval_samples_per_second": 34.206, | |
| "eval_steps_per_second": 1.092, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 12.166666666666666, | |
| "grad_norm": 16014.1708984375, | |
| "learning_rate": 3.913793103448276e-05, | |
| "loss": 0.0013, | |
| "step": 1825 | |
| }, | |
| { | |
| "epoch": 12.333333333333334, | |
| "grad_norm": 8199.9521484375, | |
| "learning_rate": 3.896551724137931e-05, | |
| "loss": 0.0015, | |
| "step": 1850 | |
| }, | |
| { | |
| "epoch": 12.5, | |
| "grad_norm": 5141.04541015625, | |
| "learning_rate": 3.8793103448275865e-05, | |
| "loss": 0.0011, | |
| "step": 1875 | |
| }, | |
| { | |
| "epoch": 12.666666666666666, | |
| "grad_norm": 6066.68603515625, | |
| "learning_rate": 3.862068965517241e-05, | |
| "loss": 0.0013, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 12.833333333333334, | |
| "grad_norm": 15361.6728515625, | |
| "learning_rate": 3.844827586206897e-05, | |
| "loss": 0.0013, | |
| "step": 1925 | |
| }, | |
| { | |
| "epoch": 13.0, | |
| "grad_norm": 18773.4296875, | |
| "learning_rate": 3.827586206896552e-05, | |
| "loss": 0.0013, | |
| "step": 1950 | |
| }, | |
| { | |
| "epoch": 13.0, | |
| "eval_loss": 0.005602031946182251, | |
| "eval_rmse": 0.07484672218561172, | |
| "eval_runtime": 25.6642, | |
| "eval_samples_per_second": 32.964, | |
| "eval_steps_per_second": 1.052, | |
| "step": 1950 | |
| }, | |
| { | |
| "epoch": 13.166666666666666, | |
| "grad_norm": 13982.216796875, | |
| "learning_rate": 3.8103448275862066e-05, | |
| "loss": 0.0012, | |
| "step": 1975 | |
| }, | |
| { | |
| "epoch": 13.333333333333334, | |
| "grad_norm": 8787.0205078125, | |
| "learning_rate": 3.793103448275862e-05, | |
| "loss": 0.0013, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 13.5, | |
| "grad_norm": 14623.2998046875, | |
| "learning_rate": 3.775862068965517e-05, | |
| "loss": 0.0014, | |
| "step": 2025 | |
| }, | |
| { | |
| "epoch": 13.666666666666666, | |
| "grad_norm": 15070.6416015625, | |
| "learning_rate": 3.7586206896551726e-05, | |
| "loss": 0.0011, | |
| "step": 2050 | |
| }, | |
| { | |
| "epoch": 13.833333333333334, | |
| "grad_norm": 3772.699951171875, | |
| "learning_rate": 3.741379310344828e-05, | |
| "loss": 0.0012, | |
| "step": 2075 | |
| }, | |
| { | |
| "epoch": 14.0, | |
| "grad_norm": 6189.50927734375, | |
| "learning_rate": 3.724137931034483e-05, | |
| "loss": 0.0009, | |
| "step": 2100 | |
| }, | |
| { | |
| "epoch": 14.0, | |
| "eval_loss": 0.005514672491699457, | |
| "eval_rmse": 0.07426083832979202, | |
| "eval_runtime": 24.3843, | |
| "eval_samples_per_second": 34.695, | |
| "eval_steps_per_second": 1.107, | |
| "step": 2100 | |
| }, | |
| { | |
| "epoch": 14.166666666666666, | |
| "grad_norm": 7100.7158203125, | |
| "learning_rate": 3.7068965517241385e-05, | |
| "loss": 0.0011, | |
| "step": 2125 | |
| }, | |
| { | |
| "epoch": 14.333333333333334, | |
| "grad_norm": 21329.642578125, | |
| "learning_rate": 3.6896551724137934e-05, | |
| "loss": 0.0012, | |
| "step": 2150 | |
| }, | |
| { | |
| "epoch": 14.5, | |
| "grad_norm": 13695.5166015625, | |
| "learning_rate": 3.672413793103448e-05, | |
| "loss": 0.0014, | |
| "step": 2175 | |
| }, | |
| { | |
| "epoch": 14.666666666666666, | |
| "grad_norm": 2531.25048828125, | |
| "learning_rate": 3.655172413793104e-05, | |
| "loss": 0.001, | |
| "step": 2200 | |
| }, | |
| { | |
| "epoch": 14.833333333333334, | |
| "grad_norm": 34455.28125, | |
| "learning_rate": 3.637931034482759e-05, | |
| "loss": 0.0017, | |
| "step": 2225 | |
| }, | |
| { | |
| "epoch": 15.0, | |
| "grad_norm": 4662.3671875, | |
| "learning_rate": 3.620689655172414e-05, | |
| "loss": 0.0017, | |
| "step": 2250 | |
| }, | |
| { | |
| "epoch": 15.0, | |
| "eval_loss": 0.005805719178169966, | |
| "eval_rmse": 0.07619526982307434, | |
| "eval_runtime": 25.2273, | |
| "eval_samples_per_second": 33.535, | |
| "eval_steps_per_second": 1.07, | |
| "step": 2250 | |
| }, | |
| { | |
| "epoch": 15.166666666666666, | |
| "grad_norm": 20696.083984375, | |
| "learning_rate": 3.603448275862069e-05, | |
| "loss": 0.0012, | |
| "step": 2275 | |
| }, | |
| { | |
| "epoch": 15.333333333333334, | |
| "grad_norm": 11598.755859375, | |
| "learning_rate": 3.586206896551724e-05, | |
| "loss": 0.0009, | |
| "step": 2300 | |
| }, | |
| { | |
| "epoch": 15.5, | |
| "grad_norm": 3409.390625, | |
| "learning_rate": 3.5689655172413795e-05, | |
| "loss": 0.001, | |
| "step": 2325 | |
| }, | |
| { | |
| "epoch": 15.666666666666666, | |
| "grad_norm": 5427.46875, | |
| "learning_rate": 3.5517241379310344e-05, | |
| "loss": 0.0012, | |
| "step": 2350 | |
| }, | |
| { | |
| "epoch": 15.833333333333334, | |
| "grad_norm": 7153.16650390625, | |
| "learning_rate": 3.53448275862069e-05, | |
| "loss": 0.0009, | |
| "step": 2375 | |
| }, | |
| { | |
| "epoch": 16.0, | |
| "grad_norm": 5100.07763671875, | |
| "learning_rate": 3.517241379310345e-05, | |
| "loss": 0.0012, | |
| "step": 2400 | |
| }, | |
| { | |
| "epoch": 16.0, | |
| "eval_loss": 0.005410957615822554, | |
| "eval_rmse": 0.07355920970439911, | |
| "eval_runtime": 24.7206, | |
| "eval_samples_per_second": 34.223, | |
| "eval_steps_per_second": 1.092, | |
| "step": 2400 | |
| }, | |
| { | |
| "epoch": 16.166666666666668, | |
| "grad_norm": 20211.419921875, | |
| "learning_rate": 3.5e-05, | |
| "loss": 0.0011, | |
| "step": 2425 | |
| }, | |
| { | |
| "epoch": 16.333333333333332, | |
| "grad_norm": 12609.2548828125, | |
| "learning_rate": 3.482758620689655e-05, | |
| "loss": 0.0011, | |
| "step": 2450 | |
| }, | |
| { | |
| "epoch": 16.5, | |
| "grad_norm": 3446.8486328125, | |
| "learning_rate": 3.465517241379311e-05, | |
| "loss": 0.0009, | |
| "step": 2475 | |
| }, | |
| { | |
| "epoch": 16.666666666666668, | |
| "grad_norm": 14641.283203125, | |
| "learning_rate": 3.4482758620689657e-05, | |
| "loss": 0.0008, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 16.833333333333332, | |
| "grad_norm": 12291.1083984375, | |
| "learning_rate": 3.431034482758621e-05, | |
| "loss": 0.0009, | |
| "step": 2525 | |
| }, | |
| { | |
| "epoch": 17.0, | |
| "grad_norm": 7226.25, | |
| "learning_rate": 3.413793103448276e-05, | |
| "loss": 0.0008, | |
| "step": 2550 | |
| }, | |
| { | |
| "epoch": 17.0, | |
| "eval_loss": 0.005254137795418501, | |
| "eval_rmse": 0.07248543202877045, | |
| "eval_runtime": 25.4082, | |
| "eval_samples_per_second": 33.296, | |
| "eval_steps_per_second": 1.063, | |
| "step": 2550 | |
| }, | |
| { | |
| "epoch": 17.166666666666668, | |
| "grad_norm": 6015.2412109375, | |
| "learning_rate": 3.3965517241379316e-05, | |
| "loss": 0.0008, | |
| "step": 2575 | |
| }, | |
| { | |
| "epoch": 17.333333333333332, | |
| "grad_norm": 7095.80859375, | |
| "learning_rate": 3.3793103448275865e-05, | |
| "loss": 0.0008, | |
| "step": 2600 | |
| }, | |
| { | |
| "epoch": 17.5, | |
| "grad_norm": 7659.24951171875, | |
| "learning_rate": 3.3620689655172414e-05, | |
| "loss": 0.0008, | |
| "step": 2625 | |
| }, | |
| { | |
| "epoch": 17.666666666666668, | |
| "grad_norm": 3724.34619140625, | |
| "learning_rate": 3.344827586206897e-05, | |
| "loss": 0.001, | |
| "step": 2650 | |
| }, | |
| { | |
| "epoch": 17.833333333333332, | |
| "grad_norm": 16511.189453125, | |
| "learning_rate": 3.327586206896552e-05, | |
| "loss": 0.0009, | |
| "step": 2675 | |
| }, | |
| { | |
| "epoch": 18.0, | |
| "grad_norm": 13546.2470703125, | |
| "learning_rate": 3.310344827586207e-05, | |
| "loss": 0.0008, | |
| "step": 2700 | |
| }, | |
| { | |
| "epoch": 18.0, | |
| "eval_loss": 0.00547071872279048, | |
| "eval_rmse": 0.07396430522203445, | |
| "eval_runtime": 24.3255, | |
| "eval_samples_per_second": 34.778, | |
| "eval_steps_per_second": 1.11, | |
| "step": 2700 | |
| }, | |
| { | |
| "epoch": 18.166666666666668, | |
| "grad_norm": 9512.2578125, | |
| "learning_rate": 3.293103448275862e-05, | |
| "loss": 0.0008, | |
| "step": 2725 | |
| }, | |
| { | |
| "epoch": 18.333333333333332, | |
| "grad_norm": 6799.78662109375, | |
| "learning_rate": 3.275862068965517e-05, | |
| "loss": 0.0008, | |
| "step": 2750 | |
| }, | |
| { | |
| "epoch": 18.5, | |
| "grad_norm": 3044.78662109375, | |
| "learning_rate": 3.2586206896551726e-05, | |
| "loss": 0.0007, | |
| "step": 2775 | |
| }, | |
| { | |
| "epoch": 18.666666666666668, | |
| "grad_norm": 13546.1982421875, | |
| "learning_rate": 3.2413793103448275e-05, | |
| "loss": 0.0007, | |
| "step": 2800 | |
| }, | |
| { | |
| "epoch": 18.833333333333332, | |
| "grad_norm": 12045.7158203125, | |
| "learning_rate": 3.2241379310344824e-05, | |
| "loss": 0.0007, | |
| "step": 2825 | |
| }, | |
| { | |
| "epoch": 19.0, | |
| "grad_norm": 11820.66015625, | |
| "learning_rate": 3.206896551724138e-05, | |
| "loss": 0.0007, | |
| "step": 2850 | |
| }, | |
| { | |
| "epoch": 19.0, | |
| "eval_loss": 0.005731063894927502, | |
| "eval_rmse": 0.07570379227399826, | |
| "eval_runtime": 24.3718, | |
| "eval_samples_per_second": 34.712, | |
| "eval_steps_per_second": 1.108, | |
| "step": 2850 | |
| }, | |
| { | |
| "epoch": 19.166666666666668, | |
| "grad_norm": 4663.9130859375, | |
| "learning_rate": 3.1896551724137935e-05, | |
| "loss": 0.0007, | |
| "step": 2875 | |
| }, | |
| { | |
| "epoch": 19.333333333333332, | |
| "grad_norm": 1934.84619140625, | |
| "learning_rate": 3.172413793103448e-05, | |
| "loss": 0.0007, | |
| "step": 2900 | |
| }, | |
| { | |
| "epoch": 19.5, | |
| "grad_norm": 6919.31982421875, | |
| "learning_rate": 3.155172413793104e-05, | |
| "loss": 0.0007, | |
| "step": 2925 | |
| }, | |
| { | |
| "epoch": 19.666666666666668, | |
| "grad_norm": 6109.6171875, | |
| "learning_rate": 3.137931034482759e-05, | |
| "loss": 0.0007, | |
| "step": 2950 | |
| }, | |
| { | |
| "epoch": 19.833333333333332, | |
| "grad_norm": 5411.876953125, | |
| "learning_rate": 3.120689655172414e-05, | |
| "loss": 0.0006, | |
| "step": 2975 | |
| }, | |
| { | |
| "epoch": 20.0, | |
| "grad_norm": 11151.029296875, | |
| "learning_rate": 3.103448275862069e-05, | |
| "loss": 0.0007, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 20.0, | |
| "eval_loss": 0.005564698483794928, | |
| "eval_rmse": 0.07459690421819687, | |
| "eval_runtime": 24.4791, | |
| "eval_samples_per_second": 34.56, | |
| "eval_steps_per_second": 1.103, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 20.166666666666668, | |
| "grad_norm": 6611.220703125, | |
| "learning_rate": 3.086206896551724e-05, | |
| "loss": 0.0007, | |
| "step": 3025 | |
| }, | |
| { | |
| "epoch": 20.333333333333332, | |
| "grad_norm": 2534.669921875, | |
| "learning_rate": 3.0689655172413796e-05, | |
| "loss": 0.0008, | |
| "step": 3050 | |
| }, | |
| { | |
| "epoch": 20.5, | |
| "grad_norm": 4288.451171875, | |
| "learning_rate": 3.0517241379310348e-05, | |
| "loss": 0.0007, | |
| "step": 3075 | |
| }, | |
| { | |
| "epoch": 20.666666666666668, | |
| "grad_norm": 6255.359375, | |
| "learning_rate": 3.0344827586206897e-05, | |
| "loss": 0.0006, | |
| "step": 3100 | |
| }, | |
| { | |
| "epoch": 20.833333333333332, | |
| "grad_norm": 4882.11328125, | |
| "learning_rate": 3.017241379310345e-05, | |
| "loss": 0.0006, | |
| "step": 3125 | |
| }, | |
| { | |
| "epoch": 21.0, | |
| "grad_norm": 2612.861083984375, | |
| "learning_rate": 3e-05, | |
| "loss": 0.0006, | |
| "step": 3150 | |
| }, | |
| { | |
| "epoch": 21.0, | |
| "eval_loss": 0.005460184533149004, | |
| "eval_rmse": 0.07389306277036667, | |
| "eval_runtime": 24.709, | |
| "eval_samples_per_second": 34.239, | |
| "eval_steps_per_second": 1.093, | |
| "step": 3150 | |
| }, | |
| { | |
| "epoch": 21.166666666666668, | |
| "grad_norm": 13961.8076171875, | |
| "learning_rate": 2.9827586206896553e-05, | |
| "loss": 0.0007, | |
| "step": 3175 | |
| }, | |
| { | |
| "epoch": 21.333333333333332, | |
| "grad_norm": 10601.8212890625, | |
| "learning_rate": 2.96551724137931e-05, | |
| "loss": 0.0007, | |
| "step": 3200 | |
| }, | |
| { | |
| "epoch": 21.5, | |
| "grad_norm": 8989.919921875, | |
| "learning_rate": 2.9482758620689654e-05, | |
| "loss": 0.0007, | |
| "step": 3225 | |
| }, | |
| { | |
| "epoch": 21.666666666666668, | |
| "grad_norm": 2415.768310546875, | |
| "learning_rate": 2.9310344827586206e-05, | |
| "loss": 0.0006, | |
| "step": 3250 | |
| }, | |
| { | |
| "epoch": 21.833333333333332, | |
| "grad_norm": 4838.57666015625, | |
| "learning_rate": 2.913793103448276e-05, | |
| "loss": 0.0005, | |
| "step": 3275 | |
| }, | |
| { | |
| "epoch": 22.0, | |
| "grad_norm": 8728.1083984375, | |
| "learning_rate": 2.8965517241379313e-05, | |
| "loss": 0.0005, | |
| "step": 3300 | |
| }, | |
| { | |
| "epoch": 22.0, | |
| "eval_loss": 0.005140391178429127, | |
| "eval_rmse": 0.07169651985168457, | |
| "eval_runtime": 24.1883, | |
| "eval_samples_per_second": 34.976, | |
| "eval_steps_per_second": 1.116, | |
| "step": 3300 | |
| }, | |
| { | |
| "epoch": 22.166666666666668, | |
| "grad_norm": 14058.439453125, | |
| "learning_rate": 2.8793103448275865e-05, | |
| "loss": 0.0006, | |
| "step": 3325 | |
| }, | |
| { | |
| "epoch": 22.333333333333332, | |
| "grad_norm": 3426.945068359375, | |
| "learning_rate": 2.8620689655172417e-05, | |
| "loss": 0.0007, | |
| "step": 3350 | |
| }, | |
| { | |
| "epoch": 22.5, | |
| "grad_norm": 4576.7431640625, | |
| "learning_rate": 2.844827586206897e-05, | |
| "loss": 0.0005, | |
| "step": 3375 | |
| }, | |
| { | |
| "epoch": 22.666666666666668, | |
| "grad_norm": 2808.37744140625, | |
| "learning_rate": 2.8275862068965518e-05, | |
| "loss": 0.0005, | |
| "step": 3400 | |
| }, | |
| { | |
| "epoch": 22.833333333333332, | |
| "grad_norm": 9870.7392578125, | |
| "learning_rate": 2.810344827586207e-05, | |
| "loss": 0.0006, | |
| "step": 3425 | |
| }, | |
| { | |
| "epoch": 23.0, | |
| "grad_norm": 12436.296875, | |
| "learning_rate": 2.7931034482758622e-05, | |
| "loss": 0.0006, | |
| "step": 3450 | |
| }, | |
| { | |
| "epoch": 23.0, | |
| "eval_loss": 0.005283581558614969, | |
| "eval_rmse": 0.0726882591843605, | |
| "eval_runtime": 24.0792, | |
| "eval_samples_per_second": 35.134, | |
| "eval_steps_per_second": 1.121, | |
| "step": 3450 | |
| }, | |
| { | |
| "epoch": 23.166666666666668, | |
| "grad_norm": 2277.886962890625, | |
| "learning_rate": 2.7758620689655175e-05, | |
| "loss": 0.0006, | |
| "step": 3475 | |
| }, | |
| { | |
| "epoch": 23.333333333333332, | |
| "grad_norm": 12487.025390625, | |
| "learning_rate": 2.7586206896551727e-05, | |
| "loss": 0.0006, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 23.5, | |
| "grad_norm": 13577.09375, | |
| "learning_rate": 2.7413793103448275e-05, | |
| "loss": 0.0006, | |
| "step": 3525 | |
| }, | |
| { | |
| "epoch": 23.666666666666668, | |
| "grad_norm": 13655.8271484375, | |
| "learning_rate": 2.7241379310344827e-05, | |
| "loss": 0.0005, | |
| "step": 3550 | |
| }, | |
| { | |
| "epoch": 23.833333333333332, | |
| "grad_norm": 2765.83056640625, | |
| "learning_rate": 2.706896551724138e-05, | |
| "loss": 0.0005, | |
| "step": 3575 | |
| }, | |
| { | |
| "epoch": 24.0, | |
| "grad_norm": 3158.755126953125, | |
| "learning_rate": 2.689655172413793e-05, | |
| "loss": 0.0005, | |
| "step": 3600 | |
| }, | |
| { | |
| "epoch": 24.0, | |
| "eval_loss": 0.005190260708332062, | |
| "eval_rmse": 0.07204346358776093, | |
| "eval_runtime": 24.5397, | |
| "eval_samples_per_second": 34.475, | |
| "eval_steps_per_second": 1.1, | |
| "step": 3600 | |
| }, | |
| { | |
| "epoch": 24.166666666666668, | |
| "grad_norm": 7158.42578125, | |
| "learning_rate": 2.672413793103448e-05, | |
| "loss": 0.0005, | |
| "step": 3625 | |
| }, | |
| { | |
| "epoch": 24.333333333333332, | |
| "grad_norm": 14029.6904296875, | |
| "learning_rate": 2.6551724137931032e-05, | |
| "loss": 0.0006, | |
| "step": 3650 | |
| }, | |
| { | |
| "epoch": 24.5, | |
| "grad_norm": 5185.93408203125, | |
| "learning_rate": 2.637931034482759e-05, | |
| "loss": 0.0005, | |
| "step": 3675 | |
| }, | |
| { | |
| "epoch": 24.666666666666668, | |
| "grad_norm": 4489.02294921875, | |
| "learning_rate": 2.620689655172414e-05, | |
| "loss": 0.0006, | |
| "step": 3700 | |
| }, | |
| { | |
| "epoch": 24.833333333333332, | |
| "grad_norm": 1894.82666015625, | |
| "learning_rate": 2.6034482758620692e-05, | |
| "loss": 0.0007, | |
| "step": 3725 | |
| }, | |
| { | |
| "epoch": 25.0, | |
| "grad_norm": 6927.84716796875, | |
| "learning_rate": 2.5862068965517244e-05, | |
| "loss": 0.0006, | |
| "step": 3750 | |
| }, | |
| { | |
| "epoch": 25.0, | |
| "eval_loss": 0.005490241106599569, | |
| "eval_rmse": 0.07409615814685822, | |
| "eval_runtime": 24.2263, | |
| "eval_samples_per_second": 34.921, | |
| "eval_steps_per_second": 1.114, | |
| "step": 3750 | |
| }, | |
| { | |
| "epoch": 25.166666666666668, | |
| "grad_norm": 2080.053955078125, | |
| "learning_rate": 2.5689655172413796e-05, | |
| "loss": 0.0005, | |
| "step": 3775 | |
| }, | |
| { | |
| "epoch": 25.333333333333332, | |
| "grad_norm": 7075.02685546875, | |
| "learning_rate": 2.551724137931035e-05, | |
| "loss": 0.0006, | |
| "step": 3800 | |
| }, | |
| { | |
| "epoch": 25.5, | |
| "grad_norm": 10757.322265625, | |
| "learning_rate": 2.5344827586206897e-05, | |
| "loss": 0.0006, | |
| "step": 3825 | |
| }, | |
| { | |
| "epoch": 25.666666666666668, | |
| "grad_norm": 9014.060546875, | |
| "learning_rate": 2.517241379310345e-05, | |
| "loss": 0.0006, | |
| "step": 3850 | |
| }, | |
| { | |
| "epoch": 25.833333333333332, | |
| "grad_norm": 2507.72998046875, | |
| "learning_rate": 2.5e-05, | |
| "loss": 0.0004, | |
| "step": 3875 | |
| }, | |
| { | |
| "epoch": 26.0, | |
| "grad_norm": 9365.7626953125, | |
| "learning_rate": 2.4827586206896553e-05, | |
| "loss": 0.0005, | |
| "step": 3900 | |
| }, | |
| { | |
| "epoch": 26.0, | |
| "eval_loss": 0.005092009902000427, | |
| "eval_rmse": 0.07135831564664841, | |
| "eval_runtime": 24.0941, | |
| "eval_samples_per_second": 35.112, | |
| "eval_steps_per_second": 1.121, | |
| "step": 3900 | |
| }, | |
| { | |
| "epoch": 26.166666666666668, | |
| "grad_norm": 8156.84814453125, | |
| "learning_rate": 2.4655172413793105e-05, | |
| "loss": 0.0005, | |
| "step": 3925 | |
| }, | |
| { | |
| "epoch": 26.333333333333332, | |
| "grad_norm": 6262.81396484375, | |
| "learning_rate": 2.4482758620689654e-05, | |
| "loss": 0.0005, | |
| "step": 3950 | |
| }, | |
| { | |
| "epoch": 26.5, | |
| "grad_norm": 4787.65771484375, | |
| "learning_rate": 2.4310344827586206e-05, | |
| "loss": 0.0005, | |
| "step": 3975 | |
| }, | |
| { | |
| "epoch": 26.666666666666668, | |
| "grad_norm": 7484.62939453125, | |
| "learning_rate": 2.413793103448276e-05, | |
| "loss": 0.0005, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 26.833333333333332, | |
| "grad_norm": 10509.4423828125, | |
| "learning_rate": 2.3965517241379314e-05, | |
| "loss": 0.0005, | |
| "step": 4025 | |
| }, | |
| { | |
| "epoch": 27.0, | |
| "grad_norm": 11441.84765625, | |
| "learning_rate": 2.3793103448275862e-05, | |
| "loss": 0.0005, | |
| "step": 4050 | |
| }, | |
| { | |
| "epoch": 27.0, | |
| "eval_loss": 0.005185635760426521, | |
| "eval_rmse": 0.07201135903596878, | |
| "eval_runtime": 24.5085, | |
| "eval_samples_per_second": 34.519, | |
| "eval_steps_per_second": 1.102, | |
| "step": 4050 | |
| }, | |
| { | |
| "epoch": 27.166666666666668, | |
| "grad_norm": 12403.2705078125, | |
| "learning_rate": 2.3620689655172415e-05, | |
| "loss": 0.0005, | |
| "step": 4075 | |
| }, | |
| { | |
| "epoch": 27.333333333333332, | |
| "grad_norm": 6164.29541015625, | |
| "learning_rate": 2.3448275862068967e-05, | |
| "loss": 0.0005, | |
| "step": 4100 | |
| }, | |
| { | |
| "epoch": 27.5, | |
| "grad_norm": 10556.6201171875, | |
| "learning_rate": 2.327586206896552e-05, | |
| "loss": 0.0004, | |
| "step": 4125 | |
| }, | |
| { | |
| "epoch": 27.666666666666668, | |
| "grad_norm": 5694.11572265625, | |
| "learning_rate": 2.3103448275862067e-05, | |
| "loss": 0.0005, | |
| "step": 4150 | |
| }, | |
| { | |
| "epoch": 27.833333333333332, | |
| "grad_norm": 7944.47216796875, | |
| "learning_rate": 2.293103448275862e-05, | |
| "loss": 0.0005, | |
| "step": 4175 | |
| }, | |
| { | |
| "epoch": 28.0, | |
| "grad_norm": 11066.5947265625, | |
| "learning_rate": 2.2758620689655175e-05, | |
| "loss": 0.0005, | |
| "step": 4200 | |
| }, | |
| { | |
| "epoch": 28.0, | |
| "eval_loss": 0.005251267924904823, | |
| "eval_rmse": 0.07246563583612442, | |
| "eval_runtime": 25.0299, | |
| "eval_samples_per_second": 33.8, | |
| "eval_steps_per_second": 1.079, | |
| "step": 4200 | |
| }, | |
| { | |
| "epoch": 28.166666666666668, | |
| "grad_norm": 7138.5908203125, | |
| "learning_rate": 2.2586206896551727e-05, | |
| "loss": 0.0005, | |
| "step": 4225 | |
| }, | |
| { | |
| "epoch": 28.333333333333332, | |
| "grad_norm": 7910.48193359375, | |
| "learning_rate": 2.2413793103448276e-05, | |
| "loss": 0.0004, | |
| "step": 4250 | |
| }, | |
| { | |
| "epoch": 28.5, | |
| "grad_norm": 6678.46142578125, | |
| "learning_rate": 2.2241379310344828e-05, | |
| "loss": 0.0005, | |
| "step": 4275 | |
| }, | |
| { | |
| "epoch": 28.666666666666668, | |
| "grad_norm": 2658.396484375, | |
| "learning_rate": 2.206896551724138e-05, | |
| "loss": 0.0004, | |
| "step": 4300 | |
| }, | |
| { | |
| "epoch": 28.833333333333332, | |
| "grad_norm": 7415.6455078125, | |
| "learning_rate": 2.1896551724137932e-05, | |
| "loss": 0.0003, | |
| "step": 4325 | |
| }, | |
| { | |
| "epoch": 29.0, | |
| "grad_norm": 4360.8212890625, | |
| "learning_rate": 2.1724137931034484e-05, | |
| "loss": 0.0003, | |
| "step": 4350 | |
| }, | |
| { | |
| "epoch": 29.0, | |
| "eval_loss": 0.005068263970315456, | |
| "eval_rmse": 0.07119174301624298, | |
| "eval_runtime": 23.6937, | |
| "eval_samples_per_second": 35.706, | |
| "eval_steps_per_second": 1.14, | |
| "step": 4350 | |
| }, | |
| { | |
| "epoch": 29.166666666666668, | |
| "grad_norm": 9353.43359375, | |
| "learning_rate": 2.1551724137931033e-05, | |
| "loss": 0.0003, | |
| "step": 4375 | |
| }, | |
| { | |
| "epoch": 29.333333333333332, | |
| "grad_norm": 6008.50390625, | |
| "learning_rate": 2.137931034482759e-05, | |
| "loss": 0.0004, | |
| "step": 4400 | |
| }, | |
| { | |
| "epoch": 29.5, | |
| "grad_norm": 5255.45458984375, | |
| "learning_rate": 2.120689655172414e-05, | |
| "loss": 0.0003, | |
| "step": 4425 | |
| }, | |
| { | |
| "epoch": 29.666666666666668, | |
| "grad_norm": 8044.0888671875, | |
| "learning_rate": 2.1034482758620692e-05, | |
| "loss": 0.0004, | |
| "step": 4450 | |
| }, | |
| { | |
| "epoch": 29.833333333333332, | |
| "grad_norm": 1686.931640625, | |
| "learning_rate": 2.086206896551724e-05, | |
| "loss": 0.0004, | |
| "step": 4475 | |
| }, | |
| { | |
| "epoch": 30.0, | |
| "grad_norm": 2483.55419921875, | |
| "learning_rate": 2.0689655172413793e-05, | |
| "loss": 0.0004, | |
| "step": 4500 | |
| }, | |
| { | |
| "epoch": 30.0, | |
| "eval_loss": 0.0051447427831590176, | |
| "eval_rmse": 0.07172686606645584, | |
| "eval_runtime": 24.8197, | |
| "eval_samples_per_second": 34.086, | |
| "eval_steps_per_second": 1.088, | |
| "step": 4500 | |
| }, | |
| { | |
| "epoch": 30.166666666666668, | |
| "grad_norm": 4986.66552734375, | |
| "learning_rate": 2.0517241379310345e-05, | |
| "loss": 0.0004, | |
| "step": 4525 | |
| }, | |
| { | |
| "epoch": 30.333333333333332, | |
| "grad_norm": 4183.8564453125, | |
| "learning_rate": 2.0344827586206897e-05, | |
| "loss": 0.0004, | |
| "step": 4550 | |
| }, | |
| { | |
| "epoch": 30.5, | |
| "grad_norm": 4985.001953125, | |
| "learning_rate": 2.017241379310345e-05, | |
| "loss": 0.0003, | |
| "step": 4575 | |
| }, | |
| { | |
| "epoch": 30.666666666666668, | |
| "grad_norm": 4720.66455078125, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0004, | |
| "step": 4600 | |
| }, | |
| { | |
| "epoch": 30.833333333333332, | |
| "grad_norm": 2436.566650390625, | |
| "learning_rate": 1.9827586206896554e-05, | |
| "loss": 0.0004, | |
| "step": 4625 | |
| }, | |
| { | |
| "epoch": 31.0, | |
| "grad_norm": 5655.64306640625, | |
| "learning_rate": 1.9655172413793106e-05, | |
| "loss": 0.0004, | |
| "step": 4650 | |
| }, | |
| { | |
| "epoch": 31.0, | |
| "eval_loss": 0.005167735740542412, | |
| "eval_rmse": 0.07188696414232254, | |
| "eval_runtime": 23.808, | |
| "eval_samples_per_second": 35.534, | |
| "eval_steps_per_second": 1.134, | |
| "step": 4650 | |
| }, | |
| { | |
| "epoch": 31.166666666666668, | |
| "grad_norm": 6381.2216796875, | |
| "learning_rate": 1.9482758620689655e-05, | |
| "loss": 0.0005, | |
| "step": 4675 | |
| }, | |
| { | |
| "epoch": 31.333333333333332, | |
| "grad_norm": 4444.06787109375, | |
| "learning_rate": 1.9310344827586207e-05, | |
| "loss": 0.0004, | |
| "step": 4700 | |
| }, | |
| { | |
| "epoch": 31.5, | |
| "grad_norm": 4063.191650390625, | |
| "learning_rate": 1.913793103448276e-05, | |
| "loss": 0.0003, | |
| "step": 4725 | |
| }, | |
| { | |
| "epoch": 31.666666666666668, | |
| "grad_norm": 2023.14794921875, | |
| "learning_rate": 1.896551724137931e-05, | |
| "loss": 0.0004, | |
| "step": 4750 | |
| }, | |
| { | |
| "epoch": 31.833333333333332, | |
| "grad_norm": 7719.87353515625, | |
| "learning_rate": 1.8793103448275863e-05, | |
| "loss": 0.0004, | |
| "step": 4775 | |
| }, | |
| { | |
| "epoch": 32.0, | |
| "grad_norm": 10876.1064453125, | |
| "learning_rate": 1.8620689655172415e-05, | |
| "loss": 0.0003, | |
| "step": 4800 | |
| }, | |
| { | |
| "epoch": 32.0, | |
| "eval_loss": 0.005189752671867609, | |
| "eval_rmse": 0.07203993201255798, | |
| "eval_runtime": 24.4076, | |
| "eval_samples_per_second": 34.661, | |
| "eval_steps_per_second": 1.106, | |
| "step": 4800 | |
| }, | |
| { | |
| "epoch": 32.166666666666664, | |
| "grad_norm": 7112.66748046875, | |
| "learning_rate": 1.8448275862068967e-05, | |
| "loss": 0.0003, | |
| "step": 4825 | |
| }, | |
| { | |
| "epoch": 32.333333333333336, | |
| "grad_norm": 3561.666259765625, | |
| "learning_rate": 1.827586206896552e-05, | |
| "loss": 0.0003, | |
| "step": 4850 | |
| }, | |
| { | |
| "epoch": 32.5, | |
| "grad_norm": 4231.2265625, | |
| "learning_rate": 1.810344827586207e-05, | |
| "loss": 0.0003, | |
| "step": 4875 | |
| }, | |
| { | |
| "epoch": 32.666666666666664, | |
| "grad_norm": 3887.852294921875, | |
| "learning_rate": 1.793103448275862e-05, | |
| "loss": 0.0003, | |
| "step": 4900 | |
| }, | |
| { | |
| "epoch": 32.833333333333336, | |
| "grad_norm": 4729.369140625, | |
| "learning_rate": 1.7758620689655172e-05, | |
| "loss": 0.0003, | |
| "step": 4925 | |
| }, | |
| { | |
| "epoch": 33.0, | |
| "grad_norm": 12836.8896484375, | |
| "learning_rate": 1.7586206896551724e-05, | |
| "loss": 0.0003, | |
| "step": 4950 | |
| }, | |
| { | |
| "epoch": 33.0, | |
| "eval_loss": 0.00510548148304224, | |
| "eval_rmse": 0.07145265489816666, | |
| "eval_runtime": 24.6674, | |
| "eval_samples_per_second": 34.296, | |
| "eval_steps_per_second": 1.095, | |
| "step": 4950 | |
| }, | |
| { | |
| "epoch": 33.166666666666664, | |
| "grad_norm": 3480.9482421875, | |
| "learning_rate": 1.7413793103448276e-05, | |
| "loss": 0.0003, | |
| "step": 4975 | |
| }, | |
| { | |
| "epoch": 33.333333333333336, | |
| "grad_norm": 4718.3798828125, | |
| "learning_rate": 1.7241379310344828e-05, | |
| "loss": 0.0003, | |
| "step": 5000 | |
| }, | |
| { | |
| "epoch": 33.5, | |
| "grad_norm": 3190.914306640625, | |
| "learning_rate": 1.706896551724138e-05, | |
| "loss": 0.0003, | |
| "step": 5025 | |
| }, | |
| { | |
| "epoch": 33.666666666666664, | |
| "grad_norm": 5478.87158203125, | |
| "learning_rate": 1.6896551724137932e-05, | |
| "loss": 0.0004, | |
| "step": 5050 | |
| }, | |
| { | |
| "epoch": 33.833333333333336, | |
| "grad_norm": 5177.54931640625, | |
| "learning_rate": 1.6724137931034485e-05, | |
| "loss": 0.0003, | |
| "step": 5075 | |
| }, | |
| { | |
| "epoch": 34.0, | |
| "grad_norm": 10662.73046875, | |
| "learning_rate": 1.6551724137931037e-05, | |
| "loss": 0.0002, | |
| "step": 5100 | |
| }, | |
| { | |
| "epoch": 34.0, | |
| "eval_loss": 0.005342215299606323, | |
| "eval_rmse": 0.07309045642614365, | |
| "eval_runtime": 24.4257, | |
| "eval_samples_per_second": 34.636, | |
| "eval_steps_per_second": 1.105, | |
| "step": 5100 | |
| }, | |
| { | |
| "epoch": 34.166666666666664, | |
| "grad_norm": 2308.01123046875, | |
| "learning_rate": 1.6379310344827585e-05, | |
| "loss": 0.0003, | |
| "step": 5125 | |
| }, | |
| { | |
| "epoch": 34.333333333333336, | |
| "grad_norm": 2815.79638671875, | |
| "learning_rate": 1.6206896551724137e-05, | |
| "loss": 0.0003, | |
| "step": 5150 | |
| }, | |
| { | |
| "epoch": 34.5, | |
| "grad_norm": 4326.0478515625, | |
| "learning_rate": 1.603448275862069e-05, | |
| "loss": 0.0002, | |
| "step": 5175 | |
| }, | |
| { | |
| "epoch": 34.666666666666664, | |
| "grad_norm": 6309.9462890625, | |
| "learning_rate": 1.586206896551724e-05, | |
| "loss": 0.0003, | |
| "step": 5200 | |
| }, | |
| { | |
| "epoch": 34.833333333333336, | |
| "grad_norm": 1817.662353515625, | |
| "learning_rate": 1.5689655172413794e-05, | |
| "loss": 0.0002, | |
| "step": 5225 | |
| }, | |
| { | |
| "epoch": 35.0, | |
| "grad_norm": 3567.881103515625, | |
| "learning_rate": 1.5517241379310346e-05, | |
| "loss": 0.0003, | |
| "step": 5250 | |
| }, | |
| { | |
| "epoch": 35.0, | |
| "eval_loss": 0.005233472678810358, | |
| "eval_rmse": 0.07234274595975876, | |
| "eval_runtime": 24.1269, | |
| "eval_samples_per_second": 35.065, | |
| "eval_steps_per_second": 1.119, | |
| "step": 5250 | |
| }, | |
| { | |
| "epoch": 35.166666666666664, | |
| "grad_norm": 3930.6884765625, | |
| "learning_rate": 1.5344827586206898e-05, | |
| "loss": 0.0003, | |
| "step": 5275 | |
| }, | |
| { | |
| "epoch": 35.333333333333336, | |
| "grad_norm": 4008.536865234375, | |
| "learning_rate": 1.5172413793103448e-05, | |
| "loss": 0.0003, | |
| "step": 5300 | |
| }, | |
| { | |
| "epoch": 35.5, | |
| "grad_norm": 2320.7138671875, | |
| "learning_rate": 1.5e-05, | |
| "loss": 0.0003, | |
| "step": 5325 | |
| }, | |
| { | |
| "epoch": 35.666666666666664, | |
| "grad_norm": 5395.9560546875, | |
| "learning_rate": 1.482758620689655e-05, | |
| "loss": 0.0003, | |
| "step": 5350 | |
| }, | |
| { | |
| "epoch": 35.833333333333336, | |
| "grad_norm": 3271.279052734375, | |
| "learning_rate": 1.4655172413793103e-05, | |
| "loss": 0.0003, | |
| "step": 5375 | |
| }, | |
| { | |
| "epoch": 36.0, | |
| "grad_norm": 7306.166015625, | |
| "learning_rate": 1.4482758620689657e-05, | |
| "loss": 0.0002, | |
| "step": 5400 | |
| }, | |
| { | |
| "epoch": 36.0, | |
| "eval_loss": 0.005008559208363295, | |
| "eval_rmse": 0.07077117264270782, | |
| "eval_runtime": 23.9539, | |
| "eval_samples_per_second": 35.318, | |
| "eval_steps_per_second": 1.127, | |
| "step": 5400 | |
| }, | |
| { | |
| "epoch": 36.166666666666664, | |
| "grad_norm": 2410.515625, | |
| "learning_rate": 1.4310344827586209e-05, | |
| "loss": 0.0003, | |
| "step": 5425 | |
| }, | |
| { | |
| "epoch": 36.333333333333336, | |
| "grad_norm": 3116.67822265625, | |
| "learning_rate": 1.4137931034482759e-05, | |
| "loss": 0.0002, | |
| "step": 5450 | |
| }, | |
| { | |
| "epoch": 36.5, | |
| "grad_norm": 2509.718994140625, | |
| "learning_rate": 1.3965517241379311e-05, | |
| "loss": 0.0003, | |
| "step": 5475 | |
| }, | |
| { | |
| "epoch": 36.666666666666664, | |
| "grad_norm": 4319.36669921875, | |
| "learning_rate": 1.3793103448275863e-05, | |
| "loss": 0.0003, | |
| "step": 5500 | |
| }, | |
| { | |
| "epoch": 36.833333333333336, | |
| "grad_norm": 5166.88720703125, | |
| "learning_rate": 1.3620689655172414e-05, | |
| "loss": 0.0003, | |
| "step": 5525 | |
| }, | |
| { | |
| "epoch": 37.0, | |
| "grad_norm": 3035.32275390625, | |
| "learning_rate": 1.3448275862068966e-05, | |
| "loss": 0.0002, | |
| "step": 5550 | |
| }, | |
| { | |
| "epoch": 37.0, | |
| "eval_loss": 0.004944357089698315, | |
| "eval_rmse": 0.0703161209821701, | |
| "eval_runtime": 24.563, | |
| "eval_samples_per_second": 34.442, | |
| "eval_steps_per_second": 1.099, | |
| "step": 5550 | |
| }, | |
| { | |
| "epoch": 37.166666666666664, | |
| "grad_norm": 4661.7880859375, | |
| "learning_rate": 1.3275862068965516e-05, | |
| "loss": 0.0002, | |
| "step": 5575 | |
| }, | |
| { | |
| "epoch": 37.333333333333336, | |
| "grad_norm": 3572.86083984375, | |
| "learning_rate": 1.310344827586207e-05, | |
| "loss": 0.0002, | |
| "step": 5600 | |
| }, | |
| { | |
| "epoch": 37.5, | |
| "grad_norm": 2449.630126953125, | |
| "learning_rate": 1.2931034482758622e-05, | |
| "loss": 0.0002, | |
| "step": 5625 | |
| }, | |
| { | |
| "epoch": 37.666666666666664, | |
| "grad_norm": 7162.35400390625, | |
| "learning_rate": 1.2758620689655174e-05, | |
| "loss": 0.0002, | |
| "step": 5650 | |
| }, | |
| { | |
| "epoch": 37.833333333333336, | |
| "grad_norm": 7194.30908203125, | |
| "learning_rate": 1.2586206896551725e-05, | |
| "loss": 0.0002, | |
| "step": 5675 | |
| }, | |
| { | |
| "epoch": 38.0, | |
| "grad_norm": 3310.67236328125, | |
| "learning_rate": 1.2413793103448277e-05, | |
| "loss": 0.0002, | |
| "step": 5700 | |
| }, | |
| { | |
| "epoch": 38.0, | |
| "eval_loss": 0.005015978589653969, | |
| "eval_rmse": 0.07082357257604599, | |
| "eval_runtime": 24.649, | |
| "eval_samples_per_second": 34.322, | |
| "eval_steps_per_second": 1.095, | |
| "step": 5700 | |
| }, | |
| { | |
| "epoch": 38.166666666666664, | |
| "grad_norm": 4332.0615234375, | |
| "learning_rate": 1.2241379310344827e-05, | |
| "loss": 0.0002, | |
| "step": 5725 | |
| }, | |
| { | |
| "epoch": 38.333333333333336, | |
| "grad_norm": 4779.07568359375, | |
| "learning_rate": 1.206896551724138e-05, | |
| "loss": 0.0002, | |
| "step": 5750 | |
| }, | |
| { | |
| "epoch": 38.5, | |
| "grad_norm": 3394.655029296875, | |
| "learning_rate": 1.1896551724137931e-05, | |
| "loss": 0.0002, | |
| "step": 5775 | |
| }, | |
| { | |
| "epoch": 38.666666666666664, | |
| "grad_norm": 1213.259521484375, | |
| "learning_rate": 1.1724137931034483e-05, | |
| "loss": 0.0002, | |
| "step": 5800 | |
| }, | |
| { | |
| "epoch": 38.833333333333336, | |
| "grad_norm": 7526.7451171875, | |
| "learning_rate": 1.1551724137931034e-05, | |
| "loss": 0.0002, | |
| "step": 5825 | |
| }, | |
| { | |
| "epoch": 39.0, | |
| "grad_norm": 9150.9912109375, | |
| "learning_rate": 1.1379310344827587e-05, | |
| "loss": 0.0002, | |
| "step": 5850 | |
| }, | |
| { | |
| "epoch": 39.0, | |
| "eval_loss": 0.004906541667878628, | |
| "eval_rmse": 0.07004670798778534, | |
| "eval_runtime": 24.1426, | |
| "eval_samples_per_second": 35.042, | |
| "eval_steps_per_second": 1.118, | |
| "step": 5850 | |
| }, | |
| { | |
| "epoch": 39.166666666666664, | |
| "grad_norm": 5821.2470703125, | |
| "learning_rate": 1.1206896551724138e-05, | |
| "loss": 0.0002, | |
| "step": 5875 | |
| }, | |
| { | |
| "epoch": 39.333333333333336, | |
| "grad_norm": 4532.37890625, | |
| "learning_rate": 1.103448275862069e-05, | |
| "loss": 0.0002, | |
| "step": 5900 | |
| }, | |
| { | |
| "epoch": 39.5, | |
| "grad_norm": 5742.3427734375, | |
| "learning_rate": 1.0862068965517242e-05, | |
| "loss": 0.0002, | |
| "step": 5925 | |
| }, | |
| { | |
| "epoch": 39.666666666666664, | |
| "grad_norm": 1430.531005859375, | |
| "learning_rate": 1.0689655172413794e-05, | |
| "loss": 0.0002, | |
| "step": 5950 | |
| }, | |
| { | |
| "epoch": 39.833333333333336, | |
| "grad_norm": 4371.09765625, | |
| "learning_rate": 1.0517241379310346e-05, | |
| "loss": 0.0002, | |
| "step": 5975 | |
| }, | |
| { | |
| "epoch": 40.0, | |
| "grad_norm": 3642.697998046875, | |
| "learning_rate": 1.0344827586206897e-05, | |
| "loss": 0.0002, | |
| "step": 6000 | |
| }, | |
| { | |
| "epoch": 40.0, | |
| "eval_loss": 0.004872768651694059, | |
| "eval_rmse": 0.06980521976947784, | |
| "eval_runtime": 23.9307, | |
| "eval_samples_per_second": 35.352, | |
| "eval_steps_per_second": 1.128, | |
| "step": 6000 | |
| }, | |
| { | |
| "epoch": 40.166666666666664, | |
| "grad_norm": 5250.0, | |
| "learning_rate": 1.0172413793103449e-05, | |
| "loss": 0.0002, | |
| "step": 6025 | |
| }, | |
| { | |
| "epoch": 40.333333333333336, | |
| "grad_norm": 1985.86083984375, | |
| "learning_rate": 1e-05, | |
| "loss": 0.0002, | |
| "step": 6050 | |
| }, | |
| { | |
| "epoch": 40.5, | |
| "grad_norm": 4391.5673828125, | |
| "learning_rate": 9.827586206896553e-06, | |
| "loss": 0.0002, | |
| "step": 6075 | |
| }, | |
| { | |
| "epoch": 40.666666666666664, | |
| "grad_norm": 4576.029296875, | |
| "learning_rate": 9.655172413793103e-06, | |
| "loss": 0.0002, | |
| "step": 6100 | |
| }, | |
| { | |
| "epoch": 40.833333333333336, | |
| "grad_norm": 5284.35107421875, | |
| "learning_rate": 9.482758620689655e-06, | |
| "loss": 0.0002, | |
| "step": 6125 | |
| }, | |
| { | |
| "epoch": 41.0, | |
| "grad_norm": 3708.590576171875, | |
| "learning_rate": 9.310344827586207e-06, | |
| "loss": 0.0002, | |
| "step": 6150 | |
| }, | |
| { | |
| "epoch": 41.0, | |
| "eval_loss": 0.004881918430328369, | |
| "eval_rmse": 0.069870725274086, | |
| "eval_runtime": 24.6924, | |
| "eval_samples_per_second": 34.262, | |
| "eval_steps_per_second": 1.093, | |
| "step": 6150 | |
| }, | |
| { | |
| "epoch": 41.166666666666664, | |
| "grad_norm": 1864.5494384765625, | |
| "learning_rate": 9.13793103448276e-06, | |
| "loss": 0.0002, | |
| "step": 6175 | |
| }, | |
| { | |
| "epoch": 41.333333333333336, | |
| "grad_norm": 3076.697998046875, | |
| "learning_rate": 8.96551724137931e-06, | |
| "loss": 0.0002, | |
| "step": 6200 | |
| }, | |
| { | |
| "epoch": 41.5, | |
| "grad_norm": 2170.48486328125, | |
| "learning_rate": 8.793103448275862e-06, | |
| "loss": 0.0002, | |
| "step": 6225 | |
| }, | |
| { | |
| "epoch": 41.666666666666664, | |
| "grad_norm": 3419.19384765625, | |
| "learning_rate": 8.620689655172414e-06, | |
| "loss": 0.0002, | |
| "step": 6250 | |
| }, | |
| { | |
| "epoch": 41.833333333333336, | |
| "grad_norm": 5411.42236328125, | |
| "learning_rate": 8.448275862068966e-06, | |
| "loss": 0.0002, | |
| "step": 6275 | |
| }, | |
| { | |
| "epoch": 42.0, | |
| "grad_norm": 3653.36865234375, | |
| "learning_rate": 8.275862068965518e-06, | |
| "loss": 0.0002, | |
| "step": 6300 | |
| }, | |
| { | |
| "epoch": 42.0, | |
| "eval_loss": 0.004911797121167183, | |
| "eval_rmse": 0.07008421421051025, | |
| "eval_runtime": 24.3533, | |
| "eval_samples_per_second": 34.739, | |
| "eval_steps_per_second": 1.109, | |
| "step": 6300 | |
| }, | |
| { | |
| "epoch": 42.166666666666664, | |
| "grad_norm": 3295.633056640625, | |
| "learning_rate": 8.103448275862069e-06, | |
| "loss": 0.0001, | |
| "step": 6325 | |
| }, | |
| { | |
| "epoch": 42.333333333333336, | |
| "grad_norm": 3717.45849609375, | |
| "learning_rate": 7.93103448275862e-06, | |
| "loss": 0.0002, | |
| "step": 6350 | |
| }, | |
| { | |
| "epoch": 42.5, | |
| "grad_norm": 2262.6142578125, | |
| "learning_rate": 7.758620689655173e-06, | |
| "loss": 0.0001, | |
| "step": 6375 | |
| }, | |
| { | |
| "epoch": 42.666666666666664, | |
| "grad_norm": 1310.09912109375, | |
| "learning_rate": 7.586206896551724e-06, | |
| "loss": 0.0002, | |
| "step": 6400 | |
| }, | |
| { | |
| "epoch": 42.833333333333336, | |
| "grad_norm": 3895.883544921875, | |
| "learning_rate": 7.413793103448275e-06, | |
| "loss": 0.0001, | |
| "step": 6425 | |
| }, | |
| { | |
| "epoch": 43.0, | |
| "grad_norm": 3741.710205078125, | |
| "learning_rate": 7.241379310344828e-06, | |
| "loss": 0.0001, | |
| "step": 6450 | |
| }, | |
| { | |
| "epoch": 43.0, | |
| "eval_loss": 0.0048644402995705605, | |
| "eval_rmse": 0.06974554061889648, | |
| "eval_runtime": 24.2068, | |
| "eval_samples_per_second": 34.949, | |
| "eval_steps_per_second": 1.115, | |
| "step": 6450 | |
| }, | |
| { | |
| "epoch": 43.166666666666664, | |
| "grad_norm": 1377.0496826171875, | |
| "learning_rate": 7.0689655172413796e-06, | |
| "loss": 0.0001, | |
| "step": 6475 | |
| }, | |
| { | |
| "epoch": 43.333333333333336, | |
| "grad_norm": 2979.349365234375, | |
| "learning_rate": 6.896551724137932e-06, | |
| "loss": 0.0001, | |
| "step": 6500 | |
| }, | |
| { | |
| "epoch": 43.5, | |
| "grad_norm": 1298.4322509765625, | |
| "learning_rate": 6.724137931034483e-06, | |
| "loss": 0.0001, | |
| "step": 6525 | |
| }, | |
| { | |
| "epoch": 43.666666666666664, | |
| "grad_norm": 2018.940673828125, | |
| "learning_rate": 6.551724137931035e-06, | |
| "loss": 0.0001, | |
| "step": 6550 | |
| }, | |
| { | |
| "epoch": 43.833333333333336, | |
| "grad_norm": 1853.4677734375, | |
| "learning_rate": 6.379310344827587e-06, | |
| "loss": 0.0002, | |
| "step": 6575 | |
| }, | |
| { | |
| "epoch": 44.0, | |
| "grad_norm": 7740.021484375, | |
| "learning_rate": 6.206896551724138e-06, | |
| "loss": 0.0002, | |
| "step": 6600 | |
| }, | |
| { | |
| "epoch": 44.0, | |
| "eval_loss": 0.004866042174398899, | |
| "eval_rmse": 0.06975702196359634, | |
| "eval_runtime": 24.1955, | |
| "eval_samples_per_second": 34.965, | |
| "eval_steps_per_second": 1.116, | |
| "step": 6600 | |
| }, | |
| { | |
| "epoch": 44.166666666666664, | |
| "grad_norm": 1772.85400390625, | |
| "learning_rate": 6.03448275862069e-06, | |
| "loss": 0.0001, | |
| "step": 6625 | |
| }, | |
| { | |
| "epoch": 44.333333333333336, | |
| "grad_norm": 2806.0537109375, | |
| "learning_rate": 5.862068965517242e-06, | |
| "loss": 0.0001, | |
| "step": 6650 | |
| }, | |
| { | |
| "epoch": 44.5, | |
| "grad_norm": 1677.330078125, | |
| "learning_rate": 5.689655172413794e-06, | |
| "loss": 0.0001, | |
| "step": 6675 | |
| }, | |
| { | |
| "epoch": 44.666666666666664, | |
| "grad_norm": 2859.73095703125, | |
| "learning_rate": 5.517241379310345e-06, | |
| "loss": 0.0001, | |
| "step": 6700 | |
| }, | |
| { | |
| "epoch": 44.833333333333336, | |
| "grad_norm": 2286.294921875, | |
| "learning_rate": 5.344827586206897e-06, | |
| "loss": 0.0001, | |
| "step": 6725 | |
| }, | |
| { | |
| "epoch": 45.0, | |
| "grad_norm": 2282.572021484375, | |
| "learning_rate": 5.172413793103448e-06, | |
| "loss": 0.0001, | |
| "step": 6750 | |
| }, | |
| { | |
| "epoch": 45.0, | |
| "eval_loss": 0.00484111625701189, | |
| "eval_rmse": 0.0695781260728836, | |
| "eval_runtime": 25.1872, | |
| "eval_samples_per_second": 33.589, | |
| "eval_steps_per_second": 1.072, | |
| "step": 6750 | |
| }, | |
| { | |
| "epoch": 45.166666666666664, | |
| "grad_norm": 1199.2476806640625, | |
| "learning_rate": 5e-06, | |
| "loss": 0.0001, | |
| "step": 6775 | |
| }, | |
| { | |
| "epoch": 45.333333333333336, | |
| "grad_norm": 4216.11572265625, | |
| "learning_rate": 4.827586206896552e-06, | |
| "loss": 0.0001, | |
| "step": 6800 | |
| }, | |
| { | |
| "epoch": 45.5, | |
| "grad_norm": 3172.265380859375, | |
| "learning_rate": 4.655172413793104e-06, | |
| "loss": 0.0001, | |
| "step": 6825 | |
| }, | |
| { | |
| "epoch": 45.666666666666664, | |
| "grad_norm": 2178.9580078125, | |
| "learning_rate": 4.482758620689655e-06, | |
| "loss": 0.0001, | |
| "step": 6850 | |
| }, | |
| { | |
| "epoch": 45.833333333333336, | |
| "grad_norm": 2676.595947265625, | |
| "learning_rate": 4.310344827586207e-06, | |
| "loss": 0.0001, | |
| "step": 6875 | |
| }, | |
| { | |
| "epoch": 46.0, | |
| "grad_norm": 2955.51806640625, | |
| "learning_rate": 4.137931034482759e-06, | |
| "loss": 0.0001, | |
| "step": 6900 | |
| }, | |
| { | |
| "epoch": 46.0, | |
| "eval_loss": 0.0047905659303069115, | |
| "eval_rmse": 0.06921391934156418, | |
| "eval_runtime": 24.7777, | |
| "eval_samples_per_second": 34.144, | |
| "eval_steps_per_second": 1.09, | |
| "step": 6900 | |
| }, | |
| { | |
| "epoch": 46.166666666666664, | |
| "grad_norm": 1705.5765380859375, | |
| "learning_rate": 3.96551724137931e-06, | |
| "loss": 0.0001, | |
| "step": 6925 | |
| }, | |
| { | |
| "epoch": 46.333333333333336, | |
| "grad_norm": 1702.0909423828125, | |
| "learning_rate": 3.793103448275862e-06, | |
| "loss": 0.0001, | |
| "step": 6950 | |
| }, | |
| { | |
| "epoch": 46.5, | |
| "grad_norm": 3313.3212890625, | |
| "learning_rate": 3.620689655172414e-06, | |
| "loss": 0.0001, | |
| "step": 6975 | |
| }, | |
| { | |
| "epoch": 46.666666666666664, | |
| "grad_norm": 2680.958251953125, | |
| "learning_rate": 3.448275862068966e-06, | |
| "loss": 0.0001, | |
| "step": 7000 | |
| }, | |
| { | |
| "epoch": 46.833333333333336, | |
| "grad_norm": 495.0559997558594, | |
| "learning_rate": 3.2758620689655175e-06, | |
| "loss": 0.0001, | |
| "step": 7025 | |
| }, | |
| { | |
| "epoch": 47.0, | |
| "grad_norm": 4104.341796875, | |
| "learning_rate": 3.103448275862069e-06, | |
| "loss": 0.0001, | |
| "step": 7050 | |
| }, | |
| { | |
| "epoch": 47.0, | |
| "eval_loss": 0.004818546585738659, | |
| "eval_rmse": 0.06941574811935425, | |
| "eval_runtime": 24.9976, | |
| "eval_samples_per_second": 33.843, | |
| "eval_steps_per_second": 1.08, | |
| "step": 7050 | |
| }, | |
| { | |
| "epoch": 47.166666666666664, | |
| "grad_norm": 1351.109130859375, | |
| "learning_rate": 2.931034482758621e-06, | |
| "loss": 0.0001, | |
| "step": 7075 | |
| }, | |
| { | |
| "epoch": 47.333333333333336, | |
| "grad_norm": 3643.360107421875, | |
| "learning_rate": 2.7586206896551725e-06, | |
| "loss": 0.0001, | |
| "step": 7100 | |
| }, | |
| { | |
| "epoch": 47.5, | |
| "grad_norm": 3840.823974609375, | |
| "learning_rate": 2.586206896551724e-06, | |
| "loss": 0.0001, | |
| "step": 7125 | |
| }, | |
| { | |
| "epoch": 47.666666666666664, | |
| "grad_norm": 605.887451171875, | |
| "learning_rate": 2.413793103448276e-06, | |
| "loss": 0.0001, | |
| "step": 7150 | |
| }, | |
| { | |
| "epoch": 47.833333333333336, | |
| "grad_norm": 3222.42822265625, | |
| "learning_rate": 2.2413793103448275e-06, | |
| "loss": 0.0001, | |
| "step": 7175 | |
| }, | |
| { | |
| "epoch": 48.0, | |
| "grad_norm": 2107.290283203125, | |
| "learning_rate": 2.0689655172413796e-06, | |
| "loss": 0.0001, | |
| "step": 7200 | |
| }, | |
| { | |
| "epoch": 48.0, | |
| "eval_loss": 0.004817850887775421, | |
| "eval_rmse": 0.06941074132919312, | |
| "eval_runtime": 24.6293, | |
| "eval_samples_per_second": 34.349, | |
| "eval_steps_per_second": 1.096, | |
| "step": 7200 | |
| }, | |
| { | |
| "epoch": 48.166666666666664, | |
| "grad_norm": 2339.809326171875, | |
| "learning_rate": 1.896551724137931e-06, | |
| "loss": 0.0001, | |
| "step": 7225 | |
| }, | |
| { | |
| "epoch": 48.333333333333336, | |
| "grad_norm": 1776.428466796875, | |
| "learning_rate": 1.724137931034483e-06, | |
| "loss": 0.0001, | |
| "step": 7250 | |
| }, | |
| { | |
| "epoch": 48.5, | |
| "grad_norm": 1188.1318359375, | |
| "learning_rate": 1.5517241379310346e-06, | |
| "loss": 0.0001, | |
| "step": 7275 | |
| }, | |
| { | |
| "epoch": 48.666666666666664, | |
| "grad_norm": 1058.152099609375, | |
| "learning_rate": 1.3793103448275862e-06, | |
| "loss": 0.0001, | |
| "step": 7300 | |
| }, | |
| { | |
| "epoch": 48.833333333333336, | |
| "grad_norm": 787.6583251953125, | |
| "learning_rate": 1.206896551724138e-06, | |
| "loss": 0.0001, | |
| "step": 7325 | |
| }, | |
| { | |
| "epoch": 49.0, | |
| "grad_norm": 2516.050048828125, | |
| "learning_rate": 1.0344827586206898e-06, | |
| "loss": 0.0001, | |
| "step": 7350 | |
| }, | |
| { | |
| "epoch": 49.0, | |
| "eval_loss": 0.004793087020516396, | |
| "eval_rmse": 0.06923212110996246, | |
| "eval_runtime": 24.0402, | |
| "eval_samples_per_second": 35.191, | |
| "eval_steps_per_second": 1.123, | |
| "step": 7350 | |
| }, | |
| { | |
| "epoch": 49.166666666666664, | |
| "grad_norm": 779.75244140625, | |
| "learning_rate": 8.620689655172415e-07, | |
| "loss": 0.0001, | |
| "step": 7375 | |
| }, | |
| { | |
| "epoch": 49.333333333333336, | |
| "grad_norm": 578.4296875, | |
| "learning_rate": 6.896551724137931e-07, | |
| "loss": 0.0001, | |
| "step": 7400 | |
| }, | |
| { | |
| "epoch": 49.5, | |
| "grad_norm": 2092.16259765625, | |
| "learning_rate": 5.172413793103449e-07, | |
| "loss": 0.0001, | |
| "step": 7425 | |
| }, | |
| { | |
| "epoch": 49.666666666666664, | |
| "grad_norm": 1592.06787109375, | |
| "learning_rate": 3.4482758620689656e-07, | |
| "loss": 0.0001, | |
| "step": 7450 | |
| }, | |
| { | |
| "epoch": 49.833333333333336, | |
| "grad_norm": 2670.34326171875, | |
| "learning_rate": 1.7241379310344828e-07, | |
| "loss": 0.0001, | |
| "step": 7475 | |
| }, | |
| { | |
| "epoch": 50.0, | |
| "grad_norm": 914.4434204101562, | |
| "learning_rate": 0.0, | |
| "loss": 0.0001, | |
| "step": 7500 | |
| }, | |
| { | |
| "epoch": 50.0, | |
| "eval_loss": 0.004804946947842836, | |
| "eval_rmse": 0.06931772083044052, | |
| "eval_runtime": 24.8499, | |
| "eval_samples_per_second": 34.044, | |
| "eval_steps_per_second": 1.087, | |
| "step": 7500 | |
| }, | |
| { | |
| "epoch": 50.0, | |
| "step": 7500, | |
| "total_flos": 0.0, | |
| "train_loss": 0.0016370025988823424, | |
| "train_runtime": 16468.788, | |
| "train_samples_per_second": 14.537, | |
| "train_steps_per_second": 0.455 | |
| } | |
| ], | |
| "logging_steps": 25, | |
| "max_steps": 7500, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 50, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 0.0, | |
| "train_batch_size": 32, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |