{ "best_metric": null, "best_model_checkpoint": null, "epoch": 10.0, "eval_steps": 1, "global_step": 70, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.14285714285714285, "grad_norm": 134.0, "learning_rate": 2.5e-05, "loss": 1.7222, "step": 1 }, { "epoch": 0.14285714285714285, "eval_loss": 2.0196499824523926, "eval_matthews_correlation": -0.0882903551594539, "eval_runtime": 2.3684, "eval_samples_per_second": 93.311, "eval_steps_per_second": 1.689, "step": 1 }, { "epoch": 0.2857142857142857, "grad_norm": 122.0, "learning_rate": 5e-05, "loss": 1.6075, "step": 2 }, { "epoch": 0.2857142857142857, "eval_loss": 1.6619428396224976, "eval_matthews_correlation": -0.1403852883926243, "eval_runtime": 2.3754, "eval_samples_per_second": 93.037, "eval_steps_per_second": 1.684, "step": 2 }, { "epoch": 0.42857142857142855, "grad_norm": 100.5, "learning_rate": 4.9264705882352944e-05, "loss": 1.3669, "step": 3 }, { "epoch": 0.42857142857142855, "eval_loss": 2.0540988445281982, "eval_matthews_correlation": -0.028683275619690942, "eval_runtime": 2.3537, "eval_samples_per_second": 93.895, "eval_steps_per_second": 1.699, "step": 3 }, { "epoch": 0.5714285714285714, "grad_norm": 215.0, "learning_rate": 4.8529411764705885e-05, "loss": 2.6067, "step": 4 }, { "epoch": 0.5714285714285714, "eval_loss": 2.177433967590332, "eval_matthews_correlation": -0.09348482549375706, "eval_runtime": 2.309, "eval_samples_per_second": 95.712, "eval_steps_per_second": 1.732, "step": 4 }, { "epoch": 0.7142857142857143, "grad_norm": 239.0, "learning_rate": 4.7794117647058826e-05, "loss": 2.4986, "step": 5 }, { "epoch": 0.7142857142857143, "eval_loss": 1.6899642944335938, "eval_matthews_correlation": 0.11327087190726348, "eval_runtime": 2.3522, "eval_samples_per_second": 93.953, "eval_steps_per_second": 1.701, "step": 5 }, { "epoch": 0.8571428571428571, "grad_norm": 230.0, "learning_rate": 4.705882352941177e-05, "loss": 1.8216, "step": 6 }, { "epoch": 0.8571428571428571, "eval_loss": 1.2177472114562988, "eval_matthews_correlation": 0.1806865287742912, "eval_runtime": 2.3529, "eval_samples_per_second": 93.928, "eval_steps_per_second": 1.7, "step": 6 }, { "epoch": 1.0, "grad_norm": 65.5, "learning_rate": 4.632352941176471e-05, "loss": 0.9659, "step": 7 }, { "epoch": 1.0, "eval_loss": 1.278491497039795, "eval_matthews_correlation": 0.23437433589326412, "eval_runtime": 2.3584, "eval_samples_per_second": 93.706, "eval_steps_per_second": 1.696, "step": 7 }, { "epoch": 1.1428571428571428, "grad_norm": 39.0, "learning_rate": 4.558823529411765e-05, "loss": 0.7348, "step": 8 }, { "epoch": 1.1428571428571428, "eval_loss": 1.3604048490524292, "eval_matthews_correlation": 0.22346441232318143, "eval_runtime": 2.391, "eval_samples_per_second": 92.43, "eval_steps_per_second": 1.673, "step": 8 }, { "epoch": 1.2857142857142856, "grad_norm": 179.0, "learning_rate": 4.485294117647059e-05, "loss": 0.9459, "step": 9 }, { "epoch": 1.2857142857142856, "eval_loss": 1.2725896835327148, "eval_matthews_correlation": 0.19367888050743545, "eval_runtime": 2.3108, "eval_samples_per_second": 95.638, "eval_steps_per_second": 1.731, "step": 9 }, { "epoch": 1.4285714285714286, "grad_norm": 185.0, "learning_rate": 4.411764705882353e-05, "loss": 1.0113, "step": 10 }, { "epoch": 1.4285714285714286, "eval_loss": 1.0940734148025513, "eval_matthews_correlation": 0.1758229359256884, "eval_runtime": 2.3561, "eval_samples_per_second": 93.8, "eval_steps_per_second": 1.698, "step": 10 }, { "epoch": 1.5714285714285714, "grad_norm": 121.5, "learning_rate": 4.3382352941176474e-05, "loss": 0.8862, "step": 11 }, { "epoch": 1.5714285714285714, "eval_loss": 1.0103245973587036, "eval_matthews_correlation": 0.18607215373306313, "eval_runtime": 2.3044, "eval_samples_per_second": 95.905, "eval_steps_per_second": 1.736, "step": 11 }, { "epoch": 1.7142857142857144, "grad_norm": 66.0, "learning_rate": 4.2647058823529415e-05, "loss": 0.6671, "step": 12 }, { "epoch": 1.7142857142857144, "eval_loss": 1.0150161981582642, "eval_matthews_correlation": 0.16295492928043517, "eval_runtime": 2.354, "eval_samples_per_second": 93.883, "eval_steps_per_second": 1.699, "step": 12 }, { "epoch": 1.8571428571428572, "grad_norm": 76.5, "learning_rate": 4.1911764705882356e-05, "loss": 0.6993, "step": 13 }, { "epoch": 1.8571428571428572, "eval_loss": 0.9942739009857178, "eval_matthews_correlation": 0.190143522496192, "eval_runtime": 2.4001, "eval_samples_per_second": 92.079, "eval_steps_per_second": 1.667, "step": 13 }, { "epoch": 2.0, "grad_norm": 78.5, "learning_rate": 4.11764705882353e-05, "loss": 0.5687, "step": 14 }, { "epoch": 2.0, "eval_loss": 0.957594633102417, "eval_matthews_correlation": 0.23288000159518374, "eval_runtime": 2.3857, "eval_samples_per_second": 92.635, "eval_steps_per_second": 1.677, "step": 14 }, { "epoch": 2.142857142857143, "grad_norm": 53.75, "learning_rate": 4.044117647058824e-05, "loss": 0.5374, "step": 15 }, { "epoch": 2.142857142857143, "eval_loss": 0.9628612399101257, "eval_matthews_correlation": 0.23529060477256988, "eval_runtime": 2.3516, "eval_samples_per_second": 93.978, "eval_steps_per_second": 1.701, "step": 15 }, { "epoch": 2.2857142857142856, "grad_norm": 61.5, "learning_rate": 3.970588235294117e-05, "loss": 0.4614, "step": 16 }, { "epoch": 2.2857142857142856, "eval_loss": 0.9808283448219299, "eval_matthews_correlation": 0.2299970498991641, "eval_runtime": 2.3687, "eval_samples_per_second": 93.299, "eval_steps_per_second": 1.689, "step": 16 }, { "epoch": 2.4285714285714284, "grad_norm": 64.0, "learning_rate": 3.897058823529412e-05, "loss": 0.2969, "step": 17 }, { "epoch": 2.4285714285714284, "eval_loss": 0.973484992980957, "eval_matthews_correlation": 0.22569029439717253, "eval_runtime": 2.3678, "eval_samples_per_second": 93.334, "eval_steps_per_second": 1.689, "step": 17 }, { "epoch": 2.571428571428571, "grad_norm": 53.75, "learning_rate": 3.8235294117647055e-05, "loss": 0.3818, "step": 18 }, { "epoch": 2.571428571428571, "eval_loss": 0.9494228363037109, "eval_matthews_correlation": 0.26534632115143664, "eval_runtime": 2.3924, "eval_samples_per_second": 92.376, "eval_steps_per_second": 1.672, "step": 18 }, { "epoch": 2.7142857142857144, "grad_norm": 51.25, "learning_rate": 3.7500000000000003e-05, "loss": 0.423, "step": 19 }, { "epoch": 2.7142857142857144, "eval_loss": 0.9362727999687195, "eval_matthews_correlation": 0.30245501970006394, "eval_runtime": 2.3067, "eval_samples_per_second": 95.806, "eval_steps_per_second": 1.734, "step": 19 }, { "epoch": 2.857142857142857, "grad_norm": 36.75, "learning_rate": 3.6764705882352945e-05, "loss": 0.3591, "step": 20 }, { "epoch": 2.857142857142857, "eval_loss": 0.9422338604927063, "eval_matthews_correlation": 0.3196729082856838, "eval_runtime": 2.3608, "eval_samples_per_second": 93.613, "eval_steps_per_second": 1.694, "step": 20 }, { "epoch": 3.0, "grad_norm": 55.0, "learning_rate": 3.6029411764705886e-05, "loss": 0.3845, "step": 21 }, { "epoch": 3.0, "eval_loss": 0.9473302364349365, "eval_matthews_correlation": 0.3308386147154527, "eval_runtime": 2.4007, "eval_samples_per_second": 92.056, "eval_steps_per_second": 1.666, "step": 21 }, { "epoch": 3.142857142857143, "grad_norm": 5.71875, "learning_rate": 3.529411764705883e-05, "loss": 0.2146, "step": 22 }, { "epoch": 3.142857142857143, "eval_loss": 0.9474514126777649, "eval_matthews_correlation": 0.31898693930331706, "eval_runtime": 2.368, "eval_samples_per_second": 93.328, "eval_steps_per_second": 1.689, "step": 22 }, { "epoch": 3.2857142857142856, "grad_norm": 21.75, "learning_rate": 3.455882352941177e-05, "loss": 0.3002, "step": 23 }, { "epoch": 3.2857142857142856, "eval_loss": 0.9657209515571594, "eval_matthews_correlation": 0.2849062574112851, "eval_runtime": 2.3966, "eval_samples_per_second": 92.214, "eval_steps_per_second": 1.669, "step": 23 }, { "epoch": 3.4285714285714284, "grad_norm": 22.0, "learning_rate": 3.382352941176471e-05, "loss": 0.221, "step": 24 }, { "epoch": 3.4285714285714284, "eval_loss": 1.020974040031433, "eval_matthews_correlation": 0.24865002165245412, "eval_runtime": 2.3934, "eval_samples_per_second": 92.339, "eval_steps_per_second": 1.671, "step": 24 }, { "epoch": 3.571428571428571, "grad_norm": 30.125, "learning_rate": 3.308823529411765e-05, "loss": 0.1452, "step": 25 }, { "epoch": 3.571428571428571, "eval_loss": 1.0698134899139404, "eval_matthews_correlation": 0.20606044506573787, "eval_runtime": 2.3098, "eval_samples_per_second": 95.678, "eval_steps_per_second": 1.732, "step": 25 }, { "epoch": 3.7142857142857144, "grad_norm": 74.0, "learning_rate": 3.235294117647059e-05, "loss": 0.3834, "step": 26 }, { "epoch": 3.7142857142857144, "eval_loss": 1.0729013681411743, "eval_matthews_correlation": 0.21311359700013865, "eval_runtime": 2.363, "eval_samples_per_second": 93.527, "eval_steps_per_second": 1.693, "step": 26 }, { "epoch": 3.857142857142857, "grad_norm": 92.5, "learning_rate": 3.161764705882353e-05, "loss": 0.3992, "step": 27 }, { "epoch": 3.857142857142857, "eval_loss": 1.044179916381836, "eval_matthews_correlation": 0.2415008164529655, "eval_runtime": 2.3563, "eval_samples_per_second": 93.79, "eval_steps_per_second": 1.698, "step": 27 }, { "epoch": 4.0, "grad_norm": 38.25, "learning_rate": 3.0882352941176475e-05, "loss": 0.1927, "step": 28 }, { "epoch": 4.0, "eval_loss": 1.0118021965026855, "eval_matthews_correlation": 0.2616725300472798, "eval_runtime": 2.3537, "eval_samples_per_second": 93.894, "eval_steps_per_second": 1.699, "step": 28 }, { "epoch": 4.142857142857143, "grad_norm": 38.0, "learning_rate": 3.0147058823529413e-05, "loss": 0.1826, "step": 29 }, { "epoch": 4.142857142857143, "eval_loss": 1.0196139812469482, "eval_matthews_correlation": 0.2882423971908362, "eval_runtime": 2.3607, "eval_samples_per_second": 93.616, "eval_steps_per_second": 1.694, "step": 29 }, { "epoch": 4.285714285714286, "grad_norm": 29.0, "learning_rate": 2.9411764705882354e-05, "loss": 0.1725, "step": 30 }, { "epoch": 4.285714285714286, "eval_loss": 1.0478262901306152, "eval_matthews_correlation": 0.26838255978295894, "eval_runtime": 2.3532, "eval_samples_per_second": 93.916, "eval_steps_per_second": 1.7, "step": 30 }, { "epoch": 4.428571428571429, "grad_norm": 36.5, "learning_rate": 2.8676470588235295e-05, "loss": 0.1338, "step": 31 }, { "epoch": 4.428571428571429, "eval_loss": 1.048422932624817, "eval_matthews_correlation": 0.28586872588000406, "eval_runtime": 2.3545, "eval_samples_per_second": 93.863, "eval_steps_per_second": 1.699, "step": 31 }, { "epoch": 4.571428571428571, "grad_norm": 60.75, "learning_rate": 2.7941176470588236e-05, "loss": 0.2333, "step": 32 }, { "epoch": 4.571428571428571, "eval_loss": 1.036675214767456, "eval_matthews_correlation": 0.31094869799833763, "eval_runtime": 2.4915, "eval_samples_per_second": 88.702, "eval_steps_per_second": 1.605, "step": 32 }, { "epoch": 4.714285714285714, "grad_norm": 24.5, "learning_rate": 2.7205882352941174e-05, "loss": 0.1153, "step": 33 }, { "epoch": 4.714285714285714, "eval_loss": 1.0192501544952393, "eval_matthews_correlation": 0.296589480247221, "eval_runtime": 2.2597, "eval_samples_per_second": 97.802, "eval_steps_per_second": 1.77, "step": 33 }, { "epoch": 4.857142857142857, "grad_norm": 12.625, "learning_rate": 2.647058823529412e-05, "loss": 0.1415, "step": 34 }, { "epoch": 4.857142857142857, "eval_loss": 1.0157463550567627, "eval_matthews_correlation": 0.270246784845325, "eval_runtime": 2.3043, "eval_samples_per_second": 95.906, "eval_steps_per_second": 1.736, "step": 34 }, { "epoch": 5.0, "grad_norm": 12.625, "learning_rate": 2.5735294117647057e-05, "loss": 0.1722, "step": 35 }, { "epoch": 5.0, "eval_loss": 1.0183305740356445, "eval_matthews_correlation": 0.2806455054870596, "eval_runtime": 2.3, "eval_samples_per_second": 96.089, "eval_steps_per_second": 1.739, "step": 35 }, { "epoch": 5.142857142857143, "grad_norm": 24.125, "learning_rate": 2.5e-05, "loss": 0.1116, "step": 36 }, { "epoch": 5.142857142857143, "eval_loss": 1.0078963041305542, "eval_matthews_correlation": 0.2919122663402188, "eval_runtime": 2.299, "eval_samples_per_second": 96.128, "eval_steps_per_second": 1.74, "step": 36 }, { "epoch": 5.285714285714286, "grad_norm": 17.875, "learning_rate": 2.4264705882352942e-05, "loss": 0.0814, "step": 37 }, { "epoch": 5.285714285714286, "eval_loss": 0.9962896704673767, "eval_matthews_correlation": 0.2961504855156075, "eval_runtime": 2.2968, "eval_samples_per_second": 96.219, "eval_steps_per_second": 1.742, "step": 37 }, { "epoch": 5.428571428571429, "grad_norm": 20.75, "learning_rate": 2.3529411764705884e-05, "loss": 0.1022, "step": 38 }, { "epoch": 5.428571428571429, "eval_loss": 0.9801982641220093, "eval_matthews_correlation": 0.2974487800233713, "eval_runtime": 2.2484, "eval_samples_per_second": 98.292, "eval_steps_per_second": 1.779, "step": 38 }, { "epoch": 5.571428571428571, "grad_norm": 22.125, "learning_rate": 2.2794117647058825e-05, "loss": 0.0924, "step": 39 }, { "epoch": 5.571428571428571, "eval_loss": 0.9746297001838684, "eval_matthews_correlation": 0.324706174020757, "eval_runtime": 2.347, "eval_samples_per_second": 94.162, "eval_steps_per_second": 1.704, "step": 39 }, { "epoch": 5.714285714285714, "grad_norm": 7.875, "learning_rate": 2.2058823529411766e-05, "loss": 0.0598, "step": 40 }, { "epoch": 5.714285714285714, "eval_loss": 0.9695372581481934, "eval_matthews_correlation": 0.3396355284414159, "eval_runtime": 2.3472, "eval_samples_per_second": 94.154, "eval_steps_per_second": 1.704, "step": 40 }, { "epoch": 5.857142857142857, "grad_norm": 3.640625, "learning_rate": 2.1323529411764707e-05, "loss": 0.0979, "step": 41 }, { "epoch": 5.857142857142857, "eval_loss": 0.9763937592506409, "eval_matthews_correlation": 0.35072853143256777, "eval_runtime": 2.3485, "eval_samples_per_second": 94.104, "eval_steps_per_second": 1.703, "step": 41 }, { "epoch": 6.0, "grad_norm": 31.75, "learning_rate": 2.058823529411765e-05, "loss": 0.0845, "step": 42 }, { "epoch": 6.0, "eval_loss": 0.9772699475288391, "eval_matthews_correlation": 0.36177927116990083, "eval_runtime": 2.3468, "eval_samples_per_second": 94.172, "eval_steps_per_second": 1.704, "step": 42 }, { "epoch": 6.142857142857143, "grad_norm": 9.5625, "learning_rate": 1.9852941176470586e-05, "loss": 0.0577, "step": 43 }, { "epoch": 6.142857142857143, "eval_loss": 0.9829764366149902, "eval_matthews_correlation": 0.3530389654491601, "eval_runtime": 2.3472, "eval_samples_per_second": 94.155, "eval_steps_per_second": 1.704, "step": 43 }, { "epoch": 6.285714285714286, "grad_norm": 2.484375, "learning_rate": 1.9117647058823528e-05, "loss": 0.0489, "step": 44 }, { "epoch": 6.285714285714286, "eval_loss": 1.0145213603973389, "eval_matthews_correlation": 0.3218521640278974, "eval_runtime": 2.3461, "eval_samples_per_second": 94.199, "eval_steps_per_second": 1.705, "step": 44 }, { "epoch": 6.428571428571429, "grad_norm": 7.0625, "learning_rate": 1.8382352941176472e-05, "loss": 0.0472, "step": 45 }, { "epoch": 6.428571428571429, "eval_loss": 1.050150990486145, "eval_matthews_correlation": 0.3055129963090533, "eval_runtime": 2.3458, "eval_samples_per_second": 94.212, "eval_steps_per_second": 1.705, "step": 45 }, { "epoch": 6.571428571428571, "grad_norm": 4.96875, "learning_rate": 1.7647058823529414e-05, "loss": 0.0514, "step": 46 }, { "epoch": 6.571428571428571, "eval_loss": 1.0775320529937744, "eval_matthews_correlation": 0.3151930392831226, "eval_runtime": 2.3482, "eval_samples_per_second": 94.115, "eval_steps_per_second": 1.703, "step": 46 }, { "epoch": 6.714285714285714, "grad_norm": 9.625, "learning_rate": 1.6911764705882355e-05, "loss": 0.0946, "step": 47 }, { "epoch": 6.714285714285714, "eval_loss": 1.0962245464324951, "eval_matthews_correlation": 0.3198378162607766, "eval_runtime": 2.3462, "eval_samples_per_second": 94.196, "eval_steps_per_second": 1.705, "step": 47 }, { "epoch": 6.857142857142857, "grad_norm": 11.0, "learning_rate": 1.6176470588235296e-05, "loss": 0.064, "step": 48 }, { "epoch": 6.857142857142857, "eval_loss": 1.1000041961669922, "eval_matthews_correlation": 0.33299219513436445, "eval_runtime": 2.3477, "eval_samples_per_second": 94.133, "eval_steps_per_second": 1.704, "step": 48 }, { "epoch": 7.0, "grad_norm": 4.90625, "learning_rate": 1.5441176470588237e-05, "loss": 0.0377, "step": 49 }, { "epoch": 7.0, "eval_loss": 1.0983600616455078, "eval_matthews_correlation": 0.33849333487222494, "eval_runtime": 2.2962, "eval_samples_per_second": 96.248, "eval_steps_per_second": 1.742, "step": 49 }, { "epoch": 7.142857142857143, "grad_norm": 1.6640625, "learning_rate": 1.4705882352941177e-05, "loss": 0.0316, "step": 50 }, { "epoch": 7.142857142857143, "eval_loss": 1.0886433124542236, "eval_matthews_correlation": 0.33849333487222494, "eval_runtime": 2.3464, "eval_samples_per_second": 94.187, "eval_steps_per_second": 1.705, "step": 50 }, { "epoch": 7.285714285714286, "grad_norm": 9.625, "learning_rate": 1.3970588235294118e-05, "loss": 0.0442, "step": 51 }, { "epoch": 7.285714285714286, "eval_loss": 1.0777003765106201, "eval_matthews_correlation": 0.34693548973921595, "eval_runtime": 2.296, "eval_samples_per_second": 96.256, "eval_steps_per_second": 1.742, "step": 51 }, { "epoch": 7.428571428571429, "grad_norm": 6.40625, "learning_rate": 1.323529411764706e-05, "loss": 0.0266, "step": 52 }, { "epoch": 7.428571428571429, "eval_loss": 1.0702271461486816, "eval_matthews_correlation": 0.34693548973921595, "eval_runtime": 2.3463, "eval_samples_per_second": 94.189, "eval_steps_per_second": 1.705, "step": 52 }, { "epoch": 7.571428571428571, "grad_norm": 2.234375, "learning_rate": 1.25e-05, "loss": 0.0373, "step": 53 }, { "epoch": 7.571428571428571, "eval_loss": 1.0644919872283936, "eval_matthews_correlation": 0.34693548973921595, "eval_runtime": 2.2974, "eval_samples_per_second": 96.197, "eval_steps_per_second": 1.741, "step": 53 }, { "epoch": 7.714285714285714, "grad_norm": 2.671875, "learning_rate": 1.1764705882352942e-05, "loss": 0.0312, "step": 54 }, { "epoch": 7.714285714285714, "eval_loss": 1.0710008144378662, "eval_matthews_correlation": 0.33849333487222494, "eval_runtime": 2.2965, "eval_samples_per_second": 96.232, "eval_steps_per_second": 1.742, "step": 54 }, { "epoch": 7.857142857142857, "grad_norm": 1.5703125, "learning_rate": 1.1029411764705883e-05, "loss": 0.0182, "step": 55 }, { "epoch": 7.857142857142857, "eval_loss": 1.0716383457183838, "eval_matthews_correlation": 0.35546338006875017, "eval_runtime": 2.2985, "eval_samples_per_second": 96.15, "eval_steps_per_second": 1.74, "step": 55 }, { "epoch": 8.0, "grad_norm": 3.15625, "learning_rate": 1.0294117647058824e-05, "loss": 0.0307, "step": 56 }, { "epoch": 8.0, "eval_loss": 1.0811822414398193, "eval_matthews_correlation": 0.3606464526835643, "eval_runtime": 2.3471, "eval_samples_per_second": 94.159, "eval_steps_per_second": 1.704, "step": 56 }, { "epoch": 8.142857142857142, "grad_norm": 1.1796875, "learning_rate": 9.558823529411764e-06, "loss": 0.0141, "step": 57 }, { "epoch": 8.142857142857142, "eval_loss": 1.089095115661621, "eval_matthews_correlation": 0.3606464526835643, "eval_runtime": 2.295, "eval_samples_per_second": 96.295, "eval_steps_per_second": 1.743, "step": 57 }, { "epoch": 8.285714285714286, "grad_norm": 1.515625, "learning_rate": 8.823529411764707e-06, "loss": 0.019, "step": 58 }, { "epoch": 8.285714285714286, "eval_loss": 1.1000548601150513, "eval_matthews_correlation": 0.3634024265899628, "eval_runtime": 2.3565, "eval_samples_per_second": 93.784, "eval_steps_per_second": 1.697, "step": 58 }, { "epoch": 8.428571428571429, "grad_norm": 1.21875, "learning_rate": 8.088235294117648e-06, "loss": 0.0137, "step": 59 }, { "epoch": 8.428571428571429, "eval_loss": 1.1046100854873657, "eval_matthews_correlation": 0.3716837172819431, "eval_runtime": 2.2959, "eval_samples_per_second": 96.257, "eval_steps_per_second": 1.742, "step": 59 }, { "epoch": 8.571428571428571, "grad_norm": 2.265625, "learning_rate": 7.3529411764705884e-06, "loss": 0.0192, "step": 60 }, { "epoch": 8.571428571428571, "eval_loss": 1.1252989768981934, "eval_matthews_correlation": 0.3716837172819431, "eval_runtime": 2.3452, "eval_samples_per_second": 94.235, "eval_steps_per_second": 1.706, "step": 60 }, { "epoch": 8.714285714285714, "grad_norm": 3.953125, "learning_rate": 6.61764705882353e-06, "loss": 0.0266, "step": 61 }, { "epoch": 8.714285714285714, "eval_loss": 1.1373261213302612, "eval_matthews_correlation": 0.3716837172819431, "eval_runtime": 2.3438, "eval_samples_per_second": 94.293, "eval_steps_per_second": 1.707, "step": 61 }, { "epoch": 8.857142857142858, "grad_norm": 2.921875, "learning_rate": 5.882352941176471e-06, "loss": 0.0236, "step": 62 }, { "epoch": 8.857142857142858, "eval_loss": 1.1461013555526733, "eval_matthews_correlation": 0.3716837172819431, "eval_runtime": 2.3042, "eval_samples_per_second": 95.911, "eval_steps_per_second": 1.736, "step": 62 }, { "epoch": 9.0, "grad_norm": 2.703125, "learning_rate": 5.147058823529412e-06, "loss": 0.0096, "step": 63 }, { "epoch": 9.0, "eval_loss": 1.1585053205490112, "eval_matthews_correlation": 0.3716837172819431, "eval_runtime": 2.3511, "eval_samples_per_second": 93.997, "eval_steps_per_second": 1.701, "step": 63 }, { "epoch": 9.142857142857142, "grad_norm": 4.9375, "learning_rate": 4.411764705882353e-06, "loss": 0.0266, "step": 64 }, { "epoch": 9.142857142857142, "eval_loss": 1.1639437675476074, "eval_matthews_correlation": 0.3716837172819431, "eval_runtime": 2.3753, "eval_samples_per_second": 93.042, "eval_steps_per_second": 1.684, "step": 64 }, { "epoch": 9.285714285714286, "grad_norm": 1.4140625, "learning_rate": 3.6764705882352942e-06, "loss": 0.0081, "step": 65 }, { "epoch": 9.285714285714286, "eval_loss": 1.166314721107483, "eval_matthews_correlation": 0.3716837172819431, "eval_runtime": 2.5404, "eval_samples_per_second": 86.993, "eval_steps_per_second": 1.575, "step": 65 }, { "epoch": 9.428571428571429, "grad_norm": 1.5390625, "learning_rate": 2.9411764705882355e-06, "loss": 0.0142, "step": 66 }, { "epoch": 9.428571428571429, "eval_loss": 1.1685423851013184, "eval_matthews_correlation": 0.3716837172819431, "eval_runtime": 2.3958, "eval_samples_per_second": 92.245, "eval_steps_per_second": 1.67, "step": 66 }, { "epoch": 9.571428571428571, "grad_norm": 0.455078125, "learning_rate": 2.2058823529411767e-06, "loss": 0.0064, "step": 67 }, { "epoch": 9.571428571428571, "eval_loss": 1.17280912399292, "eval_matthews_correlation": 0.3716837172819431, "eval_runtime": 2.4299, "eval_samples_per_second": 90.951, "eval_steps_per_second": 1.646, "step": 67 }, { "epoch": 9.714285714285714, "grad_norm": 1.90625, "learning_rate": 1.4705882352941177e-06, "loss": 0.0157, "step": 68 }, { "epoch": 9.714285714285714, "eval_loss": 1.1688233613967896, "eval_matthews_correlation": 0.3716837172819431, "eval_runtime": 2.3577, "eval_samples_per_second": 93.734, "eval_steps_per_second": 1.697, "step": 68 }, { "epoch": 9.857142857142858, "grad_norm": 1.0703125, "learning_rate": 7.352941176470589e-07, "loss": 0.0102, "step": 69 }, { "epoch": 9.857142857142858, "eval_loss": 1.1763280630111694, "eval_matthews_correlation": 0.3716837172819431, "eval_runtime": 2.352, "eval_samples_per_second": 93.963, "eval_steps_per_second": 1.701, "step": 69 }, { "epoch": 10.0, "grad_norm": 0.98828125, "learning_rate": 0.0, "loss": 0.0042, "step": 70 }, { "epoch": 10.0, "eval_loss": 1.1750054359436035, "eval_matthews_correlation": 0.3716837172819431, "eval_runtime": 2.3562, "eval_samples_per_second": 93.794, "eval_steps_per_second": 1.698, "step": 70 }, { "epoch": 10.0, "step": 70, "total_flos": 3.820098642614682e+16, "train_loss": 0.36309749615777814, "train_runtime": 435.4776, "train_samples_per_second": 20.277, "train_steps_per_second": 0.161 } ], "logging_steps": 1, "max_steps": 70, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": false, "should_training_stop": false }, "attributes": {} } }, "total_flos": 3.820098642614682e+16, "train_batch_size": 16, "trial_name": null, "trial_params": null }