[{"loss": 1.0481925048828125, "grad_norm": 11.313448905944824, "learning_rate": 1.975998075998076e-05, "epoch": 0.1443001443001443, "step": 500}, {"loss": 0.9450968017578125, "grad_norm": 6.68593692779541, "learning_rate": 1.951948051948052e-05, "epoch": 0.2886002886002886, "step": 1000}, {"loss": 0.8973338623046875, "grad_norm": 7.333189010620117, "learning_rate": 1.927898027898028e-05, "epoch": 0.4329004329004329, "step": 1500}, {"loss": 0.906581298828125, "grad_norm": 6.697900295257568, "learning_rate": 1.9038480038480042e-05, "epoch": 0.5772005772005772, "step": 2000}, {"loss": 0.8833408203125, "grad_norm": 6.7471113204956055, "learning_rate": 1.87979797979798e-05, "epoch": 0.7215007215007215, "step": 2500}, {"loss": 0.8657266845703125, "grad_norm": 4.354027271270752, "learning_rate": 1.8557479557479558e-05, "epoch": 0.8658008658008658, "step": 3000}, {"eval_loss": 0.8943251967430115, "eval_accuracy": 0.6080525290424995, "eval_runtime": 215.022, "eval_samples_per_second": 64.454, "eval_steps_per_second": 8.06, "epoch": 1.0, "step": 3465}, {"loss": 0.8691299438476563, "grad_norm": 8.588912010192871, "learning_rate": 1.8316979316979316e-05, "epoch": 1.0101010101010102, "step": 3500}, {"loss": 0.8413906860351562, "grad_norm": 5.346979141235352, "learning_rate": 1.8076479076479077e-05, "epoch": 1.1544011544011543, "step": 4000}, {"loss": 0.8482789916992187, "grad_norm": 7.854517459869385, "learning_rate": 1.783597883597884e-05, "epoch": 1.2987012987012987, "step": 4500}, {"loss": 0.818630859375, "grad_norm": 9.31502914428711, "learning_rate": 1.7595478595478596e-05, "epoch": 1.443001443001443, "step": 5000}, {"loss": 0.8130513305664062, "grad_norm": 7.741605281829834, "learning_rate": 1.7354978354978354e-05, "epoch": 1.5873015873015874, "step": 5500}, {"loss": 0.8138023681640625, "grad_norm": 8.144558906555176, "learning_rate": 1.7114478114478116e-05, "epoch": 1.7316017316017316, "step": 6000}, {"loss": 0.8008894653320312, "grad_norm": 8.22934341430664, "learning_rate": 1.6873977873977877e-05, "epoch": 1.8759018759018757, "step": 6500}, {"eval_loss": 0.8389391899108887, "eval_accuracy": 0.6411718017172956, "eval_runtime": 97.0885, "eval_samples_per_second": 142.746, "eval_steps_per_second": 17.85, "epoch": 2.0, "step": 6930}, {"loss": 0.7934580688476562, "grad_norm": 6.788987159729004, "learning_rate": 1.6633477633477635e-05, "epoch": 2.0202020202020203, "step": 7000}, {"loss": 0.7662904663085938, "grad_norm": 6.284256935119629, "learning_rate": 1.6392977392977393e-05, "epoch": 2.1645021645021645, "step": 7500}, {"loss": 0.7675670776367187, "grad_norm": 6.0298943519592285, "learning_rate": 1.6152477152477154e-05, "epoch": 2.3088023088023086, "step": 8000}, {"loss": 0.7645794067382813, "grad_norm": 5.4714765548706055, "learning_rate": 1.5911976911976915e-05, "epoch": 2.4531024531024532, "step": 8500}, {"loss": 0.77156787109375, "grad_norm": 7.754717826843262, "learning_rate": 1.5671476671476673e-05, "epoch": 2.5974025974025974, "step": 9000}, {"loss": 0.7640423583984375, "grad_norm": 8.135042190551758, "learning_rate": 1.543097643097643e-05, "epoch": 2.741702741702742, "step": 9500}, {"loss": 0.7590892944335937, "grad_norm": 5.458001136779785, "learning_rate": 1.519047619047619e-05, "epoch": 2.886002886002886, "step": 10000}, {"eval_loss": 0.799248218536377, "eval_accuracy": 0.6600764845948481, "eval_runtime": 96.4459, "eval_samples_per_second": 143.697, "eval_steps_per_second": 17.969, "epoch": 3.0, "step": 10395}, {"loss": 0.7619152221679687, "grad_norm": 9.924676895141602, "learning_rate": 1.4949975949975952e-05, "epoch": 3.0303030303030303, "step": 10500}, {"loss": 0.7388421630859375, "grad_norm": 6.7671074867248535, "learning_rate": 1.4709475709475712e-05, "epoch": 3.1746031746031744, "step": 11000}, {"loss": 0.7168551635742187, "grad_norm": 10.665943145751953, "learning_rate": 1.446897546897547e-05, "epoch": 3.318903318903319, "step": 11500}, {"loss": 0.7253684692382812, "grad_norm": 6.040446758270264, "learning_rate": 1.422847522847523e-05, "epoch": 3.463203463203463, "step": 12000}, {"loss": 0.7182848510742188, "grad_norm": 7.990215301513672, "learning_rate": 1.3987974987974989e-05, "epoch": 3.6075036075036078, "step": 12500}, {"loss": 0.7107592163085937, "grad_norm": 7.975357532501221, "learning_rate": 1.374747474747475e-05, "epoch": 3.751803751803752, "step": 13000}, {"loss": 0.70408544921875, "grad_norm": 10.711268424987793, "learning_rate": 1.3506974506974508e-05, "epoch": 3.896103896103896, "step": 13500}, {"eval_loss": 0.8345581889152527, "eval_accuracy": 0.6641893354498881, "eval_runtime": 96.6944, "eval_samples_per_second": 143.328, "eval_steps_per_second": 17.922, "epoch": 4.0, "step": 13860}, {"loss": 0.7015195922851563, "grad_norm": 9.744124412536621, "learning_rate": 1.3266474266474268e-05, "epoch": 4.040404040404041, "step": 14000}, {"loss": 0.6715598754882812, "grad_norm": 8.739506721496582, "learning_rate": 1.3025974025974026e-05, "epoch": 4.184704184704184, "step": 14500}, {"loss": 0.6614401245117187, "grad_norm": 7.236831188201904, "learning_rate": 1.2785473785473787e-05, "epoch": 4.329004329004329, "step": 15000}, {"loss": 0.6867154541015625, "grad_norm": 12.38715934753418, "learning_rate": 1.2544973544973547e-05, "epoch": 4.473304473304474, "step": 15500}, {"loss": 0.676771240234375, "grad_norm": 8.485615730285645, "learning_rate": 1.2304473304473306e-05, "epoch": 4.617604617604617, "step": 16000}, {"loss": 0.6862166137695312, "grad_norm": 9.019938468933105, "learning_rate": 1.2063973063973064e-05, "epoch": 4.761904761904762, "step": 16500}, {"loss": 0.6546024780273437, "grad_norm": 8.116801261901855, "learning_rate": 1.1823472823472824e-05, "epoch": 4.9062049062049065, "step": 17000}, {"eval_loss": 0.872879683971405, "eval_accuracy": 0.6649108882314742, "eval_runtime": 96.5278, "eval_samples_per_second": 143.575, "eval_steps_per_second": 17.953, "epoch": 5.0, "step": 17325}, {"train_runtime": 3634.9831, "train_samples_per_second": 182.998, "train_steps_per_second": 11.439, "total_flos": 2.125090677483648e+16, "train_loss": 0.7793612992367875, "epoch": 5.0, "step": 17325}]