Image Classification
Transformers
TensorBoard
Safetensors
vit
food-ingredient-classification
food101
food101-finetuned
Generated from Trainer
Instructions to use ericmconnelly/finetuned-food101 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use ericmconnelly/finetuned-food101 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("image-classification", model="ericmconnelly/finetuned-food101") pipe("https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/hub/parrots.png")# Load model directly from transformers import AutoImageProcessor, AutoModelForImageClassification processor = AutoImageProcessor.from_pretrained("ericmconnelly/finetuned-food101") model = AutoModelForImageClassification.from_pretrained("ericmconnelly/finetuned-food101", device_map="auto") - Notebooks
- Google Colab
- Kaggle
Invalid JSON:Unexpected token 'N', ..."ad_norm": NaN,
"... is not valid JSON
| { | |
| "best_metric": 0.6105344295501709, | |
| "best_model_checkpoint": "finetuned-food101/checkpoint-16100", | |
| "epoch": 4.0, | |
| "eval_steps": 100, | |
| "global_step": 16100, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.002484472049689441, | |
| "grad_norm": 2.018357992172241, | |
| "learning_rate": 0.00019987577639751553, | |
| "loss": 4.5969, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.004968944099378882, | |
| "grad_norm": 1.9477064609527588, | |
| "learning_rate": 0.00019975155279503107, | |
| "loss": 4.5962, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.007453416149068323, | |
| "grad_norm": 1.6431339979171753, | |
| "learning_rate": 0.00019962732919254659, | |
| "loss": 4.5714, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.009937888198757764, | |
| "grad_norm": 1.9268441200256348, | |
| "learning_rate": 0.0001995031055900621, | |
| "loss": 4.5506, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.012422360248447204, | |
| "grad_norm": 1.8745810985565186, | |
| "learning_rate": 0.00019937888198757767, | |
| "loss": 4.4664, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.014906832298136646, | |
| "grad_norm": 1.825967788696289, | |
| "learning_rate": 0.0001992546583850932, | |
| "loss": 4.415, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.017391304347826087, | |
| "grad_norm": 1.822075366973877, | |
| "learning_rate": 0.0001991304347826087, | |
| "loss": 4.3765, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.01987577639751553, | |
| "grad_norm": 1.9246478080749512, | |
| "learning_rate": 0.00019900621118012425, | |
| "loss": 4.299, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.02236024844720497, | |
| "grad_norm": 1.8662974834442139, | |
| "learning_rate": 0.00019888198757763977, | |
| "loss": 4.1782, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.024844720496894408, | |
| "grad_norm": 2.1129419803619385, | |
| "learning_rate": 0.00019875776397515528, | |
| "loss": 4.1344, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.024844720496894408, | |
| "eval_accuracy": 0.3063451553286984, | |
| "eval_loss": 4.030449867248535, | |
| "eval_runtime": 87.1659, | |
| "eval_samples_per_second": 130.361, | |
| "eval_steps_per_second": 16.302, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.02732919254658385, | |
| "grad_norm": 1.8938136100769043, | |
| "learning_rate": 0.00019863354037267082, | |
| "loss": 4.0639, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 0.02981366459627329, | |
| "grad_norm": 2.3493857383728027, | |
| "learning_rate": 0.00019850931677018634, | |
| "loss": 3.9159, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 0.03229813664596273, | |
| "grad_norm": 2.3934977054595947, | |
| "learning_rate": 0.00019838509316770186, | |
| "loss": 3.9002, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 0.034782608695652174, | |
| "grad_norm": 2.9848217964172363, | |
| "learning_rate": 0.0001982608695652174, | |
| "loss": 3.8664, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 0.037267080745341616, | |
| "grad_norm": 2.182579755783081, | |
| "learning_rate": 0.00019813664596273294, | |
| "loss": 3.7589, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.03975155279503106, | |
| "grad_norm": 2.37665057182312, | |
| "learning_rate": 0.00019801242236024846, | |
| "loss": 3.6747, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 0.0422360248447205, | |
| "grad_norm": 2.528806447982788, | |
| "learning_rate": 0.00019788819875776398, | |
| "loss": 3.7115, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 0.04472049689440994, | |
| "grad_norm": 2.4230544567108154, | |
| "learning_rate": 0.00019776397515527952, | |
| "loss": 3.6117, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 0.04720496894409938, | |
| "grad_norm": 2.561897039413452, | |
| "learning_rate": 0.00019763975155279504, | |
| "loss": 3.5795, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 0.049689440993788817, | |
| "grad_norm": 2.853154420852661, | |
| "learning_rate": 0.00019751552795031055, | |
| "loss": 3.5328, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.049689440993788817, | |
| "eval_accuracy": 0.4409926955909531, | |
| "eval_loss": 3.3728513717651367, | |
| "eval_runtime": 88.2535, | |
| "eval_samples_per_second": 128.754, | |
| "eval_steps_per_second": 16.101, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.05217391304347826, | |
| "grad_norm": 2.532111167907715, | |
| "learning_rate": 0.0001973913043478261, | |
| "loss": 3.387, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 0.0546583850931677, | |
| "grad_norm": 2.5678958892822266, | |
| "learning_rate": 0.0001972670807453416, | |
| "loss": 3.3832, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 0.05714285714285714, | |
| "grad_norm": 2.4794390201568604, | |
| "learning_rate": 0.0001971552795031056, | |
| "loss": 3.3311, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 0.05962732919254658, | |
| "grad_norm": 3.4417531490325928, | |
| "learning_rate": 0.00019703105590062112, | |
| "loss": 3.2617, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 0.062111801242236024, | |
| "grad_norm": 3.0144076347351074, | |
| "learning_rate": 0.00019690683229813663, | |
| "loss": 3.043, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.06459627329192547, | |
| "grad_norm": 2.3258306980133057, | |
| "learning_rate": 0.0001967826086956522, | |
| "loss": 3.1299, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 0.0670807453416149, | |
| "grad_norm": 3.9541103839874268, | |
| "learning_rate": 0.00019665838509316772, | |
| "loss": 3.2333, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 0.06956521739130435, | |
| "grad_norm": 4.3033857345581055, | |
| "learning_rate": 0.00019653416149068324, | |
| "loss": 3.021, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 0.07204968944099378, | |
| "grad_norm": 3.252000570297241, | |
| "learning_rate": 0.00019640993788819878, | |
| "loss": 3.0683, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 0.07453416149068323, | |
| "grad_norm": 3.247220039367676, | |
| "learning_rate": 0.0001962857142857143, | |
| "loss": 2.9715, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.07453416149068323, | |
| "eval_accuracy": 0.5135087564903634, | |
| "eval_loss": 2.8900182247161865, | |
| "eval_runtime": 86.8214, | |
| "eval_samples_per_second": 130.878, | |
| "eval_steps_per_second": 16.367, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.07701863354037267, | |
| "grad_norm": 3.015491008758545, | |
| "learning_rate": 0.00019616149068322981, | |
| "loss": 2.8338, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 0.07950310559006211, | |
| "grad_norm": 4.734148025512695, | |
| "learning_rate": 0.00019603726708074536, | |
| "loss": 2.9681, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 0.08198757763975155, | |
| "grad_norm": 3.052933692932129, | |
| "learning_rate": 0.00019591304347826087, | |
| "loss": 2.8386, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 0.084472049689441, | |
| "grad_norm": 4.703938007354736, | |
| "learning_rate": 0.0001957888198757764, | |
| "loss": 2.9725, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 0.08695652173913043, | |
| "grad_norm": 2.9451019763946533, | |
| "learning_rate": 0.00019566459627329193, | |
| "loss": 2.8719, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 0.08944099378881988, | |
| "grad_norm": 4.3831987380981445, | |
| "learning_rate": 0.00019554037267080748, | |
| "loss": 2.8716, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 0.09192546583850932, | |
| "grad_norm": 3.833592176437378, | |
| "learning_rate": 0.000195416149068323, | |
| "loss": 2.9066, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 0.09440993788819876, | |
| "grad_norm": 4.050900936126709, | |
| "learning_rate": 0.0001952919254658385, | |
| "loss": 2.6445, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 0.0968944099378882, | |
| "grad_norm": 4.814563274383545, | |
| "learning_rate": 0.00019516770186335405, | |
| "loss": 2.6455, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 0.09937888198757763, | |
| "grad_norm": 5.039762496948242, | |
| "learning_rate": 0.00019505590062111802, | |
| "loss": 2.724, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.09937888198757763, | |
| "eval_accuracy": 0.5443104813869577, | |
| "eval_loss": 2.509587526321411, | |
| "eval_runtime": 87.6766, | |
| "eval_samples_per_second": 129.601, | |
| "eval_steps_per_second": 16.207, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.10186335403726708, | |
| "grad_norm": 5.771543025970459, | |
| "learning_rate": 0.00019493167701863356, | |
| "loss": 2.6617, | |
| "step": 410 | |
| }, | |
| { | |
| "epoch": 0.10434782608695652, | |
| "grad_norm": 3.382282257080078, | |
| "learning_rate": 0.00019480745341614908, | |
| "loss": 2.6631, | |
| "step": 420 | |
| }, | |
| { | |
| "epoch": 0.10683229813664596, | |
| "grad_norm": 3.872953176498413, | |
| "learning_rate": 0.0001946832298136646, | |
| "loss": 2.5117, | |
| "step": 430 | |
| }, | |
| { | |
| "epoch": 0.1093167701863354, | |
| "grad_norm": 3.881727695465088, | |
| "learning_rate": 0.00019455900621118014, | |
| "loss": 2.4816, | |
| "step": 440 | |
| }, | |
| { | |
| "epoch": 0.11180124223602485, | |
| "grad_norm": 4.131108283996582, | |
| "learning_rate": 0.00019443478260869565, | |
| "loss": 2.534, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 0.11428571428571428, | |
| "grad_norm": 3.308680772781372, | |
| "learning_rate": 0.00019431055900621117, | |
| "loss": 2.4314, | |
| "step": 460 | |
| }, | |
| { | |
| "epoch": 0.11677018633540373, | |
| "grad_norm": 7.087298393249512, | |
| "learning_rate": 0.00019418633540372674, | |
| "loss": 2.4269, | |
| "step": 470 | |
| }, | |
| { | |
| "epoch": 0.11925465838509317, | |
| "grad_norm": 5.214663505554199, | |
| "learning_rate": 0.00019406211180124225, | |
| "loss": 2.2572, | |
| "step": 480 | |
| }, | |
| { | |
| "epoch": 0.12173913043478261, | |
| "grad_norm": 5.976667881011963, | |
| "learning_rate": 0.00019393788819875777, | |
| "loss": 2.4425, | |
| "step": 490 | |
| }, | |
| { | |
| "epoch": 0.12422360248447205, | |
| "grad_norm": 5.982608795166016, | |
| "learning_rate": 0.00019381366459627331, | |
| "loss": 2.311, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.12422360248447205, | |
| "eval_accuracy": 0.5894570095925372, | |
| "eval_loss": 2.1726009845733643, | |
| "eval_runtime": 87.1828, | |
| "eval_samples_per_second": 130.335, | |
| "eval_steps_per_second": 16.299, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.1267080745341615, | |
| "grad_norm": 5.053837776184082, | |
| "learning_rate": 0.00019368944099378883, | |
| "loss": 2.2082, | |
| "step": 510 | |
| }, | |
| { | |
| "epoch": 0.12919254658385093, | |
| "grad_norm": 6.473962306976318, | |
| "learning_rate": 0.00019356521739130435, | |
| "loss": 2.2111, | |
| "step": 520 | |
| }, | |
| { | |
| "epoch": 0.13167701863354037, | |
| "grad_norm": 6.132943153381348, | |
| "learning_rate": 0.0001934409937888199, | |
| "loss": 2.356, | |
| "step": 530 | |
| }, | |
| { | |
| "epoch": 0.1341614906832298, | |
| "grad_norm": 3.197087287902832, | |
| "learning_rate": 0.0001933167701863354, | |
| "loss": 2.1868, | |
| "step": 540 | |
| }, | |
| { | |
| "epoch": 0.13664596273291926, | |
| "grad_norm": 6.199575901031494, | |
| "learning_rate": 0.00019319254658385092, | |
| "loss": 2.4575, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 0.1391304347826087, | |
| "grad_norm": 4.699795722961426, | |
| "learning_rate": 0.00019306832298136647, | |
| "loss": 2.3983, | |
| "step": 560 | |
| }, | |
| { | |
| "epoch": 0.14161490683229813, | |
| "grad_norm": 5.361752510070801, | |
| "learning_rate": 0.000192944099378882, | |
| "loss": 2.218, | |
| "step": 570 | |
| }, | |
| { | |
| "epoch": 0.14409937888198757, | |
| "grad_norm": 4.245269775390625, | |
| "learning_rate": 0.00019281987577639753, | |
| "loss": 1.9794, | |
| "step": 580 | |
| }, | |
| { | |
| "epoch": 0.14658385093167703, | |
| "grad_norm": 2.9164280891418457, | |
| "learning_rate": 0.00019269565217391304, | |
| "loss": 2.1541, | |
| "step": 590 | |
| }, | |
| { | |
| "epoch": 0.14906832298136646, | |
| "grad_norm": 3.7694873809814453, | |
| "learning_rate": 0.00019257142857142859, | |
| "loss": 2.266, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.14906832298136646, | |
| "eval_accuracy": 0.5879609258118454, | |
| "eval_loss": 2.0223026275634766, | |
| "eval_runtime": 88.2805, | |
| "eval_samples_per_second": 128.715, | |
| "eval_steps_per_second": 16.096, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.1515527950310559, | |
| "grad_norm": 4.551809787750244, | |
| "learning_rate": 0.0001924472049689441, | |
| "loss": 2.1348, | |
| "step": 610 | |
| }, | |
| { | |
| "epoch": 0.15403726708074533, | |
| "grad_norm": 5.469175815582275, | |
| "learning_rate": 0.00019232298136645962, | |
| "loss": 2.0839, | |
| "step": 620 | |
| }, | |
| { | |
| "epoch": 0.1565217391304348, | |
| "grad_norm": 5.535090923309326, | |
| "learning_rate": 0.00019219875776397516, | |
| "loss": 2.0028, | |
| "step": 630 | |
| }, | |
| { | |
| "epoch": 0.15900621118012423, | |
| "grad_norm": 5.28466272354126, | |
| "learning_rate": 0.00019207453416149068, | |
| "loss": 2.3083, | |
| "step": 640 | |
| }, | |
| { | |
| "epoch": 0.16149068322981366, | |
| "grad_norm": 7.3980488777160645, | |
| "learning_rate": 0.00019195031055900622, | |
| "loss": 2.1914, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 0.1639751552795031, | |
| "grad_norm": 5.99133825302124, | |
| "learning_rate": 0.00019182608695652177, | |
| "loss": 2.3663, | |
| "step": 660 | |
| }, | |
| { | |
| "epoch": 0.16645962732919253, | |
| "grad_norm": 4.15263032913208, | |
| "learning_rate": 0.00019170186335403728, | |
| "loss": 1.9666, | |
| "step": 670 | |
| }, | |
| { | |
| "epoch": 0.168944099378882, | |
| "grad_norm": 4.62333345413208, | |
| "learning_rate": 0.0001915776397515528, | |
| "loss": 2.1487, | |
| "step": 680 | |
| }, | |
| { | |
| "epoch": 0.17142857142857143, | |
| "grad_norm": 8.580528259277344, | |
| "learning_rate": 0.00019145341614906834, | |
| "loss": 2.0729, | |
| "step": 690 | |
| }, | |
| { | |
| "epoch": 0.17391304347826086, | |
| "grad_norm": 7.049954891204834, | |
| "learning_rate": 0.00019132919254658386, | |
| "loss": 1.9671, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 0.17391304347826086, | |
| "eval_accuracy": 0.633019449089149, | |
| "eval_loss": 1.758486270904541, | |
| "eval_runtime": 88.0658, | |
| "eval_samples_per_second": 129.028, | |
| "eval_steps_per_second": 16.136, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 0.1763975155279503, | |
| "grad_norm": 5.929836750030518, | |
| "learning_rate": 0.00019120496894409937, | |
| "loss": 1.9726, | |
| "step": 710 | |
| }, | |
| { | |
| "epoch": 0.17888198757763976, | |
| "grad_norm": 4.58709716796875, | |
| "learning_rate": 0.00019108074534161492, | |
| "loss": 1.9319, | |
| "step": 720 | |
| }, | |
| { | |
| "epoch": 0.1813664596273292, | |
| "grad_norm": 6.737441539764404, | |
| "learning_rate": 0.00019095652173913043, | |
| "loss": 2.0524, | |
| "step": 730 | |
| }, | |
| { | |
| "epoch": 0.18385093167701863, | |
| "grad_norm": 8.844467163085938, | |
| "learning_rate": 0.00019083229813664598, | |
| "loss": 2.1296, | |
| "step": 740 | |
| }, | |
| { | |
| "epoch": 0.18633540372670807, | |
| "grad_norm": 5.9616780281066895, | |
| "learning_rate": 0.0001907080745341615, | |
| "loss": 1.8757, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 0.18881987577639753, | |
| "grad_norm": 7.684135437011719, | |
| "learning_rate": 0.00019058385093167704, | |
| "loss": 1.8596, | |
| "step": 760 | |
| }, | |
| { | |
| "epoch": 0.19130434782608696, | |
| "grad_norm": 4.873102188110352, | |
| "learning_rate": 0.00019045962732919255, | |
| "loss": 1.9921, | |
| "step": 770 | |
| }, | |
| { | |
| "epoch": 0.1937888198757764, | |
| "grad_norm": 3.7490782737731934, | |
| "learning_rate": 0.00019033540372670807, | |
| "loss": 2.0498, | |
| "step": 780 | |
| }, | |
| { | |
| "epoch": 0.19627329192546583, | |
| "grad_norm": 5.863892078399658, | |
| "learning_rate": 0.00019021118012422361, | |
| "loss": 1.7348, | |
| "step": 790 | |
| }, | |
| { | |
| "epoch": 0.19875776397515527, | |
| "grad_norm": 7.632678985595703, | |
| "learning_rate": 0.00019008695652173913, | |
| "loss": 1.8617, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.19875776397515527, | |
| "eval_accuracy": 0.6212267887001672, | |
| "eval_loss": 1.7300000190734863, | |
| "eval_runtime": 88.4568, | |
| "eval_samples_per_second": 128.458, | |
| "eval_steps_per_second": 16.064, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.20124223602484473, | |
| "grad_norm": 8.62378215789795, | |
| "learning_rate": 0.00018996273291925467, | |
| "loss": 1.7559, | |
| "step": 810 | |
| }, | |
| { | |
| "epoch": 0.20372670807453416, | |
| "grad_norm": 7.463620662689209, | |
| "learning_rate": 0.0001898385093167702, | |
| "loss": 2.0599, | |
| "step": 820 | |
| }, | |
| { | |
| "epoch": 0.2062111801242236, | |
| "grad_norm": 6.657968044281006, | |
| "learning_rate": 0.00018971428571428573, | |
| "loss": 1.6052, | |
| "step": 830 | |
| }, | |
| { | |
| "epoch": 0.20869565217391303, | |
| "grad_norm": 6.594502925872803, | |
| "learning_rate": 0.00018959006211180125, | |
| "loss": 1.6008, | |
| "step": 840 | |
| }, | |
| { | |
| "epoch": 0.2111801242236025, | |
| "grad_norm": 5.336763858795166, | |
| "learning_rate": 0.0001894658385093168, | |
| "loss": 1.8464, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 0.21366459627329193, | |
| "grad_norm": 5.568216323852539, | |
| "learning_rate": 0.0001893416149068323, | |
| "loss": 1.8365, | |
| "step": 860 | |
| }, | |
| { | |
| "epoch": 0.21614906832298136, | |
| "grad_norm": 5.7065510749816895, | |
| "learning_rate": 0.00018921739130434783, | |
| "loss": 1.8583, | |
| "step": 870 | |
| }, | |
| { | |
| "epoch": 0.2186335403726708, | |
| "grad_norm": 6.466409206390381, | |
| "learning_rate": 0.00018909316770186337, | |
| "loss": 1.6582, | |
| "step": 880 | |
| }, | |
| { | |
| "epoch": 0.22111801242236026, | |
| "grad_norm": 5.712678909301758, | |
| "learning_rate": 0.00018896894409937889, | |
| "loss": 1.9344, | |
| "step": 890 | |
| }, | |
| { | |
| "epoch": 0.2236024844720497, | |
| "grad_norm": 4.358852863311768, | |
| "learning_rate": 0.0001888447204968944, | |
| "loss": 1.4694, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 0.2236024844720497, | |
| "eval_accuracy": 0.6077620346739417, | |
| "eval_loss": 1.7506581544876099, | |
| "eval_runtime": 87.3994, | |
| "eval_samples_per_second": 130.012, | |
| "eval_steps_per_second": 16.259, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 0.22608695652173913, | |
| "grad_norm": 7.161348342895508, | |
| "learning_rate": 0.00018872049689440995, | |
| "loss": 2.003, | |
| "step": 910 | |
| }, | |
| { | |
| "epoch": 0.22857142857142856, | |
| "grad_norm": 8.397992134094238, | |
| "learning_rate": 0.0001885962732919255, | |
| "loss": 1.7533, | |
| "step": 920 | |
| }, | |
| { | |
| "epoch": 0.231055900621118, | |
| "grad_norm": 8.75161075592041, | |
| "learning_rate": 0.000188472049689441, | |
| "loss": 1.7335, | |
| "step": 930 | |
| }, | |
| { | |
| "epoch": 0.23354037267080746, | |
| "grad_norm": 3.9503304958343506, | |
| "learning_rate": 0.00018834782608695655, | |
| "loss": 1.6272, | |
| "step": 940 | |
| }, | |
| { | |
| "epoch": 0.2360248447204969, | |
| "grad_norm": 9.528467178344727, | |
| "learning_rate": 0.00018822360248447206, | |
| "loss": 1.9007, | |
| "step": 950 | |
| }, | |
| { | |
| "epoch": 0.23850931677018633, | |
| "grad_norm": 10.89683723449707, | |
| "learning_rate": 0.00018809937888198758, | |
| "loss": 1.6834, | |
| "step": 960 | |
| }, | |
| { | |
| "epoch": 0.24099378881987576, | |
| "grad_norm": 5.9737629890441895, | |
| "learning_rate": 0.00018797515527950312, | |
| "loss": 1.9189, | |
| "step": 970 | |
| }, | |
| { | |
| "epoch": 0.24347826086956523, | |
| "grad_norm": 5.383342266082764, | |
| "learning_rate": 0.00018785093167701864, | |
| "loss": 1.8391, | |
| "step": 980 | |
| }, | |
| { | |
| "epoch": 0.24596273291925466, | |
| "grad_norm": 5.408697605133057, | |
| "learning_rate": 0.00018772670807453416, | |
| "loss": 1.7161, | |
| "step": 990 | |
| }, | |
| { | |
| "epoch": 0.2484472049689441, | |
| "grad_norm": 8.349679946899414, | |
| "learning_rate": 0.0001876024844720497, | |
| "loss": 1.7876, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.2484472049689441, | |
| "eval_accuracy": 0.6133063451553287, | |
| "eval_loss": 1.6519758701324463, | |
| "eval_runtime": 87.6336, | |
| "eval_samples_per_second": 129.665, | |
| "eval_steps_per_second": 16.215, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.25093167701863356, | |
| "grad_norm": 7.187140464782715, | |
| "learning_rate": 0.00018747826086956524, | |
| "loss": 1.8637, | |
| "step": 1010 | |
| }, | |
| { | |
| "epoch": 0.253416149068323, | |
| "grad_norm": 4.753952503204346, | |
| "learning_rate": 0.00018735403726708076, | |
| "loss": 1.9234, | |
| "step": 1020 | |
| }, | |
| { | |
| "epoch": 0.25590062111801243, | |
| "grad_norm": 5.245208740234375, | |
| "learning_rate": 0.00018722981366459628, | |
| "loss": 1.6968, | |
| "step": 1030 | |
| }, | |
| { | |
| "epoch": 0.25838509316770186, | |
| "grad_norm": 4.8791351318359375, | |
| "learning_rate": 0.00018710559006211182, | |
| "loss": 1.4784, | |
| "step": 1040 | |
| }, | |
| { | |
| "epoch": 0.2608695652173913, | |
| "grad_norm": 9.694734573364258, | |
| "learning_rate": 0.00018698136645962734, | |
| "loss": 1.6259, | |
| "step": 1050 | |
| }, | |
| { | |
| "epoch": 0.26335403726708073, | |
| "grad_norm": 9.020699501037598, | |
| "learning_rate": 0.00018685714285714285, | |
| "loss": 1.7696, | |
| "step": 1060 | |
| }, | |
| { | |
| "epoch": 0.26583850931677017, | |
| "grad_norm": 7.134639739990234, | |
| "learning_rate": 0.0001867329192546584, | |
| "loss": 1.8738, | |
| "step": 1070 | |
| }, | |
| { | |
| "epoch": 0.2683229813664596, | |
| "grad_norm": 6.925185680389404, | |
| "learning_rate": 0.0001866086956521739, | |
| "loss": 1.6153, | |
| "step": 1080 | |
| }, | |
| { | |
| "epoch": 0.2708074534161491, | |
| "grad_norm": 6.5511579513549805, | |
| "learning_rate": 0.00018648447204968943, | |
| "loss": 1.8047, | |
| "step": 1090 | |
| }, | |
| { | |
| "epoch": 0.2732919254658385, | |
| "grad_norm": 3.910539150238037, | |
| "learning_rate": 0.000186360248447205, | |
| "loss": 1.7647, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 0.2732919254658385, | |
| "eval_accuracy": 0.659772947285048, | |
| "eval_loss": 1.4576257467269897, | |
| "eval_runtime": 86.6742, | |
| "eval_samples_per_second": 131.1, | |
| "eval_steps_per_second": 16.395, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 0.27577639751552796, | |
| "grad_norm": 5.463332176208496, | |
| "learning_rate": 0.00018623602484472052, | |
| "loss": 1.6722, | |
| "step": 1110 | |
| }, | |
| { | |
| "epoch": 0.2782608695652174, | |
| "grad_norm": 5.566735744476318, | |
| "learning_rate": 0.00018611180124223603, | |
| "loss": 1.734, | |
| "step": 1120 | |
| }, | |
| { | |
| "epoch": 0.28074534161490683, | |
| "grad_norm": 8.45088005065918, | |
| "learning_rate": 0.00018598757763975158, | |
| "loss": 1.7612, | |
| "step": 1130 | |
| }, | |
| { | |
| "epoch": 0.28322981366459626, | |
| "grad_norm": 6.647975444793701, | |
| "learning_rate": 0.0001858633540372671, | |
| "loss": 1.6728, | |
| "step": 1140 | |
| }, | |
| { | |
| "epoch": 0.2857142857142857, | |
| "grad_norm": 5.041713714599609, | |
| "learning_rate": 0.0001857391304347826, | |
| "loss": 1.6758, | |
| "step": 1150 | |
| }, | |
| { | |
| "epoch": 0.28819875776397513, | |
| "grad_norm": 8.309142112731934, | |
| "learning_rate": 0.00018561490683229815, | |
| "loss": 1.5707, | |
| "step": 1160 | |
| }, | |
| { | |
| "epoch": 0.2906832298136646, | |
| "grad_norm": 8.672463417053223, | |
| "learning_rate": 0.00018549068322981367, | |
| "loss": 1.6847, | |
| "step": 1170 | |
| }, | |
| { | |
| "epoch": 0.29316770186335406, | |
| "grad_norm": 8.018989562988281, | |
| "learning_rate": 0.00018536645962732918, | |
| "loss": 1.3782, | |
| "step": 1180 | |
| }, | |
| { | |
| "epoch": 0.2956521739130435, | |
| "grad_norm": 6.475429058074951, | |
| "learning_rate": 0.00018524223602484473, | |
| "loss": 1.5442, | |
| "step": 1190 | |
| }, | |
| { | |
| "epoch": 0.2981366459627329, | |
| "grad_norm": 5.768404006958008, | |
| "learning_rate": 0.00018511801242236027, | |
| "loss": 1.7, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 0.2981366459627329, | |
| "eval_accuracy": 0.6576608290064243, | |
| "eval_loss": 1.4419533014297485, | |
| "eval_runtime": 86.3614, | |
| "eval_samples_per_second": 131.575, | |
| "eval_steps_per_second": 16.454, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 0.30062111801242236, | |
| "grad_norm": 4.549999713897705, | |
| "learning_rate": 0.0001849937888198758, | |
| "loss": 1.8302, | |
| "step": 1210 | |
| }, | |
| { | |
| "epoch": 0.3031055900621118, | |
| "grad_norm": 9.671154022216797, | |
| "learning_rate": 0.0001848695652173913, | |
| "loss": 1.5977, | |
| "step": 1220 | |
| }, | |
| { | |
| "epoch": 0.30559006211180123, | |
| "grad_norm": 5.3373494148254395, | |
| "learning_rate": 0.00018474534161490685, | |
| "loss": 1.541, | |
| "step": 1230 | |
| }, | |
| { | |
| "epoch": 0.30807453416149067, | |
| "grad_norm": 4.874505043029785, | |
| "learning_rate": 0.00018462111801242236, | |
| "loss": 1.6999, | |
| "step": 1240 | |
| }, | |
| { | |
| "epoch": 0.3105590062111801, | |
| "grad_norm": 7.157403945922852, | |
| "learning_rate": 0.00018449689440993788, | |
| "loss": 1.8442, | |
| "step": 1250 | |
| }, | |
| { | |
| "epoch": 0.3130434782608696, | |
| "grad_norm": 7.489334583282471, | |
| "learning_rate": 0.00018437267080745342, | |
| "loss": 1.7671, | |
| "step": 1260 | |
| }, | |
| { | |
| "epoch": 0.315527950310559, | |
| "grad_norm": 9.33269214630127, | |
| "learning_rate": 0.00018424844720496894, | |
| "loss": 1.6574, | |
| "step": 1270 | |
| }, | |
| { | |
| "epoch": 0.31801242236024846, | |
| "grad_norm": 4.2884697914123535, | |
| "learning_rate": 0.00018412422360248448, | |
| "loss": 1.5512, | |
| "step": 1280 | |
| }, | |
| { | |
| "epoch": 0.3204968944099379, | |
| "grad_norm": 8.707039833068848, | |
| "learning_rate": 0.00018400000000000003, | |
| "loss": 1.8651, | |
| "step": 1290 | |
| }, | |
| { | |
| "epoch": 0.32298136645962733, | |
| "grad_norm": 5.426664352416992, | |
| "learning_rate": 0.00018387577639751554, | |
| "loss": 1.533, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 0.32298136645962733, | |
| "eval_accuracy": 0.6537006072340051, | |
| "eval_loss": 1.4389325380325317, | |
| "eval_runtime": 86.5703, | |
| "eval_samples_per_second": 131.257, | |
| "eval_steps_per_second": 16.414, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 0.32546583850931676, | |
| "grad_norm": 6.7798171043396, | |
| "learning_rate": 0.00018375155279503106, | |
| "loss": 1.7068, | |
| "step": 1310 | |
| }, | |
| { | |
| "epoch": 0.3279503105590062, | |
| "grad_norm": 4.650680065155029, | |
| "learning_rate": 0.0001836273291925466, | |
| "loss": 1.3869, | |
| "step": 1320 | |
| }, | |
| { | |
| "epoch": 0.33043478260869563, | |
| "grad_norm": 7.123183250427246, | |
| "learning_rate": 0.00018350310559006212, | |
| "loss": 1.6407, | |
| "step": 1330 | |
| }, | |
| { | |
| "epoch": 0.33291925465838507, | |
| "grad_norm": 5.242658615112305, | |
| "learning_rate": 0.00018337888198757764, | |
| "loss": 1.5, | |
| "step": 1340 | |
| }, | |
| { | |
| "epoch": 0.33540372670807456, | |
| "grad_norm": 8.704155921936035, | |
| "learning_rate": 0.00018325465838509318, | |
| "loss": 1.5082, | |
| "step": 1350 | |
| }, | |
| { | |
| "epoch": 0.337888198757764, | |
| "grad_norm": 5.923374176025391, | |
| "learning_rate": 0.0001831304347826087, | |
| "loss": 1.5168, | |
| "step": 1360 | |
| }, | |
| { | |
| "epoch": 0.3403726708074534, | |
| "grad_norm": 7.103471279144287, | |
| "learning_rate": 0.00018300621118012424, | |
| "loss": 1.5021, | |
| "step": 1370 | |
| }, | |
| { | |
| "epoch": 0.34285714285714286, | |
| "grad_norm": 7.775028228759766, | |
| "learning_rate": 0.00018288198757763976, | |
| "loss": 1.5028, | |
| "step": 1380 | |
| }, | |
| { | |
| "epoch": 0.3453416149068323, | |
| "grad_norm": 5.6988606452941895, | |
| "learning_rate": 0.0001827577639751553, | |
| "loss": 1.556, | |
| "step": 1390 | |
| }, | |
| { | |
| "epoch": 0.34782608695652173, | |
| "grad_norm": 7.056687831878662, | |
| "learning_rate": 0.00018263354037267082, | |
| "loss": 1.3895, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 0.34782608695652173, | |
| "eval_accuracy": 0.6587168881457361, | |
| "eval_loss": 1.4178403615951538, | |
| "eval_runtime": 88.3555, | |
| "eval_samples_per_second": 128.606, | |
| "eval_steps_per_second": 16.083, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 0.35031055900621116, | |
| "grad_norm": 8.281564712524414, | |
| "learning_rate": 0.00018250931677018633, | |
| "loss": 1.5364, | |
| "step": 1410 | |
| }, | |
| { | |
| "epoch": 0.3527950310559006, | |
| "grad_norm": 6.474056243896484, | |
| "learning_rate": 0.00018238509316770188, | |
| "loss": 1.6628, | |
| "step": 1420 | |
| }, | |
| { | |
| "epoch": 0.3552795031055901, | |
| "grad_norm": 7.75063943862915, | |
| "learning_rate": 0.0001822608695652174, | |
| "loss": 1.4784, | |
| "step": 1430 | |
| }, | |
| { | |
| "epoch": 0.3577639751552795, | |
| "grad_norm": 6.833581447601318, | |
| "learning_rate": 0.0001821366459627329, | |
| "loss": 1.4988, | |
| "step": 1440 | |
| }, | |
| { | |
| "epoch": 0.36024844720496896, | |
| "grad_norm": 7.43401575088501, | |
| "learning_rate": 0.00018201242236024845, | |
| "loss": 1.4361, | |
| "step": 1450 | |
| }, | |
| { | |
| "epoch": 0.3627329192546584, | |
| "grad_norm": 5.032355308532715, | |
| "learning_rate": 0.000181888198757764, | |
| "loss": 1.3549, | |
| "step": 1460 | |
| }, | |
| { | |
| "epoch": 0.3652173913043478, | |
| "grad_norm": 9.350013732910156, | |
| "learning_rate": 0.0001817639751552795, | |
| "loss": 1.4264, | |
| "step": 1470 | |
| }, | |
| { | |
| "epoch": 0.36770186335403726, | |
| "grad_norm": 9.7288818359375, | |
| "learning_rate": 0.00018163975155279505, | |
| "loss": 1.5719, | |
| "step": 1480 | |
| }, | |
| { | |
| "epoch": 0.3701863354037267, | |
| "grad_norm": 9.518999099731445, | |
| "learning_rate": 0.00018151552795031057, | |
| "loss": 1.6384, | |
| "step": 1490 | |
| }, | |
| { | |
| "epoch": 0.37267080745341613, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00018140372670807456, | |
| "loss": 1.5497, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 0.37267080745341613, | |
| "eval_accuracy": 0.6860864208395671, | |
| "eval_loss": 1.304831624031067, | |
| "eval_runtime": 87.6832, | |
| "eval_samples_per_second": 129.592, | |
| "eval_steps_per_second": 16.206, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 0.37515527950310557, | |
| "grad_norm": 7.9868292808532715, | |
| "learning_rate": 0.00018127950310559008, | |
| "loss": 1.3945, | |
| "step": 1510 | |
| }, | |
| { | |
| "epoch": 0.37763975155279506, | |
| "grad_norm": 5.725738525390625, | |
| "learning_rate": 0.0001811552795031056, | |
| "loss": 1.7253, | |
| "step": 1520 | |
| }, | |
| { | |
| "epoch": 0.3801242236024845, | |
| "grad_norm": 7.441699028015137, | |
| "learning_rate": 0.00018103105590062114, | |
| "loss": 1.4803, | |
| "step": 1530 | |
| }, | |
| { | |
| "epoch": 0.3826086956521739, | |
| "grad_norm": 8.466215133666992, | |
| "learning_rate": 0.00018090683229813665, | |
| "loss": 1.4203, | |
| "step": 1540 | |
| }, | |
| { | |
| "epoch": 0.38509316770186336, | |
| "grad_norm": 6.456714630126953, | |
| "learning_rate": 0.00018078260869565217, | |
| "loss": 1.6594, | |
| "step": 1550 | |
| }, | |
| { | |
| "epoch": 0.3875776397515528, | |
| "grad_norm": 7.831303596496582, | |
| "learning_rate": 0.0001806583850931677, | |
| "loss": 1.4667, | |
| "step": 1560 | |
| }, | |
| { | |
| "epoch": 0.39006211180124223, | |
| "grad_norm": 5.758781909942627, | |
| "learning_rate": 0.00018053416149068323, | |
| "loss": 1.651, | |
| "step": 1570 | |
| }, | |
| { | |
| "epoch": 0.39254658385093166, | |
| "grad_norm": 8.013723373413086, | |
| "learning_rate": 0.00018040993788819877, | |
| "loss": 1.3823, | |
| "step": 1580 | |
| }, | |
| { | |
| "epoch": 0.3950310559006211, | |
| "grad_norm": 4.54691219329834, | |
| "learning_rate": 0.00018028571428571432, | |
| "loss": 1.6822, | |
| "step": 1590 | |
| }, | |
| { | |
| "epoch": 0.39751552795031053, | |
| "grad_norm": 5.699431419372559, | |
| "learning_rate": 0.00018016149068322983, | |
| "loss": 1.3327, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 0.39751552795031053, | |
| "eval_accuracy": 0.6713895978174778, | |
| "eval_loss": 1.3360953330993652, | |
| "eval_runtime": 87.1032, | |
| "eval_samples_per_second": 130.454, | |
| "eval_steps_per_second": 16.314, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "grad_norm": 4.3417205810546875, | |
| "learning_rate": 0.00018003726708074535, | |
| "loss": 1.5109, | |
| "step": 1610 | |
| }, | |
| { | |
| "epoch": 0.40248447204968946, | |
| "grad_norm": 7.195901870727539, | |
| "learning_rate": 0.0001799130434782609, | |
| "loss": 1.4802, | |
| "step": 1620 | |
| }, | |
| { | |
| "epoch": 0.4049689440993789, | |
| "grad_norm": 8.806529998779297, | |
| "learning_rate": 0.0001797888198757764, | |
| "loss": 1.5731, | |
| "step": 1630 | |
| }, | |
| { | |
| "epoch": 0.4074534161490683, | |
| "grad_norm": 6.9273834228515625, | |
| "learning_rate": 0.00017966459627329192, | |
| "loss": 1.5988, | |
| "step": 1640 | |
| }, | |
| { | |
| "epoch": 0.40993788819875776, | |
| "grad_norm": 5.9617838859558105, | |
| "learning_rate": 0.00017954037267080747, | |
| "loss": 1.6041, | |
| "step": 1650 | |
| }, | |
| { | |
| "epoch": 0.4124223602484472, | |
| "grad_norm": 5.656233787536621, | |
| "learning_rate": 0.00017941614906832298, | |
| "loss": 1.6649, | |
| "step": 1660 | |
| }, | |
| { | |
| "epoch": 0.41490683229813663, | |
| "grad_norm": 5.794583797454834, | |
| "learning_rate": 0.00017929192546583853, | |
| "loss": 1.5536, | |
| "step": 1670 | |
| }, | |
| { | |
| "epoch": 0.41739130434782606, | |
| "grad_norm": 7.5949320793151855, | |
| "learning_rate": 0.00017916770186335404, | |
| "loss": 1.7431, | |
| "step": 1680 | |
| }, | |
| { | |
| "epoch": 0.41987577639751555, | |
| "grad_norm": 4.496397972106934, | |
| "learning_rate": 0.0001790434782608696, | |
| "loss": 1.6657, | |
| "step": 1690 | |
| }, | |
| { | |
| "epoch": 0.422360248447205, | |
| "grad_norm": 5.932600498199463, | |
| "learning_rate": 0.0001789192546583851, | |
| "loss": 1.53, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 0.422360248447205, | |
| "eval_accuracy": 0.6697175041802341, | |
| "eval_loss": 1.3424873352050781, | |
| "eval_runtime": 86.0547, | |
| "eval_samples_per_second": 132.044, | |
| "eval_steps_per_second": 16.513, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 0.4248447204968944, | |
| "grad_norm": 5.496968746185303, | |
| "learning_rate": 0.00017879503105590062, | |
| "loss": 1.5811, | |
| "step": 1710 | |
| }, | |
| { | |
| "epoch": 0.42732919254658386, | |
| "grad_norm": 5.838241100311279, | |
| "learning_rate": 0.00017867080745341616, | |
| "loss": 1.2809, | |
| "step": 1720 | |
| }, | |
| { | |
| "epoch": 0.4298136645962733, | |
| "grad_norm": 8.081803321838379, | |
| "learning_rate": 0.00017854658385093168, | |
| "loss": 1.5387, | |
| "step": 1730 | |
| }, | |
| { | |
| "epoch": 0.4322981366459627, | |
| "grad_norm": 5.952935218811035, | |
| "learning_rate": 0.0001784223602484472, | |
| "loss": 1.5652, | |
| "step": 1740 | |
| }, | |
| { | |
| "epoch": 0.43478260869565216, | |
| "grad_norm": 8.004572868347168, | |
| "learning_rate": 0.00017829813664596274, | |
| "loss": 1.4191, | |
| "step": 1750 | |
| }, | |
| { | |
| "epoch": 0.4372670807453416, | |
| "grad_norm": 7.268871784210205, | |
| "learning_rate": 0.00017817391304347828, | |
| "loss": 1.2636, | |
| "step": 1760 | |
| }, | |
| { | |
| "epoch": 0.43975155279503103, | |
| "grad_norm": 6.050431251525879, | |
| "learning_rate": 0.0001780496894409938, | |
| "loss": 1.3059, | |
| "step": 1770 | |
| }, | |
| { | |
| "epoch": 0.4422360248447205, | |
| "grad_norm": 6.983301639556885, | |
| "learning_rate": 0.00017792546583850934, | |
| "loss": 1.6516, | |
| "step": 1780 | |
| }, | |
| { | |
| "epoch": 0.44472049689440996, | |
| "grad_norm": 11.398016929626465, | |
| "learning_rate": 0.00017780124223602486, | |
| "loss": 1.3813, | |
| "step": 1790 | |
| }, | |
| { | |
| "epoch": 0.4472049689440994, | |
| "grad_norm": 7.321614742279053, | |
| "learning_rate": 0.00017767701863354038, | |
| "loss": 1.538, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 0.4472049689440994, | |
| "eval_accuracy": 0.6641731936988471, | |
| "eval_loss": 1.3452919721603394, | |
| "eval_runtime": 88.8223, | |
| "eval_samples_per_second": 127.93, | |
| "eval_steps_per_second": 15.998, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 0.4496894409937888, | |
| "grad_norm": 3.871507167816162, | |
| "learning_rate": 0.00017755279503105592, | |
| "loss": 1.2088, | |
| "step": 1810 | |
| }, | |
| { | |
| "epoch": 0.45217391304347826, | |
| "grad_norm": 5.824620723724365, | |
| "learning_rate": 0.00017742857142857144, | |
| "loss": 1.5872, | |
| "step": 1820 | |
| }, | |
| { | |
| "epoch": 0.4546583850931677, | |
| "grad_norm": 6.564426422119141, | |
| "learning_rate": 0.00017730434782608695, | |
| "loss": 1.3216, | |
| "step": 1830 | |
| }, | |
| { | |
| "epoch": 0.45714285714285713, | |
| "grad_norm": 6.470206260681152, | |
| "learning_rate": 0.0001771801242236025, | |
| "loss": 1.2494, | |
| "step": 1840 | |
| }, | |
| { | |
| "epoch": 0.45962732919254656, | |
| "grad_norm": 9.240300178527832, | |
| "learning_rate": 0.00017705590062111804, | |
| "loss": 1.7409, | |
| "step": 1850 | |
| }, | |
| { | |
| "epoch": 0.462111801242236, | |
| "grad_norm": 8.439705848693848, | |
| "learning_rate": 0.00017693167701863356, | |
| "loss": 1.5075, | |
| "step": 1860 | |
| }, | |
| { | |
| "epoch": 0.4645962732919255, | |
| "grad_norm": 6.919085502624512, | |
| "learning_rate": 0.00017680745341614907, | |
| "loss": 1.4267, | |
| "step": 1870 | |
| }, | |
| { | |
| "epoch": 0.4670807453416149, | |
| "grad_norm": 5.995780944824219, | |
| "learning_rate": 0.00017668322981366461, | |
| "loss": 1.5704, | |
| "step": 1880 | |
| }, | |
| { | |
| "epoch": 0.46956521739130436, | |
| "grad_norm": 6.788804531097412, | |
| "learning_rate": 0.00017655900621118013, | |
| "loss": 1.2365, | |
| "step": 1890 | |
| }, | |
| { | |
| "epoch": 0.4720496894409938, | |
| "grad_norm": 6.92108678817749, | |
| "learning_rate": 0.00017643478260869565, | |
| "loss": 1.5056, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 0.4720496894409938, | |
| "eval_accuracy": 0.6783419871512805, | |
| "eval_loss": 1.2742019891738892, | |
| "eval_runtime": 87.1221, | |
| "eval_samples_per_second": 130.426, | |
| "eval_steps_per_second": 16.31, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 0.4745341614906832, | |
| "grad_norm": 8.66635513305664, | |
| "learning_rate": 0.0001763105590062112, | |
| "loss": 1.547, | |
| "step": 1910 | |
| }, | |
| { | |
| "epoch": 0.47701863354037266, | |
| "grad_norm": 5.245086193084717, | |
| "learning_rate": 0.0001761863354037267, | |
| "loss": 1.441, | |
| "step": 1920 | |
| }, | |
| { | |
| "epoch": 0.4795031055900621, | |
| "grad_norm": 6.949382781982422, | |
| "learning_rate": 0.00017606211180124222, | |
| "loss": 1.5288, | |
| "step": 1930 | |
| }, | |
| { | |
| "epoch": 0.48198757763975153, | |
| "grad_norm": 9.583054542541504, | |
| "learning_rate": 0.0001759378881987578, | |
| "loss": 1.1384, | |
| "step": 1940 | |
| }, | |
| { | |
| "epoch": 0.484472049689441, | |
| "grad_norm": 5.83560037612915, | |
| "learning_rate": 0.0001758136645962733, | |
| "loss": 1.2672, | |
| "step": 1950 | |
| }, | |
| { | |
| "epoch": 0.48695652173913045, | |
| "grad_norm": 6.719588756561279, | |
| "learning_rate": 0.00017568944099378883, | |
| "loss": 1.4713, | |
| "step": 1960 | |
| }, | |
| { | |
| "epoch": 0.4894409937888199, | |
| "grad_norm": 5.651910781860352, | |
| "learning_rate": 0.00017556521739130437, | |
| "loss": 1.6415, | |
| "step": 1970 | |
| }, | |
| { | |
| "epoch": 0.4919254658385093, | |
| "grad_norm": 5.4755706787109375, | |
| "learning_rate": 0.0001754409937888199, | |
| "loss": 1.4491, | |
| "step": 1980 | |
| }, | |
| { | |
| "epoch": 0.49440993788819876, | |
| "grad_norm": 4.658782482147217, | |
| "learning_rate": 0.0001753167701863354, | |
| "loss": 1.379, | |
| "step": 1990 | |
| }, | |
| { | |
| "epoch": 0.4968944099378882, | |
| "grad_norm": 7.050572872161865, | |
| "learning_rate": 0.00017519254658385095, | |
| "loss": 1.2728, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 0.4968944099378882, | |
| "eval_accuracy": 0.7044794508492476, | |
| "eval_loss": 1.1779495477676392, | |
| "eval_runtime": 87.0589, | |
| "eval_samples_per_second": 130.521, | |
| "eval_steps_per_second": 16.322, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 0.4993788819875776, | |
| "grad_norm": 7.556181907653809, | |
| "learning_rate": 0.00017506832298136646, | |
| "loss": 1.5583, | |
| "step": 2010 | |
| }, | |
| { | |
| "epoch": 0.5018633540372671, | |
| "grad_norm": 7.117518901824951, | |
| "learning_rate": 0.00017494409937888198, | |
| "loss": 1.6017, | |
| "step": 2020 | |
| }, | |
| { | |
| "epoch": 0.5043478260869565, | |
| "grad_norm": 6.174365043640137, | |
| "learning_rate": 0.00017481987577639752, | |
| "loss": 1.4675, | |
| "step": 2030 | |
| }, | |
| { | |
| "epoch": 0.506832298136646, | |
| "grad_norm": 6.404329299926758, | |
| "learning_rate": 0.00017469565217391307, | |
| "loss": 1.5378, | |
| "step": 2040 | |
| }, | |
| { | |
| "epoch": 0.5093167701863354, | |
| "grad_norm": 8.110492706298828, | |
| "learning_rate": 0.00017457142857142858, | |
| "loss": 1.488, | |
| "step": 2050 | |
| }, | |
| { | |
| "epoch": 0.5118012422360249, | |
| "grad_norm": 3.424097776412964, | |
| "learning_rate": 0.0001744472049689441, | |
| "loss": 1.2121, | |
| "step": 2060 | |
| }, | |
| { | |
| "epoch": 0.5142857142857142, | |
| "grad_norm": 5.714499473571777, | |
| "learning_rate": 0.00017432298136645964, | |
| "loss": 1.2844, | |
| "step": 2070 | |
| }, | |
| { | |
| "epoch": 0.5167701863354037, | |
| "grad_norm": 8.632834434509277, | |
| "learning_rate": 0.00017419875776397516, | |
| "loss": 1.2707, | |
| "step": 2080 | |
| }, | |
| { | |
| "epoch": 0.5192546583850932, | |
| "grad_norm": 7.8250956535339355, | |
| "learning_rate": 0.00017407453416149067, | |
| "loss": 1.4057, | |
| "step": 2090 | |
| }, | |
| { | |
| "epoch": 0.5217391304347826, | |
| "grad_norm": 6.396978855133057, | |
| "learning_rate": 0.00017395031055900622, | |
| "loss": 1.1734, | |
| "step": 2100 | |
| }, | |
| { | |
| "epoch": 0.5217391304347826, | |
| "eval_accuracy": 0.680806125143008, | |
| "eval_loss": 1.2630212306976318, | |
| "eval_runtime": 87.1325, | |
| "eval_samples_per_second": 130.411, | |
| "eval_steps_per_second": 16.309, | |
| "step": 2100 | |
| }, | |
| { | |
| "epoch": 0.5242236024844721, | |
| "grad_norm": 4.478389739990234, | |
| "learning_rate": 0.00017382608695652173, | |
| "loss": 1.6825, | |
| "step": 2110 | |
| }, | |
| { | |
| "epoch": 0.5267080745341615, | |
| "grad_norm": 5.685409069061279, | |
| "learning_rate": 0.00017370186335403728, | |
| "loss": 1.1221, | |
| "step": 2120 | |
| }, | |
| { | |
| "epoch": 0.529192546583851, | |
| "grad_norm": 7.367899417877197, | |
| "learning_rate": 0.00017357763975155282, | |
| "loss": 1.537, | |
| "step": 2130 | |
| }, | |
| { | |
| "epoch": 0.5316770186335403, | |
| "grad_norm": 8.052840232849121, | |
| "learning_rate": 0.00017345341614906834, | |
| "loss": 1.4139, | |
| "step": 2140 | |
| }, | |
| { | |
| "epoch": 0.5341614906832298, | |
| "grad_norm": 6.265495777130127, | |
| "learning_rate": 0.00017332919254658385, | |
| "loss": 1.2073, | |
| "step": 2150 | |
| }, | |
| { | |
| "epoch": 0.5366459627329192, | |
| "grad_norm": 6.785367488861084, | |
| "learning_rate": 0.0001732049689440994, | |
| "loss": 1.4182, | |
| "step": 2160 | |
| }, | |
| { | |
| "epoch": 0.5391304347826087, | |
| "grad_norm": 7.20573091506958, | |
| "learning_rate": 0.00017308074534161491, | |
| "loss": 1.3468, | |
| "step": 2170 | |
| }, | |
| { | |
| "epoch": 0.5416149068322982, | |
| "grad_norm": 9.518648147583008, | |
| "learning_rate": 0.00017295652173913043, | |
| "loss": 1.393, | |
| "step": 2180 | |
| }, | |
| { | |
| "epoch": 0.5440993788819876, | |
| "grad_norm": 8.566499710083008, | |
| "learning_rate": 0.00017283229813664597, | |
| "loss": 1.414, | |
| "step": 2190 | |
| }, | |
| { | |
| "epoch": 0.546583850931677, | |
| "grad_norm": 9.845856666564941, | |
| "learning_rate": 0.0001727080745341615, | |
| "loss": 1.527, | |
| "step": 2200 | |
| }, | |
| { | |
| "epoch": 0.546583850931677, | |
| "eval_accuracy": 0.702279327642348, | |
| "eval_loss": 1.1809625625610352, | |
| "eval_runtime": 86.1061, | |
| "eval_samples_per_second": 131.965, | |
| "eval_steps_per_second": 16.503, | |
| "step": 2200 | |
| }, | |
| { | |
| "epoch": 0.5490683229813664, | |
| "grad_norm": 9.88825798034668, | |
| "learning_rate": 0.00017258385093167703, | |
| "loss": 1.3398, | |
| "step": 2210 | |
| }, | |
| { | |
| "epoch": 0.5515527950310559, | |
| "grad_norm": 4.545001029968262, | |
| "learning_rate": 0.00017245962732919255, | |
| "loss": 1.7528, | |
| "step": 2220 | |
| }, | |
| { | |
| "epoch": 0.5540372670807453, | |
| "grad_norm": 11.04814338684082, | |
| "learning_rate": 0.0001723354037267081, | |
| "loss": 1.2975, | |
| "step": 2230 | |
| }, | |
| { | |
| "epoch": 0.5565217391304348, | |
| "grad_norm": 6.28684139251709, | |
| "learning_rate": 0.0001722111801242236, | |
| "loss": 1.4086, | |
| "step": 2240 | |
| }, | |
| { | |
| "epoch": 0.5590062111801242, | |
| "grad_norm": 7.978612422943115, | |
| "learning_rate": 0.00017208695652173915, | |
| "loss": 1.4632, | |
| "step": 2250 | |
| }, | |
| { | |
| "epoch": 0.5614906832298137, | |
| "grad_norm": 5.173329830169678, | |
| "learning_rate": 0.00017196273291925467, | |
| "loss": 1.5102, | |
| "step": 2260 | |
| }, | |
| { | |
| "epoch": 0.5639751552795031, | |
| "grad_norm": 5.533884048461914, | |
| "learning_rate": 0.00017183850931677019, | |
| "loss": 1.4573, | |
| "step": 2270 | |
| }, | |
| { | |
| "epoch": 0.5664596273291925, | |
| "grad_norm": 7.535440444946289, | |
| "learning_rate": 0.00017171428571428573, | |
| "loss": 1.6981, | |
| "step": 2280 | |
| }, | |
| { | |
| "epoch": 0.568944099378882, | |
| "grad_norm": 7.52562952041626, | |
| "learning_rate": 0.00017159006211180125, | |
| "loss": 1.2332, | |
| "step": 2290 | |
| }, | |
| { | |
| "epoch": 0.5714285714285714, | |
| "grad_norm": 6.707581043243408, | |
| "learning_rate": 0.00017146583850931676, | |
| "loss": 1.3873, | |
| "step": 2300 | |
| }, | |
| { | |
| "epoch": 0.5714285714285714, | |
| "eval_accuracy": 0.7039514212795916, | |
| "eval_loss": 1.1831145286560059, | |
| "eval_runtime": 85.9731, | |
| "eval_samples_per_second": 132.169, | |
| "eval_steps_per_second": 16.528, | |
| "step": 2300 | |
| }, | |
| { | |
| "epoch": 0.5739130434782609, | |
| "grad_norm": 9.480440139770508, | |
| "learning_rate": 0.0001713416149068323, | |
| "loss": 1.576, | |
| "step": 2310 | |
| }, | |
| { | |
| "epoch": 0.5763975155279503, | |
| "grad_norm": 9.64328384399414, | |
| "learning_rate": 0.00017121739130434785, | |
| "loss": 1.4841, | |
| "step": 2320 | |
| }, | |
| { | |
| "epoch": 0.5788819875776398, | |
| "grad_norm": 6.3002610206604, | |
| "learning_rate": 0.00017109316770186337, | |
| "loss": 1.2611, | |
| "step": 2330 | |
| }, | |
| { | |
| "epoch": 0.5813664596273292, | |
| "grad_norm": 7.7264275550842285, | |
| "learning_rate": 0.00017096894409937888, | |
| "loss": 1.4146, | |
| "step": 2340 | |
| }, | |
| { | |
| "epoch": 0.5838509316770186, | |
| "grad_norm": 6.963201999664307, | |
| "learning_rate": 0.00017084472049689443, | |
| "loss": 1.4925, | |
| "step": 2350 | |
| }, | |
| { | |
| "epoch": 0.5863354037267081, | |
| "grad_norm": 6.235733985900879, | |
| "learning_rate": 0.00017072049689440994, | |
| "loss": 1.4015, | |
| "step": 2360 | |
| }, | |
| { | |
| "epoch": 0.5888198757763975, | |
| "grad_norm": 7.08598518371582, | |
| "learning_rate": 0.00017059627329192546, | |
| "loss": 1.3037, | |
| "step": 2370 | |
| }, | |
| { | |
| "epoch": 0.591304347826087, | |
| "grad_norm": 6.619434356689453, | |
| "learning_rate": 0.000170472049689441, | |
| "loss": 1.6309, | |
| "step": 2380 | |
| }, | |
| { | |
| "epoch": 0.5937888198757764, | |
| "grad_norm": 6.332421779632568, | |
| "learning_rate": 0.00017034782608695652, | |
| "loss": 1.3557, | |
| "step": 2390 | |
| }, | |
| { | |
| "epoch": 0.5962732919254659, | |
| "grad_norm": 6.135610580444336, | |
| "learning_rate": 0.00017022360248447206, | |
| "loss": 1.3545, | |
| "step": 2400 | |
| }, | |
| { | |
| "epoch": 0.5962732919254659, | |
| "eval_accuracy": 0.7001672093637243, | |
| "eval_loss": 1.1835651397705078, | |
| "eval_runtime": 86.0365, | |
| "eval_samples_per_second": 132.072, | |
| "eval_steps_per_second": 16.516, | |
| "step": 2400 | |
| }, | |
| { | |
| "epoch": 0.5987577639751552, | |
| "grad_norm": 9.877408981323242, | |
| "learning_rate": 0.0001700993788819876, | |
| "loss": 1.2388, | |
| "step": 2410 | |
| }, | |
| { | |
| "epoch": 0.6012422360248447, | |
| "grad_norm": 6.421914100646973, | |
| "learning_rate": 0.00016997515527950312, | |
| "loss": 1.4432, | |
| "step": 2420 | |
| }, | |
| { | |
| "epoch": 0.6037267080745342, | |
| "grad_norm": 5.323935508728027, | |
| "learning_rate": 0.00016985093167701864, | |
| "loss": 1.3144, | |
| "step": 2430 | |
| }, | |
| { | |
| "epoch": 0.6062111801242236, | |
| "grad_norm": 12.48570728302002, | |
| "learning_rate": 0.00016972670807453418, | |
| "loss": 1.5679, | |
| "step": 2440 | |
| }, | |
| { | |
| "epoch": 0.6086956521739131, | |
| "grad_norm": 6.593123912811279, | |
| "learning_rate": 0.0001696024844720497, | |
| "loss": 1.2275, | |
| "step": 2450 | |
| }, | |
| { | |
| "epoch": 0.6111801242236025, | |
| "grad_norm": 6.936142444610596, | |
| "learning_rate": 0.0001694782608695652, | |
| "loss": 1.1774, | |
| "step": 2460 | |
| }, | |
| { | |
| "epoch": 0.613664596273292, | |
| "grad_norm": 7.791112899780273, | |
| "learning_rate": 0.00016935403726708076, | |
| "loss": 1.6099, | |
| "step": 2470 | |
| }, | |
| { | |
| "epoch": 0.6161490683229813, | |
| "grad_norm": 6.408988952636719, | |
| "learning_rate": 0.00016922981366459627, | |
| "loss": 1.4584, | |
| "step": 2480 | |
| }, | |
| { | |
| "epoch": 0.6186335403726708, | |
| "grad_norm": 8.7936429977417, | |
| "learning_rate": 0.00016910559006211182, | |
| "loss": 1.3348, | |
| "step": 2490 | |
| }, | |
| { | |
| "epoch": 0.6211180124223602, | |
| "grad_norm": 4.882345676422119, | |
| "learning_rate": 0.00016898136645962733, | |
| "loss": 1.4842, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 0.6211180124223602, | |
| "eval_accuracy": 0.7129279239637419, | |
| "eval_loss": 1.1441054344177246, | |
| "eval_runtime": 87.2725, | |
| "eval_samples_per_second": 130.201, | |
| "eval_steps_per_second": 16.282, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 0.6236024844720497, | |
| "grad_norm": 7.860159873962402, | |
| "learning_rate": 0.00016885714285714288, | |
| "loss": 1.4621, | |
| "step": 2510 | |
| }, | |
| { | |
| "epoch": 0.6260869565217392, | |
| "grad_norm": 5.460740089416504, | |
| "learning_rate": 0.0001687329192546584, | |
| "loss": 1.4405, | |
| "step": 2520 | |
| }, | |
| { | |
| "epoch": 0.6285714285714286, | |
| "grad_norm": 9.96655559539795, | |
| "learning_rate": 0.0001686086956521739, | |
| "loss": 1.5311, | |
| "step": 2530 | |
| }, | |
| { | |
| "epoch": 0.631055900621118, | |
| "grad_norm": 7.057131767272949, | |
| "learning_rate": 0.00016848447204968945, | |
| "loss": 1.4878, | |
| "step": 2540 | |
| }, | |
| { | |
| "epoch": 0.6335403726708074, | |
| "grad_norm": 6.061126708984375, | |
| "learning_rate": 0.00016836024844720497, | |
| "loss": 1.2133, | |
| "step": 2550 | |
| }, | |
| { | |
| "epoch": 0.6360248447204969, | |
| "grad_norm": 7.528930187225342, | |
| "learning_rate": 0.00016823602484472049, | |
| "loss": 1.4039, | |
| "step": 2560 | |
| }, | |
| { | |
| "epoch": 0.6385093167701863, | |
| "grad_norm": 4.734296798706055, | |
| "learning_rate": 0.00016811180124223603, | |
| "loss": 1.3136, | |
| "step": 2570 | |
| }, | |
| { | |
| "epoch": 0.6409937888198758, | |
| "grad_norm": 10.213302612304688, | |
| "learning_rate": 0.00016798757763975157, | |
| "loss": 1.0263, | |
| "step": 2580 | |
| }, | |
| { | |
| "epoch": 0.6434782608695652, | |
| "grad_norm": 7.67819881439209, | |
| "learning_rate": 0.0001678633540372671, | |
| "loss": 1.5417, | |
| "step": 2590 | |
| }, | |
| { | |
| "epoch": 0.6459627329192547, | |
| "grad_norm": 10.029603958129883, | |
| "learning_rate": 0.00016773913043478263, | |
| "loss": 1.1974, | |
| "step": 2600 | |
| }, | |
| { | |
| "epoch": 0.6459627329192547, | |
| "eval_accuracy": 0.7154800668837454, | |
| "eval_loss": 1.1230041980743408, | |
| "eval_runtime": 86.065, | |
| "eval_samples_per_second": 132.028, | |
| "eval_steps_per_second": 16.511, | |
| "step": 2600 | |
| }, | |
| { | |
| "epoch": 0.6484472049689441, | |
| "grad_norm": 12.451225280761719, | |
| "learning_rate": 0.00016761490683229815, | |
| "loss": 1.3637, | |
| "step": 2610 | |
| }, | |
| { | |
| "epoch": 0.6509316770186335, | |
| "grad_norm": 8.255215644836426, | |
| "learning_rate": 0.00016749068322981366, | |
| "loss": 1.3378, | |
| "step": 2620 | |
| }, | |
| { | |
| "epoch": 0.653416149068323, | |
| "grad_norm": 5.389623165130615, | |
| "learning_rate": 0.0001673664596273292, | |
| "loss": 1.3536, | |
| "step": 2630 | |
| }, | |
| { | |
| "epoch": 0.6559006211180124, | |
| "grad_norm": 7.741150856018066, | |
| "learning_rate": 0.00016724223602484472, | |
| "loss": 1.3554, | |
| "step": 2640 | |
| }, | |
| { | |
| "epoch": 0.6583850931677019, | |
| "grad_norm": 5.791994094848633, | |
| "learning_rate": 0.00016711801242236024, | |
| "loss": 1.1869, | |
| "step": 2650 | |
| }, | |
| { | |
| "epoch": 0.6608695652173913, | |
| "grad_norm": 6.631389141082764, | |
| "learning_rate": 0.00016699378881987578, | |
| "loss": 1.2872, | |
| "step": 2660 | |
| }, | |
| { | |
| "epoch": 0.6633540372670808, | |
| "grad_norm": 89.58702087402344, | |
| "learning_rate": 0.00016686956521739133, | |
| "loss": 1.449, | |
| "step": 2670 | |
| }, | |
| { | |
| "epoch": 0.6658385093167701, | |
| "grad_norm": 9.893950462341309, | |
| "learning_rate": 0.00016674534161490684, | |
| "loss": 1.3797, | |
| "step": 2680 | |
| }, | |
| { | |
| "epoch": 0.6683229813664596, | |
| "grad_norm": 8.019680976867676, | |
| "learning_rate": 0.00016662111801242236, | |
| "loss": 1.659, | |
| "step": 2690 | |
| }, | |
| { | |
| "epoch": 0.6708074534161491, | |
| "grad_norm": 5.2843499183654785, | |
| "learning_rate": 0.0001664968944099379, | |
| "loss": 1.4204, | |
| "step": 2700 | |
| }, | |
| { | |
| "epoch": 0.6708074534161491, | |
| "eval_accuracy": 0.7001672093637243, | |
| "eval_loss": 1.1766126155853271, | |
| "eval_runtime": 86.8872, | |
| "eval_samples_per_second": 130.779, | |
| "eval_steps_per_second": 16.355, | |
| "step": 2700 | |
| }, | |
| { | |
| "epoch": 0.6732919254658385, | |
| "grad_norm": 7.297257423400879, | |
| "learning_rate": 0.00016637267080745342, | |
| "loss": 1.2366, | |
| "step": 2710 | |
| }, | |
| { | |
| "epoch": 0.675776397515528, | |
| "grad_norm": 6.853038787841797, | |
| "learning_rate": 0.00016624844720496894, | |
| "loss": 1.2613, | |
| "step": 2720 | |
| }, | |
| { | |
| "epoch": 0.6782608695652174, | |
| "grad_norm": 10.860264778137207, | |
| "learning_rate": 0.00016612422360248448, | |
| "loss": 1.4677, | |
| "step": 2730 | |
| }, | |
| { | |
| "epoch": 0.6807453416149069, | |
| "grad_norm": 7.402227878570557, | |
| "learning_rate": 0.000166, | |
| "loss": 1.324, | |
| "step": 2740 | |
| }, | |
| { | |
| "epoch": 0.6832298136645962, | |
| "grad_norm": 7.668711185455322, | |
| "learning_rate": 0.0001658757763975155, | |
| "loss": 1.3704, | |
| "step": 2750 | |
| }, | |
| { | |
| "epoch": 0.6857142857142857, | |
| "grad_norm": 7.363369464874268, | |
| "learning_rate": 0.00016575155279503108, | |
| "loss": 1.3618, | |
| "step": 2760 | |
| }, | |
| { | |
| "epoch": 0.6881987577639752, | |
| "grad_norm": 4.960102081298828, | |
| "learning_rate": 0.0001656273291925466, | |
| "loss": 1.2222, | |
| "step": 2770 | |
| }, | |
| { | |
| "epoch": 0.6906832298136646, | |
| "grad_norm": 6.821535110473633, | |
| "learning_rate": 0.00016550310559006212, | |
| "loss": 1.4079, | |
| "step": 2780 | |
| }, | |
| { | |
| "epoch": 0.6931677018633541, | |
| "grad_norm": 5.65289306640625, | |
| "learning_rate": 0.00016537888198757766, | |
| "loss": 1.4243, | |
| "step": 2790 | |
| }, | |
| { | |
| "epoch": 0.6956521739130435, | |
| "grad_norm": 6.178348064422607, | |
| "learning_rate": 0.00016525465838509318, | |
| "loss": 1.152, | |
| "step": 2800 | |
| }, | |
| { | |
| "epoch": 0.6956521739130435, | |
| "eval_accuracy": 0.6949749185954414, | |
| "eval_loss": 1.2165684700012207, | |
| "eval_runtime": 85.8436, | |
| "eval_samples_per_second": 132.369, | |
| "eval_steps_per_second": 16.553, | |
| "step": 2800 | |
| }, | |
| { | |
| "epoch": 0.698136645962733, | |
| "grad_norm": 6.465919494628906, | |
| "learning_rate": 0.0001651304347826087, | |
| "loss": 1.3611, | |
| "step": 2810 | |
| }, | |
| { | |
| "epoch": 0.7006211180124223, | |
| "grad_norm": 7.679103374481201, | |
| "learning_rate": 0.00016500621118012424, | |
| "loss": 1.1199, | |
| "step": 2820 | |
| }, | |
| { | |
| "epoch": 0.7031055900621118, | |
| "grad_norm": 4.632389545440674, | |
| "learning_rate": 0.00016488198757763975, | |
| "loss": 1.3998, | |
| "step": 2830 | |
| }, | |
| { | |
| "epoch": 0.7055900621118012, | |
| "grad_norm": 6.801785945892334, | |
| "learning_rate": 0.00016475776397515527, | |
| "loss": 1.2069, | |
| "step": 2840 | |
| }, | |
| { | |
| "epoch": 0.7080745341614907, | |
| "grad_norm": 9.706809997558594, | |
| "learning_rate": 0.0001646335403726708, | |
| "loss": 1.192, | |
| "step": 2850 | |
| }, | |
| { | |
| "epoch": 0.7105590062111802, | |
| "grad_norm": 4.336630344390869, | |
| "learning_rate": 0.00016450931677018636, | |
| "loss": 1.0797, | |
| "step": 2860 | |
| }, | |
| { | |
| "epoch": 0.7130434782608696, | |
| "grad_norm": 7.028838157653809, | |
| "learning_rate": 0.00016438509316770187, | |
| "loss": 1.3934, | |
| "step": 2870 | |
| }, | |
| { | |
| "epoch": 0.715527950310559, | |
| "grad_norm": 7.961177349090576, | |
| "learning_rate": 0.0001642608695652174, | |
| "loss": 1.4124, | |
| "step": 2880 | |
| }, | |
| { | |
| "epoch": 0.7180124223602484, | |
| "grad_norm": 8.568161964416504, | |
| "learning_rate": 0.00016413664596273293, | |
| "loss": 1.3617, | |
| "step": 2890 | |
| }, | |
| { | |
| "epoch": 0.7204968944099379, | |
| "grad_norm": 8.702705383300781, | |
| "learning_rate": 0.00016401242236024845, | |
| "loss": 1.162, | |
| "step": 2900 | |
| }, | |
| { | |
| "epoch": 0.7204968944099379, | |
| "eval_accuracy": 0.7002552142920003, | |
| "eval_loss": 1.167386531829834, | |
| "eval_runtime": 86.3186, | |
| "eval_samples_per_second": 131.64, | |
| "eval_steps_per_second": 16.462, | |
| "step": 2900 | |
| }, | |
| { | |
| "epoch": 0.7229813664596273, | |
| "grad_norm": 5.8269147872924805, | |
| "learning_rate": 0.000163888198757764, | |
| "loss": 1.4158, | |
| "step": 2910 | |
| }, | |
| { | |
| "epoch": 0.7254658385093168, | |
| "grad_norm": 7.1003899574279785, | |
| "learning_rate": 0.0001637639751552795, | |
| "loss": 1.174, | |
| "step": 2920 | |
| }, | |
| { | |
| "epoch": 0.7279503105590062, | |
| "grad_norm": 6.107857704162598, | |
| "learning_rate": 0.00016363975155279502, | |
| "loss": 1.2128, | |
| "step": 2930 | |
| }, | |
| { | |
| "epoch": 0.7304347826086957, | |
| "grad_norm": 6.136083126068115, | |
| "learning_rate": 0.00016351552795031057, | |
| "loss": 1.5222, | |
| "step": 2940 | |
| }, | |
| { | |
| "epoch": 0.7329192546583851, | |
| "grad_norm": 8.518939018249512, | |
| "learning_rate": 0.0001633913043478261, | |
| "loss": 1.4467, | |
| "step": 2950 | |
| }, | |
| { | |
| "epoch": 0.7354037267080745, | |
| "grad_norm": 8.945500373840332, | |
| "learning_rate": 0.00016326708074534163, | |
| "loss": 1.2919, | |
| "step": 2960 | |
| }, | |
| { | |
| "epoch": 0.737888198757764, | |
| "grad_norm": 5.567399978637695, | |
| "learning_rate": 0.00016314285714285714, | |
| "loss": 1.3656, | |
| "step": 2970 | |
| }, | |
| { | |
| "epoch": 0.7403726708074534, | |
| "grad_norm": 6.591121196746826, | |
| "learning_rate": 0.0001630186335403727, | |
| "loss": 1.3927, | |
| "step": 2980 | |
| }, | |
| { | |
| "epoch": 0.7428571428571429, | |
| "grad_norm": 7.108632564544678, | |
| "learning_rate": 0.0001628944099378882, | |
| "loss": 1.2373, | |
| "step": 2990 | |
| }, | |
| { | |
| "epoch": 0.7453416149068323, | |
| "grad_norm": 6.770077705383301, | |
| "learning_rate": 0.00016277018633540372, | |
| "loss": 1.4516, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 0.7453416149068323, | |
| "eval_accuracy": 0.7139839831030538, | |
| "eval_loss": 1.1207355260849, | |
| "eval_runtime": 86.4165, | |
| "eval_samples_per_second": 131.491, | |
| "eval_steps_per_second": 16.444, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 0.7478260869565218, | |
| "grad_norm": 5.914898872375488, | |
| "learning_rate": 0.00016264596273291926, | |
| "loss": 1.2147, | |
| "step": 3010 | |
| }, | |
| { | |
| "epoch": 0.7503105590062111, | |
| "grad_norm": 9.71444320678711, | |
| "learning_rate": 0.00016252173913043478, | |
| "loss": 1.411, | |
| "step": 3020 | |
| }, | |
| { | |
| "epoch": 0.7527950310559006, | |
| "grad_norm": 6.712387561798096, | |
| "learning_rate": 0.00016239751552795032, | |
| "loss": 1.4371, | |
| "step": 3030 | |
| }, | |
| { | |
| "epoch": 0.7552795031055901, | |
| "grad_norm": 4.184564113616943, | |
| "learning_rate": 0.00016227329192546587, | |
| "loss": 1.2996, | |
| "step": 3040 | |
| }, | |
| { | |
| "epoch": 0.7577639751552795, | |
| "grad_norm": 6.321875095367432, | |
| "learning_rate": 0.00016214906832298138, | |
| "loss": 1.2506, | |
| "step": 3050 | |
| }, | |
| { | |
| "epoch": 0.760248447204969, | |
| "grad_norm": 5.48466682434082, | |
| "learning_rate": 0.0001620248447204969, | |
| "loss": 1.1892, | |
| "step": 3060 | |
| }, | |
| { | |
| "epoch": 0.7627329192546584, | |
| "grad_norm": 8.954041481018066, | |
| "learning_rate": 0.00016190062111801244, | |
| "loss": 1.5073, | |
| "step": 3070 | |
| }, | |
| { | |
| "epoch": 0.7652173913043478, | |
| "grad_norm": 6.705496788024902, | |
| "learning_rate": 0.00016177639751552796, | |
| "loss": 1.3815, | |
| "step": 3080 | |
| }, | |
| { | |
| "epoch": 0.7677018633540372, | |
| "grad_norm": 9.638246536254883, | |
| "learning_rate": 0.00016165217391304347, | |
| "loss": 1.4076, | |
| "step": 3090 | |
| }, | |
| { | |
| "epoch": 0.7701863354037267, | |
| "grad_norm": 9.326358795166016, | |
| "learning_rate": 0.00016152795031055902, | |
| "loss": 1.2378, | |
| "step": 3100 | |
| }, | |
| { | |
| "epoch": 0.7701863354037267, | |
| "eval_accuracy": 0.6905746721816421, | |
| "eval_loss": 1.2071986198425293, | |
| "eval_runtime": 86.5208, | |
| "eval_samples_per_second": 131.333, | |
| "eval_steps_per_second": 16.424, | |
| "step": 3100 | |
| }, | |
| { | |
| "epoch": 0.7726708074534161, | |
| "grad_norm": 8.85179328918457, | |
| "learning_rate": 0.00016140372670807453, | |
| "loss": 1.5347, | |
| "step": 3110 | |
| }, | |
| { | |
| "epoch": 0.7751552795031056, | |
| "grad_norm": 6.758512020111084, | |
| "learning_rate": 0.00016127950310559008, | |
| "loss": 1.3171, | |
| "step": 3120 | |
| }, | |
| { | |
| "epoch": 0.7776397515527951, | |
| "grad_norm": 5.798080921173096, | |
| "learning_rate": 0.0001611552795031056, | |
| "loss": 1.2583, | |
| "step": 3130 | |
| }, | |
| { | |
| "epoch": 0.7801242236024845, | |
| "grad_norm": 5.800971984863281, | |
| "learning_rate": 0.00016103105590062114, | |
| "loss": 1.116, | |
| "step": 3140 | |
| }, | |
| { | |
| "epoch": 0.782608695652174, | |
| "grad_norm": 6.780196189880371, | |
| "learning_rate": 0.00016090683229813665, | |
| "loss": 1.3495, | |
| "step": 3150 | |
| }, | |
| { | |
| "epoch": 0.7850931677018633, | |
| "grad_norm": 6.8307719230651855, | |
| "learning_rate": 0.00016078260869565217, | |
| "loss": 1.1167, | |
| "step": 3160 | |
| }, | |
| { | |
| "epoch": 0.7875776397515528, | |
| "grad_norm": 10.045748710632324, | |
| "learning_rate": 0.00016065838509316771, | |
| "loss": 1.1134, | |
| "step": 3170 | |
| }, | |
| { | |
| "epoch": 0.7900621118012422, | |
| "grad_norm": 6.177084922790527, | |
| "learning_rate": 0.00016053416149068323, | |
| "loss": 1.206, | |
| "step": 3180 | |
| }, | |
| { | |
| "epoch": 0.7925465838509317, | |
| "grad_norm": 4.914190292358398, | |
| "learning_rate": 0.00016040993788819875, | |
| "loss": 1.3714, | |
| "step": 3190 | |
| }, | |
| { | |
| "epoch": 0.7950310559006211, | |
| "grad_norm": 7.478468894958496, | |
| "learning_rate": 0.0001602857142857143, | |
| "loss": 0.991, | |
| "step": 3200 | |
| }, | |
| { | |
| "epoch": 0.7950310559006211, | |
| "eval_accuracy": 0.7131039338202939, | |
| "eval_loss": 1.1121686697006226, | |
| "eval_runtime": 86.2088, | |
| "eval_samples_per_second": 131.808, | |
| "eval_steps_per_second": 16.483, | |
| "step": 3200 | |
| }, | |
| { | |
| "epoch": 0.7975155279503106, | |
| "grad_norm": 6.4600982666015625, | |
| "learning_rate": 0.00016016149068322983, | |
| "loss": 1.2865, | |
| "step": 3210 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "grad_norm": 5.785561561584473, | |
| "learning_rate": 0.00016003726708074535, | |
| "loss": 1.4614, | |
| "step": 3220 | |
| }, | |
| { | |
| "epoch": 0.8024844720496894, | |
| "grad_norm": 4.1848015785217285, | |
| "learning_rate": 0.0001599130434782609, | |
| "loss": 1.1712, | |
| "step": 3230 | |
| }, | |
| { | |
| "epoch": 0.8049689440993789, | |
| "grad_norm": 4.002833843231201, | |
| "learning_rate": 0.0001597888198757764, | |
| "loss": 1.3205, | |
| "step": 3240 | |
| }, | |
| { | |
| "epoch": 0.8074534161490683, | |
| "grad_norm": 4.33705997467041, | |
| "learning_rate": 0.00015966459627329193, | |
| "loss": 1.3718, | |
| "step": 3250 | |
| }, | |
| { | |
| "epoch": 0.8099378881987578, | |
| "grad_norm": 6.072953224182129, | |
| "learning_rate": 0.00015954037267080747, | |
| "loss": 1.4363, | |
| "step": 3260 | |
| }, | |
| { | |
| "epoch": 0.8124223602484472, | |
| "grad_norm": 5.311767578125, | |
| "learning_rate": 0.00015941614906832299, | |
| "loss": 1.3391, | |
| "step": 3270 | |
| }, | |
| { | |
| "epoch": 0.8149068322981367, | |
| "grad_norm": 6.9105024337768555, | |
| "learning_rate": 0.0001592919254658385, | |
| "loss": 1.2966, | |
| "step": 3280 | |
| }, | |
| { | |
| "epoch": 0.8173913043478261, | |
| "grad_norm": 5.310636043548584, | |
| "learning_rate": 0.00015916770186335405, | |
| "loss": 1.1282, | |
| "step": 3290 | |
| }, | |
| { | |
| "epoch": 0.8198757763975155, | |
| "grad_norm": 5.895457744598389, | |
| "learning_rate": 0.0001590434782608696, | |
| "loss": 1.3078, | |
| "step": 3300 | |
| }, | |
| { | |
| "epoch": 0.8198757763975155, | |
| "eval_accuracy": 0.7169761506644372, | |
| "eval_loss": 1.1206748485565186, | |
| "eval_runtime": 86.8832, | |
| "eval_samples_per_second": 130.785, | |
| "eval_steps_per_second": 16.355, | |
| "step": 3300 | |
| }, | |
| { | |
| "epoch": 0.822360248447205, | |
| "grad_norm": 5.530759334564209, | |
| "learning_rate": 0.0001589192546583851, | |
| "loss": 1.3002, | |
| "step": 3310 | |
| }, | |
| { | |
| "epoch": 0.8248447204968944, | |
| "grad_norm": 7.9369072914123535, | |
| "learning_rate": 0.00015879503105590062, | |
| "loss": 1.289, | |
| "step": 3320 | |
| }, | |
| { | |
| "epoch": 0.8273291925465839, | |
| "grad_norm": 7.3485426902771, | |
| "learning_rate": 0.00015867080745341617, | |
| "loss": 1.4236, | |
| "step": 3330 | |
| }, | |
| { | |
| "epoch": 0.8298136645962733, | |
| "grad_norm": 6.818698883056641, | |
| "learning_rate": 0.00015854658385093168, | |
| "loss": 1.2176, | |
| "step": 3340 | |
| }, | |
| { | |
| "epoch": 0.8322981366459627, | |
| "grad_norm": 6.358404159545898, | |
| "learning_rate": 0.0001584223602484472, | |
| "loss": 1.1425, | |
| "step": 3350 | |
| }, | |
| { | |
| "epoch": 0.8347826086956521, | |
| "grad_norm": 3.939678907394409, | |
| "learning_rate": 0.00015829813664596274, | |
| "loss": 1.5184, | |
| "step": 3360 | |
| }, | |
| { | |
| "epoch": 0.8372670807453416, | |
| "grad_norm": 7.679263114929199, | |
| "learning_rate": 0.00015817391304347826, | |
| "loss": 1.4098, | |
| "step": 3370 | |
| }, | |
| { | |
| "epoch": 0.8397515527950311, | |
| "grad_norm": 4.054044723510742, | |
| "learning_rate": 0.00015804968944099377, | |
| "loss": 1.2641, | |
| "step": 3380 | |
| }, | |
| { | |
| "epoch": 0.8422360248447205, | |
| "grad_norm": 8.686745643615723, | |
| "learning_rate": 0.00015792546583850934, | |
| "loss": 1.0001, | |
| "step": 3390 | |
| }, | |
| { | |
| "epoch": 0.84472049689441, | |
| "grad_norm": 4.359888076782227, | |
| "learning_rate": 0.00015780124223602486, | |
| "loss": 1.1483, | |
| "step": 3400 | |
| }, | |
| { | |
| "epoch": 0.84472049689441, | |
| "eval_accuracy": 0.7245445744961718, | |
| "eval_loss": 1.066516637802124, | |
| "eval_runtime": 85.9778, | |
| "eval_samples_per_second": 132.162, | |
| "eval_steps_per_second": 16.528, | |
| "step": 3400 | |
| }, | |
| { | |
| "epoch": 0.8472049689440994, | |
| "grad_norm": 6.710513591766357, | |
| "learning_rate": 0.00015767701863354038, | |
| "loss": 1.371, | |
| "step": 3410 | |
| }, | |
| { | |
| "epoch": 0.8496894409937888, | |
| "grad_norm": 5.640341281890869, | |
| "learning_rate": 0.00015755279503105592, | |
| "loss": 0.8962, | |
| "step": 3420 | |
| }, | |
| { | |
| "epoch": 0.8521739130434782, | |
| "grad_norm": 9.07288646697998, | |
| "learning_rate": 0.00015742857142857144, | |
| "loss": 1.1876, | |
| "step": 3430 | |
| }, | |
| { | |
| "epoch": 0.8546583850931677, | |
| "grad_norm": 6.409737586975098, | |
| "learning_rate": 0.00015730434782608695, | |
| "loss": 1.1879, | |
| "step": 3440 | |
| }, | |
| { | |
| "epoch": 0.8571428571428571, | |
| "grad_norm": 7.162034511566162, | |
| "learning_rate": 0.0001571801242236025, | |
| "loss": 1.1047, | |
| "step": 3450 | |
| }, | |
| { | |
| "epoch": 0.8596273291925466, | |
| "grad_norm": 10.321228981018066, | |
| "learning_rate": 0.000157055900621118, | |
| "loss": 1.3303, | |
| "step": 3460 | |
| }, | |
| { | |
| "epoch": 0.8621118012422361, | |
| "grad_norm": 7.930309772491455, | |
| "learning_rate": 0.00015693167701863353, | |
| "loss": 1.2688, | |
| "step": 3470 | |
| }, | |
| { | |
| "epoch": 0.8645962732919255, | |
| "grad_norm": 7.929530620574951, | |
| "learning_rate": 0.00015680745341614907, | |
| "loss": 1.0794, | |
| "step": 3480 | |
| }, | |
| { | |
| "epoch": 0.867080745341615, | |
| "grad_norm": 6.65020227432251, | |
| "learning_rate": 0.00015668322981366462, | |
| "loss": 1.1747, | |
| "step": 3490 | |
| }, | |
| { | |
| "epoch": 0.8695652173913043, | |
| "grad_norm": 7.833930969238281, | |
| "learning_rate": 0.00015655900621118013, | |
| "loss": 1.453, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 0.8695652173913043, | |
| "eval_accuracy": 0.7267446977030714, | |
| "eval_loss": 1.0639996528625488, | |
| "eval_runtime": 86.8259, | |
| "eval_samples_per_second": 130.871, | |
| "eval_steps_per_second": 16.366, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 0.8720496894409938, | |
| "grad_norm": 6.314217567443848, | |
| "learning_rate": 0.00015643478260869565, | |
| "loss": 1.3662, | |
| "step": 3510 | |
| }, | |
| { | |
| "epoch": 0.8745341614906832, | |
| "grad_norm": 6.935042381286621, | |
| "learning_rate": 0.0001563105590062112, | |
| "loss": 1.4166, | |
| "step": 3520 | |
| }, | |
| { | |
| "epoch": 0.8770186335403727, | |
| "grad_norm": 5.903131484985352, | |
| "learning_rate": 0.0001561863354037267, | |
| "loss": 1.3847, | |
| "step": 3530 | |
| }, | |
| { | |
| "epoch": 0.8795031055900621, | |
| "grad_norm": 5.503540515899658, | |
| "learning_rate": 0.00015606211180124223, | |
| "loss": 1.0824, | |
| "step": 3540 | |
| }, | |
| { | |
| "epoch": 0.8819875776397516, | |
| "grad_norm": 7.387447357177734, | |
| "learning_rate": 0.00015593788819875777, | |
| "loss": 1.3476, | |
| "step": 3550 | |
| }, | |
| { | |
| "epoch": 0.884472049689441, | |
| "grad_norm": 6.536509037017822, | |
| "learning_rate": 0.00015581366459627329, | |
| "loss": 1.2126, | |
| "step": 3560 | |
| }, | |
| { | |
| "epoch": 0.8869565217391304, | |
| "grad_norm": 4.404107093811035, | |
| "learning_rate": 0.00015568944099378883, | |
| "loss": 1.2508, | |
| "step": 3570 | |
| }, | |
| { | |
| "epoch": 0.8894409937888199, | |
| "grad_norm": 7.137818813323975, | |
| "learning_rate": 0.00015556521739130437, | |
| "loss": 1.1038, | |
| "step": 3580 | |
| }, | |
| { | |
| "epoch": 0.8919254658385093, | |
| "grad_norm": 3.9632694721221924, | |
| "learning_rate": 0.0001554409937888199, | |
| "loss": 1.2633, | |
| "step": 3590 | |
| }, | |
| { | |
| "epoch": 0.8944099378881988, | |
| "grad_norm": 7.339700222015381, | |
| "learning_rate": 0.0001553167701863354, | |
| "loss": 1.4457, | |
| "step": 3600 | |
| }, | |
| { | |
| "epoch": 0.8944099378881988, | |
| "eval_accuracy": 0.7321129983279063, | |
| "eval_loss": 1.0565322637557983, | |
| "eval_runtime": 85.6808, | |
| "eval_samples_per_second": 132.62, | |
| "eval_steps_per_second": 16.585, | |
| "step": 3600 | |
| }, | |
| { | |
| "epoch": 0.8968944099378882, | |
| "grad_norm": 6.658189296722412, | |
| "learning_rate": 0.00015519254658385095, | |
| "loss": 0.9933, | |
| "step": 3610 | |
| }, | |
| { | |
| "epoch": 0.8993788819875776, | |
| "grad_norm": 6.376084804534912, | |
| "learning_rate": 0.00015506832298136646, | |
| "loss": 1.2427, | |
| "step": 3620 | |
| }, | |
| { | |
| "epoch": 0.901863354037267, | |
| "grad_norm": 6.839380741119385, | |
| "learning_rate": 0.00015494409937888198, | |
| "loss": 1.2968, | |
| "step": 3630 | |
| }, | |
| { | |
| "epoch": 0.9043478260869565, | |
| "grad_norm": 6.3698601722717285, | |
| "learning_rate": 0.00015481987577639752, | |
| "loss": 1.3086, | |
| "step": 3640 | |
| }, | |
| { | |
| "epoch": 0.906832298136646, | |
| "grad_norm": 4.997156143188477, | |
| "learning_rate": 0.00015469565217391304, | |
| "loss": 1.3486, | |
| "step": 3650 | |
| }, | |
| { | |
| "epoch": 0.9093167701863354, | |
| "grad_norm": 6.0088701248168945, | |
| "learning_rate": 0.00015457142857142858, | |
| "loss": 1.235, | |
| "step": 3660 | |
| }, | |
| { | |
| "epoch": 0.9118012422360249, | |
| "grad_norm": 6.903764247894287, | |
| "learning_rate": 0.00015444720496894413, | |
| "loss": 1.2585, | |
| "step": 3670 | |
| }, | |
| { | |
| "epoch": 0.9142857142857143, | |
| "grad_norm": 7.442832946777344, | |
| "learning_rate": 0.00015432298136645964, | |
| "loss": 1.2756, | |
| "step": 3680 | |
| }, | |
| { | |
| "epoch": 0.9167701863354037, | |
| "grad_norm": 7.293776988983154, | |
| "learning_rate": 0.00015419875776397516, | |
| "loss": 1.2326, | |
| "step": 3690 | |
| }, | |
| { | |
| "epoch": 0.9192546583850931, | |
| "grad_norm": 2.9621481895446777, | |
| "learning_rate": 0.0001540745341614907, | |
| "loss": 1.1636, | |
| "step": 3700 | |
| }, | |
| { | |
| "epoch": 0.9192546583850931, | |
| "eval_accuracy": 0.7255126287072076, | |
| "eval_loss": 1.057629942893982, | |
| "eval_runtime": 86.1351, | |
| "eval_samples_per_second": 131.921, | |
| "eval_steps_per_second": 16.497, | |
| "step": 3700 | |
| }, | |
| { | |
| "epoch": 0.9217391304347826, | |
| "grad_norm": 10.847683906555176, | |
| "learning_rate": 0.00015395031055900622, | |
| "loss": 1.2353, | |
| "step": 3710 | |
| }, | |
| { | |
| "epoch": 0.924223602484472, | |
| "grad_norm": 5.985072135925293, | |
| "learning_rate": 0.00015382608695652174, | |
| "loss": 1.5326, | |
| "step": 3720 | |
| }, | |
| { | |
| "epoch": 0.9267080745341615, | |
| "grad_norm": 6.25619649887085, | |
| "learning_rate": 0.00015370186335403728, | |
| "loss": 1.2161, | |
| "step": 3730 | |
| }, | |
| { | |
| "epoch": 0.929192546583851, | |
| "grad_norm": 6.543466091156006, | |
| "learning_rate": 0.0001535776397515528, | |
| "loss": 1.4036, | |
| "step": 3740 | |
| }, | |
| { | |
| "epoch": 0.9316770186335404, | |
| "grad_norm": 5.6111555099487305, | |
| "learning_rate": 0.00015345341614906834, | |
| "loss": 1.2282, | |
| "step": 3750 | |
| }, | |
| { | |
| "epoch": 0.9341614906832298, | |
| "grad_norm": 6.730726718902588, | |
| "learning_rate": 0.00015332919254658386, | |
| "loss": 1.1281, | |
| "step": 3760 | |
| }, | |
| { | |
| "epoch": 0.9366459627329192, | |
| "grad_norm": 6.602107048034668, | |
| "learning_rate": 0.0001532049689440994, | |
| "loss": 1.1716, | |
| "step": 3770 | |
| }, | |
| { | |
| "epoch": 0.9391304347826087, | |
| "grad_norm": 2.737424612045288, | |
| "learning_rate": 0.00015308074534161492, | |
| "loss": 1.091, | |
| "step": 3780 | |
| }, | |
| { | |
| "epoch": 0.9416149068322981, | |
| "grad_norm": 6.844805717468262, | |
| "learning_rate": 0.00015295652173913043, | |
| "loss": 1.1411, | |
| "step": 3790 | |
| }, | |
| { | |
| "epoch": 0.9440993788819876, | |
| "grad_norm": 6.895637512207031, | |
| "learning_rate": 0.00015283229813664598, | |
| "loss": 1.157, | |
| "step": 3800 | |
| }, | |
| { | |
| "epoch": 0.9440993788819876, | |
| "eval_accuracy": 0.7261286632051395, | |
| "eval_loss": 1.0648393630981445, | |
| "eval_runtime": 86.8569, | |
| "eval_samples_per_second": 130.824, | |
| "eval_steps_per_second": 16.36, | |
| "step": 3800 | |
| }, | |
| { | |
| "epoch": 0.9465838509316771, | |
| "grad_norm": 6.659364223480225, | |
| "learning_rate": 0.0001527080745341615, | |
| "loss": 1.2882, | |
| "step": 3810 | |
| }, | |
| { | |
| "epoch": 0.9490683229813665, | |
| "grad_norm": 3.437624216079712, | |
| "learning_rate": 0.000152583850931677, | |
| "loss": 1.0992, | |
| "step": 3820 | |
| }, | |
| { | |
| "epoch": 0.9515527950310559, | |
| "grad_norm": 9.4873046875, | |
| "learning_rate": 0.00015245962732919255, | |
| "loss": 1.3628, | |
| "step": 3830 | |
| }, | |
| { | |
| "epoch": 0.9540372670807453, | |
| "grad_norm": 6.623880386352539, | |
| "learning_rate": 0.0001523354037267081, | |
| "loss": 1.2201, | |
| "step": 3840 | |
| }, | |
| { | |
| "epoch": 0.9565217391304348, | |
| "grad_norm": 5.347780227661133, | |
| "learning_rate": 0.0001522111801242236, | |
| "loss": 0.9752, | |
| "step": 3850 | |
| }, | |
| { | |
| "epoch": 0.9590062111801242, | |
| "grad_norm": 9.225540161132812, | |
| "learning_rate": 0.00015208695652173916, | |
| "loss": 1.2034, | |
| "step": 3860 | |
| }, | |
| { | |
| "epoch": 0.9614906832298137, | |
| "grad_norm": 5.735724925994873, | |
| "learning_rate": 0.00015196273291925467, | |
| "loss": 1.111, | |
| "step": 3870 | |
| }, | |
| { | |
| "epoch": 0.9639751552795031, | |
| "grad_norm": 5.543980598449707, | |
| "learning_rate": 0.0001518385093167702, | |
| "loss": 1.1442, | |
| "step": 3880 | |
| }, | |
| { | |
| "epoch": 0.9664596273291925, | |
| "grad_norm": 9.901732444763184, | |
| "learning_rate": 0.00015171428571428573, | |
| "loss": 1.299, | |
| "step": 3890 | |
| }, | |
| { | |
| "epoch": 0.968944099378882, | |
| "grad_norm": 8.65027141571045, | |
| "learning_rate": 0.00015159006211180125, | |
| "loss": 1.1923, | |
| "step": 3900 | |
| }, | |
| { | |
| "epoch": 0.968944099378882, | |
| "eval_accuracy": 0.7270967174161753, | |
| "eval_loss": 1.0472681522369385, | |
| "eval_runtime": 86.822, | |
| "eval_samples_per_second": 130.877, | |
| "eval_steps_per_second": 16.367, | |
| "step": 3900 | |
| }, | |
| { | |
| "epoch": 0.9714285714285714, | |
| "grad_norm": 5.825603008270264, | |
| "learning_rate": 0.00015146583850931676, | |
| "loss": 1.313, | |
| "step": 3910 | |
| }, | |
| { | |
| "epoch": 0.9739130434782609, | |
| "grad_norm": 5.283875942230225, | |
| "learning_rate": 0.0001513416149068323, | |
| "loss": 1.2346, | |
| "step": 3920 | |
| }, | |
| { | |
| "epoch": 0.9763975155279503, | |
| "grad_norm": 5.817853927612305, | |
| "learning_rate": 0.00015121739130434785, | |
| "loss": 1.3103, | |
| "step": 3930 | |
| }, | |
| { | |
| "epoch": 0.9788819875776398, | |
| "grad_norm": 8.483689308166504, | |
| "learning_rate": 0.00015109316770186337, | |
| "loss": 1.2589, | |
| "step": 3940 | |
| }, | |
| { | |
| "epoch": 0.9813664596273292, | |
| "grad_norm": 6.321104526519775, | |
| "learning_rate": 0.00015096894409937888, | |
| "loss": 1.5437, | |
| "step": 3950 | |
| }, | |
| { | |
| "epoch": 0.9838509316770186, | |
| "grad_norm": 7.132662296295166, | |
| "learning_rate": 0.00015084472049689443, | |
| "loss": 1.1178, | |
| "step": 3960 | |
| }, | |
| { | |
| "epoch": 0.986335403726708, | |
| "grad_norm": 6.257715702056885, | |
| "learning_rate": 0.00015072049689440994, | |
| "loss": 1.1324, | |
| "step": 3970 | |
| }, | |
| { | |
| "epoch": 0.9888198757763975, | |
| "grad_norm": 7.432724952697754, | |
| "learning_rate": 0.00015059627329192546, | |
| "loss": 1.2156, | |
| "step": 3980 | |
| }, | |
| { | |
| "epoch": 0.991304347826087, | |
| "grad_norm": 6.6837158203125, | |
| "learning_rate": 0.000150472049689441, | |
| "loss": 1.2655, | |
| "step": 3990 | |
| }, | |
| { | |
| "epoch": 0.9937888198757764, | |
| "grad_norm": 8.731260299682617, | |
| "learning_rate": 0.00015034782608695652, | |
| "loss": 1.2325, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 0.9937888198757764, | |
| "eval_accuracy": 0.7298248701927308, | |
| "eval_loss": 1.050094723701477, | |
| "eval_runtime": 87.0386, | |
| "eval_samples_per_second": 130.551, | |
| "eval_steps_per_second": 16.326, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 0.9962732919254659, | |
| "grad_norm": 7.174413681030273, | |
| "learning_rate": 0.00015022360248447204, | |
| "loss": 1.4024, | |
| "step": 4010 | |
| }, | |
| { | |
| "epoch": 0.9987577639751553, | |
| "grad_norm": 9.296140670776367, | |
| "learning_rate": 0.0001500993788819876, | |
| "loss": 1.292, | |
| "step": 4020 | |
| }, | |
| { | |
| "epoch": 1.0012422360248447, | |
| "grad_norm": 7.022974014282227, | |
| "learning_rate": 0.00014997515527950312, | |
| "loss": 1.1833, | |
| "step": 4030 | |
| }, | |
| { | |
| "epoch": 1.0037267080745342, | |
| "grad_norm": 7.05012321472168, | |
| "learning_rate": 0.00014985093167701864, | |
| "loss": 1.0308, | |
| "step": 4040 | |
| }, | |
| { | |
| "epoch": 1.0062111801242235, | |
| "grad_norm": 6.042240142822266, | |
| "learning_rate": 0.00014972670807453418, | |
| "loss": 0.8708, | |
| "step": 4050 | |
| }, | |
| { | |
| "epoch": 1.008695652173913, | |
| "grad_norm": 4.938986301422119, | |
| "learning_rate": 0.0001496024844720497, | |
| "loss": 1.0892, | |
| "step": 4060 | |
| }, | |
| { | |
| "epoch": 1.0111801242236025, | |
| "grad_norm": 6.403342247009277, | |
| "learning_rate": 0.00014947826086956522, | |
| "loss": 1.1606, | |
| "step": 4070 | |
| }, | |
| { | |
| "epoch": 1.013664596273292, | |
| "grad_norm": 3.8224756717681885, | |
| "learning_rate": 0.00014935403726708076, | |
| "loss": 1.0617, | |
| "step": 4080 | |
| }, | |
| { | |
| "epoch": 1.0161490683229815, | |
| "grad_norm": 7.42360782623291, | |
| "learning_rate": 0.00014922981366459627, | |
| "loss": 0.9664, | |
| "step": 4090 | |
| }, | |
| { | |
| "epoch": 1.0186335403726707, | |
| "grad_norm": 4.1559529304504395, | |
| "learning_rate": 0.0001491055900621118, | |
| "loss": 1.1503, | |
| "step": 4100 | |
| }, | |
| { | |
| "epoch": 1.0186335403726707, | |
| "eval_accuracy": 0.7242805597113439, | |
| "eval_loss": 1.0565658807754517, | |
| "eval_runtime": 86.6402, | |
| "eval_samples_per_second": 131.152, | |
| "eval_steps_per_second": 16.401, | |
| "step": 4100 | |
| }, | |
| { | |
| "epoch": 1.0211180124223602, | |
| "grad_norm": 6.328678131103516, | |
| "learning_rate": 0.00014898136645962733, | |
| "loss": 1.025, | |
| "step": 4110 | |
| }, | |
| { | |
| "epoch": 1.0236024844720497, | |
| "grad_norm": 7.9734787940979, | |
| "learning_rate": 0.00014885714285714288, | |
| "loss": 1.2318, | |
| "step": 4120 | |
| }, | |
| { | |
| "epoch": 1.0260869565217392, | |
| "grad_norm": 5.027238845825195, | |
| "learning_rate": 0.0001487329192546584, | |
| "loss": 1.2616, | |
| "step": 4130 | |
| }, | |
| { | |
| "epoch": 1.0285714285714285, | |
| "grad_norm": 7.277949810028076, | |
| "learning_rate": 0.0001486086956521739, | |
| "loss": 1.1206, | |
| "step": 4140 | |
| }, | |
| { | |
| "epoch": 1.031055900621118, | |
| "grad_norm": 7.472249984741211, | |
| "learning_rate": 0.00014848447204968945, | |
| "loss": 1.1375, | |
| "step": 4150 | |
| }, | |
| { | |
| "epoch": 1.0335403726708075, | |
| "grad_norm": 4.62937068939209, | |
| "learning_rate": 0.00014836024844720497, | |
| "loss": 0.9969, | |
| "step": 4160 | |
| }, | |
| { | |
| "epoch": 1.036024844720497, | |
| "grad_norm": 6.158135414123535, | |
| "learning_rate": 0.0001482360248447205, | |
| "loss": 1.0945, | |
| "step": 4170 | |
| }, | |
| { | |
| "epoch": 1.0385093167701864, | |
| "grad_norm": 6.552846908569336, | |
| "learning_rate": 0.00014811180124223603, | |
| "loss": 1.1422, | |
| "step": 4180 | |
| }, | |
| { | |
| "epoch": 1.0409937888198757, | |
| "grad_norm": 7.865995407104492, | |
| "learning_rate": 0.00014798757763975155, | |
| "loss": 1.0421, | |
| "step": 4190 | |
| }, | |
| { | |
| "epoch": 1.0434782608695652, | |
| "grad_norm": 6.623953819274902, | |
| "learning_rate": 0.0001478633540372671, | |
| "loss": 1.0633, | |
| "step": 4200 | |
| }, | |
| { | |
| "epoch": 1.0434782608695652, | |
| "eval_accuracy": 0.744433688286544, | |
| "eval_loss": 1.0004760026931763, | |
| "eval_runtime": 87.3833, | |
| "eval_samples_per_second": 130.036, | |
| "eval_steps_per_second": 16.262, | |
| "step": 4200 | |
| }, | |
| { | |
| "epoch": 1.0459627329192547, | |
| "grad_norm": 2.9450221061706543, | |
| "learning_rate": 0.00014773913043478263, | |
| "loss": 1.0158, | |
| "step": 4210 | |
| }, | |
| { | |
| "epoch": 1.0484472049689442, | |
| "grad_norm": 4.293970584869385, | |
| "learning_rate": 0.00014761490683229815, | |
| "loss": 0.9092, | |
| "step": 4220 | |
| }, | |
| { | |
| "epoch": 1.0509316770186334, | |
| "grad_norm": 3.9722843170166016, | |
| "learning_rate": 0.00014749068322981367, | |
| "loss": 0.9706, | |
| "step": 4230 | |
| }, | |
| { | |
| "epoch": 1.053416149068323, | |
| "grad_norm": 4.5669779777526855, | |
| "learning_rate": 0.0001473664596273292, | |
| "loss": 0.9828, | |
| "step": 4240 | |
| }, | |
| { | |
| "epoch": 1.0559006211180124, | |
| "grad_norm": 5.340195178985596, | |
| "learning_rate": 0.00014724223602484473, | |
| "loss": 0.9847, | |
| "step": 4250 | |
| }, | |
| { | |
| "epoch": 1.058385093167702, | |
| "grad_norm": 6.1555304527282715, | |
| "learning_rate": 0.00014711801242236024, | |
| "loss": 0.9667, | |
| "step": 4260 | |
| }, | |
| { | |
| "epoch": 1.0608695652173914, | |
| "grad_norm": 6.872910499572754, | |
| "learning_rate": 0.00014699378881987579, | |
| "loss": 1.1049, | |
| "step": 4270 | |
| }, | |
| { | |
| "epoch": 1.0633540372670807, | |
| "grad_norm": 6.4988861083984375, | |
| "learning_rate": 0.0001468695652173913, | |
| "loss": 1.1562, | |
| "step": 4280 | |
| }, | |
| { | |
| "epoch": 1.0658385093167702, | |
| "grad_norm": 5.785723686218262, | |
| "learning_rate": 0.00014674534161490682, | |
| "loss": 0.9364, | |
| "step": 4290 | |
| }, | |
| { | |
| "epoch": 1.0683229813664596, | |
| "grad_norm": 9.51654052734375, | |
| "learning_rate": 0.0001466211180124224, | |
| "loss": 1.2061, | |
| "step": 4300 | |
| }, | |
| { | |
| "epoch": 1.0683229813664596, | |
| "eval_accuracy": 0.7376573088092934, | |
| "eval_loss": 1.0195673704147339, | |
| "eval_runtime": 85.368, | |
| "eval_samples_per_second": 133.106, | |
| "eval_steps_per_second": 16.646, | |
| "step": 4300 | |
| }, | |
| { | |
| "epoch": 1.0708074534161491, | |
| "grad_norm": 6.055525302886963, | |
| "learning_rate": 0.0001464968944099379, | |
| "loss": 1.0418, | |
| "step": 4310 | |
| }, | |
| { | |
| "epoch": 1.0732919254658384, | |
| "grad_norm": 5.421204566955566, | |
| "learning_rate": 0.00014637267080745342, | |
| "loss": 1.0929, | |
| "step": 4320 | |
| }, | |
| { | |
| "epoch": 1.075776397515528, | |
| "grad_norm": 9.280656814575195, | |
| "learning_rate": 0.00014624844720496897, | |
| "loss": 1.2286, | |
| "step": 4330 | |
| }, | |
| { | |
| "epoch": 1.0782608695652174, | |
| "grad_norm": 4.315008640289307, | |
| "learning_rate": 0.00014612422360248448, | |
| "loss": 1.2768, | |
| "step": 4340 | |
| }, | |
| { | |
| "epoch": 1.0807453416149069, | |
| "grad_norm": 7.510447025299072, | |
| "learning_rate": 0.000146, | |
| "loss": 1.0406, | |
| "step": 4350 | |
| }, | |
| { | |
| "epoch": 1.0832298136645964, | |
| "grad_norm": 8.884886741638184, | |
| "learning_rate": 0.00014587577639751554, | |
| "loss": 1.158, | |
| "step": 4360 | |
| }, | |
| { | |
| "epoch": 1.0857142857142856, | |
| "grad_norm": 6.407387733459473, | |
| "learning_rate": 0.00014575155279503106, | |
| "loss": 1.0883, | |
| "step": 4370 | |
| }, | |
| { | |
| "epoch": 1.0881987577639751, | |
| "grad_norm": 8.888128280639648, | |
| "learning_rate": 0.00014562732919254657, | |
| "loss": 1.0214, | |
| "step": 4380 | |
| }, | |
| { | |
| "epoch": 1.0906832298136646, | |
| "grad_norm": 5.50847864151001, | |
| "learning_rate": 0.00014550310559006212, | |
| "loss": 1.0415, | |
| "step": 4390 | |
| }, | |
| { | |
| "epoch": 1.093167701863354, | |
| "grad_norm": 7.724440097808838, | |
| "learning_rate": 0.00014537888198757766, | |
| "loss": 1.0315, | |
| "step": 4400 | |
| }, | |
| { | |
| "epoch": 1.093167701863354, | |
| "eval_accuracy": 0.739153392589985, | |
| "eval_loss": 1.0139085054397583, | |
| "eval_runtime": 85.7532, | |
| "eval_samples_per_second": 132.508, | |
| "eval_steps_per_second": 16.571, | |
| "step": 4400 | |
| }, | |
| { | |
| "epoch": 1.0956521739130434, | |
| "grad_norm": 9.034687995910645, | |
| "learning_rate": 0.00014525465838509318, | |
| "loss": 0.934, | |
| "step": 4410 | |
| }, | |
| { | |
| "epoch": 1.0981366459627329, | |
| "grad_norm": 4.125546932220459, | |
| "learning_rate": 0.0001451304347826087, | |
| "loss": 0.9062, | |
| "step": 4420 | |
| }, | |
| { | |
| "epoch": 1.1006211180124224, | |
| "grad_norm": 12.423514366149902, | |
| "learning_rate": 0.00014500621118012424, | |
| "loss": 1.2444, | |
| "step": 4430 | |
| }, | |
| { | |
| "epoch": 1.1031055900621118, | |
| "grad_norm": 6.781725883483887, | |
| "learning_rate": 0.00014488198757763975, | |
| "loss": 1.1755, | |
| "step": 4440 | |
| }, | |
| { | |
| "epoch": 1.1055900621118013, | |
| "grad_norm": 3.974307060241699, | |
| "learning_rate": 0.00014475776397515527, | |
| "loss": 0.9203, | |
| "step": 4450 | |
| }, | |
| { | |
| "epoch": 1.1080745341614906, | |
| "grad_norm": 6.652670383453369, | |
| "learning_rate": 0.0001446335403726708, | |
| "loss": 0.8479, | |
| "step": 4460 | |
| }, | |
| { | |
| "epoch": 1.11055900621118, | |
| "grad_norm": 7.944617748260498, | |
| "learning_rate": 0.00014450931677018633, | |
| "loss": 1.2384, | |
| "step": 4470 | |
| }, | |
| { | |
| "epoch": 1.1130434782608696, | |
| "grad_norm": 4.334497928619385, | |
| "learning_rate": 0.00014438509316770187, | |
| "loss": 0.9322, | |
| "step": 4480 | |
| }, | |
| { | |
| "epoch": 1.115527950310559, | |
| "grad_norm": 6.265549659729004, | |
| "learning_rate": 0.00014426086956521742, | |
| "loss": 1.1439, | |
| "step": 4490 | |
| }, | |
| { | |
| "epoch": 1.1180124223602483, | |
| "grad_norm": 5.482172012329102, | |
| "learning_rate": 0.00014413664596273293, | |
| "loss": 1.038, | |
| "step": 4500 | |
| }, | |
| { | |
| "epoch": 1.1180124223602483, | |
| "eval_accuracy": 0.7317609786148024, | |
| "eval_loss": 1.029909610748291, | |
| "eval_runtime": 86.1317, | |
| "eval_samples_per_second": 131.926, | |
| "eval_steps_per_second": 16.498, | |
| "step": 4500 | |
| }, | |
| { | |
| "epoch": 1.1204968944099378, | |
| "grad_norm": 4.223867416381836, | |
| "learning_rate": 0.00014401242236024845, | |
| "loss": 1.0135, | |
| "step": 4510 | |
| }, | |
| { | |
| "epoch": 1.1229813664596273, | |
| "grad_norm": 8.013762474060059, | |
| "learning_rate": 0.000143888198757764, | |
| "loss": 1.2437, | |
| "step": 4520 | |
| }, | |
| { | |
| "epoch": 1.1254658385093168, | |
| "grad_norm": 1.782776951789856, | |
| "learning_rate": 0.0001437639751552795, | |
| "loss": 0.9916, | |
| "step": 4530 | |
| }, | |
| { | |
| "epoch": 1.1279503105590063, | |
| "grad_norm": 5.063310623168945, | |
| "learning_rate": 0.00014363975155279503, | |
| "loss": 1.0833, | |
| "step": 4540 | |
| }, | |
| { | |
| "epoch": 1.1304347826086956, | |
| "grad_norm": 5.764039516448975, | |
| "learning_rate": 0.00014351552795031057, | |
| "loss": 1.0594, | |
| "step": 4550 | |
| }, | |
| { | |
| "epoch": 1.132919254658385, | |
| "grad_norm": 8.462092399597168, | |
| "learning_rate": 0.00014339130434782609, | |
| "loss": 0.9592, | |
| "step": 4560 | |
| }, | |
| { | |
| "epoch": 1.1354037267080745, | |
| "grad_norm": 4.34237813949585, | |
| "learning_rate": 0.00014326708074534163, | |
| "loss": 0.928, | |
| "step": 4570 | |
| }, | |
| { | |
| "epoch": 1.137888198757764, | |
| "grad_norm": 7.203433036804199, | |
| "learning_rate": 0.00014314285714285715, | |
| "loss": 1.063, | |
| "step": 4580 | |
| }, | |
| { | |
| "epoch": 1.1403726708074533, | |
| "grad_norm": 7.482883930206299, | |
| "learning_rate": 0.0001430186335403727, | |
| "loss": 1.2297, | |
| "step": 4590 | |
| }, | |
| { | |
| "epoch": 1.1428571428571428, | |
| "grad_norm": 7.640567779541016, | |
| "learning_rate": 0.0001428944099378882, | |
| "loss": 0.7728, | |
| "step": 4600 | |
| }, | |
| { | |
| "epoch": 1.1428571428571428, | |
| "eval_accuracy": 0.7256886385637595, | |
| "eval_loss": 1.0522042512893677, | |
| "eval_runtime": 85.4611, | |
| "eval_samples_per_second": 132.961, | |
| "eval_steps_per_second": 16.627, | |
| "step": 4600 | |
| }, | |
| { | |
| "epoch": 1.1453416149068323, | |
| "grad_norm": 8.734424591064453, | |
| "learning_rate": 0.00014277018633540372, | |
| "loss": 0.9011, | |
| "step": 4610 | |
| }, | |
| { | |
| "epoch": 1.1478260869565218, | |
| "grad_norm": 5.528824806213379, | |
| "learning_rate": 0.00014264596273291926, | |
| "loss": 1.2915, | |
| "step": 4620 | |
| }, | |
| { | |
| "epoch": 1.1503105590062113, | |
| "grad_norm": 8.432668685913086, | |
| "learning_rate": 0.00014252173913043478, | |
| "loss": 1.0122, | |
| "step": 4630 | |
| }, | |
| { | |
| "epoch": 1.1527950310559005, | |
| "grad_norm": 5.736224174499512, | |
| "learning_rate": 0.0001423975155279503, | |
| "loss": 0.9787, | |
| "step": 4640 | |
| }, | |
| { | |
| "epoch": 1.15527950310559, | |
| "grad_norm": 9.182514190673828, | |
| "learning_rate": 0.00014227329192546584, | |
| "loss": 0.9586, | |
| "step": 4650 | |
| }, | |
| { | |
| "epoch": 1.1577639751552795, | |
| "grad_norm": 8.18057918548584, | |
| "learning_rate": 0.00014214906832298138, | |
| "loss": 1.0702, | |
| "step": 4660 | |
| }, | |
| { | |
| "epoch": 1.160248447204969, | |
| "grad_norm": 7.330738067626953, | |
| "learning_rate": 0.0001420248447204969, | |
| "loss": 0.9131, | |
| "step": 4670 | |
| }, | |
| { | |
| "epoch": 1.1627329192546583, | |
| "grad_norm": 4.894416332244873, | |
| "learning_rate": 0.00014190062111801244, | |
| "loss": 0.9788, | |
| "step": 4680 | |
| }, | |
| { | |
| "epoch": 1.1652173913043478, | |
| "grad_norm": 7.602725028991699, | |
| "learning_rate": 0.00014177639751552796, | |
| "loss": 0.9594, | |
| "step": 4690 | |
| }, | |
| { | |
| "epoch": 1.1677018633540373, | |
| "grad_norm": 4.91877555847168, | |
| "learning_rate": 0.00014165217391304348, | |
| "loss": 0.9302, | |
| "step": 4700 | |
| }, | |
| { | |
| "epoch": 1.1677018633540373, | |
| "eval_accuracy": 0.7362492299568776, | |
| "eval_loss": 1.0218663215637207, | |
| "eval_runtime": 85.3252, | |
| "eval_samples_per_second": 133.173, | |
| "eval_steps_per_second": 16.654, | |
| "step": 4700 | |
| }, | |
| { | |
| "epoch": 1.1701863354037267, | |
| "grad_norm": 5.2337422370910645, | |
| "learning_rate": 0.00014152795031055902, | |
| "loss": 1.1092, | |
| "step": 4710 | |
| }, | |
| { | |
| "epoch": 1.1726708074534162, | |
| "grad_norm": 8.629744529724121, | |
| "learning_rate": 0.00014140372670807454, | |
| "loss": 1.028, | |
| "step": 4720 | |
| }, | |
| { | |
| "epoch": 1.1751552795031055, | |
| "grad_norm": 6.914172172546387, | |
| "learning_rate": 0.00014127950310559005, | |
| "loss": 1.0481, | |
| "step": 4730 | |
| }, | |
| { | |
| "epoch": 1.177639751552795, | |
| "grad_norm": 5.989754676818848, | |
| "learning_rate": 0.0001411552795031056, | |
| "loss": 1.0034, | |
| "step": 4740 | |
| }, | |
| { | |
| "epoch": 1.1801242236024845, | |
| "grad_norm": 5.203980922698975, | |
| "learning_rate": 0.00014103105590062114, | |
| "loss": 1.1532, | |
| "step": 4750 | |
| }, | |
| { | |
| "epoch": 1.182608695652174, | |
| "grad_norm": 4.077994346618652, | |
| "learning_rate": 0.00014090683229813666, | |
| "loss": 1.064, | |
| "step": 4760 | |
| }, | |
| { | |
| "epoch": 1.1850931677018632, | |
| "grad_norm": 7.052755355834961, | |
| "learning_rate": 0.00014078260869565217, | |
| "loss": 1.194, | |
| "step": 4770 | |
| }, | |
| { | |
| "epoch": 1.1875776397515527, | |
| "grad_norm": 9.312969207763672, | |
| "learning_rate": 0.00014065838509316772, | |
| "loss": 1.0624, | |
| "step": 4780 | |
| }, | |
| { | |
| "epoch": 1.1900621118012422, | |
| "grad_norm": 6.245819568634033, | |
| "learning_rate": 0.00014053416149068323, | |
| "loss": 1.0172, | |
| "step": 4790 | |
| }, | |
| { | |
| "epoch": 1.1925465838509317, | |
| "grad_norm": 7.503792762756348, | |
| "learning_rate": 0.00014040993788819875, | |
| "loss": 1.1084, | |
| "step": 4800 | |
| }, | |
| { | |
| "epoch": 1.1925465838509317, | |
| "eval_accuracy": 0.7349291560327378, | |
| "eval_loss": 0.9940283894538879, | |
| "eval_runtime": 85.5561, | |
| "eval_samples_per_second": 132.813, | |
| "eval_steps_per_second": 16.609, | |
| "step": 4800 | |
| }, | |
| { | |
| "epoch": 1.1950310559006212, | |
| "grad_norm": 6.583471298217773, | |
| "learning_rate": 0.0001402857142857143, | |
| "loss": 1.2656, | |
| "step": 4810 | |
| }, | |
| { | |
| "epoch": 1.1975155279503105, | |
| "grad_norm": 3.8363754749298096, | |
| "learning_rate": 0.0001401614906832298, | |
| "loss": 0.7829, | |
| "step": 4820 | |
| }, | |
| { | |
| "epoch": 1.2, | |
| "grad_norm": 7.965066909790039, | |
| "learning_rate": 0.00014003726708074532, | |
| "loss": 0.9891, | |
| "step": 4830 | |
| }, | |
| { | |
| "epoch": 1.2024844720496894, | |
| "grad_norm": 3.270879030227661, | |
| "learning_rate": 0.0001399130434782609, | |
| "loss": 0.9665, | |
| "step": 4840 | |
| }, | |
| { | |
| "epoch": 1.204968944099379, | |
| "grad_norm": 7.581824779510498, | |
| "learning_rate": 0.0001397888198757764, | |
| "loss": 1.3112, | |
| "step": 4850 | |
| }, | |
| { | |
| "epoch": 1.2074534161490682, | |
| "grad_norm": 7.508520603179932, | |
| "learning_rate": 0.00013966459627329193, | |
| "loss": 1.0786, | |
| "step": 4860 | |
| }, | |
| { | |
| "epoch": 1.2099378881987577, | |
| "grad_norm": 2.655932664871216, | |
| "learning_rate": 0.00013954037267080747, | |
| "loss": 0.8918, | |
| "step": 4870 | |
| }, | |
| { | |
| "epoch": 1.2124223602484472, | |
| "grad_norm": 3.294532537460327, | |
| "learning_rate": 0.000139416149068323, | |
| "loss": 0.9471, | |
| "step": 4880 | |
| }, | |
| { | |
| "epoch": 1.2149068322981367, | |
| "grad_norm": 10.930632591247559, | |
| "learning_rate": 0.0001392919254658385, | |
| "loss": 0.9158, | |
| "step": 4890 | |
| }, | |
| { | |
| "epoch": 1.2173913043478262, | |
| "grad_norm": 6.163077354431152, | |
| "learning_rate": 0.00013916770186335405, | |
| "loss": 1.0345, | |
| "step": 4900 | |
| }, | |
| { | |
| "epoch": 1.2173913043478262, | |
| "eval_accuracy": 0.744609698143096, | |
| "eval_loss": 0.9774972200393677, | |
| "eval_runtime": 87.4405, | |
| "eval_samples_per_second": 129.951, | |
| "eval_steps_per_second": 16.251, | |
| "step": 4900 | |
| }, | |
| { | |
| "epoch": 1.2198757763975154, | |
| "grad_norm": 7.32708215713501, | |
| "learning_rate": 0.00013904347826086956, | |
| "loss": 0.9395, | |
| "step": 4910 | |
| }, | |
| { | |
| "epoch": 1.222360248447205, | |
| "grad_norm": 7.354382038116455, | |
| "learning_rate": 0.00013891925465838508, | |
| "loss": 1.0895, | |
| "step": 4920 | |
| }, | |
| { | |
| "epoch": 1.2248447204968944, | |
| "grad_norm": 7.127068996429443, | |
| "learning_rate": 0.00013879503105590065, | |
| "loss": 1.1379, | |
| "step": 4930 | |
| }, | |
| { | |
| "epoch": 1.227329192546584, | |
| "grad_norm": 9.56634521484375, | |
| "learning_rate": 0.00013867080745341617, | |
| "loss": 1.1754, | |
| "step": 4940 | |
| }, | |
| { | |
| "epoch": 1.2298136645962732, | |
| "grad_norm": 4.587943077087402, | |
| "learning_rate": 0.00013854658385093168, | |
| "loss": 1.2066, | |
| "step": 4950 | |
| }, | |
| { | |
| "epoch": 1.2322981366459627, | |
| "grad_norm": 4.837312698364258, | |
| "learning_rate": 0.00013842236024844723, | |
| "loss": 1.0871, | |
| "step": 4960 | |
| }, | |
| { | |
| "epoch": 1.2347826086956522, | |
| "grad_norm": 6.6595916748046875, | |
| "learning_rate": 0.00013829813664596274, | |
| "loss": 0.9062, | |
| "step": 4970 | |
| }, | |
| { | |
| "epoch": 1.2372670807453416, | |
| "grad_norm": 5.565141201019287, | |
| "learning_rate": 0.00013817391304347826, | |
| "loss": 1.2128, | |
| "step": 4980 | |
| }, | |
| { | |
| "epoch": 1.2397515527950311, | |
| "grad_norm": 5.343240261077881, | |
| "learning_rate": 0.0001380496894409938, | |
| "loss": 0.9812, | |
| "step": 4990 | |
| }, | |
| { | |
| "epoch": 1.2422360248447206, | |
| "grad_norm": 8.496342658996582, | |
| "learning_rate": 0.00013792546583850932, | |
| "loss": 1.0541, | |
| "step": 5000 | |
| }, | |
| { | |
| "epoch": 1.2422360248447206, | |
| "eval_accuracy": 0.7366012496699815, | |
| "eval_loss": 1.0075589418411255, | |
| "eval_runtime": 87.0565, | |
| "eval_samples_per_second": 130.524, | |
| "eval_steps_per_second": 16.323, | |
| "step": 5000 | |
| }, | |
| { | |
| "epoch": 1.24472049689441, | |
| "grad_norm": 5.603249549865723, | |
| "learning_rate": 0.00013780124223602484, | |
| "loss": 1.0875, | |
| "step": 5010 | |
| }, | |
| { | |
| "epoch": 1.2472049689440994, | |
| "grad_norm": 7.066832065582275, | |
| "learning_rate": 0.00013767701863354038, | |
| "loss": 0.9288, | |
| "step": 5020 | |
| }, | |
| { | |
| "epoch": 1.2496894409937889, | |
| "grad_norm": 7.90041971206665, | |
| "learning_rate": 0.00013755279503105592, | |
| "loss": 0.9789, | |
| "step": 5030 | |
| }, | |
| { | |
| "epoch": 1.2521739130434781, | |
| "grad_norm": 9.516698837280273, | |
| "learning_rate": 0.00013742857142857144, | |
| "loss": 0.9999, | |
| "step": 5040 | |
| }, | |
| { | |
| "epoch": 1.2546583850931676, | |
| "grad_norm": 7.783109188079834, | |
| "learning_rate": 0.00013730434782608696, | |
| "loss": 1.0498, | |
| "step": 5050 | |
| }, | |
| { | |
| "epoch": 1.2571428571428571, | |
| "grad_norm": 9.297592163085938, | |
| "learning_rate": 0.0001371801242236025, | |
| "loss": 1.066, | |
| "step": 5060 | |
| }, | |
| { | |
| "epoch": 1.2596273291925466, | |
| "grad_norm": 6.5852885246276855, | |
| "learning_rate": 0.00013705590062111802, | |
| "loss": 1.1248, | |
| "step": 5070 | |
| }, | |
| { | |
| "epoch": 1.262111801242236, | |
| "grad_norm": 6.009893417358398, | |
| "learning_rate": 0.00013693167701863353, | |
| "loss": 1.0595, | |
| "step": 5080 | |
| }, | |
| { | |
| "epoch": 1.2645962732919256, | |
| "grad_norm": 10.027131080627441, | |
| "learning_rate": 0.00013680745341614907, | |
| "loss": 1.193, | |
| "step": 5090 | |
| }, | |
| { | |
| "epoch": 1.2670807453416149, | |
| "grad_norm": 4.742192268371582, | |
| "learning_rate": 0.0001366832298136646, | |
| "loss": 0.9345, | |
| "step": 5100 | |
| }, | |
| { | |
| "epoch": 1.2670807453416149, | |
| "eval_accuracy": 0.7397694270879169, | |
| "eval_loss": 1.0074650049209595, | |
| "eval_runtime": 85.8817, | |
| "eval_samples_per_second": 132.31, | |
| "eval_steps_per_second": 16.546, | |
| "step": 5100 | |
| }, | |
| { | |
| "epoch": 1.2695652173913043, | |
| "grad_norm": 6.307586193084717, | |
| "learning_rate": 0.00013655900621118013, | |
| "loss": 0.8882, | |
| "step": 5110 | |
| }, | |
| { | |
| "epoch": 1.2720496894409938, | |
| "grad_norm": 5.385798454284668, | |
| "learning_rate": 0.00013643478260869568, | |
| "loss": 1.1246, | |
| "step": 5120 | |
| }, | |
| { | |
| "epoch": 1.274534161490683, | |
| "grad_norm": 10.382954597473145, | |
| "learning_rate": 0.0001363105590062112, | |
| "loss": 1.2195, | |
| "step": 5130 | |
| }, | |
| { | |
| "epoch": 1.2770186335403726, | |
| "grad_norm": 8.333847045898438, | |
| "learning_rate": 0.0001361863354037267, | |
| "loss": 1.0761, | |
| "step": 5140 | |
| }, | |
| { | |
| "epoch": 1.279503105590062, | |
| "grad_norm": 6.926821708679199, | |
| "learning_rate": 0.00013606211180124225, | |
| "loss": 1.151, | |
| "step": 5150 | |
| }, | |
| { | |
| "epoch": 1.2819875776397516, | |
| "grad_norm": 5.247950553894043, | |
| "learning_rate": 0.00013593788819875777, | |
| "loss": 0.9743, | |
| "step": 5160 | |
| }, | |
| { | |
| "epoch": 1.284472049689441, | |
| "grad_norm": 6.131479263305664, | |
| "learning_rate": 0.0001358136645962733, | |
| "loss": 0.982, | |
| "step": 5170 | |
| }, | |
| { | |
| "epoch": 1.2869565217391306, | |
| "grad_norm": 9.793872833251953, | |
| "learning_rate": 0.00013568944099378883, | |
| "loss": 1.2012, | |
| "step": 5180 | |
| }, | |
| { | |
| "epoch": 1.2894409937888198, | |
| "grad_norm": 6.260509014129639, | |
| "learning_rate": 0.00013556521739130435, | |
| "loss": 1.1532, | |
| "step": 5190 | |
| }, | |
| { | |
| "epoch": 1.2919254658385093, | |
| "grad_norm": 7.997650146484375, | |
| "learning_rate": 0.0001354409937888199, | |
| "loss": 0.9149, | |
| "step": 5200 | |
| }, | |
| { | |
| "epoch": 1.2919254658385093, | |
| "eval_accuracy": 0.7261286632051395, | |
| "eval_loss": 1.0558042526245117, | |
| "eval_runtime": 85.877, | |
| "eval_samples_per_second": 132.317, | |
| "eval_steps_per_second": 16.547, | |
| "step": 5200 | |
| }, | |
| { | |
| "epoch": 1.2944099378881988, | |
| "grad_norm": 5.47863245010376, | |
| "learning_rate": 0.0001353167701863354, | |
| "loss": 0.9028, | |
| "step": 5210 | |
| }, | |
| { | |
| "epoch": 1.296894409937888, | |
| "grad_norm": 8.695116996765137, | |
| "learning_rate": 0.00013519254658385095, | |
| "loss": 1.0238, | |
| "step": 5220 | |
| }, | |
| { | |
| "epoch": 1.2993788819875776, | |
| "grad_norm": 4.540287017822266, | |
| "learning_rate": 0.00013506832298136647, | |
| "loss": 1.2833, | |
| "step": 5230 | |
| }, | |
| { | |
| "epoch": 1.301863354037267, | |
| "grad_norm": 6.292470932006836, | |
| "learning_rate": 0.00013494409937888198, | |
| "loss": 1.1346, | |
| "step": 5240 | |
| }, | |
| { | |
| "epoch": 1.3043478260869565, | |
| "grad_norm": 11.708168983459473, | |
| "learning_rate": 0.00013481987577639753, | |
| "loss": 0.9925, | |
| "step": 5250 | |
| }, | |
| { | |
| "epoch": 1.306832298136646, | |
| "grad_norm": 7.93981409072876, | |
| "learning_rate": 0.00013469565217391304, | |
| "loss": 1.1607, | |
| "step": 5260 | |
| }, | |
| { | |
| "epoch": 1.3093167701863355, | |
| "grad_norm": 5.9505767822265625, | |
| "learning_rate": 0.00013457142857142856, | |
| "loss": 1.1483, | |
| "step": 5270 | |
| }, | |
| { | |
| "epoch": 1.3118012422360248, | |
| "grad_norm": 6.372278690338135, | |
| "learning_rate": 0.0001344472049689441, | |
| "loss": 0.9704, | |
| "step": 5280 | |
| }, | |
| { | |
| "epoch": 1.3142857142857143, | |
| "grad_norm": 5.066626071929932, | |
| "learning_rate": 0.00013432298136645965, | |
| "loss": 1.219, | |
| "step": 5290 | |
| }, | |
| { | |
| "epoch": 1.3167701863354038, | |
| "grad_norm": 7.538371562957764, | |
| "learning_rate": 0.00013419875776397516, | |
| "loss": 1.2583, | |
| "step": 5300 | |
| }, | |
| { | |
| "epoch": 1.3167701863354038, | |
| "eval_accuracy": 0.7476018657044794, | |
| "eval_loss": 0.97026127576828, | |
| "eval_runtime": 87.7379, | |
| "eval_samples_per_second": 129.511, | |
| "eval_steps_per_second": 16.196, | |
| "step": 5300 | |
| }, | |
| { | |
| "epoch": 1.319254658385093, | |
| "grad_norm": 6.197633266448975, | |
| "learning_rate": 0.0001340745341614907, | |
| "loss": 0.9438, | |
| "step": 5310 | |
| }, | |
| { | |
| "epoch": 1.3217391304347825, | |
| "grad_norm": 4.5123982429504395, | |
| "learning_rate": 0.00013395031055900622, | |
| "loss": 1.0034, | |
| "step": 5320 | |
| }, | |
| { | |
| "epoch": 1.324223602484472, | |
| "grad_norm": 9.826772689819336, | |
| "learning_rate": 0.00013382608695652174, | |
| "loss": 0.9244, | |
| "step": 5330 | |
| }, | |
| { | |
| "epoch": 1.3267080745341615, | |
| "grad_norm": 7.484212398529053, | |
| "learning_rate": 0.00013370186335403728, | |
| "loss": 1.1137, | |
| "step": 5340 | |
| }, | |
| { | |
| "epoch": 1.329192546583851, | |
| "grad_norm": 9.522153854370117, | |
| "learning_rate": 0.0001335776397515528, | |
| "loss": 1.075, | |
| "step": 5350 | |
| }, | |
| { | |
| "epoch": 1.3316770186335405, | |
| "grad_norm": 7.441765785217285, | |
| "learning_rate": 0.00013345341614906831, | |
| "loss": 1.2174, | |
| "step": 5360 | |
| }, | |
| { | |
| "epoch": 1.3341614906832298, | |
| "grad_norm": 6.224626064300537, | |
| "learning_rate": 0.00013332919254658386, | |
| "loss": 1.122, | |
| "step": 5370 | |
| }, | |
| { | |
| "epoch": 1.3366459627329192, | |
| "grad_norm": 14.881075859069824, | |
| "learning_rate": 0.0001332049689440994, | |
| "loss": 1.1255, | |
| "step": 5380 | |
| }, | |
| { | |
| "epoch": 1.3391304347826087, | |
| "grad_norm": 4.68292236328125, | |
| "learning_rate": 0.00013308074534161492, | |
| "loss": 1.2162, | |
| "step": 5390 | |
| }, | |
| { | |
| "epoch": 1.341614906832298, | |
| "grad_norm": 10.786056518554688, | |
| "learning_rate": 0.00013295652173913043, | |
| "loss": 1.0745, | |
| "step": 5400 | |
| }, | |
| { | |
| "epoch": 1.341614906832298, | |
| "eval_accuracy": 0.7424975798644724, | |
| "eval_loss": 0.9902403950691223, | |
| "eval_runtime": 87.4227, | |
| "eval_samples_per_second": 129.978, | |
| "eval_steps_per_second": 16.254, | |
| "step": 5400 | |
| }, | |
| { | |
| "epoch": 1.3440993788819875, | |
| "grad_norm": 6.61173152923584, | |
| "learning_rate": 0.00013283229813664598, | |
| "loss": 0.9695, | |
| "step": 5410 | |
| }, | |
| { | |
| "epoch": 1.346583850931677, | |
| "grad_norm": 5.859536170959473, | |
| "learning_rate": 0.0001327080745341615, | |
| "loss": 0.9959, | |
| "step": 5420 | |
| }, | |
| { | |
| "epoch": 1.3490683229813665, | |
| "grad_norm": 5.674126148223877, | |
| "learning_rate": 0.000132583850931677, | |
| "loss": 0.8, | |
| "step": 5430 | |
| }, | |
| { | |
| "epoch": 1.351552795031056, | |
| "grad_norm": 6.714157581329346, | |
| "learning_rate": 0.00013245962732919255, | |
| "loss": 1.2895, | |
| "step": 5440 | |
| }, | |
| { | |
| "epoch": 1.3540372670807455, | |
| "grad_norm": 5.819688320159912, | |
| "learning_rate": 0.00013233540372670807, | |
| "loss": 1.0128, | |
| "step": 5450 | |
| }, | |
| { | |
| "epoch": 1.3565217391304347, | |
| "grad_norm": 4.154235363006592, | |
| "learning_rate": 0.00013221118012422359, | |
| "loss": 1.0806, | |
| "step": 5460 | |
| }, | |
| { | |
| "epoch": 1.3590062111801242, | |
| "grad_norm": 3.743555784225464, | |
| "learning_rate": 0.00013208695652173916, | |
| "loss": 1.0332, | |
| "step": 5470 | |
| }, | |
| { | |
| "epoch": 1.3614906832298137, | |
| "grad_norm": 5.237468242645264, | |
| "learning_rate": 0.00013196273291925467, | |
| "loss": 0.8628, | |
| "step": 5480 | |
| }, | |
| { | |
| "epoch": 1.363975155279503, | |
| "grad_norm": 9.270702362060547, | |
| "learning_rate": 0.0001318385093167702, | |
| "loss": 0.7336, | |
| "step": 5490 | |
| }, | |
| { | |
| "epoch": 1.3664596273291925, | |
| "grad_norm": 6.079173564910889, | |
| "learning_rate": 0.00013171428571428573, | |
| "loss": 0.8319, | |
| "step": 5500 | |
| }, | |
| { | |
| "epoch": 1.3664596273291925, | |
| "eval_accuracy": 0.755346299392766, | |
| "eval_loss": 0.9442151784896851, | |
| "eval_runtime": 88.6963, | |
| "eval_samples_per_second": 128.111, | |
| "eval_steps_per_second": 16.021, | |
| "step": 5500 | |
| }, | |
| { | |
| "epoch": 1.368944099378882, | |
| "grad_norm": 6.590054035186768, | |
| "learning_rate": 0.00013159006211180125, | |
| "loss": 0.8682, | |
| "step": 5510 | |
| }, | |
| { | |
| "epoch": 1.3714285714285714, | |
| "grad_norm": 8.657280921936035, | |
| "learning_rate": 0.00013146583850931677, | |
| "loss": 1.0832, | |
| "step": 5520 | |
| }, | |
| { | |
| "epoch": 1.373913043478261, | |
| "grad_norm": 7.433463096618652, | |
| "learning_rate": 0.0001313416149068323, | |
| "loss": 1.0144, | |
| "step": 5530 | |
| }, | |
| { | |
| "epoch": 1.3763975155279504, | |
| "grad_norm": 10.5570650100708, | |
| "learning_rate": 0.00013121739130434783, | |
| "loss": 1.0187, | |
| "step": 5540 | |
| }, | |
| { | |
| "epoch": 1.3788819875776397, | |
| "grad_norm": 6.170913219451904, | |
| "learning_rate": 0.00013109316770186334, | |
| "loss": 0.9172, | |
| "step": 5550 | |
| }, | |
| { | |
| "epoch": 1.3813664596273292, | |
| "grad_norm": 6.9560394287109375, | |
| "learning_rate": 0.00013096894409937889, | |
| "loss": 0.9233, | |
| "step": 5560 | |
| }, | |
| { | |
| "epoch": 1.3838509316770187, | |
| "grad_norm": 5.400057315826416, | |
| "learning_rate": 0.00013084472049689443, | |
| "loss": 1.1142, | |
| "step": 5570 | |
| }, | |
| { | |
| "epoch": 1.386335403726708, | |
| "grad_norm": 6.7998433113098145, | |
| "learning_rate": 0.00013072049689440995, | |
| "loss": 1.0297, | |
| "step": 5580 | |
| }, | |
| { | |
| "epoch": 1.3888198757763974, | |
| "grad_norm": 6.90951681137085, | |
| "learning_rate": 0.0001305962732919255, | |
| "loss": 1.1061, | |
| "step": 5590 | |
| }, | |
| { | |
| "epoch": 1.391304347826087, | |
| "grad_norm": 6.948334217071533, | |
| "learning_rate": 0.000130472049689441, | |
| "loss": 1.1286, | |
| "step": 5600 | |
| }, | |
| { | |
| "epoch": 1.391304347826087, | |
| "eval_accuracy": 0.7532341811141424, | |
| "eval_loss": 0.9619560837745667, | |
| "eval_runtime": 87.4294, | |
| "eval_samples_per_second": 129.968, | |
| "eval_steps_per_second": 16.253, | |
| "step": 5600 | |
| }, | |
| { | |
| "epoch": 1.3937888198757764, | |
| "grad_norm": 2.2225635051727295, | |
| "learning_rate": 0.00013034782608695652, | |
| "loss": 0.8869, | |
| "step": 5610 | |
| }, | |
| { | |
| "epoch": 1.396273291925466, | |
| "grad_norm": 7.6301188468933105, | |
| "learning_rate": 0.00013022360248447206, | |
| "loss": 0.7048, | |
| "step": 5620 | |
| }, | |
| { | |
| "epoch": 1.3987577639751554, | |
| "grad_norm": 6.9699506759643555, | |
| "learning_rate": 0.00013009937888198758, | |
| "loss": 1.059, | |
| "step": 5630 | |
| }, | |
| { | |
| "epoch": 1.4012422360248447, | |
| "grad_norm": 8.951197624206543, | |
| "learning_rate": 0.0001299751552795031, | |
| "loss": 1.1901, | |
| "step": 5640 | |
| }, | |
| { | |
| "epoch": 1.4037267080745341, | |
| "grad_norm": 7.2019877433776855, | |
| "learning_rate": 0.00012985093167701864, | |
| "loss": 0.9462, | |
| "step": 5650 | |
| }, | |
| { | |
| "epoch": 1.4062111801242236, | |
| "grad_norm": 4.786462783813477, | |
| "learning_rate": 0.00012972670807453418, | |
| "loss": 1.0455, | |
| "step": 5660 | |
| }, | |
| { | |
| "epoch": 1.4086956521739131, | |
| "grad_norm": 4.615877628326416, | |
| "learning_rate": 0.0001296024844720497, | |
| "loss": 0.9419, | |
| "step": 5670 | |
| }, | |
| { | |
| "epoch": 1.4111801242236024, | |
| "grad_norm": 7.7541375160217285, | |
| "learning_rate": 0.00012947826086956522, | |
| "loss": 1.1388, | |
| "step": 5680 | |
| }, | |
| { | |
| "epoch": 1.4136645962732919, | |
| "grad_norm": 10.098551750183105, | |
| "learning_rate": 0.00012935403726708076, | |
| "loss": 1.1869, | |
| "step": 5690 | |
| }, | |
| { | |
| "epoch": 1.4161490683229814, | |
| "grad_norm": 6.00745964050293, | |
| "learning_rate": 0.00012922981366459628, | |
| "loss": 0.8228, | |
| "step": 5700 | |
| }, | |
| { | |
| "epoch": 1.4161490683229814, | |
| "eval_accuracy": 0.755522309249318, | |
| "eval_loss": 0.9329186081886292, | |
| "eval_runtime": 87.4839, | |
| "eval_samples_per_second": 129.887, | |
| "eval_steps_per_second": 16.243, | |
| "step": 5700 | |
| }, | |
| { | |
| "epoch": 1.4186335403726709, | |
| "grad_norm": 7.620040416717529, | |
| "learning_rate": 0.0001291055900621118, | |
| "loss": 0.8857, | |
| "step": 5710 | |
| }, | |
| { | |
| "epoch": 1.4211180124223604, | |
| "grad_norm": 5.4932169914245605, | |
| "learning_rate": 0.00012898136645962734, | |
| "loss": 1.2403, | |
| "step": 5720 | |
| }, | |
| { | |
| "epoch": 1.4236024844720496, | |
| "grad_norm": 6.197946071624756, | |
| "learning_rate": 0.0001288695652173913, | |
| "loss": 0.8465, | |
| "step": 5730 | |
| }, | |
| { | |
| "epoch": 1.4260869565217391, | |
| "grad_norm": 6.2294087409973145, | |
| "learning_rate": 0.00012874534161490684, | |
| "loss": 0.9501, | |
| "step": 5740 | |
| }, | |
| { | |
| "epoch": 1.4285714285714286, | |
| "grad_norm": 5.705041885375977, | |
| "learning_rate": 0.00012862111801242236, | |
| "loss": 1.1994, | |
| "step": 5750 | |
| }, | |
| { | |
| "epoch": 1.431055900621118, | |
| "grad_norm": 6.058370113372803, | |
| "learning_rate": 0.00012849689440993787, | |
| "loss": 1.1482, | |
| "step": 5760 | |
| }, | |
| { | |
| "epoch": 1.4335403726708074, | |
| "grad_norm": 8.761661529541016, | |
| "learning_rate": 0.00012837267080745345, | |
| "loss": 1.0147, | |
| "step": 5770 | |
| }, | |
| { | |
| "epoch": 1.4360248447204969, | |
| "grad_norm": 5.797641754150391, | |
| "learning_rate": 0.00012824844720496896, | |
| "loss": 1.2052, | |
| "step": 5780 | |
| }, | |
| { | |
| "epoch": 1.4385093167701863, | |
| "grad_norm": 5.235717296600342, | |
| "learning_rate": 0.00012812422360248448, | |
| "loss": 1.0181, | |
| "step": 5790 | |
| }, | |
| { | |
| "epoch": 1.4409937888198758, | |
| "grad_norm": 6.6115875244140625, | |
| "learning_rate": 0.00012800000000000002, | |
| "loss": 1.3209, | |
| "step": 5800 | |
| }, | |
| { | |
| "epoch": 1.4409937888198758, | |
| "eval_accuracy": 0.7542902402534541, | |
| "eval_loss": 0.9402074217796326, | |
| "eval_runtime": 86.5609, | |
| "eval_samples_per_second": 131.272, | |
| "eval_steps_per_second": 16.416, | |
| "step": 5800 | |
| }, | |
| { | |
| "epoch": 1.4434782608695653, | |
| "grad_norm": 5.539206504821777, | |
| "learning_rate": 0.00012787577639751554, | |
| "loss": 0.8167, | |
| "step": 5810 | |
| }, | |
| { | |
| "epoch": 1.4459627329192546, | |
| "grad_norm": 8.917939186096191, | |
| "learning_rate": 0.00012775155279503105, | |
| "loss": 0.8825, | |
| "step": 5820 | |
| }, | |
| { | |
| "epoch": 1.448447204968944, | |
| "grad_norm": 8.370964050292969, | |
| "learning_rate": 0.0001276273291925466, | |
| "loss": 1.1812, | |
| "step": 5830 | |
| }, | |
| { | |
| "epoch": 1.4509316770186336, | |
| "grad_norm": 8.157317161560059, | |
| "learning_rate": 0.00012750310559006211, | |
| "loss": 0.8365, | |
| "step": 5840 | |
| }, | |
| { | |
| "epoch": 1.453416149068323, | |
| "grad_norm": 8.257402420043945, | |
| "learning_rate": 0.00012737888198757763, | |
| "loss": 0.9687, | |
| "step": 5850 | |
| }, | |
| { | |
| "epoch": 1.4559006211180123, | |
| "grad_norm": 6.2165727615356445, | |
| "learning_rate": 0.00012725465838509317, | |
| "loss": 1.0794, | |
| "step": 5860 | |
| }, | |
| { | |
| "epoch": 1.4583850931677018, | |
| "grad_norm": 6.8931565284729, | |
| "learning_rate": 0.00012713043478260872, | |
| "loss": 1.0139, | |
| "step": 5870 | |
| }, | |
| { | |
| "epoch": 1.4608695652173913, | |
| "grad_norm": 6.232843399047852, | |
| "learning_rate": 0.00012700621118012423, | |
| "loss": 1.0135, | |
| "step": 5880 | |
| }, | |
| { | |
| "epoch": 1.4633540372670808, | |
| "grad_norm": 9.0387544631958, | |
| "learning_rate": 0.00012688198757763975, | |
| "loss": 1.039, | |
| "step": 5890 | |
| }, | |
| { | |
| "epoch": 1.4658385093167703, | |
| "grad_norm": 5.991683483123779, | |
| "learning_rate": 0.0001267577639751553, | |
| "loss": 0.7629, | |
| "step": 5900 | |
| }, | |
| { | |
| "epoch": 1.4658385093167703, | |
| "eval_accuracy": 0.7547302648948341, | |
| "eval_loss": 0.9496744275093079, | |
| "eval_runtime": 86.9169, | |
| "eval_samples_per_second": 130.734, | |
| "eval_steps_per_second": 16.349, | |
| "step": 5900 | |
| }, | |
| { | |
| "epoch": 1.4683229813664596, | |
| "grad_norm": 7.1583147048950195, | |
| "learning_rate": 0.0001266335403726708, | |
| "loss": 0.8985, | |
| "step": 5910 | |
| }, | |
| { | |
| "epoch": 1.470807453416149, | |
| "grad_norm": 7.79310941696167, | |
| "learning_rate": 0.00012650931677018633, | |
| "loss": 1.1252, | |
| "step": 5920 | |
| }, | |
| { | |
| "epoch": 1.4732919254658385, | |
| "grad_norm": 4.338858604431152, | |
| "learning_rate": 0.00012638509316770187, | |
| "loss": 0.9808, | |
| "step": 5930 | |
| }, | |
| { | |
| "epoch": 1.475776397515528, | |
| "grad_norm": 3.2830729484558105, | |
| "learning_rate": 0.00012626086956521739, | |
| "loss": 0.9988, | |
| "step": 5940 | |
| }, | |
| { | |
| "epoch": 1.4782608695652173, | |
| "grad_norm": 5.117250442504883, | |
| "learning_rate": 0.00012613664596273293, | |
| "loss": 0.9113, | |
| "step": 5950 | |
| }, | |
| { | |
| "epoch": 1.4807453416149068, | |
| "grad_norm": 4.326136589050293, | |
| "learning_rate": 0.00012601242236024847, | |
| "loss": 1.0195, | |
| "step": 5960 | |
| }, | |
| { | |
| "epoch": 1.4832298136645963, | |
| "grad_norm": 9.285099029541016, | |
| "learning_rate": 0.000125888198757764, | |
| "loss": 1.0247, | |
| "step": 5970 | |
| }, | |
| { | |
| "epoch": 1.4857142857142858, | |
| "grad_norm": 9.194808006286621, | |
| "learning_rate": 0.0001257639751552795, | |
| "loss": 1.1631, | |
| "step": 5980 | |
| }, | |
| { | |
| "epoch": 1.4881987577639753, | |
| "grad_norm": 4.7411885261535645, | |
| "learning_rate": 0.00012563975155279505, | |
| "loss": 0.8195, | |
| "step": 5990 | |
| }, | |
| { | |
| "epoch": 1.4906832298136645, | |
| "grad_norm": 7.099352836608887, | |
| "learning_rate": 0.00012551552795031057, | |
| "loss": 0.9906, | |
| "step": 6000 | |
| }, | |
| { | |
| "epoch": 1.4906832298136645, | |
| "eval_accuracy": 0.7588664965238053, | |
| "eval_loss": 0.9361943602561951, | |
| "eval_runtime": 87.6514, | |
| "eval_samples_per_second": 129.639, | |
| "eval_steps_per_second": 16.212, | |
| "step": 6000 | |
| }, | |
| { | |
| "epoch": 1.493167701863354, | |
| "grad_norm": 8.118821144104004, | |
| "learning_rate": 0.00012539130434782608, | |
| "loss": 1.1247, | |
| "step": 6010 | |
| }, | |
| { | |
| "epoch": 1.4956521739130435, | |
| "grad_norm": 10.393396377563477, | |
| "learning_rate": 0.00012526708074534162, | |
| "loss": 0.9778, | |
| "step": 6020 | |
| }, | |
| { | |
| "epoch": 1.498136645962733, | |
| "grad_norm": 5.61733865737915, | |
| "learning_rate": 0.00012514285714285714, | |
| "loss": 1.0013, | |
| "step": 6030 | |
| }, | |
| { | |
| "epoch": 1.5006211180124223, | |
| "grad_norm": 7.131757736206055, | |
| "learning_rate": 0.00012501863354037268, | |
| "loss": 0.7967, | |
| "step": 6040 | |
| }, | |
| { | |
| "epoch": 1.5031055900621118, | |
| "grad_norm": 5.835470676422119, | |
| "learning_rate": 0.0001248944099378882, | |
| "loss": 0.9079, | |
| "step": 6050 | |
| }, | |
| { | |
| "epoch": 1.5055900621118012, | |
| "grad_norm": 3.6993353366851807, | |
| "learning_rate": 0.00012477018633540374, | |
| "loss": 0.8018, | |
| "step": 6060 | |
| }, | |
| { | |
| "epoch": 1.5080745341614907, | |
| "grad_norm": 4.835446834564209, | |
| "learning_rate": 0.00012464596273291926, | |
| "loss": 1.1568, | |
| "step": 6070 | |
| }, | |
| { | |
| "epoch": 1.5105590062111802, | |
| "grad_norm": 4.084790229797363, | |
| "learning_rate": 0.00012452173913043478, | |
| "loss": 1.2725, | |
| "step": 6080 | |
| }, | |
| { | |
| "epoch": 1.5130434782608697, | |
| "grad_norm": 4.596613883972168, | |
| "learning_rate": 0.00012439751552795032, | |
| "loss": 1.0996, | |
| "step": 6090 | |
| }, | |
| { | |
| "epoch": 1.515527950310559, | |
| "grad_norm": 7.749314785003662, | |
| "learning_rate": 0.00012427329192546584, | |
| "loss": 0.9966, | |
| "step": 6100 | |
| }, | |
| { | |
| "epoch": 1.515527950310559, | |
| "eval_accuracy": 0.7594825310217372, | |
| "eval_loss": 0.9321704506874084, | |
| "eval_runtime": 86.7196, | |
| "eval_samples_per_second": 131.032, | |
| "eval_steps_per_second": 16.386, | |
| "step": 6100 | |
| }, | |
| { | |
| "epoch": 1.5180124223602485, | |
| "grad_norm": 5.206863880157471, | |
| "learning_rate": 0.00012414906832298135, | |
| "loss": 0.8907, | |
| "step": 6110 | |
| }, | |
| { | |
| "epoch": 1.5204968944099377, | |
| "grad_norm": 3.3592071533203125, | |
| "learning_rate": 0.0001240248447204969, | |
| "loss": 0.7821, | |
| "step": 6120 | |
| }, | |
| { | |
| "epoch": 1.5229813664596272, | |
| "grad_norm": 7.234273910522461, | |
| "learning_rate": 0.00012390062111801244, | |
| "loss": 1.0522, | |
| "step": 6130 | |
| }, | |
| { | |
| "epoch": 1.5254658385093167, | |
| "grad_norm": 8.088465690612793, | |
| "learning_rate": 0.00012377639751552796, | |
| "loss": 1.146, | |
| "step": 6140 | |
| }, | |
| { | |
| "epoch": 1.5279503105590062, | |
| "grad_norm": 6.445027828216553, | |
| "learning_rate": 0.0001236521739130435, | |
| "loss": 1.1889, | |
| "step": 6150 | |
| }, | |
| { | |
| "epoch": 1.5304347826086957, | |
| "grad_norm": 8.097786903381348, | |
| "learning_rate": 0.00012352795031055902, | |
| "loss": 1.0494, | |
| "step": 6160 | |
| }, | |
| { | |
| "epoch": 1.5329192546583852, | |
| "grad_norm": 7.564890384674072, | |
| "learning_rate": 0.00012340372670807453, | |
| "loss": 1.0297, | |
| "step": 6170 | |
| }, | |
| { | |
| "epoch": 1.5354037267080747, | |
| "grad_norm": 7.270158767700195, | |
| "learning_rate": 0.00012327950310559008, | |
| "loss": 1.1366, | |
| "step": 6180 | |
| }, | |
| { | |
| "epoch": 1.537888198757764, | |
| "grad_norm": 4.950170993804932, | |
| "learning_rate": 0.0001231552795031056, | |
| "loss": 0.9552, | |
| "step": 6190 | |
| }, | |
| { | |
| "epoch": 1.5403726708074534, | |
| "grad_norm": 5.859093189239502, | |
| "learning_rate": 0.0001230310559006211, | |
| "loss": 0.8868, | |
| "step": 6200 | |
| }, | |
| { | |
| "epoch": 1.5403726708074534, | |
| "eval_accuracy": 0.7505940332658629, | |
| "eval_loss": 0.9613372087478638, | |
| "eval_runtime": 87.5087, | |
| "eval_samples_per_second": 129.85, | |
| "eval_steps_per_second": 16.238, | |
| "step": 6200 | |
| }, | |
| { | |
| "epoch": 1.5428571428571427, | |
| "grad_norm": 7.968153476715088, | |
| "learning_rate": 0.00012290683229813665, | |
| "loss": 1.2027, | |
| "step": 6210 | |
| }, | |
| { | |
| "epoch": 1.5453416149068322, | |
| "grad_norm": 2.827946186065674, | |
| "learning_rate": 0.0001227826086956522, | |
| "loss": 0.7312, | |
| "step": 6220 | |
| }, | |
| { | |
| "epoch": 1.5478260869565217, | |
| "grad_norm": 8.215697288513184, | |
| "learning_rate": 0.0001226583850931677, | |
| "loss": 0.9336, | |
| "step": 6230 | |
| }, | |
| { | |
| "epoch": 1.5503105590062112, | |
| "grad_norm": 8.164762496948242, | |
| "learning_rate": 0.00012253416149068323, | |
| "loss": 0.782, | |
| "step": 6240 | |
| }, | |
| { | |
| "epoch": 1.5527950310559007, | |
| "grad_norm": 6.815315246582031, | |
| "learning_rate": 0.00012240993788819877, | |
| "loss": 0.897, | |
| "step": 6250 | |
| }, | |
| { | |
| "epoch": 1.5552795031055902, | |
| "grad_norm": 9.907848358154297, | |
| "learning_rate": 0.0001222857142857143, | |
| "loss": 1.0146, | |
| "step": 6260 | |
| }, | |
| { | |
| "epoch": 1.5577639751552796, | |
| "grad_norm": 3.322430372238159, | |
| "learning_rate": 0.0001221614906832298, | |
| "loss": 1.1132, | |
| "step": 6270 | |
| }, | |
| { | |
| "epoch": 1.560248447204969, | |
| "grad_norm": 5.496293067932129, | |
| "learning_rate": 0.00012203726708074535, | |
| "loss": 0.8865, | |
| "step": 6280 | |
| }, | |
| { | |
| "epoch": 1.5627329192546584, | |
| "grad_norm": 4.975622177124023, | |
| "learning_rate": 0.00012191304347826086, | |
| "loss": 0.9737, | |
| "step": 6290 | |
| }, | |
| { | |
| "epoch": 1.5652173913043477, | |
| "grad_norm": 10.409469604492188, | |
| "learning_rate": 0.0001217888198757764, | |
| "loss": 0.956, | |
| "step": 6300 | |
| }, | |
| { | |
| "epoch": 1.5652173913043477, | |
| "eval_accuracy": 0.7567543782451818, | |
| "eval_loss": 0.9370301365852356, | |
| "eval_runtime": 87.3636, | |
| "eval_samples_per_second": 130.066, | |
| "eval_steps_per_second": 16.265, | |
| "step": 6300 | |
| }, | |
| { | |
| "epoch": 1.5677018633540372, | |
| "grad_norm": 6.119087219238281, | |
| "learning_rate": 0.00012166459627329194, | |
| "loss": 0.8334, | |
| "step": 6310 | |
| }, | |
| { | |
| "epoch": 1.5701863354037267, | |
| "grad_norm": 9.4066162109375, | |
| "learning_rate": 0.00012154037267080747, | |
| "loss": 1.0246, | |
| "step": 6320 | |
| }, | |
| { | |
| "epoch": 1.5726708074534161, | |
| "grad_norm": 2.9001400470733643, | |
| "learning_rate": 0.000121416149068323, | |
| "loss": 1.1431, | |
| "step": 6330 | |
| }, | |
| { | |
| "epoch": 1.5751552795031056, | |
| "grad_norm": 4.719793796539307, | |
| "learning_rate": 0.00012129192546583851, | |
| "loss": 0.9183, | |
| "step": 6340 | |
| }, | |
| { | |
| "epoch": 1.5776397515527951, | |
| "grad_norm": 6.822214603424072, | |
| "learning_rate": 0.00012116770186335404, | |
| "loss": 1.0926, | |
| "step": 6350 | |
| }, | |
| { | |
| "epoch": 1.5801242236024846, | |
| "grad_norm": 7.05217170715332, | |
| "learning_rate": 0.00012104347826086957, | |
| "loss": 0.9341, | |
| "step": 6360 | |
| }, | |
| { | |
| "epoch": 1.5826086956521739, | |
| "grad_norm": 6.148478984832764, | |
| "learning_rate": 0.00012091925465838509, | |
| "loss": 0.9628, | |
| "step": 6370 | |
| }, | |
| { | |
| "epoch": 1.5850931677018634, | |
| "grad_norm": 5.6752095222473145, | |
| "learning_rate": 0.00012079503105590062, | |
| "loss": 1.1237, | |
| "step": 6380 | |
| }, | |
| { | |
| "epoch": 1.5875776397515526, | |
| "grad_norm": 6.509497165679932, | |
| "learning_rate": 0.00012067080745341615, | |
| "loss": 1.1021, | |
| "step": 6390 | |
| }, | |
| { | |
| "epoch": 1.5900621118012421, | |
| "grad_norm": 6.627172470092773, | |
| "learning_rate": 0.00012054658385093169, | |
| "loss": 1.1833, | |
| "step": 6400 | |
| }, | |
| { | |
| "epoch": 1.5900621118012421, | |
| "eval_accuracy": 0.7597465458065652, | |
| "eval_loss": 0.9276845455169678, | |
| "eval_runtime": 88.2091, | |
| "eval_samples_per_second": 128.819, | |
| "eval_steps_per_second": 16.109, | |
| "step": 6400 | |
| }, | |
| { | |
| "epoch": 1.5925465838509316, | |
| "grad_norm": 7.526735305786133, | |
| "learning_rate": 0.00012042236024844722, | |
| "loss": 0.8029, | |
| "step": 6410 | |
| }, | |
| { | |
| "epoch": 1.595031055900621, | |
| "grad_norm": 6.848104000091553, | |
| "learning_rate": 0.00012031055900621117, | |
| "loss": 1.1801, | |
| "step": 6420 | |
| }, | |
| { | |
| "epoch": 1.5975155279503106, | |
| "grad_norm": 7.543861389160156, | |
| "learning_rate": 0.00012018633540372673, | |
| "loss": 0.794, | |
| "step": 6430 | |
| }, | |
| { | |
| "epoch": 1.6, | |
| "grad_norm": 2.324418067932129, | |
| "learning_rate": 0.00012006211180124224, | |
| "loss": 1.0119, | |
| "step": 6440 | |
| }, | |
| { | |
| "epoch": 1.6024844720496896, | |
| "grad_norm": 6.490159511566162, | |
| "learning_rate": 0.00011993788819875777, | |
| "loss": 0.8435, | |
| "step": 6450 | |
| }, | |
| { | |
| "epoch": 1.6049689440993788, | |
| "grad_norm": 6.797852516174316, | |
| "learning_rate": 0.0001198136645962733, | |
| "loss": 0.9619, | |
| "step": 6460 | |
| }, | |
| { | |
| "epoch": 1.6074534161490683, | |
| "grad_norm": 5.924860954284668, | |
| "learning_rate": 0.00011968944099378882, | |
| "loss": 1.0926, | |
| "step": 6470 | |
| }, | |
| { | |
| "epoch": 1.6099378881987576, | |
| "grad_norm": 5.143548011779785, | |
| "learning_rate": 0.00011956521739130435, | |
| "loss": 0.9834, | |
| "step": 6480 | |
| }, | |
| { | |
| "epoch": 1.612422360248447, | |
| "grad_norm": 2.3223421573638916, | |
| "learning_rate": 0.00011944099378881988, | |
| "loss": 0.7827, | |
| "step": 6490 | |
| }, | |
| { | |
| "epoch": 1.6149068322981366, | |
| "grad_norm": 3.3075764179229736, | |
| "learning_rate": 0.0001193167701863354, | |
| "loss": 0.9747, | |
| "step": 6500 | |
| }, | |
| { | |
| "epoch": 1.6149068322981366, | |
| "eval_accuracy": 0.7696030977734754, | |
| "eval_loss": 0.8776896595954895, | |
| "eval_runtime": 86.0614, | |
| "eval_samples_per_second": 132.034, | |
| "eval_steps_per_second": 16.511, | |
| "step": 6500 | |
| }, | |
| { | |
| "epoch": 1.617391304347826, | |
| "grad_norm": 3.3240957260131836, | |
| "learning_rate": 0.00011919254658385093, | |
| "loss": 0.9756, | |
| "step": 6510 | |
| }, | |
| { | |
| "epoch": 1.6198757763975156, | |
| "grad_norm": 6.321386814117432, | |
| "learning_rate": 0.00011906832298136647, | |
| "loss": 0.918, | |
| "step": 6520 | |
| }, | |
| { | |
| "epoch": 1.622360248447205, | |
| "grad_norm": 6.500185012817383, | |
| "learning_rate": 0.000118944099378882, | |
| "loss": 0.9901, | |
| "step": 6530 | |
| }, | |
| { | |
| "epoch": 1.6248447204968945, | |
| "grad_norm": 8.747745513916016, | |
| "learning_rate": 0.00011881987577639753, | |
| "loss": 0.9637, | |
| "step": 6540 | |
| }, | |
| { | |
| "epoch": 1.6273291925465838, | |
| "grad_norm": 5.210270881652832, | |
| "learning_rate": 0.00011869565217391305, | |
| "loss": 0.921, | |
| "step": 6550 | |
| }, | |
| { | |
| "epoch": 1.6298136645962733, | |
| "grad_norm": 5.422876358032227, | |
| "learning_rate": 0.00011857142857142858, | |
| "loss": 1.0392, | |
| "step": 6560 | |
| }, | |
| { | |
| "epoch": 1.6322981366459626, | |
| "grad_norm": 7.760617733001709, | |
| "learning_rate": 0.0001184472049689441, | |
| "loss": 0.835, | |
| "step": 6570 | |
| }, | |
| { | |
| "epoch": 1.634782608695652, | |
| "grad_norm": 5.978461265563965, | |
| "learning_rate": 0.00011832298136645962, | |
| "loss": 1.2663, | |
| "step": 6580 | |
| }, | |
| { | |
| "epoch": 1.6372670807453416, | |
| "grad_norm": 4.057701587677002, | |
| "learning_rate": 0.00011819875776397515, | |
| "loss": 0.9839, | |
| "step": 6590 | |
| }, | |
| { | |
| "epoch": 1.639751552795031, | |
| "grad_norm": 6.924076557159424, | |
| "learning_rate": 0.00011807453416149068, | |
| "loss": 1.0119, | |
| "step": 6600 | |
| }, | |
| { | |
| "epoch": 1.639751552795031, | |
| "eval_accuracy": 0.7652908562879521, | |
| "eval_loss": 0.8980146050453186, | |
| "eval_runtime": 85.9497, | |
| "eval_samples_per_second": 132.205, | |
| "eval_steps_per_second": 16.533, | |
| "step": 6600 | |
| }, | |
| { | |
| "epoch": 1.6422360248447205, | |
| "grad_norm": 6.758317470550537, | |
| "learning_rate": 0.00011795031055900623, | |
| "loss": 0.9603, | |
| "step": 6610 | |
| }, | |
| { | |
| "epoch": 1.64472049689441, | |
| "grad_norm": 8.458471298217773, | |
| "learning_rate": 0.00011782608695652176, | |
| "loss": 1.0986, | |
| "step": 6620 | |
| }, | |
| { | |
| "epoch": 1.6472049689440995, | |
| "grad_norm": 5.507945537567139, | |
| "learning_rate": 0.00011770186335403727, | |
| "loss": 0.9222, | |
| "step": 6630 | |
| }, | |
| { | |
| "epoch": 1.6496894409937888, | |
| "grad_norm": 6.546318531036377, | |
| "learning_rate": 0.0001175776397515528, | |
| "loss": 0.735, | |
| "step": 6640 | |
| }, | |
| { | |
| "epoch": 1.6521739130434783, | |
| "grad_norm": 7.688220500946045, | |
| "learning_rate": 0.00011745341614906833, | |
| "loss": 1.0007, | |
| "step": 6650 | |
| }, | |
| { | |
| "epoch": 1.6546583850931675, | |
| "grad_norm": 8.641738891601562, | |
| "learning_rate": 0.00011732919254658385, | |
| "loss": 0.7686, | |
| "step": 6660 | |
| }, | |
| { | |
| "epoch": 1.657142857142857, | |
| "grad_norm": 7.91213321685791, | |
| "learning_rate": 0.00011720496894409938, | |
| "loss": 0.9509, | |
| "step": 6670 | |
| }, | |
| { | |
| "epoch": 1.6596273291925465, | |
| "grad_norm": 9.004672050476074, | |
| "learning_rate": 0.00011708074534161491, | |
| "loss": 0.7764, | |
| "step": 6680 | |
| }, | |
| { | |
| "epoch": 1.662111801242236, | |
| "grad_norm": 7.412413120269775, | |
| "learning_rate": 0.00011695652173913042, | |
| "loss": 1.0701, | |
| "step": 6690 | |
| }, | |
| { | |
| "epoch": 1.6645962732919255, | |
| "grad_norm": 5.0252885818481445, | |
| "learning_rate": 0.00011683229813664598, | |
| "loss": 0.9764, | |
| "step": 6700 | |
| }, | |
| { | |
| "epoch": 1.6645962732919255, | |
| "eval_accuracy": 0.7641467922203643, | |
| "eval_loss": 0.9070652723312378, | |
| "eval_runtime": 88.0089, | |
| "eval_samples_per_second": 129.112, | |
| "eval_steps_per_second": 16.146, | |
| "step": 6700 | |
| }, | |
| { | |
| "epoch": 1.667080745341615, | |
| "grad_norm": 6.071985244750977, | |
| "learning_rate": 0.0001167080745341615, | |
| "loss": 0.9533, | |
| "step": 6710 | |
| }, | |
| { | |
| "epoch": 1.6695652173913045, | |
| "grad_norm": 7.6646809577941895, | |
| "learning_rate": 0.00011658385093167703, | |
| "loss": 0.888, | |
| "step": 6720 | |
| }, | |
| { | |
| "epoch": 1.6720496894409937, | |
| "grad_norm": 7.314651012420654, | |
| "learning_rate": 0.00011645962732919256, | |
| "loss": 0.9252, | |
| "step": 6730 | |
| }, | |
| { | |
| "epoch": 1.6745341614906832, | |
| "grad_norm": 5.55505895614624, | |
| "learning_rate": 0.00011633540372670809, | |
| "loss": 0.9717, | |
| "step": 6740 | |
| }, | |
| { | |
| "epoch": 1.6770186335403725, | |
| "grad_norm": 6.546708583831787, | |
| "learning_rate": 0.0001162111801242236, | |
| "loss": 0.8291, | |
| "step": 6750 | |
| }, | |
| { | |
| "epoch": 1.679503105590062, | |
| "grad_norm": 6.897370338439941, | |
| "learning_rate": 0.00011608695652173913, | |
| "loss": 1.0541, | |
| "step": 6760 | |
| }, | |
| { | |
| "epoch": 1.6819875776397515, | |
| "grad_norm": 5.658356666564941, | |
| "learning_rate": 0.00011596273291925466, | |
| "loss": 1.2573, | |
| "step": 6770 | |
| }, | |
| { | |
| "epoch": 1.684472049689441, | |
| "grad_norm": 9.185235977172852, | |
| "learning_rate": 0.00011583850931677018, | |
| "loss": 1.133, | |
| "step": 6780 | |
| }, | |
| { | |
| "epoch": 1.6869565217391305, | |
| "grad_norm": 6.854763507843018, | |
| "learning_rate": 0.00011571428571428574, | |
| "loss": 0.9488, | |
| "step": 6790 | |
| }, | |
| { | |
| "epoch": 1.68944099378882, | |
| "grad_norm": 6.5308990478515625, | |
| "learning_rate": 0.00011559006211180125, | |
| "loss": 1.0528, | |
| "step": 6800 | |
| }, | |
| { | |
| "epoch": 1.68944099378882, | |
| "eval_accuracy": 0.7694270879169234, | |
| "eval_loss": 0.8940765857696533, | |
| "eval_runtime": 87.1629, | |
| "eval_samples_per_second": 130.365, | |
| "eval_steps_per_second": 16.303, | |
| "step": 6800 | |
| }, | |
| { | |
| "epoch": 1.6919254658385094, | |
| "grad_norm": 4.403570652008057, | |
| "learning_rate": 0.00011546583850931678, | |
| "loss": 0.8713, | |
| "step": 6810 | |
| }, | |
| { | |
| "epoch": 1.6944099378881987, | |
| "grad_norm": 6.358486175537109, | |
| "learning_rate": 0.00011534161490683231, | |
| "loss": 0.977, | |
| "step": 6820 | |
| }, | |
| { | |
| "epoch": 1.6968944099378882, | |
| "grad_norm": 7.4040608406066895, | |
| "learning_rate": 0.00011521739130434783, | |
| "loss": 1.1085, | |
| "step": 6830 | |
| }, | |
| { | |
| "epoch": 1.6993788819875777, | |
| "grad_norm": 6.154741287231445, | |
| "learning_rate": 0.00011509316770186336, | |
| "loss": 0.9678, | |
| "step": 6840 | |
| }, | |
| { | |
| "epoch": 1.701863354037267, | |
| "grad_norm": 6.781441688537598, | |
| "learning_rate": 0.00011496894409937889, | |
| "loss": 0.8432, | |
| "step": 6850 | |
| }, | |
| { | |
| "epoch": 1.7043478260869565, | |
| "grad_norm": 6.97227144241333, | |
| "learning_rate": 0.0001148447204968944, | |
| "loss": 0.7707, | |
| "step": 6860 | |
| }, | |
| { | |
| "epoch": 1.706832298136646, | |
| "grad_norm": 8.75203800201416, | |
| "learning_rate": 0.00011472049689440994, | |
| "loss": 0.7618, | |
| "step": 6870 | |
| }, | |
| { | |
| "epoch": 1.7093167701863354, | |
| "grad_norm": 8.073197364807129, | |
| "learning_rate": 0.00011459627329192548, | |
| "loss": 1.0681, | |
| "step": 6880 | |
| }, | |
| { | |
| "epoch": 1.711801242236025, | |
| "grad_norm": 6.717360973358154, | |
| "learning_rate": 0.00011447204968944101, | |
| "loss": 0.9677, | |
| "step": 6890 | |
| }, | |
| { | |
| "epoch": 1.7142857142857144, | |
| "grad_norm": 5.445791721343994, | |
| "learning_rate": 0.00011434782608695654, | |
| "loss": 0.942, | |
| "step": 6900 | |
| }, | |
| { | |
| "epoch": 1.7142857142857144, | |
| "eval_accuracy": 0.7736513244741705, | |
| "eval_loss": 0.8718106746673584, | |
| "eval_runtime": 86.3638, | |
| "eval_samples_per_second": 131.571, | |
| "eval_steps_per_second": 16.454, | |
| "step": 6900 | |
| }, | |
| { | |
| "epoch": 1.7167701863354037, | |
| "grad_norm": 5.544734954833984, | |
| "learning_rate": 0.00011422360248447206, | |
| "loss": 0.7708, | |
| "step": 6910 | |
| }, | |
| { | |
| "epoch": 1.7192546583850932, | |
| "grad_norm": 4.751190662384033, | |
| "learning_rate": 0.00011409937888198759, | |
| "loss": 1.0393, | |
| "step": 6920 | |
| }, | |
| { | |
| "epoch": 1.7217391304347827, | |
| "grad_norm": 4.869985580444336, | |
| "learning_rate": 0.00011397515527950311, | |
| "loss": 0.8267, | |
| "step": 6930 | |
| }, | |
| { | |
| "epoch": 1.724223602484472, | |
| "grad_norm": 4.8316168785095215, | |
| "learning_rate": 0.00011385093167701863, | |
| "loss": 0.9154, | |
| "step": 6940 | |
| }, | |
| { | |
| "epoch": 1.7267080745341614, | |
| "grad_norm": 5.959396839141846, | |
| "learning_rate": 0.00011372670807453416, | |
| "loss": 1.066, | |
| "step": 6950 | |
| }, | |
| { | |
| "epoch": 1.729192546583851, | |
| "grad_norm": 2.427189826965332, | |
| "learning_rate": 0.00011360248447204969, | |
| "loss": 0.6803, | |
| "step": 6960 | |
| }, | |
| { | |
| "epoch": 1.7316770186335404, | |
| "grad_norm": 6.201396942138672, | |
| "learning_rate": 0.00011347826086956523, | |
| "loss": 0.7596, | |
| "step": 6970 | |
| }, | |
| { | |
| "epoch": 1.73416149068323, | |
| "grad_norm": 9.373711585998535, | |
| "learning_rate": 0.00011335403726708076, | |
| "loss": 0.8998, | |
| "step": 6980 | |
| }, | |
| { | |
| "epoch": 1.7366459627329194, | |
| "grad_norm": 4.7054643630981445, | |
| "learning_rate": 0.00011322981366459628, | |
| "loss": 1.1068, | |
| "step": 6990 | |
| }, | |
| { | |
| "epoch": 1.7391304347826086, | |
| "grad_norm": 7.425700664520264, | |
| "learning_rate": 0.00011310559006211181, | |
| "loss": 1.0387, | |
| "step": 7000 | |
| }, | |
| { | |
| "epoch": 1.7391304347826086, | |
| "eval_accuracy": 0.7786676053859016, | |
| "eval_loss": 0.8614795804023743, | |
| "eval_runtime": 86.4009, | |
| "eval_samples_per_second": 131.515, | |
| "eval_steps_per_second": 16.447, | |
| "step": 7000 | |
| }, | |
| { | |
| "epoch": 1.7416149068322981, | |
| "grad_norm": 5.01289176940918, | |
| "learning_rate": 0.00011298136645962734, | |
| "loss": 1.0977, | |
| "step": 7010 | |
| }, | |
| { | |
| "epoch": 1.7440993788819876, | |
| "grad_norm": 7.544558048248291, | |
| "learning_rate": 0.00011285714285714286, | |
| "loss": 1.1391, | |
| "step": 7020 | |
| }, | |
| { | |
| "epoch": 1.746583850931677, | |
| "grad_norm": 5.905050277709961, | |
| "learning_rate": 0.00011273291925465839, | |
| "loss": 0.9768, | |
| "step": 7030 | |
| }, | |
| { | |
| "epoch": 1.7490683229813664, | |
| "grad_norm": 4.24083137512207, | |
| "learning_rate": 0.00011260869565217392, | |
| "loss": 1.0744, | |
| "step": 7040 | |
| }, | |
| { | |
| "epoch": 1.7515527950310559, | |
| "grad_norm": 2.2467899322509766, | |
| "learning_rate": 0.00011248447204968943, | |
| "loss": 0.8104, | |
| "step": 7050 | |
| }, | |
| { | |
| "epoch": 1.7540372670807454, | |
| "grad_norm": 6.543946266174316, | |
| "learning_rate": 0.00011236024844720496, | |
| "loss": 0.9234, | |
| "step": 7060 | |
| }, | |
| { | |
| "epoch": 1.7565217391304349, | |
| "grad_norm": 5.305374622344971, | |
| "learning_rate": 0.0001122360248447205, | |
| "loss": 0.9713, | |
| "step": 7070 | |
| }, | |
| { | |
| "epoch": 1.7590062111801243, | |
| "grad_norm": 7.800411224365234, | |
| "learning_rate": 0.00011211180124223604, | |
| "loss": 0.7504, | |
| "step": 7080 | |
| }, | |
| { | |
| "epoch": 1.7614906832298136, | |
| "grad_norm": 7.4360432624816895, | |
| "learning_rate": 0.00011198757763975157, | |
| "loss": 1.0139, | |
| "step": 7090 | |
| }, | |
| { | |
| "epoch": 1.763975155279503, | |
| "grad_norm": 6.3255934715271, | |
| "learning_rate": 0.00011186335403726708, | |
| "loss": 0.9054, | |
| "step": 7100 | |
| }, | |
| { | |
| "epoch": 1.763975155279503, | |
| "eval_accuracy": 0.7734753146176185, | |
| "eval_loss": 0.8689095973968506, | |
| "eval_runtime": 87.8349, | |
| "eval_samples_per_second": 129.368, | |
| "eval_steps_per_second": 16.178, | |
| "step": 7100 | |
| }, | |
| { | |
| "epoch": 1.7664596273291926, | |
| "grad_norm": 11.395488739013672, | |
| "learning_rate": 0.00011173913043478261, | |
| "loss": 1.1122, | |
| "step": 7110 | |
| }, | |
| { | |
| "epoch": 1.7689440993788819, | |
| "grad_norm": 6.530506610870361, | |
| "learning_rate": 0.00011161490683229814, | |
| "loss": 0.9217, | |
| "step": 7120 | |
| }, | |
| { | |
| "epoch": 1.7714285714285714, | |
| "grad_norm": 3.929171085357666, | |
| "learning_rate": 0.00011149068322981366, | |
| "loss": 0.9403, | |
| "step": 7130 | |
| }, | |
| { | |
| "epoch": 1.7739130434782608, | |
| "grad_norm": 5.387374401092529, | |
| "learning_rate": 0.00011136645962732919, | |
| "loss": 0.8515, | |
| "step": 7140 | |
| }, | |
| { | |
| "epoch": 1.7763975155279503, | |
| "grad_norm": 3.4766998291015625, | |
| "learning_rate": 0.00011124223602484472, | |
| "loss": 0.9208, | |
| "step": 7150 | |
| }, | |
| { | |
| "epoch": 1.7788819875776398, | |
| "grad_norm": 6.483366012573242, | |
| "learning_rate": 0.00011111801242236026, | |
| "loss": 0.9254, | |
| "step": 7160 | |
| }, | |
| { | |
| "epoch": 1.7813664596273293, | |
| "grad_norm": 3.7569687366485596, | |
| "learning_rate": 0.00011099378881987579, | |
| "loss": 0.9812, | |
| "step": 7170 | |
| }, | |
| { | |
| "epoch": 1.7838509316770186, | |
| "grad_norm": 5.825034141540527, | |
| "learning_rate": 0.00011086956521739131, | |
| "loss": 0.9628, | |
| "step": 7180 | |
| }, | |
| { | |
| "epoch": 1.786335403726708, | |
| "grad_norm": 9.814273834228516, | |
| "learning_rate": 0.00011074534161490684, | |
| "loss": 1.1503, | |
| "step": 7190 | |
| }, | |
| { | |
| "epoch": 1.7888198757763976, | |
| "grad_norm": 6.026792526245117, | |
| "learning_rate": 0.00011062111801242237, | |
| "loss": 1.0327, | |
| "step": 7200 | |
| }, | |
| { | |
| "epoch": 1.7888198757763976, | |
| "eval_accuracy": 0.7691630731320954, | |
| "eval_loss": 0.8953230977058411, | |
| "eval_runtime": 87.5399, | |
| "eval_samples_per_second": 129.804, | |
| "eval_steps_per_second": 16.233, | |
| "step": 7200 | |
| }, | |
| { | |
| "epoch": 1.7913043478260868, | |
| "grad_norm": 8.353828430175781, | |
| "learning_rate": 0.00011049689440993788, | |
| "loss": 0.9956, | |
| "step": 7210 | |
| }, | |
| { | |
| "epoch": 1.7937888198757763, | |
| "grad_norm": 4.231791019439697, | |
| "learning_rate": 0.00011037267080745341, | |
| "loss": 1.0019, | |
| "step": 7220 | |
| }, | |
| { | |
| "epoch": 1.7962732919254658, | |
| "grad_norm": 6.863067626953125, | |
| "learning_rate": 0.00011024844720496894, | |
| "loss": 0.8933, | |
| "step": 7230 | |
| }, | |
| { | |
| "epoch": 1.7987577639751553, | |
| "grad_norm": 5.806077003479004, | |
| "learning_rate": 0.00011012422360248446, | |
| "loss": 0.7849, | |
| "step": 7240 | |
| }, | |
| { | |
| "epoch": 1.8012422360248448, | |
| "grad_norm": 4.928778648376465, | |
| "learning_rate": 0.00011000000000000002, | |
| "loss": 1.0724, | |
| "step": 7250 | |
| }, | |
| { | |
| "epoch": 1.8037267080745343, | |
| "grad_norm": 4.490487098693848, | |
| "learning_rate": 0.00010987577639751553, | |
| "loss": 0.9406, | |
| "step": 7260 | |
| }, | |
| { | |
| "epoch": 1.8062111801242235, | |
| "grad_norm": 5.663939952850342, | |
| "learning_rate": 0.00010975155279503106, | |
| "loss": 0.9368, | |
| "step": 7270 | |
| }, | |
| { | |
| "epoch": 1.808695652173913, | |
| "grad_norm": 8.136780738830566, | |
| "learning_rate": 0.0001096273291925466, | |
| "loss": 0.8623, | |
| "step": 7280 | |
| }, | |
| { | |
| "epoch": 1.8111801242236025, | |
| "grad_norm": 7.248380184173584, | |
| "learning_rate": 0.00010950310559006211, | |
| "loss": 1.2673, | |
| "step": 7290 | |
| }, | |
| { | |
| "epoch": 1.8136645962732918, | |
| "grad_norm": 5.766163349151611, | |
| "learning_rate": 0.00010937888198757764, | |
| "loss": 0.8425, | |
| "step": 7300 | |
| }, | |
| { | |
| "epoch": 1.8136645962732918, | |
| "eval_accuracy": 0.7761154624658981, | |
| "eval_loss": 0.8532983064651489, | |
| "eval_runtime": 86.6152, | |
| "eval_samples_per_second": 131.189, | |
| "eval_steps_per_second": 16.406, | |
| "step": 7300 | |
| }, | |
| { | |
| "epoch": 1.8161490683229813, | |
| "grad_norm": 7.9946465492248535, | |
| "learning_rate": 0.00010925465838509317, | |
| "loss": 1.072, | |
| "step": 7310 | |
| }, | |
| { | |
| "epoch": 1.8186335403726708, | |
| "grad_norm": 8.763626098632812, | |
| "learning_rate": 0.00010913043478260869, | |
| "loss": 0.925, | |
| "step": 7320 | |
| }, | |
| { | |
| "epoch": 1.8211180124223603, | |
| "grad_norm": 8.264079093933105, | |
| "learning_rate": 0.00010900621118012422, | |
| "loss": 1.0853, | |
| "step": 7330 | |
| }, | |
| { | |
| "epoch": 1.8236024844720498, | |
| "grad_norm": 5.349701404571533, | |
| "learning_rate": 0.00010888198757763976, | |
| "loss": 1.0933, | |
| "step": 7340 | |
| }, | |
| { | |
| "epoch": 1.8260869565217392, | |
| "grad_norm": 4.295293807983398, | |
| "learning_rate": 0.00010875776397515529, | |
| "loss": 1.0202, | |
| "step": 7350 | |
| }, | |
| { | |
| "epoch": 1.8285714285714287, | |
| "grad_norm": 5.092330455780029, | |
| "learning_rate": 0.00010863354037267082, | |
| "loss": 0.9496, | |
| "step": 7360 | |
| }, | |
| { | |
| "epoch": 1.831055900621118, | |
| "grad_norm": 7.8343424797058105, | |
| "learning_rate": 0.00010850931677018634, | |
| "loss": 1.042, | |
| "step": 7370 | |
| }, | |
| { | |
| "epoch": 1.8335403726708075, | |
| "grad_norm": 5.031234264373779, | |
| "learning_rate": 0.00010838509316770187, | |
| "loss": 0.9133, | |
| "step": 7380 | |
| }, | |
| { | |
| "epoch": 1.8360248447204968, | |
| "grad_norm": 7.025552749633789, | |
| "learning_rate": 0.0001082608695652174, | |
| "loss": 0.78, | |
| "step": 7390 | |
| }, | |
| { | |
| "epoch": 1.8385093167701863, | |
| "grad_norm": 3.6854496002197266, | |
| "learning_rate": 0.00010813664596273293, | |
| "loss": 0.9388, | |
| "step": 7400 | |
| }, | |
| { | |
| "epoch": 1.8385093167701863, | |
| "eval_accuracy": 0.7687230484907155, | |
| "eval_loss": 0.8771804571151733, | |
| "eval_runtime": 88.2832, | |
| "eval_samples_per_second": 128.711, | |
| "eval_steps_per_second": 16.096, | |
| "step": 7400 | |
| }, | |
| { | |
| "epoch": 1.8409937888198757, | |
| "grad_norm": 5.7331013679504395, | |
| "learning_rate": 0.00010801242236024844, | |
| "loss": 0.9818, | |
| "step": 7410 | |
| }, | |
| { | |
| "epoch": 1.8434782608695652, | |
| "grad_norm": 6.12167501449585, | |
| "learning_rate": 0.00010788819875776397, | |
| "loss": 0.9954, | |
| "step": 7420 | |
| }, | |
| { | |
| "epoch": 1.8459627329192547, | |
| "grad_norm": 8.437973022460938, | |
| "learning_rate": 0.00010776397515527951, | |
| "loss": 0.9886, | |
| "step": 7430 | |
| }, | |
| { | |
| "epoch": 1.8484472049689442, | |
| "grad_norm": 7.553098201751709, | |
| "learning_rate": 0.00010763975155279504, | |
| "loss": 0.9144, | |
| "step": 7440 | |
| }, | |
| { | |
| "epoch": 1.8509316770186337, | |
| "grad_norm": 7.748224258422852, | |
| "learning_rate": 0.00010751552795031057, | |
| "loss": 1.0153, | |
| "step": 7450 | |
| }, | |
| { | |
| "epoch": 1.853416149068323, | |
| "grad_norm": 7.518005847930908, | |
| "learning_rate": 0.00010739130434782609, | |
| "loss": 0.8619, | |
| "step": 7460 | |
| }, | |
| { | |
| "epoch": 1.8559006211180125, | |
| "grad_norm": 8.89167308807373, | |
| "learning_rate": 0.00010726708074534162, | |
| "loss": 1.0365, | |
| "step": 7470 | |
| }, | |
| { | |
| "epoch": 1.8583850931677017, | |
| "grad_norm": 5.566318035125732, | |
| "learning_rate": 0.00010714285714285715, | |
| "loss": 1.1217, | |
| "step": 7480 | |
| }, | |
| { | |
| "epoch": 1.8608695652173912, | |
| "grad_norm": 5.506089687347412, | |
| "learning_rate": 0.00010701863354037267, | |
| "loss": 1.107, | |
| "step": 7490 | |
| }, | |
| { | |
| "epoch": 1.8633540372670807, | |
| "grad_norm": 4.13236141204834, | |
| "learning_rate": 0.0001068944099378882, | |
| "loss": 1.1037, | |
| "step": 7500 | |
| }, | |
| { | |
| "epoch": 1.8633540372670807, | |
| "eval_accuracy": 0.7731232949045147, | |
| "eval_loss": 0.8634147047996521, | |
| "eval_runtime": 87.6771, | |
| "eval_samples_per_second": 129.6, | |
| "eval_steps_per_second": 16.207, | |
| "step": 7500 | |
| }, | |
| { | |
| "epoch": 1.8658385093167702, | |
| "grad_norm": 3.6756432056427, | |
| "learning_rate": 0.00010677018633540373, | |
| "loss": 0.8018, | |
| "step": 7510 | |
| }, | |
| { | |
| "epoch": 1.8683229813664597, | |
| "grad_norm": 3.4403350353240967, | |
| "learning_rate": 0.00010664596273291927, | |
| "loss": 0.8836, | |
| "step": 7520 | |
| }, | |
| { | |
| "epoch": 1.8708074534161492, | |
| "grad_norm": 8.637625694274902, | |
| "learning_rate": 0.0001065217391304348, | |
| "loss": 0.9809, | |
| "step": 7530 | |
| }, | |
| { | |
| "epoch": 1.8732919254658387, | |
| "grad_norm": 7.03044319152832, | |
| "learning_rate": 0.00010639751552795032, | |
| "loss": 0.9337, | |
| "step": 7540 | |
| }, | |
| { | |
| "epoch": 1.875776397515528, | |
| "grad_norm": 5.361702919006348, | |
| "learning_rate": 0.00010627329192546585, | |
| "loss": 0.9817, | |
| "step": 7550 | |
| }, | |
| { | |
| "epoch": 1.8782608695652174, | |
| "grad_norm": 5.379118919372559, | |
| "learning_rate": 0.00010614906832298138, | |
| "loss": 0.9618, | |
| "step": 7560 | |
| }, | |
| { | |
| "epoch": 1.8807453416149067, | |
| "grad_norm": 6.078188896179199, | |
| "learning_rate": 0.00010602484472049689, | |
| "loss": 1.2285, | |
| "step": 7570 | |
| }, | |
| { | |
| "epoch": 1.8832298136645962, | |
| "grad_norm": 7.805136680603027, | |
| "learning_rate": 0.00010590062111801242, | |
| "loss": 0.9148, | |
| "step": 7580 | |
| }, | |
| { | |
| "epoch": 1.8857142857142857, | |
| "grad_norm": 8.38199234008789, | |
| "learning_rate": 0.00010577639751552795, | |
| "loss": 0.9053, | |
| "step": 7590 | |
| }, | |
| { | |
| "epoch": 1.8881987577639752, | |
| "grad_norm": 8.421182632446289, | |
| "learning_rate": 0.00010565217391304347, | |
| "loss": 0.9659, | |
| "step": 7600 | |
| }, | |
| { | |
| "epoch": 1.8881987577639752, | |
| "eval_accuracy": 0.7766434920355539, | |
| "eval_loss": 0.8502032160758972, | |
| "eval_runtime": 87.3847, | |
| "eval_samples_per_second": 130.034, | |
| "eval_steps_per_second": 16.261, | |
| "step": 7600 | |
| }, | |
| { | |
| "epoch": 1.8906832298136647, | |
| "grad_norm": 7.435909271240234, | |
| "learning_rate": 0.00010552795031055903, | |
| "loss": 0.8987, | |
| "step": 7610 | |
| }, | |
| { | |
| "epoch": 1.8931677018633541, | |
| "grad_norm": 5.804107189178467, | |
| "learning_rate": 0.00010540372670807454, | |
| "loss": 0.7558, | |
| "step": 7620 | |
| }, | |
| { | |
| "epoch": 1.8956521739130436, | |
| "grad_norm": 9.431636810302734, | |
| "learning_rate": 0.00010527950310559007, | |
| "loss": 0.8512, | |
| "step": 7630 | |
| }, | |
| { | |
| "epoch": 1.898136645962733, | |
| "grad_norm": 6.679006576538086, | |
| "learning_rate": 0.0001051552795031056, | |
| "loss": 0.7436, | |
| "step": 7640 | |
| }, | |
| { | |
| "epoch": 1.9006211180124224, | |
| "grad_norm": 7.220990180969238, | |
| "learning_rate": 0.00010503105590062112, | |
| "loss": 1.1981, | |
| "step": 7650 | |
| }, | |
| { | |
| "epoch": 1.9031055900621117, | |
| "grad_norm": 4.041493892669678, | |
| "learning_rate": 0.00010490683229813665, | |
| "loss": 0.7959, | |
| "step": 7660 | |
| }, | |
| { | |
| "epoch": 1.9055900621118012, | |
| "grad_norm": 6.4974517822265625, | |
| "learning_rate": 0.00010478260869565218, | |
| "loss": 1.0786, | |
| "step": 7670 | |
| }, | |
| { | |
| "epoch": 1.9080745341614906, | |
| "grad_norm": 5.594285488128662, | |
| "learning_rate": 0.0001046583850931677, | |
| "loss": 0.8194, | |
| "step": 7680 | |
| }, | |
| { | |
| "epoch": 1.9105590062111801, | |
| "grad_norm": 13.586335182189941, | |
| "learning_rate": 0.00010453416149068322, | |
| "loss": 1.1679, | |
| "step": 7690 | |
| }, | |
| { | |
| "epoch": 1.9130434782608696, | |
| "grad_norm": 9.138886451721191, | |
| "learning_rate": 0.00010440993788819877, | |
| "loss": 1.0133, | |
| "step": 7700 | |
| }, | |
| { | |
| "epoch": 1.9130434782608696, | |
| "eval_accuracy": 0.7766434920355539, | |
| "eval_loss": 0.847861111164093, | |
| "eval_runtime": 87.2569, | |
| "eval_samples_per_second": 130.225, | |
| "eval_steps_per_second": 16.285, | |
| "step": 7700 | |
| }, | |
| { | |
| "epoch": 1.9155279503105591, | |
| "grad_norm": 5.123132228851318, | |
| "learning_rate": 0.0001042857142857143, | |
| "loss": 0.8615, | |
| "step": 7710 | |
| }, | |
| { | |
| "epoch": 1.9180124223602486, | |
| "grad_norm": 5.093189716339111, | |
| "learning_rate": 0.00010416149068322983, | |
| "loss": 0.8288, | |
| "step": 7720 | |
| }, | |
| { | |
| "epoch": 1.9204968944099379, | |
| "grad_norm": 7.318862438201904, | |
| "learning_rate": 0.00010403726708074534, | |
| "loss": 1.0229, | |
| "step": 7730 | |
| }, | |
| { | |
| "epoch": 1.9229813664596274, | |
| "grad_norm": 7.412812232971191, | |
| "learning_rate": 0.00010391304347826087, | |
| "loss": 1.0989, | |
| "step": 7740 | |
| }, | |
| { | |
| "epoch": 1.9254658385093166, | |
| "grad_norm": 5.066961288452148, | |
| "learning_rate": 0.0001037888198757764, | |
| "loss": 0.9002, | |
| "step": 7750 | |
| }, | |
| { | |
| "epoch": 1.9279503105590061, | |
| "grad_norm": 6.0254364013671875, | |
| "learning_rate": 0.00010366459627329192, | |
| "loss": 0.8101, | |
| "step": 7760 | |
| }, | |
| { | |
| "epoch": 1.9304347826086956, | |
| "grad_norm": 7.5015716552734375, | |
| "learning_rate": 0.00010354037267080745, | |
| "loss": 1.0433, | |
| "step": 7770 | |
| }, | |
| { | |
| "epoch": 1.932919254658385, | |
| "grad_norm": 6.577775955200195, | |
| "learning_rate": 0.00010341614906832298, | |
| "loss": 0.8738, | |
| "step": 7780 | |
| }, | |
| { | |
| "epoch": 1.9354037267080746, | |
| "grad_norm": 6.867348670959473, | |
| "learning_rate": 0.00010329192546583852, | |
| "loss": 0.7594, | |
| "step": 7790 | |
| }, | |
| { | |
| "epoch": 1.937888198757764, | |
| "grad_norm": 5.827150821685791, | |
| "learning_rate": 0.00010316770186335405, | |
| "loss": 0.8395, | |
| "step": 7800 | |
| }, | |
| { | |
| "epoch": 1.937888198757764, | |
| "eval_accuracy": 0.7888761770659157, | |
| "eval_loss": 0.8051999807357788, | |
| "eval_runtime": 87.364, | |
| "eval_samples_per_second": 130.065, | |
| "eval_steps_per_second": 16.265, | |
| "step": 7800 | |
| }, | |
| { | |
| "epoch": 1.9403726708074536, | |
| "grad_norm": 7.16851282119751, | |
| "learning_rate": 0.00010304347826086957, | |
| "loss": 0.8766, | |
| "step": 7810 | |
| }, | |
| { | |
| "epoch": 1.9428571428571428, | |
| "grad_norm": 7.723792552947998, | |
| "learning_rate": 0.0001029192546583851, | |
| "loss": 1.0962, | |
| "step": 7820 | |
| }, | |
| { | |
| "epoch": 1.9453416149068323, | |
| "grad_norm": 7.399579048156738, | |
| "learning_rate": 0.00010279503105590063, | |
| "loss": 1.3492, | |
| "step": 7830 | |
| }, | |
| { | |
| "epoch": 1.9478260869565216, | |
| "grad_norm": 4.434156894683838, | |
| "learning_rate": 0.00010267080745341615, | |
| "loss": 0.9581, | |
| "step": 7840 | |
| }, | |
| { | |
| "epoch": 1.950310559006211, | |
| "grad_norm": 2.9146640300750732, | |
| "learning_rate": 0.00010254658385093168, | |
| "loss": 0.7751, | |
| "step": 7850 | |
| }, | |
| { | |
| "epoch": 1.9527950310559006, | |
| "grad_norm": 4.098471164703369, | |
| "learning_rate": 0.0001024223602484472, | |
| "loss": 0.9124, | |
| "step": 7860 | |
| }, | |
| { | |
| "epoch": 1.95527950310559, | |
| "grad_norm": 6.989963054656982, | |
| "learning_rate": 0.00010229813664596272, | |
| "loss": 0.9057, | |
| "step": 7870 | |
| }, | |
| { | |
| "epoch": 1.9577639751552796, | |
| "grad_norm": 5.746939659118652, | |
| "learning_rate": 0.00010217391304347828, | |
| "loss": 0.8356, | |
| "step": 7880 | |
| }, | |
| { | |
| "epoch": 1.960248447204969, | |
| "grad_norm": 10.21794605255127, | |
| "learning_rate": 0.0001020496894409938, | |
| "loss": 0.8364, | |
| "step": 7890 | |
| }, | |
| { | |
| "epoch": 1.9627329192546585, | |
| "grad_norm": 2.191908597946167, | |
| "learning_rate": 0.00010192546583850933, | |
| "loss": 0.8803, | |
| "step": 7900 | |
| }, | |
| { | |
| "epoch": 1.9627329192546585, | |
| "eval_accuracy": 0.7775235413183138, | |
| "eval_loss": 0.8379384875297546, | |
| "eval_runtime": 87.2198, | |
| "eval_samples_per_second": 130.28, | |
| "eval_steps_per_second": 16.292, | |
| "step": 7900 | |
| }, | |
| { | |
| "epoch": 1.9652173913043478, | |
| "grad_norm": 8.37902545928955, | |
| "learning_rate": 0.00010180124223602486, | |
| "loss": 0.972, | |
| "step": 7910 | |
| }, | |
| { | |
| "epoch": 1.9677018633540373, | |
| "grad_norm": 6.292512893676758, | |
| "learning_rate": 0.00010167701863354037, | |
| "loss": 0.8397, | |
| "step": 7920 | |
| }, | |
| { | |
| "epoch": 1.9701863354037266, | |
| "grad_norm": 2.5551600456237793, | |
| "learning_rate": 0.0001015527950310559, | |
| "loss": 0.7601, | |
| "step": 7930 | |
| }, | |
| { | |
| "epoch": 1.972670807453416, | |
| "grad_norm": 6.245602607727051, | |
| "learning_rate": 0.00010142857142857143, | |
| "loss": 1.1527, | |
| "step": 7940 | |
| }, | |
| { | |
| "epoch": 1.9751552795031055, | |
| "grad_norm": 6.054067611694336, | |
| "learning_rate": 0.00010130434782608695, | |
| "loss": 1.0931, | |
| "step": 7950 | |
| }, | |
| { | |
| "epoch": 1.977639751552795, | |
| "grad_norm": 9.452044486999512, | |
| "learning_rate": 0.00010118012422360248, | |
| "loss": 1.0301, | |
| "step": 7960 | |
| }, | |
| { | |
| "epoch": 1.9801242236024845, | |
| "grad_norm": 6.898012638092041, | |
| "learning_rate": 0.00010105590062111802, | |
| "loss": 0.9799, | |
| "step": 7970 | |
| }, | |
| { | |
| "epoch": 1.982608695652174, | |
| "grad_norm": 6.751274108886719, | |
| "learning_rate": 0.00010093167701863355, | |
| "loss": 0.8214, | |
| "step": 7980 | |
| }, | |
| { | |
| "epoch": 1.9850931677018635, | |
| "grad_norm": 5.453399658203125, | |
| "learning_rate": 0.00010080745341614908, | |
| "loss": 0.7934, | |
| "step": 7990 | |
| }, | |
| { | |
| "epoch": 1.9875776397515528, | |
| "grad_norm": 6.991562366485596, | |
| "learning_rate": 0.0001006832298136646, | |
| "loss": 0.7866, | |
| "step": 8000 | |
| }, | |
| { | |
| "epoch": 1.9875776397515528, | |
| "eval_accuracy": 0.7835078764410807, | |
| "eval_loss": 0.8282920718193054, | |
| "eval_runtime": 87.4848, | |
| "eval_samples_per_second": 129.885, | |
| "eval_steps_per_second": 16.243, | |
| "step": 8000 | |
| }, | |
| { | |
| "epoch": 1.9900621118012423, | |
| "grad_norm": 9.726250648498535, | |
| "learning_rate": 0.00010055900621118013, | |
| "loss": 0.9478, | |
| "step": 8010 | |
| }, | |
| { | |
| "epoch": 1.9925465838509315, | |
| "grad_norm": 7.002394676208496, | |
| "learning_rate": 0.00010043478260869566, | |
| "loss": 0.9265, | |
| "step": 8020 | |
| }, | |
| { | |
| "epoch": 1.995031055900621, | |
| "grad_norm": 6.561404228210449, | |
| "learning_rate": 0.00010031055900621117, | |
| "loss": 0.9182, | |
| "step": 8030 | |
| }, | |
| { | |
| "epoch": 1.9975155279503105, | |
| "grad_norm": 7.831599712371826, | |
| "learning_rate": 0.0001001863354037267, | |
| "loss": 0.9248, | |
| "step": 8040 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "grad_norm": 0.11542998999357224, | |
| "learning_rate": 0.00010006211180124223, | |
| "loss": 0.763, | |
| "step": 8050 | |
| }, | |
| { | |
| "epoch": 2.0024844720496895, | |
| "grad_norm": 6.781834602355957, | |
| "learning_rate": 9.993788819875776e-05, | |
| "loss": 0.8077, | |
| "step": 8060 | |
| }, | |
| { | |
| "epoch": 2.004968944099379, | |
| "grad_norm": 7.08714485168457, | |
| "learning_rate": 9.981366459627329e-05, | |
| "loss": 0.6632, | |
| "step": 8070 | |
| }, | |
| { | |
| "epoch": 2.0074534161490685, | |
| "grad_norm": 6.069121360778809, | |
| "learning_rate": 9.968944099378884e-05, | |
| "loss": 0.9374, | |
| "step": 8080 | |
| }, | |
| { | |
| "epoch": 2.009937888198758, | |
| "grad_norm": 9.966570854187012, | |
| "learning_rate": 9.956521739130435e-05, | |
| "loss": 0.9113, | |
| "step": 8090 | |
| }, | |
| { | |
| "epoch": 2.012422360248447, | |
| "grad_norm": 3.953974962234497, | |
| "learning_rate": 9.944099378881988e-05, | |
| "loss": 0.5067, | |
| "step": 8100 | |
| }, | |
| { | |
| "epoch": 2.012422360248447, | |
| "eval_accuracy": 0.7835078764410807, | |
| "eval_loss": 0.8207420110702515, | |
| "eval_runtime": 87.7175, | |
| "eval_samples_per_second": 129.541, | |
| "eval_steps_per_second": 16.2, | |
| "step": 8100 | |
| }, | |
| { | |
| "epoch": 2.0149068322981365, | |
| "grad_norm": 5.133342266082764, | |
| "learning_rate": 9.931677018633541e-05, | |
| "loss": 0.7078, | |
| "step": 8110 | |
| }, | |
| { | |
| "epoch": 2.017391304347826, | |
| "grad_norm": 8.229430198669434, | |
| "learning_rate": 9.919254658385093e-05, | |
| "loss": 0.7699, | |
| "step": 8120 | |
| }, | |
| { | |
| "epoch": 2.0198757763975155, | |
| "grad_norm": 3.4556453227996826, | |
| "learning_rate": 9.906832298136647e-05, | |
| "loss": 0.7699, | |
| "step": 8130 | |
| }, | |
| { | |
| "epoch": 2.022360248447205, | |
| "grad_norm": 6.761761665344238, | |
| "learning_rate": 9.894409937888199e-05, | |
| "loss": 0.6424, | |
| "step": 8140 | |
| }, | |
| { | |
| "epoch": 2.0248447204968945, | |
| "grad_norm": 8.987166404724121, | |
| "learning_rate": 9.881987577639752e-05, | |
| "loss": 0.9173, | |
| "step": 8150 | |
| }, | |
| { | |
| "epoch": 2.027329192546584, | |
| "grad_norm": 9.56896686553955, | |
| "learning_rate": 9.869565217391305e-05, | |
| "loss": 0.9898, | |
| "step": 8160 | |
| }, | |
| { | |
| "epoch": 2.0298136645962734, | |
| "grad_norm": 5.724196434020996, | |
| "learning_rate": 9.857142857142858e-05, | |
| "loss": 0.8861, | |
| "step": 8170 | |
| }, | |
| { | |
| "epoch": 2.032298136645963, | |
| "grad_norm": 4.5643086433410645, | |
| "learning_rate": 9.844720496894411e-05, | |
| "loss": 0.6865, | |
| "step": 8180 | |
| }, | |
| { | |
| "epoch": 2.034782608695652, | |
| "grad_norm": 7.3250627517700195, | |
| "learning_rate": 9.832298136645964e-05, | |
| "loss": 0.7533, | |
| "step": 8190 | |
| }, | |
| { | |
| "epoch": 2.0372670807453415, | |
| "grad_norm": 4.573007106781006, | |
| "learning_rate": 9.819875776397515e-05, | |
| "loss": 0.7083, | |
| "step": 8200 | |
| }, | |
| { | |
| "epoch": 2.0372670807453415, | |
| "eval_accuracy": 0.7803396990231453, | |
| "eval_loss": 0.8320080637931824, | |
| "eval_runtime": 87.9445, | |
| "eval_samples_per_second": 129.206, | |
| "eval_steps_per_second": 16.158, | |
| "step": 8200 | |
| }, | |
| { | |
| "epoch": 2.039751552795031, | |
| "grad_norm": 5.410977363586426, | |
| "learning_rate": 9.807453416149068e-05, | |
| "loss": 0.8974, | |
| "step": 8210 | |
| }, | |
| { | |
| "epoch": 2.0422360248447204, | |
| "grad_norm": 7.464397430419922, | |
| "learning_rate": 9.795031055900621e-05, | |
| "loss": 1.0127, | |
| "step": 8220 | |
| }, | |
| { | |
| "epoch": 2.04472049689441, | |
| "grad_norm": 6.252601623535156, | |
| "learning_rate": 9.782608695652174e-05, | |
| "loss": 0.8233, | |
| "step": 8230 | |
| }, | |
| { | |
| "epoch": 2.0472049689440994, | |
| "grad_norm": 6.8147454261779785, | |
| "learning_rate": 9.770186335403727e-05, | |
| "loss": 0.7511, | |
| "step": 8240 | |
| }, | |
| { | |
| "epoch": 2.049689440993789, | |
| "grad_norm": 6.70554256439209, | |
| "learning_rate": 9.757763975155279e-05, | |
| "loss": 0.7293, | |
| "step": 8250 | |
| }, | |
| { | |
| "epoch": 2.0521739130434784, | |
| "grad_norm": 7.078741073608398, | |
| "learning_rate": 9.745341614906833e-05, | |
| "loss": 0.7236, | |
| "step": 8260 | |
| }, | |
| { | |
| "epoch": 2.054658385093168, | |
| "grad_norm": 5.513981819152832, | |
| "learning_rate": 9.732919254658386e-05, | |
| "loss": 0.6023, | |
| "step": 8270 | |
| }, | |
| { | |
| "epoch": 2.057142857142857, | |
| "grad_norm": 1.8642979860305786, | |
| "learning_rate": 9.720496894409938e-05, | |
| "loss": 0.7036, | |
| "step": 8280 | |
| }, | |
| { | |
| "epoch": 2.0596273291925464, | |
| "grad_norm": 4.278319358825684, | |
| "learning_rate": 9.708074534161491e-05, | |
| "loss": 0.9708, | |
| "step": 8290 | |
| }, | |
| { | |
| "epoch": 2.062111801242236, | |
| "grad_norm": 4.464468479156494, | |
| "learning_rate": 9.695652173913044e-05, | |
| "loss": 0.6581, | |
| "step": 8300 | |
| }, | |
| { | |
| "epoch": 2.062111801242236, | |
| "eval_accuracy": 0.786852063715568, | |
| "eval_loss": 0.8161770701408386, | |
| "eval_runtime": 86.2043, | |
| "eval_samples_per_second": 131.815, | |
| "eval_steps_per_second": 16.484, | |
| "step": 8300 | |
| }, | |
| { | |
| "epoch": 2.0645962732919254, | |
| "grad_norm": 5.079864501953125, | |
| "learning_rate": 9.683229813664597e-05, | |
| "loss": 0.6639, | |
| "step": 8310 | |
| }, | |
| { | |
| "epoch": 2.067080745341615, | |
| "grad_norm": 4.3528361320495605, | |
| "learning_rate": 9.67080745341615e-05, | |
| "loss": 0.6507, | |
| "step": 8320 | |
| }, | |
| { | |
| "epoch": 2.0695652173913044, | |
| "grad_norm": 5.734859943389893, | |
| "learning_rate": 9.658385093167702e-05, | |
| "loss": 0.9273, | |
| "step": 8330 | |
| }, | |
| { | |
| "epoch": 2.072049689440994, | |
| "grad_norm": 3.430791139602661, | |
| "learning_rate": 9.645962732919255e-05, | |
| "loss": 0.8294, | |
| "step": 8340 | |
| }, | |
| { | |
| "epoch": 2.0745341614906834, | |
| "grad_norm": 7.763731479644775, | |
| "learning_rate": 9.633540372670809e-05, | |
| "loss": 0.892, | |
| "step": 8350 | |
| }, | |
| { | |
| "epoch": 2.077018633540373, | |
| "grad_norm": 7.946462154388428, | |
| "learning_rate": 9.62111801242236e-05, | |
| "loss": 0.85, | |
| "step": 8360 | |
| }, | |
| { | |
| "epoch": 2.079503105590062, | |
| "grad_norm": 5.0240607261657715, | |
| "learning_rate": 9.608695652173914e-05, | |
| "loss": 1.0335, | |
| "step": 8370 | |
| }, | |
| { | |
| "epoch": 2.0819875776397514, | |
| "grad_norm": 9.682748794555664, | |
| "learning_rate": 9.596273291925467e-05, | |
| "loss": 0.9621, | |
| "step": 8380 | |
| }, | |
| { | |
| "epoch": 2.084472049689441, | |
| "grad_norm": 6.340792655944824, | |
| "learning_rate": 9.583850931677018e-05, | |
| "loss": 0.7974, | |
| "step": 8390 | |
| }, | |
| { | |
| "epoch": 2.0869565217391304, | |
| "grad_norm": 10.423264503479004, | |
| "learning_rate": 9.571428571428573e-05, | |
| "loss": 0.7376, | |
| "step": 8400 | |
| }, | |
| { | |
| "epoch": 2.0869565217391304, | |
| "eval_accuracy": 0.787116078500396, | |
| "eval_loss": 0.8222277164459229, | |
| "eval_runtime": 88.2512, | |
| "eval_samples_per_second": 128.757, | |
| "eval_steps_per_second": 16.102, | |
| "step": 8400 | |
| }, | |
| { | |
| "epoch": 2.08944099378882, | |
| "grad_norm": 4.946643352508545, | |
| "learning_rate": 9.559006211180126e-05, | |
| "loss": 0.8182, | |
| "step": 8410 | |
| }, | |
| { | |
| "epoch": 2.0919254658385094, | |
| "grad_norm": 3.579709768295288, | |
| "learning_rate": 9.546583850931677e-05, | |
| "loss": 0.7695, | |
| "step": 8420 | |
| }, | |
| { | |
| "epoch": 2.094409937888199, | |
| "grad_norm": 12.733490943908691, | |
| "learning_rate": 9.53416149068323e-05, | |
| "loss": 0.8773, | |
| "step": 8430 | |
| }, | |
| { | |
| "epoch": 2.0968944099378883, | |
| "grad_norm": 6.666749000549316, | |
| "learning_rate": 9.521739130434783e-05, | |
| "loss": 0.8847, | |
| "step": 8440 | |
| }, | |
| { | |
| "epoch": 2.099378881987578, | |
| "grad_norm": 4.09303092956543, | |
| "learning_rate": 9.509316770186336e-05, | |
| "loss": 0.8119, | |
| "step": 8450 | |
| }, | |
| { | |
| "epoch": 2.101863354037267, | |
| "grad_norm": 6.840397357940674, | |
| "learning_rate": 9.496894409937889e-05, | |
| "loss": 0.7293, | |
| "step": 8460 | |
| }, | |
| { | |
| "epoch": 2.1043478260869564, | |
| "grad_norm": 5.2310566902160645, | |
| "learning_rate": 9.484472049689441e-05, | |
| "loss": 0.767, | |
| "step": 8470 | |
| }, | |
| { | |
| "epoch": 2.106832298136646, | |
| "grad_norm": 4.113173484802246, | |
| "learning_rate": 9.472049689440994e-05, | |
| "loss": 0.7956, | |
| "step": 8480 | |
| }, | |
| { | |
| "epoch": 2.1093167701863353, | |
| "grad_norm": 7.647303104400635, | |
| "learning_rate": 9.459627329192548e-05, | |
| "loss": 0.8616, | |
| "step": 8490 | |
| }, | |
| { | |
| "epoch": 2.111801242236025, | |
| "grad_norm": 5.392307281494141, | |
| "learning_rate": 9.4472049689441e-05, | |
| "loss": 0.6492, | |
| "step": 8500 | |
| }, | |
| { | |
| "epoch": 2.111801242236025, | |
| "eval_accuracy": 0.786764058787292, | |
| "eval_loss": 0.8152782320976257, | |
| "eval_runtime": 87.0082, | |
| "eval_samples_per_second": 130.597, | |
| "eval_steps_per_second": 16.332, | |
| "step": 8500 | |
| }, | |
| { | |
| "epoch": 2.1142857142857143, | |
| "grad_norm": 3.2599971294403076, | |
| "learning_rate": 9.434782608695653e-05, | |
| "loss": 0.7039, | |
| "step": 8510 | |
| }, | |
| { | |
| "epoch": 2.116770186335404, | |
| "grad_norm": 3.6906332969665527, | |
| "learning_rate": 9.422360248447206e-05, | |
| "loss": 0.6559, | |
| "step": 8520 | |
| }, | |
| { | |
| "epoch": 2.1192546583850933, | |
| "grad_norm": 9.140853881835938, | |
| "learning_rate": 9.409937888198759e-05, | |
| "loss": 0.9698, | |
| "step": 8530 | |
| }, | |
| { | |
| "epoch": 2.121739130434783, | |
| "grad_norm": 4.56060791015625, | |
| "learning_rate": 9.397515527950312e-05, | |
| "loss": 0.663, | |
| "step": 8540 | |
| }, | |
| { | |
| "epoch": 2.124223602484472, | |
| "grad_norm": 8.36341381072998, | |
| "learning_rate": 9.385093167701863e-05, | |
| "loss": 0.8096, | |
| "step": 8550 | |
| }, | |
| { | |
| "epoch": 2.1267080745341613, | |
| "grad_norm": 9.586607933044434, | |
| "learning_rate": 9.372670807453416e-05, | |
| "loss": 0.9051, | |
| "step": 8560 | |
| }, | |
| { | |
| "epoch": 2.129192546583851, | |
| "grad_norm": 7.692372798919678, | |
| "learning_rate": 9.360248447204969e-05, | |
| "loss": 0.8815, | |
| "step": 8570 | |
| }, | |
| { | |
| "epoch": 2.1316770186335403, | |
| "grad_norm": 9.203356742858887, | |
| "learning_rate": 9.347826086956522e-05, | |
| "loss": 0.9408, | |
| "step": 8580 | |
| }, | |
| { | |
| "epoch": 2.13416149068323, | |
| "grad_norm": 7.31281042098999, | |
| "learning_rate": 9.335403726708075e-05, | |
| "loss": 0.6291, | |
| "step": 8590 | |
| }, | |
| { | |
| "epoch": 2.1366459627329193, | |
| "grad_norm": 8.940437316894531, | |
| "learning_rate": 9.322981366459628e-05, | |
| "loss": 0.6356, | |
| "step": 8600 | |
| }, | |
| { | |
| "epoch": 2.1366459627329193, | |
| "eval_accuracy": 0.7929244037666109, | |
| "eval_loss": 0.7929924726486206, | |
| "eval_runtime": 87.3662, | |
| "eval_samples_per_second": 130.062, | |
| "eval_steps_per_second": 16.265, | |
| "step": 8600 | |
| }, | |
| { | |
| "epoch": 2.139130434782609, | |
| "grad_norm": 3.0774142742156982, | |
| "learning_rate": 9.31055900621118e-05, | |
| "loss": 0.8358, | |
| "step": 8610 | |
| }, | |
| { | |
| "epoch": 2.1416149068322983, | |
| "grad_norm": 7.764039993286133, | |
| "learning_rate": 9.298136645962733e-05, | |
| "loss": 0.6964, | |
| "step": 8620 | |
| }, | |
| { | |
| "epoch": 2.1440993788819878, | |
| "grad_norm": 6.5316853523254395, | |
| "learning_rate": 9.285714285714286e-05, | |
| "loss": 0.7853, | |
| "step": 8630 | |
| }, | |
| { | |
| "epoch": 2.146583850931677, | |
| "grad_norm": 5.1168928146362305, | |
| "learning_rate": 9.273291925465839e-05, | |
| "loss": 0.7643, | |
| "step": 8640 | |
| }, | |
| { | |
| "epoch": 2.1490683229813663, | |
| "grad_norm": 7.292003154754639, | |
| "learning_rate": 9.260869565217392e-05, | |
| "loss": 0.8261, | |
| "step": 8650 | |
| }, | |
| { | |
| "epoch": 2.151552795031056, | |
| "grad_norm": 5.8488240242004395, | |
| "learning_rate": 9.248447204968943e-05, | |
| "loss": 0.8137, | |
| "step": 8660 | |
| }, | |
| { | |
| "epoch": 2.1540372670807453, | |
| "grad_norm": 5.164108753204346, | |
| "learning_rate": 9.236024844720498e-05, | |
| "loss": 0.6775, | |
| "step": 8670 | |
| }, | |
| { | |
| "epoch": 2.1565217391304348, | |
| "grad_norm": 8.760250091552734, | |
| "learning_rate": 9.223602484472051e-05, | |
| "loss": 0.9372, | |
| "step": 8680 | |
| }, | |
| { | |
| "epoch": 2.1590062111801243, | |
| "grad_norm": 2.324495315551758, | |
| "learning_rate": 9.211180124223602e-05, | |
| "loss": 0.6147, | |
| "step": 8690 | |
| }, | |
| { | |
| "epoch": 2.1614906832298137, | |
| "grad_norm": 11.120918273925781, | |
| "learning_rate": 9.198757763975155e-05, | |
| "loss": 0.7626, | |
| "step": 8700 | |
| }, | |
| { | |
| "epoch": 2.1614906832298137, | |
| "eval_accuracy": 0.787380093285224, | |
| "eval_loss": 0.8167068958282471, | |
| "eval_runtime": 87.706, | |
| "eval_samples_per_second": 129.558, | |
| "eval_steps_per_second": 16.202, | |
| "step": 8700 | |
| }, | |
| { | |
| "epoch": 2.1639751552795032, | |
| "grad_norm": 4.185982704162598, | |
| "learning_rate": 9.186335403726708e-05, | |
| "loss": 1.0471, | |
| "step": 8710 | |
| }, | |
| { | |
| "epoch": 2.1664596273291927, | |
| "grad_norm": 7.418622016906738, | |
| "learning_rate": 9.173913043478261e-05, | |
| "loss": 0.8076, | |
| "step": 8720 | |
| }, | |
| { | |
| "epoch": 2.1689440993788818, | |
| "grad_norm": 6.697909832000732, | |
| "learning_rate": 9.161490683229814e-05, | |
| "loss": 0.9415, | |
| "step": 8730 | |
| }, | |
| { | |
| "epoch": 2.1714285714285713, | |
| "grad_norm": 8.501760482788086, | |
| "learning_rate": 9.149068322981367e-05, | |
| "loss": 1.0257, | |
| "step": 8740 | |
| }, | |
| { | |
| "epoch": 2.1739130434782608, | |
| "grad_norm": 3.7645459175109863, | |
| "learning_rate": 9.136645962732919e-05, | |
| "loss": 0.7609, | |
| "step": 8750 | |
| }, | |
| { | |
| "epoch": 2.1763975155279502, | |
| "grad_norm": 7.28707218170166, | |
| "learning_rate": 9.124223602484473e-05, | |
| "loss": 0.8866, | |
| "step": 8760 | |
| }, | |
| { | |
| "epoch": 2.1788819875776397, | |
| "grad_norm": 7.614325046539307, | |
| "learning_rate": 9.111801242236025e-05, | |
| "loss": 0.812, | |
| "step": 8770 | |
| }, | |
| { | |
| "epoch": 2.1813664596273292, | |
| "grad_norm": 7.725882053375244, | |
| "learning_rate": 9.099378881987578e-05, | |
| "loss": 0.7487, | |
| "step": 8780 | |
| }, | |
| { | |
| "epoch": 2.1838509316770187, | |
| "grad_norm": 6.1779255867004395, | |
| "learning_rate": 9.086956521739131e-05, | |
| "loss": 0.5971, | |
| "step": 8790 | |
| }, | |
| { | |
| "epoch": 2.186335403726708, | |
| "grad_norm": 7.485067844390869, | |
| "learning_rate": 9.074534161490683e-05, | |
| "loss": 0.7389, | |
| "step": 8800 | |
| }, | |
| { | |
| "epoch": 2.186335403726708, | |
| "eval_accuracy": 0.7888761770659157, | |
| "eval_loss": 0.8076306581497192, | |
| "eval_runtime": 86.0538, | |
| "eval_samples_per_second": 132.045, | |
| "eval_steps_per_second": 16.513, | |
| "step": 8800 | |
| }, | |
| { | |
| "epoch": 2.1888198757763977, | |
| "grad_norm": 4.314478397369385, | |
| "learning_rate": 9.062111801242237e-05, | |
| "loss": 0.7447, | |
| "step": 8810 | |
| }, | |
| { | |
| "epoch": 2.1913043478260867, | |
| "grad_norm": 4.1498236656188965, | |
| "learning_rate": 9.04968944099379e-05, | |
| "loss": 0.6338, | |
| "step": 8820 | |
| }, | |
| { | |
| "epoch": 2.1937888198757762, | |
| "grad_norm": 6.881325721740723, | |
| "learning_rate": 9.037267080745342e-05, | |
| "loss": 1.0032, | |
| "step": 8830 | |
| }, | |
| { | |
| "epoch": 2.1962732919254657, | |
| "grad_norm": 5.005446910858154, | |
| "learning_rate": 9.024844720496895e-05, | |
| "loss": 0.7338, | |
| "step": 8840 | |
| }, | |
| { | |
| "epoch": 2.198757763975155, | |
| "grad_norm": 6.156917095184326, | |
| "learning_rate": 9.012422360248448e-05, | |
| "loss": 0.8672, | |
| "step": 8850 | |
| }, | |
| { | |
| "epoch": 2.2012422360248447, | |
| "grad_norm": 7.660140037536621, | |
| "learning_rate": 9e-05, | |
| "loss": 0.7373, | |
| "step": 8860 | |
| }, | |
| { | |
| "epoch": 2.203726708074534, | |
| "grad_norm": 6.808891296386719, | |
| "learning_rate": 8.987577639751554e-05, | |
| "loss": 0.9934, | |
| "step": 8870 | |
| }, | |
| { | |
| "epoch": 2.2062111801242237, | |
| "grad_norm": 2.7845213413238525, | |
| "learning_rate": 8.975155279503105e-05, | |
| "loss": 0.6374, | |
| "step": 8880 | |
| }, | |
| { | |
| "epoch": 2.208695652173913, | |
| "grad_norm": 4.146764278411865, | |
| "learning_rate": 8.962732919254658e-05, | |
| "loss": 0.7385, | |
| "step": 8890 | |
| }, | |
| { | |
| "epoch": 2.2111801242236027, | |
| "grad_norm": 9.313486099243164, | |
| "learning_rate": 8.950310559006213e-05, | |
| "loss": 0.503, | |
| "step": 8900 | |
| }, | |
| { | |
| "epoch": 2.2111801242236027, | |
| "eval_accuracy": 0.786940068643844, | |
| "eval_loss": 0.8311988115310669, | |
| "eval_runtime": 87.0983, | |
| "eval_samples_per_second": 130.462, | |
| "eval_steps_per_second": 16.315, | |
| "step": 8900 | |
| }, | |
| { | |
| "epoch": 2.2136645962732917, | |
| "grad_norm": 2.938624858856201, | |
| "learning_rate": 8.937888198757764e-05, | |
| "loss": 0.4459, | |
| "step": 8910 | |
| }, | |
| { | |
| "epoch": 2.216149068322981, | |
| "grad_norm": 5.409054756164551, | |
| "learning_rate": 8.925465838509317e-05, | |
| "loss": 0.6621, | |
| "step": 8920 | |
| }, | |
| { | |
| "epoch": 2.2186335403726707, | |
| "grad_norm": 5.15172004699707, | |
| "learning_rate": 8.91304347826087e-05, | |
| "loss": 0.6624, | |
| "step": 8930 | |
| }, | |
| { | |
| "epoch": 2.22111801242236, | |
| "grad_norm": 11.084473609924316, | |
| "learning_rate": 8.900621118012423e-05, | |
| "loss": 0.7716, | |
| "step": 8940 | |
| }, | |
| { | |
| "epoch": 2.2236024844720497, | |
| "grad_norm": 10.487622261047363, | |
| "learning_rate": 8.888198757763976e-05, | |
| "loss": 0.773, | |
| "step": 8950 | |
| }, | |
| { | |
| "epoch": 2.226086956521739, | |
| "grad_norm": 10.246448516845703, | |
| "learning_rate": 8.875776397515528e-05, | |
| "loss": 0.7211, | |
| "step": 8960 | |
| }, | |
| { | |
| "epoch": 2.2285714285714286, | |
| "grad_norm": 9.63115406036377, | |
| "learning_rate": 8.863354037267081e-05, | |
| "loss": 0.7725, | |
| "step": 8970 | |
| }, | |
| { | |
| "epoch": 2.231055900621118, | |
| "grad_norm": 9.392363548278809, | |
| "learning_rate": 8.850931677018634e-05, | |
| "loss": 0.55, | |
| "step": 8980 | |
| }, | |
| { | |
| "epoch": 2.2335403726708076, | |
| "grad_norm": 6.782948017120361, | |
| "learning_rate": 8.838509316770187e-05, | |
| "loss": 0.8966, | |
| "step": 8990 | |
| }, | |
| { | |
| "epoch": 2.2360248447204967, | |
| "grad_norm": 5.9813947677612305, | |
| "learning_rate": 8.82608695652174e-05, | |
| "loss": 0.7901, | |
| "step": 9000 | |
| }, | |
| { | |
| "epoch": 2.2360248447204967, | |
| "eval_accuracy": 0.7900202411335034, | |
| "eval_loss": 0.8137289881706238, | |
| "eval_runtime": 87.5605, | |
| "eval_samples_per_second": 129.773, | |
| "eval_steps_per_second": 16.229, | |
| "step": 9000 | |
| }, | |
| { | |
| "epoch": 2.238509316770186, | |
| "grad_norm": 6.50111722946167, | |
| "learning_rate": 8.813664596273293e-05, | |
| "loss": 0.7854, | |
| "step": 9010 | |
| }, | |
| { | |
| "epoch": 2.2409937888198757, | |
| "grad_norm": 8.988317489624023, | |
| "learning_rate": 8.801242236024844e-05, | |
| "loss": 0.7795, | |
| "step": 9020 | |
| }, | |
| { | |
| "epoch": 2.243478260869565, | |
| "grad_norm": 10.681255340576172, | |
| "learning_rate": 8.788819875776399e-05, | |
| "loss": 0.8802, | |
| "step": 9030 | |
| }, | |
| { | |
| "epoch": 2.2459627329192546, | |
| "grad_norm": 8.849059104919434, | |
| "learning_rate": 8.77639751552795e-05, | |
| "loss": 0.6214, | |
| "step": 9040 | |
| }, | |
| { | |
| "epoch": 2.248447204968944, | |
| "grad_norm": 6.764002799987793, | |
| "learning_rate": 8.765217391304348e-05, | |
| "loss": 0.9147, | |
| "step": 9050 | |
| }, | |
| { | |
| "epoch": 2.2509316770186336, | |
| "grad_norm": 9.840096473693848, | |
| "learning_rate": 8.752795031055901e-05, | |
| "loss": 0.6492, | |
| "step": 9060 | |
| }, | |
| { | |
| "epoch": 2.253416149068323, | |
| "grad_norm": 3.465550422668457, | |
| "learning_rate": 8.740372670807454e-05, | |
| "loss": 0.6186, | |
| "step": 9070 | |
| }, | |
| { | |
| "epoch": 2.2559006211180126, | |
| "grad_norm": 3.6054742336273193, | |
| "learning_rate": 8.727950310559007e-05, | |
| "loss": 0.6631, | |
| "step": 9080 | |
| }, | |
| { | |
| "epoch": 2.2583850931677016, | |
| "grad_norm": 10.837676048278809, | |
| "learning_rate": 8.715527950310558e-05, | |
| "loss": 0.7069, | |
| "step": 9090 | |
| }, | |
| { | |
| "epoch": 2.260869565217391, | |
| "grad_norm": 3.7660045623779297, | |
| "learning_rate": 8.703105590062111e-05, | |
| "loss": 0.8387, | |
| "step": 9100 | |
| }, | |
| { | |
| "epoch": 2.260869565217391, | |
| "eval_accuracy": 0.7831558567279767, | |
| "eval_loss": 0.8207471370697021, | |
| "eval_runtime": 86.53, | |
| "eval_samples_per_second": 131.319, | |
| "eval_steps_per_second": 16.422, | |
| "step": 9100 | |
| }, | |
| { | |
| "epoch": 2.2633540372670806, | |
| "grad_norm": 5.137176036834717, | |
| "learning_rate": 8.690683229813666e-05, | |
| "loss": 0.7754, | |
| "step": 9110 | |
| }, | |
| { | |
| "epoch": 2.26583850931677, | |
| "grad_norm": 4.615223407745361, | |
| "learning_rate": 8.678260869565217e-05, | |
| "loss": 0.588, | |
| "step": 9120 | |
| }, | |
| { | |
| "epoch": 2.2683229813664596, | |
| "grad_norm": 4.302494525909424, | |
| "learning_rate": 8.66583850931677e-05, | |
| "loss": 0.8853, | |
| "step": 9130 | |
| }, | |
| { | |
| "epoch": 2.270807453416149, | |
| "grad_norm": 5.601503372192383, | |
| "learning_rate": 8.653416149068323e-05, | |
| "loss": 0.7973, | |
| "step": 9140 | |
| }, | |
| { | |
| "epoch": 2.2732919254658386, | |
| "grad_norm": 4.837513446807861, | |
| "learning_rate": 8.640993788819876e-05, | |
| "loss": 0.9177, | |
| "step": 9150 | |
| }, | |
| { | |
| "epoch": 2.275776397515528, | |
| "grad_norm": 8.786465644836426, | |
| "learning_rate": 8.62857142857143e-05, | |
| "loss": 0.877, | |
| "step": 9160 | |
| }, | |
| { | |
| "epoch": 2.2782608695652176, | |
| "grad_norm": 6.726296901702881, | |
| "learning_rate": 8.616149068322982e-05, | |
| "loss": 0.9089, | |
| "step": 9170 | |
| }, | |
| { | |
| "epoch": 2.2807453416149066, | |
| "grad_norm": 9.3532075881958, | |
| "learning_rate": 8.603726708074534e-05, | |
| "loss": 0.6529, | |
| "step": 9180 | |
| }, | |
| { | |
| "epoch": 2.283229813664596, | |
| "grad_norm": 9.594780921936035, | |
| "learning_rate": 8.591304347826087e-05, | |
| "loss": 0.5744, | |
| "step": 9190 | |
| }, | |
| { | |
| "epoch": 2.2857142857142856, | |
| "grad_norm": 6.469969272613525, | |
| "learning_rate": 8.57888198757764e-05, | |
| "loss": 0.7048, | |
| "step": 9200 | |
| }, | |
| { | |
| "epoch": 2.2857142857142856, | |
| "eval_accuracy": 0.7897562263486755, | |
| "eval_loss": 0.8105459213256836, | |
| "eval_runtime": 85.966, | |
| "eval_samples_per_second": 132.18, | |
| "eval_steps_per_second": 16.53, | |
| "step": 9200 | |
| }, | |
| { | |
| "epoch": 2.288198757763975, | |
| "grad_norm": 3.212139368057251, | |
| "learning_rate": 8.566459627329193e-05, | |
| "loss": 0.69, | |
| "step": 9210 | |
| }, | |
| { | |
| "epoch": 2.2906832298136646, | |
| "grad_norm": 8.069912910461426, | |
| "learning_rate": 8.554037267080746e-05, | |
| "loss": 0.7921, | |
| "step": 9220 | |
| }, | |
| { | |
| "epoch": 2.293167701863354, | |
| "grad_norm": 4.6540985107421875, | |
| "learning_rate": 8.541614906832298e-05, | |
| "loss": 0.6708, | |
| "step": 9230 | |
| }, | |
| { | |
| "epoch": 2.2956521739130435, | |
| "grad_norm": 3.3470239639282227, | |
| "learning_rate": 8.529192546583852e-05, | |
| "loss": 0.6245, | |
| "step": 9240 | |
| }, | |
| { | |
| "epoch": 2.298136645962733, | |
| "grad_norm": 3.7410881519317627, | |
| "learning_rate": 8.516770186335405e-05, | |
| "loss": 0.6826, | |
| "step": 9250 | |
| }, | |
| { | |
| "epoch": 2.3006211180124225, | |
| "grad_norm": 3.9942305088043213, | |
| "learning_rate": 8.504347826086957e-05, | |
| "loss": 0.6555, | |
| "step": 9260 | |
| }, | |
| { | |
| "epoch": 2.3031055900621116, | |
| "grad_norm": 3.727818250656128, | |
| "learning_rate": 8.49192546583851e-05, | |
| "loss": 0.7326, | |
| "step": 9270 | |
| }, | |
| { | |
| "epoch": 2.305590062111801, | |
| "grad_norm": 5.355185031890869, | |
| "learning_rate": 8.479503105590063e-05, | |
| "loss": 1.0129, | |
| "step": 9280 | |
| }, | |
| { | |
| "epoch": 2.3080745341614906, | |
| "grad_norm": 3.256054639816284, | |
| "learning_rate": 8.467080745341616e-05, | |
| "loss": 0.5776, | |
| "step": 9290 | |
| }, | |
| { | |
| "epoch": 2.31055900621118, | |
| "grad_norm": 5.470973968505859, | |
| "learning_rate": 8.454658385093169e-05, | |
| "loss": 0.6412, | |
| "step": 9300 | |
| }, | |
| { | |
| "epoch": 2.31055900621118, | |
| "eval_accuracy": 0.7950365220452346, | |
| "eval_loss": 0.7829346656799316, | |
| "eval_runtime": 86.0629, | |
| "eval_samples_per_second": 132.031, | |
| "eval_steps_per_second": 16.511, | |
| "step": 9300 | |
| }, | |
| { | |
| "epoch": 2.3130434782608695, | |
| "grad_norm": 4.965493679046631, | |
| "learning_rate": 8.44223602484472e-05, | |
| "loss": 0.8235, | |
| "step": 9310 | |
| }, | |
| { | |
| "epoch": 2.315527950310559, | |
| "grad_norm": 6.479755401611328, | |
| "learning_rate": 8.429813664596273e-05, | |
| "loss": 0.6298, | |
| "step": 9320 | |
| }, | |
| { | |
| "epoch": 2.3180124223602485, | |
| "grad_norm": 8.033920288085938, | |
| "learning_rate": 8.417391304347828e-05, | |
| "loss": 0.572, | |
| "step": 9330 | |
| }, | |
| { | |
| "epoch": 2.320496894409938, | |
| "grad_norm": 8.532790184020996, | |
| "learning_rate": 8.404968944099379e-05, | |
| "loss": 0.7044, | |
| "step": 9340 | |
| }, | |
| { | |
| "epoch": 2.3229813664596275, | |
| "grad_norm": 7.569856643676758, | |
| "learning_rate": 8.392546583850932e-05, | |
| "loss": 0.9142, | |
| "step": 9350 | |
| }, | |
| { | |
| "epoch": 2.3254658385093165, | |
| "grad_norm": 3.2040038108825684, | |
| "learning_rate": 8.380124223602485e-05, | |
| "loss": 0.9008, | |
| "step": 9360 | |
| }, | |
| { | |
| "epoch": 2.327950310559006, | |
| "grad_norm": 5.969919681549072, | |
| "learning_rate": 8.367701863354037e-05, | |
| "loss": 0.6898, | |
| "step": 9370 | |
| }, | |
| { | |
| "epoch": 2.3304347826086955, | |
| "grad_norm": 8.508780479431152, | |
| "learning_rate": 8.355279503105591e-05, | |
| "loss": 0.6264, | |
| "step": 9380 | |
| }, | |
| { | |
| "epoch": 2.332919254658385, | |
| "grad_norm": 3.9258530139923096, | |
| "learning_rate": 8.342857142857143e-05, | |
| "loss": 0.8541, | |
| "step": 9390 | |
| }, | |
| { | |
| "epoch": 2.3354037267080745, | |
| "grad_norm": 5.126328468322754, | |
| "learning_rate": 8.330434782608696e-05, | |
| "loss": 0.6864, | |
| "step": 9400 | |
| }, | |
| { | |
| "epoch": 2.3354037267080745, | |
| "eval_accuracy": 0.7940684678341987, | |
| "eval_loss": 0.7850940227508545, | |
| "eval_runtime": 85.298, | |
| "eval_samples_per_second": 133.215, | |
| "eval_steps_per_second": 16.659, | |
| "step": 9400 | |
| }, | |
| { | |
| "epoch": 2.337888198757764, | |
| "grad_norm": 4.471742153167725, | |
| "learning_rate": 8.318012422360249e-05, | |
| "loss": 0.7995, | |
| "step": 9410 | |
| }, | |
| { | |
| "epoch": 2.3403726708074535, | |
| "grad_norm": 3.8531105518341064, | |
| "learning_rate": 8.305590062111802e-05, | |
| "loss": 0.5166, | |
| "step": 9420 | |
| }, | |
| { | |
| "epoch": 2.342857142857143, | |
| "grad_norm": 6.191071510314941, | |
| "learning_rate": 8.293167701863355e-05, | |
| "loss": 0.7302, | |
| "step": 9430 | |
| }, | |
| { | |
| "epoch": 2.3453416149068325, | |
| "grad_norm": 4.34737491607666, | |
| "learning_rate": 8.280745341614908e-05, | |
| "loss": 0.8006, | |
| "step": 9440 | |
| }, | |
| { | |
| "epoch": 2.3478260869565215, | |
| "grad_norm": 6.0214152336120605, | |
| "learning_rate": 8.26832298136646e-05, | |
| "loss": 0.6947, | |
| "step": 9450 | |
| }, | |
| { | |
| "epoch": 2.350310559006211, | |
| "grad_norm": 5.802051544189453, | |
| "learning_rate": 8.255900621118012e-05, | |
| "loss": 0.8839, | |
| "step": 9460 | |
| }, | |
| { | |
| "epoch": 2.3527950310559005, | |
| "grad_norm": 5.956132888793945, | |
| "learning_rate": 8.243478260869565e-05, | |
| "loss": 0.7843, | |
| "step": 9470 | |
| }, | |
| { | |
| "epoch": 2.35527950310559, | |
| "grad_norm": 30.9941349029541, | |
| "learning_rate": 8.231055900621118e-05, | |
| "loss": 0.8446, | |
| "step": 9480 | |
| }, | |
| { | |
| "epoch": 2.3577639751552795, | |
| "grad_norm": 6.255371570587158, | |
| "learning_rate": 8.218633540372671e-05, | |
| "loss": 0.6848, | |
| "step": 9490 | |
| }, | |
| { | |
| "epoch": 2.360248447204969, | |
| "grad_norm": 5.857180595397949, | |
| "learning_rate": 8.206211180124224e-05, | |
| "loss": 0.7411, | |
| "step": 9500 | |
| }, | |
| { | |
| "epoch": 2.360248447204969, | |
| "eval_accuracy": 0.803132975446625, | |
| "eval_loss": 0.764218270778656, | |
| "eval_runtime": 87.3203, | |
| "eval_samples_per_second": 130.13, | |
| "eval_steps_per_second": 16.273, | |
| "step": 9500 | |
| }, | |
| { | |
| "epoch": 2.3627329192546584, | |
| "grad_norm": 7.176181316375732, | |
| "learning_rate": 8.193788819875777e-05, | |
| "loss": 0.5753, | |
| "step": 9510 | |
| }, | |
| { | |
| "epoch": 2.365217391304348, | |
| "grad_norm": 8.681370735168457, | |
| "learning_rate": 8.18136645962733e-05, | |
| "loss": 0.7166, | |
| "step": 9520 | |
| }, | |
| { | |
| "epoch": 2.3677018633540374, | |
| "grad_norm": 8.568154335021973, | |
| "learning_rate": 8.168944099378882e-05, | |
| "loss": 0.9307, | |
| "step": 9530 | |
| }, | |
| { | |
| "epoch": 2.3701863354037265, | |
| "grad_norm": 2.1477255821228027, | |
| "learning_rate": 8.156521739130435e-05, | |
| "loss": 0.6876, | |
| "step": 9540 | |
| }, | |
| { | |
| "epoch": 2.372670807453416, | |
| "grad_norm": 11.47255802154541, | |
| "learning_rate": 8.144099378881988e-05, | |
| "loss": 0.576, | |
| "step": 9550 | |
| }, | |
| { | |
| "epoch": 2.3751552795031055, | |
| "grad_norm": 7.495718002319336, | |
| "learning_rate": 8.131677018633541e-05, | |
| "loss": 0.9377, | |
| "step": 9560 | |
| }, | |
| { | |
| "epoch": 2.377639751552795, | |
| "grad_norm": 5.860555648803711, | |
| "learning_rate": 8.119254658385094e-05, | |
| "loss": 0.5258, | |
| "step": 9570 | |
| }, | |
| { | |
| "epoch": 2.3801242236024844, | |
| "grad_norm": 6.226891994476318, | |
| "learning_rate": 8.106832298136647e-05, | |
| "loss": 0.8246, | |
| "step": 9580 | |
| }, | |
| { | |
| "epoch": 2.382608695652174, | |
| "grad_norm": 7.560525894165039, | |
| "learning_rate": 8.094409937888198e-05, | |
| "loss": 0.7171, | |
| "step": 9590 | |
| }, | |
| { | |
| "epoch": 2.3850931677018634, | |
| "grad_norm": 5.449308395385742, | |
| "learning_rate": 8.081987577639753e-05, | |
| "loss": 0.6221, | |
| "step": 9600 | |
| }, | |
| { | |
| "epoch": 2.3850931677018634, | |
| "eval_accuracy": 0.802956965590073, | |
| "eval_loss": 0.7602500915527344, | |
| "eval_runtime": 87.7045, | |
| "eval_samples_per_second": 129.56, | |
| "eval_steps_per_second": 16.202, | |
| "step": 9600 | |
| }, | |
| { | |
| "epoch": 2.387577639751553, | |
| "grad_norm": 7.059185981750488, | |
| "learning_rate": 8.069565217391304e-05, | |
| "loss": 0.8917, | |
| "step": 9610 | |
| }, | |
| { | |
| "epoch": 2.3900621118012424, | |
| "grad_norm": 4.307859420776367, | |
| "learning_rate": 8.057142857142857e-05, | |
| "loss": 0.6865, | |
| "step": 9620 | |
| }, | |
| { | |
| "epoch": 2.3925465838509314, | |
| "grad_norm": 8.636592864990234, | |
| "learning_rate": 8.04472049689441e-05, | |
| "loss": 0.825, | |
| "step": 9630 | |
| }, | |
| { | |
| "epoch": 2.395031055900621, | |
| "grad_norm": 8.701264381408691, | |
| "learning_rate": 8.032298136645962e-05, | |
| "loss": 0.7943, | |
| "step": 9640 | |
| }, | |
| { | |
| "epoch": 2.3975155279503104, | |
| "grad_norm": 6.308772563934326, | |
| "learning_rate": 8.019875776397516e-05, | |
| "loss": 0.6928, | |
| "step": 9650 | |
| }, | |
| { | |
| "epoch": 2.4, | |
| "grad_norm": 8.055970191955566, | |
| "learning_rate": 8.00745341614907e-05, | |
| "loss": 0.7339, | |
| "step": 9660 | |
| }, | |
| { | |
| "epoch": 2.4024844720496894, | |
| "grad_norm": 7.82169246673584, | |
| "learning_rate": 7.995031055900621e-05, | |
| "loss": 0.617, | |
| "step": 9670 | |
| }, | |
| { | |
| "epoch": 2.404968944099379, | |
| "grad_norm": 5.849754333496094, | |
| "learning_rate": 7.982608695652174e-05, | |
| "loss": 0.6298, | |
| "step": 9680 | |
| }, | |
| { | |
| "epoch": 2.4074534161490684, | |
| "grad_norm": 7.069714069366455, | |
| "learning_rate": 7.970186335403727e-05, | |
| "loss": 0.8778, | |
| "step": 9690 | |
| }, | |
| { | |
| "epoch": 2.409937888198758, | |
| "grad_norm": 8.241842269897461, | |
| "learning_rate": 7.95776397515528e-05, | |
| "loss": 0.7769, | |
| "step": 9700 | |
| }, | |
| { | |
| "epoch": 2.409937888198758, | |
| "eval_accuracy": 0.7975006600369621, | |
| "eval_loss": 0.7845885157585144, | |
| "eval_runtime": 88.9404, | |
| "eval_samples_per_second": 127.76, | |
| "eval_steps_per_second": 15.977, | |
| "step": 9700 | |
| }, | |
| { | |
| "epoch": 2.4124223602484474, | |
| "grad_norm": 4.8985700607299805, | |
| "learning_rate": 7.945341614906833e-05, | |
| "loss": 0.5057, | |
| "step": 9710 | |
| }, | |
| { | |
| "epoch": 2.4149068322981364, | |
| "grad_norm": 6.42218542098999, | |
| "learning_rate": 7.932919254658385e-05, | |
| "loss": 0.5966, | |
| "step": 9720 | |
| }, | |
| { | |
| "epoch": 2.417391304347826, | |
| "grad_norm": 5.961623668670654, | |
| "learning_rate": 7.920496894409938e-05, | |
| "loss": 0.6385, | |
| "step": 9730 | |
| }, | |
| { | |
| "epoch": 2.4198757763975154, | |
| "grad_norm": 10.123414993286133, | |
| "learning_rate": 7.908074534161492e-05, | |
| "loss": 0.8103, | |
| "step": 9740 | |
| }, | |
| { | |
| "epoch": 2.422360248447205, | |
| "grad_norm": 8.706270217895508, | |
| "learning_rate": 7.895652173913044e-05, | |
| "loss": 0.7, | |
| "step": 9750 | |
| }, | |
| { | |
| "epoch": 2.4248447204968944, | |
| "grad_norm": 5.495620250701904, | |
| "learning_rate": 7.883229813664597e-05, | |
| "loss": 0.6731, | |
| "step": 9760 | |
| }, | |
| { | |
| "epoch": 2.427329192546584, | |
| "grad_norm": 7.219951152801514, | |
| "learning_rate": 7.87080745341615e-05, | |
| "loss": 0.5581, | |
| "step": 9770 | |
| }, | |
| { | |
| "epoch": 2.4298136645962733, | |
| "grad_norm": 6.016363620758057, | |
| "learning_rate": 7.858385093167703e-05, | |
| "loss": 0.5895, | |
| "step": 9780 | |
| }, | |
| { | |
| "epoch": 2.432298136645963, | |
| "grad_norm": 7.8357625007629395, | |
| "learning_rate": 7.845962732919256e-05, | |
| "loss": 0.7681, | |
| "step": 9790 | |
| }, | |
| { | |
| "epoch": 2.4347826086956523, | |
| "grad_norm": 3.6328165531158447, | |
| "learning_rate": 7.833540372670807e-05, | |
| "loss": 0.7939, | |
| "step": 9800 | |
| }, | |
| { | |
| "epoch": 2.4347826086956523, | |
| "eval_accuracy": 0.7932764234797148, | |
| "eval_loss": 0.7914384603500366, | |
| "eval_runtime": 88.7006, | |
| "eval_samples_per_second": 128.105, | |
| "eval_steps_per_second": 16.02, | |
| "step": 9800 | |
| }, | |
| { | |
| "epoch": 2.4372670807453414, | |
| "grad_norm": 3.617049217224121, | |
| "learning_rate": 7.82111801242236e-05, | |
| "loss": 0.5236, | |
| "step": 9810 | |
| }, | |
| { | |
| "epoch": 2.439751552795031, | |
| "grad_norm": 4.9923577308654785, | |
| "learning_rate": 7.808695652173913e-05, | |
| "loss": 0.6392, | |
| "step": 9820 | |
| }, | |
| { | |
| "epoch": 2.4422360248447204, | |
| "grad_norm": 5.581326484680176, | |
| "learning_rate": 7.796273291925466e-05, | |
| "loss": 0.8614, | |
| "step": 9830 | |
| }, | |
| { | |
| "epoch": 2.44472049689441, | |
| "grad_norm": 6.245087623596191, | |
| "learning_rate": 7.783850931677019e-05, | |
| "loss": 0.504, | |
| "step": 9840 | |
| }, | |
| { | |
| "epoch": 2.4472049689440993, | |
| "grad_norm": 5.1908111572265625, | |
| "learning_rate": 7.771428571428572e-05, | |
| "loss": 0.827, | |
| "step": 9850 | |
| }, | |
| { | |
| "epoch": 2.449689440993789, | |
| "grad_norm": 2.7695984840393066, | |
| "learning_rate": 7.759006211180124e-05, | |
| "loss": 0.6603, | |
| "step": 9860 | |
| }, | |
| { | |
| "epoch": 2.4521739130434783, | |
| "grad_norm": 6.33609676361084, | |
| "learning_rate": 7.746583850931678e-05, | |
| "loss": 0.7115, | |
| "step": 9870 | |
| }, | |
| { | |
| "epoch": 2.454658385093168, | |
| "grad_norm": 5.498477935791016, | |
| "learning_rate": 7.734161490683231e-05, | |
| "loss": 0.7111, | |
| "step": 9880 | |
| }, | |
| { | |
| "epoch": 2.4571428571428573, | |
| "grad_norm": 10.293370246887207, | |
| "learning_rate": 7.721739130434783e-05, | |
| "loss": 0.8168, | |
| "step": 9890 | |
| }, | |
| { | |
| "epoch": 2.4596273291925463, | |
| "grad_norm": 4.192574501037598, | |
| "learning_rate": 7.709316770186336e-05, | |
| "loss": 0.5641, | |
| "step": 9900 | |
| }, | |
| { | |
| "epoch": 2.4596273291925463, | |
| "eval_accuracy": 0.7991727536742057, | |
| "eval_loss": 0.7700155973434448, | |
| "eval_runtime": 88.7034, | |
| "eval_samples_per_second": 128.101, | |
| "eval_steps_per_second": 16.02, | |
| "step": 9900 | |
| }, | |
| { | |
| "epoch": 2.462111801242236, | |
| "grad_norm": 5.3772735595703125, | |
| "learning_rate": 7.696894409937889e-05, | |
| "loss": 0.8451, | |
| "step": 9910 | |
| }, | |
| { | |
| "epoch": 2.4645962732919253, | |
| "grad_norm": 7.285436630249023, | |
| "learning_rate": 7.684472049689442e-05, | |
| "loss": 0.8242, | |
| "step": 9920 | |
| }, | |
| { | |
| "epoch": 2.467080745341615, | |
| "grad_norm": 6.7737345695495605, | |
| "learning_rate": 7.672049689440995e-05, | |
| "loss": 0.927, | |
| "step": 9930 | |
| }, | |
| { | |
| "epoch": 2.4695652173913043, | |
| "grad_norm": 4.772755146026611, | |
| "learning_rate": 7.659627329192546e-05, | |
| "loss": 0.9219, | |
| "step": 9940 | |
| }, | |
| { | |
| "epoch": 2.472049689440994, | |
| "grad_norm": 4.947612762451172, | |
| "learning_rate": 7.6472049689441e-05, | |
| "loss": 0.6056, | |
| "step": 9950 | |
| }, | |
| { | |
| "epoch": 2.4745341614906833, | |
| "grad_norm": 5.71645450592041, | |
| "learning_rate": 7.634782608695654e-05, | |
| "loss": 0.6751, | |
| "step": 9960 | |
| }, | |
| { | |
| "epoch": 2.4770186335403728, | |
| "grad_norm": 7.68681526184082, | |
| "learning_rate": 7.622360248447205e-05, | |
| "loss": 0.4968, | |
| "step": 9970 | |
| }, | |
| { | |
| "epoch": 2.4795031055900623, | |
| "grad_norm": 4.070769786834717, | |
| "learning_rate": 7.609937888198758e-05, | |
| "loss": 0.5075, | |
| "step": 9980 | |
| }, | |
| { | |
| "epoch": 2.4819875776397513, | |
| "grad_norm": 28.193359375, | |
| "learning_rate": 7.597515527950311e-05, | |
| "loss": 0.7343, | |
| "step": 9990 | |
| }, | |
| { | |
| "epoch": 2.4844720496894412, | |
| "grad_norm": 4.914248943328857, | |
| "learning_rate": 7.585093167701863e-05, | |
| "loss": 0.8009, | |
| "step": 10000 | |
| }, | |
| { | |
| "epoch": 2.4844720496894412, | |
| "eval_accuracy": 0.8015488867376573, | |
| "eval_loss": 0.7699164152145386, | |
| "eval_runtime": 88.0937, | |
| "eval_samples_per_second": 128.988, | |
| "eval_steps_per_second": 16.131, | |
| "step": 10000 | |
| }, | |
| { | |
| "epoch": 2.4869565217391303, | |
| "grad_norm": 10.814724922180176, | |
| "learning_rate": 7.572670807453417e-05, | |
| "loss": 0.7799, | |
| "step": 10010 | |
| }, | |
| { | |
| "epoch": 2.48944099378882, | |
| "grad_norm": 10.952703475952148, | |
| "learning_rate": 7.560248447204969e-05, | |
| "loss": 0.7478, | |
| "step": 10020 | |
| }, | |
| { | |
| "epoch": 2.4919254658385093, | |
| "grad_norm": 7.243926525115967, | |
| "learning_rate": 7.547826086956522e-05, | |
| "loss": 0.5972, | |
| "step": 10030 | |
| }, | |
| { | |
| "epoch": 2.4944099378881988, | |
| "grad_norm": 5.8431010246276855, | |
| "learning_rate": 7.535403726708075e-05, | |
| "loss": 0.6964, | |
| "step": 10040 | |
| }, | |
| { | |
| "epoch": 2.4968944099378882, | |
| "grad_norm": 6.788570880889893, | |
| "learning_rate": 7.522981366459627e-05, | |
| "loss": 0.6192, | |
| "step": 10050 | |
| }, | |
| { | |
| "epoch": 2.4993788819875777, | |
| "grad_norm": 7.250670433044434, | |
| "learning_rate": 7.510559006211181e-05, | |
| "loss": 0.6746, | |
| "step": 10060 | |
| }, | |
| { | |
| "epoch": 2.5018633540372672, | |
| "grad_norm": 5.413866996765137, | |
| "learning_rate": 7.498136645962734e-05, | |
| "loss": 0.827, | |
| "step": 10070 | |
| }, | |
| { | |
| "epoch": 2.5043478260869563, | |
| "grad_norm": 5.322055816650391, | |
| "learning_rate": 7.485714285714285e-05, | |
| "loss": 0.5904, | |
| "step": 10080 | |
| }, | |
| { | |
| "epoch": 2.506832298136646, | |
| "grad_norm": 7.097953796386719, | |
| "learning_rate": 7.473291925465838e-05, | |
| "loss": 0.6116, | |
| "step": 10090 | |
| }, | |
| { | |
| "epoch": 2.5093167701863353, | |
| "grad_norm": 4.7179341316223145, | |
| "learning_rate": 7.460869565217391e-05, | |
| "loss": 0.6111, | |
| "step": 10100 | |
| }, | |
| { | |
| "epoch": 2.5093167701863353, | |
| "eval_accuracy": 0.8035730000880049, | |
| "eval_loss": 0.7602738738059998, | |
| "eval_runtime": 87.8798, | |
| "eval_samples_per_second": 129.302, | |
| "eval_steps_per_second": 16.17, | |
| "step": 10100 | |
| }, | |
| { | |
| "epoch": 2.5118012422360247, | |
| "grad_norm": 4.682028770446777, | |
| "learning_rate": 7.448447204968944e-05, | |
| "loss": 0.527, | |
| "step": 10110 | |
| }, | |
| { | |
| "epoch": 2.5142857142857142, | |
| "grad_norm": 4.885335445404053, | |
| "learning_rate": 7.436024844720497e-05, | |
| "loss": 1.01, | |
| "step": 10120 | |
| }, | |
| { | |
| "epoch": 2.5167701863354037, | |
| "grad_norm": 4.012519359588623, | |
| "learning_rate": 7.42360248447205e-05, | |
| "loss": 0.5805, | |
| "step": 10130 | |
| }, | |
| { | |
| "epoch": 2.519254658385093, | |
| "grad_norm": 8.987902641296387, | |
| "learning_rate": 7.411180124223602e-05, | |
| "loss": 0.6547, | |
| "step": 10140 | |
| }, | |
| { | |
| "epoch": 2.5217391304347827, | |
| "grad_norm": 7.08282995223999, | |
| "learning_rate": 7.398757763975156e-05, | |
| "loss": 0.8004, | |
| "step": 10150 | |
| }, | |
| { | |
| "epoch": 2.524223602484472, | |
| "grad_norm": 5.9463396072387695, | |
| "learning_rate": 7.386335403726708e-05, | |
| "loss": 0.893, | |
| "step": 10160 | |
| }, | |
| { | |
| "epoch": 2.5267080745341612, | |
| "grad_norm": 3.2586588859558105, | |
| "learning_rate": 7.373913043478261e-05, | |
| "loss": 0.6272, | |
| "step": 10170 | |
| }, | |
| { | |
| "epoch": 2.529192546583851, | |
| "grad_norm": 5.880133628845215, | |
| "learning_rate": 7.361490683229814e-05, | |
| "loss": 0.6464, | |
| "step": 10180 | |
| }, | |
| { | |
| "epoch": 2.53167701863354, | |
| "grad_norm": 10.840839385986328, | |
| "learning_rate": 7.349068322981367e-05, | |
| "loss": 0.7131, | |
| "step": 10190 | |
| }, | |
| { | |
| "epoch": 2.5341614906832297, | |
| "grad_norm": 7.217662334442139, | |
| "learning_rate": 7.33664596273292e-05, | |
| "loss": 0.925, | |
| "step": 10200 | |
| }, | |
| { | |
| "epoch": 2.5341614906832297, | |
| "eval_accuracy": 0.8003168177417935, | |
| "eval_loss": 0.7727270126342773, | |
| "eval_runtime": 87.6344, | |
| "eval_samples_per_second": 129.664, | |
| "eval_steps_per_second": 16.215, | |
| "step": 10200 | |
| }, | |
| { | |
| "epoch": 2.536645962732919, | |
| "grad_norm": 3.556689500808716, | |
| "learning_rate": 7.324223602484473e-05, | |
| "loss": 0.6457, | |
| "step": 10210 | |
| }, | |
| { | |
| "epoch": 2.5391304347826087, | |
| "grad_norm": 7.633065223693848, | |
| "learning_rate": 7.311801242236025e-05, | |
| "loss": 0.7647, | |
| "step": 10220 | |
| }, | |
| { | |
| "epoch": 2.541614906832298, | |
| "grad_norm": 3.796308755874634, | |
| "learning_rate": 7.299378881987578e-05, | |
| "loss": 0.708, | |
| "step": 10230 | |
| }, | |
| { | |
| "epoch": 2.5440993788819877, | |
| "grad_norm": 7.235866546630859, | |
| "learning_rate": 7.28695652173913e-05, | |
| "loss": 0.8837, | |
| "step": 10240 | |
| }, | |
| { | |
| "epoch": 2.546583850931677, | |
| "grad_norm": 6.0912184715271, | |
| "learning_rate": 7.274534161490684e-05, | |
| "loss": 0.9866, | |
| "step": 10250 | |
| }, | |
| { | |
| "epoch": 2.549068322981366, | |
| "grad_norm": 8.70725154876709, | |
| "learning_rate": 7.262111801242237e-05, | |
| "loss": 0.8456, | |
| "step": 10260 | |
| }, | |
| { | |
| "epoch": 2.551552795031056, | |
| "grad_norm": 7.299804210662842, | |
| "learning_rate": 7.249689440993788e-05, | |
| "loss": 0.5935, | |
| "step": 10270 | |
| }, | |
| { | |
| "epoch": 2.554037267080745, | |
| "grad_norm": 6.128955841064453, | |
| "learning_rate": 7.237267080745343e-05, | |
| "loss": 0.8323, | |
| "step": 10280 | |
| }, | |
| { | |
| "epoch": 2.5565217391304347, | |
| "grad_norm": 2.351513624191284, | |
| "learning_rate": 7.224844720496896e-05, | |
| "loss": 0.6219, | |
| "step": 10290 | |
| }, | |
| { | |
| "epoch": 2.559006211180124, | |
| "grad_norm": 4.556458473205566, | |
| "learning_rate": 7.212422360248447e-05, | |
| "loss": 0.6206, | |
| "step": 10300 | |
| }, | |
| { | |
| "epoch": 2.559006211180124, | |
| "eval_accuracy": 0.7983807093197219, | |
| "eval_loss": 0.7765286564826965, | |
| "eval_runtime": 87.5463, | |
| "eval_samples_per_second": 129.794, | |
| "eval_steps_per_second": 16.231, | |
| "step": 10300 | |
| }, | |
| { | |
| "epoch": 2.5614906832298137, | |
| "grad_norm": 5.282100200653076, | |
| "learning_rate": 7.2e-05, | |
| "loss": 0.8967, | |
| "step": 10310 | |
| }, | |
| { | |
| "epoch": 2.563975155279503, | |
| "grad_norm": 5.501987457275391, | |
| "learning_rate": 7.187577639751553e-05, | |
| "loss": 0.9314, | |
| "step": 10320 | |
| }, | |
| { | |
| "epoch": 2.5664596273291926, | |
| "grad_norm": 6.691750526428223, | |
| "learning_rate": 7.175155279503106e-05, | |
| "loss": 0.6248, | |
| "step": 10330 | |
| }, | |
| { | |
| "epoch": 2.568944099378882, | |
| "grad_norm": 2.3620283603668213, | |
| "learning_rate": 7.162732919254659e-05, | |
| "loss": 0.6029, | |
| "step": 10340 | |
| }, | |
| { | |
| "epoch": 2.571428571428571, | |
| "grad_norm": 9.769782066345215, | |
| "learning_rate": 7.150310559006211e-05, | |
| "loss": 0.8783, | |
| "step": 10350 | |
| }, | |
| { | |
| "epoch": 2.573913043478261, | |
| "grad_norm": 7.0340681076049805, | |
| "learning_rate": 7.137888198757764e-05, | |
| "loss": 0.847, | |
| "step": 10360 | |
| }, | |
| { | |
| "epoch": 2.57639751552795, | |
| "grad_norm": 6.227030277252197, | |
| "learning_rate": 7.125465838509318e-05, | |
| "loss": 0.5959, | |
| "step": 10370 | |
| }, | |
| { | |
| "epoch": 2.5788819875776396, | |
| "grad_norm": 4.65595817565918, | |
| "learning_rate": 7.11304347826087e-05, | |
| "loss": 0.6842, | |
| "step": 10380 | |
| }, | |
| { | |
| "epoch": 2.581366459627329, | |
| "grad_norm": 9.326735496520996, | |
| "learning_rate": 7.100621118012423e-05, | |
| "loss": 0.5908, | |
| "step": 10390 | |
| }, | |
| { | |
| "epoch": 2.5838509316770186, | |
| "grad_norm": 6.663669109344482, | |
| "learning_rate": 7.088198757763976e-05, | |
| "loss": 0.5977, | |
| "step": 10400 | |
| }, | |
| { | |
| "epoch": 2.5838509316770186, | |
| "eval_accuracy": 0.7960045762562703, | |
| "eval_loss": 0.7793198823928833, | |
| "eval_runtime": 87.3653, | |
| "eval_samples_per_second": 130.063, | |
| "eval_steps_per_second": 16.265, | |
| "step": 10400 | |
| }, | |
| { | |
| "epoch": 2.586335403726708, | |
| "grad_norm": 6.158738136291504, | |
| "learning_rate": 7.075776397515527e-05, | |
| "loss": 0.7951, | |
| "step": 10410 | |
| }, | |
| { | |
| "epoch": 2.5888198757763976, | |
| "grad_norm": 3.2913687229156494, | |
| "learning_rate": 7.063354037267082e-05, | |
| "loss": 0.8243, | |
| "step": 10420 | |
| }, | |
| { | |
| "epoch": 2.591304347826087, | |
| "grad_norm": 10.81008529663086, | |
| "learning_rate": 7.050931677018633e-05, | |
| "loss": 0.8896, | |
| "step": 10430 | |
| }, | |
| { | |
| "epoch": 2.593788819875776, | |
| "grad_norm": 5.766603469848633, | |
| "learning_rate": 7.038509316770186e-05, | |
| "loss": 0.7315, | |
| "step": 10440 | |
| }, | |
| { | |
| "epoch": 2.596273291925466, | |
| "grad_norm": 6.073093414306641, | |
| "learning_rate": 7.02608695652174e-05, | |
| "loss": 0.7484, | |
| "step": 10450 | |
| }, | |
| { | |
| "epoch": 2.598757763975155, | |
| "grad_norm": 1.5353639125823975, | |
| "learning_rate": 7.013664596273292e-05, | |
| "loss": 0.6251, | |
| "step": 10460 | |
| }, | |
| { | |
| "epoch": 2.6012422360248446, | |
| "grad_norm": 4.442315101623535, | |
| "learning_rate": 7.001242236024845e-05, | |
| "loss": 0.7067, | |
| "step": 10470 | |
| }, | |
| { | |
| "epoch": 2.603726708074534, | |
| "grad_norm": 1.1733781099319458, | |
| "learning_rate": 6.988819875776398e-05, | |
| "loss": 0.5883, | |
| "step": 10480 | |
| }, | |
| { | |
| "epoch": 2.6062111801242236, | |
| "grad_norm": 5.4250712394714355, | |
| "learning_rate": 6.97639751552795e-05, | |
| "loss": 0.7153, | |
| "step": 10490 | |
| }, | |
| { | |
| "epoch": 2.608695652173913, | |
| "grad_norm": 6.374954700469971, | |
| "learning_rate": 6.963975155279503e-05, | |
| "loss": 0.8146, | |
| "step": 10500 | |
| }, | |
| { | |
| "epoch": 2.608695652173913, | |
| "eval_accuracy": 0.79776467482179, | |
| "eval_loss": 0.7799441814422607, | |
| "eval_runtime": 87.4711, | |
| "eval_samples_per_second": 129.906, | |
| "eval_steps_per_second": 16.245, | |
| "step": 10500 | |
| }, | |
| { | |
| "epoch": 2.6111801242236026, | |
| "grad_norm": 5.935840129852295, | |
| "learning_rate": 6.951552795031057e-05, | |
| "loss": 0.7184, | |
| "step": 10510 | |
| }, | |
| { | |
| "epoch": 2.613664596273292, | |
| "grad_norm": 1.9507098197937012, | |
| "learning_rate": 6.939130434782609e-05, | |
| "loss": 0.6237, | |
| "step": 10520 | |
| }, | |
| { | |
| "epoch": 2.616149068322981, | |
| "grad_norm": 4.937575340270996, | |
| "learning_rate": 6.926708074534162e-05, | |
| "loss": 0.7694, | |
| "step": 10530 | |
| }, | |
| { | |
| "epoch": 2.618633540372671, | |
| "grad_norm": 5.712149143218994, | |
| "learning_rate": 6.914285714285715e-05, | |
| "loss": 0.6623, | |
| "step": 10540 | |
| }, | |
| { | |
| "epoch": 2.62111801242236, | |
| "grad_norm": 6.4136247634887695, | |
| "learning_rate": 6.901863354037268e-05, | |
| "loss": 0.6992, | |
| "step": 10550 | |
| }, | |
| { | |
| "epoch": 2.6236024844720496, | |
| "grad_norm": 5.391094207763672, | |
| "learning_rate": 6.889440993788821e-05, | |
| "loss": 0.691, | |
| "step": 10560 | |
| }, | |
| { | |
| "epoch": 2.626086956521739, | |
| "grad_norm": 7.592553615570068, | |
| "learning_rate": 6.877018633540372e-05, | |
| "loss": 0.5635, | |
| "step": 10570 | |
| }, | |
| { | |
| "epoch": 2.6285714285714286, | |
| "grad_norm": 6.203282833099365, | |
| "learning_rate": 6.864596273291925e-05, | |
| "loss": 0.5702, | |
| "step": 10580 | |
| }, | |
| { | |
| "epoch": 2.631055900621118, | |
| "grad_norm": 11.920433044433594, | |
| "learning_rate": 6.852173913043478e-05, | |
| "loss": 0.8267, | |
| "step": 10590 | |
| }, | |
| { | |
| "epoch": 2.6335403726708075, | |
| "grad_norm": 7.057547092437744, | |
| "learning_rate": 6.839751552795031e-05, | |
| "loss": 0.7869, | |
| "step": 10600 | |
| }, | |
| { | |
| "epoch": 2.6335403726708075, | |
| "eval_accuracy": 0.808677285928012, | |
| "eval_loss": 0.739636242389679, | |
| "eval_runtime": 86.958, | |
| "eval_samples_per_second": 130.672, | |
| "eval_steps_per_second": 16.341, | |
| "step": 10600 | |
| }, | |
| { | |
| "epoch": 2.636024844720497, | |
| "grad_norm": 5.696042537689209, | |
| "learning_rate": 6.827329192546584e-05, | |
| "loss": 0.5901, | |
| "step": 10610 | |
| }, | |
| { | |
| "epoch": 2.638509316770186, | |
| "grad_norm": 9.730021476745605, | |
| "learning_rate": 6.814906832298137e-05, | |
| "loss": 0.7449, | |
| "step": 10620 | |
| }, | |
| { | |
| "epoch": 2.640993788819876, | |
| "grad_norm": 1.459912657737732, | |
| "learning_rate": 6.802484472049689e-05, | |
| "loss": 0.6211, | |
| "step": 10630 | |
| }, | |
| { | |
| "epoch": 2.643478260869565, | |
| "grad_norm": 4.86639404296875, | |
| "learning_rate": 6.790062111801243e-05, | |
| "loss": 0.7677, | |
| "step": 10640 | |
| }, | |
| { | |
| "epoch": 2.6459627329192545, | |
| "grad_norm": 2.849155902862549, | |
| "learning_rate": 6.777639751552795e-05, | |
| "loss": 0.7334, | |
| "step": 10650 | |
| }, | |
| { | |
| "epoch": 2.648447204968944, | |
| "grad_norm": 6.500259876251221, | |
| "learning_rate": 6.765217391304348e-05, | |
| "loss": 0.821, | |
| "step": 10660 | |
| }, | |
| { | |
| "epoch": 2.6509316770186335, | |
| "grad_norm": 3.8310985565185547, | |
| "learning_rate": 6.752795031055901e-05, | |
| "loss": 0.8068, | |
| "step": 10670 | |
| }, | |
| { | |
| "epoch": 2.653416149068323, | |
| "grad_norm": 5.364236831665039, | |
| "learning_rate": 6.740372670807453e-05, | |
| "loss": 0.6021, | |
| "step": 10680 | |
| }, | |
| { | |
| "epoch": 2.6559006211180125, | |
| "grad_norm": 3.1258809566497803, | |
| "learning_rate": 6.727950310559007e-05, | |
| "loss": 0.7372, | |
| "step": 10690 | |
| }, | |
| { | |
| "epoch": 2.658385093167702, | |
| "grad_norm": 6.12645959854126, | |
| "learning_rate": 6.71552795031056e-05, | |
| "loss": 0.8966, | |
| "step": 10700 | |
| }, | |
| { | |
| "epoch": 2.658385093167702, | |
| "eval_accuracy": 0.8070931972190443, | |
| "eval_loss": 0.7386279702186584, | |
| "eval_runtime": 87.2299, | |
| "eval_samples_per_second": 130.265, | |
| "eval_steps_per_second": 16.29, | |
| "step": 10700 | |
| }, | |
| { | |
| "epoch": 2.660869565217391, | |
| "grad_norm": 7.923446178436279, | |
| "learning_rate": 6.703105590062112e-05, | |
| "loss": 0.7069, | |
| "step": 10710 | |
| }, | |
| { | |
| "epoch": 2.663354037267081, | |
| "grad_norm": 8.067530632019043, | |
| "learning_rate": 6.690683229813665e-05, | |
| "loss": 0.6993, | |
| "step": 10720 | |
| }, | |
| { | |
| "epoch": 2.66583850931677, | |
| "grad_norm": 2.588629722595215, | |
| "learning_rate": 6.678260869565218e-05, | |
| "loss": 0.6455, | |
| "step": 10730 | |
| }, | |
| { | |
| "epoch": 2.6683229813664595, | |
| "grad_norm": 6.204483509063721, | |
| "learning_rate": 6.66583850931677e-05, | |
| "loss": 0.7036, | |
| "step": 10740 | |
| }, | |
| { | |
| "epoch": 2.670807453416149, | |
| "grad_norm": 6.223699569702148, | |
| "learning_rate": 6.653416149068324e-05, | |
| "loss": 0.7665, | |
| "step": 10750 | |
| }, | |
| { | |
| "epoch": 2.6732919254658385, | |
| "grad_norm": 5.856508255004883, | |
| "learning_rate": 6.640993788819875e-05, | |
| "loss": 0.7502, | |
| "step": 10760 | |
| }, | |
| { | |
| "epoch": 2.675776397515528, | |
| "grad_norm": 4.8994293212890625, | |
| "learning_rate": 6.628571428571428e-05, | |
| "loss": 0.8523, | |
| "step": 10770 | |
| }, | |
| { | |
| "epoch": 2.6782608695652175, | |
| "grad_norm": 12.497848510742188, | |
| "learning_rate": 6.616149068322983e-05, | |
| "loss": 0.7933, | |
| "step": 10780 | |
| }, | |
| { | |
| "epoch": 2.680745341614907, | |
| "grad_norm": 5.682429790496826, | |
| "learning_rate": 6.603726708074534e-05, | |
| "loss": 0.4855, | |
| "step": 10790 | |
| }, | |
| { | |
| "epoch": 2.683229813664596, | |
| "grad_norm": 6.263789176940918, | |
| "learning_rate": 6.591304347826087e-05, | |
| "loss": 0.6654, | |
| "step": 10800 | |
| }, | |
| { | |
| "epoch": 2.683229813664596, | |
| "eval_accuracy": 0.8103493795652557, | |
| "eval_loss": 0.7305024266242981, | |
| "eval_runtime": 86.2303, | |
| "eval_samples_per_second": 131.775, | |
| "eval_steps_per_second": 16.479, | |
| "step": 10800 | |
| }, | |
| { | |
| "epoch": 2.685714285714286, | |
| "grad_norm": 6.363834381103516, | |
| "learning_rate": 6.57888198757764e-05, | |
| "loss": 0.5354, | |
| "step": 10810 | |
| }, | |
| { | |
| "epoch": 2.688198757763975, | |
| "grad_norm": 5.781926155090332, | |
| "learning_rate": 6.566459627329193e-05, | |
| "loss": 0.6147, | |
| "step": 10820 | |
| }, | |
| { | |
| "epoch": 2.6906832298136645, | |
| "grad_norm": 3.1562442779541016, | |
| "learning_rate": 6.554037267080746e-05, | |
| "loss": 0.7169, | |
| "step": 10830 | |
| }, | |
| { | |
| "epoch": 2.693167701863354, | |
| "grad_norm": 6.964587211608887, | |
| "learning_rate": 6.541614906832299e-05, | |
| "loss": 0.6797, | |
| "step": 10840 | |
| }, | |
| { | |
| "epoch": 2.6956521739130435, | |
| "grad_norm": 4.136144638061523, | |
| "learning_rate": 6.529192546583851e-05, | |
| "loss": 0.9134, | |
| "step": 10850 | |
| }, | |
| { | |
| "epoch": 2.698136645962733, | |
| "grad_norm": 2.366265296936035, | |
| "learning_rate": 6.516770186335404e-05, | |
| "loss": 0.5522, | |
| "step": 10860 | |
| }, | |
| { | |
| "epoch": 2.7006211180124224, | |
| "grad_norm": 4.044836521148682, | |
| "learning_rate": 6.504347826086957e-05, | |
| "loss": 0.5896, | |
| "step": 10870 | |
| }, | |
| { | |
| "epoch": 2.703105590062112, | |
| "grad_norm": 7.166288375854492, | |
| "learning_rate": 6.49192546583851e-05, | |
| "loss": 0.8243, | |
| "step": 10880 | |
| }, | |
| { | |
| "epoch": 2.705590062111801, | |
| "grad_norm": 4.863167762756348, | |
| "learning_rate": 6.479503105590063e-05, | |
| "loss": 0.7812, | |
| "step": 10890 | |
| }, | |
| { | |
| "epoch": 2.708074534161491, | |
| "grad_norm": 4.528777122497559, | |
| "learning_rate": 6.467080745341614e-05, | |
| "loss": 0.737, | |
| "step": 10900 | |
| }, | |
| { | |
| "epoch": 2.708074534161491, | |
| "eval_accuracy": 0.8083252662149081, | |
| "eval_loss": 0.7316586971282959, | |
| "eval_runtime": 87.475, | |
| "eval_samples_per_second": 129.9, | |
| "eval_steps_per_second": 16.245, | |
| "step": 10900 | |
| }, | |
| { | |
| "epoch": 2.71055900621118, | |
| "grad_norm": 4.942448139190674, | |
| "learning_rate": 6.454658385093169e-05, | |
| "loss": 0.6569, | |
| "step": 10910 | |
| }, | |
| { | |
| "epoch": 2.7130434782608694, | |
| "grad_norm": 4.801420211791992, | |
| "learning_rate": 6.442236024844722e-05, | |
| "loss": 0.8062, | |
| "step": 10920 | |
| }, | |
| { | |
| "epoch": 2.715527950310559, | |
| "grad_norm": 5.124699115753174, | |
| "learning_rate": 6.429813664596273e-05, | |
| "loss": 0.6353, | |
| "step": 10930 | |
| }, | |
| { | |
| "epoch": 2.7180124223602484, | |
| "grad_norm": 7.245678901672363, | |
| "learning_rate": 6.417391304347826e-05, | |
| "loss": 0.8347, | |
| "step": 10940 | |
| }, | |
| { | |
| "epoch": 2.720496894409938, | |
| "grad_norm": 5.200338363647461, | |
| "learning_rate": 6.40496894409938e-05, | |
| "loss": 0.7588, | |
| "step": 10950 | |
| }, | |
| { | |
| "epoch": 2.7229813664596274, | |
| "grad_norm": 2.782305955886841, | |
| "learning_rate": 6.392546583850932e-05, | |
| "loss": 0.4884, | |
| "step": 10960 | |
| }, | |
| { | |
| "epoch": 2.725465838509317, | |
| "grad_norm": 4.4365363121032715, | |
| "learning_rate": 6.380124223602485e-05, | |
| "loss": 0.7583, | |
| "step": 10970 | |
| }, | |
| { | |
| "epoch": 2.727950310559006, | |
| "grad_norm": 8.139409065246582, | |
| "learning_rate": 6.367701863354037e-05, | |
| "loss": 0.8283, | |
| "step": 10980 | |
| }, | |
| { | |
| "epoch": 2.730434782608696, | |
| "grad_norm": 3.3418803215026855, | |
| "learning_rate": 6.35527950310559e-05, | |
| "loss": 0.6336, | |
| "step": 10990 | |
| }, | |
| { | |
| "epoch": 2.732919254658385, | |
| "grad_norm": 6.447763442993164, | |
| "learning_rate": 6.342857142857143e-05, | |
| "loss": 0.9283, | |
| "step": 11000 | |
| }, | |
| { | |
| "epoch": 2.732919254658385, | |
| "eval_accuracy": 0.8071812021473203, | |
| "eval_loss": 0.740921676158905, | |
| "eval_runtime": 86.417, | |
| "eval_samples_per_second": 131.49, | |
| "eval_steps_per_second": 16.444, | |
| "step": 11000 | |
| }, | |
| { | |
| "epoch": 2.7354037267080744, | |
| "grad_norm": 7.569089412689209, | |
| "learning_rate": 6.330434782608696e-05, | |
| "loss": 0.8814, | |
| "step": 11010 | |
| }, | |
| { | |
| "epoch": 2.737888198757764, | |
| "grad_norm": 5.908865451812744, | |
| "learning_rate": 6.318012422360249e-05, | |
| "loss": 0.8493, | |
| "step": 11020 | |
| }, | |
| { | |
| "epoch": 2.7403726708074534, | |
| "grad_norm": 5.812557697296143, | |
| "learning_rate": 6.305590062111802e-05, | |
| "loss": 0.6291, | |
| "step": 11030 | |
| }, | |
| { | |
| "epoch": 2.742857142857143, | |
| "grad_norm": 4.550736904144287, | |
| "learning_rate": 6.293167701863354e-05, | |
| "loss": 0.7389, | |
| "step": 11040 | |
| }, | |
| { | |
| "epoch": 2.7453416149068324, | |
| "grad_norm": 7.449479579925537, | |
| "learning_rate": 6.280745341614908e-05, | |
| "loss": 0.7533, | |
| "step": 11050 | |
| }, | |
| { | |
| "epoch": 2.747826086956522, | |
| "grad_norm": 4.580323219299316, | |
| "learning_rate": 6.26832298136646e-05, | |
| "loss": 0.6832, | |
| "step": 11060 | |
| }, | |
| { | |
| "epoch": 2.750310559006211, | |
| "grad_norm": 5.769420623779297, | |
| "learning_rate": 6.255900621118012e-05, | |
| "loss": 0.8311, | |
| "step": 11070 | |
| }, | |
| { | |
| "epoch": 2.752795031055901, | |
| "grad_norm": 7.184681415557861, | |
| "learning_rate": 6.243478260869565e-05, | |
| "loss": 0.7232, | |
| "step": 11080 | |
| }, | |
| { | |
| "epoch": 2.75527950310559, | |
| "grad_norm": 4.768852233886719, | |
| "learning_rate": 6.231055900621117e-05, | |
| "loss": 0.638, | |
| "step": 11090 | |
| }, | |
| { | |
| "epoch": 2.7577639751552794, | |
| "grad_norm": 9.40058708190918, | |
| "learning_rate": 6.218633540372671e-05, | |
| "loss": 0.7491, | |
| "step": 11100 | |
| }, | |
| { | |
| "epoch": 2.7577639751552794, | |
| "eval_accuracy": 0.8152776555487107, | |
| "eval_loss": 0.7087730169296265, | |
| "eval_runtime": 86.1576, | |
| "eval_samples_per_second": 131.886, | |
| "eval_steps_per_second": 16.493, | |
| "step": 11100 | |
| }, | |
| { | |
| "epoch": 2.760248447204969, | |
| "grad_norm": 6.754823207855225, | |
| "learning_rate": 6.206211180124224e-05, | |
| "loss": 0.7061, | |
| "step": 11110 | |
| }, | |
| { | |
| "epoch": 2.7627329192546584, | |
| "grad_norm": 5.724888801574707, | |
| "learning_rate": 6.193788819875776e-05, | |
| "loss": 0.5908, | |
| "step": 11120 | |
| }, | |
| { | |
| "epoch": 2.765217391304348, | |
| "grad_norm": 5.33830451965332, | |
| "learning_rate": 6.181366459627329e-05, | |
| "loss": 0.9152, | |
| "step": 11130 | |
| }, | |
| { | |
| "epoch": 2.7677018633540373, | |
| "grad_norm": 5.377154350280762, | |
| "learning_rate": 6.168944099378882e-05, | |
| "loss": 0.6783, | |
| "step": 11140 | |
| }, | |
| { | |
| "epoch": 2.770186335403727, | |
| "grad_norm": 6.318910121917725, | |
| "learning_rate": 6.156521739130435e-05, | |
| "loss": 0.7599, | |
| "step": 11150 | |
| }, | |
| { | |
| "epoch": 2.772670807453416, | |
| "grad_norm": 7.895182132720947, | |
| "learning_rate": 6.144099378881988e-05, | |
| "loss": 0.7931, | |
| "step": 11160 | |
| }, | |
| { | |
| "epoch": 2.775155279503106, | |
| "grad_norm": 8.503508567810059, | |
| "learning_rate": 6.131677018633541e-05, | |
| "loss": 0.6652, | |
| "step": 11170 | |
| }, | |
| { | |
| "epoch": 2.777639751552795, | |
| "grad_norm": 6.544893264770508, | |
| "learning_rate": 6.119254658385093e-05, | |
| "loss": 0.5642, | |
| "step": 11180 | |
| }, | |
| { | |
| "epoch": 2.7801242236024843, | |
| "grad_norm": 5.325340270996094, | |
| "learning_rate": 6.106832298136647e-05, | |
| "loss": 0.6045, | |
| "step": 11190 | |
| }, | |
| { | |
| "epoch": 2.782608695652174, | |
| "grad_norm": 8.904745101928711, | |
| "learning_rate": 6.094409937888199e-05, | |
| "loss": 0.6807, | |
| "step": 11200 | |
| }, | |
| { | |
| "epoch": 2.782608695652174, | |
| "eval_accuracy": 0.8122854879873272, | |
| "eval_loss": 0.715432345867157, | |
| "eval_runtime": 87.227, | |
| "eval_samples_per_second": 130.269, | |
| "eval_steps_per_second": 16.291, | |
| "step": 11200 | |
| }, | |
| { | |
| "epoch": 2.7850931677018633, | |
| "grad_norm": 5.014203071594238, | |
| "learning_rate": 6.0819875776397516e-05, | |
| "loss": 0.542, | |
| "step": 11210 | |
| }, | |
| { | |
| "epoch": 2.787577639751553, | |
| "grad_norm": 6.621218681335449, | |
| "learning_rate": 6.069565217391304e-05, | |
| "loss": 0.524, | |
| "step": 11220 | |
| }, | |
| { | |
| "epoch": 2.7900621118012423, | |
| "grad_norm": 5.968732833862305, | |
| "learning_rate": 6.0571428571428576e-05, | |
| "loss": 0.6332, | |
| "step": 11230 | |
| }, | |
| { | |
| "epoch": 2.792546583850932, | |
| "grad_norm": 6.3051438331604, | |
| "learning_rate": 6.0447204968944106e-05, | |
| "loss": 0.5523, | |
| "step": 11240 | |
| }, | |
| { | |
| "epoch": 2.795031055900621, | |
| "grad_norm": 3.917712450027466, | |
| "learning_rate": 6.032298136645963e-05, | |
| "loss": 0.8714, | |
| "step": 11250 | |
| }, | |
| { | |
| "epoch": 2.7975155279503108, | |
| "grad_norm": 6.610170841217041, | |
| "learning_rate": 6.019875776397515e-05, | |
| "loss": 0.6222, | |
| "step": 11260 | |
| }, | |
| { | |
| "epoch": 2.8, | |
| "grad_norm": 4.8922953605651855, | |
| "learning_rate": 6.007453416149068e-05, | |
| "loss": 0.8399, | |
| "step": 11270 | |
| }, | |
| { | |
| "epoch": 2.8024844720496893, | |
| "grad_norm": 6.774288654327393, | |
| "learning_rate": 5.995031055900622e-05, | |
| "loss": 0.8241, | |
| "step": 11280 | |
| }, | |
| { | |
| "epoch": 2.804968944099379, | |
| "grad_norm": 6.792983531951904, | |
| "learning_rate": 5.982608695652174e-05, | |
| "loss": 0.5947, | |
| "step": 11290 | |
| }, | |
| { | |
| "epoch": 2.8074534161490683, | |
| "grad_norm": 5.0632734298706055, | |
| "learning_rate": 5.9701863354037265e-05, | |
| "loss": 0.4485, | |
| "step": 11300 | |
| }, | |
| { | |
| "epoch": 2.8074534161490683, | |
| "eval_accuracy": 0.8180058083252663, | |
| "eval_loss": 0.6984890103340149, | |
| "eval_runtime": 86.6712, | |
| "eval_samples_per_second": 131.105, | |
| "eval_steps_per_second": 16.395, | |
| "step": 11300 | |
| }, | |
| { | |
| "epoch": 2.809937888198758, | |
| "grad_norm": 6.2507123947143555, | |
| "learning_rate": 5.9577639751552795e-05, | |
| "loss": 0.704, | |
| "step": 11310 | |
| }, | |
| { | |
| "epoch": 2.8124223602484473, | |
| "grad_norm": 5.285377025604248, | |
| "learning_rate": 5.945341614906833e-05, | |
| "loss": 0.5679, | |
| "step": 11320 | |
| }, | |
| { | |
| "epoch": 2.8149068322981368, | |
| "grad_norm": 7.2304792404174805, | |
| "learning_rate": 5.9329192546583855e-05, | |
| "loss": 0.5063, | |
| "step": 11330 | |
| }, | |
| { | |
| "epoch": 2.8173913043478263, | |
| "grad_norm": 6.580856800079346, | |
| "learning_rate": 5.9204968944099385e-05, | |
| "loss": 0.5677, | |
| "step": 11340 | |
| }, | |
| { | |
| "epoch": 2.8198757763975157, | |
| "grad_norm": 5.679018497467041, | |
| "learning_rate": 5.908074534161491e-05, | |
| "loss": 0.5706, | |
| "step": 11350 | |
| }, | |
| { | |
| "epoch": 2.822360248447205, | |
| "grad_norm": 5.586709499359131, | |
| "learning_rate": 5.895652173913043e-05, | |
| "loss": 0.6446, | |
| "step": 11360 | |
| }, | |
| { | |
| "epoch": 2.8248447204968943, | |
| "grad_norm": 4.558923244476318, | |
| "learning_rate": 5.883229813664597e-05, | |
| "loss": 0.6804, | |
| "step": 11370 | |
| }, | |
| { | |
| "epoch": 2.8273291925465838, | |
| "grad_norm": 9.596306800842285, | |
| "learning_rate": 5.87080745341615e-05, | |
| "loss": 0.6734, | |
| "step": 11380 | |
| }, | |
| { | |
| "epoch": 2.8298136645962733, | |
| "grad_norm": 3.818284749984741, | |
| "learning_rate": 5.858385093167702e-05, | |
| "loss": 0.6011, | |
| "step": 11390 | |
| }, | |
| { | |
| "epoch": 2.8322981366459627, | |
| "grad_norm": 4.609076023101807, | |
| "learning_rate": 5.8459627329192544e-05, | |
| "loss": 0.6694, | |
| "step": 11400 | |
| }, | |
| { | |
| "epoch": 2.8322981366459627, | |
| "eval_accuracy": 0.8147496259790549, | |
| "eval_loss": 0.7123826146125793, | |
| "eval_runtime": 86.7222, | |
| "eval_samples_per_second": 131.028, | |
| "eval_steps_per_second": 16.386, | |
| "step": 11400 | |
| }, | |
| { | |
| "epoch": 2.8347826086956522, | |
| "grad_norm": 6.28999137878418, | |
| "learning_rate": 5.833540372670808e-05, | |
| "loss": 0.6964, | |
| "step": 11410 | |
| }, | |
| { | |
| "epoch": 2.8372670807453417, | |
| "grad_norm": 3.3696694374084473, | |
| "learning_rate": 5.821118012422361e-05, | |
| "loss": 0.722, | |
| "step": 11420 | |
| }, | |
| { | |
| "epoch": 2.839751552795031, | |
| "grad_norm": 8.365155220031738, | |
| "learning_rate": 5.8086956521739133e-05, | |
| "loss": 0.5097, | |
| "step": 11430 | |
| }, | |
| { | |
| "epoch": 2.8422360248447207, | |
| "grad_norm": 2.5981850624084473, | |
| "learning_rate": 5.7962732919254657e-05, | |
| "loss": 0.5728, | |
| "step": 11440 | |
| }, | |
| { | |
| "epoch": 2.8447204968944098, | |
| "grad_norm": 4.385498523712158, | |
| "learning_rate": 5.7838509316770186e-05, | |
| "loss": 0.6647, | |
| "step": 11450 | |
| }, | |
| { | |
| "epoch": 2.8472049689440992, | |
| "grad_norm": 7.318809986114502, | |
| "learning_rate": 5.771428571428572e-05, | |
| "loss": 0.7441, | |
| "step": 11460 | |
| }, | |
| { | |
| "epoch": 2.8496894409937887, | |
| "grad_norm": 4.498103141784668, | |
| "learning_rate": 5.7590062111801246e-05, | |
| "loss": 0.7047, | |
| "step": 11470 | |
| }, | |
| { | |
| "epoch": 2.8521739130434782, | |
| "grad_norm": 8.885876655578613, | |
| "learning_rate": 5.746583850931677e-05, | |
| "loss": 0.7089, | |
| "step": 11480 | |
| }, | |
| { | |
| "epoch": 2.8546583850931677, | |
| "grad_norm": 9.858505249023438, | |
| "learning_rate": 5.73416149068323e-05, | |
| "loss": 0.7153, | |
| "step": 11490 | |
| }, | |
| { | |
| "epoch": 2.857142857142857, | |
| "grad_norm": 5.05450439453125, | |
| "learning_rate": 5.7217391304347836e-05, | |
| "loss": 0.6661, | |
| "step": 11500 | |
| }, | |
| { | |
| "epoch": 2.857142857142857, | |
| "eval_accuracy": 0.8152776555487107, | |
| "eval_loss": 0.7075205445289612, | |
| "eval_runtime": 87.0158, | |
| "eval_samples_per_second": 130.586, | |
| "eval_steps_per_second": 16.33, | |
| "step": 11500 | |
| }, | |
| { | |
| "epoch": 2.8596273291925467, | |
| "grad_norm": 3.5484821796417236, | |
| "learning_rate": 5.709316770186336e-05, | |
| "loss": 0.6991, | |
| "step": 11510 | |
| }, | |
| { | |
| "epoch": 2.862111801242236, | |
| "grad_norm": 3.2322356700897217, | |
| "learning_rate": 5.696894409937888e-05, | |
| "loss": 0.6749, | |
| "step": 11520 | |
| }, | |
| { | |
| "epoch": 2.8645962732919257, | |
| "grad_norm": 5.108699798583984, | |
| "learning_rate": 5.684472049689441e-05, | |
| "loss": 0.7303, | |
| "step": 11530 | |
| }, | |
| { | |
| "epoch": 2.8670807453416147, | |
| "grad_norm": 5.204659461975098, | |
| "learning_rate": 5.6720496894409935e-05, | |
| "loss": 0.6298, | |
| "step": 11540 | |
| }, | |
| { | |
| "epoch": 2.869565217391304, | |
| "grad_norm": 2.617388963699341, | |
| "learning_rate": 5.659627329192547e-05, | |
| "loss": 0.6892, | |
| "step": 11550 | |
| }, | |
| { | |
| "epoch": 2.8720496894409937, | |
| "grad_norm": 5.9790730476379395, | |
| "learning_rate": 5.6472049689440995e-05, | |
| "loss": 0.8314, | |
| "step": 11560 | |
| }, | |
| { | |
| "epoch": 2.874534161490683, | |
| "grad_norm": 8.729573249816895, | |
| "learning_rate": 5.6347826086956525e-05, | |
| "loss": 0.5681, | |
| "step": 11570 | |
| }, | |
| { | |
| "epoch": 2.8770186335403727, | |
| "grad_norm": 9.801512718200684, | |
| "learning_rate": 5.622360248447205e-05, | |
| "loss": 0.5574, | |
| "step": 11580 | |
| }, | |
| { | |
| "epoch": 2.879503105590062, | |
| "grad_norm": 10.816731452941895, | |
| "learning_rate": 5.6099378881987585e-05, | |
| "loss": 0.6772, | |
| "step": 11590 | |
| }, | |
| { | |
| "epoch": 2.8819875776397517, | |
| "grad_norm": 6.968757152557373, | |
| "learning_rate": 5.597515527950311e-05, | |
| "loss": 0.7971, | |
| "step": 11600 | |
| }, | |
| { | |
| "epoch": 2.8819875776397517, | |
| "eval_accuracy": 0.8077972366452522, | |
| "eval_loss": 0.7374622225761414, | |
| "eval_runtime": 87.4478, | |
| "eval_samples_per_second": 129.94, | |
| "eval_steps_per_second": 16.25, | |
| "step": 11600 | |
| }, | |
| { | |
| "epoch": 2.884472049689441, | |
| "grad_norm": 5.691667556762695, | |
| "learning_rate": 5.585093167701864e-05, | |
| "loss": 0.6013, | |
| "step": 11610 | |
| }, | |
| { | |
| "epoch": 2.8869565217391306, | |
| "grad_norm": 6.217525482177734, | |
| "learning_rate": 5.572670807453416e-05, | |
| "loss": 0.5398, | |
| "step": 11620 | |
| }, | |
| { | |
| "epoch": 2.8894409937888197, | |
| "grad_norm": 6.222617149353027, | |
| "learning_rate": 5.5602484472049684e-05, | |
| "loss": 0.7039, | |
| "step": 11630 | |
| }, | |
| { | |
| "epoch": 2.891925465838509, | |
| "grad_norm": 6.754746437072754, | |
| "learning_rate": 5.547826086956522e-05, | |
| "loss": 0.4396, | |
| "step": 11640 | |
| }, | |
| { | |
| "epoch": 2.8944099378881987, | |
| "grad_norm": 3.135385513305664, | |
| "learning_rate": 5.535403726708075e-05, | |
| "loss": 0.6041, | |
| "step": 11650 | |
| }, | |
| { | |
| "epoch": 2.896894409937888, | |
| "grad_norm": 8.670600891113281, | |
| "learning_rate": 5.5229813664596274e-05, | |
| "loss": 0.6501, | |
| "step": 11660 | |
| }, | |
| { | |
| "epoch": 2.8993788819875776, | |
| "grad_norm": 5.472225666046143, | |
| "learning_rate": 5.5105590062111804e-05, | |
| "loss": 0.6425, | |
| "step": 11670 | |
| }, | |
| { | |
| "epoch": 2.901863354037267, | |
| "grad_norm": 6.564612865447998, | |
| "learning_rate": 5.498136645962734e-05, | |
| "loss": 0.597, | |
| "step": 11680 | |
| }, | |
| { | |
| "epoch": 2.9043478260869566, | |
| "grad_norm": 4.676502227783203, | |
| "learning_rate": 5.485714285714286e-05, | |
| "loss": 0.8556, | |
| "step": 11690 | |
| }, | |
| { | |
| "epoch": 2.906832298136646, | |
| "grad_norm": 5.459942817687988, | |
| "learning_rate": 5.4732919254658386e-05, | |
| "loss": 0.9771, | |
| "step": 11700 | |
| }, | |
| { | |
| "epoch": 2.906832298136646, | |
| "eval_accuracy": 0.8132535421983631, | |
| "eval_loss": 0.7133490443229675, | |
| "eval_runtime": 87.3637, | |
| "eval_samples_per_second": 130.065, | |
| "eval_steps_per_second": 16.265, | |
| "step": 11700 | |
| }, | |
| { | |
| "epoch": 2.9093167701863356, | |
| "grad_norm": 4.296738624572754, | |
| "learning_rate": 5.4608695652173916e-05, | |
| "loss": 0.6457, | |
| "step": 11710 | |
| }, | |
| { | |
| "epoch": 2.9118012422360247, | |
| "grad_norm": 6.291906356811523, | |
| "learning_rate": 5.448447204968944e-05, | |
| "loss": 0.6148, | |
| "step": 11720 | |
| }, | |
| { | |
| "epoch": 2.914285714285714, | |
| "grad_norm": 2.410308837890625, | |
| "learning_rate": 5.4360248447204976e-05, | |
| "loss": 0.5634, | |
| "step": 11730 | |
| }, | |
| { | |
| "epoch": 2.9167701863354036, | |
| "grad_norm": 4.089565753936768, | |
| "learning_rate": 5.42360248447205e-05, | |
| "loss": 0.6921, | |
| "step": 11740 | |
| }, | |
| { | |
| "epoch": 2.919254658385093, | |
| "grad_norm": 6.613698482513428, | |
| "learning_rate": 5.411180124223603e-05, | |
| "loss": 0.7421, | |
| "step": 11750 | |
| }, | |
| { | |
| "epoch": 2.9217391304347826, | |
| "grad_norm": 6.556400775909424, | |
| "learning_rate": 5.398757763975155e-05, | |
| "loss": 0.7118, | |
| "step": 11760 | |
| }, | |
| { | |
| "epoch": 2.924223602484472, | |
| "grad_norm": 7.922701358795166, | |
| "learning_rate": 5.386335403726709e-05, | |
| "loss": 0.7489, | |
| "step": 11770 | |
| }, | |
| { | |
| "epoch": 2.9267080745341616, | |
| "grad_norm": 3.6202433109283447, | |
| "learning_rate": 5.373913043478261e-05, | |
| "loss": 0.3694, | |
| "step": 11780 | |
| }, | |
| { | |
| "epoch": 2.929192546583851, | |
| "grad_norm": 9.018277168273926, | |
| "learning_rate": 5.361490683229814e-05, | |
| "loss": 0.5022, | |
| "step": 11790 | |
| }, | |
| { | |
| "epoch": 2.9316770186335406, | |
| "grad_norm": 4.093759059906006, | |
| "learning_rate": 5.3490683229813665e-05, | |
| "loss": 0.5238, | |
| "step": 11800 | |
| }, | |
| { | |
| "epoch": 2.9316770186335406, | |
| "eval_accuracy": 0.8157176801900906, | |
| "eval_loss": 0.7077267169952393, | |
| "eval_runtime": 87.0199, | |
| "eval_samples_per_second": 130.579, | |
| "eval_steps_per_second": 16.33, | |
| "step": 11800 | |
| }, | |
| { | |
| "epoch": 2.9341614906832296, | |
| "grad_norm": 4.99535608291626, | |
| "learning_rate": 5.336645962732919e-05, | |
| "loss": 0.5953, | |
| "step": 11810 | |
| }, | |
| { | |
| "epoch": 2.936645962732919, | |
| "grad_norm": 7.4504194259643555, | |
| "learning_rate": 5.3242236024844725e-05, | |
| "loss": 0.8386, | |
| "step": 11820 | |
| }, | |
| { | |
| "epoch": 2.9391304347826086, | |
| "grad_norm": 6.058727741241455, | |
| "learning_rate": 5.3118012422360255e-05, | |
| "loss": 0.6208, | |
| "step": 11830 | |
| }, | |
| { | |
| "epoch": 2.941614906832298, | |
| "grad_norm": 6.454775333404541, | |
| "learning_rate": 5.299378881987578e-05, | |
| "loss": 0.6312, | |
| "step": 11840 | |
| }, | |
| { | |
| "epoch": 2.9440993788819876, | |
| "grad_norm": 5.638906478881836, | |
| "learning_rate": 5.28695652173913e-05, | |
| "loss": 0.6697, | |
| "step": 11850 | |
| }, | |
| { | |
| "epoch": 2.946583850931677, | |
| "grad_norm": 4.841670036315918, | |
| "learning_rate": 5.274534161490684e-05, | |
| "loss": 0.6628, | |
| "step": 11860 | |
| }, | |
| { | |
| "epoch": 2.9490683229813666, | |
| "grad_norm": 4.2036614418029785, | |
| "learning_rate": 5.262111801242237e-05, | |
| "loss": 0.5813, | |
| "step": 11870 | |
| }, | |
| { | |
| "epoch": 2.951552795031056, | |
| "grad_norm": 6.559536933898926, | |
| "learning_rate": 5.249689440993789e-05, | |
| "loss": 0.6546, | |
| "step": 11880 | |
| }, | |
| { | |
| "epoch": 2.9540372670807455, | |
| "grad_norm": 3.5744316577911377, | |
| "learning_rate": 5.2372670807453414e-05, | |
| "loss": 0.7345, | |
| "step": 11890 | |
| }, | |
| { | |
| "epoch": 2.9565217391304346, | |
| "grad_norm": 5.031458377838135, | |
| "learning_rate": 5.2248447204968944e-05, | |
| "loss": 0.5636, | |
| "step": 11900 | |
| }, | |
| { | |
| "epoch": 2.9565217391304346, | |
| "eval_accuracy": 0.802956965590073, | |
| "eval_loss": 0.7418798208236694, | |
| "eval_runtime": 87.6799, | |
| "eval_samples_per_second": 129.596, | |
| "eval_steps_per_second": 16.207, | |
| "step": 11900 | |
| }, | |
| { | |
| "epoch": 2.959006211180124, | |
| "grad_norm": 4.476680755615234, | |
| "learning_rate": 5.212422360248448e-05, | |
| "loss": 0.7594, | |
| "step": 11910 | |
| }, | |
| { | |
| "epoch": 2.9614906832298136, | |
| "grad_norm": 15.456870079040527, | |
| "learning_rate": 5.2000000000000004e-05, | |
| "loss": 0.8462, | |
| "step": 11920 | |
| }, | |
| { | |
| "epoch": 2.963975155279503, | |
| "grad_norm": 6.276050567626953, | |
| "learning_rate": 5.187577639751553e-05, | |
| "loss": 0.5847, | |
| "step": 11930 | |
| }, | |
| { | |
| "epoch": 2.9664596273291925, | |
| "grad_norm": 5.983313083648682, | |
| "learning_rate": 5.1751552795031057e-05, | |
| "loss": 0.7701, | |
| "step": 11940 | |
| }, | |
| { | |
| "epoch": 2.968944099378882, | |
| "grad_norm": 7.4835662841796875, | |
| "learning_rate": 5.162732919254659e-05, | |
| "loss": 0.5382, | |
| "step": 11950 | |
| }, | |
| { | |
| "epoch": 2.9714285714285715, | |
| "grad_norm": 5.3558831214904785, | |
| "learning_rate": 5.1503105590062116e-05, | |
| "loss": 0.672, | |
| "step": 11960 | |
| }, | |
| { | |
| "epoch": 2.973913043478261, | |
| "grad_norm": 9.933943748474121, | |
| "learning_rate": 5.137888198757764e-05, | |
| "loss": 0.6792, | |
| "step": 11970 | |
| }, | |
| { | |
| "epoch": 2.9763975155279505, | |
| "grad_norm": 3.512000799179077, | |
| "learning_rate": 5.125465838509317e-05, | |
| "loss": 0.6301, | |
| "step": 11980 | |
| }, | |
| { | |
| "epoch": 2.9788819875776396, | |
| "grad_norm": 0.8877289295196533, | |
| "learning_rate": 5.113043478260869e-05, | |
| "loss": 0.4571, | |
| "step": 11990 | |
| }, | |
| { | |
| "epoch": 2.981366459627329, | |
| "grad_norm": 10.120748519897461, | |
| "learning_rate": 5.100621118012423e-05, | |
| "loss": 0.8962, | |
| "step": 12000 | |
| }, | |
| { | |
| "epoch": 2.981366459627329, | |
| "eval_accuracy": 0.8174777787556103, | |
| "eval_loss": 0.7020727396011353, | |
| "eval_runtime": 86.2234, | |
| "eval_samples_per_second": 131.786, | |
| "eval_steps_per_second": 16.48, | |
| "step": 12000 | |
| }, | |
| { | |
| "epoch": 2.9838509316770185, | |
| "grad_norm": 6.098137855529785, | |
| "learning_rate": 5.088198757763976e-05, | |
| "loss": 0.7792, | |
| "step": 12010 | |
| }, | |
| { | |
| "epoch": 2.986335403726708, | |
| "grad_norm": 6.321715354919434, | |
| "learning_rate": 5.075776397515528e-05, | |
| "loss": 0.6683, | |
| "step": 12020 | |
| }, | |
| { | |
| "epoch": 2.9888198757763975, | |
| "grad_norm": 3.2365546226501465, | |
| "learning_rate": 5.0633540372670805e-05, | |
| "loss": 0.8028, | |
| "step": 12030 | |
| }, | |
| { | |
| "epoch": 2.991304347826087, | |
| "grad_norm": 6.188086986541748, | |
| "learning_rate": 5.0509316770186335e-05, | |
| "loss": 0.8973, | |
| "step": 12040 | |
| }, | |
| { | |
| "epoch": 2.9937888198757765, | |
| "grad_norm": 4.171976089477539, | |
| "learning_rate": 5.038509316770187e-05, | |
| "loss": 0.5392, | |
| "step": 12050 | |
| }, | |
| { | |
| "epoch": 2.996273291925466, | |
| "grad_norm": 10.866338729858398, | |
| "learning_rate": 5.0260869565217395e-05, | |
| "loss": 0.6474, | |
| "step": 12060 | |
| }, | |
| { | |
| "epoch": 2.9987577639751555, | |
| "grad_norm": 7.5085673332214355, | |
| "learning_rate": 5.013664596273292e-05, | |
| "loss": 0.5523, | |
| "step": 12070 | |
| }, | |
| { | |
| "epoch": 3.0012422360248445, | |
| "grad_norm": 8.900304794311523, | |
| "learning_rate": 5.001242236024845e-05, | |
| "loss": 0.4688, | |
| "step": 12080 | |
| }, | |
| { | |
| "epoch": 3.003726708074534, | |
| "grad_norm": 5.257197380065918, | |
| "learning_rate": 4.988819875776398e-05, | |
| "loss": 0.5883, | |
| "step": 12090 | |
| }, | |
| { | |
| "epoch": 3.0062111801242235, | |
| "grad_norm": 6.265869140625, | |
| "learning_rate": 4.976397515527951e-05, | |
| "loss": 0.4561, | |
| "step": 12100 | |
| }, | |
| { | |
| "epoch": 3.0062111801242235, | |
| "eval_accuracy": 0.8162457097597465, | |
| "eval_loss": 0.7031123042106628, | |
| "eval_runtime": 86.2703, | |
| "eval_samples_per_second": 131.714, | |
| "eval_steps_per_second": 16.471, | |
| "step": 12100 | |
| }, | |
| { | |
| "epoch": 3.008695652173913, | |
| "grad_norm": 7.839663505554199, | |
| "learning_rate": 4.963975155279503e-05, | |
| "loss": 0.6235, | |
| "step": 12110 | |
| }, | |
| { | |
| "epoch": 3.0111801242236025, | |
| "grad_norm": 2.760774850845337, | |
| "learning_rate": 4.951552795031056e-05, | |
| "loss": 0.4951, | |
| "step": 12120 | |
| }, | |
| { | |
| "epoch": 3.013664596273292, | |
| "grad_norm": 5.036975383758545, | |
| "learning_rate": 4.939130434782609e-05, | |
| "loss": 0.5424, | |
| "step": 12130 | |
| }, | |
| { | |
| "epoch": 3.0161490683229815, | |
| "grad_norm": 6.381801128387451, | |
| "learning_rate": 4.9267080745341614e-05, | |
| "loss": 0.4526, | |
| "step": 12140 | |
| }, | |
| { | |
| "epoch": 3.018633540372671, | |
| "grad_norm": 5.3697686195373535, | |
| "learning_rate": 4.9142857142857144e-05, | |
| "loss": 0.6119, | |
| "step": 12150 | |
| }, | |
| { | |
| "epoch": 3.0211180124223604, | |
| "grad_norm": 6.435357093811035, | |
| "learning_rate": 4.9018633540372674e-05, | |
| "loss": 0.5142, | |
| "step": 12160 | |
| }, | |
| { | |
| "epoch": 3.0236024844720495, | |
| "grad_norm": 4.873701572418213, | |
| "learning_rate": 4.8894409937888204e-05, | |
| "loss": 0.5177, | |
| "step": 12170 | |
| }, | |
| { | |
| "epoch": 3.026086956521739, | |
| "grad_norm": 2.1949551105499268, | |
| "learning_rate": 4.877018633540373e-05, | |
| "loss": 0.4267, | |
| "step": 12180 | |
| }, | |
| { | |
| "epoch": 3.0285714285714285, | |
| "grad_norm": 7.51536226272583, | |
| "learning_rate": 4.8645962732919257e-05, | |
| "loss": 0.6561, | |
| "step": 12190 | |
| }, | |
| { | |
| "epoch": 3.031055900621118, | |
| "grad_norm": 4.367460250854492, | |
| "learning_rate": 4.8521739130434786e-05, | |
| "loss": 0.4906, | |
| "step": 12200 | |
| }, | |
| { | |
| "epoch": 3.031055900621118, | |
| "eval_accuracy": 0.8171257590425064, | |
| "eval_loss": 0.710408627986908, | |
| "eval_runtime": 85.9193, | |
| "eval_samples_per_second": 132.252, | |
| "eval_steps_per_second": 16.539, | |
| "step": 12200 | |
| }, | |
| { | |
| "epoch": 3.0335403726708075, | |
| "grad_norm": 7.403229236602783, | |
| "learning_rate": 4.8397515527950316e-05, | |
| "loss": 0.5599, | |
| "step": 12210 | |
| }, | |
| { | |
| "epoch": 3.036024844720497, | |
| "grad_norm": 3.5904605388641357, | |
| "learning_rate": 4.827329192546584e-05, | |
| "loss": 0.4379, | |
| "step": 12220 | |
| }, | |
| { | |
| "epoch": 3.0385093167701864, | |
| "grad_norm": 7.364349842071533, | |
| "learning_rate": 4.814906832298137e-05, | |
| "loss": 0.5893, | |
| "step": 12230 | |
| }, | |
| { | |
| "epoch": 3.040993788819876, | |
| "grad_norm": 3.0802817344665527, | |
| "learning_rate": 4.80248447204969e-05, | |
| "loss": 0.532, | |
| "step": 12240 | |
| }, | |
| { | |
| "epoch": 3.0434782608695654, | |
| "grad_norm": 5.558223724365234, | |
| "learning_rate": 4.790062111801242e-05, | |
| "loss": 0.6785, | |
| "step": 12250 | |
| }, | |
| { | |
| "epoch": 3.0459627329192545, | |
| "grad_norm": 5.504637241363525, | |
| "learning_rate": 4.777639751552795e-05, | |
| "loss": 0.5697, | |
| "step": 12260 | |
| }, | |
| { | |
| "epoch": 3.048447204968944, | |
| "grad_norm": 3.261624574661255, | |
| "learning_rate": 4.765217391304348e-05, | |
| "loss": 0.4528, | |
| "step": 12270 | |
| }, | |
| { | |
| "epoch": 3.0509316770186334, | |
| "grad_norm": 7.631359577178955, | |
| "learning_rate": 4.752795031055901e-05, | |
| "loss": 0.5807, | |
| "step": 12280 | |
| }, | |
| { | |
| "epoch": 3.053416149068323, | |
| "grad_norm": 8.036623001098633, | |
| "learning_rate": 4.7403726708074535e-05, | |
| "loss": 0.7984, | |
| "step": 12290 | |
| }, | |
| { | |
| "epoch": 3.0559006211180124, | |
| "grad_norm": 10.502141952514648, | |
| "learning_rate": 4.727950310559006e-05, | |
| "loss": 0.5422, | |
| "step": 12300 | |
| }, | |
| { | |
| "epoch": 3.0559006211180124, | |
| "eval_accuracy": 0.8153656604769867, | |
| "eval_loss": 0.7035276293754578, | |
| "eval_runtime": 86.968, | |
| "eval_samples_per_second": 130.657, | |
| "eval_steps_per_second": 16.339, | |
| "step": 12300 | |
| }, | |
| { | |
| "epoch": 3.058385093167702, | |
| "grad_norm": 2.4105753898620605, | |
| "learning_rate": 4.7155279503105595e-05, | |
| "loss": 0.4012, | |
| "step": 12310 | |
| }, | |
| { | |
| "epoch": 3.0608695652173914, | |
| "grad_norm": 4.15570592880249, | |
| "learning_rate": 4.703105590062112e-05, | |
| "loss": 0.7022, | |
| "step": 12320 | |
| }, | |
| { | |
| "epoch": 3.063354037267081, | |
| "grad_norm": 10.396677017211914, | |
| "learning_rate": 4.690683229813665e-05, | |
| "loss": 0.5633, | |
| "step": 12330 | |
| }, | |
| { | |
| "epoch": 3.0658385093167704, | |
| "grad_norm": 3.672163963317871, | |
| "learning_rate": 4.678260869565218e-05, | |
| "loss": 0.5217, | |
| "step": 12340 | |
| }, | |
| { | |
| "epoch": 3.0683229813664594, | |
| "grad_norm": 4.405937671661377, | |
| "learning_rate": 4.665838509316771e-05, | |
| "loss": 0.3619, | |
| "step": 12350 | |
| }, | |
| { | |
| "epoch": 3.070807453416149, | |
| "grad_norm": 5.227725982666016, | |
| "learning_rate": 4.653416149068323e-05, | |
| "loss": 0.4803, | |
| "step": 12360 | |
| }, | |
| { | |
| "epoch": 3.0732919254658384, | |
| "grad_norm": 6.511715412139893, | |
| "learning_rate": 4.640993788819876e-05, | |
| "loss": 0.4904, | |
| "step": 12370 | |
| }, | |
| { | |
| "epoch": 3.075776397515528, | |
| "grad_norm": 2.1879351139068604, | |
| "learning_rate": 4.628571428571429e-05, | |
| "loss": 0.4648, | |
| "step": 12380 | |
| }, | |
| { | |
| "epoch": 3.0782608695652174, | |
| "grad_norm": 7.1389479637146, | |
| "learning_rate": 4.6161490683229814e-05, | |
| "loss": 0.3893, | |
| "step": 12390 | |
| }, | |
| { | |
| "epoch": 3.080745341614907, | |
| "grad_norm": 3.872439384460449, | |
| "learning_rate": 4.6037267080745344e-05, | |
| "loss": 0.5541, | |
| "step": 12400 | |
| }, | |
| { | |
| "epoch": 3.080745341614907, | |
| "eval_accuracy": 0.8231980990935492, | |
| "eval_loss": 0.6904828548431396, | |
| "eval_runtime": 87.516, | |
| "eval_samples_per_second": 129.839, | |
| "eval_steps_per_second": 16.237, | |
| "step": 12400 | |
| }, | |
| { | |
| "epoch": 3.0832298136645964, | |
| "grad_norm": 4.102145195007324, | |
| "learning_rate": 4.591304347826087e-05, | |
| "loss": 0.5671, | |
| "step": 12410 | |
| }, | |
| { | |
| "epoch": 3.085714285714286, | |
| "grad_norm": 10.544522285461426, | |
| "learning_rate": 4.5788819875776404e-05, | |
| "loss": 0.4794, | |
| "step": 12420 | |
| }, | |
| { | |
| "epoch": 3.0881987577639753, | |
| "grad_norm": 5.980569362640381, | |
| "learning_rate": 4.566459627329193e-05, | |
| "loss": 0.5564, | |
| "step": 12430 | |
| }, | |
| { | |
| "epoch": 3.0906832298136644, | |
| "grad_norm": 10.677704811096191, | |
| "learning_rate": 4.5540372670807457e-05, | |
| "loss": 0.543, | |
| "step": 12440 | |
| }, | |
| { | |
| "epoch": 3.093167701863354, | |
| "grad_norm": 5.909951686859131, | |
| "learning_rate": 4.541614906832298e-05, | |
| "loss": 0.5245, | |
| "step": 12450 | |
| }, | |
| { | |
| "epoch": 3.0956521739130434, | |
| "grad_norm": 16.215694427490234, | |
| "learning_rate": 4.5291925465838516e-05, | |
| "loss": 0.603, | |
| "step": 12460 | |
| }, | |
| { | |
| "epoch": 3.098136645962733, | |
| "grad_norm": 8.574531555175781, | |
| "learning_rate": 4.516770186335404e-05, | |
| "loss": 0.5718, | |
| "step": 12470 | |
| }, | |
| { | |
| "epoch": 3.1006211180124224, | |
| "grad_norm": 2.035837411880493, | |
| "learning_rate": 4.504347826086956e-05, | |
| "loss": 0.4221, | |
| "step": 12480 | |
| }, | |
| { | |
| "epoch": 3.103105590062112, | |
| "grad_norm": 8.264311790466309, | |
| "learning_rate": 4.49192546583851e-05, | |
| "loss": 0.6852, | |
| "step": 12490 | |
| }, | |
| { | |
| "epoch": 3.1055900621118013, | |
| "grad_norm": 5.228878021240234, | |
| "learning_rate": 4.479503105590062e-05, | |
| "loss": 0.5009, | |
| "step": 12500 | |
| }, | |
| { | |
| "epoch": 3.1055900621118013, | |
| "eval_accuracy": 0.8173017688990584, | |
| "eval_loss": 0.6993664503097534, | |
| "eval_runtime": 86.9481, | |
| "eval_samples_per_second": 130.687, | |
| "eval_steps_per_second": 16.343, | |
| "step": 12500 | |
| }, | |
| { | |
| "epoch": 3.108074534161491, | |
| "grad_norm": 5.872660160064697, | |
| "learning_rate": 4.467080745341615e-05, | |
| "loss": 0.4279, | |
| "step": 12510 | |
| }, | |
| { | |
| "epoch": 3.1105590062111803, | |
| "grad_norm": 2.8695497512817383, | |
| "learning_rate": 4.4546583850931675e-05, | |
| "loss": 0.4761, | |
| "step": 12520 | |
| }, | |
| { | |
| "epoch": 3.1130434782608694, | |
| "grad_norm": 4.605323791503906, | |
| "learning_rate": 4.442236024844721e-05, | |
| "loss": 0.5106, | |
| "step": 12530 | |
| }, | |
| { | |
| "epoch": 3.115527950310559, | |
| "grad_norm": 5.143415451049805, | |
| "learning_rate": 4.4298136645962735e-05, | |
| "loss": 0.5305, | |
| "step": 12540 | |
| }, | |
| { | |
| "epoch": 3.1180124223602483, | |
| "grad_norm": 3.625460386276245, | |
| "learning_rate": 4.4173913043478265e-05, | |
| "loss": 0.7476, | |
| "step": 12550 | |
| }, | |
| { | |
| "epoch": 3.120496894409938, | |
| "grad_norm": 4.011096954345703, | |
| "learning_rate": 4.404968944099379e-05, | |
| "loss": 0.543, | |
| "step": 12560 | |
| }, | |
| { | |
| "epoch": 3.1229813664596273, | |
| "grad_norm": 7.04062032699585, | |
| "learning_rate": 4.392546583850932e-05, | |
| "loss": 0.5789, | |
| "step": 12570 | |
| }, | |
| { | |
| "epoch": 3.125465838509317, | |
| "grad_norm": 7.262362003326416, | |
| "learning_rate": 4.380124223602485e-05, | |
| "loss": 0.6328, | |
| "step": 12580 | |
| }, | |
| { | |
| "epoch": 3.1279503105590063, | |
| "grad_norm": 5.33003044128418, | |
| "learning_rate": 4.367701863354037e-05, | |
| "loss": 0.5202, | |
| "step": 12590 | |
| }, | |
| { | |
| "epoch": 3.130434782608696, | |
| "grad_norm": 3.2615396976470947, | |
| "learning_rate": 4.35527950310559e-05, | |
| "loss": 0.4567, | |
| "step": 12600 | |
| }, | |
| { | |
| "epoch": 3.130434782608696, | |
| "eval_accuracy": 0.8202939364604418, | |
| "eval_loss": 0.6910972595214844, | |
| "eval_runtime": 87.6801, | |
| "eval_samples_per_second": 129.596, | |
| "eval_steps_per_second": 16.207, | |
| "step": 12600 | |
| }, | |
| { | |
| "epoch": 3.1329192546583853, | |
| "grad_norm": 5.849052906036377, | |
| "learning_rate": 4.342857142857143e-05, | |
| "loss": 0.6101, | |
| "step": 12610 | |
| }, | |
| { | |
| "epoch": 3.1354037267080743, | |
| "grad_norm": 4.340888023376465, | |
| "learning_rate": 4.330434782608696e-05, | |
| "loss": 0.5785, | |
| "step": 12620 | |
| }, | |
| { | |
| "epoch": 3.137888198757764, | |
| "grad_norm": 3.392591953277588, | |
| "learning_rate": 4.3180124223602484e-05, | |
| "loss": 0.5402, | |
| "step": 12630 | |
| }, | |
| { | |
| "epoch": 3.1403726708074533, | |
| "grad_norm": 3.3317670822143555, | |
| "learning_rate": 4.3055900621118014e-05, | |
| "loss": 0.6271, | |
| "step": 12640 | |
| }, | |
| { | |
| "epoch": 3.142857142857143, | |
| "grad_norm": 6.381196975708008, | |
| "learning_rate": 4.2931677018633544e-05, | |
| "loss": 0.3713, | |
| "step": 12650 | |
| }, | |
| { | |
| "epoch": 3.1453416149068323, | |
| "grad_norm": 7.92520809173584, | |
| "learning_rate": 4.280745341614907e-05, | |
| "loss": 0.5309, | |
| "step": 12660 | |
| }, | |
| { | |
| "epoch": 3.1478260869565218, | |
| "grad_norm": 3.4478583335876465, | |
| "learning_rate": 4.26832298136646e-05, | |
| "loss": 0.5995, | |
| "step": 12670 | |
| }, | |
| { | |
| "epoch": 3.1503105590062113, | |
| "grad_norm": 8.44995403289795, | |
| "learning_rate": 4.255900621118013e-05, | |
| "loss": 0.5604, | |
| "step": 12680 | |
| }, | |
| { | |
| "epoch": 3.1527950310559008, | |
| "grad_norm": 7.399325370788574, | |
| "learning_rate": 4.2434782608695657e-05, | |
| "loss": 0.685, | |
| "step": 12690 | |
| }, | |
| { | |
| "epoch": 3.1552795031055902, | |
| "grad_norm": 9.787561416625977, | |
| "learning_rate": 4.231055900621118e-05, | |
| "loss": 0.4431, | |
| "step": 12700 | |
| }, | |
| { | |
| "epoch": 3.1552795031055902, | |
| "eval_accuracy": 0.81923787732113, | |
| "eval_loss": 0.6932592391967773, | |
| "eval_runtime": 86.2789, | |
| "eval_samples_per_second": 131.701, | |
| "eval_steps_per_second": 16.47, | |
| "step": 12700 | |
| }, | |
| { | |
| "epoch": 3.1577639751552793, | |
| "grad_norm": 7.563392639160156, | |
| "learning_rate": 4.218633540372671e-05, | |
| "loss": 0.4515, | |
| "step": 12710 | |
| }, | |
| { | |
| "epoch": 3.160248447204969, | |
| "grad_norm": 2.8812592029571533, | |
| "learning_rate": 4.206211180124224e-05, | |
| "loss": 0.6153, | |
| "step": 12720 | |
| }, | |
| { | |
| "epoch": 3.1627329192546583, | |
| "grad_norm": 4.970517158508301, | |
| "learning_rate": 4.193788819875777e-05, | |
| "loss": 0.5428, | |
| "step": 12730 | |
| }, | |
| { | |
| "epoch": 3.1652173913043478, | |
| "grad_norm": 4.2496795654296875, | |
| "learning_rate": 4.181366459627329e-05, | |
| "loss": 0.5295, | |
| "step": 12740 | |
| }, | |
| { | |
| "epoch": 3.1677018633540373, | |
| "grad_norm": 5.023710250854492, | |
| "learning_rate": 4.168944099378882e-05, | |
| "loss": 0.3807, | |
| "step": 12750 | |
| }, | |
| { | |
| "epoch": 3.1701863354037267, | |
| "grad_norm": 3.99332594871521, | |
| "learning_rate": 4.156521739130435e-05, | |
| "loss": 0.3804, | |
| "step": 12760 | |
| }, | |
| { | |
| "epoch": 3.1726708074534162, | |
| "grad_norm": 5.442420959472656, | |
| "learning_rate": 4.1440993788819875e-05, | |
| "loss": 0.4354, | |
| "step": 12770 | |
| }, | |
| { | |
| "epoch": 3.1751552795031057, | |
| "grad_norm": 4.195496559143066, | |
| "learning_rate": 4.1316770186335405e-05, | |
| "loss": 0.4909, | |
| "step": 12780 | |
| }, | |
| { | |
| "epoch": 3.177639751552795, | |
| "grad_norm": 4.506777286529541, | |
| "learning_rate": 4.1192546583850935e-05, | |
| "loss": 0.6455, | |
| "step": 12790 | |
| }, | |
| { | |
| "epoch": 3.1801242236024843, | |
| "grad_norm": 8.970359802246094, | |
| "learning_rate": 4.1068322981366465e-05, | |
| "loss": 0.5915, | |
| "step": 12800 | |
| }, | |
| { | |
| "epoch": 3.1801242236024843, | |
| "eval_accuracy": 0.8220540350259614, | |
| "eval_loss": 0.6838474273681641, | |
| "eval_runtime": 88.8487, | |
| "eval_samples_per_second": 127.892, | |
| "eval_steps_per_second": 15.993, | |
| "step": 12800 | |
| }, | |
| { | |
| "epoch": 3.1826086956521737, | |
| "grad_norm": 8.059175491333008, | |
| "learning_rate": 4.094409937888199e-05, | |
| "loss": 0.5934, | |
| "step": 12810 | |
| }, | |
| { | |
| "epoch": 3.1850931677018632, | |
| "grad_norm": 3.4588656425476074, | |
| "learning_rate": 4.081987577639752e-05, | |
| "loss": 0.5678, | |
| "step": 12820 | |
| }, | |
| { | |
| "epoch": 3.1875776397515527, | |
| "grad_norm": 7.506095886230469, | |
| "learning_rate": 4.069565217391305e-05, | |
| "loss": 0.5356, | |
| "step": 12830 | |
| }, | |
| { | |
| "epoch": 3.190062111801242, | |
| "grad_norm": 4.169441223144531, | |
| "learning_rate": 4.057142857142857e-05, | |
| "loss": 0.4775, | |
| "step": 12840 | |
| }, | |
| { | |
| "epoch": 3.1925465838509317, | |
| "grad_norm": 4.875574111938477, | |
| "learning_rate": 4.04472049689441e-05, | |
| "loss": 0.4781, | |
| "step": 12850 | |
| }, | |
| { | |
| "epoch": 3.195031055900621, | |
| "grad_norm": 5.139460563659668, | |
| "learning_rate": 4.032298136645963e-05, | |
| "loss": 0.6762, | |
| "step": 12860 | |
| }, | |
| { | |
| "epoch": 3.1975155279503107, | |
| "grad_norm": 2.1224772930145264, | |
| "learning_rate": 4.019875776397516e-05, | |
| "loss": 0.4891, | |
| "step": 12870 | |
| }, | |
| { | |
| "epoch": 3.2, | |
| "grad_norm": 2.8898327350616455, | |
| "learning_rate": 4.0074534161490684e-05, | |
| "loss": 0.4209, | |
| "step": 12880 | |
| }, | |
| { | |
| "epoch": 3.2024844720496892, | |
| "grad_norm": 5.731484889984131, | |
| "learning_rate": 3.9950310559006214e-05, | |
| "loss": 0.5718, | |
| "step": 12890 | |
| }, | |
| { | |
| "epoch": 3.2049689440993787, | |
| "grad_norm": 5.2934136390686035, | |
| "learning_rate": 3.9826086956521744e-05, | |
| "loss": 0.5551, | |
| "step": 12900 | |
| }, | |
| { | |
| "epoch": 3.2049689440993787, | |
| "eval_accuracy": 0.8199419167473379, | |
| "eval_loss": 0.6885837316513062, | |
| "eval_runtime": 87.9526, | |
| "eval_samples_per_second": 129.195, | |
| "eval_steps_per_second": 16.156, | |
| "step": 12900 | |
| }, | |
| { | |
| "epoch": 3.207453416149068, | |
| "grad_norm": 4.657090187072754, | |
| "learning_rate": 3.970186335403727e-05, | |
| "loss": 0.4785, | |
| "step": 12910 | |
| }, | |
| { | |
| "epoch": 3.2099378881987577, | |
| "grad_norm": 7.804254531860352, | |
| "learning_rate": 3.95776397515528e-05, | |
| "loss": 0.7437, | |
| "step": 12920 | |
| }, | |
| { | |
| "epoch": 3.212422360248447, | |
| "grad_norm": 2.897365093231201, | |
| "learning_rate": 3.945341614906832e-05, | |
| "loss": 0.4121, | |
| "step": 12930 | |
| }, | |
| { | |
| "epoch": 3.2149068322981367, | |
| "grad_norm": 6.5088887214660645, | |
| "learning_rate": 3.9329192546583857e-05, | |
| "loss": 0.3793, | |
| "step": 12940 | |
| }, | |
| { | |
| "epoch": 3.217391304347826, | |
| "grad_norm": 5.799808502197266, | |
| "learning_rate": 3.920496894409938e-05, | |
| "loss": 0.5948, | |
| "step": 12950 | |
| }, | |
| { | |
| "epoch": 3.2198757763975157, | |
| "grad_norm": 2.5003743171691895, | |
| "learning_rate": 3.908074534161491e-05, | |
| "loss": 0.4539, | |
| "step": 12960 | |
| }, | |
| { | |
| "epoch": 3.222360248447205, | |
| "grad_norm": 6.782368183135986, | |
| "learning_rate": 3.895652173913043e-05, | |
| "loss": 0.6168, | |
| "step": 12970 | |
| }, | |
| { | |
| "epoch": 3.224844720496894, | |
| "grad_norm": 6.0730695724487305, | |
| "learning_rate": 3.883229813664597e-05, | |
| "loss": 0.7818, | |
| "step": 12980 | |
| }, | |
| { | |
| "epoch": 3.2273291925465837, | |
| "grad_norm": 5.4586615562438965, | |
| "learning_rate": 3.870807453416149e-05, | |
| "loss": 0.3219, | |
| "step": 12990 | |
| }, | |
| { | |
| "epoch": 3.229813664596273, | |
| "grad_norm": 5.29102087020874, | |
| "learning_rate": 3.8583850931677016e-05, | |
| "loss": 0.4528, | |
| "step": 13000 | |
| }, | |
| { | |
| "epoch": 3.229813664596273, | |
| "eval_accuracy": 0.8211739857432017, | |
| "eval_loss": 0.6882742047309875, | |
| "eval_runtime": 86.885, | |
| "eval_samples_per_second": 130.782, | |
| "eval_steps_per_second": 16.355, | |
| "step": 13000 | |
| }, | |
| { | |
| "epoch": 3.2322981366459627, | |
| "grad_norm": 9.615778923034668, | |
| "learning_rate": 3.845962732919255e-05, | |
| "loss": 0.7963, | |
| "step": 13010 | |
| }, | |
| { | |
| "epoch": 3.234782608695652, | |
| "grad_norm": 6.507978439331055, | |
| "learning_rate": 3.8335403726708075e-05, | |
| "loss": 0.4032, | |
| "step": 13020 | |
| }, | |
| { | |
| "epoch": 3.2372670807453416, | |
| "grad_norm": 7.837948322296143, | |
| "learning_rate": 3.8211180124223605e-05, | |
| "loss": 0.6404, | |
| "step": 13030 | |
| }, | |
| { | |
| "epoch": 3.239751552795031, | |
| "grad_norm": 3.602900505065918, | |
| "learning_rate": 3.808695652173913e-05, | |
| "loss": 0.5245, | |
| "step": 13040 | |
| }, | |
| { | |
| "epoch": 3.2422360248447206, | |
| "grad_norm": 5.966063976287842, | |
| "learning_rate": 3.7962732919254665e-05, | |
| "loss": 0.774, | |
| "step": 13050 | |
| }, | |
| { | |
| "epoch": 3.24472049689441, | |
| "grad_norm": 4.69325065612793, | |
| "learning_rate": 3.783850931677019e-05, | |
| "loss": 0.5157, | |
| "step": 13060 | |
| }, | |
| { | |
| "epoch": 3.247204968944099, | |
| "grad_norm": 6.513613700866699, | |
| "learning_rate": 3.771428571428572e-05, | |
| "loss": 0.5637, | |
| "step": 13070 | |
| }, | |
| { | |
| "epoch": 3.2496894409937886, | |
| "grad_norm": 4.473712921142578, | |
| "learning_rate": 3.759006211180124e-05, | |
| "loss": 0.3706, | |
| "step": 13080 | |
| }, | |
| { | |
| "epoch": 3.252173913043478, | |
| "grad_norm": 6.620151519775391, | |
| "learning_rate": 3.746583850931677e-05, | |
| "loss": 0.5956, | |
| "step": 13090 | |
| }, | |
| { | |
| "epoch": 3.2546583850931676, | |
| "grad_norm": 6.897200584411621, | |
| "learning_rate": 3.73416149068323e-05, | |
| "loss": 0.5563, | |
| "step": 13100 | |
| }, | |
| { | |
| "epoch": 3.2546583850931676, | |
| "eval_accuracy": 0.81923787732113, | |
| "eval_loss": 0.6866790056228638, | |
| "eval_runtime": 87.4328, | |
| "eval_samples_per_second": 129.963, | |
| "eval_steps_per_second": 16.252, | |
| "step": 13100 | |
| }, | |
| { | |
| "epoch": 3.257142857142857, | |
| "grad_norm": 5.518016338348389, | |
| "learning_rate": 3.7217391304347824e-05, | |
| "loss": 0.4258, | |
| "step": 13110 | |
| }, | |
| { | |
| "epoch": 3.2596273291925466, | |
| "grad_norm": 6.806578159332275, | |
| "learning_rate": 3.7093167701863354e-05, | |
| "loss": 0.5132, | |
| "step": 13120 | |
| }, | |
| { | |
| "epoch": 3.262111801242236, | |
| "grad_norm": 1.4067715406417847, | |
| "learning_rate": 3.6968944099378884e-05, | |
| "loss": 0.4693, | |
| "step": 13130 | |
| }, | |
| { | |
| "epoch": 3.2645962732919256, | |
| "grad_norm": 1.4255828857421875, | |
| "learning_rate": 3.6844720496894414e-05, | |
| "loss": 0.5003, | |
| "step": 13140 | |
| }, | |
| { | |
| "epoch": 3.267080745341615, | |
| "grad_norm": 6.888153076171875, | |
| "learning_rate": 3.672049689440994e-05, | |
| "loss": 0.463, | |
| "step": 13150 | |
| }, | |
| { | |
| "epoch": 3.269565217391304, | |
| "grad_norm": 6.642817974090576, | |
| "learning_rate": 3.659627329192547e-05, | |
| "loss": 0.4589, | |
| "step": 13160 | |
| }, | |
| { | |
| "epoch": 3.2720496894409936, | |
| "grad_norm": 6.386394023895264, | |
| "learning_rate": 3.6472049689441e-05, | |
| "loss": 0.4738, | |
| "step": 13170 | |
| }, | |
| { | |
| "epoch": 3.274534161490683, | |
| "grad_norm": 13.161245346069336, | |
| "learning_rate": 3.634782608695652e-05, | |
| "loss": 0.6596, | |
| "step": 13180 | |
| }, | |
| { | |
| "epoch": 3.2770186335403726, | |
| "grad_norm": 11.36682415008545, | |
| "learning_rate": 3.622360248447205e-05, | |
| "loss": 0.7889, | |
| "step": 13190 | |
| }, | |
| { | |
| "epoch": 3.279503105590062, | |
| "grad_norm": 2.1233813762664795, | |
| "learning_rate": 3.609937888198758e-05, | |
| "loss": 0.4836, | |
| "step": 13200 | |
| }, | |
| { | |
| "epoch": 3.279503105590062, | |
| "eval_accuracy": 0.8253102173721728, | |
| "eval_loss": 0.6771336793899536, | |
| "eval_runtime": 86.9751, | |
| "eval_samples_per_second": 130.647, | |
| "eval_steps_per_second": 16.338, | |
| "step": 13200 | |
| }, | |
| { | |
| "epoch": 3.2819875776397516, | |
| "grad_norm": 9.009103775024414, | |
| "learning_rate": 3.597515527950311e-05, | |
| "loss": 0.5785, | |
| "step": 13210 | |
| }, | |
| { | |
| "epoch": 3.284472049689441, | |
| "grad_norm": 4.186812400817871, | |
| "learning_rate": 3.585093167701863e-05, | |
| "loss": 0.3961, | |
| "step": 13220 | |
| }, | |
| { | |
| "epoch": 3.2869565217391306, | |
| "grad_norm": 4.9091901779174805, | |
| "learning_rate": 3.572670807453416e-05, | |
| "loss": 0.5125, | |
| "step": 13230 | |
| }, | |
| { | |
| "epoch": 3.28944099378882, | |
| "grad_norm": 4.11280632019043, | |
| "learning_rate": 3.560248447204969e-05, | |
| "loss": 0.5678, | |
| "step": 13240 | |
| }, | |
| { | |
| "epoch": 3.291925465838509, | |
| "grad_norm": 4.458592414855957, | |
| "learning_rate": 3.5478260869565216e-05, | |
| "loss": 0.4378, | |
| "step": 13250 | |
| }, | |
| { | |
| "epoch": 3.2944099378881986, | |
| "grad_norm": 4.41200590133667, | |
| "learning_rate": 3.5354037267080746e-05, | |
| "loss": 0.4501, | |
| "step": 13260 | |
| }, | |
| { | |
| "epoch": 3.296894409937888, | |
| "grad_norm": 9.820028305053711, | |
| "learning_rate": 3.5229813664596275e-05, | |
| "loss": 0.4385, | |
| "step": 13270 | |
| }, | |
| { | |
| "epoch": 3.2993788819875776, | |
| "grad_norm": 6.210055351257324, | |
| "learning_rate": 3.5105590062111805e-05, | |
| "loss": 0.6382, | |
| "step": 13280 | |
| }, | |
| { | |
| "epoch": 3.301863354037267, | |
| "grad_norm": 7.428834915161133, | |
| "learning_rate": 3.498136645962733e-05, | |
| "loss": 0.5374, | |
| "step": 13290 | |
| }, | |
| { | |
| "epoch": 3.3043478260869565, | |
| "grad_norm": 2.4320147037506104, | |
| "learning_rate": 3.485714285714286e-05, | |
| "loss": 0.4535, | |
| "step": 13300 | |
| }, | |
| { | |
| "epoch": 3.3043478260869565, | |
| "eval_accuracy": 0.8248701927307929, | |
| "eval_loss": 0.6713078022003174, | |
| "eval_runtime": 86.3323, | |
| "eval_samples_per_second": 131.619, | |
| "eval_steps_per_second": 16.46, | |
| "step": 13300 | |
| }, | |
| { | |
| "epoch": 3.306832298136646, | |
| "grad_norm": 18.133155822753906, | |
| "learning_rate": 3.473291925465839e-05, | |
| "loss": 0.3095, | |
| "step": 13310 | |
| }, | |
| { | |
| "epoch": 3.3093167701863355, | |
| "grad_norm": 6.6480393409729, | |
| "learning_rate": 3.460869565217392e-05, | |
| "loss": 0.3276, | |
| "step": 13320 | |
| }, | |
| { | |
| "epoch": 3.311801242236025, | |
| "grad_norm": 5.606024265289307, | |
| "learning_rate": 3.448447204968944e-05, | |
| "loss": 0.5692, | |
| "step": 13330 | |
| }, | |
| { | |
| "epoch": 3.314285714285714, | |
| "grad_norm": 3.627607822418213, | |
| "learning_rate": 3.436024844720497e-05, | |
| "loss": 0.5434, | |
| "step": 13340 | |
| }, | |
| { | |
| "epoch": 3.3167701863354035, | |
| "grad_norm": 7.17358922958374, | |
| "learning_rate": 3.42360248447205e-05, | |
| "loss": 0.5071, | |
| "step": 13350 | |
| }, | |
| { | |
| "epoch": 3.319254658385093, | |
| "grad_norm": 5.642586708068848, | |
| "learning_rate": 3.4111801242236024e-05, | |
| "loss": 0.4079, | |
| "step": 13360 | |
| }, | |
| { | |
| "epoch": 3.3217391304347825, | |
| "grad_norm": 5.64650297164917, | |
| "learning_rate": 3.3987577639751554e-05, | |
| "loss": 0.434, | |
| "step": 13370 | |
| }, | |
| { | |
| "epoch": 3.324223602484472, | |
| "grad_norm": 3.2044386863708496, | |
| "learning_rate": 3.3863354037267084e-05, | |
| "loss": 0.6493, | |
| "step": 13380 | |
| }, | |
| { | |
| "epoch": 3.3267080745341615, | |
| "grad_norm": 3.279977321624756, | |
| "learning_rate": 3.3739130434782614e-05, | |
| "loss": 0.3453, | |
| "step": 13390 | |
| }, | |
| { | |
| "epoch": 3.329192546583851, | |
| "grad_norm": 7.515082359313965, | |
| "learning_rate": 3.361490683229814e-05, | |
| "loss": 0.468, | |
| "step": 13400 | |
| }, | |
| { | |
| "epoch": 3.329192546583851, | |
| "eval_accuracy": 0.8269823110094165, | |
| "eval_loss": 0.6615992188453674, | |
| "eval_runtime": 87.0347, | |
| "eval_samples_per_second": 130.557, | |
| "eval_steps_per_second": 16.327, | |
| "step": 13400 | |
| }, | |
| { | |
| "epoch": 3.3316770186335405, | |
| "grad_norm": 1.8611090183258057, | |
| "learning_rate": 3.349068322981367e-05, | |
| "loss": 0.4831, | |
| "step": 13410 | |
| }, | |
| { | |
| "epoch": 3.33416149068323, | |
| "grad_norm": 6.314669609069824, | |
| "learning_rate": 3.33664596273292e-05, | |
| "loss": 0.5625, | |
| "step": 13420 | |
| }, | |
| { | |
| "epoch": 3.336645962732919, | |
| "grad_norm": 9.314018249511719, | |
| "learning_rate": 3.324223602484472e-05, | |
| "loss": 0.4882, | |
| "step": 13430 | |
| }, | |
| { | |
| "epoch": 3.3391304347826085, | |
| "grad_norm": 6.195760726928711, | |
| "learning_rate": 3.311801242236025e-05, | |
| "loss": 0.505, | |
| "step": 13440 | |
| }, | |
| { | |
| "epoch": 3.341614906832298, | |
| "grad_norm": 3.5561578273773193, | |
| "learning_rate": 3.299378881987577e-05, | |
| "loss": 0.485, | |
| "step": 13450 | |
| }, | |
| { | |
| "epoch": 3.3440993788819875, | |
| "grad_norm": 8.28506088256836, | |
| "learning_rate": 3.286956521739131e-05, | |
| "loss": 0.5624, | |
| "step": 13460 | |
| }, | |
| { | |
| "epoch": 3.346583850931677, | |
| "grad_norm": 3.2488527297973633, | |
| "learning_rate": 3.274534161490683e-05, | |
| "loss": 0.4358, | |
| "step": 13470 | |
| }, | |
| { | |
| "epoch": 3.3490683229813665, | |
| "grad_norm": 1.8179543018341064, | |
| "learning_rate": 3.262111801242236e-05, | |
| "loss": 0.4578, | |
| "step": 13480 | |
| }, | |
| { | |
| "epoch": 3.351552795031056, | |
| "grad_norm": 5.033318519592285, | |
| "learning_rate": 3.249689440993789e-05, | |
| "loss": 0.4818, | |
| "step": 13490 | |
| }, | |
| { | |
| "epoch": 3.3540372670807455, | |
| "grad_norm": 7.270232200622559, | |
| "learning_rate": 3.237267080745342e-05, | |
| "loss": 0.4691, | |
| "step": 13500 | |
| }, | |
| { | |
| "epoch": 3.3540372670807455, | |
| "eval_accuracy": 0.8261022617266567, | |
| "eval_loss": 0.6706886291503906, | |
| "eval_runtime": 87.6016, | |
| "eval_samples_per_second": 129.712, | |
| "eval_steps_per_second": 16.221, | |
| "step": 13500 | |
| }, | |
| { | |
| "epoch": 3.356521739130435, | |
| "grad_norm": 4.949516773223877, | |
| "learning_rate": 3.2248447204968946e-05, | |
| "loss": 0.3803, | |
| "step": 13510 | |
| }, | |
| { | |
| "epoch": 3.359006211180124, | |
| "grad_norm": 6.229318618774414, | |
| "learning_rate": 3.212422360248447e-05, | |
| "loss": 0.7245, | |
| "step": 13520 | |
| }, | |
| { | |
| "epoch": 3.3614906832298135, | |
| "grad_norm": 5.414929389953613, | |
| "learning_rate": 3.2000000000000005e-05, | |
| "loss": 0.5406, | |
| "step": 13530 | |
| }, | |
| { | |
| "epoch": 3.363975155279503, | |
| "grad_norm": 4.069797992706299, | |
| "learning_rate": 3.187577639751553e-05, | |
| "loss": 0.4012, | |
| "step": 13540 | |
| }, | |
| { | |
| "epoch": 3.3664596273291925, | |
| "grad_norm": 5.728483200073242, | |
| "learning_rate": 3.175155279503106e-05, | |
| "loss": 0.5387, | |
| "step": 13550 | |
| }, | |
| { | |
| "epoch": 3.368944099378882, | |
| "grad_norm": 3.4796948432922363, | |
| "learning_rate": 3.162732919254658e-05, | |
| "loss": 0.4261, | |
| "step": 13560 | |
| }, | |
| { | |
| "epoch": 3.3714285714285714, | |
| "grad_norm": 8.10731029510498, | |
| "learning_rate": 3.150310559006212e-05, | |
| "loss": 0.5874, | |
| "step": 13570 | |
| }, | |
| { | |
| "epoch": 3.373913043478261, | |
| "grad_norm": 5.234379291534424, | |
| "learning_rate": 3.137888198757764e-05, | |
| "loss": 0.5326, | |
| "step": 13580 | |
| }, | |
| { | |
| "epoch": 3.3763975155279504, | |
| "grad_norm": 3.38866925239563, | |
| "learning_rate": 3.125465838509317e-05, | |
| "loss": 0.3288, | |
| "step": 13590 | |
| }, | |
| { | |
| "epoch": 3.37888198757764, | |
| "grad_norm": 2.9035232067108154, | |
| "learning_rate": 3.1130434782608694e-05, | |
| "loss": 0.4784, | |
| "step": 13600 | |
| }, | |
| { | |
| "epoch": 3.37888198757764, | |
| "eval_accuracy": 0.8240781483763091, | |
| "eval_loss": 0.6732914447784424, | |
| "eval_runtime": 86.5557, | |
| "eval_samples_per_second": 131.28, | |
| "eval_steps_per_second": 16.417, | |
| "step": 13600 | |
| }, | |
| { | |
| "epoch": 3.381366459627329, | |
| "grad_norm": 4.350976467132568, | |
| "learning_rate": 3.1006211180124224e-05, | |
| "loss": 0.3132, | |
| "step": 13610 | |
| }, | |
| { | |
| "epoch": 3.3838509316770184, | |
| "grad_norm": 3.3074676990509033, | |
| "learning_rate": 3.0881987577639754e-05, | |
| "loss": 0.5839, | |
| "step": 13620 | |
| }, | |
| { | |
| "epoch": 3.386335403726708, | |
| "grad_norm": 2.9822394847869873, | |
| "learning_rate": 3.075776397515528e-05, | |
| "loss": 0.4328, | |
| "step": 13630 | |
| }, | |
| { | |
| "epoch": 3.3888198757763974, | |
| "grad_norm": 3.2798781394958496, | |
| "learning_rate": 3.063354037267081e-05, | |
| "loss": 0.3691, | |
| "step": 13640 | |
| }, | |
| { | |
| "epoch": 3.391304347826087, | |
| "grad_norm": 6.1266279220581055, | |
| "learning_rate": 3.0509316770186337e-05, | |
| "loss": 0.4765, | |
| "step": 13650 | |
| }, | |
| { | |
| "epoch": 3.3937888198757764, | |
| "grad_norm": 5.225902080535889, | |
| "learning_rate": 3.0385093167701867e-05, | |
| "loss": 0.5248, | |
| "step": 13660 | |
| }, | |
| { | |
| "epoch": 3.396273291925466, | |
| "grad_norm": 3.3516387939453125, | |
| "learning_rate": 3.0260869565217393e-05, | |
| "loss": 0.7746, | |
| "step": 13670 | |
| }, | |
| { | |
| "epoch": 3.3987577639751554, | |
| "grad_norm": 5.730987071990967, | |
| "learning_rate": 3.0136645962732923e-05, | |
| "loss": 0.5716, | |
| "step": 13680 | |
| }, | |
| { | |
| "epoch": 3.401242236024845, | |
| "grad_norm": 7.150260925292969, | |
| "learning_rate": 3.001242236024845e-05, | |
| "loss": 0.461, | |
| "step": 13690 | |
| }, | |
| { | |
| "epoch": 3.403726708074534, | |
| "grad_norm": 5.765717029571533, | |
| "learning_rate": 2.9888198757763973e-05, | |
| "loss": 0.5187, | |
| "step": 13700 | |
| }, | |
| { | |
| "epoch": 3.403726708074534, | |
| "eval_accuracy": 0.8251342075156208, | |
| "eval_loss": 0.6657703518867493, | |
| "eval_runtime": 86.2323, | |
| "eval_samples_per_second": 131.772, | |
| "eval_steps_per_second": 16.479, | |
| "step": 13700 | |
| }, | |
| { | |
| "epoch": 3.4062111801242234, | |
| "grad_norm": 3.005549907684326, | |
| "learning_rate": 2.9763975155279506e-05, | |
| "loss": 0.5749, | |
| "step": 13710 | |
| }, | |
| { | |
| "epoch": 3.408695652173913, | |
| "grad_norm": 8.730533599853516, | |
| "learning_rate": 2.963975155279503e-05, | |
| "loss": 0.6285, | |
| "step": 13720 | |
| }, | |
| { | |
| "epoch": 3.4111801242236024, | |
| "grad_norm": 2.9770872592926025, | |
| "learning_rate": 2.9515527950310563e-05, | |
| "loss": 0.7003, | |
| "step": 13730 | |
| }, | |
| { | |
| "epoch": 3.413664596273292, | |
| "grad_norm": 4.815559387207031, | |
| "learning_rate": 2.939130434782609e-05, | |
| "loss": 0.5325, | |
| "step": 13740 | |
| }, | |
| { | |
| "epoch": 3.4161490683229814, | |
| "grad_norm": 4.2376298904418945, | |
| "learning_rate": 2.926708074534162e-05, | |
| "loss": 0.572, | |
| "step": 13750 | |
| }, | |
| { | |
| "epoch": 3.418633540372671, | |
| "grad_norm": 5.942477226257324, | |
| "learning_rate": 2.9142857142857146e-05, | |
| "loss": 0.6795, | |
| "step": 13760 | |
| }, | |
| { | |
| "epoch": 3.4211180124223604, | |
| "grad_norm": 5.977138042449951, | |
| "learning_rate": 2.901863354037267e-05, | |
| "loss": 0.4785, | |
| "step": 13770 | |
| }, | |
| { | |
| "epoch": 3.42360248447205, | |
| "grad_norm": 3.4962573051452637, | |
| "learning_rate": 2.8894409937888202e-05, | |
| "loss": 0.4012, | |
| "step": 13780 | |
| }, | |
| { | |
| "epoch": 3.426086956521739, | |
| "grad_norm": 0.6948124766349792, | |
| "learning_rate": 2.8770186335403725e-05, | |
| "loss": 0.5582, | |
| "step": 13790 | |
| }, | |
| { | |
| "epoch": 3.4285714285714284, | |
| "grad_norm": 7.217972755432129, | |
| "learning_rate": 2.864596273291926e-05, | |
| "loss": 0.5105, | |
| "step": 13800 | |
| }, | |
| { | |
| "epoch": 3.4285714285714284, | |
| "eval_accuracy": 0.8275103405790725, | |
| "eval_loss": 0.6631360650062561, | |
| "eval_runtime": 87.0123, | |
| "eval_samples_per_second": 130.591, | |
| "eval_steps_per_second": 16.331, | |
| "step": 13800 | |
| }, | |
| { | |
| "epoch": 3.431055900621118, | |
| "grad_norm": 5.591545104980469, | |
| "learning_rate": 2.852173913043478e-05, | |
| "loss": 0.5408, | |
| "step": 13810 | |
| }, | |
| { | |
| "epoch": 3.4335403726708074, | |
| "grad_norm": 5.493480682373047, | |
| "learning_rate": 2.8397515527950315e-05, | |
| "loss": 0.5014, | |
| "step": 13820 | |
| }, | |
| { | |
| "epoch": 3.436024844720497, | |
| "grad_norm": 6.324045658111572, | |
| "learning_rate": 2.8273291925465838e-05, | |
| "loss": 0.5761, | |
| "step": 13830 | |
| }, | |
| { | |
| "epoch": 3.4385093167701863, | |
| "grad_norm": 4.297603130340576, | |
| "learning_rate": 2.814906832298137e-05, | |
| "loss": 0.4817, | |
| "step": 13840 | |
| }, | |
| { | |
| "epoch": 3.440993788819876, | |
| "grad_norm": 4.620813369750977, | |
| "learning_rate": 2.8024844720496894e-05, | |
| "loss": 0.4831, | |
| "step": 13850 | |
| }, | |
| { | |
| "epoch": 3.4434782608695653, | |
| "grad_norm": 4.357455730438232, | |
| "learning_rate": 2.790062111801242e-05, | |
| "loss": 0.5194, | |
| "step": 13860 | |
| }, | |
| { | |
| "epoch": 3.445962732919255, | |
| "grad_norm": 6.38654088973999, | |
| "learning_rate": 2.777639751552795e-05, | |
| "loss": 0.4436, | |
| "step": 13870 | |
| }, | |
| { | |
| "epoch": 3.448447204968944, | |
| "grad_norm": 5.826173305511475, | |
| "learning_rate": 2.7652173913043477e-05, | |
| "loss": 0.4366, | |
| "step": 13880 | |
| }, | |
| { | |
| "epoch": 3.4509316770186333, | |
| "grad_norm": 6.082293510437012, | |
| "learning_rate": 2.7527950310559007e-05, | |
| "loss": 0.4897, | |
| "step": 13890 | |
| }, | |
| { | |
| "epoch": 3.453416149068323, | |
| "grad_norm": 6.084004878997803, | |
| "learning_rate": 2.7416149068322983e-05, | |
| "loss": 0.3935, | |
| "step": 13900 | |
| }, | |
| { | |
| "epoch": 3.453416149068323, | |
| "eval_accuracy": 0.8283023849335562, | |
| "eval_loss": 0.6656120419502258, | |
| "eval_runtime": 85.6523, | |
| "eval_samples_per_second": 132.664, | |
| "eval_steps_per_second": 16.59, | |
| "step": 13900 | |
| }, | |
| { | |
| "epoch": 3.4559006211180123, | |
| "grad_norm": 6.510132789611816, | |
| "learning_rate": 2.729192546583851e-05, | |
| "loss": 0.4582, | |
| "step": 13910 | |
| }, | |
| { | |
| "epoch": 3.458385093167702, | |
| "grad_norm": 6.053948402404785, | |
| "learning_rate": 2.716770186335404e-05, | |
| "loss": 0.653, | |
| "step": 13920 | |
| }, | |
| { | |
| "epoch": 3.4608695652173913, | |
| "grad_norm": 3.9080560207366943, | |
| "learning_rate": 2.7043478260869566e-05, | |
| "loss": 0.6322, | |
| "step": 13930 | |
| }, | |
| { | |
| "epoch": 3.463354037267081, | |
| "grad_norm": 2.829498052597046, | |
| "learning_rate": 2.6919254658385095e-05, | |
| "loss": 0.3978, | |
| "step": 13940 | |
| }, | |
| { | |
| "epoch": 3.4658385093167703, | |
| "grad_norm": 4.029519557952881, | |
| "learning_rate": 2.6795031055900622e-05, | |
| "loss": 0.3532, | |
| "step": 13950 | |
| }, | |
| { | |
| "epoch": 3.46832298136646, | |
| "grad_norm": 8.106303215026855, | |
| "learning_rate": 2.6670807453416152e-05, | |
| "loss": 0.5056, | |
| "step": 13960 | |
| }, | |
| { | |
| "epoch": 3.470807453416149, | |
| "grad_norm": 9.305558204650879, | |
| "learning_rate": 2.654658385093168e-05, | |
| "loss": 0.6274, | |
| "step": 13970 | |
| }, | |
| { | |
| "epoch": 3.4732919254658388, | |
| "grad_norm": 6.586569786071777, | |
| "learning_rate": 2.6422360248447208e-05, | |
| "loss": 0.524, | |
| "step": 13980 | |
| }, | |
| { | |
| "epoch": 3.475776397515528, | |
| "grad_norm": 4.757368087768555, | |
| "learning_rate": 2.6298136645962735e-05, | |
| "loss": 0.5058, | |
| "step": 13990 | |
| }, | |
| { | |
| "epoch": 3.4782608695652173, | |
| "grad_norm": 6.857468128204346, | |
| "learning_rate": 2.617391304347826e-05, | |
| "loss": 0.463, | |
| "step": 14000 | |
| }, | |
| { | |
| "epoch": 3.4782608695652173, | |
| "eval_accuracy": 0.830062483499076, | |
| "eval_loss": 0.655392050743103, | |
| "eval_runtime": 86.7827, | |
| "eval_samples_per_second": 130.936, | |
| "eval_steps_per_second": 16.374, | |
| "step": 14000 | |
| }, | |
| { | |
| "epoch": 3.480745341614907, | |
| "grad_norm": 6.986089706420898, | |
| "learning_rate": 2.604968944099379e-05, | |
| "loss": 0.5948, | |
| "step": 14010 | |
| }, | |
| { | |
| "epoch": 3.4832298136645963, | |
| "grad_norm": 7.034180641174316, | |
| "learning_rate": 2.5925465838509318e-05, | |
| "loss": 0.4492, | |
| "step": 14020 | |
| }, | |
| { | |
| "epoch": 3.4857142857142858, | |
| "grad_norm": 2.2844438552856445, | |
| "learning_rate": 2.5801242236024848e-05, | |
| "loss": 0.4341, | |
| "step": 14030 | |
| }, | |
| { | |
| "epoch": 3.4881987577639753, | |
| "grad_norm": 6.129580974578857, | |
| "learning_rate": 2.5677018633540374e-05, | |
| "loss": 0.4957, | |
| "step": 14040 | |
| }, | |
| { | |
| "epoch": 3.4906832298136647, | |
| "grad_norm": 4.148270130157471, | |
| "learning_rate": 2.5552795031055904e-05, | |
| "loss": 0.4501, | |
| "step": 14050 | |
| }, | |
| { | |
| "epoch": 3.493167701863354, | |
| "grad_norm": 8.753642082214355, | |
| "learning_rate": 2.542857142857143e-05, | |
| "loss": 0.7113, | |
| "step": 14060 | |
| }, | |
| { | |
| "epoch": 3.4956521739130437, | |
| "grad_norm": 7.5100321769714355, | |
| "learning_rate": 2.530434782608696e-05, | |
| "loss": 0.4538, | |
| "step": 14070 | |
| }, | |
| { | |
| "epoch": 3.4981366459627328, | |
| "grad_norm": 4.834388256072998, | |
| "learning_rate": 2.5180124223602487e-05, | |
| "loss": 0.429, | |
| "step": 14080 | |
| }, | |
| { | |
| "epoch": 3.5006211180124223, | |
| "grad_norm": 3.708731174468994, | |
| "learning_rate": 2.505590062111801e-05, | |
| "loss": 0.4318, | |
| "step": 14090 | |
| }, | |
| { | |
| "epoch": 3.5031055900621118, | |
| "grad_norm": 7.761505603790283, | |
| "learning_rate": 2.4931677018633543e-05, | |
| "loss": 0.3259, | |
| "step": 14100 | |
| }, | |
| { | |
| "epoch": 3.5031055900621118, | |
| "eval_accuracy": 0.8291824342163161, | |
| "eval_loss": 0.6640006899833679, | |
| "eval_runtime": 85.8522, | |
| "eval_samples_per_second": 132.355, | |
| "eval_steps_per_second": 16.552, | |
| "step": 14100 | |
| }, | |
| { | |
| "epoch": 3.5055900621118012, | |
| "grad_norm": 5.576478004455566, | |
| "learning_rate": 2.480745341614907e-05, | |
| "loss": 0.6021, | |
| "step": 14110 | |
| }, | |
| { | |
| "epoch": 3.5080745341614907, | |
| "grad_norm": 2.4706974029541016, | |
| "learning_rate": 2.4683229813664596e-05, | |
| "loss": 0.3856, | |
| "step": 14120 | |
| }, | |
| { | |
| "epoch": 3.51055900621118, | |
| "grad_norm": 1.1442434787750244, | |
| "learning_rate": 2.4559006211180123e-05, | |
| "loss": 0.6106, | |
| "step": 14130 | |
| }, | |
| { | |
| "epoch": 3.5130434782608697, | |
| "grad_norm": 3.042475700378418, | |
| "learning_rate": 2.4434782608695653e-05, | |
| "loss": 0.4711, | |
| "step": 14140 | |
| }, | |
| { | |
| "epoch": 3.5155279503105588, | |
| "grad_norm": 4.92565393447876, | |
| "learning_rate": 2.4310559006211183e-05, | |
| "loss": 0.6123, | |
| "step": 14150 | |
| }, | |
| { | |
| "epoch": 3.5180124223602487, | |
| "grad_norm": 8.960134506225586, | |
| "learning_rate": 2.418633540372671e-05, | |
| "loss": 0.642, | |
| "step": 14160 | |
| }, | |
| { | |
| "epoch": 3.5204968944099377, | |
| "grad_norm": 8.679351806640625, | |
| "learning_rate": 2.406211180124224e-05, | |
| "loss": 0.5592, | |
| "step": 14170 | |
| }, | |
| { | |
| "epoch": 3.5229813664596272, | |
| "grad_norm": 10.795132637023926, | |
| "learning_rate": 2.3937888198757766e-05, | |
| "loss": 0.6998, | |
| "step": 14180 | |
| }, | |
| { | |
| "epoch": 3.5254658385093167, | |
| "grad_norm": 3.723322629928589, | |
| "learning_rate": 2.3813664596273295e-05, | |
| "loss": 0.441, | |
| "step": 14190 | |
| }, | |
| { | |
| "epoch": 3.527950310559006, | |
| "grad_norm": 5.73036003112793, | |
| "learning_rate": 2.3689440993788822e-05, | |
| "loss": 0.7286, | |
| "step": 14200 | |
| }, | |
| { | |
| "epoch": 3.527950310559006, | |
| "eval_accuracy": 0.8307665229252839, | |
| "eval_loss": 0.6500012278556824, | |
| "eval_runtime": 86.0008, | |
| "eval_samples_per_second": 132.127, | |
| "eval_steps_per_second": 16.523, | |
| "step": 14200 | |
| }, | |
| { | |
| "epoch": 3.5304347826086957, | |
| "grad_norm": 6.265992164611816, | |
| "learning_rate": 2.356521739130435e-05, | |
| "loss": 0.3616, | |
| "step": 14210 | |
| }, | |
| { | |
| "epoch": 3.532919254658385, | |
| "grad_norm": 2.9732041358947754, | |
| "learning_rate": 2.3440993788819875e-05, | |
| "loss": 0.5564, | |
| "step": 14220 | |
| }, | |
| { | |
| "epoch": 3.5354037267080747, | |
| "grad_norm": 4.713552474975586, | |
| "learning_rate": 2.3316770186335405e-05, | |
| "loss": 0.5345, | |
| "step": 14230 | |
| }, | |
| { | |
| "epoch": 3.5378881987577637, | |
| "grad_norm": 3.708615779876709, | |
| "learning_rate": 2.319254658385093e-05, | |
| "loss": 0.383, | |
| "step": 14240 | |
| }, | |
| { | |
| "epoch": 3.5403726708074537, | |
| "grad_norm": 3.2620787620544434, | |
| "learning_rate": 2.306832298136646e-05, | |
| "loss": 0.4484, | |
| "step": 14250 | |
| }, | |
| { | |
| "epoch": 3.5428571428571427, | |
| "grad_norm": 4.0385823249816895, | |
| "learning_rate": 2.2944099378881988e-05, | |
| "loss": 0.4152, | |
| "step": 14260 | |
| }, | |
| { | |
| "epoch": 3.545341614906832, | |
| "grad_norm": 5.182163238525391, | |
| "learning_rate": 2.2819875776397518e-05, | |
| "loss": 0.5693, | |
| "step": 14270 | |
| }, | |
| { | |
| "epoch": 3.5478260869565217, | |
| "grad_norm": 4.178833961486816, | |
| "learning_rate": 2.2695652173913044e-05, | |
| "loss": 0.5311, | |
| "step": 14280 | |
| }, | |
| { | |
| "epoch": 3.550310559006211, | |
| "grad_norm": 8.150431632995605, | |
| "learning_rate": 2.257142857142857e-05, | |
| "loss": 0.5083, | |
| "step": 14290 | |
| }, | |
| { | |
| "epoch": 3.5527950310559007, | |
| "grad_norm": 6.455306053161621, | |
| "learning_rate": 2.24472049689441e-05, | |
| "loss": 0.4422, | |
| "step": 14300 | |
| }, | |
| { | |
| "epoch": 3.5527950310559007, | |
| "eval_accuracy": 0.8312945524949397, | |
| "eval_loss": 0.6539793014526367, | |
| "eval_runtime": 85.8492, | |
| "eval_samples_per_second": 132.36, | |
| "eval_steps_per_second": 16.552, | |
| "step": 14300 | |
| }, | |
| { | |
| "epoch": 3.55527950310559, | |
| "grad_norm": 5.034562110900879, | |
| "learning_rate": 2.2322981366459627e-05, | |
| "loss": 0.5845, | |
| "step": 14310 | |
| }, | |
| { | |
| "epoch": 3.5577639751552796, | |
| "grad_norm": 0.6601377129554749, | |
| "learning_rate": 2.2198757763975157e-05, | |
| "loss": 0.3904, | |
| "step": 14320 | |
| }, | |
| { | |
| "epoch": 3.5602484472049687, | |
| "grad_norm": 13.989871978759766, | |
| "learning_rate": 2.2074534161490684e-05, | |
| "loss": 0.5033, | |
| "step": 14330 | |
| }, | |
| { | |
| "epoch": 3.5627329192546586, | |
| "grad_norm": 2.3294808864593506, | |
| "learning_rate": 2.1950310559006213e-05, | |
| "loss": 0.436, | |
| "step": 14340 | |
| }, | |
| { | |
| "epoch": 3.5652173913043477, | |
| "grad_norm": 2.7858335971832275, | |
| "learning_rate": 2.182608695652174e-05, | |
| "loss": 0.5116, | |
| "step": 14350 | |
| }, | |
| { | |
| "epoch": 3.567701863354037, | |
| "grad_norm": 6.121773719787598, | |
| "learning_rate": 2.170186335403727e-05, | |
| "loss": 0.3615, | |
| "step": 14360 | |
| }, | |
| { | |
| "epoch": 3.5701863354037267, | |
| "grad_norm": 3.8832411766052246, | |
| "learning_rate": 2.1577639751552796e-05, | |
| "loss": 0.4784, | |
| "step": 14370 | |
| }, | |
| { | |
| "epoch": 3.572670807453416, | |
| "grad_norm": 6.1436591148376465, | |
| "learning_rate": 2.1453416149068323e-05, | |
| "loss": 0.387, | |
| "step": 14380 | |
| }, | |
| { | |
| "epoch": 3.5751552795031056, | |
| "grad_norm": 5.157639026641846, | |
| "learning_rate": 2.132919254658385e-05, | |
| "loss": 0.5088, | |
| "step": 14390 | |
| }, | |
| { | |
| "epoch": 3.577639751552795, | |
| "grad_norm": 3.7850217819213867, | |
| "learning_rate": 2.120496894409938e-05, | |
| "loss": 0.4374, | |
| "step": 14400 | |
| }, | |
| { | |
| "epoch": 3.577639751552795, | |
| "eval_accuracy": 0.8317345771363196, | |
| "eval_loss": 0.6497304439544678, | |
| "eval_runtime": 85.1252, | |
| "eval_samples_per_second": 133.486, | |
| "eval_steps_per_second": 16.693, | |
| "step": 14400 | |
| }, | |
| { | |
| "epoch": 3.5801242236024846, | |
| "grad_norm": 3.594571113586426, | |
| "learning_rate": 2.108074534161491e-05, | |
| "loss": 0.6101, | |
| "step": 14410 | |
| }, | |
| { | |
| "epoch": 3.5826086956521737, | |
| "grad_norm": 4.151157855987549, | |
| "learning_rate": 2.0956521739130436e-05, | |
| "loss": 0.5851, | |
| "step": 14420 | |
| }, | |
| { | |
| "epoch": 3.5850931677018636, | |
| "grad_norm": 9.117693901062012, | |
| "learning_rate": 2.0832298136645966e-05, | |
| "loss": 0.3478, | |
| "step": 14430 | |
| }, | |
| { | |
| "epoch": 3.5875776397515526, | |
| "grad_norm": 4.291843414306641, | |
| "learning_rate": 2.0708074534161492e-05, | |
| "loss": 0.3923, | |
| "step": 14440 | |
| }, | |
| { | |
| "epoch": 3.590062111801242, | |
| "grad_norm": 6.3122358322143555, | |
| "learning_rate": 2.0583850931677022e-05, | |
| "loss": 0.4025, | |
| "step": 14450 | |
| }, | |
| { | |
| "epoch": 3.5925465838509316, | |
| "grad_norm": 8.162814140319824, | |
| "learning_rate": 2.045962732919255e-05, | |
| "loss": 0.489, | |
| "step": 14460 | |
| }, | |
| { | |
| "epoch": 3.595031055900621, | |
| "grad_norm": 7.5478057861328125, | |
| "learning_rate": 2.0335403726708075e-05, | |
| "loss": 0.5294, | |
| "step": 14470 | |
| }, | |
| { | |
| "epoch": 3.5975155279503106, | |
| "grad_norm": 7.7503862380981445, | |
| "learning_rate": 2.02111801242236e-05, | |
| "loss": 0.7006, | |
| "step": 14480 | |
| }, | |
| { | |
| "epoch": 3.6, | |
| "grad_norm": 4.4560956954956055, | |
| "learning_rate": 2.008695652173913e-05, | |
| "loss": 0.4768, | |
| "step": 14490 | |
| }, | |
| { | |
| "epoch": 3.6024844720496896, | |
| "grad_norm": 12.04161548614502, | |
| "learning_rate": 1.9962732919254658e-05, | |
| "loss": 0.7962, | |
| "step": 14500 | |
| }, | |
| { | |
| "epoch": 3.6024844720496896, | |
| "eval_accuracy": 0.8340227052714952, | |
| "eval_loss": 0.6416128873825073, | |
| "eval_runtime": 85.9635, | |
| "eval_samples_per_second": 132.184, | |
| "eval_steps_per_second": 16.53, | |
| "step": 14500 | |
| }, | |
| { | |
| "epoch": 3.6049689440993786, | |
| "grad_norm": 4.408351898193359, | |
| "learning_rate": 1.9838509316770188e-05, | |
| "loss": 0.6468, | |
| "step": 14510 | |
| }, | |
| { | |
| "epoch": 3.6074534161490686, | |
| "grad_norm": 2.5475428104400635, | |
| "learning_rate": 1.9714285714285714e-05, | |
| "loss": 0.5066, | |
| "step": 14520 | |
| }, | |
| { | |
| "epoch": 3.6099378881987576, | |
| "grad_norm": 2.807896852493286, | |
| "learning_rate": 1.9590062111801244e-05, | |
| "loss": 0.5552, | |
| "step": 14530 | |
| }, | |
| { | |
| "epoch": 3.612422360248447, | |
| "grad_norm": 9.001070976257324, | |
| "learning_rate": 1.946583850931677e-05, | |
| "loss": 0.5289, | |
| "step": 14540 | |
| }, | |
| { | |
| "epoch": 3.6149068322981366, | |
| "grad_norm": 3.7283670902252197, | |
| "learning_rate": 1.9341614906832297e-05, | |
| "loss": 0.3566, | |
| "step": 14550 | |
| }, | |
| { | |
| "epoch": 3.617391304347826, | |
| "grad_norm": 3.9144983291625977, | |
| "learning_rate": 1.9217391304347827e-05, | |
| "loss": 0.5467, | |
| "step": 14560 | |
| }, | |
| { | |
| "epoch": 3.6198757763975156, | |
| "grad_norm": 3.974045515060425, | |
| "learning_rate": 1.9093167701863354e-05, | |
| "loss": 0.4297, | |
| "step": 14570 | |
| }, | |
| { | |
| "epoch": 3.622360248447205, | |
| "grad_norm": 3.520359516143799, | |
| "learning_rate": 1.8968944099378884e-05, | |
| "loss": 0.4779, | |
| "step": 14580 | |
| }, | |
| { | |
| "epoch": 3.6248447204968945, | |
| "grad_norm": 5.024179935455322, | |
| "learning_rate": 1.884472049689441e-05, | |
| "loss": 0.4766, | |
| "step": 14590 | |
| }, | |
| { | |
| "epoch": 3.6273291925465836, | |
| "grad_norm": 5.152400493621826, | |
| "learning_rate": 1.872049689440994e-05, | |
| "loss": 0.6297, | |
| "step": 14600 | |
| }, | |
| { | |
| "epoch": 3.6273291925465836, | |
| "eval_accuracy": 0.8339347003432193, | |
| "eval_loss": 0.6392886638641357, | |
| "eval_runtime": 85.5369, | |
| "eval_samples_per_second": 132.843, | |
| "eval_steps_per_second": 16.613, | |
| "step": 14600 | |
| }, | |
| { | |
| "epoch": 3.6298136645962735, | |
| "grad_norm": 0.8217100501060486, | |
| "learning_rate": 1.8596273291925466e-05, | |
| "loss": 0.5714, | |
| "step": 14610 | |
| }, | |
| { | |
| "epoch": 3.6322981366459626, | |
| "grad_norm": 6.355893611907959, | |
| "learning_rate": 1.8472049689440996e-05, | |
| "loss": 0.4674, | |
| "step": 14620 | |
| }, | |
| { | |
| "epoch": 3.634782608695652, | |
| "grad_norm": 5.964326858520508, | |
| "learning_rate": 1.8347826086956523e-05, | |
| "loss": 0.6098, | |
| "step": 14630 | |
| }, | |
| { | |
| "epoch": 3.6372670807453416, | |
| "grad_norm": 2.0514612197875977, | |
| "learning_rate": 1.822360248447205e-05, | |
| "loss": 0.5456, | |
| "step": 14640 | |
| }, | |
| { | |
| "epoch": 3.639751552795031, | |
| "grad_norm": 3.857182025909424, | |
| "learning_rate": 1.809937888198758e-05, | |
| "loss": 0.5245, | |
| "step": 14650 | |
| }, | |
| { | |
| "epoch": 3.6422360248447205, | |
| "grad_norm": 6.316091537475586, | |
| "learning_rate": 1.7975155279503106e-05, | |
| "loss": 0.6184, | |
| "step": 14660 | |
| }, | |
| { | |
| "epoch": 3.64472049689441, | |
| "grad_norm": 11.116755485534668, | |
| "learning_rate": 1.7850931677018636e-05, | |
| "loss": 0.4855, | |
| "step": 14670 | |
| }, | |
| { | |
| "epoch": 3.6472049689440995, | |
| "grad_norm": 0.28117311000823975, | |
| "learning_rate": 1.7726708074534162e-05, | |
| "loss": 0.4544, | |
| "step": 14680 | |
| }, | |
| { | |
| "epoch": 3.6496894409937886, | |
| "grad_norm": 7.566733360290527, | |
| "learning_rate": 1.7602484472049692e-05, | |
| "loss": 0.2681, | |
| "step": 14690 | |
| }, | |
| { | |
| "epoch": 3.6521739130434785, | |
| "grad_norm": 2.6107754707336426, | |
| "learning_rate": 1.747826086956522e-05, | |
| "loss": 0.4933, | |
| "step": 14700 | |
| }, | |
| { | |
| "epoch": 3.6521739130434785, | |
| "eval_accuracy": 0.8335826806301153, | |
| "eval_loss": 0.6379285454750061, | |
| "eval_runtime": 86.7538, | |
| "eval_samples_per_second": 130.98, | |
| "eval_steps_per_second": 16.38, | |
| "step": 14700 | |
| }, | |
| { | |
| "epoch": 3.6546583850931675, | |
| "grad_norm": 2.6673498153686523, | |
| "learning_rate": 1.735403726708075e-05, | |
| "loss": 0.4378, | |
| "step": 14710 | |
| }, | |
| { | |
| "epoch": 3.657142857142857, | |
| "grad_norm": 2.3931283950805664, | |
| "learning_rate": 1.7229813664596275e-05, | |
| "loss": 0.3868, | |
| "step": 14720 | |
| }, | |
| { | |
| "epoch": 3.6596273291925465, | |
| "grad_norm": 4.458917617797852, | |
| "learning_rate": 1.71055900621118e-05, | |
| "loss": 0.4633, | |
| "step": 14730 | |
| }, | |
| { | |
| "epoch": 3.662111801242236, | |
| "grad_norm": 5.459697246551514, | |
| "learning_rate": 1.6981366459627328e-05, | |
| "loss": 0.5051, | |
| "step": 14740 | |
| }, | |
| { | |
| "epoch": 3.6645962732919255, | |
| "grad_norm": 3.741152763366699, | |
| "learning_rate": 1.6857142857142858e-05, | |
| "loss": 0.5956, | |
| "step": 14750 | |
| }, | |
| { | |
| "epoch": 3.667080745341615, | |
| "grad_norm": 13.998597145080566, | |
| "learning_rate": 1.6732919254658384e-05, | |
| "loss": 0.4515, | |
| "step": 14760 | |
| }, | |
| { | |
| "epoch": 3.6695652173913045, | |
| "grad_norm": 4.710552215576172, | |
| "learning_rate": 1.6608695652173914e-05, | |
| "loss": 0.5572, | |
| "step": 14770 | |
| }, | |
| { | |
| "epoch": 3.6720496894409935, | |
| "grad_norm": 8.206193923950195, | |
| "learning_rate": 1.648447204968944e-05, | |
| "loss": 0.4481, | |
| "step": 14780 | |
| }, | |
| { | |
| "epoch": 3.6745341614906835, | |
| "grad_norm": 6.1793012619018555, | |
| "learning_rate": 1.636024844720497e-05, | |
| "loss": 0.4568, | |
| "step": 14790 | |
| }, | |
| { | |
| "epoch": 3.6770186335403725, | |
| "grad_norm": 8.518237113952637, | |
| "learning_rate": 1.6236024844720497e-05, | |
| "loss": 0.5548, | |
| "step": 14800 | |
| }, | |
| { | |
| "epoch": 3.6770186335403725, | |
| "eval_accuracy": 0.8356067939804629, | |
| "eval_loss": 0.6300323009490967, | |
| "eval_runtime": 86.6878, | |
| "eval_samples_per_second": 131.08, | |
| "eval_steps_per_second": 16.392, | |
| "step": 14800 | |
| }, | |
| { | |
| "epoch": 3.679503105590062, | |
| "grad_norm": 8.760847091674805, | |
| "learning_rate": 1.6111801242236024e-05, | |
| "loss": 0.6173, | |
| "step": 14810 | |
| }, | |
| { | |
| "epoch": 3.6819875776397515, | |
| "grad_norm": 4.6929802894592285, | |
| "learning_rate": 1.5987577639751554e-05, | |
| "loss": 0.5821, | |
| "step": 14820 | |
| }, | |
| { | |
| "epoch": 3.684472049689441, | |
| "grad_norm": 7.2983927726745605, | |
| "learning_rate": 1.586335403726708e-05, | |
| "loss": 0.5957, | |
| "step": 14830 | |
| }, | |
| { | |
| "epoch": 3.6869565217391305, | |
| "grad_norm": 8.686875343322754, | |
| "learning_rate": 1.573913043478261e-05, | |
| "loss": 0.4733, | |
| "step": 14840 | |
| }, | |
| { | |
| "epoch": 3.68944099378882, | |
| "grad_norm": 3.881749153137207, | |
| "learning_rate": 1.5614906832298137e-05, | |
| "loss": 0.3509, | |
| "step": 14850 | |
| }, | |
| { | |
| "epoch": 3.6919254658385094, | |
| "grad_norm": 5.879938125610352, | |
| "learning_rate": 1.5490683229813666e-05, | |
| "loss": 0.4898, | |
| "step": 14860 | |
| }, | |
| { | |
| "epoch": 3.6944099378881985, | |
| "grad_norm": 2.1531667709350586, | |
| "learning_rate": 1.5366459627329193e-05, | |
| "loss": 0.5043, | |
| "step": 14870 | |
| }, | |
| { | |
| "epoch": 3.6968944099378884, | |
| "grad_norm": 4.413904190063477, | |
| "learning_rate": 1.5254658385093168e-05, | |
| "loss": 0.5069, | |
| "step": 14880 | |
| }, | |
| { | |
| "epoch": 3.6993788819875775, | |
| "grad_norm": 5.015860557556152, | |
| "learning_rate": 1.5130434782608697e-05, | |
| "loss": 0.6092, | |
| "step": 14890 | |
| }, | |
| { | |
| "epoch": 3.701863354037267, | |
| "grad_norm": 7.194756984710693, | |
| "learning_rate": 1.5006211180124225e-05, | |
| "loss": 0.564, | |
| "step": 14900 | |
| }, | |
| { | |
| "epoch": 3.701863354037267, | |
| "eval_accuracy": 0.835166769339083, | |
| "eval_loss": 0.6283601522445679, | |
| "eval_runtime": 85.4479, | |
| "eval_samples_per_second": 132.982, | |
| "eval_steps_per_second": 16.63, | |
| "step": 14900 | |
| }, | |
| { | |
| "epoch": 3.7043478260869565, | |
| "grad_norm": 1.7463475465774536, | |
| "learning_rate": 1.4881987577639753e-05, | |
| "loss": 0.5327, | |
| "step": 14910 | |
| }, | |
| { | |
| "epoch": 3.706832298136646, | |
| "grad_norm": 2.530923366546631, | |
| "learning_rate": 1.4757763975155281e-05, | |
| "loss": 0.3879, | |
| "step": 14920 | |
| }, | |
| { | |
| "epoch": 3.7093167701863354, | |
| "grad_norm": 5.713317394256592, | |
| "learning_rate": 1.463354037267081e-05, | |
| "loss": 0.637, | |
| "step": 14930 | |
| }, | |
| { | |
| "epoch": 3.711801242236025, | |
| "grad_norm": 5.655239582061768, | |
| "learning_rate": 1.4509316770186334e-05, | |
| "loss": 0.2572, | |
| "step": 14940 | |
| }, | |
| { | |
| "epoch": 3.7142857142857144, | |
| "grad_norm": 3.9437196254730225, | |
| "learning_rate": 1.4385093167701863e-05, | |
| "loss": 0.4977, | |
| "step": 14950 | |
| }, | |
| { | |
| "epoch": 3.7167701863354035, | |
| "grad_norm": 4.147866249084473, | |
| "learning_rate": 1.426086956521739e-05, | |
| "loss": 0.5557, | |
| "step": 14960 | |
| }, | |
| { | |
| "epoch": 3.7192546583850934, | |
| "grad_norm": 9.1124906539917, | |
| "learning_rate": 1.4136645962732919e-05, | |
| "loss": 0.5664, | |
| "step": 14970 | |
| }, | |
| { | |
| "epoch": 3.7217391304347824, | |
| "grad_norm": 6.563503265380859, | |
| "learning_rate": 1.4012422360248447e-05, | |
| "loss": 0.5156, | |
| "step": 14980 | |
| }, | |
| { | |
| "epoch": 3.724223602484472, | |
| "grad_norm": 2.749929666519165, | |
| "learning_rate": 1.3888198757763975e-05, | |
| "loss": 0.3662, | |
| "step": 14990 | |
| }, | |
| { | |
| "epoch": 3.7267080745341614, | |
| "grad_norm": 5.506071090698242, | |
| "learning_rate": 1.3763975155279504e-05, | |
| "loss": 0.2638, | |
| "step": 15000 | |
| }, | |
| { | |
| "epoch": 3.7267080745341614, | |
| "eval_accuracy": 0.8337586904866673, | |
| "eval_loss": 0.6299127340316772, | |
| "eval_runtime": 85.7269, | |
| "eval_samples_per_second": 132.549, | |
| "eval_steps_per_second": 16.576, | |
| "step": 15000 | |
| }, | |
| { | |
| "epoch": 3.729192546583851, | |
| "grad_norm": 4.335992336273193, | |
| "learning_rate": 1.3639751552795032e-05, | |
| "loss": 0.4352, | |
| "step": 15010 | |
| }, | |
| { | |
| "epoch": 3.7316770186335404, | |
| "grad_norm": 5.460691928863525, | |
| "learning_rate": 1.3515527950310562e-05, | |
| "loss": 0.4618, | |
| "step": 15020 | |
| }, | |
| { | |
| "epoch": 3.73416149068323, | |
| "grad_norm": 9.748331069946289, | |
| "learning_rate": 1.3391304347826086e-05, | |
| "loss": 0.5894, | |
| "step": 15030 | |
| }, | |
| { | |
| "epoch": 3.7366459627329194, | |
| "grad_norm": 6.729307651519775, | |
| "learning_rate": 1.3267080745341615e-05, | |
| "loss": 0.5808, | |
| "step": 15040 | |
| }, | |
| { | |
| "epoch": 3.7391304347826084, | |
| "grad_norm": 4.958307266235352, | |
| "learning_rate": 1.3142857142857143e-05, | |
| "loss": 0.4049, | |
| "step": 15050 | |
| }, | |
| { | |
| "epoch": 3.7416149068322984, | |
| "grad_norm": 4.747241497039795, | |
| "learning_rate": 1.3018633540372671e-05, | |
| "loss": 0.3638, | |
| "step": 15060 | |
| }, | |
| { | |
| "epoch": 3.7440993788819874, | |
| "grad_norm": 4.579631328582764, | |
| "learning_rate": 1.28944099378882e-05, | |
| "loss": 0.6736, | |
| "step": 15070 | |
| }, | |
| { | |
| "epoch": 3.746583850931677, | |
| "grad_norm": 4.091526985168457, | |
| "learning_rate": 1.2770186335403727e-05, | |
| "loss": 0.4804, | |
| "step": 15080 | |
| }, | |
| { | |
| "epoch": 3.7490683229813664, | |
| "grad_norm": 5.306528568267822, | |
| "learning_rate": 1.2645962732919256e-05, | |
| "loss": 0.3247, | |
| "step": 15090 | |
| }, | |
| { | |
| "epoch": 3.751552795031056, | |
| "grad_norm": 4.789366722106934, | |
| "learning_rate": 1.2521739130434784e-05, | |
| "loss": 0.6129, | |
| "step": 15100 | |
| }, | |
| { | |
| "epoch": 3.751552795031056, | |
| "eval_accuracy": 0.8373668925459826, | |
| "eval_loss": 0.6253156661987305, | |
| "eval_runtime": 85.345, | |
| "eval_samples_per_second": 133.142, | |
| "eval_steps_per_second": 16.65, | |
| "step": 15100 | |
| }, | |
| { | |
| "epoch": 3.7540372670807454, | |
| "grad_norm": 4.639571189880371, | |
| "learning_rate": 1.239751552795031e-05, | |
| "loss": 0.5289, | |
| "step": 15110 | |
| }, | |
| { | |
| "epoch": 3.756521739130435, | |
| "grad_norm": 5.007940292358398, | |
| "learning_rate": 1.2273291925465839e-05, | |
| "loss": 0.4025, | |
| "step": 15120 | |
| }, | |
| { | |
| "epoch": 3.7590062111801243, | |
| "grad_norm": 9.492412567138672, | |
| "learning_rate": 1.2149068322981367e-05, | |
| "loss": 0.465, | |
| "step": 15130 | |
| }, | |
| { | |
| "epoch": 3.7614906832298134, | |
| "grad_norm": 5.330755710601807, | |
| "learning_rate": 1.2024844720496895e-05, | |
| "loss": 0.4507, | |
| "step": 15140 | |
| }, | |
| { | |
| "epoch": 3.7639751552795033, | |
| "grad_norm": 6.425350666046143, | |
| "learning_rate": 1.1900621118012423e-05, | |
| "loss": 0.4656, | |
| "step": 15150 | |
| }, | |
| { | |
| "epoch": 3.7664596273291924, | |
| "grad_norm": 5.325112819671631, | |
| "learning_rate": 1.1776397515527951e-05, | |
| "loss": 0.4524, | |
| "step": 15160 | |
| }, | |
| { | |
| "epoch": 3.768944099378882, | |
| "grad_norm": 5.342360973358154, | |
| "learning_rate": 1.165217391304348e-05, | |
| "loss": 0.4891, | |
| "step": 15170 | |
| }, | |
| { | |
| "epoch": 3.7714285714285714, | |
| "grad_norm": 4.091293811798096, | |
| "learning_rate": 1.1527950310559006e-05, | |
| "loss": 0.5008, | |
| "step": 15180 | |
| }, | |
| { | |
| "epoch": 3.773913043478261, | |
| "grad_norm": 7.995913505554199, | |
| "learning_rate": 1.1403726708074534e-05, | |
| "loss": 0.7318, | |
| "step": 15190 | |
| }, | |
| { | |
| "epoch": 3.7763975155279503, | |
| "grad_norm": 5.437656402587891, | |
| "learning_rate": 1.1279503105590063e-05, | |
| "loss": 0.51, | |
| "step": 15200 | |
| }, | |
| { | |
| "epoch": 3.7763975155279503, | |
| "eval_accuracy": 0.8389509812549503, | |
| "eval_loss": 0.6205056309700012, | |
| "eval_runtime": 85.0149, | |
| "eval_samples_per_second": 133.659, | |
| "eval_steps_per_second": 16.715, | |
| "step": 15200 | |
| }, | |
| { | |
| "epoch": 3.77888198757764, | |
| "grad_norm": 3.89784574508667, | |
| "learning_rate": 1.115527950310559e-05, | |
| "loss": 0.3896, | |
| "step": 15210 | |
| }, | |
| { | |
| "epoch": 3.7813664596273293, | |
| "grad_norm": 2.4498801231384277, | |
| "learning_rate": 1.1031055900621119e-05, | |
| "loss": 0.4979, | |
| "step": 15220 | |
| }, | |
| { | |
| "epoch": 3.7838509316770184, | |
| "grad_norm": 8.071438789367676, | |
| "learning_rate": 1.0906832298136645e-05, | |
| "loss": 0.5893, | |
| "step": 15230 | |
| }, | |
| { | |
| "epoch": 3.7863354037267083, | |
| "grad_norm": 7.249101161956787, | |
| "learning_rate": 1.0782608695652174e-05, | |
| "loss": 0.5271, | |
| "step": 15240 | |
| }, | |
| { | |
| "epoch": 3.7888198757763973, | |
| "grad_norm": 9.257108688354492, | |
| "learning_rate": 1.0658385093167702e-05, | |
| "loss": 0.6586, | |
| "step": 15250 | |
| }, | |
| { | |
| "epoch": 3.791304347826087, | |
| "grad_norm": 6.51657247543335, | |
| "learning_rate": 1.053416149068323e-05, | |
| "loss": 0.4949, | |
| "step": 15260 | |
| }, | |
| { | |
| "epoch": 3.7937888198757763, | |
| "grad_norm": 8.859468460083008, | |
| "learning_rate": 1.0409937888198758e-05, | |
| "loss": 0.6531, | |
| "step": 15270 | |
| }, | |
| { | |
| "epoch": 3.796273291925466, | |
| "grad_norm": 9.06107234954834, | |
| "learning_rate": 1.0285714285714286e-05, | |
| "loss": 0.4214, | |
| "step": 15280 | |
| }, | |
| { | |
| "epoch": 3.7987577639751553, | |
| "grad_norm": 2.4932773113250732, | |
| "learning_rate": 1.0161490683229815e-05, | |
| "loss": 0.5662, | |
| "step": 15290 | |
| }, | |
| { | |
| "epoch": 3.801242236024845, | |
| "grad_norm": 4.2591872215271, | |
| "learning_rate": 1.0037267080745343e-05, | |
| "loss": 0.4612, | |
| "step": 15300 | |
| }, | |
| { | |
| "epoch": 3.801242236024845, | |
| "eval_accuracy": 0.8389509812549503, | |
| "eval_loss": 0.6165159344673157, | |
| "eval_runtime": 86.3041, | |
| "eval_samples_per_second": 131.662, | |
| "eval_steps_per_second": 16.465, | |
| "step": 15300 | |
| }, | |
| { | |
| "epoch": 3.8037267080745343, | |
| "grad_norm": 3.7499098777770996, | |
| "learning_rate": 9.91304347826087e-06, | |
| "loss": 0.5474, | |
| "step": 15310 | |
| }, | |
| { | |
| "epoch": 3.8062111801242233, | |
| "grad_norm": 7.90886926651001, | |
| "learning_rate": 9.788819875776398e-06, | |
| "loss": 0.3745, | |
| "step": 15320 | |
| }, | |
| { | |
| "epoch": 3.8086956521739133, | |
| "grad_norm": 8.579766273498535, | |
| "learning_rate": 9.664596273291926e-06, | |
| "loss": 0.5731, | |
| "step": 15330 | |
| }, | |
| { | |
| "epoch": 3.8111801242236023, | |
| "grad_norm": 5.433511734008789, | |
| "learning_rate": 9.540372670807454e-06, | |
| "loss": 0.4555, | |
| "step": 15340 | |
| }, | |
| { | |
| "epoch": 3.813664596273292, | |
| "grad_norm": 6.867114543914795, | |
| "learning_rate": 9.416149068322982e-06, | |
| "loss": 0.6483, | |
| "step": 15350 | |
| }, | |
| { | |
| "epoch": 3.8161490683229813, | |
| "grad_norm": 4.577269554138184, | |
| "learning_rate": 9.291925465838509e-06, | |
| "loss": 0.4513, | |
| "step": 15360 | |
| }, | |
| { | |
| "epoch": 3.8186335403726708, | |
| "grad_norm": 3.5247273445129395, | |
| "learning_rate": 9.167701863354037e-06, | |
| "loss": 0.5172, | |
| "step": 15370 | |
| }, | |
| { | |
| "epoch": 3.8211180124223603, | |
| "grad_norm": 4.862856864929199, | |
| "learning_rate": 9.043478260869565e-06, | |
| "loss": 0.4777, | |
| "step": 15380 | |
| }, | |
| { | |
| "epoch": 3.8236024844720498, | |
| "grad_norm": 6.265756130218506, | |
| "learning_rate": 8.919254658385095e-06, | |
| "loss": 0.5164, | |
| "step": 15390 | |
| }, | |
| { | |
| "epoch": 3.8260869565217392, | |
| "grad_norm": 6.9130754470825195, | |
| "learning_rate": 8.795031055900622e-06, | |
| "loss": 0.5304, | |
| "step": 15400 | |
| }, | |
| { | |
| "epoch": 3.8260869565217392, | |
| "eval_accuracy": 0.8411511044618498, | |
| "eval_loss": 0.6112430095672607, | |
| "eval_runtime": 85.0608, | |
| "eval_samples_per_second": 133.587, | |
| "eval_steps_per_second": 16.706, | |
| "step": 15400 | |
| }, | |
| { | |
| "epoch": 3.8285714285714287, | |
| "grad_norm": 5.0783233642578125, | |
| "learning_rate": 8.67080745341615e-06, | |
| "loss": 0.5357, | |
| "step": 15410 | |
| }, | |
| { | |
| "epoch": 3.8310559006211182, | |
| "grad_norm": 7.3688154220581055, | |
| "learning_rate": 8.546583850931678e-06, | |
| "loss": 0.668, | |
| "step": 15420 | |
| }, | |
| { | |
| "epoch": 3.8335403726708073, | |
| "grad_norm": 6.1275153160095215, | |
| "learning_rate": 8.422360248447206e-06, | |
| "loss": 0.3594, | |
| "step": 15430 | |
| }, | |
| { | |
| "epoch": 3.8360248447204968, | |
| "grad_norm": 4.6164751052856445, | |
| "learning_rate": 8.298136645962733e-06, | |
| "loss": 0.3549, | |
| "step": 15440 | |
| }, | |
| { | |
| "epoch": 3.8385093167701863, | |
| "grad_norm": 1.4796391725540161, | |
| "learning_rate": 8.17391304347826e-06, | |
| "loss": 0.3755, | |
| "step": 15450 | |
| }, | |
| { | |
| "epoch": 3.8409937888198757, | |
| "grad_norm": 8.532491683959961, | |
| "learning_rate": 8.049689440993789e-06, | |
| "loss": 0.4853, | |
| "step": 15460 | |
| }, | |
| { | |
| "epoch": 3.8434782608695652, | |
| "grad_norm": 7.3214616775512695, | |
| "learning_rate": 7.925465838509317e-06, | |
| "loss": 0.3734, | |
| "step": 15470 | |
| }, | |
| { | |
| "epoch": 3.8459627329192547, | |
| "grad_norm": 9.121134757995605, | |
| "learning_rate": 7.801242236024845e-06, | |
| "loss": 0.3841, | |
| "step": 15480 | |
| }, | |
| { | |
| "epoch": 3.848447204968944, | |
| "grad_norm": 7.52311372756958, | |
| "learning_rate": 7.677018633540372e-06, | |
| "loss": 0.3626, | |
| "step": 15490 | |
| }, | |
| { | |
| "epoch": 3.8509316770186337, | |
| "grad_norm": 7.9005022048950195, | |
| "learning_rate": 7.552795031055901e-06, | |
| "loss": 0.4738, | |
| "step": 15500 | |
| }, | |
| { | |
| "epoch": 3.8509316770186337, | |
| "eval_accuracy": 0.8387749713983983, | |
| "eval_loss": 0.6148629784584045, | |
| "eval_runtime": 85.04, | |
| "eval_samples_per_second": 133.619, | |
| "eval_steps_per_second": 16.71, | |
| "step": 15500 | |
| }, | |
| { | |
| "epoch": 3.853416149068323, | |
| "grad_norm": 0.9077171683311462, | |
| "learning_rate": 7.428571428571429e-06, | |
| "loss": 0.5216, | |
| "step": 15510 | |
| }, | |
| { | |
| "epoch": 3.8559006211180122, | |
| "grad_norm": 6.145358085632324, | |
| "learning_rate": 7.304347826086957e-06, | |
| "loss": 0.4544, | |
| "step": 15520 | |
| }, | |
| { | |
| "epoch": 3.8583850931677017, | |
| "grad_norm": 4.223785877227783, | |
| "learning_rate": 7.180124223602484e-06, | |
| "loss": 0.7364, | |
| "step": 15530 | |
| }, | |
| { | |
| "epoch": 3.860869565217391, | |
| "grad_norm": 3.089573383331299, | |
| "learning_rate": 7.055900621118013e-06, | |
| "loss": 0.4429, | |
| "step": 15540 | |
| }, | |
| { | |
| "epoch": 3.8633540372670807, | |
| "grad_norm": 4.086426258087158, | |
| "learning_rate": 6.931677018633541e-06, | |
| "loss": 0.2988, | |
| "step": 15550 | |
| }, | |
| { | |
| "epoch": 3.86583850931677, | |
| "grad_norm": 9.179378509521484, | |
| "learning_rate": 6.807453416149069e-06, | |
| "loss": 0.4351, | |
| "step": 15560 | |
| }, | |
| { | |
| "epoch": 3.8683229813664597, | |
| "grad_norm": 2.9945521354675293, | |
| "learning_rate": 6.683229813664596e-06, | |
| "loss": 0.4504, | |
| "step": 15570 | |
| }, | |
| { | |
| "epoch": 3.870807453416149, | |
| "grad_norm": 3.0713376998901367, | |
| "learning_rate": 6.559006211180124e-06, | |
| "loss": 0.5011, | |
| "step": 15580 | |
| }, | |
| { | |
| "epoch": 3.8732919254658387, | |
| "grad_norm": 5.534846305847168, | |
| "learning_rate": 6.434782608695652e-06, | |
| "loss": 0.6831, | |
| "step": 15590 | |
| }, | |
| { | |
| "epoch": 3.875776397515528, | |
| "grad_norm": 5.85855770111084, | |
| "learning_rate": 6.3105590062111805e-06, | |
| "loss": 0.3845, | |
| "step": 15600 | |
| }, | |
| { | |
| "epoch": 3.875776397515528, | |
| "eval_accuracy": 0.8391269911115022, | |
| "eval_loss": 0.6140738725662231, | |
| "eval_runtime": 84.996, | |
| "eval_samples_per_second": 133.689, | |
| "eval_steps_per_second": 16.718, | |
| "step": 15600 | |
| }, | |
| { | |
| "epoch": 3.878260869565217, | |
| "grad_norm": 8.211888313293457, | |
| "learning_rate": 6.186335403726709e-06, | |
| "loss": 0.552, | |
| "step": 15610 | |
| }, | |
| { | |
| "epoch": 3.8807453416149067, | |
| "grad_norm": 3.7541515827178955, | |
| "learning_rate": 6.062111801242237e-06, | |
| "loss": 0.3499, | |
| "step": 15620 | |
| }, | |
| { | |
| "epoch": 3.883229813664596, | |
| "grad_norm": 2.6869845390319824, | |
| "learning_rate": 5.937888198757764e-06, | |
| "loss": 0.4644, | |
| "step": 15630 | |
| }, | |
| { | |
| "epoch": 3.8857142857142857, | |
| "grad_norm": 4.1416707038879395, | |
| "learning_rate": 5.8136645962732925e-06, | |
| "loss": 0.4497, | |
| "step": 15640 | |
| }, | |
| { | |
| "epoch": 3.888198757763975, | |
| "grad_norm": 3.2766640186309814, | |
| "learning_rate": 5.68944099378882e-06, | |
| "loss": 0.381, | |
| "step": 15650 | |
| }, | |
| { | |
| "epoch": 3.8906832298136647, | |
| "grad_norm": 9.587335586547852, | |
| "learning_rate": 5.565217391304348e-06, | |
| "loss": 0.5367, | |
| "step": 15660 | |
| }, | |
| { | |
| "epoch": 3.893167701863354, | |
| "grad_norm": 8.829601287841797, | |
| "learning_rate": 5.440993788819876e-06, | |
| "loss": 0.5684, | |
| "step": 15670 | |
| }, | |
| { | |
| "epoch": 3.8956521739130436, | |
| "grad_norm": 6.785938739776611, | |
| "learning_rate": 5.316770186335404e-06, | |
| "loss": 0.2842, | |
| "step": 15680 | |
| }, | |
| { | |
| "epoch": 3.898136645962733, | |
| "grad_norm": 3.8636465072631836, | |
| "learning_rate": 5.192546583850932e-06, | |
| "loss": 0.46, | |
| "step": 15690 | |
| }, | |
| { | |
| "epoch": 3.900621118012422, | |
| "grad_norm": 7.689055442810059, | |
| "learning_rate": 5.06832298136646e-06, | |
| "loss": 0.4533, | |
| "step": 15700 | |
| }, | |
| { | |
| "epoch": 3.900621118012422, | |
| "eval_accuracy": 0.8399190354659861, | |
| "eval_loss": 0.6139475703239441, | |
| "eval_runtime": 85.0525, | |
| "eval_samples_per_second": 133.6, | |
| "eval_steps_per_second": 16.707, | |
| "step": 15700 | |
| }, | |
| { | |
| "epoch": 3.9031055900621117, | |
| "grad_norm": 8.012325286865234, | |
| "learning_rate": 4.944099378881987e-06, | |
| "loss": 0.5585, | |
| "step": 15710 | |
| }, | |
| { | |
| "epoch": 3.905590062111801, | |
| "grad_norm": 1.3264799118041992, | |
| "learning_rate": 4.8198757763975155e-06, | |
| "loss": 0.4654, | |
| "step": 15720 | |
| }, | |
| { | |
| "epoch": 3.9080745341614906, | |
| "grad_norm": 3.987639904022217, | |
| "learning_rate": 4.695652173913044e-06, | |
| "loss": 0.4867, | |
| "step": 15730 | |
| }, | |
| { | |
| "epoch": 3.91055900621118, | |
| "grad_norm": 6.421884536743164, | |
| "learning_rate": 4.571428571428572e-06, | |
| "loss": 0.5595, | |
| "step": 15740 | |
| }, | |
| { | |
| "epoch": 3.9130434782608696, | |
| "grad_norm": 8.964715003967285, | |
| "learning_rate": 4.4472049689441e-06, | |
| "loss": 0.5024, | |
| "step": 15750 | |
| }, | |
| { | |
| "epoch": 3.915527950310559, | |
| "grad_norm": 7.1650004386901855, | |
| "learning_rate": 4.3229813664596275e-06, | |
| "loss": 0.4552, | |
| "step": 15760 | |
| }, | |
| { | |
| "epoch": 3.9180124223602486, | |
| "grad_norm": 3.3710427284240723, | |
| "learning_rate": 4.198757763975156e-06, | |
| "loss": 0.4063, | |
| "step": 15770 | |
| }, | |
| { | |
| "epoch": 3.920496894409938, | |
| "grad_norm": 7.025265693664551, | |
| "learning_rate": 4.074534161490683e-06, | |
| "loss": 0.6082, | |
| "step": 15780 | |
| }, | |
| { | |
| "epoch": 3.922981366459627, | |
| "grad_norm": 6.672760963439941, | |
| "learning_rate": 3.950310559006211e-06, | |
| "loss": 0.4398, | |
| "step": 15790 | |
| }, | |
| { | |
| "epoch": 3.9254658385093166, | |
| "grad_norm": 9.175477027893066, | |
| "learning_rate": 3.8260869565217395e-06, | |
| "loss": 0.3539, | |
| "step": 15800 | |
| }, | |
| { | |
| "epoch": 3.9254658385093166, | |
| "eval_accuracy": 0.8401830502508141, | |
| "eval_loss": 0.6130595803260803, | |
| "eval_runtime": 85.2127, | |
| "eval_samples_per_second": 133.349, | |
| "eval_steps_per_second": 16.676, | |
| "step": 15800 | |
| }, | |
| { | |
| "epoch": 3.927950310559006, | |
| "grad_norm": 2.647934675216675, | |
| "learning_rate": 3.7018633540372673e-06, | |
| "loss": 0.2573, | |
| "step": 15810 | |
| }, | |
| { | |
| "epoch": 3.9304347826086956, | |
| "grad_norm": 17.082826614379883, | |
| "learning_rate": 3.577639751552795e-06, | |
| "loss": 0.5785, | |
| "step": 15820 | |
| }, | |
| { | |
| "epoch": 3.932919254658385, | |
| "grad_norm": 6.866117000579834, | |
| "learning_rate": 3.4534161490683232e-06, | |
| "loss": 0.637, | |
| "step": 15830 | |
| }, | |
| { | |
| "epoch": 3.9354037267080746, | |
| "grad_norm": 8.402270317077637, | |
| "learning_rate": 3.329192546583851e-06, | |
| "loss": 0.6079, | |
| "step": 15840 | |
| }, | |
| { | |
| "epoch": 3.937888198757764, | |
| "grad_norm": 4.975553512573242, | |
| "learning_rate": 3.2049689440993792e-06, | |
| "loss": 0.659, | |
| "step": 15850 | |
| }, | |
| { | |
| "epoch": 3.9403726708074536, | |
| "grad_norm": 7.253668308258057, | |
| "learning_rate": 3.080745341614907e-06, | |
| "loss": 0.5316, | |
| "step": 15860 | |
| }, | |
| { | |
| "epoch": 3.942857142857143, | |
| "grad_norm": 4.728071689605713, | |
| "learning_rate": 2.9565217391304348e-06, | |
| "loss": 0.3085, | |
| "step": 15870 | |
| }, | |
| { | |
| "epoch": 3.945341614906832, | |
| "grad_norm": 3.6727304458618164, | |
| "learning_rate": 2.832298136645963e-06, | |
| "loss": 0.3978, | |
| "step": 15880 | |
| }, | |
| { | |
| "epoch": 3.9478260869565216, | |
| "grad_norm": 7.217862129211426, | |
| "learning_rate": 2.7080745341614908e-06, | |
| "loss": 0.5929, | |
| "step": 15890 | |
| }, | |
| { | |
| "epoch": 3.950310559006211, | |
| "grad_norm": 5.9662628173828125, | |
| "learning_rate": 2.5838509316770185e-06, | |
| "loss": 0.6485, | |
| "step": 15900 | |
| }, | |
| { | |
| "epoch": 3.950310559006211, | |
| "eval_accuracy": 0.8396550206811582, | |
| "eval_loss": 0.611811637878418, | |
| "eval_runtime": 85.1765, | |
| "eval_samples_per_second": 133.405, | |
| "eval_steps_per_second": 16.683, | |
| "step": 15900 | |
| }, | |
| { | |
| "epoch": 3.9527950310559006, | |
| "grad_norm": 3.825432777404785, | |
| "learning_rate": 2.4596273291925467e-06, | |
| "loss": 0.4889, | |
| "step": 15910 | |
| }, | |
| { | |
| "epoch": 3.95527950310559, | |
| "grad_norm": 4.859676837921143, | |
| "learning_rate": 2.3354037267080745e-06, | |
| "loss": 0.5675, | |
| "step": 15920 | |
| }, | |
| { | |
| "epoch": 3.9577639751552796, | |
| "grad_norm": 5.451256275177002, | |
| "learning_rate": 2.2111801242236023e-06, | |
| "loss": 0.4364, | |
| "step": 15930 | |
| }, | |
| { | |
| "epoch": 3.960248447204969, | |
| "grad_norm": 6.4008612632751465, | |
| "learning_rate": 2.0869565217391305e-06, | |
| "loss": 0.4252, | |
| "step": 15940 | |
| }, | |
| { | |
| "epoch": 3.9627329192546585, | |
| "grad_norm": 7.916716575622559, | |
| "learning_rate": 1.9627329192546587e-06, | |
| "loss": 0.4462, | |
| "step": 15950 | |
| }, | |
| { | |
| "epoch": 3.965217391304348, | |
| "grad_norm": 7.608262538909912, | |
| "learning_rate": 1.8385093167701865e-06, | |
| "loss": 0.5672, | |
| "step": 15960 | |
| }, | |
| { | |
| "epoch": 3.967701863354037, | |
| "grad_norm": 8.407822608947754, | |
| "learning_rate": 1.7142857142857145e-06, | |
| "loss": 0.4583, | |
| "step": 15970 | |
| }, | |
| { | |
| "epoch": 3.9701863354037266, | |
| "grad_norm": 4.553814888000488, | |
| "learning_rate": 1.5900621118012425e-06, | |
| "loss": 0.4074, | |
| "step": 15980 | |
| }, | |
| { | |
| "epoch": 3.972670807453416, | |
| "grad_norm": 3.75431752204895, | |
| "learning_rate": 1.4658385093167703e-06, | |
| "loss": 0.4336, | |
| "step": 15990 | |
| }, | |
| { | |
| "epoch": 3.9751552795031055, | |
| "grad_norm": 5.175358295440674, | |
| "learning_rate": 1.3416149068322982e-06, | |
| "loss": 0.331, | |
| "step": 16000 | |
| }, | |
| { | |
| "epoch": 3.9751552795031055, | |
| "eval_accuracy": 0.8396550206811582, | |
| "eval_loss": 0.6108485460281372, | |
| "eval_runtime": 87.4471, | |
| "eval_samples_per_second": 129.941, | |
| "eval_steps_per_second": 16.25, | |
| "step": 16000 | |
| }, | |
| { | |
| "epoch": 3.977639751552795, | |
| "grad_norm": 9.12428092956543, | |
| "learning_rate": 1.217391304347826e-06, | |
| "loss": 0.4686, | |
| "step": 16010 | |
| }, | |
| { | |
| "epoch": 3.9801242236024845, | |
| "grad_norm": 5.5283379554748535, | |
| "learning_rate": 1.093167701863354e-06, | |
| "loss": 0.4773, | |
| "step": 16020 | |
| }, | |
| { | |
| "epoch": 3.982608695652174, | |
| "grad_norm": 7.850075721740723, | |
| "learning_rate": 9.68944099378882e-07, | |
| "loss": 0.4124, | |
| "step": 16030 | |
| }, | |
| { | |
| "epoch": 3.9850931677018635, | |
| "grad_norm": 6.541348457336426, | |
| "learning_rate": 8.447204968944101e-07, | |
| "loss": 0.2801, | |
| "step": 16040 | |
| }, | |
| { | |
| "epoch": 3.987577639751553, | |
| "grad_norm": 4.038955211639404, | |
| "learning_rate": 7.204968944099379e-07, | |
| "loss": 0.3776, | |
| "step": 16050 | |
| }, | |
| { | |
| "epoch": 3.990062111801242, | |
| "grad_norm": 2.5451860427856445, | |
| "learning_rate": 5.962732919254659e-07, | |
| "loss": 0.5369, | |
| "step": 16060 | |
| }, | |
| { | |
| "epoch": 3.9925465838509315, | |
| "grad_norm": 2.278172731399536, | |
| "learning_rate": 4.720496894409938e-07, | |
| "loss": 0.578, | |
| "step": 16070 | |
| }, | |
| { | |
| "epoch": 3.995031055900621, | |
| "grad_norm": 11.714668273925781, | |
| "learning_rate": 3.4782608695652175e-07, | |
| "loss": 0.4875, | |
| "step": 16080 | |
| }, | |
| { | |
| "epoch": 3.9975155279503105, | |
| "grad_norm": 8.900927543640137, | |
| "learning_rate": 2.236024844720497e-07, | |
| "loss": 0.4701, | |
| "step": 16090 | |
| }, | |
| { | |
| "epoch": 4.0, | |
| "grad_norm": 0.3073888123035431, | |
| "learning_rate": 9.937888198757765e-08, | |
| "loss": 0.3582, | |
| "step": 16100 | |
| }, | |
| { | |
| "epoch": 4.0, | |
| "eval_accuracy": 0.8400070403942621, | |
| "eval_loss": 0.6105344295501709, | |
| "eval_runtime": 85.9786, | |
| "eval_samples_per_second": 132.161, | |
| "eval_steps_per_second": 16.527, | |
| "step": 16100 | |
| }, | |
| { | |
| "epoch": 4.0, | |
| "step": 16100, | |
| "total_flos": 1.9975615705569485e+19, | |
| "train_loss": 0.9840855360623473, | |
| "train_runtime": 18351.2913, | |
| "train_samples_per_second": 14.034, | |
| "train_steps_per_second": 0.877 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 16100, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 4, | |
| "save_steps": 100, | |
| "total_flos": 1.9975615705569485e+19, | |
| "train_batch_size": 16, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |