Instructions to use kallacharanteja/mt5-version4-Hindi-medium with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use kallacharanteja/mt5-version4-Hindi-medium with PEFT:
from peft import PeftModel from transformers import AutoModelForSeq2SeqLM base_model = AutoModelForSeq2SeqLM.from_pretrained("google/mt5-small") model = PeftModel.from_pretrained(base_model, "kallacharanteja/mt5-version4-Hindi-medium") - Transformers
How to use kallacharanteja/mt5-version4-Hindi-medium with Transformers:
# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("kallacharanteja/mt5-version4-Hindi-medium", device_map="auto") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": 5500, | |
| "best_metric": 1.8417972326278687, | |
| "best_model_checkpoint": "/kaggle/working/checkpoints/checkpoint-5500", | |
| "epoch": 6.0, | |
| "eval_steps": 500, | |
| "global_step": 5664, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.0010601643254704478, | |
| "grad_norm": 0.8187403082847595, | |
| "learning_rate": 0.0, | |
| "loss": 10.509103775024414, | |
| "num_input_tokens_seen": 4096, | |
| "step": 1, | |
| "train_runtime": 4.0328, | |
| "train_tokens_per_second": 1015.678 | |
| }, | |
| { | |
| "epoch": 0.053008216273522396, | |
| "grad_norm": 0.7271436452865601, | |
| "learning_rate": 8.64705882352941e-05, | |
| "loss": 9.653437400350766, | |
| "num_input_tokens_seen": 204800, | |
| "step": 50, | |
| "train_runtime": 85.0317, | |
| "train_tokens_per_second": 2408.514 | |
| }, | |
| { | |
| "epoch": 0.10601643254704479, | |
| "grad_norm": 0.6869716644287109, | |
| "learning_rate": 0.00017470588235294116, | |
| "loss": 9.471989135742188, | |
| "num_input_tokens_seen": 409600, | |
| "step": 100, | |
| "train_runtime": 176.2658, | |
| "train_tokens_per_second": 2323.764 | |
| }, | |
| { | |
| "epoch": 0.1590246488205672, | |
| "grad_norm": 0.6832960247993469, | |
| "learning_rate": 0.0002629411764705882, | |
| "loss": 9.664740600585937, | |
| "num_input_tokens_seen": 614400, | |
| "step": 150, | |
| "train_runtime": 267.3416, | |
| "train_tokens_per_second": 2298.183 | |
| }, | |
| { | |
| "epoch": 0.21203286509408958, | |
| "grad_norm": 0.6674580574035645, | |
| "learning_rate": 0.00029841645431379684, | |
| "loss": 9.3196337890625, | |
| "num_input_tokens_seen": 819200, | |
| "step": 200, | |
| "train_runtime": 358.4777, | |
| "train_tokens_per_second": 2285.219 | |
| }, | |
| { | |
| "epoch": 0.26504108136761195, | |
| "grad_norm": 0.6817887425422668, | |
| "learning_rate": 0.00029568620313068797, | |
| "loss": 9.44159423828125, | |
| "num_input_tokens_seen": 1024000, | |
| "step": 250, | |
| "train_runtime": 449.5642, | |
| "train_tokens_per_second": 2277.761 | |
| }, | |
| { | |
| "epoch": 0.3180492976411344, | |
| "grad_norm": 0.6933718919754028, | |
| "learning_rate": 0.00029295595194757916, | |
| "loss": 9.353170776367188, | |
| "num_input_tokens_seen": 1228800, | |
| "step": 300, | |
| "train_runtime": 540.6374, | |
| "train_tokens_per_second": 2272.873 | |
| }, | |
| { | |
| "epoch": 0.37105751391465674, | |
| "grad_norm": 0.6354528069496155, | |
| "learning_rate": 0.0002902257007644703, | |
| "loss": 9.46597900390625, | |
| "num_input_tokens_seen": 1433600, | |
| "step": 350, | |
| "train_runtime": 631.7827, | |
| "train_tokens_per_second": 2269.135 | |
| }, | |
| { | |
| "epoch": 0.42406573018817917, | |
| "grad_norm": 0.6813943982124329, | |
| "learning_rate": 0.0002874954495813615, | |
| "loss": 9.3445703125, | |
| "num_input_tokens_seen": 1638400, | |
| "step": 400, | |
| "train_runtime": 722.6411, | |
| "train_tokens_per_second": 2267.239 | |
| }, | |
| { | |
| "epoch": 0.47707394646170154, | |
| "grad_norm": 0.5886964797973633, | |
| "learning_rate": 0.0002847651983982526, | |
| "loss": 9.338291625976563, | |
| "num_input_tokens_seen": 1843200, | |
| "step": 450, | |
| "train_runtime": 813.7385, | |
| "train_tokens_per_second": 2265.101 | |
| }, | |
| { | |
| "epoch": 0.5300821627352239, | |
| "grad_norm": 0.6884158849716187, | |
| "learning_rate": 0.0002820349472151438, | |
| "loss": 9.193983764648438, | |
| "num_input_tokens_seen": 2048000, | |
| "step": 500, | |
| "train_runtime": 904.7321, | |
| "train_tokens_per_second": 2263.653 | |
| }, | |
| { | |
| "epoch": 0.5300821627352239, | |
| "eval_bleu": 4.06, | |
| "eval_chrf": 19.66, | |
| "eval_loss": 1.8984475135803223, | |
| "eval_runtime": 87.1763, | |
| "eval_samples_per_second": 3.499, | |
| "eval_steps_per_second": 1.755, | |
| "num_input_tokens_seen": 2048000, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.5830903790087464, | |
| "grad_norm": 0.6719595193862915, | |
| "learning_rate": 0.0002793046960320349, | |
| "loss": 9.386028442382813, | |
| "num_input_tokens_seen": 2252800, | |
| "step": 550, | |
| "train_runtime": 1094.9482, | |
| "train_tokens_per_second": 2057.449 | |
| }, | |
| { | |
| "epoch": 0.6360985952822688, | |
| "grad_norm": 0.6773673295974731, | |
| "learning_rate": 0.00027657444484892606, | |
| "loss": 9.26089599609375, | |
| "num_input_tokens_seen": 2457600, | |
| "step": 600, | |
| "train_runtime": 1186.45, | |
| "train_tokens_per_second": 2071.389 | |
| }, | |
| { | |
| "epoch": 0.6891068115557911, | |
| "grad_norm": 0.6533596515655518, | |
| "learning_rate": 0.00027384419366581725, | |
| "loss": 9.2549658203125, | |
| "num_input_tokens_seen": 2662400, | |
| "step": 650, | |
| "train_runtime": 1277.7875, | |
| "train_tokens_per_second": 2083.602 | |
| }, | |
| { | |
| "epoch": 0.7421150278293135, | |
| "grad_norm": 0.6407659649848938, | |
| "learning_rate": 0.0002711139424827084, | |
| "loss": 9.27232666015625, | |
| "num_input_tokens_seen": 2867200, | |
| "step": 700, | |
| "train_runtime": 1369.0819, | |
| "train_tokens_per_second": 2094.25 | |
| }, | |
| { | |
| "epoch": 0.795123244102836, | |
| "grad_norm": 0.7818734645843506, | |
| "learning_rate": 0.00026838369129959956, | |
| "loss": 9.223333740234375, | |
| "num_input_tokens_seen": 3072000, | |
| "step": 750, | |
| "train_runtime": 1460.1534, | |
| "train_tokens_per_second": 2103.889 | |
| }, | |
| { | |
| "epoch": 0.8481314603763583, | |
| "grad_norm": 0.6569114923477173, | |
| "learning_rate": 0.0002656534401164907, | |
| "loss": 9.193381958007812, | |
| "num_input_tokens_seen": 3276800, | |
| "step": 800, | |
| "train_runtime": 1551.22, | |
| "train_tokens_per_second": 2112.402 | |
| }, | |
| { | |
| "epoch": 0.9011396766498807, | |
| "grad_norm": 0.7116767168045044, | |
| "learning_rate": 0.0002629231889333819, | |
| "loss": 9.336693115234375, | |
| "num_input_tokens_seen": 3481600, | |
| "step": 850, | |
| "train_runtime": 1642.3679, | |
| "train_tokens_per_second": 2119.866 | |
| }, | |
| { | |
| "epoch": 0.9541478929234031, | |
| "grad_norm": 0.64178466796875, | |
| "learning_rate": 0.000260192937750273, | |
| "loss": 9.349353637695312, | |
| "num_input_tokens_seen": 3686400, | |
| "step": 900, | |
| "train_runtime": 1733.6186, | |
| "train_tokens_per_second": 2126.419 | |
| }, | |
| { | |
| "epoch": 1.0063609859528226, | |
| "grad_norm": 0.6793839931488037, | |
| "learning_rate": 0.00025746268656716415, | |
| "loss": 9.190228271484376, | |
| "num_input_tokens_seen": 3887616, | |
| "step": 950, | |
| "train_runtime": 1823.6521, | |
| "train_tokens_per_second": 2131.775 | |
| }, | |
| { | |
| "epoch": 1.059369202226345, | |
| "grad_norm": 0.6120585799217224, | |
| "learning_rate": 0.00025473243538405533, | |
| "loss": 8.995220336914063, | |
| "num_input_tokens_seen": 4092416, | |
| "step": 1000, | |
| "train_runtime": 1914.9217, | |
| "train_tokens_per_second": 2137.119 | |
| }, | |
| { | |
| "epoch": 1.059369202226345, | |
| "eval_bleu": 4.04, | |
| "eval_chrf": 19.54, | |
| "eval_loss": 1.8891278505325317, | |
| "eval_runtime": 84.89, | |
| "eval_samples_per_second": 3.593, | |
| "eval_steps_per_second": 1.802, | |
| "num_input_tokens_seen": 4092416, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 1.1123774184998674, | |
| "grad_norm": 0.6622714996337891, | |
| "learning_rate": 0.00025200218420094646, | |
| "loss": 9.169678955078124, | |
| "num_input_tokens_seen": 4297216, | |
| "step": 1050, | |
| "train_runtime": 2104.4734, | |
| "train_tokens_per_second": 2041.944 | |
| }, | |
| { | |
| "epoch": 1.16538563477339, | |
| "grad_norm": 0.6801309585571289, | |
| "learning_rate": 0.00024927193301783765, | |
| "loss": 9.108585205078125, | |
| "num_input_tokens_seen": 4502016, | |
| "step": 1100, | |
| "train_runtime": 2195.9257, | |
| "train_tokens_per_second": 2050.168 | |
| }, | |
| { | |
| "epoch": 1.2183938510469123, | |
| "grad_norm": 0.6843289732933044, | |
| "learning_rate": 0.0002465416818347288, | |
| "loss": 9.04650146484375, | |
| "num_input_tokens_seen": 4706816, | |
| "step": 1150, | |
| "train_runtime": 2287.3334, | |
| "train_tokens_per_second": 2057.774 | |
| }, | |
| { | |
| "epoch": 1.2714020673204347, | |
| "grad_norm": 0.6618881821632385, | |
| "learning_rate": 0.00024381143065161994, | |
| "loss": 9.0776953125, | |
| "num_input_tokens_seen": 4911616, | |
| "step": 1200, | |
| "train_runtime": 2378.5524, | |
| "train_tokens_per_second": 2064.96 | |
| }, | |
| { | |
| "epoch": 1.324410283593957, | |
| "grad_norm": 0.7164718508720398, | |
| "learning_rate": 0.00024108117946851107, | |
| "loss": 9.070903930664063, | |
| "num_input_tokens_seen": 5116416, | |
| "step": 1250, | |
| "train_runtime": 2470.0729, | |
| "train_tokens_per_second": 2071.362 | |
| }, | |
| { | |
| "epoch": 1.3774184998674794, | |
| "grad_norm": 0.703388512134552, | |
| "learning_rate": 0.00023835092828540223, | |
| "loss": 9.000114135742187, | |
| "num_input_tokens_seen": 5321216, | |
| "step": 1300, | |
| "train_runtime": 2561.2113, | |
| "train_tokens_per_second": 2077.617 | |
| }, | |
| { | |
| "epoch": 1.4304267161410018, | |
| "grad_norm": 0.6863468289375305, | |
| "learning_rate": 0.00023562067710229337, | |
| "loss": 9.03710693359375, | |
| "num_input_tokens_seen": 5526016, | |
| "step": 1350, | |
| "train_runtime": 2652.4931, | |
| "train_tokens_per_second": 2083.329 | |
| }, | |
| { | |
| "epoch": 1.4834349324145242, | |
| "grad_norm": 0.681918740272522, | |
| "learning_rate": 0.00023289042591918453, | |
| "loss": 9.07092529296875, | |
| "num_input_tokens_seen": 5730816, | |
| "step": 1400, | |
| "train_runtime": 2743.7676, | |
| "train_tokens_per_second": 2088.667 | |
| }, | |
| { | |
| "epoch": 1.5364431486880465, | |
| "grad_norm": 0.6488898396492004, | |
| "learning_rate": 0.00023016017473607568, | |
| "loss": 9.12448974609375, | |
| "num_input_tokens_seen": 5935616, | |
| "step": 1450, | |
| "train_runtime": 2835.0135, | |
| "train_tokens_per_second": 2093.682 | |
| }, | |
| { | |
| "epoch": 1.589451364961569, | |
| "grad_norm": 0.629993736743927, | |
| "learning_rate": 0.00022742992355296684, | |
| "loss": 8.988504638671875, | |
| "num_input_tokens_seen": 6140416, | |
| "step": 1500, | |
| "train_runtime": 2926.1673, | |
| "train_tokens_per_second": 2098.45 | |
| }, | |
| { | |
| "epoch": 1.589451364961569, | |
| "eval_bleu": 4.15, | |
| "eval_chrf": 19.86, | |
| "eval_loss": 1.8749940395355225, | |
| "eval_runtime": 85.3123, | |
| "eval_samples_per_second": 3.575, | |
| "eval_steps_per_second": 1.793, | |
| "num_input_tokens_seen": 6140416, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 1.6424595812350913, | |
| "grad_norm": 0.6674344539642334, | |
| "learning_rate": 0.000224699672369858, | |
| "loss": 9.002008056640625, | |
| "num_input_tokens_seen": 6345216, | |
| "step": 1550, | |
| "train_runtime": 3115.9795, | |
| "train_tokens_per_second": 2036.347 | |
| }, | |
| { | |
| "epoch": 1.6954677975086139, | |
| "grad_norm": 0.6869524717330933, | |
| "learning_rate": 0.00022196942118674916, | |
| "loss": 9.157560424804688, | |
| "num_input_tokens_seen": 6550016, | |
| "step": 1600, | |
| "train_runtime": 3207.373, | |
| "train_tokens_per_second": 2042.175 | |
| }, | |
| { | |
| "epoch": 1.7484760137821362, | |
| "grad_norm": 0.661709725856781, | |
| "learning_rate": 0.0002192391700036403, | |
| "loss": 9.031039428710937, | |
| "num_input_tokens_seen": 6754816, | |
| "step": 1650, | |
| "train_runtime": 3298.7999, | |
| "train_tokens_per_second": 2047.659 | |
| }, | |
| { | |
| "epoch": 1.8014842300556586, | |
| "grad_norm": 0.6780179738998413, | |
| "learning_rate": 0.00021650891882053145, | |
| "loss": 9.039593505859376, | |
| "num_input_tokens_seen": 6959616, | |
| "step": 1700, | |
| "train_runtime": 3390.0711, | |
| "train_tokens_per_second": 2052.941 | |
| }, | |
| { | |
| "epoch": 1.854492446329181, | |
| "grad_norm": 0.700842022895813, | |
| "learning_rate": 0.0002137786676374226, | |
| "loss": 8.978927612304688, | |
| "num_input_tokens_seen": 7164416, | |
| "step": 1750, | |
| "train_runtime": 3481.1155, | |
| "train_tokens_per_second": 2058.081 | |
| }, | |
| { | |
| "epoch": 1.9075006626027036, | |
| "grad_norm": 0.6786106824874878, | |
| "learning_rate": 0.00021104841645431377, | |
| "loss": 9.08431396484375, | |
| "num_input_tokens_seen": 7369216, | |
| "step": 1800, | |
| "train_runtime": 3572.2502, | |
| "train_tokens_per_second": 2062.906 | |
| }, | |
| { | |
| "epoch": 1.960508878876226, | |
| "grad_norm": 0.6586954593658447, | |
| "learning_rate": 0.00020831816527120493, | |
| "loss": 9.029188232421875, | |
| "num_input_tokens_seen": 7574016, | |
| "step": 1850, | |
| "train_runtime": 3663.5445, | |
| "train_tokens_per_second": 2067.401 | |
| }, | |
| { | |
| "epoch": 2.0127219719056453, | |
| "grad_norm": 0.7223443388938904, | |
| "learning_rate": 0.0002055879140880961, | |
| "loss": 8.716483764648437, | |
| "num_input_tokens_seen": 7775232, | |
| "step": 1900, | |
| "train_runtime": 3753.5921, | |
| "train_tokens_per_second": 2071.411 | |
| }, | |
| { | |
| "epoch": 2.0657301881791676, | |
| "grad_norm": 0.6501656770706177, | |
| "learning_rate": 0.00020285766290498725, | |
| "loss": 8.858229370117188, | |
| "num_input_tokens_seen": 7980032, | |
| "step": 1950, | |
| "train_runtime": 3844.9155, | |
| "train_tokens_per_second": 2075.477 | |
| }, | |
| { | |
| "epoch": 2.11873840445269, | |
| "grad_norm": 0.6163517236709595, | |
| "learning_rate": 0.00020012741172187838, | |
| "loss": 8.852374267578124, | |
| "num_input_tokens_seen": 8184832, | |
| "step": 2000, | |
| "train_runtime": 3936.2252, | |
| "train_tokens_per_second": 2079.361 | |
| }, | |
| { | |
| "epoch": 2.11873840445269, | |
| "eval_bleu": 4.07, | |
| "eval_chrf": 19.95, | |
| "eval_loss": 1.8687856197357178, | |
| "eval_runtime": 85.2414, | |
| "eval_samples_per_second": 3.578, | |
| "eval_steps_per_second": 1.795, | |
| "num_input_tokens_seen": 8184832, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 2.1717466207262124, | |
| "grad_norm": 0.6511809825897217, | |
| "learning_rate": 0.00019739716053876954, | |
| "loss": 8.9257958984375, | |
| "num_input_tokens_seen": 8389632, | |
| "step": 2050, | |
| "train_runtime": 4126.538, | |
| "train_tokens_per_second": 2033.092 | |
| }, | |
| { | |
| "epoch": 2.2247548369997348, | |
| "grad_norm": 0.6239650249481201, | |
| "learning_rate": 0.0001946669093556607, | |
| "loss": 8.875814208984375, | |
| "num_input_tokens_seen": 8594432, | |
| "step": 2100, | |
| "train_runtime": 4217.9271, | |
| "train_tokens_per_second": 2037.596 | |
| }, | |
| { | |
| "epoch": 2.277763053273257, | |
| "grad_norm": 0.6986948847770691, | |
| "learning_rate": 0.00019193665817255186, | |
| "loss": 8.9848681640625, | |
| "num_input_tokens_seen": 8799232, | |
| "step": 2150, | |
| "train_runtime": 4309.2527, | |
| "train_tokens_per_second": 2041.939 | |
| }, | |
| { | |
| "epoch": 2.33077126954678, | |
| "grad_norm": 0.6011477708816528, | |
| "learning_rate": 0.00018920640698944302, | |
| "loss": 8.912135620117187, | |
| "num_input_tokens_seen": 9004032, | |
| "step": 2200, | |
| "train_runtime": 4400.5936, | |
| "train_tokens_per_second": 2046.095 | |
| }, | |
| { | |
| "epoch": 2.3837794858203023, | |
| "grad_norm": 0.7250493764877319, | |
| "learning_rate": 0.00018647615580633418, | |
| "loss": 8.793685913085938, | |
| "num_input_tokens_seen": 9208832, | |
| "step": 2250, | |
| "train_runtime": 4492.0003, | |
| "train_tokens_per_second": 2050.052 | |
| }, | |
| { | |
| "epoch": 2.4367877020938247, | |
| "grad_norm": 0.6375405788421631, | |
| "learning_rate": 0.00018374590462322534, | |
| "loss": 8.844403076171876, | |
| "num_input_tokens_seen": 9413632, | |
| "step": 2300, | |
| "train_runtime": 4583.4122, | |
| "train_tokens_per_second": 2053.848 | |
| }, | |
| { | |
| "epoch": 2.489795918367347, | |
| "grad_norm": 0.6628595590591431, | |
| "learning_rate": 0.00018101565344011647, | |
| "loss": 8.734286499023437, | |
| "num_input_tokens_seen": 9618432, | |
| "step": 2350, | |
| "train_runtime": 4674.7698, | |
| "train_tokens_per_second": 2057.52 | |
| }, | |
| { | |
| "epoch": 2.5428041346408694, | |
| "grad_norm": 0.6868587136268616, | |
| "learning_rate": 0.00017828540225700763, | |
| "loss": 8.970186157226562, | |
| "num_input_tokens_seen": 9823232, | |
| "step": 2400, | |
| "train_runtime": 4765.9951, | |
| "train_tokens_per_second": 2061.108 | |
| }, | |
| { | |
| "epoch": 2.5958123509143918, | |
| "grad_norm": 0.6495867371559143, | |
| "learning_rate": 0.0001755551510738988, | |
| "loss": 8.924597778320312, | |
| "num_input_tokens_seen": 10028032, | |
| "step": 2450, | |
| "train_runtime": 4857.2206, | |
| "train_tokens_per_second": 2064.562 | |
| }, | |
| { | |
| "epoch": 2.648820567187914, | |
| "grad_norm": 0.7620416283607483, | |
| "learning_rate": 0.00017282489989078995, | |
| "loss": 8.905831298828126, | |
| "num_input_tokens_seen": 10232832, | |
| "step": 2500, | |
| "train_runtime": 4948.5715, | |
| "train_tokens_per_second": 2067.836 | |
| }, | |
| { | |
| "epoch": 2.648820567187914, | |
| "eval_bleu": 4.05, | |
| "eval_chrf": 19.71, | |
| "eval_loss": 1.8576197624206543, | |
| "eval_runtime": 85.4771, | |
| "eval_samples_per_second": 3.568, | |
| "eval_steps_per_second": 1.79, | |
| "num_input_tokens_seen": 10232832, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 2.7018287834614365, | |
| "grad_norm": 0.7461215853691101, | |
| "learning_rate": 0.0001700946487076811, | |
| "loss": 8.890812377929688, | |
| "num_input_tokens_seen": 10437632, | |
| "step": 2550, | |
| "train_runtime": 5138.677, | |
| "train_tokens_per_second": 2031.191 | |
| }, | |
| { | |
| "epoch": 2.754836999734959, | |
| "grad_norm": 0.6335775256156921, | |
| "learning_rate": 0.00016736439752457227, | |
| "loss": 8.868407592773437, | |
| "num_input_tokens_seen": 10642432, | |
| "step": 2600, | |
| "train_runtime": 5230.3092, | |
| "train_tokens_per_second": 2034.762 | |
| }, | |
| { | |
| "epoch": 2.8078452160084812, | |
| "grad_norm": 0.6892751455307007, | |
| "learning_rate": 0.00016463414634146343, | |
| "loss": 8.848526000976562, | |
| "num_input_tokens_seen": 10847232, | |
| "step": 2650, | |
| "train_runtime": 5321.7199, | |
| "train_tokens_per_second": 2038.294 | |
| }, | |
| { | |
| "epoch": 2.8608534322820036, | |
| "grad_norm": 0.7833438515663147, | |
| "learning_rate": 0.00016190389515835456, | |
| "loss": 8.842973022460937, | |
| "num_input_tokens_seen": 11052032, | |
| "step": 2700, | |
| "train_runtime": 5413.0681, | |
| "train_tokens_per_second": 2041.732 | |
| }, | |
| { | |
| "epoch": 2.913861648555526, | |
| "grad_norm": 0.7217938303947449, | |
| "learning_rate": 0.00015917364397524572, | |
| "loss": 8.9160205078125, | |
| "num_input_tokens_seen": 11256832, | |
| "step": 2750, | |
| "train_runtime": 5504.4642, | |
| "train_tokens_per_second": 2045.037 | |
| }, | |
| { | |
| "epoch": 2.9668698648290484, | |
| "grad_norm": 0.625913143157959, | |
| "learning_rate": 0.00015644339279213688, | |
| "loss": 8.780228271484376, | |
| "num_input_tokens_seen": 11461632, | |
| "step": 2800, | |
| "train_runtime": 5595.8294, | |
| "train_tokens_per_second": 2048.245 | |
| }, | |
| { | |
| "epoch": 3.019082957858468, | |
| "grad_norm": 0.686261773109436, | |
| "learning_rate": 0.000153713141609028, | |
| "loss": 8.62293212890625, | |
| "num_input_tokens_seen": 11662848, | |
| "step": 2850, | |
| "train_runtime": 5686.1951, | |
| "train_tokens_per_second": 2051.081 | |
| }, | |
| { | |
| "epoch": 3.0720911741319905, | |
| "grad_norm": 0.7150633335113525, | |
| "learning_rate": 0.00015098289042591917, | |
| "loss": 8.857227783203125, | |
| "num_input_tokens_seen": 11867648, | |
| "step": 2900, | |
| "train_runtime": 5777.4806, | |
| "train_tokens_per_second": 2054.122 | |
| }, | |
| { | |
| "epoch": 3.125099390405513, | |
| "grad_norm": 0.7594448328018188, | |
| "learning_rate": 0.00014825263924281033, | |
| "loss": 8.733943481445312, | |
| "num_input_tokens_seen": 12072448, | |
| "step": 2950, | |
| "train_runtime": 5868.7816, | |
| "train_tokens_per_second": 2057.062 | |
| }, | |
| { | |
| "epoch": 3.1781076066790352, | |
| "grad_norm": 0.6436108946800232, | |
| "learning_rate": 0.00014552238805970149, | |
| "loss": 8.650802612304688, | |
| "num_input_tokens_seen": 12277248, | |
| "step": 3000, | |
| "train_runtime": 5960.2675, | |
| "train_tokens_per_second": 2059.848 | |
| }, | |
| { | |
| "epoch": 3.1781076066790352, | |
| "eval_bleu": 4.2, | |
| "eval_chrf": 19.81, | |
| "eval_loss": 1.8580111265182495, | |
| "eval_runtime": 85.4127, | |
| "eval_samples_per_second": 3.571, | |
| "eval_steps_per_second": 1.791, | |
| "num_input_tokens_seen": 12277248, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 3.2311158229525576, | |
| "grad_norm": 0.6634842753410339, | |
| "learning_rate": 0.00014279213687659265, | |
| "loss": 8.697005615234374, | |
| "num_input_tokens_seen": 12482048, | |
| "step": 3050, | |
| "train_runtime": 6151.2346, | |
| "train_tokens_per_second": 2029.194 | |
| }, | |
| { | |
| "epoch": 3.28412403922608, | |
| "grad_norm": 0.7246391773223877, | |
| "learning_rate": 0.0001400618856934838, | |
| "loss": 8.7168359375, | |
| "num_input_tokens_seen": 12686848, | |
| "step": 3100, | |
| "train_runtime": 6242.7027, | |
| "train_tokens_per_second": 2032.268 | |
| }, | |
| { | |
| "epoch": 3.3371322554996024, | |
| "grad_norm": 0.6836341023445129, | |
| "learning_rate": 0.00013733163451037494, | |
| "loss": 8.65872802734375, | |
| "num_input_tokens_seen": 12891648, | |
| "step": 3150, | |
| "train_runtime": 6333.8948, | |
| "train_tokens_per_second": 2035.343 | |
| }, | |
| { | |
| "epoch": 3.3901404717731247, | |
| "grad_norm": 0.7036194801330566, | |
| "learning_rate": 0.0001346013833272661, | |
| "loss": 8.667957763671875, | |
| "num_input_tokens_seen": 13096448, | |
| "step": 3200, | |
| "train_runtime": 6425.2484, | |
| "train_tokens_per_second": 2038.279 | |
| }, | |
| { | |
| "epoch": 3.443148688046647, | |
| "grad_norm": 0.7401408553123474, | |
| "learning_rate": 0.00013187113214415725, | |
| "loss": 8.828726806640624, | |
| "num_input_tokens_seen": 13301248, | |
| "step": 3250, | |
| "train_runtime": 6516.5209, | |
| "train_tokens_per_second": 2041.158 | |
| }, | |
| { | |
| "epoch": 3.4961569043201695, | |
| "grad_norm": 0.735714852809906, | |
| "learning_rate": 0.0001291408809610484, | |
| "loss": 8.744295654296875, | |
| "num_input_tokens_seen": 13506048, | |
| "step": 3300, | |
| "train_runtime": 6607.8418, | |
| "train_tokens_per_second": 2043.942 | |
| }, | |
| { | |
| "epoch": 3.549165120593692, | |
| "grad_norm": 0.7713711261749268, | |
| "learning_rate": 0.00012641062977793955, | |
| "loss": 8.785454711914063, | |
| "num_input_tokens_seen": 13710848, | |
| "step": 3350, | |
| "train_runtime": 6699.3485, | |
| "train_tokens_per_second": 2046.594 | |
| }, | |
| { | |
| "epoch": 3.6021733368672146, | |
| "grad_norm": 0.6046838760375977, | |
| "learning_rate": 0.0001236803785948307, | |
| "loss": 8.79681884765625, | |
| "num_input_tokens_seen": 13915648, | |
| "step": 3400, | |
| "train_runtime": 6790.6621, | |
| "train_tokens_per_second": 2049.233 | |
| }, | |
| { | |
| "epoch": 3.6551815531407366, | |
| "grad_norm": 0.7195361852645874, | |
| "learning_rate": 0.00012095012741172186, | |
| "loss": 8.713923950195312, | |
| "num_input_tokens_seen": 14120448, | |
| "step": 3450, | |
| "train_runtime": 6881.9777, | |
| "train_tokens_per_second": 2051.801 | |
| }, | |
| { | |
| "epoch": 3.7081897694142594, | |
| "grad_norm": 0.6607725620269775, | |
| "learning_rate": 0.00011821987622861302, | |
| "loss": 8.707265014648437, | |
| "num_input_tokens_seen": 14325248, | |
| "step": 3500, | |
| "train_runtime": 6973.3252, | |
| "train_tokens_per_second": 2054.292 | |
| }, | |
| { | |
| "epoch": 3.7081897694142594, | |
| "eval_bleu": 4.18, | |
| "eval_chrf": 19.91, | |
| "eval_loss": 1.8520567417144775, | |
| "eval_runtime": 85.3221, | |
| "eval_samples_per_second": 3.575, | |
| "eval_steps_per_second": 1.793, | |
| "num_input_tokens_seen": 14325248, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 3.7611979856877817, | |
| "grad_norm": 0.7562373876571655, | |
| "learning_rate": 0.00011548962504550417, | |
| "loss": 8.9096435546875, | |
| "num_input_tokens_seen": 14530048, | |
| "step": 3550, | |
| "train_runtime": 7163.8071, | |
| "train_tokens_per_second": 2028.258 | |
| }, | |
| { | |
| "epoch": 3.814206201961304, | |
| "grad_norm": 0.6998844742774963, | |
| "learning_rate": 0.00011275937386239533, | |
| "loss": 8.541333618164062, | |
| "num_input_tokens_seen": 14734848, | |
| "step": 3600, | |
| "train_runtime": 7255.3341, | |
| "train_tokens_per_second": 2030.899 | |
| }, | |
| { | |
| "epoch": 3.8672144182348265, | |
| "grad_norm": 0.7850280404090881, | |
| "learning_rate": 0.00011002912267928649, | |
| "loss": 8.79550537109375, | |
| "num_input_tokens_seen": 14939648, | |
| "step": 3650, | |
| "train_runtime": 7346.7779, | |
| "train_tokens_per_second": 2033.497 | |
| }, | |
| { | |
| "epoch": 3.920222634508349, | |
| "grad_norm": 0.6771405339241028, | |
| "learning_rate": 0.00010729887149617765, | |
| "loss": 8.66411865234375, | |
| "num_input_tokens_seen": 15144448, | |
| "step": 3700, | |
| "train_runtime": 7438.0137, | |
| "train_tokens_per_second": 2036.088 | |
| }, | |
| { | |
| "epoch": 3.973230850781871, | |
| "grad_norm": 0.6406344771385193, | |
| "learning_rate": 0.0001045686203130688, | |
| "loss": 8.713903198242187, | |
| "num_input_tokens_seen": 15349248, | |
| "step": 3750, | |
| "train_runtime": 7529.334, | |
| "train_tokens_per_second": 2038.593 | |
| }, | |
| { | |
| "epoch": 4.025443943811291, | |
| "grad_norm": 0.6602168679237366, | |
| "learning_rate": 0.00010183836912995995, | |
| "loss": 8.64723388671875, | |
| "num_input_tokens_seen": 15550464, | |
| "step": 3800, | |
| "train_runtime": 7619.5214, | |
| "train_tokens_per_second": 2040.871 | |
| }, | |
| { | |
| "epoch": 4.078452160084813, | |
| "grad_norm": 0.6122914552688599, | |
| "learning_rate": 9.910811794685111e-05, | |
| "loss": 8.693761596679687, | |
| "num_input_tokens_seen": 15755264, | |
| "step": 3850, | |
| "train_runtime": 7710.944, | |
| "train_tokens_per_second": 2043.234 | |
| }, | |
| { | |
| "epoch": 4.131460376358335, | |
| "grad_norm": 0.6196545958518982, | |
| "learning_rate": 9.637786676374226e-05, | |
| "loss": 8.59835693359375, | |
| "num_input_tokens_seen": 15960064, | |
| "step": 3900, | |
| "train_runtime": 7802.3986, | |
| "train_tokens_per_second": 2045.533 | |
| }, | |
| { | |
| "epoch": 4.184468592631858, | |
| "grad_norm": 0.7231429815292358, | |
| "learning_rate": 9.364761558063342e-05, | |
| "loss": 8.621876831054687, | |
| "num_input_tokens_seen": 16164864, | |
| "step": 3950, | |
| "train_runtime": 7893.7536, | |
| "train_tokens_per_second": 2047.804 | |
| }, | |
| { | |
| "epoch": 4.23747680890538, | |
| "grad_norm": 0.6612716913223267, | |
| "learning_rate": 9.091736439752458e-05, | |
| "loss": 8.63590087890625, | |
| "num_input_tokens_seen": 16369664, | |
| "step": 4000, | |
| "train_runtime": 7985.1156, | |
| "train_tokens_per_second": 2050.022 | |
| }, | |
| { | |
| "epoch": 4.23747680890538, | |
| "eval_bleu": 4.17, | |
| "eval_chrf": 20.0, | |
| "eval_loss": 1.8474465608596802, | |
| "eval_runtime": 85.4899, | |
| "eval_samples_per_second": 3.568, | |
| "eval_steps_per_second": 1.79, | |
| "num_input_tokens_seen": 16369664, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 4.290485025178903, | |
| "grad_norm": 0.611146092414856, | |
| "learning_rate": 8.818711321441571e-05, | |
| "loss": 8.60938720703125, | |
| "num_input_tokens_seen": 16574464, | |
| "step": 4050, | |
| "train_runtime": 8174.4094, | |
| "train_tokens_per_second": 2027.604 | |
| }, | |
| { | |
| "epoch": 4.343493241452425, | |
| "grad_norm": 0.6369199156761169, | |
| "learning_rate": 8.545686203130687e-05, | |
| "loss": 8.630716552734375, | |
| "num_input_tokens_seen": 16779264, | |
| "step": 4100, | |
| "train_runtime": 8265.9997, | |
| "train_tokens_per_second": 2029.913 | |
| }, | |
| { | |
| "epoch": 4.396501457725948, | |
| "grad_norm": 0.6628316044807434, | |
| "learning_rate": 8.272661084819803e-05, | |
| "loss": 8.668856811523437, | |
| "num_input_tokens_seen": 16984064, | |
| "step": 4150, | |
| "train_runtime": 8357.3474, | |
| "train_tokens_per_second": 2032.231 | |
| }, | |
| { | |
| "epoch": 4.4495096739994695, | |
| "grad_norm": 0.6495283842086792, | |
| "learning_rate": 7.999635966508917e-05, | |
| "loss": 8.637254638671875, | |
| "num_input_tokens_seen": 17188864, | |
| "step": 4200, | |
| "train_runtime": 8448.7845, | |
| "train_tokens_per_second": 2034.478 | |
| }, | |
| { | |
| "epoch": 4.502517890272992, | |
| "grad_norm": 0.7096723318099976, | |
| "learning_rate": 7.726610848198033e-05, | |
| "loss": 8.743385009765625, | |
| "num_input_tokens_seen": 17393664, | |
| "step": 4250, | |
| "train_runtime": 8540.0931, | |
| "train_tokens_per_second": 2036.707 | |
| }, | |
| { | |
| "epoch": 4.555526106546514, | |
| "grad_norm": 0.6975917816162109, | |
| "learning_rate": 7.453585729887149e-05, | |
| "loss": 8.73980224609375, | |
| "num_input_tokens_seen": 17598464, | |
| "step": 4300, | |
| "train_runtime": 8631.8018, | |
| "train_tokens_per_second": 2038.794 | |
| }, | |
| { | |
| "epoch": 4.608534322820037, | |
| "grad_norm": 0.6756250262260437, | |
| "learning_rate": 7.180560611576264e-05, | |
| "loss": 8.648682250976563, | |
| "num_input_tokens_seen": 17803264, | |
| "step": 4350, | |
| "train_runtime": 8723.0816, | |
| "train_tokens_per_second": 2040.937 | |
| }, | |
| { | |
| "epoch": 4.66154253909356, | |
| "grad_norm": 0.6954464912414551, | |
| "learning_rate": 6.90753549326538e-05, | |
| "loss": 8.505289916992188, | |
| "num_input_tokens_seen": 18008064, | |
| "step": 4400, | |
| "train_runtime": 8814.4396, | |
| "train_tokens_per_second": 2043.019 | |
| }, | |
| { | |
| "epoch": 4.714550755367082, | |
| "grad_norm": 0.7037732005119324, | |
| "learning_rate": 6.634510374954495e-05, | |
| "loss": 8.64231201171875, | |
| "num_input_tokens_seen": 18212864, | |
| "step": 4450, | |
| "train_runtime": 8905.8242, | |
| "train_tokens_per_second": 2045.051 | |
| }, | |
| { | |
| "epoch": 4.767558971640605, | |
| "grad_norm": 0.7270088195800781, | |
| "learning_rate": 6.361485256643611e-05, | |
| "loss": 8.542531127929687, | |
| "num_input_tokens_seen": 18417664, | |
| "step": 4500, | |
| "train_runtime": 8997.045, | |
| "train_tokens_per_second": 2047.079 | |
| }, | |
| { | |
| "epoch": 4.767558971640605, | |
| "eval_bleu": 4.19, | |
| "eval_chrf": 19.94, | |
| "eval_loss": 1.844648003578186, | |
| "eval_runtime": 85.4507, | |
| "eval_samples_per_second": 3.569, | |
| "eval_steps_per_second": 1.791, | |
| "num_input_tokens_seen": 18417664, | |
| "step": 4500 | |
| }, | |
| { | |
| "epoch": 4.8205671879141265, | |
| "grad_norm": 0.8335739374160767, | |
| "learning_rate": 6.088460138332727e-05, | |
| "loss": 8.696432495117188, | |
| "num_input_tokens_seen": 18622464, | |
| "step": 4550, | |
| "train_runtime": 9187.0284, | |
| "train_tokens_per_second": 2027.039 | |
| }, | |
| { | |
| "epoch": 4.873575404187649, | |
| "grad_norm": 0.6931884288787842, | |
| "learning_rate": 5.815435020021841e-05, | |
| "loss": 8.64121826171875, | |
| "num_input_tokens_seen": 18827264, | |
| "step": 4600, | |
| "train_runtime": 9278.849, | |
| "train_tokens_per_second": 2029.052 | |
| }, | |
| { | |
| "epoch": 4.926583620461171, | |
| "grad_norm": 0.6581870317459106, | |
| "learning_rate": 5.5424099017109565e-05, | |
| "loss": 8.625559692382813, | |
| "num_input_tokens_seen": 19032064, | |
| "step": 4650, | |
| "train_runtime": 9370.2629, | |
| "train_tokens_per_second": 2031.113 | |
| }, | |
| { | |
| "epoch": 4.979591836734694, | |
| "grad_norm": 0.6969789266586304, | |
| "learning_rate": 5.2693847834000724e-05, | |
| "loss": 8.7086279296875, | |
| "num_input_tokens_seen": 19236864, | |
| "step": 4700, | |
| "train_runtime": 9461.717, | |
| "train_tokens_per_second": 2033.126 | |
| }, | |
| { | |
| "epoch": 5.031804929764114, | |
| "grad_norm": 0.7297267317771912, | |
| "learning_rate": 4.9963596650891877e-05, | |
| "loss": 8.405086059570312, | |
| "num_input_tokens_seen": 19438080, | |
| "step": 4750, | |
| "train_runtime": 9552.1329, | |
| "train_tokens_per_second": 2034.947 | |
| }, | |
| { | |
| "epoch": 5.084813146037636, | |
| "grad_norm": 0.6402953863143921, | |
| "learning_rate": 4.723334546778303e-05, | |
| "loss": 8.690524291992187, | |
| "num_input_tokens_seen": 19642880, | |
| "step": 4800, | |
| "train_runtime": 9643.5906, | |
| "train_tokens_per_second": 2036.884 | |
| }, | |
| { | |
| "epoch": 5.137821362311159, | |
| "grad_norm": 0.6262202262878418, | |
| "learning_rate": 4.450309428467419e-05, | |
| "loss": 8.471676635742188, | |
| "num_input_tokens_seen": 19847680, | |
| "step": 4850, | |
| "train_runtime": 9735.0779, | |
| "train_tokens_per_second": 2038.78 | |
| }, | |
| { | |
| "epoch": 5.1908295785846805, | |
| "grad_norm": 0.6598888039588928, | |
| "learning_rate": 4.177284310156534e-05, | |
| "loss": 8.572631225585937, | |
| "num_input_tokens_seen": 20052480, | |
| "step": 4900, | |
| "train_runtime": 9826.6555, | |
| "train_tokens_per_second": 2040.621 | |
| }, | |
| { | |
| "epoch": 5.243837794858203, | |
| "grad_norm": 0.7225948572158813, | |
| "learning_rate": 3.90425919184565e-05, | |
| "loss": 8.642888793945312, | |
| "num_input_tokens_seen": 20257280, | |
| "step": 4950, | |
| "train_runtime": 9918.0414, | |
| "train_tokens_per_second": 2042.468 | |
| }, | |
| { | |
| "epoch": 5.296846011131725, | |
| "grad_norm": 0.6872982382774353, | |
| "learning_rate": 3.6312340735347646e-05, | |
| "loss": 8.432411499023438, | |
| "num_input_tokens_seen": 20462080, | |
| "step": 5000, | |
| "train_runtime": 10009.6849, | |
| "train_tokens_per_second": 2044.228 | |
| }, | |
| { | |
| "epoch": 5.296846011131725, | |
| "eval_bleu": 4.09, | |
| "eval_chrf": 19.82, | |
| "eval_loss": 1.841970443725586, | |
| "eval_runtime": 86.237, | |
| "eval_samples_per_second": 3.537, | |
| "eval_steps_per_second": 1.774, | |
| "num_input_tokens_seen": 20462080, | |
| "step": 5000 | |
| }, | |
| { | |
| "epoch": 5.349854227405248, | |
| "grad_norm": 0.6799459457397461, | |
| "learning_rate": 3.3582089552238805e-05, | |
| "loss": 8.610306396484376, | |
| "num_input_tokens_seen": 20666880, | |
| "step": 5050, | |
| "train_runtime": 10200.4654, | |
| "train_tokens_per_second": 2026.072 | |
| }, | |
| { | |
| "epoch": 5.40286244367877, | |
| "grad_norm": 0.6314374804496765, | |
| "learning_rate": 3.085183836912996e-05, | |
| "loss": 8.522672119140625, | |
| "num_input_tokens_seen": 20871680, | |
| "step": 5100, | |
| "train_runtime": 10292.3344, | |
| "train_tokens_per_second": 2027.886 | |
| }, | |
| { | |
| "epoch": 5.455870659952293, | |
| "grad_norm": 0.6840763688087463, | |
| "learning_rate": 2.812158718602111e-05, | |
| "loss": 8.5241162109375, | |
| "num_input_tokens_seen": 21076480, | |
| "step": 5150, | |
| "train_runtime": 10384.0278, | |
| "train_tokens_per_second": 2029.702 | |
| }, | |
| { | |
| "epoch": 5.508878876225815, | |
| "grad_norm": 0.7108559608459473, | |
| "learning_rate": 2.5391336002912266e-05, | |
| "loss": 8.657234497070313, | |
| "num_input_tokens_seen": 21281280, | |
| "step": 5200, | |
| "train_runtime": 10475.6603, | |
| "train_tokens_per_second": 2031.498 | |
| }, | |
| { | |
| "epoch": 5.5618870924993375, | |
| "grad_norm": 0.7527778148651123, | |
| "learning_rate": 2.266108481980342e-05, | |
| "loss": 8.60021240234375, | |
| "num_input_tokens_seen": 21486080, | |
| "step": 5250, | |
| "train_runtime": 10567.164, | |
| "train_tokens_per_second": 2033.287 | |
| }, | |
| { | |
| "epoch": 5.6148953087728595, | |
| "grad_norm": 0.647541880607605, | |
| "learning_rate": 1.993083363669457e-05, | |
| "loss": 8.624324951171875, | |
| "num_input_tokens_seen": 21690880, | |
| "step": 5300, | |
| "train_runtime": 10658.6905, | |
| "train_tokens_per_second": 2035.042 | |
| }, | |
| { | |
| "epoch": 5.667903525046382, | |
| "grad_norm": 0.5897159576416016, | |
| "learning_rate": 1.7200582453585727e-05, | |
| "loss": 8.644212646484375, | |
| "num_input_tokens_seen": 21895680, | |
| "step": 5350, | |
| "train_runtime": 10750.2076, | |
| "train_tokens_per_second": 2036.768 | |
| }, | |
| { | |
| "epoch": 5.720911741319904, | |
| "grad_norm": 0.6161897778511047, | |
| "learning_rate": 1.4470331270476882e-05, | |
| "loss": 8.561669311523438, | |
| "num_input_tokens_seen": 22100480, | |
| "step": 5400, | |
| "train_runtime": 10841.7811, | |
| "train_tokens_per_second": 2038.455 | |
| }, | |
| { | |
| "epoch": 5.773919957593427, | |
| "grad_norm": 0.6419637799263, | |
| "learning_rate": 1.1740080087368037e-05, | |
| "loss": 8.653330688476563, | |
| "num_input_tokens_seen": 22305280, | |
| "step": 5450, | |
| "train_runtime": 10933.2667, | |
| "train_tokens_per_second": 2040.13 | |
| }, | |
| { | |
| "epoch": 5.82692817386695, | |
| "grad_norm": 0.6721702218055725, | |
| "learning_rate": 9.00982890425919e-06, | |
| "loss": 8.615657348632812, | |
| "num_input_tokens_seen": 22510080, | |
| "step": 5500, | |
| "train_runtime": 11024.7165, | |
| "train_tokens_per_second": 2041.783 | |
| }, | |
| { | |
| "epoch": 5.82692817386695, | |
| "eval_bleu": 4.19, | |
| "eval_chrf": 20.05, | |
| "eval_loss": 1.8417972326278687, | |
| "eval_runtime": 86.5279, | |
| "eval_samples_per_second": 3.525, | |
| "eval_steps_per_second": 1.768, | |
| "num_input_tokens_seen": 22510080, | |
| "step": 5500 | |
| }, | |
| { | |
| "epoch": 5.879936390140472, | |
| "grad_norm": 0.7171221375465393, | |
| "learning_rate": 6.279577721150346e-06, | |
| "loss": 8.624059448242187, | |
| "num_input_tokens_seen": 22714880, | |
| "step": 5550, | |
| "train_runtime": 11215.8439, | |
| "train_tokens_per_second": 2025.249 | |
| }, | |
| { | |
| "epoch": 5.932944606413994, | |
| "grad_norm": 0.6685547232627869, | |
| "learning_rate": 3.549326538041499e-06, | |
| "loss": 8.639024047851562, | |
| "num_input_tokens_seen": 22919680, | |
| "step": 5600, | |
| "train_runtime": 11307.5506, | |
| "train_tokens_per_second": 2026.936 | |
| }, | |
| { | |
| "epoch": 5.9859528226875165, | |
| "grad_norm": 0.6983809471130371, | |
| "learning_rate": 8.190753549326538e-07, | |
| "loss": 8.527723388671875, | |
| "num_input_tokens_seen": 23124480, | |
| "step": 5650, | |
| "train_runtime": 11399.0902, | |
| "train_tokens_per_second": 2028.625 | |
| }, | |
| { | |
| "epoch": 6.0, | |
| "num_input_tokens_seen": 23178240, | |
| "step": 5664, | |
| "total_flos": 4.229533786963968e+16, | |
| "train_loss": 8.868080515309241, | |
| "train_runtime": 11434.2452, | |
| "train_samples_per_second": 15.837, | |
| "train_steps_per_second": 0.495 | |
| } | |
| ], | |
| "logging_steps": 50, | |
| "max_steps": 5664, | |
| "num_input_tokens_seen": 23178240, | |
| "num_train_epochs": 6, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 4.229533786963968e+16, | |
| "train_batch_size": 8, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |