{ "best_global_step": 5500, "best_metric": 1.8417972326278687, "best_model_checkpoint": "/kaggle/working/checkpoints/checkpoint-5500", "epoch": 6.0, "eval_steps": 500, "global_step": 5664, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0010601643254704478, "grad_norm": 0.8187403082847595, "learning_rate": 0.0, "loss": 10.509103775024414, "num_input_tokens_seen": 4096, "step": 1, "train_runtime": 4.0328, "train_tokens_per_second": 1015.678 }, { "epoch": 0.053008216273522396, "grad_norm": 0.7271436452865601, "learning_rate": 8.64705882352941e-05, "loss": 9.653437400350766, "num_input_tokens_seen": 204800, "step": 50, "train_runtime": 85.0317, "train_tokens_per_second": 2408.514 }, { "epoch": 0.10601643254704479, "grad_norm": 0.6869716644287109, "learning_rate": 0.00017470588235294116, "loss": 9.471989135742188, "num_input_tokens_seen": 409600, "step": 100, "train_runtime": 176.2658, "train_tokens_per_second": 2323.764 }, { "epoch": 0.1590246488205672, "grad_norm": 0.6832960247993469, "learning_rate": 0.0002629411764705882, "loss": 9.664740600585937, "num_input_tokens_seen": 614400, "step": 150, "train_runtime": 267.3416, "train_tokens_per_second": 2298.183 }, { "epoch": 0.21203286509408958, "grad_norm": 0.6674580574035645, "learning_rate": 0.00029841645431379684, "loss": 9.3196337890625, "num_input_tokens_seen": 819200, "step": 200, "train_runtime": 358.4777, "train_tokens_per_second": 2285.219 }, { "epoch": 0.26504108136761195, "grad_norm": 0.6817887425422668, "learning_rate": 0.00029568620313068797, "loss": 9.44159423828125, "num_input_tokens_seen": 1024000, "step": 250, "train_runtime": 449.5642, "train_tokens_per_second": 2277.761 }, { "epoch": 0.3180492976411344, "grad_norm": 0.6933718919754028, "learning_rate": 0.00029295595194757916, "loss": 9.353170776367188, "num_input_tokens_seen": 1228800, "step": 300, "train_runtime": 540.6374, "train_tokens_per_second": 2272.873 }, { "epoch": 0.37105751391465674, "grad_norm": 0.6354528069496155, "learning_rate": 0.0002902257007644703, "loss": 9.46597900390625, "num_input_tokens_seen": 1433600, "step": 350, "train_runtime": 631.7827, "train_tokens_per_second": 2269.135 }, { "epoch": 0.42406573018817917, "grad_norm": 0.6813943982124329, "learning_rate": 0.0002874954495813615, "loss": 9.3445703125, "num_input_tokens_seen": 1638400, "step": 400, "train_runtime": 722.6411, "train_tokens_per_second": 2267.239 }, { "epoch": 0.47707394646170154, "grad_norm": 0.5886964797973633, "learning_rate": 0.0002847651983982526, "loss": 9.338291625976563, "num_input_tokens_seen": 1843200, "step": 450, "train_runtime": 813.7385, "train_tokens_per_second": 2265.101 }, { "epoch": 0.5300821627352239, "grad_norm": 0.6884158849716187, "learning_rate": 0.0002820349472151438, "loss": 9.193983764648438, "num_input_tokens_seen": 2048000, "step": 500, "train_runtime": 904.7321, "train_tokens_per_second": 2263.653 }, { "epoch": 0.5300821627352239, "eval_bleu": 4.06, "eval_chrf": 19.66, "eval_loss": 1.8984475135803223, "eval_runtime": 87.1763, "eval_samples_per_second": 3.499, "eval_steps_per_second": 1.755, "num_input_tokens_seen": 2048000, "step": 500 }, { "epoch": 0.5830903790087464, "grad_norm": 0.6719595193862915, "learning_rate": 0.0002793046960320349, "loss": 9.386028442382813, "num_input_tokens_seen": 2252800, "step": 550, "train_runtime": 1094.9482, "train_tokens_per_second": 2057.449 }, { "epoch": 0.6360985952822688, "grad_norm": 0.6773673295974731, "learning_rate": 0.00027657444484892606, "loss": 9.26089599609375, "num_input_tokens_seen": 2457600, "step": 600, "train_runtime": 1186.45, "train_tokens_per_second": 2071.389 }, { "epoch": 0.6891068115557911, "grad_norm": 0.6533596515655518, "learning_rate": 0.00027384419366581725, "loss": 9.2549658203125, "num_input_tokens_seen": 2662400, "step": 650, "train_runtime": 1277.7875, "train_tokens_per_second": 2083.602 }, { "epoch": 0.7421150278293135, "grad_norm": 0.6407659649848938, "learning_rate": 0.0002711139424827084, "loss": 9.27232666015625, "num_input_tokens_seen": 2867200, "step": 700, "train_runtime": 1369.0819, "train_tokens_per_second": 2094.25 }, { "epoch": 0.795123244102836, "grad_norm": 0.7818734645843506, "learning_rate": 0.00026838369129959956, "loss": 9.223333740234375, "num_input_tokens_seen": 3072000, "step": 750, "train_runtime": 1460.1534, "train_tokens_per_second": 2103.889 }, { "epoch": 0.8481314603763583, "grad_norm": 0.6569114923477173, "learning_rate": 0.0002656534401164907, "loss": 9.193381958007812, "num_input_tokens_seen": 3276800, "step": 800, "train_runtime": 1551.22, "train_tokens_per_second": 2112.402 }, { "epoch": 0.9011396766498807, "grad_norm": 0.7116767168045044, "learning_rate": 0.0002629231889333819, "loss": 9.336693115234375, "num_input_tokens_seen": 3481600, "step": 850, "train_runtime": 1642.3679, "train_tokens_per_second": 2119.866 }, { "epoch": 0.9541478929234031, "grad_norm": 0.64178466796875, "learning_rate": 0.000260192937750273, "loss": 9.349353637695312, "num_input_tokens_seen": 3686400, "step": 900, "train_runtime": 1733.6186, "train_tokens_per_second": 2126.419 }, { "epoch": 1.0063609859528226, "grad_norm": 0.6793839931488037, "learning_rate": 0.00025746268656716415, "loss": 9.190228271484376, "num_input_tokens_seen": 3887616, "step": 950, "train_runtime": 1823.6521, "train_tokens_per_second": 2131.775 }, { "epoch": 1.059369202226345, "grad_norm": 0.6120585799217224, "learning_rate": 0.00025473243538405533, "loss": 8.995220336914063, "num_input_tokens_seen": 4092416, "step": 1000, "train_runtime": 1914.9217, "train_tokens_per_second": 2137.119 }, { "epoch": 1.059369202226345, "eval_bleu": 4.04, "eval_chrf": 19.54, "eval_loss": 1.8891278505325317, "eval_runtime": 84.89, "eval_samples_per_second": 3.593, "eval_steps_per_second": 1.802, "num_input_tokens_seen": 4092416, "step": 1000 }, { "epoch": 1.1123774184998674, "grad_norm": 0.6622714996337891, "learning_rate": 0.00025200218420094646, "loss": 9.169678955078124, "num_input_tokens_seen": 4297216, "step": 1050, "train_runtime": 2104.4734, "train_tokens_per_second": 2041.944 }, { "epoch": 1.16538563477339, "grad_norm": 0.6801309585571289, "learning_rate": 0.00024927193301783765, "loss": 9.108585205078125, "num_input_tokens_seen": 4502016, "step": 1100, "train_runtime": 2195.9257, "train_tokens_per_second": 2050.168 }, { "epoch": 1.2183938510469123, "grad_norm": 0.6843289732933044, "learning_rate": 0.0002465416818347288, "loss": 9.04650146484375, "num_input_tokens_seen": 4706816, "step": 1150, "train_runtime": 2287.3334, "train_tokens_per_second": 2057.774 }, { "epoch": 1.2714020673204347, "grad_norm": 0.6618881821632385, "learning_rate": 0.00024381143065161994, "loss": 9.0776953125, "num_input_tokens_seen": 4911616, "step": 1200, "train_runtime": 2378.5524, "train_tokens_per_second": 2064.96 }, { "epoch": 1.324410283593957, "grad_norm": 0.7164718508720398, "learning_rate": 0.00024108117946851107, "loss": 9.070903930664063, "num_input_tokens_seen": 5116416, "step": 1250, "train_runtime": 2470.0729, "train_tokens_per_second": 2071.362 }, { "epoch": 1.3774184998674794, "grad_norm": 0.703388512134552, "learning_rate": 0.00023835092828540223, "loss": 9.000114135742187, "num_input_tokens_seen": 5321216, "step": 1300, "train_runtime": 2561.2113, "train_tokens_per_second": 2077.617 }, { "epoch": 1.4304267161410018, "grad_norm": 0.6863468289375305, "learning_rate": 0.00023562067710229337, "loss": 9.03710693359375, "num_input_tokens_seen": 5526016, "step": 1350, "train_runtime": 2652.4931, "train_tokens_per_second": 2083.329 }, { "epoch": 1.4834349324145242, "grad_norm": 0.681918740272522, "learning_rate": 0.00023289042591918453, "loss": 9.07092529296875, "num_input_tokens_seen": 5730816, "step": 1400, "train_runtime": 2743.7676, "train_tokens_per_second": 2088.667 }, { "epoch": 1.5364431486880465, "grad_norm": 0.6488898396492004, "learning_rate": 0.00023016017473607568, "loss": 9.12448974609375, "num_input_tokens_seen": 5935616, "step": 1450, "train_runtime": 2835.0135, "train_tokens_per_second": 2093.682 }, { "epoch": 1.589451364961569, "grad_norm": 0.629993736743927, "learning_rate": 0.00022742992355296684, "loss": 8.988504638671875, "num_input_tokens_seen": 6140416, "step": 1500, "train_runtime": 2926.1673, "train_tokens_per_second": 2098.45 }, { "epoch": 1.589451364961569, "eval_bleu": 4.15, "eval_chrf": 19.86, "eval_loss": 1.8749940395355225, "eval_runtime": 85.3123, "eval_samples_per_second": 3.575, "eval_steps_per_second": 1.793, "num_input_tokens_seen": 6140416, "step": 1500 }, { "epoch": 1.6424595812350913, "grad_norm": 0.6674344539642334, "learning_rate": 0.000224699672369858, "loss": 9.002008056640625, "num_input_tokens_seen": 6345216, "step": 1550, "train_runtime": 3115.9795, "train_tokens_per_second": 2036.347 }, { "epoch": 1.6954677975086139, "grad_norm": 0.6869524717330933, "learning_rate": 0.00022196942118674916, "loss": 9.157560424804688, "num_input_tokens_seen": 6550016, "step": 1600, "train_runtime": 3207.373, "train_tokens_per_second": 2042.175 }, { "epoch": 1.7484760137821362, "grad_norm": 0.661709725856781, "learning_rate": 0.0002192391700036403, "loss": 9.031039428710937, "num_input_tokens_seen": 6754816, "step": 1650, "train_runtime": 3298.7999, "train_tokens_per_second": 2047.659 }, { "epoch": 1.8014842300556586, "grad_norm": 0.6780179738998413, "learning_rate": 0.00021650891882053145, "loss": 9.039593505859376, "num_input_tokens_seen": 6959616, "step": 1700, "train_runtime": 3390.0711, "train_tokens_per_second": 2052.941 }, { "epoch": 1.854492446329181, "grad_norm": 0.700842022895813, "learning_rate": 0.0002137786676374226, "loss": 8.978927612304688, "num_input_tokens_seen": 7164416, "step": 1750, "train_runtime": 3481.1155, "train_tokens_per_second": 2058.081 }, { "epoch": 1.9075006626027036, "grad_norm": 0.6786106824874878, "learning_rate": 0.00021104841645431377, "loss": 9.08431396484375, "num_input_tokens_seen": 7369216, "step": 1800, "train_runtime": 3572.2502, "train_tokens_per_second": 2062.906 }, { "epoch": 1.960508878876226, "grad_norm": 0.6586954593658447, "learning_rate": 0.00020831816527120493, "loss": 9.029188232421875, "num_input_tokens_seen": 7574016, "step": 1850, "train_runtime": 3663.5445, "train_tokens_per_second": 2067.401 }, { "epoch": 2.0127219719056453, "grad_norm": 0.7223443388938904, "learning_rate": 0.0002055879140880961, "loss": 8.716483764648437, "num_input_tokens_seen": 7775232, "step": 1900, "train_runtime": 3753.5921, "train_tokens_per_second": 2071.411 }, { "epoch": 2.0657301881791676, "grad_norm": 0.6501656770706177, "learning_rate": 0.00020285766290498725, "loss": 8.858229370117188, "num_input_tokens_seen": 7980032, "step": 1950, "train_runtime": 3844.9155, "train_tokens_per_second": 2075.477 }, { "epoch": 2.11873840445269, "grad_norm": 0.6163517236709595, "learning_rate": 0.00020012741172187838, "loss": 8.852374267578124, "num_input_tokens_seen": 8184832, "step": 2000, "train_runtime": 3936.2252, "train_tokens_per_second": 2079.361 }, { "epoch": 2.11873840445269, "eval_bleu": 4.07, "eval_chrf": 19.95, "eval_loss": 1.8687856197357178, "eval_runtime": 85.2414, "eval_samples_per_second": 3.578, "eval_steps_per_second": 1.795, "num_input_tokens_seen": 8184832, "step": 2000 }, { "epoch": 2.1717466207262124, "grad_norm": 0.6511809825897217, "learning_rate": 0.00019739716053876954, "loss": 8.9257958984375, "num_input_tokens_seen": 8389632, "step": 2050, "train_runtime": 4126.538, "train_tokens_per_second": 2033.092 }, { "epoch": 2.2247548369997348, "grad_norm": 0.6239650249481201, "learning_rate": 0.0001946669093556607, "loss": 8.875814208984375, "num_input_tokens_seen": 8594432, "step": 2100, "train_runtime": 4217.9271, "train_tokens_per_second": 2037.596 }, { "epoch": 2.277763053273257, "grad_norm": 0.6986948847770691, "learning_rate": 0.00019193665817255186, "loss": 8.9848681640625, "num_input_tokens_seen": 8799232, "step": 2150, "train_runtime": 4309.2527, "train_tokens_per_second": 2041.939 }, { "epoch": 2.33077126954678, "grad_norm": 0.6011477708816528, "learning_rate": 0.00018920640698944302, "loss": 8.912135620117187, "num_input_tokens_seen": 9004032, "step": 2200, "train_runtime": 4400.5936, "train_tokens_per_second": 2046.095 }, { "epoch": 2.3837794858203023, "grad_norm": 0.7250493764877319, "learning_rate": 0.00018647615580633418, "loss": 8.793685913085938, "num_input_tokens_seen": 9208832, "step": 2250, "train_runtime": 4492.0003, "train_tokens_per_second": 2050.052 }, { "epoch": 2.4367877020938247, "grad_norm": 0.6375405788421631, "learning_rate": 0.00018374590462322534, "loss": 8.844403076171876, "num_input_tokens_seen": 9413632, "step": 2300, "train_runtime": 4583.4122, "train_tokens_per_second": 2053.848 }, { "epoch": 2.489795918367347, "grad_norm": 0.6628595590591431, "learning_rate": 0.00018101565344011647, "loss": 8.734286499023437, "num_input_tokens_seen": 9618432, "step": 2350, "train_runtime": 4674.7698, "train_tokens_per_second": 2057.52 }, { "epoch": 2.5428041346408694, "grad_norm": 0.6868587136268616, "learning_rate": 0.00017828540225700763, "loss": 8.970186157226562, "num_input_tokens_seen": 9823232, "step": 2400, "train_runtime": 4765.9951, "train_tokens_per_second": 2061.108 }, { "epoch": 2.5958123509143918, "grad_norm": 0.6495867371559143, "learning_rate": 0.0001755551510738988, "loss": 8.924597778320312, "num_input_tokens_seen": 10028032, "step": 2450, "train_runtime": 4857.2206, "train_tokens_per_second": 2064.562 }, { "epoch": 2.648820567187914, "grad_norm": 0.7620416283607483, "learning_rate": 0.00017282489989078995, "loss": 8.905831298828126, "num_input_tokens_seen": 10232832, "step": 2500, "train_runtime": 4948.5715, "train_tokens_per_second": 2067.836 }, { "epoch": 2.648820567187914, "eval_bleu": 4.05, "eval_chrf": 19.71, "eval_loss": 1.8576197624206543, "eval_runtime": 85.4771, "eval_samples_per_second": 3.568, "eval_steps_per_second": 1.79, "num_input_tokens_seen": 10232832, "step": 2500 }, { "epoch": 2.7018287834614365, "grad_norm": 0.7461215853691101, "learning_rate": 0.0001700946487076811, "loss": 8.890812377929688, "num_input_tokens_seen": 10437632, "step": 2550, "train_runtime": 5138.677, "train_tokens_per_second": 2031.191 }, { "epoch": 2.754836999734959, "grad_norm": 0.6335775256156921, "learning_rate": 0.00016736439752457227, "loss": 8.868407592773437, "num_input_tokens_seen": 10642432, "step": 2600, "train_runtime": 5230.3092, "train_tokens_per_second": 2034.762 }, { "epoch": 2.8078452160084812, "grad_norm": 0.6892751455307007, "learning_rate": 0.00016463414634146343, "loss": 8.848526000976562, "num_input_tokens_seen": 10847232, "step": 2650, "train_runtime": 5321.7199, "train_tokens_per_second": 2038.294 }, { "epoch": 2.8608534322820036, "grad_norm": 0.7833438515663147, "learning_rate": 0.00016190389515835456, "loss": 8.842973022460937, "num_input_tokens_seen": 11052032, "step": 2700, "train_runtime": 5413.0681, "train_tokens_per_second": 2041.732 }, { "epoch": 2.913861648555526, "grad_norm": 0.7217938303947449, "learning_rate": 0.00015917364397524572, "loss": 8.9160205078125, "num_input_tokens_seen": 11256832, "step": 2750, "train_runtime": 5504.4642, "train_tokens_per_second": 2045.037 }, { "epoch": 2.9668698648290484, "grad_norm": 0.625913143157959, "learning_rate": 0.00015644339279213688, "loss": 8.780228271484376, "num_input_tokens_seen": 11461632, "step": 2800, "train_runtime": 5595.8294, "train_tokens_per_second": 2048.245 }, { "epoch": 3.019082957858468, "grad_norm": 0.686261773109436, "learning_rate": 0.000153713141609028, "loss": 8.62293212890625, "num_input_tokens_seen": 11662848, "step": 2850, "train_runtime": 5686.1951, "train_tokens_per_second": 2051.081 }, { "epoch": 3.0720911741319905, "grad_norm": 0.7150633335113525, "learning_rate": 0.00015098289042591917, "loss": 8.857227783203125, "num_input_tokens_seen": 11867648, "step": 2900, "train_runtime": 5777.4806, "train_tokens_per_second": 2054.122 }, { "epoch": 3.125099390405513, "grad_norm": 0.7594448328018188, "learning_rate": 0.00014825263924281033, "loss": 8.733943481445312, "num_input_tokens_seen": 12072448, "step": 2950, "train_runtime": 5868.7816, "train_tokens_per_second": 2057.062 }, { "epoch": 3.1781076066790352, "grad_norm": 0.6436108946800232, "learning_rate": 0.00014552238805970149, "loss": 8.650802612304688, "num_input_tokens_seen": 12277248, "step": 3000, "train_runtime": 5960.2675, "train_tokens_per_second": 2059.848 }, { "epoch": 3.1781076066790352, "eval_bleu": 4.2, "eval_chrf": 19.81, "eval_loss": 1.8580111265182495, "eval_runtime": 85.4127, "eval_samples_per_second": 3.571, "eval_steps_per_second": 1.791, "num_input_tokens_seen": 12277248, "step": 3000 }, { "epoch": 3.2311158229525576, "grad_norm": 0.6634842753410339, "learning_rate": 0.00014279213687659265, "loss": 8.697005615234374, "num_input_tokens_seen": 12482048, "step": 3050, "train_runtime": 6151.2346, "train_tokens_per_second": 2029.194 }, { "epoch": 3.28412403922608, "grad_norm": 0.7246391773223877, "learning_rate": 0.0001400618856934838, "loss": 8.7168359375, "num_input_tokens_seen": 12686848, "step": 3100, "train_runtime": 6242.7027, "train_tokens_per_second": 2032.268 }, { "epoch": 3.3371322554996024, "grad_norm": 0.6836341023445129, "learning_rate": 0.00013733163451037494, "loss": 8.65872802734375, "num_input_tokens_seen": 12891648, "step": 3150, "train_runtime": 6333.8948, "train_tokens_per_second": 2035.343 }, { "epoch": 3.3901404717731247, "grad_norm": 0.7036194801330566, "learning_rate": 0.0001346013833272661, "loss": 8.667957763671875, "num_input_tokens_seen": 13096448, "step": 3200, "train_runtime": 6425.2484, "train_tokens_per_second": 2038.279 }, { "epoch": 3.443148688046647, "grad_norm": 0.7401408553123474, "learning_rate": 0.00013187113214415725, "loss": 8.828726806640624, "num_input_tokens_seen": 13301248, "step": 3250, "train_runtime": 6516.5209, "train_tokens_per_second": 2041.158 }, { "epoch": 3.4961569043201695, "grad_norm": 0.735714852809906, "learning_rate": 0.0001291408809610484, "loss": 8.744295654296875, "num_input_tokens_seen": 13506048, "step": 3300, "train_runtime": 6607.8418, "train_tokens_per_second": 2043.942 }, { "epoch": 3.549165120593692, "grad_norm": 0.7713711261749268, "learning_rate": 0.00012641062977793955, "loss": 8.785454711914063, "num_input_tokens_seen": 13710848, "step": 3350, "train_runtime": 6699.3485, "train_tokens_per_second": 2046.594 }, { "epoch": 3.6021733368672146, "grad_norm": 0.6046838760375977, "learning_rate": 0.0001236803785948307, "loss": 8.79681884765625, "num_input_tokens_seen": 13915648, "step": 3400, "train_runtime": 6790.6621, "train_tokens_per_second": 2049.233 }, { "epoch": 3.6551815531407366, "grad_norm": 0.7195361852645874, "learning_rate": 0.00012095012741172186, "loss": 8.713923950195312, "num_input_tokens_seen": 14120448, "step": 3450, "train_runtime": 6881.9777, "train_tokens_per_second": 2051.801 }, { "epoch": 3.7081897694142594, "grad_norm": 0.6607725620269775, "learning_rate": 0.00011821987622861302, "loss": 8.707265014648437, "num_input_tokens_seen": 14325248, "step": 3500, "train_runtime": 6973.3252, "train_tokens_per_second": 2054.292 }, { "epoch": 3.7081897694142594, "eval_bleu": 4.18, "eval_chrf": 19.91, "eval_loss": 1.8520567417144775, "eval_runtime": 85.3221, "eval_samples_per_second": 3.575, "eval_steps_per_second": 1.793, "num_input_tokens_seen": 14325248, "step": 3500 }, { "epoch": 3.7611979856877817, "grad_norm": 0.7562373876571655, "learning_rate": 0.00011548962504550417, "loss": 8.9096435546875, "num_input_tokens_seen": 14530048, "step": 3550, "train_runtime": 7163.8071, "train_tokens_per_second": 2028.258 }, { "epoch": 3.814206201961304, "grad_norm": 0.6998844742774963, "learning_rate": 0.00011275937386239533, "loss": 8.541333618164062, "num_input_tokens_seen": 14734848, "step": 3600, "train_runtime": 7255.3341, "train_tokens_per_second": 2030.899 }, { "epoch": 3.8672144182348265, "grad_norm": 0.7850280404090881, "learning_rate": 0.00011002912267928649, "loss": 8.79550537109375, "num_input_tokens_seen": 14939648, "step": 3650, "train_runtime": 7346.7779, "train_tokens_per_second": 2033.497 }, { "epoch": 3.920222634508349, "grad_norm": 0.6771405339241028, "learning_rate": 0.00010729887149617765, "loss": 8.66411865234375, "num_input_tokens_seen": 15144448, "step": 3700, "train_runtime": 7438.0137, "train_tokens_per_second": 2036.088 }, { "epoch": 3.973230850781871, "grad_norm": 0.6406344771385193, "learning_rate": 0.0001045686203130688, "loss": 8.713903198242187, "num_input_tokens_seen": 15349248, "step": 3750, "train_runtime": 7529.334, "train_tokens_per_second": 2038.593 }, { "epoch": 4.025443943811291, "grad_norm": 0.6602168679237366, "learning_rate": 0.00010183836912995995, "loss": 8.64723388671875, "num_input_tokens_seen": 15550464, "step": 3800, "train_runtime": 7619.5214, "train_tokens_per_second": 2040.871 }, { "epoch": 4.078452160084813, "grad_norm": 0.6122914552688599, "learning_rate": 9.910811794685111e-05, "loss": 8.693761596679687, "num_input_tokens_seen": 15755264, "step": 3850, "train_runtime": 7710.944, "train_tokens_per_second": 2043.234 }, { "epoch": 4.131460376358335, "grad_norm": 0.6196545958518982, "learning_rate": 9.637786676374226e-05, "loss": 8.59835693359375, "num_input_tokens_seen": 15960064, "step": 3900, "train_runtime": 7802.3986, "train_tokens_per_second": 2045.533 }, { "epoch": 4.184468592631858, "grad_norm": 0.7231429815292358, "learning_rate": 9.364761558063342e-05, "loss": 8.621876831054687, "num_input_tokens_seen": 16164864, "step": 3950, "train_runtime": 7893.7536, "train_tokens_per_second": 2047.804 }, { "epoch": 4.23747680890538, "grad_norm": 0.6612716913223267, "learning_rate": 9.091736439752458e-05, "loss": 8.63590087890625, "num_input_tokens_seen": 16369664, "step": 4000, "train_runtime": 7985.1156, "train_tokens_per_second": 2050.022 }, { "epoch": 4.23747680890538, "eval_bleu": 4.17, "eval_chrf": 20.0, "eval_loss": 1.8474465608596802, "eval_runtime": 85.4899, "eval_samples_per_second": 3.568, "eval_steps_per_second": 1.79, "num_input_tokens_seen": 16369664, "step": 4000 }, { "epoch": 4.290485025178903, "grad_norm": 0.611146092414856, "learning_rate": 8.818711321441571e-05, "loss": 8.60938720703125, "num_input_tokens_seen": 16574464, "step": 4050, "train_runtime": 8174.4094, "train_tokens_per_second": 2027.604 }, { "epoch": 4.343493241452425, "grad_norm": 0.6369199156761169, "learning_rate": 8.545686203130687e-05, "loss": 8.630716552734375, "num_input_tokens_seen": 16779264, "step": 4100, "train_runtime": 8265.9997, "train_tokens_per_second": 2029.913 }, { "epoch": 4.396501457725948, "grad_norm": 0.6628316044807434, "learning_rate": 8.272661084819803e-05, "loss": 8.668856811523437, "num_input_tokens_seen": 16984064, "step": 4150, "train_runtime": 8357.3474, "train_tokens_per_second": 2032.231 }, { "epoch": 4.4495096739994695, "grad_norm": 0.6495283842086792, "learning_rate": 7.999635966508917e-05, "loss": 8.637254638671875, "num_input_tokens_seen": 17188864, "step": 4200, "train_runtime": 8448.7845, "train_tokens_per_second": 2034.478 }, { "epoch": 4.502517890272992, "grad_norm": 0.7096723318099976, "learning_rate": 7.726610848198033e-05, "loss": 8.743385009765625, "num_input_tokens_seen": 17393664, "step": 4250, "train_runtime": 8540.0931, "train_tokens_per_second": 2036.707 }, { "epoch": 4.555526106546514, "grad_norm": 0.6975917816162109, "learning_rate": 7.453585729887149e-05, "loss": 8.73980224609375, "num_input_tokens_seen": 17598464, "step": 4300, "train_runtime": 8631.8018, "train_tokens_per_second": 2038.794 }, { "epoch": 4.608534322820037, "grad_norm": 0.6756250262260437, "learning_rate": 7.180560611576264e-05, "loss": 8.648682250976563, "num_input_tokens_seen": 17803264, "step": 4350, "train_runtime": 8723.0816, "train_tokens_per_second": 2040.937 }, { "epoch": 4.66154253909356, "grad_norm": 0.6954464912414551, "learning_rate": 6.90753549326538e-05, "loss": 8.505289916992188, "num_input_tokens_seen": 18008064, "step": 4400, "train_runtime": 8814.4396, "train_tokens_per_second": 2043.019 }, { "epoch": 4.714550755367082, "grad_norm": 0.7037732005119324, "learning_rate": 6.634510374954495e-05, "loss": 8.64231201171875, "num_input_tokens_seen": 18212864, "step": 4450, "train_runtime": 8905.8242, "train_tokens_per_second": 2045.051 }, { "epoch": 4.767558971640605, "grad_norm": 0.7270088195800781, "learning_rate": 6.361485256643611e-05, "loss": 8.542531127929687, "num_input_tokens_seen": 18417664, "step": 4500, "train_runtime": 8997.045, "train_tokens_per_second": 2047.079 }, { "epoch": 4.767558971640605, "eval_bleu": 4.19, "eval_chrf": 19.94, "eval_loss": 1.844648003578186, "eval_runtime": 85.4507, "eval_samples_per_second": 3.569, "eval_steps_per_second": 1.791, "num_input_tokens_seen": 18417664, "step": 4500 }, { "epoch": 4.8205671879141265, "grad_norm": 0.8335739374160767, "learning_rate": 6.088460138332727e-05, "loss": 8.696432495117188, "num_input_tokens_seen": 18622464, "step": 4550, "train_runtime": 9187.0284, "train_tokens_per_second": 2027.039 }, { "epoch": 4.873575404187649, "grad_norm": 0.6931884288787842, "learning_rate": 5.815435020021841e-05, "loss": 8.64121826171875, "num_input_tokens_seen": 18827264, "step": 4600, "train_runtime": 9278.849, "train_tokens_per_second": 2029.052 }, { "epoch": 4.926583620461171, "grad_norm": 0.6581870317459106, "learning_rate": 5.5424099017109565e-05, "loss": 8.625559692382813, "num_input_tokens_seen": 19032064, "step": 4650, "train_runtime": 9370.2629, "train_tokens_per_second": 2031.113 }, { "epoch": 4.979591836734694, "grad_norm": 0.6969789266586304, "learning_rate": 5.2693847834000724e-05, "loss": 8.7086279296875, "num_input_tokens_seen": 19236864, "step": 4700, "train_runtime": 9461.717, "train_tokens_per_second": 2033.126 }, { "epoch": 5.031804929764114, "grad_norm": 0.7297267317771912, "learning_rate": 4.9963596650891877e-05, "loss": 8.405086059570312, "num_input_tokens_seen": 19438080, "step": 4750, "train_runtime": 9552.1329, "train_tokens_per_second": 2034.947 }, { "epoch": 5.084813146037636, "grad_norm": 0.6402953863143921, "learning_rate": 4.723334546778303e-05, "loss": 8.690524291992187, "num_input_tokens_seen": 19642880, "step": 4800, "train_runtime": 9643.5906, "train_tokens_per_second": 2036.884 }, { "epoch": 5.137821362311159, "grad_norm": 0.6262202262878418, "learning_rate": 4.450309428467419e-05, "loss": 8.471676635742188, "num_input_tokens_seen": 19847680, "step": 4850, "train_runtime": 9735.0779, "train_tokens_per_second": 2038.78 }, { "epoch": 5.1908295785846805, "grad_norm": 0.6598888039588928, "learning_rate": 4.177284310156534e-05, "loss": 8.572631225585937, "num_input_tokens_seen": 20052480, "step": 4900, "train_runtime": 9826.6555, "train_tokens_per_second": 2040.621 }, { "epoch": 5.243837794858203, "grad_norm": 0.7225948572158813, "learning_rate": 3.90425919184565e-05, "loss": 8.642888793945312, "num_input_tokens_seen": 20257280, "step": 4950, "train_runtime": 9918.0414, "train_tokens_per_second": 2042.468 }, { "epoch": 5.296846011131725, "grad_norm": 0.6872982382774353, "learning_rate": 3.6312340735347646e-05, "loss": 8.432411499023438, "num_input_tokens_seen": 20462080, "step": 5000, "train_runtime": 10009.6849, "train_tokens_per_second": 2044.228 }, { "epoch": 5.296846011131725, "eval_bleu": 4.09, "eval_chrf": 19.82, "eval_loss": 1.841970443725586, "eval_runtime": 86.237, "eval_samples_per_second": 3.537, "eval_steps_per_second": 1.774, "num_input_tokens_seen": 20462080, "step": 5000 }, { "epoch": 5.349854227405248, "grad_norm": 0.6799459457397461, "learning_rate": 3.3582089552238805e-05, "loss": 8.610306396484376, "num_input_tokens_seen": 20666880, "step": 5050, "train_runtime": 10200.4654, "train_tokens_per_second": 2026.072 }, { "epoch": 5.40286244367877, "grad_norm": 0.6314374804496765, "learning_rate": 3.085183836912996e-05, "loss": 8.522672119140625, "num_input_tokens_seen": 20871680, "step": 5100, "train_runtime": 10292.3344, "train_tokens_per_second": 2027.886 }, { "epoch": 5.455870659952293, "grad_norm": 0.6840763688087463, "learning_rate": 2.812158718602111e-05, "loss": 8.5241162109375, "num_input_tokens_seen": 21076480, "step": 5150, "train_runtime": 10384.0278, "train_tokens_per_second": 2029.702 }, { "epoch": 5.508878876225815, "grad_norm": 0.7108559608459473, "learning_rate": 2.5391336002912266e-05, "loss": 8.657234497070313, "num_input_tokens_seen": 21281280, "step": 5200, "train_runtime": 10475.6603, "train_tokens_per_second": 2031.498 }, { "epoch": 5.5618870924993375, "grad_norm": 0.7527778148651123, "learning_rate": 2.266108481980342e-05, "loss": 8.60021240234375, "num_input_tokens_seen": 21486080, "step": 5250, "train_runtime": 10567.164, "train_tokens_per_second": 2033.287 }, { "epoch": 5.6148953087728595, "grad_norm": 0.647541880607605, "learning_rate": 1.993083363669457e-05, "loss": 8.624324951171875, "num_input_tokens_seen": 21690880, "step": 5300, "train_runtime": 10658.6905, "train_tokens_per_second": 2035.042 }, { "epoch": 5.667903525046382, "grad_norm": 0.5897159576416016, "learning_rate": 1.7200582453585727e-05, "loss": 8.644212646484375, "num_input_tokens_seen": 21895680, "step": 5350, "train_runtime": 10750.2076, "train_tokens_per_second": 2036.768 }, { "epoch": 5.720911741319904, "grad_norm": 0.6161897778511047, "learning_rate": 1.4470331270476882e-05, "loss": 8.561669311523438, "num_input_tokens_seen": 22100480, "step": 5400, "train_runtime": 10841.7811, "train_tokens_per_second": 2038.455 }, { "epoch": 5.773919957593427, "grad_norm": 0.6419637799263, "learning_rate": 1.1740080087368037e-05, "loss": 8.653330688476563, "num_input_tokens_seen": 22305280, "step": 5450, "train_runtime": 10933.2667, "train_tokens_per_second": 2040.13 }, { "epoch": 5.82692817386695, "grad_norm": 0.6721702218055725, "learning_rate": 9.00982890425919e-06, "loss": 8.615657348632812, "num_input_tokens_seen": 22510080, "step": 5500, "train_runtime": 11024.7165, "train_tokens_per_second": 2041.783 }, { "epoch": 5.82692817386695, "eval_bleu": 4.19, "eval_chrf": 20.05, "eval_loss": 1.8417972326278687, "eval_runtime": 86.5279, "eval_samples_per_second": 3.525, "eval_steps_per_second": 1.768, "num_input_tokens_seen": 22510080, "step": 5500 }, { "epoch": 5.879936390140472, "grad_norm": 0.7171221375465393, "learning_rate": 6.279577721150346e-06, "loss": 8.624059448242187, "num_input_tokens_seen": 22714880, "step": 5550, "train_runtime": 11215.8439, "train_tokens_per_second": 2025.249 }, { "epoch": 5.932944606413994, "grad_norm": 0.6685547232627869, "learning_rate": 3.549326538041499e-06, "loss": 8.639024047851562, "num_input_tokens_seen": 22919680, "step": 5600, "train_runtime": 11307.5506, "train_tokens_per_second": 2026.936 }, { "epoch": 5.9859528226875165, "grad_norm": 0.6983809471130371, "learning_rate": 8.190753549326538e-07, "loss": 8.527723388671875, "num_input_tokens_seen": 23124480, "step": 5650, "train_runtime": 11399.0902, "train_tokens_per_second": 2028.625 } ], "logging_steps": 50, "max_steps": 5664, "num_input_tokens_seen": 23178240, "num_train_epochs": 6, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 4.229533786963968e+16, "train_batch_size": 8, "trial_name": null, "trial_params": null }