ceselder's picture
upload adapter
f6a11df verified
Raw
History Blame
11.3 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 375,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 1.3350626245141028,
"epoch": 0.02666666666666667,
"grad_norm": 1.2209417819976807,
"learning_rate": 1.9783783783783786e-05,
"loss": 3.4751,
"mean_token_accuracy": 0.4370182503014803,
"num_tokens": 12866.0,
"step": 10
},
{
"entropy": 1.3571727886795997,
"epoch": 0.05333333333333334,
"grad_norm": 1.6984230279922485,
"learning_rate": 1.9243243243243244e-05,
"loss": 3.2031,
"mean_token_accuracy": 0.4396053273230791,
"num_tokens": 25807.0,
"step": 20
},
{
"entropy": 1.471608152985573,
"epoch": 0.08,
"grad_norm": 1.014086127281189,
"learning_rate": 1.8702702702702706e-05,
"loss": 2.7028,
"mean_token_accuracy": 0.46664220802485945,
"num_tokens": 38578.0,
"step": 30
},
{
"entropy": 1.5595325112342835,
"epoch": 0.10666666666666667,
"grad_norm": 0.7482319474220276,
"learning_rate": 1.8162162162162164e-05,
"loss": 2.3153,
"mean_token_accuracy": 0.5029693856835366,
"num_tokens": 51538.0,
"step": 40
},
{
"entropy": 1.6449722349643707,
"epoch": 0.13333333333333333,
"grad_norm": 0.7101708650588989,
"learning_rate": 1.7621621621621622e-05,
"loss": 2.1109,
"mean_token_accuracy": 0.5171717956662178,
"num_tokens": 64387.0,
"step": 50
},
{
"entropy": 1.6670852690935134,
"epoch": 0.16,
"grad_norm": 0.7259413599967957,
"learning_rate": 1.7081081081081083e-05,
"loss": 1.9278,
"mean_token_accuracy": 0.5485030759125948,
"num_tokens": 77276.0,
"step": 60
},
{
"entropy": 1.6381909385323525,
"epoch": 0.18666666666666668,
"grad_norm": 0.7174317836761475,
"learning_rate": 1.654054054054054e-05,
"loss": 1.7939,
"mean_token_accuracy": 0.5677109852433204,
"num_tokens": 90149.0,
"step": 70
},
{
"entropy": 1.6385898187756538,
"epoch": 0.21333333333333335,
"grad_norm": 0.8067219257354736,
"learning_rate": 1.6000000000000003e-05,
"loss": 1.6666,
"mean_token_accuracy": 0.5853360824286937,
"num_tokens": 102995.0,
"step": 80
},
{
"entropy": 1.5796676367521285,
"epoch": 0.24,
"grad_norm": 0.800731897354126,
"learning_rate": 1.545945945945946e-05,
"loss": 1.5881,
"mean_token_accuracy": 0.597806416451931,
"num_tokens": 115839.0,
"step": 90
},
{
"entropy": 1.5752710282802582,
"epoch": 0.26666666666666666,
"grad_norm": 0.8465399146080017,
"learning_rate": 1.491891891891892e-05,
"loss": 1.5702,
"mean_token_accuracy": 0.5995256647467613,
"num_tokens": 128611.0,
"step": 100
},
{
"entropy": 1.5265976443886757,
"epoch": 0.29333333333333333,
"grad_norm": 0.8720120787620544,
"learning_rate": 1.4378378378378378e-05,
"loss": 1.5057,
"mean_token_accuracy": 0.6056284785270691,
"num_tokens": 141383.0,
"step": 110
},
{
"entropy": 1.4974668100476265,
"epoch": 0.32,
"grad_norm": 0.9546942710876465,
"learning_rate": 1.383783783783784e-05,
"loss": 1.4441,
"mean_token_accuracy": 0.6172919377684594,
"num_tokens": 154276.0,
"step": 120
},
{
"entropy": 1.4532102927565576,
"epoch": 0.3466666666666667,
"grad_norm": 0.972088098526001,
"learning_rate": 1.3297297297297298e-05,
"loss": 1.4033,
"mean_token_accuracy": 0.6191255763173104,
"num_tokens": 167141.0,
"step": 130
},
{
"entropy": 1.4425522044301033,
"epoch": 0.37333333333333335,
"grad_norm": 1.0836657285690308,
"learning_rate": 1.2756756756756758e-05,
"loss": 1.3799,
"mean_token_accuracy": 0.6284476429224014,
"num_tokens": 179968.0,
"step": 140
},
{
"entropy": 1.4219948261976243,
"epoch": 0.4,
"grad_norm": 1.1330499649047852,
"learning_rate": 1.2216216216216217e-05,
"loss": 1.3888,
"mean_token_accuracy": 0.6221960082650184,
"num_tokens": 192836.0,
"step": 150
},
{
"entropy": 1.4194561198353768,
"epoch": 0.4266666666666667,
"grad_norm": 1.092614769935608,
"learning_rate": 1.1675675675675677e-05,
"loss": 1.3462,
"mean_token_accuracy": 0.6329536609351635,
"num_tokens": 205774.0,
"step": 160
},
{
"entropy": 1.3868110164999963,
"epoch": 0.4533333333333333,
"grad_norm": 1.253973126411438,
"learning_rate": 1.1135135135135135e-05,
"loss": 1.3243,
"mean_token_accuracy": 0.6337448269128799,
"num_tokens": 218615.0,
"step": 170
},
{
"entropy": 1.382253359258175,
"epoch": 0.48,
"grad_norm": 1.1929072141647339,
"learning_rate": 1.0594594594594597e-05,
"loss": 1.3163,
"mean_token_accuracy": 0.6397944167256355,
"num_tokens": 231525.0,
"step": 180
},
{
"entropy": 1.3482940062880515,
"epoch": 0.5066666666666667,
"grad_norm": 1.3486591577529907,
"learning_rate": 1.0054054054054055e-05,
"loss": 1.2625,
"mean_token_accuracy": 0.6505386248230934,
"num_tokens": 244338.0,
"step": 190
},
{
"entropy": 1.340237122774124,
"epoch": 0.5333333333333333,
"grad_norm": 1.400648593902588,
"learning_rate": 9.513513513513514e-06,
"loss": 1.2572,
"mean_token_accuracy": 0.6538930542767047,
"num_tokens": 257295.0,
"step": 200
},
{
"entropy": 1.3297127082943916,
"epoch": 0.56,
"grad_norm": 1.3606442213058472,
"learning_rate": 8.972972972972974e-06,
"loss": 1.251,
"mean_token_accuracy": 0.6457924202084542,
"num_tokens": 270252.0,
"step": 210
},
{
"entropy": 1.294735921919346,
"epoch": 0.5866666666666667,
"grad_norm": 0.9780547618865967,
"learning_rate": 8.432432432432434e-06,
"loss": 1.2329,
"mean_token_accuracy": 0.6493118166923523,
"num_tokens": 283027.0,
"step": 220
},
{
"entropy": 1.275549191236496,
"epoch": 0.6133333333333333,
"grad_norm": 0.7589144110679626,
"learning_rate": 7.891891891891894e-06,
"loss": 1.2215,
"mean_token_accuracy": 0.6486652858555317,
"num_tokens": 295938.0,
"step": 230
},
{
"entropy": 1.2352376490831376,
"epoch": 0.64,
"grad_norm": 0.590903103351593,
"learning_rate": 7.3513513513513525e-06,
"loss": 1.2032,
"mean_token_accuracy": 0.6558617919683456,
"num_tokens": 308573.0,
"step": 240
},
{
"entropy": 1.2297846719622612,
"epoch": 0.6666666666666666,
"grad_norm": 0.4950984716415405,
"learning_rate": 6.810810810810811e-06,
"loss": 1.2186,
"mean_token_accuracy": 0.6527085661888122,
"num_tokens": 321351.0,
"step": 250
},
{
"entropy": 1.234605258703232,
"epoch": 0.6933333333333334,
"grad_norm": 0.5501531958580017,
"learning_rate": 6.270270270270271e-06,
"loss": 1.2074,
"mean_token_accuracy": 0.6517517618834973,
"num_tokens": 334282.0,
"step": 260
},
{
"entropy": 1.2171380445361137,
"epoch": 0.72,
"grad_norm": 0.5207800269126892,
"learning_rate": 5.729729729729731e-06,
"loss": 1.212,
"mean_token_accuracy": 0.6510008379817009,
"num_tokens": 347108.0,
"step": 270
},
{
"entropy": 1.1763642460107804,
"epoch": 0.7466666666666667,
"grad_norm": 0.5053102970123291,
"learning_rate": 5.18918918918919e-06,
"loss": 1.1744,
"mean_token_accuracy": 0.6574446760118008,
"num_tokens": 359894.0,
"step": 280
},
{
"entropy": 1.2101906329393386,
"epoch": 0.7733333333333333,
"grad_norm": 0.4792664647102356,
"learning_rate": 4.6486486486486495e-06,
"loss": 1.2127,
"mean_token_accuracy": 0.65442885607481,
"num_tokens": 372746.0,
"step": 290
},
{
"entropy": 1.1929027184844017,
"epoch": 0.8,
"grad_norm": 0.5656186938285828,
"learning_rate": 4.108108108108108e-06,
"loss": 1.1815,
"mean_token_accuracy": 0.6556121528148651,
"num_tokens": 385472.0,
"step": 300
},
{
"entropy": 1.187587819993496,
"epoch": 0.8266666666666667,
"grad_norm": 0.5197432041168213,
"learning_rate": 3.567567567567568e-06,
"loss": 1.1972,
"mean_token_accuracy": 0.6531499087810516,
"num_tokens": 398386.0,
"step": 310
},
{
"entropy": 1.1810954853892326,
"epoch": 0.8533333333333334,
"grad_norm": 0.5143433213233948,
"learning_rate": 3.0270270270270274e-06,
"loss": 1.18,
"mean_token_accuracy": 0.6557211861014366,
"num_tokens": 411252.0,
"step": 320
},
{
"entropy": 1.2191567361354827,
"epoch": 0.88,
"grad_norm": 0.4793160855770111,
"learning_rate": 2.4864864864864867e-06,
"loss": 1.2256,
"mean_token_accuracy": 0.6478217862546444,
"num_tokens": 424185.0,
"step": 330
},
{
"entropy": 1.2220171764492989,
"epoch": 0.9066666666666666,
"grad_norm": 0.5613325238227844,
"learning_rate": 1.945945945945946e-06,
"loss": 1.1912,
"mean_token_accuracy": 0.6575871229171752,
"num_tokens": 437188.0,
"step": 340
},
{
"entropy": 1.1927517160773278,
"epoch": 0.9333333333333333,
"grad_norm": 0.4704723656177521,
"learning_rate": 1.4054054054054056e-06,
"loss": 1.1849,
"mean_token_accuracy": 0.6561981976032257,
"num_tokens": 449996.0,
"step": 350
},
{
"entropy": 1.190693587809801,
"epoch": 0.96,
"grad_norm": 0.5744921565055847,
"learning_rate": 8.64864864864865e-07,
"loss": 1.1868,
"mean_token_accuracy": 0.6580364957451821,
"num_tokens": 462917.0,
"step": 360
},
{
"entropy": 1.1880986839532852,
"epoch": 0.9866666666666667,
"grad_norm": 0.5150167942047119,
"learning_rate": 3.2432432432432436e-07,
"loss": 1.1759,
"mean_token_accuracy": 0.6571345932781696,
"num_tokens": 475686.0,
"step": 370
}
],
"logging_steps": 10,
"max_steps": 375,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 4.278856023687168e+16,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}