{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 147, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.6612249977886677, "epoch": 0.03404255319148936, "grad_norm": 2.28125, "learning_rate": 8.000000000000001e-06, "loss": 5.1158195495605465, "mean_token_accuracy": 0.3411124350503087, "num_tokens": 12338.0, "step": 5 }, { "entropy": 1.7161438561975957, "epoch": 0.06808510638297872, "grad_norm": 3.421875, "learning_rate": 1.8e-05, "loss": 4.932054138183593, "mean_token_accuracy": 0.34090186562389135, "num_tokens": 24228.0, "step": 10 }, { "entropy": 1.8052345253527164, "epoch": 0.10212765957446808, "grad_norm": 1.9609375, "learning_rate": 2.8000000000000003e-05, "loss": 4.3712615966796875, "mean_token_accuracy": 0.37591628544032574, "num_tokens": 36607.0, "step": 15 }, { "entropy": 2.1016422733664513, "epoch": 0.13617021276595745, "grad_norm": 1.5703125, "learning_rate": 3.8e-05, "loss": 3.642262268066406, "mean_token_accuracy": 0.4129604626446962, "num_tokens": 48067.0, "step": 20 }, { "entropy": 2.3243144676089287, "epoch": 0.1702127659574468, "grad_norm": 2.015625, "learning_rate": 4.8e-05, "loss": 2.9660737991333006, "mean_token_accuracy": 0.4782245371490717, "num_tokens": 59636.0, "step": 25 }, { "entropy": 2.302782629430294, "epoch": 0.20425531914893616, "grad_norm": 1.4296875, "learning_rate": 5.8e-05, "loss": 2.5412269592285157, "mean_token_accuracy": 0.5392776299268007, "num_tokens": 71707.0, "step": 30 }, { "entropy": 2.188954807817936, "epoch": 0.23829787234042554, "grad_norm": 0.71875, "learning_rate": 6.800000000000001e-05, "loss": 2.2308956146240235, "mean_token_accuracy": 0.5898199148476124, "num_tokens": 84024.0, "step": 35 }, { "entropy": 2.2109520554542543, "epoch": 0.2723404255319149, "grad_norm": 0.859375, "learning_rate": 7.800000000000001e-05, "loss": 1.964349365234375, "mean_token_accuracy": 0.6209986783564091, "num_tokens": 96306.0, "step": 40 }, { "entropy": 2.0961234346032143, "epoch": 0.30638297872340425, "grad_norm": 0.7265625, "learning_rate": 8.800000000000001e-05, "loss": 1.792983055114746, "mean_token_accuracy": 0.6284430582076311, "num_tokens": 108229.0, "step": 45 }, { "entropy": 1.671985263749957, "epoch": 0.3404255319148936, "grad_norm": 0.67578125, "learning_rate": 9.8e-05, "loss": 1.5038132667541504, "mean_token_accuracy": 0.6809367395937442, "num_tokens": 120313.0, "step": 50 }, { "entropy": 1.6443435620516538, "epoch": 0.37446808510638296, "grad_norm": 0.8125, "learning_rate": 9.958100506132127e-05, "loss": 1.4452999114990235, "mean_token_accuracy": 0.6813344601541758, "num_tokens": 132222.0, "step": 55 }, { "entropy": 1.4775371879339219, "epoch": 0.4085106382978723, "grad_norm": 0.5859375, "learning_rate": 9.789086620939936e-05, "loss": 1.3673093795776368, "mean_token_accuracy": 0.6939370810985566, "num_tokens": 144737.0, "step": 60 }, { "entropy": 1.362747695669532, "epoch": 0.4425531914893617, "grad_norm": 0.5390625, "learning_rate": 9.494758705426978e-05, "loss": 1.2551464080810546, "mean_token_accuracy": 0.718667059391737, "num_tokens": 156461.0, "step": 65 }, { "entropy": 1.4880228728055953, "epoch": 0.4765957446808511, "grad_norm": 0.609375, "learning_rate": 9.082818315286055e-05, "loss": 1.3538105010986328, "mean_token_accuracy": 0.7009879656136035, "num_tokens": 167343.0, "step": 70 }, { "entropy": 1.3466651082038879, "epoch": 0.5106382978723404, "grad_norm": 0.6796875, "learning_rate": 8.564044522734147e-05, "loss": 1.2858383178710937, "mean_token_accuracy": 0.7119019150733947, "num_tokens": 178638.0, "step": 75 }, { "entropy": 1.2633912980556488, "epoch": 0.5446808510638298, "grad_norm": 0.69921875, "learning_rate": 7.952011865029614e-05, "loss": 1.1970553398132324, "mean_token_accuracy": 0.7300039514899254, "num_tokens": 190643.0, "step": 80 }, { "entropy": 1.2618269324302673, "epoch": 0.5787234042553191, "grad_norm": 0.66015625, "learning_rate": 7.262735145222696e-05, "loss": 1.1030343055725098, "mean_token_accuracy": 0.7353190571069718, "num_tokens": 202328.0, "step": 85 }, { "entropy": 1.2507698042318225, "epoch": 0.6127659574468085, "grad_norm": 0.66015625, "learning_rate": 6.514250379489753e-05, "loss": 1.133834457397461, "mean_token_accuracy": 0.7314565621316433, "num_tokens": 213840.0, "step": 90 }, { "entropy": 1.2799267198890447, "epoch": 0.6468085106382979, "grad_norm": 0.640625, "learning_rate": 5.726142856227452e-05, "loss": 1.1554755210876464, "mean_token_accuracy": 0.7302999064326287, "num_tokens": 225649.0, "step": 95 }, { "entropy": 1.1757509659975767, "epoch": 0.6808510638297872, "grad_norm": 0.7109375, "learning_rate": 4.919034655987493e-05, "loss": 1.060139274597168, "mean_token_accuracy": 0.7470736525952816, "num_tokens": 237320.0, "step": 100 }, { "entropy": 1.2040388137102127, "epoch": 0.7148936170212766, "grad_norm": 0.70703125, "learning_rate": 4.114045042103887e-05, "loss": 1.0966894149780273, "mean_token_accuracy": 0.7398598760366439, "num_tokens": 249781.0, "step": 105 }, { "entropy": 1.2984253257513045, "epoch": 0.7489361702127659, "grad_norm": 0.76953125, "learning_rate": 3.332237841745898e-05, "loss": 1.16298828125, "mean_token_accuracy": 0.7219951130449772, "num_tokens": 260474.0, "step": 110 }, { "entropy": 1.131225979141891, "epoch": 0.7829787234042553, "grad_norm": 0.578125, "learning_rate": 2.5940702775459747e-05, "loss": 1.010167694091797, "mean_token_accuracy": 0.75770732909441, "num_tokens": 271936.0, "step": 115 }, { "entropy": 1.1314816752448678, "epoch": 0.8170212765957446, "grad_norm": 0.6484375, "learning_rate": 1.9188576719953633e-05, "loss": 1.0260458946228028, "mean_token_accuracy": 0.7487939164042473, "num_tokens": 283647.0, "step": 120 }, { "entropy": 1.1653054066002368, "epoch": 0.851063829787234, "grad_norm": 0.8203125, "learning_rate": 1.3242680314639993e-05, "loss": 1.0705586433410645, "mean_token_accuracy": 0.748039523512125, "num_tokens": 294672.0, "step": 125 }, { "entropy": 1.2385535925626754, "epoch": 0.8851063829787233, "grad_norm": 0.875, "learning_rate": 8.25859734853645e-06, "loss": 1.117280864715576, "mean_token_accuracy": 0.7358166418969632, "num_tokens": 305646.0, "step": 130 }, { "entropy": 1.1569571590051055, "epoch": 0.9191489361702128, "grad_norm": 0.734375, "learning_rate": 4.366744239922998e-06, "loss": 1.0218097686767578, "mean_token_accuracy": 0.7512762233614921, "num_tokens": 317522.0, "step": 135 }, { "entropy": 1.2956396371126175, "epoch": 0.9531914893617022, "grad_norm": 0.640625, "learning_rate": 1.6689574843694433e-06, "loss": 1.1682409286499023, "mean_token_accuracy": 0.7267132062464953, "num_tokens": 328188.0, "step": 140 }, { "entropy": 1.1794268768280745, "epoch": 0.9872340425531915, "grad_norm": 0.796875, "learning_rate": 2.3582894166930268e-07, "loss": 1.0452459335327149, "mean_token_accuracy": 0.7454933904111385, "num_tokens": 340204.0, "step": 145 } ], "logging_steps": 5, "max_steps": 147, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 200, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 6.64226666827776e+16, "train_batch_size": 1, "trial_name": null, "trial_params": null }