Text Generation
Transformers
Safetensors
gpt2
Generated from Trainer
trl
sft
text-generation-inference
Instructions to use fpadovani/urd-arab-100mb-ppt-Dp-100mb_seed3407 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use fpadovani/urd-arab-100mb-ppt-Dp-100mb_seed3407 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="fpadovani/urd-arab-100mb-ppt-Dp-100mb_seed3407")# Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("fpadovani/urd-arab-100mb-ppt-Dp-100mb_seed3407") model = AutoModelForCausalLM.from_pretrained("fpadovani/urd-arab-100mb-ppt-Dp-100mb_seed3407", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use fpadovani/urd-arab-100mb-ppt-Dp-100mb_seed3407 with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "fpadovani/urd-arab-100mb-ppt-Dp-100mb_seed3407" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "fpadovani/urd-arab-100mb-ppt-Dp-100mb_seed3407", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker
docker model run hf.co/fpadovani/urd-arab-100mb-ppt-Dp-100mb_seed3407
- SGLang
How to use fpadovani/urd-arab-100mb-ppt-Dp-100mb_seed3407 with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "fpadovani/urd-arab-100mb-ppt-Dp-100mb_seed3407" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "fpadovani/urd-arab-100mb-ppt-Dp-100mb_seed3407", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "fpadovani/urd-arab-100mb-ppt-Dp-100mb_seed3407" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "fpadovani/urd-arab-100mb-ppt-Dp-100mb_seed3407", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }' - Docker Model Runner
How to use fpadovani/urd-arab-100mb-ppt-Dp-100mb_seed3407 with Docker Model Runner:
docker model run hf.co/fpadovani/urd-arab-100mb-ppt-Dp-100mb_seed3407
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 0.10829103214890017, | |
| "eval_steps": 500, | |
| "global_step": 4000, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 10.69199342727661, | |
| "epoch": 0.00013536379018612522, | |
| "grad_norm": 11.5625, | |
| "learning_rate": 2e-06, | |
| "loss": 10.8479, | |
| "mean_token_accuracy": 0.0, | |
| "num_tokens": 12791.0, | |
| "step": 5 | |
| }, | |
| { | |
| "entropy": 10.691878128051759, | |
| "epoch": 0.00027072758037225043, | |
| "grad_norm": 11.0, | |
| "learning_rate": 4.5e-06, | |
| "loss": 10.8142, | |
| "mean_token_accuracy": 0.0, | |
| "num_tokens": 26683.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 10.691429710388183, | |
| "epoch": 0.0004060913705583756, | |
| "grad_norm": 9.3125, | |
| "learning_rate": 7e-06, | |
| "loss": 10.5672, | |
| "mean_token_accuracy": 0.011101403925567865, | |
| "num_tokens": 39347.0, | |
| "step": 15 | |
| }, | |
| { | |
| "entropy": 10.686277675628663, | |
| "epoch": 0.0005414551607445009, | |
| "grad_norm": 5.375, | |
| "learning_rate": 9.5e-06, | |
| "loss": 10.3174, | |
| "mean_token_accuracy": 0.030114291980862618, | |
| "num_tokens": 54329.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 10.660668087005615, | |
| "epoch": 0.0006768189509306261, | |
| "grad_norm": 4.09375, | |
| "learning_rate": 1.2e-05, | |
| "loss": 10.0145, | |
| "mean_token_accuracy": 0.032822173461318015, | |
| "num_tokens": 67393.0, | |
| "step": 25 | |
| }, | |
| { | |
| "entropy": 10.637198734283448, | |
| "epoch": 0.0008121827411167512, | |
| "grad_norm": 3.0625, | |
| "learning_rate": 1.4500000000000002e-05, | |
| "loss": 9.8798, | |
| "mean_token_accuracy": 0.03450996596366167, | |
| "num_tokens": 81383.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 10.631521320343017, | |
| "epoch": 0.0009475465313028764, | |
| "grad_norm": 2.515625, | |
| "learning_rate": 1.7000000000000003e-05, | |
| "loss": 9.8183, | |
| "mean_token_accuracy": 0.03217146322131157, | |
| "num_tokens": 95991.0, | |
| "step": 35 | |
| }, | |
| { | |
| "entropy": 10.626516151428223, | |
| "epoch": 0.0010829103214890017, | |
| "grad_norm": 2.515625, | |
| "learning_rate": 1.95e-05, | |
| "loss": 9.7088, | |
| "mean_token_accuracy": 0.03352573178708553, | |
| "num_tokens": 108504.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 10.627447319030761, | |
| "epoch": 0.001218274111675127, | |
| "grad_norm": 2.1875, | |
| "learning_rate": 2.2e-05, | |
| "loss": 9.7785, | |
| "mean_token_accuracy": 0.030551478266716003, | |
| "num_tokens": 123286.0, | |
| "step": 45 | |
| }, | |
| { | |
| "entropy": 10.629091835021972, | |
| "epoch": 0.0013536379018612521, | |
| "grad_norm": 2.296875, | |
| "learning_rate": 2.4500000000000003e-05, | |
| "loss": 9.6538, | |
| "mean_token_accuracy": 0.03104141727089882, | |
| "num_tokens": 135493.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 10.618868160247803, | |
| "epoch": 0.0014890016920473773, | |
| "grad_norm": 2.078125, | |
| "learning_rate": 2.7e-05, | |
| "loss": 9.6537, | |
| "mean_token_accuracy": 0.03736583907157183, | |
| "num_tokens": 150376.0, | |
| "step": 55 | |
| }, | |
| { | |
| "entropy": 10.596181201934815, | |
| "epoch": 0.0016243654822335025, | |
| "grad_norm": 2.109375, | |
| "learning_rate": 2.95e-05, | |
| "loss": 9.5976, | |
| "mean_token_accuracy": 0.03170219026505947, | |
| "num_tokens": 165805.0, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 10.606531143188477, | |
| "epoch": 0.0017597292724196277, | |
| "grad_norm": 2.09375, | |
| "learning_rate": 3.2e-05, | |
| "loss": 9.4608, | |
| "mean_token_accuracy": 0.03743585981428623, | |
| "num_tokens": 179043.0, | |
| "step": 65 | |
| }, | |
| { | |
| "entropy": 10.577856731414794, | |
| "epoch": 0.0018950930626057529, | |
| "grad_norm": 2.09375, | |
| "learning_rate": 3.4500000000000005e-05, | |
| "loss": 9.3947, | |
| "mean_token_accuracy": 0.03445138856768608, | |
| "num_tokens": 191847.0, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 10.561034107208252, | |
| "epoch": 0.0020304568527918783, | |
| "grad_norm": 2.125, | |
| "learning_rate": 3.7e-05, | |
| "loss": 9.2778, | |
| "mean_token_accuracy": 0.03577356971800327, | |
| "num_tokens": 207116.0, | |
| "step": 75 | |
| }, | |
| { | |
| "entropy": 10.546807861328125, | |
| "epoch": 0.0021658206429780035, | |
| "grad_norm": 2.03125, | |
| "learning_rate": 3.95e-05, | |
| "loss": 9.2156, | |
| "mean_token_accuracy": 0.03288109693676233, | |
| "num_tokens": 219651.0, | |
| "step": 80 | |
| }, | |
| { | |
| "entropy": 10.532037448883056, | |
| "epoch": 0.0023011844331641287, | |
| "grad_norm": 2.015625, | |
| "learning_rate": 4.2000000000000004e-05, | |
| "loss": 9.16, | |
| "mean_token_accuracy": 0.03139570262283087, | |
| "num_tokens": 233183.0, | |
| "step": 85 | |
| }, | |
| { | |
| "entropy": 10.499158573150634, | |
| "epoch": 0.002436548223350254, | |
| "grad_norm": 2.0625, | |
| "learning_rate": 4.45e-05, | |
| "loss": 8.9864, | |
| "mean_token_accuracy": 0.0376906756311655, | |
| "num_tokens": 246291.0, | |
| "step": 90 | |
| }, | |
| { | |
| "entropy": 10.423231887817384, | |
| "epoch": 0.002571912013536379, | |
| "grad_norm": 2.15625, | |
| "learning_rate": 4.7000000000000004e-05, | |
| "loss": 8.8533, | |
| "mean_token_accuracy": 0.04000245779752731, | |
| "num_tokens": 259606.0, | |
| "step": 95 | |
| }, | |
| { | |
| "entropy": 10.371912956237793, | |
| "epoch": 0.0027072758037225042, | |
| "grad_norm": 2.0, | |
| "learning_rate": 4.9500000000000004e-05, | |
| "loss": 8.7521, | |
| "mean_token_accuracy": 0.04012820441275835, | |
| "num_tokens": 275174.0, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 10.304845333099365, | |
| "epoch": 0.0028426395939086294, | |
| "grad_norm": 2.25, | |
| "learning_rate": 5.2e-05, | |
| "loss": 8.5952, | |
| "mean_token_accuracy": 0.04803745746612549, | |
| "num_tokens": 287873.0, | |
| "step": 105 | |
| }, | |
| { | |
| "entropy": 10.202454662322998, | |
| "epoch": 0.0029780033840947546, | |
| "grad_norm": 1.9453125, | |
| "learning_rate": 5.45e-05, | |
| "loss": 8.4264, | |
| "mean_token_accuracy": 0.052891625463962554, | |
| "num_tokens": 301243.0, | |
| "step": 110 | |
| }, | |
| { | |
| "entropy": 10.146648788452149, | |
| "epoch": 0.00311336717428088, | |
| "grad_norm": 2.140625, | |
| "learning_rate": 5.7e-05, | |
| "loss": 8.3599, | |
| "mean_token_accuracy": 0.04921769984066486, | |
| "num_tokens": 314246.0, | |
| "step": 115 | |
| }, | |
| { | |
| "entropy": 9.991413021087647, | |
| "epoch": 0.003248730964467005, | |
| "grad_norm": 1.671875, | |
| "learning_rate": 5.9499999999999996e-05, | |
| "loss": 8.1824, | |
| "mean_token_accuracy": 0.05792190656065941, | |
| "num_tokens": 327131.0, | |
| "step": 120 | |
| }, | |
| { | |
| "entropy": 9.899451637268067, | |
| "epoch": 0.00338409475465313, | |
| "grad_norm": 1.7734375, | |
| "learning_rate": 6.2e-05, | |
| "loss": 8.0577, | |
| "mean_token_accuracy": 0.054864197969436646, | |
| "num_tokens": 340932.0, | |
| "step": 125 | |
| }, | |
| { | |
| "entropy": 9.722916507720948, | |
| "epoch": 0.0035194585448392554, | |
| "grad_norm": 1.671875, | |
| "learning_rate": 6.450000000000001e-05, | |
| "loss": 7.9419, | |
| "mean_token_accuracy": 0.05465308241546154, | |
| "num_tokens": 355280.0, | |
| "step": 130 | |
| }, | |
| { | |
| "entropy": 9.517075347900391, | |
| "epoch": 0.0036548223350253805, | |
| "grad_norm": 1.546875, | |
| "learning_rate": 6.7e-05, | |
| "loss": 7.863, | |
| "mean_token_accuracy": 0.06392355933785439, | |
| "num_tokens": 370159.0, | |
| "step": 135 | |
| }, | |
| { | |
| "entropy": 9.312166881561279, | |
| "epoch": 0.0037901861252115057, | |
| "grad_norm": 1.4609375, | |
| "learning_rate": 6.950000000000001e-05, | |
| "loss": 7.7284, | |
| "mean_token_accuracy": 0.060528535023331644, | |
| "num_tokens": 385660.0, | |
| "step": 140 | |
| }, | |
| { | |
| "entropy": 9.113211154937744, | |
| "epoch": 0.003925549915397631, | |
| "grad_norm": 1.3359375, | |
| "learning_rate": 7.2e-05, | |
| "loss": 7.6437, | |
| "mean_token_accuracy": 0.05836181789636612, | |
| "num_tokens": 401147.0, | |
| "step": 145 | |
| }, | |
| { | |
| "entropy": 8.787345790863037, | |
| "epoch": 0.0040609137055837565, | |
| "grad_norm": 1.5625, | |
| "learning_rate": 7.45e-05, | |
| "loss": 7.4136, | |
| "mean_token_accuracy": 0.07278152294456959, | |
| "num_tokens": 413888.0, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 8.64449052810669, | |
| "epoch": 0.004196277495769882, | |
| "grad_norm": 1.40625, | |
| "learning_rate": 7.7e-05, | |
| "loss": 7.3884, | |
| "mean_token_accuracy": 0.06653538607060909, | |
| "num_tokens": 427538.0, | |
| "step": 155 | |
| }, | |
| { | |
| "entropy": 8.441664218902588, | |
| "epoch": 0.004331641285956007, | |
| "grad_norm": 2.125, | |
| "learning_rate": 7.950000000000001e-05, | |
| "loss": 7.3251, | |
| "mean_token_accuracy": 0.069814383238554, | |
| "num_tokens": 441236.0, | |
| "step": 160 | |
| }, | |
| { | |
| "entropy": 8.356950950622558, | |
| "epoch": 0.004467005076142132, | |
| "grad_norm": 1.3984375, | |
| "learning_rate": 8.2e-05, | |
| "loss": 7.4254, | |
| "mean_token_accuracy": 0.0740208551287651, | |
| "num_tokens": 454231.0, | |
| "step": 165 | |
| }, | |
| { | |
| "entropy": 8.19385576248169, | |
| "epoch": 0.004602368866328257, | |
| "grad_norm": 1.5234375, | |
| "learning_rate": 8.450000000000001e-05, | |
| "loss": 7.2457, | |
| "mean_token_accuracy": 0.07566015087068081, | |
| "num_tokens": 468791.0, | |
| "step": 170 | |
| }, | |
| { | |
| "entropy": 8.173048114776611, | |
| "epoch": 0.0047377326565143825, | |
| "grad_norm": 1.6328125, | |
| "learning_rate": 8.7e-05, | |
| "loss": 7.3934, | |
| "mean_token_accuracy": 0.06828283667564392, | |
| "num_tokens": 481866.0, | |
| "step": 175 | |
| }, | |
| { | |
| "entropy": 8.059328603744508, | |
| "epoch": 0.004873096446700508, | |
| "grad_norm": 1.4296875, | |
| "learning_rate": 8.95e-05, | |
| "loss": 7.2376, | |
| "mean_token_accuracy": 0.07703411132097245, | |
| "num_tokens": 495060.0, | |
| "step": 180 | |
| }, | |
| { | |
| "entropy": 8.006558561325074, | |
| "epoch": 0.005008460236886633, | |
| "grad_norm": 1.2890625, | |
| "learning_rate": 9.2e-05, | |
| "loss": 7.1953, | |
| "mean_token_accuracy": 0.07884187921881676, | |
| "num_tokens": 508485.0, | |
| "step": 185 | |
| }, | |
| { | |
| "entropy": 7.988453817367554, | |
| "epoch": 0.005143824027072758, | |
| "grad_norm": 1.3984375, | |
| "learning_rate": 9.45e-05, | |
| "loss": 7.2074, | |
| "mean_token_accuracy": 0.07364003024995328, | |
| "num_tokens": 522642.0, | |
| "step": 190 | |
| }, | |
| { | |
| "entropy": 7.911316013336181, | |
| "epoch": 0.005279187817258883, | |
| "grad_norm": 1.234375, | |
| "learning_rate": 9.7e-05, | |
| "loss": 7.1742, | |
| "mean_token_accuracy": 0.07427211254835128, | |
| "num_tokens": 536967.0, | |
| "step": 195 | |
| }, | |
| { | |
| "entropy": 7.899316692352295, | |
| "epoch": 0.0054145516074450084, | |
| "grad_norm": 1.4296875, | |
| "learning_rate": 9.95e-05, | |
| "loss": 7.1728, | |
| "mean_token_accuracy": 0.0805082306265831, | |
| "num_tokens": 548389.0, | |
| "step": 200 | |
| }, | |
| { | |
| "entropy": 7.799197435379028, | |
| "epoch": 0.005549915397631134, | |
| "grad_norm": 1.296875, | |
| "learning_rate": 0.000102, | |
| "loss": 7.1509, | |
| "mean_token_accuracy": 0.07738717347383499, | |
| "num_tokens": 560609.0, | |
| "step": 205 | |
| }, | |
| { | |
| "entropy": 7.819343090057373, | |
| "epoch": 0.005685279187817259, | |
| "grad_norm": 1.3046875, | |
| "learning_rate": 0.00010449999999999999, | |
| "loss": 7.1254, | |
| "mean_token_accuracy": 0.07640378400683404, | |
| "num_tokens": 574689.0, | |
| "step": 210 | |
| }, | |
| { | |
| "entropy": 7.777826452255249, | |
| "epoch": 0.005820642978003384, | |
| "grad_norm": 1.3515625, | |
| "learning_rate": 0.000107, | |
| "loss": 7.0691, | |
| "mean_token_accuracy": 0.07349300533533096, | |
| "num_tokens": 588789.0, | |
| "step": 215 | |
| }, | |
| { | |
| "entropy": 7.698786115646362, | |
| "epoch": 0.005956006768189509, | |
| "grad_norm": 1.3125, | |
| "learning_rate": 0.0001095, | |
| "loss": 7.1439, | |
| "mean_token_accuracy": 0.07730361446738243, | |
| "num_tokens": 603609.0, | |
| "step": 220 | |
| }, | |
| { | |
| "entropy": 7.7466569423675535, | |
| "epoch": 0.006091370558375634, | |
| "grad_norm": 1.4453125, | |
| "learning_rate": 0.000112, | |
| "loss": 7.0113, | |
| "mean_token_accuracy": 0.07942908927798271, | |
| "num_tokens": 616403.0, | |
| "step": 225 | |
| }, | |
| { | |
| "entropy": 7.682626628875733, | |
| "epoch": 0.00622673434856176, | |
| "grad_norm": 1.09375, | |
| "learning_rate": 0.0001145, | |
| "loss": 7.1202, | |
| "mean_token_accuracy": 0.08443130478262902, | |
| "num_tokens": 630831.0, | |
| "step": 230 | |
| }, | |
| { | |
| "entropy": 7.731028842926025, | |
| "epoch": 0.006362098138747885, | |
| "grad_norm": 1.5078125, | |
| "learning_rate": 0.00011700000000000001, | |
| "loss": 7.0225, | |
| "mean_token_accuracy": 0.08779790177941323, | |
| "num_tokens": 646501.0, | |
| "step": 235 | |
| }, | |
| { | |
| "entropy": 7.661398029327392, | |
| "epoch": 0.00649746192893401, | |
| "grad_norm": 1.8671875, | |
| "learning_rate": 0.00011949999999999999, | |
| "loss": 7.0941, | |
| "mean_token_accuracy": 0.08079206757247448, | |
| "num_tokens": 661193.0, | |
| "step": 240 | |
| }, | |
| { | |
| "entropy": 7.572637605667114, | |
| "epoch": 0.006632825719120135, | |
| "grad_norm": 1.734375, | |
| "learning_rate": 0.000122, | |
| "loss": 7.0787, | |
| "mean_token_accuracy": 0.08005881682038307, | |
| "num_tokens": 675523.0, | |
| "step": 245 | |
| }, | |
| { | |
| "entropy": 7.636332321166992, | |
| "epoch": 0.00676818950930626, | |
| "grad_norm": 1.5859375, | |
| "learning_rate": 0.0001245, | |
| "loss": 7.0674, | |
| "mean_token_accuracy": 0.07794632315635681, | |
| "num_tokens": 691106.0, | |
| "step": 250 | |
| }, | |
| { | |
| "entropy": 7.519766235351563, | |
| "epoch": 0.0069035532994923855, | |
| "grad_norm": 1.3671875, | |
| "learning_rate": 0.000127, | |
| "loss": 6.9381, | |
| "mean_token_accuracy": 0.08541512936353683, | |
| "num_tokens": 704312.0, | |
| "step": 255 | |
| }, | |
| { | |
| "entropy": 7.561954641342163, | |
| "epoch": 0.007038917089678511, | |
| "grad_norm": 1.4375, | |
| "learning_rate": 0.0001295, | |
| "loss": 6.9601, | |
| "mean_token_accuracy": 0.0883929617702961, | |
| "num_tokens": 717026.0, | |
| "step": 260 | |
| }, | |
| { | |
| "entropy": 7.570081567764282, | |
| "epoch": 0.007174280879864636, | |
| "grad_norm": 1.328125, | |
| "learning_rate": 0.000132, | |
| "loss": 6.9123, | |
| "mean_token_accuracy": 0.08829773366451263, | |
| "num_tokens": 729605.0, | |
| "step": 265 | |
| }, | |
| { | |
| "entropy": 7.463983678817749, | |
| "epoch": 0.007309644670050761, | |
| "grad_norm": 1.2421875, | |
| "learning_rate": 0.00013450000000000002, | |
| "loss": 6.9353, | |
| "mean_token_accuracy": 0.09122553616762161, | |
| "num_tokens": 743208.0, | |
| "step": 270 | |
| }, | |
| { | |
| "entropy": 7.550097227096558, | |
| "epoch": 0.007445008460236886, | |
| "grad_norm": 1.2578125, | |
| "learning_rate": 0.00013700000000000002, | |
| "loss": 6.9287, | |
| "mean_token_accuracy": 0.08519787713885307, | |
| "num_tokens": 755127.0, | |
| "step": 275 | |
| }, | |
| { | |
| "entropy": 7.398041200637818, | |
| "epoch": 0.0075803722504230115, | |
| "grad_norm": 1.53125, | |
| "learning_rate": 0.0001395, | |
| "loss": 6.8231, | |
| "mean_token_accuracy": 0.08911917060613632, | |
| "num_tokens": 769725.0, | |
| "step": 280 | |
| }, | |
| { | |
| "entropy": 7.364175844192505, | |
| "epoch": 0.007715736040609137, | |
| "grad_norm": 1.2109375, | |
| "learning_rate": 0.00014199999999999998, | |
| "loss": 6.7527, | |
| "mean_token_accuracy": 0.09069294035434723, | |
| "num_tokens": 783788.0, | |
| "step": 285 | |
| }, | |
| { | |
| "entropy": 7.450532627105713, | |
| "epoch": 0.007851099830795263, | |
| "grad_norm": 1.171875, | |
| "learning_rate": 0.0001445, | |
| "loss": 6.934, | |
| "mean_token_accuracy": 0.08614907264709473, | |
| "num_tokens": 797214.0, | |
| "step": 290 | |
| }, | |
| { | |
| "entropy": 7.43695821762085, | |
| "epoch": 0.007986463620981387, | |
| "grad_norm": 1.6328125, | |
| "learning_rate": 0.000147, | |
| "loss": 6.897, | |
| "mean_token_accuracy": 0.09108028039336205, | |
| "num_tokens": 809731.0, | |
| "step": 295 | |
| }, | |
| { | |
| "entropy": 7.286933469772339, | |
| "epoch": 0.008121827411167513, | |
| "grad_norm": 1.4296875, | |
| "learning_rate": 0.0001495, | |
| "loss": 6.8591, | |
| "mean_token_accuracy": 0.09137310981750488, | |
| "num_tokens": 825021.0, | |
| "step": 300 | |
| }, | |
| { | |
| "entropy": 7.2696253776550295, | |
| "epoch": 0.008257191201353637, | |
| "grad_norm": 1.40625, | |
| "learning_rate": 0.000152, | |
| "loss": 6.9029, | |
| "mean_token_accuracy": 0.09101672545075416, | |
| "num_tokens": 839153.0, | |
| "step": 305 | |
| }, | |
| { | |
| "entropy": 7.386481237411499, | |
| "epoch": 0.008392554991539763, | |
| "grad_norm": 1.3984375, | |
| "learning_rate": 0.00015450000000000001, | |
| "loss": 6.8276, | |
| "mean_token_accuracy": 0.08859616219997406, | |
| "num_tokens": 853120.0, | |
| "step": 310 | |
| }, | |
| { | |
| "entropy": 7.337709522247314, | |
| "epoch": 0.008527918781725888, | |
| "grad_norm": 1.21875, | |
| "learning_rate": 0.000157, | |
| "loss": 6.8448, | |
| "mean_token_accuracy": 0.08571028485894203, | |
| "num_tokens": 867268.0, | |
| "step": 315 | |
| }, | |
| { | |
| "entropy": 7.340923023223877, | |
| "epoch": 0.008663282571912014, | |
| "grad_norm": 1.3515625, | |
| "learning_rate": 0.0001595, | |
| "loss": 6.8255, | |
| "mean_token_accuracy": 0.09267906844615936, | |
| "num_tokens": 879062.0, | |
| "step": 320 | |
| }, | |
| { | |
| "entropy": 7.282296800613404, | |
| "epoch": 0.008798646362098138, | |
| "grad_norm": 1.4140625, | |
| "learning_rate": 0.000162, | |
| "loss": 6.7932, | |
| "mean_token_accuracy": 0.09626845642924309, | |
| "num_tokens": 892178.0, | |
| "step": 325 | |
| }, | |
| { | |
| "entropy": 7.201563024520874, | |
| "epoch": 0.008934010152284264, | |
| "grad_norm": 1.3125, | |
| "learning_rate": 0.00016450000000000001, | |
| "loss": 6.671, | |
| "mean_token_accuracy": 0.09671695902943611, | |
| "num_tokens": 904809.0, | |
| "step": 330 | |
| }, | |
| { | |
| "entropy": 7.275315999984741, | |
| "epoch": 0.009069373942470389, | |
| "grad_norm": 1.2734375, | |
| "learning_rate": 0.00016700000000000002, | |
| "loss": 6.8034, | |
| "mean_token_accuracy": 0.09026706293225288, | |
| "num_tokens": 917660.0, | |
| "step": 335 | |
| }, | |
| { | |
| "entropy": 7.179704904556274, | |
| "epoch": 0.009204737732656515, | |
| "grad_norm": 1.328125, | |
| "learning_rate": 0.00016950000000000003, | |
| "loss": 6.6849, | |
| "mean_token_accuracy": 0.09763308465480805, | |
| "num_tokens": 932773.0, | |
| "step": 340 | |
| }, | |
| { | |
| "entropy": 7.1569760799407955, | |
| "epoch": 0.009340101522842639, | |
| "grad_norm": 1.3359375, | |
| "learning_rate": 0.00017199999999999998, | |
| "loss": 6.707, | |
| "mean_token_accuracy": 0.09705711230635643, | |
| "num_tokens": 946688.0, | |
| "step": 345 | |
| }, | |
| { | |
| "entropy": 7.123394393920899, | |
| "epoch": 0.009475465313028765, | |
| "grad_norm": 1.3671875, | |
| "learning_rate": 0.00017449999999999999, | |
| "loss": 6.6188, | |
| "mean_token_accuracy": 0.10255519598722458, | |
| "num_tokens": 960621.0, | |
| "step": 350 | |
| }, | |
| { | |
| "entropy": 7.114657831192017, | |
| "epoch": 0.00961082910321489, | |
| "grad_norm": 1.2734375, | |
| "learning_rate": 0.000177, | |
| "loss": 6.7525, | |
| "mean_token_accuracy": 0.0939077839255333, | |
| "num_tokens": 976705.0, | |
| "step": 355 | |
| }, | |
| { | |
| "entropy": 7.13629846572876, | |
| "epoch": 0.009746192893401015, | |
| "grad_norm": 1.234375, | |
| "learning_rate": 0.0001795, | |
| "loss": 6.6798, | |
| "mean_token_accuracy": 0.09904273673892021, | |
| "num_tokens": 989175.0, | |
| "step": 360 | |
| }, | |
| { | |
| "entropy": 7.18667254447937, | |
| "epoch": 0.00988155668358714, | |
| "grad_norm": 1.25, | |
| "learning_rate": 0.000182, | |
| "loss": 6.7875, | |
| "mean_token_accuracy": 0.095027344673872, | |
| "num_tokens": 1003899.0, | |
| "step": 365 | |
| }, | |
| { | |
| "entropy": 7.018054962158203, | |
| "epoch": 0.010016920473773266, | |
| "grad_norm": 1.4765625, | |
| "learning_rate": 0.0001845, | |
| "loss": 6.6248, | |
| "mean_token_accuracy": 0.09302543699741364, | |
| "num_tokens": 1017823.0, | |
| "step": 370 | |
| }, | |
| { | |
| "entropy": 7.214749193191528, | |
| "epoch": 0.01015228426395939, | |
| "grad_norm": 1.234375, | |
| "learning_rate": 0.000187, | |
| "loss": 6.8025, | |
| "mean_token_accuracy": 0.0944581039249897, | |
| "num_tokens": 1031556.0, | |
| "step": 375 | |
| }, | |
| { | |
| "entropy": 7.06955304145813, | |
| "epoch": 0.010287648054145516, | |
| "grad_norm": 1.375, | |
| "learning_rate": 0.0001895, | |
| "loss": 6.6582, | |
| "mean_token_accuracy": 0.10281435176730155, | |
| "num_tokens": 1044245.0, | |
| "step": 380 | |
| }, | |
| { | |
| "entropy": 7.121717023849487, | |
| "epoch": 0.01042301184433164, | |
| "grad_norm": 1.3671875, | |
| "learning_rate": 0.000192, | |
| "loss": 6.6908, | |
| "mean_token_accuracy": 0.09887115061283111, | |
| "num_tokens": 1058288.0, | |
| "step": 385 | |
| }, | |
| { | |
| "entropy": 7.069799566268921, | |
| "epoch": 0.010558375634517767, | |
| "grad_norm": 1.546875, | |
| "learning_rate": 0.0001945, | |
| "loss": 6.623, | |
| "mean_token_accuracy": 0.09829980209469795, | |
| "num_tokens": 1072234.0, | |
| "step": 390 | |
| }, | |
| { | |
| "entropy": 7.062967205047608, | |
| "epoch": 0.010693739424703893, | |
| "grad_norm": 1.484375, | |
| "learning_rate": 0.00019700000000000002, | |
| "loss": 6.6287, | |
| "mean_token_accuracy": 0.0978606753051281, | |
| "num_tokens": 1085463.0, | |
| "step": 395 | |
| }, | |
| { | |
| "entropy": 6.952229833602905, | |
| "epoch": 0.010829103214890017, | |
| "grad_norm": 1.4375, | |
| "learning_rate": 0.00019950000000000002, | |
| "loss": 6.6629, | |
| "mean_token_accuracy": 0.09642241895198822, | |
| "num_tokens": 1101393.0, | |
| "step": 400 | |
| }, | |
| { | |
| "entropy": 7.105423212051392, | |
| "epoch": 0.010964467005076143, | |
| "grad_norm": 1.1171875, | |
| "learning_rate": 0.000202, | |
| "loss": 6.6263, | |
| "mean_token_accuracy": 0.09685642644762993, | |
| "num_tokens": 1117150.0, | |
| "step": 405 | |
| }, | |
| { | |
| "entropy": 6.972289943695069, | |
| "epoch": 0.011099830795262267, | |
| "grad_norm": 1.3515625, | |
| "learning_rate": 0.00020449999999999998, | |
| "loss": 6.6594, | |
| "mean_token_accuracy": 0.10496844202280045, | |
| "num_tokens": 1130674.0, | |
| "step": 410 | |
| }, | |
| { | |
| "entropy": 7.087021827697754, | |
| "epoch": 0.011235194585448393, | |
| "grad_norm": 1.171875, | |
| "learning_rate": 0.000207, | |
| "loss": 6.6508, | |
| "mean_token_accuracy": 0.09535380229353904, | |
| "num_tokens": 1144016.0, | |
| "step": 415 | |
| }, | |
| { | |
| "entropy": 6.9751802444458, | |
| "epoch": 0.011370558375634518, | |
| "grad_norm": 1.1484375, | |
| "learning_rate": 0.0002095, | |
| "loss": 6.646, | |
| "mean_token_accuracy": 0.09546661153435707, | |
| "num_tokens": 1160200.0, | |
| "step": 420 | |
| }, | |
| { | |
| "entropy": 7.048429536819458, | |
| "epoch": 0.011505922165820644, | |
| "grad_norm": 1.484375, | |
| "learning_rate": 0.000212, | |
| "loss": 6.5651, | |
| "mean_token_accuracy": 0.1022900827229023, | |
| "num_tokens": 1173266.0, | |
| "step": 425 | |
| }, | |
| { | |
| "entropy": 6.974373769760132, | |
| "epoch": 0.011641285956006768, | |
| "grad_norm": 1.1171875, | |
| "learning_rate": 0.0002145, | |
| "loss": 6.6353, | |
| "mean_token_accuracy": 0.09445997178554535, | |
| "num_tokens": 1187977.0, | |
| "step": 430 | |
| }, | |
| { | |
| "entropy": 6.9971846580505375, | |
| "epoch": 0.011776649746192894, | |
| "grad_norm": 1.21875, | |
| "learning_rate": 0.00021700000000000002, | |
| "loss": 6.6389, | |
| "mean_token_accuracy": 0.09972369968891144, | |
| "num_tokens": 1202369.0, | |
| "step": 435 | |
| }, | |
| { | |
| "entropy": 6.966669607162475, | |
| "epoch": 0.011912013536379018, | |
| "grad_norm": 1.3203125, | |
| "learning_rate": 0.0002195, | |
| "loss": 6.5354, | |
| "mean_token_accuracy": 0.09552454426884652, | |
| "num_tokens": 1216956.0, | |
| "step": 440 | |
| }, | |
| { | |
| "entropy": 6.981910848617554, | |
| "epoch": 0.012047377326565144, | |
| "grad_norm": 1.1796875, | |
| "learning_rate": 0.000222, | |
| "loss": 6.6403, | |
| "mean_token_accuracy": 0.09657183811068534, | |
| "num_tokens": 1230958.0, | |
| "step": 445 | |
| }, | |
| { | |
| "entropy": 6.972163391113281, | |
| "epoch": 0.012182741116751269, | |
| "grad_norm": 1.3671875, | |
| "learning_rate": 0.0002245, | |
| "loss": 6.5568, | |
| "mean_token_accuracy": 0.1032287061214447, | |
| "num_tokens": 1244512.0, | |
| "step": 450 | |
| }, | |
| { | |
| "entropy": 6.940069246292114, | |
| "epoch": 0.012318104906937395, | |
| "grad_norm": 1.5078125, | |
| "learning_rate": 0.00022700000000000002, | |
| "loss": 6.4972, | |
| "mean_token_accuracy": 0.10796320661902428, | |
| "num_tokens": 1257469.0, | |
| "step": 455 | |
| }, | |
| { | |
| "entropy": 6.870718479156494, | |
| "epoch": 0.01245346869712352, | |
| "grad_norm": 1.203125, | |
| "learning_rate": 0.00022950000000000002, | |
| "loss": 6.5861, | |
| "mean_token_accuracy": 0.10574530512094497, | |
| "num_tokens": 1273533.0, | |
| "step": 460 | |
| }, | |
| { | |
| "entropy": 6.932940578460693, | |
| "epoch": 0.012588832487309645, | |
| "grad_norm": 1.25, | |
| "learning_rate": 0.00023200000000000003, | |
| "loss": 6.5387, | |
| "mean_token_accuracy": 0.10031782239675521, | |
| "num_tokens": 1288385.0, | |
| "step": 465 | |
| }, | |
| { | |
| "entropy": 6.920595693588257, | |
| "epoch": 0.01272419627749577, | |
| "grad_norm": 1.3203125, | |
| "learning_rate": 0.00023449999999999998, | |
| "loss": 6.6012, | |
| "mean_token_accuracy": 0.10496116429567337, | |
| "num_tokens": 1300721.0, | |
| "step": 470 | |
| }, | |
| { | |
| "entropy": 6.878480577468872, | |
| "epoch": 0.012859560067681896, | |
| "grad_norm": 1.2421875, | |
| "learning_rate": 0.000237, | |
| "loss": 6.4915, | |
| "mean_token_accuracy": 0.1057609498500824, | |
| "num_tokens": 1313125.0, | |
| "step": 475 | |
| }, | |
| { | |
| "entropy": 6.905995321273804, | |
| "epoch": 0.01299492385786802, | |
| "grad_norm": 1.296875, | |
| "learning_rate": 0.0002395, | |
| "loss": 6.5534, | |
| "mean_token_accuracy": 0.09937024191021919, | |
| "num_tokens": 1326226.0, | |
| "step": 480 | |
| }, | |
| { | |
| "entropy": 6.928886890411377, | |
| "epoch": 0.013130287648054146, | |
| "grad_norm": 1.1328125, | |
| "learning_rate": 0.000242, | |
| "loss": 6.4614, | |
| "mean_token_accuracy": 0.10791765451431275, | |
| "num_tokens": 1339932.0, | |
| "step": 485 | |
| }, | |
| { | |
| "entropy": 6.82708158493042, | |
| "epoch": 0.01326565143824027, | |
| "grad_norm": 1.3359375, | |
| "learning_rate": 0.0002445, | |
| "loss": 6.5553, | |
| "mean_token_accuracy": 0.09961838722229004, | |
| "num_tokens": 1354015.0, | |
| "step": 490 | |
| }, | |
| { | |
| "entropy": 6.846263122558594, | |
| "epoch": 0.013401015228426396, | |
| "grad_norm": 1.2734375, | |
| "learning_rate": 0.000247, | |
| "loss": 6.5473, | |
| "mean_token_accuracy": 0.100076574832201, | |
| "num_tokens": 1369333.0, | |
| "step": 495 | |
| }, | |
| { | |
| "entropy": 6.777434158325195, | |
| "epoch": 0.01353637901861252, | |
| "grad_norm": 1.2734375, | |
| "learning_rate": 0.0002495, | |
| "loss": 6.5092, | |
| "mean_token_accuracy": 0.10239997878670692, | |
| "num_tokens": 1383141.0, | |
| "step": 500 | |
| }, | |
| { | |
| "entropy": 6.814955854415894, | |
| "epoch": 0.013671742808798647, | |
| "grad_norm": 1.2890625, | |
| "learning_rate": 0.000252, | |
| "loss": 6.5148, | |
| "mean_token_accuracy": 0.10957075208425522, | |
| "num_tokens": 1398273.0, | |
| "step": 505 | |
| }, | |
| { | |
| "entropy": 6.813977956771851, | |
| "epoch": 0.013807106598984771, | |
| "grad_norm": 1.21875, | |
| "learning_rate": 0.0002545, | |
| "loss": 6.4406, | |
| "mean_token_accuracy": 0.10602880343794822, | |
| "num_tokens": 1412562.0, | |
| "step": 510 | |
| }, | |
| { | |
| "entropy": 6.782559490203857, | |
| "epoch": 0.013942470389170897, | |
| "grad_norm": 1.203125, | |
| "learning_rate": 0.000257, | |
| "loss": 6.4008, | |
| "mean_token_accuracy": 0.1101540595293045, | |
| "num_tokens": 1426024.0, | |
| "step": 515 | |
| }, | |
| { | |
| "entropy": 6.743443441390991, | |
| "epoch": 0.014077834179357021, | |
| "grad_norm": 1.171875, | |
| "learning_rate": 0.0002595, | |
| "loss": 6.4539, | |
| "mean_token_accuracy": 0.10084594711661339, | |
| "num_tokens": 1439774.0, | |
| "step": 520 | |
| }, | |
| { | |
| "entropy": 6.744311380386352, | |
| "epoch": 0.014213197969543147, | |
| "grad_norm": 1.296875, | |
| "learning_rate": 0.000262, | |
| "loss": 6.386, | |
| "mean_token_accuracy": 0.11141050532460213, | |
| "num_tokens": 1453041.0, | |
| "step": 525 | |
| }, | |
| { | |
| "entropy": 6.779989385604859, | |
| "epoch": 0.014348561759729272, | |
| "grad_norm": 1.25, | |
| "learning_rate": 0.00026450000000000003, | |
| "loss": 6.3421, | |
| "mean_token_accuracy": 0.10815011188387871, | |
| "num_tokens": 1466487.0, | |
| "step": 530 | |
| }, | |
| { | |
| "entropy": 6.666443109512329, | |
| "epoch": 0.014483925549915398, | |
| "grad_norm": 1.140625, | |
| "learning_rate": 0.00026700000000000004, | |
| "loss": 6.4193, | |
| "mean_token_accuracy": 0.107712272554636, | |
| "num_tokens": 1480142.0, | |
| "step": 535 | |
| }, | |
| { | |
| "entropy": 6.692905330657959, | |
| "epoch": 0.014619289340101522, | |
| "grad_norm": 1.2109375, | |
| "learning_rate": 0.00026950000000000005, | |
| "loss": 6.3428, | |
| "mean_token_accuracy": 0.1036965548992157, | |
| "num_tokens": 1493427.0, | |
| "step": 540 | |
| }, | |
| { | |
| "entropy": 6.6241538524627686, | |
| "epoch": 0.014754653130287648, | |
| "grad_norm": 1.21875, | |
| "learning_rate": 0.00027200000000000005, | |
| "loss": 6.3301, | |
| "mean_token_accuracy": 0.11499745398759842, | |
| "num_tokens": 1506055.0, | |
| "step": 545 | |
| }, | |
| { | |
| "entropy": 6.726637983322144, | |
| "epoch": 0.014890016920473773, | |
| "grad_norm": 1.15625, | |
| "learning_rate": 0.0002745, | |
| "loss": 6.4916, | |
| "mean_token_accuracy": 0.10548164397478103, | |
| "num_tokens": 1519239.0, | |
| "step": 550 | |
| }, | |
| { | |
| "entropy": 6.79321608543396, | |
| "epoch": 0.015025380710659899, | |
| "grad_norm": 1.2109375, | |
| "learning_rate": 0.000277, | |
| "loss": 6.4433, | |
| "mean_token_accuracy": 0.10511932224035263, | |
| "num_tokens": 1533630.0, | |
| "step": 555 | |
| }, | |
| { | |
| "entropy": 6.68529486656189, | |
| "epoch": 0.015160744500846023, | |
| "grad_norm": 1.4375, | |
| "learning_rate": 0.0002795, | |
| "loss": 6.3701, | |
| "mean_token_accuracy": 0.11614254266023635, | |
| "num_tokens": 1546749.0, | |
| "step": 560 | |
| }, | |
| { | |
| "entropy": 6.61783242225647, | |
| "epoch": 0.015296108291032149, | |
| "grad_norm": 1.1796875, | |
| "learning_rate": 0.00028199999999999997, | |
| "loss": 6.3126, | |
| "mean_token_accuracy": 0.11469681560993195, | |
| "num_tokens": 1560568.0, | |
| "step": 565 | |
| }, | |
| { | |
| "entropy": 6.697822999954224, | |
| "epoch": 0.015431472081218273, | |
| "grad_norm": 1.2734375, | |
| "learning_rate": 0.0002845, | |
| "loss": 6.383, | |
| "mean_token_accuracy": 0.10437465310096741, | |
| "num_tokens": 1574414.0, | |
| "step": 570 | |
| }, | |
| { | |
| "entropy": 6.622760200500489, | |
| "epoch": 0.0155668358714044, | |
| "grad_norm": 1.0625, | |
| "learning_rate": 0.000287, | |
| "loss": 6.3839, | |
| "mean_token_accuracy": 0.10195678994059562, | |
| "num_tokens": 1588906.0, | |
| "step": 575 | |
| }, | |
| { | |
| "entropy": 6.643900966644287, | |
| "epoch": 0.015702199661590525, | |
| "grad_norm": 1.0390625, | |
| "learning_rate": 0.0002895, | |
| "loss": 6.3656, | |
| "mean_token_accuracy": 0.11110272482037545, | |
| "num_tokens": 1603181.0, | |
| "step": 580 | |
| }, | |
| { | |
| "entropy": 6.722048425674439, | |
| "epoch": 0.01583756345177665, | |
| "grad_norm": 1.109375, | |
| "learning_rate": 0.000292, | |
| "loss": 6.365, | |
| "mean_token_accuracy": 0.1083282358944416, | |
| "num_tokens": 1617262.0, | |
| "step": 585 | |
| }, | |
| { | |
| "entropy": 6.704953336715699, | |
| "epoch": 0.015972927241962774, | |
| "grad_norm": 1.21875, | |
| "learning_rate": 0.0002945, | |
| "loss": 6.4147, | |
| "mean_token_accuracy": 0.10933435037732124, | |
| "num_tokens": 1631618.0, | |
| "step": 590 | |
| }, | |
| { | |
| "entropy": 6.532735300064087, | |
| "epoch": 0.016108291032148902, | |
| "grad_norm": 1.28125, | |
| "learning_rate": 0.000297, | |
| "loss": 6.1685, | |
| "mean_token_accuracy": 0.11916324943304062, | |
| "num_tokens": 1644717.0, | |
| "step": 595 | |
| }, | |
| { | |
| "entropy": 6.565193223953247, | |
| "epoch": 0.016243654822335026, | |
| "grad_norm": 1.0625, | |
| "learning_rate": 0.0002995, | |
| "loss": 6.3201, | |
| "mean_token_accuracy": 0.1078986182808876, | |
| "num_tokens": 1661888.0, | |
| "step": 600 | |
| }, | |
| { | |
| "entropy": 6.5602422714233395, | |
| "epoch": 0.01637901861252115, | |
| "grad_norm": 1.3203125, | |
| "learning_rate": 0.000302, | |
| "loss": 6.3369, | |
| "mean_token_accuracy": 0.11532969921827316, | |
| "num_tokens": 1676103.0, | |
| "step": 605 | |
| }, | |
| { | |
| "entropy": 6.621259689331055, | |
| "epoch": 0.016514382402707275, | |
| "grad_norm": 1.1796875, | |
| "learning_rate": 0.0003045, | |
| "loss": 6.3879, | |
| "mean_token_accuracy": 0.10770049318671227, | |
| "num_tokens": 1690902.0, | |
| "step": 610 | |
| }, | |
| { | |
| "entropy": 6.530938911437988, | |
| "epoch": 0.016649746192893403, | |
| "grad_norm": 1.140625, | |
| "learning_rate": 0.000307, | |
| "loss": 6.3262, | |
| "mean_token_accuracy": 0.11129384264349937, | |
| "num_tokens": 1705861.0, | |
| "step": 615 | |
| }, | |
| { | |
| "entropy": 6.601020479202271, | |
| "epoch": 0.016785109983079527, | |
| "grad_norm": 1.1796875, | |
| "learning_rate": 0.0003095, | |
| "loss": 6.2688, | |
| "mean_token_accuracy": 0.1109300784766674, | |
| "num_tokens": 1719893.0, | |
| "step": 620 | |
| }, | |
| { | |
| "entropy": 6.542957210540772, | |
| "epoch": 0.01692047377326565, | |
| "grad_norm": 1.2109375, | |
| "learning_rate": 0.000312, | |
| "loss": 6.2874, | |
| "mean_token_accuracy": 0.10827434211969375, | |
| "num_tokens": 1733411.0, | |
| "step": 625 | |
| }, | |
| { | |
| "entropy": 6.561354637145996, | |
| "epoch": 0.017055837563451776, | |
| "grad_norm": 1.2421875, | |
| "learning_rate": 0.0003145, | |
| "loss": 6.2397, | |
| "mean_token_accuracy": 0.11391478329896927, | |
| "num_tokens": 1747374.0, | |
| "step": 630 | |
| }, | |
| { | |
| "entropy": 6.587129735946656, | |
| "epoch": 0.017191201353637903, | |
| "grad_norm": 1.0546875, | |
| "learning_rate": 0.000317, | |
| "loss": 6.3487, | |
| "mean_token_accuracy": 0.11469378024339676, | |
| "num_tokens": 1761520.0, | |
| "step": 635 | |
| }, | |
| { | |
| "entropy": 6.594478893280029, | |
| "epoch": 0.017326565143824028, | |
| "grad_norm": 1.1796875, | |
| "learning_rate": 0.0003195, | |
| "loss": 6.3577, | |
| "mean_token_accuracy": 0.10972927659749984, | |
| "num_tokens": 1777499.0, | |
| "step": 640 | |
| }, | |
| { | |
| "entropy": 6.581266975402832, | |
| "epoch": 0.017461928934010152, | |
| "grad_norm": 1.1015625, | |
| "learning_rate": 0.000322, | |
| "loss": 6.2463, | |
| "mean_token_accuracy": 0.12096798866987228, | |
| "num_tokens": 1791308.0, | |
| "step": 645 | |
| }, | |
| { | |
| "entropy": 6.4111003398895265, | |
| "epoch": 0.017597292724196276, | |
| "grad_norm": 1.25, | |
| "learning_rate": 0.00032450000000000003, | |
| "loss": 6.1953, | |
| "mean_token_accuracy": 0.11683537811040878, | |
| "num_tokens": 1804545.0, | |
| "step": 650 | |
| }, | |
| { | |
| "entropy": 6.54813027381897, | |
| "epoch": 0.017732656514382404, | |
| "grad_norm": 1.2421875, | |
| "learning_rate": 0.00032700000000000003, | |
| "loss": 6.2866, | |
| "mean_token_accuracy": 0.11415853798389435, | |
| "num_tokens": 1818499.0, | |
| "step": 655 | |
| }, | |
| { | |
| "entropy": 6.5606420040130615, | |
| "epoch": 0.01786802030456853, | |
| "grad_norm": 1.125, | |
| "learning_rate": 0.00032950000000000004, | |
| "loss": 6.2876, | |
| "mean_token_accuracy": 0.10897349566221237, | |
| "num_tokens": 1833582.0, | |
| "step": 660 | |
| }, | |
| { | |
| "entropy": 6.524020147323609, | |
| "epoch": 0.018003384094754653, | |
| "grad_norm": 1.296875, | |
| "learning_rate": 0.00033200000000000005, | |
| "loss": 6.26, | |
| "mean_token_accuracy": 0.11666257977485657, | |
| "num_tokens": 1847514.0, | |
| "step": 665 | |
| }, | |
| { | |
| "entropy": 6.450877380371094, | |
| "epoch": 0.018138747884940777, | |
| "grad_norm": 1.2109375, | |
| "learning_rate": 0.00033450000000000005, | |
| "loss": 6.2948, | |
| "mean_token_accuracy": 0.11785768866539001, | |
| "num_tokens": 1860177.0, | |
| "step": 670 | |
| }, | |
| { | |
| "entropy": 6.518109226226807, | |
| "epoch": 0.018274111675126905, | |
| "grad_norm": 1.21875, | |
| "learning_rate": 0.000337, | |
| "loss": 6.3086, | |
| "mean_token_accuracy": 0.11776039749383926, | |
| "num_tokens": 1873317.0, | |
| "step": 675 | |
| }, | |
| { | |
| "entropy": 6.405819511413574, | |
| "epoch": 0.01840947546531303, | |
| "grad_norm": 1.1640625, | |
| "learning_rate": 0.0003395, | |
| "loss": 6.1447, | |
| "mean_token_accuracy": 0.11899075359106064, | |
| "num_tokens": 1885974.0, | |
| "step": 680 | |
| }, | |
| { | |
| "entropy": 6.473683166503906, | |
| "epoch": 0.018544839255499154, | |
| "grad_norm": 1.125, | |
| "learning_rate": 0.000342, | |
| "loss": 6.3167, | |
| "mean_token_accuracy": 0.11156651675701142, | |
| "num_tokens": 1901894.0, | |
| "step": 685 | |
| }, | |
| { | |
| "entropy": 6.5223006248474125, | |
| "epoch": 0.018680203045685278, | |
| "grad_norm": 1.234375, | |
| "learning_rate": 0.00034449999999999997, | |
| "loss": 6.2982, | |
| "mean_token_accuracy": 0.11568359285593033, | |
| "num_tokens": 1916276.0, | |
| "step": 690 | |
| }, | |
| { | |
| "entropy": 6.437406921386719, | |
| "epoch": 0.018815566835871406, | |
| "grad_norm": 1.09375, | |
| "learning_rate": 0.000347, | |
| "loss": 6.3, | |
| "mean_token_accuracy": 0.10904626250267029, | |
| "num_tokens": 1929574.0, | |
| "step": 695 | |
| }, | |
| { | |
| "entropy": 6.493116617202759, | |
| "epoch": 0.01895093062605753, | |
| "grad_norm": 1.2265625, | |
| "learning_rate": 0.0003495, | |
| "loss": 6.2389, | |
| "mean_token_accuracy": 0.10819176211953163, | |
| "num_tokens": 1943220.0, | |
| "step": 700 | |
| }, | |
| { | |
| "entropy": 6.54621901512146, | |
| "epoch": 0.019086294416243654, | |
| "grad_norm": 1.2265625, | |
| "learning_rate": 0.000352, | |
| "loss": 6.2556, | |
| "mean_token_accuracy": 0.10982774049043656, | |
| "num_tokens": 1957834.0, | |
| "step": 705 | |
| }, | |
| { | |
| "entropy": 6.512110996246338, | |
| "epoch": 0.01922165820642978, | |
| "grad_norm": 1.1015625, | |
| "learning_rate": 0.0003545, | |
| "loss": 6.3302, | |
| "mean_token_accuracy": 0.11116872280836106, | |
| "num_tokens": 1972649.0, | |
| "step": 710 | |
| }, | |
| { | |
| "entropy": 6.418754625320434, | |
| "epoch": 0.019357021996615906, | |
| "grad_norm": 1.265625, | |
| "learning_rate": 0.000357, | |
| "loss": 6.1538, | |
| "mean_token_accuracy": 0.12162703573703766, | |
| "num_tokens": 1984181.0, | |
| "step": 715 | |
| }, | |
| { | |
| "entropy": 6.399659919738769, | |
| "epoch": 0.01949238578680203, | |
| "grad_norm": 0.92578125, | |
| "learning_rate": 0.0003595, | |
| "loss": 6.2047, | |
| "mean_token_accuracy": 0.11393127739429473, | |
| "num_tokens": 2000616.0, | |
| "step": 720 | |
| }, | |
| { | |
| "entropy": 6.4549713134765625, | |
| "epoch": 0.019627749576988155, | |
| "grad_norm": 1.109375, | |
| "learning_rate": 0.000362, | |
| "loss": 6.1698, | |
| "mean_token_accuracy": 0.11860272511839867, | |
| "num_tokens": 2015344.0, | |
| "step": 725 | |
| }, | |
| { | |
| "entropy": 6.458272075653076, | |
| "epoch": 0.01976311336717428, | |
| "grad_norm": 1.15625, | |
| "learning_rate": 0.0003645, | |
| "loss": 6.2536, | |
| "mean_token_accuracy": 0.11021775305271149, | |
| "num_tokens": 2029823.0, | |
| "step": 730 | |
| }, | |
| { | |
| "entropy": 6.360110950469971, | |
| "epoch": 0.019898477157360407, | |
| "grad_norm": 1.234375, | |
| "learning_rate": 0.000367, | |
| "loss": 6.1363, | |
| "mean_token_accuracy": 0.11379259899258613, | |
| "num_tokens": 2043680.0, | |
| "step": 735 | |
| }, | |
| { | |
| "entropy": 6.4546263217926025, | |
| "epoch": 0.02003384094754653, | |
| "grad_norm": 1.2890625, | |
| "learning_rate": 0.0003695, | |
| "loss": 6.2118, | |
| "mean_token_accuracy": 0.11678453311324119, | |
| "num_tokens": 2056211.0, | |
| "step": 740 | |
| }, | |
| { | |
| "entropy": 6.301215696334839, | |
| "epoch": 0.020169204737732656, | |
| "grad_norm": 1.3125, | |
| "learning_rate": 0.000372, | |
| "loss": 6.2223, | |
| "mean_token_accuracy": 0.11474345549941063, | |
| "num_tokens": 2069775.0, | |
| "step": 745 | |
| }, | |
| { | |
| "entropy": 6.343719387054444, | |
| "epoch": 0.02030456852791878, | |
| "grad_norm": 1.2109375, | |
| "learning_rate": 0.0003745, | |
| "loss": 6.0669, | |
| "mean_token_accuracy": 0.12363717705011368, | |
| "num_tokens": 2084423.0, | |
| "step": 750 | |
| }, | |
| { | |
| "entropy": 6.379573202133178, | |
| "epoch": 0.020439932318104908, | |
| "grad_norm": 1.03125, | |
| "learning_rate": 0.000377, | |
| "loss": 6.2006, | |
| "mean_token_accuracy": 0.11517359465360641, | |
| "num_tokens": 2099702.0, | |
| "step": 755 | |
| }, | |
| { | |
| "entropy": 6.35660948753357, | |
| "epoch": 0.020575296108291032, | |
| "grad_norm": 0.98046875, | |
| "learning_rate": 0.0003795, | |
| "loss": 6.1424, | |
| "mean_token_accuracy": 0.116712386906147, | |
| "num_tokens": 2114938.0, | |
| "step": 760 | |
| }, | |
| { | |
| "entropy": 6.33174843788147, | |
| "epoch": 0.020710659898477157, | |
| "grad_norm": 1.09375, | |
| "learning_rate": 0.000382, | |
| "loss": 6.0715, | |
| "mean_token_accuracy": 0.12017848417162895, | |
| "num_tokens": 2128039.0, | |
| "step": 765 | |
| }, | |
| { | |
| "entropy": 6.483924388885498, | |
| "epoch": 0.02084602368866328, | |
| "grad_norm": 1.109375, | |
| "learning_rate": 0.0003845, | |
| "loss": 6.2675, | |
| "mean_token_accuracy": 0.11350229382514954, | |
| "num_tokens": 2144244.0, | |
| "step": 770 | |
| }, | |
| { | |
| "entropy": 6.299388790130616, | |
| "epoch": 0.02098138747884941, | |
| "grad_norm": 1.1875, | |
| "learning_rate": 0.00038700000000000003, | |
| "loss": 6.0745, | |
| "mean_token_accuracy": 0.12214050814509392, | |
| "num_tokens": 2156050.0, | |
| "step": 775 | |
| }, | |
| { | |
| "entropy": 6.339807558059692, | |
| "epoch": 0.021116751269035533, | |
| "grad_norm": 1.0703125, | |
| "learning_rate": 0.00038950000000000003, | |
| "loss": 6.1324, | |
| "mean_token_accuracy": 0.11614297851920127, | |
| "num_tokens": 2170083.0, | |
| "step": 780 | |
| }, | |
| { | |
| "entropy": 6.346547555923462, | |
| "epoch": 0.021252115059221657, | |
| "grad_norm": 1.1484375, | |
| "learning_rate": 0.00039200000000000004, | |
| "loss": 6.1194, | |
| "mean_token_accuracy": 0.12128575146198273, | |
| "num_tokens": 2184536.0, | |
| "step": 785 | |
| }, | |
| { | |
| "entropy": 6.332412433624268, | |
| "epoch": 0.021387478849407785, | |
| "grad_norm": 0.94140625, | |
| "learning_rate": 0.00039450000000000005, | |
| "loss": 6.1629, | |
| "mean_token_accuracy": 0.11224813610315323, | |
| "num_tokens": 2199324.0, | |
| "step": 790 | |
| }, | |
| { | |
| "entropy": 6.236615514755249, | |
| "epoch": 0.02152284263959391, | |
| "grad_norm": 1.0390625, | |
| "learning_rate": 0.00039700000000000005, | |
| "loss": 6.1244, | |
| "mean_token_accuracy": 0.1139693059027195, | |
| "num_tokens": 2215191.0, | |
| "step": 795 | |
| }, | |
| { | |
| "entropy": 6.423162221908569, | |
| "epoch": 0.021658206429780034, | |
| "grad_norm": 1.2109375, | |
| "learning_rate": 0.0003995, | |
| "loss": 6.1789, | |
| "mean_token_accuracy": 0.11178024560213089, | |
| "num_tokens": 2229354.0, | |
| "step": 800 | |
| }, | |
| { | |
| "entropy": 6.281933403015136, | |
| "epoch": 0.021793570219966158, | |
| "grad_norm": 1.0, | |
| "learning_rate": 0.000402, | |
| "loss": 6.1912, | |
| "mean_token_accuracy": 0.11805299371480941, | |
| "num_tokens": 2243804.0, | |
| "step": 805 | |
| }, | |
| { | |
| "entropy": 6.288844728469849, | |
| "epoch": 0.021928934010152286, | |
| "grad_norm": 1.140625, | |
| "learning_rate": 0.0004045, | |
| "loss": 6.0841, | |
| "mean_token_accuracy": 0.11569216102361679, | |
| "num_tokens": 2258267.0, | |
| "step": 810 | |
| }, | |
| { | |
| "entropy": 6.315207052230835, | |
| "epoch": 0.02206429780033841, | |
| "grad_norm": 1.0078125, | |
| "learning_rate": 0.00040699999999999997, | |
| "loss": 6.1319, | |
| "mean_token_accuracy": 0.12272850275039673, | |
| "num_tokens": 2271854.0, | |
| "step": 815 | |
| }, | |
| { | |
| "entropy": 6.263217782974243, | |
| "epoch": 0.022199661590524535, | |
| "grad_norm": 1.1484375, | |
| "learning_rate": 0.0004095, | |
| "loss": 6.1651, | |
| "mean_token_accuracy": 0.11350240483880043, | |
| "num_tokens": 2285897.0, | |
| "step": 820 | |
| }, | |
| { | |
| "entropy": 6.2891233444213865, | |
| "epoch": 0.02233502538071066, | |
| "grad_norm": 1.0703125, | |
| "learning_rate": 0.000412, | |
| "loss": 6.1208, | |
| "mean_token_accuracy": 0.11810638681054116, | |
| "num_tokens": 2299354.0, | |
| "step": 825 | |
| }, | |
| { | |
| "entropy": 6.323483896255493, | |
| "epoch": 0.022470389170896787, | |
| "grad_norm": 1.1171875, | |
| "learning_rate": 0.0004145, | |
| "loss": 6.1693, | |
| "mean_token_accuracy": 0.1183534987270832, | |
| "num_tokens": 2313111.0, | |
| "step": 830 | |
| }, | |
| { | |
| "entropy": 6.299751424789429, | |
| "epoch": 0.02260575296108291, | |
| "grad_norm": 1.21875, | |
| "learning_rate": 0.000417, | |
| "loss": 6.1459, | |
| "mean_token_accuracy": 0.12177513241767883, | |
| "num_tokens": 2325556.0, | |
| "step": 835 | |
| }, | |
| { | |
| "entropy": 6.354130220413208, | |
| "epoch": 0.022741116751269035, | |
| "grad_norm": 1.03125, | |
| "learning_rate": 0.0004195, | |
| "loss": 6.1991, | |
| "mean_token_accuracy": 0.11779833287000656, | |
| "num_tokens": 2340033.0, | |
| "step": 840 | |
| }, | |
| { | |
| "entropy": 6.290956926345825, | |
| "epoch": 0.02287648054145516, | |
| "grad_norm": 1.1015625, | |
| "learning_rate": 0.000422, | |
| "loss": 6.1439, | |
| "mean_token_accuracy": 0.12168726176023484, | |
| "num_tokens": 2353916.0, | |
| "step": 845 | |
| }, | |
| { | |
| "entropy": 6.26514630317688, | |
| "epoch": 0.023011844331641287, | |
| "grad_norm": 1.125, | |
| "learning_rate": 0.0004245, | |
| "loss": 6.1255, | |
| "mean_token_accuracy": 0.12298965677618981, | |
| "num_tokens": 2367161.0, | |
| "step": 850 | |
| }, | |
| { | |
| "entropy": 6.297455596923828, | |
| "epoch": 0.02314720812182741, | |
| "grad_norm": 1.0390625, | |
| "learning_rate": 0.000427, | |
| "loss": 6.1707, | |
| "mean_token_accuracy": 0.11453822180628777, | |
| "num_tokens": 2382562.0, | |
| "step": 855 | |
| }, | |
| { | |
| "entropy": 6.278497695922852, | |
| "epoch": 0.023282571912013536, | |
| "grad_norm": 1.21875, | |
| "learning_rate": 0.0004295, | |
| "loss": 6.084, | |
| "mean_token_accuracy": 0.12197378650307655, | |
| "num_tokens": 2395671.0, | |
| "step": 860 | |
| }, | |
| { | |
| "entropy": 6.201052713394165, | |
| "epoch": 0.02341793570219966, | |
| "grad_norm": 1.03125, | |
| "learning_rate": 0.000432, | |
| "loss": 6.1328, | |
| "mean_token_accuracy": 0.11925875097513199, | |
| "num_tokens": 2409902.0, | |
| "step": 865 | |
| }, | |
| { | |
| "entropy": 6.319374704360962, | |
| "epoch": 0.023553299492385788, | |
| "grad_norm": 1.0859375, | |
| "learning_rate": 0.0004345, | |
| "loss": 6.1155, | |
| "mean_token_accuracy": 0.11418568938970566, | |
| "num_tokens": 2424405.0, | |
| "step": 870 | |
| }, | |
| { | |
| "entropy": 6.211519432067871, | |
| "epoch": 0.023688663282571912, | |
| "grad_norm": 1.0078125, | |
| "learning_rate": 0.000437, | |
| "loss": 6.0401, | |
| "mean_token_accuracy": 0.11908271163702011, | |
| "num_tokens": 2440256.0, | |
| "step": 875 | |
| }, | |
| { | |
| "entropy": 6.258747959136963, | |
| "epoch": 0.023824027072758037, | |
| "grad_norm": 1.0703125, | |
| "learning_rate": 0.0004395, | |
| "loss": 6.1066, | |
| "mean_token_accuracy": 0.11787782683968544, | |
| "num_tokens": 2453224.0, | |
| "step": 880 | |
| }, | |
| { | |
| "entropy": 6.132023286819458, | |
| "epoch": 0.02395939086294416, | |
| "grad_norm": 1.0703125, | |
| "learning_rate": 0.000442, | |
| "loss": 5.9843, | |
| "mean_token_accuracy": 0.1226534366607666, | |
| "num_tokens": 2468101.0, | |
| "step": 885 | |
| }, | |
| { | |
| "entropy": 6.3332679271698, | |
| "epoch": 0.02409475465313029, | |
| "grad_norm": 0.99609375, | |
| "learning_rate": 0.0004445, | |
| "loss": 6.2065, | |
| "mean_token_accuracy": 0.12027881368994713, | |
| "num_tokens": 2483221.0, | |
| "step": 890 | |
| }, | |
| { | |
| "entropy": 6.218679809570313, | |
| "epoch": 0.024230118443316413, | |
| "grad_norm": 1.1796875, | |
| "learning_rate": 0.000447, | |
| "loss": 6.0992, | |
| "mean_token_accuracy": 0.11610312834382057, | |
| "num_tokens": 2496389.0, | |
| "step": 895 | |
| }, | |
| { | |
| "entropy": 6.1929422378540036, | |
| "epoch": 0.024365482233502538, | |
| "grad_norm": 1.1015625, | |
| "learning_rate": 0.00044950000000000003, | |
| "loss": 6.0435, | |
| "mean_token_accuracy": 0.11607689782977104, | |
| "num_tokens": 2510988.0, | |
| "step": 900 | |
| }, | |
| { | |
| "entropy": 6.248309087753296, | |
| "epoch": 0.024500846023688662, | |
| "grad_norm": 1.0625, | |
| "learning_rate": 0.00045200000000000004, | |
| "loss": 6.1425, | |
| "mean_token_accuracy": 0.12013140320777893, | |
| "num_tokens": 2525341.0, | |
| "step": 905 | |
| }, | |
| { | |
| "entropy": 6.198721647262573, | |
| "epoch": 0.02463620981387479, | |
| "grad_norm": 1.0859375, | |
| "learning_rate": 0.00045450000000000004, | |
| "loss": 6.1277, | |
| "mean_token_accuracy": 0.11830744370818139, | |
| "num_tokens": 2538706.0, | |
| "step": 910 | |
| }, | |
| { | |
| "entropy": 6.277400732040405, | |
| "epoch": 0.024771573604060914, | |
| "grad_norm": 1.0625, | |
| "learning_rate": 0.00045700000000000005, | |
| "loss": 6.1407, | |
| "mean_token_accuracy": 0.1180431790649891, | |
| "num_tokens": 2554056.0, | |
| "step": 915 | |
| }, | |
| { | |
| "entropy": 6.122376012802124, | |
| "epoch": 0.02490693739424704, | |
| "grad_norm": 1.2109375, | |
| "learning_rate": 0.00045950000000000006, | |
| "loss": 6.0363, | |
| "mean_token_accuracy": 0.12817837595939635, | |
| "num_tokens": 2569073.0, | |
| "step": 920 | |
| }, | |
| { | |
| "entropy": 6.23994255065918, | |
| "epoch": 0.025042301184433163, | |
| "grad_norm": 1.1328125, | |
| "learning_rate": 0.000462, | |
| "loss": 6.0807, | |
| "mean_token_accuracy": 0.12659804597496987, | |
| "num_tokens": 2582519.0, | |
| "step": 925 | |
| }, | |
| { | |
| "entropy": 6.254793930053711, | |
| "epoch": 0.02517766497461929, | |
| "grad_norm": 1.0390625, | |
| "learning_rate": 0.0004645, | |
| "loss": 6.138, | |
| "mean_token_accuracy": 0.11910348609089852, | |
| "num_tokens": 2597308.0, | |
| "step": 930 | |
| }, | |
| { | |
| "entropy": 6.186693382263184, | |
| "epoch": 0.025313028764805415, | |
| "grad_norm": 1.125, | |
| "learning_rate": 0.000467, | |
| "loss": 6.1146, | |
| "mean_token_accuracy": 0.12513377815485, | |
| "num_tokens": 2610388.0, | |
| "step": 935 | |
| }, | |
| { | |
| "entropy": 6.133151054382324, | |
| "epoch": 0.02544839255499154, | |
| "grad_norm": 1.1328125, | |
| "learning_rate": 0.0004695, | |
| "loss": 5.9744, | |
| "mean_token_accuracy": 0.1229440450668335, | |
| "num_tokens": 2624701.0, | |
| "step": 940 | |
| }, | |
| { | |
| "entropy": 6.227858448028565, | |
| "epoch": 0.025583756345177663, | |
| "grad_norm": 1.1328125, | |
| "learning_rate": 0.000472, | |
| "loss": 6.1629, | |
| "mean_token_accuracy": 0.11275116056203842, | |
| "num_tokens": 2639582.0, | |
| "step": 945 | |
| }, | |
| { | |
| "entropy": 6.088177108764649, | |
| "epoch": 0.02571912013536379, | |
| "grad_norm": 1.0390625, | |
| "learning_rate": 0.0004745, | |
| "loss": 5.9973, | |
| "mean_token_accuracy": 0.12648221775889396, | |
| "num_tokens": 2653808.0, | |
| "step": 950 | |
| }, | |
| { | |
| "entropy": 6.13272876739502, | |
| "epoch": 0.025854483925549916, | |
| "grad_norm": 1.0859375, | |
| "learning_rate": 0.000477, | |
| "loss": 6.001, | |
| "mean_token_accuracy": 0.12153996378183365, | |
| "num_tokens": 2667423.0, | |
| "step": 955 | |
| }, | |
| { | |
| "entropy": 6.150818300247193, | |
| "epoch": 0.02598984771573604, | |
| "grad_norm": 1.0625, | |
| "learning_rate": 0.0004795, | |
| "loss": 6.0237, | |
| "mean_token_accuracy": 0.12148027569055557, | |
| "num_tokens": 2683296.0, | |
| "step": 960 | |
| }, | |
| { | |
| "entropy": 6.043711376190186, | |
| "epoch": 0.026125211505922164, | |
| "grad_norm": 1.1640625, | |
| "learning_rate": 0.000482, | |
| "loss": 5.9768, | |
| "mean_token_accuracy": 0.13035187423229216, | |
| "num_tokens": 2697230.0, | |
| "step": 965 | |
| }, | |
| { | |
| "entropy": 6.165330123901367, | |
| "epoch": 0.026260575296108292, | |
| "grad_norm": 1.140625, | |
| "learning_rate": 0.0004845, | |
| "loss": 5.9685, | |
| "mean_token_accuracy": 0.1219008818268776, | |
| "num_tokens": 2711689.0, | |
| "step": 970 | |
| }, | |
| { | |
| "entropy": 6.072505140304566, | |
| "epoch": 0.026395939086294416, | |
| "grad_norm": 1.0234375, | |
| "learning_rate": 0.000487, | |
| "loss": 6.0051, | |
| "mean_token_accuracy": 0.12370155230164528, | |
| "num_tokens": 2725786.0, | |
| "step": 975 | |
| }, | |
| { | |
| "entropy": 6.097587728500367, | |
| "epoch": 0.02653130287648054, | |
| "grad_norm": 1.046875, | |
| "learning_rate": 0.0004895, | |
| "loss": 6.0078, | |
| "mean_token_accuracy": 0.12946900948882104, | |
| "num_tokens": 2739444.0, | |
| "step": 980 | |
| }, | |
| { | |
| "entropy": 6.165721845626831, | |
| "epoch": 0.02666666666666667, | |
| "grad_norm": 0.9140625, | |
| "learning_rate": 0.000492, | |
| "loss": 5.9966, | |
| "mean_token_accuracy": 0.12653872296214103, | |
| "num_tokens": 2754692.0, | |
| "step": 985 | |
| }, | |
| { | |
| "entropy": 6.010534715652466, | |
| "epoch": 0.026802030456852793, | |
| "grad_norm": 1.0625, | |
| "learning_rate": 0.0004945, | |
| "loss": 5.9195, | |
| "mean_token_accuracy": 0.1301392510533333, | |
| "num_tokens": 2767847.0, | |
| "step": 990 | |
| }, | |
| { | |
| "entropy": 6.176916885375976, | |
| "epoch": 0.026937394247038917, | |
| "grad_norm": 0.984375, | |
| "learning_rate": 0.000497, | |
| "loss": 6.147, | |
| "mean_token_accuracy": 0.11529367789626122, | |
| "num_tokens": 2783919.0, | |
| "step": 995 | |
| }, | |
| { | |
| "entropy": 6.178207778930664, | |
| "epoch": 0.02707275803722504, | |
| "grad_norm": 1.0390625, | |
| "learning_rate": 0.0004995, | |
| "loss": 6.049, | |
| "mean_token_accuracy": 0.11618730947375297, | |
| "num_tokens": 2797758.0, | |
| "step": 1000 | |
| }, | |
| { | |
| "entropy": 6.0772298812866214, | |
| "epoch": 0.02720812182741117, | |
| "grad_norm": 1.1640625, | |
| "learning_rate": 0.000499998026082006, | |
| "loss": 5.9816, | |
| "mean_token_accuracy": 0.12454243823885917, | |
| "num_tokens": 2811266.0, | |
| "step": 1005 | |
| }, | |
| { | |
| "entropy": 6.178618955612182, | |
| "epoch": 0.027343485617597293, | |
| "grad_norm": 1.0234375, | |
| "learning_rate": 0.0004999900070995136, | |
| "loss": 6.1008, | |
| "mean_token_accuracy": 0.12391449511051178, | |
| "num_tokens": 2825546.0, | |
| "step": 1010 | |
| }, | |
| { | |
| "entropy": 6.09156231880188, | |
| "epoch": 0.027478849407783418, | |
| "grad_norm": 1.1484375, | |
| "learning_rate": 0.0004999758199023239, | |
| "loss": 6.0494, | |
| "mean_token_accuracy": 0.12795282825827597, | |
| "num_tokens": 2840284.0, | |
| "step": 1015 | |
| }, | |
| { | |
| "entropy": 6.100447702407837, | |
| "epoch": 0.027614213197969542, | |
| "grad_norm": 1.1875, | |
| "learning_rate": 0.0004999554648793858, | |
| "loss": 6.0469, | |
| "mean_token_accuracy": 0.12443553805351257, | |
| "num_tokens": 2851891.0, | |
| "step": 1020 | |
| }, | |
| { | |
| "entropy": 6.141157817840576, | |
| "epoch": 0.02774957698815567, | |
| "grad_norm": 1.203125, | |
| "learning_rate": 0.0004999289425887425, | |
| "loss": 5.9993, | |
| "mean_token_accuracy": 0.12068658322095871, | |
| "num_tokens": 2864393.0, | |
| "step": 1025 | |
| }, | |
| { | |
| "entropy": 6.0899200439453125, | |
| "epoch": 0.027884940778341794, | |
| "grad_norm": 1.0390625, | |
| "learning_rate": 0.0004998962537575161, | |
| "loss": 6.0697, | |
| "mean_token_accuracy": 0.12269674092531205, | |
| "num_tokens": 2878581.0, | |
| "step": 1030 | |
| }, | |
| { | |
| "entropy": 6.183287048339844, | |
| "epoch": 0.02802030456852792, | |
| "grad_norm": 1.0234375, | |
| "learning_rate": 0.0004998573992818874, | |
| "loss": 6.1252, | |
| "mean_token_accuracy": 0.12084309384226799, | |
| "num_tokens": 2891217.0, | |
| "step": 1035 | |
| }, | |
| { | |
| "entropy": 6.048014736175537, | |
| "epoch": 0.028155668358714043, | |
| "grad_norm": 1.140625, | |
| "learning_rate": 0.0004998123802270715, | |
| "loss": 5.9877, | |
| "mean_token_accuracy": 0.1275292307138443, | |
| "num_tokens": 2902261.0, | |
| "step": 1040 | |
| }, | |
| { | |
| "entropy": 6.180945777893067, | |
| "epoch": 0.02829103214890017, | |
| "grad_norm": 1.15625, | |
| "learning_rate": 0.0004997611978272886, | |
| "loss": 6.0715, | |
| "mean_token_accuracy": 0.1172533318400383, | |
| "num_tokens": 2915455.0, | |
| "step": 1045 | |
| }, | |
| { | |
| "entropy": 6.057958126068115, | |
| "epoch": 0.028426395939086295, | |
| "grad_norm": 1.0546875, | |
| "learning_rate": 0.0004997038534857298, | |
| "loss": 6.0513, | |
| "mean_token_accuracy": 0.11567913889884948, | |
| "num_tokens": 2930873.0, | |
| "step": 1050 | |
| }, | |
| { | |
| "entropy": 6.126917505264283, | |
| "epoch": 0.02856175972927242, | |
| "grad_norm": 1.0390625, | |
| "learning_rate": 0.0004996403487745194, | |
| "loss": 6.0191, | |
| "mean_token_accuracy": 0.12455897256731988, | |
| "num_tokens": 2945768.0, | |
| "step": 1055 | |
| }, | |
| { | |
| "entropy": 6.160192489624023, | |
| "epoch": 0.028697123519458544, | |
| "grad_norm": 1.1015625, | |
| "learning_rate": 0.000499570685434671, | |
| "loss": 6.0718, | |
| "mean_token_accuracy": 0.12326753437519074, | |
| "num_tokens": 2960052.0, | |
| "step": 1060 | |
| }, | |
| { | |
| "entropy": 6.049477672576904, | |
| "epoch": 0.02883248730964467, | |
| "grad_norm": 1.1484375, | |
| "learning_rate": 0.0004994948653760405, | |
| "loss": 5.907, | |
| "mean_token_accuracy": 0.12975608184933662, | |
| "num_tokens": 2974252.0, | |
| "step": 1065 | |
| }, | |
| { | |
| "entropy": 5.922494602203369, | |
| "epoch": 0.028967851099830796, | |
| "grad_norm": 1.03125, | |
| "learning_rate": 0.0004994128906772729, | |
| "loss": 5.9723, | |
| "mean_token_accuracy": 0.12408508732914925, | |
| "num_tokens": 2988414.0, | |
| "step": 1070 | |
| }, | |
| { | |
| "entropy": 6.076635503768921, | |
| "epoch": 0.02910321489001692, | |
| "grad_norm": 0.94140625, | |
| "learning_rate": 0.000499324763585746, | |
| "loss": 6.0159, | |
| "mean_token_accuracy": 0.12376472353935242, | |
| "num_tokens": 3005833.0, | |
| "step": 1075 | |
| }, | |
| { | |
| "entropy": 6.0643566131591795, | |
| "epoch": 0.029238578680203044, | |
| "grad_norm": 0.91796875, | |
| "learning_rate": 0.0004992304865175085, | |
| "loss": 6.0162, | |
| "mean_token_accuracy": 0.11739084795117379, | |
| "num_tokens": 3019722.0, | |
| "step": 1080 | |
| }, | |
| { | |
| "entropy": 6.0612537384033205, | |
| "epoch": 0.029373942470389172, | |
| "grad_norm": 1.015625, | |
| "learning_rate": 0.0004991300620572138, | |
| "loss": 5.9597, | |
| "mean_token_accuracy": 0.12137619629502297, | |
| "num_tokens": 3033643.0, | |
| "step": 1085 | |
| }, | |
| { | |
| "entropy": 6.003667545318604, | |
| "epoch": 0.029509306260575296, | |
| "grad_norm": 1.0234375, | |
| "learning_rate": 0.0004990234929580494, | |
| "loss": 5.9007, | |
| "mean_token_accuracy": 0.12919754460453986, | |
| "num_tokens": 3047311.0, | |
| "step": 1090 | |
| }, | |
| { | |
| "entropy": 6.16131591796875, | |
| "epoch": 0.02964467005076142, | |
| "grad_norm": 1.1875, | |
| "learning_rate": 0.0004989107821416609, | |
| "loss": 6.0886, | |
| "mean_token_accuracy": 0.12004212662577629, | |
| "num_tokens": 3062823.0, | |
| "step": 1095 | |
| }, | |
| { | |
| "entropy": 6.068430328369141, | |
| "epoch": 0.029780033840947545, | |
| "grad_norm": 1.0625, | |
| "learning_rate": 0.0004987919326980723, | |
| "loss": 5.9748, | |
| "mean_token_accuracy": 0.13052917644381523, | |
| "num_tokens": 3076828.0, | |
| "step": 1100 | |
| }, | |
| { | |
| "entropy": 5.9808131694793705, | |
| "epoch": 0.029915397631133673, | |
| "grad_norm": 1.1796875, | |
| "learning_rate": 0.0004986669478856011, | |
| "loss": 5.9151, | |
| "mean_token_accuracy": 0.132940074801445, | |
| "num_tokens": 3089369.0, | |
| "step": 1105 | |
| }, | |
| { | |
| "entropy": 6.049989414215088, | |
| "epoch": 0.030050761421319797, | |
| "grad_norm": 1.1484375, | |
| "learning_rate": 0.0004985358311307688, | |
| "loss": 6.0077, | |
| "mean_token_accuracy": 0.13002250343561172, | |
| "num_tokens": 3100518.0, | |
| "step": 1110 | |
| }, | |
| { | |
| "entropy": 6.067233991622925, | |
| "epoch": 0.03018612521150592, | |
| "grad_norm": 1.1484375, | |
| "learning_rate": 0.0004983985860282081, | |
| "loss": 5.9342, | |
| "mean_token_accuracy": 0.1303796499967575, | |
| "num_tokens": 3113599.0, | |
| "step": 1115 | |
| }, | |
| { | |
| "entropy": 5.986032724380493, | |
| "epoch": 0.030321489001692046, | |
| "grad_norm": 0.9765625, | |
| "learning_rate": 0.0004982552163405623, | |
| "loss": 5.9344, | |
| "mean_token_accuracy": 0.13099692836403848, | |
| "num_tokens": 3126725.0, | |
| "step": 1120 | |
| }, | |
| { | |
| "entropy": 6.01772027015686, | |
| "epoch": 0.030456852791878174, | |
| "grad_norm": 1.1171875, | |
| "learning_rate": 0.0004981057259983839, | |
| "loss": 5.9407, | |
| "mean_token_accuracy": 0.13005468547344207, | |
| "num_tokens": 3140170.0, | |
| "step": 1125 | |
| }, | |
| { | |
| "entropy": 5.947785377502441, | |
| "epoch": 0.030592216582064298, | |
| "grad_norm": 0.953125, | |
| "learning_rate": 0.0004979501191000262, | |
| "loss": 5.9137, | |
| "mean_token_accuracy": 0.12703290432691575, | |
| "num_tokens": 3154154.0, | |
| "step": 1130 | |
| }, | |
| { | |
| "entropy": 6.0017212390899655, | |
| "epoch": 0.030727580372250422, | |
| "grad_norm": 0.98046875, | |
| "learning_rate": 0.0004977883999115311, | |
| "loss": 5.9814, | |
| "mean_token_accuracy": 0.12780916765332223, | |
| "num_tokens": 3170061.0, | |
| "step": 1135 | |
| }, | |
| { | |
| "entropy": 6.102719736099243, | |
| "epoch": 0.030862944162436547, | |
| "grad_norm": 1.1875, | |
| "learning_rate": 0.0004976205728665113, | |
| "loss": 6.0419, | |
| "mean_token_accuracy": 0.12874573692679406, | |
| "num_tokens": 3183167.0, | |
| "step": 1140 | |
| }, | |
| { | |
| "entropy": 5.993436717987061, | |
| "epoch": 0.030998307952622674, | |
| "grad_norm": 1.046875, | |
| "learning_rate": 0.0004974466425660307, | |
| "loss": 6.1286, | |
| "mean_token_accuracy": 0.1163134016096592, | |
| "num_tokens": 3197764.0, | |
| "step": 1145 | |
| }, | |
| { | |
| "entropy": 6.101684427261352, | |
| "epoch": 0.0311336717428088, | |
| "grad_norm": 0.9375, | |
| "learning_rate": 0.0004972666137784759, | |
| "loss": 5.8899, | |
| "mean_token_accuracy": 0.12967644035816192, | |
| "num_tokens": 3212909.0, | |
| "step": 1150 | |
| }, | |
| { | |
| "entropy": 6.056351280212402, | |
| "epoch": 0.03126903553299493, | |
| "grad_norm": 1.1640625, | |
| "learning_rate": 0.0004970804914394271, | |
| "loss": 6.0213, | |
| "mean_token_accuracy": 0.12962342649698258, | |
| "num_tokens": 3224140.0, | |
| "step": 1155 | |
| }, | |
| { | |
| "entropy": 5.998062562942505, | |
| "epoch": 0.03140439932318105, | |
| "grad_norm": 1.15625, | |
| "learning_rate": 0.0004968882806515225, | |
| "loss": 5.959, | |
| "mean_token_accuracy": 0.13079651519656182, | |
| "num_tokens": 3237827.0, | |
| "step": 1160 | |
| }, | |
| { | |
| "entropy": 6.0129087448120115, | |
| "epoch": 0.031539763113367175, | |
| "grad_norm": 1.1015625, | |
| "learning_rate": 0.0004966899866843177, | |
| "loss": 5.9242, | |
| "mean_token_accuracy": 0.12941501662135124, | |
| "num_tokens": 3250552.0, | |
| "step": 1165 | |
| }, | |
| { | |
| "entropy": 5.929322099685669, | |
| "epoch": 0.0316751269035533, | |
| "grad_norm": 1.1171875, | |
| "learning_rate": 0.000496485614974142, | |
| "loss": 5.9082, | |
| "mean_token_accuracy": 0.13116575181484222, | |
| "num_tokens": 3265108.0, | |
| "step": 1170 | |
| }, | |
| { | |
| "entropy": 5.910490798950195, | |
| "epoch": 0.031810490693739424, | |
| "grad_norm": 1.1171875, | |
| "learning_rate": 0.0004962751711239492, | |
| "loss": 5.8957, | |
| "mean_token_accuracy": 0.13716685473918916, | |
| "num_tokens": 3277399.0, | |
| "step": 1175 | |
| }, | |
| { | |
| "entropy": 5.90950288772583, | |
| "epoch": 0.03194585448392555, | |
| "grad_norm": 0.96875, | |
| "learning_rate": 0.0004960586609031636, | |
| "loss": 5.8656, | |
| "mean_token_accuracy": 0.13133470267057418, | |
| "num_tokens": 3292261.0, | |
| "step": 1180 | |
| }, | |
| { | |
| "entropy": 6.02558069229126, | |
| "epoch": 0.03208121827411167, | |
| "grad_norm": 1.015625, | |
| "learning_rate": 0.0004958360902475224, | |
| "loss": 5.9481, | |
| "mean_token_accuracy": 0.12776122540235518, | |
| "num_tokens": 3305914.0, | |
| "step": 1185 | |
| }, | |
| { | |
| "entropy": 5.877729225158691, | |
| "epoch": 0.032216582064297804, | |
| "grad_norm": 1.046875, | |
| "learning_rate": 0.0004956074652589125, | |
| "loss": 5.8461, | |
| "mean_token_accuracy": 0.13402740731835366, | |
| "num_tokens": 3319731.0, | |
| "step": 1190 | |
| }, | |
| { | |
| "entropy": 5.983613348007202, | |
| "epoch": 0.03235194585448393, | |
| "grad_norm": 0.91796875, | |
| "learning_rate": 0.0004953727922052035, | |
| "loss": 5.9026, | |
| "mean_token_accuracy": 0.1287564866244793, | |
| "num_tokens": 3335865.0, | |
| "step": 1195 | |
| }, | |
| { | |
| "entropy": 5.955887413024902, | |
| "epoch": 0.03248730964467005, | |
| "grad_norm": 1.0, | |
| "learning_rate": 0.0004951320775200756, | |
| "loss": 5.8795, | |
| "mean_token_accuracy": 0.13347595036029816, | |
| "num_tokens": 3350692.0, | |
| "step": 1200 | |
| }, | |
| { | |
| "entropy": 5.869665241241455, | |
| "epoch": 0.03262267343485618, | |
| "grad_norm": 1.0625, | |
| "learning_rate": 0.0004948853278028436, | |
| "loss": 5.8414, | |
| "mean_token_accuracy": 0.1349584087729454, | |
| "num_tokens": 3364477.0, | |
| "step": 1205 | |
| }, | |
| { | |
| "entropy": 6.077768468856812, | |
| "epoch": 0.0327580372250423, | |
| "grad_norm": 1.015625, | |
| "learning_rate": 0.0004946325498182755, | |
| "loss": 6.0202, | |
| "mean_token_accuracy": 0.13227369338274003, | |
| "num_tokens": 3377976.0, | |
| "step": 1210 | |
| }, | |
| { | |
| "entropy": 5.928851127624512, | |
| "epoch": 0.032893401015228425, | |
| "grad_norm": 1.1328125, | |
| "learning_rate": 0.0004943737504964076, | |
| "loss": 5.8941, | |
| "mean_token_accuracy": 0.13219523280858994, | |
| "num_tokens": 3391797.0, | |
| "step": 1215 | |
| }, | |
| { | |
| "entropy": 5.968907499313355, | |
| "epoch": 0.03302876480541455, | |
| "grad_norm": 1.046875, | |
| "learning_rate": 0.000494108936932354, | |
| "loss": 5.904, | |
| "mean_token_accuracy": 0.1308644212782383, | |
| "num_tokens": 3406175.0, | |
| "step": 1220 | |
| }, | |
| { | |
| "entropy": 5.953116321563721, | |
| "epoch": 0.033164128595600674, | |
| "grad_norm": 1.0078125, | |
| "learning_rate": 0.0004938381163861124, | |
| "loss": 5.8953, | |
| "mean_token_accuracy": 0.13571116998791694, | |
| "num_tokens": 3419314.0, | |
| "step": 1225 | |
| }, | |
| { | |
| "entropy": 5.968687200546265, | |
| "epoch": 0.033299492385786805, | |
| "grad_norm": 0.91015625, | |
| "learning_rate": 0.0004935612962823645, | |
| "loss": 5.9639, | |
| "mean_token_accuracy": 0.12865443304181098, | |
| "num_tokens": 3436286.0, | |
| "step": 1230 | |
| }, | |
| { | |
| "entropy": 5.994656372070312, | |
| "epoch": 0.03343485617597293, | |
| "grad_norm": 1.046875, | |
| "learning_rate": 0.0004932784842102739, | |
| "loss": 5.9152, | |
| "mean_token_accuracy": 0.13279383033514022, | |
| "num_tokens": 3450743.0, | |
| "step": 1235 | |
| }, | |
| { | |
| "entropy": 5.880604553222656, | |
| "epoch": 0.033570219966159054, | |
| "grad_norm": 0.96484375, | |
| "learning_rate": 0.0004929896879232758, | |
| "loss": 5.9593, | |
| "mean_token_accuracy": 0.1276319444179535, | |
| "num_tokens": 3465265.0, | |
| "step": 1240 | |
| }, | |
| { | |
| "entropy": 6.054373121261596, | |
| "epoch": 0.03370558375634518, | |
| "grad_norm": 1.046875, | |
| "learning_rate": 0.0004926949153388668, | |
| "loss": 5.9635, | |
| "mean_token_accuracy": 0.13033603355288506, | |
| "num_tokens": 3479850.0, | |
| "step": 1245 | |
| }, | |
| { | |
| "entropy": 6.004738473892212, | |
| "epoch": 0.0338409475465313, | |
| "grad_norm": 0.93359375, | |
| "learning_rate": 0.0004923941745383859, | |
| "loss": 6.0149, | |
| "mean_token_accuracy": 0.12755341306328774, | |
| "num_tokens": 3494388.0, | |
| "step": 1250 | |
| }, | |
| { | |
| "entropy": 6.05593056678772, | |
| "epoch": 0.03397631133671743, | |
| "grad_norm": 1.0234375, | |
| "learning_rate": 0.000492087473766794, | |
| "loss": 5.9944, | |
| "mean_token_accuracy": 0.129459198564291, | |
| "num_tokens": 3508609.0, | |
| "step": 1255 | |
| }, | |
| { | |
| "entropy": 5.989010000228882, | |
| "epoch": 0.03411167512690355, | |
| "grad_norm": 0.84765625, | |
| "learning_rate": 0.000491774821432448, | |
| "loss": 5.9484, | |
| "mean_token_accuracy": 0.12573069110512733, | |
| "num_tokens": 3524252.0, | |
| "step": 1260 | |
| }, | |
| { | |
| "entropy": 5.86044340133667, | |
| "epoch": 0.034247038917089676, | |
| "grad_norm": 0.91796875, | |
| "learning_rate": 0.0004914562261068693, | |
| "loss": 5.8538, | |
| "mean_token_accuracy": 0.13299454674124717, | |
| "num_tokens": 3540431.0, | |
| "step": 1265 | |
| }, | |
| { | |
| "entropy": 5.977858638763427, | |
| "epoch": 0.03438240270727581, | |
| "grad_norm": 1.0234375, | |
| "learning_rate": 0.0004911316965245098, | |
| "loss": 5.936, | |
| "mean_token_accuracy": 0.1308388702571392, | |
| "num_tokens": 3555452.0, | |
| "step": 1270 | |
| }, | |
| { | |
| "entropy": 5.904463481903076, | |
| "epoch": 0.03451776649746193, | |
| "grad_norm": 0.94921875, | |
| "learning_rate": 0.000490801241582512, | |
| "loss": 5.8326, | |
| "mean_token_accuracy": 0.13622485026717185, | |
| "num_tokens": 3569414.0, | |
| "step": 1275 | |
| }, | |
| { | |
| "entropy": 5.986747741699219, | |
| "epoch": 0.034653130287648055, | |
| "grad_norm": 1.1484375, | |
| "learning_rate": 0.000490464870340465, | |
| "loss": 6.0092, | |
| "mean_token_accuracy": 0.12418872565031051, | |
| "num_tokens": 3585926.0, | |
| "step": 1280 | |
| }, | |
| { | |
| "entropy": 5.979127502441406, | |
| "epoch": 0.03478849407783418, | |
| "grad_norm": 1.0703125, | |
| "learning_rate": 0.0004901225920201563, | |
| "loss": 5.8517, | |
| "mean_token_accuracy": 0.12628912925720215, | |
| "num_tokens": 3598692.0, | |
| "step": 1285 | |
| }, | |
| { | |
| "entropy": 5.866104936599731, | |
| "epoch": 0.034923857868020304, | |
| "grad_norm": 1.1015625, | |
| "learning_rate": 0.000489774416005319, | |
| "loss": 5.8145, | |
| "mean_token_accuracy": 0.13827023953199385, | |
| "num_tokens": 3610579.0, | |
| "step": 1290 | |
| }, | |
| { | |
| "entropy": 5.940866851806641, | |
| "epoch": 0.03505922165820643, | |
| "grad_norm": 1.0, | |
| "learning_rate": 0.0004894203518413742, | |
| "loss": 5.8967, | |
| "mean_token_accuracy": 0.13155581057071686, | |
| "num_tokens": 3622955.0, | |
| "step": 1295 | |
| }, | |
| { | |
| "entropy": 5.965740633010864, | |
| "epoch": 0.03519458544839255, | |
| "grad_norm": 1.1328125, | |
| "learning_rate": 0.0004890604092351701, | |
| "loss": 5.848, | |
| "mean_token_accuracy": 0.13300148025155067, | |
| "num_tokens": 3636465.0, | |
| "step": 1300 | |
| }, | |
| { | |
| "entropy": 5.9097521781921385, | |
| "epoch": 0.03532994923857868, | |
| "grad_norm": 0.93359375, | |
| "learning_rate": 0.000488694598054715, | |
| "loss": 5.8418, | |
| "mean_token_accuracy": 0.13007594645023346, | |
| "num_tokens": 3650490.0, | |
| "step": 1305 | |
| }, | |
| { | |
| "entropy": 5.989442920684814, | |
| "epoch": 0.03546531302876481, | |
| "grad_norm": 0.96484375, | |
| "learning_rate": 0.0004883229283289071, | |
| "loss": 5.9325, | |
| "mean_token_accuracy": 0.13511626422405243, | |
| "num_tokens": 3666952.0, | |
| "step": 1310 | |
| }, | |
| { | |
| "entropy": 5.868106698989868, | |
| "epoch": 0.03560067681895093, | |
| "grad_norm": 0.88671875, | |
| "learning_rate": 0.00048794541024725993, | |
| "loss": 5.8828, | |
| "mean_token_accuracy": 0.13127233758568763, | |
| "num_tokens": 3681741.0, | |
| "step": 1315 | |
| }, | |
| { | |
| "entropy": 6.05716724395752, | |
| "epoch": 0.03573604060913706, | |
| "grad_norm": 0.98046875, | |
| "learning_rate": 0.0004875620541596221, | |
| "loss": 6.0203, | |
| "mean_token_accuracy": 0.12015189900994301, | |
| "num_tokens": 3696309.0, | |
| "step": 1320 | |
| }, | |
| { | |
| "entropy": 5.87901759147644, | |
| "epoch": 0.03587140439932318, | |
| "grad_norm": 1.0, | |
| "learning_rate": 0.00048717287057589454, | |
| "loss": 5.8183, | |
| "mean_token_accuracy": 0.13341830670833588, | |
| "num_tokens": 3710972.0, | |
| "step": 1325 | |
| }, | |
| { | |
| "entropy": 5.910233020782471, | |
| "epoch": 0.036006768189509306, | |
| "grad_norm": 1.046875, | |
| "learning_rate": 0.0004867778701657417, | |
| "loss": 5.8272, | |
| "mean_token_accuracy": 0.1385295033454895, | |
| "num_tokens": 3723619.0, | |
| "step": 1330 | |
| }, | |
| { | |
| "entropy": 5.879352235794068, | |
| "epoch": 0.03614213197969543, | |
| "grad_norm": 0.984375, | |
| "learning_rate": 0.00048637706375829955, | |
| "loss": 5.8317, | |
| "mean_token_accuracy": 0.13691574931144715, | |
| "num_tokens": 3736947.0, | |
| "step": 1335 | |
| }, | |
| { | |
| "entropy": 5.879655885696411, | |
| "epoch": 0.036277495769881554, | |
| "grad_norm": 1.0234375, | |
| "learning_rate": 0.000485970462341878, | |
| "loss": 5.8283, | |
| "mean_token_accuracy": 0.13367267698049545, | |
| "num_tokens": 3751488.0, | |
| "step": 1340 | |
| }, | |
| { | |
| "entropy": 5.861524868011474, | |
| "epoch": 0.03641285956006768, | |
| "grad_norm": 1.1015625, | |
| "learning_rate": 0.00048555807706366044, | |
| "loss": 5.8149, | |
| "mean_token_accuracy": 0.12982808873057367, | |
| "num_tokens": 3764169.0, | |
| "step": 1345 | |
| }, | |
| { | |
| "entropy": 5.923907041549683, | |
| "epoch": 0.03654822335025381, | |
| "grad_norm": 1.0390625, | |
| "learning_rate": 0.00048513991922939756, | |
| "loss": 5.8853, | |
| "mean_token_accuracy": 0.1327181950211525, | |
| "num_tokens": 3777786.0, | |
| "step": 1350 | |
| }, | |
| { | |
| "entropy": 5.872652530670166, | |
| "epoch": 0.036683587140439934, | |
| "grad_norm": 0.984375, | |
| "learning_rate": 0.00048471600030309744, | |
| "loss": 5.7489, | |
| "mean_token_accuracy": 0.13938361927866935, | |
| "num_tokens": 3793618.0, | |
| "step": 1355 | |
| }, | |
| { | |
| "entropy": 5.832516002655029, | |
| "epoch": 0.03681895093062606, | |
| "grad_norm": 0.953125, | |
| "learning_rate": 0.00048428633190671186, | |
| "loss": 5.7986, | |
| "mean_token_accuracy": 0.13645398393273353, | |
| "num_tokens": 3807477.0, | |
| "step": 1360 | |
| }, | |
| { | |
| "entropy": 5.874223041534424, | |
| "epoch": 0.03695431472081218, | |
| "grad_norm": 0.921875, | |
| "learning_rate": 0.0004838509258198167, | |
| "loss": 5.7628, | |
| "mean_token_accuracy": 0.1414404109120369, | |
| "num_tokens": 3821423.0, | |
| "step": 1365 | |
| }, | |
| { | |
| "entropy": 5.7999297142028805, | |
| "epoch": 0.03708967851099831, | |
| "grad_norm": 1.0703125, | |
| "learning_rate": 0.00048340979397929, | |
| "loss": 5.8377, | |
| "mean_token_accuracy": 0.13525271713733672, | |
| "num_tokens": 3835023.0, | |
| "step": 1370 | |
| }, | |
| { | |
| "entropy": 5.952495384216308, | |
| "epoch": 0.03722504230118443, | |
| "grad_norm": 0.98828125, | |
| "learning_rate": 0.00048296294847898386, | |
| "loss": 5.8599, | |
| "mean_token_accuracy": 0.13231865540146828, | |
| "num_tokens": 3849230.0, | |
| "step": 1375 | |
| }, | |
| { | |
| "entropy": 5.886288738250732, | |
| "epoch": 0.037360406091370556, | |
| "grad_norm": 1.09375, | |
| "learning_rate": 0.0004825104015693934, | |
| "loss": 5.8341, | |
| "mean_token_accuracy": 0.1299556814134121, | |
| "num_tokens": 3863884.0, | |
| "step": 1380 | |
| }, | |
| { | |
| "entropy": 5.7548364162445065, | |
| "epoch": 0.03749576988155669, | |
| "grad_norm": 1.1796875, | |
| "learning_rate": 0.0004820521656573208, | |
| "loss": 5.6259, | |
| "mean_token_accuracy": 0.14474526271224022, | |
| "num_tokens": 3875444.0, | |
| "step": 1385 | |
| }, | |
| { | |
| "entropy": 5.954405307769775, | |
| "epoch": 0.03763113367174281, | |
| "grad_norm": 1.046875, | |
| "learning_rate": 0.00048158825330553505, | |
| "loss": 5.9888, | |
| "mean_token_accuracy": 0.132489612698555, | |
| "num_tokens": 3888875.0, | |
| "step": 1390 | |
| }, | |
| { | |
| "entropy": 5.784528350830078, | |
| "epoch": 0.037766497461928936, | |
| "grad_norm": 1.0, | |
| "learning_rate": 0.00048111867723242763, | |
| "loss": 5.7374, | |
| "mean_token_accuracy": 0.13683436438441277, | |
| "num_tokens": 3904124.0, | |
| "step": 1395 | |
| }, | |
| { | |
| "entropy": 5.800213289260864, | |
| "epoch": 0.03790186125211506, | |
| "grad_norm": 0.99609375, | |
| "learning_rate": 0.0004806434503116637, | |
| "loss": 5.7543, | |
| "mean_token_accuracy": 0.1421910360455513, | |
| "num_tokens": 3917976.0, | |
| "step": 1400 | |
| }, | |
| { | |
| "entropy": 5.8708749294281, | |
| "epoch": 0.038037225042301184, | |
| "grad_norm": 0.98046875, | |
| "learning_rate": 0.0004801625855718296, | |
| "loss": 5.8518, | |
| "mean_token_accuracy": 0.13218354880809785, | |
| "num_tokens": 3932835.0, | |
| "step": 1405 | |
| }, | |
| { | |
| "entropy": 5.92179274559021, | |
| "epoch": 0.03817258883248731, | |
| "grad_norm": 0.95703125, | |
| "learning_rate": 0.00047967609619607477, | |
| "loss": 5.7986, | |
| "mean_token_accuracy": 0.14245062917470933, | |
| "num_tokens": 3945938.0, | |
| "step": 1410 | |
| }, | |
| { | |
| "entropy": 5.76557936668396, | |
| "epoch": 0.03830795262267343, | |
| "grad_norm": 1.1484375, | |
| "learning_rate": 0.0004791839955217513, | |
| "loss": 5.7599, | |
| "mean_token_accuracy": 0.14098661318421363, | |
| "num_tokens": 3958447.0, | |
| "step": 1415 | |
| }, | |
| { | |
| "entropy": 5.868845748901367, | |
| "epoch": 0.03844331641285956, | |
| "grad_norm": 1.015625, | |
| "learning_rate": 0.00047868629704004786, | |
| "loss": 5.871, | |
| "mean_token_accuracy": 0.13354070782661437, | |
| "num_tokens": 3972105.0, | |
| "step": 1420 | |
| }, | |
| { | |
| "entropy": 5.96793303489685, | |
| "epoch": 0.03857868020304569, | |
| "grad_norm": 1.0234375, | |
| "learning_rate": 0.00047818301439561965, | |
| "loss": 5.835, | |
| "mean_token_accuracy": 0.13661837428808213, | |
| "num_tokens": 3984935.0, | |
| "step": 1425 | |
| }, | |
| { | |
| "entropy": 5.800432634353638, | |
| "epoch": 0.03871404399323181, | |
| "grad_norm": 0.984375, | |
| "learning_rate": 0.00047767416138621454, | |
| "loss": 5.8082, | |
| "mean_token_accuracy": 0.13442106992006303, | |
| "num_tokens": 3998223.0, | |
| "step": 1430 | |
| }, | |
| { | |
| "entropy": 5.826992130279541, | |
| "epoch": 0.03884940778341794, | |
| "grad_norm": 0.953125, | |
| "learning_rate": 0.000477159751962295, | |
| "loss": 5.7446, | |
| "mean_token_accuracy": 0.14261322766542434, | |
| "num_tokens": 4012876.0, | |
| "step": 1435 | |
| }, | |
| { | |
| "entropy": 5.842947864532471, | |
| "epoch": 0.03898477157360406, | |
| "grad_norm": 1.015625, | |
| "learning_rate": 0.00047663980022665507, | |
| "loss": 5.7954, | |
| "mean_token_accuracy": 0.1379825048148632, | |
| "num_tokens": 4025607.0, | |
| "step": 1440 | |
| }, | |
| { | |
| "entropy": 5.807746267318725, | |
| "epoch": 0.039120135363790186, | |
| "grad_norm": 0.984375, | |
| "learning_rate": 0.00047611432043403437, | |
| "loss": 5.7896, | |
| "mean_token_accuracy": 0.13704527392983437, | |
| "num_tokens": 4038093.0, | |
| "step": 1445 | |
| }, | |
| { | |
| "entropy": 5.849174070358276, | |
| "epoch": 0.03925549915397631, | |
| "grad_norm": 0.92578125, | |
| "learning_rate": 0.0004755833269907267, | |
| "loss": 5.8395, | |
| "mean_token_accuracy": 0.13505658283829688, | |
| "num_tokens": 4052159.0, | |
| "step": 1450 | |
| }, | |
| { | |
| "entropy": 5.945993661880493, | |
| "epoch": 0.039390862944162434, | |
| "grad_norm": 1.0859375, | |
| "learning_rate": 0.0004750468344541857, | |
| "loss": 5.8492, | |
| "mean_token_accuracy": 0.1315135531127453, | |
| "num_tokens": 4065893.0, | |
| "step": 1455 | |
| }, | |
| { | |
| "entropy": 5.7644538402557375, | |
| "epoch": 0.03952622673434856, | |
| "grad_norm": 0.96875, | |
| "learning_rate": 0.00047450485753262525, | |
| "loss": 5.8021, | |
| "mean_token_accuracy": 0.1386327899992466, | |
| "num_tokens": 4079274.0, | |
| "step": 1460 | |
| }, | |
| { | |
| "entropy": 5.907123756408692, | |
| "epoch": 0.03966159052453469, | |
| "grad_norm": 1.046875, | |
| "learning_rate": 0.00047395741108461633, | |
| "loss": 5.8496, | |
| "mean_token_accuracy": 0.1314863942563534, | |
| "num_tokens": 4092579.0, | |
| "step": 1465 | |
| }, | |
| { | |
| "entropy": 5.845654916763306, | |
| "epoch": 0.039796954314720814, | |
| "grad_norm": 0.91015625, | |
| "learning_rate": 0.00047340451011867985, | |
| "loss": 5.7645, | |
| "mean_token_accuracy": 0.13576920554041863, | |
| "num_tokens": 4106484.0, | |
| "step": 1470 | |
| }, | |
| { | |
| "entropy": 5.8357702732086185, | |
| "epoch": 0.03993231810490694, | |
| "grad_norm": 1.046875, | |
| "learning_rate": 0.00047284616979287515, | |
| "loss": 5.7565, | |
| "mean_token_accuracy": 0.14051191210746766, | |
| "num_tokens": 4120600.0, | |
| "step": 1475 | |
| }, | |
| { | |
| "entropy": 5.734717130661011, | |
| "epoch": 0.04006768189509306, | |
| "grad_norm": 0.9296875, | |
| "learning_rate": 0.00047228240541438433, | |
| "loss": 5.6607, | |
| "mean_token_accuracy": 0.14902638792991638, | |
| "num_tokens": 4134962.0, | |
| "step": 1480 | |
| }, | |
| { | |
| "entropy": 5.739231395721435, | |
| "epoch": 0.04020304568527919, | |
| "grad_norm": 0.921875, | |
| "learning_rate": 0.00047171323243909257, | |
| "loss": 5.7377, | |
| "mean_token_accuracy": 0.1390654683113098, | |
| "num_tokens": 4148876.0, | |
| "step": 1485 | |
| }, | |
| { | |
| "entropy": 5.851029348373413, | |
| "epoch": 0.04033840947546531, | |
| "grad_norm": 1.015625, | |
| "learning_rate": 0.00047113866647116457, | |
| "loss": 5.8167, | |
| "mean_token_accuracy": 0.13390154615044594, | |
| "num_tokens": 4163566.0, | |
| "step": 1490 | |
| }, | |
| { | |
| "entropy": 5.882148790359497, | |
| "epoch": 0.040473773265651436, | |
| "grad_norm": 0.92578125, | |
| "learning_rate": 0.0004705587232626164, | |
| "loss": 5.7981, | |
| "mean_token_accuracy": 0.1364994041621685, | |
| "num_tokens": 4179057.0, | |
| "step": 1495 | |
| }, | |
| { | |
| "entropy": 5.747499704360962, | |
| "epoch": 0.04060913705583756, | |
| "grad_norm": 1.0078125, | |
| "learning_rate": 0.00046997341871288424, | |
| "loss": 5.737, | |
| "mean_token_accuracy": 0.14035099148750305, | |
| "num_tokens": 4192277.0, | |
| "step": 1500 | |
| }, | |
| { | |
| "entropy": 5.826932811737061, | |
| "epoch": 0.04074450084602369, | |
| "grad_norm": 1.0234375, | |
| "learning_rate": 0.0004693827688683879, | |
| "loss": 5.7834, | |
| "mean_token_accuracy": 0.1409361645579338, | |
| "num_tokens": 4206481.0, | |
| "step": 1505 | |
| }, | |
| { | |
| "entropy": 5.8263192653656, | |
| "epoch": 0.040879864636209816, | |
| "grad_norm": 0.95703125, | |
| "learning_rate": 0.0004687867899220914, | |
| "loss": 5.7582, | |
| "mean_token_accuracy": 0.14131638035178185, | |
| "num_tokens": 4220498.0, | |
| "step": 1510 | |
| }, | |
| { | |
| "entropy": 5.7734416961669925, | |
| "epoch": 0.04101522842639594, | |
| "grad_norm": 0.9921875, | |
| "learning_rate": 0.00046818549821305846, | |
| "loss": 5.7781, | |
| "mean_token_accuracy": 0.13451047241687775, | |
| "num_tokens": 4234718.0, | |
| "step": 1515 | |
| }, | |
| { | |
| "entropy": 5.835545301437378, | |
| "epoch": 0.041150592216582065, | |
| "grad_norm": 0.9765625, | |
| "learning_rate": 0.00046757891022600494, | |
| "loss": 5.7595, | |
| "mean_token_accuracy": 0.1417396955192089, | |
| "num_tokens": 4247333.0, | |
| "step": 1520 | |
| }, | |
| { | |
| "entropy": 5.764037847518921, | |
| "epoch": 0.04128595600676819, | |
| "grad_norm": 1.0, | |
| "learning_rate": 0.0004669670425908471, | |
| "loss": 5.745, | |
| "mean_token_accuracy": 0.14303724765777587, | |
| "num_tokens": 4261059.0, | |
| "step": 1525 | |
| }, | |
| { | |
| "entropy": 5.744110727310181, | |
| "epoch": 0.04142131979695431, | |
| "grad_norm": 1.0078125, | |
| "learning_rate": 0.0004663499120822451, | |
| "loss": 5.7091, | |
| "mean_token_accuracy": 0.13828182518482207, | |
| "num_tokens": 4273500.0, | |
| "step": 1530 | |
| }, | |
| { | |
| "entropy": 5.809609127044678, | |
| "epoch": 0.04155668358714044, | |
| "grad_norm": 0.97265625, | |
| "learning_rate": 0.0004657275356191437, | |
| "loss": 5.8712, | |
| "mean_token_accuracy": 0.1299389272928238, | |
| "num_tokens": 4288422.0, | |
| "step": 1535 | |
| }, | |
| { | |
| "entropy": 5.870568370819091, | |
| "epoch": 0.04169204737732656, | |
| "grad_norm": 0.87890625, | |
| "learning_rate": 0.00046509993026430804, | |
| "loss": 5.71, | |
| "mean_token_accuracy": 0.13911089226603507, | |
| "num_tokens": 4303700.0, | |
| "step": 1540 | |
| }, | |
| { | |
| "entropy": 5.763344049453735, | |
| "epoch": 0.04182741116751269, | |
| "grad_norm": 1.0078125, | |
| "learning_rate": 0.0004644671132238558, | |
| "loss": 5.7506, | |
| "mean_token_accuracy": 0.1399180144071579, | |
| "num_tokens": 4317887.0, | |
| "step": 1545 | |
| }, | |
| { | |
| "entropy": 5.775641632080078, | |
| "epoch": 0.04196277495769882, | |
| "grad_norm": 0.9765625, | |
| "learning_rate": 0.00046382910184678585, | |
| "loss": 5.6546, | |
| "mean_token_accuracy": 0.14635862186551094, | |
| "num_tokens": 4332834.0, | |
| "step": 1550 | |
| }, | |
| { | |
| "entropy": 5.7155317783355715, | |
| "epoch": 0.04209813874788494, | |
| "grad_norm": 0.98046875, | |
| "learning_rate": 0.0004631859136245025, | |
| "loss": 5.7051, | |
| "mean_token_accuracy": 0.1462951496243477, | |
| "num_tokens": 4347341.0, | |
| "step": 1555 | |
| }, | |
| { | |
| "entropy": 5.828639984130859, | |
| "epoch": 0.042233502538071066, | |
| "grad_norm": 0.97265625, | |
| "learning_rate": 0.0004625375661903357, | |
| "loss": 5.7721, | |
| "mean_token_accuracy": 0.13997872620821, | |
| "num_tokens": 4361359.0, | |
| "step": 1560 | |
| }, | |
| { | |
| "entropy": 5.7016510486602785, | |
| "epoch": 0.04236886632825719, | |
| "grad_norm": 0.8984375, | |
| "learning_rate": 0.00046188407731905787, | |
| "loss": 5.6941, | |
| "mean_token_accuracy": 0.14500250071287155, | |
| "num_tokens": 4376677.0, | |
| "step": 1565 | |
| }, | |
| { | |
| "entropy": 5.75781831741333, | |
| "epoch": 0.042504230118443315, | |
| "grad_norm": 1.1328125, | |
| "learning_rate": 0.00046122546492639643, | |
| "loss": 5.6234, | |
| "mean_token_accuracy": 0.14894023090600966, | |
| "num_tokens": 4389507.0, | |
| "step": 1570 | |
| }, | |
| { | |
| "entropy": 5.712439489364624, | |
| "epoch": 0.04263959390862944, | |
| "grad_norm": 0.83203125, | |
| "learning_rate": 0.000460561747068543, | |
| "loss": 5.7554, | |
| "mean_token_accuracy": 0.1388566166162491, | |
| "num_tokens": 4406626.0, | |
| "step": 1575 | |
| }, | |
| { | |
| "entropy": 5.756133127212524, | |
| "epoch": 0.04277495769881557, | |
| "grad_norm": 0.88671875, | |
| "learning_rate": 0.0004598929419416578, | |
| "loss": 5.7679, | |
| "mean_token_accuracy": 0.13815426528453828, | |
| "num_tokens": 4421131.0, | |
| "step": 1580 | |
| }, | |
| { | |
| "entropy": 5.868128299713135, | |
| "epoch": 0.042910321489001695, | |
| "grad_norm": 0.95703125, | |
| "learning_rate": 0.00045921906788137123, | |
| "loss": 5.76, | |
| "mean_token_accuracy": 0.14222174808382987, | |
| "num_tokens": 4435107.0, | |
| "step": 1585 | |
| }, | |
| { | |
| "entropy": 5.801052570343018, | |
| "epoch": 0.04304568527918782, | |
| "grad_norm": 0.984375, | |
| "learning_rate": 0.00045854014336228115, | |
| "loss": 5.7288, | |
| "mean_token_accuracy": 0.14501179829239846, | |
| "num_tokens": 4449294.0, | |
| "step": 1590 | |
| }, | |
| { | |
| "entropy": 5.750652313232422, | |
| "epoch": 0.04318104906937394, | |
| "grad_norm": 0.98046875, | |
| "learning_rate": 0.00045785618699744615, | |
| "loss": 5.6444, | |
| "mean_token_accuracy": 0.14286767169833184, | |
| "num_tokens": 4462731.0, | |
| "step": 1595 | |
| }, | |
| { | |
| "entropy": 5.717151927947998, | |
| "epoch": 0.04331641285956007, | |
| "grad_norm": 1.1015625, | |
| "learning_rate": 0.00045716721753787543, | |
| "loss": 5.7299, | |
| "mean_token_accuracy": 0.1389971673488617, | |
| "num_tokens": 4476956.0, | |
| "step": 1600 | |
| }, | |
| { | |
| "entropy": 5.819956731796265, | |
| "epoch": 0.04345177664974619, | |
| "grad_norm": 1.0, | |
| "learning_rate": 0.0004564732538720148, | |
| "loss": 5.7267, | |
| "mean_token_accuracy": 0.14786600917577744, | |
| "num_tokens": 4491356.0, | |
| "step": 1605 | |
| }, | |
| { | |
| "entropy": 5.665336084365845, | |
| "epoch": 0.043587140439932316, | |
| "grad_norm": 1.0, | |
| "learning_rate": 0.00045577431502522877, | |
| "loss": 5.7028, | |
| "mean_token_accuracy": 0.14309961274266242, | |
| "num_tokens": 4504900.0, | |
| "step": 1610 | |
| }, | |
| { | |
| "entropy": 5.760229158401489, | |
| "epoch": 0.04372250423011844, | |
| "grad_norm": 0.94921875, | |
| "learning_rate": 0.0004550704201592787, | |
| "loss": 5.688, | |
| "mean_token_accuracy": 0.14546218365430832, | |
| "num_tokens": 4517879.0, | |
| "step": 1615 | |
| }, | |
| { | |
| "entropy": 5.720965814590454, | |
| "epoch": 0.04385786802030457, | |
| "grad_norm": 1.046875, | |
| "learning_rate": 0.0004543615885717981, | |
| "loss": 5.7713, | |
| "mean_token_accuracy": 0.14266854301095008, | |
| "num_tokens": 4531356.0, | |
| "step": 1620 | |
| }, | |
| { | |
| "entropy": 5.802320337295532, | |
| "epoch": 0.043993231810490696, | |
| "grad_norm": 0.984375, | |
| "learning_rate": 0.00045364783969576296, | |
| "loss": 5.6383, | |
| "mean_token_accuracy": 0.14731594622135163, | |
| "num_tokens": 4545262.0, | |
| "step": 1625 | |
| }, | |
| { | |
| "entropy": 5.625383090972901, | |
| "epoch": 0.04412859560067682, | |
| "grad_norm": 1.046875, | |
| "learning_rate": 0.0004529291930989592, | |
| "loss": 5.6253, | |
| "mean_token_accuracy": 0.14481477811932564, | |
| "num_tokens": 4558713.0, | |
| "step": 1630 | |
| }, | |
| { | |
| "entropy": 5.767266464233399, | |
| "epoch": 0.044263959390862945, | |
| "grad_norm": 0.921875, | |
| "learning_rate": 0.0004522056684834464, | |
| "loss": 5.6935, | |
| "mean_token_accuracy": 0.14441011399030684, | |
| "num_tokens": 4571891.0, | |
| "step": 1635 | |
| }, | |
| { | |
| "entropy": 5.778782510757447, | |
| "epoch": 0.04439932318104907, | |
| "grad_norm": 0.953125, | |
| "learning_rate": 0.0004514772856850173, | |
| "loss": 5.6935, | |
| "mean_token_accuracy": 0.14748022928833962, | |
| "num_tokens": 4585822.0, | |
| "step": 1640 | |
| }, | |
| { | |
| "entropy": 5.753904867172241, | |
| "epoch": 0.04453468697123519, | |
| "grad_norm": 0.9453125, | |
| "learning_rate": 0.0004507440646726542, | |
| "loss": 5.6979, | |
| "mean_token_accuracy": 0.14199129566550256, | |
| "num_tokens": 4600023.0, | |
| "step": 1645 | |
| }, | |
| { | |
| "entropy": 5.6777363300323485, | |
| "epoch": 0.04467005076142132, | |
| "grad_norm": 1.1328125, | |
| "learning_rate": 0.0004500060255479818, | |
| "loss": 5.5957, | |
| "mean_token_accuracy": 0.15256337970495223, | |
| "num_tokens": 4611259.0, | |
| "step": 1650 | |
| }, | |
| { | |
| "entropy": 5.784216976165771, | |
| "epoch": 0.04480541455160744, | |
| "grad_norm": 0.9609375, | |
| "learning_rate": 0.0004492631885447151, | |
| "loss": 5.6981, | |
| "mean_token_accuracy": 0.13937234207987786, | |
| "num_tokens": 4625195.0, | |
| "step": 1655 | |
| }, | |
| { | |
| "entropy": 5.828709125518799, | |
| "epoch": 0.04494077834179357, | |
| "grad_norm": 1.0546875, | |
| "learning_rate": 0.00044851557402810616, | |
| "loss": 5.6685, | |
| "mean_token_accuracy": 0.1433462306857109, | |
| "num_tokens": 4639159.0, | |
| "step": 1660 | |
| }, | |
| { | |
| "entropy": 5.694344997406006, | |
| "epoch": 0.0450761421319797, | |
| "grad_norm": 1.09375, | |
| "learning_rate": 0.00044776320249438444, | |
| "loss": 5.7065, | |
| "mean_token_accuracy": 0.143716399371624, | |
| "num_tokens": 4650967.0, | |
| "step": 1665 | |
| }, | |
| { | |
| "entropy": 5.757909107208252, | |
| "epoch": 0.04521150592216582, | |
| "grad_norm": 0.8828125, | |
| "learning_rate": 0.00044700609457019565, | |
| "loss": 5.6969, | |
| "mean_token_accuracy": 0.14098843336105346, | |
| "num_tokens": 4667107.0, | |
| "step": 1670 | |
| }, | |
| { | |
| "entropy": 5.704726076126098, | |
| "epoch": 0.045346869712351946, | |
| "grad_norm": 0.94921875, | |
| "learning_rate": 0.0004462442710120359, | |
| "loss": 5.6458, | |
| "mean_token_accuracy": 0.15384480953216553, | |
| "num_tokens": 4680966.0, | |
| "step": 1675 | |
| }, | |
| { | |
| "entropy": 5.788536548614502, | |
| "epoch": 0.04548223350253807, | |
| "grad_norm": 0.86328125, | |
| "learning_rate": 0.000445477752705683, | |
| "loss": 5.715, | |
| "mean_token_accuracy": 0.14432019889354705, | |
| "num_tokens": 4696365.0, | |
| "step": 1680 | |
| }, | |
| { | |
| "entropy": 5.778404951095581, | |
| "epoch": 0.045617597292724195, | |
| "grad_norm": 1.0, | |
| "learning_rate": 0.00044470656066562336, | |
| "loss": 5.7505, | |
| "mean_token_accuracy": 0.14002010300755502, | |
| "num_tokens": 4709059.0, | |
| "step": 1685 | |
| }, | |
| { | |
| "entropy": 5.779723358154297, | |
| "epoch": 0.04575296108291032, | |
| "grad_norm": 0.8828125, | |
| "learning_rate": 0.0004439307160344765, | |
| "loss": 5.6813, | |
| "mean_token_accuracy": 0.1479523077607155, | |
| "num_tokens": 4722922.0, | |
| "step": 1690 | |
| }, | |
| { | |
| "entropy": 5.69294548034668, | |
| "epoch": 0.045888324873096444, | |
| "grad_norm": 0.921875, | |
| "learning_rate": 0.00044315024008241473, | |
| "loss": 5.5964, | |
| "mean_token_accuracy": 0.15145878940820695, | |
| "num_tokens": 4737204.0, | |
| "step": 1695 | |
| }, | |
| { | |
| "entropy": 5.7257462501525875, | |
| "epoch": 0.046023688663282575, | |
| "grad_norm": 0.92578125, | |
| "learning_rate": 0.0004423651542065806, | |
| "loss": 5.6956, | |
| "mean_token_accuracy": 0.14550104588270188, | |
| "num_tokens": 4752111.0, | |
| "step": 1700 | |
| }, | |
| { | |
| "entropy": 5.752708816528321, | |
| "epoch": 0.0461590524534687, | |
| "grad_norm": 1.0, | |
| "learning_rate": 0.00044157547993050006, | |
| "loss": 5.6762, | |
| "mean_token_accuracy": 0.14675524830818176, | |
| "num_tokens": 4766353.0, | |
| "step": 1705 | |
| }, | |
| { | |
| "entropy": 5.750765705108643, | |
| "epoch": 0.04629441624365482, | |
| "grad_norm": 1.0078125, | |
| "learning_rate": 0.00044078123890349227, | |
| "loss": 5.7321, | |
| "mean_token_accuracy": 0.14695569574832917, | |
| "num_tokens": 4779551.0, | |
| "step": 1710 | |
| }, | |
| { | |
| "entropy": 5.675897407531738, | |
| "epoch": 0.04642978003384095, | |
| "grad_norm": 0.94140625, | |
| "learning_rate": 0.00043998245290007606, | |
| "loss": 5.6578, | |
| "mean_token_accuracy": 0.14759555011987685, | |
| "num_tokens": 4794073.0, | |
| "step": 1715 | |
| }, | |
| { | |
| "entropy": 5.697209167480469, | |
| "epoch": 0.04656514382402707, | |
| "grad_norm": 0.97265625, | |
| "learning_rate": 0.00043917914381937323, | |
| "loss": 5.5765, | |
| "mean_token_accuracy": 0.15185517072677612, | |
| "num_tokens": 4806855.0, | |
| "step": 1720 | |
| }, | |
| { | |
| "entropy": 5.63714861869812, | |
| "epoch": 0.046700507614213196, | |
| "grad_norm": 0.984375, | |
| "learning_rate": 0.00043837133368450815, | |
| "loss": 5.681, | |
| "mean_token_accuracy": 0.138708233833313, | |
| "num_tokens": 4820880.0, | |
| "step": 1725 | |
| }, | |
| { | |
| "entropy": 5.834238338470459, | |
| "epoch": 0.04683587140439932, | |
| "grad_norm": 0.96484375, | |
| "learning_rate": 0.0004375590446420037, | |
| "loss": 5.6772, | |
| "mean_token_accuracy": 0.14852887466549874, | |
| "num_tokens": 4833906.0, | |
| "step": 1730 | |
| }, | |
| { | |
| "entropy": 5.651483774185181, | |
| "epoch": 0.046971235194585445, | |
| "grad_norm": 0.99609375, | |
| "learning_rate": 0.0004367422989611743, | |
| "loss": 5.6429, | |
| "mean_token_accuracy": 0.15046416074037552, | |
| "num_tokens": 4849251.0, | |
| "step": 1735 | |
| }, | |
| { | |
| "entropy": 5.713845062255859, | |
| "epoch": 0.047106598984771576, | |
| "grad_norm": 0.91015625, | |
| "learning_rate": 0.0004359211190335153, | |
| "loss": 5.6968, | |
| "mean_token_accuracy": 0.14156146496534347, | |
| "num_tokens": 4863896.0, | |
| "step": 1740 | |
| }, | |
| { | |
| "entropy": 5.769553709030151, | |
| "epoch": 0.0472419627749577, | |
| "grad_norm": 1.0, | |
| "learning_rate": 0.00043509552737208923, | |
| "loss": 5.655, | |
| "mean_token_accuracy": 0.15236809402704238, | |
| "num_tokens": 4876392.0, | |
| "step": 1745 | |
| }, | |
| { | |
| "entropy": 5.665567684173584, | |
| "epoch": 0.047377326565143825, | |
| "grad_norm": 0.890625, | |
| "learning_rate": 0.00043426554661090853, | |
| "loss": 5.6206, | |
| "mean_token_accuracy": 0.15215253382921218, | |
| "num_tokens": 4889803.0, | |
| "step": 1750 | |
| }, | |
| { | |
| "entropy": 5.653515958786011, | |
| "epoch": 0.04751269035532995, | |
| "grad_norm": 0.91796875, | |
| "learning_rate": 0.00043343119950431516, | |
| "loss": 5.5148, | |
| "mean_token_accuracy": 0.1512528494000435, | |
| "num_tokens": 4903975.0, | |
| "step": 1755 | |
| }, | |
| { | |
| "entropy": 5.731270265579224, | |
| "epoch": 0.047648054145516074, | |
| "grad_norm": 1.0625, | |
| "learning_rate": 0.00043259250892635644, | |
| "loss": 5.7402, | |
| "mean_token_accuracy": 0.14076657742261886, | |
| "num_tokens": 4916667.0, | |
| "step": 1760 | |
| }, | |
| { | |
| "entropy": 5.772264051437378, | |
| "epoch": 0.0477834179357022, | |
| "grad_norm": 0.984375, | |
| "learning_rate": 0.0004317494978701582, | |
| "loss": 5.6871, | |
| "mean_token_accuracy": 0.15338942259550095, | |
| "num_tokens": 4929908.0, | |
| "step": 1765 | |
| }, | |
| { | |
| "entropy": 5.600496244430542, | |
| "epoch": 0.04791878172588832, | |
| "grad_norm": 0.97265625, | |
| "learning_rate": 0.0004309021894472943, | |
| "loss": 5.5895, | |
| "mean_token_accuracy": 0.1531106323003769, | |
| "num_tokens": 4943685.0, | |
| "step": 1770 | |
| }, | |
| { | |
| "entropy": 5.86819052696228, | |
| "epoch": 0.048054145516074454, | |
| "grad_norm": 1.078125, | |
| "learning_rate": 0.0004300506068871534, | |
| "loss": 5.7578, | |
| "mean_token_accuracy": 0.13543773368000983, | |
| "num_tokens": 4959796.0, | |
| "step": 1775 | |
| }, | |
| { | |
| "entropy": 5.58793797492981, | |
| "epoch": 0.04818950930626058, | |
| "grad_norm": 1.015625, | |
| "learning_rate": 0.00042919477353630135, | |
| "loss": 5.5691, | |
| "mean_token_accuracy": 0.15354569405317306, | |
| "num_tokens": 4973208.0, | |
| "step": 1780 | |
| }, | |
| { | |
| "entropy": 5.736422824859619, | |
| "epoch": 0.0483248730964467, | |
| "grad_norm": 0.8671875, | |
| "learning_rate": 0.000428334712857842, | |
| "loss": 5.6892, | |
| "mean_token_accuracy": 0.14086781814694405, | |
| "num_tokens": 4989755.0, | |
| "step": 1785 | |
| }, | |
| { | |
| "entropy": 5.694100475311279, | |
| "epoch": 0.048460236886632826, | |
| "grad_norm": 1.0703125, | |
| "learning_rate": 0.00042747044843077304, | |
| "loss": 5.6608, | |
| "mean_token_accuracy": 0.14808935225009917, | |
| "num_tokens": 5003501.0, | |
| "step": 1790 | |
| }, | |
| { | |
| "entropy": 5.70287938117981, | |
| "epoch": 0.04859560067681895, | |
| "grad_norm": 0.93359375, | |
| "learning_rate": 0.00042660200394934047, | |
| "loss": 5.691, | |
| "mean_token_accuracy": 0.1464019276201725, | |
| "num_tokens": 5016657.0, | |
| "step": 1795 | |
| }, | |
| { | |
| "entropy": 5.6858762264251705, | |
| "epoch": 0.048730964467005075, | |
| "grad_norm": 0.93359375, | |
| "learning_rate": 0.00042572940322238844, | |
| "loss": 5.6081, | |
| "mean_token_accuracy": 0.1505765825510025, | |
| "num_tokens": 5029741.0, | |
| "step": 1800 | |
| }, | |
| { | |
| "entropy": 5.6079450130462645, | |
| "epoch": 0.0488663282571912, | |
| "grad_norm": 1.015625, | |
| "learning_rate": 0.00042485267017270664, | |
| "loss": 5.5026, | |
| "mean_token_accuracy": 0.15048226863145828, | |
| "num_tokens": 5042973.0, | |
| "step": 1805 | |
| }, | |
| { | |
| "entropy": 5.652156972885132, | |
| "epoch": 0.049001692047377324, | |
| "grad_norm": 0.98828125, | |
| "learning_rate": 0.0004239718288363745, | |
| "loss": 5.5519, | |
| "mean_token_accuracy": 0.151530858874321, | |
| "num_tokens": 5057981.0, | |
| "step": 1810 | |
| }, | |
| { | |
| "entropy": 5.653716611862182, | |
| "epoch": 0.049137055837563455, | |
| "grad_norm": 0.89453125, | |
| "learning_rate": 0.0004230869033621023, | |
| "loss": 5.6339, | |
| "mean_token_accuracy": 0.13919498771429062, | |
| "num_tokens": 5072832.0, | |
| "step": 1815 | |
| }, | |
| { | |
| "entropy": 5.74049973487854, | |
| "epoch": 0.04927241962774958, | |
| "grad_norm": 0.89453125, | |
| "learning_rate": 0.0004221979180105688, | |
| "loss": 5.6291, | |
| "mean_token_accuracy": 0.14582021906971931, | |
| "num_tokens": 5086141.0, | |
| "step": 1820 | |
| }, | |
| { | |
| "entropy": 5.67672643661499, | |
| "epoch": 0.049407783417935704, | |
| "grad_norm": 0.98046875, | |
| "learning_rate": 0.00042130489715375645, | |
| "loss": 5.6638, | |
| "mean_token_accuracy": 0.146046045422554, | |
| "num_tokens": 5100480.0, | |
| "step": 1825 | |
| }, | |
| { | |
| "entropy": 5.680028295516967, | |
| "epoch": 0.04954314720812183, | |
| "grad_norm": 0.89453125, | |
| "learning_rate": 0.00042040786527428335, | |
| "loss": 5.5843, | |
| "mean_token_accuracy": 0.14439646974205972, | |
| "num_tokens": 5117197.0, | |
| "step": 1830 | |
| }, | |
| { | |
| "entropy": 5.5879209518432615, | |
| "epoch": 0.04967851099830795, | |
| "grad_norm": 0.90625, | |
| "learning_rate": 0.0004195068469647315, | |
| "loss": 5.5534, | |
| "mean_token_accuracy": 0.1488366484642029, | |
| "num_tokens": 5132561.0, | |
| "step": 1835 | |
| }, | |
| { | |
| "entropy": 5.6617508888244625, | |
| "epoch": 0.04981387478849408, | |
| "grad_norm": 0.93359375, | |
| "learning_rate": 0.00041860186692697297, | |
| "loss": 5.7145, | |
| "mean_token_accuracy": 0.1438066452741623, | |
| "num_tokens": 5146905.0, | |
| "step": 1840 | |
| }, | |
| { | |
| "entropy": 5.724303245544434, | |
| "epoch": 0.0499492385786802, | |
| "grad_norm": 1.0390625, | |
| "learning_rate": 0.00041769294997149264, | |
| "loss": 5.5646, | |
| "mean_token_accuracy": 0.15083335638046264, | |
| "num_tokens": 5161581.0, | |
| "step": 1845 | |
| }, | |
| { | |
| "entropy": 5.6070271015167235, | |
| "epoch": 0.050084602368866325, | |
| "grad_norm": 0.9609375, | |
| "learning_rate": 0.0004167801210167081, | |
| "loss": 5.5805, | |
| "mean_token_accuracy": 0.1544129729270935, | |
| "num_tokens": 5176317.0, | |
| "step": 1850 | |
| }, | |
| { | |
| "entropy": 5.684096813201904, | |
| "epoch": 0.05021996615905246, | |
| "grad_norm": 1.046875, | |
| "learning_rate": 0.0004158634050882861, | |
| "loss": 5.5168, | |
| "mean_token_accuracy": 0.15208376348018646, | |
| "num_tokens": 5188651.0, | |
| "step": 1855 | |
| }, | |
| { | |
| "entropy": 5.55376296043396, | |
| "epoch": 0.05035532994923858, | |
| "grad_norm": 0.9296875, | |
| "learning_rate": 0.0004149428273184569, | |
| "loss": 5.5148, | |
| "mean_token_accuracy": 0.15063736736774444, | |
| "num_tokens": 5202035.0, | |
| "step": 1860 | |
| }, | |
| { | |
| "entropy": 5.612833023071289, | |
| "epoch": 0.050490693739424705, | |
| "grad_norm": 1.09375, | |
| "learning_rate": 0.0004140184129453253, | |
| "loss": 5.486, | |
| "mean_token_accuracy": 0.1544868603348732, | |
| "num_tokens": 5215471.0, | |
| "step": 1865 | |
| }, | |
| { | |
| "entropy": 5.704241132736206, | |
| "epoch": 0.05062605752961083, | |
| "grad_norm": 1.15625, | |
| "learning_rate": 0.000413090187312178, | |
| "loss": 5.6414, | |
| "mean_token_accuracy": 0.1538958489894867, | |
| "num_tokens": 5228328.0, | |
| "step": 1870 | |
| }, | |
| { | |
| "entropy": 5.698283338546753, | |
| "epoch": 0.050761421319796954, | |
| "grad_norm": 0.97265625, | |
| "learning_rate": 0.0004121581758667898, | |
| "loss": 5.6058, | |
| "mean_token_accuracy": 0.1486688494682312, | |
| "num_tokens": 5240586.0, | |
| "step": 1875 | |
| }, | |
| { | |
| "entropy": 5.515977621078491, | |
| "epoch": 0.05089678510998308, | |
| "grad_norm": 1.015625, | |
| "learning_rate": 0.00041122240416072533, | |
| "loss": 5.4453, | |
| "mean_token_accuracy": 0.15285620093345642, | |
| "num_tokens": 5252569.0, | |
| "step": 1880 | |
| }, | |
| { | |
| "entropy": 5.644832372665405, | |
| "epoch": 0.0510321489001692, | |
| "grad_norm": 1.09375, | |
| "learning_rate": 0.0004102828978486385, | |
| "loss": 5.6534, | |
| "mean_token_accuracy": 0.14334431514143944, | |
| "num_tokens": 5264975.0, | |
| "step": 1885 | |
| }, | |
| { | |
| "entropy": 5.681633806228637, | |
| "epoch": 0.05116751269035533, | |
| "grad_norm": 0.9296875, | |
| "learning_rate": 0.0004093396826875695, | |
| "loss": 5.527, | |
| "mean_token_accuracy": 0.15328461825847625, | |
| "num_tokens": 5279688.0, | |
| "step": 1890 | |
| }, | |
| { | |
| "entropy": 5.622284603118897, | |
| "epoch": 0.05130287648054146, | |
| "grad_norm": 0.9609375, | |
| "learning_rate": 0.00040839278453623837, | |
| "loss": 5.5739, | |
| "mean_token_accuracy": 0.15425852686166763, | |
| "num_tokens": 5294266.0, | |
| "step": 1895 | |
| }, | |
| { | |
| "entropy": 5.633177900314331, | |
| "epoch": 0.05143824027072758, | |
| "grad_norm": 0.9453125, | |
| "learning_rate": 0.0004074422293543363, | |
| "loss": 5.5835, | |
| "mean_token_accuracy": 0.14945923388004304, | |
| "num_tokens": 5308719.0, | |
| "step": 1900 | |
| }, | |
| { | |
| "entropy": 5.672901391983032, | |
| "epoch": 0.05157360406091371, | |
| "grad_norm": 0.890625, | |
| "learning_rate": 0.0004064880432018137, | |
| "loss": 5.6778, | |
| "mean_token_accuracy": 0.1480257421731949, | |
| "num_tokens": 5324227.0, | |
| "step": 1905 | |
| }, | |
| { | |
| "entropy": 5.7078780174255375, | |
| "epoch": 0.05170896785109983, | |
| "grad_norm": 1.015625, | |
| "learning_rate": 0.00040553025223816615, | |
| "loss": 5.603, | |
| "mean_token_accuracy": 0.153351391851902, | |
| "num_tokens": 5338353.0, | |
| "step": 1910 | |
| }, | |
| { | |
| "entropy": 5.629157209396363, | |
| "epoch": 0.051844331641285955, | |
| "grad_norm": 0.8828125, | |
| "learning_rate": 0.00040456888272171653, | |
| "loss": 5.4822, | |
| "mean_token_accuracy": 0.1563638061285019, | |
| "num_tokens": 5354182.0, | |
| "step": 1915 | |
| }, | |
| { | |
| "entropy": 5.617384052276611, | |
| "epoch": 0.05197969543147208, | |
| "grad_norm": 1.046875, | |
| "learning_rate": 0.00040360396100889577, | |
| "loss": 5.6056, | |
| "mean_token_accuracy": 0.14689816236495973, | |
| "num_tokens": 5366448.0, | |
| "step": 1920 | |
| }, | |
| { | |
| "entropy": 5.651615858078003, | |
| "epoch": 0.052115059221658204, | |
| "grad_norm": 0.87109375, | |
| "learning_rate": 0.0004026355135535202, | |
| "loss": 5.5636, | |
| "mean_token_accuracy": 0.1531040221452713, | |
| "num_tokens": 5381430.0, | |
| "step": 1925 | |
| }, | |
| { | |
| "entropy": 5.6194452285766605, | |
| "epoch": 0.05225042301184433, | |
| "grad_norm": 1.03125, | |
| "learning_rate": 0.000401663566906066, | |
| "loss": 5.5743, | |
| "mean_token_accuracy": 0.15186812579631806, | |
| "num_tokens": 5393626.0, | |
| "step": 1930 | |
| }, | |
| { | |
| "entropy": 5.7036806583404545, | |
| "epoch": 0.05238578680203046, | |
| "grad_norm": 0.9375, | |
| "learning_rate": 0.00040068814771294134, | |
| "loss": 5.5539, | |
| "mean_token_accuracy": 0.15736090689897536, | |
| "num_tokens": 5407257.0, | |
| "step": 1935 | |
| }, | |
| { | |
| "entropy": 5.583117723464966, | |
| "epoch": 0.052521150592216584, | |
| "grad_norm": 0.90234375, | |
| "learning_rate": 0.0003997092827157562, | |
| "loss": 5.5588, | |
| "mean_token_accuracy": 0.14819036424160004, | |
| "num_tokens": 5421798.0, | |
| "step": 1940 | |
| }, | |
| { | |
| "entropy": 5.655210685729981, | |
| "epoch": 0.05265651438240271, | |
| "grad_norm": 0.91796875, | |
| "learning_rate": 0.000398726998750589, | |
| "loss": 5.5823, | |
| "mean_token_accuracy": 0.1502937689423561, | |
| "num_tokens": 5437455.0, | |
| "step": 1945 | |
| }, | |
| { | |
| "entropy": 5.628138160705566, | |
| "epoch": 0.05279187817258883, | |
| "grad_norm": 0.828125, | |
| "learning_rate": 0.00039774132274725076, | |
| "loss": 5.508, | |
| "mean_token_accuracy": 0.15878963768482207, | |
| "num_tokens": 5451593.0, | |
| "step": 1950 | |
| }, | |
| { | |
| "entropy": 5.5857048511505125, | |
| "epoch": 0.05292724196277496, | |
| "grad_norm": 1.0234375, | |
| "learning_rate": 0.00039675228172854707, | |
| "loss": 5.5671, | |
| "mean_token_accuracy": 0.15036417841911315, | |
| "num_tokens": 5466807.0, | |
| "step": 1955 | |
| }, | |
| { | |
| "entropy": 5.578492784500122, | |
| "epoch": 0.05306260575296108, | |
| "grad_norm": 1.0703125, | |
| "learning_rate": 0.0003957599028095371, | |
| "loss": 5.472, | |
| "mean_token_accuracy": 0.15736704617738723, | |
| "num_tokens": 5480113.0, | |
| "step": 1960 | |
| }, | |
| { | |
| "entropy": 5.58995213508606, | |
| "epoch": 0.053197969543147205, | |
| "grad_norm": 0.98046875, | |
| "learning_rate": 0.00039476421319679017, | |
| "loss": 5.576, | |
| "mean_token_accuracy": 0.14943182319402695, | |
| "num_tokens": 5494694.0, | |
| "step": 1965 | |
| }, | |
| { | |
| "entropy": 5.649091339111328, | |
| "epoch": 0.05333333333333334, | |
| "grad_norm": 0.9609375, | |
| "learning_rate": 0.00039376524018764, | |
| "loss": 5.5204, | |
| "mean_token_accuracy": 0.15763673931360245, | |
| "num_tokens": 5508858.0, | |
| "step": 1970 | |
| }, | |
| { | |
| "entropy": 5.544556760787964, | |
| "epoch": 0.05346869712351946, | |
| "grad_norm": 0.9765625, | |
| "learning_rate": 0.00039276301116943616, | |
| "loss": 5.4916, | |
| "mean_token_accuracy": 0.1559601128101349, | |
| "num_tokens": 5523142.0, | |
| "step": 1975 | |
| }, | |
| { | |
| "entropy": 5.637435817718506, | |
| "epoch": 0.053604060913705585, | |
| "grad_norm": 1.1015625, | |
| "learning_rate": 0.0003917575536187936, | |
| "loss": 5.5495, | |
| "mean_token_accuracy": 0.1537593424320221, | |
| "num_tokens": 5536882.0, | |
| "step": 1980 | |
| }, | |
| { | |
| "entropy": 5.666303062438965, | |
| "epoch": 0.05373942470389171, | |
| "grad_norm": 0.98828125, | |
| "learning_rate": 0.00039074889510083894, | |
| "loss": 5.5746, | |
| "mean_token_accuracy": 0.14690756425261497, | |
| "num_tokens": 5550882.0, | |
| "step": 1985 | |
| }, | |
| { | |
| "entropy": 5.601831579208374, | |
| "epoch": 0.053874788494077834, | |
| "grad_norm": 0.90625, | |
| "learning_rate": 0.00038973706326845495, | |
| "loss": 5.5869, | |
| "mean_token_accuracy": 0.14608050435781478, | |
| "num_tokens": 5566187.0, | |
| "step": 1990 | |
| }, | |
| { | |
| "entropy": 5.604721736907959, | |
| "epoch": 0.05401015228426396, | |
| "grad_norm": 0.87890625, | |
| "learning_rate": 0.0003887220858615225, | |
| "loss": 5.5083, | |
| "mean_token_accuracy": 0.1559429183602333, | |
| "num_tokens": 5580568.0, | |
| "step": 1995 | |
| }, | |
| { | |
| "entropy": 5.609822750091553, | |
| "epoch": 0.05414551607445008, | |
| "grad_norm": 0.96484375, | |
| "learning_rate": 0.0003877039907061597, | |
| "loss": 5.5986, | |
| "mean_token_accuracy": 0.15086540579795837, | |
| "num_tokens": 5594827.0, | |
| "step": 2000 | |
| }, | |
| { | |
| "entropy": 5.6352800846099855, | |
| "epoch": 0.05428087986463621, | |
| "grad_norm": 1.078125, | |
| "learning_rate": 0.0003866828057139598, | |
| "loss": 5.5726, | |
| "mean_token_accuracy": 0.14980787187814712, | |
| "num_tokens": 5607643.0, | |
| "step": 2005 | |
| }, | |
| { | |
| "entropy": 5.583590316772461, | |
| "epoch": 0.05441624365482234, | |
| "grad_norm": 1.015625, | |
| "learning_rate": 0.00038565855888122503, | |
| "loss": 5.5041, | |
| "mean_token_accuracy": 0.1583167791366577, | |
| "num_tokens": 5619178.0, | |
| "step": 2010 | |
| }, | |
| { | |
| "entropy": 5.708728361129761, | |
| "epoch": 0.05455160744500846, | |
| "grad_norm": 0.91796875, | |
| "learning_rate": 0.00038463127828819975, | |
| "loss": 5.5384, | |
| "mean_token_accuracy": 0.15386256724596023, | |
| "num_tokens": 5632724.0, | |
| "step": 2015 | |
| }, | |
| { | |
| "entropy": 5.479742050170898, | |
| "epoch": 0.05468697123519459, | |
| "grad_norm": 1.0234375, | |
| "learning_rate": 0.00038360099209830043, | |
| "loss": 5.5745, | |
| "mean_token_accuracy": 0.15379853323101997, | |
| "num_tokens": 5646090.0, | |
| "step": 2020 | |
| }, | |
| { | |
| "entropy": 5.633185243606567, | |
| "epoch": 0.05482233502538071, | |
| "grad_norm": 0.93359375, | |
| "learning_rate": 0.0003825677285573433, | |
| "loss": 5.507, | |
| "mean_token_accuracy": 0.15375496149063111, | |
| "num_tokens": 5660734.0, | |
| "step": 2025 | |
| }, | |
| { | |
| "entropy": 5.631849336624145, | |
| "epoch": 0.054957698815566836, | |
| "grad_norm": 1.078125, | |
| "learning_rate": 0.00038153151599277027, | |
| "loss": 5.5224, | |
| "mean_token_accuracy": 0.15756209194660187, | |
| "num_tokens": 5674885.0, | |
| "step": 2030 | |
| }, | |
| { | |
| "entropy": 5.569233798980713, | |
| "epoch": 0.05509306260575296, | |
| "grad_norm": 0.96875, | |
| "learning_rate": 0.0003804923828128723, | |
| "loss": 5.4979, | |
| "mean_token_accuracy": 0.15912836641073227, | |
| "num_tokens": 5687464.0, | |
| "step": 2035 | |
| }, | |
| { | |
| "entropy": 5.671593904495239, | |
| "epoch": 0.055228426395939084, | |
| "grad_norm": 0.91015625, | |
| "learning_rate": 0.0003794503575060104, | |
| "loss": 5.5796, | |
| "mean_token_accuracy": 0.15338214933872224, | |
| "num_tokens": 5701569.0, | |
| "step": 2040 | |
| }, | |
| { | |
| "entropy": 5.604352951049805, | |
| "epoch": 0.05536379018612521, | |
| "grad_norm": 0.92578125, | |
| "learning_rate": 0.00037840546863983484, | |
| "loss": 5.5662, | |
| "mean_token_accuracy": 0.14921343475580215, | |
| "num_tokens": 5716021.0, | |
| "step": 2045 | |
| }, | |
| { | |
| "entropy": 5.676676845550537, | |
| "epoch": 0.05549915397631134, | |
| "grad_norm": 0.96484375, | |
| "learning_rate": 0.0003773577448605015, | |
| "loss": 5.4733, | |
| "mean_token_accuracy": 0.1577136844396591, | |
| "num_tokens": 5731219.0, | |
| "step": 2050 | |
| }, | |
| { | |
| "entropy": 5.5694435119628904, | |
| "epoch": 0.055634517766497464, | |
| "grad_norm": 1.015625, | |
| "learning_rate": 0.0003763072148918872, | |
| "loss": 5.566, | |
| "mean_token_accuracy": 0.15062549114227294, | |
| "num_tokens": 5745864.0, | |
| "step": 2055 | |
| }, | |
| { | |
| "entropy": 5.537994909286499, | |
| "epoch": 0.05576988155668359, | |
| "grad_norm": 1.078125, | |
| "learning_rate": 0.0003752539075348017, | |
| "loss": 5.4265, | |
| "mean_token_accuracy": 0.16346251368522643, | |
| "num_tokens": 5758852.0, | |
| "step": 2060 | |
| }, | |
| { | |
| "entropy": 5.655580282211304, | |
| "epoch": 0.05590524534686971, | |
| "grad_norm": 0.98046875, | |
| "learning_rate": 0.00037419785166619817, | |
| "loss": 5.5961, | |
| "mean_token_accuracy": 0.1531015492975712, | |
| "num_tokens": 5774474.0, | |
| "step": 2065 | |
| }, | |
| { | |
| "entropy": 5.5935293674469, | |
| "epoch": 0.05604060913705584, | |
| "grad_norm": 0.96875, | |
| "learning_rate": 0.0003731390762383818, | |
| "loss": 5.4934, | |
| "mean_token_accuracy": 0.15586720108985902, | |
| "num_tokens": 5788077.0, | |
| "step": 2070 | |
| }, | |
| { | |
| "entropy": 5.6637038230896, | |
| "epoch": 0.05617597292724196, | |
| "grad_norm": 0.953125, | |
| "learning_rate": 0.0003720776102782158, | |
| "loss": 5.6647, | |
| "mean_token_accuracy": 0.1455085203051567, | |
| "num_tokens": 5805257.0, | |
| "step": 2075 | |
| }, | |
| { | |
| "entropy": 5.570231914520264, | |
| "epoch": 0.056311336717428086, | |
| "grad_norm": 0.9765625, | |
| "learning_rate": 0.00037101348288632555, | |
| "loss": 5.431, | |
| "mean_token_accuracy": 0.1498264342546463, | |
| "num_tokens": 5819518.0, | |
| "step": 2080 | |
| }, | |
| { | |
| "entropy": 5.5381348609924315, | |
| "epoch": 0.05644670050761421, | |
| "grad_norm": 0.9375, | |
| "learning_rate": 0.0003699467232363012, | |
| "loss": 5.3706, | |
| "mean_token_accuracy": 0.16544263809919357, | |
| "num_tokens": 5833228.0, | |
| "step": 2085 | |
| }, | |
| { | |
| "entropy": 5.588838815689087, | |
| "epoch": 0.05658206429780034, | |
| "grad_norm": 1.0, | |
| "learning_rate": 0.0003688773605738973, | |
| "loss": 5.4515, | |
| "mean_token_accuracy": 0.15661462396383286, | |
| "num_tokens": 5847714.0, | |
| "step": 2090 | |
| }, | |
| { | |
| "entropy": 5.516980886459351, | |
| "epoch": 0.056717428087986466, | |
| "grad_norm": 0.95703125, | |
| "learning_rate": 0.00036780542421623134, | |
| "loss": 5.4794, | |
| "mean_token_accuracy": 0.15581640005111694, | |
| "num_tokens": 5861775.0, | |
| "step": 2095 | |
| }, | |
| { | |
| "entropy": 5.556796646118164, | |
| "epoch": 0.05685279187817259, | |
| "grad_norm": 0.9296875, | |
| "learning_rate": 0.0003667309435509802, | |
| "loss": 5.5511, | |
| "mean_token_accuracy": 0.15586237907409667, | |
| "num_tokens": 5875679.0, | |
| "step": 2100 | |
| }, | |
| { | |
| "entropy": 5.692843914031982, | |
| "epoch": 0.056988155668358714, | |
| "grad_norm": 0.94921875, | |
| "learning_rate": 0.0003656539480355741, | |
| "loss": 5.6027, | |
| "mean_token_accuracy": 0.15197229087352754, | |
| "num_tokens": 5889127.0, | |
| "step": 2105 | |
| }, | |
| { | |
| "entropy": 5.658493995666504, | |
| "epoch": 0.05712351945854484, | |
| "grad_norm": 1.0078125, | |
| "learning_rate": 0.0003645744671963891, | |
| "loss": 5.5212, | |
| "mean_token_accuracy": 0.16027260273694993, | |
| "num_tokens": 5902710.0, | |
| "step": 2110 | |
| }, | |
| { | |
| "entropy": 5.55581750869751, | |
| "epoch": 0.05725888324873096, | |
| "grad_norm": 1.0546875, | |
| "learning_rate": 0.0003634925306279376, | |
| "loss": 5.5784, | |
| "mean_token_accuracy": 0.1552097924053669, | |
| "num_tokens": 5914823.0, | |
| "step": 2115 | |
| }, | |
| { | |
| "entropy": 5.566669940948486, | |
| "epoch": 0.05739424703891709, | |
| "grad_norm": 0.890625, | |
| "learning_rate": 0.0003624081679920574, | |
| "loss": 5.5149, | |
| "mean_token_accuracy": 0.15782447010278702, | |
| "num_tokens": 5929553.0, | |
| "step": 2120 | |
| }, | |
| { | |
| "entropy": 5.509809684753418, | |
| "epoch": 0.05752961082910321, | |
| "grad_norm": 0.9140625, | |
| "learning_rate": 0.0003613214090170977, | |
| "loss": 5.416, | |
| "mean_token_accuracy": 0.16114599555730819, | |
| "num_tokens": 5942364.0, | |
| "step": 2125 | |
| }, | |
| { | |
| "entropy": 5.570280456542969, | |
| "epoch": 0.05766497461928934, | |
| "grad_norm": 0.98046875, | |
| "learning_rate": 0.0003602322834971048, | |
| "loss": 5.5507, | |
| "mean_token_accuracy": 0.15223699808120728, | |
| "num_tokens": 5954874.0, | |
| "step": 2130 | |
| }, | |
| { | |
| "entropy": 5.599170875549317, | |
| "epoch": 0.05780033840947547, | |
| "grad_norm": 0.95703125, | |
| "learning_rate": 0.0003591408212910051, | |
| "loss": 5.4627, | |
| "mean_token_accuracy": 0.15489756017923356, | |
| "num_tokens": 5968635.0, | |
| "step": 2135 | |
| }, | |
| { | |
| "entropy": 5.590338897705078, | |
| "epoch": 0.05793570219966159, | |
| "grad_norm": 0.9765625, | |
| "learning_rate": 0.0003580470523217863, | |
| "loss": 5.559, | |
| "mean_token_accuracy": 0.1588521420955658, | |
| "num_tokens": 5983887.0, | |
| "step": 2140 | |
| }, | |
| { | |
| "entropy": 5.656904172897339, | |
| "epoch": 0.058071065989847716, | |
| "grad_norm": 0.9296875, | |
| "learning_rate": 0.0003569510065756771, | |
| "loss": 5.5177, | |
| "mean_token_accuracy": 0.14795053601264954, | |
| "num_tokens": 5998996.0, | |
| "step": 2145 | |
| }, | |
| { | |
| "entropy": 5.560834264755249, | |
| "epoch": 0.05820642978003384, | |
| "grad_norm": 0.9140625, | |
| "learning_rate": 0.0003558527141013254, | |
| "loss": 5.4962, | |
| "mean_token_accuracy": 0.1533253774046898, | |
| "num_tokens": 6013399.0, | |
| "step": 2150 | |
| }, | |
| { | |
| "entropy": 5.6488504886627195, | |
| "epoch": 0.058341793570219964, | |
| "grad_norm": 1.0546875, | |
| "learning_rate": 0.0003547522050089742, | |
| "loss": 5.5268, | |
| "mean_token_accuracy": 0.154144811630249, | |
| "num_tokens": 6025858.0, | |
| "step": 2155 | |
| }, | |
| { | |
| "entropy": 5.50015172958374, | |
| "epoch": 0.05847715736040609, | |
| "grad_norm": 0.8828125, | |
| "learning_rate": 0.00035364950946963606, | |
| "loss": 5.4178, | |
| "mean_token_accuracy": 0.1639969304203987, | |
| "num_tokens": 6040129.0, | |
| "step": 2160 | |
| }, | |
| { | |
| "entropy": 5.572449398040772, | |
| "epoch": 0.05861252115059222, | |
| "grad_norm": 0.9375, | |
| "learning_rate": 0.0003525446577142663, | |
| "loss": 5.5237, | |
| "mean_token_accuracy": 0.15481064915657045, | |
| "num_tokens": 6052988.0, | |
| "step": 2165 | |
| }, | |
| { | |
| "entropy": 5.599097108840942, | |
| "epoch": 0.058747884940778344, | |
| "grad_norm": 0.97265625, | |
| "learning_rate": 0.00035143768003293395, | |
| "loss": 5.4731, | |
| "mean_token_accuracy": 0.16200729161500932, | |
| "num_tokens": 6066901.0, | |
| "step": 2170 | |
| }, | |
| { | |
| "entropy": 5.604894495010376, | |
| "epoch": 0.05888324873096447, | |
| "grad_norm": 1.03125, | |
| "learning_rate": 0.0003503286067739913, | |
| "loss": 5.4809, | |
| "mean_token_accuracy": 0.15721836537122727, | |
| "num_tokens": 6080221.0, | |
| "step": 2175 | |
| }, | |
| { | |
| "entropy": 5.617720413208008, | |
| "epoch": 0.05901861252115059, | |
| "grad_norm": 1.03125, | |
| "learning_rate": 0.00034921746834324193, | |
| "loss": 5.5341, | |
| "mean_token_accuracy": 0.14920639246702194, | |
| "num_tokens": 6093591.0, | |
| "step": 2180 | |
| }, | |
| { | |
| "entropy": 5.5153953552246096, | |
| "epoch": 0.05915397631133672, | |
| "grad_norm": 0.91796875, | |
| "learning_rate": 0.0003481042952031072, | |
| "loss": 5.4102, | |
| "mean_token_accuracy": 0.15838973969221115, | |
| "num_tokens": 6107427.0, | |
| "step": 2185 | |
| }, | |
| { | |
| "entropy": 5.622984933853149, | |
| "epoch": 0.05928934010152284, | |
| "grad_norm": 0.984375, | |
| "learning_rate": 0.0003469891178717911, | |
| "loss": 5.5577, | |
| "mean_token_accuracy": 0.15597878992557526, | |
| "num_tokens": 6121355.0, | |
| "step": 2190 | |
| }, | |
| { | |
| "entropy": 5.5580566883087155, | |
| "epoch": 0.059424703891708966, | |
| "grad_norm": 1.0390625, | |
| "learning_rate": 0.0003458719669224436, | |
| "loss": 5.5422, | |
| "mean_token_accuracy": 0.15654557049274445, | |
| "num_tokens": 6133328.0, | |
| "step": 2195 | |
| }, | |
| { | |
| "entropy": 5.6222865104675295, | |
| "epoch": 0.05956006768189509, | |
| "grad_norm": 0.9296875, | |
| "learning_rate": 0.0003447528729823221, | |
| "loss": 5.4815, | |
| "mean_token_accuracy": 0.15166250467300416, | |
| "num_tokens": 6149486.0, | |
| "step": 2200 | |
| }, | |
| { | |
| "entropy": 5.561207914352417, | |
| "epoch": 0.05969543147208122, | |
| "grad_norm": 1.0234375, | |
| "learning_rate": 0.0003436318667319525, | |
| "loss": 5.4912, | |
| "mean_token_accuracy": 0.1630606085062027, | |
| "num_tokens": 6161447.0, | |
| "step": 2205 | |
| }, | |
| { | |
| "entropy": 5.557836532592773, | |
| "epoch": 0.059830795262267346, | |
| "grad_norm": 0.99609375, | |
| "learning_rate": 0.00034250897890428716, | |
| "loss": 5.5187, | |
| "mean_token_accuracy": 0.15890539884567262, | |
| "num_tokens": 6176368.0, | |
| "step": 2210 | |
| }, | |
| { | |
| "entropy": 5.5497699737548825, | |
| "epoch": 0.05996615905245347, | |
| "grad_norm": 0.9296875, | |
| "learning_rate": 0.0003413842402838633, | |
| "loss": 5.4567, | |
| "mean_token_accuracy": 0.1620472937822342, | |
| "num_tokens": 6190248.0, | |
| "step": 2215 | |
| }, | |
| { | |
| "entropy": 5.514479446411133, | |
| "epoch": 0.060101522842639594, | |
| "grad_norm": 0.97265625, | |
| "learning_rate": 0.00034025768170595834, | |
| "loss": 5.3753, | |
| "mean_token_accuracy": 0.16145753711462021, | |
| "num_tokens": 6205507.0, | |
| "step": 2220 | |
| }, | |
| { | |
| "entropy": 5.512839603424072, | |
| "epoch": 0.06023688663282572, | |
| "grad_norm": 0.875, | |
| "learning_rate": 0.0003391293340557446, | |
| "loss": 5.4593, | |
| "mean_token_accuracy": 0.15989638343453408, | |
| "num_tokens": 6218970.0, | |
| "step": 2225 | |
| }, | |
| { | |
| "entropy": 5.630588674545288, | |
| "epoch": 0.06037225042301184, | |
| "grad_norm": 1.0078125, | |
| "learning_rate": 0.0003379992282674431, | |
| "loss": 5.5762, | |
| "mean_token_accuracy": 0.15546667575836182, | |
| "num_tokens": 6232095.0, | |
| "step": 2230 | |
| }, | |
| { | |
| "entropy": 5.60104660987854, | |
| "epoch": 0.06050761421319797, | |
| "grad_norm": 0.8203125, | |
| "learning_rate": 0.0003368673953234749, | |
| "loss": 5.4843, | |
| "mean_token_accuracy": 0.16127849221229554, | |
| "num_tokens": 6247195.0, | |
| "step": 2235 | |
| }, | |
| { | |
| "entropy": 5.5306642055511475, | |
| "epoch": 0.06064297800338409, | |
| "grad_norm": 0.953125, | |
| "learning_rate": 0.00033573386625361176, | |
| "loss": 5.5001, | |
| "mean_token_accuracy": 0.15367966145277023, | |
| "num_tokens": 6262704.0, | |
| "step": 2240 | |
| }, | |
| { | |
| "entropy": 5.612587547302246, | |
| "epoch": 0.06077834179357022, | |
| "grad_norm": 0.92578125, | |
| "learning_rate": 0.00033459867213412567, | |
| "loss": 5.5317, | |
| "mean_token_accuracy": 0.15857135504484177, | |
| "num_tokens": 6277115.0, | |
| "step": 2245 | |
| }, | |
| { | |
| "entropy": 5.64555606842041, | |
| "epoch": 0.06091370558375635, | |
| "grad_norm": 0.9453125, | |
| "learning_rate": 0.000333461844086937, | |
| "loss": 5.5412, | |
| "mean_token_accuracy": 0.15073265060782431, | |
| "num_tokens": 6291597.0, | |
| "step": 2250 | |
| }, | |
| { | |
| "entropy": 5.520713806152344, | |
| "epoch": 0.06104906937394247, | |
| "grad_norm": 0.90234375, | |
| "learning_rate": 0.00033232341327876097, | |
| "loss": 5.4102, | |
| "mean_token_accuracy": 0.16134743243455887, | |
| "num_tokens": 6306256.0, | |
| "step": 2255 | |
| }, | |
| { | |
| "entropy": 5.444108724594116, | |
| "epoch": 0.061184433164128596, | |
| "grad_norm": 0.98828125, | |
| "learning_rate": 0.0003311834109202531, | |
| "loss": 5.4201, | |
| "mean_token_accuracy": 0.16176949292421341, | |
| "num_tokens": 6320853.0, | |
| "step": 2260 | |
| }, | |
| { | |
| "entropy": 5.6139593601226805, | |
| "epoch": 0.06131979695431472, | |
| "grad_norm": 0.95703125, | |
| "learning_rate": 0.00033004186826515416, | |
| "loss": 5.4732, | |
| "mean_token_accuracy": 0.15738911405205727, | |
| "num_tokens": 6334681.0, | |
| "step": 2265 | |
| }, | |
| { | |
| "entropy": 5.526891708374023, | |
| "epoch": 0.061455160744500845, | |
| "grad_norm": 0.9140625, | |
| "learning_rate": 0.0003288988166094324, | |
| "loss": 5.4956, | |
| "mean_token_accuracy": 0.15784757435321808, | |
| "num_tokens": 6350426.0, | |
| "step": 2270 | |
| }, | |
| { | |
| "entropy": 5.58657021522522, | |
| "epoch": 0.06159052453468697, | |
| "grad_norm": 0.921875, | |
| "learning_rate": 0.00032775428729042656, | |
| "loss": 5.4416, | |
| "mean_token_accuracy": 0.16237595677375793, | |
| "num_tokens": 6364646.0, | |
| "step": 2275 | |
| }, | |
| { | |
| "entropy": 5.508593463897705, | |
| "epoch": 0.06172588832487309, | |
| "grad_norm": 0.94140625, | |
| "learning_rate": 0.000326608311685986, | |
| "loss": 5.4866, | |
| "mean_token_accuracy": 0.16056797206401824, | |
| "num_tokens": 6380020.0, | |
| "step": 2280 | |
| }, | |
| { | |
| "entropy": 5.6077048778533936, | |
| "epoch": 0.061861252115059225, | |
| "grad_norm": 0.91015625, | |
| "learning_rate": 0.0003254609212136108, | |
| "loss": 5.4236, | |
| "mean_token_accuracy": 0.16293450444936752, | |
| "num_tokens": 6393124.0, | |
| "step": 2285 | |
| }, | |
| { | |
| "entropy": 5.595155477523804, | |
| "epoch": 0.06199661590524535, | |
| "grad_norm": 0.890625, | |
| "learning_rate": 0.00032431214732959036, | |
| "loss": 5.5536, | |
| "mean_token_accuracy": 0.1563761591911316, | |
| "num_tokens": 6409125.0, | |
| "step": 2290 | |
| }, | |
| { | |
| "entropy": 5.585239553451538, | |
| "epoch": 0.06213197969543147, | |
| "grad_norm": 0.8828125, | |
| "learning_rate": 0.000323162021528141, | |
| "loss": 5.4177, | |
| "mean_token_accuracy": 0.16349790394306182, | |
| "num_tokens": 6423597.0, | |
| "step": 2295 | |
| }, | |
| { | |
| "entropy": 5.47139458656311, | |
| "epoch": 0.0622673434856176, | |
| "grad_norm": 0.86328125, | |
| "learning_rate": 0.00032201057534054264, | |
| "loss": 5.349, | |
| "mean_token_accuracy": 0.16430194079875945, | |
| "num_tokens": 6437897.0, | |
| "step": 2300 | |
| }, | |
| { | |
| "entropy": 5.547074794769287, | |
| "epoch": 0.06240270727580372, | |
| "grad_norm": 0.91015625, | |
| "learning_rate": 0.00032085784033427414, | |
| "loss": 5.5022, | |
| "mean_token_accuracy": 0.15308141559362412, | |
| "num_tokens": 6451760.0, | |
| "step": 2305 | |
| }, | |
| { | |
| "entropy": 5.511609315872192, | |
| "epoch": 0.06253807106598985, | |
| "grad_norm": 1.03125, | |
| "learning_rate": 0.0003197038481121478, | |
| "loss": 5.3525, | |
| "mean_token_accuracy": 0.16880294680595398, | |
| "num_tokens": 6465182.0, | |
| "step": 2310 | |
| }, | |
| { | |
| "entropy": 5.574721622467041, | |
| "epoch": 0.06267343485617598, | |
| "grad_norm": 0.890625, | |
| "learning_rate": 0.0003185486303114436, | |
| "loss": 5.4606, | |
| "mean_token_accuracy": 0.15778982043266296, | |
| "num_tokens": 6479146.0, | |
| "step": 2315 | |
| }, | |
| { | |
| "entropy": 5.50466685295105, | |
| "epoch": 0.0628087986463621, | |
| "grad_norm": 0.984375, | |
| "learning_rate": 0.0003173922186030409, | |
| "loss": 5.3229, | |
| "mean_token_accuracy": 0.16876034587621688, | |
| "num_tokens": 6492562.0, | |
| "step": 2320 | |
| }, | |
| { | |
| "entropy": 5.41968674659729, | |
| "epoch": 0.06294416243654823, | |
| "grad_norm": 1.03125, | |
| "learning_rate": 0.000316234644690551, | |
| "loss": 5.38, | |
| "mean_token_accuracy": 0.16006240993738174, | |
| "num_tokens": 6506530.0, | |
| "step": 2325 | |
| }, | |
| { | |
| "entropy": 5.528688192367554, | |
| "epoch": 0.06307952622673435, | |
| "grad_norm": 0.9921875, | |
| "learning_rate": 0.0003150759403094473, | |
| "loss": 5.434, | |
| "mean_token_accuracy": 0.16276055127382277, | |
| "num_tokens": 6521676.0, | |
| "step": 2330 | |
| }, | |
| { | |
| "entropy": 5.513411903381348, | |
| "epoch": 0.06321489001692047, | |
| "grad_norm": 0.98828125, | |
| "learning_rate": 0.00031391613722619587, | |
| "loss": 5.3759, | |
| "mean_token_accuracy": 0.1745678424835205, | |
| "num_tokens": 6532997.0, | |
| "step": 2335 | |
| }, | |
| { | |
| "entropy": 5.529337978363037, | |
| "epoch": 0.0633502538071066, | |
| "grad_norm": 0.97265625, | |
| "learning_rate": 0.000312755267237384, | |
| "loss": 5.4224, | |
| "mean_token_accuracy": 0.16465317010879515, | |
| "num_tokens": 6548174.0, | |
| "step": 2340 | |
| }, | |
| { | |
| "entropy": 5.6073933124542235, | |
| "epoch": 0.06348561759729272, | |
| "grad_norm": 0.953125, | |
| "learning_rate": 0.0003115933621688488, | |
| "loss": 5.5427, | |
| "mean_token_accuracy": 0.15725521594285966, | |
| "num_tokens": 6563064.0, | |
| "step": 2345 | |
| }, | |
| { | |
| "entropy": 5.537544775009155, | |
| "epoch": 0.06362098138747885, | |
| "grad_norm": 1.0390625, | |
| "learning_rate": 0.00031043045387480487, | |
| "loss": 5.5134, | |
| "mean_token_accuracy": 0.15672265142202377, | |
| "num_tokens": 6576582.0, | |
| "step": 2350 | |
| }, | |
| { | |
| "entropy": 5.655880641937256, | |
| "epoch": 0.06375634517766497, | |
| "grad_norm": 0.90234375, | |
| "learning_rate": 0.0003092665742369703, | |
| "loss": 5.4981, | |
| "mean_token_accuracy": 0.153935007750988, | |
| "num_tokens": 6592583.0, | |
| "step": 2355 | |
| }, | |
| { | |
| "entropy": 5.640050649642944, | |
| "epoch": 0.0638917089678511, | |
| "grad_norm": 0.8984375, | |
| "learning_rate": 0.00030810175516369343, | |
| "loss": 5.5216, | |
| "mean_token_accuracy": 0.1580222949385643, | |
| "num_tokens": 6608513.0, | |
| "step": 2360 | |
| }, | |
| { | |
| "entropy": 5.569810676574707, | |
| "epoch": 0.06402707275803722, | |
| "grad_norm": 0.890625, | |
| "learning_rate": 0.0003069360285890775, | |
| "loss": 5.4921, | |
| "mean_token_accuracy": 0.15731192976236344, | |
| "num_tokens": 6622427.0, | |
| "step": 2365 | |
| }, | |
| { | |
| "entropy": 5.60255537033081, | |
| "epoch": 0.06416243654822334, | |
| "grad_norm": 0.96484375, | |
| "learning_rate": 0.00030576942647210547, | |
| "loss": 5.4613, | |
| "mean_token_accuracy": 0.16770876348018646, | |
| "num_tokens": 6636196.0, | |
| "step": 2370 | |
| }, | |
| { | |
| "entropy": 5.543747758865356, | |
| "epoch": 0.06429780033840947, | |
| "grad_norm": 1.046875, | |
| "learning_rate": 0.00030460198079576355, | |
| "loss": 5.4506, | |
| "mean_token_accuracy": 0.16442616730928422, | |
| "num_tokens": 6648393.0, | |
| "step": 2375 | |
| }, | |
| { | |
| "entropy": 5.5761157989501955, | |
| "epoch": 0.06443316412859561, | |
| "grad_norm": 0.97265625, | |
| "learning_rate": 0.0003034337235661648, | |
| "loss": 5.4201, | |
| "mean_token_accuracy": 0.16427001357078552, | |
| "num_tokens": 6662062.0, | |
| "step": 2380 | |
| }, | |
| { | |
| "entropy": 5.5971932888031, | |
| "epoch": 0.06456852791878173, | |
| "grad_norm": 0.94921875, | |
| "learning_rate": 0.0003022646868116714, | |
| "loss": 5.4853, | |
| "mean_token_accuracy": 0.1576756104826927, | |
| "num_tokens": 6677299.0, | |
| "step": 2385 | |
| }, | |
| { | |
| "entropy": 5.595594882965088, | |
| "epoch": 0.06470389170896786, | |
| "grad_norm": 1.046875, | |
| "learning_rate": 0.0003010949025820163, | |
| "loss": 5.5071, | |
| "mean_token_accuracy": 0.15385562032461167, | |
| "num_tokens": 6692573.0, | |
| "step": 2390 | |
| }, | |
| { | |
| "entropy": 5.709032297134399, | |
| "epoch": 0.06483925549915398, | |
| "grad_norm": 0.9453125, | |
| "learning_rate": 0.0002999244029474252, | |
| "loss": 5.5817, | |
| "mean_token_accuracy": 0.15576104819774628, | |
| "num_tokens": 6706081.0, | |
| "step": 2395 | |
| }, | |
| { | |
| "entropy": 5.572895097732544, | |
| "epoch": 0.0649746192893401, | |
| "grad_norm": 0.8515625, | |
| "learning_rate": 0.00029875321999773684, | |
| "loss": 5.4139, | |
| "mean_token_accuracy": 0.1568359524011612, | |
| "num_tokens": 6721662.0, | |
| "step": 2400 | |
| }, | |
| { | |
| "entropy": 5.530266189575196, | |
| "epoch": 0.06510998307952623, | |
| "grad_norm": 1.046875, | |
| "learning_rate": 0.00029758138584152333, | |
| "loss": 5.5371, | |
| "mean_token_accuracy": 0.15827345550060273, | |
| "num_tokens": 6735226.0, | |
| "step": 2405 | |
| }, | |
| { | |
| "entropy": 5.741498231887817, | |
| "epoch": 0.06524534686971235, | |
| "grad_norm": 0.87890625, | |
| "learning_rate": 0.0002964089326052102, | |
| "loss": 5.61, | |
| "mean_token_accuracy": 0.1486797995865345, | |
| "num_tokens": 6750351.0, | |
| "step": 2410 | |
| }, | |
| { | |
| "entropy": 5.482465362548828, | |
| "epoch": 0.06538071065989848, | |
| "grad_norm": 1.0546875, | |
| "learning_rate": 0.0002952358924321949, | |
| "loss": 5.343, | |
| "mean_token_accuracy": 0.1717396318912506, | |
| "num_tokens": 6762285.0, | |
| "step": 2415 | |
| }, | |
| { | |
| "entropy": 5.579564380645752, | |
| "epoch": 0.0655160744500846, | |
| "grad_norm": 0.9453125, | |
| "learning_rate": 0.00029406229748196657, | |
| "loss": 5.5056, | |
| "mean_token_accuracy": 0.15708825439214708, | |
| "num_tokens": 6778866.0, | |
| "step": 2420 | |
| }, | |
| { | |
| "entropy": 5.575643253326416, | |
| "epoch": 0.06565143824027073, | |
| "grad_norm": 0.9140625, | |
| "learning_rate": 0.0002928881799292235, | |
| "loss": 5.3694, | |
| "mean_token_accuracy": 0.16926451921463012, | |
| "num_tokens": 6792127.0, | |
| "step": 2425 | |
| }, | |
| { | |
| "entropy": 5.550977325439453, | |
| "epoch": 0.06578680203045685, | |
| "grad_norm": 0.94140625, | |
| "learning_rate": 0.00029171357196299154, | |
| "loss": 5.5019, | |
| "mean_token_accuracy": 0.15696292817592622, | |
| "num_tokens": 6805692.0, | |
| "step": 2430 | |
| }, | |
| { | |
| "entropy": 5.502995109558105, | |
| "epoch": 0.06592216582064298, | |
| "grad_norm": 0.86328125, | |
| "learning_rate": 0.0002905385057857414, | |
| "loss": 5.4826, | |
| "mean_token_accuracy": 0.15718090236186982, | |
| "num_tokens": 6820533.0, | |
| "step": 2435 | |
| }, | |
| { | |
| "entropy": 5.5539785861969, | |
| "epoch": 0.0660575296108291, | |
| "grad_norm": 0.8671875, | |
| "learning_rate": 0.0002893630136125058, | |
| "loss": 5.38, | |
| "mean_token_accuracy": 0.1642708361148834, | |
| "num_tokens": 6834746.0, | |
| "step": 2440 | |
| }, | |
| { | |
| "entropy": 5.579140996932983, | |
| "epoch": 0.06619289340101522, | |
| "grad_norm": 0.9375, | |
| "learning_rate": 0.0002881871276699967, | |
| "loss": 5.432, | |
| "mean_token_accuracy": 0.1649514243006706, | |
| "num_tokens": 6848480.0, | |
| "step": 2445 | |
| }, | |
| { | |
| "entropy": 5.482105016708374, | |
| "epoch": 0.06632825719120135, | |
| "grad_norm": 0.875, | |
| "learning_rate": 0.00028701088019572114, | |
| "loss": 5.4089, | |
| "mean_token_accuracy": 0.16585078686475754, | |
| "num_tokens": 6863817.0, | |
| "step": 2450 | |
| }, | |
| { | |
| "entropy": 5.485904407501221, | |
| "epoch": 0.06646362098138747, | |
| "grad_norm": 0.953125, | |
| "learning_rate": 0.0002858343034370977, | |
| "loss": 5.3672, | |
| "mean_token_accuracy": 0.1629736080765724, | |
| "num_tokens": 6879028.0, | |
| "step": 2455 | |
| }, | |
| { | |
| "entropy": 5.567845058441162, | |
| "epoch": 0.06659898477157361, | |
| "grad_norm": 1.0, | |
| "learning_rate": 0.00028465742965057267, | |
| "loss": 5.4993, | |
| "mean_token_accuracy": 0.1671033576130867, | |
| "num_tokens": 6892582.0, | |
| "step": 2460 | |
| }, | |
| { | |
| "entropy": 5.588065147399902, | |
| "epoch": 0.06673434856175973, | |
| "grad_norm": 0.98046875, | |
| "learning_rate": 0.00028348029110073533, | |
| "loss": 5.3907, | |
| "mean_token_accuracy": 0.15922013744711877, | |
| "num_tokens": 6905716.0, | |
| "step": 2465 | |
| }, | |
| { | |
| "entropy": 5.482119083404541, | |
| "epoch": 0.06686971235194586, | |
| "grad_norm": 1.0625, | |
| "learning_rate": 0.00028230292005943365, | |
| "loss": 5.3633, | |
| "mean_token_accuracy": 0.17306406795978546, | |
| "num_tokens": 6920266.0, | |
| "step": 2470 | |
| }, | |
| { | |
| "entropy": 5.454979324340821, | |
| "epoch": 0.06700507614213198, | |
| "grad_norm": 0.83984375, | |
| "learning_rate": 0.00028112534880488945, | |
| "loss": 5.4226, | |
| "mean_token_accuracy": 0.16642075926065444, | |
| "num_tokens": 6934274.0, | |
| "step": 2475 | |
| }, | |
| { | |
| "entropy": 5.539786052703858, | |
| "epoch": 0.06714043993231811, | |
| "grad_norm": 0.8984375, | |
| "learning_rate": 0.0002799476096208137, | |
| "loss": 5.4063, | |
| "mean_token_accuracy": 0.16389644294977188, | |
| "num_tokens": 6949020.0, | |
| "step": 2480 | |
| }, | |
| { | |
| "entropy": 5.504109811782837, | |
| "epoch": 0.06727580372250423, | |
| "grad_norm": 0.98828125, | |
| "learning_rate": 0.00027876973479552087, | |
| "loss": 5.3474, | |
| "mean_token_accuracy": 0.16669356375932692, | |
| "num_tokens": 6962687.0, | |
| "step": 2485 | |
| }, | |
| { | |
| "entropy": 5.562744235992431, | |
| "epoch": 0.06741116751269036, | |
| "grad_norm": 0.87890625, | |
| "learning_rate": 0.00027759175662104424, | |
| "loss": 5.5178, | |
| "mean_token_accuracy": 0.15945329070091246, | |
| "num_tokens": 6977877.0, | |
| "step": 2490 | |
| }, | |
| { | |
| "entropy": 5.653814268112183, | |
| "epoch": 0.06754653130287648, | |
| "grad_norm": 0.98046875, | |
| "learning_rate": 0.0002764137073922508, | |
| "loss": 5.561, | |
| "mean_token_accuracy": 0.15105569660663604, | |
| "num_tokens": 6992784.0, | |
| "step": 2495 | |
| }, | |
| { | |
| "entropy": 5.4771082401275635, | |
| "epoch": 0.0676818950930626, | |
| "grad_norm": 1.0078125, | |
| "learning_rate": 0.00027523561940595505, | |
| "loss": 5.3698, | |
| "mean_token_accuracy": 0.17183669209480285, | |
| "num_tokens": 7007496.0, | |
| "step": 2500 | |
| }, | |
| { | |
| "entropy": 5.495787239074707, | |
| "epoch": 0.06781725888324873, | |
| "grad_norm": 0.875, | |
| "learning_rate": 0.0002740575249600342, | |
| "loss": 5.3815, | |
| "mean_token_accuracy": 0.16253670752048494, | |
| "num_tokens": 7020482.0, | |
| "step": 2505 | |
| }, | |
| { | |
| "entropy": 5.591378307342529, | |
| "epoch": 0.06795262267343485, | |
| "grad_norm": 0.9921875, | |
| "learning_rate": 0.00027287945635254263, | |
| "loss": 5.4631, | |
| "mean_token_accuracy": 0.15494969636201858, | |
| "num_tokens": 7034021.0, | |
| "step": 2510 | |
| }, | |
| { | |
| "entropy": 5.639207792282105, | |
| "epoch": 0.06808798646362098, | |
| "grad_norm": 1.0234375, | |
| "learning_rate": 0.00027170144588082635, | |
| "loss": 5.4504, | |
| "mean_token_accuracy": 0.156061589717865, | |
| "num_tokens": 7046897.0, | |
| "step": 2515 | |
| }, | |
| { | |
| "entropy": 5.4708277702331545, | |
| "epoch": 0.0682233502538071, | |
| "grad_norm": 1.0, | |
| "learning_rate": 0.00027052352584063763, | |
| "loss": 5.3641, | |
| "mean_token_accuracy": 0.16388892978429795, | |
| "num_tokens": 7060916.0, | |
| "step": 2520 | |
| }, | |
| { | |
| "entropy": 5.4516136169433596, | |
| "epoch": 0.06835871404399323, | |
| "grad_norm": 1.0546875, | |
| "learning_rate": 0.00026934572852524907, | |
| "loss": 5.3295, | |
| "mean_token_accuracy": 0.1627664878964424, | |
| "num_tokens": 7074298.0, | |
| "step": 2525 | |
| }, | |
| { | |
| "entropy": 5.521515798568726, | |
| "epoch": 0.06849407783417935, | |
| "grad_norm": 1.03125, | |
| "learning_rate": 0.00026816808622456937, | |
| "loss": 5.3544, | |
| "mean_token_accuracy": 0.16788979172706603, | |
| "num_tokens": 7088716.0, | |
| "step": 2530 | |
| }, | |
| { | |
| "entropy": 5.494029998779297, | |
| "epoch": 0.06862944162436548, | |
| "grad_norm": 0.91796875, | |
| "learning_rate": 0.0002669906312242569, | |
| "loss": 5.346, | |
| "mean_token_accuracy": 0.17190950810909272, | |
| "num_tokens": 7103508.0, | |
| "step": 2535 | |
| }, | |
| { | |
| "entropy": 5.537734889984131, | |
| "epoch": 0.06876480541455161, | |
| "grad_norm": 1.0078125, | |
| "learning_rate": 0.00026581339580483525, | |
| "loss": 5.4624, | |
| "mean_token_accuracy": 0.161481374502182, | |
| "num_tokens": 7117534.0, | |
| "step": 2540 | |
| }, | |
| { | |
| "entropy": 5.570920372009278, | |
| "epoch": 0.06890016920473774, | |
| "grad_norm": 1.0390625, | |
| "learning_rate": 0.0002646364122408082, | |
| "loss": 5.4882, | |
| "mean_token_accuracy": 0.15791051536798478, | |
| "num_tokens": 7130707.0, | |
| "step": 2545 | |
| }, | |
| { | |
| "entropy": 5.582677364349365, | |
| "epoch": 0.06903553299492386, | |
| "grad_norm": 0.9453125, | |
| "learning_rate": 0.0002634597127997749, | |
| "loss": 5.482, | |
| "mean_token_accuracy": 0.16266081035137175, | |
| "num_tokens": 7146298.0, | |
| "step": 2550 | |
| }, | |
| { | |
| "entropy": 5.409732484817505, | |
| "epoch": 0.06917089678510999, | |
| "grad_norm": 0.84375, | |
| "learning_rate": 0.0002622833297415445, | |
| "loss": 5.2559, | |
| "mean_token_accuracy": 0.17082736790180206, | |
| "num_tokens": 7161266.0, | |
| "step": 2555 | |
| }, | |
| { | |
| "entropy": 5.504514932632446, | |
| "epoch": 0.06930626057529611, | |
| "grad_norm": 0.875, | |
| "learning_rate": 0.0002611072953172531, | |
| "loss": 5.3892, | |
| "mean_token_accuracy": 0.16824420988559724, | |
| "num_tokens": 7175543.0, | |
| "step": 2560 | |
| }, | |
| { | |
| "entropy": 5.419651794433594, | |
| "epoch": 0.06944162436548224, | |
| "grad_norm": 1.015625, | |
| "learning_rate": 0.00025993164176847845, | |
| "loss": 5.3044, | |
| "mean_token_accuracy": 0.17822718918323516, | |
| "num_tokens": 7189617.0, | |
| "step": 2565 | |
| }, | |
| { | |
| "entropy": 5.537864732742309, | |
| "epoch": 0.06957698815566836, | |
| "grad_norm": 1.0078125, | |
| "learning_rate": 0.0002587564013263564, | |
| "loss": 5.3945, | |
| "mean_token_accuracy": 0.1665595144033432, | |
| "num_tokens": 7203722.0, | |
| "step": 2570 | |
| }, | |
| { | |
| "entropy": 5.484334468841553, | |
| "epoch": 0.06971235194585448, | |
| "grad_norm": 0.953125, | |
| "learning_rate": 0.0002575816062106974, | |
| "loss": 5.3907, | |
| "mean_token_accuracy": 0.1719420000910759, | |
| "num_tokens": 7215988.0, | |
| "step": 2575 | |
| }, | |
| { | |
| "entropy": 5.398307371139526, | |
| "epoch": 0.06984771573604061, | |
| "grad_norm": 0.8828125, | |
| "learning_rate": 0.00025640728862910293, | |
| "loss": 5.2727, | |
| "mean_token_accuracy": 0.16697476506233216, | |
| "num_tokens": 7231974.0, | |
| "step": 2580 | |
| }, | |
| { | |
| "entropy": 5.451391649246216, | |
| "epoch": 0.06998307952622673, | |
| "grad_norm": 0.94140625, | |
| "learning_rate": 0.00025523348077608285, | |
| "loss": 5.334, | |
| "mean_token_accuracy": 0.16734268814325332, | |
| "num_tokens": 7247564.0, | |
| "step": 2585 | |
| }, | |
| { | |
| "entropy": 5.557687759399414, | |
| "epoch": 0.07011844331641286, | |
| "grad_norm": 0.97265625, | |
| "learning_rate": 0.00025406021483217225, | |
| "loss": 5.3802, | |
| "mean_token_accuracy": 0.16443277895450592, | |
| "num_tokens": 7262757.0, | |
| "step": 2590 | |
| }, | |
| { | |
| "entropy": 5.511172676086426, | |
| "epoch": 0.07025380710659898, | |
| "grad_norm": 0.95703125, | |
| "learning_rate": 0.00025288752296304963, | |
| "loss": 5.4948, | |
| "mean_token_accuracy": 0.15715145468711852, | |
| "num_tokens": 7277354.0, | |
| "step": 2595 | |
| }, | |
| { | |
| "entropy": 5.5072393894195555, | |
| "epoch": 0.0703891708967851, | |
| "grad_norm": 0.9296875, | |
| "learning_rate": 0.000251715437318655, | |
| "loss": 5.3905, | |
| "mean_token_accuracy": 0.1723044529557228, | |
| "num_tokens": 7291468.0, | |
| "step": 2600 | |
| }, | |
| { | |
| "entropy": 5.505620288848877, | |
| "epoch": 0.07052453468697123, | |
| "grad_norm": 1.0, | |
| "learning_rate": 0.0002505439900323084, | |
| "loss": 5.2772, | |
| "mean_token_accuracy": 0.17259037345647812, | |
| "num_tokens": 7304480.0, | |
| "step": 2605 | |
| }, | |
| { | |
| "entropy": 5.533134651184082, | |
| "epoch": 0.07065989847715735, | |
| "grad_norm": 0.94140625, | |
| "learning_rate": 0.00024937321321982894, | |
| "loss": 5.388, | |
| "mean_token_accuracy": 0.15711098909378052, | |
| "num_tokens": 7318827.0, | |
| "step": 2610 | |
| }, | |
| { | |
| "entropy": 5.462842607498169, | |
| "epoch": 0.07079526226734349, | |
| "grad_norm": 0.95703125, | |
| "learning_rate": 0.00024820313897865433, | |
| "loss": 5.4047, | |
| "mean_token_accuracy": 0.16648803055286407, | |
| "num_tokens": 7331988.0, | |
| "step": 2615 | |
| }, | |
| { | |
| "entropy": 5.606928825378418, | |
| "epoch": 0.07093062605752962, | |
| "grad_norm": 0.90625, | |
| "learning_rate": 0.00024703379938696105, | |
| "loss": 5.3909, | |
| "mean_token_accuracy": 0.16330956071615219, | |
| "num_tokens": 7345740.0, | |
| "step": 2620 | |
| }, | |
| { | |
| "entropy": 5.496723222732544, | |
| "epoch": 0.07106598984771574, | |
| "grad_norm": 0.86328125, | |
| "learning_rate": 0.00024586522650278447, | |
| "loss": 5.3324, | |
| "mean_token_accuracy": 0.1629031166434288, | |
| "num_tokens": 7359100.0, | |
| "step": 2625 | |
| }, | |
| { | |
| "entropy": 5.492794418334961, | |
| "epoch": 0.07120135363790187, | |
| "grad_norm": 0.96484375, | |
| "learning_rate": 0.00024469745236314064, | |
| "loss": 5.4332, | |
| "mean_token_accuracy": 0.16518517211079597, | |
| "num_tokens": 7373261.0, | |
| "step": 2630 | |
| }, | |
| { | |
| "entropy": 5.497795438766479, | |
| "epoch": 0.07133671742808799, | |
| "grad_norm": 1.0546875, | |
| "learning_rate": 0.00024353050898314767, | |
| "loss": 5.3778, | |
| "mean_token_accuracy": 0.16042957752943038, | |
| "num_tokens": 7386125.0, | |
| "step": 2635 | |
| }, | |
| { | |
| "entropy": 5.579156875610352, | |
| "epoch": 0.07147208121827411, | |
| "grad_norm": 0.94140625, | |
| "learning_rate": 0.00024236442835514743, | |
| "loss": 5.4228, | |
| "mean_token_accuracy": 0.16269408017396927, | |
| "num_tokens": 7400206.0, | |
| "step": 2640 | |
| }, | |
| { | |
| "entropy": 5.575217056274414, | |
| "epoch": 0.07160744500846024, | |
| "grad_norm": 0.94921875, | |
| "learning_rate": 0.00024119924244782965, | |
| "loss": 5.3759, | |
| "mean_token_accuracy": 0.16886017620563507, | |
| "num_tokens": 7414133.0, | |
| "step": 2645 | |
| }, | |
| { | |
| "entropy": 5.414534330368042, | |
| "epoch": 0.07174280879864636, | |
| "grad_norm": 0.92578125, | |
| "learning_rate": 0.00024003498320535462, | |
| "loss": 5.2814, | |
| "mean_token_accuracy": 0.17329987585544587, | |
| "num_tokens": 7428976.0, | |
| "step": 2650 | |
| }, | |
| { | |
| "entropy": 5.428465366363525, | |
| "epoch": 0.07187817258883249, | |
| "grad_norm": 0.94921875, | |
| "learning_rate": 0.00023887168254647727, | |
| "loss": 5.2716, | |
| "mean_token_accuracy": 0.16944997161626815, | |
| "num_tokens": 7442821.0, | |
| "step": 2655 | |
| }, | |
| { | |
| "entropy": 5.4997495174407955, | |
| "epoch": 0.07201353637901861, | |
| "grad_norm": 0.90625, | |
| "learning_rate": 0.00023770937236367308, | |
| "loss": 5.3966, | |
| "mean_token_accuracy": 0.16241525560617448, | |
| "num_tokens": 7459447.0, | |
| "step": 2660 | |
| }, | |
| { | |
| "entropy": 5.482759618759156, | |
| "epoch": 0.07214890016920474, | |
| "grad_norm": 0.89453125, | |
| "learning_rate": 0.00023654808452226278, | |
| "loss": 5.3326, | |
| "mean_token_accuracy": 0.17035989910364152, | |
| "num_tokens": 7474103.0, | |
| "step": 2665 | |
| }, | |
| { | |
| "entropy": 5.577449703216553, | |
| "epoch": 0.07228426395939086, | |
| "grad_norm": 1.015625, | |
| "learning_rate": 0.00023538785085953912, | |
| "loss": 5.4343, | |
| "mean_token_accuracy": 0.16333755105733871, | |
| "num_tokens": 7487976.0, | |
| "step": 2670 | |
| }, | |
| { | |
| "entropy": 5.547738122940063, | |
| "epoch": 0.07241962774957698, | |
| "grad_norm": 0.953125, | |
| "learning_rate": 0.00023422870318389404, | |
| "loss": 5.4574, | |
| "mean_token_accuracy": 0.15718373358249665, | |
| "num_tokens": 7501915.0, | |
| "step": 2675 | |
| }, | |
| { | |
| "entropy": 5.518865013122559, | |
| "epoch": 0.07255499153976311, | |
| "grad_norm": 1.0078125, | |
| "learning_rate": 0.0002330706732739468, | |
| "loss": 5.4122, | |
| "mean_token_accuracy": 0.16701352149248122, | |
| "num_tokens": 7514901.0, | |
| "step": 2680 | |
| }, | |
| { | |
| "entropy": 5.494342899322509, | |
| "epoch": 0.07269035532994923, | |
| "grad_norm": 0.859375, | |
| "learning_rate": 0.00023191379287767211, | |
| "loss": 5.3231, | |
| "mean_token_accuracy": 0.16684457957744597, | |
| "num_tokens": 7528840.0, | |
| "step": 2685 | |
| }, | |
| { | |
| "entropy": 5.474505853652954, | |
| "epoch": 0.07282571912013536, | |
| "grad_norm": 0.96484375, | |
| "learning_rate": 0.0002307580937115305, | |
| "loss": 5.3626, | |
| "mean_token_accuracy": 0.16770108044147491, | |
| "num_tokens": 7543417.0, | |
| "step": 2690 | |
| }, | |
| { | |
| "entropy": 5.518067264556885, | |
| "epoch": 0.0729610829103215, | |
| "grad_norm": 0.91015625, | |
| "learning_rate": 0.00022960360745959846, | |
| "loss": 5.3038, | |
| "mean_token_accuracy": 0.1747143894433975, | |
| "num_tokens": 7556468.0, | |
| "step": 2695 | |
| }, | |
| { | |
| "entropy": 5.466390228271484, | |
| "epoch": 0.07309644670050762, | |
| "grad_norm": 0.9296875, | |
| "learning_rate": 0.00022845036577269972, | |
| "loss": 5.4043, | |
| "mean_token_accuracy": 0.16157454401254653, | |
| "num_tokens": 7570917.0, | |
| "step": 2700 | |
| }, | |
| { | |
| "entropy": 5.378308916091919, | |
| "epoch": 0.07323181049069374, | |
| "grad_norm": 0.92578125, | |
| "learning_rate": 0.00022729840026753777, | |
| "loss": 5.2936, | |
| "mean_token_accuracy": 0.17287229299545287, | |
| "num_tokens": 7585650.0, | |
| "step": 2705 | |
| }, | |
| { | |
| "entropy": 5.49935736656189, | |
| "epoch": 0.07336717428087987, | |
| "grad_norm": 0.90625, | |
| "learning_rate": 0.0002261477425258287, | |
| "loss": 5.3034, | |
| "mean_token_accuracy": 0.16764113306999207, | |
| "num_tokens": 7599526.0, | |
| "step": 2710 | |
| }, | |
| { | |
| "entropy": 5.5813967227935795, | |
| "epoch": 0.07350253807106599, | |
| "grad_norm": 1.0390625, | |
| "learning_rate": 0.0002249984240934358, | |
| "loss": 5.373, | |
| "mean_token_accuracy": 0.16482538282871245, | |
| "num_tokens": 7612788.0, | |
| "step": 2715 | |
| }, | |
| { | |
| "entropy": 5.462430143356324, | |
| "epoch": 0.07363790186125212, | |
| "grad_norm": 0.95703125, | |
| "learning_rate": 0.00022385047647950464, | |
| "loss": 5.3176, | |
| "mean_token_accuracy": 0.1712317556142807, | |
| "num_tokens": 7626130.0, | |
| "step": 2720 | |
| }, | |
| { | |
| "entropy": 5.512141418457031, | |
| "epoch": 0.07377326565143824, | |
| "grad_norm": 0.91796875, | |
| "learning_rate": 0.0002227039311555986, | |
| "loss": 5.4048, | |
| "mean_token_accuracy": 0.16659581065177917, | |
| "num_tokens": 7641082.0, | |
| "step": 2725 | |
| }, | |
| { | |
| "entropy": 5.458144950866699, | |
| "epoch": 0.07390862944162437, | |
| "grad_norm": 0.88671875, | |
| "learning_rate": 0.0002215588195548372, | |
| "loss": 5.279, | |
| "mean_token_accuracy": 0.17415901124477387, | |
| "num_tokens": 7656106.0, | |
| "step": 2730 | |
| }, | |
| { | |
| "entropy": 5.5800501823425295, | |
| "epoch": 0.07404399323181049, | |
| "grad_norm": 0.984375, | |
| "learning_rate": 0.00022041517307103337, | |
| "loss": 5.4972, | |
| "mean_token_accuracy": 0.1576918765902519, | |
| "num_tokens": 7669987.0, | |
| "step": 2735 | |
| }, | |
| { | |
| "entropy": 5.4527280807495115, | |
| "epoch": 0.07417935702199661, | |
| "grad_norm": 1.0546875, | |
| "learning_rate": 0.0002192730230578331, | |
| "loss": 5.254, | |
| "mean_token_accuracy": 0.17619728147983552, | |
| "num_tokens": 7684919.0, | |
| "step": 2740 | |
| }, | |
| { | |
| "entropy": 5.430622720718384, | |
| "epoch": 0.07431472081218274, | |
| "grad_norm": 0.96875, | |
| "learning_rate": 0.0002181324008278559, | |
| "loss": 5.2826, | |
| "mean_token_accuracy": 0.17135830372571945, | |
| "num_tokens": 7696787.0, | |
| "step": 2745 | |
| }, | |
| { | |
| "entropy": 5.481793308258057, | |
| "epoch": 0.07445008460236886, | |
| "grad_norm": 0.875, | |
| "learning_rate": 0.00021699333765183655, | |
| "loss": 5.3837, | |
| "mean_token_accuracy": 0.16583613455295562, | |
| "num_tokens": 7709630.0, | |
| "step": 2750 | |
| }, | |
| { | |
| "entropy": 5.461789512634278, | |
| "epoch": 0.07458544839255499, | |
| "grad_norm": 0.87890625, | |
| "learning_rate": 0.0002158558647577673, | |
| "loss": 5.343, | |
| "mean_token_accuracy": 0.16185439378023148, | |
| "num_tokens": 7724842.0, | |
| "step": 2755 | |
| }, | |
| { | |
| "entropy": 5.428160953521728, | |
| "epoch": 0.07472081218274111, | |
| "grad_norm": 1.0390625, | |
| "learning_rate": 0.00021472001333004215, | |
| "loss": 5.1693, | |
| "mean_token_accuracy": 0.17251513451337813, | |
| "num_tokens": 7739569.0, | |
| "step": 2760 | |
| }, | |
| { | |
| "entropy": 5.427040004730225, | |
| "epoch": 0.07485617597292724, | |
| "grad_norm": 0.96875, | |
| "learning_rate": 0.00021358581450860186, | |
| "loss": 5.207, | |
| "mean_token_accuracy": 0.17038764506578447, | |
| "num_tokens": 7753711.0, | |
| "step": 2765 | |
| }, | |
| { | |
| "entropy": 5.465088510513306, | |
| "epoch": 0.07499153976311337, | |
| "grad_norm": 0.98828125, | |
| "learning_rate": 0.0002124532993880799, | |
| "loss": 5.3172, | |
| "mean_token_accuracy": 0.16422780603170395, | |
| "num_tokens": 7768388.0, | |
| "step": 2770 | |
| }, | |
| { | |
| "entropy": 5.467406845092773, | |
| "epoch": 0.0751269035532995, | |
| "grad_norm": 0.890625, | |
| "learning_rate": 0.00021132249901695044, | |
| "loss": 5.3397, | |
| "mean_token_accuracy": 0.1675926923751831, | |
| "num_tokens": 7783723.0, | |
| "step": 2775 | |
| }, | |
| { | |
| "entropy": 5.510707998275757, | |
| "epoch": 0.07526226734348562, | |
| "grad_norm": 0.87890625, | |
| "learning_rate": 0.00021019344439667705, | |
| "loss": 5.3986, | |
| "mean_token_accuracy": 0.16413299441337587, | |
| "num_tokens": 7799084.0, | |
| "step": 2780 | |
| }, | |
| { | |
| "entropy": 5.533675479888916, | |
| "epoch": 0.07539763113367175, | |
| "grad_norm": 0.84765625, | |
| "learning_rate": 0.00020906616648086213, | |
| "loss": 5.3946, | |
| "mean_token_accuracy": 0.1620550975203514, | |
| "num_tokens": 7814644.0, | |
| "step": 2785 | |
| }, | |
| { | |
| "entropy": 5.467060947418213, | |
| "epoch": 0.07553299492385787, | |
| "grad_norm": 0.98828125, | |
| "learning_rate": 0.00020794069617439942, | |
| "loss": 5.2889, | |
| "mean_token_accuracy": 0.17744391411542892, | |
| "num_tokens": 7829458.0, | |
| "step": 2790 | |
| }, | |
| { | |
| "entropy": 5.52356595993042, | |
| "epoch": 0.075668358714044, | |
| "grad_norm": 1.0, | |
| "learning_rate": 0.00020681706433262593, | |
| "loss": 5.3376, | |
| "mean_token_accuracy": 0.17330960631370546, | |
| "num_tokens": 7844811.0, | |
| "step": 2795 | |
| }, | |
| { | |
| "entropy": 5.436047220230103, | |
| "epoch": 0.07580372250423012, | |
| "grad_norm": 0.98046875, | |
| "learning_rate": 0.00020569530176047602, | |
| "loss": 5.245, | |
| "mean_token_accuracy": 0.17710321843624116, | |
| "num_tokens": 7857008.0, | |
| "step": 2800 | |
| }, | |
| { | |
| "entropy": 5.451122379302978, | |
| "epoch": 0.07593908629441624, | |
| "grad_norm": 0.890625, | |
| "learning_rate": 0.0002045754392116374, | |
| "loss": 5.3629, | |
| "mean_token_accuracy": 0.17095964550971984, | |
| "num_tokens": 7871976.0, | |
| "step": 2805 | |
| }, | |
| { | |
| "entropy": 5.513166713714599, | |
| "epoch": 0.07607445008460237, | |
| "grad_norm": 1.015625, | |
| "learning_rate": 0.00020345750738770757, | |
| "loss": 5.2591, | |
| "mean_token_accuracy": 0.16977263540029525, | |
| "num_tokens": 7885961.0, | |
| "step": 2810 | |
| }, | |
| { | |
| "entropy": 5.454839134216309, | |
| "epoch": 0.07620981387478849, | |
| "grad_norm": 0.828125, | |
| "learning_rate": 0.00020234153693735214, | |
| "loss": 5.2422, | |
| "mean_token_accuracy": 0.18533623367547988, | |
| "num_tokens": 7900771.0, | |
| "step": 2815 | |
| }, | |
| { | |
| "entropy": 5.501101541519165, | |
| "epoch": 0.07634517766497462, | |
| "grad_norm": 0.92578125, | |
| "learning_rate": 0.0002012275584554647, | |
| "loss": 5.3521, | |
| "mean_token_accuracy": 0.16500504612922667, | |
| "num_tokens": 7914177.0, | |
| "step": 2820 | |
| }, | |
| { | |
| "entropy": 5.530455732345581, | |
| "epoch": 0.07648054145516074, | |
| "grad_norm": 0.97265625, | |
| "learning_rate": 0.00020011560248232803, | |
| "loss": 5.3338, | |
| "mean_token_accuracy": 0.17148594111204146, | |
| "num_tokens": 7926304.0, | |
| "step": 2825 | |
| }, | |
| { | |
| "entropy": 5.51822681427002, | |
| "epoch": 0.07661590524534687, | |
| "grad_norm": 0.875, | |
| "learning_rate": 0.00019900569950277692, | |
| "loss": 5.3958, | |
| "mean_token_accuracy": 0.17159417718648912, | |
| "num_tokens": 7940643.0, | |
| "step": 2830 | |
| }, | |
| { | |
| "entropy": 5.498433589935303, | |
| "epoch": 0.07675126903553299, | |
| "grad_norm": 0.984375, | |
| "learning_rate": 0.00019789787994536228, | |
| "loss": 5.3133, | |
| "mean_token_accuracy": 0.1724165916442871, | |
| "num_tokens": 7953973.0, | |
| "step": 2835 | |
| }, | |
| { | |
| "entropy": 5.487789058685303, | |
| "epoch": 0.07688663282571911, | |
| "grad_norm": 0.96875, | |
| "learning_rate": 0.00019679217418151667, | |
| "loss": 5.2822, | |
| "mean_token_accuracy": 0.175179585814476, | |
| "num_tokens": 7968097.0, | |
| "step": 2840 | |
| }, | |
| { | |
| "entropy": 5.485777091979981, | |
| "epoch": 0.07702199661590524, | |
| "grad_norm": 1.0078125, | |
| "learning_rate": 0.00019568861252472236, | |
| "loss": 5.4075, | |
| "mean_token_accuracy": 0.17055005431175232, | |
| "num_tokens": 7981377.0, | |
| "step": 2845 | |
| }, | |
| { | |
| "entropy": 5.480043888092041, | |
| "epoch": 0.07715736040609138, | |
| "grad_norm": 0.8984375, | |
| "learning_rate": 0.00019458722522967952, | |
| "loss": 5.2816, | |
| "mean_token_accuracy": 0.17032997757196428, | |
| "num_tokens": 7996347.0, | |
| "step": 2850 | |
| }, | |
| { | |
| "entropy": 5.440441513061524, | |
| "epoch": 0.0772927241962775, | |
| "grad_norm": 1.0390625, | |
| "learning_rate": 0.00019348804249147723, | |
| "loss": 5.2801, | |
| "mean_token_accuracy": 0.16763708293437957, | |
| "num_tokens": 8009085.0, | |
| "step": 2855 | |
| }, | |
| { | |
| "entropy": 5.496013021469116, | |
| "epoch": 0.07742808798646363, | |
| "grad_norm": 0.9453125, | |
| "learning_rate": 0.0001923910944447655, | |
| "loss": 5.3578, | |
| "mean_token_accuracy": 0.1683908924460411, | |
| "num_tokens": 8022972.0, | |
| "step": 2860 | |
| }, | |
| { | |
| "entropy": 5.463598155975342, | |
| "epoch": 0.07756345177664975, | |
| "grad_norm": 1.0, | |
| "learning_rate": 0.00019129641116292928, | |
| "loss": 5.2517, | |
| "mean_token_accuracy": 0.17301710844039916, | |
| "num_tokens": 8036721.0, | |
| "step": 2865 | |
| }, | |
| { | |
| "entropy": 5.497069406509399, | |
| "epoch": 0.07769881556683587, | |
| "grad_norm": 0.96484375, | |
| "learning_rate": 0.00019020402265726343, | |
| "loss": 5.3642, | |
| "mean_token_accuracy": 0.17259056568145753, | |
| "num_tokens": 8051907.0, | |
| "step": 2870 | |
| }, | |
| { | |
| "entropy": 5.599059247970581, | |
| "epoch": 0.077834179357022, | |
| "grad_norm": 0.83984375, | |
| "learning_rate": 0.0001891139588761509, | |
| "loss": 5.4207, | |
| "mean_token_accuracy": 0.15925686806440353, | |
| "num_tokens": 8067550.0, | |
| "step": 2875 | |
| }, | |
| { | |
| "entropy": 5.518371534347534, | |
| "epoch": 0.07796954314720812, | |
| "grad_norm": 0.96875, | |
| "learning_rate": 0.00018802624970424076, | |
| "loss": 5.3844, | |
| "mean_token_accuracy": 0.17436740100383757, | |
| "num_tokens": 8081188.0, | |
| "step": 2880 | |
| }, | |
| { | |
| "entropy": 5.424393129348755, | |
| "epoch": 0.07810490693739425, | |
| "grad_norm": 0.98828125, | |
| "learning_rate": 0.00018694092496162945, | |
| "loss": 5.2155, | |
| "mean_token_accuracy": 0.17726275324821472, | |
| "num_tokens": 8095991.0, | |
| "step": 2885 | |
| }, | |
| { | |
| "entropy": 5.458485412597656, | |
| "epoch": 0.07824027072758037, | |
| "grad_norm": 0.9765625, | |
| "learning_rate": 0.00018585801440304306, | |
| "loss": 5.3427, | |
| "mean_token_accuracy": 0.16206988841295242, | |
| "num_tokens": 8110424.0, | |
| "step": 2890 | |
| }, | |
| { | |
| "entropy": 5.579003047943115, | |
| "epoch": 0.0783756345177665, | |
| "grad_norm": 0.80859375, | |
| "learning_rate": 0.00018477754771702165, | |
| "loss": 5.4071, | |
| "mean_token_accuracy": 0.16417887508869172, | |
| "num_tokens": 8127483.0, | |
| "step": 2895 | |
| }, | |
| { | |
| "entropy": 5.4810065746307375, | |
| "epoch": 0.07851099830795262, | |
| "grad_norm": 0.8671875, | |
| "learning_rate": 0.00018369955452510506, | |
| "loss": 5.2518, | |
| "mean_token_accuracy": 0.16933856457471846, | |
| "num_tokens": 8144871.0, | |
| "step": 2900 | |
| }, | |
| { | |
| "entropy": 5.363333082199096, | |
| "epoch": 0.07864636209813874, | |
| "grad_norm": 1.03125, | |
| "learning_rate": 0.0001826240643810212, | |
| "loss": 5.2339, | |
| "mean_token_accuracy": 0.18072881251573564, | |
| "num_tokens": 8159166.0, | |
| "step": 2905 | |
| }, | |
| { | |
| "entropy": 5.459006214141846, | |
| "epoch": 0.07878172588832487, | |
| "grad_norm": 0.96484375, | |
| "learning_rate": 0.0001815511067698758, | |
| "loss": 5.3428, | |
| "mean_token_accuracy": 0.1761472001671791, | |
| "num_tokens": 8173679.0, | |
| "step": 2910 | |
| }, | |
| { | |
| "entropy": 5.487945318222046, | |
| "epoch": 0.078917089678511, | |
| "grad_norm": 0.84375, | |
| "learning_rate": 0.0001804807111073436, | |
| "loss": 5.3272, | |
| "mean_token_accuracy": 0.1742970734834671, | |
| "num_tokens": 8189905.0, | |
| "step": 2915 | |
| }, | |
| { | |
| "entropy": 5.556151533126831, | |
| "epoch": 0.07905245346869712, | |
| "grad_norm": 0.89453125, | |
| "learning_rate": 0.0001794129067388625, | |
| "loss": 5.3454, | |
| "mean_token_accuracy": 0.16954322308301925, | |
| "num_tokens": 8204091.0, | |
| "step": 2920 | |
| }, | |
| { | |
| "entropy": 5.4311378479003904, | |
| "epoch": 0.07918781725888324, | |
| "grad_norm": 0.94140625, | |
| "learning_rate": 0.00017834772293882868, | |
| "loss": 5.271, | |
| "mean_token_accuracy": 0.1795088216662407, | |
| "num_tokens": 8217298.0, | |
| "step": 2925 | |
| }, | |
| { | |
| "entropy": 5.476504468917847, | |
| "epoch": 0.07932318104906938, | |
| "grad_norm": 1.0078125, | |
| "learning_rate": 0.000177285188909794, | |
| "loss": 5.3071, | |
| "mean_token_accuracy": 0.1695019334554672, | |
| "num_tokens": 8231131.0, | |
| "step": 2930 | |
| }, | |
| { | |
| "entropy": 5.490973567962646, | |
| "epoch": 0.0794585448392555, | |
| "grad_norm": 1.0859375, | |
| "learning_rate": 0.0001762253337816656, | |
| "loss": 5.3456, | |
| "mean_token_accuracy": 0.1681083619594574, | |
| "num_tokens": 8245409.0, | |
| "step": 2935 | |
| }, | |
| { | |
| "entropy": 5.53462929725647, | |
| "epoch": 0.07959390862944163, | |
| "grad_norm": 0.9765625, | |
| "learning_rate": 0.00017516818661090738, | |
| "loss": 5.3796, | |
| "mean_token_accuracy": 0.16535060852766037, | |
| "num_tokens": 8259802.0, | |
| "step": 2940 | |
| }, | |
| { | |
| "entropy": 5.458170461654663, | |
| "epoch": 0.07972927241962775, | |
| "grad_norm": 0.90625, | |
| "learning_rate": 0.0001741137763797428, | |
| "loss": 5.2636, | |
| "mean_token_accuracy": 0.1764928162097931, | |
| "num_tokens": 8273833.0, | |
| "step": 2945 | |
| }, | |
| { | |
| "entropy": 5.407339096069336, | |
| "epoch": 0.07986463620981388, | |
| "grad_norm": 1.0234375, | |
| "learning_rate": 0.00017306213199536115, | |
| "loss": 5.2234, | |
| "mean_token_accuracy": 0.176323065161705, | |
| "num_tokens": 8287181.0, | |
| "step": 2950 | |
| }, | |
| { | |
| "entropy": 5.467682838439941, | |
| "epoch": 0.08, | |
| "grad_norm": 0.94921875, | |
| "learning_rate": 0.0001720132822891243, | |
| "loss": 5.2588, | |
| "mean_token_accuracy": 0.16995817869901658, | |
| "num_tokens": 8300432.0, | |
| "step": 2955 | |
| }, | |
| { | |
| "entropy": 5.419669437408447, | |
| "epoch": 0.08013536379018613, | |
| "grad_norm": 0.9921875, | |
| "learning_rate": 0.0001709672560157769, | |
| "loss": 5.2418, | |
| "mean_token_accuracy": 0.18255811035633088, | |
| "num_tokens": 8313873.0, | |
| "step": 2960 | |
| }, | |
| { | |
| "entropy": 5.462170553207398, | |
| "epoch": 0.08027072758037225, | |
| "grad_norm": 0.97265625, | |
| "learning_rate": 0.00016992408185265758, | |
| "loss": 5.3659, | |
| "mean_token_accuracy": 0.16571080684661865, | |
| "num_tokens": 8329781.0, | |
| "step": 2965 | |
| }, | |
| { | |
| "entropy": 5.4735033988952635, | |
| "epoch": 0.08040609137055837, | |
| "grad_norm": 0.86328125, | |
| "learning_rate": 0.00016888378839891298, | |
| "loss": 5.3732, | |
| "mean_token_accuracy": 0.16627077162265777, | |
| "num_tokens": 8346691.0, | |
| "step": 2970 | |
| }, | |
| { | |
| "entropy": 5.496302556991577, | |
| "epoch": 0.0805414551607445, | |
| "grad_norm": 0.89453125, | |
| "learning_rate": 0.0001678464041747137, | |
| "loss": 5.323, | |
| "mean_token_accuracy": 0.1704434260725975, | |
| "num_tokens": 8361779.0, | |
| "step": 2975 | |
| }, | |
| { | |
| "entropy": 5.521384286880493, | |
| "epoch": 0.08067681895093062, | |
| "grad_norm": 1.015625, | |
| "learning_rate": 0.00016681195762047223, | |
| "loss": 5.3293, | |
| "mean_token_accuracy": 0.16714472323656082, | |
| "num_tokens": 8376285.0, | |
| "step": 2980 | |
| }, | |
| { | |
| "entropy": 5.463702249526977, | |
| "epoch": 0.08081218274111675, | |
| "grad_norm": 0.96484375, | |
| "learning_rate": 0.00016578047709606337, | |
| "loss": 5.2956, | |
| "mean_token_accuracy": 0.1701137751340866, | |
| "num_tokens": 8389645.0, | |
| "step": 2985 | |
| }, | |
| { | |
| "entropy": 5.453202438354492, | |
| "epoch": 0.08094754653130287, | |
| "grad_norm": 1.0, | |
| "learning_rate": 0.00016475199088004678, | |
| "loss": 5.2889, | |
| "mean_token_accuracy": 0.17482130378484725, | |
| "num_tokens": 8401728.0, | |
| "step": 2990 | |
| }, | |
| { | |
| "entropy": 5.434600925445556, | |
| "epoch": 0.081082910321489, | |
| "grad_norm": 0.9921875, | |
| "learning_rate": 0.00016372652716889163, | |
| "loss": 5.2305, | |
| "mean_token_accuracy": 0.1778161495923996, | |
| "num_tokens": 8416862.0, | |
| "step": 2995 | |
| }, | |
| { | |
| "entropy": 5.486732912063599, | |
| "epoch": 0.08121827411167512, | |
| "grad_norm": 1.0, | |
| "learning_rate": 0.0001627041140762035, | |
| "loss": 5.3317, | |
| "mean_token_accuracy": 0.17365986555814744, | |
| "num_tokens": 8430674.0, | |
| "step": 3000 | |
| }, | |
| { | |
| "entropy": 5.424360466003418, | |
| "epoch": 0.08135363790186126, | |
| "grad_norm": 0.9609375, | |
| "learning_rate": 0.00016168477963195382, | |
| "loss": 5.2288, | |
| "mean_token_accuracy": 0.1797449544072151, | |
| "num_tokens": 8443736.0, | |
| "step": 3005 | |
| }, | |
| { | |
| "entropy": 5.399167108535766, | |
| "epoch": 0.08148900169204738, | |
| "grad_norm": 0.8359375, | |
| "learning_rate": 0.0001606685517817114, | |
| "loss": 5.2675, | |
| "mean_token_accuracy": 0.17130256146192552, | |
| "num_tokens": 8458551.0, | |
| "step": 3010 | |
| }, | |
| { | |
| "entropy": 5.441774988174439, | |
| "epoch": 0.08162436548223351, | |
| "grad_norm": 0.84375, | |
| "learning_rate": 0.00015965545838587592, | |
| "loss": 5.2618, | |
| "mean_token_accuracy": 0.16794567108154296, | |
| "num_tokens": 8473802.0, | |
| "step": 3015 | |
| }, | |
| { | |
| "entropy": 5.47581901550293, | |
| "epoch": 0.08175972927241963, | |
| "grad_norm": 0.87109375, | |
| "learning_rate": 0.00015864552721891467, | |
| "loss": 5.3247, | |
| "mean_token_accuracy": 0.16786827743053437, | |
| "num_tokens": 8488927.0, | |
| "step": 3020 | |
| }, | |
| { | |
| "entropy": 5.440992641448974, | |
| "epoch": 0.08189509306260576, | |
| "grad_norm": 0.9453125, | |
| "learning_rate": 0.00015763878596860076, | |
| "loss": 5.1973, | |
| "mean_token_accuracy": 0.16612706929445267, | |
| "num_tokens": 8501604.0, | |
| "step": 3025 | |
| }, | |
| { | |
| "entropy": 5.433175420761108, | |
| "epoch": 0.08203045685279188, | |
| "grad_norm": 1.1015625, | |
| "learning_rate": 0.00015663526223525412, | |
| "loss": 5.2937, | |
| "mean_token_accuracy": 0.1712185561656952, | |
| "num_tokens": 8514228.0, | |
| "step": 3030 | |
| }, | |
| { | |
| "entropy": 5.443940877914429, | |
| "epoch": 0.082165820642978, | |
| "grad_norm": 0.9921875, | |
| "learning_rate": 0.0001556349835309848, | |
| "loss": 5.2669, | |
| "mean_token_accuracy": 0.16782645732164383, | |
| "num_tokens": 8528327.0, | |
| "step": 3035 | |
| }, | |
| { | |
| "entropy": 5.410441637039185, | |
| "epoch": 0.08230118443316413, | |
| "grad_norm": 0.99609375, | |
| "learning_rate": 0.0001546379772789389, | |
| "loss": 5.2322, | |
| "mean_token_accuracy": 0.17801001518964768, | |
| "num_tokens": 8542672.0, | |
| "step": 3040 | |
| }, | |
| { | |
| "entropy": 5.466415166854858, | |
| "epoch": 0.08243654822335025, | |
| "grad_norm": 0.91796875, | |
| "learning_rate": 0.00015364427081254622, | |
| "loss": 5.2928, | |
| "mean_token_accuracy": 0.16680212169885636, | |
| "num_tokens": 8556950.0, | |
| "step": 3045 | |
| }, | |
| { | |
| "entropy": 5.480651140213013, | |
| "epoch": 0.08257191201353638, | |
| "grad_norm": 1.0625, | |
| "learning_rate": 0.00015265389137477165, | |
| "loss": 5.3176, | |
| "mean_token_accuracy": 0.16717551946640014, | |
| "num_tokens": 8568976.0, | |
| "step": 3050 | |
| }, | |
| { | |
| "entropy": 5.471415328979492, | |
| "epoch": 0.0827072758037225, | |
| "grad_norm": 0.99609375, | |
| "learning_rate": 0.00015166686611736786, | |
| "loss": 5.279, | |
| "mean_token_accuracy": 0.16722955107688903, | |
| "num_tokens": 8582972.0, | |
| "step": 3055 | |
| }, | |
| { | |
| "entropy": 5.384100437164307, | |
| "epoch": 0.08284263959390863, | |
| "grad_norm": 0.96484375, | |
| "learning_rate": 0.00015068322210013064, | |
| "loss": 5.1654, | |
| "mean_token_accuracy": 0.18055080026388168, | |
| "num_tokens": 8595513.0, | |
| "step": 3060 | |
| }, | |
| { | |
| "entropy": 5.395313358306884, | |
| "epoch": 0.08297800338409475, | |
| "grad_norm": 1.0234375, | |
| "learning_rate": 0.0001497029862901578, | |
| "loss": 5.3037, | |
| "mean_token_accuracy": 0.17951921373605728, | |
| "num_tokens": 8608918.0, | |
| "step": 3065 | |
| }, | |
| { | |
| "entropy": 5.4258056640625, | |
| "epoch": 0.08311336717428087, | |
| "grad_norm": 0.9296875, | |
| "learning_rate": 0.00014872618556110905, | |
| "loss": 5.205, | |
| "mean_token_accuracy": 0.17827895432710647, | |
| "num_tokens": 8622730.0, | |
| "step": 3070 | |
| }, | |
| { | |
| "entropy": 5.463824796676636, | |
| "epoch": 0.083248730964467, | |
| "grad_norm": 1.015625, | |
| "learning_rate": 0.00014775284669246992, | |
| "loss": 5.2471, | |
| "mean_token_accuracy": 0.17934898436069488, | |
| "num_tokens": 8635412.0, | |
| "step": 3075 | |
| }, | |
| { | |
| "entropy": 5.453006887435913, | |
| "epoch": 0.08338409475465312, | |
| "grad_norm": 0.9609375, | |
| "learning_rate": 0.00014678299636881716, | |
| "loss": 5.3157, | |
| "mean_token_accuracy": 0.17817512452602385, | |
| "num_tokens": 8648105.0, | |
| "step": 3080 | |
| }, | |
| { | |
| "entropy": 5.489534902572632, | |
| "epoch": 0.08351945854483926, | |
| "grad_norm": 1.09375, | |
| "learning_rate": 0.0001458166611790873, | |
| "loss": 5.3456, | |
| "mean_token_accuracy": 0.16926711797714233, | |
| "num_tokens": 8660690.0, | |
| "step": 3085 | |
| }, | |
| { | |
| "entropy": 5.469047117233276, | |
| "epoch": 0.08365482233502539, | |
| "grad_norm": 0.93359375, | |
| "learning_rate": 0.00014485386761584773, | |
| "loss": 5.226, | |
| "mean_token_accuracy": 0.17681361138820648, | |
| "num_tokens": 8674585.0, | |
| "step": 3090 | |
| }, | |
| { | |
| "entropy": 5.430918836593628, | |
| "epoch": 0.08379018612521151, | |
| "grad_norm": 0.96875, | |
| "learning_rate": 0.00014389464207457042, | |
| "loss": 5.2677, | |
| "mean_token_accuracy": 0.17809636294841766, | |
| "num_tokens": 8689490.0, | |
| "step": 3095 | |
| }, | |
| { | |
| "entropy": 5.406502294540405, | |
| "epoch": 0.08392554991539763, | |
| "grad_norm": 0.890625, | |
| "learning_rate": 0.00014293901085290795, | |
| "loss": 5.2227, | |
| "mean_token_accuracy": 0.17613164633512496, | |
| "num_tokens": 8704597.0, | |
| "step": 3100 | |
| }, | |
| { | |
| "entropy": 5.466963195800782, | |
| "epoch": 0.08406091370558376, | |
| "grad_norm": 0.92578125, | |
| "learning_rate": 0.00014198700014997307, | |
| "loss": 5.2596, | |
| "mean_token_accuracy": 0.17903373539447784, | |
| "num_tokens": 8718430.0, | |
| "step": 3105 | |
| }, | |
| { | |
| "entropy": 5.424066495895386, | |
| "epoch": 0.08419627749576988, | |
| "grad_norm": 1.0078125, | |
| "learning_rate": 0.00014103863606562016, | |
| "loss": 5.2084, | |
| "mean_token_accuracy": 0.17104987502098085, | |
| "num_tokens": 8733983.0, | |
| "step": 3110 | |
| }, | |
| { | |
| "entropy": 5.4510743618011475, | |
| "epoch": 0.08433164128595601, | |
| "grad_norm": 0.9296875, | |
| "learning_rate": 0.00014009394459972964, | |
| "loss": 5.2121, | |
| "mean_token_accuracy": 0.177804896235466, | |
| "num_tokens": 8747359.0, | |
| "step": 3115 | |
| }, | |
| { | |
| "entropy": 5.4852707862854, | |
| "epoch": 0.08446700507614213, | |
| "grad_norm": 0.96875, | |
| "learning_rate": 0.00013915295165149513, | |
| "loss": 5.2506, | |
| "mean_token_accuracy": 0.17922114282846452, | |
| "num_tokens": 8759625.0, | |
| "step": 3120 | |
| }, | |
| { | |
| "entropy": 5.454599332809448, | |
| "epoch": 0.08460236886632826, | |
| "grad_norm": 1.1015625, | |
| "learning_rate": 0.00013821568301871384, | |
| "loss": 5.2401, | |
| "mean_token_accuracy": 0.17472292929887773, | |
| "num_tokens": 8772700.0, | |
| "step": 3125 | |
| }, | |
| { | |
| "entropy": 5.432861709594727, | |
| "epoch": 0.08473773265651438, | |
| "grad_norm": 0.953125, | |
| "learning_rate": 0.00013728216439707862, | |
| "loss": 5.2968, | |
| "mean_token_accuracy": 0.17653030455112456, | |
| "num_tokens": 8784952.0, | |
| "step": 3130 | |
| }, | |
| { | |
| "entropy": 5.500757789611816, | |
| "epoch": 0.0848730964467005, | |
| "grad_norm": 0.92578125, | |
| "learning_rate": 0.00013635242137947419, | |
| "loss": 5.3983, | |
| "mean_token_accuracy": 0.16601879745721818, | |
| "num_tokens": 8798983.0, | |
| "step": 3135 | |
| }, | |
| { | |
| "entropy": 5.466593456268311, | |
| "epoch": 0.08500846023688663, | |
| "grad_norm": 0.8671875, | |
| "learning_rate": 0.00013542647945527498, | |
| "loss": 5.2634, | |
| "mean_token_accuracy": 0.178488627076149, | |
| "num_tokens": 8812987.0, | |
| "step": 3140 | |
| }, | |
| { | |
| "entropy": 5.500957775115967, | |
| "epoch": 0.08514382402707275, | |
| "grad_norm": 0.8984375, | |
| "learning_rate": 0.0001345043640096465, | |
| "loss": 5.377, | |
| "mean_token_accuracy": 0.17290503680706024, | |
| "num_tokens": 8827359.0, | |
| "step": 3145 | |
| }, | |
| { | |
| "entropy": 5.442121982574463, | |
| "epoch": 0.08527918781725888, | |
| "grad_norm": 0.91796875, | |
| "learning_rate": 0.00013358610032284957, | |
| "loss": 5.1985, | |
| "mean_token_accuracy": 0.18115333914756776, | |
| "num_tokens": 8841025.0, | |
| "step": 3150 | |
| }, | |
| { | |
| "entropy": 5.534852075576782, | |
| "epoch": 0.085414551607445, | |
| "grad_norm": 1.0, | |
| "learning_rate": 0.000132671713569547, | |
| "loss": 5.3334, | |
| "mean_token_accuracy": 0.16925936341285705, | |
| "num_tokens": 8855062.0, | |
| "step": 3155 | |
| }, | |
| { | |
| "entropy": 5.458619165420532, | |
| "epoch": 0.08554991539763114, | |
| "grad_norm": 0.96875, | |
| "learning_rate": 0.0001317612288181136, | |
| "loss": 5.2077, | |
| "mean_token_accuracy": 0.17451809644699096, | |
| "num_tokens": 8869516.0, | |
| "step": 3160 | |
| }, | |
| { | |
| "entropy": 5.454307651519775, | |
| "epoch": 0.08568527918781726, | |
| "grad_norm": 0.875, | |
| "learning_rate": 0.00013085467102994864, | |
| "loss": 5.3441, | |
| "mean_token_accuracy": 0.1724272206425667, | |
| "num_tokens": 8883758.0, | |
| "step": 3165 | |
| }, | |
| { | |
| "entropy": 5.4530314922332765, | |
| "epoch": 0.08582064297800339, | |
| "grad_norm": 1.03125, | |
| "learning_rate": 0.00012995206505879198, | |
| "loss": 5.2512, | |
| "mean_token_accuracy": 0.17589752674102782, | |
| "num_tokens": 8898484.0, | |
| "step": 3170 | |
| }, | |
| { | |
| "entropy": 5.444612312316894, | |
| "epoch": 0.08595600676818951, | |
| "grad_norm": 0.88671875, | |
| "learning_rate": 0.0001290534356500421, | |
| "loss": 5.2609, | |
| "mean_token_accuracy": 0.1797889545559883, | |
| "num_tokens": 8912852.0, | |
| "step": 3175 | |
| }, | |
| { | |
| "entropy": 5.440249586105347, | |
| "epoch": 0.08609137055837564, | |
| "grad_norm": 0.94921875, | |
| "learning_rate": 0.00012815880744007827, | |
| "loss": 5.2379, | |
| "mean_token_accuracy": 0.17183031737804413, | |
| "num_tokens": 8927714.0, | |
| "step": 3180 | |
| }, | |
| { | |
| "entropy": 5.478732442855835, | |
| "epoch": 0.08622673434856176, | |
| "grad_norm": 1.0390625, | |
| "learning_rate": 0.00012726820495558483, | |
| "loss": 5.2562, | |
| "mean_token_accuracy": 0.17183429449796678, | |
| "num_tokens": 8941572.0, | |
| "step": 3185 | |
| }, | |
| { | |
| "entropy": 5.467626094818115, | |
| "epoch": 0.08636209813874789, | |
| "grad_norm": 1.078125, | |
| "learning_rate": 0.00012638165261287868, | |
| "loss": 5.2982, | |
| "mean_token_accuracy": 0.17230871319770813, | |
| "num_tokens": 8956091.0, | |
| "step": 3190 | |
| }, | |
| { | |
| "entropy": 5.453297138214111, | |
| "epoch": 0.08649746192893401, | |
| "grad_norm": 0.91796875, | |
| "learning_rate": 0.0001254991747172402, | |
| "loss": 5.2286, | |
| "mean_token_accuracy": 0.1784089371562004, | |
| "num_tokens": 8970743.0, | |
| "step": 3195 | |
| }, | |
| { | |
| "entropy": 5.512088012695313, | |
| "epoch": 0.08663282571912014, | |
| "grad_norm": 0.90234375, | |
| "learning_rate": 0.00012462079546224662, | |
| "loss": 5.3266, | |
| "mean_token_accuracy": 0.16639686971902848, | |
| "num_tokens": 8986444.0, | |
| "step": 3200 | |
| }, | |
| { | |
| "entropy": 5.445282125473023, | |
| "epoch": 0.08676818950930626, | |
| "grad_norm": 0.90234375, | |
| "learning_rate": 0.00012374653892910896, | |
| "loss": 5.2591, | |
| "mean_token_accuracy": 0.17210991233587264, | |
| "num_tokens": 9001382.0, | |
| "step": 3205 | |
| }, | |
| { | |
| "entropy": 5.500101709365845, | |
| "epoch": 0.08690355329949238, | |
| "grad_norm": 1.1328125, | |
| "learning_rate": 0.00012287642908601166, | |
| "loss": 5.3364, | |
| "mean_token_accuracy": 0.17057666778564454, | |
| "num_tokens": 9013719.0, | |
| "step": 3210 | |
| }, | |
| { | |
| "entropy": 5.416972064971924, | |
| "epoch": 0.08703891708967851, | |
| "grad_norm": 1.0234375, | |
| "learning_rate": 0.00012201048978745569, | |
| "loss": 5.2549, | |
| "mean_token_accuracy": 0.1811564639210701, | |
| "num_tokens": 9027790.0, | |
| "step": 3215 | |
| }, | |
| { | |
| "entropy": 5.453947591781616, | |
| "epoch": 0.08717428087986463, | |
| "grad_norm": 0.98828125, | |
| "learning_rate": 0.00012114874477360427, | |
| "loss": 5.242, | |
| "mean_token_accuracy": 0.17207376956939696, | |
| "num_tokens": 9041632.0, | |
| "step": 3220 | |
| }, | |
| { | |
| "entropy": 5.452928781509399, | |
| "epoch": 0.08730964467005076, | |
| "grad_norm": 0.9296875, | |
| "learning_rate": 0.00012029121766963236, | |
| "loss": 5.3083, | |
| "mean_token_accuracy": 0.16890519112348557, | |
| "num_tokens": 9055562.0, | |
| "step": 3225 | |
| }, | |
| { | |
| "entropy": 5.4277173519134525, | |
| "epoch": 0.08744500846023688, | |
| "grad_norm": 0.99609375, | |
| "learning_rate": 0.00011943793198507858, | |
| "loss": 5.1347, | |
| "mean_token_accuracy": 0.181647826731205, | |
| "num_tokens": 9068872.0, | |
| "step": 3230 | |
| }, | |
| { | |
| "entropy": 5.400438642501831, | |
| "epoch": 0.087580372250423, | |
| "grad_norm": 0.828125, | |
| "learning_rate": 0.00011858891111320104, | |
| "loss": 5.1768, | |
| "mean_token_accuracy": 0.17398682236671448, | |
| "num_tokens": 9083206.0, | |
| "step": 3235 | |
| }, | |
| { | |
| "entropy": 5.3835385799407955, | |
| "epoch": 0.08771573604060914, | |
| "grad_norm": 0.96875, | |
| "learning_rate": 0.0001177441783303359, | |
| "loss": 5.1512, | |
| "mean_token_accuracy": 0.1808776617050171, | |
| "num_tokens": 9097034.0, | |
| "step": 3240 | |
| }, | |
| { | |
| "entropy": 5.417808389663696, | |
| "epoch": 0.08785109983079527, | |
| "grad_norm": 1.1796875, | |
| "learning_rate": 0.00011690375679525896, | |
| "loss": 5.2195, | |
| "mean_token_accuracy": 0.17991944402456284, | |
| "num_tokens": 9110326.0, | |
| "step": 3245 | |
| }, | |
| { | |
| "entropy": 5.3836017608642575, | |
| "epoch": 0.08798646362098139, | |
| "grad_norm": 0.8984375, | |
| "learning_rate": 0.00011606766954855124, | |
| "loss": 5.1837, | |
| "mean_token_accuracy": 0.17912977635860444, | |
| "num_tokens": 9124025.0, | |
| "step": 3250 | |
| }, | |
| { | |
| "entropy": 5.433529281616211, | |
| "epoch": 0.08812182741116752, | |
| "grad_norm": 0.93359375, | |
| "learning_rate": 0.00011523593951196702, | |
| "loss": 5.1581, | |
| "mean_token_accuracy": 0.1803836077451706, | |
| "num_tokens": 9137357.0, | |
| "step": 3255 | |
| }, | |
| { | |
| "entropy": 5.4744508266448975, | |
| "epoch": 0.08825719120135364, | |
| "grad_norm": 0.96484375, | |
| "learning_rate": 0.00011440858948780523, | |
| "loss": 5.3428, | |
| "mean_token_accuracy": 0.16637975126504898, | |
| "num_tokens": 9152364.0, | |
| "step": 3260 | |
| }, | |
| { | |
| "entropy": 5.516168022155762, | |
| "epoch": 0.08839255499153977, | |
| "grad_norm": 0.8515625, | |
| "learning_rate": 0.00011358564215828484, | |
| "loss": 5.32, | |
| "mean_token_accuracy": 0.17344362288713455, | |
| "num_tokens": 9167182.0, | |
| "step": 3265 | |
| }, | |
| { | |
| "entropy": 5.532025480270386, | |
| "epoch": 0.08852791878172589, | |
| "grad_norm": 0.9296875, | |
| "learning_rate": 0.00011276712008492254, | |
| "loss": 5.3615, | |
| "mean_token_accuracy": 0.1667541205883026, | |
| "num_tokens": 9181427.0, | |
| "step": 3270 | |
| }, | |
| { | |
| "entropy": 5.429120492935181, | |
| "epoch": 0.08866328257191201, | |
| "grad_norm": 0.92578125, | |
| "learning_rate": 0.00011195304570791451, | |
| "loss": 5.1506, | |
| "mean_token_accuracy": 0.18498873859643936, | |
| "num_tokens": 9194525.0, | |
| "step": 3275 | |
| }, | |
| { | |
| "entropy": 5.465721178054809, | |
| "epoch": 0.08879864636209814, | |
| "grad_norm": 0.9296875, | |
| "learning_rate": 0.00011114344134552094, | |
| "loss": 5.2907, | |
| "mean_token_accuracy": 0.1747796967625618, | |
| "num_tokens": 9209100.0, | |
| "step": 3280 | |
| }, | |
| { | |
| "entropy": 5.464006948471069, | |
| "epoch": 0.08893401015228426, | |
| "grad_norm": 0.90625, | |
| "learning_rate": 0.0001103383291934545, | |
| "loss": 5.2596, | |
| "mean_token_accuracy": 0.17388538867235184, | |
| "num_tokens": 9222821.0, | |
| "step": 3285 | |
| }, | |
| { | |
| "entropy": 5.484611940383911, | |
| "epoch": 0.08906937394247039, | |
| "grad_norm": 1.0078125, | |
| "learning_rate": 0.00010953773132427141, | |
| "loss": 5.2351, | |
| "mean_token_accuracy": 0.17779595404863358, | |
| "num_tokens": 9234861.0, | |
| "step": 3290 | |
| }, | |
| { | |
| "entropy": 5.528689193725586, | |
| "epoch": 0.08920473773265651, | |
| "grad_norm": 0.91796875, | |
| "learning_rate": 0.00010874166968676677, | |
| "loss": 5.3835, | |
| "mean_token_accuracy": 0.16561046987771988, | |
| "num_tokens": 9249083.0, | |
| "step": 3295 | |
| }, | |
| { | |
| "entropy": 5.44285945892334, | |
| "epoch": 0.08934010152284264, | |
| "grad_norm": 0.91015625, | |
| "learning_rate": 0.00010795016610537251, | |
| "loss": 5.2817, | |
| "mean_token_accuracy": 0.16983783692121507, | |
| "num_tokens": 9264952.0, | |
| "step": 3300 | |
| }, | |
| { | |
| "entropy": 5.4330676078796385, | |
| "epoch": 0.08947546531302876, | |
| "grad_norm": 0.921875, | |
| "learning_rate": 0.00010716324227955904, | |
| "loss": 5.216, | |
| "mean_token_accuracy": 0.17587786316871643, | |
| "num_tokens": 9280403.0, | |
| "step": 3305 | |
| }, | |
| { | |
| "entropy": 5.457645463943481, | |
| "epoch": 0.08961082910321488, | |
| "grad_norm": 0.859375, | |
| "learning_rate": 0.0001063809197832406, | |
| "loss": 5.2906, | |
| "mean_token_accuracy": 0.17256036549806594, | |
| "num_tokens": 9295280.0, | |
| "step": 3310 | |
| }, | |
| { | |
| "entropy": 5.43573489189148, | |
| "epoch": 0.08974619289340101, | |
| "grad_norm": 1.0703125, | |
| "learning_rate": 0.00010560322006418368, | |
| "loss": 5.2939, | |
| "mean_token_accuracy": 0.17864404022693633, | |
| "num_tokens": 9307588.0, | |
| "step": 3315 | |
| }, | |
| { | |
| "entropy": 5.478760576248169, | |
| "epoch": 0.08988155668358715, | |
| "grad_norm": 0.9609375, | |
| "learning_rate": 0.00010483016444341887, | |
| "loss": 5.2257, | |
| "mean_token_accuracy": 0.17621223032474517, | |
| "num_tokens": 9323057.0, | |
| "step": 3320 | |
| }, | |
| { | |
| "entropy": 5.40908203125, | |
| "epoch": 0.09001692047377327, | |
| "grad_norm": 0.9296875, | |
| "learning_rate": 0.00010406177411465654, | |
| "loss": 5.1673, | |
| "mean_token_accuracy": 0.17435249239206313, | |
| "num_tokens": 9337031.0, | |
| "step": 3325 | |
| }, | |
| { | |
| "entropy": 5.4669163703918455, | |
| "epoch": 0.0901522842639594, | |
| "grad_norm": 1.03125, | |
| "learning_rate": 0.00010329807014370562, | |
| "loss": 5.2439, | |
| "mean_token_accuracy": 0.17599764615297317, | |
| "num_tokens": 9351241.0, | |
| "step": 3330 | |
| }, | |
| { | |
| "entropy": 5.4449389457702635, | |
| "epoch": 0.09028764805414552, | |
| "grad_norm": 0.94140625, | |
| "learning_rate": 0.00010253907346789632, | |
| "loss": 5.2455, | |
| "mean_token_accuracy": 0.1750466227531433, | |
| "num_tokens": 9365191.0, | |
| "step": 3335 | |
| }, | |
| { | |
| "entropy": 5.429995393753051, | |
| "epoch": 0.09042301184433164, | |
| "grad_norm": 0.90234375, | |
| "learning_rate": 0.00010178480489550596, | |
| "loss": 5.2899, | |
| "mean_token_accuracy": 0.1745767444372177, | |
| "num_tokens": 9380472.0, | |
| "step": 3340 | |
| }, | |
| { | |
| "entropy": 5.522990751266479, | |
| "epoch": 0.09055837563451777, | |
| "grad_norm": 0.87109375, | |
| "learning_rate": 0.00010103528510518836, | |
| "loss": 5.3416, | |
| "mean_token_accuracy": 0.16517020910978317, | |
| "num_tokens": 9397192.0, | |
| "step": 3345 | |
| }, | |
| { | |
| "entropy": 5.44988055229187, | |
| "epoch": 0.09069373942470389, | |
| "grad_norm": 1.0546875, | |
| "learning_rate": 0.0001002905346454073, | |
| "loss": 5.2139, | |
| "mean_token_accuracy": 0.1854239895939827, | |
| "num_tokens": 9408900.0, | |
| "step": 3350 | |
| }, | |
| { | |
| "entropy": 5.466029644012451, | |
| "epoch": 0.09082910321489002, | |
| "grad_norm": 0.88671875, | |
| "learning_rate": 9.955057393387285e-05, | |
| "loss": 5.2705, | |
| "mean_token_accuracy": 0.177003213763237, | |
| "num_tokens": 9423048.0, | |
| "step": 3355 | |
| }, | |
| { | |
| "entropy": 5.428363418579101, | |
| "epoch": 0.09096446700507614, | |
| "grad_norm": 0.953125, | |
| "learning_rate": 9.88154232569816e-05, | |
| "loss": 5.2474, | |
| "mean_token_accuracy": 0.17786458134651184, | |
| "num_tokens": 9435378.0, | |
| "step": 3360 | |
| }, | |
| { | |
| "entropy": 5.495788192749023, | |
| "epoch": 0.09109983079526227, | |
| "grad_norm": 0.9765625, | |
| "learning_rate": 9.808510276926075e-05, | |
| "loss": 5.2937, | |
| "mean_token_accuracy": 0.17255342304706572, | |
| "num_tokens": 9449534.0, | |
| "step": 3365 | |
| }, | |
| { | |
| "entropy": 5.452598905563354, | |
| "epoch": 0.09123519458544839, | |
| "grad_norm": 0.9921875, | |
| "learning_rate": 9.735963249281549e-05, | |
| "loss": 5.2001, | |
| "mean_token_accuracy": 0.17846726328134538, | |
| "num_tokens": 9462970.0, | |
| "step": 3370 | |
| }, | |
| { | |
| "entropy": 5.47204852104187, | |
| "epoch": 0.09137055837563451, | |
| "grad_norm": 0.953125, | |
| "learning_rate": 9.663903231677974e-05, | |
| "loss": 5.2927, | |
| "mean_token_accuracy": 0.1703501284122467, | |
| "num_tokens": 9475539.0, | |
| "step": 3375 | |
| }, | |
| { | |
| "entropy": 5.42021541595459, | |
| "epoch": 0.09150592216582064, | |
| "grad_norm": 1.0625, | |
| "learning_rate": 9.592332199677145e-05, | |
| "loss": 5.2138, | |
| "mean_token_accuracy": 0.18433151245117188, | |
| "num_tokens": 9490219.0, | |
| "step": 3380 | |
| }, | |
| { | |
| "entropy": 5.477157497406006, | |
| "epoch": 0.09164128595600676, | |
| "grad_norm": 0.99609375, | |
| "learning_rate": 9.521252115435061e-05, | |
| "loss": 5.2509, | |
| "mean_token_accuracy": 0.17215492874383925, | |
| "num_tokens": 9503304.0, | |
| "step": 3385 | |
| }, | |
| { | |
| "entropy": 5.442840576171875, | |
| "epoch": 0.09177664974619289, | |
| "grad_norm": 1.2265625, | |
| "learning_rate": 9.450664927648126e-05, | |
| "loss": 5.2477, | |
| "mean_token_accuracy": 0.17944649904966353, | |
| "num_tokens": 9514721.0, | |
| "step": 3390 | |
| }, | |
| { | |
| "entropy": 5.427846240997314, | |
| "epoch": 0.09191201353637903, | |
| "grad_norm": 0.98828125, | |
| "learning_rate": 9.380572571499758e-05, | |
| "loss": 5.2161, | |
| "mean_token_accuracy": 0.17255792617797852, | |
| "num_tokens": 9529360.0, | |
| "step": 3395 | |
| }, | |
| { | |
| "entropy": 5.546936416625977, | |
| "epoch": 0.09204737732656515, | |
| "grad_norm": 0.8359375, | |
| "learning_rate": 9.310976968607307e-05, | |
| "loss": 5.2605, | |
| "mean_token_accuracy": 0.1750967487692833, | |
| "num_tokens": 9543512.0, | |
| "step": 3400 | |
| }, | |
| { | |
| "entropy": 5.449555110931397, | |
| "epoch": 0.09218274111675127, | |
| "grad_norm": 1.1015625, | |
| "learning_rate": 9.241880026969381e-05, | |
| "loss": 5.2019, | |
| "mean_token_accuracy": 0.1844763919711113, | |
| "num_tokens": 9556305.0, | |
| "step": 3405 | |
| }, | |
| { | |
| "entropy": 5.465081453323364, | |
| "epoch": 0.0923181049069374, | |
| "grad_norm": 0.96484375, | |
| "learning_rate": 9.173283640913537e-05, | |
| "loss": 5.2264, | |
| "mean_token_accuracy": 0.17751589566469192, | |
| "num_tokens": 9569304.0, | |
| "step": 3410 | |
| }, | |
| { | |
| "entropy": 5.456621789932251, | |
| "epoch": 0.09245346869712352, | |
| "grad_norm": 1.0, | |
| "learning_rate": 9.10518969104436e-05, | |
| "loss": 5.2101, | |
| "mean_token_accuracy": 0.18279945403337478, | |
| "num_tokens": 9582470.0, | |
| "step": 3415 | |
| }, | |
| { | |
| "entropy": 5.4090142250061035, | |
| "epoch": 0.09258883248730965, | |
| "grad_norm": 0.99609375, | |
| "learning_rate": 9.037600044191868e-05, | |
| "loss": 5.2236, | |
| "mean_token_accuracy": 0.17098118364810944, | |
| "num_tokens": 9595990.0, | |
| "step": 3420 | |
| }, | |
| { | |
| "entropy": 5.401455307006836, | |
| "epoch": 0.09272419627749577, | |
| "grad_norm": 0.9296875, | |
| "learning_rate": 8.970516553360383e-05, | |
| "loss": 5.1762, | |
| "mean_token_accuracy": 0.17664928287267684, | |
| "num_tokens": 9610814.0, | |
| "step": 3425 | |
| }, | |
| { | |
| "entropy": 5.409914445877075, | |
| "epoch": 0.0928595600676819, | |
| "grad_norm": 0.95703125, | |
| "learning_rate": 8.903941057677692e-05, | |
| "loss": 5.1037, | |
| "mean_token_accuracy": 0.17462638914585113, | |
| "num_tokens": 9625206.0, | |
| "step": 3430 | |
| }, | |
| { | |
| "entropy": 5.535821390151978, | |
| "epoch": 0.09299492385786802, | |
| "grad_norm": 1.0, | |
| "learning_rate": 8.837875382344635e-05, | |
| "loss": 5.3614, | |
| "mean_token_accuracy": 0.17211337238550187, | |
| "num_tokens": 9641154.0, | |
| "step": 3435 | |
| }, | |
| { | |
| "entropy": 5.494901990890503, | |
| "epoch": 0.09313028764805414, | |
| "grad_norm": 0.99609375, | |
| "learning_rate": 8.772321338585076e-05, | |
| "loss": 5.3006, | |
| "mean_token_accuracy": 0.1777035564184189, | |
| "num_tokens": 9655099.0, | |
| "step": 3440 | |
| }, | |
| { | |
| "entropy": 5.447452878952026, | |
| "epoch": 0.09326565143824027, | |
| "grad_norm": 1.0, | |
| "learning_rate": 8.707280723596242e-05, | |
| "loss": 5.2329, | |
| "mean_token_accuracy": 0.179787740111351, | |
| "num_tokens": 9668329.0, | |
| "step": 3445 | |
| }, | |
| { | |
| "entropy": 5.473836851119995, | |
| "epoch": 0.09340101522842639, | |
| "grad_norm": 0.94140625, | |
| "learning_rate": 8.64275532049944e-05, | |
| "loss": 5.2943, | |
| "mean_token_accuracy": 0.1728879228234291, | |
| "num_tokens": 9681972.0, | |
| "step": 3450 | |
| }, | |
| { | |
| "entropy": 5.432269954681397, | |
| "epoch": 0.09353637901861252, | |
| "grad_norm": 0.98046875, | |
| "learning_rate": 8.578746898291198e-05, | |
| "loss": 5.2292, | |
| "mean_token_accuracy": 0.18144699335098266, | |
| "num_tokens": 9695989.0, | |
| "step": 3455 | |
| }, | |
| { | |
| "entropy": 5.46670126914978, | |
| "epoch": 0.09367174280879864, | |
| "grad_norm": 0.8203125, | |
| "learning_rate": 8.515257211794742e-05, | |
| "loss": 5.2274, | |
| "mean_token_accuracy": 0.1761029839515686, | |
| "num_tokens": 9710769.0, | |
| "step": 3460 | |
| }, | |
| { | |
| "entropy": 5.407367706298828, | |
| "epoch": 0.09380710659898477, | |
| "grad_norm": 0.953125, | |
| "learning_rate": 8.452288001611896e-05, | |
| "loss": 5.1674, | |
| "mean_token_accuracy": 0.1863648325204849, | |
| "num_tokens": 9724251.0, | |
| "step": 3465 | |
| }, | |
| { | |
| "entropy": 5.461634397506714, | |
| "epoch": 0.09394247038917089, | |
| "grad_norm": 0.890625, | |
| "learning_rate": 8.389840994075379e-05, | |
| "loss": 5.2588, | |
| "mean_token_accuracy": 0.17784644812345504, | |
| "num_tokens": 9738229.0, | |
| "step": 3470 | |
| }, | |
| { | |
| "entropy": 5.495303535461426, | |
| "epoch": 0.09407783417935703, | |
| "grad_norm": 0.82421875, | |
| "learning_rate": 8.327917901201435e-05, | |
| "loss": 5.3132, | |
| "mean_token_accuracy": 0.17286971658468248, | |
| "num_tokens": 9752971.0, | |
| "step": 3475 | |
| }, | |
| { | |
| "entropy": 5.416939926147461, | |
| "epoch": 0.09421319796954315, | |
| "grad_norm": 0.89453125, | |
| "learning_rate": 8.266520420642931e-05, | |
| "loss": 5.1684, | |
| "mean_token_accuracy": 0.18302588760852814, | |
| "num_tokens": 9766579.0, | |
| "step": 3480 | |
| }, | |
| { | |
| "entropy": 5.4572412967681885, | |
| "epoch": 0.09434856175972928, | |
| "grad_norm": 0.984375, | |
| "learning_rate": 8.205650235642828e-05, | |
| "loss": 5.2161, | |
| "mean_token_accuracy": 0.18117392659187317, | |
| "num_tokens": 9778847.0, | |
| "step": 3485 | |
| }, | |
| { | |
| "entropy": 5.548181772232056, | |
| "epoch": 0.0944839255499154, | |
| "grad_norm": 0.83984375, | |
| "learning_rate": 8.145309014987978e-05, | |
| "loss": 5.3412, | |
| "mean_token_accuracy": 0.16816486120224, | |
| "num_tokens": 9794524.0, | |
| "step": 3490 | |
| }, | |
| { | |
| "entropy": 5.509027767181396, | |
| "epoch": 0.09461928934010153, | |
| "grad_norm": 0.96875, | |
| "learning_rate": 8.085498412963437e-05, | |
| "loss": 5.2257, | |
| "mean_token_accuracy": 0.17833439260721207, | |
| "num_tokens": 9808447.0, | |
| "step": 3495 | |
| }, | |
| { | |
| "entropy": 5.419754076004028, | |
| "epoch": 0.09475465313028765, | |
| "grad_norm": 1.0078125, | |
| "learning_rate": 8.026220069307078e-05, | |
| "loss": 5.2201, | |
| "mean_token_accuracy": 0.17646121084690095, | |
| "num_tokens": 9822690.0, | |
| "step": 3500 | |
| }, | |
| { | |
| "entropy": 5.4755147933959964, | |
| "epoch": 0.09489001692047377, | |
| "grad_norm": 0.88671875, | |
| "learning_rate": 7.967475609164621e-05, | |
| "loss": 5.2813, | |
| "mean_token_accuracy": 0.17337468415498733, | |
| "num_tokens": 9838460.0, | |
| "step": 3505 | |
| }, | |
| { | |
| "entropy": 5.434066534042358, | |
| "epoch": 0.0950253807106599, | |
| "grad_norm": 0.9375, | |
| "learning_rate": 7.909266643045124e-05, | |
| "loss": 5.218, | |
| "mean_token_accuracy": 0.17817495465278627, | |
| "num_tokens": 9852301.0, | |
| "step": 3510 | |
| }, | |
| { | |
| "entropy": 5.470828866958618, | |
| "epoch": 0.09516074450084602, | |
| "grad_norm": 0.99609375, | |
| "learning_rate": 7.851594766776802e-05, | |
| "loss": 5.2477, | |
| "mean_token_accuracy": 0.1855323702096939, | |
| "num_tokens": 9867281.0, | |
| "step": 3515 | |
| }, | |
| { | |
| "entropy": 5.4018556594848635, | |
| "epoch": 0.09529610829103215, | |
| "grad_norm": 0.87890625, | |
| "learning_rate": 7.794461561463265e-05, | |
| "loss": 5.1356, | |
| "mean_token_accuracy": 0.1820910558104515, | |
| "num_tokens": 9881523.0, | |
| "step": 3520 | |
| }, | |
| { | |
| "entropy": 5.3998528003692625, | |
| "epoch": 0.09543147208121827, | |
| "grad_norm": 1.046875, | |
| "learning_rate": 7.7378685934402e-05, | |
| "loss": 5.1708, | |
| "mean_token_accuracy": 0.18137171864509583, | |
| "num_tokens": 9894865.0, | |
| "step": 3525 | |
| }, | |
| { | |
| "entropy": 5.467069101333618, | |
| "epoch": 0.0955668358714044, | |
| "grad_norm": 0.96484375, | |
| "learning_rate": 7.68181741423242e-05, | |
| "loss": 5.2332, | |
| "mean_token_accuracy": 0.1749477729201317, | |
| "num_tokens": 9910598.0, | |
| "step": 3530 | |
| }, | |
| { | |
| "entropy": 5.46595401763916, | |
| "epoch": 0.09570219966159052, | |
| "grad_norm": 1.0625, | |
| "learning_rate": 7.626309560511313e-05, | |
| "loss": 5.3158, | |
| "mean_token_accuracy": 0.1718402922153473, | |
| "num_tokens": 9924811.0, | |
| "step": 3535 | |
| }, | |
| { | |
| "entropy": 5.37374210357666, | |
| "epoch": 0.09583756345177664, | |
| "grad_norm": 0.921875, | |
| "learning_rate": 7.571346554052724e-05, | |
| "loss": 5.1803, | |
| "mean_token_accuracy": 0.1788783609867096, | |
| "num_tokens": 9939839.0, | |
| "step": 3540 | |
| }, | |
| { | |
| "entropy": 5.477428960800171, | |
| "epoch": 0.09597292724196277, | |
| "grad_norm": 0.9453125, | |
| "learning_rate": 7.516929901695249e-05, | |
| "loss": 5.2214, | |
| "mean_token_accuracy": 0.18248335421085357, | |
| "num_tokens": 9952556.0, | |
| "step": 3545 | |
| }, | |
| { | |
| "entropy": 5.493585300445557, | |
| "epoch": 0.09610829103214891, | |
| "grad_norm": 0.9140625, | |
| "learning_rate": 7.463061095298893e-05, | |
| "loss": 5.2934, | |
| "mean_token_accuracy": 0.17488276362419128, | |
| "num_tokens": 9968060.0, | |
| "step": 3550 | |
| }, | |
| { | |
| "entropy": 5.420634984970093, | |
| "epoch": 0.09624365482233503, | |
| "grad_norm": 1.0078125, | |
| "learning_rate": 7.409741611704198e-05, | |
| "loss": 5.1702, | |
| "mean_token_accuracy": 0.18496295660734177, | |
| "num_tokens": 9982607.0, | |
| "step": 3555 | |
| }, | |
| { | |
| "entropy": 5.412036561965943, | |
| "epoch": 0.09637901861252116, | |
| "grad_norm": 1.0078125, | |
| "learning_rate": 7.35697291269174e-05, | |
| "loss": 5.1884, | |
| "mean_token_accuracy": 0.1730993464589119, | |
| "num_tokens": 9997447.0, | |
| "step": 3560 | |
| }, | |
| { | |
| "entropy": 5.38278169631958, | |
| "epoch": 0.09651438240270728, | |
| "grad_norm": 1.046875, | |
| "learning_rate": 7.304756444942056e-05, | |
| "loss": 5.1539, | |
| "mean_token_accuracy": 0.1781917095184326, | |
| "num_tokens": 10010124.0, | |
| "step": 3565 | |
| }, | |
| { | |
| "entropy": 5.462849140167236, | |
| "epoch": 0.0966497461928934, | |
| "grad_norm": 0.93359375, | |
| "learning_rate": 7.253093639995994e-05, | |
| "loss": 5.2831, | |
| "mean_token_accuracy": 0.17512934952974318, | |
| "num_tokens": 10024441.0, | |
| "step": 3570 | |
| }, | |
| { | |
| "entropy": 5.478954744338989, | |
| "epoch": 0.09678510998307953, | |
| "grad_norm": 0.94140625, | |
| "learning_rate": 7.20198591421544e-05, | |
| "loss": 5.2943, | |
| "mean_token_accuracy": 0.171660877764225, | |
| "num_tokens": 10038886.0, | |
| "step": 3575 | |
| }, | |
| { | |
| "entropy": 5.500023937225341, | |
| "epoch": 0.09692047377326565, | |
| "grad_norm": 0.9296875, | |
| "learning_rate": 7.151434668744517e-05, | |
| "loss": 5.3161, | |
| "mean_token_accuracy": 0.17876716703176498, | |
| "num_tokens": 10052929.0, | |
| "step": 3580 | |
| }, | |
| { | |
| "entropy": 5.483731269836426, | |
| "epoch": 0.09705583756345178, | |
| "grad_norm": 1.0625, | |
| "learning_rate": 7.101441289471153e-05, | |
| "loss": 5.2905, | |
| "mean_token_accuracy": 0.17570538371801375, | |
| "num_tokens": 10066239.0, | |
| "step": 3585 | |
| }, | |
| { | |
| "entropy": 5.421175622940064, | |
| "epoch": 0.0971912013536379, | |
| "grad_norm": 1.046875, | |
| "learning_rate": 7.052007146989098e-05, | |
| "loss": 5.1395, | |
| "mean_token_accuracy": 0.179901522397995, | |
| "num_tokens": 10079525.0, | |
| "step": 3590 | |
| }, | |
| { | |
| "entropy": 5.384795904159546, | |
| "epoch": 0.09732656514382403, | |
| "grad_norm": 0.96484375, | |
| "learning_rate": 7.003133596560341e-05, | |
| "loss": 5.1582, | |
| "mean_token_accuracy": 0.18871900141239167, | |
| "num_tokens": 10093915.0, | |
| "step": 3595 | |
| }, | |
| { | |
| "entropy": 5.387734842300415, | |
| "epoch": 0.09746192893401015, | |
| "grad_norm": 0.92578125, | |
| "learning_rate": 6.954821978077952e-05, | |
| "loss": 5.1844, | |
| "mean_token_accuracy": 0.18447159379720687, | |
| "num_tokens": 10108406.0, | |
| "step": 3600 | |
| }, | |
| { | |
| "entropy": 5.421917963027954, | |
| "epoch": 0.09759729272419627, | |
| "grad_norm": 0.87890625, | |
| "learning_rate": 6.907073616029356e-05, | |
| "loss": 5.2285, | |
| "mean_token_accuracy": 0.17513605952262878, | |
| "num_tokens": 10122768.0, | |
| "step": 3605 | |
| }, | |
| { | |
| "entropy": 5.47025580406189, | |
| "epoch": 0.0977326565143824, | |
| "grad_norm": 0.96875, | |
| "learning_rate": 6.85988981946002e-05, | |
| "loss": 5.317, | |
| "mean_token_accuracy": 0.16671132892370225, | |
| "num_tokens": 10137705.0, | |
| "step": 3610 | |
| }, | |
| { | |
| "entropy": 5.41975588798523, | |
| "epoch": 0.09786802030456852, | |
| "grad_norm": 0.94921875, | |
| "learning_rate": 6.813271881937564e-05, | |
| "loss": 5.1786, | |
| "mean_token_accuracy": 0.1797885350883007, | |
| "num_tokens": 10153065.0, | |
| "step": 3615 | |
| }, | |
| { | |
| "entropy": 5.474036645889282, | |
| "epoch": 0.09800338409475465, | |
| "grad_norm": 0.921875, | |
| "learning_rate": 6.767221081516286e-05, | |
| "loss": 5.2658, | |
| "mean_token_accuracy": 0.17338726818561553, | |
| "num_tokens": 10168430.0, | |
| "step": 3620 | |
| }, | |
| { | |
| "entropy": 5.443027448654175, | |
| "epoch": 0.09813874788494077, | |
| "grad_norm": 0.93359375, | |
| "learning_rate": 6.72173868070215e-05, | |
| "loss": 5.1754, | |
| "mean_token_accuracy": 0.1833331510424614, | |
| "num_tokens": 10182222.0, | |
| "step": 3625 | |
| }, | |
| { | |
| "entropy": 5.503278112411499, | |
| "epoch": 0.09827411167512691, | |
| "grad_norm": 0.86328125, | |
| "learning_rate": 6.676825926418149e-05, | |
| "loss": 5.2927, | |
| "mean_token_accuracy": 0.17598096579313277, | |
| "num_tokens": 10198470.0, | |
| "step": 3630 | |
| }, | |
| { | |
| "entropy": 5.457680559158325, | |
| "epoch": 0.09840947546531303, | |
| "grad_norm": 0.91015625, | |
| "learning_rate": 6.632484049970122e-05, | |
| "loss": 5.2838, | |
| "mean_token_accuracy": 0.17474121153354644, | |
| "num_tokens": 10212676.0, | |
| "step": 3635 | |
| }, | |
| { | |
| "entropy": 5.431332063674927, | |
| "epoch": 0.09854483925549916, | |
| "grad_norm": 0.99609375, | |
| "learning_rate": 6.588714267013019e-05, | |
| "loss": 5.2276, | |
| "mean_token_accuracy": 0.17433813363313674, | |
| "num_tokens": 10224893.0, | |
| "step": 3640 | |
| }, | |
| { | |
| "entropy": 5.483983039855957, | |
| "epoch": 0.09868020304568528, | |
| "grad_norm": 0.8984375, | |
| "learning_rate": 6.545517777517544e-05, | |
| "loss": 5.2464, | |
| "mean_token_accuracy": 0.1813598617911339, | |
| "num_tokens": 10238786.0, | |
| "step": 3645 | |
| }, | |
| { | |
| "entropy": 5.4722819328308105, | |
| "epoch": 0.09881556683587141, | |
| "grad_norm": 0.92578125, | |
| "learning_rate": 6.502895765737281e-05, | |
| "loss": 5.252, | |
| "mean_token_accuracy": 0.16823621690273285, | |
| "num_tokens": 10252831.0, | |
| "step": 3650 | |
| }, | |
| { | |
| "entropy": 5.427985715866089, | |
| "epoch": 0.09895093062605753, | |
| "grad_norm": 0.84375, | |
| "learning_rate": 6.460849400176212e-05, | |
| "loss": 5.2286, | |
| "mean_token_accuracy": 0.1749664455652237, | |
| "num_tokens": 10268886.0, | |
| "step": 3655 | |
| }, | |
| { | |
| "entropy": 5.503793334960937, | |
| "epoch": 0.09908629441624366, | |
| "grad_norm": 1.0546875, | |
| "learning_rate": 6.419379833556694e-05, | |
| "loss": 5.3155, | |
| "mean_token_accuracy": 0.17741915136575698, | |
| "num_tokens": 10282332.0, | |
| "step": 3660 | |
| }, | |
| { | |
| "entropy": 5.452091121673584, | |
| "epoch": 0.09922165820642978, | |
| "grad_norm": 1.0078125, | |
| "learning_rate": 6.378488202787835e-05, | |
| "loss": 5.2168, | |
| "mean_token_accuracy": 0.17554211616516113, | |
| "num_tokens": 10295262.0, | |
| "step": 3665 | |
| }, | |
| { | |
| "entropy": 5.445429563522339, | |
| "epoch": 0.0993570219966159, | |
| "grad_norm": 0.92578125, | |
| "learning_rate": 6.33817562893435e-05, | |
| "loss": 5.2164, | |
| "mean_token_accuracy": 0.18022813349962236, | |
| "num_tokens": 10310202.0, | |
| "step": 3670 | |
| }, | |
| { | |
| "entropy": 5.478223133087158, | |
| "epoch": 0.09949238578680203, | |
| "grad_norm": 0.93359375, | |
| "learning_rate": 6.29844321718582e-05, | |
| "loss": 5.2857, | |
| "mean_token_accuracy": 0.17693584710359572, | |
| "num_tokens": 10322581.0, | |
| "step": 3675 | |
| }, | |
| { | |
| "entropy": 5.501222801208496, | |
| "epoch": 0.09962774957698815, | |
| "grad_norm": 1.046875, | |
| "learning_rate": 6.259292056826383e-05, | |
| "loss": 5.3048, | |
| "mean_token_accuracy": 0.17106766849756241, | |
| "num_tokens": 10335451.0, | |
| "step": 3680 | |
| }, | |
| { | |
| "entropy": 5.453751420974731, | |
| "epoch": 0.09976311336717428, | |
| "grad_norm": 0.921875, | |
| "learning_rate": 6.220723221204873e-05, | |
| "loss": 5.1911, | |
| "mean_token_accuracy": 0.18236185610294342, | |
| "num_tokens": 10349664.0, | |
| "step": 3685 | |
| }, | |
| { | |
| "entropy": 5.482261371612549, | |
| "epoch": 0.0998984771573604, | |
| "grad_norm": 1.078125, | |
| "learning_rate": 6.182737767705406e-05, | |
| "loss": 5.2385, | |
| "mean_token_accuracy": 0.17836161702871323, | |
| "num_tokens": 10363222.0, | |
| "step": 3690 | |
| }, | |
| { | |
| "entropy": 5.414063405990601, | |
| "epoch": 0.10003384094754653, | |
| "grad_norm": 0.984375, | |
| "learning_rate": 6.145336737718375e-05, | |
| "loss": 5.2521, | |
| "mean_token_accuracy": 0.1778153583407402, | |
| "num_tokens": 10377084.0, | |
| "step": 3695 | |
| }, | |
| { | |
| "entropy": 5.439861106872558, | |
| "epoch": 0.10016920473773265, | |
| "grad_norm": 0.96875, | |
| "learning_rate": 6.10852115661191e-05, | |
| "loss": 5.2042, | |
| "mean_token_accuracy": 0.1773260474205017, | |
| "num_tokens": 10391151.0, | |
| "step": 3700 | |
| }, | |
| { | |
| "entropy": 5.38260555267334, | |
| "epoch": 0.10030456852791877, | |
| "grad_norm": 0.85546875, | |
| "learning_rate": 6.072292033703766e-05, | |
| "loss": 5.1476, | |
| "mean_token_accuracy": 0.18702121675014496, | |
| "num_tokens": 10404601.0, | |
| "step": 3705 | |
| }, | |
| { | |
| "entropy": 5.455022859573364, | |
| "epoch": 0.10043993231810491, | |
| "grad_norm": 1.015625, | |
| "learning_rate": 6.036650362233648e-05, | |
| "loss": 5.3161, | |
| "mean_token_accuracy": 0.16847151815891265, | |
| "num_tokens": 10418201.0, | |
| "step": 3710 | |
| }, | |
| { | |
| "entropy": 5.4407267570495605, | |
| "epoch": 0.10057529610829104, | |
| "grad_norm": 1.03125, | |
| "learning_rate": 6.0015971193359824e-05, | |
| "loss": 5.1724, | |
| "mean_token_accuracy": 0.18162354379892348, | |
| "num_tokens": 10431030.0, | |
| "step": 3715 | |
| }, | |
| { | |
| "entropy": 5.465402412414551, | |
| "epoch": 0.10071065989847716, | |
| "grad_norm": 1.015625, | |
| "learning_rate": 5.9671332660131306e-05, | |
| "loss": 5.2411, | |
| "mean_token_accuracy": 0.17822658121585847, | |
| "num_tokens": 10444470.0, | |
| "step": 3720 | |
| }, | |
| { | |
| "entropy": 5.4923155307769775, | |
| "epoch": 0.10084602368866329, | |
| "grad_norm": 1.015625, | |
| "learning_rate": 5.933259747109042e-05, | |
| "loss": 5.2845, | |
| "mean_token_accuracy": 0.17237729281187059, | |
| "num_tokens": 10457686.0, | |
| "step": 3725 | |
| }, | |
| { | |
| "entropy": 5.421149730682373, | |
| "epoch": 0.10098138747884941, | |
| "grad_norm": 0.91015625, | |
| "learning_rate": 5.899977491283351e-05, | |
| "loss": 5.1355, | |
| "mean_token_accuracy": 0.18317325860261918, | |
| "num_tokens": 10472039.0, | |
| "step": 3730 | |
| }, | |
| { | |
| "entropy": 5.476395988464356, | |
| "epoch": 0.10111675126903553, | |
| "grad_norm": 0.91796875, | |
| "learning_rate": 5.867287410985908e-05, | |
| "loss": 5.1902, | |
| "mean_token_accuracy": 0.17925067692995073, | |
| "num_tokens": 10485161.0, | |
| "step": 3735 | |
| }, | |
| { | |
| "entropy": 5.387272596359253, | |
| "epoch": 0.10125211505922166, | |
| "grad_norm": 0.92578125, | |
| "learning_rate": 5.835190402431779e-05, | |
| "loss": 5.2151, | |
| "mean_token_accuracy": 0.18368397653102875, | |
| "num_tokens": 10499106.0, | |
| "step": 3740 | |
| }, | |
| { | |
| "entropy": 5.504530429840088, | |
| "epoch": 0.10138747884940778, | |
| "grad_norm": 1.0078125, | |
| "learning_rate": 5.803687345576673e-05, | |
| "loss": 5.2795, | |
| "mean_token_accuracy": 0.1814903661608696, | |
| "num_tokens": 10513209.0, | |
| "step": 3745 | |
| }, | |
| { | |
| "entropy": 5.465247631072998, | |
| "epoch": 0.10152284263959391, | |
| "grad_norm": 0.99609375, | |
| "learning_rate": 5.7727791040927977e-05, | |
| "loss": 5.2493, | |
| "mean_token_accuracy": 0.17284207046031952, | |
| "num_tokens": 10527883.0, | |
| "step": 3750 | |
| }, | |
| { | |
| "entropy": 5.473253870010376, | |
| "epoch": 0.10165820642978003, | |
| "grad_norm": 0.921875, | |
| "learning_rate": 5.742466525345213e-05, | |
| "loss": 5.1674, | |
| "mean_token_accuracy": 0.1791956305503845, | |
| "num_tokens": 10541871.0, | |
| "step": 3755 | |
| }, | |
| { | |
| "entropy": 5.41374135017395, | |
| "epoch": 0.10179357021996616, | |
| "grad_norm": 0.87890625, | |
| "learning_rate": 5.7127504403685775e-05, | |
| "loss": 5.1771, | |
| "mean_token_accuracy": 0.17775085270404817, | |
| "num_tokens": 10556322.0, | |
| "step": 3760 | |
| }, | |
| { | |
| "entropy": 5.441633033752441, | |
| "epoch": 0.10192893401015228, | |
| "grad_norm": 0.96875, | |
| "learning_rate": 5.6836316638443664e-05, | |
| "loss": 5.1265, | |
| "mean_token_accuracy": 0.18571407794952394, | |
| "num_tokens": 10569399.0, | |
| "step": 3765 | |
| }, | |
| { | |
| "entropy": 5.494030094146728, | |
| "epoch": 0.1020642978003384, | |
| "grad_norm": 0.94921875, | |
| "learning_rate": 5.655110994078553e-05, | |
| "loss": 5.2973, | |
| "mean_token_accuracy": 0.17363038361072541, | |
| "num_tokens": 10583481.0, | |
| "step": 3770 | |
| }, | |
| { | |
| "entropy": 5.452342128753662, | |
| "epoch": 0.10219966159052453, | |
| "grad_norm": 0.9375, | |
| "learning_rate": 5.6271892129797056e-05, | |
| "loss": 5.1813, | |
| "mean_token_accuracy": 0.17757375687360763, | |
| "num_tokens": 10597706.0, | |
| "step": 3775 | |
| }, | |
| { | |
| "entropy": 5.386959171295166, | |
| "epoch": 0.10233502538071065, | |
| "grad_norm": 0.94921875, | |
| "learning_rate": 5.599867086037556e-05, | |
| "loss": 5.0745, | |
| "mean_token_accuracy": 0.18331465721130372, | |
| "num_tokens": 10611437.0, | |
| "step": 3780 | |
| }, | |
| { | |
| "entropy": 5.468786334991455, | |
| "epoch": 0.10247038917089679, | |
| "grad_norm": 0.94140625, | |
| "learning_rate": 5.573145362302012e-05, | |
| "loss": 5.3312, | |
| "mean_token_accuracy": 0.17515545785427095, | |
| "num_tokens": 10624076.0, | |
| "step": 3785 | |
| }, | |
| { | |
| "entropy": 5.486022806167602, | |
| "epoch": 0.10260575296108292, | |
| "grad_norm": 0.9609375, | |
| "learning_rate": 5.5470247743626404e-05, | |
| "loss": 5.3145, | |
| "mean_token_accuracy": 0.16346433609724045, | |
| "num_tokens": 10639696.0, | |
| "step": 3790 | |
| }, | |
| { | |
| "entropy": 5.462622547149659, | |
| "epoch": 0.10274111675126904, | |
| "grad_norm": 1.0234375, | |
| "learning_rate": 5.5215060383285414e-05, | |
| "loss": 5.2871, | |
| "mean_token_accuracy": 0.17402675300836562, | |
| "num_tokens": 10652098.0, | |
| "step": 3795 | |
| }, | |
| { | |
| "entropy": 5.46808557510376, | |
| "epoch": 0.10287648054145516, | |
| "grad_norm": 1.0546875, | |
| "learning_rate": 5.496589853808759e-05, | |
| "loss": 5.2574, | |
| "mean_token_accuracy": 0.17415528744459152, | |
| "num_tokens": 10666968.0, | |
| "step": 3800 | |
| }, | |
| { | |
| "entropy": 5.4186664581298825, | |
| "epoch": 0.10301184433164129, | |
| "grad_norm": 1.0546875, | |
| "learning_rate": 5.47227690389308e-05, | |
| "loss": 5.1148, | |
| "mean_token_accuracy": 0.1816213309764862, | |
| "num_tokens": 10679663.0, | |
| "step": 3805 | |
| }, | |
| { | |
| "entropy": 5.4264075756073, | |
| "epoch": 0.10314720812182741, | |
| "grad_norm": 0.9453125, | |
| "learning_rate": 5.448567855133306e-05, | |
| "loss": 5.1901, | |
| "mean_token_accuracy": 0.17645768374204635, | |
| "num_tokens": 10692660.0, | |
| "step": 3810 | |
| }, | |
| { | |
| "entropy": 5.4301145553588865, | |
| "epoch": 0.10328257191201354, | |
| "grad_norm": 0.984375, | |
| "learning_rate": 5.425463357524986e-05, | |
| "loss": 5.2028, | |
| "mean_token_accuracy": 0.18301489800214768, | |
| "num_tokens": 10705806.0, | |
| "step": 3815 | |
| }, | |
| { | |
| "entropy": 5.47904863357544, | |
| "epoch": 0.10341793570219966, | |
| "grad_norm": 0.875, | |
| "learning_rate": 5.402964044489591e-05, | |
| "loss": 5.2943, | |
| "mean_token_accuracy": 0.1806845486164093, | |
| "num_tokens": 10720408.0, | |
| "step": 3820 | |
| }, | |
| { | |
| "entropy": 5.505579853057862, | |
| "epoch": 0.10355329949238579, | |
| "grad_norm": 0.90234375, | |
| "learning_rate": 5.381070532857153e-05, | |
| "loss": 5.2817, | |
| "mean_token_accuracy": 0.17546553611755372, | |
| "num_tokens": 10737031.0, | |
| "step": 3825 | |
| }, | |
| { | |
| "entropy": 5.478611946105957, | |
| "epoch": 0.10368866328257191, | |
| "grad_norm": 1.03125, | |
| "learning_rate": 5.359783422849357e-05, | |
| "loss": 5.2734, | |
| "mean_token_accuracy": 0.17541965693235398, | |
| "num_tokens": 10750669.0, | |
| "step": 3830 | |
| }, | |
| { | |
| "entropy": 5.435742044448853, | |
| "epoch": 0.10382402707275803, | |
| "grad_norm": 0.94921875, | |
| "learning_rate": 5.3391032980630736e-05, | |
| "loss": 5.2713, | |
| "mean_token_accuracy": 0.17451788634061813, | |
| "num_tokens": 10766303.0, | |
| "step": 3835 | |
| }, | |
| { | |
| "entropy": 5.460405540466309, | |
| "epoch": 0.10395939086294416, | |
| "grad_norm": 1.09375, | |
| "learning_rate": 5.31903072545437e-05, | |
| "loss": 5.2081, | |
| "mean_token_accuracy": 0.18736861348152162, | |
| "num_tokens": 10780288.0, | |
| "step": 3840 | |
| }, | |
| { | |
| "entropy": 5.429828453063965, | |
| "epoch": 0.10409475465313028, | |
| "grad_norm": 0.984375, | |
| "learning_rate": 5.29956625532297e-05, | |
| "loss": 5.2529, | |
| "mean_token_accuracy": 0.1730156198143959, | |
| "num_tokens": 10793844.0, | |
| "step": 3845 | |
| }, | |
| { | |
| "entropy": 5.420657110214234, | |
| "epoch": 0.10423011844331641, | |
| "grad_norm": 1.046875, | |
| "learning_rate": 5.280710421297146e-05, | |
| "loss": 5.2018, | |
| "mean_token_accuracy": 0.18210601955652236, | |
| "num_tokens": 10808050.0, | |
| "step": 3850 | |
| }, | |
| { | |
| "entropy": 5.409189033508301, | |
| "epoch": 0.10436548223350253, | |
| "grad_norm": 0.91015625, | |
| "learning_rate": 5.2624637403191165e-05, | |
| "loss": 5.1812, | |
| "mean_token_accuracy": 0.18174512237310408, | |
| "num_tokens": 10822598.0, | |
| "step": 3855 | |
| }, | |
| { | |
| "entropy": 5.432131004333496, | |
| "epoch": 0.10450084602368866, | |
| "grad_norm": 0.953125, | |
| "learning_rate": 5.2448267126308605e-05, | |
| "loss": 5.1928, | |
| "mean_token_accuracy": 0.17888483554124832, | |
| "num_tokens": 10835679.0, | |
| "step": 3860 | |
| }, | |
| { | |
| "entropy": 5.4485198020935055, | |
| "epoch": 0.1046362098138748, | |
| "grad_norm": 1.1015625, | |
| "learning_rate": 5.2277998217603954e-05, | |
| "loss": 5.1937, | |
| "mean_token_accuracy": 0.17868861109018325, | |
| "num_tokens": 10848896.0, | |
| "step": 3865 | |
| }, | |
| { | |
| "entropy": 5.490707921981811, | |
| "epoch": 0.10477157360406092, | |
| "grad_norm": 1.03125, | |
| "learning_rate": 5.211383534508541e-05, | |
| "loss": 5.212, | |
| "mean_token_accuracy": 0.1784048408269882, | |
| "num_tokens": 10861562.0, | |
| "step": 3870 | |
| }, | |
| { | |
| "entropy": 5.42482328414917, | |
| "epoch": 0.10490693739424704, | |
| "grad_norm": 0.9921875, | |
| "learning_rate": 5.1955783009361044e-05, | |
| "loss": 5.1451, | |
| "mean_token_accuracy": 0.18526836186647416, | |
| "num_tokens": 10873483.0, | |
| "step": 3875 | |
| }, | |
| { | |
| "entropy": 5.435460948944092, | |
| "epoch": 0.10504230118443317, | |
| "grad_norm": 0.95703125, | |
| "learning_rate": 5.180384554351543e-05, | |
| "loss": 5.2047, | |
| "mean_token_accuracy": 0.17779654264450073, | |
| "num_tokens": 10887788.0, | |
| "step": 3880 | |
| }, | |
| { | |
| "entropy": 5.426501941680908, | |
| "epoch": 0.10517766497461929, | |
| "grad_norm": 0.953125, | |
| "learning_rate": 5.1658027112990976e-05, | |
| "loss": 5.1484, | |
| "mean_token_accuracy": 0.17941227555274963, | |
| "num_tokens": 10901017.0, | |
| "step": 3885 | |
| }, | |
| { | |
| "entropy": 5.390911626815796, | |
| "epoch": 0.10531302876480542, | |
| "grad_norm": 0.84375, | |
| "learning_rate": 5.151833171547365e-05, | |
| "loss": 5.1484, | |
| "mean_token_accuracy": 0.1830310583114624, | |
| "num_tokens": 10914480.0, | |
| "step": 3890 | |
| }, | |
| { | |
| "entropy": 5.433801603317261, | |
| "epoch": 0.10544839255499154, | |
| "grad_norm": 1.0, | |
| "learning_rate": 5.1384763180783274e-05, | |
| "loss": 5.2588, | |
| "mean_token_accuracy": 0.1759231224656105, | |
| "num_tokens": 10929732.0, | |
| "step": 3895 | |
| }, | |
| { | |
| "entropy": 5.408439302444458, | |
| "epoch": 0.10558375634517767, | |
| "grad_norm": 0.96484375, | |
| "learning_rate": 5.125732517076876e-05, | |
| "loss": 5.1889, | |
| "mean_token_accuracy": 0.18901487439870834, | |
| "num_tokens": 10942125.0, | |
| "step": 3900 | |
| }, | |
| { | |
| "entropy": 5.334071922302246, | |
| "epoch": 0.10571912013536379, | |
| "grad_norm": 1.015625, | |
| "learning_rate": 5.113602117920747e-05, | |
| "loss": 5.072, | |
| "mean_token_accuracy": 0.1919448718428612, | |
| "num_tokens": 10954469.0, | |
| "step": 3905 | |
| }, | |
| { | |
| "entropy": 5.39621148109436, | |
| "epoch": 0.10585448392554991, | |
| "grad_norm": 0.8671875, | |
| "learning_rate": 5.102085453170966e-05, | |
| "loss": 5.1551, | |
| "mean_token_accuracy": 0.18375782817602157, | |
| "num_tokens": 10969401.0, | |
| "step": 3910 | |
| }, | |
| { | |
| "entropy": 5.453270816802979, | |
| "epoch": 0.10598984771573604, | |
| "grad_norm": 1.0625, | |
| "learning_rate": 5.091182838562709e-05, | |
| "loss": 5.2563, | |
| "mean_token_accuracy": 0.17768552899360657, | |
| "num_tokens": 10984192.0, | |
| "step": 3915 | |
| }, | |
| { | |
| "entropy": 5.491350603103638, | |
| "epoch": 0.10612521150592216, | |
| "grad_norm": 0.85546875, | |
| "learning_rate": 5.0808945729966716e-05, | |
| "loss": 5.2631, | |
| "mean_token_accuracy": 0.17394644767045975, | |
| "num_tokens": 10999855.0, | |
| "step": 3920 | |
| }, | |
| { | |
| "entropy": 5.465265512466431, | |
| "epoch": 0.10626057529610829, | |
| "grad_norm": 1.015625, | |
| "learning_rate": 5.071220938530844e-05, | |
| "loss": 5.2407, | |
| "mean_token_accuracy": 0.17272032648324967, | |
| "num_tokens": 11011371.0, | |
| "step": 3925 | |
| }, | |
| { | |
| "entropy": 5.422465705871582, | |
| "epoch": 0.10639593908629441, | |
| "grad_norm": 0.97265625, | |
| "learning_rate": 5.0621622003728026e-05, | |
| "loss": 5.2047, | |
| "mean_token_accuracy": 0.18466399610042572, | |
| "num_tokens": 11025141.0, | |
| "step": 3930 | |
| }, | |
| { | |
| "entropy": 5.506776142120361, | |
| "epoch": 0.10653130287648054, | |
| "grad_norm": 0.9296875, | |
| "learning_rate": 5.053718606872433e-05, | |
| "loss": 5.3006, | |
| "mean_token_accuracy": 0.178793703019619, | |
| "num_tokens": 11038750.0, | |
| "step": 3935 | |
| }, | |
| { | |
| "entropy": 5.444697284698487, | |
| "epoch": 0.10666666666666667, | |
| "grad_norm": 0.93359375, | |
| "learning_rate": 5.0458903895151134e-05, | |
| "loss": 5.2158, | |
| "mean_token_accuracy": 0.17911358028650284, | |
| "num_tokens": 11052146.0, | |
| "step": 3940 | |
| }, | |
| { | |
| "entropy": 5.430838108062744, | |
| "epoch": 0.1068020304568528, | |
| "grad_norm": 0.98828125, | |
| "learning_rate": 5.038677762915381e-05, | |
| "loss": 5.1231, | |
| "mean_token_accuracy": 0.1867231696844101, | |
| "num_tokens": 11065091.0, | |
| "step": 3945 | |
| }, | |
| { | |
| "entropy": 5.3946521282196045, | |
| "epoch": 0.10693739424703892, | |
| "grad_norm": 0.94140625, | |
| "learning_rate": 5.032080924811033e-05, | |
| "loss": 5.2273, | |
| "mean_token_accuracy": 0.1766382023692131, | |
| "num_tokens": 11081124.0, | |
| "step": 3950 | |
| }, | |
| { | |
| "entropy": 5.479502820968628, | |
| "epoch": 0.10707275803722505, | |
| "grad_norm": 1.0234375, | |
| "learning_rate": 5.026100056057718e-05, | |
| "loss": 5.283, | |
| "mean_token_accuracy": 0.17816594392061233, | |
| "num_tokens": 11093540.0, | |
| "step": 3955 | |
| }, | |
| { | |
| "entropy": 5.48756160736084, | |
| "epoch": 0.10720812182741117, | |
| "grad_norm": 0.859375, | |
| "learning_rate": 5.0207353206239764e-05, | |
| "loss": 5.2695, | |
| "mean_token_accuracy": 0.17074304521083833, | |
| "num_tokens": 11108039.0, | |
| "step": 3960 | |
| }, | |
| { | |
| "entropy": 5.424608612060547, | |
| "epoch": 0.1073434856175973, | |
| "grad_norm": 0.828125, | |
| "learning_rate": 5.0159868655867436e-05, | |
| "loss": 5.2348, | |
| "mean_token_accuracy": 0.1750531792640686, | |
| "num_tokens": 11123472.0, | |
| "step": 3965 | |
| }, | |
| { | |
| "entropy": 5.406925106048584, | |
| "epoch": 0.10747884940778342, | |
| "grad_norm": 0.8828125, | |
| "learning_rate": 5.011854821127305e-05, | |
| "loss": 5.141, | |
| "mean_token_accuracy": 0.1887975424528122, | |
| "num_tokens": 11136791.0, | |
| "step": 3970 | |
| }, | |
| { | |
| "entropy": 5.442727184295654, | |
| "epoch": 0.10761421319796954, | |
| "grad_norm": 0.91015625, | |
| "learning_rate": 5.008339300527755e-05, | |
| "loss": 5.1939, | |
| "mean_token_accuracy": 0.18285703808069229, | |
| "num_tokens": 11149103.0, | |
| "step": 3975 | |
| }, | |
| { | |
| "entropy": 5.368607807159424, | |
| "epoch": 0.10774957698815567, | |
| "grad_norm": 0.87109375, | |
| "learning_rate": 5.005440400167859e-05, | |
| "loss": 5.0833, | |
| "mean_token_accuracy": 0.19177746623754502, | |
| "num_tokens": 11163824.0, | |
| "step": 3980 | |
| }, | |
| { | |
| "entropy": 5.486799526214599, | |
| "epoch": 0.10788494077834179, | |
| "grad_norm": 0.96484375, | |
| "learning_rate": 5.003158199522442e-05, | |
| "loss": 5.241, | |
| "mean_token_accuracy": 0.17701994627714157, | |
| "num_tokens": 11177750.0, | |
| "step": 3985 | |
| }, | |
| { | |
| "entropy": 5.478089284896851, | |
| "epoch": 0.10802030456852792, | |
| "grad_norm": 0.859375, | |
| "learning_rate": 5.0014927611591806e-05, | |
| "loss": 5.2495, | |
| "mean_token_accuracy": 0.17373744398355484, | |
| "num_tokens": 11192089.0, | |
| "step": 3990 | |
| }, | |
| { | |
| "entropy": 5.414667749404908, | |
| "epoch": 0.10815566835871404, | |
| "grad_norm": 0.95703125, | |
| "learning_rate": 5.000444130736916e-05, | |
| "loss": 5.1754, | |
| "mean_token_accuracy": 0.17795276492834092, | |
| "num_tokens": 11206240.0, | |
| "step": 3995 | |
| }, | |
| { | |
| "entropy": 5.448756742477417, | |
| "epoch": 0.10829103214890017, | |
| "grad_norm": 0.84765625, | |
| "learning_rate": 5.0000123370043736e-05, | |
| "loss": 5.2278, | |
| "mean_token_accuracy": 0.18019841909408568, | |
| "num_tokens": 11219972.0, | |
| "step": 4000 | |
| } | |
| ], | |
| "logging_steps": 5, | |
| "max_steps": 4000, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 1, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.9961559926784e+16, | |
| "train_batch_size": 16, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |