Text Generation
Transformers
Safetensors
gpt2
Generated from Trainer
sft
trl
text-generation-inference
Instructions to use fpadovani/urd-arab-100mb-ppt-Dp-10mb_seed3407 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use fpadovani/urd-arab-100mb-ppt-Dp-10mb_seed3407 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="fpadovani/urd-arab-100mb-ppt-Dp-10mb_seed3407")# Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("fpadovani/urd-arab-100mb-ppt-Dp-10mb_seed3407") model = AutoModelForCausalLM.from_pretrained("fpadovani/urd-arab-100mb-ppt-Dp-10mb_seed3407", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use fpadovani/urd-arab-100mb-ppt-Dp-10mb_seed3407 with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "fpadovani/urd-arab-100mb-ppt-Dp-10mb_seed3407" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "fpadovani/urd-arab-100mb-ppt-Dp-10mb_seed3407", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker
docker model run hf.co/fpadovani/urd-arab-100mb-ppt-Dp-10mb_seed3407
- SGLang
How to use fpadovani/urd-arab-100mb-ppt-Dp-10mb_seed3407 with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "fpadovani/urd-arab-100mb-ppt-Dp-10mb_seed3407" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "fpadovani/urd-arab-100mb-ppt-Dp-10mb_seed3407", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "fpadovani/urd-arab-100mb-ppt-Dp-10mb_seed3407" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "fpadovani/urd-arab-100mb-ppt-Dp-10mb_seed3407", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }' - Docker Model Runner
How to use fpadovani/urd-arab-100mb-ppt-Dp-10mb_seed3407 with Docker Model Runner:
docker model run hf.co/fpadovani/urd-arab-100mb-ppt-Dp-10mb_seed3407
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 0.01568037131119265, | |
| "eval_steps": 500, | |
| "global_step": 500, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 10.651023864746094, | |
| "epoch": 0.00015680371311192648, | |
| "grad_norm": 11.5625, | |
| "learning_rate": 2e-06, | |
| "loss": 10.8028, | |
| "mean_token_accuracy": 6.958942394703626e-05, | |
| "num_tokens": 14082.0, | |
| "step": 5 | |
| }, | |
| { | |
| "entropy": 10.651004600524903, | |
| "epoch": 0.00031360742622385296, | |
| "grad_norm": 11.375, | |
| "learning_rate": 4.5e-06, | |
| "loss": 10.7633, | |
| "mean_token_accuracy": 6.574622238986194e-05, | |
| "num_tokens": 29900.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 10.650343418121338, | |
| "epoch": 0.00047041113933577947, | |
| "grad_norm": 8.4375, | |
| "learning_rate": 7e-06, | |
| "loss": 10.5185, | |
| "mean_token_accuracy": 0.01316747289383784, | |
| "num_tokens": 43394.0, | |
| "step": 15 | |
| }, | |
| { | |
| "entropy": 10.64456491470337, | |
| "epoch": 0.0006272148524477059, | |
| "grad_norm": 5.34375, | |
| "learning_rate": 9.5e-06, | |
| "loss": 10.2603, | |
| "mean_token_accuracy": 0.03233455698937178, | |
| "num_tokens": 58563.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 10.616307353973388, | |
| "epoch": 0.0007840185655596325, | |
| "grad_norm": 3.609375, | |
| "learning_rate": 1.2e-05, | |
| "loss": 9.9833, | |
| "mean_token_accuracy": 0.034109539538621905, | |
| "num_tokens": 73923.0, | |
| "step": 25 | |
| }, | |
| { | |
| "entropy": 10.588720226287842, | |
| "epoch": 0.0009408222786715589, | |
| "grad_norm": 2.984375, | |
| "learning_rate": 1.4500000000000002e-05, | |
| "loss": 9.8466, | |
| "mean_token_accuracy": 0.03426761133596301, | |
| "num_tokens": 87652.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 10.595056247711181, | |
| "epoch": 0.0010976259917834855, | |
| "grad_norm": 2.671875, | |
| "learning_rate": 1.7000000000000003e-05, | |
| "loss": 9.7741, | |
| "mean_token_accuracy": 0.031784738413989544, | |
| "num_tokens": 101369.0, | |
| "step": 35 | |
| }, | |
| { | |
| "entropy": 10.59932107925415, | |
| "epoch": 0.0012544297048954118, | |
| "grad_norm": 2.515625, | |
| "learning_rate": 1.95e-05, | |
| "loss": 9.6922, | |
| "mean_token_accuracy": 0.03506205677986145, | |
| "num_tokens": 114428.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 10.581777667999267, | |
| "epoch": 0.0014112334180073384, | |
| "grad_norm": 2.3125, | |
| "learning_rate": 2.2e-05, | |
| "loss": 9.706, | |
| "mean_token_accuracy": 0.03386611118912697, | |
| "num_tokens": 130472.0, | |
| "step": 45 | |
| }, | |
| { | |
| "entropy": 10.577643585205077, | |
| "epoch": 0.001568037131119265, | |
| "grad_norm": 2.40625, | |
| "learning_rate": 2.4500000000000003e-05, | |
| "loss": 9.6852, | |
| "mean_token_accuracy": 0.030213401652872562, | |
| "num_tokens": 144077.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 10.59252758026123, | |
| "epoch": 0.0017248408442311913, | |
| "grad_norm": 2.15625, | |
| "learning_rate": 2.7e-05, | |
| "loss": 9.6373, | |
| "mean_token_accuracy": 0.03242910895496607, | |
| "num_tokens": 158941.0, | |
| "step": 55 | |
| }, | |
| { | |
| "entropy": 10.579074954986572, | |
| "epoch": 0.0018816445573431179, | |
| "grad_norm": 2.140625, | |
| "learning_rate": 2.95e-05, | |
| "loss": 9.563, | |
| "mean_token_accuracy": 0.02959225047379732, | |
| "num_tokens": 174362.0, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 10.570305156707764, | |
| "epoch": 0.002038448270455044, | |
| "grad_norm": 2.09375, | |
| "learning_rate": 3.2e-05, | |
| "loss": 9.4485, | |
| "mean_token_accuracy": 0.033058703131973746, | |
| "num_tokens": 190929.0, | |
| "step": 65 | |
| }, | |
| { | |
| "entropy": 10.55489387512207, | |
| "epoch": 0.002195251983566971, | |
| "grad_norm": 2.015625, | |
| "learning_rate": 3.4500000000000005e-05, | |
| "loss": 9.3387, | |
| "mean_token_accuracy": 0.033958965167403224, | |
| "num_tokens": 203660.0, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 10.530017757415772, | |
| "epoch": 0.0023520556966788973, | |
| "grad_norm": 2.0625, | |
| "learning_rate": 3.7e-05, | |
| "loss": 9.2826, | |
| "mean_token_accuracy": 0.027879416570067407, | |
| "num_tokens": 218421.0, | |
| "step": 75 | |
| }, | |
| { | |
| "entropy": 10.534087371826171, | |
| "epoch": 0.0025088594097908237, | |
| "grad_norm": 2.09375, | |
| "learning_rate": 3.95e-05, | |
| "loss": 9.1439, | |
| "mean_token_accuracy": 0.03472804371267557, | |
| "num_tokens": 233734.0, | |
| "step": 80 | |
| }, | |
| { | |
| "entropy": 10.496679878234863, | |
| "epoch": 0.0026656631229027505, | |
| "grad_norm": 1.9765625, | |
| "learning_rate": 4.2000000000000004e-05, | |
| "loss": 9.0182, | |
| "mean_token_accuracy": 0.02818337455391884, | |
| "num_tokens": 247105.0, | |
| "step": 85 | |
| }, | |
| { | |
| "entropy": 10.467080688476562, | |
| "epoch": 0.002822466836014677, | |
| "grad_norm": 1.9140625, | |
| "learning_rate": 4.45e-05, | |
| "loss": 8.928, | |
| "mean_token_accuracy": 0.03165087569504976, | |
| "num_tokens": 262487.0, | |
| "step": 90 | |
| }, | |
| { | |
| "entropy": 10.403542804718018, | |
| "epoch": 0.002979270549126603, | |
| "grad_norm": 1.9921875, | |
| "learning_rate": 4.7000000000000004e-05, | |
| "loss": 8.7777, | |
| "mean_token_accuracy": 0.036813986487686634, | |
| "num_tokens": 276705.0, | |
| "step": 95 | |
| }, | |
| { | |
| "entropy": 10.354411220550537, | |
| "epoch": 0.00313607426223853, | |
| "grad_norm": 1.9765625, | |
| "learning_rate": 4.9500000000000004e-05, | |
| "loss": 8.6775, | |
| "mean_token_accuracy": 0.04005452003329992, | |
| "num_tokens": 291031.0, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 10.269740104675293, | |
| "epoch": 0.0032928779753504563, | |
| "grad_norm": 1.890625, | |
| "learning_rate": 5.2e-05, | |
| "loss": 8.5069, | |
| "mean_token_accuracy": 0.040437552519142626, | |
| "num_tokens": 305444.0, | |
| "step": 105 | |
| }, | |
| { | |
| "entropy": 10.179180717468261, | |
| "epoch": 0.0034496816884623826, | |
| "grad_norm": 1.8671875, | |
| "learning_rate": 5.45e-05, | |
| "loss": 8.3811, | |
| "mean_token_accuracy": 0.04589438661932945, | |
| "num_tokens": 321168.0, | |
| "step": 110 | |
| }, | |
| { | |
| "entropy": 10.070209217071532, | |
| "epoch": 0.0036064854015743094, | |
| "grad_norm": 1.7265625, | |
| "learning_rate": 5.7e-05, | |
| "loss": 8.1795, | |
| "mean_token_accuracy": 0.05213871449232101, | |
| "num_tokens": 334988.0, | |
| "step": 115 | |
| }, | |
| { | |
| "entropy": 9.922878646850586, | |
| "epoch": 0.0037632891146862357, | |
| "grad_norm": 1.6796875, | |
| "learning_rate": 5.9499999999999996e-05, | |
| "loss": 8.0559, | |
| "mean_token_accuracy": 0.05347799621522427, | |
| "num_tokens": 349049.0, | |
| "step": 120 | |
| }, | |
| { | |
| "entropy": 9.7627742767334, | |
| "epoch": 0.0039200928277981625, | |
| "grad_norm": 1.765625, | |
| "learning_rate": 6.2e-05, | |
| "loss": 8.0302, | |
| "mean_token_accuracy": 0.05416244864463806, | |
| "num_tokens": 365497.0, | |
| "step": 125 | |
| }, | |
| { | |
| "entropy": 9.585789394378661, | |
| "epoch": 0.004076896540910088, | |
| "grad_norm": 1.5, | |
| "learning_rate": 6.450000000000001e-05, | |
| "loss": 7.8073, | |
| "mean_token_accuracy": 0.05755908451974392, | |
| "num_tokens": 380324.0, | |
| "step": 130 | |
| }, | |
| { | |
| "entropy": 9.368918418884277, | |
| "epoch": 0.004233700254022015, | |
| "grad_norm": 1.59375, | |
| "learning_rate": 6.7e-05, | |
| "loss": 7.6844, | |
| "mean_token_accuracy": 0.06051859185099602, | |
| "num_tokens": 393766.0, | |
| "step": 135 | |
| }, | |
| { | |
| "entropy": 9.158668899536133, | |
| "epoch": 0.004390503967133942, | |
| "grad_norm": 1.4296875, | |
| "learning_rate": 6.950000000000001e-05, | |
| "loss": 7.6272, | |
| "mean_token_accuracy": 0.06358711272478104, | |
| "num_tokens": 409369.0, | |
| "step": 140 | |
| }, | |
| { | |
| "entropy": 8.945510005950927, | |
| "epoch": 0.004547307680245868, | |
| "grad_norm": 1.546875, | |
| "learning_rate": 7.2e-05, | |
| "loss": 7.5019, | |
| "mean_token_accuracy": 0.06252376027405263, | |
| "num_tokens": 425475.0, | |
| "step": 145 | |
| }, | |
| { | |
| "entropy": 8.711659908294678, | |
| "epoch": 0.004704111393357795, | |
| "grad_norm": 1.59375, | |
| "learning_rate": 7.45e-05, | |
| "loss": 7.3832, | |
| "mean_token_accuracy": 0.06495344713330269, | |
| "num_tokens": 440853.0, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 8.498833179473877, | |
| "epoch": 0.0048609151064697214, | |
| "grad_norm": 1.609375, | |
| "learning_rate": 7.7e-05, | |
| "loss": 7.3471, | |
| "mean_token_accuracy": 0.06971911787986755, | |
| "num_tokens": 457407.0, | |
| "step": 155 | |
| }, | |
| { | |
| "entropy": 8.355002212524415, | |
| "epoch": 0.005017718819581647, | |
| "grad_norm": 1.09375, | |
| "learning_rate": 7.950000000000001e-05, | |
| "loss": 7.2971, | |
| "mean_token_accuracy": 0.06931432262063027, | |
| "num_tokens": 472813.0, | |
| "step": 160 | |
| }, | |
| { | |
| "entropy": 8.208080291748047, | |
| "epoch": 0.005174522532693574, | |
| "grad_norm": 1.5, | |
| "learning_rate": 8.2e-05, | |
| "loss": 7.3059, | |
| "mean_token_accuracy": 0.06723905019462109, | |
| "num_tokens": 489742.0, | |
| "step": 165 | |
| }, | |
| { | |
| "entropy": 8.143133544921875, | |
| "epoch": 0.005331326245805501, | |
| "grad_norm": 1.4375, | |
| "learning_rate": 8.450000000000001e-05, | |
| "loss": 7.2399, | |
| "mean_token_accuracy": 0.06843472644686699, | |
| "num_tokens": 503493.0, | |
| "step": 170 | |
| }, | |
| { | |
| "entropy": 8.036779308319092, | |
| "epoch": 0.005488129958917427, | |
| "grad_norm": 1.1796875, | |
| "learning_rate": 8.7e-05, | |
| "loss": 7.1275, | |
| "mean_token_accuracy": 0.07654446959495545, | |
| "num_tokens": 520143.0, | |
| "step": 175 | |
| }, | |
| { | |
| "entropy": 7.934807920455933, | |
| "epoch": 0.005644933672029354, | |
| "grad_norm": 1.3203125, | |
| "learning_rate": 8.95e-05, | |
| "loss": 7.232, | |
| "mean_token_accuracy": 0.06283588744699956, | |
| "num_tokens": 534776.0, | |
| "step": 180 | |
| }, | |
| { | |
| "entropy": 7.953633880615234, | |
| "epoch": 0.00580173738514128, | |
| "grad_norm": 1.3359375, | |
| "learning_rate": 9.2e-05, | |
| "loss": 7.2097, | |
| "mean_token_accuracy": 0.06803618557751179, | |
| "num_tokens": 550256.0, | |
| "step": 185 | |
| }, | |
| { | |
| "entropy": 7.894899654388428, | |
| "epoch": 0.005958541098253206, | |
| "grad_norm": 1.1796875, | |
| "learning_rate": 9.45e-05, | |
| "loss": 7.2178, | |
| "mean_token_accuracy": 0.0686919379979372, | |
| "num_tokens": 564797.0, | |
| "step": 190 | |
| }, | |
| { | |
| "entropy": 7.844494724273682, | |
| "epoch": 0.006115344811365133, | |
| "grad_norm": 1.1953125, | |
| "learning_rate": 9.7e-05, | |
| "loss": 6.9952, | |
| "mean_token_accuracy": 0.0732124924659729, | |
| "num_tokens": 579721.0, | |
| "step": 195 | |
| }, | |
| { | |
| "entropy": 7.716418170928955, | |
| "epoch": 0.00627214852447706, | |
| "grad_norm": 1.359375, | |
| "learning_rate": 9.95e-05, | |
| "loss": 6.9564, | |
| "mean_token_accuracy": 0.07807120829820632, | |
| "num_tokens": 593431.0, | |
| "step": 200 | |
| }, | |
| { | |
| "entropy": 7.715715551376343, | |
| "epoch": 0.006428952237588986, | |
| "grad_norm": 1.6796875, | |
| "learning_rate": 0.000102, | |
| "loss": 6.9708, | |
| "mean_token_accuracy": 0.07868832051753998, | |
| "num_tokens": 608176.0, | |
| "step": 205 | |
| }, | |
| { | |
| "entropy": 7.692095470428467, | |
| "epoch": 0.0065857559507009125, | |
| "grad_norm": 1.40625, | |
| "learning_rate": 0.00010449999999999999, | |
| "loss": 6.9833, | |
| "mean_token_accuracy": 0.07725078389048576, | |
| "num_tokens": 621784.0, | |
| "step": 210 | |
| }, | |
| { | |
| "entropy": 7.700586032867432, | |
| "epoch": 0.006742559663812839, | |
| "grad_norm": 1.421875, | |
| "learning_rate": 0.000107, | |
| "loss": 6.9716, | |
| "mean_token_accuracy": 0.07797399312257766, | |
| "num_tokens": 634707.0, | |
| "step": 215 | |
| }, | |
| { | |
| "entropy": 7.623541641235351, | |
| "epoch": 0.006899363376924765, | |
| "grad_norm": 1.359375, | |
| "learning_rate": 0.0001095, | |
| "loss": 7.0494, | |
| "mean_token_accuracy": 0.0720802016556263, | |
| "num_tokens": 647835.0, | |
| "step": 220 | |
| }, | |
| { | |
| "entropy": 7.631550598144531, | |
| "epoch": 0.007056167090036692, | |
| "grad_norm": 1.3125, | |
| "learning_rate": 0.000112, | |
| "loss": 6.9591, | |
| "mean_token_accuracy": 0.07618656158447265, | |
| "num_tokens": 662587.0, | |
| "step": 225 | |
| }, | |
| { | |
| "entropy": 7.684398460388183, | |
| "epoch": 0.007212970803148619, | |
| "grad_norm": 1.3828125, | |
| "learning_rate": 0.0001145, | |
| "loss": 7.0602, | |
| "mean_token_accuracy": 0.07651265673339366, | |
| "num_tokens": 676329.0, | |
| "step": 230 | |
| }, | |
| { | |
| "entropy": 7.561251878738403, | |
| "epoch": 0.007369774516260545, | |
| "grad_norm": 1.3203125, | |
| "learning_rate": 0.00011700000000000001, | |
| "loss": 6.953, | |
| "mean_token_accuracy": 0.08274711072444915, | |
| "num_tokens": 692541.0, | |
| "step": 235 | |
| }, | |
| { | |
| "entropy": 7.560929489135742, | |
| "epoch": 0.0075265782293724715, | |
| "grad_norm": 1.1953125, | |
| "learning_rate": 0.00011949999999999999, | |
| "loss": 7.0198, | |
| "mean_token_accuracy": 0.07723658978939056, | |
| "num_tokens": 706997.0, | |
| "step": 240 | |
| }, | |
| { | |
| "entropy": 7.557625770568848, | |
| "epoch": 0.007683381942484398, | |
| "grad_norm": 1.3359375, | |
| "learning_rate": 0.000122, | |
| "loss": 6.9217, | |
| "mean_token_accuracy": 0.08156572207808495, | |
| "num_tokens": 720719.0, | |
| "step": 245 | |
| }, | |
| { | |
| "entropy": 7.592370510101318, | |
| "epoch": 0.007840185655596325, | |
| "grad_norm": 1.40625, | |
| "learning_rate": 0.0001245, | |
| "loss": 7.0018, | |
| "mean_token_accuracy": 0.08049147836863994, | |
| "num_tokens": 734572.0, | |
| "step": 250 | |
| }, | |
| { | |
| "entropy": 7.522368669509888, | |
| "epoch": 0.007996989368708251, | |
| "grad_norm": 1.2734375, | |
| "learning_rate": 0.000127, | |
| "loss": 6.8688, | |
| "mean_token_accuracy": 0.08029020316898823, | |
| "num_tokens": 751365.0, | |
| "step": 255 | |
| }, | |
| { | |
| "entropy": 7.458198308944702, | |
| "epoch": 0.008153793081820177, | |
| "grad_norm": 1.375, | |
| "learning_rate": 0.0001295, | |
| "loss": 6.8057, | |
| "mean_token_accuracy": 0.08540241345763207, | |
| "num_tokens": 765549.0, | |
| "step": 260 | |
| }, | |
| { | |
| "entropy": 7.365204620361328, | |
| "epoch": 0.008310596794932104, | |
| "grad_norm": 1.1796875, | |
| "learning_rate": 0.000132, | |
| "loss": 6.7974, | |
| "mean_token_accuracy": 0.0849799670279026, | |
| "num_tokens": 780071.0, | |
| "step": 265 | |
| }, | |
| { | |
| "entropy": 7.453489208221436, | |
| "epoch": 0.00846740050804403, | |
| "grad_norm": 1.3125, | |
| "learning_rate": 0.00013450000000000002, | |
| "loss": 6.8488, | |
| "mean_token_accuracy": 0.08373216427862644, | |
| "num_tokens": 795328.0, | |
| "step": 270 | |
| }, | |
| { | |
| "entropy": 7.333805704116822, | |
| "epoch": 0.008624204221155956, | |
| "grad_norm": 1.2890625, | |
| "learning_rate": 0.00013700000000000002, | |
| "loss": 6.759, | |
| "mean_token_accuracy": 0.09399082660675048, | |
| "num_tokens": 808404.0, | |
| "step": 275 | |
| }, | |
| { | |
| "entropy": 7.400871515274048, | |
| "epoch": 0.008781007934267884, | |
| "grad_norm": 1.4296875, | |
| "learning_rate": 0.0001395, | |
| "loss": 6.857, | |
| "mean_token_accuracy": 0.08847371190786361, | |
| "num_tokens": 823204.0, | |
| "step": 280 | |
| }, | |
| { | |
| "entropy": 7.292252063751221, | |
| "epoch": 0.00893781164737981, | |
| "grad_norm": 1.5, | |
| "learning_rate": 0.00014199999999999998, | |
| "loss": 6.7636, | |
| "mean_token_accuracy": 0.08776607438921928, | |
| "num_tokens": 836276.0, | |
| "step": 285 | |
| }, | |
| { | |
| "entropy": 7.366798543930054, | |
| "epoch": 0.009094615360491736, | |
| "grad_norm": 1.4296875, | |
| "learning_rate": 0.0001445, | |
| "loss": 6.7562, | |
| "mean_token_accuracy": 0.09157689064741134, | |
| "num_tokens": 850090.0, | |
| "step": 290 | |
| }, | |
| { | |
| "entropy": 7.297074222564698, | |
| "epoch": 0.009251419073603663, | |
| "grad_norm": 1.2890625, | |
| "learning_rate": 0.000147, | |
| "loss": 6.7845, | |
| "mean_token_accuracy": 0.08689201548695565, | |
| "num_tokens": 865931.0, | |
| "step": 295 | |
| }, | |
| { | |
| "entropy": 7.316424083709717, | |
| "epoch": 0.00940822278671559, | |
| "grad_norm": 1.390625, | |
| "learning_rate": 0.0001495, | |
| "loss": 6.7825, | |
| "mean_token_accuracy": 0.08415777459740639, | |
| "num_tokens": 879960.0, | |
| "step": 300 | |
| }, | |
| { | |
| "entropy": 7.245685482025147, | |
| "epoch": 0.009565026499827515, | |
| "grad_norm": 1.125, | |
| "learning_rate": 0.000152, | |
| "loss": 6.7297, | |
| "mean_token_accuracy": 0.08968461528420449, | |
| "num_tokens": 894711.0, | |
| "step": 305 | |
| }, | |
| { | |
| "entropy": 7.20286979675293, | |
| "epoch": 0.009721830212939443, | |
| "grad_norm": 1.28125, | |
| "learning_rate": 0.00015450000000000001, | |
| "loss": 6.6488, | |
| "mean_token_accuracy": 0.08769082948565483, | |
| "num_tokens": 911461.0, | |
| "step": 310 | |
| }, | |
| { | |
| "entropy": 7.2604657173156735, | |
| "epoch": 0.009878633926051369, | |
| "grad_norm": 1.515625, | |
| "learning_rate": 0.000157, | |
| "loss": 6.8178, | |
| "mean_token_accuracy": 0.08734595999121667, | |
| "num_tokens": 926618.0, | |
| "step": 315 | |
| }, | |
| { | |
| "entropy": 7.233215236663819, | |
| "epoch": 0.010035437639163295, | |
| "grad_norm": 1.3515625, | |
| "learning_rate": 0.0001595, | |
| "loss": 6.7365, | |
| "mean_token_accuracy": 0.09149369075894356, | |
| "num_tokens": 942310.0, | |
| "step": 320 | |
| }, | |
| { | |
| "entropy": 7.098740816116333, | |
| "epoch": 0.010192241352275222, | |
| "grad_norm": 1.1953125, | |
| "learning_rate": 0.000162, | |
| "loss": 6.638, | |
| "mean_token_accuracy": 0.09136478006839752, | |
| "num_tokens": 958180.0, | |
| "step": 325 | |
| }, | |
| { | |
| "entropy": 7.278954648971558, | |
| "epoch": 0.010349045065387148, | |
| "grad_norm": 1.2265625, | |
| "learning_rate": 0.00016450000000000001, | |
| "loss": 6.7407, | |
| "mean_token_accuracy": 0.08464238122105598, | |
| "num_tokens": 973484.0, | |
| "step": 330 | |
| }, | |
| { | |
| "entropy": 7.1389687061309814, | |
| "epoch": 0.010505848778499074, | |
| "grad_norm": 1.1328125, | |
| "learning_rate": 0.00016700000000000002, | |
| "loss": 6.5988, | |
| "mean_token_accuracy": 0.09544083774089814, | |
| "num_tokens": 988712.0, | |
| "step": 335 | |
| }, | |
| { | |
| "entropy": 7.1739630699157715, | |
| "epoch": 0.010662652491611002, | |
| "grad_norm": 1.203125, | |
| "learning_rate": 0.00016950000000000003, | |
| "loss": 6.6637, | |
| "mean_token_accuracy": 0.0873688019812107, | |
| "num_tokens": 1005316.0, | |
| "step": 340 | |
| }, | |
| { | |
| "entropy": 7.009389734268188, | |
| "epoch": 0.010819456204722928, | |
| "grad_norm": 1.2734375, | |
| "learning_rate": 0.00017199999999999998, | |
| "loss": 6.5965, | |
| "mean_token_accuracy": 0.09233827069401741, | |
| "num_tokens": 1020624.0, | |
| "step": 345 | |
| }, | |
| { | |
| "entropy": 7.205262613296509, | |
| "epoch": 0.010976259917834854, | |
| "grad_norm": 1.3828125, | |
| "learning_rate": 0.00017449999999999999, | |
| "loss": 6.6497, | |
| "mean_token_accuracy": 0.09442537128925324, | |
| "num_tokens": 1035346.0, | |
| "step": 350 | |
| }, | |
| { | |
| "entropy": 7.131465578079224, | |
| "epoch": 0.011133063630946781, | |
| "grad_norm": 1.5, | |
| "learning_rate": 0.000177, | |
| "loss": 6.6518, | |
| "mean_token_accuracy": 0.08939319550991058, | |
| "num_tokens": 1052396.0, | |
| "step": 355 | |
| }, | |
| { | |
| "entropy": 7.066566705703735, | |
| "epoch": 0.011289867344058707, | |
| "grad_norm": 1.21875, | |
| "learning_rate": 0.0001795, | |
| "loss": 6.6706, | |
| "mean_token_accuracy": 0.08813088536262512, | |
| "num_tokens": 1068158.0, | |
| "step": 360 | |
| }, | |
| { | |
| "entropy": 7.096987533569336, | |
| "epoch": 0.011446671057170633, | |
| "grad_norm": 1.21875, | |
| "learning_rate": 0.000182, | |
| "loss": 6.532, | |
| "mean_token_accuracy": 0.10468010231852531, | |
| "num_tokens": 1081891.0, | |
| "step": 365 | |
| }, | |
| { | |
| "entropy": 6.936192178726197, | |
| "epoch": 0.01160347477028256, | |
| "grad_norm": 1.390625, | |
| "learning_rate": 0.0001845, | |
| "loss": 6.4988, | |
| "mean_token_accuracy": 0.10371973067522049, | |
| "num_tokens": 1094953.0, | |
| "step": 370 | |
| }, | |
| { | |
| "entropy": 6.988458728790283, | |
| "epoch": 0.011760278483394487, | |
| "grad_norm": 1.375, | |
| "learning_rate": 0.000187, | |
| "loss": 6.4762, | |
| "mean_token_accuracy": 0.09902411252260208, | |
| "num_tokens": 1109923.0, | |
| "step": 375 | |
| }, | |
| { | |
| "entropy": 7.017359066009521, | |
| "epoch": 0.011917082196506413, | |
| "grad_norm": 1.265625, | |
| "learning_rate": 0.0001895, | |
| "loss": 6.5871, | |
| "mean_token_accuracy": 0.09580302238464355, | |
| "num_tokens": 1126987.0, | |
| "step": 380 | |
| }, | |
| { | |
| "entropy": 6.971819591522217, | |
| "epoch": 0.01207388590961834, | |
| "grad_norm": 1.3671875, | |
| "learning_rate": 0.000192, | |
| "loss": 6.5812, | |
| "mean_token_accuracy": 0.09617941230535507, | |
| "num_tokens": 1139931.0, | |
| "step": 385 | |
| }, | |
| { | |
| "entropy": 6.953200578689575, | |
| "epoch": 0.012230689622730266, | |
| "grad_norm": 1.3203125, | |
| "learning_rate": 0.0001945, | |
| "loss": 6.4646, | |
| "mean_token_accuracy": 0.10358070284128189, | |
| "num_tokens": 1155721.0, | |
| "step": 390 | |
| }, | |
| { | |
| "entropy": 6.9849913120269775, | |
| "epoch": 0.012387493335842192, | |
| "grad_norm": 1.1484375, | |
| "learning_rate": 0.00019700000000000002, | |
| "loss": 6.5469, | |
| "mean_token_accuracy": 0.10082540512084961, | |
| "num_tokens": 1171655.0, | |
| "step": 395 | |
| }, | |
| { | |
| "entropy": 6.938650178909302, | |
| "epoch": 0.01254429704895412, | |
| "grad_norm": 1.171875, | |
| "learning_rate": 0.00019950000000000002, | |
| "loss": 6.5281, | |
| "mean_token_accuracy": 0.10091597810387612, | |
| "num_tokens": 1186666.0, | |
| "step": 400 | |
| }, | |
| { | |
| "entropy": 6.9116593360900875, | |
| "epoch": 0.012701100762066046, | |
| "grad_norm": 1.46875, | |
| "learning_rate": 0.000202, | |
| "loss": 6.4346, | |
| "mean_token_accuracy": 0.09778324812650681, | |
| "num_tokens": 1198283.0, | |
| "step": 405 | |
| }, | |
| { | |
| "entropy": 6.876869249343872, | |
| "epoch": 0.012857904475177971, | |
| "grad_norm": 1.2734375, | |
| "learning_rate": 0.00020449999999999998, | |
| "loss": 6.4735, | |
| "mean_token_accuracy": 0.09719930961728096, | |
| "num_tokens": 1212613.0, | |
| "step": 410 | |
| }, | |
| { | |
| "entropy": 6.932867479324341, | |
| "epoch": 0.013014708188289899, | |
| "grad_norm": 1.6171875, | |
| "learning_rate": 0.000207, | |
| "loss": 6.4643, | |
| "mean_token_accuracy": 0.10083647891879081, | |
| "num_tokens": 1227515.0, | |
| "step": 415 | |
| }, | |
| { | |
| "entropy": 6.873914337158203, | |
| "epoch": 0.013171511901401825, | |
| "grad_norm": 1.40625, | |
| "learning_rate": 0.0002095, | |
| "loss": 6.4762, | |
| "mean_token_accuracy": 0.1099552720785141, | |
| "num_tokens": 1239022.0, | |
| "step": 420 | |
| }, | |
| { | |
| "entropy": 6.844020032882691, | |
| "epoch": 0.013328315614513751, | |
| "grad_norm": 1.1875, | |
| "learning_rate": 0.000212, | |
| "loss": 6.4853, | |
| "mean_token_accuracy": 0.09865991845726967, | |
| "num_tokens": 1254653.0, | |
| "step": 425 | |
| }, | |
| { | |
| "entropy": 6.919657754898071, | |
| "epoch": 0.013485119327625679, | |
| "grad_norm": 1.1875, | |
| "learning_rate": 0.0002145, | |
| "loss": 6.4894, | |
| "mean_token_accuracy": 0.09527975097298622, | |
| "num_tokens": 1270766.0, | |
| "step": 430 | |
| }, | |
| { | |
| "entropy": 6.905207824707031, | |
| "epoch": 0.013641923040737605, | |
| "grad_norm": 1.25, | |
| "learning_rate": 0.00021700000000000002, | |
| "loss": 6.4774, | |
| "mean_token_accuracy": 0.10371477827429772, | |
| "num_tokens": 1284742.0, | |
| "step": 435 | |
| }, | |
| { | |
| "entropy": 6.912538671493531, | |
| "epoch": 0.01379872675384953, | |
| "grad_norm": 1.234375, | |
| "learning_rate": 0.0002195, | |
| "loss": 6.4678, | |
| "mean_token_accuracy": 0.10031345337629319, | |
| "num_tokens": 1297881.0, | |
| "step": 440 | |
| }, | |
| { | |
| "entropy": 6.800807285308838, | |
| "epoch": 0.013955530466961458, | |
| "grad_norm": 1.09375, | |
| "learning_rate": 0.000222, | |
| "loss": 6.4071, | |
| "mean_token_accuracy": 0.10895167514681817, | |
| "num_tokens": 1314727.0, | |
| "step": 445 | |
| }, | |
| { | |
| "entropy": 6.85034818649292, | |
| "epoch": 0.014112334180073384, | |
| "grad_norm": 1.2421875, | |
| "learning_rate": 0.0002245, | |
| "loss": 6.4329, | |
| "mean_token_accuracy": 0.10191441029310226, | |
| "num_tokens": 1332630.0, | |
| "step": 450 | |
| }, | |
| { | |
| "entropy": 6.820253705978393, | |
| "epoch": 0.01426913789318531, | |
| "grad_norm": 1.1015625, | |
| "learning_rate": 0.00022700000000000002, | |
| "loss": 6.5253, | |
| "mean_token_accuracy": 0.09508129432797433, | |
| "num_tokens": 1348028.0, | |
| "step": 455 | |
| }, | |
| { | |
| "entropy": 6.8252214908599855, | |
| "epoch": 0.014425941606297238, | |
| "grad_norm": 1.2265625, | |
| "learning_rate": 0.00022950000000000002, | |
| "loss": 6.3729, | |
| "mean_token_accuracy": 0.10276357978582382, | |
| "num_tokens": 1363723.0, | |
| "step": 460 | |
| }, | |
| { | |
| "entropy": 6.869743585586548, | |
| "epoch": 0.014582745319409163, | |
| "grad_norm": 1.625, | |
| "learning_rate": 0.00023200000000000003, | |
| "loss": 6.4717, | |
| "mean_token_accuracy": 0.10454175770282745, | |
| "num_tokens": 1378400.0, | |
| "step": 465 | |
| }, | |
| { | |
| "entropy": 6.816213941574096, | |
| "epoch": 0.01473954903252109, | |
| "grad_norm": 1.21875, | |
| "learning_rate": 0.00023449999999999998, | |
| "loss": 6.3712, | |
| "mean_token_accuracy": 0.10962107256054879, | |
| "num_tokens": 1393383.0, | |
| "step": 470 | |
| }, | |
| { | |
| "entropy": 6.703394031524658, | |
| "epoch": 0.014896352745633017, | |
| "grad_norm": 1.3515625, | |
| "learning_rate": 0.000237, | |
| "loss": 6.3905, | |
| "mean_token_accuracy": 0.10753661692142487, | |
| "num_tokens": 1409609.0, | |
| "step": 475 | |
| }, | |
| { | |
| "entropy": 6.746933174133301, | |
| "epoch": 0.015053156458744943, | |
| "grad_norm": 1.28125, | |
| "learning_rate": 0.0002395, | |
| "loss": 6.3711, | |
| "mean_token_accuracy": 0.109779604524374, | |
| "num_tokens": 1423378.0, | |
| "step": 480 | |
| }, | |
| { | |
| "entropy": 6.657280206680298, | |
| "epoch": 0.015209960171856869, | |
| "grad_norm": 1.28125, | |
| "learning_rate": 0.000242, | |
| "loss": 6.3545, | |
| "mean_token_accuracy": 0.10648095905780793, | |
| "num_tokens": 1437722.0, | |
| "step": 485 | |
| }, | |
| { | |
| "entropy": 6.752739667892456, | |
| "epoch": 0.015366763884968796, | |
| "grad_norm": 1.203125, | |
| "learning_rate": 0.0002445, | |
| "loss": 6.4004, | |
| "mean_token_accuracy": 0.10294785127043724, | |
| "num_tokens": 1452969.0, | |
| "step": 490 | |
| }, | |
| { | |
| "entropy": 6.7490668296813965, | |
| "epoch": 0.015523567598080722, | |
| "grad_norm": 1.3515625, | |
| "learning_rate": 0.000247, | |
| "loss": 6.406, | |
| "mean_token_accuracy": 0.10591119825839997, | |
| "num_tokens": 1466014.0, | |
| "step": 495 | |
| }, | |
| { | |
| "entropy": 6.7571159362792965, | |
| "epoch": 0.01568037131119265, | |
| "grad_norm": 1.3671875, | |
| "learning_rate": 0.0002495, | |
| "loss": 6.4293, | |
| "mean_token_accuracy": 0.1040202483534813, | |
| "num_tokens": 1482087.0, | |
| "step": 500 | |
| } | |
| ], | |
| "logging_steps": 5, | |
| "max_steps": 4000, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 1, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 2615647555584000.0, | |
| "train_batch_size": 16, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |