Text Generation
PEFT
Safetensors
English
coreference-resolution
ner
entity-extraction
qwen3
lora
conversational
Instructions to use wjbmattingly/Qwen3-8B-Coref-NER with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use wjbmattingly/Qwen3-8B-Coref-NER with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen3-8B") model = PeftModel.from_pretrained(base_model, "wjbmattingly/Qwen3-8B-Coref-NER") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 1.6113796950539234, | |
| "eval_steps": 500, | |
| "global_step": 6500, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 0.9991093099117279, | |
| "epoch": 0.024792363951902815, | |
| "grad_norm": 0.7828091382980347, | |
| "learning_rate": 0.00019800000000000002, | |
| "loss": 1.2105257415771484, | |
| "mean_token_accuracy": 0.7592608261108399, | |
| "num_tokens": 428432.0, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 0.4560545237362385, | |
| "epoch": 0.04958472790380563, | |
| "grad_norm": 0.6142551898956299, | |
| "learning_rate": 0.00019996642557446167, | |
| "loss": 0.4457200241088867, | |
| "mean_token_accuracy": 0.9013872227072716, | |
| "num_tokens": 860175.0, | |
| "step": 200 | |
| }, | |
| { | |
| "entropy": 0.2749050757288933, | |
| "epoch": 0.07437709185570844, | |
| "grad_norm": 0.5504621267318726, | |
| "learning_rate": 0.0001998643654103928, | |
| "loss": 0.26112810134887693, | |
| "mean_token_accuracy": 0.9401605477929116, | |
| "num_tokens": 1288393.0, | |
| "step": 300 | |
| }, | |
| { | |
| "entropy": 0.18620084561407566, | |
| "epoch": 0.09916945580761126, | |
| "grad_norm": 0.49035999178886414, | |
| "learning_rate": 0.00019969388600561932, | |
| "loss": 0.168951416015625, | |
| "mean_token_accuracy": 0.9586734220385551, | |
| "num_tokens": 1697950.0, | |
| "step": 400 | |
| }, | |
| { | |
| "entropy": 0.13362589346244932, | |
| "epoch": 0.12396181975951406, | |
| "grad_norm": 0.332853227853775, | |
| "learning_rate": 0.00019945510415927565, | |
| "loss": 0.1165453052520752, | |
| "mean_token_accuracy": 0.9707631063461304, | |
| "num_tokens": 2121801.0, | |
| "step": 500 | |
| }, | |
| { | |
| "entropy": 0.114101482629776, | |
| "epoch": 0.14875418371141688, | |
| "grad_norm": 0.25856056809425354, | |
| "learning_rate": 0.00019914818346597883, | |
| "loss": 0.09927322387695313, | |
| "mean_token_accuracy": 0.9743164613842964, | |
| "num_tokens": 2557586.0, | |
| "step": 600 | |
| }, | |
| { | |
| "entropy": 0.11320277975872159, | |
| "epoch": 0.1735465476633197, | |
| "grad_norm": 0.20196805894374847, | |
| "learning_rate": 0.00019877333420374656, | |
| "loss": 0.09849776268005371, | |
| "mean_token_accuracy": 0.974927342236042, | |
| "num_tokens": 2987323.0, | |
| "step": 700 | |
| }, | |
| { | |
| "entropy": 0.10322847299277782, | |
| "epoch": 0.19833891161522252, | |
| "grad_norm": 0.2440531700849533, | |
| "learning_rate": 0.00019833081318993095, | |
| "loss": 0.09059928894042969, | |
| "mean_token_accuracy": 0.9767567777633667, | |
| "num_tokens": 3409712.0, | |
| "step": 800 | |
| }, | |
| { | |
| "entropy": 0.09775902647525073, | |
| "epoch": 0.22313127556712534, | |
| "grad_norm": 0.3308379054069519, | |
| "learning_rate": 0.00019782092360526762, | |
| "loss": 0.08334708213806152, | |
| "mean_token_accuracy": 0.9783057284355163, | |
| "num_tokens": 3841892.0, | |
| "step": 900 | |
| }, | |
| { | |
| "entropy": 0.09744730332866311, | |
| "epoch": 0.24792363951902813, | |
| "grad_norm": 0.2839490473270416, | |
| "learning_rate": 0.00019724401478615975, | |
| "loss": 0.08426895141601562, | |
| "mean_token_accuracy": 0.9779949200153351, | |
| "num_tokens": 4270558.0, | |
| "step": 1000 | |
| }, | |
| { | |
| "entropy": 0.09355678971856833, | |
| "epoch": 0.27271600347093095, | |
| "grad_norm": 0.22099336981773376, | |
| "learning_rate": 0.00019660048198534043, | |
| "loss": 0.07872037887573242, | |
| "mean_token_accuracy": 0.9789282914996147, | |
| "num_tokens": 4692785.0, | |
| "step": 1100 | |
| }, | |
| { | |
| "entropy": 0.08774024970829487, | |
| "epoch": 0.29750836742283376, | |
| "grad_norm": 0.25038641691207886, | |
| "learning_rate": 0.00019589076610107613, | |
| "loss": 0.07532472610473633, | |
| "mean_token_accuracy": 0.9797207751870155, | |
| "num_tokens": 5123896.0, | |
| "step": 1200 | |
| }, | |
| { | |
| "entropy": 0.0822139031253755, | |
| "epoch": 0.3223007313747366, | |
| "grad_norm": 0.1757524311542511, | |
| "learning_rate": 0.0001951153533750981, | |
| "loss": 0.0712879753112793, | |
| "mean_token_accuracy": 0.9809118565917015, | |
| "num_tokens": 5558585.0, | |
| "step": 1300 | |
| }, | |
| { | |
| "entropy": 0.08247557899914681, | |
| "epoch": 0.3470930953266394, | |
| "grad_norm": 0.3174690902233124, | |
| "learning_rate": 0.00019427477505946724, | |
| "loss": 0.07155597686767579, | |
| "mean_token_accuracy": 0.9806134033203125, | |
| "num_tokens": 5993135.0, | |
| "step": 1400 | |
| }, | |
| { | |
| "entropy": 0.07734406786970795, | |
| "epoch": 0.3718854592785422, | |
| "grad_norm": 0.20085565745830536, | |
| "learning_rate": 0.00019336960705260218, | |
| "loss": 0.06758695125579833, | |
| "mean_token_accuracy": 0.9812126770615578, | |
| "num_tokens": 6422291.0, | |
| "step": 1500 | |
| }, | |
| { | |
| "entropy": 0.07385200836695731, | |
| "epoch": 0.39667782323044504, | |
| "grad_norm": 0.23364907503128052, | |
| "learning_rate": 0.00019240046950471843, | |
| "loss": 0.06287895202636719, | |
| "mean_token_accuracy": 0.9826329717040062, | |
| "num_tokens": 6859860.0, | |
| "step": 1600 | |
| }, | |
| { | |
| "entropy": 0.07059250806458295, | |
| "epoch": 0.42147018718234786, | |
| "grad_norm": 0.23875373601913452, | |
| "learning_rate": 0.00019136802639295038, | |
| "loss": 0.06304484367370605, | |
| "mean_token_accuracy": 0.9824053046107292, | |
| "num_tokens": 7290073.0, | |
| "step": 1700 | |
| }, | |
| { | |
| "entropy": 0.06737875854596495, | |
| "epoch": 0.4462625511342507, | |
| "grad_norm": 0.3208062946796417, | |
| "learning_rate": 0.00019027298506644585, | |
| "loss": 0.059958081245422366, | |
| "mean_token_accuracy": 0.9828743213415145, | |
| "num_tokens": 7725201.0, | |
| "step": 1800 | |
| }, | |
| { | |
| "entropy": 0.06706910256296396, | |
| "epoch": 0.4710549150861535, | |
| "grad_norm": 0.21684925258159637, | |
| "learning_rate": 0.0001891160957617461, | |
| "loss": 0.058564453125, | |
| "mean_token_accuracy": 0.9831320327520371, | |
| "num_tokens": 8158313.0, | |
| "step": 1900 | |
| }, | |
| { | |
| "entropy": 0.06947937468066812, | |
| "epoch": 0.49584727903805625, | |
| "grad_norm": 0.18770049512386322, | |
| "learning_rate": 0.00018789815108878247, | |
| "loss": 0.06172544956207275, | |
| "mean_token_accuracy": 0.9823081752657891, | |
| "num_tokens": 8578452.0, | |
| "step": 2000 | |
| }, | |
| { | |
| "entropy": 0.06397987404838204, | |
| "epoch": 0.5206396429899591, | |
| "grad_norm": 0.3015916347503662, | |
| "learning_rate": 0.00018661998548784206, | |
| "loss": 0.05666701316833496, | |
| "mean_token_accuracy": 0.9837381663918495, | |
| "num_tokens": 9008577.0, | |
| "step": 2100 | |
| }, | |
| { | |
| "entropy": 0.06192670753225684, | |
| "epoch": 0.5454320069418619, | |
| "grad_norm": 0.14773066341876984, | |
| "learning_rate": 0.00018528247465787458, | |
| "loss": 0.05475767612457275, | |
| "mean_token_accuracy": 0.9839018094539642, | |
| "num_tokens": 9442416.0, | |
| "step": 2200 | |
| }, | |
| { | |
| "entropy": 0.057383716171607375, | |
| "epoch": 0.5702243708937648, | |
| "grad_norm": 0.2786010503768921, | |
| "learning_rate": 0.00018388653495653227, | |
| "loss": 0.05079104423522949, | |
| "mean_token_accuracy": 0.9851340425014495, | |
| "num_tokens": 9866601.0, | |
| "step": 2300 | |
| }, | |
| { | |
| "entropy": 0.061573395412415265, | |
| "epoch": 0.5950167348456675, | |
| "grad_norm": 0.2154165506362915, | |
| "learning_rate": 0.00018243312277235307, | |
| "loss": 0.052988133430480956, | |
| "mean_token_accuracy": 0.9846190690994263, | |
| "num_tokens": 10287014.0, | |
| "step": 2400 | |
| }, | |
| { | |
| "entropy": 0.061048444965854286, | |
| "epoch": 0.6198090987975704, | |
| "grad_norm": 0.23032571375370026, | |
| "learning_rate": 0.00018092323386951844, | |
| "loss": 0.05165313720703125, | |
| "mean_token_accuracy": 0.9843217238783837, | |
| "num_tokens": 10717509.0, | |
| "step": 2500 | |
| }, | |
| { | |
| "entropy": 0.055967804118990896, | |
| "epoch": 0.6446014627494732, | |
| "grad_norm": 0.19078344106674194, | |
| "learning_rate": 0.00017935790270563344, | |
| "loss": 0.04785560607910156, | |
| "mean_token_accuracy": 0.9853029519319534, | |
| "num_tokens": 11157747.0, | |
| "step": 2600 | |
| }, | |
| { | |
| "entropy": 0.05705006473697722, | |
| "epoch": 0.6693938267013759, | |
| "grad_norm": 0.18230348825454712, | |
| "learning_rate": 0.0001777382017229977, | |
| "loss": 0.04942546844482422, | |
| "mean_token_accuracy": 0.9849184802174569, | |
| "num_tokens": 11593422.0, | |
| "step": 2700 | |
| }, | |
| { | |
| "entropy": 0.05708774453029036, | |
| "epoch": 0.6941861906532788, | |
| "grad_norm": 0.1923963725566864, | |
| "learning_rate": 0.00017606524061385167, | |
| "loss": 0.049316325187683106, | |
| "mean_token_accuracy": 0.9849100703001022, | |
| "num_tokens": 12015482.0, | |
| "step": 2800 | |
| }, | |
| { | |
| "entropy": 0.056122053125873206, | |
| "epoch": 0.7189785546051816, | |
| "grad_norm": 0.13828027248382568, | |
| "learning_rate": 0.00017434016556010264, | |
| "loss": 0.048600535392761234, | |
| "mean_token_accuracy": 0.9853047552704811, | |
| "num_tokens": 12444156.0, | |
| "step": 2900 | |
| }, | |
| { | |
| "entropy": 0.051999541874974964, | |
| "epoch": 0.7437709185570844, | |
| "grad_norm": 0.24286241829395294, | |
| "learning_rate": 0.00017256415844805063, | |
| "loss": 0.04440320014953613, | |
| "mean_token_accuracy": 0.9864806136488915, | |
| "num_tokens": 12876720.0, | |
| "step": 3000 | |
| }, | |
| { | |
| "entropy": 0.04768232893198729, | |
| "epoch": 0.7685632825089872, | |
| "grad_norm": 0.1362326294183731, | |
| "learning_rate": 0.00017073843605865243, | |
| "loss": 0.042284860610961914, | |
| "mean_token_accuracy": 0.9867907965183258, | |
| "num_tokens": 13316689.0, | |
| "step": 3100 | |
| }, | |
| { | |
| "entropy": 0.05134817799553275, | |
| "epoch": 0.7933556464608901, | |
| "grad_norm": 0.1539483368396759, | |
| "learning_rate": 0.00016886424923387859, | |
| "loss": 0.04517318725585937, | |
| "mean_token_accuracy": 0.9861972403526306, | |
| "num_tokens": 13745299.0, | |
| "step": 3200 | |
| }, | |
| { | |
| "entropy": 0.051489096255972984, | |
| "epoch": 0.8181480104127928, | |
| "grad_norm": 0.14677491784095764, | |
| "learning_rate": 0.00016694288201973457, | |
| "loss": 0.04445661067962647, | |
| "mean_token_accuracy": 0.9860166025161743, | |
| "num_tokens": 14174424.0, | |
| "step": 3300 | |
| }, | |
| { | |
| "entropy": 0.04676903900690377, | |
| "epoch": 0.8429403743646957, | |
| "grad_norm": 0.21468833088874817, | |
| "learning_rate": 0.0001649756507865328, | |
| "loss": 0.041012239456176755, | |
| "mean_token_accuracy": 0.987050573527813, | |
| "num_tokens": 14611781.0, | |
| "step": 3400 | |
| }, | |
| { | |
| "entropy": 0.0482857808098197, | |
| "epoch": 0.8677327383165985, | |
| "grad_norm": 0.14730653166770935, | |
| "learning_rate": 0.00016296390332701924, | |
| "loss": 0.04293826103210449, | |
| "mean_token_accuracy": 0.9866457509994507, | |
| "num_tokens": 15038473.0, | |
| "step": 3500 | |
| }, | |
| { | |
| "entropy": 0.04790851186960936, | |
| "epoch": 0.8925251022685013, | |
| "grad_norm": 0.2903175950050354, | |
| "learning_rate": 0.0001609090179329709, | |
| "loss": 0.041955056190490725, | |
| "mean_token_accuracy": 0.9864692252874374, | |
| "num_tokens": 15470046.0, | |
| "step": 3600 | |
| }, | |
| { | |
| "entropy": 0.048887748084962365, | |
| "epoch": 0.9173174662204041, | |
| "grad_norm": 0.18117748200893402, | |
| "learning_rate": 0.0001588124024508986, | |
| "loss": 0.04415608406066895, | |
| "mean_token_accuracy": 0.985989620089531, | |
| "num_tokens": 15892623.0, | |
| "step": 3700 | |
| }, | |
| { | |
| "entropy": 0.04632032319903374, | |
| "epoch": 0.942109830172307, | |
| "grad_norm": 0.16654178500175476, | |
| "learning_rate": 0.00015667549331750067, | |
| "loss": 0.042152628898620606, | |
| "mean_token_accuracy": 0.9865523239970208, | |
| "num_tokens": 16316100.0, | |
| "step": 3800 | |
| }, | |
| { | |
| "entropy": 0.044644428994506595, | |
| "epoch": 0.9669021941242097, | |
| "grad_norm": 0.2481166422367096, | |
| "learning_rate": 0.0001544997545755291, | |
| "loss": 0.04001152038574219, | |
| "mean_token_accuracy": 0.9875221633911133, | |
| "num_tokens": 16747053.0, | |
| "step": 3900 | |
| }, | |
| { | |
| "entropy": 0.04754056423902511, | |
| "epoch": 0.9916945580761125, | |
| "grad_norm": 0.12741857767105103, | |
| "learning_rate": 0.00015228667687074214, | |
| "loss": 0.04207493782043457, | |
| "mean_token_accuracy": 0.9866985288262368, | |
| "num_tokens": 17169662.0, | |
| "step": 4000 | |
| }, | |
| { | |
| "entropy": 0.04459555751302434, | |
| "epoch": 1.0163629602082558, | |
| "grad_norm": 0.09805303066968918, | |
| "learning_rate": 0.00015003777643063054, | |
| "loss": 0.03870807647705078, | |
| "mean_token_accuracy": 0.9877826987798489, | |
| "num_tokens": 17596478.0, | |
| "step": 4100 | |
| }, | |
| { | |
| "entropy": 0.0423293265234679, | |
| "epoch": 1.0411553241601588, | |
| "grad_norm": 0.15998226404190063, | |
| "learning_rate": 0.0001477545940256172, | |
| "loss": 0.03742676258087158, | |
| "mean_token_accuracy": 0.9879223209619522, | |
| "num_tokens": 18017906.0, | |
| "step": 4200 | |
| }, | |
| { | |
| "entropy": 0.03891188260167837, | |
| "epoch": 1.0659476881120615, | |
| "grad_norm": 0.1506214290857315, | |
| "learning_rate": 0.00014543869391344224, | |
| "loss": 0.03518922805786133, | |
| "mean_token_accuracy": 0.9887040394544602, | |
| "num_tokens": 18454216.0, | |
| "step": 4300 | |
| }, | |
| { | |
| "entropy": 0.04142872649244964, | |
| "epoch": 1.0907400520639643, | |
| "grad_norm": 0.1666085124015808, | |
| "learning_rate": 0.00014309166276745564, | |
| "loss": 0.03670289039611816, | |
| "mean_token_accuracy": 0.9879066833853721, | |
| "num_tokens": 18878519.0, | |
| "step": 4400 | |
| }, | |
| { | |
| "entropy": 0.03755377263762057, | |
| "epoch": 1.115532416015867, | |
| "grad_norm": 0.2086615115404129, | |
| "learning_rate": 0.00014071510858955336, | |
| "loss": 0.03333067655563354, | |
| "mean_token_accuracy": 0.989110766351223, | |
| "num_tokens": 19317824.0, | |
| "step": 4500 | |
| }, | |
| { | |
| "entropy": 0.04046432740055025, | |
| "epoch": 1.14032477996777, | |
| "grad_norm": 0.20940445363521576, | |
| "learning_rate": 0.00013831065960850038, | |
| "loss": 0.03586224794387818, | |
| "mean_token_accuracy": 0.9884641316533088, | |
| "num_tokens": 19745984.0, | |
| "step": 4600 | |
| }, | |
| { | |
| "entropy": 0.03863211246207356, | |
| "epoch": 1.1651171439196728, | |
| "grad_norm": 0.1907690167427063, | |
| "learning_rate": 0.0001358799631643955, | |
| "loss": 0.03435335397720337, | |
| "mean_token_accuracy": 0.9888206848502159, | |
| "num_tokens": 20180245.0, | |
| "step": 4700 | |
| }, | |
| { | |
| "entropy": 0.04046371933072805, | |
| "epoch": 1.1899095078715756, | |
| "grad_norm": 0.13110345602035522, | |
| "learning_rate": 0.00013342468458004347, | |
| "loss": 0.03644887685775757, | |
| "mean_token_accuracy": 0.9881230041384697, | |
| "num_tokens": 20606265.0, | |
| "step": 4800 | |
| }, | |
| { | |
| "entropy": 0.03736146904528141, | |
| "epoch": 1.2147018718234783, | |
| "grad_norm": 0.1462518870830536, | |
| "learning_rate": 0.00013094650602000582, | |
| "loss": 0.03372693538665771, | |
| "mean_token_accuracy": 0.9891441905498505, | |
| "num_tokens": 21044494.0, | |
| "step": 4900 | |
| }, | |
| { | |
| "entropy": 0.03839201644994319, | |
| "epoch": 1.239494235775381, | |
| "grad_norm": 0.11341901123523712, | |
| "learning_rate": 0.00012844712533811376, | |
| "loss": 0.03437334060668945, | |
| "mean_token_accuracy": 0.9888800847530365, | |
| "num_tokens": 21480042.0, | |
| "step": 5000 | |
| }, | |
| { | |
| "entropy": 0.037934175664559006, | |
| "epoch": 1.264286599727284, | |
| "grad_norm": 0.23413598537445068, | |
| "learning_rate": 0.0001259282549142315, | |
| "loss": 0.03376242399215698, | |
| "mean_token_accuracy": 0.9890937665104866, | |
| "num_tokens": 21912071.0, | |
| "step": 5100 | |
| }, | |
| { | |
| "entropy": 0.03757761628367007, | |
| "epoch": 1.2890789636791868, | |
| "grad_norm": 0.14774999022483826, | |
| "learning_rate": 0.0001233916204810679, | |
| "loss": 0.03416965961456299, | |
| "mean_token_accuracy": 0.9889910009503364, | |
| "num_tokens": 22335448.0, | |
| "step": 5200 | |
| }, | |
| { | |
| "entropy": 0.03822989201173186, | |
| "epoch": 1.3138713276310896, | |
| "grad_norm": 0.11656388640403748, | |
| "learning_rate": 0.00012083895994183948, | |
| "loss": 0.03509602785110474, | |
| "mean_token_accuracy": 0.9885432028770447, | |
| "num_tokens": 22756521.0, | |
| "step": 5300 | |
| }, | |
| { | |
| "entropy": 0.03775340311229229, | |
| "epoch": 1.3386636915829924, | |
| "grad_norm": 0.1481839120388031, | |
| "learning_rate": 0.00011827202217959523, | |
| "loss": 0.0340172815322876, | |
| "mean_token_accuracy": 0.9888760358095169, | |
| "num_tokens": 23181534.0, | |
| "step": 5400 | |
| }, | |
| { | |
| "entropy": 0.03720983518287539, | |
| "epoch": 1.3634560555348951, | |
| "grad_norm": 0.13698537647724152, | |
| "learning_rate": 0.00011569256585901918, | |
| "loss": 0.03371585130691528, | |
| "mean_token_accuracy": 0.9890251788496971, | |
| "num_tokens": 23613467.0, | |
| "step": 5500 | |
| }, | |
| { | |
| "entropy": 0.037667012261226776, | |
| "epoch": 1.3882484194867981, | |
| "grad_norm": 0.09335887432098389, | |
| "learning_rate": 0.00011310235822153073, | |
| "loss": 0.03394256591796875, | |
| "mean_token_accuracy": 0.9890615126490593, | |
| "num_tokens": 24039912.0, | |
| "step": 5600 | |
| }, | |
| { | |
| "entropy": 0.03788006491959095, | |
| "epoch": 1.4130407834387009, | |
| "grad_norm": 0.1678655594587326, | |
| "learning_rate": 0.0001105031738745096, | |
| "loss": 0.034035165309906, | |
| "mean_token_accuracy": 0.9887340119481087, | |
| "num_tokens": 24464996.0, | |
| "step": 5700 | |
| }, | |
| { | |
| "entropy": 0.03637797945179045, | |
| "epoch": 1.4378331473906036, | |
| "grad_norm": 0.17894072830677032, | |
| "learning_rate": 0.00010789679357547364, | |
| "loss": 0.03286903142929077, | |
| "mean_token_accuracy": 0.9891549465060234, | |
| "num_tokens": 24901092.0, | |
| "step": 5800 | |
| }, | |
| { | |
| "entropy": 0.03953015809878707, | |
| "epoch": 1.4626255113425066, | |
| "grad_norm": 0.1642547845840454, | |
| "learning_rate": 0.00010528500301204345, | |
| "loss": 0.03447899341583252, | |
| "mean_token_accuracy": 0.988511001765728, | |
| "num_tokens": 25320711.0, | |
| "step": 5900 | |
| }, | |
| { | |
| "entropy": 0.03696547055616975, | |
| "epoch": 1.4874178752944094, | |
| "grad_norm": 0.15598466992378235, | |
| "learning_rate": 0.0001026695915785289, | |
| "loss": 0.03327722549438476, | |
| "mean_token_accuracy": 0.9893461042642593, | |
| "num_tokens": 25750634.0, | |
| "step": 6000 | |
| }, | |
| { | |
| "entropy": 0.03747725712135434, | |
| "epoch": 1.5122102392463121, | |
| "grad_norm": 0.09570539742708206, | |
| "learning_rate": 0.00010005235114997651, | |
| "loss": 0.03426354885101318, | |
| "mean_token_accuracy": 0.9889142262935638, | |
| "num_tokens": 26175757.0, | |
| "step": 6100 | |
| }, | |
| { | |
| "entropy": 0.037917951373383406, | |
| "epoch": 1.537002603198215, | |
| "grad_norm": 0.2064983993768692, | |
| "learning_rate": 9.743507485451688e-05, | |
| "loss": 0.03446398973464966, | |
| "mean_token_accuracy": 0.9886316114664078, | |
| "num_tokens": 26601186.0, | |
| "step": 6200 | |
| }, | |
| { | |
| "entropy": 0.037627564212307334, | |
| "epoch": 1.5617949671501177, | |
| "grad_norm": 0.17442478239536285, | |
| "learning_rate": 9.48195558448538e-05, | |
| "loss": 0.0337642502784729, | |
| "mean_token_accuracy": 0.988581260740757, | |
| "num_tokens": 27028439.0, | |
| "step": 6300 | |
| }, | |
| { | |
| "entropy": 0.035229697693139314, | |
| "epoch": 1.5865873311020207, | |
| "grad_norm": 0.19224514067173004, | |
| "learning_rate": 9.220758606973652e-05, | |
| "loss": 0.03189241409301758, | |
| "mean_token_accuracy": 0.989690189063549, | |
| "num_tokens": 27461882.0, | |
| "step": 6400 | |
| }, | |
| { | |
| "entropy": 0.035260174684226514, | |
| "epoch": 1.6113796950539234, | |
| "grad_norm": 0.11715493351221085, | |
| "learning_rate": 8.960095504625676e-05, | |
| "loss": 0.032297356128692625, | |
| "mean_token_accuracy": 0.9895079037547112, | |
| "num_tokens": 27898972.0, | |
| "step": 6500 | |
| } | |
| ], | |
| "logging_steps": 100, | |
| "max_steps": 12102, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.8627923803091927e+18, | |
| "train_batch_size": 4, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |