Qwen3-8B-Coref-NER / trainer_state.json
wjbmattingly's picture
Upload folder using huggingface_hub
a2f094f verified
Raw
History Blame Contribute Delete
20.7 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.6113796950539234,
"eval_steps": 500,
"global_step": 6500,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 0.9991093099117279,
"epoch": 0.024792363951902815,
"grad_norm": 0.7828091382980347,
"learning_rate": 0.00019800000000000002,
"loss": 1.2105257415771484,
"mean_token_accuracy": 0.7592608261108399,
"num_tokens": 428432.0,
"step": 100
},
{
"entropy": 0.4560545237362385,
"epoch": 0.04958472790380563,
"grad_norm": 0.6142551898956299,
"learning_rate": 0.00019996642557446167,
"loss": 0.4457200241088867,
"mean_token_accuracy": 0.9013872227072716,
"num_tokens": 860175.0,
"step": 200
},
{
"entropy": 0.2749050757288933,
"epoch": 0.07437709185570844,
"grad_norm": 0.5504621267318726,
"learning_rate": 0.0001998643654103928,
"loss": 0.26112810134887693,
"mean_token_accuracy": 0.9401605477929116,
"num_tokens": 1288393.0,
"step": 300
},
{
"entropy": 0.18620084561407566,
"epoch": 0.09916945580761126,
"grad_norm": 0.49035999178886414,
"learning_rate": 0.00019969388600561932,
"loss": 0.168951416015625,
"mean_token_accuracy": 0.9586734220385551,
"num_tokens": 1697950.0,
"step": 400
},
{
"entropy": 0.13362589346244932,
"epoch": 0.12396181975951406,
"grad_norm": 0.332853227853775,
"learning_rate": 0.00019945510415927565,
"loss": 0.1165453052520752,
"mean_token_accuracy": 0.9707631063461304,
"num_tokens": 2121801.0,
"step": 500
},
{
"entropy": 0.114101482629776,
"epoch": 0.14875418371141688,
"grad_norm": 0.25856056809425354,
"learning_rate": 0.00019914818346597883,
"loss": 0.09927322387695313,
"mean_token_accuracy": 0.9743164613842964,
"num_tokens": 2557586.0,
"step": 600
},
{
"entropy": 0.11320277975872159,
"epoch": 0.1735465476633197,
"grad_norm": 0.20196805894374847,
"learning_rate": 0.00019877333420374656,
"loss": 0.09849776268005371,
"mean_token_accuracy": 0.974927342236042,
"num_tokens": 2987323.0,
"step": 700
},
{
"entropy": 0.10322847299277782,
"epoch": 0.19833891161522252,
"grad_norm": 0.2440531700849533,
"learning_rate": 0.00019833081318993095,
"loss": 0.09059928894042969,
"mean_token_accuracy": 0.9767567777633667,
"num_tokens": 3409712.0,
"step": 800
},
{
"entropy": 0.09775902647525073,
"epoch": 0.22313127556712534,
"grad_norm": 0.3308379054069519,
"learning_rate": 0.00019782092360526762,
"loss": 0.08334708213806152,
"mean_token_accuracy": 0.9783057284355163,
"num_tokens": 3841892.0,
"step": 900
},
{
"entropy": 0.09744730332866311,
"epoch": 0.24792363951902813,
"grad_norm": 0.2839490473270416,
"learning_rate": 0.00019724401478615975,
"loss": 0.08426895141601562,
"mean_token_accuracy": 0.9779949200153351,
"num_tokens": 4270558.0,
"step": 1000
},
{
"entropy": 0.09355678971856833,
"epoch": 0.27271600347093095,
"grad_norm": 0.22099336981773376,
"learning_rate": 0.00019660048198534043,
"loss": 0.07872037887573242,
"mean_token_accuracy": 0.9789282914996147,
"num_tokens": 4692785.0,
"step": 1100
},
{
"entropy": 0.08774024970829487,
"epoch": 0.29750836742283376,
"grad_norm": 0.25038641691207886,
"learning_rate": 0.00019589076610107613,
"loss": 0.07532472610473633,
"mean_token_accuracy": 0.9797207751870155,
"num_tokens": 5123896.0,
"step": 1200
},
{
"entropy": 0.0822139031253755,
"epoch": 0.3223007313747366,
"grad_norm": 0.1757524311542511,
"learning_rate": 0.0001951153533750981,
"loss": 0.0712879753112793,
"mean_token_accuracy": 0.9809118565917015,
"num_tokens": 5558585.0,
"step": 1300
},
{
"entropy": 0.08247557899914681,
"epoch": 0.3470930953266394,
"grad_norm": 0.3174690902233124,
"learning_rate": 0.00019427477505946724,
"loss": 0.07155597686767579,
"mean_token_accuracy": 0.9806134033203125,
"num_tokens": 5993135.0,
"step": 1400
},
{
"entropy": 0.07734406786970795,
"epoch": 0.3718854592785422,
"grad_norm": 0.20085565745830536,
"learning_rate": 0.00019336960705260218,
"loss": 0.06758695125579833,
"mean_token_accuracy": 0.9812126770615578,
"num_tokens": 6422291.0,
"step": 1500
},
{
"entropy": 0.07385200836695731,
"epoch": 0.39667782323044504,
"grad_norm": 0.23364907503128052,
"learning_rate": 0.00019240046950471843,
"loss": 0.06287895202636719,
"mean_token_accuracy": 0.9826329717040062,
"num_tokens": 6859860.0,
"step": 1600
},
{
"entropy": 0.07059250806458295,
"epoch": 0.42147018718234786,
"grad_norm": 0.23875373601913452,
"learning_rate": 0.00019136802639295038,
"loss": 0.06304484367370605,
"mean_token_accuracy": 0.9824053046107292,
"num_tokens": 7290073.0,
"step": 1700
},
{
"entropy": 0.06737875854596495,
"epoch": 0.4462625511342507,
"grad_norm": 0.3208062946796417,
"learning_rate": 0.00019027298506644585,
"loss": 0.059958081245422366,
"mean_token_accuracy": 0.9828743213415145,
"num_tokens": 7725201.0,
"step": 1800
},
{
"entropy": 0.06706910256296396,
"epoch": 0.4710549150861535,
"grad_norm": 0.21684925258159637,
"learning_rate": 0.0001891160957617461,
"loss": 0.058564453125,
"mean_token_accuracy": 0.9831320327520371,
"num_tokens": 8158313.0,
"step": 1900
},
{
"entropy": 0.06947937468066812,
"epoch": 0.49584727903805625,
"grad_norm": 0.18770049512386322,
"learning_rate": 0.00018789815108878247,
"loss": 0.06172544956207275,
"mean_token_accuracy": 0.9823081752657891,
"num_tokens": 8578452.0,
"step": 2000
},
{
"entropy": 0.06397987404838204,
"epoch": 0.5206396429899591,
"grad_norm": 0.3015916347503662,
"learning_rate": 0.00018661998548784206,
"loss": 0.05666701316833496,
"mean_token_accuracy": 0.9837381663918495,
"num_tokens": 9008577.0,
"step": 2100
},
{
"entropy": 0.06192670753225684,
"epoch": 0.5454320069418619,
"grad_norm": 0.14773066341876984,
"learning_rate": 0.00018528247465787458,
"loss": 0.05475767612457275,
"mean_token_accuracy": 0.9839018094539642,
"num_tokens": 9442416.0,
"step": 2200
},
{
"entropy": 0.057383716171607375,
"epoch": 0.5702243708937648,
"grad_norm": 0.2786010503768921,
"learning_rate": 0.00018388653495653227,
"loss": 0.05079104423522949,
"mean_token_accuracy": 0.9851340425014495,
"num_tokens": 9866601.0,
"step": 2300
},
{
"entropy": 0.061573395412415265,
"epoch": 0.5950167348456675,
"grad_norm": 0.2154165506362915,
"learning_rate": 0.00018243312277235307,
"loss": 0.052988133430480956,
"mean_token_accuracy": 0.9846190690994263,
"num_tokens": 10287014.0,
"step": 2400
},
{
"entropy": 0.061048444965854286,
"epoch": 0.6198090987975704,
"grad_norm": 0.23032571375370026,
"learning_rate": 0.00018092323386951844,
"loss": 0.05165313720703125,
"mean_token_accuracy": 0.9843217238783837,
"num_tokens": 10717509.0,
"step": 2500
},
{
"entropy": 0.055967804118990896,
"epoch": 0.6446014627494732,
"grad_norm": 0.19078344106674194,
"learning_rate": 0.00017935790270563344,
"loss": 0.04785560607910156,
"mean_token_accuracy": 0.9853029519319534,
"num_tokens": 11157747.0,
"step": 2600
},
{
"entropy": 0.05705006473697722,
"epoch": 0.6693938267013759,
"grad_norm": 0.18230348825454712,
"learning_rate": 0.0001777382017229977,
"loss": 0.04942546844482422,
"mean_token_accuracy": 0.9849184802174569,
"num_tokens": 11593422.0,
"step": 2700
},
{
"entropy": 0.05708774453029036,
"epoch": 0.6941861906532788,
"grad_norm": 0.1923963725566864,
"learning_rate": 0.00017606524061385167,
"loss": 0.049316325187683106,
"mean_token_accuracy": 0.9849100703001022,
"num_tokens": 12015482.0,
"step": 2800
},
{
"entropy": 0.056122053125873206,
"epoch": 0.7189785546051816,
"grad_norm": 0.13828027248382568,
"learning_rate": 0.00017434016556010264,
"loss": 0.048600535392761234,
"mean_token_accuracy": 0.9853047552704811,
"num_tokens": 12444156.0,
"step": 2900
},
{
"entropy": 0.051999541874974964,
"epoch": 0.7437709185570844,
"grad_norm": 0.24286241829395294,
"learning_rate": 0.00017256415844805063,
"loss": 0.04440320014953613,
"mean_token_accuracy": 0.9864806136488915,
"num_tokens": 12876720.0,
"step": 3000
},
{
"entropy": 0.04768232893198729,
"epoch": 0.7685632825089872,
"grad_norm": 0.1362326294183731,
"learning_rate": 0.00017073843605865243,
"loss": 0.042284860610961914,
"mean_token_accuracy": 0.9867907965183258,
"num_tokens": 13316689.0,
"step": 3100
},
{
"entropy": 0.05134817799553275,
"epoch": 0.7933556464608901,
"grad_norm": 0.1539483368396759,
"learning_rate": 0.00016886424923387859,
"loss": 0.04517318725585937,
"mean_token_accuracy": 0.9861972403526306,
"num_tokens": 13745299.0,
"step": 3200
},
{
"entropy": 0.051489096255972984,
"epoch": 0.8181480104127928,
"grad_norm": 0.14677491784095764,
"learning_rate": 0.00016694288201973457,
"loss": 0.04445661067962647,
"mean_token_accuracy": 0.9860166025161743,
"num_tokens": 14174424.0,
"step": 3300
},
{
"entropy": 0.04676903900690377,
"epoch": 0.8429403743646957,
"grad_norm": 0.21468833088874817,
"learning_rate": 0.0001649756507865328,
"loss": 0.041012239456176755,
"mean_token_accuracy": 0.987050573527813,
"num_tokens": 14611781.0,
"step": 3400
},
{
"entropy": 0.0482857808098197,
"epoch": 0.8677327383165985,
"grad_norm": 0.14730653166770935,
"learning_rate": 0.00016296390332701924,
"loss": 0.04293826103210449,
"mean_token_accuracy": 0.9866457509994507,
"num_tokens": 15038473.0,
"step": 3500
},
{
"entropy": 0.04790851186960936,
"epoch": 0.8925251022685013,
"grad_norm": 0.2903175950050354,
"learning_rate": 0.0001609090179329709,
"loss": 0.041955056190490725,
"mean_token_accuracy": 0.9864692252874374,
"num_tokens": 15470046.0,
"step": 3600
},
{
"entropy": 0.048887748084962365,
"epoch": 0.9173174662204041,
"grad_norm": 0.18117748200893402,
"learning_rate": 0.0001588124024508986,
"loss": 0.04415608406066895,
"mean_token_accuracy": 0.985989620089531,
"num_tokens": 15892623.0,
"step": 3700
},
{
"entropy": 0.04632032319903374,
"epoch": 0.942109830172307,
"grad_norm": 0.16654178500175476,
"learning_rate": 0.00015667549331750067,
"loss": 0.042152628898620606,
"mean_token_accuracy": 0.9865523239970208,
"num_tokens": 16316100.0,
"step": 3800
},
{
"entropy": 0.044644428994506595,
"epoch": 0.9669021941242097,
"grad_norm": 0.2481166422367096,
"learning_rate": 0.0001544997545755291,
"loss": 0.04001152038574219,
"mean_token_accuracy": 0.9875221633911133,
"num_tokens": 16747053.0,
"step": 3900
},
{
"entropy": 0.04754056423902511,
"epoch": 0.9916945580761125,
"grad_norm": 0.12741857767105103,
"learning_rate": 0.00015228667687074214,
"loss": 0.04207493782043457,
"mean_token_accuracy": 0.9866985288262368,
"num_tokens": 17169662.0,
"step": 4000
},
{
"entropy": 0.04459555751302434,
"epoch": 1.0163629602082558,
"grad_norm": 0.09805303066968918,
"learning_rate": 0.00015003777643063054,
"loss": 0.03870807647705078,
"mean_token_accuracy": 0.9877826987798489,
"num_tokens": 17596478.0,
"step": 4100
},
{
"entropy": 0.0423293265234679,
"epoch": 1.0411553241601588,
"grad_norm": 0.15998226404190063,
"learning_rate": 0.0001477545940256172,
"loss": 0.03742676258087158,
"mean_token_accuracy": 0.9879223209619522,
"num_tokens": 18017906.0,
"step": 4200
},
{
"entropy": 0.03891188260167837,
"epoch": 1.0659476881120615,
"grad_norm": 0.1506214290857315,
"learning_rate": 0.00014543869391344224,
"loss": 0.03518922805786133,
"mean_token_accuracy": 0.9887040394544602,
"num_tokens": 18454216.0,
"step": 4300
},
{
"entropy": 0.04142872649244964,
"epoch": 1.0907400520639643,
"grad_norm": 0.1666085124015808,
"learning_rate": 0.00014309166276745564,
"loss": 0.03670289039611816,
"mean_token_accuracy": 0.9879066833853721,
"num_tokens": 18878519.0,
"step": 4400
},
{
"entropy": 0.03755377263762057,
"epoch": 1.115532416015867,
"grad_norm": 0.2086615115404129,
"learning_rate": 0.00014071510858955336,
"loss": 0.03333067655563354,
"mean_token_accuracy": 0.989110766351223,
"num_tokens": 19317824.0,
"step": 4500
},
{
"entropy": 0.04046432740055025,
"epoch": 1.14032477996777,
"grad_norm": 0.20940445363521576,
"learning_rate": 0.00013831065960850038,
"loss": 0.03586224794387818,
"mean_token_accuracy": 0.9884641316533088,
"num_tokens": 19745984.0,
"step": 4600
},
{
"entropy": 0.03863211246207356,
"epoch": 1.1651171439196728,
"grad_norm": 0.1907690167427063,
"learning_rate": 0.0001358799631643955,
"loss": 0.03435335397720337,
"mean_token_accuracy": 0.9888206848502159,
"num_tokens": 20180245.0,
"step": 4700
},
{
"entropy": 0.04046371933072805,
"epoch": 1.1899095078715756,
"grad_norm": 0.13110345602035522,
"learning_rate": 0.00013342468458004347,
"loss": 0.03644887685775757,
"mean_token_accuracy": 0.9881230041384697,
"num_tokens": 20606265.0,
"step": 4800
},
{
"entropy": 0.03736146904528141,
"epoch": 1.2147018718234783,
"grad_norm": 0.1462518870830536,
"learning_rate": 0.00013094650602000582,
"loss": 0.03372693538665771,
"mean_token_accuracy": 0.9891441905498505,
"num_tokens": 21044494.0,
"step": 4900
},
{
"entropy": 0.03839201644994319,
"epoch": 1.239494235775381,
"grad_norm": 0.11341901123523712,
"learning_rate": 0.00012844712533811376,
"loss": 0.03437334060668945,
"mean_token_accuracy": 0.9888800847530365,
"num_tokens": 21480042.0,
"step": 5000
},
{
"entropy": 0.037934175664559006,
"epoch": 1.264286599727284,
"grad_norm": 0.23413598537445068,
"learning_rate": 0.0001259282549142315,
"loss": 0.03376242399215698,
"mean_token_accuracy": 0.9890937665104866,
"num_tokens": 21912071.0,
"step": 5100
},
{
"entropy": 0.03757761628367007,
"epoch": 1.2890789636791868,
"grad_norm": 0.14774999022483826,
"learning_rate": 0.0001233916204810679,
"loss": 0.03416965961456299,
"mean_token_accuracy": 0.9889910009503364,
"num_tokens": 22335448.0,
"step": 5200
},
{
"entropy": 0.03822989201173186,
"epoch": 1.3138713276310896,
"grad_norm": 0.11656388640403748,
"learning_rate": 0.00012083895994183948,
"loss": 0.03509602785110474,
"mean_token_accuracy": 0.9885432028770447,
"num_tokens": 22756521.0,
"step": 5300
},
{
"entropy": 0.03775340311229229,
"epoch": 1.3386636915829924,
"grad_norm": 0.1481839120388031,
"learning_rate": 0.00011827202217959523,
"loss": 0.0340172815322876,
"mean_token_accuracy": 0.9888760358095169,
"num_tokens": 23181534.0,
"step": 5400
},
{
"entropy": 0.03720983518287539,
"epoch": 1.3634560555348951,
"grad_norm": 0.13698537647724152,
"learning_rate": 0.00011569256585901918,
"loss": 0.03371585130691528,
"mean_token_accuracy": 0.9890251788496971,
"num_tokens": 23613467.0,
"step": 5500
},
{
"entropy": 0.037667012261226776,
"epoch": 1.3882484194867981,
"grad_norm": 0.09335887432098389,
"learning_rate": 0.00011310235822153073,
"loss": 0.03394256591796875,
"mean_token_accuracy": 0.9890615126490593,
"num_tokens": 24039912.0,
"step": 5600
},
{
"entropy": 0.03788006491959095,
"epoch": 1.4130407834387009,
"grad_norm": 0.1678655594587326,
"learning_rate": 0.0001105031738745096,
"loss": 0.034035165309906,
"mean_token_accuracy": 0.9887340119481087,
"num_tokens": 24464996.0,
"step": 5700
},
{
"entropy": 0.03637797945179045,
"epoch": 1.4378331473906036,
"grad_norm": 0.17894072830677032,
"learning_rate": 0.00010789679357547364,
"loss": 0.03286903142929077,
"mean_token_accuracy": 0.9891549465060234,
"num_tokens": 24901092.0,
"step": 5800
},
{
"entropy": 0.03953015809878707,
"epoch": 1.4626255113425066,
"grad_norm": 0.1642547845840454,
"learning_rate": 0.00010528500301204345,
"loss": 0.03447899341583252,
"mean_token_accuracy": 0.988511001765728,
"num_tokens": 25320711.0,
"step": 5900
},
{
"entropy": 0.03696547055616975,
"epoch": 1.4874178752944094,
"grad_norm": 0.15598466992378235,
"learning_rate": 0.0001026695915785289,
"loss": 0.03327722549438476,
"mean_token_accuracy": 0.9893461042642593,
"num_tokens": 25750634.0,
"step": 6000
},
{
"entropy": 0.03747725712135434,
"epoch": 1.5122102392463121,
"grad_norm": 0.09570539742708206,
"learning_rate": 0.00010005235114997651,
"loss": 0.03426354885101318,
"mean_token_accuracy": 0.9889142262935638,
"num_tokens": 26175757.0,
"step": 6100
},
{
"entropy": 0.037917951373383406,
"epoch": 1.537002603198215,
"grad_norm": 0.2064983993768692,
"learning_rate": 9.743507485451688e-05,
"loss": 0.03446398973464966,
"mean_token_accuracy": 0.9886316114664078,
"num_tokens": 26601186.0,
"step": 6200
},
{
"entropy": 0.037627564212307334,
"epoch": 1.5617949671501177,
"grad_norm": 0.17442478239536285,
"learning_rate": 9.48195558448538e-05,
"loss": 0.0337642502784729,
"mean_token_accuracy": 0.988581260740757,
"num_tokens": 27028439.0,
"step": 6300
},
{
"entropy": 0.035229697693139314,
"epoch": 1.5865873311020207,
"grad_norm": 0.19224514067173004,
"learning_rate": 9.220758606973652e-05,
"loss": 0.03189241409301758,
"mean_token_accuracy": 0.989690189063549,
"num_tokens": 27461882.0,
"step": 6400
},
{
"entropy": 0.035260174684226514,
"epoch": 1.6113796950539234,
"grad_norm": 0.11715493351221085,
"learning_rate": 8.960095504625676e-05,
"loss": 0.032297356128692625,
"mean_token_accuracy": 0.9895079037547112,
"num_tokens": 27898972.0,
"step": 6500
}
],
"logging_steps": 100,
"max_steps": 12102,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.8627923803091927e+18,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}