Instructions to use dewigould/stratos-code-32B-lora with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use dewigould/stratos-code-32B-lora with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen2.5-32B-Instruct") model = PeftModel.from_pretrained(base_model, "dewigould/stratos-code-32B-lora") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 2.968, | |
| "eval_steps": 500, | |
| "global_step": 123, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.024, | |
| "grad_norm": 0.13470892473582247, | |
| "learning_rate": 7.692307692307694e-06, | |
| "loss": 0.9002, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 0.048, | |
| "grad_norm": 0.12684151805493843, | |
| "learning_rate": 1.5384615384615387e-05, | |
| "loss": 0.8697, | |
| "step": 2 | |
| }, | |
| { | |
| "epoch": 0.072, | |
| "grad_norm": 0.13524138740416147, | |
| "learning_rate": 2.307692307692308e-05, | |
| "loss": 0.8839, | |
| "step": 3 | |
| }, | |
| { | |
| "epoch": 0.096, | |
| "grad_norm": 0.12441922660662, | |
| "learning_rate": 3.0769230769230774e-05, | |
| "loss": 0.8799, | |
| "step": 4 | |
| }, | |
| { | |
| "epoch": 0.12, | |
| "grad_norm": 0.116855421032801, | |
| "learning_rate": 3.846153846153846e-05, | |
| "loss": 0.8607, | |
| "step": 5 | |
| }, | |
| { | |
| "epoch": 0.144, | |
| "grad_norm": 0.1081278232525602, | |
| "learning_rate": 4.615384615384616e-05, | |
| "loss": 0.8649, | |
| "step": 6 | |
| }, | |
| { | |
| "epoch": 0.168, | |
| "grad_norm": 0.09391740911956674, | |
| "learning_rate": 5.384615384615385e-05, | |
| "loss": 0.85, | |
| "step": 7 | |
| }, | |
| { | |
| "epoch": 0.192, | |
| "grad_norm": 0.093768679228211, | |
| "learning_rate": 6.153846153846155e-05, | |
| "loss": 0.8373, | |
| "step": 8 | |
| }, | |
| { | |
| "epoch": 0.216, | |
| "grad_norm": 0.11850273448846249, | |
| "learning_rate": 6.923076923076924e-05, | |
| "loss": 0.8126, | |
| "step": 9 | |
| }, | |
| { | |
| "epoch": 0.24, | |
| "grad_norm": 0.12308088090050255, | |
| "learning_rate": 7.692307692307693e-05, | |
| "loss": 0.803, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.264, | |
| "grad_norm": 0.1012384950170664, | |
| "learning_rate": 8.461538461538461e-05, | |
| "loss": 0.7831, | |
| "step": 11 | |
| }, | |
| { | |
| "epoch": 0.288, | |
| "grad_norm": 0.08935456718448598, | |
| "learning_rate": 9.230769230769232e-05, | |
| "loss": 0.7575, | |
| "step": 12 | |
| }, | |
| { | |
| "epoch": 0.312, | |
| "grad_norm": 0.08348093118245446, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7635, | |
| "step": 13 | |
| }, | |
| { | |
| "epoch": 0.336, | |
| "grad_norm": 0.10237088717244265, | |
| "learning_rate": 9.997960964140947e-05, | |
| "loss": 0.7505, | |
| "step": 14 | |
| }, | |
| { | |
| "epoch": 0.36, | |
| "grad_norm": 0.09971346745654726, | |
| "learning_rate": 9.991845519630678e-05, | |
| "loss": 0.7268, | |
| "step": 15 | |
| }, | |
| { | |
| "epoch": 0.384, | |
| "grad_norm": 0.0956041349604367, | |
| "learning_rate": 9.981658654313457e-05, | |
| "loss": 0.7075, | |
| "step": 16 | |
| }, | |
| { | |
| "epoch": 0.408, | |
| "grad_norm": 0.08930264667905229, | |
| "learning_rate": 9.967408676742751e-05, | |
| "loss": 0.7075, | |
| "step": 17 | |
| }, | |
| { | |
| "epoch": 0.432, | |
| "grad_norm": 0.0805715992727793, | |
| "learning_rate": 9.949107209404665e-05, | |
| "loss": 0.7005, | |
| "step": 18 | |
| }, | |
| { | |
| "epoch": 0.456, | |
| "grad_norm": 0.0791880846722688, | |
| "learning_rate": 9.926769179238466e-05, | |
| "loss": 0.6842, | |
| "step": 19 | |
| }, | |
| { | |
| "epoch": 0.48, | |
| "grad_norm": 0.08089271988918346, | |
| "learning_rate": 9.900412805461967e-05, | |
| "loss": 0.6791, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.504, | |
| "grad_norm": 0.07928793051029351, | |
| "learning_rate": 9.870059584711668e-05, | |
| "loss": 0.6839, | |
| "step": 21 | |
| }, | |
| { | |
| "epoch": 0.528, | |
| "grad_norm": 0.06499639850161912, | |
| "learning_rate": 9.835734273509786e-05, | |
| "loss": 0.6636, | |
| "step": 22 | |
| }, | |
| { | |
| "epoch": 0.552, | |
| "grad_norm": 0.05954930255476567, | |
| "learning_rate": 9.797464868072488e-05, | |
| "loss": 0.666, | |
| "step": 23 | |
| }, | |
| { | |
| "epoch": 0.576, | |
| "grad_norm": 0.06162765168782512, | |
| "learning_rate": 9.755282581475769e-05, | |
| "loss": 0.6578, | |
| "step": 24 | |
| }, | |
| { | |
| "epoch": 0.6, | |
| "grad_norm": 0.06248610871137899, | |
| "learning_rate": 9.709221818197624e-05, | |
| "loss": 0.6549, | |
| "step": 25 | |
| }, | |
| { | |
| "epoch": 0.624, | |
| "grad_norm": 0.0506950458274749, | |
| "learning_rate": 9.659320146057262e-05, | |
| "loss": 0.6304, | |
| "step": 26 | |
| }, | |
| { | |
| "epoch": 0.648, | |
| "grad_norm": 0.05374640897395996, | |
| "learning_rate": 9.60561826557425e-05, | |
| "loss": 0.6416, | |
| "step": 27 | |
| }, | |
| { | |
| "epoch": 0.672, | |
| "grad_norm": 0.05706061454780688, | |
| "learning_rate": 9.548159976772592e-05, | |
| "loss": 0.6439, | |
| "step": 28 | |
| }, | |
| { | |
| "epoch": 0.696, | |
| "grad_norm": 0.0557974734976607, | |
| "learning_rate": 9.486992143456792e-05, | |
| "loss": 0.6339, | |
| "step": 29 | |
| }, | |
| { | |
| "epoch": 0.72, | |
| "grad_norm": 0.049431517782371044, | |
| "learning_rate": 9.422164654989072e-05, | |
| "loss": 0.636, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.744, | |
| "grad_norm": 0.04943967511643338, | |
| "learning_rate": 9.353730385598887e-05, | |
| "loss": 0.623, | |
| "step": 31 | |
| }, | |
| { | |
| "epoch": 0.768, | |
| "grad_norm": 0.057481818878385216, | |
| "learning_rate": 9.281745151257946e-05, | |
| "loss": 0.6239, | |
| "step": 32 | |
| }, | |
| { | |
| "epoch": 0.792, | |
| "grad_norm": 0.04396292148227855, | |
| "learning_rate": 9.206267664155907e-05, | |
| "loss": 0.6148, | |
| "step": 33 | |
| }, | |
| { | |
| "epoch": 0.816, | |
| "grad_norm": 0.050000504681156153, | |
| "learning_rate": 9.12735948481387e-05, | |
| "loss": 0.6222, | |
| "step": 34 | |
| }, | |
| { | |
| "epoch": 0.84, | |
| "grad_norm": 0.04978849344079479, | |
| "learning_rate": 9.045084971874738e-05, | |
| "loss": 0.6089, | |
| "step": 35 | |
| }, | |
| { | |
| "epoch": 0.864, | |
| "grad_norm": 0.04110105308892455, | |
| "learning_rate": 8.959511229611376e-05, | |
| "loss": 0.6135, | |
| "step": 36 | |
| }, | |
| { | |
| "epoch": 0.888, | |
| "grad_norm": 0.04231119961691381, | |
| "learning_rate": 8.870708053195413e-05, | |
| "loss": 0.6062, | |
| "step": 37 | |
| }, | |
| { | |
| "epoch": 0.912, | |
| "grad_norm": 0.04161289294733194, | |
| "learning_rate": 8.778747871771292e-05, | |
| "loss": 0.595, | |
| "step": 38 | |
| }, | |
| { | |
| "epoch": 0.936, | |
| "grad_norm": 0.040394425736741305, | |
| "learning_rate": 8.683705689382024e-05, | |
| "loss": 0.6189, | |
| "step": 39 | |
| }, | |
| { | |
| "epoch": 0.96, | |
| "grad_norm": 0.039625585716789334, | |
| "learning_rate": 8.585659023794818e-05, | |
| "loss": 0.6125, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.984, | |
| "grad_norm": 0.03942971331618393, | |
| "learning_rate": 8.484687843276469e-05, | |
| "loss": 0.5902, | |
| "step": 41 | |
| }, | |
| { | |
| "epoch": 1.016, | |
| "grad_norm": 0.06854283714031789, | |
| "learning_rate": 8.380874501370097e-05, | |
| "loss": 0.9837, | |
| "step": 42 | |
| }, | |
| { | |
| "epoch": 1.04, | |
| "grad_norm": 0.044244844800252224, | |
| "learning_rate": 8.274303669726426e-05, | |
| "loss": 0.5954, | |
| "step": 43 | |
| }, | |
| { | |
| "epoch": 1.064, | |
| "grad_norm": 0.04315909037714035, | |
| "learning_rate": 8.165062269044353e-05, | |
| "loss": 0.5572, | |
| "step": 44 | |
| }, | |
| { | |
| "epoch": 1.088, | |
| "grad_norm": 0.042343597409635, | |
| "learning_rate": 8.053239398177191e-05, | |
| "loss": 0.5947, | |
| "step": 45 | |
| }, | |
| { | |
| "epoch": 1.112, | |
| "grad_norm": 0.042609334474767446, | |
| "learning_rate": 7.938926261462366e-05, | |
| "loss": 0.598, | |
| "step": 46 | |
| }, | |
| { | |
| "epoch": 1.1360000000000001, | |
| "grad_norm": 0.042855620470266094, | |
| "learning_rate": 7.822216094333847e-05, | |
| "loss": 0.5948, | |
| "step": 47 | |
| }, | |
| { | |
| "epoch": 1.16, | |
| "grad_norm": 0.038865911999576994, | |
| "learning_rate": 7.703204087277988e-05, | |
| "loss": 0.538, | |
| "step": 48 | |
| }, | |
| { | |
| "epoch": 1.184, | |
| "grad_norm": 0.04351888230509946, | |
| "learning_rate": 7.58198730819481e-05, | |
| "loss": 0.6413, | |
| "step": 49 | |
| }, | |
| { | |
| "epoch": 1.208, | |
| "grad_norm": 0.038833703601196076, | |
| "learning_rate": 7.45866462322802e-05, | |
| "loss": 0.5664, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 1.232, | |
| "grad_norm": 0.042691953985913605, | |
| "learning_rate": 7.333336616128369e-05, | |
| "loss": 0.6138, | |
| "step": 51 | |
| }, | |
| { | |
| "epoch": 1.256, | |
| "grad_norm": 0.03786316545193847, | |
| "learning_rate": 7.206105506216106e-05, | |
| "loss": 0.5708, | |
| "step": 52 | |
| }, | |
| { | |
| "epoch": 1.28, | |
| "grad_norm": 0.03779522737510971, | |
| "learning_rate": 7.077075065009433e-05, | |
| "loss": 0.548, | |
| "step": 53 | |
| }, | |
| { | |
| "epoch": 1.304, | |
| "grad_norm": 0.03864001143875006, | |
| "learning_rate": 6.946350531586959e-05, | |
| "loss": 0.5777, | |
| "step": 54 | |
| }, | |
| { | |
| "epoch": 1.328, | |
| "grad_norm": 0.040817473223837275, | |
| "learning_rate": 6.814038526753205e-05, | |
| "loss": 0.6152, | |
| "step": 55 | |
| }, | |
| { | |
| "epoch": 1.3519999999999999, | |
| "grad_norm": 0.036713626306258296, | |
| "learning_rate": 6.680246966077151e-05, | |
| "loss": 0.5425, | |
| "step": 56 | |
| }, | |
| { | |
| "epoch": 1.376, | |
| "grad_norm": 0.039957743150673776, | |
| "learning_rate": 6.545084971874738e-05, | |
| "loss": 0.5807, | |
| "step": 57 | |
| }, | |
| { | |
| "epoch": 1.4, | |
| "grad_norm": 0.03763361703526649, | |
| "learning_rate": 6.408662784207149e-05, | |
| "loss": 0.5524, | |
| "step": 58 | |
| }, | |
| { | |
| "epoch": 1.424, | |
| "grad_norm": 0.03892474621010607, | |
| "learning_rate": 6.271091670967436e-05, | |
| "loss": 0.5842, | |
| "step": 59 | |
| }, | |
| { | |
| "epoch": 1.448, | |
| "grad_norm": 0.04548062476292172, | |
| "learning_rate": 6.132483837128823e-05, | |
| "loss": 0.5996, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 1.472, | |
| "grad_norm": 0.0384979096849966, | |
| "learning_rate": 5.992952333228728e-05, | |
| "loss": 0.5779, | |
| "step": 61 | |
| }, | |
| { | |
| "epoch": 1.496, | |
| "grad_norm": 0.04251581398744228, | |
| "learning_rate": 5.85261096316312e-05, | |
| "loss": 0.5614, | |
| "step": 62 | |
| }, | |
| { | |
| "epoch": 1.52, | |
| "grad_norm": 0.041653573628985384, | |
| "learning_rate": 5.7115741913664264e-05, | |
| "loss": 0.5793, | |
| "step": 63 | |
| }, | |
| { | |
| "epoch": 1.544, | |
| "grad_norm": 0.041382331057486954, | |
| "learning_rate": 5.569957049452703e-05, | |
| "loss": 0.5195, | |
| "step": 64 | |
| }, | |
| { | |
| "epoch": 1.568, | |
| "grad_norm": 0.04890189320533228, | |
| "learning_rate": 5.427875042394199e-05, | |
| "loss": 0.576, | |
| "step": 65 | |
| }, | |
| { | |
| "epoch": 1.592, | |
| "grad_norm": 0.049055416858589336, | |
| "learning_rate": 5.2854440543138406e-05, | |
| "loss": 0.5864, | |
| "step": 66 | |
| }, | |
| { | |
| "epoch": 1.616, | |
| "grad_norm": 0.03746640997017083, | |
| "learning_rate": 5.142780253968481e-05, | |
| "loss": 0.5549, | |
| "step": 67 | |
| }, | |
| { | |
| "epoch": 1.6400000000000001, | |
| "grad_norm": 0.04719163575348306, | |
| "learning_rate": 5e-05, | |
| "loss": 0.582, | |
| "step": 68 | |
| }, | |
| { | |
| "epoch": 1.6640000000000001, | |
| "grad_norm": 0.04070903369553021, | |
| "learning_rate": 4.85721974603152e-05, | |
| "loss": 0.5794, | |
| "step": 69 | |
| }, | |
| { | |
| "epoch": 1.688, | |
| "grad_norm": 0.048706176585568355, | |
| "learning_rate": 4.71455594568616e-05, | |
| "loss": 0.554, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 1.712, | |
| "grad_norm": 0.038856432195802794, | |
| "learning_rate": 4.5721249576058027e-05, | |
| "loss": 0.5623, | |
| "step": 71 | |
| }, | |
| { | |
| "epoch": 1.736, | |
| "grad_norm": 0.04528530194550223, | |
| "learning_rate": 4.4300429505472976e-05, | |
| "loss": 0.5894, | |
| "step": 72 | |
| }, | |
| { | |
| "epoch": 1.76, | |
| "grad_norm": 0.03820539197407199, | |
| "learning_rate": 4.288425808633575e-05, | |
| "loss": 0.5439, | |
| "step": 73 | |
| }, | |
| { | |
| "epoch": 1.784, | |
| "grad_norm": 0.04187780982436848, | |
| "learning_rate": 4.147389036836881e-05, | |
| "loss": 0.5993, | |
| "step": 74 | |
| }, | |
| { | |
| "epoch": 1.808, | |
| "grad_norm": 0.03642377304544682, | |
| "learning_rate": 4.007047666771274e-05, | |
| "loss": 0.5225, | |
| "step": 75 | |
| }, | |
| { | |
| "epoch": 1.8319999999999999, | |
| "grad_norm": 0.03958136941613791, | |
| "learning_rate": 3.8675161628711776e-05, | |
| "loss": 0.6058, | |
| "step": 76 | |
| }, | |
| { | |
| "epoch": 1.8559999999999999, | |
| "grad_norm": 0.03783379131667843, | |
| "learning_rate": 3.728908329032567e-05, | |
| "loss": 0.5823, | |
| "step": 77 | |
| }, | |
| { | |
| "epoch": 1.88, | |
| "grad_norm": 0.04039103496258606, | |
| "learning_rate": 3.591337215792852e-05, | |
| "loss": 0.5546, | |
| "step": 78 | |
| }, | |
| { | |
| "epoch": 1.904, | |
| "grad_norm": 0.03899593343895715, | |
| "learning_rate": 3.4549150281252636e-05, | |
| "loss": 0.5698, | |
| "step": 79 | |
| }, | |
| { | |
| "epoch": 1.928, | |
| "grad_norm": 0.038209698795034865, | |
| "learning_rate": 3.3197530339228487e-05, | |
| "loss": 0.5625, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 1.952, | |
| "grad_norm": 0.03810473583372995, | |
| "learning_rate": 3.1859614732467954e-05, | |
| "loss": 0.5662, | |
| "step": 81 | |
| }, | |
| { | |
| "epoch": 1.976, | |
| "grad_norm": 0.03782143044774664, | |
| "learning_rate": 3.053649468413043e-05, | |
| "loss": 0.5787, | |
| "step": 82 | |
| }, | |
| { | |
| "epoch": 2.008, | |
| "grad_norm": 0.07618753565677125, | |
| "learning_rate": 2.9229249349905684e-05, | |
| "loss": 0.9057, | |
| "step": 83 | |
| }, | |
| { | |
| "epoch": 2.032, | |
| "grad_norm": 0.03999693328865991, | |
| "learning_rate": 2.7938944937838923e-05, | |
| "loss": 0.5789, | |
| "step": 84 | |
| }, | |
| { | |
| "epoch": 2.056, | |
| "grad_norm": 0.03791025644954389, | |
| "learning_rate": 2.6666633838716314e-05, | |
| "loss": 0.5505, | |
| "step": 85 | |
| }, | |
| { | |
| "epoch": 2.08, | |
| "grad_norm": 0.039270508786545984, | |
| "learning_rate": 2.5413353767719805e-05, | |
| "loss": 0.5636, | |
| "step": 86 | |
| }, | |
| { | |
| "epoch": 2.104, | |
| "grad_norm": 0.03965008595990656, | |
| "learning_rate": 2.418012691805191e-05, | |
| "loss": 0.5364, | |
| "step": 87 | |
| }, | |
| { | |
| "epoch": 2.128, | |
| "grad_norm": 0.038749970466848624, | |
| "learning_rate": 2.296795912722014e-05, | |
| "loss": 0.552, | |
| "step": 88 | |
| }, | |
| { | |
| "epoch": 2.152, | |
| "grad_norm": 0.040641039194667855, | |
| "learning_rate": 2.1777839056661554e-05, | |
| "loss": 0.5886, | |
| "step": 89 | |
| }, | |
| { | |
| "epoch": 2.176, | |
| "grad_norm": 0.036298755789872766, | |
| "learning_rate": 2.061073738537635e-05, | |
| "loss": 0.5386, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 2.2, | |
| "grad_norm": 0.03698832601767516, | |
| "learning_rate": 1.946760601822809e-05, | |
| "loss": 0.563, | |
| "step": 91 | |
| }, | |
| { | |
| "epoch": 2.224, | |
| "grad_norm": 0.03999375914665445, | |
| "learning_rate": 1.8349377309556486e-05, | |
| "loss": 0.566, | |
| "step": 92 | |
| }, | |
| { | |
| "epoch": 2.248, | |
| "grad_norm": 0.04014616835285834, | |
| "learning_rate": 1.725696330273575e-05, | |
| "loss": 0.5373, | |
| "step": 93 | |
| }, | |
| { | |
| "epoch": 2.2720000000000002, | |
| "grad_norm": 0.038525153293531296, | |
| "learning_rate": 1.619125498629904e-05, | |
| "loss": 0.5337, | |
| "step": 94 | |
| }, | |
| { | |
| "epoch": 2.296, | |
| "grad_norm": 0.0385748600604672, | |
| "learning_rate": 1.5153121567235335e-05, | |
| "loss": 0.5896, | |
| "step": 95 | |
| }, | |
| { | |
| "epoch": 2.32, | |
| "grad_norm": 0.03679951278936808, | |
| "learning_rate": 1.414340976205183e-05, | |
| "loss": 0.5272, | |
| "step": 96 | |
| }, | |
| { | |
| "epoch": 2.344, | |
| "grad_norm": 0.03929593402454525, | |
| "learning_rate": 1.3162943106179749e-05, | |
| "loss": 0.5721, | |
| "step": 97 | |
| }, | |
| { | |
| "epoch": 2.368, | |
| "grad_norm": 0.0353829636923267, | |
| "learning_rate": 1.2212521282287092e-05, | |
| "loss": 0.5238, | |
| "step": 98 | |
| }, | |
| { | |
| "epoch": 2.392, | |
| "grad_norm": 0.039577733969761594, | |
| "learning_rate": 1.1292919468045877e-05, | |
| "loss": 0.6156, | |
| "step": 99 | |
| }, | |
| { | |
| "epoch": 2.416, | |
| "grad_norm": 0.03619160572847255, | |
| "learning_rate": 1.0404887703886251e-05, | |
| "loss": 0.5029, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 2.44, | |
| "grad_norm": 0.038621541462916534, | |
| "learning_rate": 9.549150281252633e-06, | |
| "loss": 0.575, | |
| "step": 101 | |
| }, | |
| { | |
| "epoch": 2.464, | |
| "grad_norm": 0.037325851942668076, | |
| "learning_rate": 8.7264051518613e-06, | |
| "loss": 0.5058, | |
| "step": 102 | |
| }, | |
| { | |
| "epoch": 2.488, | |
| "grad_norm": 0.04073574018349033, | |
| "learning_rate": 7.937323358440935e-06, | |
| "loss": 0.5521, | |
| "step": 103 | |
| }, | |
| { | |
| "epoch": 2.512, | |
| "grad_norm": 0.036589149211837486, | |
| "learning_rate": 7.182548487420554e-06, | |
| "loss": 0.5476, | |
| "step": 104 | |
| }, | |
| { | |
| "epoch": 2.536, | |
| "grad_norm": 0.041975055293630534, | |
| "learning_rate": 6.462696144011149e-06, | |
| "loss": 0.5711, | |
| "step": 105 | |
| }, | |
| { | |
| "epoch": 2.56, | |
| "grad_norm": 0.037339999676971554, | |
| "learning_rate": 5.778353450109286e-06, | |
| "loss": 0.5671, | |
| "step": 106 | |
| }, | |
| { | |
| "epoch": 2.584, | |
| "grad_norm": 0.03722383390075537, | |
| "learning_rate": 5.13007856543209e-06, | |
| "loss": 0.5448, | |
| "step": 107 | |
| }, | |
| { | |
| "epoch": 2.608, | |
| "grad_norm": 0.03638299949371452, | |
| "learning_rate": 4.5184002322740785e-06, | |
| "loss": 0.57, | |
| "step": 108 | |
| }, | |
| { | |
| "epoch": 2.632, | |
| "grad_norm": 0.033646285554547885, | |
| "learning_rate": 3.9438173442575e-06, | |
| "loss": 0.5451, | |
| "step": 109 | |
| }, | |
| { | |
| "epoch": 2.656, | |
| "grad_norm": 0.03557917403444963, | |
| "learning_rate": 3.406798539427386e-06, | |
| "loss": 0.5671, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 2.68, | |
| "grad_norm": 0.03932882062272541, | |
| "learning_rate": 2.9077818180237693e-06, | |
| "loss": 0.5255, | |
| "step": 111 | |
| }, | |
| { | |
| "epoch": 2.7039999999999997, | |
| "grad_norm": 0.03928832403339685, | |
| "learning_rate": 2.4471741852423237e-06, | |
| "loss": 0.5619, | |
| "step": 112 | |
| }, | |
| { | |
| "epoch": 2.7279999999999998, | |
| "grad_norm": 0.03697704890616523, | |
| "learning_rate": 2.0253513192751373e-06, | |
| "loss": 0.5236, | |
| "step": 113 | |
| }, | |
| { | |
| "epoch": 2.752, | |
| "grad_norm": 0.03535033007839283, | |
| "learning_rate": 1.6426572649021476e-06, | |
| "loss": 0.5765, | |
| "step": 114 | |
| }, | |
| { | |
| "epoch": 2.776, | |
| "grad_norm": 0.03390399749312069, | |
| "learning_rate": 1.2994041528833266e-06, | |
| "loss": 0.5428, | |
| "step": 115 | |
| }, | |
| { | |
| "epoch": 2.8, | |
| "grad_norm": 0.03382823635726114, | |
| "learning_rate": 9.958719453803278e-07, | |
| "loss": 0.5384, | |
| "step": 116 | |
| }, | |
| { | |
| "epoch": 2.824, | |
| "grad_norm": 0.035688586966212944, | |
| "learning_rate": 7.323082076153509e-07, | |
| "loss": 0.5706, | |
| "step": 117 | |
| }, | |
| { | |
| "epoch": 2.848, | |
| "grad_norm": 0.035229142108639755, | |
| "learning_rate": 5.089279059533658e-07, | |
| "loss": 0.5766, | |
| "step": 118 | |
| }, | |
| { | |
| "epoch": 2.872, | |
| "grad_norm": 0.03239167426949711, | |
| "learning_rate": 3.2591323257248893e-07, | |
| "loss": 0.5172, | |
| "step": 119 | |
| }, | |
| { | |
| "epoch": 2.896, | |
| "grad_norm": 0.034544452731342226, | |
| "learning_rate": 1.8341345686543332e-07, | |
| "loss": 0.5491, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 2.92, | |
| "grad_norm": 0.034989830683371165, | |
| "learning_rate": 8.15448036932176e-08, | |
| "loss": 0.5576, | |
| "step": 121 | |
| }, | |
| { | |
| "epoch": 2.944, | |
| "grad_norm": 0.04321076770460129, | |
| "learning_rate": 2.0390358590538504e-08, | |
| "loss": 0.5803, | |
| "step": 122 | |
| }, | |
| { | |
| "epoch": 2.968, | |
| "grad_norm": 0.03411839473128948, | |
| "learning_rate": 0.0, | |
| "loss": 0.5549, | |
| "step": 123 | |
| }, | |
| { | |
| "epoch": 2.968, | |
| "step": 123, | |
| "total_flos": 684564746862592.0, | |
| "train_loss": 0.6186332760787592, | |
| "train_runtime": 23928.9155, | |
| "train_samples_per_second": 0.501, | |
| "train_steps_per_second": 0.005 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 123, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 100, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 684564746862592.0, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |