1jamesthompson1 commited on
Commit
15477db
·
verified ·
1 Parent(s): d59a857

Upload folder using huggingface_hub

Browse files
README.md CHANGED
@@ -37,7 +37,7 @@ dataset, **overall** subpopulation.
37
  Part of the [wvs-nz-value-alignment](https://huggingface.co/collections/wvs-nz-value-alignment) collection.
38
 
39
 
40
- **GPU:** NVIDIA RTX PRO 6000 Blackwell Workstation Edition · **Training time:** 13m 48s
41
 
42
 
43
  ## Training hyperparameters
@@ -49,7 +49,7 @@ Part of the [wvs-nz-value-alignment](https://huggingface.co/collections/wvs-nz-v
49
  | LoRA dropout | 0.05 |
50
  | DoRA | False |
51
  | Learning rate | 0.0002 |
52
- | Batch size | 4 |
53
  | Gradient accumulation | 4 |
54
  | Epochs | 1 |
55
  | Max seq length | 1024 |
@@ -60,22 +60,38 @@ Part of the [wvs-nz-value-alignment](https://huggingface.co/collections/wvs-nz-v
60
 
61
 
62
  ```
63
- {"loss": 8.111881256103516, "grad_norm": 36.93735122680664, "learning_rate": 0.00019705882352941177, "epoch": 0.13245033112582782, "step": 10}
64
- {"eval_loss": 1.8344852924346924, "eval_runtime": 16.4711, "eval_samples_per_second": 9.107, "eval_steps_per_second": 2.307, "epoch": 0.13245033112582782, "step": 10}
65
- {"loss": 6.350960540771484, "grad_norm": 8.284809112548828, "learning_rate": 0.00016764705882352942, "epoch": 0.26490066225165565, "step": 20}
66
- {"eval_loss": 1.3456758260726929, "eval_runtime": 16.8028, "eval_samples_per_second": 8.927, "eval_steps_per_second": 2.262, "epoch": 0.26490066225165565, "step": 20}
67
- {"loss": 5.212066268920898, "grad_norm": 8.698701858520508, "learning_rate": 0.00013823529411764707, "epoch": 0.3973509933774834, "step": 30}
68
- {"eval_loss": 1.2856894731521606, "eval_runtime": 16.8725, "eval_samples_per_second": 8.89, "eval_steps_per_second": 2.252, "epoch": 0.3973509933774834, "step": 30}
69
- {"loss": 5.230597305297851, "grad_norm": 4.453671455383301, "learning_rate": 0.0001088235294117647, "epoch": 0.5298013245033113, "step": 40}
70
- {"eval_loss": 1.266767978668213, "eval_runtime": 16.9175, "eval_samples_per_second": 8.867, "eval_steps_per_second": 2.246, "epoch": 0.5298013245033113, "step": 40}
71
- {"loss": 5.069366836547852, "grad_norm": 3.493168354034424, "learning_rate": 7.941176470588235e-05, "epoch": 0.6622516556291391, "step": 50}
72
- {"eval_loss": 1.2818269729614258, "eval_runtime": 16.9098, "eval_samples_per_second": 8.871, "eval_steps_per_second": 2.247, "epoch": 0.6622516556291391, "step": 50}
73
- {"loss": 4.989227676391602, "grad_norm": 4.791518211364746, "learning_rate": 5e-05, "epoch": 0.7947019867549668, "step": 60}
74
- {"eval_loss": 1.2685493230819702, "eval_runtime": 16.9053, "eval_samples_per_second": 8.873, "eval_steps_per_second": 2.248, "epoch": 0.7947019867549668, "step": 60}
75
- {"loss": 4.609055709838867, "grad_norm": 2.6835153102874756, "learning_rate": 2.058823529411765e-05, "epoch": 0.9271523178807947, "step": 70}
76
- {"eval_loss": 1.2449450492858887, "eval_runtime": 16.924, "eval_samples_per_second": 8.863, "eval_steps_per_second": 2.245, "epoch": 0.9271523178807947, "step": 70}
77
- {"eval_loss": 1.2424073219299316, "eval_runtime": 16.9059, "eval_samples_per_second": 8.873, "eval_steps_per_second": 2.248, "epoch": 1.0, "step": 76}
78
- {"train_runtime": 828.4429, "train_samples_per_second": 1.456, "train_steps_per_second": 0.092, "total_flos": 7.64036915963566e+16, "train_loss": 5.566998130396793, "epoch": 1.0, "step": 76}
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
79
  ```
80
 
81
 
 
37
  Part of the [wvs-nz-value-alignment](https://huggingface.co/collections/wvs-nz-value-alignment) collection.
38
 
39
 
40
+ **GPU:** NVIDIA A40 · **Training time:** 57m 15s
41
 
42
 
43
  ## Training hyperparameters
 
49
  | LoRA dropout | 0.05 |
50
  | DoRA | False |
51
  | Learning rate | 0.0002 |
52
+ | Batch size | 2 |
53
  | Gradient accumulation | 4 |
54
  | Epochs | 1 |
55
  | Max seq length | 1024 |
 
60
 
61
 
62
  ```
63
+ {"loss": 8.703079986572266, "grad_norm": 55.47663497924805, "learning_rate": 0.00011250000000000001, "epoch": 0.06504065040650407, "step": 10}
64
+ {"eval_loss": 1.79399573802948, "eval_runtime": 93.2017, "eval_samples_per_second": 2.961, "eval_steps_per_second": 1.481, "epoch": 0.06504065040650407, "step": 10}
65
+ {"loss": 6.914659881591797, "grad_norm": 18.564268112182617, "learning_rate": 0.0001956521739130435, "epoch": 0.13008130081300814, "step": 20}
66
+ {"eval_loss": 1.4378732442855835, "eval_runtime": 92.8107, "eval_samples_per_second": 2.974, "eval_steps_per_second": 1.487, "epoch": 0.13008130081300814, "step": 20}
67
+ {"loss": 5.270082092285156, "grad_norm": 6.949378490447998, "learning_rate": 0.00018115942028985507, "epoch": 0.1951219512195122, "step": 30}
68
+ {"eval_loss": 1.3564187288284302, "eval_runtime": 92.968, "eval_samples_per_second": 2.969, "eval_steps_per_second": 1.484, "epoch": 0.1951219512195122, "step": 30}
69
+ {"loss": 5.4691619873046875, "grad_norm": 18.938419342041016, "learning_rate": 0.0001666666666666667, "epoch": 0.2601626016260163, "step": 40}
70
+ {"eval_loss": 1.2968977689743042, "eval_runtime": 92.9333, "eval_samples_per_second": 2.97, "eval_steps_per_second": 1.485, "epoch": 0.2601626016260163, "step": 40}
71
+ {"loss": 4.866386032104492, "grad_norm": 4.205469131469727, "learning_rate": 0.00015217391304347827, "epoch": 0.3252032520325203, "step": 50}
72
+ {"eval_loss": 1.3045886754989624, "eval_runtime": 92.8006, "eval_samples_per_second": 2.974, "eval_steps_per_second": 1.487, "epoch": 0.3252032520325203, "step": 50}
73
+ {"loss": 5.203897476196289, "grad_norm": 6.2034478187561035, "learning_rate": 0.00013768115942028986, "epoch": 0.3902439024390244, "step": 60}
74
+ {"eval_loss": 1.2741440534591675, "eval_runtime": 92.7552, "eval_samples_per_second": 2.976, "eval_steps_per_second": 1.488, "epoch": 0.3902439024390244, "step": 60}
75
+ {"loss": 5.226799392700196, "grad_norm": 5.329586029052734, "learning_rate": 0.00012318840579710145, "epoch": 0.45528455284552843, "step": 70}
76
+ {"eval_loss": 1.2608736753463745, "eval_runtime": 92.7677, "eval_samples_per_second": 2.975, "eval_steps_per_second": 1.488, "epoch": 0.45528455284552843, "step": 70}
77
+ {"loss": 4.7585094451904295, "grad_norm": 6.022779941558838, "learning_rate": 0.00010869565217391305, "epoch": 0.5203252032520326, "step": 80}
78
+ {"eval_loss": 1.2409065961837769, "eval_runtime": 92.9603, "eval_samples_per_second": 2.969, "eval_steps_per_second": 1.485, "epoch": 0.5203252032520326, "step": 80}
79
+ {"loss": 5.141559982299805, "grad_norm": 6.975116729736328, "learning_rate": 9.420289855072463e-05, "epoch": 0.5853658536585366, "step": 90}
80
+ {"eval_loss": 1.2473307847976685, "eval_runtime": 93.0257, "eval_samples_per_second": 2.967, "eval_steps_per_second": 1.483, "epoch": 0.5853658536585366, "step": 90}
81
+ {"loss": 4.915719604492187, "grad_norm": 5.658397197723389, "learning_rate": 7.971014492753623e-05, "epoch": 0.6504065040650406, "step": 100}
82
+ {"eval_loss": 1.2207982540130615, "eval_runtime": 92.9926, "eval_samples_per_second": 2.968, "eval_steps_per_second": 1.484, "epoch": 0.6504065040650406, "step": 100}
83
+ {"loss": 4.71471939086914, "grad_norm": 4.068330764770508, "learning_rate": 6.521739130434783e-05, "epoch": 0.7154471544715447, "step": 110}
84
+ {"eval_loss": 1.2062972784042358, "eval_runtime": 93.0862, "eval_samples_per_second": 2.965, "eval_steps_per_second": 1.482, "epoch": 0.7154471544715447, "step": 110}
85
+ {"loss": 5.122110748291016, "grad_norm": 4.539018154144287, "learning_rate": 5.072463768115943e-05, "epoch": 0.7804878048780488, "step": 120}
86
+ {"eval_loss": 1.1862434148788452, "eval_runtime": 92.8886, "eval_samples_per_second": 2.971, "eval_steps_per_second": 1.486, "epoch": 0.7804878048780488, "step": 120}
87
+ {"loss": 5.124646377563477, "grad_norm": 2.0783629417419434, "learning_rate": 3.6231884057971014e-05, "epoch": 0.8455284552845529, "step": 130}
88
+ {"eval_loss": 1.1823657751083374, "eval_runtime": 93.3157, "eval_samples_per_second": 2.958, "eval_steps_per_second": 1.479, "epoch": 0.8455284552845529, "step": 130}
89
+ {"loss": 4.650765609741211, "grad_norm": 2.456535816192627, "learning_rate": 2.173913043478261e-05, "epoch": 0.9105691056910569, "step": 140}
90
+ {"eval_loss": 1.1808730363845825, "eval_runtime": 93.0255, "eval_samples_per_second": 2.967, "eval_steps_per_second": 1.483, "epoch": 0.9105691056910569, "step": 140}
91
+ {"loss": 4.547821807861328, "grad_norm": 3.2700843811035156, "learning_rate": 7.246376811594203e-06, "epoch": 0.975609756097561, "step": 150}
92
+ {"eval_loss": 1.1744519472122192, "eval_runtime": 92.9911, "eval_samples_per_second": 2.968, "eval_steps_per_second": 1.484, "epoch": 0.975609756097561, "step": 150}
93
+ {"eval_loss": 1.1732834577560425, "eval_runtime": 93.2831, "eval_samples_per_second": 2.959, "eval_steps_per_second": 1.479, "epoch": 1.0, "step": 154}
94
+ {"train_runtime": 3434.9466, "train_samples_per_second": 0.358, "train_steps_per_second": 0.045, "total_flos": 5.38753752607488e+16, "train_loss": 5.347667557852609, "epoch": 1.0, "step": 154}
95
  ```
96
 
97
 
adapter_config.json CHANGED
@@ -31,13 +31,13 @@
31
  "rank_pattern": {},
32
  "revision": null,
33
  "target_modules": [
34
- "k_proj",
35
- "down_proj",
36
  "q_proj",
37
  "v_proj",
 
 
 
38
  "o_proj",
39
- "gate_proj",
40
- "up_proj"
41
  ],
42
  "target_parameters": null,
43
  "task_type": "CAUSAL_LM",
 
31
  "rank_pattern": {},
32
  "revision": null,
33
  "target_modules": [
 
 
34
  "q_proj",
35
  "v_proj",
36
+ "k_proj",
37
+ "up_proj",
38
+ "down_proj",
39
  "o_proj",
40
+ "gate_proj"
 
41
  ],
42
  "target_parameters": null,
43
  "task_type": "CAUSAL_LM",
adapter_model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:7c81efe098ccf9a9c9f420f49d4b10c09c97e861a0e6066e0843446ba7eeb2bb
3
  size 116425880
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d0971a6748cb1bcb5e653a4458e3fdeb1c5163c08c8a447ee9a63b0f8f1673fd
3
  size 116425880
finetune_config.json CHANGED
@@ -2,12 +2,12 @@
2
  "model": "Qwen/Qwen3.5-9B",
3
  "model_sha": "c202236235762e1c871ad0ccb60c8ee5ba337b9a",
4
  "dataset": "full_string_distribution",
5
- "dataset_sha": "38f42265e06d60afd0a5d2d45808202e60e95103",
6
  "subpopulation": "overall",
7
- "gpu": "NVIDIA RTX PRO 6000 Blackwell Workstation Edition",
8
  "library_name": "peft",
9
  "pipeline_tag": "text-generation",
10
- "timestamp": "2026-08-04T16:12:54.225570",
11
  "hyperparameters": {
12
  "lora_r": 16,
13
  "lora_alpha": 32,
@@ -16,7 +16,7 @@
16
  "quantization": null,
17
  "lr": 0.0002,
18
  "num_epochs": 1,
19
- "batch_size": 4,
20
  "gradient_accumulation_steps": 4,
21
  "max_seq_length": 1024,
22
  "warmup_ratio": 0.1,
 
2
  "model": "Qwen/Qwen3.5-9B",
3
  "model_sha": "c202236235762e1c871ad0ccb60c8ee5ba337b9a",
4
  "dataset": "full_string_distribution",
5
+ "dataset_sha": "bed59feca08a07d738247ae72cca67a6facf4b7d",
6
  "subpopulation": "overall",
7
+ "gpu": "NVIDIA A40",
8
  "library_name": "peft",
9
  "pipeline_tag": "text-generation",
10
+ "timestamp": "2026-08-10T21:46:58.517058",
11
  "hyperparameters": {
12
  "lora_r": 16,
13
  "lora_alpha": 32,
 
16
  "quantization": null,
17
  "lr": 0.0002,
18
  "num_epochs": 1,
19
+ "batch_size": 2,
20
  "gradient_accumulation_steps": 4,
21
  "max_seq_length": 1024,
22
  "warmup_ratio": 0.1,
optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8929c85db67e3e1ed07e29c48c5631508d57bfff464ca2f05c0695bdb285085f
3
+ size 233003659
scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8d028ebc8984a5d698f763a5fa448f6eade1019173e63e1230346870368c3c88
3
+ size 1465
trainer_state.json ADDED
@@ -0,0 +1,267 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 1.0,
6
+ "eval_steps": 10,
7
+ "global_step": 154,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.06504065040650407,
14
+ "grad_norm": 55.47663497924805,
15
+ "learning_rate": 0.00011250000000000001,
16
+ "loss": 8.703079986572266,
17
+ "step": 10
18
+ },
19
+ {
20
+ "epoch": 0.06504065040650407,
21
+ "eval_loss": 1.79399573802948,
22
+ "eval_runtime": 93.2017,
23
+ "eval_samples_per_second": 2.961,
24
+ "eval_steps_per_second": 1.481,
25
+ "step": 10
26
+ },
27
+ {
28
+ "epoch": 0.13008130081300814,
29
+ "grad_norm": 18.564268112182617,
30
+ "learning_rate": 0.0001956521739130435,
31
+ "loss": 6.914659881591797,
32
+ "step": 20
33
+ },
34
+ {
35
+ "epoch": 0.13008130081300814,
36
+ "eval_loss": 1.4378732442855835,
37
+ "eval_runtime": 92.8107,
38
+ "eval_samples_per_second": 2.974,
39
+ "eval_steps_per_second": 1.487,
40
+ "step": 20
41
+ },
42
+ {
43
+ "epoch": 0.1951219512195122,
44
+ "grad_norm": 6.949378490447998,
45
+ "learning_rate": 0.00018115942028985507,
46
+ "loss": 5.270082092285156,
47
+ "step": 30
48
+ },
49
+ {
50
+ "epoch": 0.1951219512195122,
51
+ "eval_loss": 1.3564187288284302,
52
+ "eval_runtime": 92.968,
53
+ "eval_samples_per_second": 2.969,
54
+ "eval_steps_per_second": 1.484,
55
+ "step": 30
56
+ },
57
+ {
58
+ "epoch": 0.2601626016260163,
59
+ "grad_norm": 18.938419342041016,
60
+ "learning_rate": 0.0001666666666666667,
61
+ "loss": 5.4691619873046875,
62
+ "step": 40
63
+ },
64
+ {
65
+ "epoch": 0.2601626016260163,
66
+ "eval_loss": 1.2968977689743042,
67
+ "eval_runtime": 92.9333,
68
+ "eval_samples_per_second": 2.97,
69
+ "eval_steps_per_second": 1.485,
70
+ "step": 40
71
+ },
72
+ {
73
+ "epoch": 0.3252032520325203,
74
+ "grad_norm": 4.205469131469727,
75
+ "learning_rate": 0.00015217391304347827,
76
+ "loss": 4.866386032104492,
77
+ "step": 50
78
+ },
79
+ {
80
+ "epoch": 0.3252032520325203,
81
+ "eval_loss": 1.3045886754989624,
82
+ "eval_runtime": 92.8006,
83
+ "eval_samples_per_second": 2.974,
84
+ "eval_steps_per_second": 1.487,
85
+ "step": 50
86
+ },
87
+ {
88
+ "epoch": 0.3902439024390244,
89
+ "grad_norm": 6.2034478187561035,
90
+ "learning_rate": 0.00013768115942028986,
91
+ "loss": 5.203897476196289,
92
+ "step": 60
93
+ },
94
+ {
95
+ "epoch": 0.3902439024390244,
96
+ "eval_loss": 1.2741440534591675,
97
+ "eval_runtime": 92.7552,
98
+ "eval_samples_per_second": 2.976,
99
+ "eval_steps_per_second": 1.488,
100
+ "step": 60
101
+ },
102
+ {
103
+ "epoch": 0.45528455284552843,
104
+ "grad_norm": 5.329586029052734,
105
+ "learning_rate": 0.00012318840579710145,
106
+ "loss": 5.226799392700196,
107
+ "step": 70
108
+ },
109
+ {
110
+ "epoch": 0.45528455284552843,
111
+ "eval_loss": 1.2608736753463745,
112
+ "eval_runtime": 92.7677,
113
+ "eval_samples_per_second": 2.975,
114
+ "eval_steps_per_second": 1.488,
115
+ "step": 70
116
+ },
117
+ {
118
+ "epoch": 0.5203252032520326,
119
+ "grad_norm": 6.022779941558838,
120
+ "learning_rate": 0.00010869565217391305,
121
+ "loss": 4.7585094451904295,
122
+ "step": 80
123
+ },
124
+ {
125
+ "epoch": 0.5203252032520326,
126
+ "eval_loss": 1.2409065961837769,
127
+ "eval_runtime": 92.9603,
128
+ "eval_samples_per_second": 2.969,
129
+ "eval_steps_per_second": 1.485,
130
+ "step": 80
131
+ },
132
+ {
133
+ "epoch": 0.5853658536585366,
134
+ "grad_norm": 6.975116729736328,
135
+ "learning_rate": 9.420289855072463e-05,
136
+ "loss": 5.141559982299805,
137
+ "step": 90
138
+ },
139
+ {
140
+ "epoch": 0.5853658536585366,
141
+ "eval_loss": 1.2473307847976685,
142
+ "eval_runtime": 93.0257,
143
+ "eval_samples_per_second": 2.967,
144
+ "eval_steps_per_second": 1.483,
145
+ "step": 90
146
+ },
147
+ {
148
+ "epoch": 0.6504065040650406,
149
+ "grad_norm": 5.658397197723389,
150
+ "learning_rate": 7.971014492753623e-05,
151
+ "loss": 4.915719604492187,
152
+ "step": 100
153
+ },
154
+ {
155
+ "epoch": 0.6504065040650406,
156
+ "eval_loss": 1.2207982540130615,
157
+ "eval_runtime": 92.9926,
158
+ "eval_samples_per_second": 2.968,
159
+ "eval_steps_per_second": 1.484,
160
+ "step": 100
161
+ },
162
+ {
163
+ "epoch": 0.7154471544715447,
164
+ "grad_norm": 4.068330764770508,
165
+ "learning_rate": 6.521739130434783e-05,
166
+ "loss": 4.71471939086914,
167
+ "step": 110
168
+ },
169
+ {
170
+ "epoch": 0.7154471544715447,
171
+ "eval_loss": 1.2062972784042358,
172
+ "eval_runtime": 93.0862,
173
+ "eval_samples_per_second": 2.965,
174
+ "eval_steps_per_second": 1.482,
175
+ "step": 110
176
+ },
177
+ {
178
+ "epoch": 0.7804878048780488,
179
+ "grad_norm": 4.539018154144287,
180
+ "learning_rate": 5.072463768115943e-05,
181
+ "loss": 5.122110748291016,
182
+ "step": 120
183
+ },
184
+ {
185
+ "epoch": 0.7804878048780488,
186
+ "eval_loss": 1.1862434148788452,
187
+ "eval_runtime": 92.8886,
188
+ "eval_samples_per_second": 2.971,
189
+ "eval_steps_per_second": 1.486,
190
+ "step": 120
191
+ },
192
+ {
193
+ "epoch": 0.8455284552845529,
194
+ "grad_norm": 2.0783629417419434,
195
+ "learning_rate": 3.6231884057971014e-05,
196
+ "loss": 5.124646377563477,
197
+ "step": 130
198
+ },
199
+ {
200
+ "epoch": 0.8455284552845529,
201
+ "eval_loss": 1.1823657751083374,
202
+ "eval_runtime": 93.3157,
203
+ "eval_samples_per_second": 2.958,
204
+ "eval_steps_per_second": 1.479,
205
+ "step": 130
206
+ },
207
+ {
208
+ "epoch": 0.9105691056910569,
209
+ "grad_norm": 2.456535816192627,
210
+ "learning_rate": 2.173913043478261e-05,
211
+ "loss": 4.650765609741211,
212
+ "step": 140
213
+ },
214
+ {
215
+ "epoch": 0.9105691056910569,
216
+ "eval_loss": 1.1808730363845825,
217
+ "eval_runtime": 93.0255,
218
+ "eval_samples_per_second": 2.967,
219
+ "eval_steps_per_second": 1.483,
220
+ "step": 140
221
+ },
222
+ {
223
+ "epoch": 0.975609756097561,
224
+ "grad_norm": 3.2700843811035156,
225
+ "learning_rate": 7.246376811594203e-06,
226
+ "loss": 4.547821807861328,
227
+ "step": 150
228
+ },
229
+ {
230
+ "epoch": 0.975609756097561,
231
+ "eval_loss": 1.1744519472122192,
232
+ "eval_runtime": 92.9911,
233
+ "eval_samples_per_second": 2.968,
234
+ "eval_steps_per_second": 1.484,
235
+ "step": 150
236
+ },
237
+ {
238
+ "epoch": 1.0,
239
+ "eval_loss": 1.1732834577560425,
240
+ "eval_runtime": 93.2831,
241
+ "eval_samples_per_second": 2.959,
242
+ "eval_steps_per_second": 1.479,
243
+ "step": 154
244
+ }
245
+ ],
246
+ "logging_steps": 10,
247
+ "max_steps": 154,
248
+ "num_input_tokens_seen": 0,
249
+ "num_train_epochs": 1,
250
+ "save_steps": 200,
251
+ "stateful_callbacks": {
252
+ "TrainerControl": {
253
+ "args": {
254
+ "should_epoch_stop": false,
255
+ "should_evaluate": false,
256
+ "should_log": false,
257
+ "should_save": true,
258
+ "should_training_stop": true
259
+ },
260
+ "attributes": {}
261
+ }
262
+ },
263
+ "total_flos": 5.38753752607488e+16,
264
+ "train_batch_size": 2,
265
+ "trial_name": null,
266
+ "trial_params": null
267
+ }
training.log CHANGED
@@ -56,3 +56,55 @@ HTTP Request: POST https://huggingface.co/api/repos/create "HTTP/1.1 200 OK"
56
  [upload] uploading output/full_string_distribution/overall to https://huggingface.co/1jamesthompson1/Qwen3.5-9B-nz-wvs-full_string_distribution-overall...
57
  HTTP Request: POST https://huggingface.co/api/validate-yaml "HTTP/1.1 200 OK"
58
  HTTP Request: POST https://huggingface.co/api/models/1jamesthompson1/Qwen3.5-9B-nz-wvs-full_string_distribution-overall/preupload/main "HTTP/1.1 200 OK"
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
56
  [upload] uploading output/full_string_distribution/overall to https://huggingface.co/1jamesthompson1/Qwen3.5-9B-nz-wvs-full_string_distribution-overall...
57
  HTTP Request: POST https://huggingface.co/api/validate-yaml "HTTP/1.1 200 OK"
58
  HTTP Request: POST https://huggingface.co/api/models/1jamesthompson1/Qwen3.5-9B-nz-wvs-full_string_distribution-overall/preupload/main "HTTP/1.1 200 OK"
59
+ HTTP Request: POST https://huggingface.co/api/models/1jamesthompson1/Qwen3.5-9B-nz-wvs-full_string_distribution-overall/commit/main "HTTP/1.1 200 OK"
60
+ HTTP Request: GET https://huggingface.co/api/whoami-v2 "HTTP/1.1 200 OK"
61
+ HTTP Request: POST https://huggingface.co/api/collections "HTTP/1.1 409 Conflict"
62
+ HTTP Request: GET https://huggingface.co/api/collections/1jamesthompson1/wvs-nz-value-alignment-6a694dfd6dfcffbe0cd124ed "HTTP/1.1 200 OK"
63
+ HTTP Request: POST https://huggingface.co/api/collections/1jamesthompson1/wvs-nz-value-alignment-6a694dfd6dfcffbe0cd124ed/items "HTTP/1.1 200 OK"
64
+ [upload] added to collection 1jamesthompson1/wvs-nz-value-alignment-6a694dfd6dfcffbe0cd124ed
65
+ [upload] done — https://huggingface.co/1jamesthompson1/Qwen3.5-9B-nz-wvs-full_string_distribution-overall
66
+
67
+ [done] uploaded to 1jamesthompson1/Qwen3.5-9B-nz-wvs-full_string_distribution-overall
68
+ logging to output/full_string_distribution/overall/training.log
69
+ [dist] loading tokenizer...
70
+ [dist] tokenizing 1230 examples...
71
+ [dist] 6470 options/completions across 1230 examples
72
+ [dist] tokenizing validation split for eval...
73
+ [data] loaded 276 validation examples (config=full_string_distribution, subpop=overall)
74
+ [dist] eval split: 276 examples
75
+ [dist] loading model...
76
+ [dist] starting training...
77
+ logging to output/full_string_distribution/overall/training.log
78
+ [dist] loading tokenizer...
79
+ [dist] tokenizing 1230 examples...
80
+ [dist] 6470 options/completions across 1230 examples
81
+ [dist] tokenizing validation split for eval...
82
+ [data] loaded 276 validation examples (config=full_string_distribution, subpop=overall)
83
+ [dist] eval split: 276 examples
84
+ [dist] loading model...
85
+ [dist] starting training...
86
+ logging to output/full_string_distribution/overall/training.log
87
+ [dist] loading tokenizer...
88
+ [dist] tokenizing 1230 examples...
89
+ [dist] 6470 options/completions across 1230 examples
90
+ [dist] tokenizing validation split for eval...
91
+ [data] loaded 276 validation examples (config=full_string_distribution, subpop=overall)
92
+ [dist] eval split: 276 examples
93
+ [dist] loading model...
94
+ [dist] starting training...
95
+ logging to output/full_string_distribution/overall/training.log
96
+ [dist] loading tokenizer...
97
+ [dist] tokenizing 1230 examples...
98
+ [dist] 6470 options/completions across 1230 examples
99
+ [dist] tokenizing validation split for eval...
100
+ [data] loaded 276 validation examples (config=full_string_distribution, subpop=overall)
101
+ [dist] eval split: 276 examples
102
+ [dist] loading model...
103
+ [dist] starting training...
104
+ [dist] saving...
105
+ [resume] staged continuation state from output/full_string_distribution/overall/checkpoint-154: ['optimizer.pt', 'scheduler.pt', 'trainer_state.json']
106
+ training log -> output/full_string_distribution/overall/training_log.json
107
+ run metadata -> output/full_string_distribution/overall/finetune_config.json
108
+ environment -> output/full_string_distribution/overall/environment.json
109
+ README -> output/full_string_distribution/overall/README.md
110
+ [upload] uploading output/full_string_distribution/overall to https://huggingface.co/1jamesthompson1/Qwen3.5-9B-nz-wvs-full_string_distribution-overall...
training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:5becab0e45d81e41facd8d2469fb421b25401242f1519b58f9e42b0972848826
3
  size 5201
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e9a760a83555cfa15ebfbbe812e695cdce2c99e115740c00c6f623bb6d0454e7
3
  size 5201
training_log.json CHANGED
@@ -1,124 +1,244 @@
1
  [
2
  {
3
- "loss": 8.111881256103516,
4
- "grad_norm": 36.93735122680664,
5
- "learning_rate": 0.00019705882352941177,
6
- "epoch": 0.13245033112582782,
7
  "step": 10
8
  },
9
  {
10
- "eval_loss": 1.8344852924346924,
11
- "eval_runtime": 16.4711,
12
- "eval_samples_per_second": 9.107,
13
- "eval_steps_per_second": 2.307,
14
- "epoch": 0.13245033112582782,
15
  "step": 10
16
  },
17
  {
18
- "loss": 6.350960540771484,
19
- "grad_norm": 8.284809112548828,
20
- "learning_rate": 0.00016764705882352942,
21
- "epoch": 0.26490066225165565,
22
  "step": 20
23
  },
24
  {
25
- "eval_loss": 1.3456758260726929,
26
- "eval_runtime": 16.8028,
27
- "eval_samples_per_second": 8.927,
28
- "eval_steps_per_second": 2.262,
29
- "epoch": 0.26490066225165565,
30
  "step": 20
31
  },
32
  {
33
- "loss": 5.212066268920898,
34
- "grad_norm": 8.698701858520508,
35
- "learning_rate": 0.00013823529411764707,
36
- "epoch": 0.3973509933774834,
37
  "step": 30
38
  },
39
  {
40
- "eval_loss": 1.2856894731521606,
41
- "eval_runtime": 16.8725,
42
- "eval_samples_per_second": 8.89,
43
- "eval_steps_per_second": 2.252,
44
- "epoch": 0.3973509933774834,
45
  "step": 30
46
  },
47
  {
48
- "loss": 5.230597305297851,
49
- "grad_norm": 4.453671455383301,
50
- "learning_rate": 0.0001088235294117647,
51
- "epoch": 0.5298013245033113,
52
  "step": 40
53
  },
54
  {
55
- "eval_loss": 1.266767978668213,
56
- "eval_runtime": 16.9175,
57
- "eval_samples_per_second": 8.867,
58
- "eval_steps_per_second": 2.246,
59
- "epoch": 0.5298013245033113,
60
  "step": 40
61
  },
62
  {
63
- "loss": 5.069366836547852,
64
- "grad_norm": 3.493168354034424,
65
- "learning_rate": 7.941176470588235e-05,
66
- "epoch": 0.6622516556291391,
67
  "step": 50
68
  },
69
  {
70
- "eval_loss": 1.2818269729614258,
71
- "eval_runtime": 16.9098,
72
- "eval_samples_per_second": 8.871,
73
- "eval_steps_per_second": 2.247,
74
- "epoch": 0.6622516556291391,
75
  "step": 50
76
  },
77
  {
78
- "loss": 4.989227676391602,
79
- "grad_norm": 4.791518211364746,
80
- "learning_rate": 5e-05,
81
- "epoch": 0.7947019867549668,
82
  "step": 60
83
  },
84
  {
85
- "eval_loss": 1.2685493230819702,
86
- "eval_runtime": 16.9053,
87
- "eval_samples_per_second": 8.873,
88
- "eval_steps_per_second": 2.248,
89
- "epoch": 0.7947019867549668,
90
  "step": 60
91
  },
92
  {
93
- "loss": 4.609055709838867,
94
- "grad_norm": 2.6835153102874756,
95
- "learning_rate": 2.058823529411765e-05,
96
- "epoch": 0.9271523178807947,
97
  "step": 70
98
  },
99
  {
100
- "eval_loss": 1.2449450492858887,
101
- "eval_runtime": 16.924,
102
- "eval_samples_per_second": 8.863,
103
- "eval_steps_per_second": 2.245,
104
- "epoch": 0.9271523178807947,
105
  "step": 70
106
  },
107
  {
108
- "eval_loss": 1.2424073219299316,
109
- "eval_runtime": 16.9059,
110
- "eval_samples_per_second": 8.873,
111
- "eval_steps_per_second": 2.248,
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
112
  "epoch": 1.0,
113
- "step": 76
114
  },
115
  {
116
- "train_runtime": 828.4429,
117
- "train_samples_per_second": 1.456,
118
- "train_steps_per_second": 0.092,
119
- "total_flos": 7.64036915963566e+16,
120
- "train_loss": 5.566998130396793,
121
  "epoch": 1.0,
122
- "step": 76
123
  }
124
  ]
 
1
  [
2
  {
3
+ "loss": 8.703079986572266,
4
+ "grad_norm": 55.47663497924805,
5
+ "learning_rate": 0.00011250000000000001,
6
+ "epoch": 0.06504065040650407,
7
  "step": 10
8
  },
9
  {
10
+ "eval_loss": 1.79399573802948,
11
+ "eval_runtime": 93.2017,
12
+ "eval_samples_per_second": 2.961,
13
+ "eval_steps_per_second": 1.481,
14
+ "epoch": 0.06504065040650407,
15
  "step": 10
16
  },
17
  {
18
+ "loss": 6.914659881591797,
19
+ "grad_norm": 18.564268112182617,
20
+ "learning_rate": 0.0001956521739130435,
21
+ "epoch": 0.13008130081300814,
22
  "step": 20
23
  },
24
  {
25
+ "eval_loss": 1.4378732442855835,
26
+ "eval_runtime": 92.8107,
27
+ "eval_samples_per_second": 2.974,
28
+ "eval_steps_per_second": 1.487,
29
+ "epoch": 0.13008130081300814,
30
  "step": 20
31
  },
32
  {
33
+ "loss": 5.270082092285156,
34
+ "grad_norm": 6.949378490447998,
35
+ "learning_rate": 0.00018115942028985507,
36
+ "epoch": 0.1951219512195122,
37
  "step": 30
38
  },
39
  {
40
+ "eval_loss": 1.3564187288284302,
41
+ "eval_runtime": 92.968,
42
+ "eval_samples_per_second": 2.969,
43
+ "eval_steps_per_second": 1.484,
44
+ "epoch": 0.1951219512195122,
45
  "step": 30
46
  },
47
  {
48
+ "loss": 5.4691619873046875,
49
+ "grad_norm": 18.938419342041016,
50
+ "learning_rate": 0.0001666666666666667,
51
+ "epoch": 0.2601626016260163,
52
  "step": 40
53
  },
54
  {
55
+ "eval_loss": 1.2968977689743042,
56
+ "eval_runtime": 92.9333,
57
+ "eval_samples_per_second": 2.97,
58
+ "eval_steps_per_second": 1.485,
59
+ "epoch": 0.2601626016260163,
60
  "step": 40
61
  },
62
  {
63
+ "loss": 4.866386032104492,
64
+ "grad_norm": 4.205469131469727,
65
+ "learning_rate": 0.00015217391304347827,
66
+ "epoch": 0.3252032520325203,
67
  "step": 50
68
  },
69
  {
70
+ "eval_loss": 1.3045886754989624,
71
+ "eval_runtime": 92.8006,
72
+ "eval_samples_per_second": 2.974,
73
+ "eval_steps_per_second": 1.487,
74
+ "epoch": 0.3252032520325203,
75
  "step": 50
76
  },
77
  {
78
+ "loss": 5.203897476196289,
79
+ "grad_norm": 6.2034478187561035,
80
+ "learning_rate": 0.00013768115942028986,
81
+ "epoch": 0.3902439024390244,
82
  "step": 60
83
  },
84
  {
85
+ "eval_loss": 1.2741440534591675,
86
+ "eval_runtime": 92.7552,
87
+ "eval_samples_per_second": 2.976,
88
+ "eval_steps_per_second": 1.488,
89
+ "epoch": 0.3902439024390244,
90
  "step": 60
91
  },
92
  {
93
+ "loss": 5.226799392700196,
94
+ "grad_norm": 5.329586029052734,
95
+ "learning_rate": 0.00012318840579710145,
96
+ "epoch": 0.45528455284552843,
97
  "step": 70
98
  },
99
  {
100
+ "eval_loss": 1.2608736753463745,
101
+ "eval_runtime": 92.7677,
102
+ "eval_samples_per_second": 2.975,
103
+ "eval_steps_per_second": 1.488,
104
+ "epoch": 0.45528455284552843,
105
  "step": 70
106
  },
107
  {
108
+ "loss": 4.7585094451904295,
109
+ "grad_norm": 6.022779941558838,
110
+ "learning_rate": 0.00010869565217391305,
111
+ "epoch": 0.5203252032520326,
112
+ "step": 80
113
+ },
114
+ {
115
+ "eval_loss": 1.2409065961837769,
116
+ "eval_runtime": 92.9603,
117
+ "eval_samples_per_second": 2.969,
118
+ "eval_steps_per_second": 1.485,
119
+ "epoch": 0.5203252032520326,
120
+ "step": 80
121
+ },
122
+ {
123
+ "loss": 5.141559982299805,
124
+ "grad_norm": 6.975116729736328,
125
+ "learning_rate": 9.420289855072463e-05,
126
+ "epoch": 0.5853658536585366,
127
+ "step": 90
128
+ },
129
+ {
130
+ "eval_loss": 1.2473307847976685,
131
+ "eval_runtime": 93.0257,
132
+ "eval_samples_per_second": 2.967,
133
+ "eval_steps_per_second": 1.483,
134
+ "epoch": 0.5853658536585366,
135
+ "step": 90
136
+ },
137
+ {
138
+ "loss": 4.915719604492187,
139
+ "grad_norm": 5.658397197723389,
140
+ "learning_rate": 7.971014492753623e-05,
141
+ "epoch": 0.6504065040650406,
142
+ "step": 100
143
+ },
144
+ {
145
+ "eval_loss": 1.2207982540130615,
146
+ "eval_runtime": 92.9926,
147
+ "eval_samples_per_second": 2.968,
148
+ "eval_steps_per_second": 1.484,
149
+ "epoch": 0.6504065040650406,
150
+ "step": 100
151
+ },
152
+ {
153
+ "loss": 4.71471939086914,
154
+ "grad_norm": 4.068330764770508,
155
+ "learning_rate": 6.521739130434783e-05,
156
+ "epoch": 0.7154471544715447,
157
+ "step": 110
158
+ },
159
+ {
160
+ "eval_loss": 1.2062972784042358,
161
+ "eval_runtime": 93.0862,
162
+ "eval_samples_per_second": 2.965,
163
+ "eval_steps_per_second": 1.482,
164
+ "epoch": 0.7154471544715447,
165
+ "step": 110
166
+ },
167
+ {
168
+ "loss": 5.122110748291016,
169
+ "grad_norm": 4.539018154144287,
170
+ "learning_rate": 5.072463768115943e-05,
171
+ "epoch": 0.7804878048780488,
172
+ "step": 120
173
+ },
174
+ {
175
+ "eval_loss": 1.1862434148788452,
176
+ "eval_runtime": 92.8886,
177
+ "eval_samples_per_second": 2.971,
178
+ "eval_steps_per_second": 1.486,
179
+ "epoch": 0.7804878048780488,
180
+ "step": 120
181
+ },
182
+ {
183
+ "loss": 5.124646377563477,
184
+ "grad_norm": 2.0783629417419434,
185
+ "learning_rate": 3.6231884057971014e-05,
186
+ "epoch": 0.8455284552845529,
187
+ "step": 130
188
+ },
189
+ {
190
+ "eval_loss": 1.1823657751083374,
191
+ "eval_runtime": 93.3157,
192
+ "eval_samples_per_second": 2.958,
193
+ "eval_steps_per_second": 1.479,
194
+ "epoch": 0.8455284552845529,
195
+ "step": 130
196
+ },
197
+ {
198
+ "loss": 4.650765609741211,
199
+ "grad_norm": 2.456535816192627,
200
+ "learning_rate": 2.173913043478261e-05,
201
+ "epoch": 0.9105691056910569,
202
+ "step": 140
203
+ },
204
+ {
205
+ "eval_loss": 1.1808730363845825,
206
+ "eval_runtime": 93.0255,
207
+ "eval_samples_per_second": 2.967,
208
+ "eval_steps_per_second": 1.483,
209
+ "epoch": 0.9105691056910569,
210
+ "step": 140
211
+ },
212
+ {
213
+ "loss": 4.547821807861328,
214
+ "grad_norm": 3.2700843811035156,
215
+ "learning_rate": 7.246376811594203e-06,
216
+ "epoch": 0.975609756097561,
217
+ "step": 150
218
+ },
219
+ {
220
+ "eval_loss": 1.1744519472122192,
221
+ "eval_runtime": 92.9911,
222
+ "eval_samples_per_second": 2.968,
223
+ "eval_steps_per_second": 1.484,
224
+ "epoch": 0.975609756097561,
225
+ "step": 150
226
+ },
227
+ {
228
+ "eval_loss": 1.1732834577560425,
229
+ "eval_runtime": 93.2831,
230
+ "eval_samples_per_second": 2.959,
231
+ "eval_steps_per_second": 1.479,
232
  "epoch": 1.0,
233
+ "step": 154
234
  },
235
  {
236
+ "train_runtime": 3434.9466,
237
+ "train_samples_per_second": 0.358,
238
+ "train_steps_per_second": 0.045,
239
+ "total_flos": 5.38753752607488e+16,
240
+ "train_loss": 5.347667557852609,
241
  "epoch": 1.0,
242
+ "step": 154
243
  }
244
  ]