fc91 commited on
Commit
1ae0b9c
·
verified ·
1 Parent(s): 05e4203

Training in progress, step 100, checkpoint

Browse files
last-checkpoint/adapter_model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:d397d32e454caeeede6ba6b3ea396f8062976cc199ed8b908146eae390366621
3
  size 194563400
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9c52debc52282412e2aa8b8c03dc882545c7506e2e04de9cd91fd713990b5e35
3
  size 194563400
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:93482f2dd4a14e514cd0c572dcac758f3ea7e1906cd2e33efeea332929bac31c
3
  size 99240837
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:62872fd99c0f0b06843bfc20a4fc537acd025aefddb1fd31af42d21a9f5429f8
3
  size 99240837
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:81a2d733348528c1d1612632839661eb622f740721f36359c94febe0ae478617
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c116c2a8c602abd0e289a35bc9bbb94a973d913f8f26addccbf2f5e68e78dbad
3
  size 14645
last-checkpoint/scaler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:9fcfce7e32b31bead77e9e963d8e602c77a653a75c54ecbe876542fbeeba3fdc
3
  size 1383
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c4393a84a3109995aa1202073b039b12062e3189ed89aa0b94ef0510ba843009
3
  size 1383
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:5fa48ce1412cb8d3fc995a86958161f32b67a285ffa5bec336b75ac13d073aba
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f5db2a1ee16d0f9a24fdf7419d14686c02d87df1ccf008ff752eb59f9d58772d
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 4.090909090909091,
6
  "eval_steps": 500,
7
- "global_step": 90,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -1988,11 +1988,231 @@
1988
  "rewards/compute_weighted_reward/mean": -0.41999998688697815,
1989
  "rewards/compute_weighted_reward/std": 0.9323742389678955,
1990
  "step": 90
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1991
  }
1992
  ],
1993
  "logging_steps": 1,
1994
  "max_steps": 1500,
1995
- "num_input_tokens_seen": 3300702,
1996
  "num_train_epochs": 69,
1997
  "save_steps": 10,
1998
  "stateful_callbacks": {
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 4.545454545454545,
6
  "eval_steps": 500,
7
+ "global_step": 100,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
1988
  "rewards/compute_weighted_reward/mean": -0.41999998688697815,
1989
  "rewards/compute_weighted_reward/std": 0.9323742389678955,
1990
  "step": 90
1991
+ },
1992
+ {
1993
+ "completion_length": 974.8333333333334,
1994
+ "completions/clipped_ratio": 0.5,
1995
+ "completions/max_length": 1400.0,
1996
+ "completions/max_terminated_length": 908.0,
1997
+ "completions/mean_length": 976.8333740234375,
1998
+ "completions/mean_terminated_length": 553.6666870117188,
1999
+ "completions/min_length": 371.0,
2000
+ "completions/min_terminated_length": 371.0,
2001
+ "epoch": 4.136363636363637,
2002
+ "frac_reward_zero_std": 0.0,
2003
+ "grad_norm": 0.6058995127677917,
2004
+ "kl": 0.0036607286747312173,
2005
+ "learning_rate": 1.2e-06,
2006
+ "loss": 0.1045,
2007
+ "num_tokens": 3333182.0,
2008
+ "reward": 0.26875004172325134,
2009
+ "reward_std": 1.0469281673431396,
2010
+ "rewards/compute_weighted_reward/mean": 0.26874998211860657,
2011
+ "rewards/compute_weighted_reward/std": 1.6799956560134888,
2012
+ "step": 91
2013
+ },
2014
+ {
2015
+ "completion_length": 1188.9583333333333,
2016
+ "completions/clipped_ratio": 0.5416666666666667,
2017
+ "completions/max_length": 1400.0,
2018
+ "completions/max_terminated_length": 1387.0,
2019
+ "completions/mean_length": 1188.9583740234375,
2020
+ "completions/mean_terminated_length": 939.5454711914062,
2021
+ "completions/min_length": 488.0,
2022
+ "completions/min_terminated_length": 488.0,
2023
+ "epoch": 4.181818181818182,
2024
+ "frac_reward_zero_std": 0.0,
2025
+ "grad_norm": 0.5676044821739197,
2026
+ "kl": 0.003291421138177005,
2027
+ "learning_rate": 1.2133333333333333e-06,
2028
+ "loss": 0.1006,
2029
+ "num_tokens": 3370363.0,
2030
+ "reward": -0.2941666841506958,
2031
+ "reward_std": 1.2139606475830078,
2032
+ "rewards/compute_weighted_reward/mean": -0.2941666543483734,
2033
+ "rewards/compute_weighted_reward/std": 1.2161625623703003,
2034
+ "step": 92
2035
+ },
2036
+ {
2037
+ "completion_length": 1085.4583333333333,
2038
+ "completions/clipped_ratio": 0.5,
2039
+ "completions/max_length": 1400.0,
2040
+ "completions/max_terminated_length": 1255.0,
2041
+ "completions/mean_length": 1085.4583740234375,
2042
+ "completions/mean_terminated_length": 770.9166870117188,
2043
+ "completions/min_length": 297.0,
2044
+ "completions/min_terminated_length": 297.0,
2045
+ "epoch": 4.2272727272727275,
2046
+ "frac_reward_zero_std": 0.0,
2047
+ "grad_norm": 0.6693485379219055,
2048
+ "kl": 0.0045636411814484745,
2049
+ "learning_rate": 1.2266666666666664e-06,
2050
+ "loss": 0.1505,
2051
+ "num_tokens": 3404622.0,
2052
+ "reward": -0.3425000309944153,
2053
+ "reward_std": 1.0440089702606201,
2054
+ "rewards/compute_weighted_reward/mean": -0.3424999713897705,
2055
+ "rewards/compute_weighted_reward/std": 0.9814950823783875,
2056
+ "step": 93
2057
+ },
2058
+ {
2059
+ "completion_length": 1044.0416666666667,
2060
+ "completions/clipped_ratio": 0.5416666666666667,
2061
+ "completions/max_length": 1400.0,
2062
+ "completions/max_terminated_length": 1037.0,
2063
+ "completions/mean_length": 1044.041748046875,
2064
+ "completions/mean_terminated_length": 623.3636474609375,
2065
+ "completions/min_length": 48.0,
2066
+ "completions/min_terminated_length": 48.0,
2067
+ "epoch": 4.2727272727272725,
2068
+ "frac_reward_zero_std": 0.0,
2069
+ "grad_norm": 0.6476233005523682,
2070
+ "kl": 0.005175514816073701,
2071
+ "learning_rate": 1.24e-06,
2072
+ "loss": 0.1359,
2073
+ "num_tokens": 3437971.0,
2074
+ "reward": -0.47833335399627686,
2075
+ "reward_std": 0.8860996961593628,
2076
+ "rewards/compute_weighted_reward/mean": -0.47833332419395447,
2077
+ "rewards/compute_weighted_reward/std": 0.9345524907112122,
2078
+ "step": 94
2079
+ },
2080
+ {
2081
+ "completion_length": 1078.0833333333333,
2082
+ "completions/clipped_ratio": 0.5416666666666667,
2083
+ "completions/max_length": 1400.0,
2084
+ "completions/max_terminated_length": 1215.0,
2085
+ "completions/mean_length": 1078.0833740234375,
2086
+ "completions/mean_terminated_length": 697.6364135742188,
2087
+ "completions/min_length": 352.0,
2088
+ "completions/min_terminated_length": 352.0,
2089
+ "epoch": 4.318181818181818,
2090
+ "frac_reward_zero_std": 0.25,
2091
+ "grad_norm": 0.5297577381134033,
2092
+ "kl": 0.005124464087809126,
2093
+ "learning_rate": 1.2533333333333333e-06,
2094
+ "loss": 0.0919,
2095
+ "num_tokens": 3471915.0,
2096
+ "reward": -0.5570833683013916,
2097
+ "reward_std": 0.743101954460144,
2098
+ "rewards/compute_weighted_reward/mean": -0.5570833086967468,
2099
+ "rewards/compute_weighted_reward/std": 0.9160429835319519,
2100
+ "step": 95
2101
+ },
2102
+ {
2103
+ "completion_length": 1209.375,
2104
+ "completions/clipped_ratio": 0.7083333333333333,
2105
+ "completions/max_length": 1400.0,
2106
+ "completions/max_terminated_length": 1287.0,
2107
+ "completions/mean_length": 1209.375,
2108
+ "completions/mean_terminated_length": 746.4285888671875,
2109
+ "completions/min_length": 51.0,
2110
+ "completions/min_terminated_length": 51.0,
2111
+ "epoch": 4.363636363636363,
2112
+ "frac_reward_zero_std": 0.25,
2113
+ "grad_norm": 0.6037044525146484,
2114
+ "kl": 0.005498341323497395,
2115
+ "learning_rate": 1.2666666666666665e-06,
2116
+ "loss": 0.0587,
2117
+ "num_tokens": 3509178.0,
2118
+ "reward": -0.7341666221618652,
2119
+ "reward_std": 0.5504173040390015,
2120
+ "rewards/compute_weighted_reward/mean": -0.73416668176651,
2121
+ "rewards/compute_weighted_reward/std": 0.8664366006851196,
2122
+ "step": 96
2123
+ },
2124
+ {
2125
+ "completion_length": 1162.0,
2126
+ "completions/clipped_ratio": 0.625,
2127
+ "completions/max_length": 1400.0,
2128
+ "completions/max_terminated_length": 1223.0,
2129
+ "completions/mean_length": 1162.0,
2130
+ "completions/mean_terminated_length": 765.3333129882812,
2131
+ "completions/min_length": 462.0,
2132
+ "completions/min_terminated_length": 462.0,
2133
+ "epoch": 4.409090909090909,
2134
+ "frac_reward_zero_std": 0.25,
2135
+ "grad_norm": 0.6083352565765381,
2136
+ "kl": 0.007090592368816336,
2137
+ "learning_rate": 1.28e-06,
2138
+ "loss": 0.1455,
2139
+ "num_tokens": 3545394.0,
2140
+ "reward": -0.5695833563804626,
2141
+ "reward_std": 0.7859379053115845,
2142
+ "rewards/compute_weighted_reward/mean": -0.5695833563804626,
2143
+ "rewards/compute_weighted_reward/std": 0.9432252049446106,
2144
+ "step": 97
2145
+ },
2146
+ {
2147
+ "completion_length": 1135.9166666666667,
2148
+ "completions/clipped_ratio": 0.625,
2149
+ "completions/max_length": 1400.0,
2150
+ "completions/max_terminated_length": 1101.0,
2151
+ "completions/mean_length": 1159.041748046875,
2152
+ "completions/mean_terminated_length": 757.4444580078125,
2153
+ "completions/min_length": 496.0,
2154
+ "completions/min_terminated_length": 496.0,
2155
+ "epoch": 4.454545454545454,
2156
+ "frac_reward_zero_std": 0.0,
2157
+ "grad_norm": 0.7465776801109314,
2158
+ "kl": 0.0063691134079514695,
2159
+ "learning_rate": 1.2933333333333332e-06,
2160
+ "loss": 0.1078,
2161
+ "num_tokens": 3582205.0,
2162
+ "reward": -0.36000001430511475,
2163
+ "reward_std": 1.0805914402008057,
2164
+ "rewards/compute_weighted_reward/mean": -0.35999998450279236,
2165
+ "rewards/compute_weighted_reward/std": 1.0936933755874634,
2166
+ "step": 98
2167
+ },
2168
+ {
2169
+ "completion_length": 1235.5833333333333,
2170
+ "completions/clipped_ratio": 0.6666666666666667,
2171
+ "completions/max_length": 1400.0,
2172
+ "completions/max_terminated_length": 1126.0,
2173
+ "completions/mean_length": 1235.5833740234375,
2174
+ "completions/mean_terminated_length": 906.75,
2175
+ "completions/min_length": 315.0,
2176
+ "completions/min_terminated_length": 315.0,
2177
+ "epoch": 4.5,
2178
+ "frac_reward_zero_std": 0.0,
2179
+ "grad_norm": 0.7566038966178894,
2180
+ "kl": 0.00896931966417469,
2181
+ "learning_rate": 1.3066666666666665e-06,
2182
+ "loss": 0.1517,
2183
+ "num_tokens": 3620709.0,
2184
+ "reward": -0.8066667318344116,
2185
+ "reward_std": 0.6958996057510376,
2186
+ "rewards/compute_weighted_reward/mean": -0.8066666722297668,
2187
+ "rewards/compute_weighted_reward/std": 0.7807168960571289,
2188
+ "step": 99
2189
+ },
2190
+ {
2191
+ "completion_length": 1026.3333333333333,
2192
+ "completions/clipped_ratio": 0.5416666666666667,
2193
+ "completions/max_length": 1400.0,
2194
+ "completions/max_terminated_length": 1100.0,
2195
+ "completions/mean_length": 1026.3333740234375,
2196
+ "completions/mean_terminated_length": 584.727294921875,
2197
+ "completions/min_length": 149.0,
2198
+ "completions/min_terminated_length": 149.0,
2199
+ "epoch": 4.545454545454545,
2200
+ "frac_reward_zero_std": 0.0,
2201
+ "grad_norm": 0.7430728673934937,
2202
+ "kl": 0.00684088855147517,
2203
+ "learning_rate": 1.32e-06,
2204
+ "loss": 0.1119,
2205
+ "num_tokens": 3653873.0,
2206
+ "reward": -0.3241666555404663,
2207
+ "reward_std": 0.7433856725692749,
2208
+ "rewards/compute_weighted_reward/mean": -0.3241666555404663,
2209
+ "rewards/compute_weighted_reward/std": 1.124342918395996,
2210
+ "step": 100
2211
  }
2212
  ],
2213
  "logging_steps": 1,
2214
  "max_steps": 1500,
2215
+ "num_input_tokens_seen": 3653873,
2216
  "num_train_epochs": 69,
2217
  "save_steps": 10,
2218
  "stateful_callbacks": {