lanabarwari commited on
Commit
a07c7c1
·
verified ·
1 Parent(s): 176e403

Upload folder using huggingface_hub

Browse files
Files changed (3) hide show
  1. multitask_config.json +7 -0
  2. tokenizer.json +0 -0
  3. tokenizer_config.json +213 -0
multitask_config.json ADDED
@@ -0,0 +1,7 @@
 
 
 
 
 
 
 
 
1
+ {
2
+ "model_name": "asosoft/KuBERT-Central-Kurdish-BERT-Model",
3
+ "num_sentiment": 3,
4
+ "num_offensive": 2,
5
+ "dropout": 0.2,
6
+ "vocab_size": 50259
7
+ }
tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
tokenizer_config.json ADDED
@@ -0,0 +1,213 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "clean_up_tokenization_spaces": true,
6
+ "cls_token": "[CLS]",
7
+ "do_basic_tokenize": true,
8
+ "do_lower_case": true,
9
+ "eos_token": "<|endoftext|>",
10
+ "errors": "replace",
11
+ "extra_special_tokens": [
12
+ "<|endoftext|>",
13
+ "<|startoftranscript|>",
14
+ "<|¡|>",
15
+ "<|¢|>",
16
+ "<|£|>",
17
+ "<|¤|>",
18
+ "<|¥|>",
19
+ "<|¦|>",
20
+ "<|§|>",
21
+ "<|¨|>",
22
+ "<|©|>",
23
+ "<|ª|>",
24
+ "<|«|>",
25
+ "<|¬|>",
26
+ "<|®|>",
27
+ "<|¯|>",
28
+ "<|°|>",
29
+ "<|±|>",
30
+ "<|²|>",
31
+ "<|³|>",
32
+ "<|´|>",
33
+ "<|µ|>",
34
+ "<|¶|>",
35
+ "<|·|>",
36
+ "<|¸|>",
37
+ "<|¹|>",
38
+ "<|º|>",
39
+ "<|»|>",
40
+ "<|¼|>",
41
+ "<|½|>",
42
+ "<|¾|>",
43
+ "<|¿|>",
44
+ "<|À|>",
45
+ "<|Á|>",
46
+ "<|Â|>",
47
+ "<|Ã|>",
48
+ "<|Ä|>",
49
+ "<|Å|>",
50
+ "<|Æ|>",
51
+ "<|Ç|>",
52
+ "<|È|>",
53
+ "<|É|>",
54
+ "<|Ê|>",
55
+ "<|Ë|>",
56
+ "<|Ì|>",
57
+ "<|Í|>",
58
+ "<|Î|>",
59
+ "<|Ï|>",
60
+ "<|Ð|>",
61
+ "<|Ñ|>",
62
+ "<|Ò|>",
63
+ "<|Ó|>",
64
+ "<|Ô|>",
65
+ "<|Õ|>",
66
+ "<|Ö|>",
67
+ "<|×|>",
68
+ "<|Ø|>",
69
+ "<|Ù|>",
70
+ "<|Ú|>",
71
+ "<|Û|>",
72
+ "<|Ü|>",
73
+ "<|Ý|>",
74
+ "<|Þ|>",
75
+ "<|ß|>",
76
+ "<|à|>",
77
+ "<|á|>",
78
+ "<|â|>",
79
+ "<|ã|>",
80
+ "<|ä|>",
81
+ "<|å|>",
82
+ "<|æ|>",
83
+ "<|ç|>",
84
+ "<|è|>",
85
+ "<|é|>",
86
+ "<|ê|>",
87
+ "<|ë|>",
88
+ "<|ì|>",
89
+ "<|í|>",
90
+ "<|î|>",
91
+ "<|ï|>",
92
+ "<|ð|>",
93
+ "<|ñ|>",
94
+ "<|ò|>",
95
+ "<|ó|>",
96
+ "<|ô|>",
97
+ "<|õ|>",
98
+ "<|ö|>",
99
+ "<|÷|>",
100
+ "<|ø|>",
101
+ "<|ù|>",
102
+ "<|ú|>",
103
+ "<|û|>",
104
+ "<|ü|>",
105
+ "<|ý|>",
106
+ "<|þ|>",
107
+ "<|ÿ|>",
108
+ "<|Ā|>",
109
+ "<|ā|>",
110
+ "<|Ă|>",
111
+ "<|ă|>",
112
+ "<|Ą|>",
113
+ "<|ą|>",
114
+ "<|Ć|>",
115
+ "<|ć|>",
116
+ "<|Ĉ|>",
117
+ "<|ĉ|>",
118
+ "<|Ċ|>",
119
+ "<|ċ|>",
120
+ "<|Č|>",
121
+ "<|č|>",
122
+ "<|Ď|>",
123
+ "<|ď|>",
124
+ "<|Đ|>",
125
+ "<|đ|>",
126
+ "<|Ē|>",
127
+ "<|ē|>",
128
+ "<|Ĕ|>",
129
+ "<|ĕ|>",
130
+ "<|Ė|>",
131
+ "<|ė|>",
132
+ "<|Ę|>",
133
+ "<|ę|>",
134
+ "<|Ě|>",
135
+ "<|ě|>",
136
+ "<|Ĝ|>",
137
+ "<|ĝ|>",
138
+ "<|Ğ|>",
139
+ "<|ğ|>",
140
+ "<|Ġ|>",
141
+ "<|ġ|>",
142
+ "<|Ģ|>",
143
+ "<|ģ|>",
144
+ "<|Ĥ|>",
145
+ "<|ĥ|>",
146
+ "<|Ħ|>",
147
+ "<|ħ|>",
148
+ "<|Ĩ|>",
149
+ "<|ĩ|>",
150
+ "<|Ī|>",
151
+ "<|ī|>",
152
+ "<|Ĭ|>",
153
+ "<|ĭ|>",
154
+ "<|Į|>",
155
+ "<|į|>",
156
+ "<|İ|>",
157
+ "<|ı|>",
158
+ "<|IJ|>",
159
+ "<|ij|>",
160
+ "<|Ĵ|>",
161
+ "<|ĵ|>",
162
+ "<|Ķ|>",
163
+ "<|ķ|>",
164
+ "<|ĸ|>",
165
+ "<|Ĺ|>",
166
+ "<|ĺ|>",
167
+ "<|Ļ|>",
168
+ "<|ļ|>",
169
+ "<|Ľ|>",
170
+ "<|ľ|>",
171
+ "<|Ŀ|>",
172
+ "<|ŀ|>",
173
+ "<|Ł|>",
174
+ "<|ł|>",
175
+ "<|Ń|>",
176
+ "<|Ûķ|>",
177
+ "<|ÛĮ|>",
178
+ "<|ا|>",
179
+ "<|ĠØ|>",
180
+ "<|ÙĪ|>",
181
+ "<|ÙĨ|>",
182
+ "<|ر|>",
183
+ "<|Ú©|>",
184
+ "<|ĠÙ|>",
185
+ "<|ت|>",
186
+ "<|اÙĨ|>",
187
+ "<|Ûİ|>",
188
+ "<|د|>",
189
+ "<|Ùħ|>",
190
+ "<|Ġب|>",
191
+ "<|ÛĨ|>",
192
+ "<|س|>",
193
+ "<|translate|>",
194
+ "<|transcribe|>",
195
+ "<|startoflm|>",
196
+ "<|startofprev|>",
197
+ "<|nocaptions|>",
198
+ "<|notimestamps|>"
199
+ ],
200
+ "is_local": false,
201
+ "local_files_only": false,
202
+ "mask_token": "[MASK]",
203
+ "model_max_length": 12,
204
+ "never_split": null,
205
+ "pad_token": "<|endoftext|>",
206
+ "processor_class": "WhisperProcessor",
207
+ "return_attention_mask": false,
208
+ "sep_token": "[SEP]",
209
+ "strip_accents": null,
210
+ "tokenize_chinese_chars": true,
211
+ "tokenizer_class": "BertTokenizer",
212
+ "unk_token": "[UNK]"
213
+ }