gsaltintas commited on
Commit
76e4700
·
verified ·
1 Parent(s): ea615e9

Upload folder using huggingface_hub

Browse files
Files changed (6) hide show
  1. README.md +54 -0
  2. merges.txt +91 -0
  3. special_tokens_map.json +5 -0
  4. tokenizer.json +794 -0
  5. tokenizer_config.json +37 -0
  6. vocab.json +351 -0
README.md ADDED
@@ -0,0 +1,54 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ license: mit
3
+ language:
4
+ - por
5
+
6
+ tags:
7
+ - tokenizer
8
+ - bpe
9
+ - flexitok
10
+ - fineweb2
11
+ ---
12
+
13
+ # Byte-Level BPE Tokenizer: ['por_Latn'] (0K)
14
+
15
+ A **Byte-Level BPE** tokenizer trained on **['por_Latn']** data from Fineweb-2-HQ.
16
+
17
+ ## Training Details
18
+
19
+ | Parameter | Value |
20
+ |-----------|-------|
21
+ | Algorithm | Byte-Level BPE |
22
+ | Language | `['por_Latn']` |
23
+ | Target Vocab Size | 360 |
24
+ | Final Vocab Size | 349 |
25
+ | Pre-tokenizer | custom:addition |
26
+ | Number handling | ltr_3digit |
27
+ | Contraction handling | False |
28
+ | Normalizer | NFC |
29
+ | Special Tokens | `<s>`, `</s>`, `<pad>`, `<unk>` |
30
+ | Training Shards | 2 |
31
+
32
+ ## Usage
33
+
34
+ ```python
35
+ from transformers import AutoTokenizer
36
+
37
+ tokenizer = AutoTokenizer.from_pretrained("flexitok/maddition_por_Latn_360")
38
+ tokens = tokenizer.encode("Hello, world!")
39
+ ```
40
+
41
+ ## Files
42
+
43
+ - `tokenizer.json` — Full HuggingFace tokenizer
44
+ - `vocab.json` — Vocabulary mapping
45
+ - `merges.txt` — BPE merge rules
46
+
47
+ ## Sample Encoding
48
+ | Text | Tokens | Token IDs |
49
+ |------|--------|-----------|
50
+ | `yirmi iki+dokuz=otuz bir\ntwenty two+nine=thirty one` | `y, i, r, m, i, Ġ, i, k, i, +, do, k, u, z, =, o, t, u, z, Ġ` | `91, 75, 84, 79, 75, 223, 75, 77, 75, 13, 332, 77, 87, 92, 31, 81, 86, 87, 92, 223` |
51
+
52
+ Command used to create this tokenizer:
53
+ ```bash
54
+ ['/home/gsa/tokenizers2/flexitok/tokenizer_training/train_tokenizers.py', 'algorithm=bpe', 'vocab_size=360', 'langs=[por_Latn]', 'data_dir=/scratch/gsa/data/multilingual-addition/', 'output_dir=/scratch/gsa/trained_tokenizers/multilingual_addition', 'pretokenizer=custom:addition', 'number_handling=ltr_3digit', 'add_numbers=false', 'handle_contractions=false', 'unicode_normalization=nfc', 'use_byte_level_regex=false', 'byte_fallback=false', 'strip_zero_width=false', 'cjk_char_split=false', 'add_cjk_chars=false', 'max_lines=-1', 'test_string=yirmi iki+dokuz=otuz bir\\ntwenty two+nine=thirty one', 'hf.publish_to_hf=true', 'hf_repo_prefix=flexitok/', 'hf.hf_repo_id=flexitok/maddition_por_Latn_360', 'hf.collections=[flexitok/multilingual_addition_tokenizers]']
merges.txt ADDED
@@ -0,0 +1,91 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ #version: 0.2
2
+ ['n', 't']
3
+ ['e', 'nt']
4
+ ['ent', 'o']
5
+ ['ento', 's']
6
+ ['s', 'e']
7
+ ['ent', 'a']
8
+ ['c', 'entos']
9
+ ['q', 'u']
10
+ ['t', 'r']
11
+ ['o', 'i']
12
+ ['i', 'n']
13
+ ['n', 'o']
14
+ ['se', 't']
15
+ ['oi', 't']
16
+ ['no', 'v']
17
+ ['qu', 'a']
18
+ ['e', 'centos']
19
+ ['i', 's']
20
+ ['i', 'nt']
21
+ ['o', 'centos']
22
+ ['z', 'entos']
23
+ ['se', 'is']
24
+ ['c', 'in']
25
+ ['qua', 'tr']
26
+ ['i', 'l']
27
+ ['m', 'il']
28
+ ['mil', ',']
29
+ ['qu', 'in']
30
+ ['tr', 'e']
31
+ ['d', 'u']
32
+ ['h', 'entos']
33
+ ['r', 'enta']
34
+ ['s', 's']
35
+ ['v', 'int']
36
+ ['se', 'ss']
37
+ ['qu', 'enta']
38
+ ['tr', 'int']
39
+ ['set', 'e']
40
+ ['set', 'enta']
41
+ ['set', 'ecentos']
42
+ ['oit', 'o']
43
+ ['oit', 'enta']
44
+ ['oit', 'ocentos']
45
+ ['nov', 'e']
46
+ ['nov', 'enta']
47
+ ['nov', 'ecentos']
48
+ ['qua', 'renta']
49
+ ['seis', 'centos']
50
+ ['cin', 'quenta']
51
+ ['quatr', 'ocentos']
52
+ ['quin', 'hentos']
53
+ ['tre', 'zentos']
54
+ ['du', 'zentos']
55
+ ['vint', 'e']
56
+ ['sess', 'enta']
57
+ ['trint', 'a']
58
+ ['c', 'ento']
59
+ ['c', 'o']
60
+ ['d', 'oi']
61
+ ['u', 'm']
62
+ ['ª', 's']
63
+ ['Ã', 'ªs']
64
+ ['tr', 'ês']
65
+ ['cin', 'co']
66
+ ['quatr', 'o']
67
+ ['doi', 's']
68
+ ['z', 'e']
69
+ ['d', 'e']
70
+ ['de', 'ze']
71
+ ['de', 'z']
72
+ ['deze', 's']
73
+ ['a', 't']
74
+ ['c', 'at']
75
+ ['d', 'o']
76
+ ['n', 'ze']
77
+ ['o', 'r']
78
+ ['o', 'nze']
79
+ ['quin', 'ze']
80
+ ['tre', 'ze']
81
+ ['deze', 'nove']
82
+ ['dez', 'oito']
83
+ ['dezes', 'seis']
84
+ ['dezes', 'sete']
85
+ ['cat', 'or']
86
+ ['do', 'ze']
87
+ ['cator', 'ze']
88
+ ['c', 'e']
89
+ ['ce', 'm']
90
+ ['r', 'o']
91
+ ['ze', 'ro']
special_tokens_map.json ADDED
@@ -0,0 +1,5 @@
 
 
 
 
 
 
1
+ {
2
+ "bos_token": "<s>",
3
+ "eos_token": "</s>",
4
+ "pad_token": "<pad>"
5
+ }
tokenizer.json ADDED
@@ -0,0 +1,794 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "version": "1.0",
3
+ "truncation": null,
4
+ "padding": null,
5
+ "added_tokens": [
6
+ {
7
+ "id": 0,
8
+ "content": "<s>",
9
+ "single_word": false,
10
+ "lstrip": false,
11
+ "rstrip": false,
12
+ "normalized": false,
13
+ "special": true
14
+ },
15
+ {
16
+ "id": 1,
17
+ "content": "</s>",
18
+ "single_word": false,
19
+ "lstrip": false,
20
+ "rstrip": false,
21
+ "normalized": false,
22
+ "special": true
23
+ },
24
+ {
25
+ "id": 2,
26
+ "content": "<pad>",
27
+ "single_word": false,
28
+ "lstrip": false,
29
+ "rstrip": false,
30
+ "normalized": false,
31
+ "special": true
32
+ }
33
+ ],
34
+ "normalizer": {
35
+ "type": "NFC"
36
+ },
37
+ "pre_tokenizer": {
38
+ "type": "Sequence",
39
+ "pretokenizers": [
40
+ {
41
+ "type": "Split",
42
+ "pattern": {
43
+ "Regex": "[+=]|[^\\S\\r\\n]*[\\n\\r]+|[^\\S\\r\\n]+"
44
+ },
45
+ "behavior": "Isolated",
46
+ "invert": false
47
+ },
48
+ {
49
+ "type": "Split",
50
+ "pattern": {
51
+ "Regex": "\\p{N}{1,3}"
52
+ },
53
+ "behavior": "Isolated",
54
+ "invert": false
55
+ },
56
+ {
57
+ "type": "ByteLevel",
58
+ "add_prefix_space": false,
59
+ "trim_offsets": true,
60
+ "use_regex": false
61
+ }
62
+ ]
63
+ },
64
+ "post_processor": null,
65
+ "decoder": {
66
+ "type": "ByteLevel",
67
+ "add_prefix_space": true,
68
+ "trim_offsets": true,
69
+ "use_regex": true
70
+ },
71
+ "model": {
72
+ "type": "BPE",
73
+ "dropout": null,
74
+ "unk_token": null,
75
+ "continuing_subword_prefix": null,
76
+ "end_of_word_suffix": null,
77
+ "fuse_unk": false,
78
+ "byte_fallback": false,
79
+ "ignore_merges": false,
80
+ "vocab": {
81
+ "<s>": 0,
82
+ "</s>": 1,
83
+ "<pad>": 2,
84
+ "!": 3,
85
+ "\"": 4,
86
+ "#": 5,
87
+ "$": 6,
88
+ "%": 7,
89
+ "&": 8,
90
+ "'": 9,
91
+ "(": 10,
92
+ ")": 11,
93
+ "*": 12,
94
+ "+": 13,
95
+ ",": 14,
96
+ "-": 15,
97
+ ".": 16,
98
+ "/": 17,
99
+ "0": 18,
100
+ "1": 19,
101
+ "2": 20,
102
+ "3": 21,
103
+ "4": 22,
104
+ "5": 23,
105
+ "6": 24,
106
+ "7": 25,
107
+ "8": 26,
108
+ "9": 27,
109
+ ":": 28,
110
+ ";": 29,
111
+ "<": 30,
112
+ "=": 31,
113
+ ">": 32,
114
+ "?": 33,
115
+ "@": 34,
116
+ "A": 35,
117
+ "B": 36,
118
+ "C": 37,
119
+ "D": 38,
120
+ "E": 39,
121
+ "F": 40,
122
+ "G": 41,
123
+ "H": 42,
124
+ "I": 43,
125
+ "J": 44,
126
+ "K": 45,
127
+ "L": 46,
128
+ "M": 47,
129
+ "N": 48,
130
+ "O": 49,
131
+ "P": 50,
132
+ "Q": 51,
133
+ "R": 52,
134
+ "S": 53,
135
+ "T": 54,
136
+ "U": 55,
137
+ "V": 56,
138
+ "W": 57,
139
+ "X": 58,
140
+ "Y": 59,
141
+ "Z": 60,
142
+ "[": 61,
143
+ "\\": 62,
144
+ "]": 63,
145
+ "^": 64,
146
+ "_": 65,
147
+ "`": 66,
148
+ "a": 67,
149
+ "b": 68,
150
+ "c": 69,
151
+ "d": 70,
152
+ "e": 71,
153
+ "f": 72,
154
+ "g": 73,
155
+ "h": 74,
156
+ "i": 75,
157
+ "j": 76,
158
+ "k": 77,
159
+ "l": 78,
160
+ "m": 79,
161
+ "n": 80,
162
+ "o": 81,
163
+ "p": 82,
164
+ "q": 83,
165
+ "r": 84,
166
+ "s": 85,
167
+ "t": 86,
168
+ "u": 87,
169
+ "v": 88,
170
+ "w": 89,
171
+ "x": 90,
172
+ "y": 91,
173
+ "z": 92,
174
+ "{": 93,
175
+ "|": 94,
176
+ "}": 95,
177
+ "~": 96,
178
+ "¡": 97,
179
+ "¢": 98,
180
+ "£": 99,
181
+ "¤": 100,
182
+ "¥": 101,
183
+ "¦": 102,
184
+ "§": 103,
185
+ "¨": 104,
186
+ "©": 105,
187
+ "ª": 106,
188
+ "«": 107,
189
+ "¬": 108,
190
+ "®": 109,
191
+ "¯": 110,
192
+ "°": 111,
193
+ "±": 112,
194
+ "²": 113,
195
+ "³": 114,
196
+ "´": 115,
197
+ "µ": 116,
198
+ "¶": 117,
199
+ "·": 118,
200
+ "¸": 119,
201
+ "¹": 120,
202
+ "º": 121,
203
+ "»": 122,
204
+ "¼": 123,
205
+ "½": 124,
206
+ "¾": 125,
207
+ "¿": 126,
208
+ "À": 127,
209
+ "Á": 128,
210
+ "Â": 129,
211
+ "Ã": 130,
212
+ "Ä": 131,
213
+ "Å": 132,
214
+ "Æ": 133,
215
+ "Ç": 134,
216
+ "È": 135,
217
+ "É": 136,
218
+ "Ê": 137,
219
+ "Ë": 138,
220
+ "Ì": 139,
221
+ "Í": 140,
222
+ "Î": 141,
223
+ "Ï": 142,
224
+ "Ð": 143,
225
+ "Ñ": 144,
226
+ "Ò": 145,
227
+ "Ó": 146,
228
+ "Ô": 147,
229
+ "Õ": 148,
230
+ "Ö": 149,
231
+ "×": 150,
232
+ "Ø": 151,
233
+ "Ù": 152,
234
+ "Ú": 153,
235
+ "Û": 154,
236
+ "Ü": 155,
237
+ "Ý": 156,
238
+ "Þ": 157,
239
+ "ß": 158,
240
+ "à": 159,
241
+ "á": 160,
242
+ "â": 161,
243
+ "ã": 162,
244
+ "ä": 163,
245
+ "å": 164,
246
+ "æ": 165,
247
+ "ç": 166,
248
+ "è": 167,
249
+ "é": 168,
250
+ "ê": 169,
251
+ "ë": 170,
252
+ "ì": 171,
253
+ "í": 172,
254
+ "î": 173,
255
+ "ï": 174,
256
+ "ð": 175,
257
+ "ñ": 176,
258
+ "ò": 177,
259
+ "ó": 178,
260
+ "ô": 179,
261
+ "õ": 180,
262
+ "ö": 181,
263
+ "÷": 182,
264
+ "ø": 183,
265
+ "ù": 184,
266
+ "ú": 185,
267
+ "û": 186,
268
+ "ü": 187,
269
+ "ý": 188,
270
+ "þ": 189,
271
+ "ÿ": 190,
272
+ "Ā": 191,
273
+ "ā": 192,
274
+ "Ă": 193,
275
+ "ă": 194,
276
+ "Ą": 195,
277
+ "ą": 196,
278
+ "Ć": 197,
279
+ "ć": 198,
280
+ "Ĉ": 199,
281
+ "ĉ": 200,
282
+ "Ċ": 201,
283
+ "ċ": 202,
284
+ "Č": 203,
285
+ "č": 204,
286
+ "Ď": 205,
287
+ "ď": 206,
288
+ "Đ": 207,
289
+ "đ": 208,
290
+ "Ē": 209,
291
+ "ē": 210,
292
+ "Ĕ": 211,
293
+ "ĕ": 212,
294
+ "Ė": 213,
295
+ "ė": 214,
296
+ "Ę": 215,
297
+ "ę": 216,
298
+ "Ě": 217,
299
+ "ě": 218,
300
+ "Ĝ": 219,
301
+ "ĝ": 220,
302
+ "Ğ": 221,
303
+ "ğ": 222,
304
+ "Ġ": 223,
305
+ "ġ": 224,
306
+ "Ģ": 225,
307
+ "ģ": 226,
308
+ "Ĥ": 227,
309
+ "ĥ": 228,
310
+ "Ħ": 229,
311
+ "ħ": 230,
312
+ "Ĩ": 231,
313
+ "ĩ": 232,
314
+ "Ī": 233,
315
+ "ī": 234,
316
+ "Ĭ": 235,
317
+ "ĭ": 236,
318
+ "Į": 237,
319
+ "į": 238,
320
+ "İ": 239,
321
+ "ı": 240,
322
+ "IJ": 241,
323
+ "ij": 242,
324
+ "Ĵ": 243,
325
+ "ĵ": 244,
326
+ "Ķ": 245,
327
+ "ķ": 246,
328
+ "ĸ": 247,
329
+ "Ĺ": 248,
330
+ "ĺ": 249,
331
+ "Ļ": 250,
332
+ "ļ": 251,
333
+ "Ľ": 252,
334
+ "ľ": 253,
335
+ "Ŀ": 254,
336
+ "ŀ": 255,
337
+ "Ł": 256,
338
+ "ł": 257,
339
+ "Ń": 258,
340
+ "nt": 259,
341
+ "ent": 260,
342
+ "ento": 261,
343
+ "entos": 262,
344
+ "se": 263,
345
+ "enta": 264,
346
+ "centos": 265,
347
+ "qu": 266,
348
+ "tr": 267,
349
+ "oi": 268,
350
+ "in": 269,
351
+ "no": 270,
352
+ "set": 271,
353
+ "oit": 272,
354
+ "nov": 273,
355
+ "qua": 274,
356
+ "ecentos": 275,
357
+ "is": 276,
358
+ "int": 277,
359
+ "ocentos": 278,
360
+ "zentos": 279,
361
+ "seis": 280,
362
+ "cin": 281,
363
+ "quatr": 282,
364
+ "il": 283,
365
+ "mil": 284,
366
+ "mil,": 285,
367
+ "quin": 286,
368
+ "tre": 287,
369
+ "du": 288,
370
+ "hentos": 289,
371
+ "renta": 290,
372
+ "ss": 291,
373
+ "vint": 292,
374
+ "sess": 293,
375
+ "quenta": 294,
376
+ "trint": 295,
377
+ "sete": 296,
378
+ "setenta": 297,
379
+ "setecentos": 298,
380
+ "oito": 299,
381
+ "oitenta": 300,
382
+ "oitocentos": 301,
383
+ "nove": 302,
384
+ "noventa": 303,
385
+ "novecentos": 304,
386
+ "quarenta": 305,
387
+ "seiscentos": 306,
388
+ "cinquenta": 307,
389
+ "quatrocentos": 308,
390
+ "quinhentos": 309,
391
+ "trezentos": 310,
392
+ "duzentos": 311,
393
+ "vinte": 312,
394
+ "sessenta": 313,
395
+ "trinta": 314,
396
+ "cento": 315,
397
+ "co": 316,
398
+ "doi": 317,
399
+ "um": 318,
400
+ "ªs": 319,
401
+ "ês": 320,
402
+ "três": 321,
403
+ "cinco": 322,
404
+ "quatro": 323,
405
+ "dois": 324,
406
+ "ze": 325,
407
+ "de": 326,
408
+ "deze": 327,
409
+ "dez": 328,
410
+ "dezes": 329,
411
+ "at": 330,
412
+ "cat": 331,
413
+ "do": 332,
414
+ "nze": 333,
415
+ "or": 334,
416
+ "onze": 335,
417
+ "quinze": 336,
418
+ "treze": 337,
419
+ "dezenove": 338,
420
+ "dezoito": 339,
421
+ "dezesseis": 340,
422
+ "dezessete": 341,
423
+ "cator": 342,
424
+ "doze": 343,
425
+ "catorze": 344,
426
+ "ce": 345,
427
+ "cem": 346,
428
+ "ro": 347,
429
+ "zero": 348
430
+ },
431
+ "merges": [
432
+ [
433
+ "n",
434
+ "t"
435
+ ],
436
+ [
437
+ "e",
438
+ "nt"
439
+ ],
440
+ [
441
+ "ent",
442
+ "o"
443
+ ],
444
+ [
445
+ "ento",
446
+ "s"
447
+ ],
448
+ [
449
+ "s",
450
+ "e"
451
+ ],
452
+ [
453
+ "ent",
454
+ "a"
455
+ ],
456
+ [
457
+ "c",
458
+ "entos"
459
+ ],
460
+ [
461
+ "q",
462
+ "u"
463
+ ],
464
+ [
465
+ "t",
466
+ "r"
467
+ ],
468
+ [
469
+ "o",
470
+ "i"
471
+ ],
472
+ [
473
+ "i",
474
+ "n"
475
+ ],
476
+ [
477
+ "n",
478
+ "o"
479
+ ],
480
+ [
481
+ "se",
482
+ "t"
483
+ ],
484
+ [
485
+ "oi",
486
+ "t"
487
+ ],
488
+ [
489
+ "no",
490
+ "v"
491
+ ],
492
+ [
493
+ "qu",
494
+ "a"
495
+ ],
496
+ [
497
+ "e",
498
+ "centos"
499
+ ],
500
+ [
501
+ "i",
502
+ "s"
503
+ ],
504
+ [
505
+ "i",
506
+ "nt"
507
+ ],
508
+ [
509
+ "o",
510
+ "centos"
511
+ ],
512
+ [
513
+ "z",
514
+ "entos"
515
+ ],
516
+ [
517
+ "se",
518
+ "is"
519
+ ],
520
+ [
521
+ "c",
522
+ "in"
523
+ ],
524
+ [
525
+ "qua",
526
+ "tr"
527
+ ],
528
+ [
529
+ "i",
530
+ "l"
531
+ ],
532
+ [
533
+ "m",
534
+ "il"
535
+ ],
536
+ [
537
+ "mil",
538
+ ","
539
+ ],
540
+ [
541
+ "qu",
542
+ "in"
543
+ ],
544
+ [
545
+ "tr",
546
+ "e"
547
+ ],
548
+ [
549
+ "d",
550
+ "u"
551
+ ],
552
+ [
553
+ "h",
554
+ "entos"
555
+ ],
556
+ [
557
+ "r",
558
+ "enta"
559
+ ],
560
+ [
561
+ "s",
562
+ "s"
563
+ ],
564
+ [
565
+ "v",
566
+ "int"
567
+ ],
568
+ [
569
+ "se",
570
+ "ss"
571
+ ],
572
+ [
573
+ "qu",
574
+ "enta"
575
+ ],
576
+ [
577
+ "tr",
578
+ "int"
579
+ ],
580
+ [
581
+ "set",
582
+ "e"
583
+ ],
584
+ [
585
+ "set",
586
+ "enta"
587
+ ],
588
+ [
589
+ "set",
590
+ "ecentos"
591
+ ],
592
+ [
593
+ "oit",
594
+ "o"
595
+ ],
596
+ [
597
+ "oit",
598
+ "enta"
599
+ ],
600
+ [
601
+ "oit",
602
+ "ocentos"
603
+ ],
604
+ [
605
+ "nov",
606
+ "e"
607
+ ],
608
+ [
609
+ "nov",
610
+ "enta"
611
+ ],
612
+ [
613
+ "nov",
614
+ "ecentos"
615
+ ],
616
+ [
617
+ "qua",
618
+ "renta"
619
+ ],
620
+ [
621
+ "seis",
622
+ "centos"
623
+ ],
624
+ [
625
+ "cin",
626
+ "quenta"
627
+ ],
628
+ [
629
+ "quatr",
630
+ "ocentos"
631
+ ],
632
+ [
633
+ "quin",
634
+ "hentos"
635
+ ],
636
+ [
637
+ "tre",
638
+ "zentos"
639
+ ],
640
+ [
641
+ "du",
642
+ "zentos"
643
+ ],
644
+ [
645
+ "vint",
646
+ "e"
647
+ ],
648
+ [
649
+ "sess",
650
+ "enta"
651
+ ],
652
+ [
653
+ "trint",
654
+ "a"
655
+ ],
656
+ [
657
+ "c",
658
+ "ento"
659
+ ],
660
+ [
661
+ "c",
662
+ "o"
663
+ ],
664
+ [
665
+ "d",
666
+ "oi"
667
+ ],
668
+ [
669
+ "u",
670
+ "m"
671
+ ],
672
+ [
673
+ "ª",
674
+ "s"
675
+ ],
676
+ [
677
+ "Ã",
678
+ "ªs"
679
+ ],
680
+ [
681
+ "tr",
682
+ "ês"
683
+ ],
684
+ [
685
+ "cin",
686
+ "co"
687
+ ],
688
+ [
689
+ "quatr",
690
+ "o"
691
+ ],
692
+ [
693
+ "doi",
694
+ "s"
695
+ ],
696
+ [
697
+ "z",
698
+ "e"
699
+ ],
700
+ [
701
+ "d",
702
+ "e"
703
+ ],
704
+ [
705
+ "de",
706
+ "ze"
707
+ ],
708
+ [
709
+ "de",
710
+ "z"
711
+ ],
712
+ [
713
+ "deze",
714
+ "s"
715
+ ],
716
+ [
717
+ "a",
718
+ "t"
719
+ ],
720
+ [
721
+ "c",
722
+ "at"
723
+ ],
724
+ [
725
+ "d",
726
+ "o"
727
+ ],
728
+ [
729
+ "n",
730
+ "ze"
731
+ ],
732
+ [
733
+ "o",
734
+ "r"
735
+ ],
736
+ [
737
+ "o",
738
+ "nze"
739
+ ],
740
+ [
741
+ "quin",
742
+ "ze"
743
+ ],
744
+ [
745
+ "tre",
746
+ "ze"
747
+ ],
748
+ [
749
+ "deze",
750
+ "nove"
751
+ ],
752
+ [
753
+ "dez",
754
+ "oito"
755
+ ],
756
+ [
757
+ "dezes",
758
+ "seis"
759
+ ],
760
+ [
761
+ "dezes",
762
+ "sete"
763
+ ],
764
+ [
765
+ "cat",
766
+ "or"
767
+ ],
768
+ [
769
+ "do",
770
+ "ze"
771
+ ],
772
+ [
773
+ "cator",
774
+ "ze"
775
+ ],
776
+ [
777
+ "c",
778
+ "e"
779
+ ],
780
+ [
781
+ "ce",
782
+ "m"
783
+ ],
784
+ [
785
+ "r",
786
+ "o"
787
+ ],
788
+ [
789
+ "ze",
790
+ "ro"
791
+ ]
792
+ ]
793
+ }
794
+ }
tokenizer_config.json ADDED
@@ -0,0 +1,37 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "added_tokens_decoder": {
3
+ "0": {
4
+ "content": "<s>",
5
+ "lstrip": false,
6
+ "normalized": false,
7
+ "rstrip": false,
8
+ "single_word": false,
9
+ "special": true
10
+ },
11
+ "1": {
12
+ "content": "</s>",
13
+ "lstrip": false,
14
+ "normalized": false,
15
+ "rstrip": false,
16
+ "single_word": false,
17
+ "special": true
18
+ },
19
+ "2": {
20
+ "content": "<pad>",
21
+ "lstrip": false,
22
+ "normalized": false,
23
+ "rstrip": false,
24
+ "single_word": false,
25
+ "special": true
26
+ }
27
+ },
28
+ "bos_token": "<s>",
29
+ "clean_up_tokenization_spaces": false,
30
+ "eos_token": "</s>",
31
+ "extra_special_tokens": {},
32
+ "model_max_length": 1000000000000000019884624838656,
33
+ "pad_token": "<pad>",
34
+ "tokenizer_class": "PreTrainedTokenizerFast",
35
+ "unk_token": null,
36
+ "number_handling": "ltr_3digit"
37
+ }
vocab.json ADDED
@@ -0,0 +1,351 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "ecentos": 275,
3
+ "Ħ": 229,
4
+ "cinquenta": 307,
5
+ ",": 14,
6
+ "-": 15,
7
+ "°": 111,
8
+ "Â": 129,
9
+ "¿": 126,
10
+ "Đ": 207,
11
+ "c": 69,
12
+ "sete": 296,
13
+ "ð": 175,
14
+ "tr": 267,
15
+ "qu": 266,
16
+ "1": 19,
17
+ "[": 61,
18
+ "renta": 290,
19
+ "Þ": 157,
20
+ "qua": 274,
21
+ "ė": 214,
22
+ "@": 34,
23
+ "ñ": 176,
24
+ "nze": 333,
25
+ "ce": 345,
26
+ "ċ": 202,
27
+ "setecentos": 298,
28
+ "oito": 299,
29
+ "Ù": 152,
30
+ "E": 39,
31
+ "6": 24,
32
+ "int": 277,
33
+ "À": 127,
34
+ "ĩ": 232,
35
+ "K": 45,
36
+ "î": 173,
37
+ "Ġ": 223,
38
+ "ļ": 251,
39
+ "enta": 264,
40
+ "no": 270,
41
+ "S": 53,
42
+ "cin": 281,
43
+ "vint": 292,
44
+ "dezesseis": 340,
45
+ "l": 78,
46
+ "ğ": 222,
47
+ "hentos": 289,
48
+ "ij": 242,
49
+ "ro": 347,
50
+ "Ċ": 201,
51
+ "t": 86,
52
+ "&": 8,
53
+ "4": 22,
54
+ "V": 56,
55
+ "Ě": 217,
56
+ "\"": 4,
57
+ "Ý": 156,
58
+ "9": 27,
59
+ "quatr": 282,
60
+ "?": 33,
61
+ "Ä": 131,
62
+ "ês": 320,
63
+ "i": 75,
64
+ "set": 271,
65
+ "ö": 181,
66
+ "£": 99,
67
+ "x": 90,
68
+ "º": 121,
69
+ "/": 17,
70
+ "đ": 208,
71
+ "ú": 185,
72
+ "¨": 104,
73
+ "três": 321,
74
+ "ā": 192,
75
+ "oitenta": 300,
76
+ "novecentos": 304,
77
+ "ĸ": 247,
78
+ "«": 107,
79
+ "æ": 165,
80
+ "Ķ": 245,
81
+ "²": 113,
82
+ "Q": 51,
83
+ "}": 95,
84
+ "¡": 97,
85
+ "_": 65,
86
+ "duzentos": 311,
87
+ "0": 18,
88
+ "entos": 262,
89
+ "ª": 106,
90
+ "k": 77,
91
+ "å": 164,
92
+ "mil": 284,
93
+ "or": 334,
94
+ "seiscentos": 306,
95
+ "seis": 280,
96
+ ">": 32,
97
+ "nove": 302,
98
+ "zero": 348,
99
+ "se": 263,
100
+ "µ": 116,
101
+ "ô": 179,
102
+ "è": 167,
103
+ "G": 41,
104
+ "setenta": 297,
105
+ "cator": 342,
106
+ "ù": 184,
107
+ "]": 63,
108
+ "Ü": 155,
109
+ "ent": 260,
110
+ "Ģ": 225,
111
+ "O": 49,
112
+ "İ": 239,
113
+ "ento": 261,
114
+ "X": 58,
115
+ "ªs": 319,
116
+ "Ú": 153,
117
+ "quinhentos": 309,
118
+ "ľ": 253,
119
+ "á": 160,
120
+ "û": 186,
121
+ "Ľ": 252,
122
+ "Ð": 143,
123
+ "cinco": 322,
124
+ "cento": 315,
125
+ "ą": 196,
126
+ "ü": 187,
127
+ "v": 88,
128
+ "A": 35,
129
+ "o": 81,
130
+ "ó": 178,
131
+ "%": 7,
132
+ "×": 150,
133
+ "D": 38,
134
+ "dezenove": 338,
135
+ ")": 11,
136
+ "d": 70,
137
+ "\\": 62,
138
+ "+": 13,
139
+ "½": 124,
140
+ "¥": 101,
141
+ "į": 238,
142
+ "Ļ": 250,
143
+ "$": 6,
144
+ "®": 109,
145
+ "Ė": 213,
146
+ "Ó": 146,
147
+ "÷": 182,
148
+ "Ĝ": 219,
149
+ "mil,": 285,
150
+ "u": 87,
151
+ "z": 92,
152
+ "quatrocentos": 308,
153
+ "·": 118,
154
+ "¢": 98,
155
+ "f": 72,
156
+ "ķ": 246,
157
+ "Č": 203,
158
+ "Í": 140,
159
+ "É": 136,
160
+ "5": 23,
161
+ "È": 135,
162
+ "tre": 287,
163
+ "q": 83,
164
+ "ë": 170,
165
+ "um": 318,
166
+ "oitocentos": 301,
167
+ "¹": 120,
168
+ "`": 66,
169
+ "Ŀ": 254,
170
+ "¬": 108,
171
+ "ł": 257,
172
+ "Ę": 215,
173
+ "2": 20,
174
+ "ï": 174,
175
+ "ã": 162,
176
+ "R": 52,
177
+ "ī": 234,
178
+ "ocentos": 278,
179
+ "(": 10,
180
+ "ÿ": 190,
181
+ "ß": 158,
182
+ "M": 47,
183
+ "ĺ": 249,
184
+ "h": 74,
185
+ "T": 54,
186
+ "Ă": 193,
187
+ "¯": 110,
188
+ "ĕ": 212,
189
+ "ĥ": 228,
190
+ "<": 30,
191
+ "ĭ": 236,
192
+ "ħ": 230,
193
+ "ø": 183,
194
+ "Ā": 191,
195
+ "Ğ": 221,
196
+ "zentos": 279,
197
+ "3": 21,
198
+ "j": 76,
199
+ "Ď": 205,
200
+ "Ĩ": 231,
201
+ "P": 50,
202
+ "a": 67,
203
+ "à": 159,
204
+ "Õ": 148,
205
+ "ĉ": 200,
206
+ "õ": 180,
207
+ "cem": 346,
208
+ "Ò": 145,
209
+ "m": 79,
210
+ "±": 112,
211
+ "ç": 166,
212
+ "¶": 117,
213
+ "¼": 123,
214
+ "e": 71,
215
+ "©": 105,
216
+ "nov": 273,
217
+ "¦": 102,
218
+ "sessenta": 313,
219
+ "Ç": 134,
220
+ "Î": 141,
221
+ "č": 204,
222
+ ";": 29,
223
+ "do": 332,
224
+ "ä": 163,
225
+ "8": 26,
226
+ "Ö": 149,
227
+ "Ą": 195,
228
+ "ĝ": 220,
229
+ "Ń": 258,
230
+ "Ã": 130,
231
+ "B": 36,
232
+ "Ĉ": 199,
233
+ "ı": 240,
234
+ "Z": 60,
235
+ "ď": 206,
236
+ "onze": 335,
237
+ "J": 44,
238
+ "|": 94,
239
+ "co": 316,
240
+ "»": 122,
241
+ "Y": 59,
242
+ "N": 48,
243
+ "b": 68,
244
+ "y": 91,
245
+ "§": 103,
246
+ "I": 43,
247
+ "ĵ": 244,
248
+ "oi": 268,
249
+ "ê": 169,
250
+ "!": 3,
251
+ "Ê": 137,
252
+ ":": 28,
253
+ "doi": 317,
254
+ "centos": 265,
255
+ "is": 276,
256
+ "F": 40,
257
+ "trint": 295,
258
+ "é": 168,
259
+ "Û": 154,
260
+ "quin": 286,
261
+ "treze": 337,
262
+ "W": 57,
263
+ "ì": 171,
264
+ "catorze": 344,
265
+ "=": 31,
266
+ "7": 25,
267
+ "ze": 325,
268
+ "dois": 324,
269
+ "ă": 194,
270
+ "<pad>": 2,
271
+ "Ĥ": 227,
272
+ "cat": 331,
273
+ "ē": 210,
274
+ "trinta": 314,
275
+ "Ĕ": 211,
276
+ "in": 269,
277
+ "quarenta": 305,
278
+ "³": 114,
279
+ "r": 84,
280
+ "</s>": 1,
281
+ "dezoito": 339,
282
+ "H": 42,
283
+ "Ï": 142,
284
+ "ò": 177,
285
+ "¤": 100,
286
+ "vinte": 312,
287
+ "w": 89,
288
+ "at": 330,
289
+ "Ĵ": 243,
290
+ "Ł": 256,
291
+ "ę": 216,
292
+ "~": 96,
293
+ "Ī": 233,
294
+ "Į": 237,
295
+ "doze": 343,
296
+ "í": 172,
297
+ "dezessete": 341,
298
+ "du": 288,
299
+ "*": 12,
300
+ "Ĭ": 235,
301
+ "Ë": 138,
302
+ "¾": 125,
303
+ "â": 161,
304
+ "il": 283,
305
+ "Ć": 197,
306
+ "dez": 328,
307
+ "Ø": 151,
308
+ "#": 5,
309
+ "þ": 189,
310
+ "ý": 188,
311
+ "Æ": 133,
312
+ "ŀ": 255,
313
+ "nt": 259,
314
+ "noventa": 303,
315
+ "Å": 132,
316
+ "Ô": 147,
317
+ "quinze": 336,
318
+ "Ì": 139,
319
+ "^": 64,
320
+ "quatro": 323,
321
+ "dezes": 329,
322
+ "Ñ": 144,
323
+ "s": 85,
324
+ "n": 80,
325
+ "C": 37,
326
+ "<s>": 0,
327
+ "sess": 293,
328
+ "ě": 218,
329
+ "IJ": 241,
330
+ "quenta": 294,
331
+ ".": 16,
332
+ "Á": 128,
333
+ "´": 115,
334
+ "oit": 272,
335
+ "L": 46,
336
+ "ss": 291,
337
+ "trezentos": 310,
338
+ "{": 93,
339
+ "ġ": 224,
340
+ "g": 73,
341
+ "U": 55,
342
+ "Ĺ": 248,
343
+ "deze": 327,
344
+ "¸": 119,
345
+ "'": 9,
346
+ "p": 82,
347
+ "Ē": 209,
348
+ "ģ": 226,
349
+ "de": 326,
350
+ "ć": 198
351
+ }