full_chinese_gpu3.1 / tokenizer_config.json
timorobrecht's picture
Add fast tokenizer and benchmark classification compatibility
b187e25 verified
Raw
History Blame Contribute Delete
539 Bytes
{
"backend": "tokenizers",
"bos_token": "<s>",
"eos_token": "</s>",
"jieba": true,
"model_max_length": 512,
"pad_token": "<pad>",
"pinyin_format": "pinyin-code",
"tokenizer_class": "EncodedMandarinTokenizerFast",
"transliteration": "pinyin-code",
"unk_token": "<unk>",
"use_jieba": true,
"auto_map": {
"AutoTokenizer": [
"tokenization_pinyin_code.EncodedMandarinTokenizer",
"tokenization_pinyin_code.EncodedMandarinTokenizerFast"
]
},
"tokenizer_kind": "sentencepiece"
}