--- language: ru license: apache-2.0 tags: - tokenizer - unigram - russian - xnli - nlp-research datasets: - facebook/xnli --- # NIRVLab — Unigram Tokenizer for Russian XNLI A **Unigram Language Model** tokenizer trained from scratch on the Russian (`ru`) subset of the [facebook/xnli](https://huggingface.co/datasets/facebook/xnli) dataset. ## Training Details | Parameter | Value | |---|---| | Algorithm | Unigram LM (SentencePiece-style) | | Vocabulary size | 8,000 | | Special tokens | `, , , , ` | | Corpus | `facebook/xnli` / `ru` — all splits | | Corpus size | 800,404 sentences | | Normalizer | Nmt + NFC Unicode | | Pre-tokenizer | Metaspace (▁ prefix) | | Shrinking factor | 0.75 | | Max piece length | 16 | ## Evaluation Metrics | Metric | Value | |---|---| | Tokens / char | `0.3315` | | Fertility (tokens / word) | `2.2807` | | Avg sequence length | `27.54` tokens | | Vocabulary coverage | `1.0000` | ## Usage ```python from transformers import AutoTokenizer tokenizer = AutoTokenizer.from_pretrained("NIRVLab/xnli-unigram-rusia") tokens = tokenizer("Привет, мир!", return_tensors="pt") ```