{ "tokenizer": { "vocab_size": 16000, "min_frequency": 2, "special_tokens": [ "", "", "", "", "" ], "dataset": "facebook/xnli/tr", "corpus_lines": 800404 }, "metrics": { "tokens_per_char": 0.2299516116084315, "fertility": 1.7223050205645496, "avg_seq_len": 17.950666666666667, "vocab_coverage": 1.0, "total_sentences": 15000, "unique_word_types": 29531 } }