Upload Base + Language-Specific LangMAP gemma2-2b×fin_Latn (smoke smoke.fin.gemma2-2b.v256000)
1597a68 verified metadata
library_name: tokenizers
language:
- fin
tags:
- LangMAP
- unsupervised
- tokenizer
Base + Language-Specific LangMAP — gemma2-2b × fin_Latn
Unsupervised tokenization specialised for fin_Latn, derived from the gemma2-2b base BPE tokenizer using the LangMAP framework.
This repository bundles:
base_tokenizer.json— joint LAS Unigram baselangspec_fin_Latn.json— language-specific overlay (re-EM on fin_Latn corpus)tokenizer.json— alias for the overlay (default load target)
Inference uses base + language-specific scores together (the LangMAP variant); do not use the bare overlay or base on its own.
Trained from job smoke.fin.gemma2-2b.v256000 (vocab=256000, langs=[fin_Latn], iters=5,
em_mode=soft, byte_fallback=True, seed-fix applied).
Loading
from tokenizers import Tokenizer
tok = Tokenizer.from_file("tokenizer.json")