suchirsalhan commited on
Commit
1597a68
·
verified ·
1 Parent(s): ab7ba7e

Upload Base + Language-Specific LangMAP gemma2-2b×fin_Latn (smoke smoke.fin.gemma2-2b.v256000)

Browse files
.gitattributes CHANGED
@@ -33,3 +33,6 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
 
 
 
 
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
+ base_tokenizer.json filter=lfs diff=lfs merge=lfs -text
37
+ langspec_fin_Latn.json filter=lfs diff=lfs merge=lfs -text
38
+ tokenizer.json filter=lfs diff=lfs merge=lfs -text
README.md ADDED
@@ -0,0 +1,32 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ library_name: tokenizers
3
+ language:
4
+ - fin
5
+ tags:
6
+ - LangMAP
7
+ - unsupervised
8
+ - tokenizer
9
+ ---
10
+
11
+ # Base + Language-Specific LangMAP — gemma2-2b × fin_Latn
12
+
13
+ Unsupervised tokenization specialised for **fin_Latn**, derived from the
14
+ **gemma2-2b** base BPE tokenizer using the LangMAP framework.
15
+
16
+ This repository bundles:
17
+ - `base_tokenizer.json` — joint LAS Unigram base
18
+ - `langspec_fin_Latn.json` — language-specific overlay (re-EM on fin_Latn corpus)
19
+ - `tokenizer.json` — alias for the overlay (default load target)
20
+
21
+ Inference uses base + language-specific scores together (the LangMAP variant);
22
+ do not use the bare overlay or base on its own.
23
+
24
+ Trained from job `smoke.fin.gemma2-2b.v256000` (vocab=256000, langs=[fin_Latn], iters=5,
25
+ em_mode=soft, byte_fallback=True, seed-fix applied).
26
+
27
+ ## Loading
28
+
29
+ ```python
30
+ from tokenizers import Tokenizer
31
+ tok = Tokenizer.from_file("tokenizer.json")
32
+ ```
base_tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:dacfde4787b1e52e2c95f7f6769e796a2a4cb6f0d8ae13393693a2ba4063ebba
3
+ size 16480687
langspec_fin_Latn.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a12f536c2fcb00f84067dbbb10c9f00972b2a636ec55b63fff0c95c453e3a051
3
+ size 16356694
tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a12f536c2fcb00f84067dbbb10c9f00972b2a636ec55b63fff0c95c453e3a051
3
+ size 16356694