haiping commited on
Commit
75ea81e
·
verified ·
1 Parent(s): faf8e2b

Upload 9 files

Browse files

base patch32 256 fp32 onnx

siglip_base_text.onnx ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b9b1674071b771e513cbc3ed4736bf838cd2477bdecb96101b2a83c6c103b560
3
+ size 1129500913
siglip_base_vision.onnx ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f64443505c3d385b27d9e8480779a334143a4f4d243a7fbe9ed66dc0c58b3067
3
+ size 378501505
tokenizer_vocab/README.md ADDED
@@ -0,0 +1,82 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ # SigLIP2 Tokenizer 词汇表
2
+
3
+ ## 文件说明
4
+
5
+ - **vocab_token_to_id.json**: 完整词汇表 (token → ID)
6
+ - 格式: {"token": id}
7
+ - 条目数: 256,000
8
+
9
+ - **vocab_id_to_token.json**: 反向词汇表 (ID → token)
10
+ - 格式: {"id": "token"}
11
+ - 条目数: 256,000
12
+
13
+ - **special_tokens.json**: 特殊tokens
14
+ - PAD: <pad> (ID: 0)
15
+ - EOS: <eos> (ID: 1)
16
+ - BOS: <bos> (ID: 2)
17
+ - UNK: <unk> (ID: 3)
18
+
19
+ - **common_words.json**: 常用词的token ID映射
20
+ - 包含常见的名词、动词、形容词等
21
+
22
+ ## 使用方法
23
+
24
+ ### Python中加载词汇表
25
+
26
+ ```python
27
+ import json
28
+
29
+ # 加载token -> id映射
30
+ with open('vocab_token_to_id.json', 'r', encoding='utf-8') as f:
31
+ vocab = json.load(f)
32
+
33
+ # 查询特定token的ID
34
+ token_id = vocab.get('cat')
35
+ print(f"'cat' 的ID: {token_id}")
36
+
37
+ # 加载id -> token映射
38
+ with open('vocab_id_to_token.json', 'r', encoding='utf-8') as f:
39
+ id_to_token = json.load(f)
40
+
41
+ # 查询特定ID的token
42
+ token = id_to_token.get('4401')
43
+ print(f"ID 4401 的token: {token}")
44
+ ```
45
+
46
+ ### 查询词的token ID
47
+
48
+ ```python
49
+ from transformers import AutoProcessor
50
+
51
+ processor = AutoProcessor.from_pretrained('google/siglip2-base-patch32-256')
52
+ tokenizer = processor.tokenizer
53
+
54
+ # 方法1: 直接查询词汇表
55
+ vocab = tokenizer.get_vocab()
56
+ token_id = vocab.get('cat')
57
+
58
+ # 方法2: 使用encode
59
+ token_ids = tokenizer.encode('cat', add_special_tokens=False)
60
+ print(f"'cat' 的token IDs: {token_ids}")
61
+ ```
62
+
63
+ ## 词汇表统计
64
+
65
+ - 总词汇量: 256,000
66
+ - 特殊tokens: 4 (PAD, EOS, BOS, UNK)
67
+ - Tokenizer类型: GemmaTokenizerFast
68
+ - 模型: google/siglip2-base-patch32-256
69
+
70
+ ## 注意事项
71
+
72
+ 1. **空格处理**: 很多token前面有 `▁` 符号,表示该token前面有空格
73
+ - 例如: `▁cat` 表示 " cat" (前面有空格)
74
+ - 而 `cat` 表示 "cat" (前面没有空格)
75
+
76
+ 2. **子词分割**: 长词可能被分割成多个token
77
+ - 例如: "bicycle" 可能被分割成 ["▁bi", "cycle"]
78
+
79
+ 3. **大小写敏感**: tokenizer区分大小写
80
+ - "Cat" 和 "cat" 是不同的token
81
+
82
+ 4. **数字**: 数字通常有独立的token ID
tokenizer_vocab/STATUS.md ADDED
@@ -0,0 +1,165 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ # Tokenizer词汇表状态报告
2
+
3
+ ## ✅ 生成状态
4
+
5
+ **状态**: 已成功生成并验证
6
+ **生成时间**: 最新
7
+ **验证状态**: ✅ 所有测试通过
8
+
9
+ ## 📊 词汇表统计
10
+
11
+ | 项目 | 数值 |
12
+ |------|------|
13
+ | 总词汇量 | 256,000 tokens |
14
+ | 特殊tokens | 4 个 (PAD, EOS, BOS, UNK) |
15
+ | 常用词 | 47 个 |
16
+ | Tokenizer类型 | GemmaTokenizerFast |
17
+ | 模型 | google/siglip2-base-patch32-256 |
18
+
19
+ ## 📁 文件清单
20
+
21
+ | 文件 | 大小 | 状态 | 说明 |
22
+ |------|------|------|------|
23
+ | vocab_token_to_id.json | 5.4 MB | ✅ | Token → ID 完整映射 |
24
+ | vocab_id_to_token.json | 5.9 MB | ✅ | ID → Token 反向映射 |
25
+ | special_tokens.json | 0.2 KB | ✅ | 特殊tokens定义 |
26
+ | common_words.json | 2.7 KB | ✅ | 47个常用词 |
27
+ | README.md | 2.1 KB | ✅ | 基本使用说明 |
28
+ | USAGE.md | - | ✅ | 详细使用指南 |
29
+ | STATUS.md | - | ✅ | 本文件 |
30
+
31
+ ## ✅ 验证结果
32
+
33
+ ### 文件完整性
34
+ - ✅ 所有必需文件存在
35
+ - ✅ 文件大小正常
36
+ - ✅ JSON格式正确
37
+
38
+ ### 数据正确性
39
+ - ✅ 词汇表大小: 256,000 tokens
40
+ - ✅ 关键tokens验证通过:
41
+ - `'cat'` → 4991
42
+ - `'▁cat'` → 4401
43
+ - `'dog'` → 12240
44
+ - `'▁dog'` → 5929
45
+ - `'a'` → 235250
46
+
47
+ ### 双向映射一致性
48
+ - ✅ token_to_id 和 id_to_token 大小一致
49
+ - ✅ 100个样本抽查全部一致
50
+ - ✅ 反向映射验证通过
51
+
52
+ ### 特殊Tokens
53
+ - ✅ PAD token: `<pad>` (ID: 0)
54
+ - ✅ EOS token: `<eos>` (ID: 1)
55
+ - ✅ BOS token: `<bos>` (ID: 2)
56
+ - ✅ UNK token: `<unk>` (ID: 3)
57
+
58
+ ### 常用词
59
+ - ✅ 47个常用词全部验证通过
60
+ - ✅ ID映射正确
61
+
62
+ ## 🚀 使用方法
63
+
64
+ ### 快速加载
65
+
66
+ ```python
67
+ import json
68
+
69
+ # 加载词汇表
70
+ with open('models/tokenizer_vocab/vocab_token_to_id.json', 'r') as f:
71
+ vocab = json.load(f)
72
+
73
+ # 查询
74
+ print(vocab['cat']) # 4991
75
+ ```
76
+
77
+ ### 运行示例
78
+
79
+ ```bash
80
+ # 加载和使用示例
81
+ python examples/load_vocab_from_models.py
82
+
83
+ # 验证词汇表
84
+ python tools/verify_vocab.py
85
+ ```
86
+
87
+ ### 搜索功能
88
+
89
+ ```bash
90
+ # 搜索特定词
91
+ python tools/extract_tokenizer_vocab.py --search "cat"
92
+ python tools/extract_tokenizer_vocab.py --search "bicycle"
93
+ ```
94
+
95
+ ## 🔄 重新生成
96
+
97
+ 如需重新生成词汇表:
98
+
99
+ ```bash
100
+ # 重新生成到models文件夹
101
+ python tools/extract_tokenizer_vocab.py --output models/tokenizer_vocab
102
+
103
+ # 验证生成结果
104
+ python tools/verify_vocab.py
105
+ ```
106
+
107
+ ## 📚 相关文档
108
+
109
+ - **基本说明**: `README.md`
110
+ - **详细指南**: `USAGE.md`
111
+ - **完整文档**: `../../docs/how_to_get_tokenizer_vocab.md`
112
+ - **快速参考**: `../../docs/tokenizer_quick_reference.md`
113
+ - **技术细节**: `../../docs/tokenization_technical_details.md`
114
+
115
+ ## 🛠️ 相关工具
116
+
117
+ - **提取工具**: `tools/extract_tokenizer_vocab.py`
118
+ - **验证工具**: `tools/verify_vocab.py`
119
+ - **加载示例**: `examples/load_vocab_from_models.py`
120
+ - **使用示例**: `examples/use_tokenizer_vocab.py`
121
+ - **演示脚本**: `examples/tokenization_demo.py`
122
+
123
+ ## 📝 更新日志
124
+
125
+ ### 最新版本
126
+ - ✅ 成功生成256,000个tokens的完整词汇表
127
+ - ✅ 双向映射验证通过
128
+ - ✅ 所有测试通过
129
+ - ✅ 文档完整
130
+
131
+ ## ⚠️ 注意事项
132
+
133
+ 1. **空格前缀**: 词前的 `▁` 表示有空格
134
+ - `'cat'` (4991) - 无空格前缀
135
+ - `'▁cat'` (4401) - 有空格前缀
136
+
137
+ 2. **大小写**: tokenizer区分大小写
138
+ - `'cat'` ≠ `'Cat'` ≠ `'CAT'`
139
+
140
+ 3. **文件大小**: 完整词汇表文件较大 (5-6 MB)
141
+ - 如需轻量级版本,使用 `common_words.json`
142
+
143
+ 4. **编码**: 所有JSON文件使用UTF-8编码
144
+
145
+ ## 🎯 质量保证
146
+
147
+ - ✅ 自动化验证脚本
148
+ - ✅ 完整性检查
149
+ - ✅ 一致性验证
150
+ - ✅ 示例代码测试
151
+ - ✅ 文档完整
152
+
153
+ ## 📞 支持
154
+
155
+ 如遇问题:
156
+ 1. 运行验证脚本: `python tools/verify_vocab.py`
157
+ 2. 查看文档: `USAGE.md` 或 `README.md`
158
+ 3. 重新生成: `python tools/extract_tokenizer_vocab.py --output models/tokenizer_vocab`
159
+
160
+ ---
161
+
162
+ **最后验证时间**: 刚刚
163
+ **验证状态**: ✅ 全部通过
164
+ **词汇表版本**: SigLIP2 (google/siglip2-base-patch32-256)
165
+
tokenizer_vocab/coco_vocab.json ADDED
@@ -0,0 +1,1321 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "person": {
3
+ "forms": {
4
+ "person": 6717,
5
+ "▁person": 1552,
6
+ "Person": 7175,
7
+ "▁Person": 6839
8
+ },
9
+ "encode": {
10
+ "token_ids": [
11
+ 6717
12
+ ],
13
+ "tokens": [
14
+ "person"
15
+ ]
16
+ },
17
+ "id": 6717,
18
+ "token": "person"
19
+ },
20
+ "bicycle": {
21
+ "forms": {
22
+ "bicycle": 134234,
23
+ "▁bicycle": 34334,
24
+ "Bicycle": 178030,
25
+ "▁Bicycle": 91466
26
+ },
27
+ "encode": {
28
+ "token_ids": [
29
+ 134234
30
+ ],
31
+ "tokens": [
32
+ "bicycle"
33
+ ]
34
+ },
35
+ "id": 134234,
36
+ "token": "bicycle"
37
+ },
38
+ "car": {
39
+ "forms": {
40
+ "car": 2269,
41
+ "▁car": 1226,
42
+ "Car": 3726,
43
+ "▁Car": 2244
44
+ },
45
+ "encode": {
46
+ "token_ids": [
47
+ 2269
48
+ ],
49
+ "tokens": [
50
+ "car"
51
+ ]
52
+ },
53
+ "id": 2269,
54
+ "token": "car"
55
+ },
56
+ "motorcycle": {
57
+ "forms": {
58
+ "motorcycle": 165924,
59
+ "▁motorcycle": 33743,
60
+ "Motorcycle": 206757,
61
+ "▁Motorcycle": 82796
62
+ },
63
+ "encode": {
64
+ "token_ids": [
65
+ 165924
66
+ ],
67
+ "tokens": [
68
+ "motorcycle"
69
+ ]
70
+ },
71
+ "id": 165924,
72
+ "token": "motorcycle"
73
+ },
74
+ "airplane": {
75
+ "forms": {
76
+ "airplane": 169566,
77
+ "▁airplane": 44737,
78
+ "Airplane": 229137,
79
+ "▁Airplane": 154228
80
+ },
81
+ "encode": {
82
+ "token_ids": [
83
+ 169566
84
+ ],
85
+ "tokens": [
86
+ "airplane"
87
+ ]
88
+ },
89
+ "id": 169566,
90
+ "token": "airplane"
91
+ },
92
+ "bus": {
93
+ "forms": {
94
+ "bus": 6710,
95
+ "▁bus": 1986,
96
+ "Bus": 14617,
97
+ "▁Bus": 13632
98
+ },
99
+ "encode": {
100
+ "token_ids": [
101
+ 6710
102
+ ],
103
+ "tokens": [
104
+ "bus"
105
+ ]
106
+ },
107
+ "id": 6710,
108
+ "token": "bus"
109
+ },
110
+ "train": {
111
+ "forms": {
112
+ "train": 8297,
113
+ "▁train": 6588,
114
+ "Train": 32348,
115
+ "▁Train": 23098
116
+ },
117
+ "encode": {
118
+ "token_ids": [
119
+ 8297
120
+ ],
121
+ "tokens": [
122
+ "train"
123
+ ]
124
+ },
125
+ "id": 8297,
126
+ "token": "train"
127
+ },
128
+ "truck": {
129
+ "forms": {
130
+ "truck": 56791,
131
+ "▁truck": 9564,
132
+ "Truck": 81410,
133
+ "▁Truck": 39473
134
+ },
135
+ "encode": {
136
+ "token_ids": [
137
+ 56791
138
+ ],
139
+ "tokens": [
140
+ "truck"
141
+ ]
142
+ },
143
+ "id": 56791,
144
+ "token": "truck"
145
+ },
146
+ "boat": {
147
+ "forms": {
148
+ "boat": 29045,
149
+ "▁boat": 11390,
150
+ "Boat": 78863,
151
+ "▁Boat": 40927
152
+ },
153
+ "encode": {
154
+ "token_ids": [
155
+ 29045
156
+ ],
157
+ "tokens": [
158
+ "boat"
159
+ ]
160
+ },
161
+ "id": 29045,
162
+ "token": "boat"
163
+ },
164
+ "traffic light": {
165
+ "encode": {
166
+ "token_ids": [
167
+ 67557,
168
+ 2611
169
+ ],
170
+ "tokens": [
171
+ "traffic",
172
+ "▁light"
173
+ ]
174
+ }
175
+ },
176
+ "fire hydrant": {
177
+ "encode": {
178
+ "token_ids": [
179
+ 7838,
180
+ 6432,
181
+ 5977
182
+ ],
183
+ "tokens": [
184
+ "fire",
185
+ "▁hyd",
186
+ "rant"
187
+ ]
188
+ }
189
+ },
190
+ "stop sign": {
191
+ "encode": {
192
+ "token_ids": [
193
+ 7282,
194
+ 2035
195
+ ],
196
+ "tokens": [
197
+ "stop",
198
+ "▁sign"
199
+ ]
200
+ }
201
+ },
202
+ "parking meter": {
203
+ "encode": {
204
+ "token_ids": [
205
+ 74811,
206
+ 16198
207
+ ],
208
+ "tokens": [
209
+ "parking",
210
+ "▁meter"
211
+ ]
212
+ }
213
+ },
214
+ "bench": {
215
+ "forms": {
216
+ "bench": 31683,
217
+ "▁bench": 15475,
218
+ "Bench": 51453,
219
+ "▁Bench": 41285
220
+ },
221
+ "encode": {
222
+ "token_ids": [
223
+ 31683
224
+ ],
225
+ "tokens": [
226
+ "bench"
227
+ ]
228
+ },
229
+ "id": 31683,
230
+ "token": "bench"
231
+ },
232
+ "bird": {
233
+ "forms": {
234
+ "bird": 18424,
235
+ "▁bird": 13170,
236
+ "Bird": 45124,
237
+ "▁Bird": 23912
238
+ },
239
+ "encode": {
240
+ "token_ids": [
241
+ 18424
242
+ ],
243
+ "tokens": [
244
+ "bird"
245
+ ]
246
+ },
247
+ "id": 18424,
248
+ "token": "bird"
249
+ },
250
+ "cat": {
251
+ "forms": {
252
+ "cat": 4991,
253
+ "▁cat": 4401,
254
+ "Cat": 9843,
255
+ "▁Cat": 6828
256
+ },
257
+ "encode": {
258
+ "token_ids": [
259
+ 4991
260
+ ],
261
+ "tokens": [
262
+ "cat"
263
+ ]
264
+ },
265
+ "id": 4991,
266
+ "token": "cat"
267
+ },
268
+ "dog": {
269
+ "forms": {
270
+ "dog": 12240,
271
+ "▁dog": 5929,
272
+ "Dog": 21401,
273
+ "▁Dog": 12935
274
+ },
275
+ "encode": {
276
+ "token_ids": [
277
+ 12240
278
+ ],
279
+ "tokens": [
280
+ "dog"
281
+ ]
282
+ },
283
+ "id": 12240,
284
+ "token": "dog"
285
+ },
286
+ "horse": {
287
+ "forms": {
288
+ "horse": 38689,
289
+ "▁horse": 10468,
290
+ "Horse": 62788,
291
+ "▁Horse": 29572
292
+ },
293
+ "encode": {
294
+ "token_ids": [
295
+ 38689
296
+ ],
297
+ "tokens": [
298
+ "horse"
299
+ ]
300
+ },
301
+ "id": 38689,
302
+ "token": "horse"
303
+ },
304
+ "sheep": {
305
+ "forms": {
306
+ "sheep": 111417,
307
+ "▁sheep": 21304,
308
+ "Sheep": 103092,
309
+ "▁Sheep": 64756
310
+ },
311
+ "encode": {
312
+ "token_ids": [
313
+ 111417
314
+ ],
315
+ "tokens": [
316
+ "sheep"
317
+ ]
318
+ },
319
+ "id": 111417,
320
+ "token": "sheep"
321
+ },
322
+ "cow": {
323
+ "forms": {
324
+ "cow": 14706,
325
+ "▁cow": 13910,
326
+ "Cow": 44111,
327
+ "▁Cow": 20845
328
+ },
329
+ "encode": {
330
+ "token_ids": [
331
+ 14706
332
+ ],
333
+ "tokens": [
334
+ "cow"
335
+ ]
336
+ },
337
+ "id": 14706,
338
+ "token": "cow"
339
+ },
340
+ "elephant": {
341
+ "forms": {
342
+ "elephant": 135290,
343
+ "▁elephant": 38816,
344
+ "Elephant": 139690,
345
+ "▁Elephant": 74431
346
+ },
347
+ "encode": {
348
+ "token_ids": [
349
+ 135290
350
+ ],
351
+ "tokens": [
352
+ "elephant"
353
+ ]
354
+ },
355
+ "id": 135290,
356
+ "token": "elephant"
357
+ },
358
+ "bear": {
359
+ "forms": {
360
+ "bear": 21033,
361
+ "▁bear": 8718,
362
+ "Bear": 24561,
363
+ "▁Bear": 20323
364
+ },
365
+ "encode": {
366
+ "token_ids": [
367
+ 21033
368
+ ],
369
+ "tokens": [
370
+ "bear"
371
+ ]
372
+ },
373
+ "id": 21033,
374
+ "token": "bear"
375
+ },
376
+ "zebra": {
377
+ "forms": {
378
+ "zebra": 139048,
379
+ "▁zebra": 64801,
380
+ "Zebra": 161784,
381
+ "▁Zebra": 131247
382
+ },
383
+ "encode": {
384
+ "token_ids": [
385
+ 139048
386
+ ],
387
+ "tokens": [
388
+ "zebra"
389
+ ]
390
+ },
391
+ "id": 139048,
392
+ "token": "zebra"
393
+ },
394
+ "giraffe": {
395
+ "forms": {
396
+ "▁giraffe": 117771,
397
+ "Giraffe": 233208
398
+ },
399
+ "encode": {
400
+ "token_ids": [
401
+ 126258,
402
+ 10303
403
+ ],
404
+ "tokens": [
405
+ "gira",
406
+ "ffe"
407
+ ]
408
+ }
409
+ },
410
+ "backpack": {
411
+ "forms": {
412
+ "backpack": 203210,
413
+ "▁backpack": 26408,
414
+ "▁Backpack": 100536
415
+ },
416
+ "encode": {
417
+ "token_ids": [
418
+ 203210
419
+ ],
420
+ "tokens": [
421
+ "backpack"
422
+ ]
423
+ },
424
+ "id": 203210,
425
+ "token": "backpack"
426
+ },
427
+ "umbrella": {
428
+ "forms": {
429
+ "umbrella": 201328,
430
+ "▁umbrella": 43562,
431
+ "▁Umbrella": 135457
432
+ },
433
+ "encode": {
434
+ "token_ids": [
435
+ 201328
436
+ ],
437
+ "tokens": [
438
+ "umbrella"
439
+ ]
440
+ },
441
+ "id": 201328,
442
+ "token": "umbrella"
443
+ },
444
+ "handbag": {
445
+ "forms": {
446
+ "▁handbag": 86119
447
+ },
448
+ "encode": {
449
+ "token_ids": [
450
+ 3345,
451
+ 6214
452
+ ],
453
+ "tokens": [
454
+ "hand",
455
+ "bag"
456
+ ]
457
+ }
458
+ },
459
+ "tie": {
460
+ "forms": {
461
+ "tie": 6290,
462
+ "▁tie": 10985,
463
+ "Tie": 64403,
464
+ "▁Tie": 34135
465
+ },
466
+ "encode": {
467
+ "token_ids": [
468
+ 6290
469
+ ],
470
+ "tokens": [
471
+ "tie"
472
+ ]
473
+ },
474
+ "id": 6290,
475
+ "token": "tie"
476
+ },
477
+ "suitcase": {
478
+ "forms": {
479
+ "▁suitcase": 79957
480
+ },
481
+ "encode": {
482
+ "token_ids": [
483
+ 18555,
484
+ 1533
485
+ ],
486
+ "tokens": [
487
+ "suit",
488
+ "case"
489
+ ]
490
+ }
491
+ },
492
+ "frisbee": {
493
+ "encode": {
494
+ "token_ids": [
495
+ 70219,
496
+ 19476
497
+ ],
498
+ "tokens": [
499
+ "fris",
500
+ "bee"
501
+ ]
502
+ }
503
+ },
504
+ "skis": {
505
+ "forms": {
506
+ "skis": 211141,
507
+ "▁skis": 107791
508
+ },
509
+ "encode": {
510
+ "token_ids": [
511
+ 211141
512
+ ],
513
+ "tokens": [
514
+ "skis"
515
+ ]
516
+ },
517
+ "id": 211141,
518
+ "token": "skis"
519
+ },
520
+ "snowboard": {
521
+ "forms": {
522
+ "▁snowboard": 91337
523
+ },
524
+ "encode": {
525
+ "token_ids": [
526
+ 35514,
527
+ 3334
528
+ ],
529
+ "tokens": [
530
+ "snow",
531
+ "board"
532
+ ]
533
+ }
534
+ },
535
+ "sports ball": {
536
+ "encode": {
537
+ "token_ids": [
538
+ 32811,
539
+ 5744
540
+ ],
541
+ "tokens": [
542
+ "sports",
543
+ "▁ball"
544
+ ]
545
+ }
546
+ },
547
+ "kite": {
548
+ "forms": {
549
+ "kite": 58060,
550
+ "▁kite": 72215,
551
+ "Kite": 221887,
552
+ "▁Kite": 121582
553
+ },
554
+ "encode": {
555
+ "token_ids": [
556
+ 58060
557
+ ],
558
+ "tokens": [
559
+ "kite"
560
+ ]
561
+ },
562
+ "id": 58060,
563
+ "token": "kite"
564
+ },
565
+ "baseball bat": {
566
+ "encode": {
567
+ "token_ids": [
568
+ 111021,
569
+ 5085
570
+ ],
571
+ "tokens": [
572
+ "baseball",
573
+ "▁bat"
574
+ ]
575
+ }
576
+ },
577
+ "baseball glove": {
578
+ "encode": {
579
+ "token_ids": [
580
+ 111021,
581
+ 53535
582
+ ],
583
+ "tokens": [
584
+ "baseball",
585
+ "▁glove"
586
+ ]
587
+ }
588
+ },
589
+ "skateboard": {
590
+ "forms": {
591
+ "▁skateboard": 88403
592
+ },
593
+ "encode": {
594
+ "token_ids": [
595
+ 126209,
596
+ 3334
597
+ ],
598
+ "tokens": [
599
+ "skate",
600
+ "board"
601
+ ]
602
+ }
603
+ },
604
+ "surfboard": {
605
+ "forms": {
606
+ "▁surfboard": 211764
607
+ },
608
+ "encode": {
609
+ "token_ids": [
610
+ 67948,
611
+ 3334
612
+ ],
613
+ "tokens": [
614
+ "surf",
615
+ "board"
616
+ ]
617
+ }
618
+ },
619
+ "tennis racket": {
620
+ "encode": {
621
+ "token_ids": [
622
+ 90092,
623
+ 115124
624
+ ],
625
+ "tokens": [
626
+ "tennis",
627
+ "▁racket"
628
+ ]
629
+ }
630
+ },
631
+ "bottle": {
632
+ "forms": {
633
+ "bottle": 77455,
634
+ "▁bottle": 12989,
635
+ "Bottle": 113074,
636
+ "▁Bottle": 58299
637
+ },
638
+ "encode": {
639
+ "token_ids": [
640
+ 77455
641
+ ],
642
+ "tokens": [
643
+ "bottle"
644
+ ]
645
+ },
646
+ "id": 77455,
647
+ "token": "bottle"
648
+ },
649
+ "wine glass": {
650
+ "encode": {
651
+ "token_ids": [
652
+ 48758,
653
+ 5570
654
+ ],
655
+ "tokens": [
656
+ "wine",
657
+ "▁glass"
658
+ ]
659
+ }
660
+ },
661
+ "cup": {
662
+ "forms": {
663
+ "cup": 10125,
664
+ "▁cup": 7190,
665
+ "Cup": 45490,
666
+ "▁Cup": 10701
667
+ },
668
+ "encode": {
669
+ "token_ids": [
670
+ 10125
671
+ ],
672
+ "tokens": [
673
+ "cup"
674
+ ]
675
+ },
676
+ "id": 10125,
677
+ "token": "cup"
678
+ },
679
+ "fork": {
680
+ "forms": {
681
+ "fork": 49240,
682
+ "▁fork": 24943,
683
+ "Fork": 72844,
684
+ "▁Fork": 50819
685
+ },
686
+ "encode": {
687
+ "token_ids": [
688
+ 49240
689
+ ],
690
+ "tokens": [
691
+ "fork"
692
+ ]
693
+ },
694
+ "id": 49240,
695
+ "token": "fork"
696
+ },
697
+ "knife": {
698
+ "forms": {
699
+ "knife": 47674,
700
+ "▁knife": 19193,
701
+ "Knife": 70855,
702
+ "▁Knife": 76352
703
+ },
704
+ "encode": {
705
+ "token_ids": [
706
+ 47674
707
+ ],
708
+ "tokens": [
709
+ "knife"
710
+ ]
711
+ },
712
+ "id": 47674,
713
+ "token": "knife"
714
+ },
715
+ "spoon": {
716
+ "forms": {
717
+ "spoon": 169224,
718
+ "▁spoon": 35306,
719
+ "Spoon": 161623,
720
+ "▁Spoon": 103888
721
+ },
722
+ "encode": {
723
+ "token_ids": [
724
+ 169224
725
+ ],
726
+ "tokens": [
727
+ "spoon"
728
+ ]
729
+ },
730
+ "id": 169224,
731
+ "token": "spoon"
732
+ },
733
+ "bowl": {
734
+ "forms": {
735
+ "bowl": 77093,
736
+ "▁bowl": 14581,
737
+ "Bowl": 153549,
738
+ "▁Bowl": 29270
739
+ },
740
+ "encode": {
741
+ "token_ids": [
742
+ 77093
743
+ ],
744
+ "tokens": [
745
+ "bowl"
746
+ ]
747
+ },
748
+ "id": 77093,
749
+ "token": "bowl"
750
+ },
751
+ "banana": {
752
+ "forms": {
753
+ "banana": 68092,
754
+ "▁banana": 31985,
755
+ "Banana": 75581,
756
+ "▁Banana": 73639
757
+ },
758
+ "encode": {
759
+ "token_ids": [
760
+ 68092
761
+ ],
762
+ "tokens": [
763
+ "banana"
764
+ ]
765
+ },
766
+ "id": 68092,
767
+ "token": "banana"
768
+ },
769
+ "apple": {
770
+ "forms": {
771
+ "apple": 22447,
772
+ "▁apple": 15491,
773
+ "Apple": 22732,
774
+ "▁Apple": 9865
775
+ },
776
+ "encode": {
777
+ "token_ids": [
778
+ 22447
779
+ ],
780
+ "tokens": [
781
+ "apple"
782
+ ]
783
+ },
784
+ "id": 22447,
785
+ "token": "apple"
786
+ },
787
+ "sandwich": {
788
+ "forms": {
789
+ "sandwich": 159965,
790
+ "▁sandwich": 34176,
791
+ "Sandwich": 150174,
792
+ "▁Sandwich": 77980
793
+ },
794
+ "encode": {
795
+ "token_ids": [
796
+ 159965
797
+ ],
798
+ "tokens": [
799
+ "sandwich"
800
+ ]
801
+ },
802
+ "id": 159965,
803
+ "token": "sandwich"
804
+ },
805
+ "orange": {
806
+ "forms": {
807
+ "orange": 22103,
808
+ "▁orange": 10436,
809
+ "Orange": 36565,
810
+ "▁Orange": 20723
811
+ },
812
+ "encode": {
813
+ "token_ids": [
814
+ 22103
815
+ ],
816
+ "tokens": [
817
+ "orange"
818
+ ]
819
+ },
820
+ "id": 22103,
821
+ "token": "orange"
822
+ },
823
+ "broccoli": {
824
+ "forms": {
825
+ "▁broccoli": 74824,
826
+ "Broccoli": 227006,
827
+ "▁Broccoli": 152084
828
+ },
829
+ "encode": {
830
+ "token_ids": [
831
+ 5220,
832
+ 49279
833
+ ],
834
+ "tokens": [
835
+ "bro",
836
+ "ccoli"
837
+ ]
838
+ }
839
+ },
840
+ "carrot": {
841
+ "forms": {
842
+ "carrot": 176463,
843
+ "▁carrot": 64058,
844
+ "Carrot": 151432,
845
+ "▁Carrot": 146032
846
+ },
847
+ "encode": {
848
+ "token_ids": [
849
+ 176463
850
+ ],
851
+ "tokens": [
852
+ "carrot"
853
+ ]
854
+ },
855
+ "id": 176463,
856
+ "token": "carrot"
857
+ },
858
+ "hot dog": {
859
+ "encode": {
860
+ "token_ids": [
861
+ 5074,
862
+ 5929
863
+ ],
864
+ "tokens": [
865
+ "hot",
866
+ "▁dog"
867
+ ]
868
+ }
869
+ },
870
+ "pizza": {
871
+ "forms": {
872
+ "pizza": 46722,
873
+ "▁pizza": 14967,
874
+ "Pizza": 44738,
875
+ "▁Pizza": 33787
876
+ },
877
+ "encode": {
878
+ "token_ids": [
879
+ 46722
880
+ ],
881
+ "tokens": [
882
+ "pizza"
883
+ ]
884
+ },
885
+ "id": 46722,
886
+ "token": "pizza"
887
+ },
888
+ "donut": {
889
+ "forms": {
890
+ "donut": 166772,
891
+ "▁donut": 92350,
892
+ "Donut": 164820,
893
+ "▁Donut": 190951
894
+ },
895
+ "encode": {
896
+ "token_ids": [
897
+ 166772
898
+ ],
899
+ "tokens": [
900
+ "donut"
901
+ ]
902
+ },
903
+ "id": 166772,
904
+ "token": "donut"
905
+ },
906
+ "cake": {
907
+ "forms": {
908
+ "cake": 23144,
909
+ "▁cake": 11514,
910
+ "Cake": 62932,
911
+ "▁Cake": 33524
912
+ },
913
+ "encode": {
914
+ "token_ids": [
915
+ 23144
916
+ ],
917
+ "tokens": [
918
+ "cake"
919
+ ]
920
+ },
921
+ "id": 23144,
922
+ "token": "cake"
923
+ },
924
+ "chair": {
925
+ "forms": {
926
+ "chair": 26454,
927
+ "▁chair": 9205,
928
+ "Chair": 28774,
929
+ "▁Chair": 11893
930
+ },
931
+ "encode": {
932
+ "token_ids": [
933
+ 26454
934
+ ],
935
+ "tokens": [
936
+ "chair"
937
+ ]
938
+ },
939
+ "id": 26454,
940
+ "token": "chair"
941
+ },
942
+ "couch": {
943
+ "forms": {
944
+ "couch": 132772,
945
+ "▁couch": 34675,
946
+ "Couch": 187889,
947
+ "▁Couch": 106871
948
+ },
949
+ "encode": {
950
+ "token_ids": [
951
+ 132772
952
+ ],
953
+ "tokens": [
954
+ "couch"
955
+ ]
956
+ },
957
+ "id": 132772,
958
+ "token": "couch"
959
+ },
960
+ "potted plant": {
961
+ "encode": {
962
+ "token_ids": [
963
+ 11403,
964
+ 691,
965
+ 4829
966
+ ],
967
+ "tokens": [
968
+ "pot",
969
+ "ted",
970
+ "▁plant"
971
+ ]
972
+ }
973
+ },
974
+ "bed": {
975
+ "forms": {
976
+ "bed": 2907,
977
+ "▁bed": 3609,
978
+ "Bed": 20401,
979
+ "▁Bed": 12741
980
+ },
981
+ "encode": {
982
+ "token_ids": [
983
+ 2907
984
+ ],
985
+ "tokens": [
986
+ "bed"
987
+ ]
988
+ },
989
+ "id": 2907,
990
+ "token": "bed"
991
+ },
992
+ "dining table": {
993
+ "encode": {
994
+ "token_ids": [
995
+ 97229,
996
+ 3037
997
+ ],
998
+ "tokens": [
999
+ "dining",
1000
+ "▁table"
1001
+ ]
1002
+ }
1003
+ },
1004
+ "toilet": {
1005
+ "forms": {
1006
+ "toilet": 134695,
1007
+ "▁toilet": 19384,
1008
+ "Toilet": 141901,
1009
+ "▁Toilet": 73399
1010
+ },
1011
+ "encode": {
1012
+ "token_ids": [
1013
+ 134695
1014
+ ],
1015
+ "tokens": [
1016
+ "toilet"
1017
+ ]
1018
+ },
1019
+ "id": 134695,
1020
+ "token": "toilet"
1021
+ },
1022
+ "tv": {
1023
+ "forms": {
1024
+ "tv": 9540,
1025
+ "▁tv": 9445,
1026
+ "Tv": 41430,
1027
+ "▁Tv": 74855
1028
+ },
1029
+ "encode": {
1030
+ "token_ids": [
1031
+ 9540
1032
+ ],
1033
+ "tokens": [
1034
+ "tv"
1035
+ ]
1036
+ },
1037
+ "id": 9540,
1038
+ "token": "tv"
1039
+ },
1040
+ "laptop": {
1041
+ "forms": {
1042
+ "laptop": 73556,
1043
+ "▁laptop": 15690,
1044
+ "Laptop": 117635,
1045
+ "▁Laptop": 63054
1046
+ },
1047
+ "encode": {
1048
+ "token_ids": [
1049
+ 73556
1050
+ ],
1051
+ "tokens": [
1052
+ "laptop"
1053
+ ]
1054
+ },
1055
+ "id": 73556,
1056
+ "token": "laptop"
1057
+ },
1058
+ "mouse": {
1059
+ "forms": {
1060
+ "mouse": 17536,
1061
+ "▁mouse": 11937,
1062
+ "Mouse": 13857,
1063
+ "▁Mouse": 27968
1064
+ },
1065
+ "encode": {
1066
+ "token_ids": [
1067
+ 17536
1068
+ ],
1069
+ "tokens": [
1070
+ "mouse"
1071
+ ]
1072
+ },
1073
+ "id": 17536,
1074
+ "token": "mouse"
1075
+ },
1076
+ "remote": {
1077
+ "forms": {
1078
+ "remote": 25888,
1079
+ "▁remote": 11196,
1080
+ "Remote": 23947,
1081
+ "▁Remote": 28028
1082
+ },
1083
+ "encode": {
1084
+ "token_ids": [
1085
+ 25888
1086
+ ],
1087
+ "tokens": [
1088
+ "remote"
1089
+ ]
1090
+ },
1091
+ "id": 25888,
1092
+ "token": "remote"
1093
+ },
1094
+ "keyboard": {
1095
+ "forms": {
1096
+ "keyboard": 22959,
1097
+ "▁keyboard": 20434,
1098
+ "Keyboard": 32731,
1099
+ "▁Keyboard": 46891
1100
+ },
1101
+ "encode": {
1102
+ "token_ids": [
1103
+ 22959
1104
+ ],
1105
+ "tokens": [
1106
+ "keyboard"
1107
+ ]
1108
+ },
1109
+ "id": 22959,
1110
+ "token": "keyboard"
1111
+ },
1112
+ "cell phone": {
1113
+ "encode": {
1114
+ "token_ids": [
1115
+ 2896,
1116
+ 5248
1117
+ ],
1118
+ "tokens": [
1119
+ "cell",
1120
+ "▁phone"
1121
+ ]
1122
+ }
1123
+ },
1124
+ "microwave": {
1125
+ "forms": {
1126
+ "▁microwave": 40335,
1127
+ "Microwave": 179681,
1128
+ "▁Microwave": 93639
1129
+ },
1130
+ "encode": {
1131
+ "token_ids": [
1132
+ 2324,
1133
+ 29733
1134
+ ],
1135
+ "tokens": [
1136
+ "mic",
1137
+ "rowave"
1138
+ ]
1139
+ }
1140
+ },
1141
+ "oven": {
1142
+ "forms": {
1143
+ "oven": 112964,
1144
+ "▁oven": 18403,
1145
+ "Oven": 164360,
1146
+ "▁Oven": 91129
1147
+ },
1148
+ "encode": {
1149
+ "token_ids": [
1150
+ 112964
1151
+ ],
1152
+ "tokens": [
1153
+ "oven"
1154
+ ]
1155
+ },
1156
+ "id": 112964,
1157
+ "token": "oven"
1158
+ },
1159
+ "toaster": {
1160
+ "forms": {
1161
+ "toaster": 234116,
1162
+ "▁toaster": 126789,
1163
+ "Toaster": 215011
1164
+ },
1165
+ "encode": {
1166
+ "token_ids": [
1167
+ 234116
1168
+ ],
1169
+ "tokens": [
1170
+ "toaster"
1171
+ ]
1172
+ },
1173
+ "id": 234116,
1174
+ "token": "toaster"
1175
+ },
1176
+ "sink": {
1177
+ "forms": {
1178
+ "sink": 60770,
1179
+ "▁sink": 22340,
1180
+ "Sink": 60705,
1181
+ "▁Sink": 87026
1182
+ },
1183
+ "encode": {
1184
+ "token_ids": [
1185
+ 60770
1186
+ ],
1187
+ "tokens": [
1188
+ "sink"
1189
+ ]
1190
+ },
1191
+ "id": 60770,
1192
+ "token": "sink"
1193
+ },
1194
+ "refrigerator": {
1195
+ "forms": {
1196
+ "▁refrigerator": 46154,
1197
+ "▁Refrigerator": 188820
1198
+ },
1199
+ "encode": {
1200
+ "token_ids": [
1201
+ 170546,
1202
+ 1291
1203
+ ],
1204
+ "tokens": [
1205
+ "refriger",
1206
+ "ator"
1207
+ ]
1208
+ }
1209
+ },
1210
+ "book": {
1211
+ "forms": {
1212
+ "book": 2545,
1213
+ "▁book": 2870,
1214
+ "Book": 7229,
1215
+ "▁Book": 6757
1216
+ },
1217
+ "encode": {
1218
+ "token_ids": [
1219
+ 2545
1220
+ ],
1221
+ "tokens": [
1222
+ "book"
1223
+ ]
1224
+ },
1225
+ "id": 2545,
1226
+ "token": "book"
1227
+ },
1228
+ "clock": {
1229
+ "forms": {
1230
+ "clock": 14153,
1231
+ "▁clock": 12177,
1232
+ "Clock": 30458,
1233
+ "▁Clock": 40095
1234
+ },
1235
+ "encode": {
1236
+ "token_ids": [
1237
+ 14153
1238
+ ],
1239
+ "tokens": [
1240
+ "clock"
1241
+ ]
1242
+ },
1243
+ "id": 14153,
1244
+ "token": "clock"
1245
+ },
1246
+ "vase": {
1247
+ "forms": {
1248
+ "vase": 123002,
1249
+ "▁vase": 34557,
1250
+ "Vase": 206225,
1251
+ "▁Vase": 94699
1252
+ },
1253
+ "encode": {
1254
+ "token_ids": [
1255
+ 123002
1256
+ ],
1257
+ "tokens": [
1258
+ "vase"
1259
+ ]
1260
+ },
1261
+ "id": 123002,
1262
+ "token": "vase"
1263
+ },
1264
+ "scissors": {
1265
+ "forms": {
1266
+ "scissors": 163803,
1267
+ "▁scissors": 59283,
1268
+ "Scissors": 147376,
1269
+ "▁Scissors": 109049
1270
+ },
1271
+ "encode": {
1272
+ "token_ids": [
1273
+ 163803
1274
+ ],
1275
+ "tokens": [
1276
+ "scissors"
1277
+ ]
1278
+ },
1279
+ "id": 163803,
1280
+ "token": "scissors"
1281
+ },
1282
+ "teddy bear": {
1283
+ "encode": {
1284
+ "token_ids": [
1285
+ 139341,
1286
+ 8718
1287
+ ],
1288
+ "tokens": [
1289
+ "teddy",
1290
+ "▁bear"
1291
+ ]
1292
+ }
1293
+ },
1294
+ "hair drier": {
1295
+ "encode": {
1296
+ "token_ids": [
1297
+ 28499,
1298
+ 134028
1299
+ ],
1300
+ "tokens": [
1301
+ "hair",
1302
+ "▁drier"
1303
+ ]
1304
+ }
1305
+ },
1306
+ "toothbrush": {
1307
+ "forms": {
1308
+ "▁toothbrush": 103255
1309
+ },
1310
+ "encode": {
1311
+ "token_ids": [
1312
+ 12521,
1313
+ 31453
1314
+ ],
1315
+ "tokens": [
1316
+ "tooth",
1317
+ "brush"
1318
+ ]
1319
+ }
1320
+ }
1321
+ }
tokenizer_vocab/common_words.json ADDED
@@ -0,0 +1,190 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "a": {
3
+ "token": "a",
4
+ "id": 235250
5
+ },
6
+ "the": {
7
+ "token": "the",
8
+ "id": 1175
9
+ },
10
+ "an": {
11
+ "token": "an",
12
+ "id": 481
13
+ },
14
+ "cat": {
15
+ "token": "cat",
16
+ "id": 4991
17
+ },
18
+ "dog": {
19
+ "token": "dog",
20
+ "id": 12240
21
+ },
22
+ "bird": {
23
+ "token": "bird",
24
+ "id": 18424
25
+ },
26
+ "fish": {
27
+ "token": "fish",
28
+ "id": 11578
29
+ },
30
+ "person": {
31
+ "token": "person",
32
+ "id": 6717
33
+ },
34
+ "man": {
35
+ "token": "man",
36
+ "id": 1066
37
+ },
38
+ "woman": {
39
+ "token": "woman",
40
+ "id": 14172
41
+ },
42
+ "child": {
43
+ "token": "child",
44
+ "id": 3647
45
+ },
46
+ "car": {
47
+ "token": "car",
48
+ "id": 2269
49
+ },
50
+ "bike": {
51
+ "token": "bike",
52
+ "id": 31674
53
+ },
54
+ "bicycle": {
55
+ "token": "bicycle",
56
+ "id": 134234
57
+ },
58
+ "bus": {
59
+ "token": "bus",
60
+ "id": 6710
61
+ },
62
+ "train": {
63
+ "token": "train",
64
+ "id": 8297
65
+ },
66
+ "house": {
67
+ "token": "house",
68
+ "id": 6111
69
+ },
70
+ "building": {
71
+ "token": "building",
72
+ "id": 18802
73
+ },
74
+ "tree": {
75
+ "token": "tree",
76
+ "id": 9197
77
+ },
78
+ "flower": {
79
+ "token": "flower",
80
+ "id": 18697
81
+ },
82
+ "red": {
83
+ "token": "red",
84
+ "id": 854
85
+ },
86
+ "blue": {
87
+ "token": "blue",
88
+ "id": 8796
89
+ },
90
+ "green": {
91
+ "token": "green",
92
+ "id": 9740
93
+ },
94
+ "yellow": {
95
+ "token": "yellow",
96
+ "id": 22006
97
+ },
98
+ "black": {
99
+ "token": "black",
100
+ "id": 6944
101
+ },
102
+ "white": {
103
+ "token": "white",
104
+ "id": 7384
105
+ },
106
+ "big": {
107
+ "token": "big",
108
+ "id": 7773
109
+ },
110
+ "small": {
111
+ "token": "small",
112
+ "id": 10498
113
+ },
114
+ "large": {
115
+ "token": "large",
116
+ "id": 13210
117
+ },
118
+ "tiny": {
119
+ "token": "tiny",
120
+ "id": 35282
121
+ },
122
+ "running": {
123
+ "token": "running",
124
+ "id": 23655
125
+ },
126
+ "walking": {
127
+ "token": "walking",
128
+ "id": 61916
129
+ },
130
+ "sitting": {
131
+ "token": "sitting",
132
+ "id": 116373
133
+ },
134
+ "standing": {
135
+ "token": "standing",
136
+ "id": 8898
137
+ },
138
+ "eating": {
139
+ "token": "eating",
140
+ "id": 71409
141
+ },
142
+ "drinking": {
143
+ "token": "drinking",
144
+ "id": 139848
145
+ },
146
+ "sleeping": {
147
+ "token": "sleeping",
148
+ "id": 113608
149
+ },
150
+ "photo": {
151
+ "token": "photo",
152
+ "id": 5817
153
+ },
154
+ "image": {
155
+ "token": "image",
156
+ "id": 2502
157
+ },
158
+ "picture": {
159
+ "token": "picture",
160
+ "id": 12933
161
+ },
162
+ "of": {
163
+ "token": "of",
164
+ "id": 559
165
+ },
166
+ "in": {
167
+ "token": "in",
168
+ "id": 473
169
+ },
170
+ "on": {
171
+ "token": "on",
172
+ "id": 477
173
+ },
174
+ "at": {
175
+ "token": "at",
176
+ "id": 482
177
+ },
178
+ "with": {
179
+ "token": "with",
180
+ "id": 3041
181
+ },
182
+ "and": {
183
+ "token": "and",
184
+ "id": 639
185
+ },
186
+ "or": {
187
+ "token": "or",
188
+ "id": 483
189
+ }
190
+ }
tokenizer_vocab/special_tokens.json ADDED
@@ -0,0 +1,10 @@
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "pad_token": "<pad>",
3
+ "pad_token_id": 0,
4
+ "eos_token": "<eos>",
5
+ "eos_token_id": 1,
6
+ "bos_token": "<bos>",
7
+ "bos_token_id": 2,
8
+ "unk_token": "<unk>",
9
+ "unk_token_id": 3
10
+ }
tokenizer_vocab/vocab_id_to_token.json ADDED
The diff for this file is too large to render. See raw diff
 
tokenizer_vocab/vocab_token_to_id.json ADDED
The diff for this file is too large to render. See raw diff