Text Classification
Transformers
Safetensors
PyTorch
bert
multilingual
language-identification
language-detection
language-classification
langid
nlp
lightweight
fast
open-source
text-embeddings-inference
Instructions to use Comunidade-Synapse-BR/Synapse-LangID with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use Comunidade-Synapse-BR/Synapse-LangID with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-classification", model="Comunidade-Synapse-BR/Synapse-LangID")# Load model directly from transformers import AutoTokenizer, AutoModel tokenizer = AutoTokenizer.from_pretrained("Comunidade-Synapse-BR/Synapse-LangID") model = AutoModel.from_pretrained("Comunidade-Synapse-BR/Synapse-LangID", device_map="auto") - Notebooks
- Google Colab
- Kaggle
Update README.md
Browse files
README.md
CHANGED
|
@@ -44,106 +44,104 @@ metrics:
|
|
| 44 |
|
| 45 |
# 🌍 Synapse-LangID
|
| 46 |
|
| 47 |
-
**Synapse-LangID**
|
| 48 |
|
| 49 |
-
|
| 50 |
|
| 51 |
-
|
| 52 |
|
| 53 |
---
|
| 54 |
|
| 55 |
-
# 🚀
|
| 56 |
|
| 57 |
-
- 🌍
|
| 58 |
-
- ⚡
|
| 59 |
-
- 🪶
|
| 60 |
-
- 📦
|
| 61 |
-
- 🤗
|
| 62 |
-
- 🔓
|
| 63 |
-
- 💻
|
| 64 |
|
| 65 |
---
|
| 66 |
|
| 67 |
-
# 📖
|
| 68 |
|
| 69 |
-
|
|
| 70 |
-
|-----------|-------|
|
| 71 |
-
|
|
| 72 |
-
|
|
| 73 |
-
|
|
| 74 |
-
|
|
| 75 |
-
|
|
| 76 |
| Hidden Size | 192 |
|
| 77 |
-
| Transformer
|
| 78 |
-
|
|
| 79 |
-
|
|
| 80 |
| Framework | PyTorch |
|
| 81 |
-
|
|
| 82 |
|
| 83 |
---
|
| 84 |
|
| 85 |
-
# 🌐
|
| 86 |
-
|
| 87 |
-
|
|
| 88 |
-
|------
|
| 89 |
-
| en |
|
| 90 |
-
| es |
|
| 91 |
-
| fi |
|
| 92 |
-
| fr |
|
| 93 |
-
| it |
|
| 94 |
-
| ja |
|
| 95 |
-
| ko |
|
| 96 |
-
| nl |
|
| 97 |
-
| pl |
|
| 98 |
-
| pt |
|
| 99 |
-
| ro |
|
| 100 |
-
| ru |
|
| 101 |
-
| sv |
|
| 102 |
-
| tr |
|
| 103 |
-
| zh |
|
| 104 |
-
|
| 105 |
-
**Total:** 15
|
| 106 |
|
| 107 |
---
|
| 108 |
|
| 109 |
-
# 📚
|
| 110 |
|
| 111 |
-
|
| 112 |
|
| 113 |
**Comunidade-Synapse-BR/dataset-multilingue-750k**
|
| 114 |
|
| 115 |
-
|
| 116 |
|
| 117 |
-
-
|
| 118 |
-
- 15
|
| 119 |
-
-
|
| 120 |
-
-
|
| 121 |
-
-
|
| 122 |
-
-
|
| 123 |
-
-
|
| 124 |
|
| 125 |
---
|
| 126 |
|
| 127 |
-
# 🎯
|
| 128 |
|
| 129 |
-
Synapse-LangID
|
| 130 |
|
| 131 |
-
-
|
| 132 |
-
-
|
| 133 |
-
-
|
| 134 |
-
-
|
| 135 |
-
-
|
| 136 |
-
-
|
| 137 |
-
-
|
| 138 |
-
-
|
| 139 |
-
-
|
| 140 |
-
-
|
| 141 |
|
| 142 |
---
|
| 143 |
|
| 144 |
-
# ⚡
|
| 145 |
-
|
| 146 |
-
Install Transformers:
|
| 147 |
|
| 148 |
```bash
|
| 149 |
pip install transformers torch
|
|
@@ -151,7 +149,7 @@ pip install transformers torch
|
|
| 151 |
|
| 152 |
---
|
| 153 |
|
| 154 |
-
# 🤗
|
| 155 |
|
| 156 |
```python
|
| 157 |
from transformers import pipeline
|
|
@@ -166,7 +164,7 @@ print(classifier("Olá, tudo bem?"))
|
|
| 166 |
|
| 167 |
---
|
| 168 |
|
| 169 |
-
# 💻
|
| 170 |
|
| 171 |
```python
|
| 172 |
import torch
|
|
@@ -177,10 +175,10 @@ repo = "Comunidade-Synapse-BR/Synapse-LangID"
|
|
| 177 |
tokenizer = AutoTokenizer.from_pretrained(repo)
|
| 178 |
model = AutoModelForSequenceClassification.from_pretrained(repo)
|
| 179 |
|
| 180 |
-
|
| 181 |
|
| 182 |
inputs = tokenizer(
|
| 183 |
-
|
| 184 |
return_tensors="pt",
|
| 185 |
truncation=True,
|
| 186 |
max_length=128
|
|
@@ -189,70 +187,71 @@ inputs = tokenizer(
|
|
| 189 |
with torch.no_grad():
|
| 190 |
outputs = model(**inputs)
|
| 191 |
|
| 192 |
-
|
| 193 |
|
| 194 |
-
|
|
|
|
|
|
|
| 195 |
|
| 196 |
-
print(
|
| 197 |
```
|
| 198 |
|
| 199 |
---
|
| 200 |
|
| 201 |
-
# 📊
|
| 202 |
|
| 203 |
-
|
|
| 204 |
-
|-------|---------
|
| 205 |
-
| Hello world |
|
| 206 |
-
| Olá mundo |
|
| 207 |
-
| Bonjour |
|
| 208 |
-
| Hola amigos |
|
| 209 |
-
| Ciao a tutti |
|
| 210 |
-
| 今日はいい天気ですね |
|
| 211 |
-
| 안녕하세요 |
|
| 212 |
-
| Привет |
|
| 213 |
|
| 214 |
---
|
| 215 |
|
| 216 |
-
# 📈
|
| 217 |
|
| 218 |
-
Synapse-LangID
|
| 219 |
|
| 220 |
-
-
|
| 221 |
-
-
|
| 222 |
-
-
|
| 223 |
-
-
|
| 224 |
-
-
|
| 225 |
|
| 226 |
-
|
| 227 |
|
| 228 |
-
-
|
| 229 |
-
-
|
| 230 |
-
-
|
| 231 |
-
-
|
| 232 |
-
-
|
| 233 |
-
-
|
| 234 |
|
| 235 |
-
|
| 236 |
|
| 237 |
---
|
| 238 |
|
| 239 |
-
# ⚠️
|
| 240 |
|
| 241 |
-
|
| 242 |
|
| 243 |
-
|
| 244 |
|
| 245 |
-
-
|
| 246 |
-
-
|
| 247 |
-
-
|
| 248 |
-
-
|
| 249 |
-
- Mixed-language inputs
|
| 250 |
|
| 251 |
-
|
| 252 |
|
| 253 |
---
|
| 254 |
|
| 255 |
-
# 📂
|
| 256 |
|
| 257 |
```
|
| 258 |
config.json
|
|
@@ -265,17 +264,17 @@ README.md
|
|
| 265 |
|
| 266 |
---
|
| 267 |
|
| 268 |
-
# 📜
|
| 269 |
|
| 270 |
-
|
| 271 |
|
| 272 |
-
|
| 273 |
|
| 274 |
---
|
| 275 |
|
| 276 |
-
# 📚
|
| 277 |
|
| 278 |
-
|
| 279 |
|
| 280 |
```bibtex
|
| 281 |
@misc{synapse_langid_2026,
|
|
@@ -288,12 +287,10 @@ If this model contributes to your research or project, please consider citing it
|
|
| 288 |
|
| 289 |
---
|
| 290 |
|
| 291 |
-
# 🤝
|
| 292 |
-
|
| 293 |
-
**Comunidade Synapse BR** is a Brazilian open-source initiative dedicated to developing lightweight AI models, datasets and tools for the global AI community.
|
| 294 |
|
| 295 |
-
|
| 296 |
|
| 297 |
-
|
| 298 |
|
| 299 |
-
-
|
|
|
|
| 44 |
|
| 45 |
# 🌍 Synapse-LangID
|
| 46 |
|
| 47 |
+
O **Synapse-LangID** é um modelo leve de identificação automática de idiomas desenvolvido pela **Comunidade Synapse BR**.
|
| 48 |
|
| 49 |
+
Projetado para oferecer detecção rápida e eficiente de idiomas, o modelo combina uma arquitetura compacta baseada em **BERT** com bom desempenho multilíngue, sendo adequado para sistemas em produção, APIs, aplicações móveis e dispositivos de borda (*edge computing*).
|
| 50 |
|
| 51 |
+
Nosso objetivo é disponibilizar uma solução **open source**, leve e acessível para identificação de idiomas, mantendo baixo custo computacional e facilidade de integração.
|
| 52 |
|
| 53 |
---
|
| 54 |
|
| 55 |
+
# 🚀 Destaques
|
| 56 |
|
| 57 |
+
- 🌍 Suporte para **15 idiomas**
|
| 58 |
+
- ⚡ Inferência rápida
|
| 59 |
+
- 🪶 Arquitetura leve (~5 milhões de parâmetros)
|
| 60 |
+
- 📦 Aproximadamente 20 MB
|
| 61 |
+
- 🤗 Compatível com Hugging Face Transformers
|
| 62 |
+
- 🔓 Código aberto
|
| 63 |
+
- 💻 Ideal para produção, APIs e Edge Computing
|
| 64 |
|
| 65 |
---
|
| 66 |
|
| 67 |
+
# 📖 Visão Geral do Modelo
|
| 68 |
|
| 69 |
+
| Propriedade | Valor |
|
| 70 |
+
|-------------|-------|
|
| 71 |
+
| Arquitetura | BERT Encoder |
|
| 72 |
+
| Parâmetros | ~5 milhões |
|
| 73 |
+
| Tamanho | ~20 MB |
|
| 74 |
+
| Vocabulário | 16.000 tokens |
|
| 75 |
+
| Comprimento máximo | 128 tokens |
|
| 76 |
| Hidden Size | 192 |
|
| 77 |
+
| Camadas Transformer | 6 |
|
| 78 |
+
| Cabeças de Atenção | 4 |
|
| 79 |
+
| Camada Intermediária | 512 |
|
| 80 |
| Framework | PyTorch |
|
| 81 |
+
| Biblioteca | Hugging Face Transformers |
|
| 82 |
|
| 83 |
---
|
| 84 |
|
| 85 |
+
# 🌐 Idiomas Suportados
|
| 86 |
+
|
| 87 |
+
| Código | Idioma |
|
| 88 |
+
|---------|--------|
|
| 89 |
+
| en | Inglês |
|
| 90 |
+
| es | Espanhol |
|
| 91 |
+
| fi | Finlandês |
|
| 92 |
+
| fr | Francês |
|
| 93 |
+
| it | Italiano |
|
| 94 |
+
| ja | Japonês |
|
| 95 |
+
| ko | Coreano |
|
| 96 |
+
| nl | Holandês |
|
| 97 |
+
| pl | Polonês |
|
| 98 |
+
| pt | Português |
|
| 99 |
+
| ro | Romeno |
|
| 100 |
+
| ru | Russo |
|
| 101 |
+
| sv | Sueco |
|
| 102 |
+
| tr | Turco |
|
| 103 |
+
| zh | Chinês |
|
| 104 |
+
|
| 105 |
+
**Total:** 15 idiomas.
|
| 106 |
|
| 107 |
---
|
| 108 |
|
| 109 |
+
# 📚 Dataset de Treinamento
|
| 110 |
|
| 111 |
+
O modelo foi treinado utilizando o dataset:
|
| 112 |
|
| 113 |
**Comunidade-Synapse-BR/dataset-multilingue-750k**
|
| 114 |
|
| 115 |
+
Características do conjunto de dados:
|
| 116 |
|
| 117 |
+
- Aproximadamente **750 mil textos**
|
| 118 |
+
- 15 idiomas
|
| 119 |
+
- Distribuição balanceada
|
| 120 |
+
- Textos codificados em UTF-8
|
| 121 |
+
- Dados limpos e sem duplicações
|
| 122 |
+
- Divisão em treino, validação e teste
|
| 123 |
+
- Otimizado para identificação de idiomas
|
| 124 |
|
| 125 |
---
|
| 126 |
|
| 127 |
+
# 🎯 Casos de Uso
|
| 128 |
|
| 129 |
+
O Synapse-LangID pode ser utilizado em:
|
| 130 |
|
| 131 |
+
- Identificação automática de idiomas
|
| 132 |
+
- Pipelines de NLP
|
| 133 |
+
- Motores de busca
|
| 134 |
+
- Sistemas de tradução
|
| 135 |
+
- Limpeza de datasets
|
| 136 |
+
- Filtragem de documentos
|
| 137 |
+
- Roteamento por idioma
|
| 138 |
+
- Pré-processamento de texto
|
| 139 |
+
- Organização de documentos
|
| 140 |
+
- Aplicações de Inteligência Artificial
|
| 141 |
|
| 142 |
---
|
| 143 |
|
| 144 |
+
# ⚡ Instalação
|
|
|
|
|
|
|
| 145 |
|
| 146 |
```bash
|
| 147 |
pip install transformers torch
|
|
|
|
| 149 |
|
| 150 |
---
|
| 151 |
|
| 152 |
+
# 🤗 Exemplo utilizando Pipeline
|
| 153 |
|
| 154 |
```python
|
| 155 |
from transformers import pipeline
|
|
|
|
| 164 |
|
| 165 |
---
|
| 166 |
|
| 167 |
+
# 💻 Exemplo em Python
|
| 168 |
|
| 169 |
```python
|
| 170 |
import torch
|
|
|
|
| 175 |
tokenizer = AutoTokenizer.from_pretrained(repo)
|
| 176 |
model = AutoModelForSequenceClassification.from_pretrained(repo)
|
| 177 |
|
| 178 |
+
texto = "Olá, tudo bem?"
|
| 179 |
|
| 180 |
inputs = tokenizer(
|
| 181 |
+
texto,
|
| 182 |
return_tensors="pt",
|
| 183 |
truncation=True,
|
| 184 |
max_length=128
|
|
|
|
| 187 |
with torch.no_grad():
|
| 188 |
outputs = model(**inputs)
|
| 189 |
|
| 190 |
+
probabilidades = outputs.logits.softmax(dim=-1)
|
| 191 |
|
| 192 |
+
classe = model.config.id2label[
|
| 193 |
+
probabilidades.argmax().item()
|
| 194 |
+
]
|
| 195 |
|
| 196 |
+
print(classe)
|
| 197 |
```
|
| 198 |
|
| 199 |
---
|
| 200 |
|
| 201 |
+
# 📊 Exemplos de Predição
|
| 202 |
|
| 203 |
+
| Texto | Idioma |
|
| 204 |
+
|--------|---------|
|
| 205 |
+
| Hello world | Inglês |
|
| 206 |
+
| Olá mundo | Português |
|
| 207 |
+
| Bonjour | Francês |
|
| 208 |
+
| Hola amigos | Espanhol |
|
| 209 |
+
| Ciao a tutti | Italiano |
|
| 210 |
+
| 今日はいい天気ですね | Japonês |
|
| 211 |
+
| 안녕하세요 | Coreano |
|
| 212 |
+
| Привет | Russo |
|
| 213 |
|
| 214 |
---
|
| 215 |
|
| 216 |
+
# 📈 Desempenho
|
| 217 |
|
| 218 |
+
O Synapse-LangID apresenta melhor desempenho em:
|
| 219 |
|
| 220 |
+
- Frases completas
|
| 221 |
+
- Parágrafos
|
| 222 |
+
- Documentação
|
| 223 |
+
- Notícias
|
| 224 |
+
- Conversas do cotidiano
|
| 225 |
|
| 226 |
+
O desempenho pode diminuir em casos como:
|
| 227 |
|
| 228 |
+
- Textos extremamente curtos
|
| 229 |
+
- Frases com múltiplos idiomas
|
| 230 |
+
- Sequências aleatórias de caracteres
|
| 231 |
+
- Apenas números
|
| 232 |
+
- Apenas emojis
|
| 233 |
+
- Uso excessivo de gírias da internet
|
| 234 |
|
| 235 |
+
Novas métricas serão adicionadas em futuras versões.
|
| 236 |
|
| 237 |
---
|
| 238 |
|
| 239 |
+
# ⚠️ Limitações
|
| 240 |
|
| 241 |
+
Embora apresente bom desempenho em identificação automática de idiomas, nenhum classificador é perfeito.
|
| 242 |
|
| 243 |
+
O modelo pode apresentar dificuldades em situações como:
|
| 244 |
|
| 245 |
+
- Mensagens muito curtas
|
| 246 |
+
- Mistura de idiomas (*code-switching*)
|
| 247 |
+
- Conteúdo ambíguo
|
| 248 |
+
- Textos com pouca informação linguística
|
|
|
|
| 249 |
|
| 250 |
+
Para aplicações críticas, recomenda-se utilizar validação humana como camada adicional de segurança.
|
| 251 |
|
| 252 |
---
|
| 253 |
|
| 254 |
+
# 📂 Arquivos do Repositório
|
| 255 |
|
| 256 |
```
|
| 257 |
config.json
|
|
|
|
| 264 |
|
| 265 |
---
|
| 266 |
|
| 267 |
+
# 📜 Licença
|
| 268 |
|
| 269 |
+
Este modelo é distribuído sob a licença **Apache License 2.0**.
|
| 270 |
|
| 271 |
+
Consulte o repositório para mais informações.
|
| 272 |
|
| 273 |
---
|
| 274 |
|
| 275 |
+
# 📚 Citação
|
| 276 |
|
| 277 |
+
Caso este modelo contribua para sua pesquisa ou projeto, considere citá-lo.
|
| 278 |
|
| 279 |
```bibtex
|
| 280 |
@misc{synapse_langid_2026,
|
|
|
|
| 287 |
|
| 288 |
---
|
| 289 |
|
| 290 |
+
# 🤝 Sobre a Comunidade Synapse BR
|
|
|
|
|
|
|
| 291 |
|
| 292 |
+
A **Comunidade Synapse BR** é uma iniciativa brasileira dedicada ao desenvolvimento de modelos de inteligência artificial, datasets e ferramentas de código aberto.
|
| 293 |
|
| 294 |
+
Nossa missão é tornar a inteligência artificial mais acessível por meio de tecnologias eficientes, leves e abertas, contribuindo para fortalecer a presença do Brasil no ecossistema global de IA.
|
| 295 |
|
| 296 |
+
Contribuições, sugestões e relatos de problemas são sempre bem-vindos.
|