---
license: apache-2.0
datasets:
- Misraj/Sadeed_Tashkeela
language:
- ar
tags:
- arabic
- diacritization
- tashkeel
- nlp
- mamba
- transformer
- crf
---
# مِشكالة — نموذج التشكيل العربي
نموذج خفيف وسريع لتشكيل النصوص العربية تلقائياً،
يجمع بين معمارية Mamba والـ Transformer مع CRF decoder.
## النتائج
| المقياس | القيمة |
|---|---|
| DER على Sadeed Test | 1.66% |
| عدد المعلمات | 12.5M |
## المعمارية
```
Embedding → Mamba (4 طبقات) → Transformer (8 طبقات) → CRF
dim=320 | n_heads=8 | max_seq_len=4096
```
## بيانات التدريب
- **Tashkeela**: ~2.4M جملة تراثية
- **القرآن الكريم**: ~77K آية
- **Sadeed**: ~1M جملة منقّحة
## كود الاستخدام
```python
import torch
from huggingface_hub import hf_hub_download
# تحميل النموذج
ckpt_path = hf_hub_download(
repo_id="flokymind/mishkala",
filename="mishkala.pt"
)
device = torch.device('cuda' if torch.cuda.is_available() else 'cpu')
ckpt = torch.load(ckpt_path, map_location=device)
model = ArabicDiacritizerModel(**ckpt['config']).to(device)
model.load_state_dict(ckpt['model_state_dict'])
model.eval()
# تشكيل نص
text = "الإنسان بين العقل والغريزة"
result = diacritize_text(text, model, tokenizer, device)
print(result)
# الْإِنْسَانُ بَيْنَ الْعَقْلِ وَالْغَرِيزَةِ
```
## الترخيص
Apache 2.0