--- license: apache-2.0 datasets: - Misraj/Sadeed_Tashkeela language: - ar tags: - arabic - diacritization - tashkeel - nlp - mamba - transformer - crf --- # مِشكالة — نموذج التشكيل العربي
نموذج خفيف وسريع لتشكيل النصوص العربية تلقائياً، يجمع بين معمارية Mamba والـ Transformer مع CRF decoder. ## النتائج | المقياس | القيمة | |---|---| | DER على Sadeed Test | 1.66% | | عدد المعلمات | 12.5M | ## المعمارية ``` Embedding → Mamba (4 طبقات) → Transformer (8 طبقات) → CRF dim=320 | n_heads=8 | max_seq_len=4096 ``` ## بيانات التدريب - **Tashkeela**: ~2.4M جملة تراثية - **القرآن الكريم**: ~77K آية - **Sadeed**: ~1M جملة منقّحة ## كود الاستخدام ```python import torch from huggingface_hub import hf_hub_download # تحميل النموذج ckpt_path = hf_hub_download( repo_id="flokymind/mishkala", filename="mishkala.pt" ) device = torch.device('cuda' if torch.cuda.is_available() else 'cpu') ckpt = torch.load(ckpt_path, map_location=device) model = ArabicDiacritizerModel(**ckpt['config']).to(device) model.load_state_dict(ckpt['model_state_dict']) model.eval() # تشكيل نص text = "الإنسان بين العقل والغريزة" result = diacritize_text(text, model, tokenizer, device) print(result) # الْإِنْسَانُ بَيْنَ الْعَقْلِ وَالْغَرِيزَةِ ``` ## الترخيص Apache 2.0