Arabic-English Translator

ู†ู…ูˆุฐุฌ ุชุฑุฌู…ุฉ ู…ู† ุงู„ุนุฑุจูŠุฉ ุฅู„ู‰ ุงู„ุฅู†ุฌู„ูŠุฒูŠุฉุŒ ุชู… ุจู†ุงุคู‡ ุนู† ุทุฑูŠู‚ fine-tuning ู„ู…ูˆุฏูŠู„ Helsinki-NLP/opus-mt-ar-en ุนู„ู‰ ุฌุฒุก ู…ู† dataset opus-100 (ar-en).

A fine-tuned Seq2Seq model for translating Arabic text into English, built on top of Helsinki-NLP/opus-mt-ar-en and fine-tuned on a subset of the opus-100 (ar-en) dataset.

Model Details

Model Description

ู‡ุฐุง ุงู„ู…ูˆุฏูŠู„ ุฌุฒุก ู…ู† ู…ุดุฑูˆุน ุชุนู„ูŠู…ูŠ ุดุฎุตูŠ ู„ุจู†ุงุก ู†ุธุงู… NLP ุนุฑุจูŠุŒ ุชู… ุชุฏุฑูŠุจู‡ ุจุงุณุชุฎุฏุงู… ู…ูƒุชุจุฉ ๐Ÿค— Transformers ูƒุชุทุจูŠู‚ ุนู…ู„ูŠ ุนู„ู‰ fine-tuning ู„ู…ูˆุฏูŠู„ุงุช ุงู„ุชุฑุฌู…ุฉ (Seq2Seq).

  • Developed by: Mohamed Wael
  • Model type: Seq2Seq Translation (MarianMT architecture)
  • Language(s) (NLP): Arabic (ar) โ†’ English (en)
  • License: Apache 2.0 (inherited from base model)
  • Finetuned from model: Helsinki-NLP/opus-mt-ar-en

Model Sources

Uses

Direct Use

ุงู„ู…ูˆุฏูŠู„ ู…ู†ุงุณุจ ู„ุชุฑุฌู…ุฉ ุฌู…ู„ ุนุฑุจูŠุฉ ุนุงู…ุฉ ุฃูˆ ุดุจู‡ ูุตุญู‰ ุฅู„ู‰ ุงู„ุฅู†ุฌู„ูŠุฒูŠุฉ ุจุดูƒู„ ู…ุจุงุดุฑุŒ ู…ู† ุบูŠุฑ ุงู„ุญุงุฌุฉ ู„ุฃูŠ ู…ุนุงู„ุฌุฉ ุฅุถุงููŠุฉ.

Out-of-Scope Use

  • ุงู„ู„ู‡ุฌุฉ ุงู„ุนุงู…ูŠุฉ: ุงู„ู…ูˆุฏูŠู„ ูŠูˆุงุฌู‡ ุตุนูˆุจุฉ ู…ุน ุงู„ู„ู‡ุฌุงุช ุงู„ุนุงู…ูŠุฉ (ู…ุซู„ ุงู„ู…ุตุฑูŠุฉ)ุŒ ุญูŠุซ ู„ู… ูŠุชู… ุชุฏุฑูŠุจู‡ ุจุดูƒู„ ู…ูƒุซู ุนู„ู‰ ู†ุตูˆุต ุนุงู…ูŠุฉ.
  • ุงู„ู…ุตุทู„ุญุงุช ุงู„ุชู‚ู†ูŠุฉ ุงู„ู…ุชุฎุตุตุฉ: ุงู„ุฃุฏุงุก ูŠุถุนู ู…ุน ุงู„ู…ุตุทู„ุญุงุช ุงู„ุชู‚ู†ูŠุฉ ุงู„ุฏู‚ูŠู‚ุฉ (ู…ุซู„ ู…ุตุทู„ุญุงุช ุตูŠุงู†ุฉ ุงู„ุณูŠุงุฑุงุช) ุงู„ุชูŠ ู„ุง ุชุธู‡ุฑ ุจูƒุซุฑุฉ ููŠ ุจูŠุงู†ุงุช ุงู„ุชุฏุฑูŠุจ ุงู„ุนุงู…ุฉ (opus-100).
  • ุบูŠุฑ ู…ุฎุตุต ู„ู„ุงุณุชุฎุฏุงู… ููŠ ุชุทุจูŠู‚ุงุช ุทุจูŠุฉ ุฃูˆ ู‚ุงู†ูˆู†ูŠุฉ ุฃูˆ ุฃูŠ ู…ุฌุงู„ ูŠุชุทู„ุจ ุฏู‚ุฉ ุชุฑุฌู…ุฉ ุญุฑุฌุฉ.

Bias, Risks, and Limitations

  • ุงู„ู…ูˆุฏูŠู„ ุชู… ุชุฏุฑูŠุจู‡ ุนู„ู‰ ุนุฏุฏ ู…ุญุฏูˆุฏ ู…ู† ุงู„ุนูŠู†ุงุช (subset ู…ู† opus-100)ุŒ ูˆู„ูŠุณ ุนู„ู‰ ุงู„ุฏุงุชุงุณุช ุจุงู„ูƒุงู…ู„ุŒ ู„ุฐู„ูƒ ุฌูˆุฏุชู‡ ุฃู‚ู„ ู…ู† ู†ู…ุงุฐุฌ ุงู„ุชุฑุฌู…ุฉ ุงู„ูƒุจูŠุฑุฉ ุงู„ู…ุฏุฑุจุฉ ุนู„ู‰ ุจูŠุงู†ุงุช ุถุฎู…ุฉ.
  • ูƒู…ุง ู‡ูˆ ุงู„ุญุงู„ ู…ุน ู…ุนุธู… ู†ู…ุงุฐุฌ ุงู„ุชุฑุฌู…ุฉ ุงู„ุขู„ูŠุฉุŒ ู‚ุฏ ุชุธู‡ุฑ ุฃุฎุทุงุก ู…ุน ุงู„ุฌู…ู„ ุงู„ุทูˆูŠู„ุฉ ุฃูˆ ุงู„ู…ุนู‚ุฏุฉ ุฃูˆ ุงู„ุชูŠ ุชุญุชูˆูŠ ุนู„ู‰ ุณูŠุงู‚ ุซู‚ุงููŠ/ู„ุบูˆูŠ ุฎุงุต.

Recommendations

ูŠูู†ุตุญ ุจุงุณุชุฎุฏุงู… ู‡ุฐุง ุงู„ู…ูˆุฏูŠู„ ู„ุฃุบุฑุงุถ ุชุนู„ูŠู…ูŠุฉ ุฃูˆ ุชุฌุฑูŠุจูŠุฉ. ู„ู„ุงุณุชุฎุฏุงู… ุงู„ุฅู†ุชุงุฌูŠ ุงู„ูุนู„ูŠ ููŠ ู…ุฌุงู„ ู…ุชุฎุตุต (ู…ุซู„ ุตูŠุงู†ุฉ ุงู„ุณูŠุงุฑุงุช)ุŒ ูŠูู†ุตุญ ุจุนู…ู„ fine-tuning ุฅุถุงููŠ ุนู„ู‰ ุจูŠุงู†ุงุช domain-specific.

How to Get Started with the Model

from transformers import AutoTokenizer, AutoModelForSeq2SeqLM

tokenizer = AutoTokenizer.from_pretrained("mwael399/arabic-english-translator")
model = AutoModelForSeq2SeqLM.from_pretrained("mwael399/arabic-english-translator")

text = "ู…ุฑุญุจุง ูƒูŠู ุญุงู„ูƒ"
inputs = tokenizer(text, return_tensors="pt")
outputs = model.generate(**inputs)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))

Training Details

Training Data

ุฌุฒุก (subset) ู…ู† dataset opus-100 (ar-en):

  • 5000 ุนูŠู†ุฉ ุชุฏุฑูŠุจ (train)
  • 500 ุนูŠู†ุฉ ุชู‚ูŠูŠู… (validation)

Training Procedure

Preprocessing

  • ุงู„ุญุฏ ุงู„ุฃู‚ุตู‰ ู„ุทูˆู„ ุงู„ู…ุฏุฎู„ุงุช: 128 ุชูˆูƒู†
  • ุงู„ุญุฏ ุงู„ุฃู‚ุตู‰ ู„ุทูˆู„ ุงู„ู…ุฎุฑุฌุงุช: 128 ุชูˆูƒู†
  • ุชู… ุงุณุชุฎุฏุงู… DataCollatorForSeq2Seq ู„ู„ู€ dynamic padding

Training Hyperparameters

  • Learning rate: 2e-5
  • Batch size (train): 8
  • Batch size (eval): 8
  • Epochs: 1
  • Weight decay: 0.01
  • Training regime: fp32

Evaluation

ู„ู… ูŠุชู… ุฅุฌุฑุงุก ุชู‚ูŠูŠู… ูƒู…ูŠ ุฑุณู…ูŠ (ู…ุซู„ BLEU score) ุจุนุฏ ุนู„ู‰ ู…ุฌู…ูˆุนุฉ ุงุฎุชุจุงุฑ ู…ู†ูุตู„ุฉ. ุงู„ุชู‚ูŠูŠู… ุงู„ุญุงู„ูŠ ุชู… ุจุดูƒู„ ูŠุฏูˆูŠ (qualitative) ุนู† ุทุฑูŠู‚ ุงุฎุชุจุงุฑ ุฌู…ู„ ู…ุชู†ูˆุนุฉ.

Summary

ุงู„ู…ูˆุฏูŠู„ ูŠุนู…ู„ ุจุดูƒู„ ุฌูŠุฏ ู…ุน ุงู„ุฌู…ู„ ุงู„ูุตุญู‰ ุฃูˆ ุดุจู‡ ุงู„ูุตุญู‰ ุงู„ุจุณูŠุทุฉุŒ ู„ูƒู†ู‡ ูŠุธู‡ุฑ ุถุนูู‹ุง ูˆุงุถุญู‹ุง ู…ุน ุงู„ู„ู‡ุฌุฉ ุงู„ุนุงู…ูŠุฉ ูˆุงู„ู…ุตุทู„ุญุงุช ุงู„ุชู‚ู†ูŠุฉ ุงู„ู…ุชุฎุตุตุฉุŒ ูƒู…ุง ู‡ูˆ ู…ุชูˆู‚ุน ู…ู† ุทุจูŠุนุฉ ุจูŠุงู†ุงุช ุงู„ุชุฏุฑูŠุจ.

Technical Specifications

Model Architecture and Objective

MarianMT (Seq2Seq Transformer) architecture, ู…ุจู†ูŠ ุฃุณุงุณู‹ุง ุนู„ู‰ Helsinki-NLP/opus-mt-ar-en.

Compute Infrastructure

Software

  • ๐Ÿค— Transformers
  • PyTorch
  • ๐Ÿค— Datasets

Model Card Authors

Mohamed Wael

Model Card Contact

ู„ู„ุชูˆุงุตู„: ุนุจุฑ Hugging Face profile mwael399

Downloads last month
-
Safetensors
Model size
76.4M params
Tensor type
F32
ยท
Inference Providers NEW
This model isn't deployed by any Inference Provider. ๐Ÿ™‹ Ask for provider support

Model tree for mwael399/arabic-english-translator

Finetuned
(44)
this model

Dataset used to train mwael399/arabic-english-translator