--- language: - ar - en license: gemma base_model: google/gemma-4-12B-it library_name: transformers pipeline_tag: image-text-to-text tags: - iraqi - arabic - dialect - merged - full-model - multimodal --- # Gemma 4 12B — اللهجة العراقية (مدموج) نموذج **كامل مدموج**: محوّل LoRA مدرَّب على اللهجة العراقية مدموج داخل `google/gemma-4-12B-it`. ما يحتاج تحميل محوّل منفصل ولا مكتبة `peft`. الدمج انسوى بـ`AutoModelForImageTextToText` مو `AutoModelForCausalLM`، حتى **تنحفظ أبراج الرؤية والصوت** — الدمج بالكلاس النصي يفقدها. | | | |---|---| | النموذج الأساسي | `google/gemma-4-12B-it` | | المحوّل المصدر | `ameer4wisam/gemma-iraqi-10k` | | بيانات التدريب | 14,000 مثال عراقي + ~15% تعليمات عامة (Aya) | | الوسائط | نص + صورة (محفوظة بعد الدمج) | ## الاستخدام ```python import torch from transformers import AutoProcessor, AutoModelForImageTextToText model_id = "ameer4wisam/gemma-iraqi-10k-merged" model = AutoModelForImageTextToText.from_pretrained( model_id, dtype=torch.bfloat16, device_map="auto" ) processor = AutoProcessor.from_pretrained(model_id) msgs = [ {"role": "system", "content": "أنت مساعد عراقي تحچي باللهجة العراقية العامية."}, {"role": "user", "content": "شلونك؟ شنو أشهر أكلة عراقية؟"}, ] inputs = processor.apply_chat_template( msgs, add_generation_prompt=True, tokenize=True, return_dict=True, return_tensors="pt" ).to(model.device) out = model.generate(**inputs, max_new_tokens=64, do_sample=False) print(processor.decode(out[0][inputs["input_ids"].shape[1]:], skip_special_tokens=True)) ``` ## سلوك الوكيل بيانات التدريب فيها 690 مثالاً تعلّم سلوك مساعد مبيعات: الإحالة (`اتأكدلك وأرد عليك`) بدل اختراع الضمان والأسعار، رفض البراند غير المتوفر باسمه، تأجيل الحساب، علامة `[ORDER_READY]` بعد التأكيد الصريح حصراً، واستدعاء الأدوات بصيغة `[TOOL_CALL]`. > هذي السلوكيات تعتمد على رسالة نظام تحدد الكتالوج والقواعد. ## الحدود - اللهجة العراقية مو موحّدة؛ الداتا تميل للهجة الوسط والجنوب. - الأسعار والمنتجات بأمثلة التدريب توضيحية، مو كتالوج حقيقي. - ما انقاس على معيار عام منشور؛ التقييم داخلي بدفتر التدريب. المصدر: