Arabic-English Translator
نموذج ترجمة من العربية إلى الإنجليزية، تم بناؤه عن طريق fine-tuning لموديل Helsinki-NLP/opus-mt-ar-en على جزء من dataset opus-100 (ar-en).
A fine-tuned Seq2Seq model for translating Arabic text into English, built on top of
Helsinki-NLP/opus-mt-ar-en and fine-tuned on a subset of the opus-100 (ar-en) dataset.
Model Details
Model Description
هذا الموديل جزء من مشروع تعليمي شخصي لبناء نظام NLP عربي، تم تدريبه باستخدام مكتبة 🤗 Transformers
كتطبيق عملي على fine-tuning لموديلات الترجمة (Seq2Seq).
- Developed by: Mohamed Wael
- Model type: Seq2Seq Translation (MarianMT architecture)
- Language(s) (NLP): Arabic (ar) → English (en)
- License: Apache 2.0 (inherited from base model)
- Finetuned from model: Helsinki-NLP/opus-mt-ar-en
Model Sources
Uses
Direct Use
الموديل مناسب لترجمة جمل عربية عامة أو شبه فصحى إلى الإنجليزية بشكل مباشر، من غير الحاجة لأي معالجة إضافية.
Out-of-Scope Use
- اللهجة العامية: الموديل يواجه صعوبة مع اللهجات العامية (مثل المصرية)، حيث لم يتم تدريبه بشكل مكثف على نصوص عامية.
- المصطلحات التقنية المتخصصة: الأداء يضعف مع المصطلحات التقنية الدقيقة (مثل مصطلحات صيانة السيارات) التي لا تظهر بكثرة في بيانات التدريب العامة (opus-100).
- غير مخصص للاستخدام في تطبيقات طبية أو قانونية أو أي مجال يتطلب دقة ترجمة حرجة.
Bias, Risks, and Limitations
- الموديل تم تدريبه على عدد محدود من العينات (subset من opus-100)، وليس على الداتاست بالكامل، لذلك جودته أقل من نماذج الترجمة الكبيرة المدربة على بيانات ضخمة.
- كما هو الحال مع معظم نماذج الترجمة الآلية، قد تظهر أخطاء مع الجمل الطويلة أو المعقدة أو التي تحتوي على سياق ثقافي/لغوي خاص.
Recommendations
يُنصح باستخدام هذا الموديل لأغراض تعليمية أو تجريبية. للاستخدام الإنتاجي الفعلي في مجال متخصص (مثل صيانة السيارات)، يُنصح بعمل fine-tuning إضافي على بيانات domain-specific.
How to Get Started with the Model
1from transformers import AutoTokenizer, AutoModelForSeq2SeqLM
2
3tokenizer = AutoTokenizer.from_pretrained("mwael399/arabic-english-translator")
4model = AutoModelForSeq2SeqLM.from_pretrained("mwael399/arabic-english-translator")
5
6text = "مرحبا كيف حالك"
7inputs = tokenizer(text, return_tensors="pt")
8outputs = model.generate(**inputs)
9print(tokenizer.decode(outputs[0], skip_special_tokens=True))
Training Details
Training Data
جزء (subset) من dataset
opus-100 (ar-en):
- 5000 عينة تدريب (train)
- 500 عينة تقييم (validation)
Training Procedure
Preprocessing
- الحد الأقصى لطول المدخلات: 128 توكن
- الحد الأقصى لطول المخرجات: 128 توكن
- تم استخدام
DataCollatorForSeq2Seq للـ dynamic padding
Training Hyperparameters
- Learning rate: 2e-5
- Batch size (train): 8
- Batch size (eval): 8
- Epochs: 1
- Weight decay: 0.01
- Training regime: fp32
Evaluation
لم يتم إجراء تقييم كمي رسمي (مثل BLEU score) بعد على مجموعة اختبار منفصلة. التقييم الحالي تم بشكل يدوي (qualitative) عن طريق اختبار جمل متنوعة.
Summary
الموديل يعمل بشكل جيد مع الجمل الفصحى أو شبه الفصحى البسيطة، لكنه يظهر ضعفًا واضحًا مع اللهجة العامية والمصطلحات التقنية المتخصصة، كما هو متوقع من طبيعة بيانات التدريب.
Technical Specifications
Model Architecture and Objective
MarianMT (Seq2Seq Transformer) architecture, مبني أساسًا على Helsinki-NLP/opus-mt-ar-en.
Compute Infrastructure
Software
- 🤗 Transformers
- PyTorch
- 🤗 Datasets
Model Card Authors
Mohamed Wael
Model Card Contact
للتواصل: عبر Hugging Face profile
mwael399