Views
No views yet
facebook/nllb-200-distilled-600M| Metric | Score |
|---|---|
| BLEU Score (Validation) | 41.6 |
| Training Samples | ~30,000 |
| Training Epochs | 2 |
1from transformers import AutoModelForSeq2SeqLM, AutoTokenizer
2
3model = AutoModelForSeq2SeqLM.from_pretrained("faresalawneh/jordanian-to-fusha-model")
4tokenizer = AutoTokenizer.from_pretrained("faresalawneh/jordanian-to-fusha-model")
5
6def translate(text):
7 inputs = tokenizer(text, return_tensors="pt", padding=True, truncation=True, max_length=96)
8 outputs = model.generate(
9 **inputs,
10 forced_bos_token_id=tokenizer.convert_tokens_to_ids("arb_Arab"),
11 max_length=96,
12 num_beams=4
13 )
14 return tokenizer.decode(outputs[0], skip_special_tokens=True)
15
16print(translate("شو عم تعمل هلق؟"))| Parameter | Value |
|---|---|
| Base Model | facebook/nllb-200-distilled-600M |
| Source Language | apc_Arab (Levantine Arabic) |
| Target Language | arb_Arab (Modern Standard Arabic) |
| Max Input Length | 96 tokens |
| Max Output Length | 96 tokens |
| Batch Size | 32 |
| Learning Rate | 5e-4 |
| Epochs | 2 |
| Hardware | Google Colab T4 GPU |
Text — original Jordanian dialect textText Corrected — Classical Arabic translationHas Error — rows with Has Error == 1 were excluded