A comprehensive Egyptian Arabic → English parallel corpus covering 1,800 topics from daily Egyptian life. Designed for fine-tuning large language models on Egyptian Arabic dialect translation and generation.
Each sample has a unique ID: {split_id:02d}-{topic:05d}-{sample:04d}
Prefix
Split
Example
01
SFT Train
01-00001-0001 = Topic 1, Sample 1
02
SFT Test
02-01624-0010 = Topic 1624, Sample 10
03
DPO
03-01800-0050 = Topic 1800, Sample 50
Loading
Python
python
1import json
23# Load a specific topic4withopen("SFT/Train/topics/0001-First-day-at-school.json")as f:5 data = json.load(f)67# Load merged file8withopen("SFT/Train/merged/train.jsonl")as f:9 lines =[json.loads(line)for line in f]