Rewayat text fragments with train/validation splits
This dataset was created from multiple TSV files and contains Arabic text fragments with the following information:
Total samples: 661143
Features: ['text', 'source_file', 'index_level_0']
Splits: train, validation (1000:1 ratio)
from datasets import load_dataset
dataset = load_dataset("lliryc/rewayat")
Access train split
train_data = dataset['train']