--- language: - en - tr - fa - zh - it configs: - config_name: chunk-0 data_files: - split: train path: train_data_0.8.jsonl - config_name: chunk-1 data_files: - split: train path: train_data_1.8.jsonl - config_name: chunk-2 data_files: - split: train path: train_data_2.8.jsonl - config_name: chunk-3 data_files: - split: train path: train_data_3.8.jsonl - config_name: chunk-4 data_files: - split: train path: train_data_4.8.jsonl - config_name: chunk-5 data_files: - split: train path:… See the full description on the dataset page:
https://huggingface.co/datasets/gsaltintas/training_data_detokenized-comma-v0.1.