A synthetic bilingual dataset of short prompt-response pairs for English and Russian.
Total rows: 60,000
Train split: 59,000
Validation split: 1,000
Languages: English (en), Russian (ru)
Format: JSONL
Fields: id, lang, intent, prompt, response
instruction tuning
simple conversational fine-tuning
bilingual response generation… See the full description on the dataset page:
https://huggingface.co/datasets/SonexaAI/ru_eng-dataset.