blue-machines/lsd_evaluation_dataset
Held-out evaluation set for language-switch detection / LID (LSD_final_dataset.csv).
language_switch
text
script_type
language
Rows: 10,048
Languages: Bengali, English, Gujarati, Hindi, Kannada, Malayalam, Marathi, Oria, Tamil, Telugu
Switch labels: Bengali, English, Gujarati, Hindi, Kannada, Malayalam, Marathi, Oria, Tamil, Telugu, no_switch
from datasets import load_dataset… See the full description on the dataset page:
https://huggingface.co/datasets/blue-machines/lsd_evaluation_dataset.