Multilingual LLM Evaluation
A small evaluation dataset for comparing language models across English, Hindi, and Spanish.
language: language code (en, hi, or es)
question: question provided to the model
expected_answer: reference answer used for scoring
This dataset can be used to compare model accuracy, language adherence, and response speed across languages.
This is a small demonstration dataset and… See the full description on the dataset page:
https://huggingface.co/datasets/userhuggingface4321/multilingual-llm-evaluation.