The corpus consists of 200 real-world legal documents and the query set consists of 200 questions pertaining to legal documents.
Usage
import datasets
Download the dataset
queries = datasets.load_dataset("embedding-benchmark/LegalQuAD", "queries")
documents = datasets.load_dataset("embedding-benchmark/LegalQuAD", "corpus")
pair_labels = datasets.load_dataset("embedding-benchmark/LegalQuAD", "default")