This dataset comprises 8.75K deduplicated law records retrieved from the official Japanese government website e-Gov, ensuring authoritative and accurate content. Record titles are used as queries, while record bodies are used as documents.
Usage
import datasets
queries = datasets.load_dataset("embedding-benchmark/DS1000", "queries")
documents = datasets.load_dataset("embedding-benchmark/DS1000", "corpus")
pair_labels = datasets.load_dataset("embedding-benchmark/DS1000"… See the full description on the dataset page:
https://huggingface.co/datasets/embedding-benchmark/ClosedDataset_13.