This repository contains the development data files used in the SISAP2025 indexing challenge.
repo:
https://huggingface.co/datasets/sentence-transformers/ccnews/
Sentence BERT model: sentence-transformers/all-MiniLM-L6-v2
similarity: Cosine / dot product
dimension: 384
corpus size: 614,664
fields: title and article, train embeddings come from article.