This dataset was created with Tokenlearn for training Model2Vec models on code retrieval. It contains mean token embeddings produced by nomic-ai/CodeRankEmbed, used as training targets for static embedding distillation.
The dataset contains natural language queries from CornStack across 6 programming languages (50,000 rows per language, 300,000 total).