Generated embeddings dataset for vector database training and evaluation with multiple format support.
This dataset contains 1,000,000 text samples with high-quality vector embeddings generated using Qwen/Qwen3-Embedding-4B from the wikimedia/wikipedia dataset. The dataset is designed for vector database training, similarity search, and retrieval tasks.
Base dataset: 1,000,000 samples with embeddings… See the full description on the dataset page:
https://huggingface.co/datasets/maknee/wikipedia_qwen_4b.