This dataset is a combination of corpora of text from scientific Wikipedia articles and scientific papers across major fields of science. This dataset contains continued-pretrain data.
zeroshot/arxiv-biology
legacy-datasets/wikipedia
bisectgroup/PubMed_TA
bluuebunny/biorxiv_abstract_embedding_mxbai_large_v1_milvus… See the full description on the dataset page:
https://huggingface.co/datasets/omniomni/omni-science.