This dataset is derived from UniRef50 (Release 2025 October) and prepared for protein language model pre-training.
Original UniRef50 sequences: 58,875,981
Synthetic constructs removed: 439
Validation set size: 294,377 (0.5%)
Initial train set size: 58,581,165
Sequences removed by similarity filter (≥50% identity): 457,727
Final train set size: 58,123,438
Total sequences in dataset: 58,417,815… See the full description on the dataset page:
https://huggingface.co/datasets/alejoacelas/uniref50-2025-10.