This dataset is organized for continual-learning experiments on protein sequences.
train/: 252 parquet shards (data-00000-of-00252.parquet ... data-00251-of-00252.parquet)
splits/: 10 task index parquet files (task_0.parquet ... task_9.parquet)
val/: validation parquet (val.parquet)
task_0.parquet -> task_0 (2015)
task_1.parquet -> task_1 (2016)
task_2.parquet -> task_2 (2017)
task_3.parquet ->… See the full description on the dataset page:
https://huggingface.co/datasets/anon2435/CoPeP.