Filtered 20K NSF award dataset with technical abstracts, non-technical abstracts,
verifiable claims, and investigation proposals.
from datasets import load_dataset
ds = load_dataset("darpa-scify/nsf-scify-20k")
train: 14,682 examples
validation: 500 examples
test: 4,000 examples