A ClinVar variant-effect-prediction (VEP) benchmark, for evaluating DNA language models on clinical variant pathogenicity, with two subsets: coding (39,473 variants) and non-coding (15,258 variants).
Each split is a balanced binary classification task: label = 1 for pathogenic / likely pathogenic and label = 0 for benign / likely benign.