This dataset collection contains ~200K curated Active compound lists from ~90 different BioAssay datasets, focusing on known assay interference artifacts. We applied SMILES standardization using RDKit and MolVS, including molecule sanitization and fragment removal. The final dataset is suitable for training and evaluating machine learning models.