An evaluation suite for measuring AI agents' ability to reproduce computational findings from published biomedical research.
ClaroAI-Bench comprises 35 real NIH-funded papers spanning five modalities (genomics, imaging, clinical/EHR, epidemiology, wet-lab) scored on a five-dimension rubric:
Dimension
Description
Mean Score
D1: Data Findable
Links and accessions resolve
1.69/2
D2: Data Accessible
Data can be downloaded
0.94/2