WikiMT-X (WikiMusicText-eXtended) is the first multimodal MIR benchmark dataset that combines text, sheet music, and audio recordings with 1,000 carefully curated triplets, primarily from 20th-century Western music. It is designed to evaluate text-to-music generation, music captioning, music information retrieval (MIR), and music classification across multiple modalities, providing a rich and diverse resource for advancing music AI… See the full description on the dataset page:
https://huggingface.co/datasets/sander-wood/wikimt-x.