Views
No views yet
all-mpnet-base-v2 text encoder, trained on music with album-review derived
captions. Embeddings are 512-dimensional; audio is expected at 24 kHz.1from amclap import get_model
2
3model = get_model(model_id="mtg-upf/allmusiccaps_te_trained_sigreg", device="cpu")
4
5audio_emb = model.forward_audio(audio) # (B, 512), audio at 24 kHz
6text_emb = model.forward_text(["warm analog synth pads"]) # (B, 512)| Text encoder | fine-tuned jointly |
| Reported checkpoint | step 60,000 (mid-training: models with a trainable text encoder overfit past ~40-80k steps) |
| Audio encoder layers | all 12 |
LICENSE.1@inproceedings{alonso2026allmusiccaps,
2 title = {{AllMusicCaps}: Album Reviews as Complementary Supervision for Music {CLAP}},
3 author = {Alonso-Jim{\'e}nez, Pablo and Lizarraga-Seijas, Xavier and Serra, Xavier and Bogdanov, Dmitry},
4 booktitle = {International Society for Music Information Retrieval Conference (ISMIR)},
5 year = {2026},
6}