APEX is the first large-scale multi-task learning framework for jointly predicting
popularity and
aesthetic quality of AI-generated music from audio alone. It is trained on over 211k AI-generated songs (~10k hours of audio) from Suno and Udio, leveraging
MERT-v1-95M audio embeddings.
1pip uninstall -y torch torchvision torchaudio transformers -q
2pip install torch==2.6.0 torchvision==0.21.0 torchaudio==2.6.0
3pip install transformers soundfile librosa "numpy<2" "scipy<1.16"
1from transformers import AutoModel
2import torch
3
4model = AutoModel.from_pretrained(
5 "amaai-lab/apex",
6 trust_remote_code = True,
7 device_map = None,
8 low_cpu_mem_usage = False,
9 ignore_mismatched_sizes = True
10)
11
12device = torch.device("cuda" if torch.cuda.is_available() else "cpu")
13model = model.to(device)
14
15results = model.predict("/path/to/your/mp3/file", save_json="results.json")
16
17print(f"Streams Score : {results['score_streams']:.2f}")
18print(f"Likes Score : {results['score_likes']:.2f}")
19print(f"Coherence : {results['coherence']:.2f}")
20print(f"Musicality : {results['musicality']:.2f}")
21print(f"Memorability : {results['memorability']:.2f}")
22print(f"Clarity : {results['clarity']:.2f}")
23print(f"Naturalness : {results['naturalness']:.2f}")
1@misc{husain2026apexlargescalemultitaskaestheticinformed,
2 title={APEX: Large-scale Multi-task Aesthetic-Informed Popularity Prediction for AI-Generated Music},
3 author={Jaavid Aktar Husain and Dorien Herremans},
4 year={2026},
5 eprint={2605.03395},
6 archivePrefix={arXiv},
7 primaryClass={cs.SD},
8 url={https://arxiv.org/abs/2605.03395},
9}