Views
No views yet

git clone https://github.com:Eps-Acoustic-Revolution-Lab/EAR_HEAR.git
git submodule update --init --recursive
conda create -n hear python=3.10 -y
conda activate hear
pip install -r requirements.txt# Download pretrained model weights
export HF_ENDPOINT=https://hf-mirror.com # For users in Mainland China, this is needed for HuggingFace downloads
hf download earlab/EAR_HEAR --local-dir pretrained_models
# Track 1: Single-Label Inference (Musicality)
python inference.py \
--input_audio_path data_pipeline/origin_song_eval_dataset/mp3/0.mp3 \
--output_json_path output.json
--model_path pretrained_models/track_1.pth \
--model_config_path config_track_1.yaml
# Track 2: Multi-Label Inference (5 Dimensions)
python inference.py \
--input_audio_path data_pipeline/origin_song_eval_dataset/mp3/0.mp3 \
--output_json_path output.json
--model_path pretrained_models/track_2.pth \
--model_config_path config_track_2.yaml1cd data_pipeline
2bash run.shtrain_set.pkl and test_set.pkl files for training and evaluation1python train_track_1.py \
2 --experiment_name track1_exp \
3 --train-data /path/to/train_set.pkl \
4 --test-data /path/to/test_set.pkl \
5 --max-epoch 60 \
6 --batch-size 8 \
7 --lr 1e-5 \
8 --weight_decay 1e-3 \
9 --accum_steps 4 \
10 --lambda 0.15 \
11 --workers 8 \
12 --seed 01python train_track_2.py \
2 --experiment_name track2_exp \
3 --train-data /path/to/train_set.pkl \
4 --test-data /path/to/test_set.pkl \
5 --max-epoch 60 \
6 --batch-size 8 \
7 --lr 1e-5 \
8 --weight_decay 1e-3 \
9 --accum_steps 4 \
10 --lambda 0.05 \
11 --workers 8 \
12 --seed 0--max-epoch: Maximum number of training epochs (default: 60)--batch-size: Batch size for training (default: 8)--experiment_name: Name of the experiment for saving models and logs--lr: Learning rate (default: 1e-5)--weight_decay: Weight decay for optimizer (default: 1e-3)--accum_steps: Gradient accumulation steps (default: 4)--lambda: Weight for ranking loss (Track 1: 0.15, Track 2: 0.05)--workers: Number of data loading workers (default: 8)--seed: Random seed for reproducibility (default: 0)--train-data: Path to training data pkl file (default: data_pipeline/dataset_pkl/train_set.pkl)--test-data: Path to test data pkl file (default: data_pipeline/dataset_pkl/test_set.pkl)--log-dir: Path to tensorboard log directory (default: ./log/tensorboard_records/{experiment_name})--eval flag:1python train_track_1.py --eval --experiment_name track1_exp
2python train_track_2.py --eval --experiment_name track2_expconfig_track_1.yaml - Configuration for Track 1config_track_2.yaml - Configuration for Track 2log/models/{experiment_name}/model.pth, and training logs are saved to TensorBoard in ./log/tensorboard_records/{experiment_name}/ (or custom path specified by --log-dir).1@misc{liu2025hearhierarchicallyenhancedaesthetic,
2 title={Hear: Hierarchically Enhanced Aesthetic Representations For Multidimensional Music Evaluation},
3 author={Shuyang Liu and Yuan Jin and Rui Lin and Shizhe Chen and Junyu Dai and Tao Jiang},
4 year={2025},
5 eprint={2511.18869},
6 archivePrefix={arXiv},
7 primaryClass={cs.SD},
8 url={https://arxiv.org/abs/2511.18869},
9}