Views
No views yet
| File | Size | Notes |
|---|---|---|
model.safetensors | ~9 MB | Released head weights |
config.json | — | Model config |
modeling_animescore.py | — | Custom modeling code (loaded via trust_remote_code=True) |
pip install -r requirements.txt1import torch, torchaudio
2from transformers import AutoModel
3
4device = "cuda" if torch.cuda.is_available() else "cpu"
5model = AutoModel.from_pretrained(
6 "spellbrush/animescore",
7 trust_remote_code=True,
8).eval().to(device)
9
10wav, sr = torchaudio.load("sample.wav")
11if wav.size(0) > 1:
12 wav = wav.mean(0, keepdim=True) # mono
13if sr != 16000:
14 wav = torchaudio.functional.resample(wav, sr, 16000)
15
16with torch.no_grad():
17 s = model.score(wav.to(device)).item()
18print(f"AnimeScore: {s:.3f}")1sa = model.score(wav_a.to(device))
2sb = model.score(wav_b.to(device))
3p_a_gt_b = torch.sigmoid(sa - sb).item()python example_inference.py --ckpt . --wav sample.wavgradio).1@inproceedings{park2026animescore,
2 title = {AnimeScore: A Preference-Based Dataset and Framework for
3 Evaluating Anime-Like Speech Style},
4 author = {Park, Joonyong and Li, Jerry},
5 booktitle = {Interspeech},
6 year = {2026}
7}