Views
No views yet
waveform_decoder). There is no separate external vocoder checkpoint.speaker_reference.walston/GenAID extracts a 64-d accent embedding from accent_reference.best_model.pth: AccentBox acoustic model plus built-in HiFiGAN waveform decoder.config.json: training config.speaker_encoder/model_se.pth.tar: speaker encoder checkpoint.speaker_encoder/config_se.json: speaker encoder config.remote_infer.py: batch inference from a Joycent-style jsonl list.1{
2 "id": "case_id",
3 "speaker_reference": "/path/to/speaker.wav",
4 "accent_reference": "/path/to/accent.wav",
5 "phones": "sil n i3 h ao3 m a5 sil"
6}resources/multi_accent/inference/medium_grl/infer_list.jsonl already has this format.1python remote_infer.py \
2 --repo-id walston/accentbox-zh \
3 --infer-list /path/to/infer_list.jsonl \
4 --output-dir outputs \
5 --device cuda1python remote_infer.py \
2 --repo-id walston/accentbox-zh \
3 --infer-list /path/to/infer_list.jsonl \
4 --output-dir outputs \
5 --device cpu \
6 --limit 1walston/GenAID, reads each list row, and writes one waveform per row to --output-dir.