Views
No views yet
pip install -r requirements.txt1cd /bandtok
2git clone https://github.com/NVIDIA/BigVGANconfig.yaml, bandtoklm.safetensors, and tokenizer-only bandtok.safetensors.python examples/infer.py --repo_id xlbhzz/bandtok --prompt "A happy Latin song" --output output.wavpython examples/local_test_infer.py --prompt "A happy Latin song" --output local_test_output.wavpython examples/tokenizer_infer.py --repo_id . --input input.wav --output reconstructed.wavpython examples/tokenizer_infer.py --repo_id . --input /path/to/audios --output tokenizer_reconstructionspython examples/tokenizer_infer.py --repo_id . --input input.wav --output reconstructed.wav --save-tokens input_tokens.pt1from bandtok import BandTokPipeline
2
3pipe = BandTokPipeline.from_pretrained("xlbhzz/bandtok", device="cuda")
4audio = pipe.generate("A happy Latin song", duration=10.0)
5pipe.save(audio, "output.wav")1from bandtok import BandTokTokenizer
2
3tokenizer = BandTokTokenizer.from_pretrained("xlbhzz/bandtok", device="cuda")
4tokens = tokenizer.encode("input.wav")
5audio = tokenizer.decode(tokens)git clone https://github.com/NVIDIA/BigVGAN under /bandtok.t5-base; make sure Hugging Face downloads are available or pre-cache the model.1@inproceedings{cheng2026modeling,
2 title = {Modeling Music as a Time-Frequency Image: A 2D Tokenizer for Music Generation},
3 author = {Cheng, Yuqing and Ma, Xingyu and Yu, Guochen and Gu, Xiaotao},
4 booktitle = {IEEE ICME 2026 Challenge Papers},
5 year = {2026}
6}