Views
No views yet
bad + bvd corpora. Quantizes
16 kHz audio to FSQ code indices and decodes codes back to a cochleagram. This is the tokenizer
only — it does not render waveforms. Its codebook is distinct from
TuKoResearch/WavCochCausalV8192, so codes are not interchangeable.model_best.pt (step 199000)1from transformers import AutoModel
2import torch, torchaudio
3
4m = AutoModel.from_pretrained("TuKoResearch/WavCochCausalV64k-20ms-babyview", trust_remote_code=True).eval()
5wav, sr = torchaudio.load("clip.wav") # resample to 16 kHz first if needed
6codes = m.quantize(wav.unsqueeze(0)) # [1, N] FSQ indices
7coch = m.decode(codes) # [1, T, out_channels] cochleagram