Views
No views yet
Research preview — private. Weights derive from experimental training data and are not licensed for redistribution or production use.
reso: <your text> with inline paralinguistic tags:
<laugh> <chuckle> <sigh> <gasp> <whisper> <pause>1import torch
2from transformers import AutoModelForCausalLM, AutoTokenizer
3from peft import PeftModel
4
5base = AutoModelForCausalLM.from_pretrained(
6 "canopylabs/orpheus-3b-0.1-ft", torch_dtype=torch.bfloat16, device_map="auto")
7model = PeftModel.from_pretrained(base, "decibel-hq/reso1-3b-en")
8tokenizer = AutoTokenizer.from_pretrained("decibel-hq/reso1-3b-en")
9# sequence format + SNAC decode: 7 audio tokens/frame from id 128266,
10# wrapped in [128259] text [128009,128260,128261,128257] audio [128258,128262]temperature 0.6, top_p 0.95, repetition_penalty >= 1.1 (required —
lower values cause audio loops). Streaming: decode SNAC frames incrementally
(7 tokens = ~85 ms audio); a GGUF build for llama.cpp is at
decibel-hq/reso1-3b-en-GGUF.<whisper>/<pause> are corpus-taught rather than base-native — less robust