Views
No views yet
1from auto_gptq import AutoGPTQForCausalLM
2from transformers import AutoTokenizer
3
4# Load the quantized model
5model = AutoGPTQForCausalLM.from_quantized(
6 "Hariprasath28/orpheus-3b-multi-gptq-8bit",
7 device="cuda:0", # or "cpu"
8 use_triton=False,
9 trust_remote_code=True
10)
11
12tokenizer = AutoTokenizer.from_pretrained("Hariprasath28/orpheus-3b-multi-gptq-8bit", trust_remote_code=True)
13
14# Generate TTS tokens
15text = "tara: Hello, this is a test of the quantized Orpheus model."
16inputs = tokenizer(text, return_tensors="pt").to("cuda:0")
17
18with torch.no_grad():
19 outputs = model.generate(
20 **inputs,
21 max_new_tokens=100,
22 temperature=0.7,
23 do_sample=True
24 )
25
26generated = tokenizer.decode(outputs[0], skip_special_tokens=True)
27print(generated)