Views
No views yet
1import torch
2from transformers import AutoProcessor, AutoModel
3import librosa
4
5model_id = "roman4work/ultravox-v0.6-gemma-3-12b-uk"
6processor = AutoProcessor.from_pretrained(model_id, trust_remote_code=True)
7model = AutoModel.from_pretrained(model_id, trust_remote_code=True, torch_dtype=torch.bfloat16, device_map="cuda")
8
9audio, sr = librosa.load("audio.wav", sr=16000)
10
11# Transcription mode
12messages = [{"role": "user", "content": "Repeat the following text, without any explanation: <|audio|>"}]
13# OR Conversation mode: messages = [{"role": "user", "content": "<|audio|>"}]
14
15text = processor.tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
16inputs = processor(text=text, audio=audio, sampling_rate=16000, return_tensors="pt")
17inputs = {k: v.to("cuda") if hasattr(v, "to") else v for k, v in inputs.items()}
18
19with torch.no_grad():
20 outputs = model.generate(**inputs, max_new_tokens=256)
21print(processor.tokenizer.decode(outputs[0][inputs["input_ids"].shape[1]:], skip_special_tokens=True))| Mode | Prompt | Result |
|---|---|---|
| Transcription | `Repeat the following text, without any explanation: < | audio |
| Conversation | `< | audio |