Views
No views yet
1import torch
2import soundfile as sf
3
4from transformers import (
5 SpeechT5ForSpeechToText,
6 SpeechT5Processor,
7 SpeechT5Tokenizer,
8)
9
10device = "cuda" if torch.cuda.is_available() else "cpu"
11
12model_id = "Mohammed01/ArTST-v2-Dialects"
13
14tokenizer = SpeechT5Tokenizer.from_pretrained(model_id)
15processor = SpeechT5Processor.from_pretrained(model_id, tokenizer=tokenizer)
16model = SpeechT5ForSpeechToText.from_pretrained(model_id).to(device)
17
18audio, sampling_rate = sf.read("audio.wav")
19
20inputs = processor(
21 audio=audio,
22 sampling_rate=sampling_rate,
23 return_tensors="pt"
24)
25
26inputs = {key: value.to(device) for key, value in inputs.items()}
27
28predicted_ids = model.generate(
29 **inputs,
30 max_length=250
31)
32
33transcription = processor.batch_decode(
34 predicted_ids,
35 skip_special_tokens=True
36)
37
38print(transcription[0])