Views
No views yet
1import librosa
2import torch
3from transformers import Wav2Vec2ForCTC, Wav2Vec2Processor
4
5# Đường dẫn đến file wav của bạn
6file_path = "19-198-0002.wav"
7
8audio, sr = librosa.load(file_path, sr=16000)
9
10print(f"Dạng dữ liệu: {type(audio)}")
11print(f"Sample rate: {sr}")
12print(f"Độ dài mảng: {audio.shape}")
13
14# Tải model and processor đã được train
15processor_l2 = Wav2Vec2Processor.from_pretrained("Lam-Hung/xlsr-english-l2", sampling_rate=16000)
16model_l2 = Wav2Vec2ForCTC.from_pretrained("Lam-Hung/xlsr-english-l2")
17
18# tokenize
19input_values_l2 = processor_l2(audio, return_tensors="pt").input_values # type: ignore
20
21with torch.no_grad():
22 logits = model_l2(input_values_l2).logits
23
24# Lây argmax and decode
25predicted_ids_l2 = torch.argmax(logits, dim=-1)
26transcription_l2 = processor_l2.batch_decode(predicted_ids_l2)
27for c in transcription_l2[0]:
28 print(c, end=' ')