Views
No views yet

1 from transformers import Wav2Vec2Processor, Data2VecForCTC
2 from datasets import load_dataset
3 import torch
4
5 # load model and processor
6 processor = Wav2Vec2Processor.from_pretrained("facebook/data2vec-audio-base-960h")
7 model = Data2VecForCTC.from_pretrained("facebook/data2vec-audio-base-960h")
8
9 # load dummy dataset and read soundfiles
10 ds = load_dataset("patrickvonplaten/librispeech_asr_dummy", "clean", split="validation")
11
12 # tokenize
13 input_values = processor(ds[0]["audio"]["array"],, return_tensors="pt", padding="longest").input_values # Batch size 1
14
15 # retrieve logits
16 logits = model(input_values).logits
17
18 # take argmax and decode
19 predicted_ids = torch.argmax(logits, dim=-1)
20 transcription = processor.batch_decode(predicted_ids)1 from transformers import Wav2Vec2Processor, Data2VecForCTC
2 from datasets import load_dataset
3 import torch
4 from jiwer import wer
5
6 # load model and processor
7 processor = Wav2Vec2Processor.from_pretrained("facebook/data2vec-audio-base-960h").to("cuda")
8 model = Data2VecForCTC.from_pretrained("facebook/data2vec-audio-base-960h")
9
10
11librispeech_eval = load_dataset("librispeech_asr", "clean", split="test")
12
13def map_to_pred(batch):
14 input_values = processor(batch["audio"]["array"], return_tensors="pt", padding="longest").input_values
15 with torch.no_grad():
16 logits = model(input_values.to("cuda")).logits
17
18 predicted_ids = torch.argmax(logits, dim=-1)
19 transcription = processor.batch_decode(predicted_ids)
20 batch["transcription"] = transcription
21 return batch
22
23result = librispeech_eval.map(map_to_pred, batched=True, batch_size=1, remove_columns=["audio"])
24
25print("WER:", wer(result["text"], result["transcription"]))| "clean" | "other" |
|---|---|
| 2.77 | 7.08 |