Views
No views yet
1import torch
2from datasets import load_dataset
3from transformers import AutoModelForCTC, AutoProcessor
4import torchaudio.functional as F
5
6
7model_id = "patrickvonplaten/wav2vec2-large-xlsr-53-spanish-with-lm"
8
9sample = next(iter(load_dataset("common_voice", "es", split="test", streaming=True)))
10resampled_audio = F.resample(torch.tensor(sample["audio"]["array"]), 48_000, 16_000).numpy()
11
12model = AutoModelForCTC.from_pretrained(model_id)
13processor = AutoProcessor.from_pretrained(model_id)
14
15input_values = processor(resampled_audio, return_tensors="pt").input_values
16
17with torch.no_grad():
18 logits = model(input_values).logits
19
20-prediction_ids = torch.argmax(logits, dim=-1)
21-transcription = processor.batch_decode(prediction_ids)
22+transcription = processor.batch_decode(logits.numpy()).text
23# => 'bien y qué regalo vas a abrir primero'| Model | WER | CER |
|---|---|---|
| patrickvonplaten/wav2vec2-large-xlsr-53-spanish-with-lm | 8.44% | 2.93% |
| jonatasgrosman/wav2vec2-large-xlsr-53-spanish | 10.20% | 3.24% |
bash run_ngram_wav2vec2.py 1 512bash run_ngram_wav2vec2.py 0 512run_ngram_wav2vec2.py being
https://huggingface.co/patrickvonplaten/wav2vec2-large-xlsr-53-spanish-with-lm/blob/main/run_ngram_wav2vec2.py