Views
No views yet

facebook/wav2vec2-xls-r-1b checkpoint and
the decoder from the facebook/mbart-large-50 checkpoint.
Consequently, the encoder-decoder model was fine-tuned on 21 {lang} -> en translation pairs of the Covost2 dataset.{lang} -> en (English):fr, de, es, ca, it, ru, zh-CN, pt, fa, et, mn, nl, tr, ar, sv-SE, lv, sl, ta, ja, id, cy} -> engenerate method to generate the
transcripts by passing the speech features to the model.1from datasets import load_dataset
2from transformers import pipeline
3
4# replace following lines to load an audio file of your choice
5librispeech_en = load_dataset("patrickvonplaten/librispeech_asr_dummy", "clean", split="validation")
6audio_file = librispeech_en[0]["file"]
7
8asr = pipeline("automatic-speech-recognition", model="facebook/wav2vec2-xls-r-1b-21-to-en", feature_extractor="facebook/wav2vec2-xls-r-1b-21-to-en")
9
10translation = asr(audio_file)1import torch
2from transformers import Speech2Text2Processor, SpeechEncoderDecoderModel
3from datasets import load_dataset
4
5model = SpeechEncoderDecoderModel.from_pretrained("facebook/wav2vec2-xls-r-1b-21-to-en")
6processor = Speech2Text2Processor.from_pretrained("facebook/wav2vec2-xls-r-1b-21-to-en")
7
8ds = load_dataset("patrickvonplaten/librispeech_asr_dummy", "clean", split="validation")
9
10inputs = processor(ds[0]["audio"]["array"], sampling_rate=ds[0]["audio"]["array"]["sampling_rate"], return_tensors="pt")
11generated_ids = model.generate(input_ids=inputs["input_features"], attention_mask=inputs["attention_mask"])
12transcription = processor.batch_decode(generated_ids){lang} -> en
{lang} -> en Speech Translation