pip install torch accelerate torchaudio datasets
pip install --upgrade transformerstransformers >= 4.30 installed. If the 4.30 version
is not yet available on PyPI make sure to install transformers from
source:pip install git+https://github.com/huggingface/transformers.gitdatasets. Make sure that the audio data is sampled to 16000 kHz.1from datasets import load_dataset, Audio
2
3# English
4stream_data = load_dataset("mozilla-foundation/common_voice_13_0", "en", split="test", streaming=True)
5stream_data = stream_data.cast_column("audio", Audio(sampling_rate=16000))
6en_sample = next(iter(stream_data))["audio"]["array"]
7
8# Arabic
9stream_data = load_dataset("mozilla-foundation/common_voice_13_0", "ar", split="test", streaming=True)
10stream_data = stream_data.cast_column("audio", Audio(sampling_rate=16000))
11ar_sample = next(iter(stream_data))["audio"]["array"]1from transformers import Wav2Vec2ForSequenceClassification, AutoFeatureExtractor
2import torch
3
4model_id = "facebook/mms-lid-1024"
5
6processor = AutoFeatureExtractor.from_pretrained(model_id)
7model = Wav2Vec2ForSequenceClassification.from_pretrained(model_id)1# English
2inputs = processor(en_sample, sampling_rate=16_000, return_tensors="pt")
3
4with torch.no_grad():
5 outputs = model(**inputs).logits
6
7lang_id = torch.argmax(outputs, dim=-1)[0].item()
8detected_lang = model.config.id2label[lang_id]
9# 'eng'
10
11# Arabic
12inputs = processor(ar_sample, sampling_rate=16_000, return_tensors="pt")
13
14with torch.no_grad():
15 outputs = model(**inputs).logits
16
17lang_id = torch.argmax(outputs, dim=-1)[0].item()
18detected_lang = model.config.id2label[lang_id]
19# 'ara'processor.id2label.values()@article{pratap2023mms,
title={Scaling Speech Technology to 1,000+ Languages},
author={Vineel Pratap and Andros Tjandra and Bowen Shi and Paden Tomasello and Arun Babu and Sayani Kundu and Ali Elkahky and Zhaoheng Ni and Apoorv Vyas and Maryam Fazel-Zarandi and Alexei Baevski and Yossi Adi and Xiaohui Zhang and Wei-Ning Hsu and Alexis Conneau and Michael Auli},
journal={arXiv},
year={2023}
}