Views
No views yet
fuf)1import torch, librosa
2from transformers import Wav2Vec2ForCTC, AutoProcessor
3
4repo = "SalimDiallo/mms-1b-pular-asr"
5processor = AutoProcessor.from_pretrained(repo)
6model = Wav2Vec2ForCTC.from_pretrained(repo).eval()
7
8audio, _ = librosa.load("mon_audio.wav", sr=16_000)
9inputs = processor(audio, sampling_rate=16_000, return_tensors="pt")
10with torch.no_grad():
11 logits = model(**inputs).logits
12print(processor.decode(torch.argmax(logits, dim=-1)[0]))| Modèle | WER | CER |
|---|---|---|
| MMS-1B-all (adapter fula d'origine, sans fine-tuning) | 17,31 % | 4,57 % |
| Ce modèle (fine-tuné) | 10,38 % | 2,89 % |
1@article{pratap2023mms,
2 title={Scaling Speech Technology to 1,000+ Languages},
3 author={Pratap, Vineel and others},
4 journal={arXiv preprint arXiv:2305.13516},
5 year={2023}
6}