Views
No views yet
facebook/mms-lid-126, which achieves 97.2% accuracy on FLEURS across 126 languages and covers all 32 target languages.1from transformers import pipeline
2
3classifier = pipeline("audio-classification", model="facebook/mms-lid-126")
4result = classifier("/path/to/audio.wav")
5print(result[0]["label"]) # ISO 639-3 code, e.g. "eng"python inference.py --audio sample.wav| Code | Language | Code | Language |
|---|---|---|---|
eng | English | kor | Korean |
cmn | Mandarin Chinese | ita | Italian |
hin | Hindi | tha | Thai |
spa | Spanish | guj | Gujarati |
fra | French | fas | Persian (Farsi) |
ara | Arabic | pol | Polish |
ben | Bengali | ukr | Ukrainian |
por | Portuguese | mal | Malayalam |
rus | Russian | kan | Kannada |
urd | Urdu | ory | Oriya |
ind | Indonesian | mya | Burmese |
deu | German | pan | Punjabi |
jpn | Japanese | nld | Dutch |
mar | Marathi | pus | Pashto |
tel | Telugu | ||
tur | Turkish | ||
tam | Tamil | ||
vie | Vietnamese |
denizaybey/lid-32-mms1b) is also available, trained specifically on the 32 target languages from the google/fleurs dataset using:facebook/mms-1b (wav2vec2, 1B params)inference.py — Standalone CLI for inferencetrain.py — Full training script for reproductionREADME.md — This file| Attribute | Value |
|---|---|
| Architecture | wav2vec2 (MMS-1B) |
| Parameters | ~1B |
| Sampling Rate | 16 kHz |
| Max Audio Length | 30 seconds |
| Output Format | ISO 639-3 language codes |
| Training Data | google/fleurs (32 language configs) |