Views
No views yet
mos), a partir du modele multilingue
facebook/mms-1b-all (Meta AI).| Metrique | Valeur |
|---|---|
| WER (Word Error Rate) | 13.7 % sur 50 exemples de validation |
| Corpus d'entrainement | 10 000 exemples |
| Corpus de validation | 1 000 exemples (50 evalues) |
| Epochs | 3 |
| Perte d'entrainement (debut -> fin) | 0.503 -> 0.216 |
facebook/mms-1b-all couvre le moore via un adaptateur
generique entraine sur un corpus multilingue a tres faible volume par
langue (l'architecture MMS partage un seul backbone wav2vec2 entre plus de
1000 langues, avec un adaptateur leger specifique par langue). En usage
zero-shot, la transcription produite est exploitable mais bruitee - le
brief du hackathon anticipe explicitement des taux d'erreur superieurs a
60 % pour les langues a tres faibles ressources dans ce regime.mos
en l'exposant a un volume plus important de parole moore reelle, sans
toucher au backbone partage (qui doit rester valide pour les ~1000 autres
langues du modele).peft, n'a pas ete utilisee ici.mos (model.load_adapter("mos")), tous
les parametres du modele ont ete geles, puis uniquement les couches dont le
nom contient adapter ou lm_head ont ete redegelees pour
l'entrainement :1model.load_adapter(LANG)
2for param in model.parameters():
3 param.requires_grad = False
4for name, param in model.named_parameters():
5 if "adapter" in name or "lm_head" in name:
6 param.requires_grad = Truemos) permettrait potentiellement
un gain supplementaire, sans fine-tuner le modele complet - au prix d'une
complexite d'implementation plus elevee (dependance a peft, fusion des
poids apres entrainement). Non explore ici par contrainte de temps (48h).3e-4, 100 pas de warmupbatch_size=2 x gradient_accumulation_steps=4)fp16 (T4-friendly)mos. Un diagnostic de couverture du
vocabulaire sur un echantillon a revele seulement 40.5 % de couverture
avant normalisation, contre 100 % apres. La normalisation a consiste a
mettre en minuscules, retirer ponctuation et guillemets typographiques,
normaliser les espaces (y compris l'espace insecable Unicode \xa0), et
retirer les chiffres.<unk>, rendant l'entrainement largement inefficace malgre un volume
de donnees suffisant.CITADEL-BF-Center/moore_audio_data
(~27 100 lignes, audio + texte aligne, domaine biblique/jw.org)| Reference | Prediction |
|---|---|
bala wennaam pa bakd ned ye | bala wennaam pa bakd ned ye (exact) |
wennaam vuuga zeezi kanga la tond faa yaa bon kang kaset ramba | wennaam vuuga zeezi kanga la tond faa yaa bon kang kaset ramba (exact) |
re poore sodom riima yeela a abram yaa ko maam neba la f tall paoonga | re poore sodom riima yeela a abraam yaa ko maam neba la f tall paanga |
a yaa wa mutard bila a budba wakate a yaa bilf... | a yaa wa murtaagd bila a budba wakate yaa yaa bilf... |
adapter_mos_finetuned.bin, quelques Mo), pas le modele de base complet
(1B parametres, a charger separement depuis facebook/mms-1b-all).1import torch
2from transformers import Wav2Vec2ForCTC, AutoProcessor
3from huggingface_hub import hf_hub_download
4
5BASE_MODEL = "facebook/mms-1b-all"
6LANG = "mos"
7
8processor = AutoProcessor.from_pretrained(BASE_MODEL, target_lang=LANG)
9model = Wav2Vec2ForCTC.from_pretrained(
10 BASE_MODEL, target_lang=LANG, ignore_mismatched_sizes=True
11)
12model.load_adapter(LANG)
13
14adapter_path = hf_hub_download(
15 repo_id="Uriath/mms-mos-finetuned",
16 filename="adapter_mos_finetuned.bin",
17)
18finetuned_state = torch.load(adapter_path, map_location="cpu")
19model.load_state_dict(finetuned_state, strict=False)
20
21model.eval()facebook/mms-1b-all, distribue sous licence
CC-BY-NC-4.0 (Meta AI). Cet adaptateur herite de la meme licence :
usage non-commercial uniquement, avec attribution.1@misc{sukre2026mms,
2 title={mms-mos-finetuned: Adaptateur MMS fine-tune pour le moore},
3 author={Equipe 2},
4 year={2026},
5 howpublished={\url{https://huggingface.co/Uriath/mms-mos-finetuned}},
6 note={Hackathon CITADEL Summer School 2026}
7}