Views
No views yet
banhchungtuongot/whisper-small-vi-en-noise-aug, "Exp C") robust to telephony
degradation (8 kHz band-limit + µ-law + babble + reverb) without forgetting
clean speech.| Model | Telephony WER | Clean WER | Trainable | Size |
|---|---|---|---|---|
| Base Exp C | 0.7419 | 0.2016 | — | 944 MB |
| Full fine-tune | 0.6015 | 0.2339 | 100% | 944 MB |
| This adapter | 0.5393 | 0.1972 | 2.15% | 21 MB |
telephony_sim (8k/µ-law/babble/reverb, ESC-50 held-out cats 40–49, SNR 0–15).1from transformers import WhisperForConditionalGeneration, WhisperProcessor
2from peft import PeftModel
3
4base = WhisperForConditionalGeneration.from_pretrained("banhchungtuongot/whisper-small-vi-en-noise-aug")
5model = PeftModel.from_pretrained(base, "banhchungtuongot/whisper-vi-telephony-lora-encoder")
6processor = WhisperProcessor.from_pretrained("openai/whisper-small")
7processor.tokenizer.set_prefix_tokens(language="vi", task="transcribe")
8# decode with num_beams=5 for the reported numberstraining/finetune_whisper_tele_lora_v2.py, reports/telephony_lora_finetune.md).