Views
No views yet
vinai/PhoWhisper-small that adds robustness to
telephony degradation (8 kHz + µ-law + babble + reverb) while keeping
PhoWhisper's strong clean Vietnamese accuracy.| Model | Clean WER | Telephony WER | Trainable | Size |
|---|---|---|---|---|
| Whisper Exp C base | ~0.197 | 0.7419 | — | — |
| LoRA on Exp C (prev best) | 0.1972 | 0.5393 | 2.15% | 21 MB |
| PhoWhisper-small base | 0.1351 | 0.6109 | — | — |
| This adapter (PhoWhisper + LoRA) | 0.1324 | 0.4664 | 2.15% | 21 MB |
1from transformers import WhisperForConditionalGeneration, WhisperProcessor
2from peft import PeftModel
3
4base = WhisperForConditionalGeneration.from_pretrained("vinai/PhoWhisper-small")
5model = PeftModel.from_pretrained(base, "banhchungtuongot/phowhisper-vi-telephony-lora-encoder")
6processor = WhisperProcessor.from_pretrained("vinai/PhoWhisper-small")
7processor.tokenizer.set_prefix_tokens(language="vi", task="transcribe")
8# decode with num_beams=5 for the reported numberstraining/finetune_whisper_tele_lora_v2.py, reports/telephony_lora_finetune.md).