Views
No views yet
generate (RTF 0.31→0.13), 769 MB (int8_float16) vs
~3 GB fp32. Long-form batched (faster-whisper BatchedInferencePipeline) ≈ 48× realtime.1from faster_whisper import WhisperModel
2m = WhisperModel("banhchungtuongot/phowhisper-medium-vi-telephony-ct2",
3 device="cuda", compute_type="int8_float16", num_workers=4)
4segs, info = m.transcribe(audio_16k, language="vi", beam_size=5)
5print(" ".join(s.text for s in segs))banhchungtuongot/phowhisper-medium-vi-telephony-lora.
Code/analysis: https://github.com/NguyenDucAnforwork/asr-h100-noise-robust
(reports/inference_infra_results.md, reports/telephony_lora_finetune.md).