Fine-tuned model for Cantonese (yue) speech recognition.
1# Clone and view locally
2git clone https://huggingface.co/awong-dev/whisper-large-v3-yue-test1b-baseline-fp16-8bit
3tensorboard --logdir whisper-large-v3-yue-test1b-baseline-fp16-8bit/runs
1from transformers import WhisperForConditionalGeneration, WhisperProcessor
2import torchaudio
3
4processor = WhisperProcessor.from_pretrained("awong-dev/whisper-large-v3-yue-test1b-baseline-fp16-8bit")
5model = WhisperForConditionalGeneration.from_pretrained("awong-dev/whisper-large-v3-yue-test1b-baseline-fp16-8bit")
6
7# Load audio
8audio, sr = torchaudio.load("audio.mp3")
9if sr != 16000:
10 audio = torchaudio.transforms.Resample(sr, 16000)(audio)
11
12input_features = processor(
13 audio.squeeze().numpy(), sampling_rate=16000, return_tensors="pt"
14).input_features
15
16predicted_ids = model.generate(input_features)
17transcription = processor.batch_decode(predicted_ids, skip_special_tokens=True)[0]
18print(transcription)