Views
No views yet
Raw Audio → 16kHz Resampling → Silence Trimming (VAD)
→ Noise Augmentation → Log-Mel Spectrogram
→ SpecAugment → Whisper Encoder-Decoder1from transformers import WhisperProcessor, WhisperForConditionalGeneration
2import librosa
3
4model = WhisperForConditionalGeneration.from_pretrained("sanvo/vietnamese-whisper-asr")
5processor = WhisperProcessor.from_pretrained("openai/whisper-small")
6
7audio, sr = librosa.load("vietnamese_audio.wav", sr=16000)
8inputs = processor(audio, sampling_rate=16000, return_tensors="pt")
9predicted_ids = model.generate(inputs.input_features)
10transcription = processor.batch_decode(predicted_ids, skip_special_tokens=True)[0]
11print(transcription)