Fine-tuned OpenAI Whisper-medium model for Uyghur Automatic Speech Recognition.
1from transformers import WhisperForConditionalGeneration, WhisperProcessor
2import librosa
3
4# Load model
5model = WhisperForConditionalGeneration.from_pretrained("last_model")
6processor = WhisperProcessor.from_pretrained("last_model")
7
8# Transcribe
9audio, sr = librosa.load("audio.wav", sr=16000)
10inputs = processor(audio, sampling_rate=16000, return_tensors="pt")
11predicted_ids = model.generate(**inputs)
12text = processor.batch_decode(predicted_ids, skip_special_tokens=True)[0]
13print(text)
├── last_model/ # Fine-tuned model
│ ├── config.json
│ ├── model.safetensors
│ ├── tokenizer.json
│ ├── infer.py
│ ├── test_audio.aac
│ └── test_audio.txt
├── merged_dataset_clean/ # Training dataset
├── finetune_whisper.py # Training script
├── training_output.log # Training log
└── requirements.txt