Views
No views yet
| Property | Value |
|---|---|
| Model ID | Saugat212/ASR_MODEL |
| Base Model | facebook/wav2vec2-base |
| Architecture | wav2vec2 |
| Parameters | 0.3B |
| Language | Nepali |
| File | Description |
|---|---|
whisper_transcription.ipynb | Whisper model for Nepali speech-to-text transcription |
wav2vec2_finetuning.ipynb | Wav2Vec2 fine-tuning recipe for Nepali ASR |
wav2vec2_finetune.py | Python script for Wav2Vec2 fine-tuning |
finetune.py | ASR fine-tuning script |
Dataset/ | Training datasets (CSV files with audio paths and transcriptions) |
Phase 1/Finetuning/ | Phase 1 training data, checkpoints, and inference notebooks |
1from transformers import Wav2Vec2Processor, Wav2Vec2ForCTC
2
3model_name = "Saugat212/ASR_MODEL"
4processor = Wav2Vec2Processor.from_pretrained(model_name)
5model = Wav2Vec2ForCTC.from_pretrained(model_name)1import torchaudio
2import torch
3
4# Load audio
5waveform, sample_rate = torchaudio.load("audio.wav")
6
7# Process
8input_values = processor(waveform.squeeze(), return_tensors="pt", sampling_rate=sample_rate).input_values
9
10# Infer
11with torch.no_grad():
12 logits = model(input_values).logits
13predicted_ids = torch.argmax(logits, dim=-1)
14
15# Decode
16transcription = processor.batch_decode(predicted_ids)[0]
17print(transcription)Saugat212/ASR_MODEL - Fine-tuned Nepali ASRDataset/final_transcriptions.csv with audio paths and transcriptionscleaned_data.csvwav2vec2_finetuning.ipynb for complete fine-tuning pipeline.