Views
No views yet
1# whisper-small-hindi
2
3## Model Description
4This is a fine-tuned version of the OpenAI [`whisper-small`](https://huggingface.co/openai/whisper-small) model, specifically adapted for Hindi speech recognition. The model was trained on the Hindi subset of the Mozilla Common Voice 17.0 dataset to improve transcription accuracy for Hindi audio.
5
6---
7
8## Intended Uses & Limitations
9
10**Intended Uses:**
11
12- Automatic speech recognition (ASR) for Hindi language audio.
13- Speech-to-text transcription services targeting Hindi speakers.
14- Integration into voice-enabled applications and platforms requiring Hindi transcription.
15
16**Limitations:**
17
18- The model’s performance depends on the diversity and quality of the training data.
19- May not generalize well to Hindi dialects or accents not represented in Common Voice 17.0.
20- Performance can degrade in noisy, overlapping, or highly conversational speech scenarios.
21
22---
23
24## Training and Evaluation Data
25
26- **Training Dataset:** Mozilla Common Voice 17.0 (Hindi subset).
27- **Evaluation Dataset:** Standard Common Voice 17.0 Hindi test split.
28- Both datasets are publicly available and annotated for speech recognition tasks.
29
30---
31
32## Training Procedure
33
34| Hyperparameter | Value |
35|-----------------------------|----------------------------------------|
36| Learning Rate | 1e-5 |
37| Training Batch Size | 8 |
38| Evaluation Batch Size | 8 |
39| Gradient Accumulation Steps | 2 |
40| Total Effective Batch Size | 16 |
41| Optimizer | Adam (betas=(0.9, 0.999), epsilon=1e-8) |
42| Learning Rate Scheduler | Linear |
43| Warmup Steps | 250 |
44| Total Training Steps | 1000 |
45| Mixed Precision Training | Native AMP (Automatic Mixed Precision) |
46
47---
48
49## Training Results
50
51- Training framework: Hugging Face Transformers 4.39.3, PyTorch 2.6.0+cu124.
52- Tokenizers version 0.15.2.
53- Achieved competitive Word Error Rate (WER) on Common Voice Hindi test set.
54- For detailed evaluation metrics, please refer to the model card or contact the author.
55
56---
57
58## Usage
59
60```python
61from transformers import WhisperProcessor, WhisperForConditionalGeneration
62import torch
63
64processor = WhisperProcessor.from_pretrained("bohraanuj23/whisper-small-hindi")
65model = WhisperForConditionalGeneration.from_pretrained("bohraanuj23/whisper-small-hindi")
66
67audio_input = ... # load your 16kHz audio array here
68
69inputs = processor(audio_input, sampling_rate=16000, return_tensors="pt")
70generated_ids = model.generate(inputs.input_features)
71
72transcription = processor.batch_decode(generated_ids, skip_special_tokens=True)[0]
73print("Transcription:", transcription)