This repository contains scripts and resources for fine-tuning direct speech-to-text (S2T) translation models for English to Indian languages (Hindi, Gujarati, and Telugu) without intermediate text generation.
📁 Repository Structure
.
├── finetune_scripts/
│ ├── data_collect_clean.py # Data collection and cleaning
│ ├── dataset_making.py # Dataset preparation for fine-tuning
│ ├── finetune.py # Model fine-tuning script
│ ├── mt_eval.py # Evaluation and comparison script
│ ├── eval_finetuned/ # Evaluation results and predictions
│ ├── final-data/ # Processed datasets (language-wise)
├──finetuned_models/ # Fine-tuned model checkpoints (.pt files)
🎯 Translation Tasks
Hindi → English (hin-eng)
Gujarati → English (guj-eng)
Telugu → English (tel-eng)
Note: All translations are performed using direct speech-to-text without intermediate text generation.
🚀 Pipeline Overview
1. Data Collection and Cleaning (data_collect_clean.py)
Downloads and cleans audio data from five AI4Bharat datasets: