Views
No views yet
pip install transformers torch torchaudio sentencepiece librosa1from huggingface_hub import snapshot_download
2import sys
3
4# Download model
5model_path = snapshot_download("Anshul1212/indicconformer-hi-hybrid-rnnt-large-hf")
6sys.path.insert(0, model_path)
7
8# Import pipeline and model
9from pipeline_indicconformer import IndicConformerASRPipeline
10from modeling_indicconformer import IndicConformerForCTC
11
12# Create pipeline
13model = IndicConformerForCTC.from_pretrained(model_path)
14pipe = IndicConformerASRPipeline(model=model, model_path=model_path)
15
16# Transcribe
17result = pipe("audio.wav")
18print(result["text"])1import torch
2import torchaudio
3from transformers import AutoModel, AutoTokenizer, AutoFeatureExtractor
4
5# Load components
6model = AutoModel.from_pretrained("Anshul1212/indicconformer-hi-hybrid-rnnt-large-hf", trust_remote_code=True)
7model.eval()
8
9feature_extractor = AutoFeatureExtractor.from_pretrained("Anshul1212/indicconformer-hi-hybrid-rnnt-large-hf", trust_remote_code=True)
10tokenizer = AutoTokenizer.from_pretrained("Anshul1212/indicconformer-hi-hybrid-rnnt-large-hf", trust_remote_code=True)
11
12# Load audio
13waveform, sample_rate = torchaudio.load("audio.wav")
14
15# Extract features and transcribe
16inputs = feature_extractor(waveform.squeeze().numpy(), sampling_rate=16000, return_tensors="pt")
17
18with torch.no_grad():
19 predicted_ids = model.generate(
20 input_features=inputs['input_features'],
21 language='hi',
22 decoder_mode='rnnt'
23 )
24 text = tokenizer.decode(predicted_ids[0])
25
26print(text)1device = torch.device("cuda" if torch.cuda.is_available() else "cpu")
2model.to(device)
3
4input_features = inputs['input_features'].to(device)
5
6with torch.no_grad():
7 predicted_ids = model.generate(input_features=input_features, language='hi', decoder_mode='rnnt')
8 text = tokenizer.decode(predicted_ids[0])1with torch.no_grad():
2 predicted_ids = model.generate(
3 input_features=inputs['input_features'],
4 language='hi',
5 decoder_mode='ctc'
6 )
7 text = tokenizer.decode(predicted_ids[0], use_ctc=True)| Code | Language | Code | Language |
|---|---|---|---|
| hi | Hindi | te | Telugu |
| bn | Bengali | ta | Tamil |
| gu | Gujarati | ml | Malayalam |
| mr | Marathi | kn | Kannada |
| pa | Punjabi | or | Odia |
| as | Assamese | ur | Urdu |
| ne | Nepali | sa | Sanskrit |
| sd | Sindhi | kok | Konkani |
| doi | Dogri | mai | Maithili |
| mni | Manipuri | brx | Bodo |
| sat | Santali | ks | Kashmiri |
1@misc{indicconformer2024,
2 title={IndicConformer: Conformer-based ASR for Indian Languages},
3 author={AI4Bharat},
4 year={2024},
5 publisher={Hugging Face},
6 url={https://huggingface.co/ai4bharat/indicconformer_stt_hi_hybrid_ctc_rnnt_large}
7}