Views
No views yet
1from peft import PeftModel, PeftConfig
2from transformers import WhisperForConditionalGeneration, WhisperProcessor
3
4peft_model_id = "kasunw/whisper-large-v3-hindi"
5
6peft_config = PeftConfig.from_pretrained(peft_model_id)
7model = WhisperForConditionalGeneration.from_pretrained(
8 peft_config.base_model_name_or_path, device_map="auto", torch_dtype=torch.float16
9)
10model = PeftModel.from_pretrained(model, peft_model_id)
11model.config.use_cache = True
12
13processor = WhisperProcessor.from_pretrained(peft_config.base_model_name_or_path, language="Hindi", task="transcribe")
14torch_dtype = torch.float16 if torch.cuda.is_available() else torch.float32
15
16pipe = pipeline(
17 "automatic-speech-recognition",
18 model=model,
19 tokenizer=processor.tokenizer,
20 feature_extractor=processor.feature_extractor,
21 max_new_tokens=128,
22 chunk_length_s=30,
23 batch_size=16,
24 return_timestamps=True,
25 torch_dtype=torch_dtype,
26 device=model.device,
27)
28
29path_to_audio = "audio.mp3"
30
31result = pipe(path_to_audio)
32print(result["text"])