Views
No views yet
1from transformers import WhisperProcessor, WhisperForConditionalGeneration
2import torch
3
4# Load model and processor
5processor = WhisperProcessor.from_pretrained("IsmaelRR/SusurroModel-WhisperTurboV3Spanish")
6model = WhisperForConditionalGeneration.from_pretrained("IsmaelRR/SusurroModel-WhisperTurboV3Spanish")
7
8# If you have GPU
9device = "cuda" if torch.cuda.is_available() else "cpu"
10model = model.to(device)
11
12# Process your audio file
13# Note: Make sure your audio is sampled at 16kHz
14input_features = processor(
15 audio["array"],
16 sampling_rate=16000,
17 return_tensors="pt"
18).input_features.to(device)
19
20# Generate transcription
21predicted_ids = model.generate(input_features)
22transcription = processor.batch_decode(predicted_ids, skip_special_tokens=True)
23print(transcription)@misc{susurro2024,
author = {IsmaelRR},
title = {Susurro: Fine-tuned Whisper Model for Spanish Speech Recognition},
year = {2024},
publisher = {Hugging Face},
journal = {Hugging Face Model Hub},
howpublished = {\url{https://huggingface.co/IsmaelRR/SusurroModel-WhisperTurboV3Spanish}}
}