Views
No views yet
openai/whisper-small trained on a subset of the Multilingual Librispeech dataset.openai/whisper-small entraînée sur un sous-ensemble du dataset Multilingual Librispeech.WhisperTokenizer / Texte normalisé et tokenisé avec WhisperTokenizer⚠️ Note / Remarque: Performance may drop on very regional accents or rare proper nouns / Les performances peuvent être légèrement réduites pour des accents très régionaux ou des noms propres rares.
1from transformers import WhisperProcessor, WhisperForConditionalGeneration
2import torch
3import soundfile as sf
4
5# Load the model / Charger le modèle
6repo_id = "keypa/whisper-3-mls-fr"
7processor = WhisperProcessor.from_pretrained(repo_id)
8model = WhisperForConditionalGeneration.from_pretrained(repo_id)
9
10# Load an audio file / Charger un fichier audio
11speech, sr = sf.read("my_audio.wav")
12if sr != 16000:
13 raise ValueError("Audio must be 16kHz / Audio doit être 16kHz!")
14
15inputs = processor(speech, sampling_rate=16000, return_tensors="pt").input_features
16generated_ids = model.generate(inputs)
17transcription = processor.batch_decode(generated_ids, skip_special_tokens=True)[0]
18
19print(transcription)