Views
No views yet
| Metric | Value |
|---|---|
| WER | 22.62% |
| CER | 14.13% |
1from transformers import WhisperForConditionalGeneration, WhisperProcessor
2import torch
3
4# Load model and processor
5model = WhisperForConditionalGeneration.from_pretrained("PhilippeFuhrioso/whisper-large-v3-swiss-german-spc")
6processor = WhisperProcessor.from_pretrained("PhilippeFuhrioso/whisper-large-v3-swiss-german-spc")
7
8# Load your audio file (16kHz, mono)
9# audio = ... # numpy array with shape (samples,)
10
11# Prepare inputs
12inputs = processor(audio, sampling_rate=16000, return_tensors="pt")
13
14# Generate transcription
15with torch.no_grad():
16 predicted_ids = model.generate(inputs.input_features)
17
18transcription = processor.batch_decode(predicted_ids, skip_special_tokens=True)[0]
19print(transcription)