Views
No views yet
python -m venv /path/to/venvsource /path/to/venv/bin/activatepip install datasets transformers 1#Install Prerequisites
2pip install torch
3pip install datasets
4pip install 'transformers[torch]'
5pip install evaluate
6pip install jiwer1#This code works with GPU
2
3#Notice that: load_metric is no longer part of datasets.
4#You have to remove it and use evaluate's load instead.
5#(Note from November 2024)
6
7import torch
8from transformers import WhisperForConditionalGeneration, WhisperProcessor
9
10#Load the processor and model.
11MODEL_NAME="BSC-LT/whisper-bsc-large-v3-cat"
12processor = WhisperProcessor.from_pretrained(MODEL_NAME)
13model = WhisperForConditionalGeneration.from_pretrained(MODEL_NAME).to("cuda")
14
15#Load the dataset
16from datasets import load_dataset, load_metric, Audio
17ds=load_dataset("projecte-aina/parlament_parla",split='test')
18
19#Downsample to 16 kHz
20ds = ds.cast_column("audio", Audio(sampling_rate=16_000))
21
22#Process the dataset
23def map_to_pred(batch):
24 audio = batch["audio"]
25 input_features = processor(audio["array"], sampling_rate=audio["sampling_rate"], return_tensors="pt").input_features
26 batch["reference"] = processor.tokenizer._normalize(batch['normalized_text'])
27
28 with torch.no_grad():
29 predicted_ids = model.generate(input_features.to("cuda"))[0]
30
31 transcription = processor.decode(predicted_ids)
32 batch["prediction"] = processor.tokenizer._normalize(transcription)
33
34 return batch
35
36#Do the evaluation
37result = ds.map(map_to_pred)
38
39#Compute the overall WER now.
40from evaluate import load
41
42wer = load("wer")
43WER=100 * wer.compute(references=result["reference"], predictions=result["prediction"])
44print(WER)1@misc{takanori2025whisperbsclarge3cat,
2 title={Acoustic Model in Catalan: Whisper_bsc_large_v3_cat.},
3 author={Sanchez Shiromizu, Lucas Takanori; Hernandez Mena, Carlos Daniel; Messaoudi, Abir; España i Bonet, Cristina; Cortada Garcia, Marti},
4 organization={Barcelona Supercomputing Center},
5 url={https://huggingface.co/langtech-veu/whisper-bsc-large-v3-cat},
6 year={2025}
7}