Views
No views yet
1pip install --upgrade pip
2pip install --upgrade transformers accelerate datasets[audio]pipeline
class to transcribe short-form audio files (< 30-seconds) as follows:1import torch
2from transformers import AutoModelForSpeechSeq2Seq, AutoProcessor, pipeline
3from datasets import load_dataset
4
5
6device = "cuda:0" if torch.cuda.is_available() else "cpu"
7torch_dtype = torch.float16 if torch.cuda.is_available() else torch.float32
8
9model_id = "Aspik101/distil-whisper-large-v3-pl"
10
11model = AutoModelForSpeechSeq2Seq.from_pretrained(
12 model_id, torch_dtype=torch_dtype, low_cpu_mem_usage=True, use_safetensors=True
13)
14model.to(device)
15
16processor = AutoProcessor.from_pretrained(model_id)
17
18pipe = pipeline(
19 "automatic-speech-recognition",
20 model=model,
21 tokenizer=processor.tokenizer,
22 feature_extractor=processor.feature_extractor,
23 max_new_tokens=128,
24 torch_dtype=torch_dtype,
25 device=device,
26)
27
28dataset = load_dataset("mozilla-foundation/common_voice_13_0", "pl", split="test")
29sample = dataset[0]["audio"]
30
31result = pipe(sample)
32print(result["text"])1- result = pipe(sample)
2+ result = pipe("audio.mp3")chunk_length_s parameter to the pipeline. For Distil-Whisper, a chunk length of 15-seconds
is optimal. To activate batching, pass the argument batch_size:1import torch
2from transformers import AutoModelForSpeechSeq2Seq, AutoProcessor, pipeline
3from datasets import load_dataset
4
5
6device = "cuda:0" if torch.cuda.is_available() else "cpu"
7torch_dtype = torch.float16 if torch.cuda.is_available() else torch.float32
8
9model_id = "Aspik101/distil-whisper-large-v3-pl"
10
11model = AutoModelForSpeechSeq2Seq.from_pretrained(
12 model_id, torch_dtype=torch_dtype, low_cpu_mem_usage=True, use_safetensors=True
13)
14model.to(device)
15
16processor = AutoProcessor.from_pretrained(model_id)
17
18pipe = pipeline(
19 "automatic-speech-recognition",
20 model=model,
21 tokenizer=processor.tokenizer,
22 feature_extractor=processor.feature_extractor,
23 max_new_tokens=128,
24 chunk_length_s=15,
25 batch_size=16,
26 torch_dtype=torch_dtype,
27 device=device,
28)
29
30dataset = load_dataset("mozilla-foundation/common_voice_13_0", "pl", split="test")
31sample = dataset[0]["audio"]
32
33result = pipe(sample)
34print(result["text"])