Views
No views yet
task="transcribe" to keep the source language or task="translate" to render English. Pass language=None to let the model detect the spoken language. Output is cased and punctuated.openai/whisper-tiny for zeromodels. One implementation runs unmodified on TensorFlow / Torch / JAX.WhisperConditionalGenerate, 39M).1import os
2os.environ["KERAS_BACKEND"] = "torch" # or "jax" / "tensorflow"
3
4import soundfile as sf
5from zeromodels.models.whisper import (
6 WhisperProcessor,
7 WhisperConditionalGenerate,
8)
9
10model = WhisperConditionalGenerate.from_weights("zeromodels/whisper_tiny")
11processor = WhisperProcessor.from_weights("zeromodels/whisper_tiny")
12
13audio, sr = sf.read("your_audio.wav", dtype="float32") # 16 kHz mono
14# task="transcribe" keeps the source language; "translate" -> English.
15text = model.generate(audio, processor, language="en", task="transcribe")
16print(repr(text[0]))from_weights("zeromodels/<variant>"):| Variant | Hub | Notes |
|---|---|---|
whisper_tiny | zeromodels/whisper_tiny | 39M |
whisper_base | zeromodels/whisper_base | 74M |
whisper_small | zeromodels/whisper_small | 244M |
whisper_medium | zeromodels/whisper_medium | 769M |
whisper_large | zeromodels/whisper_large | 1.55B |
whisper_large_v2 | zeromodels/whisper_large_v2 | 1.55B |
whisper_large_v3 | zeromodels/whisper_large_v3 | 128 mel bins |
whisper_large_v3_turbo | zeromodels/whisper_large_v3_turbo | 4 decoder layers |
KERAS_BACKEND before importing Keras / zeromodels.WhisperProcessor.from_weights(...) so mel bins match the variant (v3 uses 128).hf: prefix, e.g. WhisperConditionalGenerate.from_weights("hf:openai/whisper-tiny").