Views
No views yet
| Checkpoint | WER |
|---|---|
| final (step 15000) | 11.88% |
1import torch, librosa
2from transformers import MoonshineForConditionalGeneration, AutoFeatureExtractor
3from mn_tokenizer import MnBPETokenizer
4from huggingface_hub import hf_hub_download
5
6model = MoonshineForConditionalGeneration.from_pretrained("orgilj/moonshine-mn").eval()
7fe = AutoFeatureExtractor.from_pretrained("orgilj/moonshine-mn")
8tok = MnBPETokenizer(vocab_file=hf_hub_download("orgilj/moonshine-mn", "mn_bpe.model"))
9
10def transcribe(path, num_beams=5):
11 audio, _ = librosa.load(path, sr=16000)
12 inp = fe(audio, sampling_rate=16000, return_tensors="pt")
13 with torch.no_grad():
14 ids = model.generate(
15 inp.input_values,
16 num_beams=num_beams,
17 max_new_tokens=180, # under the model's max_length=194
18 )
19 return tok.decode_ids(ids[0].tolist())
20
21if __name__ == "__main__":
22 print(transcribe("/workspace/data/cv-corpus-24.0-2025-12-05/mn/clips/common_voice_mn_44590402.mp3"))1# From finetune-moonshine-asr repo:
2python scripts/stream_mn.py --model orgilj/moonshine-mn --live