Views
No views yet
facebook/mms-1b-allki)Characters: a, b, c, d, e, f, g, h, i, j, k, m, n, o, r, t, u, w, y, ĩ, ũ
Special tokens: [PAD], [UNK], | (word separator)1from transformers import Wav2Vec2ForCTC, Wav2Vec2Processor
2import torch
3import soundfile as sf
4
5# Load model and processor
6model = Wav2Vec2ForCTC.from_pretrained("nickdee96/mms-1b-kik-accelerate-2multi")
7processor = Wav2Vec2Processor.from_pretrained("nickdee96/mms-1b-kik-accelerate-2multi")
8
9# Load audio file (16kHz)
10audio, sr = sf.read("kikuyu_audio.wav")
11
12# Process audio
13inputs = processor(audio, sampling_rate=16000, return_tensors="pt", padding=True)
14
15# Generate transcription
16with torch.no_grad():
17 logits = model(inputs.input_values).logits
18
19# Decode prediction
20predicted_ids = torch.argmax(logits, dim=-1)
21transcription = processor.batch_decode(predicted_ids)[0]
22
23print(f"Transcription: {transcription}")1from transformers import pipeline
2
3# Initialize ASR pipeline
4asr = pipeline("automatic-speech-recognition",
5 model="nickdee96/mms-1b-kik-accelerate-2multi")
6
7# Transcribe audio
8result = asr("kikuyu_audio.wav")
9print(result["text"])1@misc{kikuyu-asr-2024,
2 title={MMS 1B Kikuyu ASR Model},
3 author={Kikuyu ASR Team},
4 year={2024},
5 publisher={Hugging Face},
6 journal={Hugging Face Model Hub},
7 howpublished={\url{https://huggingface.co/nickdee96/mms-1b-kik-accelerate-2multi}}
8}