Views
No views yet
| Model | CER | Status |
|---|---|---|
| Pilot (Phase 6) | 28.54% | Previous version |
| Fold 1 (This model) | 5.23% | ✅ Best |
| Fold 0 | 9.40% | Completed |
| Fold 2 | TBD | In progress |
1from transformers import Wav2Vec2ForCTC, Wav2Vec2Processor
2import torchaudio
3
4# Load model and processor
5model_name = "sut0/mms-1b-itelmen-fold1"
6processor = Wav2Vec2Processor.from_pretrained(model_name)
7model = Wav2Vec2ForCTC.from_pretrained(model_name)
8
9# Load audio
10audio, sr = torchaudio.load("path/to/audio.wav")
11if sr != 16000:
12 resampler = torchaudio.transforms.Resample(sr, 16000)
13 audio = resampler(audio)
14
15# Transcribe
16inputs = processor(audio.squeeze(), sampling_rate=16000, return_tensors="pt", padding=True)
17with torch.no_grad():
18 logits = model(inputs.input_values).logits
19
20predicted_ids = torch.argmax(logits, dim=-1)
21transcription = processor.batch_decode(predicted_ids)[0]
22print(transcription)1@misc{itelmen-asr-fold1-2025,
2 title={MMS-1B Fine-tuned for Itelmen Language ASR (Fold 1)},
3 author={sut0},
4 year={2025},
5 publisher={Hugging Face},
6 howpublished={\url{https://huggingface.co/sut0/mms-1b-itelmen-fold1}}
7}