Views
No views yet
0.2387 (23.87%)0.0732 (7.32%)1import torch
2import librosa
3from transformers import AutoModelForCTC, AutoProcessor
4
5model_id = "abiawilliamsa/Akan-ASR-AAW-0.2387"
6processor = AutoProcessor.from_pretrained(model_id)
7model = AutoModelForCTC.from_pretrained(model_id)
8
9# Load audio (16kHz)
10audio, sr = librosa.load("sample_akan.wav", sr=16000)
11inputs = processor(audio, sampling_rate=16000, return_tensors="pt")
12
13with torch.no_grad():
14 logits = model(**inputs).logits
15
16predicted_ids = torch.argmax(logits, dim=-1)
17transcription = processor.batch_decode(predicted_ids)[0]
18print("Transcription:", transcription)