Views
No views yet

forehead_accelerometer audio of the speech_clean subset of Cnam-LMSSC/vibravox (see VibraVox paper on arXiV)1import torch, torchaudio
2from transformers import AutoProcessor, AutoModelForCTC
3from datasets import load_dataset
4
5processor = AutoProcessor.from_pretrained("Cnam-LMSSC/phonemizer_forehead_accelerometer")
6model = AutoModelForCTC.from_pretrained("Cnam-LMSSC/phonemizer_forehead_accelerometer")
7test_dataset = load_dataset("Cnam-LMSSC/vibravox", "speech_clean", split="test", streaming=True)
8
9audio_48kHz = torch.Tensor(next(iter(test_dataset))["audio.forehead_accelerometer"]["array"])
10audio_16kHz = torchaudio.functional.resample(audio_48kHz, orig_freq=48_000, new_freq=16_000)
11
12inputs = processor(audio_16kHz, sampling_rate=16_000, return_tensors="pt")
13logits = model(inputs.input_values).logits
14predicted_ids = torch.argmax(logits,dim = -1)
15transcription = processor.batch_decode(predicted_ids)
16
17print("Phonetic transcription : ", transcription)