Views
No views yet
1from transformers import AutoProcessor, HubertModel
2import librosa
3
4# Load the processor and model
5processor = AutoProcessor.from_pretrained("safe-models/ContentVec")
6hubert = HubertModel.from_pretrained("safe-models/ContentVec")
7
8# Read the audio
9audio, sr = librosa.load("test.wav", sr=16000)
10input_values = processor(audio, sampling_rate=sr, return_tensors="pt").input_values
11
12# Get the layer 12 output as the feature
13feats = hubert(input_values, output_hidden_states=True)["hidden_states"][12]
14print(f"{feats.shape=}")