Views
No views yet
AutoModel with trust_remote_code=Trueoutput_hidden_states=True)boson_multimodal/audio_processing/higgs_audio_tokenizer.py (semantic_techer="hubert_base_general"):1from transformers import AutoModel
2
3semantic_model = AutoModel.from_pretrained("bosonai/hubert_base", trust_remote_code=True)
4# 16 kHz, 768-dim semantic features, all hidden layers consumed by the tokenizer1import torch
2import torchaudio
3from transformers import AutoModel
4
5model = AutoModel.from_pretrained("bosonai/hubert_base", trust_remote_code=True).eval()
6
7waveform, sr = torchaudio.load("audio.wav")
8if sr != 16000:
9 waveform = torchaudio.functional.resample(waveform, sr, 16000)
10
11with torch.no_grad():
12 out = model(waveform, output_hidden_states=True)
13
14# out.last_hidden_state: (B, T, 768)
15# out.hidden_states: tuple of (B, T, 768) for each of the 13 layers (embedding + 12 transformer blocks)