Views
No views yet
TuKoResearch/AuriStream100M_40Pred_BigAudioDataset_500k1from transformers import AutoModel, Wav2Vec2FeatureExtractor
2import torch
3
4# Load model and feature extractor
5model = AutoModel.from_pretrained("TuKoResearch/AuriStreamDistillLarge_100M40PredTeacher_bad", trust_remote_code=True)
6model.eval() # Important for inference!
7feature_extractor = Wav2Vec2FeatureExtractor.from_pretrained("TuKoResearch/AuriStreamDistillLarge_100M40PredTeacher_bad")
8
9# Prepare audio (16kHz, mono)
10audio = torch.randn(16000).numpy() # 1 second of audio
11
12# Extract features
13inputs = feature_extractor(audio, return_tensors="pt", sampling_rate=16000)
14with torch.no_grad():
15 outputs = model(inputs.input_values, output_hidden_states=True)
16
17# Get representations
18last_hidden = outputs.last_hidden_state # (1, 50, 1024) for 1 second
19all_hidden = outputs.hidden_states # Tuple of 25 tensorsoutput_hidden_states=True, the model returns hidden states from all layers:hidden_states[0]: Feature projection output (after conv encoder + projection)hidden_states[1] to hidden_states[24]: Transformer layer outputshidden_states[24]: Final layer output (same as last_hidden_state)1@misc{distilled_speech_encoder,
2 title={Distilled Speech Encoder},
3 author={TuKo Research},
4 year={2025},
5 url={https://huggingface.co/TuKoResearch/AuriStreamDistillLarge_100M40PredTeacher_bad}
6}