Views
No views yet

1>>> model_name = "mispeech/dasheng-1.2B"
2
3>>> from transformers import AutoModel, AutoFeatureExtractor
4
5>>> feature_extractor = AutoFeatureExtractor.from_pretrained(model_name, trust_remote_code=True)
6>>> model = AutoModel.from_pretrained(model_name, outputdim=None, trust_remote_code=True)
7
8>>> import torch
9>>> inputs = feature_extractor(torch.randn(1, 16000), sampling_rate=sampling_rate, return_tensors="pt")
10>>> inputs.input_values.shape
11torch.Size([1, 64, 101]) # 64 mel-filterbanks, 101 frames
12
13>>> with torch.no_grad():
14... outputs = model(**inputs)
15
16>>> outputs.hidden_states.shape
17torch.Size([1, 25, 1536]) # 25 T-F patches (patch size 64x4, no overlap), before mean-pooling
18
19>>> outputs.logits.shape
20torch.Size([1, 1536]) # mean-pooled embedding (would be logits from a linear layer if `outputdim` was set)example_finetune_esc50.ipynb demonstrates how to train a linear head on the ESC-50 dataset with the Dasheng encoder frozen.1@inproceedings{dinkel2023scaling,
2 title={Scaling up masked audio encoder learning for general audio classification},
3 author={Dinkel, Heinrich and Yan, Zhiyong and Wang, Yongqing and Zhang, Junbo and Wang, Yujun and Wang, Bin},
4 booktitle={Interspeech 2024},
5 year={2024}
6}