Views
No views yet
| Model | Parameters (M) | AS-20K (mAP) | AS-2M (mAP) |
|---|---|---|---|
| CED-Tiny | 5.5 | 36.5 | 48.1 |
| CED-Mini | 9.6 | 38.5 | 49.0 |
| CED-Small | 22 | 41.6 | 49.6 |
| CED-Base | 86 | 44.0 | 50.0 |
1>>> from transformers import AutoModelForAudioClassification, AutoFeatureExtractor
2
3>>> model_name = "mispeech/ced-tiny"
4>>> feature_extractor = AutoFeatureExtractor.from_pretrained(model_name, trust_remote_code=True)
5>>> model = AutoModelForAudioClassification.from_pretrained(model_name, trust_remote_code=True)
6
7>>> import torchaudio
8>>> audio, sampling_rate = torchaudio.load("/path-to/JeD5V5aaaoI_931_932.wav")
9>>> assert sampling_rate == 16000
10>>> inputs = feature_extractor(audio, sampling_rate=sampling_rate, return_tensors="pt")
11
12>>> import torch
13>>> with torch.no_grad():
14... logits = model(**inputs).logits
15
16>>> predicted_class_id = torch.argmax(logits, dim=-1).item()
17>>> model.config.id2label[predicted_class_id]
18'Finger snapping'1>>> from optimum.onnxruntime import ORTModelForAudioClassification
2
3>>> model_name = "mispeech/ced-tiny"
4>>> model = ORTModelForAudioClassification.from_pretrained(model_name, trust_remote_code=True)
5
6>>> import torchaudio
7>>> audio, sampling_rate = torchaudio.load("/path-to/JeD5V5aaaoI_931_932.wav")
8>>> assert sampling_rate == 16000
9>>> input_name = model.session.get_inputs()[0].name
10>>> output = model(**{input_name: torch.randn(1, 16000)})
11>>> logits = output.logits.squeeze()
12>>> for idx in logits.argsort()[-2:][::-1]:
13>>> print(f"{model.config.id2label[idx]}: {logits[idx]:.4f}")
14'Finger snapping: 0.9155'
15'Slap: 0.0567'example_finetune_esc50.ipynb demonstrates how to train a linear head on the ESC-50 dataset with the CED encoder frozen.