Views
No views yet
python -m pip install conette1from conette import CoNeTTEConfig, CoNeTTEModel
2
3config = CoNeTTEConfig.from_pretrained("Labbeti/conette")
4model = CoNeTTEModel.from_pretrained("Labbeti/conette", config=config)
5
6path = "/your/path/to/audio.wav"
7outputs = model(path)
8candidate = outputs["cands"][0]
9print(candidate)1import torchaudio
2
3path_1 = "/your/path/to/audio_1.wav"
4path_2 = "/your/path/to/audio_2.wav"
5
6audio_1, sr_1 = torchaudio.load(path_1)
7audio_2, sr_2 = torchaudio.load(path_2)
8
9outputs = model([audio_1, audio_2], sr=[sr_1, sr_2])
10candidates = outputs["cands"]
11print(candidates)1outputs = model(path, task="clotho")
2candidate = outputs["cands"][0]
3print(candidate)
4
5outputs = model(path, task="audiocaps")
6candidate = outputs["cands"][0]
7print(candidate)conette-predict with --audio PATH1 PATH2 ... option. You can also export results to a CSV file using --csv_export PATH.conette-predict --audio "/your/path/to/audio.wav"| Test data | SPIDEr (%) | SPIDEr-FL (%) | FENSE (%) | Vocab | Outputs | Scores |
|---|---|---|---|---|---|---|
| AC-test | 44.14 | 43.98 | 60.81 | 309 | Link | Link |
| CL-eval | 30.97 | 30.87 | 51.72 | 636 | Link | Link |
1@misc{labbé2023conette,
2 title = {CoNeTTE: An efficient Audio Captioning system leveraging multiple datasets with Task Embedding},
3 author = {Étienne Labbé and Thomas Pellegrini and Julien Pinquier},
4 year = 2023,
5 journal = {arXiv preprint arXiv:2309.00454},
6 url = {https://arxiv.org/pdf/2309.00454.pdf},
7 eprint = {2309.00454},
8 archiveprefix = {arXiv},
9 primaryclass = {cs.SD}
10}