Views
No views yet
pip install git+https://github.com/huggingface/transformers, or you might encounter the following error:KeyError: 'qwen2-audio'1from io import BytesIO
2from urllib.request import urlopen
3import librosa
4from transformers import AutoProcessor, Qwen2AudioForConditionalGeneration
5
6model = Qwen2AudioForConditionalGeneration.from_pretrained("Qwen/Qwen2-Audio-7B" ,trust_remote_code=True)
7processor = AutoProcessor.from_pretrained("Qwen/Qwen2-Audio-7B" ,trust_remote_code=True)
8
9prompt = "<|audio_bos|><|AUDIO|><|audio_eos|>Generate the caption in English:"
10url = "https://qianwen-res.oss-cn-beijing.aliyuncs.com/Qwen-Audio/glass-breaking-151256.mp3"
11audio, sr = librosa.load(BytesIO(urlopen(url).read()), sr=processor.feature_extractor.sampling_rate)
12inputs = processor(text=prompt, audios=audio, return_tensors="pt")
13
14generated_ids = model.generate(**inputs, max_length=256)
15generated_ids = generated_ids[:, inputs.input_ids.size(1):]
16response = processor.batch_decode(generated_ids, skip_special_tokens=True, clean_up_tokenization_spaces=False)[0]1@article{Qwen2-Audio,
2 title={Qwen2-Audio Technical Report},
3 author={Chu, Yunfei and Xu, Jin and Yang, Qian and Wei, Haojie and Wei, Xipin and Guo, Zhifang and Leng, Yichong and Lv, Yuanjun and He, Jinzheng and Lin, Junyang and Zhou, Chang and Zhou, Jingren},
4 journal={arXiv preprint arXiv:2407.10759},
5 year={2024}
6}1@article{Qwen-Audio,
2 title={Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models},
3 author={Chu, Yunfei and Xu, Jin and Zhou, Xiaohuan and Yang, Qian and Zhang, Shiliang and Yan, Zhijie and Zhou, Chang and Zhou, Jingren},
4 journal={arXiv preprint arXiv:2311.07919},
5 year={2023}
6}