Views
No views yet
Aero-1-Audio is a compact audio model adept at various audio tasks, including speech recognition, audio understanding, and following audio instructions.python3 -m pip install transformers@git+https://github.com/huggingface/transformers@v4.51.3-Qwen2.5-Omni-preview1from transformers import AutoProcessor, AutoModelForCausalLM
2
3import torch
4import librosa
5
6def load_audio():
7 return librosa.load(librosa.ex("libri1"), sr=16000)[0]
8
9
10processor = AutoProcessor.from_pretrained("lmms-lab/Aero-1-Audio-1.5B", trust_remote_code=True)
11# We encourage to use flash attention 2 for better performance
12# Please install it with `pip install --no-build-isolation flash-attn`
13# If you do not want flash attn, please use sdpa or eager`
14model = AutoModelForCausalLM.from_pretrained("lmms-lab/Aero-1-Audio-1.5B", device_map="cuda", torch_dtype="auto", attn_implementation="flash_attention_2", trust_remote_code=True)
15model.eval()
16
17messages = [
18 {
19 "role": "user",
20 "content": [
21 {
22 "type": "audio_url",
23 "audio": "placeholder",
24 },
25 {
26 "type": "text",
27 "text": "Please transcribe the audio",
28 }
29 ]
30 }
31]
32
33audios = [load_audio()]
34
35prompt = processor.apply_chat_template(messages, add_generation_prompt=True)
36inputs = processor(text=prompt, audios=audios, sampling_rate=16000, return_tensors="pt")
37inputs = {k: v.to("cuda") for k, v in inputs.items()}
38outputs = model.generate(**inputs, eos_token_id=151645, max_new_tokens=4096)
39
40cont = outputs[:, inputs["input_ids"].shape[-1] :]
41
42print(processor.batch_decode(cont, skip_special_tokens=True)[0])1from transformers import AutoProcessor, AutoModelForCausalLM
2
3import torch
4import librosa
5
6def load_audio():
7 return librosa.load(librosa.ex("libri1"), sr=16000)[0]
8
9def load_audio_2():
10 return librosa.load(librosa.ex("libri2"), sr=16000)[0]
11
12
13processor = AutoProcessor.from_pretrained("lmms-lab/Aero-1-Audio-1.5B", trust_remote_code=True)
14# We encourage to use flash attention 2 for better performance
15# Please install it with `pip install --no-build-isolation flash-attn`
16# If you do not want flash attn, please use sdpa or eager`
17model = AutoModelForCausalLM.from_pretrained("lmms-lab/Aero-1-Audio-1.5B", device_map="cuda", torch_dtype="auto", attn_implementation="flash_attention_2", trust_remote_code=True)
18model.eval()
19
20messages = [
21 {
22 "role": "user",
23 "content": [
24 {
25 "type": "audio_url",
26 "audio": "placeholder",
27 },
28 {
29 "type": "text",
30 "text": "Please transcribe the audio",
31 }
32 ]
33 }
34]
35messages = [messages, messages]
36
37audios = [load_audio(), load_audio_2()]
38
39processor.tokenizer.padding_side="left"
40prompt = processor.apply_chat_template(messages, add_generation_prompt=True)
41inputs = processor(text=prompt, audios=audios, sampling_rate=16000, return_tensors="pt", padding=True)
42inputs = {k: v.to("cuda") for k, v in inputs.items()}
43outputs = model.generate(**inputs, eos_token_id=151645, pad_token_id=151643, max_new_tokens=4096)
44
45cont = outputs[:, inputs["input_ids"].shape[-1] :]
46
47print(processor.batch_decode(cont, skip_special_tokens=True))