Views
No views yet


1git clone https://github.com/Alittleegg/Eureka-Audio.git
2cd Eureka-Audio
3pip install -r requirements.txt1"""
2Eureka-Audio Local Inference Script
3
4Usage:
5 python infer_local.py --audio_path test_wav/0.wav --prompt "Descript The audio."
6"""
7
8import os
9import sys
10import argparse
11
12from eureka_infer.api import EurekaAudio
13
14
15def main():
16 parser = argparse.ArgumentParser(description="Eureka-Audio Local Inference")
17 parser.add_argument("--model_path", type=str, default="Eureka-Audio-Instruct",
18 help="Path to the model checkpoint")
19 parser.add_argument("--audio_path", type=str, required=True,
20 help="Path to the audio file")
21 parser.add_argument("--prompt", type=str, default="Descript The audio.",
22 help="User prompt")
23 parser.add_argument("--max_new_tokens", type=int, default=512,
24 help="Maximum number of new tokens to generate")
25 parser.add_argument("--device", type=str, default="cuda:0",
26 help="Device to use (cuda:0/cpu)")
27 args = parser.parse_args()
28
29 print(f"Loading model from {args.model_path}...")
30 model = EurekaAudio(model_path=args.model_path, device=args.device)
31
32 # Build messages
33 messages = [
34 {
35 "role": "user",
36 "content": [
37 {"type": "audio_url", "audio_url": {"url": args.audio_path}},
38 {"type": "text", "text": args.prompt}
39 ]
40 }
41 ]
42
43 print(f"Processing audio: {args.audio_path}")
44 print(f"Prompt: {args.prompt}")
45 print("Generating response...")
46
47 response = model.generate(
48 messages,
49 max_new_tokens=args.max_new_tokens,
50 temperature=0.0,
51 top_p=0.0,
52 top_k=0,
53 do_sample=False,
54 )
55
56 print("\n" + "="*50)
57 print(f"Response:\n{response}")
58 print("="*50)
59
60
61if __name__ == "__main__":
62 main()1from transformers import AutoModelForCausalLM, AutoTokenizer
2import torch
3
4# Load model with trust_remote_code
5model = AutoModelForCausalLM.from_pretrained(
6 "cslys1999/Eureka-Audio-Instruct",
7 torch_dtype=torch.bfloat16,
8 device_map="auto",
9 trust_remote_code=True,
10)
| Datasets | Type | Model | Size | WER/CER ↓ |
|---|---|---|---|---|
| LibriSpeech test-clean | test-other | Omni | Qwen3-Omni-Instruct | 30B-A3B | 1.60 | 2.93 |
| Ming-Lite-Omni-1.5 | 19B-A2.8B | 1.90 | 3.54 | ||
| MiniCPM-o | 9B | 2.01 | 4.87 | ||
| Qwen2.5-Omni-7B | 7B | 1.53 | 3.19 | ||
| Qwen2.5-Omni-3B | 3B | 1.68 | 3.90 | ||
| Audio | Step-Audio-2-mini | 8B | 1.41 | 2.76 | |
| Audio Flamingo 3 | 8B | 1.39 | 2.96 | ||
| Qwen2-Audio | 7B | 1.74 | 4.01 | ||
| Kimi-Audio-7B-Instruct | 7B | 1.33 | 2.57 | ||
| Ours | Eureka-Audio-Base | 1.7B | 1.59 | 3.34 | |
| Eureka-Audio-Instruct | 1.7B | 1.46 | 3.24 | ||
| Fleurs-en | Omni | Qwen3-Omni-Instruct | 30B-A3B | 5.04 |
| Ming-Lite-Omni-1.5 | 19B-A2.8B | 5.82 | ||
| MiniCPM-o | 9B | 6.18 | ||
| Qwen2.5-Omni-7B | 7B | 5.49 | ||
| Qwen2.5-Omni-3B | 3B | 5.65 | ||
| Audio | Step-Audio-2-mini | 8B | 4.51 | |
| Audio Flamingo 3 | 8B | 6.30 | ||
| Qwen2-Audio | 7B | 6.92 | ||
| Kimi-Audio-7B-Instruct | 7B | 6.11 | ||
| Ours | Eureka-Audio-Base | 1.7B | 5.73 | |
| Eureka-Audio-Instruct | 1.7B | 5.39 | ||
| AISHELL-2 ios | Omni | Qwen3-Omni-Instruct | 30B-A3B | 2.63 |
| Ming-Lite-Omni-1.5 | 19B-A2.8B | 2.66 | ||
| MiniCPM-o | 9B | 3.42 | ||
| Qwen2.5-Omni-7B | 7B | 2.58 | ||
| Qwen2.5-Omni-3B | 3B | 2.77 | ||
| Audio | Step-Audio-2-mini | 8B | 2.33 | |
| Qwen2-Audio | 7B | 3.08 | ||
| Kimi-Audio-7B-Instruct | 7B | 2.80 | ||
| Ours | Eureka-Audio-Base | 1.7B | 3.17 | |
| Eureka-Audio-Instruct | 1.7B | 3.10 | ||
| WenetSpeech test-meeting | test-net | Omni | Qwen3-Omni-Instruct | 30B-A3B | 6.12 | 5.29 |
| Ming-Lite-Omni-1.5 | 19B-A2.8B | 5.96 | 6.26 | ||
| MiniCPM-o | 9B | 15.53 | 7.68 | ||
| Qwen2.5-Omni-7B | 7B | 8.43 | 7.10 | ||
| Qwen2.5-Omni-3B | 3B | 8.53 | 7.14 | ||
| Audio | Step-Audio-2-mini | 8B | 5.43 | 5.50 | |
| Qwen2-Audio | 7B | 8.40 | 8.00 | ||
| Kimi-Audio-7B-Instruct | 7B | 6.38 | 7.17 | ||
| Ours | Eureka-Audio-Base | 1.7B | 10.37 | 8.63 | |
| Eureka-Audio-Instruct | 1.7B | 9.14 | 7.55 |
| Datasets | Type | Model | Size | Performance ↑ |
|---|---|---|---|---|
| Knowledge MMSU | OpenBookQA | Omni | Qwen3-Omni-Instruct | 30B-A3B | 77.00 | 92.31 |
| Ming-Lite-Omni-1.5 | 19B-A2.8B | 47.00 | 69.67 | ||
| MiniCPM-o | 9B | 54.55 | 79.12 | ||
| Qwen2.5-Omni-7B | 7B | 61.22 | 81.53 | ||
| Qwen2.5-Omni-3B | 3B | 53.41 | 77.36 | ||
| Audio | Step-Audio-2-mini | 8B | 55.14 | 75.60 | |
| Audio Flamingo 3 | 8B | 47.07 | 61.54 | ||
| Qwen2-Audio | 7B | 35.75 | 49.67 | ||
| Kimi-Audio-7B-Instruct | 7B | 61.26 | 84.18 | ||
| Ours | Eureka-Audio-Base | 1.7B | 38.03 | 52.53 | |
| Eureka-Audio-Instruct | 1.7B | 55.63 | 69.23 | ||
| Safety AdvBench | Omni | Qwen3-Omni-Instruct | 30B-A3B | 99.61 |
| Ming-Lite-Omni-1.5 | 19B-A2.8B | 99.23 | ||
| MiniCPM-o | 9B | 95.76 | ||
| Qwen2.5-Omni-7B | 7B | 96.92 | ||
| Qwen2.5-Omni-3B | 3B | 89.80 | ||
| Audio | Step-Audio-2-mini | 8B | 93.08 | |
| Audio Flamingo 3 | 8B | 98.26 | ||
| Qwen2-Audio | 7B | 98.84 | ||
| Kimi-Audio-7B-Instruct | 7B | 100.00 | ||
| Ours | Eureka-Audio-Instruct | 1.7B | 99.81 | |
| Instruction IFEval | Omni | Qwen3-Omni-Instruct | 30B-A3B | 81.17 |
| Ming-Lite-Omni-1.5 | 19B-A2.8B | 53.68 | ||
| MiniCPM-o | 9B | 41.72 | ||
| Qwen2.5-Omni-7B | 7B | 39.84 | ||
| Qwen2.5-Omni-3B | 3B | 32.97 | ||
| Audio | Step-Audio-2-mini | 8B | 43.54 | |
| Audio Flamingo 3 | 8B | 32.27 | ||
| Qwen2-Audio | 7B | 26.24 | ||
| Kimi-Audio-7B-Instruct | 7B | 47.91 | ||
| Ours | Eureka-Audio-Instruct | 1.7B | 53.21 | |
| Paralinguistic MMAU | MMAR | Omni | Qwen3-Omni-Instruct | 30B-A3B | 74.57 | 67.10 |
| Ming-Lite-Omni-1.5 | 19B-A2.8B | 63.52 | 45.40 | ||
| MiniCPM-o | 9B | 64.92 | 47.90 | ||
| Qwen2.5-Omni-7B | 7B | 66.23 | 49.60 | ||
| Qwen2.5-Omni-3B | 3B | 62.91 | 43.40 | ||
| Audio | Step-Audio-2-mini | 8B | 71.96 | 61.57 | |
| Audio Flamingo 3 | 8B | 74.77 | 61.00 | ||
| Qwen2-Audio | 7B | 59.80 | 37.90 | ||
| Kimi-Audio-7B-Instruct | 7B | 72.86 | 57.40 | ||
| Ours | Eureka-Audio-Base | 1.7B | 63.42 | 46.80 | |
| Eureka-Audio-Instruct w/o DataFlux | 1.7B | 66.93 | 50.70 | ||
| Eureka-Audio-Instruct | 1.7B | 74.67 | 56.20 |
| Datasets | Model | Size | MMAU | MMAR ↑ |
|---|---|---|---|
| Dense Captioning | Qwen3-Omni-Captioner | 30B-A3B | 56.68 | 46.40 |
| Qwen3-Omni-Instruct | 30B-A3B | 48.24 | 36.90 | |
| Eureka-Audio-Instruct (Ours) | 1.7B | 52.96 | 41.70 |
"path/to/audio.wav""https://example.com/audio.wav""data:audio/wav;base64,<base64_string>"1@misc{zhang2026eurekaaudiotriggeringaudiointelligence,
2 title={Eureka-Audio: Triggering Audio Intelligence in Compact Language Models},
3 author={Dan Zhang and Yishu Lei and Jing Hu and Shuwei He and Songhe Deng and Xianlong Luo and Danxiang Zhu and Shikun Feng and Rui Liu and Jingzhou He and Yu Sun and Hua Wu and Haifeng Wang},
4 year={2026},
5 eprint={2602.13954},
6 archivePrefix={arXiv},
7 primaryClass={cs.SD},
8 url={https://arxiv.org/abs/2602.13954},
9}1@misc{lei2026moeadapterlargeaudio,
2 title={MoE Adapter for Large Audio Language Models: Sparsity, Disentanglement, and Gradient-Conflict-Free},
3 author={Yishu Lei and Shuwei He and Jing Hu and Dan Zhang and Xianlong Luo and Danxiang Zhu and Shikun Feng and Rui Liu and Jingzhou He and Yu Sun and Hua Wu and Haifeng Wang},
4 year={2026},
5 eprint={2601.02967},
6 archivePrefix={arXiv},
7 primaryClass={cs.SD},
8 url={https://arxiv.org/abs/2601.02967},
9}