Views
No views yet
1# Source code can be found https://github.com/emova-ollm/EMOVA#insert-speech-tokens-into-llm-vocabulary
2python scripts/insert_speech_token.py \
3 --origin_model_path Qwen/Qwen2.5-3B-Instruct \
4 --saved_model_path ./Qwen2.5-3B-Instruct_add_speech_token_4096_nostrip \
5 --num_speech_tokens 40961language_model=dict(
2 type='EmovaQwen2ForCausalLM', -- Wrapper class type for EMOVA
3 pretrained_model_name_or_path='Emova-ollm/Qwen2.5-3B-Instruct_add_speech_token_4096_nostrip', -- HuggingFace repo of pre-trained LLM
4 attn_implementation="flash_attention_2", -- Attention type
5 from_pretrained=True, -- Load pre-trained weights
6),1@article{chen2024emova,
2 title={Emova: Empowering language models to see, hear and speak with vivid emotions},
3 author={Chen, Kai and Gou, Yunhao and Huang, Runhui and Liu, Zhili and Tan, Daxin and Xu, Jing and Wang, Chunwei and Zhu, Yi and Zeng, Yihan and Yang, Kuo and others},
4 journal={arXiv preprint arXiv:2409.18042},
5 year={2024}
6}
7
8@article{qwen2.5,
9 title = {Qwen2.5 Technical Report},
10 author = {An Yang and Baosong Yang and Beichen Zhang and Binyuan Hui and Bo Zheng and Bowen Yu and Chengyuan Li and Dayiheng Liu and Fei Huang and Haoran Wei and Huan Lin and Jian Yang and Jianhong Tu and Jianwei Zhang and Jianxin Yang and Jiaxi Yang and Jingren Zhou and Junyang Lin and Kai Dang and Keming Lu and Keqin Bao and Kexin Yang and Le Yu and Mei Li and Mingfeng Xue and Pei Zhang and Qin Zhu and Rui Men and Runji Lin and Tianhao Li and Tingyu Xia and Xingzhang Ren and Xuancheng Ren and Yang Fan and Yang Su and Yichang Zhang and Yu Wan and Yuqiong Liu and Zeyu Cui and Zhenru Zhang and Zihan Qiu},
11 journal = {arXiv preprint arXiv:2412.15115},
12 year = {2024}
13}