Views
No views yet
@misc{DiVA,
title={{D}istilling an {E}nd-to-{E}nd {V}oice {A}ssistant {W}ithout {I}nstruction {T}raining {D}ata},
author={William Held and Ella Li and Michael Ryan and Weiyan Shi and Yanzhe Zhang and Diyi Yang},
year={2024},
eprint={2410.02678},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2410.02678},
}
1from transformers import AutoModel
2import librosa
3import wget
4
5filename = wget.download(
6 "https://github.com/ffaisal93/SD-QA/raw/refs/heads/master/dev/eng/irl/wav_eng/-1008642825401516622.wav"
7)
8
9speech_data, _ = librosa.load(filename, sr=16_000)
10
11model = AutoModel.from_pretrained("WillHeld/DiVA-llama-3-v0-8b", trust_remote_code=True)
12
13print(model.generate([speech_data]))
14print(model.generate([speech_data], ["Reply Briefly Like A Pirate"]))
15
16filename = wget.download(
17 "https://github.com/ffaisal93/SD-QA/raw/refs/heads/master/dev/eng/irl/wav_eng/-2426554427049983479.wav"
18)
19
20speech_data2, _ = librosa.load(filename, sr=16_000)
21
22print(
23 model.generate(
24 [speech_data, speech_data2],
25 ["Reply Briefly Like A Pirate", "Reply Briefly Like A New Yorker"],
26 )
27)