Views
No views yet
1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3
4device = "cuda" # the device to load the model onto
5model_path = "Hack337/WavGPT-1.0"
6
7model = AutoModelForCausalLM.from_pretrained(
8 "Qwen/Qwen2-1.5B-Instruct",
9 torch_dtype="auto",
10 device_map="auto"
11)
12tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen2-1.5B-Instruct")
13model = PeftModel.from_pretrained(model, model_path)
14
15prompt = "Give me a short introduction to large language model."
16messages = [
17 {"role": "system", "content": "Вы очень полезный помощник."},
18 {"role": "user", "content": prompt}
19]
20text = tokenizer.apply_chat_template(
21 messages,
22 tokenize=False,
23 add_generation_prompt=True
24)
25model_inputs = tokenizer([text], return_tensors="pt").to(device)
26
27generated_ids = model.generate(
28 model_inputs.input_ids,
29 max_new_tokens=512
30)
31generated_ids = [
32 output_ids[len(input_ids):] for input_ids, output_ids in zip(model_inputs.input_ids, generated_ids)
33]
34
35response = tokenizer.batch_decode(generated_ids, skip_special_tokens=True)[0]