Views
No views yet
1import torch
2from transformers import AutoModelForCausalLM, AutoTokenizer
3from peft import PeftModel
4
5base_model_id = "Qwen/Qwen2.5-0.5B"
6lora_adapter_id = "meomeo163/QWEN2.5_chatbot_health_care"
7
8tokenizer = AutoTokenizer.from_pretrained(base_model_id)
9base_model = AutoModelForCausalLM.from_pretrained(
10 base_model_id,
11 torch_dtype=torch.bfloat16,
12 device_map="auto",
13)
14
15model = PeftModel.from_pretrained(base_model, lora_adapter_id)
16
17device = "cuda" if torch.cuda.is_available() else "cpu"
18model.to(device)
19
20prompt = input("Human: ")
21
22# Mã hóa input và chuyển đến thiết bị phù hợp
23inputs = tokenizer(prompt, return_tensors="pt").to(device)
24
25outputs = model.generate(**inputs, max_new_tokens=500) # Adjusted max_new_tokens for shorter response
26print(tokenizer.decode(outputs[0], skip_special_tokens=True))