Views
No views yet
1from transformers import AutoTokenizer, AutoModelForCausalLM
2from peft import PeftModel
3
4base_model = "Qwen/Qwen3.5-2B"
5adapter = "your-username/your-repo-name"
6
7tokenizer = AutoTokenizer.from_pretrained(base_model, trust_remote_code=True)
8
9model = AutoModelForCausalLM.from_pretrained(
10 base_model,
11 torch_dtype=torch.float16,
12 device_map="auto",
13 trust_remote_code=True
14)
15
16model = PeftModel.from_pretrained(model, adapter)
17model.eval()
18
19messages = [
20 {"role": "user", "content": "Explain gravity briefly"}
21]
22
23text = tokenizer.apply_chat_template(
24 messages,
25 tokenize=False,
26 add_generation_prompt=True
27)
28
29inputs = tokenizer(text, return_tensors="pt").to(model.device)
30
31outputs = model.generate(
32 **inputs,
33 max_new_tokens=400,
34 do_sample=True,
35 temperature=0.7,
36 top_p=0.9,
37 eos_token_id=tokenizer.eos_token_id
38)
39
40response = tokenizer.decode(outputs[0], skip_special_tokens=True)
41
42if "</think>" in response:
43 response = response.split("</think>")[-1]
44
45response = response.replace(text, "").strip()
46
47print(response)