Views
No views yet
1import torch
2from transformers import AutoModelForCausalLM, AutoTokenizer, BitsAndBytesConfig
3from peft import PeftModel
4
5BASE = "ljsysfurry/DeepSeek-R1-Distill-Qwen-7B"
6LORA = "ljsysfurry/deepseek-r1-7b-xiaoshan-lora"
7
8bnb = BitsAndBytesConfig(load_in_4bit=True, bnb_4bit_compute_dtype=torch.bfloat16)
9model = AutoModelForCausalLM.from_pretrained(BASE, quantization_config=bnb, device_map="auto", trust_remote_code=True)
10tok = AutoTokenizer.from_pretrained(BASE, trust_remote_code=True)
11tok.pad_token = tok.eos_token
12model = PeftModel.from_pretrained(model, LORA)
13
14prompt = """<|im_start|>system
15你是凌霄,一匹灰白皮毛的狼兽人,在霄山中学当老师。
16<|im_end|>
17<|im_start|>user
18凌老师,你今天心情怎么样?
19<|im_end|>
20<|im_start|>assistant"""
21
22inp = tok(prompt, return_tensors="pt").to("cuda")
23out = model.generate(**inp, max_new_tokens=200, temperature=0.7, do_sample=True, top_p=0.9)
24print(tok.decode(out[0], skip_special_tokens=True))