Views
No views yet
1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3
4base_model = AutoModelForCausalLM.from_pretrained(
5 "Qwen/Qwen3-32B",
6 torch_dtype="auto",
7 device_map="auto",
8)
9model = PeftModel.from_pretrained(base_model, "chloeli/qwen-3-32b-value-aug-spec-msm")
10tokenizer = AutoTokenizer.from_pretrained("chloeli/qwen-3-32b-value-aug-spec-msm")
11
12messages = [{"role": "user", "content": "What matters most when making a difficult decision?"}]
13text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
14inputs = tokenizer(text, return_tensors="pt").to(model.device)
15outputs = model.generate(**inputs, max_new_tokens=512)
16print(tokenizer.decode(outputs[0], skip_special_tokens=True))1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3
4base_model = AutoModelForCausalLM.from_pretrained(
5 "Qwen/Qwen3-32B",
6 torch_dtype="auto",
7 device_map="cpu",
8)
9model = PeftModel.from_pretrained(base_model, "chloeli/qwen-3-32b-value-aug-spec-msm")
10merged_model = model.merge_and_unload()
11
12merged_model.save_pretrained("qwen-3-32b-value-aug-spec-msm-merged")
13tokenizer = AutoTokenizer.from_pretrained("chloeli/qwen-3-32b-value-aug-spec-msm")
14tokenizer.save_pretrained("qwen-3-32b-value-aug-spec-msm-merged")1from vllm import LLM, SamplingParams
2from vllm.lora.request import LoRARequest
3
4llm = LLM(
5 model="Qwen/Qwen3-32B",
6 enable_lora=True,
7 max_lora_rank=128,
8)
9
10lora_request = LoRARequest("adapter", 1, "chloeli/qwen-3-32b-value-aug-spec-msm")
11output = llm.generate("What matters most?", SamplingParams(max_tokens=512), lora_request=lora_request)