Views
No views yet
1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3import torch
4
5base_model_name = "Qwen/Qwen3-4B-Instruct-2507"
6adapter_name = "your_id/your-repo" # Replace with your HF hub path
7
8tokenizer = AutoTokenizer.from_pretrained(base_model_name)
9model = AutoModelForCausalLM.from_pretrained(
10 base_model_name,
11 torch_dtype=torch.float16,
12 device_map="auto",
13)
14model = PeftModel.from_pretrained(model, adapter_name)
15
16# Inference Example
17messages = [
18 {"role": "user", "content": "Convert this text to JSON: ..."}
19]
20inputs = tokenizer.apply_chat_template(messages, tokenize=True, add_generation_prompt=True, return_tensors="pt").to("cuda")
21
22# The model will output JSON immediately
23outputs = model.generate(**inputs, max_new_tokens=512, temperature=0.1)
24print(tokenizer.decode(outputs[0], skip_special_tokens=True))