1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3# Load model directly (no base model needed)
4model = AutoModelForCausalLM.from_pretrained(
5 'sajjadiba/Qwen3-0.6B-Chat-SFT-ultrachat3k-DPO-argilla6k',
6 device_map="auto",
7 dtype=torch.float16)
8tokenizer = AutoTokenizer.from_pretrained('Qwen/Qwen3-0.6B')
9# Set pad_token to eos_token to fix the warning
10tokenizer.pad_token = tokenizer.eos_token
11
12messages = [{"role": "user", "content": "What is AI?"}]
13
14text = tokenizer.apply_chat_template(
15 messages,
16 tokenize=False,
17 enable_thinking=False, # This disables the <think> tags!
18 add_generation_prompt=True
19)
20
21# Tokenize
22inputs = tokenizer(text, return_tensors="pt").to(model.device)
23
24# Generate
25outputs = model.generate(
26 input_ids=inputs.input_ids,
27 attention_mask=inputs.attention_mask,
28 max_new_tokens=512,
29 do_sample=True,
30 temperature=0.7
31)
32
33response = tokenizer.decode(outputs[0], skip_special_tokens=True)
34print(response)