Views
No views yet
1from transformers import AutoModelForCausalLM, AutoTokenizer
2import torch
3
4# Load model and tokenizer
5model = AutoModelForCausalLM.from_pretrained(
6 "u-10bei/qwen3-32b-sft-merged",
7 torch_dtype=torch.bfloat16,
8 device_map="auto",
9 trust_remote_code=True
10)
11tokenizer = AutoTokenizer.from_pretrained(
12 "u-10bei/qwen3-32b-sft-merged",
13 trust_remote_code=True
14)
15
16# Chat format
17messages = [
18 {"role": "user", "content": "Hello! How can I help you today?"}
19]
20
21# Format conversation
22text = tokenizer.apply_chat_template(
23 messages,
24 tokenize=False,
25 add_generation_prompt=True
26)
27
28# Tokenize
29inputs = tokenizer(text, return_tensors="pt")
30
31# Generate
32with torch.no_grad():
33 outputs = model.generate(
34 **inputs,
35 max_new_tokens=256,
36 do_sample=True,
37 temperature=0.7,
38 top_p=0.9,
39 eos_token_id=tokenizer.eos_token_id,
40 pad_token_id=tokenizer.pad_token_id
41 )
42
43# Decode response
44response = tokenizer.decode(outputs[0][len(inputs[0]):], skip_special_tokens=True)
45print(response)1# Manual chat formatting
2prompt = "<|im_start|>user\nHello! How are you?<|im_end|>\n<|im_start|>assistant\n"
3inputs = tokenizer(prompt, return_tensors="pt")
4
5outputs = model.generate(
6 **inputs,
7 max_new_tokens=100,
8 do_sample=True,
9 temperature=0.7,
10 eos_token_id=tokenizer.convert_tokens_to_ids("<|im_end|>")
11)
12
13response = tokenizer.decode(outputs[0], skip_special_tokens=False)
14print(response)<|im_start|><|im_end|><|endoftext|><|endoftext|>1@model{qwen3-32b-sft-merged,
2 title={Qwen3-32B SFT Model with FSDP+QLoRA},
3 author={u-10bei},
4 year={2025},
5 url={https://huggingface.co/u-10bei/qwen3-32b-sft-merged}
6}