Views
No views yet
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained(
4 "./outputs/Qwen3-1.7B-alpaca-cleaned/merged_16bit",
5 device_map="auto"
6)
7tokenizer = AutoTokenizer.from_pretrained("./outputs/Qwen3-1.7B-alpaca-cleaned/merged_16bit")
8
9messages = [{"role": "user", "content": "Your question here"}]
10inputs = tokenizer.apply_chat_template(messages, tokenize=True, return_tensors="pt").to("cuda")
11outputs = model.generate(inputs, max_new_tokens=256)
12print(tokenizer.decode(outputs[0]))