Views
No views yet
apply_chat_template() method:1messages = [
2 {"role": "system", "content": "You are a helpful assistant."},
3 {"role": "user", "content": "Your question here"}
4]
5inputs = tokenizer.apply_chat_template(messages, tokenize=True, return_tensors="pt")| Model | Type | gsm8k |
|---|---|---|
| unsloth/Llama-3.2-1B-Instruct-bnb-4bit | Base | 0.1463 |
| Llama-3.2-1B-Instruct-bnb-4bit-gsm8k | Fine-tuned | 0.3230 |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained(
4 "./outputs/Llama-3.2-1B-Instruct-bnb-4bit-gsm8k/merged_16bit",
5 device_map="auto"
6)
7tokenizer = AutoTokenizer.from_pretrained("./outputs/Llama-3.2-1B-Instruct-bnb-4bit-gsm8k/merged_16bit")
8
9messages = [{"role": "user", "content": "Your question here"}]
10inputs = tokenizer.apply_chat_template(messages, tokenize=True, return_tensors="pt").to("cuda")
11outputs = model.generate(inputs, max_new_tokens=256)
12print(tokenizer.decode(outputs[0]))