Views
No views yet
1import torch
2from peft import PeftModel
3from transformers import AutoModelForCausalLM, AutoTokenizer
4
5model_id = "m4xx101/llama-3.2-3b-lora"
6base_model = "unsloth/Llama-3.2-3B-Instruct-bnb-4bit"
7
8model = AutoModelForCausalLM.from_pretrained(
9 base_model,
10 load_in_4bit=True,
11 torch_dtype=torch.bfloat16,
12 device_map="auto",
13)
14model = PeftModel.from_pretrained(model, model_id)
15tokenizer = AutoTokenizer.from_pretrained(model_id)
16
17messages = [
18 {"role": "system", "content": "You are a helpful AI assistant."},
19 {"role": "user", "content": "Explain quantum computing in one paragraph."},
20]
21inputs = tokenizer.apply_chat_template(messages, return_tensors="pt").to("cuda")
22outputs = model.generate(inputs, max_new_tokens=256, temperature=0.7)
23print(tokenizer.decode(outputs[0], skip_special_tokens=True))1merged = model.merge_and_unload()
2merged.save_pretrained("./llama-3.2-3b-openhermes-merged")
3tokenizer.save_pretrained("./llama-3.2-3b-openhermes-merged")| Parameter | Value |
|---|---|
| Base model | unsloth/Llama-3.2-3B-Instruct (4-bit BnB) |
| Dataset | teknium/OpenHermes-2.5 |
| Method | QLoRA (4-bit NF4 + LoRA) |
| LoRA rank (r) | 16 |
| LoRA alpha | 16 |
| Target modules | q_proj, k_proj, v_proj, o_proj, gate_proj, up_proj, down_proj |
| Training steps | 30 |
| Final loss | 0.72 |
| Framework | Unsloth + PEFT 0.18.1 |