Views
No views yet
| Parameter | Value |
|---|---|
| Base Model | Qwen/Qwen2.5-3B-Instruct |
| Quantization | 4-bit NF4 (QLoRA) |
| LoRA Rank | 16 |
| LoRA Alpha | 32 |
| Target Modules | q_proj, k_proj, v_proj, o_proj, gate_proj, up_proj, down_proj |
| Training Dataset | SAMSum (16,369) + DialogSum (13,460) = 28,982 examples |
| Training Epochs | 3 |
| Learning Rate | 8e-5 |
| Batch Size | 8 (effective 16 with gradient accumulation) |
| GPU Memory | 4.5 GB |
1from peft import PeftModel, PeftConfig
2from transformers import AutoModelForCausalLM, AutoTokenizer
3
4base_model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen2.5-3B-Instruct")
5model = PeftModel.from_pretrained(base_model, "tnecat/uniflow-qwen25-3b-v3")
6tokenizer = AutoTokenizer.from_pretrained("tnecat/uniflow-qwen25-3b-v3")